Bloglar
AI ModelsBenchmarksLong documentsClaudeGeminiGPT-5.6

Aynı 22 sayfalık belgeyi beş farklı modele test ettirdik. İşte öğrendiklerimiz.

5 min
Aynı 22 sayfalık belgeyi beş farklı modele test ettirdik. İşte öğrendiklerimiz.

Aynı 22 sayfalık belgeyi beş farklı modele test ettirdik. İşte öğrendiklerimiz.

Birkaç haftada bir, beraberinde yeni bir kıyaslama (benchmark) tablosu getiren yeni bir model piyasaya sürülüyor. Ancak bu tabloların hiçbiri, bir belge aracının en çok ihtiyaç duyduğu şeyi ölçmüyor: Model; uzun ve yapılandırılmış bir belgeyi, bir insanın beklemeye razı olacağı bir hızda, sessizce yarıda kesmeden sonuna kadar yazabiliyor mu?

Bu yüzden kendi testimizi geliştirdik ve her modelin NextDocs'ta bir kulvar edinmeden önce bu testi geçmesi gerekiyor. Bu yazıda, testi ve mevcut beş modelin bu testte nasıl bir performans sergilediğini açıklıyoruz. Sonuçlardan bazıları bizi oldukça şaşırttı.

Değerlendirme kapısı

Üretim ortamından gerçek bir istem (prompt) aldık: Bölümleri, tabloları ve belirli bir yapısı olan 22 sayfalık bir belge üreten bir talep. Bunu, ürünün kullandığı üretim bütçesinin aynısıyla aday bir model üzerinde yeniden çalıştırıyoruz ve üç şeye dikkat ediyoruz:

  1. Tamamladı mı? 22 sayfanın tamamını bitirdi mi, yoksa herhangi bir hata vermeden bir öğenin ortasında durdu mu?
  2. Ne kadar sürdü? NextDocs, belgeyi yazılırken anlık olarak akıtır (stream eder) ve kullanıcı bunu izler. İki dakikada bitiren bir model ile on dakikada bitiren bir model aynı ürün deneyimini sunmaz.
  3. Verim (throughput) korundu mu? Bazı modeller hızlı başlar ve çıktı büyüdükçe yavaşlar. Bu durum, uzun bir belgenin yarıda kesilmesine neden olan temel kalıptır.

Kıyaslama tablosu ne kadar iyi görünürse görünsün, bu üç kriterden herhangi birinde başarısız olan bir model bir üst aşamaya geçemez.

Beş modelin performansı

GPT-5.6 Luna (OpenAI, Azure AI Foundry üzerinde çalışıyor). En hızlı denemelerde 22 sayfanın tamamını iki dakikanın altında tamamladı. İlk sayfadan son sayfaya kadar tutarlı bir verim sağladı. Luna'nın her planda hızlı kulvarı elinde tutmasının nedeni budur.

Gemini 3.5 Flash (Google). 22 sayfanın tamamını iki dakikadan biraz daha uzun bir sürede tamamladı. Yaz mevsiminin büyük bölümünde kalite kulvarını elinde tuttu.

Gemini 3.8 Flash (Google, 2 Eylül'de yayınlandı). Yayınlanmasından sonraki bir gün içinde aynı değerlendirme kapısını geçti ve 3 Eylül'de kalite kulvarına yükseltildi. Dört ay içindeki dördüncü Flash nesli ve 24 saat içinde geçiş yaptığımız ilk model oldu.

Claude Sonnet 4.6 (Anthropic). 22 sayfanın tamamını tamamladı ancak bunu yaparken üretim bütçesinin neredeyse tamamını kullandı ve diğer tüm modellerden çok daha fazla, yaklaşık 170.000 karakter yazdı. Başlangıçta yavaş değil ve performansı düşmüyor; sadece son derece detaylı çalışıyor. Bu da onu mükemmel bir premium yazar ve çok uzun belgelerde yakından takip ettiğimiz bir model haline getiriyor; çünkü biraz daha uzun bir talep bütçeyi aşmasına neden olabilir.

Claude Sonnet 5 (Anthropic, 30 Haziran'da yayınlandı). Sürpriz olan buydu. Sonnet 5 is newer and cheaper than Sonnet 4.6, and its agentic benchmarks are better. Bizim değerlendirme kapımızda, yaklaşık sekiz dakika sonra 22 sayfanın 16. sayfasında, bir öğenin ortasında hiçbir hata vermeden durdu. Bu, Temmuz ayını ortadan kaldırmakla geçirdiğimiz yarıda kesilme hatasının tam olarak aynısıdır. Bu nedenle Sonnet 5 kademeye alınmadı ve yeni bir test aksini gösterene kadar Sonnet 4.6 premium kulvarını korumaya devam ediyor.

Öğrendiklerimiz

Uzun belgeler için yeni olan her zaman daha iyi demek değildir. Bu yaz yükseltmeyi reddettiğimiz iki model de kulvarlarını koruyan modellerden daha yeniydi. Bir model token başına daha akıllı olabilir ancak yine de verim eğrisi nedeniyle uzun bir belgede başarısız olabilir.

İzlenmesi gereken başarısızlık modu verim düşüşüdür. Tehlikeli modeller hata vermez. Belge büyüdükçe yavaşlarlar, akış bütçesini aşarlar ve akış, tamamlanmış gibi görünen ancak yarıda kalmış bir belgeyle sona erer. NextDocs'u yarıda kesilen bir akışı algılayacak ve kesilen sonucu kaydetmeyi reddedecek şekilde değiştirdik; bu nedenle uzun belgeler artık sessizce değil, ya tamamlanıyor ya da belirgin bir şekilde hata veriyor.

Detaycılığın bir bedeli vardır. Sonnet 4.6, beş model arasında en zengin içerikli ve en uzun belgeleri yazanıdır. 40 sayfalık bir rapor için tam olarak bunu isteyebilirsiniz. Ancak on slaytlık bir sunum için Luna'yı tercih edip öğleden sonranızı kendinize ayırmak istersiniz. Bu yüzden kadememizde tek bir model yerine farklı kulvarlar bulunuyor.

Her zaman yükseltmeden önce test edin. Gemini 3.8 Flash, değerlendirme kapısının tekrarlanabilir olması sayesinde kulvarını bir günde kazandı. Sonnet 5 ise aynı sebepten dolayı normalde sahip olacağı kulvarı kaybetti. Sabit bir test, tedbirsiz davranmadan hızlı kalabilmenizi sağlar.

Bu size nasıl yansıyor?

Bunlerin hiçbirini düşünmenize gerek yok. Bir mod seçin ve kademe sizin için modeli seçsin:

  • Hızlı (Fast), taslaklar ve kısa belgeler için.
  • Kalite (Quality), tutarlı kalması gereken bölümlere sahip her şey için.
  • Premium, Pro+ ve Ultra planlarında, derinliğin zamandan daha önemli olduğu yazılar için.

Veya model seçiciden doğrudan bir seçim yapın. Eğer bu testin kendi versiyonunuzu çalıştırmak isterseniz, çok değişkenli üretim özelliği tek bir istemi aynı anda birkaç modele göndermenize ve tamamlanan belgeleri yan yana karşılaştırmanıza olanak tanır. Bu, bir laboratuvar ortamı olmadan gerçekleştirebileceğiniz en adil karşılaştırma yöntemidir.

En çok karşılaştırmak istediğiniz modeller en yenileri olan GPT-6 Astra ve Claude Fable 5.1 ise, bunlar henüz NextDocs'ta yer almıyor. Shyne masaüstü uygulaması, kendi Claude Code veya Codex aboneliğiniz üzerinden kendi otonom aracını çalıştırabilir; bu da onları bugün gerçek belgeler üzerinde çalıştırmanın en hızlı yoludur.

NextDocs'taki model seçiciyi deneyin


NextDocs Ekibi