Blogs
AI ModelsBenchmarksLong documentsClaudeGeminiGPT-5.6

We hebben vijf modellen door hetzelfde document van 22 pagina's gehaald. Dit is wat we hebben geleerd.

5 min
We hebben vijf modellen door hetzelfde document van 22 pagina's gehaald. Dit is wat we hebben geleerd.

We hebben vijf modellen door hetzelfde document van 22 pagina's gehaald. Dit is wat we hebben geleerd.

Om de paar weken verschijnt er een nieuw model met een benchmarkgrafiek. Geen van die grafieken meet wat een documenttool het hardst nodig heeft: kan het model een lang, gestructureerd document helemaal tot het einde schrijven, met een snelheid waar een mens op wil wachten, zonder stilletjes voortijdig te stoppen?

Dus hebben we onze eigen test gebouwd, en elk model moet hiervoor slagen voordat het een plek krijgt in NextDocs. Dit bericht legt de test uit en laat zien hoe vijf huidige modellen presteerden. Sommige resultaten verrasten ons.

De poort

We namen een echte prompt uit de praktijk: een verzoek dat een document van 22 pagina's had opgeleverd, met secties, tabellen en een specifieke structuur. We spelen dit opnieuw af bij een kandidaat-model met hetzelfde generatiebudget dat het product gebruikt, en we letten op drie dingen:

  1. Is het afgerond? Alle 22 pagina's, of stopte het halverwege een element zonder foutmelding?
  2. Hoe lang duurde het? NextDocs streamt een document terwijl het wordt geschreven, en de gebruiker kijkt mee. Een model dat in twee minuten klaar is en een model dat er tien minuten over doet, zijn niet hetzelfde product.
  3. Bleef de doorvoersnelheid constant? Sommige modellen beginnen snel en vertragen naarmate de output groeit. Dat patroon is precies wat een lang document verandert in een afgebroken document.

Een model dat op een van deze drie punten faalt, wordt niet gepromoveerd, hoe goed de benchmarkgrafiek er ook uitziet.

Wat de vijf modellen deden

GPT-5.6 Luna (OpenAI, draaiend op Azure AI Foundry). Voltooide alle 22 pagina's, in minder dan twee minuten tijdens de snelste runs. Consistente doorvoersnelheid van de eerste tot de laatste pagina. Dit is waarom Luna de snelle baan behoudt voor elk abonnement.

Gemini 3.5 Flash (Google). Voltooide alle 22 pagina's in iets meer dan twee minuten. Behield het grootste deel van de zomer de kwaliteitsbaan.

Gemini 3.8 Flash (Google, uitgebracht op 2 september). Passeerde dezelfde poort binnen een dag na release en werd op 3 september gepromoveerd naar de kwaliteitsbaan. De vierde Flash-generatie in vier maanden tijd, en de eerste waar we binnen 24 uur naar zijn overgestapt.

Claude Sonnet 4.6 (Anthropic). Voltooide alle 22 pagina's, maar verbruikte daarvoor bijna het volledige generatiebudget en schreef veel meer dan welk ander model dan ook, ongeveer 170.000 tekens. Het start niet traag en de prestaties nemen niet af; het is simpelweg grondig. Dat maakt het een uitstekende premium schrijver en een model dat we nauwlettend in de gaten houden bij zeer lange documenten, omdat een iets langer verzoek het budget zou kunnen overschrijden.

Claude Sonnet 5 (Anthropic, uitgebracht op 30 juni). Dit was de verrassing. Sonnet 5 is nieuwer en goedkoper dan Sonnet 4.6, en de agentische benchmarks zijn beter. Bij onze poort stopte het na ongeveer acht minuten op pagina 16 van de 22, halverwege een element, zonder foutmelding. Dat is exact de handtekening van de afbreekfout die we in juli hebben weggewerkt. Dus Sonnet 5 is niet opgenomen in de ladder, and Sonnet 4.6 behoudt de premium-baan totdat een hertest anders uitwijst.

Wat we hebben geleerd

Nieuwer is niet hetzelfde als beter voor lange documenten. De twee modellen die we deze zomer niet hebben gepromoveerd, waren beide nieuwer dan de modellen die hun baan behielden. Een model kan per token slimmer zijn en het toch verliezen bij een lang document door een dalende doorvoersnelheid.

De afname van de doorvoersnelheid is de foutmodus om in de gaten te houden. De gevaarlijke modellen geven geen foutmelding. Ze vertragen naarmate het document groeit, overschrijden het streamingbudget en de stream eindigt met een halfvoltooid document dat compleet lijkt. We hebben NextDocs aangepast om een afgebroken stream te detecteren en te weigeren het afgekapte resultaat op te slaan. Dat is de reden waarom lange documenten tegenwoordig luidruchtig slagen of falen, en nooit meer in stilte.

Grondigheid heeft een prijs. Sonnet 4.6 schrijft de rijkste en langste documenten van de vijf. Voor een rapport van 40 pagina's is dat misschien precies wat je wilt. Voor een presentatie van tien dia's heb je liever Luna en je middag terug. Dat is waarom de ladder verschillende banen heeft in plaats van één model.

Test altijd voordat je promoveert. Gemini 3.8 Flash verdiende zijn baan in één dag omdat de poort herhaalbaar is. Sonnet 5 verloor om dezelfde reden een baan die het anders wel had gekregen. Een vaste test is de manier om snel te blijven zonder roekeloos te worden.

Wat dit voor jou betekent

Je hoeft hier zelf helemaal niet over na te denken. Kies een modus en de ladder kiest het model:

  • Snel voor concepten en korte documenten.
  • Kwaliteit voor alles met secties die consistent moeten blijven.
  • Premium, op Pro+ en Ultra, voor schrijfwerk waarbij diepgang belangrijker is dan tijd.

Of kies expliciet in de modelkiezer. En als je je eigen versie van deze test wilt uitvoeren, stelt multi-variante generatie je in staat om één prompt naar meerdere modellen tegelijk te sturen en de volledige documenten naast elkaar te vergelijken. Het is het dichtste dat je bij een eerlijke vergelijkingstest kunt komen zonder laboratorium.

Als de modellen die je het liefst wilt vergelijken de allernieuwste zijn, GPT-6 Astra en Claude Fable 5.1: deze zitten nog niet in NextDocs. De Shyne desktop-app kan zijn agent uitvoeren op je eigen Claude Code- of Codex-abonnement, wat momenteel de snelste manier is om ze aan het werk te zetten met echte documenten.

Probeer de modelkiezer in NextDocs


Het NextDocs-team