Om de paar weken verschijnt er een nieuw model met een benchmarkgrafiek. Geen van die grafieken meet wat een documenttool het hardst nodig heeft: kan het model een lang, gestructureerd document helemaal tot het einde schrijven, met een snelheid waar een mens op wil wachten, zonder stilletjes voortijdig te stoppen?
Dus hebben we onze eigen test gebouwd, en elk model moet hiervoor slagen voordat het een plek krijgt in NextDocs. Dit bericht legt de test uit en laat zien hoe vijf huidige modellen presteerden. Sommige resultaten verrasten ons.
We namen een echte prompt uit de praktijk: een verzoek dat een document van 22 pagina's had opgeleverd, met secties, tabellen en een specifieke structuur. We spelen dit opnieuw af bij een kandidaat-model met hetzelfde generatiebudget dat het product gebruikt, en we letten op drie dingen:
Een model dat op een van deze drie punten faalt, wordt niet gepromoveerd, hoe goed de benchmarkgrafiek er ook uitziet.
GPT-5.6 Luna (OpenAI, draaiend op Azure AI Foundry). Voltooide alle 22 pagina's, in minder dan twee minuten tijdens de snelste runs. Consistente doorvoersnelheid van de eerste tot de laatste pagina. Dit is waarom Luna de snelle baan behoudt voor elk abonnement.
Gemini 3.5 Flash (Google). Voltooide alle 22 pagina's in iets meer dan twee minuten. Behield het grootste deel van de zomer de kwaliteitsbaan.
Gemini 3.8 Flash (Google, uitgebracht op 2 september). Passeerde dezelfde poort binnen een dag na release en werd op 3 september gepromoveerd naar de kwaliteitsbaan. De vierde Flash-generatie in vier maanden tijd, en de eerste waar we binnen 24 uur naar zijn overgestapt.
Claude Sonnet 4.6 (Anthropic). Voltooide alle 22 pagina's, maar verbruikte daarvoor bijna het volledige generatiebudget en schreef veel meer dan welk ander model dan ook, ongeveer 170.000 tekens. Het start niet traag en de prestaties nemen niet af; het is simpelweg grondig. Dat maakt het een uitstekende premium schrijver en een model dat we nauwlettend in de gaten houden bij zeer lange documenten, omdat een iets langer verzoek het budget zou kunnen overschrijden.
Claude Sonnet 5 (Anthropic, uitgebracht op 30 juni). Dit was de verrassing. Sonnet 5 is nieuwer en goedkoper dan Sonnet 4.6, en de agentische benchmarks zijn beter. Bij onze poort stopte het na ongeveer acht minuten op pagina 16 van de 22, halverwege een element, zonder foutmelding. Dat is exact de handtekening van de afbreekfout die we in juli hebben weggewerkt. Dus Sonnet 5 is niet opgenomen in de ladder, and Sonnet 4.6 behoudt de premium-baan totdat een hertest anders uitwijst.
Nieuwer is niet hetzelfde als beter voor lange documenten. De twee modellen die we deze zomer niet hebben gepromoveerd, waren beide nieuwer dan de modellen die hun baan behielden. Een model kan per token slimmer zijn en het toch verliezen bij een lang document door een dalende doorvoersnelheid.
De afname van de doorvoersnelheid is de foutmodus om in de gaten te houden. De gevaarlijke modellen geven geen foutmelding. Ze vertragen naarmate het document groeit, overschrijden het streamingbudget en de stream eindigt met een halfvoltooid document dat compleet lijkt. We hebben NextDocs aangepast om een afgebroken stream te detecteren en te weigeren het afgekapte resultaat op te slaan. Dat is de reden waarom lange documenten tegenwoordig luidruchtig slagen of falen, en nooit meer in stilte.
Grondigheid heeft een prijs. Sonnet 4.6 schrijft de rijkste en langste documenten van de vijf. Voor een rapport van 40 pagina's is dat misschien precies wat je wilt. Voor een presentatie van tien dia's heb je liever Luna en je middag terug. Dat is waarom de ladder verschillende banen heeft in plaats van één model.
Test altijd voordat je promoveert. Gemini 3.8 Flash verdiende zijn baan in één dag omdat de poort herhaalbaar is. Sonnet 5 verloor om dezelfde reden een baan die het anders wel had gekregen. Een vaste test is de manier om snel te blijven zonder roekeloos te worden.
Je hoeft hier zelf helemaal niet over na te denken. Kies een modus en de ladder kiest het model:
Of kies expliciet in de modelkiezer. En als je je eigen versie van deze test wilt uitvoeren, stelt multi-variante generatie je in staat om één prompt naar meerdere modellen tegelijk te sturen en de volledige documenten naast elkaar te vergelijken. Het is het dichtste dat je bij een eerlijke vergelijkingstest kunt komen zonder laboratorium.
Als de modellen die je het liefst wilt vergelijken de allernieuwste zijn, GPT-6 Astra en Claude Fable 5.1: deze zitten nog niet in NextDocs. De Shyne desktop-app kan zijn agent uitvoeren op je eigen Claude Code- of Codex-abonnement, wat momenteel de snelste manier is om ze aan het werk te zetten met echte documenten.
Probeer de modelkiezer in NextDocs
Het NextDocs-team

GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash en Kimi K3 kwamen allemaal binnen enkele weken na elkaar uit. Waar elk model goed in is voor presentaties en documenten, wat ze kosten, welke NextDocs vandaag de dag gebruikt en hoe je de allernieuwste kunt gebruiken via Shyne.
Lees meer
Lange documenten waren het punt waarop AI-generatie het vaakst faalde, meestal aan het einde en meestal geruisloos. Hier leest u hoe NextDocs een lang document genereert in begrijpelijke taal, wat er is veranderd in v1.11.1 zodat processen worden voltooid of duidelijk falen, en wat u moet doen als u 100 pagina's nodig heeft.
Lees meer
Genereer tot 4 documentvarianten tegelijkertijd. Vergelijk verschillende
Lees meer