Ogni poche settimane arriva un nuovo modello accompagnato da un grafico di benchmark. Nessuno di questi grafici misura ciò di cui uno strumento per documenti ha più bisogno: il modello è in grado di scrivere un documento lungo e strutturato fino alla fine, a una velocità accettabile per un utente, senza interrompersi silenziosamente prima del tempo?
Così abbiamo creato il nostro test, e ogni modello deve superarlo prima di ottenere una corsia in NextDocs. Questo post spiega in cosa consiste il test e come si sono comportati cinque modelli attuali. Alcuni risultati ci hanno sorpreso.
Abbiamo preso un prompt reale dalla produzione: una richiesta che aveva generato un documento di 22 pagine, con sezioni, tabelle e una struttura specifica. Lo riproduciamo con un modello candidato utilizzando lo stesso budget di generazione usato dal prodotto, e osserviamo tre aspetti:
Un modello che fallisce anche solo uno di questi tre punti non viene promosso, indipendentemente da quanto sia promettente il suo grafico di benchmark.
GPT-5.6 Luna (OpenAI, in esecuzione su Azure AI Foundry). Ha completato tutte le 22 pagine, in meno di due minuti nelle sessioni più veloci. Throughput costante dalla prima all'ultima pagina. Ecco perché Luna mantiene la corsia veloce per ogni piano.
Gemini 3.5 Flash (Google). Ha completato tutte le 22 pagine in poco più di due minuti. Ha mantenuto la corsia della qualità per gran parte dell'estate.
Gemini 3.8 Flash (Google, rilasciato il 2 settembre). Ha superato lo stesso test di sbarramento entro un giorno dal rilascio ed è stato promosso alla corsia della qualità il 3 settembre. La quarta generazione Flash in quattro mesi, e la prima su cui siamo passati entro 24 ore.
Claude Sonnet 4.6 (Anthropic). Ha completato tutte le 22 pagine, ma ha consumato quasi l'intero budget di generazione per farlo, scrivendo molto più di qualsiasi altro modello, circa 170.000 caratteri. Non è lento all'avvio e non subisce cali di prestazioni; è semplicemente estremamente meticoloso. Questo lo rende un eccellente scrittore premium e un modello che monitoriamo da vicino per i documenti molto lunghi, poiché una richiesta leggermente più lunga potrebbe fargli superare il budget.
Claude Sonnet 5 (Anthropic, rilasciato il 30 giugno). Questa è stata la sorpresa. Sonnet 5 è più recente ed economico di Sonnet 4.6, e i suoi benchmark agentici sono migliori. Nel nostro test si è fermato a 16 pagine su 22 dopo circa otto minuti, a metà di un elemento, senza alcun errore. Questa è l'esatta firma del bug di troncamento che abbiamo passato il mese di luglio a eliminare. Di conseguenza, Sonnet 5 non è stato inserito nella gerarchia e Sonnet 4.6 mantiene la corsia premium fino a quando un nuovo test non dirà il contrario.
Più recente non significa migliore per i documenti lunghi. I due modelli che abbiamo deciso di non promuovere quest'estate erano entrambi più recenti di quelli che hanno mantenuto le loro corsie. Un modello può essere più intelligente per singolo token e comunque fallire su un documento lungo a causa della curva di throughput.
Il calo del throughput è la modalità di guasto da monitorare. I modelli pericolosi non restituiscono errori. Rallentano man mano che il documento cresce, superano il budget di streaming e la trasmissione si interrompe con un documento completato a metà che sembra finito. Abbiamo modificato NextDocs per rilevare uno streaming interrotto e rifiutare il salvataggio del risultato troncato, motivo per cui i documenti lunghi ora finiscono o falliscono in modo evidente, mai silenziosamente.
La meticolosità ha un costo. Sonnet 4.6 scrive i documenti più ricchi e lunghi tra i cinque. Per un report di 40 pagine potresti volere esattamente questo. Per una presentazione di dieci slide, preferiresti avere Luna e recuperare il tuo pomeriggio. Ecco perché la nostra gerarchia prevede diverse corsie invece di un unico modello.
Testare prima di promuovere, sempre. Gemini 3.8 Flash si è guadagnato la sua corsia in un giorno perché il test di sbarramento è ripetibile. Sonnet 5 ha perso una corsia che altrimenti avrebbe ottenuto per lo stesso motivo. Un test fisso è il modo in cui si rimane veloci senza essere imprudenti.
Non devi preoccuparti di nulla di tutto questo. Scegli una modalità e la gerarchia selezionerà il modello:
Oppure effettua una scelta esplicita nel selettore di modelli. E se vuoi eseguire la tua versione di questo test, la generazione multivariante ti consente di inviare un singolo prompt a diversi modelli contemporaneamente e confrontare i documenti completi fianco a fianco. È quanto di più vicino a un confronto diretto e imparziale tu possa fare senza un laboratorio.
Se i modelli che desideri confrontare maggiormente sono i più recenti, GPT-6 Astra e Claude Fable 5.1, non sono ancora disponibili su NextDocs. L'app desktop Shyne può eseguire il suo agente sul tuo abbonamento Claude Code o Codex, che è il modo più rapido per metterli al lavoro su documenti reali oggi stesso.
Prova il selettore di modelli in NextDocs
Il Team di NextDocs

GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash e Kimi K3 sono arrivati tutti a poche settimane di distanza l'uno dall'altro. Scopri in cosa eccelle ciascuno per presentazioni e documenti, quanto costano, quali sono supportati oggi da NextDocs e come utilizzare i nuovissimi modelli tramite Shyne.
Leggi di più
I documenti lunghi erano il punto in cui la generazione tramite IA falliva più spesso, di solito verso la fine e in modo silenzioso. Ecco come NextDocs genera un documento lungo in parole semplici, cosa è cambiato nella versione 1.11.1 affinché i processi vengano completati o falliscano in modo evidente, e cosa fare quando si ha bisogno di 100 pagine.
Leggi di più
Genera fino a 4 varianti di documenti simultaneamente. Confronta diverse opzioni e scegli la migliore.
Leggi di più