Toutes les quelques semaines, un nouveau modèle arrive avec son graphique de référence (benchmark). Aucun de ces graphiques ne mesure ce dont un outil de traitement de documents a le plus besoin : le modèle peut-il rédiger un document long et structuré jusqu'au bout, à une vitesse acceptable pour un utilisateur, sans s'arrêter discrètement en cours de route ?
Nous avons donc créé notre propre test, et chaque modèle doit le réussir avant d'obtenir sa place dans NextDocs. Cet article explique ce test et comment cinq modèles actuels s'en sont sortis. Certains résultats nous ont surpris.
Nous avons pris un véritable prompt issu de la production : une requête qui avait généré un document de 22 pages, avec des sections, des tableaux et une structure spécifique. Nous la rejouons sur le modèle candidat avec le même budget de génération que celui utilisé par le produit, et nous surveillons trois critères :
Un modèle qui échoue à l'un de ces trois critères n'est pas promu, quelle que soit la qualité de ses graphiques de référence.
GPT-5.6 Luna (OpenAI, fonctionnant sur Azure AI Foundry). A terminé les 22 pages en moins de deux minutes sur les passages les plus rapides. Débit constant de la première à la dernière page. C'est pourquoi Luna occupe la voie rapide pour tous les abonnements.
Gemini 3.5 Flash (Google). A terminé les 22 pages en un peu plus de deux minutes. A occupé la voie de qualité pendant la majeure partie de l'été.
Gemini 3.8 Flash (Google, sorti le 2 septembre). A franchi le même filtre de sélection en moins d'un jour après sa sortie et a été promu dans la voie de qualité le 3 septembre. La quatrième génération de Flash en quatre mois, et la première vers laquelle nous avons migré en moins de 24 heures.
Claude Sonnet 4.6 (Anthropic). A terminé les 22 pages, mais a consommé presque tout le budget de génération pour y parvenir, et a écrit beaucoup plus que n'importe quel autre modèle, environ 170 000 caractères. Il ne tarde pas à démarrer et son débit ne faiblit pas ; il est simplement extrêmement minutieux. Cela en fait un rédacteur premium exceptionnel et un modèle que nous surveillons de près pour les documents très longs, car une requête légèrement plus longue pourrait lui faire dépasser le budget.
Claude Sonnet 5 (Anthropic, sorti le 30 juin). Ce fut la surprise. Sonnet 5 est plus récent et moins cher que Sonnet 4.6, et ses benchmarks d'agents sont meilleurs. Sur notre filtre de sélection, il s'est arrêté à la page 16 sur 22 après environ huit minutes, au milieu d'un élément, sans message d'erreur. C'est la signature exacte du bug de troncature que nous avons passé le mois de juillet à éliminer. Sonnet 5 n'est donc pas intégré à notre hiérarchie, et Sonnet 4.6 conserve la voie premium jusqu'à ce qu'un nouveau test prouve le contraire.
Le plus récent n'est pas forcément le meilleur pour les documents longs. Les deux modèles que nous avons refusé de promouvoir cet été étaient tous deux plus récents que ceux qui ont conservé leur place. Un modèle peut être plus intelligent par jeton (token) et tout de même échouer sur un document long à cause de sa courbe de débit.
La baisse de débit est le mode de défaillance à surveiller. Les modèles dangereux ne génèrent pas d'erreur. Ils ralentissent à mesure que le document s'allonge, dépassent le budget de streaming, et le flux se termine par un document à moitié rédigé qui semble pourtant complet. Nous avons modifié NextDocs pour détecter un flux interrompu et refuser d'enregistrer le résultat tronqué, c'est pourquoi les documents longs se terminent désormais ou échouent de manière visible, jamais en silence.
La minutie a un coût. Sonnet 4.6 rédige les documents les plus riches des cinq, et les plus longs. Pour un rapport de 40 pages, c'est exactement ce que vous recherchez. Pour une présentation de dix diapositives, vous préférerez Luna pour pouvoir profiter de votre après-midi. C'est pourquoi notre hiérarchie comporte différentes voies plutôt qu'un seul modèle.
Tester avant de promouvoir, à chaque fois. Gemini 3.8 Flash a gagné sa place en un jour car le test de sélection est reproductible. Sonnet 5 a perdu une place qu'il aurait obtenue autrement pour la même raison. Un test standardisé est le meilleur moyen de rester rapide sans être imprudent.
Vous n'avez pas besoin de vous soucier de tout cela. Choisissez un mode et notre système sélectionne le modèle :
Ou choisissez explicitement dans le sélecteur de modèle. Et si vous souhaitez lancer votre propre version de ce test, la génération multi-variante vous permet d'envoyer un seul prompt à plusieurs modèles à la fois et de comparer les documents complets côte à côte. C'est ce qui se rapproche le plus d'un comparatif équitable sans avoir besoin d'un laboratoire.
Si les modèles que vous souhaitez le plus comparer sont les tout derniers, GPT-6 Astra et Claude Fable 5.1, ils ne sont pas encore intégrés à NextDocs. L'application de bureau Shyne peut exécuter son agent sur votre propre abonnement Claude Code ou Codex, ce qui est le moyen le plus rapide de les mettre au travail sur de vrais documents aujourd'hui.
Essayez le sélecteur de modèle dans NextDocs
L'équipe NextDocs

GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash et Kimi K3 sont tous arrivés à quelques semaines d'intervalle. Découvrez les points forts de chacun pour les présentations et les documents, leurs tarifs, les modèles actuellement utilisés par NextDocs, et comment exploiter les tout derniers via Shyne.
Lire la suite
Les documents longs étaient le principal point de défaillance de la génération par IA, généralement vers la fin et de manière silencieuse. Voici comment NextDocs génère un document long en langage clair, ce qui a changé dans la v1.11.1 pour que les exécutions se terminent ou échouent de manière explicite, et ce qu'il faut faire lorsque vous avez besoin de 100 pages.
Lire la suite
Générez jusqu'à 4 variantes de documents simultanément. Comparez différentes approches.
Lire la suite