blogs
AI ModelsBenchmarksLong documentsClaudeGeminiGPT-5.6

Nous avons testé cinq modèles sur le même document de 22 pages. Voici ce que nous avons appris.

6 min
Nous avons testé cinq modèles sur le même document de 22 pages. Voici ce que nous avons appris.

Nous avons testé cinq modèles sur le même document de 22 pages. Voici ce que nous avons appris.

Toutes les quelques semaines, un nouveau modèle arrive avec son graphique de référence (benchmark). Aucun de ces graphiques ne mesure ce dont un outil de traitement de documents a le plus besoin : le modèle peut-il rédiger un document long et structuré jusqu'au bout, à une vitesse acceptable pour un utilisateur, sans s'arrêter discrètement en cours de route ?

Nous avons donc créé notre propre test, et chaque modèle doit le réussir avant d'obtenir sa place dans NextDocs. Cet article explique ce test et comment cinq modèles actuels s'en sont sortis. Certains résultats nous ont surpris.

Le filtre de sélection

Nous avons pris un véritable prompt issu de la production : une requête qui avait généré un document de 22 pages, avec des sections, des tableaux et une structure spécifique. Nous la rejouons sur le modèle candidat avec le même budget de génération que celui utilisé par le produit, et nous surveillons trois critères :

  1. A-t-il terminé ? Les 22 pages complètes, ou s'est-il arrêté au milieu d'un élément sans message d'erreur ?
  2. Combien de temps cela a-t-il pris ? NextDocs diffuse le document en continu (streaming) au fur et à mesure de sa rédaction, sous les yeux de l'utilisateur. Un modèle qui termine en deux minutes et un autre qui met dix minutes ne proposent pas la même expérience produit.
  3. Le débit s'est-il maintenu ? Certains modèles démarrent rapidement et ralentissent à mesure que le volume généré augmente. Ce comportement est précisément ce qui transforme un document long en un document tronqué.

Un modèle qui échoue à l'un de ces trois critères n'est pas promu, quelle que soit la qualité de ses graphiques de référence.

Les performances des cinq modèles

GPT-5.6 Luna (OpenAI, fonctionnant sur Azure AI Foundry). A terminé les 22 pages en moins de deux minutes sur les passages les plus rapides. Débit constant de la première à la dernière page. C'est pourquoi Luna occupe la voie rapide pour tous les abonnements.

Gemini 3.5 Flash (Google). A terminé les 22 pages en un peu plus de deux minutes. A occupé la voie de qualité pendant la majeure partie de l'été.

Gemini 3.8 Flash (Google, sorti le 2 septembre). A franchi le même filtre de sélection en moins d'un jour après sa sortie et a été promu dans la voie de qualité le 3 septembre. La quatrième génération de Flash en quatre mois, et la première vers laquelle nous avons migré en moins de 24 heures.

Claude Sonnet 4.6 (Anthropic). A terminé les 22 pages, mais a consommé presque tout le budget de génération pour y parvenir, et a écrit beaucoup plus que n'importe quel autre modèle, environ 170 000 caractères. Il ne tarde pas à démarrer et son débit ne faiblit pas ; il est simplement extrêmement minutieux. Cela en fait un rédacteur premium exceptionnel et un modèle que nous surveillons de près pour les documents très longs, car une requête légèrement plus longue pourrait lui faire dépasser le budget.

Claude Sonnet 5 (Anthropic, sorti le 30 juin). Ce fut la surprise. Sonnet 5 est plus récent et moins cher que Sonnet 4.6, et ses benchmarks d'agents sont meilleurs. Sur notre filtre de sélection, il s'est arrêté à la page 16 sur 22 après environ huit minutes, au milieu d'un élément, sans message d'erreur. C'est la signature exacte du bug de troncature que nous avons passé le mois de juillet à éliminer. Sonnet 5 n'est donc pas intégré à notre hiérarchie, et Sonnet 4.6 conserve la voie premium jusqu'à ce qu'un nouveau test prouve le contraire.

Ce que nous avons appris

Le plus récent n'est pas forcément le meilleur pour les documents longs. Les deux modèles que nous avons refusé de promouvoir cet été étaient tous deux plus récents que ceux qui ont conservé leur place. Un modèle peut être plus intelligent par jeton (token) et tout de même échouer sur un document long à cause de sa courbe de débit.

La baisse de débit est le mode de défaillance à surveiller. Les modèles dangereux ne génèrent pas d'erreur. Ils ralentissent à mesure que le document s'allonge, dépassent le budget de streaming, et le flux se termine par un document à moitié rédigé qui semble pourtant complet. Nous avons modifié NextDocs pour détecter un flux interrompu et refuser d'enregistrer le résultat tronqué, c'est pourquoi les documents longs se terminent désormais ou échouent de manière visible, jamais en silence.

La minutie a un coût. Sonnet 4.6 rédige les documents les plus riches des cinq, et les plus longs. Pour un rapport de 40 pages, c'est exactement ce que vous recherchez. Pour une présentation de dix diapositives, vous préférerez Luna pour pouvoir profiter de votre après-midi. C'est pourquoi notre hiérarchie comporte différentes voies plutôt qu'un seul modèle.

Tester avant de promouvoir, à chaque fois. Gemini 3.8 Flash a gagné sa place en un jour car le test de sélection est reproductible. Sonnet 5 a perdu une place qu'il aurait obtenue autrement pour la même raison. Un test standardisé est le meilleur moyen de rester rapide sans être imprudent.

Comment cela se traduit pour vous

Vous n'avez pas besoin de vous soucier de tout cela. Choisissez un mode et notre système sélectionne le modèle :

  • Rapide pour les brouillons et les documents courts.
  • Qualité pour tout document comportant des sections qui doivent rester cohérentes.
  • Premium, sur Pro+ et Ultra, pour les rédactions où la profondeur importe plus que le temps.

Ou choisissez explicitement dans le sélecteur de modèle. Et si vous souhaitez lancer votre propre version de ce test, la génération multi-variante vous permet d'envoyer un seul prompt à plusieurs modèles à la fois et de comparer les documents complets côte à côte. C'est ce qui se rapproche le plus d'un comparatif équitable sans avoir besoin d'un laboratoire.

Si les modèles que vous souhaitez le plus comparer sont les tout derniers, GPT-6 Astra et Claude Fable 5.1, ils ne sont pas encore intégrés à NextDocs. L'application de bureau Shyne peut exécuter son agent sur votre propre abonnement Claude Code ou Codex, ce qui est le moyen le plus rapide de les mettre au travail sur de vrais documents aujourd'hui.

Essayez le sélecteur de modèle dans NextDocs


L'équipe NextDocs