Blogs
AI ModelsBenchmarksLong documentsClaudeGeminiGPT-5.6

Sometimos a cinco modelos al mismo documento de 22 páginas. Esto es lo que aprendimos.

5 min
Sometimos a cinco modelos al mismo documento de 22 páginas. Esto es lo que aprendimos.

Sometimos a cinco modelos al mismo documento de 22 páginas. Esto es lo que aprendimos.

Cada pocas semanas llega un nuevo modelo con un gráfico de rendimiento (benchmark). Ninguno de esos gráficos mide lo que una herramienta de documentos más necesita: ¿puede el modelo escribir un documento largo y estructurado hasta el final, a una velocidad que una persona esté dispuesta a esperar, sin detenerse silenciosamente antes de tiempo?

Así que creamos nuestra propia prueba, y cada modelo tiene que superarla antes de obtener un carril en NextDocs. Esta publicación explica la prueba y cómo se desempeñaron cinco modelos actuales en ella. Algunos de los resultados nos sorprendieron.

El filtro de acceso

Tomamos una instrucción (prompt) real de producción: una solicitud que había generado un documento de 22 páginas, con secciones, tablas y una estructura específica. La ejecutamos de nuevo contra un modelo candidato con el mismo presupuesto de generación que utiliza el producto, y observamos tres cosas:

  1. ¿Terminó? Las 22 páginas completas, ¿o se detuvo a mitad de un elemento sin mostrar ningún error?
  2. ¿Cuánto tiempo tardó? NextDocs transmite (streams) un documento a medida que se escribe, y el usuario lo está viendo. Un modelo que termina en dos minutos y uno que tarda diez no son el mismo producto.
  3. ¿Se mantuvo el rendimiento (throughput)? Algunos modelos comienzan rápido y se ralentizan a medida que el resultado crece. Ese patrón es lo que convierte un documento largo en uno truncado.

Un modelo que falla en cualquiera de las tres variables no es promovido, por muy bien que se vea su gráfico de rendimiento.

Qué hicieron los cinco modelos

GPT-5.6 Luna (OpenAI, ejecutándose en Azure AI Foundry). Terminó las 22 páginas en menos de dos minutos en las ejecuciones más rápidas. Rendimiento constante desde la primera página hasta la última. Es por esto que Luna mantiene el carril rápido en todos los planes.

Gemini 3.5 Flash (Google). Terminó las 22 páginas en poco más de dos minutos. Mantuvo el carril de calidad durante la mayor parte del verano.

Gemini 3.8 Flash (Google, lanzado el 2 de septiembre). Superó el mismo filtro un día después de su lanzamiento y fue promovido al carril de calidad el 3 de septiembre. La cuarta generación de Flash en cuatro meses, y la primera a la que migramos en menos de 24 horas.

Claude Sonnet 4.6 (Anthropic). Terminó las 22 páginas, pero utilizó casi todo el presupuesto de generación para hacerlo y escribió mucho más que cualquier otro modelo, alrededor de 170,000 caracteres. No es lento al inicio ni decae; es simplemente minucioso. Eso lo convierte en un redactor prémium excelente y en un modelo que vigilamos de cerca para documentos muy largos, ya que una solicitud ligeramente más extensa podría superar el presupuesto.

Claude Sonnet 5 (Anthropic, lanzado el 30 de junio). Esta fue la sorpresa. Sonnet 5 es más nuevo y económico que Sonnet 4.6, y sus evaluaciones de agentes (agentic benchmarks) son mejores. En nuestro filtro, se detuvo en la página 16 de 22 después de unos ocho minutos, a mitad de un elemento y sin errores. Esa es la firma exacta del error de truncamiento que pasamos todo julio eliminando. Por lo tanto, Sonnet 5 no está clasificado en los carriles, y Sonnet 4.6 conserva el carril prémium hasta que una nueva prueba indique lo contrario.

Lo que aprendimos

Más nuevo no equivale a mejor para documentos largos. Los dos modelos que decidimos no promover este verano eran más nuevos que los que conservaron sus carriles. Un modelo puede ser más inteligente por token y aun así fallar en un documento largo debido a la curva de rendimiento.

La caída del rendimiento es el modo de fallo a vigilar. Los modelos peligrosos no arrojan errores. Se ralentizan a medida que el documento crece, superan el presupuesto de transmisión y la transmisión finaliza con un documento a medio terminar que parece completo. Modificamos NextDocs para detectar transmisiones interrumpidas y rechazar el guardado del resultado truncado, razón por la cual los documentos largos ahora terminan o fallan ruidosamente, nunca de forma silenciosa.

La minuciosidad tiene un costo. Sonnet 4.6 escribe los documentos más ricos y largos de los cinco. Para un informe de 40 páginas, es posible que desees exactamente eso. Para una presentación de diez diapositivas, preferirías tener a Luna y recuperar tu tarde. Es por eso que nuestra estructura tiene carriles en lugar de un solo modelo.

Probar antes de promover, siempre. Gemini 3.8 Flash se ganó su carril en un día porque el filtro es repetible. Sonnet 5 perdió un carril que de otro modo habría tenido por la misma razón. Una prueba fija es la manera de mantener la rapidez sin ser imprudentes.

Cómo te beneficia esto

No tienes que preocuparte por nada de esto. Elige un modo y el sistema seleccionará el modelo:

  • Rápido para borradores y documentos cortos.
  • Calidad para cualquier documento con secciones que deban mantener la coherencia.
  • Prémium, en Pro+ y Ultra, para redacciones donde la profundidad importa más que el tiempo.

O elígelo explícitamente en el selector de modelos. Y si deseas ejecutar tu propia versión de esta prueba, la generación multivariante te permite enviar una misma instrucción a varios modelos a la vez y comparar los documentos completos lado a lado. Es lo más parecido a una comparativa justa que puedes realizar sin un laboratorio.

Si los modelos que más deseas comparar son los más nuevos, GPT-6 Astra y Claude Fable 5.1, aún no están en NextDocs. La aplicación de escritorio Shyne puede ejecutar su agente en tu propia suscripción de Claude Code o Codex, lo cual es la forma más rápida de ponerlos a trabajar en documentos reales hoy mismo.

Prueba el selector de modelos en NextDocs


El equipo de NextDocs