Cada pocas semanas llega un nuevo modelo con un gráfico de rendimiento (benchmark). Ninguno de esos gráficos mide lo que una herramienta de documentos más necesita: ¿puede el modelo escribir un documento largo y estructurado hasta el final, a una velocidad que una persona esté dispuesta a esperar, sin detenerse silenciosamente antes de tiempo?
Así que creamos nuestra propia prueba, y cada modelo tiene que superarla antes de obtener un carril en NextDocs. Esta publicación explica la prueba y cómo se desempeñaron cinco modelos actuales en ella. Algunos de los resultados nos sorprendieron.
Tomamos una instrucción (prompt) real de producción: una solicitud que había generado un documento de 22 páginas, con secciones, tablas y una estructura específica. La ejecutamos de nuevo contra un modelo candidato con el mismo presupuesto de generación que utiliza el producto, y observamos tres cosas:
Un modelo que falla en cualquiera de las tres variables no es promovido, por muy bien que se vea su gráfico de rendimiento.
GPT-5.6 Luna (OpenAI, ejecutándose en Azure AI Foundry). Terminó las 22 páginas en menos de dos minutos en las ejecuciones más rápidas. Rendimiento constante desde la primera página hasta la última. Es por esto que Luna mantiene el carril rápido en todos los planes.
Gemini 3.5 Flash (Google). Terminó las 22 páginas en poco más de dos minutos. Mantuvo el carril de calidad durante la mayor parte del verano.
Gemini 3.8 Flash (Google, lanzado el 2 de septiembre). Superó el mismo filtro un día después de su lanzamiento y fue promovido al carril de calidad el 3 de septiembre. La cuarta generación de Flash en cuatro meses, y la primera a la que migramos en menos de 24 horas.
Claude Sonnet 4.6 (Anthropic). Terminó las 22 páginas, pero utilizó casi todo el presupuesto de generación para hacerlo y escribió mucho más que cualquier otro modelo, alrededor de 170,000 caracteres. No es lento al inicio ni decae; es simplemente minucioso. Eso lo convierte en un redactor prémium excelente y en un modelo que vigilamos de cerca para documentos muy largos, ya que una solicitud ligeramente más extensa podría superar el presupuesto.
Claude Sonnet 5 (Anthropic, lanzado el 30 de junio). Esta fue la sorpresa. Sonnet 5 es más nuevo y económico que Sonnet 4.6, y sus evaluaciones de agentes (agentic benchmarks) son mejores. En nuestro filtro, se detuvo en la página 16 de 22 después de unos ocho minutos, a mitad de un elemento y sin errores. Esa es la firma exacta del error de truncamiento que pasamos todo julio eliminando. Por lo tanto, Sonnet 5 no está clasificado en los carriles, y Sonnet 4.6 conserva el carril prémium hasta que una nueva prueba indique lo contrario.
Más nuevo no equivale a mejor para documentos largos. Los dos modelos que decidimos no promover este verano eran más nuevos que los que conservaron sus carriles. Un modelo puede ser más inteligente por token y aun así fallar en un documento largo debido a la curva de rendimiento.
La caída del rendimiento es el modo de fallo a vigilar. Los modelos peligrosos no arrojan errores. Se ralentizan a medida que el documento crece, superan el presupuesto de transmisión y la transmisión finaliza con un documento a medio terminar que parece completo. Modificamos NextDocs para detectar transmisiones interrumpidas y rechazar el guardado del resultado truncado, razón por la cual los documentos largos ahora terminan o fallan ruidosamente, nunca de forma silenciosa.
La minuciosidad tiene un costo. Sonnet 4.6 escribe los documentos más ricos y largos de los cinco. Para un informe de 40 páginas, es posible que desees exactamente eso. Para una presentación de diez diapositivas, preferirías tener a Luna y recuperar tu tarde. Es por eso que nuestra estructura tiene carriles en lugar de un solo modelo.
Probar antes de promover, siempre. Gemini 3.8 Flash se ganó su carril en un día porque el filtro es repetible. Sonnet 5 perdió un carril que de otro modo habría tenido por la misma razón. Una prueba fija es la manera de mantener la rapidez sin ser imprudentes.
No tienes que preocuparte por nada de esto. Elige un modo y el sistema seleccionará el modelo:
O elígelo explícitamente en el selector de modelos. Y si deseas ejecutar tu propia versión de esta prueba, la generación multivariante te permite enviar una misma instrucción a varios modelos a la vez y comparar los documentos completos lado a lado. Es lo más parecido a una comparativa justa que puedes realizar sin un laboratorio.
Si los modelos que más deseas comparar son los más nuevos, GPT-6 Astra y Claude Fable 5.1, aún no están en NextDocs. La aplicación de escritorio Shyne puede ejecutar su agente en tu propia suscripción de Claude Code o Codex, lo cual es la forma más rápida de ponerlos a trabajar en documentos reales hoy mismo.
Prueba el selector de modelos en NextDocs
El equipo de NextDocs

GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash y Kimi K3 llegaron con pocas semanas de diferencia. En qué destaca cada uno para presentaciones y documentos, cuánto cuestan, cuáles ejecuta NextDocs hoy en día y cómo usar los más nuevos a través de Shyne.
Leer más
Los documentos largos eran el punto donde la generación por IA fallaba más, normalmente cerca del final y de forma silenciosa. Aquí te explicamos cómo NextDocs genera un documento largo en un lenguaje sencillo, qué cambió en la v1.11.1 para que las ejecuciones se completen o fallen ruidosamente, y qué hacer cuando necesitas 100 páginas.
Leer más
Genera hasta 4 variantes de documentos simultáneamente. Compara diferentes opciones.
Leer más