A cada poucas semanas, um novo modelo chega com um gráfico de benchmark. Nenhum desses gráficos mede o que uma ferramenta de documentos mais precisa: o modelo consegue escrever um documento longo e estruturado até o fim, em uma velocidade que uma pessoa esteja disposta a esperar, sem parar silenciosamente antes da hora?
Por isso, criamos nosso próprio teste, e cada modelo precisa passar por ele antes de ganhar uma faixa no NextDocs. Este post explica o teste e o que cinco modelos atuais fizeram nele. Alguns dos resultados nos surpreenderam.
Pegamos um prompt real da produção: uma solicitação que havia produzido um documento de 22 páginas, com seções, tabelas e uma estrutura específica. Nós o reproduzimos em um modelo candidato com o mesmo orçamento de geração que o produto utiliza, e observamos três coisas:
Um modelo que falha em qualquer um dos três não é promovido, por melhor que seja o seu gráfico de benchmark.
GPT-5.6 Luna (OpenAI, rodando no Azure AI Foundry). Concluiu todas as 22 páginas em menos de dois minutos nas execuções mais rápidas. Rendimento consistente da primeira à última página. É por isso que o Luna mantém a faixa rápida em todos os planos.
Gemini 3.5 Flash (Google). Concluiu todas as 22 páginas em pouco mais de dois minutos. Manteve a faixa de qualidade durante a maior parte do verão.
Gemini 3.8 Flash (Google, lançado em 2 de setembro). Passou pelo mesmo portão em menos de um dia após o lançamento e foi promovido para a faixa de qualidade em 3 de setembro. A quarta geração do Flash em quatro meses, e a primeira para a qual migramos em menos de 24 horas.
Claude Sonnet 4.6 (Anthropic). Concluiu todas as 22 páginas, mas usou quase todo o orçamento de geração para isso, e escreveu muito mais do que qualquer outro modelo, cerca de 170.000 caracteres. Ele não é lento para começar e não decai; é simplesmente minucioso. Isso o torna um excelente redator premium e um modelo que observamos de perto em documentos muito longos, pois uma solicitação um pouco mais longa poderia fazê-lo estourar o orçamento.
Claude Sonnet 5 (Anthropic, lançado em 30 de junho). Esta foi a surpresa. O Sonnet 5 é mais novo e mais barato que o Sonnet 4.6, e seus benchmarks de agentes são melhores. Em nosso portão, ele parou em 16 de 22 páginas após cerca de oito minutos, no meio de um elemento, sem nenhum erro. Essa é a assinatura exata do bug de truncamento que passamos o mês de julho eliminando. Portanto, o Sonnet 5 não foi classificado, e o Sonnet 4.6 mantém a faixa premium até que um novo teste diga o contrário.
Mais novo não é sinônimo de melhor para documentos logos. Os dois modelos que decidimos não promover neste verão eram mais novos do que os que mantiveram suas faixas. Um modelo pode ser mais inteligente por token e ainda assim falhar em um documento longo devido a uma curva de rendimento.
A queda de rendimento é o modo de falha a ser observado. Os modelos perigosos não apresentam erros. Eles desaceleram à medida que o documento cresce, excedem o orçamento de transmissão e a transmissão termina com um documento semiacabado que parece completo. Alteramos o NextDocs para detectar uma transmissão abortada e recusar salvar o resultado truncado, e é por isso que os documentos longos agora terminam ou falham ruidosamente, nunca silenciosamente.
A minuciosidade tem um custo. O Sonnet 4.6 escreve os documentos mais ricos e mais longos dos cinco. Para um relatório de 40 páginas, você pode querer exatamente isso. Para uma apresentação de dez slides, você preferiria ter o Luna e sua tarde de volta. É por isso que a classificação tem faixas em vez de um único modelo.
Teste antes de promover, sempre. O Gemini 3.8 Flash conquistou sua faixa em um dia porque o portão é repetível. O Sonnet 5 perdeu uma faixa que de outra forma teria pelo mesmo motivo. Um teste fixo é a maneira de se manter rápido sem ser imprudente.
Você não precisa pensar em nada disso. Escolha um modo e a classificação escolhe o modelo:
Ou escolha explicitamente no seletor de modelos. E se você quiser rodar sua própria versão deste teste, a geração multivariada permite enviar um prompt para vários modelos ao mesmo tempo e comparar os documentos completos lado a lado. É o mais próximo de uma comparação justa que você pode fazer sem um laboratório.
Se os modelos que você mais deseja comparar são os mais novos, GPT-6 Astra e Claude Fable 5.1, eles ainda não estão no NextDocs. O aplicativo de desktop Shyne pode rodar o agente dele na sua própria assinatura do Claude Code ou Codex, que é a maneira mais rápida de colocá-los para trabalhar em documentos reais hoje.
Experimente o seletor de modelos no NextDocs
A Equipe NextDocs

GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash e Kimi K3 foram lançados com poucas semanas de diferença. Saiba no que cada um se destaca para apresentações e documentos, quanto custam, quais o NextDocs executa hoje e como usar os mais recentes através do Shyne.
Leia mais
Documentos longos eram onde a geração por IA mais falhava, geralmente perto do fim e de forma silenciosa. Veja como o NextDocs gera um documento longo em linguagem simples, o que mudou na v1.11.1 para que as execuções terminem ou falhem explicitamente, e o que fazer quando você precisa de 100 páginas.
Leia mais
Gere até 4 variantes de documentos simultaneamente. Compare diferentes abordagens.
Leia mais