Blogs
AI ModelsBenchmarksLong documentsClaudeGeminiGPT-5.6

Rodamos cinco modelos no mesmo documento de 22 páginas. Aqui está o que aprendemos.

5 min
Rodamos cinco modelos no mesmo documento de 22 páginas. Aqui está o que aprendemos.

Rodamos cinco modelos no mesmo documento de 22 páginas. Aqui está o que aprendemos.

A cada poucas semanas, um novo modelo chega com um gráfico de benchmark. Nenhum desses gráficos mede o que uma ferramenta de documentos mais precisa: o modelo consegue escrever um documento longo e estruturado até o fim, em uma velocidade que uma pessoa esteja disposta a esperar, sem parar silenciosamente antes da hora?

Por isso, criamos nosso próprio teste, e cada modelo precisa passar por ele antes de ganhar uma faixa no NextDocs. Este post explica o teste e o que cinco modelos atuais fizeram nele. Alguns dos resultados nos surpreenderam.

O portão

Pegamos um prompt real da produção: uma solicitação que havia produzido um documento de 22 páginas, com seções, tabelas e uma estrutura específica. Nós o reproduzimos em um modelo candidato com o mesmo orçamento de geração que o produto utiliza, e observamos três coisas:

  1. Ele terminou? Todas as 22 páginas, ou parou no meio de um elemento sem apresentar erro?
  2. Quanto tempo demorou? O NextDocs transmite o documento em tempo real enquanto ele é escrito, e o usuário está assistindo. Um modelo que termina em dois minutos e outro que termina em dez não são o mesmo produto.
  3. O rendimento (throughput) se manteve? Alguns modelos começam rápidos e desaceleram à medida que a saída cresce. Esse padrão é o que transforma um documento longo em um documento truncado.

Um modelo que falha em qualquer um dos três não é promovido, por melhor que seja o seu gráfico de benchmark.

O que cinco modelos fizeram

GPT-5.6 Luna (OpenAI, rodando no Azure AI Foundry). Concluiu todas as 22 páginas em menos de dois minutos nas execuções mais rápidas. Rendimento consistente da primeira à última página. É por isso que o Luna mantém a faixa rápida em todos os planos.

Gemini 3.5 Flash (Google). Concluiu todas as 22 páginas em pouco mais de dois minutos. Manteve a faixa de qualidade durante a maior parte do verão.

Gemini 3.8 Flash (Google, lançado em 2 de setembro). Passou pelo mesmo portão em menos de um dia após o lançamento e foi promovido para a faixa de qualidade em 3 de setembro. A quarta geração do Flash em quatro meses, e a primeira para a qual migramos em menos de 24 horas.

Claude Sonnet 4.6 (Anthropic). Concluiu todas as 22 páginas, mas usou quase todo o orçamento de geração para isso, e escreveu muito mais do que qualquer outro modelo, cerca de 170.000 caracteres. Ele não é lento para começar e não decai; é simplesmente minucioso. Isso o torna um excelente redator premium e um modelo que observamos de perto em documentos muito longos, pois uma solicitação um pouco mais longa poderia fazê-lo estourar o orçamento.

Claude Sonnet 5 (Anthropic, lançado em 30 de junho). Esta foi a surpresa. O Sonnet 5 é mais novo e mais barato que o Sonnet 4.6, e seus benchmarks de agentes são melhores. Em nosso portão, ele parou em 16 de 22 páginas após cerca de oito minutos, no meio de um elemento, sem nenhum erro. Essa é a assinatura exata do bug de truncamento que passamos o mês de julho eliminando. Portanto, o Sonnet 5 não foi classificado, e o Sonnet 4.6 mantém a faixa premium até que um novo teste diga o contrário.

O que aprendemos

Mais novo não é sinônimo de melhor para documentos logos. Os dois modelos que decidimos não promover neste verão eram mais novos do que os que mantiveram suas faixas. Um modelo pode ser mais inteligente por token e ainda assim falhar em um documento longo devido a uma curva de rendimento.

A queda de rendimento é o modo de falha a ser observado. Os modelos perigosos não apresentam erros. Eles desaceleram à medida que o documento cresce, excedem o orçamento de transmissão e a transmissão termina com um documento semiacabado que parece completo. Alteramos o NextDocs para detectar uma transmissão abortada e recusar salvar o resultado truncado, e é por isso que os documentos longos agora terminam ou falham ruidosamente, nunca silenciosamente.

A minuciosidade tem um custo. O Sonnet 4.6 escreve os documentos mais ricos e mais longos dos cinco. Para um relatório de 40 páginas, você pode querer exatamente isso. Para uma apresentação de dez slides, você preferiria ter o Luna e sua tarde de volta. É por isso que a classificação tem faixas em vez de um único modelo.

Teste antes de promover, sempre. O Gemini 3.8 Flash conquistou sua faixa em um dia porque o portão é repetível. O Sonnet 5 perdeu uma faixa que de outra forma teria pelo mesmo motivo. Um teste fixo é a maneira de se manter rápido sem ser imprudente.

Como isso chega até você

Você não precisa pensar em nada disso. Escolha um modo e a classificação escolhe o modelo:

  • Rápido para rascunhos e documentos curtos.
  • Qualidade para qualquer coisa com seções que devem permanecer consistentes.
  • Premium, no Pro+ e Ultra, para redação onde a profundidade importa mais do que o tempo.

Ou escolha explicitamente no seletor de modelos. E se você quiser rodar sua própria versão deste teste, a geração multivariada permite enviar um prompt para vários modelos ao mesmo tempo e comparar os documentos completos lado a lado. É o mais próximo de uma comparação justa que você pode fazer sem um laboratório.

Se os modelos que você mais deseja comparar são os mais novos, GPT-6 Astra e Claude Fable 5.1, eles ainda não estão no NextDocs. O aplicativo de desktop Shyne pode rodar o agente dele na sua própria assinatura do Claude Code ou Codex, que é a maneira mais rápida de colocá-los para trabalhar em documentos reais hoje.

Experimente o seletor de modelos no NextDocs


A Equipe NextDocs