博客
AI ModelsBenchmarksLong documentsClaudeGeminiGPT-5.6

我们用同一份 22 页的文档测试了五款模型。以下是我们的发现。

1 min
我们用同一份 22 页的文档测试了五款模型。以下是我们的发现。

我们用同一份 22 页的文档测试了五款模型。以下是我们的发现。

每隔几周,就会有一款新模型带着基准测试图表问世。然而,这些图表都没有衡量文档工具最需要的能力:模型能否在用户愿意等待的时间内,完整地撰写一份长篇、结构化的文档,而不会在半途悄然停止?

因此,我们构建了自己的测试,每个模型都必须通过该测试才能在 NextDocs 中获得一席之地。本文将介绍这项测试以及五款主流模型在测试中的表现。其中一些结果令我们感到惊讶。

准入测试

我们从生产环境中获取了一个真实的提示词:该请求曾生成过一份包含章节、表格和特定结构的 22 页文档。我们使用与产品相同的生成预算,在候选模型上重新运行该请求,并重点观察以下三点:

  1. 是否完成? 是完整生成了全部 22 页,还是在没有报错的情况下在某个元素中间戛然而止?
  2. 耗时多久? NextDocs 会在文档编写时进行流式传输,用户正在实时观看。一个在两分钟内完成的模型和一个需要十分钟的模型,在产品体验上有着天壤之别。
  3. 吞吐量是否保持稳定? 某些模型在开始时速度很快,但随着输出内容的增加而逐渐变慢。这种模式往往会导致长文档被截断。

任何无法通过这三项指标的模型都不会获得晋升,无论其基准测试图表看起来多么优秀。

五款模型的表现

GPT-5.6 Luna(OpenAI,运行于 Azure AI Foundry)。完成了全部 22 页,最快运行时间不足两分钟。从第一页到最后一页的吞吐量始终如一。这就是为什么 Luna 在每个订阅方案中都占据着“极速”通道。

Gemini 3.5 Flash(Google)。在两分钟多一点的时间内完成了全部 22 页。在今年夏天的大部分时间里都占据着“优质”通道。

Gemini 3.8 Flash(Google,9 月 2 日发布)。在发布后的一天内就通过了相同的准入测试,并于 9 月 3 日被晋升至“优质”通道。这是四个月内的第四代 Flash 模型,也是我们首次在 24 小时内就完成迁移的模型。

Claude Sonnet 4.6(Anthropic)。完成了全部 22 页,但几乎用尽了所有的生成预算,并且撰写的内容远多于其他任何模型,约为 170,000 个字符。它在启动时并不慢,性能也没有衰减;它只是非常详尽。这使它成为一个极佳的高级撰稿人,也是我们在处理超长文档时密切关注的模型,因为稍微长一点的请求就可能使其超出预算。

Claude Sonnet 5(Anthropic,6 月 30 日发布)。这是一个意外。Sonnet 5 比 Sonnet 4.6 更亲民、更新,且其智能体(agentic)基准测试表现更好。但在我们的准入测试中,它在运行了大约八分钟后,在第 16 页(共 22 页)的某个元素中间停止了,且没有报任何错误。这正是我们整个七月份都在努力消除的“截断 Bug”的典型特征。因此,Sonnet 5 未能上榜,而 Sonnet 4.6 将继续保留在“尊享”通道,直到重新测试的结果有所改变。

我们的启示

对于长文档而言,更新并不等同于更好。 我们今年夏天拒绝晋升的两款模型都比保留通道的模型更新。一个模型在单个 Token 上可能更聪明,但仍可能因为吞吐量衰减曲线而在长文档生成中败下阵来。

吞吐量衰减是需要警惕的失效模式。 危险的模型不会报错。它们会随着文档的增长而变慢,超出流式传输预算,最终流式传输结束时,只留下一个看起来完整但实际上只完成了一半的文档。我们修改了 NextDocs,使其能够检测到异常中断的流并拒绝保存被截断的结果,这就是为什么长文档现在要么完成,要么明确报错,而绝不会无声无息地失败。

详尽是有代价的。 在这五款模型中,Sonnet 4.6 撰写的文档内容最丰富、篇幅也最长。对于一份 40 页的报告,这可能正是你想要的。但对于一个 10 页的幻灯片,你可能更希望使用 Luna,以便早点下班享受下午时光。这就是为什么我们的分级体系有不同的通道,而不是只使用单一模型。

每次晋升前必须进行测试。 Gemini 3.8 Flash 能在一天内获得它的通道,是因为我们的准入测试是可重复的。同理,Sonnet 5 也因为这个测试失去了它本可以获得的通道。固定的测试是让你在保持高效的同时避免鲁莽的法宝。

这对您意味着什么

您无需操心这些细节。只需选择一种模式,我们的分级系统就会自动为您匹配最合适的模型:

  • 极速(Fast):适用于草稿和短文档。
  • 优质(Quality):适用于任何需要保持章节一致性的内容。
  • 尊享(Premium)(适用于 Pro+ 和 Ultra 计划):适用于深度重于时间成本的写作任务。

或者,您也可以在模型选择器中进行明确选择。如果您想自己运行此测试,多变体生成功能允许您同时向多个模型发送同一个提示词,并并排比较生成的完整文档。这是您在没有实验室的情况下,能进行的最接近公平对决的测试方式。

如果您最想对比的是最新的 GPT-6 Astra 和 Claude Fable 5.1,它们目前尚未集成到 NextDocs 中。不过,Shyne 桌面应用可以在您自己的 Claude Code 或 Codex 订阅上运行其智能体,这是目前让他们处理真实文档最快捷的方式。

在 NextDocs 中体验模型选择器


NextDocs 团队