Cứ vài tuần lại có một mô hình mới ra mắt kèm theo biểu đồ điểm chuẩn (benchmark). Không có biểu đồ nào trong số đó đo lường được điều mà một công cụ xử lý tài liệu cần nhất: liệu mô hình có thể viết một tài liệu dài, có cấu trúc từ đầu đến cuối, với tốc độ mà người dùng có thể kiên nhẫn chờ đợi, mà không đột ngột dừng lại giữa chừng hay không?
Vì vậy, chúng tôi đã xây dựng bài kiểm tra của riêng mình và mọi mô hình đều phải vượt qua bài kiểm tra này trước khi được đưa vào sử dụng trong NextDocs. Bài viết này sẽ giải thích về bài kiểm tra đó và kết quả thực hiện của năm mô hình hiện tại. Một số kết quả đã làm chúng tôi ngạc nhiên.
Chúng tôi đã lấy một prompt thực tế từ môi trường production: một yêu cầu đã từng tạo ra một tài liệu dài 22 trang, có các phần, bảng biểu và cấu trúc cụ thể. Chúng tôi chạy lại yêu cầu đó với mô hình ứng viên bằng cùng một mức giới hạn tài nguyên (generation budget) mà sản phẩm thực tế sử dụng, và chúng tôi theo dõi ba yếu tố:
Một mô hình thất bại ở bất kỳ tiêu chí nào trong ba tiêu chí trên sẽ không được thăng cấp, bất kể biểu đồ điểm chuẩn của nó trông đẹp đẽ đến thế nào.
GPT-5.6 Luna (OpenAI, chạy trên Azure AI Foundry). Hoàn thành toàn bộ 22 trang, trong chưa đầy hai phút ở những lượt chạy nhanh nhất. Băng thông nhất quán từ trang đầu tiên đến trang cuối cùng. Đây là lý do tại sao Luna giữ luồng tốc độ cao (fast lane) cho mọi gói dịch vụ.
Gemini 3.5 Flash (Google). Hoàn thành toàn bộ 22 trang trong hơn hai phút một chút. Đã giữ luồng chất lượng (quality lane) trong hầu hết mùa hè.
Gemini 3.8 Flash (Google, ra mắt ngày 2 tháng 9). Vượt qua cùng một vòng kiểm duyệt trong vòng một ngày kể từ khi ra mắt và được thăng cấp lên luồng chất lượng vào ngày 3 tháng 9. Đây là thế hệ Flash thứ tư trong bốn tháng, và là thế hệ đầu tiên chúng tôi chuyển sang sử dụng trong vòng 24 giờ.
Claude Sonnet 4.6 (Anthropic). Hoàn thành toàn bộ 22 trang, nhưng đã sử dụng gần như toàn bộ giới hạn tài nguyên để làm việc đó, và viết nhiều hơn bất kỳ mô hình nào khác, khoảng 170.000 ký tự. Nó không bắt đầu chậm và không bị giảm hiệu suất; nó chỉ đơn giản là cực kỳ tỉ mỉ. Điều đó khiến nó trở thành một cây viết cao cấp tuyệt vời và là mô hình chúng tôi theo dõi sát sao đối với các tài liệu rất dài, bởi vì một yêu cầu dài hơn một chút có thể đẩy nó vượt quá giới hạn tài nguyên.
Claude Sonnet 5 (Anthropic, ra mắt ngày 30 tháng 6). Đây là một bất ngờ lớn. Sonnet 5 mới hơn và rẻ hơn Sonnet 4.6, và các điểm chuẩn về tác vụ tự trị (agentic benchmarks) của nó tốt hơn. Tại vòng kiểm duyệt của chúng tôi, nó đã dừng lại ở trang 16 trên 22 sau khoảng tám phút, ngay giữa chừng một thành phần, mà không có lỗi nào. Đó chính xác là dấu hiệu của lỗi cắt xén (truncation bug) mà chúng tôi đã dành cả tháng 7 để loại bỏ. Vì vậy, Sonnet 5 không được xếp hạng, và Sonnet 4.6 tiếp tục giữ luồng cao cấp (premium lane) cho đến khi có kết quả kiểm tra lại.
Mới hơn không đồng nghĩa với tốt hơn đối với các tài liệu dài. Cả hai mô hình mà chúng tôi từ chối thăng cấp trong mùa hè này đều mới hơn những mô hình giữ được luồng của chúng. Một mô hình có thể thông minh hơn trên mỗi token nhưng vẫn thất bại khi xử lý tài liệu dài do đường cong băng thông giảm dần.
Sự suy giảm băng thông là lỗi cần chú ý nhất. Các mô hình nguy hiểm không hề báo lỗi. Chúng chậm lại khi tài liệu dài ra, vượt quá giới hạn truyền phát, và quá trình truyền phát kết thúc với một tài liệu dở dang trông có vẻ như đã hoàn thành. Chúng tôi đã thay đổi NextDocs để phát hiện luồng truyền phát bị hủy và từ chối lưu kết quả bị cắt xén, đó là lý do tại sao các tài liệu dài bây giờ sẽ hoàn thành hoặc thất bại một cách rõ ràng, chứ không bao giờ im lặng.
Sự tỉ mỉ luôn có giá của nó. Sonnet 4.6 viết ra những tài liệu phong phú nhất và dài nhất trong số năm mô hình. Đối với một báo cáo dài 40 trang, bạn có thể muốn chính xác điều đó. Nhưng đối với một slide thuyết trình mười trang, bạn sẽ muốn chọn Luna để tiết kiệm thời gian cho buổi chiều của mình. Đó là lý do tại sao hệ thống phân cấp có nhiều luồng thay vì chỉ một mô hình duy nhất.
Luôn kiểm tra trước khi thăng cấp. Gemini 3.8 Flash đã giành được luồng của mình chỉ trong một ngày vì vòng kiểm duyệt có thể lặp lại một cách nhất quán. Sonnet 5 đã mất đi luồng mà lẽ ra nó đã có vì cùng một lý do. Một bài kiểm tra cố định là cách giúp bạn tiến nhanh mà không liều lĩnh.
Bạn không cần phải bận tâm về những điều này. Chỉ cần chọn một chế độ và hệ thống sẽ tự động chọn mô hình phù hợp:
Hoặc bạn có thể tự chọn mô hình trong trình chọn mô hình. Và nếu bạn muốn chạy thử nghiệm phiên bản của riêng mình, tính năng tạo đa biến thể (multi-variant generation) cho phép bạn gửi một prompt đến nhiều mô hình cùng một lúc và so sánh trực quan các tài liệu hoàn chỉnh cạnh nhau. Đây là cách gần nhất để thực hiện một cuộc so tài công bằng mà không cần đến phòng thí nghiệm.
Nếu các mô hình bạn muốn so sánh nhất là những mô hình mới nhất, GPT-6 Astra và Claude Fable 5.1, thì chúng vẫn chưa có mặt trên NextDocs. Ứng dụng máy tính Shyne có thể chạy tác nhân của nó trên gói đăng ký Claude Code hoặc Codex của riêng bạn, đây là cách nhanh nhất để đưa chúng vào xử lý các tài liệu thực tế hiện nay.
Trải nghiệm trình chọn mô hình trong NextDocs
Đội ngũ NextDocs

GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash và Kimi K3 đều đồng loạt ra mắt chỉ trong vòng vài tuần. Điểm mạnh của từng mô hình đối với slide thuyết trình và tài liệu, chi phí của chúng, những mô hình nào NextDocs đang chạy hiện nay, và cách sử dụng các mô hình mới nhất thông qua Shyne.
Đọc thêm
Tài liệu dài từng là nơi việc tạo nội dung bằng AI dễ thất bại nhất, thường là ở gần cuối và thường diễn ra trong im lặng. Dưới đây là cách NextDocs tạo ra một tài liệu dài bằng tiếng Anh giản dị, những thay đổi trong phiên bản v1.11.1 để quá trình chạy hoàn tất hoặc báo lỗi rõ ràng, và những việc cần làm khi bạn cần 100 trang.
Đọc thêm
Tạo cùng lúc lên đến 4 biến thể của tài liệu. So sánh các lựa chọn khác nhau
Đọc thêm