هر چند هفته یکبار، مدل جدیدی همراه با یک نمودار بنچمارک معرفی میشود. اما هیچکدام از آن نمودارها مهمترین نیاز یک ابزار تولید سند را نمیسنجند: آیا مدل میتواند یک سند طولانی و ساختاریافته را تا انتها بنویسد، آن هم با سرعتی که کاربر منتظرش بماند، بدون اینکه در میانه راه بیسروصدا متوقف شود؟
بنابراین ما آزمون اختصاصی خود را طراحی کردیم و هر مدلی قبل از اینکه در NextDocs به کار گرفته شود، باید از این فیلتر عبور کند. این پست به توضیح این آزمون و عملکرد پنج مدل فعلی در آن میپردازد. برخی از نتایج ما را شگفتزده کرد.
ما یک پرامپت واقعی را از محیط عملیاتی (production) انتخاب کردیم: درخواستی که یک سند ۲۲ صفحهای شامل بخشها، جدولها و ساختاری مشخص تولید کرده بود. ما این پرامپت را روی مدل کاندید با همان بودجه تولیدی که در محصول واقعی استفاده میشود اجرا میکنیم و سه مورد را زیر نظر میگیریم:
مدلی که در هر یک از این سه مورد مردود شود، ارتقا نمییابد؛ هرچقدر هم که نمودار بنچمارک آن عالی به نظر برسد.
GPT-5.6 Luna (محصول OpenAI، اجرا شده روی Azure AI Foundry). تمام ۲۲ صفحه را در سریعترین اجراها در کمتر از دو دقیقه به پایان رساند. سرعت تولید از صفحه اول تا آخر ثابت بود. به همین دلیل است که Luna جایگاه مسیر سریع (fast lane) را در تمام پلنها به خود اختصاص داده است.
Gemini 3.5 Flash (محصول Google). تمام ۲۲ صفحه را در مدتزمانی کمی بیشتر از دو دقیقه به پایان رساند. این مدل در بیشتر طول تابستان جایگاه مسیر کیفیت (quality lane) را در اختیار داشت.
Gemini 3.8 Flash (محصول Google، منتشر شده در ۲ سپتامبر). ظرف یک روز پس از انتشار، از همین فیلتر ارزیابی عبور کرد و در ۳ سپتامبر به مسیر کیفیت ارتقا یافت. این چهارمین نسل از سری Flash در چهار ماه گذشته بود و اولین مدلی بود که ظرف ۲۴ ساعت به آن مهاجرت کردیم.
Claude Sonnet 4.6 (محصول Anthropic). تمام ۲۲ صفحه را به پایان رساند، اما تقریباً از تمام بودجه تولید برای این کار استفاده کرد و بسیار بیشتر از هر مدل دیگری نوشت (حدود ۱۷۰,۰۰۰ کاراکتر). شروع آن کند نیست و دچار افت سرعت هم نمیشود؛ بلکه صرفاً بسیار دقیق و مفصل مینویسد. این ویژگی آن را به یک نویسنده پرمیوم فوقالعاده تبدیل میکند؛ مدلی که ما در اسناد بسیار طولانی بهدقت آن را زیر نظر داریم، زیرا یک درخواست کمی طولانیتر میتواند آن را از سقف بودجه فراتر ببرد.
Claude Sonnet 5 (محصول Anthropic، منتشر شده در ۳۰ ژوئن). این مورد غافلگیرکننده بود. Sonnet 5 جدیدتر و ارزانتر از Sonnet 4.6 است و بنچمارکهای عاملمحور (agentic) آن بهتر است. اما در فیلتر ارزیابی ما، پس از حدود هشت دقیقه در صفحه ۱۶ از ۲۲ صفحه، در میانهی یک بخش و بدون هیچ خطایی متوقف شد. این دقیقاً نشانه همان باگ قطع ناگهانی (truncation bug) است که کل ماه جولای را صرف برطرف کردنش کردیم. بنابراین Sonnet 5 وارد چرخه نشد و Sonnet 4.6 مسیر پرمیوم را حفظ میکند تا زمانی که آزمایش مجدد خلاف آن را ثابت کند.
جدیدتر بودن لزوماً به معنای بهتر بودن برای اسناد طولانی نیست. هر دو مدلی که در تابستان امسال از ارتقای آنها خودداری کردیم، جدیدتر از مدلهایی بودند که جایگاه خود را حفظ کردند. یک مدل میتواند به ازای هر توکن هوشمندتر باشد، اما همچنان در یک سند طولانی به دلیل افت سرعت تولید شکست بخورد.
افت سرعت تولید (Throughput decay) همان حالت خطایی است که باید مراقبش بود. مدلهای خطرناک خطا نمیدهند. آنها با بزرگتر شدن سند کند میشوند، از بودجه استریم فراتر میروند و استریم با یک سند نیمهکاره که کامل به نظر میرسد به پایان میرسد. ما NextDocs را تغییر دادیم تا استریمهای قطعشده را شناسایی کرده و از ذخیره نتیجه ناقص خودداری کند؛ به همین دلیل است که اسناد طولانی اکنون یا با موفقیت به پایان میرسند یا با صدای بلند شکست میخورند، و هرگز بیسروصدا متوقف نمیشوند.
دقت و تفصیل هزینه دارد. Sonnet 4.6 غنیترین و طولانیترین اسناد را در میان این پنج مدل مینویسد. برای یک گزارش ۴۰ صفحهای، احتمالاً دقیقاً همین را میخواهید. اما برای یک ارائه ۱۰ اسلایدی، ترجیح میدهید از Luna استفاده کنید و بقیه بعدازظهر خود را ذخیره کنید. به همین دلیل است که سیستم ما به جای یک مدل واحد، دارای مسیرهای مختلفی است.
همیشه قبل از ارتقا تست کنید. Gemini 3.8 Flash ظرف یک روز جایگاه خود را به دست آورد زیرا فیلتر ارزیابی ما تکرارپذیر است. Sonnet 5 نیز به همین دلیل جایگاهی را که میتوانست داشته باشد از دست داد. یک آزمون ثابت، راهی است برای اینکه بدون بیاحتیاطی، سریع بمانید.
نیازی نیست نگران هیچکدام از این مسائل باشید. کافی است یک حالت (mode) را انتخاب کنید تا سیستم مدل مناسب را برگزیند:
یا میتوانید مدل را بهطور مستقیم در بخش انتخابگر مدل (model picker) انتخاب کنید. و اگر میخواهید نسخه خودتان را از این تست اجرا کنید، قابلیت تولید چندمتغیره (multi-variant generation) به شما امکان میدهد یک پرامپت را همزمان به چندین مدل بفرستید و اسناد کامل را در کنار هم مقایسه کنید. این نزدیکترین چیز به یک رقابت عادلانه است که میتوانید بدون نیاز به آزمایشگاه اجرا کنید.
اگر مدلهایی که بیشتر مایل به مقایسه آنها هستید جدیدترینها یعنی GPT-6 Astra و Claude Fable 5.1 هستند، آنها هنوز در NextDocs در دسترس نیستند. اپلیکیشن دسکتاپ Shyne میتواند عامل خود را روی اشتراک Claude Code یا Codex خودتان اجرا کند، که سریعترین راه برای بهکارگیری آنها روی اسناد واقعی در حال حاضر است.
انتخابگر مدل را در NextDocs امتحان کنید
تیم NextDocs

مدلهای GPT-6 Astra، Claude Fable 5.1، Gemini 3.8 Flash و Kimi K3 همگی با فاصله چند هفته از یکدیگر معرفی شدند. در این مطلب بررسی میکنیم که هر کدام برای ساخت اسلایدها و اسناد چه کاربردی دارند، هزینه آنها چقدر است، NextDocs امروز از کدامیک استفاده میکند و چگونه میتوان از جدیدترین آنها از طریق Shyne استفاده کرد.
ادامه مطلب
اسناد طولانی جایی بودند که تولید محتوا توسط هوش مصنوعی بیشترین شکست را در آنها داشت، معمولاً نزدیک به پایان و معمولاً در سکوت. در اینجا توضیح میدهیم که NextDocs چگونه یک سند طولانی را به زبان ساده تولید میکند، چه تغییراتی در نسخه v1.11.1 ایجاد شده تا فرآیندها یا کامل شوند یا با صدای بلند (با خطا) متوقف شوند، و زمانی که به ۱۰۰ صفحه نیاز دارید چه باید بکنید.
ادامه مطلب
تولید همزمان تا ۴ نسخه مختلف از سند. مقایسه رویکردهای متفاوت
ادامه مطلب