وبلاگ‌ها
AI ModelsBenchmarksLong documentsClaudeGeminiGPT-5.6

ما پنج مدل را روی یک سند ۲۲ صفحه‌ای یکسان اجرا کردیم. این چیزی است که یاد گرفتیم.

6 min
ما پنج مدل را روی یک سند ۲۲ صفحه‌ای یکسان اجرا کردیم. این چیزی است که یاد گرفتیم.

ما پنج مدل را روی یک سند ۲۲ صفحه‌ای یکسان اجرا کردیم. این چیزی است که یاد گرفتیم.

هر چند هفته یک‌بار، مدل جدیدی همراه با یک نمودار بنچمارک معرفی می‌شود. اما هیچ‌کدام از آن نمودارها مهم‌ترین نیاز یک ابزار تولید سند را نمی‌سنجند: آیا مدل می‌تواند یک سند طولانی و ساختاریافته را تا انتها بنویسد، آن هم با سرعتی که کاربر منتظرش بماند، بدون اینکه در میانه راه بی‌سروصدا متوقف شود؟

بنابراین ما آزمون اختصاصی خود را طراحی کردیم و هر مدلی قبل از اینکه در NextDocs به کار گرفته شود، باید از این فیلتر عبور کند. این پست به توضیح این آزمون و عملکرد پنج مدل فعلی در آن می‌پردازد. برخی از نتایج ما را شگفت‌زده کرد.

فیلتر ارزیابی

ما یک پرامپت واقعی را از محیط عملیاتی (production) انتخاب کردیم: درخواستی که یک سند ۲۲ صفحه‌ای شامل بخش‌ها، جدول‌ها و ساختاری مشخص تولید کرده بود. ما این پرامپت را روی مدل کاندید با همان بودجه تولیدی که در محصول واقعی استفاده می‌شود اجرا می‌کنیم و سه مورد را زیر نظر می‌گیریم:

  1. آیا کار را تمام کرد؟ تمام ۲۲ صفحه را نوشت، یا اینکه در میانه‌ی یک بخش بدون هیچ خطایی متوقف شد؟
  2. چقدر طول کشید؟ NextDocs سند را هم‌زمان با نوشته شدن استریم می‌کند و کاربر در حال تماشای آن است. مدلی که کار را در دو دقیقه تمام می‌کند با مدلی که ده دقیقه زمان می‌برد، محصول یکسانی نیستند.
  3. آیا سرعت تولید (throughput) ثابت ماند؟ برخی از مدل‌ها سریع شروع می‌کنند اما با افزایش حجم خروجی، کند می‌شوند. این الگو همان چیزی است که یک سند طولانی را به یک سند ناقص و نصفه‌کاره تبدیل می‌کند.

مدلی که در هر یک از این سه مورد مردود شود، ارتقا نمی‌یابد؛ هرچقدر هم که نمودار بنچمارک آن عالی به نظر برسد.

عملکرد پنج مدل

GPT-5.6 Luna (محصول OpenAI، اجرا شده روی Azure AI Foundry). تمام ۲۲ صفحه را در سریع‌ترین اجراها در کمتر از دو دقیقه به پایان رساند. سرعت تولید از صفحه اول تا آخر ثابت بود. به همین دلیل است که Luna جایگاه مسیر سریع (fast lane) را در تمام پلن‌ها به خود اختصاص داده است.

Gemini 3.5 Flash (محصول Google). تمام ۲۲ صفحه را در مدت‌زمانی کمی بیشتر از دو دقیقه به پایان رساند. این مدل در بیشتر طول تابستان جایگاه مسیر کیفیت (quality lane) را در اختیار داشت.

Gemini 3.8 Flash (محصول Google، منتشر شده در ۲ سپتامبر). ظرف یک روز پس از انتشار، از همین فیلتر ارزیابی عبور کرد و در ۳ سپتامبر به مسیر کیفیت ارتقا یافت. این چهارمین نسل از سری Flash در چهار ماه گذشته بود و اولین مدلی بود که ظرف ۲۴ ساعت به آن مهاجرت کردیم.

Claude Sonnet 4.6 (محصول Anthropic). تمام ۲۲ صفحه را به پایان رساند، اما تقریباً از تمام بودجه تولید برای این کار استفاده کرد و بسیار بیشتر از هر مدل دیگری نوشت (حدود ۱۷۰,۰۰۰ کاراکتر). شروع آن کند نیست و دچار افت سرعت هم نمی‌شود؛ بلکه صرفاً بسیار دقیق و مفصل می‌نویسد. این ویژگی آن را به یک نویسنده پرمیوم فوق‌العاده تبدیل می‌کند؛ مدلی که ما در اسناد بسیار طولانی به‌دقت آن را زیر نظر داریم، زیرا یک درخواست کمی طولانی‌تر می‌تواند آن را از سقف بودجه فراتر ببرد.

Claude Sonnet 5 (محصول Anthropic، منتشر شده در ۳۰ ژوئن). این مورد غافلگیرکننده بود. Sonnet 5 جدیدتر و ارزان‌تر از Sonnet 4.6 است و بنچمارک‌های عامل‌محور (agentic) آن بهتر است. اما در فیلتر ارزیابی ما، پس از حدود هشت دقیقه در صفحه ۱۶ از ۲۲ صفحه، در میانه‌ی یک بخش و بدون هیچ خطایی متوقف شد. این دقیقاً نشانه همان باگ قطع ناگهانی (truncation bug) است که کل ماه جولای را صرف برطرف کردنش کردیم. بنابراین Sonnet 5 وارد چرخه نشد و Sonnet 4.6 مسیر پرمیوم را حفظ می‌کند تا زمانی که آزمایش مجدد خلاف آن را ثابت کند.

آنچه یاد گرفتیم

جدیدتر بودن لزوماً به معنای بهتر بودن برای اسناد طولانی نیست. هر دو مدلی که در تابستان امسال از ارتقای آن‌ها خودداری کردیم، جدیدتر از مدل‌هایی بودند که جایگاه خود را حفظ کردند. یک مدل می‌تواند به ازای هر توکن هوشمندتر باشد، اما همچنان در یک سند طولانی به دلیل افت سرعت تولید شکست بخورد.

افت سرعت تولید (Throughput decay) همان حالت خطایی است که باید مراقبش بود. مدل‌های خطرناک خطا نمی‌دهند. آن‌ها با بزرگ‌تر شدن سند کند می‌شوند، از بودجه استریم فراتر می‌روند و استریم با یک سند نیمه‌کاره که کامل به نظر می‌رسد به پایان می‌رسد. ما NextDocs را تغییر دادیم تا استریم‌های قطع‌شده را شناسایی کرده و از ذخیره نتیجه ناقص خودداری کند؛ به همین دلیل است که اسناد طولانی اکنون یا با موفقیت به پایان می‌رسند یا با صدای بلند شکست می‌خورند، و هرگز بی‌سروصدا متوقف نمی‌شوند.

دقت و تفصیل هزینه دارد. Sonnet 4.6 غنی‌ترین و طولانی‌ترین اسناد را در میان این پنج مدل می‌نویسد. برای یک گزارش ۴۰ صفحه‌ای، احتمالاً دقیقاً همین را می‌خواهید. اما برای یک ارائه ۱۰ اسلایدی، ترجیح می‌دهید از Luna استفاده کنید و بقیه بعدازظهر خود را ذخیره کنید. به همین دلیل است که سیستم ما به جای یک مدل واحد، دارای مسیرهای مختلفی است.

همیشه قبل از ارتقا تست کنید. Gemini 3.8 Flash ظرف یک روز جایگاه خود را به دست آورد زیرا فیلتر ارزیابی ما تکرارپذیر است. Sonnet 5 نیز به همین دلیل جایگاهی را که می‌توانست داشته باشد از دست داد. یک آزمون ثابت، راهی است برای اینکه بدون بی‌احتیاطی، سریع بمانید.

این موضوع چه تأثیری روی شما دارد؟

نیازی نیست نگران هیچ‌کدام از این مسائل باشید. کافی است یک حالت (mode) را انتخاب کنید تا سیستم مدل مناسب را برگزیند:

  • سریع (Fast) برای پیش‌نویس‌ها و اسناد کوتاه.
  • با کیفیت (Quality) برای هر چیزی که دارای بخش‌های مختلف است و باید یکپارچگی خود را حفظ کند.
  • پرمیوم (Premium)، در پلن‌های Pro+ و Ultra، برای نگارشی که عمق مطلب در آن مهم‌تر از زمان است.

یا می‌توانید مدل را به‌طور مستقیم در بخش انتخاب‌گر مدل (model picker) انتخاب کنید. و اگر می‌خواهید نسخه خودتان را از این تست اجرا کنید، قابلیت تولید چندمتغیره (multi-variant generation) به شما امکان می‌دهد یک پرامپت را هم‌زمان به چندین مدل بفرستید و اسناد کامل را در کنار هم مقایسه کنید. این نزدیک‌ترین چیز به یک رقابت عادلانه است که می‌توانید بدون نیاز به آزمایشگاه اجرا کنید.

اگر مدل‌هایی که بیشتر مایل به مقایسه آن‌ها هستید جدیدترین‌ها یعنی GPT-6 Astra و Claude Fable 5.1 هستند، آن‌ها هنوز در NextDocs در دسترس نیستند. اپلیکیشن دسکتاپ Shyne می‌تواند عامل خود را روی اشتراک Claude Code یا Codex خودتان اجرا کند، که سریع‌ترین راه برای به‌کارگیری آن‌ها روی اسناد واقعی در حال حاضر است.

انتخاب‌گر مدل را در NextDocs امتحان کنید


تیم NextDocs

مطالب مرتبط

موج مدل‌های سپتامبر ۲۰۲۶، به زبان ساده برای تولیدکنندگان اسناد

موج مدل‌های سپتامبر ۲۰۲۶، به زبان ساده برای تولیدکنندگان اسناد

مدل‌های GPT-6 Astra، Claude Fable 5.1، Gemini 3.8 Flash و Kimi K3 همگی با فاصله چند هفته از یکدیگر معرفی شدند. در این مطلب بررسی می‌کنیم که هر کدام برای ساخت اسلایدها و اسناد چه کاربردی دارند، هزینه آن‌ها چقدر است، NextDocs امروز از کدام‌یک استفاده می‌کند و چگونه می‌توان از جدیدترین آن‌ها از طریق Shyne استفاده کرد.

ادامه مطلب
اسناد صد صفحه‌ای که واقعاً به پایان می‌رسند

اسناد صد صفحه‌ای که واقعاً به پایان می‌رسند

اسناد طولانی جایی بودند که تولید محتوا توسط هوش مصنوعی بیشترین شکست را در آن‌ها داشت، معمولاً نزدیک به پایان و معمولاً در سکوت. در اینجا توضیح می‌دهیم که NextDocs چگونه یک سند طولانی را به زبان ساده تولید می‌کند، چه تغییراتی در نسخه v1.11.1 ایجاد شده تا فرآیندها یا کامل شوند یا با صدای بلند (با خطا) متوقف شوند، و زمانی که به ۱۰۰ صفحه نیاز دارید چه باید بکنید.

ادامه مطلب
معرفی تولید چند‌متغیره — NextDocs نسخه ۱.۴

معرفی تولید چند‌متغیره — NextDocs نسخه ۱.۴

تولید همزمان تا ۴ نسخه مختلف از سند. مقایسه رویکردهای متفاوت

ادامه مطلب