المدونات
AI ModelsBenchmarksLong documentsClaudeGeminiGPT-5.6

قمنا بتشغيل خمسة نماذج على نفس المستند المكون من 22 صفحة. إليك ما تعلمناه.

5 min
قمنا بتشغيل خمسة نماذج على نفس المستند المكون من 22 صفحة. إليك ما تعلمناه.

قمنا بتشغيل خمسة نماذج على نفس المستند المكون من 22 صفحة. إليك ما تعلمناه.

كل بضعة أسابيع، يظهر نموذج جديد مصحوبًا بمخطط اختبار أداء (benchmark). ولكن لا أحد من هذه المخططات يقيس الشيء الأكثر أهمية لأداة معالجة المستندات: هل يستطيع النموذج كتابة مستند طويل ومنظم حتى النهاية، وبسرعة يتقبلها المستخدم البشري، دون أن يتوقف فجأة وبصمت في منتصف الطريق؟

لذلك، قمنا ببناء اختبارنا الخاص، ويجب على كل نموذج اجتيازه قبل أن يحصل على مسار في NextDocs. يشرح هذا المنشور هذا الاختبار وما حققته خمسة نماذج حالية فيه. لقد فاجأتنا بعض النتائج.

بوابة الاختبار

لقد أخذنا أمرًا (prompt) حقيقيًا من بيئة الإنتاج: طلبًا أنتج مستندًا مكونًا من 22 صفحة، يحتوي على أقسام وجداول وهيكل محدد. نقوم بإعادة تشغيله على النموذج المرشح بنفس ميزانية التوليد التي يستخدمها المنتج، ونراقب ثلاثة أشياء:

  1. هل أكمل العمل؟ هل أنهى الصفحات الـ 22 كاملة، أم توقف في منتصف أحد العناصر دون إظهار أي خطأ؟
  2. كم من الوقت استغرق؟ يقوم NextDocs ببث المستند أثناء كتابته، ويكون المستخدم في حالة انتظار ومراقبة. النموذج الذي ينتهي في دقيقتين والآخر الذي ينتهي في عشر دقائق لا يمثلان نفس جودة المنتج.
  3. هل استمر معدل الإنتاجية بثبات؟ تبدأ بعض النماذج بسرعة ثم تتباطأ مع زيادة حجم المخرجات. هذا النمط هو ما يحول المستند الطويل إلى مستند مبتور.

النموذج الذي يفشل في أي من هذه المعايير الثلاثة لا يتم ترقيته، بغض النظر عن مدى جودة مخطط اختبار الأداء الخاص به.

ما حققته النماذج الخمسة

GPT-5.6 Luna (من OpenAI، يعمل على Azure AI Foundry). أنهى جميع الصفحات الـ 22 في أقل من دقيقتين في أسرع جولات التشغيل. تميز بمعدل إنتاجية ثابت من الصفحة الأولى وحتى الأخيرة. هذا هو السبب في أن Luna يحتفظ بالمسار السريع في كل خطة اشتراك.

Gemini 3.5 Flash (من Google). أنهى جميع الصفحات الـ 22 في ما يزيد قليلاً عن دقيقتين. واحتفظ بمسار الجودة لمعظم فترة الصيف.

Gemini 3.8 Flash (من Google، تم إصداره في 2 سبتمبر). اجتاز نفس البوابة في غضون يوم واحد من إصداره وتمت ترقيته إلى مسار الجودة في 3 سبتمبر. وهو الجيل الرابع من Flash خلال أربعة أشهر، والأول الذي ننتقل إليه في غضون 24 ساعة.

Claude Sonnet 4.6 (من Anthropic). أنهى جميع الصفحات الـ 22، ولكنه استهلك ميزانية التوليد بالكامل تقريبًا للقيام بذلك، وكتب أكثر بكثير من أي نموذج آخر، حوالي 170,000 حرف. إنه ليس بطيئًا في البداية ولا يتراجع أداؤه؛ بل هو ببساطة دقيق وشامل للغاية. هذا يجعله كاتبًا متميزًا وممتازًا ونموذجًا نراقبه عن كثب في المستندات الطويلة جدًا، لأن أي طلب أطول قليلاً قد يدفعه لتجاوز الميزانية المحددة.

Claude Sonnet 5 (من Anthropic، تم إصداره في 30 يونيو). كانت هذه هي المفاجأة. إن Sonnet 5 أحدث وأرخص من Sonnet 4.6، كما أن نتائج اختبارات الأداء القائمة على الوكلاء (agentic benchmarks) الخاصة به أفضل. ومع ذلك، في اختبار البوابة الخاص بنا، توقف عند الصفحة 16 من أصل 22 صفحة بعد حوالي ثماني دقائق، في منتصف أحد العناصر، ودون أي خطأ. هذا هو السلوك النموذجي لخلل البتر (truncation bug) الذي قضينا شهر يوليو في التخلص منه. لذلك، لم يتم إدراج Sonnet 5 في تصنيفنا، ويحتفظ Sonnet 4.6 بالمسار المميز (premium lane) حتى يثبت اختبار إعادة التقييم عكس ذلك.

ما تعلمناه

الأحدث ليس مرادفًا للأفضل دائمًا في المستندات الطويلة. كلا النموذجين اللذين رفضنا ترقيتهما هذا الصيف كانا أحدث من النموذجين اللذين حافظا على مساريهما. يمكن للنموذج أن يكون أكثر ذكاءً لكل رمز (token) ومع ذلك يفشل في إنهاء مستند طويل بسبب تراجع منحنى الإنتاجية.

تراجع الإنتاجية هو نمط الفشل الذي يجب الحذر منه. النماذج الخطيرة لا تظهر أخطاءً. بل تتباطأ مع نمو المستند، وتتجاوز ميزانية البث، وينتهي البث بمستند نصف مكتمل يبدو للوهلة الأولى كاملاً. لقد قمنا بتعديل NextDocs لاكتشاف البث المجهض ورفض حفظ النتيجة المبتورة، وهذا هو السبب في أن المستندات الطويلة تنتهي الآن أو تفشل بشكل واضح، وليس بصمت أبدًا.

الدقة والشمولية لهما ثمن. يكتب Sonnet 4.6 المستندات الأكثر ثراءً وطولاً بين النماذج الخمسة. لتقرير مكون من 40 صفحة، قد يكون هذا هو ما تحتاجه تمامًا. أما بالنسبة لعرض تقديمي من عشر شرائح، فستفضل استخدام Luna لتوفير وقتك وبقية يومك. لهذا السبب يحتوي تصنيفنا على مسارات متعددة بدلاً من نموذج واحد فقط.

الاختبار قبل الترقية، في كل مرة. حصل Gemini 3.8 Flash على مساره في يوم واحد لأن اختبار البوابة قابل للتكرار. وخسر Sonnet 5 مسارًا كان سيحصل عليه لولا ذلك لنفس السبب. الاختبار الثابت هو وسيلتك للحفاظ على السرعة دون تسرع.

كيف يصلك هذا

لا داعي للقلق بشأن أي من هذا. ما عليك سوى اختيار الوضع، وسيتولى نظامنا اختيار النموذج المناسب:

  • السريع (Fast) للمسودات والمستندات القصيرة.
  • الجودة (Quality) لأي مستند يحتوي على أقسام يجب أن تظل متناسقة.
  • المميز (Premium)، في باقتي Pro+ وUltra، للكتابة التي يهم فيها العمق أكثر من الوقت.

أو يمكنك الاختيار صراحةً من أداة اختيار النموذج. وإذا كنت ترغب في تشغيل نسختك الخاصة من هذا الاختبار، فإن ميزة التوليد متعدد المتغيرات تتيح لك إرسال أمر واحد إلى عدة نماذج في وقت واحد ومقارنة المستندات الكاملة جنبًا إلى جنب. إنه أقرب شيء لمقارنة عادلة يمكنك إجراؤها دون الحاجة إلى مختبر.

إذا كانت النماذج التي ترغب في مقارنتها هي الأحدث على الإطلاق، مثل GPT-6 Astra وClaude Fable 5.1، فهي ليست متوفرة في NextDocs بعد. ولكن يمكن لتطبيق Shyne لسطح المكتب تشغيل وكيله على اشتراكك الخاص في Claude Code أو Codex، وهي الطريقة الأسرع لتشغيلها على مستندات حقيقية اليوم.

جرب أداة اختيار النموذج في NextDocs


فريق NextDocs