ब्लॉग्स
AI ModelsBenchmarksLong documentsClaudeGeminiGPT-5.6

हमने एक ही 22-पेज के दस्तावेज़ पर पांच मॉडलों का परीक्षण किया। यहाँ बताया गया है कि हमने क्या सीखा।

6 min
हमने एक ही 22-पेज के दस्तावेज़ पर पांच मॉडलों का परीक्षण किया। यहाँ बताया गया है कि हमने क्या सीखा।

हमने एक ही 22-पेज के दस्तावेज़ पर पांच मॉडलों का परीक्षण किया। यहाँ बताया गया है कि हमने क्या सीखा।

हर कुछ हफ़्तों में एक बेंचमार्क चार्ट के साथ एक नया मॉडल आता है। उन चार्टों में से कोई भी उस चीज़ को नहीं मापता जिसकी एक दस्तावेज़ टूल को सबसे अधिक आवश्यकता होती: क्या मॉडल बिना किसी रुकावट के, एक ऐसी गति से जिसे कोई व्यक्ति सहन कर सके, अंत तक एक लंबा, संरचित दस्तावेज़ लिख सकता है?

इसलिए हमने अपना खुद का परीक्षण बनाया, और NextDocs में जगह पाने से पहले हर मॉडल को इसे पास करना होगा। यह पोस्ट इस परीक्षण और इस पर पांच मौजूदा मॉडलों के प्रदर्शन के बारे में बताती है। कुछ परिणामों ने हमें हैरान कर दिया।

गेट

हमने प्रोडक्शन से एक वास्तविक प्रॉम्प्ट लिया: एक ऐसा अनुरोध जिसने अनुभागों (sections), तालिकाओं (tables) और एक विशिष्ट संरचना के साथ 22-पेज का दस्तावेज़ तैयार किया था। हम इसे उसी जनरेशन बजट के साथ एक उम्मीदवार मॉडल पर फिर से चलाते हैं जिसका उपयोग उत्पाद करता है, और हम तीन चीज़ों पर नज़र रखते हैं:

  1. क्या इसने काम पूरा किया? पूरे 22 पेज, या यह बिना किसी त्रुटि (error) के बीच में ही रुक गया?
  2. इसमें कितना समय लगा? NextDocs दस्तावेज़ को लिखते समय उसे स्ट्रीम करता है, और उपयोगकर्ता इसे देख रहा होता है। दो मिनट में समाप्त होने वाला मॉडल और दस मिनट में समाप्त होने वाला मॉडल एक समान उत्पाद नहीं हैं।
  3. क्या थ्रूपुट (throughput) स्थिर रहा? कुछ मॉडल तेज़ी से शुरू होते हैं और आउटपुट बढ़ने पर धीमे हो जाते हैं। यही पैटर्न एक लंबे दस्तावेज़ को अधूरा (truncated) छोड़ देता है।

इन तीनों में से किसी में भी विफल रहने वाले मॉडल को आगे नहीं बढ़ाया जाता है, चाहे उसका बेंचमार्क चार्ट कितना भी अच्छा क्यों न दिखे।

पांच मॉडलों ने क्या किया

GPT-5.6 Luna (OpenAI, Azure AI Foundry पर संचालित)। सबसे तेज़ रन में दो मिनट से भी कम समय में सभी 22 पेज पूरे किए। पहले पेज से लेकर आखिरी पेज तक लगातार थ्रूपुट। यही कारण है कि Luna हर प्लान के लिए फास्ट लेन (fast lane) पर काबिज़ है।

Gemini 3.5 Flash (Google)। दो मिनट से थोड़े अधिक समय में सभी 22 पेज पूरे किए। गर्मियों के अधिकांश समय में क्वालिटी लेन (quality lane) पर बनी रही।

Gemini 3.8 Flash (Google, 2 सितंबर को रिलीज़)। रिलीज़ के एक दिन के भीतर उसी गेट को पास किया और 3 सितंबर को क्वालिटी लेन में प्रमोट किया गया। चार महीनों में चौथी फ़्लैश जनरेशन, और पहली जिसे हमने 24 घंटों के भीतर अपनाया।

Claude Sonnet 4.6 (Anthropic)। सभी 22 पेज पूरे किए, लेकिन ऐसा करने में लगभग पूरे जनरेशन बजट का उपयोग किया, और किसी भी अन्य मॉडल की तुलना में कहीं अधिक, लगभग 170,000 अक्षर लिखे। यह शुरू होने में धीमा नहीं है और न ही इसका प्रदर्शन घटता है; यह केवल बेहद विस्तृत है। यह इसे एक बेहतरीन प्रीमियम लेखक और एक ऐसा मॉडल बनाता है जिस पर हम बहुत लंबे दस्तावेज़ों के लिए बारीकी से नज़र रखते हैं, क्योंकि थोड़ा लंबा अनुरोध भी इसे बजट से बाहर धकेल सकता है।

Claude Sonnet 5 (Anthropic, 30 जून को रिलीज़)। यह आश्चर्यजनक था। Sonnet 5, Sonnet 4.6 की तुलना में नया और सस्ता है, और इसके एजेंटिक बेंचमार्क बेहतर हैं। हमारे गेट पर यह लगभग आठ मिनट के बाद 22 में से 16 पेजों पर, बिना किसी त्रुटि के बीच में ही रुक गया। यह बिल्कुल उसी ट्रंकेशन बग (truncation bug) का संकेत है जिसे हमने जुलाई में ठीक करने में बिताया था। इसलिए Sonnet 5 को लैडर (ladder) में शामिल नहीं किया गया है, और Sonnet 4.6 प्रीमियम लेन में तब तक बना रहेगा जब तक कि दोबारा परीक्षण कुछ और न कहे।

हमने क्या सीखा

लंबे दस्तावेज़ों के लिए नया होना हमेशा बेहतर होने के समान नहीं होता है। इस गर्मी में जिन दो मॉडलों को हमने प्रमोट करने से मना कर दिया, वे दोनों उन मॉडलों से नए थे जिन्होंने अपनी लेन बरकरार रखी। एक मॉडल प्रति टोकन अधिक स्मार्ट हो सकता है और फिर भी थ्रूपुट कर्व (throughput curve) के कारण लंबे दस्तावेज़ में पिछड़ सकता है।

थ्रूपुट में गिरावट (Throughput decay) वह विफलता मोड है जिस पर नज़र रखनी चाहिए। खतरनाक मॉडल त्रुटि (error) नहीं दिखाते हैं। दस्तावेज़ बढ़ने के साथ वे धीमे हो जाते हैं, स्ट्रीमिंग बजट को पार कर जाते हैं, और स्ट्रीम एक आधे-अधूरे दस्तावेज़ के साथ समाप्त हो जाती है जो देखने में पूरा लगता है। हमने NextDocs को एक बाधित स्ट्रीम का पता लगाने और अधूरे परिणाम को सहेजने से इनकार करने के लिए बदल दिया है, यही कारण है कि लंबे दस्तावेज़ अब या तो पूरे होते हैं या स्पष्ट रूप से विफल हो जाते हैं, कभी भी चुपचाप नहीं।

विस्तृत होने की एक कीमत होती है। Sonnet 4.6 पांचों में से सबसे समृद्ध और सबसे लंबे दस्तावेज़ लिखता है। 40-पेज की रिपोर्ट के लिए आप शायद यही चाहेंगे। दस-स्लाइड के डेक के लिए आप Luna को चुनना पसंद करेंगे ताकि आपका दोपहर का समय बच सके। यही कारण है कि लैडर में केवल एक मॉडल के बजाय अलग-अलग लेन हैं।

हर बार प्रमोट करने से पहले परीक्षण करें। Gemini 3.8 Flash ने एक दिन में अपनी लेन हासिल कर ली क्योंकि गेट दोहराने योग्य (repeatable) है। Sonnet 5 ने इसी वजह से वह लेन खो दी जो अन्यथा उसे मिल जाती। एक निश्चित परीक्षण ही वह तरीका है जिससे आप बिना लापरवाह हुए तेज़ बने रह सकते हैं।

यह आप तक कैसे पहुँचता है

आपको इस बारे में सोचने की ज़रूरत नहीं है। बस एक मोड चुनें और लैडर मॉडल चुन लेता है:

  • ड्राफ्ट और छोटे दस्तावेज़ों के लिए Fast
  • किसी भी ऐसी चीज़ के लिए Quality जिसमें अनुभागों का सुसंगत रहना आवश्यक है।
  • Pro+ और Ultra पर Premium, ऐसे लेखन के लिए जहाँ समय से अधिक गहराई मायने रखती है।

या मॉडल पिकर में स्पष्ट रूप से चुनें। और यदि आप इस परीक्षण का अपना संस्करण चलाना चाहते हैं, तो मल्टी-वेरिएंट जनरेशन आपको एक ही बार में कई मॉडलों को एक प्रॉम्प्ट भेजने और पूरे दस्तावेज़ों की साथ-साथ तुलना करने की अनुमति देता है। यह बिना किसी लैब के एक निष्पक्ष तुलनात्मक परीक्षण (bake-off) चलाने के सबसे करीब है।

यदि जिन मॉडलों की आप सबसे अधिक तुलना करना चाहते हैं वे बिल्कुल नए हैं, जैसे GPT-6 Astra और Claude Fable 5.1, तो वे अभी तक NextDocs में नहीं हैं। Shyne डेस्कटॉप ऐप आपके खुद के Claude Code या Codex सब्सक्रिप्शन पर अपना एजेंट चला सकता है, जो आज उन्हें वास्तविक दस्तावेज़ों पर काम में लगाने का सबसे तेज़ तरीका है।

NextDocs में मॉडल पिकर आज़माएं


NextDocs टीम

संबंधित पोस्ट

सितंबर 2026 की मॉडल लहर, दस्तावेज़ बनाने वाले लोगों के लिए समझाई गई

सितंबर 2026 की मॉडल लहर, दस्तावेज़ बनाने वाले लोगों के लिए समझाई गई

GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash और Kimi K3 सभी कुछ ही हफ्तों के भीतर लॉन्च हुए हैं। डेक और दस्तावेज़ों के लिए इनमें से प्रत्येक किस चीज़ में बेहतर है, उनकी लागत क्या है, NextDocs आज इनमें से किसे चलाता है, और Shyne के माध्यम से बिल्कुल नए मॉडलों का उपयोग कैसे करें।

अधिक पढ़ें
सौ पन्नों के दस्तावेज़ जो वास्तव में पूरे होते हैं

सौ पन्नों के दस्तावेज़ जो वास्तव में पूरे होते हैं

लंबे दस्तावेज़ वे जगह थे जहाँ AI जनरेशन सबसे अधिक विफल रहा, आमतौर पर अंत के करीब और आमतौर पर चुपचाप। यहाँ बताया गया है कि NextDocs सरल अंग्रेज़ी में एक लंबा दस्तावेज़ कैसे जनरेट करता है, v1.11.1 में क्या बदलाव आया है ताकि रन पूरे हों या स्पष्ट रूप से विफल हों, और जब आपको 100 पन्नों की आवश्यकता हो तो क्या करें।

अधिक पढ़ें
मल्टीवेरिएंट जेनरेशन का परिचय — NextDocs v1.4

मल्टीवेरिएंट जेनरेशन का परिचय — NextDocs v1.4

एक ही समय में अधिकतम 4 दस्तावेज़ वेरिएंट उत्पन्न करें। विभिन्न

अधिक पढ़ें