हर कुछ हफ़्तों में एक बेंचमार्क चार्ट के साथ एक नया मॉडल आता है। उन चार्टों में से कोई भी उस चीज़ को नहीं मापता जिसकी एक दस्तावेज़ टूल को सबसे अधिक आवश्यकता होती: क्या मॉडल बिना किसी रुकावट के, एक ऐसी गति से जिसे कोई व्यक्ति सहन कर सके, अंत तक एक लंबा, संरचित दस्तावेज़ लिख सकता है?
इसलिए हमने अपना खुद का परीक्षण बनाया, और NextDocs में जगह पाने से पहले हर मॉडल को इसे पास करना होगा। यह पोस्ट इस परीक्षण और इस पर पांच मौजूदा मॉडलों के प्रदर्शन के बारे में बताती है। कुछ परिणामों ने हमें हैरान कर दिया।
हमने प्रोडक्शन से एक वास्तविक प्रॉम्प्ट लिया: एक ऐसा अनुरोध जिसने अनुभागों (sections), तालिकाओं (tables) और एक विशिष्ट संरचना के साथ 22-पेज का दस्तावेज़ तैयार किया था। हम इसे उसी जनरेशन बजट के साथ एक उम्मीदवार मॉडल पर फिर से चलाते हैं जिसका उपयोग उत्पाद करता है, और हम तीन चीज़ों पर नज़र रखते हैं:
इन तीनों में से किसी में भी विफल रहने वाले मॉडल को आगे नहीं बढ़ाया जाता है, चाहे उसका बेंचमार्क चार्ट कितना भी अच्छा क्यों न दिखे।
GPT-5.6 Luna (OpenAI, Azure AI Foundry पर संचालित)। सबसे तेज़ रन में दो मिनट से भी कम समय में सभी 22 पेज पूरे किए। पहले पेज से लेकर आखिरी पेज तक लगातार थ्रूपुट। यही कारण है कि Luna हर प्लान के लिए फास्ट लेन (fast lane) पर काबिज़ है।
Gemini 3.5 Flash (Google)। दो मिनट से थोड़े अधिक समय में सभी 22 पेज पूरे किए। गर्मियों के अधिकांश समय में क्वालिटी लेन (quality lane) पर बनी रही।
Gemini 3.8 Flash (Google, 2 सितंबर को रिलीज़)। रिलीज़ के एक दिन के भीतर उसी गेट को पास किया और 3 सितंबर को क्वालिटी लेन में प्रमोट किया गया। चार महीनों में चौथी फ़्लैश जनरेशन, और पहली जिसे हमने 24 घंटों के भीतर अपनाया।
Claude Sonnet 4.6 (Anthropic)। सभी 22 पेज पूरे किए, लेकिन ऐसा करने में लगभग पूरे जनरेशन बजट का उपयोग किया, और किसी भी अन्य मॉडल की तुलना में कहीं अधिक, लगभग 170,000 अक्षर लिखे। यह शुरू होने में धीमा नहीं है और न ही इसका प्रदर्शन घटता है; यह केवल बेहद विस्तृत है। यह इसे एक बेहतरीन प्रीमियम लेखक और एक ऐसा मॉडल बनाता है जिस पर हम बहुत लंबे दस्तावेज़ों के लिए बारीकी से नज़र रखते हैं, क्योंकि थोड़ा लंबा अनुरोध भी इसे बजट से बाहर धकेल सकता है।
Claude Sonnet 5 (Anthropic, 30 जून को रिलीज़)। यह आश्चर्यजनक था। Sonnet 5, Sonnet 4.6 की तुलना में नया और सस्ता है, और इसके एजेंटिक बेंचमार्क बेहतर हैं। हमारे गेट पर यह लगभग आठ मिनट के बाद 22 में से 16 पेजों पर, बिना किसी त्रुटि के बीच में ही रुक गया। यह बिल्कुल उसी ट्रंकेशन बग (truncation bug) का संकेत है जिसे हमने जुलाई में ठीक करने में बिताया था। इसलिए Sonnet 5 को लैडर (ladder) में शामिल नहीं किया गया है, और Sonnet 4.6 प्रीमियम लेन में तब तक बना रहेगा जब तक कि दोबारा परीक्षण कुछ और न कहे।
लंबे दस्तावेज़ों के लिए नया होना हमेशा बेहतर होने के समान नहीं होता है। इस गर्मी में जिन दो मॉडलों को हमने प्रमोट करने से मना कर दिया, वे दोनों उन मॉडलों से नए थे जिन्होंने अपनी लेन बरकरार रखी। एक मॉडल प्रति टोकन अधिक स्मार्ट हो सकता है और फिर भी थ्रूपुट कर्व (throughput curve) के कारण लंबे दस्तावेज़ में पिछड़ सकता है।
थ्रूपुट में गिरावट (Throughput decay) वह विफलता मोड है जिस पर नज़र रखनी चाहिए। खतरनाक मॉडल त्रुटि (error) नहीं दिखाते हैं। दस्तावेज़ बढ़ने के साथ वे धीमे हो जाते हैं, स्ट्रीमिंग बजट को पार कर जाते हैं, और स्ट्रीम एक आधे-अधूरे दस्तावेज़ के साथ समाप्त हो जाती है जो देखने में पूरा लगता है। हमने NextDocs को एक बाधित स्ट्रीम का पता लगाने और अधूरे परिणाम को सहेजने से इनकार करने के लिए बदल दिया है, यही कारण है कि लंबे दस्तावेज़ अब या तो पूरे होते हैं या स्पष्ट रूप से विफल हो जाते हैं, कभी भी चुपचाप नहीं।
विस्तृत होने की एक कीमत होती है। Sonnet 4.6 पांचों में से सबसे समृद्ध और सबसे लंबे दस्तावेज़ लिखता है। 40-पेज की रिपोर्ट के लिए आप शायद यही चाहेंगे। दस-स्लाइड के डेक के लिए आप Luna को चुनना पसंद करेंगे ताकि आपका दोपहर का समय बच सके। यही कारण है कि लैडर में केवल एक मॉडल के बजाय अलग-अलग लेन हैं।
हर बार प्रमोट करने से पहले परीक्षण करें। Gemini 3.8 Flash ने एक दिन में अपनी लेन हासिल कर ली क्योंकि गेट दोहराने योग्य (repeatable) है। Sonnet 5 ने इसी वजह से वह लेन खो दी जो अन्यथा उसे मिल जाती। एक निश्चित परीक्षण ही वह तरीका है जिससे आप बिना लापरवाह हुए तेज़ बने रह सकते हैं।
आपको इस बारे में सोचने की ज़रूरत नहीं है। बस एक मोड चुनें और लैडर मॉडल चुन लेता है:
या मॉडल पिकर में स्पष्ट रूप से चुनें। और यदि आप इस परीक्षण का अपना संस्करण चलाना चाहते हैं, तो मल्टी-वेरिएंट जनरेशन आपको एक ही बार में कई मॉडलों को एक प्रॉम्प्ट भेजने और पूरे दस्तावेज़ों की साथ-साथ तुलना करने की अनुमति देता है। यह बिना किसी लैब के एक निष्पक्ष तुलनात्मक परीक्षण (bake-off) चलाने के सबसे करीब है।
यदि जिन मॉडलों की आप सबसे अधिक तुलना करना चाहते हैं वे बिल्कुल नए हैं, जैसे GPT-6 Astra और Claude Fable 5.1, तो वे अभी तक NextDocs में नहीं हैं। Shyne डेस्कटॉप ऐप आपके खुद के Claude Code या Codex सब्सक्रिप्शन पर अपना एजेंट चला सकता है, जो आज उन्हें वास्तविक दस्तावेज़ों पर काम में लगाने का सबसे तेज़ तरीका है।
NextDocs में मॉडल पिकर आज़माएं
NextDocs टीम

GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash और Kimi K3 सभी कुछ ही हफ्तों के भीतर लॉन्च हुए हैं। डेक और दस्तावेज़ों के लिए इनमें से प्रत्येक किस चीज़ में बेहतर है, उनकी लागत क्या है, NextDocs आज इनमें से किसे चलाता है, और Shyne के माध्यम से बिल्कुल नए मॉडलों का उपयोग कैसे करें।
अधिक पढ़ें
लंबे दस्तावेज़ वे जगह थे जहाँ AI जनरेशन सबसे अधिक विफल रहा, आमतौर पर अंत के करीब और आमतौर पर चुपचाप। यहाँ बताया गया है कि NextDocs सरल अंग्रेज़ी में एक लंबा दस्तावेज़ कैसे जनरेट करता है, v1.11.1 में क्या बदलाव आया है ताकि रन पूरे हों या स्पष्ट रूप से विफल हों, और जब आपको 100 पन्नों की आवश्यकता हो तो क्या करें।
अधिक पढ़ें
एक ही समय में अधिकतम 4 दस्तावेज़ वेरिएंट उत्पन्न करें। विभिन्न
अधिक पढ़ें