Co kilka tygodni pojawia się nowy model wraz z wykresem przedstawiającym wyniki testów porównawczych (benchmarków). Żaden z tych wykresów nie mierzy jednak tego, czego narzędzie do pracy z dokumentami potrzebuje najbardziej: czy model potrafi napisać długi, ustrukturyzowany dokument od początku do samego końca, w tempie akceptowalnym dla człowieka, nie przerywając po cichu pracy przed czasem?
Stworzyliśmy więc nasz własny test i każdy model musi go zdać, zanim trafi do NextDocs. Ten wpis wyjaśnia, na czym polega ten test i jak poradziło sobie w nim pięć obecnych modeli. Niektóre wyniki nas zaskoczyły.
Wzięliśmy rzeczywisty prompt z produkcji: zapytanie, które wygenerowało 22-stronicowy dokument z sekcjami, tabelami i określoną strukturą. Uruchamiamy je ponownie na testowanym modelu z takim samym budżetem generowania, jakiego używa nasz produkt, i obserwujemy trzy rzeczy:
Model, który obleje którykolwiek z tych trzech punktów, nie zostaje wdrożony, bez względu na to, jak dobrze prezentują się jego wykresy wydajności.
GPT-5.6 Luna (OpenAI, uruchamiany na Azure AI Foundry). Ukończył wszystkie 22 strony, w najszybszych próbach w czasie poniżej dwóch minut. Stabilna przepustowość od pierwszej do ostatniej strony. To dlatego Luna obsługuje szybką ścieżkę (fast lane) w każdym planie.
Gemini 3.5 Flash (Google). Ukończył wszystkie 22 strony w nieco ponad dwie minuty. Przez większość lata utrzymywał się na ścieżce jakościowej (quality lane).
Gemini 3.8 Flash (Google, wydany 2 września). Przeszedł tę samą bramkę w ciągu doby od premiery i 3 września został przeniesiony na ścieżkę jakościową. To czwarta generacja Flash w ciągu czterech miesięcy i pierwsza, na którą przeszliśmy w ciągu 24 godzin.
Claude Sonnet 4.6 (Anthropic). Ukończył wszystkie 22 strony, ale zużył na to prawie cały budżet generowania i napisał znacznie więcej niż jakikolwiek inny model – około 170 000 znaków. Nie startuje powoli ani nie zwalnia; jest po prostu niezwykle szczegółowy. To czyni go znakomitym autorem tekstów premium i modelem, który uważnie obserwujemy przy bardzo długich dokumentach, ponieważ nieco dłuższe zapytanie mogłoby przekroczyć dostępny budżet.
Claude Sonnet 5 (Anthropic, wydany 30 czerwca). To była niespodzianka. Sonnet 5 jest nowszy i tańszy niż Sonnet 4.6, a jego wyniki w benchmarkach agentowych są lepsze. Na naszej bramce zatrzymał się na 16. z 22 stron po około ośmiu minutach, w środku elementu, bez żadnego błędu. To dokładnie ten sam objaw błędu obcinania tekstu (truncation bug), na którego eliminację poświęciliśmy cały lipiec. W rezultacie Sonnet 5 nie został uwzględniony w naszej drabince, a Sonnet 4.6 zachowuje ścieżkę premium, dopóki ponowny test nie wykaże inaczej.
Nowszy nie oznacza lepszego w przypadku długich dokumentów. Oba modele, których wdrożenia odmówiliśmy tego lata, były nowsze od tych, które utrzymały swoje pozycje. Model może być inteligentniejszy w przeliczeniu na pojedynczy token, a mimo to polec przy długim dokumencie z powodu spadku przepustowości.
Spadek przepustowości to krytyczny błąd, na który trzeba uważać. Niebezpieczne modele nie zgłaszają błędów. Zwalniają w miarę wzrostu dokumentu, przekraczają budżet przesyłania strumieniowego, a transmisja kończy się na pół-ukończonym dokumencie, który wygląda na kompletny. Zmodyfikowaliśmy NextDocs tak, aby wykrywał przerwany strumień i odrzucał zapisywanie uciętego wyniku. Dzięki temu długie dokumenty teraz albo kończą się sukcesem, albo zgłaszają wyraźny błąd – nigdy nie dzieje się to po cichu.
Szczegółowość ma swoją cenę. Sonnet 4.6 tworzy najbogatsze i najdłuższe dokumenty z całej piątki. Przy 40-stronicowym raporcie możesz chcieć dokładnie tego. Przy 10-slajdowej prezentacji wolisz jednak wybrać Lunę i odzyskać wolne popołudnie. Właśnie dlatego nasza drabinka oferuje różne ścieżki zamiast jednego modelu.
Testuj przed wdrożeniem, za każdym razem. Gemini 3.8 Flash zdobył swoją pozycję w jeden dzień, ponieważ nasz test jest powtarzalny. Z tego samego powodu Sonnet 5 stracił szansę na pozycję, którą w innym przypadku by otrzymał. Stały test to sposób na szybkie działanie bez niepotrzebnego ryzyka.
Nie musisz się o nic martwić. Wybierz tryb, a nasza drabinka dobierze odpowiedni model:
Możesz też dokonać bezpośredniego wyboru w selektorze modeli. A jeśli chcesz przeprowadzić własną wersję tego testu, generowanie wielowariantowe pozwala wysłać jeden prompt do kilku modeli jednocześnie i porównać gotowe dokumenty obok siebie. To najbliższa uczciwemu porównaniu metoda, jaką możesz zastosować bez dostępu do laboratorium.
Jeśli modelami, które najbardziej chcesz porównać, są te najnowsze – GPT-6 Astra i Claude Fable 5.1 – nie ma ich jeszcze w NextDocs. Aplikacja desktopowa Shyne może uruchomić swojego agenta w ramach Twojej własnej subskrypcji Claude Code lub Codex, co jest dziś najszybszym sposobem na zaprzęgnięcie ich do pracy nad prawdziwymi dokumentami.
Wypróbuj selektor modeli w NextDocs
Zespół NextDocs

GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash i Kimi K3 pojawiły się w odstępie zaledwie kilku tygodni. Do czego każdy z nich nadaje się najlepiej w przypadku prezentacji i dokumentów, ile kosztują, które z nich są obecnie uruchamiane w NextDocs oraz jak korzystać z najnowszych wersji za pośrednictwem Shyne.
Czytaj dalej
Długie dokumenty były obszarem, w którym generowanie przez AI zawodziło najczęściej – zazwyczaj pod sam koniec i bez żadnego ostrzeżenia. Oto jak NextDocs generuje długie dokumenty, co zmieniło się w wersji v1.11.1, dzięki czemu procesy kończą się sukcesem lub wyraźnym błędem, oraz co zrobić, gdy potrzebujesz 100 stron.
Czytaj dalej
Generuj do 4 wariantów dokumentów jednocześnie. Porównuj różne
Czytaj dalej