Blogi
AI ModelsBenchmarksLong documentsClaudeGeminiGPT-5.6

Przepuściliśmy pięć modeli przez ten sam 22-stronicowy dokument. Oto czego się dowiedzieliśmy.

5 min
Przepuściliśmy pięć modeli przez ten sam 22-stronicowy dokument. Oto czego się dowiedzieliśmy.

Przepuściliśmy pięć modeli przez ten sam 22-stronicowy dokument. Oto czego się dowiedzieliśmy.

Co kilka tygodni pojawia się nowy model wraz z wykresem przedstawiającym wyniki testów porównawczych (benchmarków). Żaden z tych wykresów nie mierzy jednak tego, czego narzędzie do pracy z dokumentami potrzebuje najbardziej: czy model potrafi napisać długi, ustrukturyzowany dokument od początku do samego końca, w tempie akceptowalnym dla człowieka, nie przerywając po cichu pracy przed czasem?

Stworzyliśmy więc nasz własny test i każdy model musi go zdać, zanim trafi do NextDocs. Ten wpis wyjaśnia, na czym polega ten test i jak poradziło sobie w nim pięć obecnych modeli. Niektóre wyniki nas zaskoczyły.

Bramka

Wzięliśmy rzeczywisty prompt z produkcji: zapytanie, które wygenerowało 22-stronicowy dokument z sekcjami, tabelami i określoną strukturą. Uruchamiamy je ponownie na testowanym modelu z takim samym budżetem generowania, jakiego używa nasz produkt, i obserwujemy trzy rzeczy:

  1. Czy ukończył zadanie? Całe 22 strony, czy może zatrzymał się w środku elementu bez zgłoszenia błędu?
  2. Ile czasu to zajęło? NextDocs przesyła dokument strumieniowo w trakcie jego pisania, a użytkownik to obserwuje. Model, który kończy pracę w dwie minuty, i ten, który potrzebuje na to dziesięciu, to nie jest ten sam produkt.
  3. Czy przepustowość została utrzymana? Niektóre modele zaczynają szybko, a zwalniają w miarę wzrostu generowanego tekstu. Taki schemat działania sprawia, że długi dokument zostaje ucięty.

Model, który obleje którykolwiek z tych trzech punktów, nie zostaje wdrożony, bez względu na to, jak dobrze prezentują się jego wykresy wydajności.

Jak poradziło sobie pięć modeli

GPT-5.6 Luna (OpenAI, uruchamiany na Azure AI Foundry). Ukończył wszystkie 22 strony, w najszybszych próbach w czasie poniżej dwóch minut. Stabilna przepustowość od pierwszej do ostatniej strony. To dlatego Luna obsługuje szybką ścieżkę (fast lane) w każdym planie.

Gemini 3.5 Flash (Google). Ukończył wszystkie 22 strony w nieco ponad dwie minuty. Przez większość lata utrzymywał się na ścieżce jakościowej (quality lane).

Gemini 3.8 Flash (Google, wydany 2 września). Przeszedł tę samą bramkę w ciągu doby od premiery i 3 września został przeniesiony na ścieżkę jakościową. To czwarta generacja Flash w ciągu czterech miesięcy i pierwsza, na którą przeszliśmy w ciągu 24 godzin.

Claude Sonnet 4.6 (Anthropic). Ukończył wszystkie 22 strony, ale zużył na to prawie cały budżet generowania i napisał znacznie więcej niż jakikolwiek inny model – około 170 000 znaków. Nie startuje powoli ani nie zwalnia; jest po prostu niezwykle szczegółowy. To czyni go znakomitym autorem tekstów premium i modelem, który uważnie obserwujemy przy bardzo długich dokumentach, ponieważ nieco dłuższe zapytanie mogłoby przekroczyć dostępny budżet.

Claude Sonnet 5 (Anthropic, wydany 30 czerwca). To była niespodzianka. Sonnet 5 jest nowszy i tańszy niż Sonnet 4.6, a jego wyniki w benchmarkach agentowych są lepsze. Na naszej bramce zatrzymał się na 16. z 22 stron po około ośmiu minutach, w środku elementu, bez żadnego błędu. To dokładnie ten sam objaw błędu obcinania tekstu (truncation bug), na którego eliminację poświęciliśmy cały lipiec. W rezultacie Sonnet 5 nie został uwzględniony w naszej drabince, a Sonnet 4.6 zachowuje ścieżkę premium, dopóki ponowny test nie wykaże inaczej.

Czego się dowiedzieliśmy

Nowszy nie oznacza lepszego w przypadku długich dokumentów. Oba modele, których wdrożenia odmówiliśmy tego lata, były nowsze od tych, które utrzymały swoje pozycje. Model może być inteligentniejszy w przeliczeniu na pojedynczy token, a mimo to polec przy długim dokumencie z powodu spadku przepustowości.

Spadek przepustowości to krytyczny błąd, na który trzeba uważać. Niebezpieczne modele nie zgłaszają błędów. Zwalniają w miarę wzrostu dokumentu, przekraczają budżet przesyłania strumieniowego, a transmisja kończy się na pół-ukończonym dokumencie, który wygląda na kompletny. Zmodyfikowaliśmy NextDocs tak, aby wykrywał przerwany strumień i odrzucał zapisywanie uciętego wyniku. Dzięki temu długie dokumenty teraz albo kończą się sukcesem, albo zgłaszają wyraźny błąd – nigdy nie dzieje się to po cichu.

Szczegółowość ma swoją cenę. Sonnet 4.6 tworzy najbogatsze i najdłuższe dokumenty z całej piątki. Przy 40-stronicowym raporcie możesz chcieć dokładnie tego. Przy 10-slajdowej prezentacji wolisz jednak wybrać Lunę i odzyskać wolne popołudnie. Właśnie dlatego nasza drabinka oferuje różne ścieżki zamiast jednego modelu.

Testuj przed wdrożeniem, za każdym razem. Gemini 3.8 Flash zdobył swoją pozycję w jeden dzień, ponieważ nasz test jest powtarzalny. Z tego samego powodu Sonnet 5 stracił szansę na pozycję, którą w innym przypadku by otrzymał. Stały test to sposób na szybkie działanie bez niepotrzebnego ryzyka.

Co to oznacza dla Ciebie

Nie musisz się o nic martwić. Wybierz tryb, a nasza drabinka dobierze odpowiedni model:

  • Fast (Szybki) do szkiców i krótkich dokumentów.
  • Quality (Jakościowy) do wszystkiego, co zawiera sekcje wymagające spójności.
  • Premium (w planach Pro+ i Ultra) do tekstów, w których głębia ma większe znaczenie niż czas.

Możesz też dokonać bezpośredniego wyboru w selektorze modeli. A jeśli chcesz przeprowadzić własną wersję tego testu, generowanie wielowariantowe pozwala wysłać jeden prompt do kilku modeli jednocześnie i porównać gotowe dokumenty obok siebie. To najbliższa uczciwemu porównaniu metoda, jaką możesz zastosować bez dostępu do laboratorium.

Jeśli modelami, które najbardziej chcesz porównać, są te najnowsze – GPT-6 Astra i Claude Fable 5.1 – nie ma ich jeszcze w NextDocs. Aplikacja desktopowa Shyne może uruchomić swojego agenta w ramach Twojej własnej subskrypcji Claude Code lub Codex, co jest dziś najszybszym sposobem na zaprzęgnięcie ich do pracy nad prawdziwymi dokumentami.

Wypróbuj selektor modeli w NextDocs


Zespół NextDocs