Setiap beberapa minggu, model baru hadir dengan bagan tolok ukur (benchmark). Tidak ada satu pun dari bagan tersebut yang mengukur hal yang paling dibutuhkan oleh alat pembuat dokumen: dapatkah model tersebut menulis dokumen yang panjang dan terstruktur hingga selesai, dengan kecepatan yang bersedia ditunggu oleh pengguna, tanpa berhenti diam-diam di tengah jalan?
Jadi, kami membuat pengujian kami sendiri, dan setiap model harus lulus pengujian ini sebelum mendapatkan jalur di NextDocs. Postingan ini menjelaskan pengujian tersebut dan apa yang dilakukan oleh lima model saat ini terhadap pengujian tersebut. Beberapa hasilnya mengejutkan kami.
Kami mengambil prompt nyata dari produksi: sebuah permintaan yang telah menghasilkan dokumen setebal 22 halaman, lengkap dengan bagian-bagian, tabel, dan struktur tertentu. Kami menjalankannya kembali pada model kandidat dengan anggaran pembuatan (generation budget) yang sama dengan yang digunakan produk, dan kami mengamati tiga hal:
Model yang gagal dalam salah satu dari ketiga hal tersebut tidak akan dipromosikan, seberapa bagus pun bagan tolok ukurnya.
GPT-5.6 Luna (OpenAI, berjalan di Azure AI Foundry). Menyelesaikan seluruh 22 halaman, dalam waktu kurang dari dua menit pada sesi tercepat. Throughput yang konsisten dari halaman pertama hingga terakhir. Inilah mengapa Luna memegang jalur cepat (fast lane) untuk setiap paket.
Gemini 3.5 Flash (Google). Menyelesaikan seluruh 22 halaman dalam waktu sedikit di atas dua menit. Memegang jalur kualitas (quality lane) selama sebagian besar musim panas.
Gemini 3.8 Flash (Google, dirilis 2 September). Lolos gerbang seleksi yang sama dalam waktu satu hari setelah rilis dan dipromosikan ke jalur kualitas pada 3 September. Generasi Flash keempat dalam empat bulan, dan yang pertama yang kami adopsi dalam waktu 24 jam.
Claude Sonnet 4.6 (Anthropic). Menyelesaikan seluruh 22 halaman, tetapi menghabiskan hampir seluruh anggaran pembuatan untuk melakukannya, dan menulis jauh lebih banyak daripada model lainnya, sekitar 170.000 karakter. Model ini tidak lambat di awal dan kinerjanya tidak menurun; ia hanya sangat teliti. Hal itu menjadikannya penulis premium yang luar biasa dan model yang kami awasi dengan ketat untuk dokumen yang sangat panjang, karena permintaan yang sedikit lebih panjang dapat membuatnya melampaui anggaran.
Claude Sonnet 5 (Anthropic, dirilis 30 Juni). Ini adalah kejutannya. Sonnet 5 lebih baru dan lebih murah daripada Sonnet 4.6, dan tolok ukur keagenannya (agentic benchmarks) lebih baik. Pada gerbang seleksi kami, model ini berhenti di halaman 16 dari 22 halaman setelah sekitar delapan menit, di tengah-tengah elemen, tanpa ada error. Itu adalah ciri khas dari bug pemotongan (truncation bug) yang kami habiskan sepanjang bulan Juli untuk dieliminasi. Jadi, Sonnet 5 tidak dimasukkan ke dalam tangga pilihan (ladder), dan Sonnet 4.6 tetap mempertahankan jalur premium (premium lane) hingga pengujian ulang menyatakan sebaliknya.
Lebih baru tidak selalu berarti lebih baik untuk dokumen panjang. Dua model yang kami tolak untuk dipromosikan musim panas ini keduanya lebih baru daripada model yang mempertahankan jalurnya. Sebuah model bisa saja lebih cerdas per token, tetapi tetap gagal dalam menangani dokumen panjang karena kurva throughput.
Penurunan throughput (throughput decay) adalah mode kegagalan yang harus diwaspadai. Model yang berbahaya tidak menghasilkan error. Mereka melambat seiring bertambahnya ukuran dokumen, melampaui anggaran streaming, dan aliran data berakhir dengan dokumen setengah jadi yang tampak lengkap. Kami mengubah NextDocs untuk mendeteksi aliran data yang terputus dan menolak untuk menyimpan hasil yang terpotong, itulah sebabnya dokumen panjang sekarang selesai atau gagal dengan jelas, tidak pernah gagal secara diam-diam.
Ketelitian ada harganya. Sonnet 4.6 menulis dokumen terkaya dari kelimanya dan yang paling panjang. Untuk laporan setebal 40 halaman, Anda mungkin menginginkan hal itu. Untuk presentasi sepuluh slide, Anda tentu lebih memilih menggunakan Luna dan menghemat waktu sore Anda. Itulah mengapa tangga pilihan kami memiliki beberapa jalur, bukan hanya satu model.
Selalu lakukan pengujian sebelum mempromosikan. Gemini 3.8 Flash mendapatkan jalurnya dalam sehari karena gerbang seleksi ini dapat diulang. Sonnet 5 kehilangan jalur yang seharusnya bisa didapatkannya karena alasan yang sama. Pengujian yang konsisten adalah cara Anda untuk tetap cepat tanpa bersikap ceroboh.
Anda tidak perlu memikirkan semua ini. Cukup pilih mode dan sistem tangga kami yang akan memilih modelnya:
Atau pilih secara eksplisit di pemilih model (model picker). Dan jika Anda ingin menjalankan versi pengujian Anda sendiri, pembuatan multi-varian memungkinkan Anda mengirim satu prompt ke beberapa model sekaligus dan membandingkan dokumen lengkap secara berdampingan. Ini adalah cara paling mendekati uji tanding (bake-off) yang adil yang dapat Anda jalankan tanpa laboratorium.
Jika model yang paling ingin Anda bandingkan adalah yang paling baru, seperti GPT-6 Astra dan Claude Fable 5.1, model-model tersebut belum ada di NextDocs. Aplikasi desktop Shyne dapat menjalankan agennya di langganan Claude Code atau Codex Anda sendiri, yang merupakan cara tercepat untuk mengujinya pada dokumen nyata saat ini.
Coba pemilih model di NextDocs
Tim NextDocs

GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash, dan Kimi K3 semuanya hadir dalam waktu beberapa minggu saja. Kelebihan masing-masing model untuk presentasi (deck) dan dokumen, biayanya, model mana yang dijalankan NextDocs saat ini, dan cara menggunakan model terbaru melalui Shyne.
Baca selengkapnya
Dokumen panjang adalah area di mana pembuatan AI paling sering gagal, biasanya menjelang akhir dan secara diam-diam. Berikut adalah cara NextDocs menghasilkan dokumen panjang dalam bahasa Inggris sederhana, apa yang berubah di v1.11.1 sehingga proses pembuatan selesai atau gagal dengan peringatan yang jelas, dan apa yang harus dilakukan saat Anda membutuhkan 100 halaman.
Baca selengkapnya
Hasilkan hingga 4 varian dokumen secara bersamaan. Bandingkan berbagai
Baca selengkapnya