Blog
AI ModelsBenchmarksLong documentsClaudeGeminiGPT-5.6

Kami menguji lima model dengan dokumen 22 halaman yang sama. Inilah yang kami pelajari.

5 min
Kami menguji lima model dengan dokumen 22 halaman yang sama. Inilah yang kami pelajari.

Kami menguji lima model dengan dokumen 22 halaman yang sama. Inilah yang kami pelajari.

Setiap beberapa minggu, model baru hadir dengan bagan tolok ukur (benchmark). Tidak ada satu pun dari bagan tersebut yang mengukur hal yang paling dibutuhkan oleh alat pembuat dokumen: dapatkah model tersebut menulis dokumen yang panjang dan terstruktur hingga selesai, dengan kecepatan yang bersedia ditunggu oleh pengguna, tanpa berhenti diam-diam di tengah jalan?

Jadi, kami membuat pengujian kami sendiri, dan setiap model harus lulus pengujian ini sebelum mendapatkan jalur di NextDocs. Postingan ini menjelaskan pengujian tersebut dan apa yang dilakukan oleh lima model saat ini terhadap pengujian tersebut. Beberapa hasilnya mengejutkan kami.

Gerbang seleksi

Kami mengambil prompt nyata dari produksi: sebuah permintaan yang telah menghasilkan dokumen setebal 22 halaman, lengkap dengan bagian-bagian, tabel, dan struktur tertentu. Kami menjalankannya kembali pada model kandidat dengan anggaran pembuatan (generation budget) yang sama dengan yang digunakan produk, dan kami mengamati tiga hal:

  1. Apakah selesai? Seluruh 22 halaman, atau apakah berhenti di tengah elemen tanpa ada kesalahan (error)?
  2. Berapa lama waktu yang dibutuhkan? NextDocs mengalirkan (stream) dokumen saat sedang ditulis, dan pengguna sedang memperhatikannya. Model yang selesai dalam dua menit dan model yang selesai dalam sepuluh menit bukanlah produk yang sama.
  3. Apakah throughput-nya stabil? Beberapa model mulai dengan cepat dan melambat seiring bertambahnya output. Pola seperti itulah yang mengubah dokumen panjang menjadi terpotong (truncated).

Model yang gagal dalam salah satu dari ketiga hal tersebut tidak akan dipromosikan, seberapa bagus pun bagan tolok ukurnya.

Apa yang dilakukan oleh kelima model

GPT-5.6 Luna (OpenAI, berjalan di Azure AI Foundry). Menyelesaikan seluruh 22 halaman, dalam waktu kurang dari dua menit pada sesi tercepat. Throughput yang konsisten dari halaman pertama hingga terakhir. Inilah mengapa Luna memegang jalur cepat (fast lane) untuk setiap paket.

Gemini 3.5 Flash (Google). Menyelesaikan seluruh 22 halaman dalam waktu sedikit di atas dua menit. Memegang jalur kualitas (quality lane) selama sebagian besar musim panas.

Gemini 3.8 Flash (Google, dirilis 2 September). Lolos gerbang seleksi yang sama dalam waktu satu hari setelah rilis dan dipromosikan ke jalur kualitas pada 3 September. Generasi Flash keempat dalam empat bulan, dan yang pertama yang kami adopsi dalam waktu 24 jam.

Claude Sonnet 4.6 (Anthropic). Menyelesaikan seluruh 22 halaman, tetapi menghabiskan hampir seluruh anggaran pembuatan untuk melakukannya, dan menulis jauh lebih banyak daripada model lainnya, sekitar 170.000 karakter. Model ini tidak lambat di awal dan kinerjanya tidak menurun; ia hanya sangat teliti. Hal itu menjadikannya penulis premium yang luar biasa dan model yang kami awasi dengan ketat untuk dokumen yang sangat panjang, karena permintaan yang sedikit lebih panjang dapat membuatnya melampaui anggaran.

Claude Sonnet 5 (Anthropic, dirilis 30 Juni). Ini adalah kejutannya. Sonnet 5 lebih baru dan lebih murah daripada Sonnet 4.6, dan tolok ukur keagenannya (agentic benchmarks) lebih baik. Pada gerbang seleksi kami, model ini berhenti di halaman 16 dari 22 halaman setelah sekitar delapan menit, di tengah-tengah elemen, tanpa ada error. Itu adalah ciri khas dari bug pemotongan (truncation bug) yang kami habiskan sepanjang bulan Juli untuk dieliminasi. Jadi, Sonnet 5 tidak dimasukkan ke dalam tangga pilihan (ladder), dan Sonnet 4.6 tetap mempertahankan jalur premium (premium lane) hingga pengujian ulang menyatakan sebaliknya.

Apa yang kami pelajari

Lebih baru tidak selalu berarti lebih baik untuk dokumen panjang. Dua model yang kami tolak untuk dipromosikan musim panas ini keduanya lebih baru daripada model yang mempertahankan jalurnya. Sebuah model bisa saja lebih cerdas per token, tetapi tetap gagal dalam menangani dokumen panjang karena kurva throughput.

Penurunan throughput (throughput decay) adalah mode kegagalan yang harus diwaspadai. Model yang berbahaya tidak menghasilkan error. Mereka melambat seiring bertambahnya ukuran dokumen, melampaui anggaran streaming, dan aliran data berakhir dengan dokumen setengah jadi yang tampak lengkap. Kami mengubah NextDocs untuk mendeteksi aliran data yang terputus dan menolak untuk menyimpan hasil yang terpotong, itulah sebabnya dokumen panjang sekarang selesai atau gagal dengan jelas, tidak pernah gagal secara diam-diam.

Ketelitian ada harganya. Sonnet 4.6 menulis dokumen terkaya dari kelimanya dan yang paling panjang. Untuk laporan setebal 40 halaman, Anda mungkin menginginkan hal itu. Untuk presentasi sepuluh slide, Anda tentu lebih memilih menggunakan Luna dan menghemat waktu sore Anda. Itulah mengapa tangga pilihan kami memiliki beberapa jalur, bukan hanya satu model.

Selalu lakukan pengujian sebelum mempromosikan. Gemini 3.8 Flash mendapatkan jalurnya dalam sehari karena gerbang seleksi ini dapat diulang. Sonnet 5 kehilangan jalur yang seharusnya bisa didapatkannya karena alasan yang sama. Pengujian yang konsisten adalah cara Anda untuk tetap cepat tanpa bersikap ceroboh.

Bagaimana hal ini berdampak pada Anda

Anda tidak perlu memikirkan semua ini. Cukup pilih mode dan sistem tangga kami yang akan memilih modelnya:

  • Fast (Cepat) untuk draf dan dokumen pendek.
  • Quality (Kualitas) untuk apa pun yang memiliki bagian-bagian yang harus tetap konsisten.
  • Premium, pada paket Pro+ dan Ultra, untuk penulisan di mana kedalaman materi lebih penting daripada waktu.

Atau pilih secara eksplisit di pemilih model (model picker). Dan jika Anda ingin menjalankan versi pengujian Anda sendiri, pembuatan multi-varian memungkinkan Anda mengirim satu prompt ke beberapa model sekaligus dan membandingkan dokumen lengkap secara berdampingan. Ini adalah cara paling mendekati uji tanding (bake-off) yang adil yang dapat Anda jalankan tanpa laboratorium.

Jika model yang paling ingin Anda bandingkan adalah yang paling baru, seperti GPT-6 Astra dan Claude Fable 5.1, model-model tersebut belum ada di NextDocs. Aplikasi desktop Shyne dapat menjalankan agennya di langganan Claude Code atau Codex Anda sendiri, yang merupakan cara tercepat untuk mengujinya pada dokumen nyata saat ini.

Coba pemilih model di NextDocs


Tim NextDocs