Tujuh model AI diuji dengan satu huruf jawaban dan selisih token mencapai 876 kali
Tujuh model, satu set uji, satu huruf yang diminta. Yang paling boros memakai 876 kali lebih banyak token daripada yang paling hemat. Versi pertama tulisan ini menyebut 2.290 kali, dan angka itu keliru.
Angka kunci
Angka ini dari mana?Diukur dari meta.json run jv-A procurement: tujuh model, token keluaran per panggilan dan 2 sumber lain
Kami memberi tujuh model soal pilihan ganda pada satu set uji yang sama. Jawaban yang diminta satu huruf. A, B, C, atau D.
Lalu kami hitung berapa token keluaran yang mereka pakai untuk memberikannya. Yang paling hemat memakai 1,0 token. Yang paling boros memakai 875,8. Selisihnya 876 kali, untuk pekerjaan yang persis sama.
Satu huruf, 875 token
Semua angka di bawah berasal dari satu run, 2026-07-25-jv-A-procurement, dengan 32 panggilan per model. Menyatukannya dalam satu run itu penting, dan alasannya ada di bagian ketiga tulisan ini.
| Model | Token keluaran per panggilan | Panggilan |
|---|---|---|
| gemini-2.5-flash | 1,0 | 32 |
| gemini-3.1-flash-lite | 1,0 | 32 |
| deepseek-v3-2 | 1,9 | 32 |
| gemma-4-31b | 1,9 | 32 |
| qwen-3.5-flagship | 726,0 | 32 |
| kimi-k2.6 | 733,1 | 32 |
| qwen3-235b | 875,8 | 32 |
Tidak ada kelompok tengah. Empat model duduk di bawah dua token, tiga model duduk di atas tujuh ratus, dan tidak ada satu pun di antaranya. Ini bukan spektrum, melainkan dua kelompok yang kebetulan diminta mengerjakan tugas yang sama.
Penyebabnya bukan misteri. Model penalaran menghasilkan rantai penalaran sebelum menjawab, dan rantai itu ikut ditagih. Yang mengejutkan bukan mekanismenya, melainkan bahwa mekanisme itu tetap jalan ketika jawaban yang diminta cuma satu huruf. Model tidak punya cara mengetahui bahwa soalnya sepele.
Cara kami mengukurnya
Tiap run diekspor ke berkas berisi hasil per panggilan: model, butir soal, skor, token masuk, token keluar, dan kegagalan format. Angka di tabel adalah rata-rata token keluar per panggilan, dihitung dari 32 panggilan tiap model.
Kenapa token keluar dan bukan biaya rupiah: harga bisa berubah kapan saja dan berbeda antarpenyedia, sementara jumlah token adalah sifat perilaku modelnya sendiri. Ia tetap benar setahun lagi meski daftar harganya sudah berganti tiga kali.
Pilihan yang bisa digugat: kami membandingkan pada satu format saja, yaitu pilihan ganda. Format itu adalah kasus paling ekstrem untuk model penalaran, karena rasio antara penalaran dan jawaban jadi setinggi mungkin. Pada tugas mengarang paragraf, selisihnya hampir pasti jauh lebih kecil. Angka di sini menunjukkan batas atas, bukan rata-rata pemakaian sehari-hari.
Versi pertama tulisan ini salah, dan begini salahnya
Tabel di atas sekarang berasal dari satu run. Versi pertama tidak.
Waktu itu kami menulis angka 2.290,8 token untuk qwen-3.5-flagship, dan menyatakan selisihnya 2.290 kali. Angka itu nyata, tapi ia diambil dari run yang berbeda dari enam angka lainnya di tabel yang sama. Run itu, 2026-07-25-jv-A-produksi, cuma punya delapan panggilan per model, sampel terkecil dari seluruh run yang kami punya.
Pada set yang benar-benar sama, model itu memakai 726,0 token, bukan 2.290,8.
Kalimat "pada set yang sama" di versi pertama karena itu tidak benar, dan angka utamanya melebih-lebihkan selisih sekitar tiga kali lipat. Kesalahannya bukan pada datanya, melainkan pada kami yang mengambil angka paling mencolok dari kumpulan run tanpa memeriksa apakah ia sebanding dengan sisanya.
Angkanya sendiri bergerak antar-run
Setelah kekeliruan itu ditelusuri, muncul temuan yang lebih berguna daripada temuan aslinya.
Model yang sama, pada run yang berbeda, memakai jumlah token yang jauh berbeda:
| Model | Rata-rata terendah | Rata-rata tertinggi | Jumlah run |
|---|---|---|---|
| qwen-3.5-flagship | 726,0 | 2.290,8 | 5 |
| qwen3-235b | 618,0 | 881,6 | 5 |
| deepseek-v3-2 | 1,9 | 47,0 | 11 |
| gemini-3.1-flash-lite | 1,0 | 11,2 | 16 |
qwen-3.5-flagship bergerak dari 726 sampai 2.291, rentang yang lebih lebar daripada nilai terendahnya sendiri. Artinya satu pengukuran tunggal terhadap model penalaran tidak cukup untuk memperkirakan biayanya, dan angka tunggal apa pun yang kamu baca di mana pun, termasuk di versi pertama tulisan ini, patut dicurigai.
Sebagian sebaran itu punya penjelasan wajar: run yang berbeda memakai set soal dan panjang prompt yang berbeda. Tapi kami tidak mengukur seberapa besar bagian yang dijelaskan oleh sebab itu, jadi angka rentangnya harus dibaca sebagai sebaran total, bukan sebagai varians murni model.
Kenapa harga katalog menipu
Harga API dikutip per token, jadi wajar kalau orang membandingkan model dengan melihat angka itu. Masalahnya, angka itu cuma separuh dari perkalian.
Separuh lainnya adalah berapa token yang benar-benar dipakai model, dan itu tidak tertulis di katalog mana pun. Tidak ada penyedia yang memasang label "model ini cenderung memakai 700 token untuk menjawab pertanyaan sepele".
Model dengan harga per token lebih murah bisa berakhir jauh lebih mahal, dan kamu tidak akan tahu sebelum menjalankannya sendiri.
Contohnya ada di tabel pertama. qwen-3.5-flagship dan deepseek-v3-2 duduk di kelas harga yang tidak jauh berbeda per tokennya. Dalam praktik, pada set yang sama, satu memakai 726,0 token dan satu lagi 1,9. Kalau kamu merencanakan anggaran dari katalog, kamu akan meleset dengan faktor ratusan.
Ini juga alasan kenapa kami sekarang memilih model dari log pemakaian nyata, bukan dari katalog. Katalog memberi tahu harga; log memberi tahu tagihan.
Dan karena rentang antar-run selebar itu, satu run saja belum cukup jadi log yang bisa dipercaya.
Data & provenans
- meta.json run jv-A procurement: tujuh model, token keluaran per panggilan
- summary.md run yang sama: ringkasan per model
- meta.json run jv-A produksi: sumber angka 2.290 kali yang dikoreksi di versi pertama artikel ini
Keterbatasan
Perbandingan dilakukan pada satu format saja, pilihan ganda, yang merupakan kasus paling ekstrem untuk model penalaran; pada tugas mengarang selisihnya hampir pasti jauh lebih kecil. Tabel utama berasal dari satu run dengan 32 panggilan per model, bukan dari pengulangan terencana, jadi ia belum cukup untuk menyimpulkan varians model secara benar. Rentang antar-run yang dilaporkan mencampur sebab yang berbeda, termasuk perbedaan set soal dan panjang prompt, dan kami tidak mengukur porsi masing-masing. Angka token keluaran tidak diterjemahkan ke biaya karena harga berbeda antarpenyedia dan berubah sewaktu-waktu.
Riwayat revisi
- Terbit
- Terakhir diperbarui
- belum pernah direvisi sejak terbit
Istilah dalam artikel ini
- token
- Potongan teks yang jadi satuan hitung model AI, kira-kira sepanjang suku kata sampai satu kata pendek. Harga layanan AI dihitung per juta token, masuk dan keluar dihitung terpisah, sehingga jawaban yang bertele-tele benar-benar lebih mahal daripada jawaban yang ringkas.
Ditulis penulis untuk artikel ini, bukan disalin dari entri kamus.