Empiris· 4 menit baca

Tujuh model AI diuji dengan satu huruf jawaban dan selisih token mencapai 876 kali

Tujuh model, satu set uji, satu huruf yang diminta. Yang paling boros memakai 876 kali lebih banyak token daripada yang paling hemat. Versi pertama tulisan ini menyebut 2.290 kali, dan angka itu keliru.

Diukur dari meta.json run jv-A procurement: tujuh model, token keluaran per panggilan dan 2 sumber lain

875,8
token, model paling boros
1,0
token, model paling hemat
876x
selisih pada set yang sama
32
panggilan per model

Kami memberi tujuh model soal pilihan ganda pada satu set uji yang sama. Jawaban yang diminta satu huruf. A, B, C, atau D.

Lalu kami hitung berapa token keluaran yang mereka pakai untuk memberikannya. Yang paling hemat memakai 1,0 token. Yang paling boros memakai 875,8. Selisihnya 876 kali, untuk pekerjaan yang persis sama.

Satu huruf, 875 token

Semua angka di bawah berasal dari satu run, 2026-07-25-jv-A-procurement, dengan 32 panggilan per model. Menyatukannya dalam satu run itu penting, dan alasannya ada di bagian ketiga tulisan ini.

ModelToken keluaran per panggilanPanggilan
gemini-2.5-flash1,032
gemini-3.1-flash-lite1,032
deepseek-v3-21,932
gemma-4-31b1,932
qwen-3.5-flagship726,032
kimi-k2.6733,132
qwen3-235b875,832

Tidak ada kelompok tengah. Empat model duduk di bawah dua token, tiga model duduk di atas tujuh ratus, dan tidak ada satu pun di antaranya. Ini bukan spektrum, melainkan dua kelompok yang kebetulan diminta mengerjakan tugas yang sama.

Penyebabnya bukan misteri. Model penalaran menghasilkan rantai penalaran sebelum menjawab, dan rantai itu ikut ditagih. Yang mengejutkan bukan mekanismenya, melainkan bahwa mekanisme itu tetap jalan ketika jawaban yang diminta cuma satu huruf. Model tidak punya cara mengetahui bahwa soalnya sepele.

Cara kami mengukurnya

Tiap run diekspor ke berkas berisi hasil per panggilan: model, butir soal, skor, token masuk, token keluar, dan kegagalan format. Angka di tabel adalah rata-rata token keluar per panggilan, dihitung dari 32 panggilan tiap model.

Kenapa token keluar dan bukan biaya rupiah: harga bisa berubah kapan saja dan berbeda antarpenyedia, sementara jumlah token adalah sifat perilaku modelnya sendiri. Ia tetap benar setahun lagi meski daftar harganya sudah berganti tiga kali.

Pilihan yang bisa digugat: kami membandingkan pada satu format saja, yaitu pilihan ganda. Format itu adalah kasus paling ekstrem untuk model penalaran, karena rasio antara penalaran dan jawaban jadi setinggi mungkin. Pada tugas mengarang paragraf, selisihnya hampir pasti jauh lebih kecil. Angka di sini menunjukkan batas atas, bukan rata-rata pemakaian sehari-hari.

Versi pertama tulisan ini salah, dan begini salahnya

Tabel di atas sekarang berasal dari satu run. Versi pertama tidak.

Waktu itu kami menulis angka 2.290,8 token untuk qwen-3.5-flagship, dan menyatakan selisihnya 2.290 kali. Angka itu nyata, tapi ia diambil dari run yang berbeda dari enam angka lainnya di tabel yang sama. Run itu, 2026-07-25-jv-A-produksi, cuma punya delapan panggilan per model, sampel terkecil dari seluruh run yang kami punya.

Pada set yang benar-benar sama, model itu memakai 726,0 token, bukan 2.290,8.

Kalimat "pada set yang sama" di versi pertama karena itu tidak benar, dan angka utamanya melebih-lebihkan selisih sekitar tiga kali lipat. Kesalahannya bukan pada datanya, melainkan pada kami yang mengambil angka paling mencolok dari kumpulan run tanpa memeriksa apakah ia sebanding dengan sisanya.

Angkanya sendiri bergerak antar-run

Setelah kekeliruan itu ditelusuri, muncul temuan yang lebih berguna daripada temuan aslinya.

Model yang sama, pada run yang berbeda, memakai jumlah token yang jauh berbeda:

ModelRata-rata terendahRata-rata tertinggiJumlah run
qwen-3.5-flagship726,02.290,85
qwen3-235b618,0881,65
deepseek-v3-21,947,011
gemini-3.1-flash-lite1,011,216

qwen-3.5-flagship bergerak dari 726 sampai 2.291, rentang yang lebih lebar daripada nilai terendahnya sendiri. Artinya satu pengukuran tunggal terhadap model penalaran tidak cukup untuk memperkirakan biayanya, dan angka tunggal apa pun yang kamu baca di mana pun, termasuk di versi pertama tulisan ini, patut dicurigai.

Sebagian sebaran itu punya penjelasan wajar: run yang berbeda memakai set soal dan panjang prompt yang berbeda. Tapi kami tidak mengukur seberapa besar bagian yang dijelaskan oleh sebab itu, jadi angka rentangnya harus dibaca sebagai sebaran total, bukan sebagai varians murni model.

Kenapa harga katalog menipu

Harga API dikutip per token, jadi wajar kalau orang membandingkan model dengan melihat angka itu. Masalahnya, angka itu cuma separuh dari perkalian.

Separuh lainnya adalah berapa token yang benar-benar dipakai model, dan itu tidak tertulis di katalog mana pun. Tidak ada penyedia yang memasang label "model ini cenderung memakai 700 token untuk menjawab pertanyaan sepele".

Model dengan harga per token lebih murah bisa berakhir jauh lebih mahal, dan kamu tidak akan tahu sebelum menjalankannya sendiri.

Contohnya ada di tabel pertama. qwen-3.5-flagship dan deepseek-v3-2 duduk di kelas harga yang tidak jauh berbeda per tokennya. Dalam praktik, pada set yang sama, satu memakai 726,0 token dan satu lagi 1,9. Kalau kamu merencanakan anggaran dari katalog, kamu akan meleset dengan faktor ratusan.

Ini juga alasan kenapa kami sekarang memilih model dari log pemakaian nyata, bukan dari katalog. Katalog memberi tahu harga; log memberi tahu tagihan.

Dan karena rentang antar-run selebar itu, satu run saja belum cukup jadi log yang bisa dipercaya.

Data & provenans

Keterbatasan

Perbandingan dilakukan pada satu format saja, pilihan ganda, yang merupakan kasus paling ekstrem untuk model penalaran; pada tugas mengarang selisihnya hampir pasti jauh lebih kecil. Tabel utama berasal dari satu run dengan 32 panggilan per model, bukan dari pengulangan terencana, jadi ia belum cukup untuk menyimpulkan varians model secara benar. Rentang antar-run yang dilaporkan mencampur sebab yang berbeda, termasuk perbedaan set soal dan panjang prompt, dan kami tidak mengukur porsi masing-masing. Angka token keluaran tidak diterjemahkan ke biaya karena harga berbeda antarpenyedia dan berubah sewaktu-waktu.

Riwayat revisi

Terbit
Terakhir diperbarui
belum pernah direvisi sejak terbit

Istilah dalam artikel ini

token
Potongan teks yang jadi satuan hitung model AI, kira-kira sepanjang suku kata sampai satu kata pendek. Harga layanan AI dihitung per juta token, masuk dan keluar dihitung terpisah, sehingga jawaban yang bertele-tele benar-benar lebih mahal daripada jawaban yang ringkas.

Ditulis penulis untuk artikel ini, bukan disalin dari entri kamus.