Kenapa Ini Penting
Model AI dipilih orang dengan cara yang sama seperti memilih paket data. Lihat harga per satuan, ambil yang paling murah. Untuk pekerjaan bahasa, cara itu bisa menyesatkan, dan kami ingin tahu seberapa jauh.
Kami menanyakan hal yang paling dasar kepada 10 model AI dari 10 perusahaan: apa arti kata Jawa ini dalam bahasa Indonesia? 135 kata, pertanyaan yang sama persis untuk semua model, dan kunci jawaban yang sudah diperiksa penutur.
Pertanyaan seperti ini enak diuji karena jawabannya tidak bisa setengah benar. Berbeda dengan menerjemahkan kalimat, yang satu kalimatnya bisa diterjemahkan dengan banyak cara yang sama bagusnya, arti sebuah kata itu kena atau tidak kena.
Lalu kami menghitung dua hal. Berapa jawaban yang benar, dan berapa ongkos untuk tiap jawaban yang benar. Angka kedua ini jarang dihitung orang, dan ia menceritakan hal yang sama sekali berbeda dari angka pertama.
Temuannya
10 model itu tersebar jauh. Model tertinggi menjawab benar 128 kata, yang terendah 22, dan sisanya mengisi hampir tiap titik di antaranya, misalnya Ling 3.0 Flash 70 kata dan Qwen3-30B-A3B 52 kata. Tidak ada dua kelompok yang terpisah rapi, yang ada satu deret panjang dari hampir sempurna sampai hampir tidak tahu apa-apa.
Gemini 3.5 Flash menjawab benar paling banyak, 128 dari 135 kata. Ia juga model paling boros di seluruh panel.
Gemma menghabiskan $0,0000154 untuk tiap jawaban benar. Gemini menghabiskan $0,0028749. Keduanya menjawab pertanyaan yang sama, dengan selisih hasil 11 kata dari 135.
Kalau dua peringkat itu ditaruh berdampingan, hubungannya nyaris tidak ada:
3
7
6
2
4
9
10
5
8
1
Gemma 4 31B berada di peringkat 1 untuk ongkos dan peringkat 3 untuk skor. Gemini kebalikannya persis, peringkat 1 untuk skor dan peringkat 10 untuk ongkos. Model yang murah per panggilan pun belum tentu hemat. Nemotron 3.5 Lightning berharga murah tiap kali dipanggil, tetapi berakhir sebagai model termahal kedua per jawaban benar.
Sebabnya begini. Nemotron menghabiskan token untuk menalar sebelum menjawab, dan penalarannya berbahasa Inggris walau pertanyaannya berbahasa Indonesia. Pada anggaran 600 token, seluruh jawabannya pulang kosong karena anggarannya habis sebelum jawaban keluar. Kami menaikkan anggarannya ke 4.000 token supaya ia sempat selesai. Ongkos nyatanya 30 kali lipat taksiran yang kami hitung dari tabel harga resminya.
Itu juga yang membuat perbandingan harga per satuan menyesatkan, sebab yang ditagih bukan pertanyaannya, melainkan seluruh kata yang dikeluarkan model, termasuk kata yang tidak pernah sampai ke pembaca.
Untuk memakai angka ini secara praktis, pertanyaannya bukan model mana yang paling pintar, melainkan berapa jawaban benar yang dibutuhkan dan berapa anggaran yang tersedia. Untuk pekerjaan yang hasilnya tetap diperiksa manusia belakangan, model dengan skor sedikit lebih rendah dan ongkos jauh lebih murah biasanya pilihan yang lebih masuk akal.
Batasannya
Angka-angka ini tidak boleh dibaca sebagai peringkat kepintaran. Kami memanggil 3 model teratas sebanyak 3 kali dengan 135 pertanyaan yang sama persis, dan skor mereka sendiri bergeser sampai 4 kata tanpa satu pun pertanyaan berubah. Selisih yang lebih kecil daripada itu bukan selisih kemampuan, melainkan goyangan biasa.
135 kata yang kami pakai juga bukan kata langka. Semuanya sudah ada di halaman kamus kami yang terbuka untuk umum sebelum pengujian ini, jadi skor tinggi belum tentu berarti model itu menguasai bahasa Jawa. Bisa saja ia pernah membaca kamus kami. Untuk memisahkan keduanya, kami sedang menyiapkan set kendali dari 192 kata yang belum pernah kami terbitkan di mana pun.
Dan harga model berubah sewaktu-waktu. Seluruh ongkos di halaman ini terukur pada Agustus 2026, dan tabel harga bisa bergeser kapan saja. Kami berharap yang bertahan lebih lama bukan angkanya, melainkan cara menghitungnya. Bandingkan ongkos untuk hasil yang benar, bukan ongkos untuk sekali bertanya.
Cara kami menyusun kunci jawaban, hasil lengkap 10 model, dan seluruh data mentahnya ada di versi teknis artikel ini.
Di balik temuan ini
Versi teknisnya memuat angka mentah, susunan pengujian, dan hal-hal yang justru tidak bisa disimpulkan darinya.