Prediksi kami gugur: tidak ada garis pemisah antara AI yang paham kata Jawa dan yang tidak
Alih-alih membuktikan jurang pemisah antara AI yang paham dan yang buta bahasa Jawa, langkah terakhir kami justru merobohkan garis batas itu.
Angka kunci
Angka ini dari mana?Diukur dari export-jv-B-hasil-model.csv dan 3 sumber lain
Prediksi kami, ditulis sebelum satu panggilan pun
Di artikel sebelumnya kami menguji 6 model AI pada 135 kata Jawa. Sesudah artikel itu terbit kami menambahkan Nemotron 3.5 Lightning dari NVIDIA sebagai model ketujuh, tanpa rencana apa pun selain memperluas panel. Susunan skor 7 model itu yang punya bentuk mencurigakan:
Angka di grafik itu sudah dihitung ulang terhadap kunci akhir supaya dapat diperiksa dari data yang kami terbitkan. Waktu perkiraan ditulis, Nemotron berada satu lema lebih rendah, dan bentuk celahnya sama saja.
5 model menumpuk di atas, 2 di dasar, dan tidak ada satu model pun di antara 20 dan 63 persen. Bacaan yang menggoda: model punya kosakata Jawa atau tidak punya, dan tidak ada keadaan di antaranya.
Masalahnya, dengan 7 model bentuk seperti itu bisa muncul dari kebetulan. Jadi sebelum menambah model berikutnya kami menulis 4 perkiraan, mengunci dokumennya bertanggal, dan baru sesudah itu memanggil model:
- Celah antara 20 dan 63 persen tetap kosong, dan 3 model baru mendarat di salah satu kelompok, bukan di antaranya.
- Qwen3-30B-A3B mendarat di kelompok atas walau bentuk arsitekturnya sama persis dengan Nemotron yang hanya benar 27 lema.
- Ling 3.0 Flash mendarat di kelompok atas, dan karena harganya paling murah ia merebut ongkos per jawaban benar terendah dari Gemma 4 31B.
- Hunyuan A13B mendarat di bawah 20 persen walau paling besar di antara ketiga model baru.
Kami juga menulis apa yang tidak kami klaim, dan bagian itu yang paling menentukan. Kami tidak punya dasar untuk membidik bagian tengah. Pengujian kami sebelumnya sudah menemukan bahwa keterangan resmi model tidak meramalkan perilakunya, dan uji pendahuluan 4 lema pun tidak memberi sinyal: hasilnya 0, 1, dan 3 dari 4, tanpa satu pun yang di tengah. Kami hanya bisa menyebar sampelnya.
3 model yang kami pilih untuk menggugurkan perkiraan sendiri
Ketiganya dari perusahaan yang belum pernah masuk panel kami, dan masing-masing menguji hal yang berbeda.
Qwen3-30B-A3B dari Alibaba kami pilih karena bentuk arsitekturnya sama persis dengan Nemotron 3.5 Lightning yang baru saja masuk panel: keduanya campuran pakar dengan 30 miliar parameter total dan 3 miliar aktif. Nemotron menjawab benar 27 lema. Kalau Qwen mendarat jauh di atasnya, bentuk arsitektur bukan penentunya.
Ling 3.0 Flash dari Ant Group hampir tidak pernah muncul di benchmark mana pun, dan ongkosnya $0,0000117 per panggilan, di antara yang termurah yang pernah kami panggil.
Hunyuan A13B dari Tencent adalah campuran pakar 80 miliar parameter dengan 13 miliar aktif, jauh lebih besar daripada dua lainnya.
Kami menolak 4 kandidat lain sebelum menjalankan apa pun. ByteDance Seed 1.6 Flash mengeluarkan 426 token penalaran lalu mengembalikan jawaban kosong. Qwen3-14B menghabiskan 10.124 milidetik untuk pertanyaan satu kata. StepFun dan Xiaomi berjalan di 4.190 dan 3.683 milidetik tanpa memberi sudut pengujian yang baru.
Hasilnya: celah itu terisi
3 model, 405 panggilan, ongkos seluruhnya $0,0051.
| Model | Benar dari 135 | Persen benar | Persentil semantik |
|---|---|---|---|
| Gemini 3.5 Flash | 128 | 94,8% | 94,7% |
| GPT-5.6 Luna | 118 | 87,4% | 90,7% |
| Gemma 4 31B | 117 | 86,7% | 92,0% |
| DeepSeek V4 Flash | 114 | 84,4% | 92,9% |
| Claude Haiku 4.5 | 86 | 63,7% | 84,9% |
| Ling 3.0 Flash | 70 | 51,9% | 81,8% |
| Qwen3-30B-A3B | 52 | 38,5% | 72,6% |
| Nemotron 3.5 Lightning | 27 | 20,0% | 64,8% |
| Mistral Small 3 | 24 | 17,8% | 49,9% |
| Hunyuan A13B | 22 | 16,3% | 63,1% |
4 model di tabel itu belum ada waktu artikel sebelumnya terbit. Nemotron 3.5 Lightning masuk lebih dulu dan ikut membentuk celah yang hendak kami uji. 3 sisanya, yang dicetak tebal, dipilih sesudah perkiraan dikunci dan justru untuk menggugurkannya.
Ling mendarat di 51,9 persen dan Qwen di 38,5 persen. Keduanya jatuh di dalam celah yang kami sebut kosong, pada percobaan pertama.
Deret 10 model sekarang menaik mulus dari 16,3 sampai 94,8 persen tanpa jurang di mana pun. Bentuk yang tampak seperti dua kelompok ternyata bentuk daftar model kami sendiri, bukan bentuk sebaran yang sesungguhnya.
Struktur yang terlihat pada panel kecil bisa lahir dari pilihan sampel, dan satu-satunya cara mengetahuinya adalah mencoba merusaknya dengan sengaja.
Perkiraan pertama gugur, dan bersamanya gugur pula bacaan bahwa model punya kosakata Jawa atau tidak punya, tanpa keadaan di antaranya. Perkiraan keempat justru benar: Hunyuan A13B mendarat di 16,3 persen, terendah dari 10 model, walau paling besar di antara ketiga model baru. Perusahaan besar dengan model besar tidak menjamin penguasaan kosakata Jawa. Perkiraan kedua dan ketiga dibahas di dua bagian berikutnya, dan keduanya meleset.
Tetap berdiri: bentuk arsitektur tidak menentukan apa pun
Perkiraan kedua meleset pada angkanya, tetapi hal yang hendak diujinya justru terjawab lebih bersih.
Kami memperkirakan Qwen3-30B-A3B mendarat di kelompok atas. Ia mendarat di 52 lema, jauh di bawah perkiraan. Namun Qwen dan Nemotron 3.5 Lightning membawa bentuk arsitektur yang sama persis, 30 miliar parameter total dengan 3 miliar aktif, dan terpisah hampir 2 kali lipat: 52 lema lawan 27 lema.
Jadi kesimpulan yang kami cari tetap didapat, hanya arah tebakannya yang salah. Jumlah parameter aktif tidak menerangkan siapa yang tahu arti gangsal dan siapa yang tidak. Hunyuan A13B menegaskannya dari sisi lain: model paling besar di antara ketiga model baru justru mendarat paling rendah.
Berapa skor bergeser kalau pertanyaannya diulang
Sebelum membandingkan model yang berdesakan, kami perlu tahu berapa skornya bergeser tanpa apa pun berubah. 3 model teratas kami panggil ulang 2 kali, dengan 135 pertanyaan yang sama persis, pada setting yang seharusnya membuat model selalu memilih jawaban paling mungkin.
| Model | Tiga jalan | Rentang | Teks jawaban berbeda | Vonis berbalik |
|---|---|---|---|---|
| GPT-5.6 Luna | 118 · 121 · 119 | 3 | 74% | 8% |
| Gemma 4 31B | 117 · 115 · 116 | 2 | 65% | 4% |
| DeepSeek V4 Flash | 114 · 110 · 110 | 4 | 84% | 7% |
Rentang terbesarnya 4 lema, angka yang sama persis dengan yang kami laporkan sebelumnya pada model paling lemah. Angka itu menjawab pertanyaan yang kami tinggalkan terbuka waktu itu: ragam sebesar itu bukan ciri model lemah saja, sebab ketiga model di tabel ini ada di kelompok teratas.
Akibatnya langsung. Jarak Luna ke Gemma 1 lema, Gemma ke DeepSeek 3 lema, dan keduanya lebih kecil daripada goyangan model itu sendiri. Urutan di dalam kelompok teratas tidak dapat dibaca sebagai urutan kemampuan. Hanya jarak antar-kelompok yang dapat dibaca, misalnya Gemini di 128 lema terhadap Ling di 70 lema.
Model dengan skor tertinggi paling mahal per jawaban benar
Angka yang jarang dihitung orang: bukan ongkos per panggilan, melainkan ongkos untuk tiap jawaban yang benar.
| Model | Benar | Ongkos per jawaban benar | Peringkat ongkos | Peringkat skor |
|---|---|---|---|---|
| Gemma 4 31B | 117 | $0,0000154 | 1 | 3 |
| Qwen3-30B-A3B | 52 | $0,0000175 | 2 | 7 |
| Ling 3.0 Flash | 70 | $0,0000226 | 3 | 6 |
| GPT-5.6 Luna | 118 | $0,0000478 | 4 | 2 |
| DeepSeek V4 Flash | 114 | $0,0000537 | 5 | 4 |
| Mistral Small 3 | 24 | $0,0000612 | 6 | 9 |
| Hunyuan A13B | 22 | $0,0001207 | 7 | 10 |
| Claude Haiku 4.5 | 86 | $0,0002924 | 8 | 5 |
| Nemotron 3.5 Lightning | 27 | $0,0009019 | 9 | 8 |
| Gemini 3.5 Flash | 128 | $0,0028749 | 10 | 1 |
Gemini 3.5 Flash menjawab benar paling banyak dan sekaligus paling buruk nilainya: 187 kali lebih mahal per jawaban benar daripada Gemma 4 31B, untuk 11 lema lebih banyak. Seluruh rentang panel ini 187 kali, dan urutannya nyaris tidak berhubungan dengan urutan skor.
Ongkosnya sengaja tidak kami gambar sebagai batang. Jarak termurah ke termahal 187 kali, dan pada sumbu biasa 9 dari 10 batang akan mengecil sampai tidak terbaca, sehingga grafiknya menyembunyikan justru yang perlu dilihat. Peringkatnya saja yang bisa digambar, dan di situ tampak keduanya nyaris tidak berhubungan:
3
7
6
2
4
9
10
5
8
1
Perkiraan ketiga kami menyangkut tabel ini, dan meleset dua kali. Ling 3.0 Flash memang model termurah per panggilan, tetapi ia menjawab benar 70 lema saja, dan Gemma 4 31B bertahan sebagai pemegang ongkos per jawaban benar terendah. Harga per panggilan menentukan urutan hanya kalau skornya setara, dan di sini skornya tidak setara.
Nemotron 3.5 Lightning menunjukkan kenapa taksiran dari tabel harga tidak bisa dipercaya. Keterangan resminya menyatakan penalaran tidak aktif secara bawaan. Ia menalar, dalam bahasa Inggris, untuk pertanyaan berbahasa Indonesia, dan pada anggaran 600 token seluruh jawabannya pulang kosong. Kami menaikkan anggarannya ke 4.000 token supaya ia sempat menyelesaikan penalarannya. Ongkos nyatanya 30 kali lipat taksiran tabel harga.
Kunci kami sendiri diuji, dan tidak bergerak
Menambah 4 model berarti menambah 540 jawaban baru yang belum pernah dibaca penutur. Sebagian di antaranya benar dengan cara yang belum terdaftar di kunci, dan itu risiko nyata: kalau kunci kami masih longgar, angka seluruh panel ikut bergeser.
Penutur meninjau keempatnya, dan hasilnya menambah 6 kunci pada 4 lema, dari 540 menjadi 546. Tidak ada satu pun kunci yang dihapus. Kami menghitung ulang skor seluruh 10 model terhadap kunci baru itu.
6 model yang angkanya sudah kami terbitkan sebelumnya tidak bergeser satu lema pun. Kunci tambahan hanya menyelamatkan jawaban model yang baru masuk panel. Bagi kami ini angka yang penting, sebab pengujian kami yang paling awal justru sebaliknya: alat ukurnya bergerak dari 83,8 ke 90,6 persen dalam 6 hari tanpa satu model pun berubah, dan pada set 43 kata langka 1 model naik 14 lema sendirian setelah tinjauan. 6 putaran pemeriksaan tampaknya cukup untuk membuat kunci berhenti bergerak.
Kunci jawaban tidak memisahkan 3 model terbawah, kemiripan makna memisahkannya
3 model terbawah praktis imbang kalau dinilai dari kunci: Nemotron 27, Mistral 24, Hunyuan 22. Selisihnya di bawah ragam antar-jalan, jadi ketiganya tidak dapat diurutkan.
Kolom kemiripan makna memisahkan mereka dengan tegas. Kolom itu mengukur kedekatan jawaban model terhadap definisi kamus, dilaporkan sebagai persentil terhadap skor kebetulan yang kami hitung dengan menyilangkan tiap jawaban ke definisi seluruh lema lain.
Mistral Small 3 duduk di 49,9 persen, artinya persis di titik nol, setara menjawab acak. Hunyuan di 63,1 persen dan Nemotron di 64,8 persen, keduanya nyata di atasnya. Jawaban salah pun punya derajat: ada yang meleset dekat dan ada yang sama sekali tidak menyentuh persoalan, dan penilaian berbasis kunci saja membuang perbedaan itu.
Ditaruh berdampingan, kedua ukuran itu berjalan seiring di kelompok atas lalu berpisah di dasar.
94,7
90,7
92,0
92,9
84,9
81,8
72,6
64,8
49,9
63,1
Daya pisah kolom semantik terhadap vonis kunci, diukur dengan AUC, 0,896 atas seluruh 135 lema.
Batas simpulan
Bukan berarti model yang skornya tinggi menguasai bahasa Jawa. 135 lema di set ini seluruhnya sudah terbit di halaman kamus kami yang terindeks publik sebelum pengujian, jadi skor tinggi tidak dapat dibedakan antara memahami bahasa Jawa dan pernah membaca kamus kami. Untuk menjawabnya kami menyiapkan set kendali dari 192 lema yang belum pernah kami pakai maupun terbitkan.
Bukan berarti urutan di tabel pertama adalah peringkat. Selisih yang lebih kecil daripada 4 lema tidak dapat dibaca, dan itu mencakup sebagian besar jarak di kelompok teratas.
Bukan berarti model murah selalu lebih hemat. Nemotron 3.5 Lightning berharga murah per token dan tetap menjadi model termahal kedua per jawaban benar, karena ia membakar token penalaran yang tidak menghasilkan jawaban.
Bukan berarti perkiraan kami gugur karena salah dirancang. Perkiraan itu memang disusun untuk bisa gugur, dan kandidatnya dipilih untuk menggugurkannya. Kalau celah itu tetap kosong, kami akan melaporkan bahwa sebarannya terbelah. Hasil ini layak dibaca bukan karena arah temuannya, melainkan karena arahnya ditetapkan sebelum datanya ada.
Seluruh jawaban model, kunci jawabannya, dan jawaban mentah dari ketiga jalan pengulangan dapat diunduh dari tautan di bawah.
Data & provenans
Keterbatasan
135 lema di set ini bukan kata langka. Seluruhnya sudah terbit di halaman kamus kami yang terindeks publik sebelum pengujian ini, jadi skor tinggi tidak dapat dibedakan antara menguasai bahasa Jawa dan pernah membaca kamus kami. Set kendali dari lema yang belum pernah kami terbitkan sedang disiapkan untuk menjawabnya.
Ragam antar-jalan kami ukur pada 3 model saja, seluruhnya dari kelompok teratas. 7 model lain dipanggil 1 kali per lema, sehingga skornya membawa ketidakpastian yang belum terukur.
4 model yang baru masuk panel melewati 1 putaran tinjauan penutur, sementara 6 model sebelumnya melewati 6 putaran. Kunci jawabannya memang sudah tidak bergerak, tetapi kedua kelompok itu tidak melewati jumlah pemeriksaan yang sama.
Tidak ada satu pun keluarga model yang diwakili dua ukuran berbeda di panel ini, jadi pertanyaan apakah yang menentukan itu besar model atau data latihnya tidak dapat dijawab dari panel ini.
Artikel ini rekaman awal dari perjalanan panjang benchmark-nusantara, yang saat tulisan ini terbit masih berjalan menuju naskah akademik. Angka di halaman benchmark dan halaman model situs publik akan terus berubah seiring model baru masuk dan metodologi disempurnakan, jadi kalau kelak berbeda dari yang tertulis di sini, itu bukan kesalahan, melainkan tanda proyeknya terus bergerak.
Riwayat revisi
- Terbit
- Terakhir diperbarui
Istilah dalam artikel ini
- lema
- Bentuk dasar sebuah kata yang menjadi tajuk satu entri kamus, dan yang dicari orang saat membuka kamus. Satu lema dapat memayungi beberapa makna sekaligus, dan tiap makna dapat membawa contoh kalimatnya sendiri.
- token
- Potongan teks yang jadi satuan hitung model AI, kira-kira sepanjang suku kata sampai satu kata pendek. Harga layanan AI dihitung per juta token, masuk dan keluar dihitung terpisah, sehingga jawaban yang bertele-tele benar-benar lebih mahal daripada jawaban yang ringkas.
Ditulis penulis untuk artikel ini, bukan disalin dari entri kamus.