Empiris· 11 menit baca

Prediksi kami gugur: tidak ada garis pemisah antara AI yang paham kata Jawa dan yang tidak

Alih-alih membuktikan jurang pemisah antara AI yang paham dan yang buta bahasa Jawa, langkah terakhir kami justru merobohkan garis batas itu.

Diukur dari export-jv-B-hasil-model.csv dan 3 sumber lain

10
Model diuji
135
Kata Jawa
1 dari 4
Prediksi benar
187 kali
Selisih ongkos

Prediksi kami, ditulis sebelum satu panggilan pun

Di artikel sebelumnya kami menguji 6 model AI pada 135 kata Jawa. Sesudah artikel itu terbit kami menambahkan Nemotron 3.5 Lightning dari NVIDIA sebagai model ketujuh, tanpa rencana apa pun selain memperluas panel. Susunan skor 7 model itu yang punya bentuk mencurigakan:

Gemini 3.5 Flash
128
GPT-5.6 Luna
118
Gemma 4 31B
117
DeepSeek V4 Flash
114
Claude Haiku 4.5
86
Nemotron 3.5 Lightning
27
Mistral Small 3
24
Jawaban benar dari 135 lema, panel 7 model sebelum 3 model terakhir ditambahkan

Angka di grafik itu sudah dihitung ulang terhadap kunci akhir supaya dapat diperiksa dari data yang kami terbitkan. Waktu perkiraan ditulis, Nemotron berada satu lema lebih rendah, dan bentuk celahnya sama saja.

5 model menumpuk di atas, 2 di dasar, dan tidak ada satu model pun di antara 20 dan 63 persen. Bacaan yang menggoda: model punya kosakata Jawa atau tidak punya, dan tidak ada keadaan di antaranya.

Masalahnya, dengan 7 model bentuk seperti itu bisa muncul dari kebetulan. Jadi sebelum menambah model berikutnya kami menulis 4 perkiraan, mengunci dokumennya bertanggal, dan baru sesudah itu memanggil model:

  1. Celah antara 20 dan 63 persen tetap kosong, dan 3 model baru mendarat di salah satu kelompok, bukan di antaranya.
  2. Qwen3-30B-A3B mendarat di kelompok atas walau bentuk arsitekturnya sama persis dengan Nemotron yang hanya benar 27 lema.
  3. Ling 3.0 Flash mendarat di kelompok atas, dan karena harganya paling murah ia merebut ongkos per jawaban benar terendah dari Gemma 4 31B.
  4. Hunyuan A13B mendarat di bawah 20 persen walau paling besar di antara ketiga model baru.

Kami juga menulis apa yang tidak kami klaim, dan bagian itu yang paling menentukan. Kami tidak punya dasar untuk membidik bagian tengah. Pengujian kami sebelumnya sudah menemukan bahwa keterangan resmi model tidak meramalkan perilakunya, dan uji pendahuluan 4 lema pun tidak memberi sinyal: hasilnya 0, 1, dan 3 dari 4, tanpa satu pun yang di tengah. Kami hanya bisa menyebar sampelnya.

3 model yang kami pilih untuk menggugurkan perkiraan sendiri

Ketiganya dari perusahaan yang belum pernah masuk panel kami, dan masing-masing menguji hal yang berbeda.

Qwen3-30B-A3B dari Alibaba kami pilih karena bentuk arsitekturnya sama persis dengan Nemotron 3.5 Lightning yang baru saja masuk panel: keduanya campuran pakar dengan 30 miliar parameter total dan 3 miliar aktif. Nemotron menjawab benar 27 lema. Kalau Qwen mendarat jauh di atasnya, bentuk arsitektur bukan penentunya.

Ling 3.0 Flash dari Ant Group hampir tidak pernah muncul di benchmark mana pun, dan ongkosnya $0,0000117 per panggilan, di antara yang termurah yang pernah kami panggil.

Hunyuan A13B dari Tencent adalah campuran pakar 80 miliar parameter dengan 13 miliar aktif, jauh lebih besar daripada dua lainnya.

Kami menolak 4 kandidat lain sebelum menjalankan apa pun. ByteDance Seed 1.6 Flash mengeluarkan 426 token penalaran lalu mengembalikan jawaban kosong. Qwen3-14B menghabiskan 10.124 milidetik untuk pertanyaan satu kata. StepFun dan Xiaomi berjalan di 4.190 dan 3.683 milidetik tanpa memberi sudut pengujian yang baru.

Hasilnya: celah itu terisi

3 model, 405 panggilan, ongkos seluruhnya $0,0051.

ModelBenar dari 135Persen benarPersentil semantik
Gemini 3.5 Flash12894,8%94,7%
GPT-5.6 Luna11887,4%90,7%
Gemma 4 31B11786,7%92,0%
DeepSeek V4 Flash11484,4%92,9%
Claude Haiku 4.58663,7%84,9%
Ling 3.0 Flash7051,9%81,8%
Qwen3-30B-A3B5238,5%72,6%
Nemotron 3.5 Lightning2720,0%64,8%
Mistral Small 32417,8%49,9%
Hunyuan A13B2216,3%63,1%

4 model di tabel itu belum ada waktu artikel sebelumnya terbit. Nemotron 3.5 Lightning masuk lebih dulu dan ikut membentuk celah yang hendak kami uji. 3 sisanya, yang dicetak tebal, dipilih sesudah perkiraan dikunci dan justru untuk menggugurkannya.

Gemini 3.5 Flash
128
GPT-5.6 Luna
118
Gemma 4 31B
117
DeepSeek V4 Flash
114
Claude Haiku 4.5
86
Ling 3.0 Flash
70
Qwen3-30B-A3B
52
Nemotron 3.5 Lightning
27
Mistral Small 3
24
Hunyuan A13B
22
Jawaban benar dari 135 lema Jawa

Ling mendarat di 51,9 persen dan Qwen di 38,5 persen. Keduanya jatuh di dalam celah yang kami sebut kosong, pada percobaan pertama.

2 dari 3
model yang kami pilih untuk menguji perkiraan sendiri mendarat tepat di celah yang kami perkirakan akan tetap kosong

Deret 10 model sekarang menaik mulus dari 16,3 sampai 94,8 persen tanpa jurang di mana pun. Bentuk yang tampak seperti dua kelompok ternyata bentuk daftar model kami sendiri, bukan bentuk sebaran yang sesungguhnya.

Struktur yang terlihat pada panel kecil bisa lahir dari pilihan sampel, dan satu-satunya cara mengetahuinya adalah mencoba merusaknya dengan sengaja.

Perkiraan pertama gugur, dan bersamanya gugur pula bacaan bahwa model punya kosakata Jawa atau tidak punya, tanpa keadaan di antaranya. Perkiraan keempat justru benar: Hunyuan A13B mendarat di 16,3 persen, terendah dari 10 model, walau paling besar di antara ketiga model baru. Perusahaan besar dengan model besar tidak menjamin penguasaan kosakata Jawa. Perkiraan kedua dan ketiga dibahas di dua bagian berikutnya, dan keduanya meleset.

Tetap berdiri: bentuk arsitektur tidak menentukan apa pun

Perkiraan kedua meleset pada angkanya, tetapi hal yang hendak diujinya justru terjawab lebih bersih.

Kami memperkirakan Qwen3-30B-A3B mendarat di kelompok atas. Ia mendarat di 52 lema, jauh di bawah perkiraan. Namun Qwen dan Nemotron 3.5 Lightning membawa bentuk arsitektur yang sama persis, 30 miliar parameter total dengan 3 miliar aktif, dan terpisah hampir 2 kali lipat: 52 lema lawan 27 lema.

Jadi kesimpulan yang kami cari tetap didapat, hanya arah tebakannya yang salah. Jumlah parameter aktif tidak menerangkan siapa yang tahu arti gangsal dan siapa yang tidak. Hunyuan A13B menegaskannya dari sisi lain: model paling besar di antara ketiga model baru justru mendarat paling rendah.

Berapa skor bergeser kalau pertanyaannya diulang

Sebelum membandingkan model yang berdesakan, kami perlu tahu berapa skornya bergeser tanpa apa pun berubah. 3 model teratas kami panggil ulang 2 kali, dengan 135 pertanyaan yang sama persis, pada setting yang seharusnya membuat model selalu memilih jawaban paling mungkin.

ModelTiga jalanRentangTeks jawaban berbedaVonis berbalik
GPT-5.6 Luna118 · 121 · 119374%8%
Gemma 4 31B117 · 115 · 116265%4%
DeepSeek V4 Flash114 · 110 · 110484%7%
GPT-5.6 Luna
118 ke 121
Gemma 4 31B
115 ke 117
DeepSeek V4 Flash
110 ke 114
Skor terendah sampai tertinggi pada 3 jalan yang pertanyaannya sama persis

Rentang terbesarnya 4 lema, angka yang sama persis dengan yang kami laporkan sebelumnya pada model paling lemah. Angka itu menjawab pertanyaan yang kami tinggalkan terbuka waktu itu: ragam sebesar itu bukan ciri model lemah saja, sebab ketiga model di tabel ini ada di kelompok teratas.

Akibatnya langsung. Jarak Luna ke Gemma 1 lema, Gemma ke DeepSeek 3 lema, dan keduanya lebih kecil daripada goyangan model itu sendiri. Urutan di dalam kelompok teratas tidak dapat dibaca sebagai urutan kemampuan. Hanya jarak antar-kelompok yang dapat dibaca, misalnya Gemini di 128 lema terhadap Ling di 70 lema.

Model dengan skor tertinggi paling mahal per jawaban benar

Angka yang jarang dihitung orang: bukan ongkos per panggilan, melainkan ongkos untuk tiap jawaban yang benar.

ModelBenarOngkos per jawaban benarPeringkat ongkosPeringkat skor
Gemma 4 31B117$0,000015413
Qwen3-30B-A3B52$0,000017527
Ling 3.0 Flash70$0,000022636
GPT-5.6 Luna118$0,000047842
DeepSeek V4 Flash114$0,000053754
Mistral Small 324$0,000061269
Hunyuan A13B22$0,0001207710
Claude Haiku 4.586$0,000292485
Nemotron 3.5 Lightning27$0,000901998
Gemini 3.5 Flash128$0,0028749101

Gemini 3.5 Flash menjawab benar paling banyak dan sekaligus paling buruk nilainya: 187 kali lebih mahal per jawaban benar daripada Gemma 4 31B, untuk 11 lema lebih banyak. Seluruh rentang panel ini 187 kali, dan urutannya nyaris tidak berhubungan dengan urutan skor.

Ongkosnya sengaja tidak kami gambar sebagai batang. Jarak termurah ke termahal 187 kali, dan pada sumbu biasa 9 dari 10 batang akan mengecil sampai tidak terbaca, sehingga grafiknya menyembunyikan justru yang perlu dilihat. Peringkatnya saja yang bisa digambar, dan di situ tampak keduanya nyaris tidak berhubungan:

Peringkat ongkos Peringkat skor
Gemma 4 31B
1
3
Qwen3-30B-A3B
2
7
Ling 3.0 Flash
3
6
GPT-5.6 Luna
4
2
DeepSeek V4 Flash
5
4
Mistral Small 3
6
9
Hunyuan A13B
7
10
Claude Haiku 4.5
8
5
Nemotron 3.5 Lightning
9
8
Gemini 3.5 Flash
10
1
Peringkat ongkos lawan peringkat skor, 1 paling baik

Perkiraan ketiga kami menyangkut tabel ini, dan meleset dua kali. Ling 3.0 Flash memang model termurah per panggilan, tetapi ia menjawab benar 70 lema saja, dan Gemma 4 31B bertahan sebagai pemegang ongkos per jawaban benar terendah. Harga per panggilan menentukan urutan hanya kalau skornya setara, dan di sini skornya tidak setara.

Nemotron 3.5 Lightning menunjukkan kenapa taksiran dari tabel harga tidak bisa dipercaya. Keterangan resminya menyatakan penalaran tidak aktif secara bawaan. Ia menalar, dalam bahasa Inggris, untuk pertanyaan berbahasa Indonesia, dan pada anggaran 600 token seluruh jawabannya pulang kosong. Kami menaikkan anggarannya ke 4.000 token supaya ia sempat menyelesaikan penalarannya. Ongkos nyatanya 30 kali lipat taksiran tabel harga.

Kunci kami sendiri diuji, dan tidak bergerak

Menambah 4 model berarti menambah 540 jawaban baru yang belum pernah dibaca penutur. Sebagian di antaranya benar dengan cara yang belum terdaftar di kunci, dan itu risiko nyata: kalau kunci kami masih longgar, angka seluruh panel ikut bergeser.

Penutur meninjau keempatnya, dan hasilnya menambah 6 kunci pada 4 lema, dari 540 menjadi 546. Tidak ada satu pun kunci yang dihapus. Kami menghitung ulang skor seluruh 10 model terhadap kunci baru itu.

6 model yang angkanya sudah kami terbitkan sebelumnya tidak bergeser satu lema pun. Kunci tambahan hanya menyelamatkan jawaban model yang baru masuk panel. Bagi kami ini angka yang penting, sebab pengujian kami yang paling awal justru sebaliknya: alat ukurnya bergerak dari 83,8 ke 90,6 persen dalam 6 hari tanpa satu model pun berubah, dan pada set 43 kata langka 1 model naik 14 lema sendirian setelah tinjauan. 6 putaran pemeriksaan tampaknya cukup untuk membuat kunci berhenti bergerak.

Kunci jawaban tidak memisahkan 3 model terbawah, kemiripan makna memisahkannya

3 model terbawah praktis imbang kalau dinilai dari kunci: Nemotron 27, Mistral 24, Hunyuan 22. Selisihnya di bawah ragam antar-jalan, jadi ketiganya tidak dapat diurutkan.

Kolom kemiripan makna memisahkan mereka dengan tegas. Kolom itu mengukur kedekatan jawaban model terhadap definisi kamus, dilaporkan sebagai persentil terhadap skor kebetulan yang kami hitung dengan menyilangkan tiap jawaban ke definisi seluruh lema lain.

Mistral Small 3 duduk di 49,9 persen, artinya persis di titik nol, setara menjawab acak. Hunyuan di 63,1 persen dan Nemotron di 64,8 persen, keduanya nyata di atasnya. Jawaban salah pun punya derajat: ada yang meleset dekat dan ada yang sama sekali tidak menyentuh persoalan, dan penilaian berbasis kunci saja membuang perbedaan itu.

Ditaruh berdampingan, kedua ukuran itu berjalan seiring di kelompok atas lalu berpisah di dasar.

Persen benar Persentil semantik
Gemini 3.5 Flash
94,8
94,7
GPT-5.6 Luna
87,4
90,7
Gemma 4 31B
86,7
92,0
DeepSeek V4 Flash
84,4
92,9
Claude Haiku 4.5
63,7
84,9
Ling 3.0 Flash
51,9
81,8
Qwen3-30B-A3B
38,5
72,6
Nemotron 3.5 Lightning
20,0
64,8
Mistral Small 3
17,8
49,9
Hunyuan A13B
16,3
63,1
Persen benar lawan persentil kemiripan makna

Daya pisah kolom semantik terhadap vonis kunci, diukur dengan AUC, 0,896 atas seluruh 135 lema.

Batas simpulan

Bukan berarti model yang skornya tinggi menguasai bahasa Jawa. 135 lema di set ini seluruhnya sudah terbit di halaman kamus kami yang terindeks publik sebelum pengujian, jadi skor tinggi tidak dapat dibedakan antara memahami bahasa Jawa dan pernah membaca kamus kami. Untuk menjawabnya kami menyiapkan set kendali dari 192 lema yang belum pernah kami pakai maupun terbitkan.

Bukan berarti urutan di tabel pertama adalah peringkat. Selisih yang lebih kecil daripada 4 lema tidak dapat dibaca, dan itu mencakup sebagian besar jarak di kelompok teratas.

Bukan berarti model murah selalu lebih hemat. Nemotron 3.5 Lightning berharga murah per token dan tetap menjadi model termahal kedua per jawaban benar, karena ia membakar token penalaran yang tidak menghasilkan jawaban.

Bukan berarti perkiraan kami gugur karena salah dirancang. Perkiraan itu memang disusun untuk bisa gugur, dan kandidatnya dipilih untuk menggugurkannya. Kalau celah itu tetap kosong, kami akan melaporkan bahwa sebarannya terbelah. Hasil ini layak dibaca bukan karena arah temuannya, melainkan karena arahnya ditetapkan sebelum datanya ada.

Seluruh jawaban model, kunci jawabannya, dan jawaban mentah dari ketiga jalan pengulangan dapat diunduh dari tautan di bawah.

Data & provenans

Keterbatasan

135 lema di set ini bukan kata langka. Seluruhnya sudah terbit di halaman kamus kami yang terindeks publik sebelum pengujian ini, jadi skor tinggi tidak dapat dibedakan antara menguasai bahasa Jawa dan pernah membaca kamus kami. Set kendali dari lema yang belum pernah kami terbitkan sedang disiapkan untuk menjawabnya.

Ragam antar-jalan kami ukur pada 3 model saja, seluruhnya dari kelompok teratas. 7 model lain dipanggil 1 kali per lema, sehingga skornya membawa ketidakpastian yang belum terukur.

4 model yang baru masuk panel melewati 1 putaran tinjauan penutur, sementara 6 model sebelumnya melewati 6 putaran. Kunci jawabannya memang sudah tidak bergerak, tetapi kedua kelompok itu tidak melewati jumlah pemeriksaan yang sama.

Tidak ada satu pun keluarga model yang diwakili dua ukuran berbeda di panel ini, jadi pertanyaan apakah yang menentukan itu besar model atau data latihnya tidak dapat dijawab dari panel ini.

Artikel ini rekaman awal dari perjalanan panjang benchmark-nusantara, yang saat tulisan ini terbit masih berjalan menuju naskah akademik. Angka di halaman benchmark dan halaman model situs publik akan terus berubah seiring model baru masuk dan metodologi disempurnakan, jadi kalau kelak berbeda dari yang tertulis di sini, itu bukan kesalahan, melainkan tanda proyeknya terus bergerak.

Riwayat revisi

Terbit
Terakhir diperbarui

Istilah dalam artikel ini

lema
Bentuk dasar sebuah kata yang menjadi tajuk satu entri kamus, dan yang dicari orang saat membuka kamus. Satu lema dapat memayungi beberapa makna sekaligus, dan tiap makna dapat membawa contoh kalimatnya sendiri.
token
Potongan teks yang jadi satuan hitung model AI, kira-kira sepanjang suku kata sampai satu kata pendek. Harga layanan AI dihitung per juta token, masuk dan keluar dihitung terpisah, sehingga jawaban yang bertele-tele benar-benar lebih mahal daripada jawaban yang ringkas.

Ditulis penulis untuk artikel ini, bukan disalin dari entri kamus.