Kami menguji model samaran ox-alpha saat masih gratis, lalu menguji model resmi yang dinyatakan Z.ai sebagai dirinya, GLM-5.3-Flash, di set soal yang sama. Skor naik dari 49 menjadi 54 dari 60 di slang Indonesia dan dari 27 menjadi 32 dari 38 di tingkat tutur Jawa. Sisanya mirip: kecocokan jawaban 88% dan 79%.
54/60Skor id-B49/60Skor uji88%Jawaban cocok
Kami menguji 4 model AI pada 69 kalimat yang sama dengan tiga rumusan prompt berbeda. Rumusan kedua menaikkan skor satu model dari 32 menjadi 59, dan rumusan itu bertentangan dengan kunci jawaban kami sendiri di 40 tempat.
69Kalimat diuji3Rumusan prompt27 poinLonjakan skor
Dua model NVIDIA yang dibagikan gratis kami uji pada 42 soal slang Indonesia. Nemotron Super 120 miliar parameter menjawab benar 34, Nemotron 3.5 Lightning menjawab benar 26, dan keduanya masih di bawah Gemma 31 miliar parameter yang tarifnya recehan.
34/42Nemotron Super26/42Nemotron 3.541/42Gemma 4 31B
Dua model terkecil yang pernah kami uji, LFM2.5 2,6 miliar parameter dan hy-mt2 1,8 miliar, bertarung pada 60 soal slang Indonesia. Skornya imbang telak, tetapi cara keduanya gagal bertolak belakang, dan satu di antaranya sempat mencoba memanggil Google di ruang ujian tertutup.
34/60hy-mt2 1,8B32/60LFM2.5 2,6B358xRasio token
Kami menguji ox-alpha dan GLM-5.3 pada tingkat tutur Jawa dan slang Indonesia di lajur uji terpisah dari papan resmi. GLM-5.3 unggul di keempat pengukuran, dan kecocokan jawaban 71% menunjukkan keduanya bukan model yang sama.
57/60GLM-5.349/60ox-alpha34/60hy-mt2 (1,8B)
Kami menguji 10 model AI pada 135 kata Jawa dan memperkirakan hasilnya terbelah dua kelompok dengan celah kosong di tengah. 3 model terakhir kami pilih justru karena paling mungkin menggugurkan perkiraan itu, dan 2 di antaranya mendarat tepat di celah yang kami sebut kosong.
10Model diuji135Kata Jawa1 dari 4Prediksi benar
Tiga artikel sebelumnya berakhir dengan pengakuan yang sama: tiap kali kami membaca jawaban satu model dan memperbaiki kunci, model itulah yang paling diuntungkan. Kali ini protokolnya dirancang supaya hal itu mustahil, dan pada 135 kata Jawa dengan 6 model AI, protokolnya bekerja. Yang tidak kami duga: setelah alat ukurnya berhenti bergerak, model AI-nya sendiri yang goyah. Pada temperature 0 yang seharusnya menghasilkan jawaban identik, 36 persen jawaban berubah antara dua panggilan berturut-turut.
135Kata Jawa6Model AI36%Jawaban berubah
Peringkat model di benchmark Jawa kami selama ini ditentukan kunci jawaban tulisan manusia. Untuk memeriksa apakah peringkat itu nyata, kami pasang alat ukur kedua yang tidak pernah melihat kunci: IndoBERT, model kecil 40 MB yang berjalan di komputer sendiri. Urutan keempat modelnya keluar sama persis. Tetapi 63 persen kemiripan yang diukurnya ternyata bukan makna, melainkan pola kalimat yang sama, dan itu harus diukur lebih dulu sebelum satu angka pun dapat dibaca.
43Kata Jawa diuji40 MBIndoBERT lokal, alat ukur kedua63%Kemiripan yang ternyata pola kalimat
Empat model AI ditanya arti 43 kata Jawa yang tidak muncul di NusaX, NusaWrites, maupun Wiktionary Jawa. Mistral Small 3 benar 5 persen, DeepSeek V4 Flash 53 persen, GPT-5.6 Luna 81 persen, Gemini 3.5 Flash 91 persen. Alat ukurnya sendiri ditambal dua kali di tengah pengukuran, dan tiap tambalan menaikkan skor tanpa satu panggilan pun diulang.
43Kata Jawa91%Skor maksimum4 ModelMistral, DeepSeek, GPT, Gemini
Contoh kalimat di kamus Jawa kami dipakai sebagai soal, glos Indonesianya dipakai sebagai kunci jawaban. Dua model AI diuji. Pada adu buta 20 pasang, glos kami menang 4 kali, model menang 5 kali, dan 11 sisanya seri. Kunci jawaban yang tidak lebih baik dari yang dinilainya tidak mengukur kemampuan, melainkan kesepakatan diksi.
11 dari 20Adu buta berakhir seri0 dari 20Cocok persis dengan glos kami2Model AI diuji
Set uji slang kami menyediakan jawaban gratis bagi siapa saja yang membaca opsi. Namun, model AI hanya mengambil paling banyak 1,00 dari 4,1 item.
38 soalSet slang yang diuji4,1 soalJawaban gratis yang tersedia1,00 soalYang benar-benar diambil model
Mistral Small 3 dan Llama 3.1 8B Instruct dijual dengan harga yang sama persis dan sama cepatnya. Pada 69 soal menormalkan tulisan singkatan ke bahasa Indonesia baku, yang satu benar 56,52%, yang lain 26,09%.
69 soalSoal56,52%Mistral Small 326,09%Llama 3.1 8B