Insight

Seberapa jauh AI dan mesin bahasa kami bisa dipercaya?

Kami menguji mesin koreksi kami sendiri dan berbagai model AI dari luar terhadap bahasa Indonesia dan bahasa daerah, lalu menerbitkan angkanya apa adanya. Di halaman ini, kami meringkas tiap temuan jadi satu gambar saja. Metode lengkap dan data mentahnya bisa dibuka lewat tautan di tiap kartu.

9 temuanTiap temuan menaut ke versi teknisnya

9 temuan

BenchmarkEmpiris
Peringkat ongkos Peringkat skor
Gemma 4 31B
1
3
Qwen3-30B-A3B
2
7
Ling 3.0 Flash
3
6
GPT-5.6 Luna
4
2
DeepSeek V4 Flash
5
4
Mistral Small 3
6
9
Hunyuan A13B
7
10
Claude Haiku 4.5
8
5
Nemotron 3.5 Lightning
9
8
Gemini 3.5 Flash
10
1
Peringkat ongkos lawan peringkat skor, 1 paling baik

AI Terpintar di Kata Jawa Ternyata 187 Kali Lebih Boros

Kami menanyakan arti 135 kata Jawa kepada 10 model AI. Gemini 3.5 Flash menjawab benar paling banyak, 128 dari 135, dan sekaligus jadi model paling boros, 187 kali lebih mahal untuk tiap jawaban benar daripada model yang tertinggal 11 kata saja.

22 September 2026 · 4 menit bacaBaca temuannya →
BenchmarkEmpiris
Rumusan 1 Rumusan 3
Gemma 4 31B
32
60
Qwen3-30B-A3B
40
46
Ling 3.0 Flash
39
41
Mistral Small 3
39
38
Jawaban benar dari 69 kalimat yang sama persis

Ganti Prompt, Peringkat 4 AI Langsung Terbalik

Kami menguji 4 model AI pada 69 kalimat yang sama dengan tiga cara bertanya. Gemma 4 31B buatan Google juru kunci pada cara pertama dan teratas pada cara ketiga, dengan soal dan kunci jawaban yang tidak pernah berubah.

15 September 2026 · 3 menit bacaBaca temuannya →
BenchmarkEmpiris
11
Berbeda 11Sama 27
Jawaban ox-alpha dan GLM-5.3 pada 38 soal yang sama

Dua hari sebelum Z.ai buka suara, data kami sudah bilang ini bukan GLM-5.3

Pada 24 Agustus kami menulis bahwa ox-alpha bukan GLM-5.3, melainkan kerabatnya. Pada 26 Agustus Z.ai mengumumkan model itu adalah GLM-5.3-Flash. Bukan tebakan yang membawa kami ke sana, melainkan 38 soal bahasa Jawa.

30 Agustus 2026 · 3 menit bacaBaca temuannya →
Mesin koreksiData Terstruktur
32,8
Mustahil dipakai 32,8Bisa diadaptasi 64,3
Dari 2.909 aturan LanguageTool yang kami tambang

Kerabat Bahasa Terdekat Kita di LanguageTool Hanya Punya 44 Aturan

Sebelum menulis aturan tata bahasa dari nol, kami cek dulu apa yang bisa dipinjam dari LanguageTool, pemeriksa tata bahasa sumber terbuka terbesar yang ada. Ia punya modul untuk 35 bahasa. Bahasa dengan penutur terbanyak keempat di dunia bukan salah satunya.

21 Agustus 2026 · 2 menit bacaBaca temuannya →
BenchmarkEmpiris
Claude Haiku 4.5
72,22
Claude Sonnet 4.6
91,67
Skor benar dari 36 soal sopan santun bahasa Jawa

Diuji Unggah-Ungguh Jawa, AI Termurah Anthropic Salah 10 Kali

Claude Haiku, model termurah Anthropic, salah menjawab 10 dari 36 soal sopan santun bahasa Jawa. Claude Sonnet, versi mahalnya, hanya salah 3.

19 Agustus 2026 · 3 menit bacaBaca temuannya →
Mesin koreksiEmpiris
3.741 Ronde 1 2.729 Ronde 6
Jumlah penandaan mesin, ronde ke ronde

Mesin Koreksi Lulus Ujian, Gagal di Tulisan Asli

Kami arahkan pemeriksa ejaan buatan sendiri ke tulisan orang sungguhan, bukan ke kalimat uji. Ia menandai 3.741 hal, dan sebagian besar bukan kesalahan. Ini catatan enam ronde perbaikannya, termasuk angka yang sempat kami salah hitung sendiri.

17 Agustus 2026 · 2 menit bacaBaca temuannya →
KorpusEmpiris
Lolos jadi soal uji 43Dibuang 701
Dari 744 koreksi yang kami tambang

Kami Tambang 744 Koreksi Wikipedia, Hanya 43 Lolos

Riwayat suntingan Wikipedia terlihat seperti sumber koreksi ejaan siap pakai. Dari 744 yang kami tambang, cuma 43 yang benar-benar layak jadi soal uji. Sisanya bukan koreksi sungguhan.

15 Agustus 2026 · 2 menit bacaBaca temuannya →
Bahasa JawaEmpiris
Gugur karena buku vs penutur 6Tetap dipakai 34
Dari 40 soal bahasa Jawa yang kami susun

Buku Bilang Salah, Penutur Bilang Wajar: 6 Soal Bahasa Jawa Kami Gugur

Kami susun soal uji bahasa Jawa dari aturan buku tata bahasa. Enam dari 40 soal gugur, bukan karena AI menjawab salah, tapi karena bentuk yang menurut buku salah ternyata diterima luas oleh penutur asli.

14 Agustus 2026 · 2 menit bacaBaca temuannya →
KamusData Terstruktur
38.559
Tak pernah muncul 38.559Muncul di korpus 33.895
Dari 72.454 lema kamus kami

Hanya 899 dari 3.289 Kandidat Kosakata Baru Kami yang Lolos Saringan

Kami cari kata yang sering dipakai orang Indonesia tapi absen dari kamus kami. Ketemu 3.289 kandidat kata baru, tapi begitu diperiksa lebih dekat, hanya 899 yang benar-benar layak, sisanya nama merek, nama tempat, atau kata yang nyaris tidak pernah dipakai.

13 Agustus 2026 · 2 menit bacaBaca temuannya →