Insight

Seberapa jauh AI dan mesin bahasa kami bisa dipercaya?

Kami menguji mesin koreksi kami sendiri dan berbagai model AI dari luar terhadap bahasa Indonesia dan bahasa daerah, lalu menerbitkan angkanya apa adanya. Di halaman ini, kami meringkas tiap temuan jadi satu gambar saja. Metode lengkap dan data mentahnya bisa dibuka lewat tautan di tiap kartu.

4 temuanTiap temuan menaut ke versi teknisnya
TersaringBenchmarkHapus penyaring

4 temuan

BenchmarkEmpiris
Peringkat ongkos Peringkat skor
Gemma 4 31B
1
3
Qwen3-30B-A3B
2
7
Ling 3.0 Flash
3
6
GPT-5.6 Luna
4
2
DeepSeek V4 Flash
5
4
Mistral Small 3
6
9
Hunyuan A13B
7
10
Claude Haiku 4.5
8
5
Nemotron 3.5 Lightning
9
8
Gemini 3.5 Flash
10
1
Peringkat ongkos lawan peringkat skor, 1 paling baik

AI Terpintar di Kata Jawa Ternyata 187 Kali Lebih Boros

Kami menanyakan arti 135 kata Jawa kepada 10 model AI. Gemini 3.5 Flash menjawab benar paling banyak, 128 dari 135, dan sekaligus jadi model paling boros, 187 kali lebih mahal untuk tiap jawaban benar daripada model yang tertinggal 11 kata saja.

22 September 2026 · 4 menit bacaBaca temuannya →
BenchmarkEmpiris
Rumusan 1 Rumusan 3
Gemma 4 31B
32
60
Qwen3-30B-A3B
40
46
Ling 3.0 Flash
39
41
Mistral Small 3
39
38
Jawaban benar dari 69 kalimat yang sama persis

Ganti Prompt, Peringkat 4 AI Langsung Terbalik

Kami menguji 4 model AI pada 69 kalimat yang sama dengan tiga cara bertanya. Gemma 4 31B buatan Google juru kunci pada cara pertama dan teratas pada cara ketiga, dengan soal dan kunci jawaban yang tidak pernah berubah.

15 September 2026 · 3 menit bacaBaca temuannya →
BenchmarkEmpiris
11
Berbeda 11Sama 27
Jawaban ox-alpha dan GLM-5.3 pada 38 soal yang sama

Dua hari sebelum Z.ai buka suara, data kami sudah bilang ini bukan GLM-5.3

Pada 24 Agustus kami menulis bahwa ox-alpha bukan GLM-5.3, melainkan kerabatnya. Pada 26 Agustus Z.ai mengumumkan model itu adalah GLM-5.3-Flash. Bukan tebakan yang membawa kami ke sana, melainkan 38 soal bahasa Jawa.

30 Agustus 2026 · 3 menit bacaBaca temuannya →
BenchmarkEmpiris
Claude Haiku 4.5
72,22
Claude Sonnet 4.6
91,67
Skor benar dari 36 soal sopan santun bahasa Jawa

Diuji Unggah-Ungguh Jawa, AI Termurah Anthropic Salah 10 Kali

Claude Haiku, model termurah Anthropic, salah menjawab 10 dari 36 soal sopan santun bahasa Jawa. Claude Sonnet, versi mahalnya, hanya salah 3.

19 Agustus 2026 · 3 menit bacaBaca temuannya →