Insight

Seberapa jauh AI dan mesin bahasa kami bisa dipercaya?

Kami menguji mesin koreksi kami sendiri dan berbagai model AI dari luar terhadap bahasa Indonesia dan bahasa daerah, lalu menerbitkan angkanya apa adanya. Di halaman ini, kami meringkas tiap temuan jadi satu gambar saja. Metode lengkap dan data mentahnya bisa dibuka lewat tautan di tiap kartu.

2 temuanTiap temuan menaut ke versi teknisnya
TersaringKegagalan sendiriHapus penyaring

2 temuan

BenchmarkEmpiris
Rumusan 1 Rumusan 3
Gemma 4 31B
32
60
Qwen3-30B-A3B
40
46
Ling 3.0 Flash
39
41
Mistral Small 3
39
38
Jawaban benar dari 69 kalimat yang sama persis

Ganti Prompt, Peringkat 4 AI Langsung Terbalik

Kami menguji 4 model AI pada 69 kalimat yang sama dengan tiga cara bertanya. Gemma 4 31B buatan Google juru kunci pada cara pertama dan teratas pada cara ketiga, dengan soal dan kunci jawaban yang tidak pernah berubah.

15 September 2026 · 3 menit bacaBaca temuannya →
Mesin koreksiEmpiris
3.741 Ronde 1 2.729 Ronde 6
Jumlah penandaan mesin, ronde ke ronde

Mesin Koreksi Lulus Ujian, Gagal di Tulisan Asli

Kami arahkan pemeriksa ejaan buatan sendiri ke tulisan orang sungguhan, bukan ke kalimat uji. Ia menandai 3.741 hal, dan sebagian besar bukan kesalahan. Ini catatan enam ronde perbaikannya, termasuk angka yang sempat kami salah hitung sendiri.

17 Agustus 2026 · 2 menit bacaBaca temuannya →