BenchmarkEmpiris
Kami menanyakan arti 135 kata Jawa kepada 10 model AI. Gemini 3.5 Flash menjawab benar paling banyak, 128 dari 135, dan sekaligus jadi model paling boros, 187 kali lebih mahal untuk tiap jawaban benar daripada model yang tertinggal 11 kata saja.
22 September 2026 · 4 menit bacaBaca temuannya →
BenchmarkEmpiris
Pada 24 Agustus kami menulis bahwa ox-alpha bukan GLM-5.3, melainkan kerabatnya. Pada 26 Agustus Z.ai mengumumkan model itu adalah GLM-5.3-Flash. Bukan tebakan yang membawa kami ke sana, melainkan 38 soal bahasa Jawa.
30 Agustus 2026 · 3 menit bacaBaca temuannya →
BenchmarkEmpiris
Claude Haiku, model termurah Anthropic, salah menjawab 10 dari 36 soal sopan santun bahasa Jawa. Claude Sonnet, versi mahalnya, hanya salah 3.
19 Agustus 2026 · 3 menit bacaBaca temuannya →
Bahasa JawaEmpiris
Kami susun soal uji bahasa Jawa dari aturan buku tata bahasa. Enam dari 40 soal gugur, bukan karena AI menjawab salah, tapi karena bentuk yang menurut buku salah ternyata diterima luas oleh penutur asli.
14 Agustus 2026 · 2 menit bacaBaca temuannya →