Koleksi Terukur

Artikel

Kami menguji sendiri seberapa jauh AI memahami bahasa Indonesia dan bahasa daerahnya, memetakan kata yang menjebak penuturnya, dan menerbitkan angkanya beserta data mentah serta batasannya, termasuk ketika hasilnya tidak sesuai harapan kami sendiri.

1 artikelTiap artikel menaut ke data mentahnya
TersaringHeld outHapus penyaring

1 artikel

Empiris

GPT-6 Astra dan Luna imbang pada benchmark slang Indonesia

GPT-6 Astra menjawab benar 42 dari 42 soal pada separuh publik benchmark slang Indonesia kami, hasil terbaik bersama di panel. Dihitung bersama 18 soal tertahan, Astra menutup pengujian di angka 59 dari 60, terpaut 1 soal di belakang GPT-5.6 Luna milik OpenAI sendiri yang jauh lebih murah. Selisih 1 soal dari 60 bukan jarak yang berarti secara statistik, dan justru di situ letak temuan yang lebih menarik: separuh soal publik sudah tidak lagi memisahkan model-model terkuat.

42/42Astra publik59/60Astra total$0,15Biaya Astra