Koleksi Terukur

Artikel

Kami menguji sendiri seberapa jauh AI memahami bahasa Indonesia dan bahasa daerahnya, memetakan kata yang menjebak penuturnya, dan menerbitkan angkanya beserta data mentah serta batasannya, termasuk ketika hasilnya tidak sesuai harapan kami sendiri.

2 artikelTiap artikel menaut ke data mentahnya
TersaringOpenaiHapus penyaring

2 artikel

Empiris

GPT-6 Astra dan Luna imbang pada benchmark slang Indonesia

GPT-6 Astra menjawab benar 42 dari 42 soal pada separuh publik benchmark slang Indonesia kami, hasil terbaik bersama di panel. Dihitung bersama 18 soal tertahan, Astra menutup pengujian di angka 59 dari 60, terpaut 1 soal di belakang GPT-5.6 Luna milik OpenAI sendiri yang jauh lebih murah. Selisih 1 soal dari 60 bukan jarak yang berarti secara statistik, dan justru di situ letak temuan yang lebih menarik: separuh soal publik sudah tidak lagi memisahkan model-model terkuat.

42/42Astra publik59/60Astra total$0,15Biaya Astra
Empiris

GPT-6 Astra, Model Termahal OpenAI, Kalah dari Model Murahnya Sendiri di Kata Jawa Langka

GPT-6 Astra, model terbaru dan termahal OpenAI, menjawab benar 33 dari 43 kata Jawa langka, berada di belakang Gemini 3.5 Flash milik Google (40/43) dan GPT-5.6 Luna yang jauh lebih murah (35/43), dengan tarif 56 kali lipat Luna. Pada uji tingkat tutur Jawa terpisah, Astra meraih skor tertinggi sejajar dengan Gemini 3.5 Flash.

$0,22Biaya Astra76,7%Skor Astra93,0%Skor Gemini