Benchmark bahasa Jawa

Tingkat tutur bahasa Jawa

Memilih ragam tutur Jawa yang tepat bagi lawan bicara.Baca selengkapnya
Bagian dari Benchmark Nusantara

Kumpulan benchmark bahasa Indonesia dan bahasa daerah yang kami susun dan jalankan sendiri. Tiap set berdiri sendiri, memakai metode dan aturan penilaian yang sama, dan seluruh datanya terbit di satu tempat.

38 soalPengujian terakhir
GitHub
Sebaran skor

pilihan ganda

GPT-6 Astra26/27 96,3%

jawaban isian

GPT-6 Astra6/6 100,0%

20

Model diuji

38

Soal

34

Pengujian tercatat

Ringkasan cepat

Diambil dari papan pilihan ganda, papan dengan model terbanyak di set ini. Papan lain punya angkanya sendiri di bawah.

Skor tertinggi

96,3%

26 dari 27 soal benar

GPT-6 AstraOpenAI
Berimbang dengan DeepSeek V4.1 Flash pada jumlah jawaban benar yang sama persis. Nama di sini bukan pemenang, dan urutan di antara keduanya tidak kami klaim.

Paling murah

$0.000010

untuk tiap jawaban benar

Solar Pro 4Upstage
Dihitung hanya di antara model yang skornya paling tidak separuh skor tertinggi di papan ini, sebab model yang banyak salah selalu terlihat paling murah. Skor model ini 59,3%.

Latensi terendah

547 ms

median waktu tunggu

Mistral Small 3Mistral
Skornya 40,7%, jadi cepat di sini bukan berarti tepat.

Hasil

Berapa soal yang dijawab benar oleh tiap model, dari soal yang sama persis. Batang menunjukkan jumlah jawaban benar, bukan peringkat kemampuan model secara umum.

pilihan ganda

Model membaca soal beserta pilihan jawabannya, lalu menjawab satu huruf saja. Soalnya dinilai mesin: jawaban benar kalau hurufnya sama dengan kunci.

suhu 0batas token bervariasiKeterangan
GPT-6 Astra26/27 96,3%
DeepSeek V4.1 Flash26/27 96,3%
Gemini 3.5 Flash26/27 96,3%
Gemma 4 31B26/27 96,3%
DeepSeek V4 Flash 073125/27 92,6%
GPT-5.6 Luna23/27 85,2%
GLM 5.3 Flash22/27 81,5%
MiMo-V2.6-Flash22/27 81,5%
Mercury 2.522/27 81,5%
GLM 5.321/27 77,8%
Claude Haiku 4.520/27 74,1%
Ling-3.0-flash18/27 66,7%
Gemma-SEA-LION v4.5 E2B-IT16/27 59,3%
Solar Pro 416/27 59,3%
Qwen3 30B A3B Instruct 250714/27 51,9%
Seed-2.0-Mini13/27 48,1%
Llama3 8B CPT Sahabat-AI v1 Instruct13/27 48,1%
Hunyuan A13B Instruct12/27 44,4%
Mistral Small 311/27 40,7%
Llama 3.1 8B Instruct9/27 33,3%
20 model · 27 soal dinilai

Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.

Cara angka ini dihitung
cara bertanya mcq-py1Keterangancara menilai mcq-py1Keteranganversi soal c0c83850858eKeteranganversi kunci 18e8ec378904Keterangan
jawaban isian

Model menulis jawabannya sendiri, tanpa diberi pilihan. Sebagian dinilai mesin dengan mencocokkan rujukan, sebagian dibaca penutur asli satu per satu memakai rubrik berbobot.

suhu 0batas token bervariasiKeterangan
GPT-6 Astra6/6 100,0%
DeepSeek V4.1 Flash6/6 100,0%
Gemini 3.5 Flash6/6 100,0%
Gemma 4 31B6/6 100,0%
GLM 5.3 Flash5/6 83,3%
Gemma-SEA-LION v4.5 E2B-IT5/6 83,3%
MiMo-V2.6-Flash5/6 83,3%
Mercury 2.54/6 66,7%
GLM 5.33/6 50,0%
Qwen3 30B A3B Instruct 25072/6 33,3%
Llama 3.1 8B Instruct1/6 16,7%
Llama3 8B CPT Sahabat-AI v1 Instruct1/6 16,7%
Seed-2.0-Mini1/6 16,7%
Mistral Small 30/6 0,0%
14 model · 6 soal dinilai

Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.

Cara angka ini dihitung
cara bertanya open-py1Keterangancara menilai open-py1Keteranganversi soal 9f2d79048c32Keteranganversi kunci 061ea38a9d7bKeterangan

Rincian per model

Angka yang sama dengan grafik di atas, ditambah biaya untuk tiap jawaban benar, waktu tunggu, dan tanggal pengujian terakhir. Kolom yang tidak dapat ditebak dari namanya membawa keterangannya sendiri.

pilihan ganda
Urutkan
Tabel ini merinci hasil tiap model pada tugas pilihan ganda: berapa jawaban benarnya, berapa biaya untuk tiap jawaban benar, berapa lama waktu tunggunya, dan kapan terakhir kami menjalankannya.
KeteranganKeteranganKeteranganKeteranganKeterangan
GPT-6 AstraOpenAI26/2796,3%11/11$0.001961$0.07251.930 msmedian
DeepSeek V4.1 FlashDeepSeek26/2796,3%11/11$0.000354$0.01314.278 msmedian
Gemini 3.5 FlashGoogle26/2796,3%11/11$0.002148$0.07952.217 msmedian
Gemma 4 31BGoogle26/2796,3%10/11$0.000015$0.0006803 msmedian
DeepSeek V4 Flash 0731DeepSeek25/2792,6%11/11$0.000054$0.00204.324 msmedian
GPT-5.6 LunaOpenAI23/2785,2%11/11$0.000023$0.0008988 msmedian
GLM 5.3 FlashZ-ai22/2781,5%10/11$0.000130$0.00428.156 msmedian
MiMo-V2.6-FlashXiaomi22/2781,5%9/11$0.000143$0.00445.547 msmedian
Mercury 2.5Inception22/2781,5%9/11$0.000054$0.0017979 msmedian
GLM 5.3Z-ai21/2777,8%8/11$0.000283$0.00821.017 msmedian
Claude Haiku 4.5Anthropic20/2774,1%8/11$0.000256$0.00722.228 msmedian
Ling-3.0-flashAnt Group18/2766,7%8/11$0.000058$0.00151.547 msmedian
Gemma-SEA-LION v4.5 E2B-ITlokal16/2759,3%6/11-837 msmedian
Solar Pro 4Upstage16/2759,3%6/11$0.000010$0.00026.680 msmedian
Qwen3 30B A3B Instruct 2507Alibaba14/2751,9%5/11$0.000023$0.0004612 msmedian
Seed-2.0-MiniBytedance-seed13/2748,1%7/11$0.001133$0.02277.893 msmedian
Llama3 8B CPT Sahabat-AI v1 Instructlokal13/2748,1%5/11-311 msmedian
Hunyuan A13B InstructTencent12/2744,4%9/11$0.000039$0.00081.396 msmedian
Mistral Small 3Mistral11/2740,7%7/11$0.000014$0.0003547 msmedian
Llama 3.1 8B Instructlokal9/2733,3%6/11-432 msmedian

Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.

jawaban isian
Urutkan
Tabel ini merinci hasil tiap model pada tugas jawaban isian: berapa jawaban benarnya, berapa biaya untuk tiap jawaban benar, berapa lama waktu tunggunya, dan kapan terakhir kami menjalankannya.
KeteranganKeteranganKeteranganKeteranganKeterangan
GPT-6 AstraOpenAI6/6100,0%2/2$0.005116$0.04095.008 msmedian
DeepSeek V4.1 FlashDeepSeek6/6100,0%2/2$0.000830$0.00665.308 msmedian
Gemini 3.5 FlashGoogle6/6100,0%2/2$0.003273$0.02622.753 msmedian
Gemma 4 31BGoogle6/6100,0%2/2$0.000019$0.00011.318 msmedian
GLM 5.3 FlashZ-ai5/683,3%2/2$0.000232$0.001613.476 msmedian
Gemma-SEA-LION v4.5 E2B-ITlokal5/683,3%1/2-920 msmedian
MiMo-V2.6-FlashXiaomi5/683,3%1/2$0.000125$0.00077.016 msmedian
Mercury 2.5Inception4/666,7%2/2$0.000058$0.0004992 msmedian
GLM 5.3Z-ai3/650,0%2/2$0.000740$0.00371.465 msmedian
Qwen3 30B A3B Instruct 2507Alibaba2/633,3%0/2$0.000050$0.0001477 msmedian
Llama 3.1 8B Instructlokal1/616,7%0/2-571 msmedian
Llama3 8B CPT Sahabat-AI v1 Instructlokal1/616,7%0/2-426 msmedian
Seed-2.0-MiniBytedance-seed1/616,7%0/2$0.003426$0.00348.121 msmedian
Mistral Small 3Mistral0/60,0%0/2-$0.00011.098 msmedian

Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.

Tiap angka di tabel ini dapat dihitung ulang dari data mentahnya. Buka datanya →

Biaya dan tokenpilihan gandaTermurah untuk tiap jawaban benar: Solar Pro 4 ($0.000010). Termahal: Gemini 3.5 Flash ($0.002148).

Seluruh angka biaya dalam dolar AS.

Biaya untuk tiap jawaban benar · pilihan ganda

Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.

Biaya untuk tiap jawaban benar · pilihan ganda

Biaya satu kali pengujian penuh · pilihan ganda

Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.

Biaya satu kali pengujian penuh · pilihan ganda

Token yang dipakai · pilihan ganda

Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.

InputOutput
Seed-2.0-Mini6.220,0 · 55.086,0
Ling-3.0-flash6.245,0 · 13.504,0
MiMo-V2.6-Flash5.593,0 · 13.119,0
GLM 5.3 Flash5.656,0 · 11.291,0
DeepSeek V4.1 Flash5.949,0 · 10.803,0
Mercury 2.54.971,0 · 9.793,0
Gemini 3.5 Flash4.122,0 · 8.142,0
DeepSeek V4 Flash 07314.960,0 · 6.495,0
GPT-5.6 Luna4.754,0 · 528,0
GPT-6 Astra4.754,0 · 500,0
GLM 5.35.692,0 · 464,0
Claude Haiku 4.56.396,0 · 152,0
Solar Pro 46.781,0 · 78,0
Mistral Small 35.016,0 · 78,0
Llama 3.1 8B Instruct5.740,0 · 77,0
Gemma 4 31B4.908,0 · 76,0
Gemma-SEA-LION v4.5 E2B-IT4.654,0 · 76,0
Llama3 8B CPT Sahabat-AI v1 Instruct5.740,0 · 76,0
Hunyuan A13B Instruct5.517,0 · 76,0
Qwen3 30B A3B Instruct 25075.669,0 · 67,0
Token yang dipakai · pilihan ganda
Biaya dan tokenjawaban isianTermurah untuk tiap jawaban benar: Gemma 4 31B ($0.000019). Termahal: GPT-6 Astra ($0.005116).

Seluruh angka biaya dalam dolar AS.

Biaya untuk tiap jawaban benar · jawaban isian

Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.

Biaya untuk tiap jawaban benar · jawaban isian

Biaya satu kali pengujian penuh · jawaban isian

Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.

Biaya satu kali pengujian penuh · jawaban isian

Token yang dipakai · jawaban isian

Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.

InputOutput
Seed-2.0-Mini1.277,0 · 8.245,0
DeepSeek V4.1 Flash1.202,0 · 5.221,0
GLM 5.3 Flash1.213,0 · 4.831,0
Gemini 3.5 Flash802,0 · 2.776,0
MiMo-V2.6-Flash1.203,0 · 2.168,0
Mercury 2.5964,0 · 2.080,0
GPT-6 Astra968,0 · 625,0
GLM 5.31.219,0 · 581,0
Llama3 8B CPT Sahabat-AI v1 Instruct1.231,0 · 132,0
Qwen3 30B A3B Instruct 25071.219,0 · 122,0
Mistral Small 31.031,0 · 108,0
Llama 3.1 8B Instruct1.231,0 · 103,0
Gemma 4 31B962,0 · 97,0
Gemma-SEA-LION v4.5 E2B-IT914,0 · 96,0
Token yang dipakai · jawaban isian

← Benchmark