Benchmark bahasa Jawa

Arti kata Jawa sehari-hari

Menjelaskan arti kata Jawa sehari-hari yang terverifikasi penutur, sebagian ditahan.Baca selengkapnya
Bagian dari Benchmark Nusantara

Kumpulan benchmark bahasa Indonesia dan bahasa daerah yang kami susun dan jalankan sendiri. Tiap set berdiri sendiri, memakai metode dan aturan penilaian yang sama, dan seluruh datanya terbit di satu tempat.

199 soalPengujian terakhir
GitHub

14

Model diuji

199/ 64

Soal / ditahan

34

Pengujian tercatat

Set ini punya 1 kumpulan hasil lain, dari soal atau kunci jawaban versi sebelumnya. Kami tidak menggambarnya di grafik yang sama, sebab skor yang dihitung dengan soal berbeda bukan pengukuran yang sama.

Ringkasan cepat

Skor tertinggi

94,8%

128 dari 135 soal benar

Gemini 3.5 FlashGoogle
Selisihnya dengan peringkat kedua 12 soal, dan kami tidak mengklaim urutan di antara model yang rentang antar-pengujiannya bertindih.

Paling murah

$0.000012

untuk tiap jawaban benar

Gemma 4 31BGoogle
Dihitung hanya di antara model yang skornya paling tidak separuh skor tertinggi di papan ini, sebab model yang banyak salah selalu terlihat paling murah. Skor model ini 85,9%.

Latensi terendah

816 ms

median waktu tunggu

Qwen3 30B A3B Instruct 2507Alibaba
Skornya 37,8%, jadi cepat di sini bukan berarti tepat.

Hasil

Berapa soal yang dijawab benar oleh tiap model, dari soal yang sama persis. Batang menunjukkan jumlah jawaban benar, bukan peringkat kemampuan model secara umum.

arti kata

Model diminta menjelaskan arti satu kata dengan kalimat bebas. Jawaban dihitung benar kalau memuat seluruh kata dari salah satu kunci yang kami sahkan.

suhu 0batas token bervariasiKeterangan
14 model · 135 soal dinilai

Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.

Cara angka ini dihitung
cara bertanya arti-kata-v1Keterangancara menilai kunci-alias-v1Keteranganversi soal a7ba9fa24e64Keteranganversi kunci 873b6f168502Keterangan

Rincian per model

Angka yang sama dengan grafik di atas, ditambah biaya untuk tiap jawaban benar, waktu tunggu, dan tanggal pengujian terakhir. Kolom yang tidak dapat ditebak dari namanya membawa keterangannya sendiri.

arti kata
Tabel ini merinci hasil tiap model pada tugas arti kata: berapa jawaban benarnya, berapa biaya untuk tiap jawaban benar, berapa lama waktu tunggunya, dan kapan terakhir kami menjalankannya.
ModelBenarKeteranganDitahanKeterangan$/benarKeteranganLatensiKeteranganTerakhirKeterangan
Gemini 3.5 FlashGoogle128/13594,8%58/6490,6%$0.002985$0.55522.711 msmedian
Gemma 4 31BGoogle116/13585,9%51/6479,7%$0.000012$0.00211.063 msmedian
GPT-5.6 LunaOpenAI112/13583,0%53/6482,8%$0.000051$0.00841.438 msmedian
DeepSeek V4 Flash 0731DeepSeek107/13579,3%49/6476,6%$0.000054$0.00853.123 msmedian
Claude Haiku 4.5Anthropic86/13563,7%41/6464,1%$0.000292$0.03711.635 msmedian
Ling-3.0-flashAnt Group69/13551,1%27/6442,2%$0.000036$0.00351.390 msmedian
Llama3 8B CPT Sahabat-AI v1 Instructlokal61/13545,2%27/6442,2%-528 msmedian
Gemma-SEA-LION v4.5 E2B-ITlokal60/13544,4%27/6442,2%-734 msmedian
Solar Pro 4Upstage52/13538,5%24/6437,5%$0.000013$0.00101.142 msmedian
Qwen3 30B A3B Instruct 2507Alibaba51/13537,8%23/6435,9%$0.000020$0.0015816 msmedian
Llama 3.1 8B Instructlokal26/13519,3%11/6417,2%-532 msmedian
Nemotron 3.5 LightningNVIDIA25/13518,5%9/6414,1%$0.001081$0.03683.088 msmedian
Mistral Small 3Mistral25/13518,5%6/649,4%$0.000070$0.0022843 msmedian
Hunyuan A13B InstructTencent21/13515,6%12/6418,8%$0.000118$0.00391.747 msmedian

Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.

Tiap angka di tabel ini dapat dihitung ulang dari data mentahnya. Buka datanya

Biaya dan tokenTermurah untuk tiap jawaban benar: Gemma 4 31B ($0.000012). Termahal: Gemini 3.5 Flash ($0.002985).

Seluruh angka biaya dalam dolar AS.

Biaya untuk tiap jawaban benar

Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.

Biaya untuk tiap jawaban benar

Biaya satu kali pengujian penuh

Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.

Biaya satu kali pengujian penuh

Token yang dipakai

Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.

InputOutput
Nemotron 3.5 Lightning8.445,0 · 155.249,0
Gemini 3.5 Flash4.437,0 · 60.950,0
DeepSeek V4 Flash 07316.313,0 · 36.231,0
Ling-3.0-flash10.649,0 · 27.904,0
GPT-5.6 Luna6.029,0 · 12.966,0
Claude Haiku 4.59.041,0 · 5.613,0
Hunyuan A13B Instruct7.669,0 · 4.928,0
Solar Pro 415.811,0 · 4.563,0
Mistral Small 337.698,0 · 3.509,0
Gemma 4 31B7.027,0 · 3.431,0
Llama3 8B CPT Sahabat-AI v1 Instruct8.062,0 · 3.281,0
Qwen3 30B A3B Instruct 25077.669,0 · 3.100,0
Llama 3.1 8B Instruct8.062,0 · 2.910,0
Gemma-SEA-LION v4.5 E2B-IT6.228,0 · 2.594,0
Token yang dipakai

Versi sebelumnya

Kami mengubah soal atau kunci jawabannya setelah angka ini diukur, jadi angka di bawah tidak dapat dibandingkan langsung dengan hasil di atas. Kami menyimpannya, bukan menghapusnya.

Gemini 3.5 Flash127/135 94,1%
GPT-5.6 Luna121/135 89,6%
GPT-5.6 Luna119/135 88,1%
Gemma 4 31B116/135 85,9%
GPT-5.6 Luna116/135 85,9%
Gemma 4 31B115/135 85,2%
Gemma 4 31B113/135 83,7%
Claude Haiku 4.582/135 60,7%
Ling-3.0-flash69/135 51,1%
Solar Pro 452/135 38,5%
Mistral Small 321/135 15,6%
arti kata · arti-kata-v1 · 135 soal · 4e682041

Benchmark