Benchmark bahasa Indonesia

Pemahaman slang Indonesia

Menjelaskan arti kata gaul Indonesia di dalam kalimat.Baca selengkapnya
Bagian dari Benchmark Nusantara

Kumpulan benchmark bahasa Indonesia dan bahasa daerah yang kami susun dan jalankan sendiri. Tiap set berdiri sendiri, memakai metode dan aturan penilaian yang sama, dan seluruh datanya terbit di satu tempat.

60 soalPengujian terakhir
GitHub

12

Model diuji

60/ 18

Soal / ditahan

25

Pengujian tercatat

Set ini punya 1 kumpulan hasil lain, dari soal atau kunci jawaban versi sebelumnya. Kami tidak menggambarnya di grafik yang sama, sebab skor yang dihitung dengan soal berbeda bukan pengukuran yang sama.

Ringkasan cepat

Skor tertinggi

100,0%

42 dari 42 soal benar

GPT-5.6 LunaOpenAI
Selisihnya dengan peringkat kedua 1 soal, dan kami tidak mengklaim urutan di antara model yang rentang antar-pengujiannya bertindih.

Paling murah

$0.000008

untuk tiap jawaban benar

Solar Pro 4Upstage
Dihitung hanya di antara model yang skornya paling tidak separuh skor tertinggi di papan ini, sebab model yang banyak salah selalu terlihat paling murah. Skor model ini 88,1%.

Latensi terendah

501 ms

median waktu tunggu

Mistral Small 3Mistral
Skornya 76,2%, jadi cepat di sini bukan berarti tepat.

Hasil

Berapa soal yang dijawab benar oleh tiap model, dari soal yang sama persis. Batang menunjukkan jumlah jawaban benar, bukan peringkat kemampuan model secara umum.

pilihan ganda

Model membaca soal beserta pilihan jawabannya, lalu menjawab satu huruf saja. Soalnya dinilai mesin: jawaban benar kalau hurufnya sama dengan kunci.

suhu 0batas token bervariasiKeterangan
GPT-5.6 Luna42/42 100,0%
Gemma 4 31B41/42 97,6%
Llama3 8B CPT Sahabat-AI v1 Instruct2 pengujianKeterangan40/42 95,2%
Claude Haiku 4.538/42 90,5%
Ling-3.0-flash37/42 88,1%
Solar Pro 437/42 88,1%
Mistral Small 332/42 76,2%
rentang antar-pengujianmodel tanpa blok gelap dijalankan sekali
12 model · 42 soal dinilai

Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.

Cara angka ini dihitung
cara bertanya mcq-py1Keterangancara menilai mcq-py1Keteranganversi soal d3e8c01bc554Keteranganversi kunci 4e94e1cb7f25Keterangan

Rincian per model

Angka yang sama dengan grafik di atas, ditambah biaya untuk tiap jawaban benar, waktu tunggu, dan tanggal pengujian terakhir. Kolom yang tidak dapat ditebak dari namanya membawa keterangannya sendiri.

pilihan ganda
Tabel ini merinci hasil tiap model pada tugas pilihan ganda: berapa jawaban benarnya, berapa biaya untuk tiap jawaban benar, berapa lama waktu tunggunya, dan kapan terakhir kami menjalankannya.
ModelBenarKeteranganDitahanKeterangan$/benarKeteranganLatensiKeteranganTerakhirKeterangan
GPT-5.6 LunaOpenAI42/42100,0%18/18$0.000051$0.00311.103 msmedian
Gemma 4 31BGoogle41/4297,6%17/18$0.000017$0.0010614 msmedian
Llama3 8B CPT Sahabat-AI v1 Instructlokal2 pengujianKeterangan56-56/4295,2%16/18-430 msmedian
DeepSeek V4 Flash 0731DeepSeek39/4292,9%18/18$0.000039$0.00223.281 msmedian
Claude Haiku 4.5Anthropic38/4290,5%18/18$0.000274$0.01541.426 msmedian
Ling-3.0-flashAnt Group37/4288,1%17/18$0.000021$0.00111.410 msmedian
Qwen3 30B A3B Instruct 2507Alibaba37/4288,1%16/18$0.000021$0.0011701 msmedian
Solar Pro 4Upstage37/4288,1%15/18$0.000008$0.0004881 msmedian
Gemma-SEA-LION v4.5 E2B-ITlokal33/4278,6%12/18-843 msmedian
Mistral Small 3Mistral32/4276,2%13/18$0.000013$0.0006501 msmedian
Llama 3.1 8B Instructlokal32/4276,2%13/18-533 msmedian
Hunyuan A13B InstructTencent29/4269,0%14/18$0.000042$0.00181.488 msmedian

Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.

Tiap angka di tabel ini dapat dihitung ulang dari data mentahnya. Buka datanya

Biaya dan tokenTermurah untuk tiap jawaban benar: Solar Pro 4 ($0.000008). Termahal: Claude Haiku 4.5 ($0.000274).

Seluruh angka biaya dalam dolar AS.

Biaya untuk tiap jawaban benar

Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.

Biaya untuk tiap jawaban benar

Biaya satu kali pengujian penuh

Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.

Biaya satu kali pengujian penuh

Token yang dipakai

Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.

InputOutput
Ling-3.0-flash13.334,0 · 10.279,0
DeepSeek V4 Flash 073110.888,0 · 4.981,0
GPT-5.6 Luna10.310,0 · 831,0
Claude Haiku 4.514.163,0 · 240,0
Solar Pro 413.796,0 · 125,0
Gemma 4 31B10.271,0 · 120,0
Llama3 8B CPT Sahabat-AI v1 Instruct2 pengujianKeterangan12.771,0 · 120,0
Gemma-SEA-LION v4.5 E2B-IT9.920,0 · 120,0
Mistral Small 311.084,0 · 120,0
Llama 3.1 8B Instruct12.771,0 · 120,0
Hunyuan A13B Instruct12.446,0 · 120,0
Qwen3 30B A3B Instruct 250712.684,0 · 103,0
Token yang dipakai

Dari waktu ke waktu

Kami hanya menggambar model yang dijalankan lebih dari sekali. Satu titik bukan tren, dan menariknya jadi garis datar menyiratkan kestabilan yang belum kami ukur.

2026-08-172026-08-172026-08-17 · 562026-08-17 · 56
Dari waktu ke waktu
DeretTanggalNilai
Llama3 8B CPT Sahabat-AI v1 Instruct2026-08-17T15:04:03Z56
Llama3 8B CPT Sahabat-AI v1 Instruct2026-08-17T15:10:43Z56
Dari waktu ke waktu

Versi sebelumnya

Kami mengubah soal atau kunci jawabannya setelah angka ini diukur, jadi angka di bawah tidak dapat dibandingkan langsung dengan hasil di atas. Kami menyimpannya, bukan menghapusnya.

pilihan ganda · mcq-py1 · 27 soal · 3e5973f0

Benchmark