Benchmark bahasa Indonesia

Koreksi ejaan Indonesia

Menerima atau menolak saran pemeriksa ejaan pada teks nyata.Baca selengkapnya
Bagian dari Benchmark Nusantara

Kumpulan benchmark bahasa Indonesia dan bahasa daerah yang kami susun dan jalankan sendiri. Tiap set berdiri sendiri, memakai metode dan aturan penilaian yang sama, dan seluruh datanya terbit di satu tempat.

54 soalPengujian terakhir
GitHub

12

Model diuji

54/ 16

Soal / ditahan

12

Pengujian tercatat

Ringkasan cepat

Skor tertinggi

76,3%

29 dari 38 soal benar

Gemma 4 31BGoogle
Selisihnya dengan peringkat kedua 4 soal, dan kami tidak mengklaim urutan di antara model yang rentang antar-pengujiannya bertindih.

Paling murah

$0.000013

untuk tiap jawaban benar

Solar Pro 4Upstage
Dihitung hanya di antara model yang skornya paling tidak separuh skor tertinggi di papan ini, sebab model yang banyak salah selalu terlihat paling murah. Skor model ini 60,5%.

Latensi terendah

556 ms

median waktu tunggu

Mistral Small 3Mistral
Skornya 57,9%, jadi cepat di sini bukan berarti tepat.

Hasil

Berapa soal yang dijawab benar oleh tiap model, dari soal yang sama persis. Batang menunjukkan jumlah jawaban benar, bukan peringkat kemampuan model secara umum.

jawaban isian

Model menulis jawabannya sendiri, tanpa diberi pilihan. Sebagian dinilai mesin dengan mencocokkan rujukan, sebagian dibaca penutur asli satu per satu memakai rubrik berbobot.

suhu 0batas token bervariasiKeterangan
12 model · 38 soal dinilai

Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.

Cara angka ini dihitung
cara bertanya open-py1Keterangancara menilai open-py1Keteranganversi soal 27af2c184856Keteranganversi kunci 82bbf3cc2f8aKeterangan

Rincian per model

Angka yang sama dengan grafik di atas, ditambah biaya untuk tiap jawaban benar, waktu tunggu, dan tanggal pengujian terakhir. Kolom yang tidak dapat ditebak dari namanya membawa keterangannya sendiri.

jawaban isian
Tabel ini merinci hasil tiap model pada tugas jawaban isian: berapa jawaban benarnya, berapa biaya untuk tiap jawaban benar, berapa lama waktu tunggunya, dan kapan terakhir kami menjalankannya.
ModelBenarKeteranganDitahanKeterangan$/benarKeteranganLatensiKeteranganTerakhirKeterangan
Gemma 4 31BGoogle29/3876,3%13/16$0.000031$0.00131.021 msmedian
GPT-5.6 LunaOpenAI25/3865,8%12/16$0.000141$0.00522.701 msmedian
Ling-3.0-flashAnt Group25/3865,8%12/16$0.000042$0.00161.410 msmedian
Gemma-SEA-LION v4.5 E2B-ITlokal25/3865,8%11/16-836 msmedian
DeepSeek V4 Flash 0731DeepSeek23/3860,5%12/16$0.000112$0.00395.016 msmedian
Solar Pro 4Upstage23/3860,5%10/16$0.000013$0.000433.811 msmedian
Mistral Small 3Mistral22/3857,9%9/16$0.000019$0.0006556 msmedian
Qwen3 30B A3B Instruct 2507Alibaba21/3855,3%13/16$0.000030$0.0010596 msmedian
Llama3 8B CPT Sahabat-AI v1 Instructlokal21/3855,3%11/16-301 msmedian
Hunyuan A13B InstructTencent21/3855,3%7/16$0.000068$0.00191.474 msmedian
Claude Haiku 4.5Anthropic20/3852,6%12/16$0.000508$0.01631.266 msmedian
Llama 3.1 8B Instructlokal19/3850,0%11/16-443 msmedian

Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.

Tiap angka di tabel ini dapat dihitung ulang dari data mentahnya. Buka datanya

Biaya dan tokenTermurah untuk tiap jawaban benar: Solar Pro 4 ($0.000013). Termahal: Claude Haiku 4.5 ($0.000508).

Seluruh angka biaya dalam dolar AS.

Biaya untuk tiap jawaban benar

Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.

Biaya untuk tiap jawaban benar

Biaya satu kali pengujian penuh

Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.

Biaya satu kali pengujian penuh

Token yang dipakai

Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.

InputOutput
Ling-3.0-flash13.118,0 · 16.337,0
DeepSeek V4 Flash 073111.085,0 · 13.176,0
GPT-5.6 Luna10.655,0 · 6.923,0
Claude Haiku 4.514.517,0 · 349,0
Hunyuan A13B Instruct12.566,0 · 260,0
Llama 3.1 8B Instruct12.831,0 · 255,0
Solar Pro 413.819,0 · 226,0
Mistral Small 311.546,0 · 221,0
Llama3 8B CPT Sahabat-AI v1 Instruct12.831,0 · 205,0
Gemma 4 31B10.323,0 · 190,0
Qwen3 30B A3B Instruct 250712.782,0 · 186,0
Gemma-SEA-LION v4.5 E2B-IT9.909,0 · 184,0
Token yang dipakai

Benchmark