Benchmark bahasa Indonesia

Normalisasi teks Indonesia

Mengubah teks bergaya pesan singkat menjadi bahasa Indonesia baku.Baca selengkapnya
Bagian dari Benchmark Nusantara

Kumpulan benchmark bahasa Indonesia dan bahasa daerah yang kami susun dan jalankan sendiri. Tiap set berdiri sendiri, memakai metode dan aturan penilaian yang sama, dan seluruh datanya terbit di satu tempat.

69 soalPengujian terakhir
GitHub

11

Model diuji

69/ 20

Soal / ditahan

33

Pengujian tercatat

Ringkasan cepat

Diambil dari papan jawaban isian, prompt bawaan, papan dengan model terbanyak di set ini. Papan lain punya angkanya sendiri di bawah.

Skor tertinggi

59,2–87,8%

Skor terbaik berbeda-beda tergantung cara bertanya

Terendah
59,2% · Prompt bawaan · Qwen3 30B A3B Instruct 2507
Tertinggi
87,8% · Prompt rinci yang melarang ganti kata · Gemma 4 31B

Perbandingan lengkap ketiga rumusan ada di bawah.

Paling murah

$0.000014

untuk tiap jawaban benar

Mistral Small 3Mistral
Dihitung hanya di antara model yang skornya paling tidak separuh skor tertinggi di papan ini, sebab model yang banyak salah selalu terlihat paling murah. Skor model ini 53,1%.

Latensi terendah

962 ms

median waktu tunggu

Mistral Small 3Mistral
Skornya 53,1%, jadi cepat di sini bukan berarti tepat.

Hasil

Berapa soal yang dijawab benar oleh tiap model, dari soal yang sama persis. Batang menunjukkan jumlah jawaban benar, bukan peringkat kemampuan model secara umum.

Set ini diuji dengan 3 prompt berbeda

Soal dan kunci jawabannya sama persis di 3 pengujian ini, 69 soal jawaban isian yang tidak bergerak satu kata pun. Bedanya cuma prompt yang dikirim ke model. Skor Gemma 4 31B bergeser 44,9 poin hanya karena promptnya diganti. Juaranya pun berganti, dari Qwen3 30B A3B Instruct 2507 ke Gemma 4 31B. Karena itu set ini tidak punya satu papan peringkat, dan angkanya tidak boleh dirata-ratakan antar-prompt.

Prompt bawaanPrompt rinci yang melarang ganti kataPrompt yang menyatakan aturan kunci
Gemma 4 31B42,9% · 87,8% · 87,8%
GPT-5.6 Luna44,9% · 77,6% · 83,7%
DeepSeek V4 Flash 073149,0% · 71,4% · 75,5%
Gemma-SEA-LION v4.5 E2B-IT46,9% · 73,5% · 71,4%
Ling-3.0-flash55,1% · 65,3% · 59,2%
Qwen3 30B A3B Instruct 250759,2% · 61,2% · 63,3%
Solar Pro 438,8% · 57,1% · 61,2%
Mistral Small 353,1% · 55,1% · 46,9%
Llama 3.1 8B Instruct32,7% · 40,8% · 24,5%
Hunyuan A13B Instruct24,5% · 38,8% · 22,4%
Set ini diuji dengan 3 prompt berbeda

Bunyi tiap prompt

Prompt bawaan

Promptnya berbunyi “Ubah kalimat berikut menjadi bahasa Indonesia baku”, diambil apa adanya dari dalam soal. Longgar: ia tidak menyebut apa yang tidak boleh disentuh, jadi model bebas menafsirkan sampai mengganti kata dengan sinonimnya.

open-py1
Prompt rinci yang melarang ganti kata

Promptnya melarang mengganti kata dengan sinonim dan melarang mengubah tingkat keformalan. Larangan itu terdengar masuk akal, tetapi kunci jawaban kami sendiri mengganti kata di 40 tempat, jadi prompt ini justru melanggar kuncinya.

open-py2
Prompt yang menyatakan aturan kunci

Promptnya menyuruh membakukan tiap kata yang belum baku, termasuk singkatan yang ditulis tanpa huruf vokal, dan membiarkan kata yang sudah baku. Ditulis setelah aturan kuncinya dihitung kata demi kata.

open-py3
Lihat 3 papan terpisah, satu per prompt
jawaban isianPrompt bawaan

Model menulis jawabannya sendiri, tanpa diberi pilihan. Sebagian dinilai mesin dengan mencocokkan rujukan, sebagian dibaca penutur asli satu per satu memakai rubrik berbobot.

suhu 0batas token bervariasiKeterangan
11 model · 49 soal dinilai

Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.

Cara angka ini dihitung
cara bertanya open-py1Keterangancara menilai open-py1Keteranganversi soal 5ca9dfe11dc2Keteranganversi kunci eda1d1cddc75Keterangan
jawaban isianPrompt rinci yang melarang ganti kata

Model menulis jawabannya sendiri, tanpa diberi pilihan. Sebagian dinilai mesin dengan mencocokkan rujukan, sebagian dibaca penutur asli satu per satu memakai rubrik berbobot.

suhu 0batas token bervariasiKeterangan
11 model · 49 soal dinilai

Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.

Cara angka ini dihitung
cara bertanya open-py2Keterangancara menilai open-py1Keteranganversi soal 5ca9dfe11dc2Keteranganversi kunci eda1d1cddc75Keterangan
jawaban isianPrompt yang menyatakan aturan kunci

Model menulis jawabannya sendiri, tanpa diberi pilihan. Sebagian dinilai mesin dengan mencocokkan rujukan, sebagian dibaca penutur asli satu per satu memakai rubrik berbobot.

suhu 0batas token bervariasiKeterangan
11 model · 49 soal dinilai

Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.

Cara angka ini dihitung
cara bertanya open-py3Keterangancara menilai open-py1Keteranganversi soal 5ca9dfe11dc2Keteranganversi kunci eda1d1cddc75Keterangan

Rincian per model

Angka yang sama dengan grafik di atas, ditambah biaya untuk tiap jawaban benar, waktu tunggu, dan tanggal pengujian terakhir. Kolom yang tidak dapat ditebak dari namanya membawa keterangannya sendiri.

Lihat 3 tabel terpisah, satu per prompt
jawaban isianPrompt bawaan
Tabel ini merinci hasil tiap model pada tugas jawaban isian: berapa jawaban benarnya, berapa biaya untuk tiap jawaban benar, berapa lama waktu tunggunya, dan kapan terakhir kami menjalankannya.
ModelBenarKeteranganDitahanKeterangan$/benarKeteranganLatensiKeteranganTerakhirKeterangan
Qwen3 30B A3B Instruct 2507Alibaba29/4959,2%11/20$0.000024$0.00102.043 msmedian
Ling-3.0-flashAnt Group27/4955,1%12/20$0.000050$0.00201.766 msmedian
Mistral Small 3Mistral26/4953,1%13/20$0.000014$0.0005962 msmedian
DeepSeek V4 Flash 0731DeepSeek24/4949,0%11/20$0.000116$0.00403.644 msmedian
Gemma-SEA-LION v4.5 E2B-ITlokal23/4946,9%12/20-890 msmedian
GPT-5.6 LunaOpenAI22/4944,9%9/20$0.000069$0.00211.034 msmedian
Gemma 4 31BGoogle21/4942,9%11/20$0.000051$0.00161.330 msmedian
Solar Pro 4Upstage19/4938,8%9/20$0.000017$0.00052.684 msmedian
Llama3 8B CPT Sahabat-AI v1 Instructlokal17/4934,7%5/20-390 msmedian
Llama 3.1 8B Instructlokal16/4932,7%10/20-528 msmedian
Hunyuan A13B InstructTencent12/4924,5%5/20$0.000114$0.00191.485 msmedian

Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.

jawaban isianPrompt rinci yang melarang ganti kata
Tabel ini merinci hasil tiap model pada tugas jawaban isian: berapa jawaban benarnya, berapa biaya untuk tiap jawaban benar, berapa lama waktu tunggunya, dan kapan terakhir kami menjalankannya.
ModelBenarKeteranganDitahanKeterangan$/benarKeteranganLatensiKeteranganTerakhirKeterangan
Gemma 4 31BGoogle43/4987,8%16/20$0.000026$0.00161.373 msmedian
GPT-5.6 LunaOpenAI38/4977,6%14/20$0.000081$0.00422.199 msmedian
Gemma-SEA-LION v4.5 E2B-ITlokal36/4973,5%15/20-863 msmedian
DeepSeek V4 Flash 0731DeepSeek35/4971,4%15/20$0.000095$0.00474.526 msmedian
Ling-3.0-flashAnt Group32/4965,3%12/20$0.000040$0.00181.767 msmedian
Qwen3 30B A3B Instruct 2507Alibaba30/4961,2%13/20$0.000027$0.00121.656 msmedian
Llama3 8B CPT Sahabat-AI v1 Instructlokal29/4959,2%11/20-415 msmedian
Solar Pro 4Upstage28/4957,1%13/20$0.000013$0.00055.339 msmedian
Mistral Small 3Mistral27/4955,1%11/20$0.000017$0.0006650 msmedian
Llama 3.1 8B Instructlokal20/4940,8%10/20-505 msmedian
Hunyuan A13B InstructTencent19/4938,8%10/20$0.000078$0.00231.493 msmedian

Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.

jawaban isianPrompt yang menyatakan aturan kunci
Tabel ini merinci hasil tiap model pada tugas jawaban isian: berapa jawaban benarnya, berapa biaya untuk tiap jawaban benar, berapa lama waktu tunggunya, dan kapan terakhir kami menjalankannya.
ModelBenarKeteranganDitahanKeterangan$/benarKeteranganLatensiKeteranganTerakhirKeterangan
Gemma 4 31BGoogle43/4987,8%17/20$0.000027$0.0016952 msmedian
GPT-5.6 LunaOpenAI41/4983,7%14/20$0.000074$0.00412.020 msmedian
DeepSeek V4 Flash 0731DeepSeek37/4975,5%14/20$0.000096$0.00494.094 msmedian
Gemma-SEA-LION v4.5 E2B-ITlokal35/4971,4%15/20-930 msmedian
Qwen3 30B A3B Instruct 2507Alibaba31/4963,3%15/20$0.000028$0.00131.636 msmedian
Solar Pro 4Upstage30/4961,2%13/20$0.000012$0.00052.275 msmedian
Ling-3.0-flashAnt Group29/4959,2%12/20$0.000083$0.00341.936 msmedian
Mistral Small 3Mistral23/4946,9%15/20$0.000016$0.0006671 msmedian
Llama3 8B CPT Sahabat-AI v1 Instructlokal20/4940,8%9/20-418 msmedian
Llama 3.1 8B Instructlokal12/4924,5%11/20-534 msmedian
Hunyuan A13B InstructTencent11/4922,4%11/20$0.000099$0.00221.497 msmedian

Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.

Tiap angka di tabel ini dapat dihitung ulang dari data mentahnya. Buka datanya

Biaya dan tokenjawaban isianPrompt bawaanTermurah untuk tiap jawaban benar: Mistral Small 3 ($0.000014). Termahal: DeepSeek V4 Flash 0731 ($0.000116).

Seluruh angka biaya dalam dolar AS.

Biaya untuk tiap jawaban benar · Prompt bawaan

Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.

Biaya untuk tiap jawaban benar · Prompt bawaan

Biaya satu kali pengujian penuh · Prompt bawaan

Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.

Biaya satu kali pengujian penuh · Prompt bawaan

Token yang dipakai · Prompt bawaan

Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.

InputOutput
Ling-3.0-flash10.971,0 · 25.604,0
DeepSeek V4 Flash 07318.996,0 · 12.280,0
GPT-5.6 Luna8.826,0 · 2.099,0
Llama3 8B CPT Sahabat-AI v1 Instruct10.752,0 · 950,0
Llama 3.1 8B Instruct10.752,0 · 945,0
Qwen3 30B A3B Instruct 250710.617,0 · 928,0
Mistral Small 39.348,0 · 873,0
Hunyuan A13B Instruct10.341,0 · 869,0
Solar Pro 412.501,0 · 853,0
Gemma-SEA-LION v4.5 E2B-IT8.106,0 · 687,0
Gemma 4 31B9.098,0 · 685,0
Token yang dipakai · Prompt bawaan
Biaya dan tokenjawaban isianPrompt rinci yang melarang ganti kataTermurah untuk tiap jawaban benar: Solar Pro 4 ($0.000013). Termahal: DeepSeek V4 Flash 0731 ($0.000095).

Seluruh angka biaya dalam dolar AS.

Biaya untuk tiap jawaban benar · Prompt rinci yang melarang ganti kata

Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.

Biaya untuk tiap jawaban benar · Prompt rinci yang melarang ganti kata

Biaya satu kali pengujian penuh · Prompt rinci yang melarang ganti kata

Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.

Biaya satu kali pengujian penuh · Prompt rinci yang melarang ganti kata

Token yang dipakai · Prompt rinci yang melarang ganti kata

Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.

InputOutput
Ling-3.0-flash13.455,0 · 22.398,0
DeepSeek V4 Flash 073110.998,0 · 14.585,0
GPT-5.6 Luna10.689,0 · 5.256,0
Llama 3.1 8B Instruct13.098,0 · 955,0
Llama3 8B CPT Sahabat-AI v1 Instruct13.098,0 · 939,0
Qwen3 30B A3B Instruct 250712.963,0 · 930,0
Mistral Small 311.349,0 · 875,0
Hunyuan A13B Instruct12.687,0 · 871,0
Solar Pro 414.502,0 · 849,0
Gemma 4 31B10.432,0 · 688,0
Gemma-SEA-LION v4.5 E2B-IT9.900,0 · 684,0
Token yang dipakai · Prompt rinci yang melarang ganti kata
Biaya dan tokenjawaban isianPrompt yang menyatakan aturan kunciTermurah untuk tiap jawaban benar: Solar Pro 4 ($0.000012). Termahal: Hunyuan A13B Instruct ($0.000099).

Seluruh angka biaya dalam dolar AS.

Biaya untuk tiap jawaban benar · Prompt yang menyatakan aturan kunci

Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.

Biaya untuk tiap jawaban benar · Prompt yang menyatakan aturan kunci

Biaya satu kali pengujian penuh · Prompt yang menyatakan aturan kunci

Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.

Biaya satu kali pengujian penuh · Prompt yang menyatakan aturan kunci

Token yang dipakai · Prompt yang menyatakan aturan kunci

Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.

InputOutput
Ling-3.0-flash12.351,0 · 42.114,0
DeepSeek V4 Flash 073110.240,0 · 14.955,0
GPT-5.6 Luna9.999,0 · 5.122,0
Llama 3.1 8B Instruct12.477,0 · 971,0
Llama3 8B CPT Sahabat-AI v1 Instruct12.477,0 · 942,0
Qwen3 30B A3B Instruct 250712.342,0 · 916,0
Gemma 4 31B9.761,0 · 901,0
Mistral Small 310.521,0 · 879,0
Hunyuan A13B Instruct12.066,0 · 871,0
Solar Pro 413.812,0 · 860,0
Gemma-SEA-LION v4.5 E2B-IT9.210,0 · 687,0
Token yang dipakai · Prompt yang menyatakan aturan kunci

Benchmark