Ringkasan cepat
Diambil dari papan jawaban isian, prompt bawaan, papan dengan model terbanyak di set ini. Papan lain punya angkanya sendiri di bawah.
Hasil
Berapa soal yang dijawab benar oleh tiap model, dari soal yang sama persis. Batang menunjukkan jumlah jawaban benar, bukan peringkat kemampuan model secara umum.
Set ini diuji dengan 3 prompt berbeda
Soal dan kunci jawabannya sama persis di 3 pengujian ini, 69 soal jawaban isian yang tidak bergerak satu kata pun. Bedanya cuma prompt yang dikirim ke model. Skor Gemma 4 31B bergeser 44,9 poin hanya karena promptnya diganti. Juaranya pun berganti, dari Qwen3 30B A3B Instruct 2507 ke Gemma 4 31B. Karena itu set ini tidak punya satu papan peringkat, dan angkanya tidak boleh dirata-ratakan antar-prompt.
Bunyi tiap prompt
Promptnya berbunyi “Ubah kalimat berikut menjadi bahasa Indonesia baku”, diambil apa adanya dari dalam soal. Longgar: ia tidak menyebut apa yang tidak boleh disentuh, jadi model bebas menafsirkan sampai mengganti kata dengan sinonimnya.
open-py1Promptnya melarang mengganti kata dengan sinonim dan melarang mengubah tingkat keformalan. Larangan itu terdengar masuk akal, tetapi kunci jawaban kami sendiri mengganti kata di 40 tempat, jadi prompt ini justru melanggar kuncinya.
open-py2Promptnya menyuruh membakukan tiap kata yang belum baku, termasuk singkatan yang ditulis tanpa huruf vokal, dan membiarkan kata yang sudah baku. Ditulis setelah aturan kuncinya dihitung kata demi kata.
open-py3Lihat 3 papan terpisah, satu per prompt
Model menulis jawabannya sendiri, tanpa diberi pilihan. Sebagian dinilai mesin dengan mencocokkan rujukan, sebagian dibaca penutur asli satu per satu memakai rubrik berbobot.
Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.
Cara angka ini dihitung
open-py1KeteranganPromptnya berbunyi “Ubah kalimat berikut menjadi bahasa Indonesia baku”, diambil apa adanya dari dalam soal. Longgar: ia tidak menyebut apa yang tidak boleh disentuh, jadi model bebas menafsirkan sampai mengganti kata dengan sinonimnya.cara menilai open-py1KeteranganCara menilai jawaban terbuka. Jawaban dinormalkan lebih dulu, lalu dibandingkan dengan rujukan dan daftar jawaban lain yang kami terima. Item yang menuntut penilaian manusia sengaja tidak diberi skor otomatis.versi soal 5ca9dfe11dc2KeteranganSidik jari 12 karakter dari seluruh soal yang dilihat oleh model: nomor item, kalimat pertanyaannya, pilihan jawabannya, dan urutan opsinya. Mengubah satu kata saja mengubah sidik jarinya. Skor dengan sidik jari berbeda menjawab pertanyaan yang berbeda, jadi halaman ini hanya membandingkan angka yang sidik jarinya sama.versi kunci eda1d1cddc75KeteranganSidik jari 12 karakter dari kunci jawabannya: rujukan, padanan lain yang kami terima, dan vonis penutur untuk soal yang tidak dinilai mesin. Soalnya dapat sama persis sementara kuncinya berubah. Ketika itu terjadi, skornya bisa berubah padahal soal tidak berubah satu kata pun. Karena itu ia dipisah dari versi soal.Model menulis jawabannya sendiri, tanpa diberi pilihan. Sebagian dinilai mesin dengan mencocokkan rujukan, sebagian dibaca penutur asli satu per satu memakai rubrik berbobot.
Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.
Cara angka ini dihitung
open-py2KeteranganPromptnya melarang mengganti kata dengan sinonim dan melarang mengubah tingkat keformalan. Larangan itu terdengar masuk akal, tetapi kunci jawaban kami sendiri mengganti kata di 40 tempat, jadi prompt ini justru melanggar kuncinya.cara menilai open-py1KeteranganCara menilai jawaban terbuka. Jawaban dinormalkan lebih dulu, lalu dibandingkan dengan rujukan dan daftar jawaban lain yang kami terima. Item yang menuntut penilaian manusia sengaja tidak diberi skor otomatis.versi soal 5ca9dfe11dc2KeteranganSidik jari 12 karakter dari seluruh soal yang dilihat oleh model: nomor item, kalimat pertanyaannya, pilihan jawabannya, dan urutan opsinya. Mengubah satu kata saja mengubah sidik jarinya. Skor dengan sidik jari berbeda menjawab pertanyaan yang berbeda, jadi halaman ini hanya membandingkan angka yang sidik jarinya sama.versi kunci eda1d1cddc75KeteranganSidik jari 12 karakter dari kunci jawabannya: rujukan, padanan lain yang kami terima, dan vonis penutur untuk soal yang tidak dinilai mesin. Soalnya dapat sama persis sementara kuncinya berubah. Ketika itu terjadi, skornya bisa berubah padahal soal tidak berubah satu kata pun. Karena itu ia dipisah dari versi soal.Model menulis jawabannya sendiri, tanpa diberi pilihan. Sebagian dinilai mesin dengan mencocokkan rujukan, sebagian dibaca penutur asli satu per satu memakai rubrik berbobot.
Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.
Cara angka ini dihitung
open-py3KeteranganPromptnya menyuruh membakukan tiap kata yang belum baku, termasuk singkatan yang ditulis tanpa huruf vokal, dan membiarkan kata yang sudah baku. Ditulis setelah aturan kuncinya dihitung kata demi kata.cara menilai open-py1KeteranganCara menilai jawaban terbuka. Jawaban dinormalkan lebih dulu, lalu dibandingkan dengan rujukan dan daftar jawaban lain yang kami terima. Item yang menuntut penilaian manusia sengaja tidak diberi skor otomatis.versi soal 5ca9dfe11dc2KeteranganSidik jari 12 karakter dari seluruh soal yang dilihat oleh model: nomor item, kalimat pertanyaannya, pilihan jawabannya, dan urutan opsinya. Mengubah satu kata saja mengubah sidik jarinya. Skor dengan sidik jari berbeda menjawab pertanyaan yang berbeda, jadi halaman ini hanya membandingkan angka yang sidik jarinya sama.versi kunci eda1d1cddc75KeteranganSidik jari 12 karakter dari kunci jawabannya: rujukan, padanan lain yang kami terima, dan vonis penutur untuk soal yang tidak dinilai mesin. Soalnya dapat sama persis sementara kuncinya berubah. Ketika itu terjadi, skornya bisa berubah padahal soal tidak berubah satu kata pun. Karena itu ia dipisah dari versi soal.Rincian per model
Angka yang sama dengan grafik di atas, ditambah biaya untuk tiap jawaban benar, waktu tunggu, dan tanggal pengujian terakhir. Kolom yang tidak dapat ditebak dari namanya membawa keterangannya sendiri.
Lihat 3 tabel terpisah, satu per prompt
| Model | BenarKeteranganBerapa jawaban model yang cocok dengan kunci, dari sekian soal yang dinilai. | DitahanKeteranganSkor pada soal yang kuncinya tidak pernah kami terbitkan. Kolom di sebelah kirinya memuat soal yang kuncinya sudah publik, jadi skor di sana tidak dapat dibedakan dari model yang pernah membacanya. Kolom ini yang membedakannya. Kelompok soal tertahan di set ini terlalu kecil untuk dibaca sebagai pengukuran: selisih baru berarti di atas sekitar 34,9 poin, dan itu jauh lebih besar daripada selisih yang realistis. Karena itu persentasenya sengaja tidak ditampilkan, hanya cacahannya. Menerbitkan skor ini juga mengikis kegunaannya pelan-pelan, sebab tiap angka yang terbit adalah informasi tentang soal yang kami tahan. Karena itu, kelompok soal tertahan ini punya umur terbatas, dan akan dirotasi. | $/benarKeteranganBiaya satu kali pengujian penuh dibagi SELURUH jawaban benarnya, termasuk yang di kolom Ditahan. Kolom Benar memuat soal yang kuncinya sudah terbit saja, jadi penyebut di sini jumlah kedua kolom itu. BUKAN biaya per panggilan: model yang murah tetapi banyak salah bisa lebih mahal per jawaban benar daripada model yang lebih mahal per panggilan. | LatensiKeteranganMedian waktu tunggu satu panggilan. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya. | TerakhirKeteranganTanggal terakhir kami menjalankan model ini pada soal dan kunci jawaban yang sama. |
|---|---|---|---|---|---|
| Qwen3 30B A3B Instruct 2507Alibaba | 29/4959,2% | 11/20 | $0.000024$0.0010 | 2.043 msmedian | |
| Ling-3.0-flashAnt Group | 27/4955,1% | 12/20 | $0.000050$0.0020 | 1.766 msmedian | |
| Mistral Small 3Mistral | 26/4953,1% | 13/20 | $0.000014$0.0005 | 962 msmedian | |
| DeepSeek V4 Flash 0731DeepSeek | 24/4949,0% | 11/20 | $0.000116$0.0040 | 3.644 msmedian | |
| Gemma-SEA-LION v4.5 E2B-ITlokal | 23/4946,9% | 12/20 | - | 890 msmedian | |
| GPT-5.6 LunaOpenAI | 22/4944,9% | 9/20 | $0.000069$0.0021 | 1.034 msmedian | |
| Gemma 4 31BGoogle | 21/4942,9% | 11/20 | $0.000051$0.0016 | 1.330 msmedian | |
| Solar Pro 4Upstage | 19/4938,8% | 9/20 | $0.000017$0.0005 | 2.684 msmedian | |
| Llama3 8B CPT Sahabat-AI v1 Instructlokal | 17/4934,7% | 5/20 | - | 390 msmedian | |
| Llama 3.1 8B Instructlokal | 16/4932,7% | 10/20 | - | 528 msmedian | |
| Hunyuan A13B InstructTencent | 12/4924,5% | 5/20 | $0.000114$0.0019 | 1.485 msmedian |
Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.
| Model | BenarKeteranganBerapa jawaban model yang cocok dengan kunci, dari sekian soal yang dinilai. | DitahanKeteranganSkor pada soal yang kuncinya tidak pernah kami terbitkan. Kolom di sebelah kirinya memuat soal yang kuncinya sudah publik, jadi skor di sana tidak dapat dibedakan dari model yang pernah membacanya. Kolom ini yang membedakannya. Kelompok soal tertahan di set ini terlalu kecil untuk dibaca sebagai pengukuran: selisih baru berarti di atas sekitar 34,9 poin, dan itu jauh lebih besar daripada selisih yang realistis. Karena itu persentasenya sengaja tidak ditampilkan, hanya cacahannya. Menerbitkan skor ini juga mengikis kegunaannya pelan-pelan, sebab tiap angka yang terbit adalah informasi tentang soal yang kami tahan. Karena itu, kelompok soal tertahan ini punya umur terbatas, dan akan dirotasi. | $/benarKeteranganBiaya satu kali pengujian penuh dibagi SELURUH jawaban benarnya, termasuk yang di kolom Ditahan. Kolom Benar memuat soal yang kuncinya sudah terbit saja, jadi penyebut di sini jumlah kedua kolom itu. BUKAN biaya per panggilan: model yang murah tetapi banyak salah bisa lebih mahal per jawaban benar daripada model yang lebih mahal per panggilan. | LatensiKeteranganMedian waktu tunggu satu panggilan. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya. | TerakhirKeteranganTanggal terakhir kami menjalankan model ini pada soal dan kunci jawaban yang sama. |
|---|---|---|---|---|---|
| Gemma 4 31BGoogle | 43/4987,8% | 16/20 | $0.000026$0.0016 | 1.373 msmedian | |
| GPT-5.6 LunaOpenAI | 38/4977,6% | 14/20 | $0.000081$0.0042 | 2.199 msmedian | |
| Gemma-SEA-LION v4.5 E2B-ITlokal | 36/4973,5% | 15/20 | - | 863 msmedian | |
| DeepSeek V4 Flash 0731DeepSeek | 35/4971,4% | 15/20 | $0.000095$0.0047 | 4.526 msmedian | |
| Ling-3.0-flashAnt Group | 32/4965,3% | 12/20 | $0.000040$0.0018 | 1.767 msmedian | |
| Qwen3 30B A3B Instruct 2507Alibaba | 30/4961,2% | 13/20 | $0.000027$0.0012 | 1.656 msmedian | |
| Llama3 8B CPT Sahabat-AI v1 Instructlokal | 29/4959,2% | 11/20 | - | 415 msmedian | |
| Solar Pro 4Upstage | 28/4957,1% | 13/20 | $0.000013$0.0005 | 5.339 msmedian | |
| Mistral Small 3Mistral | 27/4955,1% | 11/20 | $0.000017$0.0006 | 650 msmedian | |
| Llama 3.1 8B Instructlokal | 20/4940,8% | 10/20 | - | 505 msmedian | |
| Hunyuan A13B InstructTencent | 19/4938,8% | 10/20 | $0.000078$0.0023 | 1.493 msmedian |
Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.
| Model | BenarKeteranganBerapa jawaban model yang cocok dengan kunci, dari sekian soal yang dinilai. | DitahanKeteranganSkor pada soal yang kuncinya tidak pernah kami terbitkan. Kolom di sebelah kirinya memuat soal yang kuncinya sudah publik, jadi skor di sana tidak dapat dibedakan dari model yang pernah membacanya. Kolom ini yang membedakannya. Kelompok soal tertahan di set ini terlalu kecil untuk dibaca sebagai pengukuran: selisih baru berarti di atas sekitar 34,9 poin, dan itu jauh lebih besar daripada selisih yang realistis. Karena itu persentasenya sengaja tidak ditampilkan, hanya cacahannya. Menerbitkan skor ini juga mengikis kegunaannya pelan-pelan, sebab tiap angka yang terbit adalah informasi tentang soal yang kami tahan. Karena itu, kelompok soal tertahan ini punya umur terbatas, dan akan dirotasi. | $/benarKeteranganBiaya satu kali pengujian penuh dibagi SELURUH jawaban benarnya, termasuk yang di kolom Ditahan. Kolom Benar memuat soal yang kuncinya sudah terbit saja, jadi penyebut di sini jumlah kedua kolom itu. BUKAN biaya per panggilan: model yang murah tetapi banyak salah bisa lebih mahal per jawaban benar daripada model yang lebih mahal per panggilan. | LatensiKeteranganMedian waktu tunggu satu panggilan. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya. | TerakhirKeteranganTanggal terakhir kami menjalankan model ini pada soal dan kunci jawaban yang sama. |
|---|---|---|---|---|---|
| Gemma 4 31BGoogle | 43/4987,8% | 17/20 | $0.000027$0.0016 | 952 msmedian | |
| GPT-5.6 LunaOpenAI | 41/4983,7% | 14/20 | $0.000074$0.0041 | 2.020 msmedian | |
| DeepSeek V4 Flash 0731DeepSeek | 37/4975,5% | 14/20 | $0.000096$0.0049 | 4.094 msmedian | |
| Gemma-SEA-LION v4.5 E2B-ITlokal | 35/4971,4% | 15/20 | - | 930 msmedian | |
| Qwen3 30B A3B Instruct 2507Alibaba | 31/4963,3% | 15/20 | $0.000028$0.0013 | 1.636 msmedian | |
| Solar Pro 4Upstage | 30/4961,2% | 13/20 | $0.000012$0.0005 | 2.275 msmedian | |
| Ling-3.0-flashAnt Group | 29/4959,2% | 12/20 | $0.000083$0.0034 | 1.936 msmedian | |
| Mistral Small 3Mistral | 23/4946,9% | 15/20 | $0.000016$0.0006 | 671 msmedian | |
| Llama3 8B CPT Sahabat-AI v1 Instructlokal | 20/4940,8% | 9/20 | - | 418 msmedian | |
| Llama 3.1 8B Instructlokal | 12/4924,5% | 11/20 | - | 534 msmedian | |
| Hunyuan A13B InstructTencent | 11/4922,4% | 11/20 | $0.000099$0.0022 | 1.497 msmedian |
Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.
Tiap angka di tabel ini dapat dihitung ulang dari data mentahnya. Buka datanya →
Biaya dan tokenjawaban isianPrompt bawaanTermurah untuk tiap jawaban benar: Mistral Small 3 ($0.000014). Termahal: DeepSeek V4 Flash 0731 ($0.000116).Lihat grafikSembunyikan
Seluruh angka biaya dalam dolar AS.
Biaya untuk tiap jawaban benar · Prompt bawaan
Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.
Biaya satu kali pengujian penuh · Prompt bawaan
Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.
Token yang dipakai · Prompt bawaan
Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.
Biaya dan tokenjawaban isianPrompt rinci yang melarang ganti kataTermurah untuk tiap jawaban benar: Solar Pro 4 ($0.000013). Termahal: DeepSeek V4 Flash 0731 ($0.000095).Lihat grafikSembunyikan
Seluruh angka biaya dalam dolar AS.
Biaya untuk tiap jawaban benar · Prompt rinci yang melarang ganti kata
Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.
Biaya satu kali pengujian penuh · Prompt rinci yang melarang ganti kata
Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.
Token yang dipakai · Prompt rinci yang melarang ganti kata
Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.
Biaya dan tokenjawaban isianPrompt yang menyatakan aturan kunciTermurah untuk tiap jawaban benar: Solar Pro 4 ($0.000012). Termahal: Hunyuan A13B Instruct ($0.000099).Lihat grafikSembunyikan
Seluruh angka biaya dalam dolar AS.
Biaya untuk tiap jawaban benar · Prompt yang menyatakan aturan kunci
Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.
Biaya satu kali pengujian penuh · Prompt yang menyatakan aturan kunci
Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.
Token yang dipakai · Prompt yang menyatakan aturan kunci
Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.