Set ini punya 1 kumpulan hasil lain, dari soal atau kunci jawaban versi sebelumnya. Kami tidak menggambarnya di grafik yang sama, sebab skor yang dihitung dengan soal berbeda bukan pengukuran yang sama.
Ringkasan cepat
Hasil
Berapa soal yang dijawab benar oleh tiap model, dari soal yang sama persis. Batang menunjukkan jumlah jawaban benar, bukan peringkat kemampuan model secara umum.
Model membaca soal beserta pilihan jawabannya, lalu menjawab satu huruf saja. Soalnya dinilai mesin: jawaban benar kalau hurufnya sama dengan kunci.
Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.
Cara angka ini dihitung
mcq-py1KeteranganCara bertanya pilihan ganda. Soal dan opsinya disusun dari item, urutan opsinya diacak dengan benih tetap supaya sama untuk semua model, dan model diminta menjawab satu huruf saja.cara menilai mcq-py1KeteranganCara menilai pilihan ganda. Kami membaca satu huruf opsi dari jawaban dan membandingkannya dengan kunci. Jawaban yang tidak memuat huruf opsi dicatat sebagai gagal format, terpisah dari jawaban salah, supaya alat yang rusak tidak terbaca sebagai model yang lemah.versi soal d3e8c01bc554KeteranganSidik jari 12 karakter dari seluruh soal yang dilihat oleh model: nomor item, kalimat pertanyaannya, pilihan jawabannya, dan urutan opsinya. Mengubah satu kata saja mengubah sidik jarinya. Skor dengan sidik jari berbeda menjawab pertanyaan yang berbeda, jadi halaman ini hanya membandingkan angka yang sidik jarinya sama.versi kunci 4e94e1cb7f25KeteranganSidik jari 12 karakter dari kunci jawabannya: rujukan, padanan lain yang kami terima, dan vonis penutur untuk soal yang tidak dinilai mesin. Soalnya dapat sama persis sementara kuncinya berubah. Ketika itu terjadi, skornya bisa berubah padahal soal tidak berubah satu kata pun. Karena itu ia dipisah dari versi soal.Rincian per model
Angka yang sama dengan grafik di atas, ditambah biaya untuk tiap jawaban benar, waktu tunggu, dan tanggal pengujian terakhir. Kolom yang tidak dapat ditebak dari namanya membawa keterangannya sendiri.
| Model | BenarKeteranganBerapa jawaban model yang cocok dengan kunci, dari sekian soal yang dinilai. | DitahanKeteranganSkor pada soal yang kuncinya tidak pernah kami terbitkan. Kolom di sebelah kirinya memuat soal yang kuncinya sudah publik, jadi skor di sana tidak dapat dibedakan dari model yang pernah membacanya. Kolom ini yang membedakannya. Kelompok soal tertahan di set ini terlalu kecil untuk dibaca sebagai pengukuran: selisih baru berarti di atas sekitar 36,8 poin, dan itu jauh lebih besar daripada selisih yang realistis. Karena itu persentasenya sengaja tidak ditampilkan, hanya cacahannya. Menerbitkan skor ini juga mengikis kegunaannya pelan-pelan, sebab tiap angka yang terbit adalah informasi tentang soal yang kami tahan. Karena itu, kelompok soal tertahan ini punya umur terbatas, dan akan dirotasi. | $/benarKeteranganBiaya satu kali pengujian penuh dibagi SELURUH jawaban benarnya, termasuk yang di kolom Ditahan. Kolom Benar memuat soal yang kuncinya sudah terbit saja, jadi penyebut di sini jumlah kedua kolom itu. BUKAN biaya per panggilan: model yang murah tetapi banyak salah bisa lebih mahal per jawaban benar daripada model yang lebih mahal per panggilan. | LatensiKeteranganMedian waktu tunggu satu panggilan. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya. | TerakhirKeteranganTanggal terakhir kami menjalankan model ini pada soal dan kunci jawaban yang sama. |
|---|---|---|---|---|---|
| GPT-5.6 LunaOpenAI | 42/42100,0% | 18/18 | $0.000051$0.0031 | 1.103 msmedian | |
| Gemma 4 31BGoogle | 41/4297,6% | 17/18 | $0.000017$0.0010 | 614 msmedian | |
| Llama3 8B CPT Sahabat-AI v1 Instructlokal2 pengujianKeteranganModel ini dijalankan 2 kali pada benchmark ini, dengan soal, kunci, dan suhu yang sama. Kolom Benar menunjukkan hasil terendah sampai tertinggi. Jarak itu menunjukkan seberapa jauh skor bergerak dengan sendirinya, jadi selisih yang lebih kecil daripada jarak itu bukan selisih kemampuan. Kolom biaya, latensi, dan tanggal berasal dari pengujian terakhir, bukan dijumlahkan. | 56-56/4295,2% | 16/18 | - | 430 msmedian | |
| DeepSeek V4 Flash 0731DeepSeek | 39/4292,9% | 18/18 | $0.000039$0.0022 | 3.281 msmedian | |
| Claude Haiku 4.5Anthropic | 38/4290,5% | 18/18 | $0.000274$0.0154 | 1.426 msmedian | |
| Ling-3.0-flashAnt Group | 37/4288,1% | 17/18 | $0.000021$0.0011 | 1.410 msmedian | |
| Qwen3 30B A3B Instruct 2507Alibaba | 37/4288,1% | 16/18 | $0.000021$0.0011 | 701 msmedian | |
| Solar Pro 4Upstage | 37/4288,1% | 15/18 | $0.000008$0.0004 | 881 msmedian | |
| Gemma-SEA-LION v4.5 E2B-ITlokal | 33/4278,6% | 12/18 | - | 843 msmedian | |
| Mistral Small 3Mistral | 32/4276,2% | 13/18 | $0.000013$0.0006 | 501 msmedian | |
| Llama 3.1 8B Instructlokal | 32/4276,2% | 13/18 | - | 533 msmedian | |
| Hunyuan A13B InstructTencent | 29/4269,0% | 14/18 | $0.000042$0.0018 | 1.488 msmedian |
Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.
Tiap angka di tabel ini dapat dihitung ulang dari data mentahnya. Buka datanya →
Biaya dan tokenTermurah untuk tiap jawaban benar: Solar Pro 4 ($0.000008). Termahal: Claude Haiku 4.5 ($0.000274).Lihat grafikSembunyikan
Seluruh angka biaya dalam dolar AS.
Biaya untuk tiap jawaban benar
Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.
Biaya satu kali pengujian penuh
Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.
Token yang dipakai
Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.
Dari waktu ke waktu
Kami hanya menggambar model yang dijalankan lebih dari sekali. Satu titik bukan tren, dan menariknya jadi garis datar menyiratkan kestabilan yang belum kami ukur.
| Deret | Tanggal | Nilai |
|---|---|---|
| Llama3 8B CPT Sahabat-AI v1 Instruct | 2026-08-17T15:04:03Z | 56 |
| Llama3 8B CPT Sahabat-AI v1 Instruct | 2026-08-17T15:10:43Z | 56 |
Versi sebelumnya
Kami mengubah soal atau kunci jawabannya setelah angka ini diukur, jadi angka di bawah tidak dapat dibandingkan langsung dengan hasil di atas. Kami menyimpannya, bukan menghapusnya.