Set ini punya 1 kumpulan hasil lain, dari soal atau kunci jawaban versi sebelumnya. Kami tidak menggambarnya di grafik yang sama, sebab skor yang dihitung dengan soal berbeda bukan pengukuran yang sama.
Ringkasan cepat
Hasil
Berapa soal yang dijawab benar oleh tiap model, dari soal yang sama persis. Batang menunjukkan jumlah jawaban benar, bukan peringkat kemampuan model secara umum.
Model diminta menjelaskan arti satu kata dengan kalimat bebas. Jawaban dihitung benar kalau memuat seluruh kata dari salah satu kunci yang kami sahkan.
Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.
Cara angka ini dihitung
arti-kata-v1KeteranganCara bertanya untuk soal arti kata. Model diminta menjelaskan arti satu kata tanpa diberi pilihan jawaban, jadi jawabannya kalimat bebas.cara menilai kunci-alias-v1KeteranganCara menilai soal arti kata. Jawaban dihitung benar kalau memuat seluruh kata dari salah satu kunci yang kami sahkan, dibandingkan pada bentuk dasarnya. Imbuhan, urutan kata, dan kalimat tambahan di sekitarnya tidak menggugurkan jawaban.versi soal a7ba9fa24e64KeteranganSidik jari 12 karakter dari seluruh soal yang dilihat oleh model: nomor item, kalimat pertanyaannya, pilihan jawabannya, dan urutan opsinya. Mengubah satu kata saja mengubah sidik jarinya. Skor dengan sidik jari berbeda menjawab pertanyaan yang berbeda, jadi halaman ini hanya membandingkan angka yang sidik jarinya sama.versi kunci 873b6f168502KeteranganSidik jari 12 karakter dari kunci jawabannya: rujukan, padanan lain yang kami terima, dan vonis penutur untuk soal yang tidak dinilai mesin. Soalnya dapat sama persis sementara kuncinya berubah. Ketika itu terjadi, skornya bisa berubah padahal soal tidak berubah satu kata pun. Karena itu ia dipisah dari versi soal.Rincian per model
Angka yang sama dengan grafik di atas, ditambah biaya untuk tiap jawaban benar, waktu tunggu, dan tanggal pengujian terakhir. Kolom yang tidak dapat ditebak dari namanya membawa keterangannya sendiri.
| Model | BenarKeteranganBerapa jawaban model yang cocok dengan kunci, dari sekian soal yang dinilai. | DitahanKeteranganSkor pada soal yang kuncinya tidak pernah kami terbitkan. Kolom di sebelah kirinya memuat soal yang kuncinya sudah publik, jadi skor di sana tidak dapat dibedakan dari model yang pernah membacanya. Kolom ini yang membedakannya. Pada set ini, selisih baru layak dibaca sebagai sinyal di atas sekitar 20,8 poin. Selisih yang lebih kecil tidak dapat dipisahkan dari kebetulan. Menerbitkan skor ini juga mengikis kegunaannya pelan-pelan, sebab tiap angka yang terbit adalah informasi tentang soal yang kami tahan. Karena itu, kelompok soal tertahan ini punya umur terbatas, dan akan dirotasi. | $/benarKeteranganBiaya satu kali pengujian penuh dibagi SELURUH jawaban benarnya, termasuk yang di kolom Ditahan. Kolom Benar memuat soal yang kuncinya sudah terbit saja, jadi penyebut di sini jumlah kedua kolom itu. BUKAN biaya per panggilan: model yang murah tetapi banyak salah bisa lebih mahal per jawaban benar daripada model yang lebih mahal per panggilan. | LatensiKeteranganMedian waktu tunggu satu panggilan. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya. | TerakhirKeteranganTanggal terakhir kami menjalankan model ini pada soal dan kunci jawaban yang sama. |
|---|---|---|---|---|---|
| Gemini 3.5 FlashGoogle | 128/13594,8% | 58/6490,6% | $0.002985$0.5552 | 2.711 msmedian | |
| Gemma 4 31BGoogle | 116/13585,9% | 51/6479,7% | $0.000012$0.0021 | 1.063 msmedian | |
| GPT-5.6 LunaOpenAI | 112/13583,0% | 53/6482,8% | $0.000051$0.0084 | 1.438 msmedian | |
| DeepSeek V4 Flash 0731DeepSeek | 107/13579,3% | 49/6476,6% | $0.000054$0.0085 | 3.123 msmedian | |
| Claude Haiku 4.5Anthropic | 86/13563,7% | 41/6464,1% | $0.000292$0.0371 | 1.635 msmedian | |
| Ling-3.0-flashAnt Group | 69/13551,1% | 27/6442,2% | $0.000036$0.0035 | 1.390 msmedian | |
| Llama3 8B CPT Sahabat-AI v1 Instructlokal | 61/13545,2% | 27/6442,2% | - | 528 msmedian | |
| Gemma-SEA-LION v4.5 E2B-ITlokal | 60/13544,4% | 27/6442,2% | - | 734 msmedian | |
| Solar Pro 4Upstage | 52/13538,5% | 24/6437,5% | $0.000013$0.0010 | 1.142 msmedian | |
| Qwen3 30B A3B Instruct 2507Alibaba | 51/13537,8% | 23/6435,9% | $0.000020$0.0015 | 816 msmedian | |
| Llama 3.1 8B Instructlokal | 26/13519,3% | 11/6417,2% | - | 532 msmedian | |
| Nemotron 3.5 LightningNVIDIA | 25/13518,5% | 9/6414,1% | $0.001081$0.0368 | 3.088 msmedian | |
| Mistral Small 3Mistral | 25/13518,5% | 6/649,4% | $0.000070$0.0022 | 843 msmedian | |
| Hunyuan A13B InstructTencent | 21/13515,6% | 12/6418,8% | $0.000118$0.0039 | 1.747 msmedian |
Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.
Tiap angka di tabel ini dapat dihitung ulang dari data mentahnya. Buka datanya →
Biaya dan tokenTermurah untuk tiap jawaban benar: Gemma 4 31B ($0.000012). Termahal: Gemini 3.5 Flash ($0.002985).Lihat grafikSembunyikan
Seluruh angka biaya dalam dolar AS.
Biaya untuk tiap jawaban benar
Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.
Biaya satu kali pengujian penuh
Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.
Token yang dipakai
Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.
Versi sebelumnya
Kami mengubah soal atau kunci jawabannya setelah angka ini diukur, jadi angka di bawah tidak dapat dibandingkan langsung dengan hasil di atas. Kami menyimpannya, bukan menghapusnya.