Ringkasan cepat
Hasil
Berapa soal yang dijawab benar oleh tiap model, dari soal yang sama persis. Batang menunjukkan jumlah jawaban benar, bukan peringkat kemampuan model secara umum.
Model diminta menjelaskan arti satu kata dengan kalimat bebas. Jawaban dihitung benar kalau memuat seluruh kata dari salah satu kunci yang kami sahkan.
Model yang namanya tidak berakhir dengan tanggal dipanggil lewat id yang tidak mengunci versi. Lihat keterangan di sebelah namanya.
Cara angka ini dihitung
arti-kata-v1KeteranganCara bertanya untuk soal arti kata. Model diminta menjelaskan arti satu kata tanpa diberi pilihan jawaban, jadi jawabannya kalimat bebas.cara menilai kunci-alias-v1KeteranganCara menilai soal arti kata. Jawaban dihitung benar kalau memuat seluruh kata dari salah satu kunci yang kami sahkan, dibandingkan pada bentuk dasarnya. Imbuhan, urutan kata, dan kalimat tambahan di sekitarnya tidak menggugurkan jawaban.versi soal 6dfcc448bbd5KeteranganSidik jari 12 karakter dari seluruh soal yang dilihat oleh model: nomor item, kalimat pertanyaannya, pilihan jawabannya, dan urutan opsinya. Mengubah satu kata saja mengubah sidik jarinya. Skor dengan sidik jari berbeda menjawab pertanyaan yang berbeda, jadi halaman ini hanya membandingkan angka yang sidik jarinya sama.versi kunci 0a1bc07f67bcKeteranganSidik jari 12 karakter dari kunci jawabannya: rujukan, padanan lain yang kami terima, dan vonis penutur untuk soal yang tidak dinilai mesin. Soalnya dapat sama persis sementara kuncinya berubah. Ketika itu terjadi, skornya bisa berubah padahal soal tidak berubah satu kata pun. Karena itu ia dipisah dari versi soal.Rincian per model
Angka yang sama dengan grafik di atas, ditambah biaya untuk tiap jawaban benar, waktu tunggu, dan tanggal pengujian terakhir. Kolom yang tidak dapat ditebak dari namanya membawa keterangannya sendiri.
| Model | BenarKeteranganBerapa jawaban model yang cocok dengan kunci, dari sekian soal yang dinilai. | $/benarKeteranganBiaya satu kali pengujian penuh dibagi SELURUH jawaban benarnya, termasuk yang di kolom Ditahan. Kolom Benar memuat soal yang kuncinya sudah terbit saja, jadi penyebut di sini jumlah kedua kolom itu. BUKAN biaya per panggilan: model yang murah tetapi banyak salah bisa lebih mahal per jawaban benar daripada model yang lebih mahal per panggilan. | LatensiKeteranganMedian waktu tunggu satu panggilan. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya. | TerakhirKeteranganTanggal terakhir kami menjalankan model ini pada soal dan kunci jawaban yang sama. |
|---|---|---|---|---|
| Gemini 3.5 FlashGoogle | 40/4393,0% | $0.003175$0.1270 | 3.418 msmedian | Keterangantanggal taksiran |
| GPT-5.6 LunaOpenAI | 35/4381,4% | $0.000113$0.0040 | 3.708 msmedian | Keterangantanggal taksiran |
| Gemma 4 31BGoogle | 26/4360,5% | $0.000019$0.0005 | 1.913 msmedian | |
| DeepSeek V4 Flash 0731DeepSeek | 22/4351,2% | $0.000114$0.0025 | 4.670 msmedian | Keterangantanggal taksiran |
| Gemma-SEA-LION v4.5 E2B-ITlokal | 9/4320,9% | - | 843 msmedian | |
| Llama3 8B CPT Sahabat-AI v1 Instructlokal | 4/439,3% | - | 567 msmedian | |
| Solar Pro 4Upstage | 4/439,3% | $0.000057$0.0002 | 6.807 msmedian | |
| Nemotron 3.5 LightningNVIDIA | 3/437,0% | $0.003700$0.0111 | 3.669 msmedian | |
| Llama 3.1 8B Instructlokal | 1/432,3% | - | 543 msmedian | |
| Mistral Small 3Mistral | 1/432,3% | $0.000475$0.0005 | 1.403 msmedian | Keterangantanggal taksiran |
Model bertanda lokal dijalankan di perangkat keras kami sendiri, jadi tidak ada tagihan untuk dicatat dan waktu tunggunya mengukur mesin kami, bukan layanan yang orang lain dapat beli. Skornya tetap sebanding: soal, kunci, dan suhunya sama persis dengan model lain di tabel ini.
Tiap angka di tabel ini dapat dihitung ulang dari data mentahnya. Buka datanya →
Biaya dan tokenTermurah untuk tiap jawaban benar: Gemma 4 31B ($0.000019). Termahal: Nemotron 3.5 Lightning ($0.003700).Lihat grafikSembunyikan
Seluruh angka biaya dalam dolar AS.
Biaya untuk tiap jawaban benar
Model dengan skor tertinggi belum tentu yang paling murah. Angka ini membagi biaya satu kali pengujian penuh dengan jumlah jawaban benarnya.
Biaya satu kali pengujian penuh
Angka mentahnya, sebelum dibagi jumlah jawaban benar. Tiap model menjawab soal yang sama persis, jadi angka ini langsung dapat dibandingkan: inilah yang kamu bayar untuk menjalankan benchmark ini sekali pada tiap model.
Token yang dipakai
Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya antar-model berasal. Model tanpa batang berarti tokennya tidak tercatat, bukan nol.
6 model tidak digambar di sini karena jumlah tokennya tidak tercatat saat pengujiannya dijalankan. Kami tidak menebak angkanya, dan menggambarnya sebagai nol akan terbaca seperti model yang tidak memakai token sama sekali.