Seberapa banyak yang dijawab benar
Tiap batang mewakili satu benchmark, dan panjangnya menunjukkan berapa soal yang dijawab benar dari seluruh soal di benchmark itu. Soal dan kunci jawabannya kami susun sendiri, lalu diperiksa oleh dua penutur asli, dan tiap model menjawab soal yang sama persis.
Hasil dibanding biayanya
Kami urutkan dari yang paling murah untuk tiap jawaban benar. Kolom kiri menunjukkan berapa banyak yang dijawab benar. Baris teratas yang kolom kirinya juga panjang berarti murah sekaligus tepat.
Token yang dipakai
Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya berasal.
Waktu tunggu tiap panggilan
Median waktu tunggu satu panggilan pada tiap benchmark. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya.
Cakupan pengujian
Model ini sudah diuji pada seluruh 6 benchmark yang kami terbitkan.
Log9 kali model ini dipanggil, tersebar di 2 hari.BukaTutup
Model ini dipanggil lewat id penyedia yang belum tentu mengunci versi, jadi tanggal di bawah menyatakan bobot mana yang benar-benar diuji. Tanggal pada baris bertanda tanda hubung tidak dicatat saat model dipanggil, melainkan kami perkirakan belakangan, jadi tanggalnya bisa meleset sehari dan jamnya tidak kami tampilkan.
- 23:30Arti kata Jawa langkaarti kata11/43
- 22:44Arti kata Jawa sehari-hariarti kata97/135
- 20:48Normalisasi teks Indonesiajawaban isianPrompt rinci yang melarang ganti kata30/49
- 20:29Normalisasi teks Indonesiajawaban isianPrompt bawaan25/49
- 18:50Normalisasi teks Indonesiajawaban isianPrompt yang menyatakan aturan kunci34/49
- 17:48Koreksi ejaan Indonesiajawaban isian25/38
- 00:48Tingkat tutur bahasa Jawajawaban isian5/6
- 23:56Tingkat tutur bahasa Jawapilihan ganda22/27
- 23:32Pemahaman slang Indonesiapilihan ganda38/42