Seberapa banyak yang dijawab benar
Tiap batang mewakili satu benchmark, dan panjangnya menunjukkan berapa soal yang dijawab benar dari seluruh soal di benchmark itu. Soal dan kunci jawabannya kami susun sendiri, lalu diperiksa oleh dua penutur asli, dan tiap model menjawab soal yang sama persis.
Hasil dibanding biayanya
Kami urutkan dari yang paling murah untuk tiap jawaban benar. Kolom kiri menunjukkan berapa banyak yang dijawab benar. Baris teratas yang kolom kirinya juga panjang berarti murah sekaligus tepat.
Token yang dipakai
Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya berasal.
Waktu tunggu tiap panggilan
Median waktu tunggu satu panggilan pada tiap benchmark. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya.
Cakupan pengujian
Model ini sudah diuji pada seluruh 6 benchmark yang kami terbitkan.
Log7 kali model ini dipanggil, tersebar di 1 hari.BukaTutup
Model ini dipanggil lewat id penyedia yang belum tentu mengunci versi, jadi tanggal di bawah menyatakan bobot mana yang benar-benar diuji. Tanggal pada baris bertanda tanda hubung tidak dicatat saat model dipanggil, melainkan kami perkirakan belakangan, jadi tanggalnya bisa meleset sehari dan jamnya tidak kami tampilkan.
- 21:00Arti kata Jawa sehari-hariarti kata100/135
- 20:36Normalisasi teks Indonesiajawaban isian37/49
- 20:26Koreksi ejaan Indonesiajawaban isian26/38
- 20:15Tingkat tutur bahasa Jawajawaban isian5/6
- 20:14Tingkat tutur bahasa Jawapilihan ganda22/27
- 19:29Arti kata Jawa langkaarti kata15/43
- 19:27Pemahaman slang Indonesiapilihan ganda40/42