Seberapa banyak yang dijawab benar
Tiap batang mewakili satu benchmark, dan panjangnya menunjukkan berapa soal yang dijawab benar dari seluruh soal di benchmark itu. Soal dan kunci jawabannya kami susun sendiri, lalu diperiksa oleh dua penutur asli, dan tiap model menjawab soal yang sama persis.
Hasil dibanding biayanya
Kami urutkan dari yang paling murah untuk tiap jawaban benar. Kolom kiri menunjukkan berapa banyak yang dijawab benar. Baris teratas yang kolom kirinya juga panjang berarti murah sekaligus tepat.
Token yang dipakai
Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya berasal.
Waktu tunggu tiap panggilan
Median waktu tunggu satu panggilan pada tiap benchmark. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya.
Cakupan pengujian
Model ini diuji pada 4 dari 6 benchmark yang kami terbitkan. Sisanya belum dijalankan, jadi kami belum tahu kemampuannya di sana.
Versi soal sebelumnya
Kami mengubah soal atau kunci jawabannya setelah angka ini diukur. Kami menyimpannya sebagai riwayat, bukan sebagai hasil sekarang.lihat 2 baristutup
Log6 kali model ini dipanggil, tersebar di 3 hari.BukaTutup
Model ini dipanggil lewat id penyedia yang belum tentu mengunci versi, jadi tanggal di bawah menyatakan bobot mana yang benar-benar diuji. Tanggal pada baris bertanda tanda hubung tidak dicatat saat model dipanggil, melainkan kami perkirakan belakangan, jadi tanggalnya bisa meleset sehari dan jamnya tidak kami tampilkan.
- 23:08Pemahaman slang Indonesiapilihan ganda38/42
- 21:18Arti kata Jawa sehari-hariarti kata86/135
- -Keterangantanggal taksiranArti kata Jawa sehari-hariarti kata82/135
- 06:42Koreksi ejaan Indonesiajawaban isian20/38
- 06:37Pemahaman slang Indonesiapilihan ganda26/27
- 03:59Tingkat tutur bahasa Jawapilihan ganda20/27