MistralModel AI

Mistral Small 3

Hasil Mistral Small 3 pada seluruh benchmark bahasa Indonesia dan bahasa daerah yang kami terbitkan.Baca selengkapnya
Terakhir dijalankanpada Pemahaman slang Indonesia

Benchmark diuji

6

dari 6 benchmark yang kami terbitkan

Model ini sudah dijalankan pada seluruh benchmark yang kami terbitkan.

Pengujian dijalankan

11

pengujian penuh tercatat

Satu pengujian berarti model menjawab seluruh soal satu set sekali habis. Set yang dijalankan berulang menyumbang lebih dari satu.

Biaya seluruhnya

$0.0077

untuk seluruh pengujian di atas

Angka tagihan sungguhan dari penyedia, dijumlahkan, bukan taksiran dari harga per token. Belum dibagi jumlah jawaban benar.

Token seluruhnya

104.256

input dan output dijumlahkan

Dihitung hanya dari pengujian yang mencatat pemakaian tokennya. Sebagian pengujian lama tidak mencatatnya, dan angkanya tidak kami tebak.

Seberapa banyak yang dijawab benar

Tiap batang mewakili satu benchmark, dan panjangnya menunjukkan berapa soal yang dijawab benar dari seluruh soal di benchmark itu. Soal dan kunci jawabannya kami susun sendiri, lalu diperiksa oleh dua penutur asli, dan tiap model menjawab soal yang sama persis.

9 benchmark
Normalisasi teks Indonesiaversi soal 2Keterangan27/49 55,1%
Normalisasi teks Indonesiaversi soal 1Keterangan26/49 53,1%
Normalisasi teks Indonesiaversi soal 3Keterangan23/49 46,9%
Tingkat tutur bahasa Jawapilihan ganda11/27 40,7%
Tingkat tutur bahasa Jawajawaban isian0/6 0,0%
Persentase jawaban benar di 9 benchmark

Hasil dibanding biayanya

Kami urutkan dari yang paling murah untuk tiap jawaban benar. Kolom kiri menunjukkan berapa banyak yang dijawab benar. Baris teratas yang kolom kirinya juga panjang berarti murah sekaligus tepat.

8 punya catatan biaya
Jawaban benarBiaya tiap jawaban benar
Normalisasi teks Indonesiaversi soal 1Keterangan53,1%$0.000014
Tingkat tutur bahasa Jawapilihan ganda40,7%$0.000014
Normalisasi teks Indonesiaversi soal 3Keterangan46,9%$0.000016
Normalisasi teks Indonesiaversi soal 2Keterangan55,1%$0.000017
Berapa jawaban benar, dibanding berapa ongkosnya untuk tiap jawaban benar

Token yang dipakai

Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya berasal.

97.593 masuk, 6.663 keluar
InputOutput
Pemahaman slang Indonesia11.084 · 120
Koreksi ejaan Indonesia11.546 · 221
Normalisasi teks Indonesiaversi soal 2Keterangan11.349 · 875
Normalisasi teks Indonesiaversi soal 1Keterangan9.348 · 873
Normalisasi teks Indonesiaversi soal 3Keterangan10.521 · 879
Tingkat tutur bahasa Jawapilihan ganda5.016 · 78
Arti kata Jawa sehari-hari37.698 · 3.509
Tingkat tutur bahasa Jawajawaban isian1.031 · 108
Token satu kali pengujian penuh, tiap benchmark

1 benchmark tidak digambar di sini karena pengujiannya tidak mencatat jumlah token. Tidak tercatat, bukan nol.

Waktu tunggu tiap panggilan

Median waktu tunggu satu panggilan pada tiap benchmark. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya.

9 punya catatan waktu tunggu
Tingkat tutur bahasa Jawapilihan ganda0.55 s
Normalisasi teks Indonesiaversi soal 2Keterangan0.65 s
Normalisasi teks Indonesiaversi soal 3Keterangan0.67 s
Normalisasi teks Indonesiaversi soal 1Keterangan0.96 s
Tingkat tutur bahasa Jawajawaban isian1.10 s
Median waktu tunggu satu panggilan, tiap benchmark

Cakupan pengujian

Model ini sudah diuji pada seluruh 6 benchmark yang kami terbitkan.

6 dari 6 benchmark yang kami terbitkan

Versi soal sebelumnya

Kami mengubah soal atau kunci jawabannya setelah angka ini diukur. Kami menyimpannya sebagai riwayat, bukan sebagai hasil sekarang.
Pemahaman slang Indonesia22/27 81,5%
Arti kata Jawa sehari-hari21/135 15,6%
Hasil pada soal atau kunci jawaban versi sebelumnya
Log11 kali model ini dipanggil, tersebar di 4 hari.

Model ini dipanggil lewat id penyedia yang belum tentu mengunci versi, jadi tanggal di bawah menyatakan bobot mana yang benar-benar diuji. Tanggal pada baris bertanda tanda hubung tidak dicatat saat model dipanggil, melainkan kami perkirakan belakangan, jadi tanggalnya bisa meleset sehari dan jamnya tidak kami tampilkan.

1 pengujian
  1. 22:26Pemahaman slang Indonesiapilihan ganda32/42
1 pengujian
  1. 20:12Arti kata Jawa sehari-hariarti kata25/135
3 pengujian
  1. -KeteranganArti kata Jawa langkaarti kata1/43
  2. -KeteranganArti kata Jawa sehari-hariarti kata21/135
  3. 06:03Tingkat tutur bahasa Jawajawaban isian0/6
6 pengujian
  1. 22:41Tingkat tutur bahasa Jawapilihan ganda11/27
  2. 18:04Normalisasi teks Indonesiajawaban isianPrompt yang menyatakan aturan kunci23/49
  3. 15:58Normalisasi teks Indonesiajawaban isianPrompt rinci yang melarang ganti kata27/49
  4. 15:02Normalisasi teks Indonesiajawaban isianPrompt bawaan26/49
  5. 14:55Koreksi ejaan Indonesiajawaban isian22/38
  6. 14:46Pemahaman slang Indonesiapilihan ganda22/27

Lihat semua model