AlibabaModel AI

Qwen3 30B A3B Instruct 2507

Hasil Qwen3 30B A3B Instruct 2507 pada seluruh benchmark bahasa Indonesia dan bahasa daerah yang kami terbitkan.Baca selengkapnya
Terakhir dijalankanpada Pemahaman slang Indonesia

Benchmark diuji

5

dari 6 benchmark yang kami terbitkan

Sisanya belum dijalankan, jadi kami belum tahu kemampuannya di 1 benchmark lain.

Pengujian dijalankan

10

pengujian penuh tercatat

Satu pengujian berarti model menjawab seluruh soal satu set sekali habis. Set yang dijalankan berulang menyumbang lebih dari satu.

Biaya seluruhnya

$0.0092

untuk seluruh pengujian di atas

Angka tagihan sungguhan dari penyedia, dijumlahkan, bukan taksiran dari harga per token. Belum dibagi jumlah jawaban benar.

Token seluruhnya

82.297

input dan output dijumlahkan

Dihitung hanya dari pengujian yang mencatat pemakaian tokennya. Sebagian pengujian lama tidak mencatatnya, dan angkanya tidak kami tebak.

Seberapa banyak yang dijawab benar

Tiap batang mewakili satu benchmark, dan panjangnya menunjukkan berapa soal yang dijawab benar dari seluruh soal di benchmark itu. Soal dan kunci jawabannya kami susun sendiri, lalu diperiksa oleh dua penutur asli, dan tiap model menjawab soal yang sama persis.

8 benchmark
Normalisasi teks Indonesiaversi soal 3Keterangan31/49 63,3%
Normalisasi teks Indonesiaversi soal 2Keterangan30/49 61,2%
Normalisasi teks Indonesiaversi soal 1Keterangan29/49 59,2%
Tingkat tutur bahasa Jawapilihan ganda14/27 51,9%
Tingkat tutur bahasa Jawajawaban isian2/6 33,3%
Persentase jawaban benar di 8 benchmark

Hasil dibanding biayanya

Kami urutkan dari yang paling murah untuk tiap jawaban benar. Kolom kiri menunjukkan berapa banyak yang dijawab benar. Baris teratas yang kolom kirinya juga panjang berarti murah sekaligus tepat.

8 punya catatan biaya
Jawaban benarBiaya tiap jawaban benar
Tingkat tutur bahasa Jawapilihan ganda51,9%$0.000023
Normalisasi teks Indonesiaversi soal 1Keterangan59,2%$0.000024
Normalisasi teks Indonesiaversi soal 2Keterangan61,2%$0.000027
Normalisasi teks Indonesiaversi soal 3Keterangan63,3%$0.000028
Tingkat tutur bahasa Jawajawaban isian33,3%$0.000050
Berapa jawaban benar, dibanding berapa ongkosnya untuk tiap jawaban benar

Token yang dipakai

Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya berasal.

75.945 masuk, 6.352 keluar
InputOutput
Pemahaman slang Indonesia12.684 · 103
Normalisasi teks Indonesiaversi soal 3Keterangan12.342 · 916
Normalisasi teks Indonesiaversi soal 2Keterangan12.963 · 930
Normalisasi teks Indonesiaversi soal 1Keterangan10.617 · 928
Koreksi ejaan Indonesia12.782 · 186
Tingkat tutur bahasa Jawapilihan ganda5.669 · 67
Arti kata Jawa sehari-hari7.669 · 3.100
Tingkat tutur bahasa Jawajawaban isian1.219 · 122
Token satu kali pengujian penuh, tiap benchmark

Waktu tunggu tiap panggilan

Median waktu tunggu satu panggilan pada tiap benchmark. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya.

8 punya catatan waktu tunggu
Tingkat tutur bahasa Jawajawaban isian0.48 s
Tingkat tutur bahasa Jawapilihan ganda0.61 s
Normalisasi teks Indonesiaversi soal 3Keterangan1.64 s
Normalisasi teks Indonesiaversi soal 2Keterangan1.66 s
Normalisasi teks Indonesiaversi soal 1Keterangan2.04 s
Median waktu tunggu satu panggilan, tiap benchmark

Cakupan pengujian

Model ini diuji pada 5 dari 6 benchmark yang kami terbitkan. Sisanya belum dijalankan, jadi kami belum tahu kemampuannya di sana.

5 dari 6 benchmark yang kami terbitkan

Versi soal sebelumnya

Kami mengubah soal atau kunci jawabannya setelah angka ini diukur. Kami menyimpannya sebagai riwayat, bukan sebagai hasil sekarang.
Pemahaman slang Indonesia23/27 85,2%
Arti kata Jawa sehari-hari50/135 37,0%
Hasil pada soal atau kunci jawaban versi sebelumnya
Log10 kali model ini dipanggil, tersebar di 5 hari.

Model ini dipanggil lewat id penyedia yang belum tentu mengunci versi, jadi tanggal di bawah menyatakan bobot mana yang benar-benar diuji. Tanggal pada baris bertanda tanda hubung tidak dicatat saat model dipanggil, melainkan kami perkirakan belakangan, jadi tanggalnya bisa meleset sehari dan jamnya tidak kami tampilkan.

1 pengujian
  1. 22:32Pemahaman slang Indonesiapilihan ganda37/42
1 pengujian
  1. 19:57Arti kata Jawa sehari-hariarti kata51/135
3 pengujian
  1. 06:02Tingkat tutur bahasa Jawajawaban isian2/6
  2. 03:02Pemahaman slang Indonesiapilihan ganda23/27
  3. 02:56Koreksi ejaan Indonesiajawaban isian21/38
4 pengujian
  1. 22:44Tingkat tutur bahasa Jawapilihan ganda14/27
  2. 18:15Normalisasi teks Indonesiajawaban isianPrompt yang menyatakan aturan kunci31/49
  3. 16:09Normalisasi teks Indonesiajawaban isianPrompt rinci yang melarang ganti kata30/49
  4. 15:31Normalisasi teks Indonesiajawaban isianPrompt bawaan29/49
1 pengujian
  1. 22:15Arti kata Jawa sehari-hariarti kata50/135

Lihat semua model