Z-aiModel AI

GLM 5.3

Hasil GLM 5.3 pada seluruh benchmark bahasa Indonesia dan bahasa daerah yang kami terbitkan.Baca selengkapnya
Terakhir dijalankanpada Arti kata Jawa langkaversi tidak terkunciKeterangan

Benchmark diuji

6

dari 6 benchmark yang kami terbitkan

Model ini sudah dijalankan pada seluruh benchmark yang kami terbitkan.

Pengujian dijalankan

9

pengujian penuh tercatat

Satu pengujian berarti model menjawab seluruh soal satu set sekali habis. Set yang dijalankan berulang menyumbang lebih dari satu.

Biaya seluruhnya

$0.1783

untuk seluruh pengujian di atas

Angka tagihan sungguhan dari penyedia, dijumlahkan, bukan taksiran dari harga per token. Belum dibagi jumlah jawaban benar.

Token seluruhnya

102.561

input dan output dijumlahkan

Dihitung hanya dari pengujian yang mencatat pemakaian tokennya. Sebagian pengujian lama tidak mencatatnya, dan angkanya tidak kami tebak.

Seberapa banyak yang dijawab benar

Tiap batang mewakili satu benchmark, dan panjangnya menunjukkan berapa soal yang dijawab benar dari seluruh soal di benchmark itu. Soal dan kunci jawabannya kami susun sendiri, lalu diperiksa oleh dua penutur asli, dan tiap model menjawab soal yang sama persis.

9 benchmark
Pemahaman slang Indonesia40/42 95,2%
Tingkat tutur bahasa Jawapilihan ganda21/27 77,8%
Normalisasi teks Indonesiaversi soal 3Keterangan37/49 75,5%
Normalisasi teks Indonesiaversi soal 2Keterangan37/49 75,5%
Arti kata Jawa sehari-hari98/135 72,6%
Koreksi ejaan Indonesia26/38 68,4%
Normalisasi teks Indonesiaversi soal 1Keterangan30/49 61,2%
Tingkat tutur bahasa Jawajawaban isian3/6 50,0%
Arti kata Jawa langka14/43 32,6%
Persentase jawaban benar di 9 benchmark

Hasil dibanding biayanya

Kami urutkan dari yang paling murah untuk tiap jawaban benar. Kolom kiri menunjukkan berapa banyak yang dijawab benar. Baris teratas yang kolom kirinya juga panjang berarti murah sekaligus tepat.

9 punya catatan biaya
Jawaban benarBiaya tiap jawaban benar
Tingkat tutur bahasa Jawapilihan ganda77,8%$0.000283
Pemahaman slang Indonesia95,2%$0.000311
Normalisasi teks Indonesiaversi soal 2Keterangan75,5%$0.000345
Normalisasi teks Indonesiaversi soal 1Keterangan61,2%$0.000371
Arti kata Jawa sehari-hari72,6%$0.000391
Koreksi ejaan Indonesia68,4%$0.000499
Normalisasi teks Indonesiaversi soal 3Keterangan75,5%$0.000527
Tingkat tutur bahasa Jawajawaban isian50,0%$0.000740
Arti kata Jawa langka32,6%$0.001075
Berapa jawaban benar, dibanding berapa ongkosnya untuk tiap jawaban benar

Token yang dipakai

Input dan output dipisah karena harganya bisa berbeda sampai sepuluh kali lipat. Batang output yang panjang berarti model menghasilkan banyak token, sering karena bernalar panjang sebelum menjawab, dan di situlah hampir seluruh selisih biaya berasal.

78.830 masuk, 23.731 keluar
InputOutput
Pemahaman slang Indonesia12.683 · 759
Tingkat tutur bahasa Jawapilihan ganda5.692 · 464
Normalisasi teks Indonesiaversi soal 3Keterangan12.387 · 4.352
Normalisasi teks Indonesiaversi soal 2Keterangan13.002 · 1.558
Arti kata Jawa sehari-hari8.589 · 10.336
Koreksi ejaan Indonesia12.754 · 1.175
Normalisasi teks Indonesiaversi soal 1Keterangan10.640 · 1.485
Tingkat tutur bahasa Jawajawaban isian1.219 · 581
Arti kata Jawa langka1.864 · 3.021
Token satu kali pengujian penuh, tiap benchmark

Waktu tunggu tiap panggilan

Median waktu tunggu satu panggilan pada tiap benchmark. Median, bukan rata-rata, supaya satu panggilan yang tersendat tidak menggeser angkanya.

9 punya catatan waktu tunggu
Tingkat tutur bahasa Jawapilihan ganda1.02 s
Koreksi ejaan Indonesia1.10 s
Normalisasi teks Indonesiaversi soal 1Keterangan1.16 s
Normalisasi teks Indonesiaversi soal 2Keterangan1.19 s
Pemahaman slang Indonesia1.21 s
Normalisasi teks Indonesiaversi soal 3Keterangan1.39 s
Tingkat tutur bahasa Jawajawaban isian1.47 s
Arti kata Jawa langka1.66 s
Arti kata Jawa sehari-hari1.77 s
Median waktu tunggu satu panggilan, tiap benchmark

Cakupan pengujian

Model ini sudah diuji pada seluruh 6 benchmark yang kami terbitkan.

6 dari 6 benchmark yang kami terbitkan
Log9 kali model ini dipanggil, tersebar di 1 hari.

Model ini dipanggil lewat id penyedia yang belum tentu mengunci versi, jadi tanggal di bawah menyatakan bobot mana yang benar-benar diuji. Tanggal pada baris bertanda tanda hubung tidak dicatat saat model dipanggil, melainkan kami perkirakan belakangan, jadi tanggalnya bisa meleset sehari dan jamnya tidak kami tampilkan.

9 pengujian
  1. 22:35Arti kata Jawa langkaarti kata14/43
  2. 22:15Arti kata Jawa sehari-hariarti kata98/135
  3. 21:45Normalisasi teks Indonesiajawaban isianPrompt yang menyatakan aturan kunci37/49
  4. 21:38Normalisasi teks Indonesiajawaban isianPrompt rinci yang melarang ganti kata37/49
  5. 21:31Normalisasi teks Indonesiajawaban isianPrompt bawaan30/49
  6. 18:44Koreksi ejaan Indonesiajawaban isian26/38
  7. 08:30Tingkat tutur bahasa Jawajawaban isian3/6
  8. 08:14Tingkat tutur bahasa Jawapilihan ganda21/27
  9. 08:00Pemahaman slang Indonesiapilihan ganda40/42

← Lihat semua model