Transparansi

Log pengujian benchmark

Setiap kali kami menjalankan model AI terhadap satu set benchmark, barisnya tercatat di sini apa adanya. Bukan ringkasan seperti papan peringkat /benchmark, melainkan satu baris per panggilan, supaya tiap angka ringkasan di situs ini bisa ditelusuri balik ke pengujian yang menghasilkannya.Baca selengkapnya
134 kali pengujian14 model diuji6 set benchmarkPengujian terbaru
GitHub

1 run
  1. 03:19Ling-3.0-flashNormalisasi teks Indonesiajawaban isianPrompt rinci yang melarang ganti kata32/49

1 run
  1. 19:42Ling-3.0-flashTingkat tutur bahasa Jawapilihan ganda18/27

1 run
  1. 16:57Gemma-SEA-LION v4.5 E2B-ITTingkat tutur bahasa Jawajawaban isian5/6

Angka di ujung kanan tiap baris adalah skor: jawaban benar dari jumlah soal yang dinilai. Bisa lebih kecil dari total soal set kalau sebagian ditahan atau masih menunggu penilaian penutur.

Halaman ini daftar mentah, bukan analisis. Untuk hasil per set beserta batasnya, lihat papan benchmark. Untuk aturan penilaiannya, lihat metodologi kami.