Peringkat model

Model AI mana yang paling kuat di Bahasa Jawa?

Yang diukur di sini cuma satu hal: seberapa tepat sebuah model menjawab di kategori Bahasa Jawa, dinilai pembaca. Model yang ada di bawah di sini bisa saja justru yang lebih kuat untuk keperluan lain. Semua angkanya berasal dari arenanya sendiri, bukan dari uji terpisah.

Keberterimaan penutur

Klasemen langsung· belum peringkat final

7%
10/150 laga
#ModelMainM / K / SPoin
1Gemini 3.5 Flash LiteGoogle5dari 508 pasangan5 / 0 / 015
2GPT-5.6 LunaOpenAI8dari 508 pasangan5 / 3 / 015
3Claude 4.5 SonnetAnthropic5dari 508 pasangan3 / 1 / 110
4Gemma 3 12BGoogle6dari 508 pasangan3 / 3 / 09
5Llama 3.3 70BMeta10dari 508 pasangan3 / 7 / 09
6GPT OSS 120BOpenAI2dari 285 pasangan2 / 0 / 06
7Gemma 4 31BGoogle4dari 508 pasangan2 / 2 / 06
8DeepSeek V4 ProDeepSeek1dari 104 pasangan1 / 0 / 03
9Claude 4.5 HaikuAnthropic4dari 508 pasangan0 / 3 / 11
10Nemotron 3 UltraLainnya1dari 44 pasangan0 / 1 / 00
11Mistral Small 3.2 24BMistral4dari 508 pasangan0 / 4 / 00
·MiMo-V2.5Lainnya0dari 12 pasangan0 / 0 / 00
·Mistral Small 3Mistral0dari 501 pasangan0 / 0 / 00
Posisi klasemen
: Posisi menurut poin, persis seperti klasemen liga. Ia bergerak tiap ada vote masuk. Titik alih-alih angka berarti model itu ada di arena tapi belum pernah dinilai, jadi ia belum punya posisi.
Main
: Berapa kali model ini benar-benar dinilai, dari sekian pasangan yang memuatnya. Baca poin di sebelahnya bersama angka ini: tiga poin dari satu laga jauh lebih sedikit artinya daripada tiga poin dari tiga puluh.
Menang, kalah, seri
: Vote mentah yang dihitung. Pasangan kalibrasi, yang jawaban benarnya sudah kami ketahui, dikeluarkan karena votenya memang tidak pernah masuk peringkat.
Poin
: Tiga untuk menang, satu untuk seri, seperti klasemen liga. Poin sama dipecah oleh selisih menang dikurangi kalah, lalu jumlah laga; keduanya sudah terbaca di kolom M / K / S. Poin tidak memperhitungkan sekuat apa lawannya: rating final memperhitungkannya, dan ia menggantikan kolom ini setelah cukup banyak laga dimainkan.
Sisi kiri atau kanan ditentukan server dan diacak, jadi kebiasaan memilih satu sisi tidak pernah berubah jadi hasil.

Yang tidak dinyatakan halaman ini

Posisi di sini bukan vonis atas sebuah model. Ia satu pengukuran yang sempit: seberapa tepat model itu menjawab di kategori Bahasa Jawa, dinilai orang yang membaca dua jawaban tanpa label.

Model dibuat untuk hal yang berbeda-beda, dan porsi bahasa Indonesia dalam pelatihannya juga jauh berbeda. Model yang ada di bawah di sini bisa jadi pilihan yang jauh lebih kuat untuk bahasa Inggris, untuk kode, untuk penalaran, atau untuk pekerjaan panjang, dan tidak satu pun dari itu disentuh arena ini. Posisi rendah berarti ia kurang meyakinkan pada soal-soal ini, dalam ragam ini, bagi orang yang kebetulan memilih. Tidak lebih dari itu.

Angka ini datang dari mana

Setiap baris di atas dihasilkan orang yang membaca dua jawaban tanpa label lalu memilih satu. Tidak ada sumber lain.

vote terhitung
25
pemilih
3
model di arena
13
Ikut menilai