Peringkat model

Model AI mana yang paling kuat di Slang?

Yang diukur di sini cuma satu hal: seberapa tepat sebuah model menjawab di kategori Slang, dinilai pembaca. Model yang ada di bawah di sini bisa saja justru yang lebih kuat untuk keperluan lain. Semua angkanya berasal dari arenanya sendiri, bukan dari uji terpisah.

Keberterimaan penutur

Klasemen langsung· belum peringkat final

8%
12/150 laga
#ModelMainM / K / SPoin
1Claude 4.6 Sonnet (OR)Anthropic11dari 777 pasangan6 / 1 / 422
2DeepSeek V4 FlashDeepSeek10dari 507 pasangan6 / 1 / 321
3DeepSeek V3.2DeepSeek12dari 777 pasangan6 / 5 / 119
4Llama 3.3 70BMeta9dari 777 pasangan4 / 4 / 113
5UI-TARS 7BLainnya8dari 782 pasangan2 / 4 / 28
6Gemma 4 31BGoogle5dari 777 pasangan1 / 0 / 47
7Voxtral Small 24B 2507Mistral7dari 782 pasangan2 / 4 / 17
8Gemini 3.5 Flash LiteGoogle4dari 777 pasangan1 / 1 / 25
9Mistral Small 3Mistral7dari 782 pasangan0 / 2 / 55
10Gemma 3 12BGoogle3dari 782 pasangan1 / 2 / 03
11Qwen3 30B InstructQwen7dari 782 pasangan0 / 4 / 33
12GPT OSS 20BOpenAI1dari 221 pasangan0 / 1 / 00
·Tencent: Hy3Lainnya0dari 65 pasangan0 / 0 / 00
·Xiaomi: MiMo-V2.5-ProLainnya0dari 782 pasangan0 / 0 / 00
Posisi klasemen
: Posisi menurut poin, persis seperti klasemen liga. Ia bergerak tiap ada vote masuk. Titik alih-alih angka berarti model itu ada di arena tapi belum pernah dinilai, jadi ia belum punya posisi.
Main
: Berapa kali model ini benar-benar dinilai, dari sekian pasangan yang memuatnya. Baca poin di sebelahnya bersama angka ini: tiga poin dari satu laga jauh lebih sedikit artinya daripada tiga poin dari tiga puluh.
Menang, kalah, seri
: Vote mentah yang dihitung. Pasangan kalibrasi, yang jawaban benarnya sudah kami ketahui, dikeluarkan karena votenya memang tidak pernah masuk peringkat.
Poin
: Tiga untuk menang, satu untuk seri, seperti klasemen liga. Poin sama dipecah oleh selisih menang dikurangi kalah, lalu jumlah laga; keduanya sudah terbaca di kolom M / K / S. Poin tidak memperhitungkan sekuat apa lawannya: rating final memperhitungkannya, dan ia menggantikan kolom ini setelah cukup banyak laga dimainkan.
Sisi kiri atau kanan ditentukan server dan diacak, jadi kebiasaan memilih satu sisi tidak pernah berubah jadi hasil.

Yang tidak dinyatakan halaman ini

Posisi di sini bukan vonis atas sebuah model. Ia satu pengukuran yang sempit: seberapa tepat model itu menjawab di kategori Slang, dinilai orang yang membaca dua jawaban tanpa label.

Model dibuat untuk hal yang berbeda-beda, dan porsi bahasa Indonesia dalam pelatihannya juga jauh berbeda. Model yang ada di bawah di sini bisa jadi pilihan yang jauh lebih kuat untuk bahasa Inggris, untuk kode, untuk penalaran, atau untuk pekerjaan panjang, dan tidak satu pun dari itu disentuh arena ini. Posisi rendah berarti ia kurang meyakinkan pada soal-soal ini, dalam ragam ini, bagi orang yang kebetulan memilih. Tidak lebih dari itu.

Angka ini datang dari mana

Setiap baris di atas dihasilkan orang yang membaca dua jawaban tanpa label lalu memilih satu. Tidak ada sumber lain.

vote terhitung
42
pemilih
4
model di arena
14
Ikut menilai