Peringkat model

Model AI mana yang paling kuat di Ragam Formal?

Yang diukur di sini cuma satu hal: seberapa tepat sebuah model menjawab di kategori Ragam Formal, dinilai pembaca. Model yang ada di bawah di sini bisa saja justru yang lebih kuat untuk keperluan lain. Semua angkanya berasal dari arenanya sendiri, bukan dari uji terpisah.

Aturan preskriptif

Klasemen langsung· belum peringkat final

10%
15/150 laga
#ModelMainM / K / SPoin
1DeepSeek V3.2DeepSeek12dari 603 pasangan6 / 4 / 220
2Gemma 4 31BGoogle13dari 603 pasangan6 / 5 / 220
3GPT-4o Mini (Legacy)OpenAI12dari 571 pasangan4 / 3 / 517
4MiniMax M2.5MiniMax7dari 247 pasangan5 / 1 / 116
5Llama 3.3 70BMeta9dari 603 pasangan5 / 3 / 116
6Mistral Small 3.2 24BMistral11dari 603 pasangan4 / 3 / 416
7Gemini 3.5 Flash LiteGoogle15dari 603 pasangan4 / 7 / 416
8GPT-5.6 LunaOpenAI5dari 217 pasangan0 / 4 / 11
9Reka Flash 3Lainnya1dari 13 pasangan0 / 1 / 00
10IBM: Granite 4.1 8BLainnya3dari 603 pasangan0 / 3 / 00
·Claude 4.6 SonnetAnthropic0dari 603 pasangan0 / 0 / 00
·MiMo-V2.5Lainnya0dari 85 pasangan0 / 0 / 00
·Mistral Small 3Mistral0dari 603 pasangan0 / 0 / 00
·UI-TARS 7BLainnya0dari 603 pasangan0 / 0 / 00
Posisi klasemen
: Posisi menurut poin, persis seperti klasemen liga. Ia bergerak tiap ada vote masuk. Titik alih-alih angka berarti model itu ada di arena tapi belum pernah dinilai, jadi ia belum punya posisi.
Main
: Berapa kali model ini benar-benar dinilai, dari sekian pasangan yang memuatnya. Baca poin di sebelahnya bersama angka ini: tiga poin dari satu laga jauh lebih sedikit artinya daripada tiga poin dari tiga puluh.
Menang, kalah, seri
: Vote mentah yang dihitung. Pasangan kalibrasi, yang jawaban benarnya sudah kami ketahui, dikeluarkan karena votenya memang tidak pernah masuk peringkat.
Poin
: Tiga untuk menang, satu untuk seri, seperti klasemen liga. Poin sama dipecah oleh selisih menang dikurangi kalah, lalu jumlah laga; keduanya sudah terbaca di kolom M / K / S. Poin tidak memperhitungkan sekuat apa lawannya: rating final memperhitungkannya, dan ia menggantikan kolom ini setelah cukup banyak laga dimainkan.
Sisi kiri atau kanan ditentukan server dan diacak, jadi kebiasaan memilih satu sisi tidak pernah berubah jadi hasil.

Yang tidak dinyatakan halaman ini

Posisi di sini bukan vonis atas sebuah model. Ia satu pengukuran yang sempit: seberapa tepat model itu menjawab di kategori Ragam Formal, dinilai orang yang membaca dua jawaban tanpa label.

Model dibuat untuk hal yang berbeda-beda, dan porsi bahasa Indonesia dalam pelatihannya juga jauh berbeda. Model yang ada di bawah di sini bisa jadi pilihan yang jauh lebih kuat untuk bahasa Inggris, untuk kode, untuk penalaran, atau untuk pekerjaan panjang, dan tidak satu pun dari itu disentuh arena ini. Posisi rendah berarti ia kurang meyakinkan pada soal-soal ini, dalam ragam ini, bagi orang yang kebetulan memilih. Tidak lebih dari itu.

Angka ini datang dari mana

Setiap baris di atas dihasilkan orang yang membaca dua jawaban tanpa label lalu memilih satu. Tidak ada sumber lain.

vote terhitung
44
pemilih
3
model di arena
14
Ikut menilai
Peringkat model AI untuk Ragam Formal | ibahasa