Arena vote buta

AI mana yang benar-benar tepat berbahasa Indonesia?

Dua model AI menjawab pertanyaan bahasa Indonesia yang sama, entah dalam bahasa gaul, dialek daerah, atau ragam baku, dan kamu memilih jawaban yang lebih tepat. Nama modelnya disembunyikan sampai kamu memilih, jadi yang kamu nilai tulisannya, bukan mereknya. Semua jawaban sudah ditulis dan tersimpan lebih dulu, itu sebabnya arenanya tampil seketika.

kategori
3
model di arena
27
pasangan bisa dinilai
10470

Bagaimana peringkat lahir

  1. 1

    Kamu memilih

    Dua jawaban untuk soal yang sama, nama modelnya disembunyikan dan sisinya diacak server, supaya yang kamu nilai tulisannya, bukan mereknya, dan kebiasaan memilih kotak kiri tidak diam-diam jadi hasil.

  2. 2

    Hasilnya ditimbang

    Model Bradley-Terry mengubah hasil adu satu lawan satu jadi taksiran kekuatan, sehingga mengalahkan lawan yang kuat bernilai lebih besar daripada mengalahkan yang lemah.

  3. 3

    Gerbangnya menahan

    Rating tiap model dihitung ulang secara berkala begitu vote masuk, tapi angkanya belum ditampilkan sebagai peringkat final sampai sebuah model dinilai cukup sering sehingga hasilnya berarti.

    Lihat peringkatnya

Semua yang ada di halaman peringkat lahir dari rantai ini, tidak dari yang lain. Kami tidak mencampurkan skor dari uji terpisah: uji itu mengukur apakah model tahu jawaban benar pada soal tertutup, dan itu pertanyaan yang berbeda dari jawaban bebas mana yang diterima penutur.

Pertanyaan yang sering muncul

Bagaimana cara kerja Battle AI?

Dua model AI menjawab soal bahasa Indonesia yang sama, entah bahasa gaul, dialek daerah, atau ragam baku. Kamu membaca kedua jawaban tanpa tahu modelnya, lalu memilih yang paling tepat. Identitas model baru dibuka setelah kamu memilih, sekalian dengan catatan masing-masing model di arena sejauh ini.

Kenapa nama modelnya disembunyikan sampai selesai vote?

Karena nama yang terlihat mengubah apa yang dinilai. Diperlihatkan mereknya lebih dulu, orang menilai merek; diperlihatkan tulisannya saja, orang menilai tulisan. Perbandingan buta adalah satu-satunya bentuk yang benar-benar mengukur mutu bahasa, bukan reputasi. Sisi kiri atau kanan pun ditentukan dan diacak server, jadi kebiasaan memilih kotak kiri tidak diam-diam berubah jadi hasil.

Apakah jawabannya dibuat saat halaman dibuka?

Tidak. Semua jawaban ditulis lebih dulu dan disimpan, baru disajikan sebagai pasangan. Itu pilihan yang disengaja: arenanya jadi tampil seketika, satu jawaban bisa diadu dengan beberapa lawan tanpa ditulis ulang, dan yang kamu nilai adalah teks yang tetap, bukan lemparan dadu yang baru tiap kali.

Bagaimana peringkatnya dihitung?

Seluruhnya dari vote yang masuk di sini. Model Bradley-Terry mengubah hasil adu satu lawan satu jadi taksiran kekuatan tiap model, dan itu tidak sama dengan menghitung kemenangan: mengalahkan lawan yang jarang kalah menggeser taksirannya jauh lebih besar daripada mengalahkan yang sering kalah, sehingga tidak ada model yang diuntungkan hanya karena kebetulan bertemu lawan ringan. Peringkat baru diterbitkan setelah sebuah model dinilai cukup sering sehingga selangnya bermakna; di bawah itu, urutan apa pun cuma derau yang berpakaian hasil.

Kenapa peringkatnya ditulis sebagai rentang, bukan satu angka?

Karena dengan jumlah vote yang terbatas, beberapa model tidak bisa dibedakan. Tiap taksiran membawa selangnya sendiri, dan ketika dua selang saling tumpang tindih tidak ada bukti bahwa satu model berada di atas yang lain. Menuliskan satu posisi untuk keduanya adalah klaim yang tidak ditopang votenya. Model yang selangnya belum bermakna diberi rentang penuh, dan itu jawaban yang benar untuk "peringkat berapa" ketika jawabannya memang belum diketahui.

Kenapa ada pilihan “sama saja”?

Karena memaksa memilih di antara dua jawaban yang sama-sama bisa diterima justru menyuntikkan derau ke peringkat. Pada kategori yang dinilai dari keberterimaan penutur, bukan dari aturan preskriptif, dua jawaban berbeda yang sama-sama benar adalah situasi yang lazim, bukan kasus tepi.

Kenapa ada pasangan yang votenya tidak dihitung?

Sebagian pasangan adalah item kalibrasi yang jawaban benarnya sudah kami ketahui. Gunanya menakar seberapa tepercaya penilaian secara keseluruhan, jadi ia sengaja dikeluarkan dari peringkat. Vote dalam mode lihat-lihat, dan vote yang masuk terlalu cepat untuk bisa disebut hasil membaca, juga tetap dicatat tapi tidak masuk peringkat.

Apakah jawaban yang lebih panjang otomatis menang?

Kecenderungan itu nyata dan sudah banyak didokumentasikan pada arena semacam ini, dan justru karena itu kami mengoreksinya. Di samping rating mentah, kami menaksir rating terkoreksi gaya yang memperhitungkan panjang jawaban dan penggunaan penanda format. Selisih keduanya sendiri adalah temuan: ia menunjukkan seberapa besar bagian dari sebuah preferensi yang sebenarnya kefasihan retoris, bukan kompetensi bahasa.

Daftar istilah

Bradley-Terry
Model statistik yang menaksir kekuatan tiap peserta dari hasil adu satu lawan satu. Ia tidak menghitung kemenangan begitu saja: mengalahkan lawan yang jarang kalah menggeser taksirannya jauh lebih besar daripada mengalahkan yang sering kalah, sehingga sebuah model tidak pernah diuntungkan hanya karena kebetulan bertemu lawan yang ringan.