2 model AI dengan harga sama persis diuji pada benchmark bahasa Indonesia: 56,52% lawan 26,09%
Dua model AI dari dua perusahaan berbeda dijual dengan harga yang sama persis: $0,05 per juta token masuk, $0,08 per juta token keluar. Keduanya sama cepatnya. Kami memberi keduanya 69 soal yang sama, dan hasilnya terpisah lebih dari dua kali lipat. Yang tidak kami duga, sebagian kesalahan justru ada di kunci jawaban kami sendiri.
Angka kunci
Angka ini dari mana?Diukur dari runs-2026-08-06-idN-dua-model-murah-summary.md dan 1 sumber lain
Anggaran sama, hasil dua kali lipat berbeda
Kalau kamu memilih model AI murah untuk mengolah teks bahasa Indonesia, biasanya kamu membandingkan harga dulu, lalu kecepatan. Dua model ini menggagalkan cara itu, karena keduanya identik di kedua kolom tersebut.
| Mistral Small 3 | Llama 3.1 8B Instruct | |
|---|---|---|
| Perusahaan | Mistral AI | Meta |
| Harga masuk / juta token | $0,05 | $0,05 |
| Harga keluar / juta token | $0,08 | $0,08 |
| Peringkat latensi di katalog | #7 | #10 |
| Context window | 32.768 token | 131.072 token |
Harga sama persis. Kecepatan menurut katalog nyaris setara. Satu-satunya kolom yang jelas berbeda justru menguntungkan Llama: context window-nya empat kali lebih besar.
Lalu kami beri keduanya pekerjaan yang sama.
Tugasnya: membaca tulisan orang yang sedang buru-buru
Set soalnya berisi kalimat yang ditulis seperti orang mengetik cepat di ponsel, dan tugas model adalah mengembalikannya ke bahasa Indonesia baku.
asal : Bsk aku blm bisa dtg, ada urusan.
seharusnya : Besok aku belum bisa datang, ada urusan.
69 soal, semuanya isian bebas dan bukan pilihan ganda, tiga kali ulangan per soal, temperature 0. Penilaiannya memakai edit-based scoring: yang dibandingkan suntingan yang dilakukan model terhadap kalimat asal, bukan teksnya huruf per huruf, jadi perbedaan format yang tidak mengubah makna tidak dihukum.
| Model | Skor | Waktu jawab (median) | Biaya |
|---|---|---|---|
| Mistral Small 3 | 56,52% | 850 ms | $0,0016 |
| Llama 3.1 8B Instruct | 26,09% | 941 ms | $0,0019 |
Katalog benar soal kecepatan: 850 lawan 941 milidetik, selisihnya 91 milidetik, praktis tidak terasa. Yang tidak diramalkan katalog mana pun adalah selisih 30,43 poin pada kualitas jawabannya. Dan context window empat kali lebih besar milik Llama tidak menolongnya sama sekali di sini, sebab soalnya cuma satu kalimat.
Seluruh pengujian ini, kedua model, 414 panggilan, menghabiskan $0,0035. Tiga setengah per seribu dolar untuk mengetahui bahwa dua pilihan seharga sama terpisah dua kali lipat.
Kunci jawaban kami sendiri menghukum jawaban yang benar
Ini bagian yang paling tidak kami duga, dan kami hampir menerbitkan angka yang salah karenanya.
Jalan pertama memberi skor lebih rendah untuk kedua model. Angka serendah itu bikin curiga, jadi kami baca satu per satu jawaban yang dinilai salah. Sebagian memang gagal beneran: model meninggalkan tp yang seharusnya jadi tapi. Tapi empat soal punya masalah lain, dan masalahnya ada di kami.
Empat soal itu memuat singkatan yang belum ternormalkan di kunci jawabannya sendiri:
"Jangan lupa bawa bku besok pagi." Kata "bku" tidak pernah diperbaiki jadi "buku".
"Jangan lupa bawa buku besok pagi." Sepenuhnya benar, dan dinilai SALAH.
Sistem memenangkan kunci yang rusak. Kedua model mencetak nol di keempat soal itu, dan model yang menormalkan dengan lebih benar justru dihukum lebih berat.
Empat dari 69 soal terdengar kecil. Yang membuatnya serius bukan jumlahnya melainkan arahnya: kesalahan ini tidak mengacak, ia menghukum pihak yang mengerjakan tugasnya dengan benar. Kunci jawabannya sudah dibetulkan dan seluruh angka di artikel ini berasal dari jalan sesudah perbaikan.
Yang menemukannya bukan pemeriksaan soal satu per satu, karena keempat soal itu sudah lolos verifikasi manusia. Yang menemukannya adalah membaca jawaban yang dinilai salah, lalu bertanya kenapa jawaban yang kelihatan benar mendapat nol.
Angka yang lebih penting daripada skor keseluruhan
Lima belas dari 69 soal adalah control item: kalimatnya sudah baku dan seharusnya dikembalikan apa adanya. Model yang mengubahnya berarti merusak tulisan yang tidak perlu diperbaiki.
| Model | Kalimat benar yang dipertahankan |
|---|---|
| Mistral Small 3 | 82,2% |
| Llama 3.1 8B Instruct | 42,2% |
Llama merusak kalimat yang sudah benar pada hampir enam dari sepuluh kesempatan. Mistral dua dari sepuluh.
Kalau model ini dipakai sebagai alat bantu menulis, kolom inilah yang menentukan, bukan skor keseluruhan. Orang memaafkan koreksi yang terlewat, karena mereka tidak tahu apa yang terlewat. Orang tidak memaafkan tulisan benar yang dirusak, karena itu terlihat, dan setiap kali terlihat kepercayaan pada alatnya berkurang.
Perhatikan juga jurangnya melebar di kolom ini: 30 poin di skor keseluruhan, 40 poin di soal kontrol.
Untuk pertama kalinya, set kami cukup besar
Ada catatan metodologi yang kami senang bisa tulis kali ini.
Pada pengukuran kami sebelumnya, sebagian besar set kami sebenarnya tidak punya cukup soal untuk membuktikan selisih yang mereka laporkan sendiri. Kali ini lolos:
| Soal yang dibutuhkan untuk statistical power 80% | 37 |
| Soal yang tersedia | 69 |
Sebabnya bukan set ini membesar, melainkan selisihnya besar dan kedua model cukup sering keliru. Itu berlawanan dengan naluri: makin sering model salah, makin sedikit soal yang dibutuhkan untuk membuktikan siapa yang lebih baik. Pada set kami yang lain, tempat kedua model hampir selalu benar, selisih sekecil itu menuntut 1.710 soal.
Jadi, pilih yang mana
Untuk tugas menormalkan teks bahasa Indonesia, pada anggaran yang sama persis dan kecepatan yang sama, Mistral Small 3 dari Mistral AI mengerjakannya dua kali lebih sering benar daripada Llama 3.1 8B Instruct dari Meta, dan tiga kali lebih jarang merusak kalimat yang sudah benar.
Yang tidak boleh disimpulkan dari sini: bahwa satu model "lebih baik" secara umum. Yang diuji satu jenis tugas dalam satu bahasa. Llama punya context window empat kali lebih besar, dan pada pekerjaan yang benar-benar membutuhkan konteks panjang, perbandingan ini tidak berlaku sama sekali.
Yang bisa dibawa pulang siapa pun: harga dan peringkat kecepatan di katalog pemasok tidak meramalkan kualitas jawaban. Untuk mengetahuinya, satu-satunya jalan adalah mengujinya sendiri pada pekerjaan yang benar-benar akan dikerjakan. Punya kami menghabiskan tiga setengah per seribu dolar.
Data & provenans
Keterbatasan
Dua model, satu set 69 soal, satu bahasa, satu jenis tugas. Menormalkan tulisan singkatan bukan ukuran umum kemampuan berbahasa Indonesia, dan hasilnya tidak otomatis berlaku untuk tugas lain seperti meringkas atau menjawab pertanyaan.
Set ini cukup besar untuk membuktikan selisih sebesar ini, bukan selisih kecil. Dua model yang berdekatan tetap menuntut set yang jauh lebih besar.
Skor Llama 3.1 8B Instruct bergerak 3,55 poin antar ulangan, tiga kali lipat milik Mistral Small 3. Rerata tiga ulangan menyembunyikan ketidakstabilan itu.
Empat kunci jawaban yang dibetulkan menaikkan skor kedua model. Angka sebelum dan sesudah perbaikan tidak sebanding, dan artikel ini memakai angka sesudahnya.
Selisih waktu jawab 91 milidetik terlalu dekat untuk menyimpulkan apa pun tentang peringkat latensi yang tercantum di katalog pemasok.
Soal-soal ini tidak pernah diterbitkan, tetapi kami tidak punya cara membuktikan model belum pernah melihat sumber yang sama.
Riwayat revisi
- Terbit
- Terakhir diperbarui
- belum pernah direvisi sejak terbit
Istilah dalam artikel ini
- context window
- Batas berapa banyak teks yang sanggup dipegang sebuah model AI sekaligus dalam satu percakapan, dihitung dalam token. Sering disalahpahami sebagai ukuran kepintaran, padahal ia cuma ukuran daya tampung: model dengan daya tampung besar bisa membaca dokumen panjang, tetapi tidak otomatis menjawab lebih benar pada kalimat pendek.
- control item
- Soal yang jawabannya sudah benar sejak awal dan seharusnya dikembalikan apa adanya. Dipakai mengukur koreksi berlebih, yaitu kebiasaan model mengubah sesuatu yang tidak perlu diubah. Tanpa soal semacam ini, sebuah alat yang membetulkan segalanya akan terlihat sempurna pada set yang seluruhnya berisi kesalahan.
- edit-based scoring
- Cara menilai jawaban dengan membandingkan SUNTINGAN yang dilakukan terhadap kalimat asal, bukan membandingkan teks jawabannya huruf per huruf. Yang dicocokkan adalah kata apa yang dibuang dan ditambahkan. Akibatnya jawaban yang benar tetapi memakai tanda kutip atau spasi berbeda tidak lagi dihukum, padahal pada pencocokan teks persis ia akan dinilai salah.
- latensi
- Lama waktu dari permintaan dikirim sampai jawaban lengkap diterima. Perlu dibedakan dari kecepatan mengetik model: angka ini ikut memuat jeda menunggu giliran ketika penyedia sedang penuh, sehingga segelintir panggilan yang bernasib buruk dapat menaikkan reratanya jauh di atas pengalaman sehari-hari.
- statistical power
- Peluang sebuah pengujian benar-benar menangkap selisih yang memang ada. Bergantung pada besar selisihnya dan banyaknya soal: selisih besar bisa dibuktikan dengan sedikit soal, selisih kecil menuntut banyak. Set uji yang terlalu kecil dapat melaporkan dua model tampak berbeda tanpa sanggup membuktikan perbedaannya bukan kebetulan.
- temperature
- Sakelar yang mengatur seberapa berani sebuah model AI memilih kata yang kurang mungkin. Disetel nol, model selalu mengambil pilihan yang paling mungkin, sehingga pertanyaan yang sama cenderung dijawab sama persis. Dinaikkan, jawabannya jadi lebih beragam tetapi lebih sulit diulang. Dalam pengujian, nol dipakai supaya yang terukur kemampuan modelnya, bukan keberuntungan undiannya.
- token
- Potongan teks yang jadi satuan hitung model AI, kira-kira sepanjang suku kata sampai satu kata pendek. Harga layanan AI dihitung per juta token, masuk dan keluar dihitung terpisah, sehingga jawaban yang bertele-tele benar-benar lebih mahal daripada jawaban yang ringkas.
Ditulis penulis untuk artikel ini, bukan disalin dari entri kamus.