Seberapa bagus skor model-model NVIDIA dibanding model lain
Pertengahan Agustus lalu kami menjalankan Nemotron 3.5 Lightning versi berbayar di papan resmi, pada soal arti kata bahasa Jawa, dan hasilnya termasuk yang paling rendah di panel. NVIDIA juga membagikan beberapa model besarnya gratis, jadi kami penasaran pada pertanyaan yang lebih adil untuk mereka: bagaimana skor model-model itu di bahasa Indonesia sehari-hari, dan apakah ukuran yang jauh lebih besar terbayar di soal semacam itu.
Angka kunci
Angka ini dari mana?Diukur dari export-lajur-uji-2026-08-26-id-B-ringkas.csv dan 1 sumber lain
NVIDIA pernah masuk papan kami, dan hasilnya kurang bagus
Pada 12 dan 16 Agustus 2026 kami menjalankan Nemotron 3.5 Lightning versi berbayar di papan resmi, pada dua set arti kata bahasa Jawa. Skornya 34 dari 199 lema di satu set dan 3 dari 43 di set satunya, termasuk yang paling rendah di antara model yang kami uji. Soal arti kata bahasa Jawa memang berat untuk hampir semua model, jadi angka itu bukan vonis atas NVIDIA secara umum.
Dalam beberapa bulan terakhir NVIDIA membagikan sebagian model besarnya gratis lewat OpenRouter, termasuk yang berukuran 120 dan 550 miliar parameter. Karena itu kami ajukan pertanyaan yang lebih adil untuk mereka: bagaimana skornya di bahasa Indonesia sehari-hari, dan apakah ukuran yang lebih besar terbayar di soal seperti itu.
Bagaimana kami mengukurnya
Kami memakai set slang Indonesia: soal pilihan ganda tentang arti kata dan ungkapan gaul yang dipakai sehari-hari, mulai dari singkatan anak muda sampai istilah yang berpindah makna. Kami memakai 42 soal irisan publik di sini, yaitu sebagian soal yang aman dibagikan karena tidak dipakai menguji kontaminasi. 18 soal sisanya kami tahan dan tidak pernah dikirim ke model yang menyimpan prompt penggunanya, karena soal cadangan itulah alat kami memeriksa kontaminasi. Kunci jawabannya tidak pernah kami terbitkan.
Ketiga model dijalankan di lajur uji, jalur terpisah yang memakai soal dan rubrik penilai yang sama dengan papan resmi tetapi hasilnya dikarantina. Skor di artikel ini tidak masuk papan peringkat ibahasa.com/benchmark. Biayanya nol rupiah, karena semua model yang diuji sedang dibagikan gratis.
Hasil benchmark
| Model | Ukuran | Benar dari 42 | Status |
|---|---|---|---|
| GPT-5.6 Luna | tidak diumumkan | 42 | berbayar, papan resmi |
| Gemma 4 31B | 31 miliar | 41 | berbayar, papan resmi |
| DeepSeek V4 Flash | tidak diumumkan | 39 | berbayar, papan resmi |
| Nemotron 3 Super | 120 miliar | 34 | gratis |
| SEA-LION 4,6B | 4,6 miliar | 33 | lokal, di komputer kami |
| Laguna S 2.1 | tidak diumumkan | 32 | gratis |
| Hunyuan A13B | 13 miliar aktif | 29 | berbayar, papan resmi |
| Nemotron 3.5 Lightning | 30 miliar (3 miliar aktif) | 26 | gratis |
Nemotron 3 Super menjawab benar 34 soal, dan itu skor yang layak: ia mengalahkan Hunyuan yang berbayar dan setara SEA-LION yang kami jalankan sendiri di komputer kantor. Nemotron 3.5 Lightning menjawab benar 26, terendah di antara semua model yang pernah masuk set ini.
Ukuran tidak menentukan skornya
Bagian yang paling menarik dari tabel di atas bukan urutannya, melainkan ukuran di kolom kedua. Nemotron 3 Super membawa 120 miliar parameter dan menjawab benar 34 soal. Gemma 4 31B, yang ukurannya sekitar seperempat Nemotron 3 Super, menjawab benar 41. Selisih 7 jawaban itu cukup tegas secara statistik (z sekitar 2,5), dan arah selisihnya berlawanan dengan dugaan umum bahwa model lebih besar pasti lebih paham.
Perbandingan yang lebih mengejutkan ada satu baris di bawahnya. SEA-LION berukuran 4,6 miliar parameter, presisinya diturunkan ke 4 bit supaya muat di komputer biasa, dan berjalan di komputer kami sendiri tanpa sambungan internet. Ia menjawab benar 33 soal, praktis sama dengan Nemotron 3 Super yang 26 kali lebih besar di atas kertas dan berjalan di pusat data NVIDIA. Untuk soal seperti ini, yang menentukan bukan berapa besar modelnya, melainkan seberapa banyak bahasa Indonesia sehari-hari yang pernah ia baca.
12
31
3
4,6
Grafik di atas menjelaskan sebagian besar teka-tekinya. Angka 120 miliar milik Nemotron 3 Super adalah ukuran seluruh modelnya, sementara yang benar-benar bekerja saat menjawab satu soal hanya 12 miliar, lebih kecil daripada Gemma yang memakai seluruh 31 miliarnya sekaligus. Nemotron 3.5 Lightning lebih ekstrem lagi: 3 miliar dari 30 miliar. Batang abu-abu yang pendek itulah yang sebenarnya sedang kami adu dengan Gemma, bukan batang merah yang panjang.
Sebelum menyimpulkan model besar sia-sia, ada baiknya melihat rancangan aslinya. Nemotron 3 Super memang besar, tapi hanya 12 miliar parameternya yang aktif saat menjawab, dan ia memakai arsitektur hibrida yang bukan transformer murni. Rancangan ini untuk penalaran agen dan otomatisasi tiket dukungan teknis. Nemotron 3.5 Lightning dioptimalkan untuk menulis kode dan keperluan perusahaan, dengan 3 miliar parameter aktif dari total 30 miliar. Nemotron 3 Ultra, dengan 55 miliar parameter aktif, diarahkan untuk penalaran tingkat lanjut dan mengoordinasikan agen yang berjalan lama. Ketiganya dirancang untuk bernalar dan mengerjakan tugas, bukan menebak arti kata gaul. Skor rendah di slang Indonesia karena itu bukan kegagalan desain, melainkan model yang kami pakai di luar keahlian utamanya.
Model yang tidak bisa kami uji
NVIDIA juga membagikan gratis Nemotron 3 Ultra, model 550 miliar parameter yang seharusnya jadi fokus artikel ini. Kami tidak berhasil mendapat satu jawaban pun darinya. Setiap permintaan API ditolak dengan pesan bahwa kuota bersama untuk pemakai gratis sedang penuh, termasuk sesudah kami beri jeda delapan detik antar-soal dan menaikkan jeda percobaan ulang sampai empat puluh detik.
Model yang tidak bisa dipanggil tidak menghasilkan data, dan model tanpa data tidak masuk tabel kami. Kejadian ini sendiri layak dicatat sebagai biaya tersembunyi model gratis: bukan hanya soal akurasi, melainkan juga soal apakah ia bisa dipakai saat dibutuhkan. Kuota gratis itu dipakai bersama seluruh dunia, dan giliran kita bergantung pada seberapa ramai pemakainya saat itu.
Kekeliruan kami sendiri di angka-angka ini
Artikel ini memakai skor pada 42 soal irisan publik, dan angka itu berbeda dari yang kami tulis di artikel dua hari lalu. Penyebabnya kekeliruan kami: berkas ekspor kami menyimpan skor irisan publik dan skor irisan tertahan di kolom terpisah, dan kami sempat membaca kolom pertama sebagai skor keseluruhan. Akibatnya satu perbandingan di artikel sebelumnya salah dan sudah kami koreksi, dan penjelasan kolomnya kami perbaiki di berkas dataset publik supaya orang lain tidak melakukan kesalahan baca yang sama.
Kami menyebutkannya di sini karena angka Gemma 41 dari 42 di tabel atas adalah angka yang sama yang dulu kami salah baca. Sekarang ia benar, dan cara memeriksanya terbuka: berkas ringkasannya tertaut di bawah artikel ini.
Batas simpulannya
Tiap model dijalankan sekali, pada satu jenis soal, dalam satu bahasa. Jadi simpulannya sebatas pemahaman slang Indonesia pada hari pengukuran. Selisih antara kedua model NVIDIA sendiri, 34 lawan 26, belum cukup tegas untuk menyingkirkan kebetulan (z sekitar 1,9), sementara jarak keduanya ke Gemma dan GPT-5.6 sudah cukup lebar untuk dibicarakan. Kami juga belum menguji model-model NVIDIA ini pada tingkat tutur bahasa Jawa, bagian tersulit instrumen kami, dan hasil versi berbayarnya di soal arti kata Jawa menunjukkan bahwa tingkat tutur Jawa adalah ujian yang jauh lebih berat.
Data & provenans
Keterbatasan
Satu run per model pada 42 soal pilihan ganda irisan publik set slang kami. Soal dan kuncinya tidak pernah diterbitkan. Angka di sini lahir di lajur uji, terpisah dari papan resmi, jadi ia tidak menggeser peringkat siapa pun di ibahasa.com/benchmark. Nemotron 3 Ultra 550 miliar parameter tidak dapat diuji sama sekali karena kuota gratisnya penuh terus, dan model tanpa data tidak kami masukkan ke tabel.
Riwayat revisi
- Terbit
- Terakhir diperbarui
- belum pernah direvisi sejak terbit
Istilah dalam artikel ini
- lema
- Bentuk dasar sebuah kata yang menjadi tajuk satu entri kamus, dan yang dicari orang saat membuka kamus. Satu lema dapat memayungi beberapa makna sekaligus, dan tiap makna dapat membawa contoh kalimatnya sendiri.
Ditulis penulis untuk artikel ini, bukan disalin dari entri kamus.