Empiris· 6 menit baca

Seberapa bagus skor model-model NVIDIA dibanding model lain

Pertengahan Agustus lalu kami menjalankan Nemotron 3.5 Lightning versi berbayar di papan resmi, pada soal arti kata bahasa Jawa, dan hasilnya termasuk yang paling rendah di panel. NVIDIA juga membagikan beberapa model besarnya gratis, jadi kami penasaran pada pertanyaan yang lebih adil untuk mereka: bagaimana skor model-model itu di bahasa Indonesia sehari-hari, dan apakah ukuran yang jauh lebih besar terbayar di soal semacam itu.

Diukur dari export-lajur-uji-2026-08-26-id-B-ringkas.csv dan 1 sumber lain

34/42
Nemotron Super
26/42
Nemotron 3.5
41/42
Gemma 4 31B
$0
Biaya uji

NVIDIA pernah masuk papan kami, dan hasilnya kurang bagus

nvidia nemotron AI
Nvidia nemotron AI

Pada 12 dan 16 Agustus 2026 kami menjalankan Nemotron 3.5 Lightning versi berbayar di papan resmi, pada dua set arti kata bahasa Jawa. Skornya 34 dari 199 lema di satu set dan 3 dari 43 di set satunya, termasuk yang paling rendah di antara model yang kami uji. Soal arti kata bahasa Jawa memang berat untuk hampir semua model, jadi angka itu bukan vonis atas NVIDIA secara umum.

Dalam beberapa bulan terakhir NVIDIA membagikan sebagian model besarnya gratis lewat OpenRouter, termasuk yang berukuran 120 dan 550 miliar parameter. Karena itu kami ajukan pertanyaan yang lebih adil untuk mereka: bagaimana skornya di bahasa Indonesia sehari-hari, dan apakah ukuran yang lebih besar terbayar di soal seperti itu.

Bagaimana kami mengukurnya

Kami memakai set slang Indonesia: soal pilihan ganda tentang arti kata dan ungkapan gaul yang dipakai sehari-hari, mulai dari singkatan anak muda sampai istilah yang berpindah makna. Kami memakai 42 soal irisan publik di sini, yaitu sebagian soal yang aman dibagikan karena tidak dipakai menguji kontaminasi. 18 soal sisanya kami tahan dan tidak pernah dikirim ke model yang menyimpan prompt penggunanya, karena soal cadangan itulah alat kami memeriksa kontaminasi. Kunci jawabannya tidak pernah kami terbitkan.

Ketiga model dijalankan di lajur uji, jalur terpisah yang memakai soal dan rubrik penilai yang sama dengan papan resmi tetapi hasilnya dikarantina. Skor di artikel ini tidak masuk papan peringkat ibahasa.com/benchmark. Biayanya nol rupiah, karena semua model yang diuji sedang dibagikan gratis.

Hasil benchmark

ModelUkuranBenar dari 42Status
GPT-5.6 Lunatidak diumumkan42berbayar, papan resmi
Gemma 4 31B31 miliar41berbayar, papan resmi
DeepSeek V4 Flashtidak diumumkan39berbayar, papan resmi
Nemotron 3 Super120 miliar34gratis
SEA-LION 4,6B4,6 miliar33lokal, di komputer kami
Laguna S 2.1tidak diumumkan32gratis
Hunyuan A13B13 miliar aktif29berbayar, papan resmi
Nemotron 3.5 Lightning30 miliar (3 miliar aktif)26gratis
Gemma 4 31B (berbayar)
41
DeepSeek V4 Flash (berbayar)
39
Nemotron 3 Super 120B (gratis)
34
SEA-LION 4,6B (lokal)
33
Nemotron 3.5 Lightning (gratis)
26
Benar dari 42 soal slang Indonesia

Nemotron 3 Super menjawab benar 34 soal, dan itu skor yang layak: ia mengalahkan Hunyuan yang berbayar dan setara SEA-LION yang kami jalankan sendiri di komputer kantor. Nemotron 3.5 Lightning menjawab benar 26, terendah di antara semua model yang pernah masuk set ini.

Ukuran tidak menentukan skornya

Bagian yang paling menarik dari tabel di atas bukan urutannya, melainkan ukuran di kolom kedua. Nemotron 3 Super membawa 120 miliar parameter dan menjawab benar 34 soal. Gemma 4 31B, yang ukurannya sekitar seperempat Nemotron 3 Super, menjawab benar 41. Selisih 7 jawaban itu cukup tegas secara statistik (z sekitar 2,5), dan arah selisihnya berlawanan dengan dugaan umum bahwa model lebih besar pasti lebih paham.

Perbandingan yang lebih mengejutkan ada satu baris di bawahnya. SEA-LION berukuran 4,6 miliar parameter, presisinya diturunkan ke 4 bit supaya muat di komputer biasa, dan berjalan di komputer kami sendiri tanpa sambungan internet. Ia menjawab benar 33 soal, praktis sama dengan Nemotron 3 Super yang 26 kali lebih besar di atas kertas dan berjalan di pusat data NVIDIA. Untuk soal seperti ini, yang menentukan bukan berapa besar modelnya, melainkan seberapa banyak bahasa Indonesia sehari-hari yang pernah ia baca.

Total Aktif per jawaban
Nemotron 3 Super
120
12
Gemma 4 31B
31
31
Nemotron 3.5 Lightning
30
3
SEA-LION 4,6B
4,6
4,6
Ukuran model, total lawan yang benar-benar aktif saat menjawab (miliar parameter)

Grafik di atas menjelaskan sebagian besar teka-tekinya. Angka 120 miliar milik Nemotron 3 Super adalah ukuran seluruh modelnya, sementara yang benar-benar bekerja saat menjawab satu soal hanya 12 miliar, lebih kecil daripada Gemma yang memakai seluruh 31 miliarnya sekaligus. Nemotron 3.5 Lightning lebih ekstrem lagi: 3 miliar dari 30 miliar. Batang abu-abu yang pendek itulah yang sebenarnya sedang kami adu dengan Gemma, bukan batang merah yang panjang.

Sebelum menyimpulkan model besar sia-sia, ada baiknya melihat rancangan aslinya. Nemotron 3 Super memang besar, tapi hanya 12 miliar parameternya yang aktif saat menjawab, dan ia memakai arsitektur hibrida yang bukan transformer murni. Rancangan ini untuk penalaran agen dan otomatisasi tiket dukungan teknis. Nemotron 3.5 Lightning dioptimalkan untuk menulis kode dan keperluan perusahaan, dengan 3 miliar parameter aktif dari total 30 miliar. Nemotron 3 Ultra, dengan 55 miliar parameter aktif, diarahkan untuk penalaran tingkat lanjut dan mengoordinasikan agen yang berjalan lama. Ketiganya dirancang untuk bernalar dan mengerjakan tugas, bukan menebak arti kata gaul. Skor rendah di slang Indonesia karena itu bukan kegagalan desain, melainkan model yang kami pakai di luar keahlian utamanya.

Model yang tidak bisa kami uji

NVIDIA juga membagikan gratis Nemotron 3 Ultra, model 550 miliar parameter yang seharusnya jadi fokus artikel ini. Kami tidak berhasil mendapat satu jawaban pun darinya. Setiap permintaan API ditolak dengan pesan bahwa kuota bersama untuk pemakai gratis sedang penuh, termasuk sesudah kami beri jeda delapan detik antar-soal dan menaikkan jeda percobaan ulang sampai empat puluh detik.

Model yang tidak bisa dipanggil tidak menghasilkan data, dan model tanpa data tidak masuk tabel kami. Kejadian ini sendiri layak dicatat sebagai biaya tersembunyi model gratis: bukan hanya soal akurasi, melainkan juga soal apakah ia bisa dipakai saat dibutuhkan. Kuota gratis itu dipakai bersama seluruh dunia, dan giliran kita bergantung pada seberapa ramai pemakainya saat itu.

Kekeliruan kami sendiri di angka-angka ini

Artikel ini memakai skor pada 42 soal irisan publik, dan angka itu berbeda dari yang kami tulis di artikel dua hari lalu. Penyebabnya kekeliruan kami: berkas ekspor kami menyimpan skor irisan publik dan skor irisan tertahan di kolom terpisah, dan kami sempat membaca kolom pertama sebagai skor keseluruhan. Akibatnya satu perbandingan di artikel sebelumnya salah dan sudah kami koreksi, dan penjelasan kolomnya kami perbaiki di berkas dataset publik supaya orang lain tidak melakukan kesalahan baca yang sama.

Kami menyebutkannya di sini karena angka Gemma 41 dari 42 di tabel atas adalah angka yang sama yang dulu kami salah baca. Sekarang ia benar, dan cara memeriksanya terbuka: berkas ringkasannya tertaut di bawah artikel ini.

Batas simpulannya

Tiap model dijalankan sekali, pada satu jenis soal, dalam satu bahasa. Jadi simpulannya sebatas pemahaman slang Indonesia pada hari pengukuran. Selisih antara kedua model NVIDIA sendiri, 34 lawan 26, belum cukup tegas untuk menyingkirkan kebetulan (z sekitar 1,9), sementara jarak keduanya ke Gemma dan GPT-5.6 sudah cukup lebar untuk dibicarakan. Kami juga belum menguji model-model NVIDIA ini pada tingkat tutur bahasa Jawa, bagian tersulit instrumen kami, dan hasil versi berbayarnya di soal arti kata Jawa menunjukkan bahwa tingkat tutur Jawa adalah ujian yang jauh lebih berat.

Data & provenans

Keterbatasan

Satu run per model pada 42 soal pilihan ganda irisan publik set slang kami. Soal dan kuncinya tidak pernah diterbitkan. Angka di sini lahir di lajur uji, terpisah dari papan resmi, jadi ia tidak menggeser peringkat siapa pun di ibahasa.com/benchmark. Nemotron 3 Ultra 550 miliar parameter tidak dapat diuji sama sekali karena kuota gratisnya penuh terus, dan model tanpa data tidak kami masukkan ke tabel.

Riwayat revisi

Terbit
Terakhir diperbarui
belum pernah direvisi sejak terbit

Istilah dalam artikel ini

lema
Bentuk dasar sebuah kata yang menjadi tajuk satu entri kamus, dan yang dicari orang saat membuka kamus. Satu lema dapat memayungi beberapa makna sekaligus, dan tiap makna dapat membawa contoh kalimatnya sendiri.

Ditulis penulis untuk artikel ini, bukan disalin dari entri kamus.