Benchmark·Empiris

Dua hari sebelum Z.ai buka suara, data kami sudah bilang ini bukan GLM-5.3

Selama enam hari sebuah model misterius bernama ox-alpha dibagikan gratis dan dipakai ratusan ribu orang. Komunitas menebak-nebak siapa pembuatnya lewat sidik teknis, dan kesimpulannya berhenti di "keluarga GLM". Kami mengujinya dengan soal tingkat tutur bahasa Jawa, dan jawaban yang keluar lebih tajam: sekeluarga memang, tetapi bukan GLM-5.3 versi resmi. Dua hari kemudian Z.ai membenarkannya.

Ini adalah ringkasan dan perspektif lain dari artikel riset ini.

Apa artinya

Pada 20 Agustus 2026 sebuah model AI muncul gratis di OpenRouter tanpa nama perusahaan, hanya berlabel ox-alpha. Dalam hitungan hari ia jadi model tersibuk kedua di sana. Semua orang bertanya siapa pembuatnya, dan komunitas menebak lewat sidik teknis seperti pola pemenggalan kata dan gaya kode. Tebakan terjauh mereka: keluarga GLM milik perusahaan Tiongkok Z.ai.

ox alpha glm 5 3 flash ibahasa
ox-alpha = GLM 5.3 Flash

Kami mengambil jalan lain. Alih-alih membedah mesinnya, kami mengujinya memakai soal bahasa: 38 pertanyaan tingkat tutur bahasa Jawa, jenis soal yang menuntut model memilih bentuk krama yang tepat untuk lawan bicara tertentu. Model yang sama, dijalankan dua kali, biasanya menjawab nyaris sama persis. Ox-alpha dan GLM-5.3 versi resmi ternyata hanya sepakat pada 27 dari 38 soal.

11
Berbeda 11Sama 27
Jawaban ox-alpha dan GLM-5.3 pada 38 soal yang sama

11 soal yang dijawab berbeda itulah dasar tulisan kami pada 24 Agustus: ox-alpha bukan GLM-5.3 versi resmi, meski kemungkinan besar masih satu keluarga, misalnya varian yang dirancang lain atau hasil penyetelan lanjutan.

Dua hari kemudian, pada 26 Agustus, Z.ai mengumumkan bahwa model misterius itu adalah GLM-5.3-Flash, dan mengakui bahwa merekalah yang menguji model itu diam-diam dengan nama ox-alpha. Persis seperti dugaan kami: satu keluarga, tetapi bukan model yang sama.

Kenapa bisa begitu

Sidik teknis menjawab pertanyaan "buatan siapa". Ia tidak bisa menjawab "yang mana", karena satu perusahaan memakai pola pemenggalan kata yang sama untuk seluruh keluarganya. Perilaku bahasa justru sebaliknya: dua model dari satu pabrik tetap menjawab berbeda kalau ukuran dan penyetelannya berbeda, dan perbedaan itu paling kelihatan pada soal yang sulit.

Tingkat tutur bahasa Jawa kebetulan jenis soal yang sangat sulit. Model harus tahu bahwa kata yang sama berubah bentuk tergantung siapa yang diajak bicara, dan salah sedikit saja jawabannya meleset. Soal seperti itu memisahkan model yang berkerabat, sementara soal mudah membuat mereka terlihat kembar karena sama-sama menjawab benar.

Angka resminya memperjelas semuanya. GLM-5.3-Flash membawa 320 miliar parameter, tetapi hanya 18 miliar yang benar-benar bekerja saat menjawab satu soal, sebuah rancangan hemat yang memang dibuat untuk kecepatan. Itu menjelaskan kenapa skornya di pengukuran kami selalu sedikit di bawah GLM-5.3 versi lengkap.

GLM-5.3 ox-alpha (GLM-5.3-Flash)
Tingkat tutur Jawa
84,2
71,1
Slang Indonesia
95,0
81,7
Persen jawaban benar, ox-alpha lawan GLM-5.3 versi lengkap

Batang merah selalu lebih tinggi di kedua jenis soal, dan jaraknya mirip. Model yang sama persis tidak akan meninggalkan pola setenang itu, sementara dua kerabat dengan ukuran kerja berbeda justru akan.

Batasannya

Kami tidak pernah menebak nama modelnya, dan tidak berpura-pura begitu. Kami hanya menyimpulkan satu hal: ia bukan GLM-5.3 versi resmi. Nama Flash datang dari Z.ai sendiri, bukan dari data kami.

Kesimpulan itu juga bersandar pada satu kali pengukuran per model, pada satu jenis soal, dalam satu bahasa daerah. Seandainya kedua model itu kebetulan menjawab mirip di 38 soal tersebut, simpulan kami akan terbalik dan keliru. Angka kecocokan 71 persen cukup jauh dari angka khas model kembar identik yang biasanya di atas 90 persen, tetapi ia tetap satu bukti, bukan kumpulan bukti.

Terakhir, semua angka di sini dihasilkan di lajur uji kami, jalur terpisah untuk model yang tidak masuk papan peringkat resmi. Model samaran berganti identitas terlalu cepat untuk dinilai setara model yang stabil, jadi skornya tidak pernah tercatat di ibahasa.com/benchmark. Berkas datanya terbuka di tautan bawah artikel ini.

Di balik temuan ini

Versi teknisnya memuat angka mentah, susunan pengujian, dan hal-hal yang justru tidak bisa disimpulkan darinya.

Baca versi teknisnya