Tanya Jawab

Semua yang perlu Anda tahu tentang ibahasa: cara kami bekerja, apa yang kami cakup, dan bagaimana Anda bisa terlibat.

Tentang ibahasa

Apa itu ibahasa?
ibahasa berawal dari kamus hidup bahasa Indonesia: dokumentasi deskriptif bagaimana bahasa benar-benar dipakai sehari-hari, dan itu yang membuatnya berguna sebagai alat ukur. Korpus itu sekarang jadi dasar riset kami: mengukur seberapa jauh model AI benar-benar memahami bahasa Indonesia begitu keluar dari ragam baku, lalu menerbitkan temuannya sebagai laporan riset lengkap dengan data mentah dan batasannya.
Kenapa ibahasa mulai dari kamus, dan kenapa sekarang fokusnya riset?
Kamusnya sudah jadi: korpus bahasa Indonesia yang kami kurasi sendiri, ditinjau oleh manusia sebelum diterbitkan. Begitu korpusnya matang, kami menemukan kegunaan kedua untuknya: sebagai alat ukur untuk menguji AI. Kerja aktif kami sekarang ada di sisi itu: riset dan benchmark yang kami terbitkan terbuka. Kalau Anda menemukan entri kamus yang salah, beri tahu kami. Itu masih cara kami yang paling bisa diandalkan untuk menangkap kekeliruan.

Riset & Pengujian AI

Dari mana angka di artikel riset?
Dari pengujian yang kami jalankan sendiri, bukan dari angka yang kami kutip dari pihak lain. Tiap laporan menaut ke berkas data mentah yang dipakainya di repositori publik. Tautan itu dikunci ke versi saat angka itu dikutip, bukan ke rupa berkasnya hari ini. Kalau sebuah angka tidak bisa ditelusuri sampai ke berkasnya, angka itu tidak diterbitkan.
Apa itu Benchmark Nusantara?

Nama kumpulan benchmark bahasa Indonesia dan bahasa daerah yang kami susun dan jalankan sendiri. Tiap set mengukur satu kemampuan, memakai metode dan pagar yang sama, dan seluruh datanya terbit di satu repositori bernama sama. Nama itu juga yang dipakai kalau Anda ingin mengutip datanya. Pendiriannya satu kalimat: keluaran utama sebuah benchmark bukan papan peringkat, melainkan pernyataan terkalibrasi tentang seberapa jauh angkanya boleh dipercaya. Daftar setnya di ibahasa.com/id/benchmark.

Bisakah saya mengunduh data risetnya?

Bisa, di dua repositori, keduanya berlisensi CC BY 4.0. Data benchmark ada di github.com/ibahasa/benchmark-nusantara, sisanya di github.com/ibahasa/research-data. Keduanya dipisah karena data benchmark berubah tiap kali satu model dijalankan, sedangkan sisanya harus tetap tidak berubah supaya artikel yang mengutipnya tetap dapat diperiksa. Tiap kumpulan data disertai MANIFEST.json yang memuat daftar berkas, ukurannya, dan nilai sha256 masing-masing, sehingga unduhan Anda bisa diperiksa keasliannya. Sumber pihak ketiga tetap tunduk pada ketentuannya sendiri dan disebutkan di sana.

Kenapa sebagian data uji tidak diterbitkan?
Karena kalau semuanya terbit, semuanya berpeluang masuk ke data latih model berikutnya. Setelah itu kami kehilangan cara membedakan model yang benar-benar memahami bahasanya dari model yang kebetulan pernah membaca kuncinya. Bagian yang ditahan itu juga tidak pernah dipakai di kuis, permainan, atau fitur publik mana pun.

Masih Ada Pertanyaan?

Baca halaman Tentang untuk lebih banyak tentang riset kami, atau kunjungi komunitas kami untuk dukungan langsung.