Mesin koreksi kami gagal di teks liar, lalu turun 27% dalam dua hari
Tersedia juga, ditulis untuk pembaca umumMesin Koreksi Lulus Ujian, Gagal di Tulisan AsliSetelah kami berhenti memakai kalimat uji yang ideal, mesin kami langsung menandai 3.740 hal. Kami mencatat perbaikan selama 8 snapshot dan hasilnya ternyata cukup mengejutkan.
Angka kunci
Angka ini dari mana?Diukur dari Ringkasan agregat per snapshot: kurva temuan lintas tujuh versi mesin
Alat koreksi bahasa hampir selalu diuji dengan kalimat yang memang dibuat untuk mengujinya. Kalimatnya pendek, kesalahannya satu, konteksnya bersih. Mesin kami lulus di sana, dan kami sempat merasa cukup senang.
Lalu kami arahkan ke tulisan yang benar-benar dibuat orang.
Ronde pertama: 3.741 penandaan, dan sebagian besar salah
Angka pertamanya 3.741. Bukan 3.741 kesalahan, melainkan 3.741 hal yang mesin anggap perlu diperbaiki. Begitu kami periksa satu per satu, sebagian besar ternyata bukan kesalahan sama sekali.
Nama tempat dianggap salah eja. Partikel percakapan direkatkan ke kata di depannya. Istilah teknis "diperbaiki" jadi kata lain yang tidak dimaksud siapa pun. Ada satu kasus di mana mesin dengan percaya diri mengubah nama kecamatan jadi kata sifat.
Alat koreksi yang lebih sering salah daripada benar bukan cuma tidak berguna. Ia berbahaya, karena orang cenderung menuruti saran yang muncul di layar, apalagi kalau saran itu terlihat yakin.
Cara kami mengukurnya, dan satu pilihan yang bisa digugat
Kami menjalankan mesin pada korpus yang sama berulang kali, lalu menyimpan hasilnya sebagai berkas terpisah tiap ronde. Delapan berkas. Belakangan ketahuan dua di antaranya isinya identik, dan satu lagi berkas tak bertanggal yang terus ditimpa, jadi yang benar-benar berbeda dan beku ada enam.
Kenapa berkas dan bukan basis data: basis data lokal bisa direset, dan tidak ada yang bisa mengauditnya dari luar mesin yang menjalankannya. Berkas yang tersimpan bisa dibandingkan berpasangan, dan itu yang membuat perubahan antarronde terlihat.
Pilihan yang bisa digugat: kami menghitung jumlah penandaan, bukan rasio penandaan yang benar. Rasio itu jauh lebih berarti, tapi menghitungnya menuntut seseorang memeriksa ribuan kasus secara manual tiap ronde. Kami memilih ukuran yang bisa dijalankan tiap jam, dan menerima bahwa ukuran itu lebih kasar.
Angkanya bergerak, tapi bukan seperti yang kami kira
| Ronde | Penandaan |
|---|---|
| 1 | 3.741 |
| 2 | 3.363 |
| 3 | 3.049 |
| 4 | 2.954 |
| 5 | 2.783 |
| 6 | 2.729 |
Turun 27% dari ronde pertama. Tiap penurunan punya sebabnya sendiri, dan tidak satu pun berupa menaikkan ambang kepercayaan.
Kami sengaja tidak menempuh jalan itu. Menaikkan ambang memang menurunkan angka dengan cepat, tapi ia menyembunyikan masalah alih-alih memperbaikinya, dan yang hilang lebih dulu justru penandaan yang benar. Angka yang bagus karena mesin berhenti bekerja bukan kemajuan.
Yang paling mengejutkan datang dari perbaikan terbesar. Ketika satu aturan berhenti merekatkan partikel ke kata sebelumnya, token partikel itu tidak lenyap. Ia jatuh ke aturan berikutnya yang tidak punya datanya, lalu menebak. Jadi angka totalnya turun, sementara jenis kesalahannya berubah.
Perbaikan yang paling banyak menurunkan angka ternyata memindahkan masalah, bukan menghapusnya.
Ini tidak akan terlihat kalau kami cuma punya satu foto keadaan akhir. Dua snapshot berurutan memperlihatkannya dalam beberapa menit.
Angka di versi pertama tulisan ini kurang satu, dan begini sebabnya
Deret di atas sudah dibetulkan. Versi pertama memuat tujuh angka, dan tidak satu pun tepat.
Enam yang pertama masing-masing kurang satu. Sebabnya wc -l, yang menghitung baris baru dan bukan rekaman. Berkas keluaran kami tidak diakhiri baris baru, sehingga tiap hitungan kehilangan rekaman terakhirnya.
wc -lmelaporkan 3.740. Berkasnya memuat 3.741 rekaman. Byte terakhirnya}, bukan baris baru.
Angka ketujuh, 2.554, masalahnya lain dan lebih besar: ia tidak ada di berkas mana pun. Ia terbaca dari berkas keluaran tak bertanggal yang ditimpa ulang tiap kali audit dijalankan, jadi isinya sudah berganti beberapa kali sejak tulisan ini pertama terbit. Angka itu dibuang, bukan dibetulkan, karena tidak ada keadaan beku yang bisa dirujuk.
Akibatnya penurunannya 27%, bukan 32%.
Enam angka yang tersisa berasal dari snapshot bertanggal yang tidak berubah lagi, dan tiap satunya bisa dicocokkan ke ringkasan snapshot di tautan data mentah di bawah.
Ironi yang tidak kami cari: tulisan ini berargumen bahwa berkas tersimpan lebih bisa diaudit daripada basis data, lalu satu angkanya sendiri diambil dari berkas yang memang tersimpan tapi tidak pernah dibekukan. Menyimpan saja tidak cukup. Yang membuat sebuah angka bisa diperiksa adalah tanggal dan sidik isinya.
Yang tidak bisa disimpulkan dari sini
Angka 27% adalah penurunan jumlah penandaan, bukan peningkatan akurasi. Keduanya berkorelasi, tapi tidak sama. Mesin yang berhenti menandai apa pun akan mencetak penurunan 100% dan sepenuhnya tidak berguna.
Kami juga tidak membandingkannya dengan alat lain. Bukan karena hasilnya akan memalukan, melainkan karena kami belum menjalankan perbandingan itu. Menuliskannya tanpa menjalankannya adalah persis jenis klaim yang membuat tulisan seperti ini tidak ada gunanya.
Dan dua hari adalah jendela yang sangat pendek. Laju perbaikan pada dua hari kerja intensif tidak memberi tahu apa pun tentang laju perbaikan sebulan ke depan. Kalau nanti kurvanya mendatar, kami akan menuliskannya juga.
Data & provenans
Keterbatasan
Satu korpus, satu mesin, tanpa pembanding eksternal. Delapan snapshot diambil dalam rentang dua hari, jadi angkanya menggambarkan laju perbaikan pada satu periode kerja intensif, bukan tren jangka panjang. "Penandaan" adalah jumlah hal yang ditandai mesin, bukan jumlah kesalahan yang terbukti; rasio positif palsu diaudit terpisah dan tidak dilaporkan di sini.
Riwayat revisi
- Terbit
- Terakhir diperbarui
Istilah dalam artikel ini
- token
- Potongan teks yang jadi satuan hitung model AI, kira-kira sepanjang suku kata sampai satu kata pendek. Harga layanan AI dihitung per juta token, masuk dan keluar dihitung terpisah, sehingga jawaban yang bertele-tele benar-benar lebih mahal daripada jawaban yang ringkas.
Ditulis penulis untuk artikel ini, bukan disalin dari entri kamus.