Detektor tidak dapat mengetahui perangkat lunak apa yang terbuka saat Anda mengetik. Detektor membaca teks yang sudah selesai dan memperkirakan seberapa mudah pilihan katanya diprediksi. Menggunakan autocomplete tidak membuat teks dikenali sebagai keluaran mesin, tetapi detektor tetap dapat salah mengklasifikasikan tulisan manusia.
Hal yang sebenarnya diukur oleh detektor
Alat-alat ini melihat properti statistik teks: seberapa mudah setiap kata diprediksi berdasarkan kata-kata sebelumnya, seberapa besar variasi panjang kalimat, dan seberapa luas kosakatanya. Teks yang dihasilkan model bahasa cenderung berada di bagian tengah dengan probabilitas tinggi dalam distribusi tersebut, karena itulah yang dirancang untuk dihasilkan oleh model. Tulisan manusia lebih beragam.
Itu merupakan penilaian terhadap teks, bukan catatan tentang cara teks tersebut dibuat. Tidak ada informasi dalam dokumen yang menunjukkan tombol keyboard mana yang berasal dari sebuah saran — dan sebaliknya, tidak ada pula yang melindungi tulisan yang kebetulan sederhana dan teratur.
Penelitian tidak berpihak pada detektor
Evaluasi independen oleh Liang, Yuksekgonul, Mao, Wu, dan Zou dari Stanford diterbitkan di Patterns pada 2023. Mereka menjalankan tujuh detektor yang banyak digunakan pada 91 esai TOEFL yang ditulis oleh manusia dan 88 esai siswa kelas 8 di AS, yang juga ditulis oleh manusia.
- Esai siswa kelas 8 diklasifikasikan secara akurat — sekitar 5,1% ditandai secara keliru.
- Esai TOEFL tidak demikian: tingkat positif palsunya rata-rata mencapai 61,3%.
- Ketujuh detektor sepakat menandai 19,8% esai TOEFL secara keliru.
- Setidaknya satu detektor menandai 97,8% esai tersebut.
Para penulis mengaitkan hasil ini dengan fitur yang digunakan detektor. Rentang kosakata yang terbatas dan struktur kalimat yang mudah ditebak dapat terlihat seperti tulisan mesin bagi detektor, tetapi keduanya juga umum ditemukan dalam tulisan yang dihasilkan dalam bahasa kedua. Oleh karena itu, alat-alat tersebut berisiko menghukum tulisan manusia karena kesederhanaan statistiknya.
Penelitian tersebut berasal dari 2023 dan detektor telah berubah sejak saat itu. Namun, bentuk masalahnya tidak berubah: detektor adalah pengklasifikasi probabilistik, dan tidak satu pun menerbitkan tingkat kesalahan per dokumen yang dapat Anda andalkan untuk menuduh seseorang.
Jadi, di mana posisi autocomplete?
Itu sepenuhnya bergantung pada seberapa banyak bagian teks yang merupakan tulisan Anda.
| Yang Anda lakukan | Yang dilihat detektor |
|---|---|
| Menerima beberapa pelengkapan kata dalam kalimat yang Anda susun | Tulisan Anda, dengan struktur dan kosakata Anda |
| Sesekali menerima sebuah frasa untuk menyelesaikan kalimat rutin | Sebagian besar tulisan Anda; kalimat rutin tetaplah rutin |
| Meminta chatbot menulis paragraf lalu menempelkannya | Teks yang dihasilkan, karena memang merupakan teks yang dihasilkan |
| Menulisnya sendiri, dengan bahasa yang sederhana, dalam bahasa kedua | Tetap mungkin ditandai — lihat penjelasan di atas |
Perbedaan yang relevan adalah apakah Anda menyusun teks tersebut sendiri. Menyelesaikan kalimat Anda sendiri dengan sebuah saran tetap mempertahankan susunan tulisan Anda, sedangkan meminta dan menerima paragraf yang dihasilkan tidak demikian.
Jika Anda dinilai berdasarkan orisinalitas
- Cari tahu aturan yang sebenarnya. Banyak institusi mengizinkan bantuan ejaan, tata bahasa, dan teks prediktif, serta melarang konten yang dihasilkan. Sebagian institusi melarang semuanya. Aturan tertulis lebih berharga daripada asumsi ke arah mana pun.
- Simpan riwayat versi Anda. Google Docs dan Word sama-sama menyimpannya. Dokumen yang berkembang selama berjam-jam, dengan penambahan, penghapusan, dan kalimat yang ditulis ulang, merupakan catatan bahwa proses penulisan benar-benar terjadi — jenis bukti yang berbeda dari sebuah skor dan tidak dapat dijawab oleh skor tersebut.
- Jangan menulis ulang teks hanya untuk mengakali detektor. Menambahkan kata-kata yang tidak biasa ke dalam kalimat untuk menurunkan skor akan membuat tulisan Anda lebih buruk dan tidak dapat dibedakan dari hasil alat “humanizer”. Jika Anda dituduh, jawabannya adalah riwayat versi.
- Anggap skor sebagai awal percakapan, bukan putusan. Dengan tingkat positif palsu seperti di atas, hanya itulah yang dapat dikatakan secara jujur oleh skor tersebut.
Perbedaan autocomplete lokal
Satu perbedaan praktis tidak berkaitan sama sekali dengan deteksi. Asisten penulisan berbasis cloud mengirimkan apa yang Anda ketik ke server untuk menghasilkan sarannya. Typeahead Typeahead menjalankan model ringkas di PC Anda sendiri melalui llama.cpp, sehingga setelah model diunduh, tidak ada tulisan Anda yang dikirim ke mana pun dan alat ini dapat bekerja tanpa koneksi sama sekali.
Typeahead menyarankan beberapa kata berikutnya dari kalimat yang sedang Anda tulis, di samping caret, dan tidak memasukkan apa pun kecuali Anda menekan Tab. Typeahead tidak menghasilkan paragraf dan tidak memiliki fungsi “tuliskan ini untuk saya” — padahal fungsi itulah yang benar-benar akan memasukkan teks yang dihasilkan ke dalam dokumen Anda.
Semua itu tidak menjamin hasil tertentu dari detektor. Kalimat Anda tetap berada di mesin Anda, dan alat ini tidak menyertakan fungsi yang menghasilkan paragraf untuk Anda.