Un detector no puede saber qué software estaba abierto mientras escribías. Lee el texto terminado y calcula hasta qué punto son predecibles las palabras elegidas. Usar el autocompletado no identifica el texto como generado por una máquina, pero los detectores pueden clasificar erróneamente incluso la escritura humana.
Qué mide realmente un detector
Estas herramientas analizan las propiedades estadísticas del texto: hasta qué punto es predecible cada palabra dadas las anteriores, cuánto varía la longitud de las oraciones y qué amplitud tiene el vocabulario. El texto generado por un modelo de lenguaje tiende a situarse en la zona central de alta probabilidad de esas distribuciones, porque eso es lo que el modelo está diseñado para producir. La escritura humana se desvía más.
Eso es una valoración del texto, no un registro de cómo se produjo. Ningún documento indica qué pulsaciones procedían de una sugerencia y, del mismo modo, nada protege una escritura que casualmente sea sencilla y regular.
La investigación no deja en buen lugar a los detectores
Una evaluación independiente de Liang, Yuksekgonul, Mao, Wu y Zou, de Stanford, se publicó en Patterns en 2023. Probaron siete detectores de uso extendido con 91 ensayos del TOEFL escritos por personas y 88 ensayos de estudiantes estadounidenses de octavo grado, también escritos por personas.
- Los ensayos de octavo grado se clasificaron correctamente: aproximadamente el 5,1 % se marcó por error.
- Los ensayos del TOEFL no: la tasa media de falsos positivos fue del 61,3 %.
- Los siete detectores coincidieron al marcar por error el 19,8 % de los ensayos del TOEFL.
- Al menos un detector marcó el 97,8 % de ellos.
Los autores atribuyen este resultado a las características que utilizan los detectores. Un vocabulario limitado y una estructura de oración predecible pueden parecer propias de una máquina para un detector, pero también son habituales en textos escritos en un segundo idioma. Por tanto, estas herramientas corren el riesgo de penalizar la escritura humana por su sencillez estadística.
Ese estudio es de 2023 y los detectores han cambiado desde entonces. Lo que no ha cambiado es la naturaleza del problema: son clasificadores probabilísticos y ninguno publica una tasa de error por documento en la que puedas basarte para acusar a alguien.
Entonces, ¿dónde encaja el autocompletado?
Depende por completo de cuánto del texto sea tuyo.
| Lo que hiciste | Lo que ve el detector |
|---|---|
| Aceptaste algunas sugerencias de palabras para completar oraciones que habías redactado | Tu escritura, con tu estructura y tu vocabulario |
| Aceptaste de vez en cuando una frase para terminar una oración rutinaria | Principalmente tu escritura; las oraciones rutinarias son rutinarias en cualquier caso |
| Pediste a un chatbot que escribiera el párrafo y lo pegaste | Texto generado, porque es texto generado |
| Lo escribiste tú mismo, de forma sencilla, en un segundo idioma | Es posible que aun así se marque por error; consulta lo anterior |
La distinción relevante es si redactaste tú mismo el texto. Terminar tu propia oración con una sugerencia conserva tu redacción, mientras que pedir y aceptar un párrafo generado no lo hace.
Si se evalúa tu originalidad
- Averigua cuál es la norma exacta. Muchas instituciones permiten la asistencia ortográfica, gramatical y de texto predictivo, y prohíben el contenido generado. Algunas lo prohíben todo. Una norma escrita vale más que una suposición en cualquiera de los dos sentidos.
- Conserva el historial de versiones. Google Docs y Word guardan uno. Un documento que creció durante horas, con adiciones, eliminaciones y oraciones escritas dos veces, demuestra que la escritura tuvo lugar — un tipo de evidencia distinto de una puntuación y al que una puntuación no puede responder.
- No reescribas el texto para engañar a un detector. Rellenar las oraciones con palabras inusuales para bajar una puntuación empeora tu escritura y no se distingue de lo que hace una herramienta “humanizer”. Si te acusan, la respuesta está en el historial de versiones.
- Considera una puntuación como el punto de partida de una conversación, no como un veredicto. Con tasas de falsos positivos como las anteriores, eso es todo lo que honestamente puede ser.
En qué se diferencia un autocompletado local
Una diferencia práctica no tiene nada que ver con la detección. Los asistentes de escritura en la nube envían a un servidor lo que escribes para generar sus sugerencias. Typeahead ejecuta un modelo compacto en tu propio PC mediante llama.cpp, así que, una vez descargado un modelo, nada de lo que escribes se transmite a ningún sitio y funciona sin conexión alguna.
Sugiere las siguientes palabras de la oración que ya estás escribiendo, junto al cursor, y no inserta nada a menos que pulses Tab. No genera párrafos ni tiene una función de “escribe esto por mí”, que es precisamente la característica que pondría texto generado en tu documento.
Nada de eso garantiza un resultado concreto en un detector. Tus oraciones permanecen en tu equipo y la herramienta no incluye ninguna función que genere párrafos por ti.