Un détecteur ne peut pas savoir quel logiciel était ouvert pendant que vous tapiez. Il lit le texte final et estime à quel point les choix de mots sont prévisibles. L’utilisation de l’autocomplétion ne permet pas d’identifier le texte comme une production automatique, mais les détecteurs peuvent tout de même classer à tort un texte humain.
Ce qu’un détecteur mesure réellement
Ces outils examinent les propriétés statistiques du texte : la prévisibilité de chaque mot compte tenu des mots qui le précèdent, la variation de la longueur des phrases et l’étendue du vocabulaire. Le texte généré par un modèle de langage tend à se situer au milieu, dans la zone à forte probabilité de ces distributions, car c’est ce que le modèle est conçu pour produire. L’écriture humaine est plus irrégulière.
Il s’agit d’un jugement sur le texte, et non d’un relevé de la manière dont il a été produit. Rien dans un document n’indique quelles touches provenaient d’une suggestion — et, inversement, rien ne protège un texte qui se trouve être simple et régulier.
Les recherches ne sont pas favorables aux détecteurs
Une évaluation indépendante menée par Liang, Yuksekgonul, Mao, Wu et Zou à Stanford a été publiée dans Patterns en 2023. Ils ont fait passer sept détecteurs largement utilisés sur 91 essais du TOEFL rédigés par des personnes et 88 essais rédigés par des élèves américains de quatrième, eux aussi écrits par des personnes.
- Les essais de quatrième ont été classés correctement — environ 5,1 % ont été signalés à tort.
- Ce n’était pas le cas des essais du TOEFL : le taux moyen de faux positifs était de 61,3 %.
- Les sept détecteurs ont tous signalé à tort 19,8 % des essais du TOEFL.
- Au moins un détecteur en a signalé 97,8 %.
Les auteurs attribuent ce résultat aux caractéristiques utilisées par les détecteurs. Un vocabulaire limité et une structure de phrase prévisible peuvent sembler générés par une machine pour un détecteur, mais ils sont aussi fréquents dans les textes produits dans une langue seconde. Les outils risquent donc de pénaliser une rédaction humaine en raison de sa simplicité statistique.
Cette étude date de 2023 et les détecteurs ont évolué depuis. Ce qui n’a pas changé, c’est la nature du problème : il s’agit de classificateurs probabilistes, et aucun ne publie un taux d’erreur par document sur lequel vous pourriez vous appuyer pour accuser quelqu’un.
Alors, quelle est la place de l’autocomplétion ?
Tout dépend de la part du texte qui vient de vous.
| Ce que vous avez fait | Ce que voit le détecteur |
|---|---|
| Accepté quelques complétions de mots dans des phrases que vous aviez composées | Votre rédaction, avec votre structure et votre vocabulaire |
| Accepté de temps à autre une expression pour terminer une phrase courante | Surtout votre rédaction ; les phrases courantes restent courantes dans tous les cas |
| Demandé à un chatbot de rédiger le paragraphe, puis l’avoir collé | Du texte généré, puisqu’il s’agit de texte généré |
| Rédigé vous-même un texte simple dans une langue seconde | Peut tout de même être signalé — voir ci-dessus |
La distinction pertinente est de savoir si vous avez composé le texte vous-même. Terminer votre propre phrase avec une suggestion préserve votre composition, tandis que demander et accepter un paragraphe généré ne la préserve pas.
Si votre originalité fait l’objet d’une évaluation
- Renseignez-vous sur la règle réellement applicable. De nombreux établissements autorisent l’aide à l’orthographe, à la grammaire et au texte prédictif, et interdisent le contenu généré. Certains interdisent tout. Une règle écrite vaut mieux qu’une supposition dans un sens comme dans l’autre.
- Conservez l’historique de vos versions. Google Docs et Word en conservent tous deux un. Un document qui s’est développé pendant des heures, avec des ajouts, des suppressions et des phrases rédigées deux fois, témoigne de la rédaction en cours — c’est un type de preuve différent d’un score, auquel un score ne peut pas répondre.
- Ne réécrivez pas votre texte pour tromper un détecteur. Ajouter des mots inhabituels aux phrases pour faire baisser un score dégrade votre rédaction et ne se distingue pas de ce que fait un outil « humanizer ». Si vous êtes accusé, l’historique des versions est la réponse.
- Considérez un score comme le point de départ d’une discussion, pas comme un verdict. Compte tenu des taux de faux positifs indiqués ci-dessus, c’est tout ce qu’il peut honnêtement être.
En quoi une autocomplétion locale diffère
Une différence pratique n’a rien à voir avec la détection. Les assistants d’écriture dans le cloud envoient ce que vous tapez à un serveur afin de générer leurs suggestions. Typeahead Typeahead exécute un modèle compact sur votre propre PC grâce à llama.cpp : une fois le modèle téléchargé, rien de ce que vous écrivez n’est transmis où que ce soit et l’outil fonctionne même sans aucune connexion.
Il suggère les quelques mots suivants de la phrase que vous êtes déjà en train d’écrire, à côté du curseur, et n’insère rien sauf si vous appuyez sur Tab. Il ne génère pas de paragraphes et ne possède aucune fonction « écris ceci à ma place » — c’est précisément cette fonction qui placerait réellement du texte généré dans votre document.
Rien de tout cela ne garantit un résultat particulier avec un détecteur. Vos phrases restent sur votre machine et l’outil n’inclut aucune fonction qui génère des paragraphes à votre place.