検出ツールは、入力中にどのソフトウェアが開いていたかを知ることができません。完成した文章を読み、単語の選択がどれほど予測しやすいかを推定します。オートコンプリートを使っても、その文章が機械による出力だと特定されるわけではありませんが、検出ツールが人間の文章を誤分類することはあります。

検出ツールが実際に測定しているもの

これらのツールは、文章の統計的な特徴を調べます。たとえば、直前の単語から見た各単語の予測しやすさ、文の長さのばらつき、語彙の広さなどです。言語モデルが生成した文章は、これらの分布の中でも確率の高い中央付近に位置する傾向があります。モデルはそのような文章を生成するように作られているためです。人間の文章は、より自由に変化します。

これは文章に対する判断であり、どのように作られたかの記録ではありません。ドキュメントには、どのキー入力が候補から挿入されたかは記録されません。同様に、たまたま簡潔で規則的な文章になった場合、それを守る仕組みもありません。

研究結果は検出ツールに厳しいものです

StanfordのLiang、Yuksekgonul、Mao、Wu、Zouによる独立評価は、 Patterns 誌に2023年に発表されました。研究では、広く使われている7つの検出ツールを、人間が書いたTOEFLエッセイ91本と、同じく人間が書いた米国の8年生によるエッセイ88本に適用しました。

  • 8年生のエッセイは正確に分類されましたが、約5.1%が誤って検出されました。
  • TOEFLエッセイは正確に分類されませんでした。誤検出率の平均は61.3%でした。
  • 7つの検出ツールすべてが、TOEFLエッセイの19.8%を誤って検出しました。
  • 少なくとも1つの検出ツールは、97.8%を検出しました。

著者らは、この結果を検出ツールが使用する特徴に起因するとしています。限られた語彙の幅や予測しやすい文構造は、検出ツールには機械的に見えることがあります。しかし、それらは第二言語で書かれた文章にもよく見られます。そのため、これらのツールは、統計的に単純な人間の文章を不当に低く評価するおそれがあります。

この研究は2023年のものであり、それ以降に検出ツールも変化しています。それでも変わっていないのは、問題の本質です。これらは確率的な分類器であり、誰かを告発する際に信頼できる文書ごとの誤り率を公開しているものはありません。

では、オートコンプリートはどこに位置付けられますか?

それは、文章のどれだけをあなた自身が書いたかに完全に左右されます。

あなたが行ったこと 検出ツールに見えるもの
自分で作った文の中で、いくつかの単語補完を受け入れたあなた自身の文章であり、構成も語彙もあなたのものです
定型的な文を完成させるため、ときどきフレーズを受け入れたほとんどがあなた自身の文章です。どちらにしても定型的な文は定型的です
チャットボットに段落を書かせて貼り付けた生成された文章です。実際に生成された文章だからです
第二言語で、明らかに自分で書いたそれでも誤って検出される可能性があります。上記を参照してください

重要な違いは、文章を自分で作ったかどうかです。自分の文を候補で完成させる場合は、作成した文章であることに変わりありません。一方、生成された段落を求めて受け入れた場合は違います。

独創性について評価される場合

  • 実際の規則を確認してください。 多くの機関は、スペル、文法、予測入力による補助を認め、生成されたコンテンツを禁止しています。すべてを禁止している機関もあります。どちらの方向でも、思い込みより明文化された規則を優先してください。
  • 変更履歴を残してください。 Google DocsとWordはどちらも変更履歴を保存します。数時間かけて、追加、削除、書き直した文などを重ねて作られたドキュメントは、文章が実際に書かれていった記録です。これはスコアとは異なる種類の証拠であり、スコアでは説明できません。
  • 検出ツールを欺くために書き換えないでください。 スコアを下げるために珍しい単語を使って文を水増しすると、文章の質が下がり、「humanizer」ツールが行うことと区別できなくなります。不正を疑われた場合は、変更履歴が答えになります。
  • スコアは判定ではなく、話し合いを始めるきっかけとして扱ってください。 上記のような誤検出率を考えれば、正直に言って、それがスコアにできるすべてです。

ローカルのオートコンプリートが異なる点

実用上の違いの1つは、検出とは関係ありません。クラウド型の文章アシスタントは、候補を生成するために入力内容をサーバーへ送信します。 Typeahead Typeaheadは、llama.cppを通じてコンパクトなモデルを自分のPC上で実行します。そのため、モデルをダウンロードした後は、入力した内容がどこにも送信されず、接続がまったくない状態でも動作します。

すでに入力している文に続く数語を、キャレットの横に提案します。Tabを押さない限り、何も挿入しません。段落を生成することも、「自分の代わりにこれを書いて」という機能もありません。後者こそ、実際に生成された文章をドキュメントに入れてしまう機能です。

これらの点から、特定の検出ツールの結果が保証されるわけではありません。文章はあなたのマシン上に残り、ツールには段落を代わりに生成する機能がありません。

出典

よくある質問

AI検出ツールは、オートコンプリートを使ったことを判別できますか?
いいえ。検出ツールは、完成した文章の統計的なパターンを分析します。どのソフトウェアが起動していたか、どのキー入力が候補から挿入されたかを記録していません。
AI検出ツールの精度はどの程度ですか?
スコアを証拠として扱うべきではないほど信頼性が低いものです。Stanfordの評価では、 Patterns 2023年に、7つの検出ツールが、人間が書いたTOEFLエッセイを平均61.3%の割合で誤って検出しました。一方、米国の8年生が書いたエッセイを誤って検出した割合は約5.1%でした。
なぜ検出ツールは、英語を母語としない執筆者を頻繁に誤検出するのですか?
検出ツールは、限られた語彙の幅や予測しやすい文構造を機械的な特徴として扱います。しかし、それらは第二言語で十分に文章を書く人に見られる特徴でもあります。偏りは、検出ツールが測定する対象にあります。
予測入力の使用は不正とみなされますか?
それは所属機関の明文化された規則によって異なり、規則もそれぞれ違います。多くの機関は、入力補助ではなく生成されたコンテンツを境界線としています。どちらの方向でも、決めつけずに確認してください。
誤って不正を疑われた場合はどうすればよいですか?
ドキュメントの変更履歴を提示してください。Google DocsとWordはどちらも、ファイルが時間とともにどのように作られたかを記録します。編集履歴は、実際に文章が書かれていった記録です。確率スコアでは、そこまで説明できません。
Typeaheadは段落を代わりに書いてくれますか?
いいえ。入力中の文に続く数語を提案し、Tabを押した場合にのみ挿入します。段落を生成するコマンドはありません。