# AI生成テキスト検知 LLM が生成したテキストを人間執筆テキストと判別する技術。AIGC(AI-generated content)検知とも呼ばれ、学術論文の不正検知や、二次創作・レビューなどの投稿プラットフォームでの無断 AI 生成コンテンツの検知に用いられる。 ## 定義 AI生成テキスト検知とは、与えられたテキストがLLMによって生成された確率を推定するタスクである。代表的なアプローチとして、LLMを用いて単語出現確率を推定する[[パープレキシティ]]ベース手法と、n-gram統計量を特徴量とする伝統的な機械学習分類器(TF-IDF + SVM等)がある(Source: [[AI生成テキスト分類器]])。 ## 横断的知見 - パープレキシティベース手法(既存LLMで単語出現確率のTop-N順位を見る)は理論的には妥当に見えるが、実運用では偽陽性・偽陰性が多く、推論コストの高さ・モデル間汎化性能の低さ・closed-weightモデルとの統合困難という複合的な問題があり、実用性に乏しい(Source: [[AI生成テキスト分類器]])。 - 対照的に、`TF-IDF` + `LinearSVC` という単純な伝統的機械学習パイプラインは、文単位で約85%の精度・80%超のF1を達成し、訓練データに含まれない未知のLLM(Claude Sonnet 4.6、GPT 5.2等)に対しても約70%以上の検知率を示す汎化性能を持つ。単一モデルでの分類より、複数モデルそれぞれに対する二値分類器を多数決で統合する方式の方が、8クラス同時分類(精度約50%)よりも大幅に高精度である(Source: [[AI生成テキスト分類器]])。 - 実データ(Lofterの高閲覧数長文投稿1万件)での偽陽性率は閾値60%で0.04%、70%で0.01%未満と極めて低く抑えられる一方、同プラットフォームのトレンド記事では32.22%がAIスコア50%超と判定され、無断AI生成コンテンツが広範に存在する可能性が示唆されている(Source: [[AI生成テキスト分類器]])。 - 翻訳往復(中→英→中)や「AI感を減らせ」というプロンプトによる回避策は、検知スコアを軽微に下げる(89.9%→79〜86%程度)のみで、実用上の回避手段としては機能しない(Source: [[AI生成テキスト分類器]])。 ## 未解決の問い - TF-IDF+SVMベースの検知器は、著者以外の独立データセットや、より新しい・より多様なLLMに対してどこまで汎化するか。 - 検知器の特徴量(SVMが重視するn-gram)を意図的に破壊するルールベースの回避手法は実際にどの程度有効か(著者は未検証と明言)。 - 学術論文など、Lofter以外のドメイン(異なる文体・言語)への転移性能はどうか。 ## 関連 - [[AI生成テキスト分類器]] — 本概念の主要な出典となったブログ記事。TF-IDF+SVMの実装詳細と評価結果を含む。 - [[AITextDetector]] — 実装・オンラインデモ。 - [[lyc8503]] — 開発者。 - [[パープレキシティ]] — 対比される既存アプローチ(未作成。将来的な参照候補)。 ## 出典 - [[AI生成テキスト分類器]](https://blog.lyc8503.net/en/post/llm-classifier/)