Maat ScanMaat Scan

技術解説

いたちごっこ:なぜAI画像検出はますます難しくなるのか

Maat Scan · 2026年5月26日

ベンチマークで99%の精度を誇る検出器が、2024年にSNSから収集した実際のディープフェイクに対しては 62%未満まで落ち込みました。1これは測定誤差でも特殊事例でもありません。この分野が直面している構造的な問題であり、 毎年拡大し続けています。

検出ツールは何を見ているか

AI生成画像には統計的な痕跡が残ります。 拡散モデルは高周波数領域に特有のパターンを生み出し、フーリエ解析で検出できます。 本物の写真には特定の空間分布を持つセンサーノイズがありますが、 AI画像はどのカメラのセンサープロファイルとも一致しない「清潔すぎる」仕上がりになる傾向があります。 中心の被写体が完璧に見えても、周辺部には意味的な矛盾が残ることもあります。

検出モデルはこれらのパターンを学習します。 問題は、そのパターンが新しい生成モデルごとに変わることです。 Stable Diffusion 1.5のアーティファクトを見分けるために訓練されたモデルは、 異なるアーキテクチャと異なる学習データを持つFlux.1に対しては精度が下がる場合があります。2主要な新モデルが登場するたびに、難易度のカーブはリセットされます。

ベンチマークの罠

ディープフェイク検出の精度数値は、ほぼ必ず既知の生成モデルから集めた学術データセットで 測定されます。多くの場合、訓練に使用したものと同じモデルです。 その数値は本物ですが、実際の運用性能を予測しません。

2024年にSNSで実際に流通したコンテンツから構築されたベンチマーク「Deepfake-Eval-2024」は、 そのギャップの大きさを示しました。 最先端のオープンソース検出器は、標準ベンチマークと比較してAUCが画像で48%、動画で50%低下しました。1商用ツールは健闘し、最上位のものは実世界コンテンツで82%を達成しましたが、 それでも実験室の数値には遠く及びません。

低下の原因は二つあります。一つは、SNSの再エンコード処理が検出器の頼みとする 周波数ドメインのシグナルを除去することです。 プラットフォームのパイプラインを二度通過したJPEGは元の画像と異なる様相を示します。 もう一つは、新しい生成モデルが検出モデルを再訓練できる速度よりも早く登場し続けることです。

なぜギャップは縮まらないのか

ETH チューリッヒの研究者が2025年に発表した論文は、AI画像検出が構造的に勝ち目のない戦いだと 主張しています。努力が足りないのではなく、生成器と識別器の学習が相互作用する仕組みによるものです。3分析によると、検出はデータセットの複雑さの両極端で最も困難になります。 単純なデータセットでは生成器がほぼ完璧に学習し、検出できる残差エラーが残りません。 一方、多様性の高いデータセットでは、多様性そのものが不完全さを隠します。 中程度の複雑さだけが検出に有利な条件を作りますが、モデルが進歩するにつれてこの窓は狭まります。

敵対的攻撃はこの問題をさらに深刻にします。 AI生成画像に小さく不可視な摂動を加えると、検出器がそれを本物と判定するよう誘導できることが 研究で示されています。この攻撃はJPEG圧縮やリサイズなどの一般的な後処理を経ても機能します。4検出器の内部構造にアクセスする必要もなく、ブラックボックスとして扱うだけで 複数の商用ツールを同時に回避できます。

透かしという別のアプローチ

検出は生成モデルが残した痕跡を読もうとします。 透かし(ウォーターマーク)は逆のアプローチを取ります。 生成時に後処理でも消えないシグナルを埋め込み、後から確認できるようにするのです。

GoogleのSynthIDは、Googleのツールで生成された画像に不可視のパターンを埋め込みます。 2026年初頭時点で、100億件以上のコンテンツにSynthIDの透かしが入っています。5クロップ、色調整、スクリーンキャプチャにも耐えます。 限界は対応範囲です。OpenAI、Midjourney、Stability AI、Fluxなど ほとんどの主要生成モデルはSynthIDを使用していないため、 それらが生成したコンテンツの検出には使えません。

C2PA来歴標準は異なる仕組みで機能します。ピクセルにシグナルを隠すのではなく、 ファイルにカメラまたはソフトウェアが署名した暗号証明書を添付します。 これはAI生成かどうかではなく、どこから来たかを証明するものです。 二つのアプローチは補完し合います。 信頼できるハードウェアからの有効なC2PAクレデンシャルと、 検出ツールの高い真正性スコアを組み合わせると、単独よりも格段に強い証拠になります。 ただし、C2PAの記事で解説したとおり、ほとんどのプラットフォームはアップロード時にC2PAメタデータを削除しています。

現実的な防御とは何か

いたちごっこというフレームは、どちらかの側がいつか勝つことを示唆します。 おそらく、それは正しいモデルではありません。 特定の既知の生成モデルに対する検出精度は非常に高くなりえます。 問題は、現役で使われている生成モデルの種類が増え続け、 昨年の出力で訓練された検出モデルは昨年の偽物しか捕まえられないことです。

より有用なフレームは、「検出は欺きのコストを上げる」というものです。 自動チェックを通過した画像が信頼できるものになるわけではありませんが、 チェックに失敗した画像は早期警告を提供します。 検出アルゴリズム、来歴メタデータ、重要なコンテンツへの人手によるレビューを重ねることで、 単一の手法よりも良い結果が得られます。

2026年8月から段階的施行が始まるEU AI法の開示要件は、 検出をすべて下流のツールに任せるのではなく、 生成器自身に自分の出力を標識させることを求めます。 この責任の移転は、分類器の精度向上よりも実際には大きな意味を持つかもしれません。

出典

  1. Zheng et al., "Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024," arXiv:2503.02857, 2025年3月。
  2. arXiv:2602.07814, "Detection Accuracy of Flux Dev Images," 2026年(Fluxモデルの検出率18〜30%)。
  3. Aczel & Vettor, "The Unwinnable Arms Race of AI Image Detection," arXiv:2509.21135, 2025年9月。
  4. Jia et al., "Vulnerabilities in AI-generated Image Detection: The Challenge of Adversarial Attacks," arXiv:2407.20836, 2024年7月。
  5. Google DeepMind, "SynthID: Watermarking and Detecting AI-Generated Content," deepmind.google, 2025〜2026年。