技術解説
周波数解析:研究者がピクセルレベルでAI画像を検出する方法
Maat Scan · 2026年6月2日
2020年、ハノーファー大学の研究者がGAN生成の顔画像をフーリエ変換にかけ、 ピクセルだけでは絶対に見えないものを発見しました。 周波数スペクトルに、等間隔に並ぶスパイクの格子。 自然な画像には現れない規則性で、肉眼では見えません。1この発見が、今日世界中のツールに使われる検出手法の出発点になりました。 それから4年、この分野ははるかに複雑になっています。
すべての画像の下にある周波数の層
デジタル画像はピクセル値の格子です。 しかし同時に、異なる空間周波数の波パターンの重ね合わせとしても表現できます。 「空間周波数」とは、画像上で輝度が変化する速さのこと。 髪の毛や布地の細かいテクスチャは高周波、空のグラデーションは低周波です。
離散フーリエ変換(DFT)はピクセル空間の画像をこの周波数表現に変換します。 本物の写真は特徴的な1/fべき乗則に従います。 低周波が支配的で、高周波に向かってエネルギーがなだらかに低下する分布です。2これは物理的必然です。自然の景色には統計的な規則性があり、カメラはそれを忠実に記録します。 AI生成器は画像の見た目を模倣するよう学習されますが、 その生成プロセス自体が異なる統計的痕跡を残します。
GANがチェッカーボードを残す理由
GANの生成器は、低解像度の潜在コードからフルサイズの出力を作るために 転置畳み込み(トランスポーズド・コンボリューション)を使います。 この演算には構造的な欠陥があります。 カーネルが出力全体に対して不均一に重なり合うため、 等間隔で繰り返されるアーティファクトが生じるのです。 ピクセル空間では薄いグリッドとして、DFTでは予測可能な座標の離散スパイクとして現れます。1
ピクセルではなくスペクトルで分類器を訓練すると、驚くほど効果的でした。 2024年のテストでは、周波数ドメインのCNNがGAN生成画像の検出で精度92.8%、AUC 0.95を達成し、 同じタスクでピクセルベースの分類器を上回りました。2GANのアーキテクチャが違えばスパイクの位置も違うため、 周波数スペクトルは生成器のフィンガープリントとしても機能します。 「偽物か本物か」だけでなく「どのモデルが作ったか」も特定できる場合があります。
拡散モデルが問題を変えた
拡散モデルは転置畳み込みを使わないため、チェッカーボードのスパイクが生じません。 GANアーティファクトを捕らえるよう訓練された検出ツールは、 拡散モデル生成コンテンツの多くを見逃します。 Stable Diffusion、Midjourney、DALL-EがGANに取って代わった時期に、 このギャップは深刻な問題でした。
拡散モデルも痕跡を残しますが、より微細です。 拡散モデル生成画像は、低周波から高周波にかけて実写との統計的差異が 段階的に大きくなることが研究で明らかになっています。3高周波コンテンツが体系的に少ない。 画像を生成する逆拡散プロセスが、実際のカメラセンサーのファイングレインなノイズ統計を 完全には再現できないからです。
2024年に提案されたF²C(Frequency Forgery Clue)は、 フーリエスペクトルに重み付きフィルタを適用し、識別力の低い帯域を抑制して 高識別帯域を増幅することでこれに対処しました。32025年のFreqCrossは、Stable Diffusion 3.5生成画像が正規化周波数0.1〜0.4の帯域で 特徴的なスペクトルシグネチャを示すことを発見しています。4本物の写真はこの帯域に異なる分布を持ちます。
JPEGが証拠を消す
JPEG圧縮はそれ自体が周波数ドメインの処理です。 離散コサイン変換(DCT)で画像を周波数帯域に分解し、 人間の視覚が最も感知しにくい高周波情報を削除します。 検出器が微妙な高周波ミスマッチを探しているとき、JPEGはまさにそのシグナルを先に消します。
GANのチェッカーボードスパイクは軽い圧縮なら一部が残ります。 コーデックが特定して狙う位置ではないためです。 拡散モデルのアーティファクトはより難しい。 検出を可能にしていた高周波統計ミスマッチが、 JPEGが最初に削除するものだからです。 SNSで共有された画像は、ユーザーが見るまでに最低2回再エンコードされます。 これが、ラボのベンチマークと実世界での精度の差の多くを説明しています。 詳しくはいたちごっこの記事を参照してください。
周波数フィンガープリンティング
検出は二値の問いです。本物か偽物か。 フィンガープリンティングはさらに踏み込みます。 各モデルのアーキテクチャが固有のスペクトルパターンを残すため、 複数の生成器で訓練された分類器は、 クロップや軽い編集が加えられた後でも、 どの特定のツールが画像を生成したかを特定できる場合があります。
これは法的な文脈で意味を持ちます。 改ざんされた画像が選挙キャンペーンや法廷に現れたとき、 それがMidjourney v7なのかFlux.1なのかカスタムのファインチューンモデルなのかを知ることは、 二値の真偽ラベルより有用なことがほとんどです。
限界も同じです。 新しいモデルは本物の写真との周波数乖離を最小化する分布で訓練されるようになっています。 Flux.1はすでにStable Diffusion 1.5と比べて高周波の偏差が格段に小さく、 それが検出率18〜30%という数字につながっています。旧モデルでは70%超でした。5周波数アプローチは依然として最も強力なシグナルのひとつですが、 安定したものではありません。新しい生成器のリリースから 訓練済みの検出器が対応するまでの窓は、日単位ではなく月単位で計られます。
出典
- Zhang et al., "Detecting and Simulating Artifacts in GAN Fake Images," arXiv:1907.06515, 2019年(チェッカーボード周波数解析の基礎研究)。
- Szeghalmy & Fazekas, "Discrete Fourier Transform in Unmasking Deepfake Images," MDPI Information 15(11):711, 2024年11月。
- "Enhancing Frequency Forgery Clues for Diffusion-Generated Image Detection," arXiv:2511.00429, 2024年11月。
- Li et al., "FreqCross: A Multi-Modal Frequency-Spatial Fusion Network for Robust Detection of Stable Diffusion 3.5 Generated Images," arXiv:2507.02995, 2025年7月。
- arXiv:2602.07814, "Detection Accuracy of Flux Dev Images," 2026年(Flux.1の検出率18〜30%)。
