技術解説
AI画像生成の仕組み——拡散モデルをわかりやすく解説
Maat Scan · 2026年5月5日
2022年、テキストプロンプトからフォトリアルな顔を生成するには ハイエンドGPUと丁寧なプロンプト調整、そして約1分の計算時間が必要でした。 2026年の現在、同じ作業がクラウドAPIで4.5秒で完了します。1これほどの変化をもたらした仕組みを理解することは、 AI生成画像を検出しようとするすべての人にとって意味があります。
核心にあるアイデア:ノイズを取り除く学習
拡散モデルはゼロから絵を描くことを学ぶわけではありません。 ノイズを取り除くことを学びます。
学習中、モデルには本物の画像が段階的にランダムノイズで壊されていく過程が示されます。 最終的に何も認識できない純粋なノイズになるまで続きます。 モデルの役割は、この逆を学ぶことです。 少しノイズが乗った画像が与えられたとき、少しだけノイズが少ない版を予測する。 これを何百ステップも繰り返せば、純粋なノイズから始めて コヒーレントな画像へと逆向きに歩いていくことができます。
2020年にHoらが発表したDDPM論文(Denoising Diffusion Probabilistic Models)が この手法を形式化し、それ以前の5年間画像生成を支配していたGANよりも 高品質な出力が得られることを示しました。2GANはジェネレーターとディスクリミネーターを競わせる方式でしたが、 学習が不安定になりやすく、モード崩壊と呼ばれる 出力の多様性が失われる問題がありました。 拡散モデルはこれを、小さなノイズ除去ステップの連鎖として解くことで回避しています。
テキストはどうやって画像に反映されるのか
ノイズ除去だけを学んだモデルは、学習データに似た画像をランダムに生成します。 テキストで制御するには、もう一つの仕組みが必要です。
主な手法は、CLIPや言語モデルなどのテキストエンコーダーを使って プロンプトを数値表現に変換し、それをノイズ除去の各ステップに注入することです。 この数値表現がノイズ除去の方向をテキストが示す視覚概念へと偏らせます。 モデルは何十億もの画像・テキストペアで学習する中で、 どのテキストトークンがどの視覚的特徴と対応するかを覚えてきました。
Stable Diffusionの学習に使われたLAION-5Bは、 ウェブから収集した約50億枚の画像・テキストペアから成るデータセットです。3生成画像がストックフォトのように見えることがあるのは、 モデルが何百万枚ものストックフォトから学んでいるからです。 インターネット上の偏り——特定の人口統計、美的感覚、視覚スタイルの偏重——も そのまま反映されています。
潜在拡散:なぜ速くなったのか
初期の拡散モデルはピクセル空間で直接ノイズ除去を行っていました。 512×512の画像には786,432個のピクセル値があります。 それに対して何百ものステップを実行するのは計算コストが高く、実用的ではありませんでした。
2022年にStable Diffusionとともに登場した潜在拡散モデルは、 エンコーダーを使って画像をまず小さな「潜在表現」に圧縮することで問題を解決しました。4ノイズ除去ステップはこの圧縮された空間(典型的には64×64)で行われ、 最後にデコーダーが元の解像度に戻します。 この圧縮によって計算量が大幅に削減され、コンシューマー向けGPUでの実行が可能になり、 やがてクラウドAPIでの10秒以下での生成も実現しました。
主な生成モデルとその違い
2025〜2026年の主要な画像生成ツールはいずれも拡散の基盤を共有していますが、 アーキテクチャ、学習方法、設計思想はそれぞれ異なります。
Stable Diffusion(Stability AI)
オープンソースでローカル実行が可能です。LoRAによるファインチューニングや ControlNetによるレイアウト制御など、幅広いカスタマイズに対応しています。 3.5 Largeは81億パラメータを持ち、画像トークンとテキストトークンを 共同処理するMMDiT(Multimodal Diffusion Transformer)アーキテクチャを採用しています。
Midjourney
独自のアーキテクチャを持つクローズドソースのサービスです。 美的な一貫性と写真品質の高さで知られていますが、 外部からの検査やカスタマイズには対応していません。
DALL-E 3(OpenAI)
ChatGPTとの統合が深く、プロンプトの書き直しとコンテンツフィルタリングが組み込まれています。 画像内に読めるテキストを描画する能力が他のモデルより安定しています。
Flux(Black Forest Labs)
標準的なDDPMではなくフローマッチングをトランスフォーマー基盤と組み合わせています。 Flux.1 Proは約120億パラメータを持ちます。52026年現在、プロンプトの忠実度とテキスト描画でベンチマーク首位に立っており、 検出ツールが最も捕捉しにくいモデルでもあります。 2026年2月の研究では、古い世代のジェネレーターの80〜95%と比べ、 正確に識別された割合はわずか18〜30%でした。6
検出にとっての意味
この生成プロセスを理解すると、なぜ検出が技術的に難しいのかがわかります。 手で描いた筆跡もコピーペーストされた領域もなく、 画像は圧縮された特徴空間の中で学習された統計的パターンから組み立てられます。 残るアーティファクトは統計的なもの——テクスチャの周波数分布の偏り、 物理的制約からのわずかなジオメトリのずれ、 実際のカメラ光学系が生み出す微細なムラを欠いた肌のテクスチャです。
新しいモデルアーキテクチャが特徴の処理やデコード方法を変えると、 この統計的なシグネチャも変わります。 あるモデルファミリーで学習した検出システムは、 別のファミリーには効かないことがあります。 アーキテクチャの改良は意図せず、前世代を検出可能にしていたパターンからの逸脱でもあります。
これは検出精度の向上だけでは解決できない問題でもあります。 生成時点での暗号化証明を埋め込むC2PAのような来歴標準は、 異なる部分に取り組んでいます。 「AI生成らしく見えるか」ではなく「どこから来たか検証できるか」という問いです。 どちらのアプローチも、もう一方なしには機能しません。
出典
- freeacademy.ai, "Midjourney vs DALL-E vs Stable Diffusion vs Flux 2026 Comparison," Freeacademy.ai, 2026年。
- Ho et al., "Denoising Diffusion Probabilistic Models," arXiv 2006.11239, 2020年。
- Schuhmann et al., "LAION-5B: An open large-scale dataset for training next generation image-text models," arXiv 2210.08402, 2022年。
- Rombach et al., "High-Resolution Image Synthesis with Latent Diffusion Models," CVPR, 2022年。
- Anakin.ai, "FLUX vs MidJourney vs DALL-E vs Stable Diffusion," Anakin.ai, 2025年。
- arXiv 2602.07814, "Open-Source AI-Generated Image Detection Benchmark," 2026年2月。
