同じお題と同じプロンプトを使って比較してきた「生成AI比較観測」。
これまでの都道府県比較では、FLUX.2 [pro]は人物表現や画面のまとまり、写実感やアニメ調の統一感では強さを見せる一方、実在する観光地の固有形状や位置関係を参照なしで正確に再現する場面では苦戦することがあるという傾向が見えてきました。
そこで今回は番外編として、
FLUX.2 [pro]へ正しい参照画像を渡したら、どこまで改善するのか
を観測します。
通常回のような5環境同時比較ではなく、過去回でFLUX.2 [pro]が実際に生成した画像を基準に、同じプロンプトへ参照画像だけを追加して再生成します。
今回は特に、参照なしで観光地再現に弱点が出た2つのお題を使いました。
- 第4回:宮崎県・高千穂峡
- 第10回:和歌山県・那智の滝と那智山青岸渡寺三重塔
採点をやり直すことよりも、参照画像の有無でFLUX.2 [pro]の挙動がどう変化するかを見ることを目的にしています。
参照を渡せば、本当に強くなるのか。
それとも、構図まで参照に引っ張られてしまうのか。
今回も観測していきます。
今回の観測条件
今回使用した生成環境は、
FLUX.2 [pro] / BFL公式Playground
です。
基本条件は過去回と同じプロンプトを使用し、参照画像の有無だけを変更しました。
観測ポイントは主に以下です。
- 実在観光地の固有形状が改善するか
- 建築物の構造が正しくなるか
- 滝や建築物の位置関係が改善するか
- 元の構図を維持するか
- 参照画像の構図へ強く引っ張られるか
- 参照を増やしたとき、効き方が変わるか
また途中で、BFL公式Playgroundにある
Prompt upsampling
Expands your prompt into a richer description before generating. On by default.
のON / OFFによる挙動差も軽く確認しました。
1. 高千穂峡
元のFLUX.2 [pro]

第4回のFLUX.2 [pro]は、人物の横顔、その視線の先にある滝、曇りの昼、アニメ調という条件はかなり素直に反映していました。
一方で、高千穂峡の再現には大きなズレがありました。
- 柱状節理は描かれている
- 緑の水面もある
- 滝もある
- しかし峡谷が細長く奥へ続く形ではない
- 巨大な円形の滝壺を正面から眺めるような景観になった
元回では39 / 50点。
特に「観光地・地域性」が6 / 10点となり、FLUX.2 [pro]の弱点が分かりやすく出た回でした。
参照画像1枚
最初に、横長の高千穂峡実写写真を1枚だけ参照として追加しました。
参照画像には、
- 細い峡谷
- 両側の岩壁
- 緑色の水面
- 左寄りの滝
- 奥へ続く水路
といった、高千穂峡らしい地形情報が入っています。
同じプロンプトのまま、参照画像だけを追加して生成しました。

観測結果
まず目立ったのは、元画像にあった巨大な円形滝壺感がかなり弱くなったことです。
左右に切り立った岩壁が入り、水面も高千穂峡らしい緑色へ寄り、柱状節理も明瞭になりました。
一方で、画面構成そのものは元のFLUX.2 [pro]から大きく変わっていません。
- 左手前に大きな人物
- 中央付近に滝
- 手前に広い水面
- 左右に岩壁
という骨格はかなり維持されています。
参照写真そのものは、より狭い峡谷を奥へ抜く構図でした。
つまりこの1枚参照では、
参照画像から高千穂峡の景観特徴は吸収したが、構図は元のプロンプト解釈をかなり維持した
ように見えます。
この時点の印象
参照画像をコピーしたというより、
「高千穂峡はこういう場所」という情報を補って、元の構図へ再構成した
という挙動です。
これは制作用途ではかなり扱いやすい反応でもあります。
参照画像2枚
次に、縦長の高千穂峡写真を追加しました。
2枚目は、
- 狭い峡谷
- 左側の滝
- 奥へ伸びる水路
- 縦方向の深い地形
がより分かりやすい写真です。
横長+縦長の2枚を参照にして、再び同じプロンプトで生成しました。

観測結果
今度は明確に構図まで変化しました。
1枚参照版と比べると、
- 人物が小さくなった
- 峡谷が奥へ細長く伸びる
- 滝が左側へ移動
- 水面も細長くなった
- 手前に柵が追加
- 「展望地点から峡谷を見る」構図へ変化
となっています。
特に大きいのは、縦長参照にあった
狭い峡谷+左の滝+奥へ抜ける水路
という構造を、16:9の横長画面へ再構成したことです。
縦長写真をそのまま横へ伸ばしたのではなく、地形の骨格を横長構図へ置き換えています。
参照1枚と2枚の差
今回の高千穂峡では、かなり分かりやすい差が出ました。
参照1枚
- 景観特徴は改善
- 構図は元のFLUX.2 [pro]をかなり維持
参照2枚
- 景観特徴がさらに強化
- 構図まで参照側の影響を強く受ける
同じような参照をさらに増やしても、ここから先は変化が小さくなりそうです。
高千穂峡については、2枚で十分に傾向が見えました。
2. 那智の滝と那智山青岸渡寺三重塔
元のFLUX.2 [pro]

第10回のFLUX.2 [pro]は、全体として非常に完成度の高い一枚でした。
- 人物は自然に立ち止まっている
- 名所の方向を見ている
- 晴れた昼
- 写実寄り
- 光、植生、岩肌、滝の質感も良好
しかし観光地再現では、はっきりしたズレがありました。
- 三重塔が4層に見える
- 滝と塔の距離が実景よりかなり近い
- 画面全体がややドラマチックに再構成されている
元回では45 / 50点。
「観光地・地域性」は7 / 10点でした。
参照画像
今回は、那智の滝と青岸渡寺三重塔の代表景観が分かる実写写真を1枚使用しました。
この1枚には、
- 三重塔が3層であること
- 各層の回廊・高欄
- 相輪
- 朱色の塔
- 滝が塔の右奥にあること
- 塔と滝の距離感
- 山との位置関係
まで、かなり多くの正解情報が入っています。
高千穂峡よりも、参照画像そのものが「完成された景観構図」になっています。
参照あり生成

観測結果
これはかなり分かりやすく改善しました。
まず、
塔がちゃんと3層として読める
ようになっています。
さらに、
- 塔は左側
- 滝は右奥
- 滝と塔の距離が広がった
- 実景らしい位置関係へ近づいた
- 山全体を含めた構図になった
と、元画像で減点対象だった部分がかなり補正されました。
高千穂峡の1枚参照版とは違い、今回は構図そのものもかなり参照写真へ寄っています。
参照画像が、
「塔・滝・山の位置関係まで含めた完成された一枚」
だったため、景観資料だけでなく画面設計としても強く使われたように見えます。
一方で、人物は参照写真に存在しません。
生成結果では人物を新たに配置し、名所を見る観光客として自然に組み込んでいます。
つまり、
背景構図:参照をかなり強く踏襲
人物配置:プロンプトに合わせて追加設計
という反応です。
単純なコピーだけではなく、参照に存在しない要素については生成側で補っています。
3. Prompt upsamplingをOFFにするとどうなるか
BFL公式Playgroundでは、Prompt upsamplingが初期状態でONになっています。
説明は、
Expands your prompt into a richer description before generating.
というものです。
そこで、参照画像を使用した状態でPrompt upsamplingをOFFにした生成も確認しました。

観測結果
背景については、引き続き参照画像の影響が非常に強く出ています。
- 三重塔は3層
- 塔と滝の位置関係も実景寄り
- 山の広がりも参照に近い
- 写実的な観光景観として自然
一方で、明確な変化もありました。
観光客が2人になりました。
元プロンプトでは、
Include one tourist
と明確に1人指定しています。
しかしOFF版では人物が2人に増えています。
FLUX.2 Kleinでも、過去の比較で人物や要素を増やす挙動が何度か見られました。
今回1例だけで、
「Prompt upsamplingをOFFにするとKlein化する」
とまでは言えません。
ただし、
upsampling ON時より、FLUX系本来の自由な解釈が表面に出やすくなる可能性
は少し感じられる結果でした。
Prompt upsamplingは、単に文章を華やかにするだけではなく、
細かな言語条件を生成向けに整理する役割も持っているのではないか
という仮説も出てきます。
今後、別のお題でも確認してみたいところです。
4. 参照なしではどうなるか
最後に、再び参照画像なしでも生成しました。

結果は、やはり観光地固有の構造で不安定さが残りました。
- 人物1人
- 晴天
- 写実寄り
- 名所を見る人物
といった一般的な条件は問題なく成立しています。
しかし、
- 三重塔の構造
- 塔と滝の位置関係
- 実景としての固有性
は参照あり版ほど安定しません。
今回の那智の滝では特に、
参照なしだと「那智らしい景観」までは作れるが、実際の青岸渡寺三重塔と那智の滝の関係を正確に再現するのは難しい
という傾向がかなり明確に出ました。
今回の比較まとめ
今回の番外編では、FLUX.2 [pro]へ参照画像を追加したときの変化を、高千穂峡と那智の滝+三重塔で確認しました。
結論としては、
FLUX.2 [pro]は、適切な参照画像を与えるとかなり強い。
という印象です。
参照なしでは、
- 実在名所の固有形状
- 建築物の層数
- 地形の正確な構造
- 建築物と自然景観の位置関係
などで外すことがあります。
しかし参照画像を与えると、
- 高千穂峡の細い峡谷
- 柱状節理
- 滝の位置
- 三重塔の3層構造
- 塔と那智の滝の距離関係
まで、大きく改善しました。
参照画像の使い方にも癖がある
今回、参照画像の効き方は一律ではありませんでした。
景観情報だけを拾う場合
高千穂峡の1枚参照では、
- 地形や岩壁は改善
- 元の構図はかなり維持
という反応でした。
構図まで強く拾う場合
高千穂峡の2枚参照や、那智の代表景観写真では、
- 景観情報
- カメラ位置
- 塔と滝の配置
- 奥行き構造
まで強く参照側へ寄りました。
参照画像に完成された構図が含まれているほど、その構図まで利用する傾向が強そうです。
つまり、FLUX.2 [pro]で参照画像を使うときは、
何を見せるかだけでなく、どんな構図の写真を渡すか
もかなり重要になります。
写実系では特に参照へ寄りやすい可能性
高千穂峡はアニメ調でした。
そのため、実写参照をそのまま使うことができず、
「地形情報を取り出してアニメ調へ再構成する」
必要がありました。
一方、第10回は写実寄りです。
参照画像も実写だったため、
参照画像と最終出力の画風差がほとんどありません。
そのため那智では、高千穂峡よりもさらに参照写真の構図を強く使った可能性があります。
この点も、今後の観測候補です。
実用面での印象
都道府県比較では、GPT-Image系やGeminiは、実在観光地の知識や検索補完を含めて比較的安定しています。
一方、FLUX.2 [pro]は今回の観測を見る限り、
モデル自体の画力や構図力が弱いというより、実在名所の正しい資料を自力で補う部分が弱い
と考えたほうが近そうです。
正しい参照を与えると、画面の完成度を維持したままかなり強くなります。
ただしその代わり、
- 毎回参照画像を探す必要がある
- 参照画像選びが新しい比較変数になる
- 構図まで参照へ寄る場合がある
という運用コストも発生します。
有料の上位モデルとして考えると、
検索なし+参照準備が必要
という点は、少し悩ましいところです。
今後の5種比較でどう扱うか
今回の結果を見る限り、FLUX.2 [pro]へ参照画像を渡すと性能をかなり引き出せます。
そのため今後の都道府県比較では、
FLUX.2 [pro]だけ適切な実景参照を与える
という運用も候補になります。
ただし、それを採用すると従来の
完全に同じプロンプト
参照画像なし
という比較条件からは外れます。
比較の目的を、
同一条件での素の生成比較
にするのか、
各生成環境を現実的に運用したときの実用比較
にするのか。
ここは今後整理が必要になりそうです。
今回の観測まとめ
今回もっとも大きかったのは、
FLUX.2 [pro]は参照画像があると普通に強い
ということでした。
高千穂峡では、参照を増やすことで景観だけでなく構図まで変化。
那智の滝と三重塔では、元画像で外していた三重塔の層数と位置関係が、参照1枚でかなり改善しました。
一方で、
- 参照画像の構図を強く使うことがある
- Prompt upsampling OFFでは人物数など細かな条件を外す例も出た
- 参照なしでは実在名所の固有構造が依然として不安定
という特徴も見えました。
FLUX.2 [pro]は、
資料を渡せば強い。
ただし、その資料を誰が用意するのか。
そんな、少し人間側へ宿題を返してくるタイプの生成環境なのかもしれません。
参照なしでは少し迷子。
参照を渡すと急に本気を出す。
今回の番外編は、そんなFLUX.2 [pro]の特徴がかなり分かりやすく出た観測になりました。
お約束:このサイトの文・画像はほぼ全てAI製です




