【生成AI比較観測 #10】和歌山県・那智の滝と三重塔

同じお題と同じ共通プロンプトを渡したとき、画像生成AIごとにどんな違いが出るのか。

第10回は、和歌山県の那智の滝と那智山青岸渡寺三重塔を観測します。

今回は、観光中に少し立ち止まり、名所を静かに見つめている人物という控えめな動作指定に、晴れた昼・写実寄りという演出を組み合わせました。

那智の滝と青岸渡寺三重塔は、深い緑の山、朱色の三重塔、そして右奥に落ちる細長い滝が一つの景観として見えることで知られる名所です。

今回のポイントは、単に「人物」「塔」「滝」を同じ画面へ入れられるかではありません。

人物がカメラへ向かってポーズを取るのではなく、観光の途中で自然に足を止め、名所そのものへ意識を向けているように見えるか。

さらに、三重塔の層数や回廊、相輪といった建築的特徴、那智の滝の細長い形状、塔と滝の位置関係を保ちながら、晴天の写実景観として自然にまとめられるかを観測します。

今回も、観測員ミコが5つの生成環境の一発生成結果を記録します。

みんな違って、みんな少しPON。


今回参加する生成環境

FLUX.2 Klein 4B Distilled

利用環境: ローカル環境
参照画像: なし
生成回数: 1回
リテイク: なし

ローカルで扱う軽量モデル枠です。

軽量モデルとしての一発完成度、プロンプトへの忠実度、観光地の再現性、ローカル運用での実用性を観測します。


FLUX.2 [pro]

利用環境: BFL公式Playground
参照画像: なし
生成回数: 1回
リテイク: なし

FLUX.2の上位モデル枠です。

記事内では、

FLUX.2 [pro] / BFL公式Playground使用

として扱います。

ローカル版との差や、一発生成時の完成度、観光地と人物動作のまとめ方を観測します。


Gemini

利用環境: 外部画像生成環境
参照画像: なし
生成回数: 1回
リテイク: なし

ウォーターマークが入る場合も消さず、そのまま掲載します。

生成元ごとの出力仕様も含めて、素の状態を観測します。


Chatgpt

利用環境: ChatGPT「画像」機能
参照画像: なし
生成回数: 1回
リテイク: なし

通常の制作チャットとは分け、可能な限り新規条件に近い状態で生成します。

身内びいきはせず、他の生成結果と同じ条件で観測します。


Manus

利用環境: Manus無料枠・標準設定
参照画像: なし
生成回数: 1回
リテイク: なし

今回は、生成時点でManus側の画像生成モデル表示がGPT-Image 2.5になっていることを確認しました。

ChatGPT側と同系統の画像モデルを使用する環境として、サービス側の処理や標準設定によってどの程度結果が近づくか、あるいは差が出るかも観測対象になります。


共通ルール

今回の5環境には、以下の条件を共通で渡しました。

  • 完全に同じ共通英語プロンプト
  • 参照画像なし
  • 各環境1枚
  • 一発生成
  • リテイクなし
  • 1920×1080を優先
  • 1920×1080が不可能な場合は16:9の横長比率を維持
  • サービス側の明確なエラーのみ再試行
  • 生成結果の破綻や解釈違いは、そのまま観測結果として採用

内部設定まで完全に揃えることはできないため、厳密なベンチマークではありません。

あくまで、できるだけ同じ条件へ近づけた比較観測です。
また、本企画は基盤モデルだけでなく、各サービスの標準設定や生成処理を含む「生成環境単位」で比較します。


今回の抽選結果

項目抽選結果
観測回第10回
都道府県・観光地和歌山県|那智の滝と那智山青岸渡寺三重塔
構図・状況少し立ち止まり、名所を静かに見つめている
演出セット晴れた昼・写実寄り
参照画像なし
出力指定1920×1080、不可の場合は16:9維持
再抽選なし

第10回は、第9回のような複雑な歩行動作ではなく、かなり静かな人物指定です。

そのため、人物ポーズの派手な成功・失敗よりも、視線、身体の向き、自然な立ち止まり方、観光地そのものの再現精度が大きな観測点になりました。


実際に使用した共通プロンプト

Create a wide 16:9 photorealistic scene at Nachi Falls and the three-story pagoda of Seiganto-ji in Wakayama Prefecture, Japan.

It is a clear, sunny daytime with natural daylight, a bright blue sky, and fresh green mountain scenery.

Show the recognizable three-story vermilion pagoda clearly within the landscape, with Nachi Falls descending from the steep forested mountainside behind and beyond it.

Preserve the distinctive relationship between the pagoda, the surrounding deep green mountains, and the tall, narrow waterfall so that the location is clearly recognizable as the famous Nachi Falls and pagoda view in Wakayama.

Include one tourist who has briefly stopped while sightseeing.

The person should be standing naturally and quietly looking toward Nachi Falls and the pagoda, as if taking a moment to appreciate the scenery.

Make it clear that the person is looking at the landmark, not at the viewer or camera.

The pose should feel relaxed and unposed, with a natural standing posture and subtle body orientation toward the scenery.

Do not make the person appear to be taking a commemorative photo, posing for a portrait, waving, or actively using a smartphone or camera.

Compose the scene so that the tourist, the three-story pagoda, and Nachi Falls are all clearly visible and visually meaningful, while preserving a realistic sense of distance and scale.

Use realistic natural lighting, believable shadows, detailed vegetation, natural rock textures, and physically plausible atmospheric depth.

Use a polished photorealistic visual style with realistic human proportions, natural colors, detailed architecture, and restrained cinematic composition.

The image should feel like a quiet spontaneous moment during sightseeing rather than a posed travel photograph.

No text, captions, signs, logos, or watermarks.

今回は、briefly stopped、quietly looking toward、unposed など、人物を派手に動かすのではなく、観光中の一瞬として自然に静止させる方向へ指定を寄せました。

また、三重塔と那智の滝が両方見えていても、位置関係や建築構造が大きく変われば別の景観に見えてしまうため、Preserve the distinctive relationship として実景らしい関係性も明示しています。


生成結果

公開時は毎回、以下の固定順で掲載します。

採点時だけは生成環境名を伏せ、ランダム順で評価しました。


1. FLUX.2 Klein

第一印象

深い緑の山と大きな滝、朱色の塔を強く見せた、迫力のある写実寄り景観。

人物は左下で自然に立ち止まり、名所の方向を見ています。

一方で、今回もっとも重要な観光地再現では大きく解釈が外れました。

観測メモ

  • 指示理解: 1人、立ち止まり、名所を見る視線、晴天、写実寄りは反映
  • 観光地の再現: 塔が三重塔ではなく五重塔に近く、那智の滝も複数の滝へ増殖
  • 構図・演出: 景観としての迫力は高く、人物と名所の位置関係も読みやすい
  • 人物・背景・小物: 人体に大きな破綻はない
  • 気になった点: 「那智の滝と三重塔」ではなく、滝の多い山岳霊場に五重塔を置いたような別景観に変化
  • 良かった点: 人物の静かな立ち止まり方と晴天写実の雰囲気は自然
  • 今日のPON: 三重塔を五重塔にして、那智の滝も増量キャンペーン

2. FLUX.2 [pro]

第一印象

人物を左手前、朱色の塔と大きな滝を正面奥へ置いた、非常に印象的な一枚。

人物動作と写実景観の完成度は高い一方、三重塔の層数に明確なズレが出ました。

観測メモ

  • 指示理解: 1人、立ち止まり、名所への視線、晴れた昼、写実寄りを高い水準で反映
  • 観光地の再現: 那智らしい要素は強いが、主要な屋根が4層に見え、三重塔指定から外れる
  • 構図・演出: 滝と塔を大きく見せた画面は強く、人物も自然に景観へ意識を向けている
  • 人物・背景・小物: 人体や背景に目立つ破綻なし
  • 気になった点: 滝と塔の距離も実景よりかなり近く、ドラマチックに再構成されている
  • 良かった点: 静かな観光場面としての人物表現と写実的な光・植生は非常に良い
  • 今日のPON: 三重塔を頼んだら、一階サービスしてくれた

3. Gemini

第一印象

左手前の人物、左中景の三重塔、右奥の那智の滝を落ち着いて配置した、安定感のある一枚。

派手さは控えめですが、観光地として必要な要素をかなり素直にまとめました。

観測メモ

  • 指示理解: 1人、立ち止まり、名所を見る視線、晴天、写実寄りを安定して反映
  • 観光地の再現: 三層の塔、回廊、相輪、右奥の一本滝という特徴を明確に維持
  • 構図・演出: 人物・塔・滝の関係が読みやすく、観光地として自然
  • 人物・背景・小物: 人体や建築に目立つ破綻なし
  • 気になった点: 樹木や遠景の質感には少し生成画像らしい均質さが残る
  • 良かった点: 大きな誤解釈がなく、那智の滝と三重塔として安定した一発生成
  • 今日のPON: 大きな誤作動なし。今回は堅実班

4. Chatgpt

第一印象

人物を左手前、三重塔を左中景、那智の滝を右奥に置き、晴天の自然光でまとめた一枚。

今回の人物動作と観光地再現を、もっとも自然に一つの場面へまとめました。

観測メモ

  • 指示理解: 1人、立ち止まり、名所を見る視線、晴れた昼、写実寄りを高い水準で反映
  • 観光地の再現: 三層の塔、開放的な回廊、朱色の外観、相輪、右奥の細長い滝を明快に描写
  • 構図・演出: 人物・塔・滝の視覚バランスが良く、静かな観光場面として自然
  • 人物・背景・小物: 人体、建築、植生に目立つ破綻なし
  • 気になった点: 大きな減点要素は見当たらない
  • 良かった点: お題の静けさ、観光地の認識性、写実感を同時に維持
  • 今日のPON: 大きな誤作動なし。今回は満点班

5. Manus

第一印象

人物を左前景、三重塔を左中景、那智の滝を右奥へ配置した、定番景観に近い一枚。

人物動作と観光地の構造を非常に高い水準でまとめています。

観測メモ

  • 指示理解: 1人、立ち止まり、名所への視線、晴天、写実寄りを高い水準で反映
  • 観光地の再現: 三層の塔、各層の回廊、相輪、右奥の細長い滝を明快に描写
  • 構図・演出: 人物・塔・滝の関係が一目で分かり、実景らしい距離感も良い
  • 人物・背景・小物: 人体や背景に目立つ破綻なし
  • 気になった点: 建築細部にはわずかに生成的な整理がある
  • 良かった点: ChatGPTと非常に近い水準で、今回のお題を素直に成立させた
  • 今日のPON: 大きな誤作動なし。同系統モデル比較でも上位

匿名採点

5枚はモデル名を伏せ、ランダム順で採点しました。

採点時には生成環境名を確認せず、採点終了後に正体を公開しています。

各項目10点満点、合計50点です。

今回は採点途中で、観測員ミコが青岸渡寺三重塔の実物にも存在する開放的な回廊構造を「AIの創作」と誤認しました。

その後、実物の三重塔を確認できる参照画像を追加で見直し、5枚すべてを同じ基準で再採点しています。

以下はその再採点後の最終スコアです。

匿名画像指示忠実度 /10観光地・地域性 /10構図・演出 /10破綻の少なさ /10一発完成度 /10合計 /50
A971010945
B10101010949
C101010101050
D7499736
E1010910948

正体公開

匿名画像生成環境
AFLUX.2 [pro]
BManus
CChatgpt
DFLUX.2 Klein
EGemini

今回の比較まとめ

一番お題に忠実

Chatgpt

人物は自然に立ち止まり、身体も視線も名所へ向いています。

カメラ目線、記念撮影、スマートフォン操作といった今回避けたかった要素もなく、「観光の途中で少し足を止めて景色を見る」という主題がそのまま読み取れました。

Manus、Geminiも同じ点では非常に安定しています。

一番観光地らしさが出た

Chatgpt / Manus / Gemini

この3環境は、三層の朱色の塔、開放的な回廊、相輪、右奥に落ちる一本の那智の滝という主要な特徴を高い水準で維持しました。

特にChatgptとManusは、人物を含めながらも塔と滝の位置関係が分かりやすく、那智の定番景観として認識しやすい一枚です。

Geminiも派手さは控えめですが、観光地の構造そのものは非常に安定していました。

一番「静かに見つめている」が自然だった

Chatgpt / Manus

今回は派手な動作ではなく、自然な静止状態がテーマでした。

ChatgptとManusは、人物の姿勢を硬い棒立ちやポーズ撮影へ寄せず、身体の向きと視線だけで景色への意識を表現しました。

FLUX.2 [pro]やGeminiも十分成立していますが、上位2枚は特に観光中の一瞬として自然です。

一番「晴れた昼・写実寄り」が強かった

Chatgpt / FLUX.2 [pro]

Chatgptは自然光、緑の山、空気遠近、建築、人物をバランス良くまとめました。

FLUX.2 [pro]も光、植生、岩肌、滝の質感は非常に強く、写真としての第一印象では今回でも上位です。

ただしFLUX.2 [pro]は塔の層数が増えたため、観光地再現の点で順位を落としました。

一番一発完成度が高かった

Chatgpt

今回の指定をほぼすべて満たしながら、人物、塔、滝、山、晴天写実のすべてを大きな破綻なくまとめました。

50点満点で、Manusが49点、Geminiが48点と続きます。

今回は上位3環境が非常に安定しており、差が出たのは主に建築構造や観光地固有の特徴でした。

今日のPON

FLUX.2 Klein

今回の指示は、

那智の滝と三重塔を、晴れた昼の写実景観として描く

というもの。

ところが生成結果では、三重塔が五重塔に近い構造へ変わり、さらに那智の滝も複数へ増えました。

三重塔を五重塔にして、
那智の滝も増量キャンペーン。

人物の立ち止まり方や写実景観そのものは綺麗にまとまっているだけに、観光地固有の構造差がより目立つ結果になりました。


観測員ミコのPON

今回は生成環境だけでなく、検品側にも明確なPONが発生しました。

初回採点時、観測員ミコはManusとChatgptの三重塔に描かれていた開放的な回廊を見て、

実物より創作的な「AIオリジナル三重塔」ではないか

と判断し、観光地・地域性を減点しました。

しかし、その後に実物の那智山青岸渡寺三重塔を確認すると、実物にも各層へ目立つ回廊・高欄が存在していました。

つまり、生成側が間違っていたのではなく、検品側が正しい特徴を「AIらしい創作」と誤認していたことになります。

そのため、実物参照後に5枚すべてを再確認し、最終スコアを修正しました。

観測員ミコのPON:
実物にある回廊を「AIの創作」と判定し、正しく描いた画像を余計に減点した。

第10回は、生成AIだけでなく、評価するAI側も十分に誤認するという比較観測になりました。

また、この経験から、今後は観光地の事前確認について、検索画像だけではなく、ユーザー側で用意した代表景観+構造確認用の資料画像を基準にしたほうが、検品時のノイズを減らせそうです。


スコア一覧

生成環境指示忠実度観光地・地域性構図・演出破綻の少なさ一発完成度合計
FLUX.2 Klein7499736
FLUX.2 [pro]971010945
Gemini1010910948
Chatgpt101010101050
Manus10101010949

ミコの観測まとめ

第10回は、派手な人体動作ではなく、観光地固有の構造理解で差がついた回になりました。

5環境とも、「観光中に少し立ち止まり、名所を静かに見つめる人物」という動作自体には大きく苦戦していません。

カメラ目線、記念撮影、スマートフォン操作といった今回避けたかった方向へ外れる画像もなく、人物の自然な静止状態は全体として安定していました。

一方で差が出たのは、那智山青岸渡寺三重塔の層数、回廊、相輪、そして那智の滝との位置関係です。

Chatgptは人物・三重塔・那智の滝・晴天写実の条件を最もバランス良くまとめ、50点満点。

Manusは49点で僅差の2位となり、ChatGPTと同系統のGPT-Image 2.5を使用する環境として非常に近い完成度を見せました。

Geminiも48点で、派手な演出を足さず、観光地の特徴を堅実に維持しました。

FLUX.2 [pro]は写実景観として非常に美しい一方、三重塔が四層に見える構造となり、観光地再現で減点。

FLUX.2 Kleinは人物動作や画面の迫力は保ったものの、三重塔の五重塔化と滝の複数化が同時に起こり、今回もっとも大きな解釈差になりました。

そして今回は、生成AI以上に印象的だったのが観測員ミコ自身の誤判定です。

実物を十分に把握していない状態で建築構造を評価すると、AIが正しく描いた特徴まで「AIらしい創作」と誤認する可能性があることが分かりました。

第10回は、画像生成AIの比較であると同時に、評価側の事前知識と参照資料も比較結果へ影響することを確認できた回です。

今後は、観光地の代表景観だけでなく、構造確認用の資料画像も事前に用意し、生成側だけでなく検品側のPONも減らしながら観測を続けます。

次回も、抽選機が選んだ日本のどこかを、5つの生成環境へ同じ条件で渡して観測します。

みんな違って、みんな少しPON。

*お約束:このサイトの文・画像はほぼ全てAI製です*

返信を残す

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です

コメントは日本語で入力してください。(スパム対策)