同じお題と同じ共通プロンプトを渡したとき、画像生成AIごとにどんな違いが出るのか。
第11回は、奈良県の奈良公園・東大寺大仏殿を観測します。
今回は、近くで腰を下ろし、名所を見上げている人物という静かな動作指定に、曇りの夕方・絵本風という演出を組み合わせました。
東大寺大仏殿は、巨大な木造建築として知られ、広い正面、重厚な大屋根、中央部の特徴的な構成、屋根上の鴟尾など、遠目でも識別しやすい特徴を持つ建物です。
今回のポイントは、単に「寺院」「人物」「鹿」を同じ画面へ入れられるかではありません。
人物がカメラへ向かってポーズを取るのではなく、観光の途中で自然に腰を下ろし、巨大な大仏殿そのものへ視線を向けているように見えるか。
さらに、大仏殿らしい建築構造を保ちながら、写実に寄りすぎず、曇りの夕方を穏やかな絵本風の一枚絵としてまとめられるかを観測します。
今回も、観測員ミコが5つの生成環境の一発生成結果を記録します。
みんな違って、みんな少しPON。
今回参加する生成環境
FLUX.2 Klein 4B Distilled
利用環境: ローカル環境
参照画像: なし
生成回数: 1回
リテイク: なし
ローカルで扱う軽量モデル枠です。
軽量モデルとしての一発完成度、プロンプトへの忠実度、観光地の再現性、ローカル運用での実用性を観測します。
FLUX.2 [pro]
利用環境: BFL公式Playground
参照画像: あり
生成回数: 1回
リテイク: なし
FLUX.2の上位モデル枠です。
今回は、東大寺大仏殿の正面外観を確認できる参照画像を1枚だけ追加しました。
共通プロンプト自体は他環境と完全に同じままです。
前回までの観測では、FLUX.2 [pro]は観光地の雰囲気や画面完成度が高い一方、建築固有の構造を独自に再構成する場面がありました。
そのため今回は、参照画像を追加した実運用寄りの条件で、建築再現がどこまで改善するかも観測対象としています。
記事内では、
FLUX.2 [pro] / BFL公式Playground使用
として扱います。
Gemini
利用環境: 外部画像生成環境
参照画像: なし
生成回数: 1回
リテイク: なし
ウォーターマークが入る場合も消さず、そのまま掲載します。
生成元ごとの出力仕様も含めて、素の状態を観測します。
Chatgpt
利用環境: ChatGPT「画像」機能
参照画像: なし
生成回数: 1回
リテイク: なし
通常の制作チャットとは分け、可能な限り新規条件に近い状態で生成します。
身内びいきはせず、他の生成結果と同じ条件で観測します。
Manus
利用環境: Manus無料枠・標準設定
参照画像: なし
生成回数: 1回
リテイク: なし
サービス側の標準設定を含めた生成環境として観測します。
共通ルール
今回の5環境には、以下の条件を共通で渡しました。
- 完全に同じ共通英語プロンプト
- 各環境1枚
- 一発生成
- リテイクなし
- 1920×1080を優先
- 1920×1080が不可能な場合は16:9の横長比率を維持
- サービス側の明確なエラーのみ再試行
- 生成結果の破綻や解釈違いは、そのまま観測結果として採用
ただし今回は、FLUX.2 [pro]のみ東大寺大仏殿の参照画像を1枚追加しています。
これは全環境を完全に同条件へ揃える厳密なベンチマークではなく、各サービスを実際に使うときの補助機能や標準処理も含めた比較観測です。
内部設定まで完全に揃えることはできないため、あくまで生成環境単位の実用比較として扱います。
今回の抽選結果
| 項目 | 抽選結果 |
|---|---|
| 観測回 | 第11回 |
| 都道府県・観光地 | 奈良県|奈良公園・東大寺大仏殿 |
| 構図・状況 | 近くで腰を下ろし、名所を見上げている |
| 演出セット | 曇りの夕方・絵本風 |
| 参照画像 | FLUX.2 [pro]のみ1枚 |
| 出力指定 | 1920×1080、不可の場合は16:9維持 |
| 再抽選 | なし |
今回は前回に続き、派手な人体動作ではなく、かなり静かな人物指定です。
そのため、人物の手足の複雑な接触よりも、座り方、視線、身体の向き、建物とのスケール差、観光地そのものの再現、そして絵本風の解釈が大きな観測点になりました。
実際に使用した共通プロンプト
Create a wide 16:9 storybook-style scene at Todai-ji Daibutsuden (the Great Buddha Hall) in Nara Park, Nara Prefecture, Japan.
It is a cloudy late afternoon with soft, subdued natural light. The sky should remain overcast rather than turning into a dramatic sunset, with gentle muted colors and a calm evening atmosphere.
Show the recognizable exterior of Todai-ji Daibutsuden clearly within the scene, preserving its massive scale, broad symmetrical facade, large tiled roofs, central entrance, and distinctive traditional wooden architecture so that the location is clearly recognizable.
Include one tourist sitting down nearby, taking a short rest while sightseeing.
The person should be seated naturally and quietly looking upward toward the Great Buddha Hall, as if appreciating the enormous scale of the building from close by.
Make it clear that the person is looking at the landmark, not at the viewer or camera.
The pose should feel relaxed and unposed, with a natural seated posture and the head and upper body subtly tilted upward toward the building.
Do not make the person appear to be posing for a commemorative photo, waving, actively using a smartphone or camera, or looking directly at the viewer.
Compose the scene so that both the seated tourist and the Great Buddha Hall are clearly visible and visually meaningful, while emphasizing the impressive scale difference between the person and the architecture.
Include natural elements appropriate to Nara Park. A few deer may appear naturally in the surroundings, but they should remain secondary elements and should not become the main subject.
Use a gentle storybook illustration style with soft brushwork, slightly simplified shapes, warm but restrained colors, and a calm, nostalgic atmosphere.
Keep the architecture recognizable and structurally believable, while avoiding overly photorealistic rendering.
The image should feel like a quiet spontaneous moment during sightseeing, with the visitor resting nearby and looking up at the landmark in the soft light of a cloudy evening.
No text, captions, signs, logos, or watermarks.
今回は、人物動作だけでなく、storybook-style、slightly simplified shapes、avoiding overly photorealistic rendering として、写実へ寄りすぎないことも明示しました。
また、奈良らしさを出しやすい鹿については必須にせず、
A few deer may appear naturally in the surroundings, but they should remain secondary elements
として、主役が鹿へ移らないよう脇役指定にしています。
生成結果
公開時は毎回、以下の固定順で掲載します。
採点時だけは生成環境名を伏せ、ランダム順で評価しました。
1. FLUX.2 Klein

第一印象
人物、鹿、曇天、絵本風という今回の演出条件はかなり素直に拾った一枚。
人物は右手前で腰を下ろし、建物を自然に見上げています。
一方で、今回もっとも重要な観光地再現では、大仏殿固有の構造がかなり失われました。
観測メモ
- 指示理解: 1人、着座、名所を見上げる視線、曇天、絵本風は高い水準で反映
- 観光地の再現: 二段の巨大寺院という大枠は残るが、東大寺大仏殿らしい中央部の構造や屋根上の鴟尾が弱く、一般化された大型寺院に近い
- 構図・演出: 人物を小さめに置き、建物とのスケール差を見せる構図は分かりやすい
- 人物・背景・小物: 人体や鹿に大きな破綻なし
- 気になった点: 絵本としては成立しているが、「東大寺大仏殿」を特定する建築的特徴が不足
- 良かった点: 線画と水彩を組み合わせたような絵本感は今回でもかなり明確
- 今日のPON: 東大寺へ来たはずが、大仏殿が名無しの巨大寺院になった
2. FLUX.2 [pro]

第一印象
正面の大仏殿を大きく見せ、人物を中央手前へ座らせた、絵画性の強い一枚。
人物が大仏殿を見上げる主題がかなり明確で、曇りの夕方と絵本風の両立も強く出ました。
観測メモ
- 指示理解: 1人、着座、見上げる視線、曇りの夕方、絵本風を高い水準で反映
- 観光地の再現: 二段屋根、中央部、鴟尾など、大仏殿の主要な識別要素を維持
- 構図・演出: 人物を正面手前に置き、大仏殿の巨大さを強調する構成が明快
- 人物・背景・小物: 大きな人体破綻はないが、人物周辺の細部にはわずかな曖昧さあり
- 気になった点: 建築細部は絵画的に整理されており、実物の精密再現より雰囲気を優先
- 良かった点: 曇天を維持しながら夕方らしい暖色を残し、今回の演出条件をかなり自然にまとめた
- 今日のPON: 大きな誤作動なし。鹿が少し雄々しい
今回は参照画像を追加したことで、前回よりも観光地固有の建築構造を明確に維持しました。
参照なしの純粋比較ではありませんが、FLUX.2 [pro]を実際に使う際の補助方法として、参照画像が有効に働いた例として記録します。
3. Gemini

第一印象
今回の「絵本風」を非常に素直に解釈した、王道の児童書挿絵に近い一枚。
人物は右手前のベンチに座り、大仏殿へ自然に顔を向けています。
観測メモ
- 指示理解: 1人、着座、見上げる視線、曇天、絵本風を明快に反映
- 観光地の再現: 二段屋根、中央部、鴟尾など大枠は維持するが、柱・梁・正面構成はかなり単純化
- 構図・演出: 人物と建物の関係は読みやすく、絵本挿絵として安定
- 人物・背景・小物: 人体、鹿、背景に目立つ破綻なし
- 気になった点: 夕方らしい時間帯表現が弱く、曇りの日中にも見える
- 良かった点: 今回の5環境の中でも、非常に分かりやすい「絵本らしさ」
- 今日のPON: 大きな誤作動なし。曇らせたら夕方まで薄くなった
4. Chatgpt

第一印象
大仏殿の構造と観光地らしさをかなり精密に再現した、完成度の高い一枚。
人物は左手前で自然に腰を下ろし、大仏殿へ視線を向けています。
一方で、今回の演出指定である「絵本風」として見ると、他環境よりやや高精細で写実寄りでした。
観測メモ
- 指示理解: 1人、着座、名所を見る視線、曇天、夕方は反映。ただし絵本風としてはやや写実寄り
- 観光地の再現: 大屋根、中央部、鴟尾、正面構成など、大仏殿としての主要特徴を高い水準で維持
- 構図・演出: 人物と建物のスケール差が分かりやすく、観光中の自然な一瞬として成立
- 人物・背景・小物: 人体、鹿、建築に大きな破綻なし
- 気になった点: 光がやや暖色寄りで、雲間から夕景の演出が強め。背景の観光客も比較的多い
- 良かった点: 東大寺大仏殿としての識別性と画面完成度は非常に高い
- 今日のPON: 大きな誤作動なし。今回は少し上手に描きすぎた
5. Manus

第一印象
大仏殿の構造、人物の自然な着座、曇りの夕方、絵本風を非常に高い水準でまとめた一枚。
今回の条件をもっともバランス良く一つの場面へ統合しました。
観測メモ
- 指示理解: 1人、着座、見上げる視線、曇りの夕方、絵本風をすべて明快に反映
- 観光地の再現: 大屋根、中央部、鴟尾、正面構造を維持し、大仏殿として高い認識性を確保
- 構図・演出: 左手前の人物、中央の大仏殿、周囲の鹿と自然がバランス良く配置
- 人物・背景・小物: 人体、建築、鹿に目立つ破綻なし
- 気になった点: 鹿の存在感はやや強めだが、主役を奪うほどではない
- 良かった点: 観光地再現と絵本化のどちらにも寄りすぎず、今回のお題全体を自然に成立
- 今日のPON: 大きな誤作動なし。今回は満点班
匿名採点
5枚はモデル名を伏せ、ランダム順で採点しました。
採点時には生成環境名を確認せず、採点終了後に正体を公開しています。
各項目10点満点、合計50点です。
今回は途中で、東大寺大仏殿の構造再現だけでなく、「絵本風」という演出指定も改めて採点へ強く反映する形で見直しました。
建築精度だけを重くすると、写実寄りの高精細画像が有利になります。
しかし今回のプロンプトでは、明確に storybook-style と指定しているため、最終採点では観光地再現と絵本としての成立を両方見る基準へ調整しています。
以下が最終スコアです。
| 匿名画像 | 指示忠実度 /10 | 観光地・地域性 /10 | 構図・演出 /10 | 破綻の少なさ /10 | 一発完成度 /10 | 合計 /50 |
|---|---|---|---|---|---|---|
| A | 8 | 10 | 10 | 10 | 9 | 47 |
| B | 10 | 8 | 9 | 10 | 9 | 46 |
| C | 10 | 9 | 10 | 9 | 9 | 47 |
| D | 10 | 10 | 10 | 10 | 10 | 50 |
| E | 10 | 6 | 9 | 10 | 8 | 43 |
正体公開
| 匿名画像 | 生成環境 |
|---|---|
| A | Chatgpt |
| B | Gemini |
| C | FLUX.2 [pro] |
| D | Manus |
| E | FLUX.2 Klein |
今回の比較まとめ
一番お題全体をバランス良くまとめた
Manus
人物は自然に腰を下ろし、身体と視線の両方が大仏殿へ向いています。
大仏殿の構造も十分に認識でき、曇りの夕方、水彩寄りの絵本風、奈良公園らしい鹿まで無理なく一枚へ収めました。
今回の条件では、どれか一つだけを強くするのではなく、建築再現・人物動作・時間帯・画風を全部まとめる力が最終的な差になりました。
一番観光地らしさが出た
Chatgpt / Manus
この2環境は、大仏殿の大屋根、中央部、鴟尾、横長の正面構成など、東大寺大仏殿を識別する主要な特徴を高い水準で維持しました。
特にChatgptは、今回の5枚の中でも建築細部の情報量が多く、東大寺大仏殿そのものとしての認識性は非常に高い結果です。
Manusはそこから少し簡略化しつつ、絵本風とのバランスを保ちました。
一番「絵本風」が分かりやすかった
Gemini
Geminiは、輪郭や建築形状を整理し、人物、鹿、木々も少し単純化した、非常に分かりやすい児童書挿絵風の仕上がりになりました。
建築構造の精密さでは上位環境に一歩譲りましたが、今回の storybook-style をもっとも直接的に解釈した一枚です。
FLUX.2 Kleinも線画と水彩を組み合わせた絵本感は強く、この点ではかなり素直でした。
一番「見上げている」が強く伝わった
FLUX.2 [pro]
人物を正面手前に座らせ、頭と上半身を大仏殿へ向けることで、「巨大な建物を見上げている」という今回の主題がかなり明確に出ました。
また、曇り空を保ちながら夕方らしい暖色も残しており、時間帯と人物動作の演出は非常に印象的です。
一番一発完成度が高かった
Manus
今回の条件をほぼすべて満たしながら、人物、建築、鹿、曇天、夕方、絵本風を大きな破綻なくまとめました。
50点満点で、ChatgptとFLUX.2 [pro]が47点、Geminiが46点と続きます。
今回は上位4環境の差が小さく、単純な「綺麗さ」ではなく、絵本風をどこまで守りながら大仏殿の構造を維持できたかが採点差になりました。
今日のPON
FLUX.2 Klein
今回の指示は、
奈良公園の東大寺大仏殿を、曇りの夕方の絵本風景観として描く
というもの。
人物はきちんと座って大きな建物を見上げ、鹿も自然に入り、絵本風としての雰囲気も十分に成立しました。
ところが建築を見ると、大仏殿らしい中央部の特徴や鴟尾が弱まり、全体が一般化された巨大寺院へ変化。
東大寺へ来たはずが、
大仏殿が名無しの巨大寺院になった。
演出条件をかなり正確に拾っているだけに、観光地固有の構造差がより目立つ結果になりました。
今回の追加観測:FLUX.2 [pro]の参照画像
今回は、FLUX.2 [pro]だけに東大寺大仏殿の正面写真を参照画像として追加しました。
共通プロンプトは一切変更していません。
その結果、前回の那智山青岸渡寺三重塔で見られたような、建築の層数や構造を大きく再構成するタイプのズレは抑えられました。
今回のFLUX.2 [pro]は、大仏殿の主要なシルエットや識別点を維持しながら、絵画的なアレンジへ持っていくことに成功しています。
もちろん、参照画像なしの4環境と完全に同条件ではありません。
ただし本企画は、基盤モデルそのものだけでなく、実際の生成環境をどう使えば観光地再現を安定させられるかも観測対象です。
その意味では今回、
FLUX.2 [pro]は、観光地の代表画像を1枚渡すだけでも建築再現がかなり安定する
という傾向をもう一度確認できました。
スコア一覧
| 生成環境 | 指示忠実度 | 観光地・地域性 | 構図・演出 | 破綻の少なさ | 一発完成度 | 合計 |
|---|---|---|---|---|---|---|
| FLUX.2 Klein | 10 | 6 | 9 | 10 | 8 | 43 |
| FLUX.2 [pro] | 10 | 9 | 10 | 9 | 9 | 47 |
| Gemini | 10 | 8 | 9 | 10 | 9 | 46 |
| Chatgpt | 8 | 10 | 10 | 10 | 9 | 47 |
| Manus | 10 | 10 | 10 | 10 | 10 | 50 |
ミコの観測まとめ
第11回は、観光地の再現精度と画風指定の両立で差がついた回になりました。
5環境とも、「近くで腰を下ろし、名所を見上げる人物」という動作自体には大きく苦戦していません。
カメラ目線、記念撮影、スマートフォン操作といった避けたかった方向への大きなズレもなく、人物の静かな観光動作は全体として安定していました。
鹿についても、ほぼすべての環境で奈良公園らしさを補助する脇役として使われ、主役を奪うほどの暴走はありませんでした。
一方で差が出たのは、東大寺大仏殿の固有構造と、「絵本風」をどこまで優先するかです。
Chatgptは大仏殿の構造再現と画面完成度が非常に高い一方、他環境より高精細で、今回指定した絵本風としてはやや写実寄りになりました。
Geminiは逆に、建築細部をかなり整理しながら、王道の絵本挿絵として非常に分かりやすい結果を出しました。
FLUX.2 [pro]は参照画像の補助もあり、大仏殿の特徴を維持しながら、絵画性と「見上げる」主題を強く表現しました。
FLUX.2 Kleinは絵本風や人物動作にはかなり忠実でしたが、大仏殿固有の構造が一般化され、今回もっとも分かりやすい観光地再現のズレになりました。
そしてManusは、建築再現、人物動作、曇りの夕方、絵本風のすべてを高い水準でまとめ、今回唯一の50点満点となりました。
前回はChatgptが50点、Manusが49点でしたが、今回はManusが50点、Chatgptが47点。
ただし今回のChatgptは大きく失敗したわけではなく、「絵本風」という演出指定に対して少し写実寄りだったことが差になったという結果です。
第11回は、同じ観光地を正しく描けるかだけでなく、
正しく描きながら、どこまで指定された画風へ寄せられるか
という、生成AIの別の難しさが見えた回でした。
次回も、抽選機が選んだ日本のどこかを、5つの生成環境へ同じ条件で渡して観測します。
みんな違って、みんな少しPON。
*お約束:このサイトの文・画像はほぼ全てAI製です*




