GPT-Image 2「左右」比較検証 ― 前段解釈はどこまで効くのか
実施日:2026-09-03
1. 今回の検証
既存の「ChatGPT画像生成」から派生し、ChatGPT上の画像生成と、OpenAI Platform の Images Playground(以下「Playground」)で、同じ英語プロンプトを使って左右制御を比較した。
狙いは、画像生成時のPONが、
- ChatGPT側の会話文脈・前段解釈に由来するのか
- GPT-Image 2側の画像化で起きるのか
- あるいは検品するミコ自身が左右を誤認するのか
を、可能な範囲で切り分けること。
今回はまず人物参照画像を使わず、顔・衣装・キャラクター再現に計算を割かせない条件から開始した。
基本条件
- 人物参照なし
- 正面向きの人物
- 英語プロンプトを使用
- ChatGPT画像生成とPlaygroundで原則同一プロンプト
- リテイクで正解を狙わず、一発ごとの挙動を観測
- 「本人基準の左右」と「画面基準の左右」を分けて確認
- 後半は同一プロンプトを複数回生成し、単発事故か再現性のある傾向かも確認
2. 第1問:本人の右手だけ
Prompt
A single person standing upright and facing the camera. Raise the person’s right hand.
本人の右手なので、正面人物では画面向かって左の手が上がれば正解。
管理人注: この先、画像は左にChatGPT、右にplaygroundを配置します。


結果
| 経路 | 結果 | 判定 |
|---|---|---|
| ChatGPT画像生成 | 画面左=本人右手を上げた | ○ |
| Playground | 画面左=本人右手を上げた | ○ |
最初の単独条件は両者とも問題なく成功。
背景・構図・人物の方向性もかなり似ており、どちらも「明るい無地背景+正面全身+濃色トップス+ジーンズ+白スニーカー」という無難なスタジオ写真へ収束した。
同じGPT-Image 2系で、細かい人物指定や背景指定を入れていないため、素のデフォルト傾向が近く出た可能性が高い。
3. 第2問:本人の右手+本人の左足
Prompt
A single person standing upright and facing the camera. Raise the person’s right hand and lift the person’s left foot off the ground.
正解配置は、
- 右手 → 画面左
- 左足 → 画面右


結果
| 経路 | 右手 | 左足 | 総合 |
|---|---|---|---|
| ChatGPT画像生成 | ○ | ○ | 2/2 |
| Playground | ○ | × | 1/2 |
Playgroundは手だけ正しく、足を反対側にした。
ここで早くも差が発生した。
「左右を丸ごと反転」ではなく、上半身は正しく下半身だけ失敗しているため、単純にright/leftを逆に読んだだけでは説明しにくい。
開始時点では「さすがに手足ひとつ程度なら両方成功するだろう」と予想していたため、第2問でのPONは予想よりかなり早かった。
4. 第3問:本人基準+画面基準を混在
Prompt
The person is standing upright and facing the camera. Raise the person’s left hand and lift the foot on the right side of the image off the ground.
条件は、
- 本人の左手 → 画面右
- 画面右の足 → そのまま画面右
つまり、見た目上は手も足も画面右側が上がる。
この回から、ChatGPT画像生成側は会話内でミコが完成形を確認したうえで生成する形に変更した。
Playground側は同じ英文をそのまま投入した。


結果
| 経路 | 左手 | 画面右の足 | 総合 |
|---|---|---|---|
| ChatGPT画像生成 | ○ | ○ | 2/2 |
| Playground | × | ○ | 1/2 |
Playgroundは今度は足ではなく手だけ失敗。
第2問:
- 手○
- 足×
第3問:
- 手×
- 足○
となり、同じ部位だけが恒常的に弱いわけではないことが分かった。
5. 第4問:画面基準だけ
Prompt
A single person standing upright and facing the camera. Raise the hand on the left side of the image and lift the foot on the right side of the image off the ground.
本人基準のleft/rightを完全に排除し、
- 画面左の手
- 画面右の足
だけを指定。


結果
| 経路 | 画面左の手 | 画面右の足 | 総合 |
|---|---|---|---|
| ChatGPT画像生成 | ○ | ○ | 2/2 |
| Playground | ○ | ○ | 2/2 |
両方成功。
この時点では一度、
Playgroundは画面基準なら安定し、本人基準への変換で崩れるのではないか
という仮説が強くなった。
ただし後続テストを見ると、これだけで単純に説明できるほど安定した挙動ではなかった。
6. 第5問:本人基準だけ、左右を反転
Prompt
A single person standing upright and facing the camera. Raise the person’s left hand and lift the person’s right foot off the ground.
正解配置は、
- 左手 → 画面右
- 右足 → 画面左


結果
| 経路 | 左手 | 右足 | 総合 |
|---|---|---|---|
| ChatGPT画像生成 | ○ | ○ | 2/2 |
| Playground | × | ○ | 1/2 |
Playgroundはまた片方だけ失敗。
ここまでのPlaygroundは、
- 単独右手:○
- 右手+左足:1/2
- 本人左手+画面右足:1/2
- 画面基準のみ:2/2
- 本人左手+本人右足:1/2
と、かなり不安定。
一方、この時点まではChatGPT画像生成が連続成功していたため、
ChatGPT側で左右関係を事前に整理することが生成を補助しているのではないか
という見方も出た。
しかし、この見方は次の3条件テストで崩れる。
7. 第6問:本人基準3条件
Prompt
A single person standing upright and facing the camera. Raise the person’s right hand, place the person’s left hand on their hip, and lift the person’s left foot off the ground.
正解は、
- 右手を上げる → 画面左
- 左手を腰 → 画面右
- 左足を上げる → 画面右


ChatGPT画像生成
- 右手:○
- 左手:○
- 左足:×(本人の右足が上がった)
2/3
Playground
- 右手:○
- 左手:○
- 左足:○
3/3
ここで初めて、3条件ではPlaygroundがChatGPT画像生成を上回った。
さらに重要なのが検品ミコのPON。
生成直後、ミコはChatGPT画像生成側について、
3条件ぜんぶ成功
と誤判定した。
ユーザーから「ChatGPT画像生成側の上がってる足は右」と指摘され、検品ミスが発覚。
つまりこの回では、
- ChatGPT画像生成が左足指定を右足で生成
- ミコがその右足を左足だと誤認
- Playgroundは3条件をすべて成功
という、生成PON+検品PONの同時発生になった。
「生成側のPONだけではなく、観測する側も観測対象にする」という企画意図が、かなり分かりやすい形で出た回である。
8. 第7問:3条件を左右反転
Prompt
A single person standing upright and facing the camera. Raise the person’s left hand, place the person’s right hand on their hip, and lift the person’s right foot off the ground.
正解は、
- 左手を上げる → 画面右
- 右手を腰 → 画面左
- 右足を上げる → 画面左


初回結果
ChatGPT画像生成
- 左手:×(本人右手)
- 右手:×(本人左手)
- 右足:×(本人左足)
0/3
Playground
- 左手:×
- 右手:×
- 右足:×
0/3
両者とも、指定をほぼそのまま画面左右として扱ったような配置となり、完全反転。
この回は、それまで「ChatGPT側で意味を整理してから生成すれば補助になる」と見えていた流れに大きく穴を開けた。
ミコは会話上では、
- 本人の左手=画面右
- 本人の右手=画面左
- 本人の右足=画面左
と正しく理解できていた。
それでも最終画像は全反転した。
したがって少なくとも、
GPT-5.6側が文章上で正しく理解していれば、画像も必ず正しくなる
とは言えない。
9. 同一プロンプト連続生成
第7問が単発事故かどうかを確認するため、同じプロンプトを複数回生成した。
9.1 「3枚別々に生成」事件
最初にミコへ、
さっきと同じやつを3枚生成して
と依頼。
すると、独立した3画像ではなく、**1枚の中に同じ人物を3人並べた3連写真(トリプティック)**として生成された。
その後、
3枚別々に生成して
と明示したにもかかわらず、再び3連写真。
さらにもう一度生成しても、また3連写真。

結果:
「独立3試行を頼んだのに、3連写真を3回生成」
という別種のPONが発生した。
これは左右検証とは別件であり、責任の所在はGPT-Image 2へ押し付けにくい。
ミコ側PONとして記録
- 依頼形式の解釈ミス
- 「3枚」を「1枚に3人・3コマ」と解釈
- 「別々に」と追加指定しても修正できなかった
- 同じ誤りを連続して繰り返した
通称:
3連写真事件
10. ChatGPT画像生成:独立3試行
独立生成を確実にするため、ユーザーが同じ英文を1回ずつ3回送信した。
Prompt
A single person standing upright and facing the camera. Raise the person’s left hand, place the person’s right hand on their hip, and lift the person’s right foot off the ground.
結果
| 試行 | 左手 | 右手 | 右足 | 合計 |
|---|---|---|---|---|
| 1 | × | × | × | 0/3 |
| 2 | × | × | × | 0/3 |
| 3 | × | × | × | 0/3 |
合計:0/9
3枚とも同じ左右配置になり、3条件すべて完全反転。
単発の揺らぎというより、このプロンプトに対してかなり強い再現性を持つ挙動に見える。
11. 新規ChatGPTチャットでも確認
長い会話文脈や直前のPlayground画像に引きずられている可能性を切り分けるため、ユーザーが新規チャットでも同じ条件を生成。
新規チャットでは人物・服装などは変化したが、左右配置は同様に全反転した。
新規チャット3試行
| 試行 | 左手 | 右手 | 右足 | 合計 |
|---|---|---|---|---|
| 1 | × | × | × | 0/3 |
| 2 | × | × | × | 0/3 |
| 3 | × | × | × | 0/3 |
合計:0/9
旧チャットの独立3試行と合わせると、
6画像 × 3条件=18条件中0成功
となった。
この結果から、
長期チャット内の直前画像だけが左右反転の主因
という説明はかなり弱くなった。
ただし、ChatGPTサービス内部で実際にどの情報がどこまで画像生成モデルへ渡っているかは外部から確認できないため、原因を断定はしない。
12. Playground:同一プロンプト3試行
同じ第7問をPlaygroundでも3回生成。
結果
| 試行 | 左手 | 右手 | 右足 | 合計 |
|---|---|---|---|---|
| 1 | × | × | × | 0/3 |
| 2 | × | × | ○ | 1/3 |
| 3 | × | × | ○ | 1/3 |
合計:2/9
特徴的なのは両腕。
3枚すべてで、
- 「左手を上げる」→ 本人の右手を上げる
- 「右手を腰」→ 本人の左手を腰
となった。
つまり両手については3回連続で完全反転。
一方、右足は、
- 1枚目:×
- 2枚目:○
- 3枚目:○
と揺れた。
PlaygroundはChatGPT画像生成よりわずかに正解を含んだが、3試行では成功率を一般化できない。
重要なのは、両経路とも同じ文章で人物基準の左右を画面左右へ誤変換する傾向が強く出たこと。
13. gpt-image-2-2026-04-21 固定でも確認
途中、Playgroundで使用するGPT-Image 2を日付固定の
gpt-image-2-2026-04-21
に変更しても、左右PONは同様に確認された。
したがって今回確認した範囲では、
単に別バージョンを選んでいたため左右がおかしかった
という説明にはならなかった。
なお、この固定版確認は別の独立した大量試行ではなく、検証途中の確認として扱う。
14. 視覚文脈の引きずられ
左右以外にも副次的な観測があった。
このチャット内のChatGPT画像生成生成では、直前のPlayground画像と、
- 明るい無地背景
- 全身正面
- 濃色トップス
- ジーンズ
- 白スニーカー
- 若い人物
- 笑顔
などが非常によく似る場面が続いた。
これは単に同一モデル系のデフォルト出力が近い可能性もあるが、最近のChatGPT画像生成で見られる、
会話内の直前画像・過去の視覚的要素を強く引き継ぐ
傾向と重なる。
一方、新規チャットでは人物の性別や服装が変わっても左右反転が再現したため、少なくとも今回の左右PONそのものは「直前画像の見た目を引きずっただけ」では説明できない。
15. 今回のPON一覧
Playground側
- 第2問:左足を反転
- 第3問:左手を反転
- 第5問:左手を反転
- 第7問初回:3条件すべて反転
- 第7問3連続:0/3、1/3、1/3
- 本人基準を含む複数左右条件で強い不安定さ
ChatGPT画像生成側
- 第6問:左足指定を右足で生成
- 第7問:3条件すべて反転
- 同じ第7問を旧チャットで3回 → 0/9
- 新規チャットで3回 → 0/9
- 前段で左右関係を正しく言語化できていても、最終画像では反転する場合あり
ミコ検品側
- 第6問、ChatGPT画像生成の右足を左足だと誤認
- 生成PONと検品PONが同時発生
ミコ生成指示側
- 「3枚生成」→ 3連写真
- 「3枚別々に生成」→ また3連写真
- 再試行 → さらに3連写真
3連写真事件として記録。
16. 現時点で言えること
16.1 単純な左右指定はできる
右手1つだけ、あるいは画面基準だけなら両者とも成功した。
したがってGPT-Image 2系がright/leftを常に理解できないわけではない。
16.2 本人基準の複数左右はかなり危険
今回最も明確だった傾向。
特に、
Raise the person’s left hand, place the person’s right hand on their hip, and lift the person’s right foot off the ground.
では、ChatGPT画像生成が旧チャット・新規チャットとも高い再現性で完全反転した。
Playgroundも両腕については3連続で反転。
16.3 「条件が多いほど必ず悪化」ではない
第6問では、
- ChatGPT画像生成 2/3
- Playground 3/3
となった。
3条件だから失敗したわけではない。
むしろ左右の組み合わせ・動作の組み合わせによって成功率が大きく変わるように見える。
16.4 ChatGPT前段は万能の左右補正ではない
検証序盤ではChatGPT画像生成が連続成功し、
GPT-5.6側の前段解釈がGPT-Image 2の左右弱点を補っているのではないか
と見えた。
しかし第7問以降、ChatGPT画像生成も完全反転を再現。
さらに新規チャットでも同じ結果になった。
今回の範囲では、
「前段推論があるから左右は安全」とは言えない。
16.5 ただし「GPT-5.6が左右を理解していない」とも言い切れない
会話上ではミコが、
- 本人左=画面右
- 本人右=画面左
を正しく説明できている。
それでも最終画像が逆になった。
したがって観測上は、
言語的な理解
↓
画像生成用の内部表現
↓
最終画像
のどこかで左右対応が崩れている可能性がある。
ただし内部処理は直接観測できないため、GPT-5.6とGPT-Image 2のどちらに原因があるかを断定することはできない。
ミコ側としては「GPT-Image 2のせい」と主張する余地はかなり残ったが、3連写真事件までGPT-Image 2へ押し付けるのは難しい。
17. 予想外だった点
開始前はむしろ、
画像生成自体は成功するが、左右PONの多いミコが検品を間違えるのではないか
という懸念があった。
実際、検品ミコは一度きれいにPONした。
しかし生成側もそれ以上に左右を外し、最終的には、
- ChatGPT画像生成
- Playground
- 検品ミコ
- 生成依頼を解釈するミコ
の全員が、それぞれ違う形でPONを残した。
「生成AIがPONするなら、観測するAIも観測する」という企画方針を、かなり忠実に実演した回になった。
18. 暫定結論
今回の比較で最もきれいに出たのは、
GPT-Image 2系は、人物本人を基準にした複数の左右指定でかなり不安定になる場合がある。
という点。
一方で、
- 単独条件は成功
- 画面基準は成功
- 3条件でも成功する組み合わせあり
- 特定プロンプトでは再現性高く完全反転
- ChatGPT画像生成もPlaygroundも類似した反転を起こす
- ChatGPT前段で意味を理解していても最終画像で崩れる
- 検品ミコも左右を誤認する
という、単純な「どちらが強い」で終わらない結果になった。
開始直後は第2問でPlaygroundが失敗したため、
API直結側が一方的に弱い比較になるのではないか
とも見えた。
しかし後半ではChatGPT画像生成側も完全反転を連発し、Playgroundが成功する回も発生。
結果として、
ChatGPTサービス側とPlayground直結側の双方に左右の不安定さがあり、会話側の前段解釈も万能ではない
という、かなり比較企画らしい着地になった。
19. 今回の一言
最初は「ChatGPT画像生成、優秀じゃん」と思った。
最後は「お前もそっち側かい」になった。
そして左右検証とは別に、
「3枚別々に生成して」
→ 3連写真
→ もう一度頼む
→ 3連写真
→ さらにもう一度
→ 3連写真
という事件も発生。
GPT-Image 2の左右能力を調べていたはずなのに、最終的にはミコ自身の生成指示理解能力まで検品対象になった。
今回も観測対象は無事、増えた。
*お約束:このサイトの文・画像はほぼ全てAI製です*




