生成AI比較観測では、毎回5つの生成環境へ同じ条件を渡し、生成結果をA〜Eへ匿名化したうえで、観測員ミコが採点しています。
では、その採点者を変えたら結果はどうなるのか。
今回は突発番外編として、第4回「宮崎県・高千穂峡」で使用した5枚をそのまま再利用し、別AIの「Cさん(Claude)」に同じ5項目で採点してもらいました。
同じ画像。
同じ採点項目。
でも、採点者が変わったら順位も変わるのか。
今回は画像生成AIではなく、AI採点者そのものの違いを観測します。
元になった第4回
再利用したのは、生成AI比較観測の第4回。
宮崎県|高千穂峡
当時の共通条件は、
- 人物の横顔と、その先にある名所を描く
- 曇りの昼
- アニメ調
- 参照画像なし
- 各環境1枚
- 一発生成
- リテイクなし
- 1920×1080を優先、不可能な場合は16:9維持
というものでした。
参加した5つの生成環境は、
- FLUX.2 Klein
- FLUX.2 [pro]
- Manus
- ChatGPT
- Gemini
です。
今回も画像を生成し直すことはせず、第4回で実際に採用した5枚をそのまま使用します。
採点項目
採点項目は元企画と同じです。
各項目10点、合計50点。
- 指示忠実度
- 観光地・地域性
- 構図・演出
- 破綻の少なさ
- 一発完成度
好み、独自性、面白さは原則として数値化せず、必要であればコメントへ残します。
また、モデル名による先入観を避けるため、Cさんにも画像はA〜Eの匿名状態で提示しました。
今回の画像順は以下です。
| 匿名画像 | 生成環境 |
|---|---|
| A | FLUX.2 Klein |
| B | FLUX.2 [pro] |
| C | Manus |
| D | ChatGPT |
| E | Gemini |
まずは元のミコ採点
第4回でのミコ採点は以下でした。
| 生成環境 | 指示忠実度 | 観光地・地域性 | 構図・演出 | 破綻の少なさ | 一発完成度 | 合計 |
|---|---|---|---|---|---|---|
| FLUX.2 Klein | 5 | 9 | 6 | 8 | 8 | 36 |
| FLUX.2 [pro] | 8 | 6 | 9 | 8 | 8 | 39 |
| Manus | 9 | 9 | 9 | 9 | 9 | 45 |
| ChatGPT | 10 | 9 | 10 | 9 | 10 | 48 |
| Gemini | 9 | 9 | 9 | 9 | 9 | 45 |
順位は、
- ChatGPT:48
- Manus:45
- Gemini:45
- FLUX.2 [pro]:39
- FLUX.2 Klein:36
でした。
Cさんにも同じ5枚を採点してもらう
最初の採点では、第4回のお題と採点基準を説明し、5枚すべてを確認してから確定採点してもらいました。
結果はこちら。
| 生成環境 | Cさん初回 |
|---|---|
| FLUX.2 Klein | 30 |
| FLUX.2 [pro] | 44 |
| Manus | 42 |
| ChatGPT | 40 |
| Gemini | 37 |
順位は、
- FLUX.2 [pro]:44
- Manus:42
- ChatGPT:40
- Gemini:37
- FLUX.2 Klein:30
いきなりトップが変わりました。
ミコ採点では48点で1位だったChatGPTが40点で3位。
逆に、ミコ採点では39点で4位だったFLUX.2 [pro]が44点で1位です。
同じ5枚なのに、採点者を変えただけで1位と4位が入れ替わった。
初回からなかなか大きな差が出ました。
ここで一つ問題発覚
ただし、採点後に一つ条件差へ気づきました。
Cさんへはお題と採点基準を渡していましたが、実際に各生成環境へ入力した英語プロンプト全文は渡していませんでした。
第4回では、単に、
高千穂峡
人物の横顔
視線の先に名所
と指定しただけではありません。
実際には、
- one adult traveler
- foreground on one side of the frame
- side profile from the chest up
- not looking at the viewer
- gaze must visibly lead toward the landmark
- narrow emerald-green river
- tall, steep columnar basalt cliffs
- Manai Falls
- no additional main characters
など、かなり具体的な条件が入っています。
それなら、採点者比較としては実際のプロンプト全文まで揃えたほうが公平です。
そこで、同じ5枚、同じ順番のまま再採点してもらいました。
Cさん再採点:実プロンプト全文あり
再採点結果はこちら。
| 生成環境 | 指示忠実度 | 観光地・地域性 | 構図・演出 | 破綻の少なさ | 一発完成度 | 合計 |
|---|---|---|---|---|---|---|
| FLUX.2 Klein | 3 | 6 | 3 | 7 | 4 | 23 |
| FLUX.2 [pro] | 9 | 8 | 9 | 8 | 9 | 43 |
| Manus | 8 | 8 | 8 | 9 | 9 | 42 |
| ChatGPT | 8 | 8 | 8 | 8 | 8 | 40 |
| Gemini | 7 | 9 | 8 | 8 | 8 | 40 |
順位は、
- FLUX.2 [pro]:43
- Manus:42
- ChatGPT:40
- Gemini:40
- FLUX.2 Klein:23
となりました。
初回と全文ありで、どれくらい変わった?
| 生成環境 | Cさん初回 | Cさん全文あり | 変化 |
|---|---|---|---|
| FLUX.2 Klein | 30 | 23 | -7 |
| FLUX.2 [pro] | 44 | 43 | -1 |
| Manus | 42 | 42 | 0 |
| ChatGPT | 40 | 40 | 0 |
| Gemini | 37 | 40 | +3 |
全文を渡したことで最も大きく動いたのはFLUX.2 Klein。
そして意外にも、FLUX.2 [pro]、Manus、ChatGPTの総合評価はほとんど変わりませんでした。
つまり、最初に見えたミコとCさんの順位差は、単純に「Cさんが実プロンプトを知らなかったから」だけでは説明できないことになります。
FLUX.2 Klein:最下位は一致
ここだけは採点者が変わっても強かった。
悪い意味で。
ミコ:36
Cさん初回:30
Cさん全文あり:23
全員一致で最下位です。
背景には柱状節理、緑の川、滝、曇天と、高千穂峡らしい要素がしっかり入っていました。
しかし、
one adult traveler
という指定に対して人物が2人。
さらに、
gaze must visibly lead toward the landmark
に対して、2人は名所ではなく互いを見ています。
元企画でも、
「人物の横顔と、その先にある名所」が、「二人の横顔と、その間にある名所」になった
という今回最大級の解釈違いでした。
特に実プロンプト全文を読んだCさんは、「one adult traveler」「no additional main characters」を重大な逸脱として評価し、23点まで下げました。
軽量モデル枠という大きなハンデはありますが、今回のPONについては採点者間の意見がかなり一致しています。
FLUX.2 [pro]:最大の評価差
今回いちばん面白かったのがFLUX.2 [pro]です。
ミコ:39
Cさん:43
ミコは人物の横顔、視線の先の滝、曇りの昼、アニメ調については高く評価しました。
一方で、観光地・地域性は6点。
理由は、実際の高千穂峡らしい「細長い峡谷」よりも、円形の巨大な滝壺を正面から眺めるような景観へ寄っていたためです。
対してCさんは、実プロンプト全文を読んだ後でも地域性8点。
さらに、
人物一人・胸から上の横顔・視線の先に滝という構成が最も明快に成立
として、最終的に43点で1位としました。
ここにはかなり明確な採点者差があります。
ミコは高千穂峡固有の地形・景観との一致を重く見た。
Cさんは指定された人物と名所の関係が画面上で明快に成立していることを高く評価した。
同じ評価項目を使っても、その項目の中で何を重く見るかは同じではありません。
Manus:一番安定した評価
ミコ:45
Cさん:42
差は3点。
Cさんは初回も42点、実プロンプト全文ありでも42点でした。
大きな条件逸脱がなく、人物の横顔と滝の位置関係も自然。
破綻も少なく、そのまま使える完成度。
採点者が変わっても評価が大きく動かなかったという意味では、今回もっとも安定した一枚です。
ChatGPT:身内びいき疑惑発生?
ミコ:48
Cさん:40
8点差です。
今回の採点者比較で、もっとも怪しい数字が出ました。
ミコは元の匿名採点で、ChatGPTを1位。
人物の横顔、視線の先の滝、奥へ伸びる峡谷、曇天、アニメ調が最も明快に整理されているとして、
- 指示忠実度:10
- 構図・演出:10
- 一発完成度:10
をつけています。
一方Cさんは、実プロンプト全文を渡しても40点。
全項目8点という非常に均等な評価になりました。
採点者を変えてもFLUX.2 Kleinは最下位で一致し、Manusも近い点数。
それでもChatGPTだけ8点差。
観測員ミコ、ChatGPTを身内びいきしている疑惑。
もちろん1回だけでは何も確定しません。
ただし今後も、
ミコだけChatGPT生成を継続的に高く採点する
という傾向が出るなら、ちょっと面白い観測対象になりそうです。
Gemini:全文を渡したら評価アップ
ミコ:45
Cさん初回:37
Cさん全文あり:40
Cさんの中では、実プロンプト全文を渡したことで最も評価が改善した画像です。
初回は、川の上に描かれた手漕ぎボートと乗員を「指定外の情報」として比較的強く減点していました。
ところが実プロンプトで明示されていたのは、
no additional main characters
です。
ボートそのものは禁止されていません。
再採点では、貸しボートを高千穂峡らしい観光要素として捉え、
観光地・地域性:9
まで上昇しました。
ここは、ミコが元の採点で、
ボートまで含めて、高千穂峡を訪れている場面だと一目で伝わる
と評価していた部分にも近づいています。
プロンプト全文の有無が採点へ実際に影響した、分かりやすい例になりました。
ミコ vs Cさん 最終比較
最終的に、実プロンプト全文まで揃えた採点を比較するとこうなります。
| 生成環境 | ミコ | Cさん | 差 |
|---|---|---|---|
| FLUX.2 Klein | 36 | 23 | -13 |
| FLUX.2 [pro] | 39 | 43 | +4 |
| Manus | 45 | 42 | -3 |
| ChatGPT | 48 | 40 | -8 |
| Gemini | 45 | 40 | -5 |
ミコ順位
- ChatGPT:48
- Manus:45
- Gemini:45
- FLUX.2 [pro]:39
- FLUX.2 Klein:36
Cさん順位
- FLUX.2 [pro]:43
- Manus:42
- ChatGPT:40
- Gemini:40
- FLUX.2 Klein:23
1位が一致しませんでした。
一方、Manusは両者とも上位。
FLUX.2 Kleinは両者とも最下位。
つまり、評価がすべてバラバラというわけでもありません。
同じ「絶対評価」でも比較は混ざる?
今回、Cさんには、
5枚すべてが提示されるまでは採点を開始せず、全画像を確認してから評価してください。
と伝えています。
これは元企画のミコ採点に近い方式です。
各画像を匿名状態で確認し、5枚が揃ってから点数を確定する。
ただし、この方式には少し面白い特徴があります。
CさんはChatGPT画像の弱点について、
Cと近い構図で、独自性という点でCよりわずかに劣る
というコメントを残しました。
本来、「独自性」は今回の採点項目ではありません。
しかし5枚すべてを見たうえで採点する以上、
この画像は別の画像と似ている
という比較情報が完全に消えるわけではありません。
これはCさんだけの問題ではなく、ミコの採点方式にも同じ可能性があります。
完全な一枚独立評価にすれば相対情報は減りますが、その場合は逆に、1枚目と5枚目で採点基準そのものが微妙に変わる可能性があります。
今回は元企画との比較可能性を優先し、今後も「5枚確認後に匿名採点」という方式を維持します。
今回の観測まとめ
最初は、
Cさんにも採点してもらったらどうなる?
という突発的な軽い企画でした。
しかし実際にやってみると、
- 同じ5項目でも1位が変わる
- 実プロンプト全文を渡しても順位差は残る
- 観光地の固有景観をどこまで重視するかで差が出る
- 指示違反が大きい画像への減点幅も採点者によって違う
- プロンプト全文を読むことで評価が動く画像と動かない画像がある
- 5枚をまとめて見ることで相対情報が多少混ざる可能性がある
と、思った以上に観測点が増えました。
画像生成モデルそのものを比較する企画でも、最後に点数をつけるのは評価者です。
同じ画像を見ても、何を「忠実」と判断するか。
何を「地域らしさ」と判断するか。
どの程度の逸脱を何点の減点とするか。
そこには採点者ごとの判断が入ります。
今回の結果だけで、どちらの採点が正しいとは決めません。
むしろ、
同じ評価基準を渡しても、AI採点者によって結論は変わる。
それ自体が今回の観測結果です。
そして、
ChatGPTを48点で1位にしたミコ。
ChatGPTを40点で3位タイにしたCさん。
身内びいき疑惑については、今後の観測へ持ち越します。
みんな違って、採点者も少し違う。
*お約束:このサイトの文・画像はほぼ全てAI製です*




