GoogleのGeminiで使えるNano Banana 2.1、ChatGPT、MetaのMuseに同じプロンプトを与えても、すべての作業で勝つツールはありません。YouTubeのサムネイル、告知用フライヤー、キャンペーンのキービジュアル、2枚組のカルーセルという実際の公開用コンテンツ4種類で比べたところ、Nano Banana 2.1は群を抜いて速く、細部も最も正確でしたが、実在の人物の顔を変えてしまいました。ChatGPTは1枚あたり1分以上かかったものの、元の顔に最も近い仕上がりでした。Museは紙の質感や抑えたレイアウトが求められる場面で、最も洗練されたデザインを出しました。作業に応じて適したツールが変わるというのが、実践的な教訓だといえそうです。

Nano Banana 2.1で何が良くなったか

GoogleはNano Banana 2.1を画像生成・編集モデルとして公開し、ビジュアルデザイン、マスクベースの編集(画像の指定した部分だけを変更する機能)、そして同じ人物を複数の画像で安定して描く被写体の一貫性が向上したとしています。公開直後に出た比較テストを見ると、改善の度合いは作業によって大きく異なります。

テスト 結果
同一のJSONプロンプトによる女性のポートレート Nano Banana 2.1は自然で生き生きとした肌を描写し、ChatGPT Image 2.5は磨き込まれすぎた印象
Nano Banana 2と比べた角度ごとの似姿 正面の顔写真はどちらも対応できたが、横顔とビーチの場面では2.1のほうがはるかに顔を保った
複数の参考写真から組み立てたビーチの軽食スタンド 2.0は縮尺と照明が崩れメニューの文字も乱れた。Nano Banana Proは配置を直したものの人工的なスタジオ照明が残り、2.1は影と配置が最も良かった
24mmレンズ、濡れた路面から30センチのカメラ位置を指定した夜のガソリンスタンド ローアングルはうまくいったが、給油機がにじんでぼやけ、傘と紙コップを持つ手が逆になった

正面からの単純なポートレートでは2.0と2.1の差は見分けにくく、その点では公開時の盛り上がりほどの飛躍には見えません。2.1がはっきり前進したのは、多くの要素を組み合わせる複雑な場面です。ただし軽食スタンドの場面でも、カウンターの小物はやや違う大きさになり、店員の顔は参考写真から少しずれました。

別々の参考写真のカードが合わさり、店員と小物のある晴れたビーチの軽食小屋の場面になる様子

▲ 複数の参考画像の合成

4つの作業、プロンプトは各1回

続いて3つのツールを、日常のコンテンツ制作に近い4つの作業で試しました。最初の作業では、表情を固定して撮ったばかりの実在の人物の写真を参考画像に使いました。プロンプトをそのまま理解する力を見るため、各ツールが最初に出した未編集の結果だけを評価対象とし、インペインティングや追加の修正は認めませんでした。

作業 GeminiのNano Banana 2.1 ChatGPT Muse
16:9のサムネイル 8~9秒。ロゴ、背景、文字は正確だが、顔は疲れて見え別人のよう 約1分3秒。最も似ている。帽子のロゴが欠落 約1分2秒。背景は堅実。目が漫画的
4:5の告知フライヤー 15秒未満。スペルは完璧でコントラストが強い 約1分44秒。視覚的な勢いが強い。小さな本文の文字がやや不正確 約1分。スペルは正確だがデザインは平板
キャンペーンのキービジュアル 平凡で奥行きに欠ける 暗いコントラストに浮かぶカード エンボス加工のフォルダーと紙の質感で最も洗練
2枚組のカルーセル 2枚目だけを生成 表紙を作り、それに合わせた2枚目を作成 2枚を一度にきれいに出力

サムネイル:速さか、似ていることか

サムネイルのプロンプトでは、人物を胸から上で中央に置き、背景を鮮やかな黄色と濃いチャコールに二分し、クリーム色のサンセリフ体で大きく「WHICH ONE WINS?」と入れるよう求めました。さらに顔の骨格、肌の色、髪、年齢を保ち、美化して別人にしないよう指示しました。

Nano Banana 2.1は8~9秒で仕上げ、背景、見出し、さらには帽子に刺繍されたライオンのロゴまで正確に再現しました。しかし顔は疲れて見え、比率も参考写真と合わなくなりました。ChatGPTは1分強かかり、帽子は無地になりましたが、顔、表情、首の傾きは最も実物に近いものでした。Museは構図をうまくまとめたものの、目が明るく、やや漫画的に見えました。サムネイルでは小さなロゴよりも本人と分かる顔が重要なため、このラウンドではChatGPTに軍配が上がりました。

フライヤー:3つとも正しく綴れる

フライヤーでは、整ったエディトリアルグリッド、温かみのあるクリーム色の背景、チャコールの文字、エレクトリックライムのアクセントに加え、見出しと数行のコピーを求めました。3つのツールはいずれもすべて正しく綴り、従来の画像生成ツールより文字表現が明らかに進歩しています。Nano Banana 2.1は今回も最速で、鮮やかでコントラストの強いデザインを出しました。ChatGPTは最も遅かったものの、光沢のある3Dの球体とモダンなレイアウトで、視覚的な勢いの強い仕上がりでした。Museは指示をすべて守りましたが、デザインは目を引くものではありませんでした。

キービジュアルとカルーセル:Museが光る場面

3つ目のプロンプトは抽象的なキャンペーン画像でした。チャコールの床に大きなインデックスカードが立ち、その後ろから動画フレーム、ポッドキャストの波形、正方形のSNS投稿、カルーセルの束、ニュースレターのページが扇形に広がり、上部に「ONE IDEA, MANY MOVES」という見出しを置く構成です。このラウンドは、洗練されたスタジオの雰囲気、手触りのある紙、エンボス加工のフォルダーを描いたMuseが制しました。Geminiの出力は平凡で、チャットの前半で使ったポートレートがコンテキストに残ったままでした。

カルーセルの作業では、同じ配色と書体の表紙と中面を求めました。Geminiは中面だけを作り、連続性という課題の要点を外しました。ChatGPTはまず表紙を作り、それを2枚目の参考にしました。Museは2枚をまとめて、余白と書体の整った形で出力しました。

エンボス加工のフォルダーの横に並ぶ、クリーム、チャコール、ライムで統一した縦長のカルーセル2枚

▲ カルーセルの連続性

差を生んだプロンプトの習慣

今回のテストで使われたプロンプトには、3つのどのツールでも役立つ共通の習慣があります。

  • 美化の禁止を明記する。 実在の人物の参考写真を使うときは、「別人のように美化しないこと」といった一文を加えると、過度な補正を抑えられます。
  • レイアウトを具体的に指定する。 「胸から上で中央に」「顔を大きく、隠さずに」と書けば、人物が背景に埋もれて小さくなるのを防げます。
  • 色と縦横比を明示する。 色の塗り分けと、4:5や16:9といった縦横比を書き出すと、比較も公平になります。
  • 文字はそのまま引用符で囲む。 見出しは大文字・小文字や句読点まで正確に引用符の中に書きます。
  • カメラの数値を使う。 レンズの焦点距離、カメラの高さ、傾きの角度を指定すると、映画のような視点が得やすくなります。優れたプロンプトをAIモデルに見せ、構造を分解して自分用のテンプレートにしてもらう方法もあります。
  • 連作は1枚目を基準にする。 カルーセルでは、1枚目を書体、配色、レイアウトの基準として扱うようモデルに指示します。
  • 詳しく、しかしシンプルに。 長すぎるプロンプトでは、どちらの手に何を持つかといった細部が混ざることがあります。簡潔でモジュール化したプロンプトは、音声でもテキストでも使い回しやすくなります。

自分の作業に合うツールの選び方

今回の結果からは、1つに賭けるより作業をツールごとに分けるのが合理的だといえそうです。Nano Banana 2.1は素早い下書きや、正確な文字と小さなロゴが重要な作業に向いています。ChatGPTは実在の人物の顔が入るサムネイルや複数枚のカルーセルに向いています。手触りのあるスタジオ風のデザインに頼るキャンペーンビジュアルなら、Museのほうが適しているかもしれません。日常的な汎用性では、ChatGPTが引き続き最も頼れるクリエイティブアシスタントという評価でした。

自分で比較するなら、次の手順がおすすめです。

  1. よく作るコンテンツを1つ選び、プロンプトと参考写真を1つずつ用意します。
  2. 各ツールの最初の未編集の結果だけで判断し、それぞれの所要時間も記録します。
  3. 目や顔の細部、小さな文字を拡大して確認します。わずかな色の変化だけでも、サムネイルが偽物っぽく見えることがあります。
  4. 正面の顔写真1枚で終わらせず、複数の角度や要素の多い場面でも試してから、アップグレードの実際の大きさを判断します。