把同样的提示词交给谷歌Gemini中的Nano Banana 2.1、ChatGPT和Meta的Muse,并没有哪一款工具能在所有任务中胜出。在YouTube缩略图、宣传海报、营销主视觉和两页轮播图这四项真实发布任务的正面比较中,Nano Banana 2.1速度遥遥领先,细节也最精准,却改变了真人的面孔。ChatGPT每张图耗时超过一分钟,但人脸最接近原貌。在需要纸张质感和克制版式的场合,Muse的设计最为精致。由此得出的实用结论似乎是:合适的工具取决于具体任务。

Nano Banana 2.1改进了什么

谷歌将Nano Banana 2.1作为图像生成与编辑模型推出,称其在视觉设计、基于蒙版的编辑(只修改图像中选定的区域)以及主体一致性(在多张图像中稳定地画出同一个人)方面都有提升。发布后不久出现的对比测试显示,提升幅度因任务而有很大差异。

测试 结果
用同一JSON提示词生成的女性肖像 Nano Banana 2.1的皮肤更自然逼真;ChatGPT Image 2.5显得过于光滑
与Nano Banana 2比较不同角度的相似度 两者都能处理正面头像;在侧脸和海滩场景中,2.1对面部的保持明显更好
用多张参考照片组合出的海滩小吃摊 2.0在比例、光线上失败,菜单文字也出现乱码;Nano Banana Pro修正了布局,但仍是不自然的影棚光;2.1的阴影和布局最好
指定24mm镜头、相机离湿路面30厘米的夜间加油站画面 低角度效果到位,但加油机模糊晕开,雨伞和纸杯拿反了手

在普通的正面肖像上,2.0与2.1的差别很难看出,这方面的进步远不如发布时的热度所暗示的那样显著。2.1明显领先的是组合大量元素的复杂场景。不过即便在小吃摊场景中,柜台上的小物件尺寸也略有偏差,摊主的面孔与参考照片相比也有些走样。

多张独立的参考照片卡片合成为一个阳光明媚、有摊主和柜台物品的海滩小吃摊场景

▲ 多张参考图的合成

四项任务,每项一条提示词

随后,三款工具在四项贴近日常内容制作的任务中接受了测试。第一项任务以一张刚拍下、表情保持自然的真人照片作为参考图。为了考察对提示词的原始理解能力,只计入每款工具首次生成、未经编辑的结果,不允许局部重绘或后续修改。

任务 Gemini中的Nano Banana 2.1 ChatGPT Muse
16:9缩略图 8到9秒;标志、背景和文字正确;面容显得疲惫且走样 约1分3秒;最为相似;漏掉了帽子上的标志 约1分2秒;背景扎实;眼睛显得卡通化
4:5宣传海报 不到15秒;拼写完美;对比强烈 约1分44秒;视觉冲击力强;小号正文略有偏差 约1分钟;拼写正确;设计平淡
营销主视觉 平淡,缺乏层次 深色对比搭配悬浮卡片 压纹文件夹与纸张质感,最为精致
两页轮播图 只生成了第二页 先做封面,再做与之匹配的第二页 一次干净地输出两页

缩略图:速度与相似度的取舍

缩略图提示词要求人物胸部以上居中,背景分为饱和黄色和深炭灰色两半,并用奶油色无衬线大字写出“WHICH ONE WINS?”。提示词还要求保留面部结构、肤色、发型和年龄,不得把人美化成另一个人。

Nano Banana 2.1在8到9秒内完成,背景、标题乃至帽子上刺绣的狮子标志都准确无误。然而面容显得疲惫,比例也与参考照片不再吻合。ChatGPT用时一分多钟,帽子变成了空白,但面部、表情和头部倾斜都最接近真人。Muse的构图处理得不错,但眼睛偏亮,略显卡通。对缩略图来说,一张认得出的脸比一个小标志更重要,因此这一轮更倾向于ChatGPT。

海报:三款都能正确拼写

海报要求整洁的编辑式网格、温暖的奶油色背景、炭灰色文字和电光青柠色点缀,外加标题和几行文案。三款工具都拼写无误,与早期图像生成工具相比,文字渲染明显进步。Nano Banana 2.1依然最快,交出了鲜艳、高对比度的设计。ChatGPT最慢,却做出了光泽感十足的3D球体和现代版式,视觉冲击力强。Muse遵守了每一条指令,但设计不够抢眼。

主视觉与轮播图:Muse的强项

第三条提示词描述的是一幅抽象营销图:一张超大索引卡立在炭灰色地面上,身后呈扇形展开视频画框、播客声波、方形社交帖子、轮播卡片堆和一页通讯稿,上方是标题“ONE IDEA, MANY MOVES”。Muse凭借精致的影棚氛围、富有触感的纸张和压纹文件夹赢下这一轮。Gemini的输出平淡,而且对话早先用过的肖像照仍留在其上下文中。

轮播图任务要求封面和内页使用相同的配色与字体。Gemini只做了内页,没有把握住连续性这一要点。ChatGPT先生成封面,再以它为参考做第二页。Muse则把两页一并生成,边距和字体都很整齐。

压纹文件夹旁两张配色统一为奶油色、炭灰色和青柠色的竖版轮播图

▲ 轮播图的页面连贯性

拉开差距的提示词习惯

这些测试中使用的提示词有几个共同习惯,对三款工具都适用:

  • 明确禁止美化。 使用真人参考照片时,加上“不要把她美化成另一个人”之类的句子,可以减少过度修饰。
  • 把版式定死。 写明“胸部以上居中”“脸要大且不被遮挡”,能防止人物缩进背景里。
  • 写明颜色和画面比例。 说清色块划分以及4:5或16:9等比例,也能让比较更公平。
  • 原样引用文字。 把标题放进引号,大小写和标点都要准确。
  • 使用相机参数。 镜头焦距、相机高度和倾斜角度有助于获得电影般的视角。也可以把一条优秀的提示词交给AI模型,请它拆解结构,做成自己的模板。
  • 系列图以第一页为基准。 制作轮播图时,告诉模型以第一页作为字体、配色和版式的参照。
  • 详细但简洁。 提示词过长时,哪只手拿什么之类的细节可能会混淆。简洁、模块化的提示词也更便于通过语音或文字重复使用。

如何为自己的工作选工具

这些结果表明,与其押注一款工具,不如按任务分工使用。Nano Banana 2.1适合快速出稿,以及文字准确、小标志很重要的任务。ChatGPT适合有真人面孔的缩略图和多页轮播图。对于依赖触感与影棚风格设计的营销视觉,Muse可能是更好的选择。就日常通用性而言,ChatGPT仍被认为是最可靠的创意助手。

如果想自己做比较,可以按以下步骤进行:

  1. 选一种经常制作的内容,准备一条提示词和一张参考照片。
  2. 只根据每款工具首次生成的未编辑结果来判断,并记录各自的耗时。
  3. 放大检查眼睛、面部细节和小号文字,细微的色彩偏差就可能让缩略图显得虚假。
  4. 不要只看一张正面头像,还要测试多个角度和多元素场景,再判断升级的真实幅度。