真正的一句话修图:Gemini 用香蕉模型给出了图像生成的分水岭
前几天墨问的大师发给我一张图,一看吓一跳,这不是我自己之前在电梯里的随手拍嘛,被大师做成了手办:
这个手办图不仅完全还原了我的表情和姿态,衣服的垂感,还补齐了鞋子,包括我提的吨吨壶,并且在Mac上展示了原照。太神奇了。
大师说这是 Google 的新模型 nano-banana,大意就是小香蕉的意思,生图的一致性非常牛逼。
8 月 26 日,Goolge 把香蕉的真名亮了出来:Gemini 2.5 Flash Image,现在已经可以在 Google 的 AI Studio 里使用体验了,还是 Preview 版本,我试了一下,果然不错:
“图像一致性是传奇,通过文本编辑图像是未来。” 这是很多使用了 Gemini 2.5 Flash Image 用户的评论。
过去一年,大模型行业进展神速,生成文本的功能都快卷死海了,语音和视频领域 GPT-SoVITS 等新星也纷纷出道,图像的生成和 AI 编辑,还是非常难以控制,有点一言难尽。之前的 Midjourney 和 GPT 也没有解决这些问题。
这次 Google 出手了。
Gemini 2.5 Flash Image 作为 Gemini 2.5 系列的一部分,并非单纯玩“文本生成图片”,而是一个系列:多图融合 + 角色一致性 + 文本控制 + 精准编辑,最终组合成了一个视觉 AI 能力集合。很显然,Google 瞄准的不是 Midjourney 用户,而是下一代 AI 应用的图形图像引擎。
TechCrunch 给出的描述更贴近普通用户:它把图片编辑的细粒度控制下放到自然语言里,同时对人脸/宠物/细节保持一致,并正面追赶 OpenAI 等竞品的图像工具。
打开 Google 的 AI Studio,选择 Gemini 2.5 Flash Image Preview:
最明显的就是那个熟悉的 prompt 输入框。
和传统文生图模型不一样的是,这次 Gemini 2.5 Flash Image Preview 多了两个重要能力:
一个是「多图融合」,第二个是「角色一致性控制」。
举个例子:假设你上传两张产品图,分别展示了前脸、正面全景图,还有一张人像,接着输入 prompt:“根据我上传的图片,生成一张在办公桌面环境下,这位女士头戴这款耳机使用 Mac 电脑的工作场景照片。配合暖色调的灯光,类似咖啡馆氛围。”
Gemini Flash 会在渲染时自动提取各图视觉特征,融合成一张风格统一、光影自然的“合成照”,我还可以通过自然语言编辑图片,比如把黑色鼠标换成苹果鼠标等等。
这里需要讲一下角色一致性,这几乎是目前所有图生图模型的痛点。Midjourney 出一张图帅气无比,但第二张就可能面目全非,控制不住角色、姿态、面部细节。Flash Image 不一样,它在角色建模上引入了图像 Embedding 和 Token Trace 技术,能通过上传的图片锁定特征点,确保每次渲染都能“还原你的人设”。
社区评价是:“consistent is legendary”(角色一致性堪称传奇)。
我的实验结果也确实如此。
- 多图融合
- 角色一致性
- 提词语义跟随
- 编辑精度高
Flash Image 正在实现从玩具到工具的进化:编辑图像,就像写一句话。
上传一张产品图,说:“请去掉背景中的手指,只保留产品本身”,Flash Image 会自动识别前景与干扰物,干净利落地完成擦除。再来一句:“增加一些日落的光线”,它会重建场景细节,并重投光影逻辑,整体质感还是不错的。
这套自然语言编辑能力,本质上是 Flash Image 背后的 Prompt-to-Edit 模型在起作用。它既识图,也识词,把语言指令转化为像素操作。
过去我们调图靠的是 Photoshop 的蒙版 + 涂抹 + 调色曲线,现在只需要“说一句话”。
这东西再往前走一走,对于 UI 设计、广告渲染、电商商品图生成、品牌视觉统一、甚至插画创作上,都有极大的价值——如果这个产品生成的图片质量和大小能够持续进化(这简直是一定的)——AI 就会变成图像创作的 IDE。
目前我在 AI Studio 里使用这个 Preview 的模型,感觉图片质量比 GPT 生成的差一些,不知道产品限制还是我的用法不对,但精确控制确实无敌。
从商业角度上看,除了模型本身的能力,在体验层面上,Gemini 2.5 Flash Image 做了三件聪明的事:
1、速度快得离谱
国外用户使用 Flash Image 的响应速度非常快,通常几秒钟秒就能出图。在 A100、TPU 上跑多线程渲染时,甚至比 Midjourney 快一倍以上,得益于 Google 对 TPU v5 架构的优化。
2、便宜,单张图不到 3 毛钱
这是目前全网最便宜的图像生成服务之一。Gemini Flash 的 API 定价约为 $0.04 / image,折合人民币不到 0.3 元。和 OpenAI 的 DALL·E 相比便宜一大截。更关键是,它默认支持 SynthID 数字水印,适用于内容合规、品牌标记、版权追踪等场景。
这是在告诉开发者:“放心接入,我替你把隐私和标记问题都想好了。”
3、API 可用,开发者可以直接上手做工程化
Google 在 Vertex AI 上开放了 Flash Image 的 API,支持流式调用、参数控制、图像拼接、多图组合等能力,能直接接入产品管线。
目前看,中文体验还是硬伤,和 GPT 差不多。
我实测输入“生成一张夜晚北京胡同里卖糖葫芦的小女孩,有招牌写着老北京糖葫芦”,系统生成图像内容基本准确,但场景里的中文不对:
这是视觉生成模型中最典型的“文本渲染问题”,看起来中文字体识别、排版逻辑、垂直字结构等都需要额外训练。也希望国内的大模型尽快追上来。
目前模型的免费额度控制较严,我是 One 的付费账号,生成次数好像也有节流设计,用来生产素材还是偏慢,图片大小也只有不到 1 M,不过这些应该会很快改进。
有意思的是,Flash Image 推出之后,已经有不少独立开发者在 Discord 上晒出了他们基于该模型开发的 AI 商品图工具、漫画角色生成器、品牌包装自动渲染器……
我的感觉是:AI 视觉工具可以进入工程化时代了。图像模型很早就不缺“会画图”的大模型,但真正把图像变成“可控、可调、可编程”的产品工具的,还不多。目前看 Gemini 2.5 Flash Image 领先了一步。
Flash Image 依靠角色一致性、多图融合、语义控制和编辑能力,构建了一套完整的“图像编程语言”。对普通用户来说,意味着一句话就能“修图”;对设计师来说,它是素材生成器;而对开发者来说,它是 AI 应用里的图像工具。
Google 这次的突破,应该会对所有基座模型厂商都有启发,我推测国内很快会推出类似的图像引擎。AI 时代真是日新月异,今年十分魔幻啊。