MacTalk

真正的一句话修图:Gemini 用香蕉模型给出了图像生成的分水岭

前几天墨问的大师发给我一张图,一看吓一跳,这不是我自己之前在电梯里的随手拍嘛,被大师做成了手办:

Image

这个手办图不仅完全还原了我的表情和姿态,衣服的垂感,还补齐了鞋子,包括我提的吨吨壶,并且在Mac上展示了原照。太神奇了。

大师说这是 Google 的新模型 nano-banana,大意就是小香蕉的意思,生图的一致性非常牛逼。

8 月 26 日,Goolge 把香蕉的真名亮了出来:Gemini 2.5 Flash Image,现在已经可以在 Google 的 AI Studio 里使用体验了,还是 Preview 版本,我试了一下,果然不错:

Image

“图像一致性是传奇,通过文本编辑图像是未来。” 这是很多使用了 Gemini 2.5 Flash Image 用户的评论。

过去一年,大模型行业进展神速,生成文本的功能都快卷死海了,语音和视频领域 GPT-SoVITS 等新星也纷纷出道,图像的生成和 AI 编辑,还是非常难以控制,有点一言难尽。之前的 Midjourney 和 GPT 也没有解决这些问题。

这次 Google 出手了。

Gemini 2.5 Flash Image 作为 Gemini 2.5 系列的一部分,并非单纯玩“文本生成图片”,而是一个系列:多图融合 + 角色一致性 + 文本控制 + 精准编辑,最终组合成了一个视觉 AI 能力集合。很显然,Google 瞄准的不是 Midjourney 用户,而是下一代 AI 应用的图形图像引擎。

TechCrunch 给出的描述更贴近普通用户:它把图片编辑的细粒度控制下放到自然语言里,同时对人脸/宠物/细节保持一致,并正面追赶 OpenAI 等竞品的图像工具。

打开 Google 的 AI Studio,选择 Gemini 2.5 Flash Image Preview:

Image

最明显的就是那个熟悉的 prompt 输入框。

Image

和传统文生图模型不一样的是,这次 Gemini 2.5 Flash Image Preview 多了两个重要能力:

一个是「多图融合」,第二个是「角色一致性控制」。

举个例子:假设你上传两张产品图,分别展示了前脸、正面全景图,还有一张人像,接着输入 prompt:“根据我上传的图片,生成一张在办公桌面环境下,这位女士头戴这款耳机使用 Mac 电脑的工作场景照片。配合暖色调的灯光,类似咖啡馆氛围。”

Image

Gemini Flash 会在渲染时自动提取各图视觉特征,融合成一张风格统一、光影自然的“合成照”,我还可以通过自然语言编辑图片,比如把黑色鼠标换成苹果鼠标等等。

Image

这里需要讲一下角色一致性,这几乎是目前所有图生图模型的痛点。Midjourney 出一张图帅气无比,但第二张就可能面目全非,控制不住角色、姿态、面部细节。Flash Image 不一样,它在角色建模上引入了图像 Embedding 和 Token Trace 技术,能通过上传的图片锁定特征点,确保每次渲染都能“还原你的人设”。

社区评价是:“consistent is legendary”(角色一致性堪称传奇)。

我的实验结果也确实如此。

- 多图融合
- 角色一致性
- 提词语义跟随
- 编辑精度高

Flash Image  正在实现从玩具到工具的进化:编辑图像,就像写一句话。

上传一张产品图,说:“请去掉背景中的手指,只保留产品本身”,Flash Image 会自动识别前景与干扰物,干净利落地完成擦除。再来一句:“增加一些日落的光线”,它会重建场景细节,并重投光影逻辑,整体质感还是不错的。

Image

这套自然语言编辑能力,本质上是 Flash Image 背后的 Prompt-to-Edit 模型在起作用。它既识图,也识词,把语言指令转化为像素操作。

过去我们调图靠的是 Photoshop 的蒙版 + 涂抹 + 调色曲线,现在只需要“说一句话”。

这东西再往前走一走,对于 UI 设计、广告渲染、电商商品图生成、品牌视觉统一、甚至插画创作上,都有极大的价值——如果这个产品生成的图片质量和大小能够持续进化(这简直是一定的)——AI 就会变成图像创作的 IDE。

目前我在 AI Studio 里使用这个 Preview 的模型,感觉图片质量比 GPT 生成的差一些,不知道产品限制还是我的用法不对,但精确控制确实无敌。

从商业角度上看,除了模型本身的能力,在体验层面上,Gemini 2.5 Flash Image 做了三件聪明的事:

1、速度快得离谱

国外用户使用 Flash Image 的响应速度非常快,通常几秒钟秒就能出图。在 A100、TPU 上跑多线程渲染时,甚至比 Midjourney 快一倍以上,得益于 Google 对 TPU v5 架构的优化。

2、便宜,单张图不到 3 毛钱

这是目前全网最便宜的图像生成服务之一。Gemini Flash 的 API 定价约为 $0.04 / image,折合人民币不到 0.3 元。和 OpenAI 的 DALL·E 相比便宜一大截。更关键是,它默认支持 SynthID 数字水印,适用于内容合规、品牌标记、版权追踪等场景。

这是在告诉开发者:“放心接入,我替你把隐私和标记问题都想好了。”

3、API 可用,开发者可以直接上手做工程化

Google 在 Vertex AI 上开放了 Flash Image 的 API,支持流式调用、参数控制、图像拼接、多图组合等能力,能直接接入产品管线。

目前看,中文体验还是硬伤,和 GPT 差不多。

我实测输入“生成一张夜晚北京胡同里卖糖葫芦的小女孩,有招牌写着老北京糖葫芦”,系统生成图像内容基本准确,但场景里的中文不对:

Image

这是视觉生成模型中最典型的“文本渲染问题”,看起来中文字体识别、排版逻辑、垂直字结构等都需要额外训练。也希望国内的大模型尽快追上来。

目前模型的免费额度控制较严,我是 One 的付费账号,生成次数好像也有节流设计,用来生产素材还是偏慢,图片大小也只有不到 1 M,不过这些应该会很快改进。

有意思的是,Flash Image 推出之后,已经有不少独立开发者在 Discord 上晒出了他们基于该模型开发的 AI 商品图工具、漫画角色生成器、品牌包装自动渲染器……

我的感觉是:AI 视觉工具可以进入工程化时代了。图像模型很早就不缺“会画图”的大模型,但真正把图像变成“可控、可调、可编程”的产品工具的,还不多。目前看 Gemini 2.5 Flash Image 领先了一步。

Flash Image 依靠角色一致性、多图融合、语义控制和编辑能力,构建了一套完整的“图像编程语言”。对普通用户来说,意味着一句话就能“修图”;对设计师来说,它是素材生成器;而对开发者来说,它是 AI 应用里的图像工具。

Google 这次的突破,应该会对所有基座模型厂商都有启发,我推测国内很快会推出类似的图像引擎。AI 时代真是日新月异,今年十分魔幻啊。