叶小钗

实测 Google Nano Banana:一句话生成漫画、做手办,太稳了

手里有些AI岗位;想找工作的同学可联系,急缺高级产品经理

关注公众号,回复1,与我交个朋友吧

今天周五,写不动技术类文章了,我们来看看最近非常火的 Nano Banana。

Nano Banana是Google在2025年8月底推出的一款革命性的AI图像生成与编辑模型,一经推出就广受好评,对此大家其实不必意外,因为Google在这里早有布局。

早在5月21日,Google I/O 大会上Gemini 2.5 就已经开始崭露头角(应该说之前也很不错),他的Flow + Veo3 + Imagen4表现非常亮眼。这三者组合,就像是给创作者配齐了导演、摄影、视觉总监:

Image

于是基友最近一直在鼓吹创业失败的我:

Image

而AI生成短剧的事情,已经在各种发生了(大家在抖音上经常能看到),从这里可以看出一件事:Google推出Nano Banana并不是偶然,很有可能就是降低了大家使用门槛,对之前产品做了一轮基于用户侧的包装和营销。

然后,Nano Banana 的官方名称是:Gemini 2.5 Flash Image。所以工程化、产品化已经是核心能力啊。

这里先来简单看看其核心Gemini:

Gemini 世界模型

Gemini 2.5 被定位为“世界模型”雏形:能模拟物理、推演场景、规划行动。

如前所述,在这里 Google 已经铺垫多年,他的出现极为厚重:

  1. 在《星际争霸》《围棋》中训练智能体,习得复杂决策策略;
  2. 打造 Genie 2,只需一张图,就能生成完整的 3D 可交互虚拟世界;
  3. 推出 Gemini Robotics,让机器人学会“如何抓住一件物品、执行指令并根据实时环境动态调整”;
  4. 以及最新发布的 Veo,具备对“物理世界直觉”的深刻理解,能精准掌握运动、惯性等背后的规律;

这些能力的交汇,正慢慢把 Gemini 变成一个有感知、有推理、有记忆、有行动力的超级智能体。

一个令人震撼的方向是:借助 Gemini,我们可以轻松地将现实中的物理世界,转化为通过代码和网页仿真的数字世界。例如拍下下面的一张树木的照片,Gemini可以帮你生成游戏模型或者3D模型中的树的结构。

Image

只不过,世界模型是最吃数据闭环的存在,如果没有实时反馈,它只是更大的 GAN 罢了。

因此,基于Gemini这个强大底座,Nano Banana 横空出世并不奇怪,它直接复用 2.5 的统一表征与推理,在同一角色跨镜头保持一致、多图融合能理解前后关系、用自然语言即可精确做局部改动且不破坏全局风格等场景表现都很好。

说这么多,还不如来试一试...

如何使用

当然是直接使用了gemini.google.com,网页左上角切换到2.5Flash,输入框处选择image模式:

Image

国内也有很多免费的地方,大家自己去搜搜。

小说场景

我这里想让他帮我生成一张武侠图:

这种距离下,李景风竟还能挡住去无悔,杨衍佩服,却更悲伤。就在李景风收招瞬间,杨衍已收回野火,缓过一口气,运劲于刀,高高跃起,一刀劈下。
刀上热流犹如烈火天降,焚天灭地,李景风只觉火云罩顶,热浪笼罩身周。此时已避无可避,唯有斜垂初衷,使出龙城九令最后一招——剑出蹄绝没湖声。
初衷自左下向右上扫起,闪电般打了个弯,转而从左上扫向右下,李景风同样没有余地,只能全力反击。
谁犹豫,谁就必败无疑。
一连几声刀剑碰撞的巨响,李景风身后云梯被卷入,骨架尽被斩折,犹如一栋高楼倾倒而下,顷刻间便淹没了两人身影。
片刻之后,惨呼声骤然响彻山洞,一条喷着血的小腿从堆积的碎木中滚出。
——————————
我再给你完整的文字,左边人物跳高点,然后右边人物得做个向上劈砍的动作,有个蹲着往上砍的趋势,对着脚去
飞起来的脚被砍断了,两个人更年轻帅气点,
帮我创造这幅图

GPT:

Image

Gemini:

Image

似乎看不出来差距,我们换个场景,做个手办:

做个手办

Image

额这里因为我没开新窗口,有点污染:

Image

于是新开一个窗口:

Image

说实话,还行!再稍微改下提示词:

Image
Image

最后,来把大的,让他根据我的文章做一个职场漫画:

职场漫画

场景:一家看似光鲜实则暗流涌动的公司大堂,各种员工行色匆匆,脸上写满了疲惫和算计:

Image

镜头一转,导师的表情瞬间变得阴鸷,嘴角勾起一丝不易察觉的冷笑。

职场导师: “…所谓成长,就是认清现实,学会如何站稳脚跟。记住,这个世界从不缺努力的人,只缺会‘做人’的人。”

Image

部门经理: “小王,你这次的报告数据有问题!市场部那边可是很不满意啊。”

小王 (一个唯唯诺诺,戴着眼镜的年轻人,额头冒汗): “经理,我…我核对过好几次了,数据应该没问题啊…”

部门经理: “没问题?那就是市场部有问题?你是在质疑我的判断,还是在质疑公司的权威?”

小王: “不…不是的,经理,我不是那个意思…我再去检查一遍,我一定改!”

女秘书 (心中OS): “哼,这种货色,还想在职场混?连替罪羊都当不好。”

Image

女同事A: “你听说了吗?小王这次可惨了,被经理骂得狗血淋头。”

女同事B: “活该!谁让他平时老是抢着表现,结果弄巧成拙,还不是被推出来背锅?”

男同事 (心中OS): “职场嘛,就是一场表演,看谁演得更真,看谁能笑到最后。”

Image
Image

现在这些文生图模型在中文这块处理都不太好,官方虽然也在强调“可以渲染图中的文字”,并给了提示写法,但成功率受限,尤其是中文这类非拉丁文字。

这里说下整体感悟和结论吧:一致性很高,已经可以做漫画了,只不过其中文字部分自己特别处理下就行。

结语

Nano Banana(Gemini 2.5 Flash Image)的核心特性可归纳为:SOTA 级生成与编辑、卓越的角色一致性、高速生成与低门槛使用。

它不仅实现了平面图转立体手办这类创意玩法,更在换装、换人、换景等实用场景中表现出稳定的迭代能力。

当然,其当前局限也较明确:中文文字渲染成功率不高、复杂场景中偶发定位偏差,使用时也需注意会话污染问题,必要时重新开启。

总体而言,它将强大的模型能力封装成易用的产品,把专业创作工具部分能力成功“降维”为大众效率工具。

Nano Banana 的发布进展对文生图赛道的发展方向具有明确指向性:一致性成为基础能力、可控性趋向结构化、工作流化与多模态闭环、3D 与视频生成合流、成本、合规与可信度协同进化......

总之,Nano Banana 是一次好的开始,这个赛道非常火热,最近3个月国内就会跟进,大家拭目以待吧。

点击上方卡片关注叶小钗公众号,查看下方二维码,添加我个人微信:

Image