OpenAI最新生图模型实测!网友:完蛋了
一幅超写实风格的画面:雨夜的东京街头,霓虹灯映照在湿漉漉的路面上。前景是一位穿着透明雨衣的年轻女性,手持发光的全息伞;中景有一辆正在缓慢行驶的出租车,车窗内可见司机的侧脸;背景是高楼林立的城市天际线与模糊的人群。电影感构图,浅景深,4K细节。
在生成速度上,Nano Banana Pro更胜一筹,耗时大概15秒完成输出,这包括其思考的过程。可以看到,Nano Banana Pro对复杂提示词中的细节做到了准确还原,不过没有理解“发光的全息伞”这一细节。画面中,出租车和街道的细节都做到了准确的还原。
随后GPT Image 1.5也给出了生成结果,第一眼我们就能感受到明显的“AI味儿”。GPT Image 1.5的画风十分“油腻”,饱和度拉得很高。对于我们明确要求的“车窗内可见司机的侧脸”,GPT Image 1.5做了模糊化处理。人物和背景的融合也并不自然,给人一种处于两个图层的感觉。
如果仔细看,还能发现图中角色右手只有四个手指,这种基础的人体错误对一款2025年的生图模型来说,实在有点不应该了。
接下来的提示词,主要考察模型在风格迁移和语义约束方面的表现:
用梵高《星空》的笔触和色彩风格,描绘一座未来主义太空站的内部大厅:巨大的弧形玻璃窗外是旋转的星云和行星,室内有三名宇航员正在低重力环境中漂浮操作全息界面。保持强烈旋涡状笔触,但结构清晰、物体可辨。
GPT Image 1.5的生成依旧还是慢了半拍,不过这次我们先来看看其效果:虽然画面内容基本准确,但在最关键的强烈旋涡状笔触和色彩风格上,可以说是差强人意,与梵高《星空》原作的区别十分明显。
Nano Banana Pro的生成结果如下。可以看到,在保证细节准确的前提下,模型准确还原了梵高《星空》的画风,色彩风格也更为接近原作。
这则提示词主要考察细节一致性,画面的视角也是非常规视角,能体现模型在边缘场景的能力:
从猫的第一人称视角看到的画面:清晨的厨房,阳光从窗户斜射进来,桌面上有一杯正在冒热气的咖啡和一块咬过的面包。画面下方隐约可见猫的前爪和胡须边缘,广角镜头,温暖色调,生活摄影风格,高细节真实质感。
GPT Image 1.5在这种边缘场景出现了很严重的崩坏。首先,猫只有半张脸长了胡子,鼻子等细节全部丢失了,让人一时无法辨认这是猫脸还是一个小毛球。此外,对背景的虚化其实让图像的真实感更差了。
Nano Banana Pro的生成结果如下,凭画面能一眼判断这是我们要求的猫猫第一视角,光影还原度和细节呈现也符合我们的要求。
也有不少网友分享了对比实测的效果。同样为人物肖像,左侧由GPT Image 1.5生成的画面中,人物的头部过大,光影效果的日常感要差一些。Nano Banana Pro的生成结果虽然面部打光有点不足,窗子有点过曝,不过正是这种瑕疵让图像的真实感更好。
分享这一生成结果的网友称:OpenAI彻底完蛋了。
不过,也有网友补充道,如果在发给GPT Image 1.5提示词里加入“未经处理的iPhone照片”、“低饱和度颜色配置文件”等要求,就能让其效果更为真实。
AI博主Heisenberg分享了最近很火的巨人特效,他认为,相比之下,Nano Banana Pro的结果要自然得多。在细节方面,GPT Image 1.5出现了许多Bug,比如左侧两辆汽车直接面对面行驶,道路上的白线断断续续,Altman的手也显得过大了。
我们还测试了GPT Image 1.5生成中文的能力。在前几个字模型还保持了相对的准确度,但在之后就出现了诸多错误。