OpenAI一更新,把我朋友圈变成了吉卜力?
自打前天凌晨,奥特曼这老小子发布了 GPT-4o 文生图模型以后,哥们是真被这玩意给刷屏了 。
甚至我一打开小红书,首页推送的好多也都是拿 GPT 画画的。。。
可能有差友还不知道这是发生啥了,简单说吧,OpenAI 放出来了个 GPT-4o 文生图模型,这玩意直接让用嘴 P 图、敲字画图的离谱需求,成了可能。
你瞅瞅他们官网的演示案例,像什么抓拍的马克思、心有猛虎的小猫;还有让简单的草图变成照片、让倒影里的摄影师转过身来和你击掌啥的,这特么你告诉我居然没P图?
爽玩了一天以后,我只能说, 虽然瑕疵还是有不少,但至少从四个方面看,OpenAI 这一波的生图功能,确实又秀又6。
首先,画面保持和图片风格转化方面 ,4o 主打一个驾轻就熟。 在经过了金毛火锅的同意下,我们拿出了一张火锅和机器狗的对峙照片,来让 AI 转成漫画版。
你瞅瞅,这神态,真别说还挺对味的。
反过来, 把画改成真实风格,这玩意搞得也不错 ,我们也上传了一张刻在不少人基因里的孔子图片,让它以此为原型,生成一张真实照片。
反正看到效果,不知道大伙们感受到一股时空穿越的感觉没?
下面这几幅都是 同一套提示词搞出来的 ,依次是 Midjourney , ImageFX , GPT-4o和之前挺火的 Gemini-2.0-flash-exp 。
很明显,GPT-4o 和 Midjourney 是一档的,而且效果可以说遥遥领先于同行。。。
而接下来的四点,可能真的就是 Only OpenAI can do 了。
第一个是在文本的渲染上,4o 模型这次残暴得甚至有点可怕。 看下面这个,我让他生成一个学者在白板上写量子力学的公式和理论,虽然内容我也基本告诉它了,但这又有数学公式又有框图的,怎么说也很难整对吧。
以防大伙们不知道这是个啥水平,相同的提示词,我用 OpenAI 某友商旗下的模型试了试,效果是这样的。
虽然看起来是那么一回事儿,但细看一下图里的文字内容,你就知道为啥 OpenAI 这波有点强得离谱了。
第二个就是在多主体的生成上,4o 模型这次主打一个又准又狠。 比如大伙们请看这段提示词,小小的一段话里面暗藏玄机,7个不同的元素里,个数和颜色都不一样。。。
其他模型这边,则直接慌了阵脚,交出了这样的作业,在数字上翻了车。
反观 OpenAI 这边,分毫不差地执行了咱的要求,稳如老狗简直是。
而且你要回头细品,还会发现 OpenAI 的图里元素都不是跟别的模型一样随机摆放的,而是有设计,像是一个有故事的动画场景一样。。。
最后一点,我觉得最牛的,那就是 4o 的图片生成模型在对于文字和图像的理解这方面,就跟长了脑子一样。 比如说在复杂指令, 特别是在长文本上理解上 ,它不仅能搞懂你想表达啥,还跟开挂一样,能把你要的那个画面直接给到。
很刁钻是吧,就是像这种复杂指令,你看看它怎么处理。
该说不说,看到这个图的时候我是真没想到,这人家都能画出来,还是写实风格的,用光影搞了一个透明的空气大象。
所以说,这 OpenAI 也是支棱起来了,在大家都以为他要拉的时候,搞出来这么一个牛逼哄哄的东西。
在技术博客里,OpenAI 说他们用的是自回归方法 ,而不是以前文生图里常用的Diffusion 扩散模型。前者是不停靠之前的信息来预测后面的,再用后面的预测更后面的;Diffusion 则是让模型从一堆乱码中,逐渐从混乱变清晰。
相比 Diffusion,自回归的好处恰恰就是在语义识别上更牛,特别是你要给出唠唠叨叨的一大串需求的时候,以前的文生图模型就理解不全面,所以大家老是没法跑出来符合自己心意的图。
好玩的是,OpenAI 第一次大火就是在用了自回归 Transformer 模型的GPT-3.5上, 没想到现在图片生成领域,他们又靠着自回归扳回一局。
或许也因为是自回归模型的原因, GPT-4o 生成的图片也会出现一些大模型幻觉 。
但这倒不是多根手指啥的,而是图片元素如果过多,或者长度太长,到后面就会崩了。
比方下面这个,我们让它生成一堆元素贴纸组成的海报:
结果虽然你一打眼觉得它好像搞得像模像样,但细看就会发现,它多搞了机器人和冲浪者,弄丢了无人机,就还是比较马虎的。
官方博客还说,他们虽然在拉丁文字处理上整挺好, 但对别的小语种,就不大行了。
但话又说回来,这其实也都能理解。照我看,相比 GPT-4o 尚有的这些小缺点,这玩意给业界最大的震撼恐怕还不止是图片质量, 而是它越来越让人意识到,AI更新的速度实在是太快了。
比如有个老哥,看到 GPT-4o 的效果以后,心态就崩了。
好不容易花了大把时间,又是琢磨提示词,又是各种调参,刚把一个提示词或者工作流弄得差不多能打个 70 分了,结果没过几天,人家又冒出来个知识库加工作流的新玩意儿,直接把之前的努力给顶替了。等你刚适应了知识库加工作流,还没捂热乎呢,更厉害的智能体又来了。
也就是说,模型能力强了,很多以前需要我们绞尽脑汁去琢磨的东西,模型自己就能轻松搞定,我们的创造力也能更自由,而这,才是技术爆发时代对人的红利。
撰文 :纳西 编辑 :江江 & 面线 美编 :焕妍
图片、资料来源 : OpenAI,X(@remixdesigner),小红书等,部分图源网络