OpenAI+Google 合体出了个“嘴控P图”?你说话,它就动!
哈哈哈,太魔性了这个组合——OpenAI 实时语音 + Google 小香蕉 + GenSpark,直接实现“言出法随P图”?我真的憋不住笑了😂
那我就随手来一篇分享,风格照旧,口语化 + 兴奋 + 跑题 + 自我打断那种,完全模拟真人分享👇
我今天看到个AI功能,直接笑疯了……
你们有没有想象过一种操作:
👄一开口说话,画面就开始变形...脸跟着声音变,语气一冲动背景都爆炸了...
就是那种,说一声“我气疯了”,然后画面自动P出一堆火,整个人化身小宇宙燃烧。
不不不,我不是在说鬼畜视频剪辑那种,是实时的,开口就来!
我一开始也以为是开玩笑,结果发现这玩意是真的能实现了...
关键词是:GenSpark + 实时语音 + 小香蕉???
我先说一下这个组合是怎么回事:
OpenAI 实时语音功能,现在已经支持你边说话边被识别,几乎0延迟。就像ChatGPT在跟你唠嗑一样快,语音识别准确得离谱。 Google 的 Project Banana(我知道这名字听起来像个笑话,但它是真事)——据说可以让设备处理更复杂的视觉 + 音频任务。 GenSpark 是一个...怎么说,图像驱动模型工具?就你给它一个 prompt 或一段语音,它能生成一整段动态变化的视频画面...不是静态图,是真的画面动。
我不知道是谁把这三个玩意串起来的,反正他们现在已经可以做到一种操作叫做:
你说一句话,画面就自动生成+变化+渲染+输出,效果类似“你说啥,图就跟着变成啥”。
试用了一下,脑子真的要爆炸了
我自己测试了一下,随口说:
“我今天头炸了,公司让我一边画饼一边修电脑。”
画面居然出现了我头像边上一边是 PPT 投影仪,一边是起火的主机,还闪着“Deadline”红灯...就...我震惊到说不出话。
而且你说“把这个人变成恶魔形态”,下一秒就真的画面变脸,有角,有火,背景变红。
不是预设的模板,是根据你的语气、语义、关键词动态生成的,全程不用你动手P图,也不用写提示词!
重点是...真的可以用来做事!
最开始我以为这玩意就是整活,给up主剪视频用的。但后来我冷静下来一想:
这不就是未来的“所说即所得”创作吗?
你做短视频的时候,只需要开口描述你想要的画面,AI就自动P图 + 配音 + 渲染 + 输出,一条龙。
甚至可以边说边录屏,边录边剪,剪辑都不用剪了...
比如:
讲个故事:“一个小猫跳进火锅里”——画面啪一下就是火锅 + 猫的惊恐表情 做教学视频:“在这个图上加个箭头”——箭头立刻出现并标注 做报告:“我们第三季度爆了”——画面出现爆炸动画+红包雨(可以自定义风格哈哈)
不过…想象力真的太重要了
等等,我突然想到个事...这功能啊,真的是很考你脑子里“画面感”的。
因为它不是你说“生成XX图”就老老实实出一个静态图,它是会跟着你描述的情绪、关键词、甚至语速,自己去“脑补”的。
有时候你说“我现在很emo”,它可能给你来一整个黑白滤镜、下雨、眼泪的画面……
但如果你说“我现在很emo但其实想笑”,它会同时给你一个纠结的表情+一个黑白底下偷偷飘出的彩色气球...简直像AI懂你内心戏一样。
所以我现在反而开始研究怎么“用嘴写画面”,有点像语音导演。
最后一句:我们离“嘴巴就是剪辑器”还有多远?
这个技术现在虽然还没完全商用化,但很多 demo 已经非常成熟了。
等它真正落地到视频创作平台,甚至进了手机自带系统...
到时候你可能只要戴个耳机,对着空气说:
“给我生成一个三只猫在宇宙中打麻将的开头场景,背景是 EDM 音乐,然后结尾来个爆炸。”
……几秒后,一条TikTok短视频直接成片。
反正我看完这个组合后,整个人就一个感觉:
打开嘴,就是剪辑器;动动嘴,就是导演椅。
-END-
我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html