VEED Fabric 1.0 上线:一张图片 + 你的声音,1 分钟出片
我今天看到个挺有意思的…VEED 把一个叫 Fabric 1.0 的东西正式端上来了。简单讲就是:拿一张图,配上你的声音,它就开始“张嘴说话”,而且不是那种木头嘴,嘴型对词儿还挺跟得上,表情也会动,眼神不是死的…我反正看了两遍才反应过来这是张静态图。
等等,我先把我关心的点捋一下(别嫌我碎)—— 第一,它不是一个“玩具小插件”,而是 VEED 新立的模型线,入口在他们家“AI 视频模型”那儿就能看到 Fabric 1.0 的牌子,说明这事不是临时蹭热点。
第二,唇形这块他们还单独发了个 Lipsync API,说是“世界上最强的唇同步技术”…反正官方自信满满,开发者也能直接对接做大规模内容。这个点对本地化/多语言挺香。
第三,用途他们自己都写死了:社交广告、产品演示、播客、UGC、教学/How-to…基本凡是“要有人出镜说话”的场合,都能拿它糊一版出来再测。
对了,时长这个我纠结了一下。有人在 X 上说“单条 1 分钟”,也有人说“能到 3 分钟”…这信息现在有点乱,官方页面没明确写死上限。我保守点,先按 1 分钟规划,真要讲长段子就切块拼。你要赌 3 分钟,等他们把字写清楚再说。
怎么用呢…就很“偷懒友好”:丢一张正脸清晰的图,配一段音频(自己录或 TTS 都行),它生成完你直接在 VEED 编辑器里加字幕、logo、尺寸改 9:16,发。这个从“图→会说话→在线剪辑”的闭环,VEED 本来就熟门熟路。
我脑袋里已经开始乱飞了: — 社交广告 A/B:同一人设图,十条文案十条口播,半天跑一轮,谁点穿就谁上预算。
— 产品还没发、先把“上手讲解”做出来,等真机来了只补镜头。这个对早期团队太省了。
— 播客音频切段做“会说话封面”,平台刷存在…哦对,他们本来就有“会说话照片”的老工具线,Fabric 更像是把这招升级成模型引擎。
小提醒(不是泼冷水,就是防坑):
— 时长别赌最大值,现在社区口径不一;保守做 60 秒版就好,长内容切段拼接,稳定第一。
— 想要嘴型更丝滑、配多语言,直接把 Lipsync API 拉上,尤其做本地化口播那种,你会明显感觉“对嘴更稳”。
— API 这边是等候名单/申请制,别想着今天申请今天就能批量跑,先在网页里跑通流程更稳。
说回个人感受吧…我总觉得这波不是“虚拟人又来一波”,而是把“口播生产线”给拆解了:美术出人设图 + 文案/音频 → 批量口播视频 → 线上剪一点点包装,就能把“必须真人说”的坑位填上。团队小、预算紧的,可能一夜之间就能把“有脸、有嘴型”的内容给铺起来。对了,我还想试试一个“同一张脸多语言讲解”的系列,看看 TikTok 和 Shorts 哪个吃这套…要不你也整两条试试?万一爆了呢。 反正就这样,我去找一张顺眼的头像先跑一条玩玩了。
体验链接:veed.io/ai/fabric-1-0
-END-
我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html