昨天夸国产大模型争气,今天Vidu Q3就霸榜了
昨天刚夸了国产大模型争气,今天就在国际权威 AI 基准测试机构 Artificial Analysis 的最新榜单里,又看到一个中国视频大模型 Vidu——更准确地说,是 Vidu Q3 在 Video Arena(盲测偏好投票、ELO 排名)里冲到了全球第二,国产第一。
Vidu 超过了 Runway Gen-4.5 ,Google Veo3.1 和 OpenAI Sora 2,仅次于 xAI 的 Grok Imagine。
Vidu Q3 是 Vidu 最新一代的商业级视频模型,在 Text-to-Video 总榜里 ELO 评分是 1242,全球范围内排名第二,中国第一,属于第一梯队里的硬核选手。
Vidu 为什么会吸引我呢?
我之前用过好几个视频模型,视频长度不是五秒就是十秒,Vidu Q3 应该是全球首个支持 16秒音视频直出模型:一次生成完整成片,叙事能力更强。声画同出,高清直出,同时还支持中、英、日多国语言对话。
第二个让我在意的是镜头感。Vidu Q3 把“镜头控制、自主切镜”做成了产品特点:Vidu 能在一个片段里完成建立镜头、推进镜头、特写、反打镜头等多个镜头之间的切换,用户可以通过自然语言提示词控制节奏和运镜。
视频的文字控制也很棒,生成视频时可精准渲染中文、英文、日文三种文字,从字幕、路牌到海报文案,都能直接写进提示词里。
有了这些能力,想象空间一下就打开了,不仅是短剧,还有漫剧、影视剧的内容,呼之欲出。角色、冲突、对白、节奏,加上声画一体和多语种文字渲染,组合起来,就是一条从脚本到视听成片的简易生产线。对内容创作者来说,这种改变在于我们可以更自然地把一个完整的情节、一个清晰的亮点,直接丢给模型去剪辑。
体验地址如下:
Vidu官网:vidu.cn
Vidu 开发者平台:platform.vidu.cn
1、为什么“声画同出和 16 秒”会成为分水岭
过去一年,视频模型的主赛道有点像早期的数码相机:大家盯着分辨率、帧率、稳定性、物理规律……这些当然重要,但它们只解决“画面像不像”。
真正让视频从“素材”变成“内容”的,是声音、节奏:对白、旁白、环境音、音乐、节奏点、停顿和情绪的呼吸,这些都非常重要。
如果你也折腾过各家视频模型,就会发现一个问题:很多模型只管出画面,不管出声音,生成完还得自己再去配音、加音乐、铺环境音。
在 Artificial Analysis 的 Text-to-Video Leaderboard 里,不少头部模型名字后面都跟着一个“(No Audio)”,无声的意思。这些模型在画面维度已经很强了,但在产品形态上,仍然停留在“只给你视频素材”,并没把“声画一体”当成默认交付标准。
Vidu Q3 的产品定义就很直接了,全球首个支持 16 秒 音视频直出模型,一次生成、声画同出、高清直出。
16 秒听起来不长,已经是一个突破了,对于视频来说,多 1 秒表达的内容就会大大增多,16 秒足够完成一次镜头调度(建立空间—推进情绪—落点);也足够让声音有更多的发挥空间。
我试用了一下,Vidu Q3 的 16 秒文字生音视频直出,不仅能生成画面、音频,还可以“完美适配口型”,支持旁白、双人对话、音效、音乐,并覆盖中/日/英三种语言。
文生视频提示词:
两个女生手里拿着咖啡在街上漫步
镜头一(远景,3 秒):路灯、驶过的车辆、柔和的城市背景音
镜头二(中景,5 秒):其中一人轻轻叹气
对白:
朋友 A:“Do you ever feel like you’re stuck??”
镜头三(特写,4 秒):朋友 B 啜一口咖啡,然后露出微笑
朋友 B:“Yeah… but maybe being stuck means we’re about to move.”
时长 15 秒,英文对白加音效和音乐,直出搞定,完全不需要再次配乐和配音了。
下面这两个视频分别是中英文男女对话,侧面有柔和的窗外光线,整体色彩偏灰、低饱和,浅景深,带电影胶片颗粒,机位高度接近人眼视角。整体氛围紧张而亲密,充满压抑已久的失望感。中英文两个版本完成度都很高。
2、镜头控制与自动切镜解决了好不好看的问题
如果说 16 秒和声画同出讲的是一个完整的故事,那么镜头控制解决的就是“这个故事讲得好不好看”。Vidu Q3 强调从运镜到节奏的控制,以及“自动切镜”,它让视频生成从“给我一个画面”变成“给我一段可剪的叙事”。
我们来做个相关案例:
一个写实的真人实拍风格棒球场景:下午的一场比赛正在进行。一位父亲和他的儿子坐在看台上,穿着休闲服,手里拿着零食。
镜头 1(建立场景的远景,3 秒):棒球场全景,观众席欢呼,远处能看到记分牌。
镜头 2(中景,5 秒):父亲把身子微微探向儿子。
对白:
父亲:Which team do you think will win today?
镜头 3(儿子特写,4 秒):儿子神情专注地盯着球场。
儿子: I think the new team they just brought in will surprise everyone.
镜头 4(切回父子同框的双人镜头,3 秒):父亲微笑着点点头。
自然日光,手持摄影的质感,真实的球场观众氛围。
3、 多语言文字渲染:字幕、招牌、海报
视频模型最容易被忽略、但最影响“可用性”的环节,是文字。一段广告、一个路牌、一个片头、一个屏幕 UI,如果文字错了,整个画面再精致也没用,还得用视频剪辑软件重新设计。
Vidu Q3 这次把“文字渲染和多国语言”做成了标配:可精准渲染中/英/日三种文字。
东京夜景航拍,镜头从高空缓慢下降到一块巨型 LED 屏幕。城市环境音+低频电子乐。画面需要清晰可读的三语文字,且字形准确。
1)LED 屏幕先出现中文大字:“声画同出”
2)文字平滑切换为英文:“Audio + Video, Together”
3)再切换为日文:“声と映像、同時に”
最后一帧三行并列排版,字形清晰、无乱码、无错字、无多余符号。稳定推镜+轻微变焦,真实屏幕扫描线与光溢出,夜景反射在玻璃幕墙上。
4、AI 视频逐步可以切入专业级短剧、漫剧和影视剧表达
这里的“剧”不只是短剧平台的剧,更是“有角色、有冲突、有节奏”的内容形态——这样的内容产品要求的是:表演、剪辑、声音这三件事可以同时成立。
这是一个皮克斯式喜剧短片的提示词,效果是这样的:
厨房烤箱内部固定机位,看向外侧。暖色灯光,玻璃门有轻微雾气与反射。饼干在烤盘上逐渐鼓起。蒸汽声、烤箱风扇声清晰。
英文对白,带夸张但自然的动画表演节奏。
Beat 1:面包师贴近玻璃,小声说:
“Today… I achieve perfection.”
Beat 2:他更贴近,紧张补一句:
“Golden edges. Soft center…”
Beat 3:突然停顿,他慌张:
“Wait— did I forget the chocolate ?”
镜头快速切到侧面:同事嚼着饼干说:
“Nope. You forgot the sugar.”
Pixar 3D 动画、表情夸张但节奏精准、音效到位、喜剧停顿明确。
5、从“爆火玩法”到“商业交付”:行业场景开始成形
一通操作玩下来,我觉得用这个产品已经可以创作自己视频号的部分内容了。当视频模型开始默认交付“声画一体、自动切镜和文字渲染”等成果,很多行业场景就不需要再用后期去“补全世界”了。
未来短剧漫剧广告营销、影视生产、自媒体内容、白噪音视频、创意播客……甚至连“开放式办公室四镜头角色演讲 + 环境音效”这种偏制作的脚本都可以创作出来。
最后我给自己做了个“白噪音内容”,晚上催眠用:
雨夜窗边,壁炉火焰燃烧,木质摇椅缓慢摇晃,地上铺白色毛毯。镜头稳定,氛围安静。可循环,无对白,只要环境声。
雨打落叶、微风、壁炉劈啪声、摇椅轻微吱呀声。整体舒缓,不要突然的大音量变化。
写实、暖色、浅景深、细节清晰、画面干净。
6、AI 视频的交付生态变天了
目前 Vidu Q3 在 Video Arena 的 Text-to-Video 领域已跻身全球第二,不仅将单次生成视频的时长从 Q2 的 8 秒跃升至 16 秒,更首次实现了原生音视频同步输出,成为少数真正做到“声画同出”的模型之一。
更关键的突破在于:它的胜出不再依赖某一帧“最惊艳”的画面,而是整个交付形态的质变——一次生成即可获得接近成片的完整内容:对白清晰、节奏流畅、镜头切换自然、文字精准呈现,甚至角色表演都具备可控性。
非常开心看到这种国产视频模型的突飞猛进,这标志着中国的视频模型正在从“技术追赶”转向“内容生产力”的较量。从“制作一支惊艳的样片”迈向“生产多条可直接上线的视频内容”。
我想,这是未来 AI 视频行业竞争的重头戏:不只比拼想象力,更要较量将创意落地为可交付作品的效率与稳定性。期待更多好产品。我要去做自己的视频号内容了~
感兴趣的朋友可以通过下方“阅读原文”进入产品官网体验,使用「MACTALK」这个邀请码注册,可以直接获得 500 积分。