ViMax:1万星的视频生成"导演",但它自己不会拍视频
section-header
AI 视频生成走到 2026 年中,一个尴尬的局面已经摆上台面:
所有 SOTA 视频模型,都只能生成几秒钟的片段。
Veo 3 能出 8 秒,Wan 2.2 能出 10 秒,Sora 的分钟级视频至今是"精选集"——但 YouTube 上随便一个 vlog 是 15 分钟,网剧一集 30 分钟,电影 120 分钟。
不是模型不够好。是 短视频模型天生解决不了长视频问题——人物一致性、场景连续性、叙事节奏、镜头语言,这些不是"更长的单次推理"能搞定的。它们需要一个导演。
这就是 ViMax 做的事情。
stats
● ● ●
ViMax 是什么——不是什么
先说它不是什么:ViMax 不是一个视频生成模型。它不训练 Diffusion Transformer,不做潜空间压缩,不产出像素。
它是什么:一个多智能体编排框架。你把一个想法、一段小说、一个剧本扔给它,它调动 LLM 做叙事规划、VLM 做视觉质量把关、外部视频模型(Veo/Wan/可替换)做实际生成,端到端产出一段有镜头、有转场、人物不崩的多镜头视频。
截止 2026 年 6 月,GitHub 10,406 Star,1,518 Fork,MIT 协议。香港大学数据科学实验室出品,论文刚挂上 arXiv(2606.07649)。
section-header
● ● ●
四种创作模式
ViMax 不跟你谈 prompt engineering。它直接给你四种入口,匹配不同的创作起点:
modes
① Idea2Video — 一个想法 → 完整视频
最"魔法"的模式。你只需要一个概念——"如果一只猫和一只狗是最好的朋友,它们遇到一只新猫会发生什么?"——ViMax 自动完成剧本撰写、角色设计、分镜规划、镜头拍摄、一致性校验全流程。
面向人群:想做但不知道从哪开始的创作者。
② Novel2Video — 小说 → 剧集
把完整小说变成多集视频内容。核心挑战是"叙事压缩"——小说 10 万字,怎么在保留关键情节和人物对话的前提下拆成视频化的场景?
ViMax 的做法:RAG 驱动的长文本脚本引擎,自动分析长篇叙事结构,按场景边界切分,保证关键情节点不被丢弃,同时用人物追踪系统确保每个场景里的角色外貌不崩。
③ Script2Video — 剧本 → 视频
给你完全控制权。你写剧本——可以是一段标准的剧本格式(场景、对话、动作描述),ViMax 负责镜头设计、参考图选择、逐帧生成、多机位模拟。
这个模式最接近"传统影视制作"的思维——你负责创意,AI 负责执行。
④ AutoCameo — 你的照片 → 你的"客串"视频
上传一张自己和宠物的照片,ViMax 把你融入无限种创意剧情中——你可以是武侠片的主角,也可以是科幻片里的路人。人物外观在多场景中保持一致性,交互自然。
section-header
● ● ●
架构:五个智能体如何协作
ViMax 的核心不是"更强的模型",而是把视频生成拆成了五个角色:
| 角色 | 职责 | 核心能力 |
|---|---|---|
| **Screenwriter(编剧)** | 剧本生成与结构化 | RAG 长文本引擎,场景边界识别 |
| **Director(导演)** | 分镜设计与镜头语言 | 多机位模拟,叙事节奏控制 |
| **Producer(制片)** | 参考图管理与素材索引 | 嵌入检索,视觉资产复用 |
| **Consistency Guard(一致性守卫)** | 人物/环境追踪 | 跨时间线依赖图,状态持久化 |
| **QA Agent(质量审核)** | VLM 驱动的多选一 | Best-of-K 选择,帧间一致性校验 |
五个智能体串在一条管道里,每个阶段产出结构化的中间结果(不是黑箱的 latent),下一个阶段基于上游产物继续工作。
这就解决了一个核心问题:当某一帧崩了,你知道是哪一步出了问题——是剧本的镜头描述不够精确?是参考图选错了?还是图像模型自己画崩了?不像单模型黑箱出视频,崩了只能重来。
architecture
关键的"一致性守卫"
长视频最头疼的是第 30 秒的角色和第 5 秒不一样——发色变了、衣服换了、甚至性别都变了。
ViMax 的做法是维护一个跨时间的依赖图(Dependency Graph):每生成一帧,都会把该帧的角色外观特征、环境空间关系、镜头位置记录下来;生成下一帧时,系统从图中检索"最相关的前序帧"作为参考,强制图像生成模型保持一致性。
如果一次生成还是崩了?VLM 会并行生成 K 个候选帧,选出最符合"前后帧一致性"的那一帧——模拟人类剪辑师的"多条拍一条"工作流。
pipeline
为什么并行很关键
同一个镜头内的多个 Shot,ViMax 是并行调度的。举个例子:一个对话场景有 8 个 Shot(正反打、特写、全景),传统做法是串行生成 8 次,ViMax 在依赖关系允许的范围内一次并发跑 4-6 个 Shot。
10,000 Star 的项目,架构上的巧思比"模型更强"更有解释力。
section-header
● ● ●
社区里怎么用
打开 GitHub Issues,能看到真实的用户场景:
- 同人创作:用户把《三体》片段喂给 Novel2Video,生成了一段罗辑与智子的对决场景(用 Wan 2.2 做后端)
- 儿童内容:Idea2Video 模式输入"一个关于刷牙的童话",自动产出了 3 分钟卡通教育视频
- 产品 Demo:有开发者用 Script2Video 生成 App 功能演示视频,替代传统录屏+剪辑流程
- 虚拟人设:AutoCameo 上传人像照,生成"我在赛博朋克世界的一天"风格短片
TUI 模式也值得一提——vimax tui new 启动一个交互式终端界面,你可以在里面和 Agent 多轮对话、回退修改分镜、控制渲染参数,甚至复用之前 Session 的资产。
section-header
● ● ●
限制:诚实地说
① 不产出像素,依赖外部模型
ViMax 自己不生成任何视觉内容。你需要至少配一个图片生成模型和一个视频生成模型。目前官方默认是 Google 的 NanoBanana + Veo,需要 Google API Key。好消息是配置文件支持替换任何兼容 OpenAI API 格式的模型——社区已经有人在用 Wan 2.2 和商用图生视频 API。
② 长视频仍是"多段拼接"
ViMax 产出的"长视频"本质上是多个视频生成模型产出的片段,通过镜头语言和转场设计拼接在一起。它不是真的"端到端生成了 5 分钟的视频"——更准确的说法是"自动编排了 20 个 10 秒片段,让它们看起来像一段完整的视频"。
③ 质量取决于底座模型天花板
如果 Veo 的手部生成本来就有问题,ViMax 的一致性校验只能"从 K 个烂结果里选最不烂的那个"。它不能修复生成模型本身的缺陷。
④ 环境限制
目前只支持 Linux 和 Windows。Mac 用户在官方支持到来之前需要自己折腾。
⑤ 成本
每生成一段视频,要过 LLM(剧本+分镜)→ 图片模型(参考图+N 帧)→ 视频模型(片段生成)→ VLM(质量审核)。一个 3 分钟的视频,API 调用可能上百次。
section-header
● ● ●
和同类项目比
comparison
ViMax 填补的空白很明确:在你和视频模型之间,加了一个"制片团队"。它不取代 Veo 或 Sora,它让这些模型能协同工作。
section-header
● ● ●
Bonus:和 nexu-io/html-video 打配合
调研 ViMax 的同时,我们也深入看了另一个开源视频生成项目:nexu-io/html-video(3.3k Star,Apache-2.0)。它做的事和 ViMax 完全不同,但恰好互补:
html-video 不是"视频生成模型"。它是 Agent 驱动的 HTML→视频渲染器。 你描述一个视频,Agent 选模板、生成 HTML 动画帧,Playwright 录屏,ffmpeg 封装 MP4。整个链路零付费依赖——Chromium(MIT)+ ffmpeg(GPL)。
它有 23 套模板——数据可视化、产品宣传、标题动画、电影级光效——生成的视频文字清晰、图表精美、动效流畅。但它不能生成真实场景,不能做人物,不能讲故事。
这恰好和 ViMax 互不重叠:
synergy
一个完整的视频制作管线可以是:html-video 出片头标题和数据图表 → ViMax 出叙事主体 → 拼接。两个项目都是全开源、全免费——Apache-2.0 + MIT。
如果你在做 AI 视频工具或内容创作,这两个项目值得放进同一个工具箱。它们覆盖的不是同一个问题,但加起来覆盖了"从零到成品"的绝大部分环节。
section-header
● ● ●
我的判断
ViMax 值得关注,但需要看清它的位置:
它改变的不是"视频生成有多好",而是"视频生成能有多长"。 这是两个完全不同的问题。模型研究者关心前者,内容创作者更需要后者。
对谁有用:
- 想做视频但不会剪辑的创作者 → Idea2Video 模式直接可用
- 有剧本/小说但缺制作能力的作者 → Novel2Video / Script2Video
- 想做 AI 视频产品但不想从头搭管道的开发者 → 作为框架集成
对谁没用:
- 追求单帧画质极致的 → 直接调 Veo 3.0,别绕路
- 只需要 5 秒短视频的 → 用原生模型更简单
- 指望 AI 完全替代影视工业的 → 想多了,这只是第一步
最后说一句:10,000 Star 不是因为它"更强",而是因为它回答了视频生成领域一个被忽略的问题——不是所有的好视频都是短片段,长视频的瓶颈不在模型本身,在编排。
这个洞察,比任何模型 benchmark 都重要。
ViMax GitHub: github.com/HKUDS/ViMax
论文: arXiv:2606.07649