速度太快了!Open-Sora 2.0开源来咯!
最近,开源界又迎来了一个大事件——潞晨科技正式推出了 Open-Sora 2.0,一个全新的 SOTA(State-of-the-Art)视频生成模型。
值得一提的是,它只用了 20 万美元(224 张 GPU) 就训练出了 11B 参数 的大模型,而这个规模的模型,通常需要百万美元级别的投资。
如果你对 AI 生成视频有所了解,那一定知道目前主流的视频生成模型训练成本相当惊人。
比如 Meta 训练自己的视频模型,动用了 6000 多张 GPU,花费 数百万美元,而 Open-Sora 2.0 仅用 224 张 GPU,就达到了 媲美 HunyuanVideo 和 30B 参数 Step-Video 的水平,这无疑是一次成本与性能的重大突破。
开源革命:人人可用的高质量视频生成模型
过去,视频生成模型大多由大型科技公司掌控,闭源、高成本、高门槛,让普通开发者难以接触。而 Open-Sora 2.0 这次不仅开源了 模型权重 和 推理代码,还开放了 完整的分布式训练流程,真正让高质量的视频生成技术触手可及。
如果你是开发者,现在就可以直接去 GitHub 下载它的源码,甚至复现完整的训练过程!
体验 Open-Sora 2.0:高质量视频生成的实力展现
在实际测试中,Open-Sora 2.0 在多个关键指标上都达到了业界领先水平,甚至在部分维度上超越了昂贵的商业模型,比如 Runway Gen-3 Alpha。
高清视频与流畅度: 720p 高分辨率 24FPS 流畅帧率 精准的动作控制: 可调节视频中人物或场景的动作幅度 自然的场景过渡: 无论是城市风光还是乡村景色,场景切换都更加自然
更令人惊喜的是,它在业界权威的视频生成评测 VBench 中,与 OpenAI 的 Sora 模型之间的性能差距,从之前的 4.52% 缩小到了仅 **0.69%**,几乎实现了 全面追平!
低成本、高效训练的秘密
过去,训练 10B 以上的开源视频生成模型,成本高达 百万美元,而 Open-Sora 2.0 仅用了 20 万美元。那么它是如何做到的?
1. 高效的训练策略
智能数据筛选: 只选用高质量数据集,避免计算资源浪费。 多阶段分辨率策略: 先训练 低分辨率 版本,学习关键的运动信息。 最后再进行 高清化,降低计算量的同时保证画质。
2. 强大的模型架构
采用 3D 全注意力机制,提升视频质量。 使用 MMDiT 架构,更精准地结合文本与视频内容。 结合开源 FLUX 模型,大幅降低训练成本。
3. 高效的并行计算
ColossalAI + ZeroDP,优化大规模分布式训练。 Gradient Checkpointing 技术,减少显存占用,提高计算效率。 自动恢复机制,确保 99% 以上的计算资源都被有效利用。
4. 高压缩比自编码器,推理速度提升 10 倍
当前主流的视频自编码器,通常使用 4×8×8 结构,导致 单张 GPU 生成 768px 5 秒视频需要 30 分钟。为了解决这个问题,Open-Sora 2.0 研发了一款高压缩比的 4×32×32 自编码器,将推理时间缩短至 3 分钟以内。
这意味着,未来你可以用 更少的计算资源,更快地生成高质量视频。
未来展望:推动 AI 视频生成进入新纪元
Open-Sora 2.0 不仅是一个开源模型,更是一个完整的 生态系统。
论文引用量半年内增长近百次,开源影响力全球领先。 社区活跃,开发者可以共同参与改进模型。 训练全流程开源,降低 AI 研究门槛,让更多人加入创新。
可以预见,未来 高质量、低成本 的视频生成,将会成为行业的新常态,而 Open-Sora 2.0 正在引领这场变革。
👉 GitHub 开源仓库:https://github.com/hpcaitech/Open-Sora
由于一些小伙伴的网站网络不行,在这里我给大家准备了网盘链接:https://pan.quark.cn/s/b7e135bb6848
最后,我为大家打造了一份deepseek的入门到精通教程,完全免费:https://www.songshuhezi.com/deepseek
也可以看我写的这篇文章《DeepSeek满血复活,直接起飞!》来进行本地搭建。
-END-
以上,就是今天的分享了,看完文章记得右下角点赞,也欢迎在评论区写下你的留言。