赛博禅心

爆料:「阶跃星辰」正开源「文生视频」模型

该模型为 30B 大小,支持生成最长 204 帧(544×992px)视频,效果惊艳。 技术要点: 1. 深度压缩视频 VAE(16×16 空间压缩 + 8× 时间压缩),降低训练/推理成本; 2. 3D 全注意力 DiT 架构,适配动态分辨率; 3. 视频偏好优化(DPO),通过人类反馈提升流畅度与真实感。支持中英文输入,提供基础版(50 步生成)和 Turbo 版(15 步蒸馏加速),实测生成 204 帧视频需 4 块 80GB GPU(12 分钟)。 目前尚未官宣 github:https://github.com/stepfun-ai/Step-Video-T2V huggingface:https://huggingface.co/stepfun-ai