「ACE-Step-v1.5(2B)」音乐模型,10 秒之内给你整一首完整歌曲
本地AI做音乐这块,今天算是真正被点燃了。 CE Studio 直接扔出一个「ACE-Step-v1.5(2B)」音乐模型,上来就放狠话:10 秒之内给你整一首完整歌曲,质量介于 Suno v4.5 和 v5 之间。 云上 Suno 还在排队,本地这边已经开始秒出歌了——这波操作我服。
从官方数据看,这玩意儿的速度有点离谱。 A100 上生成一整首歌,不到 2 秒就搞定;哪怕是很多玩家家里更常见的 RTX 3090,也能稳稳控制在 10 秒以内。 而且不是只能来几秒 demo,那种「试用味」,它直接支持 10 秒到 10 分钟的音频长度,一整张迷你 EP 都给你干出来。
更关键的是,它不是那种「能响」级别的玩具模型。 ACE-Step-v1.5 官方号称支持 1000+ 种乐器和风格,电音、交响、爵士、摇滚想怎么拧就怎么拧。 歌词这块也没拉胯,支持 50+ 种语言生成,中文、英文、日文、韩文都能一站式解决,做跨语种专辑都不是问题。
很多人看到这里的第一反应肯定是:听起来很强,那本地跑得动吗? 答案还挺香的——本地运行只需要不到 4GB 显存。 这意味着什么?不用顶配工作站,很多游戏本、主流台式机都能跑起来,门槛直接拉到地板上。 而且还支持批量生成,一次最多扔 8 首歌一起出,对做素材、做商用库的同学非常友好。
功能细节上,ACE-Step-v1.5 也尽量把「专业活」往一站式工具上堆。 你可以用参考音频引导生成,让新歌在氛围、节奏上贴近某首参考曲。 也可以做「风格翻唱」——从现有音频里,按指定风格再唱一遍,给自己的作品来个不同版本。 想局部修音频,也有“音频重绘”,选中一段重新生成,相当于音乐圈的局部重绘版 PS。
做后期的同学会更关心多轨能力,这次也给到了。 它支持音轨分离,可以把一首完整歌拆成独立音轨。 在此基础上再做「多轨生成」:给现有音频加新图层,比如额外加一层铺底合成器、一个氛围人声,细节随便叠。 还有一个挺实用的小功能:人声转伴奏,为干人声自动生成背景音乐,做 demo、做短视频 BGM 都很实用。
最有潜力的还是 LoRA 训练这块。 官方给的说法是:只需要 8 首歌曲,再加上大概 1 小时训练时间(3090,12GB 显存),就能搞出一套属于你自己的个人风格 LoRA。 这意味着什么?音乐人、制作人、甚至 UP 主都可以把自己的风格「固化」成一个模型,之后一键批量出同风格新曲。 以前是靠耳朵和手复刻,现在直接变成了「风格资产」。
生态这块,社区也已经开始跟进了。 小互在 X 上已经发了,ComfyUI 现已支持 ACE-Step 1.5,节点挂上去就能走可视化流程。 想折腾的同学可以直接去 GitHub 下模型、在 ComfyUI 里搭图,跟玩图像工作流一个逻辑,门槛比传统音频工作站低太多。 对很多已经熟悉 ComfyUI 的玩家来说,这几乎属于“顺手升级一个音乐 DLC”。
如果把 ACE-Step-v1.5 放回整个音乐 AI 的盘子里看,它的意义其实不只是「又多了一个模型」。 云端的 Suno 一直很强,但版权、隐私、商用条款、排队时间,总会让人有点顾虑,本地开源模型补的就是这个缺口。 现在只要你有一台能跑的机器,就可以把创作、训练、导出全部关在自己硬盘里,真正做到「歌曲和风格都在自己手上」。
后面要看的,就是社区能不能玩出更多花样。 比如针对特定风格的 LoRA:电子、国风、ACG、影视配乐专用模型; 再加上工作流封装成一键脚本,给不会 DAW 的普通用户,变成「选风格 + 输提示词 = 出歌」的懒人模式。 如果这条路跑通了,本地音乐生成这块,可能真会迎来一波「人人都有自己的 AI 作曲助手」的小爆发。
你现在对 AI 写歌是期待更多,还是担心「人类音乐人要失业」? 欢迎在评论区聊聊你最想用它来干嘛:做歌、做 BGM 还是给自己做一张 AI 专辑。 后续如果你们感兴趣,可以再详细拆一拆:怎么在本地跑 ACE-Step、怎么用 LoRA 做个人风格,顺便找时间实测一下它和 Suno 的差异,到底有没有把牙膏再挤爆一层~
开源地址:github.com/ace-step/ACE-Step-1.5