ACE-Step 配乐(可选时长)
写一段情绪与乐器描述就能生成一段器乐;留空歌词是纯配乐,填词也可以唱。时长从 1 秒到 240 秒自由指定,适合给成片铺底。
自述文件
ACE-Step
ACE-Step 是开源的音乐生成基础模型,由 ACE Studio 与 StepFun 联合开发(Apache 2.0 许可)。写一段风格描述就能出曲:歌词留空是纯器乐,填词则可以唱。
架构上是"扩散生成 + Sana 深度压缩自编码器 + 轻量线性 Transformer",换来的是生成速度与可控性:官方给出 15 倍于同类大模型方案的速度,A100 上 4 分钟音乐约 20 秒出。
它的能力
- 文字生成音乐:按风格与情绪描述生成原创器乐,或带人声的曲子
- 时长可控:模型支持 1 秒到 240 秒,本平台开放 15 秒 / 30 秒 / 1 分 / 1.5 分 / 2 分 / 3 分几档
- 歌词可空:留空即纯器乐(短视频配乐最常见的用法),填词则按词演唱
- 可改写:支持歌词改写、重混与风格迁移
适合拿它做什么
- 短视频配乐:按成片长度出底,再挑一版
- 先出器乐底,后期再叠旁白或配音
- 风格探索:同一段描述多出几版,听不同的编曲走向
上手建议
- 描述写具体:乐器、情绪、速度都值得写进去,例如"温暖的原声吉他,慢速,带一点忧郁"。
- 按用途给时长:15–30 秒适合卡点短句,1–3 分钟适合完整段落。
- 多出几版:模型对随机种子与时长比较敏感,同一份输入的结果会不一样,这是常态。
已知限制
- 超过 5 分钟的生成可能丢结构一致性
- 部分曲风与冷门乐器表现偏弱(例如中文说唱)
- 人声质感偏粗,细腻表达有限
- 重绘与续写的衔接处可能出现不自然的过渡
定价
| 档位 | 计价单位 | 单价 |
|---|---|---|
| SHORT | 次 | 60 积分/次 |
| MEDIUM | 次 | 120 积分/次 |
| LONG | 次 | 240 积分/次 |
| 默认档 | 次 | 120 积分/次 |
参数
该模型暂无额外可选参数。