模型lucataco/ace-step

ACE-Step 配乐(可选时长)

写一段情绪与乐器描述就能生成一段器乐;留空歌词是纯配乐,填词也可以唱。时长从 1 秒到 240 秒自由指定,适合给成片铺底。

音频

自述文件

ACE-Step

ACE-Step 是开源的音乐生成基础模型,由 ACE Studio 与 StepFun 联合开发(Apache 2.0 许可)。写一段风格描述就能出曲:歌词留空是纯器乐,填词则可以唱。

架构上是"扩散生成 + Sana 深度压缩自编码器 + 轻量线性 Transformer",换来的是生成速度与可控性:官方给出 15 倍于同类大模型方案的速度,A100 上 4 分钟音乐约 20 秒出。

它的能力

  • 文字生成音乐:按风格与情绪描述生成原创器乐,或带人声的曲子
  • 时长可控:模型支持 1 秒到 240 秒,本平台开放 15 秒 / 30 秒 / 1 分 / 1.5 分 / 2 分 / 3 分几档
  • 歌词可空:留空即纯器乐(短视频配乐最常见的用法),填词则按词演唱
  • 可改写:支持歌词改写、重混与风格迁移

适合拿它做什么

  • 短视频配乐:按成片长度出底,再挑一版
  • 先出器乐底,后期再叠旁白或配音
  • 风格探索:同一段描述多出几版,听不同的编曲走向

上手建议

  • 描述写具体:乐器、情绪、速度都值得写进去,例如"温暖的原声吉他,慢速,带一点忧郁"。
  • 按用途给时长:15–30 秒适合卡点短句,1–3 分钟适合完整段落。
  • 多出几版:模型对随机种子与时长比较敏感,同一份输入的结果会不一样,这是常态。

已知限制

  • 超过 5 分钟的生成可能丢结构一致性
  • 部分曲风与冷门乐器表现偏弱(例如中文说唱)
  • 人声质感偏粗,细腻表达有限
  • 重绘与续写的衔接处可能出现不自然的过渡

定价

档位计价单位单价
SHORT次60 积分/次
MEDIUM次120 积分/次
LONG次240 积分/次
默认档次120 积分/次

参数

该模型暂无额外可选参数。