模型minimax/speech-2.8-turbo

MiniMax Speech 2.8 Turbo 配音

把文案转成自然的口播:情绪与音色可控,适合短视频解说、口播与有声内容,支持 40 多种语言。

音频

自述文件

MiniMax Speech 2.8 Turbo

MiniMax Speech 2.8 Turbo 把文字转成自然、有表现力的语音,在 Artificial Analysis Speech Arena、Hugging Face TTS Arena 这类语音质量榜上长期排在前面。底座是自回归 Transformer 加可学习说话人编码器,短音频样本就能克隆音色;混合 Flow-VAE 解码器进一步提升音质与自然度。

它的能力

  • 40 多种语言:中英文最好,其他语种也能出声
  • 音色可选:内置 17 个音色,覆盖不同性别、年龄与语气
  • 情绪可控:neutral、happy、sad、angry、fearful、disgusted、surprised
  • 语速可调:0.5x 到 2x
  • 拟声词:文本里直接写 (laughs)、(sighs)、(breath) 这类提示,会加进笑声、叹气等自然音
  • 低延迟:不到 250 毫秒即可出声,适合实时语音场景

内置音色

  • 权威感:Deep_Voice_Man(低沉男声)、Imposing_Manner(威仪男声)、Elegant_Man(儒雅男声)
  • 亲切感:Casual_Guy、Friendly_Person、Decent_Boy、Lively_Girl
  • 元气向:Exuberant_Girl、Inspirational_girl
  • 角色感:Young_Knight、Abbess、Wise_Woman

本平台开放其中 13 个常用音色,默认 English_Wiselady。用 MiniMax 音色克隆训练出的自定义音色同样可用。

适合拿它做什么

  • 口播与解说:短视频解说、产品介绍、课程旁白
  • 有声内容:有声书、播客、长文转语音
  • 角色配音:不同角色配不同音色与情绪
  • 内容本地化:一份文案出多语言版本

上手建议

  • 数字与日期写全拼,例如写"三月十五日、二零二四年",读起来更自然
  • 多人对话给每个角色不同的音色与情绪
  • 听着不自然时,先简化长句、检查标点,再换音色试

定价

档位计价单位单价
默认档次30 积分/次

参数

该模型暂无额外可选参数。