MiniMax Speech 2.8 Turbo 配音
把文案转成自然的口播:情绪与音色可控,适合短视频解说、口播与有声内容,支持 40 多种语言。
自述文件
MiniMax Speech 2.8 Turbo
MiniMax Speech 2.8 Turbo 把文字转成自然、有表现力的语音,在 Artificial Analysis Speech Arena、Hugging Face TTS Arena 这类语音质量榜上长期排在前面。底座是自回归 Transformer 加可学习说话人编码器,短音频样本就能克隆音色;混合 Flow-VAE 解码器进一步提升音质与自然度。
它的能力
- 40 多种语言:中英文最好,其他语种也能出声
- 音色可选:内置 17 个音色,覆盖不同性别、年龄与语气
- 情绪可控:neutral、happy、sad、angry、fearful、disgusted、surprised
- 语速可调:0.5x 到 2x
- 拟声词:文本里直接写 (laughs)、(sighs)、(breath) 这类提示,会加进笑声、叹气等自然音
- 低延迟:不到 250 毫秒即可出声,适合实时语音场景
内置音色
- 权威感:Deep_Voice_Man(低沉男声)、Imposing_Manner(威仪男声)、Elegant_Man(儒雅男声)
- 亲切感:Casual_Guy、Friendly_Person、Decent_Boy、Lively_Girl
- 元气向:Exuberant_Girl、Inspirational_girl
- 角色感:Young_Knight、Abbess、Wise_Woman
本平台开放其中 13 个常用音色,默认 English_Wiselady。用 MiniMax 音色克隆训练出的自定义音色同样可用。
适合拿它做什么
- 口播与解说:短视频解说、产品介绍、课程旁白
- 有声内容:有声书、播客、长文转语音
- 角色配音:不同角色配不同音色与情绪
- 内容本地化:一份文案出多语言版本
上手建议
- 数字与日期写全拼,例如写"三月十五日、二零二四年",读起来更自然
- 多人对话给每个角色不同的音色与情绪
- 听着不自然时,先简化长句、检查标点,再换音色试
定价
| 档位 | 计价单位 | 单价 |
|---|---|---|
| 默认档 | 次 | 30 积分/次 |
参数
该模型暂无额外可选参数。