Matrix TTS 上手:零样本声音克隆与多语种合成
· 阅读需 2 分钟
matrix-tts-v1 是什么
- 零样本:提供一段参考音频即可克隆音色,无需额外训练
- 多语种:支持中文、英文、日语、西班牙语、法语、阿拉伯语等语种
- 音色控制:可调整语速,并按性别、年龄、音调等属性设计音色
- OpenAI 兼容:通过
/v1/audio/speech接口调用
使用 SDK 生成音频
matrix-tts-v1 没有预置音色,可以省略 voice 参数。默认输出为 WAV。
from openai import OpenAI
client = OpenAI(base_url="https://mzsjai.com/v1", api_key="<你的 Key>")
speech = client.audio.speech.create(
model="matrix-tts-v1",
input="你好世界,这是 Matrix TTS 生成的语音。",
)
speech.stream_to_file("hello.wav")
使用自己的声音
把参考音频转成 Base64,放进 JSON 请求体的 ref_audio 字段:
REF_B64=$(base64 -i my-voice-sample.wav | tr -d '\n')
curl https://mzsjai.com/v1/audio/speech \
-H "Authorization: Bearer <你的 Key>" \
-H "Content-Type: application/json" \
-d "{
\"model\": \"matrix-tts-v1\",
\"input\": \"用我的声音念这句话\",
\"ref_audio\": \"${REF_B64}\"
}" \
--output cloned.wav
参考音频通过 JSON 字段传入,不使用 multipart 文件上传。建议用 5~15 秒、单人、无背景噪音的录音。
常见用法
- 播客和短视频配音
- 多语种内容本地化
- 角色或游戏 NPC 配音
- 为文章生成音频版本
计费
语音合成按 Token 计费,输入文本与输出音频分别计量,其中音频时长按每分钟约 1000 Token 折算。 实际价格以模型价格和账单记录为准。
完整文档
本文只覆盖最常用的流程。完整的参数说明、音色设计词典、输出格式差异和错误码,请查阅 语音合成文档。