跳到主要内容

语音识别

Mozia API 提供 OpenAI 兼容的语音识别接口。上传音频文件,同步返回识别文本,无需轮询任务状态。

接口​

方法路径作用
POST/v1/audio/transcriptions将音频文件转写为文本并直接返回

基础地址:https://mzsjai.com

所有请求都需要 API Key:

Authorization: Bearer <YOUR_API_KEY>

请求体为 multipart/form-data,与 OpenAI 的 audio.transcriptions 接口一致,可直接使用 OpenAI 官方 SDK。

快速开始​

curl --fail-with-body \
-X POST 'https://mzsjai.com/v1/audio/transcriptions' \
-H "Authorization: Bearer ${MOZIA_API_KEY}" \
-F 'model=kyrgyz-whisper-medium' \
-F 'file=@meeting.mp3'
{"text": "Полиция сөөк ал жерде бир күндөй тургандыгын билдирген."}

通用参数​

参数类型必填说明
filefile是音频文件,单文件不超过 25 MB
modelstring是模型 ID,见各模型页面
languagestring否音频语言(ISO 639-1),各模型支持的取值不同
response_formatstring否json(默认)、text、verbose_json

verbose_json 额外返回音频时长与语言:

{"task": "transcribe", "language": "ky", "duration": 86.65, "text": "..."}

支持的音频格式​

wav、mp3、flac、m4a、ogg、webm、aac。采样率与声道不限,服务端会自动转换为 16 kHz 单声道。

计费​

语音识别按音频时长计费,精确到秒并向上取整;识别结果的文本长度不影响费用。 每个模型的单价见模型页面。

可用模型​

模型语言说明
kyrgyz-whisper-medium吉尔吉斯语、俄语、英语吉尔吉斯语专项优化的 Whisper 模型