语音识别
Mozia API 提供 OpenAI 兼容的语音识别接口。上传音频文件,同步返回识别文本,无需轮询任务状态。
接口
| 方法 | 路径 | 作用 |
|---|---|---|
POST | /v1/audio/transcriptions | 将音频文件转写为文本并直接返回 |
基础地址:https://mzsjai.com
所有请求都需要 API Key:
Authorization: Bearer <YOUR_API_KEY>
请求体为 multipart/form-data,与 OpenAI 的 audio.transcriptions 接口一致,可直接使用 OpenAI 官方 SDK。
快速开始
curl --fail-with-body \
-X POST 'https://mzsjai.com/v1/audio/transcriptions' \
-H "Authorization: Bearer ${MOZIA_API_KEY}" \
-F 'model=kyrgyz-whisper-medium' \
-F 'file=@meeting.mp3'
{"text": "Полиция сөөк ал жерде бир күндөй тургандыгын билдирген."}
通用参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
file | file | 是 | 音频文件,单文件不超过 25 MB |
model | string | 是 | 模型 ID,见各模型页面 |
language | string | 否 | 音频语言(ISO 639-1),各模型支持的取值不同 |
response_format | string | 否 | json(默认)、text、verbose_json |
verbose_json 额外返回音频时长与语言:
{"task": "transcribe", "language": "ky", "duration": 86.65, "text": "..."}
支持的音频格式
wav、mp3、flac、m4a、ogg、webm、aac。采样率与声道不限,服务端会自动转换为 16 kHz 单声道。
计费
语音识别按音频时长计费,精确到秒并向上取整;识别结果的文本长度不影响费用。 每个模型的单价见模型页面。
可用模型
| 模型 | 语言 | 说明 |
|---|---|---|
kyrgyz-whisper-medium | 吉尔吉斯语、俄语、英语 | 吉尔吉斯语专项优化的 Whisper 模型 |