跳到主要内容

Kyrgyz Whisper API

kyrgyz-whisper-medium 基于 OpenAI Whisper Medium 架构,针对吉尔吉斯语进行了专项训练,同时保留俄语与英语识别能力。 适合字幕生成、通话与会议记录初稿、语音内容检索等场景。

:::info 模型升级

原 kyrgyz-whisper-small 已于 2026-09-30 升级为 kyrgyz-whisper-medium(吉尔吉斯语词错率相对下降约 15%), 旧模型名已下线。请将 model 改为 kyrgyz-whisper-medium,其他参数无需修改。

:::

快速开始​

curl --fail-with-body \
-X POST 'https://mzsjai.com/v1/audio/transcriptions' \
-H "Authorization: Bearer ${MOZIA_API_KEY}" \
-F 'model=kyrgyz-whisper-medium' \
-F 'language=ky' \
-F 'file=@audio.mp3'

使用 OpenAI Python SDK:

from openai import OpenAI

client = OpenAI(api_key="YOUR_API_KEY", base_url="https://mzsjai.com/v1")

with open("audio.mp3", "rb") as f:
result = client.audio.transcriptions.create(
model="kyrgyz-whisper-medium",
file=f,
language="ky",
response_format="verbose_json",
)
print(result.text)

请求参数​

参数类型必填说明
modelstring是固定为 kyrgyz-whisper-medium
filefile是音频文件,不超过 25 MB,时长不超过 60 分钟
languagestring否ky(吉尔吉斯语,默认)、ru(俄语)、en(英语)
response_formatstring否json(默认)、text、verbose_json

language 传入其他值会返回 400。模型不做自动语种检测,请按音频实际语言传参。

处理能力​

  • 单次请求同步返回。处理速度约为音频时长的 1/9,短句通常 0.5 秒内返回,10 分钟音频通常在 70 秒内返回。
  • 长音频由服务端按约 30 秒一段在静音处切分后逐段识别再拼接,无需客户端切分。
  • 返回文本包含标点,不含时间戳。
  • 纯静音音频返回空文本。

使用建议​

  • 识别准确率与音频质量强相关:清晰的播音、朗读类音频效果最好;电话录音、强噪声环境下错误率会明显上升。 建议先用一段真实场景的音频试跑后再评估是否满足需求。
  • 一段音频内混用吉尔吉斯语和俄语时,只会按 language 指定的语言识别,混说部分可能出现偏差。
  • 需要逐字级精确记录的场景,建议在识别结果基础上做人工校对。

计费​

按音频时长计费,向上取整到秒。单价见平台模型价格页。