语音转文字

POST /v1/audio/transcriptions 接收 multipart/form-data,而不是 JSON:model 作为表单字段发送,录音作为名为 file 的文件字段发送。响应为 {"text": "…"}。POST /v1/audio/translations 的格式相同,返回英文。与视频端点不同,这个接口是同步的,因此较长的录音会一直占用连接,直到处理完成。

POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -F model=stepaudio-2.5-asr \
  -F file=@speech.mp3

# {"text":" China api text to speech verification."}
成本最低

stepaudio-2.5-asr

同类还有 stepaudio-2-asr-pro。stepaudio-2.5-asr 是本端点上最便宜的转写模型,价格远低于其他模型;pro 版本的价格约为它的 15 倍,只有在困难音频上确实看重准确率时才值得选用。

流式版本

stepaudio-2.5-asr-stream

它是为流式识别设计的,但本端点不会流式返回结果:上传完整的 wav(16 位 PCM)或 ogg 录音后,和其他模型一样在一次响应里拿回全文。每分钟的价格高于对应的非流式版本。

多语言与方言

qwen3-asr-flash

同类还有 glm-asr-2512 和 mimo-v2.5-asr。qwen3-asr-flash 和 glm-asr-2512 是多语言选项,mimo-v2.5-asr 则专门针对中文方言做了优化。

提示 计费依据是上传音频的时长,按每分钟 1000 个 token 换算,换算前时长会先向上取整到整秒——因此 5 秒的音频按 83 个 token 计费,不足 1 秒的也按 1 秒计费。转写出的文本本身免费。所以费用随录音时长增长,而与录音中包含多少语音无关,剪掉静音很值得。