stepaudio-2.5-asr
step-asr・step-asr-1.1・stepaudio-2-asr-pro も同じです。stepaudio-2.5-asr はこのエンドポイントで群を抜いて安く、pro と 1.1 はおよそ 15 倍の価格なので、難しい音声での精度が必要なときにだけ選ぶ価値があります。
該当するものがありません。プロトコル名、機能名、エンドポイントのパスで試してください。
POST /v1/audio/transcriptions は JSON ではなく multipart/form-data を受け取ります。model はフォームフィールドとして、録音は file という名前のファイルパートとして送ります。返るのは {"text": "…"} です。POST /v1/audio/translations は同じ形で、英語を返します。動画のエンドポイントと違いこちらは同期処理なので、長い録音は終わるまで接続を保持します。
curl https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-F model=stepaudio-2.5-asr \
-F file=@speech.mp3
# {"text":" China api text to speech verification."}
step-asr・step-asr-1.1・stepaudio-2-asr-pro も同じです。stepaudio-2.5-asr はこのエンドポイントで群を抜いて安く、pro と 1.1 はおよそ 15 倍の価格なので、難しい音声での精度が必要なときにだけ選ぶ価値があります。
step-asr-1.1-stream も同じです。これらは最後にまとめてではなく音声を読み込みながら途中のテキストを返すので、ライブ字幕に向いています。どちらも非ストリーミング版より 1 分あたりの料金は高くなります。
glm-asr-2512 と mimo-v2.5-asr も同じです。qwen3-asr-flash と glm-asr-2512 が多言語向け、mimo-v2.5-asr が中国語の方言に合わせた型です。