音声認識

POST /v1/audio/transcriptions は JSON ではなく multipart/form-data を受け取ります。model はフォームフィールドとして、録音は file という名前のファイルパートとして送ります。返るのは {"text": "…"} です。POST /v1/audio/translations は同じ形で、英語を返します。動画のエンドポイントと違いこちらは同期処理なので、長い録音は終わるまで接続を保持します。

POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -F model=stepaudio-2.5-asr \
  -F file=@speech.mp3

# {"text":" China api text to speech verification."}
最安

stepaudio-2.5-asr

step-asrstep-asr-1.1stepaudio-2-asr-pro も同じです。stepaudio-2.5-asr はこのエンドポイントで群を抜いて安く、pro1.1 はおよそ 15 倍の価格なので、難しい音声での精度が必要なときにだけ選ぶ価値があります。

ストリーミング

stepaudio-2.5-asr-stream

step-asr-1.1-stream も同じです。これらは最後にまとめてではなく音声を読み込みながら途中のテキストを返すので、ライブ字幕に向いています。どちらも非ストリーミング版より 1 分あたりの料金は高くなります。

多言語と方言

qwen3-asr-flash

glm-asr-2512mimo-v2.5-asr も同じです。qwen3-asr-flashglm-asr-2512 が多言語向け、mimo-v2.5-asr が中国語の方言に合わせた型です。

ヒント 課金はアップロードした音声の長さを 1 分 1000 トークンの換算で数えます。換算の前に秒単位で切り上げるため、5 秒のクリップは 83 トークン、1 秒未満でも 1 秒分として課金されます。書き起こしたテキスト自体は無料です。したがって費用は録音にどれだけ発話が含まれるかではなく録音の長さに比例するので、無音を切り詰める価値があります。