Речь в текст

POST /v1/audio/transcriptions принимает multipart/form-data, а не JSON: передайте model как поле формы, а запись — как файловую часть с именем file. Ответ имеет вид {"text": "…"}. POST /v1/audio/translations устроен так же и возвращает английский текст. В отличие от эндпоинтов видео этот работает синхронно, поэтому длинная запись удерживает соединение открытым до завершения.

POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -F model=stepaudio-2.5-asr \
  -F file=@speech.mp3

# {"text":" China api text to speech verification."}
Самая низкая цена

stepaudio-2.5-asr

Вместе с step-asr, step-asr-1.1 и stepaudio-2-asr-pro. stepaudio-2.5-asr с большим отрывом самая дешёвая модель расшифровки на этом эндпоинте; варианты pro и 1.1 стоят примерно в пятнадцать раз дороже и оправданы лишь тогда, когда важна точность на сложном аудио.

Потоковые

stepaudio-2.5-asr-stream

Вместе с step-asr-1.1-stream. Они возвращают частичный текст по мере обработки аудио, а не одним блоком в конце, что и нужно для субтитров в реальном времени; обе стоят дороже за минуту, чем их непотоковые аналоги.

Многоязычные и диалекты

qwen3-asr-flash

Вместе с glm-asr-2512 и mimo-v2.5-asr. qwen3-asr-flash и glm-asr-2512 — многоязычные варианты, а mimo-v2.5-asr настроена на китайские диалекты.

Совет Тарификация считает длительность загруженного вами аудио из расчёта тысяча токенов на минуту, причём длительность округляется вверх до целой секунды перед пересчётом — так что пятисекундный фрагмент тарифицируется как 83 токена, а всё, что короче секунды, всё равно тарифицируется как одна. Сама расшифровка бесплатна. Поэтому стоимость растёт с длиной записи, а не с количеством речи в ней, и обрезать тишину имеет смысл.