Ничего не найдено. Попробуйте указать протокол, возможность или путь эндпоинта.
POST /v1/audio/transcriptions принимает multipart/form-data, а не JSON: передайте model как поле формы, а запись — как файловую часть с именем file. Ответ имеет вид {"text": "…"}. POST /v1/audio/translations устроен так же и возвращает английский текст. В отличие от эндпоинтов видео этот работает синхронно, поэтому длинная запись удерживает соединение открытым до завершения.
POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-F model=stepaudio-2.5-asr \
-F file=@speech.mp3
# {"text":" China api text to speech verification."}
Самая низкая цена
stepaudio-2.5-asr
Вместе с step-asr, step-asr-1.1 и stepaudio-2-asr-pro. stepaudio-2.5-asr с большим отрывом самая дешёвая модель расшифровки на этом эндпоинте; варианты pro и 1.1 стоят примерно в пятнадцать раз дороже и оправданы лишь тогда, когда важна точность на сложном аудио.
Потоковые
stepaudio-2.5-asr-stream
Вместе с step-asr-1.1-stream. Они возвращают частичный текст по мере обработки аудио, а не одним блоком в конце, что и нужно для субтитров в реальном времени; обе стоят дороже за минуту, чем их непотоковые аналоги.
Многоязычные и диалекты
qwen3-asr-flash
Вместе с glm-asr-2512 и mimo-v2.5-asr. qwen3-asr-flash и glm-asr-2512 — многоязычные варианты, а mimo-v2.5-asr настроена на китайские диалекты.
СоветТарификация считает длительность загруженного вами аудио из расчёта тысяча токенов на минуту, причём длительность округляется вверх до целой секунды перед пересчётом — так что пятисекундный фрагмент тарифицируется как 83 токена, а всё, что короче секунды, всё равно тарифицируется как одна. Сама расшифровка бесплатна. Поэтому стоимость растёт с длиной записи, а не с количеством речи в ней, и обрезать тишину имеет смысл.