Nada corresponde. Tente um protocolo, uma capacidade ou um caminho de endpoint.
POST /v1/audio/transcriptions aceita multipart/form-data, não JSON: envie model como campo de formulário e a gravação como parte de arquivo chamada file. A resposta é {"text": "…"}. POST /v1/audio/translations tem o mesmo formato e devolve inglês. Diferente dos endpoints de vídeo, este é síncrono, então uma gravação longa mantém a conexão aberta até terminar.
POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-F model=stepaudio-2.5-asr \
-F file=@speech.mp3
# {"text":" China api text to speech verification."}
Menor custo
stepaudio-2.5-asr
Junto com step-asr, step-asr-1.1 e stepaudio-2-asr-pro. stepaudio-2.5-asr é de longe o modelo de transcrição mais barato do endpoint; as variantes pro e 1.1 custam cerca de quinze vezes mais e só compensam quando a precisão em áudio difícil importa.
Streaming
stepaudio-2.5-asr-stream
Junto com step-asr-1.1-stream. Estes devolvem texto parcial à medida que o áudio é consumido, em vez de um bloco no final, que é o que se quer para legendagem ao vivo; ambos custam mais por minuto que seus equivalentes sem streaming.
Multilíngue e dialetos
qwen3-asr-flash
Junto com glm-asr-2512 e mimo-v2.5-asr. qwen3-asr-flash e glm-asr-2512 são as opções multilíngues, e mimo-v2.5-asr é a ajustada para dialetos chineses.
DicaA cobrança conta a duração do áudio que você envia, a mil tokens por minuto, e a duração é arredondada para cima ao segundo inteiro antes dessa conversão — então um trecho de cinco segundos é cobrado como 83 tokens, e qualquer coisa abaixo de um segundo ainda é cobrada como se fosse um. A transcrição em si é gratuita. O custo, portanto, acompanha a duração da gravação e não quanta fala ela contém, o que torna vantajoso cortar os silêncios.