Fala para texto

POST /v1/audio/transcriptions aceita multipart/form-data, não JSON: envie model como campo de formulário e a gravação como parte de arquivo chamada file. A resposta é {"text": "…"}. POST /v1/audio/translations tem o mesmo formato e devolve inglês. Diferente dos endpoints de vídeo, este é síncrono, então uma gravação longa mantém a conexão aberta até terminar.

POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -F model=stepaudio-2.5-asr \
  -F file=@speech.mp3

# {"text":" China api text to speech verification."}
Menor custo

stepaudio-2.5-asr

Junto com step-asr, step-asr-1.1 e stepaudio-2-asr-pro. stepaudio-2.5-asr é de longe o modelo de transcrição mais barato do endpoint; as variantes pro e 1.1 custam cerca de quinze vezes mais e só compensam quando a precisão em áudio difícil importa.

Streaming

stepaudio-2.5-asr-stream

Junto com step-asr-1.1-stream. Estes devolvem texto parcial à medida que o áudio é consumido, em vez de um bloco no final, que é o que se quer para legendagem ao vivo; ambos custam mais por minuto que seus equivalentes sem streaming.

Multilíngue e dialetos

qwen3-asr-flash

Junto com glm-asr-2512 e mimo-v2.5-asr. qwen3-asr-flash e glm-asr-2512 são as opções multilíngues, e mimo-v2.5-asr é a ajustada para dialetos chineses.

Dica A cobrança conta a duração do áudio que você envia, a mil tokens por minuto, e a duração é arredondada para cima ao segundo inteiro antes dessa conversão — então um trecho de cinco segundos é cobrado como 83 tokens, e qualquer coisa abaixo de um segundo ainda é cobrada como se fosse um. A transcrição em si é gratuita. O custo, portanto, acompanha a duração da gravação e não quanta fala ela contém, o que torna vantajoso cortar os silêncios.