No hay coincidencias. Prueba con un protocolo, una capacidad o una ruta de endpoint.
POST /v1/audio/transcriptions acepta multipart/form-data, no JSON: envía model como campo de formulario y la grabación como parte de archivo llamada file. La respuesta es {"text": "…"}. POST /v1/audio/translations tiene la misma forma y devuelve inglés. A diferencia de los endpoints de vídeo, este es síncrono, así que una grabación larga mantiene la conexión abierta hasta que termina.
POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-F model=stepaudio-2.5-asr \
-F file=@speech.mp3
# {"text":" China api text to speech verification."}
Coste más bajo
stepaudio-2.5-asr
Junto con step-asr, step-asr-1.1 y stepaudio-2-asr-pro. stepaudio-2.5-asr es con diferencia el modelo de transcripción más barato del endpoint; las variantes pro y 1.1 cuestan unas quince veces más y solo compensan cuando importa la precisión sobre audio difícil.
Streaming
stepaudio-2.5-asr-stream
Junto con step-asr-1.1-stream. Estos devuelven texto parcial a medida que se consume el audio en lugar de un bloque al final, que es lo que hace falta para subtitulado en directo; ambos cuestan más por minuto que sus equivalentes sin streaming.
Multilingüe y dialectos
qwen3-asr-flash
Junto con glm-asr-2512 y mimo-v2.5-asr. qwen3-asr-flash y glm-asr-2512 son las opciones multilingües, y mimo-v2.5-asr es la ajustada para dialectos chinos.
ConsejoEl cobro cuenta la duración del audio que subes, a mil tokens por minuto, y la duración se redondea al segundo entero superior antes de esa conversión: así, un fragmento de cinco segundos se cobra como 83 tokens, y cualquier cosa por debajo de un segundo se cobra igualmente como uno. La transcripción en sí es gratuita. El coste, por tanto, sigue la duración de la grabación y no cuánta habla contiene, lo que hace que recortar los silencios merezca la pena.