Transcription audio

POST /v1/audio/transcriptions attend du multipart/form-data, pas du JSON : envoyez model comme champ de formulaire et l’enregistrement comme partie fichier nommée file. La réponse est {"text": "…"}. POST /v1/audio/translations a la même forme et renvoie de l’anglais. Contrairement aux endpoints vidéo, celui-ci est synchrone : un enregistrement long garde la connexion ouverte jusqu’au bout.

POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -F model=stepaudio-2.5-asr \
  -F file=@speech.mp3

# {"text":" China api text to speech verification."}
Le moins cher

stepaudio-2.5-asr

Avec step-asr, step-asr-1.1 et stepaudio-2-asr-pro. stepaudio-2.5-asr est de loin le modèle de transcription le moins cher de l’endpoint ; les variantes pro et 1.1 coûtent environ quinze fois plus et ne se justifient que si la précision sur de l’audio difficile compte.

Diffusion en continu

stepaudio-2.5-asr-stream

Avec step-asr-1.1-stream. Ils renvoient du texte partiel à mesure que l’audio est consommé plutôt qu’un bloc à la fin, ce qu’il faut pour du sous-titrage en direct ; tous deux coûtent plus cher à la minute que leurs équivalents non diffusés.

Multilingue et dialectes

qwen3-asr-flash

Avec glm-asr-2512 et mimo-v2.5-asr. qwen3-asr-flash et glm-asr-2512 sont les options multilingues, et mimo-v2.5-asr est celle réglée pour les dialectes chinois.

Conseil La facturation compte la durée de l’audio que vous envoyez, à mille tokens la minute, et la durée est arrondie à la seconde supérieure avant cette conversion — un extrait de cinq secondes est donc facturé 83 tokens, et tout ce qui dure moins d’une seconde est facturé comme une seconde. La transcription elle-même est gratuite. Le coût suit donc la longueur de l’enregistrement et non la quantité de parole qu’il contient, ce qui rend utile de couper les silences.