Aucun résultat. Essayez un protocole, une capacité ou un chemin d'endpoint.
POST /v1/audio/transcriptions attend du multipart/form-data, pas du JSON : envoyez model comme champ de formulaire et l’enregistrement comme partie fichier nommée file. La réponse est {"text": "…"}. POST /v1/audio/translations a la même forme et renvoie de l’anglais. Contrairement aux endpoints vidéo, celui-ci est synchrone : un enregistrement long garde la connexion ouverte jusqu’au bout.
POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-F model=stepaudio-2.5-asr \
-F file=@speech.mp3
# {"text":" China api text to speech verification."}
Le moins cher
stepaudio-2.5-asr
Avec step-asr, step-asr-1.1 et stepaudio-2-asr-pro. stepaudio-2.5-asr est de loin le modèle de transcription le moins cher de l’endpoint ; les variantes pro et 1.1 coûtent environ quinze fois plus et ne se justifient que si la précision sur de l’audio difficile compte.
Diffusion en continu
stepaudio-2.5-asr-stream
Avec step-asr-1.1-stream. Ils renvoient du texte partiel à mesure que l’audio est consommé plutôt qu’un bloc à la fin, ce qu’il faut pour du sous-titrage en direct ; tous deux coûtent plus cher à la minute que leurs équivalents non diffusés.
Multilingue et dialectes
qwen3-asr-flash
Avec glm-asr-2512 et mimo-v2.5-asr. qwen3-asr-flash et glm-asr-2512 sont les options multilingues, et mimo-v2.5-asr est celle réglée pour les dialectes chinois.
ConseilLa facturation compte la durée de l’audio que vous envoyez, à mille tokens la minute, et la durée est arrondie à la seconde supérieure avant cette conversion — un extrait de cinq secondes est donc facturé 83 tokens, et tout ce qui dure moins d’une seconde est facturé comme une seconde. La transcription elle-même est gratuite. Le coût suit donc la longueur de l’enregistrement et non la quantité de parole qu’il contient, ce qui rend utile de couper les silences.