Synthèse vocale

POST /v1/audio/speech renvoie l’audio lui-même, pas du JSON : le corps est le fichier encodé et Content-Type suit response_format, donc mp3 revient en audio/mpeg. Les champs qui comptent sont model, input et voice ; speed et instructions sont facultatifs, et chaque modèle publie ses propres noms de voix. Écrivez la réponse directement dans un fichier — la décoder comme du texte la corrompra.

POST /v1/audio/speech
curl https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "input": "ChinaAPI text to speech verification.",
    "voice": "cixingnansheng",
    "response_format": "mp3"
  }' \
  --output speech.mp3

# HTTP 200, Content-Type: audio/mpeg
Clonage de voix

step-tts-2

Avec step-tts-mini et stepaudio-2.5-tts. Tous trois clonent une voix à partir d’une dizaine de secondes d’audio de référence et acceptent l’émotion et le ton comme consigne en langage naturel. step-tts-mini est le membre à faible latence et faible coût.

Haute définition

speech-2.8-hd

Avec speech-2.8-turbo. La variante hd est l’option la plus fidèle de cet endpoint et se facture en conséquence ; turbo en cède une partie pour la latence, à environ la moitié du tarif.

Multilingue

qwen3-tts-flash

Avec glm-tts. Les deux sont multilingues et moins chers que les modèles de clonage, ce qui en fait le choix par défaut raisonnable quand vous n’avez pas besoin d’une voix clonée précise.

Voix par défaut Omettre voice ne pose pas de problème : chaque modèle a une valeur par défaut que nous envoyons à votre place — Cherry pour qwen3-tts-flash, tongtong pour glm-tts, cixingnansheng pour step-tts-2, step-tts-mini et stepaudio-2.5-tts, et alloy pour mimo-v2.5-tts ainsi que les deux modèles speech-2.8. Les noms de voix d’OpenAI sont acceptés partout ; sur les modèles chinois ils sont repliés vers la valeur par défaut du modèle au lieu d’être rejetés, si bien qu’un client OpenAI existant fonctionne tel quel sur cet endpoint. Ce sont des valeurs par défaut, pas la liste complète — chaque fournisseur en publie davantage. Deux variantes ne prennent aucun nom de voix : mimo-v2.5-tts-voiceclone lit un extrait de référence dans voice sous forme de data URL, et mimo-v2.5-tts-voicedesign prend la description dans instructions.
Conseil La facturation compte les caractères de input, un caractère pour un token, donc le coût est connu avant l’envoi. L’audio produit est mesuré lui aussi et apparaît en tokens de complétion à raison de mille tokens la minute, mais il est facturé à un taux nul — une requête de cinquante-neuf caractères ayant produit environ cinq secondes de parole a enregistré 59 tokens de prompt, 83 tokens de complétion, et a été facturée sur les 59. La ponctuation et les espaces comptent comme des caractères.