Texto para fala

POST /v1/audio/speech devolve o próprio áudio, não JSON: o corpo é o arquivo codificado e Content-Type segue response_format, então mp3 volta como audio/mpeg. Os campos que importam são model, input e voice; speed e instructions são opcionais, e cada modelo publica os próprios nomes de voz. Grave a resposta direto em arquivo — decodificá-la como texto vai corrompê-la.

POST /v1/audio/speech
curl https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "input": "ChinaAPI text to speech verification.",
    "voice": "cixingnansheng",
    "response_format": "mp3"
  }' \
  --output speech.mp3

# HTTP 200, Content-Type: audio/mpeg
Clonagem de voz

step-tts-2

Junto com step-tts-mini e stepaudio-2.5-tts. Os três clonam uma voz a partir de cerca de dez segundos de áudio de referência e aceitam emoção e entrega como instrução em linguagem natural. step-tts-mini é o de baixa latência e baixo custo.

Alta definição

speech-2.8-hd

Junto com speech-2.8-turbo. A variante hd é a de maior fidelidade do endpoint e cobra de acordo; turbo troca parte disso por latência, a cerca de metade da tarifa.

Multilíngue

qwen3-tts-flash

Junto com glm-tts. Ambos são multilíngues e mais baratos que os modelos de clonagem, o que os torna o padrão sensato quando você não precisa de uma voz clonada específica.

Vozes padrão Omitir voice é seguro: cada modelo tem um padrão que enviamos por você — Cherry no qwen3-tts-flash, tongtong no glm-tts, cixingnansheng no step-tts-2, step-tts-mini e stepaudio-2.5-tts, e alloy no mimo-v2.5-tts e nos dois modelos speech-2.8. Os nomes de voz da própria OpenAI são aceitos em toda parte; nos modelos chineses eles são dobrados para o padrão daquele modelo em vez de recusados, então apontar um cliente OpenAI existente para este endpoint funciona sem mudanças. Estes são padrões, não a lista completa — cada fornecedor publica mais. Duas variantes não aceitam nome de voz: mimo-v2.5-tts-voiceclone lê um trecho de referência em voice como data URL, e mimo-v2.5-tts-voicedesign recebe a descrição em instructions.
Dica A cobrança conta os caracteres de input, um caractere por token, então o custo é conhecido antes do envio. O áudio gerado também é medido e aparece como tokens de conclusão à razão de mil tokens por minuto, mas é cobrado a uma taxa zero — uma requisição de cinquenta e nove caracteres que produziu cerca de cinco segundos de fala registrou 59 tokens de prompt, 83 de conclusão, e foi cobrada sobre os 59. Pontuação e espaços contam como caracteres.