Texto a voz

POST /v1/audio/speech devuelve el audio en sí, no JSON: el cuerpo es el archivo codificado y Content-Type sigue a response_format, así que mp3 vuelve como audio/mpeg. Los campos que importan son model, input y voice; speed e instructions son opcionales, y cada modelo publica sus propios nombres de voz. Escribe la respuesta directamente en un archivo: decodificarla como texto la corromperá.

POST /v1/audio/speech
curl https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "input": "ChinaAPI text to speech verification.",
    "voice": "cixingnansheng",
    "response_format": "mp3"
  }' \
  --output speech.mp3

# HTTP 200, Content-Type: audio/mpeg
Clonación de voz

step-tts-2

Junto con step-tts-mini y stepaudio-2.5-tts. Los tres clonan una voz a partir de unos diez segundos de audio de referencia y aceptan la emoción y la entonación como indicación en lenguaje natural. step-tts-mini es el de baja latencia y bajo coste.

Alta definición

speech-2.8-hd

Junto con speech-2.8-turbo. La variante hd es la de mayor fidelidad del endpoint y cobra en consecuencia; turbo cede parte de eso a cambio de latencia, a alrededor de la mitad de la tarifa.

Multilingüe

qwen3-tts-flash

Junto con glm-tts. Ambos son multilingües y más baratos que los modelos de clonación, lo que los convierte en la opción por defecto razonable cuando no necesitas una voz clonada concreta.

Voces por defecto Omitir voice no da problemas: cada modelo tiene un valor por defecto que enviamos por ti — Cherry en qwen3-tts-flash, tongtong en glm-tts, cixingnansheng en step-tts-2, step-tts-mini y stepaudio-2.5-tts, y alloy en mimo-v2.5-tts y en los dos modelos speech-2.8. Los nombres de voz de OpenAI se aceptan en todas partes; en los modelos chinos se pliegan al valor por defecto de ese modelo en lugar de rechazarse, así que apuntar un cliente OpenAI existente a este endpoint funciona sin cambios. Son valores por defecto, no el catálogo completo: cada proveedor publica más. Dos variantes no admiten nombre de voz: mimo-v2.5-tts-voiceclone lee un fragmento de referencia desde voice como data URL, y mimo-v2.5-tts-voicedesign recibe la descripción en instructions.
Consejo El cobro cuenta los caracteres de input, un carácter por token, así que el coste se conoce antes de enviar la petición. El audio generado también se mide y aparece como tokens de finalización a razón de mil tokens por minuto, pero se cobra a una tasa de cero: una petición de cincuenta y nueve caracteres que produjo unos cinco segundos de habla registró 59 tokens de prompt, 83 de finalización, y se cobró sobre los 59. La puntuación y los espacios cuentan como caracteres.