Chuyển văn bản thành giọng nói

POST /v1/audio/speech trả về chính tệp âm thanh chứ không phải JSON: phần thân là tệp đã mã hóa và Content-Type theo response_format, nên mp3 sẽ về dưới dạng audio/mpeg. Các trường quan trọng là model, inputvoice; speedinstructions là tùy chọn, và mỗi mô hình công bố danh sách tên giọng riêng. Hãy ghi thẳng phản hồi ra tệp — giải mã nó như văn bản sẽ làm hỏng tệp.

POST /v1/audio/speech
curl https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "input": "ChinaAPI text to speech verification.",
    "voice": "cixingnansheng",
    "response_format": "mp3"
  }' \
  --output speech.mp3

# HTTP 200, Content-Type: audio/mpeg
Nhân bản giọng

step-tts-2

Cùng với step-tts-ministepaudio-2.5-tts. Cả ba đều nhân bản giọng từ khoảng mười giây âm thanh tham chiếu và nhận chỉ dẫn cảm xúc, cách nói bằng ngôn ngữ tự nhiên. step-tts-mini là bản độ trễ thấp, chi phí thấp.

Độ nét cao

speech-2.8-hd

Cùng với speech-2.8-turbo. Bản hd cho độ trung thực cao nhất trên endpoint này và giá tương xứng; turbo đánh đổi một phần chất lượng lấy độ trễ, với mức giá khoảng một nửa.

Đa ngôn ngữ

qwen3-tts-flash

Cùng với glm-tts. Cả hai đều đa ngôn ngữ và rẻ hơn nhóm nhân bản giọng, nên là lựa chọn mặc định hợp lý khi bạn không cần một giọng nhân bản cụ thể.

Giọng mặc định Bỏ trống voice vẫn an toàn: mỗi mô hình có một giá trị mặc định chúng tôi gửi thay bạn — Cherry cho qwen3-tts-flash, tongtong cho glm-tts, cixingnansheng cho step-tts-2, step-tts-ministepaudio-2.5-tts, còn alloy cho mimo-v2.5-tts và cả hai mô hình speech-2.8. Tên giọng của OpenAI được chấp nhận ở mọi nơi; trên các mô hình Trung Quốc chúng được gập về giá trị mặc định của mô hình thay vì bị từ chối, nên một client OpenAI sẵn có trỏ vào endpoint này vẫn chạy nguyên vẹn. Đây là giá trị mặc định, không phải danh sách đầy đủ — mỗi nhà cung cấp còn công bố nhiều hơn. Hai biến thể không nhận tên giọng: mimo-v2.5-tts-voiceclone đọc đoạn âm thanh mẫu từ voice dưới dạng data URL, còn mimo-v2.5-tts-voicedesign nhận phần mô tả trong instructions.
Mẹo Việc tính tiền đếm số ký tự của input, một ký tự một token, nên bạn biết chi phí trước khi gửi. Âm thanh sinh ra cũng được đo và hiện ra dưới dạng completion token theo tỉ lệ một nghìn token mỗi phút, nhưng hệ số tính tiền của nó bằng không — một yêu cầu năm mươi chín ký tự tạo ra khoảng năm giây tiếng nói đã ghi 59 prompt token, 83 completion token, và bị tính trên con số 59. Dấu câu và dấu cách cũng tính là ký tự.