step-tts-2
Cùng với step-tts-mini và stepaudio-2.5-tts. Cả ba đều nhân bản giọng từ khoảng mười giây âm thanh tham chiếu và nhận chỉ dẫn cảm xúc, cách nói bằng ngôn ngữ tự nhiên. step-tts-mini là bản độ trễ thấp, chi phí thấp.
Không có kết quả nào khớp. Hãy thử một giao thức, một năng lực hoặc một đường dẫn endpoint.
POST /v1/audio/speech trả về chính tệp âm thanh chứ không phải JSON: phần thân là tệp đã mã hóa và Content-Type theo response_format, nên mp3 sẽ về dưới dạng audio/mpeg. Các trường quan trọng là model, input và voice; speed và instructions là tùy chọn, và mỗi mô hình công bố danh sách tên giọng riêng. Hãy ghi thẳng phản hồi ra tệp — giải mã nó như văn bản sẽ làm hỏng tệp.
curl https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"input": "ChinaAPI text to speech verification.",
"voice": "cixingnansheng",
"response_format": "mp3"
}' \
--output speech.mp3
# HTTP 200, Content-Type: audio/mpeg
Cùng với step-tts-mini và stepaudio-2.5-tts. Cả ba đều nhân bản giọng từ khoảng mười giây âm thanh tham chiếu và nhận chỉ dẫn cảm xúc, cách nói bằng ngôn ngữ tự nhiên. step-tts-mini là bản độ trễ thấp, chi phí thấp.
Cùng với speech-2.8-turbo. Bản hd cho độ trung thực cao nhất trên endpoint này và giá tương xứng; turbo đánh đổi một phần chất lượng lấy độ trễ, với mức giá khoảng một nửa.
Cùng với glm-tts. Cả hai đều đa ngôn ngữ và rẻ hơn nhóm nhân bản giọng, nên là lựa chọn mặc định hợp lý khi bạn không cần một giọng nhân bản cụ thể.
voice vẫn an toàn: mỗi mô hình có một giá trị mặc định chúng tôi gửi thay bạn — Cherry cho qwen3-tts-flash, tongtong cho glm-tts, cixingnansheng cho step-tts-2, step-tts-mini và stepaudio-2.5-tts, còn alloy cho mimo-v2.5-tts và cả hai mô hình speech-2.8. Tên giọng của OpenAI được chấp nhận ở mọi nơi; trên các mô hình Trung Quốc chúng được gập về giá trị mặc định của mô hình thay vì bị từ chối, nên một client OpenAI sẵn có trỏ vào endpoint này vẫn chạy nguyên vẹn. Đây là giá trị mặc định, không phải danh sách đầy đủ — mỗi nhà cung cấp còn công bố nhiều hơn. Hai biến thể không nhận tên giọng: mimo-v2.5-tts-voiceclone đọc đoạn âm thanh mẫu từ voice dưới dạng data URL, còn mimo-v2.5-tts-voicedesign nhận phần mô tả trong instructions.
input, một ký tự một token, nên bạn biết chi phí trước khi gửi. Âm thanh sinh ra cũng được đo và hiện ra dưới dạng completion token theo tỉ lệ một nghìn token mỗi phút, nhưng hệ số tính tiền của nó bằng không — một yêu cầu năm mươi chín ký tự tạo ra khoảng năm giây tiếng nói đã ghi 59 prompt token, 83 completion token, và bị tính trên con số 59. Dấu câu và dấu cách cũng tính là ký tự.