แปลงข้อความเป็นเสียง

POST /v1/audio/speech คืนไฟล์เสียงมาตรง ๆ ไม่ใช่ JSON เนื้อหาคือไฟล์ที่เข้ารหัสแล้ว และ Content-Type เป็นไปตาม response_format ดังนั้น mp3 จะกลับมาเป็น audio/mpeg ฟิลด์ที่สำคัญคือ model input และ voice ส่วน speed กับ instructions เป็นตัวเลือก และแต่ละโมเดลประกาศชื่อเสียงพากย์ของตัวเอง ให้เขียนคำตอบลงไฟล์โดยตรง หากถอดรหัสเป็นข้อความไฟล์จะเสีย

POST /v1/audio/speech
curl https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "input": "ChinaAPI text to speech verification.",
    "voice": "cixingnansheng",
    "response_format": "mp3"
  }' \
  --output speech.mp3

# HTTP 200, Content-Type: audio/mpeg
โคลนเสียง

step-tts-2

รวมถึง step-tts-mini และ stepaudio-2.5-tts ทั้งสามโคลนเสียงได้จากเสียงอ้างอิงราวสิบวินาที และรับคำสั่งเรื่องอารมณ์กับลีลาเป็นภาษาธรรมชาติ โดย step-tts-mini เป็นรุ่นหน่วงต่ำและต้นทุนต่ำ

ความคมชัดสูง

speech-2.8-hd

รวมถึง speech-2.8-turbo รุ่น hd ให้ความสมจริงสูงสุดบนเอนด์พอยต์นี้และราคาก็สูงตาม ส่วน turbo ยอมลดคุณภาพบางส่วนเพื่อแลกความหน่วงที่ต่ำลง ในราคาราวครึ่งเดียว

หลายภาษา

qwen3-tts-flash

รวมถึง glm-tts ทั้งคู่รองรับหลายภาษาและถูกกว่ากลุ่มโคลนเสียง จึงเป็นตัวเลือกตั้งต้นที่เหมาะเมื่อคุณไม่ต้องการเสียงโคลนเฉพาะเจาะจง

เสียงเริ่มต้น ละ voice ไว้ได้ ไม่มีปัญหา เพราะแต่ละโมเดลมีค่าเริ่มต้นที่เราส่งให้แทน — Cherry สำหรับ qwen3-tts-flash, tongtong สำหรับ glm-tts, cixingnansheng สำหรับ step-tts-2, step-tts-mini และ stepaudio-2.5-tts, และ alloy สำหรับ mimo-v2.5-tts กับโมเดล speech-2.8 ทั้งสองตัว ชื่อเสียงพากย์ของ OpenAI ใช้ได้ทุกที่ บนโมเดลจีนระบบจะพับไปเป็นค่าเริ่มต้นของโมเดลนั้นแทนที่จะปฏิเสธ ดังนั้นชี้ไคลเอนต์ OpenAI เดิมมาที่เอนด์พอยต์นี้ก็ทำงานได้ทันที รายการนี้เป็นค่าเริ่มต้น ไม่ใช่รายชื่อทั้งหมด — ผู้ให้บริการแต่ละรายเปิดให้มากกว่านี้ สองรุ่นย่อยไม่รับชื่อเสียงเลย: mimo-v2.5-tts-voiceclone อ่านคลิปอ้างอิงจาก voice ในรูป data URL ส่วน mimo-v2.5-tts-voicedesign รับคำบรรยายใน instructions แทน
เคล็ดลับ การคิดเงินนับจำนวนอักขระของ input แบบหนึ่งอักขระต่อหนึ่งโทเคน คุณจึงรู้ค่าใช้จ่ายก่อนส่งคำขอ เสียงที่สร้างขึ้นก็ถูกวัดด้วยและปรากฏเป็น completion token ที่อัตราหนึ่งพันโทเคนต่อนาที แต่คิดเงินที่อัตราศูนย์ — คำขอห้าสิบเก้าอักขระที่สร้างเสียงราวห้าวินาที บันทึกไว้ที่ prompt 59 โทเคน completion 83 โทเคน และถูกคิดเงินจากตัวเลข 59 เครื่องหมายวรรคตอนและช่องว่างก็นับเป็นอักขระ