step-tts-2
รวมถึง step-tts-mini และ stepaudio-2.5-tts ทั้งสามโคลนเสียงได้จากเสียงอ้างอิงราวสิบวินาที และรับคำสั่งเรื่องอารมณ์กับลีลาเป็นภาษาธรรมชาติ โดย step-tts-mini เป็นรุ่นหน่วงต่ำและต้นทุนต่ำ
ไม่พบรายการที่ตรงกัน ลองค้นด้วยชื่อโปรโตคอล ความสามารถ หรือพาธของเอนด์พอยต์
POST /v1/audio/speech คืนไฟล์เสียงมาตรง ๆ ไม่ใช่ JSON เนื้อหาคือไฟล์ที่เข้ารหัสแล้ว และ Content-Type เป็นไปตาม response_format ดังนั้น mp3 จะกลับมาเป็น audio/mpeg ฟิลด์ที่สำคัญคือ model input และ voice ส่วน speed กับ instructions เป็นตัวเลือก และแต่ละโมเดลประกาศชื่อเสียงพากย์ของตัวเอง ให้เขียนคำตอบลงไฟล์โดยตรง หากถอดรหัสเป็นข้อความไฟล์จะเสีย
curl https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"input": "ChinaAPI text to speech verification.",
"voice": "cixingnansheng",
"response_format": "mp3"
}' \
--output speech.mp3
# HTTP 200, Content-Type: audio/mpeg
รวมถึง step-tts-mini และ stepaudio-2.5-tts ทั้งสามโคลนเสียงได้จากเสียงอ้างอิงราวสิบวินาที และรับคำสั่งเรื่องอารมณ์กับลีลาเป็นภาษาธรรมชาติ โดย step-tts-mini เป็นรุ่นหน่วงต่ำและต้นทุนต่ำ
รวมถึง speech-2.8-turbo รุ่น hd ให้ความสมจริงสูงสุดบนเอนด์พอยต์นี้และราคาก็สูงตาม ส่วน turbo ยอมลดคุณภาพบางส่วนเพื่อแลกความหน่วงที่ต่ำลง ในราคาราวครึ่งเดียว
รวมถึง glm-tts ทั้งคู่รองรับหลายภาษาและถูกกว่ากลุ่มโคลนเสียง จึงเป็นตัวเลือกตั้งต้นที่เหมาะเมื่อคุณไม่ต้องการเสียงโคลนเฉพาะเจาะจง
voice ไว้ได้ ไม่มีปัญหา เพราะแต่ละโมเดลมีค่าเริ่มต้นที่เราส่งให้แทน — Cherry สำหรับ qwen3-tts-flash, tongtong สำหรับ glm-tts, cixingnansheng สำหรับ step-tts-2, step-tts-mini และ stepaudio-2.5-tts, และ alloy สำหรับ mimo-v2.5-tts กับโมเดล speech-2.8 ทั้งสองตัว ชื่อเสียงพากย์ของ OpenAI ใช้ได้ทุกที่ บนโมเดลจีนระบบจะพับไปเป็นค่าเริ่มต้นของโมเดลนั้นแทนที่จะปฏิเสธ ดังนั้นชี้ไคลเอนต์ OpenAI เดิมมาที่เอนด์พอยต์นี้ก็ทำงานได้ทันที รายการนี้เป็นค่าเริ่มต้น ไม่ใช่รายชื่อทั้งหมด — ผู้ให้บริการแต่ละรายเปิดให้มากกว่านี้ สองรุ่นย่อยไม่รับชื่อเสียงเลย: mimo-v2.5-tts-voiceclone อ่านคลิปอ้างอิงจาก voice ในรูป data URL ส่วน mimo-v2.5-tts-voicedesign รับคำบรรยายใน instructions แทน
input แบบหนึ่งอักขระต่อหนึ่งโทเคน คุณจึงรู้ค่าใช้จ่ายก่อนส่งคำขอ เสียงที่สร้างขึ้นก็ถูกวัดด้วยและปรากฏเป็น completion token ที่อัตราหนึ่งพันโทเคนต่อนาที แต่คิดเงินที่อัตราศูนย์ — คำขอห้าสิบเก้าอักขระที่สร้างเสียงราวห้าวินาที บันทึกไว้ที่ prompt 59 โทเคน completion 83 โทเคน และถูกคิดเงินจากตัวเลข 59 เครื่องหมายวรรคตอนและช่องว่างก็นับเป็นอักขระ