ถอดเสียงเป็นข้อความ

POST /v1/audio/transcriptions รับ multipart/form-data ไม่ใช่ JSON ให้ส่ง model เป็นฟิลด์ฟอร์ม และไฟล์บันทึกเสียงเป็นส่วนไฟล์ชื่อ file คำตอบคือ {"text": "…"} ส่วน POST /v1/audio/translations มีรูปแบบเดียวกันและคืนภาษาอังกฤษ ต่างจากเอนด์พอยต์วิดีโอ ตัวนี้ทำงานแบบซิงโครนัส ไฟล์ยาวจึงค้างการเชื่อมต่อไว้จนกว่าจะเสร็จ

POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -F model=stepaudio-2.5-asr \
  -F file=@speech.mp3

# {"text":" China api text to speech verification."}
ต้นทุนต่ำสุด

stepaudio-2.5-asr

รวมถึง step-asr step-asr-1.1 และ stepaudio-2-asr-pro โดย stepaudio-2.5-asr ถูกกว่าตัวอื่นบนเอนด์พอยต์นี้อย่างมาก ส่วนรุ่น pro และ 1.1 แพงกว่าราวสิบห้าเท่า จึงคุ้มเฉพาะเมื่อความแม่นยำกับเสียงที่ยากเป็นเรื่องสำคัญ

สตรีมมิง

stepaudio-2.5-asr-stream

รวมถึง step-asr-1.1-stream สองตัวนี้คืนข้อความบางส่วนระหว่างที่อ่านเสียงไปเรื่อย ๆ แทนที่จะคืนก้อนเดียวตอนจบ เหมาะกับคำบรรยายสด ทั้งคู่มีราคาต่อนาทีสูงกว่ารุ่นที่ไม่สตรีม

หลายภาษาและสำเนียงถิ่น

qwen3-asr-flash

รวมถึง glm-asr-2512 และ mimo-v2.5-asr โดย qwen3-asr-flash กับ glm-asr-2512 เป็นตัวเลือกหลายภาษา ส่วน mimo-v2.5-asr ปรับมาสำหรับสำเนียงถิ่นภาษาจีน

เคล็ดลับ การคิดเงินนับความยาวของเสียงที่คุณอัปโหลด ที่อัตราหนึ่งพันโทเคนต่อนาที และปัดเศษความยาวขึ้นเป็นวินาทีเต็มก่อนแปลง ดังนั้นคลิปห้าวินาทีคิดเป็น 83 โทเคน และอะไรที่สั้นกว่าหนึ่งวินาทีก็ยังคิดเท่าหนึ่งวินาที ข้อความที่ถอดได้ไม่มีค่าใช้จ่าย ค่าใช้จ่ายจึงแปรตามความยาวไฟล์ ไม่ใช่ตามปริมาณคำพูดในไฟล์ การตัดช่วงเงียบออกจึงคุ้มค่า