stepaudio-2.5-asr
รวมถึง step-asr step-asr-1.1 และ stepaudio-2-asr-pro โดย stepaudio-2.5-asr ถูกกว่าตัวอื่นบนเอนด์พอยต์นี้อย่างมาก ส่วนรุ่น pro และ 1.1 แพงกว่าราวสิบห้าเท่า จึงคุ้มเฉพาะเมื่อความแม่นยำกับเสียงที่ยากเป็นเรื่องสำคัญ
ไม่พบรายการที่ตรงกัน ลองค้นด้วยชื่อโปรโตคอล ความสามารถ หรือพาธของเอนด์พอยต์
POST /v1/audio/transcriptions รับ multipart/form-data ไม่ใช่ JSON ให้ส่ง model เป็นฟิลด์ฟอร์ม และไฟล์บันทึกเสียงเป็นส่วนไฟล์ชื่อ file คำตอบคือ {"text": "…"} ส่วน POST /v1/audio/translations มีรูปแบบเดียวกันและคืนภาษาอังกฤษ ต่างจากเอนด์พอยต์วิดีโอ ตัวนี้ทำงานแบบซิงโครนัส ไฟล์ยาวจึงค้างการเชื่อมต่อไว้จนกว่าจะเสร็จ
curl https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-F model=stepaudio-2.5-asr \
-F file=@speech.mp3
# {"text":" China api text to speech verification."}
รวมถึง step-asr step-asr-1.1 และ stepaudio-2-asr-pro โดย stepaudio-2.5-asr ถูกกว่าตัวอื่นบนเอนด์พอยต์นี้อย่างมาก ส่วนรุ่น pro และ 1.1 แพงกว่าราวสิบห้าเท่า จึงคุ้มเฉพาะเมื่อความแม่นยำกับเสียงที่ยากเป็นเรื่องสำคัญ
รวมถึง step-asr-1.1-stream สองตัวนี้คืนข้อความบางส่วนระหว่างที่อ่านเสียงไปเรื่อย ๆ แทนที่จะคืนก้อนเดียวตอนจบ เหมาะกับคำบรรยายสด ทั้งคู่มีราคาต่อนาทีสูงกว่ารุ่นที่ไม่สตรีม
รวมถึง glm-asr-2512 และ mimo-v2.5-asr โดย qwen3-asr-flash กับ glm-asr-2512 เป็นตัวเลือกหลายภาษา ส่วน mimo-v2.5-asr ปรับมาสำหรับสำเนียงถิ่นภาษาจีน