Chuyển giọng nói thành văn bản

POST /v1/audio/transcriptions nhận multipart/form-data chứ không phải JSON: gửi model như một trường form và bản ghi âm như phần tệp có tên file. Phản hồi là {"text": "…"}. POST /v1/audio/translations có cùng dạng và trả về tiếng Anh. Khác với các endpoint video, endpoint này chạy đồng bộ, nên một bản ghi dài sẽ giữ kết nối mở cho tới khi xong.

POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -F model=stepaudio-2.5-asr \
  -F file=@speech.mp3

# {"text":" China api text to speech verification."}
Rẻ nhất

stepaudio-2.5-asr

Cùng với step-asr, step-asr-1.1stepaudio-2-asr-pro. stepaudio-2.5-asr rẻ hơn hẳn mọi mô hình nhận dạng khác trên endpoint này; bản pro1.1 đắt gấp khoảng mười lăm lần và chỉ đáng dùng khi cần độ chính xác trên âm thanh khó.

Truyền phát

stepaudio-2.5-asr-stream

Cùng với step-asr-1.1-stream. Hai mô hình này trả về văn bản từng phần trong lúc đọc âm thanh thay vì một khối ở cuối, đúng thứ bạn cần cho phụ đề trực tiếp; cả hai đều đắt hơn mỗi phút so với bản không truyền phát.

Đa ngôn ngữ và phương ngữ

qwen3-asr-flash

Cùng với glm-asr-2512mimo-v2.5-asr. qwen3-asr-flashglm-asr-2512 là hai lựa chọn đa ngôn ngữ, còn mimo-v2.5-asr được tinh chỉnh cho các phương ngữ tiếng Trung.

Mẹo Việc tính tiền đếm độ dài âm thanh bạn tải lên, theo tỉ lệ một nghìn token mỗi phút, và thời lượng được làm tròn lên tới giây trước khi quy đổi — nên một đoạn năm giây tính thành 83 token, còn bất cứ đoạn nào ngắn hơn một giây vẫn bị tính như một giây. Bản chép lời thì miễn phí. Vì vậy chi phí tỉ lệ với độ dài bản ghi chứ không phải với lượng lời nói trong đó, nên cắt bớt khoảng lặng là việc đáng làm.