stepaudio-2.5-asr
step-asr, step-asr-1.1, stepaudio-2-asr-pro도 같습니다. stepaudio-2.5-asr은 이 엔드포인트에서 압도적으로 저렴하고, pro와 1.1은 약 열다섯 배 비싸므로 어려운 오디오에서의 정확도가 중요할 때만 값을 합니다.
일치하는 항목이 없습니다. 프로토콜, 기능 또는 엔드포인트 경로로 검색해 보세요.
POST /v1/audio/transcriptions은 JSON이 아니라 multipart/form-data를 받습니다. model은 폼 필드로, 녹음은 file이라는 이름의 파일 파트로 보내세요. 응답은 {"text": "…"}입니다. POST /v1/audio/translations는 형태가 같고 영어를 돌려줍니다. 동영상 엔드포인트와 달리 이쪽은 동기 방식이라, 긴 녹음은 끝날 때까지 연결을 붙잡고 있습니다.
curl https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-F model=stepaudio-2.5-asr \
-F file=@speech.mp3
# {"text":" China api text to speech verification."}
step-asr, step-asr-1.1, stepaudio-2-asr-pro도 같습니다. stepaudio-2.5-asr은 이 엔드포인트에서 압도적으로 저렴하고, pro와 1.1은 약 열다섯 배 비싸므로 어려운 오디오에서의 정확도가 중요할 때만 값을 합니다.
step-asr-1.1-stream도 같습니다. 이들은 마지막에 한 덩어리로 주는 대신 오디오를 읽어 가면서 부분 텍스트를 돌려주므로 실시간 자막에 적합합니다. 둘 다 분당 요금은 비스트리밍판보다 비쌉니다.
glm-asr-2512, mimo-v2.5-asr도 같습니다. qwen3-asr-flash와 glm-asr-2512가 다국어용이고, mimo-v2.5-asr은 중국어 방언에 맞춰진 모델입니다.