음성 인식

POST /v1/audio/transcriptions은 JSON이 아니라 multipart/form-data를 받습니다. model은 폼 필드로, 녹음은 file이라는 이름의 파일 파트로 보내세요. 응답은 {"text": "…"}입니다. POST /v1/audio/translations는 형태가 같고 영어를 돌려줍니다. 동영상 엔드포인트와 달리 이쪽은 동기 방식이라, 긴 녹음은 끝날 때까지 연결을 붙잡고 있습니다.

POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -F model=stepaudio-2.5-asr \
  -F file=@speech.mp3

# {"text":" China api text to speech verification."}
최저 비용

stepaudio-2.5-asr

step-asr, step-asr-1.1, stepaudio-2-asr-pro도 같습니다. stepaudio-2.5-asr은 이 엔드포인트에서 압도적으로 저렴하고, pro1.1은 약 열다섯 배 비싸므로 어려운 오디오에서의 정확도가 중요할 때만 값을 합니다.

스트리밍

stepaudio-2.5-asr-stream

step-asr-1.1-stream도 같습니다. 이들은 마지막에 한 덩어리로 주는 대신 오디오를 읽어 가면서 부분 텍스트를 돌려주므로 실시간 자막에 적합합니다. 둘 다 분당 요금은 비스트리밍판보다 비쌉니다.

다국어와 방언

qwen3-asr-flash

glm-asr-2512, mimo-v2.5-asr도 같습니다. qwen3-asr-flashglm-asr-2512가 다국어용이고, mimo-v2.5-asr은 중국어 방언에 맞춰진 모델입니다.

과금은 업로드한 오디오의 길이를 분당 1000토큰으로 셉니다. 환산 전에 초 단위로 올림하므로 5초짜리는 83토큰이고, 1초 미만도 1초로 계산됩니다. 받아쓴 텍스트 자체는 무료입니다. 따라서 비용은 녹음에 말이 얼마나 들어 있는지가 아니라 녹음 길이에 비례하므로, 무음 구간을 잘라 내는 것이 이득입니다.