Standard & Paid Price
Standard Price
| Meter | Standard Price |
|---|---|
| Input price | $0.0220 / audio hour |
Billing details
Description
StepFun StepAudio 2.5 ASR — 4B-parameter speech recognition model built on Multi-Token Prediction, transcribing five minutes of audio in about one second (RTF around 0.0053). Optimized for Chinese and English. Includes inverse text normalization, speaker identification, and dual-channel separation for call and meeting recordings. Accepts ogg, mp3, and wav uploads; transcript output is not billed.
Capabilities
- Tasks
- transcription
API endpoints
POST /v1/audio/transcriptions(audio-transcription)