stepaudio-2.5-asr

Audio
ASR
Transcription

Standard & Paid Price

Standard Price
MeterStandard Price
Input price$0.0220 / audio hour
Billing details

Description

StepFun StepAudio 2.5 ASR — 4B-parameter speech recognition model built on Multi-Token Prediction, transcribing five minutes of audio in about one second (RTF around 0.0053). Optimized for Chinese and English. Includes inverse text normalization, speaker identification, and dual-channel separation for call and meeting recordings. Accepts ogg, mp3, and wav uploads; transcript output is not billed.

Capabilities

Tasks
transcription

API endpoints

  • POST /v1/audio/transcriptions (audio-transcription)