Tidak ada yang cocok. Coba nama protokol, kemampuan, atau path endpoint.
POST /v1/audio/transcriptions menerima multipart/form-data, bukan JSON: kirim model sebagai field formulir dan rekamannya sebagai bagian berkas bernama file. Balasannya {"text": "…"}. POST /v1/audio/translations berbentuk sama dan mengembalikan bahasa Inggris. Berbeda dari endpoint video, yang ini sinkron, jadi rekaman panjang menahan koneksi tetap terbuka sampai selesai.
POST /v1/audio/transcriptions
curl https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-F model=stepaudio-2.5-asr \
-F file=@speech.mp3
# {"text":" China api text to speech verification."}
Paling murah
stepaudio-2.5-asr
Bersama step-asr, step-asr-1.1, dan stepaudio-2-asr-pro. stepaudio-2.5-asr jauh paling murah di endpoint ini; varian pro dan 1.1 berbiaya sekitar lima belas kali lipat dan hanya sepadan bila akurasi pada audio sulit memang penting.
Streaming
stepaudio-2.5-asr-stream
Bersama step-asr-1.1-stream. Keduanya mengembalikan teks sebagian selagi audio dibaca alih-alih satu blok di akhir, yang memang dibutuhkan untuk teks langsung; keduanya berbiaya per menit lebih tinggi daripada padanan non-streaming-nya.
Multibahasa dan dialek
qwen3-asr-flash
Bersama glm-asr-2512 dan mimo-v2.5-asr. qwen3-asr-flash dan glm-asr-2512 adalah opsi multibahasa, sedangkan mimo-v2.5-asr disetel untuk dialek Tionghoa.
TipsPenagihan menghitung panjang audio yang Anda unggah, seribu token per menit, dan durasinya dibulatkan ke atas ke detik penuh sebelum konversi itu — jadi klip lima detik ditagih 83 token, dan apa pun yang kurang dari satu detik tetap ditagih seolah satu detik. Transkripnya sendiri gratis. Biayanya karena itu mengikuti panjang rekaman dan bukan seberapa banyak ucapan di dalamnya, sehingga memangkas keheningan itu sepadan.