Tidak ada yang cocok. Coba nama protokol, kemampuan, atau path endpoint.
POST /v1/audio/speech mengembalikan audionya langsung, bukan JSON: body-nya adalah berkas terenkode dan Content-Type mengikuti response_format, jadi mp3 kembali sebagai audio/mpeg. Field yang penting adalah model, input, dan voice; speed dan instructions opsional, dan tiap model menerbitkan nama suaranya sendiri. Tulis responsnya langsung ke berkas — mendekodenya sebagai teks akan merusaknya.
Bersama step-tts-mini dan stepaudio-2.5-tts. Ketiganya mengkloning suara dari sekitar sepuluh detik audio referensi dan menerima arahan emosi serta gaya bicara dalam bahasa alami. step-tts-mini adalah anggota berlatensi rendah dan berbiaya rendah.
Definisi tinggi
speech-2.8-hd
Bersama speech-2.8-turbo. Varian hd paling tinggi kesetiaannya di endpoint ini dan harganya menyesuaikan; turbo menukar sebagian kualitas itu demi latensi, dengan tarif sekitar separuhnya.
Multibahasa
qwen3-tts-flash
Bersama glm-tts. Keduanya multibahasa dan lebih murah daripada model kloning, sehingga jadi pilihan default yang masuk akal ketika Anda tidak butuh suara kloning tertentu.
Suara bawaanMengosongkan voice aman: tiap model punya nilai bawaan yang kami kirimkan untuk Anda — Cherry pada qwen3-tts-flash, tongtong pada glm-tts, cixingnansheng pada step-tts-2, step-tts-mini dan stepaudio-2.5-tts, serta alloy pada mimo-v2.5-tts dan kedua model speech-2.8. Nama suara milik OpenAI diterima di mana saja; pada model Tiongkok nama itu dilipat ke bawaan model tersebut alih-alih ditolak, jadi mengarahkan klien OpenAI yang sudah ada ke endpoint ini langsung berjalan. Ini nilai bawaan, bukan daftar lengkap — tiap vendor menerbitkan lebih banyak. Dua varian tidak menerima nama suara sama sekali: mimo-v2.5-tts-voiceclone membaca klip referensi dari voice sebagai data URL, dan mimo-v2.5-tts-voicedesign menerima deskripsinya di instructions.
TipsPenagihan menghitung karakter input, satu karakter satu token, jadi biayanya sudah diketahui sebelum permintaan dikirim. Audio yang dihasilkan juga diukur dan muncul sebagai completion token pada seribu token per menit, tetapi ditagih dengan tarif nol — permintaan lima puluh sembilan karakter yang menghasilkan sekitar lima detik ucapan tercatat 59 prompt token, 83 completion token, dan ditagih atas angka 59. Tanda baca dan spasi ikut dihitung sebagai karakter.