step-tts-2
同类还有 stepaudio-2.5-tts。两者都能用约 10 秒的参考音频克隆声音,情感和语气可以用自然语言来指定。
没有匹配的结果。试试协议、能力或端点路径。
POST /v1/audio/speech 直接返回音频本身,而不是 JSON:响应体就是编码后的文件,Content-Type 随 response_format 而定,因此 mp3 返回的是 audio/mpeg。关键字段是 model、input 和 voice;speed 和 instructions 为可选,各模型会公布各自的音色名称。请把响应直接写入文件——按文本解码会损坏文件。
curl https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"input": "ChinaAPI text to speech verification.",
"voice": "cixingnansheng",
"response_format": "mp3"
}' \
--output speech.mp3
# HTTP 200, Content-Type: audio/mpeg
同类还有 stepaudio-2.5-tts。两者都能用约 10 秒的参考音频克隆声音,情感和语气可以用自然语言来指定。
同类还有 speech-2.8-turbo。hd 版本是本端点上保真度最高的选项,价格也相应较高;turbo 以部分保真度换取更低的延迟,价格约为一半。
同类还有 glm-tts。两者都支持多语言,价格低于克隆类模型,因此在不需要特定克隆音色时,它们是合理的默认选择。
voice:每个模型都有默认音色,由我们代为发送——qwen3-tts-flash 为 Cherry,glm-tts 为 tongtong,step-tts-2 和 stepaudio-2.5-tts 为 cixingnansheng,mimo-v2.5-tts 和两个 speech-2.8 模型为 alloy。OpenAI 自家的音色名称在所有模型上都能使用;在中国模型上,它们不会被拒绝,而是回落为该模型的默认音色,因此现有的 OpenAI 客户端无需改动,直接指向这个端点即可工作。以上只是默认值,并非完整列表——各厂商公布的音色还有更多。有两个变体完全不接受音色名称:mimo-v2.5-tts-voiceclone 从 voice 中读取 data URL 形式的参考音频片段,mimo-v2.5-tts-voicedesign 则改为从 instructions 中读取音色描述。
input 的字符数,1 个字符计为 1 个 token,因此发送请求之前就能知道费用。生成的音频同样会被计量,并按每分钟 1000 个 token 记为补全 token,但其计费费率为零——一个 59 个字符的请求生成了约 5 秒语音,日志记录为 59 个提示 token、83 个补全 token,最终按 59 个 token 计费。标点和空格也计入字符数。