Nada corresponde. Tente um protocolo, uma capacidade ou um caminho de endpoint.
POST /v1/audio/speech devolve o próprio áudio, não JSON: o corpo é o arquivo codificado e Content-Type segue response_format, então mp3 volta como audio/mpeg. Os campos que importam são model, input e voice; speed e instructions são opcionais, e cada modelo publica os próprios nomes de voz. Grave a resposta direto em arquivo — decodificá-la como texto vai corrompê-la.
Junto com step-tts-mini e stepaudio-2.5-tts. Os três clonam uma voz a partir de cerca de dez segundos de áudio de referência e aceitam emoção e entrega como instrução em linguagem natural. step-tts-mini é o de baixa latência e baixo custo.
Alta definição
speech-2.8-hd
Junto com speech-2.8-turbo. A variante hd é a de maior fidelidade do endpoint e cobra de acordo; turbo troca parte disso por latência, a cerca de metade da tarifa.
Multilíngue
qwen3-tts-flash
Junto com glm-tts. Ambos são multilíngues e mais baratos que os modelos de clonagem, o que os torna o padrão sensato quando você não precisa de uma voz clonada específica.
Vozes padrãoOmitir voice é seguro: cada modelo tem um padrão que enviamos por você — Cherry no qwen3-tts-flash, tongtong no glm-tts, cixingnansheng no step-tts-2, step-tts-mini e stepaudio-2.5-tts, e alloy no mimo-v2.5-tts e nos dois modelos speech-2.8. Os nomes de voz da própria OpenAI são aceitos em toda parte; nos modelos chineses eles são dobrados para o padrão daquele modelo em vez de recusados, então apontar um cliente OpenAI existente para este endpoint funciona sem mudanças. Estes são padrões, não a lista completa — cada fornecedor publica mais. Duas variantes não aceitam nome de voz: mimo-v2.5-tts-voiceclone lê um trecho de referência em voice como data URL, e mimo-v2.5-tts-voicedesign recebe a descrição em instructions.
DicaA cobrança conta os caracteres de input, um caractere por token, então o custo é conhecido antes do envio. O áudio gerado também é medido e aparece como tokens de conclusão à razão de mil tokens por minuto, mas é cobrado a uma taxa zero — uma requisição de cinquenta e nove caracteres que produziu cerca de cinco segundos de fala registrou 59 tokens de prompt, 83 de conclusão, e foi cobrada sobre os 59. Pontuação e espaços contam como caracteres.