Preços dos modelos de IA chineses

A ChinaAPI oferece DeepSeek, Qwen, GLM, Kimi e outros modelos de IA chineses em um gateway compatível com OpenAI em https://api.chinaapi.ai/v1. Todos os preços são em dólar americano, na unidade que o fornecedor de origem utiliza. A mesma lista está disponível em JSON em /api/pricing.

Preços dos modelos públicos
ModeloFornecedorEntradaSaídaUnidadeDescrição
wan2.7-t2v阿里巴巴$0.092por segundoAlibaba Wan2.7 (T2V) — texto para vídeo com atuação aprimorada, emoções sutis, ação intensa e cortes de câmera dramáticos. Produz MP4 H.264 em 720P ou 1080P, de 2 a 15 segundos (5 s por padrão), em 16:9, 9:16, 1:1, 4:3 ou 3:4, a partir de prompts de até 5.000 caracteres. O áudio vem incluído por padrão: sem audio_url, o modelo compõe uma trilha de fundo ou efeitos sonoros condizentes, ou é possível enviar no lugar uma faixa wav ou mp3 de 2 a 30 segundos.
agnes-image-2.0-flashAgnes AI$0.000por requisiçãoAgnes AI Image 2.0 Flash — modelo rápido de geração e edição de imagens para texto para imagem, imagem para imagem e composição com várias imagens, com os resultados disponíveis como URL ou dados Base64.
doubao-seedance-2-0-mini-260615字节跳动$3.5000$3.5000por 1M tokensByteDance Seedance 2.0 Mini — o nível leve e de baixo custo da linha Seedance 2.0, limitado a 480p e 720p, 24 fps, 4 a 15 segundos. Traz o mesmo conjunto de recursos documentado do restante da linha: texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16.
step-3.5-flash-2603StepFun$0.1000$0.3000por 1M tokensStepFun step-3.5-flash-2603 — instantâneo de 256K do step-3.5-flash ajustado para agentes, otimizado para eficiência de tokens e um modo de operação com pouca inferência. Seu parâmetro reasoning_effort aceita apenas low e high, enquanto o modelo base aceita três níveis, portanto o código que envia medium precisa ser adaptado. Somente texto; oferece suporte a chamada de ferramentas, saída estruturada por JSON Schema, streaming e cache de prompts.
deepseek-v4-flashDeepSeek$0.1400$0.2800por 1M tokensDeepSeek V4 Flash — o nível rápido e de alta concorrência do DeepSeek V4 para chat, apoio à programação e ciclos de agentes, com janela de contexto de 1M tokens e saída máxima de 384K. Funciona tanto no modo de raciocínio (padrão) quanto sem raciocínio, e oferece suporte a chamada de ferramentas e saída em JSON. Texto na entrada, texto na saída.
doubao-seedream-4-5-251128字节跳动$0.038por requisiçãoByteDance Doubao Seedream 4.5 — texto para imagem e imagem para imagem com fusão de várias imagens, produzindo uma imagem única ou um conjunto de imagens relacionadas. O modo de imagem única aceita apenas um prompt, uma imagem de referência, ou de 2 a 14 imagens de referência; o modo em conjunto (sequential_image_generation=auto) retorna até 15 imagens a partir de texto, até 14 a partir de uma única imagem de referência, ou um conjunto a partir de 2 a 14 referências desde que a soma de entradas e saídas não passe de 15. Oferece suporte a saídas em 2K e 4K e retorna JPEG por padrão, como URL ou base64. A edição interativa por coordenadas é exclusiva do Seedream 5.0 pro.
mimo-v2.5-ttsXiaomi$0.0000por 10 mil caracteresXiaomi MiMo v2.5 TTS — síntese de voz expressiva com oito vozes integradas, quatro em chinês e quatro em inglês (Mia, Chloe, Milo, Dean), cobrindo chinês e inglês além dos estilos dialetais do Nordeste, de Sichuan, de Henan e do cantonês. A entrega é dirigida de duas formas: instruções de estilo em linguagem natural e tags de áudio embutidas para emoções básicas e compostas, respiração, suspiros e ritmo, incluindo um modo de canto exclusivo deste modelo na linha MiMo TTS. Retorna wav mono ou pcm16 a 24 kHz e oferece suporte a streaming de baixa latência, que exige pcm16. Contexto de 8K e saída máxima de 8K.
MiniMax-H3MiniMax$0.080por segundoMiniMax H3 (Hailuo 3.0) — modelo de vídeo multimodal de uso geral, aberto e de nova geração, que produz áudio estéreo nativo em uma única passagem, em 768P ou 2K, com 4 a 15 segundos (apenas números inteiros), a 24 fps. Ele cobre texto para vídeo, imagem para vídeo a partir de um primeiro e/ou último quadro, e geração por referência a partir de imagens, vídeos ou áudio para personagem, movimento, câmera, estilo, voz ou ritmo de montagem; imagem para vídeo e geração por referência não podem ser combinadas na mesma requisição. Ele aceita vídeo H.264/H.265, imagens JPG, JPEG, PNG, WEBP, HEIC e HEIF, e áudio WAV ou MP3, com prompts de até 7.000 caracteres. $0,08/s em 768P e $0,13/s em 2K.
doubao-seed-2-1-pro-260628字节跳动$0.9230$4.6150por 1M tokensByteDance Doubao Seed 2.1 Pro — modelo de agente carro-chefe da Doubao para trabalho em produção, cobrindo raciocínio profundo, geração de texto, compreensão multimodal, chamada de ferramentas e saída estruturada, para a qual o fornecedor recomenda o modo json_schema. Janela de contexto de 256K com entrada máxima de 256K, até 256K tokens de saída (4K por padrão) e um orçamento de 256K para a cadeia de raciocínio. Aceita texto, imagem e vídeo e retorna texto; a compreensão de áudio não é listada para a linha 2.1. Oferece suporte a cache de contexto implícito e explícito, incluindo caches de prefixo e de sessão.
image-01MiniMax$0.004por requisiçãoMiniMax image-01 — geração de imagens a partir de texto pelo endpoint nativo image_generation da MiniMax. Cobrado por imagem gerada. O fornecedor o classifica entre os modelos legados.
MiniMax-M2.7MiniMax$0.2880$1.1510por 1M tokensMiniMax M2.7 — modelo de texto para chat, programação, trabalho de escritório e tarefas agênticas, com janela de contexto de 204.800 tokens e saída a cerca de 60 tokens por segundo. Apenas texto: a API aceita blocos de conteúdo de texto e de chamada de ferramenta, mas não imagens nem vídeo. Oferece suporte a chamada de ferramentas; o thinking fica sempre ativo e não pode ser desligado.
qwen3.6-flash阿里巴巴$0.1850$1.1080por 1M tokensAlibaba Qwen3.6-Flash — modelo rápido de visão e linguagem que o fornecedor destaca para programação agêntica e para inteligência espacial, com ganhos marcantes em localização e detecção de objetos. Janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 65.536 tokens de saída e um orçamento de 131.072 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto. Oferece suporte a chamada de funções e cache de contexto.
step-audio-r1.5StepFun$1.5500$16.2750por 1M tokensStepFun step-audio-r1.5 — modelo de voz ponta a ponta da mesma família do step-audio-2, com o mesmo preço de entrada e uma saída cobrada 50% mais cara. A StepFun não publica uma página de recursos separada para este modelo; consulte a documentação de áudio da plataforma para conhecer o conjunto de parâmetros vigente.
stepaudio-2.5-ttsStepFun$0.8500por 10 mil caracteresStepFun StepAudio 2.5 TTS — síntese de voz contextual que leva a compreensão por todo o pipeline de geração, em vez de tratar a entonação como pós-processamento. Voz, emoção e ritmo são dirigidos em linguagem natural em dois níveis: um contexto global para a requisição e um contexto em linha para trechos específicos. A clonagem de voz zero-shot exige cerca de 3 segundos de áudio de referência e herda todo o conjunto de controles contextuais. Aceita até 1000 caracteres por requisição; gera wav, mp3, flac ou opus.
kling-v3快手$0.420por requisiçãoKuaishou Kling 3.0 — texto para vídeo e imagem para vídeo com áudio nativo e melhor consistência dos elementos. Os clipes duram de 3 a 15 segundos (5 por padrão) em 16:9, 9:16 ou 1:1, com o nível escolhido por mode: std para 720P, pro para 1080P e 4k para 4K nativo. O áudio é opcional e precisa ser ligado com sound=on, vindo desligado por padrão; imagem para vídeo usa um primeiro quadro com um quadro final opcional. A partir de $0,083/s (720p).
step-audio-2StepFun$1.5500$10.8500por 1M tokensStepFun step-audio-2 — modelo de voz ponta a ponta que consome o áudio diretamente, em vez de partir de uma transcrição, de modo que o tom e a entonação chegam íntegros à compreensão do modelo. Cobrado por token, com o preço de entrada da linha StepAudio 2.5 e um preço de saída mais alto. A StepFun não publica uma página de recursos separada para este modelo; consulte a documentação de áudio da plataforma para conhecer o conjunto de parâmetros vigente.
step-tts-2StepFun$0.4000por 10 mil caracteresStepFun step-tts-2 — síntese de voz ponta a ponta baseada em NTP, feita para reproduzir sotaques com precisão. Fala chinês, inglês, mistura de chinês e inglês e japonês, além de cantonês e sichuanês. A emoção e a entonação são dirigidas por rótulos em linguagem natural, e a clonagem de voz zero-shot exige cerca de 10 segundos de áudio de referência, com os controles de emoção e estilo se transferindo para a voz clonada sem custo adicional. Gera wav, mp3, flac, opus ou pcm.
hy3Tencent$0.1540$0.6150por 1M tokensTencent Hunyuan 3 (Hy3) — modelo MoE de 295B de parâmetros (21B ativos), contexto nativo de 256K e três modos de raciocínio (fast / low / deep). Forte em agentes de programação, compreensão de documentos longos, contexto em múltiplos turnos e fluxos de trabalho de agentes em várias etapas. Somente texto.
doubao-seedance-2-0-260128字节跳动$7.0000$7.0000por 1M tokensByteDance Seedance 2.0 — o carro-chefe da linha Seedance 2.0 e seu único integrante que chega a 1080p e 4K (profundidade de 10 bits) além de 480p e 720p, a 24 fps e de 4 a 15 segundos. Cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16, com o quadro final disponível como imagem. Cobrado pela resolução de saída.
doubao-seedance-2-5-260628字节跳动$10.7000$10.7000por 1M tokensByteDance Seedance 2.5 — o modelo principal da linha Seedance, que estende uma única geração para 4 a 30 segundos a 24 fps, mantendo a resolução limitada a 480p e 720p. A geração multimodal por referência chega a 1-30 imagens, até 10 vídeos de referência e até 10 trechos de áudio de referência (30 segundos no total para cada categoria) e, ao contrário da linha 2.0, uma referência de áudio pode ser usada sozinha. Ele também cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16.
kimi-k2.7-code-highspeedMoonshot$1.7810$7.3970por 1M tokensMoonshot Kimi K2.7 Code Highspeed — o nível de throughput do K2.7 Code, que serve o mesmo modelo a cerca de 180 tokens por segundo e até 260 em trabalhos de contexto curto. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens e vídeo como conteúdo base64 e retorna texto. O thinking é obrigatório e retorna erro se desativado; tool_choice fica limitado a auto ou none, e reasoning_content precisa ser repassado ao longo das chamadas de ferramentas em várias etapas.
MiniMax-M2.7-highspeedMiniMax$0.5750$2.3010por 1M tokensMiniMax M2.7 Highspeed — o mesmo modelo M2.7 servido a cerca de 100 tokens por segundo para programação de baixa latência e fluxos de trabalho de agentes, com janela de contexto de 204.800 tokens. Apenas texto: a API aceita blocos de conteúdo de texto e de chamada de ferramenta, mas não imagens nem vídeo. Oferece suporte a chamada de ferramentas; o thinking fica sempre ativo e não pode ser desligado.
stepaudio-2.5-asrStepFun$0.0220por hora de áudioStepFun StepAudio 2.5 ASR — modelo de reconhecimento de voz com 4B de parâmetros construído sobre Multi-Token Prediction, que transcreve cinco minutos de áudio em cerca de um segundo (RTF em torno de 0,0053). Otimizado para chinês e inglês. Inclui normalização inversa de texto, identificação de locutores e separação de dois canais para gravações de chamadas e reuniões. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada.
doubao-seed-2-1-turbo-260628字节跳动$0.4620$2.3080por 1M tokensByteDance Doubao Seed 2.1 Turbo — a via de baixa latência da linha Seed 2.1, que compartilha os limites do Pro: janela de contexto de 256K com entrada máxima de 256K, até 256K tokens de saída (4K por padrão) e um orçamento de 256K para a cadeia de raciocínio. Cobre raciocínio profundo, geração de texto, compreensão multimodal, chamada de ferramentas e saída estruturada, ainda que sem a recomendação de json_schema do Pro. Aceita texto, imagem e vídeo e retorna texto; a compreensão de áudio não é listada para a linha 2.1. Oferece suporte a cache de contexto implícito e explícito.
kimi-k2.7-codeMoonshot$0.7600$3.1570por 1M tokensMoonshot Kimi K2.7 Code — o modelo dedicado a programação da Kimi, que o fornecedor mede como tendo melhorado o cumprimento de instruções e a programação de longa duração em relação ao K2.6, ao mesmo tempo em que reduziu o excesso de raciocínio em cerca de 30% em média. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens e vídeo como conteúdo base64 e retorna texto. O thinking é obrigatório e retorna erro se desativado; tool_choice fica limitado a auto ou none, e reasoning_content precisa ser repassado ao longo das chamadas de ferramentas em várias etapas.
kling-3.0-turbo快手$0.560por requisiçãoKuaishou Kling 3.0 Turbo — o nível de custo-benefício da linha Kling 3.0, que gera 720P ou 1080P (720P por padrão) de 3 a 15 segundos (5 por padrão) em 16:9, 9:16 ou 1:1, a partir de um prompt ou de uma imagem de primeiro quadro. O áudio nativo vem sempre incluído e não tem chave para ligar ou desligar. Em relação ao kling-v3, ele abre mão do nível 4K, do controle do quadro final e da entrada de vídeo em troca de velocidade e custo. 720p 5 s com áudio ≈ $0,56.
qwen3-tts-flash阿里巴巴$0.1231por 10 mil caracteresAlibaba Qwen3-TTS-Flash — síntese de voz de baixa latência com 17 vozes integradas expressivas, cobrindo chinês, inglês, alemão, italiano, português, espanhol, japonês, coreano, francês e russo, além de um modo automático para textos que misturam idiomas e de saída em dialeto. Aceita até 512 tokens de texto por requisição e oferece suporte à síntese em streaming e fora dele.
qwen3.6-plus阿里巴巴$0.4000$2.4000por 1M tokensAlibaba Qwen3.6-Plus — modelo equilibrado para raciocínio geral e uso de ferramentas, com janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 65.536 tokens de saída e um orçamento de 81.920 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto. Oferece suporte a chamada de funções, saídas estruturadas, pesquisa na web, complementação de prefixo e cache de contexto.
stepaudio-2-asr-proStepFun$0.3500por hora de áudioStepFun StepAudio 2 ASR Pro — modelo de reconhecimento de voz com 32B de parâmetros, a opção que prioriza precisão na linha ASR da StepFun, enquanto o stepaudio-2.5-asr prioriza velocidade e custo. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada.
glm-5.2智谱$1.1200$3.5200por 1M tokensZhipu GLM-5.2 — modelo de fundação carro-chefe especializado em trabalho de agente de programação de longa duração, obtido por meses de treinamento dedicado e não apenas por uma extensão de contexto, com janela de contexto de 1M tokens e até 128K tokens de saída. Texto na entrada, texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP.
mimo-v2.5-tts-voicecloneXiaomi$0.0000por 10 mil caracteresModelo de clonagem de voz da Xiaomi MiMo: envie uma amostra de áudio de referência como data URL no campo voice (data:{mime};base64,...) e ele sintetiza a fala com essa voz, sem nenhuma etapa de treinamento, anotação ou ajuste fino. Aceita MP3 (audio/mpeg) ou WAV, com a string codificada em base64 limitada a 10 MB; a Xiaomi não publica uma duração mínima para o áudio de referência. As instruções de estilo em linguagem natural e as tags de áudio embutidas vêm do mimo-v2.5-tts, mas não há streaming — a requisição roda em modo de compatibilidade e só retorna depois que a síntese termina.
step-1o-turbo-visionStepFun$0.4000$1.2800por 1M tokensStepFun step-1o-turbo-vision — compreensão de imagens e vídeos com geração rápida de texto, contexto de 32K. Aceita texto, imagem e vídeo na entrada e retorna apenas texto. É um modelo de visão da geração anterior mantido por compatibilidade; o step-3.7-flash cobre as mesmas modalidades de entrada com contexto de 256K e profundidade de raciocínio selecionável. Mantenha as imagens abaixo de 4096 pixels no lado maior para um reconhecimento confiável.
step-2x-largeStepFun$0.016por requisiçãoStepFun Step 2X Large — geração de imagens a partir de texto com textura realista e uma renderização de texto em chinês e inglês dentro da própria imagem excepcionalmente boa. Suporta 256x256, 512x512, 768x768, 1024x1024, 1280x800 e 800x1280; uma imagem por requisição. Servido pelo endpoint images compatível com OpenAI.
stepaudio-2.5-asr-stream$0.1800por hora de áudio
gemini-3.6-flashGoogleCobrança escalonada, consulte a página de preçosGoogle Gemini 3.6 Flash — modelo de raciocínio multimodal em versão estável que equilibra velocidade e inteligência para tarefas agênticas e do mundo real, com contexto de entrada de 1.048.576 tokens e limite de saída de 65.536 tokens. Ele aceita texto, imagens, vídeo, áudio e PDFs, e oferece suporte a thinking, chamada de funções, execução de código, embasamento por busca, saída estruturada e Computer Use (prévia).
MiniMax-Hailuo-02MiniMax$0.280por requisiçãoMiniMax Hailuo 02 — geração de vídeo econômica que cobre tanto texto para vídeo quanto imagem para vídeo a 24 fps, com 512p e 768p disponíveis em clipes de 6 ou 10 segundos e 1080p em 6 segundos. O nível 512p é a porta de entrada da linha Hailuo.
qwen3.7-max阿里巴巴$2.5000$7.5000por 1M tokensAlibaba Qwen3.7-Max — carro-chefe de código fechado posicionado para programação, trabalho de escritório e produtividade, e execução autônoma de longo prazo, com janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 131.072 tokens de saída e um orçamento de 262.144 tokens para a cadeia de raciocínio. Texto na entrada, texto na saída. Oferece suporte a chamada de funções, saídas estruturadas e cache de contexto.
step-3.5-flashStepFun$0.1000$0.3000por 1M tokensStepFun step-3.5-flash — modelo de raciocínio somente texto com contexto de 256K, voltado a lógica, matemática, engenharia de software e pesquisa aprofundada, onde a qualidade do raciocínio precisa vir acompanhada de execução rápida e confiável. A profundidade do raciocínio é escolhida por requisição via reasoning_effort (low / medium / high). Oferece suporte a chamada de ferramentas, saída estruturada por JSON Schema, streaming e cache de prompts. Para entrada de imagem ou vídeo, use o step-3.7-flash.
step-image-edit-2StepFun$0.004por requisiçãoStepFun Step Image Edit 2 — modelo unificado de geração de imagens a partir de texto e de edição de imagens com menos de 6B de parâmetros, no nível dos editores de pesos abertos na faixa de 12B a 20B. Ele conclui uma edição em um a dois segundos e foi feito para retoques interativos de baixa latência. Suporta 256x256, 512x512, 768x768, 1024x1024, 1280x800 e 800x1280, além de prompts negativos e um modo de otimização de texto; uma imagem por requisição. Servido pelo endpoint images compatível com OpenAI.
wan2.7-videoedit阿里巴巴$0.092por segundoAlibaba Wan2.7 VideoEdit — edição de vídeo em linguagem natural, local ou global, substituição de elementos por imagem de referência e reprodução de movimento, efeitos e câmera.
glm-5.1智谱$1.1200$3.5200por 1M tokensZhipu GLM-5.1 — modelo de fundação carro-chefe construído para trabalho autônomo prolongado: o fornecedor documenta execução contínua e sem supervisão em uma única tarefa por até 8 horas, abrangendo planejamento, execução, testes e otimização iterativa. Janela de contexto de 200K, até 128K tokens de saída, texto na entrada e texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP.
happyhorse-1.1-t2v阿里巴巴$0.083por segundoAlibaba HappyHorse 1.1 (T2V) — texto para vídeo com melhor compreensão semântica, controle de câmera e geração dinâmica. Vídeo 720P/1080P fluido, detalhado e fisicamente coerente.
kimi-k2.6Moonshot$0.7600$3.1570por 1M tokensMoonshot Kimi K2.6 — modelo de uso geral para diálogo, geração de código, compreensão visual e tarefas de agentes, com escrita de código de longa duração e execução autônoma mais fortes que na geração anterior. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens (png, jpeg, webp, gif) e vídeo (mp4, mov, webm e outros) como conteúdo base64 e retorna texto. O modo de raciocínio vem ligado por padrão e pode ser desativado; a temperatura é fixa em 1.0 com raciocínio e 0.6 sem ele.
speech-2.8-turboMiniMax$0.3077por 10 mil caracteresMiniMax speech-2.8-turbo — o nível de baixa latência da linha de voz 2.8, que troca a entrega ultrarrealista do modelo HD por uma síntese mais rápida e de fluxo natural. Cobre os mesmos 40 idiomas e 7 emoções, com tom, velocidade da fala, volume, taxa de amostragem, taxa de bits e formato de saída configuráveis, e aceita até 1 milhão de caracteres de forma assíncrona ou 10.000 caracteres pela interface de streaming.
step-1o-audioStepFun$3.8500$9.2400por 1M tokensStepFun step-1o-audio — modelo de voz ponta a ponta da geração anterior, com suporte multilíngue e chamada de ferramentas, limitado a 30 minutos por interação. Em grande parte substituído pela linha StepAudio 2.5; mantido para cargas de trabalho já construídas sobre ele.
step-asr-1.1StepFun$0.3500por hora de áudioStepFun step-asr-1.1 — versão atualizada do reconhecedor de uso geral da linha step-asr, cobrindo chinês, inglês e dialetos chineses. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada.
agnes-video-v2.0Agnes AI$0.000por segundoAgnes AI Video V2.0 — modelo assíncrono de geração de vídeo para texto para vídeo, imagem para vídeo, quadros-chave a partir de várias imagens e movimentos cinematográficos, com níveis de saída normalizados em 480p, 720p e 1080p.
glm-5智谱$1.0000$3.2000por 1M tokensZhipu GLM-5 — MoE de 744B parâmetros com 40B ativos, treinado em 28,5T tokens e usando DeepSeek Sparse Attention, com janela de contexto de 200K e até 128K tokens de saída. Texto na entrada, texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP.
mimo-v2.5Xiaomi$0.1400$0.2800por 1M tokensXiaomi MiMo-V2.5 — modelo nativamente multimodal completo, com contexto de 1M e saída máxima de 128K, que entende imagens, vídeo, áudio e texto em um único modelo. Oferece suporte a raciocínio profundo, chamada de funções, saída estruturada e pesquisa na web, com capacidade de agente em todas as modalidades.
MiniMax-Hailuo-2.3-FastMiniMax$0.190por requisiçãoMiniMax Hailuo 2.3 Fast — o nível de velocidade e custo do Hailuo 2.3, voltado a imagem para vídeo e ao realismo do movimento físico, a 24 fps, com 768p disponível em clipes de 6 ou 10 segundos e 1080p em 6 segundos. 768p 6 s = $0,19.
qwen3.8-max阿里巴巴$1.9900$5.9700por 1M tokensAlibaba Qwen3.8-Max — modelo MoE carro-chefe de 2,4 trilhões de parâmetros e o mais capaz da família Qwen, com o fornecedor citando ganhos expressivos em programação e produtividade de escritório. Janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 131.072 tokens de saída e um orçamento de 262.144 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto; oferece suporte a chamada de funções, saídas estruturadas e cache de contexto.
doubao-seedream-5-0-260128字节跳动$0.034por requisiçãoByteDance Doubao Seedream 5.0-lite — texto para imagem e imagem para imagem, com criação controlável mais inteligente, recuperação em tempo real e maior consistência de sujeito (resolução de 2K ou mais).
glm-asr-2512智谱$0.1440por hora de áudioZhipu GLM-ASR-2512 — modelo de reconhecimento de voz que reporta uma taxa de erro de caracteres de 0,0717. Cobre o mandarim junto com o sichuanês, o cantonês, o min nan e o wu, os sotaques do inglês americano e britânico, e dezenas de outros idiomas, entre eles francês, alemão, japonês, coreano, espanhol e árabe. Lida com fala que mistura idiomas, jargão técnico e registro coloquial, e aceita um dicionário personalizado para vocabulário de domínio. O áudio é limitado a 30 segundos e 25 MB por requisição, com transcrição em lote e em streaming.
glm-tts智谱$0.3077por 10 mil caracteresZhipu GLM-TTS — síntese de voz construída sobre uma arquitetura de geração em duas etapas com aprendizado por reforço GRPO, que infere emoção e entonação do texto ao redor em vez de exigir marcação explícita. Traz sete vozes integradas (tongtong por padrão, xiaochen, chuichui, jam, kazi, douji, luodo) com velocidade e volume ajustáveis, aceita até 1.024 caracteres por requisição e transmite com latência de primeiro quadro abaixo de 400 ms. Retorna wav ou pcm a uma taxa de amostragem recomendada de 24 kHz; o streaming é apenas em pcm.
wan2.7-i2v阿里巴巴$0.092por segundoAlibaba Wan 2.7 Image-to-Video — cobre a geração a partir do primeiro quadro, as transições entre primeiro e último quadro e a continuação de um clipe existente. Produz 720P ou 1080P (1080P por padrão) de 2 a 15 segundos, 5 s por padrão, a partir de prompts de até 5.000 caracteres (prompts negativos de até 500). Uma faixa mp3 ou wav de 2 a 30 segundos pode ser enviada como driving_audio; sem áudio, o modelo gera uma trilha de fundo ou efeitos sonoros condizentes, um áudio mais longo que o clipe é cortado e um áudio mais curto deixa o final em silêncio.
glm-5v-turbo智谱$0.7690$3.3850por 1M tokensZhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows.
happyhorse-1.1-i2v阿里巴巴$0.083por segundoAlibaba HappyHorse 1.1 (I2V) — imagem para vídeo com melhor textura, consistência de identidade entre clipes, fluidez de movimento e sincronia entre áudio e imagem. 720P/1080P.
mimo-v2.5-proXiaomi$0.4350$0.8700por 1M tokensXiaomi MiMo-V2.5-Pro — carro-chefe de um trilhão de parâmetros (42B ativos), contexto de 1M e saída máxima de 128K, ajustado para cargas de trabalho de agentes de alta intensidade. Oferece suporte a raciocínio profundo, chamada de funções, saída estruturada e pesquisa na web. Apenas geração de texto: ao contrário do mimo-v2.5, a lista de recursos do fornecedor não inclui a compreensão de todas as modalidades.
mimo-v2.5-tts-voicedesignXiaomi$0.0000por 10 mil caracteresModelo de design de voz da Xiaomi MiMo: descreva em linguagem natural a voz desejada no campo instructions e ele sintetiza a fala com essa voz projetada.
qwen3.7-plus阿里巴巴$0.3080$1.2310por 1M tokensAlibaba Qwen3.7-Plus — modelo de agente híbrido multimodal que percebe cenas do mundo real, lê telas e opera interfaces gráficas, gera código a partir de referências visuais e faz navegação de ponta a ponta dentro de aplicativos móveis. Janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 131.072 tokens de saída e um orçamento de 262.144 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto; oferece suporte a chamada de funções, saídas estruturadas e cache de contexto.
step-asrStepFun$0.1500por hora de áudioStepFun step-asr — reconhecimento de voz de uso geral cobrindo chinês, inglês e dialetos chineses, para transcrição, atas de reunião, avaliação de qualidade de chamadas e busca por voz. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada.
wan2.7-image阿里巴巴$0.031por requisiçãoAlibaba Wan2.7 Image — texto para imagem, edição de imagens, geração com várias imagens de referência, edição interativa, além de boa renderização de texto e aderência às instruções.
agnes-2.0-flashAgnes AI$0.0000por 1M tokensAgnes AI Agnes 2.0 Flash — modelo de agente multimodal rápido com contexto de entrada de 256K e limite de saída de referência de 64K, com suporte a chat, streaming, chamada de ferramentas, programação, raciocínio, compreensão visual e fluxos de trabalho de agentes.
agnes-2.5-flashAgnes AI$0.0000por 1M tokensAgnes AI Agnes 2.5 Flash — modelo de agente multimodal rápido com contexto de entrada de 512K e limite de saída de referência de 65,5K, com suporte a chat, streaming, chamada de ferramentas, programação, raciocínio, diálogo multi-turno, compreensão visual e fluxos de trabalho de agentes.
glm-5-turbo智谱$1.2000$4.0000por 1M tokensZhipu GLM-5-Turbo — a variante do GLM-5 voltada a throughput, otimizada para fluxos de trabalho de agentes: invocação de ferramentas e habilidades mais estável ao longo de tarefas de várias etapas, melhor tratamento de instruções longas e encadeadas, e execução de tarefas agendadas ou de longa duração. Janela de contexto de 200K, até 128K tokens de saída, texto na entrada e texto na saída. Oferece suporte a modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP.
happyhorse-1.1-r2v阿里巴巴$0.083por segundoAlibaba HappyHorse 1.1 (R2V) — geração de vídeo a partir de referências, com até 9 imagens de referência, forte consistência de sujeito, cena e estilo, e controle de câmera. 720P/1080P.
kimi-k3Moonshot$2.7400$13.6990por 1M tokensMoonshot Kimi K3 — carro-chefe de 2,8 trilhões de parâmetros para programação de longa duração, trabalho do conhecimento de ponta a ponta e raciocínio profundo, com janela de contexto de 1M tokens e até 1.048.576 tokens de conclusão (131.072 por padrão). Aceita texto, imagens em base64 e vídeo, e retorna texto. O thinking fica sempre ativo, com reasoning_effort selecionável entre low, high ou max (max por padrão); a temperatura é fixa em 1.0. Oferece suporte a chamada de ferramentas personalizadas e ao carregamento dinâmico de ferramentas.
speech-2.8-hdMiniMax$0.5385por 10 mil caracteresMiniMax speech-2.8-hd — o nível de alta definição da linha de voz 2.8, posicionado para uma entrega ultrarrealista com tags de som, cobrindo 40 idiomas e 7 emoções. Tom, velocidade da fala, volume, taxa de amostragem, taxa de bits e formato de saída são configuráveis por requisição, e a síntese de textos longos aceita até 1 milhão de caracteres de forma assíncrona ou 10.000 caracteres pela interface de streaming.
step-3.7-flashStepFun$0.2000$1.1500por 1M tokensStepFun step-3.7-flash — MoE esparso com 198B de parâmetros totais e 11B ativos, contexto nativo de 256K e compreensão nativa de imagens e vídeos além de texto. A profundidade do raciocínio é escolhida por requisição via reasoning_effort (low / medium / high), e o modelo oferece suporte a chamada de ferramentas em várias etapas de forma confiável, saída estruturada por JSON Schema, streaming e cache de prompts. Ajustado para cargas de trabalho de agentes e de programação.
stepaudio-2.5-chatStepFun$1.5000$3.5000por 1M tokensStepFun StepAudio 2.5 Chat — modelo de compreensão de fala ponta a ponta: recebe áudio ou texto e devolve texto, lendo sinais paralinguísticos como hesitação e riso na própria forma de onda, e não em uma transcrição. Oferece ampla personalização de personas, abrangendo caráter, hábitos de fala e amplitude emocional. O áudio é enviado como partes de conteúdo input_audio no endpoint chat completions. Para respostas faladas, use um modelo de TTS.
agnes-image-2.1-flashAgnes AI$0.000por requisiçãoAgnes AI Image 2.1 Flash — modelo de geração e edição de imagens focado em detalhes para cenas de alta densidade de informação, cobrindo texto para imagem, imagem para imagem e composição com várias imagens, em tamanhos e proporções flexíveis de 1K a 4K.
deepseek-v4-proDeepSeek$0.4350$0.8700por 1M tokensDeepSeek V4 Pro — o nível de maior capacidade do DeepSeek V4 para programação, raciocínio e trabalho agêntico, com janela de contexto de 1M tokens e saída máxima de 384K. Funciona tanto no modo de raciocínio (padrão) quanto sem raciocínio, e oferece suporte a chamada de ferramentas e saída em JSON. Texto na entrada, texto na saída.
LongCat-2.0Meituan$0.3000$1.2000por 1M tokensMeituan LongCat-2.0 — modelo MoE aberto de 1,6T de parâmetros com contexto nativo de 1M, feito para programação agêntica e uso de ferramentas de longa duração. Modelo de raciocínio somente texto.
MiniMax-Hailuo-2.3MiniMax$0.280por requisiçãoMiniMax Hailuo 2.3 — texto para vídeo e imagem para vídeo, que o fornecedor posiciona pela aderência às instruções, a 24 fps, com 768p disponível em clipes de 6 ou 10 segundos e 1080p em 6 segundos. 768p 6 s = $0,28.
MiniMax-M3MiniMaxCobrança escalonada, consulte a página de preçosMiniMax M3 — modelo de programação multimodal de fronteira para raciocínio agêntico, uso de ferramentas e execução estruturada de tarefas, com janela de contexto de 1.000.000 tokens. Aceita texto, imagens de até 10 MB e vídeo de até 50 MB embutido ou 512 MB pela API de Files, e retorna texto. Oferece suporte a chamada de ferramentas, com o thinking opcional em vez de sempre ativo.
step-asr-1.1-stream$0.4000por hora de áudio
step-tts-miniStepFun$0.1500por 10 mil caracteresStepFun step-tts-mini — o integrante econômico e de baixa latência da linha TTS da StepFun, cobrindo os mesmos idiomas do step-tts-2 (chinês, inglês, mistura de chinês e inglês e japonês, além de cantonês e sichuanês) com um subconjunto das vozes integradas. Oferece suporte a rótulos de emoção e entonação em linguagem natural e à clonagem de voz zero-shot a partir de cerca de 10 segundos de áudio de referência. Gera wav, mp3, flac, opus ou pcm.
wan2.7-r2v阿里巴巴$0.092por segundoAlibaba Wan2.7 (R2V) — geração de vídeo a partir de referências, com até 5 referências mistas de imagem/vídeo mais uma referência de timbre de áudio, e maior consistência de personagens, objetos de cena e cenários.
doubao-seedance-2-0-fast-260128字节跳动$5.6000$5.6000por 1M tokensByteDance Seedance 2.0 Fast — geração de vídeo econômica que traz o conjunto completo de recursos do Seedance 2.0, mas limitada a 480p e 720p, 24 fps, 4 a 15 segundos. Cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. 480p 5 s ≈ $0,26.
kling-v3-omni快手$0.420por requisiçãoKling 3.0 Omni — geração de vídeo com várias imagens de referência. O preço exibido é o do nível std (720p, 5 s, sem áudio, sem vídeo de referência). Requisições que não definem mode usam o nível pro, padrão do fornecedor, e são cobradas 1,33x — cerca de $0,56 pelo mesmo clipe de 5 s; o 4k é cobrado 5x. Envie mode=std para ser cobrado pelo preço exibido.
mimo-v2.5-asrXiaomi$0.0740por hora de áudioModelo de reconhecimento de voz da Xiaomi MiMo otimizado para chinês e inglês, além de dialetos chineses, lidando com áudio ruidoso, captado a distância e com vários locutores, bem como com a transcrição de letras de música.
qwen3-asr-flash阿里巴巴$0.1235por hora de áudioAlibaba Qwen3-ASR-Flash — reconhecimento de voz construído sobre o modelo de fundação Qwen3, que identifica sozinho o idioma falado e transcreve 11 idiomas; a linha Qwen3-ASR documenta o mandarim junto com o sichuanês, o min nan, o wu e o cantonês, além de vários sotaques do inglês. Aceita aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma e wmv com até 5 minutos e 10 MB por requisição; a entrada pcm precisa estar em 16 kHz e os demais formatos são reamostrados para 16 kHz antes do reconhecimento.
wan2.7-image-pro阿里巴巴$0.060por requisiçãoAlibaba Wan 2.7 Image Pro — o nível profissional da linha de imagem Wan 2.7, cobrindo texto para imagem, conjuntos sequenciais de imagens, edição de imagens e geração com várias imagens de referência, com melhor aderência ao prompt. O texto para imagem chega a 4K (4096x4096), com níveis de 1K e 2K e tamanhos personalizados a partir de 768x768; os modos de edição e sequencial ficam limitados a 2K. Aceita até 9 imagens de referência (JPEG, JPG, PNG, BMP, WEBP; 240 a 8.000 px por lado, 20 MB cada), proporções de 1:8 a 8:1 e prompts de até 5.000 caracteres. Retorna PNG.