Preços dos modelos de IA chineses
A ChinaAPI oferece DeepSeek, Qwen, GLM, Kimi e outros modelos de IA chineses em um gateway compatível com OpenAI em https://api.chinaapi.ai/v1. Todos os preços são em dólar americano, na unidade que o fornecedor de origem utiliza. A mesma lista está disponível em JSON em /api/pricing.
60 modelos desbloqueiam preços Paid mais baixos após a primeira recarga: uma recarga de qualquer valor os ativa automaticamente para toda a conta. O preço Paid só aparece quando é menor que o preço Standard.
| Modelo | Fornecedor | Entrada | Saída | Entrada (preço Paid) | Saída (preço Paid) | Unidade | Descrição |
|---|---|---|---|---|---|---|---|
| agnes-2.5-flash | Agnes AI | $0.0000 | por 1M tokens | Agnes AI Agnes 2.5 Flash — modelo de agente multimodal rápido com contexto de entrada de 512K e limite de saída de referência de 65,5K, com suporte a chat, streaming, chamada de ferramentas, programação, raciocínio, diálogo multi-turno, compreensão visual e fluxos de trabalho de agentes. | |||
| agnes-2.5-pro | Agnes AI | $0.4500 | $0.9000 | por 1M tokens | Agnes AI Agnes 2.5 Pro — a versão comercial estável do modelo de benchmark 2.5 Pro Alpha, um modelo de raciocínio pago com contexto de entrada de 1M e saída máxima de 65.536 tokens, para programação avançada, raciocínio científico, análise de contexto longo, fluxos de trabalho de agentes e compreensão de imagens. | ||
| agnes-2.5-pro-beta | Agnes AI | $0.1000 | $0.3000 | por 1M tokens | Agnes AI Agnes 2.5 Pro Beta — o nível de preço baixo da família Pro, cobrado a um preço Beta próprio, bem abaixo do preço do 2.5 Pro, um modelo de raciocínio pago com o mesmo formato de requisição, os mesmos protocolos de texto e os mesmos limites de contexto, para programação avançada, raciocínio científico, análise de contexto longo, fluxos de trabalho de agentes e compreensão de imagens. | ||
| agnes-3.0-flash | Agnes AI | $0.0000 | por 1M tokens | Agnes AI Agnes 3.0 Flash — o modelo de linguagem de nova geração do fornecedor, feito para programação agêntica e execução de tarefas orientada por ferramentas, com contexto de entrada de 512K e limite de saída de 65.536 tokens. Aceita texto e imagens via URL na entrada e retorna texto, e oferece suporte a streaming, chamada de funções e orquestração de ferramentas em várias etapas, e cumprimento de instruções em tarefas longas. Acessível pelo endpoint de chat compatível com OpenAI, pelo endpoint Responses e pelo endpoint Messages compatível com Anthropic. No endpoint de chat, o modo de raciocínio (Thinking) é ativado ao definir chat_template_kwargs.enable_thinking como true; em uma medição de 2026-09-21, requisições sem o campo não retornaram nenhum token de raciocínio. Com o Thinking ativado, os tokens de raciocínio são contabilizados no max_tokens; por isso, dimensione-o para cobrir tanto o raciocínio quanto a resposta. | |||
| agnes-image-2.0-flash | Agnes AI | $0.000 | por requisição | Agnes AI Image 2.0 Flash — modelo rápido de geração e edição de imagens para texto para imagem, imagem para imagem e composição com várias imagens, com os resultados disponíveis como URL ou dados Base64. | |||
| agnes-image-2.1-flash | Agnes AI | $0.000 | por requisição | Agnes AI Image 2.1 Flash — modelo de geração e edição de imagens focado em detalhes para cenas de alta densidade de informação, cobrindo texto para imagem, imagem para imagem e composição com várias imagens, em tamanhos e proporções flexíveis de 1K a 4K. | |||
| agnes-image-2.5-flash | Agnes AI | $0.000 | por requisição | Agnes AI Image 2.5 Flash — o modelo de imagem da geração mais recente, à frente do Image 2.1 Flash em geração, edição, composição, renderização de detalhes e aderência ao prompt, para texto para imagem, imagem para imagem e composição com várias imagens, em tamanhos e proporções flexíveis de 1K a 4K. | |||
| agnes-video-2.5 | Agnes AI | $0.025 | por segundo | Agnes AI Video 2.5 — modelo de vídeo assíncrono e pago que gera clipes de 4 a 12 segundos em 720P, 960P ou 2K a partir de texto, de quadros-chave inicial/final ou de referências de imagem, áudio e vídeo. | |||
| agnes-video-2.5-flash | Agnes AI | $0.000 | por segundo | Agnes AI Video 2.5 Flash — a variante do Video 2.5 restrita a 720P, que gera vídeos de 4 a 12 segundos a partir de texto, de quadros-chave inicial/final ou de referências de imagem e áudio, com a mesma API assíncrona de tarefas. | |||
| claude-fable-5 | Anthropic | $10.0000 | $50.0000 | $7.0000 | $35.0000 | por 1M tokens | Anthropic Claude Fable 5 — o modelo mais capaz da Anthropic entre os de disponibilidade geral, para trabalho do conhecimento e programação ambiciosos e de longa duração. Ele foi construído para tarefas agênticas de vários dias, engenharia de software complexa, pesquisa aprofundada, raciocínio sobre documentos e imagens, e autoverificação proativa. |
| claude-fable-5-1 | Anthropic | $10.0000 | $50.0000 | $8.0000 | $40.0000 | por 1M tokens | Anthropic Claude Fable 5.1 — o carro-chefe mais recente da Anthropic entre os de disponibilidade geral, para trabalho do conhecimento e programação ambiciosos e de longa duração. Ele foi construído para tarefas agênticas de vários dias, engenharia de software complexa, pesquisa aprofundada, raciocínio sobre documentos e imagens, e autoverificação proativa. As leituras de cache custam 2,5% do preço de entrada — o menor valor de sua geração. |
| claude-haiku-4-5 | Anthropic | $1.0000 | $5.0000 | $0.7000 | $3.5000 | por 1M tokens | Anthropic Claude Haiku 4.5 — o modelo Claude mais rápido, com inteligência próxima da fronteira, construído para trabalho de alto volume e sensível à latência, como classificação, extração e roteamento. Ele aceita entrada de texto e imagem, thinking estendido, janela de contexto de 200.000 tokens e até 64.000 tokens de saída. |
| claude-haiku-5-5 | Anthropic | $0.1000 | $0.5000 | $0.0600 | $0.3000 | por 1M tokens | Anthropic Claude Haiku 5.5 — compreensão rápida e econômica de texto e imagens para classificação, extração, roteamento e agentes. Contexto de 1.000.000 tokens e saída máxima de 128.000 tokens. O raciocínio adaptativo usa medium por padrão; output_config.effort em Messages permite escolher low, medium, high, xhigh ou max. Suporta streaming e chamadas obrigatórias de ferramentas. Acima de 100.000 tokens de entrada, a tarifa de contexto longo vale para toda a solicitação, incluindo saída e cache. |
| claude-opus-4-5 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | por 1M tokens | Anthropic Claude Opus 4.5 — a versão Opus 4.5, que a Anthropic agora lista entre seus modelos legados e mantém disponível, para cargas de trabalho que desejam permanecer nesta versão do modelo. Ele aceita entrada de texto e imagem, thinking estendido, janela de contexto de 200.000 tokens e até 64.000 tokens de saída. |
| claude-opus-4-6 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | por 1M tokens | Anthropic Claude Opus 4.6 — a geração Opus para raciocínio complexo e trabalho agêntico, com janela de contexto de 1.000.000 tokens ao preço padrão e até 128.000 tokens de saída. Ele aceita entrada de texto e imagem e thinking adaptativo, e usa o tokenizador anterior ao 4.7. |
| claude-opus-4-7 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | por 1M tokens | Anthropic Claude Opus 4.7 — modelo de raciocínio avançado para engenharia de software difícil e tarefas agênticas complexas de longa execução. Ele enfatiza o cumprimento rigoroso de instruções, a autoverificação, o uso confiável de ferramentas e a visão em alta resolução em interfaces, imagens, documentos e fluxos profissionais. |
| claude-opus-4-8 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | por 1M tokens | Anthropic Claude Opus 4.8 — modelo de raciocínio de alta capacidade para programação, fluxos de trabalho agênticos, análise profissional e trabalho de longa execução. Em relação ao Opus 4.7, ele melhora confiabilidade, discernimento, eficiência no uso de ferramentas, uso do computador e raciocínio multimodal sobre documentos, com suporte a uma janela de contexto de 1.000.000 tokens. |
| claude-opus-5 | Anthropic | $5.0000 | $25.0000 | $3.0000 | $15.0000 | por 1M tokens | Anthropic Claude Opus 5 — modelo de raciocínio profundo para programação agêntica complexa e trabalho corporativo, com ganhos expressivos em tarefas de longa duração, revisão de código, fluxos documentais, visão e coordenação entre múltiplos agentes. Tem janela de contexto de 1.000.000 tokens, aceita até 128.000 tokens de saída e ativa o thinking adaptativo por padrão. |
| claude-opus-5-5 | Anthropic | $4.0000 | $20.0000 | $2.4000 | $12.0000 | por 1M tokens | Anthropic Claude Opus 5.5 — projetado para programação agêntica e trabalho de conhecimento de longa duração, com preço menor que o do Claude Opus 5. Aceita entrada de texto e imagem, tem janela de contexto de 1.000.000 tokens e suporta até 128.000 tokens de saída. O thinking adaptativo fica sempre ativo; o parâmetro effort controla a profundidade do raciocínio, com medium como padrão. |
| claude-sonnet-4-5 | Anthropic | $3.0000 | $15.0000 | $2.1000 | $10.5000 | por 1M tokens | Anthropic Claude Sonnet 4.5 — a versão Sonnet 4.5, que a Anthropic agora lista entre seus modelos legados e mantém disponível, para cargas de trabalho que desejam permanecer nesta versão do modelo. Ele aceita entrada de texto e imagem, thinking estendido, janela de contexto de 200.000 tokens e até 64.000 tokens de saída. |
| claude-sonnet-4-6 | Anthropic | $3.0000 | $15.0000 | $2.1000 | $10.5000 | por 1M tokens | Anthropic Claude Sonnet 4.6 — a geração Sonnet equilibrada, que oferece janela de contexto de 1.000.000 tokens ao preço padrão com até 128.000 tokens de saída. Ele aceita entrada de texto e imagem e thinking adaptativo, e usa o tokenizador anterior ao 4.7, de modo que o mesmo texto rende cerca de 30% menos tokens do que nos modelos 4.7 e posteriores, ao mesmo preço por token. |
| claude-sonnet-5 | Anthropic | $2.0000 | $10.0000 | $1.4000 | $7.0000 | por 1M tokens | Anthropic Claude Sonnet 5 — modelo de produção que equilibra inteligência de fronteira e velocidade para programação, agentes e fluxos de trabalho corporativos. Ele planeja, usa ferramentas de navegador e terminal e trabalha de forma autônoma em tarefas de raciocínio, trabalho do conhecimento e engenharia de software. |
| claude-sonnet-5-5 | Anthropic | $2.0000 | $10.0000 | $1.2000 | $6.0000 | por 1M tokens | Anthropic Claude Sonnet 5.5 — equilibra velocidade e inteligência para programação, agentes e cargas de trabalho em produção. Aceita entrada de texto e imagem, tem janela de contexto de 1.000.000 tokens e suporta até 128.000 tokens de saída. O thinking adaptativo fica ativo por padrão e os tokens de thinking são cobrados como saída; output_config.effort permite escolher low, medium, high, xhigh ou max, com high como padrão. Para desativar o thinking antecipado, envie thinking com type between_tools, que funciona com effort high ou inferior; type disabled é recusado. Definir temperature, top_p ou top_k com um valor diferente do padrão retorna erro, assim como forçar uma chamada de ferramenta com tool_choice any ou tool. Os blocos de thinking ficam vinculados ao modelo e à conversa; devolva-os sem alterações nos turnos seguintes. |
| cogview-4 | Zhipu AI | $0.010 | $0.0095 | por requisição | Zhipu CogView-4 — o modelo de texto para imagem CogView de quarta geração, com suporte a várias resoluções de saída e a dois níveis de serviço, um básico e um de alta definição. Aceita prompts em chinês e em inglês e renderiza texto dentro da imagem. Uma imagem por requisição. | ||
| deepseek-flash | DeepSeek | $0.1500 | $0.6000 | por 1M tokens | DeepSeek V4.1 Flash — o identificador de modelo canônico para novas integrações. Oferece suporte a entrada de texto e imagem, modos com e sem raciocínio, chamada de ferramentas e saída em JSON. Os identificadores descontinuados deepseek-v4-flash e deepseek-v4-flash-vision-exp continuam como aliases de compatibilidade, atendidos por este mesmo modelo ao mesmo preço do Flash. Janela de contexto de 1M tokens, saída máxima de 384K. Em /v1/responses, envie a conversa inteira no array input a cada turno: nenhum estado de conversa é mantido no upstream, portanto requisições que incluam previous_response_id ou conversation são recusadas. | ||
| deepseek-v4-pro | DeepSeek | $0.6600 | $1.9800 | por 1M tokens | DeepSeek V4 Pro 0813 — o nível de maior capacidade do DeepSeek V4 para programação, raciocínio e trabalho agêntico, com janela de contexto de 1M tokens e saída máxima de 384K. Funciona tanto no modo de raciocínio (padrão) quanto sem raciocínio, e oferece suporte a chamada de ferramentas e saída em JSON. Texto na entrada, texto na saída. Em /v1/responses, envie a conversa inteira no array input a cada turno: nenhum estado de conversa é mantido no upstream, portanto requisições que incluam previous_response_id ou conversation são recusadas. | ||
| doubao-seed-2-1-pro-260628 | ByteDance | $0.8889 | $4.4444 | por 1M tokens | ByteDance Doubao Seed 2.1 Pro — modelo de agente carro-chefe da Doubao para trabalho em produção, cobrindo raciocínio profundo, geração de texto, compreensão multimodal, chamada de ferramentas e saída estruturada, para a qual o fornecedor recomenda o modo json_schema. Janela de contexto de 256K com entrada máxima de 256K, até 256K tokens de saída (4K por padrão) e um orçamento de 256K para a cadeia de raciocínio. Aceita texto, imagem e vídeo e retorna texto; a compreensão de áudio não é listada para a linha 2.1. Oferece suporte a cache de contexto implícito e explícito, incluindo caches de prefixo e de sessão. | ||
| doubao-seed-2-1-turbo-260628 | ByteDance | $0.4444 | $2.2222 | por 1M tokens | ByteDance Doubao Seed 2.1 Turbo — a via de baixa latência da linha Seed 2.1, que compartilha os limites do Pro: janela de contexto de 256K com entrada máxima de 256K, até 256K tokens de saída (4K por padrão) e um orçamento de 256K para a cadeia de raciocínio. Cobre raciocínio profundo, geração de texto, compreensão multimodal, chamada de ferramentas e saída estruturada, ainda que sem a recomendação de json_schema do Pro. Aceita texto, imagem e vídeo e retorna texto; a compreensão de áudio não é listada para a linha 2.1. Oferece suporte a cache de contexto implícito e explícito. | ||
| doubao-seed-character-260628 | ByteDance | $0.1185 | $0.2963 | por 1M tokens | ByteDance Doubao Seed Character (260628) — o modelo de diálogo de personagens da Doubao para conversas de vários turnos guiadas por persona, a linha sucessora do doubao-1-5-pro-32k-character. Esta versão traz os rótulos de recursos do fornecedor para raciocínio profundo, geração de texto, compreensão multimodal, chamada de ferramentas e saída estruturada (json_schema recomendado). Janela de contexto de 128K com entrada máxima de 96K e até 32K tokens de saída (4K por padrão). O preço depende do tamanho da entrada: requisições de até 32K tokens de entrada são cobradas no nível padrão; requisições mais longas são cobradas no nível de contexto longo, em que a entrada custa 1,5 vez e a saída três vezes a tarifa do nível padrão. | ||
| doubao-seed-evolving | ByteDance | $0.8889 | $4.4444 | por 1M tokens | ByteDance Doubao Seed Evolving — o atual carro-chefe da Doubao para programação e agentes, publicado como versão contínua (rolling release): o fornecedor atualiza o modelo semanalmente sob este mesmo ID, sem instantâneo datado, de modo que o comportamento e os recursos podem mudar sem troca do número de versão. Traz os rótulos de recursos do fornecedor para raciocínio profundo, geração de texto, compreensão multimodal, execução de tarefas em interface gráfica (GUI), chamada de ferramentas e saída estruturada (json_schema recomendado). Janela de contexto de 1.024K com entrada máxima de 1.024K e até 256K tokens de saída (4K por padrão). | ||
| doubao-seedance-2-0-260128 | ByteDance | $7.0000 | por 1M tokens | ByteDance Seedance 2.0 — o carro-chefe da linha Seedance 2.0 e seu único integrante que chega a 1080p e 4K (profundidade de 10 bits) além de 480p e 720p, a 24 fps e de 4 a 15 segundos. Cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16, com o quadro final disponível como imagem. Cobrado pela resolução de saída. | |||
| doubao-seedance-2-0-fast-260128 | ByteDance | $5.6000 | por 1M tokens | ByteDance Seedance 2.0 Fast — geração de vídeo econômica que traz o conjunto completo de recursos do Seedance 2.0, mas limitada a 480p e 720p, 24 fps, 4 a 15 segundos. Cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. 480p 5 s ≈ $0,26. | |||
| doubao-seedance-2-0-mini-260615 | ByteDance | $3.5000 | por 1M tokens | ByteDance Seedance 2.0 Mini — o nível leve e de baixo custo da linha Seedance 2.0, limitado a 480p e 720p, 24 fps, 4 a 15 segundos. Traz o mesmo conjunto de recursos documentado do restante da linha: texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. | |||
| doubao-seedance-2-5-260628 | ByteDance | $10.7000 | por 1M tokens | ByteDance Seedance 2.5 — o modelo principal da linha Seedance, que estende uma única geração para 4 a 30 segundos a 24 fps, mantendo a resolução limitada a 480p e 720p. A geração multimodal por referência chega a 1-30 imagens, até 10 vídeos de referência e até 10 trechos de áudio de referência (30 segundos no total para cada categoria) e, ao contrário da linha 2.0, uma referência de áudio pode ser usada sozinha. Ele também cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. | |||
| doubao-seedream-4-5-251128 | ByteDance | $0.03704 | por requisição | ByteDance Doubao Seedream 4.5 — texto para imagem e imagem para imagem com fusão de várias imagens, produzindo uma imagem única ou um conjunto de imagens relacionadas. O modo de imagem única aceita apenas um prompt, uma imagem de referência, ou de 2 a 14 imagens de referência; o modo em conjunto (sequential_image_generation=auto) retorna até 15 imagens a partir de texto, até 14 a partir de uma única imagem de referência, ou um conjunto a partir de 2 a 14 referências desde que a soma de entradas e saídas não passe de 15. Oferece suporte a saídas em 2K e 4K e retorna JPEG por padrão, como URL ou base64. A edição interativa por coordenadas está disponível apenas no Seedream 5.0 Pro (doubao-seedream-5-0-pro-260628). | |||
| doubao-seedream-5-0-260128 | ByteDance | $0.03259 | por requisição | ByteDance Doubao Seedream 5.0-lite — texto para imagem e imagem para imagem, com criação controlável mais inteligente, recuperação em tempo real e maior consistência de sujeito (resolução de 2K ou mais). | |||
| doubao-seedream-5-0-pro-260628 | ByteDance | $0.045 | por requisição | ByteDance Doubao Seedream 5.0 Pro — o modelo de imagem topo de linha do fornecedor para criação controlável: texto para imagem, imagem para imagem com uma ou várias referências (2 a 10 imagens de referência), edição interativa por coordenadas, caixas ou setas, e decomposição em camadas, que separa uma imagem em uma base mais até 16 camadas, cada uma retornada com tamanho, z_index e caixa delimitadora próprios (defina layer_decomposition=true). Somente saída de imagem única: sem geração em conjunto (sequencial), busca na web nem streaming. Cobrado por imagem gerada conforme o cenário e a faixa de pixels: imagem única de até 2,61 MP tem o preço base; acima de 2,61 MP custa 2x; na decomposição em camadas, cada camada retornada é cobrada separadamente a 0,5x (ou 1x acima de 2,61 MP); cada imagem de referência além da primeira acrescenta 1/15 do preço base. | |||
| fun-asr-flash-2026-06-15 | Alibaba | $0.1260 | por hora de áudio | Alibaba Fun-ASR Flash (2026-06-15) — reconhecimento de fala gravada de baixa latência, com contexto de prompt e detecção automática de idioma entre dialetos chineses e mais de 30 idiomas. Aceita áudio por URL, em Base64 ou como arquivo enviado em AAC/AMR/AVI/FLAC/FLV/M4A/MKV/MOV/MP3/MP4/MPEG/OGG/OPUS/WAV/WEBM/WMA/WMV, com até 5 minutos e 2 GB. | |||
| gemini-2.5-flash-image | $0.3000 | $2.5000 | $0.2100 | $1.7500 | por 1M tokens | Google Gemini 2.5 Flash Image (Nano Banana) — modelo rápido de geração e edição nativa de imagens para fluxos de trabalho criativos. Ele aceita entrada de texto e imagem e retorna imagens pelo endpoint chat completions compatível com OpenAI, com limite de entrada de 65.536 tokens e limite de saída de 32.768 tokens. | |
| gemini-2.5-pro | $1.2500 | $10.0000 | $0.8125 | $6.5000 | por 1M tokens | Google Gemini 2.5 Pro — o modelo do nível de raciocínio da família 2.5, com janela de contexto de 1M tokens. Prompts acima de 200.000 tokens são recalculados pela tarifa de contexto longo do fornecedor para a requisição inteira, seguindo a regra do próprio Google. | |
| gemini-3-pro-image | $2.0000 | $12.0000 | $1.4000 | $8.4000 | por 1M tokens | Google Gemini 3 Pro Image (Nano Banana Pro) — modelo premium orientado por raciocínio para geração profissional de imagens e edição por conversa. Destaca-se em design gráfico complexo, mockups de produto de alta fidelidade, renderização precisa de texto multilíngue, consistência de marca e visualizações factuais embasadas pelo Google Search. Aceita texto e imagens, retorna texto e imagens, oferece suporte a thinking e gera saídas em 1K, 2K ou 4K. | |
| gemini-3.1-flash-image | $0.5000 | $3.0000 | $0.3500 | $2.1000 | por 1M tokens | Google Gemini 3.1 Flash Image (Nano Banana 2) — modelo estável de baixa latência para geração de imagens de alta qualidade e edição por conversa. Ele aceita texto, imagens e PDFs, oferece suporte a thinking e embasamento por busca, e gera imagens em 0,5K, 1K, 2K ou 4K para fluxos de produção de alto volume. | |
| gemini-3.1-flash-lite-image | $0.2500 | $1.5000 | $0.1750 | $1.0500 | por 1M tokens | Google Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — modelo de latência ultrabaixa e bom custo-benefício para geração de imagens em alto volume e edições rápidas em vários turnos. Ele aceita texto e imagens, produz imagens em 1K, oferece suporte a thinking e edição por conversa, e foi projetado para aplicações interativas de desenvolvedores e do consumidor final. | |
| gemini-3.5-flash | $1.5000 | $9.0000 | $1.0500 | $6.3000 | por 1M tokens | Google Gemini 3.5 Flash — modelo multimodal estável otimizado para desempenho sustentado de agentes, ciclos rápidos de programação, uso de subagentes e fluxos de trabalho de várias etapas e longa execução. Ele aceita texto, imagens, vídeo, áudio e PDFs, oferece suporte a thinking e ferramentas integradas, e fornece contexto de entrada de 1.048.576 tokens com até 65.536 tokens de saída. | |
| gemini-3.6-flash | $0.7500 | $3.7500 | $0.5250 | $2.6250 | por 1M tokens | Google Gemini 3.6 Flash — modelo de raciocínio multimodal em versão estável que equilibra velocidade e inteligência para tarefas agênticas e do mundo real, com contexto de entrada de 1.048.576 tokens e limite de saída de 65.536 tokens. Ele aceita texto, imagens, vídeo, áudio e PDFs, e oferece suporte a thinking, chamada de funções, execução de código, embasamento por busca, saída estruturada e Computer Use (prévia). Observação sobre preços: o preço de tabela do Google para este modelo é promocional até 31 de dezembro de 2026 — $0,75 na entrada / $3,75 na saída / $0,075 na entrada em cache por 1M tokens. A partir de 1º de janeiro de 2027, o preço de tabela do fornecedor volta a $1,50 / $7,50 / $0,15, e o nosso preço o acompanha na mesma paridade. | |
| gemini-3.7-flash | $0.7500 | $3.7500 | $0.5250 | $2.6250 | por 1M tokens | Google Gemini 3.7 Flash — o mais novo modelo de raciocínio multimodal do nível Flash, com preço idêntico ao do 3.6 Flash enquanto durar a promoção do fornecedor. Aceita texto, imagens, vídeo, áudio e PDFs; oferece suporte a thinking, chamada de funções, execução de código, embasamento por busca e saída estruturada. Observação sobre preços: o preço de tabela do Google para este modelo é promocional até 31 de dezembro de 2026 — $0,75 na entrada / $3,75 na saída / $0,075 na entrada em cache por 1M tokens. A partir de 1º de janeiro de 2027, o preço de tabela do fornecedor volta a $1,50 / $7,50 / $0,15, e o nosso preço o acompanha na mesma paridade. | |
| gemini-3.8-flash | $0.7500 | $3.7500 | $0.4875 | $2.4375 | por 1M tokens | Google Gemini 3.8 Flash — o modelo Gemini multimodal e rápido do Google, que pode ser chamado aqui tanto pelo endpoint compatível com OpenAI quanto pelo endpoint nativo do Gemini. Preço padrão por token: $0,75 na entrada, $0,075 na entrada em cache e $3,75 na saída por 1M tokens. | |
| glm-5 | Zhipu AI | $1.0000 | $3.2000 | $0.9500 | $3.0400 | por 1M tokens | Zhipu GLM-5 — MoE de 744B parâmetros com 40B ativos, treinado em 28,5T tokens e usando DeepSeek Sparse Attention, com janela de contexto de 200K e até 128K tokens de saída. Texto na entrada, texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP. |
| glm-5-turbo | Zhipu AI | $1.2000 | $4.0000 | $1.1400 | $3.8000 | por 1M tokens | Zhipu GLM-5-Turbo — a variante do GLM-5 voltada a throughput, otimizada para fluxos de trabalho de agentes: invocação de ferramentas e habilidades mais estável ao longo de tarefas de várias etapas, melhor tratamento de instruções longas e encadeadas, e execução de tarefas agendadas ou de longa duração. Janela de contexto de 200K, até 128K tokens de saída, texto na entrada e texto na saída. Oferece suporte a modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP. |
| glm-5.1 | Zhipu AI | $1.4000 | $4.4000 | $1.1200 | $3.5200 | por 1M tokens | Zhipu GLM-5.1 — modelo de fundação carro-chefe construído para trabalho autônomo prolongado: o fornecedor documenta execução contínua e sem supervisão em uma única tarefa por até 8 horas, abrangendo planejamento, execução, testes e otimização iterativa. Janela de contexto de 200K, até 128K tokens de saída, texto na entrada e texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP. |
| glm-5.2 | Zhipu AI | $1.4000 | $4.4000 | $1.1200 | $3.5200 | por 1M tokens | Zhipu GLM-5.2 — modelo de fundação carro-chefe especializado em trabalho de agente de programação de longa duração, obtido por meses de treinamento dedicado e não apenas por uma extensão de contexto, com janela de contexto de 1M tokens e até 128K tokens de saída. Texto na entrada, texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP. |
| glm-5.3 | Zhipu AI | $1.4000 | $4.4000 | $0.9100 | $2.8600 | por 1M tokens | Zhipu GLM-5.3 — modelo carro-chefe de programação e agentes, pós-treinado sobre a mesma base do GLM-5.2: ganho de 50% no benchmark interno de programação da Zhipu, SOTA entre os modelos de código aberto no Terminal-Bench 3.0 e no Agents' Last Exam, e resultados de ponta em descoberta de vulnerabilidades no CyberGym, com janela de contexto de 1M tokens e até 128K tokens de saída. Texto na entrada, texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP. |
| glm-5.3-flash | Zhipu AI | $0.1500 | $0.5000 | $0.1350 | $0.4500 | por 1M tokens | Zhipu GLM-5.3-Flash — o primeiro modelo nativamente multimodal da linha GLM-5 e seu nível de fronteira de baixo custo: 320B de parâmetros totais com 18B ativos, sobre uma arquitetura híbrida de atenção linear + esparsa que reduz várias vezes o custo computacional da atenção e o cache KV em relação ao GLM-5.3, ao mesmo tempo em que corta pela metade tanto os parâmetros ativos quanto o número de camadas em relação ao GLM-4.5. Aceita texto, imagens e vídeo; retorna texto. (O fornecedor também anuncia entrada de arquivos, que não foi verificada aqui e por isso não é oferecida.) Janela de contexto de 1M tokens e até 128K tokens de saída. Oferece suporte a modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP. Posicionado para programação visual — trabalho de front-end, jogos e 3D em que o modelo inspeciona a própria saída renderizada e itera. |
| glm-5v-turbo | Zhipu AI | $1.2000 | $4.0000 | $1.1400 | $3.8000 | por 1M tokens | Zhipu GLM-5V-Turbo — modelo de raciocínio multimodal para imagens, vídeo, arquivos, programação e fluxos de trabalho de agentes orientados por ferramentas. |
| glm-image | Zhipu AI | $0.015 | $0.01425 | por requisição | Zhipu GLM-Image — geração de imagens baseada em uma arquitetura híbrida de compreensão autorregressiva mais decodificação por difusão, o primeiro modelo multimodal SOTA treinado de ponta a ponta em chips de fabricação chinesa (Huawei Ascend). Interpreta instruções em vez de palavras-chave e preenche os detalhes que o prompt deixa implícitos, com desempenho bem superior na renderização de texto (sobretudo de caracteres chineses) e em cenas intensivas em conhecimento. Uma imagem por requisição. | ||
| glm-tts | Zhipu AI | $0.3500 | $0.3150 | por 10 mil caracteres | Zhipu GLM-TTS — síntese de voz construída sobre uma arquitetura de geração em duas etapas com aprendizado por reforço GRPO, que infere emoção e entonação do texto ao redor em vez de exigir marcação explícita. Traz sete vozes integradas (tongtong por padrão, xiaochen, chuichui, jam, kazi, douji, luodo) com velocidade e volume ajustáveis, aceita até 1.024 caracteres por requisição e transmite com latência de primeiro quadro abaixo de 400 ms. Retorna wav ou pcm a uma taxa de amostragem recomendada de 24 kHz; o streaming é apenas em pcm. | ||
| gpt-5.5 | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | por 1M tokens | OpenAI GPT-5.5 — modelo de raciocínio de fronteira para programação complexa e trabalho profissional. Aceita entrada de texto e imagem, chamada de funções e ferramentas integradas, janela de contexto de 1.050.000 tokens, até 128.000 tokens de saída e nível de raciocínio de none até xhigh. |
| gpt-5.6-luna | OpenAI | $0.2000 | $1.2000 | $0.1700 | $1.0200 | por 1M tokens | OpenAI GPT-5.6 Luna — o nível mais rápido e acessível do GPT-5.6, otimizado para cargas de trabalho de alto volume e sensíveis a custo, sem abrir mão de raciocínio, visão e uso de ferramentas. Aceita entrada de texto e imagem, janela de contexto de 1.050.000 tokens e até 128.000 tokens de saída. |
| gpt-5.6-sol | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | por 1M tokens | OpenAI GPT-5.6 Sol — modelo carro-chefe da linha GPT-5.6 para raciocínio de fronteira, trabalho profissional complexo, programação, ciência, cibersegurança e fluxos de trabalho agênticos de longa duração. Aceita entrada de texto e imagem, ferramentas integradas, janela de contexto de 1.050.000 tokens, até 128.000 tokens de saída e os ajustes de raciocínio mais profundos da família. |
| gpt-5.6-terra | OpenAI | $2.0000 | $12.0000 | $1.6000 | $9.6000 | por 1M tokens | OpenAI GPT-5.6 Terra — modelo GPT-5.6 equilibrado para o trabalho profissional do dia a dia, com alta inteligência e bom desempenho como agente de programação a um custo menor que o Sol. Aceita entrada de texto e imagem, ferramentas integradas, janela de contexto de 1.050.000 tokens e até 128.000 tokens de saída. |
| gpt-6-astra | OpenAI | $10.0000 | $50.0000 | $7.0000 | $35.0000 | por 1M tokens | OpenAI GPT-6 Astra — o modelo mais capaz da OpenAI, construído para o trabalho de ponta a ponta mais difícil: raciocínio complexo, programação, uso do computador, pesquisa e criação de documentos. Aceita entrada de texto e imagem, janela de contexto de 1.050.000 tokens, até 128.000 tokens de saída e ajustes de nível de raciocínio até xhigh e max. |
| gpt-6-luna | OpenAI | $0.1000 | $0.5000 | $0.0650 | $0.3250 | por 1M tokens | OpenAI GPT-6 Luna — o modelo mais eficiente da OpenAI, construído para tarefas focadas e de alto volume. Aceita entrada de texto e imagem, janela de contexto de 1.050.000 tokens, até 128.000 tokens de saída e nível de raciocínio de none a max, com medium como padrão. Use /v1/responses para chamadas de ferramentas: em /v1/chat/completions, a chamada de funções só funciona com reasoning_effort definido como none. Em /v1/responses, envie a conversa inteira no array input a cada turno; requisições que incluam previous_response_id ou conversation são recusadas. |
| gpt-6-sol | OpenAI | $2.0000 | $10.0000 | $1.3000 | $6.5000 | por 1M tokens | OpenAI GPT-6 Sol — construído para programação complexa e fluxos de trabalho agênticos. Aceita entrada de texto e imagem, janela de contexto de 1.050.000 tokens, até 128.000 tokens de saída e nível de raciocínio de none a max, com medium como padrão. Use /v1/responses para chamadas de ferramentas: em /v1/chat/completions, a chamada de funções só funciona com reasoning_effort definido como none. Em /v1/responses, envie a conversa inteira no array input a cada turno; requisições que incluam previous_response_id ou conversation são recusadas. |
| gpt-6.1-sol | OpenAI | $2.0000 | $10.0000 | $1.3000 | $6.5000 | por 1M tokens | OpenAI GPT-6.1 Sol — próximo do GPT-6 Astra em programação complexa, uso do computador e trabalho profissional, a um custo menor. Aceita entrada de texto e imagem, janela de contexto de 1.050.000 tokens e até 128.000 tokens de saída. O nível de raciocínio vai de low a max, com medium como padrão; none e minimal não são suportados, e os tokens de raciocínio são cobrados como saída. Quando a entrada passa de 272.000 tokens, todos os tokens dessa requisição são cobrados pela tarifa de contexto longo. Use /v1/responses para chamadas de ferramentas; /v1/chat/completions não oferece suporte a chamadas de ferramentas. Em /v1/responses, envie a conversa inteira no array input a cada turno; requisições que incluam previous_response_id ou conversation são recusadas. |
| gpt-image-2 | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | por 1M tokens | OpenAI GPT Image 2 — modelo de ponta de geração e edição de imagens para resultados rápidos e de alta qualidade. Aceita entrada de texto e imagem, oferece suporte a tamanhos de imagem flexíveis e a entradas de imagem de alta fidelidade, e cobra por token, e não por chamada: $5 na entrada de texto, $1,25 na entrada de texto em cache, $8 na entrada de imagem e $30 na saída de imagem, por 1M tokens. |
| gpt-image-2.5-flare | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | por 1M tokens | OpenAI GPT Image 2.5 Flare — um modelo de geração e edição de imagens da linha GPT Image 2.5 da OpenAI. O Flare e o gpt-image-2.5-sunburst são builds distintas, não aliases de um mesmo modelo, e são vendidas pelo mesmo preço; os rankings públicos pontuam os dois separadamente. Preço padrão por token: $5 na entrada de texto, $1,25 na entrada em cache, $8 na entrada de imagem e $30 na saída de imagem, por 1M tokens. |
| gpt-image-2.5-sunburst | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | por 1M tokens | OpenAI GPT Image 2.5 Sunburst — um modelo de geração e edição de imagens da linha GPT Image 2.5 da OpenAI. O Sunburst e o gpt-image-2.5-flare são builds distintas, não aliases de um mesmo modelo, e são vendidas pelo mesmo preço; os rankings públicos pontuam os dois separadamente. Preço padrão por token: $5 na entrada de texto, $1,25 na entrada em cache, $8 na entrada de imagem e $30 na saída de imagem, por 1M tokens. |
| grok-4.7 | xAI | $2.0000 | $6.0000 | $0.8000 | $2.4000 | por 1M tokens | xAI Grok 4.7 — um modelo de fronteira construído para programação, tarefas agênticas e trabalho intelectual. Aceita entrada de texto e imagem e tem janela de contexto de 500.000 tokens. O raciocínio não pode ser desativado: reasoning_effort permite escolher low, medium, high ou xhigh, com high como padrão, e os tokens de raciocínio são cobrados como saída. Quando um prompt chega a 200.000 tokens, todos os tokens dessa requisição são cobrados pela tarifa de contexto longo. Só são aceitas ferramentas function; as ferramentas do lado do servidor da xAI, como busca na web, busca no X e execução de código, não estão disponíveis, e requisições que as incluam são recusadas. Em /v1/responses, envie a conversa inteira no array input a cada turno e devolva sem alterações os itens de raciocínio criptografados das respostas anteriores; requisições que incluam previous_response_id ou conversation são recusadas. |
| happyhorse-1.1-i2v | Alibaba | $0.140 | por segundo | Alibaba HappyHorse 1.1 (I2V) — imagem para vídeo com melhor textura, consistência de identidade entre clipes, fluidez de movimento e sincronia entre áudio e imagem. 720P/1080P. | |||
| happyhorse-1.1-r2v | Alibaba | $0.140 | por segundo | Alibaba HappyHorse 1.1 (R2V) — geração de vídeo a partir de referências, com até 9 imagens de referência, forte consistência de sujeito, cena e estilo, e controle de câmera. 720P/1080P. | |||
| happyhorse-1.1-t2v | Alibaba | $0.140 | por segundo | Alibaba HappyHorse 1.1 (T2V) — texto para vídeo com melhor compreensão semântica, controle de câmera e geração dinâmica. Vídeo 720P/1080P fluido, detalhado e fisicamente coerente. | |||
| hy-mt2-lite | Tencent | $0.0440 | $0.1770 | por 1M tokens | Tencent HY-MT2 Lite — nível de tradução multilíngue voltado a latência e custo, pelo protocolo OpenAI Chat Completions. Até 4K tokens de entrada e 4K tokens de saída; somente texto. | ||
| hy-mt2-plus | Tencent | $0.0740 | $0.2950 | por 1M tokens | Tencent HY-MT2 Plus — nível de tradução multilíngue com cumprimento de instruções, pelo protocolo OpenAI Chat Completions. Até 4K tokens de entrada e 4K tokens de saída; somente texto. | ||
| hy-mt2-pro | Tencent | $0.0740 | $0.2950 | por 1M tokens | Tencent HY-MT2 Pro — nível carro-chefe de tradução automática para tradução multilíngue de alta qualidade pelo protocolo OpenAI Chat Completions. Até 4K tokens de entrada e 4K tokens de saída; somente texto. | ||
| hy3 | Tencent | $0.1320 | $0.5280 | por 1M tokens | Tencent Hunyuan 3 (Hy3) — modelo MoE de 295B de parâmetros (21B ativos), contexto nativo de 256K e três modos de raciocínio (fast / low / deep). Forte em agentes de programação, compreensão de documentos longos, contexto em múltiplos turnos e fluxos de trabalho de agentes em várias etapas. Somente texto. | ||
| hy4-preview | Tencent | $0.8340 | $2.5010 | por 1M tokens | Tencent Hunyuan 4 preview (Hy4 preview) — janela de contexto de 1M tokens (entrada máxima de 960K, saída máxima de 64K) com raciocínio profundo (que a Tencent chama de preserved thinking), saída estruturada, chamada de funções e cache de prompts. Somente texto. SKU de prévia: a Tencent retira um modelo de prévia assim que sua versão de disponibilidade geral é lançada. | ||
| jev-1.13 | TypeSafe | $0.0462 | por 1M tokens | TypeSafe Jev 1.13 — um modelo de decisão System One, não um modelo de chat. Envie o estado da sua aplicação (state: uma string, um objeto JSON ou um array) com um conjunto de perguntas tipadas em POST /v1/systemone — choice (escolher uma das suas opções), score (posicionar nos seus níveis ordenados) ou noul (a probabilidade de uma afirmação de sim/não ser verdadeira) — e receba respostas tipadas com uma probabilidade para cada opção e um valor de confiança, normalmente em 70–500 ms. Todas as perguntas são avaliadas em paralelo sobre o mesmo estado, então várias podem compartilhar uma requisição. Os SDKs oficiais da TypeSafe para Python e JavaScript funcionam sem alterações com a URL base definida como https://api.chinaapi.ai. Cobrado por token de entrada; a saída é gratuita. Apenas entrada de texto, até 32K tokens por requisição; o inglês é o idioma principal, então teste outros idiomas antes de depender deles. | |||
| jev-latest | TypeSafe | $0.0462 | por 1M tokens | TypeSafe Jev (latest) — o alias que os SDKs da TypeSafe chamam quando nenhum modelo é informado. Atualmente atende jev-1.13, com o mesmo preço e o mesmo contrato System One em POST /v1/systemone: estado e perguntas tipadas choice, score e noul na entrada; respostas tipadas com probabilidades e um valor de confiança na saída. O campo model da resposta indica a versão que respondeu. Só movemos o alias para uma nova versão do Jev depois de verificar o preço, então fixe jev-1.13 se você ajustou limiares com ela. | |||
| kimi-k2.6 | Moonshot | $0.9500 | $4.0000 | $0.7600 | $3.2000 | por 1M tokens | Moonshot Kimi K2.6 — modelo de uso geral para diálogo, geração de código, compreensão visual e tarefas de agentes, com escrita de código de longa duração e execução autônoma mais fortes que na geração anterior. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens (png, jpeg, webp, gif) e vídeo (mp4, mov, webm e outros) como conteúdo base64 e retorna texto. O modo de raciocínio vem ligado por padrão e pode ser desativado; a temperatura é fixa em 1.0 com raciocínio e 0.6 sem ele. |
| kimi-k2.7-code | Moonshot | $0.9500 | $4.0000 | $0.7600 | $3.2000 | por 1M tokens | Moonshot Kimi K2.7 Code — o modelo dedicado a programação da Kimi, que o fornecedor mede como tendo melhorado o cumprimento de instruções e a programação de longa duração em relação ao K2.6, ao mesmo tempo em que reduziu o excesso de raciocínio em cerca de 30% em média. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens e vídeo como conteúdo base64 e retorna texto. O thinking é obrigatório e retorna erro se desativado; tool_choice fica limitado a auto ou none, e reasoning_content precisa ser repassado ao longo das chamadas de ferramentas em várias etapas. |
| kimi-k2.7-code-highspeed | Moonshot | $1.9000 | $8.0000 | por 1M tokens | Moonshot Kimi K2.7 Code Highspeed — o nível de throughput do K2.7 Code, que serve o mesmo modelo a cerca de 180 tokens por segundo e até 260 em trabalhos de contexto curto. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens e vídeo como conteúdo base64 e retorna texto. O thinking é obrigatório e retorna erro se desativado; tool_choice fica limitado a auto ou none, e reasoning_content precisa ser repassado ao longo das chamadas de ferramentas em várias etapas. | ||
| kimi-k3 | Moonshot | $3.0000 | $15.0000 | $1.9500 | $9.7500 | por 1M tokens | Moonshot Kimi K3 — carro-chefe de 2,8 trilhões de parâmetros para programação de longa duração, trabalho do conhecimento de ponta a ponta e raciocínio profundo, com janela de contexto de 1M tokens e até 1.048.576 tokens de conclusão (131.072 por padrão). Aceita texto, imagens codificadas em base64 e vídeo codificado em base64 e retorna texto. O thinking fica sempre ativo, com o esforço de raciocínio em max por padrão; a temperatura é fixa em 1.0. Oferece suporte a chamada de ferramentas personalizadas e ao carregamento dinâmico de ferramentas. |
| kling-3.0-turbo | Kuaishou | $0.560 | por requisição | Kuaishou Kling 3.0 Turbo — o nível de custo-benefício da linha Kling 3.0, que gera 720P ou 1080P (720P por padrão) de 3 a 15 segundos (5 por padrão) em 16:9, 9:16 ou 1:1, a partir de um prompt ou de uma imagem de primeiro quadro. O áudio nativo vem sempre incluído e não tem chave para ligar ou desligar. Em relação ao kling-v3, ele abre mão do nível 4K, do controle do quadro final e da entrada de vídeo em troca de velocidade e custo. 720p 5 s com áudio ≈ $0,56. | |||
| kling-v3 | Kuaishou | $0.420 | por requisição | Kuaishou Kling 3.0 — texto para vídeo e imagem para vídeo com áudio nativo e melhor consistência dos elementos. Os clipes duram de 3 a 15 segundos (5 por padrão) em 16:9, 9:16 ou 1:1, com o nível escolhido por mode: std para 720P, pro para 1080P e 4k para 4K nativo. O áudio é opcional e precisa ser ligado com sound=on, vindo desligado por padrão; imagem para vídeo usa um primeiro quadro com um quadro final opcional. A partir de $0,083/s (720p). | |||
| kling-v3-omni | Kuaishou | $0.420 | por requisição | Kling 3.0 Omni — geração de vídeo com várias imagens de referência. O preço exibido é o do nível std (720p, 5 s, sem áudio, sem vídeo de referência). Requisições que não definem mode usam o nível pro, padrão do fornecedor, e são cobradas 1,33x — cerca de $0,56 pelo mesmo clipe de 5 s; o 4k é cobrado 5x. Envie mode=std para ser cobrado pelo preço exibido. | |||
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | por 1M tokens | Meituan LongCat-2.0 — modelo MoE aberto de 1,6T de parâmetros com contexto nativo de 1M, feito para programação agêntica e uso de ferramentas de longa duração. Modelo de raciocínio somente texto. | ||
| M2-her | MiniMax | $0.3000 | $1.2000 | por 1M tokens | MiniMax M2-her — modelo conversacional feito para roleplay e chat de vários turnos, com janela de contexto de 65.536 tokens e respostas limitadas a 2.048 tokens (max_completion_tokens). Além de system / user / assistant, aceita no endpoint de chat compatível com OpenAI os papéis de mensagem estendidos do fornecedor: user_system (a persona do usuário), group (o nome da conversa) e sample_message_user / sample_message_ai (trocas de exemplo que orientam o estilo da resposta). Toda mensagem com papel estendido precisa ter um campo name; sem ele, o fornecedor rejeita a requisição inteira com o erro 2013, enquanto mensagens system/user/assistant comuns não precisam de name. Apenas texto: sem entrada de imagem, e o fornecedor não documenta chamada de ferramentas nem cache. Cada chamada inclui, além do prompt visível, cerca de 170 tokens de sobrecarga de persona do lado do fornecedor, cobrados como entrada. | ||
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | por 1M tokens | Xiaomi MiMo-V2.5 — modelo nativamente multimodal completo, com contexto de 1M e saída máxima de 128K, que entende imagens, vídeo, áudio e texto em um único modelo. Oferece suporte a raciocínio profundo, chamada de funções, saída estruturada e pesquisa na web, com capacidade de agente em todas as modalidades. | ||
| mimo-v2.5-asr | Xiaomi | $0.0740 | por hora de áudio | Xiaomi MiMo v2.5 ASR — modelo de reconhecimento de voz otimizado para chinês e inglês, além de dialetos chineses, lidando com áudio ruidoso, captado a distância e com vários locutores, bem como com a transcrição de letras de música. | |||
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | por 1M tokens | Xiaomi MiMo-V2.5-Pro — carro-chefe de um trilhão de parâmetros (42B ativos), contexto de 1M e saída máxima de 128K, ajustado para cargas de trabalho de agentes de alta intensidade. Oferece suporte a raciocínio profundo, chamada de funções, saída estruturada e pesquisa na web. Apenas geração de texto: ao contrário do mimo-v2.5, a lista de recursos do fornecedor não inclui a compreensão de todas as modalidades. | ||
| mimo-v2.5-tts | Xiaomi | $0.0000 | por 10 mil caracteres | Xiaomi MiMo v2.5 TTS — síntese de voz expressiva com oito vozes integradas, quatro em chinês e quatro em inglês (Mia, Chloe, Milo, Dean), cobrindo chinês e inglês além dos estilos dialetais do Nordeste, de Sichuan, de Henan e do cantonês. A entrega é dirigida de duas formas: instruções de estilo em linguagem natural e tags de áudio embutidas para emoções básicas e compostas, respiração, suspiros e ritmo, incluindo um modo de canto exclusivo deste modelo na linha MiMo TTS. Retorna wav mono ou pcm16 a 24 kHz e oferece suporte a streaming de baixa latência, que exige pcm16. Contexto de 8K e saída máxima de 8K. | |||
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | por 10 mil caracteres | Xiaomi MiMo v2.5 TTS VoiceClone — modelo de clonagem de voz: envie uma amostra de áudio de referência como data URL no campo voice (data:{mime};base64,...) e ele sintetiza a fala com essa voz, sem nenhuma etapa de treinamento, anotação ou ajuste fino. Aceita MP3 (audio/mpeg) ou WAV, com a string codificada em base64 limitada a 10 MB; a Xiaomi não publica uma duração mínima para o áudio de referência. As instruções de estilo em linguagem natural e as tags de áudio embutidas vêm do mimo-v2.5-tts, mas não há streaming — a requisição roda em modo de compatibilidade e só retorna depois que a síntese termina. | |||
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | por 10 mil caracteres | Xiaomi MiMo v2.5 TTS VoiceDesign — modelo de design de voz: descreva em linguagem natural a voz desejada no campo instructions e ele sintetiza a fala com essa voz projetada. | |||
| mimo-v2.6-flash | Xiaomi | $0.1400 | $0.2800 | $0.1260 | $0.2520 | por 1M tokens | Xiaomi MiMo-V2.6-Flash — modelo de raciocínio eficiente e de baixo custo com pesos abertos, nativamente multimodal completo: um único modelo entende imagens, vídeo, áudio e texto. Contexto de 1M e saída máxima de 128K, com raciocínio profundo, chamada de funções e saída estruturada. Voltado a cargas de trabalho profissionais cotidianas e de alto volume, em que custo e vazão importam. |
| mimo-v2.6-pro | Xiaomi | $0.4350 | $0.8700 | $0.3915 | $0.7830 | por 1M tokens | Xiaomi MiMo-V2.6-Pro — modelo de raciocínio carro-chefe da Xiaomi, com um trilhão de parâmetros e pesos abertos, nativamente multimodal completo: um único modelo entende imagens, vídeo, áudio e texto. Contexto de 1M e saída máxima de 128K, com raciocínio profundo, chamada de funções e saída estruturada. Feito para projetos complexos, tarefas de agentes de longo prazo, cibersegurança e pesquisa. |
| mimo-v2.6-pro-ultraspeed | Xiaomi | $4.3500 | $8.7000 | por 1M tokens | Xiaomi MiMo-V2.6-Pro UltraSpeed — MiMo-V2.6-Pro servido no modo ultrarrápido da Xiaomi, com saída até 20 vezes mais rápida que a do modelo padrão, para interação em tempo real e produção sensível à latência. Mesmos recursos do mimo-v2.6-pro: compreensão multimodal completa de imagens, vídeo, áudio e texto, contexto de 1M, saída máxima de 128K, raciocínio profundo, chamada de funções e saída estruturada. Custa dez vezes o preço do mimo-v2.6-pro; a Xiaomi aloca a capacidade desse modo separadamente, então picos intensos podem sofrer limitação de taxa. | ||
| MiniMax-H3 | MiniMax | $0.080 | por segundo | MiniMax H3 (Hailuo 3.0) — modelo de vídeo multimodal de uso geral, aberto e de nova geração, que produz áudio estéreo nativo em uma única passagem, em 768P ou 2K, com 4 a 15 segundos (apenas números inteiros), a 24 fps. Ele cobre texto para vídeo, imagem para vídeo a partir de um primeiro e/ou último quadro, e geração por referência a partir de imagens, vídeos ou áudio para personagem, movimento, câmera, estilo, voz ou ritmo de montagem; imagem para vídeo e geração por referência não podem ser combinadas na mesma requisição. Ele aceita vídeo H.264/H.265, imagens JPG, JPEG, PNG, WEBP, HEIC e HEIF, e áudio WAV ou MP3, com prompts de até 7.000 caracteres. $0,08/s em 768P e $0,13/s em 2K. | |||
| MiniMax-Hailuo-02 | MiniMax | $0.280 | por requisição | MiniMax Hailuo 02 — geração de vídeo econômica que cobre tanto texto para vídeo quanto imagem para vídeo a 24 fps, com 512p e 768p disponíveis em clipes de 6 ou 10 segundos e 1080p em 6 segundos. O nível 512p é a porta de entrada da linha Hailuo. | |||
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | por requisição | MiniMax Hailuo 2.3 — texto para vídeo e imagem para vídeo, que o fornecedor posiciona pela aderência às instruções, a 24 fps, com 768p disponível em clipes de 6 ou 10 segundos e 1080p em 6 segundos. 768p 6 s = $0,28. | |||
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | por requisição | MiniMax Hailuo 2.3 Fast — o nível de velocidade e custo do Hailuo 2.3, voltado a imagem para vídeo e ao realismo do movimento físico, a 24 fps, com 768p disponível em clipes de 6 ou 10 segundos e 1080p em 6 segundos. 768p 6 s = $0,19. | |||
| MiniMax-M2 | MiniMax | $0.3000 | $1.2000 | por 1M tokens | MiniMax M2 — a primeira geração que a MiniMax lançou para programação eficiente e fluxos de trabalho de agentes, com janela de contexto de 204.800 tokens. É o nível mais antigo que o fornecedor ainda serve e o único dos níveis legados sem variante highspeed. Apenas texto: a API aceita blocos de conteúdo de texto e de chamada de ferramenta, mas não imagens nem vídeo. Modelo designado como legado pelo fornecedor, que a MiniMax afirma continuar servindo normalmente; mantido no catálogo por compatibilidade de versão, já que os clientes fixam um nome de modelo a uma geração. Os pesos abertos estão publicados no Hugging Face. | ||
| MiniMax-M2.1 | MiniMax | $0.3000 | $1.2000 | por 1M tokens | MiniMax M2.1 — modelo de texto feito para programação multilinguagem, com janela de contexto de 204.800 tokens e saída a cerca de 60 tokens por segundo. Apenas texto: a API aceita blocos de conteúdo de texto e de chamada de ferramenta, mas não imagens nem vídeo. Modelo designado como legado pelo fornecedor, que a MiniMax afirma continuar servindo normalmente; mantido no catálogo por compatibilidade de versão, já que os clientes fixam um nome de modelo a uma geração. Os pesos abertos estão publicados no Hugging Face. | ||
| MiniMax-M2.5 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | por 1M tokens | MiniMax M2.5 — modelo de texto que o fornecedor posiciona pelo desempenho de primeira linha a preço baixo em tarefas complexas, com janela de contexto de 204.800 tokens e saída a cerca de 60 tokens por segundo. Apenas texto: a API aceita blocos de conteúdo de texto e de chamada de ferramenta, mas não imagens nem vídeo. Modelo designado como legado pelo fornecedor, que a MiniMax afirma continuar servindo normalmente; mantido no catálogo por compatibilidade de versão, já que os clientes fixam um nome de modelo a uma geração. Os pesos abertos estão publicados no Hugging Face. |
| MiniMax-M2.7 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | por 1M tokens | MiniMax M2.7 — modelo de texto para chat, programação, trabalho de escritório e tarefas agênticas, com janela de contexto de 204.800 tokens e saída a cerca de 60 tokens por segundo. Apenas texto: a API aceita blocos de conteúdo de texto e de chamada de ferramenta, mas não imagens nem vídeo. Oferece suporte a chamada de ferramentas; o thinking fica sempre ativo e não pode ser desligado. |
| MiniMax-M2.7-highspeed | MiniMax | $0.6000 | $2.4000 | por 1M tokens | MiniMax M2.7 Highspeed — o mesmo modelo M2.7 servido a cerca de 100 tokens por segundo para programação de baixa latência e fluxos de trabalho de agentes, com janela de contexto de 204.800 tokens. Apenas texto: a API aceita blocos de conteúdo de texto e de chamada de ferramenta, mas não imagens nem vídeo. Oferece suporte a chamada de ferramentas; o thinking fica sempre ativo e não pode ser desligado. | ||
| MiniMax-M3 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | por 1M tokens | MiniMax M3 — modelo de programação multimodal de fronteira para raciocínio agêntico, uso de ferramentas e execução estruturada de tarefas, com janela de contexto de 1.000.000 tokens. Aceita texto, imagens de até 10 MB e vídeo de até 50 MB embutido ou 512 MB pela API de Files, e retorna texto. Oferece suporte a chamada de ferramentas, com o thinking opcional em vez de sempre ativo. |
| minimax-music-v3.0 | MiniMax | $0.1481 | por requisição | MiniMax Music 3.0 — geração síncrona de músicas completas a partir de um prompt musical e de uma letra opcional, com modo instrumental, otimização da letra e saída de áudio como URL ou em hex. Os prompts aceitam até 2.000 caracteres e a letra até 3.500 caracteres. | |||
| muse-spark-1.2-contributor | Meta | $0.1000 | $0.2000 | $0.0650 | $0.1300 | por 1M tokens | A Meta pode usar os prompts enviados a este modelo e as saídas que ele gera para treinar futuros modelos da Meta, conforme os termos do nível Contributor; não envie dados sensíveis ou confidenciais. Meta Muse Spark 1.2 (nível Contributor) é a versão anterior do Muse Spark. É um modelo de raciocínio: sempre raciocina antes de responder, e o raciocínio não pode ser desativado. reasoning_effort aceita minimal, low, medium, high ou xhigh; none e max não são compatíveis com este nível, e, quando reasoning_effort é omitido, o modelo escolhe o nível. Os tokens de raciocínio são cobrados como saída, e a entrada em cache é cobrada pela tarifa de entrada em cache. A busca na web não está disponível, e requisições que incluam busca na web ou qualquer tipo de ferramenta diferente de function são recusadas. Envie as requisições para /v1/chat/completions. |
| muse-spark-1.3-contributor | Meta | $0.1000 | $0.2000 | $0.0650 | $0.1300 | por 1M tokens | A Meta pode usar os prompts enviados a este modelo e as saídas que ele gera para treinar futuros modelos da Meta, conforme os termos do nível Contributor; não envie dados sensíveis ou confidenciais. Meta Muse Spark 1.3 (nível Contributor) é a versão mais recente do Muse Spark, ajustada para fluxos de trabalho agênticos e programação. É um modelo de raciocínio: sempre raciocina antes de responder, e o raciocínio não pode ser desativado. reasoning_effort aceita minimal, low, medium, high ou xhigh; none e max não são compatíveis com este nível, e, quando reasoning_effort é omitido, o modelo escolhe o nível. Os tokens de raciocínio são cobrados como saída, e a entrada em cache é cobrada pela tarifa de entrada em cache. A busca na web não está disponível, e requisições que incluam busca na web ou qualquer tipo de ferramenta diferente de function são recusadas. Envie as requisições para /v1/chat/completions. |
| qwen-audio-3.0-asr-flash | Alibaba | $0.1260 | por hora de áudio | Alibaba Qwen-Audio-3.0-ASR-Flash — reconhecimento de fala não em tempo real sobre a base Qwen-Audio 3.0, cobrindo 30 idiomas e os sete grandes grupos dialetais chineses (mandarim, wu, xiang, gan, hakka, min e yue), além de mais de 20 sotaques regionais. A previsão de pontuação e a normalização de texto colocam números, datas e valores em forma padrão; palavras-chave e o contexto do prompt elevam a precisão no vocabulário especializado. Aceita até 5 minutos ou 2 GB de áudio por solicitação. | |||
| qwen-audio-3.0-realtime-flash | Alibaba | $0.2900 | $0.8800 | por 1M tokens | Alibaba Qwen-Audio-3.0-Realtime-Flash — conversa de voz em full-duplex sobre uma sessão WebSocket, da linha que o fornecedor aponta como primeira na classificação geral de Speech-to-Speech da Artificial Analysis. Este nível rápido é ajustado para a menor latência de resposta de ponta a ponta. Conecta-se por GET /v1/realtime. A entrada e a saída de áudio são cobradas em tarifas próprias, bem acima da tarifa de texto. | ||
| qwen-audio-3.0-realtime-plus | Alibaba | $1.0000 | $8.0000 | por 1M tokens | Alibaba Qwen-Audio-3.0-Realtime-Plus — conversa de voz em full-duplex sobre uma sessão WebSocket; o fornecedor o aponta como primeiro na classificação geral de Speech-to-Speech da Artificial Analysis. O nível padrão prioriza a qualidade da resposta: mantém o raciocínio sobre fala intacto enquanto a inferência paralela e o streaming de ponta a ponta seguram a latência baixa. Conecta-se por GET /v1/realtime. A entrada e a saída de áudio são cobradas em tarifas próprias, bem acima da tarifa de texto. | ||
| qwen-audio-3.0-tts-flash | Alibaba | $0.1800 | por 10 mil caracteres | Alibaba Qwen-Audio-3.0-TTS-Flash — síntese de voz sobre a base Qwen-Audio 3.0, ajustada para interação em tempo real e cobrindo mais línguas minoritárias e dialetos chineses que a geração anterior. O seguimento de instruções em estilo livre e etiquetas de granularidade fina dirigem emoção, tom, personagem, velocidade e volume; o modelo é mais robusto a ruído e reverberação. O nível flash otimiza a síntese de baixa latência, para assistentes de voz, diálogo ao vivo e atendimento ao cliente. Cobrado por caractere (1 token = 1 caractere). Acessível tanto em requisição/resposta quanto em sessão WebSocket em tempo real. | |||
| qwen-audio-3.0-tts-plus | Alibaba | $0.2500 | por 10 mil caracteres | Alibaba Qwen-Audio-3.0-TTS-Plus — síntese de voz de alta qualidade sobre a base Qwen-Audio 3.0, cobrindo mais línguas minoritárias e dialetos chineses que a geração anterior, com pronúncia dialetal bem mais autêntica. O seguimento de instruções em estilo livre e etiquetas de granularidade fina dirigem emoção, tom, personagem, velocidade, volume e estilo; o modelo é mais robusto a ruído e reverberação. O nível plus prioriza fidelidade e expressividade, para produção de conteúdo, audiolivros, dublagem e voz de marca. Cobrado por caractere (1 token = 1 caractere). Acessível tanto em requisição/resposta quanto em sessão WebSocket em tempo real. | |||
| qwen-flash-character | Alibaba | $0.0500 | $0.4000 | por 1M tokens | Alibaba Qwen-Flash-Character — o modelo de roleplay multilíngue da Qwen (versão dinâmica; o fornecedor anuncia as atualizações com antecedência), ajustado para conversas com personagens fiéis à persona: cumprimento de instruções dentro dos limites da persona, avanço dos temas da conversa, escuta e empatia. Janela de contexto de 8.192 tokens, texto na entrada e texto na saída. Sem modo de raciocínio, chamada de ferramentas, ferramentas integradas ou saída estruturada. O cache de sessão do fornecedor é aplicado automaticamente do lado dele. | ||
| qwen-image-3.0 | Alibaba | $0.030 | por requisição | Alibaba Qwen-Image-3.0 — o nível padrão da linha de imagem da Qwen, que abrange geração de imagens a partir de texto e edição de imagens, com renderização precisa de tipos pequenos (até 10 px), 12 idiomas e mais de 20 famílias tipográficas. Aceita prompts de até 4.500 tokens, retorna até 6 imagens por solicitação e gera até 2048x2048. | |||
| qwen-image-3.0-pro | Alibaba | $0.040 | por requisição | Alibaba Qwen-Image-3.0-Pro — o nível profissional da linha de imagem da Qwen, criado para produzir em uma única geração layouts densos e cheios de informação (jornais, storyboards, cardápios, provas). Aceita prompts de até 4.500 tokens, renderiza tipos de 10 px, 12 idiomas e mais de 20 famílias tipográficas, retorna até 6 imagens por solicitação e gera até 2048x2048. Geração de imagens a partir de texto e edição de imagens. | |||
| qwen-mt-image-2.0 | Alibaba | $0.0006 | por requisição | Alibaba Qwen-MT-Image 2.0 — tradução de imagens: reescreve o texto dentro de uma imagem em outro idioma preservando o layout, as fontes e a arte ao redor, entre 55 idiomas em qualquer direção. Chame-o no endpoint images/edits da OpenAI com a URL http(s) pública de uma imagem no campo image, mais target_lang (obrigatório; código ISO ou nome em inglês) e source_lang (opcional, padrão auto); prompt é exigido pelo formato do endpoint, mas é ignorado. O objeto opcional ext repassa sem alterações os parâmetros domainHint, sensitives, terminologies e config.imageSegment do fornecedor. Retorna a URL de um JPG do mesmo tamanho, válida por 24 horas. Entrada de 15 a 8192 px por lado, proporção de 1:10 a 10:1, até 100 MB; arquivos enviados e data URLs não são aceitos. O fornecedor limita este modelo a 1 requisição por minuto e cobra a imagem mesmo quando não encontra texto traduzível (a original é retornada). Servido por um único canal oficial da Alibaba. | |||
| qwen3-asr-flash | Alibaba | $0.1260 | por hora de áudio | Alibaba Qwen3-ASR-Flash — reconhecimento de voz construído sobre o modelo de fundação Qwen3, que identifica sozinho o idioma falado e transcreve 11 idiomas; a linha Qwen3-ASR documenta o mandarim junto com o sichuanês, o min nan, o wu e o cantonês, além de vários sotaques do inglês. Aceita aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma e wmv com até 5 minutos e 10 MB por requisição; a entrada pcm precisa estar em 16 kHz e os demais formatos são reamostrados para 16 kHz antes do reconhecimento. | |||
| qwen3-tts-flash | Alibaba | $0.1100 | por 10 mil caracteres | Alibaba Qwen3-TTS-Flash — síntese de voz de baixa latência com 17 vozes integradas expressivas, cobrindo chinês, inglês, alemão, italiano, português, espanhol, japonês, coreano, francês e russo, além de um modo automático para textos que misturam idiomas e de saída em dialeto. Aceita até 512 tokens de texto por requisição e oferece suporte à síntese em streaming e fora dele. | |||
| qwen3.5-livetranslate-flash-realtime | Alibaba | $0.5500 | $20.0000 | por 1M tokens | Alibaba Qwen3.5-LiveTranslate-Flash-Realtime — interpretação simultânea de áudio e vídeo sobre uma sessão WebSocket, construída sobre a base Qwen3.5-Omni com alinhamento entre idiomas e modalidades e reforço visual. Escuta 60 idiomas e fala 29. Conecta-se por GET /v1/realtime. Sua estrutura de preços difere dos demais modelos em tempo real: **não existe tarifa de entrada de texto** — a entrada é cobrada como áudio ou imagem, e a saída como texto ou áudio. | ||
| qwen3.5-ocr | Alibaba | $0.1000 | $0.3500 | por 1M tokens | Alibaba Qwen3.5-OCR — o integrante de OCR da linha Qwen3.5, criado para análise de documentos, localização de texto e extração de informações-chave; o fornecedor aponta ganhos marcantes em documentos de identidade e habilitações do mundo real. Aceita texto e imagem na entrada e retorna texto. | ||
| qwen3.5-omni-flash | Alibaba | $0.4000 | $2.2000 | por 1M tokens | Alibaba Qwen3.5-Omni-Flash — o nível rápido da linha omnimodal Qwen3.5, que compreende e conversa por texto, imagem, áudio e vídeo com som. Processa mais de 10 horas de áudio e mais de 400 segundos de vídeo com som em 720P (1 FPS) por conversa, com entrada de áudio em mais de 60 idiomas e saída de voz em mais de 30. A entrada de áudio e a saída que contém áudio são cobradas em tarifas próprias, acima da tarifa de texto. | ||
| qwen3.5-omni-flash-realtime | Alibaba | $0.5500 | $3.3000 | por 1M tokens | Alibaba Qwen3.5-Omni-Flash-Realtime — o nível rápido em tempo real da linha omnimodal Qwen3.5, mantido aberto como uma sessão WebSocket para conversa de voz em full-duplex. Compreende texto, imagem, áudio e vídeo com som, aceita áudio em mais de 60 idiomas e fala em mais de 30, com voz dirigível, busca na web, chamada de funções complexas e interrupção semântica. Conecta-se por GET /v1/realtime. A entrada de áudio e a saída que contém áudio são cobradas em tarifas próprias, bem acima da tarifa de texto. | ||
| qwen3.5-omni-plus | Alibaba | $1.4000 | $8.3000 | por 1M tokens | Alibaba Qwen3.5-Omni-Plus — o nível de alto desempenho da linha omnimodal Qwen3.5, que compreende e conversa por texto, imagem, áudio e vídeo com som. Processa mais de 10 horas de áudio e mais de 400 segundos de vídeo com som em 720P (1 FPS) por conversa, com entrada de áudio em mais de 60 idiomas e saída de voz em mais de 30. Janela de contexto de 65.536 tokens. A entrada de áudio e a saída que contém áudio são cobradas em tarifas próprias, acima da tarifa de texto. | ||
| qwen3.5-omni-plus-realtime | Alibaba | $2.1000 | $12.4000 | por 1M tokens | Alibaba Qwen3.5-Omni-Plus-Realtime — o nível em tempo real da linha omnimodal Qwen3.5, mantido aberto como uma sessão WebSocket para conversa de voz em full-duplex. Compreende texto, imagem, áudio e vídeo com som, aceita áudio em mais de 60 idiomas e fala em mais de 30, com voz dirigível, busca na web, chamada de funções complexas e interrupção semântica. Conecta-se por GET /v1/realtime. A entrada de áudio e a saída que contém áudio são cobradas em tarifas próprias, bem acima da tarifa de texto. | ||
| qwen3.6-27b | Alibaba | $0.6000 | $3.6000 | por 1M tokens | Alibaba Qwen3.6-27B — o modelo denso de visão e linguagem nativo de 27 bilhões de parâmetros da linha Qwen3.6, de pesos abertos, que o fornecedor posiciona acima do 3.5-27B em programação agêntica, STEM e raciocínio, além de inteligência espacial, localização e detecção de objetos. Janela de contexto de 262.144 tokens. Aceita texto, imagem e vídeo na entrada e retorna texto. | ||
| qwen3.6-35b-a3b | Alibaba | $0.3750 | $2.2500 | por 1M tokens | Alibaba Qwen3.6-35B-A3B — um modelo MoE de visão e linguagem nativo de 35 bilhões de parâmetros com cerca de 3 bilhões ativos, de pesos abertos, que combina atenção linear com uma mistura esparsa de especialistas para ganhar eficiência de inferência. Janela de contexto de 262.144 tokens, até 65.536 tokens de saída e até 256 imagens ou 64 vídeos por solicitação. Aceita texto, imagem e vídeo na entrada e retorna texto. Oferece suporte a chamada de funções, ferramentas integradas e saídas estruturadas. | ||
| qwen3.6-flash | Alibaba | $0.2500 | $1.5000 | por 1M tokens | Alibaba Qwen3.6-Flash — modelo rápido de visão e linguagem que o fornecedor destaca para programação agêntica e para inteligência espacial, com ganhos marcantes em localização e detecção de objetos. Janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 65.536 tokens de saída e um orçamento de 131.072 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto. Oferece suporte a chamada de funções e cache de contexto. | ||
| qwen3.6-plus | Alibaba | $0.5000 | $3.0000 | $0.4250 | $2.5500 | por 1M tokens | Alibaba Qwen3.6-Plus — modelo equilibrado para raciocínio geral e uso de ferramentas, com janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 65.536 tokens de saída e um orçamento de 81.920 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto. Oferece suporte a chamada de funções, saídas estruturadas, pesquisa na web, complementação de prefixo e cache de contexto. |
| qwen3.7-flash | Alibaba | $0.0300 | $0.1300 | por 1M tokens | Alibaba Qwen3.7-Flash — o nível rápido da linha de visão e linguagem nativa Qwen3.7, que o fornecedor destaca para o trabalho de agentes multimodais (agentes de busca e de integração contínua) e para uma execução de tarefas de ponta a ponta mais estável que a 3.6-Flash. Janela de contexto de 1.000.000 tokens, até 65.536 tokens de saída e até 256 imagens ou 64 vídeos por solicitação. Aceita texto, imagem e vídeo na entrada e retorna texto. Oferece suporte a modo de raciocínio, chamada de funções, ferramentas integradas e saídas estruturadas. O preço tem três faixas de contexto: uma solicitação de contexto longo custa mais por token do que uma curta. | ||
| qwen3.7-max | Alibaba | $2.5000 | $7.5000 | por 1M tokens | Alibaba Qwen3.7-Max — carro-chefe de código fechado posicionado para programação, trabalho de escritório e produtividade, e execução autônoma de longo prazo, com janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 131.072 tokens de saída e um orçamento de 262.144 tokens para a cadeia de raciocínio. Texto na entrada, texto na saída. Oferece suporte a chamada de funções, saídas estruturadas e cache de contexto. | ||
| qwen3.7-plus | Alibaba | $0.4000 | $1.6000 | $0.3000 | $1.2000 | por 1M tokens | Alibaba Qwen3.7-Plus — modelo de agente híbrido multimodal que percebe cenas do mundo real, lê telas e opera interfaces gráficas, gera código a partir de referências visuais e faz navegação de ponta a ponta dentro de aplicativos móveis. Janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 131.072 tokens de saída e um orçamento de 262.144 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto; oferece suporte a chamada de funções, saídas estruturadas e cache de contexto. |
| qwen3.8-2.4t-a95b | Alibaba | $2.0000 | $6.0000 | por 1M tokens | Alibaba Qwen3.8-2.4T-A95B — a versão de pesos abertos do modelo principal Qwen3.8, um MoE esparso com 2,4 trilhões de parâmetros no total e cerca de 95 bilhões ativos por passo, com projeto de atenção híbrido. Janela de contexto de 1.000.000 tokens. Aceita texto na entrada e retorna texto. Os modos com e sem raciocínio são cobrados pela mesma tarifa e o preço de saída inclui a cadeia de raciocínio. | ||
| qwen3.8-27b | Alibaba | $0.5000 | $3.0000 | por 1M tokens | Alibaba Qwen3.8-27B — o modelo denso de visão e linguagem nativo de 27 bilhões de parâmetros da linha Qwen3.8, de pesos abertos, que o fornecedor posiciona acima do 3.6-27B em tarefas de programação e de escritório, tanto na modalidade de texto quanto na visual. Janela de contexto de 1.000.000 tokens. Aceita texto e imagem na entrada e retorna texto. Os modos com e sem raciocínio são cobrados pela mesma tarifa e o preço de saída inclui a cadeia de raciocínio. | ||
| qwen3.8-flash | Alibaba | $0.1500 | $0.4700 | $0.1125 | $0.3525 | por 1M tokens | Alibaba Qwen3.8-Flash — o nível rápido da linha Qwen3.8, um modelo nativamente multimodal que o fornecedor posiciona para assistência à programação, colaboração entre agentes e compreensão de imagens e documentos com alta vazão. Janela de contexto de 1.000.000 tokens. Aceita texto, imagem e vídeo na entrada e retorna texto. Oferece suporte a modo de raciocínio, chamada de funções, ferramentas integradas e saídas estruturadas. Fala tanto o protocolo OpenAI quanto o protocolo Anthropic Messages. |
| qwen3.8-max | Alibaba | $2.0000 | $6.0000 | $1.9000 | $5.7000 | por 1M tokens | Alibaba Qwen3.8-Max — modelo MoE carro-chefe de 2,4 trilhões de parâmetros e o mais capaz da família Qwen, com o fornecedor citando ganhos expressivos em programação e produtividade de escritório. Janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 131.072 tokens de saída e um orçamento de 262.144 tokens para a cadeia de raciocínio. Aceita entrada de texto, imagem e vídeo e retorna texto; oferece suporte a chamada de funções, saídas estruturadas e cache de contexto. |
| qwen3.8-max-0902 | Alibaba | $2.0000 | $6.0000 | por 1M tokens | Alibaba Qwen3.8-Max-0902 — o instantâneo de 2026-09-02 do Qwen3.8-Max (alias do fornecedor qwen3.8-max-2026-09-02), o carro-chefe MoE de 2,4 trilhões de parâmetros, congelado para que as integrações possam fixar exatamente esta build; o fornecedor destaca programação mais profunda para projetos de engenharia complexos e desenvolvimento autônomo de longa duração. Janela de contexto de 1.000.000 tokens, até 131.072 tokens de saída; aceita entrada de texto, imagem e vídeo e retorna texto; oferece suporte a modo de raciocínio, chamada de ferramentas e saída estruturada. O nome dinâmico qwen3.8-max passa para builds mais novas à medida que o fornecedor as lança — fixe este nome para permanecer nesta. Preço idêntico ao do qwen3.8-max. | ||
| speech-2.8-hd | MiniMax | $1.0000 | por 10 mil caracteres | MiniMax speech-2.8-hd — o nível de alta definição da linha de voz 2.8, posicionado para uma entrega ultrarrealista com tags de som, cobrindo 40 idiomas e 7 emoções. Tom, velocidade da fala, volume, taxa de amostragem, taxa de bits e formato de saída são configuráveis por requisição, e a síntese de textos longos aceita até 1 milhão de caracteres de forma assíncrona ou 10.000 caracteres pela interface de streaming. | |||
| speech-2.8-turbo | MiniMax | $0.6000 | por 10 mil caracteres | MiniMax speech-2.8-turbo — o nível de baixa latência da linha de voz 2.8, que troca a entrega ultrarrealista do modelo HD por uma síntese mais rápida e de fluxo natural. Cobre os mesmos 40 idiomas e 7 emoções, com tom, velocidade da fala, volume, taxa de amostragem, taxa de bits e formato de saída configuráveis, e aceita até 1 milhão de caracteres de forma assíncrona ou 10.000 caracteres pela interface de streaming. | |||
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | por 1M tokens | StepFun step-3.5-flash — modelo de raciocínio somente texto com contexto de 256K, voltado a lógica, matemática, engenharia de software e pesquisa aprofundada, onde a qualidade do raciocínio precisa vir acompanhada de execução rápida e confiável. A profundidade do raciocínio é escolhida por requisição via reasoning_effort (low / medium / high). Oferece suporte a chamada de ferramentas, saída estruturada por JSON Schema, streaming e cache de prompts. Para entrada de imagem ou vídeo, use o step-3.7-flash. | ||
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | por 1M tokens | StepFun step-3.5-flash-2603 — instantâneo de 256K do step-3.5-flash ajustado para agentes, otimizado para eficiência de tokens e um modo de operação com pouca inferência. Seu parâmetro reasoning_effort aceita apenas low e high, enquanto o modelo base aceita três níveis, portanto o código que envia medium precisa ser adaptado. Somente texto; oferece suporte a chamada de ferramentas, saída estruturada por JSON Schema, streaming e cache de prompts. | ||
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | por 1M tokens | StepFun step-3.7-flash — MoE esparso com 198B de parâmetros totais e 11B ativos, contexto nativo de 256K e compreensão nativa de imagens e vídeos além de texto. A profundidade do raciocínio é escolhida por requisição via reasoning_effort (low / medium / high), e o modelo oferece suporte a chamada de ferramentas em várias etapas de forma confiável, saída estruturada por JSON Schema, streaming e cache de prompts. Ajustado para cargas de trabalho de agentes e de programação. Em /v1/responses, envie a conversa inteira no array input a cada turno: nenhum estado de conversa é mantido no upstream, portanto requisições que incluam previous_response_id ou conversation são recusadas. | ||
| step-5-preview | StepFun | $1.0000 | $2.7000 | por 1M tokens | StepFun step-5-preview — novo modelo carro-chefe da StepFun para programação e trabalho intelectual especializado, lançado como prévia. Contexto de 1M de tokens com até 64K tokens de saída e compreensão nativa de imagens e vídeos além de texto. O raciocínio fica sempre ativo: ele volta como reasoning_content em /v1/chat/completions e como blocos thinking em /v1/messages, é cobrado como saída e consome max_tokens, de modo que um limite de algumas centenas de tokens pode ser gasto inteiramente no raciocínio e não retornar nenhum texto; deixe uma boa folga. A profundidade é escolhida por requisição via reasoning_effort (low / medium / high). Oferece suporte a chamada de ferramentas em várias etapas, saída estruturada por JSON Mode e JSON Schema, streaming e cache de prompts. Feito para análise de documentos longos, engenharia de software e trabalho de agentes em várias etapas. Em /v1/responses, envie a conversa inteira no array input a cada turno: nenhum estado de conversa é mantido no upstream, portanto requisições que incluam previous_response_id ou conversation são recusadas. | ||
| step-audio-2 | StepFun | $1.4815 | $10.3704 | por 1M tokens | StepFun step-audio-2 — modelo de voz ponta a ponta que consome o áudio diretamente, em vez de partir de uma transcrição, de modo que o tom e a entonação chegam íntegros à compreensão do modelo. Cobrado por token, com o preço de entrada da linha StepAudio 2.5 e um preço de saída mais alto. A StepFun não publica uma página de recursos separada para este modelo; consulte a documentação de áudio da plataforma para conhecer o conjunto de parâmetros vigente. | ||
| step-tts-2 | StepFun | $0.4148 | por 10 mil caracteres | StepFun step-tts-2 — síntese de voz ponta a ponta baseada em NTP, feita para reproduzir sotaques com precisão. Fala chinês, inglês, mistura de chinês e inglês e japonês, além de cantonês e sichuanês. A emoção e a entonação são dirigidas por rótulos em linguagem natural, e a clonagem de voz zero-shot exige cerca de 10 segundos de áudio de referência, com os controles de emoção e estilo se transferindo para a voz clonada sem custo adicional. Gera wav, mp3, flac, opus ou pcm. | |||
| stepaudio-2-asr-pro | StepFun | $0.2963 | por hora de áudio | StepFun StepAudio 2 ASR Pro — modelo de reconhecimento de voz com 32B de parâmetros, a opção que prioriza precisão na linha ASR da StepFun, enquanto o stepaudio-2.5-asr prioriza velocidade e custo. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada. | |||
| stepaudio-2.5-asr | StepFun | $0.0220 | por hora de áudio | StepFun StepAudio 2.5 ASR — modelo de reconhecimento de voz com 4B de parâmetros construído sobre Multi-Token Prediction, que transcreve cinco minutos de áudio em cerca de um segundo (RTF em torno de 0,0053). Otimizado para chinês e inglês. Inclui normalização inversa de texto, identificação de locutores e separação de dois canais para gravações de chamadas e reuniões. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada. | |||
| stepaudio-2.5-asr-stream | StepFun | $0.1800 | por hora de áudio | StepFun StepAudio 2.5 ASR Stream — a versão de reconhecimento em streaming do StepAudio 2.5 ASR (um reconhecedor com 4B de parâmetros construído sobre Multi-Token Prediction, otimizado para chinês e inglês) e o modelo de streaming que a StepFun recomenda. Neste gateway, ele é chamado da mesma forma que os demais modelos de transcrição: envie uma gravação completa para /v1/audio/transcriptions e a transcrição integral é retornada em uma única resposta quando o reconhecimento termina; os resultados parciais não são devolvidos em streaming, e ele custa mais por minuto de áudio do que o stepaudio-2.5-asr. A normalização inversa de texto é aplicada. Aceita apenas envios em wav PCM de 16 bits e ogg (mp3 não é aceito); a transcrição gerada não é cobrada. | |||
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | por 1M tokens | StepFun StepAudio 2.5 Chat — modelo de compreensão de fala ponta a ponta: recebe áudio ou texto e devolve texto, lendo sinais paralinguísticos como hesitação e riso na própria forma de onda, e não em uma transcrição. Oferece ampla personalização de personas, abrangendo caráter, hábitos de fala e amplitude emocional. O áudio é enviado como partes de conteúdo input_audio no endpoint chat completions. Para respostas faladas, use um modelo de TTS. | ||
| stepaudio-2.5-realtime | StepFun | $1.5000 | $10.0000 | por 1M tokens | StepFun StepAudio 2.5 Realtime — modelo de fala para fala de ponta a ponta, sobre uma sessão WebSocket em GET /v1/realtime: entrada de áudio ou texto em streaming e saída de áudio em streaming com transcrição em texto, com detecção de atividade de voz no servidor e interrupção. O áudio é PCM16, 24 kHz, mono; o fornecedor lista o inglês como idioma suportado. Defina a voz explicitamente em session.update: só são aceitas as vozes listadas pela StepFun. | ||
| stepaudio-2.5-tts | StepFun | $0.8500 | por 10 mil caracteres | StepFun StepAudio 2.5 TTS — síntese de voz contextual que leva a compreensão por todo o pipeline de geração, em vez de tratar a entonação como pós-processamento. Voz, emoção e ritmo são dirigidos em linguagem natural em dois níveis: um contexto global para a requisição e um contexto em linha para trechos específicos. A clonagem de voz zero-shot exige cerca de 3 segundos de áudio de referência e herda todo o conjunto de controles contextuais. Aceita até 1000 caracteres por requisição; gera wav, mp3, flac ou opus. | |||
| stepaudio-3-asr-max | StepFun | $0.4000 | por hora de áudio | StepFun StepAudio 3 ASR Max — o maior modelo de reconhecimento de voz da StepFun, construído sobre um grande modelo de linguagem, de modo que o reconhecimento se apoia no contexto e no conhecimento do domínio: tem desempenho superior com nomes próprios, nomes de medicamentos, termos técnicos e homófonos, com a mistura de chinês e inglês, dialetos e áudios longos, e com fala sussurrada, muito rápida ou com música de fundo, incluindo letras cantadas. Envie um arquivo de áudio para POST /v1/audio/transcriptions (WAV, MP3 ou OGG); cobrado pela duração do áudio. | |||
| stepaudio-3-chat-preview | StepFun | $0.0000 | por 1M tokens | StepFun StepAudio 3 Chat (prévia) — modelo de diálogo com compreensão de fala em POST /v1/chat/completions: envie, turno a turno, fala como partes de conteúdo input_audio, ou texto, e receba texto de volta, com chamada de ferramentas. Gratuito enquanto durar a prévia da StepFun. Quando o período gratuito termina, a StepFun descontinua o nome de prévia e lança uma versão paga; por isso, planeje-se considerando que este identificador de modelo deixará de funcionar nesse momento. | |||
| stepaudio-3-gen-preview | StepFun | $0.000 | por requisição | StepFun StepAudio 3 Audio Generation (prévia) — geração de áudio a partir de roteiro, da série StepAudio 3, em POST /v1/audio/generate: defina papéis com um nome e uma descrição de voz em linguagem comum, escreva o roteiro linha a linha (linhas entre colchetes viram efeitos sonoros ou música de fundo), adicione uma instrução geral, e o áudio pronto volta como bytes (mp3 por padrão). As vozes vêm das descrições dos papéis; nomes de voz predefinidos não são aceitos. Os campos da requisição seguem a referência de API da StepFun. Gratuito enquanto durar a prévia da StepFun. Quando o período gratuito termina, a StepFun descontinua o nome de prévia e lança uma versão paga; por isso, planeje-se considerando que este identificador de modelo deixará de funcionar nesse momento. | |||
| stepaudio-3-music-preview | StepFun | $0.000 | por requisição | StepFun StepAudio 3 Music (prévia) — geração de música a partir de texto, da série StepAudio 3, em POST /v1/music/generations, com o mesmo formato de requisição do minimax-music-v3.0: descreva o estilo em prompt, adicione a letra em lyrics ou defina is_instrumental, e a música pronta volta codificada em hex em data.audio (mp3 por padrão; wav, flac, opus ou pcm via audio_setting.format). A chamada é síncrona e uma música costuma levar de um a vários minutos, então configure no cliente um timeout de pelo menos 600 segundos. Covers e acompanhamento para um vocal enviado não são oferecidos. Gratuito enquanto durar a prévia da StepFun. Quando o período gratuito termina, a StepFun descontinua o nome de prévia e lança uma versão paga; por isso, planeje-se considerando que este identificador de modelo deixará de funcionar nesse momento. | |||
| stepaudio-3-realtime-preview | StepFun | $0.0000 | por 1M tokens | StepFun StepAudio 3 Realtime (prévia) — modelo de voz em full-duplex da StepFun sobre uma sessão WebSocket em GET /v1/realtime: interrupção e troca de turnos naturais, raciocínio adaptativo enquanto fala e chamadas de ferramentas durante a conversa. Gratuito enquanto durar a prévia da StepFun. Quando o período gratuito termina, a StepFun descontinua o nome de prévia e lança uma versão paga; por isso, planeje-se considerando que este identificador de modelo deixará de funcionar. | |||
| stepaudio-3-tts | StepFun | $0.3600 | por 10 mil caracteres | StepFun StepAudio 3 TTS — síntese de voz da série StepAudio 3, feita para uma locução de nível humano: timbre, entonação, ritmo e respiração acompanham a fala natural, incluindo riso, hesitação e autocorreção, e a emoção e o tom mudam conforme o conteúdo. Disponível em POST /v1/audio/speech e cobrada por caractere do texto de entrada. | |||
| vidu-video-q3 | Vidu | $0.060 | por segundo | Vidu Q3 — modelo de geração de vídeo a partir de referências, com sujeitos consistentes, troca de cena inteligente e saída de áudio/vídeo sincronizada. Aceita imagens de referência ou sujeitos nomeados; gera de 3 a 16 segundos em 540P, 720P ou 1080P. | |||
| vidu-video-q3-pro | Vidu | $0.100 | por segundo | Vidu Q3 Pro — texto para vídeo, imagem para vídeo e geração a partir de quadros inicial e final, voltados à qualidade, com saída de áudio/vídeo sincronizada. Gera de 1 a 16 segundos em 540P, 720P ou 1080P; este SKU não oferece suporte a geração de vídeo a partir de referências. | |||
| vidu-video-q3-turbo | Vidu | $0.055 | por segundo | Vidu Q3 Turbo — o nível Q3 rápido e econômico para geração de vídeo a partir de texto, imagem, quadros inicial e final ou referências, com saída de áudio/vídeo sincronizada. Gera de 1 a 16 segundos nos modos normais ou de 3 a 16 segundos no modo de referência, de 540P a 1080P. | |||
| wan2.7-i2v | Alibaba | $0.100 | por segundo | Alibaba Wan 2.7 Image-to-Video — cobre a geração a partir do primeiro quadro, as transições entre primeiro e último quadro e a continuação de um clipe existente. Produz 720P ou 1080P (1080P por padrão) de 2 a 15 segundos, 5 s por padrão, a partir de prompts de até 5.000 caracteres (prompts negativos de até 500 caracteres). Uma faixa mp3 ou wav de 2 a 30 segundos pode ser enviada como driving_audio; sem áudio, o modelo gera uma trilha de fundo ou efeitos sonoros condizentes, um áudio mais longo que o clipe é cortado e um áudio mais curto deixa o final em silêncio. | |||
| wan2.7-image | Alibaba | $0.030 | por requisição | Alibaba Wan2.7 Image — texto para imagem, edição de imagens, geração com várias imagens de referência, edição interativa, além de boa renderização de texto e aderência às instruções. | |||
| wan2.7-image-pro | Alibaba | $0.075 | por requisição | Alibaba Wan 2.7 Image Pro — o nível profissional da linha de imagem Wan 2.7, cobrindo texto para imagem, conjuntos sequenciais de imagens, edição de imagens e geração com várias imagens de referência, com melhor aderência ao prompt. O texto para imagem chega a 4K (4096x4096), com níveis de 1K e 2K e tamanhos personalizados a partir de 768x768; os modos de edição e sequencial ficam limitados a 2K. Aceita até 9 imagens de referência (JPEG, JPG, PNG, BMP, WEBP; 240 a 8.000 px por lado, 20 MB cada), proporções de 1:8 a 8:1 e prompts de até 5.000 caracteres. Retorna PNG. | |||
| wan2.7-r2v | Alibaba | $0.100 | por segundo | Alibaba Wan2.7 (R2V) — geração de vídeo a partir de referências, com até 5 referências mistas de imagem/vídeo mais uma referência de timbre de áudio, e maior consistência de personagens, objetos de cena e cenários. | |||
| wan2.7-t2v | Alibaba | $0.100 | por segundo | Alibaba Wan2.7 (T2V) — texto para vídeo com atuação aprimorada, emoções sutis, ação intensa e cortes de câmera dramáticos. Produz MP4 H.264 em 720P ou 1080P, de 2 a 15 segundos (5 s por padrão), em 16:9, 9:16, 1:1, 4:3 ou 3:4, a partir de prompts de até 5.000 caracteres. O áudio vem incluído por padrão: sem audio_url, o modelo compõe uma trilha de fundo ou efeitos sonoros condizentes, ou é possível enviar no lugar uma faixa wav ou mp3 de 2 a 30 segundos. | |||
| wan2.7-videoedit | Alibaba | $0.100 | por segundo | Alibaba Wan2.7 VideoEdit — edição de vídeo em linguagem natural, local ou global, substituição de elementos por imagem de referência e reprodução de movimento, efeitos e câmera. | |||
| wan3.0-video | Alibaba | $0.100 | $0.085 | por segundo | Alibaba Wan3.0 (Video) — modelo de vídeo tudo-em-um que unifica texto para vídeo, imagem para vídeo e referência para vídeo em um único endpoint. Gera MP4 H.264 em 480P, 720P ou 1080P, com até 30 segundos, a partir de um prompt e de uma URL opcional de imagem do primeiro quadro. Cobrado por segundo de vídeo gerado conforme a escala de preços do próprio fornecedor: 720P é a tarifa base, 480P é cobrado pela metade dela e 1080P pelo dobro. Uma requisição que não especifica a resolução é produzida em 1080P pelo modelo e cobrada nesse nível. As entradas de vídeo de referência e de áudio de referência existem no modelo do fornecedor, mas não são repassadas neste endpoint. | ||
| wan3.0-video-prime | Alibaba | $0.140 | por segundo | Alibaba Wan3.0 Video Prime — o nível rápido do modelo de vídeo tudo-em-um Wan 3.0, com os mesmos recursos do nível padrão e maior velocidade de geração. Texto para vídeo, imagem para vídeo por primeiro/último quadro e imagem de referência para vídeo (até 10 imagens de referência) em um único endpoint; MP4 H.264 em 480P, 720P ou 1080P, de 2 a 30 segundos, 30 fps, com áudio por padrão. Cobrado por segundo de vídeo gerado conforme a escala de preços do fornecedor: 720P é a tarifa base, 480P custa pouco menos da metade dela e 1080P, o dobro. Uma requisição que não especifica a resolução é renderizada no padrão do fornecedor, 1080P, e cobrada nesse nível. Entradas de vídeo de referência, áudio de referência, arquivo e link da web não são aceitas neste gateway, e a duração inteligente (-1) é rejeitada; defina a duração explicitamente. Servido por um único canal oficial da Alibaba. |