Preços dos modelos de IA chineses
A ChinaAPI oferece DeepSeek, Qwen, GLM, Kimi e outros modelos de IA chineses em um gateway compatível com OpenAI em https://api.chinaapi.ai/v1. Todos os preços são em dólar americano, na unidade que o fornecedor de origem utiliza. A mesma lista está disponível em JSON em /api/pricing.
| Modelo | Fornecedor | Entrada | Saída | Unidade | Descrição |
|---|---|---|---|---|---|
| deepseek-v4-flash-vision-exp | DeepSeek | Cobrança escalonada, consulte a página de preços | DeepSeek V4 Flash Vision (experimental) — the V4 Flash tier with image input, priced identically to deepseek-v4-flash on every face. Images are converted to tokens by their size and billed together with text at the input rate, so there is no separate image charge. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. The vendor labels this tier experimental; behaviour and availability may change without notice. Text and images in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3.1-flash-image | Cobrança escalonada, consulte a página de preços | Google Gemini 3.1 Flash Image (Nano Banana 2) — modelo estável de baixa latência para geração de imagens de alta qualidade e edição por conversa. Ele aceita texto, imagens e PDFs, oferece suporte a thinking e embasamento por busca, e gera imagens em 0,5K, 1K, 2K ou 4K para fluxos de produção de alto volume. | |||
| gpt-4.1 | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT-4.1 — a non-reasoning model tuned for instruction following and long-context work, with a 1,047,576-token context window and up to 32,768 output tokens. It takes text and image input, and its output is priced below the reasoning tier at the same input price. | ||
| gemini-2.5-flash | Cobrança escalonada, consulte a página de preços | Google Gemini 2.5 Flash — a fast, low-cost multimodal model with a 1M-token context window. Accepts text, images, video and audio; audio input is billed at the vendor's separate audio rate. | |||
| glm-5.1 | 智谱 | $1.4000 | $4.4000 | por 1M tokens | Zhipu GLM-5.1 — modelo de fundação carro-chefe construído para trabalho autônomo prolongado: o fornecedor documenta execução contínua e sem supervisão em uma única tarefa por até 8 horas, abrangendo planejamento, execução, testes e otimização iterativa. Janela de contexto de 200K, até 128K tokens de saída, texto na entrada e texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP. |
| image-01 | MiniMax | $0.004 | por requisição | MiniMax image-01 — geração de imagens a partir de texto pelo endpoint nativo image_generation da MiniMax. Cobrado por imagem gerada. O fornecedor o classifica entre os modelos legados. | |
| MiniMax-Hailuo-02 | MiniMax | $0.280 | por requisição | MiniMax Hailuo 02 — geração de vídeo econômica que cobre tanto texto para vídeo quanto imagem para vídeo a 24 fps, com 512p e 768p disponíveis em clipes de 6 ou 10 segundos e 1080p em 6 segundos. O nível 512p é a porta de entrada da linha Hailuo. | |
| MiniMax-M3 | MiniMax | Cobrança escalonada, consulte a página de preços | MiniMax M3 — modelo de programação multimodal de fronteira para raciocínio agêntico, uso de ferramentas e execução estruturada de tarefas, com janela de contexto de 1.000.000 tokens. Aceita texto, imagens de até 10 MB e vídeo de até 50 MB embutido ou 512 MB pela API de Files, e retorna texto. Oferece suporte a chamada de ferramentas, com o thinking opcional em vez de sempre ativo. | ||
| speech-2.8-hd | MiniMax | $1.0000 | por 10 mil caracteres | MiniMax speech-2.8-hd — o nível de alta definição da linha de voz 2.8, posicionado para uma entrega ultrarrealista com tags de som, cobrindo 40 idiomas e 7 emoções. Tom, velocidade da fala, volume, taxa de amostragem, taxa de bits e formato de saída são configuráveis por requisição, e a síntese de textos longos aceita até 1 milhão de caracteres de forma assíncrona ou 10.000 caracteres pela interface de streaming. | |
| gemini-3.1-flash-lite | Cobrança escalonada, consulte a página de preços | Google Gemini 3.1 Flash-Lite — modelo multimodal de baixa latência e bom custo-benefício para tarefas leves de alta frequência, fluxos de trabalho agênticos de alto volume, tradução e extração de dados estruturados. Ele aceita texto, imagens, vídeo, áudio e PDFs, oferece suporte a thinking e uso de ferramentas, e fornece contexto de entrada de 1.048.576 tokens com até 65.536 tokens de saída. | |||
| happyhorse-1.1-i2v | 阿里巴巴 | $0.091 | por segundo | Alibaba HappyHorse 1.1 (I2V) — imagem para vídeo com melhor textura, consistência de identidade entre clipes, fluidez de movimento e sincronia entre áudio e imagem. 720P/1080P. | |
| kimi-k2.7-code | Moonshot | $0.7600 | $3.1570 | por 1M tokens | Moonshot Kimi K2.7 Code — o modelo dedicado a programação da Kimi, que o fornecedor mede como tendo melhorado o cumprimento de instruções e a programação de longa duração em relação ao K2.6, ao mesmo tempo em que reduziu o excesso de raciocínio em cerca de 30% em média. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens e vídeo como conteúdo base64 e retorna texto. O thinking é obrigatório e retorna erro se desativado; tool_choice fica limitado a auto ou none, e reasoning_content precisa ser repassado ao longo das chamadas de ferramentas em várias etapas. |
| step-asr-1.1 | StepFun | $0.3370 | por hora de áudio | StepFun step-asr-1.1 — versão atualizada do reconhecedor de uso geral da linha step-asr, cobrindo chinês, inglês e dialetos chineses. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada. | |
| gpt-5.4 | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT-5.4 — a frontier model for complex professional work and coding, priced well below GPT-5.5. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 1,050,000-token context window, and up to 128,000 output tokens. Prompts above 272,000 input tokens are repriced at 2x input and 1.5x output for the whole session. | ||
| doubao-seedream-4-5-251128 | 字节跳动 | $0.037 | por requisição | ByteDance Doubao Seedream 4.5 — texto para imagem e imagem para imagem com fusão de várias imagens, produzindo uma imagem única ou um conjunto de imagens relacionadas. O modo de imagem única aceita apenas um prompt, uma imagem de referência, ou de 2 a 14 imagens de referência; o modo em conjunto (sequential_image_generation=auto) retorna até 15 imagens a partir de texto, até 14 a partir de uma única imagem de referência, ou um conjunto a partir de 2 a 14 referências desde que a soma de entradas e saídas não passe de 15. Oferece suporte a saídas em 2K e 4K e retorna JPEG por padrão, como URL ou base64. A edição interativa por coordenadas é exclusiva do Seedream 5.0 pro. | |
| deepseek-v4-flash-legacy | DeepSeek | $0.1190 | $0.2370 | por 1M tokens | DeepSeek V4 Flash (legacy tier) — a lower-priced route to the V4 Flash model family. Input and output tokens are cheaper than on deepseek-v4-flash, while cache reads are priced higher, so prompt-caching-heavy workloads are usually cheaper on deepseek-v4-flash and low-reuse workloads are cheaper here. Responses may come from an earlier V4 Flash build. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| doubao-seed-2-1-pro-260628 | 字节跳动 | $0.8890 | $4.4440 | por 1M tokens | ByteDance Doubao Seed 2.1 Pro — modelo de agente carro-chefe da Doubao para trabalho em produção, cobrindo raciocínio profundo, geração de texto, compreensão multimodal, chamada de ferramentas e saída estruturada, para a qual o fornecedor recomenda o modo json_schema. Janela de contexto de 256K com entrada máxima de 256K, até 256K tokens de saída (4K por padrão) e um orçamento de 256K para a cadeia de raciocínio. Aceita texto, imagem e vídeo e retorna texto; a compreensão de áudio não é listada para a linha 2.1. Oferece suporte a cache de contexto implícito e explícito, incluindo caches de prefixo e de sessão. |
| MiniMax-M2.7 | MiniMax | $0.3000 | $1.2000 | por 1M tokens | MiniMax M2.7 — modelo de texto para chat, programação, trabalho de escritório e tarefas agênticas, com janela de contexto de 204.800 tokens e saída a cerca de 60 tokens por segundo. Apenas texto: a API aceita blocos de conteúdo de texto e de chamada de ferramenta, mas não imagens nem vídeo. Oferece suporte a chamada de ferramentas; o thinking fica sempre ativo e não pode ser desligado. |
| MiniMax-M2.7-highspeed | MiniMax | $0.6000 | $2.4000 | por 1M tokens | MiniMax M2.7 Highspeed — o mesmo modelo M2.7 servido a cerca de 100 tokens por segundo para programação de baixa latência e fluxos de trabalho de agentes, com janela de contexto de 204.800 tokens. Apenas texto: a API aceita blocos de conteúdo de texto e de chamada de ferramenta, mas não imagens nem vídeo. Oferece suporte a chamada de ferramentas; o thinking fica sempre ativo e não pode ser desligado. |
| step-1o-audio | StepFun | $3.7070 | $8.8980 | por 1M tokens | StepFun step-1o-audio — modelo de voz ponta a ponta da geração anterior, com suporte multilíngue e chamada de ferramentas, limitado a 30 minutos por interação. Em grande parte substituído pela linha StepAudio 2.5; mantido para cargas de trabalho já construídas sobre ele. |
| wan2.7-videoedit | 阿里巴巴 | $0.080 | por segundo | Alibaba Wan2.7 VideoEdit — edição de vídeo em linguagem natural, local ou global, substituição de elementos por imagem de referência e reprodução de movimento, efeitos e câmera. | |
| gpt-5.5 | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT-5.5 — modelo de raciocínio de fronteira para programação complexa e trabalho profissional. Aceita entrada de texto e imagem, chamada de funções e ferramentas integradas, janela de contexto de 1.050.000 tokens, até 128.000 tokens de saída e nível de raciocínio de none até xhigh. | ||
| hy3 | Tencent | $0.1480 | $0.5930 | por 1M tokens | Tencent Hunyuan 3 (Hy3) — modelo MoE de 295B de parâmetros (21B ativos), contexto nativo de 256K e três modos de raciocínio (fast / low / deep). Forte em agentes de programação, compreensão de documentos longos, contexto em múltiplos turnos e fluxos de trabalho de agentes em várias etapas. Somente texto. |
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | por 1M tokens | Xiaomi MiMo-V2.5 — modelo nativamente multimodal completo, com contexto de 1M e saída máxima de 128K, que entende imagens, vídeo, áudio e texto em um único modelo. Oferece suporte a raciocínio profundo, chamada de funções, saída estruturada e pesquisa na web, com capacidade de agente em todas as modalidades. |
| step-tts-mini | StepFun | $0.1444 | por 10 mil caracteres | StepFun step-tts-mini — o integrante econômico e de baixa latência da linha TTS da StepFun, cobrindo os mesmos idiomas do step-tts-2 (chinês, inglês, mistura de chinês e inglês e japonês, além de cantonês e sichuanês) com um subconjunto das vozes integradas. Oferece suporte a rótulos de emoção e entonação em linguagem natural e à clonagem de voz zero-shot a partir de cerca de 10 segundos de áudio de referência. Gera wav, mp3, flac, opus ou pcm. | |
| claude-sonnet-4-5 | Anthropic | Cobrança escalonada, consulte a página de preços | Anthropic Claude Sonnet 4.5 — a pinned dated snapshot of the Sonnet 4.5 release, kept available for workloads that need byte-stable behaviour across runs. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| mimo-v2.5-tts | Xiaomi | $0.0000 | por 10 mil caracteres | Xiaomi MiMo v2.5 TTS — síntese de voz expressiva com oito vozes integradas, quatro em chinês e quatro em inglês (Mia, Chloe, Milo, Dean), cobrindo chinês e inglês além dos estilos dialetais do Nordeste, de Sichuan, de Henan e do cantonês. A entrega é dirigida de duas formas: instruções de estilo em linguagem natural e tags de áudio embutidas para emoções básicas e compostas, respiração, suspiros e ritmo, incluindo um modo de canto exclusivo deste modelo na linha MiMo TTS. Retorna wav mono ou pcm16 a 24 kHz e oferece suporte a streaming de baixa latência, que exige pcm16. Contexto de 8K e saída máxima de 8K. | |
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | por requisição | MiniMax Hailuo 2.3 — texto para vídeo e imagem para vídeo, que o fornecedor posiciona pela aderência às instruções, a 24 fps, com 768p disponível em clipes de 6 ou 10 segundos e 1080p em 6 segundos. 768p 6 s = $0,28. | |
| qwen3-tts-flash | 阿里巴巴 | $0.1100 | por 10 mil caracteres | Alibaba Qwen3-TTS-Flash — síntese de voz de baixa latência com 17 vozes integradas expressivas, cobrindo chinês, inglês, alemão, italiano, português, espanhol, japonês, coreano, francês e russo, além de um modo automático para textos que misturam idiomas e de saída em dialeto. Aceita até 512 tokens de texto por requisição e oferece suporte à síntese em streaming e fora dele. | |
| wan2.7-i2v | 阿里巴巴 | $0.080 | por segundo | Alibaba Wan 2.7 Image-to-Video — cobre a geração a partir do primeiro quadro, as transições entre primeiro e último quadro e a continuação de um clipe existente. Produz 720P ou 1080P (1080P por padrão) de 2 a 15 segundos, 5 s por padrão, a partir de prompts de até 5.000 caracteres (prompts negativos de até 500). Uma faixa mp3 ou wav de 2 a 30 segundos pode ser enviada como driving_audio; sem áudio, o modelo gera uma trilha de fundo ou efeitos sonoros condizentes, um áudio mais longo que o clipe é cortado e um áudio mais curto deixa o final em silêncio. | |
| doubao-seedance-2-0-fast-260128 | 字节跳动 | $4.2000 | $4.2000 | por 1M tokens | ByteDance Seedance 2.0 Fast — geração de vídeo econômica que traz o conjunto completo de recursos do Seedance 2.0, mas limitada a 480p e 720p, 24 fps, 4 a 15 segundos. Cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. 480p 5 s ≈ $0,26. |
| qwen3.7-plus | 阿里巴巴 | $0.3400 | $1.3600 | por 1M tokens | Alibaba Qwen3.7-Plus — modelo de agente híbrido multimodal que percebe cenas do mundo real, lê telas e opera interfaces gráficas, gera código a partir de referências visuais e faz navegação de ponta a ponta dentro de aplicativos móveis. Janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 131.072 tokens de saída e um orçamento de 262.144 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto; oferece suporte a chamada de funções, saídas estruturadas e cache de contexto. |
| deepseek-v4-pro | DeepSeek | Cobrança escalonada, consulte a página de preços | DeepSeek V4 Pro 0813 — the higher-capability DeepSeek V4 tier for coding, reasoning, and agentic work, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3.5-flash | Cobrança escalonada, consulte a página de preços | Google Gemini 3.5 Flash — modelo multimodal estável otimizado para desempenho sustentado de agentes, ciclos rápidos de programação, uso de subagentes e fluxos de trabalho de várias etapas e longa execução. Ele aceita texto, imagens, vídeo, áudio e PDFs, oferece suporte a thinking e ferramentas integradas, e fornece contexto de entrada de 1.048.576 tokens com até 65.536 tokens de saída. | |||
| wan2.7-image-pro | 阿里巴巴 | $0.064 | por requisição | Alibaba Wan 2.7 Image Pro — o nível profissional da linha de imagem Wan 2.7, cobrindo texto para imagem, conjuntos sequenciais de imagens, edição de imagens e geração com várias imagens de referência, com melhor aderência ao prompt. O texto para imagem chega a 4K (4096x4096), com níveis de 1K e 2K e tamanhos personalizados a partir de 768x768; os modos de edição e sequencial ficam limitados a 2K. Aceita até 9 imagens de referência (JPEG, JPG, PNG, BMP, WEBP; 240 a 8.000 px por lado, 20 MB cada), proporções de 1:8 a 8:1 e prompts de até 5.000 caracteres. Retorna PNG. | |
| claude-haiku-4-5 | Anthropic | Cobrança escalonada, consulte a página de preços | Anthropic Claude Haiku 4.5 — the fastest Claude model with near-frontier intelligence, built for high-volume, latency-sensitive work such as classification, extraction, and routing. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| happyhorse-1.1-r2v | 阿里巴巴 | $0.091 | por segundo | Alibaba HappyHorse 1.1 (R2V) — geração de vídeo a partir de referências, com até 9 imagens de referência, forte consistência de sujeito, cena e estilo, e controle de câmera. 720P/1080P. | |
| kimi-k2.7-code-highspeed | Moonshot | $1.9000 | $8.0000 | por 1M tokens | Moonshot Kimi K2.7 Code Highspeed — o nível de throughput do K2.7 Code, que serve o mesmo modelo a cerca de 180 tokens por segundo e até 260 em trabalhos de contexto curto. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens e vídeo como conteúdo base64 e retorna texto. O thinking é obrigatório e retorna erro se desativado; tool_choice fica limitado a auto ou none, e reasoning_content precisa ser repassado ao longo das chamadas de ferramentas em várias etapas. |
| qwen3.7-max | 阿里巴巴 | $1.5000 | $4.5000 | por 1M tokens | Alibaba Qwen3.7-Max — carro-chefe de código fechado posicionado para programação, trabalho de escritório e produtividade, e execução autônoma de longo prazo, com janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 131.072 tokens de saída e um orçamento de 262.144 tokens para a cadeia de raciocínio. Texto na entrada, texto na saída. Oferece suporte a chamada de funções, saídas estruturadas e cache de contexto. |
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | por 1M tokens | StepFun StepAudio 2.5 Chat — modelo de compreensão de fala ponta a ponta: recebe áudio ou texto e devolve texto, lendo sinais paralinguísticos como hesitação e riso na própria forma de onda, e não em uma transcrição. Oferece ampla personalização de personas, abrangendo caráter, hábitos de fala e amplitude emocional. O áudio é enviado como partes de conteúdo input_audio no endpoint chat completions. Para respostas faladas, use um modelo de TTS. |
| wan2.7-r2v | 阿里巴巴 | $0.080 | por segundo | Alibaba Wan2.7 (R2V) — geração de vídeo a partir de referências, com até 5 referências mistas de imagem/vídeo mais uma referência de timbre de áudio, e maior consistência de personagens, objetos de cena e cenários. | |
| agnes-image-2.1-flash | Agnes AI | $0.000 | por requisição | Agnes AI Image 2.1 Flash — modelo de geração e edição de imagens focado em detalhes para cenas de alta densidade de informação, cobrindo texto para imagem, imagem para imagem e composição com várias imagens, em tamanhos e proporções flexíveis de 1K a 4K. | |
| gemini-3-pro-image | Cobrança escalonada, consulte a página de preços | Google gemini-3-pro-image | |||
| claude-fable-5 | Anthropic | Cobrança escalonada, consulte a página de preços | Anthropic Claude Fable 5 — o modelo mais capaz da Anthropic entre os de disponibilidade geral, para trabalho do conhecimento e programação ambiciosos e de longa duração. Ele foi construído para tarefas agênticas de vários dias, engenharia de software complexa, pesquisa aprofundada, raciocínio sobre documentos e imagens, e autoverificação proativa. | ||
| step-audio-r1.5 | StepFun | $1.4930 | $15.6720 | por 1M tokens | StepFun step-audio-r1.5 — modelo de voz ponta a ponta da mesma família do step-audio-2, com o mesmo preço de entrada e uma saída cobrada 50% mais cara. A StepFun não publica uma página de recursos separada para este modelo; consulte a documentação de áudio da plataforma para conhecer o conjunto de parâmetros vigente. |
| agnes-video-v2.0 | Agnes AI | $0.000 | por segundo | Agnes AI Video V2.0 — modelo assíncrono de geração de vídeo para texto para vídeo, imagem para vídeo, quadros-chave a partir de várias imagens e movimentos cinematográficos, com níveis de saída normalizados em 480p, 720p e 1080p. | |
| kimi-k2.6 | Moonshot | $0.7600 | $3.1570 | por 1M tokens | Moonshot Kimi K2.6 — modelo de uso geral para diálogo, geração de código, compreensão visual e tarefas de agentes, com escrita de código de longa duração e execução autônoma mais fortes que na geração anterior. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens (png, jpeg, webp, gif) e vídeo (mp4, mov, webm e outros) como conteúdo base64 e retorna texto. O modo de raciocínio vem ligado por padrão e pode ser desativado; a temperatura é fixa em 1.0 com raciocínio e 0.6 sem ele. |
| kling-v3 | 快手 | $0.420 | por requisição | Kuaishou Kling 3.0 — texto para vídeo e imagem para vídeo com áudio nativo e melhor consistência dos elementos. Os clipes duram de 3 a 15 segundos (5 por padrão) em 16:9, 9:16 ou 1:1, com o nível escolhido por mode: std para 720P, pro para 1080P e 4k para 4K nativo. O áudio é opcional e precisa ser ligado com sound=on, vindo desligado por padrão; imagem para vídeo usa um primeiro quadro com um quadro final opcional. A partir de $0,083/s (720p). | |
| stepaudio-2.5-tts | StepFun | $0.8500 | por 10 mil caracteres | StepFun StepAudio 2.5 TTS — síntese de voz contextual que leva a compreensão por todo o pipeline de geração, em vez de tratar a entonação como pós-processamento. Voz, emoção e ritmo são dirigidos em linguagem natural em dois níveis: um contexto global para a requisição e um contexto em linha para trechos específicos. A clonagem de voz zero-shot exige cerca de 3 segundos de áudio de referência e herda todo o conjunto de controles contextuais. Aceita até 1000 caracteres por requisição; gera wav, mp3, flac ou opus. | |
| glm-asr-2512 | 智谱 | $0.1440 | por hora de áudio | Zhipu GLM-ASR-2512 — modelo de reconhecimento de voz que reporta uma taxa de erro de caracteres de 0,0717. Cobre o mandarim junto com o sichuanês, o cantonês, o min nan e o wu, os sotaques do inglês americano e britânico, e dezenas de outros idiomas, entre eles francês, alemão, japonês, coreano, espanhol e árabe. Lida com fala que mistura idiomas, jargão técnico e registro coloquial, e aceita um dicionário personalizado para vocabulário de domínio. O áudio é limitado a 30 segundos e 25 MB por requisição, com transcrição em lote e em streaming. | |
| gpt-5.6-luna | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT-5.6 Luna — o nível mais rápido e acessível do GPT-5.6, otimizado para cargas de trabalho de alto volume e sensíveis a custo, sem abrir mão de raciocínio, visão e uso de ferramentas. Aceita entrada de texto e imagem, janela de contexto de 1.050.000 tokens e até 128.000 tokens de saída. | ||
| qwen3.6-flash | 阿里巴巴 | $0.2500 | $1.5000 | por 1M tokens | Alibaba Qwen3.6-Flash — modelo rápido de visão e linguagem que o fornecedor destaca para programação agêntica e para inteligência espacial, com ganhos marcantes em localização e detecção de objetos. Janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 65.536 tokens de saída e um orçamento de 131.072 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto. Oferece suporte a chamada de funções e cache de contexto. |
| qwen3.6-plus | 阿里巴巴 | $0.4000 | $2.4000 | por 1M tokens | Alibaba Qwen3.6-Plus — modelo equilibrado para raciocínio geral e uso de ferramentas, com janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 65.536 tokens de saída e um orçamento de 81.920 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto. Oferece suporte a chamada de funções, saídas estruturadas, pesquisa na web, complementação de prefixo e cache de contexto. |
| glm-5-turbo | 智谱 | $1.2000 | $4.0000 | por 1M tokens | Zhipu GLM-5-Turbo — a variante do GLM-5 voltada a throughput, otimizada para fluxos de trabalho de agentes: invocação de ferramentas e habilidades mais estável ao longo de tarefas de várias etapas, melhor tratamento de instruções longas e encadeadas, e execução de tarefas agendadas ou de longa duração. Janela de contexto de 200K, até 128K tokens de saída, texto na entrada e texto na saída. Oferece suporte a modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP. |
| wan3.0-video | 阿里巴巴 | $0.089 | por segundo | Alibaba Wan3.0 (Video) — an all-in-one video model that unifies text-to-video, image-to-video and reference-to-video behind a single endpoint. Generates H.264 MP4 at 480P, 720P or 1080P, up to 30 seconds, from a prompt and an optional first-frame image URL. Billed per second of generated video against the vendor's own ladder: 720P is the base rate, 480P is charged at half of it and 1080P at double. A request that does not name a resolution is produced at 1080P by the model and is charged at that tier. Reference video and reference audio inputs exist in the vendor's model but are not carried on this endpoint. | |
| doubao-seedance-2-5-260628 | 字节跳动 | $10.7000 | $10.7000 | por 1M tokens | ByteDance Seedance 2.5 — o modelo principal da linha Seedance, que estende uma única geração para 4 a 30 segundos a 24 fps, mantendo a resolução limitada a 480p e 720p. A geração multimodal por referência chega a 1-30 imagens, até 10 vídeos de referência e até 10 trechos de áudio de referência (30 segundos no total para cada categoria) e, ao contrário da linha 2.0, uma referência de áudio pode ser usada sozinha. Ele também cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. |
| claude-sonnet-4-6 | Anthropic | Cobrança escalonada, consulte a página de preços | Anthropic Claude Sonnet 4.6 — the balanced Sonnet generation, offering a 1,000,000-token context window at standard pricing with up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer, so the same text yields roughly 30% fewer tokens than on 4.7-and-later models at the same per-token rate. | ||
| doubao-seedance-2-0-260128 | 字节跳动 | $7.0000 | $7.0000 | por 1M tokens | ByteDance Seedance 2.0 — o carro-chefe da linha Seedance 2.0 e seu único integrante que chega a 1080p e 4K (profundidade de 10 bits) além de 480p e 720p, a 24 fps e de 4 a 15 segundos. Cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16, com o quadro final disponível como imagem. Cobrado pela resolução de saída. |
| stepaudio-2.5-asr | StepFun | $0.0220 | por hora de áudio | StepFun StepAudio 2.5 ASR — modelo de reconhecimento de voz com 4B de parâmetros construído sobre Multi-Token Prediction, que transcreve cinco minutos de áudio em cerca de um segundo (RTF em torno de 0,0053). Otimizado para chinês e inglês. Inclui normalização inversa de texto, identificação de locutores e separação de dois canais para gravações de chamadas e reuniões. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada. | |
| stepaudio-2.5-asr-stream | StepFun | $0.1800 | por hora de áudio | StepFun StepAudio 2.5 ASR — 4B-parameter speech recognition model built on Multi-Token Prediction, transcribing five minutes of audio in about one second (RTF around 0.0053). Optimized for Chinese and English. Includes inverse text normalization, speaker identification, and dual-channel separation for call and meeting recordings. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| doubao-seedance-2-0-mini-260615 | 字节跳动 | $1.4000 | $1.4000 | por 1M tokens | ByteDance Seedance 2.0 Mini — o nível leve e de baixo custo da linha Seedance 2.0, limitado a 480p e 720p, 24 fps, 4 a 15 segundos. Traz o mesmo conjunto de recursos documentado do restante da linha: texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. |
| step-tts-2 | StepFun | $0.4000 | por 10 mil caracteres | StepFun step-tts-2 — síntese de voz ponta a ponta baseada em NTP, feita para reproduzir sotaques com precisão. Fala chinês, inglês, mistura de chinês e inglês e japonês, além de cantonês e sichuanês. A emoção e a entonação são dirigidas por rótulos em linguagem natural, e a clonagem de voz zero-shot exige cerca de 10 segundos de áudio de referência, com os controles de emoção e estilo se transferindo para a voz clonada sem custo adicional. Gera wav, mp3, flac, opus ou pcm. | |
| claude-opus-4-6 | Anthropic | Cobrança escalonada, consulte a página de preços | Anthropic Claude Opus 4.6 — the Opus generation for complex reasoning and agentic work, with a 1,000,000-token context window at standard pricing and up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer. | ||
| MiniMax-H3 | MiniMax | $0.080 | por segundo | MiniMax H3 (Hailuo 3.0) — modelo de vídeo multimodal de uso geral, aberto e de nova geração, que produz áudio estéreo nativo em uma única passagem, em 768P ou 2K, com 4 a 15 segundos (apenas números inteiros), a 24 fps. Ele cobre texto para vídeo, imagem para vídeo a partir de um primeiro e/ou último quadro, e geração por referência a partir de imagens, vídeos ou áudio para personagem, movimento, câmera, estilo, voz ou ritmo de montagem; imagem para vídeo e geração por referência não podem ser combinadas na mesma requisição. Ele aceita vídeo H.264/H.265, imagens JPG, JPEG, PNG, WEBP, HEIC e HEIF, e áudio WAV ou MP3, com prompts de até 7.000 caracteres. $0,08/s em 768P e $0,13/s em 2K. | |
| step-1o-turbo-vision | StepFun | $0.3850 | $1.2330 | por 1M tokens | StepFun step-1o-turbo-vision — compreensão de imagens e vídeos com geração rápida de texto, contexto de 32K. Aceita texto, imagem e vídeo na entrada e retorna apenas texto. É um modelo de visão da geração anterior mantido por compatibilidade; o step-3.7-flash cobre as mesmas modalidades de entrada com contexto de 256K e profundidade de raciocínio selecionável. Mantenha as imagens abaixo de 4096 pixels no lado maior para um reconhecimento confiável. |
| step-asr-1.1-stream | StepFun | $0.3852 | por hora de áudio | StepFun step-asr-1.1 — the updated general-purpose recognizer in the step-asr line, covering Chinese, English, and Chinese dialects. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| gpt-5.4-mini | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT-5.4 mini — the small GPT-5.4 model for high-volume workloads, coding, computer use, and subagents. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 400,000-token context window with a 272,000-token maximum input, and up to 128,000 output tokens. | ||
| agnes-2.5-flash | Agnes AI | $0.0000 | por 1M tokens | Agnes AI Agnes 2.5 Flash — modelo de agente multimodal rápido com contexto de entrada de 512K e limite de saída de referência de 65,5K, com suporte a chat, streaming, chamada de ferramentas, programação, raciocínio, diálogo multi-turno, compreensão visual e fluxos de trabalho de agentes. | |
| claude-opus-4-7 | Anthropic | Cobrança escalonada, consulte a página de preços | Anthropic Claude Opus 4.7 — modelo de raciocínio avançado para engenharia de software difícil e tarefas agênticas complexas de longa execução. Ele enfatiza o cumprimento rigoroso de instruções, a autoverificação, o uso confiável de ferramentas e a visão em alta resolução em interfaces, imagens, documentos e fluxos profissionais. | ||
| gemini-3.6-flash | Cobrança escalonada, consulte a página de preços | Google Gemini 3.6 Flash — a stable multimodal reasoning model that balances speed and intelligence for agentic and real-world tasks, with a 1,048,576-token input context and 65,536-token output limit. It accepts text, images, video, audio, and PDFs, and supports thinking, function calling, code execution, search grounding, structured output, and Computer Use (preview). Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5v-turbo | 智谱 | $1.2000 | $4.0000 | por 1M tokens | Zhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows. |
| gpt-4o | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT-4o — the multimodal GPT-4 generation model, kept in the catalogue for drop-in compatibility with existing integrations that call it by name. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| gpt-4o-mini | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT-4o mini — the small, low-cost GPT-4o variant for high-volume and latency-sensitive work. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| deepseek-v4-flash | DeepSeek | Cobrança escalonada, consulte a página de preços | DeepSeek V4 Flash 0731 — the fast, high-concurrency DeepSeek V4 tier for chat, coding help, and agent loops, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3.7-flash | Cobrança escalonada, consulte a página de preços | Google Gemini 3.7 Flash — the newest Flash-tier multimodal reasoning model, priced identically to 3.6 Flash while the vendor promotion runs. Accepts text, images, video, audio and PDFs; supports thinking, function calling, code execution, search grounding and structured output. Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5.2 | 智谱 | $1.4000 | $4.4000 | por 1M tokens | Zhipu GLM-5.2 — modelo de fundação carro-chefe especializado em trabalho de agente de programação de longa duração, obtido por meses de treinamento dedicado e não apenas por uma extensão de contexto, com janela de contexto de 1M tokens e até 128K tokens de saída. Texto na entrada, texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP. |
| gpt-5.6-sol | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT-5.6 Sol — modelo carro-chefe da linha GPT-5.6 para raciocínio de fronteira, trabalho profissional complexo, programação, ciência, cibersegurança e fluxos de trabalho agênticos de longa duração. Aceita entrada de texto e imagem, ferramentas integradas, janela de contexto de 1.050.000 tokens, até 128.000 tokens de saída e os ajustes de raciocínio mais profundos da família. | ||
| mimo-v2.5-asr | Xiaomi | $0.0740 | por hora de áudio | Modelo de reconhecimento de voz da Xiaomi MiMo otimizado para chinês e inglês, além de dialetos chineses, lidando com áudio ruidoso, captado a distância e com vários locutores, bem como com a transcrição de letras de música. | |
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | por 10 mil caracteres | Modelo de clonagem de voz da Xiaomi MiMo: envie uma amostra de áudio de referência como data URL no campo voice (data:{mime};base64,...) e ele sintetiza a fala com essa voz, sem nenhuma etapa de treinamento, anotação ou ajuste fino. Aceita MP3 (audio/mpeg) ou WAV, com a string codificada em base64 limitada a 10 MB; a Xiaomi não publica uma duração mínima para o áudio de referência. As instruções de estilo em linguagem natural e as tags de áudio embutidas vêm do mimo-v2.5-tts, mas não há streaming — a requisição roda em modo de compatibilidade e só retorna depois que a síntese termina. | |
| wan2.7-image | 阿里巴巴 | $0.030 | por requisição | Alibaba Wan2.7 Image — texto para imagem, edição de imagens, geração com várias imagens de referência, edição interativa, além de boa renderização de texto e aderência às instruções. | |
| claude-opus-4-8 | Anthropic | Cobrança escalonada, consulte a página de preços | Anthropic Claude Opus 4.8 — modelo de raciocínio de alta capacidade para programação, fluxos de trabalho agênticos, análise profissional e trabalho de longa execução. Em relação ao Opus 4.7, ele melhora confiabilidade, discernimento, eficiência no uso de ferramentas, uso do computador e raciocínio multimodal sobre documentos, com suporte a uma janela de contexto de 1.000.000 tokens. | ||
| gpt-4.1-mini | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT-4.1 mini — the small GPT-4.1 variant. Being non-reasoning, its prose stays more predictable than the reasoning tier at a comparable price, which suits writing and rewriting work. It takes text and image input, with a 1,047,576-token context window and up to 32,768 output tokens. | ||
| kling-v3-omni | 快手 | $0.420 | por requisição | Kling 3.0 Omni — geração de vídeo com várias imagens de referência. O preço exibido é o do nível std (720p, 5 s, sem áudio, sem vídeo de referência). Requisições que não definem mode usam o nível pro, padrão do fornecedor, e são cobradas 1,33x — cerca de $0,56 pelo mesmo clipe de 5 s; o 4k é cobrado 5x. Envie mode=std para ser cobrado pelo preço exibido. | |
| speech-2.8-turbo | MiniMax | $0.6000 | por 10 mil caracteres | MiniMax speech-2.8-turbo — o nível de baixa latência da linha de voz 2.8, que troca a entrega ultrarrealista do modelo HD por uma síntese mais rápida e de fluxo natural. Cobre os mesmos 40 idiomas e 7 emoções, com tom, velocidade da fala, volume, taxa de amostragem, taxa de bits e formato de saída configuráveis, e aceita até 1 milhão de caracteres de forma assíncrona ou 10.000 caracteres pela interface de streaming. | |
| gpt-image-2 | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT Image 2 — a state-of-the-art image generation and editing model for fast, high-quality output. It takes text and image input, supports flexible image sizes and high-fidelity image inputs, and bills per token rather than per call: $5 text input, $1.25 cached text input, $8 image input, and $30 image output per 1M tokens. | ||
| kimi-k3 | Moonshot | $3.0000 | $15.0000 | por 1M tokens | Moonshot Kimi K3 — carro-chefe de 2,8 trilhões de parâmetros para programação de longa duração, trabalho do conhecimento de ponta a ponta e raciocínio profundo, com janela de contexto de 1M tokens e até 1.048.576 tokens de conclusão (131.072 por padrão). Aceita texto, imagens em base64 e vídeo, e retorna texto. O thinking fica sempre ativo, com reasoning_effort selecionável entre low, high ou max (max por padrão); a temperatura é fixa em 1.0. Oferece suporte a chamada de ferramentas personalizadas e ao carregamento dinâmico de ferramentas. |
| kling-3.0-turbo | 快手 | $0.560 | por requisição | Kuaishou Kling 3.0 Turbo — o nível de custo-benefício da linha Kling 3.0, que gera 720P ou 1080P (720P por padrão) de 3 a 15 segundos (5 por padrão) em 16:9, 9:16 ou 1:1, a partir de um prompt ou de uma imagem de primeiro quadro. O áudio nativo vem sempre incluído e não tem chave para ligar ou desligar. Em relação ao kling-v3, ele abre mão do nível 4K, do controle do quadro final e da entrada de vídeo em troca de velocidade e custo. 720p 5 s com áudio ≈ $0,56. | |
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | por 1M tokens | StepFun step-3.7-flash — sparse MoE with 198B total and 11B active parameters, native 256K context, and native understanding of images and video alongside text. Reasoning depth is selectable per request through reasoning_effort (low / medium / high), and the model supports reliable multi-step tool calling, JSON Schema structured output, streaming, and prompt caching. Tuned for agent and coding workloads. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| doubao-seed-2-1-turbo-260628 | 字节跳动 | $0.4440 | $2.2220 | por 1M tokens | ByteDance Doubao Seed 2.1 Turbo — a via de baixa latência da linha Seed 2.1, que compartilha os limites do Pro: janela de contexto de 256K com entrada máxima de 256K, até 256K tokens de saída (4K por padrão) e um orçamento de 256K para a cadeia de raciocínio. Cobre raciocínio profundo, geração de texto, compreensão multimodal, chamada de ferramentas e saída estruturada, ainda que sem a recomendação de json_schema do Pro. Aceita texto, imagem e vídeo e retorna texto; a compreensão de áudio não é listada para a linha 2.1. Oferece suporte a cache de contexto implícito e explícito. |
| glm-5.3 | 智谱 | $1.4000 | $4.4000 | por 1M tokens | Zhipu GLM-5.3 — flagship coding-and-agent model post-trained on the same base as GLM-5.2: a 50% gain on Zhipu's internal coding bench, open-source SOTA on Terminal-Bench 3.0 and Agents' Last Exam, and state-of-the-art CyberGym vulnerability-discovery results, with a 1M-token context window and up to 128K output tokens. Text in, text out. Supports multiple thinking modes, function calling, structured JSON output, streaming, context caching, and MCP tool integration. |
| gpt-5.2 | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT-5.2 — a general-purpose model from the GPT-5.2 generation, kept in the catalogue for drop-in compatibility with integrations that call it by name. It takes text and image input, with a 400,000-token context window and up to 128,000 output tokens. | ||
| happyhorse-1.1-t2v | 阿里巴巴 | $0.091 | por segundo | Alibaba HappyHorse 1.1 (T2V) — texto para vídeo com melhor compreensão semântica, controle de câmera e geração dinâmica. Vídeo 720P/1080P fluido, detalhado e fisicamente coerente. | |
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | por requisição | MiniMax Hailuo 2.3 Fast — o nível de velocidade e custo do Hailuo 2.3, voltado a imagem para vídeo e ao realismo do movimento físico, a 24 fps, com 768p disponível em clipes de 6 ou 10 segundos e 1080p em 6 segundos. 768p 6 s = $0,19. | |
| qwen3-asr-flash | 阿里巴巴 | $0.1260 | por hora de áudio | Alibaba Qwen3-ASR-Flash — reconhecimento de voz construído sobre o modelo de fundação Qwen3, que identifica sozinho o idioma falado e transcreve 11 idiomas; a linha Qwen3-ASR documenta o mandarim junto com o sichuanês, o min nan, o wu e o cantonês, além de vários sotaques do inglês. Aceita aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma e wmv com até 5 minutos e 10 MB por requisição; a entrada pcm precisa estar em 16 kHz e os demais formatos são reamostrados para 16 kHz antes do reconhecimento. | |
| claude-opus-5 | Anthropic | Cobrança escalonada, consulte a página de preços | Anthropic Claude Opus 5 — modelo de raciocínio profundo para programação agêntica complexa e trabalho corporativo, com ganhos expressivos em tarefas de longa duração, revisão de código, fluxos documentais, visão e coordenação entre múltiplos agentes. Tem janela de contexto de 1.000.000 tokens, aceita até 128.000 tokens de saída e ativa o thinking adaptativo por padrão. | ||
| gemini-2.5-flash-image | Cobrança escalonada, consulte a página de preços | Google Gemini 2.5 Flash Image (Nano Banana) — a fast native image generation and editing model for creative workflows. It takes text and image input and returns images through the OpenAI-compatible chat completions endpoint, with a 65,536-token input limit and 32,768-token output limit. | |||
| qwen3.8-max | 阿里巴巴 | $1.9000 | $5.7000 | por 1M tokens | Alibaba Qwen3.8-Max — 2.4-trillion-parameter MoE flagship and the most capable model in the Qwen family, with the vendor citing major gains in coding and office productivity. 1,000,000-token context window (991,808 max input, 983,616 in thinking mode), up to 131,072 output tokens, and a 262,144-token chain-of-thought budget. Accepts text input and returns text (image/video input is not available on the current serving route); supports function calling, structured outputs, and context caching. |
| step-asr | StepFun | $0.1444 | por hora de áudio | StepFun step-asr — reconhecimento de voz de uso geral cobrindo chinês, inglês e dialetos chineses, para transcrição, atas de reunião, avaliação de qualidade de chamadas e busca por voz. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada. | |
| agnes-image-2.0-flash | Agnes AI | $0.000 | por requisição | Agnes AI Image 2.0 Flash — modelo rápido de geração e edição de imagens para texto para imagem, imagem para imagem e composição com várias imagens, com os resultados disponíveis como URL ou dados Base64. | |
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | por 1M tokens | Xiaomi MiMo-V2.5-Pro — carro-chefe de um trilhão de parâmetros (42B ativos), contexto de 1M e saída máxima de 128K, ajustado para cargas de trabalho de agentes de alta intensidade. Oferece suporte a raciocínio profundo, chamada de funções, saída estruturada e pesquisa na web. Apenas geração de texto: ao contrário do mimo-v2.5, a lista de recursos do fornecedor não inclui a compreensão de todas as modalidades. |
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | por 10 mil caracteres | Modelo de design de voz da Xiaomi MiMo: descreva em linguagem natural a voz desejada no campo instructions e ele sintetiza a fala com essa voz projetada. | |
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | por 1M tokens | StepFun step-3.5-flash-2603 — instantâneo de 256K do step-3.5-flash ajustado para agentes, otimizado para eficiência de tokens e um modo de operação com pouca inferência. Seu parâmetro reasoning_effort aceita apenas low e high, enquanto o modelo base aceita três níveis, portanto o código que envia medium precisa ser adaptado. Somente texto; oferece suporte a chamada de ferramentas, saída estruturada por JSON Schema, streaming e cache de prompts. |
| doubao-seedream-5-0-260128 | 字节跳动 | $0.033 | por requisição | ByteDance Doubao Seedream 5.0-lite — texto para imagem e imagem para imagem, com criação controlável mais inteligente, recuperação em tempo real e maior consistência de sujeito (resolução de 2K ou mais). | |
| glm-5 | 智谱 | $1.0000 | $3.2000 | por 1M tokens | Zhipu GLM-5 — MoE de 744B parâmetros com 40B ativos, treinado em 28,5T tokens e usando DeepSeek Sparse Attention, com janela de contexto de 200K e até 128K tokens de saída. Texto na entrada, texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP. |
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | por 1M tokens | Meituan LongCat-2.0 — modelo MoE aberto de 1,6T de parâmetros com contexto nativo de 1M, feito para programação agêntica e uso de ferramentas de longa duração. Modelo de raciocínio somente texto. |
| wan2.7-t2v | 阿里巴巴 | $0.080 | por segundo | Alibaba Wan2.7 (T2V) — texto para vídeo com atuação aprimorada, emoções sutis, ação intensa e cortes de câmera dramáticos. Produz MP4 H.264 em 720P ou 1080P, de 2 a 15 segundos (5 s por padrão), em 16:9, 9:16, 1:1, 4:3 ou 3:4, a partir de prompts de até 5.000 caracteres. O áudio vem incluído por padrão: sem audio_url, o modelo compõe uma trilha de fundo ou efeitos sonoros condizentes, ou é possível enviar no lugar uma faixa wav ou mp3 de 2 a 30 segundos. | |
| claude-sonnet-5 | Anthropic | Cobrança escalonada, consulte a página de preços | Anthropic Claude Sonnet 5 — modelo de produção que equilibra inteligência de fronteira e velocidade para programação, agentes e fluxos de trabalho corporativos. Ele planeja, usa ferramentas de navegador e terminal e trabalha de forma autônoma em tarefas de raciocínio, trabalho do conhecimento e engenharia de software. | ||
| gemini-3.1-flash-lite-image | Cobrança escalonada, consulte a página de preços | Google Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — modelo de latência ultrabaixa e bom custo-benefício para geração de imagens em alto volume e edições rápidas em vários turnos. Ele aceita texto e imagens, produz imagens em 1K, oferece suporte a thinking e edição por conversa, e foi projetado para aplicações interativas de desenvolvedores e do consumidor final. | |||
| stepaudio-2-asr-pro | StepFun | $0.3370 | por hora de áudio | StepFun StepAudio 2 ASR Pro — modelo de reconhecimento de voz com 32B de parâmetros, a opção que prioriza precisão na linha ASR da StepFun, enquanto o stepaudio-2.5-asr prioriza velocidade e custo. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada. | |
| agnes-2.0-flash | Agnes AI | $0.0000 | por 1M tokens | Agnes AI Agnes 2.0 Flash — modelo de agente multimodal rápido com contexto de entrada de 256K e limite de saída de referência de 64K, com suporte a chat, streaming, chamada de ferramentas, programação, raciocínio, compreensão visual e fluxos de trabalho de agentes. | |
| gemini-2.5-pro | Cobrança escalonada, consulte a página de preços | Google Gemini 2.5 Pro — the reasoning-tier model of the 2.5 family, with a 1M-token context window. Prompts above 200,000 tokens are repriced at the vendor's long-context rate for the whole request, matching Google's own rule. | |||
| glm-tts | 智谱 | $0.2963 | por 10 mil caracteres | Zhipu GLM-TTS — síntese de voz construída sobre uma arquitetura de geração em duas etapas com aprendizado por reforço GRPO, que infere emoção e entonação do texto ao redor em vez de exigir marcação explícita. Traz sete vozes integradas (tongtong por padrão, xiaochen, chuichui, jam, kazi, douji, luodo) com velocidade e volume ajustáveis, aceita até 1.024 caracteres por requisição e transmite com latência de primeiro quadro abaixo de 400 ms. Retorna wav ou pcm a uma taxa de amostragem recomendada de 24 kHz; o streaming é apenas em pcm. | |
| gpt-5.6-terra | OpenAI | Cobrança escalonada, consulte a página de preços | OpenAI GPT-5.6 Terra — modelo GPT-5.6 equilibrado para o trabalho profissional do dia a dia, com alta inteligência e bom desempenho como agente de programação a um custo menor que o Sol. Aceita entrada de texto e imagem, ferramentas integradas, janela de contexto de 1.050.000 tokens e até 128.000 tokens de saída. | ||
| step-audio-2 | StepFun | $1.4930 | $10.4480 | por 1M tokens | StepFun step-audio-2 — modelo de voz ponta a ponta que consome o áudio diretamente, em vez de partir de uma transcrição, de modo que o tom e a entonação chegam íntegros à compreensão do modelo. Cobrado por token, com o preço de entrada da linha StepAudio 2.5 e um preço de saída mais alto. A StepFun não publica uma página de recursos separada para este modelo; consulte a documentação de áudio da plataforma para conhecer o conjunto de parâmetros vigente. |
| step-image-edit-2 | StepFun | $0.003 | por requisição | StepFun Step Image Edit 2 — modelo unificado de geração de imagens a partir de texto e de edição de imagens com menos de 6B de parâmetros, no nível dos editores de pesos abertos na faixa de 12B a 20B. Ele conclui uma edição em um a dois segundos e foi feito para retoques interativos de baixa latência. Suporta 256x256, 512x512, 768x768, 1024x1024, 1280x800 e 800x1280, além de prompts negativos e um modo de otimização de texto; uma imagem por requisição. Servido pelo endpoint images compatível com OpenAI. | |
| claude-opus-4-5 | Anthropic | Cobrança escalonada, consulte a página de preços | Anthropic Claude Opus 4.5 — a pinned dated snapshot of the Opus 4.5 release for workloads that need byte-stable behaviour. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | por 1M tokens | StepFun step-3.5-flash — modelo de raciocínio somente texto com contexto de 256K, voltado a lógica, matemática, engenharia de software e pesquisa aprofundada, onde a qualidade do raciocínio precisa vir acompanhada de execução rápida e confiável. A profundidade do raciocínio é escolhida por requisição via reasoning_effort (low / medium / high). Oferece suporte a chamada de ferramentas, saída estruturada por JSON Schema, streaming e cache de prompts. Para entrada de imagem ou vídeo, use o step-3.7-flash. |