Preços dos modelos de IA chineses

A ChinaAPI oferece DeepSeek, Qwen, GLM, Kimi e outros modelos de IA chineses em um gateway compatível com OpenAI em https://api.chinaapi.ai/v1. Todos os preços são em dólar americano, na unidade que o fornecedor de origem utiliza. A mesma lista está disponível em JSON em /api/pricing.

Preços dos modelos públicos
ModeloFornecedorEntradaSaídaUnidadeDescrição
deepseek-v4-flash-vision-expDeepSeekCobrança escalonada, consulte a página de preçosDeepSeek V4 Flash Vision (experimental) — the V4 Flash tier with image input, priced identically to deepseek-v4-flash on every face. Images are converted to tokens by their size and billed together with text at the input rate, so there is no separate image charge. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. The vendor labels this tier experimental; behaviour and availability may change without notice. Text and images in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
gemini-3.1-flash-imageGoogleCobrança escalonada, consulte a página de preçosGoogle Gemini 3.1 Flash Image (Nano Banana 2) — modelo estável de baixa latência para geração de imagens de alta qualidade e edição por conversa. Ele aceita texto, imagens e PDFs, oferece suporte a thinking e embasamento por busca, e gera imagens em 0,5K, 1K, 2K ou 4K para fluxos de produção de alto volume.
gpt-4.1OpenAICobrança escalonada, consulte a página de preçosOpenAI GPT-4.1 — a non-reasoning model tuned for instruction following and long-context work, with a 1,047,576-token context window and up to 32,768 output tokens. It takes text and image input, and its output is priced below the reasoning tier at the same input price.
gemini-2.5-flashGoogleCobrança escalonada, consulte a página de preçosGoogle Gemini 2.5 Flash — a fast, low-cost multimodal model with a 1M-token context window. Accepts text, images, video and audio; audio input is billed at the vendor's separate audio rate.
glm-5.1智谱$1.4000$4.4000por 1M tokensZhipu GLM-5.1 — modelo de fundação carro-chefe construído para trabalho autônomo prolongado: o fornecedor documenta execução contínua e sem supervisão em uma única tarefa por até 8 horas, abrangendo planejamento, execução, testes e otimização iterativa. Janela de contexto de 200K, até 128K tokens de saída, texto na entrada e texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP.
image-01MiniMax$0.004por requisiçãoMiniMax image-01 — geração de imagens a partir de texto pelo endpoint nativo image_generation da MiniMax. Cobrado por imagem gerada. O fornecedor o classifica entre os modelos legados.
MiniMax-Hailuo-02MiniMax$0.280por requisiçãoMiniMax Hailuo 02 — geração de vídeo econômica que cobre tanto texto para vídeo quanto imagem para vídeo a 24 fps, com 512p e 768p disponíveis em clipes de 6 ou 10 segundos e 1080p em 6 segundos. O nível 512p é a porta de entrada da linha Hailuo.
MiniMax-M3MiniMaxCobrança escalonada, consulte a página de preçosMiniMax M3 — modelo de programação multimodal de fronteira para raciocínio agêntico, uso de ferramentas e execução estruturada de tarefas, com janela de contexto de 1.000.000 tokens. Aceita texto, imagens de até 10 MB e vídeo de até 50 MB embutido ou 512 MB pela API de Files, e retorna texto. Oferece suporte a chamada de ferramentas, com o thinking opcional em vez de sempre ativo.
speech-2.8-hdMiniMax$1.0000por 10 mil caracteresMiniMax speech-2.8-hd — o nível de alta definição da linha de voz 2.8, posicionado para uma entrega ultrarrealista com tags de som, cobrindo 40 idiomas e 7 emoções. Tom, velocidade da fala, volume, taxa de amostragem, taxa de bits e formato de saída são configuráveis por requisição, e a síntese de textos longos aceita até 1 milhão de caracteres de forma assíncrona ou 10.000 caracteres pela interface de streaming.
gemini-3.1-flash-liteGoogleCobrança escalonada, consulte a página de preçosGoogle Gemini 3.1 Flash-Lite — modelo multimodal de baixa latência e bom custo-benefício para tarefas leves de alta frequência, fluxos de trabalho agênticos de alto volume, tradução e extração de dados estruturados. Ele aceita texto, imagens, vídeo, áudio e PDFs, oferece suporte a thinking e uso de ferramentas, e fornece contexto de entrada de 1.048.576 tokens com até 65.536 tokens de saída.
happyhorse-1.1-i2v阿里巴巴$0.091por segundoAlibaba HappyHorse 1.1 (I2V) — imagem para vídeo com melhor textura, consistência de identidade entre clipes, fluidez de movimento e sincronia entre áudio e imagem. 720P/1080P.
kimi-k2.7-codeMoonshot$0.7600$3.1570por 1M tokensMoonshot Kimi K2.7 Code — o modelo dedicado a programação da Kimi, que o fornecedor mede como tendo melhorado o cumprimento de instruções e a programação de longa duração em relação ao K2.6, ao mesmo tempo em que reduziu o excesso de raciocínio em cerca de 30% em média. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens e vídeo como conteúdo base64 e retorna texto. O thinking é obrigatório e retorna erro se desativado; tool_choice fica limitado a auto ou none, e reasoning_content precisa ser repassado ao longo das chamadas de ferramentas em várias etapas.
step-asr-1.1StepFun$0.3370por hora de áudioStepFun step-asr-1.1 — versão atualizada do reconhecedor de uso geral da linha step-asr, cobrindo chinês, inglês e dialetos chineses. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada.
gpt-5.4OpenAICobrança escalonada, consulte a página de preçosOpenAI GPT-5.4 — a frontier model for complex professional work and coding, priced well below GPT-5.5. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 1,050,000-token context window, and up to 128,000 output tokens. Prompts above 272,000 input tokens are repriced at 2x input and 1.5x output for the whole session.
doubao-seedream-4-5-251128字节跳动$0.037por requisiçãoByteDance Doubao Seedream 4.5 — texto para imagem e imagem para imagem com fusão de várias imagens, produzindo uma imagem única ou um conjunto de imagens relacionadas. O modo de imagem única aceita apenas um prompt, uma imagem de referência, ou de 2 a 14 imagens de referência; o modo em conjunto (sequential_image_generation=auto) retorna até 15 imagens a partir de texto, até 14 a partir de uma única imagem de referência, ou um conjunto a partir de 2 a 14 referências desde que a soma de entradas e saídas não passe de 15. Oferece suporte a saídas em 2K e 4K e retorna JPEG por padrão, como URL ou base64. A edição interativa por coordenadas é exclusiva do Seedream 5.0 pro.
deepseek-v4-flash-legacyDeepSeek$0.1190$0.2370por 1M tokensDeepSeek V4 Flash (legacy tier) — a lower-priced route to the V4 Flash model family. Input and output tokens are cheaper than on deepseek-v4-flash, while cache reads are priced higher, so prompt-caching-heavy workloads are usually cheaper on deepseek-v4-flash and low-reuse workloads are cheaper here. Responses may come from an earlier V4 Flash build. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
doubao-seed-2-1-pro-260628字节跳动$0.8890$4.4440por 1M tokensByteDance Doubao Seed 2.1 Pro — modelo de agente carro-chefe da Doubao para trabalho em produção, cobrindo raciocínio profundo, geração de texto, compreensão multimodal, chamada de ferramentas e saída estruturada, para a qual o fornecedor recomenda o modo json_schema. Janela de contexto de 256K com entrada máxima de 256K, até 256K tokens de saída (4K por padrão) e um orçamento de 256K para a cadeia de raciocínio. Aceita texto, imagem e vídeo e retorna texto; a compreensão de áudio não é listada para a linha 2.1. Oferece suporte a cache de contexto implícito e explícito, incluindo caches de prefixo e de sessão.
MiniMax-M2.7MiniMax$0.3000$1.2000por 1M tokensMiniMax M2.7 — modelo de texto para chat, programação, trabalho de escritório e tarefas agênticas, com janela de contexto de 204.800 tokens e saída a cerca de 60 tokens por segundo. Apenas texto: a API aceita blocos de conteúdo de texto e de chamada de ferramenta, mas não imagens nem vídeo. Oferece suporte a chamada de ferramentas; o thinking fica sempre ativo e não pode ser desligado.
MiniMax-M2.7-highspeedMiniMax$0.6000$2.4000por 1M tokensMiniMax M2.7 Highspeed — o mesmo modelo M2.7 servido a cerca de 100 tokens por segundo para programação de baixa latência e fluxos de trabalho de agentes, com janela de contexto de 204.800 tokens. Apenas texto: a API aceita blocos de conteúdo de texto e de chamada de ferramenta, mas não imagens nem vídeo. Oferece suporte a chamada de ferramentas; o thinking fica sempre ativo e não pode ser desligado.
step-1o-audioStepFun$3.7070$8.8980por 1M tokensStepFun step-1o-audio — modelo de voz ponta a ponta da geração anterior, com suporte multilíngue e chamada de ferramentas, limitado a 30 minutos por interação. Em grande parte substituído pela linha StepAudio 2.5; mantido para cargas de trabalho já construídas sobre ele.
wan2.7-videoedit阿里巴巴$0.080por segundoAlibaba Wan2.7 VideoEdit — edição de vídeo em linguagem natural, local ou global, substituição de elementos por imagem de referência e reprodução de movimento, efeitos e câmera.
gpt-5.5OpenAICobrança escalonada, consulte a página de preçosOpenAI GPT-5.5 — modelo de raciocínio de fronteira para programação complexa e trabalho profissional. Aceita entrada de texto e imagem, chamada de funções e ferramentas integradas, janela de contexto de 1.050.000 tokens, até 128.000 tokens de saída e nível de raciocínio de none até xhigh.
hy3Tencent$0.1480$0.5930por 1M tokensTencent Hunyuan 3 (Hy3) — modelo MoE de 295B de parâmetros (21B ativos), contexto nativo de 256K e três modos de raciocínio (fast / low / deep). Forte em agentes de programação, compreensão de documentos longos, contexto em múltiplos turnos e fluxos de trabalho de agentes em várias etapas. Somente texto.
mimo-v2.5Xiaomi$0.1400$0.2800por 1M tokensXiaomi MiMo-V2.5 — modelo nativamente multimodal completo, com contexto de 1M e saída máxima de 128K, que entende imagens, vídeo, áudio e texto em um único modelo. Oferece suporte a raciocínio profundo, chamada de funções, saída estruturada e pesquisa na web, com capacidade de agente em todas as modalidades.
step-tts-miniStepFun$0.1444por 10 mil caracteresStepFun step-tts-mini — o integrante econômico e de baixa latência da linha TTS da StepFun, cobrindo os mesmos idiomas do step-tts-2 (chinês, inglês, mistura de chinês e inglês e japonês, além de cantonês e sichuanês) com um subconjunto das vozes integradas. Oferece suporte a rótulos de emoção e entonação em linguagem natural e à clonagem de voz zero-shot a partir de cerca de 10 segundos de áudio de referência. Gera wav, mp3, flac, opus ou pcm.
claude-sonnet-4-5AnthropicCobrança escalonada, consulte a página de preçosAnthropic Claude Sonnet 4.5 — a pinned dated snapshot of the Sonnet 4.5 release, kept available for workloads that need byte-stable behaviour across runs. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens.
mimo-v2.5-ttsXiaomi$0.0000por 10 mil caracteresXiaomi MiMo v2.5 TTS — síntese de voz expressiva com oito vozes integradas, quatro em chinês e quatro em inglês (Mia, Chloe, Milo, Dean), cobrindo chinês e inglês além dos estilos dialetais do Nordeste, de Sichuan, de Henan e do cantonês. A entrega é dirigida de duas formas: instruções de estilo em linguagem natural e tags de áudio embutidas para emoções básicas e compostas, respiração, suspiros e ritmo, incluindo um modo de canto exclusivo deste modelo na linha MiMo TTS. Retorna wav mono ou pcm16 a 24 kHz e oferece suporte a streaming de baixa latência, que exige pcm16. Contexto de 8K e saída máxima de 8K.
MiniMax-Hailuo-2.3MiniMax$0.280por requisiçãoMiniMax Hailuo 2.3 — texto para vídeo e imagem para vídeo, que o fornecedor posiciona pela aderência às instruções, a 24 fps, com 768p disponível em clipes de 6 ou 10 segundos e 1080p em 6 segundos. 768p 6 s = $0,28.
qwen3-tts-flash阿里巴巴$0.1100por 10 mil caracteresAlibaba Qwen3-TTS-Flash — síntese de voz de baixa latência com 17 vozes integradas expressivas, cobrindo chinês, inglês, alemão, italiano, português, espanhol, japonês, coreano, francês e russo, além de um modo automático para textos que misturam idiomas e de saída em dialeto. Aceita até 512 tokens de texto por requisição e oferece suporte à síntese em streaming e fora dele.
wan2.7-i2v阿里巴巴$0.080por segundoAlibaba Wan 2.7 Image-to-Video — cobre a geração a partir do primeiro quadro, as transições entre primeiro e último quadro e a continuação de um clipe existente. Produz 720P ou 1080P (1080P por padrão) de 2 a 15 segundos, 5 s por padrão, a partir de prompts de até 5.000 caracteres (prompts negativos de até 500). Uma faixa mp3 ou wav de 2 a 30 segundos pode ser enviada como driving_audio; sem áudio, o modelo gera uma trilha de fundo ou efeitos sonoros condizentes, um áudio mais longo que o clipe é cortado e um áudio mais curto deixa o final em silêncio.
doubao-seedance-2-0-fast-260128字节跳动$4.2000$4.2000por 1M tokensByteDance Seedance 2.0 Fast — geração de vídeo econômica que traz o conjunto completo de recursos do Seedance 2.0, mas limitada a 480p e 720p, 24 fps, 4 a 15 segundos. Cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. 480p 5 s ≈ $0,26.
qwen3.7-plus阿里巴巴$0.3400$1.3600por 1M tokensAlibaba Qwen3.7-Plus — modelo de agente híbrido multimodal que percebe cenas do mundo real, lê telas e opera interfaces gráficas, gera código a partir de referências visuais e faz navegação de ponta a ponta dentro de aplicativos móveis. Janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 131.072 tokens de saída e um orçamento de 262.144 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto; oferece suporte a chamada de funções, saídas estruturadas e cache de contexto.
deepseek-v4-proDeepSeekCobrança escalonada, consulte a página de preçosDeepSeek V4 Pro 0813 — the higher-capability DeepSeek V4 tier for coding, reasoning, and agentic work, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
gemini-3.5-flashGoogleCobrança escalonada, consulte a página de preçosGoogle Gemini 3.5 Flash — modelo multimodal estável otimizado para desempenho sustentado de agentes, ciclos rápidos de programação, uso de subagentes e fluxos de trabalho de várias etapas e longa execução. Ele aceita texto, imagens, vídeo, áudio e PDFs, oferece suporte a thinking e ferramentas integradas, e fornece contexto de entrada de 1.048.576 tokens com até 65.536 tokens de saída.
wan2.7-image-pro阿里巴巴$0.064por requisiçãoAlibaba Wan 2.7 Image Pro — o nível profissional da linha de imagem Wan 2.7, cobrindo texto para imagem, conjuntos sequenciais de imagens, edição de imagens e geração com várias imagens de referência, com melhor aderência ao prompt. O texto para imagem chega a 4K (4096x4096), com níveis de 1K e 2K e tamanhos personalizados a partir de 768x768; os modos de edição e sequencial ficam limitados a 2K. Aceita até 9 imagens de referência (JPEG, JPG, PNG, BMP, WEBP; 240 a 8.000 px por lado, 20 MB cada), proporções de 1:8 a 8:1 e prompts de até 5.000 caracteres. Retorna PNG.
claude-haiku-4-5AnthropicCobrança escalonada, consulte a página de preçosAnthropic Claude Haiku 4.5 — the fastest Claude model with near-frontier intelligence, built for high-volume, latency-sensitive work such as classification, extraction, and routing. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens.
happyhorse-1.1-r2v阿里巴巴$0.091por segundoAlibaba HappyHorse 1.1 (R2V) — geração de vídeo a partir de referências, com até 9 imagens de referência, forte consistência de sujeito, cena e estilo, e controle de câmera. 720P/1080P.
kimi-k2.7-code-highspeedMoonshot$1.9000$8.0000por 1M tokensMoonshot Kimi K2.7 Code Highspeed — o nível de throughput do K2.7 Code, que serve o mesmo modelo a cerca de 180 tokens por segundo e até 260 em trabalhos de contexto curto. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens e vídeo como conteúdo base64 e retorna texto. O thinking é obrigatório e retorna erro se desativado; tool_choice fica limitado a auto ou none, e reasoning_content precisa ser repassado ao longo das chamadas de ferramentas em várias etapas.
qwen3.7-max阿里巴巴$1.5000$4.5000por 1M tokensAlibaba Qwen3.7-Max — carro-chefe de código fechado posicionado para programação, trabalho de escritório e produtividade, e execução autônoma de longo prazo, com janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 131.072 tokens de saída e um orçamento de 262.144 tokens para a cadeia de raciocínio. Texto na entrada, texto na saída. Oferece suporte a chamada de funções, saídas estruturadas e cache de contexto.
stepaudio-2.5-chatStepFun$1.5000$3.5000por 1M tokensStepFun StepAudio 2.5 Chat — modelo de compreensão de fala ponta a ponta: recebe áudio ou texto e devolve texto, lendo sinais paralinguísticos como hesitação e riso na própria forma de onda, e não em uma transcrição. Oferece ampla personalização de personas, abrangendo caráter, hábitos de fala e amplitude emocional. O áudio é enviado como partes de conteúdo input_audio no endpoint chat completions. Para respostas faladas, use um modelo de TTS.
wan2.7-r2v阿里巴巴$0.080por segundoAlibaba Wan2.7 (R2V) — geração de vídeo a partir de referências, com até 5 referências mistas de imagem/vídeo mais uma referência de timbre de áudio, e maior consistência de personagens, objetos de cena e cenários.
agnes-image-2.1-flashAgnes AI$0.000por requisiçãoAgnes AI Image 2.1 Flash — modelo de geração e edição de imagens focado em detalhes para cenas de alta densidade de informação, cobrindo texto para imagem, imagem para imagem e composição com várias imagens, em tamanhos e proporções flexíveis de 1K a 4K.
gemini-3-pro-imageGoogleCobrança escalonada, consulte a página de preçosGoogle gemini-3-pro-image
claude-fable-5AnthropicCobrança escalonada, consulte a página de preçosAnthropic Claude Fable 5 — o modelo mais capaz da Anthropic entre os de disponibilidade geral, para trabalho do conhecimento e programação ambiciosos e de longa duração. Ele foi construído para tarefas agênticas de vários dias, engenharia de software complexa, pesquisa aprofundada, raciocínio sobre documentos e imagens, e autoverificação proativa.
step-audio-r1.5StepFun$1.4930$15.6720por 1M tokensStepFun step-audio-r1.5 — modelo de voz ponta a ponta da mesma família do step-audio-2, com o mesmo preço de entrada e uma saída cobrada 50% mais cara. A StepFun não publica uma página de recursos separada para este modelo; consulte a documentação de áudio da plataforma para conhecer o conjunto de parâmetros vigente.
agnes-video-v2.0Agnes AI$0.000por segundoAgnes AI Video V2.0 — modelo assíncrono de geração de vídeo para texto para vídeo, imagem para vídeo, quadros-chave a partir de várias imagens e movimentos cinematográficos, com níveis de saída normalizados em 480p, 720p e 1080p.
kimi-k2.6Moonshot$0.7600$3.1570por 1M tokensMoonshot Kimi K2.6 — modelo de uso geral para diálogo, geração de código, compreensão visual e tarefas de agentes, com escrita de código de longa duração e execução autônoma mais fortes que na geração anterior. Janela de contexto de 256K, 32.768 tokens de saída por padrão. Aceita texto, imagens (png, jpeg, webp, gif) e vídeo (mp4, mov, webm e outros) como conteúdo base64 e retorna texto. O modo de raciocínio vem ligado por padrão e pode ser desativado; a temperatura é fixa em 1.0 com raciocínio e 0.6 sem ele.
kling-v3快手$0.420por requisiçãoKuaishou Kling 3.0 — texto para vídeo e imagem para vídeo com áudio nativo e melhor consistência dos elementos. Os clipes duram de 3 a 15 segundos (5 por padrão) em 16:9, 9:16 ou 1:1, com o nível escolhido por mode: std para 720P, pro para 1080P e 4k para 4K nativo. O áudio é opcional e precisa ser ligado com sound=on, vindo desligado por padrão; imagem para vídeo usa um primeiro quadro com um quadro final opcional. A partir de $0,083/s (720p).
stepaudio-2.5-ttsStepFun$0.8500por 10 mil caracteresStepFun StepAudio 2.5 TTS — síntese de voz contextual que leva a compreensão por todo o pipeline de geração, em vez de tratar a entonação como pós-processamento. Voz, emoção e ritmo são dirigidos em linguagem natural em dois níveis: um contexto global para a requisição e um contexto em linha para trechos específicos. A clonagem de voz zero-shot exige cerca de 3 segundos de áudio de referência e herda todo o conjunto de controles contextuais. Aceita até 1000 caracteres por requisição; gera wav, mp3, flac ou opus.
glm-asr-2512智谱$0.1440por hora de áudioZhipu GLM-ASR-2512 — modelo de reconhecimento de voz que reporta uma taxa de erro de caracteres de 0,0717. Cobre o mandarim junto com o sichuanês, o cantonês, o min nan e o wu, os sotaques do inglês americano e britânico, e dezenas de outros idiomas, entre eles francês, alemão, japonês, coreano, espanhol e árabe. Lida com fala que mistura idiomas, jargão técnico e registro coloquial, e aceita um dicionário personalizado para vocabulário de domínio. O áudio é limitado a 30 segundos e 25 MB por requisição, com transcrição em lote e em streaming.
gpt-5.6-lunaOpenAICobrança escalonada, consulte a página de preçosOpenAI GPT-5.6 Luna — o nível mais rápido e acessível do GPT-5.6, otimizado para cargas de trabalho de alto volume e sensíveis a custo, sem abrir mão de raciocínio, visão e uso de ferramentas. Aceita entrada de texto e imagem, janela de contexto de 1.050.000 tokens e até 128.000 tokens de saída.
qwen3.6-flash阿里巴巴$0.2500$1.5000por 1M tokensAlibaba Qwen3.6-Flash — modelo rápido de visão e linguagem que o fornecedor destaca para programação agêntica e para inteligência espacial, com ganhos marcantes em localização e detecção de objetos. Janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 65.536 tokens de saída e um orçamento de 131.072 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto. Oferece suporte a chamada de funções e cache de contexto.
qwen3.6-plus阿里巴巴$0.4000$2.4000por 1M tokensAlibaba Qwen3.6-Plus — modelo equilibrado para raciocínio geral e uso de ferramentas, com janela de contexto de 1.000.000 tokens (991.808 tokens de entrada no máximo, 983.616 no modo de raciocínio), até 65.536 tokens de saída e um orçamento de 81.920 tokens para a cadeia de raciocínio. Aceita texto, imagem e vídeo na entrada e retorna texto. Oferece suporte a chamada de funções, saídas estruturadas, pesquisa na web, complementação de prefixo e cache de contexto.
glm-5-turbo智谱$1.2000$4.0000por 1M tokensZhipu GLM-5-Turbo — a variante do GLM-5 voltada a throughput, otimizada para fluxos de trabalho de agentes: invocação de ferramentas e habilidades mais estável ao longo de tarefas de várias etapas, melhor tratamento de instruções longas e encadeadas, e execução de tarefas agendadas ou de longa duração. Janela de contexto de 200K, até 128K tokens de saída, texto na entrada e texto na saída. Oferece suporte a modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP.
wan3.0-video阿里巴巴$0.089por segundoAlibaba Wan3.0 (Video) — an all-in-one video model that unifies text-to-video, image-to-video and reference-to-video behind a single endpoint. Generates H.264 MP4 at 480P, 720P or 1080P, up to 30 seconds, from a prompt and an optional first-frame image URL. Billed per second of generated video against the vendor's own ladder: 720P is the base rate, 480P is charged at half of it and 1080P at double. A request that does not name a resolution is produced at 1080P by the model and is charged at that tier. Reference video and reference audio inputs exist in the vendor's model but are not carried on this endpoint.
doubao-seedance-2-5-260628字节跳动$10.7000$10.7000por 1M tokensByteDance Seedance 2.5 — o modelo principal da linha Seedance, que estende uma única geração para 4 a 30 segundos a 24 fps, mantendo a resolução limitada a 480p e 720p. A geração multimodal por referência chega a 1-30 imagens, até 10 vídeos de referência e até 10 trechos de áudio de referência (30 segundos no total para cada categoria) e, ao contrário da linha 2.0, uma referência de áudio pode ser usada sozinha. Ele também cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16.
claude-sonnet-4-6AnthropicCobrança escalonada, consulte a página de preçosAnthropic Claude Sonnet 4.6 — the balanced Sonnet generation, offering a 1,000,000-token context window at standard pricing with up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer, so the same text yields roughly 30% fewer tokens than on 4.7-and-later models at the same per-token rate.
doubao-seedance-2-0-260128字节跳动$7.0000$7.0000por 1M tokensByteDance Seedance 2.0 — o carro-chefe da linha Seedance 2.0 e seu único integrante que chega a 1080p e 4K (profundidade de 10 bits) além de 480p e 720p, a 24 fps e de 4 a 15 segundos. Cobre texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16, com o quadro final disponível como imagem. Cobrado pela resolução de saída.
stepaudio-2.5-asrStepFun$0.0220por hora de áudioStepFun StepAudio 2.5 ASR — modelo de reconhecimento de voz com 4B de parâmetros construído sobre Multi-Token Prediction, que transcreve cinco minutos de áudio em cerca de um segundo (RTF em torno de 0,0053). Otimizado para chinês e inglês. Inclui normalização inversa de texto, identificação de locutores e separação de dois canais para gravações de chamadas e reuniões. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada.
stepaudio-2.5-asr-streamStepFun$0.1800por hora de áudioStepFun StepAudio 2.5 ASR — 4B-parameter speech recognition model built on Multi-Token Prediction, transcribing five minutes of audio in about one second (RTF around 0.0053). Optimized for Chinese and English. Includes inverse text normalization, speaker identification, and dual-channel separation for call and meeting recordings. Accepts ogg, mp3, and wav uploads; transcript output is not billed.
doubao-seedance-2-0-mini-260615字节跳动$1.4000$1.4000por 1M tokensByteDance Seedance 2.0 Mini — o nível leve e de baixo custo da linha Seedance 2.0, limitado a 480p e 720p, 24 fps, 4 a 15 segundos. Traz o mesmo conjunto de recursos documentado do restante da linha: texto para vídeo, imagem para vídeo a partir do primeiro quadro e do primeiro-e-último quadro, geração multimodal por referência com 1 a 9 imagens e até 3 vídeos de referência somando 15 segundos, edição de vídeo, extensão de vídeo, geração com áudio e uma ferramenta de busca na web; uma referência de áudio precisa acompanhar uma imagem ou um vídeo. Retorna MP4 em 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16.
step-tts-2StepFun$0.4000por 10 mil caracteresStepFun step-tts-2 — síntese de voz ponta a ponta baseada em NTP, feita para reproduzir sotaques com precisão. Fala chinês, inglês, mistura de chinês e inglês e japonês, além de cantonês e sichuanês. A emoção e a entonação são dirigidas por rótulos em linguagem natural, e a clonagem de voz zero-shot exige cerca de 10 segundos de áudio de referência, com os controles de emoção e estilo se transferindo para a voz clonada sem custo adicional. Gera wav, mp3, flac, opus ou pcm.
claude-opus-4-6AnthropicCobrança escalonada, consulte a página de preçosAnthropic Claude Opus 4.6 — the Opus generation for complex reasoning and agentic work, with a 1,000,000-token context window at standard pricing and up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer.
MiniMax-H3MiniMax$0.080por segundoMiniMax H3 (Hailuo 3.0) — modelo de vídeo multimodal de uso geral, aberto e de nova geração, que produz áudio estéreo nativo em uma única passagem, em 768P ou 2K, com 4 a 15 segundos (apenas números inteiros), a 24 fps. Ele cobre texto para vídeo, imagem para vídeo a partir de um primeiro e/ou último quadro, e geração por referência a partir de imagens, vídeos ou áudio para personagem, movimento, câmera, estilo, voz ou ritmo de montagem; imagem para vídeo e geração por referência não podem ser combinadas na mesma requisição. Ele aceita vídeo H.264/H.265, imagens JPG, JPEG, PNG, WEBP, HEIC e HEIF, e áudio WAV ou MP3, com prompts de até 7.000 caracteres. $0,08/s em 768P e $0,13/s em 2K.
step-1o-turbo-visionStepFun$0.3850$1.2330por 1M tokensStepFun step-1o-turbo-vision — compreensão de imagens e vídeos com geração rápida de texto, contexto de 32K. Aceita texto, imagem e vídeo na entrada e retorna apenas texto. É um modelo de visão da geração anterior mantido por compatibilidade; o step-3.7-flash cobre as mesmas modalidades de entrada com contexto de 256K e profundidade de raciocínio selecionável. Mantenha as imagens abaixo de 4096 pixels no lado maior para um reconhecimento confiável.
step-asr-1.1-streamStepFun$0.3852por hora de áudioStepFun step-asr-1.1 — the updated general-purpose recognizer in the step-asr line, covering Chinese, English, and Chinese dialects. Accepts ogg, mp3, and wav uploads; transcript output is not billed.
gpt-5.4-miniOpenAICobrança escalonada, consulte a página de preçosOpenAI GPT-5.4 mini — the small GPT-5.4 model for high-volume workloads, coding, computer use, and subagents. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 400,000-token context window with a 272,000-token maximum input, and up to 128,000 output tokens.
agnes-2.5-flashAgnes AI$0.0000por 1M tokensAgnes AI Agnes 2.5 Flash — modelo de agente multimodal rápido com contexto de entrada de 512K e limite de saída de referência de 65,5K, com suporte a chat, streaming, chamada de ferramentas, programação, raciocínio, diálogo multi-turno, compreensão visual e fluxos de trabalho de agentes.
claude-opus-4-7AnthropicCobrança escalonada, consulte a página de preçosAnthropic Claude Opus 4.7 — modelo de raciocínio avançado para engenharia de software difícil e tarefas agênticas complexas de longa execução. Ele enfatiza o cumprimento rigoroso de instruções, a autoverificação, o uso confiável de ferramentas e a visão em alta resolução em interfaces, imagens, documentos e fluxos profissionais.
gemini-3.6-flashGoogleCobrança escalonada, consulte a página de preçosGoogle Gemini 3.6 Flash — a stable multimodal reasoning model that balances speed and intelligence for agentic and real-world tasks, with a 1,048,576-token input context and 65,536-token output limit. It accepts text, images, video, audio, and PDFs, and supports thinking, function calling, code execution, search grounding, structured output, and Computer Use (preview). Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity.
glm-5v-turbo智谱$1.2000$4.0000por 1M tokensZhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows.
gpt-4oOpenAICobrança escalonada, consulte a página de preçosOpenAI GPT-4o — the multimodal GPT-4 generation model, kept in the catalogue for drop-in compatibility with existing integrations that call it by name. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens.
gpt-4o-miniOpenAICobrança escalonada, consulte a página de preçosOpenAI GPT-4o mini — the small, low-cost GPT-4o variant for high-volume and latency-sensitive work. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens.
deepseek-v4-flashDeepSeekCobrança escalonada, consulte a página de preçosDeepSeek V4 Flash 0731 — the fast, high-concurrency DeepSeek V4 tier for chat, coding help, and agent loops, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
gemini-3.7-flashGoogleCobrança escalonada, consulte a página de preçosGoogle Gemini 3.7 Flash — the newest Flash-tier multimodal reasoning model, priced identically to 3.6 Flash while the vendor promotion runs. Accepts text, images, video, audio and PDFs; supports thinking, function calling, code execution, search grounding and structured output. Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity.
glm-5.2智谱$1.4000$4.4000por 1M tokensZhipu GLM-5.2 — modelo de fundação carro-chefe especializado em trabalho de agente de programação de longa duração, obtido por meses de treinamento dedicado e não apenas por uma extensão de contexto, com janela de contexto de 1M tokens e até 128K tokens de saída. Texto na entrada, texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP.
gpt-5.6-solOpenAICobrança escalonada, consulte a página de preçosOpenAI GPT-5.6 Sol — modelo carro-chefe da linha GPT-5.6 para raciocínio de fronteira, trabalho profissional complexo, programação, ciência, cibersegurança e fluxos de trabalho agênticos de longa duração. Aceita entrada de texto e imagem, ferramentas integradas, janela de contexto de 1.050.000 tokens, até 128.000 tokens de saída e os ajustes de raciocínio mais profundos da família.
mimo-v2.5-asrXiaomi$0.0740por hora de áudioModelo de reconhecimento de voz da Xiaomi MiMo otimizado para chinês e inglês, além de dialetos chineses, lidando com áudio ruidoso, captado a distância e com vários locutores, bem como com a transcrição de letras de música.
mimo-v2.5-tts-voicecloneXiaomi$0.0000por 10 mil caracteresModelo de clonagem de voz da Xiaomi MiMo: envie uma amostra de áudio de referência como data URL no campo voice (data:{mime};base64,...) e ele sintetiza a fala com essa voz, sem nenhuma etapa de treinamento, anotação ou ajuste fino. Aceita MP3 (audio/mpeg) ou WAV, com a string codificada em base64 limitada a 10 MB; a Xiaomi não publica uma duração mínima para o áudio de referência. As instruções de estilo em linguagem natural e as tags de áudio embutidas vêm do mimo-v2.5-tts, mas não há streaming — a requisição roda em modo de compatibilidade e só retorna depois que a síntese termina.
wan2.7-image阿里巴巴$0.030por requisiçãoAlibaba Wan2.7 Image — texto para imagem, edição de imagens, geração com várias imagens de referência, edição interativa, além de boa renderização de texto e aderência às instruções.
claude-opus-4-8AnthropicCobrança escalonada, consulte a página de preçosAnthropic Claude Opus 4.8 — modelo de raciocínio de alta capacidade para programação, fluxos de trabalho agênticos, análise profissional e trabalho de longa execução. Em relação ao Opus 4.7, ele melhora confiabilidade, discernimento, eficiência no uso de ferramentas, uso do computador e raciocínio multimodal sobre documentos, com suporte a uma janela de contexto de 1.000.000 tokens.
gpt-4.1-miniOpenAICobrança escalonada, consulte a página de preçosOpenAI GPT-4.1 mini — the small GPT-4.1 variant. Being non-reasoning, its prose stays more predictable than the reasoning tier at a comparable price, which suits writing and rewriting work. It takes text and image input, with a 1,047,576-token context window and up to 32,768 output tokens.
kling-v3-omni快手$0.420por requisiçãoKling 3.0 Omni — geração de vídeo com várias imagens de referência. O preço exibido é o do nível std (720p, 5 s, sem áudio, sem vídeo de referência). Requisições que não definem mode usam o nível pro, padrão do fornecedor, e são cobradas 1,33x — cerca de $0,56 pelo mesmo clipe de 5 s; o 4k é cobrado 5x. Envie mode=std para ser cobrado pelo preço exibido.
speech-2.8-turboMiniMax$0.6000por 10 mil caracteresMiniMax speech-2.8-turbo — o nível de baixa latência da linha de voz 2.8, que troca a entrega ultrarrealista do modelo HD por uma síntese mais rápida e de fluxo natural. Cobre os mesmos 40 idiomas e 7 emoções, com tom, velocidade da fala, volume, taxa de amostragem, taxa de bits e formato de saída configuráveis, e aceita até 1 milhão de caracteres de forma assíncrona ou 10.000 caracteres pela interface de streaming.
gpt-image-2OpenAICobrança escalonada, consulte a página de preçosOpenAI GPT Image 2 — a state-of-the-art image generation and editing model for fast, high-quality output. It takes text and image input, supports flexible image sizes and high-fidelity image inputs, and bills per token rather than per call: $5 text input, $1.25 cached text input, $8 image input, and $30 image output per 1M tokens.
kimi-k3Moonshot$3.0000$15.0000por 1M tokensMoonshot Kimi K3 — carro-chefe de 2,8 trilhões de parâmetros para programação de longa duração, trabalho do conhecimento de ponta a ponta e raciocínio profundo, com janela de contexto de 1M tokens e até 1.048.576 tokens de conclusão (131.072 por padrão). Aceita texto, imagens em base64 e vídeo, e retorna texto. O thinking fica sempre ativo, com reasoning_effort selecionável entre low, high ou max (max por padrão); a temperatura é fixa em 1.0. Oferece suporte a chamada de ferramentas personalizadas e ao carregamento dinâmico de ferramentas.
kling-3.0-turbo快手$0.560por requisiçãoKuaishou Kling 3.0 Turbo — o nível de custo-benefício da linha Kling 3.0, que gera 720P ou 1080P (720P por padrão) de 3 a 15 segundos (5 por padrão) em 16:9, 9:16 ou 1:1, a partir de um prompt ou de uma imagem de primeiro quadro. O áudio nativo vem sempre incluído e não tem chave para ligar ou desligar. Em relação ao kling-v3, ele abre mão do nível 4K, do controle do quadro final e da entrada de vídeo em troca de velocidade e custo. 720p 5 s com áudio ≈ $0,56.
step-3.7-flashStepFun$0.2000$1.1500por 1M tokensStepFun step-3.7-flash — sparse MoE with 198B total and 11B active parameters, native 256K context, and native understanding of images and video alongside text. Reasoning depth is selectable per request through reasoning_effort (low / medium / high), and the model supports reliable multi-step tool calling, JSON Schema structured output, streaming, and prompt caching. Tuned for agent and coding workloads. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
doubao-seed-2-1-turbo-260628字节跳动$0.4440$2.2220por 1M tokensByteDance Doubao Seed 2.1 Turbo — a via de baixa latência da linha Seed 2.1, que compartilha os limites do Pro: janela de contexto de 256K com entrada máxima de 256K, até 256K tokens de saída (4K por padrão) e um orçamento de 256K para a cadeia de raciocínio. Cobre raciocínio profundo, geração de texto, compreensão multimodal, chamada de ferramentas e saída estruturada, ainda que sem a recomendação de json_schema do Pro. Aceita texto, imagem e vídeo e retorna texto; a compreensão de áudio não é listada para a linha 2.1. Oferece suporte a cache de contexto implícito e explícito.
glm-5.3智谱$1.4000$4.4000por 1M tokensZhipu GLM-5.3 — flagship coding-and-agent model post-trained on the same base as GLM-5.2: a 50% gain on Zhipu's internal coding bench, open-source SOTA on Terminal-Bench 3.0 and Agents' Last Exam, and state-of-the-art CyberGym vulnerability-discovery results, with a 1M-token context window and up to 128K output tokens. Text in, text out. Supports multiple thinking modes, function calling, structured JSON output, streaming, context caching, and MCP tool integration.
gpt-5.2OpenAICobrança escalonada, consulte a página de preçosOpenAI GPT-5.2 — a general-purpose model from the GPT-5.2 generation, kept in the catalogue for drop-in compatibility with integrations that call it by name. It takes text and image input, with a 400,000-token context window and up to 128,000 output tokens.
happyhorse-1.1-t2v阿里巴巴$0.091por segundoAlibaba HappyHorse 1.1 (T2V) — texto para vídeo com melhor compreensão semântica, controle de câmera e geração dinâmica. Vídeo 720P/1080P fluido, detalhado e fisicamente coerente.
MiniMax-Hailuo-2.3-FastMiniMax$0.190por requisiçãoMiniMax Hailuo 2.3 Fast — o nível de velocidade e custo do Hailuo 2.3, voltado a imagem para vídeo e ao realismo do movimento físico, a 24 fps, com 768p disponível em clipes de 6 ou 10 segundos e 1080p em 6 segundos. 768p 6 s = $0,19.
qwen3-asr-flash阿里巴巴$0.1260por hora de áudioAlibaba Qwen3-ASR-Flash — reconhecimento de voz construído sobre o modelo de fundação Qwen3, que identifica sozinho o idioma falado e transcreve 11 idiomas; a linha Qwen3-ASR documenta o mandarim junto com o sichuanês, o min nan, o wu e o cantonês, além de vários sotaques do inglês. Aceita aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma e wmv com até 5 minutos e 10 MB por requisição; a entrada pcm precisa estar em 16 kHz e os demais formatos são reamostrados para 16 kHz antes do reconhecimento.
claude-opus-5AnthropicCobrança escalonada, consulte a página de preçosAnthropic Claude Opus 5 — modelo de raciocínio profundo para programação agêntica complexa e trabalho corporativo, com ganhos expressivos em tarefas de longa duração, revisão de código, fluxos documentais, visão e coordenação entre múltiplos agentes. Tem janela de contexto de 1.000.000 tokens, aceita até 128.000 tokens de saída e ativa o thinking adaptativo por padrão.
gemini-2.5-flash-imageGoogleCobrança escalonada, consulte a página de preçosGoogle Gemini 2.5 Flash Image (Nano Banana) — a fast native image generation and editing model for creative workflows. It takes text and image input and returns images through the OpenAI-compatible chat completions endpoint, with a 65,536-token input limit and 32,768-token output limit.
qwen3.8-max阿里巴巴$1.9000$5.7000por 1M tokensAlibaba Qwen3.8-Max — 2.4-trillion-parameter MoE flagship and the most capable model in the Qwen family, with the vendor citing major gains in coding and office productivity. 1,000,000-token context window (991,808 max input, 983,616 in thinking mode), up to 131,072 output tokens, and a 262,144-token chain-of-thought budget. Accepts text input and returns text (image/video input is not available on the current serving route); supports function calling, structured outputs, and context caching.
step-asrStepFun$0.1444por hora de áudioStepFun step-asr — reconhecimento de voz de uso geral cobrindo chinês, inglês e dialetos chineses, para transcrição, atas de reunião, avaliação de qualidade de chamadas e busca por voz. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada.
agnes-image-2.0-flashAgnes AI$0.000por requisiçãoAgnes AI Image 2.0 Flash — modelo rápido de geração e edição de imagens para texto para imagem, imagem para imagem e composição com várias imagens, com os resultados disponíveis como URL ou dados Base64.
mimo-v2.5-proXiaomi$0.4350$0.8700por 1M tokensXiaomi MiMo-V2.5-Pro — carro-chefe de um trilhão de parâmetros (42B ativos), contexto de 1M e saída máxima de 128K, ajustado para cargas de trabalho de agentes de alta intensidade. Oferece suporte a raciocínio profundo, chamada de funções, saída estruturada e pesquisa na web. Apenas geração de texto: ao contrário do mimo-v2.5, a lista de recursos do fornecedor não inclui a compreensão de todas as modalidades.
mimo-v2.5-tts-voicedesignXiaomi$0.0000por 10 mil caracteresModelo de design de voz da Xiaomi MiMo: descreva em linguagem natural a voz desejada no campo instructions e ele sintetiza a fala com essa voz projetada.
step-3.5-flash-2603StepFun$0.1000$0.3000por 1M tokensStepFun step-3.5-flash-2603 — instantâneo de 256K do step-3.5-flash ajustado para agentes, otimizado para eficiência de tokens e um modo de operação com pouca inferência. Seu parâmetro reasoning_effort aceita apenas low e high, enquanto o modelo base aceita três níveis, portanto o código que envia medium precisa ser adaptado. Somente texto; oferece suporte a chamada de ferramentas, saída estruturada por JSON Schema, streaming e cache de prompts.
doubao-seedream-5-0-260128字节跳动$0.033por requisiçãoByteDance Doubao Seedream 5.0-lite — texto para imagem e imagem para imagem, com criação controlável mais inteligente, recuperação em tempo real e maior consistência de sujeito (resolução de 2K ou mais).
glm-5智谱$1.0000$3.2000por 1M tokensZhipu GLM-5 — MoE de 744B parâmetros com 40B ativos, treinado em 28,5T tokens e usando DeepSeek Sparse Attention, com janela de contexto de 200K e até 128K tokens de saída. Texto na entrada, texto na saída. Oferece suporte a vários modos de raciocínio, chamada de funções, saída JSON estruturada, streaming, cache de contexto e integração de ferramentas MCP.
LongCat-2.0Meituan$0.3000$1.2000por 1M tokensMeituan LongCat-2.0 — modelo MoE aberto de 1,6T de parâmetros com contexto nativo de 1M, feito para programação agêntica e uso de ferramentas de longa duração. Modelo de raciocínio somente texto.
wan2.7-t2v阿里巴巴$0.080por segundoAlibaba Wan2.7 (T2V) — texto para vídeo com atuação aprimorada, emoções sutis, ação intensa e cortes de câmera dramáticos. Produz MP4 H.264 em 720P ou 1080P, de 2 a 15 segundos (5 s por padrão), em 16:9, 9:16, 1:1, 4:3 ou 3:4, a partir de prompts de até 5.000 caracteres. O áudio vem incluído por padrão: sem audio_url, o modelo compõe uma trilha de fundo ou efeitos sonoros condizentes, ou é possível enviar no lugar uma faixa wav ou mp3 de 2 a 30 segundos.
claude-sonnet-5AnthropicCobrança escalonada, consulte a página de preçosAnthropic Claude Sonnet 5 — modelo de produção que equilibra inteligência de fronteira e velocidade para programação, agentes e fluxos de trabalho corporativos. Ele planeja, usa ferramentas de navegador e terminal e trabalha de forma autônoma em tarefas de raciocínio, trabalho do conhecimento e engenharia de software.
gemini-3.1-flash-lite-imageGoogleCobrança escalonada, consulte a página de preçosGoogle Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — modelo de latência ultrabaixa e bom custo-benefício para geração de imagens em alto volume e edições rápidas em vários turnos. Ele aceita texto e imagens, produz imagens em 1K, oferece suporte a thinking e edição por conversa, e foi projetado para aplicações interativas de desenvolvedores e do consumidor final.
stepaudio-2-asr-proStepFun$0.3370por hora de áudioStepFun StepAudio 2 ASR Pro — modelo de reconhecimento de voz com 32B de parâmetros, a opção que prioriza precisão na linha ASR da StepFun, enquanto o stepaudio-2.5-asr prioriza velocidade e custo. Aceita envios em ogg, mp3 e wav; a transcrição gerada não é cobrada.
agnes-2.0-flashAgnes AI$0.0000por 1M tokensAgnes AI Agnes 2.0 Flash — modelo de agente multimodal rápido com contexto de entrada de 256K e limite de saída de referência de 64K, com suporte a chat, streaming, chamada de ferramentas, programação, raciocínio, compreensão visual e fluxos de trabalho de agentes.
gemini-2.5-proGoogleCobrança escalonada, consulte a página de preçosGoogle Gemini 2.5 Pro — the reasoning-tier model of the 2.5 family, with a 1M-token context window. Prompts above 200,000 tokens are repriced at the vendor's long-context rate for the whole request, matching Google's own rule.
glm-tts智谱$0.2963por 10 mil caracteresZhipu GLM-TTS — síntese de voz construída sobre uma arquitetura de geração em duas etapas com aprendizado por reforço GRPO, que infere emoção e entonação do texto ao redor em vez de exigir marcação explícita. Traz sete vozes integradas (tongtong por padrão, xiaochen, chuichui, jam, kazi, douji, luodo) com velocidade e volume ajustáveis, aceita até 1.024 caracteres por requisição e transmite com latência de primeiro quadro abaixo de 400 ms. Retorna wav ou pcm a uma taxa de amostragem recomendada de 24 kHz; o streaming é apenas em pcm.
gpt-5.6-terraOpenAICobrança escalonada, consulte a página de preçosOpenAI GPT-5.6 Terra — modelo GPT-5.6 equilibrado para o trabalho profissional do dia a dia, com alta inteligência e bom desempenho como agente de programação a um custo menor que o Sol. Aceita entrada de texto e imagem, ferramentas integradas, janela de contexto de 1.050.000 tokens e até 128.000 tokens de saída.
step-audio-2StepFun$1.4930$10.4480por 1M tokensStepFun step-audio-2 — modelo de voz ponta a ponta que consome o áudio diretamente, em vez de partir de uma transcrição, de modo que o tom e a entonação chegam íntegros à compreensão do modelo. Cobrado por token, com o preço de entrada da linha StepAudio 2.5 e um preço de saída mais alto. A StepFun não publica uma página de recursos separada para este modelo; consulte a documentação de áudio da plataforma para conhecer o conjunto de parâmetros vigente.
step-image-edit-2StepFun$0.003por requisiçãoStepFun Step Image Edit 2 — modelo unificado de geração de imagens a partir de texto e de edição de imagens com menos de 6B de parâmetros, no nível dos editores de pesos abertos na faixa de 12B a 20B. Ele conclui uma edição em um a dois segundos e foi feito para retoques interativos de baixa latência. Suporta 256x256, 512x512, 768x768, 1024x1024, 1280x800 e 800x1280, além de prompts negativos e um modo de otimização de texto; uma imagem por requisição. Servido pelo endpoint images compatível com OpenAI.
claude-opus-4-5AnthropicCobrança escalonada, consulte a página de preçosAnthropic Claude Opus 4.5 — a pinned dated snapshot of the Opus 4.5 release for workloads that need byte-stable behaviour. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens.
step-3.5-flashStepFun$0.1000$0.3000por 1M tokensStepFun step-3.5-flash — modelo de raciocínio somente texto com contexto de 256K, voltado a lógica, matemática, engenharia de software e pesquisa aprofundada, onde a qualidade do raciocínio precisa vir acompanhada de execução rápida e confiável. A profundidade do raciocínio é escolhida por requisição via reasoning_effort (low / medium / high). Oferece suporte a chamada de ferramentas, saída estruturada por JSON Schema, streaming e cache de prompts. Para entrada de imagem ou vídeo, use o step-3.7-flash.