Tarifs des modèles d'IA chinois
ChinaAPI donne accès à DeepSeek, Qwen, GLM, Kimi et aux autres modèles d'IA chinois via une passerelle compatible OpenAI à l'adresse https://api.chinaapi.ai/v1. Tous les tarifs sont en dollars américains, exprimés dans l'unité utilisée par le fournisseur en amont. La même liste est disponible en JSON à l'adresse /api/pricing.
| Modèle | Fournisseur | Entrée | Sortie | Unité | Description |
|---|---|---|---|---|---|
| claude-sonnet-4-5 | Anthropic | Facturation par paliers, voir la page des tarifs | Anthropic Claude Sonnet 4.5 — a pinned dated snapshot of the Sonnet 4.5 release, kept available for workloads that need byte-stable behaviour across runs. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| glm-5.2 | 智谱 | $1.4000 | $4.4000 | par 1M tokens | Zhipu GLM-5.2 — modèle de fondation phare spécialisé dans le travail d'agent de programmation de longue haleine, obtenu par des mois d'entraînement dédié et non par une simple extension de contexte, avec une fenêtre de contexte de 1M tokens et jusqu'à 128K tokens de sortie. Texte en entrée, texte en sortie. Il prend en charge plusieurs modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP. |
| gpt-5.6-luna | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT-5.6 Luna — palier le plus rapide et le plus abordable de GPT-5.6, optimisé pour les charges de travail à fort volume et sensibles au coût tout en conservant le raisonnement, la vision et l'usage d'outils. Il accepte le texte et l'image en entrée, une fenêtre de contexte de 1 050 000 tokens et jusqu'à 128 000 tokens de sortie. | ||
| step-asr | StepFun | $0.1444 | par heure audio | StepFun step-asr — reconnaissance vocale généraliste couvrant le chinois, l'anglais et les dialectes chinois, pour la transcription, les comptes rendus de réunion, le contrôle qualité des appels et la recherche vocale. Accepte les fichiers ogg, mp3 et wav ; la transcription produite n'est pas facturée. | |
| step-audio-2 | StepFun | $1.4930 | $10.4480 | par 1M tokens | StepFun step-audio-2 — modèle vocal de bout en bout qui consomme directement l'audio au lieu de partir d'une transcription, de sorte que le ton et l'intonation parviennent jusqu'à la compréhension du modèle. Facturé au token, avec le tarif d'entrée de la gamme StepAudio 2.5 et un tarif de sortie plus élevé. StepFun ne publie pas de page de capacités distincte pour ce modèle ; consultez la documentation audio de la plateforme pour connaître les paramètres en vigueur. |
| gemini-2.5-flash | Facturation par paliers, voir la page des tarifs | Google Gemini 2.5 Flash — a fast, low-cost multimodal model with a 1M-token context window. Accepts text, images, video and audio; audio input is billed at the vendor's separate audio rate. | |||
| claude-sonnet-4-6 | Anthropic | Facturation par paliers, voir la page des tarifs | Anthropic Claude Sonnet 4.6 — the balanced Sonnet generation, offering a 1,000,000-token context window at standard pricing with up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer, so the same text yields roughly 30% fewer tokens than on 4.7-and-later models at the same per-token rate. | ||
| agnes-image-2.1-flash | Agnes AI | $0.000 | par requête | Agnes AI Image 2.1 Flash — modèle de génération et d'édition d'images axé sur le détail pour les scènes à forte densité d'information, couvrant le texte vers image, l'image vers image et la composition multi-images, avec des tailles et des rapports d'aspect flexibles de 1K à 4K. | |
| claude-fable-5 | Anthropic | Facturation par paliers, voir la page des tarifs | Anthropic Claude Fable 5 — le modèle le plus performant d'Anthropic parmi ceux disponibles au grand public, pour le travail du savoir et la programmation ambitieux et de longue haleine. Il est conçu pour les tâches agentiques s'étalant sur plusieurs jours, l'ingénierie logicielle complexe, la recherche approfondie, le raisonnement sur documents et images, et l'autovérification proactive. | ||
| claude-haiku-4-5 | Anthropic | Facturation par paliers, voir la page des tarifs | Anthropic Claude Haiku 4.5 — the fastest Claude model with near-frontier intelligence, built for high-volume, latency-sensitive work such as classification, extraction, and routing. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| happyhorse-1.1-i2v | 阿里巴巴 | $0.091 | par seconde | Alibaba HappyHorse 1.1 (I2V) — image vers vidéo avec une meilleure matière, une cohérence d'identité d'un plan à l'autre, une fluidité de mouvement accrue et une synchronisation audio-vidéo. 720P/1080P. | |
| MiniMax-M2.7 | MiniMax | $0.3000 | $1.2000 | par 1M tokens | MiniMax M2.7 — modèle texte pour le chat, la programmation, le travail de bureau et les tâches agentiques, avec une fenêtre de contexte de 204 800 tokens et une sortie à environ 60 tokens par seconde. Texte uniquement : l'API accepte des blocs de contenu texte et appel d'outil, mais ni images ni vidéo. Il prend en charge l'appel d'outils ; la réflexion est toujours active et ne peut pas être désactivée. |
| gpt-4.1-mini | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT-4.1 mini — the small GPT-4.1 variant. Being non-reasoning, its prose stays more predictable than the reasoning tier at a comparable price, which suits writing and rewriting work. It takes text and image input, with a 1,047,576-token context window and up to 32,768 output tokens. | ||
| kimi-k2.7-code | Moonshot | $0.7600 | $3.1570 | par 1M tokens | Moonshot Kimi K2.7 Code — le modèle dédié à la programmation de Kimi, dont le fournisseur mesure qu'il améliore le respect des instructions et la programmation de longue haleine par rapport à K2.6 tout en réduisant la sur-réflexion d'environ 30 % en moyenne. Fenêtre de contexte de 256K, 32 768 tokens de sortie par défaut. Il accepte le texte, les images et la vidéo sous forme de contenu base64 et renvoie du texte. La réflexion est obligatoire et renvoie une erreur si elle est désactivée ; tool_choice est limité à auto ou none, et reasoning_content doit être transmis d'un appel d'outil à l'autre. |
| kling-3.0-turbo | 快手 | $0.560 | par requête | Kuaishou Kling 3.0 Turbo — le palier économique de la gamme Kling 3.0, qui génère du 720P ou du 1080P (720P par défaut) sur 3 à 15 secondes (5 par défaut) en 16:9, 9:16 ou 1:1, à partir d'un prompt ou d'une première image. L'audio natif est toujours inclus et ne dispose d'aucun interrupteur. Face à kling-v3, il abandonne le palier 4K, le contrôle de l'image de fin et l'entrée vidéo en échange de vitesse et de coût. 720p 5 s avec audio ≈ $0,56. | |
| mimo-v2.5-tts | Xiaomi | $0.0000 | par 10 k caractères | Xiaomi MiMo v2.5 TTS — synthèse vocale expressive avec huit voix intégrées, quatre chinoises et quatre anglaises (Mia, Chloe, Milo, Dean), couvrant le chinois et l'anglais ainsi que les styles dialectaux du Nord-Est, du Sichuan, du Henan et du cantonais. L'intonation se dirige de deux façons : des instructions de style en langage naturel, et des balises audio en ligne pour les émotions simples et composées, la respiration, les soupirs et le rythme, y compris un mode chanté propre à ce modèle dans la gamme MiMo TTS. Renvoie du wav mono ou du pcm16 à 24 kHz et prend en charge le streaming à faible latence, qui exige le pcm16. Contexte de 8K et sortie maximale de 8K. | |
| step-asr-1.1 | StepFun | $0.3370 | par heure audio | StepFun step-asr-1.1 — version actualisée du modèle de reconnaissance généraliste de la gamme step-asr, couvrant le chinois, l'anglais et les dialectes chinois. Accepte les fichiers ogg, mp3 et wav ; la transcription produite n'est pas facturée. | |
| step-audio-r1.5 | StepFun | $1.4930 | $15.6720 | par 1M tokens | StepFun step-audio-r1.5 — modèle vocal de bout en bout de la même famille que step-audio-2, dont il partage le tarif d'entrée tout en facturant la sortie 50 % plus cher. StepFun ne publie pas de page de capacités distincte pour ce modèle ; consultez la documentation audio de la plateforme pour connaître les paramètres en vigueur. |
| step-image-edit-2 | StepFun | $0.003 | par requête | StepFun Step Image Edit 2 — modèle unifié de génération d'images à partir de texte et d'édition d'images, de moins de 6 milliards de paramètres, au niveau des éditeurs à poids ouverts de 12 à 20 milliards. Il réalise une édition en une à deux secondes et vise la retouche interactive à faible latence. Prend en charge les formats 256x256, 512x512, 768x768, 1024x1024, 1280x800 et 800x1280, ainsi que les prompts négatifs et un mode d'optimisation du texte ; une image par requête. Servi via l'endpoint images compatible OpenAI. | |
| wan2.7-image-pro | 阿里巴巴 | $0.064 | par requête | Alibaba Wan 2.7 Image Pro — le palier professionnel de la gamme image Wan 2.7, couvrant le texte vers image, les séries d'images, l'édition d'images et la génération à partir de plusieurs images de référence, avec un meilleur respect du prompt. Le texte vers image atteint le 4K (4096x4096), avec des paliers 1K et 2K et des tailles personnalisées à partir de 768x768 ; les modes édition et série plafonnent à 2K. Il accepte jusqu'à 9 images de référence (JPEG, JPG, PNG, BMP, WEBP ; 240 à 8000 px par côté, 20 Mo chacune), des rapports d'aspect de 1:8 à 8:1, et des prompts jusqu'à 5000 caractères. Renvoie du PNG. | |
| doubao-seedance-2-0-fast-260128 | 字节跳动 | $4.2000 | $4.2000 | par 1M tokens | ByteDance Seedance 2.0 Fast — génération vidéo économique reprenant l'ensemble des fonctionnalités de Seedance 2.0 mais plafonnée à 480p et 720p, 24 fps, 4 à 15 secondes. Elle couvre le texte vers vidéo, l'image vers vidéo depuis la première image ou depuis la première et la dernière, la génération multimodale par référence à partir de 1 à 9 images et de 3 vidéos de référence au maximum totalisant 15 secondes, le montage vidéo, l'extension de vidéo, la génération avec audio et un outil de recherche web ; une référence audio doit obligatoirement accompagner une image ou une vidéo. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. 480p 5 s ≈ $0,26. |
| claude-opus-5 | Anthropic | Facturation par paliers, voir la page des tarifs | Anthropic Claude Opus 5 — modèle de raisonnement profond pour la programmation agentique complexe et le travail en entreprise, avec des gains majeurs sur les tâches de longue haleine, la revue de code, les flux documentaires, la vision et la coordination multi-agents. Il dispose d'une fenêtre de contexte de 1 000 000 tokens, accepte jusqu'à 128 000 tokens de sortie et active la réflexion adaptative par défaut. | ||
| deepseek-v4-flash-vision-exp | DeepSeek | Facturation par paliers, voir la page des tarifs | DeepSeek V4 Flash Vision (experimental) — the V4 Flash tier with image input, priced identically to deepseek-v4-flash on every face. Images are converted to tokens by their size and billed together with text at the input rate, so there is no separate image charge. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. The vendor labels this tier experimental; behaviour and availability may change without notice. Text and images in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| doubao-seedance-2-0-260128 | 字节跳动 | $7.0000 | $7.0000 | par 1M tokens | ByteDance Seedance 2.0 — le modèle phare de la gamme Seedance 2.0 et le seul à atteindre le 1080p et le 4K (profondeur 10 bits) en plus du 480p et du 720p, à 24 fps et de 4 à 15 secondes. Il couvre le texte vers vidéo, l'image vers vidéo depuis la première image ou depuis la première et la dernière, la génération multimodale par référence à partir de 1 à 9 images et de 3 vidéos de référence au maximum totalisant 15 secondes, le montage vidéo, l'extension de vidéo, la génération avec audio et un outil de recherche web ; une référence audio doit obligatoirement accompagner une image ou une vidéo. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16, avec l'image de fin récupérable sous forme d'image. Facturé selon la résolution de sortie. |
| doubao-seedream-5-0-260128 | 字节跳动 | $0.033 | par requête | ByteDance Doubao Seedream 5.0-lite — texte vers image et image vers image, avec une création contrôlable plus fine, une recherche en temps réel et une meilleure cohérence des sujets (résolution 2K et plus). | |
| kling-v3 | 快手 | $0.420 | par requête | Kuaishou Kling 3.0 — texte vers vidéo et image vers vidéo avec audio natif et une meilleure cohérence des éléments. Les clips durent de 3 à 15 secondes (5 par défaut) en 16:9, 9:16 ou 1:1, le palier se choisissant via mode : std pour le 720P, pro pour le 1080P et 4k pour le 4K natif. L'audio s'active explicitement par sound=on et reste désactivé par défaut ; l'image vers vidéo prend une première image avec une image de fin facultative. À partir de $0,083/s (720p). | |
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | par 1M tokens | Xiaomi MiMo-V2.5-Pro — modèle phare à mille milliards de paramètres (42 milliards actifs) avec un contexte de 1M et jusqu'à 128K de sortie, ajusté pour les charges de travail d'agents intensives. Il prend en charge la réflexion approfondie, l'appel de fonctions, la sortie structurée et la recherche web. Génération de texte uniquement : contrairement à mimo-v2.5, la liste de capacités du fournisseur n'inclut pas la compréhension de toutes les modalités. |
| step-1o-turbo-vision | StepFun | $0.3850 | $1.2330 | par 1M tokens | StepFun step-1o-turbo-vision — compréhension d'images et de vidéos avec génération de texte rapide, contexte de 32K. Accepte le texte, l'image et la vidéo en entrée et ne renvoie que du texte. Modèle de vision de génération précédente conservé pour la compatibilité ; step-3.7-flash couvre les mêmes modalités d'entrée avec un contexte de 256K et une profondeur de raisonnement sélectionnable. Gardez les images sous 4096 pixels sur le grand côté pour une reconnaissance fiable. |
| wan2.7-image | 阿里巴巴 | $0.030 | par requête | Alibaba Wan2.7 Image — texte vers image, édition d'images, génération avec plusieurs images de référence, édition interactive, tracé du texte et respect des instructions solides. | |
| gemini-3.1-flash-image | Facturation par paliers, voir la page des tarifs | Google Gemini 3.1 Flash Image (Nano Banana 2) — modèle stable à faible latence pour la génération d'images de haute qualité et l'édition conversationnelle. Il accepte le texte, les images et les PDF, prend en charge la réflexion et l'ancrage par recherche, et peut produire des images en 0,5K, 1K, 2K ou 4K pour les flux de production à fort volume. | |||
| qwen3.8-max | 阿里巴巴 | $1.9000 | $5.7000 | par 1M tokens | Alibaba Qwen3.8-Max — 2.4-trillion-parameter MoE flagship and the most capable model in the Qwen family, with the vendor citing major gains in coding and office productivity. 1,000,000-token context window (991,808 max input, 983,616 in thinking mode), up to 131,072 output tokens, and a 262,144-token chain-of-thought budget. Accepts text input and returns text (image/video input is not available on the current serving route); supports function calling, structured outputs, and context caching. |
| happyhorse-1.1-t2v | 阿里巴巴 | $0.091 | par seconde | Alibaba HappyHorse 1.1 (T2V) — texte vers vidéo avec une meilleure compréhension sémantique, un meilleur contrôle de la caméra et une génération plus dynamique. Vidéo 720P/1080P fluide, détaillée et physiquement cohérente. | |
| MiniMax-M3 | MiniMax | Facturation par paliers, voir la page des tarifs | MiniMax M3 — modèle de programmation multimodal de pointe pour le raisonnement agentique, l'usage d'outils et l'exécution structurée de tâches, avec une fenêtre de contexte de 1 000 000 tokens. Il accepte le texte, des images jusqu'à 10 Mo et de la vidéo jusqu'à 50 Mo en ligne ou 512 Mo via l'API Files, et renvoie du texte. Il prend en charge l'appel d'outils, la réflexion étant optionnelle plutôt que systématique. | ||
| qwen3-tts-flash | 阿里巴巴 | $0.1100 | par 10 k caractères | Alibaba Qwen3-TTS-Flash — synthèse vocale à faible latence avec 17 voix intégrées expressives, couvrant le chinois, l'anglais, l'allemand, l'italien, le portugais, l'espagnol, le japonais, le coréen, le français et le russe, plus un mode automatique pour les textes mêlant plusieurs langues et une sortie en dialecte. Elle accepte jusqu'à 512 tokens de texte par requête et prend en charge la synthèse en streaming comme hors streaming. | |
| gpt-5.6-terra | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT-5.6 Terra — modèle GPT-5.6 équilibré pour le travail professionnel quotidien, offrant une forte intelligence et de bonnes performances d'agent de programmation à un coût inférieur à Sol. Il accepte le texte et l'image en entrée, les outils intégrés, une fenêtre de contexte de 1 050 000 tokens et jusqu'à 128 000 tokens de sortie. | ||
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | par 1M tokens | Xiaomi MiMo-V2.5 — modèle nativement multimodal intégral avec un contexte de 1M et jusqu'à 128K de sortie, comprenant images, vidéo, audio et texte dans un seul modèle. Il prend en charge la réflexion approfondie, l'appel de fonctions, la sortie structurée et la recherche web, avec des capacités d'agent sur toutes les modalités. |
| step-tts-mini | StepFun | $0.1444 | par 10 k caractères | StepFun step-tts-mini — membre économique et à faible latence de la gamme TTS de StepFun, couvrant les mêmes langues que step-tts-2 (chinois, anglais, mélange chinois-anglais et japonais, plus le cantonais et le sichuanais) avec une partie des voix intégrées. Il prend en charge les indications d'émotion et d'intonation en langage naturel ainsi que le clonage vocal zero-shot à partir d'environ 10 secondes d'audio de référence. Sorties en wav, mp3, flac, opus ou pcm. | |
| gemini-3.1-flash-lite-image | Facturation par paliers, voir la page des tarifs | Google Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — modèle à latence ultra-faible et économique pour la génération d'images à fort volume et les retouches rapides en plusieurs tours. Il accepte le texte et les images, produit des images en 1K, prend en charge la réflexion et l'édition conversationnelle, et vise les applications interactives grand public et pour développeurs. | |||
| gpt-4o | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT-4o — the multimodal GPT-4 generation model, kept in the catalogue for drop-in compatibility with existing integrations that call it by name. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| qwen3.6-plus | 阿里巴巴 | $0.4000 | $2.4000 | par 1M tokens | Alibaba Qwen3.6-Plus — modèle équilibré pour le raisonnement généraliste et l'usage d'outils, avec une fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 65 536 tokens de sortie et un budget de chaîne de raisonnement de 81 920 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte. Il prend en charge l'appel de fonctions, les sorties structurées, la recherche web, la complétion de préfixe et la mise en cache du contexte. |
| step-asr-1.1-stream | StepFun | $0.3852 | par heure audio | StepFun step-asr-1.1 — the updated general-purpose recognizer in the step-asr line, covering Chinese, English, and Chinese dialects. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| claude-opus-4-7 | Anthropic | Facturation par paliers, voir la page des tarifs | Anthropic Claude Opus 4.7 — modèle de raisonnement avancé pour l'ingénierie logicielle difficile et les tâches agentiques complexes de longue durée. Il met l'accent sur le suivi rigoureux des instructions, l'autovérification, un usage fiable des outils et une vision haute résolution des interfaces, des images, des documents et des flux professionnels. | ||
| qwen3.6-flash | 阿里巴巴 | $0.2500 | $1.5000 | par 1M tokens | Alibaba Qwen3.6-Flash — modèle vision-langage rapide que le fournisseur met en avant pour la programmation agentique et pour l'intelligence spatiale, avec des gains marqués en localisation et en détection d'objets. Fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 65 536 tokens de sortie et un budget de chaîne de raisonnement de 131 072 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte. Il prend en charge l'appel de fonctions et la mise en cache du contexte. |
| claude-sonnet-5 | Anthropic | Facturation par paliers, voir la page des tarifs | Anthropic Claude Sonnet 5 — modèle de production qui équilibre intelligence de pointe et vitesse pour la programmation, les agents et les flux de travail en entreprise. Il sait planifier, utiliser des outils de navigateur et de terminal, et travailler de façon autonome sur des tâches de raisonnement, de travail du savoir et d'ingénierie logicielle. | ||
| gemini-2.5-pro | Facturation par paliers, voir la page des tarifs | Google Gemini 2.5 Pro — the reasoning-tier model of the 2.5 family, with a 1M-token context window. Prompts above 200,000 tokens are repriced at the vendor's long-context rate for the whole request, matching Google's own rule. | |||
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | par 1M tokens | StepFun step-3.7-flash — sparse MoE with 198B total and 11B active parameters, native 256K context, and native understanding of images and video alongside text. Reasoning depth is selectable per request through reasoning_effort (low / medium / high), and the model supports reliable multi-step tool calling, JSON Schema structured output, streaming, and prompt caching. Tuned for agent and coding workloads. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| MiniMax-Hailuo-02 | MiniMax | $0.280 | par requête | MiniMax Hailuo 02 — génération vidéo économique couvrant à la fois le texte vers vidéo et l'image vers vidéo à 24 fps, le 512p et le 768p étant proposés en clips de 6 ou 10 secondes et le 1080p en 6 secondes. Le palier 512p est l'entrée de gamme de la ligne Hailuo. | |
| gemini-3.7-flash | Facturation par paliers, voir la page des tarifs | Google Gemini 3.7 Flash — the newest Flash-tier multimodal reasoning model, priced identically to 3.6 Flash while the vendor promotion runs. Accepts text, images, video, audio and PDFs; supports thinking, function calling, code execution, search grounding and structured output. Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5.1 | 智谱 | $1.4000 | $4.4000 | par 1M tokens | Zhipu GLM-5.1 — modèle de fondation phare conçu pour le travail autonome prolongé : le fournisseur documente une exécution continue et sans surveillance sur une même tâche pendant jusqu'à 8 heures, en couvrant planification, exécution, tests et optimisation itérative. Fenêtre de contexte de 200K, jusqu'à 128K tokens de sortie, texte en entrée et texte en sortie. Il prend en charge plusieurs modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP. |
| gpt-5.2 | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT-5.2 — a general-purpose model from the GPT-5.2 generation, kept in the catalogue for drop-in compatibility with integrations that call it by name. It takes text and image input, with a 400,000-token context window and up to 128,000 output tokens. | ||
| speech-2.8-turbo | MiniMax | $0.6000 | par 10 k caractères | MiniMax speech-2.8-turbo — le palier à faible latence de la gamme vocale 2.8, qui troque le rendu ultra-réaliste du modèle HD contre une synthèse plus rapide au débit naturel. Il couvre les mêmes 40 langues et 7 émotions, avec hauteur, débit de parole, volume, fréquence d'échantillonnage, débit binaire et format de sortie configurables, et accepte jusqu'à 1 million de caractères en asynchrone ou 10 000 caractères via l'interface de streaming. | |
| wan3.0-video | 阿里巴巴 | $0.089 | par seconde | Alibaba Wan3.0 (Video) — an all-in-one video model that unifies text-to-video, image-to-video and reference-to-video behind a single endpoint. Generates H.264 MP4 at 480P, 720P or 1080P, up to 30 seconds, from a prompt and an optional first-frame image URL. Billed per second of generated video against the vendor's own ladder: 720P is the base rate, 480P is charged at half of it and 1080P at double. A request that does not name a resolution is produced at 1080P by the model and is charged at that tier. Reference video and reference audio inputs exist in the vendor's model but are not carried on this endpoint. | |
| gpt-4.1 | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT-4.1 — a non-reasoning model tuned for instruction following and long-context work, with a 1,047,576-token context window and up to 32,768 output tokens. It takes text and image input, and its output is priced below the reasoning tier at the same input price. | ||
| agnes-2.0-flash | Agnes AI | $0.0000 | par 1M tokens | Agnes AI Agnes 2.0 Flash — modèle d'agent multimodal rapide doté d'un contexte d'entrée de 256K et d'une limite de sortie de référence de 64K, prenant en charge le chat, le streaming, l'appel d'outils, la programmation, le raisonnement, la compréhension visuelle et les flux de travail d'agents. | |
| agnes-image-2.0-flash | Agnes AI | $0.000 | par requête | Agnes AI Image 2.0 Flash — modèle rapide de génération et d'édition d'images pour le texte vers image, l'image vers image et la composition multi-images ; les résultats sont disponibles sous forme d'URL ou de données Base64. | |
| gpt-image-2 | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT Image 2 — a state-of-the-art image generation and editing model for fast, high-quality output. It takes text and image input, supports flexible image sizes and high-fidelity image inputs, and bills per token rather than per call: $5 text input, $1.25 cached text input, $8 image input, and $30 image output per 1M tokens. | ||
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | par 10 k caractères | Modèle de conception vocale de Xiaomi MiMo : décrivez en langage naturel la voix souhaitée via instructions, et il synthétise la parole avec cette voix conçue sur mesure. | |
| wan2.7-i2v | 阿里巴巴 | $0.080 | par seconde | Alibaba Wan 2.7 Image-to-Video — couvre la génération à partir de la première image, les transitions entre première et dernière image, et la continuation d'un clip existant. Produit du 720P ou du 1080P (1080P par défaut) de 2 à 15 secondes, 5 s par défaut, à partir de prompts jusqu'à 5000 caractères (prompts négatifs jusqu'à 500). Une piste mp3 ou wav de 2 à 30 secondes peut être fournie comme driving_audio ; sans audio, le modèle génère une musique de fond ou des effets sonores adaptés, un audio plus long que le clip est tronqué et un audio plus court laisse la fin silencieuse. | |
| doubao-seed-2-1-pro-260628 | 字节跳动 | $0.8890 | $4.4440 | par 1M tokens | ByteDance Doubao Seed 2.1 Pro — modèle d'agent phare de Doubao pour le travail en production, couvrant la réflexion approfondie, la génération de texte, la compréhension multimodale, l'appel d'outils et la sortie structurée, pour laquelle le fournisseur recommande le mode json_schema. Fenêtre de contexte de 256K avec 256K d'entrée au maximum, jusqu'à 256K tokens de sortie (4K par défaut) et un budget de chaîne de raisonnement de 256K. Il accepte le texte, l'image et la vidéo et renvoie du texte ; la compréhension audio n'est pas listée pour la gamme 2.1. Il prend en charge la mise en cache du contexte implicite comme explicite, y compris les caches de préfixe et de session. |
| gemini-3.1-flash-lite | Facturation par paliers, voir la page des tarifs | Google Gemini 3.1 Flash-Lite — modèle multimodal à faible latence et économique pour les tâches légères à haute fréquence, les flux de travail agentiques à fort volume, la traduction et l'extraction de données structurées. Il accepte le texte, les images, la vidéo, l'audio et les PDF, prend en charge la réflexion et l'usage d'outils, et offre un contexte d'entrée de 1 048 576 tokens avec jusqu'à 65 536 tokens de sortie. | |||
| gpt-5.4-mini | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT-5.4 mini — the small GPT-5.4 model for high-volume workloads, coding, computer use, and subagents. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 400,000-token context window with a 272,000-token maximum input, and up to 128,000 output tokens. | ||
| image-01 | MiniMax | $0.004 | par requête | MiniMax image-01 — génération d'images à partir de texte via l'endpoint natif image_generation de MiniMax. Facturé à l'image générée. Le fournisseur le classe parmi ses modèles historiques. | |
| kling-v3-omni | 快手 | $0.420 | par requête | Kling 3.0 Omni — génération vidéo multi-images à partir de références. Le prix affiché correspond au palier std (720p, 5 s, sans audio, sans vidéo de référence). Les requêtes qui ne fixent pas mode utilisent le palier pro par défaut en amont, facturé 1,33x — environ $0,56 pour le même clip de 5 s ; le 4k est facturé 5x. Passez mode=std pour être facturé au prix affiché. | |
| qwen3.7-max | 阿里巴巴 | $1.5000 | $4.5000 | par 1M tokens | Alibaba Qwen3.7-Max — modèle phare propriétaire positionné sur la programmation, le travail de bureau et la productivité, et l'exécution autonome de longue durée, avec une fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 131 072 tokens de sortie et un budget de chaîne de raisonnement de 262 144 tokens. Texte en entrée, texte en sortie. Il prend en charge l'appel de fonctions, les sorties structurées et la mise en cache du contexte. |
| doubao-seedream-4-5-251128 | 字节跳动 | $0.037 | par requête | ByteDance Doubao Seedream 4.5 — texte vers image et image vers image avec fusion multi-images, produisant soit une image unique, soit une série d'images liées. Le mode image unique accepte un prompt seul, une image de référence, ou 2 à 14 images de référence ; le mode série (sequential_image_generation=auto) renvoie jusqu'à 15 images à partir d'un texte, jusqu'à 14 à partir d'une seule image de référence, ou une série à partir de 2 à 14 références à condition que le total des entrées et des sorties reste inférieur ou égal à 15. Il prend en charge les sorties 2K et 4K et renvoie du JPEG par défaut, sous forme d'URL ou de base64. L'édition interactive par coordonnées est réservée à Seedream 5.0 pro. | |
| gpt-4o-mini | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT-4o mini — the small, low-cost GPT-4o variant for high-volume and latency-sensitive work. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| kimi-k3 | Moonshot | $3.0000 | $15.0000 | par 1M tokens | Moonshot Kimi K3 — modèle phare de 2 800 milliards de paramètres pour la programmation de longue haleine, le travail du savoir de bout en bout et le raisonnement profond, avec une fenêtre de contexte de 1M tokens et jusqu'à 1 048 576 tokens de complétion (131 072 par défaut). Il accepte le texte, les images en base64 et la vidéo, et renvoie du texte. La réflexion est toujours active, avec reasoning_effort au choix parmi low, high ou max (max par défaut) ; la température est fixée à 1.0. Il prend en charge l'appel d'outils personnalisés et le chargement dynamique d'outils. |
| stepaudio-2.5-tts | StepFun | $0.8500 | par 10 k caractères | StepFun StepAudio 2.5 TTS — synthèse vocale contextuelle qui fait circuler la compréhension dans toute la chaîne de génération au lieu de traiter l'intonation comme un post-traitement. La voix, l'émotion et le rythme se dirigent en langage naturel à deux niveaux : un contexte global pour la requête et un contexte en ligne pour chaque passage. Le clonage vocal zero-shot demande environ 3 secondes d'audio de référence et hérite de l'ensemble des contrôles contextuels. Accepte jusqu'à 1000 caractères par requête ; sorties en wav, mp3, flac ou opus. | |
| stepaudio-2.5-asr | StepFun | $0.0220 | par heure audio | StepFun StepAudio 2.5 ASR — modèle de reconnaissance vocale de 4 milliards de paramètres bâti sur le Multi-Token Prediction, qui transcrit cinq minutes d'audio en une seconde environ (RTF d'environ 0,0053). Optimisé pour le chinois et l'anglais. Il inclut la normalisation inverse du texte, l'identification des locuteurs et la séparation en deux canaux pour les enregistrements d'appels et de réunions. Accepte les fichiers ogg, mp3 et wav ; la transcription produite n'est pas facturée. | |
| wan2.7-t2v | 阿里巴巴 | $0.080 | par seconde | Alibaba Wan2.7 (T2V) — texte vers vidéo avec un jeu d'acteur amélioré, des émotions nuancées, de l'action intense et des coupes de caméra spectaculaires. Produit du MP4 H.264 en 720P ou 1080P, de 2 à 15 secondes (5 s par défaut), en 16:9, 9:16, 1:1, 4:3 ou 3:4, à partir de prompts jusqu'à 5000 caractères. L'audio est inclus par défaut : sans audio_url, le modèle compose une musique de fond ou des effets sonores adaptés, ou bien une piste wav ou mp3 de 2 à 30 secondes peut être fournie à la place. | |
| deepseek-v4-flash | DeepSeek | Facturation par paliers, voir la page des tarifs | DeepSeek V4 Flash 0731 — the fast, high-concurrency DeepSeek V4 tier for chat, coding help, and agent loops, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3.5-flash | Facturation par paliers, voir la page des tarifs | Google Gemini 3.5 Flash — modèle multimodal stable optimisé pour des performances d'agent soutenues, des boucles de programmation rapides, le déploiement de sous-agents et les flux de travail multi-étapes de longue durée. Il accepte le texte, les images, la vidéo, l'audio et les PDF, prend en charge la réflexion et les outils intégrés, et offre un contexte d'entrée de 1 048 576 tokens avec jusqu'à 65 536 tokens de sortie. | |||
| glm-5.3 | 智谱 | $1.4000 | $4.4000 | par 1M tokens | Zhipu GLM-5.3 — flagship coding-and-agent model post-trained on the same base as GLM-5.2: a 50% gain on Zhipu's internal coding bench, open-source SOTA on Terminal-Bench 3.0 and Agents' Last Exam, and state-of-the-art CyberGym vulnerability-discovery results, with a 1M-token context window and up to 128K output tokens. Text in, text out. Supports multiple thinking modes, function calling, structured JSON output, streaming, context caching, and MCP tool integration. |
| hy3 | Tencent | $0.1480 | $0.5930 | par 1M tokens | Tencent Hunyuan 3 (Hy3) — modèle MoE de 295 milliards de paramètres (21 milliards actifs), contexte natif de 256K, trois modes de réflexion (fast / low / deep). Solide sur les agents de programmation, la compréhension de longs documents, le contexte multi-tours et les flux de travail d'agents multi-étapes. Texte uniquement. |
| MiniMax-H3 | MiniMax | $0.080 | par seconde | MiniMax H3 (Hailuo 3.0) — modèle vidéo multimodal généraliste ouvert de nouvelle génération, produisant un audio stéréo natif en une seule passe, en 768P ou 2K, sur 4 à 15 secondes (nombres entiers uniquement), à 24 fps. Il couvre le texte vers vidéo, l'image vers vidéo à partir d'une première et/ou d'une dernière image, et la génération par référence à partir d'images, de vidéos ou d'audio pour le personnage, le mouvement, la caméra, le style, la voix ou le rythme de montage ; l'image vers vidéo et la génération par référence ne peuvent pas être combinées dans une même requête. Il accepte la vidéo H.264/H.265, les images JPG, JPEG, PNG, WEBP, HEIC et HEIF, et l'audio WAV ou MP3, avec des prompts jusqu'à 7000 caractères. $0,08/s en 768P, $0,13/s en 2K. | |
| agnes-2.5-flash | Agnes AI | $0.0000 | par 1M tokens | Agnes AI Agnes 2.5 Flash — modèle d'agent multimodal rapide doté d'un contexte d'entrée de 512K et d'une limite de sortie de référence de 65,5K, prenant en charge le chat, le streaming, l'appel d'outils, la programmation, le raisonnement, le dialogue multi-tours, la compréhension visuelle et les flux de travail d'agents. | |
| agnes-video-v2.0 | Agnes AI | $0.000 | par seconde | Agnes AI Video V2.0 — modèle de génération vidéo asynchrone pour le texte vers vidéo, l'image vers vidéo, les images clés multi-images et les mouvements cinématographiques, avec des paliers de sortie normalisés en 480p, 720p et 1080p. | |
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | par requête | MiniMax Hailuo 2.3 — texte vers vidéo et image vers vidéo que le fournisseur positionne sur le respect des instructions, à 24 fps, le 768p étant proposé en clips de 6 ou 10 secondes et le 1080p en 6 secondes. 768p 6 s = $0,28. | |
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | par 1M tokens | StepFun step-3.5-flash — modèle de raisonnement texte uniquement doté d'un contexte de 256K, destiné à la logique, aux mathématiques, à l'ingénierie logicielle et à la recherche approfondie, là où la qualité du raisonnement doit s'accompagner d'une exécution rapide et fiable. La profondeur de raisonnement se choisit requête par requête via reasoning_effort (low / medium / high). Prend en charge l'appel d'outils, la sortie structurée par JSON Schema, le streaming et la mise en cache des prompts. Pour une entrée image ou vidéo, utilisez step-3.7-flash. |
| kimi-k2.7-code-highspeed | Moonshot | $1.9000 | $8.0000 | par 1M tokens | Moonshot Kimi K2.7 Code Highspeed — le palier débit de K2.7 Code, qui sert le même modèle à environ 180 tokens par seconde et jusqu'à 260 sur les contextes courts. Fenêtre de contexte de 256K, 32 768 tokens de sortie par défaut. Il accepte le texte, les images et la vidéo sous forme de contenu base64 et renvoie du texte. La réflexion est obligatoire et renvoie une erreur si elle est désactivée ; tool_choice est limité à auto ou none, et reasoning_content doit être transmis d'un appel d'outil à l'autre. |
| deepseek-v4-pro | DeepSeek | Facturation par paliers, voir la page des tarifs | DeepSeek V4 Pro 0813 — the higher-capability DeepSeek V4 tier for coding, reasoning, and agentic work, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3-pro-image | Facturation par paliers, voir la page des tarifs | Google gemini-3-pro-image | |||
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | par 10 k caractères | Modèle de clonage vocal de Xiaomi MiMo : fournissez un échantillon audio de référence sous forme de data URL dans le champ voice (data:{mime};base64,...) et il synthétise la parole avec cette voix, sans aucune étape d'entraînement, d'annotation ou de réglage fin. Il accepte le MP3 (audio/mpeg) ou le WAV, la chaîne encodée en base64 étant plafonnée à 10 Mo ; Xiaomi ne publie aucune durée minimale pour l'audio de référence. Les instructions de style en langage naturel et les balises audio en ligne sont reprises de mimo-v2.5-tts, mais le streaming n'est pas disponible : la requête s'exécute en mode de compatibilité et ne répond qu'une fois la synthèse terminée. | |
| qwen3-asr-flash | 阿里巴巴 | $0.1260 | par heure audio | Alibaba Qwen3-ASR-Flash — reconnaissance vocale bâtie sur le modèle de fondation Qwen3, qui détermine automatiquement la langue parlée et transcrit 11 langues ; la gamme Qwen3-ASR documente le mandarin aux côtés du sichuanais, du minnan, du wu et du cantonais, ainsi que plusieurs accents anglais. Elle accepte les formats aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma et wmv, jusqu'à 5 minutes et 10 Mo par requête ; l'entrée pcm doit être en 16 kHz et les autres formats sont rééchantillonnés à 16 kHz avant la reconnaissance. | |
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | par 1M tokens | StepFun step-3.5-flash-2603 — instantané 256K de step-3.5-flash ajusté pour les agents, optimisé pour l'efficacité en tokens et un mode d'inférence réduite. Son paramètre reasoning_effort n'accepte que low et high, là où le modèle de base en accepte trois niveaux : le code qui envoie medium doit donc être adapté. Texte uniquement ; prend en charge l'appel d'outils, la sortie structurée par JSON Schema, le streaming et la mise en cache des prompts. |
| stepaudio-2-asr-pro | StepFun | $0.3370 | par heure audio | StepFun StepAudio 2 ASR Pro — modèle de reconnaissance vocale de 32 milliards de paramètres, l'option privilégiant la précision dans la gamme ASR de StepFun, là où stepaudio-2.5-asr privilégie la vitesse et le coût. Accepte les fichiers ogg, mp3 et wav ; la transcription produite n'est pas facturée. | |
| glm-5-turbo | 智谱 | $1.2000 | $4.0000 | par 1M tokens | Zhipu GLM-5-Turbo — la variante de GLM-5 orientée débit, optimisée pour les flux de travail d'agents : invocation d'outils et de compétences plus stable sur les tâches multi-étapes, meilleure gestion des instructions longues et complexes, et exécution de tâches planifiées ou de longue durée. Fenêtre de contexte de 200K, jusqu'à 128K tokens de sortie, texte en entrée et texte en sortie. Il prend en charge les modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP. |
| mimo-v2.5-asr | Xiaomi | $0.0740 | par heure audio | Modèle de reconnaissance vocale de Xiaomi MiMo optimisé pour le chinois et l'anglais ainsi que les dialectes chinois, capable de traiter des audios bruités, en champ lointain et à plusieurs locuteurs, jusqu'à la transcription de paroles de chansons. | |
| glm-tts | 智谱 | $0.2963 | par 10 k caractères | Zhipu GLM-TTS — synthèse vocale bâtie sur une architecture de génération en deux étapes avec apprentissage par renforcement GRPO, qui déduit l'émotion et l'intonation du texte environnant au lieu d'exiger un balisage explicite. Elle embarque sept voix intégrées (tongtong par défaut, xiaochen, chuichui, jam, kazi, douji, luodo) avec vitesse et volume réglables, accepte jusqu'à 1024 caractères par requête et diffuse en streaming avec une latence de première trame inférieure à 400 ms. Elle renvoie du wav ou du pcm à une fréquence d'échantillonnage recommandée de 24 kHz ; le streaming est en pcm uniquement. | |
| gpt-5.5 | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT-5.5 — modèle de raisonnement de pointe pour la programmation complexe et le travail professionnel. Il accepte le texte et l'image en entrée, l'appel de fonctions et les outils intégrés, une fenêtre de contexte de 1 050 000 tokens, jusqu'à 128 000 tokens de sortie et une intensité de raisonnement allant de none à xhigh. | ||
| deepseek-v4-flash-legacy | DeepSeek | $0.1190 | $0.2370 | par 1M tokens | DeepSeek V4 Flash (legacy tier) — a lower-priced route to the V4 Flash model family. Input and output tokens are cheaper than on deepseek-v4-flash, while cache reads are priced higher, so prompt-caching-heavy workloads are usually cheaper on deepseek-v4-flash and low-reuse workloads are cheaper here. Responses may come from an earlier V4 Flash build. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | par requête | MiniMax Hailuo 2.3 Fast — le palier vitesse et coût de Hailuo 2.3, centré sur l'image vers vidéo et sur le réalisme du mouvement physique, à 24 fps, le 768p étant proposé en clips de 6 ou 10 secondes et le 1080p en 6 secondes. 768p 6 s = $0,19. | |
| qwen3.7-plus | 阿里巴巴 | $0.3400 | $1.3600 | par 1M tokens | Alibaba Qwen3.7-Plus — modèle d'agent hybride multimodal qui perçoit les scènes du monde réel, lit les écrans et pilote les interfaces graphiques, génère du code à partir de références visuelles et effectue une navigation de bout en bout dans les applications mobiles. Fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 131 072 tokens de sortie et un budget de chaîne de raisonnement de 262 144 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte ; il prend en charge l'appel de fonctions, les sorties structurées et la mise en cache du contexte. |
| stepaudio-2.5-asr-stream | StepFun | $0.1800 | par heure audio | StepFun StepAudio 2.5 ASR — 4B-parameter speech recognition model built on Multi-Token Prediction, transcribing five minutes of audio in about one second (RTF around 0.0053). Optimized for Chinese and English. Includes inverse text normalization, speaker identification, and dual-channel separation for call and meeting recordings. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | par 1M tokens | StepFun StepAudio 2.5 Chat — modèle de compréhension vocale de bout en bout : il reçoit de l'audio ou du texte et renvoie du texte, en lisant les signaux paralinguistiques comme l'hésitation ou le rire directement dans la forme d'onde plutôt que dans une transcription. Il prend en charge une personnalisation poussée des personas, couvrant le caractère, les habitudes de parole et l'amplitude émotionnelle. L'audio se transmet sous forme de parties de contenu input_audio sur l'endpoint chat completions. Pour des réponses parlées, utilisez un modèle TTS. |
| gemini-3.6-flash | Facturation par paliers, voir la page des tarifs | Google Gemini 3.6 Flash — a stable multimodal reasoning model that balances speed and intelligence for agentic and real-world tasks, with a 1,048,576-token input context and 65,536-token output limit. It accepts text, images, video, audio, and PDFs, and supports thinking, function calling, code execution, search grounding, structured output, and Computer Use (preview). Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5 | 智谱 | $1.0000 | $3.2000 | par 1M tokens | Zhipu GLM-5 — MoE de 744 milliards de paramètres dont 40 milliards actifs, entraîné sur 28 500 milliards de tokens et utilisant DeepSeek Sparse Attention, avec une fenêtre de contexte de 200K et jusqu'à 128K tokens de sortie. Texte en entrée, texte en sortie. Il prend en charge plusieurs modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP. |
| glm-5v-turbo | 智谱 | $1.2000 | $4.0000 | par 1M tokens | Zhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows. |
| kimi-k2.6 | Moonshot | $0.7600 | $3.1570 | par 1M tokens | Moonshot Kimi K2.6 — modèle généraliste pour le dialogue, la génération de code, la compréhension visuelle et les tâches d'agents, avec une écriture de code de longue haleine et une exécution autonome plus solides que la génération précédente. Fenêtre de contexte de 256K, 32 768 tokens de sortie par défaut. Il accepte le texte, les images (png, jpeg, webp, gif) et la vidéo (mp4, mov, webm et d'autres) sous forme de contenu base64 et renvoie du texte. Le mode de réflexion est actif par défaut et peut être désactivé ; la température est fixée à 1.0 avec réflexion et à 0.6 sans. |
| step-1o-audio | StepFun | $3.7070 | $8.8980 | par 1M tokens | StepFun step-1o-audio — modèle vocal de bout en bout de génération précédente, multilingue et compatible avec l'appel d'outils, limité à 30 minutes par interaction. Largement remplacé par la gamme StepAudio 2.5 ; conservé pour les charges de travail déjà bâties sur lui. |
| glm-asr-2512 | 智谱 | $0.1440 | par heure audio | Zhipu GLM-ASR-2512 — modèle de reconnaissance vocale annonçant un taux d'erreur de caractères de 0,0717. Il couvre le mandarin ainsi que le sichuanais, le cantonais, le minnan et le wu, les accents anglais américain et britannique, et des dizaines d'autres langues dont le français, l'allemand, le japonais, le coréen, l'espagnol et l'arabe. Il traite la parole mêlant plusieurs langues, le jargon technique et le registre familier, et accepte un dictionnaire personnalisé pour le vocabulaire métier. L'audio est plafonné à 30 secondes et 25 Mo par requête, avec transcription par lot comme en streaming. | |
| gpt-5.4 | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT-5.4 — a frontier model for complex professional work and coding, priced well below GPT-5.5. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 1,050,000-token context window, and up to 128,000 output tokens. Prompts above 272,000 input tokens are repriced at 2x input and 1.5x output for the whole session. | ||
| gpt-5.6-sol | OpenAI | Facturation par paliers, voir la page des tarifs | OpenAI GPT-5.6 Sol — modèle phare de la gamme GPT-5.6 pour le raisonnement de pointe, le travail professionnel complexe, la programmation, la science, la cybersécurité et les flux de travail agentiques de longue haleine. Il accepte le texte et l'image en entrée, les outils intégrés, une fenêtre de contexte de 1 050 000 tokens, jusqu'à 128 000 tokens de sortie et les réglages de raisonnement les plus poussés de la famille. | ||
| speech-2.8-hd | MiniMax | $1.0000 | par 10 k caractères | MiniMax speech-2.8-hd — le palier haute définition de la gamme vocale 2.8, positionné sur un rendu ultra-réaliste avec balises sonores, couvrant 40 langues et 7 émotions. La hauteur, le débit de parole, le volume, la fréquence d'échantillonnage, le débit binaire et le format de sortie se configurent requête par requête, et la synthèse de textes longs accepte jusqu'à 1 million de caractères en asynchrone ou 10 000 caractères via l'interface de streaming. | |
| claude-opus-4-8 | Anthropic | Facturation par paliers, voir la page des tarifs | Anthropic Claude Opus 4.8 — modèle de raisonnement très performant pour la programmation, les flux de travail agentiques, l'analyse professionnelle et le travail de longue durée. Il améliore la fiabilité, le jugement, l'efficacité dans l'usage des outils, l'utilisation de l'ordinateur et le raisonnement documentaire multimodal par rapport à Opus 4.7, tout en prenant en charge une fenêtre de contexte de 1 000 000 tokens. | ||
| happyhorse-1.1-r2v | 阿里巴巴 | $0.091 | par seconde | Alibaba HappyHorse 1.1 (R2V) — génération vidéo à partir de références, jusqu'à 9 images de référence, forte cohérence de sujet, de scène et de style, et contrôle de la caméra. 720P/1080P. | |
| step-tts-2 | StepFun | $0.4000 | par 10 k caractères | StepFun step-tts-2 — synthèse vocale de bout en bout fondée sur NTP et conçue pour reproduire fidèlement les accents. Elle parle le chinois, l'anglais, le mélange chinois-anglais et le japonais, ainsi que le cantonais et le sichuanais. L'émotion et l'intonation se dirigent par des indications en langage naturel, et le clonage vocal zero-shot demande environ 10 secondes d'audio de référence, les contrôles d'émotion et de style se reportant sur la voix clonée sans coût supplémentaire. Sorties en wav, mp3, flac, opus ou pcm. | |
| wan2.7-r2v | 阿里巴巴 | $0.080 | par seconde | Alibaba Wan2.7 (R2V) — génération vidéo à partir de références, jusqu'à 5 références mixtes image/vidéo plus une référence de timbre audio, avec une meilleure cohérence des personnages, des accessoires et des décors. | |
| wan2.7-videoedit | 阿里巴巴 | $0.080 | par seconde | Alibaba Wan2.7 VideoEdit — montage vidéo en langage naturel, local ou global, remplacement d'éléments par image de référence, reproduction des mouvements, des effets et de la caméra. | |
| doubao-seedance-2-5-260628 | 字节跳动 | $10.7000 | $10.7000 | par 1M tokens | ByteDance Seedance 2.5 — le modèle principal de la gamme Seedance, qui étire une génération unique à 4-30 secondes à 24 fps tout en plafonnant la résolution à 480p et 720p. La génération multimodale par référence monte à 1-30 images, jusqu'à 10 vidéos de référence et jusqu'à 10 extraits audio de référence (30 secondes au total pour chaque catégorie), et contrairement à la gamme 2.0, une référence audio peut être utilisée seule. Il couvre aussi le texte vers vidéo, l'image vers vidéo depuis la première image ou depuis la première et la dernière, le montage vidéo, l'extension de vidéo, la génération avec audio et un outil de recherche web. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. |
| claude-opus-4-5 | Anthropic | Facturation par paliers, voir la page des tarifs | Anthropic Claude Opus 4.5 — a pinned dated snapshot of the Opus 4.5 release for workloads that need byte-stable behaviour. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| claude-opus-4-6 | Anthropic | Facturation par paliers, voir la page des tarifs | Anthropic Claude Opus 4.6 — the Opus generation for complex reasoning and agentic work, with a 1,000,000-token context window at standard pricing and up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer. | ||
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | par 1M tokens | Meituan LongCat-2.0 — modèle MoE ouvert de 1600 milliards de paramètres avec un contexte natif de 1M, conçu pour la programmation agentique et l'usage d'outils de longue haleine. Modèle de raisonnement texte uniquement. |
| doubao-seedance-2-0-mini-260615 | 字节跳动 | $1.4000 | $1.4000 | par 1M tokens | ByteDance Seedance 2.0 Mini — le palier léger et économique de la gamme Seedance 2.0, plafonné à 480p et 720p, 24 fps, 4 à 15 secondes. Il reprend le même ensemble de fonctionnalités documenté que le reste de la gamme : texte vers vidéo, image vers vidéo depuis la première image ou depuis la première et la dernière, génération multimodale par référence à partir de 1 à 9 images et de 3 vidéos de référence au maximum totalisant 15 secondes, montage vidéo, extension de vidéo, génération avec audio et un outil de recherche web ; une référence audio doit obligatoirement accompagner une image ou une vidéo. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. |
| gemini-2.5-flash-image | Facturation par paliers, voir la page des tarifs | Google Gemini 2.5 Flash Image (Nano Banana) — a fast native image generation and editing model for creative workflows. It takes text and image input and returns images through the OpenAI-compatible chat completions endpoint, with a 65,536-token input limit and 32,768-token output limit. | |||
| MiniMax-M2.7-highspeed | MiniMax | $0.6000 | $2.4000 | par 1M tokens | MiniMax M2.7 Highspeed — le même modèle M2.7 servi à environ 100 tokens par seconde pour la programmation à faible latence et les flux de travail d'agents, avec une fenêtre de contexte de 204 800 tokens. Texte uniquement : l'API accepte des blocs de contenu texte et appel d'outil, mais ni images ni vidéo. Il prend en charge l'appel d'outils ; la réflexion est toujours active et ne peut pas être désactivée. |
| doubao-seed-2-1-turbo-260628 | 字节跳动 | $0.4440 | $2.2220 | par 1M tokens | ByteDance Doubao Seed 2.1 Turbo — la voie à faible latence de la gamme Seed 2.1, qui partage l'enveloppe du Pro : fenêtre de contexte de 256K avec 256K d'entrée au maximum, jusqu'à 256K tokens de sortie (4K par défaut) et un budget de chaîne de raisonnement de 256K. Il couvre la réflexion approfondie, la génération de texte, la compréhension multimodale, l'appel d'outils et la sortie structurée, sans toutefois la recommandation json_schema du Pro. Il accepte le texte, l'image et la vidéo et renvoie du texte ; la compréhension audio n'est pas listée pour la gamme 2.1. Il prend en charge la mise en cache du contexte implicite comme explicite. |