Tarifs des modèles d'IA chinois
ChinaAPI donne accès à DeepSeek, Qwen, GLM, Kimi et aux autres modèles d'IA chinois via une passerelle compatible OpenAI à l'adresse https://api.chinaapi.ai/v1. Tous les tarifs sont en dollars américains, exprimés dans l'unité utilisée par le fournisseur en amont. La même liste est disponible en JSON à l'adresse /api/pricing.
60 modèles débloquent des prix Paid plus bas après votre premier rechargement : un seul rechargement, quel que soit le montant, les active pour tout le compte. Un prix Paid n'est indiqué que lorsqu'il est inférieur au prix Standard.
| Modèle | Fournisseur | Entrée | Sortie | Entrée (prix Paid) | Sortie (prix Paid) | Unité | Description |
|---|---|---|---|---|---|---|---|
| agnes-2.5-flash | Agnes AI | $0.0000 | par 1M tokens | Agnes AI Agnes 2.5 Flash — modèle d'agent multimodal rapide doté d'un contexte d'entrée de 512K et d'une limite de sortie de référence de 65,5K, prenant en charge le chat, le streaming, l'appel d'outils, la programmation, le raisonnement, le dialogue multi-tours, la compréhension visuelle et les flux de travail d'agents. | |||
| agnes-2.5-pro | Agnes AI | $0.4500 | $0.9000 | par 1M tokens | Agnes AI Agnes 2.5 Pro — la version stable commerciale du modèle de référence 2.5 Pro Alpha, un modèle de raisonnement payant doté d'un contexte d'entrée de 1M et d'une sortie maximale de 65 536 tokens, pour la programmation avancée, le raisonnement scientifique, l'analyse de contextes longs, les flux de travail d'agents et la compréhension d'images. | ||
| agnes-2.5-pro-beta | Agnes AI | $0.1000 | $0.3000 | par 1M tokens | Agnes AI Agnes 2.5 Pro Beta — le palier à bas prix de la famille Pro, facturé à son propre prix Beta, bien inférieur à celui de 2.5 Pro, un modèle de raisonnement payant partageant le même format de requête, les mêmes protocoles texte et les mêmes limites de contexte, pour la programmation avancée, le raisonnement scientifique, l'analyse de contextes longs, les flux de travail d'agents et la compréhension d'images. | ||
| agnes-3.0-flash | Agnes AI | $0.0000 | par 1M tokens | Agnes AI Agnes 3.0 Flash — le modèle de langage de nouvelle génération du fournisseur, conçu pour la programmation agentique et l'exécution de tâches pilotée par des outils, avec un contexte d'entrée de 512K et une limite de sortie de 65 536 tokens. Il accepte en entrée du texte et des images par URL, renvoie du texte, et prend en charge le streaming, l'appel de fonctions et l'orchestration d'outils en plusieurs étapes, ainsi que le suivi d'instructions sur des tâches longues. Accessible sur l'endpoint de chat compatible OpenAI, l'endpoint Responses et l'endpoint Messages compatible Anthropic. Sur l'endpoint de chat, le mode de réflexion (Thinking) s'active en définissant chat_template_kwargs.enable_thinking sur true ; lors d'une mesure du 2026-09-21, les requêtes sans ce champ n'ont renvoyé aucun token de raisonnement. Lorsque le mode Thinking est activé, les tokens de raisonnement sont comptés dans max_tokens ; dimensionnez-le donc pour couvrir à la fois le raisonnement et la réponse. | |||
| agnes-image-2.0-flash | Agnes AI | $0.000 | par requête | Agnes AI Image 2.0 Flash — modèle rapide de génération et d'édition d'images pour le texte vers image, l'image vers image et la composition multi-images ; les résultats sont disponibles sous forme d'URL ou de données Base64. | |||
| agnes-image-2.1-flash | Agnes AI | $0.000 | par requête | Agnes AI Image 2.1 Flash — modèle de génération et d'édition d'images axé sur le détail pour les scènes à forte densité d'information, couvrant le texte vers image, l'image vers image et la composition multi-images, avec des tailles et des rapports d'aspect flexibles de 1K à 4K. | |||
| agnes-image-2.5-flash | Agnes AI | $0.000 | par requête | Agnes AI Image 2.5 Flash — le modèle d'images de dernière génération, en avance sur Image 2.1 Flash pour la génération, l'édition, la composition, le rendu des détails et le respect du prompt, couvrant le texte vers image, l'image vers image et la composition multi-images, avec des tailles et des rapports d'aspect flexibles de 1K à 4K. | |||
| agnes-video-2.5 | Agnes AI | $0.025 | par seconde | Agnes AI Video 2.5 — modèle vidéo asynchrone payant générant des clips de 4 à 12 secondes en 720P, 960P ou 2K à partir de texte, d'images clés de début et de fin, ou de références image, audio et vidéo. | |||
| agnes-video-2.5-flash | Agnes AI | $0.000 | par seconde | Agnes AI Video 2.5 Flash — la variante de Video 2.5 limitée au 720P, générant des vidéos de 4 à 12 secondes à partir de texte, d'images clés de début et de fin, ou de références image et audio, avec la même API de tâches asynchrones. | |||
| claude-fable-5 | Anthropic | $10.0000 | $50.0000 | $7.0000 | $35.0000 | par 1M tokens | Anthropic Claude Fable 5 — le modèle le plus performant d'Anthropic parmi ceux disponibles au grand public, pour le travail du savoir et la programmation ambitieux et de longue haleine. Il est conçu pour les tâches agentiques s'étalant sur plusieurs jours, l'ingénierie logicielle complexe, la recherche approfondie, le raisonnement sur documents et images, et l'autovérification proactive. |
| claude-fable-5-1 | Anthropic | $10.0000 | $50.0000 | $8.0000 | $40.0000 | par 1M tokens | Anthropic Claude Fable 5.1 — le plus récent modèle phare d'Anthropic en disponibilité générale, pour le travail du savoir et la programmation ambitieux et de longue haleine. Il est conçu pour les tâches agentiques s'étalant sur plusieurs jours, l'ingénierie logicielle complexe, la recherche approfondie, le raisonnement sur documents et images, et l'autovérification proactive. Les lectures du cache sont facturées 2,5 % du tarif d'entrée — le plus bas de sa génération. |
| claude-haiku-4-5 | Anthropic | $1.0000 | $5.0000 | $0.7000 | $3.5000 | par 1M tokens | Anthropic Claude Haiku 4.5 — le modèle Claude le plus rapide, d'une intelligence proche de celle des modèles de pointe, conçu pour le travail à fort volume et sensible à la latence comme la classification, l'extraction et le routage. Il prend en charge le texte et l'image en entrée, la réflexion étendue, une fenêtre de contexte de 200 000 tokens et jusqu'à 64 000 tokens de sortie. |
| claude-haiku-5-5 | Anthropic | $0.1000 | $0.5000 | $0.0600 | $0.3000 | par 1M tokens | Anthropic Claude Haiku 5.5 — compréhension rapide et économique du texte et des images pour la classification, l’extraction, le routage et les agents. Fenêtre de 1 000 000 tokens, sortie maximale de 128 000 tokens. La réflexion adaptative utilise medium par défaut ; output_config.effort dans Messages permet de choisir low, medium, high, xhigh ou max. Réponses en streaming et appels d’outils forcés pris en charge. Au-delà de 100 000 tokens d’entrée, le tarif long contexte s’applique à toute la requête, sortie et cache compris. |
| claude-opus-4-5 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | par 1M tokens | Anthropic Claude Opus 4.5 — la version Opus 4.5, qu'Anthropic classe désormais parmi ses modèles historiques et maintient disponible, pour les charges de travail qui souhaitent rester sur cette version du modèle. Il prend en charge le texte et l'image en entrée, la réflexion étendue, une fenêtre de contexte de 200 000 tokens et jusqu'à 64 000 tokens de sortie. |
| claude-opus-4-6 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | par 1M tokens | Anthropic Claude Opus 4.6 — la génération Opus pour le raisonnement complexe et le travail agentique, avec une fenêtre de contexte de 1 000 000 tokens au tarif standard et jusqu'à 128 000 tokens de sortie. Il prend en charge le texte et l'image en entrée ainsi que la réflexion adaptative, et utilise le tokenizer antérieur à 4.7. |
| claude-opus-4-7 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | par 1M tokens | Anthropic Claude Opus 4.7 — modèle de raisonnement avancé pour l'ingénierie logicielle difficile et les tâches agentiques complexes de longue durée. Il met l'accent sur le suivi rigoureux des instructions, l'autovérification, un usage fiable des outils et une vision haute résolution des interfaces, des images, des documents et des flux professionnels. |
| claude-opus-4-8 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | par 1M tokens | Anthropic Claude Opus 4.8 — modèle de raisonnement très performant pour la programmation, les flux de travail agentiques, l'analyse professionnelle et le travail de longue durée. Il améliore la fiabilité, le jugement, l'efficacité dans l'usage des outils, l'utilisation de l'ordinateur et le raisonnement documentaire multimodal par rapport à Opus 4.7, tout en prenant en charge une fenêtre de contexte de 1 000 000 tokens. |
| claude-opus-5 | Anthropic | $5.0000 | $25.0000 | $3.0000 | $15.0000 | par 1M tokens | Anthropic Claude Opus 5 — modèle de raisonnement profond pour la programmation agentique complexe et le travail en entreprise, avec des gains majeurs sur les tâches de longue haleine, la revue de code, les flux documentaires, la vision et la coordination multi-agents. Il dispose d'une fenêtre de contexte de 1 000 000 tokens, accepte jusqu'à 128 000 tokens de sortie et active la réflexion adaptative par défaut. |
| claude-opus-5-5 | Anthropic | $4.0000 | $20.0000 | $2.4000 | $12.0000 | par 1M tokens | Anthropic Claude Opus 5.5 — conçu pour la programmation agentique et le travail intellectuel de longue haleine, à un prix inférieur à celui de Claude Opus 5. Il accepte le texte et l'image en entrée, dispose d'une fenêtre de contexte de 1 000 000 tokens et accepte jusqu'à 128 000 tokens de sortie. La réflexion adaptative est toujours active ; le paramètre effort règle la profondeur du raisonnement, medium étant la valeur par défaut. |
| claude-sonnet-4-5 | Anthropic | $3.0000 | $15.0000 | $2.1000 | $10.5000 | par 1M tokens | Anthropic Claude Sonnet 4.5 — la version Sonnet 4.5, qu'Anthropic classe désormais parmi ses modèles historiques et maintient disponible, pour les charges de travail qui souhaitent rester sur cette version du modèle. Il prend en charge le texte et l'image en entrée, la réflexion étendue, une fenêtre de contexte de 200 000 tokens et jusqu'à 64 000 tokens de sortie. |
| claude-sonnet-4-6 | Anthropic | $3.0000 | $15.0000 | $2.1000 | $10.5000 | par 1M tokens | Anthropic Claude Sonnet 4.6 — la génération Sonnet équilibrée, offrant une fenêtre de contexte de 1 000 000 tokens au tarif standard et jusqu'à 128 000 tokens de sortie. Il prend en charge le texte et l'image en entrée ainsi que la réflexion adaptative, et utilise le tokenizer antérieur à 4.7, de sorte qu'un même texte produit environ 30 % de tokens en moins que sur les modèles 4.7 et ultérieurs, au même tarif par token. |
| claude-sonnet-5 | Anthropic | $2.0000 | $10.0000 | $1.4000 | $7.0000 | par 1M tokens | Anthropic Claude Sonnet 5 — modèle de production qui équilibre intelligence de pointe et vitesse pour la programmation, les agents et les flux de travail en entreprise. Il sait planifier, utiliser des outils de navigateur et de terminal, et travailler de façon autonome sur des tâches de raisonnement, de travail du savoir et d'ingénierie logicielle. |
| claude-sonnet-5-5 | Anthropic | $2.0000 | $10.0000 | $1.2000 | $6.0000 | par 1M tokens | Anthropic Claude Sonnet 5.5 — équilibre vitesse et intelligence pour la programmation, les agents et les charges de travail en production. Il accepte le texte et l'image en entrée, dispose d'une fenêtre de contexte de 1 000 000 tokens et accepte jusqu'à 128 000 tokens de sortie. La réflexion adaptative est active par défaut et les tokens de réflexion sont facturés comme des tokens de sortie ; output_config.effort permet de choisir low, medium, high, xhigh ou max, high par défaut. Pour désactiver la réflexion préalable, envoyez thinking avec le type between_tools, qui fonctionne avec un effort high ou inférieur ; le type disabled est refusé. Régler temperature, top_p ou top_k sur une valeur autre que celle par défaut renvoie une erreur, tout comme forcer un appel d'outil avec tool_choice any ou tool. Les blocs de réflexion sont liés au modèle et à la conversation ; renvoyez-les tels quels aux tours suivants. |
| cogview-4 | Zhipu AI | $0.010 | $0.0095 | par requête | Zhipu CogView-4 — le modèle texte vers image CogView de quatrième génération, qui prend en charge plusieurs résolutions de sortie ainsi qu'un palier de service de base et un palier haute définition. Il accepte les prompts en chinois et en anglais et restitue du texte à l'intérieur de l'image. Une image par requête. | ||
| deepseek-flash | DeepSeek | $0.1500 | $0.6000 | par 1M tokens | DeepSeek V4.1 Flash — l'identifiant de modèle canonique pour les nouvelles intégrations. Il prend en charge l'entrée texte et image, les modes avec et sans réflexion, l'appel d'outils et la sortie JSON. Les identifiants retirés deepseek-v4-flash et deepseek-v4-flash-vision-exp restent des alias de compatibilité, servis par ce même modèle au même prix Flash. Fenêtre de contexte de 1M tokens, sortie maximale de 384K. Sur /v1/responses, envoyez l'intégralité de la conversation dans le tableau input à chaque tour : aucun état de conversation n'est conservé en amont, de sorte que les requêtes qui contiennent previous_response_id ou conversation sont refusées. | ||
| deepseek-v4-pro | DeepSeek | $0.6600 | $1.9800 | par 1M tokens | DeepSeek V4 Pro 0813 — le palier le plus performant de DeepSeek V4 pour la programmation, le raisonnement et le travail agentique, avec une fenêtre de contexte de 1M tokens et une sortie maximale de 384K. Il fonctionne en mode de réflexion (par défaut) comme sans réflexion, et prend en charge l'appel d'outils et la sortie JSON. Texte en entrée, texte en sortie. Sur /v1/responses, envoyez l'intégralité de la conversation dans le tableau input à chaque tour : aucun état de conversation n'est conservé en amont, de sorte que les requêtes qui contiennent previous_response_id ou conversation sont refusées. | ||
| doubao-seed-2-1-pro-260628 | ByteDance | $0.8889 | $4.4444 | par 1M tokens | ByteDance Doubao Seed 2.1 Pro — modèle d'agent phare de Doubao pour le travail en production, couvrant la réflexion approfondie, la génération de texte, la compréhension multimodale, l'appel d'outils et la sortie structurée, pour laquelle le fournisseur recommande le mode json_schema. Fenêtre de contexte de 256K avec 256K d'entrée au maximum, jusqu'à 256K tokens de sortie (4K par défaut) et un budget de chaîne de raisonnement de 256K. Il accepte le texte, l'image et la vidéo et renvoie du texte ; la compréhension audio n'est pas listée pour la gamme 2.1. Il prend en charge la mise en cache du contexte implicite comme explicite, y compris les caches de préfixe et de session. | ||
| doubao-seed-2-1-turbo-260628 | ByteDance | $0.4444 | $2.2222 | par 1M tokens | ByteDance Doubao Seed 2.1 Turbo — la voie à faible latence de la gamme Seed 2.1, qui partage l'enveloppe du Pro : fenêtre de contexte de 256K avec 256K d'entrée au maximum, jusqu'à 256K tokens de sortie (4K par défaut) et un budget de chaîne de raisonnement de 256K. Il couvre la réflexion approfondie, la génération de texte, la compréhension multimodale, l'appel d'outils et la sortie structurée, sans toutefois la recommandation json_schema du Pro. Il accepte le texte, l'image et la vidéo et renvoie du texte ; la compréhension audio n'est pas listée pour la gamme 2.1. Il prend en charge la mise en cache du contexte implicite comme explicite. | ||
| doubao-seed-character-260628 | ByteDance | $0.1185 | $0.2963 | par 1M tokens | ByteDance Doubao Seed Character (260628) — le modèle de dialogue de personnages de Doubao pour les conversations multi-tours guidées par une persona ; c'est la gamme qui succède à doubao-1-5-pro-32k-character. Cette version porte les étiquettes de capacités du fournisseur pour la réflexion approfondie, la génération de texte, la compréhension multimodale, l'appel d'outils et la sortie structurée (json_schema recommandé). Fenêtre de contexte de 128K avec 96K d'entrée au maximum et jusqu'à 32K tokens de sortie (4K par défaut). Tarification selon la longueur de l'entrée : les requêtes jusqu'à 32K tokens d'entrée sont facturées au palier standard ; les requêtes plus longues le sont au palier contexte long, où l'entrée coûte 1,5 fois et la sortie trois fois le tarif du palier standard. | ||
| doubao-seed-evolving | ByteDance | $0.8889 | $4.4444 | par 1M tokens | ByteDance Doubao Seed Evolving — l'actuel modèle phare de Doubao pour la programmation et les agents, publié en version continue (rolling release) : le fournisseur met à jour le modèle chaque semaine sous ce même identifiant, sans instantané daté, si bien que son comportement et ses capacités peuvent changer sans changement de numéro de version. Il porte les étiquettes de capacités du fournisseur pour la réflexion approfondie, la génération de texte, la compréhension multimodale, le traitement de tâches sur interface graphique (GUI), l'appel d'outils et la sortie structurée (json_schema recommandé). Fenêtre de contexte de 1 024K avec 1 024K d'entrée au maximum et jusqu'à 256K tokens de sortie (4K par défaut). | ||
| doubao-seedance-2-0-260128 | ByteDance | $7.0000 | par 1M tokens | ByteDance Seedance 2.0 — le modèle phare de la gamme Seedance 2.0 et le seul à atteindre le 1080p et le 4K (profondeur 10 bits) en plus du 480p et du 720p, à 24 fps et de 4 à 15 secondes. Il couvre le texte vers vidéo, l'image vers vidéo depuis la première image ou depuis la première et la dernière, la génération multimodale par référence à partir de 1 à 9 images et de 3 vidéos de référence au maximum totalisant 15 secondes, le montage vidéo, l'extension de vidéo, la génération avec audio et un outil de recherche web ; une référence audio doit obligatoirement accompagner une image ou une vidéo. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16, avec l'image de fin récupérable sous forme d'image. Facturé selon la résolution de sortie. | |||
| doubao-seedance-2-0-fast-260128 | ByteDance | $5.6000 | par 1M tokens | ByteDance Seedance 2.0 Fast — génération vidéo économique reprenant l'ensemble des fonctionnalités de Seedance 2.0 mais plafonnée à 480p et 720p, 24 fps, 4 à 15 secondes. Elle couvre le texte vers vidéo, l'image vers vidéo depuis la première image ou depuis la première et la dernière, la génération multimodale par référence à partir de 1 à 9 images et de 3 vidéos de référence au maximum totalisant 15 secondes, le montage vidéo, l'extension de vidéo, la génération avec audio et un outil de recherche web ; une référence audio doit obligatoirement accompagner une image ou une vidéo. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. 480p 5 s ≈ $0,26. | |||
| doubao-seedance-2-0-mini-260615 | ByteDance | $3.5000 | par 1M tokens | ByteDance Seedance 2.0 Mini — le palier léger et économique de la gamme Seedance 2.0, plafonné à 480p et 720p, 24 fps, 4 à 15 secondes. Il reprend le même ensemble de fonctionnalités documenté que le reste de la gamme : texte vers vidéo, image vers vidéo depuis la première image ou depuis la première et la dernière, génération multimodale par référence à partir de 1 à 9 images et de 3 vidéos de référence au maximum totalisant 15 secondes, montage vidéo, extension de vidéo, génération avec audio et un outil de recherche web ; une référence audio doit obligatoirement accompagner une image ou une vidéo. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. | |||
| doubao-seedance-2-5-260628 | ByteDance | $10.7000 | par 1M tokens | ByteDance Seedance 2.5 — le modèle principal de la gamme Seedance, qui étire une génération unique à 4-30 secondes à 24 fps tout en plafonnant la résolution à 480p et 720p. La génération multimodale par référence monte à 1-30 images, jusqu'à 10 vidéos de référence et jusqu'à 10 extraits audio de référence (30 secondes au total pour chaque catégorie), et contrairement à la gamme 2.0, une référence audio peut être utilisée seule. Il couvre aussi le texte vers vidéo, l'image vers vidéo depuis la première image ou depuis la première et la dernière, le montage vidéo, l'extension de vidéo, la génération avec audio et un outil de recherche web. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. | |||
| doubao-seedream-4-5-251128 | ByteDance | $0.03704 | par requête | ByteDance Doubao Seedream 4.5 — texte vers image et image vers image avec fusion multi-images, produisant soit une image unique, soit une série d'images liées. Le mode image unique accepte un prompt seul, une image de référence, ou 2 à 14 images de référence ; le mode série (sequential_image_generation=auto) renvoie jusqu'à 15 images à partir d'un texte, jusqu'à 14 à partir d'une seule image de référence, ou une série à partir de 2 à 14 références à condition que le total des entrées et des sorties reste inférieur ou égal à 15. Il prend en charge les sorties 2K et 4K et renvoie du JPEG par défaut, sous forme d'URL ou de base64. L'édition interactive par coordonnées n'est disponible que dans Seedream 5.0 Pro (doubao-seedream-5-0-pro-260628). | |||
| doubao-seedream-5-0-260128 | ByteDance | $0.03259 | par requête | ByteDance Doubao Seedream 5.0-lite — texte vers image et image vers image, avec une création contrôlable plus fine, une recherche en temps réel et une meilleure cohérence des sujets (résolution 2K et plus). | |||
| doubao-seedream-5-0-pro-260628 | ByteDance | $0.045 | par requête | ByteDance Doubao Seedream 5.0 Pro — le modèle d'images de plus haut niveau du fournisseur pour la création contrôlable : texte vers image, image vers image à partir d'une seule ou de plusieurs références (2 à 10 images de référence), édition interactive par coordonnées, cadres ou flèches, et décomposition en calques, qui sépare une image en une base plus jusqu'à 16 calques, chacun renvoyé avec sa propre taille, son z_index et sa boîte englobante (définissez layer_decomposition=true). Une seule image en sortie : ni génération en série (séquentielle), ni recherche web, ni streaming. Facturé par image produite selon le scénario et le palier de pixels : une image unique de 2,61 MP ou moins correspond au prix de base ; au-delà de 2,61 MP, elle coûte 2x ; en décomposition en calques, chaque calque renvoyé est facturé séparément à 0,5x (ou 1x au-delà de 2,61 MP) ; chaque image de référence au-delà de la première ajoute 1/15 du prix de base. | |||
| fun-asr-flash-2026-06-15 | Alibaba | $0.1260 | par heure audio | Alibaba Fun-ASR Flash (2026-06-15) — reconnaissance à faible latence de la parole enregistrée, avec contexte de prompt et détection automatique de la langue parmi les dialectes chinois et plus de 30 langues. Accepte l'audio par URL, en Base64 ou sous forme de fichier importé AAC/AMR/AVI/FLAC/FLV/M4A/MKV/MOV/MP3/MP4/MPEG/OGG/OPUS/WAV/WEBM/WMA/WMV, jusqu'à 5 minutes et 2 Go. | |||
| gemini-2.5-flash-image | $0.3000 | $2.5000 | $0.2100 | $1.7500 | par 1M tokens | Google Gemini 2.5 Flash Image (Nano Banana) — modèle natif rapide de génération et d'édition d'images pour les flux de travail créatifs. Il accepte le texte et l'image en entrée et renvoie des images via l'endpoint chat completions compatible OpenAI, avec une limite d'entrée de 65 536 tokens et une limite de sortie de 32 768 tokens. | |
| gemini-2.5-pro | $1.2500 | $10.0000 | $0.8125 | $6.5000 | par 1M tokens | Google Gemini 2.5 Pro — le modèle du palier raisonnement de la famille 2.5, doté d'une fenêtre de contexte de 1M tokens. Les prompts dépassant 200 000 tokens sont refacturés au tarif contexte long du fournisseur pour l'ensemble de la requête, conformément à la règle appliquée par Google. | |
| gemini-3-pro-image | $2.0000 | $12.0000 | $1.4000 | $8.4000 | par 1M tokens | Google Gemini 3 Pro Image (Nano Banana Pro) — modèle haut de gamme piloté par le raisonnement, pour la génération d'images professionnelle et l'édition conversationnelle. Il excelle dans le design graphique complexe, les maquettes de produits haute fidélité, le rendu précis de texte multilingue, la cohérence de marque et les visualisations factuelles ancrées via Google Search. Il accepte le texte et les images, renvoie du texte et des images, prend en charge la réflexion et produit des sorties en 1K, 2K ou 4K. | |
| gemini-3.1-flash-image | $0.5000 | $3.0000 | $0.3500 | $2.1000 | par 1M tokens | Google Gemini 3.1 Flash Image (Nano Banana 2) — modèle stable à faible latence pour la génération d'images de haute qualité et l'édition conversationnelle. Il accepte le texte, les images et les PDF, prend en charge la réflexion et l'ancrage par recherche, et peut produire des images en 0,5K, 1K, 2K ou 4K pour les flux de production à fort volume. | |
| gemini-3.1-flash-lite-image | $0.2500 | $1.5000 | $0.1750 | $1.0500 | par 1M tokens | Google Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — modèle à latence ultra-faible et économique pour la génération d'images à fort volume et les retouches rapides en plusieurs tours. Il accepte le texte et les images, produit des images en 1K, prend en charge la réflexion et l'édition conversationnelle, et vise les applications interactives grand public et pour développeurs. | |
| gemini-3.5-flash | $1.5000 | $9.0000 | $1.0500 | $6.3000 | par 1M tokens | Google Gemini 3.5 Flash — modèle multimodal stable optimisé pour des performances d'agent soutenues, des boucles de programmation rapides, le déploiement de sous-agents et les flux de travail multi-étapes de longue durée. Il accepte le texte, les images, la vidéo, l'audio et les PDF, prend en charge la réflexion et les outils intégrés, et offre un contexte d'entrée de 1 048 576 tokens avec jusqu'à 65 536 tokens de sortie. | |
| gemini-3.6-flash | $0.7500 | $3.7500 | $0.5250 | $2.6250 | par 1M tokens | Google Gemini 3.6 Flash — modèle de raisonnement multimodal en version stable qui équilibre vitesse et intelligence pour les tâches agentiques et les usages réels, avec un contexte d'entrée de 1 048 576 tokens et une limite de sortie de 65 536 tokens. Il accepte le texte, les images, la vidéo, l'audio et les PDF, et prend en charge la réflexion, l'appel de fonctions, l'exécution de code, l'ancrage par recherche, la sortie structurée et Computer Use (préversion). Note tarifaire : le prix catalogue de Google pour ce modèle est promotionnel jusqu'au 31 décembre 2026 — $0,75 en entrée / $3,75 en sortie / $0,075 en entrée mise en cache par 1M tokens. À partir du 1er janvier 2027, le prix catalogue du fournisseur revient à $1,50 / $7,50 / $0,15, et notre prix le suit à la même parité. | |
| gemini-3.7-flash | $0.7500 | $3.7500 | $0.5250 | $2.6250 | par 1M tokens | Google Gemini 3.7 Flash — le plus récent modèle de raisonnement multimodal du palier Flash, facturé à l'identique de 3.6 Flash pendant la durée de la promotion du fournisseur. Il accepte le texte, les images, la vidéo, l'audio et les PDF ; il prend en charge la réflexion, l'appel de fonctions, l'exécution de code, l'ancrage par recherche et la sortie structurée. Note tarifaire : le prix catalogue de Google pour ce modèle est promotionnel jusqu'au 31 décembre 2026 — $0,75 en entrée / $3,75 en sortie / $0,075 en entrée mise en cache par 1M tokens. À partir du 1er janvier 2027, le prix catalogue du fournisseur revient à $1,50 / $7,50 / $0,15, et notre prix le suit à la même parité. | |
| gemini-3.8-flash | $0.7500 | $3.7500 | $0.4875 | $2.4375 | par 1M tokens | Google Gemini 3.8 Flash — le modèle Gemini multimodal et rapide de Google, que l'on peut appeler ici aussi bien via l'endpoint compatible OpenAI que via l'endpoint Gemini natif. Tarification standard au token : $0,75 en entrée, $0,075 en entrée mise en cache et $3,75 en sortie par 1M tokens. | |
| glm-5 | Zhipu AI | $1.0000 | $3.2000 | $0.9500 | $3.0400 | par 1M tokens | Zhipu GLM-5 — MoE de 744 milliards de paramètres dont 40 milliards actifs, entraîné sur 28 500 milliards de tokens et utilisant DeepSeek Sparse Attention, avec une fenêtre de contexte de 200K et jusqu'à 128K tokens de sortie. Texte en entrée, texte en sortie. Il prend en charge plusieurs modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP. |
| glm-5-turbo | Zhipu AI | $1.2000 | $4.0000 | $1.1400 | $3.8000 | par 1M tokens | Zhipu GLM-5-Turbo — la variante de GLM-5 orientée débit, optimisée pour les flux de travail d'agents : invocation d'outils et de compétences plus stable sur les tâches multi-étapes, meilleure gestion des instructions longues et complexes, et exécution de tâches planifiées ou de longue durée. Fenêtre de contexte de 200K, jusqu'à 128K tokens de sortie, texte en entrée et texte en sortie. Il prend en charge les modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP. |
| glm-5.1 | Zhipu AI | $1.4000 | $4.4000 | $1.1200 | $3.5200 | par 1M tokens | Zhipu GLM-5.1 — modèle de fondation phare conçu pour le travail autonome prolongé : le fournisseur documente une exécution continue et sans surveillance sur une même tâche pendant jusqu'à 8 heures, en couvrant planification, exécution, tests et optimisation itérative. Fenêtre de contexte de 200K, jusqu'à 128K tokens de sortie, texte en entrée et texte en sortie. Il prend en charge plusieurs modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP. |
| glm-5.2 | Zhipu AI | $1.4000 | $4.4000 | $1.1200 | $3.5200 | par 1M tokens | Zhipu GLM-5.2 — modèle de fondation phare spécialisé dans le travail d'agent de programmation de longue haleine, obtenu par des mois d'entraînement dédié et non par une simple extension de contexte, avec une fenêtre de contexte de 1M tokens et jusqu'à 128K tokens de sortie. Texte en entrée, texte en sortie. Il prend en charge plusieurs modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP. |
| glm-5.3 | Zhipu AI | $1.4000 | $4.4000 | $0.9100 | $2.8600 | par 1M tokens | Zhipu GLM-5.3 — modèle phare de programmation et d'agents post-entraîné sur la même base que GLM-5.2 : un gain de 50 % sur le banc d'essai de programmation interne de Zhipu, le SOTA open source sur Terminal-Bench 3.0 et Agents' Last Exam, et des résultats à l'état de l'art en découverte de vulnérabilités sur CyberGym, avec une fenêtre de contexte de 1M tokens et jusqu'à 128K tokens de sortie. Texte en entrée, texte en sortie. Il prend en charge plusieurs modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP. |
| glm-5.3-flash | Zhipu AI | $0.1500 | $0.5000 | $0.1350 | $0.4500 | par 1M tokens | Zhipu GLM-5.3-Flash — le premier modèle nativement multimodal de la gamme GLM-5 et son palier de pointe économique : 320 milliards de paramètres au total dont 18 milliards actifs, sur une architecture d'attention hybride linéaire + clairsemée qui divise par plusieurs le calcul d'attention et le cache KV par rapport à GLM-5.3, tout en réduisant de moitié le nombre de paramètres actifs comme le nombre de couches par rapport à GLM-4.5. Il accepte le texte, les images et la vidéo, et renvoie du texte. (Le fournisseur annonce aussi une entrée fichier, qui n'est pas vérifiée ici et n'est donc pas proposée.) Fenêtre de contexte de 1M tokens et jusqu'à 128K tokens de sortie. Il prend en charge les modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP. Positionné sur la programmation visuelle — front-end, jeu et 3D, où le modèle inspecte son propre rendu et itère. |
| glm-5v-turbo | Zhipu AI | $1.2000 | $4.0000 | $1.1400 | $3.8000 | par 1M tokens | Zhipu GLM-5V-Turbo — modèle de raisonnement multimodal pour les images, la vidéo, les fichiers, la programmation et les flux de travail d'agents pilotés par outils. |
| glm-image | Zhipu AI | $0.015 | $0.01425 | par requête | Zhipu GLM-Image — génération d'images reposant sur une architecture hybride associant compréhension autorégressive et décodage par diffusion, premier modèle multimodal SOTA entraîné de bout en bout sur des puces de fabrication chinoise (Huawei Ascend). Il interprète des instructions plutôt que des mots-clés et complète les détails que le prompt laisse implicites, avec des performances nettement supérieures en rendu de texte (en particulier les caractères chinois) et sur les scènes riches en connaissances. Une image par requête. | ||
| glm-tts | Zhipu AI | $0.3500 | $0.3150 | par 10 k caractères | Zhipu GLM-TTS — synthèse vocale bâtie sur une architecture de génération en deux étapes avec apprentissage par renforcement GRPO, qui déduit l'émotion et l'intonation du texte environnant au lieu d'exiger un balisage explicite. Elle embarque sept voix intégrées (tongtong par défaut, xiaochen, chuichui, jam, kazi, douji, luodo) avec vitesse et volume réglables, accepte jusqu'à 1024 caractères par requête et diffuse en streaming avec une latence de première trame inférieure à 400 ms. Elle renvoie du wav ou du pcm à une fréquence d'échantillonnage recommandée de 24 kHz ; le streaming est en pcm uniquement. | ||
| gpt-5.5 | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | par 1M tokens | OpenAI GPT-5.5 — modèle de raisonnement de pointe pour la programmation complexe et le travail professionnel. Il accepte le texte et l'image en entrée, l'appel de fonctions et les outils intégrés, une fenêtre de contexte de 1 050 000 tokens, jusqu'à 128 000 tokens de sortie et une intensité de raisonnement allant de none à xhigh. |
| gpt-5.6-luna | OpenAI | $0.2000 | $1.2000 | $0.1700 | $1.0200 | par 1M tokens | OpenAI GPT-5.6 Luna — palier le plus rapide et le plus abordable de GPT-5.6, optimisé pour les charges de travail à fort volume et sensibles au coût tout en conservant le raisonnement, la vision et l'usage d'outils. Il accepte le texte et l'image en entrée, une fenêtre de contexte de 1 050 000 tokens et jusqu'à 128 000 tokens de sortie. |
| gpt-5.6-sol | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | par 1M tokens | OpenAI GPT-5.6 Sol — modèle phare de la gamme GPT-5.6 pour le raisonnement de pointe, le travail professionnel complexe, la programmation, la science, la cybersécurité et les flux de travail agentiques de longue haleine. Il accepte le texte et l'image en entrée, les outils intégrés, une fenêtre de contexte de 1 050 000 tokens, jusqu'à 128 000 tokens de sortie et les réglages de raisonnement les plus poussés de la famille. |
| gpt-5.6-terra | OpenAI | $2.0000 | $12.0000 | $1.6000 | $9.6000 | par 1M tokens | OpenAI GPT-5.6 Terra — modèle GPT-5.6 équilibré pour le travail professionnel quotidien, offrant une forte intelligence et de bonnes performances d'agent de programmation à un coût inférieur à Sol. Il accepte le texte et l'image en entrée, les outils intégrés, une fenêtre de contexte de 1 050 000 tokens et jusqu'à 128 000 tokens de sortie. |
| gpt-6-astra | OpenAI | $10.0000 | $50.0000 | $7.0000 | $35.0000 | par 1M tokens | OpenAI GPT-6 Astra — le modèle le plus performant d'OpenAI, conçu pour les travaux de bout en bout les plus difficiles : raisonnement complexe, programmation, utilisation de l'ordinateur, recherche et création de documents. Il accepte le texte et l'image en entrée, une fenêtre de contexte de 1 050 000 tokens, jusqu'à 128 000 tokens de sortie et des réglages d'intensité de raisonnement allant jusqu'à xhigh et max. |
| gpt-6-luna | OpenAI | $0.1000 | $0.5000 | $0.0650 | $0.3250 | par 1M tokens | OpenAI GPT-6 Luna — le modèle le plus efficace d'OpenAI, conçu pour des tâches ciblées à fort volume. Il accepte le texte et l'image en entrée, une fenêtre de contexte de 1 050 000 tokens, jusqu'à 128 000 tokens de sortie et une intensité de raisonnement de none à max, medium par défaut. Utilisez /v1/responses pour les appels d'outils : sur /v1/chat/completions, l'appel de fonctions ne fonctionne qu'avec reasoning_effort réglé sur none. Sur /v1/responses, envoyez l'intégralité de la conversation dans le tableau input à chaque tour ; les requêtes qui contiennent previous_response_id ou conversation sont refusées. |
| gpt-6-sol | OpenAI | $2.0000 | $10.0000 | $1.3000 | $6.5000 | par 1M tokens | OpenAI GPT-6 Sol — conçu pour la programmation complexe et les flux de travail agentiques. Il accepte le texte et l'image en entrée, une fenêtre de contexte de 1 050 000 tokens, jusqu'à 128 000 tokens de sortie et une intensité de raisonnement de none à max, medium par défaut. Utilisez /v1/responses pour les appels d'outils : sur /v1/chat/completions, l'appel de fonctions ne fonctionne qu'avec reasoning_effort réglé sur none. Sur /v1/responses, envoyez l'intégralité de la conversation dans le tableau input à chaque tour ; les requêtes qui contiennent previous_response_id ou conversation sont refusées. |
| gpt-6.1-sol | OpenAI | $2.0000 | $10.0000 | $1.3000 | $6.5000 | par 1M tokens | OpenAI GPT-6.1 Sol — proche de GPT-6 Astra en programmation complexe, utilisation de l'ordinateur et travail professionnel, pour un coût moindre. Il accepte le texte et l'image en entrée, une fenêtre de contexte de 1 050 000 tokens et jusqu'à 128 000 tokens de sortie. L'intensité de raisonnement va de low à max, medium par défaut ; none et minimal ne sont pas pris en charge, et les tokens de raisonnement sont facturés comme des tokens de sortie. Lorsque l'entrée dépasse 272 000 tokens, tous les tokens de la requête sont facturés au tarif contexte long. Utilisez /v1/responses pour les appels d'outils ; /v1/chat/completions ne prend pas en charge les appels d'outils. Sur /v1/responses, envoyez l'intégralité de la conversation dans le tableau input à chaque tour ; les requêtes qui contiennent previous_response_id ou conversation sont refusées. |
| gpt-image-2 | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | par 1M tokens | OpenAI GPT Image 2 — modèle de génération et d'édition d'images à l'état de l'art pour une sortie rapide et de haute qualité. Il accepte le texte et l'image en entrée, prend en charge des tailles d'image flexibles et des entrées image haute fidélité, et facture au token plutôt qu'à l'appel : $5 pour l'entrée texte, $1,25 pour l'entrée texte mise en cache, $8 pour l'entrée image et $30 pour la sortie image, par 1M tokens. |
| gpt-image-2.5-flare | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | par 1M tokens | OpenAI GPT Image 2.5 Flare — modèle de génération et d'édition d'images de la gamme GPT Image 2.5 d'OpenAI. Flare et gpt-image-2.5-sunburst sont des versions distinctes, et non des alias d'un même modèle, et sont vendues au même prix ; les classements publics les évaluent séparément. Tarification standard au token : $5 pour l'entrée texte, $1,25 pour l'entrée mise en cache, $8 pour l'entrée image et $30 pour la sortie image, par 1M tokens. |
| gpt-image-2.5-sunburst | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | par 1M tokens | OpenAI GPT Image 2.5 Sunburst — modèle de génération et d'édition d'images de la gamme GPT Image 2.5 d'OpenAI. Sunburst et gpt-image-2.5-flare sont des versions distinctes, et non des alias d'un même modèle, et sont vendues au même prix ; les classements publics les évaluent séparément. Tarification standard au token : $5 pour l'entrée texte, $1,25 pour l'entrée mise en cache, $8 pour l'entrée image et $30 pour la sortie image, par 1M tokens. |
| grok-4.7 | xAI | $2.0000 | $6.0000 | $0.8000 | $2.4000 | par 1M tokens | xAI Grok 4.7 — un modèle de pointe conçu pour la programmation, les tâches agentiques et le travail intellectuel. Il accepte le texte et l'image en entrée et dispose d'une fenêtre de contexte de 500 000 tokens. Le raisonnement ne peut pas être désactivé : reasoning_effort permet de choisir low, medium, high ou xhigh, high par défaut, et les tokens de raisonnement sont facturés comme des tokens de sortie. Lorsqu'un prompt atteint 200 000 tokens, tous les tokens de la requête sont facturés au tarif contexte long. Seuls les outils function sont acceptés ; les outils côté serveur de xAI, comme la recherche web, la recherche X et l'exécution de code, ne sont pas disponibles, et les requêtes qui les contiennent sont refusées. Sur /v1/responses, envoyez l'intégralité de la conversation dans le tableau input à chaque tour et renvoyez tels quels les éléments de raisonnement chiffrés des réponses précédentes ; les requêtes qui contiennent previous_response_id ou conversation sont refusées. |
| happyhorse-1.1-i2v | Alibaba | $0.140 | par seconde | Alibaba HappyHorse 1.1 (I2V) — image vers vidéo avec une meilleure matière, une cohérence d'identité d'un plan à l'autre, une fluidité de mouvement accrue et une synchronisation audio-vidéo. 720P/1080P. | |||
| happyhorse-1.1-r2v | Alibaba | $0.140 | par seconde | Alibaba HappyHorse 1.1 (R2V) — génération vidéo à partir de références, jusqu'à 9 images de référence, forte cohérence de sujet, de scène et de style, et contrôle de la caméra. 720P/1080P. | |||
| happyhorse-1.1-t2v | Alibaba | $0.140 | par seconde | Alibaba HappyHorse 1.1 (T2V) — texte vers vidéo avec une meilleure compréhension sémantique, un meilleur contrôle de la caméra et une génération plus dynamique. Vidéo 720P/1080P fluide, détaillée et physiquement cohérente. | |||
| hy-mt2-lite | Tencent | $0.0440 | $0.1770 | par 1M tokens | Tencent HY-MT2 Lite — palier de traduction multilingue axé sur la latence et le coût, via le protocole OpenAI Chat Completions. Jusqu'à 4K tokens d'entrée et 4K tokens de sortie ; texte uniquement. | ||
| hy-mt2-plus | Tencent | $0.0740 | $0.2950 | par 1M tokens | Tencent HY-MT2 Plus — palier de traduction multilingue avec suivi des instructions, via le protocole OpenAI Chat Completions. Jusqu'à 4K tokens d'entrée et 4K tokens de sortie ; texte uniquement. | ||
| hy-mt2-pro | Tencent | $0.0740 | $0.2950 | par 1M tokens | Tencent HY-MT2 Pro — palier phare de traduction automatique, pour une traduction multilingue de haute qualité via le protocole OpenAI Chat Completions. Jusqu'à 4K tokens d'entrée et 4K tokens de sortie ; texte uniquement. | ||
| hy3 | Tencent | $0.1320 | $0.5280 | par 1M tokens | Tencent Hunyuan 3 (Hy3) — modèle MoE de 295 milliards de paramètres (21 milliards actifs), contexte natif de 256K, trois modes de réflexion (fast / low / deep). Solide sur les agents de programmation, la compréhension de longs documents, le contexte multi-tours et les flux de travail d'agents multi-étapes. Texte uniquement. | ||
| hy4-preview | Tencent | $0.8340 | $2.5010 | par 1M tokens | Tencent Hunyuan 4 preview (Hy4 preview) — fenêtre de contexte de 1M tokens (960K d'entrée au maximum, 64K de sortie au maximum) avec réflexion approfondie (que Tencent appelle preserved thinking), sortie structurée, appel de fonctions et mise en cache des prompts. Texte uniquement. SKU en préversion : Tencent retire un modèle en préversion dès que sa version en disponibilité générale est publiée. | ||
| jev-1.13 | TypeSafe | $0.0462 | par 1M tokens | TypeSafe Jev 1.13 — un modèle de décision System One, pas un modèle de chat. Envoyez l'état de votre application (state : une chaîne, un objet JSON ou un tableau) avec un ensemble de questions typées sur POST /v1/systemone — choice (choisir l'une de vos options), score (situer sur vos niveaux ordonnés) ou noul (la probabilité qu'un énoncé oui/non soit vrai) — et recevez des réponses typées avec une probabilité pour chaque option et une valeur de confiance, généralement en 70–500 ms. Toutes les questions sont évaluées en parallèle sur le même état, si bien que plusieurs peuvent partager une requête. Les SDK officiels TypeSafe pour Python et JavaScript fonctionnent tels quels avec l'URL de base définie sur https://api.chinaapi.ai. Facturé par token d'entrée ; la sortie est gratuite. Entrée texte uniquement, jusqu'à 32K tokens par requête ; l'anglais est la langue principale, testez donc les autres langues avant de vous y fier. | |||
| jev-latest | TypeSafe | $0.0462 | par 1M tokens | TypeSafe Jev (latest) — l'alias qu'appellent les SDK TypeSafe quand aucun modèle n'est indiqué. Il sert actuellement jev-1.13, au même prix et avec le même contrat System One sur POST /v1/systemone : un état et des questions typées choice, score et noul en entrée, des réponses typées avec probabilités et valeur de confiance en sortie. Le champ model de la réponse indique la version qui a répondu. Nous ne déplaçons l'alias vers une nouvelle version de Jev qu'après avoir vérifié son prix ; épinglez donc jev-1.13 si vous avez calibré des seuils sur celle-ci. | |||
| kimi-k2.6 | Moonshot | $0.9500 | $4.0000 | $0.7600 | $3.2000 | par 1M tokens | Moonshot Kimi K2.6 — modèle généraliste pour le dialogue, la génération de code, la compréhension visuelle et les tâches d'agents, avec une écriture de code de longue haleine et une exécution autonome plus solides que la génération précédente. Fenêtre de contexte de 256K, 32 768 tokens de sortie par défaut. Il accepte le texte, les images (png, jpeg, webp, gif) et la vidéo (mp4, mov, webm et d'autres) sous forme de contenu base64 et renvoie du texte. Le mode de réflexion est actif par défaut et peut être désactivé ; la température est fixée à 1.0 avec réflexion et à 0.6 sans. |
| kimi-k2.7-code | Moonshot | $0.9500 | $4.0000 | $0.7600 | $3.2000 | par 1M tokens | Moonshot Kimi K2.7 Code — le modèle dédié à la programmation de Kimi, dont le fournisseur mesure qu'il améliore le respect des instructions et la programmation de longue haleine par rapport à K2.6 tout en réduisant la sur-réflexion d'environ 30 % en moyenne. Fenêtre de contexte de 256K, 32 768 tokens de sortie par défaut. Il accepte le texte, les images et la vidéo sous forme de contenu base64 et renvoie du texte. La réflexion est obligatoire et renvoie une erreur si elle est désactivée ; tool_choice est limité à auto ou none, et reasoning_content doit être transmis d'un appel d'outil à l'autre. |
| kimi-k2.7-code-highspeed | Moonshot | $1.9000 | $8.0000 | par 1M tokens | Moonshot Kimi K2.7 Code Highspeed — le palier débit de K2.7 Code, qui sert le même modèle à environ 180 tokens par seconde et jusqu'à 260 sur les contextes courts. Fenêtre de contexte de 256K, 32 768 tokens de sortie par défaut. Il accepte le texte, les images et la vidéo sous forme de contenu base64 et renvoie du texte. La réflexion est obligatoire et renvoie une erreur si elle est désactivée ; tool_choice est limité à auto ou none, et reasoning_content doit être transmis d'un appel d'outil à l'autre. | ||
| kimi-k3 | Moonshot | $3.0000 | $15.0000 | $1.9500 | $9.7500 | par 1M tokens | Moonshot Kimi K3 — modèle phare de 2 800 milliards de paramètres pour la programmation de longue haleine, le travail du savoir de bout en bout et le raisonnement profond, avec une fenêtre de contexte de 1M tokens et jusqu'à 1 048 576 tokens de complétion (131 072 par défaut). Il accepte le texte, les images encodées en base64 et la vidéo encodée en base64, et renvoie du texte. La réflexion est toujours active, avec un effort de raisonnement réglé sur max par défaut ; la température est fixée à 1.0. Il prend en charge l'appel d'outils personnalisés et le chargement dynamique d'outils. |
| kling-3.0-turbo | Kuaishou | $0.560 | par requête | Kuaishou Kling 3.0 Turbo — le palier économique de la gamme Kling 3.0, qui génère du 720P ou du 1080P (720P par défaut) sur 3 à 15 secondes (5 par défaut) en 16:9, 9:16 ou 1:1, à partir d'un prompt ou d'une première image. L'audio natif est toujours inclus et ne dispose d'aucun interrupteur. Face à kling-v3, il abandonne le palier 4K, le contrôle de l'image de fin et l'entrée vidéo en échange de vitesse et de coût. 720p 5 s avec audio ≈ $0,56. | |||
| kling-v3 | Kuaishou | $0.420 | par requête | Kuaishou Kling 3.0 — texte vers vidéo et image vers vidéo avec audio natif et une meilleure cohérence des éléments. Les clips durent de 3 à 15 secondes (5 par défaut) en 16:9, 9:16 ou 1:1, le palier se choisissant via mode : std pour le 720P, pro pour le 1080P et 4k pour le 4K natif. L'audio s'active explicitement par sound=on et reste désactivé par défaut ; l'image vers vidéo prend une première image avec une image de fin facultative. À partir de $0,083/s (720p). | |||
| kling-v3-omni | Kuaishou | $0.420 | par requête | Kling 3.0 Omni — génération vidéo multi-images à partir de références. Le prix affiché correspond au palier std (720p, 5 s, sans audio, sans vidéo de référence). Les requêtes qui ne fixent pas mode utilisent le palier pro par défaut en amont, facturé 1,33x — environ $0,56 pour le même clip de 5 s ; le 4k est facturé 5x. Passez mode=std pour être facturé au prix affiché. | |||
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | par 1M tokens | Meituan LongCat-2.0 — modèle MoE ouvert de 1600 milliards de paramètres avec un contexte natif de 1M, conçu pour la programmation agentique et l'usage d'outils de longue haleine. Modèle de raisonnement texte uniquement. | ||
| M2-her | MiniMax | $0.3000 | $1.2000 | par 1M tokens | MiniMax M2-her — modèle conversationnel conçu pour le jeu de rôle et le chat multi-tours, avec une fenêtre de contexte de 65 536 tokens et des réponses plafonnées à 2 048 tokens (max_completion_tokens). Outre system / user / assistant, il accepte sur l'endpoint de chat compatible OpenAI les rôles de message étendus du fournisseur : user_system (la persona de l'utilisateur), group (le nom de la conversation) et sample_message_user / sample_message_ai (des échanges d'exemple qui orientent le style des réponses). Tout message à rôle étendu doit comporter un champ name ; sans lui, le fournisseur rejette toute la requête avec l'erreur 2013, alors que les messages system/user/assistant ordinaires n'ont pas besoin de name. Texte uniquement : pas d'entrée image, et le fournisseur ne documente ni appel d'outils ni mise en cache. Chaque appel comporte, en plus du prompt visible, environ 170 tokens de surcharge de persona côté fournisseur, facturés en entrée. | ||
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | par 1M tokens | Xiaomi MiMo-V2.5 — modèle nativement multimodal intégral avec un contexte de 1M et jusqu'à 128K de sortie, comprenant images, vidéo, audio et texte dans un seul modèle. Il prend en charge la réflexion approfondie, l'appel de fonctions, la sortie structurée et la recherche web, avec des capacités d'agent sur toutes les modalités. | ||
| mimo-v2.5-asr | Xiaomi | $0.0740 | par heure audio | Xiaomi MiMo v2.5 ASR — modèle de reconnaissance vocale optimisé pour le chinois et l'anglais ainsi que les dialectes chinois, capable de traiter des audios bruités, en champ lointain et à plusieurs locuteurs, jusqu'à la transcription de paroles de chansons. | |||
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | par 1M tokens | Xiaomi MiMo-V2.5-Pro — modèle phare à mille milliards de paramètres (42 milliards actifs) avec un contexte de 1M et jusqu'à 128K de sortie, ajusté pour les charges de travail d'agents intensives. Il prend en charge la réflexion approfondie, l'appel de fonctions, la sortie structurée et la recherche web. Génération de texte uniquement : contrairement à mimo-v2.5, la liste de capacités du fournisseur n'inclut pas la compréhension de toutes les modalités. | ||
| mimo-v2.5-tts | Xiaomi | $0.0000 | par 10 k caractères | Xiaomi MiMo v2.5 TTS — synthèse vocale expressive avec huit voix intégrées, quatre chinoises et quatre anglaises (Mia, Chloe, Milo, Dean), couvrant le chinois et l'anglais ainsi que les styles dialectaux du Nord-Est, du Sichuan, du Henan et du cantonais. L'intonation se dirige de deux façons : des instructions de style en langage naturel, et des balises audio en ligne pour les émotions simples et composées, la respiration, les soupirs et le rythme, y compris un mode chanté propre à ce modèle dans la gamme MiMo TTS. Renvoie du wav mono ou du pcm16 à 24 kHz et prend en charge le streaming à faible latence, qui exige le pcm16. Contexte de 8K et sortie maximale de 8K. | |||
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | par 10 k caractères | Xiaomi MiMo v2.5 TTS VoiceClone — modèle de clonage vocal : fournissez un échantillon audio de référence sous forme de data URL dans le champ voice (data:{mime};base64,...) et il synthétise la parole avec cette voix, sans aucune étape d'entraînement, d'annotation ou de réglage fin. Il accepte le MP3 (audio/mpeg) ou le WAV, la chaîne encodée en base64 étant plafonnée à 10 Mo ; Xiaomi ne publie aucune durée minimale pour l'audio de référence. Les instructions de style en langage naturel et les balises audio en ligne sont reprises de mimo-v2.5-tts, mais le streaming n'est pas disponible : la requête s'exécute en mode de compatibilité et ne répond qu'une fois la synthèse terminée. | |||
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | par 10 k caractères | Xiaomi MiMo v2.5 TTS VoiceDesign — modèle de conception vocale : décrivez en langage naturel la voix souhaitée dans le champ instructions, et il synthétise la parole avec cette voix conçue sur mesure. | |||
| mimo-v2.6-flash | Xiaomi | $0.1400 | $0.2800 | $0.1260 | $0.2520 | par 1M tokens | Xiaomi MiMo-V2.6-Flash — modèle de raisonnement efficace et peu coûteux aux poids ouverts, nativement multimodal intégral : un seul modèle comprend images, vidéo, audio et texte. Contexte de 1M et jusqu'à 128K de sortie, avec réflexion approfondie, appel de fonctions et sortie structurée. Destiné aux charges de travail professionnelles courantes et à fort volume, où le coût et le débit comptent. |
| mimo-v2.6-pro | Xiaomi | $0.4350 | $0.8700 | $0.3915 | $0.7830 | par 1M tokens | Xiaomi MiMo-V2.6-Pro — modèle de raisonnement phare de Xiaomi, à mille milliards de paramètres et aux poids ouverts, nativement multimodal intégral : un seul modèle comprend images, vidéo, audio et texte. Contexte de 1M et jusqu'à 128K de sortie, avec réflexion approfondie, appel de fonctions et sortie structurée. Conçu pour les projets complexes, les tâches d'agents de longue haleine, la cybersécurité et la recherche. |
| mimo-v2.6-pro-ultraspeed | Xiaomi | $4.3500 | $8.7000 | par 1M tokens | Xiaomi MiMo-V2.6-Pro UltraSpeed — MiMo-V2.6-Pro servi dans le mode ultra-rapide de Xiaomi, avec une sortie jusqu'à 20 fois plus rapide que le modèle standard, pour l'interaction en temps réel et la production sensible à la latence. Mêmes capacités que mimo-v2.6-pro : compréhension multimodale intégrale des images, de la vidéo, de l'audio et du texte, contexte de 1M, jusqu'à 128K de sortie, réflexion approfondie, appel de fonctions et sortie structurée. Son prix est dix fois celui de mimo-v2.6-pro ; Xiaomi alloue la capacité de ce mode séparément, si bien que les pics importants peuvent être limités en débit. | ||
| MiniMax-H3 | MiniMax | $0.080 | par seconde | MiniMax H3 (Hailuo 3.0) — modèle vidéo multimodal généraliste ouvert de nouvelle génération, produisant un audio stéréo natif en une seule passe, en 768P ou 2K, sur 4 à 15 secondes (nombres entiers uniquement), à 24 fps. Il couvre le texte vers vidéo, l'image vers vidéo à partir d'une première et/ou d'une dernière image, et la génération par référence à partir d'images, de vidéos ou d'audio pour le personnage, le mouvement, la caméra, le style, la voix ou le rythme de montage ; l'image vers vidéo et la génération par référence ne peuvent pas être combinées dans une même requête. Il accepte la vidéo H.264/H.265, les images JPG, JPEG, PNG, WEBP, HEIC et HEIF, et l'audio WAV ou MP3, avec des prompts jusqu'à 7000 caractères. $0,08/s en 768P, $0,13/s en 2K. | |||
| MiniMax-Hailuo-02 | MiniMax | $0.280 | par requête | MiniMax Hailuo 02 — génération vidéo économique couvrant à la fois le texte vers vidéo et l'image vers vidéo à 24 fps, le 512p et le 768p étant proposés en clips de 6 ou 10 secondes et le 1080p en 6 secondes. Le palier 512p est l'entrée de gamme de la ligne Hailuo. | |||
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | par requête | MiniMax Hailuo 2.3 — texte vers vidéo et image vers vidéo que le fournisseur positionne sur le respect des instructions, à 24 fps, le 768p étant proposé en clips de 6 ou 10 secondes et le 1080p en 6 secondes. 768p 6 s = $0,28. | |||
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | par requête | MiniMax Hailuo 2.3 Fast — le palier vitesse et coût de Hailuo 2.3, centré sur l'image vers vidéo et sur le réalisme du mouvement physique, à 24 fps, le 768p étant proposé en clips de 6 ou 10 secondes et le 1080p en 6 secondes. 768p 6 s = $0,19. | |||
| MiniMax-M2 | MiniMax | $0.3000 | $1.2000 | par 1M tokens | MiniMax M2 — la première génération lancée par MiniMax pour la programmation efficace et les flux de travail d'agents, avec une fenêtre de contexte de 204 800 tokens. C'est le plus ancien palier encore servi par le fournisseur, et le seul des paliers historiques sans variante highspeed. Texte uniquement : l'API accepte des blocs de contenu texte et appel d'outil, mais ni images ni vidéo. Modèle désigné comme historique par le fournisseur, que MiniMax déclare continuer à servir normalement ; conservé au catalogue pour la compatibilité de version, car les clients figent un nom de modèle sur une génération. Les poids ouverts sont publiés sur Hugging Face. | ||
| MiniMax-M2.1 | MiniMax | $0.3000 | $1.2000 | par 1M tokens | MiniMax M2.1 — modèle texte conçu pour la programmation multilangage, avec une fenêtre de contexte de 204 800 tokens et une sortie à environ 60 tokens par seconde. Texte uniquement : l'API accepte des blocs de contenu texte et appel d'outil, mais ni images ni vidéo. Modèle désigné comme historique par le fournisseur, que MiniMax déclare continuer à servir normalement ; conservé au catalogue pour la compatibilité de version, car les clients figent un nom de modèle sur une génération. Les poids ouverts sont publiés sur Hugging Face. | ||
| MiniMax-M2.5 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | par 1M tokens | MiniMax M2.5 — modèle texte que le fournisseur positionne sur des performances de premier plan à bas prix pour les tâches complexes, avec une fenêtre de contexte de 204 800 tokens et une sortie à environ 60 tokens par seconde. Texte uniquement : l'API accepte des blocs de contenu texte et appel d'outil, mais ni images ni vidéo. Modèle désigné comme historique par le fournisseur, que MiniMax déclare continuer à servir normalement ; conservé au catalogue pour la compatibilité de version, car les clients figent un nom de modèle sur une génération. Les poids ouverts sont publiés sur Hugging Face. |
| MiniMax-M2.7 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | par 1M tokens | MiniMax M2.7 — modèle texte pour le chat, la programmation, le travail de bureau et les tâches agentiques, avec une fenêtre de contexte de 204 800 tokens et une sortie à environ 60 tokens par seconde. Texte uniquement : l'API accepte des blocs de contenu texte et appel d'outil, mais ni images ni vidéo. Il prend en charge l'appel d'outils ; la réflexion est toujours active et ne peut pas être désactivée. |
| MiniMax-M2.7-highspeed | MiniMax | $0.6000 | $2.4000 | par 1M tokens | MiniMax M2.7 Highspeed — le même modèle M2.7 servi à environ 100 tokens par seconde pour la programmation à faible latence et les flux de travail d'agents, avec une fenêtre de contexte de 204 800 tokens. Texte uniquement : l'API accepte des blocs de contenu texte et appel d'outil, mais ni images ni vidéo. Il prend en charge l'appel d'outils ; la réflexion est toujours active et ne peut pas être désactivée. | ||
| MiniMax-M3 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | par 1M tokens | MiniMax M3 — modèle de programmation multimodal de pointe pour le raisonnement agentique, l'usage d'outils et l'exécution structurée de tâches, avec une fenêtre de contexte de 1 000 000 tokens. Il accepte le texte, des images jusqu'à 10 Mo et de la vidéo jusqu'à 50 Mo en ligne ou 512 Mo via l'API Files, et renvoie du texte. Il prend en charge l'appel d'outils, la réflexion étant optionnelle plutôt que systématique. |
| minimax-music-v3.0 | MiniMax | $0.1481 | par requête | MiniMax Music 3.0 — génération synchrone de chansons complètes à partir d'un prompt musical et de paroles facultatives, avec mode instrumental, optimisation des paroles et sortie audio sous forme d'URL ou en hex. Les prompts acceptent jusqu'à 2 000 caractères et les paroles jusqu'à 3 500 caractères. | |||
| muse-spark-1.2-contributor | Meta | $0.1000 | $0.2000 | $0.0650 | $0.1300 | par 1M tokens | Meta peut utiliser les prompts envoyés à ce modèle et les réponses qu'il génère pour entraîner ses futurs modèles, conformément aux conditions de son niveau Contributor ; n'envoyez pas de données sensibles ou confidentielles. Meta Muse Spark 1.2 (niveau Contributor) est la version précédente de Muse Spark. C'est un modèle de raisonnement : il raisonne toujours avant de répondre, et le raisonnement ne peut pas être désactivé. reasoning_effort accepte minimal, low, medium, high ou xhigh ; none et max ne sont pas pris en charge à ce niveau, et lorsque reasoning_effort est omis, le modèle choisit le niveau. Les tokens de raisonnement sont facturés comme des tokens de sortie, et l'entrée mise en cache est facturée au tarif de l'entrée mise en cache. La recherche web n'est pas disponible, et les requêtes qui incluent la recherche web ou tout type d'outil autre que function sont refusées. Envoyez les requêtes à /v1/chat/completions. |
| muse-spark-1.3-contributor | Meta | $0.1000 | $0.2000 | $0.0650 | $0.1300 | par 1M tokens | Meta peut utiliser les prompts envoyés à ce modèle et les réponses qu'il génère pour entraîner ses futurs modèles, conformément aux conditions de son niveau Contributor ; n'envoyez pas de données sensibles ou confidentielles. Meta Muse Spark 1.3 (niveau Contributor) est la version la plus récente de Muse Spark, optimisée pour les workflows agentiques et la programmation. C'est un modèle de raisonnement : il raisonne toujours avant de répondre, et le raisonnement ne peut pas être désactivé. reasoning_effort accepte minimal, low, medium, high ou xhigh ; none et max ne sont pas pris en charge à ce niveau, et lorsque reasoning_effort est omis, le modèle choisit le niveau. Les tokens de raisonnement sont facturés comme des tokens de sortie, et l'entrée mise en cache est facturée au tarif de l'entrée mise en cache. La recherche web n'est pas disponible, et les requêtes qui incluent la recherche web ou tout type d'outil autre que function sont refusées. Envoyez les requêtes à /v1/chat/completions. |
| qwen-audio-3.0-asr-flash | Alibaba | $0.1260 | par heure audio | Alibaba Qwen-Audio-3.0-ASR-Flash — reconnaissance vocale en différé bâtie sur le socle Qwen-Audio 3.0, couvrant 30 langues et les sept grands groupes dialectaux chinois (mandarin, wu, xiang, gan, hakka, min, yue) ainsi que plus de 20 accents régionaux. La prédiction de la ponctuation et la normalisation du texte mettent les nombres, les dates et les montants sous forme standard ; les mots-clés prioritaires et le contexte de l'invite améliorent la précision sur le vocabulaire métier. Il accepte jusqu'à 5 minutes ou 2 Go d'audio par requête. | |||
| qwen-audio-3.0-realtime-flash | Alibaba | $0.2900 | $0.8800 | par 1M tokens | Alibaba Qwen-Audio-3.0-Realtime-Flash — dialogue vocal en duplex intégral sur une session WebSocket, issu de la gamme que le fournisseur donne première au classement général Speech-to-Speech d'Artificial Analysis. Cette version rapide est réglée pour la latence de réponse de bout en bout la plus faible. Connexion par GET /v1/realtime. L'entrée audio et la sortie audio sont facturées sur leurs propres tarifs, nettement plus élevés que celui du texte. | ||
| qwen-audio-3.0-realtime-plus | Alibaba | $1.0000 | $8.0000 | par 1M tokens | Alibaba Qwen-Audio-3.0-Realtime-Plus — dialogue vocal en duplex intégral sur une session WebSocket ; le fournisseur le donne premier au classement général Speech-to-Speech d'Artificial Analysis. La version standard privilégie la qualité de la réponse : le raisonnement vocal reste entier tandis que l'inférence parallèle et le streaming de bout en bout maintiennent une latence de réponse basse. Connexion par GET /v1/realtime. L'entrée audio et la sortie audio sont facturées sur leurs propres tarifs, nettement plus élevés que celui du texte. | ||
| qwen-audio-3.0-tts-flash | Alibaba | $0.1800 | par 10 k caractères | Alibaba Qwen-Audio-3.0-TTS-Flash — synthèse vocale sur la base Qwen-Audio 3.0, réglée pour l'interaction temps réel et couvrant davantage de langues minoritaires et de dialectes chinois que la génération précédente. Le suivi d'instructions en style libre et des balises fines pilotent l'émotion, le ton, le personnage, le débit et le volume ; le modèle résiste mieux au bruit et à la réverbération. La version flash optimise la synthèse à faible latence, pour les assistants vocaux, le dialogue en direct et le support client. Facturation au caractère (1 token = 1 caractère). Accessible en requête/réponse comme en session WebSocket temps réel. | |||
| qwen-audio-3.0-tts-plus | Alibaba | $0.2500 | par 10 k caractères | Alibaba Qwen-Audio-3.0-TTS-Plus — synthèse vocale de haute qualité sur la base Qwen-Audio 3.0, couvrant davantage de langues minoritaires et de dialectes chinois que la génération précédente, avec une prononciation dialectale nettement plus authentique. Le suivi d'instructions en style libre et des balises fines pilotent l'émotion, le ton, le personnage, le débit, le volume et le style ; le modèle résiste mieux au bruit et à la réverbération. La version plus privilégie la fidélité et l'expressivité, pour la production de contenu, les livres audio, le doublage et les voix de marque. Facturation au caractère (1 token = 1 caractère). Accessible en requête/réponse comme en session WebSocket temps réel. | |||
| qwen-flash-character | Alibaba | $0.0500 | $0.4000 | par 1M tokens | Alibaba Qwen-Flash-Character — le modèle de jeu de rôle multilingue de Qwen (version dynamique ; le fournisseur annonce les mises à jour à l'avance), ajusté pour des conversations de personnages fidèles à leur persona : suivi d'instructions dans les limites de la persona, progression des sujets de conversation, écoute et empathie. Fenêtre de contexte de 8 192 tokens, texte en entrée et texte en sortie. Pas de mode de réflexion, d'appel d'outils, d'outils intégrés ni de sortie structurée. Le cache de session du fournisseur s'applique automatiquement de son côté. | ||
| qwen-image-3.0 | Alibaba | $0.030 | par requête | Alibaba Qwen-Image-3.0 — la version standard de la gamme d'images Qwen, qui couvre la génération d'images à partir de texte et la retouche d'images, avec un rendu précis des petits caractères (jusqu'à 10 px), de 12 langues et de plus de 20 polices. Il accepte des invites jusqu'à 4 500 tokens, renvoie jusqu'à 6 images par requête et génère jusqu'à 2048x2048. | |||
| qwen-image-3.0-pro | Alibaba | $0.040 | par requête | Alibaba Qwen-Image-3.0-Pro — la version professionnelle de la gamme d'images Qwen, conçue pour produire en une seule génération des mises en page denses et riches en information (journaux, storyboards, menus, sujets d'examen). Il accepte des invites jusqu'à 4 500 tokens, restitue des caractères de 10 px, 12 langues et plus de 20 polices, renvoie jusqu'à 6 images par requête et génère jusqu'à 2048x2048. Génération d'images à partir de texte et retouche d'images. | |||
| qwen-mt-image-2.0 | Alibaba | $0.0006 | par requête | Alibaba Qwen-MT-Image 2.0 — traduction d'images : réécrit dans une autre langue le texte contenu dans une image, en préservant la mise en page, les polices et l'illustration environnante, entre 55 langues et dans tous les sens. Appelez-le sur l'endpoint OpenAI images/edits avec l'URL http(s) publique d'une image dans le champ image, plus target_lang (obligatoire ; code ISO ou nom en anglais) et source_lang (facultatif, auto par défaut) ; prompt est exigé par la forme de l'endpoint mais ignoré. L'objet facultatif ext transmet tels quels les paramètres domainHint, sensitives, terminologies et config.imageSegment du fournisseur. Renvoie une URL de JPG de même taille, valable 24 heures. Entrée de 15 à 8192 px par côté, rapport d'aspect de 1:10 à 10:1, jusqu'à 100 Mo ; les fichiers importés et les data URL ne sont pas acceptés. Le fournisseur limite ce modèle à 1 requête par minute et facture une image même lorsqu'il n'y trouve aucun texte à traduire (l'original est alors renvoyé). Servi par un seul canal officiel d'Alibaba. | |||
| qwen3-asr-flash | Alibaba | $0.1260 | par heure audio | Alibaba Qwen3-ASR-Flash — reconnaissance vocale bâtie sur le modèle de fondation Qwen3, qui détermine automatiquement la langue parlée et transcrit 11 langues ; la gamme Qwen3-ASR documente le mandarin aux côtés du sichuanais, du minnan, du wu et du cantonais, ainsi que plusieurs accents anglais. Elle accepte les formats aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma et wmv, jusqu'à 5 minutes et 10 Mo par requête ; l'entrée pcm doit être en 16 kHz et les autres formats sont rééchantillonnés à 16 kHz avant la reconnaissance. | |||
| qwen3-tts-flash | Alibaba | $0.1100 | par 10 k caractères | Alibaba Qwen3-TTS-Flash — synthèse vocale à faible latence avec 17 voix intégrées expressives, couvrant le chinois, l'anglais, l'allemand, l'italien, le portugais, l'espagnol, le japonais, le coréen, le français et le russe, plus un mode automatique pour les textes mêlant plusieurs langues et une sortie en dialecte. Elle accepte jusqu'à 512 tokens de texte par requête et prend en charge la synthèse en streaming comme hors streaming. | |||
| qwen3.5-livetranslate-flash-realtime | Alibaba | $0.5500 | $20.0000 | par 1M tokens | Alibaba Qwen3.5-LiveTranslate-Flash-Realtime — interprétation simultanée audio et vidéo sur une session WebSocket, bâtie sur la base Qwen3.5-Omni avec alignement translingue et transmodal et renforcement visuel. Il écoute 60 langues et en parle 29. Connexion par GET /v1/realtime. Sa structure tarifaire diffère des autres modèles temps réel : **il n'existe pas de tarif d'entrée texte** — l'entrée est facturée comme audio ou image, et la sortie comme texte ou audio. | ||
| qwen3.5-ocr | Alibaba | $0.1000 | $0.3500 | par 1M tokens | Alibaba Qwen3.5-OCR — le membre OCR de la gamme Qwen3.5, conçu pour l'analyse de documents, la localisation de texte et l'extraction d'informations clés ; le fournisseur fait état de gains marqués sur les pièces d'identité et les permis réellement rencontrés en production. Il accepte le texte et l'image en entrée et renvoie du texte. | ||
| qwen3.5-omni-flash | Alibaba | $0.4000 | $2.2000 | par 1M tokens | Alibaba Qwen3.5-Omni-Flash — la version rapide de la gamme omni-modale Qwen3.5, qui comprend et dialogue à travers le texte, l'image, l'audio et la vidéo sonore. Il traite plus de 10 heures d'audio et plus de 400 secondes de vidéo sonore en 720P (1 FPS) par conversation, avec une entrée audio dans plus de 60 langues et une sortie vocale dans plus de 30. L'entrée audio et la sortie contenant de l'audio sont facturées sur leurs propres tarifs, plus élevés que celui du texte. | ||
| qwen3.5-omni-flash-realtime | Alibaba | $0.5500 | $3.3000 | par 1M tokens | Alibaba Qwen3.5-Omni-Flash-Realtime — la version temps réel rapide de la gamme omni-modale Qwen3.5, maintenue ouverte comme une session WebSocket pour un dialogue vocal en duplex intégral. Il comprend le texte, l'image, l'audio et la vidéo sonore, accepte l'audio dans plus de 60 langues et parle dans plus de 30, avec une voix pilotable, la recherche web, l'appel de fonctions complexes et l'interruption sémantique. Connexion par GET /v1/realtime. L'entrée audio et la sortie contenant de l'audio sont facturées sur leurs propres tarifs, nettement plus élevés que celui du texte. | ||
| qwen3.5-omni-plus | Alibaba | $1.4000 | $8.3000 | par 1M tokens | Alibaba Qwen3.5-Omni-Plus — la version performante de la gamme omni-modale Qwen3.5, qui comprend et dialogue à travers le texte, l'image, l'audio et la vidéo sonore. Il traite plus de 10 heures d'audio et plus de 400 secondes de vidéo sonore en 720P (1 FPS) par conversation, avec une entrée audio dans plus de 60 langues et une sortie vocale dans plus de 30. Fenêtre de contexte de 65 536 tokens. L'entrée audio et la sortie contenant de l'audio sont facturées sur leurs propres tarifs, plus élevés que celui du texte. | ||
| qwen3.5-omni-plus-realtime | Alibaba | $2.1000 | $12.4000 | par 1M tokens | Alibaba Qwen3.5-Omni-Plus-Realtime — la version temps réel de la gamme omni-modale Qwen3.5, maintenue ouverte comme une session WebSocket pour un dialogue vocal en duplex intégral. Il comprend le texte, l'image, l'audio et la vidéo sonore, accepte l'audio dans plus de 60 langues et parle dans plus de 30, avec une voix pilotable, la recherche web, l'appel de fonctions complexes et l'interruption sémantique. Connexion par GET /v1/realtime. L'entrée audio et la sortie contenant de l'audio sont facturées sur leurs propres tarifs, nettement plus élevés que celui du texte. | ||
| qwen3.6-27b | Alibaba | $0.6000 | $3.6000 | par 1M tokens | Alibaba Qwen3.6-27B — le modèle dense vision-langage natif à 27 milliards de paramètres de la gamme Qwen3.6, à poids ouverts, que le fournisseur place au-dessus de 3.5-27B sur la programmation agentique, les STEM et le raisonnement, ainsi que sur l'intelligence spatiale, la localisation et la détection d'objets. Fenêtre de contexte de 262 144 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte. | ||
| qwen3.6-35b-a3b | Alibaba | $0.3750 | $2.2500 | par 1M tokens | Alibaba Qwen3.6-35B-A3B — un modèle MoE vision-langage natif de 35 milliards de paramètres dont environ 3 milliards sont actifs, à poids ouverts, qui associe l'attention linéaire à un mélange creux d'experts pour gagner en efficacité d'inférence. Fenêtre de contexte de 262 144 tokens, jusqu'à 65 536 tokens de sortie et jusqu'à 256 images ou 64 vidéos par requête. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte. Il prend en charge l'appel de fonctions, les outils intégrés et les sorties structurées. | ||
| qwen3.6-flash | Alibaba | $0.2500 | $1.5000 | par 1M tokens | Alibaba Qwen3.6-Flash — modèle vision-langage rapide que le fournisseur met en avant pour la programmation agentique et pour l'intelligence spatiale, avec des gains marqués en localisation et en détection d'objets. Fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 65 536 tokens de sortie et un budget de chaîne de raisonnement de 131 072 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte. Il prend en charge l'appel de fonctions et la mise en cache du contexte. | ||
| qwen3.6-plus | Alibaba | $0.5000 | $3.0000 | $0.4250 | $2.5500 | par 1M tokens | Alibaba Qwen3.6-Plus — modèle équilibré pour le raisonnement généraliste et l'usage d'outils, avec une fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 65 536 tokens de sortie et un budget de chaîne de raisonnement de 81 920 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte. Il prend en charge l'appel de fonctions, les sorties structurées, la recherche web, la complétion de préfixe et la mise en cache du contexte. |
| qwen3.7-flash | Alibaba | $0.0300 | $0.1300 | par 1M tokens | Alibaba Qwen3.7-Flash — la version rapide de la gamme vision-langage native Qwen3.7, que le fournisseur met en avant pour le travail d'agents multimodaux (agents de recherche et d'intégration continue) et pour une exécution de bout en bout plus régulière que 3.6-Flash. Fenêtre de contexte de 1 000 000 tokens, jusqu'à 65 536 tokens de sortie et jusqu'à 256 images ou 64 vidéos par requête. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte. Il prend en charge le mode de réflexion, l'appel de fonctions, les outils intégrés et les sorties structurées. La tarification comporte trois paliers de contexte : une requête à contexte long coûte davantage par token qu'une requête courte. | ||
| qwen3.7-max | Alibaba | $2.5000 | $7.5000 | par 1M tokens | Alibaba Qwen3.7-Max — modèle phare propriétaire positionné sur la programmation, le travail de bureau et la productivité, et l'exécution autonome de longue durée, avec une fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 131 072 tokens de sortie et un budget de chaîne de raisonnement de 262 144 tokens. Texte en entrée, texte en sortie. Il prend en charge l'appel de fonctions, les sorties structurées et la mise en cache du contexte. | ||
| qwen3.7-plus | Alibaba | $0.4000 | $1.6000 | $0.3000 | $1.2000 | par 1M tokens | Alibaba Qwen3.7-Plus — modèle d'agent hybride multimodal qui perçoit les scènes du monde réel, lit les écrans et pilote les interfaces graphiques, génère du code à partir de références visuelles et effectue une navigation de bout en bout dans les applications mobiles. Fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 131 072 tokens de sortie et un budget de chaîne de raisonnement de 262 144 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte ; il prend en charge l'appel de fonctions, les sorties structurées et la mise en cache du contexte. |
| qwen3.8-2.4t-a95b | Alibaba | $2.0000 | $6.0000 | par 1M tokens | Alibaba Qwen3.8-2.4T-A95B — la version à poids ouverts du modèle phare Qwen3.8, un MoE creux de 2 400 milliards de paramètres au total dont environ 95 milliards sont activés à chaque étape, avec une architecture d'attention hybride. Fenêtre de contexte de 1 000 000 tokens. Il accepte le texte en entrée et renvoie du texte. Les modes avec et sans réflexion sont facturés au même tarif et le prix de sortie inclut la chaîne de raisonnement. | ||
| qwen3.8-27b | Alibaba | $0.5000 | $3.0000 | par 1M tokens | Alibaba Qwen3.8-27B — le modèle dense vision-langage natif à 27 milliards de paramètres de la gamme Qwen3.8, à poids ouverts, que le fournisseur place au-dessus de 3.6-27B sur les tâches de codage et de bureautique, dans la modalité texte comme dans la modalité visuelle. Fenêtre de contexte de 1 000 000 tokens. Il accepte le texte et l'image en entrée et renvoie du texte. Les modes avec et sans réflexion sont facturés au même tarif et le prix de sortie inclut la chaîne de raisonnement. | ||
| qwen3.8-flash | Alibaba | $0.1500 | $0.4700 | $0.1125 | $0.3525 | par 1M tokens | Alibaba Qwen3.8-Flash — la version rapide de la gamme Qwen3.8, un modèle nativement multimodal que le fournisseur positionne pour l'assistance au codage, la collaboration entre agents et la compréhension d'images et de documents à haut débit. Fenêtre de contexte de 1 000 000 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte. Il prend en charge le mode de réflexion, l'appel de fonctions, les outils intégrés et les sorties structurées. Il parle à la fois le protocole OpenAI et le protocole Anthropic Messages. |
| qwen3.8-max | Alibaba | $2.0000 | $6.0000 | $1.9000 | $5.7000 | par 1M tokens | Alibaba Qwen3.8-Max — modèle phare MoE de 2 400 milliards de paramètres et le plus performant de la famille Qwen, le fournisseur mettant en avant des gains majeurs en programmation et en travail de bureau. Fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 131 072 tokens de sortie et un budget de chaîne de raisonnement de 262 144 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte ; il prend en charge l'appel de fonctions, les sorties structurées et la mise en cache du contexte. |
| qwen3.8-max-0902 | Alibaba | $2.0000 | $6.0000 | par 1M tokens | Alibaba Qwen3.8-Max-0902 — l'instantané du 2026-09-02 de Qwen3.8-Max (alias du fournisseur qwen3.8-max-2026-09-02), le modèle phare MoE de 2,4 mille milliards de paramètres, figé pour que les intégrations puissent épingler exactement cette version ; le fournisseur met en avant une programmation plus poussée pour les projets d'ingénierie complexes et le développement autonome de longue haleine. Fenêtre de contexte de 1 000 000 tokens, jusqu'à 131 072 tokens de sortie ; il accepte le texte, l'image et la vidéo en entrée et renvoie du texte ; il prend en charge le mode de réflexion, l'appel d'outils et la sortie structurée. Le nom dynamique qwen3.8-max passe aux versions plus récentes à mesure que le fournisseur les publie : épinglez ce nom-ci pour rester sur cette version. Facturé à l'identique de qwen3.8-max. | ||
| speech-2.8-hd | MiniMax | $1.0000 | par 10 k caractères | MiniMax speech-2.8-hd — le palier haute définition de la gamme vocale 2.8, positionné sur un rendu ultra-réaliste avec balises sonores, couvrant 40 langues et 7 émotions. La hauteur, le débit de parole, le volume, la fréquence d'échantillonnage, le débit binaire et le format de sortie se configurent requête par requête, et la synthèse de textes longs accepte jusqu'à 1 million de caractères en asynchrone ou 10 000 caractères via l'interface de streaming. | |||
| speech-2.8-turbo | MiniMax | $0.6000 | par 10 k caractères | MiniMax speech-2.8-turbo — le palier à faible latence de la gamme vocale 2.8, qui troque le rendu ultra-réaliste du modèle HD contre une synthèse plus rapide au débit naturel. Il couvre les mêmes 40 langues et 7 émotions, avec hauteur, débit de parole, volume, fréquence d'échantillonnage, débit binaire et format de sortie configurables, et accepte jusqu'à 1 million de caractères en asynchrone ou 10 000 caractères via l'interface de streaming. | |||
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | par 1M tokens | StepFun step-3.5-flash — modèle de raisonnement texte uniquement doté d'un contexte de 256K, destiné à la logique, aux mathématiques, à l'ingénierie logicielle et à la recherche approfondie, là où la qualité du raisonnement doit s'accompagner d'une exécution rapide et fiable. La profondeur de raisonnement se choisit requête par requête via reasoning_effort (low / medium / high). Prend en charge l'appel d'outils, la sortie structurée par JSON Schema, le streaming et la mise en cache des prompts. Pour une entrée image ou vidéo, utilisez step-3.7-flash. | ||
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | par 1M tokens | StepFun step-3.5-flash-2603 — instantané 256K de step-3.5-flash ajusté pour les agents, optimisé pour l'efficacité en tokens et un mode d'inférence réduite. Son paramètre reasoning_effort n'accepte que low et high, là où le modèle de base en accepte trois niveaux : le code qui envoie medium doit donc être adapté. Texte uniquement ; prend en charge l'appel d'outils, la sortie structurée par JSON Schema, le streaming et la mise en cache des prompts. | ||
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | par 1M tokens | StepFun step-3.7-flash — MoE clairsemé de 198 milliards de paramètres au total et 11 milliards actifs, avec un contexte natif de 256K et une compréhension native des images et des vidéos en plus du texte. La profondeur de raisonnement se choisit requête par requête via reasoning_effort (low / medium / high), et le modèle prend en charge l'appel d'outils multi-étapes fiable, la sortie structurée par JSON Schema, le streaming et la mise en cache des prompts. Ajusté pour les charges de travail d'agents et de programmation. Sur /v1/responses, envoyez l'intégralité de la conversation dans le tableau input à chaque tour : aucun état de conversation n'est conservé en amont, de sorte que les requêtes qui contiennent previous_response_id ou conversation sont refusées. | ||
| step-5-preview | StepFun | $1.0000 | $2.7000 | par 1M tokens | StepFun step-5-preview — nouveau modèle phare de StepFun pour la programmation et le travail intellectuel spécialisé, publié en préversion. Contexte de 1M de tokens avec jusqu'à 64K tokens en sortie, et compréhension native des images et des vidéos en plus du texte. Le raisonnement est toujours actif : il est renvoyé dans reasoning_content sur /v1/chat/completions et sous forme de blocs thinking sur /v1/messages, il est facturé comme de la sortie et puise dans max_tokens, si bien qu'une limite de quelques centaines de tokens peut être entièrement consommée par le raisonnement et ne renvoyer aucun texte ; prévoyez une marge confortable. La profondeur se choisit requête par requête via reasoning_effort (low / medium / high). Prend en charge l'appel d'outils multi-étapes, la sortie structurée par JSON Mode et JSON Schema, le streaming et la mise en cache des prompts. Conçu pour l'analyse de longs documents, l'ingénierie logicielle et le travail d'agents en plusieurs étapes. Sur /v1/responses, envoyez l'intégralité de la conversation dans le tableau input à chaque tour : aucun état de conversation n'est conservé en amont, de sorte que les requêtes qui contiennent previous_response_id ou conversation sont refusées. | ||
| step-audio-2 | StepFun | $1.4815 | $10.3704 | par 1M tokens | StepFun step-audio-2 — modèle vocal de bout en bout qui consomme directement l'audio au lieu de partir d'une transcription, de sorte que le ton et l'intonation parviennent jusqu'à la compréhension du modèle. Facturé au token, avec le tarif d'entrée de la gamme StepAudio 2.5 et un tarif de sortie plus élevé. StepFun ne publie pas de page de capacités distincte pour ce modèle ; consultez la documentation audio de la plateforme pour connaître les paramètres en vigueur. | ||
| step-tts-2 | StepFun | $0.4148 | par 10 k caractères | StepFun step-tts-2 — synthèse vocale de bout en bout fondée sur NTP et conçue pour reproduire fidèlement les accents. Elle parle le chinois, l'anglais, le mélange chinois-anglais et le japonais, ainsi que le cantonais et le sichuanais. L'émotion et l'intonation se dirigent par des indications en langage naturel, et le clonage vocal zero-shot demande environ 10 secondes d'audio de référence, les contrôles d'émotion et de style se reportant sur la voix clonée sans coût supplémentaire. Sorties en wav, mp3, flac, opus ou pcm. | |||
| stepaudio-2-asr-pro | StepFun | $0.2963 | par heure audio | StepFun StepAudio 2 ASR Pro — modèle de reconnaissance vocale de 32 milliards de paramètres, l'option privilégiant la précision dans la gamme ASR de StepFun, là où stepaudio-2.5-asr privilégie la vitesse et le coût. Accepte les fichiers ogg, mp3 et wav ; la transcription produite n'est pas facturée. | |||
| stepaudio-2.5-asr | StepFun | $0.0220 | par heure audio | StepFun StepAudio 2.5 ASR — modèle de reconnaissance vocale de 4 milliards de paramètres bâti sur le Multi-Token Prediction, qui transcrit cinq minutes d'audio en une seconde environ (RTF d'environ 0,0053). Optimisé pour le chinois et l'anglais. Il inclut la normalisation inverse du texte, l'identification des locuteurs et la séparation en deux canaux pour les enregistrements d'appels et de réunions. Accepte les fichiers ogg, mp3 et wav ; la transcription produite n'est pas facturée. | |||
| stepaudio-2.5-asr-stream | StepFun | $0.1800 | par heure audio | StepFun StepAudio 2.5 ASR Stream — la version de reconnaissance en streaming de StepAudio 2.5 ASR (un modèle de reconnaissance vocale de 4 milliards de paramètres bâti sur le Multi-Token Prediction, optimisé pour le chinois et l'anglais), et le modèle en streaming recommandé par StepFun. Sur cette passerelle, l'appel se fait comme pour les autres modèles de transcription : envoyez un enregistrement complet à /v1/audio/transcriptions et la transcription intégrale est renvoyée en une seule réponse une fois la reconnaissance terminée ; les résultats partiels ne sont pas renvoyés en streaming, et ce modèle coûte plus cher par minute d'audio que stepaudio-2.5-asr. La normalisation inverse du texte est appliquée. Accepte uniquement les fichiers wav PCM 16 bits et ogg (le mp3 n'est pas accepté) ; la transcription produite n'est pas facturée. | |||
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | par 1M tokens | StepFun StepAudio 2.5 Chat — modèle de compréhension vocale de bout en bout : il reçoit de l'audio ou du texte et renvoie du texte, en lisant les signaux paralinguistiques comme l'hésitation ou le rire directement dans la forme d'onde plutôt que dans une transcription. Il prend en charge une personnalisation poussée des personas, couvrant le caractère, les habitudes de parole et l'amplitude émotionnelle. L'audio se transmet sous forme de parties de contenu input_audio sur l'endpoint chat completions. Pour des réponses parlées, utilisez un modèle TTS. | ||
| stepaudio-2.5-realtime | StepFun | $1.5000 | $10.0000 | par 1M tokens | StepFun StepAudio 2.5 Realtime — modèle parole-à-parole de bout en bout, via une session WebSocket sur GET /v1/realtime : audio ou texte en entrée en streaming, audio en streaming accompagné d'une transcription textuelle en sortie, avec détection d'activité vocale côté serveur et interruption. L'audio est en PCM16, 24 kHz, mono ; le fournisseur indique l'anglais comme langue prise en charge. Définissez explicitement la voix dans session.update : seules les voix répertoriées par StepFun sont acceptées. | ||
| stepaudio-2.5-tts | StepFun | $0.8500 | par 10 k caractères | StepFun StepAudio 2.5 TTS — synthèse vocale contextuelle qui fait circuler la compréhension dans toute la chaîne de génération au lieu de traiter l'intonation comme un post-traitement. La voix, l'émotion et le rythme se dirigent en langage naturel à deux niveaux : un contexte global pour la requête et un contexte en ligne pour chaque passage. Le clonage vocal zero-shot demande environ 3 secondes d'audio de référence et hérite de l'ensemble des contrôles contextuels. Accepte jusqu'à 1000 caractères par requête ; sorties en wav, mp3, flac ou opus. | |||
| stepaudio-3-asr-max | StepFun | $0.4000 | par heure audio | StepFun StepAudio 3 ASR Max — le plus grand modèle de reconnaissance vocale de StepFun, bâti sur un grand modèle de langage, si bien que la reconnaissance s'appuie sur le contexte et les connaissances du domaine : il est plus performant sur les noms propres, les noms de médicaments, les termes techniques et les homophones, sur le mélange chinois-anglais, les dialectes et les longs enregistrements audio, ainsi que sur la parole chuchotée, très rapide ou accompagnée de musique, y compris les paroles chantées. Envoyez un fichier audio à POST /v1/audio/transcriptions (WAV, MP3 ou OGG) ; facturation à la durée de l'audio. | |||
| stepaudio-3-chat-preview | StepFun | $0.0000 | par 1M tokens | StepFun StepAudio 3 Chat (préversion) — modèle de dialogue à compréhension vocale sur POST /v1/chat/completions : envoyez, tour après tour, de la parole sous forme de parties de contenu input_audio, ou du texte, et recevez du texte en retour, avec appel d'outils. Gratuit tant que dure la préversion de StepFun. À la fin de la période gratuite, StepFun retire le nom de préversion et publie une version payante ; prévoyez donc que cet identifiant de modèle cessera de fonctionner à ce moment-là. | |||
| stepaudio-3-gen-preview | StepFun | $0.000 | par requête | StepFun StepAudio 3 Audio Generation (préversion) — génération audio à partir d'un script, de la série StepAudio 3, sur POST /v1/audio/generate : définissez des rôles avec un nom et une description de voix en langage courant, écrivez le script ligne par ligne (les lignes entre crochets deviennent des effets sonores ou une musique de fond), ajoutez une instruction générale, et l'audio terminé revient sous forme d'octets (mp3 par défaut). Les voix naissent des descriptions de rôle ; les noms de voix prédéfinis ne sont pas acceptés. Les champs de la requête suivent la référence d'API de StepFun. Gratuit tant que dure la préversion de StepFun. À la fin de la période gratuite, StepFun retire le nom de préversion et publie une version payante ; prévoyez donc que cet identifiant de modèle cessera de fonctionner à ce moment-là. | |||
| stepaudio-3-music-preview | StepFun | $0.000 | par requête | StepFun StepAudio 3 Music (préversion) — génération de musique à partir de texte, de la série StepAudio 3, sur POST /v1/music/generations, avec la même forme de requête que minimax-music-v3.0 : décrivez le style dans prompt, ajoutez des paroles dans lyrics ou définissez is_instrumental, et le morceau terminé revient encodé en hex dans data.audio (mp3 par défaut ; wav, flac, opus ou pcm via audio_setting.format). L'appel est synchrone et un morceau prend généralement d'une à plusieurs minutes : prévoyez un délai d'attente client d'au moins 600 secondes. Les reprises et l'accompagnement d'une voix téléversée ne sont pas proposés. Gratuit tant que dure la préversion de StepFun. À la fin de la période gratuite, StepFun retire le nom de préversion et publie une version payante ; prévoyez donc que cet identifiant de modèle cessera de fonctionner à ce moment-là. | |||
| stepaudio-3-realtime-preview | StepFun | $0.0000 | par 1M tokens | StepFun StepAudio 3 Realtime (préversion) — modèle vocal en duplex intégral de StepFun, via une session WebSocket sur GET /v1/realtime : interruption et alternance des tours de parole naturelles, raisonnement adaptatif tout en parlant et appels d'outils en cours de conversation. Gratuit tant que dure la préversion de StepFun. À la fin de la période gratuite, StepFun retire le nom de préversion et publie une version payante ; prévoyez donc que cet identifiant de modèle cessera de fonctionner. | |||
| stepaudio-3-tts | StepFun | $0.3600 | par 10 k caractères | StepFun StepAudio 3 TTS — synthèse vocale de la série StepAudio 3, conçue pour une élocution de niveau humain : le timbre, l'intonation, le rythme et la respiration suivent la parole naturelle, y compris le rire, l'hésitation et l'autocorrection, et l'émotion et le ton s'adaptent au contenu. Elle est servie sur POST /v1/audio/speech et facturée au caractère du texte d'entrée. | |||
| vidu-video-q3 | Vidu | $0.060 | par seconde | Vidu Q3 — modèle de génération vidéo à partir de références, avec des sujets cohérents, des changements de scène intelligents et une sortie audio/vidéo synchronisée. Il accepte des images de référence ou des sujets nommés ; il génère de 3 à 16 secondes en 540P, 720P ou 1080P. | |||
| vidu-video-q3-pro | Vidu | $0.100 | par seconde | Vidu Q3 Pro — texte vers vidéo, image vers vidéo et génération à partir d'images de début et de fin, axés sur la qualité, avec une sortie audio/vidéo synchronisée. Génère de 1 à 16 secondes en 540P, 720P ou 1080P ; la génération vidéo à partir de références n'est pas prise en charge par ce SKU. | |||
| vidu-video-q3-turbo | Vidu | $0.055 | par seconde | Vidu Q3 Turbo — le palier Q3 rapide et économique pour la génération vidéo à partir de texte, d'image, d'images de début et de fin ou de références, avec une sortie audio/vidéo synchronisée. Génère de 1 à 16 secondes dans les modes normaux, ou de 3 à 16 secondes en mode référence, de 540P à 1080P. | |||
| wan2.7-i2v | Alibaba | $0.100 | par seconde | Alibaba Wan 2.7 Image-to-Video — couvre la génération à partir de la première image, les transitions entre première et dernière image, et la continuation d'un clip existant. Produit du 720P ou du 1080P (1080P par défaut) de 2 à 15 secondes, 5 s par défaut, à partir de prompts jusqu'à 5000 caractères (prompts négatifs jusqu'à 500 caractères). Une piste mp3 ou wav de 2 à 30 secondes peut être fournie comme driving_audio ; sans audio, le modèle génère une musique de fond ou des effets sonores adaptés, un audio plus long que le clip est tronqué et un audio plus court laisse la fin silencieuse. | |||
| wan2.7-image | Alibaba | $0.030 | par requête | Alibaba Wan2.7 Image — texte vers image, édition d'images, génération avec plusieurs images de référence, édition interactive, tracé du texte et respect des instructions solides. | |||
| wan2.7-image-pro | Alibaba | $0.075 | par requête | Alibaba Wan 2.7 Image Pro — le palier professionnel de la gamme image Wan 2.7, couvrant le texte vers image, les séries d'images, l'édition d'images et la génération à partir de plusieurs images de référence, avec un meilleur respect du prompt. Le texte vers image atteint le 4K (4096x4096), avec des paliers 1K et 2K et des tailles personnalisées à partir de 768x768 ; les modes édition et série plafonnent à 2K. Il accepte jusqu'à 9 images de référence (JPEG, JPG, PNG, BMP, WEBP ; 240 à 8000 px par côté, 20 Mo chacune), des rapports d'aspect de 1:8 à 8:1, et des prompts jusqu'à 5000 caractères. Renvoie du PNG. | |||
| wan2.7-r2v | Alibaba | $0.100 | par seconde | Alibaba Wan2.7 (R2V) — génération vidéo à partir de références, jusqu'à 5 références mixtes image/vidéo plus une référence de timbre audio, avec une meilleure cohérence des personnages, des accessoires et des décors. | |||
| wan2.7-t2v | Alibaba | $0.100 | par seconde | Alibaba Wan2.7 (T2V) — texte vers vidéo avec un jeu d'acteur amélioré, des émotions nuancées, de l'action intense et des coupes de caméra spectaculaires. Produit du MP4 H.264 en 720P ou 1080P, de 2 à 15 secondes (5 s par défaut), en 16:9, 9:16, 1:1, 4:3 ou 3:4, à partir de prompts jusqu'à 5000 caractères. L'audio est inclus par défaut : sans audio_url, le modèle compose une musique de fond ou des effets sonores adaptés, ou bien une piste wav ou mp3 de 2 à 30 secondes peut être fournie à la place. | |||
| wan2.7-videoedit | Alibaba | $0.100 | par seconde | Alibaba Wan2.7 VideoEdit — montage vidéo en langage naturel, local ou global, remplacement d'éléments par image de référence, reproduction des mouvements, des effets et de la caméra. | |||
| wan3.0-video | Alibaba | $0.100 | $0.085 | par seconde | Alibaba Wan3.0 (Video) — modèle vidéo tout-en-un qui unifie le texte vers vidéo, l'image vers vidéo et la génération à partir de références derrière un seul endpoint. Produit du MP4 H.264 en 480P, 720P ou 1080P, jusqu'à 30 secondes, à partir d'un prompt et, en option, de l'URL d'une première image. Facturé à la seconde de vidéo générée selon la grille tarifaire propre au fournisseur : le 720P constitue le tarif de base, le 480P est facturé à la moitié et le 1080P au double. Une requête qui ne précise pas de résolution est produite en 1080P par le modèle et facturée à ce palier. Les entrées vidéo de référence et audio de référence existent dans le modèle du fournisseur mais ne sont pas prises en charge sur cet endpoint. | ||
| wan3.0-video-prime | Alibaba | $0.140 | par seconde | Alibaba Wan3.0 Video Prime — le palier rapide du modèle vidéo tout-en-un Wan 3.0, qui offre les mêmes capacités que le palier standard avec une vitesse de génération plus élevée. Texte vers vidéo, image vers vidéo par première/dernière image et vidéo à partir d'images de référence (jusqu'à 10 images de référence) derrière un seul endpoint ; MP4 H.264 en 480P, 720P ou 1080P, de 2 à 30 secondes, 30 fps, avec audio par défaut. Facturé à la seconde de vidéo générée selon la grille tarifaire du fournisseur : le 720P constitue le tarif de base, le 480P coûte un peu moins de la moitié de ce tarif et le 1080P le double. Une requête qui ne précise aucune résolution est rendue dans la résolution par défaut du fournisseur, 1080P, et facturée à ce palier. Les entrées vidéo de référence, audio de référence, fichier et lien web ne sont pas acceptées sur cette passerelle, et la durée intelligente (-1) est rejetée ; indiquez la durée explicitement. Servi par un seul canal officiel d'Alibaba. |