Tarifs des modèles d'IA chinois

ChinaAPI donne accès à DeepSeek, Qwen, GLM, Kimi et aux autres modèles d'IA chinois via une passerelle compatible OpenAI à l'adresse https://api.chinaapi.ai/v1. Tous les tarifs sont en dollars américains, exprimés dans l'unité utilisée par le fournisseur en amont. La même liste est disponible en JSON à l'adresse /api/pricing.

Tarifs des modèles publics
ModèleFournisseurEntréeSortieUnitéDescription
wan2.7-t2v阿里巴巴$0.092par secondeAlibaba Wan2.7 (T2V) — texte vers vidéo avec un jeu d'acteur amélioré, des émotions nuancées, de l'action intense et des coupes de caméra spectaculaires. Produit du MP4 H.264 en 720P ou 1080P, de 2 à 15 secondes (5 s par défaut), en 16:9, 9:16, 1:1, 4:3 ou 3:4, à partir de prompts jusqu'à 5000 caractères. L'audio est inclus par défaut : sans audio_url, le modèle compose une musique de fond ou des effets sonores adaptés, ou bien une piste wav ou mp3 de 2 à 30 secondes peut être fournie à la place.
agnes-image-2.0-flashAgnes AI$0.000par requêteAgnes AI Image 2.0 Flash — modèle rapide de génération et d'édition d'images pour le texte vers image, l'image vers image et la composition multi-images ; les résultats sont disponibles sous forme d'URL ou de données Base64.
doubao-seedance-2-0-mini-260615字节跳动$3.5000$3.5000par 1M tokensByteDance Seedance 2.0 Mini — le palier léger et économique de la gamme Seedance 2.0, plafonné à 480p et 720p, 24 fps, 4 à 15 secondes. Il reprend le même ensemble de fonctionnalités documenté que le reste de la gamme : texte vers vidéo, image vers vidéo depuis la première image ou depuis la première et la dernière, génération multimodale par référence à partir de 1 à 9 images et de 3 vidéos de référence au maximum totalisant 15 secondes, montage vidéo, extension de vidéo, génération avec audio et un outil de recherche web ; une référence audio doit obligatoirement accompagner une image ou une vidéo. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16.
step-3.5-flash-2603StepFun$0.1000$0.3000par 1M tokensStepFun step-3.5-flash-2603 — instantané 256K de step-3.5-flash ajusté pour les agents, optimisé pour l'efficacité en tokens et un mode d'inférence réduite. Son paramètre reasoning_effort n'accepte que low et high, là où le modèle de base en accepte trois niveaux : le code qui envoie medium doit donc être adapté. Texte uniquement ; prend en charge l'appel d'outils, la sortie structurée par JSON Schema, le streaming et la mise en cache des prompts.
deepseek-v4-flashDeepSeek$0.1400$0.2800par 1M tokensDeepSeek V4 Flash — le palier DeepSeek V4 rapide et à forte concurrence pour le chat, l'aide à la programmation et les boucles d'agents, avec une fenêtre de contexte de 1M tokens et une sortie maximale de 384K. Il fonctionne en mode de réflexion (par défaut) comme sans réflexion, et prend en charge l'appel d'outils et la sortie JSON. Texte en entrée, texte en sortie.
doubao-seedream-4-5-251128字节跳动$0.038par requêteByteDance Doubao Seedream 4.5 — texte vers image et image vers image avec fusion multi-images, produisant soit une image unique, soit une série d'images liées. Le mode image unique accepte un prompt seul, une image de référence, ou 2 à 14 images de référence ; le mode série (sequential_image_generation=auto) renvoie jusqu'à 15 images à partir d'un texte, jusqu'à 14 à partir d'une seule image de référence, ou une série à partir de 2 à 14 références à condition que le total des entrées et des sorties reste inférieur ou égal à 15. Il prend en charge les sorties 2K et 4K et renvoie du JPEG par défaut, sous forme d'URL ou de base64. L'édition interactive par coordonnées est réservée à Seedream 5.0 pro.
mimo-v2.5-ttsXiaomi$0.0000par 10 k caractèresXiaomi MiMo v2.5 TTS — synthèse vocale expressive avec huit voix intégrées, quatre chinoises et quatre anglaises (Mia, Chloe, Milo, Dean), couvrant le chinois et l'anglais ainsi que les styles dialectaux du Nord-Est, du Sichuan, du Henan et du cantonais. L'intonation se dirige de deux façons : des instructions de style en langage naturel, et des balises audio en ligne pour les émotions simples et composées, la respiration, les soupirs et le rythme, y compris un mode chanté propre à ce modèle dans la gamme MiMo TTS. Renvoie du wav mono ou du pcm16 à 24 kHz et prend en charge le streaming à faible latence, qui exige le pcm16. Contexte de 8K et sortie maximale de 8K.
MiniMax-H3MiniMax$0.080par secondeMiniMax H3 (Hailuo 3.0) — modèle vidéo multimodal généraliste ouvert de nouvelle génération, produisant un audio stéréo natif en une seule passe, en 768P ou 2K, sur 4 à 15 secondes (nombres entiers uniquement), à 24 fps. Il couvre le texte vers vidéo, l'image vers vidéo à partir d'une première et/ou d'une dernière image, et la génération par référence à partir d'images, de vidéos ou d'audio pour le personnage, le mouvement, la caméra, le style, la voix ou le rythme de montage ; l'image vers vidéo et la génération par référence ne peuvent pas être combinées dans une même requête. Il accepte la vidéo H.264/H.265, les images JPG, JPEG, PNG, WEBP, HEIC et HEIF, et l'audio WAV ou MP3, avec des prompts jusqu'à 7000 caractères. $0,08/s en 768P, $0,13/s en 2K.
doubao-seed-2-1-pro-260628字节跳动$0.9230$4.6150par 1M tokensByteDance Doubao Seed 2.1 Pro — modèle d'agent phare de Doubao pour le travail en production, couvrant la réflexion approfondie, la génération de texte, la compréhension multimodale, l'appel d'outils et la sortie structurée, pour laquelle le fournisseur recommande le mode json_schema. Fenêtre de contexte de 256K avec 256K d'entrée au maximum, jusqu'à 256K tokens de sortie (4K par défaut) et un budget de chaîne de raisonnement de 256K. Il accepte le texte, l'image et la vidéo et renvoie du texte ; la compréhension audio n'est pas listée pour la gamme 2.1. Il prend en charge la mise en cache du contexte implicite comme explicite, y compris les caches de préfixe et de session.
image-01MiniMax$0.004par requêteMiniMax image-01 — génération d'images à partir de texte via l'endpoint natif image_generation de MiniMax. Facturé à l'image générée. Le fournisseur le classe parmi ses modèles historiques.
MiniMax-M2.7MiniMax$0.2880$1.1510par 1M tokensMiniMax M2.7 — modèle texte pour le chat, la programmation, le travail de bureau et les tâches agentiques, avec une fenêtre de contexte de 204 800 tokens et une sortie à environ 60 tokens par seconde. Texte uniquement : l'API accepte des blocs de contenu texte et appel d'outil, mais ni images ni vidéo. Il prend en charge l'appel d'outils ; la réflexion est toujours active et ne peut pas être désactivée.
qwen3.6-flash阿里巴巴$0.1850$1.1080par 1M tokensAlibaba Qwen3.6-Flash — modèle vision-langage rapide que le fournisseur met en avant pour la programmation agentique et pour l'intelligence spatiale, avec des gains marqués en localisation et en détection d'objets. Fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 65 536 tokens de sortie et un budget de chaîne de raisonnement de 131 072 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte. Il prend en charge l'appel de fonctions et la mise en cache du contexte.
step-audio-r1.5StepFun$1.5500$16.2750par 1M tokensStepFun step-audio-r1.5 — modèle vocal de bout en bout de la même famille que step-audio-2, dont il partage le tarif d'entrée tout en facturant la sortie 50 % plus cher. StepFun ne publie pas de page de capacités distincte pour ce modèle ; consultez la documentation audio de la plateforme pour connaître les paramètres en vigueur.
stepaudio-2.5-ttsStepFun$0.8500par 10 k caractèresStepFun StepAudio 2.5 TTS — synthèse vocale contextuelle qui fait circuler la compréhension dans toute la chaîne de génération au lieu de traiter l'intonation comme un post-traitement. La voix, l'émotion et le rythme se dirigent en langage naturel à deux niveaux : un contexte global pour la requête et un contexte en ligne pour chaque passage. Le clonage vocal zero-shot demande environ 3 secondes d'audio de référence et hérite de l'ensemble des contrôles contextuels. Accepte jusqu'à 1000 caractères par requête ; sorties en wav, mp3, flac ou opus.
kling-v3快手$0.420par requêteKuaishou Kling 3.0 — texte vers vidéo et image vers vidéo avec audio natif et une meilleure cohérence des éléments. Les clips durent de 3 à 15 secondes (5 par défaut) en 16:9, 9:16 ou 1:1, le palier se choisissant via mode : std pour le 720P, pro pour le 1080P et 4k pour le 4K natif. L'audio s'active explicitement par sound=on et reste désactivé par défaut ; l'image vers vidéo prend une première image avec une image de fin facultative. À partir de $0,083/s (720p).
step-audio-2StepFun$1.5500$10.8500par 1M tokensStepFun step-audio-2 — modèle vocal de bout en bout qui consomme directement l'audio au lieu de partir d'une transcription, de sorte que le ton et l'intonation parviennent jusqu'à la compréhension du modèle. Facturé au token, avec le tarif d'entrée de la gamme StepAudio 2.5 et un tarif de sortie plus élevé. StepFun ne publie pas de page de capacités distincte pour ce modèle ; consultez la documentation audio de la plateforme pour connaître les paramètres en vigueur.
step-tts-2StepFun$0.4000par 10 k caractèresStepFun step-tts-2 — synthèse vocale de bout en bout fondée sur NTP et conçue pour reproduire fidèlement les accents. Elle parle le chinois, l'anglais, le mélange chinois-anglais et le japonais, ainsi que le cantonais et le sichuanais. L'émotion et l'intonation se dirigent par des indications en langage naturel, et le clonage vocal zero-shot demande environ 10 secondes d'audio de référence, les contrôles d'émotion et de style se reportant sur la voix clonée sans coût supplémentaire. Sorties en wav, mp3, flac, opus ou pcm.
hy3Tencent$0.1540$0.6150par 1M tokensTencent Hunyuan 3 (Hy3) — modèle MoE de 295 milliards de paramètres (21 milliards actifs), contexte natif de 256K, trois modes de réflexion (fast / low / deep). Solide sur les agents de programmation, la compréhension de longs documents, le contexte multi-tours et les flux de travail d'agents multi-étapes. Texte uniquement.
doubao-seedance-2-0-260128字节跳动$7.0000$7.0000par 1M tokensByteDance Seedance 2.0 — le modèle phare de la gamme Seedance 2.0 et le seul à atteindre le 1080p et le 4K (profondeur 10 bits) en plus du 480p et du 720p, à 24 fps et de 4 à 15 secondes. Il couvre le texte vers vidéo, l'image vers vidéo depuis la première image ou depuis la première et la dernière, la génération multimodale par référence à partir de 1 à 9 images et de 3 vidéos de référence au maximum totalisant 15 secondes, le montage vidéo, l'extension de vidéo, la génération avec audio et un outil de recherche web ; une référence audio doit obligatoirement accompagner une image ou une vidéo. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16, avec l'image de fin récupérable sous forme d'image. Facturé selon la résolution de sortie.
doubao-seedance-2-5-260628字节跳动$10.7000$10.7000par 1M tokensByteDance Seedance 2.5 — le modèle principal de la gamme Seedance, qui étire une génération unique à 4-30 secondes à 24 fps tout en plafonnant la résolution à 480p et 720p. La génération multimodale par référence monte à 1-30 images, jusqu'à 10 vidéos de référence et jusqu'à 10 extraits audio de référence (30 secondes au total pour chaque catégorie), et contrairement à la gamme 2.0, une référence audio peut être utilisée seule. Il couvre aussi le texte vers vidéo, l'image vers vidéo depuis la première image ou depuis la première et la dernière, le montage vidéo, l'extension de vidéo, la génération avec audio et un outil de recherche web. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16.
kimi-k2.7-code-highspeedMoonshot$1.7810$7.3970par 1M tokensMoonshot Kimi K2.7 Code Highspeed — le palier débit de K2.7 Code, qui sert le même modèle à environ 180 tokens par seconde et jusqu'à 260 sur les contextes courts. Fenêtre de contexte de 256K, 32 768 tokens de sortie par défaut. Il accepte le texte, les images et la vidéo sous forme de contenu base64 et renvoie du texte. La réflexion est obligatoire et renvoie une erreur si elle est désactivée ; tool_choice est limité à auto ou none, et reasoning_content doit être transmis d'un appel d'outil à l'autre.
MiniMax-M2.7-highspeedMiniMax$0.5750$2.3010par 1M tokensMiniMax M2.7 Highspeed — le même modèle M2.7 servi à environ 100 tokens par seconde pour la programmation à faible latence et les flux de travail d'agents, avec une fenêtre de contexte de 204 800 tokens. Texte uniquement : l'API accepte des blocs de contenu texte et appel d'outil, mais ni images ni vidéo. Il prend en charge l'appel d'outils ; la réflexion est toujours active et ne peut pas être désactivée.
stepaudio-2.5-asrStepFun$0.0220par heure audioStepFun StepAudio 2.5 ASR — modèle de reconnaissance vocale de 4 milliards de paramètres bâti sur le Multi-Token Prediction, qui transcrit cinq minutes d'audio en une seconde environ (RTF d'environ 0,0053). Optimisé pour le chinois et l'anglais. Il inclut la normalisation inverse du texte, l'identification des locuteurs et la séparation en deux canaux pour les enregistrements d'appels et de réunions. Accepte les fichiers ogg, mp3 et wav ; la transcription produite n'est pas facturée.
doubao-seed-2-1-turbo-260628字节跳动$0.4620$2.3080par 1M tokensByteDance Doubao Seed 2.1 Turbo — la voie à faible latence de la gamme Seed 2.1, qui partage l'enveloppe du Pro : fenêtre de contexte de 256K avec 256K d'entrée au maximum, jusqu'à 256K tokens de sortie (4K par défaut) et un budget de chaîne de raisonnement de 256K. Il couvre la réflexion approfondie, la génération de texte, la compréhension multimodale, l'appel d'outils et la sortie structurée, sans toutefois la recommandation json_schema du Pro. Il accepte le texte, l'image et la vidéo et renvoie du texte ; la compréhension audio n'est pas listée pour la gamme 2.1. Il prend en charge la mise en cache du contexte implicite comme explicite.
kimi-k2.7-codeMoonshot$0.7600$3.1570par 1M tokensMoonshot Kimi K2.7 Code — le modèle dédié à la programmation de Kimi, dont le fournisseur mesure qu'il améliore le respect des instructions et la programmation de longue haleine par rapport à K2.6 tout en réduisant la sur-réflexion d'environ 30 % en moyenne. Fenêtre de contexte de 256K, 32 768 tokens de sortie par défaut. Il accepte le texte, les images et la vidéo sous forme de contenu base64 et renvoie du texte. La réflexion est obligatoire et renvoie une erreur si elle est désactivée ; tool_choice est limité à auto ou none, et reasoning_content doit être transmis d'un appel d'outil à l'autre.
kling-3.0-turbo快手$0.560par requêteKuaishou Kling 3.0 Turbo — le palier économique de la gamme Kling 3.0, qui génère du 720P ou du 1080P (720P par défaut) sur 3 à 15 secondes (5 par défaut) en 16:9, 9:16 ou 1:1, à partir d'un prompt ou d'une première image. L'audio natif est toujours inclus et ne dispose d'aucun interrupteur. Face à kling-v3, il abandonne le palier 4K, le contrôle de l'image de fin et l'entrée vidéo en échange de vitesse et de coût. 720p 5 s avec audio ≈ $0,56.
qwen3-tts-flash阿里巴巴$0.1231par 10 k caractèresAlibaba Qwen3-TTS-Flash — synthèse vocale à faible latence avec 17 voix intégrées expressives, couvrant le chinois, l'anglais, l'allemand, l'italien, le portugais, l'espagnol, le japonais, le coréen, le français et le russe, plus un mode automatique pour les textes mêlant plusieurs langues et une sortie en dialecte. Elle accepte jusqu'à 512 tokens de texte par requête et prend en charge la synthèse en streaming comme hors streaming.
qwen3.6-plus阿里巴巴$0.4000$2.4000par 1M tokensAlibaba Qwen3.6-Plus — modèle équilibré pour le raisonnement généraliste et l'usage d'outils, avec une fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 65 536 tokens de sortie et un budget de chaîne de raisonnement de 81 920 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte. Il prend en charge l'appel de fonctions, les sorties structurées, la recherche web, la complétion de préfixe et la mise en cache du contexte.
stepaudio-2-asr-proStepFun$0.3500par heure audioStepFun StepAudio 2 ASR Pro — modèle de reconnaissance vocale de 32 milliards de paramètres, l'option privilégiant la précision dans la gamme ASR de StepFun, là où stepaudio-2.5-asr privilégie la vitesse et le coût. Accepte les fichiers ogg, mp3 et wav ; la transcription produite n'est pas facturée.
glm-5.2智谱$1.1200$3.5200par 1M tokensZhipu GLM-5.2 — modèle de fondation phare spécialisé dans le travail d'agent de programmation de longue haleine, obtenu par des mois d'entraînement dédié et non par une simple extension de contexte, avec une fenêtre de contexte de 1M tokens et jusqu'à 128K tokens de sortie. Texte en entrée, texte en sortie. Il prend en charge plusieurs modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP.
mimo-v2.5-tts-voicecloneXiaomi$0.0000par 10 k caractèresModèle de clonage vocal de Xiaomi MiMo : fournissez un échantillon audio de référence sous forme de data URL dans le champ voice (data:{mime};base64,...) et il synthétise la parole avec cette voix, sans aucune étape d'entraînement, d'annotation ou de réglage fin. Il accepte le MP3 (audio/mpeg) ou le WAV, la chaîne encodée en base64 étant plafonnée à 10 Mo ; Xiaomi ne publie aucune durée minimale pour l'audio de référence. Les instructions de style en langage naturel et les balises audio en ligne sont reprises de mimo-v2.5-tts, mais le streaming n'est pas disponible : la requête s'exécute en mode de compatibilité et ne répond qu'une fois la synthèse terminée.
step-1o-turbo-visionStepFun$0.4000$1.2800par 1M tokensStepFun step-1o-turbo-vision — compréhension d'images et de vidéos avec génération de texte rapide, contexte de 32K. Accepte le texte, l'image et la vidéo en entrée et ne renvoie que du texte. Modèle de vision de génération précédente conservé pour la compatibilité ; step-3.7-flash couvre les mêmes modalités d'entrée avec un contexte de 256K et une profondeur de raisonnement sélectionnable. Gardez les images sous 4096 pixels sur le grand côté pour une reconnaissance fiable.
step-2x-largeStepFun$0.016par requêteStepFun Step 2X Large — génération d'images à partir de texte au rendu de matière réaliste et au tracé de texte chinois et anglais dans l'image particulièrement soigné. Prend en charge les formats 256x256, 512x512, 768x768, 1024x1024, 1280x800 et 800x1280 ; une image par requête. Servi via l'endpoint images compatible OpenAI.
stepaudio-2.5-asr-stream$0.1800par heure audio
gemini-3.6-flashGoogleFacturation par paliers, voir la page des tarifsGoogle Gemini 3.6 Flash — modèle de raisonnement multimodal en version stable qui équilibre vitesse et intelligence pour les tâches agentiques et les usages réels, avec un contexte d'entrée de 1 048 576 tokens et une limite de sortie de 65 536 tokens. Il accepte le texte, les images, la vidéo, l'audio et les PDF, et prend en charge la réflexion, l'appel de fonctions, l'exécution de code, l'ancrage par recherche, la sortie structurée et Computer Use (préversion).
MiniMax-Hailuo-02MiniMax$0.280par requêteMiniMax Hailuo 02 — génération vidéo économique couvrant à la fois le texte vers vidéo et l'image vers vidéo à 24 fps, le 512p et le 768p étant proposés en clips de 6 ou 10 secondes et le 1080p en 6 secondes. Le palier 512p est l'entrée de gamme de la ligne Hailuo.
qwen3.7-max阿里巴巴$2.5000$7.5000par 1M tokensAlibaba Qwen3.7-Max — modèle phare propriétaire positionné sur la programmation, le travail de bureau et la productivité, et l'exécution autonome de longue durée, avec une fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 131 072 tokens de sortie et un budget de chaîne de raisonnement de 262 144 tokens. Texte en entrée, texte en sortie. Il prend en charge l'appel de fonctions, les sorties structurées et la mise en cache du contexte.
step-3.5-flashStepFun$0.1000$0.3000par 1M tokensStepFun step-3.5-flash — modèle de raisonnement texte uniquement doté d'un contexte de 256K, destiné à la logique, aux mathématiques, à l'ingénierie logicielle et à la recherche approfondie, là où la qualité du raisonnement doit s'accompagner d'une exécution rapide et fiable. La profondeur de raisonnement se choisit requête par requête via reasoning_effort (low / medium / high). Prend en charge l'appel d'outils, la sortie structurée par JSON Schema, le streaming et la mise en cache des prompts. Pour une entrée image ou vidéo, utilisez step-3.7-flash.
step-image-edit-2StepFun$0.004par requêteStepFun Step Image Edit 2 — modèle unifié de génération d'images à partir de texte et d'édition d'images, de moins de 6 milliards de paramètres, au niveau des éditeurs à poids ouverts de 12 à 20 milliards. Il réalise une édition en une à deux secondes et vise la retouche interactive à faible latence. Prend en charge les formats 256x256, 512x512, 768x768, 1024x1024, 1280x800 et 800x1280, ainsi que les prompts négatifs et un mode d'optimisation du texte ; une image par requête. Servi via l'endpoint images compatible OpenAI.
wan2.7-videoedit阿里巴巴$0.092par secondeAlibaba Wan2.7 VideoEdit — montage vidéo en langage naturel, local ou global, remplacement d'éléments par image de référence, reproduction des mouvements, des effets et de la caméra.
glm-5.1智谱$1.1200$3.5200par 1M tokensZhipu GLM-5.1 — modèle de fondation phare conçu pour le travail autonome prolongé : le fournisseur documente une exécution continue et sans surveillance sur une même tâche pendant jusqu'à 8 heures, en couvrant planification, exécution, tests et optimisation itérative. Fenêtre de contexte de 200K, jusqu'à 128K tokens de sortie, texte en entrée et texte en sortie. Il prend en charge plusieurs modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP.
happyhorse-1.1-t2v阿里巴巴$0.083par secondeAlibaba HappyHorse 1.1 (T2V) — texte vers vidéo avec une meilleure compréhension sémantique, un meilleur contrôle de la caméra et une génération plus dynamique. Vidéo 720P/1080P fluide, détaillée et physiquement cohérente.
kimi-k2.6Moonshot$0.7600$3.1570par 1M tokensMoonshot Kimi K2.6 — modèle généraliste pour le dialogue, la génération de code, la compréhension visuelle et les tâches d'agents, avec une écriture de code de longue haleine et une exécution autonome plus solides que la génération précédente. Fenêtre de contexte de 256K, 32 768 tokens de sortie par défaut. Il accepte le texte, les images (png, jpeg, webp, gif) et la vidéo (mp4, mov, webm et d'autres) sous forme de contenu base64 et renvoie du texte. Le mode de réflexion est actif par défaut et peut être désactivé ; la température est fixée à 1.0 avec réflexion et à 0.6 sans.
speech-2.8-turboMiniMax$0.3077par 10 k caractèresMiniMax speech-2.8-turbo — le palier à faible latence de la gamme vocale 2.8, qui troque le rendu ultra-réaliste du modèle HD contre une synthèse plus rapide au débit naturel. Il couvre les mêmes 40 langues et 7 émotions, avec hauteur, débit de parole, volume, fréquence d'échantillonnage, débit binaire et format de sortie configurables, et accepte jusqu'à 1 million de caractères en asynchrone ou 10 000 caractères via l'interface de streaming.
step-1o-audioStepFun$3.8500$9.2400par 1M tokensStepFun step-1o-audio — modèle vocal de bout en bout de génération précédente, multilingue et compatible avec l'appel d'outils, limité à 30 minutes par interaction. Largement remplacé par la gamme StepAudio 2.5 ; conservé pour les charges de travail déjà bâties sur lui.
step-asr-1.1StepFun$0.3500par heure audioStepFun step-asr-1.1 — version actualisée du modèle de reconnaissance généraliste de la gamme step-asr, couvrant le chinois, l'anglais et les dialectes chinois. Accepte les fichiers ogg, mp3 et wav ; la transcription produite n'est pas facturée.
agnes-video-v2.0Agnes AI$0.000par secondeAgnes AI Video V2.0 — modèle de génération vidéo asynchrone pour le texte vers vidéo, l'image vers vidéo, les images clés multi-images et les mouvements cinématographiques, avec des paliers de sortie normalisés en 480p, 720p et 1080p.
glm-5智谱$1.0000$3.2000par 1M tokensZhipu GLM-5 — MoE de 744 milliards de paramètres dont 40 milliards actifs, entraîné sur 28 500 milliards de tokens et utilisant DeepSeek Sparse Attention, avec une fenêtre de contexte de 200K et jusqu'à 128K tokens de sortie. Texte en entrée, texte en sortie. Il prend en charge plusieurs modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP.
mimo-v2.5Xiaomi$0.1400$0.2800par 1M tokensXiaomi MiMo-V2.5 — modèle nativement multimodal intégral avec un contexte de 1M et jusqu'à 128K de sortie, comprenant images, vidéo, audio et texte dans un seul modèle. Il prend en charge la réflexion approfondie, l'appel de fonctions, la sortie structurée et la recherche web, avec des capacités d'agent sur toutes les modalités.
MiniMax-Hailuo-2.3-FastMiniMax$0.190par requêteMiniMax Hailuo 2.3 Fast — le palier vitesse et coût de Hailuo 2.3, centré sur l'image vers vidéo et sur le réalisme du mouvement physique, à 24 fps, le 768p étant proposé en clips de 6 ou 10 secondes et le 1080p en 6 secondes. 768p 6 s = $0,19.
qwen3.8-max阿里巴巴$1.9900$5.9700par 1M tokensAlibaba Qwen3.8-Max — modèle phare MoE de 2 400 milliards de paramètres et le plus performant de la famille Qwen, le fournisseur mettant en avant des gains majeurs en programmation et en travail de bureau. Fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 131 072 tokens de sortie et un budget de chaîne de raisonnement de 262 144 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte ; il prend en charge l'appel de fonctions, les sorties structurées et la mise en cache du contexte.
doubao-seedream-5-0-260128字节跳动$0.034par requêteByteDance Doubao Seedream 5.0-lite — texte vers image et image vers image, avec une création contrôlable plus fine, une recherche en temps réel et une meilleure cohérence des sujets (résolution 2K et plus).
glm-asr-2512智谱$0.1440par heure audioZhipu GLM-ASR-2512 — modèle de reconnaissance vocale annonçant un taux d'erreur de caractères de 0,0717. Il couvre le mandarin ainsi que le sichuanais, le cantonais, le minnan et le wu, les accents anglais américain et britannique, et des dizaines d'autres langues dont le français, l'allemand, le japonais, le coréen, l'espagnol et l'arabe. Il traite la parole mêlant plusieurs langues, le jargon technique et le registre familier, et accepte un dictionnaire personnalisé pour le vocabulaire métier. L'audio est plafonné à 30 secondes et 25 Mo par requête, avec transcription par lot comme en streaming.
glm-tts智谱$0.3077par 10 k caractèresZhipu GLM-TTS — synthèse vocale bâtie sur une architecture de génération en deux étapes avec apprentissage par renforcement GRPO, qui déduit l'émotion et l'intonation du texte environnant au lieu d'exiger un balisage explicite. Elle embarque sept voix intégrées (tongtong par défaut, xiaochen, chuichui, jam, kazi, douji, luodo) avec vitesse et volume réglables, accepte jusqu'à 1024 caractères par requête et diffuse en streaming avec une latence de première trame inférieure à 400 ms. Elle renvoie du wav ou du pcm à une fréquence d'échantillonnage recommandée de 24 kHz ; le streaming est en pcm uniquement.
wan2.7-i2v阿里巴巴$0.092par secondeAlibaba Wan 2.7 Image-to-Video — couvre la génération à partir de la première image, les transitions entre première et dernière image, et la continuation d'un clip existant. Produit du 720P ou du 1080P (1080P par défaut) de 2 à 15 secondes, 5 s par défaut, à partir de prompts jusqu'à 5000 caractères (prompts négatifs jusqu'à 500). Une piste mp3 ou wav de 2 à 30 secondes peut être fournie comme driving_audio ; sans audio, le modèle génère une musique de fond ou des effets sonores adaptés, un audio plus long que le clip est tronqué et un audio plus court laisse la fin silencieuse.
glm-5v-turbo智谱$0.7690$3.3850par 1M tokensZhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows.
happyhorse-1.1-i2v阿里巴巴$0.083par secondeAlibaba HappyHorse 1.1 (I2V) — image vers vidéo avec une meilleure matière, une cohérence d'identité d'un plan à l'autre, une fluidité de mouvement accrue et une synchronisation audio-vidéo. 720P/1080P.
mimo-v2.5-proXiaomi$0.4350$0.8700par 1M tokensXiaomi MiMo-V2.5-Pro — modèle phare à mille milliards de paramètres (42 milliards actifs) avec un contexte de 1M et jusqu'à 128K de sortie, ajusté pour les charges de travail d'agents intensives. Il prend en charge la réflexion approfondie, l'appel de fonctions, la sortie structurée et la recherche web. Génération de texte uniquement : contrairement à mimo-v2.5, la liste de capacités du fournisseur n'inclut pas la compréhension de toutes les modalités.
mimo-v2.5-tts-voicedesignXiaomi$0.0000par 10 k caractèresModèle de conception vocale de Xiaomi MiMo : décrivez en langage naturel la voix souhaitée via instructions, et il synthétise la parole avec cette voix conçue sur mesure.
qwen3.7-plus阿里巴巴$0.3080$1.2310par 1M tokensAlibaba Qwen3.7-Plus — modèle d'agent hybride multimodal qui perçoit les scènes du monde réel, lit les écrans et pilote les interfaces graphiques, génère du code à partir de références visuelles et effectue une navigation de bout en bout dans les applications mobiles. Fenêtre de contexte de 1 000 000 tokens (991 808 tokens d'entrée au maximum, 983 616 en mode de réflexion), jusqu'à 131 072 tokens de sortie et un budget de chaîne de raisonnement de 262 144 tokens. Il accepte le texte, l'image et la vidéo en entrée et renvoie du texte ; il prend en charge l'appel de fonctions, les sorties structurées et la mise en cache du contexte.
step-asrStepFun$0.1500par heure audioStepFun step-asr — reconnaissance vocale généraliste couvrant le chinois, l'anglais et les dialectes chinois, pour la transcription, les comptes rendus de réunion, le contrôle qualité des appels et la recherche vocale. Accepte les fichiers ogg, mp3 et wav ; la transcription produite n'est pas facturée.
wan2.7-image阿里巴巴$0.031par requêteAlibaba Wan2.7 Image — texte vers image, édition d'images, génération avec plusieurs images de référence, édition interactive, tracé du texte et respect des instructions solides.
agnes-2.0-flashAgnes AI$0.0000par 1M tokensAgnes AI Agnes 2.0 Flash — modèle d'agent multimodal rapide doté d'un contexte d'entrée de 256K et d'une limite de sortie de référence de 64K, prenant en charge le chat, le streaming, l'appel d'outils, la programmation, le raisonnement, la compréhension visuelle et les flux de travail d'agents.
agnes-2.5-flashAgnes AI$0.0000par 1M tokensAgnes AI Agnes 2.5 Flash — modèle d'agent multimodal rapide doté d'un contexte d'entrée de 512K et d'une limite de sortie de référence de 65,5K, prenant en charge le chat, le streaming, l'appel d'outils, la programmation, le raisonnement, le dialogue multi-tours, la compréhension visuelle et les flux de travail d'agents.
glm-5-turbo智谱$1.2000$4.0000par 1M tokensZhipu GLM-5-Turbo — la variante de GLM-5 orientée débit, optimisée pour les flux de travail d'agents : invocation d'outils et de compétences plus stable sur les tâches multi-étapes, meilleure gestion des instructions longues et complexes, et exécution de tâches planifiées ou de longue durée. Fenêtre de contexte de 200K, jusqu'à 128K tokens de sortie, texte en entrée et texte en sortie. Il prend en charge les modes de réflexion, l'appel de fonctions, la sortie JSON structurée, le streaming, la mise en cache du contexte et l'intégration d'outils MCP.
happyhorse-1.1-r2v阿里巴巴$0.083par secondeAlibaba HappyHorse 1.1 (R2V) — génération vidéo à partir de références, jusqu'à 9 images de référence, forte cohérence de sujet, de scène et de style, et contrôle de la caméra. 720P/1080P.
kimi-k3Moonshot$2.7400$13.6990par 1M tokensMoonshot Kimi K3 — modèle phare de 2 800 milliards de paramètres pour la programmation de longue haleine, le travail du savoir de bout en bout et le raisonnement profond, avec une fenêtre de contexte de 1M tokens et jusqu'à 1 048 576 tokens de complétion (131 072 par défaut). Il accepte le texte, les images en base64 et la vidéo, et renvoie du texte. La réflexion est toujours active, avec reasoning_effort au choix parmi low, high ou max (max par défaut) ; la température est fixée à 1.0. Il prend en charge l'appel d'outils personnalisés et le chargement dynamique d'outils.
speech-2.8-hdMiniMax$0.5385par 10 k caractèresMiniMax speech-2.8-hd — le palier haute définition de la gamme vocale 2.8, positionné sur un rendu ultra-réaliste avec balises sonores, couvrant 40 langues et 7 émotions. La hauteur, le débit de parole, le volume, la fréquence d'échantillonnage, le débit binaire et le format de sortie se configurent requête par requête, et la synthèse de textes longs accepte jusqu'à 1 million de caractères en asynchrone ou 10 000 caractères via l'interface de streaming.
step-3.7-flashStepFun$0.2000$1.1500par 1M tokensStepFun step-3.7-flash — MoE clairsemé de 198 milliards de paramètres au total et 11 milliards actifs, avec un contexte natif de 256K et une compréhension native des images et des vidéos en plus du texte. La profondeur de raisonnement se choisit requête par requête via reasoning_effort (low / medium / high), et le modèle prend en charge l'appel d'outils multi-étapes fiable, la sortie structurée par JSON Schema, le streaming et la mise en cache des prompts. Ajusté pour les charges de travail d'agents et de programmation.
stepaudio-2.5-chatStepFun$1.5000$3.5000par 1M tokensStepFun StepAudio 2.5 Chat — modèle de compréhension vocale de bout en bout : il reçoit de l'audio ou du texte et renvoie du texte, en lisant les signaux paralinguistiques comme l'hésitation ou le rire directement dans la forme d'onde plutôt que dans une transcription. Il prend en charge une personnalisation poussée des personas, couvrant le caractère, les habitudes de parole et l'amplitude émotionnelle. L'audio se transmet sous forme de parties de contenu input_audio sur l'endpoint chat completions. Pour des réponses parlées, utilisez un modèle TTS.
agnes-image-2.1-flashAgnes AI$0.000par requêteAgnes AI Image 2.1 Flash — modèle de génération et d'édition d'images axé sur le détail pour les scènes à forte densité d'information, couvrant le texte vers image, l'image vers image et la composition multi-images, avec des tailles et des rapports d'aspect flexibles de 1K à 4K.
deepseek-v4-proDeepSeek$0.4350$0.8700par 1M tokensDeepSeek V4 Pro — le palier le plus performant de DeepSeek V4 pour la programmation, le raisonnement et le travail agentique, avec une fenêtre de contexte de 1M tokens et une sortie maximale de 384K. Il fonctionne en mode de réflexion (par défaut) comme sans réflexion, et prend en charge l'appel d'outils et la sortie JSON. Texte en entrée, texte en sortie.
LongCat-2.0Meituan$0.3000$1.2000par 1M tokensMeituan LongCat-2.0 — modèle MoE ouvert de 1600 milliards de paramètres avec un contexte natif de 1M, conçu pour la programmation agentique et l'usage d'outils de longue haleine. Modèle de raisonnement texte uniquement.
MiniMax-Hailuo-2.3MiniMax$0.280par requêteMiniMax Hailuo 2.3 — texte vers vidéo et image vers vidéo que le fournisseur positionne sur le respect des instructions, à 24 fps, le 768p étant proposé en clips de 6 ou 10 secondes et le 1080p en 6 secondes. 768p 6 s = $0,28.
MiniMax-M3MiniMaxFacturation par paliers, voir la page des tarifsMiniMax M3 — modèle de programmation multimodal de pointe pour le raisonnement agentique, l'usage d'outils et l'exécution structurée de tâches, avec une fenêtre de contexte de 1 000 000 tokens. Il accepte le texte, des images jusqu'à 10 Mo et de la vidéo jusqu'à 50 Mo en ligne ou 512 Mo via l'API Files, et renvoie du texte. Il prend en charge l'appel d'outils, la réflexion étant optionnelle plutôt que systématique.
step-asr-1.1-stream$0.4000par heure audio
step-tts-miniStepFun$0.1500par 10 k caractèresStepFun step-tts-mini — membre économique et à faible latence de la gamme TTS de StepFun, couvrant les mêmes langues que step-tts-2 (chinois, anglais, mélange chinois-anglais et japonais, plus le cantonais et le sichuanais) avec une partie des voix intégrées. Il prend en charge les indications d'émotion et d'intonation en langage naturel ainsi que le clonage vocal zero-shot à partir d'environ 10 secondes d'audio de référence. Sorties en wav, mp3, flac, opus ou pcm.
wan2.7-r2v阿里巴巴$0.092par secondeAlibaba Wan2.7 (R2V) — génération vidéo à partir de références, jusqu'à 5 références mixtes image/vidéo plus une référence de timbre audio, avec une meilleure cohérence des personnages, des accessoires et des décors.
doubao-seedance-2-0-fast-260128字节跳动$5.6000$5.6000par 1M tokensByteDance Seedance 2.0 Fast — génération vidéo économique reprenant l'ensemble des fonctionnalités de Seedance 2.0 mais plafonnée à 480p et 720p, 24 fps, 4 à 15 secondes. Elle couvre le texte vers vidéo, l'image vers vidéo depuis la première image ou depuis la première et la dernière, la génération multimodale par référence à partir de 1 à 9 images et de 3 vidéos de référence au maximum totalisant 15 secondes, le montage vidéo, l'extension de vidéo, la génération avec audio et un outil de recherche web ; une référence audio doit obligatoirement accompagner une image ou une vidéo. Renvoie du MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. 480p 5 s ≈ $0,26.
kling-v3-omni快手$0.420par requêteKling 3.0 Omni — génération vidéo multi-images à partir de références. Le prix affiché correspond au palier std (720p, 5 s, sans audio, sans vidéo de référence). Les requêtes qui ne fixent pas mode utilisent le palier pro par défaut en amont, facturé 1,33x — environ $0,56 pour le même clip de 5 s ; le 4k est facturé 5x. Passez mode=std pour être facturé au prix affiché.
mimo-v2.5-asrXiaomi$0.0740par heure audioModèle de reconnaissance vocale de Xiaomi MiMo optimisé pour le chinois et l'anglais ainsi que les dialectes chinois, capable de traiter des audios bruités, en champ lointain et à plusieurs locuteurs, jusqu'à la transcription de paroles de chansons.
qwen3-asr-flash阿里巴巴$0.1235par heure audioAlibaba Qwen3-ASR-Flash — reconnaissance vocale bâtie sur le modèle de fondation Qwen3, qui détermine automatiquement la langue parlée et transcrit 11 langues ; la gamme Qwen3-ASR documente le mandarin aux côtés du sichuanais, du minnan, du wu et du cantonais, ainsi que plusieurs accents anglais. Elle accepte les formats aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma et wmv, jusqu'à 5 minutes et 10 Mo par requête ; l'entrée pcm doit être en 16 kHz et les autres formats sont rééchantillonnés à 16 kHz avant la reconnaissance.
wan2.7-image-pro阿里巴巴$0.060par requêteAlibaba Wan 2.7 Image Pro — le palier professionnel de la gamme image Wan 2.7, couvrant le texte vers image, les séries d'images, l'édition d'images et la génération à partir de plusieurs images de référence, avec un meilleur respect du prompt. Le texte vers image atteint le 4K (4096x4096), avec des paliers 1K et 2K et des tailles personnalisées à partir de 768x768 ; les modes édition et série plafonnent à 2K. Il accepte jusqu'à 9 images de référence (JPEG, JPG, PNG, BMP, WEBP ; 240 à 8000 px par côté, 20 Mo chacune), des rapports d'aspect de 1:8 à 8:1, et des prompts jusqu'à 5000 caractères. Renvoie du PNG.