Precios de los modelos de IA chinos
ChinaAPI ofrece DeepSeek, Qwen, GLM, Kimi y otros modelos de IA chinos a través de un gateway compatible con OpenAI en https://api.chinaapi.ai/v1. Todos los precios están en dólares estadounidenses, expresados en la unidad que utiliza el proveedor de origen. La misma lista está disponible en JSON en /api/pricing.
| Modelo | Proveedor | Entrada | Salida | Unidad | Descripción |
|---|---|---|---|---|---|
| deepseek-v4-flash-vision-exp | DeepSeek | Facturación escalonada, consulte la página de precios | DeepSeek V4 Flash Vision (experimental) — the V4 Flash tier with image input, priced identically to deepseek-v4-flash on every face. Images are converted to tokens by their size and billed together with text at the input rate, so there is no separate image charge. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. The vendor labels this tier experimental; behaviour and availability may change without notice. Text and images in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3.1-flash-image | Facturación escalonada, consulte la página de precios | Google Gemini 3.1 Flash Image (Nano Banana 2) — modelo estable de baja latencia para generación de imágenes de alta calidad y edición conversacional. Acepta texto, imágenes y PDF, admite thinking y fundamentación mediante búsqueda, y puede generar imágenes de 0.5K, 1K, 2K o 4K para flujos de producción de gran volumen. | |||
| gpt-4.1 | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT-4.1 — a non-reasoning model tuned for instruction following and long-context work, with a 1,047,576-token context window and up to 32,768 output tokens. It takes text and image input, and its output is priced below the reasoning tier at the same input price. | ||
| gemini-2.5-flash | Facturación escalonada, consulte la página de precios | Google Gemini 2.5 Flash — a fast, low-cost multimodal model with a 1M-token context window. Accepts text, images, video and audio; audio input is billed at the vendor's separate audio rate. | |||
| glm-5.1 | 智谱 | $1.4000 | $4.4000 | por 1M tokens | Zhipu GLM-5.1 — modelo fundacional buque insignia construido para el trabajo autónomo prolongado: el proveedor documenta una ejecución continua y sin supervisión sobre una misma tarea durante hasta 8 horas, abarcando planificación, ejecución, pruebas y optimización iterativa. Ventana de contexto de 200K, hasta 128K tokens de salida, texto de entrada y texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP. |
| image-01 | MiniMax | $0.004 | por solicitud | MiniMax image-01 — generación de imágenes a partir de texto mediante el endpoint nativo image_generation de MiniMax. Se factura por imagen generada. El proveedor lo clasifica entre sus modelos heredados. | |
| MiniMax-Hailuo-02 | MiniMax | $0.280 | por solicitud | MiniMax Hailuo 02 — generación de vídeo económica que cubre tanto texto a vídeo como imagen a vídeo a 24 fps, con 512p y 768p disponibles en clips de 6 o 10 segundos y 1080p en 6 segundos. El nivel 512p es la puerta de entrada de la línea Hailuo. | |
| MiniMax-M3 | MiniMax | Facturación escalonada, consulte la página de precios | MiniMax M3 — modelo de programación multimodal de vanguardia para razonamiento agéntico, uso de herramientas y ejecución estructurada de tareas, con una ventana de contexto de 1,000,000 tokens. Acepta texto, imágenes de hasta 10 MB y vídeo de hasta 50 MB incrustado o 512 MB a través de la API de Files, y devuelve texto. Admite llamada a herramientas, con el razonamiento opcional en lugar de siempre activo. | ||
| speech-2.8-hd | MiniMax | $1.0000 | por 10 mil caracteres | MiniMax speech-2.8-hd — el nivel de alta definición de la línea de voz 2.8, orientado a una interpretación ultrarrealista con etiquetas de sonido, que cubre 40 idiomas y 7 emociones. El tono, la velocidad del habla, el volumen, la frecuencia de muestreo, la tasa de bits y el formato de salida se configuran por solicitud, y la síntesis de textos largos acepta hasta 1 millón de caracteres de forma asíncrona o 10,000 caracteres a través de la interfaz de streaming. | |
| gemini-3.1-flash-lite | Facturación escalonada, consulte la página de precios | Google Gemini 3.1 Flash-Lite — modelo multimodal de baja latencia y buena relación costo-beneficio para tareas ligeras de alta frecuencia, flujos de trabajo agénticos de gran volumen, traducción y extracción de datos estructurados. Acepta texto, imágenes, vídeo, audio y PDF, admite thinking y uso de herramientas, y ofrece un contexto de entrada de 1,048,576 tokens con hasta 65,536 tokens de salida. | |||
| happyhorse-1.1-i2v | 阿里巴巴 | $0.091 | por segundo | Alibaba HappyHorse 1.1 (I2V) — imagen a vídeo con mejor textura, coherencia de identidad entre clips, fluidez de movimiento y sincronía entre audio e imagen. 720P/1080P. | |
| kimi-k2.7-code | Moonshot | $0.7600 | $3.1570 | por 1M tokens | Moonshot Kimi K2.7 Code — el modelo dedicado a programación de Kimi, que según las mediciones del proveedor mejora el cumplimiento de instrucciones y la programación de larga duración frente a K2.6, al tiempo que recorta el exceso de razonamiento en torno a un 30% de media. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes y vídeo como contenido base64 y devuelve texto. El razonamiento es obligatorio y devuelve un error si se desactiva; tool_choice se limita a auto o none, y reasoning_content debe arrastrarse a lo largo de las llamadas a herramientas de varios pasos. |
| step-asr-1.1 | StepFun | $0.3370 | por hora de audio | StepFun step-asr-1.1 — versión actualizada del reconocedor de propósito general de la línea step-asr, que cubre chino, inglés y dialectos chinos. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura. | |
| gpt-5.4 | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT-5.4 — a frontier model for complex professional work and coding, priced well below GPT-5.5. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 1,050,000-token context window, and up to 128,000 output tokens. Prompts above 272,000 input tokens are repriced at 2x input and 1.5x output for the whole session. | ||
| doubao-seedream-4-5-251128 | 字节跳动 | $0.037 | por solicitud | ByteDance Doubao Seedream 4.5 — texto a imagen e imagen a imagen con fusión de varias imágenes, que produce una imagen única o un conjunto de imágenes relacionadas. El modo de imagen única acepta solo un prompt, una imagen de referencia, o de 2 a 14 imágenes de referencia; el modo de conjunto (sequential_image_generation=auto) devuelve hasta 15 imágenes a partir de texto, hasta 14 a partir de una sola imagen de referencia, o un conjunto a partir de 2 a 14 referencias siempre que la suma de entradas y salidas no supere 15. Admite salidas en 2K y 4K y devuelve JPEG por defecto, como URL o base64. La edición interactiva por coordenadas es exclusiva de Seedream 5.0 pro. | |
| deepseek-v4-flash-legacy | DeepSeek | $0.1190 | $0.2370 | por 1M tokens | DeepSeek V4 Flash (legacy tier) — a lower-priced route to the V4 Flash model family. Input and output tokens are cheaper than on deepseek-v4-flash, while cache reads are priced higher, so prompt-caching-heavy workloads are usually cheaper on deepseek-v4-flash and low-reuse workloads are cheaper here. Responses may come from an earlier V4 Flash build. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| doubao-seed-2-1-pro-260628 | 字节跳动 | $0.8890 | $4.4440 | por 1M tokens | ByteDance Doubao Seed 2.1 Pro — modelo de agente buque insignia de Doubao para el trabajo en producción, que cubre razonamiento profundo, generación de texto, comprensión multimodal, llamada a herramientas y salida estructurada, para la que el proveedor recomienda el modo json_schema. Ventana de contexto de 256K con una entrada máxima de 256K, hasta 256K tokens de salida (4K por defecto) y un presupuesto de 256K para la cadena de razonamiento. Acepta texto, imagen y vídeo y devuelve texto; la comprensión de audio no figura para la línea 2.1. Admite caché de contexto implícita y explícita, incluidas las cachés de prefijo y de sesión. |
| MiniMax-M2.7 | MiniMax | $0.3000 | $1.2000 | por 1M tokens | MiniMax M2.7 — modelo de texto para chat, programación, trabajo de oficina y tareas agénticas, con una ventana de contexto de 204,800 tokens y una salida de unos 60 tokens por segundo. Solo texto: la API acepta bloques de contenido de texto y de llamada a herramienta, pero no imágenes ni vídeo. Admite llamada a herramientas; el razonamiento está siempre activo y no puede desactivarse. |
| MiniMax-M2.7-highspeed | MiniMax | $0.6000 | $2.4000 | por 1M tokens | MiniMax M2.7 Highspeed — el mismo modelo M2.7 servido a unos 100 tokens por segundo para programación de baja latencia y flujos de trabajo de agentes, con una ventana de contexto de 204,800 tokens. Solo texto: la API acepta bloques de contenido de texto y de llamada a herramienta, pero no imágenes ni vídeo. Admite llamada a herramientas; el razonamiento está siempre activo y no puede desactivarse. |
| step-1o-audio | StepFun | $3.7070 | $8.8980 | por 1M tokens | StepFun step-1o-audio — modelo de voz de extremo a extremo de la generación anterior, con soporte multilingüe y llamada a herramientas, limitado a 30 minutos por interacción. En gran medida sustituido por la línea StepAudio 2.5; se mantiene para las cargas de trabajo ya construidas sobre él. |
| wan2.7-videoedit | 阿里巴巴 | $0.080 | por segundo | Alibaba Wan2.7 VideoEdit — edición de vídeo en lenguaje natural, local o global, sustitución de elementos mediante imagen de referencia y replicación de movimiento, efectos y cámara. | |
| gpt-5.5 | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT-5.5 — modelo de razonamiento de vanguardia para programación compleja y trabajo profesional. Admite entrada de texto e imagen, llamada a funciones y herramientas integradas, una ventana de contexto de 1,050,000 tokens, hasta 128,000 tokens de salida y un nivel de razonamiento de none hasta xhigh. | ||
| hy3 | Tencent | $0.1480 | $0.5930 | por 1M tokens | Tencent Hunyuan 3 (Hy3) — modelo MoE de 295B de parámetros (21B activos), contexto nativo de 256K y tres modos de razonamiento (fast / low / deep). Sólido en agentes de programación, comprensión de documentos largos, contexto en varios turnos y flujos de trabajo de agentes de varios pasos. Solo texto. |
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | por 1M tokens | Xiaomi MiMo-V2.5 — modelo nativamente multimodal completo, con contexto de 1M y salida máxima de 128K, que entiende imágenes, vídeo, audio y texto en un solo modelo. Admite razonamiento profundo, llamada a funciones, salida estructurada y búsqueda web, con capacidad de agente en todas las modalidades. |
| step-tts-mini | StepFun | $0.1444 | por 10 mil caracteres | StepFun step-tts-mini — el miembro económico y de baja latencia de la línea TTS de StepFun, que cubre los mismos idiomas que step-tts-2 (chino, inglés, mezcla de chino e inglés y japonés, además de cantonés y sichuanés) con un subconjunto de las voces integradas. Admite etiquetas de emoción y entonación en lenguaje natural, y clonación de voz zero-shot a partir de unos 10 segundos de audio de referencia. Genera wav, mp3, flac, opus o pcm. | |
| claude-sonnet-4-5 | Anthropic | Facturación escalonada, consulte la página de precios | Anthropic Claude Sonnet 4.5 — a pinned dated snapshot of the Sonnet 4.5 release, kept available for workloads that need byte-stable behaviour across runs. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| mimo-v2.5-tts | Xiaomi | $0.0000 | por 10 mil caracteres | Xiaomi MiMo v2.5 TTS — síntesis de voz expresiva con ocho voces integradas, cuatro en chino y cuatro en inglés (Mia, Chloe, Milo, Dean), que cubre chino e inglés además de los estilos dialectales del Noreste, de Sichuan, de Henan y del cantonés. La interpretación se dirige de dos formas: instrucciones de estilo en lenguaje natural y etiquetas de audio en línea para emociones básicas y compuestas, respiración, suspiros y ritmo, incluido un modo de canto exclusivo de este modelo dentro de la línea MiMo TTS. Devuelve wav mono o pcm16 a 24 kHz y admite streaming de baja latencia, que exige pcm16. Contexto de 8K y salida máxima de 8K. | |
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | por solicitud | MiniMax Hailuo 2.3 — texto a vídeo e imagen a vídeo que el proveedor posiciona por su seguimiento de instrucciones, a 24 fps, con 768p disponible en clips de 6 o 10 segundos y 1080p en 6 segundos. 768p 6 s = $0.28. | |
| qwen3-tts-flash | 阿里巴巴 | $0.1100 | por 10 mil caracteres | Alibaba Qwen3-TTS-Flash — síntesis de voz de baja latencia con 17 voces integradas expresivas, que cubre chino, inglés, alemán, italiano, portugués, español, japonés, coreano, francés y ruso, además de un modo automático para textos que mezclan idiomas y salida en dialecto. Acepta hasta 512 tokens de texto por solicitud y admite síntesis con y sin streaming. | |
| wan2.7-i2v | 阿里巴巴 | $0.080 | por segundo | Alibaba Wan 2.7 Image-to-Video — cubre la generación a partir del primer fotograma, las transiciones entre el primero y el último, y la continuación de un clip existente. Produce 720P o 1080P (1080P por defecto) de 2 a 15 segundos, 5 s por defecto, a partir de prompts de hasta 5,000 caracteres (prompts negativos de hasta 500). Puede enviarse una pista mp3 o wav de 2 a 30 segundos como driving_audio; sin audio, el modelo genera música de fondo o efectos de sonido acordes, un audio más largo que el clip se recorta y uno más corto deja el final en silencio. | |
| doubao-seedance-2-0-fast-260128 | 字节跳动 | $4.2000 | $4.2000 | por 1M tokens | ByteDance Seedance 2.0 Fast — generación de vídeo económica que conserva todo el conjunto de funciones de Seedance 2.0 pero limitada a 480p y 720p, 24 fps, de 4 a 15 segundos. Cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16. 480p 5 s ≈ $0.26. |
| qwen3.7-plus | 阿里巴巴 | $0.3400 | $1.3600 | por 1M tokens | Alibaba Qwen3.7-Plus — modelo de agente híbrido multimodal que percibe escenas del mundo real, lee pantallas y maneja interfaces gráficas, genera código a partir de referencias visuales y realiza navegación de extremo a extremo dentro de aplicaciones móviles. Ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 131,072 tokens de salida y un presupuesto de 262,144 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto; admite llamada a funciones, salidas estructuradas y caché de contexto. |
| deepseek-v4-pro | DeepSeek | Facturación escalonada, consulte la página de precios | DeepSeek V4 Pro 0813 — the higher-capability DeepSeek V4 tier for coding, reasoning, and agentic work, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3.5-flash | Facturación escalonada, consulte la página de precios | Google Gemini 3.5 Flash — modelo multimodal estable optimizado para un rendimiento sostenido como agente, ciclos rápidos de programación, despliegue de subagentes y flujos de trabajo de varios pasos y larga duración. Acepta texto, imágenes, vídeo, audio y PDF, admite thinking y herramientas integradas, y ofrece un contexto de entrada de 1,048,576 tokens con hasta 65,536 tokens de salida. | |||
| wan2.7-image-pro | 阿里巴巴 | $0.064 | por solicitud | Alibaba Wan 2.7 Image Pro — el nivel profesional de la línea de imagen Wan 2.7, que cubre texto a imagen, conjuntos secuenciales de imágenes, edición de imágenes y generación con varias imágenes de referencia, con un mejor seguimiento del prompt. El texto a imagen llega a 4K (4096x4096), con niveles de 1K y 2K y tamaños personalizados desde 768x768; los modos de edición y secuencial se limitan a 2K. Acepta hasta 9 imágenes de referencia (JPEG, JPG, PNG, BMP, WEBP; de 240 a 8,000 px por lado, 20 MB cada una), relaciones de aspecto de 1:8 a 8:1 y prompts de hasta 5,000 caracteres. Devuelve PNG. | |
| claude-haiku-4-5 | Anthropic | Facturación escalonada, consulte la página de precios | Anthropic Claude Haiku 4.5 — the fastest Claude model with near-frontier intelligence, built for high-volume, latency-sensitive work such as classification, extraction, and routing. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| happyhorse-1.1-r2v | 阿里巴巴 | $0.091 | por segundo | Alibaba HappyHorse 1.1 (R2V) — generación de vídeo a partir de referencias, con hasta 9 imágenes de referencia, fuerte coherencia de sujeto, escena y estilo, y control de cámara. 720P/1080P. | |
| kimi-k2.7-code-highspeed | Moonshot | $1.9000 | $8.0000 | por 1M tokens | Moonshot Kimi K2.7 Code Highspeed — el nivel de rendimiento de K2.7 Code, que sirve el mismo modelo a unos 180 tokens por segundo y hasta 260 en trabajos de contexto corto. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes y vídeo como contenido base64 y devuelve texto. El razonamiento es obligatorio y devuelve un error si se desactiva; tool_choice se limita a auto o none, y reasoning_content debe arrastrarse a lo largo de las llamadas a herramientas de varios pasos. |
| qwen3.7-max | 阿里巴巴 | $1.5000 | $4.5000 | por 1M tokens | Alibaba Qwen3.7-Max — buque insignia de código cerrado orientado a la programación, al trabajo de oficina y productividad, y a la ejecución autónoma de largo plazo, con una ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 131,072 tokens de salida y un presupuesto de 262,144 tokens para la cadena de razonamiento. Texto de entrada, texto de salida. Admite llamada a funciones, salidas estructuradas y caché de contexto. |
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | por 1M tokens | StepFun StepAudio 2.5 Chat — modelo de comprensión del habla de extremo a extremo: recibe audio o texto y devuelve texto, leyendo señales paralingüísticas como la vacilación o la risa en la propia forma de onda y no en una transcripción. Admite una personalización amplia de personas, que abarca carácter, hábitos de habla y rango emocional. El audio se envía como partes de contenido input_audio en el endpoint chat completions. Para obtener respuestas habladas, utilice un modelo de TTS. |
| wan2.7-r2v | 阿里巴巴 | $0.080 | por segundo | Alibaba Wan2.7 (R2V) — generación de vídeo a partir de referencias, con hasta 5 referencias mixtas de imagen/vídeo más una referencia de timbre de audio, y mayor coherencia de personajes, objetos de escena y escenarios. | |
| agnes-image-2.1-flash | Agnes AI | $0.000 | por solicitud | Agnes AI Image 2.1 Flash — modelo de generación y edición de imágenes centrado en el detalle para escenas de alta densidad de información, que cubre texto a imagen, imagen a imagen y composición con varias imágenes, con tamaños y relaciones de aspecto flexibles de 1K a 4K. | |
| gemini-3-pro-image | Facturación escalonada, consulte la página de precios | Google gemini-3-pro-image | |||
| claude-fable-5 | Anthropic | Facturación escalonada, consulte la página de precios | Anthropic Claude Fable 5 — el modelo más capaz de Anthropic entre los de disponibilidad general, para trabajo del conocimiento y programación ambiciosos y de larga duración. Está construido para tareas agénticas de varios días, ingeniería de software compleja, investigación profunda, razonamiento sobre documentos e imágenes y autoverificación proactiva. | ||
| step-audio-r1.5 | StepFun | $1.4930 | $15.6720 | por 1M tokens | StepFun step-audio-r1.5 — modelo de voz de extremo a extremo de la misma familia que step-audio-2, con la misma tarifa de entrada y una salida que se factura un 50% más cara. StepFun no publica una página de capacidades independiente para este modelo; consulte la documentación de audio de la plataforma para conocer el conjunto de parámetros vigente. |
| agnes-video-v2.0 | Agnes AI | $0.000 | por segundo | Agnes AI Video V2.0 — modelo asíncrono de generación de vídeo para texto a vídeo, imagen a vídeo, fotogramas clave a partir de varias imágenes y movimiento cinematográfico, con niveles de salida normalizados de 480p, 720p y 1080p. | |
| kimi-k2.6 | Moonshot | $0.7600 | $3.1570 | por 1M tokens | Moonshot Kimi K2.6 — modelo de propósito general para diálogo, generación de código, comprensión visual y tareas de agentes, con una escritura de código de larga duración y una ejecución autónoma más sólidas que en la generación anterior. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes (png, jpeg, webp, gif) y vídeo (mp4, mov, webm y otros) como contenido base64 y devuelve texto. El modo de razonamiento viene activado por defecto y puede desactivarse; la temperatura está fijada en 1.0 con razonamiento y en 0.6 sin él. |
| kling-v3 | 快手 | $0.420 | por solicitud | Kuaishou Kling 3.0 — texto a vídeo e imagen a vídeo con audio nativo y mejor coherencia de los elementos. Los clips duran de 3 a 15 segundos (5 por defecto) en 16:9, 9:16 o 1:1, y el nivel se elige mediante mode: std para 720P, pro para 1080P y 4k para 4K nativo. El audio hay que activarlo con sound=on y viene desactivado por defecto; imagen a vídeo toma un primer fotograma con un fotograma final opcional. Desde $0.083/s (720p). | |
| stepaudio-2.5-tts | StepFun | $0.8500 | por 10 mil caracteres | StepFun StepAudio 2.5 TTS — síntesis de voz contextual que traslada la comprensión a todo el proceso de generación en lugar de tratar la entonación como un posprocesado. La voz, la emoción y el ritmo se dirigen en lenguaje natural en dos niveles: un contexto global para la solicitud y un contexto en línea para pasajes concretos. La clonación de voz zero-shot necesita unos 3 segundos de audio de referencia y hereda todo el conjunto de controles contextuales. Acepta hasta 1000 caracteres por solicitud; genera wav, mp3, flac u opus. | |
| glm-asr-2512 | 智谱 | $0.1440 | por hora de audio | Zhipu GLM-ASR-2512 — modelo de reconocimiento de voz que declara una tasa de error de caracteres de 0.0717. Cubre el mandarín junto con el sichuanés, el cantonés, el min nan y el wu, los acentos del inglés estadounidense y británico, y decenas de idiomas más, entre ellos francés, alemán, japonés, coreano, español y árabe. Maneja el habla que mezcla idiomas, la jerga técnica y el registro coloquial, y acepta un diccionario personalizado para vocabulario especializado. El audio está limitado a 30 segundos y 25 MB por solicitud, con transcripción por lotes y en streaming. | |
| gpt-5.6-luna | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT-5.6 Luna — el nivel más rápido y económico de GPT-5.6, optimizado para cargas de trabajo de gran volumen y sensibles al costo sin renunciar al razonamiento, la visión y el uso de herramientas. Admite entrada de texto e imagen, una ventana de contexto de 1,050,000 tokens y hasta 128,000 tokens de salida. | ||
| qwen3.6-flash | 阿里巴巴 | $0.2500 | $1.5000 | por 1M tokens | Alibaba Qwen3.6-Flash — modelo rápido de visión y lenguaje que el proveedor destaca para la programación agéntica y para la inteligencia espacial, con avances notables en localización y detección de objetos. Ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 65,536 tokens de salida y un presupuesto de 131,072 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto. Admite llamada a funciones y caché de contexto. |
| qwen3.6-plus | 阿里巴巴 | $0.4000 | $2.4000 | por 1M tokens | Alibaba Qwen3.6-Plus — modelo equilibrado para razonamiento general y uso de herramientas, con una ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 65,536 tokens de salida y un presupuesto de 81,920 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto. Admite llamada a funciones, salidas estructuradas, búsqueda web, completado de prefijo y caché de contexto. |
| glm-5-turbo | 智谱 | $1.2000 | $4.0000 | por 1M tokens | Zhipu GLM-5-Turbo — la variante de GLM-5 orientada al rendimiento, optimizada para flujos de trabajo de agentes: invocación de herramientas y habilidades más estable a lo largo de tareas de varios pasos, mejor manejo de instrucciones largas y encadenadas, y ejecución de tareas programadas o de larga duración. Ventana de contexto de 200K, hasta 128K tokens de salida, texto de entrada y texto de salida. Admite modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP. |
| wan3.0-video | 阿里巴巴 | $0.089 | por segundo | Alibaba Wan3.0 (Video) — an all-in-one video model that unifies text-to-video, image-to-video and reference-to-video behind a single endpoint. Generates H.264 MP4 at 480P, 720P or 1080P, up to 30 seconds, from a prompt and an optional first-frame image URL. Billed per second of generated video against the vendor's own ladder: 720P is the base rate, 480P is charged at half of it and 1080P at double. A request that does not name a resolution is produced at 1080P by the model and is charged at that tier. Reference video and reference audio inputs exist in the vendor's model but are not carried on this endpoint. | |
| doubao-seedance-2-5-260628 | 字节跳动 | $10.7000 | $10.7000 | por 1M tokens | ByteDance Seedance 2.5 — el modelo principal de la línea Seedance, que estira una sola generación hasta 4-30 segundos a 24 fps mientras limita la resolución a 480p y 720p. La generación multimodal por referencia llega a 1-30 imágenes, hasta 10 vídeos de referencia y hasta 10 clips de audio de referencia (30 segundos en total para cada categoría) y, a diferencia de la línea 2.0, una referencia de audio puede usarse por sí sola. También cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16. |
| claude-sonnet-4-6 | Anthropic | Facturación escalonada, consulte la página de precios | Anthropic Claude Sonnet 4.6 — the balanced Sonnet generation, offering a 1,000,000-token context window at standard pricing with up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer, so the same text yields roughly 30% fewer tokens than on 4.7-and-later models at the same per-token rate. | ||
| doubao-seedance-2-0-260128 | 字节跳动 | $7.0000 | $7.0000 | por 1M tokens | ByteDance Seedance 2.0 — el buque insignia de la línea Seedance 2.0 y su único integrante que alcanza 1080p y 4K (profundidad de 10 bits) además de 480p y 720p, a 24 fps y de 4 a 15 segundos. Cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16, con el fotograma final disponible como imagen. Se factura según la resolución de salida. |
| stepaudio-2.5-asr | StepFun | $0.0220 | por hora de audio | StepFun StepAudio 2.5 ASR — modelo de reconocimiento de voz de 4B de parámetros construido sobre Multi-Token Prediction, que transcribe cinco minutos de audio en alrededor de un segundo (RTF cercano a 0.0053). Optimizado para chino e inglés. Incluye normalización inversa del texto, identificación de hablantes y separación de dos canales para grabaciones de llamadas y reuniones. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura. | |
| stepaudio-2.5-asr-stream | StepFun | $0.1800 | por hora de audio | StepFun StepAudio 2.5 ASR — 4B-parameter speech recognition model built on Multi-Token Prediction, transcribing five minutes of audio in about one second (RTF around 0.0053). Optimized for Chinese and English. Includes inverse text normalization, speaker identification, and dual-channel separation for call and meeting recordings. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| doubao-seedance-2-0-mini-260615 | 字节跳动 | $1.4000 | $1.4000 | por 1M tokens | ByteDance Seedance 2.0 Mini — el nivel ligero y de bajo costo de la línea Seedance 2.0, limitado a 480p y 720p, 24 fps, de 4 a 15 segundos. Conserva el mismo conjunto de funciones documentado que el resto de la línea: texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16. |
| step-tts-2 | StepFun | $0.4000 | por 10 mil caracteres | StepFun step-tts-2 — síntesis de voz de extremo a extremo basada en NTP y creada para reproducir los acentos con precisión. Habla chino, inglés, mezcla de chino e inglés y japonés, además de cantonés y sichuanés. La emoción y la entonación se dirigen mediante etiquetas en lenguaje natural, y la clonación de voz zero-shot requiere unos 10 segundos de audio de referencia, con los controles de emoción y estilo trasladándose a la voz clonada sin costo adicional. Genera wav, mp3, flac, opus o pcm. | |
| claude-opus-4-6 | Anthropic | Facturación escalonada, consulte la página de precios | Anthropic Claude Opus 4.6 — the Opus generation for complex reasoning and agentic work, with a 1,000,000-token context window at standard pricing and up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer. | ||
| MiniMax-H3 | MiniMax | $0.080 | por segundo | MiniMax H3 (Hailuo 3.0) — modelo de vídeo multimodal de propósito general, abierto y de nueva generación, que produce audio estéreo nativo en una sola pasada, en 768P o 2K, con una duración de 4 a 15 segundos (solo números enteros), a 24 fps. Cubre texto a vídeo, imagen a vídeo a partir de un primer fotograma y/o un último fotograma, y generación por referencia a partir de imágenes, vídeos o audio para el personaje, el movimiento, la cámara, el estilo, la voz o el ritmo de montaje; imagen a vídeo y generación por referencia no pueden combinarse en una misma solicitud. Acepta vídeo H.264/H.265, imágenes JPG, JPEG, PNG, WEBP, HEIC y HEIF, y audio WAV o MP3, con prompts de hasta 7,000 caracteres. $0.08/s en 768P y $0.13/s en 2K. | |
| step-1o-turbo-vision | StepFun | $0.3850 | $1.2330 | por 1M tokens | StepFun step-1o-turbo-vision — comprensión de imágenes y vídeo con generación rápida de texto, contexto de 32K. Acepta texto, imagen y vídeo como entrada y devuelve solo texto. Es un modelo de visión de la generación anterior que se mantiene por compatibilidad; step-3.7-flash cubre las mismas modalidades de entrada con contexto de 256K y profundidad de razonamiento seleccionable. Mantenga las imágenes por debajo de 4096 píxeles en el lado más largo para un reconocimiento fiable. |
| step-asr-1.1-stream | StepFun | $0.3852 | por hora de audio | StepFun step-asr-1.1 — the updated general-purpose recognizer in the step-asr line, covering Chinese, English, and Chinese dialects. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| gpt-5.4-mini | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT-5.4 mini — the small GPT-5.4 model for high-volume workloads, coding, computer use, and subagents. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 400,000-token context window with a 272,000-token maximum input, and up to 128,000 output tokens. | ||
| agnes-2.5-flash | Agnes AI | $0.0000 | por 1M tokens | Agnes AI Agnes 2.5 Flash — modelo de agente multimodal rápido con ventana de contexto de entrada de 512K y límite de salida de referencia de 65.5K, compatible con chat, streaming, llamada a herramientas, programación, razonamiento, diálogo multiturno, comprensión visual y flujos de trabajo de agentes. | |
| claude-opus-4-7 | Anthropic | Facturación escalonada, consulte la página de precios | Anthropic Claude Opus 4.7 — modelo de razonamiento avanzado para ingeniería de software difícil y tareas agénticas complejas de ejecución prolongada. Pone el acento en el seguimiento riguroso de instrucciones, la autoverificación, el uso fiable de herramientas y la visión de alta resolución sobre interfaces, imágenes, documentos y flujos profesionales. | ||
| gemini-3.6-flash | Facturación escalonada, consulte la página de precios | Google Gemini 3.6 Flash — a stable multimodal reasoning model that balances speed and intelligence for agentic and real-world tasks, with a 1,048,576-token input context and 65,536-token output limit. It accepts text, images, video, audio, and PDFs, and supports thinking, function calling, code execution, search grounding, structured output, and Computer Use (preview). Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5v-turbo | 智谱 | $1.2000 | $4.0000 | por 1M tokens | Zhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows. |
| gpt-4o | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT-4o — the multimodal GPT-4 generation model, kept in the catalogue for drop-in compatibility with existing integrations that call it by name. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| gpt-4o-mini | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT-4o mini — the small, low-cost GPT-4o variant for high-volume and latency-sensitive work. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| deepseek-v4-flash | DeepSeek | Facturación escalonada, consulte la página de precios | DeepSeek V4 Flash 0731 — the fast, high-concurrency DeepSeek V4 tier for chat, coding help, and agent loops, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3.7-flash | Facturación escalonada, consulte la página de precios | Google Gemini 3.7 Flash — the newest Flash-tier multimodal reasoning model, priced identically to 3.6 Flash while the vendor promotion runs. Accepts text, images, video, audio and PDFs; supports thinking, function calling, code execution, search grounding and structured output. Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5.2 | 智谱 | $1.4000 | $4.4000 | por 1M tokens | Zhipu GLM-5.2 — modelo fundacional buque insignia especializado en el trabajo de agente de programación de larga duración, logrado con meses de entrenamiento dedicado y no solo con una ampliación del contexto, con una ventana de contexto de 1M tokens y hasta 128K tokens de salida. Texto de entrada, texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP. |
| gpt-5.6-sol | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT-5.6 Sol — modelo buque insignia de la línea GPT-5.6 para razonamiento de vanguardia, trabajo profesional complejo, programación, ciencia, ciberseguridad y flujos de trabajo agénticos de larga duración. Admite entrada de texto e imagen, herramientas integradas, una ventana de contexto de 1,050,000 tokens, hasta 128,000 tokens de salida y los ajustes de razonamiento más profundos de la familia. | ||
| mimo-v2.5-asr | Xiaomi | $0.0740 | por hora de audio | Modelo de reconocimiento de voz de Xiaomi MiMo optimizado para chino e inglés y para dialectos chinos, capaz de manejar audio con ruido, captado a distancia y con varios hablantes, así como la transcripción de letras de canciones. | |
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | por 10 mil caracteres | Modelo de clonación de voz de Xiaomi MiMo: envíe una muestra de audio de referencia como data URL en el campo voice (data:{mime};base64,...) y el modelo sintetiza el habla con esa voz, sin ninguna etapa de entrenamiento, anotación ni ajuste fino. Acepta MP3 (audio/mpeg) o WAV, con la cadena codificada en base64 limitada a 10 MB; Xiaomi no publica una duración mínima para el audio de referencia. Las instrucciones de estilo en lenguaje natural y las etiquetas de audio en línea se heredan de mimo-v2.5-tts, pero no hay streaming: la solicitud se ejecuta en modo de compatibilidad y solo devuelve el resultado una vez terminada la síntesis. | |
| wan2.7-image | 阿里巴巴 | $0.030 | por solicitud | Alibaba Wan2.7 Image — texto a imagen, edición de imágenes, generación con varias imágenes de referencia, edición interactiva, y buen trazado de texto y seguimiento de instrucciones. | |
| claude-opus-4-8 | Anthropic | Facturación escalonada, consulte la página de precios | Anthropic Claude Opus 4.8 — modelo de razonamiento de alta capacidad para programación, flujos de trabajo agénticos, análisis profesional y trabajo de ejecución prolongada. Frente a Opus 4.7 mejora la fiabilidad, el criterio, la eficiencia en el uso de herramientas, el uso de la computadora y el razonamiento multimodal sobre documentos, y admite una ventana de contexto de 1,000,000 tokens. | ||
| gpt-4.1-mini | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT-4.1 mini — the small GPT-4.1 variant. Being non-reasoning, its prose stays more predictable than the reasoning tier at a comparable price, which suits writing and rewriting work. It takes text and image input, with a 1,047,576-token context window and up to 32,768 output tokens. | ||
| kling-v3-omni | 快手 | $0.420 | por solicitud | Kling 3.0 Omni — generación de vídeo a partir de varias imágenes de referencia. El precio publicado corresponde al nivel std (720p, 5 s, sin audio, sin vídeo de referencia). Las solicitudes que no fijan mode usan el nivel pro, predeterminado en el proveedor, y se facturan 1.33x, unos $0.56 por el mismo clip de 5 s; el 4k se factura 5x. Envíe mode=std para que se le cobre el precio publicado. | |
| speech-2.8-turbo | MiniMax | $0.6000 | por 10 mil caracteres | MiniMax speech-2.8-turbo — el nivel de baja latencia de la línea de voz 2.8, que cambia la interpretación ultrarrealista del modelo HD por una síntesis más rápida y de flujo natural. Cubre los mismos 40 idiomas y 7 emociones, con tono, velocidad del habla, volumen, frecuencia de muestreo, tasa de bits y formato de salida configurables, y acepta hasta 1 millón de caracteres de forma asíncrona o 10,000 caracteres a través de la interfaz de streaming. | |
| gpt-image-2 | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT Image 2 — a state-of-the-art image generation and editing model for fast, high-quality output. It takes text and image input, supports flexible image sizes and high-fidelity image inputs, and bills per token rather than per call: $5 text input, $1.25 cached text input, $8 image input, and $30 image output per 1M tokens. | ||
| kimi-k3 | Moonshot | $3.0000 | $15.0000 | por 1M tokens | Moonshot Kimi K3 — buque insignia de 2.8 billones de parámetros para programación de larga duración, trabajo del conocimiento de extremo a extremo y razonamiento profundo, con una ventana de contexto de 1M tokens y hasta 1,048,576 tokens de finalización (131,072 por defecto). Acepta texto, imágenes en base64 y vídeo, y devuelve texto. El razonamiento está siempre activo, con reasoning_effort seleccionable entre low, high o max (max por defecto); la temperatura está fijada en 1.0. Admite llamada a herramientas personalizadas y carga dinámica de herramientas. |
| kling-3.0-turbo | 快手 | $0.560 | por solicitud | Kuaishou Kling 3.0 Turbo — el nivel económico de la línea Kling 3.0, que genera 720P o 1080P (720P por defecto) de 3 a 15 segundos (5 por defecto) en 16:9, 9:16 o 1:1, a partir de un prompt o de una imagen de primer fotograma. El audio nativo se incluye siempre y no tiene interruptor. Frente a kling-v3, renuncia al nivel 4K, al control del fotograma final y a la entrada de vídeo a cambio de velocidad y costo. 720p 5 s con audio ≈ $0.56. | |
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | por 1M tokens | StepFun step-3.7-flash — sparse MoE with 198B total and 11B active parameters, native 256K context, and native understanding of images and video alongside text. Reasoning depth is selectable per request through reasoning_effort (low / medium / high), and the model supports reliable multi-step tool calling, JSON Schema structured output, streaming, and prompt caching. Tuned for agent and coding workloads. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| doubao-seed-2-1-turbo-260628 | 字节跳动 | $0.4440 | $2.2220 | por 1M tokens | ByteDance Doubao Seed 2.1 Turbo — la vía de baja latencia de la línea Seed 2.1, que comparte los límites del Pro: ventana de contexto de 256K con una entrada máxima de 256K, hasta 256K tokens de salida (4K por defecto) y un presupuesto de 256K para la cadena de razonamiento. Cubre razonamiento profundo, generación de texto, comprensión multimodal, llamada a herramientas y salida estructurada, aunque sin la recomendación de json_schema del Pro. Acepta texto, imagen y vídeo y devuelve texto; la comprensión de audio no figura para la línea 2.1. Admite caché de contexto implícita y explícita. |
| glm-5.3 | 智谱 | $1.4000 | $4.4000 | por 1M tokens | Zhipu GLM-5.3 — flagship coding-and-agent model post-trained on the same base as GLM-5.2: a 50% gain on Zhipu's internal coding bench, open-source SOTA on Terminal-Bench 3.0 and Agents' Last Exam, and state-of-the-art CyberGym vulnerability-discovery results, with a 1M-token context window and up to 128K output tokens. Text in, text out. Supports multiple thinking modes, function calling, structured JSON output, streaming, context caching, and MCP tool integration. |
| gpt-5.2 | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT-5.2 — a general-purpose model from the GPT-5.2 generation, kept in the catalogue for drop-in compatibility with integrations that call it by name. It takes text and image input, with a 400,000-token context window and up to 128,000 output tokens. | ||
| happyhorse-1.1-t2v | 阿里巴巴 | $0.091 | por segundo | Alibaba HappyHorse 1.1 (T2V) — texto a vídeo con mejor comprensión semántica, control de cámara y generación dinámica. Vídeo 720P/1080P fluido, detallado y físicamente coherente. | |
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | por solicitud | MiniMax Hailuo 2.3 Fast — el nivel de velocidad y costo de Hailuo 2.3, centrado en imagen a vídeo y en el realismo del movimiento físico, a 24 fps, con 768p disponible en clips de 6 o 10 segundos y 1080p en 6 segundos. 768p 6 s = $0.19. | |
| qwen3-asr-flash | 阿里巴巴 | $0.1260 | por hora de audio | Alibaba Qwen3-ASR-Flash — reconocimiento de voz construido sobre el modelo fundacional Qwen3, que determina por sí solo el idioma hablado y transcribe 11 idiomas; la línea Qwen3-ASR documenta el mandarín junto con el sichuanés, el min nan, el wu y el cantonés, además de varios acentos del inglés. Acepta aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma y wmv de hasta 5 minutos y 10 MB por solicitud; la entrada pcm debe estar en 16 kHz y los demás formatos se remuestrean a 16 kHz antes del reconocimiento. | |
| claude-opus-5 | Anthropic | Facturación escalonada, consulte la página de precios | Anthropic Claude Opus 5 — modelo de razonamiento profundo para programación agéntica compleja y trabajo empresarial, con mejoras notables en tareas de larga duración, revisión de código, flujos documentales, visión y coordinación entre varios agentes. Cuenta con una ventana de contexto de 1,000,000 tokens, admite hasta 128,000 tokens de salida y activa el thinking adaptativo de forma predeterminada. | ||
| gemini-2.5-flash-image | Facturación escalonada, consulte la página de precios | Google Gemini 2.5 Flash Image (Nano Banana) — a fast native image generation and editing model for creative workflows. It takes text and image input and returns images through the OpenAI-compatible chat completions endpoint, with a 65,536-token input limit and 32,768-token output limit. | |||
| qwen3.8-max | 阿里巴巴 | $1.9000 | $5.7000 | por 1M tokens | Alibaba Qwen3.8-Max — 2.4-trillion-parameter MoE flagship and the most capable model in the Qwen family, with the vendor citing major gains in coding and office productivity. 1,000,000-token context window (991,808 max input, 983,616 in thinking mode), up to 131,072 output tokens, and a 262,144-token chain-of-thought budget. Accepts text input and returns text (image/video input is not available on the current serving route); supports function calling, structured outputs, and context caching. |
| step-asr | StepFun | $0.1444 | por hora de audio | StepFun step-asr — reconocimiento de voz de propósito general que cubre chino, inglés y dialectos chinos, para transcripción, actas de reuniones, revisión de calidad de llamadas y búsqueda por voz. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura. | |
| agnes-image-2.0-flash | Agnes AI | $0.000 | por solicitud | Agnes AI Image 2.0 Flash — modelo rápido de generación y edición de imágenes para texto a imagen, imagen a imagen y composición con varias imágenes, cuyos resultados se entregan como URL o datos Base64. | |
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | por 1M tokens | Xiaomi MiMo-V2.5-Pro — buque insignia de un billón de parámetros (42B activos) con contexto de 1M y salida máxima de 128K, ajustado para cargas de trabajo de agentes de alta intensidad. Admite razonamiento profundo, llamada a funciones, salida estructurada y búsqueda web. Solo generación de texto: a diferencia de mimo-v2.5, la lista de capacidades del proveedor no incluye la comprensión de todas las modalidades. |
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | por 10 mil caracteres | Modelo de diseño de voz de Xiaomi MiMo: describa en lenguaje natural la voz deseada mediante instructions y el modelo sintetiza el habla con esa voz diseñada. | |
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | por 1M tokens | StepFun step-3.5-flash-2603 — instantánea de 256K de step-3.5-flash ajustada para agentes, optimizada para la eficiencia en tokens y un modo de operación de inferencia reducida. Su parámetro reasoning_effort solo acepta low y high, mientras que el modelo base acepta tres niveles, por lo que el código que envía medium debe adaptarse. Solo texto; admite llamada a herramientas, salida estructurada mediante JSON Schema, streaming y caché de prompts. |
| doubao-seedream-5-0-260128 | 字节跳动 | $0.033 | por solicitud | ByteDance Doubao Seedream 5.0-lite — texto a imagen e imagen a imagen, con una creación controlable más inteligente, recuperación en tiempo real y mayor coherencia del sujeto (resolución de 2K o superior). | |
| glm-5 | 智谱 | $1.0000 | $3.2000 | por 1M tokens | Zhipu GLM-5 — MoE de 744B parámetros con 40B activos, entrenado con 28.5T tokens y con DeepSeek Sparse Attention, con una ventana de contexto de 200K y hasta 128K tokens de salida. Texto de entrada, texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP. |
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | por 1M tokens | Meituan LongCat-2.0 — modelo MoE abierto de 1.6T de parámetros con contexto nativo de 1M, creado para programación agéntica y uso de herramientas de larga duración. Modelo de razonamiento solo de texto. |
| wan2.7-t2v | 阿里巴巴 | $0.080 | por segundo | Alibaba Wan2.7 (T2V) — texto a vídeo con mejor interpretación actoral, emociones matizadas, acción intensa y cortes de cámara dramáticos. Produce MP4 H.264 en 720P o 1080P, de 2 a 15 segundos (5 s por defecto), en 16:9, 9:16, 1:1, 4:3 o 3:4, a partir de prompts de hasta 5,000 caracteres. El audio se incluye por defecto: sin audio_url, el modelo compone música de fondo o efectos de sonido acordes, o bien puede enviarse en su lugar una pista wav o mp3 de 2 a 30 segundos. | |
| claude-sonnet-5 | Anthropic | Facturación escalonada, consulte la página de precios | Anthropic Claude Sonnet 5 — modelo de producción que equilibra inteligencia de vanguardia y velocidad para programación, agentes y flujos de trabajo empresariales. Puede planificar, usar herramientas de navegador y terminal, y trabajar de forma autónoma en tareas de razonamiento, trabajo del conocimiento e ingeniería de software. | ||
| gemini-3.1-flash-lite-image | Facturación escalonada, consulte la página de precios | Google Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — modelo de latencia ultrabaja y buena relación costo-beneficio para generación de imágenes de gran volumen y ediciones rápidas en varios turnos. Acepta texto e imágenes, produce imágenes de 1K, admite thinking y edición conversacional, y está diseñado para aplicaciones interactivas de desarrolladores y de consumo. | |||
| stepaudio-2-asr-pro | StepFun | $0.3370 | por hora de audio | StepFun StepAudio 2 ASR Pro — modelo de reconocimiento de voz de 32B de parámetros, la opción que prioriza la precisión dentro de la línea ASR de StepFun, mientras que stepaudio-2.5-asr prioriza velocidad y costo. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura. | |
| agnes-2.0-flash | Agnes AI | $0.0000 | por 1M tokens | Agnes AI Agnes 2.0 Flash — modelo de agente multimodal rápido con ventana de contexto de entrada de 256K y límite de salida de referencia de 64K, compatible con chat, streaming, llamada a herramientas, programación, razonamiento, comprensión visual y flujos de trabajo de agentes. | |
| gemini-2.5-pro | Facturación escalonada, consulte la página de precios | Google Gemini 2.5 Pro — the reasoning-tier model of the 2.5 family, with a 1M-token context window. Prompts above 200,000 tokens are repriced at the vendor's long-context rate for the whole request, matching Google's own rule. | |||
| glm-tts | 智谱 | $0.2963 | por 10 mil caracteres | Zhipu GLM-TTS — síntesis de voz construida sobre una arquitectura de generación en dos etapas con aprendizaje por refuerzo GRPO, que infiere la emoción y la entonación del texto circundante en lugar de exigir un marcado explícito. Incluye siete voces integradas (tongtong por defecto, xiaochen, chuichui, jam, kazi, douji, luodo) con velocidad y volumen ajustables, acepta hasta 1,024 caracteres por solicitud y transmite con una latencia de primer fotograma inferior a 400 ms. Devuelve wav o pcm a una frecuencia de muestreo recomendada de 24 kHz; el streaming es solo en pcm. | |
| gpt-5.6-terra | OpenAI | Facturación escalonada, consulte la página de precios | OpenAI GPT-5.6 Terra — modelo GPT-5.6 equilibrado para el trabajo profesional cotidiano, que ofrece alta inteligencia y buen rendimiento como agente de programación a un costo menor que Sol. Admite entrada de texto e imagen, herramientas integradas, una ventana de contexto de 1,050,000 tokens y hasta 128,000 tokens de salida. | ||
| step-audio-2 | StepFun | $1.4930 | $10.4480 | por 1M tokens | StepFun step-audio-2 — modelo de voz de extremo a extremo que consume el audio directamente en lugar de partir de una transcripción, de modo que el tono y la entonación llegan intactos a la comprensión del modelo. Se factura por token, con la tarifa de entrada de la línea StepAudio 2.5 y una tarifa de salida más alta. StepFun no publica una página de capacidades independiente para este modelo; consulte la documentación de audio de la plataforma para conocer el conjunto de parámetros vigente. |
| step-image-edit-2 | StepFun | $0.003 | por solicitud | StepFun Step Image Edit 2 — modelo unificado de generación de imágenes a partir de texto y edición de imágenes con menos de 6B de parámetros, a la altura de los editores de pesos abiertos del rango de 12B a 20B. Completa una edición en uno o dos segundos y está pensado para retoque interactivo de baja latencia. Admite 256x256, 512x512, 768x768, 1024x1024, 1280x800 y 800x1280, además de prompts negativos y un modo de optimización del texto; una imagen por solicitud. Se sirve mediante el endpoint images compatible con OpenAI. | |
| claude-opus-4-5 | Anthropic | Facturación escalonada, consulte la página de precios | Anthropic Claude Opus 4.5 — a pinned dated snapshot of the Opus 4.5 release for workloads that need byte-stable behaviour. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | por 1M tokens | StepFun step-3.5-flash — modelo de razonamiento solo de texto con contexto de 256K, orientado a lógica, matemáticas, ingeniería de software e investigación profunda, donde la calidad del razonamiento debe ir acompañada de una ejecución rápida y fiable. La profundidad del razonamiento se elige por solicitud mediante reasoning_effort (low / medium / high). Admite llamada a herramientas, salida estructurada mediante JSON Schema, streaming y caché de prompts. Para entradas de imagen o vídeo, utilice step-3.7-flash. |