Precios de los modelos de IA chinos

ChinaAPI ofrece DeepSeek, Qwen, GLM, Kimi y otros modelos de IA chinos a través de un gateway compatible con OpenAI en https://api.chinaapi.ai/v1. Todos los precios están en dólares estadounidenses, expresados en la unidad que utiliza el proveedor de origen. La misma lista está disponible en JSON en /api/pricing.

60 modelos desbloquean precios Paid más bajos tras la primera recarga: una sola recarga de cualquier importe los activa automáticamente para toda la cuenta. El precio Paid solo aparece cuando es inferior al precio Standard.

Precios de los modelos públicos
ModeloProveedorEntradaSalidaEntrada (precio Paid)Salida (precio Paid)UnidadDescripción
agnes-2.5-flashAgnes AI$0.0000por 1M tokensAgnes AI Agnes 2.5 Flash — modelo de agente multimodal rápido con ventana de contexto de entrada de 512K y límite de salida de referencia de 65.5K, compatible con chat, streaming, llamada a herramientas, programación, razonamiento, diálogo multiturno, comprensión visual y flujos de trabajo de agentes.
agnes-2.5-proAgnes AI$0.4500$0.9000por 1M tokensAgnes AI Agnes 2.5 Pro — la versión estable comercial del modelo de referencia 2.5 Pro Alpha, un modelo de razonamiento de pago con contexto de entrada de 1M y salida máxima de 65,536 tokens, para programación avanzada, razonamiento científico, análisis de contexto largo, flujos de trabajo de agentes y comprensión de imágenes.
agnes-2.5-pro-betaAgnes AI$0.1000$0.3000por 1M tokensAgnes AI Agnes 2.5 Pro Beta — el nivel económico de la familia Pro, facturado a su propio precio Beta, muy por debajo del de 2.5 Pro, un modelo de razonamiento de pago con el mismo formato de solicitud, los mismos protocolos de texto y los mismos límites de contexto, para programación avanzada, razonamiento científico, análisis de contexto largo, flujos de trabajo de agentes y comprensión de imágenes.
agnes-3.0-flashAgnes AI$0.0000por 1M tokensAgnes AI Agnes 3.0 Flash — el modelo de lenguaje de nueva generación del proveedor, creado para la programación agéntica y la ejecución de tareas guiada por herramientas, con un contexto de entrada de 512K y un límite de salida de 65,536 tokens. Acepta como entrada texto e imágenes mediante URL y devuelve texto, y admite streaming, llamada a funciones y orquestación de herramientas en varios pasos, y seguimiento de instrucciones en tareas largas. Accesible en el endpoint de chat compatible con OpenAI, el endpoint Responses y el endpoint Messages compatible con Anthropic. En el endpoint de chat, el modo de razonamiento (Thinking) se activa estableciendo chat_template_kwargs.enable_thinking en true; en una medición del 2026-09-21, las solicitudes sin ese campo no devolvieron tokens de razonamiento. Con el modo Thinking activado, los tokens de razonamiento se contabilizan dentro de max_tokens, así que dimensiónelo para cubrir tanto el razonamiento como la respuesta.
agnes-image-2.0-flashAgnes AI$0.000por solicitudAgnes AI Image 2.0 Flash — modelo rápido de generación y edición de imágenes para texto a imagen, imagen a imagen y composición con varias imágenes, cuyos resultados se entregan como URL o datos Base64.
agnes-image-2.1-flashAgnes AI$0.000por solicitudAgnes AI Image 2.1 Flash — modelo de generación y edición de imágenes centrado en el detalle para escenas de alta densidad de información, que cubre texto a imagen, imagen a imagen y composición con varias imágenes, con tamaños y relaciones de aspecto flexibles de 1K a 4K.
agnes-image-2.5-flashAgnes AI$0.000por solicitudAgnes AI Image 2.5 Flash — modelo de imágenes de la generación más reciente, por delante de Image 2.1 Flash en generación, edición, composición, representación del detalle y fidelidad al prompt, para texto a imagen, imagen a imagen y composición con varias imágenes, con tamaños y relaciones de aspecto flexibles de 1K a 4K.
agnes-video-2.5Agnes AI$0.025por segundoAgnes AI Video 2.5 — modelo de vídeo asíncrono de pago que genera clips de 4-12 segundos en 720P, 960P o 2K a partir de texto, de fotogramas clave inicial/final, o de referencias de imagen, audio y vídeo.
agnes-video-2.5-flashAgnes AI$0.000por segundoAgnes AI Video 2.5 Flash — la variante solo 720P de Video 2.5, que genera vídeo de 4-12 segundos a partir de texto, de fotogramas clave inicial/final, o de referencias de imagen y audio, con la misma API de tareas asíncronas.
claude-fable-5Anthropic$10.0000$50.0000$7.0000$35.0000por 1M tokensAnthropic Claude Fable 5 — el modelo más capaz de Anthropic entre los de disponibilidad general, para trabajo del conocimiento y programación ambiciosos y de larga duración. Está construido para tareas agénticas de varios días, ingeniería de software compleja, investigación profunda, razonamiento sobre documentos e imágenes y autoverificación proactiva.
claude-fable-5-1Anthropic$10.0000$50.0000$8.0000$40.0000por 1M tokensAnthropic Claude Fable 5.1 — el buque insignia más reciente de Anthropic entre los modelos de disponibilidad general, para trabajo del conocimiento y programación ambiciosos y de larga duración. Está construido para tareas agénticas de varios días, ingeniería de software compleja, investigación profunda, razonamiento sobre documentos e imágenes y autoverificación proactiva. Las lecturas de caché tienen un precio del 2.5% de la entrada, el más bajo de su generación.
claude-haiku-4-5Anthropic$1.0000$5.0000$0.7000$3.5000por 1M tokensAnthropic Claude Haiku 4.5 — el modelo Claude más rápido, con una inteligencia cercana a la de vanguardia, construido para trabajo de gran volumen y sensible a la latencia, como clasificación, extracción y enrutamiento. Admite entrada de texto e imagen, thinking extendido, una ventana de contexto de 200,000 tokens y hasta 64,000 tokens de salida.
claude-haiku-5-5Anthropic$0.1000$0.5000$0.0600$0.3000por 1M tokensAnthropic Claude Haiku 5.5 — comprensión rápida y económica de texto e imágenes para clasificación, extracción, enrutamiento y agentes. Contexto de 1.000.000 tokens y salida máxima de 128.000 tokens. El pensamiento adaptativo usa medium por defecto; output_config.effort en Messages permite elegir low, medium, high, xhigh o max. Admite streaming y llamadas forzadas a herramientas. Si la entrada supera 100.000 tokens, toda la solicitud se cobra con la tarifa de contexto largo, incluida la salida y la caché.
claude-opus-4-5Anthropic$5.0000$25.0000$3.5000$17.5000por 1M tokensAnthropic Claude Opus 4.5 — la versión Opus 4.5, que Anthropic incluye ahora entre sus modelos heredados y mantiene disponible, para cargas de trabajo que quieran permanecer en esta versión del modelo. Admite entrada de texto e imagen, thinking extendido, una ventana de contexto de 200,000 tokens y hasta 64,000 tokens de salida.
claude-opus-4-6Anthropic$5.0000$25.0000$3.5000$17.5000por 1M tokensAnthropic Claude Opus 4.6 — la generación Opus para razonamiento complejo y trabajo agéntico, con una ventana de contexto de 1,000,000 tokens a precio estándar y hasta 128,000 tokens de salida. Admite entrada de texto e imagen y thinking adaptativo, y utiliza el tokenizador anterior a 4.7.
claude-opus-4-7Anthropic$5.0000$25.0000$3.5000$17.5000por 1M tokensAnthropic Claude Opus 4.7 — modelo de razonamiento avanzado para ingeniería de software difícil y tareas agénticas complejas de ejecución prolongada. Pone el acento en el seguimiento riguroso de instrucciones, la autoverificación, el uso fiable de herramientas y la visión de alta resolución sobre interfaces, imágenes, documentos y flujos profesionales.
claude-opus-4-8Anthropic$5.0000$25.0000$3.5000$17.5000por 1M tokensAnthropic Claude Opus 4.8 — modelo de razonamiento de alta capacidad para programación, flujos de trabajo agénticos, análisis profesional y trabajo de ejecución prolongada. Frente a Opus 4.7 mejora la fiabilidad, el criterio, la eficiencia en el uso de herramientas, el uso de la computadora y el razonamiento multimodal sobre documentos, y admite una ventana de contexto de 1,000,000 tokens.
claude-opus-5Anthropic$5.0000$25.0000$3.0000$15.0000por 1M tokensAnthropic Claude Opus 5 — modelo de razonamiento profundo para programación agéntica compleja y trabajo empresarial, con mejoras notables en tareas de larga duración, revisión de código, flujos documentales, visión y coordinación entre varios agentes. Cuenta con una ventana de contexto de 1,000,000 tokens, admite hasta 128,000 tokens de salida y activa el thinking adaptativo de forma predeterminada.
claude-opus-5-5Anthropic$4.0000$20.0000$2.4000$12.0000por 1M tokensAnthropic Claude Opus 5.5 — diseñado para programación agéntica y trabajo de conocimiento de larga duración, a un precio menor que Claude Opus 5. Acepta entrada de texto e imagen, cuenta con una ventana de contexto de 1,000,000 tokens y admite hasta 128,000 tokens de salida. El thinking adaptativo está siempre activo; el parámetro effort controla la profundidad del razonamiento, con medium como valor predeterminado.
claude-sonnet-4-5Anthropic$3.0000$15.0000$2.1000$10.5000por 1M tokensAnthropic Claude Sonnet 4.5 — la versión Sonnet 4.5, que Anthropic incluye ahora entre sus modelos heredados y mantiene disponible, para cargas de trabajo que quieran permanecer en esta versión del modelo. Admite entrada de texto e imagen, thinking extendido, una ventana de contexto de 200,000 tokens y hasta 64,000 tokens de salida.
claude-sonnet-4-6Anthropic$3.0000$15.0000$2.1000$10.5000por 1M tokensAnthropic Claude Sonnet 4.6 — la generación Sonnet equilibrada, que ofrece una ventana de contexto de 1,000,000 tokens a precio estándar con hasta 128,000 tokens de salida. Admite entrada de texto e imagen y thinking adaptativo, y utiliza el tokenizador anterior a 4.7, de modo que el mismo texto produce aproximadamente un 30% menos de tokens que en los modelos 4.7 y posteriores, a la misma tarifa por token.
claude-sonnet-5Anthropic$2.0000$10.0000$1.4000$7.0000por 1M tokensAnthropic Claude Sonnet 5 — modelo de producción que equilibra inteligencia de vanguardia y velocidad para programación, agentes y flujos de trabajo empresariales. Puede planificar, usar herramientas de navegador y terminal, y trabajar de forma autónoma en tareas de razonamiento, trabajo del conocimiento e ingeniería de software.
claude-sonnet-5-5Anthropic$2.0000$10.0000$1.2000$6.0000por 1M tokensAnthropic Claude Sonnet 5.5 — equilibra velocidad e inteligencia para programación, agentes y cargas de trabajo en producción. Acepta entrada de texto e imagen, cuenta con una ventana de contexto de 1,000,000 tokens y admite hasta 128,000 tokens de salida. El thinking adaptativo está activo de forma predeterminada y los tokens de thinking se facturan como salida; output_config.effort permite elegir low, medium, high, xhigh o max, con high como valor predeterminado. Para desactivar el thinking previo, envíe thinking con type between_tools, que funciona con un effort de high o inferior; type disabled se rechaza. Establecer temperature, top_p o top_k en un valor distinto del predeterminado devuelve un error, igual que forzar una llamada a herramienta con tool_choice any o tool. Los bloques de thinking están vinculados al modelo y a la conversación; devuélvalos sin cambios en los turnos posteriores.
cogview-4Zhipu AI$0.010$0.0095por solicitudZhipu CogView-4 — el modelo de texto a imagen CogView de cuarta generación, que admite varias resoluciones de salida y dos niveles de servicio, uno base y otro de alta definición. Acepta prompts en chino y en inglés y representa texto dentro de la imagen. Una imagen por solicitud.
deepseek-flashDeepSeek$0.1500$0.6000por 1M tokensDeepSeek V4.1 Flash — el identificador de modelo canónico para nuevas integraciones. Admite entrada de texto e imagen, modos con y sin razonamiento, llamada a herramientas y salida en JSON. Los identificadores retirados deepseek-v4-flash y deepseek-v4-flash-vision-exp siguen siendo alias de compatibilidad, servidos por este mismo modelo al mismo precio Flash. Ventana de contexto de 1M tokens, salida máxima de 384K. En /v1/responses, envíe la conversación completa en el array input en cada turno: en el proveedor upstream no se conserva ningún estado de la conversación, de modo que las solicitudes que incluyan previous_response_id o conversation se rechazan.
deepseek-v4-proDeepSeek$0.6600$1.9800por 1M tokensDeepSeek V4 Pro 0813 — el nivel de mayor capacidad de DeepSeek V4 para programación, razonamiento y trabajo agéntico, con una ventana de contexto de 1M tokens y una salida máxima de 384K. Funciona tanto en modo de razonamiento (predeterminado) como sin razonamiento, y admite llamada a herramientas y salida en JSON. Texto de entrada, texto de salida. En /v1/responses, envíe la conversación completa en el array input en cada turno: en el proveedor upstream no se conserva ningún estado de la conversación, de modo que las solicitudes que incluyan previous_response_id o conversation se rechazan.
doubao-seed-2-1-pro-260628ByteDance$0.8889$4.4444por 1M tokensByteDance Doubao Seed 2.1 Pro — modelo de agente buque insignia de Doubao para el trabajo en producción, que cubre razonamiento profundo, generación de texto, comprensión multimodal, llamada a herramientas y salida estructurada, para la que el proveedor recomienda el modo json_schema. Ventana de contexto de 256K con una entrada máxima de 256K, hasta 256K tokens de salida (4K por defecto) y un presupuesto de 256K para la cadena de razonamiento. Acepta texto, imagen y vídeo y devuelve texto; la comprensión de audio no figura para la línea 2.1. Admite caché de contexto implícita y explícita, incluidas las cachés de prefijo y de sesión.
doubao-seed-2-1-turbo-260628ByteDance$0.4444$2.2222por 1M tokensByteDance Doubao Seed 2.1 Turbo — la vía de baja latencia de la línea Seed 2.1, que comparte los límites del Pro: ventana de contexto de 256K con una entrada máxima de 256K, hasta 256K tokens de salida (4K por defecto) y un presupuesto de 256K para la cadena de razonamiento. Cubre razonamiento profundo, generación de texto, comprensión multimodal, llamada a herramientas y salida estructurada, aunque sin la recomendación de json_schema del Pro. Acepta texto, imagen y vídeo y devuelve texto; la comprensión de audio no figura para la línea 2.1. Admite caché de contexto implícita y explícita.
doubao-seed-character-260628ByteDance$0.1185$0.2963por 1M tokensByteDance Doubao Seed Character (260628) — el modelo de diálogo de personajes de Doubao para conversaciones de varios turnos guiadas por una persona, la línea sucesora de doubao-1-5-pro-32k-character. Esta versión lleva las etiquetas de capacidades del proveedor para razonamiento profundo, generación de texto, comprensión multimodal, llamada a herramientas y salida estructurada (se recomienda json_schema). Ventana de contexto de 128K con una entrada máxima de 96K y hasta 32K tokens de salida (4K por defecto). El precio depende de la longitud de la entrada: las solicitudes de hasta 32K tokens de entrada se facturan en el nivel estándar; las más largas se facturan en el nivel de contexto largo, donde la entrada cuesta 1.5 veces y la salida tres veces la tarifa del nivel estándar.
doubao-seed-evolvingByteDance$0.8889$4.4444por 1M tokensByteDance Doubao Seed Evolving — el modelo insignia actual de Doubao para programación y agentes, publicado como versión continua (rolling release): el proveedor actualiza el modelo cada semana bajo este mismo ID, sin una instantánea fechada, por lo que su comportamiento y sus capacidades pueden cambiar sin que cambie el número de versión. Lleva las etiquetas de capacidades del proveedor para razonamiento profundo, generación de texto, comprensión multimodal, manejo de tareas de interfaz gráfica (GUI), llamada a herramientas y salida estructurada (se recomienda json_schema). Ventana de contexto de 1,024K con una entrada máxima de 1,024K y hasta 256K tokens de salida (4K por defecto).
doubao-seedance-2-0-260128ByteDance$7.0000por 1M tokensByteDance Seedance 2.0 — el buque insignia de la línea Seedance 2.0 y su único integrante que alcanza 1080p y 4K (profundidad de 10 bits) además de 480p y 720p, a 24 fps y de 4 a 15 segundos. Cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16, con el fotograma final disponible como imagen. Se factura según la resolución de salida.
doubao-seedance-2-0-fast-260128ByteDance$5.6000por 1M tokensByteDance Seedance 2.0 Fast — generación de vídeo económica que conserva todo el conjunto de funciones de Seedance 2.0 pero limitada a 480p y 720p, 24 fps, de 4 a 15 segundos. Cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16. 480p 5 s ≈ $0.26.
doubao-seedance-2-0-mini-260615ByteDance$3.5000por 1M tokensByteDance Seedance 2.0 Mini — el nivel ligero y de bajo costo de la línea Seedance 2.0, limitado a 480p y 720p, 24 fps, de 4 a 15 segundos. Conserva el mismo conjunto de funciones documentado que el resto de la línea: texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16.
doubao-seedance-2-5-260628ByteDance$10.7000por 1M tokensByteDance Seedance 2.5 — el modelo principal de la línea Seedance, que estira una sola generación hasta 4-30 segundos a 24 fps mientras limita la resolución a 480p y 720p. La generación multimodal por referencia llega a 1-30 imágenes, hasta 10 vídeos de referencia y hasta 10 clips de audio de referencia (30 segundos en total para cada categoría) y, a diferencia de la línea 2.0, una referencia de audio puede usarse por sí sola. También cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16.
doubao-seedream-4-5-251128ByteDance$0.03704por solicitudByteDance Doubao Seedream 4.5 — texto a imagen e imagen a imagen con fusión de varias imágenes, que produce una imagen única o un conjunto de imágenes relacionadas. El modo de imagen única acepta solo un prompt, una imagen de referencia, o de 2 a 14 imágenes de referencia; el modo de conjunto (sequential_image_generation=auto) devuelve hasta 15 imágenes a partir de texto, hasta 14 a partir de una sola imagen de referencia, o un conjunto a partir de 2 a 14 referencias siempre que la suma de entradas y salidas no supere 15. Admite salidas en 2K y 4K y devuelve JPEG por defecto, como URL o base64. La edición interactiva por coordenadas solo está disponible en Seedream 5.0 Pro (doubao-seedream-5-0-pro-260628).
doubao-seedream-5-0-260128ByteDance$0.03259por solicitudByteDance Doubao Seedream 5.0-lite — texto a imagen e imagen a imagen, con una creación controlable más inteligente, recuperación en tiempo real y mayor coherencia del sujeto (resolución de 2K o superior).
doubao-seedream-5-0-pro-260628ByteDance$0.045por solicitudByteDance Doubao Seedream 5.0 Pro — el modelo de imagen de gama más alta del proveedor para la creación controlable: texto a imagen, imagen a imagen con una sola referencia o con varias (de 2 a 10 imágenes de referencia), edición interactiva mediante coordenadas, recuadros o flechas, y descomposición en capas, que divide una imagen en una base más hasta 16 capas, cada una devuelta con su propio tamaño, z_index y cuadro delimitador (establezca layer_decomposition=true). Solo una imagen de salida: sin generación en conjunto (secuencial), búsqueda web ni streaming. Se factura por imagen de salida según el escenario y el nivel de píxeles: una imagen única de hasta 2.61 MP tiene el precio base; por encima de 2.61 MP cuesta 2x; en la descomposición en capas, cada capa devuelta se factura por separado a 0.5x (o 1x por encima de 2.61 MP); cada imagen de referencia adicional a la primera suma 1/15 del precio base.
fun-asr-flash-2026-06-15Alibaba$0.1260por hora de audioAlibaba Fun-ASR Flash (2026-06-15) — reconocimiento de voz grabada de baja latencia, con contexto de prompt y detección automática del idioma entre dialectos chinos y más de 30 idiomas. Acepta audio mediante URL, en Base64 o como archivo subido en AAC/AMR/AVI/FLAC/FLV/M4A/MKV/MOV/MP3/MP4/MPEG/OGG/OPUS/WAV/WEBM/WMA/WMV, de hasta 5 minutos y 2 GB.
gemini-2.5-flash-imageGoogle$0.3000$2.5000$0.2100$1.7500por 1M tokensGoogle Gemini 2.5 Flash Image (Nano Banana) — modelo nativo y rápido de generación y edición de imágenes para flujos de trabajo creativos. Toma texto e imagen como entrada y devuelve imágenes a través del endpoint chat completions compatible con OpenAI, con un límite de entrada de 65,536 tokens y un límite de salida de 32,768 tokens.
gemini-2.5-proGoogle$1.2500$10.0000$0.8125$6.5000por 1M tokensGoogle Gemini 2.5 Pro — el modelo del nivel de razonamiento de la familia 2.5, con una ventana de contexto de 1M tokens. Los prompts de más de 200,000 tokens se cobran a la tarifa de contexto largo del proveedor para toda la solicitud, siguiendo la propia regla de Google.
gemini-3-pro-imageGoogle$2.0000$12.0000$1.4000$8.4000por 1M tokensGoogle Gemini 3 Pro Image (Nano Banana Pro) — modelo premium impulsado por razonamiento para la generación profesional de imágenes y la edición conversacional. Destaca en diseño gráfico complejo, maquetas de producto de alta fidelidad, representación precisa de texto multilingüe, coherencia de marca y visualizaciones factuales fundamentadas con Google Search. Acepta texto e imágenes, devuelve texto e imágenes, admite thinking y genera salidas en 1K, 2K o 4K.
gemini-3.1-flash-imageGoogle$0.5000$3.0000$0.3500$2.1000por 1M tokensGoogle Gemini 3.1 Flash Image (Nano Banana 2) — modelo estable de baja latencia para generación de imágenes de alta calidad y edición conversacional. Acepta texto, imágenes y PDF, admite thinking y fundamentación mediante búsqueda, y puede generar imágenes de 0.5K, 1K, 2K o 4K para flujos de producción de gran volumen.
gemini-3.1-flash-lite-imageGoogle$0.2500$1.5000$0.1750$1.0500por 1M tokensGoogle Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — modelo de latencia ultrabaja y buena relación costo-beneficio para generación de imágenes de gran volumen y ediciones rápidas en varios turnos. Acepta texto e imágenes, produce imágenes de 1K, admite thinking y edición conversacional, y está diseñado para aplicaciones interactivas de desarrolladores y de consumo.
gemini-3.5-flashGoogle$1.5000$9.0000$1.0500$6.3000por 1M tokensGoogle Gemini 3.5 Flash — modelo multimodal estable optimizado para un rendimiento sostenido como agente, ciclos rápidos de programación, despliegue de subagentes y flujos de trabajo de varios pasos y larga duración. Acepta texto, imágenes, vídeo, audio y PDF, admite thinking y herramientas integradas, y ofrece un contexto de entrada de 1,048,576 tokens con hasta 65,536 tokens de salida.
gemini-3.6-flashGoogle$0.7500$3.7500$0.5250$2.6250por 1M tokensGoogle Gemini 3.6 Flash — modelo de razonamiento multimodal en versión estable que equilibra velocidad e inteligencia para tareas agénticas y del mundo real, con un contexto de entrada de 1,048,576 tokens y un límite de salida de 65,536 tokens. Acepta texto, imágenes, vídeo, audio y PDF, y admite thinking, llamada a funciones, ejecución de código, fundamentación mediante búsqueda, salida estructurada y Computer Use (versión preliminar). Nota sobre precios: el precio de lista de Google para este modelo es promocional hasta el 31 de diciembre de 2026, a $0.75 de entrada / $3.75 de salida / $0.075 de entrada en caché por 1M tokens. A partir del 1 de enero de 2027, el precio de lista del proveedor vuelve a $1.50 / $7.50 / $0.15, y nuestro precio lo sigue con la misma paridad.
gemini-3.7-flashGoogle$0.7500$3.7500$0.5250$2.6250por 1M tokensGoogle Gemini 3.7 Flash — el modelo de razonamiento multimodal más reciente del nivel Flash, con el mismo precio que 3.6 Flash mientras dure la promoción del proveedor. Acepta texto, imágenes, vídeo, audio y PDF; admite thinking, llamada a funciones, ejecución de código, fundamentación mediante búsqueda y salida estructurada. Nota sobre precios: el precio de lista de Google para este modelo es promocional hasta el 31 de diciembre de 2026, a $0.75 de entrada / $3.75 de salida / $0.075 de entrada en caché por 1M tokens. A partir del 1 de enero de 2027, el precio de lista del proveedor vuelve a $1.50 / $7.50 / $0.15, y nuestro precio lo sigue con la misma paridad.
gemini-3.8-flashGoogle$0.7500$3.7500$0.4875$2.4375por 1M tokensGoogle Gemini 3.8 Flash — el modelo Gemini multimodal y rápido de Google, que aquí puede invocarse tanto a través del endpoint compatible con OpenAI como del endpoint nativo de Gemini. Precio estándar por token: $0.75 de entrada, $0.075 de entrada en caché y $3.75 de salida por 1M tokens.
glm-5Zhipu AI$1.0000$3.2000$0.9500$3.0400por 1M tokensZhipu GLM-5 — MoE de 744B parámetros con 40B activos, entrenado con 28.5T tokens y con DeepSeek Sparse Attention, con una ventana de contexto de 200K y hasta 128K tokens de salida. Texto de entrada, texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
glm-5-turboZhipu AI$1.2000$4.0000$1.1400$3.8000por 1M tokensZhipu GLM-5-Turbo — la variante de GLM-5 orientada al rendimiento, optimizada para flujos de trabajo de agentes: invocación de herramientas y habilidades más estable a lo largo de tareas de varios pasos, mejor manejo de instrucciones largas y encadenadas, y ejecución de tareas programadas o de larga duración. Ventana de contexto de 200K, hasta 128K tokens de salida, texto de entrada y texto de salida. Admite modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
glm-5.1Zhipu AI$1.4000$4.4000$1.1200$3.5200por 1M tokensZhipu GLM-5.1 — modelo fundacional buque insignia construido para el trabajo autónomo prolongado: el proveedor documenta una ejecución continua y sin supervisión sobre una misma tarea durante hasta 8 horas, abarcando planificación, ejecución, pruebas y optimización iterativa. Ventana de contexto de 200K, hasta 128K tokens de salida, texto de entrada y texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
glm-5.2Zhipu AI$1.4000$4.4000$1.1200$3.5200por 1M tokensZhipu GLM-5.2 — modelo fundacional buque insignia especializado en el trabajo de agente de programación de larga duración, logrado con meses de entrenamiento dedicado y no solo con una ampliación del contexto, con una ventana de contexto de 1M tokens y hasta 128K tokens de salida. Texto de entrada, texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
glm-5.3Zhipu AI$1.4000$4.4000$0.9100$2.8600por 1M tokensZhipu GLM-5.3 — modelo buque insignia de programación y agentes, posentrenado sobre la misma base que GLM-5.2: una mejora del 50% en el banco de pruebas interno de programación de Zhipu, SOTA entre los modelos de código abierto en Terminal-Bench 3.0 y Agents' Last Exam, y resultados de vanguardia en el descubrimiento de vulnerabilidades en CyberGym, con una ventana de contexto de 1M tokens y hasta 128K tokens de salida. Texto de entrada, texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
glm-5.3-flashZhipu AI$0.1500$0.5000$0.1350$0.4500por 1M tokensZhipu GLM-5.3-Flash — el primer modelo nativamente multimodal de la línea GLM-5 y su nivel de vanguardia de bajo costo: 320B de parámetros totales con 18B activos, sobre una arquitectura híbrida de atención lineal + dispersa que reduce varias veces el cómputo de atención y la caché KV frente a GLM-5.3, a la vez que reduce a la mitad tanto los parámetros activos como el número de capas frente a GLM-4.5. Acepta texto, imágenes y vídeo; devuelve texto. (El proveedor también anuncia entrada de archivos, que no se ha verificado aquí y por tanto no se ofrece.) Ventana de contexto de 1M tokens y hasta 128K tokens de salida. Admite modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP. Orientado a la programación visual: trabajo de front-end, juegos y 3D en el que el modelo inspecciona su propia salida renderizada e itera.
glm-5v-turboZhipu AI$1.2000$4.0000$1.1400$3.8000por 1M tokensZhipu GLM-5V-Turbo — modelo de razonamiento multimodal para imágenes, vídeo, archivos, programación y flujos de trabajo de agentes basados en herramientas.
glm-imageZhipu AI$0.015$0.01425por solicitudZhipu GLM-Image — generación de imágenes basada en una arquitectura híbrida de comprensión autorregresiva más decodificación por difusión, el primer modelo multimodal SOTA entrenado de extremo a extremo en chips de fabricación china (Huawei Ascend). Interpreta instrucciones en lugar de palabras clave y completa los detalles que el prompt deja implícitos, con un desempeño notablemente superior en la representación de texto (en especial de caracteres chinos) y en escenas con uso intensivo de conocimiento. Una imagen por solicitud.
glm-ttsZhipu AI$0.3500$0.3150por 10 mil caracteresZhipu GLM-TTS — síntesis de voz construida sobre una arquitectura de generación en dos etapas con aprendizaje por refuerzo GRPO, que infiere la emoción y la entonación del texto circundante en lugar de exigir un marcado explícito. Incluye siete voces integradas (tongtong por defecto, xiaochen, chuichui, jam, kazi, douji, luodo) con velocidad y volumen ajustables, acepta hasta 1,024 caracteres por solicitud y transmite con una latencia de primer fotograma inferior a 400 ms. Devuelve wav o pcm a una frecuencia de muestreo recomendada de 24 kHz; el streaming es solo en pcm.
gpt-5.5OpenAI$5.0000$30.0000$4.0000$24.0000por 1M tokensOpenAI GPT-5.5 — modelo de razonamiento de vanguardia para programación compleja y trabajo profesional. Admite entrada de texto e imagen, llamada a funciones y herramientas integradas, una ventana de contexto de 1,050,000 tokens, hasta 128,000 tokens de salida y un nivel de razonamiento de none hasta xhigh.
gpt-5.6-lunaOpenAI$0.2000$1.2000$0.1700$1.0200por 1M tokensOpenAI GPT-5.6 Luna — el nivel más rápido y económico de GPT-5.6, optimizado para cargas de trabajo de gran volumen y sensibles al costo sin renunciar al razonamiento, la visión y el uso de herramientas. Admite entrada de texto e imagen, una ventana de contexto de 1,050,000 tokens y hasta 128,000 tokens de salida.
gpt-5.6-solOpenAI$5.0000$30.0000$4.0000$24.0000por 1M tokensOpenAI GPT-5.6 Sol — modelo buque insignia de la línea GPT-5.6 para razonamiento de vanguardia, trabajo profesional complejo, programación, ciencia, ciberseguridad y flujos de trabajo agénticos de larga duración. Admite entrada de texto e imagen, herramientas integradas, una ventana de contexto de 1,050,000 tokens, hasta 128,000 tokens de salida y los ajustes de razonamiento más profundos de la familia.
gpt-5.6-terraOpenAI$2.0000$12.0000$1.6000$9.6000por 1M tokensOpenAI GPT-5.6 Terra — modelo GPT-5.6 equilibrado para el trabajo profesional cotidiano, que ofrece alta inteligencia y buen rendimiento como agente de programación a un costo menor que Sol. Admite entrada de texto e imagen, herramientas integradas, una ventana de contexto de 1,050,000 tokens y hasta 128,000 tokens de salida.
gpt-6-astraOpenAI$10.0000$50.0000$7.0000$35.0000por 1M tokensOpenAI GPT-6 Astra — el modelo más capaz de OpenAI, construido para el trabajo de extremo a extremo más exigente: razonamiento complejo, programación, uso de la computadora, investigación y creación de documentos. Admite entrada de texto e imagen, una ventana de contexto de 1,050,000 tokens, hasta 128,000 tokens de salida y ajustes de nivel de razonamiento de hasta xhigh y max.
gpt-6-lunaOpenAI$0.1000$0.5000$0.0650$0.3250por 1M tokensOpenAI GPT-6 Luna — el modelo más eficiente de OpenAI, construido para tareas acotadas y de gran volumen. Admite entrada de texto e imagen, una ventana de contexto de 1,050,000 tokens, hasta 128,000 tokens de salida y un nivel de razonamiento de none a max, con medium como valor predeterminado. Use /v1/responses para las llamadas a herramientas: en /v1/chat/completions, las llamadas a funciones solo funcionan con reasoning_effort en none. En /v1/responses, envíe la conversación completa en el array input en cada turno; las solicitudes que incluyan previous_response_id o conversation se rechazan.
gpt-6-solOpenAI$2.0000$10.0000$1.3000$6.5000por 1M tokensOpenAI GPT-6 Sol — construido para programación compleja y flujos de trabajo agénticos. Admite entrada de texto e imagen, una ventana de contexto de 1,050,000 tokens, hasta 128,000 tokens de salida y un nivel de razonamiento de none a max, con medium como valor predeterminado. Use /v1/responses para las llamadas a herramientas: en /v1/chat/completions, las llamadas a funciones solo funcionan con reasoning_effort en none. En /v1/responses, envíe la conversación completa en el array input en cada turno; las solicitudes que incluyan previous_response_id o conversation se rechazan.
gpt-6.1-solOpenAI$2.0000$10.0000$1.3000$6.5000por 1M tokensOpenAI GPT-6.1 Sol — cercano a GPT-6 Astra en programación compleja, uso de la computadora y trabajo profesional, a un costo menor. Admite entrada de texto e imagen, una ventana de contexto de 1,050,000 tokens y hasta 128,000 tokens de salida. El nivel de razonamiento va de low a max, con medium como valor predeterminado; none y minimal no se admiten, y los tokens de razonamiento se facturan como salida. Cuando la entrada supera los 272,000 tokens, todos los tokens de esa solicitud se cobran a la tarifa de contexto largo. Use /v1/responses para las llamadas a herramientas; /v1/chat/completions no admite llamadas a herramientas. En /v1/responses, envíe la conversación completa en el array input en cada turno; las solicitudes que incluyan previous_response_id o conversation se rechazan.
gpt-image-2OpenAI$5.0000$30.0000$4.0000$24.0000por 1M tokensOpenAI GPT Image 2 — modelo de generación y edición de imágenes de última generación para una salida rápida y de alta calidad. Toma texto e imagen como entrada, admite tamaños de imagen flexibles y entradas de imagen de alta fidelidad, y se factura por token en lugar de por llamada: $5 de entrada de texto, $1.25 de entrada de texto en caché, $8 de entrada de imagen y $30 de salida de imagen por 1M tokens.
gpt-image-2.5-flareOpenAI$5.0000$30.0000$4.0000$24.0000por 1M tokensOpenAI GPT Image 2.5 Flare — un modelo de generación y edición de imágenes de la línea GPT Image 2.5 de OpenAI. Flare y gpt-image-2.5-sunburst son versiones distintas, no alias de un mismo modelo, y se venden al mismo precio; las clasificaciones públicas los puntúan por separado. Precio estándar por token: $5 de entrada de texto, $1.25 de entrada en caché, $8 de entrada de imagen y $30 de salida de imagen por 1M tokens.
gpt-image-2.5-sunburstOpenAI$5.0000$30.0000$4.0000$24.0000por 1M tokensOpenAI GPT Image 2.5 Sunburst — un modelo de generación y edición de imágenes de la línea GPT Image 2.5 de OpenAI. Sunburst y gpt-image-2.5-flare son versiones distintas, no alias de un mismo modelo, y se venden al mismo precio; las clasificaciones públicas los puntúan por separado. Precio estándar por token: $5 de entrada de texto, $1.25 de entrada en caché, $8 de entrada de imagen y $30 de salida de imagen por 1M tokens.
grok-4.7xAI$2.0000$6.0000$0.8000$2.4000por 1M tokensxAI Grok 4.7 — un modelo de frontera construido para programación, tareas agénticas y trabajo intelectual. Admite entrada de texto e imagen y tiene una ventana de contexto de 500,000 tokens. El razonamiento no se puede desactivar: reasoning_effort permite elegir low, medium, high o xhigh, con high como valor predeterminado, y los tokens de razonamiento se facturan como salida. Cuando un prompt alcanza los 200,000 tokens, todos los tokens de esa solicitud se cobran a la tarifa de contexto largo. Solo se aceptan herramientas function; las herramientas del lado del servidor de xAI, como la búsqueda web, la búsqueda en X y la ejecución de código, no están disponibles, y las solicitudes que las incluyan se rechazan. En /v1/responses, envíe la conversación completa en el array input en cada turno y devuelva sin cambios los elementos de razonamiento cifrados de las respuestas anteriores; las solicitudes que incluyan previous_response_id o conversation se rechazan.
happyhorse-1.1-i2vAlibaba$0.140por segundoAlibaba HappyHorse 1.1 (I2V) — imagen a vídeo con mejor textura, coherencia de identidad entre clips, fluidez de movimiento y sincronía entre audio e imagen. 720P/1080P.
happyhorse-1.1-r2vAlibaba$0.140por segundoAlibaba HappyHorse 1.1 (R2V) — generación de vídeo a partir de referencias, con hasta 9 imágenes de referencia, fuerte coherencia de sujeto, escena y estilo, y control de cámara. 720P/1080P.
happyhorse-1.1-t2vAlibaba$0.140por segundoAlibaba HappyHorse 1.1 (T2V) — texto a vídeo con mejor comprensión semántica, control de cámara y generación dinámica. Vídeo 720P/1080P fluido, detallado y físicamente coherente.
hy-mt2-liteTencent$0.0440$0.1770por 1M tokensTencent HY-MT2 Lite — nivel de traducción multilingüe orientado a la latencia y al costo, a través del protocolo OpenAI Chat Completions. Hasta 4K tokens de entrada y 4K tokens de salida; solo texto.
hy-mt2-plusTencent$0.0740$0.2950por 1M tokensTencent HY-MT2 Plus — nivel de traducción multilingüe con seguimiento de instrucciones, a través del protocolo OpenAI Chat Completions. Hasta 4K tokens de entrada y 4K tokens de salida; solo texto.
hy-mt2-proTencent$0.0740$0.2950por 1M tokensTencent HY-MT2 Pro — nivel insignia de traducción automática para una traducción multilingüe de alta calidad a través del protocolo OpenAI Chat Completions. Hasta 4K tokens de entrada y 4K tokens de salida; solo texto.
hy3Tencent$0.1320$0.5280por 1M tokensTencent Hunyuan 3 (Hy3) — modelo MoE de 295B de parámetros (21B activos), contexto nativo de 256K y tres modos de razonamiento (fast / low / deep). Sólido en agentes de programación, comprensión de documentos largos, contexto en varios turnos y flujos de trabajo de agentes de varios pasos. Solo texto.
hy4-previewTencent$0.8340$2.5010por 1M tokensTencent Hunyuan 4 preview (Hy4 preview) — ventana de contexto de 1M tokens (960K de entrada máxima, 64K de salida máxima) con razonamiento profundo (que Tencent denomina preserved thinking), salida estructurada, llamada a funciones y caché de prompts. Solo texto. SKU en versión preliminar: Tencent retira un modelo en versión preliminar cuando se publica su versión de disponibilidad general.
jev-1.13TypeSafe$0.0462por 1M tokensTypeSafe Jev 1.13 — un modelo de decisión System One, no un modelo de chat. Envía el estado de tu aplicación (state: una cadena, un objeto JSON o un array) con un conjunto de preguntas tipadas en POST /v1/systemone — choice (elegir una de tus opciones), score (situarlo en tus niveles ordenados) o noul (la probabilidad de que un enunciado de sí/no se cumpla) — y recibe respuestas tipadas con una probabilidad para cada opción y un valor de confianza, normalmente en 70–500 ms. Todas las preguntas se evalúan en paralelo sobre el mismo estado, así que varias pueden compartir una solicitud. Los SDK oficiales de TypeSafe para Python y JavaScript funcionan sin cambios con la URL base configurada en https://api.chinaapi.ai. Se factura por token de entrada; la salida es gratuita. Solo entrada de texto, hasta 32K tokens por solicitud; el inglés es el idioma principal, así que prueba otros idiomas antes de depender de ellos.
jev-latestTypeSafe$0.0462por 1M tokensTypeSafe Jev (latest) — el alias que llaman los SDK de TypeSafe cuando no se indica un modelo. Actualmente sirve jev-1.13, al mismo precio y con el mismo contrato System One en POST /v1/systemone: estado y preguntas tipadas choice, score y noul de entrada; respuestas tipadas con probabilidades y un valor de confianza de salida. El campo model de la respuesta indica la versión que respondió. Solo movemos el alias a una nueva versión de Jev después de comprobar su precio, así que fija jev-1.13 si has ajustado umbrales con ella.
kimi-k2.6Moonshot$0.9500$4.0000$0.7600$3.2000por 1M tokensMoonshot Kimi K2.6 — modelo de propósito general para diálogo, generación de código, comprensión visual y tareas de agentes, con una escritura de código de larga duración y una ejecución autónoma más sólidas que en la generación anterior. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes (png, jpeg, webp, gif) y vídeo (mp4, mov, webm y otros) como contenido base64 y devuelve texto. El modo de razonamiento viene activado por defecto y puede desactivarse; la temperatura está fijada en 1.0 con razonamiento y en 0.6 sin él.
kimi-k2.7-codeMoonshot$0.9500$4.0000$0.7600$3.2000por 1M tokensMoonshot Kimi K2.7 Code — el modelo dedicado a programación de Kimi, que según las mediciones del proveedor mejora el cumplimiento de instrucciones y la programación de larga duración frente a K2.6, al tiempo que recorta el exceso de razonamiento en torno a un 30% de media. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes y vídeo como contenido base64 y devuelve texto. El razonamiento es obligatorio y devuelve un error si se desactiva; tool_choice se limita a auto o none, y reasoning_content debe arrastrarse a lo largo de las llamadas a herramientas de varios pasos.
kimi-k2.7-code-highspeedMoonshot$1.9000$8.0000por 1M tokensMoonshot Kimi K2.7 Code Highspeed — el nivel de rendimiento de K2.7 Code, que sirve el mismo modelo a unos 180 tokens por segundo y hasta 260 en trabajos de contexto corto. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes y vídeo como contenido base64 y devuelve texto. El razonamiento es obligatorio y devuelve un error si se desactiva; tool_choice se limita a auto o none, y reasoning_content debe arrastrarse a lo largo de las llamadas a herramientas de varios pasos.
kimi-k3Moonshot$3.0000$15.0000$1.9500$9.7500por 1M tokensMoonshot Kimi K3 — buque insignia de 2.8 billones de parámetros para programación de larga duración, trabajo del conocimiento de extremo a extremo y razonamiento profundo, con una ventana de contexto de 1M tokens y hasta 1,048,576 tokens de finalización (131,072 por defecto). Acepta texto, imágenes codificadas en base64 y vídeo codificado en base64, y devuelve texto. El razonamiento está siempre activo, con el esfuerzo de razonamiento en max por defecto; la temperatura está fijada en 1.0. Admite llamada a herramientas personalizadas y carga dinámica de herramientas.
kling-3.0-turboKuaishou$0.560por solicitudKuaishou Kling 3.0 Turbo — el nivel económico de la línea Kling 3.0, que genera 720P o 1080P (720P por defecto) de 3 a 15 segundos (5 por defecto) en 16:9, 9:16 o 1:1, a partir de un prompt o de una imagen de primer fotograma. El audio nativo se incluye siempre y no tiene interruptor. Frente a kling-v3, renuncia al nivel 4K, al control del fotograma final y a la entrada de vídeo a cambio de velocidad y costo. 720p 5 s con audio ≈ $0.56.
kling-v3Kuaishou$0.420por solicitudKuaishou Kling 3.0 — texto a vídeo e imagen a vídeo con audio nativo y mejor coherencia de los elementos. Los clips duran de 3 a 15 segundos (5 por defecto) en 16:9, 9:16 o 1:1, y el nivel se elige mediante mode: std para 720P, pro para 1080P y 4k para 4K nativo. El audio hay que activarlo con sound=on y viene desactivado por defecto; imagen a vídeo toma un primer fotograma con un fotograma final opcional. Desde $0.083/s (720p).
kling-v3-omniKuaishou$0.420por solicitudKling 3.0 Omni — generación de vídeo a partir de varias imágenes de referencia. El precio publicado corresponde al nivel std (720p, 5 s, sin audio, sin vídeo de referencia). Las solicitudes que no fijan mode usan el nivel pro, predeterminado en el proveedor, y se facturan 1.33x, unos $0.56 por el mismo clip de 5 s; el 4k se factura 5x. Envíe mode=std para que se le cobre el precio publicado.
LongCat-2.0Meituan$0.3000$1.2000por 1M tokensMeituan LongCat-2.0 — modelo MoE abierto de 1.6T de parámetros con contexto nativo de 1M, creado para programación agéntica y uso de herramientas de larga duración. Modelo de razonamiento solo de texto.
M2-herMiniMax$0.3000$1.2000por 1M tokensMiniMax M2-her — modelo conversacional creado para el juego de rol y el chat de varios turnos, con una ventana de contexto de 65,536 tokens y respuestas limitadas a 2,048 tokens (max_completion_tokens). Además de system / user / assistant, acepta en el endpoint de chat compatible con OpenAI los roles de mensaje extendidos del proveedor: user_system (la persona del usuario), group (el nombre de la conversación) y sample_message_user / sample_message_ai (intercambios de ejemplo que orientan el estilo de la respuesta). Todo mensaje con un rol extendido debe llevar un campo name; sin él, el proveedor rechaza la solicitud completa con el error 2013, mientras que los mensajes system/user/assistant normales no necesitan name. Solo texto: sin entrada de imágenes, y el proveedor no documenta llamada a herramientas ni caché. Cada llamada incluye, además del prompt visible, unos 170 tokens de sobrecarga de persona del lado del proveedor, que se facturan como entrada.
mimo-v2.5Xiaomi$0.1400$0.2800por 1M tokensXiaomi MiMo-V2.5 — modelo nativamente multimodal completo, con contexto de 1M y salida máxima de 128K, que entiende imágenes, vídeo, audio y texto en un solo modelo. Admite razonamiento profundo, llamada a funciones, salida estructurada y búsqueda web, con capacidad de agente en todas las modalidades.
mimo-v2.5-asrXiaomi$0.0740por hora de audioXiaomi MiMo v2.5 ASR — modelo de reconocimiento de voz optimizado para chino e inglés y para dialectos chinos, capaz de manejar audio con ruido, captado a distancia y con varios hablantes, así como la transcripción de letras de canciones.
mimo-v2.5-proXiaomi$0.4350$0.8700por 1M tokensXiaomi MiMo-V2.5-Pro — buque insignia de un billón de parámetros (42B activos) con contexto de 1M y salida máxima de 128K, ajustado para cargas de trabajo de agentes de alta intensidad. Admite razonamiento profundo, llamada a funciones, salida estructurada y búsqueda web. Solo generación de texto: a diferencia de mimo-v2.5, la lista de capacidades del proveedor no incluye la comprensión de todas las modalidades.
mimo-v2.5-ttsXiaomi$0.0000por 10 mil caracteresXiaomi MiMo v2.5 TTS — síntesis de voz expresiva con ocho voces integradas, cuatro en chino y cuatro en inglés (Mia, Chloe, Milo, Dean), que cubre chino e inglés además de los estilos dialectales del Noreste, de Sichuan, de Henan y del cantonés. La interpretación se dirige de dos formas: instrucciones de estilo en lenguaje natural y etiquetas de audio en línea para emociones básicas y compuestas, respiración, suspiros y ritmo, incluido un modo de canto exclusivo de este modelo dentro de la línea MiMo TTS. Devuelve wav mono o pcm16 a 24 kHz y admite streaming de baja latencia, que exige pcm16. Contexto de 8K y salida máxima de 8K.
mimo-v2.5-tts-voicecloneXiaomi$0.0000por 10 mil caracteresXiaomi MiMo v2.5 TTS VoiceClone — modelo de clonación de voz: envíe una muestra de audio de referencia como data URL en el campo voice (data:{mime};base64,...) y el modelo sintetiza el habla con esa voz, sin ninguna etapa de entrenamiento, anotación ni ajuste fino. Acepta MP3 (audio/mpeg) o WAV, con la cadena codificada en base64 limitada a 10 MB; Xiaomi no publica una duración mínima para el audio de referencia. Las instrucciones de estilo en lenguaje natural y las etiquetas de audio en línea se heredan de mimo-v2.5-tts, pero no hay streaming: la solicitud se ejecuta en modo de compatibilidad y solo devuelve el resultado una vez terminada la síntesis.
mimo-v2.5-tts-voicedesignXiaomi$0.0000por 10 mil caracteresXiaomi MiMo v2.5 TTS VoiceDesign — modelo de diseño de voz: describa en lenguaje natural la voz deseada en el campo instructions y el modelo sintetiza el habla con esa voz diseñada.
mimo-v2.6-flashXiaomi$0.1400$0.2800$0.1260$0.2520por 1M tokensXiaomi MiMo-V2.6-Flash — modelo de razonamiento eficiente y de bajo coste con pesos abiertos, nativamente multimodal completo: un solo modelo entiende imágenes, vídeo, audio y texto. Contexto de 1M y salida máxima de 128K, con razonamiento profundo, llamada a funciones y salida estructurada. Orientado a cargas de trabajo profesionales cotidianas y de gran volumen en las que importan el coste y el rendimiento.
mimo-v2.6-proXiaomi$0.4350$0.8700$0.3915$0.7830por 1M tokensXiaomi MiMo-V2.6-Pro — modelo de razonamiento insignia de Xiaomi, con un billón de parámetros y pesos abiertos, nativamente multimodal completo: un solo modelo entiende imágenes, vídeo, audio y texto. Contexto de 1M y salida máxima de 128K, con razonamiento profundo, llamada a funciones y salida estructurada. Pensado para proyectos complejos, tareas de agentes de largo recorrido, ciberseguridad e investigación.
mimo-v2.6-pro-ultraspeedXiaomi$4.3500$8.7000por 1M tokensXiaomi MiMo-V2.6-Pro UltraSpeed — MiMo-V2.6-Pro servido en el modo ultrarrápido de Xiaomi, con una salida hasta 20 veces más rápida que la del modelo estándar, para interacción en tiempo real y producción sensible a la latencia. Mismas capacidades que mimo-v2.6-pro: comprensión multimodal completa de imágenes, vídeo, audio y texto, contexto de 1M, salida máxima de 128K, razonamiento profundo, llamada a funciones y salida estructurada. Su precio es diez veces el de mimo-v2.6-pro; Xiaomi asigna la capacidad de este modo por separado, por lo que los picos intensos pueden sufrir limitación de velocidad.
MiniMax-H3MiniMax$0.080por segundoMiniMax H3 (Hailuo 3.0) — modelo de vídeo multimodal de propósito general, abierto y de nueva generación, que produce audio estéreo nativo en una sola pasada, en 768P o 2K, con una duración de 4 a 15 segundos (solo números enteros), a 24 fps. Cubre texto a vídeo, imagen a vídeo a partir de un primer fotograma y/o un último fotograma, y generación por referencia a partir de imágenes, vídeos o audio para el personaje, el movimiento, la cámara, el estilo, la voz o el ritmo de montaje; imagen a vídeo y generación por referencia no pueden combinarse en una misma solicitud. Acepta vídeo H.264/H.265, imágenes JPG, JPEG, PNG, WEBP, HEIC y HEIF, y audio WAV o MP3, con prompts de hasta 7,000 caracteres. $0.08/s en 768P y $0.13/s en 2K.
MiniMax-Hailuo-02MiniMax$0.280por solicitudMiniMax Hailuo 02 — generación de vídeo económica que cubre tanto texto a vídeo como imagen a vídeo a 24 fps, con 512p y 768p disponibles en clips de 6 o 10 segundos y 1080p en 6 segundos. El nivel 512p es la puerta de entrada de la línea Hailuo.
MiniMax-Hailuo-2.3MiniMax$0.280por solicitudMiniMax Hailuo 2.3 — texto a vídeo e imagen a vídeo que el proveedor posiciona por su seguimiento de instrucciones, a 24 fps, con 768p disponible en clips de 6 o 10 segundos y 1080p en 6 segundos. 768p 6 s = $0.28.
MiniMax-Hailuo-2.3-FastMiniMax$0.190por solicitudMiniMax Hailuo 2.3 Fast — el nivel de velocidad y costo de Hailuo 2.3, centrado en imagen a vídeo y en el realismo del movimiento físico, a 24 fps, con 768p disponible en clips de 6 o 10 segundos y 1080p en 6 segundos. 768p 6 s = $0.19.
MiniMax-M2MiniMax$0.3000$1.2000por 1M tokensMiniMax M2 — la primera generación que MiniMax lanzó para programación eficiente y flujos de trabajo de agentes, con una ventana de contexto de 204,800 tokens. Es el nivel más antiguo que el proveedor aún sirve y el único de los niveles heredados sin variante highspeed. Solo texto: la API acepta bloques de contenido de texto y de llamada a herramienta, pero no imágenes ni vídeo. Modelo designado como heredado por el proveedor, que MiniMax afirma seguir sirviendo con normalidad; se mantiene en el catálogo por compatibilidad de versiones, ya que los clientes fijan un nombre de modelo a una generación. Los pesos abiertos están publicados en Hugging Face.
MiniMax-M2.1MiniMax$0.3000$1.2000por 1M tokensMiniMax M2.1 — modelo de texto creado para programación multilenguaje, con una ventana de contexto de 204,800 tokens y una salida de unos 60 tokens por segundo. Solo texto: la API acepta bloques de contenido de texto y de llamada a herramienta, pero no imágenes ni vídeo. Modelo designado como heredado por el proveedor, que MiniMax afirma seguir sirviendo con normalidad; se mantiene en el catálogo por compatibilidad de versiones, ya que los clientes fijan un nombre de modelo a una generación. Los pesos abiertos están publicados en Hugging Face.
MiniMax-M2.5MiniMax$0.3000$1.2000$0.1950$0.7800por 1M tokensMiniMax M2.5 — modelo de texto que el proveedor posiciona por su rendimiento de primer nivel a bajo precio en tareas complejas, con una ventana de contexto de 204,800 tokens y una salida de unos 60 tokens por segundo. Solo texto: la API acepta bloques de contenido de texto y de llamada a herramienta, pero no imágenes ni vídeo. Modelo designado como heredado por el proveedor, que MiniMax afirma seguir sirviendo con normalidad; se mantiene en el catálogo por compatibilidad de versiones, ya que los clientes fijan un nombre de modelo a una generación. Los pesos abiertos están publicados en Hugging Face.
MiniMax-M2.7MiniMax$0.3000$1.2000$0.1950$0.7800por 1M tokensMiniMax M2.7 — modelo de texto para chat, programación, trabajo de oficina y tareas agénticas, con una ventana de contexto de 204,800 tokens y una salida de unos 60 tokens por segundo. Solo texto: la API acepta bloques de contenido de texto y de llamada a herramienta, pero no imágenes ni vídeo. Admite llamada a herramientas; el razonamiento está siempre activo y no puede desactivarse.
MiniMax-M2.7-highspeedMiniMax$0.6000$2.4000por 1M tokensMiniMax M2.7 Highspeed — el mismo modelo M2.7 servido a unos 100 tokens por segundo para programación de baja latencia y flujos de trabajo de agentes, con una ventana de contexto de 204,800 tokens. Solo texto: la API acepta bloques de contenido de texto y de llamada a herramienta, pero no imágenes ni vídeo. Admite llamada a herramientas; el razonamiento está siempre activo y no puede desactivarse.
MiniMax-M3MiniMax$0.3000$1.2000$0.1950$0.7800por 1M tokensMiniMax M3 — modelo de programación multimodal de vanguardia para razonamiento agéntico, uso de herramientas y ejecución estructurada de tareas, con una ventana de contexto de 1,000,000 tokens. Acepta texto, imágenes de hasta 10 MB y vídeo de hasta 50 MB incrustado o 512 MB a través de la API de Files, y devuelve texto. Admite llamada a herramientas, con el razonamiento opcional en lugar de siempre activo.
minimax-music-v3.0MiniMax$0.1481por solicitudMiniMax Music 3.0 — generación síncrona de canciones completas a partir de un prompt musical y una letra opcional, con modo instrumental, optimización de la letra y salida de audio como URL o en hex. Los prompts admiten hasta 2,000 caracteres y la letra hasta 3,500 caracteres.
muse-spark-1.2-contributorMeta$0.1000$0.2000$0.0650$0.1300por 1M tokensMeta puede usar los prompts enviados a este modelo y las salidas que genera para entrenar futuros modelos de Meta según los términos de su nivel Contributor, así que no envíe datos sensibles ni confidenciales. Meta Muse Spark 1.2 (nivel Contributor) es la versión anterior de Muse Spark. Es un modelo de razonamiento: siempre razona antes de responder y el razonamiento no se puede desactivar. reasoning_effort admite minimal, low, medium, high o xhigh; none y max no están disponibles en este nivel, y si se omite reasoning_effort, el modelo elige el nivel. Los tokens de razonamiento se facturan como salida, y la entrada en caché se factura a la tarifa de entrada en caché. La búsqueda web no está disponible, y se rechazan las solicitudes que incluyan búsqueda web o cualquier tipo de herramienta distinto de function. Envíe las solicitudes a /v1/chat/completions.
muse-spark-1.3-contributorMeta$0.1000$0.2000$0.0650$0.1300por 1M tokensMeta puede usar los prompts enviados a este modelo y las salidas que genera para entrenar futuros modelos de Meta según los términos de su nivel Contributor, así que no envíe datos sensibles ni confidenciales. Meta Muse Spark 1.3 (nivel Contributor) es la versión más reciente de Muse Spark, ajustada para flujos de trabajo agénticos y programación. Es un modelo de razonamiento: siempre razona antes de responder y el razonamiento no se puede desactivar. reasoning_effort admite minimal, low, medium, high o xhigh; none y max no están disponibles en este nivel, y si se omite reasoning_effort, el modelo elige el nivel. Los tokens de razonamiento se facturan como salida, y la entrada en caché se factura a la tarifa de entrada en caché. La búsqueda web no está disponible, y se rechazan las solicitudes que incluyan búsqueda web o cualquier tipo de herramienta distinto de function. Envíe las solicitudes a /v1/chat/completions.
qwen-audio-3.0-asr-flashAlibaba$0.1260por hora de audioAlibaba Qwen-Audio-3.0-ASR-Flash — reconocimiento de voz en diferido sobre la base Qwen-Audio 3.0, que cubre 30 idiomas y los siete grandes grupos dialectales chinos (mandarín, wu, xiang, gan, hakka, min y yue), además de más de 20 acentos regionales. La predicción de puntuación y la normalización de texto convierten números, fechas e importes a su forma estándar; las palabras clave y el contexto de la indicación mejoran la precisión con el vocabulario especializado. Acepta hasta 5 minutos o 2 GB de audio por solicitud.
qwen-audio-3.0-realtime-flashAlibaba$0.2900$0.8800por 1M tokensAlibaba Qwen-Audio-3.0-Realtime-Flash — conversación de voz en dúplex completo sobre una sesión WebSocket, de la gama que el proveedor sitúa primera en la clasificación general de Speech-to-Speech de Artificial Analysis. Este nivel rápido está ajustado para la menor latencia de respuesta de extremo a extremo. Se conecta mediante GET /v1/realtime. La entrada y la salida de audio se facturan con tarifas propias, bastante superiores a la del texto.
qwen-audio-3.0-realtime-plusAlibaba$1.0000$8.0000por 1M tokensAlibaba Qwen-Audio-3.0-Realtime-Plus — conversación de voz en dúplex completo sobre una sesión WebSocket; el proveedor lo sitúa primero en la clasificación general de Speech-to-Speech de Artificial Analysis. El nivel estándar prioriza la calidad de la respuesta: mantiene intacto el razonamiento sobre voz mientras la inferencia paralela y el streaming de extremo a extremo mantienen baja la latencia. Se conecta mediante GET /v1/realtime. La entrada y la salida de audio se facturan con tarifas propias, bastante superiores a la del texto.
qwen-audio-3.0-tts-flashAlibaba$0.1800por 10 mil caracteresAlibaba Qwen-Audio-3.0-TTS-Flash — síntesis de voz sobre la base Qwen-Audio 3.0, ajustada para la interacción en tiempo real y que cubre más lenguas minoritarias y dialectos chinos que la generación anterior. El seguimiento de instrucciones en estilo libre y las etiquetas de grano fino dirigen la emoción, el tono, el personaje, la velocidad y el volumen; el modelo es más robusto ante ruido y reverberación. El nivel flash optimiza la síntesis de baja latencia, para asistentes de voz, diálogo en directo y atención al cliente. Se factura por carácter (1 token = 1 carácter). Accesible tanto en petición/respuesta como en sesión WebSocket en tiempo real.
qwen-audio-3.0-tts-plusAlibaba$0.2500por 10 mil caracteresAlibaba Qwen-Audio-3.0-TTS-Plus — síntesis de voz de alta calidad sobre la base Qwen-Audio 3.0, que cubre más lenguas minoritarias y dialectos chinos que la generación anterior, con una pronunciación dialectal notablemente más auténtica. El seguimiento de instrucciones en estilo libre y las etiquetas de grano fino dirigen la emoción, el tono, el personaje, la velocidad, el volumen y el estilo; el modelo es más robusto ante ruido y reverberación. El nivel plus prioriza la fidelidad y la expresividad, para producción de contenido, audiolibros, doblaje y voz de marca. Se factura por carácter (1 token = 1 carácter). Accesible tanto en petición/respuesta como en sesión WebSocket en tiempo real.
qwen-flash-characterAlibaba$0.0500$0.4000por 1M tokensAlibaba Qwen-Flash-Character — el modelo de juego de rol multilingüe de Qwen (versión dinámica; el proveedor anuncia las actualizaciones con antelación), ajustado para conversaciones con personajes fieles a su persona: seguimiento de instrucciones dentro de los límites de la persona, avance de los temas de conversación, escucha y empatía. Ventana de contexto de 8,192 tokens, texto de entrada y texto de salida. Sin modo de razonamiento, llamada a herramientas, herramientas integradas ni salida estructurada. La caché de sesión del proveedor se aplica automáticamente de su lado.
qwen-image-3.0Alibaba$0.030por solicitudAlibaba Qwen-Image-3.0 — el nivel estándar de la gama de imagen de Qwen, que abarca la generación de imágenes a partir de texto y la edición de imágenes, con una representación precisa de la tipografía pequeña (hasta 10 px), 12 idiomas y más de 20 tipos de letra. Acepta indicaciones de hasta 4,500 tokens, devuelve hasta 6 imágenes por solicitud y genera hasta 2048x2048.
qwen-image-3.0-proAlibaba$0.040por solicitudAlibaba Qwen-Image-3.0-Pro — el nivel profesional de la gama de imagen de Qwen, creado para producir de una sola vez maquetas densas y con mucha información (periódicos, guiones gráficos, cartas de menú, exámenes). Acepta indicaciones de hasta 4,500 tokens, representa tipografía de 10 px, 12 idiomas y más de 20 tipos de letra, devuelve hasta 6 imágenes por solicitud y genera hasta 2048x2048. Generación de imágenes a partir de texto y edición de imágenes.
qwen-mt-image-2.0Alibaba$0.0006por solicitudAlibaba Qwen-MT-Image 2.0 — traducción de imágenes: reescribe el texto dentro de una imagen en otro idioma conservando el diseño, las fuentes y la ilustración que lo rodea, entre 55 idiomas en cualquier dirección. Invóquelo en el endpoint images/edits de OpenAI con la URL http(s) pública de una imagen en el campo image, más target_lang (obligatorio; código ISO o nombre en inglés) y source_lang (opcional, auto por defecto); prompt es obligatorio por la forma del endpoint, pero se ignora. El objeto opcional ext transmite sin cambios los parámetros domainHint, sensitives, terminologies y config.imageSegment del proveedor. Devuelve la URL de un JPG del mismo tamaño, válida durante 24 horas. Entrada de 15 a 8192 px por lado, relación de aspecto de 1:10 a 10:1, hasta 100 MB; no se aceptan archivos subidos ni data URL. El proveedor limita este modelo a 1 solicitud por minuto y factura la imagen aunque no encuentre texto traducible (se devuelve la original). Se sirve a través de un único canal oficial de Alibaba.
qwen3-asr-flashAlibaba$0.1260por hora de audioAlibaba Qwen3-ASR-Flash — reconocimiento de voz construido sobre el modelo fundacional Qwen3, que determina por sí solo el idioma hablado y transcribe 11 idiomas; la línea Qwen3-ASR documenta el mandarín junto con el sichuanés, el min nan, el wu y el cantonés, además de varios acentos del inglés. Acepta aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma y wmv de hasta 5 minutos y 10 MB por solicitud; la entrada pcm debe estar en 16 kHz y los demás formatos se remuestrean a 16 kHz antes del reconocimiento.
qwen3-tts-flashAlibaba$0.1100por 10 mil caracteresAlibaba Qwen3-TTS-Flash — síntesis de voz de baja latencia con 17 voces integradas expresivas, que cubre chino, inglés, alemán, italiano, portugués, español, japonés, coreano, francés y ruso, además de un modo automático para textos que mezclan idiomas y salida en dialecto. Acepta hasta 512 tokens de texto por solicitud y admite síntesis con y sin streaming.
qwen3.5-livetranslate-flash-realtimeAlibaba$0.5500$20.0000por 1M tokensAlibaba Qwen3.5-LiveTranslate-Flash-Realtime — interpretación simultánea de audio y vídeo sobre una sesión WebSocket, construida sobre la base Qwen3.5-Omni con alineación entre idiomas y modalidades y refuerzo visual. Escucha 60 idiomas y habla 29. Se conecta mediante GET /v1/realtime. Su estructura de precios difiere de la de los demás modelos en tiempo real: **no existe una tarifa de entrada de texto**; la entrada se factura como audio o imagen, y la salida como texto o audio.
qwen3.5-ocrAlibaba$0.1000$0.3500por 1M tokensAlibaba Qwen3.5-OCR — el miembro OCR de la gama Qwen3.5, creado para el análisis de documentos, la localización de texto y la extracción de información clave; el proveedor señala avances notables en documentos de identidad y permisos reales. Acepta texto e imagen en la entrada y devuelve texto.
qwen3.5-omni-flashAlibaba$0.4000$2.2000por 1M tokensAlibaba Qwen3.5-Omni-Flash — el nivel rápido de la gama omnimodal Qwen3.5, que comprende y conversa a través de texto, imagen, audio y vídeo con sonido. Procesa más de 10 horas de audio y más de 400 segundos de vídeo con sonido en 720P (1 FPS) por conversación, con entrada de audio en más de 60 idiomas y salida de voz en más de 30. La entrada de audio y la salida que contiene audio se facturan con tarifas propias, superiores a la del texto.
qwen3.5-omni-flash-realtimeAlibaba$0.5500$3.3000por 1M tokensAlibaba Qwen3.5-Omni-Flash-Realtime — el nivel rápido en tiempo real de la gama omnimodal Qwen3.5, mantenido abierto como una sesión WebSocket para conversación de voz en dúplex completo. Comprende texto, imagen, audio y vídeo con sonido, acepta audio en más de 60 idiomas y habla en más de 30, con voz dirigible, búsqueda web, llamada a funciones complejas e interrupción semántica. Se conecta mediante GET /v1/realtime. La entrada de audio y la salida que contiene audio se facturan con tarifas propias, bastante superiores a la del texto.
qwen3.5-omni-plusAlibaba$1.4000$8.3000por 1M tokensAlibaba Qwen3.5-Omni-Plus — el nivel de alto rendimiento de la gama omnimodal Qwen3.5, que comprende y conversa a través de texto, imagen, audio y vídeo con sonido. Procesa más de 10 horas de audio y más de 400 segundos de vídeo con sonido en 720P (1 FPS) por conversación, con entrada de audio en más de 60 idiomas y salida de voz en más de 30. Ventana de contexto de 65,536 tokens. La entrada de audio y la salida que contiene audio se facturan con tarifas propias, superiores a la del texto.
qwen3.5-omni-plus-realtimeAlibaba$2.1000$12.4000por 1M tokensAlibaba Qwen3.5-Omni-Plus-Realtime — el nivel en tiempo real de la gama omnimodal Qwen3.5, mantenido abierto como una sesión WebSocket para conversación de voz en dúplex completo. Comprende texto, imagen, audio y vídeo con sonido, acepta audio en más de 60 idiomas y habla en más de 30, con voz dirigible, búsqueda web, llamada a funciones complejas e interrupción semántica. Se conecta mediante GET /v1/realtime. La entrada de audio y la salida que contiene audio se facturan con tarifas propias, bastante superiores a la del texto.
qwen3.6-27bAlibaba$0.6000$3.6000por 1M tokensAlibaba Qwen3.6-27B — el modelo denso de visión y lenguaje nativo de 27 000 millones de parámetros de la gama Qwen3.6, de pesos abiertos, que el proveedor sitúa por encima de 3.5-27B en programación agéntica, STEM y razonamiento, así como en inteligencia espacial, localización y detección de objetos. Ventana de contexto de 262,144 tokens. Acepta texto, imagen y vídeo en la entrada y devuelve texto.
qwen3.6-35b-a3bAlibaba$0.3750$2.2500por 1M tokensAlibaba Qwen3.6-35B-A3B — un modelo MoE de visión y lenguaje nativo de 35 000 millones de parámetros con unos 3 000 millones activos, de pesos abiertos, que combina la atención lineal con una mezcla dispersa de expertos para ganar eficiencia en la inferencia. Ventana de contexto de 262,144 tokens, hasta 65,536 tokens de salida y hasta 256 imágenes o 64 vídeos por solicitud. Acepta texto, imagen y vídeo en la entrada y devuelve texto. Admite la llamada a funciones, las herramientas integradas y las salidas estructuradas.
qwen3.6-flashAlibaba$0.2500$1.5000por 1M tokensAlibaba Qwen3.6-Flash — modelo rápido de visión y lenguaje que el proveedor destaca para la programación agéntica y para la inteligencia espacial, con avances notables en localización y detección de objetos. Ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 65,536 tokens de salida y un presupuesto de 131,072 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto. Admite llamada a funciones y caché de contexto.
qwen3.6-plusAlibaba$0.5000$3.0000$0.4250$2.5500por 1M tokensAlibaba Qwen3.6-Plus — modelo equilibrado para razonamiento general y uso de herramientas, con una ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 65,536 tokens de salida y un presupuesto de 81,920 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto. Admite llamada a funciones, salidas estructuradas, búsqueda web, completado de prefijo y caché de contexto.
qwen3.7-flashAlibaba$0.0300$0.1300por 1M tokensAlibaba Qwen3.7-Flash — el nivel rápido de la gama de visión y lenguaje nativa Qwen3.7, que el proveedor destaca para el trabajo de agentes multimodales (agentes de búsqueda y de integración continua) y para una ejecución de tareas de extremo a extremo más estable que 3.6-Flash. Ventana de contexto de 1,000,000 tokens, hasta 65,536 tokens de salida y hasta 256 imágenes o 64 vídeos por solicitud. Acepta texto, imagen y vídeo en la entrada y devuelve texto. Admite el modo de razonamiento, la llamada a funciones, las herramientas integradas y las salidas estructuradas. El precio tiene tres tramos de contexto: una solicitud de contexto largo cuesta más por token que una corta.
qwen3.7-maxAlibaba$2.5000$7.5000por 1M tokensAlibaba Qwen3.7-Max — buque insignia de código cerrado orientado a la programación, al trabajo de oficina y productividad, y a la ejecución autónoma de largo plazo, con una ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 131,072 tokens de salida y un presupuesto de 262,144 tokens para la cadena de razonamiento. Texto de entrada, texto de salida. Admite llamada a funciones, salidas estructuradas y caché de contexto.
qwen3.7-plusAlibaba$0.4000$1.6000$0.3000$1.2000por 1M tokensAlibaba Qwen3.7-Plus — modelo de agente híbrido multimodal que percibe escenas del mundo real, lee pantallas y maneja interfaces gráficas, genera código a partir de referencias visuales y realiza navegación de extremo a extremo dentro de aplicaciones móviles. Ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 131,072 tokens de salida y un presupuesto de 262,144 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto; admite llamada a funciones, salidas estructuradas y caché de contexto.
qwen3.8-2.4t-a95bAlibaba$2.0000$6.0000por 1M tokensAlibaba Qwen3.8-2.4T-A95B — la versión de pesos abiertos del modelo insignia Qwen3.8, un MoE disperso de 2,4 billones de parámetros totales con unos 95 000 millones activos por paso y un diseño de atención híbrido. Ventana de contexto de 1,000,000 tokens. Acepta texto en la entrada y devuelve texto. Los modos con y sin razonamiento se facturan a la misma tarifa y el precio de salida incluye la cadena de razonamiento.
qwen3.8-27bAlibaba$0.5000$3.0000por 1M tokensAlibaba Qwen3.8-27B — el modelo denso de visión y lenguaje nativo de 27 000 millones de parámetros de la gama Qwen3.8, de pesos abiertos, que el proveedor sitúa por encima de 3.6-27B en tareas de programación y ofimática, tanto en la modalidad de texto como en la visual. Ventana de contexto de 1,000,000 tokens. Acepta texto e imagen en la entrada y devuelve texto. Los modos con y sin razonamiento se facturan a la misma tarifa y el precio de salida incluye la cadena de razonamiento.
qwen3.8-flashAlibaba$0.1500$0.4700$0.1125$0.3525por 1M tokensAlibaba Qwen3.8-Flash — el nivel rápido de la gama Qwen3.8, un modelo nativamente multimodal que el proveedor posiciona para la asistencia a la programación, la colaboración entre agentes y la comprensión de imágenes y documentos con alto rendimiento. Ventana de contexto de 1,000,000 tokens. Acepta texto, imagen y vídeo en la entrada y devuelve texto. Admite el modo de razonamiento, la llamada a funciones, las herramientas integradas y las salidas estructuradas. Habla tanto el protocolo OpenAI como el protocolo Anthropic Messages.
qwen3.8-maxAlibaba$2.0000$6.0000$1.9000$5.7000por 1M tokensAlibaba Qwen3.8-Max — modelo MoE buque insignia de 2.4 billones de parámetros y el más capaz de la familia Qwen, con el proveedor señalando avances importantes en programación y productividad de oficina. Ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 131,072 tokens de salida y un presupuesto de 262,144 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto; admite llamada a funciones, salidas estructuradas y caché de contexto.
qwen3.8-max-0902Alibaba$2.0000$6.0000por 1M tokensAlibaba Qwen3.8-Max-0902 — la instantánea del 2026-09-02 de Qwen3.8-Max (alias del proveedor qwen3.8-max-2026-09-02), el modelo MoE insignia de 2.4 billones de parámetros, congelada para que las integraciones puedan fijar exactamente esta versión; el proveedor destaca una programación más profunda para proyectos de ingeniería complejos y el desarrollo autónomo de larga duración. Ventana de contexto de 1,000,000 tokens, hasta 131,072 tokens de salida; acepta entrada de texto, imagen y vídeo y devuelve texto; admite modo de razonamiento, llamada a herramientas y salida estructurada. El nombre dinámico qwen3.8-max pasa a versiones más recientes a medida que el proveedor las publica: fije este nombre para quedarse en esta. Tiene el mismo precio que qwen3.8-max.
speech-2.8-hdMiniMax$1.0000por 10 mil caracteresMiniMax speech-2.8-hd — el nivel de alta definición de la línea de voz 2.8, orientado a una interpretación ultrarrealista con etiquetas de sonido, que cubre 40 idiomas y 7 emociones. El tono, la velocidad del habla, el volumen, la frecuencia de muestreo, la tasa de bits y el formato de salida se configuran por solicitud, y la síntesis de textos largos acepta hasta 1 millón de caracteres de forma asíncrona o 10,000 caracteres a través de la interfaz de streaming.
speech-2.8-turboMiniMax$0.6000por 10 mil caracteresMiniMax speech-2.8-turbo — el nivel de baja latencia de la línea de voz 2.8, que cambia la interpretación ultrarrealista del modelo HD por una síntesis más rápida y de flujo natural. Cubre los mismos 40 idiomas y 7 emociones, con tono, velocidad del habla, volumen, frecuencia de muestreo, tasa de bits y formato de salida configurables, y acepta hasta 1 millón de caracteres de forma asíncrona o 10,000 caracteres a través de la interfaz de streaming.
step-3.5-flashStepFun$0.1000$0.3000por 1M tokensStepFun step-3.5-flash — modelo de razonamiento solo de texto con contexto de 256K, orientado a lógica, matemáticas, ingeniería de software e investigación profunda, donde la calidad del razonamiento debe ir acompañada de una ejecución rápida y fiable. La profundidad del razonamiento se elige por solicitud mediante reasoning_effort (low / medium / high). Admite llamada a herramientas, salida estructurada mediante JSON Schema, streaming y caché de prompts. Para entradas de imagen o vídeo, utilice step-3.7-flash.
step-3.5-flash-2603StepFun$0.1000$0.3000por 1M tokensStepFun step-3.5-flash-2603 — instantánea de 256K de step-3.5-flash ajustada para agentes, optimizada para la eficiencia en tokens y un modo de operación de inferencia reducida. Su parámetro reasoning_effort solo acepta low y high, mientras que el modelo base acepta tres niveles, por lo que el código que envía medium debe adaptarse. Solo texto; admite llamada a herramientas, salida estructurada mediante JSON Schema, streaming y caché de prompts.
step-3.7-flashStepFun$0.2000$1.1500por 1M tokensStepFun step-3.7-flash — MoE disperso con 198B de parámetros totales y 11B activos, contexto nativo de 256K y comprensión nativa de imágenes y vídeo además de texto. La profundidad del razonamiento se elige por solicitud mediante reasoning_effort (low / medium / high), y el modelo admite llamada a herramientas en varios pasos de forma fiable, salida estructurada mediante JSON Schema, streaming y caché de prompts. Ajustado para cargas de trabajo de agentes y programación. En /v1/responses, envíe la conversación completa en el array input en cada turno: en el proveedor upstream no se conserva ningún estado de la conversación, de modo que las solicitudes que incluyan previous_response_id o conversation se rechazan.
step-5-previewStepFun$1.0000$2.7000por 1M tokensStepFun step-5-preview — nuevo modelo insignia de StepFun para programación y trabajo intelectual especializado, publicado como versión preliminar. Contexto de 1M de tokens con hasta 64K tokens de salida y comprensión nativa de imágenes y vídeo además de texto. El razonamiento está siempre activo: se devuelve como reasoning_content en /v1/chat/completions y como bloques thinking en /v1/messages, se factura como salida y consume max_tokens, por lo que un límite de unos cientos de tokens puede agotarse por completo en el razonamiento y no devolver texto; deje un margen amplio. La profundidad se elige por solicitud mediante reasoning_effort (low / medium / high). Admite llamada a herramientas en varios pasos, salida estructurada mediante JSON Mode y JSON Schema, streaming y caché de prompts. Diseñado para el análisis de documentos largos, la ingeniería de software y el trabajo de agentes en varios pasos. En /v1/responses, envíe la conversación completa en el array input en cada turno: en el proveedor upstream no se conserva ningún estado de la conversación, de modo que las solicitudes que incluyan previous_response_id o conversation se rechazan.
step-audio-2StepFun$1.4815$10.3704por 1M tokensStepFun step-audio-2 — modelo de voz de extremo a extremo que consume el audio directamente en lugar de partir de una transcripción, de modo que el tono y la entonación llegan intactos a la comprensión del modelo. Se factura por token, con la tarifa de entrada de la línea StepAudio 2.5 y una tarifa de salida más alta. StepFun no publica una página de capacidades independiente para este modelo; consulte la documentación de audio de la plataforma para conocer el conjunto de parámetros vigente.
step-tts-2StepFun$0.4148por 10 mil caracteresStepFun step-tts-2 — síntesis de voz de extremo a extremo basada en NTP y creada para reproducir los acentos con precisión. Habla chino, inglés, mezcla de chino e inglés y japonés, además de cantonés y sichuanés. La emoción y la entonación se dirigen mediante etiquetas en lenguaje natural, y la clonación de voz zero-shot requiere unos 10 segundos de audio de referencia, con los controles de emoción y estilo trasladándose a la voz clonada sin costo adicional. Genera wav, mp3, flac, opus o pcm.
stepaudio-2-asr-proStepFun$0.2963por hora de audioStepFun StepAudio 2 ASR Pro — modelo de reconocimiento de voz de 32B de parámetros, la opción que prioriza la precisión dentro de la línea ASR de StepFun, mientras que stepaudio-2.5-asr prioriza velocidad y costo. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura.
stepaudio-2.5-asrStepFun$0.0220por hora de audioStepFun StepAudio 2.5 ASR — modelo de reconocimiento de voz de 4B de parámetros construido sobre Multi-Token Prediction, que transcribe cinco minutos de audio en alrededor de un segundo (RTF cercano a 0.0053). Optimizado para chino e inglés. Incluye normalización inversa del texto, identificación de hablantes y separación de dos canales para grabaciones de llamadas y reuniones. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura.
stepaudio-2.5-asr-streamStepFun$0.1800por hora de audioStepFun StepAudio 2.5 ASR Stream — la versión de reconocimiento en streaming de StepAudio 2.5 ASR (un reconocedor de 4B de parámetros construido sobre Multi-Token Prediction, optimizado para chino e inglés), y el modelo de streaming que recomienda StepFun. En este gateway se invoca igual que los demás modelos de transcripción: suba una grabación completa a /v1/audio/transcriptions y la transcripción completa se devolverá en una sola respuesta cuando termine el reconocimiento; no se devuelven resultados parciales en streaming, y este modelo cuesta más por minuto de audio que stepaudio-2.5-asr. Se aplica normalización inversa del texto. Solo acepta archivos wav PCM de 16 bits y ogg (no se acepta mp3); la transcripción generada no se factura.
stepaudio-2.5-chatStepFun$1.5000$3.5000por 1M tokensStepFun StepAudio 2.5 Chat — modelo de comprensión del habla de extremo a extremo: recibe audio o texto y devuelve texto, leyendo señales paralingüísticas como la vacilación o la risa en la propia forma de onda y no en una transcripción. Admite una personalización amplia de personas, que abarca carácter, hábitos de habla y rango emocional. El audio se envía como partes de contenido input_audio en el endpoint chat completions. Para obtener respuestas habladas, utilice un modelo de TTS.
stepaudio-2.5-realtimeStepFun$1.5000$10.0000por 1M tokensStepFun StepAudio 2.5 Realtime — modelo de voz a voz de extremo a extremo sobre una sesión WebSocket en GET /v1/realtime: entrada de audio o texto en streaming y salida de audio en streaming con transcripción de texto, con detección de actividad de voz en el servidor e interrupción. El audio es PCM16, 24 kHz, mono; el proveedor indica el inglés como idioma compatible. Define la voz de forma explícita en session.update: solo se aceptan las voces que figuran en la lista de StepFun.
stepaudio-2.5-ttsStepFun$0.8500por 10 mil caracteresStepFun StepAudio 2.5 TTS — síntesis de voz contextual que traslada la comprensión a todo el proceso de generación en lugar de tratar la entonación como un posprocesado. La voz, la emoción y el ritmo se dirigen en lenguaje natural en dos niveles: un contexto global para la solicitud y un contexto en línea para pasajes concretos. La clonación de voz zero-shot necesita unos 3 segundos de audio de referencia y hereda todo el conjunto de controles contextuales. Acepta hasta 1000 caracteres por solicitud; genera wav, mp3, flac u opus.
stepaudio-3-asr-maxStepFun$0.4000por hora de audioStepFun StepAudio 3 ASR Max — el mayor modelo de reconocimiento de voz de StepFun, construido sobre un gran modelo de lenguaje, de modo que el reconocimiento se apoya en el contexto y en el conocimiento del dominio: rinde mejor con nombres propios, nombres de medicamentos, términos técnicos y homófonos, con la mezcla de chino e inglés, los dialectos y los audios largos, y con el habla susurrada, muy rápida o con música de fondo, incluidas las letras cantadas. Envíe un archivo de audio a POST /v1/audio/transcriptions (WAV, MP3 u OGG); se factura por la duración del audio.
stepaudio-3-chat-previewStepFun$0.0000por 1M tokensStepFun StepAudio 3 Chat (versión preliminar) — modelo de diálogo con comprensión del habla en POST /v1/chat/completions: envíe, turno a turno, voz como partes de contenido input_audio, o texto, y reciba texto como respuesta, con llamada a herramientas. Gratuito mientras dure la versión preliminar de StepFun. Cuando termina el periodo gratuito, StepFun retira el nombre de la versión preliminar y lanza una versión de pago, así que prevea que este identificador de modelo dejará de funcionar en ese momento.
stepaudio-3-gen-previewStepFun$0.000por solicitudStepFun StepAudio 3 Audio Generation (versión preliminar) — generación de audio a partir de un guion de la serie StepAudio 3 en POST /v1/audio/generate: defina roles con un nombre y una descripción de la voz en lenguaje natural, escriba el guion línea a línea (las líneas entre corchetes se convierten en efectos de sonido o música de fondo), añada una instrucción general, y el audio terminado vuelve como bytes (mp3 por defecto). Las voces salen de las descripciones de los roles; no se aceptan nombres de voz predefinidos. Los campos de la solicitud siguen la referencia de API de StepFun. Gratuito mientras dure la versión preliminar de StepFun. Cuando termina el periodo gratuito, StepFun retira el nombre de la versión preliminar y lanza una versión de pago, así que prevea que este identificador de modelo dejará de funcionar en ese momento.
stepaudio-3-music-previewStepFun$0.000por solicitudStepFun StepAudio 3 Music (versión preliminar) — generación de música a partir de texto de la serie StepAudio 3 en POST /v1/music/generations, con la misma forma de solicitud que minimax-music-v3.0: describa el estilo en prompt, añada la letra en lyrics o establezca is_instrumental, y la canción terminada vuelve codificada en hex en data.audio (mp3 por defecto; wav, flac, opus o pcm mediante audio_setting.format). La llamada es síncrona y una canción suele tardar de uno a varios minutos, así que configure en el cliente un tiempo de espera de al menos 600 segundos. No se ofrecen versiones (covers) ni acompañamiento para una voz subida. Gratuito mientras dure la versión preliminar de StepFun. Cuando termina el periodo gratuito, StepFun retira el nombre de la versión preliminar y lanza una versión de pago, así que prevea que este identificador de modelo dejará de funcionar en ese momento.
stepaudio-3-realtime-previewStepFun$0.0000por 1M tokensStepFun StepAudio 3 Realtime (versión preliminar) — modelo de voz en dúplex completo de StepFun sobre una sesión WebSocket en GET /v1/realtime: interrupción y toma de turnos naturales, razonamiento adaptativo mientras habla y llamadas a herramientas durante la conversación. Gratuito mientras dure la versión preliminar de StepFun. Cuando termina el periodo gratuito, StepFun retira el nombre de la versión preliminar y lanza una versión de pago, así que prevea que este identificador de modelo dejará de funcionar.
stepaudio-3-ttsStepFun$0.3600por 10 mil caracteresStepFun StepAudio 3 TTS — síntesis de voz de la serie StepAudio 3, diseñada para una locución de nivel humano: el timbre, la entonación, el ritmo y la respiración siguen el habla natural, incluidas la risa, la vacilación y la autocorrección, y la emoción y el tono cambian según el contenido. Se sirve en POST /v1/audio/speech y se factura por carácter del texto de entrada.
vidu-video-q3Vidu$0.060por segundoVidu Q3 — modelo de generación de vídeo a partir de referencias, con sujetos coherentes, cambio de escena inteligente y salida de audio y vídeo sincronizada. Acepta imágenes de referencia o sujetos con nombre; genera de 3 a 16 segundos en 540P, 720P o 1080P.
vidu-video-q3-proVidu$0.100por segundoVidu Q3 Pro — texto a vídeo, imagen a vídeo y generación a partir de fotogramas inicial y final, orientados a la calidad, con salida de audio y vídeo sincronizada. Genera de 1 a 16 segundos en 540P, 720P o 1080P; este SKU no admite la generación de vídeo a partir de referencias.
vidu-video-q3-turboVidu$0.055por segundoVidu Q3 Turbo — el nivel Q3 rápido y económico para generación de vídeo a partir de texto, imagen, fotogramas inicial y final o referencias, con salida de audio y vídeo sincronizada. Genera de 1 a 16 segundos en los modos normales o de 3 a 16 segundos en el modo de referencia, de 540P a 1080P.
wan2.7-i2vAlibaba$0.100por segundoAlibaba Wan 2.7 Image-to-Video — cubre la generación a partir del primer fotograma, las transiciones entre el primero y el último, y la continuación de un clip existente. Produce 720P o 1080P (1080P por defecto) de 2 a 15 segundos, 5 s por defecto, a partir de prompts de hasta 5,000 caracteres (prompts negativos de hasta 500 caracteres). Puede enviarse una pista mp3 o wav de 2 a 30 segundos como driving_audio; sin audio, el modelo genera música de fondo o efectos de sonido acordes, un audio más largo que el clip se recorta y uno más corto deja el final en silencio.
wan2.7-imageAlibaba$0.030por solicitudAlibaba Wan2.7 Image — texto a imagen, edición de imágenes, generación con varias imágenes de referencia, edición interactiva, y buen trazado de texto y seguimiento de instrucciones.
wan2.7-image-proAlibaba$0.075por solicitudAlibaba Wan 2.7 Image Pro — el nivel profesional de la línea de imagen Wan 2.7, que cubre texto a imagen, conjuntos secuenciales de imágenes, edición de imágenes y generación con varias imágenes de referencia, con un mejor seguimiento del prompt. El texto a imagen llega a 4K (4096x4096), con niveles de 1K y 2K y tamaños personalizados desde 768x768; los modos de edición y secuencial se limitan a 2K. Acepta hasta 9 imágenes de referencia (JPEG, JPG, PNG, BMP, WEBP; de 240 a 8,000 px por lado, 20 MB cada una), relaciones de aspecto de 1:8 a 8:1 y prompts de hasta 5,000 caracteres. Devuelve PNG.
wan2.7-r2vAlibaba$0.100por segundoAlibaba Wan2.7 (R2V) — generación de vídeo a partir de referencias, con hasta 5 referencias mixtas de imagen/vídeo más una referencia de timbre de audio, y mayor coherencia de personajes, objetos de escena y escenarios.
wan2.7-t2vAlibaba$0.100por segundoAlibaba Wan2.7 (T2V) — texto a vídeo con mejor interpretación actoral, emociones matizadas, acción intensa y cortes de cámara dramáticos. Produce MP4 H.264 en 720P o 1080P, de 2 a 15 segundos (5 s por defecto), en 16:9, 9:16, 1:1, 4:3 o 3:4, a partir de prompts de hasta 5,000 caracteres. El audio se incluye por defecto: sin audio_url, el modelo compone música de fondo o efectos de sonido acordes, o bien puede enviarse en su lugar una pista wav o mp3 de 2 a 30 segundos.
wan2.7-videoeditAlibaba$0.100por segundoAlibaba Wan2.7 VideoEdit — edición de vídeo en lenguaje natural, local o global, sustitución de elementos mediante imagen de referencia y replicación de movimiento, efectos y cámara.
wan3.0-videoAlibaba$0.100$0.085por segundoAlibaba Wan3.0 (Video) — modelo de vídeo todo en uno que unifica texto a vídeo, imagen a vídeo y referencia a vídeo tras un único endpoint. Genera MP4 H.264 en 480P, 720P o 1080P, de hasta 30 segundos, a partir de un prompt y de una URL opcional de imagen para el primer fotograma. Se factura por segundo de vídeo generado según la propia escala de precios del proveedor: 720P es la tarifa base, 480P se cobra a la mitad y 1080P al doble. Una solicitud que no indica resolución la produce el modelo en 1080P y se cobra a ese nivel. Las entradas de vídeo de referencia y de audio de referencia existen en el modelo del proveedor, pero no se admiten en este endpoint.
wan3.0-video-primeAlibaba$0.140por segundoAlibaba Wan3.0 Video Prime — el nivel rápido del modelo de vídeo todo en uno Wan 3.0, con las mismas capacidades que el nivel estándar y una mayor velocidad de generación. Texto a vídeo, imagen a vídeo con primer/último fotograma e imagen de referencia a vídeo (hasta 10 imágenes de referencia) tras un único endpoint; MP4 H.264 en 480P, 720P o 1080P, de 2 a 30 segundos, 30 fps, con audio por defecto. Se factura por segundo de vídeo generado según la escala de precios del proveedor: 720P es la tarifa base, 480P cuesta poco menos de la mitad de ella y 1080P el doble. Una solicitud que no indica resolución se genera en la resolución predeterminada del proveedor, 1080P, y se cobra en ese nivel. En este gateway no se aceptan entradas de vídeo de referencia, audio de referencia, archivos ni enlaces web, y la duración inteligente (-1) se rechaza; indique la duración de forma explícita. Se sirve a través de un único canal oficial de Alibaba.