Precios de los modelos de IA chinos

ChinaAPI ofrece DeepSeek, Qwen, GLM, Kimi y otros modelos de IA chinos a través de un gateway compatible con OpenAI en https://api.chinaapi.ai/v1. Todos los precios están en dólares estadounidenses, expresados en la unidad que utiliza el proveedor de origen. La misma lista está disponible en JSON en /api/pricing.

Precios de los modelos públicos
ModeloProveedorEntradaSalidaUnidadDescripción
stepaudio-2.5-asrStepFun$0.0220por hora de audioStepFun StepAudio 2.5 ASR — modelo de reconocimiento de voz de 4B de parámetros construido sobre Multi-Token Prediction, que transcribe cinco minutos de audio en alrededor de un segundo (RTF cercano a 0.0053). Optimizado para chino e inglés. Incluye normalización inversa del texto, identificación de hablantes y separación de dos canales para grabaciones de llamadas y reuniones. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura.
stepaudio-2.5-asr-stream$0.1800por hora de audio
wan2.7-image-pro阿里巴巴$0.060por solicitudAlibaba Wan 2.7 Image Pro — el nivel profesional de la línea de imagen Wan 2.7, que cubre texto a imagen, conjuntos secuenciales de imágenes, edición de imágenes y generación con varias imágenes de referencia, con un mejor seguimiento del prompt. El texto a imagen llega a 4K (4096x4096), con niveles de 1K y 2K y tamaños personalizados desde 768x768; los modos de edición y secuencial se limitan a 2K. Acepta hasta 9 imágenes de referencia (JPEG, JPG, PNG, BMP, WEBP; de 240 a 8,000 px por lado, 20 MB cada una), relaciones de aspecto de 1:8 a 8:1 y prompts de hasta 5,000 caracteres. Devuelve PNG.
glm-asr-2512智谱$0.1440por hora de audioZhipu GLM-ASR-2512 — modelo de reconocimiento de voz que declara una tasa de error de caracteres de 0.0717. Cubre el mandarín junto con el sichuanés, el cantonés, el min nan y el wu, los acentos del inglés estadounidense y británico, y decenas de idiomas más, entre ellos francés, alemán, japonés, coreano, español y árabe. Maneja el habla que mezcla idiomas, la jerga técnica y el registro coloquial, y acepta un diccionario personalizado para vocabulario especializado. El audio está limitado a 30 segundos y 25 MB por solicitud, con transcripción por lotes y en streaming.
kimi-k3Moonshot$2.7400$13.6990por 1M tokensMoonshot Kimi K3 — buque insignia de 2.8 billones de parámetros para programación de larga duración, trabajo del conocimiento de extremo a extremo y razonamiento profundo, con una ventana de contexto de 1M tokens y hasta 1,048,576 tokens de finalización (131,072 por defecto). Acepta texto, imágenes en base64 y vídeo, y devuelve texto. El razonamiento está siempre activo, con reasoning_effort seleccionable entre low, high o max (max por defecto); la temperatura está fijada en 1.0. Admite llamada a herramientas personalizadas y carga dinámica de herramientas.
mimo-v2.5-proXiaomi$0.4350$0.8700por 1M tokensXiaomi MiMo-V2.5-Pro — buque insignia de un billón de parámetros (42B activos) con contexto de 1M y salida máxima de 128K, ajustado para cargas de trabajo de agentes de alta intensidad. Admite razonamiento profundo, llamada a funciones, salida estructurada y búsqueda web. Solo generación de texto: a diferencia de mimo-v2.5, la lista de capacidades del proveedor no incluye la comprensión de todas las modalidades.
speech-2.8-hdMiniMax$0.5385por 10 mil caracteresMiniMax speech-2.8-hd — el nivel de alta definición de la línea de voz 2.8, orientado a una interpretación ultrarrealista con etiquetas de sonido, que cubre 40 idiomas y 7 emociones. El tono, la velocidad del habla, el volumen, la frecuencia de muestreo, la tasa de bits y el formato de salida se configuran por solicitud, y la síntesis de textos largos acepta hasta 1 millón de caracteres de forma asíncrona o 10,000 caracteres a través de la interfaz de streaming.
wan2.7-videoedit阿里巴巴$0.092por segundoAlibaba Wan2.7 VideoEdit — edición de vídeo en lenguaje natural, local o global, sustitución de elementos mediante imagen de referencia y replicación de movimiento, efectos y cámara.
agnes-2.5-flashAgnes AI$0.0000por 1M tokensAgnes AI Agnes 2.5 Flash — modelo de agente multimodal rápido con ventana de contexto de entrada de 512K y límite de salida de referencia de 65.5K, compatible con chat, streaming, llamada a herramientas, programación, razonamiento, diálogo multiturno, comprensión visual y flujos de trabajo de agentes.
doubao-seed-2-1-turbo-260628字节跳动$0.4620$2.3080por 1M tokensByteDance Doubao Seed 2.1 Turbo — la vía de baja latencia de la línea Seed 2.1, que comparte los límites del Pro: ventana de contexto de 256K con una entrada máxima de 256K, hasta 256K tokens de salida (4K por defecto) y un presupuesto de 256K para la cadena de razonamiento. Cubre razonamiento profundo, generación de texto, comprensión multimodal, llamada a herramientas y salida estructurada, aunque sin la recomendación de json_schema del Pro. Acepta texto, imagen y vídeo y devuelve texto; la comprensión de audio no figura para la línea 2.1. Admite caché de contexto implícita y explícita.
doubao-seedance-2-5-260628字节跳动$10.7000$10.7000por 1M tokensByteDance Seedance 2.5 — el modelo principal de la línea Seedance, que estira una sola generación hasta 4-30 segundos a 24 fps mientras limita la resolución a 480p y 720p. La generación multimodal por referencia llega a 1-30 imágenes, hasta 10 vídeos de referencia y hasta 10 clips de audio de referencia (30 segundos en total para cada categoría) y, a diferencia de la línea 2.0, una referencia de audio puede usarse por sí sola. También cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16.
glm-5.2智谱$1.1200$3.5200por 1M tokensZhipu GLM-5.2 — modelo fundacional buque insignia especializado en el trabajo de agente de programación de larga duración, logrado con meses de entrenamiento dedicado y no solo con una ampliación del contexto, con una ventana de contexto de 1M tokens y hasta 128K tokens de salida. Texto de entrada, texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
happyhorse-1.1-i2v阿里巴巴$0.083por segundoAlibaba HappyHorse 1.1 (I2V) — imagen a vídeo con mejor textura, coherencia de identidad entre clips, fluidez de movimiento y sincronía entre audio e imagen. 720P/1080P.
MiniMax-M3MiniMaxFacturación escalonada, consulte la página de preciosMiniMax M3 — modelo de programación multimodal de vanguardia para razonamiento agéntico, uso de herramientas y ejecución estructurada de tareas, con una ventana de contexto de 1,000,000 tokens. Acepta texto, imágenes de hasta 10 MB y vídeo de hasta 50 MB incrustado o 512 MB a través de la API de Files, y devuelve texto. Admite llamada a herramientas, con el razonamiento opcional en lugar de siempre activo.
kimi-k2.6Moonshot$0.7600$3.1570por 1M tokensMoonshot Kimi K2.6 — modelo de propósito general para diálogo, generación de código, comprensión visual y tareas de agentes, con una escritura de código de larga duración y una ejecución autónoma más sólidas que en la generación anterior. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes (png, jpeg, webp, gif) y vídeo (mp4, mov, webm y otros) como contenido base64 y devuelve texto. El modo de razonamiento viene activado por defecto y puede desactivarse; la temperatura está fijada en 1.0 con razonamiento y en 0.6 sin él.
mimo-v2.5-tts-voicedesignXiaomi$0.0000por 10 mil caracteresModelo de diseño de voz de Xiaomi MiMo: describa en lenguaje natural la voz deseada mediante instructions y el modelo sintetiza el habla con esa voz diseñada.
MiniMax-Hailuo-2.3MiniMax$0.280por solicitudMiniMax Hailuo 2.3 — texto a vídeo e imagen a vídeo que el proveedor posiciona por su seguimiento de instrucciones, a 24 fps, con 768p disponible en clips de 6 o 10 segundos y 1080p en 6 segundos. 768p 6 s = $0.28.
qwen3.7-max阿里巴巴$2.5000$7.5000por 1M tokensAlibaba Qwen3.7-Max — buque insignia de código cerrado orientado a la programación, al trabajo de oficina y productividad, y a la ejecución autónoma de largo plazo, con una ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 131,072 tokens de salida y un presupuesto de 262,144 tokens para la cadena de razonamiento. Texto de entrada, texto de salida. Admite llamada a funciones, salidas estructuradas y caché de contexto.
step-1o-turbo-visionStepFun$0.4000$1.2800por 1M tokensStepFun step-1o-turbo-vision — comprensión de imágenes y vídeo con generación rápida de texto, contexto de 32K. Acepta texto, imagen y vídeo como entrada y devuelve solo texto. Es un modelo de visión de la generación anterior que se mantiene por compatibilidad; step-3.7-flash cubre las mismas modalidades de entrada con contexto de 256K y profundidad de razonamiento seleccionable. Mantenga las imágenes por debajo de 4096 píxeles en el lado más largo para un reconocimiento fiable.
step-audio-r1.5StepFun$1.5500$16.2750por 1M tokensStepFun step-audio-r1.5 — modelo de voz de extremo a extremo de la misma familia que step-audio-2, con la misma tarifa de entrada y una salida que se factura un 50% más cara. StepFun no publica una página de capacidades independiente para este modelo; consulte la documentación de audio de la plataforma para conocer el conjunto de parámetros vigente.
agnes-2.0-flashAgnes AI$0.0000por 1M tokensAgnes AI Agnes 2.0 Flash — modelo de agente multimodal rápido con ventana de contexto de entrada de 256K y límite de salida de referencia de 64K, compatible con chat, streaming, llamada a herramientas, programación, razonamiento, comprensión visual y flujos de trabajo de agentes.
LongCat-2.0Meituan$0.3000$1.2000por 1M tokensMeituan LongCat-2.0 — modelo MoE abierto de 1.6T de parámetros con contexto nativo de 1M, creado para programación agéntica y uso de herramientas de larga duración. Modelo de razonamiento solo de texto.
mimo-v2.5-ttsXiaomi$0.0000por 10 mil caracteresXiaomi MiMo v2.5 TTS — síntesis de voz expresiva con ocho voces integradas, cuatro en chino y cuatro en inglés (Mia, Chloe, Milo, Dean), que cubre chino e inglés además de los estilos dialectales del Noreste, de Sichuan, de Henan y del cantonés. La interpretación se dirige de dos formas: instrucciones de estilo en lenguaje natural y etiquetas de audio en línea para emociones básicas y compuestas, respiración, suspiros y ritmo, incluido un modo de canto exclusivo de este modelo dentro de la línea MiMo TTS. Devuelve wav mono o pcm16 a 24 kHz y admite streaming de baja latencia, que exige pcm16. Contexto de 8K y salida máxima de 8K.
speech-2.8-turboMiniMax$0.3077por 10 mil caracteresMiniMax speech-2.8-turbo — el nivel de baja latencia de la línea de voz 2.8, que cambia la interpretación ultrarrealista del modelo HD por una síntesis más rápida y de flujo natural. Cubre los mismos 40 idiomas y 7 emociones, con tono, velocidad del habla, volumen, frecuencia de muestreo, tasa de bits y formato de salida configurables, y acepta hasta 1 millón de caracteres de forma asíncrona o 10,000 caracteres a través de la interfaz de streaming.
agnes-image-2.0-flashAgnes AI$0.000por solicitudAgnes AI Image 2.0 Flash — modelo rápido de generación y edición de imágenes para texto a imagen, imagen a imagen y composición con varias imágenes, cuyos resultados se entregan como URL o datos Base64.
glm-5智谱$1.0000$3.2000por 1M tokensZhipu GLM-5 — MoE de 744B parámetros con 40B activos, entrenado con 28.5T tokens y con DeepSeek Sparse Attention, con una ventana de contexto de 200K y hasta 128K tokens de salida. Texto de entrada, texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
glm-tts智谱$0.3077por 10 mil caracteresZhipu GLM-TTS — síntesis de voz construida sobre una arquitectura de generación en dos etapas con aprendizaje por refuerzo GRPO, que infiere la emoción y la entonación del texto circundante en lugar de exigir un marcado explícito. Incluye siete voces integradas (tongtong por defecto, xiaochen, chuichui, jam, kazi, douji, luodo) con velocidad y volumen ajustables, acepta hasta 1,024 caracteres por solicitud y transmite con una latencia de primer fotograma inferior a 400 ms. Devuelve wav o pcm a una frecuencia de muestreo recomendada de 24 kHz; el streaming es solo en pcm.
hy3Tencent$0.1540$0.6150por 1M tokensTencent Hunyuan 3 (Hy3) — modelo MoE de 295B de parámetros (21B activos), contexto nativo de 256K y tres modos de razonamiento (fast / low / deep). Sólido en agentes de programación, comprensión de documentos largos, contexto en varios turnos y flujos de trabajo de agentes de varios pasos. Solo texto.
kling-v3-omni快手$0.420por solicitudKling 3.0 Omni — generación de vídeo a partir de varias imágenes de referencia. El precio publicado corresponde al nivel std (720p, 5 s, sin audio, sin vídeo de referencia). Las solicitudes que no fijan mode usan el nivel pro, predeterminado en el proveedor, y se facturan 1.33x, unos $0.56 por el mismo clip de 5 s; el 4k se factura 5x. Envíe mode=std para que se le cobre el precio publicado.
mimo-v2.5-tts-voicecloneXiaomi$0.0000por 10 mil caracteresModelo de clonación de voz de Xiaomi MiMo: envíe una muestra de audio de referencia como data URL en el campo voice (data:{mime};base64,...) y el modelo sintetiza el habla con esa voz, sin ninguna etapa de entrenamiento, anotación ni ajuste fino. Acepta MP3 (audio/mpeg) o WAV, con la cadena codificada en base64 limitada a 10 MB; Xiaomi no publica una duración mínima para el audio de referencia. Las instrucciones de estilo en lenguaje natural y las etiquetas de audio en línea se heredan de mimo-v2.5-tts, pero no hay streaming: la solicitud se ejecuta en modo de compatibilidad y solo devuelve el resultado una vez terminada la síntesis.
MiniMax-Hailuo-2.3-FastMiniMax$0.190por solicitudMiniMax Hailuo 2.3 Fast — el nivel de velocidad y costo de Hailuo 2.3, centrado en imagen a vídeo y en el realismo del movimiento físico, a 24 fps, con 768p disponible en clips de 6 o 10 segundos y 1080p en 6 segundos. 768p 6 s = $0.19.
glm-5-turbo智谱$1.2000$4.0000por 1M tokensZhipu GLM-5-Turbo — la variante de GLM-5 orientada al rendimiento, optimizada para flujos de trabajo de agentes: invocación de herramientas y habilidades más estable a lo largo de tareas de varios pasos, mejor manejo de instrucciones largas y encadenadas, y ejecución de tareas programadas o de larga duración. Ventana de contexto de 200K, hasta 128K tokens de salida, texto de entrada y texto de salida. Admite modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
glm-5v-turbo智谱$0.7690$3.3850por 1M tokensZhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows.
happyhorse-1.1-r2v阿里巴巴$0.083por segundoAlibaba HappyHorse 1.1 (R2V) — generación de vídeo a partir de referencias, con hasta 9 imágenes de referencia, fuerte coherencia de sujeto, escena y estilo, y control de cámara. 720P/1080P.
kling-v3快手$0.420por solicitudKuaishou Kling 3.0 — texto a vídeo e imagen a vídeo con audio nativo y mejor coherencia de los elementos. Los clips duran de 3 a 15 segundos (5 por defecto) en 16:9, 9:16 o 1:1, y el nivel se elige mediante mode: std para 720P, pro para 1080P y 4k para 4K nativo. El audio hay que activarlo con sound=on y viene desactivado por defecto; imagen a vídeo toma un primer fotograma con un fotograma final opcional. Desde $0.083/s (720p).
MiniMax-Hailuo-02MiniMax$0.280por solicitudMiniMax Hailuo 02 — generación de vídeo económica que cubre tanto texto a vídeo como imagen a vídeo a 24 fps, con 512p y 768p disponibles en clips de 6 o 10 segundos y 1080p en 6 segundos. El nivel 512p es la puerta de entrada de la línea Hailuo.
qwen3-tts-flash阿里巴巴$0.1231por 10 mil caracteresAlibaba Qwen3-TTS-Flash — síntesis de voz de baja latencia con 17 voces integradas expresivas, que cubre chino, inglés, alemán, italiano, portugués, español, japonés, coreano, francés y ruso, además de un modo automático para textos que mezclan idiomas y salida en dialecto. Acepta hasta 512 tokens de texto por solicitud y admite síntesis con y sin streaming.
step-3.7-flashStepFun$0.2000$1.1500por 1M tokensStepFun step-3.7-flash — MoE disperso con 198B de parámetros totales y 11B activos, contexto nativo de 256K y comprensión nativa de imágenes y vídeo además de texto. La profundidad del razonamiento se elige por solicitud mediante reasoning_effort (low / medium / high), y el modelo admite llamada a herramientas en varios pasos de forma fiable, salida estructurada mediante JSON Schema, streaming y caché de prompts. Ajustado para cargas de trabajo de agentes y programación.
stepaudio-2-asr-proStepFun$0.3500por hora de audioStepFun StepAudio 2 ASR Pro — modelo de reconocimiento de voz de 32B de parámetros, la opción que prioriza la precisión dentro de la línea ASR de StepFun, mientras que stepaudio-2.5-asr prioriza velocidad y costo. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura.
doubao-seed-2-1-pro-260628字节跳动$0.9230$4.6150por 1M tokensByteDance Doubao Seed 2.1 Pro — modelo de agente buque insignia de Doubao para el trabajo en producción, que cubre razonamiento profundo, generación de texto, comprensión multimodal, llamada a herramientas y salida estructurada, para la que el proveedor recomienda el modo json_schema. Ventana de contexto de 256K con una entrada máxima de 256K, hasta 256K tokens de salida (4K por defecto) y un presupuesto de 256K para la cadena de razonamiento. Acepta texto, imagen y vídeo y devuelve texto; la comprensión de audio no figura para la línea 2.1. Admite caché de contexto implícita y explícita, incluidas las cachés de prefijo y de sesión.
qwen3-asr-flash阿里巴巴$0.1235por hora de audioAlibaba Qwen3-ASR-Flash — reconocimiento de voz construido sobre el modelo fundacional Qwen3, que determina por sí solo el idioma hablado y transcribe 11 idiomas; la línea Qwen3-ASR documenta el mandarín junto con el sichuanés, el min nan, el wu y el cantonés, además de varios acentos del inglés. Acepta aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma y wmv de hasta 5 minutos y 10 MB por solicitud; la entrada pcm debe estar en 16 kHz y los demás formatos se remuestrean a 16 kHz antes del reconocimiento.
qwen3.6-flash阿里巴巴$0.1850$1.1080por 1M tokensAlibaba Qwen3.6-Flash — modelo rápido de visión y lenguaje que el proveedor destaca para la programación agéntica y para la inteligencia espacial, con avances notables en localización y detección de objetos. Ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 65,536 tokens de salida y un presupuesto de 131,072 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto. Admite llamada a funciones y caché de contexto.
step-tts-miniStepFun$0.1500por 10 mil caracteresStepFun step-tts-mini — el miembro económico y de baja latencia de la línea TTS de StepFun, que cubre los mismos idiomas que step-tts-2 (chino, inglés, mezcla de chino e inglés y japonés, además de cantonés y sichuanés) con un subconjunto de las voces integradas. Admite etiquetas de emoción y entonación en lenguaje natural, y clonación de voz zero-shot a partir de unos 10 segundos de audio de referencia. Genera wav, mp3, flac, opus o pcm.
wan2.7-i2v阿里巴巴$0.092por segundoAlibaba Wan 2.7 Image-to-Video — cubre la generación a partir del primer fotograma, las transiciones entre el primero y el último, y la continuación de un clip existente. Produce 720P o 1080P (1080P por defecto) de 2 a 15 segundos, 5 s por defecto, a partir de prompts de hasta 5,000 caracteres (prompts negativos de hasta 500). Puede enviarse una pista mp3 o wav de 2 a 30 segundos como driving_audio; sin audio, el modelo genera música de fondo o efectos de sonido acordes, un audio más largo que el clip se recorta y uno más corto deja el final en silencio.
wan2.7-image阿里巴巴$0.031por solicitudAlibaba Wan2.7 Image — texto a imagen, edición de imágenes, generación con varias imágenes de referencia, edición interactiva, y buen trazado de texto y seguimiento de instrucciones.
mimo-v2.5-asrXiaomi$0.0740por hora de audioModelo de reconocimiento de voz de Xiaomi MiMo optimizado para chino e inglés y para dialectos chinos, capaz de manejar audio con ruido, captado a distancia y con varios hablantes, así como la transcripción de letras de canciones.
qwen3.7-plus阿里巴巴$0.3080$1.2310por 1M tokensAlibaba Qwen3.7-Plus — modelo de agente híbrido multimodal que percibe escenas del mundo real, lee pantallas y maneja interfaces gráficas, genera código a partir de referencias visuales y realiza navegación de extremo a extremo dentro de aplicaciones móviles. Ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 131,072 tokens de salida y un presupuesto de 262,144 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto; admite llamada a funciones, salidas estructuradas y caché de contexto.
step-2x-largeStepFun$0.016por solicitudStepFun Step 2X Large — generación de imágenes a partir de texto con textura realista y un trazado de texto en chino e inglés dentro de la propia imagen excepcionalmente bueno. Admite 256x256, 512x512, 768x768, 1024x1024, 1280x800 y 800x1280; una imagen por solicitud. Se sirve mediante el endpoint images compatible con OpenAI.
step-3.5-flashStepFun$0.1000$0.3000por 1M tokensStepFun step-3.5-flash — modelo de razonamiento solo de texto con contexto de 256K, orientado a lógica, matemáticas, ingeniería de software e investigación profunda, donde la calidad del razonamiento debe ir acompañada de una ejecución rápida y fiable. La profundidad del razonamiento se elige por solicitud mediante reasoning_effort (low / medium / high). Admite llamada a herramientas, salida estructurada mediante JSON Schema, streaming y caché de prompts. Para entradas de imagen o vídeo, utilice step-3.7-flash.
step-asr-1.1StepFun$0.3500por hora de audioStepFun step-asr-1.1 — versión actualizada del reconocedor de propósito general de la línea step-asr, que cubre chino, inglés y dialectos chinos. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura.
deepseek-v4-proDeepSeek$0.4350$0.8700por 1M tokensDeepSeek V4 Pro — el nivel de mayor capacidad de DeepSeek V4 para programación, razonamiento y trabajo agéntico, con una ventana de contexto de 1M tokens y una salida máxima de 384K. Funciona tanto en modo de razonamiento (predeterminado) como sin razonamiento, y admite llamada a herramientas y salida en JSON. Texto de entrada, texto de salida.
gemini-3.6-flashGoogleFacturación escalonada, consulte la página de preciosGoogle Gemini 3.6 Flash — modelo de razonamiento multimodal en versión estable que equilibra velocidad e inteligencia para tareas agénticas y del mundo real, con un contexto de entrada de 1,048,576 tokens y un límite de salida de 65,536 tokens. Acepta texto, imágenes, vídeo, audio y PDF, y admite thinking, llamada a funciones, ejecución de código, fundamentación mediante búsqueda, salida estructurada y Computer Use (versión preliminar).
kimi-k2.7-code-highspeedMoonshot$1.7810$7.3970por 1M tokensMoonshot Kimi K2.7 Code Highspeed — el nivel de rendimiento de K2.7 Code, que sirve el mismo modelo a unos 180 tokens por segundo y hasta 260 en trabajos de contexto corto. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes y vídeo como contenido base64 y devuelve texto. El razonamiento es obligatorio y devuelve un error si se desactiva; tool_choice se limita a auto o none, y reasoning_content debe arrastrarse a lo largo de las llamadas a herramientas de varios pasos.
MiniMax-M2.7MiniMax$0.2880$1.1510por 1M tokensMiniMax M2.7 — modelo de texto para chat, programación, trabajo de oficina y tareas agénticas, con una ventana de contexto de 204,800 tokens y una salida de unos 60 tokens por segundo. Solo texto: la API acepta bloques de contenido de texto y de llamada a herramienta, pero no imágenes ni vídeo. Admite llamada a herramientas; el razonamiento está siempre activo y no puede desactivarse.
qwen3.6-plus阿里巴巴$0.4000$2.4000por 1M tokensAlibaba Qwen3.6-Plus — modelo equilibrado para razonamiento general y uso de herramientas, con una ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 65,536 tokens de salida y un presupuesto de 81,920 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto. Admite llamada a funciones, salidas estructuradas, búsqueda web, completado de prefijo y caché de contexto.
stepaudio-2.5-chatStepFun$1.5000$3.5000por 1M tokensStepFun StepAudio 2.5 Chat — modelo de comprensión del habla de extremo a extremo: recibe audio o texto y devuelve texto, leyendo señales paralingüísticas como la vacilación o la risa en la propia forma de onda y no en una transcripción. Admite una personalización amplia de personas, que abarca carácter, hábitos de habla y rango emocional. El audio se envía como partes de contenido input_audio en el endpoint chat completions. Para obtener respuestas habladas, utilice un modelo de TTS.
wan2.7-t2v阿里巴巴$0.092por segundoAlibaba Wan2.7 (T2V) — texto a vídeo con mejor interpretación actoral, emociones matizadas, acción intensa y cortes de cámara dramáticos. Produce MP4 H.264 en 720P o 1080P, de 2 a 15 segundos (5 s por defecto), en 16:9, 9:16, 1:1, 4:3 o 3:4, a partir de prompts de hasta 5,000 caracteres. El audio se incluye por defecto: sin audio_url, el modelo compone música de fondo o efectos de sonido acordes, o bien puede enviarse en su lugar una pista wav o mp3 de 2 a 30 segundos.
image-01MiniMax$0.004por solicitudMiniMax image-01 — generación de imágenes a partir de texto mediante el endpoint nativo image_generation de MiniMax. Se factura por imagen generada. El proveedor lo clasifica entre sus modelos heredados.
deepseek-v4-flashDeepSeek$0.1400$0.2800por 1M tokensDeepSeek V4 Flash — el nivel de DeepSeek V4 rápido y de alta concurrencia para chat, ayuda a la programación y bucles de agentes, con una ventana de contexto de 1M tokens y una salida máxima de 384K. Funciona tanto en modo de razonamiento (predeterminado) como sin razonamiento, y admite llamada a herramientas y salida en JSON. Texto de entrada, texto de salida.
doubao-seedance-2-0-fast-260128字节跳动$4.2000$4.2000por 1M tokensByteDance Seedance 2.0 Fast — generación de vídeo económica que conserva todo el conjunto de funciones de Seedance 2.0 pero limitada a 480p y 720p, 24 fps, de 4 a 15 segundos. Cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16. 480p 5 s ≈ $0.26.
happyhorse-1.1-t2v阿里巴巴$0.083por segundoAlibaba HappyHorse 1.1 (T2V) — texto a vídeo con mejor comprensión semántica, control de cámara y generación dinámica. Vídeo 720P/1080P fluido, detallado y físicamente coherente.
qwen3.8-max阿里巴巴$1.9900$5.9700por 1M tokensAlibaba Qwen3.8-Max — modelo MoE buque insignia de 2.4 billones de parámetros y el más capaz de la familia Qwen, con el proveedor señalando avances importantes en programación y productividad de oficina. Ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 131,072 tokens de salida y un presupuesto de 262,144 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto; admite llamada a funciones, salidas estructuradas y caché de contexto.
stepaudio-2.5-ttsStepFun$0.8500por 10 mil caracteresStepFun StepAudio 2.5 TTS — síntesis de voz contextual que traslada la comprensión a todo el proceso de generación en lugar de tratar la entonación como un posprocesado. La voz, la emoción y el ritmo se dirigen en lenguaje natural en dos niveles: un contexto global para la solicitud y un contexto en línea para pasajes concretos. La clonación de voz zero-shot necesita unos 3 segundos de audio de referencia y hereda todo el conjunto de controles contextuales. Acepta hasta 1000 caracteres por solicitud; genera wav, mp3, flac u opus.
agnes-video-v2.0Agnes AI$0.000por segundoAgnes AI Video V2.0 — modelo asíncrono de generación de vídeo para texto a vídeo, imagen a vídeo, fotogramas clave a partir de varias imágenes y movimiento cinematográfico, con niveles de salida normalizados de 480p, 720p y 1080p.
doubao-seedance-2-0-mini-260615字节跳动$1.4000$1.4000por 1M tokensByteDance Seedance 2.0 Mini — el nivel ligero y de bajo costo de la línea Seedance 2.0, limitado a 480p y 720p, 24 fps, de 4 a 15 segundos. Conserva el mismo conjunto de funciones documentado que el resto de la línea: texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16.
doubao-seedream-4-5-251128字节跳动$0.038por solicitudByteDance Doubao Seedream 4.5 — texto a imagen e imagen a imagen con fusión de varias imágenes, que produce una imagen única o un conjunto de imágenes relacionadas. El modo de imagen única acepta solo un prompt, una imagen de referencia, o de 2 a 14 imágenes de referencia; el modo de conjunto (sequential_image_generation=auto) devuelve hasta 15 imágenes a partir de texto, hasta 14 a partir de una sola imagen de referencia, o un conjunto a partir de 2 a 14 referencias siempre que la suma de entradas y salidas no supere 15. Admite salidas en 2K y 4K y devuelve JPEG por defecto, como URL o base64. La edición interactiva por coordenadas es exclusiva de Seedream 5.0 pro.
kling-3.0-turbo快手$0.560por solicitudKuaishou Kling 3.0 Turbo — el nivel económico de la línea Kling 3.0, que genera 720P o 1080P (720P por defecto) de 3 a 15 segundos (5 por defecto) en 16:9, 9:16 o 1:1, a partir de un prompt o de una imagen de primer fotograma. El audio nativo se incluye siempre y no tiene interruptor. Frente a kling-v3, renuncia al nivel 4K, al control del fotograma final y a la entrada de vídeo a cambio de velocidad y costo. 720p 5 s con audio ≈ $0.56.
MiniMax-M2.7-highspeedMiniMax$0.5750$2.3010por 1M tokensMiniMax M2.7 Highspeed — el mismo modelo M2.7 servido a unos 100 tokens por segundo para programación de baja latencia y flujos de trabajo de agentes, con una ventana de contexto de 204,800 tokens. Solo texto: la API acepta bloques de contenido de texto y de llamada a herramienta, pero no imágenes ni vídeo. Admite llamada a herramientas; el razonamiento está siempre activo y no puede desactivarse.
step-3.5-flash-2603StepFun$0.1000$0.3000por 1M tokensStepFun step-3.5-flash-2603 — instantánea de 256K de step-3.5-flash ajustada para agentes, optimizada para la eficiencia en tokens y un modo de operación de inferencia reducida. Su parámetro reasoning_effort solo acepta low y high, mientras que el modelo base acepta tres niveles, por lo que el código que envía medium debe adaptarse. Solo texto; admite llamada a herramientas, salida estructurada mediante JSON Schema, streaming y caché de prompts.
wan2.7-r2v阿里巴巴$0.092por segundoAlibaba Wan2.7 (R2V) — generación de vídeo a partir de referencias, con hasta 5 referencias mixtas de imagen/vídeo más una referencia de timbre de audio, y mayor coherencia de personajes, objetos de escena y escenarios.
glm-5.1智谱$1.1200$3.5200por 1M tokensZhipu GLM-5.1 — modelo fundacional buque insignia construido para el trabajo autónomo prolongado: el proveedor documenta una ejecución continua y sin supervisión sobre una misma tarea durante hasta 8 horas, abarcando planificación, ejecución, pruebas y optimización iterativa. Ventana de contexto de 200K, hasta 128K tokens de salida, texto de entrada y texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
mimo-v2.5Xiaomi$0.1400$0.2800por 1M tokensXiaomi MiMo-V2.5 — modelo nativamente multimodal completo, con contexto de 1M y salida máxima de 128K, que entiende imágenes, vídeo, audio y texto en un solo modelo. Admite razonamiento profundo, llamada a funciones, salida estructurada y búsqueda web, con capacidad de agente en todas las modalidades.
step-asrStepFun$0.1500por hora de audioStepFun step-asr — reconocimiento de voz de propósito general que cubre chino, inglés y dialectos chinos, para transcripción, actas de reuniones, revisión de calidad de llamadas y búsqueda por voz. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura.
step-audio-2StepFun$1.5500$10.8500por 1M tokensStepFun step-audio-2 — modelo de voz de extremo a extremo que consume el audio directamente en lugar de partir de una transcripción, de modo que el tono y la entonación llegan intactos a la comprensión del modelo. Se factura por token, con la tarifa de entrada de la línea StepAudio 2.5 y una tarifa de salida más alta. StepFun no publica una página de capacidades independiente para este modelo; consulte la documentación de audio de la plataforma para conocer el conjunto de parámetros vigente.
step-asr-1.1-stream$0.4000por hora de audio
step-image-edit-2StepFun$0.004por solicitudStepFun Step Image Edit 2 — modelo unificado de generación de imágenes a partir de texto y edición de imágenes con menos de 6B de parámetros, a la altura de los editores de pesos abiertos del rango de 12B a 20B. Completa una edición en uno o dos segundos y está pensado para retoque interactivo de baja latencia. Admite 256x256, 512x512, 768x768, 1024x1024, 1280x800 y 800x1280, además de prompts negativos y un modo de optimización del texto; una imagen por solicitud. Se sirve mediante el endpoint images compatible con OpenAI.
doubao-seedance-2-0-260128字节跳动$7.0000$7.0000por 1M tokensByteDance Seedance 2.0 — el buque insignia de la línea Seedance 2.0 y su único integrante que alcanza 1080p y 4K (profundidad de 10 bits) además de 480p y 720p, a 24 fps y de 4 a 15 segundos. Cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16, con el fotograma final disponible como imagen. Se factura según la resolución de salida.
doubao-seedream-5-0-260128字节跳动$0.034por solicitudByteDance Doubao Seedream 5.0-lite — texto a imagen e imagen a imagen, con una creación controlable más inteligente, recuperación en tiempo real y mayor coherencia del sujeto (resolución de 2K o superior).
MiniMax-H3MiniMax$0.080por segundoMiniMax H3 (Hailuo 3.0) — modelo de vídeo multimodal de propósito general, abierto y de nueva generación, que produce audio estéreo nativo en una sola pasada, en 768P o 2K, con una duración de 4 a 15 segundos (solo números enteros), a 24 fps. Cubre texto a vídeo, imagen a vídeo a partir de un primer fotograma y/o un último fotograma, y generación por referencia a partir de imágenes, vídeos o audio para el personaje, el movimiento, la cámara, el estilo, la voz o el ritmo de montaje; imagen a vídeo y generación por referencia no pueden combinarse en una misma solicitud. Acepta vídeo H.264/H.265, imágenes JPG, JPEG, PNG, WEBP, HEIC y HEIF, y audio WAV o MP3, con prompts de hasta 7,000 caracteres. $0.08/s en 768P y $0.13/s en 2K.
step-1o-audioStepFun$3.8500$9.2400por 1M tokensStepFun step-1o-audio — modelo de voz de extremo a extremo de la generación anterior, con soporte multilingüe y llamada a herramientas, limitado a 30 minutos por interacción. En gran medida sustituido por la línea StepAudio 2.5; se mantiene para las cargas de trabajo ya construidas sobre él.
step-tts-2StepFun$0.4000por 10 mil caracteresStepFun step-tts-2 — síntesis de voz de extremo a extremo basada en NTP y creada para reproducir los acentos con precisión. Habla chino, inglés, mezcla de chino e inglés y japonés, además de cantonés y sichuanés. La emoción y la entonación se dirigen mediante etiquetas en lenguaje natural, y la clonación de voz zero-shot requiere unos 10 segundos de audio de referencia, con los controles de emoción y estilo trasladándose a la voz clonada sin costo adicional. Genera wav, mp3, flac, opus o pcm.
agnes-image-2.1-flashAgnes AI$0.000por solicitudAgnes AI Image 2.1 Flash — modelo de generación y edición de imágenes centrado en el detalle para escenas de alta densidad de información, que cubre texto a imagen, imagen a imagen y composición con varias imágenes, con tamaños y relaciones de aspecto flexibles de 1K a 4K.
kimi-k2.7-codeMoonshot$0.7600$3.1570por 1M tokensMoonshot Kimi K2.7 Code — el modelo dedicado a programación de Kimi, que según las mediciones del proveedor mejora el cumplimiento de instrucciones y la programación de larga duración frente a K2.6, al tiempo que recorta el exceso de razonamiento en torno a un 30% de media. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes y vídeo como contenido base64 y devuelve texto. El razonamiento es obligatorio y devuelve un error si se desactiva; tool_choice se limita a auto o none, y reasoning_content debe arrastrarse a lo largo de las llamadas a herramientas de varios pasos.