Precios de los modelos de IA chinos

ChinaAPI ofrece DeepSeek, Qwen, GLM, Kimi y otros modelos de IA chinos a través de un gateway compatible con OpenAI en https://api.chinaapi.ai/v1. Todos los precios están en dólares estadounidenses, expresados en la unidad que utiliza el proveedor de origen. La misma lista está disponible en JSON en /api/pricing.

Precios de los modelos públicos
ModeloProveedorEntradaSalidaUnidadDescripción
deepseek-v4-flash-vision-expDeepSeekFacturación escalonada, consulte la página de preciosDeepSeek V4 Flash Vision (experimental) — the V4 Flash tier with image input, priced identically to deepseek-v4-flash on every face. Images are converted to tokens by their size and billed together with text at the input rate, so there is no separate image charge. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. The vendor labels this tier experimental; behaviour and availability may change without notice. Text and images in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
gemini-3.1-flash-imageGoogleFacturación escalonada, consulte la página de preciosGoogle Gemini 3.1 Flash Image (Nano Banana 2) — modelo estable de baja latencia para generación de imágenes de alta calidad y edición conversacional. Acepta texto, imágenes y PDF, admite thinking y fundamentación mediante búsqueda, y puede generar imágenes de 0.5K, 1K, 2K o 4K para flujos de producción de gran volumen.
gpt-4.1OpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT-4.1 — a non-reasoning model tuned for instruction following and long-context work, with a 1,047,576-token context window and up to 32,768 output tokens. It takes text and image input, and its output is priced below the reasoning tier at the same input price.
gemini-2.5-flashGoogleFacturación escalonada, consulte la página de preciosGoogle Gemini 2.5 Flash — a fast, low-cost multimodal model with a 1M-token context window. Accepts text, images, video and audio; audio input is billed at the vendor's separate audio rate.
glm-5.1智谱$1.4000$4.4000por 1M tokensZhipu GLM-5.1 — modelo fundacional buque insignia construido para el trabajo autónomo prolongado: el proveedor documenta una ejecución continua y sin supervisión sobre una misma tarea durante hasta 8 horas, abarcando planificación, ejecución, pruebas y optimización iterativa. Ventana de contexto de 200K, hasta 128K tokens de salida, texto de entrada y texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
image-01MiniMax$0.004por solicitudMiniMax image-01 — generación de imágenes a partir de texto mediante el endpoint nativo image_generation de MiniMax. Se factura por imagen generada. El proveedor lo clasifica entre sus modelos heredados.
MiniMax-Hailuo-02MiniMax$0.280por solicitudMiniMax Hailuo 02 — generación de vídeo económica que cubre tanto texto a vídeo como imagen a vídeo a 24 fps, con 512p y 768p disponibles en clips de 6 o 10 segundos y 1080p en 6 segundos. El nivel 512p es la puerta de entrada de la línea Hailuo.
MiniMax-M3MiniMaxFacturación escalonada, consulte la página de preciosMiniMax M3 — modelo de programación multimodal de vanguardia para razonamiento agéntico, uso de herramientas y ejecución estructurada de tareas, con una ventana de contexto de 1,000,000 tokens. Acepta texto, imágenes de hasta 10 MB y vídeo de hasta 50 MB incrustado o 512 MB a través de la API de Files, y devuelve texto. Admite llamada a herramientas, con el razonamiento opcional en lugar de siempre activo.
speech-2.8-hdMiniMax$1.0000por 10 mil caracteresMiniMax speech-2.8-hd — el nivel de alta definición de la línea de voz 2.8, orientado a una interpretación ultrarrealista con etiquetas de sonido, que cubre 40 idiomas y 7 emociones. El tono, la velocidad del habla, el volumen, la frecuencia de muestreo, la tasa de bits y el formato de salida se configuran por solicitud, y la síntesis de textos largos acepta hasta 1 millón de caracteres de forma asíncrona o 10,000 caracteres a través de la interfaz de streaming.
gemini-3.1-flash-liteGoogleFacturación escalonada, consulte la página de preciosGoogle Gemini 3.1 Flash-Lite — modelo multimodal de baja latencia y buena relación costo-beneficio para tareas ligeras de alta frecuencia, flujos de trabajo agénticos de gran volumen, traducción y extracción de datos estructurados. Acepta texto, imágenes, vídeo, audio y PDF, admite thinking y uso de herramientas, y ofrece un contexto de entrada de 1,048,576 tokens con hasta 65,536 tokens de salida.
happyhorse-1.1-i2v阿里巴巴$0.091por segundoAlibaba HappyHorse 1.1 (I2V) — imagen a vídeo con mejor textura, coherencia de identidad entre clips, fluidez de movimiento y sincronía entre audio e imagen. 720P/1080P.
kimi-k2.7-codeMoonshot$0.7600$3.1570por 1M tokensMoonshot Kimi K2.7 Code — el modelo dedicado a programación de Kimi, que según las mediciones del proveedor mejora el cumplimiento de instrucciones y la programación de larga duración frente a K2.6, al tiempo que recorta el exceso de razonamiento en torno a un 30% de media. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes y vídeo como contenido base64 y devuelve texto. El razonamiento es obligatorio y devuelve un error si se desactiva; tool_choice se limita a auto o none, y reasoning_content debe arrastrarse a lo largo de las llamadas a herramientas de varios pasos.
step-asr-1.1StepFun$0.3370por hora de audioStepFun step-asr-1.1 — versión actualizada del reconocedor de propósito general de la línea step-asr, que cubre chino, inglés y dialectos chinos. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura.
gpt-5.4OpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT-5.4 — a frontier model for complex professional work and coding, priced well below GPT-5.5. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 1,050,000-token context window, and up to 128,000 output tokens. Prompts above 272,000 input tokens are repriced at 2x input and 1.5x output for the whole session.
doubao-seedream-4-5-251128字节跳动$0.037por solicitudByteDance Doubao Seedream 4.5 — texto a imagen e imagen a imagen con fusión de varias imágenes, que produce una imagen única o un conjunto de imágenes relacionadas. El modo de imagen única acepta solo un prompt, una imagen de referencia, o de 2 a 14 imágenes de referencia; el modo de conjunto (sequential_image_generation=auto) devuelve hasta 15 imágenes a partir de texto, hasta 14 a partir de una sola imagen de referencia, o un conjunto a partir de 2 a 14 referencias siempre que la suma de entradas y salidas no supere 15. Admite salidas en 2K y 4K y devuelve JPEG por defecto, como URL o base64. La edición interactiva por coordenadas es exclusiva de Seedream 5.0 pro.
deepseek-v4-flash-legacyDeepSeek$0.1190$0.2370por 1M tokensDeepSeek V4 Flash (legacy tier) — a lower-priced route to the V4 Flash model family. Input and output tokens are cheaper than on deepseek-v4-flash, while cache reads are priced higher, so prompt-caching-heavy workloads are usually cheaper on deepseek-v4-flash and low-reuse workloads are cheaper here. Responses may come from an earlier V4 Flash build. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
doubao-seed-2-1-pro-260628字节跳动$0.8890$4.4440por 1M tokensByteDance Doubao Seed 2.1 Pro — modelo de agente buque insignia de Doubao para el trabajo en producción, que cubre razonamiento profundo, generación de texto, comprensión multimodal, llamada a herramientas y salida estructurada, para la que el proveedor recomienda el modo json_schema. Ventana de contexto de 256K con una entrada máxima de 256K, hasta 256K tokens de salida (4K por defecto) y un presupuesto de 256K para la cadena de razonamiento. Acepta texto, imagen y vídeo y devuelve texto; la comprensión de audio no figura para la línea 2.1. Admite caché de contexto implícita y explícita, incluidas las cachés de prefijo y de sesión.
MiniMax-M2.7MiniMax$0.3000$1.2000por 1M tokensMiniMax M2.7 — modelo de texto para chat, programación, trabajo de oficina y tareas agénticas, con una ventana de contexto de 204,800 tokens y una salida de unos 60 tokens por segundo. Solo texto: la API acepta bloques de contenido de texto y de llamada a herramienta, pero no imágenes ni vídeo. Admite llamada a herramientas; el razonamiento está siempre activo y no puede desactivarse.
MiniMax-M2.7-highspeedMiniMax$0.6000$2.4000por 1M tokensMiniMax M2.7 Highspeed — el mismo modelo M2.7 servido a unos 100 tokens por segundo para programación de baja latencia y flujos de trabajo de agentes, con una ventana de contexto de 204,800 tokens. Solo texto: la API acepta bloques de contenido de texto y de llamada a herramienta, pero no imágenes ni vídeo. Admite llamada a herramientas; el razonamiento está siempre activo y no puede desactivarse.
step-1o-audioStepFun$3.7070$8.8980por 1M tokensStepFun step-1o-audio — modelo de voz de extremo a extremo de la generación anterior, con soporte multilingüe y llamada a herramientas, limitado a 30 minutos por interacción. En gran medida sustituido por la línea StepAudio 2.5; se mantiene para las cargas de trabajo ya construidas sobre él.
wan2.7-videoedit阿里巴巴$0.080por segundoAlibaba Wan2.7 VideoEdit — edición de vídeo en lenguaje natural, local o global, sustitución de elementos mediante imagen de referencia y replicación de movimiento, efectos y cámara.
gpt-5.5OpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT-5.5 — modelo de razonamiento de vanguardia para programación compleja y trabajo profesional. Admite entrada de texto e imagen, llamada a funciones y herramientas integradas, una ventana de contexto de 1,050,000 tokens, hasta 128,000 tokens de salida y un nivel de razonamiento de none hasta xhigh.
hy3Tencent$0.1480$0.5930por 1M tokensTencent Hunyuan 3 (Hy3) — modelo MoE de 295B de parámetros (21B activos), contexto nativo de 256K y tres modos de razonamiento (fast / low / deep). Sólido en agentes de programación, comprensión de documentos largos, contexto en varios turnos y flujos de trabajo de agentes de varios pasos. Solo texto.
mimo-v2.5Xiaomi$0.1400$0.2800por 1M tokensXiaomi MiMo-V2.5 — modelo nativamente multimodal completo, con contexto de 1M y salida máxima de 128K, que entiende imágenes, vídeo, audio y texto en un solo modelo. Admite razonamiento profundo, llamada a funciones, salida estructurada y búsqueda web, con capacidad de agente en todas las modalidades.
step-tts-miniStepFun$0.1444por 10 mil caracteresStepFun step-tts-mini — el miembro económico y de baja latencia de la línea TTS de StepFun, que cubre los mismos idiomas que step-tts-2 (chino, inglés, mezcla de chino e inglés y japonés, además de cantonés y sichuanés) con un subconjunto de las voces integradas. Admite etiquetas de emoción y entonación en lenguaje natural, y clonación de voz zero-shot a partir de unos 10 segundos de audio de referencia. Genera wav, mp3, flac, opus o pcm.
claude-sonnet-4-5AnthropicFacturación escalonada, consulte la página de preciosAnthropic Claude Sonnet 4.5 — a pinned dated snapshot of the Sonnet 4.5 release, kept available for workloads that need byte-stable behaviour across runs. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens.
mimo-v2.5-ttsXiaomi$0.0000por 10 mil caracteresXiaomi MiMo v2.5 TTS — síntesis de voz expresiva con ocho voces integradas, cuatro en chino y cuatro en inglés (Mia, Chloe, Milo, Dean), que cubre chino e inglés además de los estilos dialectales del Noreste, de Sichuan, de Henan y del cantonés. La interpretación se dirige de dos formas: instrucciones de estilo en lenguaje natural y etiquetas de audio en línea para emociones básicas y compuestas, respiración, suspiros y ritmo, incluido un modo de canto exclusivo de este modelo dentro de la línea MiMo TTS. Devuelve wav mono o pcm16 a 24 kHz y admite streaming de baja latencia, que exige pcm16. Contexto de 8K y salida máxima de 8K.
MiniMax-Hailuo-2.3MiniMax$0.280por solicitudMiniMax Hailuo 2.3 — texto a vídeo e imagen a vídeo que el proveedor posiciona por su seguimiento de instrucciones, a 24 fps, con 768p disponible en clips de 6 o 10 segundos y 1080p en 6 segundos. 768p 6 s = $0.28.
qwen3-tts-flash阿里巴巴$0.1100por 10 mil caracteresAlibaba Qwen3-TTS-Flash — síntesis de voz de baja latencia con 17 voces integradas expresivas, que cubre chino, inglés, alemán, italiano, portugués, español, japonés, coreano, francés y ruso, además de un modo automático para textos que mezclan idiomas y salida en dialecto. Acepta hasta 512 tokens de texto por solicitud y admite síntesis con y sin streaming.
wan2.7-i2v阿里巴巴$0.080por segundoAlibaba Wan 2.7 Image-to-Video — cubre la generación a partir del primer fotograma, las transiciones entre el primero y el último, y la continuación de un clip existente. Produce 720P o 1080P (1080P por defecto) de 2 a 15 segundos, 5 s por defecto, a partir de prompts de hasta 5,000 caracteres (prompts negativos de hasta 500). Puede enviarse una pista mp3 o wav de 2 a 30 segundos como driving_audio; sin audio, el modelo genera música de fondo o efectos de sonido acordes, un audio más largo que el clip se recorta y uno más corto deja el final en silencio.
doubao-seedance-2-0-fast-260128字节跳动$4.2000$4.2000por 1M tokensByteDance Seedance 2.0 Fast — generación de vídeo económica que conserva todo el conjunto de funciones de Seedance 2.0 pero limitada a 480p y 720p, 24 fps, de 4 a 15 segundos. Cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16. 480p 5 s ≈ $0.26.
qwen3.7-plus阿里巴巴$0.3400$1.3600por 1M tokensAlibaba Qwen3.7-Plus — modelo de agente híbrido multimodal que percibe escenas del mundo real, lee pantallas y maneja interfaces gráficas, genera código a partir de referencias visuales y realiza navegación de extremo a extremo dentro de aplicaciones móviles. Ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 131,072 tokens de salida y un presupuesto de 262,144 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto; admite llamada a funciones, salidas estructuradas y caché de contexto.
deepseek-v4-proDeepSeekFacturación escalonada, consulte la página de preciosDeepSeek V4 Pro 0813 — the higher-capability DeepSeek V4 tier for coding, reasoning, and agentic work, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
gemini-3.5-flashGoogleFacturación escalonada, consulte la página de preciosGoogle Gemini 3.5 Flash — modelo multimodal estable optimizado para un rendimiento sostenido como agente, ciclos rápidos de programación, despliegue de subagentes y flujos de trabajo de varios pasos y larga duración. Acepta texto, imágenes, vídeo, audio y PDF, admite thinking y herramientas integradas, y ofrece un contexto de entrada de 1,048,576 tokens con hasta 65,536 tokens de salida.
wan2.7-image-pro阿里巴巴$0.064por solicitudAlibaba Wan 2.7 Image Pro — el nivel profesional de la línea de imagen Wan 2.7, que cubre texto a imagen, conjuntos secuenciales de imágenes, edición de imágenes y generación con varias imágenes de referencia, con un mejor seguimiento del prompt. El texto a imagen llega a 4K (4096x4096), con niveles de 1K y 2K y tamaños personalizados desde 768x768; los modos de edición y secuencial se limitan a 2K. Acepta hasta 9 imágenes de referencia (JPEG, JPG, PNG, BMP, WEBP; de 240 a 8,000 px por lado, 20 MB cada una), relaciones de aspecto de 1:8 a 8:1 y prompts de hasta 5,000 caracteres. Devuelve PNG.
claude-haiku-4-5AnthropicFacturación escalonada, consulte la página de preciosAnthropic Claude Haiku 4.5 — the fastest Claude model with near-frontier intelligence, built for high-volume, latency-sensitive work such as classification, extraction, and routing. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens.
happyhorse-1.1-r2v阿里巴巴$0.091por segundoAlibaba HappyHorse 1.1 (R2V) — generación de vídeo a partir de referencias, con hasta 9 imágenes de referencia, fuerte coherencia de sujeto, escena y estilo, y control de cámara. 720P/1080P.
kimi-k2.7-code-highspeedMoonshot$1.9000$8.0000por 1M tokensMoonshot Kimi K2.7 Code Highspeed — el nivel de rendimiento de K2.7 Code, que sirve el mismo modelo a unos 180 tokens por segundo y hasta 260 en trabajos de contexto corto. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes y vídeo como contenido base64 y devuelve texto. El razonamiento es obligatorio y devuelve un error si se desactiva; tool_choice se limita a auto o none, y reasoning_content debe arrastrarse a lo largo de las llamadas a herramientas de varios pasos.
qwen3.7-max阿里巴巴$1.5000$4.5000por 1M tokensAlibaba Qwen3.7-Max — buque insignia de código cerrado orientado a la programación, al trabajo de oficina y productividad, y a la ejecución autónoma de largo plazo, con una ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 131,072 tokens de salida y un presupuesto de 262,144 tokens para la cadena de razonamiento. Texto de entrada, texto de salida. Admite llamada a funciones, salidas estructuradas y caché de contexto.
stepaudio-2.5-chatStepFun$1.5000$3.5000por 1M tokensStepFun StepAudio 2.5 Chat — modelo de comprensión del habla de extremo a extremo: recibe audio o texto y devuelve texto, leyendo señales paralingüísticas como la vacilación o la risa en la propia forma de onda y no en una transcripción. Admite una personalización amplia de personas, que abarca carácter, hábitos de habla y rango emocional. El audio se envía como partes de contenido input_audio en el endpoint chat completions. Para obtener respuestas habladas, utilice un modelo de TTS.
wan2.7-r2v阿里巴巴$0.080por segundoAlibaba Wan2.7 (R2V) — generación de vídeo a partir de referencias, con hasta 5 referencias mixtas de imagen/vídeo más una referencia de timbre de audio, y mayor coherencia de personajes, objetos de escena y escenarios.
agnes-image-2.1-flashAgnes AI$0.000por solicitudAgnes AI Image 2.1 Flash — modelo de generación y edición de imágenes centrado en el detalle para escenas de alta densidad de información, que cubre texto a imagen, imagen a imagen y composición con varias imágenes, con tamaños y relaciones de aspecto flexibles de 1K a 4K.
gemini-3-pro-imageGoogleFacturación escalonada, consulte la página de preciosGoogle gemini-3-pro-image
claude-fable-5AnthropicFacturación escalonada, consulte la página de preciosAnthropic Claude Fable 5 — el modelo más capaz de Anthropic entre los de disponibilidad general, para trabajo del conocimiento y programación ambiciosos y de larga duración. Está construido para tareas agénticas de varios días, ingeniería de software compleja, investigación profunda, razonamiento sobre documentos e imágenes y autoverificación proactiva.
step-audio-r1.5StepFun$1.4930$15.6720por 1M tokensStepFun step-audio-r1.5 — modelo de voz de extremo a extremo de la misma familia que step-audio-2, con la misma tarifa de entrada y una salida que se factura un 50% más cara. StepFun no publica una página de capacidades independiente para este modelo; consulte la documentación de audio de la plataforma para conocer el conjunto de parámetros vigente.
agnes-video-v2.0Agnes AI$0.000por segundoAgnes AI Video V2.0 — modelo asíncrono de generación de vídeo para texto a vídeo, imagen a vídeo, fotogramas clave a partir de varias imágenes y movimiento cinematográfico, con niveles de salida normalizados de 480p, 720p y 1080p.
kimi-k2.6Moonshot$0.7600$3.1570por 1M tokensMoonshot Kimi K2.6 — modelo de propósito general para diálogo, generación de código, comprensión visual y tareas de agentes, con una escritura de código de larga duración y una ejecución autónoma más sólidas que en la generación anterior. Ventana de contexto de 256K, 32,768 tokens de salida por defecto. Acepta texto, imágenes (png, jpeg, webp, gif) y vídeo (mp4, mov, webm y otros) como contenido base64 y devuelve texto. El modo de razonamiento viene activado por defecto y puede desactivarse; la temperatura está fijada en 1.0 con razonamiento y en 0.6 sin él.
kling-v3快手$0.420por solicitudKuaishou Kling 3.0 — texto a vídeo e imagen a vídeo con audio nativo y mejor coherencia de los elementos. Los clips duran de 3 a 15 segundos (5 por defecto) en 16:9, 9:16 o 1:1, y el nivel se elige mediante mode: std para 720P, pro para 1080P y 4k para 4K nativo. El audio hay que activarlo con sound=on y viene desactivado por defecto; imagen a vídeo toma un primer fotograma con un fotograma final opcional. Desde $0.083/s (720p).
stepaudio-2.5-ttsStepFun$0.8500por 10 mil caracteresStepFun StepAudio 2.5 TTS — síntesis de voz contextual que traslada la comprensión a todo el proceso de generación en lugar de tratar la entonación como un posprocesado. La voz, la emoción y el ritmo se dirigen en lenguaje natural en dos niveles: un contexto global para la solicitud y un contexto en línea para pasajes concretos. La clonación de voz zero-shot necesita unos 3 segundos de audio de referencia y hereda todo el conjunto de controles contextuales. Acepta hasta 1000 caracteres por solicitud; genera wav, mp3, flac u opus.
glm-asr-2512智谱$0.1440por hora de audioZhipu GLM-ASR-2512 — modelo de reconocimiento de voz que declara una tasa de error de caracteres de 0.0717. Cubre el mandarín junto con el sichuanés, el cantonés, el min nan y el wu, los acentos del inglés estadounidense y británico, y decenas de idiomas más, entre ellos francés, alemán, japonés, coreano, español y árabe. Maneja el habla que mezcla idiomas, la jerga técnica y el registro coloquial, y acepta un diccionario personalizado para vocabulario especializado. El audio está limitado a 30 segundos y 25 MB por solicitud, con transcripción por lotes y en streaming.
gpt-5.6-lunaOpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT-5.6 Luna — el nivel más rápido y económico de GPT-5.6, optimizado para cargas de trabajo de gran volumen y sensibles al costo sin renunciar al razonamiento, la visión y el uso de herramientas. Admite entrada de texto e imagen, una ventana de contexto de 1,050,000 tokens y hasta 128,000 tokens de salida.
qwen3.6-flash阿里巴巴$0.2500$1.5000por 1M tokensAlibaba Qwen3.6-Flash — modelo rápido de visión y lenguaje que el proveedor destaca para la programación agéntica y para la inteligencia espacial, con avances notables en localización y detección de objetos. Ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 65,536 tokens de salida y un presupuesto de 131,072 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto. Admite llamada a funciones y caché de contexto.
qwen3.6-plus阿里巴巴$0.4000$2.4000por 1M tokensAlibaba Qwen3.6-Plus — modelo equilibrado para razonamiento general y uso de herramientas, con una ventana de contexto de 1,000,000 tokens (991,808 tokens de entrada como máximo, 983,616 en modo de razonamiento), hasta 65,536 tokens de salida y un presupuesto de 81,920 tokens para la cadena de razonamiento. Acepta texto, imagen y vídeo en la entrada y devuelve texto. Admite llamada a funciones, salidas estructuradas, búsqueda web, completado de prefijo y caché de contexto.
glm-5-turbo智谱$1.2000$4.0000por 1M tokensZhipu GLM-5-Turbo — la variante de GLM-5 orientada al rendimiento, optimizada para flujos de trabajo de agentes: invocación de herramientas y habilidades más estable a lo largo de tareas de varios pasos, mejor manejo de instrucciones largas y encadenadas, y ejecución de tareas programadas o de larga duración. Ventana de contexto de 200K, hasta 128K tokens de salida, texto de entrada y texto de salida. Admite modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
wan3.0-video阿里巴巴$0.089por segundoAlibaba Wan3.0 (Video) — an all-in-one video model that unifies text-to-video, image-to-video and reference-to-video behind a single endpoint. Generates H.264 MP4 at 480P, 720P or 1080P, up to 30 seconds, from a prompt and an optional first-frame image URL. Billed per second of generated video against the vendor's own ladder: 720P is the base rate, 480P is charged at half of it and 1080P at double. A request that does not name a resolution is produced at 1080P by the model and is charged at that tier. Reference video and reference audio inputs exist in the vendor's model but are not carried on this endpoint.
doubao-seedance-2-5-260628字节跳动$10.7000$10.7000por 1M tokensByteDance Seedance 2.5 — el modelo principal de la línea Seedance, que estira una sola generación hasta 4-30 segundos a 24 fps mientras limita la resolución a 480p y 720p. La generación multimodal por referencia llega a 1-30 imágenes, hasta 10 vídeos de referencia y hasta 10 clips de audio de referencia (30 segundos en total para cada categoría) y, a diferencia de la línea 2.0, una referencia de audio puede usarse por sí sola. También cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16.
claude-sonnet-4-6AnthropicFacturación escalonada, consulte la página de preciosAnthropic Claude Sonnet 4.6 — the balanced Sonnet generation, offering a 1,000,000-token context window at standard pricing with up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer, so the same text yields roughly 30% fewer tokens than on 4.7-and-later models at the same per-token rate.
doubao-seedance-2-0-260128字节跳动$7.0000$7.0000por 1M tokensByteDance Seedance 2.0 — el buque insignia de la línea Seedance 2.0 y su único integrante que alcanza 1080p y 4K (profundidad de 10 bits) además de 480p y 720p, a 24 fps y de 4 a 15 segundos. Cubre texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16, con el fotograma final disponible como imagen. Se factura según la resolución de salida.
stepaudio-2.5-asrStepFun$0.0220por hora de audioStepFun StepAudio 2.5 ASR — modelo de reconocimiento de voz de 4B de parámetros construido sobre Multi-Token Prediction, que transcribe cinco minutos de audio en alrededor de un segundo (RTF cercano a 0.0053). Optimizado para chino e inglés. Incluye normalización inversa del texto, identificación de hablantes y separación de dos canales para grabaciones de llamadas y reuniones. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura.
stepaudio-2.5-asr-streamStepFun$0.1800por hora de audioStepFun StepAudio 2.5 ASR — 4B-parameter speech recognition model built on Multi-Token Prediction, transcribing five minutes of audio in about one second (RTF around 0.0053). Optimized for Chinese and English. Includes inverse text normalization, speaker identification, and dual-channel separation for call and meeting recordings. Accepts ogg, mp3, and wav uploads; transcript output is not billed.
doubao-seedance-2-0-mini-260615字节跳动$1.4000$1.4000por 1M tokensByteDance Seedance 2.0 Mini — el nivel ligero y de bajo costo de la línea Seedance 2.0, limitado a 480p y 720p, 24 fps, de 4 a 15 segundos. Conserva el mismo conjunto de funciones documentado que el resto de la línea: texto a vídeo, imagen a vídeo desde el primer fotograma y desde el primero y el último, generación multimodal por referencia a partir de 1-9 imágenes y hasta 3 vídeos de referencia que sumen 15 segundos, edición de vídeo, extensión de vídeo, generación con audio y una herramienta de búsqueda web; una referencia de audio debe ir acompañada de una imagen o un vídeo. Devuelve MP4 en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16.
step-tts-2StepFun$0.4000por 10 mil caracteresStepFun step-tts-2 — síntesis de voz de extremo a extremo basada en NTP y creada para reproducir los acentos con precisión. Habla chino, inglés, mezcla de chino e inglés y japonés, además de cantonés y sichuanés. La emoción y la entonación se dirigen mediante etiquetas en lenguaje natural, y la clonación de voz zero-shot requiere unos 10 segundos de audio de referencia, con los controles de emoción y estilo trasladándose a la voz clonada sin costo adicional. Genera wav, mp3, flac, opus o pcm.
claude-opus-4-6AnthropicFacturación escalonada, consulte la página de preciosAnthropic Claude Opus 4.6 — the Opus generation for complex reasoning and agentic work, with a 1,000,000-token context window at standard pricing and up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer.
MiniMax-H3MiniMax$0.080por segundoMiniMax H3 (Hailuo 3.0) — modelo de vídeo multimodal de propósito general, abierto y de nueva generación, que produce audio estéreo nativo en una sola pasada, en 768P o 2K, con una duración de 4 a 15 segundos (solo números enteros), a 24 fps. Cubre texto a vídeo, imagen a vídeo a partir de un primer fotograma y/o un último fotograma, y generación por referencia a partir de imágenes, vídeos o audio para el personaje, el movimiento, la cámara, el estilo, la voz o el ritmo de montaje; imagen a vídeo y generación por referencia no pueden combinarse en una misma solicitud. Acepta vídeo H.264/H.265, imágenes JPG, JPEG, PNG, WEBP, HEIC y HEIF, y audio WAV o MP3, con prompts de hasta 7,000 caracteres. $0.08/s en 768P y $0.13/s en 2K.
step-1o-turbo-visionStepFun$0.3850$1.2330por 1M tokensStepFun step-1o-turbo-vision — comprensión de imágenes y vídeo con generación rápida de texto, contexto de 32K. Acepta texto, imagen y vídeo como entrada y devuelve solo texto. Es un modelo de visión de la generación anterior que se mantiene por compatibilidad; step-3.7-flash cubre las mismas modalidades de entrada con contexto de 256K y profundidad de razonamiento seleccionable. Mantenga las imágenes por debajo de 4096 píxeles en el lado más largo para un reconocimiento fiable.
step-asr-1.1-streamStepFun$0.3852por hora de audioStepFun step-asr-1.1 — the updated general-purpose recognizer in the step-asr line, covering Chinese, English, and Chinese dialects. Accepts ogg, mp3, and wav uploads; transcript output is not billed.
gpt-5.4-miniOpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT-5.4 mini — the small GPT-5.4 model for high-volume workloads, coding, computer use, and subagents. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 400,000-token context window with a 272,000-token maximum input, and up to 128,000 output tokens.
agnes-2.5-flashAgnes AI$0.0000por 1M tokensAgnes AI Agnes 2.5 Flash — modelo de agente multimodal rápido con ventana de contexto de entrada de 512K y límite de salida de referencia de 65.5K, compatible con chat, streaming, llamada a herramientas, programación, razonamiento, diálogo multiturno, comprensión visual y flujos de trabajo de agentes.
claude-opus-4-7AnthropicFacturación escalonada, consulte la página de preciosAnthropic Claude Opus 4.7 — modelo de razonamiento avanzado para ingeniería de software difícil y tareas agénticas complejas de ejecución prolongada. Pone el acento en el seguimiento riguroso de instrucciones, la autoverificación, el uso fiable de herramientas y la visión de alta resolución sobre interfaces, imágenes, documentos y flujos profesionales.
gemini-3.6-flashGoogleFacturación escalonada, consulte la página de preciosGoogle Gemini 3.6 Flash — a stable multimodal reasoning model that balances speed and intelligence for agentic and real-world tasks, with a 1,048,576-token input context and 65,536-token output limit. It accepts text, images, video, audio, and PDFs, and supports thinking, function calling, code execution, search grounding, structured output, and Computer Use (preview). Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity.
glm-5v-turbo智谱$1.2000$4.0000por 1M tokensZhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows.
gpt-4oOpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT-4o — the multimodal GPT-4 generation model, kept in the catalogue for drop-in compatibility with existing integrations that call it by name. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens.
gpt-4o-miniOpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT-4o mini — the small, low-cost GPT-4o variant for high-volume and latency-sensitive work. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens.
deepseek-v4-flashDeepSeekFacturación escalonada, consulte la página de preciosDeepSeek V4 Flash 0731 — the fast, high-concurrency DeepSeek V4 tier for chat, coding help, and agent loops, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
gemini-3.7-flashGoogleFacturación escalonada, consulte la página de preciosGoogle Gemini 3.7 Flash — the newest Flash-tier multimodal reasoning model, priced identically to 3.6 Flash while the vendor promotion runs. Accepts text, images, video, audio and PDFs; supports thinking, function calling, code execution, search grounding and structured output. Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity.
glm-5.2智谱$1.4000$4.4000por 1M tokensZhipu GLM-5.2 — modelo fundacional buque insignia especializado en el trabajo de agente de programación de larga duración, logrado con meses de entrenamiento dedicado y no solo con una ampliación del contexto, con una ventana de contexto de 1M tokens y hasta 128K tokens de salida. Texto de entrada, texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
gpt-5.6-solOpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT-5.6 Sol — modelo buque insignia de la línea GPT-5.6 para razonamiento de vanguardia, trabajo profesional complejo, programación, ciencia, ciberseguridad y flujos de trabajo agénticos de larga duración. Admite entrada de texto e imagen, herramientas integradas, una ventana de contexto de 1,050,000 tokens, hasta 128,000 tokens de salida y los ajustes de razonamiento más profundos de la familia.
mimo-v2.5-asrXiaomi$0.0740por hora de audioModelo de reconocimiento de voz de Xiaomi MiMo optimizado para chino e inglés y para dialectos chinos, capaz de manejar audio con ruido, captado a distancia y con varios hablantes, así como la transcripción de letras de canciones.
mimo-v2.5-tts-voicecloneXiaomi$0.0000por 10 mil caracteresModelo de clonación de voz de Xiaomi MiMo: envíe una muestra de audio de referencia como data URL en el campo voice (data:{mime};base64,...) y el modelo sintetiza el habla con esa voz, sin ninguna etapa de entrenamiento, anotación ni ajuste fino. Acepta MP3 (audio/mpeg) o WAV, con la cadena codificada en base64 limitada a 10 MB; Xiaomi no publica una duración mínima para el audio de referencia. Las instrucciones de estilo en lenguaje natural y las etiquetas de audio en línea se heredan de mimo-v2.5-tts, pero no hay streaming: la solicitud se ejecuta en modo de compatibilidad y solo devuelve el resultado una vez terminada la síntesis.
wan2.7-image阿里巴巴$0.030por solicitudAlibaba Wan2.7 Image — texto a imagen, edición de imágenes, generación con varias imágenes de referencia, edición interactiva, y buen trazado de texto y seguimiento de instrucciones.
claude-opus-4-8AnthropicFacturación escalonada, consulte la página de preciosAnthropic Claude Opus 4.8 — modelo de razonamiento de alta capacidad para programación, flujos de trabajo agénticos, análisis profesional y trabajo de ejecución prolongada. Frente a Opus 4.7 mejora la fiabilidad, el criterio, la eficiencia en el uso de herramientas, el uso de la computadora y el razonamiento multimodal sobre documentos, y admite una ventana de contexto de 1,000,000 tokens.
gpt-4.1-miniOpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT-4.1 mini — the small GPT-4.1 variant. Being non-reasoning, its prose stays more predictable than the reasoning tier at a comparable price, which suits writing and rewriting work. It takes text and image input, with a 1,047,576-token context window and up to 32,768 output tokens.
kling-v3-omni快手$0.420por solicitudKling 3.0 Omni — generación de vídeo a partir de varias imágenes de referencia. El precio publicado corresponde al nivel std (720p, 5 s, sin audio, sin vídeo de referencia). Las solicitudes que no fijan mode usan el nivel pro, predeterminado en el proveedor, y se facturan 1.33x, unos $0.56 por el mismo clip de 5 s; el 4k se factura 5x. Envíe mode=std para que se le cobre el precio publicado.
speech-2.8-turboMiniMax$0.6000por 10 mil caracteresMiniMax speech-2.8-turbo — el nivel de baja latencia de la línea de voz 2.8, que cambia la interpretación ultrarrealista del modelo HD por una síntesis más rápida y de flujo natural. Cubre los mismos 40 idiomas y 7 emociones, con tono, velocidad del habla, volumen, frecuencia de muestreo, tasa de bits y formato de salida configurables, y acepta hasta 1 millón de caracteres de forma asíncrona o 10,000 caracteres a través de la interfaz de streaming.
gpt-image-2OpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT Image 2 — a state-of-the-art image generation and editing model for fast, high-quality output. It takes text and image input, supports flexible image sizes and high-fidelity image inputs, and bills per token rather than per call: $5 text input, $1.25 cached text input, $8 image input, and $30 image output per 1M tokens.
kimi-k3Moonshot$3.0000$15.0000por 1M tokensMoonshot Kimi K3 — buque insignia de 2.8 billones de parámetros para programación de larga duración, trabajo del conocimiento de extremo a extremo y razonamiento profundo, con una ventana de contexto de 1M tokens y hasta 1,048,576 tokens de finalización (131,072 por defecto). Acepta texto, imágenes en base64 y vídeo, y devuelve texto. El razonamiento está siempre activo, con reasoning_effort seleccionable entre low, high o max (max por defecto); la temperatura está fijada en 1.0. Admite llamada a herramientas personalizadas y carga dinámica de herramientas.
kling-3.0-turbo快手$0.560por solicitudKuaishou Kling 3.0 Turbo — el nivel económico de la línea Kling 3.0, que genera 720P o 1080P (720P por defecto) de 3 a 15 segundos (5 por defecto) en 16:9, 9:16 o 1:1, a partir de un prompt o de una imagen de primer fotograma. El audio nativo se incluye siempre y no tiene interruptor. Frente a kling-v3, renuncia al nivel 4K, al control del fotograma final y a la entrada de vídeo a cambio de velocidad y costo. 720p 5 s con audio ≈ $0.56.
step-3.7-flashStepFun$0.2000$1.1500por 1M tokensStepFun step-3.7-flash — sparse MoE with 198B total and 11B active parameters, native 256K context, and native understanding of images and video alongside text. Reasoning depth is selectable per request through reasoning_effort (low / medium / high), and the model supports reliable multi-step tool calling, JSON Schema structured output, streaming, and prompt caching. Tuned for agent and coding workloads. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
doubao-seed-2-1-turbo-260628字节跳动$0.4440$2.2220por 1M tokensByteDance Doubao Seed 2.1 Turbo — la vía de baja latencia de la línea Seed 2.1, que comparte los límites del Pro: ventana de contexto de 256K con una entrada máxima de 256K, hasta 256K tokens de salida (4K por defecto) y un presupuesto de 256K para la cadena de razonamiento. Cubre razonamiento profundo, generación de texto, comprensión multimodal, llamada a herramientas y salida estructurada, aunque sin la recomendación de json_schema del Pro. Acepta texto, imagen y vídeo y devuelve texto; la comprensión de audio no figura para la línea 2.1. Admite caché de contexto implícita y explícita.
glm-5.3智谱$1.4000$4.4000por 1M tokensZhipu GLM-5.3 — flagship coding-and-agent model post-trained on the same base as GLM-5.2: a 50% gain on Zhipu's internal coding bench, open-source SOTA on Terminal-Bench 3.0 and Agents' Last Exam, and state-of-the-art CyberGym vulnerability-discovery results, with a 1M-token context window and up to 128K output tokens. Text in, text out. Supports multiple thinking modes, function calling, structured JSON output, streaming, context caching, and MCP tool integration.
gpt-5.2OpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT-5.2 — a general-purpose model from the GPT-5.2 generation, kept in the catalogue for drop-in compatibility with integrations that call it by name. It takes text and image input, with a 400,000-token context window and up to 128,000 output tokens.
happyhorse-1.1-t2v阿里巴巴$0.091por segundoAlibaba HappyHorse 1.1 (T2V) — texto a vídeo con mejor comprensión semántica, control de cámara y generación dinámica. Vídeo 720P/1080P fluido, detallado y físicamente coherente.
MiniMax-Hailuo-2.3-FastMiniMax$0.190por solicitudMiniMax Hailuo 2.3 Fast — el nivel de velocidad y costo de Hailuo 2.3, centrado en imagen a vídeo y en el realismo del movimiento físico, a 24 fps, con 768p disponible en clips de 6 o 10 segundos y 1080p en 6 segundos. 768p 6 s = $0.19.
qwen3-asr-flash阿里巴巴$0.1260por hora de audioAlibaba Qwen3-ASR-Flash — reconocimiento de voz construido sobre el modelo fundacional Qwen3, que determina por sí solo el idioma hablado y transcribe 11 idiomas; la línea Qwen3-ASR documenta el mandarín junto con el sichuanés, el min nan, el wu y el cantonés, además de varios acentos del inglés. Acepta aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma y wmv de hasta 5 minutos y 10 MB por solicitud; la entrada pcm debe estar en 16 kHz y los demás formatos se remuestrean a 16 kHz antes del reconocimiento.
claude-opus-5AnthropicFacturación escalonada, consulte la página de preciosAnthropic Claude Opus 5 — modelo de razonamiento profundo para programación agéntica compleja y trabajo empresarial, con mejoras notables en tareas de larga duración, revisión de código, flujos documentales, visión y coordinación entre varios agentes. Cuenta con una ventana de contexto de 1,000,000 tokens, admite hasta 128,000 tokens de salida y activa el thinking adaptativo de forma predeterminada.
gemini-2.5-flash-imageGoogleFacturación escalonada, consulte la página de preciosGoogle Gemini 2.5 Flash Image (Nano Banana) — a fast native image generation and editing model for creative workflows. It takes text and image input and returns images through the OpenAI-compatible chat completions endpoint, with a 65,536-token input limit and 32,768-token output limit.
qwen3.8-max阿里巴巴$1.9000$5.7000por 1M tokensAlibaba Qwen3.8-Max — 2.4-trillion-parameter MoE flagship and the most capable model in the Qwen family, with the vendor citing major gains in coding and office productivity. 1,000,000-token context window (991,808 max input, 983,616 in thinking mode), up to 131,072 output tokens, and a 262,144-token chain-of-thought budget. Accepts text input and returns text (image/video input is not available on the current serving route); supports function calling, structured outputs, and context caching.
step-asrStepFun$0.1444por hora de audioStepFun step-asr — reconocimiento de voz de propósito general que cubre chino, inglés y dialectos chinos, para transcripción, actas de reuniones, revisión de calidad de llamadas y búsqueda por voz. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura.
agnes-image-2.0-flashAgnes AI$0.000por solicitudAgnes AI Image 2.0 Flash — modelo rápido de generación y edición de imágenes para texto a imagen, imagen a imagen y composición con varias imágenes, cuyos resultados se entregan como URL o datos Base64.
mimo-v2.5-proXiaomi$0.4350$0.8700por 1M tokensXiaomi MiMo-V2.5-Pro — buque insignia de un billón de parámetros (42B activos) con contexto de 1M y salida máxima de 128K, ajustado para cargas de trabajo de agentes de alta intensidad. Admite razonamiento profundo, llamada a funciones, salida estructurada y búsqueda web. Solo generación de texto: a diferencia de mimo-v2.5, la lista de capacidades del proveedor no incluye la comprensión de todas las modalidades.
mimo-v2.5-tts-voicedesignXiaomi$0.0000por 10 mil caracteresModelo de diseño de voz de Xiaomi MiMo: describa en lenguaje natural la voz deseada mediante instructions y el modelo sintetiza el habla con esa voz diseñada.
step-3.5-flash-2603StepFun$0.1000$0.3000por 1M tokensStepFun step-3.5-flash-2603 — instantánea de 256K de step-3.5-flash ajustada para agentes, optimizada para la eficiencia en tokens y un modo de operación de inferencia reducida. Su parámetro reasoning_effort solo acepta low y high, mientras que el modelo base acepta tres niveles, por lo que el código que envía medium debe adaptarse. Solo texto; admite llamada a herramientas, salida estructurada mediante JSON Schema, streaming y caché de prompts.
doubao-seedream-5-0-260128字节跳动$0.033por solicitudByteDance Doubao Seedream 5.0-lite — texto a imagen e imagen a imagen, con una creación controlable más inteligente, recuperación en tiempo real y mayor coherencia del sujeto (resolución de 2K o superior).
glm-5智谱$1.0000$3.2000por 1M tokensZhipu GLM-5 — MoE de 744B parámetros con 40B activos, entrenado con 28.5T tokens y con DeepSeek Sparse Attention, con una ventana de contexto de 200K y hasta 128K tokens de salida. Texto de entrada, texto de salida. Admite varios modos de razonamiento, llamada a funciones, salida JSON estructurada, streaming, caché de contexto e integración de herramientas MCP.
LongCat-2.0Meituan$0.3000$1.2000por 1M tokensMeituan LongCat-2.0 — modelo MoE abierto de 1.6T de parámetros con contexto nativo de 1M, creado para programación agéntica y uso de herramientas de larga duración. Modelo de razonamiento solo de texto.
wan2.7-t2v阿里巴巴$0.080por segundoAlibaba Wan2.7 (T2V) — texto a vídeo con mejor interpretación actoral, emociones matizadas, acción intensa y cortes de cámara dramáticos. Produce MP4 H.264 en 720P o 1080P, de 2 a 15 segundos (5 s por defecto), en 16:9, 9:16, 1:1, 4:3 o 3:4, a partir de prompts de hasta 5,000 caracteres. El audio se incluye por defecto: sin audio_url, el modelo compone música de fondo o efectos de sonido acordes, o bien puede enviarse en su lugar una pista wav o mp3 de 2 a 30 segundos.
claude-sonnet-5AnthropicFacturación escalonada, consulte la página de preciosAnthropic Claude Sonnet 5 — modelo de producción que equilibra inteligencia de vanguardia y velocidad para programación, agentes y flujos de trabajo empresariales. Puede planificar, usar herramientas de navegador y terminal, y trabajar de forma autónoma en tareas de razonamiento, trabajo del conocimiento e ingeniería de software.
gemini-3.1-flash-lite-imageGoogleFacturación escalonada, consulte la página de preciosGoogle Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — modelo de latencia ultrabaja y buena relación costo-beneficio para generación de imágenes de gran volumen y ediciones rápidas en varios turnos. Acepta texto e imágenes, produce imágenes de 1K, admite thinking y edición conversacional, y está diseñado para aplicaciones interactivas de desarrolladores y de consumo.
stepaudio-2-asr-proStepFun$0.3370por hora de audioStepFun StepAudio 2 ASR Pro — modelo de reconocimiento de voz de 32B de parámetros, la opción que prioriza la precisión dentro de la línea ASR de StepFun, mientras que stepaudio-2.5-asr prioriza velocidad y costo. Acepta archivos ogg, mp3 y wav; la transcripción generada no se factura.
agnes-2.0-flashAgnes AI$0.0000por 1M tokensAgnes AI Agnes 2.0 Flash — modelo de agente multimodal rápido con ventana de contexto de entrada de 256K y límite de salida de referencia de 64K, compatible con chat, streaming, llamada a herramientas, programación, razonamiento, comprensión visual y flujos de trabajo de agentes.
gemini-2.5-proGoogleFacturación escalonada, consulte la página de preciosGoogle Gemini 2.5 Pro — the reasoning-tier model of the 2.5 family, with a 1M-token context window. Prompts above 200,000 tokens are repriced at the vendor's long-context rate for the whole request, matching Google's own rule.
glm-tts智谱$0.2963por 10 mil caracteresZhipu GLM-TTS — síntesis de voz construida sobre una arquitectura de generación en dos etapas con aprendizaje por refuerzo GRPO, que infiere la emoción y la entonación del texto circundante en lugar de exigir un marcado explícito. Incluye siete voces integradas (tongtong por defecto, xiaochen, chuichui, jam, kazi, douji, luodo) con velocidad y volumen ajustables, acepta hasta 1,024 caracteres por solicitud y transmite con una latencia de primer fotograma inferior a 400 ms. Devuelve wav o pcm a una frecuencia de muestreo recomendada de 24 kHz; el streaming es solo en pcm.
gpt-5.6-terraOpenAIFacturación escalonada, consulte la página de preciosOpenAI GPT-5.6 Terra — modelo GPT-5.6 equilibrado para el trabajo profesional cotidiano, que ofrece alta inteligencia y buen rendimiento como agente de programación a un costo menor que Sol. Admite entrada de texto e imagen, herramientas integradas, una ventana de contexto de 1,050,000 tokens y hasta 128,000 tokens de salida.
step-audio-2StepFun$1.4930$10.4480por 1M tokensStepFun step-audio-2 — modelo de voz de extremo a extremo que consume el audio directamente en lugar de partir de una transcripción, de modo que el tono y la entonación llegan intactos a la comprensión del modelo. Se factura por token, con la tarifa de entrada de la línea StepAudio 2.5 y una tarifa de salida más alta. StepFun no publica una página de capacidades independiente para este modelo; consulte la documentación de audio de la plataforma para conocer el conjunto de parámetros vigente.
step-image-edit-2StepFun$0.003por solicitudStepFun Step Image Edit 2 — modelo unificado de generación de imágenes a partir de texto y edición de imágenes con menos de 6B de parámetros, a la altura de los editores de pesos abiertos del rango de 12B a 20B. Completa una edición en uno o dos segundos y está pensado para retoque interactivo de baja latencia. Admite 256x256, 512x512, 768x768, 1024x1024, 1280x800 y 800x1280, además de prompts negativos y un modo de optimización del texto; una imagen por solicitud. Se sirve mediante el endpoint images compatible con OpenAI.
claude-opus-4-5AnthropicFacturación escalonada, consulte la página de preciosAnthropic Claude Opus 4.5 — a pinned dated snapshot of the Opus 4.5 release for workloads that need byte-stable behaviour. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens.
step-3.5-flashStepFun$0.1000$0.3000por 1M tokensStepFun step-3.5-flash — modelo de razonamiento solo de texto con contexto de 256K, orientado a lógica, matemáticas, ingeniería de software e investigación profunda, donde la calidad del razonamiento debe ir acompañada de una ejecución rápida y fiable. La profundidad del razonamiento se elige por solicitud mediante reasoning_effort (low / medium / high). Admite llamada a herramientas, salida estructurada mediante JSON Schema, streaming y caché de prompts. Para entradas de imagen o vídeo, utilice step-3.7-flash.