Integración de imagen, audio, vídeo y recuperación
No hay coincidencias. Prueba con un protocolo, una capacidad o una ruta de endpoint.
Estas capacidades usan la misma Base URL y clave bearer que el chat, pero cada una tiene su propio endpoint y payload. Los ID de modelo siguientes son ejemplos funcionales; consulte Consola → Modelos para ver el catálogo de modelos más reciente antes de pasar a producción.
Generación de imágenes
POST /v1/images/generations
Envíe un prompt en JSON. Lea el recurso generado desde data[0].url, o desde data[0].b64_json cuando el modelo seleccionado devuelva base64.
Parámetros clave: prompt y model son obligatorios. Use size para la resolución, n para el número de imágenes y response_format para url o b64_json. quality y style son específicos de cada modelo; los valores habituales incluyen standard, hd o auto.
curl https://api.chinaapi.ai/v1/images/generations \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "doubao-seedream-4-5-251128",
"prompt": "A cinematic skyline at blue hour",
"size": "1024x1024",
"response_format": "url",
"n": 1
}'
Generación de imágenes de Gemini
POST /v1/chat/completions
Los modelos de imagen de Gemini usan el formato de solicitud de OpenAI Chat Completions. Lea la imagen en Markdown generada desde choices[0].message.content; el payload de la imagen es una URL data:image/....
Parámetros clave: envíe el ID de modelo del catálogo, visible tras iniciar sesión, en model y el prompt de imagen en messages. No envíe este modelo a /v1/images/generations.
curl https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "<GEMINI_IMAGE_MODEL>",
"messages": [
{
"role": "user",
"content": "Generate a cinematic skyline at blue hour"
}
],
"stream": false
}'
Voz a texto
POST /v1/audio/transcriptions
Suba el audio como multipart form data; no configure manualmente el encabezado Content-Type. El texto reconocido se devuelve en el campo text.
Parámetros clave: envíe model y file como campos multipart. Use response_format con json, text o verbose_json cuando el modelo seleccionado lo admita.
curl https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-F "model=qwen3-asr-flash" \
-F "file=@speech.wav" \
-F "response_format=json"
Texto a voz
POST /v1/audio/speech
El cuerpo de la respuesta es audio binario, así que guárdelo en un archivo. alloy selecciona la voz predeterminada del modelo; un modelo también puede publicar ID de voz propios del proveedor.
Parámetros clave: use input, model y voice. Elija una salida con response_format, como mp3 o wav; speed e instructions están disponibles cuando el modelo seleccionado lo admita.
curl https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-tts",
"input": "Hello from ChinaAPI.",
"voice": "alloy",
"response_format": "mp3"
}' \
--output speech.mp3
Generación de vídeo
POST /v1/video/generations
La generación de vídeo es asíncrona. Envíe la solicitud una sola vez, guarde el task_id devuelto y luego consulte GET /v1/video/generations/{task_id} hasta que la tarea tenga éxito o falle. Crear una tarea puede consumir cuota.
Parámetros clave: prompt y model inician la tarea. Use duration, width, height, fps y n cuando estén disponibles. La resolución es el control de nitidez habitual. Coloque controles específicos del proveedor, como quality, quality_level, negative_prompt o ajustes de cámara, en metadata solo cuando estén indicados para ese modelo.
curl https://api.chinaapi.ai/v1/video/generations \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "happyhorse-1.1-t2v",
"prompt": "A paper boat crossing a moonlit lake",
"duration": 5,
"width": 1280,
"height": 720
}'
curl https://api.chinaapi.ai/v1/video/generations/$TASK_ID \
-H "Authorization: Bearer $CHINAAPI_KEY"