Integración de imagen, audio, vídeo y recuperación

Estas capacidades usan la misma Base URL y clave bearer que el chat, pero cada una tiene su propio endpoint y payload. Los ID de modelo siguientes son ejemplos funcionales; consulte Consola → Modelos para ver el catálogo de modelos más reciente antes de pasar a producción.

Generación de imágenes

POST /v1/images/generations

Envíe un prompt en JSON. Lea el recurso generado desde data[0].url, o desde data[0].b64_json cuando el modelo seleccionado devuelva base64.

Parámetros clave: prompt y model son obligatorios. Use size para la resolución, n para el número de imágenes y response_format para url o b64_json. quality y style son específicos de cada modelo; los valores habituales incluyen standard, hd o auto.

curl · image
curl https://api.chinaapi.ai/v1/images/generations \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "doubao-seedream-4-5-251128",
    "prompt": "A cinematic skyline at blue hour",
    "size": "1024x1024",
    "response_format": "url",
    "n": 1
  }'

Generación de imágenes de Gemini

POST /v1/chat/completions

Los modelos de imagen de Gemini usan el formato de solicitud de OpenAI Chat Completions. Lea la imagen en Markdown generada desde choices[0].message.content; el payload de la imagen es una URL data:image/....

Parámetros clave: envíe el ID de modelo del catálogo, visible tras iniciar sesión, en model y el prompt de imagen en messages. No envíe este modelo a /v1/images/generations.

curl · Gemini image chat
curl https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<GEMINI_IMAGE_MODEL>",
    "messages": [
      {
        "role": "user",
        "content": "Generate a cinematic skyline at blue hour"
      }
    ],
    "stream": false
  }'

Voz a texto

POST /v1/audio/transcriptions

Suba el audio como multipart form data; no configure manualmente el encabezado Content-Type. El texto reconocido se devuelve en el campo text.

Parámetros clave: envíe model y file como campos multipart. Use response_format con json, text o verbose_json cuando el modelo seleccionado lo admita.

curl · transcription
curl https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "file=@speech.wav" \
  -F "response_format=json"

Texto a voz

POST /v1/audio/speech

El cuerpo de la respuesta es audio binario, así que guárdelo en un archivo. alloy selecciona la voz predeterminada del modelo; un modelo también puede publicar ID de voz propios del proveedor.

Parámetros clave: use input, model y voice. Elija una salida con response_format, como mp3 o wav; speed e instructions están disponibles cuando el modelo seleccionado lo admita.

curl · speech
curl https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "input": "Hello from ChinaAPI.",
    "voice": "alloy",
    "response_format": "mp3"
  }' \
  --output speech.mp3

Generación de vídeo

POST /v1/video/generations

La generación de vídeo es asíncrona. Envíe la solicitud una sola vez, guarde el task_id devuelto y luego consulte GET /v1/video/generations/{task_id} hasta que la tarea tenga éxito o falle. Crear una tarea puede consumir cuota.

Parámetros clave: prompt y model inician la tarea. Use duration, width, height, fps y n cuando estén disponibles. La resolución es el control de nitidez habitual. Coloque controles específicos del proveedor, como quality, quality_level, negative_prompt o ajustes de cámara, en metadata solo cuando estén indicados para ese modelo.

curl · video
curl https://api.chinaapi.ai/v1/video/generations \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "happyhorse-1.1-t2v",
    "prompt": "A paper boat crossing a moonlit lake",
    "duration": 5,
    "width": 1280,
    "height": 720
  }'

curl https://api.chinaapi.ai/v1/video/generations/$TASK_ID \
  -H "Authorization: Bearer $CHINAAPI_KEY"