การผสานรวมรูปภาพ เสียง วิดีโอ และการค้นคืน

ความสามารถเหล่านี้ใช้ Base URL และคีย์ bearer เดียวกับการแชท แต่แต่ละอย่างมีเอนด์พอยต์และ payload ของตัวเอง model ID ด้านล่างเป็นตัวอย่างที่ใช้งานได้จริง โปรดตรวจสอบ คอนโซล → โมเดล เพื่อดูแคตตาล็อกโมเดลล่าสุดก่อนใช้งานจริง

การสร้างรูปภาพ

POST /v1/images/generations

ส่งพรอมป์ตในรูปแบบ JSON อ่านผลลัพธ์ที่สร้างได้จาก data[0].url หรือจาก data[0].b64_json เมื่อโมเดลที่เลือกส่งค่ากลับเป็น base64

พารามิเตอร์สำคัญ: ต้องระบุ prompt และ model ใช้ size สำหรับความละเอียด n สำหรับจำนวนรูปภาพ และ response_format สำหรับ url หรือ b64_json ส่วน quality และ style ขึ้นอยู่กับแต่ละโมเดล ค่าที่พบทั่วไป ได้แก่ standard, hd หรือ auto

curl · image
curl https://api.chinaapi.ai/v1/images/generations \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "doubao-seedream-4-5-251128",
    "prompt": "A cinematic skyline at blue hour",
    "size": "1024x1024",
    "response_format": "url",
    "n": 1
  }'

การสร้างรูปภาพแบบ Gemini

POST /v1/chat/completions

โมเดลรูปภาพของ Gemini ใช้รูปแบบคำขอแบบ OpenAI Chat Completions อ่านรูปภาพ Markdown ที่สร้างได้จาก choices[0].message.content โดย payload ของรูปภาพคือ URL แบบ data:image/...

พารามิเตอร์สำคัญ: ส่ง model ID ในแคตตาล็อกหลังเข้าสู่ระบบไว้ใน model และใส่พรอมป์ตรูปภาพใน messages อย่าส่งโมเดลนี้ไปยัง /v1/images/generations

curl · Gemini image chat
curl https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<GEMINI_IMAGE_MODEL>",
    "messages": [
      {
        "role": "user",
        "content": "Generate a cinematic skyline at blue hour"
      }
    ],
    "stream": false
  }'

แปลงเสียงเป็นข้อความ

POST /v1/audio/transcriptions

อัปโหลดไฟล์เสียงแบบ multipart form data อย่าตั้งค่าส่วนหัว Content-Type ด้วยตนเอง ข้อความที่รู้จำได้จะถูกส่งกลับในฟิลด์ text

พารามิเตอร์สำคัญ: ส่ง model และ file เป็นฟิลด์แบบ multipart ใช้ response_format เป็น json, text หรือ verbose_json เมื่อโมเดลที่เลือกรองรับ

curl · transcription
curl https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "file=@speech.wav" \
  -F "response_format=json"

แปลงข้อความเป็นเสียง

POST /v1/audio/speech

เนื้อหาการตอบกลับเป็นไฟล์เสียงแบบไบนารี จึงควรเขียนลงไฟล์ alloy จะเลือกเสียงเริ่มต้นของโมเดล และบางโมเดลอาจมี ID เสียงเฉพาะของผู้ให้บริการให้ใช้ด้วย

พารามิเตอร์สำคัญ: ใช้ input, model และ voice เลือกผลลัพธ์ด้วย response_format เช่น mp3 หรือ wav ส่วน speed และ instructions ใช้ได้เมื่อโมเดลที่เลือกรองรับ

curl · speech
curl https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "input": "Hello from ChinaAPI.",
    "voice": "alloy",
    "response_format": "mp3"
  }' \
  --output speech.mp3

การสร้างวิดีโอ

POST /v1/video/generations

การสร้างวิดีโอเป็นแบบอะซิงโครนัส ส่งคำขอเพียงครั้งเดียว บันทึก task_id ที่ได้รับ แล้ว poll GET /v1/video/generations/{task_id} จนกว่างานจะสำเร็จหรือล้มเหลว การสร้างงานอาจใช้โควตา

พารามิเตอร์สำคัญ: prompt และ model ใช้เริ่มงาน ใช้ duration, width, height, fps และ n เมื่อรองรับ ความละเอียดเป็นตัวควบคุมความคมชัดทั่วไป ใส่ตัวเลือกเฉพาะของผู้ให้บริการ เช่น quality, quality_level, negative_prompt หรือการตั้งค่ากล้อง ไว้ใน metadata เฉพาะเมื่อมีระบุไว้สำหรับโมเดลนั้นเท่านั้น

curl · video
curl https://api.chinaapi.ai/v1/video/generations \
  -H "Authorization: Bearer $CHINAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "happyhorse-1.1-t2v",
    "prompt": "A paper boat crossing a moonlit lake",
    "duration": 5,
    "width": 1280,
    "height": 720
  }'

curl https://api.chinaapi.ai/v1/video/generations/$TASK_ID \
  -H "Authorization: Bearer $CHINAAPI_KEY"