การผสานรวมรูปภาพ เสียง วิดีโอ และการค้นคืน
ไม่พบรายการที่ตรงกัน ลองค้นด้วยชื่อโปรโตคอล ความสามารถ หรือพาธของเอนด์พอยต์
ความสามารถเหล่านี้ใช้ Base URL และคีย์ bearer เดียวกับการแชท แต่แต่ละอย่างมีเอนด์พอยต์และ payload ของตัวเอง model ID ด้านล่างเป็นตัวอย่างที่ใช้งานได้จริง โปรดตรวจสอบ คอนโซล → โมเดล เพื่อดูแคตตาล็อกโมเดลล่าสุดก่อนใช้งานจริง
การสร้างรูปภาพ
POST /v1/images/generations
ส่งพรอมป์ตในรูปแบบ JSON อ่านผลลัพธ์ที่สร้างได้จาก data[0].url หรือจาก data[0].b64_json เมื่อโมเดลที่เลือกส่งค่ากลับเป็น base64
พารามิเตอร์สำคัญ: ต้องระบุ prompt และ model ใช้ size สำหรับความละเอียด n สำหรับจำนวนรูปภาพ และ response_format สำหรับ url หรือ b64_json ส่วน quality และ style ขึ้นอยู่กับแต่ละโมเดล ค่าที่พบทั่วไป ได้แก่ standard, hd หรือ auto
curl https://api.chinaapi.ai/v1/images/generations \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "doubao-seedream-4-5-251128",
"prompt": "A cinematic skyline at blue hour",
"size": "1024x1024",
"response_format": "url",
"n": 1
}'
การสร้างรูปภาพแบบ Gemini
POST /v1/chat/completions
โมเดลรูปภาพของ Gemini ใช้รูปแบบคำขอแบบ OpenAI Chat Completions อ่านรูปภาพ Markdown ที่สร้างได้จาก choices[0].message.content โดย payload ของรูปภาพคือ URL แบบ data:image/...
พารามิเตอร์สำคัญ: ส่ง model ID ในแคตตาล็อกหลังเข้าสู่ระบบไว้ใน model และใส่พรอมป์ตรูปภาพใน messages อย่าส่งโมเดลนี้ไปยัง /v1/images/generations
curl https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "<GEMINI_IMAGE_MODEL>",
"messages": [
{
"role": "user",
"content": "Generate a cinematic skyline at blue hour"
}
],
"stream": false
}'
แปลงเสียงเป็นข้อความ
POST /v1/audio/transcriptions
อัปโหลดไฟล์เสียงแบบ multipart form data อย่าตั้งค่าส่วนหัว Content-Type ด้วยตนเอง ข้อความที่รู้จำได้จะถูกส่งกลับในฟิลด์ text
พารามิเตอร์สำคัญ: ส่ง model และ file เป็นฟิลด์แบบ multipart ใช้ response_format เป็น json, text หรือ verbose_json เมื่อโมเดลที่เลือกรองรับ
curl https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-F "model=qwen3-asr-flash" \
-F "file=@speech.wav" \
-F "response_format=json"
แปลงข้อความเป็นเสียง
POST /v1/audio/speech
เนื้อหาการตอบกลับเป็นไฟล์เสียงแบบไบนารี จึงควรเขียนลงไฟล์ alloy จะเลือกเสียงเริ่มต้นของโมเดล และบางโมเดลอาจมี ID เสียงเฉพาะของผู้ให้บริการให้ใช้ด้วย
พารามิเตอร์สำคัญ: ใช้ input, model และ voice เลือกผลลัพธ์ด้วย response_format เช่น mp3 หรือ wav ส่วน speed และ instructions ใช้ได้เมื่อโมเดลที่เลือกรองรับ
curl https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-tts",
"input": "Hello from ChinaAPI.",
"voice": "alloy",
"response_format": "mp3"
}' \
--output speech.mp3
การสร้างวิดีโอ
POST /v1/video/generations
การสร้างวิดีโอเป็นแบบอะซิงโครนัส ส่งคำขอเพียงครั้งเดียว บันทึก task_id ที่ได้รับ แล้ว poll GET /v1/video/generations/{task_id} จนกว่างานจะสำเร็จหรือล้มเหลว การสร้างงานอาจใช้โควตา
พารามิเตอร์สำคัญ: prompt และ model ใช้เริ่มงาน ใช้ duration, width, height, fps และ n เมื่อรองรับ ความละเอียดเป็นตัวควบคุมความคมชัดทั่วไป ใส่ตัวเลือกเฉพาะของผู้ให้บริการ เช่น quality, quality_level, negative_prompt หรือการตั้งค่ากล้อง ไว้ใน metadata เฉพาะเมื่อมีระบุไว้สำหรับโมเดลนั้นเท่านั้น
curl https://api.chinaapi.ai/v1/video/generations \
-H "Authorization: Bearer $CHINAAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "happyhorse-1.1-t2v",
"prompt": "A paper boat crossing a moonlit lake",
"duration": 5,
"width": 1280,
"height": 720
}'
curl https://api.chinaapi.ai/v1/video/generations/$TASK_ID \
-H "Authorization: Bearer $CHINAAPI_KEY"