ราคาโมเดล AI จีน
ChinaAPI ให้บริการ DeepSeek, Qwen, GLM, Kimi และโมเดล AI จีนอื่น ๆ ผ่านเกตเวย์ที่เข้ากันได้กับ OpenAI ที่ https://api.chinaapi.ai/v1 ราคาทั้งหมดเป็นสกุลดอลลาร์สหรัฐ และแสดงตามหน่วยที่ผู้ให้บริการต้นทางกำหนด รายการเดียวกันนี้มีในรูปแบบ JSON ที่ /api/pricing
| โมเดล | ผู้ให้บริการ | อินพุต | เอาต์พุต | หน่วย | คำอธิบาย |
|---|---|---|---|---|---|
| agnes-image-2.0-flash | Agnes AI | $0.000 | ต่อคำขอ | Agnes AI Image 2.0 Flash — โมเดลสร้างและแก้ไขภาพที่รวดเร็ว รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ โดยรับผลลัพธ์ได้ทั้งในรูปแบบ URL หรือข้อมูล Base64 | |
| kling-3.0-turbo | 快手 | $0.560 | ต่อคำขอ | Kuaishou Kling 3.0 Turbo — ระดับคุ้มราคาของตระกูล Kling 3.0 สร้างวิดีโอ 720P หรือ 1080P (ค่าเริ่มต้น 720P) ความยาว 3-15 วินาที (ค่าเริ่มต้น 5) ในอัตราส่วน 16:9, 9:16 หรือ 1:1 จากพรอมต์หรือภาพเฟรมแรก เสียงในตัวมาพร้อมเสมอและไม่มีสวิตช์เปิดปิด เมื่อเทียบกับ kling-v3 รุ่นนี้ตัดระดับ 4K การควบคุมเฟรมสุดท้าย และการรับวิดีโอเป็นอินพุตออกไป เพื่อแลกกับความเร็วและต้นทุน 720p 5 วินาทีพร้อมเสียง ≈ $0.56 | |
| hy3 | Tencent | $0.1540 | $0.6150 | ต่อ 1M tokens | Tencent Hunyuan 3 (Hy3) — โมเดล MoE ขนาด 295B พารามิเตอร์ (ทำงานจริง 21B) บริบทดั้งเดิม 256K และโหมดการคิดสามระดับ (fast / low / deep) โดดเด่นด้านเอเจนต์เขียนโค้ด การเข้าใจเอกสารยาว การรักษาบริบทหลายรอบ และเวิร์กโฟลว์เอเจนต์หลายขั้นตอน รองรับข้อความเท่านั้น |
| kimi-k2.6 | Moonshot | $0.7600 | $3.1570 | ต่อ 1M tokens | Moonshot Kimi K2.6 — โมเดลอเนกประสงค์สำหรับการสนทนา การสร้างโค้ด การเข้าใจภาพ และงานเอเจนต์ โดยเขียนโค้ดระยะยาวและทำงานได้ด้วยตนเองดีกว่ารุ่นก่อนหน้า หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ (png, jpeg, webp, gif) และวิดีโอ (mp4, mov, webm และอื่น ๆ) ในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ โหมดการคิดเปิดไว้ตามค่าเริ่มต้นและปิดได้ ส่วน temperature ถูกตรึงไว้ที่ 1.0 เมื่อเปิดการคิด และ 0.6 เมื่อปิด |
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | ต่อ 1M tokens | Meituan LongCat-2.0 — โมเดล MoE แบบเปิดขนาด 1.6T พารามิเตอร์ พร้อมบริบทดั้งเดิม 1M สร้างมาเพื่อการเขียนโค้ดเชิงเอเจนต์และการใช้เครื่องมือระยะยาว เป็นโมเดลการให้เหตุผลที่รองรับข้อความเท่านั้น |
| step-audio-2 | StepFun | $1.5500 | $10.8500 | ต่อ 1M tokens | StepFun step-audio-2 — โมเดลเสียงพูดแบบครบวงจรที่รับเสียงเข้าโดยตรงแทนการทำงานจากข้อความถอดเสียง น้ำเสียงและลีลาการพูดจึงคงอยู่ถึงขั้นการทำความเข้าใจของโมเดล คิดค่าบริการต่อโทเค็น โดยใช้อัตราอินพุตเดียวกับตระกูล StepAudio 2.5 แต่มีอัตราเอาต์พุตสูงกว่า StepFun ไม่ได้เผยแพร่หน้าความสามารถแยกสำหรับโมเดลนี้ กรุณาดูเอกสารด้านเสียงของแพลตฟอร์มเพื่อทราบชุดพารามิเตอร์ปัจจุบัน |
| step-tts-mini | StepFun | $0.1500 | ต่อ 1 หมื่นอักขระ | StepFun step-tts-mini — สมาชิกที่คุ้มค่าและความหน่วงต่ำในตระกูล TTS ของ StepFun ครอบคลุมภาษาเดียวกับ step-tts-2 (จีน อังกฤษ จีนผสมอังกฤษ และญี่ปุ่น รวมถึงกวางตุ้งและเสฉวน) โดยมีเสียงในตัวให้เลือกบางส่วน รองรับป้ายกำกับอารมณ์และลีลาการพูดเป็นภาษาธรรมชาติ และการโคลนเสียงแบบ zero-shot จากเสียงอ้างอิงราว 10 วินาที เอาต์พุตเป็น wav, mp3, flac, opus หรือ pcm | |
| stepaudio-2.5-asr | StepFun | $0.0220 | ต่อชั่วโมงเสียง | StepFun StepAudio 2.5 ASR — โมเดลรู้จำเสียงพูดขนาด 4B พารามิเตอร์ที่สร้างบน Multi-Token Prediction ถอดเสียงห้านาทีได้ในเวลาราวหนึ่งวินาที (RTF ประมาณ 0.0053) ปรับให้เหมาะกับภาษาจีนและอังกฤษ มาพร้อมการแปลงข้อความย้อนกลับให้เป็นรูปมาตรฐาน การระบุตัวผู้พูด และการแยกสองช่องสัญญาณสำหรับบันทึกการโทรและการประชุม รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ | |
| stepaudio-2.5-tts | StepFun | $0.8500 | ต่อ 1 หมื่นอักขระ | StepFun StepAudio 2.5 TTS — การแปลงข้อความเป็นเสียงพูดที่คำนึงถึงบริบท โดยส่งความเข้าใจไปตลอดทั้งไปป์ไลน์การสร้างแทนที่จะมองลีลาการพูดเป็นงานหลังการประมวลผล กำกับเสียง อารมณ์ และจังหวะด้วยภาษาธรรมชาติได้สองระดับ คือบริบทระดับทั้งคำขอและบริบทแบบอินไลน์สำหรับแต่ละช่วงข้อความ การโคลนเสียงแบบ zero-shot ใช้เสียงอ้างอิงราว 3 วินาที และสืบทอดชุดการควบคุมตามบริบททั้งหมด รับได้สูงสุด 1000 อักขระต่อคำขอ เอาต์พุตเป็น wav, mp3, flac หรือ opus | |
| agnes-2.5-flash | Agnes AI | $0.0000 | ต่อ 1M tokens | Agnes AI Agnes 2.5 Flash — โมเดลเอเจนต์มัลติโหมดความเร็วสูง พร้อมบริบทอินพุต 512K และขีดจำกัดเอาต์พุตอ้างอิง 65.5K รองรับการแชท สตรีมมิง การเรียกใช้เครื่องมือ การเขียนโค้ด การให้เหตุผล บทสนทนาหลายรอบ การเข้าใจภาพ และเวิร์กโฟลว์เอเจนต์ | |
| glm-5 | 智谱 | $1.0000 | $3.2000 | ต่อ 1M tokens | Zhipu GLM-5 — โมเดล MoE ขนาด 744B พารามิเตอร์ โดยทำงานจริง 40B ฝึกด้วยข้อมูล 28.5T โทเค็น และใช้ DeepSeek Sparse Attention พร้อมหน้าต่างบริบท 200K และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| mimo-v2.5-tts | Xiaomi | $0.0000 | ต่อ 1 หมื่นอักขระ | Xiaomi MiMo v2.5 TTS — การแปลงข้อความเป็นเสียงพูดที่มีอารมณ์ พร้อมเสียงในตัวแปดเสียง เป็นภาษาจีนสี่เสียงและภาษาอังกฤษสี่เสียง (Mia, Chloe, Milo, Dean) ครอบคลุมภาษาจีนและอังกฤษ รวมถึงสไตล์ภาษาถิ่นตงเป่ย เสฉวน เหอหนาน และกวางตุ้ง กำกับลีลาการพูดได้สองทาง คือคำสั่งกำหนดสไตล์ด้วยภาษาธรรมชาติ และแท็กเสียงแบบอินไลน์สำหรับอารมณ์พื้นฐานและอารมณ์ผสม การหายใจ การถอนหายใจ และจังหวะ รวมถึงโหมดร้องเพลงที่มีเฉพาะโมเดลนี้ในตระกูล MiMo TTS ผลลัพธ์เป็น wav โมโนหรือ pcm16 ที่ 24 kHz และรองรับการสตรีมความหน่วงต่ำ ซึ่งต้องใช้ pcm16 บริบท 8K และเอาต์พุตสูงสุด 8K | |
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | ต่อ 1M tokens | StepFun step-3.5-flash-2603 — สแนปช็อต 256K ของ step-3.5-flash ที่ปรับจูนสำหรับงานเอเจนต์ เน้นประสิทธิภาพด้านโทเค็นและโหมดทำงานที่ใช้การอนุมานต่ำ พารามิเตอร์ reasoning_effort รับเฉพาะ low และ high ต่างจากโมเดลพื้นฐานที่รับสามระดับ โค้ดที่ส่ง medium จึงต้องปรับแก้ รองรับข้อความเท่านั้น พร้อมการเรียกใช้เครื่องมือ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ |
| step-asr | StepFun | $0.1500 | ต่อชั่วโมงเสียง | StepFun step-asr — การรู้จำเสียงพูดอเนกประสงค์ ครอบคลุมภาษาจีน อังกฤษ และภาษาถิ่นจีน ใช้สำหรับการถอดเสียง การทำรายงานการประชุม การตรวจสอบคุณภาพสายสนทนา และการค้นหาด้วยเสียง รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ | |
| step-asr-1.1-stream | $0.4000 | ต่อชั่วโมงเสียง | |||
| doubao-seedance-2-0-mini-260615 | 字节跳动 | $3.5000 | $3.5000 | ต่อ 1M tokens | ByteDance Seedance 2.0 Mini — ระดับที่เบาและประหยัดงบประมาณของตระกูล Seedance 2.0 จำกัดที่ 480p และ 720p, 24 fps, 4-15 วินาที มาพร้อมชุดความสามารถตามเอกสารเดียวกับรุ่นอื่นในตระกูล ได้แก่ ข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 |
| glm-5.2 | 智谱 | $1.1200 | $3.5200 | ต่อ 1M tokens | Zhipu GLM-5.2 — โมเดลพื้นฐานเรือธงที่ออกแบบมาเฉพาะสำหรับงานเอเจนต์เขียนโค้ดระยะยาว ผ่านการฝึกเฉพาะทางนานหลายเดือน ไม่ใช่เพียงการขยายบริบท พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| image-01 | MiniMax | $0.004 | ต่อคำขอ | MiniMax image-01 — สร้างภาพจากข้อความผ่านเอนด์พอยต์ image_generation ของ MiniMax เอง คิดค่าบริการต่อภาพที่สร้าง ผู้ให้บริการจัดโมเดลนี้ไว้ในกลุ่มโมเดลรุ่นเก่า | |
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | ต่อ 1M tokens | Xiaomi MiMo-V2.5-Pro — โมเดลเรือธงระดับล้านล้านพารามิเตอร์ (ทำงานจริง 42B) พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K ปรับจูนมาสำหรับงานเอเจนต์ที่ใช้งานหนัก รองรับการคิดเชิงลึก การเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการค้นหาเว็บ สร้างได้เฉพาะข้อความ ต่างจาก mimo-v2.5 ตรงที่รายการความสามารถของผู้ให้บริการไม่ได้ระบุการเข้าใจครบทุกโหมด |
| MiniMax-M2.7 | MiniMax | $0.2880 | $1.1510 | ต่อ 1M tokens | MiniMax M2.7 — โมเดลข้อความสำหรับการแชท การเขียนโค้ด งานสำนักงาน และงานเอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น และเอาต์พุตที่ความเร็วราว 60 โทเค็นต่อวินาที รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ รองรับการเรียกใช้เครื่องมือ ส่วนการคิดเปิดอยู่เสมอและปิดไม่ได้ |
| doubao-seedance-2-0-260128 | 字节跳动 | $7.0000 | $7.0000 | ต่อ 1M tokens | ByteDance Seedance 2.0 — เรือธงของตระกูล Seedance 2.0 และเป็นรุ่นเดียวในตระกูลที่ไปถึง 1080p และ 4K (ความลึกสี 10 บิต) เพิ่มเติมจาก 480p และ 720p ที่ 24 fps และ 4-15 วินาที ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 และดึงเฟรมปิดท้ายออกมาเป็นภาพนิ่งได้ คิดค่าบริการตามความละเอียดของเอาต์พุต |
| qwen3-asr-flash | 阿里巴巴 | $0.1235 | ต่อชั่วโมงเสียง | Alibaba Qwen3-ASR-Flash — การรู้จำเสียงพูดที่สร้างบนโมเดลพื้นฐาน Qwen3 ซึ่งระบุภาษาที่กำลังพูดโดยอัตโนมัติและถอดเสียงได้ 11 ภาษา โดยตระกูล Qwen3-ASR ระบุภาษาจีนกลางไว้ควบคู่กับภาษาเสฉวน หมิ่นหนาน อู๋ และกวางตุ้ง รวมถึงสำเนียงภาษาอังกฤษหลายแบบ โมเดลรับไฟล์ aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma และ wmv ยาวไม่เกิน 5 นาทีและไม่เกิน 10 MB ต่อคำขอ อินพุต pcm ต้องเป็น 16 kHz ส่วนรูปแบบอื่นจะถูกสุ่มสัญญาณใหม่เป็น 16 kHz ก่อนการรู้จำ | |
| qwen3.6-flash | 阿里巴巴 | $0.1850 | $1.1080 | ต่อ 1M tokens | Alibaba Qwen3.6-Flash — โมเดลภาษาเชิงภาพที่ทำงานเร็ว ซึ่งผู้ให้บริการชูจุดเด่นด้านการเขียนโค้ดเชิงเอเจนต์และปัญญาเชิงพื้นที่ พร้อมการพัฒนาที่ชัดเจนในการระบุตำแหน่งและตรวจจับวัตถุ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 65,536 โทเค็น และงบประมาณห่วงโซ่ความคิด 131,072 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชันและการแคชบริบท |
| step-tts-2 | StepFun | $0.4000 | ต่อ 1 หมื่นอักขระ | StepFun step-tts-2 — การสังเคราะห์เสียงพูดแบบครบวงจรบนพื้นฐาน NTP ที่สร้างมาเพื่อจำลองสำเนียงได้อย่างแม่นยำ พูดภาษาจีน อังกฤษ จีนผสมอังกฤษ และญี่ปุ่น รวมถึงกวางตุ้งและเสฉวน กำกับอารมณ์และลีลาการพูดผ่านป้ายกำกับภาษาธรรมชาติ ส่วนการโคลนเสียงแบบ zero-shot ใช้เสียงอ้างอิงราว 10 วินาที โดยการควบคุมอารมณ์และสไตล์ยังส่งต่อไปยังเสียงที่โคลนได้โดยไม่มีค่าใช้จ่ายเพิ่ม เอาต์พุตเป็น wav, mp3, flac, opus หรือ pcm | |
| stepaudio-2.5-asr-stream | $0.1800 | ต่อชั่วโมงเสียง | |||
| wan2.7-t2v | 阿里巴巴 | $0.092 | ต่อวินาที | Alibaba Wan2.7 (T2V) — ข้อความเป็นวิดีโอ พร้อมการแสดงอารมณ์ที่ดีขึ้น อารมณ์ที่ละเอียดอ่อน แอ็กชันที่เข้มข้น และการตัดภาพที่ดราม่า สร้างไฟล์ MP4 แบบ H.264 ที่ 720P หรือ 1080P ความยาว 2-15 วินาที (ค่าเริ่มต้น 5 วินาที) ในอัตราส่วน 16:9, 9:16, 1:1, 4:3 หรือ 3:4 จากพรอมต์ยาวได้ถึง 5,000 อักขระ เสียงถูกใส่มาให้ตามค่าเริ่มต้น หากไม่ระบุ audio_url โมเดลจะแต่งดนตรีประกอบหรือเอฟเฟกต์เสียงที่เข้ากันให้เอง หรือจะส่งไฟล์ wav หรือ mp3 ความยาว 2-30 วินาทีมาแทนก็ได้ | |
| agnes-video-v2.0 | Agnes AI | $0.000 | ต่อวินาที | Agnes AI Video V2.0 — โมเดลสร้างวิดีโอแบบอะซิงโครนัส รองรับข้อความเป็นวิดีโอ ภาพเป็นวิดีโอ คีย์เฟรมจากหลายภาพ และการเคลื่อนไหวแบบภาพยนตร์ พร้อมระดับเอาต์พุตมาตรฐาน 480p, 720p และ 1080p | |
| glm-5.1 | 智谱 | $1.1200 | $3.5200 | ต่อ 1M tokens | Zhipu GLM-5.1 — โมเดลพื้นฐานเรือธงที่สร้างมาเพื่อการทำงานอัตโนมัติต่อเนื่องยาวนาน โดยผู้ให้บริการระบุว่าสามารถทำงานเดียวต่อเนื่องโดยไม่ต้องมีคนดูแลได้นานถึง 8 ชั่วโมง ครอบคลุมทั้งการวางแผน การลงมือทำ การทดสอบ และการปรับปรุงซ้ำ หน้าต่างบริบท 200K เอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้าและตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| happyhorse-1.1-t2v | 阿里巴巴 | $0.083 | ต่อวินาที | Alibaba HappyHorse 1.1 (T2V) — ข้อความเป็นวิดีโอ พร้อมการเข้าใจความหมาย การควบคุมมุมกล้อง และการสร้างภาพเคลื่อนไหวที่ดีขึ้น ให้วิดีโอ 720P/1080P ที่ลื่นไหล มีรายละเอียด และสมจริงตามหลักฟิสิกส์ | |
| kimi-k3 | Moonshot | $2.7400 | $13.6990 | ต่อ 1M tokens | Moonshot Kimi K3 — โมเดลเรือธงขนาด 2.8 ล้านล้านพารามิเตอร์ สำหรับการเขียนโค้ดระยะยาว งานความรู้แบบครบวงจร และการให้เหตุผลเชิงลึก พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 1,048,576 โทเค็น (ค่าเริ่มต้น 131,072) โมเดลรับข้อความ ภาพแบบ base64 และวิดีโอ แล้วตอบกลับเป็นข้อความ การคิดเปิดอยู่เสมอ โดยเลือก reasoning_effort ได้เป็น low, high หรือ max (ค่าเริ่มต้นคือ max) และ temperature ถูกตรึงไว้ที่ 1.0 รองรับการเรียกใช้เครื่องมือที่กำหนดเองและการโหลดเครื่องมือแบบไดนามิก |
| kling-v3 | 快手 | $0.420 | ต่อคำขอ | Kuaishou Kling 3.0 — ข้อความเป็นวิดีโอและภาพเป็นวิดีโอ พร้อมเสียงในตัวและความสอดคล้องขององค์ประกอบที่ดีขึ้น คลิปยาว 3-15 วินาที (ค่าเริ่มต้น 5) ในอัตราส่วน 16:9, 9:16 หรือ 1:1 โดยเลือกระดับผ่าน mode ได้แก่ std สำหรับ 720P, pro สำหรับ 1080P และ 4k สำหรับ 4K แบบเนทีฟ เสียงต้องเปิดเองผ่าน sound=on และค่าเริ่มต้นคือปิด ส่วนภาพเป็นวิดีโอรับเฟรมแรกพร้อมเฟรมท้ายที่จะใส่หรือไม่ก็ได้ เริ่มต้นที่ $0.083/วินาที (720p) | |
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | ต่อ 1 หมื่นอักขระ | โมเดลออกแบบเสียงของ Xiaomi MiMo: อธิบายเสียงที่ต้องการเป็นภาษาธรรมชาติผ่าน instructions แล้วโมเดลจะสังเคราะห์คำพูดด้วยเสียงที่ออกแบบไว้นั้น | |
| glm-5v-turbo | 智谱 | $0.7690 | $3.3850 | ต่อ 1M tokens | Zhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows. |
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | ต่อ 1 หมื่นอักขระ | โมเดลโคลนเสียงของ Xiaomi MiMo: ส่งตัวอย่างเสียงอ้างอิงเป็น data URL ในฟิลด์ voice (data:{mime};base64,...) แล้วโมเดลจะสังเคราะห์คำพูดด้วยเสียงนั้นโดยไม่ต้องผ่านขั้นตอนฝึกสอน กำกับข้อมูล หรือปรับจูนใด ๆ รองรับ MP3 (audio/mpeg) หรือ WAV โดยสตริงที่เข้ารหัส base64 ต้องไม่เกิน 10 MB ทั้งนี้ Xiaomi ไม่ได้ประกาศความยาวขั้นต่ำของเสียงอ้างอิง คำสั่งกำหนดสไตล์ด้วยภาษาธรรมชาติและแท็กเสียงแบบอินไลน์สืบทอดมาจาก mimo-v2.5-tts แต่ไม่มีการสตรีม คำขอจะทำงานในโหมดความเข้ากันได้และตอบกลับเมื่อสังเคราะห์เสร็จแล้วเท่านั้น | |
| MiniMax-Hailuo-02 | MiniMax | $0.280 | ต่อคำขอ | MiniMax Hailuo 02 — การสร้างวิดีโอราคาประหยัดที่ครอบคลุมทั้งข้อความเป็นวิดีโอและภาพเป็นวิดีโอ ที่ 24 fps โดย 512p และ 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที ระดับ 512p เป็นจุดเริ่มต้นของตระกูล Hailuo | |
| step-1o-audio | StepFun | $3.8500 | $9.2400 | ต่อ 1M tokens | StepFun step-1o-audio — โมเดลเสียงแบบครบวงจรรุ่นก่อนหน้า รองรับหลายภาษาและการเรียกใช้เครื่องมือ จำกัดที่ 30 นาทีต่อหนึ่งการโต้ตอบ ส่วนใหญ่ถูกแทนที่ด้วยตระกูล StepAudio 2.5 แล้ว แต่ยังคงไว้สำหรับงานที่สร้างบนโมเดลนี้อยู่แล้ว |
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | ต่อ 1M tokens | StepFun step-3.5-flash — โมเดลการให้เหตุผลเฉพาะข้อความ บริบท 256K มุ่งงานด้านตรรกะ คณิตศาสตร์ วิศวกรรมซอฟต์แวร์ และการวิจัยเชิงลึก ที่คุณภาพของการให้เหตุผลต้องมาพร้อมการทำงานที่รวดเร็วและเชื่อถือได้ เลือกความลึกของการให้เหตุผลได้รายคำขอผ่าน reasoning_effort (low / medium / high) รองรับการเรียกใช้เครื่องมือ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ หากต้องการอินพุตเป็นภาพหรือวิดีโอ ให้ใช้ step-3.7-flash |
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | ต่อ 1M tokens | StepFun step-3.7-flash — โมเดล MoE แบบเบาบางที่มีพารามิเตอร์รวม 198B และทำงานจริง 11B บริบทดั้งเดิม 256K และเข้าใจภาพกับวิดีโอได้ในตัวควบคู่กับข้อความ เลือกความลึกของการให้เหตุผลได้รายคำขอผ่าน reasoning_effort (low / medium / high) และรองรับการเรียกใช้เครื่องมือหลายขั้นตอนอย่างเชื่อถือได้ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ ปรับจูนมาสำหรับงานเอเจนต์และการเขียนโค้ด |
| step-image-edit-2 | StepFun | $0.004 | ต่อคำขอ | StepFun Step Image Edit 2 — โมเดลรวมการสร้างภาพจากข้อความและการแก้ไขภาพ ด้วยพารามิเตอร์ต่ำกว่า 6B แต่เทียบเท่าโมเดลแก้ไขภาพแบบเปิดน้ำหนักในระดับ 12B-20B ทำงานแก้ไขหนึ่งครั้งเสร็จภายในหนึ่งถึงสองวินาที และออกแบบมาเพื่อการรีทัชแบบโต้ตอบที่ความหน่วงต่ำ รองรับ 256x256, 512x512, 768x768, 1024x1024, 1280x800 และ 800x1280 พร้อมพรอมต์เชิงลบและโหมดปรับข้อความให้เหมาะสม สร้างได้หนึ่งภาพต่อหนึ่งคำขอ ให้บริการผ่านเอนด์พอยต์ images ที่เข้ากันได้กับ OpenAI | |
| doubao-seedance-2-0-fast-260128 | 字节跳动 | $5.6000 | $5.6000 | ต่อ 1M tokens | ByteDance Seedance 2.0 Fast — การสร้างวิดีโอที่คุ้มค่า มาพร้อมชุดความสามารถครบถ้วนของ Seedance 2.0 แต่จำกัดที่ 480p และ 720p, 24 fps, 4-15 วินาที ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 โดย 480p 5 วินาที ≈ $0.26 |
| qwen3-tts-flash | 阿里巴巴 | $0.1231 | ต่อ 1 หมื่นอักขระ | Alibaba Qwen3-TTS-Flash — การแปลงข้อความเป็นเสียงพูดที่มีความหน่วงต่ำ พร้อมเสียงในตัวที่มีอารมณ์ 17 เสียง ครอบคลุมภาษาจีน อังกฤษ เยอรมัน อิตาลี โปรตุเกส สเปน ญี่ปุ่น เกาหลี ฝรั่งเศส และรัสเซีย พร้อมโหมดอัตโนมัติสำหรับข้อความที่ปนหลายภาษา และการออกเสียงตามภาษาถิ่น โมเดลรับข้อความได้สูงสุด 512 โทเค็นต่อคำขอ และรองรับการสังเคราะห์ทั้งแบบสตรีมมิงและไม่สตรีมมิง | |
| gemini-3.6-flash | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Google Gemini 3.6 Flash — โมเดลการให้เหตุผลแบบมัลติโหมดรุ่นเสถียร ที่สมดุลระหว่างความเร็วกับความฉลาดสำหรับงานเอเจนต์และงานในโลกจริง มีบริบทอินพุต 1,048,576 โทเค็น และขีดจำกัดเอาต์พุต 65,536 โทเค็น รับข้อความ ภาพ วิดีโอ เสียง และ PDF พร้อมรองรับการคิด การเรียกฟังก์ชัน การรันโค้ด การอ้างอิงจากการค้นหา เอาต์พุตแบบมีโครงสร้าง และ Computer Use (พรีวิว) | |||
| step-audio-r1.5 | StepFun | $1.5500 | $16.2750 | ต่อ 1M tokens | StepFun step-audio-r1.5 — โมเดลเสียงพูดแบบครบวงจรในตระกูลเดียวกับ step-audio-2 ใช้อัตราอินพุตเดียวกันแต่คิดค่าเอาต์พุตสูงกว่า 50% StepFun ไม่ได้เผยแพร่หน้าความสามารถแยกสำหรับโมเดลนี้ กรุณาดูเอกสารด้านเสียงของแพลตฟอร์มเพื่อทราบชุดพารามิเตอร์ปัจจุบัน |
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | ต่อ 1M tokens | StepFun StepAudio 2.5 Chat — โมเดลเข้าใจเสียงพูดแบบครบวงจร รับเสียงหรือข้อความเข้าและตอบกลับเป็นข้อความ โดยอ่านสัญญาณกึ่งภาษาอย่างการลังเลหรือเสียงหัวเราะจากคลื่นเสียงโดยตรงแทนที่จะอ่านจากข้อความถอดเสียง รองรับการปรับแต่งบุคลิกอย่างละเอียด ครอบคลุมทั้งลักษณะตัวตน นิสัยการพูด และช่วงอารมณ์ ส่งเสียงเข้ามาในรูปแบบส่วนเนื้อหา input_audio บนเอนด์พอยต์ chat completions หากต้องการคำตอบเป็นเสียงพูด ให้ใช้โมเดล TTS |
| wan2.7-r2v | 阿里巴巴 | $0.092 | ต่อวินาที | Alibaba Wan2.7 (R2V) — สร้างวิดีโอจากสื่ออ้างอิง รองรับภาพ/วิดีโออ้างอิงผสมกันได้สูงสุด 5 ชิ้น พร้อมเสียงอ้างอิงน้ำเสียง และคงความสอดคล้องของตัวละคร อุปกรณ์ประกอบฉาก และฉากได้ดีขึ้น | |
| doubao-seed-2-1-pro-260628 | 字节跳动 | $0.9230 | $4.6150 | ต่อ 1M tokens | ByteDance Doubao Seed 2.1 Pro — โมเดลเอเจนต์เรือธงของ Doubao สำหรับงานที่ใช้จริง ครอบคลุมการคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง ซึ่งผู้ให้บริการแนะนำให้ใช้โหมด json_schema หน้าต่างบริบท 256K โดยรับอินพุตสูงสุด 256K เอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K) และงบประมาณห่วงโซ่ความคิด 256K โมเดลรับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ ทั้งนี้ตระกูล 2.1 ไม่ได้ระบุความสามารถในการเข้าใจเสียงไว้ รองรับการแคชบริบททั้งแบบโดยปริยายและแบบระบุชัดเจน รวมถึงแคชส่วนนำและแคชระดับเซสชัน |
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | ต่อ 1M tokens | Xiaomi MiMo-V2.5 — โมเดลที่รองรับครบทุกโหมดโดยกำเนิด พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K เข้าใจภาพ วิดีโอ เสียง และข้อความได้ในโมเดลเดียว รองรับการคิดเชิงลึก การเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการค้นหาเว็บ พร้อมความสามารถเอเจนต์ครบทุกโหมด |
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | ต่อคำขอ | MiniMax Hailuo 2.3 Fast — ระดับที่เน้นความเร็วและต้นทุนของ Hailuo 2.3 มุ่งไปที่ภาพเป็นวิดีโอและความสมจริงของการเคลื่อนไหวเชิงฟิสิกส์ ที่ 24 fps โดย 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที 768p 6 วินาที = $0.19 | |
| MiniMax-M3 | MiniMax | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | MiniMax M3 — โมเดลเขียนโค้ดแบบมัลติโหมดระดับแนวหน้า สำหรับการให้เหตุผลเชิงเอเจนต์ การใช้เครื่องมือ และการทำงานตามโครงสร้างที่กำหนด พร้อมหน้าต่างบริบท 1,000,000 โทเค็น โมเดลรับข้อความ ภาพขนาดไม่เกิน 10 MB และวิดีโอไม่เกิน 50 MB แบบส่งมาในคำขอ หรือไม่เกิน 512 MB ผ่าน Files API แล้วตอบกลับเป็นข้อความ รองรับการเรียกใช้เครื่องมือ โดยการคิดเป็นตัวเลือกไม่ใช่สิ่งที่เปิดอยู่ตลอด | ||
| qwen3.6-plus | 阿里巴巴 | $0.4000 | $2.4000 | ต่อ 1M tokens | Alibaba Qwen3.6-Plus — โมเดลสมดุลสำหรับการให้เหตุผลทั่วไปและการใช้เครื่องมือ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 65,536 โทเค็น และงบประมาณห่วงโซ่ความคิด 81,920 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง การค้นหาเว็บ การเติมข้อความต่อจากส่วนนำ และการแคชบริบท |
| wan2.7-image-pro | 阿里巴巴 | $0.060 | ต่อคำขอ | Alibaba Wan 2.7 Image Pro — ระดับมืออาชีพของตระกูลภาพ Wan 2.7 ครอบคลุมการสร้างภาพจากข้อความ ชุดภาพตามลำดับ การแก้ไขภาพ และการสร้างภาพโดยอ้างอิงจากหลายภาพ พร้อมการทำตามพรอมต์ที่ดีขึ้น การสร้างภาพจากข้อความไปถึง 4K (4096x4096) พร้อมระดับ 1K และ 2K และขนาดกำหนดเองตั้งแต่ 768x768 ส่วนโหมดแก้ไขและโหมดชุดภาพจำกัดที่ 2K โมเดลรับภาพอ้างอิงได้สูงสุด 9 ภาพ (JPEG, JPG, PNG, BMP, WEBP; ด้านละ 240-8,000 พิกเซล ภาพละไม่เกิน 20 MB) อัตราส่วนภาพตั้งแต่ 1:8 ถึง 8:1 และพรอมต์ยาวได้ถึง 5,000 อักขระ ผลลัพธ์เป็น PNG | |
| doubao-seedream-4-5-251128 | 字节跳动 | $0.038 | ต่อคำขอ | ByteDance Doubao Seedream 4.5 — สร้างภาพจากข้อความและภาพเป็นภาพ พร้อมการหลอมรวมหลายภาพ ให้ผลลัพธ์เป็นภาพเดียวหรือชุดภาพที่สัมพันธ์กัน โหมดภาพเดียวรับเพียงพรอมต์อย่างเดียว ภาพอ้างอิงหนึ่งภาพ หรือภาพอ้างอิง 2-14 ภาพ ส่วนโหมดชุดภาพ (sequential_image_generation=auto) คืนภาพได้สูงสุด 15 ภาพจากข้อความ สูงสุด 14 ภาพจากภาพอ้างอิงเพียงภาพเดียว หรือเป็นชุดจากภาพอ้างอิง 2-14 ภาพ โดยจำนวนอินพุตบวกเอาต์พุตต้องไม่เกิน 15 รองรับเอาต์พุต 2K และ 4K และคืนค่าเป็น JPEG ตามค่าเริ่มต้น ในรูปแบบ URL หรือ base64 ส่วนการแก้ไขเชิงโต้ตอบด้วยพิกัดมีเฉพาะใน Seedream 5.0 pro เท่านั้น | |
| happyhorse-1.1-r2v | 阿里巴巴 | $0.083 | ต่อวินาที | Alibaba HappyHorse 1.1 (R2V) — สร้างวิดีโอจากภาพอ้างอิงได้สูงสุด 9 ภาพ คงความสอดคล้องของตัวแบบ ฉาก และสไตล์ได้ดี พร้อมควบคุมมุมกล้อง 720P/1080P | |
| mimo-v2.5-asr | Xiaomi | $0.0740 | ต่อชั่วโมงเสียง | โมเดลรู้จำเสียงพูดของ Xiaomi MiMo ปรับให้เหมาะกับภาษาจีนและอังกฤษรวมถึงภาษาถิ่นจีน รองรับเสียงที่มีสัญญาณรบกวน เสียงระยะไกล เสียงหลายผู้พูด ตลอดจนการถอดเนื้อเพลง | |
| step-2x-large | StepFun | $0.016 | ต่อคำขอ | StepFun Step 2X Large — สร้างภาพจากข้อความด้วยพื้นผิวสมจริง และความสามารถเขียนตัวอักษรจีนและอังกฤษลงในภาพที่โดดเด่นเป็นพิเศษ รองรับ 256x256, 512x512, 768x768, 1024x1024, 1280x800 และ 800x1280 สร้างได้หนึ่งภาพต่อหนึ่งคำขอ ให้บริการผ่านเอนด์พอยต์ images ที่เข้ากันได้กับ OpenAI | |
| deepseek-v4-flash | DeepSeek | $0.1400 | $0.2800 | ต่อ 1M tokens | DeepSeek V4 Flash — ระดับ DeepSeek V4 ที่เร็วและรองรับการทำงานพร้อมกันได้สูง สำหรับการแชท การช่วยเขียนโค้ด และลูปเอเจนต์ พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 384K ทำงานได้ทั้งโหมดการคิด (ค่าเริ่มต้น) และโหมดไม่คิด รองรับการเรียกใช้เครื่องมือและเอาต์พุตแบบ JSON รับข้อความเข้า ตอบข้อความออก |
| kimi-k2.7-code-highspeed | Moonshot | $1.7810 | $7.3970 | ต่อ 1M tokens | Moonshot Kimi K2.7 Code Highspeed — ระดับที่เน้นปริมาณงานของ K2.7 Code ให้บริการโมเดลเดียวกันที่ความเร็วราว 180 โทเค็นต่อวินาที และสูงสุด 260 โทเค็นในงานที่บริบทสั้น หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ การคิดเป็นสิ่งบังคับและจะเกิดข้อผิดพลาดหากปิด ส่วน tool_choice จำกัดไว้ที่ auto หรือ none เท่านั้น และต้องส่งต่อ reasoning_content ตลอดการเรียกใช้เครื่องมือหลายขั้นตอน |
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | ต่อคำขอ | MiniMax Hailuo 2.3 — ข้อความเป็นวิดีโอและภาพเป็นวิดีโอ ที่ผู้ให้บริการชูจุดเด่นเรื่องการทำตามคำสั่ง ที่ 24 fps โดย 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที 768p 6 วินาที = $0.28 | |
| MiniMax-M2.7-highspeed | MiniMax | $0.5750 | $2.3010 | ต่อ 1M tokens | MiniMax M2.7 Highspeed — โมเดล M2.7 ตัวเดิมที่ให้บริการที่ความเร็วราว 100 โทเค็นต่อวินาที สำหรับการเขียนโค้ดที่ความหน่วงต่ำและเวิร์กโฟลว์เอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ รองรับการเรียกใช้เครื่องมือ ส่วนการคิดเปิดอยู่เสมอและปิดไม่ได้ |
| speech-2.8-hd | MiniMax | $0.5385 | ต่อ 1 หมื่นอักขระ | MiniMax speech-2.8-hd — ระดับความละเอียดสูงของตระกูลเสียง 2.8 วางตำแหน่งไว้ที่การถ่ายทอดอันสมจริงอย่างยิ่งพร้อมแท็กเสียง ครอบคลุม 40 ภาษาและ 7 อารมณ์ ระดับเสียงสูงต่ำ ความเร็วในการพูด ความดัง อัตราสุ่มสัญญาณ บิตเรต และรูปแบบเอาต์พุตปรับตั้งได้รายคำขอ ส่วนการสังเคราะห์ข้อความยาวรับได้สูงสุด 1 ล้านอักขระแบบอะซิงโครนัส หรือ 10,000 อักขระผ่านอินเทอร์เฟซสตรีมมิง | |
| wan2.7-i2v | 阿里巴巴 | $0.092 | ต่อวินาที | Alibaba Wan 2.7 Image-to-Video — ครอบคลุมการสร้างจากเฟรมแรก การเปลี่ยนภาพระหว่างเฟรมแรกกับเฟรมสุดท้าย และการต่อเนื่องจากคลิปเดิม สร้างวิดีโอ 720P หรือ 1080P (ค่าเริ่มต้น 1080P) ความยาว 2-15 วินาที ค่าเริ่มต้น 5 วินาที จากพรอมต์ยาวได้ถึง 5,000 อักขระ (พรอมต์เชิงลบไม่เกิน 500 อักขระ) สามารถส่งไฟล์ mp3 หรือ wav ความยาว 2-30 วินาทีเป็น driving_audio ได้ หากไม่ส่งเสียงมา โมเดลจะสร้างดนตรีประกอบหรือเอฟเฟกต์เสียงที่เข้ากันให้เอง เสียงที่ยาวกว่าคลิปจะถูกตัดทิ้ง ส่วนเสียงที่สั้นกว่าจะทำให้ช่วงท้ายเงียบ | |
| agnes-2.0-flash | Agnes AI | $0.0000 | ต่อ 1M tokens | Agnes AI Agnes 2.0 Flash — โมเดลเอเจนต์มัลติโหมดความเร็วสูง พร้อมบริบทอินพุต 256K และขีดจำกัดเอาต์พุตอ้างอิง 64K รองรับการแชท สตรีมมิง การเรียกใช้เครื่องมือ การเขียนโค้ด การให้เหตุผล การเข้าใจภาพ และเวิร์กโฟลว์เอเจนต์ | |
| doubao-seed-2-1-turbo-260628 | 字节跳动 | $0.4620 | $2.3080 | ต่อ 1M tokens | ByteDance Doubao Seed 2.1 Turbo — สายความหน่วงต่ำของตระกูล Seed 2.1 ที่ใช้กรอบสเปกเดียวกับรุ่น Pro ได้แก่ หน้าต่างบริบท 256K โดยรับอินพุตสูงสุด 256K เอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K) และงบประมาณห่วงโซ่ความคิด 256K ครอบคลุมการคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง แต่ไม่มีคำแนะนำให้ใช้ json_schema อย่างรุ่น Pro โมเดลรับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ ทั้งนี้ตระกูล 2.1 ไม่ได้ระบุความสามารถในการเข้าใจเสียงไว้ รองรับการแคชบริบททั้งแบบโดยปริยายและแบบระบุชัดเจน |
| doubao-seedream-5-0-260128 | 字节跳动 | $0.034 | ต่อคำขอ | ByteDance Doubao Seedream 5.0-lite — สร้างภาพจากข้อความและภาพเป็นภาพ พร้อมการสร้างสรรค์ที่ควบคุมได้อย่างชาญฉลาดขึ้น การค้นคืนข้อมูลแบบเรียลไทม์ และความสอดคล้องของตัวแบบที่ดีขึ้น (ความละเอียด 2K ขึ้นไป) | |
| happyhorse-1.1-i2v | 阿里巴巴 | $0.083 | ต่อวินาที | Alibaba HappyHorse 1.1 (I2V) — ภาพเป็นวิดีโอ พร้อมพื้นผิวที่ดีขึ้น ความสอดคล้องของตัวละครข้ามคลิป ความลื่นไหลของการเคลื่อนไหว และการซิงก์ภาพกับเสียง 720P/1080P | |
| step-1o-turbo-vision | StepFun | $0.4000 | $1.2800 | ต่อ 1M tokens | StepFun step-1o-turbo-vision — การเข้าใจภาพและวิดีโอพร้อมการสร้างข้อความที่รวดเร็ว บริบท 32K รับอินพุตเป็นข้อความ ภาพ และวิดีโอ แต่ตอบกลับเป็นข้อความเท่านั้น เป็นโมเดลด้านการมองเห็นรุ่นก่อนที่คงไว้เพื่อความเข้ากันได้ โดย step-3.7-flash รองรับอินพุตชนิดเดียวกันด้วยบริบท 256K และเลือกระดับความลึกของการให้เหตุผลได้ ควรให้ด้านยาวของภาพไม่เกิน 4096 พิกเซลเพื่อการรู้จำที่แม่นยำ |
| wan2.7-videoedit | 阿里巴巴 | $0.092 | ต่อวินาที | Alibaba Wan2.7 VideoEdit — ตัดต่อวิดีโอด้วยภาษาธรรมชาติ ทั้งเฉพาะจุดหรือทั้งคลิป แทนที่องค์ประกอบด้วยภาพอ้างอิง และจำลองการเคลื่อนไหว เอฟเฟกต์ และมุมกล้อง | |
| agnes-image-2.1-flash | Agnes AI | $0.000 | ต่อคำขอ | Agnes AI Image 2.1 Flash — โมเดลสร้างและแก้ไขภาพที่เน้นรายละเอียดสำหรับฉากที่มีความหนาแน่นของข้อมูลสูง รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ ด้วยขนาดและอัตราส่วนภาพที่ยืดหยุ่นตั้งแต่ 1K ถึง 4K | |
| doubao-seedance-2-5-260628 | 字节跳动 | $10.7000 | $10.7000 | ต่อ 1M tokens | ByteDance Seedance 2.5 — โมเดลสายหลักของ Seedance ที่ยืดการสร้างครั้งเดียวออกไปเป็น 4-30 วินาทีที่ 24 fps แต่จำกัดความละเอียดไว้ที่ 480p และ 720p การสร้างจากสื่ออ้างอิงแบบมัลติโหมดรองรับภาพ 1-30 ภาพ วิดีโออ้างอิงสูงสุด 10 คลิป และเสียงอ้างอิงสูงสุด 10 ไฟล์ (แต่ละประเภทรวมกันไม่เกิน 30 วินาที) และต่างจากรุ่น 2.0 ตรงที่เสียงอ้างอิงใช้เดี่ยว ๆ ได้ นอกจากนี้ยังครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 |
| glm-tts | 智谱 | $0.3077 | ต่อ 1 หมื่นอักขระ | Zhipu GLM-TTS — การแปลงข้อความเป็นเสียงพูดที่สร้างบนสถาปัตยกรรมการสร้างสองขั้นตอนร่วมกับการเรียนรู้เสริมกำลังแบบ GRPO ซึ่งอนุมานอารมณ์และน้ำเสียงจากข้อความแวดล้อมแทนที่จะต้องกำกับอย่างชัดแจ้ง มาพร้อมเสียงในตัวเจ็ดเสียง (ค่าเริ่มต้นคือ tongtong ตามด้วย xiaochen, chuichui, jam, kazi, douji, luodo) ปรับความเร็วและความดังได้ รับได้สูงสุด 1,024 อักขระต่อคำขอ และสตรีมด้วยความหน่วงของเฟรมแรกต่ำกว่า 400 ms ผลลัพธ์เป็น wav หรือ pcm ที่อัตราสุ่มสัญญาณแนะนำ 24 kHz ส่วนการสตรีมรองรับเฉพาะ pcm | |
| kling-v3-omni | 快手 | $0.420 | ต่อคำขอ | Kling 3.0 Omni — สร้างวิดีโอจากหลายภาพอ้างอิง ราคาที่แสดงเป็นของระดับ std (720p, 5 วินาที, ไม่มีเสียง, ไม่มีวิดีโออ้างอิง) คำขอที่ไม่ได้ระบุ mode จะใช้ระดับ pro ซึ่งเป็นค่าเริ่มต้นของต้นทาง และถูกคิดค่าบริการ 1.33 เท่า หรือราว $0.56 สำหรับคลิป 5 วินาทีเดียวกัน ส่วน 4k คิด 5 เท่า กรุณาส่ง mode=std เพื่อให้ถูกคิดตามราคาที่แสดง | |
| MiniMax-H3 | MiniMax | $0.080 | ต่อวินาที | MiniMax H3 (Hailuo 3.0) — โมเดลวิดีโอมัลติโหมดอเนกประสงค์แบบเปิดรุ่นใหม่ ที่สร้างเสียงสเตอริโอในตัวภายในรอบเดียว ที่ความละเอียด 768P หรือ 2K ความยาว 4-15 วินาที (รับเฉพาะจำนวนเต็ม) ที่ 24 fps ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและ/หรือเฟรมสุดท้าย และการสร้างจากสื่ออ้างอิงด้วยภาพ วิดีโอ หรือเสียง เพื่อกำหนดตัวละคร การเคลื่อนไหว มุมกล้อง สไตล์ น้ำเสียง หรือจังหวะการตัดต่อ ทั้งนี้ไม่สามารถใช้ภาพเป็นวิดีโอร่วมกับการสร้างจากสื่ออ้างอิงในคำขอเดียวกันได้ โมเดลรับวิดีโอ H.264/H.265 ภาพ JPG, JPEG, PNG, WEBP, HEIC และ HEIF และเสียง WAV หรือ MP3 โดยพรอมต์ยาวได้ถึง 7,000 อักขระ $0.08/วินาที ที่ 768P และ $0.13/วินาที ที่ 2K | |
| step-asr-1.1 | StepFun | $0.3500 | ต่อชั่วโมงเสียง | StepFun step-asr-1.1 — โมเดลรู้จำเสียงพูดอเนกประสงค์รุ่นปรับปรุงในตระกูล step-asr ครอบคลุมภาษาจีน อังกฤษ และภาษาถิ่นจีน รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ | |
| deepseek-v4-pro | DeepSeek | $0.4350 | $0.8700 | ต่อ 1M tokens | DeepSeek V4 Pro — ระดับที่มีความสามารถสูงกว่าของ DeepSeek V4 สำหรับการเขียนโค้ด การให้เหตุผล และงานเอเจนต์ พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 384K ทำงานได้ทั้งโหมดการคิด (ค่าเริ่มต้น) และโหมดไม่คิด รองรับการเรียกใช้เครื่องมือและเอาต์พุตแบบ JSON รับข้อความเข้า ตอบข้อความออก |
| glm-5-turbo | 智谱 | $1.2000 | $4.0000 | ต่อ 1M tokens | Zhipu GLM-5-Turbo — GLM-5 รุ่นที่เน้นปริมาณงาน ปรับให้เหมาะกับเวิร์กโฟลว์เอเจนต์ ได้แก่ การเรียกใช้เครื่องมือและสกิลที่เสถียรขึ้นตลอดงานหลายขั้นตอน การรับมือคำสั่งที่ซับซ้อนและยาวต่อเนื่องได้ดีขึ้น และการทำงานตามกำหนดเวลาหรืองานที่รันยาว หน้าต่างบริบท 200K เอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้าและตอบข้อความออก รองรับโหมดการคิด การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| glm-asr-2512 | 智谱 | $0.1440 | ต่อชั่วโมงเสียง | Zhipu GLM-ASR-2512 — โมเดลรู้จำเสียงพูดที่รายงานอัตราความผิดพลาดระดับอักขระ 0.0717 ครอบคลุมภาษาจีนกลางควบคู่กับภาษาเสฉวน กวางตุ้ง หมิ่นหนาน และอู๋ สำเนียงภาษาอังกฤษแบบอเมริกันและอังกฤษ รวมถึงภาษาอื่นอีกหลายสิบภาษา เช่น ฝรั่งเศส เยอรมัน ญี่ปุ่น เกาหลี สเปน และอาหรับ โมเดลรับมือกับคำพูดที่ปนหลายภาษา ศัพท์เฉพาะทาง และการพูดแบบภาษาปาก และรับพจนานุกรมกำหนดเองสำหรับคำศัพท์เฉพาะสาขาได้ เสียงจำกัดที่ 30 วินาทีและ 25 MB ต่อคำขอ รองรับการถอดเสียงทั้งแบบเป็นชุดและแบบสตรีมมิง | |
| kimi-k2.7-code | Moonshot | $0.7600 | $3.1570 | ต่อ 1M tokens | Moonshot Kimi K2.7 Code — โมเดลเฉพาะทางด้านการเขียนโค้ดของ Kimi ซึ่งผู้ให้บริการวัดผลว่าทำตามคำสั่งได้ดีขึ้นและเขียนโค้ดระยะยาวได้ดีกว่า K2.6 พร้อมลดการคิดเกินจำเป็นลงราว 30% โดยเฉลี่ย หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ การคิดเป็นสิ่งบังคับและจะเกิดข้อผิดพลาดหากปิด ส่วน tool_choice จำกัดไว้ที่ auto หรือ none เท่านั้น และต้องส่งต่อ reasoning_content ตลอดการเรียกใช้เครื่องมือหลายขั้นตอน |
| qwen3.7-max | 阿里巴巴 | $2.5000 | $7.5000 | ต่อ 1M tokens | Alibaba Qwen3.7-Max — เรือธงแบบปิดซอร์ส วางตำแหน่งไว้สำหรับการเขียนโปรแกรม งานสำนักงานและงานเพิ่มผลิตภาพ รวมถึงการทำงานอัตโนมัติในระยะยาว มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท |
| qwen3.7-plus | 阿里巴巴 | $0.3080 | $1.2310 | ต่อ 1M tokens | Alibaba Qwen3.7-Plus — โมเดลเอเจนต์ลูกผสมแบบมัลติโหมด ที่รับรู้ฉากในโลกจริง อ่านหน้าจอและควบคุมส่วนติดต่อผู้ใช้แบบกราฟิก สร้างโค้ดจากภาพอ้างอิง และนำทางแบบครบวงจรภายในแอปบนมือถือ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท |
| qwen3.8-max | 阿里巴巴 | $1.9900 | $5.9700 | ต่อ 1M tokens | Alibaba Qwen3.8-Max — โมเดล MoE เรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ และเป็นโมเดลที่เก่งที่สุดในตระกูล Qwen โดยผู้ให้บริการระบุว่าพัฒนาขึ้นมากในด้านการเขียนโค้ดและงานสำนักงาน มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท |
| speech-2.8-turbo | MiniMax | $0.3077 | ต่อ 1 หมื่นอักขระ | MiniMax speech-2.8-turbo — ระดับความหน่วงต่ำของตระกูลเสียง 2.8 ที่ยอมสละการถ่ายทอดอันสมจริงอย่างยิ่งของรุ่น HD เพื่อแลกกับการสังเคราะห์ที่เร็วขึ้นโดยยังคงความลื่นไหลตามธรรมชาติ ครอบคลุม 40 ภาษาและ 7 อารมณ์เท่ากับรุ่น HD ปรับตั้งระดับเสียงสูงต่ำ ความเร็วในการพูด ความดัง อัตราสุ่มสัญญาณ บิตเรต และรูปแบบเอาต์พุตได้ และรับข้อความได้สูงสุด 1 ล้านอักขระแบบอะซิงโครนัส หรือ 10,000 อักขระผ่านอินเทอร์เฟซสตรีมมิง | |
| stepaudio-2-asr-pro | StepFun | $0.3500 | ต่อชั่วโมงเสียง | StepFun StepAudio 2 ASR Pro — โมเดลรู้จำเสียงพูดขนาด 32B พารามิเตอร์ เป็นตัวเลือกที่เน้นความแม่นยำเป็นอันดับแรกในตระกูล ASR ของ StepFun ขณะที่ stepaudio-2.5-asr เป็นตัวเลือกที่เน้นความเร็วและต้นทุน รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ | |
| wan2.7-image | 阿里巴巴 | $0.031 | ต่อคำขอ | Alibaba Wan2.7 Image — สร้างภาพจากข้อความ แก้ไขภาพ สร้างภาพโดยอ้างอิงจากหลายภาพ แก้ไขแบบโต้ตอบ พร้อมการเขียนตัวอักษรและการทำตามคำสั่งที่แข็งแกร่ง | |