ราคาโมเดล AI จีน
ChinaAPI ให้บริการ DeepSeek, Qwen, GLM, Kimi และโมเดล AI จีนอื่น ๆ ผ่านเกตเวย์ที่เข้ากันได้กับ OpenAI ที่ https://api.chinaapi.ai/v1 ราคาทั้งหมดเป็นสกุลดอลลาร์สหรัฐ และแสดงตามหน่วยที่ผู้ให้บริการต้นทางกำหนด รายการเดียวกันนี้มีในรูปแบบ JSON ที่ /api/pricing
60 โมเดลปลดล็อกราคา Paid ที่ถูกลงหลังเติมเงินครั้งแรก เติมเงินครั้งเดียวไม่ว่าจำนวนเท่าใด มีผลทั้งบัญชีโดยอัตโนมัติ ราคา Paid จะแสดงเฉพาะเมื่อต่ำกว่าราคา Standard
| โมเดล | ผู้ให้บริการ | อินพุต | เอาต์พุต | อินพุต (ราคา Paid) | เอาต์พุต (ราคา Paid) | หน่วย | คำอธิบาย |
|---|---|---|---|---|---|---|---|
| agnes-2.5-flash | Agnes AI | $0.0000 | ต่อ 1M tokens | Agnes AI Agnes 2.5 Flash — โมเดลเอเจนต์มัลติโหมดความเร็วสูง พร้อมบริบทอินพุต 512K และขีดจำกัดเอาต์พุตอ้างอิง 65.5K รองรับการแชท สตรีมมิง การเรียกใช้เครื่องมือ การเขียนโค้ด การให้เหตุผล บทสนทนาหลายรอบ การเข้าใจภาพ และเวิร์กโฟลว์เอเจนต์ | |||
| agnes-2.5-pro | Agnes AI | $0.4500 | $0.9000 | ต่อ 1M tokens | Agnes AI Agnes 2.5 Pro — รุ่นเสถียรเชิงพาณิชย์ของโมเดลเบนช์มาร์ก 2.5 Pro Alpha เป็นโมเดลการให้เหตุผลแบบชำระเงิน พร้อมบริบทอินพุต 1M และเอาต์พุตสูงสุด 65,536 โทเค็น สำหรับการเขียนโค้ดขั้นสูง การให้เหตุผลทางวิทยาศาสตร์ การวิเคราะห์บริบทยาว เวิร์กโฟลว์เอเจนต์ และการเข้าใจภาพ | ||
| agnes-2.5-pro-beta | Agnes AI | $0.1000 | $0.3000 | ต่อ 1M tokens | Agnes AI Agnes 2.5 Pro Beta — ระดับราคาต่ำของตระกูล Pro คิดค่าบริการตามราคา Beta ของตัวเองซึ่งต่ำกว่าราคาของ 2.5 Pro อย่างมาก เป็นโมเดลการให้เหตุผลแบบชำระเงินที่ใช้รูปแบบคำขอ โปรโตคอลข้อความ และขีดจำกัดบริบทเดียวกัน สำหรับการเขียนโค้ดขั้นสูง การให้เหตุผลทางวิทยาศาสตร์ การวิเคราะห์บริบทยาว เวิร์กโฟลว์เอเจนต์ และการเข้าใจภาพ | ||
| agnes-3.0-flash | Agnes AI | $0.0000 | ต่อ 1M tokens | Agnes AI Agnes 3.0 Flash — โมเดลภาษารุ่นใหม่ของผู้ให้บริการ สร้างมาเพื่อการเขียนโค้ดเชิงเอเจนต์และการทำงานที่ขับเคลื่อนด้วยเครื่องมือ พร้อมบริบทอินพุต 512K และขีดจำกัดเอาต์พุต 65,536 โทเค็น รับอินพุตเป็นข้อความและ URL ของภาพ แล้วตอบกลับเป็นข้อความ รองรับสตรีมมิง การเรียกฟังก์ชันและการประสานเครื่องมือหลายขั้นตอน และการทำตามคำสั่งในงานที่ยาว เรียกใช้ได้ผ่านเอนด์พอยต์แชทที่เข้ากันได้กับ OpenAI เอนด์พอยต์ Responses และเอนด์พอยต์ Messages ที่เข้ากันได้กับ Anthropic สำหรับเอนด์พอยต์แชท โหมดการคิด (Thinking) เปิดได้โดยตั้งค่า chat_template_kwargs.enable_thinking เป็น true จากการวัดเมื่อ 2026-09-21 คำขอที่ไม่มีฟิลด์นี้ไม่ได้ส่งกลับโทเค็นการให้เหตุผลใด ๆ เมื่อเปิดโหมดการคิด โทเค็นการให้เหตุผลจะนับรวมอยู่ใน max_tokens จึงควรกำหนด max_tokens ให้เพียงพอทั้งสำหรับการให้เหตุผลและคำตอบ | |||
| agnes-image-2.0-flash | Agnes AI | $0.000 | ต่อคำขอ | Agnes AI Image 2.0 Flash — โมเดลสร้างและแก้ไขภาพที่รวดเร็ว รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ โดยรับผลลัพธ์ได้ทั้งในรูปแบบ URL หรือข้อมูล Base64 | |||
| agnes-image-2.1-flash | Agnes AI | $0.000 | ต่อคำขอ | Agnes AI Image 2.1 Flash — โมเดลสร้างและแก้ไขภาพที่เน้นรายละเอียดสำหรับฉากที่มีความหนาแน่นของข้อมูลสูง รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ ด้วยขนาดและอัตราส่วนภาพที่ยืดหยุ่นตั้งแต่ 1K ถึง 4K | |||
| agnes-image-2.5-flash | Agnes AI | $0.000 | ต่อคำขอ | Agnes AI Image 2.5 Flash — โมเดลภาพรุ่นล่าสุด ที่เหนือกว่า Image 2.1 Flash ทั้งด้านการสร้าง การแก้ไข การจัดองค์ประกอบ การเรนเดอร์รายละเอียด และการทำตามพรอมต์ รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ ด้วยขนาดและอัตราส่วนภาพที่ยืดหยุ่นตั้งแต่ 1K ถึง 4K | |||
| agnes-video-2.5 | Agnes AI | $0.025 | ต่อวินาที | Agnes AI Video 2.5 — โมเดลวิดีโอแบบอะซิงโครนัสที่ชำระเงิน สร้างคลิปความยาว 4-12 วินาทีที่ 720P, 960P หรือ 2K จากข้อความ คีย์เฟรมแรก/เฟรมสุดท้าย หรือภาพ เสียง และวิดีโออ้างอิง | |||
| agnes-video-2.5-flash | Agnes AI | $0.000 | ต่อวินาที | Agnes AI Video 2.5 Flash — รุ่นย่อยของ Video 2.5 ที่ให้เฉพาะ 720P สร้างวิดีโอความยาว 4-12 วินาทีจากข้อความ คีย์เฟรมแรก/เฟรมสุดท้าย หรือภาพและเสียงอ้างอิง ด้วย API งานแบบอะซิงโครนัสเดียวกัน | |||
| claude-fable-5 | Anthropic | $10.0000 | $50.0000 | $7.0000 | $35.0000 | ต่อ 1M tokens | Anthropic Claude Fable 5 — โมเดลที่มีความสามารถสูงที่สุดของ Anthropic ในบรรดารุ่นที่เปิดให้ใช้งานทั่วไป สำหรับงานความรู้และการเขียนโค้ดที่ทะเยอทะยานและใช้เวลายาวนาน สร้างขึ้นสำหรับงานเอเจนต์ที่กินเวลาหลายวัน งานวิศวกรรมซอฟต์แวร์ที่ซับซ้อน การวิจัยเชิงลึก การให้เหตุผลกับเอกสารและภาพ รวมถึงการตรวจสอบตนเองเชิงรุก |
| claude-fable-5-1 | Anthropic | $10.0000 | $50.0000 | $8.0000 | $40.0000 | ต่อ 1M tokens | Anthropic Claude Fable 5.1 — โมเดลเรือธงรุ่นล่าสุดของ Anthropic ที่เปิดให้ใช้งานทั่วไป สำหรับงานความรู้และการเขียนโค้ดที่ทะเยอทะยานและใช้เวลายาวนาน สร้างขึ้นสำหรับงานเอเจนต์ที่กินเวลาหลายวัน งานวิศวกรรมซอฟต์แวร์ที่ซับซ้อน การวิจัยเชิงลึก การให้เหตุผลกับเอกสารและภาพ รวมถึงการตรวจสอบตนเองเชิงรุก การอ่านแคชคิดราคาเพียง 2.5% ของอินพุต ซึ่งต่ำที่สุดในโมเดลรุ่นเดียวกัน |
| claude-haiku-4-5 | Anthropic | $1.0000 | $5.0000 | $0.7000 | $3.5000 | ต่อ 1M tokens | Anthropic Claude Haiku 4.5 — โมเดล Claude ที่เร็วที่สุด ด้วยความฉลาดใกล้เคียงระดับแนวหน้า สร้างขึ้นสำหรับงานปริมาณมากที่อ่อนไหวต่อความหน่วง เช่น การจัดหมวดหมู่ การดึงข้อมูล และการจัดเส้นทาง รองรับอินพุตข้อความและภาพ การคิดแบบขยาย หน้าต่างบริบท 200,000 โทเค็น และเอาต์พุตสูงสุด 64,000 โทเค็น |
| claude-haiku-5-5 | Anthropic | $0.1000 | $0.5000 | $0.0600 | $0.3000 | ต่อ 1M tokens | Anthropic Claude Haiku 5.5 — โมเดลเข้าใจข้อความและภาพที่รวดเร็วและประหยัด สำหรับการจำแนก การสกัดข้อมูล การกำหนดเส้นทาง และเอเจนต์ รองรับบริบท 1,000,000 โทเคนและเอาต์พุตสูงสุด 128,000 โทเคน การคิดแบบปรับได้ใช้ medium เป็นค่าเริ่มต้น เลือก low, medium, high, xhigh หรือ max ผ่าน output_config.effort ใน Messages รองรับสตรีมและการบังคับเรียกเครื่องมือ เมื่ออินพุตเกิน 100,000 โทเคน คำขอทั้งหมดจะคิดราคาบริบทยาว รวมเอาต์พุตและแคชด้วย |
| claude-opus-4-5 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | ต่อ 1M tokens | Anthropic Claude Opus 4.5 — รุ่น Opus 4.5 ซึ่งปัจจุบัน Anthropic จัดไว้ในกลุ่มโมเดลรุ่นเก่าและยังคงเปิดให้ใช้ สำหรับเวิร์กโหลดที่ต้องการใช้โมเดลเวอร์ชันนี้ต่อไป รองรับอินพุตข้อความและภาพ การคิดแบบขยาย หน้าต่างบริบท 200,000 โทเค็น และเอาต์พุตสูงสุด 64,000 โทเค็น |
| claude-opus-4-6 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | ต่อ 1M tokens | Anthropic Claude Opus 4.6 — รุ่น Opus สำหรับการให้เหตุผลที่ซับซ้อนและงานเอเจนต์ พร้อมหน้าต่างบริบท 1,000,000 โทเค็นในราคามาตรฐาน และเอาต์พุตสูงสุด 128,000 โทเค็น รองรับอินพุตข้อความและภาพ รวมถึงการคิดแบบปรับตัว และใช้โทเค็นไนเซอร์รุ่นก่อน 4.7 |
| claude-opus-4-7 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | ต่อ 1M tokens | Anthropic Claude Opus 4.7 — โมเดลการให้เหตุผลขั้นสูงสำหรับงานวิศวกรรมซอฟต์แวร์ที่ยากและงานเอเจนต์ที่ซับซ้อนซึ่งทำงานต่อเนื่องยาวนาน เน้นการทำตามคำสั่งอย่างเคร่งครัด การตรวจสอบตนเอง การใช้เครื่องมืออย่างเชื่อถือได้ และการมองเห็นความละเอียดสูงทั้งบนอินเทอร์เฟซ ภาพ เอกสาร และเวิร์กโฟลว์เชิงวิชาชีพ |
| claude-opus-4-8 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | ต่อ 1M tokens | Anthropic Claude Opus 4.8 — โมเดลการให้เหตุผลสมรรถนะสูงสำหรับการเขียนโค้ด เวิร์กโฟลว์เอเจนต์ การวิเคราะห์เชิงวิชาชีพ และงานที่ทำงานต่อเนื่องยาวนาน พัฒนาความน่าเชื่อถือ วิจารณญาณ ประสิทธิภาพการใช้เครื่องมือ การควบคุมคอมพิวเตอร์ และการให้เหตุผลกับเอกสารแบบมัลติโหมดเหนือกว่า Opus 4.7 พร้อมรองรับหน้าต่างบริบท 1,000,000 โทเค็น |
| claude-opus-5 | Anthropic | $5.0000 | $25.0000 | $3.0000 | $15.0000 | ต่อ 1M tokens | Anthropic Claude Opus 5 — โมเดลการให้เหตุผลเชิงลึกสำหรับงานเขียนโค้ดแบบเอเจนต์ที่ซับซ้อนและงานระดับองค์กร พัฒนาขึ้นอย่างมากในงานระยะยาว การรีวิวโค้ด เวิร์กโฟลว์เอกสาร การมองเห็น และการประสานงานหลายเอเจนต์ มีหน้าต่างบริบท 1,000,000 โทเค็น รองรับเอาต์พุตสูงสุด 128,000 โทเค็น และเปิดใช้การคิดแบบปรับตัวเป็นค่าเริ่มต้น |
| claude-opus-5-5 | Anthropic | $4.0000 | $20.0000 | $2.4000 | $12.0000 | ต่อ 1M tokens | Anthropic Claude Opus 5.5 — ออกแบบมาสำหรับงานเขียนโค้ดแบบเอเจนต์และงานด้านความรู้ที่ใช้เวลานาน ในราคาที่ต่ำกว่า Claude Opus 5 รองรับอินพุตทั้งข้อความและรูปภาพ มีหน้าต่างบริบท 1,000,000 โทเค็น และรองรับเอาต์พุตสูงสุด 128,000 โทเค็น การคิดแบบปรับตัวเปิดใช้อยู่เสมอ โดยใช้พารามิเตอร์ effort กำหนดความลึกของการให้เหตุผล และมีค่าเริ่มต้นเป็น medium |
| claude-sonnet-4-5 | Anthropic | $3.0000 | $15.0000 | $2.1000 | $10.5000 | ต่อ 1M tokens | Anthropic Claude Sonnet 4.5 — รุ่น Sonnet 4.5 ซึ่งปัจจุบัน Anthropic จัดไว้ในกลุ่มโมเดลรุ่นเก่าและยังคงเปิดให้ใช้ สำหรับเวิร์กโหลดที่ต้องการใช้โมเดลเวอร์ชันนี้ต่อไป รองรับอินพุตข้อความและภาพ การคิดแบบขยาย หน้าต่างบริบท 200,000 โทเค็น และเอาต์พุตสูงสุด 64,000 โทเค็น |
| claude-sonnet-4-6 | Anthropic | $3.0000 | $15.0000 | $2.1000 | $10.5000 | ต่อ 1M tokens | Anthropic Claude Sonnet 4.6 — รุ่น Sonnet ที่สมดุล ให้หน้าต่างบริบท 1,000,000 โทเค็นในราคามาตรฐาน พร้อมเอาต์พุตสูงสุด 128,000 โทเค็น รองรับอินพุตข้อความและภาพ รวมถึงการคิดแบบปรับตัว และใช้โทเค็นไนเซอร์รุ่นก่อน 4.7 ข้อความเดียวกันจึงใช้โทเค็นน้อยกว่าโมเดลรุ่น 4.7 ขึ้นไปราว 30% ที่อัตราต่อโทเค็นเท่ากัน |
| claude-sonnet-5 | Anthropic | $2.0000 | $10.0000 | $1.4000 | $7.0000 | ต่อ 1M tokens | Anthropic Claude Sonnet 5 — โมเดลสำหรับใช้งานจริงที่สมดุลระหว่างความฉลาดระดับแนวหน้ากับความเร็ว สำหรับการเขียนโค้ด งานเอเจนต์ และเวิร์กโฟลว์องค์กร สามารถวางแผน ใช้เครื่องมือเบราว์เซอร์และเทอร์มินัล และทำงานได้ด้วยตนเองทั้งงานให้เหตุผล งานความรู้ และงานวิศวกรรมซอฟต์แวร์ |
| claude-sonnet-5-5 | Anthropic | $2.0000 | $10.0000 | $1.2000 | $6.0000 | ต่อ 1M tokens | Anthropic Claude Sonnet 5.5 — สมดุลระหว่างความเร็วกับความฉลาด สำหรับการเขียนโค้ด งานเอเจนต์ และเวิร์กโหลดใช้งานจริง รองรับอินพุตทั้งข้อความและรูปภาพ มีหน้าต่างบริบท 1,000,000 โทเค็น และรองรับเอาต์พุตสูงสุด 128,000 โทเค็น การคิดแบบปรับตัวเปิดใช้ตามค่าเริ่มต้น และโทเค็นการคิดคิดค่าบริการเป็นเอาต์พุต เลือก output_config.effort ได้เป็น low, medium, high, xhigh หรือ max โดยค่าเริ่มต้นคือ high หากต้องการปิดการคิดล่วงหน้า ให้ส่ง thinking ที่มี type เป็น between_tools ซึ่งใช้ได้เมื่อ effort อยู่ที่ high หรือต่ำกว่า ส่วน type disabled จะถูกปฏิเสธ การตั้ง temperature, top_p หรือ top_k เป็นค่าที่ไม่ใช่ค่าเริ่มต้นจะได้รับข้อผิดพลาด เช่นเดียวกับการบังคับเรียกใช้เครื่องมือด้วย tool_choice any หรือ tool บล็อกการคิดผูกอยู่กับโมเดลและบทสนทนา ให้ส่งกลับไปโดยไม่แก้ไขในรอบสนทนาถัดไป |
| cogview-4 | Zhipu AI | $0.010 | $0.0095 | ต่อคำขอ | Zhipu CogView-4 — โมเดลสร้างภาพจากข้อความ CogView รุ่นที่สี่ รองรับความละเอียดเอาต์พุตหลายขนาด และมีระดับให้บริการทั้งแบบพื้นฐานและแบบความคมชัดสูง รับพรอมต์ภาษาจีนและภาษาอังกฤษ และเรนเดอร์ข้อความลงในภาพได้ สร้างได้หนึ่งภาพต่อคำขอ | ||
| deepseek-flash | DeepSeek | $0.1500 | $0.6000 | ต่อ 1M tokens | DeepSeek V4.1 Flash — ID โมเดลหลักสำหรับการผสานระบบใหม่ รองรับอินพุตข้อความและภาพ โหมดการคิดและโหมดไม่คิด การเรียกใช้เครื่องมือ และเอาต์พุตแบบ JSON ส่วน ID deepseek-v4-flash และ deepseek-v4-flash-vision-exp ที่เลิกใช้แล้ว ยังคงเป็นชื่อแทนเพื่อความเข้ากันได้ ซึ่งให้บริการโดยโมเดลเดียวกันนี้ในราคา Flash เท่าเดิม หน้าต่างบริบท 1M โทเค็น เอาต์พุตสูงสุด 384K บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา เนื่องจากต้นทางไม่มีการเก็บสถานะบทสนทนาไว้ คำขอที่มี previous_response_id หรือ conversation จึงถูกปฏิเสธ | ||
| deepseek-v4-pro | DeepSeek | $0.6600 | $1.9800 | ต่อ 1M tokens | DeepSeek V4 Pro 0813 — ระดับที่มีความสามารถสูงกว่าของ DeepSeek V4 สำหรับการเขียนโค้ด การให้เหตุผล และงานเอเจนต์ พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 384K ทำงานได้ทั้งโหมดการคิด (ค่าเริ่มต้น) และโหมดไม่คิด รองรับการเรียกใช้เครื่องมือและเอาต์พุตแบบ JSON รับข้อความเข้า ตอบข้อความออก บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา เนื่องจากต้นทางไม่มีการเก็บสถานะบทสนทนาไว้ คำขอที่มี previous_response_id หรือ conversation จึงถูกปฏิเสธ | ||
| doubao-seed-2-1-pro-260628 | ByteDance | $0.8889 | $4.4444 | ต่อ 1M tokens | ByteDance Doubao Seed 2.1 Pro — โมเดลเอเจนต์เรือธงของ Doubao สำหรับงานที่ใช้จริง ครอบคลุมการคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง ซึ่งผู้ให้บริการแนะนำให้ใช้โหมด json_schema หน้าต่างบริบท 256K โดยรับอินพุตสูงสุด 256K เอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K) และงบประมาณห่วงโซ่ความคิด 256K โมเดลรับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ ทั้งนี้ตระกูล 2.1 ไม่ได้ระบุความสามารถในการเข้าใจเสียงไว้ รองรับการแคชบริบททั้งแบบโดยปริยายและแบบระบุชัดเจน รวมถึงแคชส่วนนำและแคชระดับเซสชัน | ||
| doubao-seed-2-1-turbo-260628 | ByteDance | $0.4444 | $2.2222 | ต่อ 1M tokens | ByteDance Doubao Seed 2.1 Turbo — สายความหน่วงต่ำของตระกูล Seed 2.1 ที่ใช้กรอบสเปกเดียวกับรุ่น Pro ได้แก่ หน้าต่างบริบท 256K โดยรับอินพุตสูงสุด 256K เอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K) และงบประมาณห่วงโซ่ความคิด 256K ครอบคลุมการคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง แต่ไม่มีคำแนะนำให้ใช้ json_schema อย่างรุ่น Pro โมเดลรับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ ทั้งนี้ตระกูล 2.1 ไม่ได้ระบุความสามารถในการเข้าใจเสียงไว้ รองรับการแคชบริบททั้งแบบโดยปริยายและแบบระบุชัดเจน | ||
| doubao-seed-character-260628 | ByteDance | $0.1185 | $0.2963 | ต่อ 1M tokens | ByteDance Doubao Seed Character (260628) — โมเดลบทสนทนาตัวละครของ Doubao สำหรับการสนทนาหลายรอบที่ขับเคลื่อนด้วยเพอร์โซนา เป็นสายที่สืบต่อจาก doubao-1-5-pro-32k-character บิลด์นี้มีป้ายความสามารถตามที่ผู้ให้บริการระบุ ได้แก่ การคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง (แนะนำ json_schema) หน้าต่างบริบท 128K โดยรับอินพุตสูงสุด 96K และเอาต์พุตสูงสุด 32K โทเค็น (ค่าเริ่มต้น 4K) คิดราคาตามความยาวอินพุต: คำขอที่มีโทเค็นอินพุตไม่เกิน 32K คิดค่าบริการในระดับมาตรฐาน ส่วนคำขอที่ยาวกว่านั้นคิดในระดับบริบทยาว ซึ่งอินพุตมีราคาเป็น 1.5 เท่า และเอาต์พุตมีราคาเป็นสามเท่าของอัตราระดับมาตรฐาน | ||
| doubao-seed-evolving | ByteDance | $0.8889 | $4.4444 | ต่อ 1M tokens | ByteDance Doubao Seed Evolving — เรือธงด้านการเขียนโค้ดและเอเจนต์ในปัจจุบันของ Doubao เผยแพร่แบบต่อเนื่อง (rolling release): ผู้ให้บริการอัปเดตโมเดลทุกสัปดาห์ภายใต้ ID เดิมนี้โดยไม่มีสแนปช็อตแบบระบุวันที่ พฤติกรรมและความสามารถจึงอาจเปลี่ยนไปได้โดยไม่มีการเปลี่ยนหมายเลขเวอร์ชัน มีป้ายความสามารถตามที่ผู้ให้บริการระบุ ได้แก่ การคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การจัดการงานบน GUI การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง (แนะนำ json_schema) หน้าต่างบริบท 1,024K โดยรับอินพุตสูงสุด 1,024K และเอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K) | ||
| doubao-seedance-2-0-260128 | ByteDance | $7.0000 | ต่อ 1M tokens | ByteDance Seedance 2.0 — เรือธงของตระกูล Seedance 2.0 และเป็นรุ่นเดียวในตระกูลที่ไปถึง 1080p และ 4K (ความลึกสี 10 บิต) เพิ่มเติมจาก 480p และ 720p ที่ 24 fps และ 4-15 วินาที ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 และดึงเฟรมปิดท้ายออกมาเป็นภาพนิ่งได้ คิดค่าบริการตามความละเอียดของเอาต์พุต | |||
| doubao-seedance-2-0-fast-260128 | ByteDance | $5.6000 | ต่อ 1M tokens | ByteDance Seedance 2.0 Fast — การสร้างวิดีโอที่คุ้มค่า มาพร้อมชุดความสามารถครบถ้วนของ Seedance 2.0 แต่จำกัดที่ 480p และ 720p, 24 fps, 4-15 วินาที ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 โดย 480p 5 วินาที ≈ $0.26 | |||
| doubao-seedance-2-0-mini-260615 | ByteDance | $3.5000 | ต่อ 1M tokens | ByteDance Seedance 2.0 Mini — ระดับที่เบาและประหยัดงบประมาณของตระกูล Seedance 2.0 จำกัดที่ 480p และ 720p, 24 fps, 4-15 วินาที มาพร้อมชุดความสามารถตามเอกสารเดียวกับรุ่นอื่นในตระกูล ได้แก่ ข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 | |||
| doubao-seedance-2-5-260628 | ByteDance | $10.7000 | ต่อ 1M tokens | ByteDance Seedance 2.5 — โมเดลสายหลักของ Seedance ที่ยืดการสร้างครั้งเดียวออกไปเป็น 4-30 วินาทีที่ 24 fps แต่จำกัดความละเอียดไว้ที่ 480p และ 720p การสร้างจากสื่ออ้างอิงแบบมัลติโหมดรองรับภาพ 1-30 ภาพ วิดีโออ้างอิงสูงสุด 10 คลิป และเสียงอ้างอิงสูงสุด 10 ไฟล์ (แต่ละประเภทรวมกันไม่เกิน 30 วินาที) และต่างจากรุ่น 2.0 ตรงที่เสียงอ้างอิงใช้เดี่ยว ๆ ได้ นอกจากนี้ยังครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 | |||
| doubao-seedream-4-5-251128 | ByteDance | $0.03704 | ต่อคำขอ | ByteDance Doubao Seedream 4.5 — สร้างภาพจากข้อความและภาพเป็นภาพ พร้อมการหลอมรวมหลายภาพ ให้ผลลัพธ์เป็นภาพเดียวหรือชุดภาพที่สัมพันธ์กัน โหมดภาพเดียวรับเพียงพรอมต์อย่างเดียว ภาพอ้างอิงหนึ่งภาพ หรือภาพอ้างอิง 2-14 ภาพ ส่วนโหมดชุดภาพ (sequential_image_generation=auto) คืนภาพได้สูงสุด 15 ภาพจากข้อความ สูงสุด 14 ภาพจากภาพอ้างอิงเพียงภาพเดียว หรือเป็นชุดจากภาพอ้างอิง 2-14 ภาพ โดยจำนวนอินพุตบวกเอาต์พุตต้องไม่เกิน 15 รองรับเอาต์พุต 2K และ 4K และคืนค่าเป็น JPEG ตามค่าเริ่มต้น ในรูปแบบ URL หรือ base64 ส่วนการแก้ไขเชิงโต้ตอบด้วยพิกัดมีเฉพาะใน Seedream 5.0 Pro (doubao-seedream-5-0-pro-260628) เท่านั้น | |||
| doubao-seedream-5-0-260128 | ByteDance | $0.03259 | ต่อคำขอ | ByteDance Doubao Seedream 5.0-lite — สร้างภาพจากข้อความและภาพเป็นภาพ พร้อมการสร้างสรรค์ที่ควบคุมได้อย่างชาญฉลาดขึ้น การค้นคืนข้อมูลแบบเรียลไทม์ และความสอดคล้องของตัวแบบที่ดีขึ้น (ความละเอียด 2K ขึ้นไป) | |||
| doubao-seedream-5-0-pro-260628 | ByteDance | $0.045 | ต่อคำขอ | ByteDance Doubao Seedream 5.0 Pro — โมเดลภาพระดับสูงสุดของผู้ให้บริการสำหรับการสร้างสรรค์ที่ควบคุมได้ ได้แก่ สร้างภาพจากข้อความ ภาพเป็นภาพแบบอ้างอิงภาพเดียวและอ้างอิงหลายภาพ (ภาพอ้างอิง 2-10 ภาพ) การแก้ไขเชิงโต้ตอบด้วยพิกัด กรอบ หรือลูกศร และการแยกเลเยอร์ที่แบ่งภาพหนึ่งภาพออกเป็นภาพฐานกับเลเยอร์อีกสูงสุด 16 เลเยอร์ โดยแต่ละเลเยอร์ส่งกลับพร้อมขนาด z_index และกรอบขอบเขตของตัวเอง (ตั้งค่า layer_decomposition=true) ให้ผลลัพธ์เป็นภาพเดียวเท่านั้น ไม่มีการสร้างแบบชุดภาพ (ตามลำดับ) การค้นหาเว็บ หรือสตรีมมิง คิดค่าบริการต่อภาพเอาต์พุตตามสถานการณ์การใช้งานและระดับพิกเซล: ภาพเดียวที่ไม่เกิน 2.61 MP เป็นราคาฐาน เกิน 2.61 MP คิด 2 เท่า ในการแยกเลเยอร์ ทุกเลเยอร์ที่ส่งกลับคิดค่าบริการแยกกันที่ 0.5 เท่า (หรือ 1 เท่าเมื่อเกิน 2.61 MP) และภาพอ้างอิงแต่ละภาพที่นอกเหนือจากภาพแรกจะบวกเพิ่ม 1/15 ของราคาฐาน | |||
| fun-asr-flash-2026-06-15 | Alibaba | $0.1260 | ต่อชั่วโมงเสียง | Alibaba Fun-ASR Flash (2026-06-15) — การรู้จำเสียงพูดความหน่วงต่ำสำหรับไฟล์เสียงที่บันทึกไว้ พร้อมบริบทจากพรอมต์และการตรวจจับภาษาอัตโนมัติ ครอบคลุมภาษาถิ่นของจีนและอีกกว่า 30 ภาษา รับเสียงผ่าน URL, Base64 หรือไฟล์อัปโหลดแบบ AAC/AMR/AVI/FLAC/FLV/M4A/MKV/MOV/MP3/MP4/MPEG/OGG/OPUS/WAV/WEBM/WMA/WMV ยาวไม่เกิน 5 นาทีและขนาดไม่เกิน 2 GB | |||
| gemini-2.5-flash-image | $0.3000 | $2.5000 | $0.2100 | $1.7500 | ต่อ 1M tokens | Google Gemini 2.5 Flash Image (Nano Banana) — โมเดลสร้างและแก้ไขภาพแบบเนทีฟที่ทำงานเร็ว สำหรับเวิร์กโฟลว์งานสร้างสรรค์ รับอินพุตข้อความและภาพ แล้วส่งภาพกลับผ่านเอนด์พอยต์ chat completions ที่เข้ากันได้กับ OpenAI พร้อมขีดจำกัดอินพุต 65,536 โทเค็น และขีดจำกัดเอาต์พุต 32,768 โทเค็น | |
| gemini-2.5-pro | $1.2500 | $10.0000 | $0.8125 | $6.5000 | ต่อ 1M tokens | Google Gemini 2.5 Pro — โมเดลระดับการให้เหตุผลของตระกูล 2.5 พร้อมหน้าต่างบริบท 1M โทเค็น พรอมต์ที่ยาวเกิน 200,000 โทเค็นจะถูกคิดราคาใหม่ตามอัตราบริบทยาวของผู้ให้บริการสำหรับทั้งคำขอ ตามกฎเดียวกับของ Google เอง | |
| gemini-3-pro-image | $2.0000 | $12.0000 | $1.4000 | $8.4000 | ต่อ 1M tokens | Google Gemini 3 Pro Image (Nano Banana Pro) — โมเดลระดับพรีเมียมที่ขับเคลื่อนด้วยการให้เหตุผล สำหรับการสร้างภาพระดับมืออาชีพและการแก้ไขผ่านบทสนทนา โดดเด่นด้านงานออกแบบกราฟิกที่ซับซ้อน ม็อกอัปสินค้าที่มีความเที่ยงตรงสูง การเรนเดอร์ข้อความหลายภาษาอย่างแม่นยำ ความสอดคล้องของแบรนด์ และการแสดงภาพข้อมูลเชิงข้อเท็จจริงที่อ้างอิงจาก Google Search รับข้อความและภาพ ส่งกลับทั้งข้อความและภาพ รองรับการคิด และสร้างเอาต์พุต 1K, 2K หรือ 4K | |
| gemini-3.1-flash-image | $0.5000 | $3.0000 | $0.3500 | $2.1000 | ต่อ 1M tokens | Google Gemini 3.1 Flash Image (Nano Banana 2) — โมเดลรุ่นเสถียรที่มีความหน่วงต่ำ สำหรับการสร้างภาพคุณภาพสูงและการแก้ไขผ่านบทสนทนา รับข้อความ ภาพ และ PDF รองรับการคิดและการอ้างอิงจากการค้นหา และสร้างภาพขนาด 0.5K, 1K, 2K หรือ 4K สำหรับเวิร์กโฟลว์ผลิตงานปริมาณมาก | |
| gemini-3.1-flash-lite-image | $0.2500 | $1.5000 | $0.1750 | $1.0500 | ต่อ 1M tokens | Google Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — โมเดลที่มีความหน่วงต่ำมากและคุ้มค่า สำหรับการสร้างภาพปริมาณมากและการแก้ไขหลายรอบอย่างรวดเร็ว รับข้อความและภาพ สร้างภาพขนาด 1K รองรับการคิดและการแก้ไขผ่านบทสนทนา ออกแบบมาสำหรับแอปพลิเคชันเชิงโต้ตอบทั้งของนักพัฒนาและผู้ใช้ทั่วไป | |
| gemini-3.5-flash | $1.5000 | $9.0000 | $1.0500 | $6.3000 | ต่อ 1M tokens | Google Gemini 3.5 Flash — โมเดลมัลติโหมดรุ่นเสถียร ปรับให้เหมาะกับประสิทธิภาพของเอเจนต์ที่ต่อเนื่อง ลูปการเขียนโค้ดที่รวดเร็ว การกระจายงานให้เอเจนต์ย่อย และเวิร์กโฟลว์หลายขั้นตอนที่ทำงานยาวนาน รับข้อความ ภาพ วิดีโอ เสียง และ PDF รองรับการคิดและเครื่องมือในตัว พร้อมบริบทอินพุต 1,048,576 โทเค็น และเอาต์พุตสูงสุด 65,536 โทเค็น | |
| gemini-3.6-flash | $0.7500 | $3.7500 | $0.5250 | $2.6250 | ต่อ 1M tokens | Google Gemini 3.6 Flash — โมเดลการให้เหตุผลแบบมัลติโหมดรุ่นเสถียร ที่สมดุลระหว่างความเร็วกับความฉลาดสำหรับงานเอเจนต์และงานในโลกจริง มีบริบทอินพุต 1,048,576 โทเค็น และขีดจำกัดเอาต์พุต 65,536 โทเค็น รับข้อความ ภาพ วิดีโอ เสียง และ PDF พร้อมรองรับการคิด การเรียกฟังก์ชัน การรันโค้ด การอ้างอิงจากการค้นหา เอาต์พุตแบบมีโครงสร้าง และ Computer Use (พรีวิว) หมายเหตุเรื่องราคา: ราคาตามรายการของ Google สำหรับโมเดลนี้เป็นราคาโปรโมชันจนถึงวันที่ 31 ธันวาคม 2026 — อินพุต $0.75 / เอาต์พุต $3.75 / อินพุตที่แคชไว้ $0.075 ต่อ 1M โทเค็น ตั้งแต่วันที่ 1 มกราคม 2027 ราคาตามรายการของผู้ให้บริการจะกลับไปอยู่ที่ $1.50 / $7.50 / $0.15 และราคาของเราจะปรับตามโดยคงระดับเทียบเท่าเดิม | |
| gemini-3.7-flash | $0.7500 | $3.7500 | $0.5250 | $2.6250 | ต่อ 1M tokens | Google Gemini 3.7 Flash — โมเดลการให้เหตุผลแบบมัลติโหมดระดับ Flash รุ่นใหม่ล่าสุด คิดราคาเท่ากับ 3.6 Flash ตลอดช่วงโปรโมชันของผู้ให้บริการ รับข้อความ ภาพ วิดีโอ เสียง และ PDF รองรับการคิด การเรียกฟังก์ชัน การรันโค้ด การอ้างอิงจากการค้นหา และเอาต์พุตแบบมีโครงสร้าง หมายเหตุเรื่องราคา: ราคาตามรายการของ Google สำหรับโมเดลนี้เป็นราคาโปรโมชันจนถึงวันที่ 31 ธันวาคม 2026 — อินพุต $0.75 / เอาต์พุต $3.75 / อินพุตที่แคชไว้ $0.075 ต่อ 1M โทเค็น ตั้งแต่วันที่ 1 มกราคม 2027 ราคาตามรายการของผู้ให้บริการจะกลับไปอยู่ที่ $1.50 / $7.50 / $0.15 และราคาของเราจะปรับตามโดยคงระดับเทียบเท่าเดิม | |
| gemini-3.8-flash | $0.7500 | $3.7500 | $0.4875 | $2.4375 | ต่อ 1M tokens | Google Gemini 3.8 Flash — โมเดล Gemini แบบมัลติโหมดความเร็วสูงของ Google ซึ่งเรียกใช้ได้ที่นี่ทั้งผ่านเอนด์พอยต์ที่เข้ากันได้กับ OpenAI และเอนด์พอยต์ Gemini แบบเนทีฟ ราคาโทเค็นมาตรฐานคือ อินพุต $0.75 อินพุตที่แคชไว้ $0.075 และเอาต์พุต $3.75 ต่อ 1M โทเค็น | |
| glm-5 | Zhipu AI | $1.0000 | $3.2000 | $0.9500 | $3.0400 | ต่อ 1M tokens | Zhipu GLM-5 — โมเดล MoE ขนาด 744B พารามิเตอร์ โดยทำงานจริง 40B ฝึกด้วยข้อมูล 28.5T โทเค็น และใช้ DeepSeek Sparse Attention พร้อมหน้าต่างบริบท 200K และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| glm-5-turbo | Zhipu AI | $1.2000 | $4.0000 | $1.1400 | $3.8000 | ต่อ 1M tokens | Zhipu GLM-5-Turbo — GLM-5 รุ่นที่เน้นปริมาณงาน ปรับให้เหมาะกับเวิร์กโฟลว์เอเจนต์ ได้แก่ การเรียกใช้เครื่องมือและสกิลที่เสถียรขึ้นตลอดงานหลายขั้นตอน การรับมือคำสั่งที่ซับซ้อนและยาวต่อเนื่องได้ดีขึ้น และการทำงานตามกำหนดเวลาหรืองานที่รันยาว หน้าต่างบริบท 200K เอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้าและตอบข้อความออก รองรับโหมดการคิด การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| glm-5.1 | Zhipu AI | $1.4000 | $4.4000 | $1.1200 | $3.5200 | ต่อ 1M tokens | Zhipu GLM-5.1 — โมเดลพื้นฐานเรือธงที่สร้างมาเพื่อการทำงานอัตโนมัติต่อเนื่องยาวนาน โดยผู้ให้บริการระบุว่าสามารถทำงานเดียวต่อเนื่องโดยไม่ต้องมีคนดูแลได้นานถึง 8 ชั่วโมง ครอบคลุมทั้งการวางแผน การลงมือทำ การทดสอบ และการปรับปรุงซ้ำ หน้าต่างบริบท 200K เอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้าและตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| glm-5.2 | Zhipu AI | $1.4000 | $4.4000 | $1.1200 | $3.5200 | ต่อ 1M tokens | Zhipu GLM-5.2 — โมเดลพื้นฐานเรือธงที่ออกแบบมาเฉพาะสำหรับงานเอเจนต์เขียนโค้ดระยะยาว ผ่านการฝึกเฉพาะทางนานหลายเดือน ไม่ใช่เพียงการขยายบริบท พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| glm-5.3 | Zhipu AI | $1.4000 | $4.4000 | $0.9100 | $2.8600 | ต่อ 1M tokens | Zhipu GLM-5.3 — โมเดลเรือธงด้านการเขียนโค้ดและเอเจนต์ ที่ผ่านการฝึกเพิ่มเติมบนโมเดลพื้นฐานเดียวกับ GLM-5.2 ได้คะแนนเพิ่มขึ้น 50% บนเบนช์มาร์กการเขียนโค้ดภายในของ Zhipu เป็น SOTA ในกลุ่มโอเพนซอร์สบน Terminal-Bench 3.0 และ Agents' Last Exam และให้ผลการค้นหาช่องโหว่บน CyberGym ในระดับล้ำสมัย พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| glm-5.3-flash | Zhipu AI | $0.1500 | $0.5000 | $0.1350 | $0.4500 | ต่อ 1M tokens | Zhipu GLM-5.3-Flash — โมเดลมัลติโหมดแบบเนทีฟรุ่นแรกในสาย GLM-5 และเป็นระดับแนวหน้าราคาประหยัดของสายนี้ มีพารามิเตอร์รวม 320B และทำงานจริง 18B บนสถาปัตยกรรม attention แบบผสมระหว่างเชิงเส้นกับแบบเบาบาง ซึ่งลดการคำนวณ attention และ KV cache ลงหลายเท่าเมื่อเทียบกับ GLM-5.3 พร้อมทั้งลดจำนวนพารามิเตอร์ที่ทำงานจริงและจำนวนชั้นลงครึ่งหนึ่งเมื่อเทียบกับ GLM-4.5 รับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ (ผู้ให้บริการยังโฆษณาว่ารับอินพุตไฟล์ได้ด้วย แต่ยังไม่ได้ตรวจสอบยืนยันที่นี่จึงไม่เปิดให้ใช้) หน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 128K โทเค็น รองรับโหมดการคิด การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP วางตำแหน่งไว้สำหรับการเขียนโค้ดเชิงภาพ ได้แก่ งานฟรอนต์เอนด์ เกม และ 3D ที่โมเดลตรวจดูผลลัพธ์ที่เรนเดอร์ออกมาของตนเองแล้วปรับปรุงซ้ำ |
| glm-5v-turbo | Zhipu AI | $1.2000 | $4.0000 | $1.1400 | $3.8000 | ต่อ 1M tokens | Zhipu GLM-5V-Turbo — โมเดลการให้เหตุผลแบบมัลติโหมดสำหรับภาพ วิดีโอ ไฟล์ การเขียนโค้ด และเวิร์กโฟลว์เอเจนต์ที่ขับเคลื่อนด้วยเครื่องมือ |
| glm-image | Zhipu AI | $0.015 | $0.01425 | ต่อคำขอ | Zhipu GLM-Image — การสร้างภาพบนสถาปัตยกรรมแบบผสมที่รวมการทำความเข้าใจแบบ autoregressive เข้ากับการถอดรหัสแบบ diffusion เป็นโมเดลมัลติโหมดระดับ SOTA ตัวแรกที่ฝึกแบบ end-to-end บนชิปที่ผลิตในประเทศจีน (Huawei Ascend) ตีความจากคำสั่งแทนที่จะดูแค่คีย์เวิร์ด และเติมรายละเอียดที่พรอมต์ไม่ได้ระบุไว้อย่างชัดแจ้ง พร้อมความสามารถที่แข็งแกร่งขึ้นอย่างเห็นได้ชัดในการเรนเดอร์ข้อความ (โดยเฉพาะอักษรจีน) และฉากที่ต้องอาศัยความรู้เข้มข้น สร้างได้หนึ่งภาพต่อคำขอ | ||
| glm-tts | Zhipu AI | $0.3500 | $0.3150 | ต่อ 1 หมื่นอักขระ | Zhipu GLM-TTS — การแปลงข้อความเป็นเสียงพูดที่สร้างบนสถาปัตยกรรมการสร้างสองขั้นตอนร่วมกับการเรียนรู้เสริมกำลังแบบ GRPO ซึ่งอนุมานอารมณ์และน้ำเสียงจากข้อความแวดล้อมแทนที่จะต้องกำกับอย่างชัดแจ้ง มาพร้อมเสียงในตัวเจ็ดเสียง (ค่าเริ่มต้นคือ tongtong ตามด้วย xiaochen, chuichui, jam, kazi, douji, luodo) ปรับความเร็วและความดังได้ รับได้สูงสุด 1,024 อักขระต่อคำขอ และสตรีมด้วยความหน่วงของเฟรมแรกต่ำกว่า 400 ms ผลลัพธ์เป็น wav หรือ pcm ที่อัตราสุ่มสัญญาณแนะนำ 24 kHz ส่วนการสตรีมรองรับเฉพาะ pcm | ||
| gpt-5.5 | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | ต่อ 1M tokens | OpenAI GPT-5.5 — โมเดลการให้เหตุผลระดับแนวหน้าสำหรับการเขียนโค้ดที่ซับซ้อนและงานอาชีพ รองรับอินพุตข้อความและภาพ การเรียกฟังก์ชันและเครื่องมือในตัว หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และระดับความเข้มข้นของการให้เหตุผลตั้งแต่ none จนถึง xhigh |
| gpt-5.6-luna | OpenAI | $0.2000 | $1.2000 | $0.1700 | $1.0200 | ต่อ 1M tokens | OpenAI GPT-5.6 Luna — ระดับที่เร็วที่สุดและคุ้มค่าที่สุดของ GPT-5.6 ปรับให้เหมาะกับงานปริมาณมากที่อ่อนไหวต่อต้นทุน โดยยังคงความสามารถด้านการให้เหตุผล การมองเห็น และการใช้เครื่องมือ รองรับอินพุตข้อความและภาพ หน้าต่างบริบท 1,050,000 โทเค็น และเอาต์พุตสูงสุด 128,000 โทเค็น |
| gpt-5.6-sol | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | ต่อ 1M tokens | OpenAI GPT-5.6 Sol — โมเดลเรือธงของตระกูล GPT-5.6 สำหรับการให้เหตุผลระดับแนวหน้า งานอาชีพที่ซับซ้อน การเขียนโค้ด วิทยาศาสตร์ ความมั่นคงปลอดภัยไซเบอร์ และเวิร์กโฟลว์เอเจนต์ระยะยาว รองรับอินพุตข้อความและภาพ เครื่องมือในตัว หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และการตั้งค่าการให้เหตุผลที่ลึกที่สุดในตระกูลนี้ |
| gpt-5.6-terra | OpenAI | $2.0000 | $12.0000 | $1.6000 | $9.6000 | ต่อ 1M tokens | OpenAI GPT-5.6 Terra — โมเดล GPT-5.6 ที่สมดุลสำหรับงานอาชีพในแต่ละวัน ให้ความฉลาดและประสิทธิภาพของเอเจนต์เขียนโค้ดที่แข็งแกร่งด้วยต้นทุนต่ำกว่า Sol รองรับอินพุตข้อความและภาพ เครื่องมือในตัว หน้าต่างบริบท 1,050,000 โทเค็น และเอาต์พุตสูงสุด 128,000 โทเค็น |
| gpt-6-astra | OpenAI | $10.0000 | $50.0000 | $7.0000 | $35.0000 | ต่อ 1M tokens | OpenAI GPT-6 Astra — โมเดลที่มีความสามารถสูงที่สุดของ OpenAI สร้างมาเพื่องานแบบครบวงจรที่ยากที่สุด ได้แก่ การให้เหตุผลที่ซับซ้อน การเขียนโค้ด การใช้งานคอมพิวเตอร์ การวิจัย และการสร้างเอกสาร รองรับอินพุตข้อความและภาพ หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และการตั้งค่าระดับความเข้มข้นของการให้เหตุผลได้ถึง xhigh และ max |
| gpt-6-luna | OpenAI | $0.1000 | $0.5000 | $0.0650 | $0.3250 | ต่อ 1M tokens | OpenAI GPT-6 Luna — โมเดลที่มีประสิทธิภาพสูงสุดของ OpenAI สร้างมาเพื่องานที่มีขอบเขตชัดเจนและปริมาณสูง รองรับอินพุตข้อความและภาพ หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และระดับการให้เหตุผลตั้งแต่ none ถึง max โดยค่าเริ่มต้นคือ medium ใช้ /v1/responses สำหรับการเรียกใช้เครื่องมือ เพราะบน /v1/chat/completions การเรียกฟังก์ชันใช้ได้เฉพาะเมื่อตั้ง reasoning_effort เป็น none บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา คำขอที่มี previous_response_id หรือ conversation จะถูกปฏิเสธ |
| gpt-6-sol | OpenAI | $2.0000 | $10.0000 | $1.3000 | $6.5000 | ต่อ 1M tokens | OpenAI GPT-6 Sol — สร้างมาเพื่องานเขียนโค้ดที่ซับซ้อนและเวิร์กโฟลว์แบบเอเจนต์ รองรับอินพุตข้อความและภาพ หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และระดับการให้เหตุผลตั้งแต่ none ถึง max โดยค่าเริ่มต้นคือ medium ใช้ /v1/responses สำหรับการเรียกใช้เครื่องมือ เพราะบน /v1/chat/completions การเรียกฟังก์ชันใช้ได้เฉพาะเมื่อตั้ง reasoning_effort เป็น none บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา คำขอที่มี previous_response_id หรือ conversation จะถูกปฏิเสธ |
| gpt-6.1-sol | OpenAI | $2.0000 | $10.0000 | $1.3000 | $6.5000 | ต่อ 1M tokens | OpenAI GPT-6.1 Sol — ใกล้เคียง GPT-6 Astra ในงานเขียนโค้ดที่ซับซ้อน การใช้งานคอมพิวเตอร์ และงานระดับมืออาชีพ ด้วยค่าใช้จ่ายที่ต่ำกว่า รองรับอินพุตข้อความและภาพ หน้าต่างบริบท 1,050,000 โทเค็น และเอาต์พุตสูงสุด 128,000 โทเค็น ระดับการให้เหตุผลตั้งแต่ low ถึง max โดยค่าเริ่มต้นคือ medium ไม่รองรับ none และ minimal และโทเค็นการให้เหตุผลคิดค่าบริการเป็นเอาต์พุต เมื่ออินพุตเกิน 272,000 โทเค็น ทุกโทเค็นในคำขอนั้นจะคิดตามอัตราบริบทยาว ใช้ /v1/responses สำหรับการเรียกใช้เครื่องมือ เพราะ /v1/chat/completions ไม่รองรับการเรียกใช้เครื่องมือ บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา คำขอที่มี previous_response_id หรือ conversation จะถูกปฏิเสธ |
| gpt-image-2 | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | ต่อ 1M tokens | OpenAI GPT Image 2 — โมเดลสร้างและแก้ไขภาพระดับล้ำสมัย สำหรับเอาต์พุตคุณภาพสูงที่รวดเร็ว รับอินพุตข้อความและภาพ รองรับขนาดภาพที่ยืดหยุ่นและอินพุตภาพความคมชัดสูง และคิดค่าบริการต่อโทเค็นแทนการคิดต่อการเรียกใช้ ได้แก่ อินพุตข้อความ $5 อินพุตข้อความที่แคชไว้ $1.25 อินพุตภาพ $8 และเอาต์พุตภาพ $30 ต่อ 1M โทเค็น |
| gpt-image-2.5-flare | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | ต่อ 1M tokens | OpenAI GPT Image 2.5 Flare — โมเดลสร้างและแก้ไขภาพจากตระกูล GPT Image 2.5 ของ OpenAI ทั้ง Flare และ gpt-image-2.5-sunburst เป็นบิลด์ที่แยกจากกัน ไม่ใช่ชื่อแทนของโมเดลเดียวกัน และจำหน่ายในราคาเดียวกัน ส่วนตารางจัดอันดับสาธารณะให้คะแนนทั้งสองแยกกัน ราคาโทเค็นมาตรฐานคือ อินพุตข้อความ $5 อินพุตที่แคชไว้ $1.25 อินพุตภาพ $8 และเอาต์พุตภาพ $30 ต่อ 1M โทเค็น |
| gpt-image-2.5-sunburst | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | ต่อ 1M tokens | OpenAI GPT Image 2.5 Sunburst — โมเดลสร้างและแก้ไขภาพจากตระกูล GPT Image 2.5 ของ OpenAI ทั้ง Sunburst และ gpt-image-2.5-flare เป็นบิลด์ที่แยกจากกัน ไม่ใช่ชื่อแทนของโมเดลเดียวกัน และจำหน่ายในราคาเดียวกัน ส่วนตารางจัดอันดับสาธารณะให้คะแนนทั้งสองแยกกัน ราคาโทเค็นมาตรฐานคือ อินพุตข้อความ $5 อินพุตที่แคชไว้ $1.25 อินพุตภาพ $8 และเอาต์พุตภาพ $30 ต่อ 1M โทเค็น |
| grok-4.7 | xAI | $2.0000 | $6.0000 | $0.8000 | $2.4000 | ต่อ 1M tokens | xAI Grok 4.7 — โมเดลระดับแนวหน้าที่สร้างมาเพื่องานเขียนโค้ด งานแบบเอเจนต์ และงานความรู้ รองรับอินพุตข้อความและภาพ พร้อมหน้าต่างบริบท 500,000 โทเค็น ปิดการให้เหตุผลไม่ได้ โดยเลือก reasoning_effort ได้เป็น low, medium, high หรือ xhigh ค่าเริ่มต้นคือ high และโทเค็นการให้เหตุผลคิดค่าบริการเป็นเอาต์พุต เมื่อพรอมต์มีความยาวถึง 200,000 โทเค็น ทุกโทเค็นในคำขอนั้นจะคิดตามอัตราบริบทยาว รับเฉพาะเครื่องมือ function เท่านั้น เครื่องมือฝั่งเซิร์ฟเวอร์ของ xAI เช่น การค้นหาเว็บ การค้นหา X และการรันโค้ด ใช้ไม่ได้ และคำขอที่มีเครื่องมือเหล่านี้จะถูกปฏิเสธ บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา และส่งรายการการให้เหตุผลที่เข้ารหัสจากการตอบกลับก่อนหน้ากลับไปโดยไม่แก้ไข คำขอที่มี previous_response_id หรือ conversation จะถูกปฏิเสธ |
| happyhorse-1.1-i2v | Alibaba | $0.140 | ต่อวินาที | Alibaba HappyHorse 1.1 (I2V) — ภาพเป็นวิดีโอ พร้อมพื้นผิวที่ดีขึ้น ความสอดคล้องของตัวละครข้ามคลิป ความลื่นไหลของการเคลื่อนไหว และการซิงก์ภาพกับเสียง 720P/1080P | |||
| happyhorse-1.1-r2v | Alibaba | $0.140 | ต่อวินาที | Alibaba HappyHorse 1.1 (R2V) — สร้างวิดีโอจากภาพอ้างอิงได้สูงสุด 9 ภาพ คงความสอดคล้องของตัวแบบ ฉาก และสไตล์ได้ดี พร้อมควบคุมมุมกล้อง 720P/1080P | |||
| happyhorse-1.1-t2v | Alibaba | $0.140 | ต่อวินาที | Alibaba HappyHorse 1.1 (T2V) — ข้อความเป็นวิดีโอ พร้อมการเข้าใจความหมาย การควบคุมมุมกล้อง และการสร้างภาพเคลื่อนไหวที่ดีขึ้น ให้วิดีโอ 720P/1080P ที่ลื่นไหล มีรายละเอียด และสมจริงตามหลักฟิสิกส์ | |||
| hy-mt2-lite | Tencent | $0.0440 | $0.1770 | ต่อ 1M tokens | Tencent HY-MT2 Lite — ระดับการแปลหลายภาษาที่ปรับให้เหมาะด้านความหน่วงและต้นทุน ผ่านโปรโตคอล OpenAI Chat Completions รับอินพุตได้สูงสุด 4K โทเค็น และเอาต์พุตสูงสุด 4K โทเค็น รองรับข้อความเท่านั้น | ||
| hy-mt2-plus | Tencent | $0.0740 | $0.2950 | ต่อ 1M tokens | Tencent HY-MT2 Plus — ระดับการแปลหลายภาษาที่ทำตามคำสั่งได้ ผ่านโปรโตคอล OpenAI Chat Completions รับอินพุตได้สูงสุด 4K โทเค็น และเอาต์พุตสูงสุด 4K โทเค็น รองรับข้อความเท่านั้น | ||
| hy-mt2-pro | Tencent | $0.0740 | $0.2950 | ต่อ 1M tokens | Tencent HY-MT2 Pro — ระดับเรือธงด้านการแปลด้วยเครื่องสำหรับการแปลหลายภาษาคุณภาพสูง ผ่านโปรโตคอล OpenAI Chat Completions รับอินพุตได้สูงสุด 4K โทเค็น และเอาต์พุตสูงสุด 4K โทเค็น รองรับข้อความเท่านั้น | ||
| hy3 | Tencent | $0.1320 | $0.5280 | ต่อ 1M tokens | Tencent Hunyuan 3 (Hy3) — โมเดล MoE ขนาด 295B พารามิเตอร์ (ทำงานจริง 21B) บริบทดั้งเดิม 256K และโหมดการคิดสามระดับ (fast / low / deep) โดดเด่นด้านเอเจนต์เขียนโค้ด การเข้าใจเอกสารยาว การรักษาบริบทหลายรอบ และเวิร์กโฟลว์เอเจนต์หลายขั้นตอน รองรับข้อความเท่านั้น | ||
| hy4-preview | Tencent | $0.8340 | $2.5010 | ต่อ 1M tokens | Tencent Hunyuan 4 preview (Hy4 preview) — หน้าต่างบริบท 1M โทเค็น (อินพุตสูงสุด 960K เอาต์พุตสูงสุด 64K) พร้อมการคิดเชิงลึก (ซึ่ง Tencent เรียกว่า preserved thinking) เอาต์พุตแบบมีโครงสร้าง การเรียกฟังก์ชัน และการแคชพรอมต์ รองรับข้อความเท่านั้น เป็น SKU รุ่นพรีวิว ซึ่ง Tencent จะเลิกให้บริการโมเดลพรีวิวเมื่อรุ่นที่เปิดให้ใช้งานทั่วไปออกมาแล้ว | ||
| jev-1.13 | TypeSafe | $0.0462 | ต่อ 1M tokens | TypeSafe Jev 1.13 — โมเดลตัดสินใจแบบ System One ไม่ใช่โมเดลแชต ส่ง state ของแอปพลิเคชัน (สตริง ออบเจ็กต์ JSON หรืออาร์เรย์) พร้อมชุดคำถามแบบมีชนิดไปที่ POST /v1/systemone ได้แก่ choice (เลือกหนึ่งตัวเลือกจากที่คุณกำหนด) score (จัดวางบนระดับที่เรียงลำดับไว้) หรือ noul (ความน่าจะเป็นที่ข้อความแบบใช่/ไม่ใช่จะเป็นจริง) แล้วรับคำตอบแบบมีชนิดพร้อมความน่าจะเป็นของทุกตัวเลือกและค่าความเชื่อมั่น โดยทั่วไปภายใน 70–500 ms คำถามทั้งหมดถูกประเมินแบบขนานกับ state เดียวกัน จึงรวมหลายคำถามไว้ในคำขอเดียวได้ SDK ทางการของ TypeSafe สำหรับ Python และ JavaScript ใช้งานได้ทันทีเพียงตั้ง base URL เป็น https://api.chinaapi.ai คิดค่าบริการตามโทเค็นอินพุตเท่านั้น เอาต์พุตไม่มีค่าใช้จ่าย รับอินพุตเป็นข้อความเท่านั้น สูงสุด 32K โทเค็นต่อคำขอ ภาษาหลักคือภาษาอังกฤษ จึงควรทดสอบภาษาอื่นก่อนนำไปใช้จริง | |||
| jev-latest | TypeSafe | $0.0462 | ต่อ 1M tokens | TypeSafe Jev (latest) — ชื่อแฝงที่ SDK ของ TypeSafe เรียกใช้เมื่อไม่ได้ระบุ model ปัจจุบันให้บริการ jev-1.13 ในราคาเดียวกันและใช้สัญญา System One เดียวกันบน POST /v1/systemone คือรับ state พร้อมคำถามแบบมีชนิด choice score และ noul แล้วส่งคืนคำตอบแบบมีชนิดพร้อมความน่าจะเป็นและค่าความเชื่อมั่น ฟิลด์ model ในผลตอบกลับระบุเวอร์ชันที่ตอบจริง เราจะย้ายชื่อแฝงไปยัง Jev รุ่นใหม่หลังจากตรวจสอบราคาแล้วเท่านั้น หากคุณปรับค่าเกณฑ์ตามเวอร์ชันนี้แล้ว ให้ระบุ jev-1.13 โดยตรง | |||
| kimi-k2.6 | Moonshot | $0.9500 | $4.0000 | $0.7600 | $3.2000 | ต่อ 1M tokens | Moonshot Kimi K2.6 — โมเดลอเนกประสงค์สำหรับการสนทนา การสร้างโค้ด การเข้าใจภาพ และงานเอเจนต์ โดยเขียนโค้ดระยะยาวและทำงานได้ด้วยตนเองดีกว่ารุ่นก่อนหน้า หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ (png, jpeg, webp, gif) และวิดีโอ (mp4, mov, webm และอื่น ๆ) ในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ โหมดการคิดเปิดไว้ตามค่าเริ่มต้นและปิดได้ ส่วน temperature ถูกตรึงไว้ที่ 1.0 เมื่อเปิดการคิด และ 0.6 เมื่อปิด |
| kimi-k2.7-code | Moonshot | $0.9500 | $4.0000 | $0.7600 | $3.2000 | ต่อ 1M tokens | Moonshot Kimi K2.7 Code — โมเดลเฉพาะทางด้านการเขียนโค้ดของ Kimi ซึ่งผู้ให้บริการวัดผลว่าทำตามคำสั่งได้ดีขึ้นและเขียนโค้ดระยะยาวได้ดีกว่า K2.6 พร้อมลดการคิดเกินจำเป็นลงราว 30% โดยเฉลี่ย หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ การคิดเป็นสิ่งบังคับและจะเกิดข้อผิดพลาดหากปิด ส่วน tool_choice จำกัดไว้ที่ auto หรือ none เท่านั้น และต้องส่งต่อ reasoning_content ตลอดการเรียกใช้เครื่องมือหลายขั้นตอน |
| kimi-k2.7-code-highspeed | Moonshot | $1.9000 | $8.0000 | ต่อ 1M tokens | Moonshot Kimi K2.7 Code Highspeed — ระดับที่เน้นปริมาณงานของ K2.7 Code ให้บริการโมเดลเดียวกันที่ความเร็วราว 180 โทเค็นต่อวินาที และสูงสุด 260 โทเค็นในงานที่บริบทสั้น หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ การคิดเป็นสิ่งบังคับและจะเกิดข้อผิดพลาดหากปิด ส่วน tool_choice จำกัดไว้ที่ auto หรือ none เท่านั้น และต้องส่งต่อ reasoning_content ตลอดการเรียกใช้เครื่องมือหลายขั้นตอน | ||
| kimi-k3 | Moonshot | $3.0000 | $15.0000 | $1.9500 | $9.7500 | ต่อ 1M tokens | Moonshot Kimi K3 — โมเดลเรือธงขนาด 2.8 ล้านล้านพารามิเตอร์ สำหรับการเขียนโค้ดระยะยาว งานความรู้แบบครบวงจร และการให้เหตุผลเชิงลึก พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 1,048,576 โทเค็น (ค่าเริ่มต้น 131,072) โมเดลรับข้อความ ภาพที่เข้ารหัส base64 และวิดีโอที่เข้ารหัส base64 แล้วตอบกลับเป็นข้อความ การคิดเปิดอยู่เสมอ โดยระดับความเข้มข้นของการให้เหตุผลอยู่ที่ max ตามค่าเริ่มต้น และ temperature ถูกตรึงไว้ที่ 1.0 รองรับการเรียกใช้เครื่องมือที่กำหนดเองและการโหลดเครื่องมือแบบไดนามิก |
| kling-3.0-turbo | Kuaishou | $0.560 | ต่อคำขอ | Kuaishou Kling 3.0 Turbo — ระดับคุ้มราคาของตระกูล Kling 3.0 สร้างวิดีโอ 720P หรือ 1080P (ค่าเริ่มต้น 720P) ความยาว 3-15 วินาที (ค่าเริ่มต้น 5) ในอัตราส่วน 16:9, 9:16 หรือ 1:1 จากพรอมต์หรือภาพเฟรมแรก เสียงในตัวมาพร้อมเสมอและไม่มีสวิตช์เปิดปิด เมื่อเทียบกับ kling-v3 รุ่นนี้ตัดระดับ 4K การควบคุมเฟรมสุดท้าย และการรับวิดีโอเป็นอินพุตออกไป เพื่อแลกกับความเร็วและต้นทุน 720p 5 วินาทีพร้อมเสียง ≈ $0.56 | |||
| kling-v3 | Kuaishou | $0.420 | ต่อคำขอ | Kuaishou Kling 3.0 — ข้อความเป็นวิดีโอและภาพเป็นวิดีโอ พร้อมเสียงในตัวและความสอดคล้องขององค์ประกอบที่ดีขึ้น คลิปยาว 3-15 วินาที (ค่าเริ่มต้น 5) ในอัตราส่วน 16:9, 9:16 หรือ 1:1 โดยเลือกระดับผ่าน mode ได้แก่ std สำหรับ 720P, pro สำหรับ 1080P และ 4k สำหรับ 4K แบบเนทีฟ เสียงต้องเปิดเองผ่าน sound=on และค่าเริ่มต้นคือปิด ส่วนภาพเป็นวิดีโอรับเฟรมแรกพร้อมเฟรมท้ายที่จะใส่หรือไม่ก็ได้ เริ่มต้นที่ $0.083/วินาที (720p) | |||
| kling-v3-omni | Kuaishou | $0.420 | ต่อคำขอ | Kling 3.0 Omni — สร้างวิดีโอจากหลายภาพอ้างอิง ราคาที่แสดงเป็นของระดับ std (720p, 5 วินาที, ไม่มีเสียง, ไม่มีวิดีโออ้างอิง) คำขอที่ไม่ได้ระบุ mode จะใช้ระดับ pro ซึ่งเป็นค่าเริ่มต้นของต้นทาง และถูกคิดค่าบริการ 1.33 เท่า หรือราว $0.56 สำหรับคลิป 5 วินาทีเดียวกัน ส่วน 4k คิด 5 เท่า กรุณาส่ง mode=std เพื่อให้ถูกคิดตามราคาที่แสดง | |||
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | ต่อ 1M tokens | Meituan LongCat-2.0 — โมเดล MoE แบบเปิดขนาด 1.6T พารามิเตอร์ พร้อมบริบทดั้งเดิม 1M สร้างมาเพื่อการเขียนโค้ดเชิงเอเจนต์และการใช้เครื่องมือระยะยาว เป็นโมเดลการให้เหตุผลที่รองรับข้อความเท่านั้น | ||
| M2-her | MiniMax | $0.3000 | $1.2000 | ต่อ 1M tokens | MiniMax M2-her — โมเดลสนทนาที่สร้างมาเพื่อการสวมบทบาทและการแชทหลายรอบ พร้อมหน้าต่างบริบท 65,536 โทเค็น และคำตอบจำกัดไว้ที่ 2,048 โทเค็น (max_completion_tokens) นอกจาก system / user / assistant แล้ว โมเดลยังรับบทบาทข้อความแบบขยายของผู้ให้บริการบนเอนด์พอยต์แชทที่เข้ากันได้กับ OpenAI ได้แก่ user_system (เพอร์โซนาของผู้ใช้) group (ชื่อของบทสนทนา) และ sample_message_user / sample_message_ai (ตัวอย่างการโต้ตอบที่ใช้กำหนดสไตล์การตอบ) ทุกข้อความที่ใช้บทบาทแบบขยายต้องมีฟิลด์ name หากไม่มี ผู้ให้บริการจะปฏิเสธทั้งคำขอด้วยข้อผิดพลาด 2013 ขณะที่ข้อความ system/user/assistant ทั่วไปไม่ต้องมี name รองรับข้อความเท่านั้น: ไม่รับอินพุตภาพ และเอกสารของผู้ให้บริการไม่ได้ระบุการเรียกใช้เครื่องมือหรือการแคช ทุกการเรียกจะมีโทเค็นเพอร์โซนาส่วนเกินจากฝั่งผู้ให้บริการราว 170 โทเค็นเพิ่มจากพรอมต์ที่มองเห็น ซึ่งคิดค่าบริการเป็นอินพุต | ||
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | ต่อ 1M tokens | Xiaomi MiMo-V2.5 — โมเดลที่รองรับครบทุกโหมดโดยกำเนิด พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K เข้าใจภาพ วิดีโอ เสียง และข้อความได้ในโมเดลเดียว รองรับการคิดเชิงลึก การเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการค้นหาเว็บ พร้อมความสามารถเอเจนต์ครบทุกโหมด | ||
| mimo-v2.5-asr | Xiaomi | $0.0740 | ต่อชั่วโมงเสียง | Xiaomi MiMo v2.5 ASR — โมเดลรู้จำเสียงพูดที่ปรับให้เหมาะกับภาษาจีนและอังกฤษรวมถึงภาษาถิ่นจีน รองรับเสียงที่มีสัญญาณรบกวน เสียงระยะไกล เสียงหลายผู้พูด ตลอดจนการถอดเนื้อเพลง | |||
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | ต่อ 1M tokens | Xiaomi MiMo-V2.5-Pro — โมเดลเรือธงระดับล้านล้านพารามิเตอร์ (ทำงานจริง 42B) พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K ปรับจูนมาสำหรับงานเอเจนต์ที่ใช้งานหนัก รองรับการคิดเชิงลึก การเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการค้นหาเว็บ สร้างได้เฉพาะข้อความ ต่างจาก mimo-v2.5 ตรงที่รายการความสามารถของผู้ให้บริการไม่ได้ระบุการเข้าใจครบทุกโหมด | ||
| mimo-v2.5-tts | Xiaomi | $0.0000 | ต่อ 1 หมื่นอักขระ | Xiaomi MiMo v2.5 TTS — การแปลงข้อความเป็นเสียงพูดที่มีอารมณ์ พร้อมเสียงในตัวแปดเสียง เป็นภาษาจีนสี่เสียงและภาษาอังกฤษสี่เสียง (Mia, Chloe, Milo, Dean) ครอบคลุมภาษาจีนและอังกฤษ รวมถึงสไตล์ภาษาถิ่นตงเป่ย เสฉวน เหอหนาน และกวางตุ้ง กำกับลีลาการพูดได้สองทาง คือคำสั่งกำหนดสไตล์ด้วยภาษาธรรมชาติ และแท็กเสียงแบบอินไลน์สำหรับอารมณ์พื้นฐานและอารมณ์ผสม การหายใจ การถอนหายใจ และจังหวะ รวมถึงโหมดร้องเพลงที่มีเฉพาะโมเดลนี้ในตระกูล MiMo TTS ผลลัพธ์เป็น wav โมโนหรือ pcm16 ที่ 24 kHz และรองรับการสตรีมความหน่วงต่ำ ซึ่งต้องใช้ pcm16 บริบท 8K และเอาต์พุตสูงสุด 8K | |||
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | ต่อ 1 หมื่นอักขระ | Xiaomi MiMo v2.5 TTS VoiceClone — โมเดลโคลนเสียง: ส่งตัวอย่างเสียงอ้างอิงเป็น data URL ในฟิลด์ voice (data:{mime};base64,...) แล้วโมเดลจะสังเคราะห์คำพูดด้วยเสียงนั้นโดยไม่ต้องผ่านขั้นตอนฝึกสอน กำกับข้อมูล หรือปรับจูนใด ๆ รองรับ MP3 (audio/mpeg) หรือ WAV โดยสตริงที่เข้ารหัส base64 ต้องไม่เกิน 10 MB ทั้งนี้ Xiaomi ไม่ได้ประกาศความยาวขั้นต่ำของเสียงอ้างอิง คำสั่งกำหนดสไตล์ด้วยภาษาธรรมชาติและแท็กเสียงแบบอินไลน์สืบทอดมาจาก mimo-v2.5-tts แต่ไม่มีการสตรีม คำขอจะทำงานในโหมดความเข้ากันได้และตอบกลับเมื่อสังเคราะห์เสร็จแล้วเท่านั้น | |||
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | ต่อ 1 หมื่นอักขระ | Xiaomi MiMo v2.5 TTS VoiceDesign — โมเดลออกแบบเสียง: อธิบายเสียงที่ต้องการเป็นภาษาธรรมชาติในฟิลด์ instructions แล้วโมเดลจะสังเคราะห์คำพูดด้วยเสียงที่ออกแบบไว้นั้น | |||
| mimo-v2.6-flash | Xiaomi | $0.1400 | $0.2800 | $0.1260 | $0.2520 | ต่อ 1M tokens | Xiaomi MiMo-V2.6-Flash — โมเดลการให้เหตุผลที่มีประสิทธิภาพและต้นทุนต่ำ เปิดเผยน้ำหนักโมเดล รองรับครบทุกโหมดโดยกำเนิด เข้าใจภาพ วิดีโอ เสียง และข้อความได้ในโมเดลเดียว พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K รองรับการคิดเชิงลึก การเรียกฟังก์ชัน และเอาต์พุตแบบมีโครงสร้าง เหมาะกับงานมืออาชีพประจำวันปริมาณมากที่ให้ความสำคัญกับต้นทุนและปริมาณงานที่รองรับได้ |
| mimo-v2.6-pro | Xiaomi | $0.4350 | $0.8700 | $0.3915 | $0.7830 | ต่อ 1M tokens | Xiaomi MiMo-V2.6-Pro — โมเดลเรือธงด้านการให้เหตุผลระดับล้านล้านพารามิเตอร์ของ Xiaomi ที่เปิดเผยน้ำหนักโมเดล รองรับครบทุกโหมดโดยกำเนิด เข้าใจภาพ วิดีโอ เสียง และข้อความได้ในโมเดลเดียว พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K รองรับการคิดเชิงลึก การเรียกฟังก์ชัน และเอาต์พุตแบบมีโครงสร้าง ออกแบบมาสำหรับโปรเจกต์ที่ซับซ้อน งานเอเจนต์ระยะยาว ความปลอดภัยไซเบอร์ และงานวิจัย |
| mimo-v2.6-pro-ultraspeed | Xiaomi | $4.3500 | $8.7000 | ต่อ 1M tokens | Xiaomi MiMo-V2.6-Pro UltraSpeed — MiMo-V2.6-Pro ที่ให้บริการในโหมดความเร็วสูงพิเศษของ Xiaomi ให้เอาต์พุตเร็วกว่ารุ่นมาตรฐานสูงสุด 20 เท่า เหมาะกับการโต้ตอบแบบเรียลไทม์และงานโปรดักชันที่ไวต่อความหน่วง มีความสามารถเหมือน mimo-v2.6-pro ได้แก่ การเข้าใจภาพ วิดีโอ เสียง และข้อความครบทุกโหมด บริบท 1M เอาต์พุตสูงสุด 128K การคิดเชิงลึก การเรียกฟังก์ชัน และเอาต์พุตแบบมีโครงสร้าง ราคาสิบเท่าของ mimo-v2.6-pro และ Xiaomi จัดสรรความจุของโหมดนี้แยกต่างหาก จึงอาจถูกจำกัดอัตราเมื่อมีคำขอพุ่งสูงอย่างหนัก | ||
| MiniMax-H3 | MiniMax | $0.080 | ต่อวินาที | MiniMax H3 (Hailuo 3.0) — โมเดลวิดีโอมัลติโหมดอเนกประสงค์แบบเปิดรุ่นใหม่ ที่สร้างเสียงสเตอริโอในตัวภายในรอบเดียว ที่ความละเอียด 768P หรือ 2K ความยาว 4-15 วินาที (รับเฉพาะจำนวนเต็ม) ที่ 24 fps ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและ/หรือเฟรมสุดท้าย และการสร้างจากสื่ออ้างอิงด้วยภาพ วิดีโอ หรือเสียง เพื่อกำหนดตัวละคร การเคลื่อนไหว มุมกล้อง สไตล์ น้ำเสียง หรือจังหวะการตัดต่อ ทั้งนี้ไม่สามารถใช้ภาพเป็นวิดีโอร่วมกับการสร้างจากสื่ออ้างอิงในคำขอเดียวกันได้ โมเดลรับวิดีโอ H.264/H.265 ภาพ JPG, JPEG, PNG, WEBP, HEIC และ HEIF และเสียง WAV หรือ MP3 โดยพรอมต์ยาวได้ถึง 7,000 อักขระ $0.08/วินาที ที่ 768P และ $0.13/วินาที ที่ 2K | |||
| MiniMax-Hailuo-02 | MiniMax | $0.280 | ต่อคำขอ | MiniMax Hailuo 02 — การสร้างวิดีโอราคาประหยัดที่ครอบคลุมทั้งข้อความเป็นวิดีโอและภาพเป็นวิดีโอ ที่ 24 fps โดย 512p และ 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที ระดับ 512p เป็นจุดเริ่มต้นของตระกูล Hailuo | |||
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | ต่อคำขอ | MiniMax Hailuo 2.3 — ข้อความเป็นวิดีโอและภาพเป็นวิดีโอ ที่ผู้ให้บริการชูจุดเด่นเรื่องการทำตามคำสั่ง ที่ 24 fps โดย 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที 768p 6 วินาที = $0.28 | |||
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | ต่อคำขอ | MiniMax Hailuo 2.3 Fast — ระดับที่เน้นความเร็วและต้นทุนของ Hailuo 2.3 มุ่งไปที่ภาพเป็นวิดีโอและความสมจริงของการเคลื่อนไหวเชิงฟิสิกส์ ที่ 24 fps โดย 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที 768p 6 วินาที = $0.19 | |||
| MiniMax-M2 | MiniMax | $0.3000 | $1.2000 | ต่อ 1M tokens | MiniMax M2 — รุ่นแรกที่ MiniMax เปิดตัวสำหรับการเขียนโค้ดอย่างมีประสิทธิภาพและเวิร์กโฟลว์เอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น เป็นระดับที่เก่าที่สุดที่ผู้ให้บริการยังคงให้บริการอยู่ และเป็นระดับเดียวในกลุ่มรุ่นเก่าที่ไม่มีรุ่นย่อย highspeed รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ เป็นโมเดลรุ่นเก่าตามที่ผู้ให้บริการกำหนด ซึ่ง MiniMax ระบุว่ายังคงให้บริการตามปกติ คงไว้เพื่อความเข้ากันได้ของเวอร์ชัน เนื่องจากลูกค้าตรึงชื่อโมเดลไว้กับรุ่นใดรุ่นหนึ่ง มีการเผยแพร่น้ำหนักโมเดลแบบเปิดบน Hugging Face | ||
| MiniMax-M2.1 | MiniMax | $0.3000 | $1.2000 | ต่อ 1M tokens | MiniMax M2.1 — โมเดลข้อความที่สร้างมาเพื่อการเขียนโปรแกรมหลายภาษา พร้อมหน้าต่างบริบท 204,800 โทเค็น และเอาต์พุตที่ความเร็วราว 60 โทเค็นต่อวินาที รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ เป็นโมเดลรุ่นเก่าตามที่ผู้ให้บริการกำหนด ซึ่ง MiniMax ระบุว่ายังคงให้บริการตามปกติ คงไว้เพื่อความเข้ากันได้ของเวอร์ชัน เนื่องจากลูกค้าตรึงชื่อโมเดลไว้กับรุ่นใดรุ่นหนึ่ง มีการเผยแพร่น้ำหนักโมเดลแบบเปิดบน Hugging Face | ||
| MiniMax-M2.5 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | ต่อ 1M tokens | MiniMax M2.5 — โมเดลข้อความที่ผู้ให้บริการวางตำแหน่งไว้ที่ประสิทธิภาพระดับแนวหน้าในราคาต่ำสำหรับงานที่ซับซ้อน พร้อมหน้าต่างบริบท 204,800 โทเค็น และเอาต์พุตที่ความเร็วราว 60 โทเค็นต่อวินาที รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ เป็นโมเดลรุ่นเก่าตามที่ผู้ให้บริการกำหนด ซึ่ง MiniMax ระบุว่ายังคงให้บริการตามปกติ คงไว้เพื่อความเข้ากันได้ของเวอร์ชัน เนื่องจากลูกค้าตรึงชื่อโมเดลไว้กับรุ่นใดรุ่นหนึ่ง มีการเผยแพร่น้ำหนักโมเดลแบบเปิดบน Hugging Face |
| MiniMax-M2.7 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | ต่อ 1M tokens | MiniMax M2.7 — โมเดลข้อความสำหรับการแชท การเขียนโค้ด งานสำนักงาน และงานเอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น และเอาต์พุตที่ความเร็วราว 60 โทเค็นต่อวินาที รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ รองรับการเรียกใช้เครื่องมือ ส่วนการคิดเปิดอยู่เสมอและปิดไม่ได้ |
| MiniMax-M2.7-highspeed | MiniMax | $0.6000 | $2.4000 | ต่อ 1M tokens | MiniMax M2.7 Highspeed — โมเดล M2.7 ตัวเดิมที่ให้บริการที่ความเร็วราว 100 โทเค็นต่อวินาที สำหรับการเขียนโค้ดที่ความหน่วงต่ำและเวิร์กโฟลว์เอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ รองรับการเรียกใช้เครื่องมือ ส่วนการคิดเปิดอยู่เสมอและปิดไม่ได้ | ||
| MiniMax-M3 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | ต่อ 1M tokens | MiniMax M3 — โมเดลเขียนโค้ดแบบมัลติโหมดระดับแนวหน้า สำหรับการให้เหตุผลเชิงเอเจนต์ การใช้เครื่องมือ และการทำงานตามโครงสร้างที่กำหนด พร้อมหน้าต่างบริบท 1,000,000 โทเค็น โมเดลรับข้อความ ภาพขนาดไม่เกิน 10 MB และวิดีโอไม่เกิน 50 MB แบบส่งมาในคำขอ หรือไม่เกิน 512 MB ผ่าน Files API แล้วตอบกลับเป็นข้อความ รองรับการเรียกใช้เครื่องมือ โดยการคิดเป็นตัวเลือกไม่ใช่สิ่งที่เปิดอยู่ตลอด |
| minimax-music-v3.0 | MiniMax | $0.1481 | ต่อคำขอ | MiniMax Music 3.0 — การสร้างเพลงเต็มเพลงแบบซิงโครนัสจากพรอมต์ด้านดนตรีและเนื้อเพลงที่จะใส่หรือไม่ก็ได้ พร้อมโหมดบรรเลง (instrumental) การปรับปรุงเนื้อเพลง และเอาต์พุตเสียงแบบ URL หรือ hex พรอมต์รองรับได้สูงสุด 2,000 อักขระ และเนื้อเพลงสูงสุด 3,500 อักขระ | |||
| muse-spark-1.2-contributor | Meta | $0.1000 | $0.2000 | $0.0650 | $0.1300 | ต่อ 1M tokens | Meta อาจใช้พรอมต์ที่ส่งไปยังโมเดลนี้และเอาต์พุตที่โมเดลสร้างขึ้นเพื่อฝึกโมเดลรุ่นต่อไปของ Meta ตามเงื่อนไขของระดับ Contributor ดังนั้นโปรดอย่าส่งข้อมูลที่ละเอียดอ่อนหรือเป็นความลับ Meta Muse Spark 1.2 (ระดับ Contributor) คือเวอร์ชันก่อนหน้าของ Muse Spark เป็นโมเดลการให้เหตุผลที่ให้เหตุผลก่อนตอบทุกครั้ง และปิดการให้เหตุผลไม่ได้ ตั้งค่า reasoning_effort ได้เป็น minimal, low, medium, high หรือ xhigh ระดับนี้ไม่รองรับ none และ max และหากไม่ระบุ reasoning_effort โมเดลจะเลือกระดับเอง โทเค็นการให้เหตุผลคิดค่าบริการเป็นเอาต์พุต และอินพุตที่แคชไว้คิดค่าบริการตามอัตราอินพุตที่แคชไว้ ไม่มีการค้นหาเว็บ และคำขอที่มีการค้นหาเว็บหรือเครื่องมือประเภทอื่นนอกจาก function จะถูกปฏิเสธ ส่งคำขอไปที่ /v1/chat/completions |
| muse-spark-1.3-contributor | Meta | $0.1000 | $0.2000 | $0.0650 | $0.1300 | ต่อ 1M tokens | Meta อาจใช้พรอมต์ที่ส่งไปยังโมเดลนี้และเอาต์พุตที่โมเดลสร้างขึ้นเพื่อฝึกโมเดลรุ่นต่อไปของ Meta ตามเงื่อนไขของระดับ Contributor ดังนั้นโปรดอย่าส่งข้อมูลที่ละเอียดอ่อนหรือเป็นความลับ Meta Muse Spark 1.3 (ระดับ Contributor) คือเวอร์ชันล่าสุดของ Muse Spark ซึ่งปรับแต่งมาสำหรับเวิร์กโฟลว์แบบเอเจนต์และการเขียนโค้ด เป็นโมเดลการให้เหตุผลที่ให้เหตุผลก่อนตอบทุกครั้ง และปิดการให้เหตุผลไม่ได้ ตั้งค่า reasoning_effort ได้เป็น minimal, low, medium, high หรือ xhigh ระดับนี้ไม่รองรับ none และ max และหากไม่ระบุ reasoning_effort โมเดลจะเลือกระดับเอง โทเค็นการให้เหตุผลคิดค่าบริการเป็นเอาต์พุต และอินพุตที่แคชไว้คิดค่าบริการตามอัตราอินพุตที่แคชไว้ ไม่มีการค้นหาเว็บ และคำขอที่มีการค้นหาเว็บหรือเครื่องมือประเภทอื่นนอกจาก function จะถูกปฏิเสธ ส่งคำขอไปที่ /v1/chat/completions |
| qwen-audio-3.0-asr-flash | Alibaba | $0.1260 | ต่อชั่วโมงเสียง | Alibaba Qwen-Audio-3.0-ASR-Flash — การรู้จำเสียงพูดแบบไม่เรียลไทม์บนฐาน Qwen-Audio 3.0 ครอบคลุม 30 ภาษาและกลุ่มภาษาถิ่นจีนหลักทั้งเจ็ด (กวานฮว่า อู๋ เซียง กั้น แคะ หมิ่น เยว่) รวมถึงสำเนียงท้องถิ่นกว่า 20 สำเนียง การทำนายเครื่องหมายวรรคตอนและการทำข้อความให้เป็นมาตรฐานจะแปลงตัวเลข วันที่ และจำนวนเงินให้อยู่ในรูปแบบมาตรฐาน ส่วนคำสำคัญและบริบทของพรอมป์ตช่วยเพิ่มความแม่นยำกับคำศัพท์เฉพาะทาง รับไฟล์เสียงได้สูงสุด 5 นาทีหรือ 2 GB ต่อคำขอ | |||
| qwen-audio-3.0-realtime-flash | Alibaba | $0.2900 | $0.8800 | ต่อ 1M tokens | Alibaba Qwen-Audio-3.0-Realtime-Flash — การสนทนาด้วยเสียงแบบสองทางพร้อมกันบนเซสชัน WebSocket จากตระกูลที่ผู้ให้บริการระบุว่าครองอันดับหนึ่งโดยรวมในหมวด Speech-to-Speech ของ Artificial Analysis รุ่นความเร็วสูงนี้ปรับแต่งมาเพื่อหน่วงเวลาตอบสนองแบบครบวงจรที่ต่ำที่สุด เชื่อมต่อผ่าน GET /v1/realtime อินพุตเสียงและเอาต์พุตเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความมาก | ||
| qwen-audio-3.0-realtime-plus | Alibaba | $1.0000 | $8.0000 | ต่อ 1M tokens | Alibaba Qwen-Audio-3.0-Realtime-Plus — การสนทนาด้วยเสียงแบบสองทางพร้อมกันบนเซสชัน WebSocket ซึ่งผู้ให้บริการระบุว่าครองอันดับหนึ่งโดยรวมในหมวด Speech-to-Speech ของ Artificial Analysis รุ่นมาตรฐานเน้นคุณภาพของคำตอบ โดยคงความสามารถในการให้เหตุผลจากเสียงไว้ครบ ขณะที่การอนุมานแบบขนานและการสตรีมแบบครบวงจรช่วยกดหน่วงเวลาให้ต่ำ เชื่อมต่อผ่าน GET /v1/realtime อินพุตเสียงและเอาต์พุตเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความมาก | ||
| qwen-audio-3.0-tts-flash | Alibaba | $0.1800 | ต่อ 1 หมื่นอักขระ | Alibaba Qwen-Audio-3.0-TTS-Flash — การสังเคราะห์เสียงพูดบนฐาน Qwen-Audio 3.0 ที่ปรับมาเพื่อการโต้ตอบแบบเรียลไทม์ ครอบคลุมภาษาชนกลุ่มน้อยและภาษาถิ่นจีนมากกว่ารุ่นก่อน การทำตามคำสั่งแบบอิสระและแท็กควบคุมละเอียดช่วยกำหนดอารมณ์ น้ำเสียง ตัวละคร ความเร็ว และระดับเสียง อีกทั้งทนต่อเสียงรบกวนและเสียงก้องได้ดีขึ้น รุ่น Flash ปรับให้สังเคราะห์เสียงด้วยหน่วงเวลาต่ำ เหมาะกับผู้ช่วยเสียง การสนทนาสด และงานบริการลูกค้า คิดค่าบริการตามจำนวนอักขระ (1 โทเค็น = 1 อักขระ) ใช้ได้ทั้งแบบร้องขอ/ตอบกลับ และแบบเซสชัน WebSocket เรียลไทม์ | |||
| qwen-audio-3.0-tts-plus | Alibaba | $0.2500 | ต่อ 1 หมื่นอักขระ | Alibaba Qwen-Audio-3.0-TTS-Plus — การสังเคราะห์เสียงพูดคุณภาพสูงบนฐาน Qwen-Audio 3.0 ครอบคลุมภาษาชนกลุ่มน้อยและภาษาถิ่นจีนมากกว่ารุ่นก่อน พร้อมการออกเสียงถิ่นที่เป็นธรรมชาติขึ้นอย่างเห็นได้ชัด การทำตามคำสั่งแบบอิสระและแท็กควบคุมละเอียดช่วยกำหนดอารมณ์ น้ำเสียง ตัวละคร ความเร็ว ระดับเสียง และสไตล์ อีกทั้งทนต่อเสียงรบกวนและเสียงก้องได้ดีขึ้น รุ่น Plus เน้นความสมจริงและพลังการแสดงออก เหมาะกับงานผลิตคอนเทนต์ หนังสือเสียง การพากย์ และเสียงประจำแบรนด์ คิดค่าบริการตามจำนวนอักขระ (1 โทเค็น = 1 อักขระ) ใช้ได้ทั้งแบบร้องขอ/ตอบกลับ และแบบเซสชัน WebSocket เรียลไทม์ | |||
| qwen-flash-character | Alibaba | $0.0500 | $0.4000 | ต่อ 1M tokens | Alibaba Qwen-Flash-Character — โมเดลสวมบทบาทหลายภาษาของ Qwen (เวอร์ชันไดนามิก โดยผู้ให้บริการจะประกาศการอัปเดตล่วงหน้า) ปรับจูนมาเพื่อบทสนทนาของตัวละครที่ซื่อตรงต่อเพอร์โซนา ได้แก่ การทำตามคำสั่งภายในกรอบเพอร์โซนา การพาหัวข้อสนทนาให้คืบหน้า การรับฟัง และความเห็นอกเห็นใจ หน้าต่างบริบท 8,192 โทเค็น รับข้อความเข้า ตอบข้อความออก ไม่มีโหมดการคิด การเรียกใช้เครื่องมือ เครื่องมือในตัว หรือเอาต์พุตแบบมีโครงสร้าง แคชเซสชันของผู้ให้บริการทำงานโดยอัตโนมัติที่ฝั่งผู้ให้บริการ | ||
| qwen-image-3.0 | Alibaba | $0.030 | ต่อคำขอ | Alibaba Qwen-Image-3.0 — รุ่นมาตรฐานของตระกูลภาพ Qwen ครอบคลุมทั้งการสร้างภาพจากข้อความและการแก้ไขภาพ พร้อมการเรนเดอร์ตัวอักษรขนาดเล็กได้แม่นยำถึง 10px รองรับ 12 ภาษาและแบบอักษรกว่า 20 แบบ รับพรอมป์ตได้สูงสุด 4,500 โทเค็น คืนภาพได้สูงสุด 6 ภาพต่อคำขอ และสร้างได้สูงสุด 2048x2048 | |||
| qwen-image-3.0-pro | Alibaba | $0.040 | ต่อคำขอ | Alibaba Qwen-Image-3.0-Pro — รุ่นมืออาชีพของตระกูลภาพ Qwen สร้างมาเพื่อผลิตเลย์เอาต์ที่อัดแน่นด้วยข้อมูล (หนังสือพิมพ์ สตอรีบอร์ด เมนู ข้อสอบ) ได้ในครั้งเดียว รับพรอมป์ตได้สูงสุด 4,500 โทเค็น เรนเดอร์ตัวอักษรขนาด 10px รองรับ 12 ภาษาและแบบอักษรกว่า 20 แบบ คืนภาพได้สูงสุด 6 ภาพต่อคำขอ และสร้างได้สูงสุด 2048x2048 รองรับทั้งการสร้างภาพจากข้อความและการแก้ไขภาพ | |||
| qwen-mt-image-2.0 | Alibaba | $0.0006 | ต่อคำขอ | Alibaba Qwen-MT-Image 2.0 — การแปลภาพ: เขียนข้อความภายในภาพใหม่เป็นอีกภาษาหนึ่งโดยคงเลย์เอาต์ แบบอักษร และงานภาพรอบข้างไว้ รองรับ 55 ภาษาโดยแปลได้ทุกทิศทาง เรียกใช้ผ่านเอนด์พอยต์ images/edits ของ OpenAI โดยใส่ URL ภาพ http(s) สาธารณะในฟิลด์ image พร้อม target_lang (ต้องระบุ; รหัส ISO หรือชื่อภาษาเป็นภาษาอังกฤษ) และ source_lang (ไม่บังคับ ค่าเริ่มต้นคือ auto) ส่วน prompt เป็นฟิลด์ที่ต้องมีตามรูปแบบของเอนด์พอยต์แต่จะถูกละเว้น ออบเจกต์ ext ที่ไม่บังคับจะส่งผ่าน domainHint, sensitives, terminologies และ config.imageSegment ของผู้ให้บริการไปโดยไม่เปลี่ยนแปลง ส่งกลับ URL ภาพ JPG ขนาดเท่าเดิมหนึ่งรายการที่ใช้ได้ 24 ชั่วโมง อินพุตด้านละ 15-8192 px อัตราส่วนภาพ 1:10 ถึง 10:1 ขนาดไม่เกิน 100 MB ไม่รับไฟล์อัปโหลดและ data URL ผู้ให้บริการจำกัดอัตราการเรียกโมเดลนี้ไว้ที่ 1 คำขอต่อนาที และคิดค่าบริการหนึ่งภาพแม้ไม่พบข้อความที่แปลได้ (จะส่งภาพต้นฉบับกลับมา) ให้บริการผ่านช่องทางทางการของ Alibaba เพียงช่องทางเดียว | |||
| qwen3-asr-flash | Alibaba | $0.1260 | ต่อชั่วโมงเสียง | Alibaba Qwen3-ASR-Flash — การรู้จำเสียงพูดที่สร้างบนโมเดลพื้นฐาน Qwen3 ซึ่งระบุภาษาที่กำลังพูดโดยอัตโนมัติและถอดเสียงได้ 11 ภาษา โดยตระกูล Qwen3-ASR ระบุภาษาจีนกลางไว้ควบคู่กับภาษาเสฉวน หมิ่นหนาน อู๋ และกวางตุ้ง รวมถึงสำเนียงภาษาอังกฤษหลายแบบ โมเดลรับไฟล์ aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma และ wmv ยาวไม่เกิน 5 นาทีและไม่เกิน 10 MB ต่อคำขอ อินพุต pcm ต้องเป็น 16 kHz ส่วนรูปแบบอื่นจะถูกสุ่มสัญญาณใหม่เป็น 16 kHz ก่อนการรู้จำ | |||
| qwen3-tts-flash | Alibaba | $0.1100 | ต่อ 1 หมื่นอักขระ | Alibaba Qwen3-TTS-Flash — การแปลงข้อความเป็นเสียงพูดที่มีความหน่วงต่ำ พร้อมเสียงในตัวที่มีอารมณ์ 17 เสียง ครอบคลุมภาษาจีน อังกฤษ เยอรมัน อิตาลี โปรตุเกส สเปน ญี่ปุ่น เกาหลี ฝรั่งเศส และรัสเซีย พร้อมโหมดอัตโนมัติสำหรับข้อความที่ปนหลายภาษา และการออกเสียงตามภาษาถิ่น โมเดลรับข้อความได้สูงสุด 512 โทเค็นต่อคำขอ และรองรับการสังเคราะห์ทั้งแบบสตรีมมิงและไม่สตรีมมิง | |||
| qwen3.5-livetranslate-flash-realtime | Alibaba | $0.5500 | $20.0000 | ต่อ 1M tokens | Alibaba Qwen3.5-LiveTranslate-Flash-Realtime — การแปลพร้อมกันสำหรับเสียงและวิดีโอบนเซสชัน WebSocket สร้างบนฐาน Qwen3.5-Omni ผสานการจัดแนวข้ามภาษาและข้ามโมดัลเข้ากับการเสริมด้วยข้อมูลภาพ ฟังได้ 60 ภาษาและพูดได้ 29 ภาษา เชื่อมต่อผ่าน GET /v1/realtime โครงสร้างราคาต่างจากโมเดลเรียลไทม์ตัวอื่น คือ **ไม่มีอัตราสำหรับอินพุตข้อความ** อินพุตคิดเป็นเสียงหรือภาพ ส่วนเอาต์พุตคิดเป็นข้อความหรือเสียง | ||
| qwen3.5-ocr | Alibaba | $0.1000 | $0.3500 | ต่อ 1M tokens | Alibaba Qwen3.5-OCR — สมาชิกสาย OCR ของตระกูล Qwen3.5 สร้างมาเพื่อการแยกวิเคราะห์เอกสาร การระบุตำแหน่งข้อความ และการดึงข้อมูลสำคัญ โดยผู้ให้บริการระบุถึงการพัฒนาที่ชัดเจนกับบัตรประจำตัวและใบอนุญาตที่ใช้งานจริง โมเดลรับข้อความและภาพเป็นอินพุต แล้วตอบกลับเป็นข้อความ | ||
| qwen3.5-omni-flash | Alibaba | $0.4000 | $2.2000 | ต่อ 1M tokens | Alibaba Qwen3.5-Omni-Flash — รุ่นความเร็วสูงของตระกูลออมนิโมดัล Qwen3.5 เข้าใจและสนทนาได้ทั้งข้อความ ภาพ เสียง และวิดีโอที่มีเสียง รองรับเสียงยาวกว่า 10 ชั่วโมง และวิดีโอที่มีเสียงแบบ 720P (1 FPS) ยาวกว่า 400 วินาทีต่อบทสนทนา โดยรับเสียงเข้าได้กว่า 60 ภาษาและพูดออกได้กว่า 30 ภาษา อินพุตเสียงและเอาต์พุตที่มีเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความ | ||
| qwen3.5-omni-flash-realtime | Alibaba | $0.5500 | $3.3000 | ต่อ 1M tokens | Alibaba Qwen3.5-Omni-Flash-Realtime — รุ่นเรียลไทม์ความเร็วสูงของตระกูลออมนิโมดัล Qwen3.5 เปิดเซสชัน WebSocket ค้างไว้เพื่อสนทนาด้วยเสียงแบบสองทางพร้อมกัน เข้าใจข้อความ ภาพ เสียง และวิดีโอที่มีเสียง รับเสียงเข้าได้กว่า 60 ภาษาและพูดออกได้กว่า 30 ภาษา พร้อมการกำหนดน้ำเสียง การค้นเว็บ การเรียกฟังก์ชันซับซ้อน และการขัดจังหวะตามความหมาย เชื่อมต่อผ่าน GET /v1/realtime อินพุตเสียงและเอาต์พุตที่มีเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความมาก | ||
| qwen3.5-omni-plus | Alibaba | $1.4000 | $8.3000 | ต่อ 1M tokens | Alibaba Qwen3.5-Omni-Plus — รุ่นสมรรถนะสูงของตระกูลออมนิโมดัล Qwen3.5 เข้าใจและสนทนาได้ทั้งข้อความ ภาพ เสียง และวิดีโอที่มีเสียง รองรับเสียงยาวกว่า 10 ชั่วโมง และวิดีโอที่มีเสียงแบบ 720P (1 FPS) ยาวกว่า 400 วินาทีต่อบทสนทนา โดยรับเสียงเข้าได้กว่า 60 ภาษาและพูดออกได้กว่า 30 ภาษา มีหน้าต่างบริบท 65,536 โทเค็น อินพุตเสียงและเอาต์พุตที่มีเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความ | ||
| qwen3.5-omni-plus-realtime | Alibaba | $2.1000 | $12.4000 | ต่อ 1M tokens | Alibaba Qwen3.5-Omni-Plus-Realtime — รุ่นเรียลไทม์ของตระกูลออมนิโมดัล Qwen3.5 เปิดเซสชัน WebSocket ค้างไว้เพื่อสนทนาด้วยเสียงแบบสองทางพร้อมกัน เข้าใจข้อความ ภาพ เสียง และวิดีโอที่มีเสียง รับเสียงเข้าได้กว่า 60 ภาษาและพูดออกได้กว่า 30 ภาษา พร้อมการกำหนดน้ำเสียง การค้นเว็บ การเรียกฟังก์ชันซับซ้อน และการขัดจังหวะตามความหมาย เชื่อมต่อผ่าน GET /v1/realtime อินพุตเสียงและเอาต์พุตที่มีเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความมาก | ||
| qwen3.6-27b | Alibaba | $0.6000 | $3.6000 | ต่อ 1M tokens | Alibaba Qwen3.6-27B — โมเดล Dense ภาษาเชิงภาพโดยกำเนิดขนาด 27 พันล้านพารามิเตอร์ของตระกูล Qwen3.6 แบบเปิดน้ำหนัก ซึ่งผู้ให้บริการจัดให้เหนือกว่า 3.5-27B ในด้านการเขียนโค้ดเชิงเอเจนต์ STEM และการให้เหตุผล รวมถึงปัญญาเชิงพื้นที่ การระบุตำแหน่งและตรวจจับวัตถุ มีหน้าต่างบริบท 262,144 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ | ||
| qwen3.6-35b-a3b | Alibaba | $0.3750 | $2.2500 | ต่อ 1M tokens | Alibaba Qwen3.6-35B-A3B — โมเดล MoE ภาษาเชิงภาพโดยกำเนิดขนาด 35 พันล้านพารามิเตอร์ โดยเปิดใช้งานราว 3 พันล้าน แบบเปิดน้ำหนัก ผสาน attention เชิงเส้นเข้ากับ Mixture of Experts แบบเบาบางเพื่อเพิ่มประสิทธิภาพการอนุมาน มีหน้าต่างบริบท 262,144 โทเค็น เอาต์พุตสูงสุด 65,536 โทเค็น และรับภาพได้สูงสุด 256 ภาพหรือวิดีโอ 64 คลิปต่อคำขอ โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เครื่องมือในตัว และเอาต์พุตแบบมีโครงสร้าง | ||
| qwen3.6-flash | Alibaba | $0.2500 | $1.5000 | ต่อ 1M tokens | Alibaba Qwen3.6-Flash — โมเดลภาษาเชิงภาพที่ทำงานเร็ว ซึ่งผู้ให้บริการชูจุดเด่นด้านการเขียนโค้ดเชิงเอเจนต์และปัญญาเชิงพื้นที่ พร้อมการพัฒนาที่ชัดเจนในการระบุตำแหน่งและตรวจจับวัตถุ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 65,536 โทเค็น และงบประมาณห่วงโซ่ความคิด 131,072 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชันและการแคชบริบท | ||
| qwen3.6-plus | Alibaba | $0.5000 | $3.0000 | $0.4250 | $2.5500 | ต่อ 1M tokens | Alibaba Qwen3.6-Plus — โมเดลสมดุลสำหรับการให้เหตุผลทั่วไปและการใช้เครื่องมือ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 65,536 โทเค็น และงบประมาณห่วงโซ่ความคิด 81,920 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง การค้นหาเว็บ การเติมข้อความต่อจากส่วนนำ และการแคชบริบท |
| qwen3.7-flash | Alibaba | $0.0300 | $0.1300 | ต่อ 1M tokens | Alibaba Qwen3.7-Flash — รุ่นความเร็วสูงของตระกูลภาษาเชิงภาพโดยกำเนิด Qwen3.7 ซึ่งผู้ให้บริการชูจุดเด่นด้านงานเอเจนต์แบบมัลติโมดัล (เอเจนต์ค้นหาและเอเจนต์ CI) และการทำงานแบบครบวงจรที่นิ่งกว่า 3.6-Flash มีหน้าต่างบริบท 1,000,000 โทเค็น เอาต์พุตสูงสุด 65,536 โทเค็น และรับภาพได้สูงสุด 256 ภาพหรือวิดีโอ 64 คลิปต่อคำขอ โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับโหมดการคิด การเรียกฟังก์ชัน เครื่องมือในตัว และเอาต์พุตแบบมีโครงสร้าง ราคาแบ่งเป็นสามช่วงตามความยาวบริบท คำขอที่บริบทยาวจึงมีราคาต่อโทเค็นสูงกว่าคำขอสั้น | ||
| qwen3.7-max | Alibaba | $2.5000 | $7.5000 | ต่อ 1M tokens | Alibaba Qwen3.7-Max — เรือธงแบบปิดซอร์ส วางตำแหน่งไว้สำหรับการเขียนโปรแกรม งานสำนักงานและงานเพิ่มผลิตภาพ รวมถึงการทำงานอัตโนมัติในระยะยาว มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท | ||
| qwen3.7-plus | Alibaba | $0.4000 | $1.6000 | $0.3000 | $1.2000 | ต่อ 1M tokens | Alibaba Qwen3.7-Plus — โมเดลเอเจนต์ลูกผสมแบบมัลติโหมด ที่รับรู้ฉากในโลกจริง อ่านหน้าจอและควบคุมส่วนติดต่อผู้ใช้แบบกราฟิก สร้างโค้ดจากภาพอ้างอิง และนำทางแบบครบวงจรภายในแอปบนมือถือ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท |
| qwen3.8-2.4t-a95b | Alibaba | $2.0000 | $6.0000 | ต่อ 1M tokens | Alibaba Qwen3.8-2.4T-A95B — รุ่นเปิดน้ำหนักของโมเดลเรือธง Qwen3.8 เป็นโมเดล MoE แบบเบาบางที่มีพารามิเตอร์รวม 2.4 ล้านล้าน และเปิดใช้งานราว 9.5 หมื่นล้านต่อขั้น ใช้สถาปัตยกรรม attention แบบผสม มีหน้าต่างบริบท 1,000,000 โทเค็น โมเดลรับข้อความเป็นอินพุต แล้วตอบกลับเป็นข้อความ โหมดคิดและไม่คิดคิดค่าบริการอัตราเดียวกัน และราคาเอาต์พุตรวมห่วงโซ่ความคิดแล้ว | ||
| qwen3.8-27b | Alibaba | $0.5000 | $3.0000 | ต่อ 1M tokens | Alibaba Qwen3.8-27B — โมเดล Dense ภาษาเชิงภาพโดยกำเนิดขนาด 27 พันล้านพารามิเตอร์ของตระกูล Qwen3.8 แบบเปิดน้ำหนัก ซึ่งผู้ให้บริการจัดให้เหนือกว่า 3.6-27B ในงานเขียนโค้ดและงานสำนักงาน ทั้งในโหมดข้อความและโหมดภาพ มีหน้าต่างบริบท 1,000,000 โทเค็น โมเดลรับข้อความและภาพเป็นอินพุต แล้วตอบกลับเป็นข้อความ โหมดคิดและไม่คิดคิดค่าบริการอัตราเดียวกัน และราคาเอาต์พุตรวมห่วงโซ่ความคิดแล้ว | ||
| qwen3.8-flash | Alibaba | $0.1500 | $0.4700 | $0.1125 | $0.3525 | ต่อ 1M tokens | Alibaba Qwen3.8-Flash — รุ่นความเร็วสูงของตระกูล Qwen3.8 เป็นโมเดลมัลติโมดัลโดยกำเนิดที่ผู้ให้บริการวางตำแหน่งไว้สำหรับการช่วยเขียนโค้ด การทำงานร่วมกันของเอเจนต์ และการทำความเข้าใจภาพและเอกสารที่ปริมาณงานสูง มีหน้าต่างบริบท 1,000,000 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับโหมดการคิด การเรียกฟังก์ชัน เครื่องมือในตัว และเอาต์พุตแบบมีโครงสร้าง รองรับทั้งโปรโตคอล OpenAI และ Anthropic Messages |
| qwen3.8-max | Alibaba | $2.0000 | $6.0000 | $1.9000 | $5.7000 | ต่อ 1M tokens | Alibaba Qwen3.8-Max — โมเดล MoE เรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ และเป็นโมเดลที่เก่งที่สุดในตระกูล Qwen โดยผู้ให้บริการระบุว่าพัฒนาขึ้นมากในด้านการเขียนโค้ดและงานสำนักงาน มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น รับอินพุตข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท |
| qwen3.8-max-0902 | Alibaba | $2.0000 | $6.0000 | ต่อ 1M tokens | Alibaba Qwen3.8-Max-0902 — สแนปช็อตวันที่ 2026-09-02 ของ Qwen3.8-Max (ชื่อแทนของผู้ให้บริการคือ qwen3.8-max-2026-09-02) โมเดล MoE เรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ ซึ่งถูกคงไว้ไม่เปลี่ยนแปลงเพื่อให้ระบบที่เชื่อมต่อตรึงบิลด์นี้ได้อย่างแม่นยำ ผู้ให้บริการระบุถึงการเขียนโค้ดที่ลึกขึ้นสำหรับโปรเจกต์วิศวกรรมที่ซับซ้อนและการพัฒนาแบบอัตโนมัติระยะยาว หน้าต่างบริบท 1,000,000 โทเค็น เอาต์พุตสูงสุด 131,072 โทเค็น รับอินพุตข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ รองรับโหมดการคิด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง ชื่อแบบไดนามิก qwen3.8-max จะย้ายไปยังบิลด์ที่ใหม่กว่าเมื่อผู้ให้บริการออกบิลด์ใหม่ หากต้องการใช้บิลด์นี้ต่อไปให้ตรึงชื่อนี้ไว้ ราคาเท่ากับ qwen3.8-max ทุกประการ | ||
| speech-2.8-hd | MiniMax | $1.0000 | ต่อ 1 หมื่นอักขระ | MiniMax speech-2.8-hd — ระดับความละเอียดสูงของตระกูลเสียง 2.8 วางตำแหน่งไว้ที่การถ่ายทอดอันสมจริงอย่างยิ่งพร้อมแท็กเสียง ครอบคลุม 40 ภาษาและ 7 อารมณ์ ระดับเสียงสูงต่ำ ความเร็วในการพูด ความดัง อัตราสุ่มสัญญาณ บิตเรต และรูปแบบเอาต์พุตปรับตั้งได้รายคำขอ ส่วนการสังเคราะห์ข้อความยาวรับได้สูงสุด 1 ล้านอักขระแบบอะซิงโครนัส หรือ 10,000 อักขระผ่านอินเทอร์เฟซสตรีมมิง | |||
| speech-2.8-turbo | MiniMax | $0.6000 | ต่อ 1 หมื่นอักขระ | MiniMax speech-2.8-turbo — ระดับความหน่วงต่ำของตระกูลเสียง 2.8 ที่ยอมสละการถ่ายทอดอันสมจริงอย่างยิ่งของรุ่น HD เพื่อแลกกับการสังเคราะห์ที่เร็วขึ้นโดยยังคงความลื่นไหลตามธรรมชาติ ครอบคลุม 40 ภาษาและ 7 อารมณ์เท่ากับรุ่น HD ปรับตั้งระดับเสียงสูงต่ำ ความเร็วในการพูด ความดัง อัตราสุ่มสัญญาณ บิตเรต และรูปแบบเอาต์พุตได้ และรับข้อความได้สูงสุด 1 ล้านอักขระแบบอะซิงโครนัส หรือ 10,000 อักขระผ่านอินเทอร์เฟซสตรีมมิง | |||
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | ต่อ 1M tokens | StepFun step-3.5-flash — โมเดลการให้เหตุผลเฉพาะข้อความ บริบท 256K มุ่งงานด้านตรรกะ คณิตศาสตร์ วิศวกรรมซอฟต์แวร์ และการวิจัยเชิงลึก ที่คุณภาพของการให้เหตุผลต้องมาพร้อมการทำงานที่รวดเร็วและเชื่อถือได้ เลือกความลึกของการให้เหตุผลได้รายคำขอผ่าน reasoning_effort (low / medium / high) รองรับการเรียกใช้เครื่องมือ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ หากต้องการอินพุตเป็นภาพหรือวิดีโอ ให้ใช้ step-3.7-flash | ||
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | ต่อ 1M tokens | StepFun step-3.5-flash-2603 — สแนปช็อต 256K ของ step-3.5-flash ที่ปรับจูนสำหรับงานเอเจนต์ เน้นประสิทธิภาพด้านโทเค็นและโหมดทำงานที่ใช้การอนุมานต่ำ พารามิเตอร์ reasoning_effort รับเฉพาะ low และ high ต่างจากโมเดลพื้นฐานที่รับสามระดับ โค้ดที่ส่ง medium จึงต้องปรับแก้ รองรับข้อความเท่านั้น พร้อมการเรียกใช้เครื่องมือ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ | ||
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | ต่อ 1M tokens | StepFun step-3.7-flash — โมเดล MoE แบบเบาบางที่มีพารามิเตอร์รวม 198B และทำงานจริง 11B บริบทดั้งเดิม 256K และเข้าใจภาพกับวิดีโอได้ในตัวควบคู่กับข้อความ เลือกความลึกของการให้เหตุผลได้รายคำขอผ่าน reasoning_effort (low / medium / high) และรองรับการเรียกใช้เครื่องมือหลายขั้นตอนอย่างเชื่อถือได้ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ ปรับจูนมาสำหรับงานเอเจนต์และการเขียนโค้ด บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา เนื่องจากต้นทางไม่มีการเก็บสถานะบทสนทนาไว้ คำขอที่มี previous_response_id หรือ conversation จึงถูกปฏิเสธ | ||
| step-5-preview | StepFun | $1.0000 | $2.7000 | ต่อ 1M tokens | StepFun step-5-preview — โมเดลเรือธงรุ่นใหม่ของ StepFun สำหรับงานเขียนโค้ดและงานความรู้เฉพาะทาง เปิดให้ใช้ในรุ่นพรีวิว บริบท 1M โทเค็น เอาต์พุตสูงสุด 64K โทเค็น และเข้าใจภาพกับวิดีโอได้ในตัวควบคู่กับข้อความ การให้เหตุผลเปิดอยู่เสมอ โดยจะส่งกลับเป็น reasoning_content บน /v1/chat/completions และเป็นบล็อก thinking บน /v1/messages คิดค่าบริการเป็นเอาต์พุต และใช้โควตาจาก max_tokens ดังนั้นหากตั้งขีดจำกัดไว้เพียงไม่กี่ร้อยโทเค็น การให้เหตุผลอาจใช้หมดจนไม่มีข้อความตอบกลับ ควรเผื่อขีดจำกัดไว้ให้มาก เลือกความลึกได้รายคำขอผ่าน reasoning_effort (low / medium / high) รองรับการเรียกใช้เครื่องมือหลายขั้นตอน เอาต์พุตแบบมีโครงสร้างด้วย JSON Mode และ JSON Schema สตรีมมิง และการแคชพรอมต์ สร้างมาเพื่อการวิเคราะห์เอกสารยาว วิศวกรรมซอฟต์แวร์ และงานเอเจนต์หลายขั้นตอน บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา เนื่องจากต้นทางไม่มีการเก็บสถานะบทสนทนาไว้ คำขอที่มี previous_response_id หรือ conversation จึงถูกปฏิเสธ | ||
| step-audio-2 | StepFun | $1.4815 | $10.3704 | ต่อ 1M tokens | StepFun step-audio-2 — โมเดลเสียงพูดแบบครบวงจรที่รับเสียงเข้าโดยตรงแทนการทำงานจากข้อความถอดเสียง น้ำเสียงและลีลาการพูดจึงคงอยู่ถึงขั้นการทำความเข้าใจของโมเดล คิดค่าบริการต่อโทเค็น โดยใช้อัตราอินพุตเดียวกับตระกูล StepAudio 2.5 แต่มีอัตราเอาต์พุตสูงกว่า StepFun ไม่ได้เผยแพร่หน้าความสามารถแยกสำหรับโมเดลนี้ กรุณาดูเอกสารด้านเสียงของแพลตฟอร์มเพื่อทราบชุดพารามิเตอร์ปัจจุบัน | ||
| step-tts-2 | StepFun | $0.4148 | ต่อ 1 หมื่นอักขระ | StepFun step-tts-2 — การสังเคราะห์เสียงพูดแบบครบวงจรบนพื้นฐาน NTP ที่สร้างมาเพื่อจำลองสำเนียงได้อย่างแม่นยำ พูดภาษาจีน อังกฤษ จีนผสมอังกฤษ และญี่ปุ่น รวมถึงกวางตุ้งและเสฉวน กำกับอารมณ์และลีลาการพูดผ่านป้ายกำกับภาษาธรรมชาติ ส่วนการโคลนเสียงแบบ zero-shot ใช้เสียงอ้างอิงราว 10 วินาที โดยการควบคุมอารมณ์และสไตล์ยังส่งต่อไปยังเสียงที่โคลนได้โดยไม่มีค่าใช้จ่ายเพิ่ม เอาต์พุตเป็น wav, mp3, flac, opus หรือ pcm | |||
| stepaudio-2-asr-pro | StepFun | $0.2963 | ต่อชั่วโมงเสียง | StepFun StepAudio 2 ASR Pro — โมเดลรู้จำเสียงพูดขนาด 32B พารามิเตอร์ เป็นตัวเลือกที่เน้นความแม่นยำเป็นอันดับแรกในตระกูล ASR ของ StepFun ขณะที่ stepaudio-2.5-asr เป็นตัวเลือกที่เน้นความเร็วและต้นทุน รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ | |||
| stepaudio-2.5-asr | StepFun | $0.0220 | ต่อชั่วโมงเสียง | StepFun StepAudio 2.5 ASR — โมเดลรู้จำเสียงพูดขนาด 4B พารามิเตอร์ที่สร้างบน Multi-Token Prediction ถอดเสียงห้านาทีได้ในเวลาราวหนึ่งวินาที (RTF ประมาณ 0.0053) ปรับให้เหมาะกับภาษาจีนและอังกฤษ มาพร้อมการแปลงข้อความย้อนกลับให้เป็นรูปมาตรฐาน การระบุตัวผู้พูด และการแยกสองช่องสัญญาณสำหรับบันทึกการโทรและการประชุม รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ | |||
| stepaudio-2.5-asr-stream | StepFun | $0.1800 | ต่อชั่วโมงเสียง | StepFun StepAudio 2.5 ASR Stream — รุ่นรู้จำเสียงพูดแบบสตรีมมิงของ StepAudio 2.5 ASR (โมเดลรู้จำเสียงพูดขนาด 4B พารามิเตอร์ที่สร้างบน Multi-Token Prediction และปรับให้เหมาะกับภาษาจีนและอังกฤษ) และเป็นโมเดลสตรีมมิงที่ StepFun แนะนำ บนเกตเวย์นี้ การเรียกใช้โมเดลนี้เป็นแบบเดียวกับโมเดลถอดเสียงอื่น ๆ: อัปโหลดไฟล์บันทึกเสียงทั้งไฟล์ไปยัง /v1/audio/transcriptions แล้วข้อความถอดเสียงฉบับเต็มจะถูกส่งกลับมาในการตอบกลับครั้งเดียวเมื่อการรู้จำเสร็จสิ้น โดยไม่มีการสตรีมผลลัพธ์บางส่วนกลับมา และมีราคาต่อนาทีของเสียงสูงกว่า stepaudio-2.5-asr ผลการถอดเสียงผ่านการแปลงข้อความย้อนกลับให้เป็นรูปมาตรฐาน รับเฉพาะไฟล์อัปโหลด wav แบบ PCM 16 บิต และ ogg (ไม่รับ mp3) โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ | |||
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | ต่อ 1M tokens | StepFun StepAudio 2.5 Chat — โมเดลเข้าใจเสียงพูดแบบครบวงจร รับเสียงหรือข้อความเข้าและตอบกลับเป็นข้อความ โดยอ่านสัญญาณกึ่งภาษาอย่างการลังเลหรือเสียงหัวเราะจากคลื่นเสียงโดยตรงแทนที่จะอ่านจากข้อความถอดเสียง รองรับการปรับแต่งบุคลิกอย่างละเอียด ครอบคลุมทั้งลักษณะตัวตน นิสัยการพูด และช่วงอารมณ์ ส่งเสียงเข้ามาในรูปแบบส่วนเนื้อหา input_audio บนเอนด์พอยต์ chat completions หากต้องการคำตอบเป็นเสียงพูด ให้ใช้โมเดล TTS | ||
| stepaudio-2.5-realtime | StepFun | $1.5000 | $10.0000 | ต่อ 1M tokens | StepFun StepAudio 2.5 Realtime — โมเดลแปลงเสียงพูดเป็นเสียงพูดแบบครบวงจร ใช้งานผ่านเซสชัน WebSocket ที่ GET /v1/realtime รับเสียงหรือข้อความแบบสตรีม และส่งเสียงแบบสตรีมพร้อมข้อความถอดเสียงกลับมา รองรับการตรวจจับเสียงพูดฝั่งเซิร์ฟเวอร์และการพูดแทรก เสียงเป็น PCM16, 24 kHz, โมโน ผู้ให้บริการระบุภาษาอังกฤษเป็นภาษาที่รองรับ ควรกำหนดเสียงพูดให้ชัดเจนใน session.update เพราะระบบรับเฉพาะเสียงพูดที่ StepFun เผยแพร่ไว้เท่านั้น | ||
| stepaudio-2.5-tts | StepFun | $0.8500 | ต่อ 1 หมื่นอักขระ | StepFun StepAudio 2.5 TTS — การแปลงข้อความเป็นเสียงพูดที่คำนึงถึงบริบท โดยส่งความเข้าใจไปตลอดทั้งไปป์ไลน์การสร้างแทนที่จะมองลีลาการพูดเป็นงานหลังการประมวลผล กำกับเสียง อารมณ์ และจังหวะด้วยภาษาธรรมชาติได้สองระดับ คือบริบทระดับทั้งคำขอและบริบทแบบอินไลน์สำหรับแต่ละช่วงข้อความ การโคลนเสียงแบบ zero-shot ใช้เสียงอ้างอิงราว 3 วินาที และสืบทอดชุดการควบคุมตามบริบททั้งหมด รับได้สูงสุด 1000 อักขระต่อคำขอ เอาต์พุตเป็น wav, mp3, flac หรือ opus | |||
| stepaudio-3-asr-max | StepFun | $0.4000 | ต่อชั่วโมงเสียง | StepFun StepAudio 3 ASR Max — โมเดลรู้จำเสียงพูดที่ใหญ่ที่สุดของ StepFun สร้างบนโมเดลภาษาขนาดใหญ่ การรู้จำจึงอาศัยบริบทและความรู้เฉพาะทางได้ ทำให้รับมือได้ดีขึ้นกับชื่อเฉพาะ ชื่อยา ศัพท์เทคนิค และคำพ้องเสียง กับการพูดจีนปนอังกฤษ ภาษาถิ่น และไฟล์เสียงยาว ตลอดจนเสียงกระซิบ การพูดเร็วมาก หรือเสียงพูดที่มีดนตรีประกอบ รวมถึงเนื้อเพลงที่ขับร้อง ส่งไฟล์เสียงไปยัง POST /v1/audio/transcriptions (WAV, MP3 หรือ OGG) คิดค่าบริการตามความยาวของเสียง | |||
| stepaudio-3-chat-preview | StepFun | $0.0000 | ต่อ 1M tokens | StepFun StepAudio 3 Chat (รุ่นพรีวิว) — โมเดลสนทนาที่เข้าใจเสียงพูดบน POST /v1/chat/completions ในแต่ละรอบให้ส่งเสียงพูดเป็นส่วนเนื้อหา input_audio หรือส่งข้อความ แล้วรับข้อความตอบกลับ พร้อมรองรับการเรียกใช้เครื่องมือ ใช้งานได้ฟรีระหว่างช่วงพรีวิวของ StepFun เมื่อช่วงใช้ฟรีสิ้นสุดลง StepFun จะเลิกใช้ชื่อรุ่นพรีวิวและออกรุ่นที่ต้องเสียค่าบริการ จึงควรวางแผนโดยคำนึงว่า ID โมเดลนี้จะใช้งานไม่ได้ตั้งแต่ตอนนั้น | |||
| stepaudio-3-gen-preview | StepFun | $0.000 | ต่อคำขอ | StepFun StepAudio 3 Audio Generation (รุ่นพรีวิว) — โมเดลสร้างเสียงตามบทในซีรีส์ StepAudio 3 ผ่าน POST /v1/audio/generate กำหนดบทบาทด้วยชื่อและคำบรรยายน้ำเสียงเป็นภาษาธรรมดา เขียนบททีละบรรทัด (บรรทัดที่อยู่ในวงเล็บเหลี่ยมจะกลายเป็นเสียงประกอบหรือดนตรีพื้นหลัง) เพิ่มคำสั่งภาพรวม แล้วจะได้เสียงที่เสร็จสมบูรณ์กลับมาเป็นไบต์ (ค่าเริ่มต้นคือ mp3) น้ำเสียงสร้างจากคำบรรยายบทบาท และไม่รับชื่อเสียงสำเร็จรูป ฟิลด์ของคำขอเป็นไปตามเอกสารอ้างอิง API ของ StepFun ใช้งานได้ฟรีระหว่างช่วงพรีวิวของ StepFun เมื่อช่วงใช้ฟรีสิ้นสุดลง StepFun จะเลิกใช้ชื่อรุ่นพรีวิวและออกรุ่นที่ต้องเสียค่าบริการ จึงควรวางแผนโดยคำนึงว่า ID โมเดลนี้จะใช้งานไม่ได้ตั้งแต่ตอนนั้น | |||
| stepaudio-3-music-preview | StepFun | $0.000 | ต่อคำขอ | StepFun StepAudio 3 Music (รุ่นพรีวิว) — โมเดลสร้างเพลงจากข้อความในซีรีส์ StepAudio 3 ผ่าน POST /v1/music/generations โดยใช้รูปแบบคำขอเดียวกับ minimax-music-v3.0 ระบุสไตล์ใน prompt ใส่เนื้อเพลงใน lyrics หรือตั้งค่า is_instrumental แล้วจะได้เพลงที่เสร็จสมบูรณ์กลับมาเป็นข้อมูลเข้ารหัส hex ใน data.audio (ค่าเริ่มต้นคือ mp3 และเลือก wav, flac, opus หรือ pcm ได้ผ่าน audio_setting.format) การเรียกเป็นแบบซิงโครนัส และแต่ละเพลงมักใช้เวลาหนึ่งถึงหลายนาที จึงควรตั้งค่า timeout ฝั่งไคลเอนต์ไว้อย่างน้อย 600 วินาที ไม่รองรับการคัฟเวอร์เพลงหรือการสร้างดนตรีประกอบให้เสียงร้องที่อัปโหลด ใช้งานได้ฟรีระหว่างช่วงพรีวิวของ StepFun เมื่อช่วงใช้ฟรีสิ้นสุดลง StepFun จะเลิกใช้ชื่อรุ่นพรีวิวและออกรุ่นที่ต้องเสียค่าบริการ จึงควรวางแผนโดยคำนึงว่า ID โมเดลนี้จะใช้งานไม่ได้ตั้งแต่ตอนนั้น | |||
| stepaudio-3-realtime-preview | StepFun | $0.0000 | ต่อ 1M tokens | StepFun StepAudio 3 Realtime (รุ่นพรีวิว) — โมเดลเสียงพูดแบบสองทางพร้อมกันของ StepFun ผ่านเซสชัน WebSocket ที่ GET /v1/realtime รองรับการขัดจังหวะและการผลัดกันพูดอย่างเป็นธรรมชาติ การให้เหตุผลแบบปรับตัวได้ขณะพูด และการเรียกใช้เครื่องมือระหว่างบทสนทนา ใช้งานได้ฟรีระหว่างช่วงพรีวิวของ StepFun เมื่อช่วงใช้ฟรีสิ้นสุดลง StepFun จะเลิกใช้ชื่อรุ่นพรีวิวและออกรุ่นที่ต้องเสียค่าบริการ จึงควรวางแผนโดยคำนึงว่า ID โมเดลนี้จะใช้งานไม่ได้ | |||
| stepaudio-3-tts | StepFun | $0.3600 | ต่อ 1 หมื่นอักขระ | StepFun StepAudio 3 TTS — การแปลงข้อความเป็นเสียงพูดจากซีรีส์ StepAudio 3 ที่สร้างมาเพื่อลีลาการพูดระดับมนุษย์ เนื้อเสียง ทำนองเสียง จังหวะ และการหายใจสอดคล้องกับการพูดโดยธรรมชาติ รวมถึงเสียงหัวเราะ การลังเล และการแก้คำพูด ส่วนอารมณ์และน้ำเสียงก็เปลี่ยนไปให้เข้ากับเนื้อหา ให้บริการผ่าน POST /v1/audio/speech และคิดค่าบริการตามจำนวนอักขระของข้อความอินพุต | |||
| vidu-video-q3 | Vidu | $0.060 | ต่อวินาที | Vidu Q3 — โมเดลสร้างวิดีโอจากสื่ออ้างอิง ที่คงความสอดคล้องของตัวแบบ เปลี่ยนฉากได้อย่างชาญฉลาด และให้เอาต์พุตเสียง/วิดีโอที่ซิงก์กัน รับภาพอ้างอิงหรือตัวแบบที่ตั้งชื่อไว้ สร้างวิดีโอยาว 3–16 วินาทีที่ 540P, 720P หรือ 1080P | |||
| vidu-video-q3-pro | Vidu | $0.100 | ต่อวินาที | Vidu Q3 Pro — การสร้างวิดีโอที่เน้นคุณภาพ ทั้งข้อความเป็นวิดีโอ ภาพเป็นวิดีโอ และการสร้างจากเฟรมเริ่มต้น/เฟรมสุดท้าย พร้อมเอาต์พุตเสียง/วิดีโอที่ซิงก์กัน สร้างวิดีโอยาว 1–16 วินาทีที่ 540P, 720P หรือ 1080P ทั้งนี้ SKU นี้ไม่รองรับการสร้างวิดีโอจากสื่ออ้างอิง | |||
| vidu-video-q3-turbo | Vidu | $0.055 | ต่อวินาที | Vidu Q3 Turbo — ระดับ Q3 ที่รวดเร็วและคุ้มค่า สำหรับการสร้างวิดีโอจากข้อความ ภาพ เฟรมเริ่มต้น/เฟรมสุดท้าย และสื่ออ้างอิง พร้อมเอาต์พุตเสียง/วิดีโอที่ซิงก์กัน สร้างวิดีโอยาว 1–16 วินาทีในโหมดปกติ หรือ 3–16 วินาทีในโหมดอ้างอิง ที่ความละเอียด 540P–1080P | |||
| wan2.7-i2v | Alibaba | $0.100 | ต่อวินาที | Alibaba Wan 2.7 Image-to-Video — ครอบคลุมการสร้างจากเฟรมแรก การเปลี่ยนภาพระหว่างเฟรมแรกกับเฟรมสุดท้าย และการต่อเนื่องจากคลิปเดิม สร้างวิดีโอ 720P หรือ 1080P (ค่าเริ่มต้น 1080P) ความยาว 2-15 วินาที ค่าเริ่มต้น 5 วินาที จากพรอมต์ยาวได้ถึง 5,000 อักขระ (พรอมต์เชิงลบไม่เกิน 500 อักขระ) สามารถส่งไฟล์ mp3 หรือ wav ความยาว 2-30 วินาทีเป็น driving_audio ได้ หากไม่ส่งเสียงมา โมเดลจะสร้างดนตรีประกอบหรือเอฟเฟกต์เสียงที่เข้ากันให้เอง เสียงที่ยาวกว่าคลิปจะถูกตัดทิ้ง ส่วนเสียงที่สั้นกว่าจะทำให้ช่วงท้ายเงียบ | |||
| wan2.7-image | Alibaba | $0.030 | ต่อคำขอ | Alibaba Wan2.7 Image — สร้างภาพจากข้อความ แก้ไขภาพ สร้างภาพโดยอ้างอิงจากหลายภาพ แก้ไขแบบโต้ตอบ พร้อมการเขียนตัวอักษรและการทำตามคำสั่งที่แข็งแกร่ง | |||
| wan2.7-image-pro | Alibaba | $0.075 | ต่อคำขอ | Alibaba Wan 2.7 Image Pro — ระดับมืออาชีพของตระกูลภาพ Wan 2.7 ครอบคลุมการสร้างภาพจากข้อความ ชุดภาพตามลำดับ การแก้ไขภาพ และการสร้างภาพโดยอ้างอิงจากหลายภาพ พร้อมการทำตามพรอมต์ที่ดีขึ้น การสร้างภาพจากข้อความไปถึง 4K (4096x4096) พร้อมระดับ 1K และ 2K และขนาดกำหนดเองตั้งแต่ 768x768 ส่วนโหมดแก้ไขและโหมดชุดภาพจำกัดที่ 2K โมเดลรับภาพอ้างอิงได้สูงสุด 9 ภาพ (JPEG, JPG, PNG, BMP, WEBP; ด้านละ 240-8,000 พิกเซล ภาพละไม่เกิน 20 MB) อัตราส่วนภาพตั้งแต่ 1:8 ถึง 8:1 และพรอมต์ยาวได้ถึง 5,000 อักขระ ผลลัพธ์เป็น PNG | |||
| wan2.7-r2v | Alibaba | $0.100 | ต่อวินาที | Alibaba Wan2.7 (R2V) — สร้างวิดีโอจากสื่ออ้างอิง รองรับภาพ/วิดีโออ้างอิงผสมกันได้สูงสุด 5 ชิ้น พร้อมเสียงอ้างอิงน้ำเสียง และคงความสอดคล้องของตัวละคร อุปกรณ์ประกอบฉาก และฉากได้ดีขึ้น | |||
| wan2.7-t2v | Alibaba | $0.100 | ต่อวินาที | Alibaba Wan2.7 (T2V) — ข้อความเป็นวิดีโอ พร้อมการแสดงอารมณ์ที่ดีขึ้น อารมณ์ที่ละเอียดอ่อน แอ็กชันที่เข้มข้น และการตัดภาพที่ดราม่า สร้างไฟล์ MP4 แบบ H.264 ที่ 720P หรือ 1080P ความยาว 2-15 วินาที (ค่าเริ่มต้น 5 วินาที) ในอัตราส่วน 16:9, 9:16, 1:1, 4:3 หรือ 3:4 จากพรอมต์ยาวได้ถึง 5,000 อักขระ เสียงถูกใส่มาให้ตามค่าเริ่มต้น หากไม่ระบุ audio_url โมเดลจะแต่งดนตรีประกอบหรือเอฟเฟกต์เสียงที่เข้ากันให้เอง หรือจะส่งไฟล์ wav หรือ mp3 ความยาว 2-30 วินาทีมาแทนก็ได้ | |||
| wan2.7-videoedit | Alibaba | $0.100 | ต่อวินาที | Alibaba Wan2.7 VideoEdit — ตัดต่อวิดีโอด้วยภาษาธรรมชาติ ทั้งเฉพาะจุดหรือทั้งคลิป แทนที่องค์ประกอบด้วยภาพอ้างอิง และจำลองการเคลื่อนไหว เอฟเฟกต์ และมุมกล้อง | |||
| wan3.0-video | Alibaba | $0.100 | $0.085 | ต่อวินาที | Alibaba Wan3.0 (Video) — โมเดลวิดีโอแบบครบวงจรที่รวมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอ และสื่ออ้างอิงเป็นวิดีโอไว้หลังเอนด์พอยต์เดียว สร้างไฟล์ MP4 แบบ H.264 ที่ 480P, 720P หรือ 1080P ความยาวสูงสุด 30 วินาที จากพรอมต์และ URL ภาพเฟรมแรกที่จะใส่หรือไม่ก็ได้ คิดค่าบริการต่อวินาทีของวิดีโอที่สร้างตามลำดับขั้นราคาของผู้ให้บริการเอง โดย 720P เป็นอัตราฐาน 480P คิดครึ่งหนึ่งของอัตรานั้น และ 1080P คิดสองเท่า คำขอที่ไม่ได้ระบุความละเอียดจะถูกโมเดลสร้างที่ 1080P และคิดค่าบริการตามระดับนั้น อินพุตวิดีโออ้างอิงและเสียงอ้างอิงมีอยู่ในโมเดลของผู้ให้บริการ แต่ไม่ได้รองรับบนเอนด์พอยต์นี้ | ||
| wan3.0-video-prime | Alibaba | $0.140 | ต่อวินาที | Alibaba Wan3.0 Video Prime — ระดับความเร็วสูงของโมเดลวิดีโอแบบครบวงจร Wan 3.0 ซึ่งมีความสามารถเทียบเท่าระดับมาตรฐานแต่สร้างได้เร็วกว่า รวมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรก/เฟรมสุดท้าย และภาพอ้างอิงเป็นวิดีโอ (ภาพอ้างอิงสูงสุด 10 ภาพ) ไว้หลังเอนด์พอยต์เดียว ให้ไฟล์ MP4 แบบ H.264 ที่ 480P, 720P หรือ 1080P ความยาว 2 ถึง 30 วินาที ที่ 30 fps และมีเสียงเป็นค่าเริ่มต้น คิดค่าบริการต่อวินาทีของวิดีโอที่สร้างตามลำดับขั้นราคาของผู้ให้บริการ โดย 720P เป็นอัตราฐาน 480P คิดต่ำกว่าครึ่งหนึ่งของอัตรานั้นเล็กน้อย และ 1080P คิดสองเท่า คำขอที่ไม่ได้ระบุความละเอียดจะเรนเดอร์ที่ 1080P ซึ่งเป็นค่าเริ่มต้นของผู้ให้บริการ และคิดค่าบริการตามระดับนั้น เกตเวย์นี้ไม่รับอินพุตที่เป็นวิดีโออ้างอิง เสียงอ้างอิง ไฟล์ และลิงก์เว็บ และจะปฏิเสธระยะเวลาอัจฉริยะ (-1) โปรดระบุ duration อย่างชัดเจน ให้บริการผ่านช่องทางทางการของ Alibaba เพียงช่องทางเดียว |