ราคาโมเดล AI จีน

ChinaAPI ให้บริการ DeepSeek, Qwen, GLM, Kimi และโมเดล AI จีนอื่น ๆ ผ่านเกตเวย์ที่เข้ากันได้กับ OpenAI ที่ https://api.chinaapi.ai/v1 ราคาทั้งหมดเป็นสกุลดอลลาร์สหรัฐ และแสดงตามหน่วยที่ผู้ให้บริการต้นทางกำหนด รายการเดียวกันนี้มีในรูปแบบ JSON ที่ /api/pricing

60 โมเดลปลดล็อกราคา Paid ที่ถูกลงหลังเติมเงินครั้งแรก เติมเงินครั้งเดียวไม่ว่าจำนวนเท่าใด มีผลทั้งบัญชีโดยอัตโนมัติ ราคา Paid จะแสดงเฉพาะเมื่อต่ำกว่าราคา Standard

ราคาโมเดลสาธารณะ
โมเดลผู้ให้บริการอินพุตเอาต์พุตอินพุต (ราคา Paid)เอาต์พุต (ราคา Paid)หน่วยคำอธิบาย
agnes-2.5-flashAgnes AI$0.0000ต่อ 1M tokensAgnes AI Agnes 2.5 Flash — โมเดลเอเจนต์มัลติโหมดความเร็วสูง พร้อมบริบทอินพุต 512K และขีดจำกัดเอาต์พุตอ้างอิง 65.5K รองรับการแชท สตรีมมิง การเรียกใช้เครื่องมือ การเขียนโค้ด การให้เหตุผล บทสนทนาหลายรอบ การเข้าใจภาพ และเวิร์กโฟลว์เอเจนต์
agnes-2.5-proAgnes AI$0.4500$0.9000ต่อ 1M tokensAgnes AI Agnes 2.5 Pro — รุ่นเสถียรเชิงพาณิชย์ของโมเดลเบนช์มาร์ก 2.5 Pro Alpha เป็นโมเดลการให้เหตุผลแบบชำระเงิน พร้อมบริบทอินพุต 1M และเอาต์พุตสูงสุด 65,536 โทเค็น สำหรับการเขียนโค้ดขั้นสูง การให้เหตุผลทางวิทยาศาสตร์ การวิเคราะห์บริบทยาว เวิร์กโฟลว์เอเจนต์ และการเข้าใจภาพ
agnes-2.5-pro-betaAgnes AI$0.1000$0.3000ต่อ 1M tokensAgnes AI Agnes 2.5 Pro Beta — ระดับราคาต่ำของตระกูล Pro คิดค่าบริการตามราคา Beta ของตัวเองซึ่งต่ำกว่าราคาของ 2.5 Pro อย่างมาก เป็นโมเดลการให้เหตุผลแบบชำระเงินที่ใช้รูปแบบคำขอ โปรโตคอลข้อความ และขีดจำกัดบริบทเดียวกัน สำหรับการเขียนโค้ดขั้นสูง การให้เหตุผลทางวิทยาศาสตร์ การวิเคราะห์บริบทยาว เวิร์กโฟลว์เอเจนต์ และการเข้าใจภาพ
agnes-3.0-flashAgnes AI$0.0000ต่อ 1M tokensAgnes AI Agnes 3.0 Flash — โมเดลภาษารุ่นใหม่ของผู้ให้บริการ สร้างมาเพื่อการเขียนโค้ดเชิงเอเจนต์และการทำงานที่ขับเคลื่อนด้วยเครื่องมือ พร้อมบริบทอินพุต 512K และขีดจำกัดเอาต์พุต 65,536 โทเค็น รับอินพุตเป็นข้อความและ URL ของภาพ แล้วตอบกลับเป็นข้อความ รองรับสตรีมมิง การเรียกฟังก์ชันและการประสานเครื่องมือหลายขั้นตอน และการทำตามคำสั่งในงานที่ยาว เรียกใช้ได้ผ่านเอนด์พอยต์แชทที่เข้ากันได้กับ OpenAI เอนด์พอยต์ Responses และเอนด์พอยต์ Messages ที่เข้ากันได้กับ Anthropic สำหรับเอนด์พอยต์แชท โหมดการคิด (Thinking) เปิดได้โดยตั้งค่า chat_template_kwargs.enable_thinking เป็น true จากการวัดเมื่อ 2026-09-21 คำขอที่ไม่มีฟิลด์นี้ไม่ได้ส่งกลับโทเค็นการให้เหตุผลใด ๆ เมื่อเปิดโหมดการคิด โทเค็นการให้เหตุผลจะนับรวมอยู่ใน max_tokens จึงควรกำหนด max_tokens ให้เพียงพอทั้งสำหรับการให้เหตุผลและคำตอบ
agnes-image-2.0-flashAgnes AI$0.000ต่อคำขอAgnes AI Image 2.0 Flash — โมเดลสร้างและแก้ไขภาพที่รวดเร็ว รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ โดยรับผลลัพธ์ได้ทั้งในรูปแบบ URL หรือข้อมูล Base64
agnes-image-2.1-flashAgnes AI$0.000ต่อคำขอAgnes AI Image 2.1 Flash — โมเดลสร้างและแก้ไขภาพที่เน้นรายละเอียดสำหรับฉากที่มีความหนาแน่นของข้อมูลสูง รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ ด้วยขนาดและอัตราส่วนภาพที่ยืดหยุ่นตั้งแต่ 1K ถึง 4K
agnes-image-2.5-flashAgnes AI$0.000ต่อคำขอAgnes AI Image 2.5 Flash — โมเดลภาพรุ่นล่าสุด ที่เหนือกว่า Image 2.1 Flash ทั้งด้านการสร้าง การแก้ไข การจัดองค์ประกอบ การเรนเดอร์รายละเอียด และการทำตามพรอมต์ รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ ด้วยขนาดและอัตราส่วนภาพที่ยืดหยุ่นตั้งแต่ 1K ถึง 4K
agnes-video-2.5Agnes AI$0.025ต่อวินาทีAgnes AI Video 2.5 — โมเดลวิดีโอแบบอะซิงโครนัสที่ชำระเงิน สร้างคลิปความยาว 4-12 วินาทีที่ 720P, 960P หรือ 2K จากข้อความ คีย์เฟรมแรก/เฟรมสุดท้าย หรือภาพ เสียง และวิดีโออ้างอิง
agnes-video-2.5-flashAgnes AI$0.000ต่อวินาทีAgnes AI Video 2.5 Flash — รุ่นย่อยของ Video 2.5 ที่ให้เฉพาะ 720P สร้างวิดีโอความยาว 4-12 วินาทีจากข้อความ คีย์เฟรมแรก/เฟรมสุดท้าย หรือภาพและเสียงอ้างอิง ด้วย API งานแบบอะซิงโครนัสเดียวกัน
claude-fable-5Anthropic$10.0000$50.0000$7.0000$35.0000ต่อ 1M tokensAnthropic Claude Fable 5 — โมเดลที่มีความสามารถสูงที่สุดของ Anthropic ในบรรดารุ่นที่เปิดให้ใช้งานทั่วไป สำหรับงานความรู้และการเขียนโค้ดที่ทะเยอทะยานและใช้เวลายาวนาน สร้างขึ้นสำหรับงานเอเจนต์ที่กินเวลาหลายวัน งานวิศวกรรมซอฟต์แวร์ที่ซับซ้อน การวิจัยเชิงลึก การให้เหตุผลกับเอกสารและภาพ รวมถึงการตรวจสอบตนเองเชิงรุก
claude-fable-5-1Anthropic$10.0000$50.0000$8.0000$40.0000ต่อ 1M tokensAnthropic Claude Fable 5.1 — โมเดลเรือธงรุ่นล่าสุดของ Anthropic ที่เปิดให้ใช้งานทั่วไป สำหรับงานความรู้และการเขียนโค้ดที่ทะเยอทะยานและใช้เวลายาวนาน สร้างขึ้นสำหรับงานเอเจนต์ที่กินเวลาหลายวัน งานวิศวกรรมซอฟต์แวร์ที่ซับซ้อน การวิจัยเชิงลึก การให้เหตุผลกับเอกสารและภาพ รวมถึงการตรวจสอบตนเองเชิงรุก การอ่านแคชคิดราคาเพียง 2.5% ของอินพุต ซึ่งต่ำที่สุดในโมเดลรุ่นเดียวกัน
claude-haiku-4-5Anthropic$1.0000$5.0000$0.7000$3.5000ต่อ 1M tokensAnthropic Claude Haiku 4.5 — โมเดล Claude ที่เร็วที่สุด ด้วยความฉลาดใกล้เคียงระดับแนวหน้า สร้างขึ้นสำหรับงานปริมาณมากที่อ่อนไหวต่อความหน่วง เช่น การจัดหมวดหมู่ การดึงข้อมูล และการจัดเส้นทาง รองรับอินพุตข้อความและภาพ การคิดแบบขยาย หน้าต่างบริบท 200,000 โทเค็น และเอาต์พุตสูงสุด 64,000 โทเค็น
claude-haiku-5-5Anthropic$0.1000$0.5000$0.0600$0.3000ต่อ 1M tokensAnthropic Claude Haiku 5.5 — โมเดลเข้าใจข้อความและภาพที่รวดเร็วและประหยัด สำหรับการจำแนก การสกัดข้อมูล การกำหนดเส้นทาง และเอเจนต์ รองรับบริบท 1,000,000 โทเคนและเอาต์พุตสูงสุด 128,000 โทเคน การคิดแบบปรับได้ใช้ medium เป็นค่าเริ่มต้น เลือก low, medium, high, xhigh หรือ max ผ่าน output_config.effort ใน Messages รองรับสตรีมและการบังคับเรียกเครื่องมือ เมื่ออินพุตเกิน 100,000 โทเคน คำขอทั้งหมดจะคิดราคาบริบทยาว รวมเอาต์พุตและแคชด้วย
claude-opus-4-5Anthropic$5.0000$25.0000$3.5000$17.5000ต่อ 1M tokensAnthropic Claude Opus 4.5 — รุ่น Opus 4.5 ซึ่งปัจจุบัน Anthropic จัดไว้ในกลุ่มโมเดลรุ่นเก่าและยังคงเปิดให้ใช้ สำหรับเวิร์กโหลดที่ต้องการใช้โมเดลเวอร์ชันนี้ต่อไป รองรับอินพุตข้อความและภาพ การคิดแบบขยาย หน้าต่างบริบท 200,000 โทเค็น และเอาต์พุตสูงสุด 64,000 โทเค็น
claude-opus-4-6Anthropic$5.0000$25.0000$3.5000$17.5000ต่อ 1M tokensAnthropic Claude Opus 4.6 — รุ่น Opus สำหรับการให้เหตุผลที่ซับซ้อนและงานเอเจนต์ พร้อมหน้าต่างบริบท 1,000,000 โทเค็นในราคามาตรฐาน และเอาต์พุตสูงสุด 128,000 โทเค็น รองรับอินพุตข้อความและภาพ รวมถึงการคิดแบบปรับตัว และใช้โทเค็นไนเซอร์รุ่นก่อน 4.7
claude-opus-4-7Anthropic$5.0000$25.0000$3.5000$17.5000ต่อ 1M tokensAnthropic Claude Opus 4.7 — โมเดลการให้เหตุผลขั้นสูงสำหรับงานวิศวกรรมซอฟต์แวร์ที่ยากและงานเอเจนต์ที่ซับซ้อนซึ่งทำงานต่อเนื่องยาวนาน เน้นการทำตามคำสั่งอย่างเคร่งครัด การตรวจสอบตนเอง การใช้เครื่องมืออย่างเชื่อถือได้ และการมองเห็นความละเอียดสูงทั้งบนอินเทอร์เฟซ ภาพ เอกสาร และเวิร์กโฟลว์เชิงวิชาชีพ
claude-opus-4-8Anthropic$5.0000$25.0000$3.5000$17.5000ต่อ 1M tokensAnthropic Claude Opus 4.8 — โมเดลการให้เหตุผลสมรรถนะสูงสำหรับการเขียนโค้ด เวิร์กโฟลว์เอเจนต์ การวิเคราะห์เชิงวิชาชีพ และงานที่ทำงานต่อเนื่องยาวนาน พัฒนาความน่าเชื่อถือ วิจารณญาณ ประสิทธิภาพการใช้เครื่องมือ การควบคุมคอมพิวเตอร์ และการให้เหตุผลกับเอกสารแบบมัลติโหมดเหนือกว่า Opus 4.7 พร้อมรองรับหน้าต่างบริบท 1,000,000 โทเค็น
claude-opus-5Anthropic$5.0000$25.0000$3.0000$15.0000ต่อ 1M tokensAnthropic Claude Opus 5 — โมเดลการให้เหตุผลเชิงลึกสำหรับงานเขียนโค้ดแบบเอเจนต์ที่ซับซ้อนและงานระดับองค์กร พัฒนาขึ้นอย่างมากในงานระยะยาว การรีวิวโค้ด เวิร์กโฟลว์เอกสาร การมองเห็น และการประสานงานหลายเอเจนต์ มีหน้าต่างบริบท 1,000,000 โทเค็น รองรับเอาต์พุตสูงสุด 128,000 โทเค็น และเปิดใช้การคิดแบบปรับตัวเป็นค่าเริ่มต้น
claude-opus-5-5Anthropic$4.0000$20.0000$2.4000$12.0000ต่อ 1M tokensAnthropic Claude Opus 5.5 — ออกแบบมาสำหรับงานเขียนโค้ดแบบเอเจนต์และงานด้านความรู้ที่ใช้เวลานาน ในราคาที่ต่ำกว่า Claude Opus 5 รองรับอินพุตทั้งข้อความและรูปภาพ มีหน้าต่างบริบท 1,000,000 โทเค็น และรองรับเอาต์พุตสูงสุด 128,000 โทเค็น การคิดแบบปรับตัวเปิดใช้อยู่เสมอ โดยใช้พารามิเตอร์ effort กำหนดความลึกของการให้เหตุผล และมีค่าเริ่มต้นเป็น medium
claude-sonnet-4-5Anthropic$3.0000$15.0000$2.1000$10.5000ต่อ 1M tokensAnthropic Claude Sonnet 4.5 — รุ่น Sonnet 4.5 ซึ่งปัจจุบัน Anthropic จัดไว้ในกลุ่มโมเดลรุ่นเก่าและยังคงเปิดให้ใช้ สำหรับเวิร์กโหลดที่ต้องการใช้โมเดลเวอร์ชันนี้ต่อไป รองรับอินพุตข้อความและภาพ การคิดแบบขยาย หน้าต่างบริบท 200,000 โทเค็น และเอาต์พุตสูงสุด 64,000 โทเค็น
claude-sonnet-4-6Anthropic$3.0000$15.0000$2.1000$10.5000ต่อ 1M tokensAnthropic Claude Sonnet 4.6 — รุ่น Sonnet ที่สมดุล ให้หน้าต่างบริบท 1,000,000 โทเค็นในราคามาตรฐาน พร้อมเอาต์พุตสูงสุด 128,000 โทเค็น รองรับอินพุตข้อความและภาพ รวมถึงการคิดแบบปรับตัว และใช้โทเค็นไนเซอร์รุ่นก่อน 4.7 ข้อความเดียวกันจึงใช้โทเค็นน้อยกว่าโมเดลรุ่น 4.7 ขึ้นไปราว 30% ที่อัตราต่อโทเค็นเท่ากัน
claude-sonnet-5Anthropic$2.0000$10.0000$1.4000$7.0000ต่อ 1M tokensAnthropic Claude Sonnet 5 — โมเดลสำหรับใช้งานจริงที่สมดุลระหว่างความฉลาดระดับแนวหน้ากับความเร็ว สำหรับการเขียนโค้ด งานเอเจนต์ และเวิร์กโฟลว์องค์กร สามารถวางแผน ใช้เครื่องมือเบราว์เซอร์และเทอร์มินัล และทำงานได้ด้วยตนเองทั้งงานให้เหตุผล งานความรู้ และงานวิศวกรรมซอฟต์แวร์
claude-sonnet-5-5Anthropic$2.0000$10.0000$1.2000$6.0000ต่อ 1M tokensAnthropic Claude Sonnet 5.5 — สมดุลระหว่างความเร็วกับความฉลาด สำหรับการเขียนโค้ด งานเอเจนต์ และเวิร์กโหลดใช้งานจริง รองรับอินพุตทั้งข้อความและรูปภาพ มีหน้าต่างบริบท 1,000,000 โทเค็น และรองรับเอาต์พุตสูงสุด 128,000 โทเค็น การคิดแบบปรับตัวเปิดใช้ตามค่าเริ่มต้น และโทเค็นการคิดคิดค่าบริการเป็นเอาต์พุต เลือก output_config.effort ได้เป็น low, medium, high, xhigh หรือ max โดยค่าเริ่มต้นคือ high หากต้องการปิดการคิดล่วงหน้า ให้ส่ง thinking ที่มี type เป็น between_tools ซึ่งใช้ได้เมื่อ effort อยู่ที่ high หรือต่ำกว่า ส่วน type disabled จะถูกปฏิเสธ การตั้ง temperature, top_p หรือ top_k เป็นค่าที่ไม่ใช่ค่าเริ่มต้นจะได้รับข้อผิดพลาด เช่นเดียวกับการบังคับเรียกใช้เครื่องมือด้วย tool_choice any หรือ tool บล็อกการคิดผูกอยู่กับโมเดลและบทสนทนา ให้ส่งกลับไปโดยไม่แก้ไขในรอบสนทนาถัดไป
cogview-4Zhipu AI$0.010$0.0095ต่อคำขอZhipu CogView-4 — โมเดลสร้างภาพจากข้อความ CogView รุ่นที่สี่ รองรับความละเอียดเอาต์พุตหลายขนาด และมีระดับให้บริการทั้งแบบพื้นฐานและแบบความคมชัดสูง รับพรอมต์ภาษาจีนและภาษาอังกฤษ และเรนเดอร์ข้อความลงในภาพได้ สร้างได้หนึ่งภาพต่อคำขอ
deepseek-flashDeepSeek$0.1500$0.6000ต่อ 1M tokensDeepSeek V4.1 Flash — ID โมเดลหลักสำหรับการผสานระบบใหม่ รองรับอินพุตข้อความและภาพ โหมดการคิดและโหมดไม่คิด การเรียกใช้เครื่องมือ และเอาต์พุตแบบ JSON ส่วน ID deepseek-v4-flash และ deepseek-v4-flash-vision-exp ที่เลิกใช้แล้ว ยังคงเป็นชื่อแทนเพื่อความเข้ากันได้ ซึ่งให้บริการโดยโมเดลเดียวกันนี้ในราคา Flash เท่าเดิม หน้าต่างบริบท 1M โทเค็น เอาต์พุตสูงสุด 384K บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา เนื่องจากต้นทางไม่มีการเก็บสถานะบทสนทนาไว้ คำขอที่มี previous_response_id หรือ conversation จึงถูกปฏิเสธ
deepseek-v4-proDeepSeek$0.6600$1.9800ต่อ 1M tokensDeepSeek V4 Pro 0813 — ระดับที่มีความสามารถสูงกว่าของ DeepSeek V4 สำหรับการเขียนโค้ด การให้เหตุผล และงานเอเจนต์ พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 384K ทำงานได้ทั้งโหมดการคิด (ค่าเริ่มต้น) และโหมดไม่คิด รองรับการเรียกใช้เครื่องมือและเอาต์พุตแบบ JSON รับข้อความเข้า ตอบข้อความออก บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา เนื่องจากต้นทางไม่มีการเก็บสถานะบทสนทนาไว้ คำขอที่มี previous_response_id หรือ conversation จึงถูกปฏิเสธ
doubao-seed-2-1-pro-260628ByteDance$0.8889$4.4444ต่อ 1M tokensByteDance Doubao Seed 2.1 Pro — โมเดลเอเจนต์เรือธงของ Doubao สำหรับงานที่ใช้จริง ครอบคลุมการคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง ซึ่งผู้ให้บริการแนะนำให้ใช้โหมด json_schema หน้าต่างบริบท 256K โดยรับอินพุตสูงสุด 256K เอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K) และงบประมาณห่วงโซ่ความคิด 256K โมเดลรับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ ทั้งนี้ตระกูล 2.1 ไม่ได้ระบุความสามารถในการเข้าใจเสียงไว้ รองรับการแคชบริบททั้งแบบโดยปริยายและแบบระบุชัดเจน รวมถึงแคชส่วนนำและแคชระดับเซสชัน
doubao-seed-2-1-turbo-260628ByteDance$0.4444$2.2222ต่อ 1M tokensByteDance Doubao Seed 2.1 Turbo — สายความหน่วงต่ำของตระกูล Seed 2.1 ที่ใช้กรอบสเปกเดียวกับรุ่น Pro ได้แก่ หน้าต่างบริบท 256K โดยรับอินพุตสูงสุด 256K เอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K) และงบประมาณห่วงโซ่ความคิด 256K ครอบคลุมการคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง แต่ไม่มีคำแนะนำให้ใช้ json_schema อย่างรุ่น Pro โมเดลรับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ ทั้งนี้ตระกูล 2.1 ไม่ได้ระบุความสามารถในการเข้าใจเสียงไว้ รองรับการแคชบริบททั้งแบบโดยปริยายและแบบระบุชัดเจน
doubao-seed-character-260628ByteDance$0.1185$0.2963ต่อ 1M tokensByteDance Doubao Seed Character (260628) — โมเดลบทสนทนาตัวละครของ Doubao สำหรับการสนทนาหลายรอบที่ขับเคลื่อนด้วยเพอร์โซนา เป็นสายที่สืบต่อจาก doubao-1-5-pro-32k-character บิลด์นี้มีป้ายความสามารถตามที่ผู้ให้บริการระบุ ได้แก่ การคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง (แนะนำ json_schema) หน้าต่างบริบท 128K โดยรับอินพุตสูงสุด 96K และเอาต์พุตสูงสุด 32K โทเค็น (ค่าเริ่มต้น 4K) คิดราคาตามความยาวอินพุต: คำขอที่มีโทเค็นอินพุตไม่เกิน 32K คิดค่าบริการในระดับมาตรฐาน ส่วนคำขอที่ยาวกว่านั้นคิดในระดับบริบทยาว ซึ่งอินพุตมีราคาเป็น 1.5 เท่า และเอาต์พุตมีราคาเป็นสามเท่าของอัตราระดับมาตรฐาน
doubao-seed-evolvingByteDance$0.8889$4.4444ต่อ 1M tokensByteDance Doubao Seed Evolving — เรือธงด้านการเขียนโค้ดและเอเจนต์ในปัจจุบันของ Doubao เผยแพร่แบบต่อเนื่อง (rolling release): ผู้ให้บริการอัปเดตโมเดลทุกสัปดาห์ภายใต้ ID เดิมนี้โดยไม่มีสแนปช็อตแบบระบุวันที่ พฤติกรรมและความสามารถจึงอาจเปลี่ยนไปได้โดยไม่มีการเปลี่ยนหมายเลขเวอร์ชัน มีป้ายความสามารถตามที่ผู้ให้บริการระบุ ได้แก่ การคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การจัดการงานบน GUI การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง (แนะนำ json_schema) หน้าต่างบริบท 1,024K โดยรับอินพุตสูงสุด 1,024K และเอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K)
doubao-seedance-2-0-260128ByteDance$7.0000ต่อ 1M tokensByteDance Seedance 2.0 — เรือธงของตระกูล Seedance 2.0 และเป็นรุ่นเดียวในตระกูลที่ไปถึง 1080p และ 4K (ความลึกสี 10 บิต) เพิ่มเติมจาก 480p และ 720p ที่ 24 fps และ 4-15 วินาที ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 และดึงเฟรมปิดท้ายออกมาเป็นภาพนิ่งได้ คิดค่าบริการตามความละเอียดของเอาต์พุต
doubao-seedance-2-0-fast-260128ByteDance$5.6000ต่อ 1M tokensByteDance Seedance 2.0 Fast — การสร้างวิดีโอที่คุ้มค่า มาพร้อมชุดความสามารถครบถ้วนของ Seedance 2.0 แต่จำกัดที่ 480p และ 720p, 24 fps, 4-15 วินาที ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 โดย 480p 5 วินาที ≈ $0.26
doubao-seedance-2-0-mini-260615ByteDance$3.5000ต่อ 1M tokensByteDance Seedance 2.0 Mini — ระดับที่เบาและประหยัดงบประมาณของตระกูล Seedance 2.0 จำกัดที่ 480p และ 720p, 24 fps, 4-15 วินาที มาพร้อมชุดความสามารถตามเอกสารเดียวกับรุ่นอื่นในตระกูล ได้แก่ ข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16
doubao-seedance-2-5-260628ByteDance$10.7000ต่อ 1M tokensByteDance Seedance 2.5 — โมเดลสายหลักของ Seedance ที่ยืดการสร้างครั้งเดียวออกไปเป็น 4-30 วินาทีที่ 24 fps แต่จำกัดความละเอียดไว้ที่ 480p และ 720p การสร้างจากสื่ออ้างอิงแบบมัลติโหมดรองรับภาพ 1-30 ภาพ วิดีโออ้างอิงสูงสุด 10 คลิป และเสียงอ้างอิงสูงสุด 10 ไฟล์ (แต่ละประเภทรวมกันไม่เกิน 30 วินาที) และต่างจากรุ่น 2.0 ตรงที่เสียงอ้างอิงใช้เดี่ยว ๆ ได้ นอกจากนี้ยังครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16
doubao-seedream-4-5-251128ByteDance$0.03704ต่อคำขอByteDance Doubao Seedream 4.5 — สร้างภาพจากข้อความและภาพเป็นภาพ พร้อมการหลอมรวมหลายภาพ ให้ผลลัพธ์เป็นภาพเดียวหรือชุดภาพที่สัมพันธ์กัน โหมดภาพเดียวรับเพียงพรอมต์อย่างเดียว ภาพอ้างอิงหนึ่งภาพ หรือภาพอ้างอิง 2-14 ภาพ ส่วนโหมดชุดภาพ (sequential_image_generation=auto) คืนภาพได้สูงสุด 15 ภาพจากข้อความ สูงสุด 14 ภาพจากภาพอ้างอิงเพียงภาพเดียว หรือเป็นชุดจากภาพอ้างอิง 2-14 ภาพ โดยจำนวนอินพุตบวกเอาต์พุตต้องไม่เกิน 15 รองรับเอาต์พุต 2K และ 4K และคืนค่าเป็น JPEG ตามค่าเริ่มต้น ในรูปแบบ URL หรือ base64 ส่วนการแก้ไขเชิงโต้ตอบด้วยพิกัดมีเฉพาะใน Seedream 5.0 Pro (doubao-seedream-5-0-pro-260628) เท่านั้น
doubao-seedream-5-0-260128ByteDance$0.03259ต่อคำขอByteDance Doubao Seedream 5.0-lite — สร้างภาพจากข้อความและภาพเป็นภาพ พร้อมการสร้างสรรค์ที่ควบคุมได้อย่างชาญฉลาดขึ้น การค้นคืนข้อมูลแบบเรียลไทม์ และความสอดคล้องของตัวแบบที่ดีขึ้น (ความละเอียด 2K ขึ้นไป)
doubao-seedream-5-0-pro-260628ByteDance$0.045ต่อคำขอByteDance Doubao Seedream 5.0 Pro — โมเดลภาพระดับสูงสุดของผู้ให้บริการสำหรับการสร้างสรรค์ที่ควบคุมได้ ได้แก่ สร้างภาพจากข้อความ ภาพเป็นภาพแบบอ้างอิงภาพเดียวและอ้างอิงหลายภาพ (ภาพอ้างอิง 2-10 ภาพ) การแก้ไขเชิงโต้ตอบด้วยพิกัด กรอบ หรือลูกศร และการแยกเลเยอร์ที่แบ่งภาพหนึ่งภาพออกเป็นภาพฐานกับเลเยอร์อีกสูงสุด 16 เลเยอร์ โดยแต่ละเลเยอร์ส่งกลับพร้อมขนาด z_index และกรอบขอบเขตของตัวเอง (ตั้งค่า layer_decomposition=true) ให้ผลลัพธ์เป็นภาพเดียวเท่านั้น ไม่มีการสร้างแบบชุดภาพ (ตามลำดับ) การค้นหาเว็บ หรือสตรีมมิง คิดค่าบริการต่อภาพเอาต์พุตตามสถานการณ์การใช้งานและระดับพิกเซล: ภาพเดียวที่ไม่เกิน 2.61 MP เป็นราคาฐาน เกิน 2.61 MP คิด 2 เท่า ในการแยกเลเยอร์ ทุกเลเยอร์ที่ส่งกลับคิดค่าบริการแยกกันที่ 0.5 เท่า (หรือ 1 เท่าเมื่อเกิน 2.61 MP) และภาพอ้างอิงแต่ละภาพที่นอกเหนือจากภาพแรกจะบวกเพิ่ม 1/15 ของราคาฐาน
fun-asr-flash-2026-06-15Alibaba$0.1260ต่อชั่วโมงเสียงAlibaba Fun-ASR Flash (2026-06-15) — การรู้จำเสียงพูดความหน่วงต่ำสำหรับไฟล์เสียงที่บันทึกไว้ พร้อมบริบทจากพรอมต์และการตรวจจับภาษาอัตโนมัติ ครอบคลุมภาษาถิ่นของจีนและอีกกว่า 30 ภาษา รับเสียงผ่าน URL, Base64 หรือไฟล์อัปโหลดแบบ AAC/AMR/AVI/FLAC/FLV/M4A/MKV/MOV/MP3/MP4/MPEG/OGG/OPUS/WAV/WEBM/WMA/WMV ยาวไม่เกิน 5 นาทีและขนาดไม่เกิน 2 GB
gemini-2.5-flash-imageGoogle$0.3000$2.5000$0.2100$1.7500ต่อ 1M tokensGoogle Gemini 2.5 Flash Image (Nano Banana) — โมเดลสร้างและแก้ไขภาพแบบเนทีฟที่ทำงานเร็ว สำหรับเวิร์กโฟลว์งานสร้างสรรค์ รับอินพุตข้อความและภาพ แล้วส่งภาพกลับผ่านเอนด์พอยต์ chat completions ที่เข้ากันได้กับ OpenAI พร้อมขีดจำกัดอินพุต 65,536 โทเค็น และขีดจำกัดเอาต์พุต 32,768 โทเค็น
gemini-2.5-proGoogle$1.2500$10.0000$0.8125$6.5000ต่อ 1M tokensGoogle Gemini 2.5 Pro — โมเดลระดับการให้เหตุผลของตระกูล 2.5 พร้อมหน้าต่างบริบท 1M โทเค็น พรอมต์ที่ยาวเกิน 200,000 โทเค็นจะถูกคิดราคาใหม่ตามอัตราบริบทยาวของผู้ให้บริการสำหรับทั้งคำขอ ตามกฎเดียวกับของ Google เอง
gemini-3-pro-imageGoogle$2.0000$12.0000$1.4000$8.4000ต่อ 1M tokensGoogle Gemini 3 Pro Image (Nano Banana Pro) — โมเดลระดับพรีเมียมที่ขับเคลื่อนด้วยการให้เหตุผล สำหรับการสร้างภาพระดับมืออาชีพและการแก้ไขผ่านบทสนทนา โดดเด่นด้านงานออกแบบกราฟิกที่ซับซ้อน ม็อกอัปสินค้าที่มีความเที่ยงตรงสูง การเรนเดอร์ข้อความหลายภาษาอย่างแม่นยำ ความสอดคล้องของแบรนด์ และการแสดงภาพข้อมูลเชิงข้อเท็จจริงที่อ้างอิงจาก Google Search รับข้อความและภาพ ส่งกลับทั้งข้อความและภาพ รองรับการคิด และสร้างเอาต์พุต 1K, 2K หรือ 4K
gemini-3.1-flash-imageGoogle$0.5000$3.0000$0.3500$2.1000ต่อ 1M tokensGoogle Gemini 3.1 Flash Image (Nano Banana 2) — โมเดลรุ่นเสถียรที่มีความหน่วงต่ำ สำหรับการสร้างภาพคุณภาพสูงและการแก้ไขผ่านบทสนทนา รับข้อความ ภาพ และ PDF รองรับการคิดและการอ้างอิงจากการค้นหา และสร้างภาพขนาด 0.5K, 1K, 2K หรือ 4K สำหรับเวิร์กโฟลว์ผลิตงานปริมาณมาก
gemini-3.1-flash-lite-imageGoogle$0.2500$1.5000$0.1750$1.0500ต่อ 1M tokensGoogle Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — โมเดลที่มีความหน่วงต่ำมากและคุ้มค่า สำหรับการสร้างภาพปริมาณมากและการแก้ไขหลายรอบอย่างรวดเร็ว รับข้อความและภาพ สร้างภาพขนาด 1K รองรับการคิดและการแก้ไขผ่านบทสนทนา ออกแบบมาสำหรับแอปพลิเคชันเชิงโต้ตอบทั้งของนักพัฒนาและผู้ใช้ทั่วไป
gemini-3.5-flashGoogle$1.5000$9.0000$1.0500$6.3000ต่อ 1M tokensGoogle Gemini 3.5 Flash — โมเดลมัลติโหมดรุ่นเสถียร ปรับให้เหมาะกับประสิทธิภาพของเอเจนต์ที่ต่อเนื่อง ลูปการเขียนโค้ดที่รวดเร็ว การกระจายงานให้เอเจนต์ย่อย และเวิร์กโฟลว์หลายขั้นตอนที่ทำงานยาวนาน รับข้อความ ภาพ วิดีโอ เสียง และ PDF รองรับการคิดและเครื่องมือในตัว พร้อมบริบทอินพุต 1,048,576 โทเค็น และเอาต์พุตสูงสุด 65,536 โทเค็น
gemini-3.6-flashGoogle$0.7500$3.7500$0.5250$2.6250ต่อ 1M tokensGoogle Gemini 3.6 Flash — โมเดลการให้เหตุผลแบบมัลติโหมดรุ่นเสถียร ที่สมดุลระหว่างความเร็วกับความฉลาดสำหรับงานเอเจนต์และงานในโลกจริง มีบริบทอินพุต 1,048,576 โทเค็น และขีดจำกัดเอาต์พุต 65,536 โทเค็น รับข้อความ ภาพ วิดีโอ เสียง และ PDF พร้อมรองรับการคิด การเรียกฟังก์ชัน การรันโค้ด การอ้างอิงจากการค้นหา เอาต์พุตแบบมีโครงสร้าง และ Computer Use (พรีวิว) หมายเหตุเรื่องราคา: ราคาตามรายการของ Google สำหรับโมเดลนี้เป็นราคาโปรโมชันจนถึงวันที่ 31 ธันวาคม 2026 — อินพุต $0.75 / เอาต์พุต $3.75 / อินพุตที่แคชไว้ $0.075 ต่อ 1M โทเค็น ตั้งแต่วันที่ 1 มกราคม 2027 ราคาตามรายการของผู้ให้บริการจะกลับไปอยู่ที่ $1.50 / $7.50 / $0.15 และราคาของเราจะปรับตามโดยคงระดับเทียบเท่าเดิม
gemini-3.7-flashGoogle$0.7500$3.7500$0.5250$2.6250ต่อ 1M tokensGoogle Gemini 3.7 Flash — โมเดลการให้เหตุผลแบบมัลติโหมดระดับ Flash รุ่นใหม่ล่าสุด คิดราคาเท่ากับ 3.6 Flash ตลอดช่วงโปรโมชันของผู้ให้บริการ รับข้อความ ภาพ วิดีโอ เสียง และ PDF รองรับการคิด การเรียกฟังก์ชัน การรันโค้ด การอ้างอิงจากการค้นหา และเอาต์พุตแบบมีโครงสร้าง หมายเหตุเรื่องราคา: ราคาตามรายการของ Google สำหรับโมเดลนี้เป็นราคาโปรโมชันจนถึงวันที่ 31 ธันวาคม 2026 — อินพุต $0.75 / เอาต์พุต $3.75 / อินพุตที่แคชไว้ $0.075 ต่อ 1M โทเค็น ตั้งแต่วันที่ 1 มกราคม 2027 ราคาตามรายการของผู้ให้บริการจะกลับไปอยู่ที่ $1.50 / $7.50 / $0.15 และราคาของเราจะปรับตามโดยคงระดับเทียบเท่าเดิม
gemini-3.8-flashGoogle$0.7500$3.7500$0.4875$2.4375ต่อ 1M tokensGoogle Gemini 3.8 Flash — โมเดล Gemini แบบมัลติโหมดความเร็วสูงของ Google ซึ่งเรียกใช้ได้ที่นี่ทั้งผ่านเอนด์พอยต์ที่เข้ากันได้กับ OpenAI และเอนด์พอยต์ Gemini แบบเนทีฟ ราคาโทเค็นมาตรฐานคือ อินพุต $0.75 อินพุตที่แคชไว้ $0.075 และเอาต์พุต $3.75 ต่อ 1M โทเค็น
glm-5Zhipu AI$1.0000$3.2000$0.9500$3.0400ต่อ 1M tokensZhipu GLM-5 — โมเดล MoE ขนาด 744B พารามิเตอร์ โดยทำงานจริง 40B ฝึกด้วยข้อมูล 28.5T โทเค็น และใช้ DeepSeek Sparse Attention พร้อมหน้าต่างบริบท 200K และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP
glm-5-turboZhipu AI$1.2000$4.0000$1.1400$3.8000ต่อ 1M tokensZhipu GLM-5-Turbo — GLM-5 รุ่นที่เน้นปริมาณงาน ปรับให้เหมาะกับเวิร์กโฟลว์เอเจนต์ ได้แก่ การเรียกใช้เครื่องมือและสกิลที่เสถียรขึ้นตลอดงานหลายขั้นตอน การรับมือคำสั่งที่ซับซ้อนและยาวต่อเนื่องได้ดีขึ้น และการทำงานตามกำหนดเวลาหรืองานที่รันยาว หน้าต่างบริบท 200K เอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้าและตอบข้อความออก รองรับโหมดการคิด การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP
glm-5.1Zhipu AI$1.4000$4.4000$1.1200$3.5200ต่อ 1M tokensZhipu GLM-5.1 — โมเดลพื้นฐานเรือธงที่สร้างมาเพื่อการทำงานอัตโนมัติต่อเนื่องยาวนาน โดยผู้ให้บริการระบุว่าสามารถทำงานเดียวต่อเนื่องโดยไม่ต้องมีคนดูแลได้นานถึง 8 ชั่วโมง ครอบคลุมทั้งการวางแผน การลงมือทำ การทดสอบ และการปรับปรุงซ้ำ หน้าต่างบริบท 200K เอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้าและตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP
glm-5.2Zhipu AI$1.4000$4.4000$1.1200$3.5200ต่อ 1M tokensZhipu GLM-5.2 — โมเดลพื้นฐานเรือธงที่ออกแบบมาเฉพาะสำหรับงานเอเจนต์เขียนโค้ดระยะยาว ผ่านการฝึกเฉพาะทางนานหลายเดือน ไม่ใช่เพียงการขยายบริบท พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP
glm-5.3Zhipu AI$1.4000$4.4000$0.9100$2.8600ต่อ 1M tokensZhipu GLM-5.3 — โมเดลเรือธงด้านการเขียนโค้ดและเอเจนต์ ที่ผ่านการฝึกเพิ่มเติมบนโมเดลพื้นฐานเดียวกับ GLM-5.2 ได้คะแนนเพิ่มขึ้น 50% บนเบนช์มาร์กการเขียนโค้ดภายในของ Zhipu เป็น SOTA ในกลุ่มโอเพนซอร์สบน Terminal-Bench 3.0 และ Agents' Last Exam และให้ผลการค้นหาช่องโหว่บน CyberGym ในระดับล้ำสมัย พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP
glm-5.3-flashZhipu AI$0.1500$0.5000$0.1350$0.4500ต่อ 1M tokensZhipu GLM-5.3-Flash — โมเดลมัลติโหมดแบบเนทีฟรุ่นแรกในสาย GLM-5 และเป็นระดับแนวหน้าราคาประหยัดของสายนี้ มีพารามิเตอร์รวม 320B และทำงานจริง 18B บนสถาปัตยกรรม attention แบบผสมระหว่างเชิงเส้นกับแบบเบาบาง ซึ่งลดการคำนวณ attention และ KV cache ลงหลายเท่าเมื่อเทียบกับ GLM-5.3 พร้อมทั้งลดจำนวนพารามิเตอร์ที่ทำงานจริงและจำนวนชั้นลงครึ่งหนึ่งเมื่อเทียบกับ GLM-4.5 รับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ (ผู้ให้บริการยังโฆษณาว่ารับอินพุตไฟล์ได้ด้วย แต่ยังไม่ได้ตรวจสอบยืนยันที่นี่จึงไม่เปิดให้ใช้) หน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 128K โทเค็น รองรับโหมดการคิด การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP วางตำแหน่งไว้สำหรับการเขียนโค้ดเชิงภาพ ได้แก่ งานฟรอนต์เอนด์ เกม และ 3D ที่โมเดลตรวจดูผลลัพธ์ที่เรนเดอร์ออกมาของตนเองแล้วปรับปรุงซ้ำ
glm-5v-turboZhipu AI$1.2000$4.0000$1.1400$3.8000ต่อ 1M tokensZhipu GLM-5V-Turbo — โมเดลการให้เหตุผลแบบมัลติโหมดสำหรับภาพ วิดีโอ ไฟล์ การเขียนโค้ด และเวิร์กโฟลว์เอเจนต์ที่ขับเคลื่อนด้วยเครื่องมือ
glm-imageZhipu AI$0.015$0.01425ต่อคำขอZhipu GLM-Image — การสร้างภาพบนสถาปัตยกรรมแบบผสมที่รวมการทำความเข้าใจแบบ autoregressive เข้ากับการถอดรหัสแบบ diffusion เป็นโมเดลมัลติโหมดระดับ SOTA ตัวแรกที่ฝึกแบบ end-to-end บนชิปที่ผลิตในประเทศจีน (Huawei Ascend) ตีความจากคำสั่งแทนที่จะดูแค่คีย์เวิร์ด และเติมรายละเอียดที่พรอมต์ไม่ได้ระบุไว้อย่างชัดแจ้ง พร้อมความสามารถที่แข็งแกร่งขึ้นอย่างเห็นได้ชัดในการเรนเดอร์ข้อความ (โดยเฉพาะอักษรจีน) และฉากที่ต้องอาศัยความรู้เข้มข้น สร้างได้หนึ่งภาพต่อคำขอ
glm-ttsZhipu AI$0.3500$0.3150ต่อ 1 หมื่นอักขระZhipu GLM-TTS — การแปลงข้อความเป็นเสียงพูดที่สร้างบนสถาปัตยกรรมการสร้างสองขั้นตอนร่วมกับการเรียนรู้เสริมกำลังแบบ GRPO ซึ่งอนุมานอารมณ์และน้ำเสียงจากข้อความแวดล้อมแทนที่จะต้องกำกับอย่างชัดแจ้ง มาพร้อมเสียงในตัวเจ็ดเสียง (ค่าเริ่มต้นคือ tongtong ตามด้วย xiaochen, chuichui, jam, kazi, douji, luodo) ปรับความเร็วและความดังได้ รับได้สูงสุด 1,024 อักขระต่อคำขอ และสตรีมด้วยความหน่วงของเฟรมแรกต่ำกว่า 400 ms ผลลัพธ์เป็น wav หรือ pcm ที่อัตราสุ่มสัญญาณแนะนำ 24 kHz ส่วนการสตรีมรองรับเฉพาะ pcm
gpt-5.5OpenAI$5.0000$30.0000$4.0000$24.0000ต่อ 1M tokensOpenAI GPT-5.5 — โมเดลการให้เหตุผลระดับแนวหน้าสำหรับการเขียนโค้ดที่ซับซ้อนและงานอาชีพ รองรับอินพุตข้อความและภาพ การเรียกฟังก์ชันและเครื่องมือในตัว หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และระดับความเข้มข้นของการให้เหตุผลตั้งแต่ none จนถึง xhigh
gpt-5.6-lunaOpenAI$0.2000$1.2000$0.1700$1.0200ต่อ 1M tokensOpenAI GPT-5.6 Luna — ระดับที่เร็วที่สุดและคุ้มค่าที่สุดของ GPT-5.6 ปรับให้เหมาะกับงานปริมาณมากที่อ่อนไหวต่อต้นทุน โดยยังคงความสามารถด้านการให้เหตุผล การมองเห็น และการใช้เครื่องมือ รองรับอินพุตข้อความและภาพ หน้าต่างบริบท 1,050,000 โทเค็น และเอาต์พุตสูงสุด 128,000 โทเค็น
gpt-5.6-solOpenAI$5.0000$30.0000$4.0000$24.0000ต่อ 1M tokensOpenAI GPT-5.6 Sol — โมเดลเรือธงของตระกูล GPT-5.6 สำหรับการให้เหตุผลระดับแนวหน้า งานอาชีพที่ซับซ้อน การเขียนโค้ด วิทยาศาสตร์ ความมั่นคงปลอดภัยไซเบอร์ และเวิร์กโฟลว์เอเจนต์ระยะยาว รองรับอินพุตข้อความและภาพ เครื่องมือในตัว หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และการตั้งค่าการให้เหตุผลที่ลึกที่สุดในตระกูลนี้
gpt-5.6-terraOpenAI$2.0000$12.0000$1.6000$9.6000ต่อ 1M tokensOpenAI GPT-5.6 Terra — โมเดล GPT-5.6 ที่สมดุลสำหรับงานอาชีพในแต่ละวัน ให้ความฉลาดและประสิทธิภาพของเอเจนต์เขียนโค้ดที่แข็งแกร่งด้วยต้นทุนต่ำกว่า Sol รองรับอินพุตข้อความและภาพ เครื่องมือในตัว หน้าต่างบริบท 1,050,000 โทเค็น และเอาต์พุตสูงสุด 128,000 โทเค็น
gpt-6-astraOpenAI$10.0000$50.0000$7.0000$35.0000ต่อ 1M tokensOpenAI GPT-6 Astra — โมเดลที่มีความสามารถสูงที่สุดของ OpenAI สร้างมาเพื่องานแบบครบวงจรที่ยากที่สุด ได้แก่ การให้เหตุผลที่ซับซ้อน การเขียนโค้ด การใช้งานคอมพิวเตอร์ การวิจัย และการสร้างเอกสาร รองรับอินพุตข้อความและภาพ หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และการตั้งค่าระดับความเข้มข้นของการให้เหตุผลได้ถึง xhigh และ max
gpt-6-lunaOpenAI$0.1000$0.5000$0.0650$0.3250ต่อ 1M tokensOpenAI GPT-6 Luna — โมเดลที่มีประสิทธิภาพสูงสุดของ OpenAI สร้างมาเพื่องานที่มีขอบเขตชัดเจนและปริมาณสูง รองรับอินพุตข้อความและภาพ หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และระดับการให้เหตุผลตั้งแต่ none ถึง max โดยค่าเริ่มต้นคือ medium ใช้ /v1/responses สำหรับการเรียกใช้เครื่องมือ เพราะบน /v1/chat/completions การเรียกฟังก์ชันใช้ได้เฉพาะเมื่อตั้ง reasoning_effort เป็น none บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา คำขอที่มี previous_response_id หรือ conversation จะถูกปฏิเสธ
gpt-6-solOpenAI$2.0000$10.0000$1.3000$6.5000ต่อ 1M tokensOpenAI GPT-6 Sol — สร้างมาเพื่องานเขียนโค้ดที่ซับซ้อนและเวิร์กโฟลว์แบบเอเจนต์ รองรับอินพุตข้อความและภาพ หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และระดับการให้เหตุผลตั้งแต่ none ถึง max โดยค่าเริ่มต้นคือ medium ใช้ /v1/responses สำหรับการเรียกใช้เครื่องมือ เพราะบน /v1/chat/completions การเรียกฟังก์ชันใช้ได้เฉพาะเมื่อตั้ง reasoning_effort เป็น none บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา คำขอที่มี previous_response_id หรือ conversation จะถูกปฏิเสธ
gpt-6.1-solOpenAI$2.0000$10.0000$1.3000$6.5000ต่อ 1M tokensOpenAI GPT-6.1 Sol — ใกล้เคียง GPT-6 Astra ในงานเขียนโค้ดที่ซับซ้อน การใช้งานคอมพิวเตอร์ และงานระดับมืออาชีพ ด้วยค่าใช้จ่ายที่ต่ำกว่า รองรับอินพุตข้อความและภาพ หน้าต่างบริบท 1,050,000 โทเค็น และเอาต์พุตสูงสุด 128,000 โทเค็น ระดับการให้เหตุผลตั้งแต่ low ถึง max โดยค่าเริ่มต้นคือ medium ไม่รองรับ none และ minimal และโทเค็นการให้เหตุผลคิดค่าบริการเป็นเอาต์พุต เมื่ออินพุตเกิน 272,000 โทเค็น ทุกโทเค็นในคำขอนั้นจะคิดตามอัตราบริบทยาว ใช้ /v1/responses สำหรับการเรียกใช้เครื่องมือ เพราะ /v1/chat/completions ไม่รองรับการเรียกใช้เครื่องมือ บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา คำขอที่มี previous_response_id หรือ conversation จะถูกปฏิเสธ
gpt-image-2OpenAI$5.0000$30.0000$4.0000$24.0000ต่อ 1M tokensOpenAI GPT Image 2 — โมเดลสร้างและแก้ไขภาพระดับล้ำสมัย สำหรับเอาต์พุตคุณภาพสูงที่รวดเร็ว รับอินพุตข้อความและภาพ รองรับขนาดภาพที่ยืดหยุ่นและอินพุตภาพความคมชัดสูง และคิดค่าบริการต่อโทเค็นแทนการคิดต่อการเรียกใช้ ได้แก่ อินพุตข้อความ $5 อินพุตข้อความที่แคชไว้ $1.25 อินพุตภาพ $8 และเอาต์พุตภาพ $30 ต่อ 1M โทเค็น
gpt-image-2.5-flareOpenAI$5.0000$30.0000$4.0000$24.0000ต่อ 1M tokensOpenAI GPT Image 2.5 Flare — โมเดลสร้างและแก้ไขภาพจากตระกูล GPT Image 2.5 ของ OpenAI ทั้ง Flare และ gpt-image-2.5-sunburst เป็นบิลด์ที่แยกจากกัน ไม่ใช่ชื่อแทนของโมเดลเดียวกัน และจำหน่ายในราคาเดียวกัน ส่วนตารางจัดอันดับสาธารณะให้คะแนนทั้งสองแยกกัน ราคาโทเค็นมาตรฐานคือ อินพุตข้อความ $5 อินพุตที่แคชไว้ $1.25 อินพุตภาพ $8 และเอาต์พุตภาพ $30 ต่อ 1M โทเค็น
gpt-image-2.5-sunburstOpenAI$5.0000$30.0000$4.0000$24.0000ต่อ 1M tokensOpenAI GPT Image 2.5 Sunburst — โมเดลสร้างและแก้ไขภาพจากตระกูล GPT Image 2.5 ของ OpenAI ทั้ง Sunburst และ gpt-image-2.5-flare เป็นบิลด์ที่แยกจากกัน ไม่ใช่ชื่อแทนของโมเดลเดียวกัน และจำหน่ายในราคาเดียวกัน ส่วนตารางจัดอันดับสาธารณะให้คะแนนทั้งสองแยกกัน ราคาโทเค็นมาตรฐานคือ อินพุตข้อความ $5 อินพุตที่แคชไว้ $1.25 อินพุตภาพ $8 และเอาต์พุตภาพ $30 ต่อ 1M โทเค็น
grok-4.7xAI$2.0000$6.0000$0.8000$2.4000ต่อ 1M tokensxAI Grok 4.7 — โมเดลระดับแนวหน้าที่สร้างมาเพื่องานเขียนโค้ด งานแบบเอเจนต์ และงานความรู้ รองรับอินพุตข้อความและภาพ พร้อมหน้าต่างบริบท 500,000 โทเค็น ปิดการให้เหตุผลไม่ได้ โดยเลือก reasoning_effort ได้เป็น low, medium, high หรือ xhigh ค่าเริ่มต้นคือ high และโทเค็นการให้เหตุผลคิดค่าบริการเป็นเอาต์พุต เมื่อพรอมต์มีความยาวถึง 200,000 โทเค็น ทุกโทเค็นในคำขอนั้นจะคิดตามอัตราบริบทยาว รับเฉพาะเครื่องมือ function เท่านั้น เครื่องมือฝั่งเซิร์ฟเวอร์ของ xAI เช่น การค้นหาเว็บ การค้นหา X และการรันโค้ด ใช้ไม่ได้ และคำขอที่มีเครื่องมือเหล่านี้จะถูกปฏิเสธ บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา และส่งรายการการให้เหตุผลที่เข้ารหัสจากการตอบกลับก่อนหน้ากลับไปโดยไม่แก้ไข คำขอที่มี previous_response_id หรือ conversation จะถูกปฏิเสธ
happyhorse-1.1-i2vAlibaba$0.140ต่อวินาทีAlibaba HappyHorse 1.1 (I2V) — ภาพเป็นวิดีโอ พร้อมพื้นผิวที่ดีขึ้น ความสอดคล้องของตัวละครข้ามคลิป ความลื่นไหลของการเคลื่อนไหว และการซิงก์ภาพกับเสียง 720P/1080P
happyhorse-1.1-r2vAlibaba$0.140ต่อวินาทีAlibaba HappyHorse 1.1 (R2V) — สร้างวิดีโอจากภาพอ้างอิงได้สูงสุด 9 ภาพ คงความสอดคล้องของตัวแบบ ฉาก และสไตล์ได้ดี พร้อมควบคุมมุมกล้อง 720P/1080P
happyhorse-1.1-t2vAlibaba$0.140ต่อวินาทีAlibaba HappyHorse 1.1 (T2V) — ข้อความเป็นวิดีโอ พร้อมการเข้าใจความหมาย การควบคุมมุมกล้อง และการสร้างภาพเคลื่อนไหวที่ดีขึ้น ให้วิดีโอ 720P/1080P ที่ลื่นไหล มีรายละเอียด และสมจริงตามหลักฟิสิกส์
hy-mt2-liteTencent$0.0440$0.1770ต่อ 1M tokensTencent HY-MT2 Lite — ระดับการแปลหลายภาษาที่ปรับให้เหมาะด้านความหน่วงและต้นทุน ผ่านโปรโตคอล OpenAI Chat Completions รับอินพุตได้สูงสุด 4K โทเค็น และเอาต์พุตสูงสุด 4K โทเค็น รองรับข้อความเท่านั้น
hy-mt2-plusTencent$0.0740$0.2950ต่อ 1M tokensTencent HY-MT2 Plus — ระดับการแปลหลายภาษาที่ทำตามคำสั่งได้ ผ่านโปรโตคอล OpenAI Chat Completions รับอินพุตได้สูงสุด 4K โทเค็น และเอาต์พุตสูงสุด 4K โทเค็น รองรับข้อความเท่านั้น
hy-mt2-proTencent$0.0740$0.2950ต่อ 1M tokensTencent HY-MT2 Pro — ระดับเรือธงด้านการแปลด้วยเครื่องสำหรับการแปลหลายภาษาคุณภาพสูง ผ่านโปรโตคอล OpenAI Chat Completions รับอินพุตได้สูงสุด 4K โทเค็น และเอาต์พุตสูงสุด 4K โทเค็น รองรับข้อความเท่านั้น
hy3Tencent$0.1320$0.5280ต่อ 1M tokensTencent Hunyuan 3 (Hy3) — โมเดล MoE ขนาด 295B พารามิเตอร์ (ทำงานจริง 21B) บริบทดั้งเดิม 256K และโหมดการคิดสามระดับ (fast / low / deep) โดดเด่นด้านเอเจนต์เขียนโค้ด การเข้าใจเอกสารยาว การรักษาบริบทหลายรอบ และเวิร์กโฟลว์เอเจนต์หลายขั้นตอน รองรับข้อความเท่านั้น
hy4-previewTencent$0.8340$2.5010ต่อ 1M tokensTencent Hunyuan 4 preview (Hy4 preview) — หน้าต่างบริบท 1M โทเค็น (อินพุตสูงสุด 960K เอาต์พุตสูงสุด 64K) พร้อมการคิดเชิงลึก (ซึ่ง Tencent เรียกว่า preserved thinking) เอาต์พุตแบบมีโครงสร้าง การเรียกฟังก์ชัน และการแคชพรอมต์ รองรับข้อความเท่านั้น เป็น SKU รุ่นพรีวิว ซึ่ง Tencent จะเลิกให้บริการโมเดลพรีวิวเมื่อรุ่นที่เปิดให้ใช้งานทั่วไปออกมาแล้ว
jev-1.13TypeSafe$0.0462ต่อ 1M tokensTypeSafe Jev 1.13 — โมเดลตัดสินใจแบบ System One ไม่ใช่โมเดลแชต ส่ง state ของแอปพลิเคชัน (สตริง ออบเจ็กต์ JSON หรืออาร์เรย์) พร้อมชุดคำถามแบบมีชนิดไปที่ POST /v1/systemone ได้แก่ choice (เลือกหนึ่งตัวเลือกจากที่คุณกำหนด) score (จัดวางบนระดับที่เรียงลำดับไว้) หรือ noul (ความน่าจะเป็นที่ข้อความแบบใช่/ไม่ใช่จะเป็นจริง) แล้วรับคำตอบแบบมีชนิดพร้อมความน่าจะเป็นของทุกตัวเลือกและค่าความเชื่อมั่น โดยทั่วไปภายใน 70–500 ms คำถามทั้งหมดถูกประเมินแบบขนานกับ state เดียวกัน จึงรวมหลายคำถามไว้ในคำขอเดียวได้ SDK ทางการของ TypeSafe สำหรับ Python และ JavaScript ใช้งานได้ทันทีเพียงตั้ง base URL เป็น https://api.chinaapi.ai คิดค่าบริการตามโทเค็นอินพุตเท่านั้น เอาต์พุตไม่มีค่าใช้จ่าย รับอินพุตเป็นข้อความเท่านั้น สูงสุด 32K โทเค็นต่อคำขอ ภาษาหลักคือภาษาอังกฤษ จึงควรทดสอบภาษาอื่นก่อนนำไปใช้จริง
jev-latestTypeSafe$0.0462ต่อ 1M tokensTypeSafe Jev (latest) — ชื่อแฝงที่ SDK ของ TypeSafe เรียกใช้เมื่อไม่ได้ระบุ model ปัจจุบันให้บริการ jev-1.13 ในราคาเดียวกันและใช้สัญญา System One เดียวกันบน POST /v1/systemone คือรับ state พร้อมคำถามแบบมีชนิด choice score และ noul แล้วส่งคืนคำตอบแบบมีชนิดพร้อมความน่าจะเป็นและค่าความเชื่อมั่น ฟิลด์ model ในผลตอบกลับระบุเวอร์ชันที่ตอบจริง เราจะย้ายชื่อแฝงไปยัง Jev รุ่นใหม่หลังจากตรวจสอบราคาแล้วเท่านั้น หากคุณปรับค่าเกณฑ์ตามเวอร์ชันนี้แล้ว ให้ระบุ jev-1.13 โดยตรง
kimi-k2.6Moonshot$0.9500$4.0000$0.7600$3.2000ต่อ 1M tokensMoonshot Kimi K2.6 — โมเดลอเนกประสงค์สำหรับการสนทนา การสร้างโค้ด การเข้าใจภาพ และงานเอเจนต์ โดยเขียนโค้ดระยะยาวและทำงานได้ด้วยตนเองดีกว่ารุ่นก่อนหน้า หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ (png, jpeg, webp, gif) และวิดีโอ (mp4, mov, webm และอื่น ๆ) ในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ โหมดการคิดเปิดไว้ตามค่าเริ่มต้นและปิดได้ ส่วน temperature ถูกตรึงไว้ที่ 1.0 เมื่อเปิดการคิด และ 0.6 เมื่อปิด
kimi-k2.7-codeMoonshot$0.9500$4.0000$0.7600$3.2000ต่อ 1M tokensMoonshot Kimi K2.7 Code — โมเดลเฉพาะทางด้านการเขียนโค้ดของ Kimi ซึ่งผู้ให้บริการวัดผลว่าทำตามคำสั่งได้ดีขึ้นและเขียนโค้ดระยะยาวได้ดีกว่า K2.6 พร้อมลดการคิดเกินจำเป็นลงราว 30% โดยเฉลี่ย หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ การคิดเป็นสิ่งบังคับและจะเกิดข้อผิดพลาดหากปิด ส่วน tool_choice จำกัดไว้ที่ auto หรือ none เท่านั้น และต้องส่งต่อ reasoning_content ตลอดการเรียกใช้เครื่องมือหลายขั้นตอน
kimi-k2.7-code-highspeedMoonshot$1.9000$8.0000ต่อ 1M tokensMoonshot Kimi K2.7 Code Highspeed — ระดับที่เน้นปริมาณงานของ K2.7 Code ให้บริการโมเดลเดียวกันที่ความเร็วราว 180 โทเค็นต่อวินาที และสูงสุด 260 โทเค็นในงานที่บริบทสั้น หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ การคิดเป็นสิ่งบังคับและจะเกิดข้อผิดพลาดหากปิด ส่วน tool_choice จำกัดไว้ที่ auto หรือ none เท่านั้น และต้องส่งต่อ reasoning_content ตลอดการเรียกใช้เครื่องมือหลายขั้นตอน
kimi-k3Moonshot$3.0000$15.0000$1.9500$9.7500ต่อ 1M tokensMoonshot Kimi K3 — โมเดลเรือธงขนาด 2.8 ล้านล้านพารามิเตอร์ สำหรับการเขียนโค้ดระยะยาว งานความรู้แบบครบวงจร และการให้เหตุผลเชิงลึก พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 1,048,576 โทเค็น (ค่าเริ่มต้น 131,072) โมเดลรับข้อความ ภาพที่เข้ารหัส base64 และวิดีโอที่เข้ารหัส base64 แล้วตอบกลับเป็นข้อความ การคิดเปิดอยู่เสมอ โดยระดับความเข้มข้นของการให้เหตุผลอยู่ที่ max ตามค่าเริ่มต้น และ temperature ถูกตรึงไว้ที่ 1.0 รองรับการเรียกใช้เครื่องมือที่กำหนดเองและการโหลดเครื่องมือแบบไดนามิก
kling-3.0-turboKuaishou$0.560ต่อคำขอKuaishou Kling 3.0 Turbo — ระดับคุ้มราคาของตระกูล Kling 3.0 สร้างวิดีโอ 720P หรือ 1080P (ค่าเริ่มต้น 720P) ความยาว 3-15 วินาที (ค่าเริ่มต้น 5) ในอัตราส่วน 16:9, 9:16 หรือ 1:1 จากพรอมต์หรือภาพเฟรมแรก เสียงในตัวมาพร้อมเสมอและไม่มีสวิตช์เปิดปิด เมื่อเทียบกับ kling-v3 รุ่นนี้ตัดระดับ 4K การควบคุมเฟรมสุดท้าย และการรับวิดีโอเป็นอินพุตออกไป เพื่อแลกกับความเร็วและต้นทุน 720p 5 วินาทีพร้อมเสียง ≈ $0.56
kling-v3Kuaishou$0.420ต่อคำขอKuaishou Kling 3.0 — ข้อความเป็นวิดีโอและภาพเป็นวิดีโอ พร้อมเสียงในตัวและความสอดคล้องขององค์ประกอบที่ดีขึ้น คลิปยาว 3-15 วินาที (ค่าเริ่มต้น 5) ในอัตราส่วน 16:9, 9:16 หรือ 1:1 โดยเลือกระดับผ่าน mode ได้แก่ std สำหรับ 720P, pro สำหรับ 1080P และ 4k สำหรับ 4K แบบเนทีฟ เสียงต้องเปิดเองผ่าน sound=on และค่าเริ่มต้นคือปิด ส่วนภาพเป็นวิดีโอรับเฟรมแรกพร้อมเฟรมท้ายที่จะใส่หรือไม่ก็ได้ เริ่มต้นที่ $0.083/วินาที (720p)
kling-v3-omniKuaishou$0.420ต่อคำขอKling 3.0 Omni — สร้างวิดีโอจากหลายภาพอ้างอิง ราคาที่แสดงเป็นของระดับ std (720p, 5 วินาที, ไม่มีเสียง, ไม่มีวิดีโออ้างอิง) คำขอที่ไม่ได้ระบุ mode จะใช้ระดับ pro ซึ่งเป็นค่าเริ่มต้นของต้นทาง และถูกคิดค่าบริการ 1.33 เท่า หรือราว $0.56 สำหรับคลิป 5 วินาทีเดียวกัน ส่วน 4k คิด 5 เท่า กรุณาส่ง mode=std เพื่อให้ถูกคิดตามราคาที่แสดง
LongCat-2.0Meituan$0.3000$1.2000ต่อ 1M tokensMeituan LongCat-2.0 — โมเดล MoE แบบเปิดขนาด 1.6T พารามิเตอร์ พร้อมบริบทดั้งเดิม 1M สร้างมาเพื่อการเขียนโค้ดเชิงเอเจนต์และการใช้เครื่องมือระยะยาว เป็นโมเดลการให้เหตุผลที่รองรับข้อความเท่านั้น
M2-herMiniMax$0.3000$1.2000ต่อ 1M tokensMiniMax M2-her — โมเดลสนทนาที่สร้างมาเพื่อการสวมบทบาทและการแชทหลายรอบ พร้อมหน้าต่างบริบท 65,536 โทเค็น และคำตอบจำกัดไว้ที่ 2,048 โทเค็น (max_completion_tokens) นอกจาก system / user / assistant แล้ว โมเดลยังรับบทบาทข้อความแบบขยายของผู้ให้บริการบนเอนด์พอยต์แชทที่เข้ากันได้กับ OpenAI ได้แก่ user_system (เพอร์โซนาของผู้ใช้) group (ชื่อของบทสนทนา) และ sample_message_user / sample_message_ai (ตัวอย่างการโต้ตอบที่ใช้กำหนดสไตล์การตอบ) ทุกข้อความที่ใช้บทบาทแบบขยายต้องมีฟิลด์ name หากไม่มี ผู้ให้บริการจะปฏิเสธทั้งคำขอด้วยข้อผิดพลาด 2013 ขณะที่ข้อความ system/user/assistant ทั่วไปไม่ต้องมี name รองรับข้อความเท่านั้น: ไม่รับอินพุตภาพ และเอกสารของผู้ให้บริการไม่ได้ระบุการเรียกใช้เครื่องมือหรือการแคช ทุกการเรียกจะมีโทเค็นเพอร์โซนาส่วนเกินจากฝั่งผู้ให้บริการราว 170 โทเค็นเพิ่มจากพรอมต์ที่มองเห็น ซึ่งคิดค่าบริการเป็นอินพุต
mimo-v2.5Xiaomi$0.1400$0.2800ต่อ 1M tokensXiaomi MiMo-V2.5 — โมเดลที่รองรับครบทุกโหมดโดยกำเนิด พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K เข้าใจภาพ วิดีโอ เสียง และข้อความได้ในโมเดลเดียว รองรับการคิดเชิงลึก การเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการค้นหาเว็บ พร้อมความสามารถเอเจนต์ครบทุกโหมด
mimo-v2.5-asrXiaomi$0.0740ต่อชั่วโมงเสียงXiaomi MiMo v2.5 ASR — โมเดลรู้จำเสียงพูดที่ปรับให้เหมาะกับภาษาจีนและอังกฤษรวมถึงภาษาถิ่นจีน รองรับเสียงที่มีสัญญาณรบกวน เสียงระยะไกล เสียงหลายผู้พูด ตลอดจนการถอดเนื้อเพลง
mimo-v2.5-proXiaomi$0.4350$0.8700ต่อ 1M tokensXiaomi MiMo-V2.5-Pro — โมเดลเรือธงระดับล้านล้านพารามิเตอร์ (ทำงานจริง 42B) พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K ปรับจูนมาสำหรับงานเอเจนต์ที่ใช้งานหนัก รองรับการคิดเชิงลึก การเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการค้นหาเว็บ สร้างได้เฉพาะข้อความ ต่างจาก mimo-v2.5 ตรงที่รายการความสามารถของผู้ให้บริการไม่ได้ระบุการเข้าใจครบทุกโหมด
mimo-v2.5-ttsXiaomi$0.0000ต่อ 1 หมื่นอักขระXiaomi MiMo v2.5 TTS — การแปลงข้อความเป็นเสียงพูดที่มีอารมณ์ พร้อมเสียงในตัวแปดเสียง เป็นภาษาจีนสี่เสียงและภาษาอังกฤษสี่เสียง (Mia, Chloe, Milo, Dean) ครอบคลุมภาษาจีนและอังกฤษ รวมถึงสไตล์ภาษาถิ่นตงเป่ย เสฉวน เหอหนาน และกวางตุ้ง กำกับลีลาการพูดได้สองทาง คือคำสั่งกำหนดสไตล์ด้วยภาษาธรรมชาติ และแท็กเสียงแบบอินไลน์สำหรับอารมณ์พื้นฐานและอารมณ์ผสม การหายใจ การถอนหายใจ และจังหวะ รวมถึงโหมดร้องเพลงที่มีเฉพาะโมเดลนี้ในตระกูล MiMo TTS ผลลัพธ์เป็น wav โมโนหรือ pcm16 ที่ 24 kHz และรองรับการสตรีมความหน่วงต่ำ ซึ่งต้องใช้ pcm16 บริบท 8K และเอาต์พุตสูงสุด 8K
mimo-v2.5-tts-voicecloneXiaomi$0.0000ต่อ 1 หมื่นอักขระXiaomi MiMo v2.5 TTS VoiceClone — โมเดลโคลนเสียง: ส่งตัวอย่างเสียงอ้างอิงเป็น data URL ในฟิลด์ voice (data:{mime};base64,...) แล้วโมเดลจะสังเคราะห์คำพูดด้วยเสียงนั้นโดยไม่ต้องผ่านขั้นตอนฝึกสอน กำกับข้อมูล หรือปรับจูนใด ๆ รองรับ MP3 (audio/mpeg) หรือ WAV โดยสตริงที่เข้ารหัส base64 ต้องไม่เกิน 10 MB ทั้งนี้ Xiaomi ไม่ได้ประกาศความยาวขั้นต่ำของเสียงอ้างอิง คำสั่งกำหนดสไตล์ด้วยภาษาธรรมชาติและแท็กเสียงแบบอินไลน์สืบทอดมาจาก mimo-v2.5-tts แต่ไม่มีการสตรีม คำขอจะทำงานในโหมดความเข้ากันได้และตอบกลับเมื่อสังเคราะห์เสร็จแล้วเท่านั้น
mimo-v2.5-tts-voicedesignXiaomi$0.0000ต่อ 1 หมื่นอักขระXiaomi MiMo v2.5 TTS VoiceDesign — โมเดลออกแบบเสียง: อธิบายเสียงที่ต้องการเป็นภาษาธรรมชาติในฟิลด์ instructions แล้วโมเดลจะสังเคราะห์คำพูดด้วยเสียงที่ออกแบบไว้นั้น
mimo-v2.6-flashXiaomi$0.1400$0.2800$0.1260$0.2520ต่อ 1M tokensXiaomi MiMo-V2.6-Flash — โมเดลการให้เหตุผลที่มีประสิทธิภาพและต้นทุนต่ำ เปิดเผยน้ำหนักโมเดล รองรับครบทุกโหมดโดยกำเนิด เข้าใจภาพ วิดีโอ เสียง และข้อความได้ในโมเดลเดียว พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K รองรับการคิดเชิงลึก การเรียกฟังก์ชัน และเอาต์พุตแบบมีโครงสร้าง เหมาะกับงานมืออาชีพประจำวันปริมาณมากที่ให้ความสำคัญกับต้นทุนและปริมาณงานที่รองรับได้
mimo-v2.6-proXiaomi$0.4350$0.8700$0.3915$0.7830ต่อ 1M tokensXiaomi MiMo-V2.6-Pro — โมเดลเรือธงด้านการให้เหตุผลระดับล้านล้านพารามิเตอร์ของ Xiaomi ที่เปิดเผยน้ำหนักโมเดล รองรับครบทุกโหมดโดยกำเนิด เข้าใจภาพ วิดีโอ เสียง และข้อความได้ในโมเดลเดียว พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K รองรับการคิดเชิงลึก การเรียกฟังก์ชัน และเอาต์พุตแบบมีโครงสร้าง ออกแบบมาสำหรับโปรเจกต์ที่ซับซ้อน งานเอเจนต์ระยะยาว ความปลอดภัยไซเบอร์ และงานวิจัย
mimo-v2.6-pro-ultraspeedXiaomi$4.3500$8.7000ต่อ 1M tokensXiaomi MiMo-V2.6-Pro UltraSpeed — MiMo-V2.6-Pro ที่ให้บริการในโหมดความเร็วสูงพิเศษของ Xiaomi ให้เอาต์พุตเร็วกว่ารุ่นมาตรฐานสูงสุด 20 เท่า เหมาะกับการโต้ตอบแบบเรียลไทม์และงานโปรดักชันที่ไวต่อความหน่วง มีความสามารถเหมือน mimo-v2.6-pro ได้แก่ การเข้าใจภาพ วิดีโอ เสียง และข้อความครบทุกโหมด บริบท 1M เอาต์พุตสูงสุด 128K การคิดเชิงลึก การเรียกฟังก์ชัน และเอาต์พุตแบบมีโครงสร้าง ราคาสิบเท่าของ mimo-v2.6-pro และ Xiaomi จัดสรรความจุของโหมดนี้แยกต่างหาก จึงอาจถูกจำกัดอัตราเมื่อมีคำขอพุ่งสูงอย่างหนัก
MiniMax-H3MiniMax$0.080ต่อวินาทีMiniMax H3 (Hailuo 3.0) — โมเดลวิดีโอมัลติโหมดอเนกประสงค์แบบเปิดรุ่นใหม่ ที่สร้างเสียงสเตอริโอในตัวภายในรอบเดียว ที่ความละเอียด 768P หรือ 2K ความยาว 4-15 วินาที (รับเฉพาะจำนวนเต็ม) ที่ 24 fps ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและ/หรือเฟรมสุดท้าย และการสร้างจากสื่ออ้างอิงด้วยภาพ วิดีโอ หรือเสียง เพื่อกำหนดตัวละคร การเคลื่อนไหว มุมกล้อง สไตล์ น้ำเสียง หรือจังหวะการตัดต่อ ทั้งนี้ไม่สามารถใช้ภาพเป็นวิดีโอร่วมกับการสร้างจากสื่ออ้างอิงในคำขอเดียวกันได้ โมเดลรับวิดีโอ H.264/H.265 ภาพ JPG, JPEG, PNG, WEBP, HEIC และ HEIF และเสียง WAV หรือ MP3 โดยพรอมต์ยาวได้ถึง 7,000 อักขระ $0.08/วินาที ที่ 768P และ $0.13/วินาที ที่ 2K
MiniMax-Hailuo-02MiniMax$0.280ต่อคำขอMiniMax Hailuo 02 — การสร้างวิดีโอราคาประหยัดที่ครอบคลุมทั้งข้อความเป็นวิดีโอและภาพเป็นวิดีโอ ที่ 24 fps โดย 512p และ 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที ระดับ 512p เป็นจุดเริ่มต้นของตระกูล Hailuo
MiniMax-Hailuo-2.3MiniMax$0.280ต่อคำขอMiniMax Hailuo 2.3 — ข้อความเป็นวิดีโอและภาพเป็นวิดีโอ ที่ผู้ให้บริการชูจุดเด่นเรื่องการทำตามคำสั่ง ที่ 24 fps โดย 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที 768p 6 วินาที = $0.28
MiniMax-Hailuo-2.3-FastMiniMax$0.190ต่อคำขอMiniMax Hailuo 2.3 Fast — ระดับที่เน้นความเร็วและต้นทุนของ Hailuo 2.3 มุ่งไปที่ภาพเป็นวิดีโอและความสมจริงของการเคลื่อนไหวเชิงฟิสิกส์ ที่ 24 fps โดย 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที 768p 6 วินาที = $0.19
MiniMax-M2MiniMax$0.3000$1.2000ต่อ 1M tokensMiniMax M2 — รุ่นแรกที่ MiniMax เปิดตัวสำหรับการเขียนโค้ดอย่างมีประสิทธิภาพและเวิร์กโฟลว์เอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น เป็นระดับที่เก่าที่สุดที่ผู้ให้บริการยังคงให้บริการอยู่ และเป็นระดับเดียวในกลุ่มรุ่นเก่าที่ไม่มีรุ่นย่อย highspeed รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ เป็นโมเดลรุ่นเก่าตามที่ผู้ให้บริการกำหนด ซึ่ง MiniMax ระบุว่ายังคงให้บริการตามปกติ คงไว้เพื่อความเข้ากันได้ของเวอร์ชัน เนื่องจากลูกค้าตรึงชื่อโมเดลไว้กับรุ่นใดรุ่นหนึ่ง มีการเผยแพร่น้ำหนักโมเดลแบบเปิดบน Hugging Face
MiniMax-M2.1MiniMax$0.3000$1.2000ต่อ 1M tokensMiniMax M2.1 — โมเดลข้อความที่สร้างมาเพื่อการเขียนโปรแกรมหลายภาษา พร้อมหน้าต่างบริบท 204,800 โทเค็น และเอาต์พุตที่ความเร็วราว 60 โทเค็นต่อวินาที รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ เป็นโมเดลรุ่นเก่าตามที่ผู้ให้บริการกำหนด ซึ่ง MiniMax ระบุว่ายังคงให้บริการตามปกติ คงไว้เพื่อความเข้ากันได้ของเวอร์ชัน เนื่องจากลูกค้าตรึงชื่อโมเดลไว้กับรุ่นใดรุ่นหนึ่ง มีการเผยแพร่น้ำหนักโมเดลแบบเปิดบน Hugging Face
MiniMax-M2.5MiniMax$0.3000$1.2000$0.1950$0.7800ต่อ 1M tokensMiniMax M2.5 — โมเดลข้อความที่ผู้ให้บริการวางตำแหน่งไว้ที่ประสิทธิภาพระดับแนวหน้าในราคาต่ำสำหรับงานที่ซับซ้อน พร้อมหน้าต่างบริบท 204,800 โทเค็น และเอาต์พุตที่ความเร็วราว 60 โทเค็นต่อวินาที รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ เป็นโมเดลรุ่นเก่าตามที่ผู้ให้บริการกำหนด ซึ่ง MiniMax ระบุว่ายังคงให้บริการตามปกติ คงไว้เพื่อความเข้ากันได้ของเวอร์ชัน เนื่องจากลูกค้าตรึงชื่อโมเดลไว้กับรุ่นใดรุ่นหนึ่ง มีการเผยแพร่น้ำหนักโมเดลแบบเปิดบน Hugging Face
MiniMax-M2.7MiniMax$0.3000$1.2000$0.1950$0.7800ต่อ 1M tokensMiniMax M2.7 — โมเดลข้อความสำหรับการแชท การเขียนโค้ด งานสำนักงาน และงานเอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น และเอาต์พุตที่ความเร็วราว 60 โทเค็นต่อวินาที รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ รองรับการเรียกใช้เครื่องมือ ส่วนการคิดเปิดอยู่เสมอและปิดไม่ได้
MiniMax-M2.7-highspeedMiniMax$0.6000$2.4000ต่อ 1M tokensMiniMax M2.7 Highspeed — โมเดล M2.7 ตัวเดิมที่ให้บริการที่ความเร็วราว 100 โทเค็นต่อวินาที สำหรับการเขียนโค้ดที่ความหน่วงต่ำและเวิร์กโฟลว์เอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ รองรับการเรียกใช้เครื่องมือ ส่วนการคิดเปิดอยู่เสมอและปิดไม่ได้
MiniMax-M3MiniMax$0.3000$1.2000$0.1950$0.7800ต่อ 1M tokensMiniMax M3 — โมเดลเขียนโค้ดแบบมัลติโหมดระดับแนวหน้า สำหรับการให้เหตุผลเชิงเอเจนต์ การใช้เครื่องมือ และการทำงานตามโครงสร้างที่กำหนด พร้อมหน้าต่างบริบท 1,000,000 โทเค็น โมเดลรับข้อความ ภาพขนาดไม่เกิน 10 MB และวิดีโอไม่เกิน 50 MB แบบส่งมาในคำขอ หรือไม่เกิน 512 MB ผ่าน Files API แล้วตอบกลับเป็นข้อความ รองรับการเรียกใช้เครื่องมือ โดยการคิดเป็นตัวเลือกไม่ใช่สิ่งที่เปิดอยู่ตลอด
minimax-music-v3.0MiniMax$0.1481ต่อคำขอMiniMax Music 3.0 — การสร้างเพลงเต็มเพลงแบบซิงโครนัสจากพรอมต์ด้านดนตรีและเนื้อเพลงที่จะใส่หรือไม่ก็ได้ พร้อมโหมดบรรเลง (instrumental) การปรับปรุงเนื้อเพลง และเอาต์พุตเสียงแบบ URL หรือ hex พรอมต์รองรับได้สูงสุด 2,000 อักขระ และเนื้อเพลงสูงสุด 3,500 อักขระ
muse-spark-1.2-contributorMeta$0.1000$0.2000$0.0650$0.1300ต่อ 1M tokensMeta อาจใช้พรอมต์ที่ส่งไปยังโมเดลนี้และเอาต์พุตที่โมเดลสร้างขึ้นเพื่อฝึกโมเดลรุ่นต่อไปของ Meta ตามเงื่อนไขของระดับ Contributor ดังนั้นโปรดอย่าส่งข้อมูลที่ละเอียดอ่อนหรือเป็นความลับ Meta Muse Spark 1.2 (ระดับ Contributor) คือเวอร์ชันก่อนหน้าของ Muse Spark เป็นโมเดลการให้เหตุผลที่ให้เหตุผลก่อนตอบทุกครั้ง และปิดการให้เหตุผลไม่ได้ ตั้งค่า reasoning_effort ได้เป็น minimal, low, medium, high หรือ xhigh ระดับนี้ไม่รองรับ none และ max และหากไม่ระบุ reasoning_effort โมเดลจะเลือกระดับเอง โทเค็นการให้เหตุผลคิดค่าบริการเป็นเอาต์พุต และอินพุตที่แคชไว้คิดค่าบริการตามอัตราอินพุตที่แคชไว้ ไม่มีการค้นหาเว็บ และคำขอที่มีการค้นหาเว็บหรือเครื่องมือประเภทอื่นนอกจาก function จะถูกปฏิเสธ ส่งคำขอไปที่ /v1/chat/completions
muse-spark-1.3-contributorMeta$0.1000$0.2000$0.0650$0.1300ต่อ 1M tokensMeta อาจใช้พรอมต์ที่ส่งไปยังโมเดลนี้และเอาต์พุตที่โมเดลสร้างขึ้นเพื่อฝึกโมเดลรุ่นต่อไปของ Meta ตามเงื่อนไขของระดับ Contributor ดังนั้นโปรดอย่าส่งข้อมูลที่ละเอียดอ่อนหรือเป็นความลับ Meta Muse Spark 1.3 (ระดับ Contributor) คือเวอร์ชันล่าสุดของ Muse Spark ซึ่งปรับแต่งมาสำหรับเวิร์กโฟลว์แบบเอเจนต์และการเขียนโค้ด เป็นโมเดลการให้เหตุผลที่ให้เหตุผลก่อนตอบทุกครั้ง และปิดการให้เหตุผลไม่ได้ ตั้งค่า reasoning_effort ได้เป็น minimal, low, medium, high หรือ xhigh ระดับนี้ไม่รองรับ none และ max และหากไม่ระบุ reasoning_effort โมเดลจะเลือกระดับเอง โทเค็นการให้เหตุผลคิดค่าบริการเป็นเอาต์พุต และอินพุตที่แคชไว้คิดค่าบริการตามอัตราอินพุตที่แคชไว้ ไม่มีการค้นหาเว็บ และคำขอที่มีการค้นหาเว็บหรือเครื่องมือประเภทอื่นนอกจาก function จะถูกปฏิเสธ ส่งคำขอไปที่ /v1/chat/completions
qwen-audio-3.0-asr-flashAlibaba$0.1260ต่อชั่วโมงเสียงAlibaba Qwen-Audio-3.0-ASR-Flash — การรู้จำเสียงพูดแบบไม่เรียลไทม์บนฐาน Qwen-Audio 3.0 ครอบคลุม 30 ภาษาและกลุ่มภาษาถิ่นจีนหลักทั้งเจ็ด (กวานฮว่า อู๋ เซียง กั้น แคะ หมิ่น เยว่) รวมถึงสำเนียงท้องถิ่นกว่า 20 สำเนียง การทำนายเครื่องหมายวรรคตอนและการทำข้อความให้เป็นมาตรฐานจะแปลงตัวเลข วันที่ และจำนวนเงินให้อยู่ในรูปแบบมาตรฐาน ส่วนคำสำคัญและบริบทของพรอมป์ตช่วยเพิ่มความแม่นยำกับคำศัพท์เฉพาะทาง รับไฟล์เสียงได้สูงสุด 5 นาทีหรือ 2 GB ต่อคำขอ
qwen-audio-3.0-realtime-flashAlibaba$0.2900$0.8800ต่อ 1M tokensAlibaba Qwen-Audio-3.0-Realtime-Flash — การสนทนาด้วยเสียงแบบสองทางพร้อมกันบนเซสชัน WebSocket จากตระกูลที่ผู้ให้บริการระบุว่าครองอันดับหนึ่งโดยรวมในหมวด Speech-to-Speech ของ Artificial Analysis รุ่นความเร็วสูงนี้ปรับแต่งมาเพื่อหน่วงเวลาตอบสนองแบบครบวงจรที่ต่ำที่สุด เชื่อมต่อผ่าน GET /v1/realtime อินพุตเสียงและเอาต์พุตเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความมาก
qwen-audio-3.0-realtime-plusAlibaba$1.0000$8.0000ต่อ 1M tokensAlibaba Qwen-Audio-3.0-Realtime-Plus — การสนทนาด้วยเสียงแบบสองทางพร้อมกันบนเซสชัน WebSocket ซึ่งผู้ให้บริการระบุว่าครองอันดับหนึ่งโดยรวมในหมวด Speech-to-Speech ของ Artificial Analysis รุ่นมาตรฐานเน้นคุณภาพของคำตอบ โดยคงความสามารถในการให้เหตุผลจากเสียงไว้ครบ ขณะที่การอนุมานแบบขนานและการสตรีมแบบครบวงจรช่วยกดหน่วงเวลาให้ต่ำ เชื่อมต่อผ่าน GET /v1/realtime อินพุตเสียงและเอาต์พุตเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความมาก
qwen-audio-3.0-tts-flashAlibaba$0.1800ต่อ 1 หมื่นอักขระAlibaba Qwen-Audio-3.0-TTS-Flash — การสังเคราะห์เสียงพูดบนฐาน Qwen-Audio 3.0 ที่ปรับมาเพื่อการโต้ตอบแบบเรียลไทม์ ครอบคลุมภาษาชนกลุ่มน้อยและภาษาถิ่นจีนมากกว่ารุ่นก่อน การทำตามคำสั่งแบบอิสระและแท็กควบคุมละเอียดช่วยกำหนดอารมณ์ น้ำเสียง ตัวละคร ความเร็ว และระดับเสียง อีกทั้งทนต่อเสียงรบกวนและเสียงก้องได้ดีขึ้น รุ่น Flash ปรับให้สังเคราะห์เสียงด้วยหน่วงเวลาต่ำ เหมาะกับผู้ช่วยเสียง การสนทนาสด และงานบริการลูกค้า คิดค่าบริการตามจำนวนอักขระ (1 โทเค็น = 1 อักขระ) ใช้ได้ทั้งแบบร้องขอ/ตอบกลับ และแบบเซสชัน WebSocket เรียลไทม์
qwen-audio-3.0-tts-plusAlibaba$0.2500ต่อ 1 หมื่นอักขระAlibaba Qwen-Audio-3.0-TTS-Plus — การสังเคราะห์เสียงพูดคุณภาพสูงบนฐาน Qwen-Audio 3.0 ครอบคลุมภาษาชนกลุ่มน้อยและภาษาถิ่นจีนมากกว่ารุ่นก่อน พร้อมการออกเสียงถิ่นที่เป็นธรรมชาติขึ้นอย่างเห็นได้ชัด การทำตามคำสั่งแบบอิสระและแท็กควบคุมละเอียดช่วยกำหนดอารมณ์ น้ำเสียง ตัวละคร ความเร็ว ระดับเสียง และสไตล์ อีกทั้งทนต่อเสียงรบกวนและเสียงก้องได้ดีขึ้น รุ่น Plus เน้นความสมจริงและพลังการแสดงออก เหมาะกับงานผลิตคอนเทนต์ หนังสือเสียง การพากย์ และเสียงประจำแบรนด์ คิดค่าบริการตามจำนวนอักขระ (1 โทเค็น = 1 อักขระ) ใช้ได้ทั้งแบบร้องขอ/ตอบกลับ และแบบเซสชัน WebSocket เรียลไทม์
qwen-flash-characterAlibaba$0.0500$0.4000ต่อ 1M tokensAlibaba Qwen-Flash-Character — โมเดลสวมบทบาทหลายภาษาของ Qwen (เวอร์ชันไดนามิก โดยผู้ให้บริการจะประกาศการอัปเดตล่วงหน้า) ปรับจูนมาเพื่อบทสนทนาของตัวละครที่ซื่อตรงต่อเพอร์โซนา ได้แก่ การทำตามคำสั่งภายในกรอบเพอร์โซนา การพาหัวข้อสนทนาให้คืบหน้า การรับฟัง และความเห็นอกเห็นใจ หน้าต่างบริบท 8,192 โทเค็น รับข้อความเข้า ตอบข้อความออก ไม่มีโหมดการคิด การเรียกใช้เครื่องมือ เครื่องมือในตัว หรือเอาต์พุตแบบมีโครงสร้าง แคชเซสชันของผู้ให้บริการทำงานโดยอัตโนมัติที่ฝั่งผู้ให้บริการ
qwen-image-3.0Alibaba$0.030ต่อคำขอAlibaba Qwen-Image-3.0 — รุ่นมาตรฐานของตระกูลภาพ Qwen ครอบคลุมทั้งการสร้างภาพจากข้อความและการแก้ไขภาพ พร้อมการเรนเดอร์ตัวอักษรขนาดเล็กได้แม่นยำถึง 10px รองรับ 12 ภาษาและแบบอักษรกว่า 20 แบบ รับพรอมป์ตได้สูงสุด 4,500 โทเค็น คืนภาพได้สูงสุด 6 ภาพต่อคำขอ และสร้างได้สูงสุด 2048x2048
qwen-image-3.0-proAlibaba$0.040ต่อคำขอAlibaba Qwen-Image-3.0-Pro — รุ่นมืออาชีพของตระกูลภาพ Qwen สร้างมาเพื่อผลิตเลย์เอาต์ที่อัดแน่นด้วยข้อมูล (หนังสือพิมพ์ สตอรีบอร์ด เมนู ข้อสอบ) ได้ในครั้งเดียว รับพรอมป์ตได้สูงสุด 4,500 โทเค็น เรนเดอร์ตัวอักษรขนาด 10px รองรับ 12 ภาษาและแบบอักษรกว่า 20 แบบ คืนภาพได้สูงสุด 6 ภาพต่อคำขอ และสร้างได้สูงสุด 2048x2048 รองรับทั้งการสร้างภาพจากข้อความและการแก้ไขภาพ
qwen-mt-image-2.0Alibaba$0.0006ต่อคำขอAlibaba Qwen-MT-Image 2.0 — การแปลภาพ: เขียนข้อความภายในภาพใหม่เป็นอีกภาษาหนึ่งโดยคงเลย์เอาต์ แบบอักษร และงานภาพรอบข้างไว้ รองรับ 55 ภาษาโดยแปลได้ทุกทิศทาง เรียกใช้ผ่านเอนด์พอยต์ images/edits ของ OpenAI โดยใส่ URL ภาพ http(s) สาธารณะในฟิลด์ image พร้อม target_lang (ต้องระบุ; รหัส ISO หรือชื่อภาษาเป็นภาษาอังกฤษ) และ source_lang (ไม่บังคับ ค่าเริ่มต้นคือ auto) ส่วน prompt เป็นฟิลด์ที่ต้องมีตามรูปแบบของเอนด์พอยต์แต่จะถูกละเว้น ออบเจกต์ ext ที่ไม่บังคับจะส่งผ่าน domainHint, sensitives, terminologies และ config.imageSegment ของผู้ให้บริการไปโดยไม่เปลี่ยนแปลง ส่งกลับ URL ภาพ JPG ขนาดเท่าเดิมหนึ่งรายการที่ใช้ได้ 24 ชั่วโมง อินพุตด้านละ 15-8192 px อัตราส่วนภาพ 1:10 ถึง 10:1 ขนาดไม่เกิน 100 MB ไม่รับไฟล์อัปโหลดและ data URL ผู้ให้บริการจำกัดอัตราการเรียกโมเดลนี้ไว้ที่ 1 คำขอต่อนาที และคิดค่าบริการหนึ่งภาพแม้ไม่พบข้อความที่แปลได้ (จะส่งภาพต้นฉบับกลับมา) ให้บริการผ่านช่องทางทางการของ Alibaba เพียงช่องทางเดียว
qwen3-asr-flashAlibaba$0.1260ต่อชั่วโมงเสียงAlibaba Qwen3-ASR-Flash — การรู้จำเสียงพูดที่สร้างบนโมเดลพื้นฐาน Qwen3 ซึ่งระบุภาษาที่กำลังพูดโดยอัตโนมัติและถอดเสียงได้ 11 ภาษา โดยตระกูล Qwen3-ASR ระบุภาษาจีนกลางไว้ควบคู่กับภาษาเสฉวน หมิ่นหนาน อู๋ และกวางตุ้ง รวมถึงสำเนียงภาษาอังกฤษหลายแบบ โมเดลรับไฟล์ aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma และ wmv ยาวไม่เกิน 5 นาทีและไม่เกิน 10 MB ต่อคำขอ อินพุต pcm ต้องเป็น 16 kHz ส่วนรูปแบบอื่นจะถูกสุ่มสัญญาณใหม่เป็น 16 kHz ก่อนการรู้จำ
qwen3-tts-flashAlibaba$0.1100ต่อ 1 หมื่นอักขระAlibaba Qwen3-TTS-Flash — การแปลงข้อความเป็นเสียงพูดที่มีความหน่วงต่ำ พร้อมเสียงในตัวที่มีอารมณ์ 17 เสียง ครอบคลุมภาษาจีน อังกฤษ เยอรมัน อิตาลี โปรตุเกส สเปน ญี่ปุ่น เกาหลี ฝรั่งเศส และรัสเซีย พร้อมโหมดอัตโนมัติสำหรับข้อความที่ปนหลายภาษา และการออกเสียงตามภาษาถิ่น โมเดลรับข้อความได้สูงสุด 512 โทเค็นต่อคำขอ และรองรับการสังเคราะห์ทั้งแบบสตรีมมิงและไม่สตรีมมิง
qwen3.5-livetranslate-flash-realtimeAlibaba$0.5500$20.0000ต่อ 1M tokensAlibaba Qwen3.5-LiveTranslate-Flash-Realtime — การแปลพร้อมกันสำหรับเสียงและวิดีโอบนเซสชัน WebSocket สร้างบนฐาน Qwen3.5-Omni ผสานการจัดแนวข้ามภาษาและข้ามโมดัลเข้ากับการเสริมด้วยข้อมูลภาพ ฟังได้ 60 ภาษาและพูดได้ 29 ภาษา เชื่อมต่อผ่าน GET /v1/realtime โครงสร้างราคาต่างจากโมเดลเรียลไทม์ตัวอื่น คือ **ไม่มีอัตราสำหรับอินพุตข้อความ** อินพุตคิดเป็นเสียงหรือภาพ ส่วนเอาต์พุตคิดเป็นข้อความหรือเสียง
qwen3.5-ocrAlibaba$0.1000$0.3500ต่อ 1M tokensAlibaba Qwen3.5-OCR — สมาชิกสาย OCR ของตระกูล Qwen3.5 สร้างมาเพื่อการแยกวิเคราะห์เอกสาร การระบุตำแหน่งข้อความ และการดึงข้อมูลสำคัญ โดยผู้ให้บริการระบุถึงการพัฒนาที่ชัดเจนกับบัตรประจำตัวและใบอนุญาตที่ใช้งานจริง โมเดลรับข้อความและภาพเป็นอินพุต แล้วตอบกลับเป็นข้อความ
qwen3.5-omni-flashAlibaba$0.4000$2.2000ต่อ 1M tokensAlibaba Qwen3.5-Omni-Flash — รุ่นความเร็วสูงของตระกูลออมนิโมดัล Qwen3.5 เข้าใจและสนทนาได้ทั้งข้อความ ภาพ เสียง และวิดีโอที่มีเสียง รองรับเสียงยาวกว่า 10 ชั่วโมง และวิดีโอที่มีเสียงแบบ 720P (1 FPS) ยาวกว่า 400 วินาทีต่อบทสนทนา โดยรับเสียงเข้าได้กว่า 60 ภาษาและพูดออกได้กว่า 30 ภาษา อินพุตเสียงและเอาต์พุตที่มีเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความ
qwen3.5-omni-flash-realtimeAlibaba$0.5500$3.3000ต่อ 1M tokensAlibaba Qwen3.5-Omni-Flash-Realtime — รุ่นเรียลไทม์ความเร็วสูงของตระกูลออมนิโมดัล Qwen3.5 เปิดเซสชัน WebSocket ค้างไว้เพื่อสนทนาด้วยเสียงแบบสองทางพร้อมกัน เข้าใจข้อความ ภาพ เสียง และวิดีโอที่มีเสียง รับเสียงเข้าได้กว่า 60 ภาษาและพูดออกได้กว่า 30 ภาษา พร้อมการกำหนดน้ำเสียง การค้นเว็บ การเรียกฟังก์ชันซับซ้อน และการขัดจังหวะตามความหมาย เชื่อมต่อผ่าน GET /v1/realtime อินพุตเสียงและเอาต์พุตที่มีเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความมาก
qwen3.5-omni-plusAlibaba$1.4000$8.3000ต่อ 1M tokensAlibaba Qwen3.5-Omni-Plus — รุ่นสมรรถนะสูงของตระกูลออมนิโมดัล Qwen3.5 เข้าใจและสนทนาได้ทั้งข้อความ ภาพ เสียง และวิดีโอที่มีเสียง รองรับเสียงยาวกว่า 10 ชั่วโมง และวิดีโอที่มีเสียงแบบ 720P (1 FPS) ยาวกว่า 400 วินาทีต่อบทสนทนา โดยรับเสียงเข้าได้กว่า 60 ภาษาและพูดออกได้กว่า 30 ภาษา มีหน้าต่างบริบท 65,536 โทเค็น อินพุตเสียงและเอาต์พุตที่มีเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความ
qwen3.5-omni-plus-realtimeAlibaba$2.1000$12.4000ต่อ 1M tokensAlibaba Qwen3.5-Omni-Plus-Realtime — รุ่นเรียลไทม์ของตระกูลออมนิโมดัล Qwen3.5 เปิดเซสชัน WebSocket ค้างไว้เพื่อสนทนาด้วยเสียงแบบสองทางพร้อมกัน เข้าใจข้อความ ภาพ เสียง และวิดีโอที่มีเสียง รับเสียงเข้าได้กว่า 60 ภาษาและพูดออกได้กว่า 30 ภาษา พร้อมการกำหนดน้ำเสียง การค้นเว็บ การเรียกฟังก์ชันซับซ้อน และการขัดจังหวะตามความหมาย เชื่อมต่อผ่าน GET /v1/realtime อินพุตเสียงและเอาต์พุตที่มีเสียงคิดค่าบริการแยกอัตราของตัวเอง ซึ่งสูงกว่าอัตราของข้อความมาก
qwen3.6-27bAlibaba$0.6000$3.6000ต่อ 1M tokensAlibaba Qwen3.6-27B — โมเดล Dense ภาษาเชิงภาพโดยกำเนิดขนาด 27 พันล้านพารามิเตอร์ของตระกูล Qwen3.6 แบบเปิดน้ำหนัก ซึ่งผู้ให้บริการจัดให้เหนือกว่า 3.5-27B ในด้านการเขียนโค้ดเชิงเอเจนต์ STEM และการให้เหตุผล รวมถึงปัญญาเชิงพื้นที่ การระบุตำแหน่งและตรวจจับวัตถุ มีหน้าต่างบริบท 262,144 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ
qwen3.6-35b-a3bAlibaba$0.3750$2.2500ต่อ 1M tokensAlibaba Qwen3.6-35B-A3B — โมเดล MoE ภาษาเชิงภาพโดยกำเนิดขนาด 35 พันล้านพารามิเตอร์ โดยเปิดใช้งานราว 3 พันล้าน แบบเปิดน้ำหนัก ผสาน attention เชิงเส้นเข้ากับ Mixture of Experts แบบเบาบางเพื่อเพิ่มประสิทธิภาพการอนุมาน มีหน้าต่างบริบท 262,144 โทเค็น เอาต์พุตสูงสุด 65,536 โทเค็น และรับภาพได้สูงสุด 256 ภาพหรือวิดีโอ 64 คลิปต่อคำขอ โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เครื่องมือในตัว และเอาต์พุตแบบมีโครงสร้าง
qwen3.6-flashAlibaba$0.2500$1.5000ต่อ 1M tokensAlibaba Qwen3.6-Flash — โมเดลภาษาเชิงภาพที่ทำงานเร็ว ซึ่งผู้ให้บริการชูจุดเด่นด้านการเขียนโค้ดเชิงเอเจนต์และปัญญาเชิงพื้นที่ พร้อมการพัฒนาที่ชัดเจนในการระบุตำแหน่งและตรวจจับวัตถุ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 65,536 โทเค็น และงบประมาณห่วงโซ่ความคิด 131,072 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชันและการแคชบริบท
qwen3.6-plusAlibaba$0.5000$3.0000$0.4250$2.5500ต่อ 1M tokensAlibaba Qwen3.6-Plus — โมเดลสมดุลสำหรับการให้เหตุผลทั่วไปและการใช้เครื่องมือ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 65,536 โทเค็น และงบประมาณห่วงโซ่ความคิด 81,920 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง การค้นหาเว็บ การเติมข้อความต่อจากส่วนนำ และการแคชบริบท
qwen3.7-flashAlibaba$0.0300$0.1300ต่อ 1M tokensAlibaba Qwen3.7-Flash — รุ่นความเร็วสูงของตระกูลภาษาเชิงภาพโดยกำเนิด Qwen3.7 ซึ่งผู้ให้บริการชูจุดเด่นด้านงานเอเจนต์แบบมัลติโมดัล (เอเจนต์ค้นหาและเอเจนต์ CI) และการทำงานแบบครบวงจรที่นิ่งกว่า 3.6-Flash มีหน้าต่างบริบท 1,000,000 โทเค็น เอาต์พุตสูงสุด 65,536 โทเค็น และรับภาพได้สูงสุด 256 ภาพหรือวิดีโอ 64 คลิปต่อคำขอ โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับโหมดการคิด การเรียกฟังก์ชัน เครื่องมือในตัว และเอาต์พุตแบบมีโครงสร้าง ราคาแบ่งเป็นสามช่วงตามความยาวบริบท คำขอที่บริบทยาวจึงมีราคาต่อโทเค็นสูงกว่าคำขอสั้น
qwen3.7-maxAlibaba$2.5000$7.5000ต่อ 1M tokensAlibaba Qwen3.7-Max — เรือธงแบบปิดซอร์ส วางตำแหน่งไว้สำหรับการเขียนโปรแกรม งานสำนักงานและงานเพิ่มผลิตภาพ รวมถึงการทำงานอัตโนมัติในระยะยาว มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท
qwen3.7-plusAlibaba$0.4000$1.6000$0.3000$1.2000ต่อ 1M tokensAlibaba Qwen3.7-Plus — โมเดลเอเจนต์ลูกผสมแบบมัลติโหมด ที่รับรู้ฉากในโลกจริง อ่านหน้าจอและควบคุมส่วนติดต่อผู้ใช้แบบกราฟิก สร้างโค้ดจากภาพอ้างอิง และนำทางแบบครบวงจรภายในแอปบนมือถือ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท
qwen3.8-2.4t-a95bAlibaba$2.0000$6.0000ต่อ 1M tokensAlibaba Qwen3.8-2.4T-A95B — รุ่นเปิดน้ำหนักของโมเดลเรือธง Qwen3.8 เป็นโมเดล MoE แบบเบาบางที่มีพารามิเตอร์รวม 2.4 ล้านล้าน และเปิดใช้งานราว 9.5 หมื่นล้านต่อขั้น ใช้สถาปัตยกรรม attention แบบผสม มีหน้าต่างบริบท 1,000,000 โทเค็น โมเดลรับข้อความเป็นอินพุต แล้วตอบกลับเป็นข้อความ โหมดคิดและไม่คิดคิดค่าบริการอัตราเดียวกัน และราคาเอาต์พุตรวมห่วงโซ่ความคิดแล้ว
qwen3.8-27bAlibaba$0.5000$3.0000ต่อ 1M tokensAlibaba Qwen3.8-27B — โมเดล Dense ภาษาเชิงภาพโดยกำเนิดขนาด 27 พันล้านพารามิเตอร์ของตระกูล Qwen3.8 แบบเปิดน้ำหนัก ซึ่งผู้ให้บริการจัดให้เหนือกว่า 3.6-27B ในงานเขียนโค้ดและงานสำนักงาน ทั้งในโหมดข้อความและโหมดภาพ มีหน้าต่างบริบท 1,000,000 โทเค็น โมเดลรับข้อความและภาพเป็นอินพุต แล้วตอบกลับเป็นข้อความ โหมดคิดและไม่คิดคิดค่าบริการอัตราเดียวกัน และราคาเอาต์พุตรวมห่วงโซ่ความคิดแล้ว
qwen3.8-flashAlibaba$0.1500$0.4700$0.1125$0.3525ต่อ 1M tokensAlibaba Qwen3.8-Flash — รุ่นความเร็วสูงของตระกูล Qwen3.8 เป็นโมเดลมัลติโมดัลโดยกำเนิดที่ผู้ให้บริการวางตำแหน่งไว้สำหรับการช่วยเขียนโค้ด การทำงานร่วมกันของเอเจนต์ และการทำความเข้าใจภาพและเอกสารที่ปริมาณงานสูง มีหน้าต่างบริบท 1,000,000 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับโหมดการคิด การเรียกฟังก์ชัน เครื่องมือในตัว และเอาต์พุตแบบมีโครงสร้าง รองรับทั้งโปรโตคอล OpenAI และ Anthropic Messages
qwen3.8-maxAlibaba$2.0000$6.0000$1.9000$5.7000ต่อ 1M tokensAlibaba Qwen3.8-Max — โมเดล MoE เรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ และเป็นโมเดลที่เก่งที่สุดในตระกูล Qwen โดยผู้ให้บริการระบุว่าพัฒนาขึ้นมากในด้านการเขียนโค้ดและงานสำนักงาน มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น รับอินพุตข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท
qwen3.8-max-0902Alibaba$2.0000$6.0000ต่อ 1M tokensAlibaba Qwen3.8-Max-0902 — สแนปช็อตวันที่ 2026-09-02 ของ Qwen3.8-Max (ชื่อแทนของผู้ให้บริการคือ qwen3.8-max-2026-09-02) โมเดล MoE เรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ ซึ่งถูกคงไว้ไม่เปลี่ยนแปลงเพื่อให้ระบบที่เชื่อมต่อตรึงบิลด์นี้ได้อย่างแม่นยำ ผู้ให้บริการระบุถึงการเขียนโค้ดที่ลึกขึ้นสำหรับโปรเจกต์วิศวกรรมที่ซับซ้อนและการพัฒนาแบบอัตโนมัติระยะยาว หน้าต่างบริบท 1,000,000 โทเค็น เอาต์พุตสูงสุด 131,072 โทเค็น รับอินพุตข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ รองรับโหมดการคิด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง ชื่อแบบไดนามิก qwen3.8-max จะย้ายไปยังบิลด์ที่ใหม่กว่าเมื่อผู้ให้บริการออกบิลด์ใหม่ หากต้องการใช้บิลด์นี้ต่อไปให้ตรึงชื่อนี้ไว้ ราคาเท่ากับ qwen3.8-max ทุกประการ
speech-2.8-hdMiniMax$1.0000ต่อ 1 หมื่นอักขระMiniMax speech-2.8-hd — ระดับความละเอียดสูงของตระกูลเสียง 2.8 วางตำแหน่งไว้ที่การถ่ายทอดอันสมจริงอย่างยิ่งพร้อมแท็กเสียง ครอบคลุม 40 ภาษาและ 7 อารมณ์ ระดับเสียงสูงต่ำ ความเร็วในการพูด ความดัง อัตราสุ่มสัญญาณ บิตเรต และรูปแบบเอาต์พุตปรับตั้งได้รายคำขอ ส่วนการสังเคราะห์ข้อความยาวรับได้สูงสุด 1 ล้านอักขระแบบอะซิงโครนัส หรือ 10,000 อักขระผ่านอินเทอร์เฟซสตรีมมิง
speech-2.8-turboMiniMax$0.6000ต่อ 1 หมื่นอักขระMiniMax speech-2.8-turbo — ระดับความหน่วงต่ำของตระกูลเสียง 2.8 ที่ยอมสละการถ่ายทอดอันสมจริงอย่างยิ่งของรุ่น HD เพื่อแลกกับการสังเคราะห์ที่เร็วขึ้นโดยยังคงความลื่นไหลตามธรรมชาติ ครอบคลุม 40 ภาษาและ 7 อารมณ์เท่ากับรุ่น HD ปรับตั้งระดับเสียงสูงต่ำ ความเร็วในการพูด ความดัง อัตราสุ่มสัญญาณ บิตเรต และรูปแบบเอาต์พุตได้ และรับข้อความได้สูงสุด 1 ล้านอักขระแบบอะซิงโครนัส หรือ 10,000 อักขระผ่านอินเทอร์เฟซสตรีมมิง
step-3.5-flashStepFun$0.1000$0.3000ต่อ 1M tokensStepFun step-3.5-flash — โมเดลการให้เหตุผลเฉพาะข้อความ บริบท 256K มุ่งงานด้านตรรกะ คณิตศาสตร์ วิศวกรรมซอฟต์แวร์ และการวิจัยเชิงลึก ที่คุณภาพของการให้เหตุผลต้องมาพร้อมการทำงานที่รวดเร็วและเชื่อถือได้ เลือกความลึกของการให้เหตุผลได้รายคำขอผ่าน reasoning_effort (low / medium / high) รองรับการเรียกใช้เครื่องมือ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ หากต้องการอินพุตเป็นภาพหรือวิดีโอ ให้ใช้ step-3.7-flash
step-3.5-flash-2603StepFun$0.1000$0.3000ต่อ 1M tokensStepFun step-3.5-flash-2603 — สแนปช็อต 256K ของ step-3.5-flash ที่ปรับจูนสำหรับงานเอเจนต์ เน้นประสิทธิภาพด้านโทเค็นและโหมดทำงานที่ใช้การอนุมานต่ำ พารามิเตอร์ reasoning_effort รับเฉพาะ low และ high ต่างจากโมเดลพื้นฐานที่รับสามระดับ โค้ดที่ส่ง medium จึงต้องปรับแก้ รองรับข้อความเท่านั้น พร้อมการเรียกใช้เครื่องมือ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์
step-3.7-flashStepFun$0.2000$1.1500ต่อ 1M tokensStepFun step-3.7-flash — โมเดล MoE แบบเบาบางที่มีพารามิเตอร์รวม 198B และทำงานจริง 11B บริบทดั้งเดิม 256K และเข้าใจภาพกับวิดีโอได้ในตัวควบคู่กับข้อความ เลือกความลึกของการให้เหตุผลได้รายคำขอผ่าน reasoning_effort (low / medium / high) และรองรับการเรียกใช้เครื่องมือหลายขั้นตอนอย่างเชื่อถือได้ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ ปรับจูนมาสำหรับงานเอเจนต์และการเขียนโค้ด บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา เนื่องจากต้นทางไม่มีการเก็บสถานะบทสนทนาไว้ คำขอที่มี previous_response_id หรือ conversation จึงถูกปฏิเสธ
step-5-previewStepFun$1.0000$2.7000ต่อ 1M tokensStepFun step-5-preview — โมเดลเรือธงรุ่นใหม่ของ StepFun สำหรับงานเขียนโค้ดและงานความรู้เฉพาะทาง เปิดให้ใช้ในรุ่นพรีวิว บริบท 1M โทเค็น เอาต์พุตสูงสุด 64K โทเค็น และเข้าใจภาพกับวิดีโอได้ในตัวควบคู่กับข้อความ การให้เหตุผลเปิดอยู่เสมอ โดยจะส่งกลับเป็น reasoning_content บน /v1/chat/completions และเป็นบล็อก thinking บน /v1/messages คิดค่าบริการเป็นเอาต์พุต และใช้โควตาจาก max_tokens ดังนั้นหากตั้งขีดจำกัดไว้เพียงไม่กี่ร้อยโทเค็น การให้เหตุผลอาจใช้หมดจนไม่มีข้อความตอบกลับ ควรเผื่อขีดจำกัดไว้ให้มาก เลือกความลึกได้รายคำขอผ่าน reasoning_effort (low / medium / high) รองรับการเรียกใช้เครื่องมือหลายขั้นตอน เอาต์พุตแบบมีโครงสร้างด้วย JSON Mode และ JSON Schema สตรีมมิง และการแคชพรอมต์ สร้างมาเพื่อการวิเคราะห์เอกสารยาว วิศวกรรมซอฟต์แวร์ และงานเอเจนต์หลายขั้นตอน บน /v1/responses ให้ส่งบทสนทนาทั้งหมดในอาร์เรย์ input ในทุกรอบสนทนา เนื่องจากต้นทางไม่มีการเก็บสถานะบทสนทนาไว้ คำขอที่มี previous_response_id หรือ conversation จึงถูกปฏิเสธ
step-audio-2StepFun$1.4815$10.3704ต่อ 1M tokensStepFun step-audio-2 — โมเดลเสียงพูดแบบครบวงจรที่รับเสียงเข้าโดยตรงแทนการทำงานจากข้อความถอดเสียง น้ำเสียงและลีลาการพูดจึงคงอยู่ถึงขั้นการทำความเข้าใจของโมเดล คิดค่าบริการต่อโทเค็น โดยใช้อัตราอินพุตเดียวกับตระกูล StepAudio 2.5 แต่มีอัตราเอาต์พุตสูงกว่า StepFun ไม่ได้เผยแพร่หน้าความสามารถแยกสำหรับโมเดลนี้ กรุณาดูเอกสารด้านเสียงของแพลตฟอร์มเพื่อทราบชุดพารามิเตอร์ปัจจุบัน
step-tts-2StepFun$0.4148ต่อ 1 หมื่นอักขระStepFun step-tts-2 — การสังเคราะห์เสียงพูดแบบครบวงจรบนพื้นฐาน NTP ที่สร้างมาเพื่อจำลองสำเนียงได้อย่างแม่นยำ พูดภาษาจีน อังกฤษ จีนผสมอังกฤษ และญี่ปุ่น รวมถึงกวางตุ้งและเสฉวน กำกับอารมณ์และลีลาการพูดผ่านป้ายกำกับภาษาธรรมชาติ ส่วนการโคลนเสียงแบบ zero-shot ใช้เสียงอ้างอิงราว 10 วินาที โดยการควบคุมอารมณ์และสไตล์ยังส่งต่อไปยังเสียงที่โคลนได้โดยไม่มีค่าใช้จ่ายเพิ่ม เอาต์พุตเป็น wav, mp3, flac, opus หรือ pcm
stepaudio-2-asr-proStepFun$0.2963ต่อชั่วโมงเสียงStepFun StepAudio 2 ASR Pro — โมเดลรู้จำเสียงพูดขนาด 32B พารามิเตอร์ เป็นตัวเลือกที่เน้นความแม่นยำเป็นอันดับแรกในตระกูล ASR ของ StepFun ขณะที่ stepaudio-2.5-asr เป็นตัวเลือกที่เน้นความเร็วและต้นทุน รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ
stepaudio-2.5-asrStepFun$0.0220ต่อชั่วโมงเสียงStepFun StepAudio 2.5 ASR — โมเดลรู้จำเสียงพูดขนาด 4B พารามิเตอร์ที่สร้างบน Multi-Token Prediction ถอดเสียงห้านาทีได้ในเวลาราวหนึ่งวินาที (RTF ประมาณ 0.0053) ปรับให้เหมาะกับภาษาจีนและอังกฤษ มาพร้อมการแปลงข้อความย้อนกลับให้เป็นรูปมาตรฐาน การระบุตัวผู้พูด และการแยกสองช่องสัญญาณสำหรับบันทึกการโทรและการประชุม รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ
stepaudio-2.5-asr-streamStepFun$0.1800ต่อชั่วโมงเสียงStepFun StepAudio 2.5 ASR Stream — รุ่นรู้จำเสียงพูดแบบสตรีมมิงของ StepAudio 2.5 ASR (โมเดลรู้จำเสียงพูดขนาด 4B พารามิเตอร์ที่สร้างบน Multi-Token Prediction และปรับให้เหมาะกับภาษาจีนและอังกฤษ) และเป็นโมเดลสตรีมมิงที่ StepFun แนะนำ บนเกตเวย์นี้ การเรียกใช้โมเดลนี้เป็นแบบเดียวกับโมเดลถอดเสียงอื่น ๆ: อัปโหลดไฟล์บันทึกเสียงทั้งไฟล์ไปยัง /v1/audio/transcriptions แล้วข้อความถอดเสียงฉบับเต็มจะถูกส่งกลับมาในการตอบกลับครั้งเดียวเมื่อการรู้จำเสร็จสิ้น โดยไม่มีการสตรีมผลลัพธ์บางส่วนกลับมา และมีราคาต่อนาทีของเสียงสูงกว่า stepaudio-2.5-asr ผลการถอดเสียงผ่านการแปลงข้อความย้อนกลับให้เป็นรูปมาตรฐาน รับเฉพาะไฟล์อัปโหลด wav แบบ PCM 16 บิต และ ogg (ไม่รับ mp3) โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ
stepaudio-2.5-chatStepFun$1.5000$3.5000ต่อ 1M tokensStepFun StepAudio 2.5 Chat — โมเดลเข้าใจเสียงพูดแบบครบวงจร รับเสียงหรือข้อความเข้าและตอบกลับเป็นข้อความ โดยอ่านสัญญาณกึ่งภาษาอย่างการลังเลหรือเสียงหัวเราะจากคลื่นเสียงโดยตรงแทนที่จะอ่านจากข้อความถอดเสียง รองรับการปรับแต่งบุคลิกอย่างละเอียด ครอบคลุมทั้งลักษณะตัวตน นิสัยการพูด และช่วงอารมณ์ ส่งเสียงเข้ามาในรูปแบบส่วนเนื้อหา input_audio บนเอนด์พอยต์ chat completions หากต้องการคำตอบเป็นเสียงพูด ให้ใช้โมเดล TTS
stepaudio-2.5-realtimeStepFun$1.5000$10.0000ต่อ 1M tokensStepFun StepAudio 2.5 Realtime — โมเดลแปลงเสียงพูดเป็นเสียงพูดแบบครบวงจร ใช้งานผ่านเซสชัน WebSocket ที่ GET /v1/realtime รับเสียงหรือข้อความแบบสตรีม และส่งเสียงแบบสตรีมพร้อมข้อความถอดเสียงกลับมา รองรับการตรวจจับเสียงพูดฝั่งเซิร์ฟเวอร์และการพูดแทรก เสียงเป็น PCM16, 24 kHz, โมโน ผู้ให้บริการระบุภาษาอังกฤษเป็นภาษาที่รองรับ ควรกำหนดเสียงพูดให้ชัดเจนใน session.update เพราะระบบรับเฉพาะเสียงพูดที่ StepFun เผยแพร่ไว้เท่านั้น
stepaudio-2.5-ttsStepFun$0.8500ต่อ 1 หมื่นอักขระStepFun StepAudio 2.5 TTS — การแปลงข้อความเป็นเสียงพูดที่คำนึงถึงบริบท โดยส่งความเข้าใจไปตลอดทั้งไปป์ไลน์การสร้างแทนที่จะมองลีลาการพูดเป็นงานหลังการประมวลผล กำกับเสียง อารมณ์ และจังหวะด้วยภาษาธรรมชาติได้สองระดับ คือบริบทระดับทั้งคำขอและบริบทแบบอินไลน์สำหรับแต่ละช่วงข้อความ การโคลนเสียงแบบ zero-shot ใช้เสียงอ้างอิงราว 3 วินาที และสืบทอดชุดการควบคุมตามบริบททั้งหมด รับได้สูงสุด 1000 อักขระต่อคำขอ เอาต์พุตเป็น wav, mp3, flac หรือ opus
stepaudio-3-asr-maxStepFun$0.4000ต่อชั่วโมงเสียงStepFun StepAudio 3 ASR Max — โมเดลรู้จำเสียงพูดที่ใหญ่ที่สุดของ StepFun สร้างบนโมเดลภาษาขนาดใหญ่ การรู้จำจึงอาศัยบริบทและความรู้เฉพาะทางได้ ทำให้รับมือได้ดีขึ้นกับชื่อเฉพาะ ชื่อยา ศัพท์เทคนิค และคำพ้องเสียง กับการพูดจีนปนอังกฤษ ภาษาถิ่น และไฟล์เสียงยาว ตลอดจนเสียงกระซิบ การพูดเร็วมาก หรือเสียงพูดที่มีดนตรีประกอบ รวมถึงเนื้อเพลงที่ขับร้อง ส่งไฟล์เสียงไปยัง POST /v1/audio/transcriptions (WAV, MP3 หรือ OGG) คิดค่าบริการตามความยาวของเสียง
stepaudio-3-chat-previewStepFun$0.0000ต่อ 1M tokensStepFun StepAudio 3 Chat (รุ่นพรีวิว) — โมเดลสนทนาที่เข้าใจเสียงพูดบน POST /v1/chat/completions ในแต่ละรอบให้ส่งเสียงพูดเป็นส่วนเนื้อหา input_audio หรือส่งข้อความ แล้วรับข้อความตอบกลับ พร้อมรองรับการเรียกใช้เครื่องมือ ใช้งานได้ฟรีระหว่างช่วงพรีวิวของ StepFun เมื่อช่วงใช้ฟรีสิ้นสุดลง StepFun จะเลิกใช้ชื่อรุ่นพรีวิวและออกรุ่นที่ต้องเสียค่าบริการ จึงควรวางแผนโดยคำนึงว่า ID โมเดลนี้จะใช้งานไม่ได้ตั้งแต่ตอนนั้น
stepaudio-3-gen-previewStepFun$0.000ต่อคำขอStepFun StepAudio 3 Audio Generation (รุ่นพรีวิว) — โมเดลสร้างเสียงตามบทในซีรีส์ StepAudio 3 ผ่าน POST /v1/audio/generate กำหนดบทบาทด้วยชื่อและคำบรรยายน้ำเสียงเป็นภาษาธรรมดา เขียนบททีละบรรทัด (บรรทัดที่อยู่ในวงเล็บเหลี่ยมจะกลายเป็นเสียงประกอบหรือดนตรีพื้นหลัง) เพิ่มคำสั่งภาพรวม แล้วจะได้เสียงที่เสร็จสมบูรณ์กลับมาเป็นไบต์ (ค่าเริ่มต้นคือ mp3) น้ำเสียงสร้างจากคำบรรยายบทบาท และไม่รับชื่อเสียงสำเร็จรูป ฟิลด์ของคำขอเป็นไปตามเอกสารอ้างอิง API ของ StepFun ใช้งานได้ฟรีระหว่างช่วงพรีวิวของ StepFun เมื่อช่วงใช้ฟรีสิ้นสุดลง StepFun จะเลิกใช้ชื่อรุ่นพรีวิวและออกรุ่นที่ต้องเสียค่าบริการ จึงควรวางแผนโดยคำนึงว่า ID โมเดลนี้จะใช้งานไม่ได้ตั้งแต่ตอนนั้น
stepaudio-3-music-previewStepFun$0.000ต่อคำขอStepFun StepAudio 3 Music (รุ่นพรีวิว) — โมเดลสร้างเพลงจากข้อความในซีรีส์ StepAudio 3 ผ่าน POST /v1/music/generations โดยใช้รูปแบบคำขอเดียวกับ minimax-music-v3.0 ระบุสไตล์ใน prompt ใส่เนื้อเพลงใน lyrics หรือตั้งค่า is_instrumental แล้วจะได้เพลงที่เสร็จสมบูรณ์กลับมาเป็นข้อมูลเข้ารหัส hex ใน data.audio (ค่าเริ่มต้นคือ mp3 และเลือก wav, flac, opus หรือ pcm ได้ผ่าน audio_setting.format) การเรียกเป็นแบบซิงโครนัส และแต่ละเพลงมักใช้เวลาหนึ่งถึงหลายนาที จึงควรตั้งค่า timeout ฝั่งไคลเอนต์ไว้อย่างน้อย 600 วินาที ไม่รองรับการคัฟเวอร์เพลงหรือการสร้างดนตรีประกอบให้เสียงร้องที่อัปโหลด ใช้งานได้ฟรีระหว่างช่วงพรีวิวของ StepFun เมื่อช่วงใช้ฟรีสิ้นสุดลง StepFun จะเลิกใช้ชื่อรุ่นพรีวิวและออกรุ่นที่ต้องเสียค่าบริการ จึงควรวางแผนโดยคำนึงว่า ID โมเดลนี้จะใช้งานไม่ได้ตั้งแต่ตอนนั้น
stepaudio-3-realtime-previewStepFun$0.0000ต่อ 1M tokensStepFun StepAudio 3 Realtime (รุ่นพรีวิว) — โมเดลเสียงพูดแบบสองทางพร้อมกันของ StepFun ผ่านเซสชัน WebSocket ที่ GET /v1/realtime รองรับการขัดจังหวะและการผลัดกันพูดอย่างเป็นธรรมชาติ การให้เหตุผลแบบปรับตัวได้ขณะพูด และการเรียกใช้เครื่องมือระหว่างบทสนทนา ใช้งานได้ฟรีระหว่างช่วงพรีวิวของ StepFun เมื่อช่วงใช้ฟรีสิ้นสุดลง StepFun จะเลิกใช้ชื่อรุ่นพรีวิวและออกรุ่นที่ต้องเสียค่าบริการ จึงควรวางแผนโดยคำนึงว่า ID โมเดลนี้จะใช้งานไม่ได้
stepaudio-3-ttsStepFun$0.3600ต่อ 1 หมื่นอักขระStepFun StepAudio 3 TTS — การแปลงข้อความเป็นเสียงพูดจากซีรีส์ StepAudio 3 ที่สร้างมาเพื่อลีลาการพูดระดับมนุษย์ เนื้อเสียง ทำนองเสียง จังหวะ และการหายใจสอดคล้องกับการพูดโดยธรรมชาติ รวมถึงเสียงหัวเราะ การลังเล และการแก้คำพูด ส่วนอารมณ์และน้ำเสียงก็เปลี่ยนไปให้เข้ากับเนื้อหา ให้บริการผ่าน POST /v1/audio/speech และคิดค่าบริการตามจำนวนอักขระของข้อความอินพุต
vidu-video-q3Vidu$0.060ต่อวินาทีVidu Q3 — โมเดลสร้างวิดีโอจากสื่ออ้างอิง ที่คงความสอดคล้องของตัวแบบ เปลี่ยนฉากได้อย่างชาญฉลาด และให้เอาต์พุตเสียง/วิดีโอที่ซิงก์กัน รับภาพอ้างอิงหรือตัวแบบที่ตั้งชื่อไว้ สร้างวิดีโอยาว 3–16 วินาทีที่ 540P, 720P หรือ 1080P
vidu-video-q3-proVidu$0.100ต่อวินาทีVidu Q3 Pro — การสร้างวิดีโอที่เน้นคุณภาพ ทั้งข้อความเป็นวิดีโอ ภาพเป็นวิดีโอ และการสร้างจากเฟรมเริ่มต้น/เฟรมสุดท้าย พร้อมเอาต์พุตเสียง/วิดีโอที่ซิงก์กัน สร้างวิดีโอยาว 1–16 วินาทีที่ 540P, 720P หรือ 1080P ทั้งนี้ SKU นี้ไม่รองรับการสร้างวิดีโอจากสื่ออ้างอิง
vidu-video-q3-turboVidu$0.055ต่อวินาทีVidu Q3 Turbo — ระดับ Q3 ที่รวดเร็วและคุ้มค่า สำหรับการสร้างวิดีโอจากข้อความ ภาพ เฟรมเริ่มต้น/เฟรมสุดท้าย และสื่ออ้างอิง พร้อมเอาต์พุตเสียง/วิดีโอที่ซิงก์กัน สร้างวิดีโอยาว 1–16 วินาทีในโหมดปกติ หรือ 3–16 วินาทีในโหมดอ้างอิง ที่ความละเอียด 540P–1080P
wan2.7-i2vAlibaba$0.100ต่อวินาทีAlibaba Wan 2.7 Image-to-Video — ครอบคลุมการสร้างจากเฟรมแรก การเปลี่ยนภาพระหว่างเฟรมแรกกับเฟรมสุดท้าย และการต่อเนื่องจากคลิปเดิม สร้างวิดีโอ 720P หรือ 1080P (ค่าเริ่มต้น 1080P) ความยาว 2-15 วินาที ค่าเริ่มต้น 5 วินาที จากพรอมต์ยาวได้ถึง 5,000 อักขระ (พรอมต์เชิงลบไม่เกิน 500 อักขระ) สามารถส่งไฟล์ mp3 หรือ wav ความยาว 2-30 วินาทีเป็น driving_audio ได้ หากไม่ส่งเสียงมา โมเดลจะสร้างดนตรีประกอบหรือเอฟเฟกต์เสียงที่เข้ากันให้เอง เสียงที่ยาวกว่าคลิปจะถูกตัดทิ้ง ส่วนเสียงที่สั้นกว่าจะทำให้ช่วงท้ายเงียบ
wan2.7-imageAlibaba$0.030ต่อคำขอAlibaba Wan2.7 Image — สร้างภาพจากข้อความ แก้ไขภาพ สร้างภาพโดยอ้างอิงจากหลายภาพ แก้ไขแบบโต้ตอบ พร้อมการเขียนตัวอักษรและการทำตามคำสั่งที่แข็งแกร่ง
wan2.7-image-proAlibaba$0.075ต่อคำขอAlibaba Wan 2.7 Image Pro — ระดับมืออาชีพของตระกูลภาพ Wan 2.7 ครอบคลุมการสร้างภาพจากข้อความ ชุดภาพตามลำดับ การแก้ไขภาพ และการสร้างภาพโดยอ้างอิงจากหลายภาพ พร้อมการทำตามพรอมต์ที่ดีขึ้น การสร้างภาพจากข้อความไปถึง 4K (4096x4096) พร้อมระดับ 1K และ 2K และขนาดกำหนดเองตั้งแต่ 768x768 ส่วนโหมดแก้ไขและโหมดชุดภาพจำกัดที่ 2K โมเดลรับภาพอ้างอิงได้สูงสุด 9 ภาพ (JPEG, JPG, PNG, BMP, WEBP; ด้านละ 240-8,000 พิกเซล ภาพละไม่เกิน 20 MB) อัตราส่วนภาพตั้งแต่ 1:8 ถึง 8:1 และพรอมต์ยาวได้ถึง 5,000 อักขระ ผลลัพธ์เป็น PNG
wan2.7-r2vAlibaba$0.100ต่อวินาทีAlibaba Wan2.7 (R2V) — สร้างวิดีโอจากสื่ออ้างอิง รองรับภาพ/วิดีโออ้างอิงผสมกันได้สูงสุด 5 ชิ้น พร้อมเสียงอ้างอิงน้ำเสียง และคงความสอดคล้องของตัวละคร อุปกรณ์ประกอบฉาก และฉากได้ดีขึ้น
wan2.7-t2vAlibaba$0.100ต่อวินาทีAlibaba Wan2.7 (T2V) — ข้อความเป็นวิดีโอ พร้อมการแสดงอารมณ์ที่ดีขึ้น อารมณ์ที่ละเอียดอ่อน แอ็กชันที่เข้มข้น และการตัดภาพที่ดราม่า สร้างไฟล์ MP4 แบบ H.264 ที่ 720P หรือ 1080P ความยาว 2-15 วินาที (ค่าเริ่มต้น 5 วินาที) ในอัตราส่วน 16:9, 9:16, 1:1, 4:3 หรือ 3:4 จากพรอมต์ยาวได้ถึง 5,000 อักขระ เสียงถูกใส่มาให้ตามค่าเริ่มต้น หากไม่ระบุ audio_url โมเดลจะแต่งดนตรีประกอบหรือเอฟเฟกต์เสียงที่เข้ากันให้เอง หรือจะส่งไฟล์ wav หรือ mp3 ความยาว 2-30 วินาทีมาแทนก็ได้
wan2.7-videoeditAlibaba$0.100ต่อวินาทีAlibaba Wan2.7 VideoEdit — ตัดต่อวิดีโอด้วยภาษาธรรมชาติ ทั้งเฉพาะจุดหรือทั้งคลิป แทนที่องค์ประกอบด้วยภาพอ้างอิง และจำลองการเคลื่อนไหว เอฟเฟกต์ และมุมกล้อง
wan3.0-videoAlibaba$0.100$0.085ต่อวินาทีAlibaba Wan3.0 (Video) — โมเดลวิดีโอแบบครบวงจรที่รวมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอ และสื่ออ้างอิงเป็นวิดีโอไว้หลังเอนด์พอยต์เดียว สร้างไฟล์ MP4 แบบ H.264 ที่ 480P, 720P หรือ 1080P ความยาวสูงสุด 30 วินาที จากพรอมต์และ URL ภาพเฟรมแรกที่จะใส่หรือไม่ก็ได้ คิดค่าบริการต่อวินาทีของวิดีโอที่สร้างตามลำดับขั้นราคาของผู้ให้บริการเอง โดย 720P เป็นอัตราฐาน 480P คิดครึ่งหนึ่งของอัตรานั้น และ 1080P คิดสองเท่า คำขอที่ไม่ได้ระบุความละเอียดจะถูกโมเดลสร้างที่ 1080P และคิดค่าบริการตามระดับนั้น อินพุตวิดีโออ้างอิงและเสียงอ้างอิงมีอยู่ในโมเดลของผู้ให้บริการ แต่ไม่ได้รองรับบนเอนด์พอยต์นี้
wan3.0-video-primeAlibaba$0.140ต่อวินาทีAlibaba Wan3.0 Video Prime — ระดับความเร็วสูงของโมเดลวิดีโอแบบครบวงจร Wan 3.0 ซึ่งมีความสามารถเทียบเท่าระดับมาตรฐานแต่สร้างได้เร็วกว่า รวมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรก/เฟรมสุดท้าย และภาพอ้างอิงเป็นวิดีโอ (ภาพอ้างอิงสูงสุด 10 ภาพ) ไว้หลังเอนด์พอยต์เดียว ให้ไฟล์ MP4 แบบ H.264 ที่ 480P, 720P หรือ 1080P ความยาว 2 ถึง 30 วินาที ที่ 30 fps และมีเสียงเป็นค่าเริ่มต้น คิดค่าบริการต่อวินาทีของวิดีโอที่สร้างตามลำดับขั้นราคาของผู้ให้บริการ โดย 720P เป็นอัตราฐาน 480P คิดต่ำกว่าครึ่งหนึ่งของอัตรานั้นเล็กน้อย และ 1080P คิดสองเท่า คำขอที่ไม่ได้ระบุความละเอียดจะเรนเดอร์ที่ 1080P ซึ่งเป็นค่าเริ่มต้นของผู้ให้บริการ และคิดค่าบริการตามระดับนั้น เกตเวย์นี้ไม่รับอินพุตที่เป็นวิดีโออ้างอิง เสียงอ้างอิง ไฟล์ และลิงก์เว็บ และจะปฏิเสธระยะเวลาอัจฉริยะ (-1) โปรดระบุ duration อย่างชัดเจน ให้บริการผ่านช่องทางทางการของ Alibaba เพียงช่องทางเดียว