ราคาโมเดล AI จีน
ChinaAPI ให้บริการ DeepSeek, Qwen, GLM, Kimi และโมเดล AI จีนอื่น ๆ ผ่านเกตเวย์ที่เข้ากันได้กับ OpenAI ที่ https://api.chinaapi.ai/v1 ราคาทั้งหมดเป็นสกุลดอลลาร์สหรัฐ และแสดงตามหน่วยที่ผู้ให้บริการต้นทางกำหนด รายการเดียวกันนี้มีในรูปแบบ JSON ที่ /api/pricing
| โมเดล | ผู้ให้บริการ | อินพุต | เอาต์พุต | หน่วย | คำอธิบาย |
|---|---|---|---|---|---|
| claude-sonnet-4-5 | Anthropic | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Anthropic Claude Sonnet 4.5 — a pinned dated snapshot of the Sonnet 4.5 release, kept available for workloads that need byte-stable behaviour across runs. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| glm-5.2 | 智谱 | $1.4000 | $4.4000 | ต่อ 1M tokens | Zhipu GLM-5.2 — โมเดลพื้นฐานเรือธงที่ออกแบบมาเฉพาะสำหรับงานเอเจนต์เขียนโค้ดระยะยาว ผ่านการฝึกเฉพาะทางนานหลายเดือน ไม่ใช่เพียงการขยายบริบท พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| gpt-5.6-luna | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT-5.6 Luna — ระดับที่เร็วที่สุดและคุ้มค่าที่สุดของ GPT-5.6 ปรับให้เหมาะกับงานปริมาณมากที่อ่อนไหวต่อต้นทุน โดยยังคงความสามารถด้านการให้เหตุผล การมองเห็น และการใช้เครื่องมือ รองรับอินพุตข้อความและภาพ หน้าต่างบริบท 1,050,000 โทเค็น และเอาต์พุตสูงสุด 128,000 โทเค็น | ||
| step-asr | StepFun | $0.1444 | ต่อชั่วโมงเสียง | StepFun step-asr — การรู้จำเสียงพูดอเนกประสงค์ ครอบคลุมภาษาจีน อังกฤษ และภาษาถิ่นจีน ใช้สำหรับการถอดเสียง การทำรายงานการประชุม การตรวจสอบคุณภาพสายสนทนา และการค้นหาด้วยเสียง รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ | |
| step-audio-2 | StepFun | $1.4930 | $10.4480 | ต่อ 1M tokens | StepFun step-audio-2 — โมเดลเสียงพูดแบบครบวงจรที่รับเสียงเข้าโดยตรงแทนการทำงานจากข้อความถอดเสียง น้ำเสียงและลีลาการพูดจึงคงอยู่ถึงขั้นการทำความเข้าใจของโมเดล คิดค่าบริการต่อโทเค็น โดยใช้อัตราอินพุตเดียวกับตระกูล StepAudio 2.5 แต่มีอัตราเอาต์พุตสูงกว่า StepFun ไม่ได้เผยแพร่หน้าความสามารถแยกสำหรับโมเดลนี้ กรุณาดูเอกสารด้านเสียงของแพลตฟอร์มเพื่อทราบชุดพารามิเตอร์ปัจจุบัน |
| gemini-2.5-flash | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Google Gemini 2.5 Flash — a fast, low-cost multimodal model with a 1M-token context window. Accepts text, images, video and audio; audio input is billed at the vendor's separate audio rate. | |||
| claude-sonnet-4-6 | Anthropic | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Anthropic Claude Sonnet 4.6 — the balanced Sonnet generation, offering a 1,000,000-token context window at standard pricing with up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer, so the same text yields roughly 30% fewer tokens than on 4.7-and-later models at the same per-token rate. | ||
| agnes-image-2.1-flash | Agnes AI | $0.000 | ต่อคำขอ | Agnes AI Image 2.1 Flash — โมเดลสร้างและแก้ไขภาพที่เน้นรายละเอียดสำหรับฉากที่มีความหนาแน่นของข้อมูลสูง รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ ด้วยขนาดและอัตราส่วนภาพที่ยืดหยุ่นตั้งแต่ 1K ถึง 4K | |
| claude-fable-5 | Anthropic | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Anthropic Claude Fable 5 — โมเดลที่มีความสามารถสูงที่สุดของ Anthropic ในบรรดารุ่นที่เปิดให้ใช้งานทั่วไป สำหรับงานความรู้และการเขียนโค้ดที่ทะเยอทะยานและใช้เวลายาวนาน สร้างขึ้นสำหรับงานเอเจนต์ที่กินเวลาหลายวัน งานวิศวกรรมซอฟต์แวร์ที่ซับซ้อน การวิจัยเชิงลึก การให้เหตุผลกับเอกสารและภาพ รวมถึงการตรวจสอบตนเองเชิงรุก | ||
| claude-haiku-4-5 | Anthropic | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Anthropic Claude Haiku 4.5 — the fastest Claude model with near-frontier intelligence, built for high-volume, latency-sensitive work such as classification, extraction, and routing. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| happyhorse-1.1-i2v | 阿里巴巴 | $0.091 | ต่อวินาที | Alibaba HappyHorse 1.1 (I2V) — ภาพเป็นวิดีโอ พร้อมพื้นผิวที่ดีขึ้น ความสอดคล้องของตัวละครข้ามคลิป ความลื่นไหลของการเคลื่อนไหว และการซิงก์ภาพกับเสียง 720P/1080P | |
| MiniMax-M2.7 | MiniMax | $0.3000 | $1.2000 | ต่อ 1M tokens | MiniMax M2.7 — โมเดลข้อความสำหรับการแชท การเขียนโค้ด งานสำนักงาน และงานเอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น และเอาต์พุตที่ความเร็วราว 60 โทเค็นต่อวินาที รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ รองรับการเรียกใช้เครื่องมือ ส่วนการคิดเปิดอยู่เสมอและปิดไม่ได้ |
| gpt-4.1-mini | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT-4.1 mini — the small GPT-4.1 variant. Being non-reasoning, its prose stays more predictable than the reasoning tier at a comparable price, which suits writing and rewriting work. It takes text and image input, with a 1,047,576-token context window and up to 32,768 output tokens. | ||
| kimi-k2.7-code | Moonshot | $0.7600 | $3.1570 | ต่อ 1M tokens | Moonshot Kimi K2.7 Code — โมเดลเฉพาะทางด้านการเขียนโค้ดของ Kimi ซึ่งผู้ให้บริการวัดผลว่าทำตามคำสั่งได้ดีขึ้นและเขียนโค้ดระยะยาวได้ดีกว่า K2.6 พร้อมลดการคิดเกินจำเป็นลงราว 30% โดยเฉลี่ย หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ การคิดเป็นสิ่งบังคับและจะเกิดข้อผิดพลาดหากปิด ส่วน tool_choice จำกัดไว้ที่ auto หรือ none เท่านั้น และต้องส่งต่อ reasoning_content ตลอดการเรียกใช้เครื่องมือหลายขั้นตอน |
| kling-3.0-turbo | 快手 | $0.560 | ต่อคำขอ | Kuaishou Kling 3.0 Turbo — ระดับคุ้มราคาของตระกูล Kling 3.0 สร้างวิดีโอ 720P หรือ 1080P (ค่าเริ่มต้น 720P) ความยาว 3-15 วินาที (ค่าเริ่มต้น 5) ในอัตราส่วน 16:9, 9:16 หรือ 1:1 จากพรอมต์หรือภาพเฟรมแรก เสียงในตัวมาพร้อมเสมอและไม่มีสวิตช์เปิดปิด เมื่อเทียบกับ kling-v3 รุ่นนี้ตัดระดับ 4K การควบคุมเฟรมสุดท้าย และการรับวิดีโอเป็นอินพุตออกไป เพื่อแลกกับความเร็วและต้นทุน 720p 5 วินาทีพร้อมเสียง ≈ $0.56 | |
| mimo-v2.5-tts | Xiaomi | $0.0000 | ต่อ 1 หมื่นอักขระ | Xiaomi MiMo v2.5 TTS — การแปลงข้อความเป็นเสียงพูดที่มีอารมณ์ พร้อมเสียงในตัวแปดเสียง เป็นภาษาจีนสี่เสียงและภาษาอังกฤษสี่เสียง (Mia, Chloe, Milo, Dean) ครอบคลุมภาษาจีนและอังกฤษ รวมถึงสไตล์ภาษาถิ่นตงเป่ย เสฉวน เหอหนาน และกวางตุ้ง กำกับลีลาการพูดได้สองทาง คือคำสั่งกำหนดสไตล์ด้วยภาษาธรรมชาติ และแท็กเสียงแบบอินไลน์สำหรับอารมณ์พื้นฐานและอารมณ์ผสม การหายใจ การถอนหายใจ และจังหวะ รวมถึงโหมดร้องเพลงที่มีเฉพาะโมเดลนี้ในตระกูล MiMo TTS ผลลัพธ์เป็น wav โมโนหรือ pcm16 ที่ 24 kHz และรองรับการสตรีมความหน่วงต่ำ ซึ่งต้องใช้ pcm16 บริบท 8K และเอาต์พุตสูงสุด 8K | |
| step-asr-1.1 | StepFun | $0.3370 | ต่อชั่วโมงเสียง | StepFun step-asr-1.1 — โมเดลรู้จำเสียงพูดอเนกประสงค์รุ่นปรับปรุงในตระกูล step-asr ครอบคลุมภาษาจีน อังกฤษ และภาษาถิ่นจีน รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ | |
| step-audio-r1.5 | StepFun | $1.4930 | $15.6720 | ต่อ 1M tokens | StepFun step-audio-r1.5 — โมเดลเสียงพูดแบบครบวงจรในตระกูลเดียวกับ step-audio-2 ใช้อัตราอินพุตเดียวกันแต่คิดค่าเอาต์พุตสูงกว่า 50% StepFun ไม่ได้เผยแพร่หน้าความสามารถแยกสำหรับโมเดลนี้ กรุณาดูเอกสารด้านเสียงของแพลตฟอร์มเพื่อทราบชุดพารามิเตอร์ปัจจุบัน |
| step-image-edit-2 | StepFun | $0.003 | ต่อคำขอ | StepFun Step Image Edit 2 — โมเดลรวมการสร้างภาพจากข้อความและการแก้ไขภาพ ด้วยพารามิเตอร์ต่ำกว่า 6B แต่เทียบเท่าโมเดลแก้ไขภาพแบบเปิดน้ำหนักในระดับ 12B-20B ทำงานแก้ไขหนึ่งครั้งเสร็จภายในหนึ่งถึงสองวินาที และออกแบบมาเพื่อการรีทัชแบบโต้ตอบที่ความหน่วงต่ำ รองรับ 256x256, 512x512, 768x768, 1024x1024, 1280x800 และ 800x1280 พร้อมพรอมต์เชิงลบและโหมดปรับข้อความให้เหมาะสม สร้างได้หนึ่งภาพต่อหนึ่งคำขอ ให้บริการผ่านเอนด์พอยต์ images ที่เข้ากันได้กับ OpenAI | |
| wan2.7-image-pro | 阿里巴巴 | $0.064 | ต่อคำขอ | Alibaba Wan 2.7 Image Pro — ระดับมืออาชีพของตระกูลภาพ Wan 2.7 ครอบคลุมการสร้างภาพจากข้อความ ชุดภาพตามลำดับ การแก้ไขภาพ และการสร้างภาพโดยอ้างอิงจากหลายภาพ พร้อมการทำตามพรอมต์ที่ดีขึ้น การสร้างภาพจากข้อความไปถึง 4K (4096x4096) พร้อมระดับ 1K และ 2K และขนาดกำหนดเองตั้งแต่ 768x768 ส่วนโหมดแก้ไขและโหมดชุดภาพจำกัดที่ 2K โมเดลรับภาพอ้างอิงได้สูงสุด 9 ภาพ (JPEG, JPG, PNG, BMP, WEBP; ด้านละ 240-8,000 พิกเซล ภาพละไม่เกิน 20 MB) อัตราส่วนภาพตั้งแต่ 1:8 ถึง 8:1 และพรอมต์ยาวได้ถึง 5,000 อักขระ ผลลัพธ์เป็น PNG | |
| doubao-seedance-2-0-fast-260128 | 字节跳动 | $4.2000 | $4.2000 | ต่อ 1M tokens | ByteDance Seedance 2.0 Fast — การสร้างวิดีโอที่คุ้มค่า มาพร้อมชุดความสามารถครบถ้วนของ Seedance 2.0 แต่จำกัดที่ 480p และ 720p, 24 fps, 4-15 วินาที ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 โดย 480p 5 วินาที ≈ $0.26 |
| claude-opus-5 | Anthropic | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Anthropic Claude Opus 5 — โมเดลการให้เหตุผลเชิงลึกสำหรับงานเขียนโค้ดแบบเอเจนต์ที่ซับซ้อนและงานระดับองค์กร พัฒนาขึ้นอย่างมากในงานระยะยาว การรีวิวโค้ด เวิร์กโฟลว์เอกสาร การมองเห็น และการประสานงานหลายเอเจนต์ มีหน้าต่างบริบท 1,000,000 โทเค็น รองรับเอาต์พุตสูงสุด 128,000 โทเค็น และเปิดใช้การคิดแบบปรับตัวเป็นค่าเริ่มต้น | ||
| deepseek-v4-flash-vision-exp | DeepSeek | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | DeepSeek V4 Flash Vision (experimental) — the V4 Flash tier with image input, priced identically to deepseek-v4-flash on every face. Images are converted to tokens by their size and billed together with text at the input rate, so there is no separate image charge. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. The vendor labels this tier experimental; behaviour and availability may change without notice. Text and images in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| doubao-seedance-2-0-260128 | 字节跳动 | $7.0000 | $7.0000 | ต่อ 1M tokens | ByteDance Seedance 2.0 — เรือธงของตระกูล Seedance 2.0 และเป็นรุ่นเดียวในตระกูลที่ไปถึง 1080p และ 4K (ความลึกสี 10 บิต) เพิ่มเติมจาก 480p และ 720p ที่ 24 fps และ 4-15 วินาที ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 และดึงเฟรมปิดท้ายออกมาเป็นภาพนิ่งได้ คิดค่าบริการตามความละเอียดของเอาต์พุต |
| doubao-seedream-5-0-260128 | 字节跳动 | $0.033 | ต่อคำขอ | ByteDance Doubao Seedream 5.0-lite — สร้างภาพจากข้อความและภาพเป็นภาพ พร้อมการสร้างสรรค์ที่ควบคุมได้อย่างชาญฉลาดขึ้น การค้นคืนข้อมูลแบบเรียลไทม์ และความสอดคล้องของตัวแบบที่ดีขึ้น (ความละเอียด 2K ขึ้นไป) | |
| kling-v3 | 快手 | $0.420 | ต่อคำขอ | Kuaishou Kling 3.0 — ข้อความเป็นวิดีโอและภาพเป็นวิดีโอ พร้อมเสียงในตัวและความสอดคล้องขององค์ประกอบที่ดีขึ้น คลิปยาว 3-15 วินาที (ค่าเริ่มต้น 5) ในอัตราส่วน 16:9, 9:16 หรือ 1:1 โดยเลือกระดับผ่าน mode ได้แก่ std สำหรับ 720P, pro สำหรับ 1080P และ 4k สำหรับ 4K แบบเนทีฟ เสียงต้องเปิดเองผ่าน sound=on และค่าเริ่มต้นคือปิด ส่วนภาพเป็นวิดีโอรับเฟรมแรกพร้อมเฟรมท้ายที่จะใส่หรือไม่ก็ได้ เริ่มต้นที่ $0.083/วินาที (720p) | |
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | ต่อ 1M tokens | Xiaomi MiMo-V2.5-Pro — โมเดลเรือธงระดับล้านล้านพารามิเตอร์ (ทำงานจริง 42B) พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K ปรับจูนมาสำหรับงานเอเจนต์ที่ใช้งานหนัก รองรับการคิดเชิงลึก การเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการค้นหาเว็บ สร้างได้เฉพาะข้อความ ต่างจาก mimo-v2.5 ตรงที่รายการความสามารถของผู้ให้บริการไม่ได้ระบุการเข้าใจครบทุกโหมด |
| step-1o-turbo-vision | StepFun | $0.3850 | $1.2330 | ต่อ 1M tokens | StepFun step-1o-turbo-vision — การเข้าใจภาพและวิดีโอพร้อมการสร้างข้อความที่รวดเร็ว บริบท 32K รับอินพุตเป็นข้อความ ภาพ และวิดีโอ แต่ตอบกลับเป็นข้อความเท่านั้น เป็นโมเดลด้านการมองเห็นรุ่นก่อนที่คงไว้เพื่อความเข้ากันได้ โดย step-3.7-flash รองรับอินพุตชนิดเดียวกันด้วยบริบท 256K และเลือกระดับความลึกของการให้เหตุผลได้ ควรให้ด้านยาวของภาพไม่เกิน 4096 พิกเซลเพื่อการรู้จำที่แม่นยำ |
| wan2.7-image | 阿里巴巴 | $0.030 | ต่อคำขอ | Alibaba Wan2.7 Image — สร้างภาพจากข้อความ แก้ไขภาพ สร้างภาพโดยอ้างอิงจากหลายภาพ แก้ไขแบบโต้ตอบ พร้อมการเขียนตัวอักษรและการทำตามคำสั่งที่แข็งแกร่ง | |
| gemini-3.1-flash-image | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Google Gemini 3.1 Flash Image (Nano Banana 2) — โมเดลรุ่นเสถียรที่มีความหน่วงต่ำ สำหรับการสร้างภาพคุณภาพสูงและการแก้ไขผ่านบทสนทนา รับข้อความ ภาพ และ PDF รองรับการคิดและการอ้างอิงจากการค้นหา และสร้างภาพขนาด 0.5K, 1K, 2K หรือ 4K สำหรับเวิร์กโฟลว์ผลิตงานปริมาณมาก | |||
| qwen3.8-max | 阿里巴巴 | $1.9000 | $5.7000 | ต่อ 1M tokens | Alibaba Qwen3.8-Max — 2.4-trillion-parameter MoE flagship and the most capable model in the Qwen family, with the vendor citing major gains in coding and office productivity. 1,000,000-token context window (991,808 max input, 983,616 in thinking mode), up to 131,072 output tokens, and a 262,144-token chain-of-thought budget. Accepts text input and returns text (image/video input is not available on the current serving route); supports function calling, structured outputs, and context caching. |
| happyhorse-1.1-t2v | 阿里巴巴 | $0.091 | ต่อวินาที | Alibaba HappyHorse 1.1 (T2V) — ข้อความเป็นวิดีโอ พร้อมการเข้าใจความหมาย การควบคุมมุมกล้อง และการสร้างภาพเคลื่อนไหวที่ดีขึ้น ให้วิดีโอ 720P/1080P ที่ลื่นไหล มีรายละเอียด และสมจริงตามหลักฟิสิกส์ | |
| MiniMax-M3 | MiniMax | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | MiniMax M3 — โมเดลเขียนโค้ดแบบมัลติโหมดระดับแนวหน้า สำหรับการให้เหตุผลเชิงเอเจนต์ การใช้เครื่องมือ และการทำงานตามโครงสร้างที่กำหนด พร้อมหน้าต่างบริบท 1,000,000 โทเค็น โมเดลรับข้อความ ภาพขนาดไม่เกิน 10 MB และวิดีโอไม่เกิน 50 MB แบบส่งมาในคำขอ หรือไม่เกิน 512 MB ผ่าน Files API แล้วตอบกลับเป็นข้อความ รองรับการเรียกใช้เครื่องมือ โดยการคิดเป็นตัวเลือกไม่ใช่สิ่งที่เปิดอยู่ตลอด | ||
| qwen3-tts-flash | 阿里巴巴 | $0.1100 | ต่อ 1 หมื่นอักขระ | Alibaba Qwen3-TTS-Flash — การแปลงข้อความเป็นเสียงพูดที่มีความหน่วงต่ำ พร้อมเสียงในตัวที่มีอารมณ์ 17 เสียง ครอบคลุมภาษาจีน อังกฤษ เยอรมัน อิตาลี โปรตุเกส สเปน ญี่ปุ่น เกาหลี ฝรั่งเศส และรัสเซีย พร้อมโหมดอัตโนมัติสำหรับข้อความที่ปนหลายภาษา และการออกเสียงตามภาษาถิ่น โมเดลรับข้อความได้สูงสุด 512 โทเค็นต่อคำขอ และรองรับการสังเคราะห์ทั้งแบบสตรีมมิงและไม่สตรีมมิง | |
| gpt-5.6-terra | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT-5.6 Terra — โมเดล GPT-5.6 ที่สมดุลสำหรับงานอาชีพในแต่ละวัน ให้ความฉลาดและประสิทธิภาพของเอเจนต์เขียนโค้ดที่แข็งแกร่งด้วยต้นทุนต่ำกว่า Sol รองรับอินพุตข้อความและภาพ เครื่องมือในตัว หน้าต่างบริบท 1,050,000 โทเค็น และเอาต์พุตสูงสุด 128,000 โทเค็น | ||
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | ต่อ 1M tokens | Xiaomi MiMo-V2.5 — โมเดลที่รองรับครบทุกโหมดโดยกำเนิด พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K เข้าใจภาพ วิดีโอ เสียง และข้อความได้ในโมเดลเดียว รองรับการคิดเชิงลึก การเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการค้นหาเว็บ พร้อมความสามารถเอเจนต์ครบทุกโหมด |
| step-tts-mini | StepFun | $0.1444 | ต่อ 1 หมื่นอักขระ | StepFun step-tts-mini — สมาชิกที่คุ้มค่าและความหน่วงต่ำในตระกูล TTS ของ StepFun ครอบคลุมภาษาเดียวกับ step-tts-2 (จีน อังกฤษ จีนผสมอังกฤษ และญี่ปุ่น รวมถึงกวางตุ้งและเสฉวน) โดยมีเสียงในตัวให้เลือกบางส่วน รองรับป้ายกำกับอารมณ์และลีลาการพูดเป็นภาษาธรรมชาติ และการโคลนเสียงแบบ zero-shot จากเสียงอ้างอิงราว 10 วินาที เอาต์พุตเป็น wav, mp3, flac, opus หรือ pcm | |
| gemini-3.1-flash-lite-image | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Google Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — โมเดลที่มีความหน่วงต่ำมากและคุ้มค่า สำหรับการสร้างภาพปริมาณมากและการแก้ไขหลายรอบอย่างรวดเร็ว รับข้อความและภาพ สร้างภาพขนาด 1K รองรับการคิดและการแก้ไขผ่านบทสนทนา ออกแบบมาสำหรับแอปพลิเคชันเชิงโต้ตอบทั้งของนักพัฒนาและผู้ใช้ทั่วไป | |||
| gpt-4o | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT-4o — the multimodal GPT-4 generation model, kept in the catalogue for drop-in compatibility with existing integrations that call it by name. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| qwen3.6-plus | 阿里巴巴 | $0.4000 | $2.4000 | ต่อ 1M tokens | Alibaba Qwen3.6-Plus — โมเดลสมดุลสำหรับการให้เหตุผลทั่วไปและการใช้เครื่องมือ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 65,536 โทเค็น และงบประมาณห่วงโซ่ความคิด 81,920 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง การค้นหาเว็บ การเติมข้อความต่อจากส่วนนำ และการแคชบริบท |
| step-asr-1.1-stream | StepFun | $0.3852 | ต่อชั่วโมงเสียง | StepFun step-asr-1.1 — the updated general-purpose recognizer in the step-asr line, covering Chinese, English, and Chinese dialects. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| claude-opus-4-7 | Anthropic | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Anthropic Claude Opus 4.7 — โมเดลการให้เหตุผลขั้นสูงสำหรับงานวิศวกรรมซอฟต์แวร์ที่ยากและงานเอเจนต์ที่ซับซ้อนซึ่งทำงานต่อเนื่องยาวนาน เน้นการทำตามคำสั่งอย่างเคร่งครัด การตรวจสอบตนเอง การใช้เครื่องมืออย่างเชื่อถือได้ และการมองเห็นความละเอียดสูงทั้งบนอินเทอร์เฟซ ภาพ เอกสาร และเวิร์กโฟลว์เชิงวิชาชีพ | ||
| qwen3.6-flash | 阿里巴巴 | $0.2500 | $1.5000 | ต่อ 1M tokens | Alibaba Qwen3.6-Flash — โมเดลภาษาเชิงภาพที่ทำงานเร็ว ซึ่งผู้ให้บริการชูจุดเด่นด้านการเขียนโค้ดเชิงเอเจนต์และปัญญาเชิงพื้นที่ พร้อมการพัฒนาที่ชัดเจนในการระบุตำแหน่งและตรวจจับวัตถุ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 65,536 โทเค็น และงบประมาณห่วงโซ่ความคิด 131,072 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชันและการแคชบริบท |
| claude-sonnet-5 | Anthropic | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Anthropic Claude Sonnet 5 — โมเดลสำหรับใช้งานจริงที่สมดุลระหว่างความฉลาดระดับแนวหน้ากับความเร็ว สำหรับการเขียนโค้ด งานเอเจนต์ และเวิร์กโฟลว์องค์กร สามารถวางแผน ใช้เครื่องมือเบราว์เซอร์และเทอร์มินัล และทำงานได้ด้วยตนเองทั้งงานให้เหตุผล งานความรู้ และงานวิศวกรรมซอฟต์แวร์ | ||
| gemini-2.5-pro | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Google Gemini 2.5 Pro — the reasoning-tier model of the 2.5 family, with a 1M-token context window. Prompts above 200,000 tokens are repriced at the vendor's long-context rate for the whole request, matching Google's own rule. | |||
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | ต่อ 1M tokens | StepFun step-3.7-flash — sparse MoE with 198B total and 11B active parameters, native 256K context, and native understanding of images and video alongside text. Reasoning depth is selectable per request through reasoning_effort (low / medium / high), and the model supports reliable multi-step tool calling, JSON Schema structured output, streaming, and prompt caching. Tuned for agent and coding workloads. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| MiniMax-Hailuo-02 | MiniMax | $0.280 | ต่อคำขอ | MiniMax Hailuo 02 — การสร้างวิดีโอราคาประหยัดที่ครอบคลุมทั้งข้อความเป็นวิดีโอและภาพเป็นวิดีโอ ที่ 24 fps โดย 512p และ 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที ระดับ 512p เป็นจุดเริ่มต้นของตระกูล Hailuo | |
| gemini-3.7-flash | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Google Gemini 3.7 Flash — the newest Flash-tier multimodal reasoning model, priced identically to 3.6 Flash while the vendor promotion runs. Accepts text, images, video, audio and PDFs; supports thinking, function calling, code execution, search grounding and structured output. Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5.1 | 智谱 | $1.4000 | $4.4000 | ต่อ 1M tokens | Zhipu GLM-5.1 — โมเดลพื้นฐานเรือธงที่สร้างมาเพื่อการทำงานอัตโนมัติต่อเนื่องยาวนาน โดยผู้ให้บริการระบุว่าสามารถทำงานเดียวต่อเนื่องโดยไม่ต้องมีคนดูแลได้นานถึง 8 ชั่วโมง ครอบคลุมทั้งการวางแผน การลงมือทำ การทดสอบ และการปรับปรุงซ้ำ หน้าต่างบริบท 200K เอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้าและตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| gpt-5.2 | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT-5.2 — a general-purpose model from the GPT-5.2 generation, kept in the catalogue for drop-in compatibility with integrations that call it by name. It takes text and image input, with a 400,000-token context window and up to 128,000 output tokens. | ||
| speech-2.8-turbo | MiniMax | $0.6000 | ต่อ 1 หมื่นอักขระ | MiniMax speech-2.8-turbo — ระดับความหน่วงต่ำของตระกูลเสียง 2.8 ที่ยอมสละการถ่ายทอดอันสมจริงอย่างยิ่งของรุ่น HD เพื่อแลกกับการสังเคราะห์ที่เร็วขึ้นโดยยังคงความลื่นไหลตามธรรมชาติ ครอบคลุม 40 ภาษาและ 7 อารมณ์เท่ากับรุ่น HD ปรับตั้งระดับเสียงสูงต่ำ ความเร็วในการพูด ความดัง อัตราสุ่มสัญญาณ บิตเรต และรูปแบบเอาต์พุตได้ และรับข้อความได้สูงสุด 1 ล้านอักขระแบบอะซิงโครนัส หรือ 10,000 อักขระผ่านอินเทอร์เฟซสตรีมมิง | |
| wan3.0-video | 阿里巴巴 | $0.089 | ต่อวินาที | Alibaba Wan3.0 (Video) — an all-in-one video model that unifies text-to-video, image-to-video and reference-to-video behind a single endpoint. Generates H.264 MP4 at 480P, 720P or 1080P, up to 30 seconds, from a prompt and an optional first-frame image URL. Billed per second of generated video against the vendor's own ladder: 720P is the base rate, 480P is charged at half of it and 1080P at double. A request that does not name a resolution is produced at 1080P by the model and is charged at that tier. Reference video and reference audio inputs exist in the vendor's model but are not carried on this endpoint. | |
| gpt-4.1 | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT-4.1 — a non-reasoning model tuned for instruction following and long-context work, with a 1,047,576-token context window and up to 32,768 output tokens. It takes text and image input, and its output is priced below the reasoning tier at the same input price. | ||
| agnes-2.0-flash | Agnes AI | $0.0000 | ต่อ 1M tokens | Agnes AI Agnes 2.0 Flash — โมเดลเอเจนต์มัลติโหมดความเร็วสูง พร้อมบริบทอินพุต 256K และขีดจำกัดเอาต์พุตอ้างอิง 64K รองรับการแชท สตรีมมิง การเรียกใช้เครื่องมือ การเขียนโค้ด การให้เหตุผล การเข้าใจภาพ และเวิร์กโฟลว์เอเจนต์ | |
| agnes-image-2.0-flash | Agnes AI | $0.000 | ต่อคำขอ | Agnes AI Image 2.0 Flash — โมเดลสร้างและแก้ไขภาพที่รวดเร็ว รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ โดยรับผลลัพธ์ได้ทั้งในรูปแบบ URL หรือข้อมูล Base64 | |
| gpt-image-2 | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT Image 2 — a state-of-the-art image generation and editing model for fast, high-quality output. It takes text and image input, supports flexible image sizes and high-fidelity image inputs, and bills per token rather than per call: $5 text input, $1.25 cached text input, $8 image input, and $30 image output per 1M tokens. | ||
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | ต่อ 1 หมื่นอักขระ | โมเดลออกแบบเสียงของ Xiaomi MiMo: อธิบายเสียงที่ต้องการเป็นภาษาธรรมชาติผ่าน instructions แล้วโมเดลจะสังเคราะห์คำพูดด้วยเสียงที่ออกแบบไว้นั้น | |
| wan2.7-i2v | 阿里巴巴 | $0.080 | ต่อวินาที | Alibaba Wan 2.7 Image-to-Video — ครอบคลุมการสร้างจากเฟรมแรก การเปลี่ยนภาพระหว่างเฟรมแรกกับเฟรมสุดท้าย และการต่อเนื่องจากคลิปเดิม สร้างวิดีโอ 720P หรือ 1080P (ค่าเริ่มต้น 1080P) ความยาว 2-15 วินาที ค่าเริ่มต้น 5 วินาที จากพรอมต์ยาวได้ถึง 5,000 อักขระ (พรอมต์เชิงลบไม่เกิน 500 อักขระ) สามารถส่งไฟล์ mp3 หรือ wav ความยาว 2-30 วินาทีเป็น driving_audio ได้ หากไม่ส่งเสียงมา โมเดลจะสร้างดนตรีประกอบหรือเอฟเฟกต์เสียงที่เข้ากันให้เอง เสียงที่ยาวกว่าคลิปจะถูกตัดทิ้ง ส่วนเสียงที่สั้นกว่าจะทำให้ช่วงท้ายเงียบ | |
| doubao-seed-2-1-pro-260628 | 字节跳动 | $0.8890 | $4.4440 | ต่อ 1M tokens | ByteDance Doubao Seed 2.1 Pro — โมเดลเอเจนต์เรือธงของ Doubao สำหรับงานที่ใช้จริง ครอบคลุมการคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง ซึ่งผู้ให้บริการแนะนำให้ใช้โหมด json_schema หน้าต่างบริบท 256K โดยรับอินพุตสูงสุด 256K เอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K) และงบประมาณห่วงโซ่ความคิด 256K โมเดลรับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ ทั้งนี้ตระกูล 2.1 ไม่ได้ระบุความสามารถในการเข้าใจเสียงไว้ รองรับการแคชบริบททั้งแบบโดยปริยายและแบบระบุชัดเจน รวมถึงแคชส่วนนำและแคชระดับเซสชัน |
| gemini-3.1-flash-lite | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Google Gemini 3.1 Flash-Lite — โมเดลมัลติโหมดที่มีความหน่วงต่ำและคุ้มค่า สำหรับงานเบาที่เรียกใช้บ่อย เวิร์กโฟลว์เอเจนต์ปริมาณมาก งานแปลภาษา และการดึงข้อมูลแบบมีโครงสร้าง รับข้อความ ภาพ วิดีโอ เสียง และ PDF รองรับการคิดและการใช้เครื่องมือ พร้อมบริบทอินพุต 1,048,576 โทเค็น และเอาต์พุตสูงสุด 65,536 โทเค็น | |||
| gpt-5.4-mini | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT-5.4 mini — the small GPT-5.4 model for high-volume workloads, coding, computer use, and subagents. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 400,000-token context window with a 272,000-token maximum input, and up to 128,000 output tokens. | ||
| image-01 | MiniMax | $0.004 | ต่อคำขอ | MiniMax image-01 — สร้างภาพจากข้อความผ่านเอนด์พอยต์ image_generation ของ MiniMax เอง คิดค่าบริการต่อภาพที่สร้าง ผู้ให้บริการจัดโมเดลนี้ไว้ในกลุ่มโมเดลรุ่นเก่า | |
| kling-v3-omni | 快手 | $0.420 | ต่อคำขอ | Kling 3.0 Omni — สร้างวิดีโอจากหลายภาพอ้างอิง ราคาที่แสดงเป็นของระดับ std (720p, 5 วินาที, ไม่มีเสียง, ไม่มีวิดีโออ้างอิง) คำขอที่ไม่ได้ระบุ mode จะใช้ระดับ pro ซึ่งเป็นค่าเริ่มต้นของต้นทาง และถูกคิดค่าบริการ 1.33 เท่า หรือราว $0.56 สำหรับคลิป 5 วินาทีเดียวกัน ส่วน 4k คิด 5 เท่า กรุณาส่ง mode=std เพื่อให้ถูกคิดตามราคาที่แสดง | |
| qwen3.7-max | 阿里巴巴 | $1.5000 | $4.5000 | ต่อ 1M tokens | Alibaba Qwen3.7-Max — เรือธงแบบปิดซอร์ส วางตำแหน่งไว้สำหรับการเขียนโปรแกรม งานสำนักงานและงานเพิ่มผลิตภาพ รวมถึงการทำงานอัตโนมัติในระยะยาว มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท |
| doubao-seedream-4-5-251128 | 字节跳动 | $0.037 | ต่อคำขอ | ByteDance Doubao Seedream 4.5 — สร้างภาพจากข้อความและภาพเป็นภาพ พร้อมการหลอมรวมหลายภาพ ให้ผลลัพธ์เป็นภาพเดียวหรือชุดภาพที่สัมพันธ์กัน โหมดภาพเดียวรับเพียงพรอมต์อย่างเดียว ภาพอ้างอิงหนึ่งภาพ หรือภาพอ้างอิง 2-14 ภาพ ส่วนโหมดชุดภาพ (sequential_image_generation=auto) คืนภาพได้สูงสุด 15 ภาพจากข้อความ สูงสุด 14 ภาพจากภาพอ้างอิงเพียงภาพเดียว หรือเป็นชุดจากภาพอ้างอิง 2-14 ภาพ โดยจำนวนอินพุตบวกเอาต์พุตต้องไม่เกิน 15 รองรับเอาต์พุต 2K และ 4K และคืนค่าเป็น JPEG ตามค่าเริ่มต้น ในรูปแบบ URL หรือ base64 ส่วนการแก้ไขเชิงโต้ตอบด้วยพิกัดมีเฉพาะใน Seedream 5.0 pro เท่านั้น | |
| gpt-4o-mini | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT-4o mini — the small, low-cost GPT-4o variant for high-volume and latency-sensitive work. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| kimi-k3 | Moonshot | $3.0000 | $15.0000 | ต่อ 1M tokens | Moonshot Kimi K3 — โมเดลเรือธงขนาด 2.8 ล้านล้านพารามิเตอร์ สำหรับการเขียนโค้ดระยะยาว งานความรู้แบบครบวงจร และการให้เหตุผลเชิงลึก พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 1,048,576 โทเค็น (ค่าเริ่มต้น 131,072) โมเดลรับข้อความ ภาพแบบ base64 และวิดีโอ แล้วตอบกลับเป็นข้อความ การคิดเปิดอยู่เสมอ โดยเลือก reasoning_effort ได้เป็น low, high หรือ max (ค่าเริ่มต้นคือ max) และ temperature ถูกตรึงไว้ที่ 1.0 รองรับการเรียกใช้เครื่องมือที่กำหนดเองและการโหลดเครื่องมือแบบไดนามิก |
| stepaudio-2.5-tts | StepFun | $0.8500 | ต่อ 1 หมื่นอักขระ | StepFun StepAudio 2.5 TTS — การแปลงข้อความเป็นเสียงพูดที่คำนึงถึงบริบท โดยส่งความเข้าใจไปตลอดทั้งไปป์ไลน์การสร้างแทนที่จะมองลีลาการพูดเป็นงานหลังการประมวลผล กำกับเสียง อารมณ์ และจังหวะด้วยภาษาธรรมชาติได้สองระดับ คือบริบทระดับทั้งคำขอและบริบทแบบอินไลน์สำหรับแต่ละช่วงข้อความ การโคลนเสียงแบบ zero-shot ใช้เสียงอ้างอิงราว 3 วินาที และสืบทอดชุดการควบคุมตามบริบททั้งหมด รับได้สูงสุด 1000 อักขระต่อคำขอ เอาต์พุตเป็น wav, mp3, flac หรือ opus | |
| stepaudio-2.5-asr | StepFun | $0.0220 | ต่อชั่วโมงเสียง | StepFun StepAudio 2.5 ASR — โมเดลรู้จำเสียงพูดขนาด 4B พารามิเตอร์ที่สร้างบน Multi-Token Prediction ถอดเสียงห้านาทีได้ในเวลาราวหนึ่งวินาที (RTF ประมาณ 0.0053) ปรับให้เหมาะกับภาษาจีนและอังกฤษ มาพร้อมการแปลงข้อความย้อนกลับให้เป็นรูปมาตรฐาน การระบุตัวผู้พูด และการแยกสองช่องสัญญาณสำหรับบันทึกการโทรและการประชุม รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ | |
| wan2.7-t2v | 阿里巴巴 | $0.080 | ต่อวินาที | Alibaba Wan2.7 (T2V) — ข้อความเป็นวิดีโอ พร้อมการแสดงอารมณ์ที่ดีขึ้น อารมณ์ที่ละเอียดอ่อน แอ็กชันที่เข้มข้น และการตัดภาพที่ดราม่า สร้างไฟล์ MP4 แบบ H.264 ที่ 720P หรือ 1080P ความยาว 2-15 วินาที (ค่าเริ่มต้น 5 วินาที) ในอัตราส่วน 16:9, 9:16, 1:1, 4:3 หรือ 3:4 จากพรอมต์ยาวได้ถึง 5,000 อักขระ เสียงถูกใส่มาให้ตามค่าเริ่มต้น หากไม่ระบุ audio_url โมเดลจะแต่งดนตรีประกอบหรือเอฟเฟกต์เสียงที่เข้ากันให้เอง หรือจะส่งไฟล์ wav หรือ mp3 ความยาว 2-30 วินาทีมาแทนก็ได้ | |
| deepseek-v4-flash | DeepSeek | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | DeepSeek V4 Flash 0731 — the fast, high-concurrency DeepSeek V4 tier for chat, coding help, and agent loops, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3.5-flash | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Google Gemini 3.5 Flash — โมเดลมัลติโหมดรุ่นเสถียร ปรับให้เหมาะกับประสิทธิภาพของเอเจนต์ที่ต่อเนื่อง ลูปการเขียนโค้ดที่รวดเร็ว การกระจายงานให้เอเจนต์ย่อย และเวิร์กโฟลว์หลายขั้นตอนที่ทำงานยาวนาน รับข้อความ ภาพ วิดีโอ เสียง และ PDF รองรับการคิดและเครื่องมือในตัว พร้อมบริบทอินพุต 1,048,576 โทเค็น และเอาต์พุตสูงสุด 65,536 โทเค็น | |||
| glm-5.3 | 智谱 | $1.4000 | $4.4000 | ต่อ 1M tokens | Zhipu GLM-5.3 — flagship coding-and-agent model post-trained on the same base as GLM-5.2: a 50% gain on Zhipu's internal coding bench, open-source SOTA on Terminal-Bench 3.0 and Agents' Last Exam, and state-of-the-art CyberGym vulnerability-discovery results, with a 1M-token context window and up to 128K output tokens. Text in, text out. Supports multiple thinking modes, function calling, structured JSON output, streaming, context caching, and MCP tool integration. |
| hy3 | Tencent | $0.1480 | $0.5930 | ต่อ 1M tokens | Tencent Hunyuan 3 (Hy3) — โมเดล MoE ขนาด 295B พารามิเตอร์ (ทำงานจริง 21B) บริบทดั้งเดิม 256K และโหมดการคิดสามระดับ (fast / low / deep) โดดเด่นด้านเอเจนต์เขียนโค้ด การเข้าใจเอกสารยาว การรักษาบริบทหลายรอบ และเวิร์กโฟลว์เอเจนต์หลายขั้นตอน รองรับข้อความเท่านั้น |
| MiniMax-H3 | MiniMax | $0.080 | ต่อวินาที | MiniMax H3 (Hailuo 3.0) — โมเดลวิดีโอมัลติโหมดอเนกประสงค์แบบเปิดรุ่นใหม่ ที่สร้างเสียงสเตอริโอในตัวภายในรอบเดียว ที่ความละเอียด 768P หรือ 2K ความยาว 4-15 วินาที (รับเฉพาะจำนวนเต็ม) ที่ 24 fps ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและ/หรือเฟรมสุดท้าย และการสร้างจากสื่ออ้างอิงด้วยภาพ วิดีโอ หรือเสียง เพื่อกำหนดตัวละคร การเคลื่อนไหว มุมกล้อง สไตล์ น้ำเสียง หรือจังหวะการตัดต่อ ทั้งนี้ไม่สามารถใช้ภาพเป็นวิดีโอร่วมกับการสร้างจากสื่ออ้างอิงในคำขอเดียวกันได้ โมเดลรับวิดีโอ H.264/H.265 ภาพ JPG, JPEG, PNG, WEBP, HEIC และ HEIF และเสียง WAV หรือ MP3 โดยพรอมต์ยาวได้ถึง 7,000 อักขระ $0.08/วินาที ที่ 768P และ $0.13/วินาที ที่ 2K | |
| agnes-2.5-flash | Agnes AI | $0.0000 | ต่อ 1M tokens | Agnes AI Agnes 2.5 Flash — โมเดลเอเจนต์มัลติโหมดความเร็วสูง พร้อมบริบทอินพุต 512K และขีดจำกัดเอาต์พุตอ้างอิง 65.5K รองรับการแชท สตรีมมิง การเรียกใช้เครื่องมือ การเขียนโค้ด การให้เหตุผล บทสนทนาหลายรอบ การเข้าใจภาพ และเวิร์กโฟลว์เอเจนต์ | |
| agnes-video-v2.0 | Agnes AI | $0.000 | ต่อวินาที | Agnes AI Video V2.0 — โมเดลสร้างวิดีโอแบบอะซิงโครนัส รองรับข้อความเป็นวิดีโอ ภาพเป็นวิดีโอ คีย์เฟรมจากหลายภาพ และการเคลื่อนไหวแบบภาพยนตร์ พร้อมระดับเอาต์พุตมาตรฐาน 480p, 720p และ 1080p | |
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | ต่อคำขอ | MiniMax Hailuo 2.3 — ข้อความเป็นวิดีโอและภาพเป็นวิดีโอ ที่ผู้ให้บริการชูจุดเด่นเรื่องการทำตามคำสั่ง ที่ 24 fps โดย 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที 768p 6 วินาที = $0.28 | |
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | ต่อ 1M tokens | StepFun step-3.5-flash — โมเดลการให้เหตุผลเฉพาะข้อความ บริบท 256K มุ่งงานด้านตรรกะ คณิตศาสตร์ วิศวกรรมซอฟต์แวร์ และการวิจัยเชิงลึก ที่คุณภาพของการให้เหตุผลต้องมาพร้อมการทำงานที่รวดเร็วและเชื่อถือได้ เลือกความลึกของการให้เหตุผลได้รายคำขอผ่าน reasoning_effort (low / medium / high) รองรับการเรียกใช้เครื่องมือ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ หากต้องการอินพุตเป็นภาพหรือวิดีโอ ให้ใช้ step-3.7-flash |
| kimi-k2.7-code-highspeed | Moonshot | $1.9000 | $8.0000 | ต่อ 1M tokens | Moonshot Kimi K2.7 Code Highspeed — ระดับที่เน้นปริมาณงานของ K2.7 Code ให้บริการโมเดลเดียวกันที่ความเร็วราว 180 โทเค็นต่อวินาที และสูงสุด 260 โทเค็นในงานที่บริบทสั้น หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ การคิดเป็นสิ่งบังคับและจะเกิดข้อผิดพลาดหากปิด ส่วน tool_choice จำกัดไว้ที่ auto หรือ none เท่านั้น และต้องส่งต่อ reasoning_content ตลอดการเรียกใช้เครื่องมือหลายขั้นตอน |
| deepseek-v4-pro | DeepSeek | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | DeepSeek V4 Pro 0813 — the higher-capability DeepSeek V4 tier for coding, reasoning, and agentic work, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3-pro-image | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Google gemini-3-pro-image | |||
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | ต่อ 1 หมื่นอักขระ | โมเดลโคลนเสียงของ Xiaomi MiMo: ส่งตัวอย่างเสียงอ้างอิงเป็น data URL ในฟิลด์ voice (data:{mime};base64,...) แล้วโมเดลจะสังเคราะห์คำพูดด้วยเสียงนั้นโดยไม่ต้องผ่านขั้นตอนฝึกสอน กำกับข้อมูล หรือปรับจูนใด ๆ รองรับ MP3 (audio/mpeg) หรือ WAV โดยสตริงที่เข้ารหัส base64 ต้องไม่เกิน 10 MB ทั้งนี้ Xiaomi ไม่ได้ประกาศความยาวขั้นต่ำของเสียงอ้างอิง คำสั่งกำหนดสไตล์ด้วยภาษาธรรมชาติและแท็กเสียงแบบอินไลน์สืบทอดมาจาก mimo-v2.5-tts แต่ไม่มีการสตรีม คำขอจะทำงานในโหมดความเข้ากันได้และตอบกลับเมื่อสังเคราะห์เสร็จแล้วเท่านั้น | |
| qwen3-asr-flash | 阿里巴巴 | $0.1260 | ต่อชั่วโมงเสียง | Alibaba Qwen3-ASR-Flash — การรู้จำเสียงพูดที่สร้างบนโมเดลพื้นฐาน Qwen3 ซึ่งระบุภาษาที่กำลังพูดโดยอัตโนมัติและถอดเสียงได้ 11 ภาษา โดยตระกูล Qwen3-ASR ระบุภาษาจีนกลางไว้ควบคู่กับภาษาเสฉวน หมิ่นหนาน อู๋ และกวางตุ้ง รวมถึงสำเนียงภาษาอังกฤษหลายแบบ โมเดลรับไฟล์ aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma และ wmv ยาวไม่เกิน 5 นาทีและไม่เกิน 10 MB ต่อคำขอ อินพุต pcm ต้องเป็น 16 kHz ส่วนรูปแบบอื่นจะถูกสุ่มสัญญาณใหม่เป็น 16 kHz ก่อนการรู้จำ | |
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | ต่อ 1M tokens | StepFun step-3.5-flash-2603 — สแนปช็อต 256K ของ step-3.5-flash ที่ปรับจูนสำหรับงานเอเจนต์ เน้นประสิทธิภาพด้านโทเค็นและโหมดทำงานที่ใช้การอนุมานต่ำ พารามิเตอร์ reasoning_effort รับเฉพาะ low และ high ต่างจากโมเดลพื้นฐานที่รับสามระดับ โค้ดที่ส่ง medium จึงต้องปรับแก้ รองรับข้อความเท่านั้น พร้อมการเรียกใช้เครื่องมือ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ |
| stepaudio-2-asr-pro | StepFun | $0.3370 | ต่อชั่วโมงเสียง | StepFun StepAudio 2 ASR Pro — โมเดลรู้จำเสียงพูดขนาด 32B พารามิเตอร์ เป็นตัวเลือกที่เน้นความแม่นยำเป็นอันดับแรกในตระกูล ASR ของ StepFun ขณะที่ stepaudio-2.5-asr เป็นตัวเลือกที่เน้นความเร็วและต้นทุน รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ | |
| glm-5-turbo | 智谱 | $1.2000 | $4.0000 | ต่อ 1M tokens | Zhipu GLM-5-Turbo — GLM-5 รุ่นที่เน้นปริมาณงาน ปรับให้เหมาะกับเวิร์กโฟลว์เอเจนต์ ได้แก่ การเรียกใช้เครื่องมือและสกิลที่เสถียรขึ้นตลอดงานหลายขั้นตอน การรับมือคำสั่งที่ซับซ้อนและยาวต่อเนื่องได้ดีขึ้น และการทำงานตามกำหนดเวลาหรืองานที่รันยาว หน้าต่างบริบท 200K เอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้าและตอบข้อความออก รองรับโหมดการคิด การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| mimo-v2.5-asr | Xiaomi | $0.0740 | ต่อชั่วโมงเสียง | โมเดลรู้จำเสียงพูดของ Xiaomi MiMo ปรับให้เหมาะกับภาษาจีนและอังกฤษรวมถึงภาษาถิ่นจีน รองรับเสียงที่มีสัญญาณรบกวน เสียงระยะไกล เสียงหลายผู้พูด ตลอดจนการถอดเนื้อเพลง | |
| glm-tts | 智谱 | $0.2963 | ต่อ 1 หมื่นอักขระ | Zhipu GLM-TTS — การแปลงข้อความเป็นเสียงพูดที่สร้างบนสถาปัตยกรรมการสร้างสองขั้นตอนร่วมกับการเรียนรู้เสริมกำลังแบบ GRPO ซึ่งอนุมานอารมณ์และน้ำเสียงจากข้อความแวดล้อมแทนที่จะต้องกำกับอย่างชัดแจ้ง มาพร้อมเสียงในตัวเจ็ดเสียง (ค่าเริ่มต้นคือ tongtong ตามด้วย xiaochen, chuichui, jam, kazi, douji, luodo) ปรับความเร็วและความดังได้ รับได้สูงสุด 1,024 อักขระต่อคำขอ และสตรีมด้วยความหน่วงของเฟรมแรกต่ำกว่า 400 ms ผลลัพธ์เป็น wav หรือ pcm ที่อัตราสุ่มสัญญาณแนะนำ 24 kHz ส่วนการสตรีมรองรับเฉพาะ pcm | |
| gpt-5.5 | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT-5.5 — โมเดลการให้เหตุผลระดับแนวหน้าสำหรับการเขียนโค้ดที่ซับซ้อนและงานอาชีพ รองรับอินพุตข้อความและภาพ การเรียกฟังก์ชันและเครื่องมือในตัว หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และระดับความเข้มข้นของการให้เหตุผลตั้งแต่ none จนถึง xhigh | ||
| deepseek-v4-flash-legacy | DeepSeek | $0.1190 | $0.2370 | ต่อ 1M tokens | DeepSeek V4 Flash (legacy tier) — a lower-priced route to the V4 Flash model family. Input and output tokens are cheaper than on deepseek-v4-flash, while cache reads are priced higher, so prompt-caching-heavy workloads are usually cheaper on deepseek-v4-flash and low-reuse workloads are cheaper here. Responses may come from an earlier V4 Flash build. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | ต่อคำขอ | MiniMax Hailuo 2.3 Fast — ระดับที่เน้นความเร็วและต้นทุนของ Hailuo 2.3 มุ่งไปที่ภาพเป็นวิดีโอและความสมจริงของการเคลื่อนไหวเชิงฟิสิกส์ ที่ 24 fps โดย 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที 768p 6 วินาที = $0.19 | |
| qwen3.7-plus | 阿里巴巴 | $0.3400 | $1.3600 | ต่อ 1M tokens | Alibaba Qwen3.7-Plus — โมเดลเอเจนต์ลูกผสมแบบมัลติโหมด ที่รับรู้ฉากในโลกจริง อ่านหน้าจอและควบคุมส่วนติดต่อผู้ใช้แบบกราฟิก สร้างโค้ดจากภาพอ้างอิง และนำทางแบบครบวงจรภายในแอปบนมือถือ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท |
| stepaudio-2.5-asr-stream | StepFun | $0.1800 | ต่อชั่วโมงเสียง | StepFun StepAudio 2.5 ASR — 4B-parameter speech recognition model built on Multi-Token Prediction, transcribing five minutes of audio in about one second (RTF around 0.0053). Optimized for Chinese and English. Includes inverse text normalization, speaker identification, and dual-channel separation for call and meeting recordings. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | ต่อ 1M tokens | StepFun StepAudio 2.5 Chat — โมเดลเข้าใจเสียงพูดแบบครบวงจร รับเสียงหรือข้อความเข้าและตอบกลับเป็นข้อความ โดยอ่านสัญญาณกึ่งภาษาอย่างการลังเลหรือเสียงหัวเราะจากคลื่นเสียงโดยตรงแทนที่จะอ่านจากข้อความถอดเสียง รองรับการปรับแต่งบุคลิกอย่างละเอียด ครอบคลุมทั้งลักษณะตัวตน นิสัยการพูด และช่วงอารมณ์ ส่งเสียงเข้ามาในรูปแบบส่วนเนื้อหา input_audio บนเอนด์พอยต์ chat completions หากต้องการคำตอบเป็นเสียงพูด ให้ใช้โมเดล TTS |
| gemini-3.6-flash | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Google Gemini 3.6 Flash — a stable multimodal reasoning model that balances speed and intelligence for agentic and real-world tasks, with a 1,048,576-token input context and 65,536-token output limit. It accepts text, images, video, audio, and PDFs, and supports thinking, function calling, code execution, search grounding, structured output, and Computer Use (preview). Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5 | 智谱 | $1.0000 | $3.2000 | ต่อ 1M tokens | Zhipu GLM-5 — โมเดล MoE ขนาด 744B พารามิเตอร์ โดยทำงานจริง 40B ฝึกด้วยข้อมูล 28.5T โทเค็น และใช้ DeepSeek Sparse Attention พร้อมหน้าต่างบริบท 200K และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP |
| glm-5v-turbo | 智谱 | $1.2000 | $4.0000 | ต่อ 1M tokens | Zhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows. |
| kimi-k2.6 | Moonshot | $0.7600 | $3.1570 | ต่อ 1M tokens | Moonshot Kimi K2.6 — โมเดลอเนกประสงค์สำหรับการสนทนา การสร้างโค้ด การเข้าใจภาพ และงานเอเจนต์ โดยเขียนโค้ดระยะยาวและทำงานได้ด้วยตนเองดีกว่ารุ่นก่อนหน้า หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ (png, jpeg, webp, gif) และวิดีโอ (mp4, mov, webm และอื่น ๆ) ในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ โหมดการคิดเปิดไว้ตามค่าเริ่มต้นและปิดได้ ส่วน temperature ถูกตรึงไว้ที่ 1.0 เมื่อเปิดการคิด และ 0.6 เมื่อปิด |
| step-1o-audio | StepFun | $3.7070 | $8.8980 | ต่อ 1M tokens | StepFun step-1o-audio — โมเดลเสียงแบบครบวงจรรุ่นก่อนหน้า รองรับหลายภาษาและการเรียกใช้เครื่องมือ จำกัดที่ 30 นาทีต่อหนึ่งการโต้ตอบ ส่วนใหญ่ถูกแทนที่ด้วยตระกูล StepAudio 2.5 แล้ว แต่ยังคงไว้สำหรับงานที่สร้างบนโมเดลนี้อยู่แล้ว |
| glm-asr-2512 | 智谱 | $0.1440 | ต่อชั่วโมงเสียง | Zhipu GLM-ASR-2512 — โมเดลรู้จำเสียงพูดที่รายงานอัตราความผิดพลาดระดับอักขระ 0.0717 ครอบคลุมภาษาจีนกลางควบคู่กับภาษาเสฉวน กวางตุ้ง หมิ่นหนาน และอู๋ สำเนียงภาษาอังกฤษแบบอเมริกันและอังกฤษ รวมถึงภาษาอื่นอีกหลายสิบภาษา เช่น ฝรั่งเศส เยอรมัน ญี่ปุ่น เกาหลี สเปน และอาหรับ โมเดลรับมือกับคำพูดที่ปนหลายภาษา ศัพท์เฉพาะทาง และการพูดแบบภาษาปาก และรับพจนานุกรมกำหนดเองสำหรับคำศัพท์เฉพาะสาขาได้ เสียงจำกัดที่ 30 วินาทีและ 25 MB ต่อคำขอ รองรับการถอดเสียงทั้งแบบเป็นชุดและแบบสตรีมมิง | |
| gpt-5.4 | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT-5.4 — a frontier model for complex professional work and coding, priced well below GPT-5.5. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 1,050,000-token context window, and up to 128,000 output tokens. Prompts above 272,000 input tokens are repriced at 2x input and 1.5x output for the whole session. | ||
| gpt-5.6-sol | OpenAI | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | OpenAI GPT-5.6 Sol — โมเดลเรือธงของตระกูล GPT-5.6 สำหรับการให้เหตุผลระดับแนวหน้า งานอาชีพที่ซับซ้อน การเขียนโค้ด วิทยาศาสตร์ ความมั่นคงปลอดภัยไซเบอร์ และเวิร์กโฟลว์เอเจนต์ระยะยาว รองรับอินพุตข้อความและภาพ เครื่องมือในตัว หน้าต่างบริบท 1,050,000 โทเค็น เอาต์พุตสูงสุด 128,000 โทเค็น และการตั้งค่าการให้เหตุผลที่ลึกที่สุดในตระกูลนี้ | ||
| speech-2.8-hd | MiniMax | $1.0000 | ต่อ 1 หมื่นอักขระ | MiniMax speech-2.8-hd — ระดับความละเอียดสูงของตระกูลเสียง 2.8 วางตำแหน่งไว้ที่การถ่ายทอดอันสมจริงอย่างยิ่งพร้อมแท็กเสียง ครอบคลุม 40 ภาษาและ 7 อารมณ์ ระดับเสียงสูงต่ำ ความเร็วในการพูด ความดัง อัตราสุ่มสัญญาณ บิตเรต และรูปแบบเอาต์พุตปรับตั้งได้รายคำขอ ส่วนการสังเคราะห์ข้อความยาวรับได้สูงสุด 1 ล้านอักขระแบบอะซิงโครนัส หรือ 10,000 อักขระผ่านอินเทอร์เฟซสตรีมมิง | |
| claude-opus-4-8 | Anthropic | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Anthropic Claude Opus 4.8 — โมเดลการให้เหตุผลสมรรถนะสูงสำหรับการเขียนโค้ด เวิร์กโฟลว์เอเจนต์ การวิเคราะห์เชิงวิชาชีพ และงานที่ทำงานต่อเนื่องยาวนาน พัฒนาความน่าเชื่อถือ วิจารณญาณ ประสิทธิภาพการใช้เครื่องมือ การควบคุมคอมพิวเตอร์ และการให้เหตุผลกับเอกสารแบบมัลติโหมดเหนือกว่า Opus 4.7 พร้อมรองรับหน้าต่างบริบท 1,000,000 โทเค็น | ||
| happyhorse-1.1-r2v | 阿里巴巴 | $0.091 | ต่อวินาที | Alibaba HappyHorse 1.1 (R2V) — สร้างวิดีโอจากภาพอ้างอิงได้สูงสุด 9 ภาพ คงความสอดคล้องของตัวแบบ ฉาก และสไตล์ได้ดี พร้อมควบคุมมุมกล้อง 720P/1080P | |
| step-tts-2 | StepFun | $0.4000 | ต่อ 1 หมื่นอักขระ | StepFun step-tts-2 — การสังเคราะห์เสียงพูดแบบครบวงจรบนพื้นฐาน NTP ที่สร้างมาเพื่อจำลองสำเนียงได้อย่างแม่นยำ พูดภาษาจีน อังกฤษ จีนผสมอังกฤษ และญี่ปุ่น รวมถึงกวางตุ้งและเสฉวน กำกับอารมณ์และลีลาการพูดผ่านป้ายกำกับภาษาธรรมชาติ ส่วนการโคลนเสียงแบบ zero-shot ใช้เสียงอ้างอิงราว 10 วินาที โดยการควบคุมอารมณ์และสไตล์ยังส่งต่อไปยังเสียงที่โคลนได้โดยไม่มีค่าใช้จ่ายเพิ่ม เอาต์พุตเป็น wav, mp3, flac, opus หรือ pcm | |
| wan2.7-r2v | 阿里巴巴 | $0.080 | ต่อวินาที | Alibaba Wan2.7 (R2V) — สร้างวิดีโอจากสื่ออ้างอิง รองรับภาพ/วิดีโออ้างอิงผสมกันได้สูงสุด 5 ชิ้น พร้อมเสียงอ้างอิงน้ำเสียง และคงความสอดคล้องของตัวละคร อุปกรณ์ประกอบฉาก และฉากได้ดีขึ้น | |
| wan2.7-videoedit | 阿里巴巴 | $0.080 | ต่อวินาที | Alibaba Wan2.7 VideoEdit — ตัดต่อวิดีโอด้วยภาษาธรรมชาติ ทั้งเฉพาะจุดหรือทั้งคลิป แทนที่องค์ประกอบด้วยภาพอ้างอิง และจำลองการเคลื่อนไหว เอฟเฟกต์ และมุมกล้อง | |
| doubao-seedance-2-5-260628 | 字节跳动 | $10.7000 | $10.7000 | ต่อ 1M tokens | ByteDance Seedance 2.5 — โมเดลสายหลักของ Seedance ที่ยืดการสร้างครั้งเดียวออกไปเป็น 4-30 วินาทีที่ 24 fps แต่จำกัดความละเอียดไว้ที่ 480p และ 720p การสร้างจากสื่ออ้างอิงแบบมัลติโหมดรองรับภาพ 1-30 ภาพ วิดีโออ้างอิงสูงสุด 10 คลิป และเสียงอ้างอิงสูงสุด 10 ไฟล์ (แต่ละประเภทรวมกันไม่เกิน 30 วินาที) และต่างจากรุ่น 2.0 ตรงที่เสียงอ้างอิงใช้เดี่ยว ๆ ได้ นอกจากนี้ยังครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 |
| claude-opus-4-5 | Anthropic | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Anthropic Claude Opus 4.5 — a pinned dated snapshot of the Opus 4.5 release for workloads that need byte-stable behaviour. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| claude-opus-4-6 | Anthropic | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Anthropic Claude Opus 4.6 — the Opus generation for complex reasoning and agentic work, with a 1,000,000-token context window at standard pricing and up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer. | ||
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | ต่อ 1M tokens | Meituan LongCat-2.0 — โมเดล MoE แบบเปิดขนาด 1.6T พารามิเตอร์ พร้อมบริบทดั้งเดิม 1M สร้างมาเพื่อการเขียนโค้ดเชิงเอเจนต์และการใช้เครื่องมือระยะยาว เป็นโมเดลการให้เหตุผลที่รองรับข้อความเท่านั้น |
| doubao-seedance-2-0-mini-260615 | 字节跳动 | $1.4000 | $1.4000 | ต่อ 1M tokens | ByteDance Seedance 2.0 Mini — ระดับที่เบาและประหยัดงบประมาณของตระกูล Seedance 2.0 จำกัดที่ 480p และ 720p, 24 fps, 4-15 วินาที มาพร้อมชุดความสามารถตามเอกสารเดียวกับรุ่นอื่นในตระกูล ได้แก่ ข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 |
| gemini-2.5-flash-image | การคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคา | Google Gemini 2.5 Flash Image (Nano Banana) — a fast native image generation and editing model for creative workflows. It takes text and image input and returns images through the OpenAI-compatible chat completions endpoint, with a 65,536-token input limit and 32,768-token output limit. | |||
| MiniMax-M2.7-highspeed | MiniMax | $0.6000 | $2.4000 | ต่อ 1M tokens | MiniMax M2.7 Highspeed — โมเดล M2.7 ตัวเดิมที่ให้บริการที่ความเร็วราว 100 โทเค็นต่อวินาที สำหรับการเขียนโค้ดที่ความหน่วงต่ำและเวิร์กโฟลว์เอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ รองรับการเรียกใช้เครื่องมือ ส่วนการคิดเปิดอยู่เสมอและปิดไม่ได้ |
| doubao-seed-2-1-turbo-260628 | 字节跳动 | $0.4440 | $2.2220 | ต่อ 1M tokens | ByteDance Doubao Seed 2.1 Turbo — สายความหน่วงต่ำของตระกูล Seed 2.1 ที่ใช้กรอบสเปกเดียวกับรุ่น Pro ได้แก่ หน้าต่างบริบท 256K โดยรับอินพุตสูงสุด 256K เอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K) และงบประมาณห่วงโซ่ความคิด 256K ครอบคลุมการคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง แต่ไม่มีคำแนะนำให้ใช้ json_schema อย่างรุ่น Pro โมเดลรับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ ทั้งนี้ตระกูล 2.1 ไม่ได้ระบุความสามารถในการเข้าใจเสียงไว้ รองรับการแคชบริบททั้งแบบโดยปริยายและแบบระบุชัดเจน |