ราคาโมเดล AI จีน

ChinaAPI ให้บริการ DeepSeek, Qwen, GLM, Kimi และโมเดล AI จีนอื่น ๆ ผ่านเกตเวย์ที่เข้ากันได้กับ OpenAI ที่ https://api.chinaapi.ai/v1 ราคาทั้งหมดเป็นสกุลดอลลาร์สหรัฐ และแสดงตามหน่วยที่ผู้ให้บริการต้นทางกำหนด รายการเดียวกันนี้มีในรูปแบบ JSON ที่ /api/pricing

ราคาโมเดลสาธารณะ
โมเดลผู้ให้บริการอินพุตเอาต์พุตหน่วยคำอธิบาย
agnes-image-2.0-flashAgnes AI$0.000ต่อคำขอAgnes AI Image 2.0 Flash — โมเดลสร้างและแก้ไขภาพที่รวดเร็ว รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ โดยรับผลลัพธ์ได้ทั้งในรูปแบบ URL หรือข้อมูล Base64
kling-3.0-turbo快手$0.560ต่อคำขอKuaishou Kling 3.0 Turbo — ระดับคุ้มราคาของตระกูล Kling 3.0 สร้างวิดีโอ 720P หรือ 1080P (ค่าเริ่มต้น 720P) ความยาว 3-15 วินาที (ค่าเริ่มต้น 5) ในอัตราส่วน 16:9, 9:16 หรือ 1:1 จากพรอมต์หรือภาพเฟรมแรก เสียงในตัวมาพร้อมเสมอและไม่มีสวิตช์เปิดปิด เมื่อเทียบกับ kling-v3 รุ่นนี้ตัดระดับ 4K การควบคุมเฟรมสุดท้าย และการรับวิดีโอเป็นอินพุตออกไป เพื่อแลกกับความเร็วและต้นทุน 720p 5 วินาทีพร้อมเสียง ≈ $0.56
hy3Tencent$0.1540$0.6150ต่อ 1M tokensTencent Hunyuan 3 (Hy3) — โมเดล MoE ขนาด 295B พารามิเตอร์ (ทำงานจริง 21B) บริบทดั้งเดิม 256K และโหมดการคิดสามระดับ (fast / low / deep) โดดเด่นด้านเอเจนต์เขียนโค้ด การเข้าใจเอกสารยาว การรักษาบริบทหลายรอบ และเวิร์กโฟลว์เอเจนต์หลายขั้นตอน รองรับข้อความเท่านั้น
kimi-k2.6Moonshot$0.7600$3.1570ต่อ 1M tokensMoonshot Kimi K2.6 — โมเดลอเนกประสงค์สำหรับการสนทนา การสร้างโค้ด การเข้าใจภาพ และงานเอเจนต์ โดยเขียนโค้ดระยะยาวและทำงานได้ด้วยตนเองดีกว่ารุ่นก่อนหน้า หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ (png, jpeg, webp, gif) และวิดีโอ (mp4, mov, webm และอื่น ๆ) ในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ โหมดการคิดเปิดไว้ตามค่าเริ่มต้นและปิดได้ ส่วน temperature ถูกตรึงไว้ที่ 1.0 เมื่อเปิดการคิด และ 0.6 เมื่อปิด
LongCat-2.0Meituan$0.3000$1.2000ต่อ 1M tokensMeituan LongCat-2.0 — โมเดล MoE แบบเปิดขนาด 1.6T พารามิเตอร์ พร้อมบริบทดั้งเดิม 1M สร้างมาเพื่อการเขียนโค้ดเชิงเอเจนต์และการใช้เครื่องมือระยะยาว เป็นโมเดลการให้เหตุผลที่รองรับข้อความเท่านั้น
step-audio-2StepFun$1.5500$10.8500ต่อ 1M tokensStepFun step-audio-2 — โมเดลเสียงพูดแบบครบวงจรที่รับเสียงเข้าโดยตรงแทนการทำงานจากข้อความถอดเสียง น้ำเสียงและลีลาการพูดจึงคงอยู่ถึงขั้นการทำความเข้าใจของโมเดล คิดค่าบริการต่อโทเค็น โดยใช้อัตราอินพุตเดียวกับตระกูล StepAudio 2.5 แต่มีอัตราเอาต์พุตสูงกว่า StepFun ไม่ได้เผยแพร่หน้าความสามารถแยกสำหรับโมเดลนี้ กรุณาดูเอกสารด้านเสียงของแพลตฟอร์มเพื่อทราบชุดพารามิเตอร์ปัจจุบัน
step-tts-miniStepFun$0.1500ต่อ 1 หมื่นอักขระStepFun step-tts-mini — สมาชิกที่คุ้มค่าและความหน่วงต่ำในตระกูล TTS ของ StepFun ครอบคลุมภาษาเดียวกับ step-tts-2 (จีน อังกฤษ จีนผสมอังกฤษ และญี่ปุ่น รวมถึงกวางตุ้งและเสฉวน) โดยมีเสียงในตัวให้เลือกบางส่วน รองรับป้ายกำกับอารมณ์และลีลาการพูดเป็นภาษาธรรมชาติ และการโคลนเสียงแบบ zero-shot จากเสียงอ้างอิงราว 10 วินาที เอาต์พุตเป็น wav, mp3, flac, opus หรือ pcm
stepaudio-2.5-asrStepFun$0.0220ต่อชั่วโมงเสียงStepFun StepAudio 2.5 ASR — โมเดลรู้จำเสียงพูดขนาด 4B พารามิเตอร์ที่สร้างบน Multi-Token Prediction ถอดเสียงห้านาทีได้ในเวลาราวหนึ่งวินาที (RTF ประมาณ 0.0053) ปรับให้เหมาะกับภาษาจีนและอังกฤษ มาพร้อมการแปลงข้อความย้อนกลับให้เป็นรูปมาตรฐาน การระบุตัวผู้พูด และการแยกสองช่องสัญญาณสำหรับบันทึกการโทรและการประชุม รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ
stepaudio-2.5-ttsStepFun$0.8500ต่อ 1 หมื่นอักขระStepFun StepAudio 2.5 TTS — การแปลงข้อความเป็นเสียงพูดที่คำนึงถึงบริบท โดยส่งความเข้าใจไปตลอดทั้งไปป์ไลน์การสร้างแทนที่จะมองลีลาการพูดเป็นงานหลังการประมวลผล กำกับเสียง อารมณ์ และจังหวะด้วยภาษาธรรมชาติได้สองระดับ คือบริบทระดับทั้งคำขอและบริบทแบบอินไลน์สำหรับแต่ละช่วงข้อความ การโคลนเสียงแบบ zero-shot ใช้เสียงอ้างอิงราว 3 วินาที และสืบทอดชุดการควบคุมตามบริบททั้งหมด รับได้สูงสุด 1000 อักขระต่อคำขอ เอาต์พุตเป็น wav, mp3, flac หรือ opus
agnes-2.5-flashAgnes AI$0.0000ต่อ 1M tokensAgnes AI Agnes 2.5 Flash — โมเดลเอเจนต์มัลติโหมดความเร็วสูง พร้อมบริบทอินพุต 512K และขีดจำกัดเอาต์พุตอ้างอิง 65.5K รองรับการแชท สตรีมมิง การเรียกใช้เครื่องมือ การเขียนโค้ด การให้เหตุผล บทสนทนาหลายรอบ การเข้าใจภาพ และเวิร์กโฟลว์เอเจนต์
glm-5智谱$1.0000$3.2000ต่อ 1M tokensZhipu GLM-5 — โมเดล MoE ขนาด 744B พารามิเตอร์ โดยทำงานจริง 40B ฝึกด้วยข้อมูล 28.5T โทเค็น และใช้ DeepSeek Sparse Attention พร้อมหน้าต่างบริบท 200K และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP
mimo-v2.5-ttsXiaomi$0.0000ต่อ 1 หมื่นอักขระXiaomi MiMo v2.5 TTS — การแปลงข้อความเป็นเสียงพูดที่มีอารมณ์ พร้อมเสียงในตัวแปดเสียง เป็นภาษาจีนสี่เสียงและภาษาอังกฤษสี่เสียง (Mia, Chloe, Milo, Dean) ครอบคลุมภาษาจีนและอังกฤษ รวมถึงสไตล์ภาษาถิ่นตงเป่ย เสฉวน เหอหนาน และกวางตุ้ง กำกับลีลาการพูดได้สองทาง คือคำสั่งกำหนดสไตล์ด้วยภาษาธรรมชาติ และแท็กเสียงแบบอินไลน์สำหรับอารมณ์พื้นฐานและอารมณ์ผสม การหายใจ การถอนหายใจ และจังหวะ รวมถึงโหมดร้องเพลงที่มีเฉพาะโมเดลนี้ในตระกูล MiMo TTS ผลลัพธ์เป็น wav โมโนหรือ pcm16 ที่ 24 kHz และรองรับการสตรีมความหน่วงต่ำ ซึ่งต้องใช้ pcm16 บริบท 8K และเอาต์พุตสูงสุด 8K
step-3.5-flash-2603StepFun$0.1000$0.3000ต่อ 1M tokensStepFun step-3.5-flash-2603 — สแนปช็อต 256K ของ step-3.5-flash ที่ปรับจูนสำหรับงานเอเจนต์ เน้นประสิทธิภาพด้านโทเค็นและโหมดทำงานที่ใช้การอนุมานต่ำ พารามิเตอร์ reasoning_effort รับเฉพาะ low และ high ต่างจากโมเดลพื้นฐานที่รับสามระดับ โค้ดที่ส่ง medium จึงต้องปรับแก้ รองรับข้อความเท่านั้น พร้อมการเรียกใช้เครื่องมือ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์
step-asrStepFun$0.1500ต่อชั่วโมงเสียงStepFun step-asr — การรู้จำเสียงพูดอเนกประสงค์ ครอบคลุมภาษาจีน อังกฤษ และภาษาถิ่นจีน ใช้สำหรับการถอดเสียง การทำรายงานการประชุม การตรวจสอบคุณภาพสายสนทนา และการค้นหาด้วยเสียง รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ
step-asr-1.1-stream$0.4000ต่อชั่วโมงเสียง
doubao-seedance-2-0-mini-260615字节跳动$3.5000$3.5000ต่อ 1M tokensByteDance Seedance 2.0 Mini — ระดับที่เบาและประหยัดงบประมาณของตระกูล Seedance 2.0 จำกัดที่ 480p และ 720p, 24 fps, 4-15 วินาที มาพร้อมชุดความสามารถตามเอกสารเดียวกับรุ่นอื่นในตระกูล ได้แก่ ข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16
glm-5.2智谱$1.1200$3.5200ต่อ 1M tokensZhipu GLM-5.2 — โมเดลพื้นฐานเรือธงที่ออกแบบมาเฉพาะสำหรับงานเอเจนต์เขียนโค้ดระยะยาว ผ่านการฝึกเฉพาะทางนานหลายเดือน ไม่ใช่เพียงการขยายบริบท พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP
image-01MiniMax$0.004ต่อคำขอMiniMax image-01 — สร้างภาพจากข้อความผ่านเอนด์พอยต์ image_generation ของ MiniMax เอง คิดค่าบริการต่อภาพที่สร้าง ผู้ให้บริการจัดโมเดลนี้ไว้ในกลุ่มโมเดลรุ่นเก่า
mimo-v2.5-proXiaomi$0.4350$0.8700ต่อ 1M tokensXiaomi MiMo-V2.5-Pro — โมเดลเรือธงระดับล้านล้านพารามิเตอร์ (ทำงานจริง 42B) พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K ปรับจูนมาสำหรับงานเอเจนต์ที่ใช้งานหนัก รองรับการคิดเชิงลึก การเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการค้นหาเว็บ สร้างได้เฉพาะข้อความ ต่างจาก mimo-v2.5 ตรงที่รายการความสามารถของผู้ให้บริการไม่ได้ระบุการเข้าใจครบทุกโหมด
MiniMax-M2.7MiniMax$0.2880$1.1510ต่อ 1M tokensMiniMax M2.7 — โมเดลข้อความสำหรับการแชท การเขียนโค้ด งานสำนักงาน และงานเอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น และเอาต์พุตที่ความเร็วราว 60 โทเค็นต่อวินาที รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ รองรับการเรียกใช้เครื่องมือ ส่วนการคิดเปิดอยู่เสมอและปิดไม่ได้
doubao-seedance-2-0-260128字节跳动$7.0000$7.0000ต่อ 1M tokensByteDance Seedance 2.0 — เรือธงของตระกูล Seedance 2.0 และเป็นรุ่นเดียวในตระกูลที่ไปถึง 1080p และ 4K (ความลึกสี 10 บิต) เพิ่มเติมจาก 480p และ 720p ที่ 24 fps และ 4-15 วินาที ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 และดึงเฟรมปิดท้ายออกมาเป็นภาพนิ่งได้ คิดค่าบริการตามความละเอียดของเอาต์พุต
qwen3-asr-flash阿里巴巴$0.1235ต่อชั่วโมงเสียงAlibaba Qwen3-ASR-Flash — การรู้จำเสียงพูดที่สร้างบนโมเดลพื้นฐาน Qwen3 ซึ่งระบุภาษาที่กำลังพูดโดยอัตโนมัติและถอดเสียงได้ 11 ภาษา โดยตระกูล Qwen3-ASR ระบุภาษาจีนกลางไว้ควบคู่กับภาษาเสฉวน หมิ่นหนาน อู๋ และกวางตุ้ง รวมถึงสำเนียงภาษาอังกฤษหลายแบบ โมเดลรับไฟล์ aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma และ wmv ยาวไม่เกิน 5 นาทีและไม่เกิน 10 MB ต่อคำขอ อินพุต pcm ต้องเป็น 16 kHz ส่วนรูปแบบอื่นจะถูกสุ่มสัญญาณใหม่เป็น 16 kHz ก่อนการรู้จำ
qwen3.6-flash阿里巴巴$0.1850$1.1080ต่อ 1M tokensAlibaba Qwen3.6-Flash — โมเดลภาษาเชิงภาพที่ทำงานเร็ว ซึ่งผู้ให้บริการชูจุดเด่นด้านการเขียนโค้ดเชิงเอเจนต์และปัญญาเชิงพื้นที่ พร้อมการพัฒนาที่ชัดเจนในการระบุตำแหน่งและตรวจจับวัตถุ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 65,536 โทเค็น และงบประมาณห่วงโซ่ความคิด 131,072 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชันและการแคชบริบท
step-tts-2StepFun$0.4000ต่อ 1 หมื่นอักขระStepFun step-tts-2 — การสังเคราะห์เสียงพูดแบบครบวงจรบนพื้นฐาน NTP ที่สร้างมาเพื่อจำลองสำเนียงได้อย่างแม่นยำ พูดภาษาจีน อังกฤษ จีนผสมอังกฤษ และญี่ปุ่น รวมถึงกวางตุ้งและเสฉวน กำกับอารมณ์และลีลาการพูดผ่านป้ายกำกับภาษาธรรมชาติ ส่วนการโคลนเสียงแบบ zero-shot ใช้เสียงอ้างอิงราว 10 วินาที โดยการควบคุมอารมณ์และสไตล์ยังส่งต่อไปยังเสียงที่โคลนได้โดยไม่มีค่าใช้จ่ายเพิ่ม เอาต์พุตเป็น wav, mp3, flac, opus หรือ pcm
stepaudio-2.5-asr-stream$0.1800ต่อชั่วโมงเสียง
wan2.7-t2v阿里巴巴$0.092ต่อวินาทีAlibaba Wan2.7 (T2V) — ข้อความเป็นวิดีโอ พร้อมการแสดงอารมณ์ที่ดีขึ้น อารมณ์ที่ละเอียดอ่อน แอ็กชันที่เข้มข้น และการตัดภาพที่ดราม่า สร้างไฟล์ MP4 แบบ H.264 ที่ 720P หรือ 1080P ความยาว 2-15 วินาที (ค่าเริ่มต้น 5 วินาที) ในอัตราส่วน 16:9, 9:16, 1:1, 4:3 หรือ 3:4 จากพรอมต์ยาวได้ถึง 5,000 อักขระ เสียงถูกใส่มาให้ตามค่าเริ่มต้น หากไม่ระบุ audio_url โมเดลจะแต่งดนตรีประกอบหรือเอฟเฟกต์เสียงที่เข้ากันให้เอง หรือจะส่งไฟล์ wav หรือ mp3 ความยาว 2-30 วินาทีมาแทนก็ได้
agnes-video-v2.0Agnes AI$0.000ต่อวินาทีAgnes AI Video V2.0 — โมเดลสร้างวิดีโอแบบอะซิงโครนัส รองรับข้อความเป็นวิดีโอ ภาพเป็นวิดีโอ คีย์เฟรมจากหลายภาพ และการเคลื่อนไหวแบบภาพยนตร์ พร้อมระดับเอาต์พุตมาตรฐาน 480p, 720p และ 1080p
glm-5.1智谱$1.1200$3.5200ต่อ 1M tokensZhipu GLM-5.1 — โมเดลพื้นฐานเรือธงที่สร้างมาเพื่อการทำงานอัตโนมัติต่อเนื่องยาวนาน โดยผู้ให้บริการระบุว่าสามารถทำงานเดียวต่อเนื่องโดยไม่ต้องมีคนดูแลได้นานถึง 8 ชั่วโมง ครอบคลุมทั้งการวางแผน การลงมือทำ การทดสอบ และการปรับปรุงซ้ำ หน้าต่างบริบท 200K เอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้าและตอบข้อความออก รองรับโหมดการคิดหลายแบบ การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP
happyhorse-1.1-t2v阿里巴巴$0.083ต่อวินาทีAlibaba HappyHorse 1.1 (T2V) — ข้อความเป็นวิดีโอ พร้อมการเข้าใจความหมาย การควบคุมมุมกล้อง และการสร้างภาพเคลื่อนไหวที่ดีขึ้น ให้วิดีโอ 720P/1080P ที่ลื่นไหล มีรายละเอียด และสมจริงตามหลักฟิสิกส์
kimi-k3Moonshot$2.7400$13.6990ต่อ 1M tokensMoonshot Kimi K3 — โมเดลเรือธงขนาด 2.8 ล้านล้านพารามิเตอร์ สำหรับการเขียนโค้ดระยะยาว งานความรู้แบบครบวงจร และการให้เหตุผลเชิงลึก พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 1,048,576 โทเค็น (ค่าเริ่มต้น 131,072) โมเดลรับข้อความ ภาพแบบ base64 และวิดีโอ แล้วตอบกลับเป็นข้อความ การคิดเปิดอยู่เสมอ โดยเลือก reasoning_effort ได้เป็น low, high หรือ max (ค่าเริ่มต้นคือ max) และ temperature ถูกตรึงไว้ที่ 1.0 รองรับการเรียกใช้เครื่องมือที่กำหนดเองและการโหลดเครื่องมือแบบไดนามิก
kling-v3快手$0.420ต่อคำขอKuaishou Kling 3.0 — ข้อความเป็นวิดีโอและภาพเป็นวิดีโอ พร้อมเสียงในตัวและความสอดคล้องขององค์ประกอบที่ดีขึ้น คลิปยาว 3-15 วินาที (ค่าเริ่มต้น 5) ในอัตราส่วน 16:9, 9:16 หรือ 1:1 โดยเลือกระดับผ่าน mode ได้แก่ std สำหรับ 720P, pro สำหรับ 1080P และ 4k สำหรับ 4K แบบเนทีฟ เสียงต้องเปิดเองผ่าน sound=on และค่าเริ่มต้นคือปิด ส่วนภาพเป็นวิดีโอรับเฟรมแรกพร้อมเฟรมท้ายที่จะใส่หรือไม่ก็ได้ เริ่มต้นที่ $0.083/วินาที (720p)
mimo-v2.5-tts-voicedesignXiaomi$0.0000ต่อ 1 หมื่นอักขระโมเดลออกแบบเสียงของ Xiaomi MiMo: อธิบายเสียงที่ต้องการเป็นภาษาธรรมชาติผ่าน instructions แล้วโมเดลจะสังเคราะห์คำพูดด้วยเสียงที่ออกแบบไว้นั้น
glm-5v-turbo智谱$0.7690$3.3850ต่อ 1M tokensZhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows.
mimo-v2.5-tts-voicecloneXiaomi$0.0000ต่อ 1 หมื่นอักขระโมเดลโคลนเสียงของ Xiaomi MiMo: ส่งตัวอย่างเสียงอ้างอิงเป็น data URL ในฟิลด์ voice (data:{mime};base64,...) แล้วโมเดลจะสังเคราะห์คำพูดด้วยเสียงนั้นโดยไม่ต้องผ่านขั้นตอนฝึกสอน กำกับข้อมูล หรือปรับจูนใด ๆ รองรับ MP3 (audio/mpeg) หรือ WAV โดยสตริงที่เข้ารหัส base64 ต้องไม่เกิน 10 MB ทั้งนี้ Xiaomi ไม่ได้ประกาศความยาวขั้นต่ำของเสียงอ้างอิง คำสั่งกำหนดสไตล์ด้วยภาษาธรรมชาติและแท็กเสียงแบบอินไลน์สืบทอดมาจาก mimo-v2.5-tts แต่ไม่มีการสตรีม คำขอจะทำงานในโหมดความเข้ากันได้และตอบกลับเมื่อสังเคราะห์เสร็จแล้วเท่านั้น
MiniMax-Hailuo-02MiniMax$0.280ต่อคำขอMiniMax Hailuo 02 — การสร้างวิดีโอราคาประหยัดที่ครอบคลุมทั้งข้อความเป็นวิดีโอและภาพเป็นวิดีโอ ที่ 24 fps โดย 512p และ 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที ระดับ 512p เป็นจุดเริ่มต้นของตระกูล Hailuo
step-1o-audioStepFun$3.8500$9.2400ต่อ 1M tokensStepFun step-1o-audio — โมเดลเสียงแบบครบวงจรรุ่นก่อนหน้า รองรับหลายภาษาและการเรียกใช้เครื่องมือ จำกัดที่ 30 นาทีต่อหนึ่งการโต้ตอบ ส่วนใหญ่ถูกแทนที่ด้วยตระกูล StepAudio 2.5 แล้ว แต่ยังคงไว้สำหรับงานที่สร้างบนโมเดลนี้อยู่แล้ว
step-3.5-flashStepFun$0.1000$0.3000ต่อ 1M tokensStepFun step-3.5-flash — โมเดลการให้เหตุผลเฉพาะข้อความ บริบท 256K มุ่งงานด้านตรรกะ คณิตศาสตร์ วิศวกรรมซอฟต์แวร์ และการวิจัยเชิงลึก ที่คุณภาพของการให้เหตุผลต้องมาพร้อมการทำงานที่รวดเร็วและเชื่อถือได้ เลือกความลึกของการให้เหตุผลได้รายคำขอผ่าน reasoning_effort (low / medium / high) รองรับการเรียกใช้เครื่องมือ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ หากต้องการอินพุตเป็นภาพหรือวิดีโอ ให้ใช้ step-3.7-flash
step-3.7-flashStepFun$0.2000$1.1500ต่อ 1M tokensStepFun step-3.7-flash — โมเดล MoE แบบเบาบางที่มีพารามิเตอร์รวม 198B และทำงานจริง 11B บริบทดั้งเดิม 256K และเข้าใจภาพกับวิดีโอได้ในตัวควบคู่กับข้อความ เลือกความลึกของการให้เหตุผลได้รายคำขอผ่าน reasoning_effort (low / medium / high) และรองรับการเรียกใช้เครื่องมือหลายขั้นตอนอย่างเชื่อถือได้ เอาต์พุตแบบมีโครงสร้างตาม JSON Schema สตรีมมิง และการแคชพรอมต์ ปรับจูนมาสำหรับงานเอเจนต์และการเขียนโค้ด
step-image-edit-2StepFun$0.004ต่อคำขอStepFun Step Image Edit 2 — โมเดลรวมการสร้างภาพจากข้อความและการแก้ไขภาพ ด้วยพารามิเตอร์ต่ำกว่า 6B แต่เทียบเท่าโมเดลแก้ไขภาพแบบเปิดน้ำหนักในระดับ 12B-20B ทำงานแก้ไขหนึ่งครั้งเสร็จภายในหนึ่งถึงสองวินาที และออกแบบมาเพื่อการรีทัชแบบโต้ตอบที่ความหน่วงต่ำ รองรับ 256x256, 512x512, 768x768, 1024x1024, 1280x800 และ 800x1280 พร้อมพรอมต์เชิงลบและโหมดปรับข้อความให้เหมาะสม สร้างได้หนึ่งภาพต่อหนึ่งคำขอ ให้บริการผ่านเอนด์พอยต์ images ที่เข้ากันได้กับ OpenAI
doubao-seedance-2-0-fast-260128字节跳动$5.6000$5.6000ต่อ 1M tokensByteDance Seedance 2.0 Fast — การสร้างวิดีโอที่คุ้มค่า มาพร้อมชุดความสามารถครบถ้วนของ Seedance 2.0 แต่จำกัดที่ 480p และ 720p, 24 fps, 4-15 วินาที ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การสร้างจากสื่ออ้างอิงแบบมัลติโหมดด้วยภาพ 1-9 ภาพ และวิดีโออ้างอิงสูงสุด 3 คลิปรวมกันไม่เกิน 15 วินาที การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ทั้งนี้เสียงอ้างอิงต้องมาพร้อมภาพหรือวิดีโอเสมอ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16 โดย 480p 5 วินาที ≈ $0.26
qwen3-tts-flash阿里巴巴$0.1231ต่อ 1 หมื่นอักขระAlibaba Qwen3-TTS-Flash — การแปลงข้อความเป็นเสียงพูดที่มีความหน่วงต่ำ พร้อมเสียงในตัวที่มีอารมณ์ 17 เสียง ครอบคลุมภาษาจีน อังกฤษ เยอรมัน อิตาลี โปรตุเกส สเปน ญี่ปุ่น เกาหลี ฝรั่งเศส และรัสเซีย พร้อมโหมดอัตโนมัติสำหรับข้อความที่ปนหลายภาษา และการออกเสียงตามภาษาถิ่น โมเดลรับข้อความได้สูงสุด 512 โทเค็นต่อคำขอ และรองรับการสังเคราะห์ทั้งแบบสตรีมมิงและไม่สตรีมมิง
gemini-3.6-flashGoogleการคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคาGoogle Gemini 3.6 Flash — โมเดลการให้เหตุผลแบบมัลติโหมดรุ่นเสถียร ที่สมดุลระหว่างความเร็วกับความฉลาดสำหรับงานเอเจนต์และงานในโลกจริง มีบริบทอินพุต 1,048,576 โทเค็น และขีดจำกัดเอาต์พุต 65,536 โทเค็น รับข้อความ ภาพ วิดีโอ เสียง และ PDF พร้อมรองรับการคิด การเรียกฟังก์ชัน การรันโค้ด การอ้างอิงจากการค้นหา เอาต์พุตแบบมีโครงสร้าง และ Computer Use (พรีวิว)
step-audio-r1.5StepFun$1.5500$16.2750ต่อ 1M tokensStepFun step-audio-r1.5 — โมเดลเสียงพูดแบบครบวงจรในตระกูลเดียวกับ step-audio-2 ใช้อัตราอินพุตเดียวกันแต่คิดค่าเอาต์พุตสูงกว่า 50% StepFun ไม่ได้เผยแพร่หน้าความสามารถแยกสำหรับโมเดลนี้ กรุณาดูเอกสารด้านเสียงของแพลตฟอร์มเพื่อทราบชุดพารามิเตอร์ปัจจุบัน
stepaudio-2.5-chatStepFun$1.5000$3.5000ต่อ 1M tokensStepFun StepAudio 2.5 Chat — โมเดลเข้าใจเสียงพูดแบบครบวงจร รับเสียงหรือข้อความเข้าและตอบกลับเป็นข้อความ โดยอ่านสัญญาณกึ่งภาษาอย่างการลังเลหรือเสียงหัวเราะจากคลื่นเสียงโดยตรงแทนที่จะอ่านจากข้อความถอดเสียง รองรับการปรับแต่งบุคลิกอย่างละเอียด ครอบคลุมทั้งลักษณะตัวตน นิสัยการพูด และช่วงอารมณ์ ส่งเสียงเข้ามาในรูปแบบส่วนเนื้อหา input_audio บนเอนด์พอยต์ chat completions หากต้องการคำตอบเป็นเสียงพูด ให้ใช้โมเดล TTS
wan2.7-r2v阿里巴巴$0.092ต่อวินาทีAlibaba Wan2.7 (R2V) — สร้างวิดีโอจากสื่ออ้างอิง รองรับภาพ/วิดีโออ้างอิงผสมกันได้สูงสุด 5 ชิ้น พร้อมเสียงอ้างอิงน้ำเสียง และคงความสอดคล้องของตัวละคร อุปกรณ์ประกอบฉาก และฉากได้ดีขึ้น
doubao-seed-2-1-pro-260628字节跳动$0.9230$4.6150ต่อ 1M tokensByteDance Doubao Seed 2.1 Pro — โมเดลเอเจนต์เรือธงของ Doubao สำหรับงานที่ใช้จริง ครอบคลุมการคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง ซึ่งผู้ให้บริการแนะนำให้ใช้โหมด json_schema หน้าต่างบริบท 256K โดยรับอินพุตสูงสุด 256K เอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K) และงบประมาณห่วงโซ่ความคิด 256K โมเดลรับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ ทั้งนี้ตระกูล 2.1 ไม่ได้ระบุความสามารถในการเข้าใจเสียงไว้ รองรับการแคชบริบททั้งแบบโดยปริยายและแบบระบุชัดเจน รวมถึงแคชส่วนนำและแคชระดับเซสชัน
mimo-v2.5Xiaomi$0.1400$0.2800ต่อ 1M tokensXiaomi MiMo-V2.5 — โมเดลที่รองรับครบทุกโหมดโดยกำเนิด พร้อมบริบท 1M และเอาต์พุตสูงสุด 128K เข้าใจภาพ วิดีโอ เสียง และข้อความได้ในโมเดลเดียว รองรับการคิดเชิงลึก การเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการค้นหาเว็บ พร้อมความสามารถเอเจนต์ครบทุกโหมด
MiniMax-Hailuo-2.3-FastMiniMax$0.190ต่อคำขอMiniMax Hailuo 2.3 Fast — ระดับที่เน้นความเร็วและต้นทุนของ Hailuo 2.3 มุ่งไปที่ภาพเป็นวิดีโอและความสมจริงของการเคลื่อนไหวเชิงฟิสิกส์ ที่ 24 fps โดย 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที 768p 6 วินาที = $0.19
MiniMax-M3MiniMaxการคิดค่าบริการแบบขั้นบันได ดูที่หน้าราคาMiniMax M3 — โมเดลเขียนโค้ดแบบมัลติโหมดระดับแนวหน้า สำหรับการให้เหตุผลเชิงเอเจนต์ การใช้เครื่องมือ และการทำงานตามโครงสร้างที่กำหนด พร้อมหน้าต่างบริบท 1,000,000 โทเค็น โมเดลรับข้อความ ภาพขนาดไม่เกิน 10 MB และวิดีโอไม่เกิน 50 MB แบบส่งมาในคำขอ หรือไม่เกิน 512 MB ผ่าน Files API แล้วตอบกลับเป็นข้อความ รองรับการเรียกใช้เครื่องมือ โดยการคิดเป็นตัวเลือกไม่ใช่สิ่งที่เปิดอยู่ตลอด
qwen3.6-plus阿里巴巴$0.4000$2.4000ต่อ 1M tokensAlibaba Qwen3.6-Plus — โมเดลสมดุลสำหรับการให้เหตุผลทั่วไปและการใช้เครื่องมือ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 65,536 โทเค็น และงบประมาณห่วงโซ่ความคิด 81,920 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง การค้นหาเว็บ การเติมข้อความต่อจากส่วนนำ และการแคชบริบท
wan2.7-image-pro阿里巴巴$0.060ต่อคำขอAlibaba Wan 2.7 Image Pro — ระดับมืออาชีพของตระกูลภาพ Wan 2.7 ครอบคลุมการสร้างภาพจากข้อความ ชุดภาพตามลำดับ การแก้ไขภาพ และการสร้างภาพโดยอ้างอิงจากหลายภาพ พร้อมการทำตามพรอมต์ที่ดีขึ้น การสร้างภาพจากข้อความไปถึง 4K (4096x4096) พร้อมระดับ 1K และ 2K และขนาดกำหนดเองตั้งแต่ 768x768 ส่วนโหมดแก้ไขและโหมดชุดภาพจำกัดที่ 2K โมเดลรับภาพอ้างอิงได้สูงสุด 9 ภาพ (JPEG, JPG, PNG, BMP, WEBP; ด้านละ 240-8,000 พิกเซล ภาพละไม่เกิน 20 MB) อัตราส่วนภาพตั้งแต่ 1:8 ถึง 8:1 และพรอมต์ยาวได้ถึง 5,000 อักขระ ผลลัพธ์เป็น PNG
doubao-seedream-4-5-251128字节跳动$0.038ต่อคำขอByteDance Doubao Seedream 4.5 — สร้างภาพจากข้อความและภาพเป็นภาพ พร้อมการหลอมรวมหลายภาพ ให้ผลลัพธ์เป็นภาพเดียวหรือชุดภาพที่สัมพันธ์กัน โหมดภาพเดียวรับเพียงพรอมต์อย่างเดียว ภาพอ้างอิงหนึ่งภาพ หรือภาพอ้างอิง 2-14 ภาพ ส่วนโหมดชุดภาพ (sequential_image_generation=auto) คืนภาพได้สูงสุด 15 ภาพจากข้อความ สูงสุด 14 ภาพจากภาพอ้างอิงเพียงภาพเดียว หรือเป็นชุดจากภาพอ้างอิง 2-14 ภาพ โดยจำนวนอินพุตบวกเอาต์พุตต้องไม่เกิน 15 รองรับเอาต์พุต 2K และ 4K และคืนค่าเป็น JPEG ตามค่าเริ่มต้น ในรูปแบบ URL หรือ base64 ส่วนการแก้ไขเชิงโต้ตอบด้วยพิกัดมีเฉพาะใน Seedream 5.0 pro เท่านั้น
happyhorse-1.1-r2v阿里巴巴$0.083ต่อวินาทีAlibaba HappyHorse 1.1 (R2V) — สร้างวิดีโอจากภาพอ้างอิงได้สูงสุด 9 ภาพ คงความสอดคล้องของตัวแบบ ฉาก และสไตล์ได้ดี พร้อมควบคุมมุมกล้อง 720P/1080P
mimo-v2.5-asrXiaomi$0.0740ต่อชั่วโมงเสียงโมเดลรู้จำเสียงพูดของ Xiaomi MiMo ปรับให้เหมาะกับภาษาจีนและอังกฤษรวมถึงภาษาถิ่นจีน รองรับเสียงที่มีสัญญาณรบกวน เสียงระยะไกล เสียงหลายผู้พูด ตลอดจนการถอดเนื้อเพลง
step-2x-largeStepFun$0.016ต่อคำขอStepFun Step 2X Large — สร้างภาพจากข้อความด้วยพื้นผิวสมจริง และความสามารถเขียนตัวอักษรจีนและอังกฤษลงในภาพที่โดดเด่นเป็นพิเศษ รองรับ 256x256, 512x512, 768x768, 1024x1024, 1280x800 และ 800x1280 สร้างได้หนึ่งภาพต่อหนึ่งคำขอ ให้บริการผ่านเอนด์พอยต์ images ที่เข้ากันได้กับ OpenAI
deepseek-v4-flashDeepSeek$0.1400$0.2800ต่อ 1M tokensDeepSeek V4 Flash — ระดับ DeepSeek V4 ที่เร็วและรองรับการทำงานพร้อมกันได้สูง สำหรับการแชท การช่วยเขียนโค้ด และลูปเอเจนต์ พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 384K ทำงานได้ทั้งโหมดการคิด (ค่าเริ่มต้น) และโหมดไม่คิด รองรับการเรียกใช้เครื่องมือและเอาต์พุตแบบ JSON รับข้อความเข้า ตอบข้อความออก
kimi-k2.7-code-highspeedMoonshot$1.7810$7.3970ต่อ 1M tokensMoonshot Kimi K2.7 Code Highspeed — ระดับที่เน้นปริมาณงานของ K2.7 Code ให้บริการโมเดลเดียวกันที่ความเร็วราว 180 โทเค็นต่อวินาที และสูงสุด 260 โทเค็นในงานที่บริบทสั้น หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ การคิดเป็นสิ่งบังคับและจะเกิดข้อผิดพลาดหากปิด ส่วน tool_choice จำกัดไว้ที่ auto หรือ none เท่านั้น และต้องส่งต่อ reasoning_content ตลอดการเรียกใช้เครื่องมือหลายขั้นตอน
MiniMax-Hailuo-2.3MiniMax$0.280ต่อคำขอMiniMax Hailuo 2.3 — ข้อความเป็นวิดีโอและภาพเป็นวิดีโอ ที่ผู้ให้บริการชูจุดเด่นเรื่องการทำตามคำสั่ง ที่ 24 fps โดย 768p มีให้เลือกเป็นคลิป 6 วินาทีหรือ 10 วินาที ส่วน 1080p อยู่ที่ 6 วินาที 768p 6 วินาที = $0.28
MiniMax-M2.7-highspeedMiniMax$0.5750$2.3010ต่อ 1M tokensMiniMax M2.7 Highspeed — โมเดล M2.7 ตัวเดิมที่ให้บริการที่ความเร็วราว 100 โทเค็นต่อวินาที สำหรับการเขียนโค้ดที่ความหน่วงต่ำและเวิร์กโฟลว์เอเจนต์ พร้อมหน้าต่างบริบท 204,800 โทเค็น รองรับข้อความเท่านั้น โดย API รับบล็อกเนื้อหาที่เป็นข้อความและการเรียกใช้เครื่องมือ ไม่รับภาพหรือวิดีโอ รองรับการเรียกใช้เครื่องมือ ส่วนการคิดเปิดอยู่เสมอและปิดไม่ได้
speech-2.8-hdMiniMax$0.5385ต่อ 1 หมื่นอักขระMiniMax speech-2.8-hd — ระดับความละเอียดสูงของตระกูลเสียง 2.8 วางตำแหน่งไว้ที่การถ่ายทอดอันสมจริงอย่างยิ่งพร้อมแท็กเสียง ครอบคลุม 40 ภาษาและ 7 อารมณ์ ระดับเสียงสูงต่ำ ความเร็วในการพูด ความดัง อัตราสุ่มสัญญาณ บิตเรต และรูปแบบเอาต์พุตปรับตั้งได้รายคำขอ ส่วนการสังเคราะห์ข้อความยาวรับได้สูงสุด 1 ล้านอักขระแบบอะซิงโครนัส หรือ 10,000 อักขระผ่านอินเทอร์เฟซสตรีมมิง
wan2.7-i2v阿里巴巴$0.092ต่อวินาทีAlibaba Wan 2.7 Image-to-Video — ครอบคลุมการสร้างจากเฟรมแรก การเปลี่ยนภาพระหว่างเฟรมแรกกับเฟรมสุดท้าย และการต่อเนื่องจากคลิปเดิม สร้างวิดีโอ 720P หรือ 1080P (ค่าเริ่มต้น 1080P) ความยาว 2-15 วินาที ค่าเริ่มต้น 5 วินาที จากพรอมต์ยาวได้ถึง 5,000 อักขระ (พรอมต์เชิงลบไม่เกิน 500 อักขระ) สามารถส่งไฟล์ mp3 หรือ wav ความยาว 2-30 วินาทีเป็น driving_audio ได้ หากไม่ส่งเสียงมา โมเดลจะสร้างดนตรีประกอบหรือเอฟเฟกต์เสียงที่เข้ากันให้เอง เสียงที่ยาวกว่าคลิปจะถูกตัดทิ้ง ส่วนเสียงที่สั้นกว่าจะทำให้ช่วงท้ายเงียบ
agnes-2.0-flashAgnes AI$0.0000ต่อ 1M tokensAgnes AI Agnes 2.0 Flash — โมเดลเอเจนต์มัลติโหมดความเร็วสูง พร้อมบริบทอินพุต 256K และขีดจำกัดเอาต์พุตอ้างอิง 64K รองรับการแชท สตรีมมิง การเรียกใช้เครื่องมือ การเขียนโค้ด การให้เหตุผล การเข้าใจภาพ และเวิร์กโฟลว์เอเจนต์
doubao-seed-2-1-turbo-260628字节跳动$0.4620$2.3080ต่อ 1M tokensByteDance Doubao Seed 2.1 Turbo — สายความหน่วงต่ำของตระกูล Seed 2.1 ที่ใช้กรอบสเปกเดียวกับรุ่น Pro ได้แก่ หน้าต่างบริบท 256K โดยรับอินพุตสูงสุด 256K เอาต์พุตสูงสุด 256K โทเค็น (ค่าเริ่มต้น 4K) และงบประมาณห่วงโซ่ความคิด 256K ครอบคลุมการคิดเชิงลึก การสร้างข้อความ การเข้าใจแบบมัลติโหมด การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง แต่ไม่มีคำแนะนำให้ใช้ json_schema อย่างรุ่น Pro โมเดลรับข้อความ ภาพ และวิดีโอ แล้วตอบกลับเป็นข้อความ ทั้งนี้ตระกูล 2.1 ไม่ได้ระบุความสามารถในการเข้าใจเสียงไว้ รองรับการแคชบริบททั้งแบบโดยปริยายและแบบระบุชัดเจน
doubao-seedream-5-0-260128字节跳动$0.034ต่อคำขอByteDance Doubao Seedream 5.0-lite — สร้างภาพจากข้อความและภาพเป็นภาพ พร้อมการสร้างสรรค์ที่ควบคุมได้อย่างชาญฉลาดขึ้น การค้นคืนข้อมูลแบบเรียลไทม์ และความสอดคล้องของตัวแบบที่ดีขึ้น (ความละเอียด 2K ขึ้นไป)
happyhorse-1.1-i2v阿里巴巴$0.083ต่อวินาทีAlibaba HappyHorse 1.1 (I2V) — ภาพเป็นวิดีโอ พร้อมพื้นผิวที่ดีขึ้น ความสอดคล้องของตัวละครข้ามคลิป ความลื่นไหลของการเคลื่อนไหว และการซิงก์ภาพกับเสียง 720P/1080P
step-1o-turbo-visionStepFun$0.4000$1.2800ต่อ 1M tokensStepFun step-1o-turbo-vision — การเข้าใจภาพและวิดีโอพร้อมการสร้างข้อความที่รวดเร็ว บริบท 32K รับอินพุตเป็นข้อความ ภาพ และวิดีโอ แต่ตอบกลับเป็นข้อความเท่านั้น เป็นโมเดลด้านการมองเห็นรุ่นก่อนที่คงไว้เพื่อความเข้ากันได้ โดย step-3.7-flash รองรับอินพุตชนิดเดียวกันด้วยบริบท 256K และเลือกระดับความลึกของการให้เหตุผลได้ ควรให้ด้านยาวของภาพไม่เกิน 4096 พิกเซลเพื่อการรู้จำที่แม่นยำ
wan2.7-videoedit阿里巴巴$0.092ต่อวินาทีAlibaba Wan2.7 VideoEdit — ตัดต่อวิดีโอด้วยภาษาธรรมชาติ ทั้งเฉพาะจุดหรือทั้งคลิป แทนที่องค์ประกอบด้วยภาพอ้างอิง และจำลองการเคลื่อนไหว เอฟเฟกต์ และมุมกล้อง
agnes-image-2.1-flashAgnes AI$0.000ต่อคำขอAgnes AI Image 2.1 Flash — โมเดลสร้างและแก้ไขภาพที่เน้นรายละเอียดสำหรับฉากที่มีความหนาแน่นของข้อมูลสูง รองรับข้อความเป็นภาพ ภาพเป็นภาพ และการประกอบหลายภาพ ด้วยขนาดและอัตราส่วนภาพที่ยืดหยุ่นตั้งแต่ 1K ถึง 4K
doubao-seedance-2-5-260628字节跳动$10.7000$10.7000ต่อ 1M tokensByteDance Seedance 2.5 — โมเดลสายหลักของ Seedance ที่ยืดการสร้างครั้งเดียวออกไปเป็น 4-30 วินาทีที่ 24 fps แต่จำกัดความละเอียดไว้ที่ 480p และ 720p การสร้างจากสื่ออ้างอิงแบบมัลติโหมดรองรับภาพ 1-30 ภาพ วิดีโออ้างอิงสูงสุด 10 คลิป และเสียงอ้างอิงสูงสุด 10 ไฟล์ (แต่ละประเภทรวมกันไม่เกิน 30 วินาที) และต่างจากรุ่น 2.0 ตรงที่เสียงอ้างอิงใช้เดี่ยว ๆ ได้ นอกจากนี้ยังครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและจากเฟรมแรก-เฟรมสุดท้าย การตัดต่อวิดีโอ การขยายความยาววิดีโอ การสร้างพร้อมเสียง และเครื่องมือค้นหาเว็บ ผลลัพธ์เป็น MP4 ในอัตราส่วน 21:9, 16:9, 4:3, 1:1, 3:4 หรือ 9:16
glm-tts智谱$0.3077ต่อ 1 หมื่นอักขระZhipu GLM-TTS — การแปลงข้อความเป็นเสียงพูดที่สร้างบนสถาปัตยกรรมการสร้างสองขั้นตอนร่วมกับการเรียนรู้เสริมกำลังแบบ GRPO ซึ่งอนุมานอารมณ์และน้ำเสียงจากข้อความแวดล้อมแทนที่จะต้องกำกับอย่างชัดแจ้ง มาพร้อมเสียงในตัวเจ็ดเสียง (ค่าเริ่มต้นคือ tongtong ตามด้วย xiaochen, chuichui, jam, kazi, douji, luodo) ปรับความเร็วและความดังได้ รับได้สูงสุด 1,024 อักขระต่อคำขอ และสตรีมด้วยความหน่วงของเฟรมแรกต่ำกว่า 400 ms ผลลัพธ์เป็น wav หรือ pcm ที่อัตราสุ่มสัญญาณแนะนำ 24 kHz ส่วนการสตรีมรองรับเฉพาะ pcm
kling-v3-omni快手$0.420ต่อคำขอKling 3.0 Omni — สร้างวิดีโอจากหลายภาพอ้างอิง ราคาที่แสดงเป็นของระดับ std (720p, 5 วินาที, ไม่มีเสียง, ไม่มีวิดีโออ้างอิง) คำขอที่ไม่ได้ระบุ mode จะใช้ระดับ pro ซึ่งเป็นค่าเริ่มต้นของต้นทาง และถูกคิดค่าบริการ 1.33 เท่า หรือราว $0.56 สำหรับคลิป 5 วินาทีเดียวกัน ส่วน 4k คิด 5 เท่า กรุณาส่ง mode=std เพื่อให้ถูกคิดตามราคาที่แสดง
MiniMax-H3MiniMax$0.080ต่อวินาทีMiniMax H3 (Hailuo 3.0) — โมเดลวิดีโอมัลติโหมดอเนกประสงค์แบบเปิดรุ่นใหม่ ที่สร้างเสียงสเตอริโอในตัวภายในรอบเดียว ที่ความละเอียด 768P หรือ 2K ความยาว 4-15 วินาที (รับเฉพาะจำนวนเต็ม) ที่ 24 fps ครอบคลุมข้อความเป็นวิดีโอ ภาพเป็นวิดีโอจากเฟรมแรกและ/หรือเฟรมสุดท้าย และการสร้างจากสื่ออ้างอิงด้วยภาพ วิดีโอ หรือเสียง เพื่อกำหนดตัวละคร การเคลื่อนไหว มุมกล้อง สไตล์ น้ำเสียง หรือจังหวะการตัดต่อ ทั้งนี้ไม่สามารถใช้ภาพเป็นวิดีโอร่วมกับการสร้างจากสื่ออ้างอิงในคำขอเดียวกันได้ โมเดลรับวิดีโอ H.264/H.265 ภาพ JPG, JPEG, PNG, WEBP, HEIC และ HEIF และเสียง WAV หรือ MP3 โดยพรอมต์ยาวได้ถึง 7,000 อักขระ $0.08/วินาที ที่ 768P และ $0.13/วินาที ที่ 2K
step-asr-1.1StepFun$0.3500ต่อชั่วโมงเสียงStepFun step-asr-1.1 — โมเดลรู้จำเสียงพูดอเนกประสงค์รุ่นปรับปรุงในตระกูล step-asr ครอบคลุมภาษาจีน อังกฤษ และภาษาถิ่นจีน รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ
deepseek-v4-proDeepSeek$0.4350$0.8700ต่อ 1M tokensDeepSeek V4 Pro — ระดับที่มีความสามารถสูงกว่าของ DeepSeek V4 สำหรับการเขียนโค้ด การให้เหตุผล และงานเอเจนต์ พร้อมหน้าต่างบริบท 1M โทเค็น และเอาต์พุตสูงสุด 384K ทำงานได้ทั้งโหมดการคิด (ค่าเริ่มต้น) และโหมดไม่คิด รองรับการเรียกใช้เครื่องมือและเอาต์พุตแบบ JSON รับข้อความเข้า ตอบข้อความออก
glm-5-turbo智谱$1.2000$4.0000ต่อ 1M tokensZhipu GLM-5-Turbo — GLM-5 รุ่นที่เน้นปริมาณงาน ปรับให้เหมาะกับเวิร์กโฟลว์เอเจนต์ ได้แก่ การเรียกใช้เครื่องมือและสกิลที่เสถียรขึ้นตลอดงานหลายขั้นตอน การรับมือคำสั่งที่ซับซ้อนและยาวต่อเนื่องได้ดีขึ้น และการทำงานตามกำหนดเวลาหรืองานที่รันยาว หน้าต่างบริบท 200K เอาต์พุตสูงสุด 128K โทเค็น รับข้อความเข้าและตอบข้อความออก รองรับโหมดการคิด การเรียกฟังก์ชัน เอาต์พุต JSON แบบมีโครงสร้าง สตรีมมิง การแคชบริบท และการเชื่อมต่อเครื่องมือ MCP
glm-asr-2512智谱$0.1440ต่อชั่วโมงเสียงZhipu GLM-ASR-2512 — โมเดลรู้จำเสียงพูดที่รายงานอัตราความผิดพลาดระดับอักขระ 0.0717 ครอบคลุมภาษาจีนกลางควบคู่กับภาษาเสฉวน กวางตุ้ง หมิ่นหนาน และอู๋ สำเนียงภาษาอังกฤษแบบอเมริกันและอังกฤษ รวมถึงภาษาอื่นอีกหลายสิบภาษา เช่น ฝรั่งเศส เยอรมัน ญี่ปุ่น เกาหลี สเปน และอาหรับ โมเดลรับมือกับคำพูดที่ปนหลายภาษา ศัพท์เฉพาะทาง และการพูดแบบภาษาปาก และรับพจนานุกรมกำหนดเองสำหรับคำศัพท์เฉพาะสาขาได้ เสียงจำกัดที่ 30 วินาทีและ 25 MB ต่อคำขอ รองรับการถอดเสียงทั้งแบบเป็นชุดและแบบสตรีมมิง
kimi-k2.7-codeMoonshot$0.7600$3.1570ต่อ 1M tokensMoonshot Kimi K2.7 Code — โมเดลเฉพาะทางด้านการเขียนโค้ดของ Kimi ซึ่งผู้ให้บริการวัดผลว่าทำตามคำสั่งได้ดีขึ้นและเขียนโค้ดระยะยาวได้ดีกว่า K2.6 พร้อมลดการคิดเกินจำเป็นลงราว 30% โดยเฉลี่ย หน้าต่างบริบท 256K เอาต์พุตค่าเริ่มต้น 32,768 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอในรูปแบบเนื้อหา base64 แล้วตอบกลับเป็นข้อความ การคิดเป็นสิ่งบังคับและจะเกิดข้อผิดพลาดหากปิด ส่วน tool_choice จำกัดไว้ที่ auto หรือ none เท่านั้น และต้องส่งต่อ reasoning_content ตลอดการเรียกใช้เครื่องมือหลายขั้นตอน
qwen3.7-max阿里巴巴$2.5000$7.5000ต่อ 1M tokensAlibaba Qwen3.7-Max — เรือธงแบบปิดซอร์ส วางตำแหน่งไว้สำหรับการเขียนโปรแกรม งานสำนักงานและงานเพิ่มผลิตภาพ รวมถึงการทำงานอัตโนมัติในระยะยาว มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น รับข้อความเข้า ตอบข้อความออก รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท
qwen3.7-plus阿里巴巴$0.3080$1.2310ต่อ 1M tokensAlibaba Qwen3.7-Plus — โมเดลเอเจนต์ลูกผสมแบบมัลติโหมด ที่รับรู้ฉากในโลกจริง อ่านหน้าจอและควบคุมส่วนติดต่อผู้ใช้แบบกราฟิก สร้างโค้ดจากภาพอ้างอิง และนำทางแบบครบวงจรภายในแอปบนมือถือ มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท
qwen3.8-max阿里巴巴$1.9900$5.9700ต่อ 1M tokensAlibaba Qwen3.8-Max — โมเดล MoE เรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ และเป็นโมเดลที่เก่งที่สุดในตระกูล Qwen โดยผู้ให้บริการระบุว่าพัฒนาขึ้นมากในด้านการเขียนโค้ดและงานสำนักงาน มีหน้าต่างบริบท 1,000,000 โทเค็น (อินพุตสูงสุด 991,808 และ 983,616 ในโหมดการคิด) เอาต์พุตสูงสุด 131,072 โทเค็น และงบประมาณห่วงโซ่ความคิด 262,144 โทเค็น โมเดลรับข้อความ ภาพ และวิดีโอเป็นอินพุต แล้วตอบกลับเป็นข้อความ รองรับการเรียกฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการแคชบริบท
speech-2.8-turboMiniMax$0.3077ต่อ 1 หมื่นอักขระMiniMax speech-2.8-turbo — ระดับความหน่วงต่ำของตระกูลเสียง 2.8 ที่ยอมสละการถ่ายทอดอันสมจริงอย่างยิ่งของรุ่น HD เพื่อแลกกับการสังเคราะห์ที่เร็วขึ้นโดยยังคงความลื่นไหลตามธรรมชาติ ครอบคลุม 40 ภาษาและ 7 อารมณ์เท่ากับรุ่น HD ปรับตั้งระดับเสียงสูงต่ำ ความเร็วในการพูด ความดัง อัตราสุ่มสัญญาณ บิตเรต และรูปแบบเอาต์พุตได้ และรับข้อความได้สูงสุด 1 ล้านอักขระแบบอะซิงโครนัส หรือ 10,000 อักขระผ่านอินเทอร์เฟซสตรีมมิง
stepaudio-2-asr-proStepFun$0.3500ต่อชั่วโมงเสียงStepFun StepAudio 2 ASR Pro — โมเดลรู้จำเสียงพูดขนาด 32B พารามิเตอร์ เป็นตัวเลือกที่เน้นความแม่นยำเป็นอันดับแรกในตระกูล ASR ของ StepFun ขณะที่ stepaudio-2.5-asr เป็นตัวเลือกที่เน้นความเร็วและต้นทุน รับไฟล์อัปโหลด ogg, mp3 และ wav โดยเอาต์พุตข้อความถอดเสียงไม่คิดค่าบริการ
wan2.7-image阿里巴巴$0.031ต่อคำขอAlibaba Wan2.7 Image — สร้างภาพจากข้อความ แก้ไขภาพ สร้างภาพโดยอ้างอิงจากหลายภาพ แก้ไขแบบโต้ตอบ พร้อมการเขียนตัวอักษรและการทำตามคำสั่งที่แข็งแกร่ง