Giá mô hình AI Trung Quốc

ChinaAPI cung cấp DeepSeek, Qwen, GLM, Kimi và các mô hình AI Trung Quốc khác qua một cổng tương thích OpenAI tại https://api.chinaapi.ai/v1. Mọi mức giá đều tính bằng đô la Mỹ, theo đơn vị mà nhà cung cấp thượng nguồn niêm yết. Cùng danh sách này có ở dạng JSON tại /api/pricing.

Giá các mô hình công khai
Mô hìnhNhà cung cấpĐầu vàoĐầu raĐơn vịMô tả
wan2.7-t2v阿里巴巴$0.092mỗi giâyAlibaba Wan2.7 (T2V) — tạo video từ văn bản với diễn xuất được nâng cấp, cảm xúc tinh tế, hành động mạnh và các cú cắt máy quay giàu kịch tính. Mô hình tạo MP4 H.264 ở 720P hoặc 1080P, dài 2-15 giây (mặc định 5 giây), theo tỷ lệ 16:9, 9:16, 1:1, 4:3 hoặc 3:4, từ prompt tối đa 5000 ký tự. Âm thanh được thêm vào theo mặc định: nếu không có audio_url, mô hình tự soạn nhạc nền hoặc hiệu ứng âm thanh phù hợp, hoặc bạn có thể cung cấp một bản wav hay mp3 dài 2-30 giây thay thế.
agnes-image-2.0-flashAgnes AI$0.000mỗi lượt gọiAgnes AI Image 2.0 Flash — mô hình tạo và chỉnh sửa hình ảnh nhanh cho văn bản thành hình ảnh, hình ảnh thành hình ảnh và ghép nhiều ảnh, kết quả tạo ra có thể nhận dưới dạng URL hoặc dữ liệu Base64.
doubao-seedance-2-0-mini-260615字节跳动$3.5000$3.5000mỗi 1M tokensByteDance Seedance 2.0 Mini — bậc nhẹ và tiết kiệm ngân sách của dòng Seedance 2.0, giới hạn ở 480p và 720p, 24 fps, 4-15 giây. Mô hình mang cùng bộ tính năng được ghi nhận như phần còn lại của dòng: văn bản sang video, hình ảnh sang video từ khung hình đầu và từ khung đầu-khung cuối, tạo từ tham chiếu đa phương thức với 1-9 ảnh và tối đa 3 video tham chiếu tổng cộng 15 giây, chỉnh sửa video, kéo dài video, tạo kèm âm thanh và một công cụ tìm kiếm web; tham chiếu âm thanh phải đi kèm một ảnh hoặc video. Trả về MP4 ở 21:9, 16:9, 4:3, 1:1, 3:4 hoặc 9:16.
step-3.5-flash-2603StepFun$0.1000$0.3000mỗi 1M tokensStepFun step-3.5-flash-2603 — bản chụp 256K của step-3.5-flash được tinh chỉnh cho tác nhân, tối ưu cho hiệu quả token và chế độ vận hành suy luận thấp. Tham số reasoning_effort chỉ nhận low và high, trong khi mô hình gốc nhận ba mức, nên mã đang gửi medium phải được điều chỉnh. Chỉ xử lý văn bản; hỗ trợ gọi công cụ, đầu ra có cấu trúc theo JSON Schema, truyền phát và bộ nhớ đệm prompt.
deepseek-v4-flashDeepSeek$0.1400$0.2800mỗi 1M tokensDeepSeek V4 Flash — bậc DeepSeek V4 nhanh, chịu tải song song cao, dành cho trò chuyện, hỗ trợ lập trình và vòng lặp tác nhân, với cửa sổ ngữ cảnh 1M token và đầu ra tối đa 384K. Mô hình chạy ở cả chế độ tư duy (mặc định) lẫn không tư duy, hỗ trợ gọi công cụ và đầu ra JSON. Vào văn bản, ra văn bản.
doubao-seedream-4-5-251128字节跳动$0.038mỗi lượt gọiByteDance Doubao Seedream 4.5 — tạo hình ảnh từ văn bản và hình ảnh thành hình ảnh với khả năng hợp nhất nhiều ảnh, cho ra một ảnh đơn hoặc một bộ ảnh liên quan. Chế độ ảnh đơn nhận riêng một prompt, một ảnh tham chiếu, hoặc 2-14 ảnh tham chiếu; chế độ theo bộ (sequential_image_generation=auto) trả về tối đa 15 ảnh từ văn bản, tối đa 14 ảnh từ một ảnh tham chiếu duy nhất, hoặc một bộ từ 2-14 ảnh tham chiếu với điều kiện tổng đầu vào cộng đầu ra không vượt quá 15. Mô hình hỗ trợ đầu ra 2K và 4K, mặc định trả về JPEG dưới dạng URL hoặc base64. Việc chỉnh sửa tương tác theo tọa độ chỉ có riêng ở Seedream 5.0 pro.
mimo-v2.5-ttsXiaomi$0.0000mỗi 10 nghìn ký tựXiaomi MiMo v2.5 TTS — chuyển văn bản thành giọng nói giàu biểu cảm với tám giọng dựng sẵn, bốn giọng tiếng Trung và bốn giọng tiếng Anh (Mia, Chloe, Milo, Dean), bao phủ tiếng Trung và tiếng Anh cùng các phong cách phương ngữ Đông Bắc, Tứ Xuyên, Hà Nam và Quảng Đông. Cách thể hiện được điều khiển theo hai hướng: chỉ dẫn phong cách bằng ngôn ngữ tự nhiên, và thẻ âm thanh nội tuyến cho cảm xúc cơ bản lẫn cảm xúc phức hợp, hơi thở, tiếng thở dài và nhịp điệu, bao gồm cả chế độ hát chỉ riêng mô hình này có trong dòng MiMo TTS. Trả về wav hoặc pcm16 đơn kênh ở 24 kHz và hỗ trợ truyền phát độ trễ thấp, vốn đòi hỏi pcm16. Ngữ cảnh 8K và đầu ra tối đa 8K.
MiniMax-H3MiniMax$0.080mỗi giâyMiniMax H3 (Hailuo 3.0) — mô hình video đa phương thức đa dụng nguồn mở thế hệ mới, tạo âm thanh stereo gốc ngay trong một lượt xử lý, ở 768P hoặc 2K, dài 4-15 giây (chỉ nhận số nguyên), 24 fps. Mô hình bao phủ văn bản sang video, hình ảnh sang video từ khung hình đầu và/hoặc khung hình cuối, và tạo từ tham chiếu bằng hình ảnh, video hoặc âm thanh để định hình nhân vật, chuyển động, góc máy, phong cách, giọng nói hay nhịp dựng; không thể kết hợp hình ảnh sang video với tạo từ tham chiếu trong cùng một yêu cầu. Mô hình nhận video H.264/H.265, ảnh JPG, JPEG, PNG, WEBP, HEIC và HEIF, cùng âm thanh WAV hoặc MP3, với prompt tối đa 7000 ký tự. $0,08/giây ở 768P, $0,13/giây ở 2K.
doubao-seed-2-1-pro-260628字节跳动$0.9230$4.6150mỗi 1M tokensByteDance Doubao Seed 2.1 Pro — mô hình tác nhân chủ lực của Doubao cho công việc chạy thật, bao phủ tư duy sâu, sinh văn bản, hiểu đa phương thức, gọi công cụ và đầu ra có cấu trúc, mà với đầu ra có cấu trúc nhà cung cấp khuyến nghị dùng chế độ json_schema. Cửa sổ ngữ cảnh 256K với đầu vào tối đa 256K, tối đa 256K token đầu ra (mặc định 4K) và hạn mức 256K token cho chuỗi suy luận. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản; dòng 2.1 không liệt kê khả năng hiểu âm thanh. Hỗ trợ bộ nhớ đệm ngữ cảnh cả ngầm định lẫn tường minh, bao gồm bộ nhớ đệm tiền tố và bộ nhớ đệm phiên.
image-01MiniMax$0.004mỗi lượt gọiMiniMax image-01 — tạo hình ảnh từ văn bản qua endpoint image_generation gốc của MiniMax. Tính phí theo mỗi ảnh được tạo. Nhà cung cấp liệt kê mô hình này trong nhóm mô hình cũ.
MiniMax-M2.7MiniMax$0.2880$1.1510mỗi 1M tokensMiniMax M2.7 — mô hình văn bản cho trò chuyện, lập trình, công việc văn phòng và các tác vụ tác nhân, với cửa sổ ngữ cảnh 204.800 token và tốc độ đầu ra khoảng 60 token mỗi giây. Chỉ xử lý văn bản: API nhận các khối nội dung văn bản và lệnh gọi công cụ, không nhận hình ảnh hay video. Hỗ trợ gọi công cụ; tư duy luôn bật và không thể tắt.
qwen3.6-flash阿里巴巴$0.1850$1.1080mỗi 1M tokensAlibaba Qwen3.6-Flash — mô hình ngôn ngữ-thị giác tốc độ cao mà nhà cung cấp nhấn mạnh ở lập trình theo hướng tác nhân và ở trí tuệ không gian, với những cải thiện rõ rệt trong việc định vị và phát hiện đối tượng. Cửa sổ ngữ cảnh 1.000.000 token (tối đa 991.808 token đầu vào, 983.616 ở chế độ tư duy), tối đa 65.536 token đầu ra và hạn mức 131.072 token cho chuỗi suy luận. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản. Hỗ trợ gọi hàm và bộ nhớ đệm ngữ cảnh.
step-audio-r1.5StepFun$1.5500$16.2750mỗi 1M tokensStepFun step-audio-r1.5 — mô hình giọng nói đầu-cuối cùng dòng với step-audio-2, dùng chung mức giá đầu vào nhưng tính phí đầu ra cao hơn 50%. StepFun không công bố trang năng lực riêng cho mô hình này; hãy tham khảo tài liệu âm thanh của nền tảng để biết bộ tham số hiện hành.
stepaudio-2.5-ttsStepFun$0.8500mỗi 10 nghìn ký tựStepFun StepAudio 2.5 TTS — mô hình chuyển văn bản thành giọng nói theo ngữ cảnh, mang phần hiểu đi suốt toàn bộ quy trình sinh thay vì coi cách thể hiện là khâu hậu kỳ. Giọng, cảm xúc và nhịp điệu được chỉ dẫn bằng ngôn ngữ tự nhiên ở hai cấp: ngữ cảnh toàn cục cho cả yêu cầu và ngữ cảnh nội tuyến cho từng đoạn riêng lẻ. Nhân bản giọng nói zero-shot cần khoảng 3 giây âm thanh tham chiếu và kế thừa trọn bộ điều khiển theo ngữ cảnh. Nhận tối đa 1000 ký tự cho mỗi yêu cầu; xuất ra wav, mp3, flac hoặc opus.
kling-v3快手$0.420mỗi lượt gọiKuaishou Kling 3.0 — văn bản sang video và hình ảnh sang video với âm thanh gốc và khả năng giữ nhất quán các yếu tố tốt hơn. Clip dài 3-15 giây (mặc định 5) theo tỷ lệ 16:9, 9:16 hoặc 1:1, với bậc chất lượng chọn qua mode: std cho 720P, pro cho 1080P và 4k cho 4K gốc. Âm thanh phải bật thủ công qua sound=on và mặc định là tắt; hình ảnh sang video nhận một khung hình đầu kèm khung hình cuối tùy chọn. Từ $0,083/giây (720p).
step-audio-2StepFun$1.5500$10.8500mỗi 1M tokensStepFun step-audio-2 — mô hình giọng nói đầu-cuối tiếp nhận trực tiếp âm thanh thay vì làm việc từ bản ghi văn bản, nhờ đó ngữ điệu và cách thể hiện được giữ lại trong phần hiểu của mô hình. Tính phí theo token, dùng chung mức giá đầu vào với dòng StepAudio 2.5 nhưng giá đầu ra cao hơn. StepFun không công bố trang năng lực riêng cho mô hình này; hãy tham khảo tài liệu âm thanh của nền tảng để biết bộ tham số hiện hành.
step-tts-2StepFun$0.4000mỗi 10 nghìn ký tựStepFun step-tts-2 — mô hình tổng hợp giọng nói đầu-cuối dựa trên NTP, được xây dựng để tái tạo chính xác chất giọng vùng miền. Mô hình nói tiếng Trung, tiếng Anh, pha trộn Trung-Anh và tiếng Nhật, cùng tiếng Quảng Đông và tiếng Tứ Xuyên. Cảm xúc và cách thể hiện được điều khiển qua nhãn bằng ngôn ngữ tự nhiên, còn nhân bản giọng nói zero-shot cần khoảng 10 giây âm thanh tham chiếu, với các điều khiển cảm xúc và phong cách được chuyển sang giọng nhân bản mà không tính thêm phí. Xuất ra wav, mp3, flac, opus hoặc pcm.
hy3Tencent$0.1540$0.6150mỗi 1M tokensTencent Hunyuan 3 (Hy3) — mô hình MoE 295B tham số (21B hoạt động), ngữ cảnh 256K gốc, ba chế độ tư duy (fast / low / deep). Mạnh ở tác nhân lập trình, hiểu tài liệu dài, giữ ngữ cảnh qua nhiều lượt và quy trình tác nhân nhiều bước. Chỉ xử lý văn bản.
doubao-seedance-2-0-260128字节跳动$7.0000$7.0000mỗi 1M tokensByteDance Seedance 2.0 — mô hình chủ lực của dòng Seedance 2.0 và là thành viên duy nhất đạt tới 1080p và 4K (độ sâu 10 bit) bên cạnh 480p và 720p, ở 24 fps và 4-15 giây. Mô hình bao phủ văn bản sang video, hình ảnh sang video từ khung hình đầu và từ khung đầu-khung cuối, tạo từ tham chiếu đa phương thức với 1-9 ảnh và tối đa 3 video tham chiếu tổng cộng 15 giây, chỉnh sửa video, kéo dài video, tạo kèm âm thanh và một công cụ tìm kiếm web; tham chiếu âm thanh phải đi kèm một ảnh hoặc video. Trả về MP4 ở 21:9, 16:9, 4:3, 1:1, 3:4 hoặc 9:16, và có thể lấy khung hình cuối dưới dạng ảnh. Tính phí theo độ phân giải đầu ra.
doubao-seedance-2-5-260628字节跳动$10.7000$10.7000mỗi 1M tokensByteDance Seedance 2.5 — mô hình dòng chính của Seedance, kéo dài một lần tạo lên 4-30 giây ở 24 fps trong khi giới hạn độ phân giải ở 480p và 720p. Việc tạo từ tham chiếu đa phương thức mở rộng đến 1-30 ảnh, tối đa 10 video tham chiếu và tối đa 10 đoạn âm thanh tham chiếu (mỗi loại tổng cộng 30 giây), và khác với dòng 2.0, một tham chiếu âm thanh có thể đứng một mình. Mô hình cũng bao phủ văn bản sang video, hình ảnh sang video từ khung hình đầu và từ khung đầu-khung cuối, chỉnh sửa video, kéo dài video, tạo kèm âm thanh và một công cụ tìm kiếm web. Trả về MP4 ở 21:9, 16:9, 4:3, 1:1, 3:4 hoặc 9:16.
kimi-k2.7-code-highspeedMoonshot$1.7810$7.3970mỗi 1M tokensMoonshot Kimi K2.7 Code Highspeed — bậc thông lượng của K2.7 Code, phục vụ cùng một mô hình ở khoảng 180 token mỗi giây và lên tới 260 trong các tác vụ ngữ cảnh ngắn. Cửa sổ ngữ cảnh 256K, mặc định 32.768 token đầu ra. Mô hình nhận văn bản, hình ảnh và video dưới dạng nội dung base64, trả về văn bản. Tư duy là bắt buộc và sẽ báo lỗi nếu bị tắt; tool_choice chỉ nhận auto hoặc none, còn reasoning_content phải được mang theo xuyên suốt các lượt gọi công cụ nhiều bước.
MiniMax-M2.7-highspeedMiniMax$0.5750$2.3010mỗi 1M tokensMiniMax M2.7 Highspeed — vẫn là mô hình M2.7 nhưng được phục vụ ở khoảng 100 token mỗi giây, dành cho lập trình độ trễ thấp và các quy trình tác nhân, với cửa sổ ngữ cảnh 204.800 token. Chỉ xử lý văn bản: API nhận các khối nội dung văn bản và lệnh gọi công cụ, không nhận hình ảnh hay video. Hỗ trợ gọi công cụ; tư duy luôn bật và không thể tắt.
stepaudio-2.5-asrStepFun$0.0220mỗi giờ âm thanhStepFun StepAudio 2.5 ASR — mô hình nhận dạng giọng nói 4B tham số xây dựng trên Multi-Token Prediction, phiên âm năm phút âm thanh trong khoảng một giây (RTF khoảng 0,0053). Tối ưu cho tiếng Trung và tiếng Anh. Bao gồm chuẩn hóa văn bản ngược, nhận diện người nói và tách hai kênh cho bản ghi cuộc gọi và cuộc họp. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
doubao-seed-2-1-turbo-260628字节跳动$0.4620$2.3080mỗi 1M tokensByteDance Doubao Seed 2.1 Turbo — làn độ trễ thấp của dòng Seed 2.1, dùng chung khuôn khổ với bản Pro: cửa sổ ngữ cảnh 256K với đầu vào tối đa 256K, tối đa 256K token đầu ra (mặc định 4K) và hạn mức 256K token cho chuỗi suy luận. Mô hình bao phủ tư duy sâu, sinh văn bản, hiểu đa phương thức, gọi công cụ và đầu ra có cấu trúc, tuy không kèm khuyến nghị dùng json_schema như bản Pro. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản; dòng 2.1 không liệt kê khả năng hiểu âm thanh. Hỗ trợ bộ nhớ đệm ngữ cảnh cả ngầm định lẫn tường minh.
kimi-k2.7-codeMoonshot$0.7600$3.1570mỗi 1M tokensMoonshot Kimi K2.7 Code — mô hình lập trình chuyên dụng của Kimi, mà theo đo đạc của nhà cung cấp đã cải thiện mức tuân thủ chỉ dẫn và khả năng lập trình dài hơi so với K2.6, đồng thời giảm khoảng 30% mức suy nghĩ thừa tính trung bình. Cửa sổ ngữ cảnh 256K, mặc định 32.768 token đầu ra. Mô hình nhận văn bản, hình ảnh và video dưới dạng nội dung base64, trả về văn bản. Tư duy là bắt buộc và sẽ báo lỗi nếu bị tắt; tool_choice chỉ nhận auto hoặc none, còn reasoning_content phải được mang theo xuyên suốt các lượt gọi công cụ nhiều bước.
kling-3.0-turbo快手$0.560mỗi lượt gọiKuaishou Kling 3.0 Turbo — bậc giá trị của dòng Kling 3.0, tạo video 720P hoặc 1080P (mặc định 720P) dài 3-15 giây (mặc định 5) theo tỷ lệ 16:9, 9:16 hoặc 1:1, từ một prompt hoặc một ảnh khung hình đầu. Âm thanh gốc luôn đi kèm và không có công tắc bật/tắt. So với kling-v3, mô hình này bỏ bậc 4K, khả năng điều khiển khung hình cuối và đầu vào video để đổi lấy tốc độ cùng chi phí. 720p 5 giây có âm thanh ≈ $0,56.
qwen3-tts-flash阿里巴巴$0.1231mỗi 10 nghìn ký tựAlibaba Qwen3-TTS-Flash — chuyển văn bản thành giọng nói độ trễ thấp với 17 giọng dựng sẵn giàu biểu cảm, bao phủ tiếng Trung, Anh, Đức, Ý, Bồ Đào Nha, Tây Ban Nha, Nhật, Hàn, Pháp và Nga, cộng thêm chế độ tự động cho văn bản pha trộn nhiều ngôn ngữ và đầu ra theo phương ngữ. Mô hình nhận tối đa 512 token văn bản mỗi yêu cầu và hỗ trợ cả tổng hợp truyền phát lẫn không truyền phát.
qwen3.6-plus阿里巴巴$0.4000$2.4000mỗi 1M tokensAlibaba Qwen3.6-Plus — mô hình cân bằng cho suy luận tổng quát và sử dụng công cụ, với cửa sổ ngữ cảnh 1.000.000 token (tối đa 991.808 token đầu vào, 983.616 ở chế độ tư duy), tối đa 65.536 token đầu ra và hạn mức 81.920 token cho chuỗi suy luận. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản. Hỗ trợ gọi hàm, đầu ra có cấu trúc, tìm kiếm web, hoàn thành tiền tố và bộ nhớ đệm ngữ cảnh.
stepaudio-2-asr-proStepFun$0.3500mỗi giờ âm thanhStepFun StepAudio 2 ASR Pro — mô hình nhận dạng giọng nói 32B tham số, là lựa chọn ưu tiên độ chính xác trong dòng ASR của StepFun, còn stepaudio-2.5-asr là lựa chọn ưu tiên tốc độ và chi phí. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
glm-5.2智谱$1.1200$3.5200mỗi 1M tokensZhipu GLM-5.2 — mô hình nền chủ lực chuyên cho công việc của tác nhân lập trình dài hơi, đạt được qua nhiều tháng huấn luyện chuyên biệt chứ không chỉ bằng việc nới rộng ngữ cảnh, với cửa sổ ngữ cảnh 1M token và tối đa 128K token đầu ra. Vào văn bản, ra văn bản. Hỗ trợ nhiều chế độ tư duy, gọi hàm, đầu ra JSON có cấu trúc, truyền phát, bộ nhớ đệm ngữ cảnh và tích hợp công cụ MCP.
mimo-v2.5-tts-voicecloneXiaomi$0.0000mỗi 10 nghìn ký tựMô hình nhân bản giọng nói của Xiaomi MiMo: cung cấp một mẫu âm thanh tham chiếu dưới dạng data URL trong trường voice (data:{mime};base64,...) và mô hình sẽ tổng hợp lời nói bằng giọng đó mà không cần bước huấn luyện, gán nhãn hay tinh chỉnh nào. Mô hình nhận MP3 (audio/mpeg) hoặc WAV, với chuỗi mã hóa base64 giới hạn ở 10 MB; Xiaomi không công bố thời lượng tối thiểu của âm thanh tham chiếu. Chỉ dẫn phong cách bằng ngôn ngữ tự nhiên và thẻ âm thanh nội tuyến được kế thừa từ mimo-v2.5-tts, nhưng không có truyền phát — yêu cầu chạy ở chế độ tương thích và chỉ trả về sau khi tổng hợp xong.
step-1o-turbo-visionStepFun$0.4000$1.2800mỗi 1M tokensStepFun step-1o-turbo-vision — hiểu hình ảnh và video kèm sinh văn bản nhanh, ngữ cảnh 32K. Nhận đầu vào văn bản, hình ảnh và video, chỉ trả về văn bản. Đây là mô hình thị giác thế hệ trước được giữ lại vì tính tương thích; step-3.7-flash bao phủ cùng các phương thức đầu vào với ngữ cảnh 256K và độ sâu suy luận tùy chọn. Hãy giữ cạnh dài của ảnh dưới 4096 pixel để nhận dạng ổn định.
step-2x-largeStepFun$0.016mỗi lượt gọiStepFun Step 2X Large — tạo hình ảnh từ văn bản với chất liệu chân thực và khả năng dựng chữ tiếng Trung, tiếng Anh ngay trong ảnh mạnh khác thường. Hỗ trợ 256x256, 512x512, 768x768, 1024x1024, 1280x800 và 800x1280; một ảnh cho mỗi yêu cầu. Phục vụ qua endpoint images tương thích OpenAI.
stepaudio-2.5-asr-stream$0.1800mỗi giờ âm thanh
gemini-3.6-flashGoogleTính phí theo bậc, xem trang giáGoogle Gemini 3.6 Flash — mô hình suy luận đa phương thức bản ổn định, cân bằng giữa tốc độ và trí tuệ cho các tác vụ tác nhân và thực tế, với 1.048.576 token ngữ cảnh đầu vào và giới hạn 65.536 token đầu ra. Mô hình nhận văn bản, hình ảnh, video, âm thanh và PDF, đồng thời hỗ trợ tư duy, gọi hàm, thực thi mã, tra cứu grounding bằng tìm kiếm, đầu ra có cấu trúc và Computer Use (bản xem trước).
MiniMax-Hailuo-02MiniMax$0.280mỗi lượt gọiMiniMax Hailuo 02 — tạo video giá rẻ, bao phủ cả văn bản sang video lẫn hình ảnh sang video ở 24 fps, với 512p và 768p có sẵn dưới dạng clip 6 giây hoặc 10 giây và 1080p ở 6 giây. Bậc 512p là điểm khởi đầu của dòng Hailuo.
qwen3.7-max阿里巴巴$2.5000$7.5000mỗi 1M tokensAlibaba Qwen3.7-Max — mô hình chủ lực mã nguồn đóng, định vị cho lập trình, công việc văn phòng và năng suất, cùng khả năng thực thi tự chủ dài hạn, với cửa sổ ngữ cảnh 1.000.000 token (tối đa 991.808 token đầu vào, 983.616 ở chế độ tư duy), tối đa 131.072 token đầu ra và hạn mức 262.144 token cho chuỗi suy luận. Vào văn bản, ra văn bản. Hỗ trợ gọi hàm, đầu ra có cấu trúc và bộ nhớ đệm ngữ cảnh.
step-3.5-flashStepFun$0.1000$0.3000mỗi 1M tokensStepFun step-3.5-flash — mô hình suy luận chỉ xử lý văn bản với ngữ cảnh 256K, hướng tới logic, toán học, kỹ thuật phần mềm và nghiên cứu chuyên sâu, nơi chất lượng suy luận phải đi cùng khả năng thực thi nhanh và ổn định. Độ sâu suy luận được chọn theo từng yêu cầu qua reasoning_effort (low / medium / high). Hỗ trợ gọi công cụ, đầu ra có cấu trúc theo JSON Schema, truyền phát và bộ nhớ đệm prompt. Nếu cần đầu vào hình ảnh hoặc video, hãy dùng step-3.7-flash.
step-image-edit-2StepFun$0.004mỗi lượt gọiStepFun Step Image Edit 2 — mô hình hợp nhất tạo hình ảnh từ văn bản và chỉnh sửa hình ảnh với dưới 6B tham số, đạt mức tương đương các mô hình chỉnh sửa nguồn mở cỡ 12B-20B, hoàn tất một lần chỉnh sửa trong một đến hai giây và được xây dựng cho việc tinh chỉnh tương tác độ trễ thấp. Hỗ trợ 256x256, 512x512, 768x768, 1024x1024, 1280x800 và 800x1280, kèm prompt phủ định và chế độ tối ưu văn bản; một ảnh cho mỗi yêu cầu. Phục vụ qua endpoint images tương thích OpenAI.
wan2.7-videoedit阿里巴巴$0.092mỗi giâyAlibaba Wan2.7 VideoEdit — chỉnh sửa video bằng ngôn ngữ tự nhiên, cục bộ hoặc toàn cục, thay thế phần tử theo ảnh tham chiếu, sao chép chuyển động/hiệu ứng/góc máy.
glm-5.1智谱$1.1200$3.5200mỗi 1M tokensZhipu GLM-5.1 — mô hình nền chủ lực xây dựng cho công việc tự chủ kéo dài: nhà cung cấp ghi nhận khả năng thực thi liên tục không cần giám sát trên một tác vụ duy nhất trong tối đa 8 giờ, xuyên suốt các khâu lập kế hoạch, thực thi, kiểm thử và tối ưu lặp. Cửa sổ ngữ cảnh 200K, tối đa 128K token đầu ra, vào văn bản và ra văn bản. Hỗ trợ nhiều chế độ tư duy, gọi hàm, đầu ra JSON có cấu trúc, truyền phát, bộ nhớ đệm ngữ cảnh và tích hợp công cụ MCP.
happyhorse-1.1-t2v阿里巴巴$0.083mỗi giâyAlibaba HappyHorse 1.1 (T2V) — tạo video từ văn bản với khả năng hiểu ngữ nghĩa, điều khiển góc máy và sinh động tốt hơn. Video 720P/1080P mượt mà, giàu chi tiết và nhất quán về vật lý.
kimi-k2.6Moonshot$0.7600$3.1570mỗi 1M tokensMoonshot Kimi K2.6 — mô hình đa dụng cho hội thoại, sinh mã, hiểu hình ảnh và các tác vụ tác nhân, với khả năng viết mã dài hơi và thực thi tự chủ mạnh hơn thế hệ trước. Cửa sổ ngữ cảnh 256K, mặc định 32.768 token đầu ra. Mô hình nhận văn bản, hình ảnh (png, jpeg, webp, gif) và video (mp4, mov, webm và nhiều định dạng khác) dưới dạng nội dung base64, trả về văn bản. Chế độ tư duy bật theo mặc định và có thể tắt; temperature cố định ở 1.0 khi có tư duy và 0.6 khi không.
speech-2.8-turboMiniMax$0.3077mỗi 10 nghìn ký tựMiniMax speech-2.8-turbo — bậc độ trễ thấp của dòng giọng nói 2.8, đánh đổi khả năng thể hiện cực kỳ chân thực của bản HD để lấy tốc độ tổng hợp nhanh hơn mà vẫn giữ được sự tự nhiên. Mô hình bao phủ cùng 40 ngôn ngữ và 7 sắc thái cảm xúc, cho phép cấu hình cao độ, tốc độ nói, âm lượng, tần số lấy mẫu, bitrate và định dạng đầu ra, đồng thời nhận tối đa 1 triệu ký tự theo cách bất đồng bộ hoặc 10.000 ký tự qua giao diện truyền phát.
step-1o-audioStepFun$3.8500$9.2400mỗi 1M tokensStepFun step-1o-audio — mô hình giọng nói đầu-cuối thế hệ trước, hỗ trợ đa ngôn ngữ và gọi công cụ, giới hạn 30 phút cho mỗi phiên tương tác. Phần lớn đã được dòng StepAudio 2.5 thay thế; giữ lại cho các khối lượng công việc đã xây dựng trên mô hình này.
step-asr-1.1StepFun$0.3500mỗi giờ âm thanhStepFun step-asr-1.1 — bản cập nhật của mô hình nhận dạng đa dụng trong dòng step-asr, bao phủ tiếng Trung, tiếng Anh và các phương ngữ tiếng Trung. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
agnes-video-v2.0Agnes AI$0.000mỗi giâyAgnes AI Video V2.0 — mô hình tạo video bất đồng bộ cho văn bản sang video, hình ảnh sang video, khung hình chính từ nhiều ảnh và chuyển động điện ảnh, hỗ trợ các mức đầu ra chuẩn hóa 480p, 720p và 1080p.
glm-5智谱$1.0000$3.2000mỗi 1M tokensZhipu GLM-5 — mô hình MoE 744B tham số với 40B tham số hoạt động, huấn luyện trên 28,5T token và sử dụng DeepSeek Sparse Attention, với cửa sổ ngữ cảnh 200K và tối đa 128K token đầu ra. Vào văn bản, ra văn bản. Hỗ trợ nhiều chế độ tư duy, gọi hàm, đầu ra JSON có cấu trúc, truyền phát, bộ nhớ đệm ngữ cảnh và tích hợp công cụ MCP.
mimo-v2.5Xiaomi$0.1400$0.2800mỗi 1M tokensXiaomi MiMo-V2.5 — mô hình toàn phương thức gốc với ngữ cảnh 1M và đầu ra tối đa 128K, hiểu hình ảnh, video, âm thanh và văn bản trong cùng một mô hình. Hỗ trợ tư duy sâu, gọi hàm, đầu ra có cấu trúc và tìm kiếm web, kèm năng lực tác nhân toàn phương thức.
MiniMax-Hailuo-2.3-FastMiniMax$0.190mỗi lượt gọiMiniMax Hailuo 2.3 Fast — bậc ưu tiên tốc độ và chi phí của Hailuo 2.3, tập trung vào hình ảnh sang video và vào độ chân thực của chuyển động vật lý, ở 24 fps, với 768p có sẵn dưới dạng clip 6 giây hoặc 10 giây và 1080p ở 6 giây. 768p 6 giây = $0,19.
qwen3.8-max阿里巴巴$1.9900$5.9700mỗi 1M tokensAlibaba Qwen3.8-Max — mô hình MoE chủ lực 2,4 nghìn tỷ tham số và là mô hình mạnh nhất trong họ Qwen, được nhà cung cấp nêu là cải thiện đáng kể ở lập trình và công việc văn phòng. Cửa sổ ngữ cảnh 1.000.000 token (tối đa 991.808 token đầu vào, 983.616 ở chế độ tư duy), tối đa 131.072 token đầu ra và hạn mức 262.144 token cho chuỗi suy luận. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản; hỗ trợ gọi hàm, đầu ra có cấu trúc và bộ nhớ đệm ngữ cảnh.
doubao-seedream-5-0-260128字节跳动$0.034mỗi lượt gọiByteDance Doubao Seedream 5.0-lite — tạo hình ảnh từ văn bản và hình ảnh thành hình ảnh với khả năng sáng tạo có kiểm soát thông minh hơn, truy xuất theo thời gian thực và giữ nhất quán chủ thể tốt hơn (độ phân giải 2K trở lên).
glm-asr-2512智谱$0.1440mỗi giờ âm thanhZhipu GLM-ASR-2512 — mô hình nhận dạng giọng nói công bố tỷ lệ lỗi ký tự 0,0717. Mô hình bao phủ tiếng Quan Thoại cùng tiếng Tứ Xuyên, Quảng Đông, Mân Nam và Ngô, chất giọng tiếng Anh Mỹ và Anh Anh, cùng hàng chục ngôn ngữ khác gồm tiếng Pháp, Đức, Nhật, Hàn, Tây Ban Nha và Ả Rập. Mô hình xử lý được lời nói pha trộn nhiều ngôn ngữ, thuật ngữ chuyên ngành và cách nói khẩu ngữ, đồng thời nhận từ điển tùy chỉnh cho từ vựng chuyên ngành. Âm thanh giới hạn ở 30 giây và 25 MB mỗi yêu cầu, hỗ trợ phiên âm theo lô lẫn theo luồng.
glm-tts智谱$0.3077mỗi 10 nghìn ký tựZhipu GLM-TTS — chuyển văn bản thành giọng nói dựa trên kiến trúc sinh hai giai đoạn với học tăng cường GRPO, suy ra cảm xúc và ngữ điệu từ văn bản xung quanh thay vì đòi hỏi đánh dấu tường minh. Mô hình có bảy giọng dựng sẵn (mặc định là tongtong, cùng xiaochen, chuichui, jam, kazi, douji, luodo) với tốc độ và âm lượng điều chỉnh được, nhận tối đa 1024 ký tự mỗi yêu cầu và truyền phát với độ trễ khung đầu tiên dưới 400 ms. Trả về wav hoặc pcm ở tần số lấy mẫu khuyến nghị 24 kHz; truyền phát chỉ hỗ trợ pcm.
wan2.7-i2v阿里巴巴$0.092mỗi giâyAlibaba Wan 2.7 Image-to-Video — bao phủ việc tạo video từ khung hình đầu, chuyển cảnh giữa khung đầu và khung cuối, cùng phần tiếp nối của một clip có sẵn. Mô hình tạo video 720P hoặc 1080P (mặc định 1080P) dài 2-15 giây, mặc định 5 giây, từ prompt tối đa 5000 ký tự (prompt phủ định tối đa 500). Có thể cung cấp một bản mp3 hoặc wav dài 2-30 giây làm driving_audio; nếu không có âm thanh, mô hình tự tạo nhạc nền hoặc hiệu ứng âm thanh phù hợp, âm thanh dài hơn clip sẽ bị cắt bớt, còn âm thanh ngắn hơn sẽ để lại phần đuôi im lặng.
glm-5v-turbo智谱$0.7690$3.3850mỗi 1M tokensZhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows.
happyhorse-1.1-i2v阿里巴巴$0.083mỗi giâyAlibaba HappyHorse 1.1 (I2V) — hình ảnh sang video với chất liệu tốt hơn, giữ nhất quán danh tính nhân vật giữa các đoạn, chuyển động mượt và đồng bộ hình-tiếng. 720P/1080P.
mimo-v2.5-proXiaomi$0.4350$0.8700mỗi 1M tokensXiaomi MiMo-V2.5-Pro — mô hình chủ lực nghìn tỷ tham số (42B hoạt động) với ngữ cảnh 1M và đầu ra tối đa 128K, được tinh chỉnh cho khối lượng công việc tác nhân cường độ cao. Hỗ trợ tư duy sâu, gọi hàm, đầu ra có cấu trúc và tìm kiếm web. Chỉ sinh văn bản: khác với mimo-v2.5, danh sách năng lực của nhà cung cấp không bao gồm khả năng hiểu toàn phương thức.
mimo-v2.5-tts-voicedesignXiaomi$0.0000mỗi 10 nghìn ký tựMô hình thiết kế giọng nói của Xiaomi MiMo: mô tả giọng nói mong muốn bằng ngôn ngữ tự nhiên qua trường instructions và mô hình sẽ tổng hợp lời nói bằng chính giọng đã thiết kế đó.
qwen3.7-plus阿里巴巴$0.3080$1.2310mỗi 1M tokensAlibaba Qwen3.7-Plus — mô hình tác nhân lai đa phương thức, có thể tri giác cảnh vật ngoài đời thực, đọc màn hình và điều khiển giao diện đồ họa, sinh mã từ tham chiếu hình ảnh, cùng điều hướng đầu-cuối bên trong ứng dụng di động. Cửa sổ ngữ cảnh 1.000.000 token (tối đa 991.808 token đầu vào, 983.616 ở chế độ tư duy), tối đa 131.072 token đầu ra và hạn mức 262.144 token cho chuỗi suy luận. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản; hỗ trợ gọi hàm, đầu ra có cấu trúc và bộ nhớ đệm ngữ cảnh.
step-asrStepFun$0.1500mỗi giờ âm thanhStepFun step-asr — nhận dạng giọng nói đa dụng bao phủ tiếng Trung, tiếng Anh và các phương ngữ tiếng Trung, dùng cho phiên âm, biên bản họp, kiểm tra chất lượng cuộc gọi và tìm kiếm bằng giọng nói. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
wan2.7-image阿里巴巴$0.031mỗi lượt gọiAlibaba Wan2.7 Image — tạo hình ảnh từ văn bản, chỉnh sửa ảnh, tạo ảnh tham chiếu từ nhiều ảnh, chỉnh sửa tương tác, dựng chữ và bám chỉ dẫn tốt.
agnes-2.0-flashAgnes AI$0.0000mỗi 1M tokensAgnes AI Agnes 2.0 Flash — mô hình tác nhân đa phương thức tốc độ cao với 256K ngữ cảnh đầu vào và giới hạn đầu ra tham chiếu 64K, hỗ trợ trò chuyện, truyền phát, gọi công cụ, lập trình, suy luận, hiểu hình ảnh và quy trình tác nhân.
agnes-2.5-flashAgnes AI$0.0000mỗi 1M tokensAgnes AI Agnes 2.5 Flash — mô hình tác nhân đa phương thức tốc độ cao với 512K ngữ cảnh đầu vào và giới hạn đầu ra tham chiếu 65,5K, hỗ trợ trò chuyện, truyền phát, gọi công cụ, lập trình, suy luận, hội thoại nhiều lượt, hiểu hình ảnh và quy trình tác nhân.
glm-5-turbo智谱$1.2000$4.0000mỗi 1M tokensZhipu GLM-5-Turbo — biến thể GLM-5 thiên về thông lượng, tối ưu cho các quy trình tác nhân: gọi công cụ và kỹ năng ổn định hơn qua các tác vụ nhiều bước, xử lý tốt hơn những chỉ dẫn dài và phức tạp, cùng khả năng thực thi tác vụ theo lịch hoặc chạy dài. Cửa sổ ngữ cảnh 200K, tối đa 128K token đầu ra, vào văn bản và ra văn bản. Hỗ trợ các chế độ tư duy, gọi hàm, đầu ra JSON có cấu trúc, truyền phát, bộ nhớ đệm ngữ cảnh và tích hợp công cụ MCP.
happyhorse-1.1-r2v阿里巴巴$0.083mỗi giâyAlibaba HappyHorse 1.1 (R2V) — tạo video từ ảnh tham chiếu với tối đa 9 ảnh, giữ nhất quán chủ thể/bối cảnh/phong cách tốt và điều khiển được góc máy. 720P/1080P.
kimi-k3Moonshot$2.7400$13.6990mỗi 1M tokensMoonshot Kimi K3 — mô hình chủ lực 2,8 nghìn tỷ tham số cho lập trình dài hơi, công việc tri thức đầu-cuối và suy luận sâu, với cửa sổ ngữ cảnh 1M token và tối đa 1.048.576 token hoàn thành (mặc định 131.072). Mô hình nhận văn bản, ảnh base64 và video, trả về văn bản. Tư duy luôn bật, với reasoning_effort chọn được là low, high hoặc max (mặc định max); temperature cố định ở 1.0. Hỗ trợ gọi công cụ tùy chỉnh và nạp công cụ động.
speech-2.8-hdMiniMax$0.5385mỗi 10 nghìn ký tựMiniMax speech-2.8-hd — bậc độ nét cao của dòng giọng nói 2.8, hướng tới lối thể hiện cực kỳ chân thực kèm thẻ âm thanh, bao phủ 40 ngôn ngữ và 7 sắc thái cảm xúc. Cao độ, tốc độ nói, âm lượng, tần số lấy mẫu, bitrate và định dạng đầu ra đều cấu hình được theo từng yêu cầu, còn tổng hợp văn bản dài nhận tối đa 1 triệu ký tự theo cách bất đồng bộ hoặc 10.000 ký tự qua giao diện truyền phát.
step-3.7-flashStepFun$0.2000$1.1500mỗi 1M tokensStepFun step-3.7-flash — MoE thưa với 198B tham số tổng và 11B tham số hoạt động, ngữ cảnh 256K gốc và khả năng hiểu hình ảnh, video gốc bên cạnh văn bản. Độ sâu suy luận được chọn theo từng yêu cầu qua reasoning_effort (low / medium / high), và mô hình hỗ trợ gọi công cụ nhiều bước một cách đáng tin cậy, đầu ra có cấu trúc theo JSON Schema, truyền phát và bộ nhớ đệm prompt. Được tinh chỉnh cho khối lượng công việc tác nhân và lập trình.
stepaudio-2.5-chatStepFun$1.5000$3.5000mỗi 1M tokensStepFun StepAudio 2.5 Chat — mô hình hiểu giọng nói đầu-cuối: nhận âm thanh hoặc văn bản vào và trả về văn bản, đọc các tín hiệu cận ngôn ngữ như sự ngập ngừng hay tiếng cười trực tiếp từ dạng sóng chứ không phải từ bản ghi văn bản. Hỗ trợ tùy biến persona sâu rộng, bao gồm tính cách, thói quen nói và biên độ cảm xúc. Âm thanh được cung cấp dưới dạng phần nội dung input_audio trên endpoint chat completions. Nếu cần câu trả lời bằng giọng nói, hãy dùng một mô hình TTS.
agnes-image-2.1-flashAgnes AI$0.000mỗi lượt gọiAgnes AI Image 2.1 Flash — mô hình tạo và chỉnh sửa hình ảnh chú trọng chi tiết cho các cảnh có mật độ thông tin cao, hỗ trợ văn bản thành hình ảnh, hình ảnh thành hình ảnh và ghép nhiều ảnh với kích thước cùng tỷ lệ khung hình linh hoạt từ 1K đến 4K.
deepseek-v4-proDeepSeek$0.4350$0.8700mỗi 1M tokensDeepSeek V4 Pro — bậc năng lực cao hơn của DeepSeek V4 cho lập trình, suy luận và công việc tác nhân, với cửa sổ ngữ cảnh 1M token và đầu ra tối đa 384K. Mô hình chạy ở cả chế độ tư duy (mặc định) lẫn không tư duy, hỗ trợ gọi công cụ và đầu ra JSON. Vào văn bản, ra văn bản.
LongCat-2.0Meituan$0.3000$1.2000mỗi 1M tokensMeituan LongCat-2.0 — mô hình MoE nguồn mở 1,6T tham số với ngữ cảnh 1M gốc, được xây dựng cho lập trình theo hướng tác nhân và sử dụng công cụ dài hơi. Mô hình suy luận chỉ xử lý văn bản.
MiniMax-Hailuo-2.3MiniMax$0.280mỗi lượt gọiMiniMax Hailuo 2.3 — văn bản sang video và hình ảnh sang video mà nhà cung cấp định vị ở khả năng bám sát chỉ dẫn, ở 24 fps, với 768p có sẵn dưới dạng clip 6 giây hoặc 10 giây và 1080p ở 6 giây. 768p 6 giây = $0,28.
MiniMax-M3MiniMaxTính phí theo bậc, xem trang giáMiniMax M3 — mô hình lập trình đa phương thức tiên phong cho suy luận tác nhân, sử dụng công cụ và thực thi tác vụ có cấu trúc, với cửa sổ ngữ cảnh 1.000.000 token. Mô hình nhận văn bản, hình ảnh tối đa 10 MB và video tối đa 50 MB gửi kèm hoặc 512 MB qua Files API, và trả về văn bản. Hỗ trợ gọi công cụ, với tư duy là tùy chọn chứ không phải luôn bật.
step-asr-1.1-stream$0.4000mỗi giờ âm thanh
step-tts-miniStepFun$0.1500mỗi 10 nghìn ký tựStepFun step-tts-mini — thành viên tiết kiệm chi phí, độ trễ thấp của dòng TTS StepFun, bao phủ cùng các ngôn ngữ như step-tts-2 (tiếng Trung, tiếng Anh, pha trộn Trung-Anh và tiếng Nhật, cùng tiếng Quảng Đông và tiếng Tứ Xuyên) với một phần các giọng đọc dựng sẵn. Hỗ trợ nhãn cảm xúc và cách thể hiện bằng ngôn ngữ tự nhiên, cùng nhân bản giọng nói zero-shot từ khoảng 10 giây âm thanh tham chiếu. Xuất ra wav, mp3, flac, opus hoặc pcm.
wan2.7-r2v阿里巴巴$0.092mỗi giâyAlibaba Wan2.7 (R2V) — tạo video từ tham chiếu, tối đa 5 tham chiếu ảnh/video hỗn hợp cùng một tham chiếu âm sắc, giữ nhất quán nhân vật/đạo cụ/bối cảnh tốt hơn.
doubao-seedance-2-0-fast-260128字节跳动$5.6000$5.6000mỗi 1M tokensByteDance Seedance 2.0 Fast — tạo video tiết kiệm chi phí, mang đầy đủ bộ tính năng của Seedance 2.0 nhưng giới hạn ở 480p và 720p, 24 fps, 4-15 giây. Mô hình bao phủ văn bản sang video, hình ảnh sang video từ khung hình đầu và từ khung đầu-khung cuối, tạo từ tham chiếu đa phương thức với 1-9 ảnh và tối đa 3 video tham chiếu tổng cộng 15 giây, chỉnh sửa video, kéo dài video, tạo kèm âm thanh và một công cụ tìm kiếm web; tham chiếu âm thanh phải đi kèm một ảnh hoặc video. Trả về MP4 ở 21:9, 16:9, 4:3, 1:1, 3:4 hoặc 9:16. 480p 5 giây ≈ $0,26.
kling-v3-omni快手$0.420mỗi lượt gọiKling 3.0 Omni — tạo video từ nhiều ảnh tham chiếu. Giá niêm yết là của bậc std (720p, 5 giây, không âm thanh, không video tham chiếu). Các yêu cầu không đặt mode sẽ dùng bậc pro mặc định của nhà cung cấp và bị tính phí gấp 1,33 lần — khoảng $0,56 cho cùng đoạn 5 giây; bậc 4k tính phí gấp 5 lần. Hãy truyền mode=std để được tính đúng giá niêm yết.
mimo-v2.5-asrXiaomi$0.0740mỗi giờ âm thanhMô hình nhận dạng giọng nói của Xiaomi MiMo, tối ưu cho tiếng Trung, tiếng Anh cùng các phương ngữ tiếng Trung, xử lý được âm thanh nhiễu, thu xa, nhiều người nói cũng như phiên âm lời bài hát.
qwen3-asr-flash阿里巴巴$0.1235mỗi giờ âm thanhAlibaba Qwen3-ASR-Flash — nhận dạng giọng nói xây dựng trên mô hình nền Qwen3, tự động xác định ngôn ngữ đang nói và phiên âm 11 ngôn ngữ; dòng Qwen3-ASR ghi nhận tiếng Quan Thoại cùng tiếng Tứ Xuyên, Mân Nam, Ngô và Quảng Đông, cùng nhiều chất giọng tiếng Anh khác nhau. Mô hình nhận aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma và wmv, tối đa 5 phút và 10 MB mỗi yêu cầu; đầu vào pcm phải ở 16 kHz, còn các định dạng khác được lấy mẫu lại về 16 kHz trước khi nhận dạng.
wan2.7-image-pro阿里巴巴$0.060mỗi lượt gọiAlibaba Wan 2.7 Image Pro — bậc chuyên nghiệp của dòng ảnh Wan 2.7, bao phủ tạo hình ảnh từ văn bản, bộ ảnh theo trình tự, chỉnh sửa ảnh và tạo ảnh từ nhiều ảnh tham chiếu, với khả năng bám prompt tốt hơn. Tạo hình ảnh từ văn bản đạt tới 4K (4096x4096) cùng các bậc 1K và 2K và kích thước tùy chỉnh từ 768x768; chế độ chỉnh sửa và chế độ theo trình tự giới hạn ở 2K. Mô hình nhận tối đa 9 ảnh tham chiếu (JPEG, JPG, PNG, BMP, WEBP; 240-8000 px mỗi cạnh, 20 MB mỗi ảnh), tỷ lệ khung hình từ 1:8 đến 8:1 và prompt tối đa 5000 ký tự. Trả về PNG.