Giá mô hình AI Trung Quốc
ChinaAPI cung cấp DeepSeek, Qwen, GLM, Kimi và các mô hình AI Trung Quốc khác qua một cổng tương thích OpenAI tại https://api.chinaapi.ai/v1. Mọi mức giá đều tính bằng đô la Mỹ, theo đơn vị mà nhà cung cấp thượng nguồn niêm yết. Cùng danh sách này có ở dạng JSON tại /api/pricing.
60 mô hình sẽ mở khóa giá Paid thấp hơn sau lần nạp đầu tiên: nạp một lần với số tiền bất kỳ, tự động áp dụng cho toàn tài khoản. Giá Paid chỉ được liệt kê khi thấp hơn giá Standard.
| Mô hình | Nhà cung cấp | Đầu vào | Đầu ra | Đầu vào (giá Paid) | Đầu ra (giá Paid) | Đơn vị | Mô tả |
|---|---|---|---|---|---|---|---|
| agnes-2.5-flash | Agnes AI | $0.0000 | mỗi 1M tokens | Agnes AI Agnes 2.5 Flash — mô hình tác nhân đa phương thức tốc độ cao với 512K ngữ cảnh đầu vào và giới hạn đầu ra tham chiếu 65,5K, hỗ trợ trò chuyện, truyền phát, gọi công cụ, lập trình, suy luận, hội thoại nhiều lượt, hiểu hình ảnh và quy trình tác nhân. | |||
| agnes-2.5-pro | Agnes AI | $0.4500 | $0.9000 | mỗi 1M tokens | Agnes AI Agnes 2.5 Pro — bản phát hành thương mại ổn định của mô hình benchmark 2.5 Pro Alpha, một mô hình suy luận trả phí với 1M ngữ cảnh đầu vào và đầu ra tối đa 65.536 token, dành cho lập trình nâng cao, suy luận khoa học, phân tích ngữ cảnh dài, quy trình tác nhân và hiểu hình ảnh. | ||
| agnes-2.5-pro-beta | Agnes AI | $0.1000 | $0.3000 | mỗi 1M tokens | Agnes AI Agnes 2.5 Pro Beta — bậc giá thấp của dòng Pro, được tính phí theo mức giá Beta riêng thấp hơn nhiều so với giá của 2.5 Pro, là một mô hình suy luận trả phí có cùng định dạng yêu cầu, giao thức văn bản và giới hạn ngữ cảnh, dành cho lập trình nâng cao, suy luận khoa học, phân tích ngữ cảnh dài, quy trình tác nhân và hiểu hình ảnh. | ||
| agnes-3.0-flash | Agnes AI | $0.0000 | mỗi 1M tokens | Agnes AI Agnes 3.0 Flash — mô hình ngôn ngữ thế hệ mới của nhà cung cấp, được xây dựng cho lập trình theo hướng tác nhân và thực thi tác vụ bằng công cụ, với 512K ngữ cảnh đầu vào và giới hạn đầu ra 65.536 token. Mô hình nhận đầu vào văn bản và URL hình ảnh, trả về văn bản, đồng thời hỗ trợ truyền phát, gọi hàm và điều phối công cụ nhiều bước, cũng như tuân thủ chỉ dẫn trong tác vụ dài. Có thể truy cập qua endpoint chat tương thích OpenAI, endpoint Responses và endpoint Messages tương thích Anthropic. Trên endpoint chat, chế độ tư duy (Thinking) được bật bằng cách đặt chat_template_kwargs.enable_thinking thành true; theo đo đạc ngày 2026-09-21, các yêu cầu không có trường này không trả về token suy luận nào. Khi bật chế độ tư duy, token suy luận được tính vào max_tokens, vì vậy hãy đặt max_tokens đủ cho cả phần suy luận lẫn câu trả lời. | |||
| agnes-image-2.0-flash | Agnes AI | $0.000 | mỗi lượt gọi | Agnes AI Image 2.0 Flash — mô hình tạo và chỉnh sửa hình ảnh nhanh cho văn bản thành hình ảnh, hình ảnh thành hình ảnh và ghép nhiều ảnh, kết quả tạo ra có thể nhận dưới dạng URL hoặc dữ liệu Base64. | |||
| agnes-image-2.1-flash | Agnes AI | $0.000 | mỗi lượt gọi | Agnes AI Image 2.1 Flash — mô hình tạo và chỉnh sửa hình ảnh chú trọng chi tiết cho các cảnh có mật độ thông tin cao, hỗ trợ văn bản thành hình ảnh, hình ảnh thành hình ảnh và ghép nhiều ảnh với kích thước cùng tỷ lệ khung hình linh hoạt từ 1K đến 4K. | |||
| agnes-image-2.5-flash | Agnes AI | $0.000 | mỗi lượt gọi | Agnes AI Image 2.5 Flash — mô hình hình ảnh thế hệ mới nhất, vượt Image 2.1 Flash ở khả năng tạo, chỉnh sửa, bố cục, dựng chi tiết và bám prompt, dành cho văn bản thành hình ảnh, hình ảnh thành hình ảnh và ghép nhiều ảnh với kích thước cùng tỷ lệ khung hình linh hoạt từ 1K đến 4K. | |||
| agnes-video-2.5 | Agnes AI | $0.025 | mỗi giây | Agnes AI Video 2.5 — mô hình tạo video bất đồng bộ trả phí, tạo các clip dài 4-12 giây ở 720P, 960P hoặc 2K từ văn bản, khung hình chính đầu/cuối, hoặc từ tham chiếu hình ảnh, âm thanh và video. | |||
| agnes-video-2.5-flash | Agnes AI | $0.000 | mỗi giây | Agnes AI Video 2.5 Flash — biến thể chỉ có 720P của Video 2.5, tạo video dài 4-12 giây từ văn bản, khung hình chính đầu/cuối, hoặc từ tham chiếu hình ảnh và âm thanh, với cùng API tác vụ bất đồng bộ. | |||
| claude-fable-5 | Anthropic | $10.0000 | $50.0000 | $7.0000 | $35.0000 | mỗi 1M tokens | Anthropic Claude Fable 5 — mô hình có năng lực cao nhất của Anthropic trong số các mô hình phát hành rộng rãi, dành cho công việc tri thức và lập trình dài hơi, nhiều tham vọng. Mô hình được xây dựng cho các tác vụ tác nhân kéo dài nhiều ngày, kỹ thuật phần mềm phức tạp, nghiên cứu chuyên sâu, suy luận trên tài liệu và hình ảnh, cùng khả năng chủ động tự kiểm chứng. |
| claude-fable-5-1 | Anthropic | $10.0000 | $50.0000 | $8.0000 | $40.0000 | mỗi 1M tokens | Anthropic Claude Fable 5.1 — mô hình chủ lực phát hành rộng rãi mới nhất của Anthropic, dành cho công việc tri thức và lập trình dài hơi, nhiều tham vọng. Mô hình được xây dựng cho các tác vụ tác nhân kéo dài nhiều ngày, kỹ thuật phần mềm phức tạp, nghiên cứu chuyên sâu, suy luận trên tài liệu và hình ảnh, cùng khả năng chủ động tự kiểm chứng. Đọc bộ nhớ đệm được tính giá bằng 2,5% giá đầu vào — mức thấp nhất trong thế hệ này. |
| claude-haiku-4-5 | Anthropic | $1.0000 | $5.0000 | $0.7000 | $3.5000 | mỗi 1M tokens | Anthropic Claude Haiku 4.5 — mô hình Claude nhanh nhất với trí tuệ gần mức tiên phong, được xây dựng cho công việc khối lượng lớn, nhạy về độ trễ như phân loại, trích xuất và định tuyến. Hỗ trợ đầu vào văn bản và hình ảnh, tư duy mở rộng, cửa sổ ngữ cảnh 200.000 token và tối đa 64.000 token đầu ra. |
| claude-haiku-5-5 | Anthropic | $0.1000 | $0.5000 | $0.0600 | $0.3000 | mỗi 1M tokens | Anthropic Claude Haiku 5.5 — hiểu văn bản và hình ảnh nhanh, tiết kiệm cho phân loại, trích xuất, định tuyến và tác nhân. Ngữ cảnh 1.000.000 token, đầu ra tối đa 128.000 token. Suy luận thích ứng mặc định là medium; dùng output_config.effort trong Messages để chọn low, medium, high, xhigh hoặc max. Hỗ trợ phản hồi luồng và gọi công cụ bắt buộc. Khi đầu vào vượt 100.000 token, toàn bộ yêu cầu áp dụng giá ngữ cảnh dài, gồm đầu ra và bộ nhớ đệm. |
| claude-opus-4-5 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | mỗi 1M tokens | Anthropic Claude Opus 4.5 — bản phát hành Opus 4.5, hiện được Anthropic xếp vào nhóm mô hình cũ (legacy) và vẫn duy trì cung cấp, dành cho các khối lượng công việc muốn tiếp tục dùng phiên bản mô hình này. Hỗ trợ đầu vào văn bản và hình ảnh, tư duy mở rộng, cửa sổ ngữ cảnh 200.000 token và tối đa 64.000 token đầu ra. |
| claude-opus-4-6 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | mỗi 1M tokens | Anthropic Claude Opus 4.6 — thế hệ Opus cho suy luận phức tạp và công việc tác nhân, với cửa sổ ngữ cảnh 1.000.000 token ở mức giá tiêu chuẩn và tối đa 128.000 token đầu ra. Hỗ trợ đầu vào văn bản và hình ảnh cùng tư duy thích ứng, và sử dụng bộ tokenizer có trước phiên bản 4.7. |
| claude-opus-4-7 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | mỗi 1M tokens | Anthropic Claude Opus 4.7 — mô hình suy luận nâng cao cho các bài toán kỹ thuật phần mềm khó và những tác vụ tác nhân phức tạp, chạy dài. Mô hình chú trọng tuân thủ chỉ dẫn nghiêm ngặt, tự kiểm chứng, sử dụng công cụ đáng tin cậy và thị giác độ phân giải cao trên giao diện, hình ảnh, tài liệu cùng các quy trình chuyên môn. |
| claude-opus-4-8 | Anthropic | $5.0000 | $25.0000 | $3.5000 | $17.5000 | mỗi 1M tokens | Anthropic Claude Opus 4.8 — mô hình suy luận năng lực cao cho lập trình, quy trình tác nhân, phân tích chuyên môn và công việc chạy dài. So với Opus 4.7, mô hình cải thiện độ tin cậy, khả năng phán đoán, hiệu quả dùng công cụ, điều khiển máy tính và suy luận tài liệu đa phương thức, đồng thời hỗ trợ cửa sổ ngữ cảnh 1.000.000 token. |
| claude-opus-5 | Anthropic | $5.0000 | $25.0000 | $3.0000 | $15.0000 | mỗi 1M tokens | Anthropic Claude Opus 5 — mô hình suy luận sâu cho lập trình tác nhân phức tạp và công việc doanh nghiệp, cải thiện đáng kể ở các tác vụ dài hơi, rà soát mã, quy trình tài liệu, thị giác và phối hợp nhiều tác nhân. Mô hình có cửa sổ ngữ cảnh 1.000.000 token, hỗ trợ tối đa 128.000 token đầu ra và bật tư duy thích ứng theo mặc định. |
| claude-opus-5-5 | Anthropic | $4.0000 | $20.0000 | $2.4000 | $12.0000 | mỗi 1M tokens | Anthropic Claude Opus 5.5 — được thiết kế cho lập trình tác nhân và công việc tri thức kéo dài, với mức giá thấp hơn Claude Opus 5. Mô hình nhận đầu vào văn bản và hình ảnh, có cửa sổ ngữ cảnh 1.000.000 token và hỗ trợ tối đa 128.000 token đầu ra. Tư duy thích ứng luôn bật; tham số effort điều chỉnh độ sâu suy luận, mặc định là medium. |
| claude-sonnet-4-5 | Anthropic | $3.0000 | $15.0000 | $2.1000 | $10.5000 | mỗi 1M tokens | Anthropic Claude Sonnet 4.5 — bản phát hành Sonnet 4.5, hiện được Anthropic xếp vào nhóm mô hình cũ (legacy) và vẫn duy trì cung cấp, dành cho các khối lượng công việc muốn tiếp tục dùng phiên bản mô hình này. Hỗ trợ đầu vào văn bản và hình ảnh, tư duy mở rộng, cửa sổ ngữ cảnh 200.000 token và tối đa 64.000 token đầu ra. |
| claude-sonnet-4-6 | Anthropic | $3.0000 | $15.0000 | $2.1000 | $10.5000 | mỗi 1M tokens | Anthropic Claude Sonnet 4.6 — thế hệ Sonnet cân bằng, cung cấp cửa sổ ngữ cảnh 1.000.000 token ở mức giá tiêu chuẩn với tối đa 128.000 token đầu ra. Hỗ trợ đầu vào văn bản và hình ảnh cùng tư duy thích ứng, và sử dụng bộ tokenizer có trước phiên bản 4.7, nên cùng một văn bản sẽ cho ra ít hơn khoảng 30% token so với các mô hình từ 4.7 trở đi ở cùng đơn giá mỗi token. |
| claude-sonnet-5 | Anthropic | $2.0000 | $10.0000 | $1.4000 | $7.0000 | mỗi 1M tokens | Anthropic Claude Sonnet 5 — mô hình phục vụ sản xuất, cân bằng giữa trí tuệ tiên phong và tốc độ cho lập trình, tác nhân và quy trình doanh nghiệp. Mô hình có thể lập kế hoạch, dùng công cụ trình duyệt và terminal, đồng thời chạy tự chủ trên các tác vụ suy luận, công việc tri thức và kỹ thuật phần mềm. |
| claude-sonnet-5-5 | Anthropic | $2.0000 | $10.0000 | $1.2000 | $6.0000 | mỗi 1M tokens | Anthropic Claude Sonnet 5.5 — cân bằng giữa tốc độ và trí tuệ cho lập trình, tác nhân và khối lượng công việc sản xuất. Mô hình nhận đầu vào văn bản và hình ảnh, có cửa sổ ngữ cảnh 1.000.000 token và hỗ trợ tối đa 128.000 token đầu ra. Tư duy thích ứng bật theo mặc định và token tư duy được tính phí như đầu ra; output_config.effort cho phép chọn low, medium, high, xhigh hoặc max, mặc định là high. Để tắt tư duy trước, hãy gửi thinking với type between_tools, chỉ hoạt động khi effort ở mức high trở xuống; type disabled sẽ bị từ chối. Đặt temperature, top_p hoặc top_k thành giá trị khác mặc định sẽ trả về lỗi, việc ép gọi công cụ bằng tool_choice any hoặc tool cũng vậy. Các khối tư duy gắn với mô hình và cuộc hội thoại; hãy gửi lại nguyên vẹn ở các lượt sau. |
| cogview-4 | Zhipu AI | $0.010 | $0.0095 | mỗi lượt gọi | Zhipu CogView-4 — mô hình tạo hình ảnh từ văn bản CogView thế hệ thứ tư, hỗ trợ nhiều độ phân giải đầu ra cùng hai bậc phục vụ là bậc cơ bản và bậc độ nét cao. Mô hình nhận prompt tiếng Trung và tiếng Anh, đồng thời dựng được chữ bên trong ảnh. Mỗi yêu cầu tạo một ảnh. | ||
| deepseek-flash | DeepSeek | $0.1500 | $0.6000 | mỗi 1M tokens | DeepSeek V4.1 Flash — ID mô hình chuẩn dành cho các tích hợp mới. Mô hình hỗ trợ đầu vào văn bản và hình ảnh, chế độ tư duy và không tư duy, gọi công cụ và đầu ra JSON. Các ID deepseek-v4-flash và deepseek-v4-flash-vision-exp đã ngừng sử dụng vẫn là bí danh tương thích, được phục vụ bởi chính mô hình này với cùng mức giá Flash. Cửa sổ ngữ cảnh 1M token, đầu ra tối đa 384K. Trên /v1/responses, hãy gửi toàn bộ cuộc hội thoại trong mảng input ở mỗi lượt: không có trạng thái hội thoại nào được lưu ở phía thượng nguồn, nên các yêu cầu chứa previous_response_id hoặc conversation sẽ bị từ chối. | ||
| deepseek-v4-pro | DeepSeek | $0.6600 | $1.9800 | mỗi 1M tokens | DeepSeek V4 Pro 0813 — bậc năng lực cao hơn của DeepSeek V4 cho lập trình, suy luận và công việc tác nhân, với cửa sổ ngữ cảnh 1M token và đầu ra tối đa 384K. Mô hình chạy ở cả chế độ tư duy (mặc định) lẫn không tư duy, hỗ trợ gọi công cụ và đầu ra JSON. Vào văn bản, ra văn bản. Trên /v1/responses, hãy gửi toàn bộ cuộc hội thoại trong mảng input ở mỗi lượt: không có trạng thái hội thoại nào được lưu ở phía thượng nguồn, nên các yêu cầu chứa previous_response_id hoặc conversation sẽ bị từ chối. | ||
| doubao-seed-2-1-pro-260628 | ByteDance | $0.8889 | $4.4444 | mỗi 1M tokens | ByteDance Doubao Seed 2.1 Pro — mô hình tác nhân chủ lực của Doubao cho công việc chạy thật, bao phủ tư duy sâu, sinh văn bản, hiểu đa phương thức, gọi công cụ và đầu ra có cấu trúc, mà với đầu ra có cấu trúc nhà cung cấp khuyến nghị dùng chế độ json_schema. Cửa sổ ngữ cảnh 256K với đầu vào tối đa 256K, tối đa 256K token đầu ra (mặc định 4K) và hạn mức 256K token cho chuỗi suy luận. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản; dòng 2.1 không liệt kê khả năng hiểu âm thanh. Hỗ trợ bộ nhớ đệm ngữ cảnh cả ngầm định lẫn tường minh, bao gồm bộ nhớ đệm tiền tố và bộ nhớ đệm phiên. | ||
| doubao-seed-2-1-turbo-260628 | ByteDance | $0.4444 | $2.2222 | mỗi 1M tokens | ByteDance Doubao Seed 2.1 Turbo — làn độ trễ thấp của dòng Seed 2.1, dùng chung khuôn khổ với bản Pro: cửa sổ ngữ cảnh 256K với đầu vào tối đa 256K, tối đa 256K token đầu ra (mặc định 4K) và hạn mức 256K token cho chuỗi suy luận. Mô hình bao phủ tư duy sâu, sinh văn bản, hiểu đa phương thức, gọi công cụ và đầu ra có cấu trúc, tuy không kèm khuyến nghị dùng json_schema như bản Pro. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản; dòng 2.1 không liệt kê khả năng hiểu âm thanh. Hỗ trợ bộ nhớ đệm ngữ cảnh cả ngầm định lẫn tường minh. | ||
| doubao-seed-character-260628 | ByteDance | $0.1185 | $0.2963 | mỗi 1M tokens | ByteDance Doubao Seed Character (260628) — mô hình hội thoại nhân vật của Doubao, dành cho trò chuyện nhiều lượt theo persona, là dòng kế nhiệm của doubao-1-5-pro-32k-character. Bản dựng này mang các nhãn năng lực của nhà cung cấp gồm tư duy sâu, sinh văn bản, hiểu đa phương thức, gọi công cụ và đầu ra có cấu trúc (khuyến nghị json_schema). Cửa sổ ngữ cảnh 128K với đầu vào tối đa 96K và tối đa 32K token đầu ra (mặc định 4K). Giá tính theo độ dài đầu vào: yêu cầu có tối đa 32K token đầu vào được tính theo bậc tiêu chuẩn; yêu cầu dài hơn được tính theo bậc ngữ cảnh dài, trong đó đầu vào có giá gấp 1,5 lần và đầu ra gấp ba lần mức giá của bậc tiêu chuẩn. | ||
| doubao-seed-evolving | ByteDance | $0.8889 | $4.4444 | mỗi 1M tokens | ByteDance Doubao Seed Evolving — mô hình chủ lực hiện tại của Doubao cho lập trình và tác nhân, được phát hành theo hình thức phát hành liên tục (rolling release): nhà cung cấp cập nhật mô hình hằng tuần dưới cùng ID này mà không có bản chụp theo ngày, nên hành vi và năng lực có thể thay đổi mà không tăng số phiên bản. Mô hình mang các nhãn năng lực của nhà cung cấp gồm tư duy sâu, sinh văn bản, hiểu đa phương thức, xử lý tác vụ GUI, gọi công cụ và đầu ra có cấu trúc (khuyến nghị json_schema). Cửa sổ ngữ cảnh 1.024K với đầu vào tối đa 1.024K và tối đa 256K token đầu ra (mặc định 4K). | ||
| doubao-seedance-2-0-260128 | ByteDance | $7.0000 | mỗi 1M tokens | ByteDance Seedance 2.0 — mô hình chủ lực của dòng Seedance 2.0 và là thành viên duy nhất đạt tới 1080p và 4K (độ sâu 10 bit) bên cạnh 480p và 720p, ở 24 fps và 4-15 giây. Mô hình bao phủ văn bản sang video, hình ảnh sang video từ khung hình đầu và từ khung đầu-khung cuối, tạo từ tham chiếu đa phương thức với 1-9 ảnh và tối đa 3 video tham chiếu tổng cộng 15 giây, chỉnh sửa video, kéo dài video, tạo kèm âm thanh và một công cụ tìm kiếm web; tham chiếu âm thanh phải đi kèm một ảnh hoặc video. Trả về MP4 ở 21:9, 16:9, 4:3, 1:1, 3:4 hoặc 9:16, và có thể lấy khung hình cuối dưới dạng ảnh. Tính phí theo độ phân giải đầu ra. | |||
| doubao-seedance-2-0-fast-260128 | ByteDance | $5.6000 | mỗi 1M tokens | ByteDance Seedance 2.0 Fast — tạo video tiết kiệm chi phí, mang đầy đủ bộ tính năng của Seedance 2.0 nhưng giới hạn ở 480p và 720p, 24 fps, 4-15 giây. Mô hình bao phủ văn bản sang video, hình ảnh sang video từ khung hình đầu và từ khung đầu-khung cuối, tạo từ tham chiếu đa phương thức với 1-9 ảnh và tối đa 3 video tham chiếu tổng cộng 15 giây, chỉnh sửa video, kéo dài video, tạo kèm âm thanh và một công cụ tìm kiếm web; tham chiếu âm thanh phải đi kèm một ảnh hoặc video. Trả về MP4 ở 21:9, 16:9, 4:3, 1:1, 3:4 hoặc 9:16. 480p 5 giây ≈ $0,26. | |||
| doubao-seedance-2-0-mini-260615 | ByteDance | $3.5000 | mỗi 1M tokens | ByteDance Seedance 2.0 Mini — bậc nhẹ và tiết kiệm ngân sách của dòng Seedance 2.0, giới hạn ở 480p và 720p, 24 fps, 4-15 giây. Mô hình mang cùng bộ tính năng được ghi nhận như phần còn lại của dòng: văn bản sang video, hình ảnh sang video từ khung hình đầu và từ khung đầu-khung cuối, tạo từ tham chiếu đa phương thức với 1-9 ảnh và tối đa 3 video tham chiếu tổng cộng 15 giây, chỉnh sửa video, kéo dài video, tạo kèm âm thanh và một công cụ tìm kiếm web; tham chiếu âm thanh phải đi kèm một ảnh hoặc video. Trả về MP4 ở 21:9, 16:9, 4:3, 1:1, 3:4 hoặc 9:16. | |||
| doubao-seedance-2-5-260628 | ByteDance | $10.7000 | mỗi 1M tokens | ByteDance Seedance 2.5 — mô hình dòng chính của Seedance, kéo dài một lần tạo lên 4-30 giây ở 24 fps trong khi giới hạn độ phân giải ở 480p và 720p. Việc tạo từ tham chiếu đa phương thức mở rộng đến 1-30 ảnh, tối đa 10 video tham chiếu và tối đa 10 đoạn âm thanh tham chiếu (mỗi loại tổng cộng 30 giây), và khác với dòng 2.0, một tham chiếu âm thanh có thể đứng một mình. Mô hình cũng bao phủ văn bản sang video, hình ảnh sang video từ khung hình đầu và từ khung đầu-khung cuối, chỉnh sửa video, kéo dài video, tạo kèm âm thanh và một công cụ tìm kiếm web. Trả về MP4 ở 21:9, 16:9, 4:3, 1:1, 3:4 hoặc 9:16. | |||
| doubao-seedream-4-5-251128 | ByteDance | $0.03704 | mỗi lượt gọi | ByteDance Doubao Seedream 4.5 — tạo hình ảnh từ văn bản và hình ảnh thành hình ảnh với khả năng hợp nhất nhiều ảnh, cho ra một ảnh đơn hoặc một bộ ảnh liên quan. Chế độ ảnh đơn nhận riêng một prompt, một ảnh tham chiếu, hoặc 2-14 ảnh tham chiếu; chế độ theo bộ (sequential_image_generation=auto) trả về tối đa 15 ảnh từ văn bản, tối đa 14 ảnh từ một ảnh tham chiếu duy nhất, hoặc một bộ từ 2-14 ảnh tham chiếu với điều kiện tổng đầu vào cộng đầu ra không vượt quá 15. Mô hình hỗ trợ đầu ra 2K và 4K, mặc định trả về JPEG dưới dạng URL hoặc base64. Việc chỉnh sửa tương tác theo tọa độ chỉ có ở Seedream 5.0 Pro (doubao-seedream-5-0-pro-260628). | |||
| doubao-seedream-5-0-260128 | ByteDance | $0.03259 | mỗi lượt gọi | ByteDance Doubao Seedream 5.0-lite — tạo hình ảnh từ văn bản và hình ảnh thành hình ảnh với khả năng sáng tạo có kiểm soát thông minh hơn, truy xuất theo thời gian thực và giữ nhất quán chủ thể tốt hơn (độ phân giải 2K trở lên). | |||
| doubao-seedream-5-0-pro-260628 | ByteDance | $0.045 | mỗi lượt gọi | ByteDance Doubao Seedream 5.0 Pro — mô hình hình ảnh hàng đầu của nhà cung cấp cho sáng tạo có kiểm soát: tạo hình ảnh từ văn bản, hình ảnh thành hình ảnh với một ảnh tham chiếu hoặc nhiều ảnh tham chiếu (2-10 ảnh tham chiếu), chỉnh sửa tương tác bằng tọa độ, khung chọn hoặc mũi tên, và tách lớp, tức chia một ảnh thành một lớp nền cộng tối đa 16 lớp, mỗi lớp được trả về kèm kích thước, z_index và hộp giới hạn riêng (đặt layer_decomposition=true). Chỉ xuất một ảnh đơn: không có tạo theo bộ (tuần tự), tìm kiếm web hay truyền phát. Tính phí theo mỗi ảnh đầu ra, theo kịch bản sử dụng và bậc điểm ảnh: một ảnh đơn từ 2,61 MP trở xuống là giá cơ sở; trên 2,61 MP tính gấp 2 lần; ở chế độ tách lớp, mỗi lớp trả về được tính phí riêng theo hệ số 0,5 (hoặc hệ số 1 khi trên 2,61 MP); mỗi ảnh tham chiếu ngoài ảnh đầu tiên cộng thêm 1/15 giá cơ sở. | |||
| fun-asr-flash-2026-06-15 | Alibaba | $0.1260 | mỗi giờ âm thanh | Alibaba Fun-ASR Flash (2026-06-15) — nhận dạng giọng nói từ bản ghi âm với độ trễ thấp, hỗ trợ ngữ cảnh prompt và tự động phát hiện ngôn ngữ trên các phương ngữ tiếng Trung và hơn 30 ngôn ngữ. Mô hình nhận âm thanh dạng URL, Base64 hoặc tệp tải lên AAC/AMR/AVI/FLAC/FLV/M4A/MKV/MOV/MP3/MP4/MPEG/OGG/OPUS/WAV/WEBM/WMA/WMV, tối đa 5 phút và 2 GB. | |||
| gemini-2.5-flash-image | $0.3000 | $2.5000 | $0.2100 | $1.7500 | mỗi 1M tokens | Google Gemini 2.5 Flash Image (Nano Banana) — mô hình tạo và chỉnh sửa hình ảnh gốc, tốc độ nhanh, dành cho các quy trình sáng tạo. Mô hình nhận đầu vào văn bản và hình ảnh, trả về hình ảnh qua endpoint chat completions tương thích OpenAI, với giới hạn 65.536 token đầu vào và 32.768 token đầu ra. | |
| gemini-2.5-pro | $1.2500 | $10.0000 | $0.8125 | $6.5000 | mỗi 1M tokens | Google Gemini 2.5 Pro — mô hình bậc suy luận của dòng 2.5, với cửa sổ ngữ cảnh 1M token. Các prompt vượt quá 200.000 token được tính lại theo đơn giá ngữ cảnh dài của nhà cung cấp cho toàn bộ yêu cầu, khớp với quy tắc của chính Google. | |
| gemini-3-pro-image | $2.0000 | $12.0000 | $1.4000 | $8.4000 | mỗi 1M tokens | Google Gemini 3 Pro Image (Nano Banana Pro) — mô hình cao cấp vận hành dựa trên suy luận, dành cho tạo hình ảnh chuyên nghiệp và chỉnh sửa theo hội thoại. Mô hình vượt trội ở thiết kế đồ họa phức tạp, mockup sản phẩm có độ trung thực cao, dựng chữ đa ngôn ngữ chính xác, nhất quán thương hiệu và các hình ảnh trực quan hóa dựa trên dữ kiện được grounding bằng Google Search. Mô hình nhận văn bản và hình ảnh, trả về văn bản và hình ảnh, hỗ trợ tư duy và tạo đầu ra 1K, 2K hoặc 4K. | |
| gemini-3.1-flash-image | $0.5000 | $3.0000 | $0.3500 | $2.1000 | mỗi 1M tokens | Google Gemini 3.1 Flash Image (Nano Banana 2) — mô hình bản ổn định, độ trễ thấp cho việc tạo hình ảnh chất lượng cao và chỉnh sửa theo hội thoại. Mô hình nhận văn bản, hình ảnh và PDF, hỗ trợ tư duy cùng tra cứu grounding bằng tìm kiếm, và có thể tạo ảnh 0,5K, 1K, 2K hoặc 4K cho các quy trình sản xuất khối lượng lớn. | |
| gemini-3.1-flash-lite-image | $0.2500 | $1.5000 | $0.1750 | $1.0500 | mỗi 1M tokens | Google Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — mô hình độ trễ cực thấp, tiết kiệm chi phí cho việc tạo hình ảnh khối lượng lớn và chỉnh sửa nhiều lượt nhanh. Mô hình nhận văn bản và hình ảnh, tạo ảnh 1K, hỗ trợ tư duy cùng chỉnh sửa theo hội thoại, và được thiết kế cho các ứng dụng tương tác dành cho nhà phát triển và người dùng cuối. | |
| gemini-3.5-flash | $1.5000 | $9.0000 | $1.0500 | $6.3000 | mỗi 1M tokens | Google Gemini 3.5 Flash — mô hình đa phương thức bản ổn định, tối ưu cho hiệu năng tác nhân bền bỉ, vòng lặp lập trình nhanh, triển khai tác nhân con và các quy trình nhiều bước chạy dài. Mô hình nhận văn bản, hình ảnh, video, âm thanh và PDF, hỗ trợ tư duy cùng công cụ tích hợp sẵn, đồng thời cung cấp 1.048.576 token ngữ cảnh đầu vào với tối đa 65.536 token đầu ra. | |
| gemini-3.6-flash | $0.7500 | $3.7500 | $0.5250 | $2.6250 | mỗi 1M tokens | Google Gemini 3.6 Flash — mô hình suy luận đa phương thức bản ổn định, cân bằng giữa tốc độ và trí tuệ cho các tác vụ tác nhân và thực tế, với 1.048.576 token ngữ cảnh đầu vào và giới hạn 65.536 token đầu ra. Mô hình nhận văn bản, hình ảnh, video, âm thanh và PDF, đồng thời hỗ trợ tư duy, gọi hàm, thực thi mã, tra cứu grounding bằng tìm kiếm, đầu ra có cấu trúc và Computer Use (bản xem trước). Lưu ý về giá: giá niêm yết của Google cho mô hình này là giá khuyến mãi áp dụng đến hết ngày 31 tháng 12 năm 2026 — $0,75 đầu vào / $3,75 đầu ra / $0,075 đầu vào từ bộ nhớ đệm trên mỗi 1M token. Từ ngày 1 tháng 1 năm 2027, giá niêm yết của nhà cung cấp trở về $1,50 / $7,50 / $0,15, và giá của chúng tôi đi theo ở cùng mức ngang giá. | |
| gemini-3.7-flash | $0.7500 | $3.7500 | $0.5250 | $2.6250 | mỗi 1M tokens | Google Gemini 3.7 Flash — mô hình suy luận đa phương thức bậc Flash mới nhất, tính giá giống hệt 3.6 Flash trong thời gian khuyến mãi của nhà cung cấp. Mô hình nhận văn bản, hình ảnh, video, âm thanh và PDF; hỗ trợ tư duy, gọi hàm, thực thi mã, tra cứu grounding bằng tìm kiếm và đầu ra có cấu trúc. Lưu ý về giá: giá niêm yết của Google cho mô hình này là giá khuyến mãi áp dụng đến hết ngày 31 tháng 12 năm 2026 — $0,75 đầu vào / $3,75 đầu ra / $0,075 đầu vào từ bộ nhớ đệm trên mỗi 1M token. Từ ngày 1 tháng 1 năm 2027, giá niêm yết của nhà cung cấp trở về $1,50 / $7,50 / $0,15, và giá của chúng tôi đi theo ở cùng mức ngang giá. | |
| gemini-3.8-flash | $0.7500 | $3.7500 | $0.4875 | $2.4375 | mỗi 1M tokens | Google Gemini 3.8 Flash — mô hình Gemini đa phương thức tốc độ cao của Google, có thể gọi tại đây qua cả endpoint tương thích OpenAI lẫn endpoint Gemini gốc. Giá token tiêu chuẩn là $0,75 đầu vào, $0,075 đầu vào từ bộ nhớ đệm và $3,75 đầu ra trên mỗi 1M token. | |
| glm-5 | Zhipu AI | $1.0000 | $3.2000 | $0.9500 | $3.0400 | mỗi 1M tokens | Zhipu GLM-5 — mô hình MoE 744B tham số với 40B tham số hoạt động, huấn luyện trên 28,5T token và sử dụng DeepSeek Sparse Attention, với cửa sổ ngữ cảnh 200K và tối đa 128K token đầu ra. Vào văn bản, ra văn bản. Hỗ trợ nhiều chế độ tư duy, gọi hàm, đầu ra JSON có cấu trúc, truyền phát, bộ nhớ đệm ngữ cảnh và tích hợp công cụ MCP. |
| glm-5-turbo | Zhipu AI | $1.2000 | $4.0000 | $1.1400 | $3.8000 | mỗi 1M tokens | Zhipu GLM-5-Turbo — biến thể GLM-5 thiên về thông lượng, tối ưu cho các quy trình tác nhân: gọi công cụ và kỹ năng ổn định hơn qua các tác vụ nhiều bước, xử lý tốt hơn những chỉ dẫn dài và phức tạp, cùng khả năng thực thi tác vụ theo lịch hoặc chạy dài. Cửa sổ ngữ cảnh 200K, tối đa 128K token đầu ra, vào văn bản và ra văn bản. Hỗ trợ các chế độ tư duy, gọi hàm, đầu ra JSON có cấu trúc, truyền phát, bộ nhớ đệm ngữ cảnh và tích hợp công cụ MCP. |
| glm-5.1 | Zhipu AI | $1.4000 | $4.4000 | $1.1200 | $3.5200 | mỗi 1M tokens | Zhipu GLM-5.1 — mô hình nền chủ lực xây dựng cho công việc tự chủ kéo dài: nhà cung cấp ghi nhận khả năng thực thi liên tục không cần giám sát trên một tác vụ duy nhất trong tối đa 8 giờ, xuyên suốt các khâu lập kế hoạch, thực thi, kiểm thử và tối ưu lặp. Cửa sổ ngữ cảnh 200K, tối đa 128K token đầu ra, vào văn bản và ra văn bản. Hỗ trợ nhiều chế độ tư duy, gọi hàm, đầu ra JSON có cấu trúc, truyền phát, bộ nhớ đệm ngữ cảnh và tích hợp công cụ MCP. |
| glm-5.2 | Zhipu AI | $1.4000 | $4.4000 | $1.1200 | $3.5200 | mỗi 1M tokens | Zhipu GLM-5.2 — mô hình nền chủ lực chuyên cho công việc của tác nhân lập trình dài hơi, đạt được qua nhiều tháng huấn luyện chuyên biệt chứ không chỉ bằng việc nới rộng ngữ cảnh, với cửa sổ ngữ cảnh 1M token và tối đa 128K token đầu ra. Vào văn bản, ra văn bản. Hỗ trợ nhiều chế độ tư duy, gọi hàm, đầu ra JSON có cấu trúc, truyền phát, bộ nhớ đệm ngữ cảnh và tích hợp công cụ MCP. |
| glm-5.3 | Zhipu AI | $1.4000 | $4.4000 | $0.9100 | $2.8600 | mỗi 1M tokens | Zhipu GLM-5.3 — mô hình chủ lực cho lập trình và tác nhân, được hậu huấn luyện trên cùng nền tảng với GLM-5.2: tăng 50% trên bộ đánh giá lập trình nội bộ của Zhipu, đạt SOTA nguồn mở trên Terminal-Bench 3.0 và Agents' Last Exam, cùng kết quả phát hiện lỗ hổng đạt mức tiên tiến nhất trên CyberGym, với cửa sổ ngữ cảnh 1M token và tối đa 128K token đầu ra. Vào văn bản, ra văn bản. Hỗ trợ nhiều chế độ tư duy, gọi hàm, đầu ra JSON có cấu trúc, truyền phát, bộ nhớ đệm ngữ cảnh và tích hợp công cụ MCP. |
| glm-5.3-flash | Zhipu AI | $0.1500 | $0.5000 | $0.1350 | $0.4500 | mỗi 1M tokens | Zhipu GLM-5.3-Flash — mô hình đa phương thức gốc đầu tiên trong dòng GLM-5 và là bậc tiên phong chi phí thấp của dòng này: 320B tham số tổng với 18B tham số hoạt động, trên kiến trúc attention lai tuyến tính + thưa giúp cắt giảm khối lượng tính toán attention và KV cache nhiều lần so với GLM-5.3, đồng thời giảm một nửa cả số tham số hoạt động lẫn số lớp so với GLM-4.5. Mô hình nhận văn bản, hình ảnh và video; trả về văn bản. (Nhà cung cấp cũng quảng bá khả năng nhận đầu vào tệp, nhưng chưa được kiểm chứng ở đây nên không được cung cấp.) Cửa sổ ngữ cảnh 1M token và tối đa 128K token đầu ra. Hỗ trợ các chế độ tư duy, gọi hàm, đầu ra JSON có cấu trúc, truyền phát, bộ nhớ đệm ngữ cảnh và tích hợp công cụ MCP. Được định vị cho lập trình dựa trên thị giác — công việc front-end, game và 3D, nơi mô hình tự kiểm tra kết quả kết xuất của chính mình rồi lặp lại cải tiến. |
| glm-5v-turbo | Zhipu AI | $1.2000 | $4.0000 | $1.1400 | $3.8000 | mỗi 1M tokens | Zhipu GLM-5V-Turbo — mô hình suy luận đa phương thức cho hình ảnh, video, tệp, lập trình và các quy trình tác nhân dựa trên công cụ. |
| glm-image | Zhipu AI | $0.015 | $0.01425 | mỗi lượt gọi | Zhipu GLM-Image — tạo hình ảnh dựa trên kiến trúc lai kết hợp phần hiểu tự hồi quy với phần giải mã khuếch tán, là mô hình đa phương thức SOTA đầu tiên được huấn luyện đầu-cuối trên chip do Trung Quốc sản xuất (Huawei Ascend). Mô hình đọc hiểu chỉ dẫn thay vì từ khóa và tự điền những chi tiết mà prompt để ngầm, với khả năng dựng chữ (đặc biệt là chữ Hán) và xử lý các cảnh đòi hỏi nhiều tri thức mạnh hơn rõ rệt. Mỗi yêu cầu tạo một ảnh. | ||
| glm-tts | Zhipu AI | $0.3500 | $0.3150 | mỗi 10 nghìn ký tự | Zhipu GLM-TTS — chuyển văn bản thành giọng nói dựa trên kiến trúc sinh hai giai đoạn với học tăng cường GRPO, suy ra cảm xúc và ngữ điệu từ văn bản xung quanh thay vì đòi hỏi đánh dấu tường minh. Mô hình có bảy giọng dựng sẵn (mặc định là tongtong, cùng xiaochen, chuichui, jam, kazi, douji, luodo) với tốc độ và âm lượng điều chỉnh được, nhận tối đa 1024 ký tự mỗi yêu cầu và truyền phát với độ trễ khung đầu tiên dưới 400 ms. Trả về wav hoặc pcm ở tần số lấy mẫu khuyến nghị 24 kHz; truyền phát chỉ hỗ trợ pcm. | ||
| gpt-5.5 | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | mỗi 1M tokens | OpenAI GPT-5.5 — mô hình suy luận tiên phong cho lập trình phức tạp và công việc chuyên môn. Hỗ trợ đầu vào văn bản và hình ảnh, gọi hàm cùng công cụ tích hợp sẵn, cửa sổ ngữ cảnh 1.050.000 token, tối đa 128.000 token đầu ra và mức suy luận từ none đến xhigh. |
| gpt-5.6-luna | OpenAI | $0.2000 | $1.2000 | $0.1700 | $1.0200 | mỗi 1M tokens | OpenAI GPT-5.6 Luna — bậc nhanh nhất và tiết kiệm nhất của GPT-5.6, tối ưu cho khối lượng lớn và nhạy cảm về chi phí trong khi vẫn giữ khả năng suy luận, thị giác và sử dụng công cụ. Hỗ trợ đầu vào văn bản và hình ảnh, cửa sổ ngữ cảnh 1.050.000 token và tối đa 128.000 token đầu ra. |
| gpt-5.6-sol | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | mỗi 1M tokens | OpenAI GPT-5.6 Sol — mô hình chủ lực của dòng GPT-5.6 cho suy luận tiên phong, công việc chuyên môn phức tạp, lập trình, khoa học, an ninh mạng và các quy trình tác nhân dài hơi. Hỗ trợ đầu vào văn bản và hình ảnh, công cụ tích hợp sẵn, cửa sổ ngữ cảnh 1.050.000 token, tối đa 128.000 token đầu ra và mức suy luận sâu nhất trong dòng này. |
| gpt-5.6-terra | OpenAI | $2.0000 | $12.0000 | $1.6000 | $9.6000 | mỗi 1M tokens | OpenAI GPT-5.6 Terra — mô hình GPT-5.6 cân bằng cho công việc chuyên môn hằng ngày, mang lại trí tuệ và hiệu năng tác nhân lập trình mạnh với chi phí thấp hơn Sol. Hỗ trợ đầu vào văn bản và hình ảnh, công cụ tích hợp sẵn, cửa sổ ngữ cảnh 1.050.000 token và tối đa 128.000 token đầu ra. |
| gpt-6-astra | OpenAI | $10.0000 | $50.0000 | $7.0000 | $35.0000 | mỗi 1M tokens | OpenAI GPT-6 Astra — mô hình có năng lực cao nhất của OpenAI, được xây dựng cho những công việc đầu-cuối khó nhất: suy luận phức tạp, lập trình, sử dụng máy tính, nghiên cứu và tạo tài liệu. Hỗ trợ đầu vào văn bản và hình ảnh, cửa sổ ngữ cảnh 1.050.000 token, tối đa 128.000 token đầu ra và các mức suy luận lên tới xhigh và max. |
| gpt-6-luna | OpenAI | $0.1000 | $0.5000 | $0.0650 | $0.3250 | mỗi 1M tokens | OpenAI GPT-6 Luna — mô hình hiệu quả nhất của OpenAI, được xây dựng cho các tác vụ tập trung với khối lượng lớn. Hỗ trợ đầu vào văn bản và hình ảnh, cửa sổ ngữ cảnh 1.050.000 token, tối đa 128.000 token đầu ra và mức suy luận từ none đến max, mặc định là medium. Hãy dùng /v1/responses để gọi công cụ: trên /v1/chat/completions, gọi hàm chỉ hoạt động khi reasoning_effort được đặt là none. Trên /v1/responses, hãy gửi toàn bộ cuộc hội thoại trong mảng input ở mỗi lượt; các yêu cầu chứa previous_response_id hoặc conversation sẽ bị từ chối. |
| gpt-6-sol | OpenAI | $2.0000 | $10.0000 | $1.3000 | $6.5000 | mỗi 1M tokens | OpenAI GPT-6 Sol — được xây dựng cho lập trình phức tạp và quy trình làm việc dạng agent. Hỗ trợ đầu vào văn bản và hình ảnh, cửa sổ ngữ cảnh 1.050.000 token, tối đa 128.000 token đầu ra và mức suy luận từ none đến max, mặc định là medium. Hãy dùng /v1/responses để gọi công cụ: trên /v1/chat/completions, gọi hàm chỉ hoạt động khi reasoning_effort được đặt là none. Trên /v1/responses, hãy gửi toàn bộ cuộc hội thoại trong mảng input ở mỗi lượt; các yêu cầu chứa previous_response_id hoặc conversation sẽ bị từ chối. |
| gpt-6.1-sol | OpenAI | $2.0000 | $10.0000 | $1.3000 | $6.5000 | mỗi 1M tokens | OpenAI GPT-6.1 Sol — tiệm cận GPT-6 Astra về lập trình phức tạp, sử dụng máy tính và công việc chuyên môn, với chi phí thấp hơn. Hỗ trợ đầu vào văn bản và hình ảnh, cửa sổ ngữ cảnh 1.050.000 token và tối đa 128.000 token đầu ra. Mức suy luận từ low đến max, mặc định là medium; không hỗ trợ none và minimal, và token suy luận được tính phí như đầu ra. Khi đầu vào vượt quá 272.000 token, mọi token trong yêu cầu đó được tính theo đơn giá ngữ cảnh dài. Hãy dùng /v1/responses để gọi công cụ; /v1/chat/completions không hỗ trợ gọi công cụ. Trên /v1/responses, hãy gửi toàn bộ cuộc hội thoại trong mảng input ở mỗi lượt; các yêu cầu chứa previous_response_id hoặc conversation sẽ bị từ chối. |
| gpt-image-2 | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | mỗi 1M tokens | OpenAI GPT Image 2 — mô hình tạo và chỉnh sửa hình ảnh tiên tiến nhất cho đầu ra nhanh, chất lượng cao. Mô hình nhận đầu vào văn bản và hình ảnh, hỗ trợ kích thước ảnh linh hoạt và đầu vào ảnh độ trung thực cao, đồng thời tính phí theo token thay vì theo lượt gọi: $5 đầu vào văn bản, $1,25 đầu vào văn bản từ bộ nhớ đệm, $8 đầu vào hình ảnh và $30 đầu ra hình ảnh trên mỗi 1M token. |
| gpt-image-2.5-flare | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | mỗi 1M tokens | OpenAI GPT Image 2.5 Flare — mô hình tạo và chỉnh sửa hình ảnh thuộc dòng GPT Image 2.5 của OpenAI. Flare và gpt-image-2.5-sunburst là hai bản dựng riêng biệt, không phải bí danh của cùng một mô hình, và được bán với cùng mức giá; các bảng xếp hạng công khai chấm điểm riêng cho từng bản. Giá token tiêu chuẩn là $5 đầu vào văn bản, $1,25 đầu vào từ bộ nhớ đệm, $8 đầu vào hình ảnh và $30 đầu ra hình ảnh trên mỗi 1M token. |
| gpt-image-2.5-sunburst | OpenAI | $5.0000 | $30.0000 | $4.0000 | $24.0000 | mỗi 1M tokens | OpenAI GPT Image 2.5 Sunburst — mô hình tạo và chỉnh sửa hình ảnh thuộc dòng GPT Image 2.5 của OpenAI. Sunburst và gpt-image-2.5-flare là hai bản dựng riêng biệt, không phải bí danh của cùng một mô hình, và được bán với cùng mức giá; các bảng xếp hạng công khai chấm điểm riêng cho từng bản. Giá token tiêu chuẩn là $5 đầu vào văn bản, $1,25 đầu vào từ bộ nhớ đệm, $8 đầu vào hình ảnh và $30 đầu ra hình ảnh trên mỗi 1M token. |
| grok-4.7 | xAI | $2.0000 | $6.0000 | $0.8000 | $2.4000 | mỗi 1M tokens | xAI Grok 4.7 — mô hình tiên phong được xây dựng cho lập trình, tác vụ dạng agent và công việc tri thức. Hỗ trợ đầu vào văn bản và hình ảnh, với cửa sổ ngữ cảnh 500.000 token. Không thể tắt suy luận: reasoning_effort cho phép chọn low, medium, high hoặc xhigh, mặc định là high, và token suy luận được tính phí như đầu ra. Khi prompt đạt 200.000 token, mọi token trong yêu cầu đó được tính theo đơn giá ngữ cảnh dài. Chỉ chấp nhận công cụ function; các công cụ phía máy chủ của xAI như tìm kiếm web, tìm kiếm X và thực thi mã không khả dụng, và các yêu cầu có chứa chúng sẽ bị từ chối. Trên /v1/responses, hãy gửi toàn bộ cuộc hội thoại trong mảng input ở mỗi lượt và gửi lại nguyên vẹn các mục suy luận đã mã hóa từ các phản hồi trước; các yêu cầu chứa previous_response_id hoặc conversation sẽ bị từ chối. |
| happyhorse-1.1-i2v | Alibaba | $0.140 | mỗi giây | Alibaba HappyHorse 1.1 (I2V) — hình ảnh sang video với chất liệu tốt hơn, giữ nhất quán danh tính nhân vật giữa các đoạn, chuyển động mượt và đồng bộ hình-tiếng. 720P/1080P. | |||
| happyhorse-1.1-r2v | Alibaba | $0.140 | mỗi giây | Alibaba HappyHorse 1.1 (R2V) — tạo video từ ảnh tham chiếu với tối đa 9 ảnh, giữ nhất quán chủ thể/bối cảnh/phong cách tốt và điều khiển được góc máy. 720P/1080P. | |||
| happyhorse-1.1-t2v | Alibaba | $0.140 | mỗi giây | Alibaba HappyHorse 1.1 (T2V) — tạo video từ văn bản với khả năng hiểu ngữ nghĩa, điều khiển góc máy và sinh động tốt hơn. Video 720P/1080P mượt mà, giàu chi tiết và nhất quán về vật lý. | |||
| hy-mt2-lite | Tencent | $0.0440 | $0.1770 | mỗi 1M tokens | Tencent HY-MT2 Lite — bậc dịch đa ngôn ngữ tối ưu cho độ trễ và chi phí, qua giao thức OpenAI Chat Completions. Tối đa 4K token đầu vào và 4K token đầu ra; chỉ xử lý văn bản. | ||
| hy-mt2-plus | Tencent | $0.0740 | $0.2950 | mỗi 1M tokens | Tencent HY-MT2 Plus — bậc dịch đa ngôn ngữ có khả năng tuân theo chỉ dẫn, qua giao thức OpenAI Chat Completions. Tối đa 4K token đầu vào và 4K token đầu ra; chỉ xử lý văn bản. | ||
| hy-mt2-pro | Tencent | $0.0740 | $0.2950 | mỗi 1M tokens | Tencent HY-MT2 Pro — bậc dịch máy chủ lực cho bản dịch đa ngôn ngữ chất lượng cao, qua giao thức OpenAI Chat Completions. Tối đa 4K token đầu vào và 4K token đầu ra; chỉ xử lý văn bản. | ||
| hy3 | Tencent | $0.1320 | $0.5280 | mỗi 1M tokens | Tencent Hunyuan 3 (Hy3) — mô hình MoE 295B tham số (21B hoạt động), ngữ cảnh 256K gốc, ba chế độ tư duy (fast / low / deep). Mạnh ở tác nhân lập trình, hiểu tài liệu dài, giữ ngữ cảnh qua nhiều lượt và quy trình tác nhân nhiều bước. Chỉ xử lý văn bản. | ||
| hy4-preview | Tencent | $0.8340 | $2.5010 | mỗi 1M tokens | Tencent Hunyuan 4 preview (Hy4 preview) — cửa sổ ngữ cảnh 1M token (đầu vào tối đa 960K, đầu ra tối đa 64K) với tư duy sâu (Tencent gọi là preserved thinking, tức tư duy được lưu giữ), đầu ra có cấu trúc, gọi hàm và bộ nhớ đệm prompt. Chỉ xử lý văn bản. SKU bản xem trước: Tencent sẽ ngừng cung cấp mô hình xem trước khi phiên bản phát hành rộng rãi của nó ra mắt. | ||
| jev-1.13 | TypeSafe | $0.0462 | mỗi 1M tokens | TypeSafe Jev 1.13 — mô hình ra quyết định System One, không phải mô hình chat. Gửi state của ứng dụng (chuỗi, đối tượng JSON hoặc mảng) cùng một bộ câu hỏi có kiểu tới POST /v1/systemone — choice (chọn một trong các lựa chọn bạn đưa ra), score (xếp vào các mức có thứ tự bạn định nghĩa) hoặc noul (xác suất một mệnh đề có/không là đúng) — và nhận về câu trả lời có kiểu kèm xác suất cho từng lựa chọn và một giá trị độ tin cậy, thường trong 70–500 ms. Mọi câu hỏi được đánh giá song song trên cùng một state, nên có thể gộp nhiều câu hỏi vào một yêu cầu. SDK chính thức của TypeSafe cho Python và JavaScript dùng được ngay khi đặt base URL là https://api.chinaapi.ai. Tính phí theo token đầu vào; đầu ra miễn phí. Chỉ nhận đầu vào văn bản, tối đa 32K token mỗi yêu cầu; ngôn ngữ chính là tiếng Anh, vì vậy hãy thử nghiệm các ngôn ngữ khác trước khi dựa vào chúng. | |||
| jev-latest | TypeSafe | $0.0462 | mỗi 1M tokens | TypeSafe Jev (latest) — bí danh mà SDK của TypeSafe gọi khi không chỉ định model. Hiện nó phục vụ jev-1.13, cùng giá và cùng hợp đồng System One trên POST /v1/systemone: đầu vào là state cùng các câu hỏi có kiểu choice, score và noul; đầu ra là câu trả lời có kiểu kèm xác suất và độ tin cậy. Trường model trong phản hồi cho biết phiên bản đã trả lời. Chúng tôi chỉ chuyển bí danh sang bản phát hành Jev mới sau khi kiểm tra giá, vì vậy hãy cố định jev-1.13 nếu bạn đã tinh chỉnh ngưỡng theo phiên bản này. | |||
| kimi-k2.6 | Moonshot | $0.9500 | $4.0000 | $0.7600 | $3.2000 | mỗi 1M tokens | Moonshot Kimi K2.6 — mô hình đa dụng cho hội thoại, sinh mã, hiểu hình ảnh và các tác vụ tác nhân, với khả năng viết mã dài hơi và thực thi tự chủ mạnh hơn thế hệ trước. Cửa sổ ngữ cảnh 256K, mặc định 32.768 token đầu ra. Mô hình nhận văn bản, hình ảnh (png, jpeg, webp, gif) và video (mp4, mov, webm và nhiều định dạng khác) dưới dạng nội dung base64, trả về văn bản. Chế độ tư duy bật theo mặc định và có thể tắt; temperature cố định ở 1.0 khi có tư duy và 0.6 khi không. |
| kimi-k2.7-code | Moonshot | $0.9500 | $4.0000 | $0.7600 | $3.2000 | mỗi 1M tokens | Moonshot Kimi K2.7 Code — mô hình lập trình chuyên dụng của Kimi, mà theo đo đạc của nhà cung cấp đã cải thiện mức tuân thủ chỉ dẫn và khả năng lập trình dài hơi so với K2.6, đồng thời giảm khoảng 30% mức suy nghĩ thừa tính trung bình. Cửa sổ ngữ cảnh 256K, mặc định 32.768 token đầu ra. Mô hình nhận văn bản, hình ảnh và video dưới dạng nội dung base64, trả về văn bản. Tư duy là bắt buộc và sẽ báo lỗi nếu bị tắt; tool_choice chỉ nhận auto hoặc none, còn reasoning_content phải được mang theo xuyên suốt các lượt gọi công cụ nhiều bước. |
| kimi-k2.7-code-highspeed | Moonshot | $1.9000 | $8.0000 | mỗi 1M tokens | Moonshot Kimi K2.7 Code Highspeed — bậc thông lượng của K2.7 Code, phục vụ cùng một mô hình ở khoảng 180 token mỗi giây và lên tới 260 trong các tác vụ ngữ cảnh ngắn. Cửa sổ ngữ cảnh 256K, mặc định 32.768 token đầu ra. Mô hình nhận văn bản, hình ảnh và video dưới dạng nội dung base64, trả về văn bản. Tư duy là bắt buộc và sẽ báo lỗi nếu bị tắt; tool_choice chỉ nhận auto hoặc none, còn reasoning_content phải được mang theo xuyên suốt các lượt gọi công cụ nhiều bước. | ||
| kimi-k3 | Moonshot | $3.0000 | $15.0000 | $1.9500 | $9.7500 | mỗi 1M tokens | Moonshot Kimi K3 — mô hình chủ lực 2,8 nghìn tỷ tham số cho lập trình dài hơi, công việc tri thức đầu-cuối và suy luận sâu, với cửa sổ ngữ cảnh 1M token và tối đa 1.048.576 token hoàn thành (mặc định 131.072). Mô hình nhận văn bản, ảnh mã hóa base64 và video mã hóa base64, trả về văn bản. Tư duy luôn bật, với mức nỗ lực suy luận mặc định là max; temperature cố định ở 1.0. Hỗ trợ gọi công cụ tùy chỉnh và nạp công cụ động. |
| kling-3.0-turbo | Kuaishou | $0.560 | mỗi lượt gọi | Kuaishou Kling 3.0 Turbo — bậc giá trị của dòng Kling 3.0, tạo video 720P hoặc 1080P (mặc định 720P) dài 3-15 giây (mặc định 5) theo tỷ lệ 16:9, 9:16 hoặc 1:1, từ một prompt hoặc một ảnh khung hình đầu. Âm thanh gốc luôn đi kèm và không có công tắc bật/tắt. So với kling-v3, mô hình này bỏ bậc 4K, khả năng điều khiển khung hình cuối và đầu vào video để đổi lấy tốc độ cùng chi phí. 720p 5 giây có âm thanh ≈ $0,56. | |||
| kling-v3 | Kuaishou | $0.420 | mỗi lượt gọi | Kuaishou Kling 3.0 — văn bản sang video và hình ảnh sang video với âm thanh gốc và khả năng giữ nhất quán các yếu tố tốt hơn. Clip dài 3-15 giây (mặc định 5) theo tỷ lệ 16:9, 9:16 hoặc 1:1, với bậc chất lượng chọn qua mode: std cho 720P, pro cho 1080P và 4k cho 4K gốc. Âm thanh phải bật thủ công qua sound=on và mặc định là tắt; hình ảnh sang video nhận một khung hình đầu kèm khung hình cuối tùy chọn. Từ $0,083/giây (720p). | |||
| kling-v3-omni | Kuaishou | $0.420 | mỗi lượt gọi | Kling 3.0 Omni — tạo video từ nhiều ảnh tham chiếu. Giá niêm yết là của bậc std (720p, 5 giây, không âm thanh, không video tham chiếu). Các yêu cầu không đặt mode sẽ dùng bậc pro mặc định của nhà cung cấp và bị tính phí gấp 1,33 lần — khoảng $0,56 cho cùng đoạn 5 giây; bậc 4k tính phí gấp 5 lần. Hãy truyền mode=std để được tính đúng giá niêm yết. | |||
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | mỗi 1M tokens | Meituan LongCat-2.0 — mô hình MoE nguồn mở 1,6T tham số với ngữ cảnh 1M gốc, được xây dựng cho lập trình theo hướng tác nhân và sử dụng công cụ dài hơi. Mô hình suy luận chỉ xử lý văn bản. | ||
| M2-her | MiniMax | $0.3000 | $1.2000 | mỗi 1M tokens | MiniMax M2-her — mô hình hội thoại được xây dựng cho nhập vai và trò chuyện nhiều lượt, với cửa sổ ngữ cảnh 65.536 token và câu trả lời giới hạn ở 2.048 token (max_completion_tokens). Ngoài system / user / assistant, mô hình còn nhận các vai trò tin nhắn mở rộng của nhà cung cấp trên endpoint chat tương thích OpenAI: user_system (persona của người dùng), group (tên cuộc hội thoại) và sample_message_user / sample_message_ai (các lượt trao đổi mẫu giúp định hướng phong cách trả lời). Mọi tin nhắn dùng vai trò mở rộng đều phải có trường name; nếu thiếu, nhà cung cấp sẽ từ chối toàn bộ yêu cầu với lỗi 2013, trong khi các tin nhắn system/user/assistant thông thường không cần name. Chỉ xử lý văn bản: không nhận đầu vào hình ảnh, và tài liệu của nhà cung cấp không đề cập gọi công cụ hay bộ nhớ đệm. Mỗi lệnh gọi mang thêm khoảng 170 token persona phát sinh ở phía nhà cung cấp, ngoài prompt hiển thị, và được tính phí như đầu vào. | ||
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | mỗi 1M tokens | Xiaomi MiMo-V2.5 — mô hình toàn phương thức gốc với ngữ cảnh 1M và đầu ra tối đa 128K, hiểu hình ảnh, video, âm thanh và văn bản trong cùng một mô hình. Hỗ trợ tư duy sâu, gọi hàm, đầu ra có cấu trúc và tìm kiếm web, kèm năng lực tác nhân toàn phương thức. | ||
| mimo-v2.5-asr | Xiaomi | $0.0740 | mỗi giờ âm thanh | Xiaomi MiMo v2.5 ASR — mô hình nhận dạng giọng nói tối ưu cho tiếng Trung, tiếng Anh cùng các phương ngữ tiếng Trung, xử lý được âm thanh nhiễu, thu xa, nhiều người nói cũng như phiên âm lời bài hát. | |||
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | mỗi 1M tokens | Xiaomi MiMo-V2.5-Pro — mô hình chủ lực nghìn tỷ tham số (42B hoạt động) với ngữ cảnh 1M và đầu ra tối đa 128K, được tinh chỉnh cho khối lượng công việc tác nhân cường độ cao. Hỗ trợ tư duy sâu, gọi hàm, đầu ra có cấu trúc và tìm kiếm web. Chỉ sinh văn bản: khác với mimo-v2.5, danh sách năng lực của nhà cung cấp không bao gồm khả năng hiểu toàn phương thức. | ||
| mimo-v2.5-tts | Xiaomi | $0.0000 | mỗi 10 nghìn ký tự | Xiaomi MiMo v2.5 TTS — chuyển văn bản thành giọng nói giàu biểu cảm với tám giọng dựng sẵn, bốn giọng tiếng Trung và bốn giọng tiếng Anh (Mia, Chloe, Milo, Dean), bao phủ tiếng Trung và tiếng Anh cùng các phong cách phương ngữ Đông Bắc, Tứ Xuyên, Hà Nam và Quảng Đông. Cách thể hiện được điều khiển theo hai hướng: chỉ dẫn phong cách bằng ngôn ngữ tự nhiên, và thẻ âm thanh nội tuyến cho cảm xúc cơ bản lẫn cảm xúc phức hợp, hơi thở, tiếng thở dài và nhịp điệu, bao gồm cả chế độ hát chỉ riêng mô hình này có trong dòng MiMo TTS. Trả về wav hoặc pcm16 đơn kênh ở 24 kHz và hỗ trợ truyền phát độ trễ thấp, vốn đòi hỏi pcm16. Ngữ cảnh 8K và đầu ra tối đa 8K. | |||
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | mỗi 10 nghìn ký tự | Xiaomi MiMo v2.5 TTS VoiceClone — mô hình nhân bản giọng nói: cung cấp một mẫu âm thanh tham chiếu dưới dạng data URL trong trường voice (data:{mime};base64,...) và mô hình sẽ tổng hợp lời nói bằng giọng đó mà không cần bước huấn luyện, gán nhãn hay tinh chỉnh nào. Mô hình nhận MP3 (audio/mpeg) hoặc WAV, với chuỗi mã hóa base64 giới hạn ở 10 MB; Xiaomi không công bố thời lượng tối thiểu của âm thanh tham chiếu. Chỉ dẫn phong cách bằng ngôn ngữ tự nhiên và thẻ âm thanh nội tuyến được kế thừa từ mimo-v2.5-tts, nhưng không có truyền phát — yêu cầu chạy ở chế độ tương thích và chỉ trả về sau khi tổng hợp xong. | |||
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | mỗi 10 nghìn ký tự | Xiaomi MiMo v2.5 TTS VoiceDesign — mô hình thiết kế giọng nói: mô tả giọng nói mong muốn bằng ngôn ngữ tự nhiên trong trường instructions và mô hình sẽ tổng hợp lời nói bằng chính giọng đã thiết kế đó. | |||
| mimo-v2.6-flash | Xiaomi | $0.1400 | $0.2800 | $0.1260 | $0.2520 | mỗi 1M tokens | Xiaomi MiMo-V2.6-Flash — mô hình suy luận hiệu quả, chi phí thấp với trọng số mở, toàn phương thức gốc: một mô hình hiểu hình ảnh, video, âm thanh và văn bản. Ngữ cảnh 1M và đầu ra tối đa 128K, hỗ trợ tư duy sâu, gọi hàm và đầu ra có cấu trúc. Hướng tới khối lượng công việc chuyên môn hằng ngày với quy mô lớn, nơi chi phí và thông lượng là quan trọng. |
| mimo-v2.6-pro | Xiaomi | $0.4350 | $0.8700 | $0.3915 | $0.7830 | mỗi 1M tokens | Xiaomi MiMo-V2.6-Pro — mô hình suy luận chủ lực nghìn tỷ tham số của Xiaomi với trọng số mở, toàn phương thức gốc: một mô hình hiểu hình ảnh, video, âm thanh và văn bản. Ngữ cảnh 1M và đầu ra tối đa 128K, hỗ trợ tư duy sâu, gọi hàm và đầu ra có cấu trúc. Được xây dựng cho các dự án phức tạp, tác vụ tác nhân dài hạn, an ninh mạng và công việc nghiên cứu. |
| mimo-v2.6-pro-ultraspeed | Xiaomi | $4.3500 | $8.7000 | mỗi 1M tokens | Xiaomi MiMo-V2.6-Pro UltraSpeed — MiMo-V2.6-Pro được phục vụ ở chế độ siêu tốc của Xiaomi, tốc độ đầu ra nhanh hơn mô hình tiêu chuẩn tới 20 lần, dành cho tương tác thời gian thực và môi trường sản xuất nhạy với độ trễ. Năng lực giống mimo-v2.6-pro: hiểu toàn phương thức hình ảnh, video, âm thanh và văn bản, ngữ cảnh 1M, đầu ra tối đa 128K, tư duy sâu, gọi hàm và đầu ra có cấu trúc. Giá gấp mười lần mimo-v2.6-pro; Xiaomi cấp dung lượng riêng cho chế độ này nên các đợt tăng đột biến lớn có thể bị giới hạn tốc độ. | ||
| MiniMax-H3 | MiniMax | $0.080 | mỗi giây | MiniMax H3 (Hailuo 3.0) — mô hình video đa phương thức đa dụng nguồn mở thế hệ mới, tạo âm thanh stereo gốc ngay trong một lượt xử lý, ở 768P hoặc 2K, dài 4-15 giây (chỉ nhận số nguyên), 24 fps. Mô hình bao phủ văn bản sang video, hình ảnh sang video từ khung hình đầu và/hoặc khung hình cuối, và tạo từ tham chiếu bằng hình ảnh, video hoặc âm thanh để định hình nhân vật, chuyển động, góc máy, phong cách, giọng nói hay nhịp dựng; không thể kết hợp hình ảnh sang video với tạo từ tham chiếu trong cùng một yêu cầu. Mô hình nhận video H.264/H.265, ảnh JPG, JPEG, PNG, WEBP, HEIC và HEIF, cùng âm thanh WAV hoặc MP3, với prompt tối đa 7000 ký tự. $0,08/giây ở 768P, $0,13/giây ở 2K. | |||
| MiniMax-Hailuo-02 | MiniMax | $0.280 | mỗi lượt gọi | MiniMax Hailuo 02 — tạo video giá rẻ, bao phủ cả văn bản sang video lẫn hình ảnh sang video ở 24 fps, với 512p và 768p có sẵn dưới dạng clip 6 giây hoặc 10 giây và 1080p ở 6 giây. Bậc 512p là điểm khởi đầu của dòng Hailuo. | |||
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | mỗi lượt gọi | MiniMax Hailuo 2.3 — văn bản sang video và hình ảnh sang video mà nhà cung cấp định vị ở khả năng bám sát chỉ dẫn, ở 24 fps, với 768p có sẵn dưới dạng clip 6 giây hoặc 10 giây và 1080p ở 6 giây. 768p 6 giây = $0,28. | |||
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | mỗi lượt gọi | MiniMax Hailuo 2.3 Fast — bậc ưu tiên tốc độ và chi phí của Hailuo 2.3, tập trung vào hình ảnh sang video và vào độ chân thực của chuyển động vật lý, ở 24 fps, với 768p có sẵn dưới dạng clip 6 giây hoặc 10 giây và 1080p ở 6 giây. 768p 6 giây = $0,19. | |||
| MiniMax-M2 | MiniMax | $0.3000 | $1.2000 | mỗi 1M tokens | MiniMax M2 — thế hệ mà MiniMax ra mắt đầu tiên cho lập trình hiệu quả và các quy trình tác nhân, với cửa sổ ngữ cảnh 204.800 token. Đây là bậc cũ nhất mà nhà cung cấp vẫn còn phục vụ và là bậc duy nhất trong các bậc cũ không có biến thể highspeed. Chỉ xử lý văn bản: API nhận các khối nội dung văn bản và lệnh gọi công cụ, không nhận hình ảnh hay video. Đây là mô hình được nhà cung cấp xếp vào nhóm mô hình cũ, và MiniMax cho biết vẫn phục vụ bình thường; mô hình được giữ lại để tương thích phiên bản, vì khách hàng ghim tên mô hình vào một thế hệ. Trọng số mở được công bố trên Hugging Face. | ||
| MiniMax-M2.1 | MiniMax | $0.3000 | $1.2000 | mỗi 1M tokens | MiniMax M2.1 — mô hình văn bản được xây dựng cho lập trình đa ngôn ngữ, với cửa sổ ngữ cảnh 204.800 token và tốc độ đầu ra khoảng 60 token mỗi giây. Chỉ xử lý văn bản: API nhận các khối nội dung văn bản và lệnh gọi công cụ, không nhận hình ảnh hay video. Đây là mô hình được nhà cung cấp xếp vào nhóm mô hình cũ, và MiniMax cho biết vẫn phục vụ bình thường; mô hình được giữ lại để tương thích phiên bản, vì khách hàng ghim tên mô hình vào một thế hệ. Trọng số mở được công bố trên Hugging Face. | ||
| MiniMax-M2.5 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | mỗi 1M tokens | MiniMax M2.5 — mô hình văn bản được nhà cung cấp định vị ở hiệu năng hàng đầu với giá thấp cho các tác vụ phức tạp, với cửa sổ ngữ cảnh 204.800 token và tốc độ đầu ra khoảng 60 token mỗi giây. Chỉ xử lý văn bản: API nhận các khối nội dung văn bản và lệnh gọi công cụ, không nhận hình ảnh hay video. Đây là mô hình được nhà cung cấp xếp vào nhóm mô hình cũ, và MiniMax cho biết vẫn phục vụ bình thường; mô hình được giữ lại để tương thích phiên bản, vì khách hàng ghim tên mô hình vào một thế hệ. Trọng số mở được công bố trên Hugging Face. |
| MiniMax-M2.7 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | mỗi 1M tokens | MiniMax M2.7 — mô hình văn bản cho trò chuyện, lập trình, công việc văn phòng và các tác vụ tác nhân, với cửa sổ ngữ cảnh 204.800 token và tốc độ đầu ra khoảng 60 token mỗi giây. Chỉ xử lý văn bản: API nhận các khối nội dung văn bản và lệnh gọi công cụ, không nhận hình ảnh hay video. Hỗ trợ gọi công cụ; tư duy luôn bật và không thể tắt. |
| MiniMax-M2.7-highspeed | MiniMax | $0.6000 | $2.4000 | mỗi 1M tokens | MiniMax M2.7 Highspeed — vẫn là mô hình M2.7 nhưng được phục vụ ở khoảng 100 token mỗi giây, dành cho lập trình độ trễ thấp và các quy trình tác nhân, với cửa sổ ngữ cảnh 204.800 token. Chỉ xử lý văn bản: API nhận các khối nội dung văn bản và lệnh gọi công cụ, không nhận hình ảnh hay video. Hỗ trợ gọi công cụ; tư duy luôn bật và không thể tắt. | ||
| MiniMax-M3 | MiniMax | $0.3000 | $1.2000 | $0.1950 | $0.7800 | mỗi 1M tokens | MiniMax M3 — mô hình lập trình đa phương thức tiên phong cho suy luận tác nhân, sử dụng công cụ và thực thi tác vụ có cấu trúc, với cửa sổ ngữ cảnh 1.000.000 token. Mô hình nhận văn bản, hình ảnh tối đa 10 MB và video tối đa 50 MB gửi kèm hoặc 512 MB qua Files API, và trả về văn bản. Hỗ trợ gọi công cụ, với tư duy là tùy chọn chứ không phải luôn bật. |
| minimax-music-v3.0 | MiniMax | $0.1481 | mỗi lượt gọi | MiniMax Music 3.0 — tạo trọn vẹn một bài hát theo cơ chế đồng bộ từ prompt âm nhạc và lời bài hát tùy chọn, với chế độ không lời (instrumental), tối ưu hóa lời bài hát và đầu ra âm thanh dạng URL hoặc hex. Prompt hỗ trợ tối đa 2.000 ký tự và lời bài hát tối đa 3.500 ký tự. | |||
| muse-spark-1.2-contributor | Meta | $0.1000 | $0.2000 | $0.0650 | $0.1300 | mỗi 1M tokens | Meta có thể dùng prompt gửi tới mô hình này và đầu ra mà mô hình tạo ra để huấn luyện các mô hình Meta trong tương lai theo điều khoản của cấp Contributor, vì vậy đừng gửi dữ liệu nhạy cảm hoặc bảo mật. Meta Muse Spark 1.2 (cấp Contributor) là phiên bản trước của Muse Spark. Đây là mô hình suy luận: mô hình luôn suy luận trước khi trả lời và không thể tắt suy luận. reasoning_effort có thể đặt là minimal, low, medium, high hoặc xhigh; cấp này không hỗ trợ none và max, và khi bỏ qua reasoning_effort, mô hình tự chọn mức. Token suy luận được tính phí như đầu ra, và đầu vào từ bộ nhớ đệm được tính theo đơn giá đầu vào từ bộ nhớ đệm. Không có tìm kiếm web, và các yêu cầu có chứa tìm kiếm web hoặc bất kỳ loại công cụ nào khác ngoài function sẽ bị từ chối. Hãy gửi yêu cầu tới /v1/chat/completions. |
| muse-spark-1.3-contributor | Meta | $0.1000 | $0.2000 | $0.0650 | $0.1300 | mỗi 1M tokens | Meta có thể dùng prompt gửi tới mô hình này và đầu ra mà mô hình tạo ra để huấn luyện các mô hình Meta trong tương lai theo điều khoản của cấp Contributor, vì vậy đừng gửi dữ liệu nhạy cảm hoặc bảo mật. Meta Muse Spark 1.3 (cấp Contributor) là phiên bản mới nhất của Muse Spark, được tinh chỉnh cho quy trình làm việc dạng agent và lập trình. Đây là mô hình suy luận: mô hình luôn suy luận trước khi trả lời và không thể tắt suy luận. reasoning_effort có thể đặt là minimal, low, medium, high hoặc xhigh; cấp này không hỗ trợ none và max, và khi bỏ qua reasoning_effort, mô hình tự chọn mức. Token suy luận được tính phí như đầu ra, và đầu vào từ bộ nhớ đệm được tính theo đơn giá đầu vào từ bộ nhớ đệm. Không có tìm kiếm web, và các yêu cầu có chứa tìm kiếm web hoặc bất kỳ loại công cụ nào khác ngoài function sẽ bị từ chối. Hãy gửi yêu cầu tới /v1/chat/completions. |
| qwen-audio-3.0-asr-flash | Alibaba | $0.1260 | mỗi giờ âm thanh | Alibaba Qwen-Audio-3.0-ASR-Flash — nhận dạng giọng nói không thời gian thực trên nền Qwen-Audio 3.0, bao phủ 30 ngôn ngữ và bảy nhóm phương ngữ lớn của tiếng Trung (quan thoại, Ngô, Tương, Cám, Khách Gia, Mân, Việt) cùng hơn 20 giọng địa phương. Dự đoán dấu câu và chuẩn hóa văn bản đưa số, ngày tháng và số tiền về dạng chuẩn; từ khóa nóng và ngữ cảnh câu lệnh nâng độ chính xác với từ vựng chuyên ngành. Mô hình nhận âm thanh tối đa 5 phút hoặc 2 GB mỗi yêu cầu. | |||
| qwen-audio-3.0-realtime-flash | Alibaba | $0.2900 | $0.8800 | mỗi 1M tokens | Alibaba Qwen-Audio-3.0-Realtime-Flash — hội thoại giọng nói song công hoàn toàn trên một phiên WebSocket, thuộc dòng mà nhà cung cấp nêu là đứng đầu bảng xếp hạng tổng thể Speech-to-Speech của Artificial Analysis. Bậc tốc độ cao này được tinh chỉnh cho độ trễ phản hồi đầu-cuối thấp nhất. Kết nối qua GET /v1/realtime. Âm thanh đầu vào và đầu ra được tính theo đơn giá riêng, cao hơn hẳn mức của văn bản. | ||
| qwen-audio-3.0-realtime-plus | Alibaba | $1.0000 | $8.0000 | mỗi 1M tokens | Alibaba Qwen-Audio-3.0-Realtime-Plus — hội thoại giọng nói song công hoàn toàn trên một phiên WebSocket; nhà cung cấp nêu mô hình đứng đầu bảng xếp hạng tổng thể Speech-to-Speech của Artificial Analysis. Bậc tiêu chuẩn ưu tiên chất lượng câu trả lời: giữ nguyên năng lực suy luận trên giọng nói, trong khi suy luận song song và truyền phát đầu-cuối giữ độ trễ phản hồi ở mức thấp. Kết nối qua GET /v1/realtime. Âm thanh đầu vào và đầu ra được tính theo đơn giá riêng, cao hơn hẳn mức của văn bản. | ||
| qwen-audio-3.0-tts-flash | Alibaba | $0.1800 | mỗi 10 nghìn ký tự | Alibaba Qwen-Audio-3.0-TTS-Flash — tổng hợp giọng nói trên nền Qwen-Audio 3.0, tinh chỉnh cho tương tác thời gian thực và bao phủ nhiều ngôn ngữ thiểu số cùng phương ngữ tiếng Trung hơn thế hệ trước. Khả năng tuân theo chỉ dẫn tự do và các thẻ điều khiển chi tiết định hướng cảm xúc, ngữ điệu, nhân vật, tốc độ và âm lượng; mô hình bền hơn trong điều kiện nhiễu và vang. Bậc flash tối ưu cho tổng hợp độ trễ thấp, dành cho trợ lý giọng nói, hội thoại trực tiếp và hỗ trợ khách hàng. Tính phí theo ký tự (1 token = 1 ký tự). Dùng được cả theo kiểu yêu cầu/phản hồi lẫn phiên WebSocket thời gian thực. | |||
| qwen-audio-3.0-tts-plus | Alibaba | $0.2500 | mỗi 10 nghìn ký tự | Alibaba Qwen-Audio-3.0-TTS-Plus — tổng hợp giọng nói chất lượng cao trên nền Qwen-Audio 3.0, bao phủ nhiều ngôn ngữ thiểu số và phương ngữ tiếng Trung hơn thế hệ trước, với phát âm phương ngữ tự nhiên hơn rõ rệt. Khả năng tuân theo chỉ dẫn tự do và các thẻ điều khiển chi tiết định hướng cảm xúc, ngữ điệu, nhân vật, tốc độ, âm lượng và phong cách; mô hình bền hơn trong điều kiện nhiễu và vang. Bậc plus ưu tiên độ trung thực và biểu cảm, dành cho sản xuất nội dung, sách nói, lồng tiếng và giọng thương hiệu. Tính phí theo ký tự (1 token = 1 ký tự). Dùng được cả theo kiểu yêu cầu/phản hồi lẫn phiên WebSocket thời gian thực. | |||
| qwen-flash-character | Alibaba | $0.0500 | $0.4000 | mỗi 1M tokens | Alibaba Qwen-Flash-Character — mô hình nhập vai đa ngôn ngữ của Qwen (phiên bản động; nhà cung cấp thông báo trước các bản cập nhật), được tinh chỉnh cho hội thoại nhân vật trung thành với persona: tuân thủ chỉ dẫn trong khuôn khổ persona, dẫn dắt chủ đề, lắng nghe và đồng cảm. Cửa sổ ngữ cảnh 8.192 token, vào văn bản, ra văn bản. Không có chế độ tư duy, gọi công cụ, công cụ tích hợp sẵn hay đầu ra có cấu trúc. Bộ nhớ đệm phiên của nhà cung cấp được áp dụng tự động ở phía họ. | ||
| qwen-image-3.0 | Alibaba | $0.030 | mỗi lượt gọi | Alibaba Qwen-Image-3.0 — bậc tiêu chuẩn của dòng ảnh Qwen, bao gồm tạo ảnh từ văn bản và chỉnh sửa ảnh, dựng chính xác chữ nhỏ (tới 10 px), 12 ngôn ngữ và hơn 20 kiểu chữ. Mô hình nhận câu lệnh tối đa 4.500 token, trả về tối đa 6 ảnh mỗi yêu cầu và tạo ảnh tới 2048x2048. | |||
| qwen-image-3.0-pro | Alibaba | $0.040 | mỗi lượt gọi | Alibaba Qwen-Image-3.0-Pro — bậc chuyên nghiệp của dòng ảnh Qwen, được xây dựng để tạo trong một lần những bố cục dày đặc thông tin (báo giấy, storyboard, thực đơn, đề thi). Mô hình nhận câu lệnh tối đa 4.500 token, dựng chữ 10 px, 12 ngôn ngữ và hơn 20 kiểu chữ, trả về tối đa 6 ảnh mỗi yêu cầu và tạo ảnh tới 2048x2048. Hỗ trợ tạo ảnh từ văn bản và chỉnh sửa ảnh. | |||
| qwen-mt-image-2.0 | Alibaba | $0.0006 | mỗi lượt gọi | Alibaba Qwen-MT-Image 2.0 — dịch hình ảnh: viết lại chữ bên trong ảnh sang một ngôn ngữ khác mà vẫn giữ nguyên bố cục, phông chữ và phần đồ họa xung quanh, cho 55 ngôn ngữ theo mọi chiều dịch. Gọi mô hình trên endpoint images/edits của OpenAI với một URL ảnh http(s) công khai trong trường image, kèm target_lang (bắt buộc; mã ISO hoặc tên ngôn ngữ bằng tiếng Anh) và source_lang (tùy chọn, mặc định auto); prompt là trường bắt buộc theo cấu trúc endpoint nhưng bị bỏ qua. Đối tượng ext tùy chọn chuyển nguyên vẹn các trường domainHint, sensitives, terminologies và config.imageSegment của nhà cung cấp. Trả về một URL ảnh JPG cùng kích thước, có hiệu lực trong 24 giờ. Đầu vào 15-8192 px mỗi cạnh, tỷ lệ khung hình 1:10 đến 10:1, tối đa 100 MB; không chấp nhận tệp tải lên và data URL. Nhà cung cấp giới hạn mô hình này ở 1 yêu cầu mỗi phút và vẫn tính phí một ảnh ngay cả khi không tìm thấy chữ nào để dịch (ảnh gốc được trả về). Được phục vụ trên một kênh chính thức duy nhất của Alibaba. | |||
| qwen3-asr-flash | Alibaba | $0.1260 | mỗi giờ âm thanh | Alibaba Qwen3-ASR-Flash — nhận dạng giọng nói xây dựng trên mô hình nền Qwen3, tự động xác định ngôn ngữ đang nói và phiên âm 11 ngôn ngữ; dòng Qwen3-ASR ghi nhận tiếng Quan Thoại cùng tiếng Tứ Xuyên, Mân Nam, Ngô và Quảng Đông, cùng nhiều chất giọng tiếng Anh khác nhau. Mô hình nhận aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma và wmv, tối đa 5 phút và 10 MB mỗi yêu cầu; đầu vào pcm phải ở 16 kHz, còn các định dạng khác được lấy mẫu lại về 16 kHz trước khi nhận dạng. | |||
| qwen3-tts-flash | Alibaba | $0.1100 | mỗi 10 nghìn ký tự | Alibaba Qwen3-TTS-Flash — chuyển văn bản thành giọng nói độ trễ thấp với 17 giọng dựng sẵn giàu biểu cảm, bao phủ tiếng Trung, Anh, Đức, Ý, Bồ Đào Nha, Tây Ban Nha, Nhật, Hàn, Pháp và Nga, cộng thêm chế độ tự động cho văn bản pha trộn nhiều ngôn ngữ và đầu ra theo phương ngữ. Mô hình nhận tối đa 512 token văn bản mỗi yêu cầu và hỗ trợ cả tổng hợp truyền phát lẫn không truyền phát. | |||
| qwen3.5-livetranslate-flash-realtime | Alibaba | $0.5500 | $20.0000 | mỗi 1M tokens | Alibaba Qwen3.5-LiveTranslate-Flash-Realtime — phiên dịch đồng thời âm thanh và video trên một phiên WebSocket, xây trên nền Qwen3.5-Omni với căn chỉnh xuyên ngôn ngữ, xuyên phương thức và tăng cường thị giác. Mô hình nghe được 60 ngôn ngữ và nói được 29. Kết nối qua GET /v1/realtime. Cấu trúc giá của nó khác các mô hình thời gian thực còn lại: **không có đơn giá cho đầu vào văn bản** — đầu vào được tính là âm thanh hoặc hình ảnh, đầu ra là văn bản hoặc âm thanh. | ||
| qwen3.5-ocr | Alibaba | $0.1000 | $0.3500 | mỗi 1M tokens | Alibaba Qwen3.5-OCR — thành viên OCR của dòng Qwen3.5, được xây dựng cho việc phân tích tài liệu, định vị văn bản và trích xuất thông tin then chốt; nhà cung cấp nêu mức cải thiện rõ rệt trên các giấy tờ tùy thân và giấy phép trong thực tế. Mô hình nhận văn bản và hình ảnh, trả về văn bản. | ||
| qwen3.5-omni-flash | Alibaba | $0.4000 | $2.2000 | mỗi 1M tokens | Alibaba Qwen3.5-Omni-Flash — bậc tốc độ cao của dòng đa phương thức toàn diện Qwen3.5, hiểu và trò chuyện xuyên suốt văn bản, hình ảnh, âm thanh và video có tiếng. Mô hình xử lý hơn 10 giờ âm thanh và hơn 400 giây video có tiếng ở 720P (1 FPS) mỗi cuộc hội thoại, với âm thanh đầu vào hơn 60 ngôn ngữ và giọng nói đầu ra hơn 30 ngôn ngữ. Âm thanh đầu vào và đầu ra có kèm âm thanh được tính theo đơn giá riêng, cao hơn mức của văn bản. | ||
| qwen3.5-omni-flash-realtime | Alibaba | $0.5500 | $3.3000 | mỗi 1M tokens | Alibaba Qwen3.5-Omni-Flash-Realtime — bậc thời gian thực tốc độ cao của dòng đa phương thức toàn diện Qwen3.5, duy trì một phiên WebSocket mở để hội thoại giọng nói song công hoàn toàn. Mô hình hiểu văn bản, hình ảnh, âm thanh và video có tiếng, nhận âm thanh ở hơn 60 ngôn ngữ và nói ở hơn 30, với giọng điều khiển được, tìm kiếm web, gọi hàm phức tạp và ngắt lời theo ngữ nghĩa. Kết nối qua GET /v1/realtime. Âm thanh đầu vào và đầu ra có kèm âm thanh được tính theo đơn giá riêng, cao hơn hẳn mức của văn bản. | ||
| qwen3.5-omni-plus | Alibaba | $1.4000 | $8.3000 | mỗi 1M tokens | Alibaba Qwen3.5-Omni-Plus — bậc hiệu năng cao của dòng đa phương thức toàn diện Qwen3.5, hiểu và trò chuyện xuyên suốt văn bản, hình ảnh, âm thanh và video có tiếng. Mô hình xử lý hơn 10 giờ âm thanh và hơn 400 giây video có tiếng ở 720P (1 FPS) mỗi cuộc hội thoại, với âm thanh đầu vào hơn 60 ngôn ngữ và giọng nói đầu ra hơn 30 ngôn ngữ. Cửa sổ ngữ cảnh 65.536 token. Âm thanh đầu vào và đầu ra có kèm âm thanh được tính theo đơn giá riêng, cao hơn mức của văn bản. | ||
| qwen3.5-omni-plus-realtime | Alibaba | $2.1000 | $12.4000 | mỗi 1M tokens | Alibaba Qwen3.5-Omni-Plus-Realtime — bậc thời gian thực của dòng đa phương thức toàn diện Qwen3.5, duy trì một phiên WebSocket mở để hội thoại giọng nói song công hoàn toàn. Mô hình hiểu văn bản, hình ảnh, âm thanh và video có tiếng, nhận âm thanh ở hơn 60 ngôn ngữ và nói ở hơn 30, với giọng điều khiển được, tìm kiếm web, gọi hàm phức tạp và ngắt lời theo ngữ nghĩa. Kết nối qua GET /v1/realtime. Âm thanh đầu vào và đầu ra có kèm âm thanh được tính theo đơn giá riêng, cao hơn hẳn mức của văn bản. | ||
| qwen3.6-27b | Alibaba | $0.6000 | $3.6000 | mỗi 1M tokens | Alibaba Qwen3.6-27B — mô hình dense ngôn ngữ-thị giác nguyên bản 27 tỷ tham số của dòng Qwen3.6, trọng số mở, được nhà cung cấp xếp trên 3.5-27B ở lập trình theo hướng tác nhân, STEM và suy luận, cũng như ở trí tuệ không gian, định vị và phát hiện đối tượng. Cửa sổ ngữ cảnh 262.144 token. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản. | ||
| qwen3.6-35b-a3b | Alibaba | $0.3750 | $2.2500 | mỗi 1M tokens | Alibaba Qwen3.6-35B-A3B — mô hình MoE ngôn ngữ-thị giác nguyên bản 35 tỷ tham số với khoảng 3 tỷ tham số kích hoạt, trọng số mở, kết hợp chú ý tuyến tính với hỗn hợp chuyên gia thưa để tăng hiệu suất suy luận. Cửa sổ ngữ cảnh 262.144 token, tối đa 65.536 token đầu ra và tối đa 256 hình ảnh hoặc 64 video mỗi yêu cầu. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản. Hỗ trợ gọi hàm, công cụ tích hợp và đầu ra có cấu trúc. | ||
| qwen3.6-flash | Alibaba | $0.2500 | $1.5000 | mỗi 1M tokens | Alibaba Qwen3.6-Flash — mô hình ngôn ngữ-thị giác tốc độ cao mà nhà cung cấp nhấn mạnh ở lập trình theo hướng tác nhân và ở trí tuệ không gian, với những cải thiện rõ rệt trong việc định vị và phát hiện đối tượng. Cửa sổ ngữ cảnh 1.000.000 token (tối đa 991.808 token đầu vào, 983.616 ở chế độ tư duy), tối đa 65.536 token đầu ra và hạn mức 131.072 token cho chuỗi suy luận. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản. Hỗ trợ gọi hàm và bộ nhớ đệm ngữ cảnh. | ||
| qwen3.6-plus | Alibaba | $0.5000 | $3.0000 | $0.4250 | $2.5500 | mỗi 1M tokens | Alibaba Qwen3.6-Plus — mô hình cân bằng cho suy luận tổng quát và sử dụng công cụ, với cửa sổ ngữ cảnh 1.000.000 token (tối đa 991.808 token đầu vào, 983.616 ở chế độ tư duy), tối đa 65.536 token đầu ra và hạn mức 81.920 token cho chuỗi suy luận. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản. Hỗ trợ gọi hàm, đầu ra có cấu trúc, tìm kiếm web, hoàn thành tiền tố và bộ nhớ đệm ngữ cảnh. |
| qwen3.7-flash | Alibaba | $0.0300 | $0.1300 | mỗi 1M tokens | Alibaba Qwen3.7-Flash — bậc tốc độ cao của dòng ngôn ngữ-thị giác nguyên bản Qwen3.7, được nhà cung cấp nhấn mạnh ở công việc tác nhân đa phương thức (tác nhân tìm kiếm và tác nhân CI) và ở việc thực thi tác vụ đầu-cuối ổn định hơn so với 3.6-Flash. Cửa sổ ngữ cảnh 1.000.000 token, tối đa 65.536 token đầu ra và tối đa 256 hình ảnh hoặc 64 video mỗi yêu cầu. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản. Hỗ trợ chế độ tư duy, gọi hàm, công cụ tích hợp và đầu ra có cấu trúc. Giá chia theo ba bậc ngữ cảnh, nên yêu cầu ngữ cảnh dài có đơn giá mỗi token cao hơn yêu cầu ngắn. | ||
| qwen3.7-max | Alibaba | $2.5000 | $7.5000 | mỗi 1M tokens | Alibaba Qwen3.7-Max — mô hình chủ lực mã nguồn đóng, định vị cho lập trình, công việc văn phòng và năng suất, cùng khả năng thực thi tự chủ dài hạn, với cửa sổ ngữ cảnh 1.000.000 token (tối đa 991.808 token đầu vào, 983.616 ở chế độ tư duy), tối đa 131.072 token đầu ra và hạn mức 262.144 token cho chuỗi suy luận. Vào văn bản, ra văn bản. Hỗ trợ gọi hàm, đầu ra có cấu trúc và bộ nhớ đệm ngữ cảnh. | ||
| qwen3.7-plus | Alibaba | $0.4000 | $1.6000 | $0.3000 | $1.2000 | mỗi 1M tokens | Alibaba Qwen3.7-Plus — mô hình tác nhân lai đa phương thức, có thể tri giác cảnh vật ngoài đời thực, đọc màn hình và điều khiển giao diện đồ họa, sinh mã từ tham chiếu hình ảnh, cùng điều hướng đầu-cuối bên trong ứng dụng di động. Cửa sổ ngữ cảnh 1.000.000 token (tối đa 991.808 token đầu vào, 983.616 ở chế độ tư duy), tối đa 131.072 token đầu ra và hạn mức 262.144 token cho chuỗi suy luận. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản; hỗ trợ gọi hàm, đầu ra có cấu trúc và bộ nhớ đệm ngữ cảnh. |
| qwen3.8-2.4t-a95b | Alibaba | $2.0000 | $6.0000 | mỗi 1M tokens | Alibaba Qwen3.8-2.4T-A95B — bản trọng số mở của mô hình đầu bảng Qwen3.8, một MoE thưa với tổng cộng 2,4 nghìn tỷ tham số và khoảng 95 tỷ tham số kích hoạt mỗi bước, dùng thiết kế chú ý lai. Cửa sổ ngữ cảnh 1.000.000 token. Mô hình nhận văn bản, trả về văn bản. Chế độ tư duy và không tư duy được tính cùng một đơn giá, và giá đầu ra đã bao gồm chuỗi suy luận. | ||
| qwen3.8-27b | Alibaba | $0.5000 | $3.0000 | mỗi 1M tokens | Alibaba Qwen3.8-27B — mô hình dense ngôn ngữ-thị giác nguyên bản 27 tỷ tham số của dòng Qwen3.8, trọng số mở, được nhà cung cấp xếp trên 3.6-27B ở các tác vụ lập trình và văn phòng, cả ở phương thức văn bản lẫn thị giác. Cửa sổ ngữ cảnh 1.000.000 token. Mô hình nhận văn bản và hình ảnh, trả về văn bản. Chế độ tư duy và không tư duy được tính cùng một đơn giá, và giá đầu ra đã bao gồm chuỗi suy luận. | ||
| qwen3.8-flash | Alibaba | $0.1500 | $0.4700 | $0.1125 | $0.3525 | mỗi 1M tokens | Alibaba Qwen3.8-Flash — bậc tốc độ cao của dòng Qwen3.8, một mô hình đa phương thức nguyên bản mà nhà cung cấp định vị cho hỗ trợ lập trình, cộng tác giữa các tác nhân và hiểu hình ảnh, tài liệu ở thông lượng cao. Cửa sổ ngữ cảnh 1.000.000 token. Mô hình nhận văn bản, hình ảnh và video, trả về văn bản. Hỗ trợ chế độ tư duy, gọi hàm, công cụ tích hợp và đầu ra có cấu trúc. Nói được cả giao thức OpenAI lẫn Anthropic Messages. |
| qwen3.8-max | Alibaba | $2.0000 | $6.0000 | $1.9000 | $5.7000 | mỗi 1M tokens | Alibaba Qwen3.8-Max — mô hình MoE chủ lực 2,4 nghìn tỷ tham số và là mô hình mạnh nhất trong họ Qwen, được nhà cung cấp nêu là cải thiện đáng kể ở lập trình và năng suất văn phòng. Cửa sổ ngữ cảnh 1.000.000 token (tối đa 991.808 token đầu vào, 983.616 ở chế độ tư duy), tối đa 131.072 token đầu ra và hạn mức 262.144 token cho chuỗi suy luận. Mô hình nhận đầu vào văn bản, hình ảnh và video, trả về văn bản; hỗ trợ gọi hàm, đầu ra có cấu trúc và bộ nhớ đệm ngữ cảnh. |
| qwen3.8-max-0902 | Alibaba | $2.0000 | $6.0000 | mỗi 1M tokens | Alibaba Qwen3.8-Max-0902 — bản chụp ngày 2026-09-02 của Qwen3.8-Max (bí danh của nhà cung cấp: qwen3.8-max-2026-09-02), mô hình MoE chủ lực 2,4 nghìn tỷ tham số, được cố định để các tích hợp có thể ghim đúng bản dựng này; nhà cung cấp nêu khả năng lập trình sâu hơn cho các dự án kỹ thuật phức tạp và phát triển tự chủ dài hơi. Cửa sổ ngữ cảnh 1.000.000 token, tối đa 131.072 token đầu ra; nhận đầu vào văn bản, hình ảnh và video, trả về văn bản; hỗ trợ chế độ tư duy, gọi công cụ và đầu ra có cấu trúc. Tên động qwen3.8-max sẽ chuyển sang các bản dựng mới hơn khi nhà cung cấp phát hành — hãy ghim tên này để tiếp tục dùng đúng bản này. Giá giống hệt qwen3.8-max. | ||
| speech-2.8-hd | MiniMax | $1.0000 | mỗi 10 nghìn ký tự | MiniMax speech-2.8-hd — bậc độ nét cao của dòng giọng nói 2.8, hướng tới lối thể hiện cực kỳ chân thực kèm thẻ âm thanh, bao phủ 40 ngôn ngữ và 7 sắc thái cảm xúc. Cao độ, tốc độ nói, âm lượng, tần số lấy mẫu, bitrate và định dạng đầu ra đều cấu hình được theo từng yêu cầu, còn tổng hợp văn bản dài nhận tối đa 1 triệu ký tự theo cách bất đồng bộ hoặc 10.000 ký tự qua giao diện truyền phát. | |||
| speech-2.8-turbo | MiniMax | $0.6000 | mỗi 10 nghìn ký tự | MiniMax speech-2.8-turbo — bậc độ trễ thấp của dòng giọng nói 2.8, đánh đổi khả năng thể hiện cực kỳ chân thực của bản HD để lấy tốc độ tổng hợp nhanh hơn mà vẫn giữ được sự tự nhiên. Mô hình bao phủ cùng 40 ngôn ngữ và 7 sắc thái cảm xúc, cho phép cấu hình cao độ, tốc độ nói, âm lượng, tần số lấy mẫu, bitrate và định dạng đầu ra, đồng thời nhận tối đa 1 triệu ký tự theo cách bất đồng bộ hoặc 10.000 ký tự qua giao diện truyền phát. | |||
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | mỗi 1M tokens | StepFun step-3.5-flash — mô hình suy luận chỉ xử lý văn bản với ngữ cảnh 256K, hướng tới logic, toán học, kỹ thuật phần mềm và nghiên cứu chuyên sâu, nơi chất lượng suy luận phải đi cùng khả năng thực thi nhanh và ổn định. Độ sâu suy luận được chọn theo từng yêu cầu qua reasoning_effort (low / medium / high). Hỗ trợ gọi công cụ, đầu ra có cấu trúc theo JSON Schema, truyền phát và bộ nhớ đệm prompt. Nếu cần đầu vào hình ảnh hoặc video, hãy dùng step-3.7-flash. | ||
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | mỗi 1M tokens | StepFun step-3.5-flash-2603 — bản chụp 256K của step-3.5-flash được tinh chỉnh cho tác nhân, tối ưu cho hiệu quả token và chế độ vận hành suy luận thấp. Tham số reasoning_effort chỉ nhận low và high, trong khi mô hình gốc nhận ba mức, nên mã đang gửi medium phải được điều chỉnh. Chỉ xử lý văn bản; hỗ trợ gọi công cụ, đầu ra có cấu trúc theo JSON Schema, truyền phát và bộ nhớ đệm prompt. | ||
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | mỗi 1M tokens | StepFun step-3.7-flash — MoE thưa với 198B tham số tổng và 11B tham số hoạt động, ngữ cảnh 256K gốc và khả năng hiểu hình ảnh, video gốc bên cạnh văn bản. Độ sâu suy luận được chọn theo từng yêu cầu qua reasoning_effort (low / medium / high), và mô hình hỗ trợ gọi công cụ nhiều bước một cách đáng tin cậy, đầu ra có cấu trúc theo JSON Schema, truyền phát và bộ nhớ đệm prompt. Được tinh chỉnh cho khối lượng công việc tác nhân và lập trình. Trên /v1/responses, hãy gửi toàn bộ cuộc hội thoại trong mảng input ở mỗi lượt: không có trạng thái hội thoại nào được lưu ở phía thượng nguồn, nên các yêu cầu chứa previous_response_id hoặc conversation sẽ bị từ chối. | ||
| step-5-preview | StepFun | $1.0000 | $2.7000 | mỗi 1M tokens | StepFun step-5-preview — mô hình chủ lực mới của StepFun dành cho lập trình và công việc tri thức chuyên môn, phát hành dưới dạng bản xem trước. Ngữ cảnh 1M token với đầu ra tối đa 64K token, cùng khả năng hiểu hình ảnh và video gốc bên cạnh văn bản. Suy luận luôn được bật: nội dung suy luận được trả về dưới dạng reasoning_content trên /v1/chat/completions và dưới dạng khối thinking trên /v1/messages, được tính phí như đầu ra và tiêu tốn max_tokens, nên một giới hạn vài trăm token có thể bị suy luận dùng hết và không trả về văn bản nào; hãy để dư nhiều. Độ sâu được chọn theo từng yêu cầu qua reasoning_effort (low / medium / high). Hỗ trợ gọi công cụ nhiều bước, đầu ra có cấu trúc theo JSON Mode và JSON Schema, truyền phát và bộ nhớ đệm prompt. Được xây dựng cho phân tích tài liệu dài, kỹ thuật phần mềm và công việc tác nhân nhiều bước. Trên /v1/responses, hãy gửi toàn bộ cuộc hội thoại trong mảng input ở mỗi lượt: không có trạng thái hội thoại nào được lưu ở phía thượng nguồn, nên các yêu cầu chứa previous_response_id hoặc conversation sẽ bị từ chối. | ||
| step-audio-2 | StepFun | $1.4815 | $10.3704 | mỗi 1M tokens | StepFun step-audio-2 — mô hình giọng nói đầu-cuối tiếp nhận trực tiếp âm thanh thay vì làm việc từ bản ghi văn bản, nhờ đó ngữ điệu và cách thể hiện được giữ lại trong phần hiểu của mô hình. Tính phí theo token, dùng chung mức giá đầu vào với dòng StepAudio 2.5 nhưng giá đầu ra cao hơn. StepFun không công bố trang năng lực riêng cho mô hình này; hãy tham khảo tài liệu âm thanh của nền tảng để biết bộ tham số hiện hành. | ||
| step-tts-2 | StepFun | $0.4148 | mỗi 10 nghìn ký tự | StepFun step-tts-2 — mô hình tổng hợp giọng nói đầu-cuối dựa trên NTP, được xây dựng để tái tạo chính xác chất giọng vùng miền. Mô hình nói tiếng Trung, tiếng Anh, pha trộn Trung-Anh và tiếng Nhật, cùng tiếng Quảng Đông và tiếng Tứ Xuyên. Cảm xúc và cách thể hiện được điều khiển qua nhãn bằng ngôn ngữ tự nhiên, còn nhân bản giọng nói zero-shot cần khoảng 10 giây âm thanh tham chiếu, với các điều khiển cảm xúc và phong cách được chuyển sang giọng nhân bản mà không tính thêm phí. Xuất ra wav, mp3, flac, opus hoặc pcm. | |||
| stepaudio-2-asr-pro | StepFun | $0.2963 | mỗi giờ âm thanh | StepFun StepAudio 2 ASR Pro — mô hình nhận dạng giọng nói 32B tham số, là lựa chọn ưu tiên độ chính xác trong dòng ASR của StepFun, còn stepaudio-2.5-asr là lựa chọn ưu tiên tốc độ và chi phí. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí. | |||
| stepaudio-2.5-asr | StepFun | $0.0220 | mỗi giờ âm thanh | StepFun StepAudio 2.5 ASR — mô hình nhận dạng giọng nói 4B tham số xây dựng trên Multi-Token Prediction, phiên âm năm phút âm thanh trong khoảng một giây (RTF khoảng 0,0053). Tối ưu cho tiếng Trung và tiếng Anh. Bao gồm chuẩn hóa văn bản ngược, nhận diện người nói và tách hai kênh cho bản ghi cuộc gọi và cuộc họp. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí. | |||
| stepaudio-2.5-asr-stream | StepFun | $0.1800 | mỗi giờ âm thanh | StepFun StepAudio 2.5 ASR Stream — phiên bản nhận dạng truyền phát (streaming) của StepAudio 2.5 ASR (mô hình nhận dạng 4B tham số xây dựng trên Multi-Token Prediction, tối ưu cho tiếng Trung và tiếng Anh), đồng thời là mô hình nhận dạng truyền phát được StepFun khuyến nghị. Trên gateway này, mô hình được gọi giống như các mô hình phiên âm khác: tải một tệp ghi âm hoàn chỉnh lên /v1/audio/transcriptions và toàn bộ bản ghi sẽ được trả về trong một phản hồi duy nhất sau khi nhận dạng xong; kết quả từng phần không được truyền phát trả về, và mô hình có giá mỗi phút âm thanh cao hơn stepaudio-2.5-asr. Có áp dụng chuẩn hóa văn bản ngược. Chỉ nhận tệp tải lên 16-bit PCM wav và ogg (không nhận mp3); đầu ra bản ghi không bị tính phí. | |||
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | mỗi 1M tokens | StepFun StepAudio 2.5 Chat — mô hình hiểu giọng nói đầu-cuối: nhận âm thanh hoặc văn bản vào và trả về văn bản, đọc các tín hiệu cận ngôn ngữ như sự ngập ngừng hay tiếng cười trực tiếp từ dạng sóng chứ không phải từ bản ghi văn bản. Hỗ trợ tùy biến persona sâu rộng, bao gồm tính cách, thói quen nói và biên độ cảm xúc. Âm thanh được cung cấp dưới dạng phần nội dung input_audio trên endpoint chat completions. Nếu cần câu trả lời bằng giọng nói, hãy dùng một mô hình TTS. | ||
| stepaudio-2.5-realtime | StepFun | $1.5000 | $10.0000 | mỗi 1M tokens | StepFun StepAudio 2.5 Realtime — mô hình giọng nói sang giọng nói đầu-cuối qua một phiên WebSocket tại GET /v1/realtime: nhận âm thanh hoặc văn bản dạng luồng, trả về âm thanh dạng luồng kèm bản chép lời dạng văn bản, có phát hiện hoạt động giọng nói phía máy chủ và cho phép ngắt lời. Âm thanh ở định dạng PCM16, 24 kHz, đơn kênh; nhà cung cấp liệt kê tiếng Anh là ngôn ngữ được hỗ trợ. Hãy đặt giọng đọc một cách tường minh trong session.update: chỉ chấp nhận các giọng đọc có trong danh sách của StepFun. | ||
| stepaudio-2.5-tts | StepFun | $0.8500 | mỗi 10 nghìn ký tự | StepFun StepAudio 2.5 TTS — mô hình chuyển văn bản thành giọng nói theo ngữ cảnh, mang phần hiểu đi suốt toàn bộ quy trình sinh thay vì coi cách thể hiện là khâu hậu kỳ. Giọng, cảm xúc và nhịp điệu được chỉ dẫn bằng ngôn ngữ tự nhiên ở hai cấp: ngữ cảnh toàn cục cho cả yêu cầu và ngữ cảnh nội tuyến cho từng đoạn riêng lẻ. Nhân bản giọng nói zero-shot cần khoảng 3 giây âm thanh tham chiếu và kế thừa trọn bộ điều khiển theo ngữ cảnh. Nhận tối đa 1000 ký tự cho mỗi yêu cầu; xuất ra wav, mp3, flac hoặc opus. | |||
| stepaudio-3-asr-max | StepFun | $0.4000 | mỗi giờ âm thanh | StepFun StepAudio 3 ASR Max — mô hình nhận dạng giọng nói lớn nhất của StepFun, xây dựng trên một mô hình ngôn ngữ lớn nên việc nhận dạng dựa vào ngữ cảnh và kiến thức chuyên ngành: mạnh hơn với tên riêng, tên thuốc, thuật ngữ kỹ thuật và từ đồng âm, với lời nói xen lẫn tiếng Trung và tiếng Anh, phương ngữ và âm thanh dài, cũng như với lời nói thì thầm, rất nhanh hoặc có nhạc nền, kể cả lời bài hát được hát. Gửi tệp âm thanh đến POST /v1/audio/transcriptions (WAV, MP3 hoặc OGG); tính phí theo thời lượng âm thanh. | |||
| stepaudio-3-chat-preview | StepFun | $0.0000 | mỗi 1M tokens | StepFun StepAudio 3 Chat (bản xem trước) — mô hình hội thoại hiểu giọng nói trên POST /v1/chat/completions: ở mỗi lượt, gửi giọng nói dưới dạng phần nội dung input_audio hoặc gửi văn bản, rồi nhận lại văn bản; có hỗ trợ gọi công cụ. Miễn phí trong suốt giai đoạn xem trước của StepFun. Khi giai đoạn miễn phí kết thúc, StepFun sẽ ngừng cung cấp tên bản xem trước và phát hành một phiên bản trả phí, vì vậy hãy tính trước rằng ID mô hình này sẽ ngừng hoạt động vào thời điểm đó. | |||
| stepaudio-3-gen-preview | StepFun | $0.000 | mỗi lượt gọi | StepFun StepAudio 3 Audio Generation (bản xem trước) — tạo âm thanh theo kịch bản thuộc dòng StepAudio 3 trên POST /v1/audio/generate: định nghĩa các vai bằng tên và mô tả giọng bằng ngôn ngữ tự nhiên, viết kịch bản từng dòng (các dòng đặt trong ngoặc vuông sẽ thành hiệu ứng âm thanh hoặc nhạc nền), thêm một chỉ dẫn tổng thể, rồi nhận âm thanh hoàn chỉnh dưới dạng byte (mặc định mp3). Giọng được tạo từ mô tả vai; không chấp nhận tên giọng có sẵn. Các trường yêu cầu theo tài liệu tham khảo API của StepFun. Miễn phí trong suốt giai đoạn xem trước của StepFun. Khi giai đoạn miễn phí kết thúc, StepFun sẽ ngừng cung cấp tên bản xem trước và phát hành một phiên bản trả phí, vì vậy hãy tính trước rằng ID mô hình này sẽ ngừng hoạt động vào thời điểm đó. | |||
| stepaudio-3-music-preview | StepFun | $0.000 | mỗi lượt gọi | StepFun StepAudio 3 Music (bản xem trước) — tạo nhạc từ văn bản thuộc dòng StepAudio 3 trên POST /v1/music/generations, cùng dạng yêu cầu với minimax-music-v3.0: mô tả phong cách trong prompt, thêm lời bài hát vào lyrics hoặc đặt is_instrumental, rồi nhận bài hát hoàn chỉnh được mã hóa hex trong data.audio (mặc định mp3; có thể chọn wav, flac, opus hoặc pcm qua audio_setting.format). Lệnh gọi là đồng bộ và một bài hát thường mất từ một đến vài phút, vì vậy hãy đặt thời gian chờ phía client ít nhất 600 giây. Không hỗ trợ cover hay tạo nhạc đệm cho giọng hát tải lên. Miễn phí trong suốt giai đoạn xem trước của StepFun. Khi giai đoạn miễn phí kết thúc, StepFun sẽ ngừng cung cấp tên bản xem trước và phát hành một phiên bản trả phí, vì vậy hãy tính trước rằng ID mô hình này sẽ ngừng hoạt động vào thời điểm đó. | |||
| stepaudio-3-realtime-preview | StepFun | $0.0000 | mỗi 1M tokens | StepFun StepAudio 3 Realtime (bản xem trước) — mô hình giọng nói song công hoàn toàn của StepFun qua một phiên WebSocket tại GET /v1/realtime: ngắt lời và luân phiên lượt nói một cách tự nhiên, suy luận thích ứng ngay trong khi nói, và gọi công cụ trong lúc hội thoại. Miễn phí trong suốt giai đoạn xem trước của StepFun. Khi giai đoạn miễn phí kết thúc, StepFun sẽ ngừng cung cấp tên bản xem trước và phát hành một phiên bản trả phí, vì vậy hãy tính trước rằng ID mô hình này sẽ ngừng hoạt động. | |||
| stepaudio-3-tts | StepFun | $0.3600 | mỗi 10 nghìn ký tự | StepFun StepAudio 3 TTS — mô hình chuyển văn bản thành giọng nói thuộc dòng StepAudio 3, được xây dựng để có cách thể hiện ngang tầm con người: âm sắc, ngữ điệu, nhịp điệu và hơi thở bám sát lời nói tự nhiên, kể cả tiếng cười, sự ngập ngừng và việc tự sửa lời, còn cảm xúc và giọng điệu thay đổi cho phù hợp với nội dung. Được cung cấp qua POST /v1/audio/speech và tính phí theo từng ký tự của văn bản đầu vào. | |||
| vidu-video-q3 | Vidu | $0.060 | mỗi giây | Vidu Q3 — mô hình tạo video từ tham chiếu với chủ thể nhất quán, chuyển cảnh thông minh và đầu ra âm thanh/video đồng bộ. Mô hình nhận ảnh tham chiếu hoặc chủ thể có tên; tạo video dài 3–16 giây ở 540P, 720P hoặc 1080P. | |||
| vidu-video-q3-pro | Vidu | $0.100 | mỗi giây | Vidu Q3 Pro — tạo video chú trọng chất lượng, gồm văn bản sang video, hình ảnh sang video và tạo từ khung hình đầu/cuối, với đầu ra âm thanh/video đồng bộ. Tạo video dài 1–16 giây ở 540P, 720P hoặc 1080P; SKU này không hỗ trợ tạo video từ tham chiếu. | |||
| vidu-video-q3-turbo | Vidu | $0.055 | mỗi giây | Vidu Q3 Turbo — bậc Q3 nhanh và tiết kiệm chi phí để tạo video từ văn bản, hình ảnh, khung hình đầu/cuối và tham chiếu, với đầu ra âm thanh/video đồng bộ. Tạo video dài 1–16 giây ở các chế độ thông thường hoặc 3–16 giây ở chế độ tham chiếu, ở độ phân giải 540P–1080P. | |||
| wan2.7-i2v | Alibaba | $0.100 | mỗi giây | Alibaba Wan 2.7 Image-to-Video — bao phủ việc tạo video từ khung hình đầu, chuyển cảnh giữa khung đầu và khung cuối, cùng phần tiếp nối của một clip có sẵn. Mô hình tạo video 720P hoặc 1080P (mặc định 1080P) dài 2-15 giây, mặc định 5 giây, từ prompt tối đa 5000 ký tự (prompt phủ định tối đa 500 ký tự). Có thể cung cấp một bản mp3 hoặc wav dài 2-30 giây làm driving_audio; nếu không có âm thanh, mô hình tự tạo nhạc nền hoặc hiệu ứng âm thanh phù hợp, âm thanh dài hơn clip sẽ bị cắt bớt, còn âm thanh ngắn hơn sẽ để lại phần đuôi im lặng. | |||
| wan2.7-image | Alibaba | $0.030 | mỗi lượt gọi | Alibaba Wan2.7 Image — tạo hình ảnh từ văn bản, chỉnh sửa ảnh, tạo ảnh tham chiếu từ nhiều ảnh, chỉnh sửa tương tác, dựng chữ và bám chỉ dẫn tốt. | |||
| wan2.7-image-pro | Alibaba | $0.075 | mỗi lượt gọi | Alibaba Wan 2.7 Image Pro — bậc chuyên nghiệp của dòng ảnh Wan 2.7, bao phủ tạo hình ảnh từ văn bản, bộ ảnh theo trình tự, chỉnh sửa ảnh và tạo ảnh từ nhiều ảnh tham chiếu, với khả năng bám prompt tốt hơn. Tạo hình ảnh từ văn bản đạt tới 4K (4096x4096) cùng các bậc 1K và 2K và kích thước tùy chỉnh từ 768x768; chế độ chỉnh sửa và chế độ theo trình tự giới hạn ở 2K. Mô hình nhận tối đa 9 ảnh tham chiếu (JPEG, JPG, PNG, BMP, WEBP; 240-8000 px mỗi cạnh, 20 MB mỗi ảnh), tỷ lệ khung hình từ 1:8 đến 8:1 và prompt tối đa 5000 ký tự. Trả về PNG. | |||
| wan2.7-r2v | Alibaba | $0.100 | mỗi giây | Alibaba Wan2.7 (R2V) — tạo video từ tham chiếu, tối đa 5 tham chiếu ảnh/video hỗn hợp cùng một tham chiếu âm sắc, giữ nhất quán nhân vật/đạo cụ/bối cảnh tốt hơn. | |||
| wan2.7-t2v | Alibaba | $0.100 | mỗi giây | Alibaba Wan2.7 (T2V) — tạo video từ văn bản với diễn xuất được nâng cấp, cảm xúc tinh tế, hành động mạnh và các cú cắt máy quay giàu kịch tính. Mô hình tạo MP4 H.264 ở 720P hoặc 1080P, dài 2-15 giây (mặc định 5 giây), theo tỷ lệ 16:9, 9:16, 1:1, 4:3 hoặc 3:4, từ prompt tối đa 5000 ký tự. Âm thanh được thêm vào theo mặc định: nếu không có audio_url, mô hình tự soạn nhạc nền hoặc hiệu ứng âm thanh phù hợp, hoặc bạn có thể cung cấp một bản wav hay mp3 dài 2-30 giây thay thế. | |||
| wan2.7-videoedit | Alibaba | $0.100 | mỗi giây | Alibaba Wan2.7 VideoEdit — chỉnh sửa video bằng ngôn ngữ tự nhiên, cục bộ hoặc toàn cục, thay thế phần tử theo ảnh tham chiếu, sao chép chuyển động/hiệu ứng/góc máy. | |||
| wan3.0-video | Alibaba | $0.100 | $0.085 | mỗi giây | Alibaba Wan3.0 (Video) — mô hình video tất cả trong một, hợp nhất văn bản sang video, hình ảnh sang video và tạo video từ tham chiếu sau một endpoint duy nhất. Mô hình tạo MP4 H.264 ở 480P, 720P hoặc 1080P, dài tối đa 30 giây, từ một prompt và một URL ảnh khung hình đầu tùy chọn. Tính phí theo từng giây video được tạo, dựa trên thang giá riêng của nhà cung cấp: 720P là mức giá cơ sở, 480P tính bằng một nửa mức đó và 1080P tính gấp đôi. Yêu cầu không chỉ định độ phân giải sẽ được mô hình tạo ở 1080P và bị tính phí theo bậc đó. Đầu vào video tham chiếu và âm thanh tham chiếu có trong mô hình của nhà cung cấp nhưng không được hỗ trợ trên endpoint này. | ||
| wan3.0-video-prime | Alibaba | $0.140 | mỗi giây | Alibaba Wan3.0 Video Prime — bậc tốc độ cao của mô hình video tất cả trong một Wan 3.0, có năng lực tương đương bậc tiêu chuẩn nhưng tốc độ tạo nhanh hơn. Văn bản sang video, hình ảnh sang video từ khung hình đầu/cuối và tạo video từ ảnh tham chiếu (tối đa 10 ảnh tham chiếu) sau một endpoint duy nhất; MP4 H.264 ở 480P, 720P hoặc 1080P, dài 2 đến 30 giây, 30 fps, mặc định có âm thanh. Tính phí theo từng giây video được tạo, dựa trên thang giá của nhà cung cấp: 720P là mức giá cơ sở, 480P có giá thấp hơn một chút so với một nửa mức đó và 1080P tính gấp đôi. Yêu cầu không chỉ định độ phân giải sẽ được tạo ở mức mặc định 1080P của nhà cung cấp và bị tính phí theo bậc đó. Gateway này không chấp nhận đầu vào video tham chiếu, âm thanh tham chiếu, tệp hay liên kết web, và thời lượng thông minh (-1) sẽ bị từ chối; hãy đặt duration một cách tường minh. Được phục vụ trên một kênh chính thức duy nhất của Alibaba. |