Harga model AI Tiongkok
ChinaAPI menyediakan DeepSeek, Qwen, GLM, Kimi, dan model AI Tiongkok lainnya melalui satu gateway yang kompatibel dengan OpenAI di https://api.chinaapi.ai/v1. Semua harga dalam dolar AS, dinyatakan dalam satuan yang dipakai pemasok hulu. Daftar yang sama tersedia sebagai JSON di /api/pricing.
| Model | Pemasok | Masukan | Output | Satuan | Deskripsi |
|---|---|---|---|---|---|
| claude-sonnet-4-5 | Anthropic | Penagihan bertingkat, lihat halaman harga | Anthropic Claude Sonnet 4.5 — a pinned dated snapshot of the Sonnet 4.5 release, kept available for workloads that need byte-stable behaviour across runs. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| glm-5.2 | 智谱 | $1.4000 | $4.4000 | per 1M tokens | Zhipu GLM-5.2 — model fondasi unggulan yang dikhususkan untuk pekerjaan agen pemrograman berdurasi panjang melalui pelatihan khusus selama berbulan-bulan, bukan sekadar perpanjangan konteks, dengan jendela konteks 1M token dan hingga 128K token keluaran. Teks masuk, teks keluar. Mendukung beberapa mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP. |
| gpt-5.6-luna | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT-5.6 Luna — tingkat GPT-5.6 yang paling cepat dan paling terjangkau, dioptimalkan untuk beban kerja bervolume tinggi yang sensitif terhadap biaya sambil tetap mempertahankan penalaran, penglihatan, dan penggunaan alat. Mendukung masukan teks dan gambar, jendela konteks 1.050.000 token, serta hingga 128.000 token keluaran. | ||
| step-asr | StepFun | $0.1444 | per jam audio | StepFun step-asr — pengenalan suara serbaguna yang mencakup bahasa Mandarin, Inggris, dan dialek-dialek Tiongkok, untuk transkripsi, notulen rapat, tinjauan mutu panggilan, dan pencarian suara. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih. | |
| step-audio-2 | StepFun | $1.4930 | $10.4480 | per 1M tokens | StepFun step-audio-2 — model suara ujung-ke-ujung yang mengonsumsi audio secara langsung alih-alih bekerja dari transkrip, sehingga nada dan cara penyampaian tetap terbawa ke dalam pemahaman model. Ditagih per token, memakai tarif masukan lini StepAudio 2.5 dengan tarif keluaran yang lebih tinggi. StepFun tidak menerbitkan halaman kapabilitas terpisah untuk model ini; lihat dokumentasi audio platform untuk mengetahui set parameter yang berlaku. |
| gemini-2.5-flash | Penagihan bertingkat, lihat halaman harga | Google Gemini 2.5 Flash — a fast, low-cost multimodal model with a 1M-token context window. Accepts text, images, video and audio; audio input is billed at the vendor's separate audio rate. | |||
| claude-sonnet-4-6 | Anthropic | Penagihan bertingkat, lihat halaman harga | Anthropic Claude Sonnet 4.6 — the balanced Sonnet generation, offering a 1,000,000-token context window at standard pricing with up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer, so the same text yields roughly 30% fewer tokens than on 4.7-and-later models at the same per-token rate. | ||
| agnes-image-2.1-flash | Agnes AI | $0.000 | per permintaan | Agnes AI Image 2.1 Flash — model pembuatan dan penyuntingan gambar yang berfokus pada detail untuk adegan berkepadatan informasi tinggi, mencakup teks ke gambar, gambar ke gambar, dan komposisi multi-gambar dengan ukuran serta rasio aspek fleksibel dari 1K hingga 4K. | |
| claude-fable-5 | Anthropic | Penagihan bertingkat, lihat halaman harga | Anthropic Claude Fable 5 — model Anthropic yang paling mumpuni di antara yang tersedia untuk umum, untuk pekerjaan pengetahuan dan pemrograman yang ambisius serta berdurasi panjang. Model ini dibangun untuk tugas agentik berhari-hari, rekayasa perangkat lunak yang kompleks, riset mendalam, penalaran atas dokumen dan gambar, serta verifikasi mandiri yang proaktif. | ||
| claude-haiku-4-5 | Anthropic | Penagihan bertingkat, lihat halaman harga | Anthropic Claude Haiku 4.5 — the fastest Claude model with near-frontier intelligence, built for high-volume, latency-sensitive work such as classification, extraction, and routing. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| happyhorse-1.1-i2v | 阿里巴巴 | $0.091 | per detik | Alibaba HappyHorse 1.1 (I2V) — gambar ke video dengan tekstur yang lebih baik, konsistensi identitas antarklip, kelancaran gerak, dan sinkronisasi audio-visual. 720P/1080P. | |
| MiniMax-M2.7 | MiniMax | $0.3000 | $1.2000 | per 1M tokens | MiniMax M2.7 — model teks untuk obrolan, pemrograman, pekerjaan kantor, dan tugas agentik, dengan jendela konteks 204.800 token dan keluaran sekitar 60 token per detik. Hanya teks: API menerima blok konten teks dan pemanggilan alat, bukan gambar atau video. Mendukung pemanggilan alat; thinking selalu aktif dan tidak dapat dimatikan. |
| gpt-4.1-mini | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT-4.1 mini — the small GPT-4.1 variant. Being non-reasoning, its prose stays more predictable than the reasoning tier at a comparable price, which suits writing and rewriting work. It takes text and image input, with a 1,047,576-token context window and up to 32,768 output tokens. | ||
| kimi-k2.7-code | Moonshot | $0.7600 | $3.1570 | per 1M tokens | Moonshot Kimi K2.7 Code — model pemrograman khusus milik Kimi, yang menurut pengukuran vendor meningkatkan kepatuhan instruksi dan pemrograman berdurasi panjang dibanding K2.6 sekaligus memangkas berpikir berlebihan sekitar 30% secara rata-rata. Jendela konteks 256K, keluaran bawaan 32.768 token. Model ini menerima teks, gambar, dan video sebagai konten base64 lalu mengembalikan teks. Thinking bersifat wajib dan akan mengembalikan galat jika dimatikan; tool_choice terbatas pada auto atau none, dan reasoning_content harus dibawa terus melintasi pemanggilan alat multi-langkah. |
| kling-3.0-turbo | 快手 | $0.560 | per permintaan | Kuaishou Kling 3.0 Turbo — tingkat bernilai ekonomis dari lini Kling 3.0, menghasilkan 720P atau 1080P (bawaan 720P) berdurasi 3-15 detik (bawaan 5) dalam 16:9, 9:16, atau 1:1, dari sebuah prompt atau gambar bingkai pertama. Audio asli selalu disertakan dan tidak memiliki sakelar hidup/mati. Dibandingkan kling-v3, model ini melepas tingkat 4K, kendali bingkai akhir, dan masukan video demi kecepatan dan biaya. 720p 5 detik dengan audio ≈ $0,56. | |
| mimo-v2.5-tts | Xiaomi | $0.0000 | per 10 ribu karakter | Xiaomi MiMo v2.5 TTS — text-to-speech ekspresif dengan delapan suara bawaan, empat berbahasa Mandarin dan empat berbahasa Inggris (Mia, Chloe, Milo, Dean), mencakup bahasa Mandarin dan Inggris ditambah gaya dialek Timur Laut, Sichuan, Henan, dan Kanton. Penyampaian diarahkan lewat dua cara: instruksi gaya dalam bahasa alami, dan tag audio sebaris untuk emosi dasar maupun majemuk, tarikan napas, helaan napas, dan tempo, termasuk mode menyanyi yang hanya dimiliki model ini di lini MiMo TTS. Menghasilkan wav mono atau pcm16 pada 24 kHz dan mendukung streaming berlatensi rendah, yang mensyaratkan pcm16. Konteks 8K dan keluaran maksimum 8K. | |
| step-asr-1.1 | StepFun | $0.3370 | per jam audio | StepFun step-asr-1.1 — versi pembaruan dari model pengenal serbaguna di lini step-asr, mencakup bahasa Mandarin, Inggris, dan dialek-dialek Tiongkok. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih. | |
| step-audio-r1.5 | StepFun | $1.4930 | $15.6720 | per 1M tokens | StepFun step-audio-r1.5 — model suara ujung-ke-ujung dalam keluarga yang sama dengan step-audio-2, memakai tarif masukan yang sama tetapi menagih keluaran 50% lebih tinggi. StepFun tidak menerbitkan halaman kapabilitas terpisah untuk model ini; lihat dokumentasi audio platform untuk mengetahui set parameter yang berlaku. |
| step-image-edit-2 | StepFun | $0.003 | per permintaan | StepFun Step Image Edit 2 — model terpadu untuk pembuatan gambar dari teks dan penyuntingan gambar dengan parameter di bawah 6B, setara dengan model penyunting berbobot terbuka di kisaran 12B-20B. Model ini merampungkan satu suntingan dalam satu sampai dua detik dan dirancang untuk retouching interaktif berlatensi rendah. Mendukung 256x256, 512x512, 768x768, 1024x1024, 1280x800, dan 800x1280, ditambah prompt negatif serta mode optimasi teks; satu gambar per permintaan. Disajikan melalui endpoint images yang kompatibel dengan OpenAI. | |
| wan2.7-image-pro | 阿里巴巴 | $0.064 | per permintaan | Alibaba Wan 2.7 Image Pro — tingkat profesional dari lini gambar Wan 2.7, mencakup teks ke gambar, set gambar berurutan, penyuntingan gambar, dan pembuatan dengan banyak gambar referensi, dengan kepatuhan prompt yang lebih baik. Teks ke gambar mencapai 4K (4096x4096) dengan tingkat 1K dan 2K serta ukuran khusus mulai 768x768; mode penyuntingan dan mode berurutan dibatasi 2K. Model ini menerima hingga 9 gambar referensi (JPEG, JPG, PNG, BMP, WEBP; 240-8.000 px per sisi, 20 MB masing-masing), rasio aspek dari 1:8 hingga 8:1, dan prompt hingga 5.000 karakter. Menghasilkan PNG. | |
| doubao-seedance-2-0-fast-260128 | 字节跳动 | $4.2000 | $4.2000 | per 1M tokens | ByteDance Seedance 2.0 Fast — pembuatan video hemat biaya yang membawa seluruh rangkaian fitur Seedance 2.0 tetapi dibatasi pada 480p dan 720p, 24 fps, 4-15 detik. Model ini mencakup teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, pembuatan berbasis referensi multimodal dari 1-9 gambar dan maksimum 3 video referensi dengan total 15 detik, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web; referensi audio harus disertai gambar atau video. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16. 480p 5 detik ≈ $0,26. |
| claude-opus-5 | Anthropic | Penagihan bertingkat, lihat halaman harga | Anthropic Claude Opus 5 — model penalaran mendalam untuk pemrograman agentik yang kompleks dan pekerjaan skala perusahaan, dengan peningkatan besar pada tugas berdurasi panjang, tinjauan kode, alur kerja dokumen, penglihatan, dan koordinasi multi-agen. Model ini memiliki jendela konteks 1.000.000 token, mendukung hingga 128.000 token keluaran, dan mengaktifkan thinking adaptif secara bawaan. | ||
| deepseek-v4-flash-vision-exp | DeepSeek | Penagihan bertingkat, lihat halaman harga | DeepSeek V4 Flash Vision (experimental) — the V4 Flash tier with image input, priced identically to deepseek-v4-flash on every face. Images are converted to tokens by their size and billed together with text at the input rate, so there is no separate image charge. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. The vendor labels this tier experimental; behaviour and availability may change without notice. Text and images in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| doubao-seedance-2-0-260128 | 字节跳动 | $7.0000 | $7.0000 | per 1M tokens | ByteDance Seedance 2.0 — model unggulan lini Seedance 2.0 dan satu-satunya anggota yang mencapai 1080p dan 4K (kedalaman 10 bit) di samping 480p dan 720p, pada 24 fps dan 4-15 detik. Model ini mencakup teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, pembuatan berbasis referensi multimodal dari 1-9 gambar dan maksimum 3 video referensi dengan total 15 detik, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web; referensi audio harus disertai gambar atau video. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16, dengan bingkai penutup tersedia sebagai gambar. Ditagih berdasarkan resolusi keluaran. |
| doubao-seedream-5-0-260128 | 字节跳动 | $0.033 | per permintaan | ByteDance Doubao Seedream 5.0-lite — teks ke gambar dan gambar ke gambar dengan kreasi terkendali yang lebih cerdas, pengambilan data real-time, dan konsistensi subjek yang lebih kuat (resolusi 2K ke atas). | |
| kling-v3 | 快手 | $0.420 | per permintaan | Kuaishou Kling 3.0 — teks ke video dan gambar ke video dengan audio asli serta konsistensi elemen yang lebih baik. Klip berdurasi 3-15 detik (bawaan 5) dalam 16:9, 9:16, atau 1:1, dengan tingkat dipilih melalui mode: std untuk 720P, pro untuk 1080P, dan 4k untuk 4K asli. Audio harus diaktifkan sendiri lewat sound=on dan secara bawaan mati; gambar ke video menerima bingkai pertama dengan bingkai akhir opsional. Mulai $0,083/detik (720p). | |
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | per 1M tokens | Xiaomi MiMo-V2.5-Pro — model unggulan berparameter satu triliun (42B aktif) dengan konteks 1M dan keluaran maksimum 128K, disetel untuk beban kerja agen berintensitas tinggi. Mendukung berpikir mendalam, pemanggilan fungsi, output terstruktur, dan pencarian web. Hanya menghasilkan teks: berbeda dari mimo-v2.5, daftar kapabilitas vendor tidak mencantumkan pemahaman semua modalitas. |
| step-1o-turbo-vision | StepFun | $0.3850 | $1.2330 | per 1M tokens | StepFun step-1o-turbo-vision — pemahaman gambar dan video dengan pembuatan teks yang cepat, konteks 32K. Menerima masukan teks, gambar, dan video, serta hanya mengembalikan teks. Ini model visual generasi sebelumnya yang dipertahankan demi kompatibilitas; step-3.7-flash mencakup modalitas masukan yang sama dengan konteks 256K dan kedalaman penalaran yang dapat dipilih. Jaga sisi terpanjang gambar di bawah 4096 piksel agar pengenalan tetap andal. |
| wan2.7-image | 阿里巴巴 | $0.030 | per permintaan | Alibaba Wan2.7 Image — teks ke gambar, penyuntingan gambar, pembuatan dengan banyak gambar referensi, penyuntingan interaktif, serta penulisan teks dan kepatuhan instruksi yang kuat. | |
| gemini-3.1-flash-image | Penagihan bertingkat, lihat halaman harga | Google Gemini 3.1 Flash Image (Nano Banana 2) — model versi stabil berlatensi rendah untuk pembuatan gambar berkualitas tinggi dan penyuntingan lewat percakapan. Model ini menerima teks, gambar, dan PDF, mendukung thinking serta grounding pencarian, dan dapat menghasilkan gambar 0,5K, 1K, 2K, atau 4K untuk alur produksi bervolume tinggi. | |||
| qwen3.8-max | 阿里巴巴 | $1.9000 | $5.7000 | per 1M tokens | Alibaba Qwen3.8-Max — 2.4-trillion-parameter MoE flagship and the most capable model in the Qwen family, with the vendor citing major gains in coding and office productivity. 1,000,000-token context window (991,808 max input, 983,616 in thinking mode), up to 131,072 output tokens, and a 262,144-token chain-of-thought budget. Accepts text input and returns text (image/video input is not available on the current serving route); supports function calling, structured outputs, and context caching. |
| happyhorse-1.1-t2v | 阿里巴巴 | $0.091 | per detik | Alibaba HappyHorse 1.1 (T2V) — teks ke video dengan pemahaman semantik, kendali kamera, dan pembuatan dinamis yang lebih baik. Video 720P/1080P yang mengalir, detail, dan konsisten secara fisik. | |
| MiniMax-M3 | MiniMax | Penagihan bertingkat, lihat halaman harga | MiniMax M3 — model pemrograman multimodal terdepan untuk penalaran agentik, penggunaan alat, dan eksekusi tugas terstruktur, dengan jendela konteks 1.000.000 token. Model ini menerima teks, gambar hingga 10 MB, dan video hingga 50 MB secara sebaris atau 512 MB melalui Files API, lalu mengembalikan teks. Mendukung pemanggilan alat, dengan thinking bersifat opsional alih-alih selalu aktif. | ||
| qwen3-tts-flash | 阿里巴巴 | $0.1100 | per 10 ribu karakter | Alibaba Qwen3-TTS-Flash — text-to-speech berlatensi rendah dengan 17 suara bawaan yang ekspresif, mencakup bahasa Mandarin, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia, ditambah mode otomatis untuk teks bercampur banyak bahasa serta keluaran dalam dialek. Model ini menerima hingga 512 token teks per permintaan dan mendukung sintesis streaming maupun non-streaming. | |
| gpt-5.6-terra | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT-5.6 Terra — model GPT-5.6 yang seimbang untuk pekerjaan profesional sehari-hari, menghadirkan kecerdasan dan performa agen pemrograman yang kuat dengan biaya lebih rendah daripada Sol. Mendukung masukan teks dan gambar, alat bawaan, jendela konteks 1.050.000 token, serta hingga 128.000 token keluaran. | ||
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | per 1M tokens | Xiaomi MiMo-V2.5 — model yang secara asli mencakup semua modalitas, dengan konteks 1M dan keluaran maksimum 128K, memahami gambar, video, audio, dan teks dalam satu model. Mendukung berpikir mendalam, pemanggilan fungsi, output terstruktur, dan pencarian web, lengkap dengan kapabilitas agen di semua modalitas. |
| step-tts-mini | StepFun | $0.1444 | per 10 ribu karakter | StepFun step-tts-mini — anggota lini TTS StepFun yang hemat biaya dan berlatensi rendah, mencakup bahasa yang sama dengan step-tts-2 (Mandarin, Inggris, campuran Mandarin-Inggris, dan Jepang, ditambah Kanton dan Sichuan) dengan sebagian dari suara bawaan. Mendukung label emosi dan gaya penyampaian dalam bahasa alami serta kloning suara zero-shot dari sekitar 10 detik audio referensi. Menghasilkan wav, mp3, flac, opus, atau pcm. | |
| gemini-3.1-flash-lite-image | Penagihan bertingkat, lihat halaman harga | Google Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — model berlatensi sangat rendah dan hemat biaya untuk pembuatan gambar bervolume tinggi dan penyuntingan multi-giliran yang cepat. Model ini menerima teks dan gambar, menghasilkan gambar 1K, mendukung thinking serta penyuntingan lewat percakapan, dan dirancang untuk aplikasi interaktif bagi pengembang maupun pengguna akhir. | |||
| gpt-4o | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT-4o — the multimodal GPT-4 generation model, kept in the catalogue for drop-in compatibility with existing integrations that call it by name. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| qwen3.6-plus | 阿里巴巴 | $0.4000 | $2.4000 | per 1M tokens | Alibaba Qwen3.6-Plus — model seimbang untuk penalaran umum dan penggunaan alat, dengan jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 65.536 token keluaran, dan anggaran 81.920 token untuk rantai penalaran. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks. Mendukung pemanggilan fungsi, output terstruktur, pencarian web, penyelesaian prefiks, dan caching konteks. |
| step-asr-1.1-stream | StepFun | $0.3852 | per jam audio | StepFun step-asr-1.1 — the updated general-purpose recognizer in the step-asr line, covering Chinese, English, and Chinese dialects. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| claude-opus-4-7 | Anthropic | Penagihan bertingkat, lihat halaman harga | Anthropic Claude Opus 4.7 — model penalaran lanjutan untuk rekayasa perangkat lunak yang sulit serta tugas agentik yang kompleks dan berjalan lama. Model ini menekankan kepatuhan instruksi yang ketat, verifikasi mandiri, penggunaan alat yang andal, dan penglihatan resolusi tinggi pada antarmuka, gambar, dokumen, serta alur kerja profesional. | ||
| qwen3.6-flash | 阿里巴巴 | $0.2500 | $1.5000 | per 1M tokens | Alibaba Qwen3.6-Flash — model visi-bahasa cepat yang oleh vendor disorot untuk pemrograman agentik dan untuk kecerdasan spasial, dengan peningkatan mencolok dalam pelokalan dan deteksi objek. Jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 65.536 token keluaran, dan anggaran 131.072 token untuk rantai penalaran. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks. Mendukung pemanggilan fungsi dan caching konteks. |
| claude-sonnet-5 | Anthropic | Penagihan bertingkat, lihat halaman harga | Anthropic Claude Sonnet 5 — model produksi yang menyeimbangkan kecerdasan terdepan dan kecepatan untuk pemrograman, agen, dan alur kerja perusahaan. Model ini dapat menyusun rencana, memakai alat peramban dan terminal, serta bekerja mandiri pada tugas penalaran, pekerjaan pengetahuan, dan rekayasa perangkat lunak. | ||
| gemini-2.5-pro | Penagihan bertingkat, lihat halaman harga | Google Gemini 2.5 Pro — the reasoning-tier model of the 2.5 family, with a 1M-token context window. Prompts above 200,000 tokens are repriced at the vendor's long-context rate for the whole request, matching Google's own rule. | |||
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | per 1M tokens | StepFun step-3.7-flash — sparse MoE with 198B total and 11B active parameters, native 256K context, and native understanding of images and video alongside text. Reasoning depth is selectable per request through reasoning_effort (low / medium / high), and the model supports reliable multi-step tool calling, JSON Schema structured output, streaming, and prompt caching. Tuned for agent and coding workloads. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| MiniMax-Hailuo-02 | MiniMax | $0.280 | per permintaan | MiniMax Hailuo 02 — pembuatan video hemat yang mencakup baik teks ke video maupun gambar ke video pada 24 fps, dengan 512p dan 768p tersedia sebagai klip 6 detik atau 10 detik dan 1080p pada 6 detik. Tingkat 512p adalah titik masuk lini Hailuo. | |
| gemini-3.7-flash | Penagihan bertingkat, lihat halaman harga | Google Gemini 3.7 Flash — the newest Flash-tier multimodal reasoning model, priced identically to 3.6 Flash while the vendor promotion runs. Accepts text, images, video, audio and PDFs; supports thinking, function calling, code execution, search grounding and structured output. Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5.1 | 智谱 | $1.4000 | $4.4000 | per 1M tokens | Zhipu GLM-5.1 — model fondasi unggulan yang dibangun untuk pekerjaan otonom berkepanjangan: vendor mendokumentasikan eksekusi terus-menerus tanpa pengawasan pada satu tugas hingga 8 jam, meliputi perencanaan, eksekusi, pengujian, dan optimalisasi berulang. Jendela konteks 200K, hingga 128K token keluaran, teks masuk dan teks keluar. Mendukung beberapa mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP. |
| gpt-5.2 | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT-5.2 — a general-purpose model from the GPT-5.2 generation, kept in the catalogue for drop-in compatibility with integrations that call it by name. It takes text and image input, with a 400,000-token context window and up to 128,000 output tokens. | ||
| speech-2.8-turbo | MiniMax | $0.6000 | per 10 ribu karakter | MiniMax speech-2.8-turbo — tingkat berlatensi rendah dari lini suara 2.8, yang menukar penyampaian sangat realistis milik model HD dengan sintesis yang lebih cepat namun tetap mengalir alami. Model ini mencakup 40 bahasa dan 7 emosi yang sama, dengan nada, kecepatan bicara, volume, laju sampel, bitrate, dan format keluaran yang dapat dikonfigurasi, serta menerima hingga 1 juta karakter secara asinkron atau 10.000 karakter melalui antarmuka streaming. | |
| wan3.0-video | 阿里巴巴 | $0.089 | per detik | Alibaba Wan3.0 (Video) — an all-in-one video model that unifies text-to-video, image-to-video and reference-to-video behind a single endpoint. Generates H.264 MP4 at 480P, 720P or 1080P, up to 30 seconds, from a prompt and an optional first-frame image URL. Billed per second of generated video against the vendor's own ladder: 720P is the base rate, 480P is charged at half of it and 1080P at double. A request that does not name a resolution is produced at 1080P by the model and is charged at that tier. Reference video and reference audio inputs exist in the vendor's model but are not carried on this endpoint. | |
| gpt-4.1 | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT-4.1 — a non-reasoning model tuned for instruction following and long-context work, with a 1,047,576-token context window and up to 32,768 output tokens. It takes text and image input, and its output is priced below the reasoning tier at the same input price. | ||
| agnes-2.0-flash | Agnes AI | $0.0000 | per 1M tokens | Agnes AI Agnes 2.0 Flash — model agen multimodal cepat dengan konteks masukan 256K dan batas keluaran acuan 64K, mendukung obrolan, streaming, pemanggilan alat, pemrograman, penalaran, pemahaman gambar, dan alur kerja agen. | |
| agnes-image-2.0-flash | Agnes AI | $0.000 | per permintaan | Agnes AI Image 2.0 Flash — model pembuatan dan penyuntingan gambar yang cepat untuk teks ke gambar, gambar ke gambar, dan komposisi multi-gambar, dengan hasil yang tersedia sebagai URL atau data Base64. | |
| gpt-image-2 | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT Image 2 — a state-of-the-art image generation and editing model for fast, high-quality output. It takes text and image input, supports flexible image sizes and high-fidelity image inputs, and bills per token rather than per call: $5 text input, $1.25 cached text input, $8 image input, and $30 image output per 1M tokens. | ||
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | per 10 ribu karakter | Model desain suara Xiaomi MiMo: jelaskan suara yang diinginkan dalam bahasa alami melalui instructions, dan model akan menyintesis ucapan dengan suara rancangan tersebut. | |
| wan2.7-i2v | 阿里巴巴 | $0.080 | per detik | Alibaba Wan 2.7 Image-to-Video — mencakup pembuatan dari bingkai pertama, transisi antara bingkai pertama dan terakhir, serta kelanjutan dari klip yang sudah ada. Model ini menghasilkan 720P atau 1080P (bawaan 1080P) berdurasi 2-15 detik, bawaan 5 detik, dari prompt hingga 5.000 karakter (prompt negatif hingga 500). Trek mp3 atau wav berdurasi 2-30 detik dapat dikirimkan sebagai driving_audio; tanpa audio, model membuat musik latar atau efek suara yang sesuai, audio yang lebih panjang dari klip akan dipotong, dan audio yang lebih pendek menyisakan bagian akhir tanpa suara. | |
| doubao-seed-2-1-pro-260628 | 字节跳动 | $0.8890 | $4.4440 | per 1M tokens | ByteDance Doubao Seed 2.1 Pro — model agen unggulan Doubao untuk pekerjaan produksi, mencakup berpikir mendalam, pembuatan teks, pemahaman multimodal, pemanggilan alat, dan output terstruktur, yang untuknya vendor merekomendasikan mode json_schema. Jendela konteks 256K dengan masukan maksimum 256K, hingga 256K token keluaran (bawaan 4K), dan anggaran 256K token untuk rantai penalaran. Model ini menerima teks, gambar, dan video lalu mengembalikan teks; pemahaman audio tidak dicantumkan untuk lini 2.1. Mendukung caching konteks implisit maupun eksplisit, termasuk cache prefiks dan cache sesi. |
| gemini-3.1-flash-lite | Penagihan bertingkat, lihat halaman harga | Google Gemini 3.1 Flash-Lite — model multimodal berlatensi rendah dan hemat biaya untuk tugas ringan berfrekuensi tinggi, alur kerja agentik bervolume tinggi, penerjemahan, dan ekstraksi data terstruktur. Model ini menerima teks, gambar, video, audio, dan PDF, mendukung thinking serta penggunaan alat, dan menyediakan konteks masukan 1.048.576 token dengan hingga 65.536 token keluaran. | |||
| gpt-5.4-mini | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT-5.4 mini — the small GPT-5.4 model for high-volume workloads, coding, computer use, and subagents. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 400,000-token context window with a 272,000-token maximum input, and up to 128,000 output tokens. | ||
| image-01 | MiniMax | $0.004 | per permintaan | MiniMax image-01 — pembuatan gambar dari teks melalui endpoint image_generation asli MiniMax. Ditagih per gambar yang dihasilkan. Vendor mencantumkannya di bawah model lawas. | |
| kling-v3-omni | 快手 | $0.420 | per permintaan | Kling 3.0 Omni — pembuatan video multi-gambar berbasis referensi. Harga yang tercantum adalah tingkat std (720p, 5 detik, tanpa audio, tanpa video referensi). Permintaan yang tidak menyetel mode akan memakai tingkat pro bawaan dari sisi vendor dan ditagih 1,33x — sekitar $0,56 untuk klip 5 detik yang sama; 4k ditagih 5x. Kirim mode=std agar ditagih sesuai harga yang tercantum. | |
| qwen3.7-max | 阿里巴巴 | $1.5000 | $4.5000 | per 1M tokens | Alibaba Qwen3.7-Max — model unggulan sumber tertutup yang diposisikan untuk pemrograman, pekerjaan perkantoran dan produktivitas, serta eksekusi otonom jangka panjang, dengan jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 131.072 token keluaran, dan anggaran 262.144 token untuk rantai penalaran. Teks masuk, teks keluar. Mendukung pemanggilan fungsi, output terstruktur, dan caching konteks. |
| doubao-seedream-4-5-251128 | 字节跳动 | $0.037 | per permintaan | ByteDance Doubao Seedream 4.5 — teks ke gambar dan gambar ke gambar dengan penggabungan multi-gambar, menghasilkan satu gambar atau satu set gambar yang saling berkaitan. Mode gambar tunggal menerima prompt saja, satu gambar referensi, atau 2-14 gambar referensi; mode set (sequential_image_generation=auto) mengembalikan hingga 15 gambar dari teks, hingga 14 dari satu gambar referensi, atau satu set dari 2-14 referensi selama jumlah masukan ditambah keluaran tidak melebihi 15. Model ini mendukung keluaran 2K dan 4K dan secara bawaan mengembalikan JPEG, sebagai URL atau base64. Penyuntingan interaktif berbasis koordinat hanya tersedia di Seedream 5.0 pro. | |
| gpt-4o-mini | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT-4o mini — the small, low-cost GPT-4o variant for high-volume and latency-sensitive work. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| kimi-k3 | Moonshot | $3.0000 | $15.0000 | per 1M tokens | Moonshot Kimi K3 — model unggulan berparameter 2,8 triliun untuk pemrograman berdurasi panjang, pekerjaan pengetahuan ujung-ke-ujung, dan penalaran mendalam, dengan jendela konteks 1M token dan hingga 1.048.576 token penyelesaian (bawaan 131.072). Model ini menerima teks, gambar base64, dan video, lalu mengembalikan teks. Thinking selalu aktif dengan reasoning_effort yang dapat dipilih sebagai low, high, atau max (bawaan max); temperature dipatok pada 1.0. Mendukung pemanggilan alat khusus dan pemuatan alat secara dinamis. |
| stepaudio-2.5-tts | StepFun | $0.8500 | per 10 ribu karakter | StepFun StepAudio 2.5 TTS — text-to-speech kontekstual yang membawa pemahaman melintasi seluruh alur pembuatan alih-alih memperlakukan gaya penyampaian sebagai pascaproses. Suara, emosi, dan tempo diarahkan dalam bahasa alami pada dua tingkat: konteks global untuk keseluruhan permintaan dan konteks sebaris untuk setiap bagian teks. Kloning suara zero-shot memerlukan sekitar 3 detik audio referensi dan mewarisi seluruh perangkat kendali kontekstual. Menerima hingga 1000 karakter per permintaan; menghasilkan wav, mp3, flac, atau opus. | |
| stepaudio-2.5-asr | StepFun | $0.0220 | per jam audio | StepFun StepAudio 2.5 ASR — model pengenalan suara 4B parameter yang dibangun di atas Multi-Token Prediction, mentranskripsi lima menit audio dalam waktu sekitar satu detik (RTF sekitar 0,0053). Dioptimalkan untuk bahasa Mandarin dan Inggris. Menyertakan normalisasi teks terbalik, identifikasi pembicara, dan pemisahan dua kanal untuk rekaman panggilan maupun rapat. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih. | |
| wan2.7-t2v | 阿里巴巴 | $0.080 | per detik | Alibaba Wan2.7 (T2V) — teks ke video dengan akting yang ditingkatkan, emosi yang halus, aksi yang intens, dan potongan kamera yang dramatis. Menghasilkan MP4 H.264 pada 720P atau 1080P berdurasi 2-15 detik (bawaan 5 detik) dalam 16:9, 9:16, 1:1, 4:3, atau 3:4, dari prompt hingga 5.000 karakter. Audio disertakan secara bawaan: tanpa audio_url, model menyusun sendiri musik latar atau efek suara yang sesuai, atau sebagai gantinya dapat dikirimkan trek wav atau mp3 berdurasi 2-30 detik. | |
| deepseek-v4-flash | DeepSeek | Penagihan bertingkat, lihat halaman harga | DeepSeek V4 Flash 0731 — the fast, high-concurrency DeepSeek V4 tier for chat, coding help, and agent loops, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3.5-flash | Penagihan bertingkat, lihat halaman harga | Google Gemini 3.5 Flash — model multimodal versi stabil yang dioptimalkan untuk performa agen yang berkelanjutan, siklus pemrograman yang cepat, penempatan sub-agen, dan alur kerja multi-langkah yang berjalan lama. Model ini menerima teks, gambar, video, audio, dan PDF, mendukung thinking serta alat bawaan, dan menyediakan konteks masukan 1.048.576 token dengan hingga 65.536 token keluaran. | |||
| glm-5.3 | 智谱 | $1.4000 | $4.4000 | per 1M tokens | Zhipu GLM-5.3 — flagship coding-and-agent model post-trained on the same base as GLM-5.2: a 50% gain on Zhipu's internal coding bench, open-source SOTA on Terminal-Bench 3.0 and Agents' Last Exam, and state-of-the-art CyberGym vulnerability-discovery results, with a 1M-token context window and up to 128K output tokens. Text in, text out. Supports multiple thinking modes, function calling, structured JSON output, streaming, context caching, and MCP tool integration. |
| hy3 | Tencent | $0.1480 | $0.5930 | per 1M tokens | Tencent Hunyuan 3 (Hy3) — model MoE 295B parameter (21B aktif), konteks asli 256K, tiga mode berpikir (fast / low / deep). Kuat pada agen pemrograman, pemahaman dokumen panjang, konteks multi-giliran, dan alur kerja agen multi-langkah. Hanya teks. |
| MiniMax-H3 | MiniMax | $0.080 | per detik | MiniMax H3 (Hailuo 3.0) — model video multimodal serbaguna terbuka generasi berikutnya yang menghasilkan audio stereo asli dalam satu proses, pada 768P atau 2K, berdurasi 4-15 detik (hanya bilangan bulat), 24 fps. Model ini mencakup teks ke video, gambar ke video dari bingkai pertama dan/atau bingkai terakhir, serta pembuatan berbasis referensi dari gambar, video, atau audio untuk karakter, gerak, kamera, gaya, suara, atau ritme penyuntingan; gambar ke video dan pembuatan berbasis referensi tidak dapat digabungkan dalam satu permintaan. Model ini menerima video H.264/H.265, gambar JPG, JPEG, PNG, WEBP, HEIC, dan HEIF, serta audio WAV atau MP3, dengan prompt hingga 7.000 karakter. $0,08/detik pada 768P, $0,13/detik pada 2K. | |
| agnes-2.5-flash | Agnes AI | $0.0000 | per 1M tokens | Agnes AI Agnes 2.5 Flash — model agen multimodal cepat dengan konteks masukan 512K dan batas keluaran acuan 65,5K, mendukung obrolan, streaming, pemanggilan alat, pemrograman, penalaran, percakapan multi-giliran, pemahaman gambar, dan alur kerja agen. | |
| agnes-video-v2.0 | Agnes AI | $0.000 | per detik | Agnes AI Video V2.0 — model pembuatan video asinkron untuk teks ke video, gambar ke video, keyframe multi-gambar, dan gerak sinematik, dengan tingkat keluaran ternormalisasi 480p, 720p, dan 1080p. | |
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | per permintaan | MiniMax Hailuo 2.3 — teks ke video dan gambar ke video yang oleh vendor diposisikan pada kepatuhan terhadap instruksi, pada 24 fps, dengan 768p tersedia sebagai klip 6 detik atau 10 detik dan 1080p pada 6 detik. 768p 6 detik = $0,28. | |
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | per 1M tokens | StepFun step-3.5-flash — model penalaran khusus teks dengan konteks 256K, ditujukan untuk logika, matematika, rekayasa perangkat lunak, dan riset mendalam, di mana kualitas penalaran harus dibarengi eksekusi yang cepat dan andal. Kedalaman penalaran dipilih per permintaan melalui reasoning_effort (low / medium / high). Mendukung pemanggilan alat, output terstruktur JSON Schema, streaming, dan caching prompt. Untuk masukan gambar atau video, gunakan step-3.7-flash. |
| kimi-k2.7-code-highspeed | Moonshot | $1.9000 | $8.0000 | per 1M tokens | Moonshot Kimi K2.7 Code Highspeed — tingkat throughput dari K2.7 Code, menyajikan model yang sama pada sekitar 180 token per detik dan hingga 260 pada pekerjaan berkonteks pendek. Jendela konteks 256K, keluaran bawaan 32.768 token. Model ini menerima teks, gambar, dan video sebagai konten base64 lalu mengembalikan teks. Thinking bersifat wajib dan akan mengembalikan galat jika dimatikan; tool_choice terbatas pada auto atau none, dan reasoning_content harus dibawa terus melintasi pemanggilan alat multi-langkah. |
| deepseek-v4-pro | DeepSeek | Penagihan bertingkat, lihat halaman harga | DeepSeek V4 Pro 0813 — the higher-capability DeepSeek V4 tier for coding, reasoning, and agentic work, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3-pro-image | Penagihan bertingkat, lihat halaman harga | Google gemini-3-pro-image | |||
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | per 10 ribu karakter | Model kloning suara Xiaomi MiMo: kirimkan sampel audio referensi sebagai data URL pada kolom voice (data:{mime};base64,...) dan model akan menyintesis ucapan dengan suara tersebut tanpa tahap pelatihan, pelabelan, atau penyetelan apa pun. Model ini menerima MP3 (audio/mpeg) atau WAV, dengan string hasil enkode base64 dibatasi 10 MB; Xiaomi tidak menerbitkan durasi minimum untuk audio referensi. Instruksi gaya dalam bahasa alami dan tag audio sebaris diwarisi dari mimo-v2.5-tts, tetapi streaming tidak tersedia — permintaan berjalan dalam mode kompatibilitas dan baru mengembalikan hasil setelah sintesis selesai. | |
| qwen3-asr-flash | 阿里巴巴 | $0.1260 | per jam audio | Alibaba Qwen3-ASR-Flash — pengenalan suara yang dibangun di atas model fondasi Qwen3, yang menentukan sendiri bahasa yang diucapkan dan mentranskripsi 11 bahasa; lini Qwen3-ASR mendokumentasikan bahasa Mandarin bersama Sichuan, Min Nan, Wu, dan Kanton, serta berbagai aksen bahasa Inggris. Model ini menerima aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma, dan wmv hingga 5 menit dan 10 MB per permintaan; masukan pcm harus 16 kHz dan format lain diubah sampelnya ke 16 kHz sebelum pengenalan. | |
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | per 1M tokens | StepFun step-3.5-flash-2603 — snapshot 256K dari step-3.5-flash yang disetel untuk agen, dioptimalkan bagi efisiensi token dan mode operasi dengan inferensi rendah. Parameter reasoning_effort-nya hanya menerima low dan high, sedangkan model dasarnya menerima tiga tingkat, sehingga kode yang mengirim medium harus disesuaikan. Hanya teks; mendukung pemanggilan alat, output terstruktur JSON Schema, streaming, dan caching prompt. |
| stepaudio-2-asr-pro | StepFun | $0.3370 | per jam audio | StepFun StepAudio 2 ASR Pro — model pengenalan suara 32B parameter, pilihan yang mengutamakan akurasi di lini ASR StepFun, sementara stepaudio-2.5-asr adalah pilihan yang mengutamakan kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih. | |
| glm-5-turbo | 智谱 | $1.2000 | $4.0000 | per 1M tokens | Zhipu GLM-5-Turbo — varian GLM-5 yang berorientasi throughput, dioptimalkan untuk alur kerja agen: pemanggilan alat dan keterampilan yang lebih stabil di sepanjang tugas multi-langkah, penanganan instruksi berantai panjang yang lebih baik, dan eksekusi tugas terjadwal maupun berjalan lama. Jendela konteks 200K, hingga 128K token keluaran, teks masuk dan teks keluar. Mendukung mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP. |
| mimo-v2.5-asr | Xiaomi | $0.0740 | per jam audio | Model pengenalan suara Xiaomi MiMo yang dioptimalkan untuk bahasa Mandarin dan Inggris serta dialek-dialek Tiongkok, menangani audio berisik, jarak jauh, dan banyak pembicara, termasuk transkripsi lirik lagu. | |
| glm-tts | 智谱 | $0.2963 | per 10 ribu karakter | Zhipu GLM-TTS — text-to-speech yang dibangun di atas arsitektur pembuatan dua tahap dengan pembelajaran penguatan GRPO, yang menyimpulkan emosi dan intonasi dari teks di sekitarnya alih-alih menuntut penandaan eksplisit. Model ini menyediakan tujuh suara bawaan (tongtong sebagai bawaan, xiaochen, chuichui, jam, kazi, douji, luodo) dengan kecepatan dan volume yang dapat disetel, menerima hingga 1.024 karakter per permintaan, dan melakukan streaming dengan latensi bingkai pertama di bawah 400 ms. Menghasilkan wav atau pcm pada laju sampel yang disarankan 24 kHz; streaming hanya mendukung pcm. | |
| gpt-5.5 | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT-5.5 — model penalaran terdepan untuk pemrograman kompleks dan pekerjaan profesional. Mendukung masukan teks dan gambar, pemanggilan fungsi serta alat bawaan, jendela konteks 1.050.000 token, hingga 128.000 token keluaran, dan tingkat penalaran dari none sampai xhigh. | ||
| deepseek-v4-flash-legacy | DeepSeek | $0.1190 | $0.2370 | per 1M tokens | DeepSeek V4 Flash (legacy tier) — a lower-priced route to the V4 Flash model family. Input and output tokens are cheaper than on deepseek-v4-flash, while cache reads are priced higher, so prompt-caching-heavy workloads are usually cheaper on deepseek-v4-flash and low-reuse workloads are cheaper here. Responses may come from an earlier V4 Flash build. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | per permintaan | MiniMax Hailuo 2.3 Fast — tingkat yang mengutamakan kecepatan dan biaya dari Hailuo 2.3, berfokus pada gambar ke video dan pada realisme gerak fisik, pada 24 fps, dengan 768p tersedia sebagai klip 6 detik atau 10 detik dan 1080p pada 6 detik. 768p 6 detik = $0,19. | |
| qwen3.7-plus | 阿里巴巴 | $0.3400 | $1.3600 | per 1M tokens | Alibaba Qwen3.7-Plus — model agen hibrida multimodal yang mengindra pemandangan dunia nyata, membaca layar dan mengendalikan antarmuka grafis, membuat kode dari referensi visual, serta melakukan navigasi ujung-ke-ujung di dalam aplikasi seluler. Jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 131.072 token keluaran, dan anggaran 262.144 token untuk rantai penalaran. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks; mendukung pemanggilan fungsi, output terstruktur, dan caching konteks. |
| stepaudio-2.5-asr-stream | StepFun | $0.1800 | per jam audio | StepFun StepAudio 2.5 ASR — 4B-parameter speech recognition model built on Multi-Token Prediction, transcribing five minutes of audio in about one second (RTF around 0.0053). Optimized for Chinese and English. Includes inverse text normalization, speaker identification, and dual-channel separation for call and meeting recordings. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | per 1M tokens | StepFun StepAudio 2.5 Chat — model pemahaman suara ujung-ke-ujung: menerima audio atau teks dan mengembalikan teks, membaca sinyal paralinguistik seperti keraguan dan tawa langsung dari bentuk gelombangnya, bukan dari transkrip. Mendukung kustomisasi persona yang luas, mencakup karakter, kebiasaan bicara, dan rentang emosi. Audio dikirim sebagai bagian konten input_audio pada endpoint chat completions. Untuk jawaban dalam bentuk suara, gunakan model TTS. |
| gemini-3.6-flash | Penagihan bertingkat, lihat halaman harga | Google Gemini 3.6 Flash — a stable multimodal reasoning model that balances speed and intelligence for agentic and real-world tasks, with a 1,048,576-token input context and 65,536-token output limit. It accepts text, images, video, audio, and PDFs, and supports thinking, function calling, code execution, search grounding, structured output, and Computer Use (preview). Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5 | 智谱 | $1.0000 | $3.2000 | per 1M tokens | Zhipu GLM-5 — MoE berparameter total 744B dengan 40B aktif, dilatih pada 28,5T token dan menggunakan DeepSeek Sparse Attention, dengan jendela konteks 200K dan hingga 128K token keluaran. Teks masuk, teks keluar. Mendukung beberapa mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP. |
| glm-5v-turbo | 智谱 | $1.2000 | $4.0000 | per 1M tokens | Zhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows. |
| kimi-k2.6 | Moonshot | $0.7600 | $3.1570 | per 1M tokens | Moonshot Kimi K2.6 — model serbaguna untuk dialog, pembuatan kode, pemahaman visual, dan tugas agen, dengan penulisan kode berdurasi panjang dan eksekusi otonom yang lebih kuat dibanding pendahulunya. Jendela konteks 256K, keluaran bawaan 32.768 token. Model ini menerima teks, gambar (png, jpeg, webp, gif), dan video (mp4, mov, webm, dan lainnya) sebagai konten base64 lalu mengembalikan teks. Mode berpikir aktif secara bawaan dan dapat dimatikan; temperature dipatok pada 1.0 saat berpikir dan 0.6 saat tidak. |
| step-1o-audio | StepFun | $3.7070 | $8.8980 | per 1M tokens | StepFun step-1o-audio — model suara ujung-ke-ujung generasi sebelumnya dengan dukungan multibahasa dan pemanggilan alat, dibatasi 30 menit per interaksi. Sebagian besar sudah digantikan lini StepAudio 2.5; dipertahankan untuk beban kerja yang sudah dibangun di atasnya. |
| glm-asr-2512 | 智谱 | $0.1440 | per jam audio | Zhipu GLM-ASR-2512 — model pengenalan suara yang melaporkan tingkat kesalahan karakter 0,0717. Model ini mencakup bahasa Mandarin bersama Sichuan, Kanton, Min Nan, dan Wu, aksen Inggris Amerika dan Britania, serta puluhan bahasa lain termasuk Prancis, Jerman, Jepang, Korea, Spanyol, dan Arab. Model ini menangani ucapan bercampur banyak bahasa, jargon teknis, dan gaya bicara sehari-hari, serta menerima kamus khusus untuk kosakata bidang tertentu. Audio dibatasi 30 detik dan 25 MB per permintaan, dengan transkripsi batch maupun streaming. | |
| gpt-5.4 | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT-5.4 — a frontier model for complex professional work and coding, priced well below GPT-5.5. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 1,050,000-token context window, and up to 128,000 output tokens. Prompts above 272,000 input tokens are repriced at 2x input and 1.5x output for the whole session. | ||
| gpt-5.6-sol | OpenAI | Penagihan bertingkat, lihat halaman harga | OpenAI GPT-5.6 Sol — model unggulan lini GPT-5.6 untuk penalaran terdepan, pekerjaan profesional yang kompleks, pemrograman, sains, keamanan siber, dan alur kerja agentik berdurasi panjang. Mendukung masukan teks dan gambar, alat bawaan, jendela konteks 1.050.000 token, hingga 128.000 token keluaran, serta setelan penalaran terdalam di keluarga ini. | ||
| speech-2.8-hd | MiniMax | $1.0000 | per 10 ribu karakter | MiniMax speech-2.8-hd — tingkat definisi tinggi dari lini suara 2.8, diposisikan untuk penyampaian yang sangat realistis dengan tag suara, mencakup 40 bahasa dan 7 emosi. Nada, kecepatan bicara, volume, laju sampel, bitrate, dan format keluaran dapat dikonfigurasi per permintaan, dan sintesis teks panjang menerima hingga 1 juta karakter secara asinkron atau 10.000 karakter melalui antarmuka streaming. | |
| claude-opus-4-8 | Anthropic | Penagihan bertingkat, lihat halaman harga | Anthropic Claude Opus 4.8 — model penalaran berkemampuan tinggi untuk pemrograman, alur kerja agentik, analisis profesional, dan pekerjaan yang berjalan lama. Dibandingkan Opus 4.7, model ini meningkatkan keandalan, pertimbangan, efisiensi penggunaan alat, penggunaan komputer, dan penalaran dokumen multimodal, sekaligus mendukung jendela konteks 1.000.000 token. | ||
| happyhorse-1.1-r2v | 阿里巴巴 | $0.091 | per detik | Alibaba HappyHorse 1.1 (R2V) — pembuatan video berbasis referensi dengan hingga 9 gambar referensi, konsistensi subjek/adegan/gaya yang kuat, dan kendali kamera. 720P/1080P. | |
| step-tts-2 | StepFun | $0.4000 | per 10 ribu karakter | StepFun step-tts-2 — sintesis suara ujung-ke-ujung berbasis NTP yang dibangun untuk mereproduksi aksen secara akurat. Model ini berbicara bahasa Mandarin, Inggris, campuran Mandarin-Inggris, dan Jepang, ditambah Kanton dan Sichuan. Emosi dan gaya penyampaian diarahkan lewat label berbahasa alami, dan kloning suara zero-shot memerlukan sekitar 10 detik audio referensi, dengan kendali emosi dan gaya yang ikut terbawa ke suara hasil kloning tanpa biaya tambahan. Menghasilkan wav, mp3, flac, opus, atau pcm. | |
| wan2.7-r2v | 阿里巴巴 | $0.080 | per detik | Alibaba Wan2.7 (R2V) — pembuatan video berbasis referensi, hingga 5 referensi campuran gambar/video ditambah referensi timbre audio, dengan konsistensi karakter/properti/adegan yang lebih kuat. | |
| wan2.7-videoedit | 阿里巴巴 | $0.080 | per detik | Alibaba Wan2.7 VideoEdit — penyuntingan video dengan bahasa alami, lokal maupun global, penggantian elemen lewat gambar referensi, serta peniruan gerak, efek, dan kerja kamera. | |
| doubao-seedance-2-5-260628 | 字节跳动 | $10.7000 | $10.7000 | per 1M tokens | ByteDance Seedance 2.5 — model jalur utama Seedance, yang memperpanjang satu kali pembuatan menjadi 4-30 detik pada 24 fps sekaligus membatasi resolusi di 480p dan 720p. Pembuatan berbasis referensi multimodal meningkat hingga 1-30 gambar, maksimum 10 video referensi, dan maksimum 10 klip audio referensi (masing-masing total 30 detik), dan tidak seperti lini 2.0, sebuah referensi audio dapat berdiri sendiri. Model ini juga mencakup teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16. |
| claude-opus-4-5 | Anthropic | Penagihan bertingkat, lihat halaman harga | Anthropic Claude Opus 4.5 — a pinned dated snapshot of the Opus 4.5 release for workloads that need byte-stable behaviour. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| claude-opus-4-6 | Anthropic | Penagihan bertingkat, lihat halaman harga | Anthropic Claude Opus 4.6 — the Opus generation for complex reasoning and agentic work, with a 1,000,000-token context window at standard pricing and up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer. | ||
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | per 1M tokens | Meituan LongCat-2.0 — model MoE terbuka berparameter 1,6T dengan konteks asli 1M, dibangun untuk pemrograman agentik dan penggunaan alat berdurasi panjang. Model penalaran khusus teks. |
| doubao-seedance-2-0-mini-260615 | 字节跳动 | $1.4000 | $1.4000 | per 1M tokens | ByteDance Seedance 2.0 Mini — tingkat ringan dan ramah anggaran dari lini Seedance 2.0, dibatasi pada 480p dan 720p, 24 fps, 4-15 detik. Model ini membawa rangkaian fitur terdokumentasi yang sama dengan anggota lini lainnya: teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, pembuatan berbasis referensi multimodal dari 1-9 gambar dan maksimum 3 video referensi dengan total 15 detik, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web; referensi audio harus disertai gambar atau video. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16. |
| gemini-2.5-flash-image | Penagihan bertingkat, lihat halaman harga | Google Gemini 2.5 Flash Image (Nano Banana) — a fast native image generation and editing model for creative workflows. It takes text and image input and returns images through the OpenAI-compatible chat completions endpoint, with a 65,536-token input limit and 32,768-token output limit. | |||
| MiniMax-M2.7-highspeed | MiniMax | $0.6000 | $2.4000 | per 1M tokens | MiniMax M2.7 Highspeed — model M2.7 yang sama, disajikan pada sekitar 100 token per detik untuk pemrograman berlatensi rendah dan alur kerja agen, dengan jendela konteks 204.800 token. Hanya teks: API menerima blok konten teks dan pemanggilan alat, bukan gambar atau video. Mendukung pemanggilan alat; thinking selalu aktif dan tidak dapat dimatikan. |
| doubao-seed-2-1-turbo-260628 | 字节跳动 | $0.4440 | $2.2220 | per 1M tokens | ByteDance Doubao Seed 2.1 Turbo — jalur berlatensi rendah dari lini Seed 2.1, dengan spesifikasi yang sama seperti Pro: jendela konteks 256K dengan masukan maksimum 256K, hingga 256K token keluaran (bawaan 4K), dan anggaran 256K token untuk rantai penalaran. Model ini mencakup berpikir mendalam, pembuatan teks, pemahaman multimodal, pemanggilan alat, dan output terstruktur, meski tanpa rekomendasi json_schema seperti pada Pro. Model ini menerima teks, gambar, dan video lalu mengembalikan teks; pemahaman audio tidak dicantumkan untuk lini 2.1. Mendukung caching konteks implisit maupun eksplisit. |