Harga model AI Tiongkok

ChinaAPI menyediakan DeepSeek, Qwen, GLM, Kimi, dan model AI Tiongkok lainnya melalui satu gateway yang kompatibel dengan OpenAI di https://api.chinaapi.ai/v1. Semua harga dalam dolar AS, dinyatakan dalam satuan yang dipakai pemasok hulu. Daftar yang sama tersedia sebagai JSON di /api/pricing.

Harga model publik
ModelPemasokMasukanOutputSatuanDeskripsi
wan2.7-t2v阿里巴巴$0.092per detikAlibaba Wan2.7 (T2V) — teks ke video dengan akting yang ditingkatkan, emosi yang halus, aksi yang intens, dan potongan kamera yang dramatis. Menghasilkan MP4 H.264 pada 720P atau 1080P berdurasi 2-15 detik (bawaan 5 detik) dalam 16:9, 9:16, 1:1, 4:3, atau 3:4, dari prompt hingga 5.000 karakter. Audio disertakan secara bawaan: tanpa audio_url, model menyusun sendiri musik latar atau efek suara yang sesuai, atau sebagai gantinya dapat dikirimkan trek wav atau mp3 berdurasi 2-30 detik.
agnes-image-2.0-flashAgnes AI$0.000per permintaanAgnes AI Image 2.0 Flash — model pembuatan dan penyuntingan gambar yang cepat untuk teks ke gambar, gambar ke gambar, dan komposisi multi-gambar, dengan hasil yang tersedia sebagai URL atau data Base64.
doubao-seedance-2-0-mini-260615字节跳动$3.5000$3.5000per 1M tokensByteDance Seedance 2.0 Mini — tingkat ringan dan ramah anggaran dari lini Seedance 2.0, dibatasi pada 480p dan 720p, 24 fps, 4-15 detik. Model ini membawa rangkaian fitur terdokumentasi yang sama dengan anggota lini lainnya: teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, pembuatan berbasis referensi multimodal dari 1-9 gambar dan maksimum 3 video referensi dengan total 15 detik, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web; referensi audio harus disertai gambar atau video. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16.
step-3.5-flash-2603StepFun$0.1000$0.3000per 1M tokensStepFun step-3.5-flash-2603 — snapshot 256K dari step-3.5-flash yang disetel untuk agen, dioptimalkan bagi efisiensi token dan mode operasi dengan inferensi rendah. Parameter reasoning_effort-nya hanya menerima low dan high, sedangkan model dasarnya menerima tiga tingkat, sehingga kode yang mengirim medium harus disesuaikan. Hanya teks; mendukung pemanggilan alat, output terstruktur JSON Schema, streaming, dan caching prompt.
deepseek-v4-flashDeepSeek$0.1400$0.2800per 1M tokensDeepSeek V4 Flash — tingkat DeepSeek V4 yang cepat dan tahan konkurensi tinggi untuk obrolan, bantuan pemrograman, dan siklus agen, dengan jendela konteks 1M token dan keluaran maksimum 384K. Model ini berjalan dalam mode berpikir (bawaan) maupun tanpa berpikir, dan mendukung pemanggilan alat serta keluaran JSON. Teks masuk, teks keluar.
doubao-seedream-4-5-251128字节跳动$0.038per permintaanByteDance Doubao Seedream 4.5 — teks ke gambar dan gambar ke gambar dengan penggabungan multi-gambar, menghasilkan satu gambar atau satu set gambar yang saling berkaitan. Mode gambar tunggal menerima prompt saja, satu gambar referensi, atau 2-14 gambar referensi; mode set (sequential_image_generation=auto) mengembalikan hingga 15 gambar dari teks, hingga 14 dari satu gambar referensi, atau satu set dari 2-14 referensi selama jumlah masukan ditambah keluaran tidak melebihi 15. Model ini mendukung keluaran 2K dan 4K dan secara bawaan mengembalikan JPEG, sebagai URL atau base64. Penyuntingan interaktif berbasis koordinat hanya tersedia di Seedream 5.0 pro.
mimo-v2.5-ttsXiaomi$0.0000per 10 ribu karakterXiaomi MiMo v2.5 TTS — text-to-speech ekspresif dengan delapan suara bawaan, empat berbahasa Mandarin dan empat berbahasa Inggris (Mia, Chloe, Milo, Dean), mencakup bahasa Mandarin dan Inggris ditambah gaya dialek Timur Laut, Sichuan, Henan, dan Kanton. Penyampaian diarahkan lewat dua cara: instruksi gaya dalam bahasa alami, dan tag audio sebaris untuk emosi dasar maupun majemuk, tarikan napas, helaan napas, dan tempo, termasuk mode menyanyi yang hanya dimiliki model ini di lini MiMo TTS. Menghasilkan wav mono atau pcm16 pada 24 kHz dan mendukung streaming berlatensi rendah, yang mensyaratkan pcm16. Konteks 8K dan keluaran maksimum 8K.
MiniMax-H3MiniMax$0.080per detikMiniMax H3 (Hailuo 3.0) — model video multimodal serbaguna terbuka generasi berikutnya yang menghasilkan audio stereo asli dalam satu proses, pada 768P atau 2K, berdurasi 4-15 detik (hanya bilangan bulat), 24 fps. Model ini mencakup teks ke video, gambar ke video dari bingkai pertama dan/atau bingkai terakhir, serta pembuatan berbasis referensi dari gambar, video, atau audio untuk karakter, gerak, kamera, gaya, suara, atau ritme penyuntingan; gambar ke video dan pembuatan berbasis referensi tidak dapat digabungkan dalam satu permintaan. Model ini menerima video H.264/H.265, gambar JPG, JPEG, PNG, WEBP, HEIC, dan HEIF, serta audio WAV atau MP3, dengan prompt hingga 7.000 karakter. $0,08/detik pada 768P, $0,13/detik pada 2K.
doubao-seed-2-1-pro-260628字节跳动$0.9230$4.6150per 1M tokensByteDance Doubao Seed 2.1 Pro — model agen unggulan Doubao untuk pekerjaan produksi, mencakup berpikir mendalam, pembuatan teks, pemahaman multimodal, pemanggilan alat, dan output terstruktur, yang untuknya vendor merekomendasikan mode json_schema. Jendela konteks 256K dengan masukan maksimum 256K, hingga 256K token keluaran (bawaan 4K), dan anggaran 256K token untuk rantai penalaran. Model ini menerima teks, gambar, dan video lalu mengembalikan teks; pemahaman audio tidak dicantumkan untuk lini 2.1. Mendukung caching konteks implisit maupun eksplisit, termasuk cache prefiks dan cache sesi.
image-01MiniMax$0.004per permintaanMiniMax image-01 — pembuatan gambar dari teks melalui endpoint image_generation asli MiniMax. Ditagih per gambar yang dihasilkan. Vendor mencantumkannya di bawah model lawas.
MiniMax-M2.7MiniMax$0.2880$1.1510per 1M tokensMiniMax M2.7 — model teks untuk obrolan, pemrograman, pekerjaan kantor, dan tugas agentik, dengan jendela konteks 204.800 token dan keluaran sekitar 60 token per detik. Hanya teks: API menerima blok konten teks dan pemanggilan alat, bukan gambar atau video. Mendukung pemanggilan alat; thinking selalu aktif dan tidak dapat dimatikan.
qwen3.6-flash阿里巴巴$0.1850$1.1080per 1M tokensAlibaba Qwen3.6-Flash — model visi-bahasa cepat yang oleh vendor disorot untuk pemrograman agentik dan untuk kecerdasan spasial, dengan peningkatan mencolok dalam pelokalan dan deteksi objek. Jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 65.536 token keluaran, dan anggaran 131.072 token untuk rantai penalaran. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks. Mendukung pemanggilan fungsi dan caching konteks.
step-audio-r1.5StepFun$1.5500$16.2750per 1M tokensStepFun step-audio-r1.5 — model suara ujung-ke-ujung dalam keluarga yang sama dengan step-audio-2, memakai tarif masukan yang sama tetapi menagih keluaran 50% lebih tinggi. StepFun tidak menerbitkan halaman kapabilitas terpisah untuk model ini; lihat dokumentasi audio platform untuk mengetahui set parameter yang berlaku.
stepaudio-2.5-ttsStepFun$0.8500per 10 ribu karakterStepFun StepAudio 2.5 TTS — text-to-speech kontekstual yang membawa pemahaman melintasi seluruh alur pembuatan alih-alih memperlakukan gaya penyampaian sebagai pascaproses. Suara, emosi, dan tempo diarahkan dalam bahasa alami pada dua tingkat: konteks global untuk keseluruhan permintaan dan konteks sebaris untuk setiap bagian teks. Kloning suara zero-shot memerlukan sekitar 3 detik audio referensi dan mewarisi seluruh perangkat kendali kontekstual. Menerima hingga 1000 karakter per permintaan; menghasilkan wav, mp3, flac, atau opus.
kling-v3快手$0.420per permintaanKuaishou Kling 3.0 — teks ke video dan gambar ke video dengan audio asli serta konsistensi elemen yang lebih baik. Klip berdurasi 3-15 detik (bawaan 5) dalam 16:9, 9:16, atau 1:1, dengan tingkat dipilih melalui mode: std untuk 720P, pro untuk 1080P, dan 4k untuk 4K asli. Audio harus diaktifkan sendiri lewat sound=on dan secara bawaan mati; gambar ke video menerima bingkai pertama dengan bingkai akhir opsional. Mulai $0,083/detik (720p).
step-audio-2StepFun$1.5500$10.8500per 1M tokensStepFun step-audio-2 — model suara ujung-ke-ujung yang mengonsumsi audio secara langsung alih-alih bekerja dari transkrip, sehingga nada dan cara penyampaian tetap terbawa ke dalam pemahaman model. Ditagih per token, memakai tarif masukan lini StepAudio 2.5 dengan tarif keluaran yang lebih tinggi. StepFun tidak menerbitkan halaman kapabilitas terpisah untuk model ini; lihat dokumentasi audio platform untuk mengetahui set parameter yang berlaku.
step-tts-2StepFun$0.4000per 10 ribu karakterStepFun step-tts-2 — sintesis suara ujung-ke-ujung berbasis NTP yang dibangun untuk mereproduksi aksen secara akurat. Model ini berbicara bahasa Mandarin, Inggris, campuran Mandarin-Inggris, dan Jepang, ditambah Kanton dan Sichuan. Emosi dan gaya penyampaian diarahkan lewat label berbahasa alami, dan kloning suara zero-shot memerlukan sekitar 10 detik audio referensi, dengan kendali emosi dan gaya yang ikut terbawa ke suara hasil kloning tanpa biaya tambahan. Menghasilkan wav, mp3, flac, opus, atau pcm.
hy3Tencent$0.1540$0.6150per 1M tokensTencent Hunyuan 3 (Hy3) — model MoE 295B parameter (21B aktif), konteks asli 256K, tiga mode berpikir (fast / low / deep). Kuat pada agen pemrograman, pemahaman dokumen panjang, konteks multi-giliran, dan alur kerja agen multi-langkah. Hanya teks.
doubao-seedance-2-0-260128字节跳动$7.0000$7.0000per 1M tokensByteDance Seedance 2.0 — model unggulan lini Seedance 2.0 dan satu-satunya anggota yang mencapai 1080p dan 4K (kedalaman 10 bit) di samping 480p dan 720p, pada 24 fps dan 4-15 detik. Model ini mencakup teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, pembuatan berbasis referensi multimodal dari 1-9 gambar dan maksimum 3 video referensi dengan total 15 detik, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web; referensi audio harus disertai gambar atau video. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16, dengan bingkai penutup tersedia sebagai gambar. Ditagih berdasarkan resolusi keluaran.
doubao-seedance-2-5-260628字节跳动$10.7000$10.7000per 1M tokensByteDance Seedance 2.5 — model jalur utama Seedance, yang memperpanjang satu kali pembuatan menjadi 4-30 detik pada 24 fps sekaligus membatasi resolusi di 480p dan 720p. Pembuatan berbasis referensi multimodal meningkat hingga 1-30 gambar, maksimum 10 video referensi, dan maksimum 10 klip audio referensi (masing-masing total 30 detik), dan tidak seperti lini 2.0, sebuah referensi audio dapat berdiri sendiri. Model ini juga mencakup teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16.
kimi-k2.7-code-highspeedMoonshot$1.7810$7.3970per 1M tokensMoonshot Kimi K2.7 Code Highspeed — tingkat throughput dari K2.7 Code, menyajikan model yang sama pada sekitar 180 token per detik dan hingga 260 pada pekerjaan berkonteks pendek. Jendela konteks 256K, keluaran bawaan 32.768 token. Model ini menerima teks, gambar, dan video sebagai konten base64 lalu mengembalikan teks. Thinking bersifat wajib dan akan mengembalikan galat jika dimatikan; tool_choice terbatas pada auto atau none, dan reasoning_content harus dibawa terus melintasi pemanggilan alat multi-langkah.
MiniMax-M2.7-highspeedMiniMax$0.5750$2.3010per 1M tokensMiniMax M2.7 Highspeed — model M2.7 yang sama, disajikan pada sekitar 100 token per detik untuk pemrograman berlatensi rendah dan alur kerja agen, dengan jendela konteks 204.800 token. Hanya teks: API menerima blok konten teks dan pemanggilan alat, bukan gambar atau video. Mendukung pemanggilan alat; thinking selalu aktif dan tidak dapat dimatikan.
stepaudio-2.5-asrStepFun$0.0220per jam audioStepFun StepAudio 2.5 ASR — model pengenalan suara 4B parameter yang dibangun di atas Multi-Token Prediction, mentranskripsi lima menit audio dalam waktu sekitar satu detik (RTF sekitar 0,0053). Dioptimalkan untuk bahasa Mandarin dan Inggris. Menyertakan normalisasi teks terbalik, identifikasi pembicara, dan pemisahan dua kanal untuk rekaman panggilan maupun rapat. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
doubao-seed-2-1-turbo-260628字节跳动$0.4620$2.3080per 1M tokensByteDance Doubao Seed 2.1 Turbo — jalur berlatensi rendah dari lini Seed 2.1, dengan spesifikasi yang sama seperti Pro: jendela konteks 256K dengan masukan maksimum 256K, hingga 256K token keluaran (bawaan 4K), dan anggaran 256K token untuk rantai penalaran. Model ini mencakup berpikir mendalam, pembuatan teks, pemahaman multimodal, pemanggilan alat, dan output terstruktur, meski tanpa rekomendasi json_schema seperti pada Pro. Model ini menerima teks, gambar, dan video lalu mengembalikan teks; pemahaman audio tidak dicantumkan untuk lini 2.1. Mendukung caching konteks implisit maupun eksplisit.
kimi-k2.7-codeMoonshot$0.7600$3.1570per 1M tokensMoonshot Kimi K2.7 Code — model pemrograman khusus milik Kimi, yang menurut pengukuran vendor meningkatkan kepatuhan instruksi dan pemrograman berdurasi panjang dibanding K2.6 sekaligus memangkas berpikir berlebihan sekitar 30% secara rata-rata. Jendela konteks 256K, keluaran bawaan 32.768 token. Model ini menerima teks, gambar, dan video sebagai konten base64 lalu mengembalikan teks. Thinking bersifat wajib dan akan mengembalikan galat jika dimatikan; tool_choice terbatas pada auto atau none, dan reasoning_content harus dibawa terus melintasi pemanggilan alat multi-langkah.
kling-3.0-turbo快手$0.560per permintaanKuaishou Kling 3.0 Turbo — tingkat bernilai ekonomis dari lini Kling 3.0, menghasilkan 720P atau 1080P (bawaan 720P) berdurasi 3-15 detik (bawaan 5) dalam 16:9, 9:16, atau 1:1, dari sebuah prompt atau gambar bingkai pertama. Audio asli selalu disertakan dan tidak memiliki sakelar hidup/mati. Dibandingkan kling-v3, model ini melepas tingkat 4K, kendali bingkai akhir, dan masukan video demi kecepatan dan biaya. 720p 5 detik dengan audio ≈ $0,56.
qwen3-tts-flash阿里巴巴$0.1231per 10 ribu karakterAlibaba Qwen3-TTS-Flash — text-to-speech berlatensi rendah dengan 17 suara bawaan yang ekspresif, mencakup bahasa Mandarin, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia, ditambah mode otomatis untuk teks bercampur banyak bahasa serta keluaran dalam dialek. Model ini menerima hingga 512 token teks per permintaan dan mendukung sintesis streaming maupun non-streaming.
qwen3.6-plus阿里巴巴$0.4000$2.4000per 1M tokensAlibaba Qwen3.6-Plus — model seimbang untuk penalaran umum dan penggunaan alat, dengan jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 65.536 token keluaran, dan anggaran 81.920 token untuk rantai penalaran. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks. Mendukung pemanggilan fungsi, output terstruktur, pencarian web, penyelesaian prefiks, dan caching konteks.
stepaudio-2-asr-proStepFun$0.3500per jam audioStepFun StepAudio 2 ASR Pro — model pengenalan suara 32B parameter, pilihan yang mengutamakan akurasi di lini ASR StepFun, sementara stepaudio-2.5-asr adalah pilihan yang mengutamakan kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
glm-5.2智谱$1.1200$3.5200per 1M tokensZhipu GLM-5.2 — model fondasi unggulan yang dikhususkan untuk pekerjaan agen pemrograman berdurasi panjang melalui pelatihan khusus selama berbulan-bulan, bukan sekadar perpanjangan konteks, dengan jendela konteks 1M token dan hingga 128K token keluaran. Teks masuk, teks keluar. Mendukung beberapa mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP.
mimo-v2.5-tts-voicecloneXiaomi$0.0000per 10 ribu karakterModel kloning suara Xiaomi MiMo: kirimkan sampel audio referensi sebagai data URL pada kolom voice (data:{mime};base64,...) dan model akan menyintesis ucapan dengan suara tersebut tanpa tahap pelatihan, pelabelan, atau penyetelan apa pun. Model ini menerima MP3 (audio/mpeg) atau WAV, dengan string hasil enkode base64 dibatasi 10 MB; Xiaomi tidak menerbitkan durasi minimum untuk audio referensi. Instruksi gaya dalam bahasa alami dan tag audio sebaris diwarisi dari mimo-v2.5-tts, tetapi streaming tidak tersedia — permintaan berjalan dalam mode kompatibilitas dan baru mengembalikan hasil setelah sintesis selesai.
step-1o-turbo-visionStepFun$0.4000$1.2800per 1M tokensStepFun step-1o-turbo-vision — pemahaman gambar dan video dengan pembuatan teks yang cepat, konteks 32K. Menerima masukan teks, gambar, dan video, serta hanya mengembalikan teks. Ini model visual generasi sebelumnya yang dipertahankan demi kompatibilitas; step-3.7-flash mencakup modalitas masukan yang sama dengan konteks 256K dan kedalaman penalaran yang dapat dipilih. Jaga sisi terpanjang gambar di bawah 4096 piksel agar pengenalan tetap andal.
step-2x-largeStepFun$0.016per permintaanStepFun Step 2X Large — pembuatan gambar dari teks dengan tekstur realistis dan kemampuan menuliskan teks Mandarin maupun Inggris di dalam gambar yang luar biasa kuat. Mendukung 256x256, 512x512, 768x768, 1024x1024, 1280x800, dan 800x1280; satu gambar per permintaan. Disajikan melalui endpoint images yang kompatibel dengan OpenAI.
stepaudio-2.5-asr-stream$0.1800per jam audio
gemini-3.6-flashGooglePenagihan bertingkat, lihat halaman hargaGoogle Gemini 3.6 Flash — model penalaran multimodal versi stabil yang menyeimbangkan kecepatan dan kecerdasan untuk tugas agentik maupun tugas dunia nyata, dengan konteks masukan 1.048.576 token dan batas keluaran 65.536 token. Model ini menerima teks, gambar, video, audio, dan PDF, serta mendukung thinking, pemanggilan fungsi, eksekusi kode, grounding pencarian, output terstruktur, dan Computer Use (pratinjau).
MiniMax-Hailuo-02MiniMax$0.280per permintaanMiniMax Hailuo 02 — pembuatan video hemat yang mencakup baik teks ke video maupun gambar ke video pada 24 fps, dengan 512p dan 768p tersedia sebagai klip 6 detik atau 10 detik dan 1080p pada 6 detik. Tingkat 512p adalah titik masuk lini Hailuo.
qwen3.7-max阿里巴巴$2.5000$7.5000per 1M tokensAlibaba Qwen3.7-Max — model unggulan sumber tertutup yang diposisikan untuk pemrograman, pekerjaan perkantoran dan produktivitas, serta eksekusi otonom jangka panjang, dengan jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 131.072 token keluaran, dan anggaran 262.144 token untuk rantai penalaran. Teks masuk, teks keluar. Mendukung pemanggilan fungsi, output terstruktur, dan caching konteks.
step-3.5-flashStepFun$0.1000$0.3000per 1M tokensStepFun step-3.5-flash — model penalaran khusus teks dengan konteks 256K, ditujukan untuk logika, matematika, rekayasa perangkat lunak, dan riset mendalam, di mana kualitas penalaran harus dibarengi eksekusi yang cepat dan andal. Kedalaman penalaran dipilih per permintaan melalui reasoning_effort (low / medium / high). Mendukung pemanggilan alat, output terstruktur JSON Schema, streaming, dan caching prompt. Untuk masukan gambar atau video, gunakan step-3.7-flash.
step-image-edit-2StepFun$0.004per permintaanStepFun Step Image Edit 2 — model terpadu untuk pembuatan gambar dari teks dan penyuntingan gambar dengan parameter di bawah 6B, setara dengan model penyunting berbobot terbuka di kisaran 12B-20B. Model ini merampungkan satu suntingan dalam satu sampai dua detik dan dirancang untuk retouching interaktif berlatensi rendah. Mendukung 256x256, 512x512, 768x768, 1024x1024, 1280x800, dan 800x1280, ditambah prompt negatif serta mode optimasi teks; satu gambar per permintaan. Disajikan melalui endpoint images yang kompatibel dengan OpenAI.
wan2.7-videoedit阿里巴巴$0.092per detikAlibaba Wan2.7 VideoEdit — penyuntingan video dengan bahasa alami, lokal maupun global, penggantian elemen lewat gambar referensi, serta peniruan gerak, efek, dan kerja kamera.
glm-5.1智谱$1.1200$3.5200per 1M tokensZhipu GLM-5.1 — model fondasi unggulan yang dibangun untuk pekerjaan otonom berkepanjangan: vendor mendokumentasikan eksekusi terus-menerus tanpa pengawasan pada satu tugas hingga 8 jam, meliputi perencanaan, eksekusi, pengujian, dan optimalisasi berulang. Jendela konteks 200K, hingga 128K token keluaran, teks masuk dan teks keluar. Mendukung beberapa mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP.
happyhorse-1.1-t2v阿里巴巴$0.083per detikAlibaba HappyHorse 1.1 (T2V) — teks ke video dengan pemahaman semantik, kendali kamera, dan pembuatan dinamis yang lebih baik. Video 720P/1080P yang mengalir, detail, dan konsisten secara fisik.
kimi-k2.6Moonshot$0.7600$3.1570per 1M tokensMoonshot Kimi K2.6 — model serbaguna untuk dialog, pembuatan kode, pemahaman visual, dan tugas agen, dengan penulisan kode berdurasi panjang dan eksekusi otonom yang lebih kuat dibanding pendahulunya. Jendela konteks 256K, keluaran bawaan 32.768 token. Model ini menerima teks, gambar (png, jpeg, webp, gif), dan video (mp4, mov, webm, dan lainnya) sebagai konten base64 lalu mengembalikan teks. Mode berpikir aktif secara bawaan dan dapat dimatikan; temperature dipatok pada 1.0 saat berpikir dan 0.6 saat tidak.
speech-2.8-turboMiniMax$0.3077per 10 ribu karakterMiniMax speech-2.8-turbo — tingkat berlatensi rendah dari lini suara 2.8, yang menukar penyampaian sangat realistis milik model HD dengan sintesis yang lebih cepat namun tetap mengalir alami. Model ini mencakup 40 bahasa dan 7 emosi yang sama, dengan nada, kecepatan bicara, volume, laju sampel, bitrate, dan format keluaran yang dapat dikonfigurasi, serta menerima hingga 1 juta karakter secara asinkron atau 10.000 karakter melalui antarmuka streaming.
step-1o-audioStepFun$3.8500$9.2400per 1M tokensStepFun step-1o-audio — model suara ujung-ke-ujung generasi sebelumnya dengan dukungan multibahasa dan pemanggilan alat, dibatasi 30 menit per interaksi. Sebagian besar sudah digantikan lini StepAudio 2.5; dipertahankan untuk beban kerja yang sudah dibangun di atasnya.
step-asr-1.1StepFun$0.3500per jam audioStepFun step-asr-1.1 — versi pembaruan dari model pengenal serbaguna di lini step-asr, mencakup bahasa Mandarin, Inggris, dan dialek-dialek Tiongkok. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
agnes-video-v2.0Agnes AI$0.000per detikAgnes AI Video V2.0 — model pembuatan video asinkron untuk teks ke video, gambar ke video, keyframe multi-gambar, dan gerak sinematik, dengan tingkat keluaran ternormalisasi 480p, 720p, dan 1080p.
glm-5智谱$1.0000$3.2000per 1M tokensZhipu GLM-5 — MoE berparameter total 744B dengan 40B aktif, dilatih pada 28,5T token dan menggunakan DeepSeek Sparse Attention, dengan jendela konteks 200K dan hingga 128K token keluaran. Teks masuk, teks keluar. Mendukung beberapa mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP.
mimo-v2.5Xiaomi$0.1400$0.2800per 1M tokensXiaomi MiMo-V2.5 — model yang secara asli mencakup semua modalitas, dengan konteks 1M dan keluaran maksimum 128K, memahami gambar, video, audio, dan teks dalam satu model. Mendukung berpikir mendalam, pemanggilan fungsi, output terstruktur, dan pencarian web, lengkap dengan kapabilitas agen di semua modalitas.
MiniMax-Hailuo-2.3-FastMiniMax$0.190per permintaanMiniMax Hailuo 2.3 Fast — tingkat yang mengutamakan kecepatan dan biaya dari Hailuo 2.3, berfokus pada gambar ke video dan pada realisme gerak fisik, pada 24 fps, dengan 768p tersedia sebagai klip 6 detik atau 10 detik dan 1080p pada 6 detik. 768p 6 detik = $0,19.
qwen3.8-max阿里巴巴$1.9900$5.9700per 1M tokensAlibaba Qwen3.8-Max — model MoE unggulan berparameter 2,4 triliun dan yang paling mumpuni di keluarga Qwen, dengan vendor menyebut peningkatan besar pada pemrograman dan produktivitas perkantoran. Jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 131.072 token keluaran, dan anggaran 262.144 token untuk rantai penalaran. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks; mendukung pemanggilan fungsi, output terstruktur, dan caching konteks.
doubao-seedream-5-0-260128字节跳动$0.034per permintaanByteDance Doubao Seedream 5.0-lite — teks ke gambar dan gambar ke gambar dengan kreasi terkendali yang lebih cerdas, pengambilan data real-time, dan konsistensi subjek yang lebih kuat (resolusi 2K ke atas).
glm-asr-2512智谱$0.1440per jam audioZhipu GLM-ASR-2512 — model pengenalan suara yang melaporkan tingkat kesalahan karakter 0,0717. Model ini mencakup bahasa Mandarin bersama Sichuan, Kanton, Min Nan, dan Wu, aksen Inggris Amerika dan Britania, serta puluhan bahasa lain termasuk Prancis, Jerman, Jepang, Korea, Spanyol, dan Arab. Model ini menangani ucapan bercampur banyak bahasa, jargon teknis, dan gaya bicara sehari-hari, serta menerima kamus khusus untuk kosakata bidang tertentu. Audio dibatasi 30 detik dan 25 MB per permintaan, dengan transkripsi batch maupun streaming.
glm-tts智谱$0.3077per 10 ribu karakterZhipu GLM-TTS — text-to-speech yang dibangun di atas arsitektur pembuatan dua tahap dengan pembelajaran penguatan GRPO, yang menyimpulkan emosi dan intonasi dari teks di sekitarnya alih-alih menuntut penandaan eksplisit. Model ini menyediakan tujuh suara bawaan (tongtong sebagai bawaan, xiaochen, chuichui, jam, kazi, douji, luodo) dengan kecepatan dan volume yang dapat disetel, menerima hingga 1.024 karakter per permintaan, dan melakukan streaming dengan latensi bingkai pertama di bawah 400 ms. Menghasilkan wav atau pcm pada laju sampel yang disarankan 24 kHz; streaming hanya mendukung pcm.
wan2.7-i2v阿里巴巴$0.092per detikAlibaba Wan 2.7 Image-to-Video — mencakup pembuatan dari bingkai pertama, transisi antara bingkai pertama dan terakhir, serta kelanjutan dari klip yang sudah ada. Model ini menghasilkan 720P atau 1080P (bawaan 1080P) berdurasi 2-15 detik, bawaan 5 detik, dari prompt hingga 5.000 karakter (prompt negatif hingga 500). Trek mp3 atau wav berdurasi 2-30 detik dapat dikirimkan sebagai driving_audio; tanpa audio, model membuat musik latar atau efek suara yang sesuai, audio yang lebih panjang dari klip akan dipotong, dan audio yang lebih pendek menyisakan bagian akhir tanpa suara.
glm-5v-turbo智谱$0.7690$3.3850per 1M tokensZhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows.
happyhorse-1.1-i2v阿里巴巴$0.083per detikAlibaba HappyHorse 1.1 (I2V) — gambar ke video dengan tekstur yang lebih baik, konsistensi identitas antarklip, kelancaran gerak, dan sinkronisasi audio-visual. 720P/1080P.
mimo-v2.5-proXiaomi$0.4350$0.8700per 1M tokensXiaomi MiMo-V2.5-Pro — model unggulan berparameter satu triliun (42B aktif) dengan konteks 1M dan keluaran maksimum 128K, disetel untuk beban kerja agen berintensitas tinggi. Mendukung berpikir mendalam, pemanggilan fungsi, output terstruktur, dan pencarian web. Hanya menghasilkan teks: berbeda dari mimo-v2.5, daftar kapabilitas vendor tidak mencantumkan pemahaman semua modalitas.
mimo-v2.5-tts-voicedesignXiaomi$0.0000per 10 ribu karakterModel desain suara Xiaomi MiMo: jelaskan suara yang diinginkan dalam bahasa alami melalui instructions, dan model akan menyintesis ucapan dengan suara rancangan tersebut.
qwen3.7-plus阿里巴巴$0.3080$1.2310per 1M tokensAlibaba Qwen3.7-Plus — model agen hibrida multimodal yang mengindra pemandangan dunia nyata, membaca layar dan mengendalikan antarmuka grafis, membuat kode dari referensi visual, serta melakukan navigasi ujung-ke-ujung di dalam aplikasi seluler. Jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 131.072 token keluaran, dan anggaran 262.144 token untuk rantai penalaran. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks; mendukung pemanggilan fungsi, output terstruktur, dan caching konteks.
step-asrStepFun$0.1500per jam audioStepFun step-asr — pengenalan suara serbaguna yang mencakup bahasa Mandarin, Inggris, dan dialek-dialek Tiongkok, untuk transkripsi, notulen rapat, tinjauan mutu panggilan, dan pencarian suara. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
wan2.7-image阿里巴巴$0.031per permintaanAlibaba Wan2.7 Image — teks ke gambar, penyuntingan gambar, pembuatan dengan banyak gambar referensi, penyuntingan interaktif, serta penulisan teks dan kepatuhan instruksi yang kuat.
agnes-2.0-flashAgnes AI$0.0000per 1M tokensAgnes AI Agnes 2.0 Flash — model agen multimodal cepat dengan konteks masukan 256K dan batas keluaran acuan 64K, mendukung obrolan, streaming, pemanggilan alat, pemrograman, penalaran, pemahaman gambar, dan alur kerja agen.
agnes-2.5-flashAgnes AI$0.0000per 1M tokensAgnes AI Agnes 2.5 Flash — model agen multimodal cepat dengan konteks masukan 512K dan batas keluaran acuan 65,5K, mendukung obrolan, streaming, pemanggilan alat, pemrograman, penalaran, percakapan multi-giliran, pemahaman gambar, dan alur kerja agen.
glm-5-turbo智谱$1.2000$4.0000per 1M tokensZhipu GLM-5-Turbo — varian GLM-5 yang berorientasi throughput, dioptimalkan untuk alur kerja agen: pemanggilan alat dan keterampilan yang lebih stabil di sepanjang tugas multi-langkah, penanganan instruksi berantai panjang yang lebih baik, dan eksekusi tugas terjadwal maupun berjalan lama. Jendela konteks 200K, hingga 128K token keluaran, teks masuk dan teks keluar. Mendukung mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP.
happyhorse-1.1-r2v阿里巴巴$0.083per detikAlibaba HappyHorse 1.1 (R2V) — pembuatan video berbasis referensi dengan hingga 9 gambar referensi, konsistensi subjek/adegan/gaya yang kuat, dan kendali kamera. 720P/1080P.
kimi-k3Moonshot$2.7400$13.6990per 1M tokensMoonshot Kimi K3 — model unggulan berparameter 2,8 triliun untuk pemrograman berdurasi panjang, pekerjaan pengetahuan ujung-ke-ujung, dan penalaran mendalam, dengan jendela konteks 1M token dan hingga 1.048.576 token penyelesaian (bawaan 131.072). Model ini menerima teks, gambar base64, dan video, lalu mengembalikan teks. Thinking selalu aktif dengan reasoning_effort yang dapat dipilih sebagai low, high, atau max (bawaan max); temperature dipatok pada 1.0. Mendukung pemanggilan alat khusus dan pemuatan alat secara dinamis.
speech-2.8-hdMiniMax$0.5385per 10 ribu karakterMiniMax speech-2.8-hd — tingkat definisi tinggi dari lini suara 2.8, diposisikan untuk penyampaian yang sangat realistis dengan tag suara, mencakup 40 bahasa dan 7 emosi. Nada, kecepatan bicara, volume, laju sampel, bitrate, dan format keluaran dapat dikonfigurasi per permintaan, dan sintesis teks panjang menerima hingga 1 juta karakter secara asinkron atau 10.000 karakter melalui antarmuka streaming.
step-3.7-flashStepFun$0.2000$1.1500per 1M tokensStepFun step-3.7-flash — MoE renggang dengan total 198B parameter dan 11B parameter aktif, konteks asli 256K, serta pemahaman asli atas gambar dan video di samping teks. Kedalaman penalaran dipilih per permintaan melalui reasoning_effort (low / medium / high), dan model ini mendukung pemanggilan alat multi-langkah yang andal, output terstruktur JSON Schema, streaming, serta caching prompt. Disetel untuk beban kerja agen dan pemrograman.
stepaudio-2.5-chatStepFun$1.5000$3.5000per 1M tokensStepFun StepAudio 2.5 Chat — model pemahaman suara ujung-ke-ujung: menerima audio atau teks dan mengembalikan teks, membaca sinyal paralinguistik seperti keraguan dan tawa langsung dari bentuk gelombangnya, bukan dari transkrip. Mendukung kustomisasi persona yang luas, mencakup karakter, kebiasaan bicara, dan rentang emosi. Audio dikirim sebagai bagian konten input_audio pada endpoint chat completions. Untuk jawaban dalam bentuk suara, gunakan model TTS.
agnes-image-2.1-flashAgnes AI$0.000per permintaanAgnes AI Image 2.1 Flash — model pembuatan dan penyuntingan gambar yang berfokus pada detail untuk adegan berkepadatan informasi tinggi, mencakup teks ke gambar, gambar ke gambar, dan komposisi multi-gambar dengan ukuran serta rasio aspek fleksibel dari 1K hingga 4K.
deepseek-v4-proDeepSeek$0.4350$0.8700per 1M tokensDeepSeek V4 Pro — tingkat DeepSeek V4 dengan kemampuan lebih tinggi untuk pemrograman, penalaran, dan pekerjaan agentik, dengan jendela konteks 1M token dan keluaran maksimum 384K. Model ini berjalan dalam mode berpikir (bawaan) maupun tanpa berpikir, dan mendukung pemanggilan alat serta keluaran JSON. Teks masuk, teks keluar.
LongCat-2.0Meituan$0.3000$1.2000per 1M tokensMeituan LongCat-2.0 — model MoE terbuka berparameter 1,6T dengan konteks asli 1M, dibangun untuk pemrograman agentik dan penggunaan alat berdurasi panjang. Model penalaran khusus teks.
MiniMax-Hailuo-2.3MiniMax$0.280per permintaanMiniMax Hailuo 2.3 — teks ke video dan gambar ke video yang oleh vendor diposisikan pada kepatuhan terhadap instruksi, pada 24 fps, dengan 768p tersedia sebagai klip 6 detik atau 10 detik dan 1080p pada 6 detik. 768p 6 detik = $0,28.
MiniMax-M3MiniMaxPenagihan bertingkat, lihat halaman hargaMiniMax M3 — model pemrograman multimodal terdepan untuk penalaran agentik, penggunaan alat, dan eksekusi tugas terstruktur, dengan jendela konteks 1.000.000 token. Model ini menerima teks, gambar hingga 10 MB, dan video hingga 50 MB secara sebaris atau 512 MB melalui Files API, lalu mengembalikan teks. Mendukung pemanggilan alat, dengan thinking bersifat opsional alih-alih selalu aktif.
step-asr-1.1-stream$0.4000per jam audio
step-tts-miniStepFun$0.1500per 10 ribu karakterStepFun step-tts-mini — anggota lini TTS StepFun yang hemat biaya dan berlatensi rendah, mencakup bahasa yang sama dengan step-tts-2 (Mandarin, Inggris, campuran Mandarin-Inggris, dan Jepang, ditambah Kanton dan Sichuan) dengan sebagian dari suara bawaan. Mendukung label emosi dan gaya penyampaian dalam bahasa alami serta kloning suara zero-shot dari sekitar 10 detik audio referensi. Menghasilkan wav, mp3, flac, opus, atau pcm.
wan2.7-r2v阿里巴巴$0.092per detikAlibaba Wan2.7 (R2V) — pembuatan video berbasis referensi, hingga 5 referensi campuran gambar/video ditambah referensi timbre audio, dengan konsistensi karakter/properti/adegan yang lebih kuat.
doubao-seedance-2-0-fast-260128字节跳动$5.6000$5.6000per 1M tokensByteDance Seedance 2.0 Fast — pembuatan video hemat biaya yang membawa seluruh rangkaian fitur Seedance 2.0 tetapi dibatasi pada 480p dan 720p, 24 fps, 4-15 detik. Model ini mencakup teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, pembuatan berbasis referensi multimodal dari 1-9 gambar dan maksimum 3 video referensi dengan total 15 detik, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web; referensi audio harus disertai gambar atau video. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16. 480p 5 detik ≈ $0,26.
kling-v3-omni快手$0.420per permintaanKling 3.0 Omni — pembuatan video multi-gambar berbasis referensi. Harga yang tercantum adalah tingkat std (720p, 5 detik, tanpa audio, tanpa video referensi). Permintaan yang tidak menyetel mode akan memakai tingkat pro bawaan dari sisi vendor dan ditagih 1,33x — sekitar $0,56 untuk klip 5 detik yang sama; 4k ditagih 5x. Kirim mode=std agar ditagih sesuai harga yang tercantum.
mimo-v2.5-asrXiaomi$0.0740per jam audioModel pengenalan suara Xiaomi MiMo yang dioptimalkan untuk bahasa Mandarin dan Inggris serta dialek-dialek Tiongkok, menangani audio berisik, jarak jauh, dan banyak pembicara, termasuk transkripsi lirik lagu.
qwen3-asr-flash阿里巴巴$0.1235per jam audioAlibaba Qwen3-ASR-Flash — pengenalan suara yang dibangun di atas model fondasi Qwen3, yang menentukan sendiri bahasa yang diucapkan dan mentranskripsi 11 bahasa; lini Qwen3-ASR mendokumentasikan bahasa Mandarin bersama Sichuan, Min Nan, Wu, dan Kanton, serta berbagai aksen bahasa Inggris. Model ini menerima aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma, dan wmv hingga 5 menit dan 10 MB per permintaan; masukan pcm harus 16 kHz dan format lain diubah sampelnya ke 16 kHz sebelum pengenalan.
wan2.7-image-pro阿里巴巴$0.060per permintaanAlibaba Wan 2.7 Image Pro — tingkat profesional dari lini gambar Wan 2.7, mencakup teks ke gambar, set gambar berurutan, penyuntingan gambar, dan pembuatan dengan banyak gambar referensi, dengan kepatuhan prompt yang lebih baik. Teks ke gambar mencapai 4K (4096x4096) dengan tingkat 1K dan 2K serta ukuran khusus mulai 768x768; mode penyuntingan dan mode berurutan dibatasi 2K. Model ini menerima hingga 9 gambar referensi (JPEG, JPG, PNG, BMP, WEBP; 240-8.000 px per sisi, 20 MB masing-masing), rasio aspek dari 1:8 hingga 8:1, dan prompt hingga 5.000 karakter. Menghasilkan PNG.