Harga model AI Tiongkok

ChinaAPI menyediakan DeepSeek, Qwen, GLM, Kimi, dan model AI Tiongkok lainnya melalui satu gateway yang kompatibel dengan OpenAI di https://api.chinaapi.ai/v1. Semua harga dalam dolar AS, dinyatakan dalam satuan yang dipakai pemasok hulu. Daftar yang sama tersedia sebagai JSON di /api/pricing.

60 model membuka harga Paid lebih rendah setelah isi ulang pertama: sekali isi ulang berapa pun jumlahnya, otomatis berlaku untuk seluruh akun. Harga Paid hanya dicantumkan jika lebih rendah dari harga Standard.

Harga model publik
ModelPemasokMasukanOutputMasukan (harga Paid)Output (harga Paid)SatuanDeskripsi
agnes-2.5-flashAgnes AI$0.0000per 1M tokensAgnes AI Agnes 2.5 Flash — model agen multimodal cepat dengan konteks masukan 512K dan batas keluaran acuan 65,5K, mendukung obrolan, streaming, pemanggilan alat, pemrograman, penalaran, percakapan multi-giliran, pemahaman gambar, dan alur kerja agen.
agnes-2.5-proAgnes AI$0.4500$0.9000per 1M tokensAgnes AI Agnes 2.5 Pro — rilis stabil komersial dari model tolok ukur 2.5 Pro Alpha, model penalaran berbayar dengan konteks masukan 1M dan keluaran maksimum 65.536 token, untuk pemrograman tingkat lanjut, penalaran ilmiah, analisis konteks panjang, alur kerja agen, dan pemahaman gambar.
agnes-2.5-pro-betaAgnes AI$0.1000$0.3000per 1M tokensAgnes AI Agnes 2.5 Pro Beta — tingkat berharga rendah dari keluarga Pro, ditagih dengan harga Beta tersendiri yang jauh di bawah harga 2.5 Pro, model penalaran berbayar dengan format permintaan, protokol teks, dan batas konteks yang sama, untuk pemrograman tingkat lanjut, penalaran ilmiah, analisis konteks panjang, alur kerja agen, dan pemahaman gambar.
agnes-3.0-flashAgnes AI$0.0000per 1M tokensAgnes AI Agnes 3.0 Flash — model bahasa generasi baru dari vendor, dibangun untuk pemrograman agentik dan eksekusi tugas berbasis alat, dengan konteks masukan 512K dan batas keluaran 65.536 token. Menerima masukan teks dan URL gambar lalu mengembalikan teks, serta mendukung streaming, pemanggilan fungsi dan orkestrasi alat multi-langkah, dan kepatuhan instruksi pada tugas panjang. Dapat diakses melalui endpoint chat yang kompatibel dengan OpenAI, endpoint Responses, dan endpoint Messages yang kompatibel dengan Anthropic. Pada endpoint chat, mode Thinking diaktifkan dengan menyetel chat_template_kwargs.enable_thinking ke true; diukur pada 2026-09-21, permintaan tanpa kolom tersebut tidak mengembalikan token penalaran apa pun. Saat Thinking aktif, token penalaran ikut dihitung dalam max_tokens; karena itu, atur max_tokens agar cukup untuk penalaran sekaligus jawabannya.
agnes-image-2.0-flashAgnes AI$0.000per permintaanAgnes AI Image 2.0 Flash — model pembuatan dan penyuntingan gambar yang cepat untuk teks ke gambar, gambar ke gambar, dan komposisi multi-gambar, dengan hasil yang tersedia sebagai URL atau data Base64.
agnes-image-2.1-flashAgnes AI$0.000per permintaanAgnes AI Image 2.1 Flash — model pembuatan dan penyuntingan gambar yang berfokus pada detail untuk adegan berkepadatan informasi tinggi, mencakup teks ke gambar, gambar ke gambar, dan komposisi multi-gambar dengan ukuran serta rasio aspek fleksibel dari 1K hingga 4K.
agnes-image-2.5-flashAgnes AI$0.000per permintaanAgnes AI Image 2.5 Flash — model gambar generasi terbaru, mengungguli Image 2.1 Flash dalam pembuatan, penyuntingan, komposisi, perenderan detail, dan kepatuhan pada prompt, untuk teks ke gambar, gambar ke gambar, dan komposisi multi-gambar dengan ukuran serta rasio aspek fleksibel dari 1K hingga 4K.
agnes-video-2.5Agnes AI$0.025per detikAgnes AI Video 2.5 — model video asinkron berbayar yang menghasilkan klip berdurasi 4-12 detik pada 720P, 960P, atau 2K dari teks, keyframe pertama/terakhir, atau referensi gambar, audio, dan video.
agnes-video-2.5-flashAgnes AI$0.000per detikAgnes AI Video 2.5 Flash — varian Video 2.5 yang hanya mendukung 720P, menghasilkan video berdurasi 4-12 detik dari teks, keyframe pertama/terakhir, atau referensi gambar dan audio, dengan API tugas asinkron yang sama.
claude-fable-5Anthropic$10.0000$50.0000$7.0000$35.0000per 1M tokensAnthropic Claude Fable 5 — model Anthropic yang paling mumpuni di antara yang tersedia untuk umum, untuk pekerjaan pengetahuan dan pemrograman yang ambisius serta berdurasi panjang. Model ini dibangun untuk tugas agentik berhari-hari, rekayasa perangkat lunak yang kompleks, riset mendalam, penalaran atas dokumen dan gambar, serta verifikasi mandiri yang proaktif.
claude-fable-5-1Anthropic$10.0000$50.0000$8.0000$40.0000per 1M tokensAnthropic Claude Fable 5.1 — model unggulan terbaru Anthropic yang tersedia untuk umum, untuk pekerjaan pengetahuan dan pemrograman yang ambisius serta berdurasi panjang. Model ini dibangun untuk tugas agentik berhari-hari, rekayasa perangkat lunak yang kompleks, riset mendalam, penalaran atas dokumen dan gambar, serta verifikasi mandiri yang proaktif. Pembacaan cache dihargai 2,5% dari tarif masukan — yang terendah di generasinya.
claude-haiku-4-5Anthropic$1.0000$5.0000$0.7000$3.5000per 1M tokensAnthropic Claude Haiku 4.5 — model Claude tercepat dengan kecerdasan mendekati terdepan, dibangun untuk pekerjaan bervolume tinggi dan peka latensi seperti klasifikasi, ekstraksi, dan perutean. Model ini mendukung masukan teks dan gambar, thinking diperluas, jendela konteks 200.000 token, dan hingga 64.000 token keluaran.
claude-haiku-5-5Anthropic$0.1000$0.5000$0.0600$0.3000per 1M tokensAnthropic Claude Haiku 5.5 — pemahaman teks dan gambar yang cepat dan hemat untuk klasifikasi, ekstraksi, perutean, dan agen. Konteks 1.000.000 token dengan keluaran hingga 128.000 token. Penalaran adaptif memakai medium secara bawaan; output_config.effort di Messages memilih low, medium, high, xhigh, atau max. Mendukung streaming dan pemanggilan alat wajib. Di atas 100.000 token masukan, tarif konteks panjang berlaku untuk seluruh permintaan, termasuk keluaran dan cache.
claude-opus-4-5Anthropic$5.0000$25.0000$3.5000$17.5000per 1M tokensAnthropic Claude Opus 4.5 — rilis Opus 4.5, yang kini dicantumkan Anthropic dalam daftar model lawasnya dan tetap disediakannya, untuk beban kerja yang ingin bertahan pada versi model ini. Model ini mendukung masukan teks dan gambar, thinking diperluas, jendela konteks 200.000 token, dan hingga 64.000 token keluaran.
claude-opus-4-6Anthropic$5.0000$25.0000$3.5000$17.5000per 1M tokensAnthropic Claude Opus 4.6 — generasi Opus untuk penalaran kompleks dan pekerjaan agentik, dengan jendela konteks 1.000.000 token pada harga standar dan hingga 128.000 token keluaran. Model ini mendukung masukan teks dan gambar serta thinking adaptif, dan memakai tokenizer pra-4.7.
claude-opus-4-7Anthropic$5.0000$25.0000$3.5000$17.5000per 1M tokensAnthropic Claude Opus 4.7 — model penalaran lanjutan untuk rekayasa perangkat lunak yang sulit serta tugas agentik yang kompleks dan berjalan lama. Model ini menekankan kepatuhan instruksi yang ketat, verifikasi mandiri, penggunaan alat yang andal, dan penglihatan resolusi tinggi pada antarmuka, gambar, dokumen, serta alur kerja profesional.
claude-opus-4-8Anthropic$5.0000$25.0000$3.5000$17.5000per 1M tokensAnthropic Claude Opus 4.8 — model penalaran berkemampuan tinggi untuk pemrograman, alur kerja agentik, analisis profesional, dan pekerjaan yang berjalan lama. Dibandingkan Opus 4.7, model ini meningkatkan keandalan, pertimbangan, efisiensi penggunaan alat, penggunaan komputer, dan penalaran dokumen multimodal, sekaligus mendukung jendela konteks 1.000.000 token.
claude-opus-5Anthropic$5.0000$25.0000$3.0000$15.0000per 1M tokensAnthropic Claude Opus 5 — model penalaran mendalam untuk pemrograman agentik yang kompleks dan pekerjaan skala perusahaan, dengan peningkatan besar pada tugas berdurasi panjang, tinjauan kode, alur kerja dokumen, penglihatan, dan koordinasi multi-agen. Model ini memiliki jendela konteks 1.000.000 token, mendukung hingga 128.000 token keluaran, dan mengaktifkan thinking adaptif secara bawaan.
claude-opus-5-5Anthropic$4.0000$20.0000$2.4000$12.0000per 1M tokensAnthropic Claude Opus 5.5 — dirancang untuk pemrograman agentik dan pekerjaan berbasis pengetahuan yang berjalan lama, dengan harga lebih rendah daripada Claude Opus 5. Model ini menerima input teks dan gambar, memiliki jendela konteks 1.000.000 token, dan mendukung hingga 128.000 token keluaran. Thinking adaptif selalu aktif; parameter effort mengatur seberapa dalam model bernalar, dengan medium sebagai nilai bawaan.
claude-sonnet-4-5Anthropic$3.0000$15.0000$2.1000$10.5000per 1M tokensAnthropic Claude Sonnet 4.5 — rilis Sonnet 4.5, yang kini dicantumkan Anthropic dalam daftar model lawasnya dan tetap disediakannya, untuk beban kerja yang ingin bertahan pada versi model ini. Model ini mendukung masukan teks dan gambar, thinking diperluas, jendela konteks 200.000 token, dan hingga 64.000 token keluaran.
claude-sonnet-4-6Anthropic$3.0000$15.0000$2.1000$10.5000per 1M tokensAnthropic Claude Sonnet 4.6 — generasi Sonnet yang seimbang, menawarkan jendela konteks 1.000.000 token pada harga standar dengan hingga 128.000 token keluaran. Model ini mendukung masukan teks dan gambar serta thinking adaptif, dan memakai tokenizer pra-4.7, sehingga teks yang sama menghasilkan sekitar 30% lebih sedikit token dibanding pada model 4.7 dan yang lebih baru dengan tarif per token yang sama.
claude-sonnet-5Anthropic$2.0000$10.0000$1.4000$7.0000per 1M tokensAnthropic Claude Sonnet 5 — model produksi yang menyeimbangkan kecerdasan terdepan dan kecepatan untuk pemrograman, agen, dan alur kerja perusahaan. Model ini dapat menyusun rencana, memakai alat peramban dan terminal, serta bekerja mandiri pada tugas penalaran, pekerjaan pengetahuan, dan rekayasa perangkat lunak.
claude-sonnet-5-5Anthropic$2.0000$10.0000$1.2000$6.0000per 1M tokensAnthropic Claude Sonnet 5.5 — menyeimbangkan kecepatan dan kecerdasan untuk pemrograman, agen, dan beban kerja produksi. Model ini menerima input teks dan gambar, memiliki jendela konteks 1.000.000 token, dan mendukung hingga 128.000 token keluaran. Thinking adaptif aktif secara bawaan dan token thinking ditagih sebagai keluaran; output_config.effort dapat disetel ke low, medium, high, xhigh, atau max, dengan high sebagai nilai bawaan. Untuk mematikan thinking di awal, kirim thinking dengan type between_tools, yang berfungsi pada effort high atau lebih rendah; type disabled akan ditolak. Menyetel temperature, top_p, atau top_k ke nilai selain bawaan akan mengembalikan galat, begitu pula memaksa pemanggilan alat dengan tool_choice any atau tool. Blok thinking terikat pada model dan percakapan; kirimkan kembali tanpa diubah pada giliran berikutnya.
cogview-4Zhipu AI$0.010$0.0095per permintaanZhipu CogView-4 — model teks ke gambar CogView generasi keempat, mendukung beberapa resolusi keluaran serta dua tingkat layanan, yaitu dasar dan definisi tinggi. Menerima prompt berbahasa Mandarin dan Inggris, serta merender teks di dalam gambar. Satu gambar per permintaan.
deepseek-flashDeepSeek$0.1500$0.6000per 1M tokensDeepSeek V4.1 Flash — ID model kanonis untuk integrasi baru. Model ini mendukung masukan teks dan gambar, mode berpikir dan tanpa berpikir, pemanggilan alat, serta keluaran JSON. ID deepseek-v4-flash dan deepseek-v4-flash-vision-exp yang telah dipensiunkan tetap menjadi alias kompatibilitas yang dilayani oleh model yang sama ini dengan harga Flash yang sama. Jendela konteks 1M token, keluaran maksimum 384K. Pada /v1/responses, kirimkan seluruh percakapan dalam array input pada setiap giliran: tidak ada status percakapan yang disimpan di upstream, sehingga permintaan yang menyertakan previous_response_id atau conversation akan ditolak.
deepseek-v4-proDeepSeek$0.6600$1.9800per 1M tokensDeepSeek V4 Pro 0813 — tingkat DeepSeek V4 dengan kemampuan lebih tinggi untuk pemrograman, penalaran, dan pekerjaan agentik, dengan jendela konteks 1M token dan keluaran maksimum 384K. Model ini berjalan dalam mode berpikir (bawaan) maupun tanpa berpikir, dan mendukung pemanggilan alat serta keluaran JSON. Teks masuk, teks keluar. Pada /v1/responses, kirimkan seluruh percakapan dalam array input pada setiap giliran: tidak ada status percakapan yang disimpan di upstream, sehingga permintaan yang menyertakan previous_response_id atau conversation akan ditolak.
doubao-seed-2-1-pro-260628ByteDance$0.8889$4.4444per 1M tokensByteDance Doubao Seed 2.1 Pro — model agen unggulan Doubao untuk pekerjaan produksi, mencakup berpikir mendalam, pembuatan teks, pemahaman multimodal, pemanggilan alat, dan output terstruktur, yang untuknya vendor merekomendasikan mode json_schema. Jendela konteks 256K dengan masukan maksimum 256K, hingga 256K token keluaran (bawaan 4K), dan anggaran 256K token untuk rantai penalaran. Model ini menerima teks, gambar, dan video lalu mengembalikan teks; pemahaman audio tidak dicantumkan untuk lini 2.1. Mendukung caching konteks implisit maupun eksplisit, termasuk cache prefiks dan cache sesi.
doubao-seed-2-1-turbo-260628ByteDance$0.4444$2.2222per 1M tokensByteDance Doubao Seed 2.1 Turbo — jalur berlatensi rendah dari lini Seed 2.1, dengan spesifikasi yang sama seperti Pro: jendela konteks 256K dengan masukan maksimum 256K, hingga 256K token keluaran (bawaan 4K), dan anggaran 256K token untuk rantai penalaran. Model ini mencakup berpikir mendalam, pembuatan teks, pemahaman multimodal, pemanggilan alat, dan output terstruktur, meski tanpa rekomendasi json_schema seperti pada Pro. Model ini menerima teks, gambar, dan video lalu mengembalikan teks; pemahaman audio tidak dicantumkan untuk lini 2.1. Mendukung caching konteks implisit maupun eksplisit.
doubao-seed-character-260628ByteDance$0.1185$0.2963per 1M tokensByteDance Doubao Seed Character (260628) — model dialog karakter Doubao untuk percakapan multi-giliran berbasis persona, lini penerus dari doubao-1-5-pro-32k-character. Build ini membawa label kapabilitas vendor untuk berpikir mendalam, pembuatan teks, pemahaman multimodal, pemanggilan alat, dan output terstruktur (json_schema direkomendasikan). Jendela konteks 128K dengan masukan maksimum 96K dan hingga 32K token keluaran (bawaan 4K). Harga ditentukan oleh panjang masukan: permintaan hingga 32K token masukan ditagih pada tingkat standar; permintaan yang lebih panjang ditagih pada tingkat konteks panjang, dengan harga masukan 1,5 kali lipat dan harga keluaran tiga kali lipat dari tarif tingkat standar.
doubao-seed-evolvingByteDance$0.8889$4.4444per 1M tokensByteDance Doubao Seed Evolving — model unggulan Doubao saat ini untuk pemrograman dan agen, diterbitkan sebagai rilis bergulir (rolling release): vendor memperbarui model setiap minggu dengan ID yang sama ini tanpa snapshot bertanggal, sehingga perilaku dan kapabilitasnya dapat berubah tanpa kenaikan nomor versi. Membawa label kapabilitas vendor untuk berpikir mendalam, pembuatan teks, pemahaman multimodal, penanganan tugas GUI, pemanggilan alat, dan output terstruktur (json_schema direkomendasikan). Jendela konteks 1.024K dengan masukan maksimum 1.024K dan hingga 256K token keluaran (bawaan 4K).
doubao-seedance-2-0-260128ByteDance$7.0000per 1M tokensByteDance Seedance 2.0 — model unggulan lini Seedance 2.0 dan satu-satunya anggota yang mencapai 1080p dan 4K (kedalaman 10 bit) di samping 480p dan 720p, pada 24 fps dan 4-15 detik. Model ini mencakup teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, pembuatan berbasis referensi multimodal dari 1-9 gambar dan maksimum 3 video referensi dengan total 15 detik, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web; referensi audio harus disertai gambar atau video. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16, dengan bingkai penutup tersedia sebagai gambar. Ditagih berdasarkan resolusi keluaran.
doubao-seedance-2-0-fast-260128ByteDance$5.6000per 1M tokensByteDance Seedance 2.0 Fast — pembuatan video hemat biaya yang membawa seluruh rangkaian fitur Seedance 2.0 tetapi dibatasi pada 480p dan 720p, 24 fps, 4-15 detik. Model ini mencakup teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, pembuatan berbasis referensi multimodal dari 1-9 gambar dan maksimum 3 video referensi dengan total 15 detik, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web; referensi audio harus disertai gambar atau video. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16. 480p 5 detik ≈ $0,26.
doubao-seedance-2-0-mini-260615ByteDance$3.5000per 1M tokensByteDance Seedance 2.0 Mini — tingkat ringan dan ramah anggaran dari lini Seedance 2.0, dibatasi pada 480p dan 720p, 24 fps, 4-15 detik. Model ini membawa rangkaian fitur terdokumentasi yang sama dengan anggota lini lainnya: teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, pembuatan berbasis referensi multimodal dari 1-9 gambar dan maksimum 3 video referensi dengan total 15 detik, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web; referensi audio harus disertai gambar atau video. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16.
doubao-seedance-2-5-260628ByteDance$10.7000per 1M tokensByteDance Seedance 2.5 — model jalur utama Seedance, yang memperpanjang satu kali pembuatan menjadi 4-30 detik pada 24 fps sekaligus membatasi resolusi di 480p dan 720p. Pembuatan berbasis referensi multimodal meningkat hingga 1-30 gambar, maksimum 10 video referensi, dan maksimum 10 klip audio referensi (masing-masing total 30 detik), dan tidak seperti lini 2.0, sebuah referensi audio dapat berdiri sendiri. Model ini juga mencakup teks ke video, gambar ke video dari bingkai pertama serta dari bingkai pertama-dan-terakhir, penyuntingan video, perpanjangan video, pembuatan dengan audio, dan sebuah alat pencarian web. Menghasilkan MP4 dalam 21:9, 16:9, 4:3, 1:1, 3:4, atau 9:16.
doubao-seedream-4-5-251128ByteDance$0.03704per permintaanByteDance Doubao Seedream 4.5 — teks ke gambar dan gambar ke gambar dengan penggabungan multi-gambar, menghasilkan satu gambar atau satu set gambar yang saling berkaitan. Mode gambar tunggal menerima prompt saja, satu gambar referensi, atau 2-14 gambar referensi; mode set (sequential_image_generation=auto) mengembalikan hingga 15 gambar dari teks, hingga 14 dari satu gambar referensi, atau satu set dari 2-14 referensi selama jumlah masukan ditambah keluaran tidak melebihi 15. Model ini mendukung keluaran 2K dan 4K dan secara bawaan mengembalikan JPEG, sebagai URL atau base64. Penyuntingan interaktif berbasis koordinat hanya tersedia di Seedream 5.0 Pro (doubao-seedream-5-0-pro-260628).
doubao-seedream-5-0-260128ByteDance$0.03259per permintaanByteDance Doubao Seedream 5.0-lite — teks ke gambar dan gambar ke gambar dengan kreasi terkendali yang lebih cerdas, pengambilan data real-time, dan konsistensi subjek yang lebih kuat (resolusi 2K ke atas).
doubao-seedream-5-0-pro-260628ByteDance$0.045per permintaanByteDance Doubao Seedream 5.0 Pro — model gambar teratas vendor untuk kreasi terkendali: teks ke gambar, gambar ke gambar dengan satu referensi maupun multi-referensi (2-10 gambar referensi), penyuntingan interaktif dengan koordinat, kotak, atau panah, serta dekomposisi lapisan yang memecah satu gambar menjadi lapisan dasar ditambah hingga 16 lapisan, masing-masing dikembalikan dengan ukuran, z_index, dan kotak pembatasnya sendiri (setel layer_decomposition=true). Hanya keluaran satu gambar: tanpa pembuatan grup (berurutan), pencarian web, atau streaming. Ditagih per gambar keluaran berdasarkan skenario dan tingkat piksel: satu gambar hingga 2,61 MP dikenai harga dasar; di atas 2,61 MP dikenai 2x; dalam dekomposisi lapisan, setiap lapisan yang dikembalikan ditagih terpisah sebesar 0,5x (atau 1x di atas 2,61 MP); setiap gambar referensi setelah yang pertama menambah 1/15 dari harga dasar.
fun-asr-flash-2026-06-15Alibaba$0.1260per jam audioAlibaba Fun-ASR Flash (2026-06-15) — pengenalan ucapan rekaman berlatensi rendah dengan konteks prompt dan deteksi bahasa otomatis pada berbagai dialek Tionghoa serta lebih dari 30 bahasa. Menerima audio melalui URL, Base64, atau unggahan AAC/AMR/AVI/FLAC/FLV/M4A/MKV/MOV/MP3/MP4/MPEG/OGG/OPUS/WAV/WEBM/WMA/WMV, hingga 5 menit dan 2 GB.
gemini-2.5-flash-imageGoogle$0.3000$2.5000$0.2100$1.7500per 1M tokensGoogle Gemini 2.5 Flash Image (Nano Banana) — model pembuatan dan penyuntingan gambar asli yang cepat untuk alur kerja kreatif. Model ini menerima masukan teks dan gambar lalu mengembalikan gambar melalui endpoint chat completions yang kompatibel dengan OpenAI, dengan batas masukan 65.536 token dan batas keluaran 32.768 token.
gemini-2.5-proGoogle$1.2500$10.0000$0.8125$6.5000per 1M tokensGoogle Gemini 2.5 Pro — model tingkat penalaran dari keluarga 2.5, dengan jendela konteks 1M token. Prompt di atas 200.000 token dihargai ulang pada tarif konteks panjang dari vendor untuk seluruh permintaan, mengikuti aturan Google sendiri.
gemini-3-pro-imageGoogle$2.0000$12.0000$1.4000$8.4000per 1M tokensGoogle Gemini 3 Pro Image (Nano Banana Pro) — model premium berbasis penalaran untuk pembuatan gambar profesional dan penyuntingan lewat percakapan. Model ini unggul dalam desain grafis yang kompleks, mockup produk berfidelitas tinggi, perenderan teks multibahasa yang akurat, konsistensi merek, dan visualisasi faktual dengan grounding Google Search. Model ini menerima teks dan gambar, mengembalikan teks dan gambar, mendukung thinking, dan menghasilkan keluaran 1K, 2K, atau 4K.
gemini-3.1-flash-imageGoogle$0.5000$3.0000$0.3500$2.1000per 1M tokensGoogle Gemini 3.1 Flash Image (Nano Banana 2) — model versi stabil berlatensi rendah untuk pembuatan gambar berkualitas tinggi dan penyuntingan lewat percakapan. Model ini menerima teks, gambar, dan PDF, mendukung thinking serta grounding pencarian, dan dapat menghasilkan gambar 0,5K, 1K, 2K, atau 4K untuk alur produksi bervolume tinggi.
gemini-3.1-flash-lite-imageGoogle$0.2500$1.5000$0.1750$1.0500per 1M tokensGoogle Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) — model berlatensi sangat rendah dan hemat biaya untuk pembuatan gambar bervolume tinggi dan penyuntingan multi-giliran yang cepat. Model ini menerima teks dan gambar, menghasilkan gambar 1K, mendukung thinking serta penyuntingan lewat percakapan, dan dirancang untuk aplikasi interaktif bagi pengembang maupun pengguna akhir.
gemini-3.5-flashGoogle$1.5000$9.0000$1.0500$6.3000per 1M tokensGoogle Gemini 3.5 Flash — model multimodal versi stabil yang dioptimalkan untuk performa agen yang berkelanjutan, siklus pemrograman yang cepat, penempatan sub-agen, dan alur kerja multi-langkah yang berjalan lama. Model ini menerima teks, gambar, video, audio, dan PDF, mendukung thinking serta alat bawaan, dan menyediakan konteks masukan 1.048.576 token dengan hingga 65.536 token keluaran.
gemini-3.6-flashGoogle$0.7500$3.7500$0.5250$2.6250per 1M tokensGoogle Gemini 3.6 Flash — model penalaran multimodal versi stabil yang menyeimbangkan kecepatan dan kecerdasan untuk tugas agentik maupun tugas dunia nyata, dengan konteks masukan 1.048.576 token dan batas keluaran 65.536 token. Model ini menerima teks, gambar, video, audio, dan PDF, serta mendukung thinking, pemanggilan fungsi, eksekusi kode, grounding pencarian, output terstruktur, dan Computer Use (pratinjau). Catatan harga: harga resmi Google untuk model ini bersifat promosi hingga 31 Desember 2026 — $0,75 masukan / $3,75 keluaran / $0,075 masukan dari cache per 1M token. Mulai 1 Januari 2027 harga resmi vendor kembali ke $1,50 / $7,50 / $0,15, dan harga kami mengikutinya dengan paritas yang sama.
gemini-3.7-flashGoogle$0.7500$3.7500$0.5250$2.6250per 1M tokensGoogle Gemini 3.7 Flash — model penalaran multimodal tingkat Flash yang terbaru, dihargai sama persis dengan 3.6 Flash selama promosi vendor berlangsung. Menerima teks, gambar, video, audio, dan PDF; mendukung thinking, pemanggilan fungsi, eksekusi kode, grounding pencarian, dan output terstruktur. Catatan harga: harga resmi Google untuk model ini bersifat promosi hingga 31 Desember 2026 — $0,75 masukan / $3,75 keluaran / $0,075 masukan dari cache per 1M token. Mulai 1 Januari 2027 harga resmi vendor kembali ke $1,50 / $7,50 / $0,15, dan harga kami mengikutinya dengan paritas yang sama.
gemini-3.8-flashGoogle$0.7500$3.7500$0.4875$2.4375per 1M tokensGoogle Gemini 3.8 Flash — model Gemini multimodal cepat dari Google, yang di sini dapat dipanggil melalui endpoint yang kompatibel dengan OpenAI maupun endpoint Gemini native. Harga token standar adalah $0,75 masukan, $0,075 masukan dari cache, dan $3,75 keluaran per 1M token.
glm-5Zhipu AI$1.0000$3.2000$0.9500$3.0400per 1M tokensZhipu GLM-5 — MoE berparameter total 744B dengan 40B aktif, dilatih pada 28,5T token dan menggunakan DeepSeek Sparse Attention, dengan jendela konteks 200K dan hingga 128K token keluaran. Teks masuk, teks keluar. Mendukung beberapa mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP.
glm-5-turboZhipu AI$1.2000$4.0000$1.1400$3.8000per 1M tokensZhipu GLM-5-Turbo — varian GLM-5 yang berorientasi throughput, dioptimalkan untuk alur kerja agen: pemanggilan alat dan keterampilan yang lebih stabil di sepanjang tugas multi-langkah, penanganan instruksi berantai panjang yang lebih baik, dan eksekusi tugas terjadwal maupun berjalan lama. Jendela konteks 200K, hingga 128K token keluaran, teks masuk dan teks keluar. Mendukung mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP.
glm-5.1Zhipu AI$1.4000$4.4000$1.1200$3.5200per 1M tokensZhipu GLM-5.1 — model fondasi unggulan yang dibangun untuk pekerjaan otonom berkepanjangan: vendor mendokumentasikan eksekusi terus-menerus tanpa pengawasan pada satu tugas hingga 8 jam, meliputi perencanaan, eksekusi, pengujian, dan optimalisasi berulang. Jendela konteks 200K, hingga 128K token keluaran, teks masuk dan teks keluar. Mendukung beberapa mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP.
glm-5.2Zhipu AI$1.4000$4.4000$1.1200$3.5200per 1M tokensZhipu GLM-5.2 — model fondasi unggulan yang dikhususkan untuk pekerjaan agen pemrograman berdurasi panjang melalui pelatihan khusus selama berbulan-bulan, bukan sekadar perpanjangan konteks, dengan jendela konteks 1M token dan hingga 128K token keluaran. Teks masuk, teks keluar. Mendukung beberapa mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP.
glm-5.3Zhipu AI$1.4000$4.4000$0.9100$2.8600per 1M tokensZhipu GLM-5.3 — model unggulan untuk pemrograman dan agen yang dilatih lanjut (post-trained) di atas basis yang sama dengan GLM-5.2: peningkatan 50% pada tolok ukur pemrograman internal Zhipu, SOTA sumber terbuka pada Terminal-Bench 3.0 dan Agents' Last Exam, serta hasil penemuan kerentanan CyberGym yang mutakhir, dengan jendela konteks 1M token dan hingga 128K token keluaran. Teks masuk, teks keluar. Mendukung beberapa mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP.
glm-5.3-flashZhipu AI$0.1500$0.5000$0.1350$0.4500per 1M tokensZhipu GLM-5.3-Flash — model multimodal asli pertama di lini GLM-5 sekaligus tingkat terdepan berbiaya rendahnya: total 320B parameter dengan 18B aktif, di atas arsitektur atensi hibrida linear + renggang yang memangkas komputasi atensi dan KV cache hingga beberapa kali lipat dibanding GLM-5.3 sekaligus memangkas separuh parameter aktif maupun jumlah lapisan dibanding GLM-4.5. Menerima teks, gambar, dan video; mengembalikan teks. (Vendor juga mengiklankan masukan berkas, yang belum diverifikasi di sini sehingga tidak ditawarkan.) Jendela konteks 1M token dan hingga 128K token keluaran. Mendukung mode berpikir, pemanggilan fungsi, keluaran JSON terstruktur, streaming, caching konteks, dan integrasi alat MCP. Diposisikan untuk pemrograman visual — pekerjaan front-end, game, dan 3D di mana model memeriksa hasil render-nya sendiri lalu beriterasi.
glm-5v-turboZhipu AI$1.2000$4.0000$1.1400$3.8000per 1M tokensZhipu GLM-5V-Turbo — model penalaran multimodal untuk gambar, video, berkas, pemrograman, dan alur kerja agen berbasis alat.
glm-imageZhipu AI$0.015$0.01425per permintaanZhipu GLM-Image — pembuatan gambar yang dibangun di atas arsitektur hibrida yang memadukan pemahaman autoregresif dengan dekode difusi, model multimodal SOTA pertama yang dilatih ujung-ke-ujung pada chip buatan Tiongkok (Huawei Ascend). Membaca instruksi alih-alih kata kunci dan mengisi detail yang dibiarkan tersirat oleh prompt, dengan perenderan teks (terutama aksara Tionghoa) dan penanganan adegan padat pengetahuan yang jauh lebih kuat. Satu gambar per permintaan.
glm-ttsZhipu AI$0.3500$0.3150per 10 ribu karakterZhipu GLM-TTS — text-to-speech yang dibangun di atas arsitektur pembuatan dua tahap dengan pembelajaran penguatan GRPO, yang menyimpulkan emosi dan intonasi dari teks di sekitarnya alih-alih menuntut penandaan eksplisit. Model ini menyediakan tujuh suara bawaan (tongtong sebagai bawaan, xiaochen, chuichui, jam, kazi, douji, luodo) dengan kecepatan dan volume yang dapat disetel, menerima hingga 1.024 karakter per permintaan, dan melakukan streaming dengan latensi bingkai pertama di bawah 400 ms. Menghasilkan wav atau pcm pada laju sampel yang disarankan 24 kHz; streaming hanya mendukung pcm.
gpt-5.5OpenAI$5.0000$30.0000$4.0000$24.0000per 1M tokensOpenAI GPT-5.5 — model penalaran terdepan untuk pemrograman kompleks dan pekerjaan profesional. Mendukung masukan teks dan gambar, pemanggilan fungsi serta alat bawaan, jendela konteks 1.050.000 token, hingga 128.000 token keluaran, dan tingkat penalaran dari none sampai xhigh.
gpt-5.6-lunaOpenAI$0.2000$1.2000$0.1700$1.0200per 1M tokensOpenAI GPT-5.6 Luna — tingkat GPT-5.6 yang paling cepat dan paling terjangkau, dioptimalkan untuk beban kerja bervolume tinggi yang sensitif terhadap biaya sambil tetap mempertahankan penalaran, penglihatan, dan penggunaan alat. Mendukung masukan teks dan gambar, jendela konteks 1.050.000 token, serta hingga 128.000 token keluaran.
gpt-5.6-solOpenAI$5.0000$30.0000$4.0000$24.0000per 1M tokensOpenAI GPT-5.6 Sol — model unggulan lini GPT-5.6 untuk penalaran terdepan, pekerjaan profesional yang kompleks, pemrograman, sains, keamanan siber, dan alur kerja agentik berdurasi panjang. Mendukung masukan teks dan gambar, alat bawaan, jendela konteks 1.050.000 token, hingga 128.000 token keluaran, serta setelan penalaran terdalam di keluarga ini.
gpt-5.6-terraOpenAI$2.0000$12.0000$1.6000$9.6000per 1M tokensOpenAI GPT-5.6 Terra — model GPT-5.6 yang seimbang untuk pekerjaan profesional sehari-hari, menghadirkan kecerdasan dan performa agen pemrograman yang kuat dengan biaya lebih rendah daripada Sol. Mendukung masukan teks dan gambar, alat bawaan, jendela konteks 1.050.000 token, serta hingga 128.000 token keluaran.
gpt-6-astraOpenAI$10.0000$50.0000$7.0000$35.0000per 1M tokensOpenAI GPT-6 Astra — model OpenAI yang paling mumpuni, dibangun untuk pekerjaan ujung-ke-ujung yang paling sulit: penalaran kompleks, pemrograman, penggunaan komputer, riset, dan pembuatan dokumen. Mendukung masukan teks dan gambar, jendela konteks 1.050.000 token, hingga 128.000 token keluaran, dan setelan tingkat penalaran hingga xhigh dan max.
gpt-6-lunaOpenAI$0.1000$0.5000$0.0650$0.3250per 1M tokensOpenAI GPT-6 Luna — model OpenAI yang paling efisien, dibangun untuk tugas terfokus bervolume tinggi. Mendukung masukan teks dan gambar, jendela konteks 1.050.000 token, hingga 128.000 token keluaran, dan tingkat penalaran dari none hingga max, dengan medium sebagai bawaan. Gunakan /v1/responses untuk pemanggilan alat: di /v1/chat/completions, pemanggilan fungsi hanya berfungsi jika reasoning_effort disetel ke none. Pada /v1/responses, kirimkan seluruh percakapan dalam array input pada setiap giliran; permintaan yang menyertakan previous_response_id atau conversation akan ditolak.
gpt-6-solOpenAI$2.0000$10.0000$1.3000$6.5000per 1M tokensOpenAI GPT-6 Sol — dibangun untuk pemrograman kompleks dan alur kerja agentik. Mendukung masukan teks dan gambar, jendela konteks 1.050.000 token, hingga 128.000 token keluaran, dan tingkat penalaran dari none hingga max, dengan medium sebagai bawaan. Gunakan /v1/responses untuk pemanggilan alat: di /v1/chat/completions, pemanggilan fungsi hanya berfungsi jika reasoning_effort disetel ke none. Pada /v1/responses, kirimkan seluruh percakapan dalam array input pada setiap giliran; permintaan yang menyertakan previous_response_id atau conversation akan ditolak.
gpt-6.1-solOpenAI$2.0000$10.0000$1.3000$6.5000per 1M tokensOpenAI GPT-6.1 Sol — mendekati GPT-6 Astra dalam pemrograman kompleks, penggunaan komputer, dan pekerjaan profesional, dengan biaya lebih rendah. Mendukung masukan teks dan gambar, jendela konteks 1.050.000 token, dan hingga 128.000 token keluaran. Tingkat penalaran berkisar dari low hingga max, dengan medium sebagai bawaan; none dan minimal tidak didukung, dan token penalaran ditagih sebagai keluaran. Jika masukan melebihi 272.000 token, seluruh token dalam permintaan tersebut ditagih dengan tarif konteks panjang. Gunakan /v1/responses untuk pemanggilan alat; /v1/chat/completions tidak mendukung pemanggilan alat. Pada /v1/responses, kirimkan seluruh percakapan dalam array input pada setiap giliran; permintaan yang menyertakan previous_response_id atau conversation akan ditolak.
gpt-image-2OpenAI$5.0000$30.0000$4.0000$24.0000per 1M tokensOpenAI GPT Image 2 — model pembuatan dan penyuntingan gambar mutakhir untuk keluaran yang cepat dan berkualitas tinggi. Model ini menerima masukan teks dan gambar, mendukung ukuran gambar yang fleksibel serta masukan gambar berfidelitas tinggi, dan menagih per token, bukan per panggilan: $5 masukan teks, $1,25 masukan teks dari cache, $8 masukan gambar, dan $30 keluaran gambar per 1M token.
gpt-image-2.5-flareOpenAI$5.0000$30.0000$4.0000$24.0000per 1M tokensOpenAI GPT Image 2.5 Flare — model pembuatan dan penyuntingan gambar dari lini GPT Image 2.5 milik OpenAI. Flare dan gpt-image-2.5-sunburst adalah build terpisah, bukan alias dari satu model yang sama, dan dijual dengan harga yang sama; papan peringkat publik menilai keduanya secara terpisah. Harga token standar adalah $5 masukan teks, $1,25 masukan dari cache, $8 masukan gambar, dan $30 keluaran gambar per 1M token.
gpt-image-2.5-sunburstOpenAI$5.0000$30.0000$4.0000$24.0000per 1M tokensOpenAI GPT Image 2.5 Sunburst — model pembuatan dan penyuntingan gambar dari lini GPT Image 2.5 milik OpenAI. Sunburst dan gpt-image-2.5-flare adalah build terpisah, bukan alias dari satu model yang sama, dan dijual dengan harga yang sama; papan peringkat publik menilai keduanya secara terpisah. Harga token standar adalah $5 masukan teks, $1,25 masukan dari cache, $8 masukan gambar, dan $30 keluaran gambar per 1M token.
grok-4.7xAI$2.0000$6.0000$0.8000$2.4000per 1M tokensxAI Grok 4.7 — model terdepan yang dibangun untuk pemrograman, tugas agentik, dan pekerjaan pengetahuan. Mendukung masukan teks dan gambar serta memiliki jendela konteks 500.000 token. Penalaran tidak dapat dimatikan: reasoning_effort dapat disetel ke low, medium, high, atau xhigh, dengan high sebagai bawaan, dan token penalaran ditagih sebagai keluaran. Jika prompt mencapai 200.000 token, seluruh token dalam permintaan tersebut ditagih dengan tarif konteks panjang. Hanya alat function yang diterima; alat sisi server xAI, seperti pencarian web, pencarian X, dan eksekusi kode, tidak tersedia, dan permintaan yang menyertakannya akan ditolak. Pada /v1/responses, kirimkan seluruh percakapan dalam array input pada setiap giliran dan kembalikan item penalaran terenkripsi dari respons sebelumnya tanpa diubah; permintaan yang menyertakan previous_response_id atau conversation akan ditolak.
happyhorse-1.1-i2vAlibaba$0.140per detikAlibaba HappyHorse 1.1 (I2V) — gambar ke video dengan tekstur yang lebih baik, konsistensi identitas antarklip, kelancaran gerak, dan sinkronisasi audio-visual. 720P/1080P.
happyhorse-1.1-r2vAlibaba$0.140per detikAlibaba HappyHorse 1.1 (R2V) — pembuatan video berbasis referensi dengan hingga 9 gambar referensi, konsistensi subjek/adegan/gaya yang kuat, dan kendali kamera. 720P/1080P.
happyhorse-1.1-t2vAlibaba$0.140per detikAlibaba HappyHorse 1.1 (T2V) — teks ke video dengan pemahaman semantik, kendali kamera, dan pembuatan dinamis yang lebih baik. Video 720P/1080P yang mengalir, detail, dan konsisten secara fisik.
hy-mt2-liteTencent$0.0440$0.1770per 1M tokensTencent HY-MT2 Lite — tingkat terjemahan multibahasa yang berorientasi pada latensi dan biaya, melalui protokol OpenAI Chat Completions. Hingga 4K token masukan dan 4K token keluaran; hanya teks.
hy-mt2-plusTencent$0.0740$0.2950per 1M tokensTencent HY-MT2 Plus — tingkat terjemahan multibahasa yang patuh pada instruksi, melalui protokol OpenAI Chat Completions. Hingga 4K token masukan dan 4K token keluaran; hanya teks.
hy-mt2-proTencent$0.0740$0.2950per 1M tokensTencent HY-MT2 Pro — tingkat terjemahan mesin unggulan untuk terjemahan multibahasa berkualitas tinggi, melalui protokol OpenAI Chat Completions. Hingga 4K token masukan dan 4K token keluaran; hanya teks.
hy3Tencent$0.1320$0.5280per 1M tokensTencent Hunyuan 3 (Hy3) — model MoE 295B parameter (21B aktif), konteks asli 256K, tiga mode berpikir (fast / low / deep). Kuat pada agen pemrograman, pemahaman dokumen panjang, konteks multi-giliran, dan alur kerja agen multi-langkah. Hanya teks.
hy4-previewTencent$0.8340$2.5010per 1M tokensTencent Hunyuan 4 preview (Hy4 preview) — jendela konteks 1M token (masukan maksimum 960K, keluaran maksimum 64K) dengan berpikir mendalam (yang diberi label preserved thinking oleh Tencent), output terstruktur, pemanggilan fungsi, dan caching prompt. Hanya teks. SKU pratinjau: Tencent menghentikan model pratinjau begitu versi ketersediaan umumnya dirilis.
jev-1.13TypeSafe$0.0462per 1M tokensTypeSafe Jev 1.13 — model keputusan System One, bukan model chat. Kirim state aplikasi Anda (string, objek JSON, atau array) bersama sekumpulan pertanyaan bertipe ke POST /v1/systemone — choice (memilih salah satu opsi Anda), score (menempatkannya pada tingkatan berurutan yang Anda tentukan), atau noul (probabilitas bahwa sebuah pernyataan ya/tidak benar) — dan terima jawaban bertipe dengan probabilitas untuk setiap opsi serta nilai keyakinan, biasanya dalam 70–500 ms. Semua pertanyaan dievaluasi secara paralel terhadap state yang sama, sehingga beberapa pertanyaan bisa dikirim dalam satu permintaan. SDK resmi TypeSafe untuk Python dan JavaScript dapat langsung dipakai dengan base URL diatur ke https://api.chinaapi.ai. Ditagih per token input; output gratis. Hanya input teks, hingga 32K token per permintaan; bahasa utamanya adalah bahasa Inggris, jadi uji bahasa lain sebelum mengandalkannya.
jev-latestTypeSafe$0.0462per 1M tokensTypeSafe Jev (latest) — alias yang dipanggil SDK TypeSafe ketika model tidak ditentukan. Saat ini melayani jev-1.13, dengan harga yang sama dan kontrak System One yang sama di POST /v1/systemone: input berupa state serta pertanyaan bertipe choice, score, dan noul; output berupa jawaban bertipe dengan probabilitas dan nilai keyakinan. Kolom model pada respons menyebutkan versi yang menjawab. Kami hanya memindahkan alias ke rilis Jev yang baru setelah memeriksa harganya, jadi tetapkan jev-1.13 jika Anda telah menyetel ambang batas dengannya.
kimi-k2.6Moonshot$0.9500$4.0000$0.7600$3.2000per 1M tokensMoonshot Kimi K2.6 — model serbaguna untuk dialog, pembuatan kode, pemahaman visual, dan tugas agen, dengan penulisan kode berdurasi panjang dan eksekusi otonom yang lebih kuat dibanding pendahulunya. Jendela konteks 256K, keluaran bawaan 32.768 token. Model ini menerima teks, gambar (png, jpeg, webp, gif), dan video (mp4, mov, webm, dan lainnya) sebagai konten base64 lalu mengembalikan teks. Mode berpikir aktif secara bawaan dan dapat dimatikan; temperature dipatok pada 1.0 saat berpikir dan 0.6 saat tidak.
kimi-k2.7-codeMoonshot$0.9500$4.0000$0.7600$3.2000per 1M tokensMoonshot Kimi K2.7 Code — model pemrograman khusus milik Kimi, yang menurut pengukuran vendor meningkatkan kepatuhan instruksi dan pemrograman berdurasi panjang dibanding K2.6 sekaligus memangkas berpikir berlebihan sekitar 30% secara rata-rata. Jendela konteks 256K, keluaran bawaan 32.768 token. Model ini menerima teks, gambar, dan video sebagai konten base64 lalu mengembalikan teks. Thinking bersifat wajib dan akan mengembalikan galat jika dimatikan; tool_choice terbatas pada auto atau none, dan reasoning_content harus dibawa terus melintasi pemanggilan alat multi-langkah.
kimi-k2.7-code-highspeedMoonshot$1.9000$8.0000per 1M tokensMoonshot Kimi K2.7 Code Highspeed — tingkat throughput dari K2.7 Code, menyajikan model yang sama pada sekitar 180 token per detik dan hingga 260 pada pekerjaan berkonteks pendek. Jendela konteks 256K, keluaran bawaan 32.768 token. Model ini menerima teks, gambar, dan video sebagai konten base64 lalu mengembalikan teks. Thinking bersifat wajib dan akan mengembalikan galat jika dimatikan; tool_choice terbatas pada auto atau none, dan reasoning_content harus dibawa terus melintasi pemanggilan alat multi-langkah.
kimi-k3Moonshot$3.0000$15.0000$1.9500$9.7500per 1M tokensMoonshot Kimi K3 — model unggulan berparameter 2,8 triliun untuk pemrograman berdurasi panjang, pekerjaan pengetahuan ujung-ke-ujung, dan penalaran mendalam, dengan jendela konteks 1M token dan hingga 1.048.576 token penyelesaian (bawaan 131.072). Model ini menerima teks, gambar hasil enkode base64, dan video hasil enkode base64, lalu mengembalikan teks. Thinking selalu aktif, dengan upaya penalaran pada tingkat max secara bawaan; temperature dipatok pada 1.0. Mendukung pemanggilan alat khusus dan pemuatan alat secara dinamis.
kling-3.0-turboKuaishou$0.560per permintaanKuaishou Kling 3.0 Turbo — tingkat bernilai ekonomis dari lini Kling 3.0, menghasilkan 720P atau 1080P (bawaan 720P) berdurasi 3-15 detik (bawaan 5) dalam 16:9, 9:16, atau 1:1, dari sebuah prompt atau gambar bingkai pertama. Audio asli selalu disertakan dan tidak memiliki sakelar hidup/mati. Dibandingkan kling-v3, model ini melepas tingkat 4K, kendali bingkai akhir, dan masukan video demi kecepatan dan biaya. 720p 5 detik dengan audio ≈ $0,56.
kling-v3Kuaishou$0.420per permintaanKuaishou Kling 3.0 — teks ke video dan gambar ke video dengan audio asli serta konsistensi elemen yang lebih baik. Klip berdurasi 3-15 detik (bawaan 5) dalam 16:9, 9:16, atau 1:1, dengan tingkat dipilih melalui mode: std untuk 720P, pro untuk 1080P, dan 4k untuk 4K asli. Audio harus diaktifkan sendiri lewat sound=on dan secara bawaan mati; gambar ke video menerima bingkai pertama dengan bingkai akhir opsional. Mulai $0,083/detik (720p).
kling-v3-omniKuaishou$0.420per permintaanKling 3.0 Omni — pembuatan video multi-gambar berbasis referensi. Harga yang tercantum adalah tingkat std (720p, 5 detik, tanpa audio, tanpa video referensi). Permintaan yang tidak menyetel mode akan memakai tingkat pro bawaan dari sisi vendor dan ditagih 1,33x — sekitar $0,56 untuk klip 5 detik yang sama; 4k ditagih 5x. Kirim mode=std agar ditagih sesuai harga yang tercantum.
LongCat-2.0Meituan$0.3000$1.2000per 1M tokensMeituan LongCat-2.0 — model MoE terbuka berparameter 1,6T dengan konteks asli 1M, dibangun untuk pemrograman agentik dan penggunaan alat berdurasi panjang. Model penalaran khusus teks.
M2-herMiniMax$0.3000$1.2000per 1M tokensMiniMax M2-her — model percakapan yang dibangun untuk bermain peran dan obrolan multi-giliran, dengan jendela konteks 65.536 token dan balasan dibatasi 2.048 token (max_completion_tokens). Selain system / user / assistant, model ini menerima peran pesan tambahan milik vendor pada endpoint chat yang kompatibel dengan OpenAI: user_system (persona pengguna), group (nama percakapan), dan sample_message_user / sample_message_ai (contoh pertukaran yang mengarahkan gaya balasan). Setiap pesan dengan peran tambahan wajib menyertakan kolom name; tanpanya vendor menolak seluruh permintaan dengan error 2013, sedangkan pesan system/user/assistant biasa tidak memerlukan name. Hanya teks: tanpa masukan gambar, dan vendor tidak mendokumentasikan pemanggilan alat maupun caching. Setiap panggilan membawa sekitar 170 token overhead persona dari sisi vendor di luar prompt yang terlihat, yang ditagih sebagai masukan.
mimo-v2.5Xiaomi$0.1400$0.2800per 1M tokensXiaomi MiMo-V2.5 — model yang secara asli mencakup semua modalitas, dengan konteks 1M dan keluaran maksimum 128K, memahami gambar, video, audio, dan teks dalam satu model. Mendukung berpikir mendalam, pemanggilan fungsi, output terstruktur, dan pencarian web, lengkap dengan kapabilitas agen di semua modalitas.
mimo-v2.5-asrXiaomi$0.0740per jam audioXiaomi MiMo v2.5 ASR — model pengenalan suara yang dioptimalkan untuk bahasa Mandarin dan Inggris serta dialek-dialek Tiongkok, menangani audio berisik, jarak jauh, dan banyak pembicara, termasuk transkripsi lirik lagu.
mimo-v2.5-proXiaomi$0.4350$0.8700per 1M tokensXiaomi MiMo-V2.5-Pro — model unggulan berparameter satu triliun (42B aktif) dengan konteks 1M dan keluaran maksimum 128K, disetel untuk beban kerja agen berintensitas tinggi. Mendukung berpikir mendalam, pemanggilan fungsi, output terstruktur, dan pencarian web. Hanya menghasilkan teks: berbeda dari mimo-v2.5, daftar kapabilitas vendor tidak mencantumkan pemahaman semua modalitas.
mimo-v2.5-ttsXiaomi$0.0000per 10 ribu karakterXiaomi MiMo v2.5 TTS — text-to-speech ekspresif dengan delapan suara bawaan, empat berbahasa Mandarin dan empat berbahasa Inggris (Mia, Chloe, Milo, Dean), mencakup bahasa Mandarin dan Inggris ditambah gaya dialek Timur Laut, Sichuan, Henan, dan Kanton. Penyampaian diarahkan lewat dua cara: instruksi gaya dalam bahasa alami, dan tag audio sebaris untuk emosi dasar maupun majemuk, tarikan napas, helaan napas, dan tempo, termasuk mode menyanyi yang hanya dimiliki model ini di lini MiMo TTS. Menghasilkan wav mono atau pcm16 pada 24 kHz dan mendukung streaming berlatensi rendah, yang mensyaratkan pcm16. Konteks 8K dan keluaran maksimum 8K.
mimo-v2.5-tts-voicecloneXiaomi$0.0000per 10 ribu karakterXiaomi MiMo v2.5 TTS VoiceClone — model kloning suara: kirimkan sampel audio referensi sebagai data URL pada kolom voice (data:{mime};base64,...) dan model akan menyintesis ucapan dengan suara tersebut tanpa tahap pelatihan, pelabelan, atau penyetelan apa pun. Model ini menerima MP3 (audio/mpeg) atau WAV, dengan string hasil enkode base64 dibatasi 10 MB; Xiaomi tidak menerbitkan durasi minimum untuk audio referensi. Instruksi gaya dalam bahasa alami dan tag audio sebaris diwarisi dari mimo-v2.5-tts, tetapi streaming tidak tersedia — permintaan berjalan dalam mode kompatibilitas dan baru mengembalikan hasil setelah sintesis selesai.
mimo-v2.5-tts-voicedesignXiaomi$0.0000per 10 ribu karakterXiaomi MiMo v2.5 TTS VoiceDesign — model desain suara: jelaskan suara yang diinginkan dalam bahasa alami pada kolom instructions, dan model akan menyintesis ucapan dengan suara rancangan tersebut.
mimo-v2.6-flashXiaomi$0.1400$0.2800$0.1260$0.2520per 1M tokensXiaomi MiMo-V2.6-Flash — model penalaran yang efisien dan berbiaya rendah dengan bobot terbuka, secara asli mencakup semua modalitas: satu model memahami gambar, video, audio, dan teks. Konteks 1M dan keluaran maksimum 128K, dengan berpikir mendalam, pemanggilan fungsi, dan output terstruktur. Ditujukan untuk beban kerja profesional sehari-hari bervolume tinggi yang mementingkan biaya dan throughput.
mimo-v2.6-proXiaomi$0.4350$0.8700$0.3915$0.7830per 1M tokensXiaomi MiMo-V2.6-Pro — model penalaran unggulan Xiaomi berparameter satu triliun dengan bobot terbuka, secara asli mencakup semua modalitas: satu model memahami gambar, video, audio, dan teks. Konteks 1M dan keluaran maksimum 128K, dengan berpikir mendalam, pemanggilan fungsi, dan output terstruktur. Dibuat untuk proyek kompleks, tugas agen jangka panjang, keamanan siber, dan pekerjaan riset.
mimo-v2.6-pro-ultraspeedXiaomi$4.3500$8.7000per 1M tokensXiaomi MiMo-V2.6-Pro UltraSpeed — MiMo-V2.6-Pro yang dilayani dalam mode ultra-cepat Xiaomi, dengan keluaran hingga 20 kali lebih cepat daripada model standar, untuk interaksi waktu nyata dan produksi yang sensitif terhadap latensi. Kapabilitasnya sama dengan mimo-v2.6-pro: pemahaman semua modalitas atas gambar, video, audio, dan teks, konteks 1M, keluaran maksimum 128K, berpikir mendalam, pemanggilan fungsi, dan output terstruktur. Harganya sepuluh kali mimo-v2.6-pro; Xiaomi menyediakan kapasitas mode ini secara terpisah, sehingga lonjakan permintaan yang besar dapat terkena pembatasan laju.
MiniMax-H3MiniMax$0.080per detikMiniMax H3 (Hailuo 3.0) — model video multimodal serbaguna terbuka generasi berikutnya yang menghasilkan audio stereo asli dalam satu proses, pada 768P atau 2K, berdurasi 4-15 detik (hanya bilangan bulat), 24 fps. Model ini mencakup teks ke video, gambar ke video dari bingkai pertama dan/atau bingkai terakhir, serta pembuatan berbasis referensi dari gambar, video, atau audio untuk karakter, gerak, kamera, gaya, suara, atau ritme penyuntingan; gambar ke video dan pembuatan berbasis referensi tidak dapat digabungkan dalam satu permintaan. Model ini menerima video H.264/H.265, gambar JPG, JPEG, PNG, WEBP, HEIC, dan HEIF, serta audio WAV atau MP3, dengan prompt hingga 7.000 karakter. $0,08/detik pada 768P, $0,13/detik pada 2K.
MiniMax-Hailuo-02MiniMax$0.280per permintaanMiniMax Hailuo 02 — pembuatan video hemat yang mencakup baik teks ke video maupun gambar ke video pada 24 fps, dengan 512p dan 768p tersedia sebagai klip 6 detik atau 10 detik dan 1080p pada 6 detik. Tingkat 512p adalah titik masuk lini Hailuo.
MiniMax-Hailuo-2.3MiniMax$0.280per permintaanMiniMax Hailuo 2.3 — teks ke video dan gambar ke video yang oleh vendor diposisikan pada kepatuhan terhadap instruksi, pada 24 fps, dengan 768p tersedia sebagai klip 6 detik atau 10 detik dan 1080p pada 6 detik. 768p 6 detik = $0,28.
MiniMax-Hailuo-2.3-FastMiniMax$0.190per permintaanMiniMax Hailuo 2.3 Fast — tingkat yang mengutamakan kecepatan dan biaya dari Hailuo 2.3, berfokus pada gambar ke video dan pada realisme gerak fisik, pada 24 fps, dengan 768p tersedia sebagai klip 6 detik atau 10 detik dan 1080p pada 6 detik. 768p 6 detik = $0,19.
MiniMax-M2MiniMax$0.3000$1.2000per 1M tokensMiniMax M2 — generasi yang pertama kali dirilis MiniMax untuk pemrograman yang efisien dan alur kerja agen, dengan jendela konteks 204.800 token. Ini adalah tingkat tertua yang masih dilayani vendor dan satu-satunya di antara tingkat lawas yang tidak memiliki varian highspeed. Hanya teks: API menerima blok konten teks dan pemanggilan alat, bukan gambar atau video. Model yang ditetapkan vendor sebagai model lawas, dan menurut MiniMax masih dilayani secara normal; tetap disediakan demi kompatibilitas versi, karena pelanggan mengunci nama model pada satu generasi. Bobot terbukanya dipublikasikan di Hugging Face.
MiniMax-M2.1MiniMax$0.3000$1.2000per 1M tokensMiniMax M2.1 — model teks yang dibangun untuk pemrograman multibahasa, dengan jendela konteks 204.800 token dan keluaran sekitar 60 token per detik. Hanya teks: API menerima blok konten teks dan pemanggilan alat, bukan gambar atau video. Model yang ditetapkan vendor sebagai model lawas, dan menurut MiniMax masih dilayani secara normal; tetap disediakan demi kompatibilitas versi, karena pelanggan mengunci nama model pada satu generasi. Bobot terbukanya dipublikasikan di Hugging Face.
MiniMax-M2.5MiniMax$0.3000$1.2000$0.1950$0.7800per 1M tokensMiniMax M2.5 — model teks yang diposisikan vendor pada performa papan atas dengan harga rendah untuk tugas kompleks, dengan jendela konteks 204.800 token dan keluaran sekitar 60 token per detik. Hanya teks: API menerima blok konten teks dan pemanggilan alat, bukan gambar atau video. Model yang ditetapkan vendor sebagai model lawas, dan menurut MiniMax masih dilayani secara normal; tetap disediakan demi kompatibilitas versi, karena pelanggan mengunci nama model pada satu generasi. Bobot terbukanya dipublikasikan di Hugging Face.
MiniMax-M2.7MiniMax$0.3000$1.2000$0.1950$0.7800per 1M tokensMiniMax M2.7 — model teks untuk obrolan, pemrograman, pekerjaan kantor, dan tugas agentik, dengan jendela konteks 204.800 token dan keluaran sekitar 60 token per detik. Hanya teks: API menerima blok konten teks dan pemanggilan alat, bukan gambar atau video. Mendukung pemanggilan alat; thinking selalu aktif dan tidak dapat dimatikan.
MiniMax-M2.7-highspeedMiniMax$0.6000$2.4000per 1M tokensMiniMax M2.7 Highspeed — model M2.7 yang sama, disajikan pada sekitar 100 token per detik untuk pemrograman berlatensi rendah dan alur kerja agen, dengan jendela konteks 204.800 token. Hanya teks: API menerima blok konten teks dan pemanggilan alat, bukan gambar atau video. Mendukung pemanggilan alat; thinking selalu aktif dan tidak dapat dimatikan.
MiniMax-M3MiniMax$0.3000$1.2000$0.1950$0.7800per 1M tokensMiniMax M3 — model pemrograman multimodal terdepan untuk penalaran agentik, penggunaan alat, dan eksekusi tugas terstruktur, dengan jendela konteks 1.000.000 token. Model ini menerima teks, gambar hingga 10 MB, dan video hingga 50 MB secara sebaris atau 512 MB melalui Files API, lalu mengembalikan teks. Mendukung pemanggilan alat, dengan thinking bersifat opsional alih-alih selalu aktif.
minimax-music-v3.0MiniMax$0.1481per permintaanMiniMax Music 3.0 — pembuatan lagu utuh secara sinkron dari prompt musik dan lirik opsional, dengan mode instrumental, optimasi lirik, dan keluaran audio berupa URL atau hex. Prompt mendukung hingga 2.000 karakter dan lirik hingga 3.500 karakter.
muse-spark-1.2-contributorMeta$0.1000$0.2000$0.0650$0.1300per 1M tokensMeta dapat menggunakan prompt yang dikirim ke model ini beserta keluaran yang dihasilkannya untuk melatih model Meta berikutnya sesuai ketentuan tingkat Contributor, jadi jangan kirim data sensitif atau rahasia. Meta Muse Spark 1.2 (tingkat Contributor) adalah versi Muse Spark sebelumnya. Ini adalah model penalaran: model selalu bernalar sebelum menjawab, dan penalaran tidak dapat dimatikan. reasoning_effort dapat disetel ke minimal, low, medium, high, atau xhigh; none dan max tidak didukung pada tingkat ini, dan jika reasoning_effort tidak disertakan, model memilih tingkatnya sendiri. Token penalaran ditagih sebagai keluaran, dan masukan dari cache ditagih dengan tarif masukan dari cache. Pencarian web tidak tersedia, dan permintaan yang menyertakan pencarian web atau jenis alat apa pun selain function akan ditolak. Kirim permintaan ke /v1/chat/completions.
muse-spark-1.3-contributorMeta$0.1000$0.2000$0.0650$0.1300per 1M tokensMeta dapat menggunakan prompt yang dikirim ke model ini beserta keluaran yang dihasilkannya untuk melatih model Meta berikutnya sesuai ketentuan tingkat Contributor, jadi jangan kirim data sensitif atau rahasia. Meta Muse Spark 1.3 (tingkat Contributor) adalah versi Muse Spark terbaru, yang disetel untuk alur kerja agentik dan pemrograman. Ini adalah model penalaran: model selalu bernalar sebelum menjawab, dan penalaran tidak dapat dimatikan. reasoning_effort dapat disetel ke minimal, low, medium, high, atau xhigh; none dan max tidak didukung pada tingkat ini, dan jika reasoning_effort tidak disertakan, model memilih tingkatnya sendiri. Token penalaran ditagih sebagai keluaran, dan masukan dari cache ditagih dengan tarif masukan dari cache. Pencarian web tidak tersedia, dan permintaan yang menyertakan pencarian web atau jenis alat apa pun selain function akan ditolak. Kirim permintaan ke /v1/chat/completions.
qwen-audio-3.0-asr-flashAlibaba$0.1260per jam audioAlibaba Qwen-Audio-3.0-ASR-Flash — pengenalan ucapan non-realtime di atas fondasi Qwen-Audio 3.0, mencakup 30 bahasa dan tujuh kelompok dialek besar bahasa Tionghoa (Mandarin, Wu, Xiang, Gan, Hakka, Min, Yue) serta lebih dari 20 aksen daerah. Prediksi tanda baca dan normalisasi teks mengubah angka, tanggal, dan nominal ke bentuk baku; kata kunci penting dan konteks prompt meningkatkan akurasi pada kosakata khusus. Model ini menerima audio hingga 5 menit atau 2 GB per permintaan.
qwen-audio-3.0-realtime-flashAlibaba$0.2900$0.8800per 1M tokensAlibaba Qwen-Audio-3.0-Realtime-Flash — percakapan suara dupleks penuh di atas sesi WebSocket, dari lini yang oleh vendor ditempatkan di peringkat pertama secara keseluruhan pada kategori Speech-to-Speech Artificial Analysis. Tingkat cepat ini disetel untuk latensi respons ujung ke ujung terendah. Terhubung lewat GET /v1/realtime. Masukan dan keluaran audio ditagih pada tarifnya sendiri, jauh di atas tarif teks.
qwen-audio-3.0-realtime-plusAlibaba$1.0000$8.0000per 1M tokensAlibaba Qwen-Audio-3.0-Realtime-Plus — percakapan suara dupleks penuh di atas sesi WebSocket; vendor menempatkannya di peringkat pertama secara keseluruhan pada kategori Speech-to-Speech Artificial Analysis. Tingkat standar mengutamakan kualitas jawaban: penalaran atas ucapan tetap utuh, sementara inferensi paralel dan streaming ujung ke ujung menahan latensi respons tetap rendah. Terhubung lewat GET /v1/realtime. Masukan dan keluaran audio ditagih pada tarifnya sendiri, jauh di atas tarif teks.
qwen-audio-3.0-tts-flashAlibaba$0.1800per 10 ribu karakterAlibaba Qwen-Audio-3.0-TTS-Flash — sintesis ucapan di atas fondasi Qwen-Audio 3.0 yang disetel untuk interaksi realtime, mencakup lebih banyak bahasa minoritas dan dialek Tionghoa dibanding generasi sebelumnya. Kepatuhan pada instruksi gaya bebas dan tag berbutir halus mengarahkan emosi, nada, karakter, kecepatan, dan volume; model ini lebih tahan terhadap derau dan gaung. Tingkat flash mengoptimalkan sintesis berlatensi rendah, untuk asisten suara, dialog langsung, dan layanan pelanggan. Ditagih per karakter (1 token = 1 karakter). Dapat diakses baik sebagai panggilan permintaan/tanggapan maupun sebagai sesi WebSocket realtime.
qwen-audio-3.0-tts-plusAlibaba$0.2500per 10 ribu karakterAlibaba Qwen-Audio-3.0-TTS-Plus — sintesis ucapan berkualitas tinggi di atas fondasi Qwen-Audio 3.0, mencakup lebih banyak bahasa minoritas dan dialek Tionghoa dibanding generasi sebelumnya, dengan pelafalan dialek yang jauh lebih autentik. Kepatuhan pada instruksi gaya bebas dan tag berbutir halus mengarahkan emosi, nada, karakter, kecepatan, volume, dan gaya; model ini lebih tahan terhadap derau dan gaung. Tingkat plus mengutamakan kesetiaan dan daya ekspresi, untuk produksi konten, buku audio, sulih suara, dan suara merek. Ditagih per karakter (1 token = 1 karakter). Dapat diakses baik sebagai panggilan permintaan/tanggapan maupun sebagai sesi WebSocket realtime.
qwen-flash-characterAlibaba$0.0500$0.4000per 1M tokensAlibaba Qwen-Flash-Character — model bermain peran multibahasa dari Qwen (versi dinamis; vendor mengumumkan pembaruan terlebih dahulu), disetel untuk percakapan karakter yang setia pada persona: kepatuhan instruksi dalam batas persona, memajukan topik, mendengarkan, dan empati. Jendela konteks 8.192 token, teks masuk dan teks keluar. Tanpa mode berpikir, pemanggilan alat, alat bawaan, atau output terstruktur. Cache sesi milik vendor berlaku secara otomatis di sisi vendor.
qwen-image-3.0Alibaba$0.030per permintaanAlibaba Qwen-Image-3.0 — tingkat standar dari lini gambar Qwen, mencakup pembuatan gambar dari teks dan penyuntingan gambar, dengan perenderan akurat untuk huruf kecil (hingga 10 px), 12 bahasa, dan lebih dari 20 jenis huruf. Model ini menerima prompt hingga 4.500 token, mengembalikan hingga 6 gambar per permintaan, dan menghasilkan hingga 2048x2048.
qwen-image-3.0-proAlibaba$0.040per permintaanAlibaba Qwen-Image-3.0-Pro — tingkat profesional dari lini gambar Qwen, dibangun untuk menghasilkan tata letak padat informasi (koran, storyboard, menu, lembar ujian) dalam sekali pembuatan. Model ini menerima prompt hingga 4.500 token, merender huruf 10 px, 12 bahasa, dan lebih dari 20 jenis huruf, mengembalikan hingga 6 gambar per permintaan, serta menghasilkan hingga 2048x2048. Pembuatan gambar dari teks dan penyuntingan gambar.
qwen-mt-image-2.0Alibaba$0.0006per permintaanAlibaba Qwen-MT-Image 2.0 — penerjemahan gambar: menulis ulang teks di dalam gambar ke bahasa lain sambil mempertahankan tata letak, fon, dan karya visual di sekitarnya, untuk 55 bahasa ke segala arah. Panggil model ini di endpoint images/edits OpenAI dengan URL gambar http(s) publik di kolom image, ditambah target_lang (wajib; kode ISO atau nama bahasa dalam bahasa Inggris) dan source_lang (opsional, bawaan auto); prompt diwajibkan oleh bentuk endpoint tetapi diabaikan. Objek ext opsional meneruskan domainHint, sensitives, terminologies, dan config.imageSegment milik vendor tanpa diubah. Mengembalikan satu URL JPG berukuran sama yang berlaku selama 24 jam. Masukan 15-8192 px per sisi, rasio aspek 1:10 hingga 10:1, hingga 100 MB; unggahan dan data URL tidak diterima. Vendor membatasi laju model ini hingga 1 permintaan per menit dan tetap menagih satu gambar meskipun tidak menemukan teks yang dapat diterjemahkan (gambar asli dikembalikan). Dilayani pada satu kanal resmi Alibaba saja.
qwen3-asr-flashAlibaba$0.1260per jam audioAlibaba Qwen3-ASR-Flash — pengenalan suara yang dibangun di atas model fondasi Qwen3, yang menentukan sendiri bahasa yang diucapkan dan mentranskripsi 11 bahasa; lini Qwen3-ASR mendokumentasikan bahasa Mandarin bersama Sichuan, Min Nan, Wu, dan Kanton, serta berbagai aksen bahasa Inggris. Model ini menerima aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma, dan wmv hingga 5 menit dan 10 MB per permintaan; masukan pcm harus 16 kHz dan format lain diubah sampelnya ke 16 kHz sebelum pengenalan.
qwen3-tts-flashAlibaba$0.1100per 10 ribu karakterAlibaba Qwen3-TTS-Flash — text-to-speech berlatensi rendah dengan 17 suara bawaan yang ekspresif, mencakup bahasa Mandarin, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia, ditambah mode otomatis untuk teks bercampur banyak bahasa serta keluaran dalam dialek. Model ini menerima hingga 512 token teks per permintaan dan mendukung sintesis streaming maupun non-streaming.
qwen3.5-livetranslate-flash-realtimeAlibaba$0.5500$20.0000per 1M tokensAlibaba Qwen3.5-LiveTranslate-Flash-Realtime — penerjemahan simultan audio dan video di atas sesi WebSocket, dibangun pada fondasi Qwen3.5-Omni dengan penyelarasan lintas bahasa dan lintas modalitas serta penguatan visual. Mendengar 60 bahasa dan berbicara 29. Terhubung lewat GET /v1/realtime. Struktur harganya berbeda dari model realtime lain: **tidak ada tarif untuk masukan teks** — masukan ditagih sebagai audio atau gambar, dan keluaran sebagai teks atau audio.
qwen3.5-ocrAlibaba$0.1000$0.3500per 1M tokensAlibaba Qwen3.5-OCR — anggota OCR dari lini Qwen3.5, dibangun untuk penguraian dokumen, pelokalan teks, dan ekstraksi informasi kunci; vendor menyebut peningkatan mencolok pada dokumen identitas dan surat izin di dunia nyata. Model ini menerima teks dan gambar sebagai masukan dan mengembalikan teks.
qwen3.5-omni-flashAlibaba$0.4000$2.2000per 1M tokensAlibaba Qwen3.5-Omni-Flash — tingkat cepat dari lini omnimodal Qwen3.5, yang memahami dan bercakap lintas teks, gambar, audio, dan video bersuara. Model ini menangani lebih dari 10 jam audio dan lebih dari 400 detik video bersuara 720P (1 FPS) per percakapan, dengan masukan audio lebih dari 60 bahasa dan keluaran suara lebih dari 30 bahasa. Masukan audio dan keluaran yang mengandung audio ditagih pada tarifnya sendiri, di atas tarif teks.
qwen3.5-omni-flash-realtimeAlibaba$0.5500$3.3000per 1M tokensAlibaba Qwen3.5-Omni-Flash-Realtime — tingkat realtime cepat dari lini omnimodal Qwen3.5, dipertahankan terbuka sebagai sesi WebSocket untuk percakapan suara dupleks penuh. Model ini memahami teks, gambar, audio, dan video bersuara, menerima audio dalam lebih dari 60 bahasa dan berbicara dalam lebih dari 30, dengan suara yang dapat diarahkan, pencarian web, pemanggilan fungsi kompleks, dan interupsi semantik. Terhubung lewat GET /v1/realtime. Masukan audio dan keluaran yang mengandung audio ditagih pada tarifnya sendiri, jauh di atas tarif teks.
qwen3.5-omni-plusAlibaba$1.4000$8.3000per 1M tokensAlibaba Qwen3.5-Omni-Plus — tingkat berperforma tinggi dari lini omnimodal Qwen3.5, yang memahami dan bercakap lintas teks, gambar, audio, dan video bersuara. Model ini menangani lebih dari 10 jam audio dan lebih dari 400 detik video bersuara 720P (1 FPS) per percakapan, dengan masukan audio lebih dari 60 bahasa dan keluaran suara lebih dari 30 bahasa. Jendela konteks 65.536 token. Masukan audio dan keluaran yang mengandung audio ditagih pada tarifnya sendiri, di atas tarif teks.
qwen3.5-omni-plus-realtimeAlibaba$2.1000$12.4000per 1M tokensAlibaba Qwen3.5-Omni-Plus-Realtime — tingkat realtime dari lini omnimodal Qwen3.5, dipertahankan terbuka sebagai sesi WebSocket untuk percakapan suara dupleks penuh. Model ini memahami teks, gambar, audio, dan video bersuara, menerima audio dalam lebih dari 60 bahasa dan berbicara dalam lebih dari 30, dengan suara yang dapat diarahkan, pencarian web, pemanggilan fungsi kompleks, dan interupsi semantik. Terhubung lewat GET /v1/realtime. Masukan audio dan keluaran yang mengandung audio ditagih pada tarifnya sendiri, jauh di atas tarif teks.
qwen3.6-27bAlibaba$0.6000$3.6000per 1M tokensAlibaba Qwen3.6-27B — model dense visi-bahasa native berparameter 27 miliar dari lini Qwen3.6, berbobot terbuka, yang oleh vendor ditempatkan di atas 3.5-27B pada pemrograman agentik, STEM dan penalaran, serta pada kecerdasan spasial, pelokalan dan deteksi objek. Jendela konteks 262.144 token. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks.
qwen3.6-35b-a3bAlibaba$0.3750$2.2500per 1M tokensAlibaba Qwen3.6-35B-A3B — model MoE visi-bahasa native berparameter 35 miliar dengan sekitar 3 miliar parameter aktif, berbobot terbuka, memadukan atensi linear dengan campuran pakar renggang demi efisiensi inferensi yang lebih tinggi. Jendela konteks 262.144 token, hingga 65.536 token keluaran, dan hingga 256 gambar atau 64 video per permintaan. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks. Mendukung pemanggilan fungsi, perkakas bawaan, dan keluaran terstruktur.
qwen3.6-flashAlibaba$0.2500$1.5000per 1M tokensAlibaba Qwen3.6-Flash — model visi-bahasa cepat yang oleh vendor disorot untuk pemrograman agentik dan untuk kecerdasan spasial, dengan peningkatan mencolok dalam pelokalan dan deteksi objek. Jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 65.536 token keluaran, dan anggaran 131.072 token untuk rantai penalaran. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks. Mendukung pemanggilan fungsi dan caching konteks.
qwen3.6-plusAlibaba$0.5000$3.0000$0.4250$2.5500per 1M tokensAlibaba Qwen3.6-Plus — model seimbang untuk penalaran umum dan penggunaan alat, dengan jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 65.536 token keluaran, dan anggaran 81.920 token untuk rantai penalaran. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks. Mendukung pemanggilan fungsi, output terstruktur, pencarian web, penyelesaian prefiks, dan caching konteks.
qwen3.7-flashAlibaba$0.0300$0.1300per 1M tokensAlibaba Qwen3.7-Flash — tingkat cepat dari lini visi-bahasa native Qwen3.7, yang oleh vendor disorot untuk kerja agen multimodal (agen pencarian dan agen CI) serta untuk eksekusi tugas ujung ke ujung yang lebih stabil dibanding 3.6-Flash. Jendela konteks 1.000.000 token, hingga 65.536 token keluaran, dan hingga 256 gambar atau 64 video per permintaan. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks. Mendukung mode berpikir, pemanggilan fungsi, perkakas bawaan, dan keluaran terstruktur. Harganya terbagi dalam tiga pita konteks, sehingga permintaan berkonteks panjang berbiaya lebih tinggi per token daripada yang pendek.
qwen3.7-maxAlibaba$2.5000$7.5000per 1M tokensAlibaba Qwen3.7-Max — model unggulan sumber tertutup yang diposisikan untuk pemrograman, pekerjaan perkantoran dan produktivitas, serta eksekusi otonom jangka panjang, dengan jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 131.072 token keluaran, dan anggaran 262.144 token untuk rantai penalaran. Teks masuk, teks keluar. Mendukung pemanggilan fungsi, output terstruktur, dan caching konteks.
qwen3.7-plusAlibaba$0.4000$1.6000$0.3000$1.2000per 1M tokensAlibaba Qwen3.7-Plus — model agen hibrida multimodal yang mengindra pemandangan dunia nyata, membaca layar dan mengendalikan antarmuka grafis, membuat kode dari referensi visual, serta melakukan navigasi ujung-ke-ujung di dalam aplikasi seluler. Jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 131.072 token keluaran, dan anggaran 262.144 token untuk rantai penalaran. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks; mendukung pemanggilan fungsi, output terstruktur, dan caching konteks.
qwen3.8-2.4t-a95bAlibaba$2.0000$6.0000per 1M tokensAlibaba Qwen3.8-2.4T-A95B — rilis berbobot terbuka dari model unggulan Qwen3.8, sebuah MoE renggang dengan total 2,4 triliun parameter dan sekitar 95 miliar aktif per langkah, memakai rancangan atensi hibrida. Jendela konteks 1.000.000 token. Model ini menerima teks sebagai masukan dan mengembalikan teks. Mode berpikir dan tanpa berpikir ditagih dengan tarif yang sama, dan harga keluaran sudah mencakup rantai penalaran.
qwen3.8-27bAlibaba$0.5000$3.0000per 1M tokensAlibaba Qwen3.8-27B — model dense visi-bahasa native berparameter 27 miliar dari lini Qwen3.8, berbobot terbuka, yang oleh vendor ditempatkan di atas 3.6-27B pada tugas pemrograman dan perkantoran, baik pada modalitas teks maupun visual. Jendela konteks 1.000.000 token. Model ini menerima teks dan gambar sebagai masukan dan mengembalikan teks. Mode berpikir dan tanpa berpikir ditagih dengan tarif yang sama, dan harga keluaran sudah mencakup rantai penalaran.
qwen3.8-flashAlibaba$0.1500$0.4700$0.1125$0.3525per 1M tokensAlibaba Qwen3.8-Flash — tingkat cepat dari lini Qwen3.8, model multimodal secara native yang diposisikan vendor untuk bantuan pemrograman, kolaborasi agen, serta pemahaman gambar dan dokumen pada throughput tinggi. Jendela konteks 1.000.000 token. Model ini menerima teks, gambar, dan video sebagai masukan dan mengembalikan teks. Mendukung mode berpikir, pemanggilan fungsi, perkakas bawaan, dan keluaran terstruktur. Berbicara baik protokol OpenAI maupun Anthropic Messages.
qwen3.8-maxAlibaba$2.0000$6.0000$1.9000$5.7000per 1M tokensAlibaba Qwen3.8-Max — model MoE unggulan berparameter 2,4 triliun dan yang paling mumpuni di keluarga Qwen, dengan vendor menyebut peningkatan besar pada pemrograman dan produktivitas perkantoran. Jendela konteks 1.000.000 token (maksimum 991.808 token masukan, 983.616 dalam mode berpikir), hingga 131.072 token keluaran, dan anggaran 262.144 token untuk rantai penalaran. Model ini menerima masukan teks, gambar, dan video lalu mengembalikan teks; mendukung pemanggilan fungsi, output terstruktur, dan caching konteks.
qwen3.8-max-0902Alibaba$2.0000$6.0000per 1M tokensAlibaba Qwen3.8-Max-0902 — snapshot 2026-09-02 dari Qwen3.8-Max (alias vendor qwen3.8-max-2026-09-02), model MoE unggulan berparameter 2,4 triliun, dibekukan agar integrasi dapat mengunci build yang persis ini; vendor menyebut kemampuan pemrograman yang lebih mendalam untuk proyek rekayasa yang kompleks dan pengembangan otonom jangka panjang. Jendela konteks 1.000.000 token, hingga 131.072 token keluaran; menerima masukan teks, gambar, dan video lalu mengembalikan teks; mendukung mode berpikir, pemanggilan alat, dan output terstruktur. Nama dinamis qwen3.8-max berpindah ke build yang lebih baru setiap kali vendor merilisnya — kunci nama ini untuk tetap berada di build ini. Harganya sama persis dengan qwen3.8-max.
speech-2.8-hdMiniMax$1.0000per 10 ribu karakterMiniMax speech-2.8-hd — tingkat definisi tinggi dari lini suara 2.8, diposisikan untuk penyampaian yang sangat realistis dengan tag suara, mencakup 40 bahasa dan 7 emosi. Nada, kecepatan bicara, volume, laju sampel, bitrate, dan format keluaran dapat dikonfigurasi per permintaan, dan sintesis teks panjang menerima hingga 1 juta karakter secara asinkron atau 10.000 karakter melalui antarmuka streaming.
speech-2.8-turboMiniMax$0.6000per 10 ribu karakterMiniMax speech-2.8-turbo — tingkat berlatensi rendah dari lini suara 2.8, yang menukar penyampaian sangat realistis milik model HD dengan sintesis yang lebih cepat namun tetap mengalir alami. Model ini mencakup 40 bahasa dan 7 emosi yang sama, dengan nada, kecepatan bicara, volume, laju sampel, bitrate, dan format keluaran yang dapat dikonfigurasi, serta menerima hingga 1 juta karakter secara asinkron atau 10.000 karakter melalui antarmuka streaming.
step-3.5-flashStepFun$0.1000$0.3000per 1M tokensStepFun step-3.5-flash — model penalaran khusus teks dengan konteks 256K, ditujukan untuk logika, matematika, rekayasa perangkat lunak, dan riset mendalam, di mana kualitas penalaran harus dibarengi eksekusi yang cepat dan andal. Kedalaman penalaran dipilih per permintaan melalui reasoning_effort (low / medium / high). Mendukung pemanggilan alat, output terstruktur JSON Schema, streaming, dan caching prompt. Untuk masukan gambar atau video, gunakan step-3.7-flash.
step-3.5-flash-2603StepFun$0.1000$0.3000per 1M tokensStepFun step-3.5-flash-2603 — snapshot 256K dari step-3.5-flash yang disetel untuk agen, dioptimalkan bagi efisiensi token dan mode operasi dengan inferensi rendah. Parameter reasoning_effort-nya hanya menerima low dan high, sedangkan model dasarnya menerima tiga tingkat, sehingga kode yang mengirim medium harus disesuaikan. Hanya teks; mendukung pemanggilan alat, output terstruktur JSON Schema, streaming, dan caching prompt.
step-3.7-flashStepFun$0.2000$1.1500per 1M tokensStepFun step-3.7-flash — MoE renggang dengan total 198B parameter dan 11B parameter aktif, konteks asli 256K, serta pemahaman asli atas gambar dan video di samping teks. Kedalaman penalaran dipilih per permintaan melalui reasoning_effort (low / medium / high), dan model ini mendukung pemanggilan alat multi-langkah yang andal, output terstruktur JSON Schema, streaming, serta caching prompt. Disetel untuk beban kerja agen dan pemrograman. Pada /v1/responses, kirimkan seluruh percakapan dalam array input pada setiap giliran: tidak ada status percakapan yang disimpan di upstream, sehingga permintaan yang menyertakan previous_response_id atau conversation akan ditolak.
step-5-previewStepFun$1.0000$2.7000per 1M tokensStepFun step-5-preview — model andalan baru StepFun untuk pemrograman dan pekerjaan pengetahuan profesional, dirilis sebagai pratinjau. Konteks 1M token dengan output hingga 64K token, serta pemahaman asli atas gambar dan video di samping teks. Penalaran selalu aktif: hasilnya dikembalikan sebagai reasoning_content di /v1/chat/completions dan sebagai blok thinking di /v1/messages, ditagih sebagai output, dan memakai jatah max_tokens, sehingga batas beberapa ratus token bisa habis seluruhnya untuk penalaran tanpa mengembalikan teks; sisakan ruang yang lega. Kedalamannya dipilih per permintaan melalui reasoning_effort (low / medium / high). Mendukung pemanggilan alat multi-langkah, output terstruktur JSON Mode dan JSON Schema, streaming, serta caching prompt. Dibuat untuk analisis dokumen panjang, rekayasa perangkat lunak, dan pekerjaan agen multi-langkah. Pada /v1/responses, kirimkan seluruh percakapan dalam array input pada setiap giliran: tidak ada status percakapan yang disimpan di upstream, sehingga permintaan yang menyertakan previous_response_id atau conversation akan ditolak.
step-audio-2StepFun$1.4815$10.3704per 1M tokensStepFun step-audio-2 — model suara ujung-ke-ujung yang mengonsumsi audio secara langsung alih-alih bekerja dari transkrip, sehingga nada dan cara penyampaian tetap terbawa ke dalam pemahaman model. Ditagih per token, memakai tarif masukan lini StepAudio 2.5 dengan tarif keluaran yang lebih tinggi. StepFun tidak menerbitkan halaman kapabilitas terpisah untuk model ini; lihat dokumentasi audio platform untuk mengetahui set parameter yang berlaku.
step-tts-2StepFun$0.4148per 10 ribu karakterStepFun step-tts-2 — sintesis suara ujung-ke-ujung berbasis NTP yang dibangun untuk mereproduksi aksen secara akurat. Model ini berbicara bahasa Mandarin, Inggris, campuran Mandarin-Inggris, dan Jepang, ditambah Kanton dan Sichuan. Emosi dan gaya penyampaian diarahkan lewat label berbahasa alami, dan kloning suara zero-shot memerlukan sekitar 10 detik audio referensi, dengan kendali emosi dan gaya yang ikut terbawa ke suara hasil kloning tanpa biaya tambahan. Menghasilkan wav, mp3, flac, opus, atau pcm.
stepaudio-2-asr-proStepFun$0.2963per jam audioStepFun StepAudio 2 ASR Pro — model pengenalan suara 32B parameter, pilihan yang mengutamakan akurasi di lini ASR StepFun, sementara stepaudio-2.5-asr adalah pilihan yang mengutamakan kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
stepaudio-2.5-asrStepFun$0.0220per jam audioStepFun StepAudio 2.5 ASR — model pengenalan suara 4B parameter yang dibangun di atas Multi-Token Prediction, mentranskripsi lima menit audio dalam waktu sekitar satu detik (RTF sekitar 0,0053). Dioptimalkan untuk bahasa Mandarin dan Inggris. Menyertakan normalisasi teks terbalik, identifikasi pembicara, dan pemisahan dua kanal untuk rekaman panggilan maupun rapat. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
stepaudio-2.5-asr-streamStepFun$0.1800per jam audioStepFun StepAudio 2.5 ASR Stream — edisi pengenalan streaming dari StepAudio 2.5 ASR (model pengenal suara 4B parameter yang dibangun di atas Multi-Token Prediction, dioptimalkan untuk bahasa Mandarin dan Inggris), sekaligus model streaming yang direkomendasikan StepFun. Di gateway ini, model ini dipanggil dengan cara yang sama seperti model transkripsi lainnya: unggah rekaman utuh ke /v1/audio/transcriptions, dan seluruh transkrip dikembalikan dalam satu respons setelah pengenalan selesai; hasil parsial tidak dikirim kembali secara streaming, dan biaya per menit audionya lebih tinggi daripada stepaudio-2.5-asr. Normalisasi teks terbalik diterapkan. Hanya menerima unggahan wav PCM 16-bit dan ogg (mp3 tidak diterima); keluaran transkrip tidak ditagih.
stepaudio-2.5-chatStepFun$1.5000$3.5000per 1M tokensStepFun StepAudio 2.5 Chat — model pemahaman suara ujung-ke-ujung: menerima audio atau teks dan mengembalikan teks, membaca sinyal paralinguistik seperti keraguan dan tawa langsung dari bentuk gelombangnya, bukan dari transkrip. Mendukung kustomisasi persona yang luas, mencakup karakter, kebiasaan bicara, dan rentang emosi. Audio dikirim sebagai bagian konten input_audio pada endpoint chat completions. Untuk jawaban dalam bentuk suara, gunakan model TTS.
stepaudio-2.5-realtimeStepFun$1.5000$10.0000per 1M tokensStepFun StepAudio 2.5 Realtime — model ucapan-ke-ucapan ujung ke ujung melalui sesi WebSocket di GET /v1/realtime: masukan audio atau teks secara streaming, keluaran audio streaming beserta transkrip teks, dengan deteksi aktivitas suara di sisi server dan dukungan interupsi. Audio berformat PCM16, 24 kHz, mono; vendor mencantumkan bahasa Inggris sebagai bahasa yang didukung. Tetapkan suara secara eksplisit di session.update: hanya suara yang tercantum dalam daftar StepFun yang diterima.
stepaudio-2.5-ttsStepFun$0.8500per 10 ribu karakterStepFun StepAudio 2.5 TTS — text-to-speech kontekstual yang membawa pemahaman melintasi seluruh alur pembuatan alih-alih memperlakukan gaya penyampaian sebagai pascaproses. Suara, emosi, dan tempo diarahkan dalam bahasa alami pada dua tingkat: konteks global untuk keseluruhan permintaan dan konteks sebaris untuk setiap bagian teks. Kloning suara zero-shot memerlukan sekitar 3 detik audio referensi dan mewarisi seluruh perangkat kendali kontekstual. Menerima hingga 1000 karakter per permintaan; menghasilkan wav, mp3, flac, atau opus.
stepaudio-3-asr-maxStepFun$0.4000per jam audioStepFun StepAudio 3 ASR Max — model pengenalan suara terbesar dari StepFun, dibangun di atas model bahasa besar sehingga pengenalannya memanfaatkan konteks dan pengetahuan domain: lebih kuat pada nama diri, nama obat, istilah teknis, dan homofon, pada campuran bahasa Mandarin dan Inggris, dialek, dan audio panjang, serta pada ucapan berbisik, sangat cepat, atau berlatar musik, termasuk lirik yang dinyanyikan. Kirim file audio ke POST /v1/audio/transcriptions (WAV, MP3, atau OGG); ditagih berdasarkan durasi audio.
stepaudio-3-chat-previewStepFun$0.0000per 1M tokensStepFun StepAudio 3 Chat (pratinjau) — model dialog pemahaman suara di POST /v1/chat/completions: kirim ucapan sebagai bagian konten input_audio, atau teks, giliran demi giliran, lalu terima balasan berupa teks, dengan dukungan pemanggilan alat. Gratis selama masa pratinjau StepFun berlangsung. Saat masa gratis berakhir, StepFun mempensiunkan nama pratinjau dan merilis versi berbayar, jadi perhitungkan bahwa ID model ini akan berhenti berfungsi pada saat itu.
stepaudio-3-gen-previewStepFun$0.000per permintaanStepFun StepAudio 3 Audio Generation (pratinjau) — pembuatan audio berbasis naskah dari seri StepAudio 3 di POST /v1/audio/generate: tentukan peran dengan nama dan deskripsi suara dalam bahasa sehari-hari, tulis naskah baris demi baris (baris dalam kurung siku menjadi efek suara atau musik latar), tambahkan instruksi keseluruhan, lalu audio jadi dikembalikan sebagai byte (mp3 secara default). Suara dibentuk dari deskripsi peran; nama suara bawaan tidak diterima. Field permintaan mengikuti referensi API StepFun. Gratis selama masa pratinjau StepFun berlangsung. Saat masa gratis berakhir, StepFun mempensiunkan nama pratinjau dan merilis versi berbayar, jadi perhitungkan bahwa ID model ini akan berhenti berfungsi pada saat itu.
stepaudio-3-music-previewStepFun$0.000per permintaanStepFun StepAudio 3 Music (pratinjau) — pembuatan musik dari teks dari seri StepAudio 3 di POST /v1/music/generations, dengan bentuk permintaan yang sama seperti minimax-music-v3.0: jelaskan gaya di prompt, tambahkan lirik di lyrics atau atur is_instrumental, lalu lagu jadi dikembalikan sebagai hex di data.audio (mp3 secara default; wav, flac, opus, atau pcm melalui audio_setting.format). Panggilannya sinkron dan satu lagu biasanya memakan waktu satu hingga beberapa menit, jadi atur timeout klien minimal 600 detik. Cover lagu dan iringan untuk vokal yang diunggah tidak tersedia. Gratis selama masa pratinjau StepFun berlangsung. Saat masa gratis berakhir, StepFun mempensiunkan nama pratinjau dan merilis versi berbayar, jadi perhitungkan bahwa ID model ini akan berhenti berfungsi pada saat itu.
stepaudio-3-realtime-previewStepFun$0.0000per 1M tokensStepFun StepAudio 3 Realtime (pratinjau) — model suara dupleks penuh dari StepFun melalui sesi WebSocket di GET /v1/realtime: interupsi dan pergantian giliran bicara yang alami, penalaran adaptif sambil berbicara, serta pemanggilan alat selama percakapan. Gratis selama masa pratinjau StepFun berlangsung. Saat masa gratis berakhir, StepFun mempensiunkan nama pratinjau dan merilis versi berbayar, jadi perhitungkan bahwa ID model ini akan berhenti berfungsi.
stepaudio-3-ttsStepFun$0.3600per 10 ribu karakterStepFun StepAudio 3 TTS — text-to-speech dari seri StepAudio 3 yang dibuat untuk penyampaian setara manusia: warna suara, intonasi, ritme, dan napas mengikuti ucapan alami, termasuk tawa, keraguan, dan ralat ucapan, sementara emosi dan nada berubah menyesuaikan isi. Dilayani melalui POST /v1/audio/speech dan ditagih per karakter teks masukan.
vidu-video-q3Vidu$0.060per detikVidu Q3 — model referensi ke video dengan subjek yang konsisten, peralihan adegan yang cerdas, dan keluaran audio/video yang tersinkronisasi. Menerima gambar referensi atau subjek bernama; menghasilkan 3–16 detik pada 540P, 720P, atau 1080P.
vidu-video-q3-proVidu$0.100per detikVidu Q3 Pro — pembuatan video yang berorientasi pada kualitas, mencakup teks ke video, gambar ke video, dan pembuatan dari bingkai awal/akhir, dengan keluaran audio/video yang tersinkronisasi. Menghasilkan 1–16 detik pada 540P, 720P, atau 1080P; referensi ke video tidak didukung oleh SKU ini.
vidu-video-q3-turboVidu$0.055per detikVidu Q3 Turbo — tingkat Q3 yang cepat dan hemat biaya untuk pembuatan video dari teks, gambar, bingkai awal/akhir, dan referensi, dengan keluaran audio/video yang tersinkronisasi. Menghasilkan 1–16 detik untuk mode normal atau 3–16 detik untuk mode referensi pada 540P–1080P.
wan2.7-i2vAlibaba$0.100per detikAlibaba Wan 2.7 Image-to-Video — mencakup pembuatan dari bingkai pertama, transisi antara bingkai pertama dan terakhir, serta kelanjutan dari klip yang sudah ada. Model ini menghasilkan 720P atau 1080P (bawaan 1080P) berdurasi 2-15 detik, bawaan 5 detik, dari prompt hingga 5.000 karakter (prompt negatif hingga 500 karakter). Trek mp3 atau wav berdurasi 2-30 detik dapat dikirimkan sebagai driving_audio; tanpa audio, model membuat musik latar atau efek suara yang sesuai, audio yang lebih panjang dari klip akan dipotong, dan audio yang lebih pendek menyisakan bagian akhir tanpa suara.
wan2.7-imageAlibaba$0.030per permintaanAlibaba Wan2.7 Image — teks ke gambar, penyuntingan gambar, pembuatan dengan banyak gambar referensi, penyuntingan interaktif, serta penulisan teks dan kepatuhan instruksi yang kuat.
wan2.7-image-proAlibaba$0.075per permintaanAlibaba Wan 2.7 Image Pro — tingkat profesional dari lini gambar Wan 2.7, mencakup teks ke gambar, set gambar berurutan, penyuntingan gambar, dan pembuatan dengan banyak gambar referensi, dengan kepatuhan prompt yang lebih baik. Teks ke gambar mencapai 4K (4096x4096) dengan tingkat 1K dan 2K serta ukuran khusus mulai 768x768; mode penyuntingan dan mode berurutan dibatasi 2K. Model ini menerima hingga 9 gambar referensi (JPEG, JPG, PNG, BMP, WEBP; 240-8.000 px per sisi, 20 MB masing-masing), rasio aspek dari 1:8 hingga 8:1, dan prompt hingga 5.000 karakter. Menghasilkan PNG.
wan2.7-r2vAlibaba$0.100per detikAlibaba Wan2.7 (R2V) — pembuatan video berbasis referensi, hingga 5 referensi campuran gambar/video ditambah referensi timbre audio, dengan konsistensi karakter/properti/adegan yang lebih kuat.
wan2.7-t2vAlibaba$0.100per detikAlibaba Wan2.7 (T2V) — teks ke video dengan akting yang ditingkatkan, emosi yang halus, aksi yang intens, dan potongan kamera yang dramatis. Menghasilkan MP4 H.264 pada 720P atau 1080P berdurasi 2-15 detik (bawaan 5 detik) dalam 16:9, 9:16, 1:1, 4:3, atau 3:4, dari prompt hingga 5.000 karakter. Audio disertakan secara bawaan: tanpa audio_url, model menyusun sendiri musik latar atau efek suara yang sesuai, atau sebagai gantinya dapat dikirimkan trek wav atau mp3 berdurasi 2-30 detik.
wan2.7-videoeditAlibaba$0.100per detikAlibaba Wan2.7 VideoEdit — penyuntingan video dengan bahasa alami, lokal maupun global, penggantian elemen lewat gambar referensi, serta peniruan gerak, efek, dan kerja kamera.
wan3.0-videoAlibaba$0.100$0.085per detikAlibaba Wan3.0 (Video) — model video terpadu yang menyatukan teks ke video, gambar ke video, dan referensi ke video di balik satu endpoint. Menghasilkan MP4 H.264 pada 480P, 720P, atau 1080P, berdurasi hingga 30 detik, dari sebuah prompt dan URL gambar bingkai pertama yang opsional. Ditagih per detik video yang dihasilkan mengikuti tangga harga vendor sendiri: 720P adalah tarif dasar, 480P ditagih setengahnya, dan 1080P dua kali lipatnya. Permintaan yang tidak menyebutkan resolusi akan diproduksi model pada 1080P dan ditagih pada tingkat tersebut. Masukan video referensi dan audio referensi ada pada model vendor tetapi tidak dibawa pada endpoint ini.
wan3.0-video-primeAlibaba$0.140per detikAlibaba Wan3.0 Video Prime — tingkat cepat dari model video terpadu Wan 3.0, dengan kemampuan setara tingkat standar pada kecepatan pembuatan yang lebih tinggi. Teks ke video, gambar ke video dari bingkai pertama/terakhir, dan gambar referensi ke video (hingga 10 gambar referensi) di balik satu endpoint; MP4 H.264 pada 480P, 720P, atau 1080P, 2 hingga 30 detik, 30 fps, dengan audio secara bawaan. Ditagih per detik video yang dihasilkan mengikuti tangga harga vendor: 720P adalah tarif dasar, 480P berbiaya sedikit di bawah setengahnya, dan 1080P dua kali lipatnya. Permintaan yang tidak menyebutkan resolusi dirender pada 1080P bawaan vendor dan ditagih pada tingkat tersebut. Masukan video referensi, audio referensi, berkas, dan tautan web tidak diterima di gateway ini, dan durasi pintar (-1) ditolak; setel duration secara eksplisit. Dilayani pada satu kanal resmi Alibaba saja.