中国 AI モデルの料金

ChinaAPI は DeepSeek、Qwen、GLM、Kimi をはじめとする中国 AI モデルを、OpenAI 互換のゲートウェイ https://api.chinaapi.ai/v1 から提供します。料金はすべて米ドル建てで、上流のサプライヤーが提示する単位で表示しています。同じ一覧は /api/pricing から JSON でも取得できます。

60 個のモデルは初回チャージ後により安い Paid 価格になります。金額を問わず一度チャージすれば、アカウント全体に自動適用されます。Paid価格は標準価格より安い場合にのみ記載しています。

公開モデルの料金
モデルサプライヤー入力出力Paid価格(入力)Paid価格(出力)単位説明
agnes-2.5-flashAgnes AI$0.00001M tokens あたりAgnes AI Agnes 2.5 Flash — 512K の入力コンテキストと 65.5K の参考出力上限を備えた高速なマルチモーダルエージェントモデル。チャット、ストリーミング、ツール呼び出し、コーディング、推論、マルチターン対話、画像理解、エージェントワークフローに対応します。
agnes-2.5-proAgnes AI$0.4500$0.90001M tokens あたりAgnes AI Agnes 2.5 Pro — 2.5 Pro Alpha ベンチマークモデルの商用安定版で、1M の入力コンテキストと 65,536 トークンの最大出力を備えた有料の推論モデル。高度なコーディング、科学的推論、ロングコンテキストの分析、エージェントワークフロー、画像理解に対応します。
agnes-2.5-pro-betaAgnes AI$0.1000$0.30001M tokens あたりAgnes AI Agnes 2.5 Pro Beta — 2.5 Pro の価格を大きく下回る独自の Beta 価格で課金される Pro ファミリーの低価格ティアで、同じリクエスト形式、テキストプロトコル、コンテキスト上限を備えた有料の推論モデル。高度なコーディング、科学的推論、ロングコンテキストの分析、エージェントワークフロー、画像理解に対応します。
agnes-3.0-flashAgnes AI$0.00001M tokens あたりAgnes AI Agnes 3.0 Flash — エージェント型コーディングとツール駆動のタスク実行に向けて作られた、ベンダーの新世代言語モデル。512K の入力コンテキストと 65,536 トークンの出力上限を備えます。テキストと画像 URL を入力として受け付けてテキストを返し、ストリーミング、関数呼び出しと多段階のツールオーケストレーション、長時間タスクでの指示追従に対応します。OpenAI 互換の chat エンドポイント、Responses エンドポイント、Anthropic 互換の Messages エンドポイントから利用できます。chat エンドポイントでは、chat_template_kwargs.enable_thinking を true に設定すると Thinking モードが有効になります。2026-09-21 の計測では、このフィールドを指定しないリクエストで推論トークンは返されませんでした。Thinking を有効にした場合は推論トークンが max_tokens に算入されるため、max_tokens は回答だけでなく推論の分も見込んで設定してください。
agnes-image-2.0-flashAgnes AI$0.0001回あたりAgnes AI Image 2.0 Flash — テキストから画像生成、画像から画像生成、複数画像の合成に対応する高速な画像生成・編集モデル。生成結果は URL または Base64 データとして受け取れます。
agnes-image-2.1-flashAgnes AI$0.0001回あたりAgnes AI Image 2.1 Flash — 情報密度の高いシーンに向けたディテール重視の画像生成・編集モデル。テキストから画像生成、画像から画像生成、複数画像の合成に対応し、1K〜4K の柔軟なサイズとアスペクト比を選べます。
agnes-image-2.5-flashAgnes AI$0.0001回あたりAgnes AI Image 2.5 Flash — 生成、編集、合成、ディテール描写、プロンプト追従で Image 2.1 Flash を上回る最新世代の画像モデル。テキストから画像生成、画像から画像生成、複数画像の合成に対応し、1K〜4K の柔軟なサイズとアスペクト比を選べます。
agnes-video-2.5Agnes AI$0.0251秒あたりAgnes AI Video 2.5 — テキスト、先頭・最終キーフレーム、あるいは画像・音声・動画の参照から、720P、960P または 2K で 4〜12 秒のクリップを生成する有料の非同期動画生成モデル。
agnes-video-2.5-flashAgnes AI$0.0001秒あたりAgnes AI Video 2.5 Flash — Video 2.5 の 720P 専用バリアント。テキスト、先頭・最終キーフレーム、あるいは画像と音声の参照から 4〜12 秒の動画を生成し、同じ非同期タスク API を使います。
claude-fable-5Anthropic$10.0000$50.0000$7.0000$35.00001M tokens あたりAnthropic Claude Fable 5 — 野心的で長時間にわたるナレッジワークとコーディングに向けた、Anthropic の一般提供モデルで最も高性能なモデル。数日規模のエージェントタスク、複雑なソフトウェアエンジニアリング、ディープリサーチ、ドキュメントと視覚の推論、能動的な自己検証のために設計されています。
claude-fable-5-1Anthropic$10.0000$50.0000$8.0000$40.00001M tokens あたりAnthropic Claude Fable 5.1 — 野心的で長時間にわたるナレッジワークとコーディングに向けた、Anthropic の最新の一般提供フラッグシップ。数日規模のエージェントタスク、複雑なソフトウェアエンジニアリング、ディープリサーチ、ドキュメントと視覚の推論、能動的な自己検証のために設計されています。キャッシュ読み取りは入力価格の 2.5% で、同世代では最も低い水準です。
claude-haiku-4-5Anthropic$1.0000$5.0000$0.7000$3.50001M tokens あたりAnthropic Claude Haiku 4.5 — 最先端に迫る知能を備えた最速の Claude モデルで、分類、抽出、ルーティングといった大量・低遅延の業務向けに設計されています。テキストと画像の入力、拡張思考、200,000 トークンのコンテキストウィンドウ、最大 64,000 トークンの出力に対応します。
claude-haiku-5-5Anthropic$0.1000$0.5000$0.0600$0.30001M tokens あたりAnthropic Claude Haiku 5.5 — 分類、抽出、ルーティング、エージェント向けの高速で低コストなテキスト・画像理解モデル。コンテキストは 1,000,000 トークン、出力は最大 128,000 トークンです。適応型思考の既定値は medium。Messages の output_config.effort で low、medium、high、xhigh、max を選択できます。ストリーミングと強制ツール呼び出しに対応します。入力が 100,000 トークンを超えると、出力とキャッシュを含むリクエスト全体に長文料金が適用されます。
claude-opus-4-5Anthropic$5.0000$25.0000$3.5000$17.50001M tokens あたりAnthropic Claude Opus 4.5 — Anthropic が現在はレガシーモデルの一つとして掲載しつつ、このモデルバージョンを使い続けたいワークロードのために提供を続けている Opus 4.5 リリース。テキストと画像の入力、拡張思考、200,000 トークンのコンテキストウィンドウ、最大 64,000 トークンの出力に対応します。
claude-opus-4-6Anthropic$5.0000$25.0000$3.5000$17.50001M tokens あたりAnthropic Claude Opus 4.6 — 複雑な推論とエージェント業務に向けた Opus 世代のモデルで、標準価格のまま 1,000,000 トークンのコンテキストウィンドウと最大 128,000 トークンの出力を備えます。テキストと画像の入力と適応的な思考に対応し、4.7 より前のトークナイザーを使用します。
claude-opus-4-7Anthropic$5.0000$25.0000$3.5000$17.50001M tokens あたりAnthropic Claude Opus 4.7 — 難度の高いソフトウェアエンジニアリングと、複雑で長時間実行されるエージェントタスクに向けた高度な推論モデル。厳密な指示追従、自己検証、信頼できるツール利用、そしてインターフェース、画像、ドキュメント、専門業務にわたる高解像度の視覚を重視しています。
claude-opus-4-8Anthropic$5.0000$25.0000$3.5000$17.50001M tokens あたりAnthropic Claude Opus 4.8 — コーディング、エージェントワークフロー、専門的な分析、長時間の作業に向けた高性能な推論モデル。Opus 4.7 と比べて信頼性、判断力、ツール利用の効率、コンピュータ操作、マルチモーダルなドキュメント推論が向上し、1,000,000 トークンのコンテキストウィンドウに対応します。
claude-opus-5Anthropic$5.0000$25.0000$3.0000$15.00001M tokens あたりAnthropic Claude Opus 5 — 複雑なエージェント型コーディングと企業業務に向けた深い推論モデル。長時間タスク、コードレビュー、ドキュメントワークフロー、視覚、マルチエージェント連携で大幅に向上しています。1,000,000 トークンのコンテキストウィンドウを持ち、最大 128,000 トークンの出力に対応し、適応的な思考をデフォルトで有効にします。
claude-opus-5-5Anthropic$4.0000$20.0000$2.4000$12.00001M tokens あたりAnthropic Claude Opus 5.5 — 長時間にわたるエージェント型コーディングとナレッジワークに向けて設計され、Claude Opus 5 より低価格です。テキストと画像を入力でき、1,000,000 トークンのコンテキストウィンドウを持ち、最大 128,000 トークンの出力に対応します。適応的な思考は常に有効で、effort パラメータで推論の深さを制御します(デフォルトは medium)。
claude-sonnet-4-5Anthropic$3.0000$15.0000$2.1000$10.50001M tokens あたりAnthropic Claude Sonnet 4.5 — Anthropic が現在はレガシーモデルの一つとして掲載しつつ、このモデルバージョンを使い続けたいワークロードのために提供を続けている Sonnet 4.5 リリース。テキストと画像の入力、拡張思考、200,000 トークンのコンテキストウィンドウ、最大 64,000 トークンの出力に対応します。
claude-sonnet-4-6Anthropic$3.0000$15.0000$2.1000$10.50001M tokens あたりAnthropic Claude Sonnet 4.6 — バランス型の Sonnet 世代のモデルで、標準価格のまま 1,000,000 トークンのコンテキストウィンドウと最大 128,000 トークンの出力を提供します。テキストと画像の入力と適応的な思考に対応し、4.7 より前のトークナイザーを使用するため、同じテキストでもトークン数は 4.7 以降のモデルよりおよそ 30% 少なくなり、トークン単価は同じです。
claude-sonnet-5Anthropic$2.0000$10.0000$1.4000$7.00001M tokens あたりAnthropic Claude Sonnet 5 — コーディング、エージェント、企業ワークフローに向けて最先端の知能と速度を両立させた実運用モデル。計画を立て、ブラウザやターミナルのツールを使い、推論、ナレッジワーク、ソフトウェアエンジニアリングのタスクを自律的に遂行できます。
claude-sonnet-5-5Anthropic$2.0000$10.0000$1.2000$6.00001M tokens あたりAnthropic Claude Sonnet 5.5 — コーディング、エージェント、本番ワークロードに向けて速度と知能を両立させたモデル。テキストと画像を入力でき、1,000,000 トークンのコンテキストウィンドウを持ち、最大 128,000 トークンの出力に対応します。適応的な思考はデフォルトで有効で、思考トークンは出力として課金されます。output_config.effort で low、medium、high、xhigh、max から選択できます(デフォルトは high)。事前の思考をオフにするには、type を between_tools にした thinking を送信してください。これは effort が high 以下の場合にのみ使えます。type に disabled を指定すると拒否されます。temperature、top_p、top_k をデフォルト以外の値に設定するとエラーになり、tool_choice の any または tool でツール呼び出しを強制した場合も同様です。思考ブロックはモデルと会話に紐づいているため、以降のターンでは変更せずにそのまま返してください。
cogview-4Zhipu AI$0.010$0.00951回あたりZhipu CogView-4 — CogView の第四世代にあたるテキストから画像生成モデル。複数の出力解像度に対応し、ベースと高精細の両方の提供ティアを備えます。中国語と英語のプロンプトを受け付け、画像内に文字を描画できます。生成できる画像はリクエストごとに一枚です。
deepseek-flashDeepSeek$0.1500$0.60001M tokens あたりDeepSeek V4.1 Flash — 新規連携向けの正式なモデル ID です。テキストと画像の入力、思考モードと非思考モード、ツール呼び出し、JSON 出力に対応します。廃止された deepseek-v4-flash と deepseek-v4-flash-vision-exp の ID は互換エイリアスとして残り、同じ Flash 価格のままこのモデルが応答します。1M トークンのコンテキストウィンドウと最大 384K の出力を備えます。/v1/responses では毎ターン、会話全体を input 配列で送信してください。上流側では会話の状態が保持されないため、previous_response_id または conversation を含むリクエストは拒否されます。
deepseek-v4-proDeepSeek$0.6600$1.98001M tokens あたりDeepSeek V4 Pro 0813 — コーディング、推論、エージェント業務に向けた DeepSeek V4 の高性能ティア。1M トークンのコンテキストウィンドウと最大 384K の出力を備えます。思考モード(既定)と非思考モードの両方で動作し、ツール呼び出しと JSON 出力に対応します。入力も出力もテキストのみです。/v1/responses では毎ターン、会話全体を input 配列で送信してください。上流側では会話の状態が保持されないため、previous_response_id または conversation を含むリクエストは拒否されます。
doubao-seed-2-1-pro-260628ByteDance$0.8889$4.44441M tokens あたりByteDance Doubao Seed 2.1 Pro — 実運用向けの Doubao フラッグシップエージェントモデル。深い思考、テキスト生成、マルチモーダル理解、ツール呼び出し、構造化出力に対応し、構造化出力にはベンダーが json_schema モードを推奨しています。256K のコンテキストウィンドウ(最大入力 256K)、最大 256K トークンの出力(既定 4K)、256K の思考トークン予算を備えます。テキスト、画像、動画を受け付け、テキストを返します。2.1 系列に音声理解は挙げられていません。プレフィックスキャッシュとセッションキャッシュを含む、暗黙的および明示的なコンテキストキャッシュに対応します。
doubao-seed-2-1-turbo-260628ByteDance$0.4444$2.22221M tokens あたりByteDance Doubao Seed 2.1 Turbo — Seed 2.1 系列の低遅延レーン。Pro と同じ枠を共有し、256K のコンテキストウィンドウ(最大入力 256K)、最大 256K トークンの出力(既定 4K)、256K の思考トークン予算を備えます。深い思考、テキスト生成、マルチモーダル理解、ツール呼び出し、構造化出力に対応しますが、Pro のような json_schema の推奨はありません。テキスト、画像、動画を受け付け、テキストを返します。2.1 系列に音声理解は挙げられていません。暗黙的および明示的なコンテキストキャッシュに対応します。
doubao-seed-character-260628ByteDance$0.1185$0.29631M tokens あたりByteDance Doubao Seed Character (260628) — ペルソナ主導のマルチターン会話に向けた Doubao のキャラクター対話モデルで、doubao-1-5-pro-32k-character の後継系列です。このビルドには、ベンダーが付けた深い思考、テキスト生成、マルチモーダル理解、ツール呼び出し、構造化出力(json_schema 推奨)の機能ラベルがあります。128K のコンテキストウィンドウ(最大入力 96K)、最大 32K トークンの出力(既定 4K)を備えます。価格は入力長で決まり、入力 32K トークン以下のリクエストは標準料金帯、それより長いリクエストはロングコンテキスト料金帯で課金されます。ロングコンテキスト料金帯では、入力の単価が標準料金帯の 1.5 倍、出力の単価が三倍になります。
doubao-seed-evolvingByteDance$0.8889$4.44441M tokens あたりByteDance Doubao Seed Evolving — Doubao の現行のコーディング・エージェント向けフラッグシップで、ローリングリリースとして公開されています。ベンダーは日付付きのスナップショットを設けず、同じ ID のままモデルを毎週更新するため、バージョンが上がらないまま挙動や機能が変わることがあります。ベンダーが付けた深い思考、テキスト生成、マルチモーダル理解、GUI タスク処理、ツール呼び出し、構造化出力(json_schema 推奨)の機能ラベルがあります。1,024K のコンテキストウィンドウ(最大入力 1,024K)、最大 256K トークンの出力(既定 4K)を備えます。
doubao-seedance-2-0-260128ByteDance$7.00001M tokens あたりByteDance Seedance 2.0 — Seedance 2.0 系列のフラッグシップで、480p と 720p に加えて 1080p と 4K(10 bit 深度)に到達する系列唯一のモデル。24 fps、4〜15 秒。テキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、画像 1〜9 枚と合計 15 秒までの参照動画最大 3 本によるマルチモーダル参照生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールに対応します。音声参照は画像または動画と併せて指定する必要があります。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応し、最終フレームを画像として取得できます。出力解像度に応じて課金されます。
doubao-seedance-2-0-fast-260128ByteDance$5.60001M tokens あたりByteDance Seedance 2.0 Fast — 費用対効果の高い動画生成。Seedance 2.0 の機能一式を備えつつ、480p と 720p、24 fps、4〜15 秒に制限されます。テキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、画像 1〜9 枚と合計 15 秒までの参照動画最大 3 本によるマルチモーダル参照生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールに対応します。音声参照は画像または動画と併せて指定する必要があります。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応します。480p 5 秒で約 $0.26。
doubao-seedance-2-0-mini-260615ByteDance$3.50001M tokens あたりByteDance Seedance 2.0 Mini — Seedance 2.0 系列の軽量で低予算向けのティア。480p と 720p、24 fps、4〜15 秒に制限されます。文書化された機能一式は系列のほかのモデルと同じで、テキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、画像 1〜9 枚と合計 15 秒までの参照動画最大 3 本によるマルチモーダル参照生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールに対応します。音声参照は画像または動画と併せて指定する必要があります。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応します。
doubao-seedance-2-5-260628ByteDance$10.70001M tokens あたりByteDance Seedance 2.5 — Seedance の主系列モデル。1 回の生成を 24 fps で 4〜30 秒まで伸ばす一方、解像度は 480p と 720p に制限されます。マルチモーダル参照生成は画像 1〜30 枚、参照動画最大 10 本、参照音声最大 10 本(それぞれ合計 30 秒まで)に対応し、2.0 系列とは異なり音声参照を単独で使えます。ほかにテキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールにも対応します。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応します。
doubao-seedream-4-5-251128ByteDance$0.037041回あたりByteDance Doubao Seedream 4.5 — 複数画像の融合に対応したテキストから画像生成と画像から画像生成。1 枚の画像、または関連する画像の組を出力します。単一画像モードはプロンプトのみ、参照画像 1 枚、または参照画像 2〜14 枚を受け付けます。グループモード(sequential_image_generation=auto)はテキストから最大 15 枚、参照画像 1 枚から最大 14 枚、参照画像 2〜14 枚からは入力と出力の合計が 15 枚以下に収まる組を返します。2K と 4K の出力に対応し、既定では JPEG を URL または Base64 で返します。座標指定による対話的な編集は Seedream 5.0 Pro(doubao-seedream-5-0-pro-260628)でのみ利用できます。
doubao-seedream-5-0-260128ByteDance$0.032591回あたりByteDance Doubao Seedream 5.0-lite — より賢く制御しやすい創作、リアルタイム検索、被写体の一貫性を強化したテキストから画像生成と画像から画像生成(2K 以上の解像度)。
doubao-seedream-5-0-pro-260628ByteDance$0.0451回あたりByteDance Doubao Seedream 5.0 Pro — 制御可能な創作に向けたベンダー最上位の画像モデル。テキストから画像生成、単一参照および複数参照(参照画像 2〜10 枚)の画像から画像生成、座標・ボックス・矢印による対話的な編集、そして一枚の画像をベースと最大 16 のレイヤーに分けるレイヤー分解に対応します。各レイヤーはそれぞれのサイズ、z_index、バウンディングボックスとともに返されます(layer_decomposition=true を指定)。出力は単一画像のみで、グループ(連続)生成、ウェブ検索、ストリーミングには対応しません。課金は出力画像ごとで、シーンとピクセル段階によって決まります。2.61 MP 以下の単一画像が基本価格で、2.61 MP を超えると 2 倍です。レイヤー分解では返されたレイヤーごとに 0.5 倍(2.61 MP 超では 1 倍)で個別に課金され、最初の一枚を超える参照画像にはそれぞれ基本価格の 1/15 が加算されます。
fun-asr-flash-2026-06-15Alibaba$0.1260音声1時間あたりAlibaba Fun-ASR Flash (2026-06-15) — 低遅延の録音音声認識モデル。プロンプト文脈と、中国語の方言および 30 を超える言語にわたる言語の自動判定に対応します。URL、Base64、またはアップロードされた AAC/AMR/AVI/FLAC/FLV/M4A/MKV/MOV/MP3/MP4/MPEG/OGG/OPUS/WAV/WEBM/WMA/WMV の音声を受け付け、最長 5 分・最大 2 GB までです。
gemini-2.5-flash-imageGoogle$0.3000$2.5000$0.2100$1.75001M tokens あたりGoogle Gemini 2.5 Flash Image(Nano Banana)— クリエイティブなワークフローに向けた高速なネイティブ画像生成・編集モデル。テキストと画像を入力として受け付け、OpenAI 互換の chat completions エンドポイントを通じて画像を返します。入力上限は 65,536 トークン、出力上限は 32,768 トークンです。
gemini-2.5-proGoogle$1.2500$10.0000$0.8125$6.50001M tokens あたりGoogle Gemini 2.5 Pro — 1M トークンのコンテキストウィンドウを備えた 2.5 ファミリーの推論ティアモデル。200,000 トークンを超えるプロンプトは、Google 自身のルールに合わせて、リクエスト全体がベンダーのロングコンテキストレートで課金されます。
gemini-3-pro-imageGoogle$2.0000$12.0000$1.4000$8.40001M tokens あたりGoogle Gemini 3 Pro Image (Nano Banana Pro) — プロフェッショナルな画像生成と対話的な編集に向けた、推論主導のプレミアムモデル。複雑なグラフィックデザイン、高忠実度の製品モックアップ、正確な多言語テキスト描画、ブランドの一貫性、Google Search でグラウンディングした事実に基づくビジュアライゼーションを得意とします。テキストと画像を受け付けてテキストと画像を返し、思考に対応し、1K、2K、4K の出力を生成します。
gemini-3.1-flash-imageGoogle$0.5000$3.0000$0.3500$2.10001M tokens あたりGoogle Gemini 3.1 Flash Image(Nano Banana 2)— 高品質な画像生成と対話的な編集に向けた安定版の低遅延モデル。テキスト、画像、PDF を受け付け、思考と検索グラウンディングに対応し、大量生成のワークフロー向けに 0.5K、1K、2K、4K の画像を生成できます。
gemini-3.1-flash-lite-imageGoogle$0.2500$1.5000$0.1750$1.05001M tokens あたりGoogle Gemini 3.1 Flash-Lite Image(Nano Banana 2 Lite)— 大量の画像生成と高速なマルチターン編集に向けた、超低遅延で費用対効果の高いモデル。テキストと画像を受け付けて 1K の画像を生成し、思考と対話的な編集に対応します。対話的な開発者向け・コンシューマー向けアプリケーションのために設計されています。
gemini-3.5-flashGoogle$1.5000$9.0000$1.0500$6.30001M tokens あたりGoogle Gemini 3.5 Flash — 持続的なエージェント性能、高速なコーディングループ、サブエージェントの展開、長時間の多段階ワークフローに最適化された安定版のマルチモーダルモデル。テキスト、画像、動画、音声、PDF を受け付け、思考と組み込みツールに対応し、1,048,576 トークンの入力コンテキストと最大 65,536 トークンの出力を提供します。
gemini-3.6-flashGoogle$0.7500$3.7500$0.5250$2.62501M tokens あたりGoogle Gemini 3.6 Flash — エージェント用途と実世界のタスクに向けて速度と知能を両立させた安定版のマルチモーダル推論モデル。入力コンテキストは 1,048,576 トークン、出力上限は 65,536 トークンです。テキスト、画像、動画、音声、PDF を受け付け、思考、関数呼び出し、コード実行、検索グラウンディング、構造化出力、Computer Use(プレビュー)に対応します。 価格に関する注記:このモデルの Google の定価は 2026 年 12 月 31 日までプロモーション価格となっており、1M トークンあたり入力 $0.75 / 出力 $3.75 / キャッシュ入力 $0.075 です。2027 年 1 月 1 日からベンダーの定価は $1.50 / $7.50 / $0.15 に戻り、当サイトの価格も同じ比率でそれに追随します。
gemini-3.7-flashGoogle$0.7500$3.7500$0.5250$2.62501M tokens あたりGoogle Gemini 3.7 Flash — Flash ティアの最新マルチモーダル推論モデルで、ベンダーのプロモーション期間中は 3.6 Flash と同じ価格です。テキスト、画像、動画、音声、PDF を受け付け、思考、関数呼び出し、コード実行、検索グラウンディング、構造化出力に対応します。 価格に関する注記:このモデルの Google の定価は 2026 年 12 月 31 日までプロモーション価格となっており、1M トークンあたり入力 $0.75 / 出力 $3.75 / キャッシュ入力 $0.075 です。2027 年 1 月 1 日からベンダーの定価は $1.50 / $7.50 / $0.15 に戻り、当サイトの価格も同じ比率でそれに追随します。
gemini-3.8-flashGoogle$0.7500$3.7500$0.4875$2.43751M tokens あたりGoogle Gemini 3.8 Flash — Google の高速なマルチモーダル Gemini モデルで、当サイトでは OpenAI 互換と Gemini ネイティブの両方のエンドポイントから呼び出せます。標準のトークン価格は、1M トークンあたり入力 $0.75、キャッシュ入力 $0.075、出力 $3.75 です。
glm-5Zhipu AI$1.0000$3.2000$0.9500$3.04001M tokens あたりZhipu GLM-5 — 総パラメータ 744B・アクティブ 40B の MoE モデル。28.5T トークンで学習し、DeepSeek Sparse Attention を採用しています。200K のコンテキストウィンドウと最大 128K トークンの出力を備え、入力も出力もテキストのみです。複数の思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。
glm-5-turboZhipu AI$1.2000$4.0000$1.1400$3.80001M tokens あたりZhipu GLM-5-Turbo — スループット重視の GLM-5 バリアントで、エージェントワークフロー向けに最適化されています。多段階タスクでのツールとスキルの呼び出しがより安定し、複雑で長い連鎖の指示への対応が向上し、スケジュール実行や長時間実行のタスクにも対応します。200K のコンテキストウィンドウ、最大 128K トークンの出力、入力も出力もテキストのみ。思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。
glm-5.1Zhipu AI$1.4000$4.4000$1.1200$3.52001M tokens あたりZhipu GLM-5.1 — 長時間の自律作業のために作られたフラッグシップ基盤モデル。ベンダーは、計画、実行、テスト、反復的な最適化にわたって、単一のタスクを最長 8 時間無人で連続実行できると記載しています。200K のコンテキストウィンドウ、最大 128K トークンの出力、入力も出力もテキストのみ。複数の思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。
glm-5.2Zhipu AI$1.4000$4.4000$1.1200$3.52001M tokens あたりZhipu GLM-5.2 — 長時間のコーディングエージェント業務に特化したフラッグシップ基盤モデル。コンテキスト長を伸ばしただけではなく、数か月に及ぶ専用の学習によって作られています。1M トークンのコンテキストウィンドウと最大 128K トークンの出力を備え、入力も出力もテキストのみです。複数の思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。
glm-5.3Zhipu AI$1.4000$4.4000$0.9100$2.86001M tokens あたりZhipu GLM-5.3 — GLM-5.2 と同じベースからポストトレーニングされたコーディング・エージェント向けのフラッグシップモデル。Zhipu 社内のコーディングベンチで 50% の向上、Terminal-Bench 3.0 と Agents' Last Exam でオープンソース SOTA、CyberGym の脆弱性発見で最先端の結果を示し、1M トークンのコンテキストウィンドウと最大 128K トークンの出力を備えます。入力も出力もテキストのみです。複数の思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。
glm-5.3-flashZhipu AI$0.1500$0.5000$0.1350$0.45001M tokens あたりZhipu GLM-5.3-Flash — GLM-5 系列で初めてネイティブにマルチモーダル化されたモデルで、同系列の低コストなフロンティアティア。総パラメータ 320B・アクティブ 18B で、線形アテンションとスパースアテンションのハイブリッド構成により、GLM-5.3 と比べてアテンション計算量と KV キャッシュを数分の一に抑え、GLM-4.5 と比べてアクティブパラメータと層数をともに半減させています。テキスト、画像、動画を受け付け、テキストを返します(ベンダーはファイル入力も掲げていますが、当サイトでは未検証のため提供していません)。1M トークンのコンテキストウィンドウと最大 128K トークンの出力を備えます。思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。モデルが自身のレンダリング結果を確認しながら反復するフロントエンド、ゲーム、3D といったビジュアルコーディングを想定した位置づけです。
glm-5v-turboZhipu AI$1.2000$4.0000$1.1400$3.80001M tokens あたりZhipu GLM-5V-Turbo — 画像、動画、ファイル、コーディング、ツール駆動のエージェントワークフローに向けたマルチモーダル推論モデル。
glm-imageZhipu AI$0.015$0.014251回あたりZhipu GLM-Image — 自己回帰型の理解と拡散型のデコードを組み合わせたハイブリッドアーキテクチャに基づく画像生成モデルで、中国製チップ(Huawei Ascend)上でエンドツーエンドに学習された初の SOTA マルチモーダルモデルです。キーワードではなく指示として読み取り、プロンプトが明示していない細部も補います。テキスト描画(特に中国語の文字)と知識集約型のシーンが大きく強化されています。生成できる画像はリクエストごとに一枚です。
glm-ttsZhipu AI$0.3500$0.31501万文字あたりZhipu GLM-TTS — GRPO 強化学習を用いた 2 段階生成アーキテクチャに基づく音声合成モデル。明示的なマークアップを求めず、前後の文脈から感情と抑揚を推定します。組み込み音声を 7 種(既定の tongtong、xiaochen、chuichui、jam、kazi、douji、luodo)備え、速度と音量を調整できます。1 リクエストにつき最大 1024 文字を受け付け、初回フレームまでの遅延 400 ms 未満でストリーミングします。出力は wav または pcm で、推奨サンプルレートは 24 kHz です。ストリーミングは pcm のみです。
gpt-5.5OpenAI$5.0000$30.0000$3.2500$19.50001M tokens あたりOpenAI GPT-5.5 — 複雑なコーディングと専門業務に向けた最先端の推論モデル。テキストと画像の入力、関数呼び出しと組み込みツール、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力、そして none から xhigh までの推論強度に対応します。
gpt-5.6-lunaOpenAI$0.2000$1.2000$0.1700$1.02001M tokens あたりOpenAI GPT-5.6 Luna — GPT-5.6 で最も高速かつ低価格なティア。推論、視覚、ツール利用を保ちながら、コスト重視の大量処理ワークロードに最適化されています。テキストと画像の入力、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力に対応します。
gpt-5.6-solOpenAI$5.0000$30.0000$3.2500$19.50001M tokens あたりOpenAI GPT-5.6 Sol — 最先端の推論、複雑な専門業務、コーディング、科学、サイバーセキュリティ、長時間のエージェントワークフローに向けた GPT-5.6 のフラッグシップモデル。テキストと画像の入力、組み込みツール、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力、そしてこのファミリーで最も深い推論設定に対応します。
gpt-5.6-terraOpenAI$2.0000$12.0000$1.6000$9.60001M tokens あたりOpenAI GPT-5.6 Terra — 日々の専門業務に向けたバランス型の GPT-5.6 モデル。Sol より低コストで高い知能とコーディングエージェント性能を提供します。テキストと画像の入力、組み込みツール、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力に対応します。
gpt-6-astraOpenAI$10.0000$50.0000$6.5000$32.50001M tokens あたりOpenAI GPT-6 Astra — 最も困難なエンドツーエンドの作業(複雑な推論、コーディング、コンピュータ操作、リサーチ、ドキュメント作成)に向けて作られた、OpenAI で最も高性能なモデル。テキストと画像の入力、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力、そして xhigh と max までの推論強度設定に対応します。
gpt-6-lunaOpenAI$0.1000$0.5000$0.0650$0.32501M tokens あたりOpenAI GPT-6 Luna — 用途の定まった大量処理タスクに向けて作られた、OpenAI で最も効率的なモデル。テキストと画像の入力、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力に対応し、推論強度は none から max まで設定できます(デフォルトは medium)。ツール呼び出しには /v1/responses を使ってください。/v1/chat/completions では、reasoning_effort を none に設定した場合にのみ関数呼び出しが使えます。/v1/responses では毎ターン、会話全体を input 配列で送信してください。previous_response_id または conversation を含むリクエストは拒否されます。
gpt-6-solOpenAI$2.0000$10.0000$1.3000$6.50001M tokens あたりOpenAI GPT-6 Sol — 複雑なコーディングとエージェント型ワークフローに向けて作られたモデル。テキストと画像の入力、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力に対応し、推論強度は none から max まで設定できます(デフォルトは medium)。ツール呼び出しには /v1/responses を使ってください。/v1/chat/completions では、reasoning_effort を none に設定した場合にのみ関数呼び出しが使えます。/v1/responses では毎ターン、会話全体を input 配列で送信してください。previous_response_id または conversation を含むリクエストは拒否されます。
gpt-6.1-solOpenAI$2.0000$10.0000$1.3000$6.50001M tokens あたりOpenAI GPT-6.1 Sol — 複雑なコーディング、コンピュータ操作、専門的な業務で GPT-6 Astra に迫る性能を、より低いコストで提供するモデル。テキストと画像の入力、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力に対応します。推論強度は low から max まで設定でき(デフォルトは medium)、none と minimal には対応していません。推論トークンは出力として課金されます。入力が 272,000 トークンを超えると、そのリクエストのすべてのトークンがロングコンテキストレートで課金されます。ツール呼び出しには /v1/responses を使ってください。/v1/chat/completions はツール呼び出しに対応していません。/v1/responses では毎ターン、会話全体を input 配列で送信してください。previous_response_id または conversation を含むリクエストは拒否されます。
gpt-image-2OpenAI$5.0000$30.0000$4.0000$24.00001M tokens あたりOpenAI GPT Image 2 — 高速で高品質な出力に向けた最先端の画像生成・編集モデル。テキストと画像を入力として受け付け、柔軟な画像サイズと高忠実度の画像入力に対応し、呼び出し単位ではなくトークン単位で課金されます。1M トークンあたり、テキスト入力 $5、キャッシュ済みテキスト入力 $1.25、画像入力 $8、画像出力 $30 です。
gpt-image-2.5-flareOpenAI$5.0000$30.0000$4.0000$24.00001M tokens あたりOpenAI GPT Image 2.5 Flare — OpenAI の GPT Image 2.5 系列に属する画像生成・編集モデル。Flare と gpt-image-2.5-sunburst は同一モデルのエイリアスではなく別々のビルドで、同じ価格で販売されています。公開リーダーボードでは両者が別々にスコア付けされています。標準のトークン価格は、1M トークンあたりテキスト入力 $5、キャッシュ入力 $1.25、画像入力 $8、画像出力 $30 です。
gpt-image-2.5-sunburstOpenAI$5.0000$30.0000$4.0000$24.00001M tokens あたりOpenAI GPT Image 2.5 Sunburst — OpenAI の GPT Image 2.5 系列に属する画像生成・編集モデル。Sunburst と gpt-image-2.5-flare は同一モデルのエイリアスではなく別々のビルドで、同じ価格で販売されています。公開リーダーボードでは両者が別々にスコア付けされています。標準のトークン価格は、1M トークンあたりテキスト入力 $5、キャッシュ入力 $1.25、画像入力 $8、画像出力 $30 です。
grok-4.7xAI$2.0000$6.0000$0.8000$2.40001M tokens あたりxAI Grok 4.7 — コーディング、エージェント型タスク、ナレッジワークに向けて作られたフロンティアモデル。テキストと画像の入力に対応し、500,000 トークンのコンテキストウィンドウを備えます。推論はオフにできません。reasoning_effort で low、medium、high、xhigh から選択でき(デフォルトは high)、推論トークンは出力として課金されます。プロンプトが 200,000 トークンに達すると、そのリクエストのすべてのトークンがロングコンテキストレートで課金されます。使えるのは function ツールのみです。xAI のサーバーサイドツール(Web 検索、X 検索、コード実行など)は利用できず、これらを含むリクエストは拒否されます。/v1/responses では毎ターン、会話全体を input 配列で送信し、以前のレスポンスに含まれる暗号化された推論アイテムを変更せずにそのまま返してください。previous_response_id または conversation を含むリクエストは拒否されます。
happyhorse-1.1-i2vAlibaba$0.1401秒あたりAlibaba HappyHorse 1.1(I2V)— 質感、クリップ間の ID 一貫性、モーションの滑らかさ、音声と映像の同期を改善した画像から動画生成。720P / 1080P。
happyhorse-1.1-r2vAlibaba$0.1401秒あたりAlibaba HappyHorse 1.1(R2V)— 最大 9 枚の参照画像を使う参照画像から動画生成。被写体・シーン・スタイルの一貫性とカメラ制御に優れます。720P / 1080P。
happyhorse-1.1-t2vAlibaba$0.1401秒あたりAlibaba HappyHorse 1.1(T2V)— 意味理解、カメラ制御、ダイナミックな生成を改善したテキストから動画生成。滑らかで細部まで描き込まれ、物理的に破綻のない 720P / 1080P の動画を生成します。
hy-mt2-liteTencent$0.0440$0.17701M tokens あたりTencent HY-MT2 Lite — OpenAI Chat Completions プロトコルで利用できる、低遅延・低コスト重視の多言語翻訳ティア。入力は最大 4K トークン、出力は最大 4K トークンで、テキスト専用です。
hy-mt2-plusTencent$0.0740$0.29501M tokens あたりTencent HY-MT2 Plus — OpenAI Chat Completions プロトコルで利用できる、指示追従型の多言語翻訳ティア。入力は最大 4K トークン、出力は最大 4K トークンで、テキスト専用です。
hy-mt2-proTencent$0.0740$0.29501M tokens あたりTencent HY-MT2 Pro — OpenAI Chat Completions プロトコルで高品質な多言語翻訳を提供する、フラッグシップの機械翻訳ティア。入力は最大 4K トークン、出力は最大 4K トークンで、テキスト専用です。
hy3Tencent$0.1320$0.52801M tokens あたりTencent Hunyuan 3(Hy3)— 295B パラメータ(アクティブ 21B)の MoE モデルで、ネイティブ 256K コンテキストと 3 段階の思考モード(fast / low / deep)を備えます。コーディングエージェント、長文ドキュメントの理解、マルチターンの文脈保持、多段階のエージェントワークフローに強みがあります。テキスト専用。
hy4-previewTencent$0.8340$2.50101M tokens あたりTencent Hunyuan 4 preview(Hy4 preview)— 1M トークンのコンテキストウィンドウ(最大入力 960K、最大出力 64K)に、深い思考(Tencent は preserved thinking と呼んでいます)、構造化出力、関数呼び出し、プロンプトキャッシュを備えます。テキスト専用。プレビュー SKU:Tencent は一般提供版がリリースされるとプレビューモデルを廃止します。
jev-1.13TypeSafe$0.04621M tokens あたりTypeSafe Jev 1.13 — System One の意思決定モデルで、チャットモデルではありません。POST /v1/systemone に、アプリケーションの state(文字列、JSON オブジェクト、または配列)と型付きの質問のセットを送ります。質問は choice(指定した選択肢から 1 つを選ぶ)、score(定義した順序付きレベル上に位置づける)、noul(はい/いいえで答える記述が成り立つ確率)のいずれかで、すべての選択肢の確率と信頼度を備えた型付きの回答が、通常 70–500 ms で返ります。すべての質問は同じ state に対して並列に評価されるため、複数の質問を 1 回のリクエストにまとめられます。公式の TypeSafe Python / JavaScript SDK は、base URL を https://api.chinaapi.ai に設定するだけでそのまま使えます。課金は入力トークンのみで、出力は無料です。入力はテキストのみ、1 リクエストあたり最大 32K トークンです。主要言語は英語のため、ほかの言語は利用前にテストしてください。
jev-latestTypeSafe$0.04621M tokens あたりTypeSafe Jev(latest)— TypeSafe SDK が model を指定しないときに呼び出すエイリアスです。現在は jev-1.13 を提供しており、価格も同じで、POST /v1/systemone 上の System One の契約も同じです。state と型付きの choice・score・noul の質問を入力すると、確率と信頼度を備えた型付きの回答が返ります。レスポンスの model フィールドには、実際に回答したバージョンが示されます。新しい Jev のリリースへエイリアスを移すのは、価格を確認してからです。このバージョンでしきい値を調整済みの場合は、jev-1.13 を固定して使ってください。
kimi-k2.6Moonshot$0.9500$4.0000$0.7600$3.20001M tokens あたりMoonshot Kimi K2.6 — 対話、コード生成、視覚理解、エージェントタスクに向けた汎用モデル。前世代より長時間のコード記述と自律実行が強化されています。256K のコンテキストウィンドウ、既定 32,768 トークンの出力。テキスト、画像(png、jpeg、webp、gif)、動画(mp4、mov、webm ほか)を Base64 コンテンツとして受け付け、テキストを返します。思考モードは既定で有効で、無効にもできます。temperature は思考ありで 1.0、思考なしで 0.6 に固定です。
kimi-k2.7-codeMoonshot$0.9500$4.0000$0.7600$3.20001M tokens あたりMoonshot Kimi K2.7 Code — Kimi のコーディング専用モデル。ベンダーの計測では、K2.6 と比べて指示の遵守と長時間のコーディングが向上し、考えすぎが平均でおよそ 30% 減っています。256K のコンテキストウィンドウ、既定 32,768 トークンの出力。テキスト、画像、動画を Base64 コンテンツとして受け付け、テキストを返します。思考は必須で、無効にするとエラーになります。tool_choice は auto または none に限られ、reasoning_content は多段階のツール呼び出しをまたいで引き回す必要があります。
kimi-k2.7-code-highspeedMoonshot$1.9000$8.00001M tokens あたりMoonshot Kimi K2.7 Code Highspeed — K2.7 Code のスループット重視ティア。同じモデルを毎秒およそ 180 トークン、短いコンテキストでは最大 260 トークンで提供します。256K のコンテキストウィンドウ、既定 32,768 トークンの出力。テキスト、画像、動画を Base64 コンテンツとして受け付け、テキストを返します。思考は必須で、無効にするとエラーになります。tool_choice は auto または none に限られ、reasoning_content は多段階のツール呼び出しをまたいで引き回す必要があります。
kimi-k3Moonshot$3.0000$15.0000$1.9500$9.75001M tokens あたりMoonshot Kimi K3 — 2.8 兆パラメータのフラッグシップ。長時間のコーディング、エンドツーエンドのナレッジワーク、深い推論に向けて設計され、1M トークンのコンテキストウィンドウと最大 1,048,576 トークンの出力(既定は 131,072)を備えます。テキスト、Base64 エンコードされた画像、Base64 エンコードされた動画を入力として受け付け、テキストを返します。思考は常に有効で、推論強度は既定で max です。temperature は 1.0 に固定です。カスタムツール呼び出しとツールの動的読み込みに対応します。
kling-3.0-turboKuaishou$0.5601回あたりKuaishou Kling 3.0 Turbo — Kling 3.0 系列のバリューティア。プロンプトまたは先頭フレーム画像から、720P または 1080P(既定は 720P)の動画を 3〜15 秒(既定 5 秒)、16:9、9:16、1:1 で生成します。ネイティブ音声は常に含まれ、オン・オフの切り替えはありません。kling-v3 と比べると、速度とコストと引き換えに 4K ティア、最終フレーム制御、動画入力が使えません。720p 5 秒(音声あり)で約 $0.56。
kling-v3Kuaishou$0.4201回あたりKuaishou Kling 3.0 — ネイティブ音声と要素の一貫性を高めたテキストから動画生成と画像から動画生成。クリップは 3〜15 秒(既定 5 秒)、16:9、9:16、1:1 で、ティアは mode で選びます。std が 720P、pro が 1080P、4k がネイティブ 4K です。音声は sound=on によるオプトインで、既定はオフです。画像から動画生成は先頭フレームを取り、最終フレームは任意で指定できます。$0.083/秒(720p)から。
kling-v3-omniKuaishou$0.4201回あたりKling 3.0 Omni — 参照ベースの複数画像による動画生成。表示価格は std ティア(720p、5 秒、音声なし、参照動画なし)のものです。mode を指定しないリクエストは上流のデフォルトである pro ティアとなり、1.33 倍で課金されます(同じ 5 秒のクリップで約 $0.56)。4k は 5 倍で課金されます。表示価格で利用するには mode=std を渡してください。
LongCat-2.0Meituan$0.3000$1.20001M tokens あたりMeituan LongCat-2.0 — ネイティブ 1M コンテキストを備えた 1.6T パラメータのオープン MoE モデルで、エージェント型コーディングと長時間のツール利用のために設計されています。テキスト専用の推論モデル。
M2-herMiniMax$0.3000$1.20001M tokens あたりMiniMax M2-her — ロールプレイとマルチターンのチャット向けに作られた対話モデル。65,536 トークンのコンテキストウィンドウを備え、応答の上限は 2,048 トークン(max_completion_tokens)です。OpenAI 互換の chat エンドポイントでは、system / user / assistant に加えて、ベンダーの拡張メッセージロールである user_system(ユーザーのペルソナ)、group(会話の名前)、sample_message_user / sample_message_ai(応答スタイルを方向づける例示のやり取り)を受け付けます。拡張ロールのメッセージにはすべて name フィールドが必要で、ない場合ベンダーはエラー 2013 でリクエスト全体を拒否します。通常の system/user/assistant メッセージには name は不要です。テキスト専用で画像入力はできず、ツール呼び出しやキャッシュについてもベンダーのドキュメントに記載はありません。すべての呼び出しには、見えているプロンプトに加えてベンダー側のペルソナ用オーバーヘッドがおよそ 170 トークン上乗せされ、入力として課金されます。
mimo-v2.5Xiaomi$0.1400$0.28001M tokens あたりXiaomi MiMo-V2.5 — 1M コンテキストと最大 128K 出力を備えたネイティブなフルモダリティモデルで、画像、動画、音声、テキストを 1 つのモデルで理解します。深い思考、関数呼び出し、構造化出力、ウェブ検索に対応し、フルモダリティのエージェント機能を備えます。
mimo-v2.5-asrXiaomi$0.0740音声1時間あたりXiaomi MiMo v2.5 ASR — 中国語と英語に加えて中国語方言に最適化された音声認識モデル。雑音下、遠距離、複数話者の音声のほか、歌詞の書き起こしにも対応します。
mimo-v2.5-proXiaomi$0.4350$0.87001M tokens あたりXiaomi MiMo-V2.5-Pro — 1M コンテキストと最大 128K 出力を備えた 1 兆パラメータ級(アクティブ 42B)のフラッグシップで、高負荷のエージェントワークロード向けに調整されています。深い思考、関数呼び出し、構造化出力、ウェブ検索に対応します。テキスト生成のみ。mimo-v2.5 とは異なり、ベンダーの機能一覧にフルモダリティ理解は含まれていません。
mimo-v2.5-ttsXiaomi$0.00001万文字あたりXiaomi MiMo v2.5 TTS — 表現力のある音声合成モデル。組み込み音声を 8 種備え、中国語 4 種と英語 4 種(Mia、Chloe、Milo、Dean)で、中国語と英語に加えて東北方言、四川方言、河南方言、広東語のスタイルをカバーします。話し方は 2 通りで指示できます。自然言語によるスタイル指示と、基本感情・複合感情、息づかい、ため息、間の取り方を指定するインラインの音声タグで、MiMo TTS 系列ではこのモデルだけが持つ歌唱モードも含みます。出力は 24 kHz モノラルの wav または pcm16 で、低遅延ストリーミングに対応します(ストリーミングには pcm16 が必要です)。コンテキストは 8K、最大出力も 8K です。
mimo-v2.5-tts-voicecloneXiaomi$0.00001万文字あたりXiaomi MiMo v2.5 TTS VoiceClone — 音声クローンモデル。voice フィールドに参照音声をデータ URL(data:{mime};base64,...)として渡すと、学習・アノテーション・ファインチューニングの工程なしにその声で音声を合成します。MP3(audio/mpeg)または WAV を受け付け、Base64 エンコード後の文字列は 10 MB までです。参照音声の最短長は Xiaomi が公開していません。自然言語によるスタイル指示とインラインの音声タグは mimo-v2.5-tts から引き継がれますが、ストリーミングは利用できません。リクエストは互換モードで実行され、合成が完了してから返されます。
mimo-v2.5-tts-voicedesignXiaomi$0.00001万文字あたりXiaomi MiMo v2.5 TTS VoiceDesign — 音声デザインモデル。instructions フィールドに望む声を自然言語で記述すると、その設計どおりの声で音声を合成します。
mimo-v2.6-flashXiaomi$0.1400$0.2800$0.1260$0.25201M tokens あたりXiaomi MiMo-V2.6-Flash — 効率的で低コストな推論モデルで、重みはオープンに公開されています。ネイティブなフルモダリティモデルで、画像、動画、音声、テキストを 1 つのモデルで理解します。1M コンテキストと最大 128K 出力を備え、深い思考、関数呼び出し、構造化出力に対応します。コストとスループットが重要な、大量かつ日常的なプロフェッショナル業務向けです。
mimo-v2.6-proXiaomi$0.4350$0.8700$0.3915$0.78301M tokens あたりXiaomi MiMo-V2.6-Pro — Xiaomi の 1 兆パラメータ級フラッグシップ推論モデルで、重みはオープンに公開されています。ネイティブなフルモダリティモデルで、画像、動画、音声、テキストを 1 つのモデルで理解します。1M コンテキストと最大 128K 出力を備え、深い思考、関数呼び出し、構造化出力に対応します。複雑なプロジェクト、長期にわたるエージェントタスク、サイバーセキュリティ、研究業務向けです。
mimo-v2.6-pro-ultraspeedXiaomi$4.3500$8.70001M tokens あたりXiaomi MiMo-V2.6-Pro UltraSpeed — Xiaomi の超高速モードで提供される MiMo-V2.6-Pro で、出力速度は標準モデルの最大 20 倍です。リアルタイムの対話やレイテンシに敏感な本番環境に向いています。機能は mimo-v2.6-pro と同じで、画像、動画、音声、テキストのフルモダリティ理解、1M コンテキスト、最大 128K 出力、深い思考、関数呼び出し、構造化出力に対応します。料金は mimo-v2.6-pro の 10 倍です。Xiaomi はこのモードの容量を個別に割り当てているため、負荷が急に集中するとレート制限がかかることがあります。
MiniMax-H3MiniMax$0.0801秒あたりMiniMax H3(Hailuo 3.0)— 次世代のオープンな汎用マルチモーダル動画モデル。ネイティブのステレオ音声を 1 パスで生成し、768P または 2K、4〜15 秒(整数のみ)、24 fps で出力します。テキストから動画生成、先頭フレームまたは最終フレーム(あるいはその両方)からの画像から動画生成、そして画像・動画・音声を素材とする参照生成に対応し、キャラクター、モーション、カメラワーク、スタイル、声、編集のリズムを指定できます。画像から動画生成と参照生成は 1 リクエストで併用できません。入力は H.264/H.265 の動画、JPG、JPEG、PNG、WEBP、HEIC、HEIF の画像、WAV または MP3 の音声を受け付け、プロンプトは最大 7000 文字です。768P で $0.08/秒、2K で $0.13/秒。
MiniMax-Hailuo-02MiniMax$0.2801回あたりMiniMax Hailuo 02 — テキストから動画生成と画像から動画生成の両方をカバーする低価格の動画生成。24 fps で、512p と 768p は 6 秒または 10 秒のクリップ、1080p は 6 秒に対応します。512p ティアは Hailuo 系列の入り口です。
MiniMax-Hailuo-2.3MiniMax$0.2801回あたりMiniMax Hailuo 2.3 — ベンダーが指示追従性を売りにするテキストから動画生成と画像から動画生成。24 fps で、768p は 6 秒または 10 秒のクリップ、1080p は 6 秒に対応します。768p 6 秒で $0.28。
MiniMax-Hailuo-2.3-FastMiniMax$0.1901回あたりMiniMax Hailuo 2.3 Fast — Hailuo 2.3 の速度とコストを重視したティア。画像から動画生成と、物理的な動きのリアリティに焦点を当てています。24 fps で、768p は 6 秒または 10 秒のクリップ、1080p は 6 秒に対応します。768p 6 秒で $0.19。
MiniMax-M2MiniMax$0.3000$1.20001M tokens あたりMiniMax M2 — MiniMax が効率的なコーディングとエージェントワークフロー向けに最初に投入した世代で、204,800 トークンのコンテキストウィンドウを備えます。ベンダーが現在も提供しているティアの中で最も古く、レガシーティアの中で唯一 highspeed バリアントがありません。テキスト専用で、API が受け付けるのはテキストとツール呼び出しのコンテンツブロックのみです(画像や動画は不可)。ベンダーがレガシーモデルに指定していますが、MiniMax は引き続き通常どおり提供するとしています。顧客はモデル名で世代を固定して利用するので、バージョン互換性のためにカタログに残しています。オープンウェイトは Hugging Face で公開されています。
MiniMax-M2.1MiniMax$0.3000$1.20001M tokens あたりMiniMax M2.1 — 多言語プログラミング向けに作られたテキストモデル。204,800 トークンのコンテキストウィンドウを備え、出力はおよそ毎秒 60 トークンです。テキスト専用で、API が受け付けるのはテキストとツール呼び出しのコンテンツブロックのみです(画像や動画は不可)。ベンダーがレガシーモデルに指定していますが、MiniMax は引き続き通常どおり提供するとしています。顧客はモデル名で世代を固定して利用するので、バージョン互換性のためにカタログに残しています。オープンウェイトは Hugging Face で公開されています。
MiniMax-M2.5MiniMax$0.3000$1.2000$0.1950$0.78001M tokens あたりMiniMax M2.5 — ベンダーが複雑なタスク向けに、低価格でトップクラスの性能を打ち出しているテキストモデル。204,800 トークンのコンテキストウィンドウを備え、出力はおよそ毎秒 60 トークンです。テキスト専用で、API が受け付けるのはテキストとツール呼び出しのコンテンツブロックのみです(画像や動画は不可)。ベンダーがレガシーモデルに指定していますが、MiniMax は引き続き通常どおり提供するとしています。顧客はモデル名で世代を固定して利用するので、バージョン互換性のためにカタログに残しています。オープンウェイトは Hugging Face で公開されています。
MiniMax-M2.7MiniMax$0.3000$1.2000$0.1950$0.78001M tokens あたりMiniMax M2.7 — チャット、コーディング、オフィス業務、エージェントタスクに向けたテキストモデル。204,800 トークンのコンテキストウィンドウを備え、出力はおよそ毎秒 60 トークンです。テキスト専用で、API が受け付けるのはテキストとツール呼び出しのコンテンツブロックのみです(画像や動画は不可)。ツール呼び出しに対応します。思考は常時有効で、無効にできません。
MiniMax-M2.7-highspeedMiniMax$0.6000$2.40001M tokens あたりMiniMax M2.7 Highspeed — 同じ M2.7 モデルを毎秒およそ 100 トークンで提供する、低遅延のコーディングとエージェントワークフロー向けのティア。204,800 トークンのコンテキストウィンドウを備えます。テキスト専用で、API が受け付けるのはテキストとツール呼び出しのコンテンツブロックのみです(画像や動画は不可)。ツール呼び出しに対応します。思考は常時有効で、無効にできません。
MiniMax-M3MiniMax$0.3000$1.2000$0.1950$0.78001M tokens あたりMiniMax M3 — エージェント的な推論、ツール利用、構造化されたタスク実行に向けた最先端のマルチモーダルコーディングモデル。1,000,000 トークンのコンテキストウィンドウを備えます。テキスト、最大 10 MB の画像、インラインで最大 50 MB(Files API 経由なら最大 512 MB)の動画を入力として受け付け、テキストを返します。ツール呼び出しに対応し、思考は常時ではなく任意です。
minimax-music-v3.0MiniMax$0.14811回あたりMiniMax Music 3.0 — 音楽的なプロンプトと任意の歌詞から楽曲全体を同期的に生成するモデル。インストゥルメンタルモード、歌詞の最適化、URL または hex 形式での音声出力に対応します。プロンプトは最大 2,000 文字、歌詞は最大 3,500 文字まで指定できます。
muse-spark-1.2-contributorMeta$0.1000$0.2000$0.0650$0.13001M tokens あたりMeta は Contributor ティアの規約に基づき、このモデルに送信されたプロンプトと出力を今後の Meta モデルの学習に使用する場合があります。機密情報やセンシティブなデータは送信しないでください。Meta Muse Spark 1.2(Contributor ティア)は Muse Spark の 1 つ前のバージョンです。推論モデルであり、回答する前に必ず推論を行います。推論はオフにできません。reasoning_effort には minimal、low、medium、high、xhigh を指定できます。このティアでは none と max はサポートされておらず、reasoning_effort を省略した場合はモデルが推論の深さを決定します。推論トークンは出力として課金され、キャッシュされた入力はキャッシュ入力料金で課金されます。Web 検索は利用できず、Web 検索または function 以外の種類のツールを含むリクエストは拒否されます。リクエストは /v1/chat/completions に送信してください。
muse-spark-1.3-contributorMeta$0.1000$0.2000$0.0650$0.13001M tokens あたりMeta は Contributor ティアの規約に基づき、このモデルに送信されたプロンプトと出力を今後の Meta モデルの学習に使用する場合があります。機密情報やセンシティブなデータは送信しないでください。Meta Muse Spark 1.3(Contributor ティア)は Muse Spark の最新バージョンで、エージェント型ワークフローとコーディング向けに調整されています。推論モデルであり、回答する前に必ず推論を行います。推論はオフにできません。reasoning_effort には minimal、low、medium、high、xhigh を指定できます。このティアでは none と max はサポートされておらず、reasoning_effort を省略した場合はモデルが推論の深さを決定します。推論トークンは出力として課金され、キャッシュされた入力はキャッシュ入力料金で課金されます。Web 検索は利用できず、Web 検索または function 以外の種類のツールを含むリクエストは拒否されます。リクエストは /v1/chat/completions に送信してください。
qwen-audio-3.0-asr-flashAlibaba$0.1260音声1時間あたりAlibaba Qwen-Audio-3.0-ASR-Flash — Qwen-Audio 3.0 を土台とする非リアルタイムの音声認識。30 言語と中国語の七大方言(官話・呉・湘・贛・客家・閩・粤)、さらに 20 以上の地域アクセントに対応します。句読点予測とテキスト正規化により数値・日付・金額が標準表記に整い、ホットワードとプロンプト文脈が専門語彙の精度を高めます。1 リクエストあたり最長 5 分、最大 2 GB の音声を受け付けます。
qwen-audio-3.0-realtime-flashAlibaba$0.2900$0.88001M tokens あたりAlibaba Qwen-Audio-3.0-Realtime-Flash — WebSocket セッション上で全二重の音声対話を行うモデル。ベンダーが Artificial Analysis の Speech-to-Speech 部門で総合首位とする系列の高速ティアで、エンドツーエンドの応答遅延を最小化するよう調整されています。GET /v1/realtime で接続します。音声入力と音声出力はそれぞれ独立した単価で、テキストよりかなり高く課金されます。
qwen-audio-3.0-realtime-plusAlibaba$1.0000$8.00001M tokens あたりAlibaba Qwen-Audio-3.0-Realtime-Plus — WebSocket セッション上で全二重の音声対話を行うモデル。ベンダーは Artificial Analysis の Speech-to-Speech 部門で総合首位としています。標準ティアは回答の質を重視し、音声推論の水準を保ったまま、並列推論とエンドツーエンドのストリーミングで応答遅延を低く抑えます。GET /v1/realtime で接続します。音声入力と音声出力はそれぞれ独立した単価で、テキストよりかなり高く課金されます。
qwen-audio-3.0-tts-flashAlibaba$0.18001万文字あたりAlibaba Qwen-Audio-3.0-TTS-Flash — Qwen-Audio 3.0 を土台に、リアルタイム対話向けに調整された音声合成モデル。前世代より多くの少数言語と中国語方言に対応します。自由記述の指示追従と細粒度のタグ制御により、感情、口調、キャラクター、話速、音量を指定でき、ノイズや残響のある条件下での頑健性も向上しています。Flash ティアは低遅延の合成に最適化されており、音声アシスタント、ライブ対話、カスタマーサポートに向きます。課金は文字単位(1 トークン = 1 文字)。リクエスト/レスポンスとリアルタイム WebSocket セッションの両方で利用できます。
qwen-audio-3.0-tts-plusAlibaba$0.25001万文字あたりAlibaba Qwen-Audio-3.0-TTS-Plus — Qwen-Audio 3.0 を土台とする高品質な音声合成モデル。前世代より多くの少数言語と中国語方言に対応し、方言発音の自然さが大きく向上しました。自由記述の指示追従と細粒度のタグ制御により、感情、口調、キャラクター、話速、音量、スタイルを指定できます。ノイズや残響のある条件下での頑健性も向上しています。Plus ティアは音質と表現力を重視し、コンテンツ制作、オーディオブック、映像の吹き替え、ブランドボイスに向きます。課金は文字単位(1 トークン = 1 文字)。リクエスト/レスポンスとリアルタイム WebSocket セッションの両方で利用できます。
qwen-flash-characterAlibaba$0.0500$0.40001M tokens あたりAlibaba Qwen-Flash-Character — Qwen の多言語ロールプレイモデル(動的バージョン。更新はベンダーが事前に告知します)。ペルソナに忠実なキャラクター会話、すなわちペルソナの制約に沿った指示追従、話題の展開、傾聴、共感に向けて調整されています。8,192 トークンのコンテキストウィンドウ、入力も出力もテキストのみです。思考モード、ツール呼び出し、組み込みツール、構造化出力には対応していません。ベンダーのセッションキャッシュはベンダー側で自動的に適用されます。
qwen-image-3.0Alibaba$0.0301回あたりAlibaba Qwen-Image-3.0 — Qwen 画像系列の標準ティア。テキストからの画像生成と画像編集をカバーし、10px までの小さな文字、12 言語、20 種類以上の書体を正確に描き分けます。最大 4,500 トークンのプロンプトを受け付け、1 リクエストあたり最大 6 枚、最大 2048x2048 で生成します。
qwen-image-3.0-proAlibaba$0.0401回あたりAlibaba Qwen-Image-3.0-Pro — Qwen 画像系列のプロフェッショナルティア。新聞、絵コンテ、メニュー、試験問題のような情報密度の高い版面を一度に生成するために作られています。最大 4,500 トークンのプロンプトを受け付け、10px の小さな文字、12 言語、20 種類以上の書体を描き分け、1 リクエストあたり最大 6 枚、最大 2048x2048 で生成します。テキストからの画像生成と画像編集に対応します。
qwen-mt-image-2.0Alibaba$0.00061回あたりAlibaba Qwen-MT-Image 2.0 — 画像翻訳モデル。レイアウト、フォント、周囲のアートワークを保ったまま画像内のテキストを別の言語に書き換え、55 言語間で任意の方向に翻訳できます。OpenAI の images/edits エンドポイントで呼び出し、image フィールドに公開された http(s) の画像 URL を指定したうえで、target_lang(必須。ISO コードまたは英語名)と source_lang(任意。既定は auto)を渡します。prompt はエンドポイントの形式上必須ですが、無視されます。任意の ext オブジェクトで、ベンダーの domainHint、sensitives、terminologies、config.imageSegment をそのまま渡せます。返されるのは入力と同じサイズの JPG の URL 一つで、有効期間は 24 時間です。入力は各辺 15〜8192 px、アスペクト比 1:10〜10:1、最大 100 MB で、アップロードとデータ URL は受け付けません。ベンダーはこのモデルを毎分 1 リクエストにレート制限しており、翻訳可能なテキストが見つからない場合でも画像の料金が発生します(元の画像が返されます)。Alibaba 公式の単一チャネルで提供されます。
qwen3-asr-flashAlibaba$0.1260音声1時間あたりAlibaba Qwen3-ASR-Flash — Qwen3 基盤モデルの上に構築された音声認識モデル。話されている言語を自動判定し、11 言語を文字起こしします。Qwen3-ASR 系列は標準中国語に加えて四川語、閩南語、呉語、広東語、そして複数の英語アクセントを挙げています。aac、amr、avi、aiff、flac、flv、mkv、mp3、mpeg、ogg、opus、wav、webm、wma、wmv を受け付け、1 リクエストにつき最大 5 分・10 MB です。pcm 入力は 16 kHz である必要があり、それ以外の形式は認識前に 16 kHz へリサンプリングされます。
qwen3-tts-flashAlibaba$0.11001万文字あたりAlibaba Qwen3-TTS-Flash — 低遅延の音声合成モデル。表現力のある組み込み音声を 17 種備え、中国語、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語に対応するほか、言語が混在するテキスト向けの自動モードと方言出力も利用できます。1 リクエストにつき最大 512 トークンのテキストを受け付け、ストリーミングと非ストリーミングの両方の合成に対応します。
qwen3.5-livetranslate-flash-realtimeAlibaba$0.5500$20.00001M tokens あたりAlibaba Qwen3.5-LiveTranslate-Flash-Realtime — WebSocket セッション上での音声・映像の同時通訳モデル。Qwen3.5-Omni を土台に、言語間・モダリティ間のアライメントと視覚情報による補強を組み合わせています。60 言語を聞き取り、29 言語で話します。GET /v1/realtime で接続します。価格の面構成が他のリアルタイムモデルと異なり、**テキスト入力の単価は存在しません**——入力は音声または画像として、出力はテキストまたは音声として課金されます。
qwen3.5-ocrAlibaba$0.1000$0.35001M tokens あたりAlibaba Qwen3.5-OCR — Qwen3.5 系列の OCR モデル。文書解析、テキストの位置特定、重要情報の抽出に向けて作られており、ベンダーは実務で扱う身分証明書や免許証などの帳票で顕著な改善があるとしています。テキストと画像を入力として受け付け、テキストを返します。
qwen3.5-omni-flashAlibaba$0.4000$2.20001M tokens あたりAlibaba Qwen3.5-Omni-Flash — Qwen3.5 全モーダル系列の高速ティア。テキスト、画像、音声、音声付き動画をまたいで理解し対話します。1 つの会話で 10 時間を超える音声と、720P(1 FPS)で 400 秒を超える音声付き動画を扱え、音声入力は 60 以上の言語、音声出力は 30 以上の言語に対応します。音声入力と音声を含む出力はそれぞれ独立した単価で、テキストより高く課金されます。
qwen3.5-omni-flash-realtimeAlibaba$0.5500$3.30001M tokens あたりAlibaba Qwen3.5-Omni-Flash-Realtime — Qwen3.5 全モーダル系列の高速リアルタイムティア。WebSocket セッションを張ったまま全二重の音声対話を行います。テキスト、画像、音声、音声付き動画を理解し、音声入力は 60 以上の言語、音声出力は 30 以上の言語に対応。話者性の制御、Web 検索、複雑な関数呼び出し、意味を汲んだ割り込みに対応します。GET /v1/realtime で接続します。音声入力と音声を含む出力はそれぞれ独立した単価で、テキストよりかなり高く課金されます。
qwen3.5-omni-plusAlibaba$1.4000$8.30001M tokens あたりAlibaba Qwen3.5-Omni-Plus — Qwen3.5 全モーダル系列の高性能ティア。テキスト、画像、音声、音声付き動画をまたいで理解し対話します。1 つの会話で 10 時間を超える音声と、720P(1 FPS)で 400 秒を超える音声付き動画を扱え、音声入力は 60 以上の言語、音声出力は 30 以上の言語に対応します。65,536 トークンのコンテキストウィンドウ。音声入力と音声を含む出力はそれぞれ独立した単価で、テキストより高く課金されます。
qwen3.5-omni-plus-realtimeAlibaba$2.1000$12.40001M tokens あたりAlibaba Qwen3.5-Omni-Plus-Realtime — Qwen3.5 全モーダル系列のリアルタイムティア。WebSocket セッションを張ったまま全二重の音声対話を行います。テキスト、画像、音声、音声付き動画を理解し、音声入力は 60 以上の言語、音声出力は 30 以上の言語に対応。話者性の制御、Web 検索、複雑な関数呼び出し、意味を汲んだ割り込みに対応します。GET /v1/realtime で接続します。音声入力と音声を含む出力はそれぞれ独立した単価で、テキストよりかなり高く課金されます。
qwen3.6-27bAlibaba$0.6000$3.60001M tokens あたりAlibaba Qwen3.6-27B — Qwen3.6 系列の 270 億パラメータのネイティブ視覚言語 Dense モデル、オープンウェイト。ベンダーはエージェント型コーディング、STEM と推論、そして空間知能・物体の位置特定と検出において 3.5-27B を上回るとしています。262,144 トークンのコンテキストウィンドウ。テキスト、画像、動画を入力として受け付け、テキストを返します。
qwen3.6-35b-a3bAlibaba$0.3750$2.25001M tokens あたりAlibaba Qwen3.6-35B-A3B — 350 億パラメータのネイティブ視覚言語 MoE モデル、活性パラメータは約 30 億、オープンウェイト。線形注意とスパースな Mixture of Experts を組み合わせ、推論効率を高めています。262,144 トークンのコンテキストウィンドウ、最大 65,536 トークンの出力、1 リクエストあたり最大 256 枚の画像または 64 本の動画。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出し、組み込みツール、構造化出力に対応します。
qwen3.6-flashAlibaba$0.2500$1.50001M tokens あたりAlibaba Qwen3.6-Flash — 高速な視覚言語モデル。ベンダーはエージェント型コーディングと空間知能を強みとして挙げており、物体の位置特定と検出が大きく向上しています。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 65,536 トークンの出力、131,072 トークンの思考トークン予算を備えます。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出しとコンテキストキャッシュに対応します。
qwen3.6-plusAlibaba$0.5000$3.0000$0.4250$2.55001M tokens あたりAlibaba Qwen3.6-Plus — 汎用的な推論とツール利用に向けたバランス型モデル。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 65,536 トークンの出力、81,920 トークンの思考トークン予算を備えます。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出し、構造化出力、ウェブ検索、プレフィックス補完、コンテキストキャッシュに対応します。
qwen3.7-flashAlibaba$0.0300$0.13001M tokens あたりAlibaba Qwen3.7-Flash — Qwen3.7 のネイティブ視覚言語系列の高速ティア。ベンダーはマルチモーダルなエージェント業務(検索エージェントや CI エージェント)と、3.6-Flash より安定したエンドツーエンドのタスク遂行を強みとして挙げています。1,000,000 トークンのコンテキストウィンドウ、最大 65,536 トークンの出力、1 リクエストあたり最大 256 枚の画像または 64 本の動画。テキスト、画像、動画を入力として受け付け、テキストを返します。思考モード、関数呼び出し、組み込みツール、構造化出力に対応します。価格はコンテキスト長の 3 段階制で、長いコンテキストのリクエストはトークンあたりの単価が高くなります。
qwen3.7-maxAlibaba$2.5000$7.50001M tokens あたりAlibaba Qwen3.7-Max — プログラミング、オフィス業務と生産性、長期の自律実行に向けたクローズドソースのフラッグシップ。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 131,072 トークンの出力、262,144 トークンの思考トークン予算を備えます。入力も出力もテキストのみです。関数呼び出し、構造化出力、コンテキストキャッシュに対応します。
qwen3.7-plusAlibaba$0.4000$1.6000$0.3000$1.20001M tokens あたりAlibaba Qwen3.7-Plus — マルチモーダルなハイブリッドエージェントモデル。実世界のシーンを認識し、画面を読んで GUI を操作し、視覚的な参照からコードを生成し、モバイルアプリ内でエンドツーエンドのナビゲーションを行います。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 131,072 トークンの出力、262,144 トークンの思考トークン予算を備えます。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出し、構造化出力、コンテキストキャッシュに対応します。
qwen3.8-2.4t-a95bAlibaba$2.0000$6.00001M tokens あたりAlibaba Qwen3.8-2.4T-A95B — Qwen3.8 フラッグシップのオープンウェイト版。総パラメータ 2.4 兆、1 ステップあたり約 950 億が活性化するスパース MoE モデルで、ハイブリッドな注意機構を採用しています。1,000,000 トークンのコンテキストウィンドウ。テキストを入力として受け付け、テキストを返します。思考モードと非思考モードは同一の単価で課金され、出力価格には思考トークンが含まれます。
qwen3.8-27bAlibaba$0.5000$3.00001M tokens あたりAlibaba Qwen3.8-27B — Qwen3.8 系列の 270 億パラメータのネイティブ視覚言語 Dense モデル、オープンウェイト。ベンダーはテキストと視覚の両モダリティにおけるコーディングとオフィス業務で 3.6-27B を上回るとしています。1,000,000 トークンのコンテキストウィンドウ。テキストと画像を入力として受け付け、テキストを返します。思考モードと非思考モードは同一の単価で課金され、出力価格には思考トークンが含まれます。
qwen3.8-flashAlibaba$0.1500$0.4700$0.1125$0.35251M tokens あたりAlibaba Qwen3.8-Flash — Qwen3.8 系列の高速ティア。ベンダーはネイティブなマルチモーダルモデルとして、高スループットでのコーディング支援、エージェント連携、画像・文書理解に位置づけています。1,000,000 トークンのコンテキストウィンドウ。テキスト、画像、動画を入力として受け付け、テキストを返します。思考モード、関数呼び出し、組み込みツール、構造化出力に対応します。OpenAI と Anthropic Messages の両プロトコルを話します。
qwen3.8-maxAlibaba$2.0000$6.0000$1.9000$5.70001M tokens あたりAlibaba Qwen3.8-Max — 2.4 兆パラメータの MoE フラッグシップで、Qwen ファミリーで最も高性能なモデル。ベンダーはコーディングとオフィス業務での大幅な向上を挙げています。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 131,072 トークンの出力、262,144 トークンの思考トークン予算を備えます。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出し、構造化出力、コンテキストキャッシュに対応します。
qwen3.8-max-0902Alibaba$2.0000$6.00001M tokens あたりAlibaba Qwen3.8-Max-0902 — Qwen3.8-Max の 2026-09-02 スナップショット(ベンダー側のエイリアスは qwen3.8-max-2026-09-02)。2.4 兆パラメータの MoE フラッグシップを、連携でこのビルドをそのまま固定できるよう凍結したものです。ベンダーは、複雑なエンジニアリングプロジェクトに向けたより深いコーディング能力と、長時間の自律開発を挙げています。1,000,000 トークンのコンテキストウィンドウ、最大 131,072 トークンの出力。テキスト、画像、動画を入力として受け付けてテキストを返し、思考モード、ツール呼び出し、構造化出力に対応します。動的な名前の qwen3.8-max はベンダーのリリースに合わせて新しいビルドへ移るため、このビルドを使い続けるにはこの名前を固定してください。価格は qwen3.8-max と同じです。
speech-2.8-hdMiniMax$1.00001万文字あたりMiniMax speech-2.8-hd — 2.8 音声系列の高音質ティア。サウンドタグを伴う超リアルな表現を狙った位置づけで、40 言語と 7 種類の感情に対応します。ピッチ、話速、音量、サンプルレート、ビットレート、出力形式はリクエストごとに設定でき、長文合成は非同期で最大 100 万文字、ストリーミングインターフェースで最大 10,000 文字を受け付けます。
speech-2.8-turboMiniMax$0.60001万文字あたりMiniMax speech-2.8-turbo — 2.8 音声系列の低遅延ティア。HD モデルの超リアルな表現を手放す代わりに、自然な流れを保ったまま高速に合成します。対応する 40 言語と 7 種類の感情は HD と同じで、ピッチ、話速、音量、サンプルレート、ビットレート、出力形式を設定できます。非同期では最大 100 万文字、ストリーミングインターフェースでは最大 10,000 文字を受け付けます。
step-3.5-flashStepFun$0.1000$0.30001M tokens あたりStepFun step-3.5-flash — 256K コンテキストのテキスト専用推論モデル。論理、数学、ソフトウェアエンジニアリング、ディープリサーチなど、推論品質と高速で安定した実行の両方が求められる領域を想定しています。推論の深さは reasoning_effort(low / medium / high)でリクエストごとに選択できます。ツール呼び出し、JSON Schema による構造化出力、ストリーミング、プロンプトキャッシュに対応します。画像や動画を入力する場合は step-3.7-flash を使用してください。
step-3.5-flash-2603StepFun$0.1000$0.30001M tokens あたりStepFun step-3.5-flash-2603 — step-3.5-flash のエージェント向けにチューニングされた 256K スナップショットで、トークン効率と低推論モードでの動作に最適化されています。reasoning_effort パラメータは low と high のみを受け付け、ベースモデルの 3 段階とは異なるため、medium を送信するコードは修正が必要です。テキスト専用。ツール呼び出し、JSON Schema による構造化出力、ストリーミング、プロンプトキャッシュに対応します。
step-3.7-flashStepFun$0.2000$1.15001M tokens あたりStepFun step-3.7-flash — 総パラメータ 198B・アクティブ 11B のスパース MoE モデルで、ネイティブ 256K コンテキストと、テキストに加えて画像・動画のネイティブな理解を備えます。推論の深さは reasoning_effort(low / medium / high)でリクエストごとに選択でき、安定した多段階のツール呼び出し、JSON Schema による構造化出力、ストリーミング、プロンプトキャッシュに対応します。エージェントとコーディングのワークロード向けに調整されています。/v1/responses では毎ターン、会話全体を input 配列で送信してください。上流側では会話の状態が保持されないため、previous_response_id または conversation を含むリクエストは拒否されます。
step-5-previewStepFun$1.0000$2.70001M tokens あたりStepFun step-5-preview — コーディングと専門的な知識業務向けの StepFun の新しいフラッグシップモデルで、プレビュー版として提供されています。1M トークンのコンテキストと最大 64K トークンの出力を備え、テキストに加えて画像・動画をネイティブに理解します。推論は常に有効で、/v1/chat/completions では reasoning_content として、/v1/messages では thinking ブロックとして返され、出力として課金され、max_tokens を消費します。そのため数百トークン程度の上限では推論だけで使い切られ、テキストが返らないことがあります。上限には十分な余裕を持たせてください。推論の深さは reasoning_effort(low / medium / high)でリクエストごとに選択できます。多段階のツール呼び出し、JSON Mode と JSON Schema による構造化出力、ストリーミング、プロンプトキャッシュに対応します。長文ドキュメントの分析、ソフトウェアエンジニアリング、多段階のエージェント作業向けに設計されています。/v1/responses では毎ターン、会話全体を input 配列で送信してください。上流側では会話の状態が保持されないため、previous_response_id または conversation を含むリクエストは拒否されます。
step-audio-2StepFun$1.4815$10.37041M tokens あたりStepFun step-audio-2 — 文字起こしを経ずに音声を直接扱うエンドツーエンド音声モデルで、声のトーンや話し方がそのままモデルの理解に反映されます。トークン単位で課金され、入力レートは StepAudio 2.5 系列と同じ、出力レートはより高く設定されています。StepFun はこのモデル固有の機能ページを公開していないため、現行のパラメータについてはプラットフォームの音声ドキュメントを参照してください。
step-tts-2StepFun$0.41481万文字あたりStepFun step-tts-2 — 正確なアクセント再現のために設計された NTP ベースのエンドツーエンド音声合成モデル。中国語、英語、中国語と英語の混在、日本語に加え、広東語と四川語を話します。感情と話し方は自然言語のラベルで指示でき、ゼロショット音声クローンには約 10 秒の参照音声が必要です。感情とスタイルの制御はクローンした声にも追加費用なしで引き継がれます。出力は wav、mp3、flac、opus、pcm です。
stepaudio-2-asr-proStepFun$0.2963音声1時間あたりStepFun StepAudio 2 ASR Pro — 32B パラメータの音声認識モデル。StepFun の ASR 系列では精度を最優先する選択肢で、速度とコストを優先する場合は stepaudio-2.5-asr を選びます。ogg、mp3、wav のアップロードを受け付けます。文字起こしの出力は課金対象外です。
stepaudio-2.5-asrStepFun$0.0220音声1時間あたりStepFun StepAudio 2.5 ASR — Multi-Token Prediction を基盤とする 4B パラメータの音声認識モデルで、5 分の音声を約 1 秒で文字起こしします(RTF は約 0.0053)。中国語と英語に最適化されています。逆テキスト正規化、話者識別、通話・会議録音向けの 2 チャンネル分離を備えます。ogg、mp3、wav のアップロードを受け付けます。文字起こしの出力は課金対象外です。
stepaudio-2.5-asr-streamStepFun$0.1800音声1時間あたりStepFun StepAudio 2.5 ASR Stream — StepAudio 2.5 ASR(Multi-Token Prediction を基盤とし、中国語と英語に最適化された 4B パラメータの音声認識モデル)のストリーミング認識版で、StepFun が推奨するストリーミングモデルです。このゲートウェイでの呼び出し方はほかの文字起こしモデルと同じです。録音全体を /v1/audio/transcriptions にアップロードすると、認識が完了した時点で文字起こしの全文が 1 つのレスポンスで返されます。途中結果はストリーミングで返されず、音声 1 分あたりの料金は stepaudio-2.5-asr より高くなります。逆テキスト正規化が適用されます。16-bit PCM の wav と ogg のアップロードのみを受け付けます(mp3 は受け付けません)。文字起こしの出力は課金対象外です。
stepaudio-2.5-chatStepFun$1.5000$3.50001M tokens あたりStepFun StepAudio 2.5 Chat — エンドツーエンドの音声理解モデル。音声またはテキストを入力として受け取り、テキストを返します。ためらいや笑いといったパラ言語的な手がかりを、文字起こしではなく波形そのものから読み取ります。キャラクター、話し方の癖、感情の幅にわたる幅広いペルソナのカスタマイズに対応します。音声は chat completions エンドポイントの input_audio コンテンツパートとして渡します。音声で応答させたい場合は TTS モデルを使用してください。
stepaudio-2.5-realtimeStepFun$1.5000$10.00001M tokens あたりStepFun StepAudio 2.5 Realtime — GET /v1/realtime の WebSocket セッション上で動作するエンドツーエンドの音声対音声モデル。音声またはテキストをストリーミングで入力し、テキストの書き起こし付きの音声をストリーミングで出力します。サーバー側の音声区間検出と割り込みに対応します。音声は PCM16・24 kHz・モノラルで、ベンダーがサポート言語として挙げているのは英語です。ボイスは session.update で明示的に指定してください。StepFun が公開しているボイスのみ受け付けられます。
stepaudio-2.5-ttsStepFun$0.85001万文字あたりStepFun StepAudio 2.5 TTS — 話し方を後処理として扱うのではなく、理解を生成パイプライン全体に通す文脈対応の音声合成モデル。声、感情、間の取り方を、リクエスト全体に効くグローバルな文脈と、個々の箇所に効くインラインの文脈という 2 つのレベルで自然言語により指示できます。ゼロショット音声クローンには約 3 秒の参照音声が必要で、文脈制御の機能一式をそのまま引き継ぎます。1 リクエストにつき最大 1000 文字。出力は wav、mp3、flac、opus です。
stepaudio-3-asr-maxStepFun$0.4000音声1時間あたりStepFun StepAudio 3 ASR Max — StepFun 最大の音声認識モデル。大規模言語モデルを基盤としているため、文脈と専門分野の知識を踏まえて認識します。固有名詞・薬品名・専門用語・同音異義語、中英混在の発話・方言・長時間音声、そしてささやき声・非常に速い話し方・背景音楽のある音声(歌われた歌詞を含む)に、より強くなっています。音声ファイル(WAV、MP3、OGG のいずれか)を POST /v1/audio/transcriptions に送信します。音声の長さに応じて課金されます。
stepaudio-3-chat-previewStepFun$0.00001M tokens あたりStepFun StepAudio 3 Chat(プレビュー版)— POST /v1/chat/completions で利用する音声理解の対話モデル。ターンごとに、音声を input_audio コンテンツパートとして送るかテキストを送ると、テキストが返ります。ツール呼び出しにも対応します。StepFun のプレビュー期間中は無料です。無料期間が終わると StepFun はプレビュー版の名称を廃止して有料版をリリースするため、その時点でこのモデル ID は使えなくなる前提で計画してください。
stepaudio-3-gen-previewStepFun$0.0001回あたりStepFun StepAudio 3 Audio Generation(プレビュー版)— StepAudio 3 シリーズの台本から音声を生成するモデルで、POST /v1/audio/generate を使います。名前と自然な言葉での声の説明で役を定義し、台本を 1 行ずつ書き(角括弧で囲んだ行は効果音や BGM になります)、全体の指示を加えると、完成した音声がバイト列で返ります(既定は mp3)。声は役の説明から作られ、プリセットのボイス名は受け付けません。リクエストのフィールドは StepFun の API リファレンスに従います。StepFun のプレビュー期間中は無料です。無料期間が終わると StepFun はプレビュー版の名称を廃止して有料版をリリースするため、その時点でこのモデル ID は使えなくなる前提で計画してください。
stepaudio-3-music-previewStepFun$0.0001回あたりStepFun StepAudio 3 Music(プレビュー版)— StepAudio 3 シリーズのテキストから音楽を生成するモデルで、POST /v1/music/generations で minimax-music-v3.0 と同じリクエスト形式を使います。prompt でスタイルを指定し、lyrics で歌詞を渡すか is_instrumental を設定すると、完成した曲が data.audio に hex エンコードで返ります(既定は mp3。audio_setting.format で wav、flac、opus、pcm も選べます)。呼び出しは同期で、1 曲の生成には通常 1 分から数分かかるため、クライアントのタイムアウトは 600 秒以上にしてください。カバーや、アップロードしたボーカルへの伴奏付けには対応していません。StepFun のプレビュー期間中は無料です。無料期間が終わると StepFun はプレビュー版の名称を廃止して有料版をリリースするため、その時点でこのモデル ID は使えなくなる前提で計画してください。
stepaudio-3-realtime-previewStepFun$0.00001M tokens あたりStepFun StepAudio 3 Realtime(プレビュー版)— GET /v1/realtime の WebSocket セッション上で動作する StepFun の全二重音声モデル。自然な割り込みとターンテイキング、話しながらの適応的な推論、会話中のツール呼び出しに対応します。StepFun のプレビュー期間中は無料です。無料期間が終わると StepFun はプレビュー版の名称を廃止して有料版をリリースするため、このモデル ID は使えなくなる前提で計画してください。
stepaudio-3-ttsStepFun$0.36001万文字あたりStepFun StepAudio 3 TTS — StepAudio 3 シリーズの音声合成モデルで、人間並みの話し方を目指して設計されています。音色、抑揚、リズム、息づかいは、笑い、ためらい、言い直しまで含めて自然な話し言葉に沿い、感情や口調も内容に合わせて変化します。POST /v1/audio/speech で提供され、入力テキストの文字単位で課金されます。
vidu-video-q3Vidu$0.0601秒あたりVidu Q3 — 被写体の一貫性、インテリジェントなシーン切り替え、音声と映像が同期した出力を備えた参照ベースの動画生成モデル。参照画像または名前を付けた被写体を受け付け、540P、720P、1080P で 3〜16 秒の動画を生成します。
vidu-video-q3-proVidu$0.1001秒あたりVidu Q3 Pro — 品質重視のテキストから動画生成、画像から動画生成、先頭・最終フレームからの生成に対応し、音声と映像が同期した出力を備えます。540P、720P、1080P で 1〜16 秒の動画を生成します。参照から動画生成はこの SKU では対応していません。
vidu-video-q3-turboVidu$0.0551秒あたりVidu Q3 Turbo — テキスト、画像、先頭・最終フレーム、参照からの動画生成に対応する、高速で費用対効果の高い Q3 ティア。音声と映像が同期した出力を備えます。540P〜1080P で、通常モードは 1〜16 秒、参照モードは 3〜16 秒の動画を生成します。
wan2.7-i2vAlibaba$0.1001秒あたりAlibaba Wan 2.7 Image-to-Video — 先頭フレームからの生成、先頭・最終フレーム間のトランジション、既存クリップの継続に対応します。720P または 1080P(既定は 1080P)で 2〜15 秒(既定 5 秒)を生成し、プロンプトは最大 5000 文字(ネガティブプロンプトは最大 500 文字)です。2〜30 秒の mp3 または wav を driving_audio として渡せます。音声を指定しない場合はモデルが合う BGM や効果音を生成し、クリップより長い音声は切り詰められ、短い場合は末尾が無音になります。
wan2.7-imageAlibaba$0.0301回あたりAlibaba Wan2.7 Image — テキストから画像生成、画像編集、複数画像を参照した生成、対話的な編集に対応。テキスト描画と指示追従に強みがあります。
wan2.7-image-proAlibaba$0.0751回あたりAlibaba Wan 2.7 Image Pro — Wan 2.7 画像系列のプロフェッショナルティア。テキストから画像生成、連続した画像の組、画像編集、複数画像を参照した生成に対応し、プロンプト追従性が向上しています。テキストから画像生成は 4K(4096x4096)まで到達し、1K と 2K のティア、および 768x768 からのカスタムサイズを選べます。編集モードと連続生成モードは 2K が上限です。参照画像は最大 9 枚(JPEG、JPG、PNG、BMP、WEBP、各辺 240〜8000 px、1 枚あたり 20 MB まで)、アスペクト比は 1:8 から 8:1、プロンプトは最大 5000 文字です。出力は PNG です。
wan2.7-r2vAlibaba$0.1001秒あたりAlibaba Wan2.7(R2V)— 参照から動画生成。最大 5 点の画像 / 動画の混在参照と音色参照に対応し、キャラクター・小道具・シーンの一貫性を強化しています。
wan2.7-t2vAlibaba$0.1001秒あたりAlibaba Wan2.7(T2V)— 演技表現、繊細な感情、激しいアクション、劇的なカメラカットを強化したテキストから動画生成。720P または 1080P の H.264 MP4 を 2〜15 秒(既定 5 秒)、16:9、9:16、1:1、4:3、3:4 で生成し、プロンプトは最大 5000 文字です。音声は既定で含まれます。audio_url を指定しなければモデルが合う BGM や効果音を作り、代わりに 2〜30 秒の wav または mp3 を渡すこともできます。
wan2.7-videoeditAlibaba$0.1001秒あたりAlibaba Wan2.7 VideoEdit — 自然言語による局所的または全体的な動画編集、参照画像による要素の置き換え、モーション / エフェクト / カメラワークの再現。
wan3.0-videoAlibaba$0.100$0.0851秒あたりAlibaba Wan3.0(Video)— テキストから動画生成、画像から動画生成、参照から動画生成を単一のエンドポイントに統合したオールインワンの動画生成モデル。プロンプトと任意の先頭フレーム画像 URL から、480P、720P または 1080P の H.264 MP4 を最大 30 秒まで生成します。生成した動画の秒数に応じてベンダー自身の価格段階で課金され、720P が基準レート、480P はその半額、1080P は 2 倍です。解像度を指定しないリクエストはモデルが 1080P で生成し、そのティアで課金されます。参照動画と参照音声の入力はベンダーのモデルには存在しますが、このエンドポイントでは扱いません。
wan3.0-video-primeAlibaba$0.1401秒あたりAlibaba Wan3.0 Video Prime — Wan 3.0 オールインワン動画モデルの高速ティアで、標準ティアと同等の機能をより速い生成速度で提供します。テキストから動画生成、先頭・最終フレームからの画像から動画生成、参照画像から動画生成(参照画像は最大 10 枚)を単一のエンドポイントで扱います。出力は H.264 MP4 で、480P、720P、1080P、2〜30 秒、30 fps、既定で音声付きです。生成された動画の秒数に応じて、ベンダーの料金段階に沿って課金されます。720P が基本料金で、480P はその半額弱、1080P はその倍の料金です。解像度を指定しないリクエストはベンダー既定の 1080P で生成され、その料金段階で課金されます。参照動画、参照音声、ファイル、ウェブリンクの入力はこのゲートウェイでは受け付けず、スマート duration(-1)も拒否されるため、duration を明示的に指定してください。Alibaba 公式の単一チャネルで提供されます。