中国 AI モデルの料金
ChinaAPI は DeepSeek、Qwen、GLM、Kimi をはじめとする中国 AI モデルを、OpenAI 互換のゲートウェイ https://api.chinaapi.ai/v1 から提供します。料金はすべて米ドル建てで、上流のサプライヤーが提示する単位で表示しています。同じ一覧は /api/pricing から JSON でも取得できます。
| モデル | サプライヤー | 入力 | 出力 | 単位 | 説明 |
|---|---|---|---|---|---|
| speech-2.8-hd | MiniMax | $0.5385 | 1万文字あたり | MiniMax speech-2.8-hd — 2.8 音声系列の高音質ティア。サウンドタグを伴う超リアルな表現を狙った位置づけで、40 言語と 7 種類の感情に対応します。ピッチ、話速、音量、サンプルレート、ビットレート、出力形式はリクエストごとに設定でき、長文合成は非同期で最大 100 万文字、ストリーミングインターフェースで最大 10,000 文字を受け付けます。 | |
| step-1o-audio | StepFun | $3.8500 | $9.2400 | 1M tokens あたり | StepFun step-1o-audio — 多言語対応とツール呼び出しを備えた前世代のエンドツーエンド音声モデル。1 回のやり取りは最大 30 分です。おおむね StepAudio 2.5 系列に置き換えられており、すでにこのモデルで構築されたワークロードのために残されています。 |
| step-1o-turbo-vision | StepFun | $0.4000 | $1.2800 | 1M tokens あたり | StepFun step-1o-turbo-vision — 画像と動画の理解に高速なテキスト生成を組み合わせた 32K コンテキストのモデル。テキスト、画像、動画を入力として受け付け、返すのはテキストのみです。互換性のために残されている前世代の視覚モデルで、同じ入力モダリティは step-3.7-flash が 256K コンテキストと選択可能な推論の深さでカバーします。認識精度を保つため、画像は長辺 4096 ピクセル以下に収めてください。 |
| step-asr | StepFun | $0.1500 | 音声1時間あたり | StepFun step-asr — 中国語、英語、中国語方言に対応する汎用音声認識モデル。文字起こし、議事録作成、通話品質チェック、音声検索に利用できます。ogg、mp3、wav のアップロードを受け付けます。文字起こしの出力は課金対象外です。 | |
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | 1M tokens あたり | Xiaomi MiMo-V2.5 — 1M コンテキストと最大 128K 出力を備えたネイティブなフルモダリティモデルで、画像、動画、音声、テキストを 1 つのモデルで理解します。深い思考、関数呼び出し、構造化出力、ウェブ検索に対応し、フルモダリティのエージェント機能を備えます。 |
| glm-5-turbo | 智谱 | $1.2000 | $4.0000 | 1M tokens あたり | Zhipu GLM-5-Turbo — スループット重視の GLM-5 バリアントで、エージェントワークフロー向けに最適化されています。多段階タスクでのツールとスキルの呼び出しがより安定し、複雑で長い連鎖の指示への対応が向上し、スケジュール実行や長時間実行のタスクにも対応します。200K のコンテキストウィンドウ、最大 128K トークンの出力、入力も出力もテキストのみ。思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。 |
| doubao-seedance-2-0-mini-260615 | 字节跳动 | $1.4000 | $1.4000 | 1M tokens あたり | ByteDance Seedance 2.0 Mini — Seedance 2.0 系列の軽量で低予算向けのティア。480p と 720p、24 fps、4〜15 秒に制限されます。文書化された機能一式は系列のほかのモデルと同じで、テキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、画像 1〜9 枚と合計 15 秒までの参照動画最大 3 本によるマルチモーダル参照生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールに対応します。音声参照は画像または動画と併せて指定する必要があります。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応します。 |
| glm-5 | 智谱 | $1.0000 | $3.2000 | 1M tokens あたり | Zhipu GLM-5 — 総パラメータ 744B・アクティブ 40B の MoE モデル。28.5T トークンで学習し、DeepSeek Sparse Attention を採用しています。200K のコンテキストウィンドウと最大 128K トークンの出力を備え、入力も出力もテキストのみです。複数の思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。 |
| MiniMax-Hailuo-02 | MiniMax | $0.280 | 1回あたり | MiniMax Hailuo 02 — テキストから動画生成と画像から動画生成の両方をカバーする低価格の動画生成。24 fps で、512p と 768p は 6 秒または 10 秒のクリップ、1080p は 6 秒に対応します。512p ティアは Hailuo 系列の入り口です。 | |
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | 1M tokens あたり | StepFun step-3.7-flash — 総パラメータ 198B・アクティブ 11B のスパース MoE モデルで、ネイティブ 256K コンテキストと、テキストに加えて画像・動画のネイティブな理解を備えます。推論の深さは reasoning_effort(low / medium / high)でリクエストごとに選択でき、安定した多段階のツール呼び出し、JSON Schema による構造化出力、ストリーミング、プロンプトキャッシュに対応します。エージェントとコーディングのワークロード向けに調整されています。 |
| stepaudio-2.5-asr | StepFun | $0.0220 | 音声1時間あたり | StepFun StepAudio 2.5 ASR — Multi-Token Prediction を基盤とする 4B パラメータの音声認識モデルで、5 分の音声を約 1 秒で文字起こしします(RTF は約 0.0053)。中国語と英語に最適化されています。逆テキスト正規化、話者識別、通話・会議録音向けの 2 チャンネル分離を備えます。ogg、mp3、wav のアップロードを受け付けます。文字起こしの出力は課金対象外です。 | |
| step-asr-1.1 | StepFun | $0.3500 | 音声1時間あたり | StepFun step-asr-1.1 — 中国語、英語、中国語方言に対応する step-asr 系列の汎用音声認識モデルの更新版。ogg、mp3、wav のアップロードを受け付けます。文字起こしの出力は課金対象外です。 | |
| step-asr-1.1-stream | $0.4000 | 音声1時間あたり | |||
| stepaudio-2.5-asr-stream | $0.1800 | 音声1時間あたり | |||
| agnes-video-v2.0 | Agnes AI | $0.000 | 1秒あたり | Agnes AI Video V2.0 — テキストから動画生成、画像から動画生成、複数画像によるキーフレーム、シネマティックなモーションに対応する非同期の動画生成モデル。480p / 720p / 1080p に正規化された出力ティアをサポートします。 | |
| gemini-3.6-flash | 段階課金、料金ページをご覧ください | Google Gemini 3.6 Flash — エージェント用途と実世界のタスクに向けて速度と知能を両立させた安定版のマルチモーダル推論モデル。入力コンテキストは 1,048,576 トークン、出力上限は 65,536 トークンです。テキスト、画像、動画、音声、PDF を受け付け、思考、関数呼び出し、コード実行、検索グラウンディング、構造化出力、Computer Use(プレビュー)に対応します。 | |||
| glm-5.1 | 智谱 | $1.1200 | $3.5200 | 1M tokens あたり | Zhipu GLM-5.1 — 長時間の自律作業のために作られたフラッグシップ基盤モデル。ベンダーは、計画、実行、テスト、反復的な最適化にわたって、単一のタスクを最長 8 時間無人で連続実行できると記載しています。200K のコンテキストウィンドウ、最大 128K トークンの出力、入力も出力もテキストのみ。複数の思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。 |
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | 1M tokens あたり | Meituan LongCat-2.0 — ネイティブ 1M コンテキストを備えた 1.6T パラメータのオープン MoE モデルで、エージェント型コーディングと長時間のツール利用のために設計されています。テキスト専用の推論モデル。 |
| qwen3.7-max | 阿里巴巴 | $2.5000 | $7.5000 | 1M tokens あたり | Alibaba Qwen3.7-Max — プログラミング、オフィス業務と生産性、長期の自律実行に向けたクローズドソースのフラッグシップ。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 131,072 トークンの出力、262,144 トークンの思考トークン予算を備えます。入力も出力もテキストのみです。関数呼び出し、構造化出力、コンテキストキャッシュに対応します。 |
| qwen3.7-plus | 阿里巴巴 | $0.3080 | $1.2310 | 1M tokens あたり | Alibaba Qwen3.7-Plus — マルチモーダルなハイブリッドエージェントモデル。実世界のシーンを認識し、画面を読んで GUI を操作し、視覚的な参照からコードを生成し、モバイルアプリ内でエンドツーエンドのナビゲーションを行います。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 131,072 トークンの出力、262,144 トークンの思考トークン予算を備えます。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出し、構造化出力、コンテキストキャッシュに対応します。 |
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | 1M tokens あたり | StepFun StepAudio 2.5 Chat — エンドツーエンドの音声理解モデル。音声またはテキストを入力として受け取り、テキストを返します。ためらいや笑いといったパラ言語的な手がかりを、文字起こしではなく波形そのものから読み取ります。キャラクター、話し方の癖、感情の幅にわたる幅広いペルソナのカスタマイズに対応します。音声は chat completions エンドポイントの input_audio コンテンツパートとして渡します。音声で応答させたい場合は TTS モデルを使用してください。 |
| doubao-seedance-2-5-260628 | 字节跳动 | $10.7000 | $10.7000 | 1M tokens あたり | ByteDance Seedance 2.5 — Seedance の主系列モデル。1 回の生成を 24 fps で 4〜30 秒まで伸ばす一方、解像度は 480p と 720p に制限されます。マルチモーダル参照生成は画像 1〜30 枚、参照動画最大 10 本、参照音声最大 10 本(それぞれ合計 30 秒まで)に対応し、2.0 系列とは異なり音声参照を単独で使えます。ほかにテキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールにも対応します。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応します。 |
| kling-v3-omni | 快手 | $0.420 | 1回あたり | Kling 3.0 Omni — 参照ベースの複数画像による動画生成。表示価格は std ティア(720p、5 秒、音声なし、参照動画なし)のものです。mode を指定しないリクエストは上流のデフォルトである pro ティアとなり、1.33 倍で課金されます(同じ 5 秒のクリップで約 $0.56)。4k は 5 倍で課金されます。表示価格で利用するには mode=std を渡してください。 | |
| speech-2.8-turbo | MiniMax | $0.3077 | 1万文字あたり | MiniMax speech-2.8-turbo — 2.8 音声系列の低遅延ティア。HD モデルの超リアルな表現を手放す代わりに、自然な流れを保ったまま高速に合成します。対応する 40 言語と 7 種類の感情は HD と同じで、ピッチ、話速、音量、サンプルレート、ビットレート、出力形式を設定できます。非同期では最大 100 万文字、ストリーミングインターフェースでは最大 10,000 文字を受け付けます。 | |
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | 1M tokens あたり | StepFun step-3.5-flash-2603 — step-3.5-flash のエージェント向けにチューニングされた 256K スナップショットで、トークン効率と低推論モードでの動作に最適化されています。reasoning_effort パラメータは low と high のみを受け付け、ベースモデルの 3 段階とは異なるため、medium を送信するコードは修正が必要です。テキスト専用。ツール呼び出し、JSON Schema による構造化出力、ストリーミング、プロンプトキャッシュに対応します。 |
| step-audio-r1.5 | StepFun | $1.5500 | $16.2750 | 1M tokens あたり | StepFun step-audio-r1.5 — step-audio-2 と同系列のエンドツーエンド音声モデル。入力レートは同じで、出力は 50% 高く課金されます。StepFun はこのモデル固有の機能ページを公開していないため、現行のパラメータについてはプラットフォームの音声ドキュメントを参照してください。 |
| wan2.7-i2v | 阿里巴巴 | $0.092 | 1秒あたり | Alibaba Wan 2.7 Image-to-Video — 先頭フレームからの生成、先頭・最終フレーム間のトランジション、既存クリップの継続に対応します。720P または 1080P(既定は 1080P)で 2〜15 秒(既定 5 秒)を生成し、プロンプトは最大 5000 文字(ネガティブプロンプトは最大 500 文字)です。2〜30 秒の mp3 または wav を driving_audio として渡せます。音声を指定しない場合はモデルが合う BGM や効果音を生成し、クリップより長い音声は切り詰められ、短い場合は末尾が無音になります。 | |
| wan2.7-image | 阿里巴巴 | $0.031 | 1回あたり | Alibaba Wan2.7 Image — テキストから画像生成、画像編集、複数画像を参照した生成、対話的な編集に対応。テキスト描画と指示追従に強みがあります。 | |
| doubao-seed-2-1-turbo-260628 | 字节跳动 | $0.4620 | $2.3080 | 1M tokens あたり | ByteDance Doubao Seed 2.1 Turbo — Seed 2.1 系列の低遅延レーン。Pro と同じ枠を共有し、256K のコンテキストウィンドウ(最大入力 256K)、最大 256K トークンの出力(既定 4K)、256K の思考トークン予算を備えます。深い思考、テキスト生成、マルチモーダル理解、ツール呼び出し、構造化出力に対応しますが、Pro のような json_schema の推奨はありません。テキスト、画像、動画を受け付け、テキストを返します。2.1 系列に音声理解は挙げられていません。暗黙的および明示的なコンテキストキャッシュに対応します。 |
| agnes-image-2.0-flash | Agnes AI | $0.000 | 1回あたり | Agnes AI Image 2.0 Flash — テキストから画像生成、画像から画像生成、複数画像の合成に対応する高速な画像生成・編集モデル。生成結果は URL または Base64 データとして受け取れます。 | |
| happyhorse-1.1-i2v | 阿里巴巴 | $0.083 | 1秒あたり | Alibaba HappyHorse 1.1(I2V)— 質感、クリップ間の ID 一貫性、モーションの滑らかさ、音声と映像の同期を改善した画像から動画生成。720P / 1080P。 | |
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | 1万文字あたり | Xiaomi MiMo の音声クローンモデル。voice フィールドに参照音声をデータ URL(data:{mime};base64,...)として渡すと、学習・アノテーション・ファインチューニングの工程なしにその声で音声を合成します。MP3(audio/mpeg)または WAV を受け付け、Base64 エンコード後の文字列は 10 MB までです。参照音声の最短長は Xiaomi が公開していません。自然言語によるスタイル指示とインラインの音声タグは mimo-v2.5-tts から引き継がれますが、ストリーミングは利用できません。リクエストは互換モードで実行され、合成が完了してから返されます。 | |
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | 1回あたり | MiniMax Hailuo 2.3 — ベンダーが指示追従性を売りにするテキストから動画生成と画像から動画生成。24 fps で、768p は 6 秒または 10 秒のクリップ、1080p は 6 秒に対応します。768p 6 秒で $0.28。 | |
| wan2.7-image-pro | 阿里巴巴 | $0.060 | 1回あたり | Alibaba Wan 2.7 Image Pro — Wan 2.7 画像系列のプロフェッショナルティア。テキストから画像生成、連続した画像の組、画像編集、複数画像を参照した生成に対応し、プロンプト追従性が向上しています。テキストから画像生成は 4K(4096x4096)まで到達し、1K と 2K のティア、および 768x768 からのカスタムサイズを選べます。編集モードと連続生成モードは 2K が上限です。参照画像は最大 9 枚(JPEG、JPG、PNG、BMP、WEBP、各辺 240〜8000 px、1 枚あたり 20 MB まで)、アスペクト比は 1:8 から 8:1、プロンプトは最大 5000 文字です。出力は PNG です。 | |
| mimo-v2.5-asr | Xiaomi | $0.0740 | 音声1時間あたり | 中国語と英語に加えて中国語方言に最適化された Xiaomi MiMo の音声認識モデル。雑音下、遠距離、複数話者の音声のほか、歌詞の書き起こしにも対応します。 | |
| qwen3.6-plus | 阿里巴巴 | $0.4000 | $2.4000 | 1M tokens あたり | Alibaba Qwen3.6-Plus — 汎用的な推論とツール利用に向けたバランス型モデル。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 65,536 トークンの出力、81,920 トークンの思考トークン予算を備えます。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出し、構造化出力、ウェブ検索、プレフィックス補完、コンテキストキャッシュに対応します。 |
| step-audio-2 | StepFun | $1.5500 | $10.8500 | 1M tokens あたり | StepFun step-audio-2 — 文字起こしを経ずに音声を直接扱うエンドツーエンド音声モデルで、声のトーンや話し方がそのままモデルの理解に反映されます。トークン単位で課金され、入力レートは StepAudio 2.5 系列と同じ、出力レートはより高く設定されています。StepFun はこのモデル固有の機能ページを公開していないため、現行のパラメータについてはプラットフォームの音声ドキュメントを参照してください。 |
| step-tts-2 | StepFun | $0.4000 | 1万文字あたり | StepFun step-tts-2 — 正確なアクセント再現のために設計された NTP ベースのエンドツーエンド音声合成モデル。中国語、英語、中国語と英語の混在、日本語に加え、広東語と四川語を話します。感情と話し方は自然言語のラベルで指示でき、ゼロショット音声クローンには約 10 秒の参照音声が必要です。感情とスタイルの制御はクローンした声にも追加費用なしで引き継がれます。出力は wav、mp3、flac、opus、pcm です。 | |
| stepaudio-2.5-tts | StepFun | $0.8500 | 1万文字あたり | StepFun StepAudio 2.5 TTS — 話し方を後処理として扱うのではなく、理解を生成パイプライン全体に通す文脈対応の音声合成モデル。声、感情、間の取り方を、リクエスト全体に効くグローバルな文脈と、個々の箇所に効くインラインの文脈という 2 つのレベルで自然言語により指示できます。ゼロショット音声クローンには約 3 秒の参照音声が必要で、文脈制御の機能一式をそのまま引き継ぎます。1 リクエストにつき最大 1000 文字。出力は wav、mp3、flac、opus です。 | |
| wan2.7-videoedit | 阿里巴巴 | $0.092 | 1秒あたり | Alibaba Wan2.7 VideoEdit — 自然言語による局所的または全体的な動画編集、参照画像による要素の置き換え、モーション / エフェクト / カメラワークの再現。 | |
| agnes-image-2.1-flash | Agnes AI | $0.000 | 1回あたり | Agnes AI Image 2.1 Flash — 情報密度の高いシーンに向けたディテール重視の画像生成・編集モデル。テキストから画像生成、画像から画像生成、複数画像の合成に対応し、1K〜4K の柔軟なサイズとアスペクト比を選べます。 | |
| doubao-seedance-2-0-fast-260128 | 字节跳动 | $4.2000 | $4.2000 | 1M tokens あたり | ByteDance Seedance 2.0 Fast — 費用対効果の高い動画生成。Seedance 2.0 の機能一式を備えつつ、480p と 720p、24 fps、4〜15 秒に制限されます。テキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、画像 1〜9 枚と合計 15 秒までの参照動画最大 3 本によるマルチモーダル参照生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールに対応します。音声参照は画像または動画と併せて指定する必要があります。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応します。480p 5 秒で約 $0.26。 |
| kling-v3 | 快手 | $0.420 | 1回あたり | Kuaishou Kling 3.0 — ネイティブ音声と要素の一貫性を高めたテキストから動画生成と画像から動画生成。クリップは 3〜15 秒(既定 5 秒)、16:9、9:16、1:1 で、ティアは mode で選びます。std が 720P、pro が 1080P、4k がネイティブ 4K です。音声は sound=on によるオプトインで、既定はオフです。画像から動画生成は先頭フレームを取り、最終フレームは任意で指定できます。$0.083/秒(720p)から。 | |
| kling-3.0-turbo | 快手 | $0.560 | 1回あたり | Kuaishou Kling 3.0 Turbo — Kling 3.0 系列のバリューティア。プロンプトまたは先頭フレーム画像から、720P または 1080P(既定は 720P)の動画を 3〜15 秒(既定 5 秒)、16:9、9:16、1:1 で生成します。ネイティブ音声は常に含まれ、オン・オフの切り替えはありません。kling-v3 と比べると、速度とコストと引き換えに 4K ティア、最終フレーム制御、動画入力が使えません。720p 5 秒(音声あり)で約 $0.56。 | |
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | 1万文字あたり | Xiaomi MiMo の音声デザインモデル。instructions で望む声を自然言語で記述すると、その設計どおりの声で音声を合成します。 | |
| MiniMax-M3 | MiniMax | 段階課金、料金ページをご覧ください | MiniMax M3 — エージェント的な推論、ツール利用、構造化されたタスク実行に向けた最先端のマルチモーダルコーディングモデル。1,000,000 トークンのコンテキストウィンドウを備えます。テキスト、最大 10 MB の画像、インラインで最大 50 MB(Files API 経由なら最大 512 MB)の動画を入力として受け付け、テキストを返します。ツール呼び出しに対応し、思考は常時ではなく任意です。 | ||
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | 1M tokens あたり | Xiaomi MiMo-V2.5-Pro — 1M コンテキストと最大 128K 出力を備えた 1 兆パラメータ級(アクティブ 42B)のフラッグシップで、高負荷のエージェントワークロード向けに調整されています。深い思考、関数呼び出し、構造化出力、ウェブ検索に対応します。テキスト生成のみ。mimo-v2.5 とは異なり、ベンダーの機能一覧にフルモダリティ理解は含まれていません。 |
| doubao-seedance-2-0-260128 | 字节跳动 | $7.0000 | $7.0000 | 1M tokens あたり | ByteDance Seedance 2.0 — Seedance 2.0 系列のフラッグシップで、480p と 720p に加えて 1080p と 4K(10 bit 深度)に到達する系列唯一のモデル。24 fps、4〜15 秒。テキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、画像 1〜9 枚と合計 15 秒までの参照動画最大 3 本によるマルチモーダル参照生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールに対応します。音声参照は画像または動画と併せて指定する必要があります。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応し、最終フレームを画像として取得できます。出力解像度に応じて課金されます。 |
| glm-5v-turbo | 智谱 | $0.7690 | $3.3850 | 1M tokens あたり | Zhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows. |
| happyhorse-1.1-t2v | 阿里巴巴 | $0.083 | 1秒あたり | Alibaba HappyHorse 1.1(T2V)— 意味理解、カメラ制御、ダイナミックな生成を改善したテキストから動画生成。滑らかで細部まで描き込まれ、物理的に破綻のない 720P / 1080P の動画を生成します。 | |
| kimi-k2.6 | Moonshot | $0.7600 | $3.1570 | 1M tokens あたり | Moonshot Kimi K2.6 — 対話、コード生成、視覚理解、エージェントタスクに向けた汎用モデル。前世代より長時間のコード記述と自律実行が強化されています。256K のコンテキストウィンドウ、既定 32,768 トークンの出力。テキスト、画像(png、jpeg、webp、gif)、動画(mp4、mov、webm ほか)を Base64 コンテンツとして受け付け、テキストを返します。思考モードは既定で有効で、無効にもできます。temperature は思考ありで 1.0、思考なしで 0.6 に固定です。 |
| qwen3.6-flash | 阿里巴巴 | $0.1850 | $1.1080 | 1M tokens あたり | Alibaba Qwen3.6-Flash — 高速な視覚言語モデル。ベンダーはエージェント型コーディングと空間知能を強みとして挙げており、物体の位置特定と検出が大きく向上しています。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 65,536 トークンの出力、131,072 トークンの思考トークン予算を備えます。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出しとコンテキストキャッシュに対応します。 |
| stepaudio-2-asr-pro | StepFun | $0.3500 | 音声1時間あたり | StepFun StepAudio 2 ASR Pro — 32B パラメータの音声認識モデル。StepFun の ASR 系列では精度を最優先する選択肢で、速度とコストを優先する場合は stepaudio-2.5-asr を選びます。ogg、mp3、wav のアップロードを受け付けます。文字起こしの出力は課金対象外です。 | |
| wan2.7-t2v | 阿里巴巴 | $0.092 | 1秒あたり | Alibaba Wan2.7(T2V)— 演技表現、繊細な感情、激しいアクション、劇的なカメラカットを強化したテキストから動画生成。720P または 1080P の H.264 MP4 を 2〜15 秒(既定 5 秒)、16:9、9:16、1:1、4:3、3:4 で生成し、プロンプトは最大 5000 文字です。音声は既定で含まれます。audio_url を指定しなければモデルが合う BGM や効果音を作り、代わりに 2〜30 秒の wav または mp3 を渡すこともできます。 | |
| kimi-k2.7-code | Moonshot | $0.7600 | $3.1570 | 1M tokens あたり | Moonshot Kimi K2.7 Code — Kimi のコーディング専用モデル。ベンダーの計測では、K2.6 と比べて指示の遵守と長時間のコーディングが向上し、考えすぎが平均でおよそ 30% 減っています。256K のコンテキストウィンドウ、既定 32,768 トークンの出力。テキスト、画像、動画を Base64 コンテンツとして受け付け、テキストを返します。思考は必須で、無効にするとエラーになります。tool_choice は auto または none に限られ、reasoning_content は多段階のツール呼び出しをまたいで引き回す必要があります。 |
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | 1回あたり | MiniMax Hailuo 2.3 Fast — Hailuo 2.3 の速度とコストを重視したティア。画像から動画生成と、物理的な動きのリアリティに焦点を当てています。24 fps で、768p は 6 秒または 10 秒のクリップ、1080p は 6 秒に対応します。768p 6 秒で $0.19。 | |
| qwen3.8-max | 阿里巴巴 | $1.9900 | $5.9700 | 1M tokens あたり | Alibaba Qwen3.8-Max — 2.4 兆パラメータの MoE フラッグシップで、Qwen ファミリーで最も高性能なモデル。ベンダーはコーディングとオフィス業務での大幅な向上を挙げています。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 131,072 トークンの出力、262,144 トークンの思考トークン予算を備えます。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出し、構造化出力、コンテキストキャッシュに対応します。 |
| wan2.7-r2v | 阿里巴巴 | $0.092 | 1秒あたり | Alibaba Wan2.7(R2V)— 参照から動画生成。最大 5 点の画像 / 動画の混在参照と音色参照に対応し、キャラクター・小道具・シーンの一貫性を強化しています。 | |
| image-01 | MiniMax | $0.004 | 1回あたり | MiniMax image-01 — MiniMax 独自の image_generation エンドポイントによるテキストから画像生成。生成された画像ごとに課金されます。ベンダーはレガシーモデルとして掲載しています。 | |
| MiniMax-H3 | MiniMax | $0.080 | 1秒あたり | MiniMax H3(Hailuo 3.0)— 次世代のオープンな汎用マルチモーダル動画モデル。ネイティブのステレオ音声を 1 パスで生成し、768P または 2K、4〜15 秒(整数のみ)、24 fps で出力します。テキストから動画生成、先頭フレームまたは最終フレーム(あるいはその両方)からの画像から動画生成、そして画像・動画・音声を素材とする参照生成に対応し、キャラクター、モーション、カメラワーク、スタイル、声、編集のリズムを指定できます。画像から動画生成と参照生成は 1 リクエストで併用できません。入力は H.264/H.265 の動画、JPG、JPEG、PNG、WEBP、HEIC、HEIF の画像、WAV または MP3 の音声を受け付け、プロンプトは最大 7000 文字です。768P で $0.08/秒、2K で $0.13/秒。 | |
| qwen3-tts-flash | 阿里巴巴 | $0.1231 | 1万文字あたり | Alibaba Qwen3-TTS-Flash — 低遅延の音声合成モデル。表現力のある組み込み音声を 17 種備え、中国語、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語に対応するほか、言語が混在するテキスト向けの自動モードと方言出力も利用できます。1 リクエストにつき最大 512 トークンのテキストを受け付け、ストリーミングと非ストリーミングの両方の合成に対応します。 | |
| step-image-edit-2 | StepFun | $0.004 | 1回あたり | StepFun Step Image Edit 2 — テキストから画像生成と画像編集を統合した 6B 未満のパラメータのモデルで、12B〜20B 級のオープンウェイト編集モデルに匹敵します。1 回の編集を 1〜2 秒で完了し、低遅延の対話的なレタッチ向けに設計されています。256x256、512x512、768x768、1024x1024、1280x800、800x1280 に対応し、ネガティブプロンプトとテキスト最適化モードも利用できます。1 リクエストにつき画像 1 枚。OpenAI 互換の images エンドポイントで提供されます。 | |
| agnes-2.5-flash | Agnes AI | $0.0000 | 1M tokens あたり | Agnes AI Agnes 2.5 Flash — 512K の入力コンテキストと 65.5K の参考出力上限を備えた高速なマルチモーダルエージェントモデル。チャット、ストリーミング、ツール呼び出し、コーディング、推論、マルチターン対話、画像理解、エージェントワークフローに対応します。 | |
| deepseek-v4-flash | DeepSeek | $0.1400 | $0.2800 | 1M tokens あたり | DeepSeek V4 Flash — チャット、コーディング支援、エージェントループに向けた高速・高並列の DeepSeek V4 ティア。1M トークンのコンテキストウィンドウと最大 384K の出力を備えます。思考モード(既定)と非思考モードの両方で動作し、ツール呼び出しと JSON 出力に対応します。入力も出力もテキストのみです。 |
| deepseek-v4-pro | DeepSeek | $0.4350 | $0.8700 | 1M tokens あたり | DeepSeek V4 Pro — コーディング、推論、エージェント業務に向けた DeepSeek V4 の高性能ティア。1M トークンのコンテキストウィンドウと最大 384K の出力を備えます。思考モード(既定)と非思考モードの両方で動作し、ツール呼び出しと JSON 出力に対応します。入力も出力もテキストのみです。 |
| kimi-k2.7-code-highspeed | Moonshot | $1.7810 | $7.3970 | 1M tokens あたり | Moonshot Kimi K2.7 Code Highspeed — K2.7 Code のスループット重視ティア。同じモデルを毎秒およそ 180 トークン、短いコンテキストでは最大 260 トークンで提供します。256K のコンテキストウィンドウ、既定 32,768 トークンの出力。テキスト、画像、動画を Base64 コンテンツとして受け付け、テキストを返します。思考は必須で、無効にするとエラーになります。tool_choice は auto または none に限られ、reasoning_content は多段階のツール呼び出しをまたいで引き回す必要があります。 |
| kimi-k3 | Moonshot | $2.7400 | $13.6990 | 1M tokens あたり | Moonshot Kimi K3 — 2.8 兆パラメータのフラッグシップ。長時間のコーディング、エンドツーエンドのナレッジワーク、深い推論に向けて設計され、1M トークンのコンテキストウィンドウと最大 1,048,576 トークンの出力(既定は 131,072)を備えます。テキスト、Base64 画像、動画を入力として受け付け、テキストを返します。思考は常に有効で、reasoning_effort は low、high、max から選べます(既定は max)。temperature は 1.0 に固定です。カスタムツール呼び出しとツールの動的読み込みに対応します。 |
| MiniMax-M2.7-highspeed | MiniMax | $0.5750 | $2.3010 | 1M tokens あたり | MiniMax M2.7 Highspeed — 同じ M2.7 モデルを毎秒およそ 100 トークンで提供する、低遅延のコーディングとエージェントワークフロー向けのティア。204,800 トークンのコンテキストウィンドウを備えます。テキスト専用で、API が受け付けるのはテキストとツール呼び出しのコンテンツブロックのみです(画像や動画は不可)。ツール呼び出しに対応します。思考は常時有効で、無効にできません。 |
| qwen3-asr-flash | 阿里巴巴 | $0.1235 | 音声1時間あたり | Alibaba Qwen3-ASR-Flash — Qwen3 基盤モデルの上に構築された音声認識モデル。話されている言語を自動判定し、11 言語を文字起こしします。Qwen3-ASR 系列は標準中国語に加えて四川語、閩南語、呉語、広東語、そして複数の英語アクセントを挙げています。aac、amr、avi、aiff、flac、flv、mkv、mp3、mpeg、ogg、opus、wav、webm、wma、wmv を受け付け、1 リクエストにつき最大 5 分・10 MB です。pcm 入力は 16 kHz である必要があり、それ以外の形式は認識前に 16 kHz へリサンプリングされます。 | |
| step-2x-large | StepFun | $0.016 | 1回あたり | StepFun Step 2X Large — 写実的な質感と、画像内の中国語・英語テキストの際立って高い描画精度を備えたテキストから画像生成モデル。256x256、512x512、768x768、1024x1024、1280x800、800x1280 に対応し、1 リクエストにつき画像 1 枚。OpenAI 互換の images エンドポイントで提供されます。 | |
| doubao-seed-2-1-pro-260628 | 字节跳动 | $0.9230 | $4.6150 | 1M tokens あたり | ByteDance Doubao Seed 2.1 Pro — 実運用向けの Doubao フラッグシップエージェントモデル。深い思考、テキスト生成、マルチモーダル理解、ツール呼び出し、構造化出力に対応し、構造化出力にはベンダーが json_schema モードを推奨しています。256K のコンテキストウィンドウ(最大入力 256K)、最大 256K トークンの出力(既定 4K)、256K の思考トークン予算を備えます。テキスト、画像、動画を受け付け、テキストを返します。2.1 系列に音声理解は挙げられていません。プレフィックスキャッシュとセッションキャッシュを含む、暗黙的および明示的なコンテキストキャッシュに対応します。 |
| doubao-seedream-4-5-251128 | 字节跳动 | $0.038 | 1回あたり | ByteDance Doubao Seedream 4.5 — 複数画像の融合に対応したテキストから画像生成と画像から画像生成。1 枚の画像、または関連する画像の組を出力します。単一画像モードはプロンプトのみ、参照画像 1 枚、または参照画像 2〜14 枚を受け付けます。グループモード(sequential_image_generation=auto)はテキストから最大 15 枚、参照画像 1 枚から最大 14 枚、参照画像 2〜14 枚からは入力と出力の合計が 15 枚以下に収まる組を返します。2K と 4K の出力に対応し、既定では JPEG を URL または Base64 で返します。座標指定による対話的な編集は Seedream 5.0 pro 専用です。 | |
| doubao-seedream-5-0-260128 | 字节跳动 | $0.034 | 1回あたり | ByteDance Doubao Seedream 5.0-lite — より賢く制御しやすい創作、リアルタイム検索、被写体の一貫性を強化したテキストから画像生成と画像から画像生成(2K 以上の解像度)。 | |
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | 1M tokens あたり | StepFun step-3.5-flash — 256K コンテキストのテキスト専用推論モデル。論理、数学、ソフトウェアエンジニアリング、ディープリサーチなど、推論品質と高速で安定した実行の両方が求められる領域を想定しています。推論の深さは reasoning_effort(low / medium / high)でリクエストごとに選択できます。ツール呼び出し、JSON Schema による構造化出力、ストリーミング、プロンプトキャッシュに対応します。画像や動画を入力する場合は step-3.7-flash を使用してください。 |
| happyhorse-1.1-r2v | 阿里巴巴 | $0.083 | 1秒あたり | Alibaba HappyHorse 1.1(R2V)— 最大 9 枚の参照画像を使う参照画像から動画生成。被写体・シーン・スタイルの一貫性とカメラ制御に優れます。720P / 1080P。 | |
| hy3 | Tencent | $0.1540 | $0.6150 | 1M tokens あたり | Tencent Hunyuan 3(Hy3)— 295B パラメータ(アクティブ 21B)の MoE モデルで、ネイティブ 256K コンテキストと 3 段階の思考モード(fast / low / deep)を備えます。コーディングエージェント、長文ドキュメントの理解、マルチターンの文脈保持、多段階のエージェントワークフローに強みがあります。テキスト専用。 |
| mimo-v2.5-tts | Xiaomi | $0.0000 | 1万文字あたり | Xiaomi MiMo v2.5 TTS — 表現力のある音声合成モデル。組み込み音声を 8 種備え、中国語 4 種と英語 4 種(Mia、Chloe、Milo、Dean)で、中国語と英語に加えて東北方言、四川方言、河南方言、広東語のスタイルをカバーします。話し方は 2 通りで指示できます。自然言語によるスタイル指示と、基本感情・複合感情、息づかい、ため息、間の取り方を指定するインラインの音声タグで、MiMo TTS 系列ではこのモデルだけが持つ歌唱モードも含みます。出力は 24 kHz モノラルの wav または pcm16 で、低遅延ストリーミングに対応します(ストリーミングには pcm16 が必要です)。コンテキストは 8K、最大出力も 8K です。 | |
| MiniMax-M2.7 | MiniMax | $0.2880 | $1.1510 | 1M tokens あたり | MiniMax M2.7 — チャット、コーディング、オフィス業務、エージェントタスクに向けたテキストモデル。204,800 トークンのコンテキストウィンドウを備え、出力はおよそ毎秒 60 トークンです。テキスト専用で、API が受け付けるのはテキストとツール呼び出しのコンテンツブロックのみです(画像や動画は不可)。ツール呼び出しに対応します。思考は常時有効で、無効にできません。 |
| step-tts-mini | StepFun | $0.1500 | 1万文字あたり | StepFun step-tts-mini — StepFun の TTS 系列で費用対効果と低遅延を重視したモデル。step-tts-2 と同じ言語(中国語、英語、中国語と英語の混在、日本語、加えて広東語と四川語)をカバーし、組み込み音声はその一部を利用できます。自然言語による感情と話し方のラベル指定と、約 10 秒の参照音声からのゼロショット音声クローンに対応します。出力は wav、mp3、flac、opus、pcm です。 | |
| agnes-2.0-flash | Agnes AI | $0.0000 | 1M tokens あたり | Agnes AI Agnes 2.0 Flash — 256K の入力コンテキストと 64K の参考出力上限を備えた高速なマルチモーダルエージェントモデル。チャット、ストリーミング、ツール呼び出し、コーディング、推論、画像理解、エージェントワークフローに対応します。 | |
| glm-5.2 | 智谱 | $1.1200 | $3.5200 | 1M tokens あたり | Zhipu GLM-5.2 — 長時間のコーディングエージェント業務に特化したフラッグシップ基盤モデル。コンテキスト長を伸ばしただけではなく、数か月に及ぶ専用の学習によって作られています。1M トークンのコンテキストウィンドウと最大 128K トークンの出力を備え、入力も出力もテキストのみです。複数の思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。 |
| glm-asr-2512 | 智谱 | $0.1440 | 音声1時間あたり | Zhipu GLM-ASR-2512 — 文字誤り率 0.0717 を公表する音声認識モデル。標準中国語に加えて四川語、広東語、閩南語、呉語、アメリカ英語とイギリス英語のアクセント、さらにフランス語、ドイツ語、日本語、韓国語、スペイン語、アラビア語を含む数十の言語をカバーします。言語が混在する発話、専門用語、口語的な話し方も扱え、専門語彙のためのカスタム辞書を受け付けます。音声は 1 リクエストにつき 30 秒・25 MB までで、バッチとストリーミングの両方の文字起こしに対応します。 | |
| glm-tts | 智谱 | $0.3077 | 1万文字あたり | Zhipu GLM-TTS — GRPO 強化学習を用いた 2 段階生成アーキテクチャに基づく音声合成モデル。明示的なマークアップを求めず、前後の文脈から感情と抑揚を推定します。組み込み音声を 7 種(既定の tongtong、xiaochen、chuichui、jam、kazi、douji、luodo)備え、速度と音量を調整できます。1 リクエストにつき最大 1024 文字を受け付け、初回フレームまでの遅延 400 ms 未満でストリーミングします。出力は wav または pcm で、推奨サンプルレートは 24 kHz です。ストリーミングは pcm のみです。 | |