中国 AI モデルの料金
ChinaAPI は DeepSeek、Qwen、GLM、Kimi をはじめとする中国 AI モデルを、OpenAI 互換のゲートウェイ https://api.chinaapi.ai/v1 から提供します。料金はすべて米ドル建てで、上流のサプライヤーが提示する単位で表示しています。同じ一覧は /api/pricing から JSON でも取得できます。
| モデル | サプライヤー | 入力 | 出力 | 単位 | 説明 |
|---|---|---|---|---|---|
| claude-sonnet-4-5 | Anthropic | 段階課金、料金ページをご覧ください | Anthropic Claude Sonnet 4.5 — a pinned dated snapshot of the Sonnet 4.5 release, kept available for workloads that need byte-stable behaviour across runs. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| glm-5.2 | 智谱 | $1.4000 | $4.4000 | 1M tokens あたり | Zhipu GLM-5.2 — 長時間のコーディングエージェント業務に特化したフラッグシップ基盤モデル。コンテキスト長を伸ばしただけではなく、数か月に及ぶ専用の学習によって作られています。1M トークンのコンテキストウィンドウと最大 128K トークンの出力を備え、入力も出力もテキストのみです。複数の思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。 |
| gpt-5.6-luna | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT-5.6 Luna — GPT-5.6 で最も高速かつ低価格なティア。推論、視覚、ツール利用を保ちながら、コスト重視の大量処理ワークロードに最適化されています。テキストと画像の入力、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力に対応します。 | ||
| step-asr | StepFun | $0.1444 | 音声1時間あたり | StepFun step-asr — 中国語、英語、中国語方言に対応する汎用音声認識モデル。文字起こし、議事録作成、通話品質チェック、音声検索に利用できます。ogg、mp3、wav のアップロードを受け付けます。文字起こしの出力は課金対象外です。 | |
| step-audio-2 | StepFun | $1.4930 | $10.4480 | 1M tokens あたり | StepFun step-audio-2 — 文字起こしを経ずに音声を直接扱うエンドツーエンド音声モデルで、声のトーンや話し方がそのままモデルの理解に反映されます。トークン単位で課金され、入力レートは StepAudio 2.5 系列と同じ、出力レートはより高く設定されています。StepFun はこのモデル固有の機能ページを公開していないため、現行のパラメータについてはプラットフォームの音声ドキュメントを参照してください。 |
| gemini-2.5-flash | 段階課金、料金ページをご覧ください | Google Gemini 2.5 Flash — a fast, low-cost multimodal model with a 1M-token context window. Accepts text, images, video and audio; audio input is billed at the vendor's separate audio rate. | |||
| claude-sonnet-4-6 | Anthropic | 段階課金、料金ページをご覧ください | Anthropic Claude Sonnet 4.6 — the balanced Sonnet generation, offering a 1,000,000-token context window at standard pricing with up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer, so the same text yields roughly 30% fewer tokens than on 4.7-and-later models at the same per-token rate. | ||
| agnes-image-2.1-flash | Agnes AI | $0.000 | 1回あたり | Agnes AI Image 2.1 Flash — 情報密度の高いシーンに向けたディテール重視の画像生成・編集モデル。テキストから画像生成、画像から画像生成、複数画像の合成に対応し、1K〜4K の柔軟なサイズとアスペクト比を選べます。 | |
| claude-fable-5 | Anthropic | 段階課金、料金ページをご覧ください | Anthropic Claude Fable 5 — 野心的で長時間にわたるナレッジワークとコーディングに向けた、Anthropic の一般提供モデルで最も高性能なモデル。数日規模のエージェントタスク、複雑なソフトウェアエンジニアリング、ディープリサーチ、ドキュメントと視覚の推論、能動的な自己検証のために設計されています。 | ||
| claude-haiku-4-5 | Anthropic | 段階課金、料金ページをご覧ください | Anthropic Claude Haiku 4.5 — the fastest Claude model with near-frontier intelligence, built for high-volume, latency-sensitive work such as classification, extraction, and routing. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| happyhorse-1.1-i2v | 阿里巴巴 | $0.091 | 1秒あたり | Alibaba HappyHorse 1.1(I2V)— 質感、クリップ間の ID 一貫性、モーションの滑らかさ、音声と映像の同期を改善した画像から動画生成。720P / 1080P。 | |
| MiniMax-M2.7 | MiniMax | $0.3000 | $1.2000 | 1M tokens あたり | MiniMax M2.7 — チャット、コーディング、オフィス業務、エージェントタスクに向けたテキストモデル。204,800 トークンのコンテキストウィンドウを備え、出力はおよそ毎秒 60 トークンです。テキスト専用で、API が受け付けるのはテキストとツール呼び出しのコンテンツブロックのみです(画像や動画は不可)。ツール呼び出しに対応します。思考は常時有効で、無効にできません。 |
| gpt-4.1-mini | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT-4.1 mini — the small GPT-4.1 variant. Being non-reasoning, its prose stays more predictable than the reasoning tier at a comparable price, which suits writing and rewriting work. It takes text and image input, with a 1,047,576-token context window and up to 32,768 output tokens. | ||
| kimi-k2.7-code | Moonshot | $0.7600 | $3.1570 | 1M tokens あたり | Moonshot Kimi K2.7 Code — Kimi のコーディング専用モデル。ベンダーの計測では、K2.6 と比べて指示の遵守と長時間のコーディングが向上し、考えすぎが平均でおよそ 30% 減っています。256K のコンテキストウィンドウ、既定 32,768 トークンの出力。テキスト、画像、動画を Base64 コンテンツとして受け付け、テキストを返します。思考は必須で、無効にするとエラーになります。tool_choice は auto または none に限られ、reasoning_content は多段階のツール呼び出しをまたいで引き回す必要があります。 |
| kling-3.0-turbo | 快手 | $0.560 | 1回あたり | Kuaishou Kling 3.0 Turbo — Kling 3.0 系列のバリューティア。プロンプトまたは先頭フレーム画像から、720P または 1080P(既定は 720P)の動画を 3〜15 秒(既定 5 秒)、16:9、9:16、1:1 で生成します。ネイティブ音声は常に含まれ、オン・オフの切り替えはありません。kling-v3 と比べると、速度とコストと引き換えに 4K ティア、最終フレーム制御、動画入力が使えません。720p 5 秒(音声あり)で約 $0.56。 | |
| mimo-v2.5-tts | Xiaomi | $0.0000 | 1万文字あたり | Xiaomi MiMo v2.5 TTS — 表現力のある音声合成モデル。組み込み音声を 8 種備え、中国語 4 種と英語 4 種(Mia、Chloe、Milo、Dean)で、中国語と英語に加えて東北方言、四川方言、河南方言、広東語のスタイルをカバーします。話し方は 2 通りで指示できます。自然言語によるスタイル指示と、基本感情・複合感情、息づかい、ため息、間の取り方を指定するインラインの音声タグで、MiMo TTS 系列ではこのモデルだけが持つ歌唱モードも含みます。出力は 24 kHz モノラルの wav または pcm16 で、低遅延ストリーミングに対応します(ストリーミングには pcm16 が必要です)。コンテキストは 8K、最大出力も 8K です。 | |
| step-asr-1.1 | StepFun | $0.3370 | 音声1時間あたり | StepFun step-asr-1.1 — 中国語、英語、中国語方言に対応する step-asr 系列の汎用音声認識モデルの更新版。ogg、mp3、wav のアップロードを受け付けます。文字起こしの出力は課金対象外です。 | |
| step-audio-r1.5 | StepFun | $1.4930 | $15.6720 | 1M tokens あたり | StepFun step-audio-r1.5 — step-audio-2 と同系列のエンドツーエンド音声モデル。入力レートは同じで、出力は 50% 高く課金されます。StepFun はこのモデル固有の機能ページを公開していないため、現行のパラメータについてはプラットフォームの音声ドキュメントを参照してください。 |
| step-image-edit-2 | StepFun | $0.003 | 1回あたり | StepFun Step Image Edit 2 — テキストから画像生成と画像編集を統合した 6B 未満のパラメータのモデルで、12B〜20B 級のオープンウェイト編集モデルに匹敵します。1 回の編集を 1〜2 秒で完了し、低遅延の対話的なレタッチ向けに設計されています。256x256、512x512、768x768、1024x1024、1280x800、800x1280 に対応し、ネガティブプロンプトとテキスト最適化モードも利用できます。1 リクエストにつき画像 1 枚。OpenAI 互換の images エンドポイントで提供されます。 | |
| wan2.7-image-pro | 阿里巴巴 | $0.064 | 1回あたり | Alibaba Wan 2.7 Image Pro — Wan 2.7 画像系列のプロフェッショナルティア。テキストから画像生成、連続した画像の組、画像編集、複数画像を参照した生成に対応し、プロンプト追従性が向上しています。テキストから画像生成は 4K(4096x4096)まで到達し、1K と 2K のティア、および 768x768 からのカスタムサイズを選べます。編集モードと連続生成モードは 2K が上限です。参照画像は最大 9 枚(JPEG、JPG、PNG、BMP、WEBP、各辺 240〜8000 px、1 枚あたり 20 MB まで)、アスペクト比は 1:8 から 8:1、プロンプトは最大 5000 文字です。出力は PNG です。 | |
| doubao-seedance-2-0-fast-260128 | 字节跳动 | $4.2000 | $4.2000 | 1M tokens あたり | ByteDance Seedance 2.0 Fast — 費用対効果の高い動画生成。Seedance 2.0 の機能一式を備えつつ、480p と 720p、24 fps、4〜15 秒に制限されます。テキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、画像 1〜9 枚と合計 15 秒までの参照動画最大 3 本によるマルチモーダル参照生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールに対応します。音声参照は画像または動画と併せて指定する必要があります。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応します。480p 5 秒で約 $0.26。 |
| claude-opus-5 | Anthropic | 段階課金、料金ページをご覧ください | Anthropic Claude Opus 5 — 複雑なエージェント型コーディングと企業業務に向けた深い推論モデル。長時間タスク、コードレビュー、ドキュメントワークフロー、視覚、マルチエージェント連携で大幅に向上しています。1,000,000 トークンのコンテキストウィンドウを持ち、最大 128,000 トークンの出力に対応し、適応的な思考をデフォルトで有効にします。 | ||
| deepseek-v4-flash-vision-exp | DeepSeek | 段階課金、料金ページをご覧ください | DeepSeek V4 Flash Vision (experimental) — the V4 Flash tier with image input, priced identically to deepseek-v4-flash on every face. Images are converted to tokens by their size and billed together with text at the input rate, so there is no separate image charge. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. The vendor labels this tier experimental; behaviour and availability may change without notice. Text and images in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| doubao-seedance-2-0-260128 | 字节跳动 | $7.0000 | $7.0000 | 1M tokens あたり | ByteDance Seedance 2.0 — Seedance 2.0 系列のフラッグシップで、480p と 720p に加えて 1080p と 4K(10 bit 深度)に到達する系列唯一のモデル。24 fps、4〜15 秒。テキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、画像 1〜9 枚と合計 15 秒までの参照動画最大 3 本によるマルチモーダル参照生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールに対応します。音声参照は画像または動画と併せて指定する必要があります。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応し、最終フレームを画像として取得できます。出力解像度に応じて課金されます。 |
| doubao-seedream-5-0-260128 | 字节跳动 | $0.033 | 1回あたり | ByteDance Doubao Seedream 5.0-lite — より賢く制御しやすい創作、リアルタイム検索、被写体の一貫性を強化したテキストから画像生成と画像から画像生成(2K 以上の解像度)。 | |
| kling-v3 | 快手 | $0.420 | 1回あたり | Kuaishou Kling 3.0 — ネイティブ音声と要素の一貫性を高めたテキストから動画生成と画像から動画生成。クリップは 3〜15 秒(既定 5 秒)、16:9、9:16、1:1 で、ティアは mode で選びます。std が 720P、pro が 1080P、4k がネイティブ 4K です。音声は sound=on によるオプトインで、既定はオフです。画像から動画生成は先頭フレームを取り、最終フレームは任意で指定できます。$0.083/秒(720p)から。 | |
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | 1M tokens あたり | Xiaomi MiMo-V2.5-Pro — 1M コンテキストと最大 128K 出力を備えた 1 兆パラメータ級(アクティブ 42B)のフラッグシップで、高負荷のエージェントワークロード向けに調整されています。深い思考、関数呼び出し、構造化出力、ウェブ検索に対応します。テキスト生成のみ。mimo-v2.5 とは異なり、ベンダーの機能一覧にフルモダリティ理解は含まれていません。 |
| step-1o-turbo-vision | StepFun | $0.3850 | $1.2330 | 1M tokens あたり | StepFun step-1o-turbo-vision — 画像と動画の理解に高速なテキスト生成を組み合わせた 32K コンテキストのモデル。テキスト、画像、動画を入力として受け付け、返すのはテキストのみです。互換性のために残されている前世代の視覚モデルで、同じ入力モダリティは step-3.7-flash が 256K コンテキストと選択可能な推論の深さでカバーします。認識精度を保つため、画像は長辺 4096 ピクセル以下に収めてください。 |
| wan2.7-image | 阿里巴巴 | $0.030 | 1回あたり | Alibaba Wan2.7 Image — テキストから画像生成、画像編集、複数画像を参照した生成、対話的な編集に対応。テキスト描画と指示追従に強みがあります。 | |
| gemini-3.1-flash-image | 段階課金、料金ページをご覧ください | Google Gemini 3.1 Flash Image(Nano Banana 2)— 高品質な画像生成と対話的な編集に向けた安定版の低遅延モデル。テキスト、画像、PDF を受け付け、思考と検索グラウンディングに対応し、大量生成のワークフロー向けに 0.5K、1K、2K、4K の画像を生成できます。 | |||
| qwen3.8-max | 阿里巴巴 | $1.9000 | $5.7000 | 1M tokens あたり | Alibaba Qwen3.8-Max — 2.4-trillion-parameter MoE flagship and the most capable model in the Qwen family, with the vendor citing major gains in coding and office productivity. 1,000,000-token context window (991,808 max input, 983,616 in thinking mode), up to 131,072 output tokens, and a 262,144-token chain-of-thought budget. Accepts text input and returns text (image/video input is not available on the current serving route); supports function calling, structured outputs, and context caching. |
| happyhorse-1.1-t2v | 阿里巴巴 | $0.091 | 1秒あたり | Alibaba HappyHorse 1.1(T2V)— 意味理解、カメラ制御、ダイナミックな生成を改善したテキストから動画生成。滑らかで細部まで描き込まれ、物理的に破綻のない 720P / 1080P の動画を生成します。 | |
| MiniMax-M3 | MiniMax | 段階課金、料金ページをご覧ください | MiniMax M3 — エージェント的な推論、ツール利用、構造化されたタスク実行に向けた最先端のマルチモーダルコーディングモデル。1,000,000 トークンのコンテキストウィンドウを備えます。テキスト、最大 10 MB の画像、インラインで最大 50 MB(Files API 経由なら最大 512 MB)の動画を入力として受け付け、テキストを返します。ツール呼び出しに対応し、思考は常時ではなく任意です。 | ||
| qwen3-tts-flash | 阿里巴巴 | $0.1100 | 1万文字あたり | Alibaba Qwen3-TTS-Flash — 低遅延の音声合成モデル。表現力のある組み込み音声を 17 種備え、中国語、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語に対応するほか、言語が混在するテキスト向けの自動モードと方言出力も利用できます。1 リクエストにつき最大 512 トークンのテキストを受け付け、ストリーミングと非ストリーミングの両方の合成に対応します。 | |
| gpt-5.6-terra | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT-5.6 Terra — 日々の専門業務に向けたバランス型の GPT-5.6 モデル。Sol より低コストで高い知能とコーディングエージェント性能を提供します。テキストと画像の入力、組み込みツール、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力に対応します。 | ||
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | 1M tokens あたり | Xiaomi MiMo-V2.5 — 1M コンテキストと最大 128K 出力を備えたネイティブなフルモダリティモデルで、画像、動画、音声、テキストを 1 つのモデルで理解します。深い思考、関数呼び出し、構造化出力、ウェブ検索に対応し、フルモダリティのエージェント機能を備えます。 |
| step-tts-mini | StepFun | $0.1444 | 1万文字あたり | StepFun step-tts-mini — StepFun の TTS 系列で費用対効果と低遅延を重視したモデル。step-tts-2 と同じ言語(中国語、英語、中国語と英語の混在、日本語、加えて広東語と四川語)をカバーし、組み込み音声はその一部を利用できます。自然言語による感情と話し方のラベル指定と、約 10 秒の参照音声からのゼロショット音声クローンに対応します。出力は wav、mp3、flac、opus、pcm です。 | |
| gemini-3.1-flash-lite-image | 段階課金、料金ページをご覧ください | Google Gemini 3.1 Flash-Lite Image(Nano Banana 2 Lite)— 大量の画像生成と高速なマルチターン編集に向けた、超低遅延で費用対効果の高いモデル。テキストと画像を受け付けて 1K の画像を生成し、思考と対話的な編集に対応します。対話的な開発者向け・コンシューマー向けアプリケーションのために設計されています。 | |||
| gpt-4o | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT-4o — the multimodal GPT-4 generation model, kept in the catalogue for drop-in compatibility with existing integrations that call it by name. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| qwen3.6-plus | 阿里巴巴 | $0.4000 | $2.4000 | 1M tokens あたり | Alibaba Qwen3.6-Plus — 汎用的な推論とツール利用に向けたバランス型モデル。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 65,536 トークンの出力、81,920 トークンの思考トークン予算を備えます。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出し、構造化出力、ウェブ検索、プレフィックス補完、コンテキストキャッシュに対応します。 |
| step-asr-1.1-stream | StepFun | $0.3852 | 音声1時間あたり | StepFun step-asr-1.1 — the updated general-purpose recognizer in the step-asr line, covering Chinese, English, and Chinese dialects. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| claude-opus-4-7 | Anthropic | 段階課金、料金ページをご覧ください | Anthropic Claude Opus 4.7 — 難度の高いソフトウェアエンジニアリングと、複雑で長時間実行されるエージェントタスクに向けた高度な推論モデル。厳密な指示追従、自己検証、信頼できるツール利用、そしてインターフェース、画像、ドキュメント、専門業務にわたる高解像度の視覚を重視しています。 | ||
| qwen3.6-flash | 阿里巴巴 | $0.2500 | $1.5000 | 1M tokens あたり | Alibaba Qwen3.6-Flash — 高速な視覚言語モデル。ベンダーはエージェント型コーディングと空間知能を強みとして挙げており、物体の位置特定と検出が大きく向上しています。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 65,536 トークンの出力、131,072 トークンの思考トークン予算を備えます。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出しとコンテキストキャッシュに対応します。 |
| claude-sonnet-5 | Anthropic | 段階課金、料金ページをご覧ください | Anthropic Claude Sonnet 5 — コーディング、エージェント、企業ワークフローに向けて最先端の知能と速度を両立させた実運用モデル。計画を立て、ブラウザやターミナルのツールを使い、推論、ナレッジワーク、ソフトウェアエンジニアリングのタスクを自律的に遂行できます。 | ||
| gemini-2.5-pro | 段階課金、料金ページをご覧ください | Google Gemini 2.5 Pro — the reasoning-tier model of the 2.5 family, with a 1M-token context window. Prompts above 200,000 tokens are repriced at the vendor's long-context rate for the whole request, matching Google's own rule. | |||
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | 1M tokens あたり | StepFun step-3.7-flash — sparse MoE with 198B total and 11B active parameters, native 256K context, and native understanding of images and video alongside text. Reasoning depth is selectable per request through reasoning_effort (low / medium / high), and the model supports reliable multi-step tool calling, JSON Schema structured output, streaming, and prompt caching. Tuned for agent and coding workloads. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| MiniMax-Hailuo-02 | MiniMax | $0.280 | 1回あたり | MiniMax Hailuo 02 — テキストから動画生成と画像から動画生成の両方をカバーする低価格の動画生成。24 fps で、512p と 768p は 6 秒または 10 秒のクリップ、1080p は 6 秒に対応します。512p ティアは Hailuo 系列の入り口です。 | |
| gemini-3.7-flash | 段階課金、料金ページをご覧ください | Google Gemini 3.7 Flash — the newest Flash-tier multimodal reasoning model, priced identically to 3.6 Flash while the vendor promotion runs. Accepts text, images, video, audio and PDFs; supports thinking, function calling, code execution, search grounding and structured output. Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5.1 | 智谱 | $1.4000 | $4.4000 | 1M tokens あたり | Zhipu GLM-5.1 — 長時間の自律作業のために作られたフラッグシップ基盤モデル。ベンダーは、計画、実行、テスト、反復的な最適化にわたって、単一のタスクを最長 8 時間無人で連続実行できると記載しています。200K のコンテキストウィンドウ、最大 128K トークンの出力、入力も出力もテキストのみ。複数の思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。 |
| gpt-5.2 | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT-5.2 — a general-purpose model from the GPT-5.2 generation, kept in the catalogue for drop-in compatibility with integrations that call it by name. It takes text and image input, with a 400,000-token context window and up to 128,000 output tokens. | ||
| speech-2.8-turbo | MiniMax | $0.6000 | 1万文字あたり | MiniMax speech-2.8-turbo — 2.8 音声系列の低遅延ティア。HD モデルの超リアルな表現を手放す代わりに、自然な流れを保ったまま高速に合成します。対応する 40 言語と 7 種類の感情は HD と同じで、ピッチ、話速、音量、サンプルレート、ビットレート、出力形式を設定できます。非同期では最大 100 万文字、ストリーミングインターフェースでは最大 10,000 文字を受け付けます。 | |
| wan3.0-video | 阿里巴巴 | $0.089 | 1秒あたり | Alibaba Wan3.0 (Video) — an all-in-one video model that unifies text-to-video, image-to-video and reference-to-video behind a single endpoint. Generates H.264 MP4 at 480P, 720P or 1080P, up to 30 seconds, from a prompt and an optional first-frame image URL. Billed per second of generated video against the vendor's own ladder: 720P is the base rate, 480P is charged at half of it and 1080P at double. A request that does not name a resolution is produced at 1080P by the model and is charged at that tier. Reference video and reference audio inputs exist in the vendor's model but are not carried on this endpoint. | |
| gpt-4.1 | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT-4.1 — a non-reasoning model tuned for instruction following and long-context work, with a 1,047,576-token context window and up to 32,768 output tokens. It takes text and image input, and its output is priced below the reasoning tier at the same input price. | ||
| agnes-2.0-flash | Agnes AI | $0.0000 | 1M tokens あたり | Agnes AI Agnes 2.0 Flash — 256K の入力コンテキストと 64K の参考出力上限を備えた高速なマルチモーダルエージェントモデル。チャット、ストリーミング、ツール呼び出し、コーディング、推論、画像理解、エージェントワークフローに対応します。 | |
| agnes-image-2.0-flash | Agnes AI | $0.000 | 1回あたり | Agnes AI Image 2.0 Flash — テキストから画像生成、画像から画像生成、複数画像の合成に対応する高速な画像生成・編集モデル。生成結果は URL または Base64 データとして受け取れます。 | |
| gpt-image-2 | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT Image 2 — a state-of-the-art image generation and editing model for fast, high-quality output. It takes text and image input, supports flexible image sizes and high-fidelity image inputs, and bills per token rather than per call: $5 text input, $1.25 cached text input, $8 image input, and $30 image output per 1M tokens. | ||
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | 1万文字あたり | Xiaomi MiMo の音声デザインモデル。instructions で望む声を自然言語で記述すると、その設計どおりの声で音声を合成します。 | |
| wan2.7-i2v | 阿里巴巴 | $0.080 | 1秒あたり | Alibaba Wan 2.7 Image-to-Video — 先頭フレームからの生成、先頭・最終フレーム間のトランジション、既存クリップの継続に対応します。720P または 1080P(既定は 1080P)で 2〜15 秒(既定 5 秒)を生成し、プロンプトは最大 5000 文字(ネガティブプロンプトは最大 500 文字)です。2〜30 秒の mp3 または wav を driving_audio として渡せます。音声を指定しない場合はモデルが合う BGM や効果音を生成し、クリップより長い音声は切り詰められ、短い場合は末尾が無音になります。 | |
| doubao-seed-2-1-pro-260628 | 字节跳动 | $0.8890 | $4.4440 | 1M tokens あたり | ByteDance Doubao Seed 2.1 Pro — 実運用向けの Doubao フラッグシップエージェントモデル。深い思考、テキスト生成、マルチモーダル理解、ツール呼び出し、構造化出力に対応し、構造化出力にはベンダーが json_schema モードを推奨しています。256K のコンテキストウィンドウ(最大入力 256K)、最大 256K トークンの出力(既定 4K)、256K の思考トークン予算を備えます。テキスト、画像、動画を受け付け、テキストを返します。2.1 系列に音声理解は挙げられていません。プレフィックスキャッシュとセッションキャッシュを含む、暗黙的および明示的なコンテキストキャッシュに対応します。 |
| gemini-3.1-flash-lite | 段階課金、料金ページをご覧ください | Google Gemini 3.1 Flash-Lite — 高頻度の軽量タスク、大量のエージェントワークフロー、翻訳、構造化データ抽出に向けた低遅延で費用対効果の高いマルチモーダルモデル。テキスト、画像、動画、音声、PDF を受け付け、思考とツール利用に対応し、1,048,576 トークンの入力コンテキストと最大 65,536 トークンの出力を提供します。 | |||
| gpt-5.4-mini | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT-5.4 mini — the small GPT-5.4 model for high-volume workloads, coding, computer use, and subagents. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 400,000-token context window with a 272,000-token maximum input, and up to 128,000 output tokens. | ||
| image-01 | MiniMax | $0.004 | 1回あたり | MiniMax image-01 — MiniMax 独自の image_generation エンドポイントによるテキストから画像生成。生成された画像ごとに課金されます。ベンダーはレガシーモデルとして掲載しています。 | |
| kling-v3-omni | 快手 | $0.420 | 1回あたり | Kling 3.0 Omni — 参照ベースの複数画像による動画生成。表示価格は std ティア(720p、5 秒、音声なし、参照動画なし)のものです。mode を指定しないリクエストは上流のデフォルトである pro ティアとなり、1.33 倍で課金されます(同じ 5 秒のクリップで約 $0.56)。4k は 5 倍で課金されます。表示価格で利用するには mode=std を渡してください。 | |
| qwen3.7-max | 阿里巴巴 | $1.5000 | $4.5000 | 1M tokens あたり | Alibaba Qwen3.7-Max — プログラミング、オフィス業務と生産性、長期の自律実行に向けたクローズドソースのフラッグシップ。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 131,072 トークンの出力、262,144 トークンの思考トークン予算を備えます。入力も出力もテキストのみです。関数呼び出し、構造化出力、コンテキストキャッシュに対応します。 |
| doubao-seedream-4-5-251128 | 字节跳动 | $0.037 | 1回あたり | ByteDance Doubao Seedream 4.5 — 複数画像の融合に対応したテキストから画像生成と画像から画像生成。1 枚の画像、または関連する画像の組を出力します。単一画像モードはプロンプトのみ、参照画像 1 枚、または参照画像 2〜14 枚を受け付けます。グループモード(sequential_image_generation=auto)はテキストから最大 15 枚、参照画像 1 枚から最大 14 枚、参照画像 2〜14 枚からは入力と出力の合計が 15 枚以下に収まる組を返します。2K と 4K の出力に対応し、既定では JPEG を URL または Base64 で返します。座標指定による対話的な編集は Seedream 5.0 pro 専用です。 | |
| gpt-4o-mini | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT-4o mini — the small, low-cost GPT-4o variant for high-volume and latency-sensitive work. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens. | ||
| kimi-k3 | Moonshot | $3.0000 | $15.0000 | 1M tokens あたり | Moonshot Kimi K3 — 2.8 兆パラメータのフラッグシップ。長時間のコーディング、エンドツーエンドのナレッジワーク、深い推論に向けて設計され、1M トークンのコンテキストウィンドウと最大 1,048,576 トークンの出力(既定は 131,072)を備えます。テキスト、Base64 画像、動画を入力として受け付け、テキストを返します。思考は常に有効で、reasoning_effort は low、high、max から選べます(既定は max)。temperature は 1.0 に固定です。カスタムツール呼び出しとツールの動的読み込みに対応します。 |
| stepaudio-2.5-tts | StepFun | $0.8500 | 1万文字あたり | StepFun StepAudio 2.5 TTS — 話し方を後処理として扱うのではなく、理解を生成パイプライン全体に通す文脈対応の音声合成モデル。声、感情、間の取り方を、リクエスト全体に効くグローバルな文脈と、個々の箇所に効くインラインの文脈という 2 つのレベルで自然言語により指示できます。ゼロショット音声クローンには約 3 秒の参照音声が必要で、文脈制御の機能一式をそのまま引き継ぎます。1 リクエストにつき最大 1000 文字。出力は wav、mp3、flac、opus です。 | |
| stepaudio-2.5-asr | StepFun | $0.0220 | 音声1時間あたり | StepFun StepAudio 2.5 ASR — Multi-Token Prediction を基盤とする 4B パラメータの音声認識モデルで、5 分の音声を約 1 秒で文字起こしします(RTF は約 0.0053)。中国語と英語に最適化されています。逆テキスト正規化、話者識別、通話・会議録音向けの 2 チャンネル分離を備えます。ogg、mp3、wav のアップロードを受け付けます。文字起こしの出力は課金対象外です。 | |
| wan2.7-t2v | 阿里巴巴 | $0.080 | 1秒あたり | Alibaba Wan2.7(T2V)— 演技表現、繊細な感情、激しいアクション、劇的なカメラカットを強化したテキストから動画生成。720P または 1080P の H.264 MP4 を 2〜15 秒(既定 5 秒)、16:9、9:16、1:1、4:3、3:4 で生成し、プロンプトは最大 5000 文字です。音声は既定で含まれます。audio_url を指定しなければモデルが合う BGM や効果音を作り、代わりに 2〜30 秒の wav または mp3 を渡すこともできます。 | |
| deepseek-v4-flash | DeepSeek | 段階課金、料金ページをご覧ください | DeepSeek V4 Flash 0731 — the fast, high-concurrency DeepSeek V4 tier for chat, coding help, and agent loops, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3.5-flash | 段階課金、料金ページをご覧ください | Google Gemini 3.5 Flash — 持続的なエージェント性能、高速なコーディングループ、サブエージェントの展開、長時間の多段階ワークフローに最適化された安定版のマルチモーダルモデル。テキスト、画像、動画、音声、PDF を受け付け、思考と組み込みツールに対応し、1,048,576 トークンの入力コンテキストと最大 65,536 トークンの出力を提供します。 | |||
| glm-5.3 | 智谱 | $1.4000 | $4.4000 | 1M tokens あたり | Zhipu GLM-5.3 — flagship coding-and-agent model post-trained on the same base as GLM-5.2: a 50% gain on Zhipu's internal coding bench, open-source SOTA on Terminal-Bench 3.0 and Agents' Last Exam, and state-of-the-art CyberGym vulnerability-discovery results, with a 1M-token context window and up to 128K output tokens. Text in, text out. Supports multiple thinking modes, function calling, structured JSON output, streaming, context caching, and MCP tool integration. |
| hy3 | Tencent | $0.1480 | $0.5930 | 1M tokens あたり | Tencent Hunyuan 3(Hy3)— 295B パラメータ(アクティブ 21B)の MoE モデルで、ネイティブ 256K コンテキストと 3 段階の思考モード(fast / low / deep)を備えます。コーディングエージェント、長文ドキュメントの理解、マルチターンの文脈保持、多段階のエージェントワークフローに強みがあります。テキスト専用。 |
| MiniMax-H3 | MiniMax | $0.080 | 1秒あたり | MiniMax H3(Hailuo 3.0)— 次世代のオープンな汎用マルチモーダル動画モデル。ネイティブのステレオ音声を 1 パスで生成し、768P または 2K、4〜15 秒(整数のみ)、24 fps で出力します。テキストから動画生成、先頭フレームまたは最終フレーム(あるいはその両方)からの画像から動画生成、そして画像・動画・音声を素材とする参照生成に対応し、キャラクター、モーション、カメラワーク、スタイル、声、編集のリズムを指定できます。画像から動画生成と参照生成は 1 リクエストで併用できません。入力は H.264/H.265 の動画、JPG、JPEG、PNG、WEBP、HEIC、HEIF の画像、WAV または MP3 の音声を受け付け、プロンプトは最大 7000 文字です。768P で $0.08/秒、2K で $0.13/秒。 | |
| agnes-2.5-flash | Agnes AI | $0.0000 | 1M tokens あたり | Agnes AI Agnes 2.5 Flash — 512K の入力コンテキストと 65.5K の参考出力上限を備えた高速なマルチモーダルエージェントモデル。チャット、ストリーミング、ツール呼び出し、コーディング、推論、マルチターン対話、画像理解、エージェントワークフローに対応します。 | |
| agnes-video-v2.0 | Agnes AI | $0.000 | 1秒あたり | Agnes AI Video V2.0 — テキストから動画生成、画像から動画生成、複数画像によるキーフレーム、シネマティックなモーションに対応する非同期の動画生成モデル。480p / 720p / 1080p に正規化された出力ティアをサポートします。 | |
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | 1回あたり | MiniMax Hailuo 2.3 — ベンダーが指示追従性を売りにするテキストから動画生成と画像から動画生成。24 fps で、768p は 6 秒または 10 秒のクリップ、1080p は 6 秒に対応します。768p 6 秒で $0.28。 | |
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | 1M tokens あたり | StepFun step-3.5-flash — 256K コンテキストのテキスト専用推論モデル。論理、数学、ソフトウェアエンジニアリング、ディープリサーチなど、推論品質と高速で安定した実行の両方が求められる領域を想定しています。推論の深さは reasoning_effort(low / medium / high)でリクエストごとに選択できます。ツール呼び出し、JSON Schema による構造化出力、ストリーミング、プロンプトキャッシュに対応します。画像や動画を入力する場合は step-3.7-flash を使用してください。 |
| kimi-k2.7-code-highspeed | Moonshot | $1.9000 | $8.0000 | 1M tokens あたり | Moonshot Kimi K2.7 Code Highspeed — K2.7 Code のスループット重視ティア。同じモデルを毎秒およそ 180 トークン、短いコンテキストでは最大 260 トークンで提供します。256K のコンテキストウィンドウ、既定 32,768 トークンの出力。テキスト、画像、動画を Base64 コンテンツとして受け付け、テキストを返します。思考は必須で、無効にするとエラーになります。tool_choice は auto または none に限られ、reasoning_content は多段階のツール呼び出しをまたいで引き回す必要があります。 |
| deepseek-v4-pro | DeepSeek | 段階課金、料金ページをご覧ください | DeepSeek V4 Pro 0813 — the higher-capability DeepSeek V4 tier for coding, reasoning, and agentic work, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. | ||
| gemini-3-pro-image | 段階課金、料金ページをご覧ください | Google gemini-3-pro-image | |||
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | 1万文字あたり | Xiaomi MiMo の音声クローンモデル。voice フィールドに参照音声をデータ URL(data:{mime};base64,...)として渡すと、学習・アノテーション・ファインチューニングの工程なしにその声で音声を合成します。MP3(audio/mpeg)または WAV を受け付け、Base64 エンコード後の文字列は 10 MB までです。参照音声の最短長は Xiaomi が公開していません。自然言語によるスタイル指示とインラインの音声タグは mimo-v2.5-tts から引き継がれますが、ストリーミングは利用できません。リクエストは互換モードで実行され、合成が完了してから返されます。 | |
| qwen3-asr-flash | 阿里巴巴 | $0.1260 | 音声1時間あたり | Alibaba Qwen3-ASR-Flash — Qwen3 基盤モデルの上に構築された音声認識モデル。話されている言語を自動判定し、11 言語を文字起こしします。Qwen3-ASR 系列は標準中国語に加えて四川語、閩南語、呉語、広東語、そして複数の英語アクセントを挙げています。aac、amr、avi、aiff、flac、flv、mkv、mp3、mpeg、ogg、opus、wav、webm、wma、wmv を受け付け、1 リクエストにつき最大 5 分・10 MB です。pcm 入力は 16 kHz である必要があり、それ以外の形式は認識前に 16 kHz へリサンプリングされます。 | |
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | 1M tokens あたり | StepFun step-3.5-flash-2603 — step-3.5-flash のエージェント向けにチューニングされた 256K スナップショットで、トークン効率と低推論モードでの動作に最適化されています。reasoning_effort パラメータは low と high のみを受け付け、ベースモデルの 3 段階とは異なるため、medium を送信するコードは修正が必要です。テキスト専用。ツール呼び出し、JSON Schema による構造化出力、ストリーミング、プロンプトキャッシュに対応します。 |
| stepaudio-2-asr-pro | StepFun | $0.3370 | 音声1時間あたり | StepFun StepAudio 2 ASR Pro — 32B パラメータの音声認識モデル。StepFun の ASR 系列では精度を最優先する選択肢で、速度とコストを優先する場合は stepaudio-2.5-asr を選びます。ogg、mp3、wav のアップロードを受け付けます。文字起こしの出力は課金対象外です。 | |
| glm-5-turbo | 智谱 | $1.2000 | $4.0000 | 1M tokens あたり | Zhipu GLM-5-Turbo — スループット重視の GLM-5 バリアントで、エージェントワークフロー向けに最適化されています。多段階タスクでのツールとスキルの呼び出しがより安定し、複雑で長い連鎖の指示への対応が向上し、スケジュール実行や長時間実行のタスクにも対応します。200K のコンテキストウィンドウ、最大 128K トークンの出力、入力も出力もテキストのみ。思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。 |
| mimo-v2.5-asr | Xiaomi | $0.0740 | 音声1時間あたり | 中国語と英語に加えて中国語方言に最適化された Xiaomi MiMo の音声認識モデル。雑音下、遠距離、複数話者の音声のほか、歌詞の書き起こしにも対応します。 | |
| glm-tts | 智谱 | $0.2963 | 1万文字あたり | Zhipu GLM-TTS — GRPO 強化学習を用いた 2 段階生成アーキテクチャに基づく音声合成モデル。明示的なマークアップを求めず、前後の文脈から感情と抑揚を推定します。組み込み音声を 7 種(既定の tongtong、xiaochen、chuichui、jam、kazi、douji、luodo)備え、速度と音量を調整できます。1 リクエストにつき最大 1024 文字を受け付け、初回フレームまでの遅延 400 ms 未満でストリーミングします。出力は wav または pcm で、推奨サンプルレートは 24 kHz です。ストリーミングは pcm のみです。 | |
| gpt-5.5 | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT-5.5 — 複雑なコーディングと専門業務に向けた最先端の推論モデル。テキストと画像の入力、関数呼び出しと組み込みツール、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力、そして none から xhigh までの推論強度に対応します。 | ||
| deepseek-v4-flash-legacy | DeepSeek | $0.1190 | $0.2370 | 1M tokens あたり | DeepSeek V4 Flash (legacy tier) — a lower-priced route to the V4 Flash model family. Input and output tokens are cheaper than on deepseek-v4-flash, while cache reads are priced higher, so prompt-caching-heavy workloads are usually cheaper on deepseek-v4-flash and low-reuse workloads are cheaper here. Responses may come from an earlier V4 Flash build. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns. |
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | 1回あたり | MiniMax Hailuo 2.3 Fast — Hailuo 2.3 の速度とコストを重視したティア。画像から動画生成と、物理的な動きのリアリティに焦点を当てています。24 fps で、768p は 6 秒または 10 秒のクリップ、1080p は 6 秒に対応します。768p 6 秒で $0.19。 | |
| qwen3.7-plus | 阿里巴巴 | $0.3400 | $1.3600 | 1M tokens あたり | Alibaba Qwen3.7-Plus — マルチモーダルなハイブリッドエージェントモデル。実世界のシーンを認識し、画面を読んで GUI を操作し、視覚的な参照からコードを生成し、モバイルアプリ内でエンドツーエンドのナビゲーションを行います。1,000,000 トークンのコンテキストウィンドウ(最大入力 991,808、思考モードでは 983,616)、最大 131,072 トークンの出力、262,144 トークンの思考トークン予算を備えます。テキスト、画像、動画を入力として受け付け、テキストを返します。関数呼び出し、構造化出力、コンテキストキャッシュに対応します。 |
| stepaudio-2.5-asr-stream | StepFun | $0.1800 | 音声1時間あたり | StepFun StepAudio 2.5 ASR — 4B-parameter speech recognition model built on Multi-Token Prediction, transcribing five minutes of audio in about one second (RTF around 0.0053). Optimized for Chinese and English. Includes inverse text normalization, speaker identification, and dual-channel separation for call and meeting recordings. Accepts ogg, mp3, and wav uploads; transcript output is not billed. | |
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | 1M tokens あたり | StepFun StepAudio 2.5 Chat — エンドツーエンドの音声理解モデル。音声またはテキストを入力として受け取り、テキストを返します。ためらいや笑いといったパラ言語的な手がかりを、文字起こしではなく波形そのものから読み取ります。キャラクター、話し方の癖、感情の幅にわたる幅広いペルソナのカスタマイズに対応します。音声は chat completions エンドポイントの input_audio コンテンツパートとして渡します。音声で応答させたい場合は TTS モデルを使用してください。 |
| gemini-3.6-flash | 段階課金、料金ページをご覧ください | Google Gemini 3.6 Flash — a stable multimodal reasoning model that balances speed and intelligence for agentic and real-world tasks, with a 1,048,576-token input context and 65,536-token output limit. It accepts text, images, video, audio, and PDFs, and supports thinking, function calling, code execution, search grounding, structured output, and Computer Use (preview). Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity. | |||
| glm-5 | 智谱 | $1.0000 | $3.2000 | 1M tokens あたり | Zhipu GLM-5 — 総パラメータ 744B・アクティブ 40B の MoE モデル。28.5T トークンで学習し、DeepSeek Sparse Attention を採用しています。200K のコンテキストウィンドウと最大 128K トークンの出力を備え、入力も出力もテキストのみです。複数の思考モード、関数呼び出し、構造化 JSON 出力、ストリーミング、コンテキストキャッシュ、MCP ツール連携に対応します。 |
| glm-5v-turbo | 智谱 | $1.2000 | $4.0000 | 1M tokens あたり | Zhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows. |
| kimi-k2.6 | Moonshot | $0.7600 | $3.1570 | 1M tokens あたり | Moonshot Kimi K2.6 — 対話、コード生成、視覚理解、エージェントタスクに向けた汎用モデル。前世代より長時間のコード記述と自律実行が強化されています。256K のコンテキストウィンドウ、既定 32,768 トークンの出力。テキスト、画像(png、jpeg、webp、gif)、動画(mp4、mov、webm ほか)を Base64 コンテンツとして受け付け、テキストを返します。思考モードは既定で有効で、無効にもできます。temperature は思考ありで 1.0、思考なしで 0.6 に固定です。 |
| step-1o-audio | StepFun | $3.7070 | $8.8980 | 1M tokens あたり | StepFun step-1o-audio — 多言語対応とツール呼び出しを備えた前世代のエンドツーエンド音声モデル。1 回のやり取りは最大 30 分です。おおむね StepAudio 2.5 系列に置き換えられており、すでにこのモデルで構築されたワークロードのために残されています。 |
| glm-asr-2512 | 智谱 | $0.1440 | 音声1時間あたり | Zhipu GLM-ASR-2512 — 文字誤り率 0.0717 を公表する音声認識モデル。標準中国語に加えて四川語、広東語、閩南語、呉語、アメリカ英語とイギリス英語のアクセント、さらにフランス語、ドイツ語、日本語、韓国語、スペイン語、アラビア語を含む数十の言語をカバーします。言語が混在する発話、専門用語、口語的な話し方も扱え、専門語彙のためのカスタム辞書を受け付けます。音声は 1 リクエストにつき 30 秒・25 MB までで、バッチとストリーミングの両方の文字起こしに対応します。 | |
| gpt-5.4 | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT-5.4 — a frontier model for complex professional work and coding, priced well below GPT-5.5. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 1,050,000-token context window, and up to 128,000 output tokens. Prompts above 272,000 input tokens are repriced at 2x input and 1.5x output for the whole session. | ||
| gpt-5.6-sol | OpenAI | 段階課金、料金ページをご覧ください | OpenAI GPT-5.6 Sol — 最先端の推論、複雑な専門業務、コーディング、科学、サイバーセキュリティ、長時間のエージェントワークフローに向けた GPT-5.6 のフラッグシップモデル。テキストと画像の入力、組み込みツール、1,050,000 トークンのコンテキストウィンドウ、最大 128,000 トークンの出力、そしてこのファミリーで最も深い推論設定に対応します。 | ||
| speech-2.8-hd | MiniMax | $1.0000 | 1万文字あたり | MiniMax speech-2.8-hd — 2.8 音声系列の高音質ティア。サウンドタグを伴う超リアルな表現を狙った位置づけで、40 言語と 7 種類の感情に対応します。ピッチ、話速、音量、サンプルレート、ビットレート、出力形式はリクエストごとに設定でき、長文合成は非同期で最大 100 万文字、ストリーミングインターフェースで最大 10,000 文字を受け付けます。 | |
| claude-opus-4-8 | Anthropic | 段階課金、料金ページをご覧ください | Anthropic Claude Opus 4.8 — コーディング、エージェントワークフロー、専門的な分析、長時間の作業に向けた高性能な推論モデル。Opus 4.7 と比べて信頼性、判断力、ツール利用の効率、コンピュータ操作、マルチモーダルなドキュメント推論が向上し、1,000,000 トークンのコンテキストウィンドウに対応します。 | ||
| happyhorse-1.1-r2v | 阿里巴巴 | $0.091 | 1秒あたり | Alibaba HappyHorse 1.1(R2V)— 最大 9 枚の参照画像を使う参照画像から動画生成。被写体・シーン・スタイルの一貫性とカメラ制御に優れます。720P / 1080P。 | |
| step-tts-2 | StepFun | $0.4000 | 1万文字あたり | StepFun step-tts-2 — 正確なアクセント再現のために設計された NTP ベースのエンドツーエンド音声合成モデル。中国語、英語、中国語と英語の混在、日本語に加え、広東語と四川語を話します。感情と話し方は自然言語のラベルで指示でき、ゼロショット音声クローンには約 10 秒の参照音声が必要です。感情とスタイルの制御はクローンした声にも追加費用なしで引き継がれます。出力は wav、mp3、flac、opus、pcm です。 | |
| wan2.7-r2v | 阿里巴巴 | $0.080 | 1秒あたり | Alibaba Wan2.7(R2V)— 参照から動画生成。最大 5 点の画像 / 動画の混在参照と音色参照に対応し、キャラクター・小道具・シーンの一貫性を強化しています。 | |
| wan2.7-videoedit | 阿里巴巴 | $0.080 | 1秒あたり | Alibaba Wan2.7 VideoEdit — 自然言語による局所的または全体的な動画編集、参照画像による要素の置き換え、モーション / エフェクト / カメラワークの再現。 | |
| doubao-seedance-2-5-260628 | 字节跳动 | $10.7000 | $10.7000 | 1M tokens あたり | ByteDance Seedance 2.5 — Seedance の主系列モデル。1 回の生成を 24 fps で 4〜30 秒まで伸ばす一方、解像度は 480p と 720p に制限されます。マルチモーダル参照生成は画像 1〜30 枚、参照動画最大 10 本、参照音声最大 10 本(それぞれ合計 30 秒まで)に対応し、2.0 系列とは異なり音声参照を単独で使えます。ほかにテキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールにも対応します。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応します。 |
| claude-opus-4-5 | Anthropic | 段階課金、料金ページをご覧ください | Anthropic Claude Opus 4.5 — a pinned dated snapshot of the Opus 4.5 release for workloads that need byte-stable behaviour. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens. | ||
| claude-opus-4-6 | Anthropic | 段階課金、料金ページをご覧ください | Anthropic Claude Opus 4.6 — the Opus generation for complex reasoning and agentic work, with a 1,000,000-token context window at standard pricing and up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer. | ||
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | 1M tokens あたり | Meituan LongCat-2.0 — ネイティブ 1M コンテキストを備えた 1.6T パラメータのオープン MoE モデルで、エージェント型コーディングと長時間のツール利用のために設計されています。テキスト専用の推論モデル。 |
| doubao-seedance-2-0-mini-260615 | 字节跳动 | $1.4000 | $1.4000 | 1M tokens あたり | ByteDance Seedance 2.0 Mini — Seedance 2.0 系列の軽量で低予算向けのティア。480p と 720p、24 fps、4〜15 秒に制限されます。文書化された機能一式は系列のほかのモデルと同じで、テキストから動画生成、先頭フレームおよび先頭・最終フレームからの画像から動画生成、画像 1〜9 枚と合計 15 秒までの参照動画最大 3 本によるマルチモーダル参照生成、動画編集、動画の延長、音声付き生成、ウェブ検索ツールに対応します。音声参照は画像または動画と併せて指定する必要があります。出力は MP4 で、21:9、16:9、4:3、1:1、3:4、9:16 に対応します。 |
| gemini-2.5-flash-image | 段階課金、料金ページをご覧ください | Google Gemini 2.5 Flash Image (Nano Banana) — a fast native image generation and editing model for creative workflows. It takes text and image input and returns images through the OpenAI-compatible chat completions endpoint, with a 65,536-token input limit and 32,768-token output limit. | |||
| MiniMax-M2.7-highspeed | MiniMax | $0.6000 | $2.4000 | 1M tokens あたり | MiniMax M2.7 Highspeed — 同じ M2.7 モデルを毎秒およそ 100 トークンで提供する、低遅延のコーディングとエージェントワークフロー向けのティア。204,800 トークンのコンテキストウィンドウを備えます。テキスト専用で、API が受け付けるのはテキストとツール呼び出しのコンテンツブロックのみです(画像や動画は不可)。ツール呼び出しに対応します。思考は常時有効で、無効にできません。 |
| doubao-seed-2-1-turbo-260628 | 字节跳动 | $0.4440 | $2.2220 | 1M tokens あたり | ByteDance Doubao Seed 2.1 Turbo — Seed 2.1 系列の低遅延レーン。Pro と同じ枠を共有し、256K のコンテキストウィンドウ(最大入力 256K)、最大 256K トークンの出力(既定 4K)、256K の思考トークン予算を備えます。深い思考、テキスト生成、マルチモーダル理解、ツール呼び出し、構造化出力に対応しますが、Pro のような json_schema の推奨はありません。テキスト、画像、動画を受け付け、テキストを返します。2.1 系列に音声理解は挙げられていません。暗黙的および明示的なコンテキストキャッシュに対応します。 |