중국 AI 모델 요금

ChinaAPI는 DeepSeek, Qwen, GLM, Kimi를 비롯한 중국 AI 모델을 OpenAI 호환 게이트웨이 https://api.chinaapi.ai/v1 하나로 제공합니다. 모든 요금은 미국 달러 기준이며, 상위 공급업체가 제시하는 단위로 표기합니다. 같은 목록은 /api/pricing에서 JSON으로도 받을 수 있습니다.

공개 모델 요금
모델공급업체입력출력단위설명
claude-sonnet-4-5Anthropic구간별 과금, 요금 페이지를 참조하세요Anthropic Claude Sonnet 4.5 — a pinned dated snapshot of the Sonnet 4.5 release, kept available for workloads that need byte-stable behaviour across runs. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens.
glm-5.2智谱$1.4000$4.40001M tokens당Zhipu GLM-5.2 — 컨텍스트 확장만이 아니라 수개월에 걸친 전용 학습을 통해 장기 실행 코딩 에이전트 업무에 특화한 플래그십 파운데이션 모델로, 1M 토큰 컨텍스트 창과 최대 128K 토큰 출력을 갖췄습니다. 텍스트 입력, 텍스트 출력. 여러 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다.
gpt-5.6-lunaOpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT-5.6 Luna — GPT-5.6 중 가장 빠르고 저렴한 등급으로, 추론과 비전, 도구 사용을 유지하면서 비용에 민감한 대량 워크로드에 최적화되었습니다. 텍스트와 이미지 입력, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력을 지원합니다.
step-asrStepFun$0.1444오디오 1시간당StepFun step-asr — 중국어, 영어, 중국어 방언을 포괄하는 범용 음성 인식 모델로 전사, 회의록 작성, 통화 품질 검토, 음성 검색에 활용합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
step-audio-2StepFun$1.4930$10.44801M tokens당StepFun step-audio-2 — 전사 결과가 아니라 오디오를 직접 입력받는 종단 간 음성 모델로, 어조와 말하기 방식이 모델의 이해 단계까지 그대로 전달됩니다. 토큰 단위로 과금되며 입력 요금은 StepAudio 2.5 계열과 같고 출력 요금은 더 높습니다. StepFun은 이 모델의 별도 기능 문서를 제공하지 않으므로 현재 파라미터는 플랫폼 오디오 문서를 참고하세요.
gemini-2.5-flashGoogle구간별 과금, 요금 페이지를 참조하세요Google Gemini 2.5 Flash — a fast, low-cost multimodal model with a 1M-token context window. Accepts text, images, video and audio; audio input is billed at the vendor's separate audio rate.
claude-sonnet-4-6Anthropic구간별 과금, 요금 페이지를 참조하세요Anthropic Claude Sonnet 4.6 — the balanced Sonnet generation, offering a 1,000,000-token context window at standard pricing with up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer, so the same text yields roughly 30% fewer tokens than on 4.7-and-later models at the same per-token rate.
agnes-image-2.1-flashAgnes AI$0.000요청당Agnes AI Image 2.1 Flash — 정보 밀도가 높은 장면을 위한 디테일 중심 이미지 생성 및 편집 모델. 텍스트-이미지, 이미지-이미지, 다중 이미지 합성을 지원하며 1K~4K 범위의 유연한 크기와 화면비를 선택할 수 있습니다.
claude-fable-5Anthropic구간별 과금, 요금 페이지를 참조하세요Anthropic Claude Fable 5 — 야심 차고 오래 이어지는 지식 노동과 코딩을 위한, Anthropic의 일반 출시 모델 가운데 가장 뛰어난 모델. 여러 날에 걸친 에이전트 작업, 복잡한 소프트웨어 엔지니어링, 심층 리서치, 문서 및 비전 추론, 선제적인 자기 검증을 위해 설계되었습니다.
claude-haiku-4-5Anthropic구간별 과금, 요금 페이지를 참조하세요Anthropic Claude Haiku 4.5 — the fastest Claude model with near-frontier intelligence, built for high-volume, latency-sensitive work such as classification, extraction, and routing. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens.
happyhorse-1.1-i2v阿里巴巴$0.091초당Alibaba HappyHorse 1.1(I2V) — 질감, 클립 간 인물 일관성, 동작의 유려함, 오디오-영상 동기화가 개선된 이미지-비디오 생성. 720P/1080P.
MiniMax-M2.7MiniMax$0.3000$1.20001M tokens당MiniMax M2.7 — 채팅, 코딩, 사무 업무, 에이전트 작업을 위한 텍스트 모델로, 204,800 토큰 컨텍스트 창을 갖추고 초당 약 60 토큰으로 출력합니다. 텍스트 전용이며, API는 텍스트와 도구 호출 콘텐츠 블록만 받고 이미지나 비디오는 받지 않습니다. 도구 호출을 지원하며 사고는 항상 켜져 있어 끌 수 없습니다.
gpt-4.1-miniOpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT-4.1 mini — the small GPT-4.1 variant. Being non-reasoning, its prose stays more predictable than the reasoning tier at a comparable price, which suits writing and rewriting work. It takes text and image input, with a 1,047,576-token context window and up to 32,768 output tokens.
kimi-k2.7-codeMoonshot$0.7600$3.15701M tokens당Moonshot Kimi K2.7 Code — Kimi의 코딩 전용 모델로, 공급사 측정에 따르면 K2.6 대비 지시 준수와 장기 실행 코딩이 향상되면서 과도한 사고는 평균 약 30% 줄었습니다. 256K 컨텍스트 창, 기본 출력 32,768 토큰. 텍스트, 이미지, 비디오를 base64 콘텐츠로 받아 텍스트를 반환합니다. 사고는 필수이며 비활성화하면 오류가 발생합니다. tool_choice는 auto 또는 none으로 제한되고, reasoning_content는 여러 단계의 도구 호출을 거치는 동안 계속 전달해야 합니다.
kling-3.0-turbo快手$0.560요청당Kuaishou Kling 3.0 Turbo — Kling 3.0 라인의 가성비 등급으로, 프롬프트 또는 첫 프레임 이미지에서 720P 또는 1080P(기본값 720P) 영상을 3~15초(기본값 5초), 16:9, 9:16, 1:1 비율로 생성합니다. 네이티브 오디오는 항상 포함되며 켜고 끄는 스위치가 없습니다. kling-v3와 비교하면 속도와 비용을 얻는 대신 4K 등급, 마지막 프레임 제어, 영상 입력을 포기했습니다. 720p 5초 오디오 포함 ≈ $0.56.
mimo-v2.5-ttsXiaomi$0.00001만 자당Xiaomi MiMo v2.5 TTS — 내장 음성 8종을 갖춘 표현력 있는 음성 합성 모델로, 중국어 4종과 영어 4종(Mia, Chloe, Milo, Dean)을 제공하며 중국어와 영어에 더해 둥베이, 쓰촨, 허난, 광둥 방언 스타일을 지원합니다. 발화 방식은 두 가지로 지시합니다. 자연어 스타일 지시와, 기본 감정 및 복합 감정, 숨소리, 한숨, 호흡 조절을 지정하는 인라인 오디오 태그이며, 여기에는 MiMo TTS 라인에서 이 모델에만 있는 노래 모드도 포함됩니다. 24 kHz 모노 wav 또는 pcm16을 반환하고 저지연 스트리밍을 지원하며, 스트리밍에는 pcm16이 필요합니다. 컨텍스트 8K, 최대 출력 8K.
step-asr-1.1StepFun$0.3370오디오 1시간당StepFun step-asr-1.1 — 중국어, 영어, 중국어 방언을 포괄하는 step-asr 계열 범용 인식 모델의 개선판. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
step-audio-r1.5StepFun$1.4930$15.67201M tokens당StepFun step-audio-r1.5 — step-audio-2와 같은 계열의 종단 간 음성 모델. 입력 요금은 동일하고 출력은 50% 높게 과금됩니다. StepFun은 이 모델의 별도 기능 문서를 제공하지 않으므로 현재 파라미터는 플랫폼 오디오 문서를 참고하세요.
step-image-edit-2StepFun$0.003요청당StepFun Step Image Edit 2 — 텍스트-이미지 생성과 이미지 편집을 통합한 6B 미만 파라미터 모델로, 12B~20B급 오픈 웨이트 편집 모델에 필적합니다. 한 번의 편집을 1~2초에 완료하며 낮은 지연 시간의 대화형 리터칭을 위해 설계되었습니다. 256x256, 512x512, 768x768, 1024x1024, 1280x800, 800x1280을 지원하고 네거티브 프롬프트와 텍스트 최적화 모드를 제공하며, 요청당 이미지 한 장을 생성합니다. OpenAI 호환 images 엔드포인트로 제공됩니다.
wan2.7-image-pro阿里巴巴$0.064요청당Alibaba Wan 2.7 Image Pro — Wan 2.7 이미지 라인의 전문가 등급으로, 텍스트-이미지 생성, 연속 이미지 세트, 이미지 편집, 다중 참조 이미지 기반 생성을 지원하며 프롬프트 준수력이 향상되었습니다. 텍스트-이미지 생성은 4K(4096x4096)까지 도달하고 1K와 2K 등급, 768x768부터의 사용자 지정 크기를 제공하며, 편집 모드와 연속 생성 모드는 2K가 상한입니다. 참조 이미지는 최대 9장(JPEG, JPG, PNG, BMP, WEBP, 각 변 240~8,000 px, 장당 20 MB), 화면비는 1:8부터 8:1까지, 프롬프트는 최대 5,000자입니다. PNG를 반환합니다.
doubao-seedance-2-0-fast-260128字节跳动$4.2000$4.20001M tokens당ByteDance Seedance 2.0 Fast — 비용 효율적인 영상 생성으로, Seedance 2.0의 기능 전체를 갖추되 480p와 720p, 24 fps, 4~15초로 제한됩니다. 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 이미지 1~9장과 합계 15초 이내의 참조 영상 최대 3개를 사용하는 멀티모달 참조 기반 생성, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구를 지원합니다. 오디오 참조는 반드시 이미지나 영상과 함께 제공해야 합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환합니다. 480p 5초 ≈ $0.26.
claude-opus-5Anthropic구간별 과금, 요금 페이지를 참조하세요Anthropic Claude Opus 5 — 복잡한 에이전트 코딩과 엔터프라이즈 업무를 위한 심층 추론 모델로, 장기 실행 작업, 코드 리뷰, 문서 워크플로, 비전, 멀티 에이전트 협업에서 크게 향상되었습니다. 1,000,000 토큰 컨텍스트 창을 갖추고 최대 128,000 토큰 출력을 지원하며 적응형 사고가 기본 활성화됩니다.
deepseek-v4-flash-vision-expDeepSeek구간별 과금, 요금 페이지를 참조하세요DeepSeek V4 Flash Vision (experimental) — the V4 Flash tier with image input, priced identically to deepseek-v4-flash on every face. Images are converted to tokens by their size and billed together with text at the input rate, so there is no separate image charge. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. The vendor labels this tier experimental; behaviour and availability may change without notice. Text and images in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
doubao-seedance-2-0-260128字节跳动$7.0000$7.00001M tokens당ByteDance Seedance 2.0 — Seedance 2.0 라인의 플래그십이자 480p와 720p에 더해 1080p와 4K(10비트 심도)까지 도달하는 라인의 유일한 모델로, 24 fps에 4~15초입니다. 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 이미지 1~9장과 합계 15초 이내의 참조 영상 최대 3개를 사용하는 멀티모달 참조 기반 생성, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구를 지원합니다. 오디오 참조는 반드시 이미지나 영상과 함께 제공해야 합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환하며 마지막 프레임을 이미지로 받을 수 있습니다. 출력 해상도에 따라 과금됩니다.
doubao-seedream-5-0-260128字节跳动$0.033요청당ByteDance Doubao Seedream 5.0-lite — 더 똑똑하고 제어하기 쉬운 창작, 실시간 검색, 향상된 피사체 일관성을 갖춘 텍스트-이미지 및 이미지-이미지 생성(2K 이상 해상도).
kling-v3快手$0.420요청당Kuaishou Kling 3.0 — 네이티브 오디오와 향상된 요소 일관성을 갖춘 텍스트-비디오 및 이미지-비디오 생성. 클립은 3~15초(기본값 5초), 16:9, 9:16, 1:1 비율이며 등급은 mode로 선택합니다. std가 720P, pro가 1080P, 4k가 네이티브 4K입니다. 오디오는 sound=on으로 직접 켜야 하며 기본값은 꺼짐입니다. 이미지-비디오는 첫 프레임을 받고 마지막 프레임은 선택 사항입니다. 초당 $0.083부터(720p).
mimo-v2.5-proXiaomi$0.4350$0.87001M tokens당Xiaomi MiMo-V2.5-Pro — 1M 컨텍스트와 최대 128K 출력을 갖춘 조 단위 파라미터 플래그십(활성 42B)으로, 고강도 에이전트 워크로드에 맞게 튜닝되었습니다. 심층 사고, 함수 호출, 구조화된 출력, 웹 검색을 지원합니다. 텍스트 생성 전용으로, mimo-v2.5와 달리 공급사의 기능 목록에 전 모달리티 이해는 포함되어 있지 않습니다.
step-1o-turbo-visionStepFun$0.3850$1.23301M tokens당StepFun step-1o-turbo-vision — 이미지와 비디오 이해에 빠른 텍스트 생성을 더한 32K 컨텍스트 모델. 텍스트, 이미지, 비디오를 입력받고 텍스트만 반환합니다. 호환성을 위해 유지되는 이전 세대 비전 모델이며, 동일한 입력 모달리티는 step-3.7-flash가 256K 컨텍스트와 선택 가능한 추론 강도로 처리합니다. 인식 정확도를 위해 이미지의 긴 변은 4096 픽셀 이하로 유지하세요.
wan2.7-image阿里巴巴$0.030요청당Alibaba Wan2.7 Image — 텍스트-이미지 생성, 이미지 편집, 다중 이미지 참조 생성, 대화형 편집을 지원하며 텍스트 렌더링과 지시 준수에 강합니다.
gemini-3.1-flash-imageGoogle구간별 과금, 요금 페이지를 참조하세요Google Gemini 3.1 Flash Image(Nano Banana 2) — 고품질 이미지 생성과 대화형 편집을 위한 안정 버전 저지연 모델. 텍스트, 이미지, PDF를 입력받고 사고와 검색 그라운딩을 지원하며, 대량 제작 워크플로를 위해 0.5K, 1K, 2K, 4K 이미지를 생성할 수 있습니다.
qwen3.8-max阿里巴巴$1.9000$5.70001M tokens당Alibaba Qwen3.8-Max — 2.4-trillion-parameter MoE flagship and the most capable model in the Qwen family, with the vendor citing major gains in coding and office productivity. 1,000,000-token context window (991,808 max input, 983,616 in thinking mode), up to 131,072 output tokens, and a 262,144-token chain-of-thought budget. Accepts text input and returns text (image/video input is not available on the current serving route); supports function calling, structured outputs, and context caching.
happyhorse-1.1-t2v阿里巴巴$0.091초당Alibaba HappyHorse 1.1(T2V) — 의미 이해, 카메라 제어, 역동적인 생성이 향상된 텍스트-비디오 생성. 유려하고 세밀하며 물리적으로 일관된 720P/1080P 영상을 만듭니다.
MiniMax-M3MiniMax구간별 과금, 요금 페이지를 참조하세요MiniMax M3 — 에이전트형 추론, 도구 사용, 구조화된 작업 수행을 위한 최전선 멀티모달 코딩 모델로, 1,000,000 토큰 컨텍스트 창을 갖췄습니다. 텍스트, 최대 10 MB 이미지, 인라인으로 최대 50 MB(Files API를 거치면 512 MB) 비디오를 입력받아 텍스트를 반환합니다. 도구 호출을 지원하며 사고는 항상 켜져 있지 않고 선택 사항입니다.
qwen3-tts-flash阿里巴巴$0.11001만 자당Alibaba Qwen3-TTS-Flash — 표현력 있는 내장 음성 17종을 갖춘 저지연 음성 합성 모델. 중국어, 영어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 일본어, 한국어, 프랑스어, 러시아어를 지원하며, 언어가 섞인 텍스트를 위한 자동 모드와 방언 출력도 제공합니다. 요청당 최대 512 토큰의 텍스트를 받으며 스트리밍과 비스트리밍 합성을 모두 지원합니다.
gpt-5.6-terraOpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT-5.6 Terra — 일상적인 전문 업무를 위한 균형형 GPT-5.6 모델로, Sol보다 낮은 비용으로 높은 지능과 코딩 에이전트 성능을 제공합니다. 텍스트와 이미지 입력, 내장 도구, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력을 지원합니다.
mimo-v2.5Xiaomi$0.1400$0.28001M tokens당Xiaomi MiMo-V2.5 — 1M 컨텍스트와 최대 128K 출력을 갖춘 네이티브 전 모달리티 모델로, 이미지와 비디오, 오디오, 텍스트를 하나의 모델에서 이해합니다. 심층 사고, 함수 호출, 구조화된 출력, 웹 검색을 지원하며 전 모달리티 에이전트 기능을 갖췄습니다.
step-tts-miniStepFun$0.14441만 자당StepFun step-tts-mini — StepFun TTS 계열에서 비용 효율과 낮은 지연 시간을 중시한 모델로, step-tts-2와 같은 언어(중국어, 영어, 중국어-영어 혼용, 일본어, 그리고 광둥어와 쓰촨어)를 지원하며 내장 음성은 그중 일부를 제공합니다. 자연어 감정 및 어조 레이블과 약 10초 분량 참조 오디오를 이용한 제로샷 음성 복제를 지원합니다. 출력 형식은 wav, mp3, flac, opus, pcm입니다.
gemini-3.1-flash-lite-imageGoogle구간별 과금, 요금 페이지를 참조하세요Google Gemini 3.1 Flash-Lite Image(Nano Banana 2 Lite) — 대량 이미지 생성과 빠른 멀티턴 편집을 위한 초저지연 비용 효율 모델. 텍스트와 이미지를 입력받아 1K 이미지를 생성하고 사고와 대화형 편집을 지원하며, 대화형 개발자 및 소비자 애플리케이션을 위해 설계되었습니다.
gpt-4oOpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT-4o — the multimodal GPT-4 generation model, kept in the catalogue for drop-in compatibility with existing integrations that call it by name. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens.
qwen3.6-plus阿里巴巴$0.4000$2.40001M tokens당Alibaba Qwen3.6-Plus — 범용 추론과 도구 사용을 위한 균형형 모델로, 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 65,536 토큰 출력, 81,920 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다. 함수 호출, 구조화된 출력, 웹 검색, 접두사 완성, 컨텍스트 캐싱을 지원합니다.
step-asr-1.1-streamStepFun$0.3852오디오 1시간당StepFun step-asr-1.1 — the updated general-purpose recognizer in the step-asr line, covering Chinese, English, and Chinese dialects. Accepts ogg, mp3, and wav uploads; transcript output is not billed.
claude-opus-4-7Anthropic구간별 과금, 요금 페이지를 참조하세요Anthropic Claude Opus 4.7 — 어려운 소프트웨어 엔지니어링과 복잡하고 오래 이어지는 에이전트 작업을 위한 고급 추론 모델. 엄밀한 지시 준수, 자기 검증, 신뢰할 수 있는 도구 사용, 그리고 인터페이스와 이미지, 문서, 전문 업무 전반에 걸친 고해상도 비전을 강조합니다.
qwen3.6-flash阿里巴巴$0.2500$1.50001M tokens당Alibaba Qwen3.6-Flash — 공급사가 에이전트형 코딩과 공간 지능을 강점으로 내세우는 빠른 비전-언어 모델로, 객체 위치 파악과 검출에서 뚜렷한 향상을 보입니다. 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 65,536 토큰 출력, 131,072 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다. 함수 호출과 컨텍스트 캐싱을 지원합니다.
claude-sonnet-5Anthropic구간별 과금, 요금 페이지를 참조하세요Anthropic Claude Sonnet 5 — 코딩, 에이전트, 엔터프라이즈 워크플로를 위해 최전선 지능과 속도를 균형 있게 갖춘 프로덕션 모델. 계획을 세우고 브라우저와 터미널 도구를 사용하며, 추론과 지식 노동, 소프트웨어 엔지니어링 작업을 자율적으로 수행할 수 있습니다.
gemini-2.5-proGoogle구간별 과금, 요금 페이지를 참조하세요Google Gemini 2.5 Pro — the reasoning-tier model of the 2.5 family, with a 1M-token context window. Prompts above 200,000 tokens are repriced at the vendor's long-context rate for the whole request, matching Google's own rule.
step-3.7-flashStepFun$0.2000$1.15001M tokens당StepFun step-3.7-flash — sparse MoE with 198B total and 11B active parameters, native 256K context, and native understanding of images and video alongside text. Reasoning depth is selectable per request through reasoning_effort (low / medium / high), and the model supports reliable multi-step tool calling, JSON Schema structured output, streaming, and prompt caching. Tuned for agent and coding workloads. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
MiniMax-Hailuo-02MiniMax$0.280요청당MiniMax Hailuo 02 — 텍스트-비디오와 이미지-비디오를 모두 지원하는 저비용 영상 생성 모델로, 24 fps에서 512p와 768p는 6초 또는 10초 클립, 1080p는 6초를 제공합니다. 512p 등급은 Hailuo 라인의 진입점입니다.
gemini-3.7-flashGoogle구간별 과금, 요금 페이지를 참조하세요Google Gemini 3.7 Flash — the newest Flash-tier multimodal reasoning model, priced identically to 3.6 Flash while the vendor promotion runs. Accepts text, images, video, audio and PDFs; supports thinking, function calling, code execution, search grounding and structured output. Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity.
glm-5.1智谱$1.4000$4.40001M tokens당Zhipu GLM-5.1 — 장시간 자율 작업을 위해 만들어진 플래그십 파운데이션 모델. 공급사는 계획, 실행, 테스트, 반복적 최적화에 걸쳐 하나의 작업을 최대 8시간 동안 사람 개입 없이 연속 수행할 수 있다고 밝히고 있습니다. 200K 컨텍스트 창, 최대 128K 토큰 출력, 텍스트 입력과 텍스트 출력. 여러 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다.
gpt-5.2OpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT-5.2 — a general-purpose model from the GPT-5.2 generation, kept in the catalogue for drop-in compatibility with integrations that call it by name. It takes text and image input, with a 400,000-token context window and up to 128,000 output tokens.
speech-2.8-turboMiniMax$0.60001만 자당MiniMax speech-2.8-turbo — 2.8 음성 라인의 저지연 등급으로, HD 모델의 초현실적인 표현을 내주는 대신 자연스러운 흐름을 유지하면서 더 빠르게 합성합니다. 지원하는 40개 언어와 7가지 감정은 HD와 같으며 음높이, 발화 속도, 음량, 샘플레이트, 비트레이트, 출력 형식을 설정할 수 있습니다. 비동기 방식으로는 최대 100만 자, 스트리밍 인터페이스로는 최대 10,000자를 받습니다.
wan3.0-video阿里巴巴$0.089초당Alibaba Wan3.0 (Video) — an all-in-one video model that unifies text-to-video, image-to-video and reference-to-video behind a single endpoint. Generates H.264 MP4 at 480P, 720P or 1080P, up to 30 seconds, from a prompt and an optional first-frame image URL. Billed per second of generated video against the vendor's own ladder: 720P is the base rate, 480P is charged at half of it and 1080P at double. A request that does not name a resolution is produced at 1080P by the model and is charged at that tier. Reference video and reference audio inputs exist in the vendor's model but are not carried on this endpoint.
gpt-4.1OpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT-4.1 — a non-reasoning model tuned for instruction following and long-context work, with a 1,047,576-token context window and up to 32,768 output tokens. It takes text and image input, and its output is priced below the reasoning tier at the same input price.
agnes-2.0-flashAgnes AI$0.00001M tokens당Agnes AI Agnes 2.0 Flash — 256K 입력 컨텍스트와 64K 참고 출력 한도를 갖춘 빠른 멀티모달 에이전트 모델. 채팅, 스트리밍, 도구 호출, 코딩, 추론, 이미지 이해, 에이전트 워크플로를 지원합니다.
agnes-image-2.0-flashAgnes AI$0.000요청당Agnes AI Image 2.0 Flash — 텍스트-이미지, 이미지-이미지, 다중 이미지 합성을 지원하는 빠른 이미지 생성 및 편집 모델. 생성 결과는 URL 또는 Base64 데이터로 받을 수 있습니다.
gpt-image-2OpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT Image 2 — a state-of-the-art image generation and editing model for fast, high-quality output. It takes text and image input, supports flexible image sizes and high-fidelity image inputs, and bills per token rather than per call: $5 text input, $1.25 cached text input, $8 image input, and $30 image output per 1M tokens.
mimo-v2.5-tts-voicedesignXiaomi$0.00001만 자당Xiaomi MiMo 음성 디자인 모델: instructions에 원하는 목소리를 자연어로 서술하면 그대로 설계된 목소리로 음성을 합성합니다.
wan2.7-i2v阿里巴巴$0.080초당Alibaba Wan 2.7 Image-to-Video — 첫 프레임 기반 생성, 첫 프레임과 마지막 프레임 사이의 전환, 기존 클립의 이어 붙이기를 지원합니다. 720P 또는 1080P(기본값 1080P)로 2~15초(기본 5초)를 생성하며 프롬프트는 최대 5,000자, 네거티브 프롬프트는 최대 500자입니다. 2~30초 길이의 mp3 또는 wav를 driving_audio로 전달할 수 있습니다. 오디오를 주지 않으면 모델이 어울리는 배경 음악이나 효과음을 만들고, 클립보다 긴 오디오는 잘리며, 짧은 오디오는 뒷부분을 무음으로 남깁니다.
doubao-seed-2-1-pro-260628字节跳动$0.8890$4.44401M tokens당ByteDance Doubao Seed 2.1 Pro — 프로덕션 업무를 위한 Doubao 플래그십 에이전트 모델로, 심층 사고, 텍스트 생성, 멀티모달 이해, 도구 호출, 구조화된 출력을 지원하며 구조화된 출력에는 공급사가 json_schema 모드를 권장합니다. 256K 컨텍스트 창에 최대 입력 256K, 최대 256K 토큰 출력(기본값 4K), 256K의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며, 2.1 라인에는 오디오 이해가 명시되어 있지 않습니다. 접두사 캐시와 세션 캐시를 포함한 암시적 및 명시적 컨텍스트 캐싱을 지원합니다.
gemini-3.1-flash-liteGoogle구간별 과금, 요금 페이지를 참조하세요Google Gemini 3.1 Flash-Lite — 고빈도 경량 작업, 대량 에이전트 워크플로, 번역, 구조화된 데이터 추출을 위한 저지연 비용 효율 멀티모달 모델. 텍스트, 이미지, 비디오, 오디오, PDF를 입력받고 사고와 도구 사용을 지원하며 1,048,576 토큰 입력 컨텍스트와 최대 65,536 토큰 출력을 제공합니다.
gpt-5.4-miniOpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT-5.4 mini — the small GPT-5.4 model for high-volume workloads, coding, computer use, and subagents. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 400,000-token context window with a 272,000-token maximum input, and up to 128,000 output tokens.
image-01MiniMax$0.004요청당MiniMax image-01 — MiniMax 자체 image_generation 엔드포인트를 통한 텍스트-이미지 생성. 생성된 이미지 단위로 과금됩니다. 공급사는 레거시 모델로 분류하고 있습니다.
kling-v3-omni快手$0.420요청당Kling 3.0 Omni — 참조 이미지 기반 다중 이미지 영상 생성. 표시 가격은 std 등급(720p, 5초, 오디오 없음, 참조 영상 없음) 기준입니다. mode를 지정하지 않은 요청은 업스트림 기본값인 pro 등급으로 처리되어 1.33배가 과금되며, 같은 5초 클립 기준 약 $0.56입니다. 4k는 5배가 과금됩니다. 표시 가격으로 이용하려면 mode=std를 전달하세요.
qwen3.7-max阿里巴巴$1.5000$4.50001M tokens당Alibaba Qwen3.7-Max — 프로그래밍, 사무 및 생산성 업무, 장기 자율 수행을 겨냥한 비공개 소스 플래그십으로, 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 131,072 토큰 출력, 262,144 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트 입력, 텍스트 출력. 함수 호출, 구조화된 출력, 컨텍스트 캐싱을 지원합니다.
doubao-seedream-4-5-251128字节跳动$0.037요청당ByteDance Doubao Seedream 4.5 — 다중 이미지 융합을 지원하는 텍스트-이미지 및 이미지-이미지 생성으로, 단일 이미지 또는 서로 연결된 이미지 세트를 만들어냅니다. 단일 이미지 모드는 프롬프트만, 참조 이미지 한 장, 또는 참조 이미지 2~14장을 받습니다. 그룹 모드(sequential_image_generation=auto)는 텍스트에서 최대 15장, 참조 이미지 한 장에서 최대 14장, 참조 이미지 2~14장에서는 입력과 출력의 합이 15장을 넘지 않는 범위의 세트를 반환합니다. 2K와 4K 출력을 지원하며 기본적으로 JPEG를 URL 또는 base64로 반환합니다. 좌표 기반 대화형 편집은 Seedream 5.0 pro 전용입니다.
gpt-4o-miniOpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT-4o mini — the small, low-cost GPT-4o variant for high-volume and latency-sensitive work. It takes text and image input, with a 128,000-token context window and up to 16,384 output tokens.
kimi-k3Moonshot$3.0000$15.00001M tokens당Moonshot Kimi K3 — 장기 실행 코딩, 종단 간 지식 노동, 심층 추론을 위한 2.8조 파라미터 플래그십으로, 1M 토큰 컨텍스트 창과 최대 1,048,576 토큰의 완성 출력(기본값 131,072)을 갖췄습니다. 텍스트, base64 이미지, 비디오를 입력받아 텍스트를 반환합니다. 사고는 항상 켜져 있으며 reasoning_effort를 low, high, max 중에서 선택할 수 있습니다(기본값 max). temperature는 1.0으로 고정됩니다. 사용자 정의 도구 호출과 도구 동적 로딩을 지원합니다.
stepaudio-2.5-ttsStepFun$0.85001만 자당StepFun StepAudio 2.5 TTS — 발화 방식을 후처리로 다루지 않고 이해를 생성 파이프라인 전체로 이어가는 맥락 인식 음성 합성 모델. 목소리와 감정, 호흡은 요청 전체에 적용되는 전역 컨텍스트와 개별 구절에 적용되는 인라인 컨텍스트라는 두 층위에서 자연어로 지시합니다. 제로샷 음성 복제에는 약 3초 분량의 참조 오디오가 필요하며 맥락 제어 기능 전체를 그대로 물려받습니다. 요청당 최대 1000자를 처리하며 출력 형식은 wav, mp3, flac, opus입니다.
stepaudio-2.5-asrStepFun$0.0220오디오 1시간당StepFun StepAudio 2.5 ASR — Multi-Token Prediction을 기반으로 한 4B 파라미터 음성 인식 모델로, 5분 분량의 오디오를 약 1초에 전사합니다(RTF 약 0.0053). 중국어와 영어에 최적화되어 있습니다. 역텍스트 정규화, 화자 식별, 통화 및 회의 녹음을 위한 이중 채널 분리를 제공합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
wan2.7-t2v阿里巴巴$0.080초당Alibaba Wan2.7(T2V) — 연기력, 섬세한 감정, 강렬한 액션, 극적인 카메라 컷이 향상된 텍스트-비디오 생성. 720P 또는 1080P H.264 MP4를 2~15초(기본 5초), 16:9, 9:16, 1:1, 4:3, 3:4 비율로 생성하며 프롬프트는 최대 5,000자입니다. 오디오는 기본으로 포함됩니다. audio_url을 지정하지 않으면 모델이 어울리는 배경 음악이나 효과음을 만들어 넣고, 대신 2~30초 길이의 wav 또는 mp3 트랙을 제공할 수도 있습니다.
deepseek-v4-flashDeepSeek구간별 과금, 요금 페이지를 참조하세요DeepSeek V4 Flash 0731 — the fast, high-concurrency DeepSeek V4 tier for chat, coding help, and agent loops, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
gemini-3.5-flashGoogle구간별 과금, 요금 페이지를 참조하세요Google Gemini 3.5 Flash — 지속적인 에이전트 성능, 빠른 코딩 루프, 서브 에이전트 배치, 오래 이어지는 다단계 워크플로에 최적화된 안정 버전 멀티모달 모델. 텍스트, 이미지, 비디오, 오디오, PDF를 입력받고 사고와 내장 도구를 지원하며 1,048,576 토큰 입력 컨텍스트와 최대 65,536 토큰 출력을 제공합니다.
glm-5.3智谱$1.4000$4.40001M tokens당Zhipu GLM-5.3 — flagship coding-and-agent model post-trained on the same base as GLM-5.2: a 50% gain on Zhipu's internal coding bench, open-source SOTA on Terminal-Bench 3.0 and Agents' Last Exam, and state-of-the-art CyberGym vulnerability-discovery results, with a 1M-token context window and up to 128K output tokens. Text in, text out. Supports multiple thinking modes, function calling, structured JSON output, streaming, context caching, and MCP tool integration.
hy3Tencent$0.1480$0.59301M tokens당Tencent Hunyuan 3(Hy3) — 295B 파라미터(활성 21B) MoE 모델로, 네이티브 256K 컨텍스트와 세 가지 사고 모드(fast / low / deep)를 갖췄습니다. 코딩 에이전트, 긴 문서 이해, 멀티턴 컨텍스트 유지, 다단계 에이전트 워크플로에 강합니다. 텍스트 전용.
MiniMax-H3MiniMax$0.080초당MiniMax H3(Hailuo 3.0) — 네이티브 스테레오 오디오를 한 번에 함께 생성하는 차세대 오픈 범용 멀티모달 영상 모델. 768P 또는 2K, 4~15초(정수만 허용), 24 fps로 출력합니다. 텍스트-비디오, 첫 프레임과 마지막 프레임 중 하나 또는 둘 다를 사용하는 이미지-비디오, 그리고 이미지·비디오·오디오를 소재로 하는 참조 기반 생성을 지원하며 캐릭터, 모션, 카메라, 스타일, 목소리, 편집 리듬을 지정할 수 있습니다. 이미지-비디오와 참조 기반 생성은 한 요청에서 함께 쓸 수 없습니다. 입력은 H.264/H.265 영상, JPG, JPEG, PNG, WEBP, HEIC, HEIF 이미지, WAV 또는 MP3 오디오를 받으며 프롬프트는 최대 7,000자입니다. 768P는 초당 $0.08, 2K는 초당 $0.13.
agnes-2.5-flashAgnes AI$0.00001M tokens당Agnes AI Agnes 2.5 Flash — 512K 입력 컨텍스트와 65.5K 참고 출력 한도를 갖춘 빠른 멀티모달 에이전트 모델. 채팅, 스트리밍, 도구 호출, 코딩, 추론, 멀티턴 대화, 이미지 이해, 에이전트 워크플로를 지원합니다.
agnes-video-v2.0Agnes AI$0.000초당Agnes AI Video V2.0 — 텍스트-비디오, 이미지-비디오, 다중 이미지 키프레임, 시네마틱 모션을 지원하는 비동기 영상 생성 모델. 480p, 720p, 1080p로 정규화된 출력 등급을 제공합니다.
MiniMax-Hailuo-2.3MiniMax$0.280요청당MiniMax Hailuo 2.3 — 공급사가 지시 준수 능력을 앞세우는 텍스트-비디오 및 이미지-비디오 모델. 24 fps로 출력하며 768p는 6초 또는 10초 클립, 1080p는 6초를 지원합니다. 768p 6초 = $0.28.
step-3.5-flashStepFun$0.1000$0.30001M tokens당StepFun step-3.5-flash — 256K 컨텍스트의 텍스트 전용 추론 모델로, 추론 품질과 빠르고 안정적인 실행이 동시에 필요한 논리, 수학, 소프트웨어 엔지니어링, 심층 리서치 작업을 겨냥합니다. 추론 강도는 reasoning_effort(low / medium / high)로 요청마다 선택할 수 있습니다. 도구 호출, JSON Schema 구조화된 출력, 스트리밍, 프롬프트 캐싱을 지원합니다. 이미지나 비디오 입력이 필요하면 step-3.7-flash를 사용하세요.
kimi-k2.7-code-highspeedMoonshot$1.9000$8.00001M tokens당Moonshot Kimi K2.7 Code Highspeed — K2.7 Code의 처리량 중심 등급으로, 같은 모델을 초당 약 180 토큰, 짧은 컨텍스트 작업에서는 최대 260 토큰으로 제공합니다. 256K 컨텍스트 창, 기본 출력 32,768 토큰. 텍스트, 이미지, 비디오를 base64 콘텐츠로 받아 텍스트를 반환합니다. 사고는 필수이며 비활성화하면 오류가 발생합니다. tool_choice는 auto 또는 none으로 제한되고, reasoning_content는 여러 단계의 도구 호출을 거치는 동안 계속 전달해야 합니다.
deepseek-v4-proDeepSeek구간별 과금, 요금 페이지를 참조하세요DeepSeek V4 Pro 0813 — the higher-capability DeepSeek V4 tier for coding, reasoning, and agentic work, with a 1M-token context window and a 384K maximum output. It runs in both thinking (default) and non-thinking modes and supports tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
gemini-3-pro-imageGoogle구간별 과금, 요금 페이지를 참조하세요Google gemini-3-pro-image
mimo-v2.5-tts-voicecloneXiaomi$0.00001만 자당Xiaomi MiMo 음성 복제 모델: voice 필드에 참조 오디오 샘플을 데이터 URL(data:{mime};base64,...)로 전달하면 학습, 라벨링, 파인튜닝 과정 없이 그 목소리로 음성을 합성합니다. MP3(audio/mpeg) 또는 WAV를 지원하며 base64로 인코딩한 문자열은 10 MB로 제한됩니다. 참조 오디오의 최소 길이는 Xiaomi가 공개하지 않았습니다. 자연어 스타일 지시와 인라인 오디오 태그는 mimo-v2.5-tts에서 그대로 이어지지만 스트리밍은 사용할 수 없습니다. 요청은 호환 모드로 실행되며 합성이 끝난 뒤에 반환됩니다.
qwen3-asr-flash阿里巴巴$0.1260오디오 1시간당Alibaba Qwen3-ASR-Flash — Qwen3 파운데이션 모델 위에 구축된 음성 인식 모델로, 발화 언어를 자동으로 판별해 11개 언어를 전사합니다. Qwen3-ASR 라인은 표준 중국어와 함께 쓰촨어, 민난어, 우어, 광둥어, 그리고 여러 영어 억양을 문서화하고 있습니다. aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma, wmv를 지원하며 요청당 최대 5분, 10 MB입니다. pcm 입력은 16 kHz여야 하고 다른 형식은 인식 전에 16 kHz로 리샘플링됩니다.
step-3.5-flash-2603StepFun$0.1000$0.30001M tokens당StepFun step-3.5-flash-2603 — 토큰 효율과 저추론 운영 모드에 최적화된 step-3.5-flash의 에이전트 튜닝 256K 스냅숏. reasoning_effort 파라미터는 low와 high만 받으며 기본 모델이 지원하는 세 단계와 다르므로 medium을 보내는 코드는 수정해야 합니다. 텍스트 전용이며 도구 호출, JSON Schema 구조화된 출력, 스트리밍, 프롬프트 캐싱을 지원합니다.
stepaudio-2-asr-proStepFun$0.3370오디오 1시간당StepFun StepAudio 2 ASR Pro — 32B 파라미터 음성 인식 모델로, StepFun ASR 계열에서 정확도를 우선하는 선택지입니다. 속도와 비용을 우선한다면 stepaudio-2.5-asr를 사용하세요. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
glm-5-turbo智谱$1.2000$4.00001M tokens당Zhipu GLM-5-Turbo — 처리량을 중시한 GLM-5 변형으로, 에이전트 워크플로에 맞게 최적화되었습니다. 여러 단계에 걸친 작업에서 도구와 스킬 호출이 더 안정적이고, 복잡한 장기 연쇄 지시를 더 잘 처리하며, 예약 실행이나 장시간 실행 작업도 수행합니다. 200K 컨텍스트 창, 최대 128K 토큰 출력, 텍스트 입력과 텍스트 출력. 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다.
mimo-v2.5-asrXiaomi$0.0740오디오 1시간당중국어와 영어, 중국어 방언에 최적화된 Xiaomi MiMo 음성 인식 모델. 잡음이 많거나 원거리에서 녹음된 오디오, 다중 화자 오디오는 물론 가사 전사도 처리합니다.
glm-tts智谱$0.29631만 자당Zhipu GLM-TTS — GRPO 강화학습을 적용한 2단계 생성 아키텍처 기반 음성 합성 모델로, 명시적인 마크업을 요구하지 않고 주변 문맥에서 감정과 억양을 추론합니다. 내장 음성 7종(기본값 tongtong과 xiaochen, chuichui, jam, kazi, douji, luodo)을 제공하며 속도와 음량을 조절할 수 있고, 요청당 최대 1,024자를 받으며 첫 프레임 지연 시간 400 ms 미만으로 스트리밍합니다. 권장 샘플레이트 24 kHz의 wav 또는 pcm을 반환하며 스트리밍은 pcm만 지원합니다.
gpt-5.5OpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT-5.5 — 복잡한 코딩과 전문 업무를 위한 최전선 추론 모델. 텍스트와 이미지 입력, 함수 호출과 내장 도구, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력, none부터 xhigh까지의 추론 강도를 지원합니다.
deepseek-v4-flash-legacyDeepSeek$0.1190$0.23701M tokens당DeepSeek V4 Flash (legacy tier) — a lower-priced route to the V4 Flash model family. Input and output tokens are cheaper than on deepseek-v4-flash, while cache reads are priced higher, so prompt-caching-heavy workloads are usually cheaper on deepseek-v4-flash and low-reuse workloads are cheaper here. Responses may come from an earlier V4 Flash build. 1M-token context window, 384K maximum output, thinking (default) and non-thinking modes, tool calling and JSON output. Text in, text out. On /v1/responses, send the whole conversation in the input array: previous_response_id is forwarded to the upstream but no conversation state is kept there, so a request that relies on it is answered without the earlier turns.
MiniMax-Hailuo-2.3-FastMiniMax$0.190요청당MiniMax Hailuo 2.3 Fast — Hailuo 2.3에서 속도와 비용을 우선한 등급으로, 이미지-비디오와 물리적 움직임의 사실감에 초점을 맞췄습니다. 24 fps로 출력하며 768p는 6초 또는 10초 클립, 1080p는 6초를 지원합니다. 768p 6초 = $0.19.
qwen3.7-plus阿里巴巴$0.3400$1.36001M tokens당Alibaba Qwen3.7-Plus — 실제 장면을 인식하고, 화면을 읽어 GUI를 조작하며, 시각적 참조로부터 코드를 생성하고, 모바일 앱 안에서 종단 간 내비게이션을 수행하는 멀티모달 하이브리드 에이전트 모델. 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 131,072 토큰 출력, 262,144 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며 함수 호출, 구조화된 출력, 컨텍스트 캐싱을 지원합니다.
stepaudio-2.5-asr-streamStepFun$0.1800오디오 1시간당StepFun StepAudio 2.5 ASR — 4B-parameter speech recognition model built on Multi-Token Prediction, transcribing five minutes of audio in about one second (RTF around 0.0053). Optimized for Chinese and English. Includes inverse text normalization, speaker identification, and dual-channel separation for call and meeting recordings. Accepts ogg, mp3, and wav uploads; transcript output is not billed.
stepaudio-2.5-chatStepFun$1.5000$3.50001M tokens당StepFun StepAudio 2.5 Chat — 종단 간 음성 이해 모델로, 오디오나 텍스트를 입력받아 텍스트를 반환하며 망설임이나 웃음 같은 준언어적 신호를 전사본이 아닌 파형 자체에서 읽어냅니다. 캐릭터, 말버릇, 감정 폭에 이르는 폭넓은 페르소나 커스터마이징을 지원합니다. 오디오는 chat completions 엔드포인트의 input_audio 콘텐츠 파트로 전달합니다. 음성으로 답하게 하려면 TTS 모델을 사용하세요.
gemini-3.6-flashGoogle구간별 과금, 요금 페이지를 참조하세요Google Gemini 3.6 Flash — a stable multimodal reasoning model that balances speed and intelligence for agentic and real-world tasks, with a 1,048,576-token input context and 65,536-token output limit. It accepts text, images, video, audio, and PDFs, and supports thinking, function calling, code execution, search grounding, structured output, and Computer Use (preview). Pricing note: Google's list price for this model is promotional through December 31, 2026 — $0.75 input / $3.75 output / $0.075 cached input per 1M tokens. From January 1, 2027 the vendor's list price returns to $1.50 / $7.50 / $0.15, and our price follows it at the same parity.
glm-5智谱$1.0000$3.20001M tokens당Zhipu GLM-5 — 총 744B 파라미터에 활성 40B의 MoE 모델로, 28.5T 토큰으로 학습했고 DeepSeek Sparse Attention을 사용하며, 200K 컨텍스트 창과 최대 128K 토큰 출력을 갖췄습니다. 텍스트 입력, 텍스트 출력. 여러 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다.
glm-5v-turbo智谱$1.2000$4.00001M tokens당Zhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows.
kimi-k2.6Moonshot$0.7600$3.15701M tokens당Moonshot Kimi K2.6 — 대화, 코드 생성, 시각 이해, 에이전트 작업을 위한 범용 모델로, 이전 세대보다 장기 실행 코드 작성과 자율 수행 능력이 강해졌습니다. 256K 컨텍스트 창, 기본 출력 32,768 토큰. 텍스트, 이미지(png, jpeg, webp, gif), 비디오(mp4, mov, webm 등)를 base64 콘텐츠로 받아 텍스트를 반환합니다. 사고 모드는 기본으로 켜져 있으며 끌 수 있습니다. temperature는 사고를 켜면 1.0, 끄면 0.6으로 고정됩니다.
step-1o-audioStepFun$3.7070$8.89801M tokens당StepFun step-1o-audio — 다국어 지원과 도구 호출을 갖춘 이전 세대 종단 간 음성 모델로, 한 번의 상호작용은 최대 30분입니다. 대부분 StepAudio 2.5 계열로 대체되었으며 이미 이 모델로 구축된 워크로드를 위해 유지됩니다.
glm-asr-2512智谱$0.1440오디오 1시간당Zhipu GLM-ASR-2512 — 문자 오류율 0.0717을 공개한 음성 인식 모델. 표준 중국어와 함께 쓰촨어, 광둥어, 민난어, 우어, 미국식과 영국식 영어 억양, 그리고 프랑스어, 독일어, 일본어, 한국어, 스페인어, 아랍어를 포함한 수십 개 언어를 지원합니다. 언어가 섞인 발화, 전문 용어, 구어체 발화를 처리하며 도메인 어휘를 위한 사용자 사전을 받을 수 있습니다. 오디오는 요청당 30초, 25 MB로 제한되며 배치 전사와 스트리밍 전사를 모두 지원합니다.
gpt-5.4OpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT-5.4 — a frontier model for complex professional work and coding, priced well below GPT-5.5. It supports text and image input, built-in tools, reasoning effort from none through xhigh, a 1,050,000-token context window, and up to 128,000 output tokens. Prompts above 272,000 input tokens are repriced at 2x input and 1.5x output for the whole session.
gpt-5.6-solOpenAI구간별 과금, 요금 페이지를 참조하세요OpenAI GPT-5.6 Sol — 최전선 추론, 복잡한 전문 업무, 코딩, 과학, 사이버 보안, 장기 실행 에이전트 워크플로를 위한 GPT-5.6 플래그십 모델. 텍스트와 이미지 입력, 내장 도구, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력, 그리고 이 제품군에서 가장 깊은 추론 설정을 지원합니다.
speech-2.8-hdMiniMax$1.00001만 자당MiniMax speech-2.8-hd — 2.8 음성 라인의 고음질 등급으로, 사운드 태그를 활용한 초현실적인 표현을 지향하며 40개 언어와 7가지 감정을 지원합니다. 음높이, 발화 속도, 음량, 샘플레이트, 비트레이트, 출력 형식은 요청마다 설정할 수 있고, 장문 합성은 비동기 방식으로 최대 100만 자, 스트리밍 인터페이스로 최대 10,000자를 받습니다.
claude-opus-4-8Anthropic구간별 과금, 요금 페이지를 참조하세요Anthropic Claude Opus 4.8 — 코딩, 에이전트 워크플로, 전문 분석, 장기 실행 업무를 위한 고성능 추론 모델. Opus 4.7 대비 신뢰성, 판단력, 도구 사용 효율, 컴퓨터 사용, 멀티모달 문서 추론이 향상되었으며 1,000,000 토큰 컨텍스트 창을 지원합니다.
happyhorse-1.1-r2v阿里巴巴$0.091초당Alibaba HappyHorse 1.1(R2V) — 최대 9장의 참조 이미지를 사용하는 참조 기반 영상 생성. 피사체·장면·스타일 일관성과 카메라 제어가 뛰어납니다. 720P/1080P.
step-tts-2StepFun$0.40001만 자당StepFun step-tts-2 — 정확한 억양 재현을 위해 만들어진 NTP 기반 종단 간 음성 합성 모델. 중국어, 영어, 중국어-영어 혼용, 일본어에 더해 광둥어와 쓰촨어를 구사합니다. 감정과 어조는 자연어 레이블로 지시하며, 제로샷 음성 복제에는 약 10초 분량의 참조 오디오가 필요하고 감정과 스타일 제어는 추가 비용 없이 복제된 목소리에도 그대로 적용됩니다. 출력 형식은 wav, mp3, flac, opus, pcm입니다.
wan2.7-r2v阿里巴巴$0.080초당Alibaba Wan2.7(R2V) — 참조 기반 영상 생성. 최대 5개의 이미지/영상 혼합 참조와 음색 참조를 지원하며 인물·소품·장면 일관성이 향상되었습니다.
wan2.7-videoedit阿里巴巴$0.080초당Alibaba Wan2.7 VideoEdit — 자연어로 지시하는 국소 또는 전역 영상 편집, 참조 이미지 기반 요소 교체, 모션·효과·카메라 워크 복제.
doubao-seedance-2-5-260628字节跳动$10.7000$10.70001M tokens당ByteDance Seedance 2.5 — Seedance의 주력 모델로, 한 번의 생성을 24 fps에서 4~30초까지 늘리는 대신 해상도는 480p와 720p로 제한합니다. 멀티모달 참조 기반 생성은 이미지 1~30장, 참조 영상 최대 10개, 참조 오디오 최대 10개(각각 합계 30초)까지 확장되며, 2.0 라인과 달리 오디오 참조를 단독으로 쓸 수 있습니다. 그 밖에 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구도 지원합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환합니다.
claude-opus-4-5Anthropic구간별 과금, 요금 페이지를 참조하세요Anthropic Claude Opus 4.5 — a pinned dated snapshot of the Opus 4.5 release for workloads that need byte-stable behaviour. It supports text and image input, extended thinking, a 200,000-token context window, and up to 64,000 output tokens.
claude-opus-4-6Anthropic구간별 과금, 요금 페이지를 참조하세요Anthropic Claude Opus 4.6 — the Opus generation for complex reasoning and agentic work, with a 1,000,000-token context window at standard pricing and up to 128,000 output tokens. It supports text and image input and adaptive thinking, and uses the pre-4.7 tokenizer.
LongCat-2.0Meituan$0.3000$1.20001M tokens당Meituan LongCat-2.0 — 네이티브 1M 컨텍스트를 갖춘 1.6T 파라미터 오픈 MoE 모델로, 에이전트 코딩과 장기 실행 도구 사용을 위해 만들어졌습니다. 텍스트 전용 추론 모델.
doubao-seedance-2-0-mini-260615字节跳动$1.4000$1.40001M tokens당ByteDance Seedance 2.0 Mini — Seedance 2.0 라인의 가볍고 부담 없는 등급으로, 480p와 720p, 24 fps, 4~15초로 제한됩니다. 문서화된 기능은 라인의 다른 모델과 동일합니다. 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 이미지 1~9장과 합계 15초 이내의 참조 영상 최대 3개를 사용하는 멀티모달 참조 기반 생성, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구를 지원합니다. 오디오 참조는 반드시 이미지나 영상과 함께 제공해야 합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환합니다.
gemini-2.5-flash-imageGoogle구간별 과금, 요금 페이지를 참조하세요Google Gemini 2.5 Flash Image (Nano Banana) — a fast native image generation and editing model for creative workflows. It takes text and image input and returns images through the OpenAI-compatible chat completions endpoint, with a 65,536-token input limit and 32,768-token output limit.
MiniMax-M2.7-highspeedMiniMax$0.6000$2.40001M tokens당MiniMax M2.7 Highspeed — 동일한 M2.7 모델을 초당 약 100 토큰으로 제공해 저지연 코딩과 에이전트 워크플로를 겨냥한 등급으로, 204,800 토큰 컨텍스트 창을 갖췄습니다. 텍스트 전용이며, API는 텍스트와 도구 호출 콘텐츠 블록만 받고 이미지나 비디오는 받지 않습니다. 도구 호출을 지원하며 사고는 항상 켜져 있어 끌 수 없습니다.
doubao-seed-2-1-turbo-260628字节跳动$0.4440$2.22201M tokens당ByteDance Doubao Seed 2.1 Turbo — Seed 2.1 라인의 저지연 계열로, Pro와 같은 사양을 공유합니다. 256K 컨텍스트 창에 최대 입력 256K, 최대 256K 토큰 출력(기본값 4K), 256K의 사고 사슬 예산을 갖췄습니다. 심층 사고, 텍스트 생성, 멀티모달 이해, 도구 호출, 구조화된 출력을 지원하지만 Pro와 달리 json_schema 권장 사항은 없습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며, 2.1 라인에는 오디오 이해가 명시되어 있지 않습니다. 암시적 및 명시적 컨텍스트 캐싱을 지원합니다.