중국 AI 모델 요금
ChinaAPI는 DeepSeek, Qwen, GLM, Kimi를 비롯한 중국 AI 모델을 OpenAI 호환 게이트웨이 https://api.chinaapi.ai/v1 하나로 제공합니다. 모든 요금은 미국 달러 기준이며, 상위 공급업체가 제시하는 단위로 표기합니다. 같은 목록은 /api/pricing에서 JSON으로도 받을 수 있습니다.
| 모델 | 공급업체 | 입력 | 출력 | 단위 | 설명 |
|---|---|---|---|---|---|
| agnes-image-2.0-flash | Agnes AI | $0.000 | 요청당 | Agnes AI Image 2.0 Flash — 텍스트-이미지, 이미지-이미지, 다중 이미지 합성을 지원하는 빠른 이미지 생성 및 편집 모델. 생성 결과는 URL 또는 Base64 데이터로 받을 수 있습니다. | |
| kling-3.0-turbo | 快手 | $0.560 | 요청당 | Kuaishou Kling 3.0 Turbo — Kling 3.0 라인의 가성비 등급으로, 프롬프트 또는 첫 프레임 이미지에서 720P 또는 1080P(기본값 720P) 영상을 3~15초(기본값 5초), 16:9, 9:16, 1:1 비율로 생성합니다. 네이티브 오디오는 항상 포함되며 켜고 끄는 스위치가 없습니다. kling-v3와 비교하면 속도와 비용을 얻는 대신 4K 등급, 마지막 프레임 제어, 영상 입력을 포기했습니다. 720p 5초 오디오 포함 ≈ $0.56. | |
| hy3 | Tencent | $0.1540 | $0.6150 | 1M tokens당 | Tencent Hunyuan 3(Hy3) — 295B 파라미터(활성 21B) MoE 모델로, 네이티브 256K 컨텍스트와 세 가지 사고 모드(fast / low / deep)를 갖췄습니다. 코딩 에이전트, 긴 문서 이해, 멀티턴 컨텍스트 유지, 다단계 에이전트 워크플로에 강합니다. 텍스트 전용. |
| kimi-k2.6 | Moonshot | $0.7600 | $3.1570 | 1M tokens당 | Moonshot Kimi K2.6 — 대화, 코드 생성, 시각 이해, 에이전트 작업을 위한 범용 모델로, 이전 세대보다 장기 실행 코드 작성과 자율 수행 능력이 강해졌습니다. 256K 컨텍스트 창, 기본 출력 32,768 토큰. 텍스트, 이미지(png, jpeg, webp, gif), 비디오(mp4, mov, webm 등)를 base64 콘텐츠로 받아 텍스트를 반환합니다. 사고 모드는 기본으로 켜져 있으며 끌 수 있습니다. temperature는 사고를 켜면 1.0, 끄면 0.6으로 고정됩니다. |
| LongCat-2.0 | Meituan | $0.3000 | $1.2000 | 1M tokens당 | Meituan LongCat-2.0 — 네이티브 1M 컨텍스트를 갖춘 1.6T 파라미터 오픈 MoE 모델로, 에이전트 코딩과 장기 실행 도구 사용을 위해 만들어졌습니다. 텍스트 전용 추론 모델. |
| step-audio-2 | StepFun | $1.5500 | $10.8500 | 1M tokens당 | StepFun step-audio-2 — 전사 결과가 아니라 오디오를 직접 입력받는 종단 간 음성 모델로, 어조와 말하기 방식이 모델의 이해 단계까지 그대로 전달됩니다. 토큰 단위로 과금되며 입력 요금은 StepAudio 2.5 계열과 같고 출력 요금은 더 높습니다. StepFun은 이 모델의 별도 기능 문서를 제공하지 않으므로 현재 파라미터는 플랫폼 오디오 문서를 참고하세요. |
| step-tts-mini | StepFun | $0.1500 | 1만 자당 | StepFun step-tts-mini — StepFun TTS 계열에서 비용 효율과 낮은 지연 시간을 중시한 모델로, step-tts-2와 같은 언어(중국어, 영어, 중국어-영어 혼용, 일본어, 그리고 광둥어와 쓰촨어)를 지원하며 내장 음성은 그중 일부를 제공합니다. 자연어 감정 및 어조 레이블과 약 10초 분량 참조 오디오를 이용한 제로샷 음성 복제를 지원합니다. 출력 형식은 wav, mp3, flac, opus, pcm입니다. | |
| stepaudio-2.5-asr | StepFun | $0.0220 | 오디오 1시간당 | StepFun StepAudio 2.5 ASR — Multi-Token Prediction을 기반으로 한 4B 파라미터 음성 인식 모델로, 5분 분량의 오디오를 약 1초에 전사합니다(RTF 약 0.0053). 중국어와 영어에 최적화되어 있습니다. 역텍스트 정규화, 화자 식별, 통화 및 회의 녹음을 위한 이중 채널 분리를 제공합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다. | |
| stepaudio-2.5-tts | StepFun | $0.8500 | 1만 자당 | StepFun StepAudio 2.5 TTS — 발화 방식을 후처리로 다루지 않고 이해를 생성 파이프라인 전체로 이어가는 맥락 인식 음성 합성 모델. 목소리와 감정, 호흡은 요청 전체에 적용되는 전역 컨텍스트와 개별 구절에 적용되는 인라인 컨텍스트라는 두 층위에서 자연어로 지시합니다. 제로샷 음성 복제에는 약 3초 분량의 참조 오디오가 필요하며 맥락 제어 기능 전체를 그대로 물려받습니다. 요청당 최대 1000자를 처리하며 출력 형식은 wav, mp3, flac, opus입니다. | |
| agnes-2.5-flash | Agnes AI | $0.0000 | 1M tokens당 | Agnes AI Agnes 2.5 Flash — 512K 입력 컨텍스트와 65.5K 참고 출력 한도를 갖춘 빠른 멀티모달 에이전트 모델. 채팅, 스트리밍, 도구 호출, 코딩, 추론, 멀티턴 대화, 이미지 이해, 에이전트 워크플로를 지원합니다. | |
| glm-5 | 智谱 | $1.0000 | $3.2000 | 1M tokens당 | Zhipu GLM-5 — 총 744B 파라미터에 활성 40B의 MoE 모델로, 28.5T 토큰으로 학습했고 DeepSeek Sparse Attention을 사용하며, 200K 컨텍스트 창과 최대 128K 토큰 출력을 갖췄습니다. 텍스트 입력, 텍스트 출력. 여러 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다. |
| mimo-v2.5-tts | Xiaomi | $0.0000 | 1만 자당 | Xiaomi MiMo v2.5 TTS — 내장 음성 8종을 갖춘 표현력 있는 음성 합성 모델로, 중국어 4종과 영어 4종(Mia, Chloe, Milo, Dean)을 제공하며 중국어와 영어에 더해 둥베이, 쓰촨, 허난, 광둥 방언 스타일을 지원합니다. 발화 방식은 두 가지로 지시합니다. 자연어 스타일 지시와, 기본 감정 및 복합 감정, 숨소리, 한숨, 호흡 조절을 지정하는 인라인 오디오 태그이며, 여기에는 MiMo TTS 라인에서 이 모델에만 있는 노래 모드도 포함됩니다. 24 kHz 모노 wav 또는 pcm16을 반환하고 저지연 스트리밍을 지원하며, 스트리밍에는 pcm16이 필요합니다. 컨텍스트 8K, 최대 출력 8K. | |
| step-3.5-flash-2603 | StepFun | $0.1000 | $0.3000 | 1M tokens당 | StepFun step-3.5-flash-2603 — 토큰 효율과 저추론 운영 모드에 최적화된 step-3.5-flash의 에이전트 튜닝 256K 스냅숏. reasoning_effort 파라미터는 low와 high만 받으며 기본 모델이 지원하는 세 단계와 다르므로 medium을 보내는 코드는 수정해야 합니다. 텍스트 전용이며 도구 호출, JSON Schema 구조화된 출력, 스트리밍, 프롬프트 캐싱을 지원합니다. |
| step-asr | StepFun | $0.1500 | 오디오 1시간당 | StepFun step-asr — 중국어, 영어, 중국어 방언을 포괄하는 범용 음성 인식 모델로 전사, 회의록 작성, 통화 품질 검토, 음성 검색에 활용합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다. | |
| step-asr-1.1-stream | $0.4000 | 오디오 1시간당 | |||
| doubao-seedance-2-0-mini-260615 | 字节跳动 | $3.5000 | $3.5000 | 1M tokens당 | ByteDance Seedance 2.0 Mini — Seedance 2.0 라인의 가볍고 부담 없는 등급으로, 480p와 720p, 24 fps, 4~15초로 제한됩니다. 문서화된 기능은 라인의 다른 모델과 동일합니다. 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 이미지 1~9장과 합계 15초 이내의 참조 영상 최대 3개를 사용하는 멀티모달 참조 기반 생성, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구를 지원합니다. 오디오 참조는 반드시 이미지나 영상과 함께 제공해야 합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환합니다. |
| glm-5.2 | 智谱 | $1.1200 | $3.5200 | 1M tokens당 | Zhipu GLM-5.2 — 컨텍스트 확장만이 아니라 수개월에 걸친 전용 학습을 통해 장기 실행 코딩 에이전트 업무에 특화한 플래그십 파운데이션 모델로, 1M 토큰 컨텍스트 창과 최대 128K 토큰 출력을 갖췄습니다. 텍스트 입력, 텍스트 출력. 여러 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다. |
| image-01 | MiniMax | $0.004 | 요청당 | MiniMax image-01 — MiniMax 자체 image_generation 엔드포인트를 통한 텍스트-이미지 생성. 생성된 이미지 단위로 과금됩니다. 공급사는 레거시 모델로 분류하고 있습니다. | |
| mimo-v2.5-pro | Xiaomi | $0.4350 | $0.8700 | 1M tokens당 | Xiaomi MiMo-V2.5-Pro — 1M 컨텍스트와 최대 128K 출력을 갖춘 조 단위 파라미터 플래그십(활성 42B)으로, 고강도 에이전트 워크로드에 맞게 튜닝되었습니다. 심층 사고, 함수 호출, 구조화된 출력, 웹 검색을 지원합니다. 텍스트 생성 전용으로, mimo-v2.5와 달리 공급사의 기능 목록에 전 모달리티 이해는 포함되어 있지 않습니다. |
| MiniMax-M2.7 | MiniMax | $0.2880 | $1.1510 | 1M tokens당 | MiniMax M2.7 — 채팅, 코딩, 사무 업무, 에이전트 작업을 위한 텍스트 모델로, 204,800 토큰 컨텍스트 창을 갖추고 초당 약 60 토큰으로 출력합니다. 텍스트 전용이며, API는 텍스트와 도구 호출 콘텐츠 블록만 받고 이미지나 비디오는 받지 않습니다. 도구 호출을 지원하며 사고는 항상 켜져 있어 끌 수 없습니다. |
| doubao-seedance-2-0-260128 | 字节跳动 | $7.0000 | $7.0000 | 1M tokens당 | ByteDance Seedance 2.0 — Seedance 2.0 라인의 플래그십이자 480p와 720p에 더해 1080p와 4K(10비트 심도)까지 도달하는 라인의 유일한 모델로, 24 fps에 4~15초입니다. 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 이미지 1~9장과 합계 15초 이내의 참조 영상 최대 3개를 사용하는 멀티모달 참조 기반 생성, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구를 지원합니다. 오디오 참조는 반드시 이미지나 영상과 함께 제공해야 합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환하며 마지막 프레임을 이미지로 받을 수 있습니다. 출력 해상도에 따라 과금됩니다. |
| qwen3-asr-flash | 阿里巴巴 | $0.1235 | 오디오 1시간당 | Alibaba Qwen3-ASR-Flash — Qwen3 파운데이션 모델 위에 구축된 음성 인식 모델로, 발화 언어를 자동으로 판별해 11개 언어를 전사합니다. Qwen3-ASR 라인은 표준 중국어와 함께 쓰촨어, 민난어, 우어, 광둥어, 그리고 여러 영어 억양을 문서화하고 있습니다. aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma, wmv를 지원하며 요청당 최대 5분, 10 MB입니다. pcm 입력은 16 kHz여야 하고 다른 형식은 인식 전에 16 kHz로 리샘플링됩니다. | |
| qwen3.6-flash | 阿里巴巴 | $0.1850 | $1.1080 | 1M tokens당 | Alibaba Qwen3.6-Flash — 공급사가 에이전트형 코딩과 공간 지능을 강점으로 내세우는 빠른 비전-언어 모델로, 객체 위치 파악과 검출에서 뚜렷한 향상을 보입니다. 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 65,536 토큰 출력, 131,072 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다. 함수 호출과 컨텍스트 캐싱을 지원합니다. |
| step-tts-2 | StepFun | $0.4000 | 1만 자당 | StepFun step-tts-2 — 정확한 억양 재현을 위해 만들어진 NTP 기반 종단 간 음성 합성 모델. 중국어, 영어, 중국어-영어 혼용, 일본어에 더해 광둥어와 쓰촨어를 구사합니다. 감정과 어조는 자연어 레이블로 지시하며, 제로샷 음성 복제에는 약 10초 분량의 참조 오디오가 필요하고 감정과 스타일 제어는 추가 비용 없이 복제된 목소리에도 그대로 적용됩니다. 출력 형식은 wav, mp3, flac, opus, pcm입니다. | |
| stepaudio-2.5-asr-stream | $0.1800 | 오디오 1시간당 | |||
| wan2.7-t2v | 阿里巴巴 | $0.092 | 초당 | Alibaba Wan2.7(T2V) — 연기력, 섬세한 감정, 강렬한 액션, 극적인 카메라 컷이 향상된 텍스트-비디오 생성. 720P 또는 1080P H.264 MP4를 2~15초(기본 5초), 16:9, 9:16, 1:1, 4:3, 3:4 비율로 생성하며 프롬프트는 최대 5,000자입니다. 오디오는 기본으로 포함됩니다. audio_url을 지정하지 않으면 모델이 어울리는 배경 음악이나 효과음을 만들어 넣고, 대신 2~30초 길이의 wav 또는 mp3 트랙을 제공할 수도 있습니다. | |
| agnes-video-v2.0 | Agnes AI | $0.000 | 초당 | Agnes AI Video V2.0 — 텍스트-비디오, 이미지-비디오, 다중 이미지 키프레임, 시네마틱 모션을 지원하는 비동기 영상 생성 모델. 480p, 720p, 1080p로 정규화된 출력 등급을 제공합니다. | |
| glm-5.1 | 智谱 | $1.1200 | $3.5200 | 1M tokens당 | Zhipu GLM-5.1 — 장시간 자율 작업을 위해 만들어진 플래그십 파운데이션 모델. 공급사는 계획, 실행, 테스트, 반복적 최적화에 걸쳐 하나의 작업을 최대 8시간 동안 사람 개입 없이 연속 수행할 수 있다고 밝히고 있습니다. 200K 컨텍스트 창, 최대 128K 토큰 출력, 텍스트 입력과 텍스트 출력. 여러 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다. |
| happyhorse-1.1-t2v | 阿里巴巴 | $0.083 | 초당 | Alibaba HappyHorse 1.1(T2V) — 의미 이해, 카메라 제어, 역동적인 생성이 향상된 텍스트-비디오 생성. 유려하고 세밀하며 물리적으로 일관된 720P/1080P 영상을 만듭니다. | |
| kimi-k3 | Moonshot | $2.7400 | $13.6990 | 1M tokens당 | Moonshot Kimi K3 — 장기 실행 코딩, 종단 간 지식 노동, 심층 추론을 위한 2.8조 파라미터 플래그십으로, 1M 토큰 컨텍스트 창과 최대 1,048,576 토큰의 완성 출력(기본값 131,072)을 갖췄습니다. 텍스트, base64 이미지, 비디오를 입력받아 텍스트를 반환합니다. 사고는 항상 켜져 있으며 reasoning_effort를 low, high, max 중에서 선택할 수 있습니다(기본값 max). temperature는 1.0으로 고정됩니다. 사용자 정의 도구 호출과 도구 동적 로딩을 지원합니다. |
| kling-v3 | 快手 | $0.420 | 요청당 | Kuaishou Kling 3.0 — 네이티브 오디오와 향상된 요소 일관성을 갖춘 텍스트-비디오 및 이미지-비디오 생성. 클립은 3~15초(기본값 5초), 16:9, 9:16, 1:1 비율이며 등급은 mode로 선택합니다. std가 720P, pro가 1080P, 4k가 네이티브 4K입니다. 오디오는 sound=on으로 직접 켜야 하며 기본값은 꺼짐입니다. 이미지-비디오는 첫 프레임을 받고 마지막 프레임은 선택 사항입니다. 초당 $0.083부터(720p). | |
| mimo-v2.5-tts-voicedesign | Xiaomi | $0.0000 | 1만 자당 | Xiaomi MiMo 음성 디자인 모델: instructions에 원하는 목소리를 자연어로 서술하면 그대로 설계된 목소리로 음성을 합성합니다. | |
| glm-5v-turbo | 智谱 | $0.7690 | $3.3850 | 1M tokens당 | Zhipu GLM-5V-Turbo — multimodal reasoning model for images, video, files, coding, and tool-driven agent workflows. |
| mimo-v2.5-tts-voiceclone | Xiaomi | $0.0000 | 1만 자당 | Xiaomi MiMo 음성 복제 모델: voice 필드에 참조 오디오 샘플을 데이터 URL(data:{mime};base64,...)로 전달하면 학습, 라벨링, 파인튜닝 과정 없이 그 목소리로 음성을 합성합니다. MP3(audio/mpeg) 또는 WAV를 지원하며 base64로 인코딩한 문자열은 10 MB로 제한됩니다. 참조 오디오의 최소 길이는 Xiaomi가 공개하지 않았습니다. 자연어 스타일 지시와 인라인 오디오 태그는 mimo-v2.5-tts에서 그대로 이어지지만 스트리밍은 사용할 수 없습니다. 요청은 호환 모드로 실행되며 합성이 끝난 뒤에 반환됩니다. | |
| MiniMax-Hailuo-02 | MiniMax | $0.280 | 요청당 | MiniMax Hailuo 02 — 텍스트-비디오와 이미지-비디오를 모두 지원하는 저비용 영상 생성 모델로, 24 fps에서 512p와 768p는 6초 또는 10초 클립, 1080p는 6초를 제공합니다. 512p 등급은 Hailuo 라인의 진입점입니다. | |
| step-1o-audio | StepFun | $3.8500 | $9.2400 | 1M tokens당 | StepFun step-1o-audio — 다국어 지원과 도구 호출을 갖춘 이전 세대 종단 간 음성 모델로, 한 번의 상호작용은 최대 30분입니다. 대부분 StepAudio 2.5 계열로 대체되었으며 이미 이 모델로 구축된 워크로드를 위해 유지됩니다. |
| step-3.5-flash | StepFun | $0.1000 | $0.3000 | 1M tokens당 | StepFun step-3.5-flash — 256K 컨텍스트의 텍스트 전용 추론 모델로, 추론 품질과 빠르고 안정적인 실행이 동시에 필요한 논리, 수학, 소프트웨어 엔지니어링, 심층 리서치 작업을 겨냥합니다. 추론 강도는 reasoning_effort(low / medium / high)로 요청마다 선택할 수 있습니다. 도구 호출, JSON Schema 구조화된 출력, 스트리밍, 프롬프트 캐싱을 지원합니다. 이미지나 비디오 입력이 필요하면 step-3.7-flash를 사용하세요. |
| step-3.7-flash | StepFun | $0.2000 | $1.1500 | 1M tokens당 | StepFun step-3.7-flash — 총 198B, 활성 11B 파라미터의 스파스 MoE 모델로, 네이티브 256K 컨텍스트와 텍스트에 더해 이미지·비디오의 네이티브 이해를 갖췄습니다. 추론 강도는 reasoning_effort(low / medium / high)로 요청마다 선택할 수 있으며, 안정적인 다단계 도구 호출, JSON Schema 구조화된 출력, 스트리밍, 프롬프트 캐싱을 지원합니다. 에이전트 및 코딩 워크로드에 맞게 튜닝되었습니다. |
| step-image-edit-2 | StepFun | $0.004 | 요청당 | StepFun Step Image Edit 2 — 텍스트-이미지 생성과 이미지 편집을 통합한 6B 미만 파라미터 모델로, 12B~20B급 오픈 웨이트 편집 모델에 필적합니다. 한 번의 편집을 1~2초에 완료하며 낮은 지연 시간의 대화형 리터칭을 위해 설계되었습니다. 256x256, 512x512, 768x768, 1024x1024, 1280x800, 800x1280을 지원하고 네거티브 프롬프트와 텍스트 최적화 모드를 제공하며, 요청당 이미지 한 장을 생성합니다. OpenAI 호환 images 엔드포인트로 제공됩니다. | |
| doubao-seedance-2-0-fast-260128 | 字节跳动 | $5.6000 | $5.6000 | 1M tokens당 | ByteDance Seedance 2.0 Fast — 비용 효율적인 영상 생성으로, Seedance 2.0의 기능 전체를 갖추되 480p와 720p, 24 fps, 4~15초로 제한됩니다. 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 이미지 1~9장과 합계 15초 이내의 참조 영상 최대 3개를 사용하는 멀티모달 참조 기반 생성, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구를 지원합니다. 오디오 참조는 반드시 이미지나 영상과 함께 제공해야 합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환합니다. 480p 5초 ≈ $0.26. |
| qwen3-tts-flash | 阿里巴巴 | $0.1231 | 1만 자당 | Alibaba Qwen3-TTS-Flash — 표현력 있는 내장 음성 17종을 갖춘 저지연 음성 합성 모델. 중국어, 영어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 일본어, 한국어, 프랑스어, 러시아어를 지원하며, 언어가 섞인 텍스트를 위한 자동 모드와 방언 출력도 제공합니다. 요청당 최대 512 토큰의 텍스트를 받으며 스트리밍과 비스트리밍 합성을 모두 지원합니다. | |
| gemini-3.6-flash | 구간별 과금, 요금 페이지를 참조하세요 | Google Gemini 3.6 Flash — 에이전트 작업과 실제 업무를 위해 속도와 지능의 균형을 맞춘 안정 버전 멀티모달 추론 모델. 입력 컨텍스트는 1,048,576 토큰, 출력 한도는 65,536 토큰입니다. 텍스트, 이미지, 비디오, 오디오, PDF를 입력받으며 사고, 함수 호출, 코드 실행, 검색 그라운딩, 구조화된 출력, Computer Use(프리뷰)를 지원합니다. | |||
| step-audio-r1.5 | StepFun | $1.5500 | $16.2750 | 1M tokens당 | StepFun step-audio-r1.5 — step-audio-2와 같은 계열의 종단 간 음성 모델. 입력 요금은 동일하고 출력은 50% 높게 과금됩니다. StepFun은 이 모델의 별도 기능 문서를 제공하지 않으므로 현재 파라미터는 플랫폼 오디오 문서를 참고하세요. |
| stepaudio-2.5-chat | StepFun | $1.5000 | $3.5000 | 1M tokens당 | StepFun StepAudio 2.5 Chat — 종단 간 음성 이해 모델로, 오디오나 텍스트를 입력받아 텍스트를 반환하며 망설임이나 웃음 같은 준언어적 신호를 전사본이 아닌 파형 자체에서 읽어냅니다. 캐릭터, 말버릇, 감정 폭에 이르는 폭넓은 페르소나 커스터마이징을 지원합니다. 오디오는 chat completions 엔드포인트의 input_audio 콘텐츠 파트로 전달합니다. 음성으로 답하게 하려면 TTS 모델을 사용하세요. |
| wan2.7-r2v | 阿里巴巴 | $0.092 | 초당 | Alibaba Wan2.7(R2V) — 참조 기반 영상 생성. 최대 5개의 이미지/영상 혼합 참조와 음색 참조를 지원하며 인물·소품·장면 일관성이 향상되었습니다. | |
| doubao-seed-2-1-pro-260628 | 字节跳动 | $0.9230 | $4.6150 | 1M tokens당 | ByteDance Doubao Seed 2.1 Pro — 프로덕션 업무를 위한 Doubao 플래그십 에이전트 모델로, 심층 사고, 텍스트 생성, 멀티모달 이해, 도구 호출, 구조화된 출력을 지원하며 구조화된 출력에는 공급사가 json_schema 모드를 권장합니다. 256K 컨텍스트 창에 최대 입력 256K, 최대 256K 토큰 출력(기본값 4K), 256K의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며, 2.1 라인에는 오디오 이해가 명시되어 있지 않습니다. 접두사 캐시와 세션 캐시를 포함한 암시적 및 명시적 컨텍스트 캐싱을 지원합니다. |
| mimo-v2.5 | Xiaomi | $0.1400 | $0.2800 | 1M tokens당 | Xiaomi MiMo-V2.5 — 1M 컨텍스트와 최대 128K 출력을 갖춘 네이티브 전 모달리티 모델로, 이미지와 비디오, 오디오, 텍스트를 하나의 모델에서 이해합니다. 심층 사고, 함수 호출, 구조화된 출력, 웹 검색을 지원하며 전 모달리티 에이전트 기능을 갖췄습니다. |
| MiniMax-Hailuo-2.3-Fast | MiniMax | $0.190 | 요청당 | MiniMax Hailuo 2.3 Fast — Hailuo 2.3에서 속도와 비용을 우선한 등급으로, 이미지-비디오와 물리적 움직임의 사실감에 초점을 맞췄습니다. 24 fps로 출력하며 768p는 6초 또는 10초 클립, 1080p는 6초를 지원합니다. 768p 6초 = $0.19. | |
| MiniMax-M3 | MiniMax | 구간별 과금, 요금 페이지를 참조하세요 | MiniMax M3 — 에이전트형 추론, 도구 사용, 구조화된 작업 수행을 위한 최전선 멀티모달 코딩 모델로, 1,000,000 토큰 컨텍스트 창을 갖췄습니다. 텍스트, 최대 10 MB 이미지, 인라인으로 최대 50 MB(Files API를 거치면 512 MB) 비디오를 입력받아 텍스트를 반환합니다. 도구 호출을 지원하며 사고는 항상 켜져 있지 않고 선택 사항입니다. | ||
| qwen3.6-plus | 阿里巴巴 | $0.4000 | $2.4000 | 1M tokens당 | Alibaba Qwen3.6-Plus — 범용 추론과 도구 사용을 위한 균형형 모델로, 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 65,536 토큰 출력, 81,920 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다. 함수 호출, 구조화된 출력, 웹 검색, 접두사 완성, 컨텍스트 캐싱을 지원합니다. |
| wan2.7-image-pro | 阿里巴巴 | $0.060 | 요청당 | Alibaba Wan 2.7 Image Pro — Wan 2.7 이미지 라인의 전문가 등급으로, 텍스트-이미지 생성, 연속 이미지 세트, 이미지 편집, 다중 참조 이미지 기반 생성을 지원하며 프롬프트 준수력이 향상되었습니다. 텍스트-이미지 생성은 4K(4096x4096)까지 도달하고 1K와 2K 등급, 768x768부터의 사용자 지정 크기를 제공하며, 편집 모드와 연속 생성 모드는 2K가 상한입니다. 참조 이미지는 최대 9장(JPEG, JPG, PNG, BMP, WEBP, 각 변 240~8,000 px, 장당 20 MB), 화면비는 1:8부터 8:1까지, 프롬프트는 최대 5,000자입니다. PNG를 반환합니다. | |
| doubao-seedream-4-5-251128 | 字节跳动 | $0.038 | 요청당 | ByteDance Doubao Seedream 4.5 — 다중 이미지 융합을 지원하는 텍스트-이미지 및 이미지-이미지 생성으로, 단일 이미지 또는 서로 연결된 이미지 세트를 만들어냅니다. 단일 이미지 모드는 프롬프트만, 참조 이미지 한 장, 또는 참조 이미지 2~14장을 받습니다. 그룹 모드(sequential_image_generation=auto)는 텍스트에서 최대 15장, 참조 이미지 한 장에서 최대 14장, 참조 이미지 2~14장에서는 입력과 출력의 합이 15장을 넘지 않는 범위의 세트를 반환합니다. 2K와 4K 출력을 지원하며 기본적으로 JPEG를 URL 또는 base64로 반환합니다. 좌표 기반 대화형 편집은 Seedream 5.0 pro 전용입니다. | |
| happyhorse-1.1-r2v | 阿里巴巴 | $0.083 | 초당 | Alibaba HappyHorse 1.1(R2V) — 최대 9장의 참조 이미지를 사용하는 참조 기반 영상 생성. 피사체·장면·스타일 일관성과 카메라 제어가 뛰어납니다. 720P/1080P. | |
| mimo-v2.5-asr | Xiaomi | $0.0740 | 오디오 1시간당 | 중국어와 영어, 중국어 방언에 최적화된 Xiaomi MiMo 음성 인식 모델. 잡음이 많거나 원거리에서 녹음된 오디오, 다중 화자 오디오는 물론 가사 전사도 처리합니다. | |
| step-2x-large | StepFun | $0.016 | 요청당 | StepFun Step 2X Large — 사실적인 질감과 이미지 안의 중국어 및 영어 텍스트 렌더링이 유난히 뛰어난 텍스트-이미지 생성 모델. 256x256, 512x512, 768x768, 1024x1024, 1280x800, 800x1280을 지원하며 요청당 이미지 한 장을 생성합니다. OpenAI 호환 images 엔드포인트로 제공됩니다. | |
| deepseek-v4-flash | DeepSeek | $0.1400 | $0.2800 | 1M tokens당 | DeepSeek V4 Flash — 채팅, 코딩 지원, 에이전트 루프를 위한 빠르고 동시 처리에 강한 DeepSeek V4 등급으로, 1M 토큰 컨텍스트 창과 최대 384K 출력을 갖췄습니다. 사고 모드(기본값)와 비사고 모드 양쪽으로 동작하며 도구 호출과 JSON 출력을 지원합니다. 텍스트 입력, 텍스트 출력. |
| kimi-k2.7-code-highspeed | Moonshot | $1.7810 | $7.3970 | 1M tokens당 | Moonshot Kimi K2.7 Code Highspeed — K2.7 Code의 처리량 중심 등급으로, 같은 모델을 초당 약 180 토큰, 짧은 컨텍스트 작업에서는 최대 260 토큰으로 제공합니다. 256K 컨텍스트 창, 기본 출력 32,768 토큰. 텍스트, 이미지, 비디오를 base64 콘텐츠로 받아 텍스트를 반환합니다. 사고는 필수이며 비활성화하면 오류가 발생합니다. tool_choice는 auto 또는 none으로 제한되고, reasoning_content는 여러 단계의 도구 호출을 거치는 동안 계속 전달해야 합니다. |
| MiniMax-Hailuo-2.3 | MiniMax | $0.280 | 요청당 | MiniMax Hailuo 2.3 — 공급사가 지시 준수 능력을 앞세우는 텍스트-비디오 및 이미지-비디오 모델. 24 fps로 출력하며 768p는 6초 또는 10초 클립, 1080p는 6초를 지원합니다. 768p 6초 = $0.28. | |
| MiniMax-M2.7-highspeed | MiniMax | $0.5750 | $2.3010 | 1M tokens당 | MiniMax M2.7 Highspeed — 동일한 M2.7 모델을 초당 약 100 토큰으로 제공해 저지연 코딩과 에이전트 워크플로를 겨냥한 등급으로, 204,800 토큰 컨텍스트 창을 갖췄습니다. 텍스트 전용이며, API는 텍스트와 도구 호출 콘텐츠 블록만 받고 이미지나 비디오는 받지 않습니다. 도구 호출을 지원하며 사고는 항상 켜져 있어 끌 수 없습니다. |
| speech-2.8-hd | MiniMax | $0.5385 | 1만 자당 | MiniMax speech-2.8-hd — 2.8 음성 라인의 고음질 등급으로, 사운드 태그를 활용한 초현실적인 표현을 지향하며 40개 언어와 7가지 감정을 지원합니다. 음높이, 발화 속도, 음량, 샘플레이트, 비트레이트, 출력 형식은 요청마다 설정할 수 있고, 장문 합성은 비동기 방식으로 최대 100만 자, 스트리밍 인터페이스로 최대 10,000자를 받습니다. | |
| wan2.7-i2v | 阿里巴巴 | $0.092 | 초당 | Alibaba Wan 2.7 Image-to-Video — 첫 프레임 기반 생성, 첫 프레임과 마지막 프레임 사이의 전환, 기존 클립의 이어 붙이기를 지원합니다. 720P 또는 1080P(기본값 1080P)로 2~15초(기본 5초)를 생성하며 프롬프트는 최대 5,000자, 네거티브 프롬프트는 최대 500자입니다. 2~30초 길이의 mp3 또는 wav를 driving_audio로 전달할 수 있습니다. 오디오를 주지 않으면 모델이 어울리는 배경 음악이나 효과음을 만들고, 클립보다 긴 오디오는 잘리며, 짧은 오디오는 뒷부분을 무음으로 남깁니다. | |
| agnes-2.0-flash | Agnes AI | $0.0000 | 1M tokens당 | Agnes AI Agnes 2.0 Flash — 256K 입력 컨텍스트와 64K 참고 출력 한도를 갖춘 빠른 멀티모달 에이전트 모델. 채팅, 스트리밍, 도구 호출, 코딩, 추론, 이미지 이해, 에이전트 워크플로를 지원합니다. | |
| doubao-seed-2-1-turbo-260628 | 字节跳动 | $0.4620 | $2.3080 | 1M tokens당 | ByteDance Doubao Seed 2.1 Turbo — Seed 2.1 라인의 저지연 계열로, Pro와 같은 사양을 공유합니다. 256K 컨텍스트 창에 최대 입력 256K, 최대 256K 토큰 출력(기본값 4K), 256K의 사고 사슬 예산을 갖췄습니다. 심층 사고, 텍스트 생성, 멀티모달 이해, 도구 호출, 구조화된 출력을 지원하지만 Pro와 달리 json_schema 권장 사항은 없습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며, 2.1 라인에는 오디오 이해가 명시되어 있지 않습니다. 암시적 및 명시적 컨텍스트 캐싱을 지원합니다. |
| doubao-seedream-5-0-260128 | 字节跳动 | $0.034 | 요청당 | ByteDance Doubao Seedream 5.0-lite — 더 똑똑하고 제어하기 쉬운 창작, 실시간 검색, 향상된 피사체 일관성을 갖춘 텍스트-이미지 및 이미지-이미지 생성(2K 이상 해상도). | |
| happyhorse-1.1-i2v | 阿里巴巴 | $0.083 | 초당 | Alibaba HappyHorse 1.1(I2V) — 질감, 클립 간 인물 일관성, 동작의 유려함, 오디오-영상 동기화가 개선된 이미지-비디오 생성. 720P/1080P. | |
| step-1o-turbo-vision | StepFun | $0.4000 | $1.2800 | 1M tokens당 | StepFun step-1o-turbo-vision — 이미지와 비디오 이해에 빠른 텍스트 생성을 더한 32K 컨텍스트 모델. 텍스트, 이미지, 비디오를 입력받고 텍스트만 반환합니다. 호환성을 위해 유지되는 이전 세대 비전 모델이며, 동일한 입력 모달리티는 step-3.7-flash가 256K 컨텍스트와 선택 가능한 추론 강도로 처리합니다. 인식 정확도를 위해 이미지의 긴 변은 4096 픽셀 이하로 유지하세요. |
| wan2.7-videoedit | 阿里巴巴 | $0.092 | 초당 | Alibaba Wan2.7 VideoEdit — 자연어로 지시하는 국소 또는 전역 영상 편집, 참조 이미지 기반 요소 교체, 모션·효과·카메라 워크 복제. | |
| agnes-image-2.1-flash | Agnes AI | $0.000 | 요청당 | Agnes AI Image 2.1 Flash — 정보 밀도가 높은 장면을 위한 디테일 중심 이미지 생성 및 편집 모델. 텍스트-이미지, 이미지-이미지, 다중 이미지 합성을 지원하며 1K~4K 범위의 유연한 크기와 화면비를 선택할 수 있습니다. | |
| doubao-seedance-2-5-260628 | 字节跳动 | $10.7000 | $10.7000 | 1M tokens당 | ByteDance Seedance 2.5 — Seedance의 주력 모델로, 한 번의 생성을 24 fps에서 4~30초까지 늘리는 대신 해상도는 480p와 720p로 제한합니다. 멀티모달 참조 기반 생성은 이미지 1~30장, 참조 영상 최대 10개, 참조 오디오 최대 10개(각각 합계 30초)까지 확장되며, 2.0 라인과 달리 오디오 참조를 단독으로 쓸 수 있습니다. 그 밖에 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구도 지원합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환합니다. |
| glm-tts | 智谱 | $0.3077 | 1만 자당 | Zhipu GLM-TTS — GRPO 강화학습을 적용한 2단계 생성 아키텍처 기반 음성 합성 모델로, 명시적인 마크업을 요구하지 않고 주변 문맥에서 감정과 억양을 추론합니다. 내장 음성 7종(기본값 tongtong과 xiaochen, chuichui, jam, kazi, douji, luodo)을 제공하며 속도와 음량을 조절할 수 있고, 요청당 최대 1,024자를 받으며 첫 프레임 지연 시간 400 ms 미만으로 스트리밍합니다. 권장 샘플레이트 24 kHz의 wav 또는 pcm을 반환하며 스트리밍은 pcm만 지원합니다. | |
| kling-v3-omni | 快手 | $0.420 | 요청당 | Kling 3.0 Omni — 참조 이미지 기반 다중 이미지 영상 생성. 표시 가격은 std 등급(720p, 5초, 오디오 없음, 참조 영상 없음) 기준입니다. mode를 지정하지 않은 요청은 업스트림 기본값인 pro 등급으로 처리되어 1.33배가 과금되며, 같은 5초 클립 기준 약 $0.56입니다. 4k는 5배가 과금됩니다. 표시 가격으로 이용하려면 mode=std를 전달하세요. | |
| MiniMax-H3 | MiniMax | $0.080 | 초당 | MiniMax H3(Hailuo 3.0) — 네이티브 스테레오 오디오를 한 번에 함께 생성하는 차세대 오픈 범용 멀티모달 영상 모델. 768P 또는 2K, 4~15초(정수만 허용), 24 fps로 출력합니다. 텍스트-비디오, 첫 프레임과 마지막 프레임 중 하나 또는 둘 다를 사용하는 이미지-비디오, 그리고 이미지·비디오·오디오를 소재로 하는 참조 기반 생성을 지원하며 캐릭터, 모션, 카메라, 스타일, 목소리, 편집 리듬을 지정할 수 있습니다. 이미지-비디오와 참조 기반 생성은 한 요청에서 함께 쓸 수 없습니다. 입력은 H.264/H.265 영상, JPG, JPEG, PNG, WEBP, HEIC, HEIF 이미지, WAV 또는 MP3 오디오를 받으며 프롬프트는 최대 7,000자입니다. 768P는 초당 $0.08, 2K는 초당 $0.13. | |
| step-asr-1.1 | StepFun | $0.3500 | 오디오 1시간당 | StepFun step-asr-1.1 — 중국어, 영어, 중국어 방언을 포괄하는 step-asr 계열 범용 인식 모델의 개선판. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다. | |
| deepseek-v4-pro | DeepSeek | $0.4350 | $0.8700 | 1M tokens당 | DeepSeek V4 Pro — 코딩, 추론, 에이전트 업무를 위한 DeepSeek V4의 고성능 등급으로, 1M 토큰 컨텍스트 창과 최대 384K 출력을 갖췄습니다. 사고 모드(기본값)와 비사고 모드 양쪽으로 동작하며 도구 호출과 JSON 출력을 지원합니다. 텍스트 입력, 텍스트 출력. |
| glm-5-turbo | 智谱 | $1.2000 | $4.0000 | 1M tokens당 | Zhipu GLM-5-Turbo — 처리량을 중시한 GLM-5 변형으로, 에이전트 워크플로에 맞게 최적화되었습니다. 여러 단계에 걸친 작업에서 도구와 스킬 호출이 더 안정적이고, 복잡한 장기 연쇄 지시를 더 잘 처리하며, 예약 실행이나 장시간 실행 작업도 수행합니다. 200K 컨텍스트 창, 최대 128K 토큰 출력, 텍스트 입력과 텍스트 출력. 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다. |
| glm-asr-2512 | 智谱 | $0.1440 | 오디오 1시간당 | Zhipu GLM-ASR-2512 — 문자 오류율 0.0717을 공개한 음성 인식 모델. 표준 중국어와 함께 쓰촨어, 광둥어, 민난어, 우어, 미국식과 영국식 영어 억양, 그리고 프랑스어, 독일어, 일본어, 한국어, 스페인어, 아랍어를 포함한 수십 개 언어를 지원합니다. 언어가 섞인 발화, 전문 용어, 구어체 발화를 처리하며 도메인 어휘를 위한 사용자 사전을 받을 수 있습니다. 오디오는 요청당 30초, 25 MB로 제한되며 배치 전사와 스트리밍 전사를 모두 지원합니다. | |
| kimi-k2.7-code | Moonshot | $0.7600 | $3.1570 | 1M tokens당 | Moonshot Kimi K2.7 Code — Kimi의 코딩 전용 모델로, 공급사 측정에 따르면 K2.6 대비 지시 준수와 장기 실행 코딩이 향상되면서 과도한 사고는 평균 약 30% 줄었습니다. 256K 컨텍스트 창, 기본 출력 32,768 토큰. 텍스트, 이미지, 비디오를 base64 콘텐츠로 받아 텍스트를 반환합니다. 사고는 필수이며 비활성화하면 오류가 발생합니다. tool_choice는 auto 또는 none으로 제한되고, reasoning_content는 여러 단계의 도구 호출을 거치는 동안 계속 전달해야 합니다. |
| qwen3.7-max | 阿里巴巴 | $2.5000 | $7.5000 | 1M tokens당 | Alibaba Qwen3.7-Max — 프로그래밍, 사무 및 생산성 업무, 장기 자율 수행을 겨냥한 비공개 소스 플래그십으로, 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 131,072 토큰 출력, 262,144 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트 입력, 텍스트 출력. 함수 호출, 구조화된 출력, 컨텍스트 캐싱을 지원합니다. |
| qwen3.7-plus | 阿里巴巴 | $0.3080 | $1.2310 | 1M tokens당 | Alibaba Qwen3.7-Plus — 실제 장면을 인식하고, 화면을 읽어 GUI를 조작하며, 시각적 참조로부터 코드를 생성하고, 모바일 앱 안에서 종단 간 내비게이션을 수행하는 멀티모달 하이브리드 에이전트 모델. 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 131,072 토큰 출력, 262,144 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며 함수 호출, 구조화된 출력, 컨텍스트 캐싱을 지원합니다. |
| qwen3.8-max | 阿里巴巴 | $1.9900 | $5.9700 | 1M tokens당 | Alibaba Qwen3.8-Max — 2.4조 파라미터 MoE 플래그십이자 Qwen 제품군에서 가장 뛰어난 모델로, 공급사는 코딩과 사무 생산성에서 큰 향상을 내세웁니다. 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 131,072 토큰 출력, 262,144 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며 함수 호출, 구조화된 출력, 컨텍스트 캐싱을 지원합니다. |
| speech-2.8-turbo | MiniMax | $0.3077 | 1만 자당 | MiniMax speech-2.8-turbo — 2.8 음성 라인의 저지연 등급으로, HD 모델의 초현실적인 표현을 내주는 대신 자연스러운 흐름을 유지하면서 더 빠르게 합성합니다. 지원하는 40개 언어와 7가지 감정은 HD와 같으며 음높이, 발화 속도, 음량, 샘플레이트, 비트레이트, 출력 형식을 설정할 수 있습니다. 비동기 방식으로는 최대 100만 자, 스트리밍 인터페이스로는 최대 10,000자를 받습니다. | |
| stepaudio-2-asr-pro | StepFun | $0.3500 | 오디오 1시간당 | StepFun StepAudio 2 ASR Pro — 32B 파라미터 음성 인식 모델로, StepFun ASR 계열에서 정확도를 우선하는 선택지입니다. 속도와 비용을 우선한다면 stepaudio-2.5-asr를 사용하세요. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다. | |
| wan2.7-image | 阿里巴巴 | $0.031 | 요청당 | Alibaba Wan2.7 Image — 텍스트-이미지 생성, 이미지 편집, 다중 이미지 참조 생성, 대화형 편집을 지원하며 텍스트 렌더링과 지시 준수에 강합니다. | |