중국 AI 모델 요금

ChinaAPI는 DeepSeek, Qwen, GLM, Kimi를 비롯한 중국 AI 모델을 OpenAI 호환 게이트웨이 https://api.chinaapi.ai/v1 하나로 제공합니다. 모든 요금은 미국 달러 기준이며, 상위 공급업체가 제시하는 단위로 표기합니다. 같은 목록은 /api/pricing에서 JSON으로도 받을 수 있습니다.

60개 모델은 첫 충전 후 더 낮은 Paid 가격이 적용됩니다. 금액에 관계없이 한 번만 충전하면 계정 전체에 자동 적용됩니다. Paid 가격은 Standard 가격보다 낮은 경우에만 표시합니다.

공개 모델 요금
모델공급업체입력출력Paid 가격(입력)Paid 가격(출력)단위설명
agnes-2.5-flashAgnes AI$0.00001M tokens당Agnes AI Agnes 2.5 Flash — 512K 입력 컨텍스트와 65.5K 참고 출력 한도를 갖춘 빠른 멀티모달 에이전트 모델. 채팅, 스트리밍, 도구 호출, 코딩, 추론, 멀티턴 대화, 이미지 이해, 에이전트 워크플로를 지원합니다.
agnes-2.5-proAgnes AI$0.4500$0.90001M tokens당Agnes AI Agnes 2.5 Pro — 2.5 Pro Alpha 벤치마크 모델의 상용 안정 버전으로, 고급 코딩, 과학적 추론, 긴 컨텍스트 분석, 에이전트 워크플로, 이미지 이해를 위한 유료 추론 모델입니다. 1M 입력 컨텍스트와 최대 65,536 토큰 출력을 갖췄습니다.
agnes-2.5-pro-betaAgnes AI$0.1000$0.30001M tokens당Agnes AI Agnes 2.5 Pro Beta — 2.5 Pro보다 훨씬 낮은 별도의 Beta 가격으로 과금되는 Pro 제품군의 저가 등급. 고급 코딩, 과학적 추론, 긴 컨텍스트 분석, 에이전트 워크플로, 이미지 이해를 위한 유료 추론 모델로, 요청 형식, 텍스트 프로토콜, 컨텍스트 한도는 2.5 Pro와 동일합니다.
agnes-3.0-flashAgnes AI$0.00001M tokens당Agnes AI Agnes 3.0 Flash — 에이전트 코딩과 도구 기반 작업 수행을 위해 만들어진 공급사의 신세대 언어 모델로, 512K 입력 컨텍스트와 65,536 토큰 출력 한도를 갖췄습니다. 텍스트와 이미지 URL을 입력받아 텍스트를 반환하며 스트리밍, 함수 호출과 다단계 도구 오케스트레이션, 장시간 작업의 지시 준수를 지원합니다. OpenAI 호환 chat 엔드포인트, Responses 엔드포인트, Anthropic 호환 Messages 엔드포인트로 이용할 수 있습니다. chat 엔드포인트에서는 chat_template_kwargs.enable_thinking을 true로 설정하면 Thinking 모드가 켜집니다. 2026-09-21 측정에서 이 필드가 없는 요청은 추론 토큰을 반환하지 않았습니다. Thinking을 켜면 추론 토큰이 max_tokens에 포함되므로, max_tokens는 답변뿐 아니라 추론 분량까지 감안해 설정하세요.
agnes-image-2.0-flashAgnes AI$0.000요청당Agnes AI Image 2.0 Flash — 텍스트-이미지, 이미지-이미지, 다중 이미지 합성을 지원하는 빠른 이미지 생성 및 편집 모델. 생성 결과는 URL 또는 Base64 데이터로 받을 수 있습니다.
agnes-image-2.1-flashAgnes AI$0.000요청당Agnes AI Image 2.1 Flash — 정보 밀도가 높은 장면을 위한 디테일 중심 이미지 생성 및 편집 모델. 텍스트-이미지, 이미지-이미지, 다중 이미지 합성을 지원하며 1K~4K 범위의 유연한 크기와 화면비를 선택할 수 있습니다.
agnes-image-2.5-flashAgnes AI$0.000요청당Agnes AI Image 2.5 Flash — 생성, 편집, 합성, 디테일 렌더링, 프롬프트 준수에서 Image 2.1 Flash를 앞서는 최신 세대 이미지 모델. 텍스트-이미지, 이미지-이미지, 다중 이미지 합성을 지원하며 1K~4K 범위의 유연한 크기와 화면비를 선택할 수 있습니다.
agnes-video-2.5Agnes AI$0.025초당Agnes AI Video 2.5 — 텍스트, 첫·마지막 키프레임, 또는 이미지·오디오·영상 참조를 바탕으로 720P, 960P 또는 2K의 4~12초 클립을 생성하는 유료 비동기 영상 모델.
agnes-video-2.5-flashAgnes AI$0.000초당Agnes AI Video 2.5 Flash — Video 2.5의 720P 전용 변형으로, 텍스트, 첫·마지막 키프레임, 또는 이미지·오디오 참조를 바탕으로 4~12초 영상을 생성하며 비동기 작업 API는 동일합니다.
claude-fable-5Anthropic$10.0000$50.0000$7.0000$35.00001M tokens당Anthropic Claude Fable 5 — 야심 차고 오래 이어지는 지식 노동과 코딩을 위한, Anthropic의 일반 출시 모델 가운데 가장 뛰어난 모델. 여러 날에 걸친 에이전트 작업, 복잡한 소프트웨어 엔지니어링, 심층 리서치, 문서 및 비전 추론, 선제적인 자기 검증을 위해 설계되었습니다.
claude-fable-5-1Anthropic$10.0000$50.0000$8.0000$40.00001M tokens당Anthropic Claude Fable 5.1 — 야심 차고 오래 이어지는 지식 노동과 코딩을 위한 Anthropic의 최신 일반 출시 플래그십. 여러 날에 걸친 에이전트 작업, 복잡한 소프트웨어 엔지니어링, 심층 리서치, 문서 및 비전 추론, 선제적인 자기 검증을 위해 설계되었습니다. 캐시 읽기는 입력 요금의 2.5%로 과금되어 같은 세대 가운데 가장 낮습니다.
claude-haiku-4-5Anthropic$1.0000$5.0000$0.7000$3.50001M tokens당Anthropic Claude Haiku 4.5 — 최전선에 가까운 지능을 갖춘 가장 빠른 Claude 모델로, 분류, 추출, 라우팅처럼 대량이면서 지연 시간에 민감한 작업을 위해 만들어졌습니다. 텍스트와 이미지 입력, 확장 사고, 200,000 토큰 컨텍스트 창, 최대 64,000 토큰 출력을 지원합니다.
claude-haiku-5-5Anthropic$0.1000$0.5000$0.0600$0.30001M tokens당Anthropic Claude Haiku 5.5 — 분류, 추출, 라우팅, 에이전트를 위한 빠르고 비용 효율적인 텍스트 및 이미지 이해 모델입니다. 컨텍스트는 1,000,000 토큰이며 최대 128,000 토큰을 출력합니다. 적응형 사고의 기본값은 medium입니다. Messages의 output_config.effort로 low, medium, high, xhigh, max를 선택합니다. 스트리밍과 강제 도구 호출을 지원합니다. 입력이 100,000 토큰을 넘으면 출력과 캐시를 포함한 전체 요청에 장문 요금이 적용됩니다.
claude-opus-4-5Anthropic$5.0000$25.0000$3.5000$17.50001M tokens당Anthropic Claude Opus 4.5 — 이 모델 버전에 머물려는 워크로드를 위한 Opus 4.5 릴리스로, Anthropic은 현재 이 모델을 레거시 모델 목록에 올려 두고 계속 제공하고 있습니다. 텍스트와 이미지 입력, 확장 사고, 200,000 토큰 컨텍스트 창, 최대 64,000 토큰 출력을 지원합니다.
claude-opus-4-6Anthropic$5.0000$25.0000$3.5000$17.50001M tokens당Anthropic Claude Opus 4.6 — 복잡한 추론과 에이전트 업무를 위한 Opus 세대 모델로, 표준 요금이 적용되는 1,000,000 토큰 컨텍스트 창과 최대 128,000 토큰 출력을 갖췄습니다. 텍스트와 이미지 입력, 적응형 사고를 지원하며 4.7 이전 토크나이저를 사용합니다.
claude-opus-4-7Anthropic$5.0000$25.0000$3.5000$17.50001M tokens당Anthropic Claude Opus 4.7 — 어려운 소프트웨어 엔지니어링과 복잡하고 오래 이어지는 에이전트 작업을 위한 고급 추론 모델. 엄밀한 지시 준수, 자기 검증, 신뢰할 수 있는 도구 사용, 그리고 인터페이스와 이미지, 문서, 전문 업무 전반에 걸친 고해상도 비전을 강조합니다.
claude-opus-4-8Anthropic$5.0000$25.0000$3.5000$17.50001M tokens당Anthropic Claude Opus 4.8 — 코딩, 에이전트 워크플로, 전문 분석, 장기 실행 업무를 위한 고성능 추론 모델. Opus 4.7 대비 신뢰성, 판단력, 도구 사용 효율, 컴퓨터 사용, 멀티모달 문서 추론이 향상되었으며 1,000,000 토큰 컨텍스트 창을 지원합니다.
claude-opus-5Anthropic$5.0000$25.0000$3.0000$15.00001M tokens당Anthropic Claude Opus 5 — 복잡한 에이전트 코딩과 엔터프라이즈 업무를 위한 심층 추론 모델로, 장기 실행 작업, 코드 리뷰, 문서 워크플로, 비전, 멀티 에이전트 협업에서 크게 향상되었습니다. 1,000,000 토큰 컨텍스트 창을 갖추고 최대 128,000 토큰 출력을 지원하며 적응형 사고가 기본 활성화됩니다.
claude-opus-5-5Anthropic$4.0000$20.0000$2.4000$12.00001M tokens당Anthropic Claude Opus 5.5 — 장시간 실행되는 에이전트 코딩과 지식 업무를 위해 설계되었으며, Claude Opus 5보다 저렴합니다. 텍스트와 이미지 입력을 지원하고 1,000,000 토큰 컨텍스트 창을 갖추었으며 최대 128,000 토큰 출력을 지원합니다. 적응형 사고는 항상 켜져 있으며, effort 매개변수로 추론 깊이를 조절하고 기본값은 medium입니다.
claude-sonnet-4-5Anthropic$3.0000$15.0000$2.1000$10.50001M tokens당Anthropic Claude Sonnet 4.5 — 이 모델 버전에 머물려는 워크로드를 위한 Sonnet 4.5 릴리스로, Anthropic은 현재 이 모델을 레거시 모델 목록에 올려 두고 계속 제공하고 있습니다. 텍스트와 이미지 입력, 확장 사고, 200,000 토큰 컨텍스트 창, 최대 64,000 토큰 출력을 지원합니다.
claude-sonnet-4-6Anthropic$3.0000$15.0000$2.1000$10.50001M tokens당Anthropic Claude Sonnet 4.6 — 균형 잡힌 Sonnet 세대 모델로, 표준 요금이 적용되는 1,000,000 토큰 컨텍스트 창과 최대 128,000 토큰 출력을 제공합니다. 텍스트와 이미지 입력, 적응형 사고를 지원하며 4.7 이전 토크나이저를 사용하므로, 토큰당 요금이 같은 조건에서 같은 텍스트가 4.7 이후 모델보다 약 30% 적은 토큰으로 처리됩니다.
claude-sonnet-5Anthropic$2.0000$10.0000$1.4000$7.00001M tokens당Anthropic Claude Sonnet 5 — 코딩, 에이전트, 엔터프라이즈 워크플로를 위해 최전선 지능과 속도를 균형 있게 갖춘 프로덕션 모델. 계획을 세우고 브라우저와 터미널 도구를 사용하며, 추론과 지식 노동, 소프트웨어 엔지니어링 작업을 자율적으로 수행할 수 있습니다.
claude-sonnet-5-5Anthropic$2.0000$10.0000$1.2000$6.00001M tokens당Anthropic Claude Sonnet 5.5 — 코딩, 에이전트, 프로덕션 워크로드를 위해 속도와 지능의 균형을 갖춘 모델. 텍스트와 이미지 입력을 지원하고 1,000,000 토큰 컨텍스트 창을 갖추었으며 최대 128,000 토큰 출력을 지원합니다. 적응형 사고는 기본적으로 켜져 있고 사고 토큰은 출력으로 과금됩니다. output_config.effort로 low, medium, high, xhigh, max 중에서 선택할 수 있으며 기본값은 high입니다. 사전 사고를 끄려면 type을 between_tools로 지정한 thinking을 보내세요. 이 설정은 effort가 high 이하일 때만 동작하며, type을 disabled로 지정하면 거부됩니다. temperature, top_p, top_k를 기본값이 아닌 값으로 설정하면 오류가 반환되며, tool_choice any 또는 tool로 도구 호출을 강제해도 마찬가지입니다. 사고 블록은 모델과 대화에 묶여 있으므로 이후 턴에서 변경 없이 그대로 다시 보내야 합니다.
cogview-4Zhipu AI$0.010$0.0095요청당Zhipu CogView-4 — CogView의 네 번째 세대 텍스트-이미지 모델로, 여러 출력 해상도를 지원하며 기본과 고화질 두 가지 서비스 등급을 모두 제공합니다. 중국어와 영어 프롬프트를 받고 이미지 안에 텍스트를 렌더링합니다. 요청당 이미지 한 장을 생성합니다.
deepseek-flashDeepSeek$0.1500$0.60001M tokens당DeepSeek V4.1 Flash — 신규 연동에 사용하는 정식 모델 ID입니다. 텍스트와 이미지 입력, 사고 모드와 비사고 모드, 도구 호출, JSON 출력을 지원합니다. 지원이 종료된 deepseek-v4-flash와 deepseek-v4-flash-vision-exp ID는 호환용 별칭으로 남아 있으며, 같은 Flash 가격으로 이 모델이 그대로 처리합니다. 1M 토큰 컨텍스트 창, 최대 384K 출력. /v1/responses에서는 턴마다 대화 전체를 input 배열에 담아 보내야 합니다. 업스트림에 대화 상태가 보관되지 않으므로, previous_response_id 또는 conversation을 포함한 요청은 거부됩니다.
deepseek-v4-proDeepSeek$0.6600$1.98001M tokens당DeepSeek V4 Pro 0813 — 코딩, 추론, 에이전트 업무를 위한 DeepSeek V4의 고성능 등급으로, 1M 토큰 컨텍스트 창과 최대 384K 출력을 갖췄습니다. 사고 모드(기본값)와 비사고 모드 양쪽으로 동작하며 도구 호출과 JSON 출력을 지원합니다. 텍스트 입력, 텍스트 출력. /v1/responses에서는 턴마다 대화 전체를 input 배열에 담아 보내야 합니다. 업스트림에 대화 상태가 보관되지 않으므로, previous_response_id 또는 conversation을 포함한 요청은 거부됩니다.
doubao-seed-2-1-pro-260628ByteDance$0.8889$4.44441M tokens당ByteDance Doubao Seed 2.1 Pro — 프로덕션 업무를 위한 Doubao 플래그십 에이전트 모델로, 심층 사고, 텍스트 생성, 멀티모달 이해, 도구 호출, 구조화된 출력을 지원하며 구조화된 출력에는 공급사가 json_schema 모드를 권장합니다. 256K 컨텍스트 창에 최대 입력 256K, 최대 256K 토큰 출력(기본값 4K), 256K의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며, 2.1 라인에는 오디오 이해가 명시되어 있지 않습니다. 접두사 캐시와 세션 캐시를 포함한 암시적 및 명시적 컨텍스트 캐싱을 지원합니다.
doubao-seed-2-1-turbo-260628ByteDance$0.4444$2.22221M tokens당ByteDance Doubao Seed 2.1 Turbo — Seed 2.1 라인의 저지연 계열로, Pro와 같은 사양을 공유합니다. 256K 컨텍스트 창에 최대 입력 256K, 최대 256K 토큰 출력(기본값 4K), 256K의 사고 사슬 예산을 갖췄습니다. 심층 사고, 텍스트 생성, 멀티모달 이해, 도구 호출, 구조화된 출력을 지원하지만 Pro와 달리 json_schema 권장 사항은 없습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며, 2.1 라인에는 오디오 이해가 명시되어 있지 않습니다. 암시적 및 명시적 컨텍스트 캐싱을 지원합니다.
doubao-seed-character-260628ByteDance$0.1185$0.29631M tokens당ByteDance Doubao Seed Character (260628) — 페르소나 중심의 멀티턴 대화를 위한 Doubao의 캐릭터 대화 모델로, doubao-1-5-pro-32k-character의 후속 라인입니다. 이 빌드에는 공급사가 부여한 심층 사고, 텍스트 생성, 멀티모달 이해, 도구 호출, 구조화된 출력(json_schema 권장) 기능 레이블이 붙어 있습니다. 128K 컨텍스트 창에 최대 입력 96K, 최대 32K 토큰 출력(기본값 4K)을 갖췄습니다. 요금은 입력 길이에 따라 정해집니다. 입력 32K 토큰 이하 요청은 표준 요금 구간으로, 그보다 긴 요청은 긴 컨텍스트 요금 구간으로 과금되며, 긴 컨텍스트 구간에서는 입력 요금이 표준 구간의 1.5배, 출력 요금이 표준 구간의 세 배입니다.
doubao-seed-evolvingByteDance$0.8889$4.44441M tokens당ByteDance Doubao Seed Evolving — Doubao의 현행 코딩·에이전트 플래그십으로, 롤링 릴리스 방식으로 공개됩니다. 공급사는 날짜가 붙은 스냅숏 없이 같은 ID로 모델을 매주 업데이트하므로, 버전이 올라가지 않은 채 동작과 기능이 바뀔 수 있습니다. 공급사가 부여한 심층 사고, 텍스트 생성, 멀티모달 이해, GUI 작업 처리, 도구 호출, 구조화된 출력(json_schema 권장) 기능 레이블이 붙어 있습니다. 1,024K 컨텍스트 창에 최대 입력 1,024K, 최대 256K 토큰 출력(기본값 4K)을 갖췄습니다.
doubao-seedance-2-0-260128ByteDance$7.00001M tokens당ByteDance Seedance 2.0 — Seedance 2.0 라인의 플래그십이자 480p와 720p에 더해 1080p와 4K(10비트 심도)까지 도달하는 라인의 유일한 모델로, 24 fps에 4~15초입니다. 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 이미지 1~9장과 합계 15초 이내의 참조 영상 최대 3개를 사용하는 멀티모달 참조 기반 생성, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구를 지원합니다. 오디오 참조는 반드시 이미지나 영상과 함께 제공해야 합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환하며 마지막 프레임을 이미지로 받을 수 있습니다. 출력 해상도에 따라 과금됩니다.
doubao-seedance-2-0-fast-260128ByteDance$5.60001M tokens당ByteDance Seedance 2.0 Fast — 비용 효율적인 영상 생성으로, Seedance 2.0의 기능 전체를 갖추되 480p와 720p, 24 fps, 4~15초로 제한됩니다. 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 이미지 1~9장과 합계 15초 이내의 참조 영상 최대 3개를 사용하는 멀티모달 참조 기반 생성, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구를 지원합니다. 오디오 참조는 반드시 이미지나 영상과 함께 제공해야 합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환합니다. 480p 5초 ≈ $0.26.
doubao-seedance-2-0-mini-260615ByteDance$3.50001M tokens당ByteDance Seedance 2.0 Mini — Seedance 2.0 라인의 가볍고 부담 없는 등급으로, 480p와 720p, 24 fps, 4~15초로 제한됩니다. 문서화된 기능은 라인의 다른 모델과 동일합니다. 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 이미지 1~9장과 합계 15초 이내의 참조 영상 최대 3개를 사용하는 멀티모달 참조 기반 생성, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구를 지원합니다. 오디오 참조는 반드시 이미지나 영상과 함께 제공해야 합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환합니다.
doubao-seedance-2-5-260628ByteDance$10.70001M tokens당ByteDance Seedance 2.5 — Seedance의 주력 모델로, 한 번의 생성을 24 fps에서 4~30초까지 늘리는 대신 해상도는 480p와 720p로 제한합니다. 멀티모달 참조 기반 생성은 이미지 1~30장, 참조 영상 최대 10개, 참조 오디오 최대 10개(각각 합계 30초)까지 확장되며, 2.0 라인과 달리 오디오 참조를 단독으로 쓸 수 있습니다. 그 밖에 텍스트-비디오, 첫 프레임 및 첫·마지막 프레임 기반 이미지-비디오, 영상 편집, 영상 연장, 오디오 포함 생성, 웹 검색 도구도 지원합니다. 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 비율의 MP4를 반환합니다.
doubao-seedream-4-5-251128ByteDance$0.03704요청당ByteDance Doubao Seedream 4.5 — 다중 이미지 융합을 지원하는 텍스트-이미지 및 이미지-이미지 생성으로, 단일 이미지 또는 서로 연결된 이미지 세트를 만들어냅니다. 단일 이미지 모드는 프롬프트만, 참조 이미지 한 장, 또는 참조 이미지 2~14장을 받습니다. 그룹 모드(sequential_image_generation=auto)는 텍스트에서 최대 15장, 참조 이미지 한 장에서 최대 14장, 참조 이미지 2~14장에서는 입력과 출력의 합이 15장을 넘지 않는 범위의 세트를 반환합니다. 2K와 4K 출력을 지원하며 기본적으로 JPEG를 URL 또는 base64로 반환합니다. 좌표 기반 대화형 편집은 Seedream 5.0 Pro(doubao-seedream-5-0-pro-260628)에서만 사용할 수 있습니다.
doubao-seedream-5-0-260128ByteDance$0.03259요청당ByteDance Doubao Seedream 5.0-lite — 더 똑똑하고 제어하기 쉬운 창작, 실시간 검색, 향상된 피사체 일관성을 갖춘 텍스트-이미지 및 이미지-이미지 생성(2K 이상 해상도).
doubao-seedream-5-0-pro-260628ByteDance$0.045요청당ByteDance Doubao Seedream 5.0 Pro — 제어 가능한 창작을 위한 공급사 최상위 이미지 모델. 텍스트-이미지, 단일 참조 및 다중 참조 이미지-이미지(참조 이미지 2~10장), 좌표·박스·화살표를 이용한 대화형 편집, 그리고 이미지 한 장을 베이스와 최대 16개 레이어로 나누는 레이어 분해를 지원합니다. 각 레이어는 고유한 크기, z_index, 바운딩 박스와 함께 반환됩니다(layer_decomposition=true 설정). 단일 이미지 출력만 지원하며 그룹(연속) 생성, 웹 검색, 스트리밍은 지원하지 않습니다. 출력 이미지 단위로 장면과 픽셀 구간에 따라 과금됩니다. 2.61 MP 이하 단일 이미지가 기본 가격이고, 2.61 MP를 넘으면 2배입니다. 레이어 분해에서는 반환된 레이어마다 0.5배(2.61 MP 초과 시 1배)로 따로 과금되며, 첫 장을 초과하는 참조 이미지는 한 장마다 기본 가격의 1/15씩 추가됩니다.
fun-asr-flash-2026-06-15Alibaba$0.1260오디오 1시간당Alibaba Fun-ASR Flash (2026-06-15) — 프롬프트 문맥과, 중국어 방언 및 30개가 넘는 언어에 걸친 자동 언어 감지를 지원하는 저지연 녹음 음성 인식 모델. URL, Base64 또는 업로드한 AAC/AMR/AVI/FLAC/FLV/M4A/MKV/MOV/MP3/MP4/MPEG/OGG/OPUS/WAV/WEBM/WMA/WMV 오디오를 받으며, 최대 5분, 2 GB까지입니다.
gemini-2.5-flash-imageGoogle$0.3000$2.5000$0.2100$1.75001M tokens당Google Gemini 2.5 Flash Image(Nano Banana) — 창작 워크플로를 위한 빠른 네이티브 이미지 생성 및 편집 모델. 텍스트와 이미지를 입력받아 OpenAI 호환 chat completions 엔드포인트를 통해 이미지를 반환하며, 입력 한도는 65,536 토큰, 출력 한도는 32,768 토큰입니다.
gemini-2.5-proGoogle$1.2500$10.0000$0.8125$6.50001M tokens당Google Gemini 2.5 Pro — 2.5 제품군의 추론 등급 모델로, 1M 토큰 컨텍스트 창을 갖췄습니다. 200,000 토큰을 넘는 프롬프트는 Google 자체 규칙과 동일하게 요청 전체가 공급사의 긴 컨텍스트 요금으로 재산정됩니다.
gemini-3-pro-imageGoogle$2.0000$12.0000$1.4000$8.40001M tokens당Google Gemini 3 Pro Image (Nano Banana Pro) — 전문적인 이미지 생성과 대화형 편집을 위한 추론 기반 프리미엄 모델. 복잡한 그래픽 디자인, 고충실도 제품 목업, 정확한 다국어 텍스트 렌더링, 브랜드 일관성, Google Search로 그라운딩한 사실 기반 시각화에 뛰어납니다. 텍스트와 이미지를 입력받아 텍스트와 이미지를 반환하고, 사고를 지원하며, 1K, 2K 또는 4K 출력을 생성합니다.
gemini-3.1-flash-imageGoogle$0.5000$3.0000$0.3500$2.10001M tokens당Google Gemini 3.1 Flash Image(Nano Banana 2) — 고품질 이미지 생성과 대화형 편집을 위한 안정 버전 저지연 모델. 텍스트, 이미지, PDF를 입력받고 사고와 검색 그라운딩을 지원하며, 대량 제작 워크플로를 위해 0.5K, 1K, 2K, 4K 이미지를 생성할 수 있습니다.
gemini-3.1-flash-lite-imageGoogle$0.2500$1.5000$0.1750$1.05001M tokens당Google Gemini 3.1 Flash-Lite Image(Nano Banana 2 Lite) — 대량 이미지 생성과 빠른 멀티턴 편집을 위한 초저지연 비용 효율 모델. 텍스트와 이미지를 입력받아 1K 이미지를 생성하고 사고와 대화형 편집을 지원하며, 대화형 개발자 및 소비자 애플리케이션을 위해 설계되었습니다.
gemini-3.5-flashGoogle$1.5000$9.0000$1.0500$6.30001M tokens당Google Gemini 3.5 Flash — 지속적인 에이전트 성능, 빠른 코딩 루프, 서브 에이전트 배치, 오래 이어지는 다단계 워크플로에 최적화된 안정 버전 멀티모달 모델. 텍스트, 이미지, 비디오, 오디오, PDF를 입력받고 사고와 내장 도구를 지원하며 1,048,576 토큰 입력 컨텍스트와 최대 65,536 토큰 출력을 제공합니다.
gemini-3.6-flashGoogle$0.7500$3.7500$0.5250$2.62501M tokens당Google Gemini 3.6 Flash — 에이전트 작업과 실제 업무를 위해 속도와 지능의 균형을 맞춘 안정 버전 멀티모달 추론 모델. 입력 컨텍스트는 1,048,576 토큰, 출력 한도는 65,536 토큰입니다. 텍스트, 이미지, 비디오, 오디오, PDF를 입력받으며 사고, 함수 호출, 코드 실행, 검색 그라운딩, 구조화된 출력, Computer Use(프리뷰)를 지원합니다. 요금 안내: 이 모델의 Google 정가는 2026년 12월 31일까지 프로모션 가격이 적용되어 1M 토큰당 입력 $0.75 / 출력 $3.75 / 캐시 입력 $0.075입니다. 2027년 1월 1일부터 공급사 정가는 $1.50 / $7.50 / $0.15로 돌아가며, 당사 가격도 같은 기준으로 그에 맞춰 조정됩니다.
gemini-3.7-flashGoogle$0.7500$3.7500$0.5250$2.62501M tokens당Google Gemini 3.7 Flash — 최신 Flash 등급 멀티모달 추론 모델로, 공급사 프로모션 기간 동안 3.6 Flash와 동일한 가격으로 제공됩니다. 텍스트, 이미지, 비디오, 오디오, PDF를 입력받으며 사고, 함수 호출, 코드 실행, 검색 그라운딩, 구조화된 출력을 지원합니다. 요금 안내: 이 모델의 Google 정가는 2026년 12월 31일까지 프로모션 가격이 적용되어 1M 토큰당 입력 $0.75 / 출력 $3.75 / 캐시 입력 $0.075입니다. 2027년 1월 1일부터 공급사 정가는 $1.50 / $7.50 / $0.15로 돌아가며, 당사 가격도 같은 기준으로 그에 맞춰 조정됩니다.
gemini-3.8-flashGoogle$0.7500$3.7500$0.4875$2.43751M tokens당Google Gemini 3.8 Flash — Google의 빠른 멀티모달 Gemini 모델로, 여기서는 OpenAI 호환 엔드포인트와 Gemini 네이티브 엔드포인트 양쪽 모두를 통해 호출할 수 있습니다. 표준 토큰 요금은 1M 토큰당 입력 $0.75, 캐시 입력 $0.075, 출력 $3.75입니다.
glm-5Zhipu AI$1.0000$3.2000$0.9500$3.04001M tokens당Zhipu GLM-5 — 총 744B 파라미터에 활성 40B의 MoE 모델로, 28.5T 토큰으로 학습했고 DeepSeek Sparse Attention을 사용하며, 200K 컨텍스트 창과 최대 128K 토큰 출력을 갖췄습니다. 텍스트 입력, 텍스트 출력. 여러 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다.
glm-5-turboZhipu AI$1.2000$4.0000$1.1400$3.80001M tokens당Zhipu GLM-5-Turbo — 처리량을 중시한 GLM-5 변형으로, 에이전트 워크플로에 맞게 최적화되었습니다. 여러 단계에 걸친 작업에서 도구와 스킬 호출이 더 안정적이고, 복잡한 장기 연쇄 지시를 더 잘 처리하며, 예약 실행이나 장시간 실행 작업도 수행합니다. 200K 컨텍스트 창, 최대 128K 토큰 출력, 텍스트 입력과 텍스트 출력. 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다.
glm-5.1Zhipu AI$1.4000$4.4000$1.1200$3.52001M tokens당Zhipu GLM-5.1 — 장시간 자율 작업을 위해 만들어진 플래그십 파운데이션 모델. 공급사는 계획, 실행, 테스트, 반복적 최적화에 걸쳐 하나의 작업을 최대 8시간 동안 사람 개입 없이 연속 수행할 수 있다고 밝히고 있습니다. 200K 컨텍스트 창, 최대 128K 토큰 출력, 텍스트 입력과 텍스트 출력. 여러 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다.
glm-5.2Zhipu AI$1.4000$4.4000$1.1200$3.52001M tokens당Zhipu GLM-5.2 — 컨텍스트 확장만이 아니라 수개월에 걸친 전용 학습을 통해 장기 실행 코딩 에이전트 업무에 특화한 플래그십 파운데이션 모델로, 1M 토큰 컨텍스트 창과 최대 128K 토큰 출력을 갖췄습니다. 텍스트 입력, 텍스트 출력. 여러 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다.
glm-5.3Zhipu AI$1.4000$4.4000$0.9100$2.86001M tokens당Zhipu GLM-5.3 — GLM-5.2와 같은 베이스에서 사후 학습한 플래그십 코딩·에이전트 모델. Zhipu 내부 코딩 벤치마크에서 50% 향상, Terminal-Bench 3.0과 Agents' Last Exam에서 오픈소스 SOTA, CyberGym 취약점 탐지에서 최고 수준의 결과를 기록했으며 1M 토큰 컨텍스트 창과 최대 128K 토큰 출력을 갖췄습니다. 텍스트 입력, 텍스트 출력. 여러 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다.
glm-5.3-flashZhipu AI$0.1500$0.5000$0.1350$0.45001M tokens당Zhipu GLM-5.3-Flash — GLM-5 라인 최초의 네이티브 멀티모달 모델이자 저비용 최전선 등급. 총 320B 파라미터에 활성 18B로, 하이브리드 선형 + 스파스 어텐션 아키텍처를 채택해 GLM-5.3 대비 어텐션 연산과 KV 캐시를 몇 배 줄이고 GLM-4.5 대비 활성 파라미터와 레이어 수를 모두 절반으로 낮췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다. (공급사는 파일 입력도 내세우지만 여기서는 검증되지 않아 제공하지 않습니다.) 1M 토큰 컨텍스트 창과 최대 128K 토큰 출력을 갖췄습니다. 사고 모드, 함수 호출, 구조화된 JSON 출력, 스트리밍, 컨텍스트 캐싱, MCP 도구 연동을 지원합니다. 모델이 자신의 렌더링 결과를 직접 확인하며 반복하는 프런트엔드, 게임, 3D 작업 등 비주얼 코딩을 겨냥합니다.
glm-5v-turboZhipu AI$1.2000$4.0000$1.1400$3.80001M tokens당Zhipu GLM-5V-Turbo — 이미지, 비디오, 파일, 코딩, 도구 기반 에이전트 워크플로를 위한 멀티모달 추론 모델.
glm-imageZhipu AI$0.015$0.01425요청당Zhipu GLM-Image — 자기회귀 방식의 이해와 확산 방식의 디코딩을 결합한 하이브리드 아키텍처 기반 이미지 생성 모델로, 중국산 칩(Huawei Ascend)에서 엔드투엔드로 학습된 최초의 SOTA 멀티모달 모델입니다. 키워드가 아니라 지시로 읽어 들이고 프롬프트가 명시하지 않은 세부까지 채우며, 텍스트 렌더링(특히 한자)과 지식 집약적 장면이 크게 강화되었습니다. 요청당 이미지 한 장을 생성합니다.
glm-ttsZhipu AI$0.3500$0.31501만 자당Zhipu GLM-TTS — GRPO 강화학습을 적용한 2단계 생성 아키텍처 기반 음성 합성 모델로, 명시적인 마크업을 요구하지 않고 주변 문맥에서 감정과 억양을 추론합니다. 내장 음성 7종(기본값 tongtong과 xiaochen, chuichui, jam, kazi, douji, luodo)을 제공하며 속도와 음량을 조절할 수 있고, 요청당 최대 1,024자를 받으며 첫 프레임 지연 시간 400 ms 미만으로 스트리밍합니다. 권장 샘플레이트 24 kHz의 wav 또는 pcm을 반환하며 스트리밍은 pcm만 지원합니다.
gpt-5.5OpenAI$5.0000$30.0000$4.0000$24.00001M tokens당OpenAI GPT-5.5 — 복잡한 코딩과 전문 업무를 위한 최전선 추론 모델. 텍스트와 이미지 입력, 함수 호출과 내장 도구, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력, none부터 xhigh까지의 추론 강도를 지원합니다.
gpt-5.6-lunaOpenAI$0.2000$1.2000$0.1700$1.02001M tokens당OpenAI GPT-5.6 Luna — GPT-5.6 중 가장 빠르고 저렴한 등급으로, 추론과 비전, 도구 사용을 유지하면서 비용에 민감한 대량 워크로드에 최적화되었습니다. 텍스트와 이미지 입력, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력을 지원합니다.
gpt-5.6-solOpenAI$5.0000$30.0000$4.0000$24.00001M tokens당OpenAI GPT-5.6 Sol — 최전선 추론, 복잡한 전문 업무, 코딩, 과학, 사이버 보안, 장기 실행 에이전트 워크플로를 위한 GPT-5.6 플래그십 모델. 텍스트와 이미지 입력, 내장 도구, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력, 그리고 이 제품군에서 가장 깊은 추론 설정을 지원합니다.
gpt-5.6-terraOpenAI$2.0000$12.0000$1.6000$9.60001M tokens당OpenAI GPT-5.6 Terra — 일상적인 전문 업무를 위한 균형형 GPT-5.6 모델로, Sol보다 낮은 비용으로 높은 지능과 코딩 에이전트 성능을 제공합니다. 텍스트와 이미지 입력, 내장 도구, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력을 지원합니다.
gpt-6-astraOpenAI$10.0000$50.0000$7.0000$35.00001M tokens당OpenAI GPT-6 Astra — 가장 어려운 엔드투엔드 작업(복잡한 추론, 코딩, 컴퓨터 사용, 리서치, 문서 작성)을 위해 만들어진 OpenAI의 가장 뛰어난 모델. 텍스트와 이미지 입력, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력, 그리고 xhigh와 max까지의 추론 강도 설정을 지원합니다.
gpt-6-lunaOpenAI$0.1000$0.5000$0.0650$0.32501M tokens당OpenAI GPT-6 Luna — 목적이 뚜렷한 대량 작업을 위해 만들어진, OpenAI에서 가장 효율적인 모델. 텍스트와 이미지 입력, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력을 지원하며, 추론 강도는 none부터 max까지 설정할 수 있습니다(기본값 medium). 도구 호출에는 /v1/responses를 사용하세요. /v1/chat/completions에서는 reasoning_effort를 none으로 설정한 경우에만 함수 호출이 동작합니다. /v1/responses에서는 턴마다 대화 전체를 input 배열에 담아 보내야 하며, previous_response_id 또는 conversation을 포함한 요청은 거부됩니다.
gpt-6-solOpenAI$2.0000$10.0000$1.3000$6.50001M tokens당OpenAI GPT-6 Sol — 복잡한 코딩과 에이전트 워크플로를 위해 만들어진 모델. 텍스트와 이미지 입력, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력을 지원하며, 추론 강도는 none부터 max까지 설정할 수 있습니다(기본값 medium). 도구 호출에는 /v1/responses를 사용하세요. /v1/chat/completions에서는 reasoning_effort를 none으로 설정한 경우에만 함수 호출이 동작합니다. /v1/responses에서는 턴마다 대화 전체를 input 배열에 담아 보내야 하며, previous_response_id 또는 conversation을 포함한 요청은 거부됩니다.
gpt-6.1-solOpenAI$2.0000$10.0000$1.3000$6.50001M tokens당OpenAI GPT-6.1 Sol — 복잡한 코딩, 컴퓨터 사용, 전문 업무에서 GPT-6 Astra에 가까운 성능을 더 낮은 비용으로 제공하는 모델. 텍스트와 이미지 입력, 1,050,000 토큰 컨텍스트 창, 최대 128,000 토큰 출력을 지원합니다. 추론 강도는 low부터 max까지 설정할 수 있으며(기본값 medium), none과 minimal은 지원하지 않고, 추론 토큰은 출력으로 과금됩니다. 입력이 272,000 토큰을 넘으면 해당 요청의 모든 토큰이 긴 컨텍스트 요금으로 과금됩니다. 도구 호출에는 /v1/responses를 사용하세요. /v1/chat/completions는 도구 호출을 지원하지 않습니다. /v1/responses에서는 턴마다 대화 전체를 input 배열에 담아 보내야 하며, previous_response_id 또는 conversation을 포함한 요청은 거부됩니다.
gpt-image-2OpenAI$5.0000$30.0000$4.0000$24.00001M tokens당OpenAI GPT Image 2 — 빠르고 품질 높은 출력을 위한 최고 수준의 이미지 생성 및 편집 모델. 텍스트와 이미지를 입력받고 유연한 이미지 크기와 고충실도 이미지 입력을 지원하며, 호출 단위가 아니라 토큰 단위로 과금됩니다. 1M 토큰당 텍스트 입력 $5, 캐시된 텍스트 입력 $1.25, 이미지 입력 $8, 이미지 출력 $30입니다.
gpt-image-2.5-flareOpenAI$5.0000$30.0000$4.0000$24.00001M tokens당OpenAI GPT Image 2.5 Flare — OpenAI의 GPT Image 2.5 계열에 속한 이미지 생성 및 편집 모델. Flare와 gpt-image-2.5-sunburst는 한 모델의 별칭이 아니라 별개의 빌드이며, 같은 가격으로 판매됩니다. 공개 리더보드에서는 두 모델의 점수를 따로 매깁니다. 표준 토큰 요금은 1M 토큰당 텍스트 입력 $5, 캐시 입력 $1.25, 이미지 입력 $8, 이미지 출력 $30입니다.
gpt-image-2.5-sunburstOpenAI$5.0000$30.0000$4.0000$24.00001M tokens당OpenAI GPT Image 2.5 Sunburst — OpenAI의 GPT Image 2.5 계열에 속한 이미지 생성 및 편집 모델. Sunburst와 gpt-image-2.5-flare는 한 모델의 별칭이 아니라 별개의 빌드이며, 같은 가격으로 판매됩니다. 공개 리더보드에서는 두 모델의 점수를 따로 매깁니다. 표준 토큰 요금은 1M 토큰당 텍스트 입력 $5, 캐시 입력 $1.25, 이미지 입력 $8, 이미지 출력 $30입니다.
grok-4.7xAI$2.0000$6.0000$0.8000$2.40001M tokens당xAI Grok 4.7 — 코딩, 에이전트 작업, 지식 업무를 위해 만들어진 프런티어 모델. 텍스트와 이미지 입력을 지원하며 500,000 토큰 컨텍스트 창을 갖췄습니다. 추론은 끌 수 없습니다. reasoning_effort로 low, medium, high, xhigh 중에서 선택할 수 있으며(기본값 high), 추론 토큰은 출력으로 과금됩니다. 프롬프트가 200,000 토큰에 이르면 해당 요청의 모든 토큰이 긴 컨텍스트 요금으로 과금됩니다. function 도구만 사용할 수 있습니다. xAI의 서버 측 도구(웹 검색, X 검색, 코드 실행 등)는 제공되지 않으며, 이를 포함한 요청은 거부됩니다. /v1/responses에서는 턴마다 대화 전체를 input 배열에 담아 보내고 이전 응답의 암호화된 추론 항목을 변경 없이 그대로 다시 보내야 하며, previous_response_id 또는 conversation을 포함한 요청은 거부됩니다.
happyhorse-1.1-i2vAlibaba$0.140초당Alibaba HappyHorse 1.1(I2V) — 질감, 클립 간 인물 일관성, 동작의 유려함, 오디오-영상 동기화가 개선된 이미지-비디오 생성. 720P/1080P.
happyhorse-1.1-r2vAlibaba$0.140초당Alibaba HappyHorse 1.1(R2V) — 최대 9장의 참조 이미지를 사용하는 참조 기반 영상 생성. 피사체·장면·스타일 일관성과 카메라 제어가 뛰어납니다. 720P/1080P.
happyhorse-1.1-t2vAlibaba$0.140초당Alibaba HappyHorse 1.1(T2V) — 의미 이해, 카메라 제어, 역동적인 생성이 향상된 텍스트-비디오 생성. 유려하고 세밀하며 물리적으로 일관된 720P/1080P 영상을 만듭니다.
hy-mt2-liteTencent$0.0440$0.17701M tokens당Tencent HY-MT2 Lite — OpenAI Chat Completions 프로토콜로 제공되는, 낮은 지연 시간과 비용을 중시한 다국어 번역 등급. 입력 최대 4K 토큰, 출력 최대 4K 토큰이며 텍스트 전용입니다.
hy-mt2-plusTencent$0.0740$0.29501M tokens당Tencent HY-MT2 Plus — OpenAI Chat Completions 프로토콜로 제공되는 지시 준수형 다국어 번역 등급. 입력 최대 4K 토큰, 출력 최대 4K 토큰이며 텍스트 전용입니다.
hy-mt2-proTencent$0.0740$0.29501M tokens당Tencent HY-MT2 Pro — OpenAI Chat Completions 프로토콜로 고품질 다국어 번역을 제공하는 플래그십 기계 번역 등급. 입력 최대 4K 토큰, 출력 최대 4K 토큰이며 텍스트 전용입니다.
hy3Tencent$0.1320$0.52801M tokens당Tencent Hunyuan 3(Hy3) — 295B 파라미터(활성 21B) MoE 모델로, 네이티브 256K 컨텍스트와 세 가지 사고 모드(fast / low / deep)를 갖췄습니다. 코딩 에이전트, 긴 문서 이해, 멀티턴 컨텍스트 유지, 다단계 에이전트 워크플로에 강합니다. 텍스트 전용.
hy4-previewTencent$0.8340$2.50101M tokens당Tencent Hunyuan 4 preview(Hy4 preview) — 1M 토큰 컨텍스트 창(최대 입력 960K, 최대 출력 64K)에 심층 사고(Tencent는 이를 보존형 사고라고 부름), 구조화된 출력, 함수 호출, 프롬프트 캐싱을 갖췄습니다. 텍스트 전용. 프리뷰 SKU: Tencent는 정식 출시 버전이 나오면 프리뷰 모델을 종료합니다.
jev-1.13TypeSafe$0.04621M tokens당TypeSafe Jev 1.13 — 채팅 모델이 아닌 System One 의사결정 모델입니다. POST /v1/systemone으로 애플리케이션의 state(문자열, JSON 객체 또는 배열)와 타입이 지정된 질문 묶음을 보냅니다. 질문 유형은 choice(주어진 선택지 중 하나를 고름), score(정의한 순서형 등급 위에 위치시킴), noul(예/아니요 진술이 참일 확률) 중 하나이며, 모든 선택지의 확률과 신뢰도가 포함된 타입 지정 답변이 보통 70–500 ms 안에 돌아옵니다. 모든 질문은 같은 state를 기준으로 병렬 평가되므로 여러 질문을 한 번의 요청에 담을 수 있습니다. 공식 TypeSafe Python·JavaScript SDK는 base URL을 https://api.chinaapi.ai로 설정하기만 하면 그대로 사용할 수 있습니다. 입력 토큰 기준으로만 과금되며 출력은 무료입니다. 텍스트 입력만 지원하며 요청당 최대 32K 토큰입니다. 주요 언어는 영어이므로 다른 언어는 사용 전에 먼저 테스트하세요.
jev-latestTypeSafe$0.04621M tokens당TypeSafe Jev(latest) — TypeSafe SDK가 model을 지정하지 않았을 때 호출하는 별칭입니다. 현재 jev-1.13을 제공하며, 가격이 같고 POST /v1/systemone에서 같은 System One 계약을 따릅니다. state와 타입이 지정된 choice·score·noul 질문을 입력하면 확률과 신뢰도가 포함된 타입 지정 답변이 출력됩니다. 응답의 model 필드에는 실제로 답한 버전이 표시됩니다. 새 Jev 릴리스로 별칭을 옮기는 것은 가격을 확인한 뒤에만 하므로, 이 버전에 맞춰 임계값을 조정했다면 jev-1.13을 고정해서 사용하세요.
kimi-k2.6Moonshot$0.9500$4.0000$0.7600$3.20001M tokens당Moonshot Kimi K2.6 — 대화, 코드 생성, 시각 이해, 에이전트 작업을 위한 범용 모델로, 이전 세대보다 장기 실행 코드 작성과 자율 수행 능력이 강해졌습니다. 256K 컨텍스트 창, 기본 출력 32,768 토큰. 텍스트, 이미지(png, jpeg, webp, gif), 비디오(mp4, mov, webm 등)를 base64 콘텐츠로 받아 텍스트를 반환합니다. 사고 모드는 기본으로 켜져 있으며 끌 수 있습니다. temperature는 사고를 켜면 1.0, 끄면 0.6으로 고정됩니다.
kimi-k2.7-codeMoonshot$0.9500$4.0000$0.7600$3.20001M tokens당Moonshot Kimi K2.7 Code — Kimi의 코딩 전용 모델로, 공급사 측정에 따르면 K2.6 대비 지시 준수와 장기 실행 코딩이 향상되면서 과도한 사고는 평균 약 30% 줄었습니다. 256K 컨텍스트 창, 기본 출력 32,768 토큰. 텍스트, 이미지, 비디오를 base64 콘텐츠로 받아 텍스트를 반환합니다. 사고는 필수이며 비활성화하면 오류가 발생합니다. tool_choice는 auto 또는 none으로 제한되고, reasoning_content는 여러 단계의 도구 호출을 거치는 동안 계속 전달해야 합니다.
kimi-k2.7-code-highspeedMoonshot$1.9000$8.00001M tokens당Moonshot Kimi K2.7 Code Highspeed — K2.7 Code의 처리량 중심 등급으로, 같은 모델을 초당 약 180 토큰, 짧은 컨텍스트 작업에서는 최대 260 토큰으로 제공합니다. 256K 컨텍스트 창, 기본 출력 32,768 토큰. 텍스트, 이미지, 비디오를 base64 콘텐츠로 받아 텍스트를 반환합니다. 사고는 필수이며 비활성화하면 오류가 발생합니다. tool_choice는 auto 또는 none으로 제한되고, reasoning_content는 여러 단계의 도구 호출을 거치는 동안 계속 전달해야 합니다.
kimi-k3Moonshot$3.0000$15.0000$1.9500$9.75001M tokens당Moonshot Kimi K3 — 장기 실행 코딩, 종단 간 지식 노동, 심층 추론을 위한 2.8조 파라미터 플래그십으로, 1M 토큰 컨텍스트 창과 최대 1,048,576 토큰의 완성 출력(기본값 131,072)을 갖췄습니다. 텍스트, base64로 인코딩된 이미지, base64로 인코딩된 비디오를 입력받아 텍스트를 반환합니다. 사고는 항상 켜져 있으며 추론 강도의 기본값은 max입니다. temperature는 1.0으로 고정됩니다. 사용자 정의 도구 호출과 도구 동적 로딩을 지원합니다.
kling-3.0-turboKuaishou$0.560요청당Kuaishou Kling 3.0 Turbo — Kling 3.0 라인의 가성비 등급으로, 프롬프트 또는 첫 프레임 이미지에서 720P 또는 1080P(기본값 720P) 영상을 3~15초(기본값 5초), 16:9, 9:16, 1:1 비율로 생성합니다. 네이티브 오디오는 항상 포함되며 켜고 끄는 스위치가 없습니다. kling-v3와 비교하면 속도와 비용을 얻는 대신 4K 등급, 마지막 프레임 제어, 영상 입력을 포기했습니다. 720p 5초 오디오 포함 ≈ $0.56.
kling-v3Kuaishou$0.420요청당Kuaishou Kling 3.0 — 네이티브 오디오와 향상된 요소 일관성을 갖춘 텍스트-비디오 및 이미지-비디오 생성. 클립은 3~15초(기본값 5초), 16:9, 9:16, 1:1 비율이며 등급은 mode로 선택합니다. std가 720P, pro가 1080P, 4k가 네이티브 4K입니다. 오디오는 sound=on으로 직접 켜야 하며 기본값은 꺼짐입니다. 이미지-비디오는 첫 프레임을 받고 마지막 프레임은 선택 사항입니다. 초당 $0.083부터(720p).
kling-v3-omniKuaishou$0.420요청당Kling 3.0 Omni — 참조 이미지 기반 다중 이미지 영상 생성. 표시 가격은 std 등급(720p, 5초, 오디오 없음, 참조 영상 없음) 기준입니다. mode를 지정하지 않은 요청은 업스트림 기본값인 pro 등급으로 처리되어 1.33배가 과금되며, 같은 5초 클립 기준 약 $0.56입니다. 4k는 5배가 과금됩니다. 표시 가격으로 이용하려면 mode=std를 전달하세요.
LongCat-2.0Meituan$0.3000$1.20001M tokens당Meituan LongCat-2.0 — 네이티브 1M 컨텍스트를 갖춘 1.6T 파라미터 오픈 MoE 모델로, 에이전트 코딩과 장기 실행 도구 사용을 위해 만들어졌습니다. 텍스트 전용 추론 모델.
M2-herMiniMax$0.3000$1.20001M tokens당MiniMax M2-her — 롤플레이와 멀티턴 채팅을 위해 만들어진 대화 모델로, 65,536 토큰 컨텍스트 창을 갖추고 응답은 2,048 토큰(max_completion_tokens)으로 제한됩니다. OpenAI 호환 chat 엔드포인트에서는 system / user / assistant 외에 공급사의 확장 메시지 역할인 user_system(사용자의 페르소나), group(대화의 이름), sample_message_user / sample_message_ai(응답 스타일을 이끄는 예시 대화)를 받습니다. 확장 역할 메시지에는 모두 name 필드가 있어야 하며, 없으면 공급사가 오류 2013으로 요청 전체를 거부합니다. 일반 system/user/assistant 메시지에는 name이 필요 없습니다. 텍스트 전용이라 이미지 입력은 받지 않으며, 공급사 문서에는 도구 호출이나 캐싱에 대한 기술이 없습니다. 모든 호출에는 보이는 프롬프트 외에 공급사 측 페르소나 오버헤드가 약 170 토큰 추가되며 입력으로 과금됩니다.
mimo-v2.5Xiaomi$0.1400$0.28001M tokens당Xiaomi MiMo-V2.5 — 1M 컨텍스트와 최대 128K 출력을 갖춘 네이티브 전 모달리티 모델로, 이미지와 비디오, 오디오, 텍스트를 하나의 모델에서 이해합니다. 심층 사고, 함수 호출, 구조화된 출력, 웹 검색을 지원하며 전 모달리티 에이전트 기능을 갖췄습니다.
mimo-v2.5-asrXiaomi$0.0740오디오 1시간당Xiaomi MiMo v2.5 ASR — 중국어와 영어, 중국어 방언에 최적화된 음성 인식 모델. 잡음이 많거나 원거리에서 녹음된 오디오, 다중 화자 오디오는 물론 가사 전사도 처리합니다.
mimo-v2.5-proXiaomi$0.4350$0.87001M tokens당Xiaomi MiMo-V2.5-Pro — 1M 컨텍스트와 최대 128K 출력을 갖춘 조 단위 파라미터 플래그십(활성 42B)으로, 고강도 에이전트 워크로드에 맞게 튜닝되었습니다. 심층 사고, 함수 호출, 구조화된 출력, 웹 검색을 지원합니다. 텍스트 생성 전용으로, mimo-v2.5와 달리 공급사의 기능 목록에 전 모달리티 이해는 포함되어 있지 않습니다.
mimo-v2.5-ttsXiaomi$0.00001만 자당Xiaomi MiMo v2.5 TTS — 내장 음성 8종을 갖춘 표현력 있는 음성 합성 모델로, 중국어 4종과 영어 4종(Mia, Chloe, Milo, Dean)을 제공하며 중국어와 영어에 더해 둥베이, 쓰촨, 허난, 광둥 방언 스타일을 지원합니다. 발화 방식은 두 가지로 지시합니다. 자연어 스타일 지시와, 기본 감정 및 복합 감정, 숨소리, 한숨, 호흡 조절을 지정하는 인라인 오디오 태그이며, 여기에는 MiMo TTS 라인에서 이 모델에만 있는 노래 모드도 포함됩니다. 24 kHz 모노 wav 또는 pcm16을 반환하고 저지연 스트리밍을 지원하며, 스트리밍에는 pcm16이 필요합니다. 컨텍스트 8K, 최대 출력 8K.
mimo-v2.5-tts-voicecloneXiaomi$0.00001만 자당Xiaomi MiMo v2.5 TTS VoiceClone — 음성 복제 모델: voice 필드에 참조 오디오 샘플을 데이터 URL(data:{mime};base64,...)로 전달하면 학습, 라벨링, 파인튜닝 과정 없이 그 목소리로 음성을 합성합니다. MP3(audio/mpeg) 또는 WAV를 지원하며 base64로 인코딩한 문자열은 10 MB로 제한됩니다. 참조 오디오의 최소 길이는 Xiaomi가 공개하지 않았습니다. 자연어 스타일 지시와 인라인 오디오 태그는 mimo-v2.5-tts에서 그대로 이어지지만 스트리밍은 사용할 수 없습니다. 요청은 호환 모드로 실행되며 합성이 끝난 뒤에 반환됩니다.
mimo-v2.5-tts-voicedesignXiaomi$0.00001만 자당Xiaomi MiMo v2.5 TTS VoiceDesign — 음성 디자인 모델: instructions 필드에 원하는 목소리를 자연어로 서술하면 그대로 설계된 목소리로 음성을 합성합니다.
mimo-v2.6-flashXiaomi$0.1400$0.2800$0.1260$0.25201M tokens당Xiaomi MiMo-V2.6-Flash — 가중치가 공개된 효율적이고 저렴한 추론 모델로, 네이티브 전 모달리티를 지원해 이미지, 비디오, 오디오, 텍스트를 하나의 모델에서 이해합니다. 1M 컨텍스트와 최대 128K 출력을 갖추고 심층 사고, 함수 호출, 구조화된 출력을 지원합니다. 비용과 처리량이 중요한 대량의 일상적 전문 업무에 적합합니다.
mimo-v2.6-proXiaomi$0.4350$0.8700$0.3915$0.78301M tokens당Xiaomi MiMo-V2.6-Pro — 가중치가 공개된 Xiaomi의 조 단위 파라미터 플래그십 추론 모델로, 네이티브 전 모달리티를 지원해 이미지, 비디오, 오디오, 텍스트를 하나의 모델에서 이해합니다. 1M 컨텍스트와 최대 128K 출력을 갖추고 심층 사고, 함수 호출, 구조화된 출력을 지원합니다. 복잡한 프로젝트, 장기 에이전트 작업, 사이버 보안, 연구 업무를 위해 만들어졌습니다.
mimo-v2.6-pro-ultraspeedXiaomi$4.3500$8.70001M tokens당Xiaomi MiMo-V2.6-Pro UltraSpeed — Xiaomi의 초고속 모드로 제공되는 MiMo-V2.6-Pro로, 출력 속도가 표준 모델보다 최대 20배 빨라 실시간 상호작용과 지연 시간에 민감한 프로덕션 환경에 적합합니다. 기능은 mimo-v2.6-pro와 같아 이미지, 비디오, 오디오, 텍스트의 전 모달리티 이해, 1M 컨텍스트, 최대 128K 출력, 심층 사고, 함수 호출, 구조화된 출력을 지원합니다. 가격은 mimo-v2.6-pro의 10배이며, Xiaomi가 이 모드의 용량을 별도로 배정하므로 요청이 급증하면 속도 제한이 걸릴 수 있습니다.
MiniMax-H3MiniMax$0.080초당MiniMax H3(Hailuo 3.0) — 네이티브 스테레오 오디오를 한 번에 함께 생성하는 차세대 오픈 범용 멀티모달 영상 모델. 768P 또는 2K, 4~15초(정수만 허용), 24 fps로 출력합니다. 텍스트-비디오, 첫 프레임과 마지막 프레임 중 하나 또는 둘 다를 사용하는 이미지-비디오, 그리고 이미지·비디오·오디오를 소재로 하는 참조 기반 생성을 지원하며 캐릭터, 모션, 카메라, 스타일, 목소리, 편집 리듬을 지정할 수 있습니다. 이미지-비디오와 참조 기반 생성은 한 요청에서 함께 쓸 수 없습니다. 입력은 H.264/H.265 영상, JPG, JPEG, PNG, WEBP, HEIC, HEIF 이미지, WAV 또는 MP3 오디오를 받으며 프롬프트는 최대 7,000자입니다. 768P는 초당 $0.08, 2K는 초당 $0.13.
MiniMax-Hailuo-02MiniMax$0.280요청당MiniMax Hailuo 02 — 텍스트-비디오와 이미지-비디오를 모두 지원하는 저비용 영상 생성 모델로, 24 fps에서 512p와 768p는 6초 또는 10초 클립, 1080p는 6초를 제공합니다. 512p 등급은 Hailuo 라인의 진입점입니다.
MiniMax-Hailuo-2.3MiniMax$0.280요청당MiniMax Hailuo 2.3 — 공급사가 지시 준수 능력을 앞세우는 텍스트-비디오 및 이미지-비디오 모델. 24 fps로 출력하며 768p는 6초 또는 10초 클립, 1080p는 6초를 지원합니다. 768p 6초 = $0.28.
MiniMax-Hailuo-2.3-FastMiniMax$0.190요청당MiniMax Hailuo 2.3 Fast — Hailuo 2.3에서 속도와 비용을 우선한 등급으로, 이미지-비디오와 물리적 움직임의 사실감에 초점을 맞췄습니다. 24 fps로 출력하며 768p는 6초 또는 10초 클립, 1080p는 6초를 지원합니다. 768p 6초 = $0.19.
MiniMax-M2MiniMax$0.3000$1.20001M tokens당MiniMax M2 — MiniMax가 효율적인 코딩과 에이전트 워크플로를 위해 처음 선보인 세대로, 204,800 토큰 컨텍스트 창을 갖췄습니다. 공급사가 아직 제공하는 등급 가운데 가장 오래되었으며, 레거시 등급 중 유일하게 highspeed 변형이 없습니다. 텍스트 전용이며, API는 텍스트와 도구 호출 콘텐츠 블록만 받고 이미지나 비디오는 받지 않습니다. 공급사가 레거시로 지정한 모델이지만 MiniMax는 여전히 정상적으로 제공한다고 밝히고 있습니다. 고객은 모델 이름으로 세대를 고정해 사용하므로 버전 호환성을 위해 카탈로그에 유지합니다. 오픈 웨이트가 Hugging Face에 공개되어 있습니다.
MiniMax-M2.1MiniMax$0.3000$1.20001M tokens당MiniMax M2.1 — 다국어 프로그래밍을 위해 만들어진 텍스트 모델로, 204,800 토큰 컨텍스트 창을 갖추고 초당 약 60 토큰으로 출력합니다. 텍스트 전용이며, API는 텍스트와 도구 호출 콘텐츠 블록만 받고 이미지나 비디오는 받지 않습니다. 공급사가 레거시로 지정한 모델이지만 MiniMax는 여전히 정상적으로 제공한다고 밝히고 있습니다. 고객은 모델 이름으로 세대를 고정해 사용하므로 버전 호환성을 위해 카탈로그에 유지합니다. 오픈 웨이트가 Hugging Face에 공개되어 있습니다.
MiniMax-M2.5MiniMax$0.3000$1.2000$0.1950$0.78001M tokens당MiniMax M2.5 — 공급사가 복잡한 작업을 위해 낮은 가격에 최상위 성능을 내세우는 텍스트 모델로, 204,800 토큰 컨텍스트 창을 갖추고 초당 약 60 토큰으로 출력합니다. 텍스트 전용이며, API는 텍스트와 도구 호출 콘텐츠 블록만 받고 이미지나 비디오는 받지 않습니다. 공급사가 레거시로 지정한 모델이지만 MiniMax는 여전히 정상적으로 제공한다고 밝히고 있습니다. 고객은 모델 이름으로 세대를 고정해 사용하므로 버전 호환성을 위해 카탈로그에 유지합니다. 오픈 웨이트가 Hugging Face에 공개되어 있습니다.
MiniMax-M2.7MiniMax$0.3000$1.2000$0.1950$0.78001M tokens당MiniMax M2.7 — 채팅, 코딩, 사무 업무, 에이전트 작업을 위한 텍스트 모델로, 204,800 토큰 컨텍스트 창을 갖추고 초당 약 60 토큰으로 출력합니다. 텍스트 전용이며, API는 텍스트와 도구 호출 콘텐츠 블록만 받고 이미지나 비디오는 받지 않습니다. 도구 호출을 지원하며 사고는 항상 켜져 있어 끌 수 없습니다.
MiniMax-M2.7-highspeedMiniMax$0.6000$2.40001M tokens당MiniMax M2.7 Highspeed — 동일한 M2.7 모델을 초당 약 100 토큰으로 제공해 저지연 코딩과 에이전트 워크플로를 겨냥한 등급으로, 204,800 토큰 컨텍스트 창을 갖췄습니다. 텍스트 전용이며, API는 텍스트와 도구 호출 콘텐츠 블록만 받고 이미지나 비디오는 받지 않습니다. 도구 호출을 지원하며 사고는 항상 켜져 있어 끌 수 없습니다.
MiniMax-M3MiniMax$0.3000$1.2000$0.1950$0.78001M tokens당MiniMax M3 — 에이전트형 추론, 도구 사용, 구조화된 작업 수행을 위한 최전선 멀티모달 코딩 모델로, 1,000,000 토큰 컨텍스트 창을 갖췄습니다. 텍스트, 최대 10 MB 이미지, 인라인으로 최대 50 MB(Files API를 거치면 512 MB) 비디오를 입력받아 텍스트를 반환합니다. 도구 호출을 지원하며 사고는 항상 켜져 있지 않고 선택 사항입니다.
minimax-music-v3.0MiniMax$0.1481요청당MiniMax Music 3.0 — 음악적 프롬프트와 선택 사항인 가사로 곡 전체를 동기 방식으로 생성하는 모델. 인스트루멘털 모드, 가사 최적화, URL 또는 hex 형식의 오디오 출력을 지원합니다. 프롬프트는 최대 2,000자, 가사는 최대 3,500자까지 입력할 수 있습니다.
muse-spark-1.2-contributorMeta$0.1000$0.2000$0.0650$0.13001M tokens당Meta는 Contributor 등급 약관에 따라 이 모델로 전송된 프롬프트와 출력을 향후 Meta 모델 학습에 사용할 수 있으므로, 민감하거나 기밀인 데이터는 보내지 마세요. Meta Muse Spark 1.2(Contributor 등급)은 Muse Spark의 이전 버전입니다. 추론 모델로, 답변하기 전에 항상 추론하며 추론은 끌 수 없습니다. reasoning_effort는 minimal, low, medium, high, xhigh 중에서 설정할 수 있습니다. 이 등급에서는 none과 max를 지원하지 않으며, reasoning_effort를 생략하면 모델이 추론 수준을 정합니다. 추론 토큰은 출력으로 과금되고, 캐시된 입력은 캐시 입력 요금으로 과금됩니다. 웹 검색은 제공되지 않으며, 웹 검색이나 function 이외 유형의 도구를 포함한 요청은 거부됩니다. 요청은 /v1/chat/completions로 보내세요.
muse-spark-1.3-contributorMeta$0.1000$0.2000$0.0650$0.13001M tokens당Meta는 Contributor 등급 약관에 따라 이 모델로 전송된 프롬프트와 출력을 향후 Meta 모델 학습에 사용할 수 있으므로, 민감하거나 기밀인 데이터는 보내지 마세요. Meta Muse Spark 1.3(Contributor 등급)은 Muse Spark의 최신 버전으로, 에이전트 워크플로와 코딩에 맞춰 조정되었습니다. 추론 모델로, 답변하기 전에 항상 추론하며 추론은 끌 수 없습니다. reasoning_effort는 minimal, low, medium, high, xhigh 중에서 설정할 수 있습니다. 이 등급에서는 none과 max를 지원하지 않으며, reasoning_effort를 생략하면 모델이 추론 수준을 정합니다. 추론 토큰은 출력으로 과금되고, 캐시된 입력은 캐시 입력 요금으로 과금됩니다. 웹 검색은 제공되지 않으며, 웹 검색이나 function 이외 유형의 도구를 포함한 요청은 거부됩니다. 요청은 /v1/chat/completions로 보내세요.
qwen-audio-3.0-asr-flashAlibaba$0.1260오디오 1시간당Alibaba Qwen-Audio-3.0-ASR-Flash — Qwen-Audio 3.0을 기반으로 한 비실시간 음성 인식으로, 30개 언어와 중국어 7대 방언군(관화·오·상·감·객가·민·월) 및 20종 이상의 지역 억양을 지원합니다. 문장부호 예측과 텍스트 정규화가 숫자·날짜·금액을 표준 형식으로 바꾸고, 핫워드와 프롬프트 문맥이 전문 어휘의 정확도를 높입니다. 요청당 최대 5분 또는 2 GB의 오디오를 받습니다.
qwen-audio-3.0-realtime-flashAlibaba$0.2900$0.88001M tokens당Alibaba Qwen-Audio-3.0-Realtime-Flash — WebSocket 세션 위에서 전이중 음성 대화를 수행하며, 공급사가 Artificial Analysis의 Speech-to-Speech 부문 종합 1위라고 밝힌 계열의 고속 티어로 엔드투엔드 응답 지연을 최소화하도록 조정됐습니다. GET /v1/realtime으로 연결합니다. 오디오 입력과 오디오 출력은 각각 별도 단가로, 텍스트보다 훨씬 높게 과금됩니다.
qwen-audio-3.0-realtime-plusAlibaba$1.0000$8.00001M tokens당Alibaba Qwen-Audio-3.0-Realtime-Plus — WebSocket 세션 위에서 전이중 음성 대화를 수행하며, 공급사는 Artificial Analysis의 Speech-to-Speech 부문 종합 1위라고 밝힙니다. 표준 티어는 답변 품질에 무게를 두어 음성 추론 수준을 유지하면서, 병렬 추론과 엔드투엔드 스트리밍으로 응답 지연을 낮게 유지합니다. GET /v1/realtime으로 연결합니다. 오디오 입력과 오디오 출력은 각각 별도 단가로, 텍스트보다 훨씬 높게 과금됩니다.
qwen-audio-3.0-tts-flashAlibaba$0.18001만 자당Alibaba Qwen-Audio-3.0-TTS-Flash — Qwen-Audio 3.0 기반으로 실시간 상호작용에 맞춰 조정된 음성 합성 모델로, 이전 세대보다 많은 소수 언어와 중국어 방언을 지원합니다. 자유 서술 지시 따르기와 세밀한 태그 제어로 감정·어조·캐릭터·속도·음량을 지정할 수 있고, 잡음과 잔향이 있는 조건에서도 더 견고합니다. Flash 티어는 저지연 합성에 최적화되어 음성 비서, 실시간 대화, 고객 응대에 적합합니다. 과금은 문자 단위(1 토큰 = 1 문자)입니다. 요청/응답과 실시간 WebSocket 세션 두 방식 모두로 쓸 수 있습니다.
qwen-audio-3.0-tts-plusAlibaba$0.25001만 자당Alibaba Qwen-Audio-3.0-TTS-Plus — Qwen-Audio 3.0 기반의 고품질 음성 합성 모델로, 이전 세대보다 많은 소수 언어와 중국어 방언을 지원하며 방언 발음의 자연스러움이 크게 좋아졌습니다. 자유 서술 지시 따르기와 세밀한 태그 제어로 감정·어조·캐릭터·속도·음량·스타일을 지정할 수 있고, 잡음과 잔향이 있는 조건에서도 더 견고합니다. Plus 티어는 음질과 표현력에 무게를 두어 콘텐츠 제작, 오디오북, 더빙, 브랜드 보이스에 적합합니다. 과금은 문자 단위(1 토큰 = 1 문자)입니다. 요청/응답과 실시간 WebSocket 세션 두 방식 모두로 쓸 수 있습니다.
qwen-flash-characterAlibaba$0.0500$0.40001M tokens당Alibaba Qwen-Flash-Character — Qwen의 다국어 롤플레이 모델(동적 버전이며 업데이트는 공급사가 사전에 공지합니다)로, 페르소나에 충실한 캐릭터 대화, 즉 페르소나 제약을 따르는 지시 준수, 화제 전개, 경청, 공감에 맞게 튜닝되었습니다. 8,192 토큰 컨텍스트 창, 텍스트 입력과 텍스트 출력. 사고 모드, 도구 호출, 내장 도구, 구조화된 출력은 지원하지 않습니다. 공급사의 세션 캐시는 공급사 측에서 자동으로 적용됩니다.
qwen-image-3.0Alibaba$0.030요청당Alibaba Qwen-Image-3.0 — Qwen 이미지 계열의 표준 티어로, 텍스트-이미지 생성과 이미지 편집을 아우르며 10px까지의 작은 글자, 12개 언어, 20종 이상의 서체를 정확히 렌더링합니다. 최대 4,500 토큰의 프롬프트를 받아 요청당 최대 6장, 최대 2048x2048로 생성합니다.
qwen-image-3.0-proAlibaba$0.040요청당Alibaba Qwen-Image-3.0-Pro — Qwen 이미지 계열의 프로페셔널 티어로, 신문·스토리보드·메뉴판·시험지처럼 정보 밀도가 높은 지면을 한 번에 생성하도록 만들어졌습니다. 최대 4,500 토큰의 프롬프트를 받고, 10px 글자와 12개 언어, 20종 이상의 서체를 렌더링하며, 요청당 최대 6장, 최대 2048x2048로 생성합니다. 텍스트-이미지 생성과 이미지 편집을 지원합니다.
qwen-mt-image-2.0Alibaba$0.0006요청당Alibaba Qwen-MT-Image 2.0 — 이미지 번역 모델로, 레이아웃과 글꼴, 주변 아트워크를 유지한 채 이미지 속 텍스트를 다른 언어로 바꿔 쓰며 55개 언어 간 어느 방향으로든 번역할 수 있습니다. OpenAI images/edits 엔드포인트로 호출하며, image 필드에 공개 http(s) 이미지 URL을 넣고 target_lang(필수, ISO 코드 또는 영어 이름)과 source_lang(선택, 기본값 auto)을 전달합니다. prompt는 엔드포인트 형식상 필수이지만 무시됩니다. 선택 사항인 ext 객체로 공급사의 domainHint, sensitives, terminologies, config.imageSegment를 그대로 전달할 수 있습니다. 입력과 같은 크기의 JPG URL 하나를 반환하며 24시간 동안 유효합니다. 입력은 각 변 15~8192 px, 화면비 1:10~10:1, 최대 100 MB이며 업로드와 데이터 URL은 받지 않습니다. 공급사는 이 모델을 분당 1회 요청으로 제한하며, 번역할 텍스트를 찾지 못해도 이미지 요금을 부과합니다(원본이 반환됩니다). 단일 Alibaba 공식 채널로 제공됩니다.
qwen3-asr-flashAlibaba$0.1260오디오 1시간당Alibaba Qwen3-ASR-Flash — Qwen3 파운데이션 모델 위에 구축된 음성 인식 모델로, 발화 언어를 자동으로 판별해 11개 언어를 전사합니다. Qwen3-ASR 라인은 표준 중국어와 함께 쓰촨어, 민난어, 우어, 광둥어, 그리고 여러 영어 억양을 문서화하고 있습니다. aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma, wmv를 지원하며 요청당 최대 5분, 10 MB입니다. pcm 입력은 16 kHz여야 하고 다른 형식은 인식 전에 16 kHz로 리샘플링됩니다.
qwen3-tts-flashAlibaba$0.11001만 자당Alibaba Qwen3-TTS-Flash — 표현력 있는 내장 음성 17종을 갖춘 저지연 음성 합성 모델. 중국어, 영어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 일본어, 한국어, 프랑스어, 러시아어를 지원하며, 언어가 섞인 텍스트를 위한 자동 모드와 방언 출력도 제공합니다. 요청당 최대 512 토큰의 텍스트를 받으며 스트리밍과 비스트리밍 합성을 모두 지원합니다.
qwen3.5-livetranslate-flash-realtimeAlibaba$0.5500$20.00001M tokens당Alibaba Qwen3.5-LiveTranslate-Flash-Realtime — WebSocket 세션 위에서 오디오·비디오를 동시통역하는 모델로, Qwen3.5-Omni를 기반으로 교차 언어·교차 모달 정렬과 시각 정보 보강을 결합했습니다. 60개 언어를 알아듣고 29개 언어로 말합니다. GET /v1/realtime으로 연결합니다. 가격 면 구성이 다른 실시간 모델과 달라 **텍스트 입력 단가가 없습니다** — 입력은 오디오 또는 이미지로, 출력은 텍스트 또는 오디오로 과금됩니다.
qwen3.5-ocrAlibaba$0.1000$0.35001M tokens당Alibaba Qwen3.5-OCR — Qwen3.5 계열의 OCR 모델로, 문서 파싱과 텍스트 위치 파악, 핵심 정보 추출을 위해 만들어졌으며 공급사는 실제 업무의 신분증·면허증류 문서에서 뚜렷한 향상을 제시합니다. 텍스트와 이미지를 입력받아 텍스트를 반환합니다.
qwen3.5-omni-flashAlibaba$0.4000$2.20001M tokens당Alibaba Qwen3.5-Omni-Flash — Qwen3.5 옴니모달 계열의 고속 티어로, 텍스트·이미지·오디오·오디오 비디오를 아울러 이해하고 대화합니다. 한 대화에서 10시간이 넘는 오디오와 720P(1 FPS) 기준 400초가 넘는 오디오 비디오를 처리하며, 오디오 입력은 60개 이상 언어, 음성 출력은 30개 이상 언어를 지원합니다. 오디오 입력과 오디오가 포함된 출력은 각각 별도 단가로, 텍스트보다 높게 과금됩니다.
qwen3.5-omni-flash-realtimeAlibaba$0.5500$3.30001M tokens당Alibaba Qwen3.5-Omni-Flash-Realtime — Qwen3.5 옴니모달 계열의 고속 실시간 티어로, WebSocket 세션을 유지한 채 전이중 음성 대화를 합니다. 텍스트·이미지·오디오·오디오 비디오를 이해하며 오디오 입력은 60개 이상 언어, 음성 출력은 30개 이상 언어를 지원하고, 음색 제어와 웹 검색, 복잡한 함수 호출, 의미 기반 끼어들기를 지원합니다. GET /v1/realtime으로 연결합니다. 오디오 입력과 오디오가 포함된 출력은 각각 별도 단가로, 텍스트보다 훨씬 높게 과금됩니다.
qwen3.5-omni-plusAlibaba$1.4000$8.30001M tokens당Alibaba Qwen3.5-Omni-Plus — Qwen3.5 옴니모달 계열의 고성능 티어로, 텍스트·이미지·오디오·오디오 비디오를 아울러 이해하고 대화합니다. 한 대화에서 10시간이 넘는 오디오와 720P(1 FPS) 기준 400초가 넘는 오디오 비디오를 처리하며, 오디오 입력은 60개 이상 언어, 음성 출력은 30개 이상 언어를 지원합니다. 65,536 토큰 컨텍스트 창. 오디오 입력과 오디오가 포함된 출력은 각각 별도 단가로, 텍스트보다 높게 과금됩니다.
qwen3.5-omni-plus-realtimeAlibaba$2.1000$12.40001M tokens당Alibaba Qwen3.5-Omni-Plus-Realtime — Qwen3.5 옴니모달 계열의 실시간 티어로, WebSocket 세션을 유지한 채 전이중 음성 대화를 합니다. 텍스트·이미지·오디오·오디오 비디오를 이해하며 오디오 입력은 60개 이상 언어, 음성 출력은 30개 이상 언어를 지원하고, 음색 제어와 웹 검색, 복잡한 함수 호출, 의미 기반 끼어들기를 지원합니다. GET /v1/realtime으로 연결합니다. 오디오 입력과 오디오가 포함된 출력은 각각 별도 단가로, 텍스트보다 훨씬 높게 과금됩니다.
qwen3.6-27bAlibaba$0.6000$3.60001M tokens당Alibaba Qwen3.6-27B — Qwen3.6 계열의 270억 파라미터 네이티브 비전-언어 Dense 모델이며 오픈 웨이트입니다. 공급사는 에이전트형 코딩, STEM과 추론, 그리고 공간 지능·객체 위치 파악과 검출에서 3.5-27B보다 앞선다고 밝힙니다. 262,144 토큰 컨텍스트 창. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다.
qwen3.6-35b-a3bAlibaba$0.3750$2.25001M tokens당Alibaba Qwen3.6-35B-A3B — 350억 파라미터 네이티브 비전-언어 MoE 모델로 활성 파라미터는 약 30억이며 오픈 웨이트입니다. 선형 어텐션과 희소 Mixture of Experts를 결합해 추론 효율을 높였습니다. 262,144 토큰 컨텍스트 창, 최대 65,536 토큰 출력, 요청당 최대 이미지 256장 또는 비디오 64개. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다. 함수 호출, 내장 도구, 구조화 출력을 지원합니다.
qwen3.6-flashAlibaba$0.2500$1.50001M tokens당Alibaba Qwen3.6-Flash — 공급사가 에이전트형 코딩과 공간 지능을 강점으로 내세우는 빠른 비전-언어 모델로, 객체 위치 파악과 검출에서 뚜렷한 향상을 보입니다. 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 65,536 토큰 출력, 131,072 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다. 함수 호출과 컨텍스트 캐싱을 지원합니다.
qwen3.6-plusAlibaba$0.5000$3.0000$0.4250$2.55001M tokens당Alibaba Qwen3.6-Plus — 범용 추론과 도구 사용을 위한 균형형 모델로, 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 65,536 토큰 출력, 81,920 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다. 함수 호출, 구조화된 출력, 웹 검색, 접두사 완성, 컨텍스트 캐싱을 지원합니다.
qwen3.7-flashAlibaba$0.0300$0.13001M tokens당Alibaba Qwen3.7-Flash — Qwen3.7 네이티브 비전-언어 계열의 고속 티어로, 공급사는 멀티모달 에이전트 작업(검색 에이전트와 CI 에이전트)과 3.6-Flash보다 안정적인 엔드투엔드 작업 수행을 강점으로 내세웁니다. 1,000,000 토큰 컨텍스트 창, 최대 65,536 토큰 출력, 요청당 최대 이미지 256장 또는 비디오 64개. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다. 사고 모드, 함수 호출, 내장 도구, 구조화 출력을 지원합니다. 컨텍스트 길이에 따른 3단계 요금제라, 긴 컨텍스트 요청은 토큰당 단가가 더 높습니다.
qwen3.7-maxAlibaba$2.5000$7.50001M tokens당Alibaba Qwen3.7-Max — 프로그래밍, 사무 및 생산성 업무, 장기 자율 수행을 겨냥한 비공개 소스 플래그십으로, 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 131,072 토큰 출력, 262,144 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트 입력, 텍스트 출력. 함수 호출, 구조화된 출력, 컨텍스트 캐싱을 지원합니다.
qwen3.7-plusAlibaba$0.4000$1.6000$0.3000$1.20001M tokens당Alibaba Qwen3.7-Plus — 실제 장면을 인식하고, 화면을 읽어 GUI를 조작하며, 시각적 참조로부터 코드를 생성하고, 모바일 앱 안에서 종단 간 내비게이션을 수행하는 멀티모달 하이브리드 에이전트 모델. 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 131,072 토큰 출력, 262,144 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며 함수 호출, 구조화된 출력, 컨텍스트 캐싱을 지원합니다.
qwen3.8-2.4t-a95bAlibaba$2.0000$6.00001M tokens당Alibaba Qwen3.8-2.4T-A95B — Qwen3.8 플래그십의 오픈 웨이트 릴리스로, 총 파라미터 2.4조에 스텝당 약 950억이 활성화되는 희소 MoE 모델이며 하이브리드 어텐션 설계를 씁니다. 1,000,000 토큰 컨텍스트 창. 텍스트를 입력받아 텍스트를 반환합니다. 사고 모드와 비사고 모드는 같은 단가로 과금되며 출력 가격에 사고 사슬이 포함됩니다.
qwen3.8-27bAlibaba$0.5000$3.00001M tokens당Alibaba Qwen3.8-27B — Qwen3.8 계열의 270억 파라미터 네이티브 비전-언어 Dense 모델이며 오픈 웨이트입니다. 공급사는 텍스트와 시각 양쪽 모달리티의 코딩·사무 작업에서 3.6-27B보다 앞선다고 밝힙니다. 1,000,000 토큰 컨텍스트 창. 텍스트와 이미지를 입력받아 텍스트를 반환합니다. 사고 모드와 비사고 모드는 같은 단가로 과금되며 출력 가격에 사고 사슬이 포함됩니다.
qwen3.8-flashAlibaba$0.1500$0.4700$0.1125$0.35251M tokens당Alibaba Qwen3.8-Flash — Qwen3.8 계열의 고속 티어로, 공급사가 높은 처리량에서의 코딩 지원, 에이전트 협업, 이미지·문서 이해에 맞춰 내세우는 네이티브 멀티모달 모델입니다. 1,000,000 토큰 컨텍스트 창. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다. 사고 모드, 함수 호출, 내장 도구, 구조화 출력을 지원합니다. OpenAI와 Anthropic Messages 프로토콜을 모두 구사합니다.
qwen3.8-maxAlibaba$2.0000$6.0000$1.9000$5.70001M tokens당Alibaba Qwen3.8-Max — 2.4조 파라미터 MoE 플래그십이자 Qwen 제품군에서 가장 뛰어난 모델로, 공급사는 코딩과 사무 생산성에서 큰 향상을 내세웁니다. 1,000,000 토큰 컨텍스트 창(최대 입력 991,808, 사고 모드에서는 983,616), 최대 131,072 토큰 출력, 262,144 토큰의 사고 사슬 예산을 갖췄습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며 함수 호출, 구조화된 출력, 컨텍스트 캐싱을 지원합니다.
qwen3.8-max-0902Alibaba$2.0000$6.00001M tokens당Alibaba Qwen3.8-Max-0902 — Qwen3.8-Max의 2026-09-02 스냅숏(공급사 별칭 qwen3.8-max-2026-09-02)으로, 2.4조 파라미터 MoE 플래그십을 연동에서 이 빌드 그대로 고정할 수 있도록 동결한 것입니다. 공급사는 복잡한 엔지니어링 프로젝트를 위한 더 깊은 코딩 능력과 장기 자율 개발을 내세웁니다. 1,000,000 토큰 컨텍스트 창, 최대 131,072 토큰 출력. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하며 사고 모드, 도구 호출, 구조화된 출력을 지원합니다. 동적 이름인 qwen3.8-max는 공급사가 새 빌드를 출시할 때마다 그 빌드로 옮겨가므로, 이 빌드에 머물려면 이 이름을 고정하세요. 가격은 qwen3.8-max와 동일합니다.
speech-2.8-hdMiniMax$1.00001만 자당MiniMax speech-2.8-hd — 2.8 음성 라인의 고음질 등급으로, 사운드 태그를 활용한 초현실적인 표현을 지향하며 40개 언어와 7가지 감정을 지원합니다. 음높이, 발화 속도, 음량, 샘플레이트, 비트레이트, 출력 형식은 요청마다 설정할 수 있고, 장문 합성은 비동기 방식으로 최대 100만 자, 스트리밍 인터페이스로 최대 10,000자를 받습니다.
speech-2.8-turboMiniMax$0.60001만 자당MiniMax speech-2.8-turbo — 2.8 음성 라인의 저지연 등급으로, HD 모델의 초현실적인 표현을 내주는 대신 자연스러운 흐름을 유지하면서 더 빠르게 합성합니다. 지원하는 40개 언어와 7가지 감정은 HD와 같으며 음높이, 발화 속도, 음량, 샘플레이트, 비트레이트, 출력 형식을 설정할 수 있습니다. 비동기 방식으로는 최대 100만 자, 스트리밍 인터페이스로는 최대 10,000자를 받습니다.
step-3.5-flashStepFun$0.1000$0.30001M tokens당StepFun step-3.5-flash — 256K 컨텍스트의 텍스트 전용 추론 모델로, 추론 품질과 빠르고 안정적인 실행이 동시에 필요한 논리, 수학, 소프트웨어 엔지니어링, 심층 리서치 작업을 겨냥합니다. 추론 강도는 reasoning_effort(low / medium / high)로 요청마다 선택할 수 있습니다. 도구 호출, JSON Schema 구조화된 출력, 스트리밍, 프롬프트 캐싱을 지원합니다. 이미지나 비디오 입력이 필요하면 step-3.7-flash를 사용하세요.
step-3.5-flash-2603StepFun$0.1000$0.30001M tokens당StepFun step-3.5-flash-2603 — 토큰 효율과 저추론 운영 모드에 최적화된 step-3.5-flash의 에이전트 튜닝 256K 스냅숏. reasoning_effort 파라미터는 low와 high만 받으며 기본 모델이 지원하는 세 단계와 다르므로 medium을 보내는 코드는 수정해야 합니다. 텍스트 전용이며 도구 호출, JSON Schema 구조화된 출력, 스트리밍, 프롬프트 캐싱을 지원합니다.
step-3.7-flashStepFun$0.2000$1.15001M tokens당StepFun step-3.7-flash — 총 198B, 활성 11B 파라미터의 스파스 MoE 모델로, 네이티브 256K 컨텍스트와 텍스트에 더해 이미지·비디오의 네이티브 이해를 갖췄습니다. 추론 강도는 reasoning_effort(low / medium / high)로 요청마다 선택할 수 있으며, 안정적인 다단계 도구 호출, JSON Schema 구조화된 출력, 스트리밍, 프롬프트 캐싱을 지원합니다. 에이전트 및 코딩 워크로드에 맞게 튜닝되었습니다. /v1/responses에서는 턴마다 대화 전체를 input 배열에 담아 보내야 합니다. 업스트림에 대화 상태가 보관되지 않으므로, previous_response_id 또는 conversation을 포함한 요청은 거부됩니다.
step-5-previewStepFun$1.0000$2.70001M tokens당StepFun step-5-preview — 코딩과 전문 지식 업무를 위한 StepFun의 새 플래그십 모델로, 프리뷰로 공개되었습니다. 1M 토큰 컨텍스트와 최대 64K 토큰 출력을 제공하며, 텍스트에 더해 이미지·비디오를 네이티브로 이해합니다. 추론은 항상 켜져 있습니다. /v1/chat/completions에서는 reasoning_content로, /v1/messages에서는 thinking 블록으로 반환되며, 출력으로 과금되고 max_tokens를 소모합니다. 따라서 수백 토큰 수준의 한도는 추론만으로 모두 소진되어 텍스트가 반환되지 않을 수 있으니 한도를 넉넉히 잡으세요. 추론 강도는 reasoning_effort(low / medium / high)로 요청마다 선택할 수 있습니다. 다단계 도구 호출, JSON Mode 및 JSON Schema 구조화된 출력, 스트리밍, 프롬프트 캐싱을 지원합니다. 긴 문서 분석, 소프트웨어 엔지니어링, 다단계 에이전트 작업을 위해 만들어졌습니다. /v1/responses에서는 턴마다 대화 전체를 input 배열에 담아 보내야 합니다. 업스트림에 대화 상태가 보관되지 않으므로, previous_response_id 또는 conversation을 포함한 요청은 거부됩니다.
step-audio-2StepFun$1.4815$10.37041M tokens당StepFun step-audio-2 — 전사 결과가 아니라 오디오를 직접 입력받는 종단 간 음성 모델로, 어조와 말하기 방식이 모델의 이해 단계까지 그대로 전달됩니다. 토큰 단위로 과금되며 입력 요금은 StepAudio 2.5 계열과 같고 출력 요금은 더 높습니다. StepFun은 이 모델의 별도 기능 문서를 제공하지 않으므로 현재 파라미터는 플랫폼 오디오 문서를 참고하세요.
step-tts-2StepFun$0.41481만 자당StepFun step-tts-2 — 정확한 억양 재현을 위해 만들어진 NTP 기반 종단 간 음성 합성 모델. 중국어, 영어, 중국어-영어 혼용, 일본어에 더해 광둥어와 쓰촨어를 구사합니다. 감정과 어조는 자연어 레이블로 지시하며, 제로샷 음성 복제에는 약 10초 분량의 참조 오디오가 필요하고 감정과 스타일 제어는 추가 비용 없이 복제된 목소리에도 그대로 적용됩니다. 출력 형식은 wav, mp3, flac, opus, pcm입니다.
stepaudio-2-asr-proStepFun$0.2963오디오 1시간당StepFun StepAudio 2 ASR Pro — 32B 파라미터 음성 인식 모델로, StepFun ASR 계열에서 정확도를 우선하는 선택지입니다. 속도와 비용을 우선한다면 stepaudio-2.5-asr를 사용하세요. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
stepaudio-2.5-asrStepFun$0.0220오디오 1시간당StepFun StepAudio 2.5 ASR — Multi-Token Prediction을 기반으로 한 4B 파라미터 음성 인식 모델로, 5분 분량의 오디오를 약 1초에 전사합니다(RTF 약 0.0053). 중국어와 영어에 최적화되어 있습니다. 역텍스트 정규화, 화자 식별, 통화 및 회의 녹음을 위한 이중 채널 분리를 제공합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
stepaudio-2.5-asr-streamStepFun$0.1800오디오 1시간당StepFun StepAudio 2.5 ASR Stream — StepAudio 2.5 ASR(Multi-Token Prediction을 기반으로 한 4B 파라미터 음성 인식 모델로, 중국어와 영어에 최적화됨)의 스트리밍 인식 버전이자 StepFun이 권장하는 스트리밍 모델입니다. 이 게이트웨이에서는 다른 전사 모델과 같은 방식으로 호출합니다. 완성된 녹음 파일을 /v1/audio/transcriptions에 업로드하면 인식이 끝난 뒤 전체 전사문이 한 번의 응답으로 반환됩니다. 부분 결과는 스트리밍으로 반환되지 않으며, 오디오 1분당 요금은 stepaudio-2.5-asr보다 높습니다. 역텍스트 정규화가 적용됩니다. 16비트 PCM wav와 ogg 업로드만 지원하며(mp3는 받지 않음) 전사 출력은 과금되지 않습니다.
stepaudio-2.5-chatStepFun$1.5000$3.50001M tokens당StepFun StepAudio 2.5 Chat — 종단 간 음성 이해 모델로, 오디오나 텍스트를 입력받아 텍스트를 반환하며 망설임이나 웃음 같은 준언어적 신호를 전사본이 아닌 파형 자체에서 읽어냅니다. 캐릭터, 말버릇, 감정 폭에 이르는 폭넓은 페르소나 커스터마이징을 지원합니다. 오디오는 chat completions 엔드포인트의 input_audio 콘텐츠 파트로 전달합니다. 음성으로 답하게 하려면 TTS 모델을 사용하세요.
stepaudio-2.5-realtimeStepFun$1.5000$10.00001M tokens당StepFun StepAudio 2.5 Realtime — GET /v1/realtime의 WebSocket 세션 위에서 동작하는 엔드투엔드 음성-음성 모델로, 오디오나 텍스트를 스트리밍으로 입력받아 텍스트 전사가 함께 붙은 오디오를 스트리밍으로 출력하며, 서버 측 음성 활동 감지와 끼어들기를 지원합니다. 오디오는 PCM16, 24 kHz, 모노이며, 공급사가 지원 언어로 명시한 것은 영어입니다. 보이스는 session.update에서 명시적으로 지정하세요. StepFun이 공개한 보이스만 허용됩니다.
stepaudio-2.5-ttsStepFun$0.85001만 자당StepFun StepAudio 2.5 TTS — 발화 방식을 후처리로 다루지 않고 이해를 생성 파이프라인 전체로 이어가는 맥락 인식 음성 합성 모델. 목소리와 감정, 호흡은 요청 전체에 적용되는 전역 컨텍스트와 개별 구절에 적용되는 인라인 컨텍스트라는 두 층위에서 자연어로 지시합니다. 제로샷 음성 복제에는 약 3초 분량의 참조 오디오가 필요하며 맥락 제어 기능 전체를 그대로 물려받습니다. 요청당 최대 1000자를 처리하며 출력 형식은 wav, mp3, flac, opus입니다.
stepaudio-3-asr-maxStepFun$0.4000오디오 1시간당StepFun StepAudio 3 ASR Max — StepFun의 최대 규모 음성 인식 모델입니다. 대규모 언어 모델을 기반으로 하여 문맥과 도메인 지식을 활용해 인식하므로, 고유명사·약품명·전문 용어·동음이의어, 중영 혼용 발화·방언·장시간 오디오, 그리고 속삭임·매우 빠른 발화·배경 음악이 깔린 음성(노래로 부른 가사 포함)에 더 강합니다. 오디오 파일(WAV, MP3 또는 OGG)를 POST /v1/audio/transcriptions로 보내며, 오디오 길이에 따라 과금됩니다.
stepaudio-3-chat-previewStepFun$0.00001M tokens당StepFun StepAudio 3 Chat(프리뷰) — POST /v1/chat/completions에서 쓰는 음성 이해 대화 모델입니다. 턴마다 음성을 input_audio 콘텐츠 파트로 보내거나 텍스트를 보내면 텍스트가 반환되며, 도구 호출을 지원합니다. StepFun의 프리뷰 기간 동안 무료입니다. 무료 기간이 끝나면 StepFun은 프리뷰 모델명 제공을 종료하고 유료 버전을 출시하므로, 그 시점에 이 모델 ID를 더 이상 쓸 수 없게 된다는 점을 계획에 반영하세요.
stepaudio-3-gen-previewStepFun$0.000요청당StepFun StepAudio 3 Audio Generation(프리뷰) — StepAudio 3 시리즈의 대본 기반 오디오 생성 모델로, POST /v1/audio/generate를 사용합니다. 이름과 자연어로 쓴 목소리 설명으로 역할을 정의하고, 대본을 한 줄씩 쓰고(대괄호로 감싼 줄은 효과음이나 배경 음악이 됩니다), 전체 지시를 더하면 완성된 오디오가 바이트로 돌아옵니다(기본값 mp3). 목소리는 역할 설명에서 만들어지며 미리 정해진 보이스 이름은 받지 않습니다. 요청 필드는 StepFun API 레퍼런스를 따릅니다. StepFun의 프리뷰 기간 동안 무료입니다. 무료 기간이 끝나면 StepFun은 프리뷰 모델명 제공을 종료하고 유료 버전을 출시하므로, 그 시점에 이 모델 ID를 더 이상 쓸 수 없게 된다는 점을 계획에 반영하세요.
stepaudio-3-music-previewStepFun$0.000요청당StepFun StepAudio 3 Music(프리뷰) — StepAudio 3 시리즈의 텍스트 기반 음악 생성 모델로, POST /v1/music/generations에서 minimax-music-v3.0과 같은 요청 형식을 사용합니다. prompt로 스타일을 설명하고 lyrics로 가사를 넣거나 is_instrumental을 설정하면 완성된 곡이 data.audio에 hex로 인코딩되어 돌아옵니다(기본값 mp3, audio_setting.format으로 wav, flac, opus, pcm 선택 가능). 호출은 동기 방식이고 한 곡을 만드는 데 보통 1분에서 몇 분이 걸리므로 클라이언트 타임아웃을 600초 이상으로 잡으세요. 커버 곡이나 업로드한 보컬에 반주를 붙이는 기능은 제공하지 않습니다. StepFun의 프리뷰 기간 동안 무료입니다. 무료 기간이 끝나면 StepFun은 프리뷰 모델명 제공을 종료하고 유료 버전을 출시하므로, 그 시점에 이 모델 ID를 더 이상 쓸 수 없게 된다는 점을 계획에 반영하세요.
stepaudio-3-realtime-previewStepFun$0.00001M tokens당StepFun StepAudio 3 Realtime(프리뷰) — GET /v1/realtime의 WebSocket 세션 위에서 동작하는 StepFun의 전이중 음성 모델로, 자연스러운 끼어들기와 말차례 주고받기, 말하는 도중의 적응형 추론, 대화 중 도구 호출을 지원합니다. StepFun의 프리뷰 기간 동안 무료입니다. 무료 기간이 끝나면 StepFun은 프리뷰 모델명 제공을 종료하고 유료 버전을 출시하므로, 이 모델 ID를 더 이상 쓸 수 없게 된다는 점을 계획에 반영하세요.
stepaudio-3-ttsStepFun$0.36001만 자당StepFun StepAudio 3 TTS — StepAudio 3 시리즈의 음성 합성 모델로, 사람 수준의 발화 표현을 목표로 설계되었습니다. 음색, 억양, 리듬, 호흡은 웃음, 망설임, 고쳐 말하기까지 포함해 자연스러운 구어를 따르고, 감정과 어조도 내용에 맞춰 달라집니다. POST /v1/audio/speech로 제공되며 입력 텍스트의 문자 단위로 과금됩니다.
vidu-video-q3Vidu$0.060초당Vidu Q3 — 피사체 일관성, 지능형 장면 전환, 오디오·영상 동기화 출력을 갖춘 참조 기반 영상 생성 모델. 참조 이미지 또는 이름을 붙인 피사체를 받아 540P, 720P, 1080P로 3~16초 영상을 생성합니다.
vidu-video-q3-proVidu$0.100초당Vidu Q3 Pro — 품질을 중시한 텍스트-비디오, 이미지-비디오, 첫·마지막 프레임 기반 생성을 지원하며 오디오·영상 동기화 출력을 제공합니다. 540P, 720P, 1080P로 1~16초 영상을 생성합니다. 참조 기반 영상 생성은 이 SKU에서 지원하지 않습니다.
vidu-video-q3-turboVidu$0.055초당Vidu Q3 Turbo — 텍스트, 이미지, 첫·마지막 프레임, 참조 기반 영상 생성을 지원하는 빠르고 비용 효율적인 Q3 등급으로, 오디오·영상 동기화 출력을 제공합니다. 540P~1080P에서 일반 모드는 1~16초, 참조 모드는 3~16초 영상을 생성합니다.
wan2.7-i2vAlibaba$0.100초당Alibaba Wan 2.7 Image-to-Video — 첫 프레임 기반 생성, 첫 프레임과 마지막 프레임 사이의 전환, 기존 클립의 이어 붙이기를 지원합니다. 720P 또는 1080P(기본값 1080P)로 2~15초(기본 5초)를 생성하며 프롬프트는 최대 5,000자, 네거티브 프롬프트는 최대 500자입니다. 2~30초 길이의 mp3 또는 wav를 driving_audio로 전달할 수 있습니다. 오디오를 주지 않으면 모델이 어울리는 배경 음악이나 효과음을 만들고, 클립보다 긴 오디오는 잘리며, 짧은 오디오는 뒷부분을 무음으로 남깁니다.
wan2.7-imageAlibaba$0.030요청당Alibaba Wan2.7 Image — 텍스트-이미지 생성, 이미지 편집, 다중 이미지 참조 생성, 대화형 편집을 지원하며 텍스트 렌더링과 지시 준수에 강합니다.
wan2.7-image-proAlibaba$0.075요청당Alibaba Wan 2.7 Image Pro — Wan 2.7 이미지 라인의 전문가 등급으로, 텍스트-이미지 생성, 연속 이미지 세트, 이미지 편집, 다중 참조 이미지 기반 생성을 지원하며 프롬프트 준수력이 향상되었습니다. 텍스트-이미지 생성은 4K(4096x4096)까지 도달하고 1K와 2K 등급, 768x768부터의 사용자 지정 크기를 제공하며, 편집 모드와 연속 생성 모드는 2K가 상한입니다. 참조 이미지는 최대 9장(JPEG, JPG, PNG, BMP, WEBP, 각 변 240~8,000 px, 장당 20 MB), 화면비는 1:8부터 8:1까지, 프롬프트는 최대 5,000자입니다. PNG를 반환합니다.
wan2.7-r2vAlibaba$0.100초당Alibaba Wan2.7(R2V) — 참조 기반 영상 생성. 최대 5개의 이미지/영상 혼합 참조와 음색 참조를 지원하며 인물·소품·장면 일관성이 향상되었습니다.
wan2.7-t2vAlibaba$0.100초당Alibaba Wan2.7(T2V) — 연기력, 섬세한 감정, 강렬한 액션, 극적인 카메라 컷이 향상된 텍스트-비디오 생성. 720P 또는 1080P H.264 MP4를 2~15초(기본 5초), 16:9, 9:16, 1:1, 4:3, 3:4 비율로 생성하며 프롬프트는 최대 5,000자입니다. 오디오는 기본으로 포함됩니다. audio_url을 지정하지 않으면 모델이 어울리는 배경 음악이나 효과음을 만들어 넣고, 대신 2~30초 길이의 wav 또는 mp3 트랙을 제공할 수도 있습니다.
wan2.7-videoeditAlibaba$0.100초당Alibaba Wan2.7 VideoEdit — 자연어로 지시하는 국소 또는 전역 영상 편집, 참조 이미지 기반 요소 교체, 모션·효과·카메라 워크 복제.
wan3.0-videoAlibaba$0.100$0.085초당Alibaba Wan3.0(Video) — 텍스트-비디오, 이미지-비디오, 참조 기반 영상 생성을 하나의 엔드포인트로 통합한 올인원 영상 모델. 프롬프트와 선택 사항인 첫 프레임 이미지 URL에서 480P, 720P 또는 1080P의 H.264 MP4를 최대 30초까지 생성합니다. 생성된 영상의 초 단위로 공급사 자체 요금 단계에 따라 과금되며, 720P가 기준 요금이고 480P는 그 절반, 1080P는 2배입니다. 해상도를 지정하지 않은 요청은 모델이 1080P로 생성하며 그 등급으로 과금됩니다. 참조 영상과 참조 오디오 입력은 공급사 모델에는 있지만 이 엔드포인트에서는 지원되지 않습니다.
wan3.0-video-primeAlibaba$0.140초당Alibaba Wan3.0 Video Prime — Wan 3.0 올인원 영상 모델의 고속 등급으로, 표준 등급과 같은 기능을 더 빠른 생성 속도로 제공합니다. 텍스트-비디오, 첫·마지막 프레임 기반 이미지-비디오, 참조 이미지 기반 영상 생성(참조 이미지 최대 10장)을 하나의 엔드포인트로 처리합니다. 480P, 720P 또는 1080P의 H.264 MP4를 2~30초, 30 fps로 출력하며 오디오가 기본으로 포함됩니다. 생성된 영상의 초 단위로 공급사의 요금 단계에 따라 과금됩니다. 720P가 기본 요금이며, 480P는 그 절반에 조금 못 미치는 요금, 1080P는 두 배가 적용됩니다. 해상도를 지정하지 않은 요청은 공급사 기본값인 1080P로 생성되며 해당 요금 단계로 과금됩니다. 참조 영상, 참조 오디오, 파일, 웹 링크 입력은 이 게이트웨이에서 받지 않으며, 스마트 duration(-1)도 거부되므로 duration을 명시적으로 지정하세요. 단일 Alibaba 공식 채널로 제공됩니다.