대상 독자: 중국계 대형 모델 오픈 웨이트 동향을 추적하는 기술 책임자, AI 개발자, 법무·컴플라이언스 담당자입니다. 2026년 7월 27일 23시, Moonshot AI(월지암면)가 Kimi K3 완전 모델 가중치·기술 보고서를 공개하고 MoonEP·FlashKDA·AgentEnv 3대 Infra를 동시 오픈소스화했습니다. 세계 최초 3조 파라미터급 모델의 완전 공개(총 2.8T, 활성 약 1040억, 100만 토큰 컨텍스트)입니다. 본문 제공: API 출시→전면 공개 11일 타임라인, KDA/AttnRes/Per-Head Muon 아키텍처, 독립 제3자 벤치마크, 라이선스 2대 상업 문턱, API 가격·자체 배포 하드웨어 문턱, 6단계 Runbook. 구성: 페인포인트 → 파라미터·아키텍처 → Infra 공개 → 벤치마크·라이선스 → 배포 선정 → FAQ → 전환. 7/16 K3 출시 리뷰, 증류 논란, 7월 OpenRouter 랭킹과 상호 보완합니다.
TL;DR — 30초 결론
이번 공개는 kimi.com·API K3 출시 후 불과 11일 만입니다. Hugging Face 가중치 파일은 약 1.56TB, 공개 30분 이내 트렌드 1위를 기록했습니다.
| 항목 | 파라미터 |
|---|---|
| 총 파라미터 | 2.8조(2.8T) |
| 활성 파라미터 | 약 1040억(104B) |
| 아키텍처 | 혼합 전문가(MoE) |
| 전문가 구성 | 896 라우팅 전문가, 토큰당 16개 활성(공유 전문가 포함) |
| 어텐션 | Kimi Delta Attention(KDA) + 게이트 MLA |
| 컨텍스트 | 100만 토큰 |
| 멀티모달 | 네이티브 비전(ViT-V2, 27층) |
| 가중치 형식 | MXFP4 가중치 + MXFP8 활성화(SFT 단계 양자화 인식 학습) |
| 가중치 용량 | 약 1.56TB(Hugging Face) |
| License | 커스텀 라이선스(공식 표기: open weight, 비 open source) |
Kimi K3는 딥러닝 3대 전통 컴포넌트——어텐션·잔차 연결·최적화기——를 재설계했습니다. 단순 파라미터 적층과의 결정적 차이입니다.
기존 Gated DeltaNet은 스칼라급 망각 게이트를 사용합니다. KDA는 채널별 독립 감쇠율을 부여해 장기 보존·단기 망각을 차원 단위로 제어합니다. chunkwise DPLR 공식으로 선형 시간 재귀를 구현하며 100만 토큰 컨텍스트에서 KV Cache 오버헤드를 극소화합니다.
기존 잔차 연결은 층 출력을 균등 누적합니다. AttnRes는 입력에 따라 과거 전 층 출력을 동적으로 선택·집계하며, 약 25% 학습 효율 향상(파라미터 비용 2% 미만)을 달성합니다.
Muon 최적화기를 헤드 단위로 확장해 각 어텐션 헤드가 더 적응적 수렴 경로를 갖습니다. API 사용자에게는 보이지 않는 학습기 기술이나, 적은 활성 파라미터로 최상위 성능을 내는 핵심 요인입니다.
896 라우팅 전문가 중 토큰당 16개만 활성(희소도 약 1.8%). Quantile Balancing과 MoonEP로 각 계산 노드의 중복 전문가 수 이론 상한을 증명합니다.
| 기술 | 포지션 | 핵심 역량 |
|---|---|---|
| MoonEP | 초대규모 세밀 MoE 고성능 통신 라이브러리 | 과부하 전문가 임시 복제로 노드별 토큰 수 균등화. 중복 전문가 수 이론 상한 증명 |
| FlashKDA | NVIDIA CUTLASS 기반 KDA 고성능 연산자(기공개) | NVIDIA H20에서 prefill 1.72–2.22배 가속. flash-linear-attention의 chunk_kda 직접 대체 백엔드 |
| AgentEnv | KVCache.ai 공동 Agent 샌드박스(Firecracker microVM) | 대규모 병렬 Agent RL 학습용. 공식값: checkpoint 133ms, 복구 49ms, 메모리 오버서브scription 최대 6.5배(제3자 독립 재현 미확인) |
기관·평가 프레임워크에 따라 수치 격차가 큽니다. 아래는 독립 제3자 재측정 데이터를 우선합니다.
| 모델 | SWE-bench Verified | 공개일 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 지능 지수(max 추론档): Claude Fable 5(max+fallback) 60점, GPT-5.6 Sol(max) 59점, Kimi K3(max) 약 57점——글로벌 3위·오픈 웨이트 1위, GLM-5.2(max) 51점, DeepSeek V4 Pro(max) 44점.
요약하면 오픈 웨이트 진영 능력 상한이지 가성비 최적해가 아닙니다. K3는 Arena.ai Frontend Code Arena 1위도 기록했습니다.
Moonshot 공식 자료는 open source를 한 번도 사용하지 않았습니다. 항상 open weight(오픈 웨이트)입니다. K2 시리즈에 없던 2대 상업 문턱이 신설되었습니다.
대부분 중소팀·스타트업에는 해당되지 않으며 정상 상업 이용이 가능합니다.
| 토큰 유형 | 가격(100만 토큰당) |
|---|---|
| 입력(캐시 히트) | $0.30 |
| 입력(캐시 미스) | $3.00 |
| 출력(추론 과정 포함) | $15.00 |
Moonshot은 OpenAI SDK 호환 Chat Completions API(https://api.moonshot.ai/v1, 모델 ID kimi-k3)를 제공합니다. Mooncake 분리형 추론 아키텍처로 전형적 프로그래밍 워크로드에서 캐시 히트율 90% 초과가 가능하며, 실제 비용은 $0.30档에 근접합니다.
자체 배포는 공식 권장 64 GPU 이상 슈퍼노드입니다. 개인·중소팀에는 OpenRouter 등 서드파티(이미 7개 업체 K3 제공)가 현실적입니다.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": "You are a senior software engineer."},
{"role": "user", "content": "Refactor this function with type hints and docstrings."},
],
max_tokens=4096,
)
print(response.choices[0].message.content)
프로덕션 주의: 64 GPU 슈퍼노드는 대부분 팀에게 비현실적입니다. API 경로에서도 장세션 Agent는 전용 7×24 노드 Gateway 배치를 권장합니다. 429/타임아웃 시 fallback 체인을 반드시 구성하십시오.
K3 공개는 세계인공지능대회(WAIC 2026) 창구기와 미중「모델 증류」분쟁 격화기와 겹칩니다. 가중치 공개 직전 미측은 Moonshot의 Anthropic 모델「공업화 증류」를 지적·제재를 경고했고, 7월 28일 중국 상무부는「AI 패권주의」를 비난·반제를 표명했습니다. Moonshot이 가중치·기술 보고서·3대 Infra를 모두 공개한 것은 기술 경로 독립성을 엔지니어링 세부로 입증하려는 태도이기도 합니다. 3일 후 알리바바가 24조 파라미터 Qwen3.8-Max-Preview를 발표해 K3에 대한 직접 대응으로 해석됩니다——국산 대형 모델 경쟁은「3T 클럽」단계에 진입했습니다.
대부분 팀에게 64 GPU 문턱은 API 호출이 유일한 현실적 경로입니다. 그러나 API 경로에서도 OpenClaw·Hermes Agent·Kilo Code와 K3를 연결한 프로덕션 Agent 워크플로에는 3대 숨은 비용이 있습니다——노트북 수면 장세션 단절, 네트워크 지터 추론 링크 단절, 다수 개발기에 분산된 API Key 로테이션 불가. 이는 K3 93.4% SWE-bench 능력과 무관하나 비즈니스 전환을 좌우합니다.
100만 토큰 컨텍스트일수록 장세션 Agent에서 위 문제가 확대됩니다. 더 안정적인 AI Agent 자동화 프로덕션 환경에는 MACCOME Mac 클라우드 호스트가 적합합니다——실제 macOS, SSH 인수, 환경 격리로 K3 API 라우팅·Agent Gateway를 전용 인스턴스에서 7×24 안정 가동합니다. 요금은 Mac mini 대여 가격을 확인하십시오.
데이터 출처: Moonshot AI 공식 블로그(kimi.com/blog/kimi-k3), Hugging Face(moonshotai org), GitHub(moonshotai/FlashKDA), Vals AI SWE-bench Verified 랭킹, Artificial Analysis Intelligence Index, VentureBeat, Simon Willison's blog. 배포 전 공식 최신 데이터를 확인하십시오.
자주 묻는 질문
Kimi K3는 진짜 오픈소스 모델입니까?
엄밀히는 아닙니다. 오픈 웨이트(open weight) 모델입니다. 학습 완료 가중치, 기술 보고서, 일부 Infra 도구는 공개되었으나 학습 데이터·전체 학습 코드는 비공개이며 OSI 기준 오픈소스 정의에 해당하지 않습니다. Moonshot은 공식적으로 항상 open weight만 사용하고 open source는 사용하지 않습니다.
Kimi K3를 상업적으로 사용할 수 있습니까?
가능합니다. 대부분 상업 시나리오에는 제한이 없습니다. 다만 Model-as-a-Service 사업 연매출 2,000만 달러 초과, 또는 MAU 1억 초과/월매출 2,000만 달러 초과 제품은 라이선스 추가 조항을 충족해야 합니다.
Kimi K3 자체 배포에 GPU가 몇 장 필요합니까?
공식 권장은 64 GPU 이상 슈퍼노드 클러스터입니다. 개인·대부분 기업에는 공식 API 또는 OpenRouter 등 서드파티가 현실적입니다. 상세는 7/16 K3 출시 리뷰 접속 방식 비교를 참고하십시오.
Kimi K3 성능은 어느 수준입니까?
오픈 웨이트 진영 종합 능력 최상위, Artificial Analysis 지능 지수 글로벌 3위(Claude Fable 5·GPT-5.6 Sol 다음). 그러나 GLM-5.2보다 비용이 높아「오픈 웨이트 능력 상한이나 가성비 최적해는 아님」의 선택지입니다. 증류 논란 배경은 Opus 5·K3 증류 논란을 참고하십시오.
Kimi K3와 Kimi K2의 차이는 무엇입니까?
K3 파라미터 규모는 K2.5의 약 3배입니다. Attention Residuals·Per-Head Muon을 신설했고 컨텍스트·멀티모달 능력도 대폭 향상되었습니다. 라이선스 측면 K3에 MaaS 수입 문턱이 신설되어 K2 시리즈보다 상업 제한이 세분화되었습니다.
프로덕션에서 K3 연동 Agent 스택을 7×24 운영하려면?
전용 Mac 클라우드 호스트에 OpenClaw/Hermes Agent 등 Gateway를 배포하고 K3 API 또는 OpenRouter 계층 라우팅과 결합하는 것을 권장합니다. 노트북 수면 장세션 단절을 피하십시오. MACCOME Mac 대여 요금에서 노드 구성·가격을 확인하십시오.