Kimi K3 완전 오픈 웨이트 공개: 2.8T 파라미터·100만 컨텍스트, Moonshot의 한 수

약 22분 소요 · MACCOME · 마지막 업데이트: 2026년 7월 28일

대상 독자: 중국계 대형 모델 오픈 웨이트 동향을 추적하는 기술 책임자, AI 개발자, 법무·컴플라이언스 담당자입니다. 2026년 7월 27일 23시, Moonshot AI(월지암면)가 Kimi K3 완전 모델 가중치·기술 보고서를 공개하고 MoonEP·FlashKDA·AgentEnv 3대 Infra를 동시 오픈소스화했습니다. 세계 최초 3조 파라미터급 모델의 완전 공개(총 2.8T, 활성 약 1040억, 100만 토큰 컨텍스트)입니다. 본문 제공: API 출시→전면 공개 11일 타임라인, KDA/AttnRes/Per-Head Muon 아키텍처, 독립 제3자 벤치마크, 라이선스 2대 상업 문턱, API 가격·자체 배포 하드웨어 문턱, 6단계 Runbook. 구성: 페인포인트 → 파라미터·아키텍처 → Infra 공개 → 벤치마크·라이선스 → 배포 선정 → FAQ → 전환. 7/16 K3 출시 리뷰, 증류 논란, 7월 OpenRouter 랭킹과 상호 보완합니다.

bolt

TL;DR — 30초 결론

  • OSI 의미의「오픈소스」아님: Moonshot은 공식적으로 항상 open weight(오픈 웨이트)만 사용하며, 학습 데이터·전체 학습 코드는 비공개입니다.
  • 스펙 상한: 2.8T 총 파라미터, 896 중 16 MoE, 1M 컨텍스트, 가중치 약 1.56TB. Hugging Face 공개 30분 만에 트렌드 1위를 기록했습니다.
  • 능력 포지션: Artificial Analysis 지능 지수 글로벌 3위·오픈 웨이트 1위(약 57점). 그러나 태스크당 약 $0.95로 GLM-5.2(약 $0.47)보다 높아 능력 상한형이지 가성비 최적해가 아닙니다.
  • 라이선스 2대 상업 문턱: MaaS 연매출 $2000만 초과 시 별도 계약. MAU 1억 초과 또는 월매출 $2000만 초과 시「Kimi K3」표기 의무.
  • 자체 배포 현실: 공식 권장 64 GPU 이상 슈퍼노드. 개인·중소팀은 공식 API 또는 OpenRouter(7개 업체 운영 중)가 현실적입니다.

6대 페인포인트: K3 가중치 공개 후 가장 흔한 오판

  1. 「오픈 웨이트」를「오픈소스」로 혼동: 언론은「오픈소스」로 번역하는 경우가 많으나 Moonshot 공식 자료는 open source를 한 번도 사용하지 않았습니다. 학습 완료 가중치·기술 보고서·추론 Infra만 공개되며 OSI 기준에 해당하지 않습니다.
  2. 라이선스 상업 문턱 간과: K3는 Modified MIT가 아닌 완전 커스텀 라이선스입니다. MaaS 수입 문턱·규모 표시 문턱이 신설되었으며, Moonshot과 경쟁하는 모델 API 사업자에게는 법무 레드라인입니다.
  3. 벤치마크 수치 오독: 벤더 자체 보고와 독립 제3자 재측정 간 격차가 큽니다. SWE-bench Verified 독립 재측에서 K3는 93.4%, Claude Opus 5(97%)·GPT-5.6 Sol(96.2%)에 미치지 않으나 오픈 웨이트 진영 최상위입니다.
  4. 능력만 보고 비용 무시: K3 태스크당 약 $0.95. Claude Fable 5(약 $2.4) 대비 60% 저렴하나 GLM-5.2(약 $0.47)의 2배——오픈 웨이트 능력 상한이지 가성비 최적해가 아닙니다.
  5. 자체 배포 하드웨어 문턱 과소평가: 2.8T·896 전문가 규모는 소비자급 하드웨어 실행을 사실상 불가능하게 합니다. 공식 권장은 64 GPU 이상 슈퍼노드입니다.
  6. 노트북에서 100만 토큰 Agent 장세션 운영: 7×24 온라인 Gateway가 전제입니다. 덮개 닫힘 수면, 네트워크 지터, API Key 분산은 모델 능력과 무관한 3대 숨은 비용입니다.

타임라인: API 출시→전면 공개 11일

  • 7월 16일 밤(WAIC 2026 전야): kimi.com·Kimi Work·Kimi Code·Kimi API에서 K3 출시. 온라인 호출만 가능, 가중치 미공개. 공식 기술 블로그 제목《Kimi K3: Open Frontier Intelligence》.
  • 7월 17일: 업계 아키텍처 분석 집중. 신화통신은「현재 세계 최대 파라미터 오픈소스 모델」로 보도했습니다.
  • 7월 22–23일: 미중「모델 증류」분쟁 격화. 백악관 과학기술 고문 Michael Kratsios가 Moonshot의 Anthropic Fable 모델에 대한「대규모·은밀한 공업화 증류」를 지적. 재무장관 Scott Bessent는 관련 중국 기업 제재·「실체 목록」제한 검토를 발표했습니다.
  • 7월 27일 23시: Moonshot이 K3 완전 가중치·기술 보고서 공개. MoonEP·AgentEnv 동시 오픈소스(FlashKDA는 기공개).
  • 7월 28일: 중국 상무부 미중 AI 분쟁 공개 대응. 미국「AI 패권주의」비난·반제 조치 경고. 국내 매체가 이번 공개 세부를 후속 보도했습니다.

이번 공개는 kimi.com·API K3 출시 후 불과 11일 만입니다. Hugging Face 가중치 파일은 약 1.56TB, 공개 30분 이내 트렌드 1위를 기록했습니다.

Kimi K3 핵심 파라미터

항목파라미터
총 파라미터2.8조(2.8T)
활성 파라미터1040억(104B)
아키텍처혼합 전문가(MoE)
전문가 구성896 라우팅 전문가, 토큰당 16개 활성(공유 전문가 포함)
어텐션Kimi Delta Attention(KDA) + 게이트 MLA
컨텍스트100만 토큰
멀티모달네이티브 비전(ViT-V2, 27층)
가중치 형식MXFP4 가중치 + MXFP8 활성화(SFT 단계 양자화 인식 학습)
가중치 용량약 1.56TB(Hugging Face)
License커스텀 라이선스(공식 표기: open weight, 비 open source)

3대 아키텍처 혁신: KDA·AttnRes·Per-Head Muon

Kimi K3는 딥러닝 3대 전통 컴포넌트——어텐션·잔차 연결·최적화기——를 재설계했습니다. 단순 파라미터 적층과의 결정적 차이입니다.

Kimi Delta Attention(KDA): 더 정밀한「망각」

기존 Gated DeltaNet은 스칼라급 망각 게이트를 사용합니다. KDA는 채널별 독립 감쇠율을 부여해 장기 보존·단기 망각을 차원 단위로 제어합니다. chunkwise DPLR 공식으로 선형 시간 재귀를 구현하며 100만 토큰 컨텍스트에서 KV Cache 오버헤드를 극소화합니다.

Attention Residuals(AttnRes): 선택적 잔차 집계

기존 잔차 연결은 층 출력을 균등 누적합니다. AttnRes는 입력에 따라 과거 전 층 출력을 동적으로 선택·집계하며, 약 25% 학습 효율 향상(파라미터 비용 2% 미만)을 달성합니다.

Per-Head Muon: 어텐션 헤드 단위 독립 최적화

Muon 최적화기를 헤드 단위로 확장해 각 어텐션 헤드가 더 적응적 수렴 경로를 갖습니다. API 사용자에게는 보이지 않는 학습기 기술이나, 적은 활성 파라미터로 최상위 성능을 내는 핵심 요인입니다.

Stable LatentMoE: 896 중 16 희소 설계

896 라우팅 전문가 중 토큰당 16개만 활성(희소도 약 1.8%). Quantile Balancing과 MoonEP로 각 계산 노드의 중복 전문가 수 이론 상한을 증명합니다.

3대 오픈소스 Infra: 가중치뿐 아니라 엔지니어링 역량 일체

기술포지션핵심 역량
MoonEP초대규모 세밀 MoE 고성능 통신 라이브러리과부하 전문가 임시 복제로 노드별 토큰 수 균등화. 중복 전문가 수 이론 상한 증명
FlashKDANVIDIA CUTLASS 기반 KDA 고성능 연산자(기공개)NVIDIA H20에서 prefill 1.72–2.22배 가속. flash-linear-attentionchunk_kda 직접 대체 백엔드
AgentEnvKVCache.ai 공동 Agent 샌드박스(Firecracker microVM)대규모 병렬 Agent RL 학습용. 공식값: checkpoint 133ms, 복구 49ms, 메모리 오버서브scription 최대 6.5배(제3자 독립 재현 미확인)

벤치마크 비교: GPT-5.6·Claude·GLM 횡단

기관·평가 프레임워크에 따라 수치 격차가 큽니다. 아래는 독립 제3자 재측정 데이터를 우선합니다.

모델SWE-bench Verified공개일
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 지능 지수(max 추론档): Claude Fable 5(max+fallback) 60점, GPT-5.6 Sol(max) 59점, Kimi K3(max) 약 57점——글로벌 3위·오픈 웨이트 1위, GLM-5.2(max) 51점, DeepSeek V4 Pro(max) 44점.

요약하면 오픈 웨이트 진영 능력 상한이지 가성비 최적해가 아닙니다. K3는 Arena.ai Frontend Code Arena 1위도 기록했습니다.

「오픈소스」인가「오픈 웨이트」인가: 라이선스 2대 상업 문턱

Moonshot 공식 자료는 open source를 한 번도 사용하지 않았습니다. 항상 open weight(오픈 웨이트)입니다. K2 시리즈에 없던 2대 상업 문턱이 신설되었습니다.

  1. Model-as-a-Service 수입 문턱: 연속 12개월 MaaS 사업 수입 $2000만 초과 시 Moonshot과 별도 상업 계약 필요.
  2. 규모 표시 문턱: MAU 1억 초과 또는 월매출 $2000만 초과 제품은 UI에「Kimi K3」를 현저히 표시해야 합니다.

대부분 중소팀·스타트업에는 해당되지 않으며 정상 상업 이용이 가능합니다.

API 가격·자체 배포: 직접 구동 가능한가

토큰 유형가격(100만 토큰당)
입력(캐시 히트)$0.30
입력(캐시 미스)$3.00
출력(추론 과정 포함)$15.00

Moonshot은 OpenAI SDK 호환 Chat Completions API(https://api.moonshot.ai/v1, 모델 ID kimi-k3)를 제공합니다. Mooncake 분리형 추론 아키텍처로 전형적 프로그래밍 워크로드에서 캐시 히트율 90% 초과가 가능하며, 실제 비용은 $0.30档에 근접합니다.

자체 배포는 공식 권장 64 GPU 이상 슈퍼노드입니다. 개인·중소팀에는 OpenRouter 등 서드파티(이미 7개 업체 K3 제공)가 현실적입니다.

python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "You are a senior software engineer."},
        {"role": "user", "content": "Refactor this function with type hints and docstrings."},
    ],
    max_tokens=4096,
)
print(response.choices[0].message.content)
warning

프로덕션 주의: 64 GPU 슈퍼노드는 대부분 팀에게 비현실적입니다. API 경로에서도 장세션 Agent는 전용 7×24 노드 Gateway 배치를 권장합니다. 429/타임아웃 시 fallback 체인을 반드시 구성하십시오.

6단계 Runbook: K3 가중치 공개 후 랜딩 경로

  1. 사용 시나리오·컴플라이언스 경계 정리: 커스텀 라이선스 전문을 검토하고 MaaS 수입 문턱($2000만/12개월) 또는 규모 표시 문턱(1억 MAU/$2000만 월수입) 해당 여부를 확인합니다. 내부 사용·중소 규모 상업이면 통상 추가 제한 없습니다.
  2. 접속 경로 선택: 공식 API(Mooncake 고캐시 히트율), OpenRouter 멀티 provider 라우팅, 자체 배포(64 GPU 슈퍼노드 필요)를 평가합니다. OpenRouter API 통합 가이드로 fallback 체인을 구성하십시오.
  3. 태스크별 계층 라우팅: 단순 대화→Flash档 중국 모델, 복잡 프로그래밍·Agent→K3 max 추론档, 극한 난이도→Claude Opus 5/GPT-5.6 Sol 유지——7월 OpenRouter 계층 라우팅 예시를 참고하십시오.
  4. 벤치마크·비용 검증: 실 워크로드에서 SWE-bench 서브셋 또는 내부 평가셋을 실행하고 K3(약 $0.95/태스크) vs GLM-5.2(약 $0.47/태스크) 가성비 곡선을 비교합니다.「능력 과잉」비용 낭비를 방지합니다.
  5. Agent Gateway 배포: 전용 노드에서 OpenClaw/Hermes Agent/Kilo Code를 가동하고 K3를 프로그래밍 주 모델로 설정합니다. 429/타임아웃 자동 강등을 구성하고 API Key는 환경별 관리(코드 저장소 하드코딩 금지)를 철저히 합니다.
  6. 7×24 모니터링·비용 알림: 일 예산 상한·캐시 히트율을 모니터링합니다. 장세션 Agent는 전용 Mac 클라우드 호스트에 배치해 노트북 수면으로 인한 추론 링크 단절을 방지합니다.

기술 리뷰에 넣을 3대 하드 데이터

  • 세계 최초 완전 공개 3T급 모델: 2.8T 총 파라미터, 1.56TB 가중치. Hugging Face 공개 30분 만에 트렌드 1위——이전 3조 파라미터급 완전 공개 사례 없음.
  • 독립 제3자 SWE-bench Verified: K3 93.4%(Vals AI 재측). Claude Opus 5(97%)와 3.6%p 차이이나 DeepSeek-V4(76.2%) 대비 17.2%p 앞섬.
  • FlashKDA 하드웨어 가속: NVIDIA H20에서 flash-linear-attention 기준 prefill 1.72–2.22배——장컨텍스트 추론 비용을 대폭 압축할 가능성.

공개의 지정학적 배경: WAIC 2026·미중 AI 분쟁

K3 공개는 세계인공지능대회(WAIC 2026) 창구기와 미중「모델 증류」분쟁 격화기와 겹칩니다. 가중치 공개 직전 미측은 Moonshot의 Anthropic 모델「공업화 증류」를 지적·제재를 경고했고, 7월 28일 중국 상무부는「AI 패권주의」를 비난·반제를 표명했습니다. Moonshot이 가중치·기술 보고서·3대 Infra를 모두 공개한 것은 기술 경로 독립성을 엔지니어링 세부로 입증하려는 태도이기도 합니다. 3일 후 알리바바가 24조 파라미터 Qwen3.8-Max-Preview를 발표해 K3에 대한 직접 대응으로 해석됩니다——국산 대형 모델 경쟁은「3T 클럽」단계에 진입했습니다.

자체 배포가 비현실적일 때: Agent 스택에 전용 노드가 필요한 이유

대부분 팀에게 64 GPU 문턱은 API 호출이 유일한 현실적 경로입니다. 그러나 API 경로에서도 OpenClaw·Hermes Agent·Kilo Code와 K3를 연결한 프로덕션 Agent 워크플로에는 3대 숨은 비용이 있습니다——노트북 수면 장세션 단절, 네트워크 지터 추론 링크 단절, 다수 개발기에 분산된 API Key 로테이션 불가. 이는 K3 93.4% SWE-bench 능력과 무관하나 비즈니스 전환을 좌우합니다.

100만 토큰 컨텍스트일수록 장세션 Agent에서 위 문제가 확대됩니다. 더 안정적인 AI Agent 자동화 프로덕션 환경에는 MACCOME Mac 클라우드 호스트가 적합합니다——실제 macOS, SSH 인수, 환경 격리로 K3 API 라우팅·Agent Gateway를 전용 인스턴스에서 7×24 안정 가동합니다. 요금은 Mac mini 대여 가격을 확인하십시오.

데이터 출처: Moonshot AI 공식 블로그(kimi.com/blog/kimi-k3), Hugging Face(moonshotai org), GitHub(moonshotai/FlashKDA), Vals AI SWE-bench Verified 랭킹, Artificial Analysis Intelligence Index, VentureBeat, Simon Willison's blog. 배포 전 공식 최신 데이터를 확인하십시오.

자주 묻는 질문

Kimi K3는 진짜 오픈소스 모델입니까?

엄밀히는 아닙니다. 오픈 웨이트(open weight) 모델입니다. 학습 완료 가중치, 기술 보고서, 일부 Infra 도구는 공개되었으나 학습 데이터·전체 학습 코드는 비공개이며 OSI 기준 오픈소스 정의에 해당하지 않습니다. Moonshot은 공식적으로 항상 open weight만 사용하고 open source는 사용하지 않습니다.

Kimi K3를 상업적으로 사용할 수 있습니까?

가능합니다. 대부분 상업 시나리오에는 제한이 없습니다. 다만 Model-as-a-Service 사업 연매출 2,000만 달러 초과, 또는 MAU 1억 초과/월매출 2,000만 달러 초과 제품은 라이선스 추가 조항을 충족해야 합니다.

Kimi K3 자체 배포에 GPU가 몇 장 필요합니까?

공식 권장은 64 GPU 이상 슈퍼노드 클러스터입니다. 개인·대부분 기업에는 공식 API 또는 OpenRouter 등 서드파티가 현실적입니다. 상세는 7/16 K3 출시 리뷰 접속 방식 비교를 참고하십시오.

Kimi K3 성능은 어느 수준입니까?

오픈 웨이트 진영 종합 능력 최상위, Artificial Analysis 지능 지수 글로벌 3위(Claude Fable 5·GPT-5.6 Sol 다음). 그러나 GLM-5.2보다 비용이 높아「오픈 웨이트 능력 상한이나 가성비 최적해는 아님」의 선택지입니다. 증류 논란 배경은 Opus 5·K3 증류 논란을 참고하십시오.

Kimi K3와 Kimi K2의 차이는 무엇입니까?

K3 파라미터 규모는 K2.5의 약 3배입니다. Attention Residuals·Per-Head Muon을 신설했고 컨텍스트·멀티모달 능력도 대폭 향상되었습니다. 라이선스 측면 K3에 MaaS 수입 문턱이 신설되어 K2 시리즈보다 상업 제한이 세분화되었습니다.

프로덕션에서 K3 연동 Agent 스택을 7×24 운영하려면?

전용 Mac 클라우드 호스트에 OpenClaw/Hermes Agent 등 Gateway를 배포하고 K3 API 또는 OpenRouter 계층 라우팅과 결합하는 것을 권장합니다. 노트북 수면 장세션 단절을 피하십시오. MACCOME Mac 대여 요금에서 노드 구성·가격을 확인하십시오.