Claude Opus 5는 반값으로 플래그십에 근접, Kimi K3는 「Claude 자칭」 증류 논란: 이번 주 AI 두 대형 이슈

약 18분 소요 · MACCOME · 마지막 업데이트: 2026년 7월 25일

대상 독자: Claude / Kimi 선정을 검토 중인 개발자, AI 컴플라이언스 및 공급망 리스크에 관심 있는 기술 책임자입니다. 이번 주 두 대형 이슈는 겉보기 무관해 보이지만, 모두 「가성비」와 「모델 능력의 실제 출처」를 묻습니다. 7월 24일 Anthropic이 Claude Opus 5를 출시하고 Claude Max 기본 모델로 설정했습니다. 7월 16일 출시된 Kimi K3는 백악관의 Claude 증류 공개 지적을 받았고, 독립 연구자가 K3가 Claude를 자칭하며 내부 배포 ID를 유출하는 것을 발견했습니다. 본문에서 다루는 내용: Opus 5 vs Fable 5 비교표, K3 증류 논란 전체 타임라인, Greenblatt 기술 증거 해석, 6단계 선정 Runbook, FAQ. 구성: 페인포인트 → Opus 5 해석 → K3 논란 → 비교 매트릭스 → Runbook → 결론·전환. K3 파라미터 및 벤치마크 상세는 Kimi K3 심층 리뷰를 참고하십시오.

bolt

TL;DR — 30초 결론

  • Opus 5(7/24): Opus 4.8과 동일한 $5/$25 per 1M. CursorBench 3.2 피크는 Fable 5보다 0.5% 낮을 뿐, 비용은 약 절반. Claude Max 기본 모델, 데이터 보존은 기본적으로 강제하지 않음.
  • K3 증류 논란(7/22–24): 백악관 OSTP 국장 Kratsios가 「은밀한 산업급 증류」+ 불법 GB300 칩을 지적. Fable 5 공개 후 2주밖에 지나지 않아 전문가들이 타임라인에 의문.
  • 가장 단단한 증거: Redwood Research의 Ryan Greenblatt가 K3가 비정상적으로 높은 빈도로 Claude를 자칭하며 claude-opus-4-5-20250929 등 내부 ID를 유출——진짜 Claude보다 정확함.
  • 7/27 검증 대기: K3 전체 가중치는 7월 27일 공개 예정. 외부에서는 아직 아키텍처와 점수를 독립 재현할 수 없음.

6대 페인포인트: 이번 주 두 대형 이슈에서 개발자가 빠지기 쉬운 함정

  1. 「반값 Opus」를 「Fable 5 전면 대체」로 오해: Opus 5는 Agent 프로그래밍과 자동화에서 플래그십에 근접하지만, Anthropic은 의도적으로 사이버 공격·생물 안전 등 이중 용도 능력의 프론티어 갱신을 피했습니다——Mythos 5가 그 자리를 차지합니다.
  2. 백악관 발언을 확정 사실로 간주: Kratsios와 Bessent의 공개 지적에는 검증 가능한 증거가 첨부되지 않았습니다. 월지암면은 훈련 과정 질의에 미응답했지만, 「미응답 ≠ 유죄」입니다.
  3. 증류 타임라인 무시: Fable 5는 7월 1일에 일반 공개. K3 출시(7/16)까지 겨우 2주——깊은 RL식 증류는 연산력과 API 비용상 거의 불가능하다고 여러 독립 연구자가 지적합니다.
  4. 「K3 Claude 자칭」 기술 신호 간과: 정치적 성명보다 분석 가치가 높습니다——훈련 데이터에 배포 메타데이터가 붙은 Claude 샘플이 섞였을 가능성을 시사하지만, Greenblatt는 증류 발생의 직접 증명은 아니다라고 강조합니다.
  5. 컴플라이언스·데이터 보존 맹점: Fable 5 / Mythos 5는 30일 데이터 보존 수락이 필요합니다. Opus 5는 Opus 시리즈와 같이 기본적으로 강제 보존 없음——엔터프라이즈 선정 시 별도 확인이 필요합니다.
  6. 노트북에서 멀티 모델 Agent 스택 운영: Opus 5 + K3 혼합 라우팅, 장컨텍스트 세션, Gateway에는 7×24 온라인 노드가 필요하며, 로컬은 덮개 닫으면 즉시 끊깁니다.

Claude Opus 5 출시: 플래그십은 아니지만, 가장 쓸 가치 있는 Claude일 수 있음

2026년 7월 24일(미국 태평양 시간), Anthropic이 Claude Opus 5(모델 ID: claude-opus-5)를 정식 출시하고 당일 Claude Max 기본 모델로 설정했습니다. Claude Pro 사용자도 현재 최강 Opus 버전을 이용할 수 있습니다. 포지셔닝은 명확합니다: 일상 주력 모델. 지능은 플래그십 Fable 5에 근접하고, 가격은 약 절반입니다.

가격은 그대로, 성능은 「급상승」

Opus 5 가격은 Opus 4.8과 완전히 동일합니다: 입력 $5 / 100만 tokens, 출력 $25 / 100만 tokens. 100만 token 컨텍스트는 기본이자 유일 설정, 최대 출력 128K. Thinking은 기본 ON, Effort 파라미터로 사고량 제어. Fast 모드는 기본의 약 2.5배 속도, 가격은 2배입니다.

Anthropic 공식 벤치마크 Highlights:

  • Frontier-Bench v0.1(소프트웨어 엔지니어링): 모든 모델 초과, Opus 4.8의 2배 이상, 태스크 단가는 더 낮음.
  • CursorBench 3.2: max effort에서 Fable 5 피크와 단 0.5% 차이, 비용 약 절반. high / xhigh / max 각 단계에서 「동일 비용 성능」이 시장 전 모델을 상회.
  • ARC-AGI 3(새로운 문제): 점수는 「차점 모델」의 3배.
  • OSWorld 2.0(컴퓨터 조작): Fable 5 최고 점수를 Fable 5 비용의 1/3 미만으로 초과.
  • Zapier AutomationBench: 엔드투엔드 상용 자동화 통과율은 차점의 약 1.5배. 최저 effort에서도 다른 모델을 상회. Zapier는 Opus 5가 해당 벤치에서 100% 통과하며, 기존 모델이 통과하지 못한 태스크도 통과했다고 평가.

Cursor 팀 평가: 「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」

연구·엔터프라이즈 실측

구조 생물학, 유기화학, 생물정보학에서 Opus 4.8을 전면 초과: 스펙트럼에서 분자 구조 추정 내부 평가 10.2%p 높음, 단백질 서열 변이 기능 예측 7.7%p 높음. Box 고객 데이터: 데이터 분석 워크플로 +11%, 실사 +17%, 전체 정확도 +8%.

정렬·안전: 가장 「순종적인」 세대이나, 이중 용도 프론티어는 의도적으로 미갱신

자동화 행동 감사에서 Opus 5는 지금까지 가장 정렬된 Claude: 기만 행위율 최저, 악용 유도가 가장 어려움. 그러나 위험형 이중 용도 능력(사이버 공격, 생물 안전)에서는 프론티어를 갱신하지 않았으며, 제한 배포 Mythos 5가 유지. 사이버보안 분류기는 Fable 5보다 약 85% 완화——소스 수준 취약점 발견은 가능, 바이너리 스캔·침투 테스트·exploit 생성 등은 계속 차단.

놓치기 쉬운 점: 기본적으로 데이터 보존 강제 없음

Opus 5는 역대 Opus와 같이 기본 접근에서 데이터 보존을 강제하지 않습니다. Fable 5 / Mythos 5는 30일 데이터 보존 정책 수락이 필요합니다. 컴플라이언스 민감 시나리오에서 Fable 5가 아닌 Opus 5를 선택하는 결정적 이유가 될 수 있습니다.

차원Claude Opus 5Claude Fable 5
출시일2026-07-242026-06-09(7/1 일반 이용 가능)
입력 / 출력 가격$5 / $25 per 1M tokens약 $10 / $50 per 1M tokens
CursorBench 3.2(max)Fable 5 피크와 0.5% 차이피크 기준
Claude Max 기본예(출시일부터)아니오
데이터 보존기본 강제 없음30일 보존 opt-in 필요
이중 용도 프론티어(사이버/생물)의도적으로 미갱신더 강함(Mythos 5가 제한 최강)

Kimi K3 「증류 논란」: 백악관 개입, 전문가의 타임라인 의문, Greenblatt의 새 증거

Opus 5가 「정상적인 신제품 출시」라면, Kimi K3 전개는 훨씬 복잡합니다. 월지암면은 7월 16일 K3(2.8T 파라미터, 1M 컨텍스트, sparse MoE)를 출시. 공식은 종합 능력이 Fable 5와 GPT-5.6 Sol에 이른다고 주장. 전체 가중치는 7월 27일 공개 예정——논란 발생 시점에는 외부 검증 불가였습니다.

백악관의 갑작스러운 개입

2026년 7월 22–23일, 백악관 과학기술정책국(OSTP) 국장 Michael Kratsios가 X에 게시하여, 월지암면이 「대규모·은밀한 산업급 증류(distillation)」로 Anthropic Fable 모델 능력을 탈취했다고 지적. 무허가 Nvidia GB300 칩 사용(태국 경유 서버로 간접 취득 가능성)도 언급. 재무장관 Scott Bessent도 「많은 중국 모델에서 미국 대형 모델 워터마크를 발견했다」고 동조했지만, 구체적 의미는 설명하지 않았습니다.

이는 공허한 주장이 아닙니다: 2026년 2월 Anthropic은 월지암면·DeepSeek·MiniMax의 「산업급 증류 공격」을 공개 지적했으며, 월지암면의 340만 회 이상 비정상 API 상호작용을 식별, 「명백히 정상 이용 패턴에서 벗어남」이라고 했고, 요청 메타데이터로 일부 행위가 월지암면 고위와 관련된다고 주장했습니다. 월지암면은 정면 확인도 부인도 하지 않았습니다.

독립 전문가: 시간이 부족함

TechCrunch(7/23)는 여러 연구자를 인터뷰했으며, 「2주 내 K3 증류」에 대한 회의가 널리 퍼졌습니다. Snorkel AI 공동창업자 Braden Hancock:

「Fable은 7월 1일부터 일반 공개. 2주 만에 이 정도 데이터를 증류하고 모델 훈련까지 완료해 출시하는 것은 불가능합니다.」

Allen Institute for AI 연구원 Nathan Lambert는, 중국 모델이 프론티어에 근접할수록 단순 SFT식 증류의 한계 효용은 작아지고, 진짜 격차는 더 시간이 걸리는 강화학습에 있다고 지적. 증류가 이렇게 유효했다면 추격자들이 GLM이나 K3를 증류로 따라잡았을 텐데, 그렇지 않다고 말합니다.

Elon Musk는 재판에서 xAI가 Grok 훈련 시 OpenAI 모델을 증류했다고 인정했으며, 업계에서 흔하다고 발언——「증류」 자체는 불법이 아니며, 「정상적 기술 참고」와 「은밀한 산업급 탈취」의 경계가 문제입니다.

가장 단단한 증거: K3가 「Claude를 자칭」함

Redwood Research 수석 과학자 Ryan Greenblatt(7/24 전후, GitHub: rgreenblatt/which_claude_is_k3)가 여러 모델의 자기 인식 행동을 교차 엔트로피로 비교하여 다음을 발견했습니다:

  • Kimi K3가 비정상적으로 높은 빈도로 Claude를 자칭, claude-opus-4-5-20250929, claude-sonnet-4-5-20250929 등 Claude 공식 내부 배포 ID까지 유출.
  • 진짜 Claude Sonnet 4.5는 「Claude Sonnet 4.5입니다」라고만 말함. Opus 4.5는 버전 번호를 보고하지 않거나 틀림——교사 모델 자체보다 K3가 더 정확.
  • K3의 자칭 버전은 「Claude 4.5 세대」(2025년 말)에 고정되며, 현행 Fable/Mythos가 아님. 이전 세대 K2는 더 오래된 Claude Sonnet 4를 가리킴——「세대를 따라가는」 패턴이 보임.

Greenblatt 해석: 훈련 데이터에 배포 메타데이터가 붙은 Claude 데이터(API 로그나 라벨 합성 데이터)가 섞였을 가능성이 높으며, 「대화 스타일 모방」으로는 설명하기 어려운 더 구체적인 증류 형태. 그러나 이 발견들은 증류 발생의 직접 증명이 아님——ID 혼동은 데이터 오염, 시스템 프롬프트 유출, 공개 데이터셋 합성 샘플에서도 발생할 수 있습니다.

커뮤니티 태도: 구경 이상으로 「쓸 수 있는가, 값어치가 있는가」

Reddit r/LocalLLaMA에서 세 가지 목소리: 오픈소스와 클로즈드 격차가 「월」에서 「일」로 줄었다는 환호. 2.8T는 거의 아무도 로컬에서 돌릴 수 없다는 농담. 실무파는 K3의 매력은 저가 + 적은 거부이며 「Fable 5 격파」가 아니라고 봄. 7월 27일 가중치 공개 전에는 아키텍처와 점수를 외부에서 독립 검증할 수 없음.

날짜이벤트
2026-02Anthropic, 월지암면/DeepSeek/MiniMax 「산업급 증류 공격」 최초 공개 지적(340만+ 비정상 상호작용)
2026-07-01Claude Fable 5 일반 공개
2026-07-16Kimi K3 API/제품 정식 출시(2.8T, 전체 가중치 7/27 대기)
2026-07-22/23백악관 OSTP 국장 Kratsios, 증류 + 불법 칩 공개 지적
2026-07-23TechCrunch, 전문가의 증류 타임라인 회의 보도
2026-07-24Claude Opus 5 출시; Greenblatt 「K3 Claude 자칭」 통계 공개
2026-07-27(예정)Kimi K3 전체 가중치 OSS 공개, 외부 독립 검증 가능

Claude Opus 5 vs Kimi K3: 이번 주 이슈 이후 빠른 의사결정 매트릭스

선정 차원Claude Opus 5 쪽Kimi K3 쪽(7/27 검증 대기)
컴플라이언스 / 데이터 보존기본 강제 보존 없음; Anthropic 엔터프라이즈 체인 성숙OSS 가중치 + 저가지만 증류 지적·공급망 리스크 미해소
Agent / 프로그래밍CursorBench, AutomationBench, OSWorld 공식 데이터 선행Program Bench, SWE Marathon 자체 보고 강, 외부 재현은 가중치 대기
비용Fable급 능력을 반값, $5/$25공식은 Fable 5 / GPT-5.6 Sol을 대폭 하회 포지셔닝
심사 / 거부최강 정렬 세대, 이중 용도는 제한커뮤니티는 「적은 거부」가 실제 매력 중 하나로 평가
검증 가능성전면 이용 가능(API / Bedrock / Vertex 등)7/27 전에는 아키텍처·점수 독립 검증 불가

6단계 Runbook: 이번 주 두 대형 이슈 이후 선정 및 Agent 배포

  1. 시나리오 우선순위 명확화: Agent 프로그래밍, 자동화, 컴플라이언스 보존이 핵심이면 Opus 5 우선 평가(프로그래밍 어시스턴트 선정 매트릭스 조합 스택 참고). 극한 비용 + OSS 제어는 7/27 이후 K3 재테스트.
  2. 데이터 보존·컴플라이언스 조항 확인: 엔터프라이즈에서 Opus 5(기본 강제 보존 없음)와 Fable 5 / Mythos 5(30일 보존 opt-in) 비교. 국경·정부 프로젝트는 법무 검토 별도 수행.
  3. Effort 단계로 비용 탐색: Opus 5 Thinking 기본 ON——CursorBench류 태스크는 high/max로 품질 측정 후, 낮은 effort로 Zapier류 자동화가 기준 충족하는지 확인해 token 낭비 방지.
  4. K3는 「증거 계층화」 유지: 정치 지적(백악관) → 타임라인 반박(전문가) → 기술 간접 증거(Greenblatt) 3층 기록. 7/27 가중치 공개 후 identity prompt·benchmark 재현.
  5. 멀티 모델 Gateway 구성: 전용 노드에 OpenClaw 또는 Kimi Code + OpenRouter 라우팅 배포, 노트북 수면으로 장세션 중단 방지. API Key와 provider fallback은 환경별 분리.
  6. 7/27 이후 추적 검증: 가중치 공개 후 GPQA-Diamond, BrowseComp, 「당신은 누구입니까」 identity 테스트 비교, 내부 모델 라우팅표 갱신, 의사결정 근거 아카이브.

기술 검토에 적어야 할 3가지 단단한 데이터

  • Opus 5 / Fable 5 가성비 가위차: CursorBench 3.2 max effort 피크 차 0.5%, token 단가는 Fable 5의 약 50%($5/$25 vs 약 $10/$50 per 1M)——Anthropic이 「반값으로 플래그십에 근접」으로 시장 가성비 요구에 직접 응답.
  • ARC-AGI 3 3배 gap: Opus 5는 「못 본 새 문제」 평가에서 차점의 3배. OSWorld 2.0은 Fable 비용 <1/3로 Fable 최고 초과——Agent 일반화와 컴퓨터 조작이 이번 출시 최고의 정량 신호.
  • K3 ID 혼동 통계: Greenblatt 교차 엔트로피 분석에서 K3가 「당신은 누구」 질문에 Claude 내부 배포 ID를 비정상적으로 높은 빈도로 출력(claude-opus-4-5-20250929 등). 버전은 Fable/Mythos가 아닌 Claude 4.5 세대에 고정——증류 논란에서 지금까지 가장 기술 함량이 높고 경쟁이 적은 각도(Why does Kimi K3 say it's Claude).

둘을 나란히 보면: 주전장은 가성비

Opus 5는 「반값으로 플래그십에 근접」으로 시장 가성비 요구에 응답하고, Kimi K3는 「OSS + 저가 + 적은 제한」으로 시장을 충격합니다. K3를 둘러싼 논란의 본질은, 각사가 가성비 전쟁에서 「당신의 저가는 기술 최적화인가, 타사 모델 무단 이용인가」를 공개적으로 묻는 것입니다.

일반 개발자와 기업에게: 먼저 시나리오, 다음 입장. 컴플라이언스, 데이터 보존, 공급망 민감 → Opus 5 가성비 매우 높음. 극한 비용과 OSS 제어 → 7/27 가중치 공개 후 K3 실측.

로컬 노트북에서 Opus 5 / K3 / 멀티 provider Gateway를 전환하면, 덮개·수면, 네트워크 지터, 키 분산이 3대 숨은 비용——장세션 Agent와 자동화 태스크에는 전용 7×24 온라인 노드가 필요합니다. MACCOME Mac 클라우드 호스트는 실제 macOS, SSH 인수, 환경 분리를 제공하여 Claude Code, OpenClaw, 멀티 모델 라우팅을 전용 인스턴스에서 안정 운영합니다. 플랜과 요금은 Mac mini 클라우드 대여 가격을 참고하십시오.

데이터 출처: Anthropic 공식 출시(anthropic.com/news/claude-opus-5), Moonshot/Kimi 기술 블로그, TechCrunch, Ryan Greenblatt GitHub(rgreenblatt/which_claude_is_k3), CNBC / The Verge. 벤치마크는 각사 자체 보고 또는 제3자 통계, 2026년 7월 25일 기준.

자주 묻는 질문

Claude Opus 5는 Claude Fable 5보다 얼마나 저렴합니까?

동일 token 단가 비교에서 Opus 5는 Fable 5의 약 절반입니다(Fable 5 약 $10/$50 per 100만 입력/출력 token, Opus 5는 $5/$25 유지). CursorBench 3.2 피크는 Fable 5와 1% 미만 차이입니다.

Claude Opus 5는 현재 Claude Max 기본 모델입니까?

예. 2026년 7월 24일 출시 당일부터 Opus 5가 Claude Max 기본 모델이 되었으며, Claude Pro 사용자가 이용할 수 있는 최강 버전입니다.

Kimi K3가 정말 Claude를 증류했습니까?

본문 게시 시점 기준 논란 중이며 최종 확정되지 않았습니다. 백악관 지적에는 공개 증거가 없습니다. 독립 전문가들은 2주 내 깊은 증류는 비현실적이라고 지적합니다. Ryan Greenblatt가 발견한 「K3 Claude 자칭·내부 버전 유출」이 현재 가장 기술 함량 높은 간접 증거입니다. 상세는 Kimi K3 심층 리뷰를 참고하십시오.

Kimi K3 전체 가중치는 언제 다운로드할 수 있습니까?

공식은 2026년 7월 27일을 약속. 본문 게시 시점에는 미공개이며, 외부 연구자는 아키텍처와 점수를 완전 독립 검증할 수 없습니다.

왜 Kimi K3는 Claude라고 자칭합니까?

Greenblatt 통계 분석에서 K3가 ID 질문에 Claude 및 내부 배포 ID(claude-opus-4-5-20250929 등)를 비정상적으로 높은 빈도로 출력하며, 진짜 Claude보다 정확합니다——배포 메타데이터가 붙은 Claude 샘플 혼입 가능성을 시사하지만, 증류의 단독 증명은 아닙니다. 데이터 오염·프롬프트 유출 가능성도 있습니다.

프로덕션에서 Opus 5 / K3 혼합 Agent를 7×24 운영하려면?

전용 Mac 클라우드 호스트에 Gateway와 멀티 provider 라우팅을 배포하여 노트북 수면 중단을 피하는 것을 권장합니다. MACCOME Mac 클라우드 대여 플랜에서 노드 구성과 요금을 확인하십시오.