Search

260719_1917_Kimi K3 공개

Kimi K3 요약

한 줄 요약

Moonshot의 2.8T 공개 모델. 코딩·에이전트는 최상위권, UX는 Fable 5 / GPT 5.6 Sol보다 아래.
로컬은 사실상 불가. H200 기준 가중치만 약 11–12장, 실서비스는 64장 이상.
LoRA는 지금 불가. 가중치 공개(7/27) 후에도 MXFP4+MoE 때문에 쉽지 않음.

스펙

총 파라미터 2.8T, MoE 896 중 16개 활성, 컨텍스트 1M, 네이티브 비전
구조: KDA + AttnRes + Stable LatentMoE
정밀도: MXFP4 가중치 / MXFP8 활성값 (SFT부터 QAT)
K2 대비 스케일링 효율 약 2.5배
API: kimi-k3 / 입력 hit $0.30, miss $3.00, 출력 $15.00 (MTok)
가중치·기술보고서: 2026-07-27까지 공개 예정

성능

강점: Program Bench, SWE Marathon, BrowseComp, Automation, OmniDocBench 등에서 선두·동급
Terminal Bench 88.3 (GPT 5.6 Sol 88.8에 근접), GPQA 93.5
약점: HLE, FrontierSWE, 대화 UX는 폐쇄형 선두에 못 미침
커널 최적화 에이전트 평가에서는 Fable 5와 경쟁, Opus/GPT 계열보다 전반적으로 높음(공식)
주의: 사고 기록 누락·모델 전환에 민감, 모호한 상황에서 과도하게 선제 행동

H200 로컬 구동

가중치 용량: 약 1.4–1.5 TB (MXFP4 산술)
H200 1장 = 141 GB
이론적 적재 하한: 약 11–12장 (가중치만, KV·통신 제외)
공식 권고: 64개 이상 accelerator supernode
8× H200(≈1.13 TB)도 가중치 부족 → 집·소규모 랩은 API 사용이 현실적

LoRA / PEFT

현재: 가중치 미공개 → 불가
공개 후에도: 네이티브 MXFP4 + 초희소 MoE + 커스텀 블록 때문에 표준 QLoRA는 비권장
유력 경로: attention-only LoRA, 또는 LoRA-QAT
PEFT라도 베이스 적재에 클러스터급 VRAM 필요
당분간 ROI: API + 프롬프트 / AGENTS.md / 에이전트 하네스

이용

kimi.com, Kimi Work(≥3.1.0), Kimi Code, API
reasoning_effort=max만 지원(출시 시점). 멀티턴 시 assistant 메시지(사고 포함) 전체 전달

염려되는점

보안에 강점인 fable이나, sol 같은 모델들은 자체적인 lock이 있어서 악용되기 어려우나, kimi3는 그러한 점에서 열려있다는 것이 심각

출처

안녕하세요

관련 기술 문의와 R&D 공동 연구 사업 관련 문의는 “glory@keti.re.kr”로 연락 부탁드립니다.

Hello

For technical and business inquiries, please contact me at “glory@keti.re.kr”