Kimi K3 요약
한 줄 요약
•
Moonshot의 2.8T 공개 모델. 코딩·에이전트는 최상위권, UX는 Fable 5 / GPT 5.6 Sol보다 아래.
•
로컬은 사실상 불가. H200 기준 가중치만 약 11–12장, 실서비스는 64장 이상.
•
LoRA는 지금 불가. 가중치 공개(7/27) 후에도 MXFP4+MoE 때문에 쉽지 않음.
스펙
•
총 파라미터 2.8T, MoE 896 중 16개 활성, 컨텍스트 1M, 네이티브 비전
•
구조: KDA + AttnRes + Stable LatentMoE
•
정밀도: MXFP4 가중치 / MXFP8 활성값 (SFT부터 QAT)
•
K2 대비 스케일링 효율 약 2.5배
•
API: kimi-k3 / 입력 hit $0.30, miss $3.00, 출력 $15.00 (MTok)
•
가중치·기술보고서: 2026-07-27까지 공개 예정
성능
•
강점: Program Bench, SWE Marathon, BrowseComp, Automation, OmniDocBench 등에서 선두·동급
•
Terminal Bench 88.3 (GPT 5.6 Sol 88.8에 근접), GPQA 93.5
•
약점: HLE, FrontierSWE, 대화 UX는 폐쇄형 선두에 못 미침
•
커널 최적화 에이전트 평가에서는 Fable 5와 경쟁, Opus/GPT 계열보다 전반적으로 높음(공식)
•
주의: 사고 기록 누락·모델 전환에 민감, 모호한 상황에서 과도하게 선제 행동
H200 로컬 구동
•
가중치 용량: 약 1.4–1.5 TB (MXFP4 산술)
•
H200 1장 = 141 GB
•
이론적 적재 하한: 약 11–12장 (가중치만, KV·통신 제외)
•
공식 권고: 64개 이상 accelerator supernode
•
8× H200(≈1.13 TB)도 가중치 부족 → 집·소규모 랩은 API 사용이 현실적
LoRA / PEFT
•
현재: 가중치 미공개 → 불가
•
공개 후에도: 네이티브 MXFP4 + 초희소 MoE + 커스텀 블록 때문에 표준 QLoRA는 비권장
•
유력 경로: attention-only LoRA, 또는 LoRA-QAT
•
PEFT라도 베이스 적재에 클러스터급 VRAM 필요
•
이용
•
kimi.com, Kimi Work(≥3.1.0), Kimi Code, API
•
reasoning_effort=max만 지원(출시 시점). 멀티턴 시 assistant 메시지(사고 포함) 전체 전달
염려되는점
•
보안에 강점인 fable이나, sol 같은 모델들은 자체적인 lock이 있어서 악용되기 어려우나, kimi3는 그러한 점에서 열려있다는 것이 심각
출처
안녕하세요
•
관련 기술 문의와 R&D 공동 연구 사업 관련 문의는 “glory@keti.re.kr”로 연락 부탁드립니다.
Hello 
•
For technical and business inquiries, please contact me at “glory@keti.re.kr”
