LLM2026· Technical Report · 2026本周新增

Kimi K3: Open Frontier Intelligence

Kimi Team (Moonshot AI)

Moonshot 开源的 2.8T MoE 前沿模型:混合「线性 + 全局」注意力(KDA + Gated MLA)配 Stable LatentMoE,原生多模态、100 万 token 上下文,相对 Kimi K2 约 2.5× 扩展效率——首个可公开下载的 3 万亿参数级模型之一。

arXiv
#MoE#linear-attention#agentic#long-context#open-weights#frontier-model#multimodal

核心贡献

  • 012.8T 参数 MoE,每 token 仅激活 104B(896 个路由专家里选 16 + 2 个共享专家)
  • 02混合注意力:每个 block = 3 层 Kimi Delta Attention(KDA,线性注意力)+ 1 层 Gated MLA(全局注意力),共 69 KDA + 24 Gated MLA = 93 层;配 Attention Residuals(AttnRes)打通跨深度信息流
  • 03Stable LatentMoE + Muon 优化器 + 精炼数据/训练配方 → 相对 Kimi K2 约 2.5× 的整体扩展效率
  • 04原生多模态:MoonViT-V2 视觉编码器(401M),1M token 上下文,词表 160K,注意力隐藏维 7168 / 96 头
  • 05从 SFT 阶段起做量化感知训练(QAT):MXFP4 权重 + MXFP8 激活,兼容多种硬件
  • 06跨「通用推理与知识 / Agent / 编码」三大域、多个 reasoning-effort 档位的强化学习;百万 token 级 agentic RL(持久 rollout + sandbox 状态)
  • 07全量开源权重(HuggingFace: moonshotai/Kimi-K3);BrowseComp 91.2、GPQA-Diamond 93.5、Terminal-Bench 2.1 88.3、SWE-Marathon 42.0、ProgramBench 77.8 等多项开源领先

一句话

K3 把三件事拧到一起做成 2.8T 的开源前沿模型:更强的注意力信息流(KDA + AttnRes)、更高效的稀疏 MoE(Stable LatentMoE)、大规模 agentic RL。目标是在长程编码 / Agent / 知识 / 推理 / 视觉上做开源第一、逼近闭源顶尖——报告坦承整体仍落后 Claude Fable 5 与 GPT-5.6 Sol,但在其评测套件里稳定优于其他开源与部分闭源模型。

架构:混合注意力 + Stable LatentMoE

K3 用逐层混合的注意力,而不是清一色全局注意力:

  • KDA(Kimi Delta Attention):线性注意力(delta-rule 家族),沿序列做 token mixing,复杂度近线性——这是把上下文拉到 1M 还能算得动的关键。
  • Gated MLA:带门控的全局潜在注意力,保留完整的全序列交互能力。
  • 比例 3:1:每个 block 三层 KDA + 一层 Gated MLA(全网 69 KDA + 24 Gated MLA)。大多数层走便宜的线性注意力,周期性插入全局层补足表达力——成本与长程建模的折中
  • Attention Residuals(AttnRes):改善跨深度的信息流(KDA 管跨 token,AttnRes 管跨层)。
  • Stable LatentMoE:896 路由专家 + 2 共享专家,每 token 激活 16 个(104B)。共享专家承接通用能力,路由专家做专精,稀疏激活让 2.8T 总量的推理开销压到 104B。

这套「token 混合(KDA)+ 层混合(AttnRes)+ 通道混合(MoE)」的组合,加上 Muon 优化器与数据配方,带来相对 K2 约 2.5× 的扩展效率

训练与后训练

  • 优化器:Muon(§2.5,延续 K2 的 Muon 路线)。
  • 量化感知训练(QAT):从 SFT 阶段起就用 MXFP4 权重 + MXFP8 激活训练,让低精度部署不掉点、覆盖更多硬件。
  • RL 而非堆专用模型:不为每个任务单独训 RL 模型,而是把 RL 扩到三大域(通用推理与知识、Agent、编码),每个域、每个 reasoning-effort 档位训一个专家,换来组合泛化与稳健的长程执行。
  • 训练环境:可验证搜索与专业知识工作、软件工程与 kernel 优化、视觉在环(vision-in-the-loop)的多模态工具使用、持久助理工作流、Web 开发等。

基础设施(2.8T 规模的工程)

  • KDA 的算法-系统协同设计
  • 完美均衡的专家并行训练 + 高效显存管理;
  • 百万 token 级 agentic RL,带持久 rollout 与 sandbox 状态(长程 Agent 训练的关键)。
面试视角

面试考点

为什么用「线性 + 全局」混合注意力,而不是全 full-attention? full-attention 是 O(n²),1M 上下文根本算不起。KDA 是线性注意力,负责大多数层的廉价 token mixing;每 4 层插 1 层 Gated MLA 全局注意力补回表达力。3:1 的比例就是「长上下文可行性 ↔ 建模能力」的工程折中。能讲清 KDA(跨 token)与 AttnRes(跨层)分工是加分项。

MoE 的稀疏性怎么算账? 2.8T 总参数,但每 token 只激活 16/896 路由专家 + 2 共享专家 = 104B。所以「训练/存储按 2.8T、推理算力按 104B」。共享专家兜底通用能力、路由专家做专精,是现代大 MoE 的常见配方。

QAT 从 SFT 就开始有什么好处? 训练时就让模型适应 MXFP4/MXFP8 低精度,避免「训练全精度、部署量化」带来的掉点;同时 MXFP4 权重大幅降低显存与带宽,利于在更广硬件上部署 2.8T 模型。

agentic RL 的规模化思路? 不为每个任务训专用模型,而是按域(通用/Agent/编码)× reasoning-effort 档位训「单专家」,靠组合泛化覆盖大量子任务;配百万 token 持久 rollout + sandbox,才能训出长程工具使用与稳健执行。

定位与意义? 报告自陈整体仍落后 Claude Fable 5、GPT-5.6 Sol,但在多数长程编码/Agent 榜(BrowseComp、SWE-Marathon、Terminal-Bench、ProgramBench)领先其他开源甚至部分闭源模型,且全量开源权重——这是它最大的价值:把接近前沿的能力开放给社区自部署。

和 K2 的关系? K2("Open Agentic Intelligence",1.04T MoE / 32B 激活,15.5T token 预训练)主打 Agent;K3("Open Frontier Intelligence",2.8T / 104B 激活)在其上加原生视觉、1M 上下文、混合注意力与 QAT,扩展效率 ~2.5×。

相关论文