<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>大模型 · AI Times</title><link>https://blog.havenice.day/tag/%E5%A4%A7%E6%A8%A1%E5%9E%8B/</link><description>AI 时代，中年人倔强的记录</description><language>zh-CN</language><lastBuildDate>Tue, 28 Jul 2026 10:54:34 +0800</lastBuildDate><atom:link href="https://blog.havenice.day/tag/%E5%A4%A7%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>47 页 Kimi K3 技术报告，讲给普通开发者听：2.8T 开源巨兽的“偷懒”艺术</title><link>https://blog.havenice.day/2026/07/28/47-ye-kimik3-ji-shu-bao-gao-jiang-gei-pu-tong-kai-fa-zhe/</link><pubDate>Tue, 28 Jul 2026 10:54:34 +0800</pubDate><guid>https://blog.havenice.day/2026/07/28/47-ye-kimik3-ji-shu-bao-gao-jiang-gei-pu-tong-kai-fa-zhe/</guid><description>&lt;p&gt;**30 秒版本：**Kimi K3 是 Moonshot 最新开源的旗舰模型——&lt;strong&gt;2.8 万亿参数的 MoE，每个 token 只激活 1040 亿（约 1/27），原生视觉，100 万 token 上下文&lt;/strong&gt;。定位一句话：能力咬住闭源前两名（Claude Fable 5、GPT-5.6 Sol），稳坐开源第一，成本却只有对手的几分之一。本文把 47 页技术报告拆成三个灵魂问题：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;2.8T 的大家伙，怎么训得起、推得动？&lt;/strong&gt; → 架构”三板斧”&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;100 万 token 上下文，怎么不让显存爆炸？&lt;/strong&gt; → 换一种”记忆方式”&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;base 模型怎么练成能干活的 agent？&lt;/strong&gt; → RL + 九专家蒸馏&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;h2 id="先看全景架构就三句话"&gt;先看全景：架构就三句话&lt;/h2&gt;&#10;&lt;p&gt;MoonViT-V2&#10;0.4B 视觉编码器&lt;/p&gt;&#10;&lt;p&gt;Embedding&#10;共享嵌入空间&lt;/p&gt;&#10;&lt;p&gt;Block ×8：93 层切成 8 块&#10;token 混合：3 KDA : 1 MLA&lt;/p&gt;&#10;&lt;p&gt;KDA&lt;/p&gt;&#10;&lt;p&gt;KDA&lt;/p&gt;&#10;&lt;p&gt;KDA&lt;/p&gt;&#10;&lt;p&gt;MLA&lt;/p&gt;&#10;&lt;p&gt;MoE&lt;/p&gt;&#10;&lt;p&gt;MoE&lt;/p&gt;&#10;&lt;p&gt;MoE&lt;/p&gt;&#10;&lt;p&gt;MoE&#10;每层 attention 后都跟一个 LatentMoE&#10;896 选 16 · 压到 3584 维 latent 空间&lt;/p&gt;&#10;&lt;p&gt;AttnRes：深度方向的”查档”机制&#10;每层带 query 检索 embedding + 所有前序 Block 的输出&lt;/p&gt;&#10;&lt;p&gt;输出&#10;循环 ×8&lt;/p&gt;&#10;&lt;p&gt;三句话概括整个架构：&lt;strong&gt;token 维度&lt;/strong&gt;靠 3 层 KDA + 1 层 MLA 混搭，&lt;strong&gt;深度维度&lt;/strong&gt;靠 AttnRes 跨层查档，&lt;strong&gt;宽度维度&lt;/strong&gt;靠 LatentMoE 稀疏调用专家。先感受一下 K2 → K3 的体格变化：&lt;/p&gt;&#10;&lt;table&gt;&#10;&lt;tr&gt;&#10;&lt;th&gt;&lt;/th&gt;&#10;&lt;th&gt;Kimi K2&lt;/th&gt;&#10;&lt;th&gt;Kimi K3&lt;/th&gt;&#10;&lt;th&gt;变化&lt;/th&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;总参数 / 激活参数&lt;/td&gt;&#10;&lt;td&gt;1.04T / 32.6B&lt;/td&gt;&#10;&lt;td&gt;2.78T / 104.2B&lt;/td&gt;&#10;&lt;td&gt;×2.7 / ×3.2&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;层数&lt;/td&gt;&#10;&lt;td&gt;61&lt;/td&gt;&#10;&lt;td&gt;93&lt;/td&gt;&#10;&lt;td&gt;+52%&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;专家数（每 token 激活）&lt;/td&gt;&#10;&lt;td&gt;384（8）&lt;/td&gt;&#10;&lt;td&gt;896（16）&lt;/td&gt;&#10;&lt;td&gt;稀疏度 56&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;训练上下文&lt;/td&gt;&#10;&lt;td&gt;128K&lt;/td&gt;&#10;&lt;td&gt;1M&lt;/td&gt;&#10;&lt;td&gt;×8&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;注意力&lt;/td&gt;&#10;&lt;td&gt;全 MLA&lt;/td&gt;&#10;&lt;td&gt;69 KDA + 24 MLA&lt;/td&gt;&#10;&lt;td&gt;混合架构&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;综合 Scaling 效率&lt;/td&gt;&#10;&lt;td&gt;基准&lt;/td&gt;&#10;&lt;td&gt;&lt;strong&gt;2.5×&lt;/strong&gt;&lt;/td&gt;&#10;&lt;td&gt;同等 loss 省 60% 算力&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;/table&gt;&#10;&lt;h2 id="第一板斧kda--把无限增长的会议记录换成固定大小的笔记本"&gt;第一板斧：KDA —— 把”无限增长的会议记录”换成”固定大小的笔记本”&lt;/h2&gt;&#10;&lt;p&gt;传统 attention 的痛点：每来一个 token，都要和之前&lt;strong&gt;所有&lt;/strong&gt; token 重新算一遍关系，KV cache 无限变长——像开一场永不散会的会，每页发言记录都要永久存档。KDA（Kimi Delta Attention）是线性注意力的一种：不管序列多长，只维护一个&lt;strong&gt;固定大小的笔记本 S&lt;/strong&gt;，成本 O(n)、缓存恒定。&lt;/p&gt;&#10;&lt;p&gt;全量注意力（如 MLA）&#10;每来 1 个 token，记录 +1 页&#10;KV cache&lt;/p&gt;&#10;&lt;p&gt;成本 O(n²) · 缓存无限涨&lt;/p&gt;&#10;&lt;p&gt;KDA（线性注意力）&#10;每来 1 个 token，只更新笔记本 S&lt;/p&gt;&#10;&lt;p&gt;① 褪色 α：旧笔记按通道变淡&#10;② 擦除：先精准擦掉旧值&#10;③ 写入 β：新内容按强度落笔&#10;成本 O(n) · 缓存固定&lt;/p&gt;&#10;&lt;p&gt;K3 的折中：3 层 KDA + 1 层 MLA&#10;75% 的层记笔记本（便宜），25% 开全员大会（保全局）&lt;/p&gt;&#10;&lt;p&gt;笔记本每来一个 token 做三个动作：&lt;strong&gt;褪色&lt;/strong&gt;（forget gate α 让每个通道的旧笔记按各自速度变淡）、&lt;strong&gt;擦除&lt;/strong&gt;（delta rule——写入前先把旧值精准擦掉，这是它和普通线性注意力的关键区别，防止内容越叠越糊）、&lt;strong&gt;写入&lt;/strong&gt;（新内容按强度 β 落笔）。&lt;/p&gt;&#10;&lt;p&gt;报告里我最喜欢的一个工程细节：数学上”1/累计衰减”会指数级膨胀，BF16 装不下就溢出。K3 的解法是给褪色速度设个下限（用 sigmoid 把 log-decay 压进 (-5, 0)），16 个 token 的累计衰减倒数最大 e⁸⁰，刚好卡在 BF16 动态范围内——&lt;strong&gt;一个数值稳定性的小改动，让整条计算路径都能跑满 Tensor Core，直接消灭了最慢的 kernel 分支&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;两个配套设计也值得记住：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;3:1 混搭&lt;/strong&gt;：光靠笔记本会丢全局细节，所以每 4 层插 1 层 Gated MLA 全量注意力”开全员大会”&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;NoPE（无位置编码）&lt;/strong&gt;：不显式存”第几个位置”，靠笔记本的衰减自然感知远近。上下文从 8K 一路扩到 1M &lt;strong&gt;完全不用改位置编码&lt;/strong&gt;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="第二板斧attnres--把-attention-的思想搬到深度方向"&gt;第二板斧：AttnRes —— 把 attention 的思想搬到”深度”方向&lt;/h2&gt;&#10;&lt;p&gt;普通残差连接像传话游戏：第 93 层只能拿到第 92 层传过来的话，前面 91 层的细节全被压扁在一个向量里。AttnRes 的思路很直接：&lt;strong&gt;每层带一个可学习的”查询词”，主动去检索 embedding 和所有前序 Block 的输出&lt;/strong&gt;，想要谁的信息就拿谁的。93 层切成 8 个 Block，块内先求和压缩、块间再做检索，开销可忽略，实验上 N=8 就能拿回大部分收益。&lt;/p&gt;&#10;&lt;h2 id="第三板斧latentmoe--896-个专家的分诊艺术"&gt;第三板斧：LatentMoE —— 896 个专家的分诊艺术&lt;/h2&gt;&#10;&lt;p&gt;token&#10;7168 维&lt;/p&gt;&#10;&lt;p&gt;W↓ 压缩&#10;7168→3584&lt;/p&gt;&#10;&lt;p&gt;Router 分诊台&#10;QB 负载均衡&#10;偏置 b 只调分诊、不改权重&lt;/p&gt;&#10;&lt;p&gt;896 个 routed 专家&#10;每个 token 只激活其中 16 个&lt;/p&gt;&#10;&lt;p&gt;专家在 3584 维 latent 空间工作&#10;通信、显存都按”简报”大小算&lt;/p&gt;&#10;&lt;p&gt;汇总 → RMSNorm → W↑&#10;投影回 7168 维，与 shared 相加&lt;/p&gt;&#10;&lt;p&gt;2 个 shared 专家（全科）&#10;全宽度直接处理每个 token&#10;896 选 16 = 稀疏度 56：只花 1/56 的算力，享受 56 倍的专家容量&lt;/p&gt;&#10;&lt;p&gt;MoE 的核心矛盾：专家越多知识容量越大，但每个被选中的专家都要收一份 7168 维的完整 token 表示，通信和显存跟着爆炸。K3 的三连解法：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;先压缩再送诊&lt;/strong&gt;：token 先被 W↓ 压成 3584 维”简报”，专家们在简报空间里干活。于是专家数翻倍（384→896）、激活数翻倍（8→16），通信量却没涨&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;SiTU-GLU 激活函数&lt;/strong&gt;：SwiGLU 的两个相乘因子都无界，2.8T 尺度下会数值爆炸。SiTU-GLU 给两个分支都装上 tanh”限高杆”（输出硬上限 100），原点附近和 SwiGLU 一阶等价——形状不变，永远不失控&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;QB 分位数均衡&lt;/strong&gt;：传统 MoE 靠辅助损失逼负载均衡（伤性能），K3 改成给每个专家加一个”排班偏置 b”——b 只影响谁被选中、不进梯度、不改权重。每步训练后按分位数调：太火的专家降分、冷门的加分，直到每个专家接待量精确达标。工程上用直方图估分位数，一次 all-reduce 只传几百个 bin，几乎免费&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;h2 id="后训练先分头练出-9-个专家再蒸馏回一个模型"&gt;后训练：先分头练出 9 个专家，再蒸馏回一个模型&lt;/h2&gt;&#10;&lt;p&gt;① SFT 冷启动&#10;打基础 agent 能力&#10;XTML 统一模板&#10;全程量化感知&lt;/p&gt;&#10;&lt;p&gt;② RL 练专项专家&#10;3 领域 × 3 思考档&#10;= 9 个专家模型&#10;超预算奖励 -1&lt;/p&gt;&#10;&lt;p&gt;③ MOPD 蒸馏&#10;9 个老师教 1 个学生&#10;逐 token 打分&#10;合成统一模型&lt;/p&gt;&#10;&lt;p&gt;④ 一个 K3&#10;low/high/max 三档&#10;MXFP4 低精度部署&#10;草稿模型加速解码&lt;/p&gt;&#10;&lt;p&gt;reasoning effort = 给模型发”思考预算”&#10;先训 max 档（预算宽），再退火出 high / low 档 —— 让模型学会该想想、该省省&lt;/p&gt;&#10;&lt;p&gt;后训练里几个有意思的细节：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;思考预算控制&lt;/strong&gt;：每题先发预算 b₀(x)，输出超 τ·b₀ 直接奖励 -1。先训 max 档，再退火出 high/low 档——模型自己学会”简单题别过度思考”&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;防话痨&lt;/strong&gt;：GRM 打分时回答长度超 σ·ℓ₀ 直接判负，专治 reward hacking 的啰嗦倾向&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;训练任务够野&lt;/strong&gt;：知识图谱自动扩展出题、mock 版 Gmail/Notion/Slack 练”连续工作好几天”的助理任务、GPU kernel 优化（奖励=正确性+逼近 roofline 程度，还配反作弊系统）、黑盒系统复刻等&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="基建28t-不是堆卡就行的"&gt;基建：2.8T 不是堆卡就行的&lt;/h2&gt;&#10;&lt;table&gt;&#10;&lt;tr&gt;&#10;&lt;th&gt;工程难题&lt;/th&gt;&#10;&lt;th&gt;K3 的解法&lt;/th&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;KDA 递归本质是串行，GPU 不喜欢&lt;/td&gt;&#10;&lt;td&gt;FlashKDA kernel：chunk 内并行、chunk 间流水重叠&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;1M 上下文并行训练&lt;/td&gt;&#10;&lt;td&gt;KCP：把每段的状态转移分解成可本地计算的两部分，一次 all-gather 搞定——线性 attention 的通信量&lt;strong&gt;与序列长度无关&lt;/strong&gt;&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;专家并行负载不均、显存碎片&lt;/td&gt;&#10;&lt;td&gt;MoonEP：每个 rank 精确收 S×K 个 token，冗余专家 ≤ E/R（有数学证明），shape 全静态免同步&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;1M agentic RL 的 KV cache 存不下&lt;/td&gt;&#10;&lt;td&gt;外部 KV 池：GPU 逐出的前缀写回 CPU DRAM，KDA state 与 MLA KV 生命周期对齐&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;agent 把容器沙箱搞到内核 panic&lt;/td&gt;&#10;&lt;td&gt;AgentENV：Firecracker microVM，支持暂停/分叉/快照（checkpoint 133ms）；整个训练共创建 &lt;strong&gt;5122 万个沙箱、150 万个镜像&lt;/strong&gt;&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;1M token 长请求挤死 2K 短请求&lt;/td&gt;&#10;&lt;td&gt;预算制准入控制：长短请求各有独立资源池，互不饿死&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;/table&gt;&#10;&lt;h2 id="成绩单报告官方数据截至-2026-07-23"&gt;成绩单（报告官方数据，截至 2026-07-23）&lt;/h2&gt;&#10;&lt;table&gt;&#10;&lt;tr&gt;&#10;&lt;th&gt;维度&lt;/th&gt;&#10;&lt;th&gt;表现&lt;/th&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;编程&lt;/td&gt;&#10;&lt;td&gt;SWE-Marathon 第一（42.0%，领先 Fable 5 七分）；Terminal-Bench 88.3% 几乎平 GPT-5.6 Sol；&lt;strong&gt;WebDev Arena 总榜第一&lt;/strong&gt;（1678 Elo，首个登顶的开源模型）&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;Agent&lt;/td&gt;&#10;&lt;td&gt;BrowseComp 91.2% 全场第一；MCPMark 94.5% 第一；GDPval-AA 第三（前二为 Fable 5、GPT-5.6 Sol）&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;知识推理&lt;/td&gt;&#10;&lt;td&gt;GPQA 93.5%；但 HLE、CritPt 等研究级任务仍落后前两名——报告自己承认这是短板&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;视觉&lt;/td&gt;&#10;&lt;td&gt;OmniDocBench 91.1% 第一；ZeroBench 平 Fable 5&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;成本&lt;/td&gt;&#10;&lt;td&gt;BrowseComp 每题 $2.03，是 GPT-5.6 Sol 的一半、Claude 系的约 1/10；KCB 2.0 用 Fable 5 约 38% 的成本拿到只差 4 分的成绩&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;Case study 里最夸张的三个：24 小时内把 4 个 GPU kernel 优化到匹配 Fable 5 的水平；独立写出一个能端到端训 GPT 的 Triton 类编译器 MiniTriton（matmul 达 cuBLAS 约 90%）；48 小时用开源 EDA 链设计了颗 INT4 推理芯片（RTL 仿真 8700 tokens/s）。&lt;/p&gt;&#10;&lt;h2 id="普通开发者能带走什么"&gt;普通开发者能带走什么&lt;/h2&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;“混合”打败”纯粹”&lt;/strong&gt;：75% 便宜层 + 25% 贵层 ≈ 全贵层。缓存/数据库/索引的分层设计是同一个道理&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;数值稳定性就是性能&lt;/strong&gt;：一个 sigmoid 下限换来整条 kernel 路径上 Tensor Core，边界条件别小看&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;负载均衡可以”调偏置”而不是”加惩罚”&lt;/strong&gt;：不改目标函数、只调准入门槛——任何调度系统都好使&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;agent 能力 ≈ 环境复杂度&lt;/strong&gt;：K3 的 agent 能力是 5122 万个沙箱喂出来的。你的 agent 产品能练多狠，取决于你能造多真的演练场&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;成本拐点&lt;/strong&gt;：开源权重的 K3 把前沿 agent 能力打到闭源旗舰 1/3~1/10 的价格，自部署的经济账越来越好算了&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;一句话总结：&lt;strong&gt;K3 没有发明新科学，但它把线性注意力、MoE、RL、系统工程四条线的工程组合做到了开源世界的天花板&lt;/strong&gt;——然后用 2.5× 的训练效率和 1/10 的推理成本告诉你：前沿智能的入场券正在变便宜。&lt;/p&gt;&#10;&lt;p&gt;本文为 Moonshot《Kimi K3: Open Frontier Intelligence》技术报告（2026 年 7 月，47 页）的个人解读，数据均引自报告原文，跑分以官方口径为准。&lt;/p&gt;&#10;</description></item></channel></rss>