<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AI · AI Times</title><link>https://blog.havenice.day/tag/ai/</link><description>AI 时代，中年人倔强的记录</description><language>zh-CN</language><lastBuildDate>Wed, 19 Aug 2026 10:50:02 +0800</lastBuildDate><atom:link href="https://blog.havenice.day/tag/ai/index.xml" rel="self" type="application/rss+xml"/><item><title>从一条提醒开始：一个会自我进化的投资跟踪系统</title><link>https://blog.havenice.day/2026/08/19/cong-yi-tiao-ti-xing-kai-shi-yi-ge-hui-zi-wo-jin-hua-de-tou/</link><pubDate>Wed, 19 Aug 2026 10:50:02 +0800</pubDate><guid>https://blog.havenice.day/2026/08/19/cong-yi-tiao-ti-xing-kai-shi-yi-ge-hui-zi-wo-jin-hua-de-tou/</guid><description>&lt;h2 id="一起点一个被遗忘成本困扰的场景"&gt;一、起点：一个被遗忘成本困扰的场景&lt;/h2&gt;&#10;&lt;p&gt;故事的起点很具体。我经常看到一些宏观分析或个股研判——逻辑严密、数据翔实，当下深以为然，甚至据此做了操作。但这类判断的验证周期往往是三个月、半年。等到该复盘的那天，问题不是”忘了看”，而是&lt;strong&gt;忘了当初为什么信它&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;第一版的解法很直觉：做个微信小程序，把观点、计划、复盘日期记下来，到期提醒。一天就写完了，深色金融风，本地存储，能跑。&lt;/p&gt;&#10;&lt;p&gt;但它很快暴露了一个根本性的错误假设。&lt;/p&gt;&#10;&lt;h2 id="二转折时间不是触发器条件才是"&gt;二、转折：时间不是触发器，条件才是&lt;/h2&gt;&#10;&lt;p&gt;那天我把一份 AI 生成的《海螺水泥圆桌报告》丢进这个还很稚嫩的系统。报告写的是典型的左侧潜伏逻辑：0.48 倍 PB 的破净现金奶牛，拐点前奏已现，但确认键是”放量站回 BOLL 中轨 17.89″，作废键是”跌破 52 周低点 16.17″。&lt;/p&gt;&#10;&lt;p&gt;我对着自己的”三个月后提醒复盘”愣住了：17.89 可能第 20 天就站上，16.17 可能第 45 天就跌破——&lt;strong&gt;等到复盘日再看，机会和风险都已成历史&lt;/strong&gt;。投资场景的提醒，本质不是日历事件，而是条件事件。&lt;/p&gt;&#10;&lt;p&gt;这次认知升级凝成了一句话，后来写进了 README 的开头：&lt;strong&gt;时间是兜底，条件才是触发器；观察是节奏，复盘是闭环。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;系统随之重构。每个跟踪项从”一段文字+一个日期”变成了一组可判定的条件：确认条件（全部达成=观点被验证）、作废条件（任一触发=逻辑被证伪）、最终期限（什么都没发生时的兜底）。状态机从”跟踪中→到期→复盘”变成了真正的决策流。&lt;/p&gt;&#10;&lt;h2 id="三抽象给盯盘语言立法"&gt;三、抽象：给”盯盘语言”立法&lt;/h2&gt;&#10;&lt;p&gt;接下来的问题是：条件要如何被机器执行？&lt;/p&gt;&#10;&lt;p&gt;“站回 17.89″好办，拉个行情接口比较一下就行。但报告里还有”KDJ 极端超卖”、”主力 10/20 日流向转正”、”北向持仓变化”——有些是指标，有些是资金数据，有些根本没有公开接口。&lt;/p&gt;&#10;&lt;p&gt;我做了一个关键的产品决策：不追求全自动的乌托邦，而是给条件建立&lt;strong&gt;类型系统&lt;/strong&gt;。能量化的收敛为七种自动类型——价格、涨跌幅、量比、RSI、KDJ、BOLL、MACD，每种有明确的参数和求值器；不能量化的诚实标记为文字条件，在每周打卡时人工核对。技术实现上，RSI、MACD 这些指标并不需要买数据服务，日 K 线拉下来本地几十行代码就能算。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;手动不是缺陷，是设计&lt;/strong&gt;：打卡表单本身就是核对清单，”资金流向转正了吗？回购还在延续吗？”——系统把”该看什么”结构化地递到你面前。&lt;/p&gt;&#10;&lt;h2 id="四ai-进场从我用-ai到ai-用文档"&gt;四、AI 进场：从”我用 AI”到”AI 用文档”&lt;/h2&gt;&#10;&lt;p&gt;功能越强，录入越重。一份报告要手工拆出七八条条件，这本身就是劝退流程。解法顺理成章：AI 写的报告，让 AI 来拆——拖入报告文件，DeepSeek 直接提取出观点、计划、条件组、关键时间点，预览确认即建项。&lt;/p&gt;&#10;&lt;p&gt;但真正有意思的决定藏在实现细节里：条件的类型映射规则没有硬编码在 prompt 里，而是写成了一份独立的手册 &lt;code&gt;rules.md&lt;/code&gt;，运行时整体注入给模型。&lt;strong&gt;改文档即改 AI 行为&lt;/strong&gt;——调整规则不需要动代码，写文档就是在编程。&lt;/p&gt;&#10;&lt;h2 id="五闭环让-ai-告诉我们它缺什么"&gt;五、闭环：让 AI 告诉我们它缺什么&lt;/h2&gt;&#10;&lt;p&gt;到这里系统已经能用了，但最有意思的设计出现在下一步。&lt;/p&gt;&#10;&lt;p&gt;我意识到一个不对称：报告里的信号千奇百怪，而我的类型系统只有七种。与其等我发现新类型，不如&lt;strong&gt;让 AI 自己报告它的能力边界&lt;/strong&gt;。于是 prompt 里加了一条约定：遇到手册无法表达但理论上可量化的信号，照常降级为文字条件，同时在返回结果里附上”新类型建议”——名字、判定逻辑、报告原文依据。&lt;/p&gt;&#10;&lt;p&gt;第二天，系统就给我提了两条需求：”南向资金连续净流入”、”COMEX 商品价格阈值”。我验证数据源、实现求值器、把手册更新。又过了几天，它再提两条：”美元指数阈值”、”港股卖空比例”。再次落地。&lt;/p&gt;&#10;&lt;p&gt;闭环就此形成：&lt;strong&gt;AI 读报告 → 发现能力缺口 → 提出建议 → 人类实现并更新手册 → AI 下次自动识别&lt;/strong&gt;。规则手册、AI 提取、求值引擎三者咬合，系统开始自我进化。触发价格、KDJ、美元指数、南向持股、沽空比例——十余种参数指标联动的数据抓取，都是在这条流水线上长出来的。&lt;/p&gt;&#10;&lt;h2 id="六工程现实那些不在计划内的课"&gt;六、工程现实：那些不在计划内的课&lt;/h2&gt;&#10;&lt;p&gt;故事里不该只有架构图。一些真实的坑，恰恰是最有信息量的部分：&lt;/p&gt;&#10;&lt;p&gt;输入框曾”无法输入”——受控组件每次按键都重渲染，打断了中文输入法的组词；Electron 二进制被 macOS Gatekeeper 当成”恶意软件”——最后靠 postinstall 脚本自动清隔离属性加本地签名解决；南向资金数据同一天有上海、深圳两条通道记录，不合并就会得出荒唐的”净流入”结论；外盘期货的字段是逗号分隔而股票是波浪号——这些在真实数据验证之前，都安静地伪装成”已完成”。&lt;/p&gt;&#10;&lt;p&gt;也正是这些坑催生了最后的工程拼图：所有数据源收拢进统一的适配层，每个源带自检，&lt;code&gt;npm run check:sources&lt;/code&gt; 一键巡检全部接口，指标算法用合成数据做离线单测。&lt;strong&gt;从此接口挂了，是测试先知道，不是我先亏知道。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;h2 id="七现在它长什么样"&gt;七、现在它长什么样&lt;/h2&gt;&#10;&lt;p&gt;一个小程序已经长成了常驻 Mac 菜单栏的桌面应用。托盘图标带着待办角标；后台每 30 分钟扫一遍行情，条件命中就弹系统通知，点开直达详情；每周打卡把”该核对什么”递到手上；复盘页自动摆出当时的观点、条件触发的完整时间线、过程打卡记录，等你写下结论。&lt;/p&gt;&#10;&lt;p&gt;而最重要的资产不是代码，是那份 &lt;code&gt;rules.md&lt;/code&gt;——一部系统与自己对话用的词典。它还会变厚，因为下一次 AI 再提出新建议时，流水线的每一环都已经就位。&lt;/p&gt;&#10;&lt;h2 id="尾声三点带走的认知"&gt;尾声：三点带走的认知&lt;/h2&gt;&#10;&lt;p&gt;&lt;strong&gt;先找到真正的触发器。&lt;/strong&gt; 最初的时间提醒不是做错了一步，而是认错了问题的本质。值得警惕的永远是”直觉解”。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;诚实地区分能与不能。&lt;/strong&gt; 把可自动化的做到极致，把不能自动化的设计成优雅的人工流程——”全自动”的执念反而产生脆弱系统。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;把 AI 放进回路，而不只是放进流程。&lt;/strong&gt; 用 AI 提取信息是提效；让 AI 参与定义自己的能力边界、让文档成为人机共享的事实源，才是这套系统会进化的原因。&lt;/p&gt;&#10;&lt;p&gt;—— 深度跟踪提醒 DeepReminder，从一个提醒需求到一个自进化条件的跟踪复盘系统。&lt;/p&gt;&#10;</description></item><item><title>47 页 Kimi K3 技术报告，讲给普通开发者听：2.8T 开源巨兽的“偷懒”艺术</title><link>https://blog.havenice.day/2026/07/28/47-ye-kimik3-ji-shu-bao-gao-jiang-gei-pu-tong-kai-fa-zhe/</link><pubDate>Tue, 28 Jul 2026 10:54:34 +0800</pubDate><guid>https://blog.havenice.day/2026/07/28/47-ye-kimik3-ji-shu-bao-gao-jiang-gei-pu-tong-kai-fa-zhe/</guid><description>&lt;p&gt;**30 秒版本：**Kimi K3 是 Moonshot 最新开源的旗舰模型——&lt;strong&gt;2.8 万亿参数的 MoE，每个 token 只激活 1040 亿（约 1/27），原生视觉，100 万 token 上下文&lt;/strong&gt;。定位一句话：能力咬住闭源前两名（Claude Fable 5、GPT-5.6 Sol），稳坐开源第一，成本却只有对手的几分之一。本文把 47 页技术报告拆成三个灵魂问题：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;2.8T 的大家伙，怎么训得起、推得动？&lt;/strong&gt; → 架构”三板斧”&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;100 万 token 上下文，怎么不让显存爆炸？&lt;/strong&gt; → 换一种”记忆方式”&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;base 模型怎么练成能干活的 agent？&lt;/strong&gt; → RL + 九专家蒸馏&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;h2 id="先看全景架构就三句话"&gt;先看全景：架构就三句话&lt;/h2&gt;&#10;&lt;p&gt;MoonViT-V2&#10;0.4B 视觉编码器&lt;/p&gt;&#10;&lt;p&gt;Embedding&#10;共享嵌入空间&lt;/p&gt;&#10;&lt;p&gt;Block ×8：93 层切成 8 块&#10;token 混合：3 KDA : 1 MLA&lt;/p&gt;&#10;&lt;p&gt;KDA&lt;/p&gt;&#10;&lt;p&gt;KDA&lt;/p&gt;&#10;&lt;p&gt;KDA&lt;/p&gt;&#10;&lt;p&gt;MLA&lt;/p&gt;&#10;&lt;p&gt;MoE&lt;/p&gt;&#10;&lt;p&gt;MoE&lt;/p&gt;&#10;&lt;p&gt;MoE&lt;/p&gt;&#10;&lt;p&gt;MoE&#10;每层 attention 后都跟一个 LatentMoE&#10;896 选 16 · 压到 3584 维 latent 空间&lt;/p&gt;&#10;&lt;p&gt;AttnRes：深度方向的”查档”机制&#10;每层带 query 检索 embedding + 所有前序 Block 的输出&lt;/p&gt;&#10;&lt;p&gt;输出&#10;循环 ×8&lt;/p&gt;&#10;&lt;p&gt;三句话概括整个架构：&lt;strong&gt;token 维度&lt;/strong&gt;靠 3 层 KDA + 1 层 MLA 混搭，&lt;strong&gt;深度维度&lt;/strong&gt;靠 AttnRes 跨层查档，&lt;strong&gt;宽度维度&lt;/strong&gt;靠 LatentMoE 稀疏调用专家。先感受一下 K2 → K3 的体格变化：&lt;/p&gt;&#10;&lt;table&gt;&#10;&lt;tr&gt;&#10;&lt;th&gt;&lt;/th&gt;&#10;&lt;th&gt;Kimi K2&lt;/th&gt;&#10;&lt;th&gt;Kimi K3&lt;/th&gt;&#10;&lt;th&gt;变化&lt;/th&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;总参数 / 激活参数&lt;/td&gt;&#10;&lt;td&gt;1.04T / 32.6B&lt;/td&gt;&#10;&lt;td&gt;2.78T / 104.2B&lt;/td&gt;&#10;&lt;td&gt;×2.7 / ×3.2&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;层数&lt;/td&gt;&#10;&lt;td&gt;61&lt;/td&gt;&#10;&lt;td&gt;93&lt;/td&gt;&#10;&lt;td&gt;+52%&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;专家数（每 token 激活）&lt;/td&gt;&#10;&lt;td&gt;384（8）&lt;/td&gt;&#10;&lt;td&gt;896（16）&lt;/td&gt;&#10;&lt;td&gt;稀疏度 56&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;训练上下文&lt;/td&gt;&#10;&lt;td&gt;128K&lt;/td&gt;&#10;&lt;td&gt;1M&lt;/td&gt;&#10;&lt;td&gt;×8&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;注意力&lt;/td&gt;&#10;&lt;td&gt;全 MLA&lt;/td&gt;&#10;&lt;td&gt;69 KDA + 24 MLA&lt;/td&gt;&#10;&lt;td&gt;混合架构&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;综合 Scaling 效率&lt;/td&gt;&#10;&lt;td&gt;基准&lt;/td&gt;&#10;&lt;td&gt;&lt;strong&gt;2.5×&lt;/strong&gt;&lt;/td&gt;&#10;&lt;td&gt;同等 loss 省 60% 算力&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;/table&gt;&#10;&lt;h2 id="第一板斧kda--把无限增长的会议记录换成固定大小的笔记本"&gt;第一板斧：KDA —— 把”无限增长的会议记录”换成”固定大小的笔记本”&lt;/h2&gt;&#10;&lt;p&gt;传统 attention 的痛点：每来一个 token，都要和之前&lt;strong&gt;所有&lt;/strong&gt; token 重新算一遍关系，KV cache 无限变长——像开一场永不散会的会，每页发言记录都要永久存档。KDA（Kimi Delta Attention）是线性注意力的一种：不管序列多长，只维护一个&lt;strong&gt;固定大小的笔记本 S&lt;/strong&gt;，成本 O(n)、缓存恒定。&lt;/p&gt;&#10;&lt;p&gt;全量注意力（如 MLA）&#10;每来 1 个 token，记录 +1 页&#10;KV cache&lt;/p&gt;&#10;&lt;p&gt;成本 O(n²) · 缓存无限涨&lt;/p&gt;&#10;&lt;p&gt;KDA（线性注意力）&#10;每来 1 个 token，只更新笔记本 S&lt;/p&gt;&#10;&lt;p&gt;① 褪色 α：旧笔记按通道变淡&#10;② 擦除：先精准擦掉旧值&#10;③ 写入 β：新内容按强度落笔&#10;成本 O(n) · 缓存固定&lt;/p&gt;&#10;&lt;p&gt;K3 的折中：3 层 KDA + 1 层 MLA&#10;75% 的层记笔记本（便宜），25% 开全员大会（保全局）&lt;/p&gt;&#10;&lt;p&gt;笔记本每来一个 token 做三个动作：&lt;strong&gt;褪色&lt;/strong&gt;（forget gate α 让每个通道的旧笔记按各自速度变淡）、&lt;strong&gt;擦除&lt;/strong&gt;（delta rule——写入前先把旧值精准擦掉，这是它和普通线性注意力的关键区别，防止内容越叠越糊）、&lt;strong&gt;写入&lt;/strong&gt;（新内容按强度 β 落笔）。&lt;/p&gt;&#10;&lt;p&gt;报告里我最喜欢的一个工程细节：数学上”1/累计衰减”会指数级膨胀，BF16 装不下就溢出。K3 的解法是给褪色速度设个下限（用 sigmoid 把 log-decay 压进 (-5, 0)），16 个 token 的累计衰减倒数最大 e⁸⁰，刚好卡在 BF16 动态范围内——&lt;strong&gt;一个数值稳定性的小改动，让整条计算路径都能跑满 Tensor Core，直接消灭了最慢的 kernel 分支&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;两个配套设计也值得记住：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;3:1 混搭&lt;/strong&gt;：光靠笔记本会丢全局细节，所以每 4 层插 1 层 Gated MLA 全量注意力”开全员大会”&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;NoPE（无位置编码）&lt;/strong&gt;：不显式存”第几个位置”，靠笔记本的衰减自然感知远近。上下文从 8K 一路扩到 1M &lt;strong&gt;完全不用改位置编码&lt;/strong&gt;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="第二板斧attnres--把-attention-的思想搬到深度方向"&gt;第二板斧：AttnRes —— 把 attention 的思想搬到”深度”方向&lt;/h2&gt;&#10;&lt;p&gt;普通残差连接像传话游戏：第 93 层只能拿到第 92 层传过来的话，前面 91 层的细节全被压扁在一个向量里。AttnRes 的思路很直接：&lt;strong&gt;每层带一个可学习的”查询词”，主动去检索 embedding 和所有前序 Block 的输出&lt;/strong&gt;，想要谁的信息就拿谁的。93 层切成 8 个 Block，块内先求和压缩、块间再做检索，开销可忽略，实验上 N=8 就能拿回大部分收益。&lt;/p&gt;&#10;&lt;h2 id="第三板斧latentmoe--896-个专家的分诊艺术"&gt;第三板斧：LatentMoE —— 896 个专家的分诊艺术&lt;/h2&gt;&#10;&lt;p&gt;token&#10;7168 维&lt;/p&gt;&#10;&lt;p&gt;W↓ 压缩&#10;7168→3584&lt;/p&gt;&#10;&lt;p&gt;Router 分诊台&#10;QB 负载均衡&#10;偏置 b 只调分诊、不改权重&lt;/p&gt;&#10;&lt;p&gt;896 个 routed 专家&#10;每个 token 只激活其中 16 个&lt;/p&gt;&#10;&lt;p&gt;专家在 3584 维 latent 空间工作&#10;通信、显存都按”简报”大小算&lt;/p&gt;&#10;&lt;p&gt;汇总 → RMSNorm → W↑&#10;投影回 7168 维，与 shared 相加&lt;/p&gt;&#10;&lt;p&gt;2 个 shared 专家（全科）&#10;全宽度直接处理每个 token&#10;896 选 16 = 稀疏度 56：只花 1/56 的算力，享受 56 倍的专家容量&lt;/p&gt;&#10;&lt;p&gt;MoE 的核心矛盾：专家越多知识容量越大，但每个被选中的专家都要收一份 7168 维的完整 token 表示，通信和显存跟着爆炸。K3 的三连解法：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;先压缩再送诊&lt;/strong&gt;：token 先被 W↓ 压成 3584 维”简报”，专家们在简报空间里干活。于是专家数翻倍（384→896）、激活数翻倍（8→16），通信量却没涨&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;SiTU-GLU 激活函数&lt;/strong&gt;：SwiGLU 的两个相乘因子都无界，2.8T 尺度下会数值爆炸。SiTU-GLU 给两个分支都装上 tanh”限高杆”（输出硬上限 100），原点附近和 SwiGLU 一阶等价——形状不变，永远不失控&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;QB 分位数均衡&lt;/strong&gt;：传统 MoE 靠辅助损失逼负载均衡（伤性能），K3 改成给每个专家加一个”排班偏置 b”——b 只影响谁被选中、不进梯度、不改权重。每步训练后按分位数调：太火的专家降分、冷门的加分，直到每个专家接待量精确达标。工程上用直方图估分位数，一次 all-reduce 只传几百个 bin，几乎免费&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;h2 id="后训练先分头练出-9-个专家再蒸馏回一个模型"&gt;后训练：先分头练出 9 个专家，再蒸馏回一个模型&lt;/h2&gt;&#10;&lt;p&gt;① SFT 冷启动&#10;打基础 agent 能力&#10;XTML 统一模板&#10;全程量化感知&lt;/p&gt;&#10;&lt;p&gt;② RL 练专项专家&#10;3 领域 × 3 思考档&#10;= 9 个专家模型&#10;超预算奖励 -1&lt;/p&gt;&#10;&lt;p&gt;③ MOPD 蒸馏&#10;9 个老师教 1 个学生&#10;逐 token 打分&#10;合成统一模型&lt;/p&gt;&#10;&lt;p&gt;④ 一个 K3&#10;low/high/max 三档&#10;MXFP4 低精度部署&#10;草稿模型加速解码&lt;/p&gt;&#10;&lt;p&gt;reasoning effort = 给模型发”思考预算”&#10;先训 max 档（预算宽），再退火出 high / low 档 —— 让模型学会该想想、该省省&lt;/p&gt;&#10;&lt;p&gt;后训练里几个有意思的细节：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;思考预算控制&lt;/strong&gt;：每题先发预算 b₀(x)，输出超 τ·b₀ 直接奖励 -1。先训 max 档，再退火出 high/low 档——模型自己学会”简单题别过度思考”&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;防话痨&lt;/strong&gt;：GRM 打分时回答长度超 σ·ℓ₀ 直接判负，专治 reward hacking 的啰嗦倾向&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;训练任务够野&lt;/strong&gt;：知识图谱自动扩展出题、mock 版 Gmail/Notion/Slack 练”连续工作好几天”的助理任务、GPU kernel 优化（奖励=正确性+逼近 roofline 程度，还配反作弊系统）、黑盒系统复刻等&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="基建28t-不是堆卡就行的"&gt;基建：2.8T 不是堆卡就行的&lt;/h2&gt;&#10;&lt;table&gt;&#10;&lt;tr&gt;&#10;&lt;th&gt;工程难题&lt;/th&gt;&#10;&lt;th&gt;K3 的解法&lt;/th&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;KDA 递归本质是串行，GPU 不喜欢&lt;/td&gt;&#10;&lt;td&gt;FlashKDA kernel：chunk 内并行、chunk 间流水重叠&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;1M 上下文并行训练&lt;/td&gt;&#10;&lt;td&gt;KCP：把每段的状态转移分解成可本地计算的两部分，一次 all-gather 搞定——线性 attention 的通信量&lt;strong&gt;与序列长度无关&lt;/strong&gt;&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;专家并行负载不均、显存碎片&lt;/td&gt;&#10;&lt;td&gt;MoonEP：每个 rank 精确收 S×K 个 token，冗余专家 ≤ E/R（有数学证明），shape 全静态免同步&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;1M agentic RL 的 KV cache 存不下&lt;/td&gt;&#10;&lt;td&gt;外部 KV 池：GPU 逐出的前缀写回 CPU DRAM，KDA state 与 MLA KV 生命周期对齐&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;agent 把容器沙箱搞到内核 panic&lt;/td&gt;&#10;&lt;td&gt;AgentENV：Firecracker microVM，支持暂停/分叉/快照（checkpoint 133ms）；整个训练共创建 &lt;strong&gt;5122 万个沙箱、150 万个镜像&lt;/strong&gt;&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;1M token 长请求挤死 2K 短请求&lt;/td&gt;&#10;&lt;td&gt;预算制准入控制：长短请求各有独立资源池，互不饿死&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;/table&gt;&#10;&lt;h2 id="成绩单报告官方数据截至-2026-07-23"&gt;成绩单（报告官方数据，截至 2026-07-23）&lt;/h2&gt;&#10;&lt;table&gt;&#10;&lt;tr&gt;&#10;&lt;th&gt;维度&lt;/th&gt;&#10;&lt;th&gt;表现&lt;/th&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;编程&lt;/td&gt;&#10;&lt;td&gt;SWE-Marathon 第一（42.0%，领先 Fable 5 七分）；Terminal-Bench 88.3% 几乎平 GPT-5.6 Sol；&lt;strong&gt;WebDev Arena 总榜第一&lt;/strong&gt;（1678 Elo，首个登顶的开源模型）&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;Agent&lt;/td&gt;&#10;&lt;td&gt;BrowseComp 91.2% 全场第一；MCPMark 94.5% 第一；GDPval-AA 第三（前二为 Fable 5、GPT-5.6 Sol）&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;知识推理&lt;/td&gt;&#10;&lt;td&gt;GPQA 93.5%；但 HLE、CritPt 等研究级任务仍落后前两名——报告自己承认这是短板&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;视觉&lt;/td&gt;&#10;&lt;td&gt;OmniDocBench 91.1% 第一；ZeroBench 平 Fable 5&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;tr&gt;&#10;&lt;td&gt;成本&lt;/td&gt;&#10;&lt;td&gt;BrowseComp 每题 $2.03，是 GPT-5.6 Sol 的一半、Claude 系的约 1/10；KCB 2.0 用 Fable 5 约 38% 的成本拿到只差 4 分的成绩&lt;/td&gt;&#10;&lt;/tr&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;Case study 里最夸张的三个：24 小时内把 4 个 GPU kernel 优化到匹配 Fable 5 的水平；独立写出一个能端到端训 GPT 的 Triton 类编译器 MiniTriton（matmul 达 cuBLAS 约 90%）；48 小时用开源 EDA 链设计了颗 INT4 推理芯片（RTL 仿真 8700 tokens/s）。&lt;/p&gt;&#10;&lt;h2 id="普通开发者能带走什么"&gt;普通开发者能带走什么&lt;/h2&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;“混合”打败”纯粹”&lt;/strong&gt;：75% 便宜层 + 25% 贵层 ≈ 全贵层。缓存/数据库/索引的分层设计是同一个道理&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;数值稳定性就是性能&lt;/strong&gt;：一个 sigmoid 下限换来整条 kernel 路径上 Tensor Core，边界条件别小看&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;负载均衡可以”调偏置”而不是”加惩罚”&lt;/strong&gt;：不改目标函数、只调准入门槛——任何调度系统都好使&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;agent 能力 ≈ 环境复杂度&lt;/strong&gt;：K3 的 agent 能力是 5122 万个沙箱喂出来的。你的 agent 产品能练多狠，取决于你能造多真的演练场&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;成本拐点&lt;/strong&gt;：开源权重的 K3 把前沿 agent 能力打到闭源旗舰 1/3~1/10 的价格，自部署的经济账越来越好算了&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;一句话总结：&lt;strong&gt;K3 没有发明新科学，但它把线性注意力、MoE、RL、系统工程四条线的工程组合做到了开源世界的天花板&lt;/strong&gt;——然后用 2.5× 的训练效率和 1/10 的推理成本告诉你：前沿智能的入场券正在变便宜。&lt;/p&gt;&#10;&lt;p&gt;本文为 Moonshot《Kimi K3: Open Frontier Intelligence》技术报告（2026 年 7 月，47 页）的个人解读，数据均引自报告原文，跑分以官方口径为准。&lt;/p&gt;&#10;</description></item></channel></rss>