<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>摘录 · AI Times</title><link>https://blog.havenice.day/category/%E6%91%98%E5%BD%95/</link><description>AI 时代，中年人倔强的记录</description><language>zh-CN</language><lastBuildDate>Fri, 10 Apr 2026 23:17:56 +0800</lastBuildDate><atom:link href="https://blog.havenice.day/category/%E6%91%98%E5%BD%95/index.xml" rel="self" type="application/rss+xml"/><item><title>顶级开发团队设计的Harness工程项目源码什么样 – 腾讯技术工程的文章</title><link>https://blog.havenice.day/2026/04/10/ding-ji-kai-fa-tuan-dui-she-ji-de-harness-gong-cheng-xiang/</link><pubDate>Fri, 10 Apr 2026 23:17:56 +0800</pubDate><guid>https://blog.havenice.day/2026/04/10/ding-ji-kai-fa-tuan-dui-she-ji-de-harness-gong-cheng-xiang/</guid><description>&lt;p&gt;技术教科书： – 知乎&lt;br&gt;&#10;https://zhuanlan.zhihu.com/p/2025587980832634840&lt;/p&gt;&#10;</description></item><item><title>The bitter lesson</title><link>https://blog.havenice.day/2026/03/18/the-bitter-lesson/</link><pubDate>Wed, 18 Mar 2026 09:57:48 +0800</pubDate><guid>https://blog.havenice.day/2026/03/18/the-bitter-lesson/</guid><description>&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2026/03/image.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://link.zhihu.com/?target=https%3A//baike.baidu.com/item/%25E7%2590%2586%25E6%259F%25A5%25E5%25BE%25B7%25C2%25B7%25E8%2596%25A9%25E9%25A0%2593/23695446"&gt;理查德·萨顿&lt;/a&gt;（Richard S. Sutton，现代强化学习之父，现任加拿大阿尔伯塔大学教授） &lt;a href="http://www.incompleteideas.net/IncIdeas/BitterLesson.html"&gt;http://www.incompleteideas.net/IncIdeas/BitterLesson.html&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;2019年3月13日&lt;/p&gt;&#10;&lt;p&gt;过去70年人工智能研究领域最重要的一堂课是，**只有通用计算方法最终是最有效的，而且优势巨大。**根本原因是&lt;a href="https://zhida.zhihu.com/search?content_id=245581586&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=%E6%91%A9%E5%B0%94%E5%AE%9A%E5%BE%8B&amp;amp;zhida_source=entity"&gt;摩尔定律&lt;/a&gt;，更确切地说是，每个计算单元的成本持续呈指数下降。大多数人工智能研究都是假设 Agent 可用的计算量是恒定的（在这种情况下，利用人类知识将是提高性能的唯一方法之一），但是，从较长的时间看，不可避免地会产生大量的计算量。为了在短期内获得有所作为的改善，研究人员试图利用该领域内的人类知识。&lt;strong&gt;但长远来看，唯一重要的是利用算力&lt;/strong&gt;。这两者不必相互对立，但在实践中它们往往会相互对立。时间投入到一种方法上，就没办法投入到另一种方法上，这是对投入一种或另一种方法的心理承诺。而人类知识往往很复杂，不太适合利用好通用算力。有很多的例子表明人工智能研究人员迟迟未能学习这个苦涩的教训，回顾一些最突出的例子很有启发性。&lt;/p&gt;&#10;&lt;p&gt;在电脑国际象棋中，1997年击败世界冠军&lt;a href="https://zhida.zhihu.com/search?content_id=245581586&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=%E5%8D%A1%E6%96%AF%E5%B8%95%E7%BD%97%E5%A4%AB&amp;amp;zhida_source=entity"&gt;卡斯帕罗夫&lt;/a&gt;的方法基于大规模的&lt;a href="https://zhida.zhihu.com/search?content_id=245581586&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=%E6%B7%B1%E5%BA%A6%E6%90%9C%E7%B4%A2&amp;amp;zhida_source=entity"&gt;深度搜索&lt;/a&gt;。当时，大多数计算机国际象棋研究人员对此感到沮丧，他们一直致力于利用人类对国际象棋特殊结构的理解的方法，当一种&lt;strong&gt;更简单的、基于搜索的、结合特殊的硬件和软件&lt;/strong&gt;的方法，被证明更有效时，这些基于人类知识的国际象棋研究人员没有虚心接受失败，他们反驳道，“蛮力”搜索可能这次赢了，但这不是一种通用的策略，而且也不是人们玩国际象棋的方式。这些研究人员希望基于人类的行棋思路能够获胜，当没有获胜时他们感到失望。&lt;/p&gt;&#10;&lt;p&gt;在电脑围棋中，也出现了类似的研究进展，只是比国际象棋晚了20年。最初的巨大努力是想办法利用人类知识（一千年的棋谱），或围棋游戏的特殊特征，避免用蛮力搜索，但是所有这些努力都被证明是无关紧要的。更糟糕的是，一旦有效地进行了大规模搜索，以及，使用自我对局来学习价值函数（就像在许多其他游戏中一样，在国际象棋中也是如此，尽管这种学习在1997年首次击败世界冠军的项目中并没有发挥重要作用），之前的努力都是负向的。**通过 自我对局 以及 通用学习 来学习，就像搜索一样，因为它能够进行大规模的计算。**在电脑围棋、电脑国际象棋中，研究人员最初的努力是利用人类的理解（更少的搜索），直到很久以后，&lt;strong&gt;通过拥抱搜索和学习，才取得更大的成功&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;在&lt;strong&gt;语音识别&lt;/strong&gt;方面，在1970年代，由&lt;a href="https://zhida.zhihu.com/search?content_id=245581586&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=DARPA&amp;amp;zhida_source=entity"&gt;DARPA&lt;/a&gt;（美国国防部高级研究计划局）赞助了一项早期的竞赛。参赛者包括许多利用人类知识的特殊方法——单词、音素、人类声道等等知识。另一方面是更具统计学意义的方法，基于&lt;a href="https://zhida.zhihu.com/search?content_id=245581586&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=%E9%9A%90%E9%A9%AC%E5%B0%94%E5%8F%AF%E5%A4%AB%E6%A8%A1%E5%9E%8B&amp;amp;zhida_source=entity"&gt;隐马尔可夫模型&lt;/a&gt;（HMMs）进行了更多的计算。**再次，统计学方法战胜了基于人类知识的方法。**这导致了几十年来所有自然语言处理的重大变化，统计学和计算逐渐开始主导该领域。最近深度学习在语音识别领域的兴起是朝着这一方向迈出的最新一步。深度学习方法对人类知识的依赖程度更低，使用更多的计算，加上在巨大的训练集上的学习，以产生更好的语音识别系统。正如游戏中一样，研究人员总是试图让系统按照他们自己的大脑工作的方式工作 —— 他们试图将这些知识放入他们的系统中 —— 但事实证明，当大规模计算变得可用并找到了一种充分利用摩尔定律的方法时，这最终会适得其反，并且浪费了研究人员的时间。&lt;/p&gt;&#10;&lt;p&gt;在计算机视觉领域，也存在类似的模式。早期的方法把视觉想象成寻找边缘，或广义柱，或以&lt;a href="https://zhida.zhihu.com/search?content_id=245581586&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=SIFT%E7%89%B9%E5%BE%81&amp;amp;zhida_source=entity"&gt;SIFT特征&lt;/a&gt;的形式。但今天，这一切都被抛弃了。现代深度学习神经网络仅使用卷积和某些不变性的概念，并且表现得更好。&lt;/p&gt;&#10;&lt;p&gt;这是一个重要的教训。纵观整个人工智能领域，我们仍然没有彻底地吸取它，因为我们继续犯同样的错误。为了看到这一点，并有效地抵制它，我们必须理解这些错误的吸引力。我们必须吸取苦涩的教训，即把我们认为的思维方式构建到系统中是行不通的。&lt;/p&gt;&#10;&lt;p&gt;苦涩的教训是基于历史观察：&lt;/p&gt;&#10;&lt;p&gt;1）人工智能研究人员经常试图将知识构建到他们的 Agent 中；&lt;/p&gt;&#10;&lt;p&gt;2）这在短期内总是有帮助的，并且对研究人员来说是个人满意的；&lt;/p&gt;&#10;&lt;p&gt;3）但从长远来看，它总会达到一个瓶颈，甚至会阻碍进一步的进展；&lt;/p&gt;&#10;&lt;p&gt;4）突破性的进展最终是通过一种相反的方法实现的，这种方法基于&lt;strong&gt;通过搜索和学习来扩展大规模计算。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;最终的成功中夹杂着一丝苦涩和消化不全，因为它比受青睐的、以人为本的方法更成功。&lt;/p&gt;&#10;&lt;p&gt;从苦涩的教训中学到的一件事是&lt;strong&gt;通用方法的巨大力量，&lt;strong&gt;即随着可用算力变得非常大，这些方法会随着计算量的增加可以继续扩展。可以以这种方式近乎无限扩展的两种方法是&lt;/strong&gt;搜索和学习&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;从苦涩的教训中学到的第二个普遍观点是，人类心灵的实际内容是极其复杂的，我们不应该再试图找到简单的方法来思考心灵的内容，比如简单地思考空间、物体、多重主体或对称性。所有这些都是任意的、内在复杂的外部世界的一部分。它们不应该被构建，因为它们的复杂性是无止境的；&lt;strong&gt;相反，我们应该只构建可以找到和捕获这种任意复杂性的元方法。&lt;strong&gt;这些方法的关键是它们可以找到很好的近似值，但算法应该是基于我们的方法，而不是我们已经学到的知识。我们&lt;/strong&gt;希望人工智能 Agent 能够像我们人类一样去发现&lt;/strong&gt;，而不是在系统里集成我们已经发现的东西。建立在我们已知发现之上只会让我们更难看到如何完成发现过程。&lt;/p&gt;&#10;</description></item><item><title>UUID的演进</title><link>https://blog.havenice.day/2025/11/25/uuid-de-yan-jin/</link><pubDate>Tue, 25 Nov 2025 12:24:19 +0800</pubDate><guid>https://blog.havenice.day/2025/11/25/uuid-de-yan-jin/</guid><description>&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/11/image.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/11/image-1.png" alt=""&gt;&lt;/p&gt;&#10;</description></item><item><title>2025.重大云服务商事故回顾</title><link>https://blog.havenice.day/2025/11/19/2025-zhong-da-yun-fu-wu-shang-shi-gu-hui-gu/</link><pubDate>Wed, 19 Nov 2025 10:02:07 +0800</pubDate><guid>https://blog.havenice.day/2025/11/19/2025-zhong-da-yun-fu-wu-shang-shi-gu-hui-gu/</guid><description>&lt;p&gt;2025年11月18日，Cloudflare发生了一次全球范围的大规模服务中断事件，被广泛称为“史诗级宕机”。此次故障持续约3小时，影响范围极其广泛，导致大量依赖其CDN、DNS、安全服务和边缘基础设施的网站与平台出现访问异常或完全中断。&lt;/p&gt;&#10;&lt;h3 id="-故障概况"&gt;🔍 故障概况&lt;/h3&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;故障时间&lt;/strong&gt;：2025年11月18日 美东时间约凌晨4:30（UTC 11:20）起&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;持续时间&lt;/strong&gt;：约3小时，核心流量于22:30恢复，次日凌晨01:06全面恢复&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;影响范围&lt;/strong&gt;：全球性，涵盖北美、欧洲、亚太等多个地区&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="-受影响服务与平台"&gt;🌐 受影响服务与平台&lt;/h3&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;社交平台&lt;/strong&gt;：X（原Twitter）出现间歇性无法访问或加载错误&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;AI服务&lt;/strong&gt;：ChatGPT、Claude AI等服务登录与响应异常&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;其他服务&lt;/strong&gt;：Spotify、Uber、DoorDash、Grindr、New Jersey Transit、IKEA、多个政府与加密平台（如Arbiscan、DefiLlama）均受影响&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;Cloudflare自身服务&lt;/strong&gt;：包括Access零信任平台、Workers KV、API、控制面板、WARP代理等也出现故障&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="-故障原因"&gt;⚙️ 故障原因&lt;/h3&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;根本原因&lt;/strong&gt;：一个用于管理威胁流量的&lt;strong&gt;自动生成配置文件&lt;/strong&gt;体积异常膨胀，超出系统预期，触发处理流量相关模块崩溃&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;非攻击事件&lt;/strong&gt;：官方明确表示，无证据表明此次事件与网络攻击或恶意行为有关&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;配置传播机制失效&lt;/strong&gt;：该配置文件每5分钟自动更新一次，导致错误配置迅速扩散至全球节点&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="-市场与行业反应"&gt;📉 市场与行业反应&lt;/h3&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;股价下跌&lt;/strong&gt;：Cloudflare股价当日盘前下跌约4.1%，市值蒸发超30亿美元&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;公众关注&lt;/strong&gt;：Downdetector平台在故障期间累计收到超过&lt;strong&gt;210万条&lt;/strong&gt;故障报告&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;行业警示&lt;/strong&gt;：此次事件再次引发对互联网过度依赖单一基础设施提供商的集中风险讨论&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="-总结"&gt;✅ 总结&lt;/h3&gt;&#10;&lt;figure class="wp-block-table"&gt;&lt;table class="has-fixed-layout"&gt;&lt;thead&gt;&lt;tr&gt;&lt;th&gt;项目&lt;/th&gt;&lt;th&gt;内容&lt;/th&gt;&lt;/tr&gt;&lt;/thead&gt;&lt;tbody&gt;&lt;tr&gt;&lt;td&gt;故障时间&lt;/td&gt;&lt;td&gt;2025年11月18日 凌晨4:30起（美东时间）&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;持续时间&lt;/td&gt;&lt;td&gt;约3小时&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;影响范围&lt;/td&gt;&lt;td&gt;全球（欧美、亚太）&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;核心原因&lt;/td&gt;&lt;td&gt;配置文件异常膨胀触发系统崩溃&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;是否攻击&lt;/td&gt;&lt;td&gt;否，非恶意行为&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;代表受影响平台&lt;/td&gt;&lt;td&gt;X、ChatGPT、Uber、Spotify、政府服务等&lt;/td&gt;&lt;/tr&gt;&lt;/tbody&gt;&lt;/table&gt;&lt;/figure&gt;&#10;&lt;p&gt;这是Cloudflare近年来影响最广泛的一次基础设施级故障，凸显了全球互联网对少数核心服务提供商的高度依赖及其潜在脆弱性。&lt;/p&gt;&#10;&lt;p&gt;再算上之前的，可以说是全面崩盘！！ 都说Allin AI，但是有些基础工作，还是得依赖人的经验和教训！&lt;/p&gt;&#10;&lt;p&gt;截至2025年下半年，微软、Google 和 AWS 均发生了严重的全球性服务中断事件，虽然它们发生在2025年，但影响延续至2026年，且揭示了三家云服务商在关键基础设施上的脆弱性。以下是三大厂商的重大事故概览：&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="-google-cloud2025年6月"&gt;🔴 &lt;strong&gt;Google Cloud（2025年6月）&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;故障时间&lt;/strong&gt;：2025年6月12日&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;持续时间&lt;/strong&gt;：约3小时&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;影响范围&lt;/strong&gt;：全球范围内超过60项服务中断，包括 Gmail、Google Drive、Google Meet、Cloud Functions、Vertex AI 等。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;故障原因&lt;/strong&gt;：一次错误的自动配额更新导致 API 管理系统崩溃，异常数据被同步至全球数据中心，引发连锁反应。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;影响企业&lt;/strong&gt;：Spotify、Shopify、Cloudflare、OpenAI、GitHub 等大量依赖 Google Cloud 的第三方平台均受影响。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;官方回应&lt;/strong&gt;：Google 承认事故本可避免，表示将加强变更管理、测试机制与容错设计 。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="-microsoft-azure2025年10月"&gt;🔴 &lt;strong&gt;Microsoft Azure（2025年10月）&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;故障时间&lt;/strong&gt;：2025年10月29日&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;持续时间&lt;/strong&gt;：约7小时&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;影响范围&lt;/strong&gt;：全球性宕机，波及 Azure Portal、Office 365、Xbox Live、Copilot、Azure SQL、Entra ID 等核心服务。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;故障原因&lt;/strong&gt;：Azure Front Door（AFD）内容分发网络中一次意外的租户配置变更，导致全球节点异常，流量分配失衡。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;影响企业&lt;/strong&gt;：阿拉斯加航空、星巴克、Costco、加拿大魁北克医疗系统等关键行业服务中断。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;官方回应&lt;/strong&gt;：微软承认配置流程存在缺陷，防护机制失效，已增强验证与回滚机制 。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="-amazon-aws2025年10月"&gt;🔴 &lt;strong&gt;Amazon AWS（2025年10月）&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;故障时间&lt;/strong&gt;：2025年10月19日深夜至20日下午&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;持续时间&lt;/strong&gt;：约15小时&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;影响范围&lt;/strong&gt;：全球大量服务瘫痪，涉及 Disney+、麦当劳、联合航空、Twitch、GitLab 等。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;故障原因&lt;/strong&gt;：美国东部1区（US-East-1）DynamoDB 的 DNS 解析异常，导致 EC2、Lambda、S3、CloudFormation 等多个服务无法正常访问。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;技术细节&lt;/strong&gt;：问题出在 AWS 自建智能 DNS 集群，非公共 DNS，导致内部服务地址无法正确解析。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;官方回应&lt;/strong&gt;：AWS 承认这是近年来最严重的事故之一，承诺加强 DNS 架构冗余与监控机制 。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="-总结-1"&gt;✅ 总结&lt;/h3&gt;&#10;&lt;figure class="wp-block-table"&gt;&lt;table class="has-fixed-layout"&gt;&lt;thead&gt;&lt;tr&gt;&lt;th&gt;云服务商&lt;/th&gt;&lt;th&gt;故障时间&lt;/th&gt;&lt;th&gt;持续时间&lt;/th&gt;&lt;th&gt;主要原因&lt;/th&gt;&lt;th&gt;影响服务数量&lt;/th&gt;&lt;th&gt;是否波及全球&lt;/th&gt;&lt;/tr&gt;&lt;/thead&gt;&lt;tbody&gt;&lt;tr&gt;&lt;td&gt;Google Cloud&lt;/td&gt;&lt;td&gt;2025年6月&lt;/td&gt;&lt;td&gt;~3小时&lt;/td&gt;&lt;td&gt;API配额系统错误&lt;/td&gt;&lt;td&gt;60+&lt;/td&gt;&lt;td&gt;✅&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;Microsoft Azure&lt;/td&gt;&lt;td&gt;2025年10月&lt;/td&gt;&lt;td&gt;~7小时&lt;/td&gt;&lt;td&gt;AFD配置变更失误&lt;/td&gt;&lt;td&gt;30+&lt;/td&gt;&lt;td&gt;✅&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;Amazon AWS&lt;/td&gt;&lt;td&gt;2025年10月&lt;/td&gt;&lt;td&gt;~15小时&lt;/td&gt;&lt;td&gt;DNS解析异常&lt;/td&gt;&lt;td&gt;多项核心服务&lt;/td&gt;&lt;td&gt;✅&lt;/td&gt;&lt;/tr&gt;&lt;/tbody&gt;&lt;/table&gt;&lt;/figure&gt;&#10;&lt;p&gt;这些事故暴露出全球云基础设施的高度耦合性和单点脆弱性，也引发了业界对“多云架构”和“容灾冗余”策略的重新审视。&lt;/p&gt;&#10;</description></item><item><title>伊朗封锁霍尔木兹海峡对中美股票市场的影响分析-coze</title><link>https://blog.havenice.day/2025/07/01/yi-lang-feng-suo-huo-er-mu-zi-hai-xia-dui-zhong-mei-gu-piao/</link><pubDate>Tue, 01 Jul 2025 09:54:13 +0800</pubDate><guid>https://blog.havenice.day/2025/07/01/yi-lang-feng-suo-huo-er-mu-zi-hai-xia-dui-zhong-mei-gu-piao/</guid><description>&lt;h1 id="伊朗封锁霍尔木兹海峡对中美股票市场的影响分析"&gt;伊朗封锁霍尔木兹海峡对中美股票市场的影响分析&lt;/h1&gt;&#10;&lt;h2 id="一霍尔木兹海峡的重要地位"&gt;一、霍尔木兹海峡的重要地位&lt;/h2&gt;&#10;&lt;p&gt;霍尔木兹海峡位于亚洲西南部，介于阿拉伯半岛东北端与伊朗南部海岸之间，连通波斯湾和阿曼湾，是波斯湾通向印度洋的唯一海上通道，具有极其重要的战略和经济意义。每天约有1800 – 2000万桶原油通过该海峡运往世界各地，全球约20%的石油和20%的液化天然气（LNG）运输都要途经此地。正因如此，霍尔木兹海峡一直是地缘政治博弈的焦点，伊朗也常将封锁海峡作为反制西方制裁的战略手段。&lt;/p&gt;&#10;&lt;h2 id="二伊朗封锁霍尔木兹海峡对美国股票市场的影响"&gt;二、伊朗封锁霍尔木兹海峡对美国股票市场的影响&lt;/h2&gt;&#10;&lt;h3 id="一短期3个月内影响"&gt;（一）短期（3个月内）影响&lt;/h3&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;整体股市震荡下跌&lt;/strong&gt;：从市场情绪来看，一旦伊朗封锁霍尔木兹海峡，投资者的避险情绪将急剧升温。美国股指期货在相关消息传出时就出现下跌情况，如当地时间21日，美国总统特朗普称已对伊朗境内三处核设施发动空袭，导致美国股市股指期货下跌，三大股指期货跌幅在0.2% – 0.4%之间。英国投资银行Panmure Liberum认为，如果伊朗关闭霍尔木兹海峡，股市可能会下跌10%至20%。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;能源板块短期波动&lt;/strong&gt;：一方面，油价短期可能会飙升。有市场人士预测，若霍尔木兹海峡被封锁，布伦特原油期货价格可能在短期内飙升至120 – 130美元/桶区间。高盛和摩根大通预测，长期封锁可能导致油价突破100美元/桶，极端情况下甚至突破130美元。这会使得美国能源板块中的石油开采、油服等相关企业股价在短期内可能会上涨，如6月23日盘前交易时段，美股能源板块呈现强劲上涨态势，休斯敦能源股价飙升超过42%，美国能源涨幅超过25%，Indonesia Energy上涨超过21%。另一方面，若封锁持续，高油价会增加美国企业的生产成本，挤压其他行业的利润空间，从而对能源板块的长期业绩产生负面影响。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;航空、运输等板块承压&lt;/strong&gt;：航空燃油成本占航空公司运营成本的30% – 40%，油价飙升将直接挤压航空公司的利润率。同时，运输行业的燃料成本上升，也会导致快递费、机票价格、进口商品运费上涨，使得航空、运输等板块的股票价格下跌。如在以往类似地缘冲突导致油价上涨的情况下，航空、运输板块首当其冲受到影响。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;通胀压力增加影响消费板块&lt;/strong&gt;：油价上涨将推高美国的通货膨胀水平，摩根大通估算，油价每上涨10美元，美国通胀压力就会增加0.3% – 0.4%。通胀上升会导致消费者的实际购买力下降，进而影响消费板块的业绩，消费板块的股票可能会面临下跌压力。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;h3 id="二长期1年影响"&gt;（二）长期（1年）影响&lt;/h3&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;经济衰退风险增加&lt;/strong&gt;：德意志银行警告称，油价长期高于120美元/桶可能引发类似1973年或2022年的经济衰退。若霍尔木兹海峡长期被封锁，油价持续维持在高位，会导致美国企业的生产成本大幅上升，消费者的消费能力下降，从而抑制经济增长，增加经济衰退的风险。在经济衰退预期下，美国股票市场整体可能会面临较大的下行压力。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;能源结构调整影响相关板块&lt;/strong&gt;：长期来看，高油价会促使美国加快能源结构调整的步伐，加大对新能源的开发和利用，减少对传统石油能源的依赖。这将使得新能源板块如光伏、风电等可能会迎来发展机遇，相关企业的股票价格可能会上涨。而传统石油行业的市场份额可能会逐渐下降，相关企业的业绩和股价可能会受到一定的影响。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;美联储货币政策调整影响股市&lt;/strong&gt;：油价飙升可能加剧美国通胀压力，迫使美联储维持高利率以抑制通胀；但若全球经济因能源危机陷入衰退，美联储可能会面临降息压力，美联储将进退维谷。货币政策的不确定性会增加股票市场的波动，投资者的风险偏好可能会降低，对股票市场的资金流入产生影响。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;h2 id="三伊朗封锁霍尔木兹海峡对中国股票市场的影响"&gt;三、伊朗封锁霍尔木兹海峡对中国股票市场的影响&lt;/h2&gt;&#10;&lt;h3 id="一短期3个月内影响-1"&gt;（一）短期（3个月内）影响&lt;/h3&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;受益板块表现活跃&lt;/strong&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;能源板块&lt;/strong&gt;：油气开采企业如通源石油、中曼石油等将直接受益于油价上涨带来的盈利提升。煤化工与替代能源同样迎来机遇，油价暴涨将显著增强煤制油、煤制气的经济性，同时推升光伏、储能等新能源的装机需求。如冲突爆发以来，科力股份30CM涨停，港股山东墨龙更一度飙涨160%。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;黄金板块&lt;/strong&gt;：地缘风险升级推动黄金价格突破3420美元/盎司，市场避险情绪明显升温，山东黄金、西部黄金等A股黄金概念股已应声涨停。金价上涨会使得黄金企业的利润增厚，相关股票受到资金青睐。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;军工与高端装备板块&lt;/strong&gt;：地区冲突加剧印证国防建设的紧迫性，导弹防御、无人作战系统等现代装备产业链需求强化。中国军工装备在实战中积累经验，性能得到验证，为出口打开了更多可能性，相关企业如航天彩虹、洪都航空等的订单可能会增加，股价可能会上涨。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;航运物流板块&lt;/strong&gt;：若航线中断，全球油轮运距被迫拉长，需绕行好望角，叠加运输风险溢价上升，超大型油轮运费可能暴涨。中远海能、招商轮船作为油运龙头直接受益，冲突爆发后，凤凰航运涨停，部分海运航线运费一周暴涨250%。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;核污染防治板块&lt;/strong&gt;：伊朗核设施遇袭引发核泄漏担忧，应急监测与治理需求激增，捷强装备作为核生化检测设备龙头，军方订单占比超60%，已获资金抢筹涨停。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;承压板块面临压力&lt;/strong&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;航空与交通运输板块&lt;/strong&gt;：航油成本上涨30%将挤压利润率5 – 8%，航线中断风险加剧，航空公司如中国国航等将面临利润压缩，物流企业如顺丰控股等的运输成本也将显著攀升，相关股票价格可能会下跌。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;高耗能制造业&lt;/strong&gt;：化工（万华化学）、钢铁（宝钢股份）等行业受油价传导影响，成本端压力加剧，部分企业或被迫减产，股票价格可能会受到抑制。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;高估值科技及制造业&lt;/strong&gt;：全球避险情绪引发外资回流，叠加芯片供应链风险（英特尔以色列工厂可能停产），高估值科技及制造业板块的股票可能会面临下跌压力。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;消费与零售板块&lt;/strong&gt;：能源涨价传导至化工原料（如聚乙烯），日化、汽车被迫提价或利润承压；中东奢侈品消费或下滑10 – 15%，消费与零售板块的股票表现可能不佳。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;h3 id="二长期1年影响-1"&gt;（二）长期（1年）影响&lt;/h3&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;能源转型加速带来机遇&lt;/strong&gt;：石油供应风险可能促使中国加快光伏、风电、电动汽车等新能源产业的布局，减少对化石燃料的依赖。新能源相关企业如隆基绿能、宁德时代等在长期内可能会受益于政策支持和市场需求的增长，股票价格可能会有较好的表现。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;产业技术输出与人民币国际化带来机会&lt;/strong&gt;：中沙5GW太阳能电站协议拉动光伏组件出口增长40%，实战经验助推中国无人机、导弹技术升级，节省5年验证时间，相关军工和高端装备企业可能会在国际市场上获得更多的份额。同时，中伊贸易35%用人民币结算，与阿联酋试点数字人民币跨境支付（手续费降70%），削弱美元霸权，跨境支付金融科技公司等可能会迎来发展机遇。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;经济结构调整影响不同板块&lt;/strong&gt;：长期来看，中国可能会进一步优化经济结构，降低对高耗能、高污染产业的依赖，提高产业的附加值和竞争力。一些传统产业可能会面临转型升级的压力，相关股票价格可能会受到影响；而新兴产业如高端制造业、科技产业等可能会迎来发展机遇，股票价格可能会上涨。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;h2 id="四结论"&gt;四、结论&lt;/h2&gt;&#10;&lt;p&gt;伊朗封锁霍尔木兹海峡对中美股票市场都将产生重大影响，无论是短期还是长期。在短期，市场主要受地缘政治风险和油价波动的影响，股票市场呈现出板块分化的特征；在长期，经济增长、能源结构调整和货币政策等因素将对股票市场产生更为深远的影响。投资者需要密切关注霍尔木兹海峡局势的发展，合理调整投资策略，以应对市场的变化。&lt;/p&gt;&#10;</description></item><item><title>Insights into DeepSeek-V3: Scaling Challenges and Reflections onHardware for AI Architectures</title><link>https://blog.havenice.day/2025/05/16/insights-into-deepseek-v3-scaling-challenges-and-reflections-onhardware-for-ai-architectures/</link><pubDate>Fri, 16 May 2025 11:32:11 +0800</pubDate><guid>https://blog.havenice.day/2025/05/16/insights-into-deepseek-v3-scaling-challenges-and-reflections-onhardware-for-ai-architectures/</guid><description>&lt;p&gt;&lt;a href="https://www.arxiv.org/pdf/2505.09343"&gt;https://www.arxiv.org/pdf/2505.09343&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;深度解析 DeepSeek-V3：扩展挑战与硬件架构反思&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;背景与目标&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;DeepSeek-V3 是由 &lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=DeepSeek-AI&amp;amp;zhida_source=entity"&gt;DeepSeek-AI&lt;/a&gt; 开发的超大规模语言模型，基于其前代 DeepSeek-V2 的架构进行了多方面的优化。论文的主要目标是：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;分析大规模 LLM 在训练和推理中面临的&lt;strong&gt;硬件瓶颈&lt;/strong&gt;。&lt;/li&gt;&#10;&lt;li&gt;探讨模型与**硬件协同设计（co-design）**的必要性。&lt;/li&gt;&#10;&lt;li&gt;提出面向未来的&lt;strong&gt;AI 硬件架构建议&lt;/strong&gt;，以支持更高效的 LLM 扩展。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;论文主要聚焦于其&lt;strong&gt;系统级架构设计&lt;/strong&gt;、&lt;strong&gt;通信机制优化&lt;/strong&gt;、&lt;strong&gt;网络拓扑结构改进&lt;/strong&gt;，以及这些因素如何影响模型的性能和成本效率。&lt;/p&gt;&#10;&lt;h2 id="2deepseek-v3-的核心架构设计"&gt;2. &lt;strong&gt;DeepSeek-V3 的核心架构设计&lt;/strong&gt;&lt;/h2&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/v2-6768971795db0886e4b6561d6d0d042f_1440w.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;h3 id="21多头潜在注意力机制multi-head-latent-attention"&gt;2.1 &lt;strong&gt;多头潜在注意力机制（Multi-head Latent Attention, &lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=MLA&amp;amp;zhida_source=entity"&gt;MLA&lt;/a&gt;）&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;p&gt;MLA 是一种旨在提升内存效率的注意力机制。传统的 &lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=Transformer+%E6%B3%A8%E6%84%8F%E5%8A%9B%E6%9C%BA%E5%88%B6&amp;amp;zhida_source=entity"&gt;Transformer 注意力机制&lt;/a&gt;需要存储大量的 Key/Value 缓存（KV Cache），这在处理长序列时会造成显著的内存负担。MLA 引入了“潜在表示”（latent representation），通过压缩 KV 缓存来减少内存占用。&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/v2-25a11b8a869ceb729533a9ada0229ecf_1440w.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;h3 id="22混合专家架构mixture-of-experts"&gt;2.2 &lt;strong&gt;混合专家架构（Mixture of Experts, &lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=MoE&amp;amp;zhida_source=entity"&gt;MoE&lt;/a&gt;）优化&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;p&gt;MoE 是 DeepSeek-V3 的核心技术之一，它通过稀疏激活机制，在不增加计算资源的前提下显著提升模型参数规模。&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/v2-4a3cb672874945ad3ced4b0ee38f8455_1440w.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;参数规模大但计算成本低&lt;/strong&gt;：例如，DeepSeek-V3 总参数达到 671B，但每个 token 只激活约 37B 参数。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;灵活的路由策略&lt;/strong&gt;：采用 Top-K 路由算法选择最相关的专家模块。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;分布式训练优化&lt;/strong&gt;：结合 All-to-All 通信模式，实现高效的专家并行（Expert Parallelism, EP）。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;实现难点：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;通信开销大&lt;/strong&gt;：EP 需要频繁的 All-to-All 数据交换。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;负载不均衡&lt;/strong&gt;：某些专家可能被频繁调用，造成热点问题。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;为解决这些问题，DeepSeek 团队开发了 &lt;strong&gt;DeepEP&lt;/strong&gt;，一个高效的 EP 实现库，并开源供社区使用。&lt;/p&gt;&#10;&lt;h3 id="23多令牌预测模块multi-token-prediction-module"&gt;2.3 &lt;strong&gt;多令牌预测模块（Multi-Token Prediction Module, &lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=MTP&amp;amp;zhida_source=entity"&gt;MTP&lt;/a&gt;）&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;p&gt;MTP 是为了加速推理而设计的模块，允许模型在同一时间步预测多个 token，从而显著提高吞吐量。&lt;br&gt;&#10;工作原理：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;在解码阶段，同时生成多个候选 token。&lt;/li&gt;&#10;&lt;li&gt;利用 speculative sampling 策略，提前预测后续 token。&lt;/li&gt;&#10;&lt;li&gt;结合硬件加速器（如 GPU 的 Tensor Core）提升并行处理能力。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;效果：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;显著减少推理延迟。&lt;/li&gt;&#10;&lt;li&gt;在消费级 GPU 上也可实现高吞吐（如运行 DeepSeek-V3 的 TPS 达到 ~20）。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="3低精度计算与通信优化"&gt;3. &lt;strong&gt;低精度计算与通信优化&lt;/strong&gt;&lt;/h2&gt;&#10;&lt;p&gt;随着 LLM 的参数规模不断增长，传统高精度浮点运算（如 FP32 或 BF16）在计算资源、内存带宽和能耗方面带来了巨大压力。尤其是在 MoE 架构中，专家模块之间的频繁通信进一步加剧了对带宽的需求。&lt;br&gt;&#10;MoE 中有两个关键阶段涉及大量通信：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;Dispatch 阶段&lt;/strong&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;输入 token 被路由到多个专家模块。&lt;/li&gt;&#10;&lt;li&gt;使用 FP8 或 &lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=LogFMT&amp;amp;zhida_source=entity"&gt;LogFMT&lt;/a&gt; 压缩后，传输数据量减少，通信时间显著缩短。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;Combine 阶段&lt;/strong&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;来自多个专家的输出被聚合。&lt;/li&gt;&#10;&lt;li&gt;如果在此阶段也使用压缩通信，可以避免带宽瓶颈，提升聚合效率。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;DeepSeek 团队提出了 &lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=FP8+%E6%B7%B7%E5%90%88%E7%B2%BE%E5%BA%A6%E8%AE%AD%E7%BB%83&amp;amp;zhida_source=entity"&gt;FP8 混合精度训练&lt;/a&gt; 和 LogFMT 通信压缩格式 等创新技术，构建了一个以低精度为核心的系统级优化框架，从而在不牺牲模型性能的前提下，显著提升了训练和推理效率。&lt;/p&gt;&#10;&lt;h3 id="31fp8-混合精度训练"&gt;3.1 &lt;strong&gt;FP8 混合精度训练&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;p&gt;DeepSeek-V3 采用了 FP8 混合精度训练技术，以降低计算和通信带宽需求。&lt;br&gt;&#10;实现方式：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;在关键计算路径（如注意力矩阵计算、FFN 层）使用 FP8。&lt;/li&gt;&#10;&lt;li&gt;其他部分保留更高精度（如 BF16）以保持数值稳定性。&lt;/li&gt;&#10;&lt;li&gt;动态调整精度策略，根据层或操作类型切换精度。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;优点：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;减少内存占用和数据传输带宽。&lt;/li&gt;&#10;&lt;li&gt;加快训练速度，尤其在带宽受限的集群环境中。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;尽管 FP8 混合精度训练带来了显著收益，但仍存在一些限制：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;累加精度不足 Hopper GPU 的 Tensor Core 在执行 FP8 GEMM 时仅维护 13 位尾数（FP22），并截断超出部分。这可能导致：&#10;&lt;ul&gt;&#10;&lt;li&gt;长序列注意力计算中的误差累积。&lt;/li&gt;&#10;&lt;li&gt;权重更新不稳定，影响收敛速度。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;数值稳定性问题 FP8 的动态范围有限，尤其在某些极端输入场景下可能出现溢出或下溢，影响模型稳定性。&lt;/li&gt;&#10;&lt;li&gt;软件支持不完善 目前主流框架（如 PyTorch）对 FP8 的支持仍处于早期阶段，需大量自定义代码实现：&#10;&lt;ul&gt;&#10;&lt;li&gt;自定义量化/反量化函数。&lt;/li&gt;&#10;&lt;li&gt;自定义 GEMM 内核（如 DeepGEMM 开源项目）。&lt;/li&gt;&#10;&lt;li&gt;混合精度调度逻辑复杂。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;未来方向：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;为 FP8 或自定义精度格式提供原生压缩/解压单元 ，是解决当前 AI 通信瓶颈的重要方向。&lt;/li&gt;&#10;&lt;li&gt;它能显著降低通信带宽需求 ，并提升通信效率 ，尤其适用于 MoE 这类通信密集型任务。&lt;/li&gt;&#10;&lt;li&gt;未来硬件应考虑将这些功能集成到网络接口控制器（NIC）、I/O die 或 GPU 内部逻辑中 ，以实现真正的高效通信&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="32-logfmt通讯压缩"&gt;3.2 LogFMT通讯压缩&lt;/h3&gt;&#10;&lt;p&gt;LogFMT 是 DeepSeek-V3 提出的一种基于对数空间的新型量化格式，在一定程度上是为了弥补 FP8 的不足而提出的 。其核心思想是将数值从线性空间转换到对数空间，从而使得数据分布更均匀，便于进行低比特量化。&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/v2-312c8f3e1cd3bc8069ed3139c1868135_1440w.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;数据结构定义（LogFMT-nBit）：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;第一位为符号位 S。&lt;/li&gt;&#10;&lt;li&gt;剩余 n-1 位编码 log(|xi|) 的值。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;每个 tile 独立计算 min/max，并据此归一化其他值，实现自适应量化范围。&lt;br&gt;&#10;主要可以应用在以下几个阶段：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;MoE 的 Dispatch 阶段 ：令牌被路由前进行低精度编码。&lt;/li&gt;&#10;&lt;li&gt;KV Cache 压缩 ：缓存 Key/Value 向量，减少内存占用。&lt;/li&gt;&#10;&lt;li&gt;中间结果通信 ：Transformer 层之间传递激活值时使用。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;存在的局限:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;当前 GPU 不支持 LogFMT 原生运算，需软件层实现，带来额外延迟。&lt;/li&gt;&#10;&lt;li&gt;编解码过程较复杂，增加了计算负担。&lt;/li&gt;&#10;&lt;li&gt;目前主要用于通信压缩，在关键计算路径（如注意力矩阵、FFN 层）仍需使用 FP8/BF16。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;未来方向：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;硬件原生支持 ：建议未来 GPU 和网络芯片支持 LogFMT 编解码功能。&lt;/li&gt;&#10;&lt;li&gt;混合精度策略 ：结合 LogFMT 与 FP8/BF16，在不同阶段灵活切换。&lt;/li&gt;&#10;&lt;li&gt;自动 rounding 到线性空间 ：确保量化过程无偏，避免在对数空间直接舍入造成的误差。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="4互联网络优化与-scale-upscale-out-架构融合"&gt;4. &lt;strong&gt;互联网络优化与 Scale-up/Scale-out 架构融合&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;p&gt;DeepSeek-V3 基于 NVIDIA H800 GPU 构建，并采用高性能互连技术（如 &lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=InfiniBand&amp;amp;zhida_source=entity"&gt;InfiniBand&lt;/a&gt; 和 &lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=NVLink&amp;amp;zhida_source=entity"&gt;NVLink&lt;/a&gt;）进行节点间通信；&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/v2-24b17965fdeb2f001068e76dbd04fa24_1440w.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;网络拓扑：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;每个 H800 节点配备 8 个 400Gbps InfiniBand (IB) NIC 。&lt;/li&gt;&#10;&lt;li&gt;实现了接近 50GB/s 的有效带宽 （考虑小数据包和延迟影响后实际约为 40GB/s）。&lt;/li&gt;&#10;&lt;li&gt;相比之下，NVLink 提供约 160GB/s 的带宽 （单向）。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;为满足监管要求，FP64 性能和 NVLink 带宽被削减。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;NVLink 带宽从 900 GB/s 降至 400 GB/s，导致节点内通信能力下降&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;为此， 每个节点配备 8 个 400Gbps InfiniBand NIC，增强节点间通信能力，同时DeepSeek-V3 通过软件优化（如 &lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=Node-Limited+Routing&amp;amp;zhida_source=entity"&gt;Node-Limited Routing&lt;/a&gt;、LogFMT 等）弥补硬件限制，实现高效训练。&lt;/p&gt;&#10;&lt;h3 id="41-hardware-aware-parallelism硬件感知并行"&gt;4.1 Hardware-Aware Parallelism(硬件感知并行)&lt;/h3&gt;&#10;&lt;p&gt;DeepSeek 团队提出了 Hardware-Aware Parallelism 策略，旨在根据硬件特性优化模型并行方式，以提升整体训练和推理效率。&lt;/p&gt;&#10;&lt;figure class="wp-block-table"&gt;&lt;table class="has-fixed-layout"&gt;&lt;tbody&gt;&lt;tr&gt;&lt;td&gt;并行类型&lt;/td&gt;&lt;td&gt;是否使用&lt;/td&gt;&lt;td&gt;使用场景&lt;/td&gt;&lt;td&gt;说明&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;&lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=Tensor+Parallelism&amp;amp;zhida_source=entity" rel="noreferrer noopener" target="_blank"&gt;Tensor Parallelism&lt;/a&gt; (TP)&lt;/td&gt;&lt;td&gt;否（训练时）&lt;br/&gt;是（推理时）&lt;/td&gt;&lt;td&gt;推理加速&lt;/td&gt;&lt;td&gt;避免在训练中使用，因 NVLink 带宽限制导致低效；推理时选择性使用以降低延迟。&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;&lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=Pipeline+Parallelism&amp;amp;zhida_source=entity" rel="noreferrer noopener" target="_blank"&gt;Pipeline Parallelism&lt;/a&gt; (PP)&lt;/td&gt;&lt;td&gt;是&lt;/td&gt;&lt;td&gt;训练加速&lt;/td&gt;&lt;td&gt;使用 DualPipe 技术重叠 attention 与 MoE 计算，减少 pipeline bubbles。&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;Expert Parallelism (EP)&lt;/td&gt;&lt;td&gt;是&lt;/td&gt;&lt;td&gt;MoE 分布式处理&lt;/td&gt;&lt;td&gt;使用 DeepEP 实现高效的 All-to-All 通信，开源实现。&lt;/td&gt;&lt;/tr&gt;&lt;/tbody&gt;&lt;/table&gt;&lt;/figure&gt;&#10;&lt;h3 id="42-模型架构与硬件协同设计-node-limited-routing"&gt;4.2 模型架构与硬件协同设计： Node-Limited Routing&lt;/h3&gt;&#10;&lt;p&gt;在 DeepSeek-V3 所使用的 NVIDIA H800 GPU 架构 中，存在明显的 Scale-Up（节点内）与 Scale-Out（节点间）通信带宽不匹配问题 ：&lt;/p&gt;&#10;&lt;figure class="wp-block-table"&gt;&lt;table class="has-fixed-layout"&gt;&lt;tbody&gt;&lt;tr&gt;&lt;td&gt;通信类型&lt;/td&gt;&lt;td&gt;带宽理论值&lt;/td&gt;&lt;td&gt;实际有效带宽&lt;/td&gt;&lt;td&gt;带宽比例（近似）&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;Scale-Up (NVLink)&lt;/td&gt;&lt;td&gt;200 GB/s&lt;/td&gt;&lt;td&gt;~160 GB/s&lt;/td&gt;&lt;td&gt;4:1&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;Scale-Out (IB NIC)&lt;/td&gt;&lt;td&gt;50 GB/s&lt;/td&gt;&lt;td&gt;~40 GB/s （由于小数据包传输和延迟影响）&lt;/td&gt;&lt;td&gt;–&lt;/td&gt;&lt;/tr&gt;&lt;/tbody&gt;&lt;/table&gt;&lt;/figure&gt;&#10;&lt;p&gt;为了解决这些问题，DeepSeek 团队提出了 Node-Limited Routing（节点限制路由） 和 TopK 专家选择策略 ，通过将专家部署在有限数量的节点上，从而减少跨节点通信量。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;专家分组与部署&#10;&lt;ul&gt;&#10;&lt;li&gt;将总共 256 个专家 分成 8 组 。&lt;/li&gt;&#10;&lt;li&gt;每组包含 32 个专家 ，并部署在 同一个节点 上。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;Token 路由策略&#10;&lt;ul&gt;&#10;&lt;li&gt;每个 token 最多被路由到 4 个节点 。&lt;/li&gt;&#10;&lt;li&gt;这样可以确保：&#10;&lt;ul&gt;&#10;&lt;li&gt;跨节点通信量减少。&lt;/li&gt;&#10;&lt;li&gt;同一节点内的专家可通过高速 NVLink 通信，降低延迟。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;假设使用 8 个节点 （共 64 个 GPU），每个 GPU 有 4 个专家，总共有 256 个专家，每个 token 被路由到 1 个共享专家 + 8 个目标专家。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;传统实现：&#10;&lt;ul&gt;&#10;&lt;li&gt;如果这 8 个目标专家分布在所有 8 个节点上，则需进行 8 次 IB 通信。&lt;/li&gt;&#10;&lt;li&gt;总通信时间为 &lt;code&gt;8 * t&lt;/code&gt;（t 为单次 IB 传输时间）。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;Node-Limited Routing 方法&#10;&lt;ul&gt;&#10;&lt;li&gt;目标专家被限制在最多 4 个节点。&lt;/li&gt;&#10;&lt;li&gt;每个节点只需一次 IB 传输，然后通过 NVLink 在节点内广播。&lt;/li&gt;&#10;&lt;li&gt;总通信时间降至 &lt;code&gt;4 * t&lt;/code&gt;，节省了 50% 的通信开销。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="43scale-up-与-scale-out-网络融合"&gt;4.3 &lt;strong&gt;Scale-up 与 Scale-out 网络融合&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;p&gt;当前硬件中，Scale-up（节点内）和 Scale-out（节点间）网络是分离的，导致通信路径复杂、延迟高。&lt;br&gt;&#10;尽管 MPFT 和 EP 等技术取得了良好效果，但仍面临一些挑战：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;当前 IB ConnectX-7 不支持多平面无缝通信，需通过节点转发，增加延迟。&lt;/li&gt;&#10;&lt;li&gt;软件复杂度高 ：&#10;&lt;ul&gt;&#10;&lt;li&gt;Node-Limited Routing 策略增加了通信流水线 kernel 的实现复杂度。&lt;/li&gt;&#10;&lt;li&gt;GPU Streaming Multiprocessors(SM) 需要同时处理网络消息填充和 NVLink 转发，消耗计算资源。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;内存一致性问题 ：&#10;&lt;ul&gt;&#10;&lt;li&gt;使用 load/store 语义进行跨节点通信时，需显式插入内存屏障（fence），影响吞吐。&lt;/li&gt;&#10;&lt;li&gt;RDMA 中也存在 out-of-order synchronization 问题。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;未来方向：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;统一网络适配器（Unified Network Adapter）、&#10;&lt;ul&gt;&#10;&lt;li&gt;设计支持统一 Scale-Up 与 Scale-Out 网络的 NIC 或 I/O Die。&lt;/li&gt;&#10;&lt;li&gt;支持基本交换功能，如将 Scale-Out 数据包转发到特定 GPU。&lt;/li&gt;&#10;&lt;li&gt;使用单一 LID/IP 地址 + 策略路由，简化地址管理。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;专用通信协处理器（Dedicated Communication Co-Processor）&#10;&lt;ul&gt;&#10;&lt;li&gt;引入专用协处理器或可编程组件（如 I/O Die），处理网络流量。&lt;/li&gt;&#10;&lt;li&gt;卸载 GPU SM 上的通信任务，防止性能退化。&lt;/li&gt;&#10;&lt;li&gt;支持硬件加速的内存拷贝、广播、转发操作。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;灵活的数据转发、广播与归约机制&#10;&lt;ul&gt;&#10;&lt;li&gt;硬件应支持灵活的转发机制，用于 MoE 分发和聚合。&lt;/li&gt;&#10;&lt;li&gt;支持高效的归约操作（reduce），提升通信效率。&lt;/li&gt;&#10;&lt;li&gt;实现类似于当前 GPU SM-based 实现的机制，但由硬件直接完成。、&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;低延迟互连与同步原语&#10;&lt;ul&gt;&#10;&lt;li&gt;支持 acquire/release 同步语义，减少软件同步开销。&lt;/li&gt;&#10;&lt;li&gt;提供硬件级原子操作、屏障指令，提升通信效率。&lt;/li&gt;&#10;&lt;li&gt;支持乱序包到达的硬件排序（RAR 机制）。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;实现 Scale-Up 与 Scale-Out 网络融合之后，AI 系统将获得以下显著优势：&lt;/p&gt;&#10;&lt;figure class="wp-block-table"&gt;&lt;table class="has-fixed-layout"&gt;&lt;tbody&gt;&lt;tr&gt;&lt;td&gt;优势&lt;/td&gt;&lt;td&gt;描述&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;更低的通信延迟&lt;/td&gt;&lt;td&gt;统一网络接口减少了中间转发步骤，提升通信效率。&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;更高的有效带宽利用率&lt;/td&gt;&lt;td&gt;可动态分配带宽资源，适应不同工作负载需求。&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;更简单的软件栈&lt;/td&gt;&lt;td&gt;无需区分 intra-node 与 inter-node 通信，简化调度逻辑。&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;更强的可扩展性&lt;/td&gt;&lt;td&gt;更容易支持超大规模集群（如 10k+ GPU）。&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;更好的负载均衡能力&lt;/td&gt;&lt;td&gt;可根据网络状态动态选择最优路径，避免热点瓶颈。&lt;/td&gt;&lt;/tr&gt;&lt;/tbody&gt;&lt;/table&gt;&lt;/figure&gt;&#10;&lt;h3 id="44-带宽争用与延迟"&gt;4.4 带宽争用与延迟&lt;/h3&gt;&#10;&lt;p&gt;在 H800 GPU 架构中，GPU 和 CPU 之间的 PCIe 接口是连接主存和显存的关键路径。然而，在大规模训练或推理过程中，多个任务会同时争夺有限的 PCIe 带宽，导致性能下降。&lt;br&gt;&#10;比如在以下两种场景下：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;KV Cache 传输 ：&#10;&lt;ul&gt;&#10;&lt;li&gt;在推理阶段，需要频繁将 Key/Value cache从 CPU 内存拷贝到 GPU 显存。&lt;/li&gt;&#10;&lt;li&gt;这类操作可能占用数十 GB/s 的带宽。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;专家并行（EP）通信 ：&#10;&lt;ul&gt;&#10;&lt;li&gt;MoE 模型中的 All-to-All 通信也依赖 IB NIC 和 GPU 之间的数据交换。&lt;/li&gt;&#10;&lt;li&gt;如果 EP 通信和 KV Cache 传输同时进行，PCIe 带宽就会成为瓶颈。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;因此，会导致存在以下问题：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;性能下降 ：带宽争用会导致整体吞吐下降。&lt;/li&gt;&#10;&lt;li&gt;延迟增加 ：某些任务的完成时间被显著延长。&lt;/li&gt;&#10;&lt;li&gt;资源利用率低 ：GPU 可能因等待数据而处于空闲状态&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;优化建议：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;动态优先级调度机制，根据不同类型的流量需求，动态调整带宽分配策略。保证关键任务（如推理任务）的低延迟执行。防止非关键任务占用过多带宽，提升整体效率。&#10;&lt;ul&gt;&#10;&lt;li&gt;对不同类型流量设定不同优先级，例如：&#10;&lt;ul&gt;&#10;&lt;li&gt;高优先级：EP、TP、KV Cache 传输&lt;/li&gt;&#10;&lt;li&gt;中低优先级：其他后台任务&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;在 PCIe 上暴露 Traffic Class (TC) 给用户空间程序，实现灵活控制。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;将网卡直接集成到 I/O Die 中（Chiplet架构），减少 PCIe 成为瓶颈的风险，提升整体系统的可扩展性和稳定性，并降低通信延迟&#10;&lt;ul&gt;&#10;&lt;li&gt;将 InfiniBand 或 RoCE 网卡直接集成到封装级别的 I/O Die 中。&lt;/li&gt;&#10;&lt;li&gt;通过封装内互连技术（如 NVLink、Infinity Fabric）连接 GPU Compute Die。、&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;使用 NVLink 替代 PCIe，统一 Scale-Up 域内的 CPU-GPU 通信 ，通过优化节点内部 CPU 与 GPU 的通信效率，避免 PCIe 成为瓶颈&#10;&lt;ul&gt;&#10;&lt;li&gt;使用 NVLink、Infinity Fabric 等高速互连技术替代传统 PCIe。&lt;/li&gt;&#10;&lt;li&gt;将 CPU 和 GPU 放入同一个 Scale-Up 域中。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="5-大规模网络驱动设计"&gt;5 大规模网络驱动设计&lt;/h2&gt;&#10;&lt;p&gt;随着 LLM（大型语言模型）参数规模的指数级增长，传统的三层 Fat-Tree（FT3）拓扑在成本、可扩展性和鲁棒性方面逐渐暴露出局限性。特别是在 MoE 架构下，All-to-All 通信密集型操作对带宽提出了更高要求。&lt;/p&gt;&#10;&lt;h3 id="51"&gt;&lt;strong&gt;5.1 &lt;a href="https://zhida.zhihu.com/search?content_id=257770090&amp;amp;content_type=Article&amp;amp;match_order=1&amp;amp;q=Multi-Plane+Fat-Tree+%E7%BD%91%E7%BB%9C%E6%8B%93%E6%89%91&amp;amp;zhida_source=entity"&gt;Multi-Plane Fat-Tree 网络拓扑&lt;/a&gt;（MPFT）&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;p&gt;DeepSeek-V3 部署了一个基于 InfiniBand 的&lt;strong&gt;多平面两层 Fat-Tree 网络（MPFT）&lt;/strong&gt;，用于替代传统的三层 Fat-Tree 架构，如图Figure 3所示。&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/v2-a9c675f299cd8de76df7162e2b839dce_1440w.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;架构特点：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;每个节点配备 8 块 GPU 和 8 个 400Gbps InfiniBand NIC 。&lt;/li&gt;&#10;&lt;li&gt;每块 GPU 对应一个独立的 IB NIC，属于不同的“网络平面”（plane）。&lt;/li&gt;&#10;&lt;li&gt;所有节点连接到 64-port 400G IB 交换机 ，构成两层 Fat-Tree。&lt;/li&gt;&#10;&lt;li&gt;此外，每个节点还配置了一个 RoCE NIC，用于连接分布式文件系统（如 3FS），实现存储网络隔离。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;优点：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;成本更低：相比三层 Fat-Tree，MPFT 可节省高达 40% 的网络成本。&lt;/li&gt;&#10;&lt;li&gt;更高的可扩展性：理论上支持最多 16,384 个 GPU。&lt;/li&gt;&#10;&lt;li&gt;流量隔离：每个平面独立运行，避免跨平面拥塞。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/v2-5db0ba7383b76aa87cfda3bbcbe1d110_1440w.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;尽管 MPFT 在理论上具有强大的优势，理想情况如Figure 4所示，&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/v2-e4effaaa70a2a04871419ae89151bcc0_1440w.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;但实际上受限于IB ConnectX-7硬件，主要表现在：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;不支持真正的多平面通信。&lt;/li&gt;&#10;&lt;li&gt;QP 数据包无法自动在多个平面上负载均衡。&lt;/li&gt;&#10;&lt;li&gt;若需要跨平面通信，必须通过节点内转发（intra-node forwarding），引入额外延迟。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;但是NVIDIA 新一代网卡 ConnectX-8 已原生支持 4 个网络平面（4-plane），可以在一个 QP 上实现真正的 multi-path packet spraying。并支持硬件级乱序包处理，确保数据一致性。&lt;/p&gt;&#10;&lt;h3 id="52-低延迟网络"&gt;5.2 低延迟网络&lt;/h3&gt;&#10;&lt;p&gt;DeepSeek-V3 的训练依赖于超大规模集群（如 2048 块 H800 GPU），而 MoE（Mixture of Experts）架构下的专家并行（EP）操作对带宽和延迟都非常敏感。因此，网络延迟的优化对于提升整体系统性能至关重要。&lt;br&gt;&#10;1. &lt;strong&gt;InfiniBand vs. RoCE：性能对比&lt;/strong&gt;&lt;br&gt;&#10;在 DeepSeek-V3 的部署中，使用了 InfiniBand（IB）作为主要通信协议。为了评估其性能优势，论文对比了 IB 与 RoCE 在不同场景下的端到端延迟表现。&lt;/p&gt;&#10;&lt;p&gt;64B 数据传输延迟对比：&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/v2-c06ab1e5f43d68bb843215d2109d0983_1440w.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;可以发现：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;InfiniBand 延迟最低&lt;/strong&gt;，是当前最适合 MoE 架构下 All-to-All 通信的网络协议。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;RoCE 虽具成本优势，但延迟较高&lt;/strong&gt;，尤其在跨 Leaf 交换机时表现不佳。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;NVLink&lt;/strong&gt; 提供了最低的节点内通信延迟，适用于 Tensor Parallelism 和 KV Cache 传输等 intra-node 操作。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;尽管 RoCE 在成本上具有一定优势，但其延迟和扩展性仍不能完全满足大规模 AI 系统的需求。为此，论文提出了以下几点改进建议：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;专用低延迟 RoCE 交换机&#10;&lt;ul&gt;&#10;&lt;li&gt;当前以太网交换机包含大量不必要的功能（如 QoS、VLAN 等），增加了处理延迟。&lt;/li&gt;&#10;&lt;li&gt;建议开发专门面向 RDMA 工作负载的 RoCE 交换机，去除冗余功能，提升性能。&lt;/li&gt;&#10;&lt;li&gt;示例：Slingshot 架构已证明基于以太网的设计可以实现接近 IB 的延迟表现。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;AI 转发头（AIFH）与低延迟以太网交换机&#10;&lt;ul&gt;&#10;&lt;li&gt;Broadcom 最新推出的 AI Forwarding Header（AIFH）协议可支持更高效的路由机制。&lt;/li&gt;&#10;&lt;li&gt;结合即将发布的低延迟以太网交换机，有望实现媲美 IB 的性能。&lt;/li&gt;&#10;&lt;li&gt;这些技术为未来构建高性价比的 AI 集群提供了新路径。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;拥塞控制算法优化&#10;&lt;ul&gt;&#10;&lt;li&gt;当前 RoCE 使用的拥塞控制机制不够智能，容易导致 Head-of-Line Blocking。&lt;/li&gt;&#10;&lt;li&gt;建议采用 endpoint-driven 拥塞控制算法，动态调节注入速率，避免严重拥塞。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;在 MoE 架构或 All-to-All 通信中，常常涉及大量小数据包传输， 如果由 CPU 处理这些通信任务，CPU 很容易成为瓶颈。特别是在高并发场景下，CPU 的串行处理能力无法满足需求。&lt;br&gt;&#10;InfiniBand GPUDirect Async（IBGDA） 是 NVIDIA 提出的一项用于加速 GPU 与网络设备之间通信的技术。它通过绕过 CPU 的直接参与，使 GPU 能够异步地启动和管理 RDMA操作，从而显著降低通信延迟并提升整体系统吞吐。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;GPU 直接填充 Work Request&#10;&lt;ul&gt;&#10;&lt;li&gt;允许 GPU 直接向 NIC 的队列对（Queue Pair, QP）写入 Work Request（WR）。&lt;/li&gt;&#10;&lt;li&gt;绕过了传统流程中的 CPU 代理线程，减少上下文切换和同步开销。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;异步 Doorbell 写入&#10;&lt;ul&gt;&#10;&lt;li&gt;GPU 可以直接写入 NIC 的 Doorbell 寄存器地址空间，无需等待 CPU。&lt;/li&gt;&#10;&lt;li&gt;使用内存映射 I/O（MMIO）方式实现低延迟触发。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;零拷贝 RDMA 通信&#10;&lt;ul&gt;&#10;&lt;li&gt;数据可以直接从 GPU 显存通过 IB 网络传输到远程节点的 GPU 显存，无需中间 CPU 或系统内存拷贝。&lt;/li&gt;&#10;&lt;li&gt;特别适用于 EP（Expert Parallelism）中的 All-to-All 通信。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;许多研究（包括 DeepSeek 团队开发的 DeepEP ）都采用了 IBGDA 技术，并取得了显著的性能提升。&lt;/p&gt;&#10;&lt;h2 id="6-讨论与对未来硬件架构设计的洞见"&gt;6. 讨论与对未来硬件架构设计的洞见&lt;/h2&gt;&#10;&lt;p&gt;本章节基于 DeepSeek-V3 的实践经验，系统性地总结了当前硬件架构在大规模 AI 工作负载下的局限性，并提出了面向未来的创新方向。主要围绕以下几个方面展开：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;硬件限制的实际影响&lt;/li&gt;&#10;&lt;li&gt;关键挑战与瓶颈分析&lt;/li&gt;&#10;&lt;li&gt;面向未来的硬件优化建议&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;h3 id="61-robustness鲁棒性挑战"&gt;6.1 Robustness（鲁棒性）挑战&lt;/h3&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;互连失败（Interconnect Failures）&#10;&lt;ul&gt;&#10;&lt;li&gt;当前高性能互连协议（如 InfiniBand 和 NVLink）容易出现间歇性断开。&lt;/li&gt;&#10;&lt;li&gt;在通信密集型任务（如 MoE 中的 EP 专家并行）中，即使是短暂中断也可能导致性能显著下降或训练失败。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;单点硬件故障（Single Hardware Failures）&#10;&lt;ul&gt;&#10;&lt;li&gt;包括节点崩溃、GPU 故障、ECC 内存错误等。&lt;/li&gt;&#10;&lt;li&gt;在超大规模部署中，这类故障的概率随系统规模增加而上升，恢复成本高。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;静默数据损坏（Silent Data Corruption）&#10;&lt;ul&gt;&#10;&lt;li&gt;多比特内存翻转或计算错误可能未被 ECC 检测到。&lt;/li&gt;&#10;&lt;li&gt;错误在长期任务中传播，最终影响模型质量。&lt;/li&gt;&#10;&lt;li&gt;目前依赖应用层启发式策略进行检测，无法保证整体系统的可靠性。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;建议改进措施：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;增强的错误检测机制&#10;&lt;ul&gt;&#10;&lt;li&gt;硬件应引入比传统 ECC 更先进的错误检测机制：&#10;&lt;ul&gt;&#10;&lt;li&gt;如 基于校验和的验证 （checksum-based validation）&lt;/li&gt;&#10;&lt;li&gt;或 硬件加速冗余检查 （hardware-accelerated redundancy checks）&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;提供完整的诊断工具包&#10;&lt;ul&gt;&#10;&lt;li&gt;硬件厂商应为终端用户提供全面的诊断工具，帮助用户验证系统完整性。&lt;/li&gt;&#10;&lt;li&gt;这些工具应作为标准硬件套件的一部分，支持持续监控和预防性修复。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;提升系统可信度&#10;&lt;ul&gt;&#10;&lt;li&gt;通过嵌入式的诊断和验证机制，增强整个生命周期内的系统透明性和可信性。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="62-cpu-性能瓶颈与互连优化"&gt;6.2 CPU 性能瓶颈与互连优化&lt;/h3&gt;&#10;&lt;p&gt;尽管 GPU 是深度学习的主要计算单元，但 CPU 在协调计算、管理 I/O 和维持吞吐方面仍不可替代。然而，当前架构存在多个瓶颈：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;PCIe 接口带宽不足&#10;&lt;ul&gt;&#10;&lt;li&gt;PCIe 成为 CPU 与 GPU 之间的主要通信接口，但在大规模参数、梯度或 KV Cache 传输时成为瓶颈。&lt;/li&gt;&#10;&lt;li&gt;例如，饱和 160 条 PCIe 5.0 通道需要超过 640 GB/s 的带宽，对内存带宽提出高达 1 TB/s per node 的需求。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;内存带宽限制&#10;&lt;ul&gt;&#10;&lt;li&gt;当前 DRAM 架构难以满足如此高的带宽要求。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;延迟敏感任务的性能瓶颈&#10;&lt;ul&gt;&#10;&lt;li&gt;内核启动、网络处理等任务对单核 CPU 性能要求高，通常需要基础频率高于 4 GHz 。&lt;/li&gt;&#10;&lt;li&gt;每个 GPU 需要足够多的 CPU 核心来避免控制路径上的瓶颈。&lt;/li&gt;&#10;&lt;li&gt;对于 chiplet 架构，还需要额外核心支持缓存感知的任务划分与隔离。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="63-toward-intelligent-networks-for-ai"&gt;&lt;strong&gt;6.3 Toward Intelligent Networks for AI&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;p&gt;为应对 AI 训练与推理中对低延迟和高吞吐的严苛要求，未来的网络架构应具备的五大关键能力：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;低延迟通信&lt;/li&gt;&#10;&lt;li&gt;自适应流量调度&lt;/li&gt;&#10;&lt;li&gt;高效的拥塞控制&lt;/li&gt;&#10;&lt;li&gt;强鲁棒性和容错机制&lt;/li&gt;&#10;&lt;li&gt;灵活的带宽分配与优先级管理&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;&lt;strong&gt;6.3.1 Co-Packaged Optics（共封装光学技术）&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;在超大规模分布式系统中，传统电气接口的带宽密度和能效已接近极限，引入 &lt;strong&gt;硅光子（Silicon Photonics）技术&lt;/strong&gt;，将光学连接直接集成到芯片封装中，可以获得：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;更高的带宽密度（Bandwidth Density）&lt;/li&gt;&#10;&lt;li&gt;更低的功耗（Energy Efficiency）&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;&lt;strong&gt;6.3.2 Lossless Network（无损网络）&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;AI工作负载（尤其是 MoE 中的 All-to-All 操作）对丢包极为敏感，即使是极小的丢包率也可能导致性能显著下降，可以使用 **Credit-Based Flow Control (CBFC)**实现无丢包传输，CBFC 原理是通过接收端发放信用额度（credit），发送端只有在获得信用后才可发送数据。但会存在以下问题：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;如果仅依赖 CBFC，容易引发严重的 &lt;strong&gt;Head-of-Line Blocking（HOLB）&lt;/strong&gt;，影响整体吞吐。&lt;/li&gt;&#10;&lt;li&gt;在多路径通信中，单一路径上的阻塞可能导致整个流被卡住&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;通过引入 **Endpoint-driven Congestion Control，**如 RTT-based CC（RTTCC）或 Programmed Congestion Control（PCC），能够主动调节注入速率，避免极端拥塞场景。&lt;/p&gt;&#10;&lt;h3 id="633adaptive-routing自适应路由"&gt;6.3.3 &lt;strong&gt;Adaptive Routing（自适应路由）&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;p&gt;传统的 ECMP（Equal-Cost Multi-Path）路由策略无法有效处理 AI 工作负载中高度集中且缺乏随机性的通信模式（如 Data Parallelism 的 AllReduce 或 MoE 的 All-to-All）。自适应路由方法：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;动态选择最优路径，避免热点瓶颈。&lt;/li&gt;&#10;&lt;li&gt;提升网络利用率，减少通信延迟。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;通过这种方式，可以显著缓解 All-to-All 和 Reduce-Scatter 类操作中的热点问题，提高集群整体通信效率和稳定性&lt;/p&gt;&#10;&lt;h3 id="634efficient-fault-tolerant-protocols高效容错协议"&gt;6.3.4 &lt;strong&gt;Efficient Fault-Tolerant Protocols（高效容错协议）&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;p&gt;大规模训练过程中，网络链路中断、硬件故障等异常情况难以避免。若不能快速恢复，可能造成训练中断、模型损坏等问题。可以引入以下方法解决：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;Self-healing Protocols（自愈协议） ：自动检测并修复断开连接。&lt;/li&gt;&#10;&lt;li&gt;Redundant Ports（冗余端口） ：提供多条路径，防止单点故障。&lt;/li&gt;&#10;&lt;li&gt;Rapid Failover Techniques（快速切换机制） ：如链路层重试机制、Selective Retransmission（选择性重传）&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="635-dynamic-resource-management动态资源管理"&gt;&lt;strong&gt;6.3.5 Dynamic Resource Management（动态资源管理）&lt;/strong&gt;&lt;/h3&gt;&#10;&lt;p&gt;AI 系统中常常存在混合工作负载（如同时进行训练与推理），不同任务对带宽、延迟、优先级的需求差异大。优化方向：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;动态带宽分配&lt;/strong&gt;：根据任务类型（如 EP、TP、KV Cache 传输）动态调整可用带宽。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;流量优先级管理&lt;/strong&gt;：区分推理任务与训练任务，在统一集群中保证推理任务的响应速度。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;figure class="wp-block-table"&gt;&lt;table class="has-fixed-layout"&gt;&lt;tbody&gt;&lt;tr&gt;&lt;td&gt;方向&lt;/td&gt;&lt;td&gt;关键技术&lt;/td&gt;&lt;td&gt;优点&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;Co-Packaged Optics&lt;/td&gt;&lt;td&gt;硅光子集成&lt;/td&gt;&lt;td&gt;提升带宽密度与能效&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;Lossless Network&lt;/td&gt;&lt;td&gt;CBFC + Endpoint-driven CC&lt;/td&gt;&lt;td&gt;避免丢包，防止 HOLB（Head-of-Line Blocking）&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;Adaptive Routing&lt;/td&gt;&lt;td&gt;Packet Spraying / Congestion-aware Routing&lt;/td&gt;&lt;td&gt;缓解热点，提升负载均衡&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;Fault-Tolerant Protocols&lt;/td&gt;&lt;td&gt;自愈机制 / 冗余端口 / 快速切换&lt;/td&gt;&lt;td&gt;提升系统鲁棒性&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;Dynamic Resource Management&lt;/td&gt;&lt;td&gt;动态带宽分配 / 流量优先级控制&lt;/td&gt;&lt;td&gt;优化混合工作负载表现&lt;/td&gt;&lt;/tr&gt;&lt;/tbody&gt;&lt;/table&gt;&lt;/figure&gt;&#10;&lt;h3 id="64-内存语义通信与顺序问题memory-semantic-communication-and-ordering-issue"&gt;6.4 内存语义通信与顺序问题（Memory-Semantic Communication and Ordering Issue）&lt;/h3&gt;&#10;&lt;p&gt;使用 load/store 模型进行节点间通信虽然高效且易于编程，但当前实现受限于内存顺序问题：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;发送方写入数据后必须显式发出内存屏障（fence），然后才能更新标志通知接收方。&lt;/li&gt;&#10;&lt;li&gt;这种严格顺序性引入了额外的往返时间（RTT）延迟，并可能导致线程阻塞，影响吞吐量。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;此外，在消息语义 RDMA 中也存在类似问题，例如：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;在 InfiniBand 或 NVIDIA BlueField-3 上执行 regular RDMA writes 后进行 packet spraying 的 RDMA 原子操作，也可能导致乱序同步问题。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;&lt;strong&gt;建议&lt;/strong&gt;&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;提供硬件级顺序保障机制&lt;/strong&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;硬件应原生支持 memory-semantic 通信的顺序一致性。&lt;/li&gt;&#10;&lt;li&gt;编程层应通过 acquire/release 语义确保一致性。&lt;/li&gt;&#10;&lt;li&gt;接收端应由硬件保证数据有序交付，避免额外开销。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;Region Acquire/Release (RAR) 机制&lt;/strong&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;接收端硬件维护一个 bitmap，跟踪 RNR（Receiver Not Ready）内存区域的状态。&lt;/li&gt;&#10;&lt;li&gt;acquire/release 操作作用于 RAR 地址范围内。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;优点&lt;/strong&gt;：&#10;&lt;ul&gt;&#10;&lt;li&gt;极低 bitmap 开销；&lt;/li&gt;&#10;&lt;li&gt;实现高效的硬件强制排序；&lt;/li&gt;&#10;&lt;li&gt;消除发送端显式的 fence 操作；&lt;/li&gt;&#10;&lt;li&gt;支持 memory-semantic 和 message-semantic RDMA 操作。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="65-网络内计算与压缩in-network-computation-and-compression"&gt;6.5 网络内计算与压缩（In-Network Computation and Compression）&lt;/h3&gt;&#10;&lt;p&gt;MoE 包含两个 All-to-All 阶段：&lt;/p&gt;&#10;&lt;h3 id="1dispatch-阶段路由"&gt;（1）Dispatch 阶段（路由）&lt;/h3&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;类似小规模多播（multicast）操作。&lt;/li&gt;&#10;&lt;li&gt;单个 token 需要被转发到多个专家节点。&lt;/li&gt;&#10;&lt;li&gt;建议：硬件应支持自动包复制与多目标转发，大幅减少通信开销。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="2combine-阶段聚合"&gt;（2）Combine 阶段（聚合）&lt;/h3&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;类似小规模归约（reduce）操作。&lt;/li&gt;&#10;&lt;li&gt;多个专家输出结果需聚合回原始节点。&lt;/li&gt;&#10;&lt;li&gt;当前挑战：EP 的归约范围较小且负载不均衡，难以灵活实现网络内聚合。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;LogFMT 是 DeepSeek-V3 中用于降低通信量的新型对数量化格式。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;可以将其原生集成进网络硬件，可以进一步提高熵密度，降低带宽需求。&lt;/li&gt;&#10;&lt;li&gt;另外，开发硬件加速的 LogFMT 压缩与解压单元，实现无缝集成于分布式系统，提升整体吞吐。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="66-以内存为中心的创新memory-centric-innovations"&gt;6.6 以内存为中心的创新（Memory-Centric Innovations）&lt;/h3&gt;&#10;&lt;p&gt;随着模型参数规模呈指数增长，传统高带宽内存（如 HBM）的发展速度远远跟不上需求。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;DRAM 堆叠加速器（DRAM-Stacked Accelerators）&#10;&lt;ul&gt;&#10;&lt;li&gt;利用先进的 3D 堆叠技术，将 DRAM 垂直集成在逻辑芯片之上。&lt;/li&gt;&#10;&lt;li&gt;优点：&#10;&lt;ul&gt;&#10;&lt;li&gt;极高的内存带宽；&lt;/li&gt;&#10;&lt;li&gt;超低延迟；&lt;/li&gt;&#10;&lt;li&gt;实用的内存容量（受堆叠层数限制）。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;应用场景：&#10;&lt;ul&gt;&#10;&lt;li&gt;特别适用于 MoE 推理中内存吞吐是瓶颈的场景。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;示例架构：&#10;&lt;ul&gt;&#10;&lt;li&gt;如 SeDRAM，为内存密集型任务提供前所未有的性能提升。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;晶圆级系统（System-on-Wafer, SoW）&#10;&lt;ul&gt;&#10;&lt;li&gt;使用 wafer-scale 集成技术，最大化计算密度与内存带宽。&lt;/li&gt;&#10;&lt;li&gt;优点：&#10;&lt;ul&gt;&#10;&lt;li&gt;支持超大规模模型部署；&lt;/li&gt;&#10;&lt;li&gt;显著提升片上通信效率；&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;应用场景：&#10;&lt;ul&gt;&#10;&lt;li&gt;特别适合处理万亿参数级别的模型。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="7-总结"&gt;7. 总结&lt;/h3&gt;&#10;&lt;p&gt;DeepSeek-V3 是硬件与软件协同设计在大规模 AI 系统中取得突破的典范。通过深入分析当前硬件架构的局限性，并提出一系列切实可行的优化建议，该研究为下一代面向大模型的硬件设计提供了清晰的发展蓝图。&lt;/p&gt;&#10;&lt;p&gt;该论文不仅是 DeepSeek-V3 的技术总结，也为未来 AI 硬件架构的发展提供了宝贵的实践指导。随着 AI 工作负载的持续增长，这种“模型 + 硬件”的软硬件协同优化设计诶将成为构建高效、可持续 AI 系统的关键路径。&lt;/p&gt;&#10;&lt;p&gt;其核心经验主要包括：&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;未来硬件设计方向&lt;/strong&gt;（如统一网络接口、专用协处理器）推动下一代 AI 系统发展。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;模型架构创新&lt;/strong&gt;（如 MLA、MoE、MTP）提升效率。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;网络拓扑优化&lt;/strong&gt;（如 MPFT）降低成本并提升扩展性。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;低精度计算与通信优化&lt;/strong&gt;（如 FP8、压缩、offload）降低带宽需求。&lt;/p&gt;&#10;</description></item><item><title>抖音开放的推荐逻辑算法4</title><link>https://blog.havenice.day/2025/05/07/dou-yin-kai-fang-de-tui-jian-luo-ji-suan-fa-4/</link><pubDate>Wed, 07 May 2025 10:47:54 +0800</pubDate><guid>https://blog.havenice.day/2025/05/07/dou-yin-kai-fang-de-tui-jian-luo-ji-suan-fa-4/</guid><description>&lt;p&gt;平台治理为推荐算法设置“护栏”&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image-13.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image-14.png" alt=""&gt;&lt;/p&gt;&#10;&lt;h1 id="抖音平台治理的流程"&gt;抖音平台治理的流程&lt;/h1&gt;&#10;&lt;p&gt;平台治理的第二步是针对标准中定义出的问题，针对性地将有问题的内容识别出来，并进行处置。&lt;/p&gt;&#10;&lt;p&gt;抖音的平台治理存在于内容发布与传播的每一个环节。一方面，内容的传播与治理紧密关联，一条内容传播的次数越多，其需要经历的审核次数也越多；另一方面，治理链路包括感知、识别、判定、处置、体验等多个步骤，且不断从头到尾，从尾到头，实现循环与升级。&lt;/p&gt;&#10;&lt;p&gt;在明确了治理标准后，抖音的平台治理链路核心有两个原则。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;原则一：所有在平台发布的内容都会经过评估：流量越高的内容经过评估的次数越多，标准也越严格。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image-15.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;原则二：“人工+机器”审核相互分工又密切配合。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image-16.png" alt=""&gt;&lt;/p&gt;&#10;&lt;h1 id="抖音如何治理专项风险"&gt;抖音如何治理专项风险&lt;/h1&gt;&#10;&lt;p&gt;抖音一方面建设了通用问题治理标准及流程，用于系统性治理平台上可能出现的普遍性风险内容，另一方面针对社会普遍关心的、呈现聚集特征的、反复出现的、对用户造成较多困扰的焦点问题，成立了数个专项治理团队，分别设置相应的治理标准、识别策略、处置手段和风险巡查能力，专注应对涉及特殊群体、网络暴力、AIGC技术滥用等问题治理。&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/img/external/d13ea945a9a4.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image-17.png" alt=""&gt;&lt;/p&gt;&#10;</description></item><item><title>抖音开放的推荐逻辑算法3</title><link>https://blog.havenice.day/2025/05/07/dou-yin-kai-fang-de-tui-jian-luo-ji-suan-fa-3/</link><pubDate>Wed, 07 May 2025 10:39:35 +0800</pubDate><guid>https://blog.havenice.day/2025/05/07/dou-yin-kai-fang-de-tui-jian-luo-ji-suan-fa-3/</guid><description>&lt;p&gt;&lt;strong&gt;抖音算法的多目标平衡&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;推荐算法通过各种“目标”来预估用户行为，为用户推荐内容。但用户的行为动作有很多，不同行为的重要程度会决定算法推荐的优先级。因此，为推荐算法设置合理的目标格外重要。推荐算法在诞生之初只关注单一或者少量的目标，比如完播、点赞，但随着平台内容和各方需求日益多元化，单一目标已难以满足实际需求，多目标推荐系统成为主流。&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/img/external/559eada61f5f.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image-12.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;多目标如何平衡多样需求&lt;br&gt;&#10;探索用户深层需求，增强收藏等目标权重&lt;/strong&gt;&lt;br&gt;&#10;&lt;strong&gt;判断用户长期需求，增强“收藏+复访”等组合目标&lt;/strong&gt;&lt;br&gt;&#10;&lt;strong&gt;探索多样性需求，助力破除“信息茧房”&lt;/strong&gt;&lt;br&gt;&#10;&lt;strong&gt;“握手模型”目标带给作者的积极体验&lt;/strong&gt;&lt;br&gt;&#10;&lt;strong&gt;多目标不让中长优质视频作者“吃亏”&lt;/strong&gt;&lt;br&gt;&#10;&lt;strong&gt;原创性目标塑造公平创作环境&lt;/strong&gt;&lt;/p&gt;&#10;</description></item><item><title>抖音开放的推荐逻辑算法2</title><link>https://blog.havenice.day/2025/05/07/dou-yin-kai-fang-de-tui-jian-luo-ji-suan-fa-2/</link><pubDate>Wed, 07 May 2025 10:32:22 +0800</pubDate><guid>https://blog.havenice.day/2025/05/07/dou-yin-kai-fang-de-tui-jian-luo-ji-suan-fa-2/</guid><description>&lt;p&gt;用户行为背后的算法推荐逻辑&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image-9.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image-8.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image-11.png" alt=""&gt;&lt;/p&gt;&#10;</description></item><item><title>抖音开放的推荐逻辑算法1</title><link>https://blog.havenice.day/2025/05/07/dou-yin-kai-fang-de-tui-jian-luo-ji-suan-fa-1/</link><pubDate>Wed, 07 May 2025 10:12:09 +0800</pubDate><guid>https://blog.havenice.day/2025/05/07/dou-yin-kai-fang-de-tui-jian-luo-ji-suan-fa-1/</guid><description>&lt;p&gt;&lt;a href="https://trust.douyin.com/transparency"&gt;https://trust.douyin.com/transparency&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image-1.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/05/image-3.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/img/external/5a433f42f9af.png" alt=""&gt;&lt;/p&gt;&#10;&lt;h1 id="总结推荐算法以数学计算学习人类行为"&gt;总结推荐算法：以数学计算学习人类行为&lt;/h1&gt;&#10;&lt;p&gt;相比人工推荐，推荐算法实现了一个重要范式突破：它将用户对内容的具体偏好（如点击、评分等显式行为）抽象为高维空间中的数学映射关系。&lt;/p&gt;&#10;&lt;p&gt;通过将用户-内容交互矩阵分解为隐语义空间中的用户偏好矩阵和内容特征矩阵，算法无需理解“内容类型”或“开心愤怒情绪”等现实语义，而是通过潜在特征向量运算，就能实现对用户“是否会看完”“是否会点赞”“是否会收藏”某个内容的行为预测。&lt;/p&gt;&#10;&lt;p&gt;正是这种脱离现实语义的数学建模能力，结合亿级数据，实现“知其然，而不必知其所以然”的精准推荐。&lt;/p&gt;&#10;</description></item><item><title>一个有意思的- AI暴打验证码</title><link>https://blog.havenice.day/2025/01/07/yi-ge-you-yi-si-de-ai-bao-da-yan-zheng-ma/</link><pubDate>Tue, 07 Jan 2025 17:48:38 +0800</pubDate><guid>https://blog.havenice.day/2025/01/07/yi-ge-you-yi-si-de-ai-bao-da-yan-zheng-ma/</guid><description>&lt;p&gt;来自“量子位”的视频，很全面的回顾了验证码的历史以及对抗。&lt;a href="https://www.36kr.com/video/3105376963182340"&gt;https://www.36kr.com/video/3105376963182340&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-5.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-6.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-9.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-10.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-11.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-12.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-13.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-14.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-15.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-16.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-17.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-20.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;V3是更多的隐私数据模型来换准确性，在隐私要求越来越高的环境下并不一定好用。&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-21.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-22.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-23.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-24.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;生成式AI可以避免人肉外包穷举&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-25.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2025/01/image-26.png" alt=""&gt;&lt;/p&gt;&#10;</description></item><item><title>有闲阶级论</title><link>https://blog.havenice.day/2024/12/17/you-xian-jie-ji-lun/</link><pubDate>Tue, 17 Dec 2024 10:48:40 +0800</pubDate><guid>https://blog.havenice.day/2024/12/17/you-xian-jie-ji-lun/</guid><description>&lt;p&gt;根据您提供的材料，《有闲阶级论》这本书探讨了消费实践和偏好形成，尤其关注炫耀性消费。作者凡勃伦认为，有闲阶级积累财富并非为了单纯满足物质或精神需求，而是通过消费来炫耀财富，以此显示权势、地位、荣誉和成功。具体来说：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;历史起源&lt;/strong&gt;：人类进化分为未开化、野蛮、手工业和机器生产四个阶段。在未开化的早期阶段，男女分工不明显，但随着时间推移，强壮的男子更多从事“侵占”性活动，如战争、狩猎和运动比赛，而女子则承担生产工作。随着社会进入野蛮状态，掠夺性本能取代工作本能，流行习俗开始出现有闲阶级观念，阶级分化明显，有闲阶级和平民的职业之间出现了明显区别。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;基本特征&lt;/strong&gt;：在新的准和平阶段，拥有财富成为获得社会地位的关键。人们关注财富积累，不仅因为物质需求，更因为财富与歧视性对比有关。财富成为获取自尊而非维持最低生活的手段。有闲阶级不参与生产劳动，而是通过挥霍性消费和休闲来展示财富和尊荣。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;消费行为&lt;/strong&gt;：有闲阶级热衷于非生产性消耗时间和炫耀性消费商品。他们雇佣大量仆役进行浪费性的代理消费和代理休闲，以显示财富。挥霍性消费和休闲被认为是财富和尊荣的标志。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;全社会的炫耀性消费&lt;/strong&gt;：有闲阶级的习性和消费行为会影响社会其他成员。消费者对商品的享受主要取决于其他人的消费方式和习惯。这种思想构成了现代经济学中“位置经济学”的先声。富人的消费更多基于炫耀性需求，这种消费没有满足人类“工作本能”的渴望，反而会损伤工作本能。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;综上所述，《有闲阶级论》通过分析有闲阶级的形成、消费行为及其对社会的影响，揭示了市场经济中进行攀比而日益奢靡的消费倾向，并为现代消费行为的剖析提供了有力工具。&lt;br&gt;&#10;input tokens: 6754, prefill time: 2.18s, output tokens: 428, decode speed: 59.24 tokens/s&lt;/p&gt;&#10;</description></item><item><title>黄仁勋深度访谈：每周工作7天6点起床，60位高管都向我汇报 (msn.cn)</title><link>https://blog.havenice.day/2024/06/05/huang-ren-xun-shen-du-fang-tan-mei-zhou-gong-zuo-7-tian-6/</link><pubDate>Wed, 05 Jun 2024 10:39:39 +0800</pubDate><guid>https://blog.havenice.day/2024/06/05/huang-ren-xun-shen-du-fang-tan-mei-zhou-gong-zuo-7-tian-6/</guid><description>&lt;p&gt;黄仁勋还大谈管理经验，包括60位高管如何向他汇报、怎么安排日常工作、为何坚持不裁员，以及大家最关心的——这位兼具工作狂魔与魅力型领导者特质的创业者，当初如何做出卓有远见的判断，带领英伟达2.8万人走向伟大的成功？&lt;/p&gt;&#10;&lt;p&gt;在这次对谈中，黄仁勋畅所欲言，分享了很多个人喜恶，比如他“每天都不开心”、“每年都对公司不满意”，讨厌“报告会议”，讨厌“电子表格”，但他不认为“最好的工作是那些一直带给你快乐的事情”，反而相当有奋斗的觉悟。&lt;/p&gt;&#10;&lt;p&gt;黄仁勋热衷于挑战困难，连送出的祝福都是“我祝你们经历大量的痛苦和磨难”。&lt;/p&gt;&#10;&lt;p&gt;“我曾经是个扫厕所的，现在我是公司CEO。”他说自己不喜欢解雇员工、不愿放弃任何一名员工的原因，是觉得自己能帮助他们进步，而且相信好员工是可以“折磨”出来的。&lt;/p&gt;&#10;&lt;p&gt;黄仁勋相信产品、公司和组织需要“爱和呵护”，这是他在英伟达内部的常用表达。&lt;/p&gt;&#10;&lt;p&gt;他是个工作狂，每周工作7天，一醒来就开始工作，一直干到睡觉，就连不工作时也满脑子想着工作，无时无刻不在思考公司的未来，每天都在确认自己的核心信念、确认自己分析公司战略时使用的第一性原理是否正确。&lt;/p&gt;&#10;&lt;p&gt;他以前5点起床，现在改成6点起床，是因为家里小狗6点才醒，吵醒小狗会令他感到内疚。&lt;/p&gt;&#10;&lt;p&gt;他觉得不积极主动参与AI就是在犯错误，平时他遇到一个问题就会扔给AI搜索工具Perplexity问问答案，他不仅想要让英伟达所有人都大量使用AI工具，还想把整个公司都变成一个巨大的AI。&lt;/p&gt;&#10;&lt;p&gt;他还懊悔没在十多年前CUDA发布时买英伟达的股票。当时增加大量成本的CUDA引发一场灾难，摧毁了英伟达原本拥有的十亿美元市场，导致英伟达市值降到大约10亿美元左右。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;帕特里克·克里森：CUDA这个想法一开始是怎么来的呢？&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;黄仁勋&lt;/strong&gt;：CUDA源自于两个想法。其中一个叫作加速计算。英伟达开创了这个叫做加速计算的概念。加速计算就像是一个I/O（输入/输出）设备，如果你在计算机行业，它是一个你放在PCIe上的I/O设备，允许应用程序以加速计算的方式与I/O设备交互。&lt;/p&gt;&#10;&lt;p&gt;UDA（Unified Driver Architecture，统一驱动架构）是在1993年发明的，它是一个影响深远的发明。它允许软件程序员直接编程I/O设备，直接给I/O设备写应用程序。这是因为I/O设备是虚拟化的，并且多代之间在架构上是兼容的。&lt;/p&gt;&#10;&lt;p&gt;总之，我们发明了这个叫做加速计算的概念，我们称它为UDA。然后几年后，我们认为我们可以使我们的GPU对高级编程语言更具可编程性。所以我们发布了CG（C for Graphics），也就是为GPU编程设计的高级着色器语言。但由于种种问题，最终发布了CUDA（Compute with Unified Driver Architecture）。总之是个非常曲折的故事。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;帕特里克·克里森：我想真正的问题是，CUDA有没有一夜爆火呢？&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;黄仁勋&lt;/strong&gt;：不是的。&lt;strong&gt;CUDA的发布可以说是一场灾难&lt;/strong&gt;。虽然我们追求的是一个“0亿美元市场”，但追求这个市场的成本太高了。它实际上&lt;strong&gt;摧毁了我们原本拥有的十亿美元市场&lt;/strong&gt;。原因是因为我们的芯片中加入了CUDA，增加了大量成本，但是没有应用。没有应用，客户就不会重视这个产品，他们不会为此支付溢价。如果人们不愿支付，而你的成本上升了，那么你的毛利率就会受到挤压，我们的市值就会下降，然后真的变得非常低。&lt;strong&gt;我想我们的市值降到了大约10亿美元左右。我真希望我当时买了自家的股票。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;帕特里克·克里森：所以你们需要取消CUDA，然后回到原来的战略吗？&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;黄仁勋&lt;/strong&gt;：不是的，我一直相信CUDA。因为我已经推理过了。我们真的相信加速计算能够解决普通计算机无法解决的问题。&lt;strong&gt;如果我们想将架构扩展得更加通用，我们就必须做出这个牺牲。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;我深深地相信我们公司的使命，相信公司未来的机会。我也坚信其他人都错了，他们只是不懂得欣赏我们所建立的东西。我深深地相信这些东西。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;h2 id="七如何判断技术的前景关键要做好决心与固执间的平衡"&gt;&lt;strong&gt;七、如何判断技术的前景？关键要做好决心与固执间的平衡&lt;/strong&gt;&lt;/h2&gt;&#10;&lt;p&gt;&lt;strong&gt;帕特里克·克里森：在场的各位都是企业家，也许每个人自己心中都有和CUDA一样类似的愿景。他们认为这对他们的领域或他们的技术非常有意义，但市场还没有看到它的潜力。你认为有没有可能从中提取一些通用的原则呢？什么时候应该坚定地相信你的愿景，什么时候又需要重新考虑呢？&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;黄仁勋&lt;/strong&gt;：是的，&lt;strong&gt;问题的关键是决心与固执之间的界限&lt;/strong&gt;。那条界限是模糊的。我每天都在确认我的核心信念。我现在仍然这样做。**我需要确认我分析公司战略时使用的第一性原理是否正确。**这不是一个很长的列表，很容易记住。&lt;/p&gt;&#10;&lt;p&gt;问题的关键是，这些原则现在是否有了根本性的改变呢？外部条件的变化是否使它们不再像以前那样重要？是不是有人解决了这个问题？这个问题现在已经消失了吗？是不是还会有需求？你必须不断检查。这是其一，不断自省。你必须非常小心地提炼基本原则，而不是说我就想这么做。这种想法就是固执了。我们不是5岁的孩子，所以你必须做好推理分析。&lt;/p&gt;&#10;&lt;p&gt;第二，必须要聪明一些。**我们找到了一些方法将CUDA变现。**我们到处寻找应用场景，找到了CT重建的应用，找到了地震信号处理的应用，找到了分子动力学的应用。我们不断地寻找应用场景。**这些应用没有让我们大获成功，但至少足以让我们维持公司运转，**&lt;strong&gt;为我们赢得了时间，让我们能撑到成功的时刻&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;h2 id="八未来大约2万亿美元的计算机要换用gpu"&gt;&lt;strong&gt;八、未来大约2万亿美元的计算机要换用GPU&lt;/strong&gt;&lt;/h2&gt;&#10;&lt;p&gt;&lt;strong&gt;帕特里克·克里森：让我们来谈谈AI。假设今天世界上所有GPU的总计算能力是X。你认为，5年后我们的总算力会是X的多少倍？&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;黄仁勋&lt;/strong&gt;：我要是说出来我肯定会后悔的。我们可是一个上市公司。你这个“疯子”，你们这种私有公司可真是自由自在。好的，让我们来分析一下。首先，世界已经安装了大约1万亿美元的数据中心。这些数据中心使用通用计算。通用计算已经没有未来了，所以我们不能再这样处理数据。世界需要加速计算，需要将加速计算应用到所有领域。当我们加速一切时，每一个数据中心、每一台计算机都将是一个加速服务器。假设市场不增长，未来4年我们要替换大约1万亿美元的计算机。&lt;/p&gt;&#10;&lt;p&gt;但如果计算机行业继续以大约20%的速度增长，我们可能需要&lt;strong&gt;在未来几年将大约2万亿美元的计算机替换成GPU&lt;/strong&gt;。这是第一点。&lt;/p&gt;&#10;&lt;p&gt;第二点，这也是为什么我认为你们的行业潜力无限。&lt;strong&gt;这是一场工业革命&lt;/strong&gt;，让我告诉你为什么。我们正在大量生产一些以前从未生产过的东西。生产这些东西需要一种以前从未存在过的设备，也就是GPU。我们现在首次大量生产的东西就是token和浮点数。这些东西的价值就在于它们代表着智能。这就是人工智能。&lt;/p&gt;&#10;&lt;p&gt;你可以将这些浮点数以某种方式重新组合，它就能变成英语、法语、蛋白质结构、化学物质、图形、图像、视频、机器人的动作、方向盘的动作。我们正在以极大的规模生产token。我们在人工智能方面不断努力，最终发现了一种生产几乎所有类型的token的方法。世界将生产大量的token。这些token将在新型数据中心中生产。我们称它们为&lt;strong&gt;AI工厂&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;回到上一次工业革命。水进入一台机器，把水烧开变成蒸汽，然后驱动发电机产生电力。原子进，电子出。而在这场新的工业革命中，是电子进，浮点出。上一次工业革命中，没有人明白为什么电这么有价值。而现在电力被出售、市场化。每千瓦时的电力被标上价格。现在token也被这么标上价格了，每1美元对应着多少token数。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;就像上一次工业革命那样，这些事情对很多人来说都很难理解。但在未来10年这会变成人们司空见惯的事情。&lt;strong&gt;这些token将创造出新产品、新服务，提高整个行业的生产力。建立在我们产品基础上的产业，价值可能有&lt;/strong&gt;100万亿美元&lt;/strong&gt;。这个行业的前景是很广阔的。&lt;/p&gt;&#10;</description></item><item><title>GitHub Archive Program</title><link>https://blog.havenice.day/2024/05/20/github-archive-program/</link><pubDate>Mon, 20 May 2024 12:19:54 +0800</pubDate><guid>https://blog.havenice.day/2024/05/20/github-archive-program/</guid><description>&lt;p&gt;偶然间闲逛发现一个github的存档项目。理念挺有意思的，为后代保存开源软件&lt;br&gt;&#10;&lt;a href="https://archiveprogram.github.com"&gt;https://archiveprogram.github.com&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2024/05/image-3.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;这里提到了他们通过多副本，存储介质等手段，来设计实现至少保存1000年的长期存档。&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2024/05/image-4.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2024/05/image-5.png" alt=""&gt;&#10;&lt;img src="https://blog.havenice.day/wp-content/uploads/2024/05/image-6.png" alt=""&gt;&lt;/p&gt;&#10;</description></item><item><title>潮汕牛肉部位</title><link>https://blog.havenice.day/2023/05/09/%E6%BD%AE%E6%B1%95%E7%89%9B%E8%82%89%E9%83%A8%E4%BD%8D/</link><pubDate>Tue, 09 May 2023 20:42:48 +0800</pubDate><guid>https://blog.havenice.day/2023/05/09/%E6%BD%AE%E6%B1%95%E7%89%9B%E8%82%89%E9%83%A8%E4%BD%8D/</guid><description>&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2023/05/image-3.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.zhihu.com/question/33828670"&gt;潮汕牛肉中的吊龙伴、脖仁、匙柄、五花趾、三花趾、匙仁、胸口朥等等都是哪些部位？ – 知乎 (zhihu.com)&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;吊龙伴&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2023/05/image-6.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;脖仁（又称牛朴肉）&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2023/05/image-10.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;&lt;strong&gt;&lt;a href="https://www.zhihu.com/search?q=%E5%8C%99%E4%BB%81&amp;amp;search_source=Entity&amp;amp;hybrid_search_source=Entity&amp;amp;hybrid_search_extra=%7B%22sourceType%22%3A%22answer%22%2C%22sourceId%22%3A81533105%7D"&gt;匙仁&lt;/a&gt;（也称匙皮）&lt;/strong&gt;&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2023/05/image-5.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;匙柄&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2023/05/image-17.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;三花趾（也称脚趾肉、三花腱）&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2023/05/image-18.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;五花趾（也称正五花、五花腱）&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2023/05/image-19.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;胸口朥（胸口油）&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2023/05/image-20.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;嫩肉&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2023/05/image-21.png" alt=""&gt;&lt;/p&gt;&#10;</description></item><item><title>中特估</title><link>https://blog.havenice.day/2023/05/09/%E4%B8%AD%E7%89%B9%E4%BC%B0/</link><pubDate>Tue, 09 May 2023 00:03:03 +0800</pubDate><guid>https://blog.havenice.day/2023/05/09/%E4%B8%AD%E7%89%B9%E4%BC%B0/</guid><description>&lt;p&gt;中特估”是**“中国特色估值体系”**的简称。是的，依然是“中国特色”。&lt;/p&gt;&#10;&lt;p&gt;“中特估”主要以&lt;strong&gt;央企、国企&lt;/strong&gt;以及一些特殊行业的上市公司为主，涉及&lt;strong&gt;通信/计算机、建筑、能源/电力、军工、银行等板块&lt;/strong&gt;，多为具有强现金流、高分红、低估值特点的价值蓝筹股（约计130只个股），提倡的是一种央国企股票的投资机会&lt;/p&gt;&#10;&lt;p&gt;这一概念最早被A股市场关注，是2022年11月21日，证监会主席&lt;strong&gt;易会满&lt;/strong&gt;在金融街论坛年会上提出：“要深入研究成熟市场估值理论的适用场景，把握好不同类型上市公司的估值逻辑，&lt;strong&gt;探索建立具有中国特色的估值体系&lt;/strong&gt;，促进市场资源配置功能更好发挥”。在2023年的政府工作报告中，深化国资国企改革，提高国企核心竞争力也成为未来重点工作内容之一。&lt;/p&gt;&#10;&lt;p&gt;从官方角度讲，“中特估”已被提升至一定重要的战略地位，&lt;strong&gt;核心点是深化国企改革、提高国企估值、做大做强国企。&lt;/strong&gt;&lt;/p&gt;&#10;</description></item><item><title>【摘录】GPT-4大模型硬核解读！</title><link>https://blog.havenice.day/2023/05/04/gpt-4%E5%A4%A7%E6%A8%A1%E5%9E%8B%E7%A1%AC%E6%A0%B8%E8%A7%A3%E8%AF%BB/</link><pubDate>Thu, 04 May 2023 17:37:48 +0800</pubDate><guid>https://blog.havenice.day/2023/05/04/gpt-4%E5%A4%A7%E6%A8%A1%E5%9E%8B%E7%A1%AC%E6%A0%B8%E8%A7%A3%E8%AF%BB/</guid><description>&lt;p&gt;GPT-4大模型硬核解读！看完成半个专家&lt;br&gt;&#10;&lt;a href="https://zhuanlan.zhihu.com/p/618761264"&gt;https://zhuanlan.zhihu.com/p/618761264&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://blog.havenice.day/wp-content/uploads/2023/05/image.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;1.1理论基础——多模态涌现能力&lt;/strong&gt;讲到大语言模型的优势，一般首先要提到这类模型的涌现能力和思维链。这两者是大语言模型不断接近人类的&lt;strong&gt;关键特征&lt;/strong&gt;。我们之所以认为GPT-4会是具有里程碑意义的一代，正是因为多模态的GPT-4会从视觉角度和视觉-文字语义融合方面涌现出更多的能力。2022-2023年，我们可以认为AI是第一次&lt;strong&gt;睁开双眼&lt;/strong&gt;理解这个世界。在大型语言模型（LLM）中，&lt;strong&gt;涌现能力&lt;/strong&gt;（Emergent Abilities）是指模型具有从原始训练数据中自动学习并发现新的、更高层次的特征和模式的能力。就中文释义而言，涌现能力也指大语言模型涌现出来的新能力。这有点类似于去超市遇到买二赠一，赠品的质量居然还出乎意料。与大语言模型（LLM）相比，多模态大语言模型（Multi-modal Large Language Model，MLLM）可实现更好的常识推理性能，跨模态迁移更有利于知识获取，产生更多新的能力，加速了能力的涌现。这些独立模态或跨模态新特征、能力或模式通常不是通过&lt;strong&gt;目的明确&lt;/strong&gt;的编程或训练获得的，而是模型在大量多模态数据中&lt;strong&gt;自然而然&lt;/strong&gt;的学习到的。&lt;/p&gt;&#10;&lt;p&gt;▲缩放定律（参数增加后精度损失连续减少）V.S. 涌现能力（1010-1011参数后新能力的涌现）（来源：OpenAI）&lt;/p&gt;&#10;&lt;p&gt;▲思维链提示的示例（来源：Google）&lt;/p&gt;&#10;&lt;p&gt;▲多模态思维链框架（来源：微软）&lt;/p&gt;&#10;&lt;p&gt;▲语言模型的4种研究范式（来源：卡内基梅隆大学）&lt;/p&gt;&#10;&lt;p&gt;大概在2017-2019年间，语言模型的研究重心逐渐从传统特定领域的有监督学习模式（基于非神经网络或神经网络）转移到预训练模型上。在那时，基于预训练语言模型的研究范式通常是“&lt;strong&gt;预训练+精调&lt;/strong&gt;”（Pre-train+Fine-tune），即在精调阶段，根据下游任务对预训练模型进行微调，以获得更好效果。但是由于模型越来越大，以及预训练阶段和下游任务之间的差距可能很大，对各个细分领域Fine-tune的计算资源要求、训练数据需求和时间成本也在快速上涨。大量爆发的下游任务也使得175B这个级别模型预训练和精调变得异常复杂。在这种背景下，随着GPT-3的发布，提示工程成为了预训练模型的新方向。形象的说，提示有点类似于老师在学生回答问题时指点回答方向。&lt;/p&gt;&#10;&lt;p&gt;▲奖励模型的过拟合导致模型性能下降（来源：OpenAI）&lt;/p&gt;&#10;&lt;p&gt;▲基于规则的奖励模型（来源：日本国立信息学研究所）&lt;/p&gt;&#10;&lt;p&gt;▲基于规则的奖励模型在样本较少情况下表现出较好性能（来源：Meta AI）&lt;/p&gt;&#10;&lt;p&gt;▲PPO算法与同类其他算法的比较（来源：OpenAI）&lt;/p&gt;&#10;&lt;p&gt;▲大语言模型可视为知识/语言的有损压缩&lt;/p&gt;&#10;&lt;p&gt;▲通过幻觉单词检测器减少幻觉（来源：Meta AI）&lt;/p&gt;&#10;&lt;p&gt;Bing反馈的GPT-4模型大小&lt;/p&gt;&#10;&lt;p&gt;GPT-3是目前最大的知名语言模型之一，包含了1750亿（175B）个参数。在GPT-3发布之前，最大的语言模型是微软的Turing NLG模型，大小为17亿（1.7B）个参数。在GPT-3发布后不久，OpenAI团队就曾表示他们计划在未来几年内研发更大的模型。而随着技术和算法的不断发展，GPT-4模型似乎也应朝着更大的尺寸发展。另外，GPT-4的上下文窗口尺寸也较GPT-3.5和GPT-3增大了不少。2020年发布的GPT-3模型上下文窗口为2049个令牌。在GPT-3.5中，窗口增加到4096个令牌（约3页单行英文文本）。GPT-4有两种尺寸。其中一个（GPT-4-8K）的上下文窗口大小为8192个令牌，另一个（GPT-4-32K）可以处理多达32768个令牌，大约50页文本。有传言说GPT-4模型大概是GPT-3的100倍或1000倍。从训练的角度看，这么大的模型膨胀可能会消耗更多的训练资源和训练周期的过度延长。&lt;/p&gt;&#10;</description></item><item><title>【摘录】乱纪元</title><link>https://blog.havenice.day/2023/05/04/%E3%80%90%E6%91%98%E5%BD%95%E3%80%91%E4%B9%B1%E7%BA%AA%E5%85%83/</link><pubDate>Thu, 04 May 2023 12:29:20 +0800</pubDate><guid>https://blog.havenice.day/2023/05/04/%E3%80%90%E6%91%98%E5%BD%95%E3%80%91%E4%B9%B1%E7%BA%AA%E5%85%83/</guid><description>&lt;h5 id="原创我是如是卢泓言2023-05-04-1214发表于云南"&gt;原创 我是如是 &lt;a href="javascript:void(0);"&gt;卢泓言&lt;/a&gt; &lt;em&gt;2023-05-04 12:14&lt;/em&gt; &lt;em&gt;发表于云南&lt;/em&gt;&lt;/h5&gt;&#10;&lt;h5 id="我有智悲心于此乱纪元寻找点灯人"&gt;我有智悲心，于此乱纪元，寻找点灯人&lt;/h5&gt;&#10;&lt;p&gt;今天，我们进入了乱纪元。&lt;/p&gt;&#10;&lt;p&gt;第一，不光人工智能，还有区块链，基因编辑，可控核聚变。都在把这个世界改造得完全不一样。所有事情都可能被重做一遍，所有经验都可能变成陷阱。&lt;/p&gt;&#10;&lt;p&gt;第二，美国脱钩一直在路上，以至于逆全球化。之前的顺风，可能都会变成逆风。之前靠连通挣钱，之后可能靠高筑墙来挣钱。&lt;/p&gt;&#10;&lt;p&gt;第三，改开也进入无人区。几十年前，我们学习前苏联的社会主义，后来学习美帝的市场经济，把两者整合在一起。但现在，他们都已经不能再为我们指明方向。得完全靠自己了。&lt;/p&gt;&#10;</description></item></channel></rss>