Chengshu@skadai · 2026.09.30
3,799 字 · 351 词 · 约 11 分钟更新于

Stanford MS&E435:AI 基础设施与前沿实验室 | Sachin Katti

Katti 把 AI 算力定义为一整套工业系统,而不只是 GPU:芯片、内存、网络、电力、制冷、数据中心、发电、配电和土地必须在同一时间到位。真正困难的工作往往从签完合同之后才开始。

来源:YouTube 原视频(Stanford Online · MS&E435)

Stanford MS&E435《Economics of the AI Supercycle》课堂对谈。讲者为 OpenAI 工业计算负责人、前 Intel CTO 与 AI 负责人 Sachin Katti,主持人为 Stanford 讲师、Altimeter Capital 合伙人 Apoorv Agrawal。讨论从 OpenAI 的算力规划延伸到电网、供应链、异构计算、Agent 工作负载、延迟、价值分配与开放权重模型。

观点与数字的归属 文中的 30 GW、1 GW 约等于 50 万块 GPU、未来推理占比超过 80%、首 token 延迟约 400–500 ms、1 GW 投入约 700 亿美元等数字,均按 Katti 在课堂上的口头口径记录;有关公司优势、市场价值、能源路线和未来竞争格局的判断也属于讲者观点,不应当作经独立核验的事实或投资建议。

TL;DR

  • Katti 把 AI 算力定义为一整套工业系统,而不只是 GPU:芯片、内存、网络、电力、制冷、数据中心、发电、配电和土地必须在同一时间到位。真正困难的工作往往从签完合同之后才开始。
  • 他认为算力需求正从预训练转向以推理为主的全生命周期:强化学习、合成数据、产品服务和 Agent 执行都大量消耗推理算力;OpenAI 预计未来推理可能占到 80% 以上。
  • Agent 不再是一次问答,而是一张包含推理、搜索、数据库、工具、虚拟机和办公软件的复杂计算图。为了把等待时间压到“人类成为瓶颈”,基础设施必须走向异构化,并把不同节点匹配给 GPU、CPU、低延迟加速器或大内存系统。
  • 大型同步训练负载会给电网带来快速、巨幅波动。AI 基础设施扩张因此同时是电网韧性、能源供给、制造能力和供应链去单点化的问题;Katti 特别指出先进逻辑、内存晶圆以及 ASML 设备的高度集中。
  • 短期内,集中式大集群仍有显著单位成本优势;而长上下文的 prefill 本身就可能耗费数百毫秒,使边缘部署节省的网络延迟暂时不占主导。更小、更强的蒸馏模型成熟后,计算才更可能进一步靠近用户。
  • 他判断利润当前集中在能源、芯片和基础设施层,但历史上价值会逐步向平台与应用迁移。同时,美国底层工业基础设施长期投资不足,变压器、电池、发电、配电、制冷、材料和制造仍可能形成技术与规模兼具的耐久机会。

00|从 Intel 反弹谈制造能力与 CPU 回归

  • Katti 的职业路径横跨网络创业、Intel CTO/AI 业务与 OpenAI 工业计算,因此主持人把他定位为能从“电子一直看到 Agent”的嘉宾。
  • 对 Intel 的近况,他给出两个利好因素:全球算力供应仍然紧张,能真正制造先进芯片的美国公司稀缺;同时 Agent 工作负载带来的复杂系统调用,也让 CPU 的作用重新上升。
  • 他同时强调 Intel 仍有大量执行工作要完成,市场价格往往会提前反映叙事。

02|算力先于收入:前沿实验室的容量逻辑

  • Katti 说自己的职责是交付 OpenAI 训练和推理所需的全部计算资源。按他的描述,过去三年 OpenAI 的算力和收入都大致逐年增长三倍,因此收入更像算力容量与利用率的滞后指标。
  • 图中到本十年末约 30 GW 的目标被他称为 aspirational goal,且会分配给研究与产品。作为研究实验室,算力规划不只追求当期收入,也要让研究者能够尝试下一代模型和训练方法。
  • 他以新模型和 Codex 的使用增长说明:能力提升后,用户会把工具从编码扩展到更广泛的知识工作,token 需求随之增加。

05|推理不只是产品服务,而是训练闭环的一部分

  • 早期 scaling law 主要被理解为预训练规模法则;Katti 认为如今它已经延伸到整个模型生命周期。
  • 后训练强化学习以大量推理为基础;真实世界数据逐渐稀缺后,合成数据也要靠模型生成;ChatGPT、Codex 等产品同样是推理负载。
  • 因此,推理已经是多数算力需求,并可能在未来成为超过 80% 的“超级多数”。这里的推理不仅是面向用户生成答案,也包括研究和训练下一代智能。
  • 公司希望同时推动三个方向:降低每个 token 的成本、提高每个 token 的智能密度、减少完成一项任务所需的 token 数量,从而让智能更广泛可用。

08|一吉瓦集群不是采购 GPU,而是编排整条工业供应链

  • Katti 将 AI compute 拆成芯片、内存、网络、电力、制冷、建筑、发电、配电和土地。任何一个环节延迟,都可能让已采购的设备无法投入使用。
  • 按他的估算,1 GW 规模大致对应 50 万块 GPU;当项目扩展到数个甚至十个吉瓦时,联网、供电、制冷、可靠性和运维都进入超大规模系统工程范畴。
  • GPU 对冷却和电力波动敏感,一旦节流,名义 FLOPS 不能转化为可用计算。因此合同签署只是相对轻松的部分,交付、整合、上线和持续高利用率才是难点。

12|算力扩张的外部性:电网波动、能源与供应链

  • 大型训练任务高度同步,功耗可能在短时间内上下波动数百兆瓦。Katti 警告,传统电网并非为这种负载设计,若系统控制不当,可能影响所在地区的供电稳定性。
  • 团队因此不仅建设数据中心,也要研究如何避免给公共基础设施带来连带损害,并推动晶圆厂、内存工厂和能源供应的去风险化。
  • 他提到从电网电力部分转向天然气、未来增加核能的设想,并认为这些基础设施投资可能产生超出 AI 行业本身的社会收益。

  • 30 GW 对单个公司而言已经很大,但 Katti 用“人人拥有相当于一块 GPU 的计算预算”说明需求上限可能远高于此。他估计美国 hyperscaler 规划总量可能接近 100 GW,并可能消耗美国电网两位数比例的容量;这是讲者的数量级判断。

16|算力优势最终要表现为可交付的智能

  • 主持人追问算力领先能给用户什么。Katti 以当时新模型的较宽松 token 限额和频繁重置使用上限为例,认为优势不是“训练出模型”就结束,而是能否把模型以足够规模持续提供给用户。
  • 如果研究成果只能在极小配额下使用,智能并没有真正完成分发。因此 usable compute 与训练峰值同样重要。

18|从 Chatbot、Reasoner 到 Agent:计算图变复杂

  • 早期 ChatGPT 是一次输入、一次推理、一次输出;reasoning 让模型在回答前进行更长的内部计算,但整体仍是被动响应。
  • Agent 的关键变化是闭环:模型不仅提出建议,还会查找资料、调用工具、运行代码、检查结果、接受反馈并再次迭代。

  • Katti 用计算机科学语言把它描述为一张更复杂的有向无环图:推理节点之间可能穿插搜索、数据库查询、RL/VM 环境、Excel、PowerPoint 或其他工具调用。
  • 这意味着基础设施不再只是把一个大模型放到一组 GPU 上,而要决定图中的每一部分在哪里运行、如何调度、如何传递状态,以及怎样同时优化成本和速度。

22|目标是让人类成为瓶颈

  • 今天的 Agent 可能运行几分钟甚至几小时。用户在等待时已经切换任务;Agent 请求确认时,人又要把上下文重新装回脑中。
  • Katti 所描述的目标体验是让人保持 flow:AI 足够快,持续把下一步决策交回给人,以至于人的判断速度而不是机器等待成为限制。

  • 他认为纯 GPU 基础设施无法经济地实现这一点。未来需要更异构的系统:低延迟加速器服务快速推理,大内存设备持有超长上下文,CPU 和其他专用芯片承担工具执行、数据处理或计算图中的特定阶段。
  • 以编码为例,系统可能需要长期保留整个代码库上下文;如果状态不断换入换出,速度和成本都会恶化。

25|多种加速器不是偏好,而是供应链现实

  • Katti 不愿给具体芯片厂商排位,但明确支持更有韧性的多供应商体系:全球 AI 不能在任何一个关键部件上单线程运行。
  • Agent 工作负载本身就比单一训练矩阵乘法更多样,适合不同硬件;另一方面,TSMC 会把晶圆产能分配给多个大客户,以降低自身依赖单一客户的风险。
  • 在他看来,需求规模和产能分配共同决定了大型算力买家必须学会使用多种 GPU 与加速器,而不是只依赖一种架构。

27|为何推理暂时仍集中,而不是全面下沉到边缘

  • 训练需要同步大集群,推理流量更分散、更有波动,直觉上似乎应该把小集群放到用户附近。但 Katti 认为短期内经济性仍支持集中部署。
  • 第一个原因是规模经济:每兆瓦成本上,建设 1 GW 集群远低于建设许多 50 MW 站点;熟练施工和运维劳动力本身也是瓶颈。
  • 第二个原因是 time to first token。长上下文模型必须先执行 prefill,将可能达到 40 万 token 的上下文通过 attention 计算后才能产生第一个 token;他给出的量级约为 400–500 ms,远高于边缘节点可节省的几十毫秒网络延迟。
  • 当更强的模型能够蒸馏为足够小的版本,并在本地或边缘经济运行时,这一判断可能改变。

30|优化一个层级,会暴露下一层延迟

  • Katti 解释,prefill 是首 token 延迟的主要来源之一;应用封装 prompt、tokenization、负载均衡和路由到 GPU 还会增加额外的数十毫秒。
  • OpenAI 引入 Cerebras 后,token 生成速度显著提升,原先被模型计算掩盖的 API 与应用层延迟开始显眼,团队不得不重新优化整条软件路径。
  • 他把低延迟视为未来竞争的重要维度:每减少几十毫秒,都可能改善交互流畅度、用户参与和留存。核心不是单颗芯片跑得快,而是端到端系统能否同步变快。

33|AI 系统仍很原始,下一代基础设施将由 AI 参与设计

  • 今天的 AI 系统常被简化为大计算单元加一层高带宽内存。Katti 类比通用计算历史,预计它会逐渐形成更丰富的缓存、内存和存储层级。
  • 更深的变化是,最新模型开始帮助设计下一代芯片和底层软件。理想状态下,新模型在训练期间就能反向提出最适合自己的系统架构,而不是等芯片厂商独立设计完成后再做适配。
  • 传统芯片从构想到量产约需三年,远慢于模型迭代。Katti 认为让 AI 参与软硬件协同设计,是压缩“time to compute”的必要路径之一。

36|五层价值迁移:利润现在在底层,长期会向上走

  • 课堂使用 Jensen Huang 的五层栈:能源、芯片、基础设施、模型、应用。Katti 认为技术周期会重复移动互联网的轨迹——早期利润集中在网络和基础设施,之后转向平台、云服务与应用。

  • 不过,对在场学生和创业者,他反而建议重视最底层:美国已经弱化了大规模建设变压器、电池、发电与配电、制冷、材料和元件的能力。
  • 这些领域既需要技术,也需要真实产能和运营规模,一旦建立就比纯软件界面更难复制。因此,“长期价值向上迁移”与“底层仍有耐久机会”在他的论述中并不矛盾。

39|做空简单 wrapper,也质疑“App”是否仍是界面单位

  • Katti 对只包一层模型 API 的产品较悲观:基础模型能力变化太快,也越来越能自行拆解任务、调用工具并交付结果,薄封装很难维持差异化。
  • 他进一步质疑传统 App 是否仍会是未来的人机接口。如果用户只需表达想要的 outcome,让 Agent 自行选择工具与步骤,今天的应用菜单和工作流可能只是过渡形态。
  • 关于“第一家 10 万亿美元市值公司”的快速问答,他先答 NVIDIA,也表示若 OpenAI 达到该规模,NVIDIA 很可能更早达到。这里显然是课堂中的个人判断与玩笑式预测。

41|真正的单点:先进逻辑、内存和 ASML

  • Katti 把最突出的结构性风险归结为晶圆制造能力不足,而且同时涉及逻辑与内存。
  • TSMC、Samsung、Intel、Micron、SK hynix 等少数公司承载了关键产能;若进一步向设备层追溯,多家制造商都依赖 ASML 光刻机。

  • 因此,AI 供应链的风险不只在热门 GPU 的交付期,而是多个层级都可能存在高度集中的 choke point。

42|问答:近期看编排与 token 效率,长期看内存架构

  • 当学生问下一波效率提升来自哪里时,Katti 的短中期答案是 orchestration software / harness,以及让模型以更少 token 完成同一任务。
  • 中长期答案则是新的内存架构:只要 Transformer 仍是主流,计算单元的大致形态相对可知,围绕它组织状态、带宽与层级的方式还有很大创新空间。
  • 对 Stargate 类项目,他强调衡量目标正从绝对算力转向 time to compute——不仅要买到多少,还要多快形成可用容量。这也是偏好大型集中集群的运营原因。

44|开放权重模型:追赶、蒸馏与前沿领先窗口

  • Katti 认可开放权重模型在生态中的角色:它们会追赶前沿能力,并把这些能力蒸馏进更紧凑、算力需求更低的模型。
  • 但他仍相信 scaling law 在前沿智能上成立,训练领先模型会需要数量级更多的计算投入。
  • 在他的判断中,即使只有约六个月的智能领先也具有巨大价值,因此 OpenAI 不会因为开放模型追赶就停止投资前沿能力。这是其所在公司的战略立场,而不是对未来格局的确定结论。

一句话复盘

AI 基础设施的核心不是“再买更多 GPU”,而是把能源、制造、网络、内存、软件调度和复杂 Agent 计算图组织成可及时上线、稳定运行且足够低延迟的工业系统;决定竞争力的指标也正在从芯片数量转向真正可用的 time to compute。

讨论

这里是静态站点,没有内嵌评论区。如果这篇文章对你有用,欢迎通过 RSS 订阅后续更新。