2,727 字 · 293 词 · 约 8 分钟更新于
Stanford MS&E435:Applications, Applied AI——从 Baseten 看推理经济
Tuhin 将推理视为 AI 产品交付价值时持续发生的成本项。Baseten 的定位,是把模型优化、部署、跨云容量、可靠性、可观测性和安全能力打包成生产平台。
来源:YouTube 原视频(Stanford Online · MS&E435)
嘉宾是 Baseten 联合创始人兼 CEO Tuhin Srivastava。本节课不是泛泛介绍“AI 应用”,而是从生产推理平台的视角,讨论应用公司如何部署定制模型、改善单位经济性,以及 GPU 供给为何可能成为长期约束。
口径说明 文中的市场份额、成本、吞吐量和未来需求均为讲者在课堂上的陈述或估计,并非本笔记独立核验后的结论。
TL;DR
- Tuhin 将推理视为 AI 产品交付价值时持续发生的成本项。Baseten 的定位,是把模型优化、部署、跨云容量、可靠性、可观测性和安全能力打包成生产平台。
- 他认为当前推理支出约有 90%–95% 流向前沿闭源模型,定制/开放模型约占 5%;但开放模型通常落后约 90 天,却可能便宜 70%–90%,因此规模化应用会越来越有动力做后训练。
- 应用公司的壁垒不只是使用某个通用模型,而是把自己的数据、工作流和效用函数沉淀进模型。Baseten 希望承接“后训练—部署—推理”的完整闭环。
- 推理基础设施并非简单的大宗商品:一旦服务中断,客户产品也会中断。Baseten 因此跨约 20 家云、87 个集群拼接容量,并考虑从租赁走向部分自有算力。
- Tuhin 判断算力紧缺未必会回归“正常”:应用更 agentic、模型更大,两者都会扩大推理量。他提出的创业方向是标准化、模块化数据中心,让算力形成类似集装箱的标准交易单元。
00–03|从创业经历到生产推理
- 主持人用“推理需求将增长十亿倍”的说法开场;Tuhin 随后介绍自己从金融、科技公司到创办 Baseten 的经历。
- Baseten 成立约七年,前期方向有过调整,过去约四年聚焦 production inference,即为 AI 应用运行生产环境中的模型推理。
- 讲者把公司目标概括为:服务增长最快的 AI 公司,并从推理基础设施需求中获得增长。

04–06|两个应用案例:Wispr Flow 与 Abridge
- Wispr Flow:语音输入产品。Tuhin 表示,其链路中同时运行多个音频模型和语言模型,Baseten 负责基础设施与性能优化,核心体验指标是从说话到文字出现的延迟。
- Abridge:医疗场景的 ambient scribe,与电子病历系统(EMR)深度集成。讲者称其大约运行 20 个模型,从语音转写一直到生成临床记录,对速度与可靠性要求都很高。
- 两个案例共同说明:真实 AI 产品往往不是单模型 API 调用,而是一条由多个专用模型构成、必须持续稳定运行的生产链路。
06–08|为什么应用公司需要独立推理平台
- Tuhin 称,当前约 90%–95% 的推理支出流向前沿模型,定制或后训练开放模型约占 5%。他的判断是,应用公司若要形成可持续利润和防御性,定制模型占比会提升。
- 他把 Baseten 的价值拆成几层:
- 对模型和 runtime 做性能优化,降低延迟与成本;
- 跨云获得 GPU,并提供容错与弹性;
- 提供开发者平台、可观测性、安全与部署支持;
- 让客户不必自己在裸算力之上搭建完整推理栈。

08–13|开放模型的成本曲线与应用壁垒
- 主持人提出疑问:采用开放模型意味着离开前沿模型的能力演进主线,下一代闭源模型随时可能再次拉开差距。
- Tuhin 的回答是一个成本—能力权衡:他认为开放模型大约落后前沿模型 90 天,但运行成本可低 70%–90%。这为高调用量应用提供了明显的迁移动机。
- 从经营角度,他认为规模化公司会通过后训练把毛利率从很低的水平提高到更健康的区间。
- 从防御性角度,他强调应用公司需要拥有与自身工作流有关的“智能”:数据、评估标准、任务反馈和后训练结果,而不能把全部产品能力寄托在所有竞争者都能调用的同一前沿 API 上。

13–19|Baseten 平台与后训练闭环
- Baseten 的平台层次包括 Model API、专用部署、训练、推理 runtime、优化基础设施、DevEx、安全、可观测性和多云容量管理。
- 讲者解释的后训练流程是:
- 企业先定义自己的 utility function(效用函数),即模型究竟要优化什么业务结果;
- 企业提供数据并选择基础模型;
- 平台提供训练脚手架与工程支持;
- 训练后的模型直接进入生产推理,并持续用结果反馈下一轮训练。
- 他特别强调,平台无法替企业决定效用函数,因为只有企业自己理解产品、用户和业务目标。
- 对医疗转写一类任务,效用函数可以具体到降低某类转写错误;这比抽象的通用 benchmark 更贴近产品价值。

19–25|开放模型、“多模型世界”与战略风险
- 主持人指出,Baseten 的重要前提之一是开放模型能持续接近前沿能力,但西方开放模型实验室的商业模式并不清晰。
- Tuhin 表示,Baseten 实际押注两件事:独立应用层会存在;开放模型足够好,应用公司可以继续后训练。
- 他认为智能不应集中在极少数公司手中,并主张形成“world of many models”。
- 关于中美开放模型生态,他称近年的领先开放模型更多来自中国,同时认为美国也需要强大的开放模型;这是讲者的产业与国家安全判断,而非课程给出的定论。
- 他提到 Google、NVIDIA 等美国公司已投入开放模型,但成果仍需要时间显现。
25–29|为什么 NVIDIA 仍占主导
- Tuhin 支持硬件多样化,并认为 TPU 和新型加速器都有潜力;但他表示 Baseten 当前大部分机群仍运行在 NVIDIA 芯片上。
- 其现实优势不只是芯片本身,还包括成熟供应链、CUDA,以及 TensorRT-LLM、vLLM、SGLang 等围绕 NVIDIA 形成的软件生态。
- 他认为长期架构未必由单一芯片完成所有工作。随着 prefill 与 decode 的计算特性分离,异构硬件可能分别承担不同阶段。
- 但对当前需要快速交付的公司而言,软件兼容性和供给可得性仍使 NVIDIA 成为阻力最小的选择。
29–32|把多云 GPU 拼成可替换容量
- Tuhin 称 Baseten 覆盖约 20 家云、87 个集群,并把不同来源的 GPU 拼接和抽象为客户可用的统一容量。
- 目的之一是获得算力:若客户还限定某一家云,可用 GPU 会更难寻找。
- 目的之二是韧性:应用的推理请求可以跨供应商运行,降低单一云或集群故障对产品的影响。
- 他把推理类比为数据库:客户一旦完成集成并稳定扩容,迁移成本较高。更直接地说,推理失败往往意味着客户产品本身不可用,因此可靠性比单纯低价更重要。

32–37|从租算力走向部分自有算力
- Baseten 早期优先租用算力,以软件层为核心,也因为初创公司没有条件直接建设数据中心。
- Tuhin 称真实供给紧张程度比外部报道更严重,并举出一个 B200 集群续约报价的例子:单位价格据称从每小时 263 美元升至 510 美元。这个例子只用于表达相对涨幅,具体合同口径未展开。
- 他还称 Baseten 当前每天服务约 30 万亿 token;按其增长预测,两年后可能需要约 15 万个 B200 等效算力,对应约 70 亿美元计算支出。
- 仅靠租赁未必能锁定如此大规模供给,因此公司计划建立更直接的芯片供应关系并拥有部分基础设施。讲者估计,自建/自有相对成熟云服务可能带来约 30% 的经济优势。
- 他总结的三项核心风险是:开放模型不够好、独立应用层未能形成、拿不到足够算力。
37–41|算力紧缺为何可能长期存在
- 对“算力什么时候恢复正常”的问题,Tuhin 的判断是可能永远不会真正正常化。
- 原因有两条:应用会变得更 agentic,一次用户任务触发更多模型调用;模型本身也会继续增大。两者叠加,使推理和算力需求持续增长。
- 全球时区也使推理负载缺少统一低谷:一个地区需求下降时,另一个地区可能正在上升。
- 如果不做 Baseten,他最感兴趣的方向是能源、电力和数据中心建设,尤其是把数据中心做成标准化模块。

39–42|“算力集装箱”与给创业者的建议
- Tuhin 用集装箱类比模块化数据中心:集装箱通过统一贸易单元推动全球物流工业化;若算力也能被标准化,建设、维护、融资和交易都可能围绕统一接口形成产业。
- 课堂把这概括成“为算力创造 API”。讲者认为,今天的数据中心项目差异仍然很大,标准化空间明显。
- 对传统企业,他的建议不是盲目追逐通用模型,而是识别自身独有的数据和流程,把它们用于后训练并部署专用推理能力。
- 对学生,他没有建议押注一个永远不变的专业;他认为应选择真正感兴趣的方向,同时指出数据中心项目融资是值得深入研究的新领域。
43–49|问答:不成熟的算力市场、反命题与政府激励
- Tuhin 将当前算力交易形容为高度依赖关系网络、缺乏透明定价的市场,距离电力等成熟市场仍很远。
- 对 Baseten 论点的反命题,他列出几种情形:算力最终只掌握在极少数主体手中;开放模型无法达到足够质量;独立应用层被基础模型公司吸收。
- 关于美国开放模型,他认为政府和产业需要创造额外激励,也提到 NVIDIA、Microsoft、Google 已有投入;他预期政策参与会增加。
- 最后的技术问题回到推理软件栈:prefill/decode 解耦、kernel 优化以及围绕新硬件的 runtime,仍有大量工程和创业机会。
一句话框架
这场课给出的核心链条是:更多 AI 应用 → 更多生产推理 → 更强的专用模型经济性 → 更高的跨云可靠性要求 → 更紧张的 GPU、电力与数据中心供给。
来源与转写
- 视频:https://www.youtube.com/watch?v=Qh7Oxvo5sJI
- 字幕:YouTube 人工英文(
en-US) - 工作底稿:
/workspace/yt-Qh7Oxvo5sJI/transcript.txt
讨论
这里是静态站点,没有内嵌评论区。如果这篇文章对你有用,欢迎通过 RSS 订阅后续更新。