跳到正文
Chengshu
@skadai · 2026.10.03
文章
原创
系列
标签
搜索
关于
ADMIN
设置
退出
RSS
Chengshu
/
标签
/
推理
推理
2 篇文章
2026年10月11日
如何扩展你的模型(8):在 TPU 上部署 LLaMA 3
中英对照第 8 篇:在 TPU v5e 上服务 LLaMA 3 要花多少钱?吞吐和延迟如何权衡?左栏原文,右栏译文。
LLaMA 3
推理
成本估算
延迟
中英对照
→
2026年10月10日
如何扩展你的模型(7):Transformer 推理全知道
中英对照第 7 篇:推理引入了延迟这个新维度,也改变了显存版图——KV cache、batching、prefill/decode、Paged Attention、投机采样与 P/D 分离。左栏原文,右栏译文。
推理
KV Cache
Paged Attention
投机采样
中英对照
→