跳到正文
Chengshu
@skadai · 2026.10.03
文章
原创
系列
标签
搜索
关于
ADMIN
设置
退出
RSS
Chengshu
/
标签
/
训练
训练
2 篇文章
2026年10月9日
如何扩展你的模型(6):在 TPU 上训练 LLaMA 3
中英对照第 6 篇:把前面的理论套到 LLaMA 3 上——需要多少 TPU、要训多久、大概花多少钱。左栏原文,右栏译文。
LLaMA 3
训练
成本估算
TPU
中英对照
→
2026年10月8日
如何扩展你的模型(5):如何并行训练一个 Transformer
中英对照第 5 篇:FSDP / ZeRO、Megatron 张量并行、流水线并行、专家并行——给定芯片数和 batch size,怎样组合这些技术把训练效率做到最高。左栏原文,右栏译文。
训练
FSDP
张量并行
流水线并行
中英对照
→