原理预计 30 分钟
硬件与拓扑:控制面、计算节点与 GPU 机型
同样是「三台管理节点 + 若干计算节点」,配错 CPU、网卡或盘位,跑起来的差距是数量级的。
学完这节你能做到
- 给控制面、CPU 计算、GPU 计算三类节点各开一份合理配置
- 说清 GPU 节点上 NUMA、网卡与 GPU 的亲和性为什么影响训练性能
- 判断什么场景需要 RoCE / InfiniBand,什么场景以太网就够
正文待编写以下是本节已定稿的小节大纲
- 1控制面规格:CPU、内存与 etcd 盘
- 2计算节点:Pod 密度、系统预留与超卖
- 3GPU 节点:卡型、PCIe 拓扑、NUMA 亲和
- 4网络:管理网、业务网、存储网与 RDMA
- 5故障域:机架、电源与调度约束的对应关系
延伸资料
- ·k8s-in-action
k8s/plan/README.md - ·Netpath 网络工程师成长路径 ↗