实验预计 40 分钟
GPU 节点:GPU Operator、设备插件与拓扑
把一台插了八张卡的机器变成集群里可调度的 GPU 节点,比装个驱动复杂得多。
学完这节你能做到
- 用 GPU Operator 完成驱动、容器运行时与设备插件的全套部署
- 验证 Pod 真正拿到了 GPU,并确认拓扑与 NUMA 亲和
- 排查「有卡但调度不上去」的常见原因
正文待编写以下是本节已定稿的小节大纲
- 1GPU Operator 组件与部署顺序
- 2设备插件与 nvidia.com/gpu 资源
- 3NFD:把硬件特征打成节点标签
- 4拓扑感知:GPU、网卡与 NUMA 的绑定
- 5MIG 与共享方案的取舍
- 6常见故障:驱动版本、运行时配置、资源不可见
延伸资料
- ·k8s-in-action
ai/gpu-operator/README.md - ·k8s-in-action
base/nfd/README.md