KKubepath
集群运维工程师 路线30 / 36 · L4 进阶战场退出路线
实验预计 40 分钟

GPU 节点:GPU Operator、设备插件与拓扑

把一台插了八张卡的机器变成集群里可调度的 GPU 节点,比装个驱动复杂得多。

学完这节你能做到

  • 用 GPU Operator 完成驱动、容器运行时与设备插件的全套部署
  • 验证 Pod 真正拿到了 GPU,并确认拓扑与 NUMA 亲和
  • 排查「有卡但调度不上去」的常见原因
正文待编写以下是本节已定稿的小节大纲
  1. 1GPU Operator 组件与部署顺序
  2. 2设备插件与 nvidia.com/gpu 资源
  3. 3NFD:把硬件特征打成节点标签
  4. 4拓扑感知:GPU、网卡与 NUMA 的绑定
  5. 5MIG 与共享方案的取舍
  6. 6常见故障:驱动版本、运行时配置、资源不可见

延伸资料

  • ·k8s-in-actionai/gpu-operator/README.md
  • ·k8s-in-actionbase/nfd/README.md