实验与闯关
知识点看过就忘,手上做过才记得住。这里把全部动手环节汇总在一起, 你可以脱离课程顺序直接来练。
命令行闯关
在模拟终端里接手一套出问题的集群,按目标一步步定位根因。动手实验
需要真实环境(虚拟机或测试集群),跟着步骤把服务跑起来。L0 底座与前置35 分钟仅大纲
节点 OS 基线:装 K8s 之前要改的那些参数
内核参数、cgroup 驱动、时间同步、swap —— 这些没对齐,集群会以各种诡异的方式间歇性出问题。
L0 底座与前置35 分钟
etcd 磁盘验收:p99 fsync 10ms 这条硬线
集群卡顿、频繁选主、apiserver 超时,追到底常常是一块不合格的盘。这条线部署前就能用 fio 测出来。
L2 部署与运维45 分钟仅大纲
用 kubespray 装出第一套集群
不是 kubeadm 敲一遍就完事:inventory 怎么写、离线源怎么配、装完先验什么。
L2 部署与运维35 分钟仅大纲
把规划写进配置:group_vars 逐项拆解
同一份 playbook,配置写法决定了集群是能用两年还是三个月后推倒重来。
L2 部署与运维35 分钟仅大纲
控制面扩缩与证书轮转
3 台变 5 台、换掉一台坏掉的管理节点、证书还有 30 天到期 —— 都是不能试错的操作。
L2 部署与运维40 分钟仅大纲
集群升级:版本偏差与回滚预案
升级本身不难,难的是升到一半发现回不去。先把回滚路径想清楚再动手。
L2 部署与运维35 分钟仅大纲
etcd 运维:备份、恢复与碎片整理
集群其它东西都能重建,etcd 不能。这一节练的是「真的能恢复」,不是「有备份」。
L3 平台能力40 分钟仅大纲
CNI 与 Cilium:eBPF 数据面
CNI 选型是集群建成后最难改的决定之一。这一节把 Cilium 的能力边界讲清楚再动手装。
L3 平台能力35 分钟仅大纲
把服务暴露出去:MetalLB、Ingress 与 Gateway API
私有集群没有云厂商的 LB,LoadBalancer 那个 IP 得你自己变出来。
L3 平台能力40 分钟仅大纲
接入后端存储:ceph-csi、gpfs-csi 与快照
把已有的 Ceph 或 GPFS 接进集群,跑通动态供应、扩容和快照这三件事。
L3 平台能力40 分钟仅大纲
可观测性:指标、日志与该盯的那几个数
监控装了一堆面板,出事时还是不知道看哪个 —— 因为没先定义「什么算不正常」。
L4 进阶战场40 分钟仅大纲
GPU 节点:GPU Operator、设备插件与拓扑
把一台插了八张卡的机器变成集群里可调度的 GPU 节点,比装个驱动复杂得多。