KKubepath

实验与闯关

知识点看过就忘,手上做过才记得住。这里把全部动手环节汇总在一起, 你可以脱离课程顺序直接来练。

命令行闯关

在模拟终端里接手一套出问题的集群,按目标一步步定位根因。

动手实验

需要真实环境(虚拟机或测试集群),跟着步骤把服务跑起来。
L0 底座与前置35 分钟仅大纲

节点 OS 基线:装 K8s 之前要改的那些参数

内核参数、cgroup 驱动、时间同步、swap —— 这些没对齐,集群会以各种诡异的方式间歇性出问题。

L0 底座与前置35 分钟

etcd 磁盘验收:p99 fsync 10ms 这条硬线

集群卡顿、频繁选主、apiserver 超时,追到底常常是一块不合格的盘。这条线部署前就能用 fio 测出来。

L2 部署与运维45 分钟仅大纲

用 kubespray 装出第一套集群

不是 kubeadm 敲一遍就完事:inventory 怎么写、离线源怎么配、装完先验什么。

L2 部署与运维35 分钟仅大纲

把规划写进配置:group_vars 逐项拆解

同一份 playbook,配置写法决定了集群是能用两年还是三个月后推倒重来。

L2 部署与运维35 分钟仅大纲

控制面扩缩与证书轮转

3 台变 5 台、换掉一台坏掉的管理节点、证书还有 30 天到期 —— 都是不能试错的操作。

L2 部署与运维40 分钟仅大纲

集群升级:版本偏差与回滚预案

升级本身不难,难的是升到一半发现回不去。先把回滚路径想清楚再动手。

L2 部署与运维35 分钟仅大纲

etcd 运维:备份、恢复与碎片整理

集群其它东西都能重建,etcd 不能。这一节练的是「真的能恢复」,不是「有备份」。

L3 平台能力40 分钟仅大纲

CNI 与 Cilium:eBPF 数据面

CNI 选型是集群建成后最难改的决定之一。这一节把 Cilium 的能力边界讲清楚再动手装。

L3 平台能力35 分钟仅大纲

把服务暴露出去:MetalLB、Ingress 与 Gateway API

私有集群没有云厂商的 LB,LoadBalancer 那个 IP 得你自己变出来。

L3 平台能力40 分钟仅大纲

接入后端存储:ceph-csi、gpfs-csi 与快照

把已有的 Ceph 或 GPFS 接进集群,跑通动态供应、扩容和快照这三件事。

L3 平台能力40 分钟仅大纲

可观测性:指标、日志与该盯的那几个数

监控装了一堆面板,出事时还是不知道看哪个 —— 因为没先定义「什么算不正常」。

L4 进阶战场40 分钟仅大纲

GPU 节点:GPU Operator、设备插件与拓扑

把一台插了八张卡的机器变成集群里可调度的 GPU 节点,比装个驱动复杂得多。

规划计算器

改参数看结果,把节点规格、可分配资源与集群规模的账算明白。