L3
平台能力
网络、存储与可观测性裸集群交付不出去。这一阶段把网络、存储、监控和镜像分发接上,让平台真的能承载业务。
8 节课 · 约 5 小时已完成 0/8
- 1
CNI 与 Cilium:eBPF 数据面
实验40 分钟仅大纲CNI 选型是集群建成后最难改的决定之一。这一节把 Cilium 的能力边界讲清楚再动手装。
- →说清主流 CNI 的差异,给出选型理由而不是只报名字
- →部署 Cilium 并用它替换 kube-proxy,验证 Service 仍然可达
- →用 cilium 命令行排查 Pod 间不通的问题
- 2
把服务暴露出去:MetalLB、Ingress 与 Gateway API
实验35 分钟仅大纲私有集群没有云厂商的 LB,LoadBalancer 那个 IP 得你自己变出来。
- →用 MetalLB 给 LoadBalancer 类型的 Service 分配可路由 IP
- →部署 Ingress Nginx 并配置 TLS 证书的自动签发
- →说清 Ingress 与 Gateway API 的差异,判断新项目该用哪个
- 3
网络策略与多租户隔离
原理30 分钟仅大纲默认全通的集群,一个租户的 Pod 可以直接连另一个租户的数据库。
- →写出默认拒绝 + 按需放行的 NetworkPolicy 组合
- →解释 NetworkPolicy 的生效前提与常见失效原因
- →判断什么场景需要上 Cilium 的 L7 策略
- 4
PV、PVC、StorageClass 与 CSI
原理35 分钟一个 PVC 从 Pending 到挂进容器,中间经过四个组件。知道是哪四个,排障就有了方向。
- →讲清 PV / PVC / StorageClass 三者的职责边界与动态供应流程
- →按业务场景选对 accessModes 与 reclaimPolicy
- →区分「卷创建不出来」和「卷挂不上」,分别去看哪个组件的日志
- 5
接入后端存储:ceph-csi、gpfs-csi 与快照
实验40 分钟仅大纲把已有的 Ceph 或 GPFS 接进集群,跑通动态供应、扩容和快照这三件事。
- →部署一个 CSI 驱动并创建可用的 StorageClass
- →验证动态供应、在线扩容与卷快照的完整链路
- →为不同业务选择块存储还是共享文件存储
- 6
闯关:PVC 一直 Pending,业务起不来
闯关30 分钟模拟终端里给你一个卡了十分钟的 PVC,按目标一步步定位到真正的根因。
- →用 events 而不是猜测来定位 PVC 卡住的原因
- →分清 PVC Pending 与 Pod ContainerCreating 两类故障的排查路径
- →读懂 CSI provisioner 日志里的关键报错
- 7
可观测性:指标、日志与该盯的那几个数
实验40 分钟仅大纲监控装了一堆面板,出事时还是不知道看哪个 —— 因为没先定义「什么算不正常」。
- →部署 VictoriaMetrics 与日志采集,把集群指标收上来
- →列出控制面、节点、工作负载三层各自必须盯的指标
- →写出几条真正会响、且响了就有动作的告警规则
- 8
镜像仓库与分发:Harbor、Spegel 与离线源
原理30 分钟仅大纲几百个节点同时拉一个 10G 的镜像,仓库和网络会先倒下。
- →搭出一套私有镜像仓库并接入集群的拉取凭据
- →用 P2P 分发缓解大规模并发拉取的带宽压力
- →为离线环境准备镜像、PyPI 与 Conda 源