KKubepath
L3

平台能力

网络、存储与可观测性

裸集群交付不出去。这一阶段把网络、存储、监控和镜像分发接上,让平台真的能承载业务。

8 节课 · 约 5 小时已完成 0/8
  1. 1

    CNI 与 Cilium:eBPF 数据面

    实验40 分钟仅大纲

    CNI 选型是集群建成后最难改的决定之一。这一节把 Cilium 的能力边界讲清楚再动手装。

    • 说清主流 CNI 的差异,给出选型理由而不是只报名字
    • 部署 Cilium 并用它替换 kube-proxy,验证 Service 仍然可达
    • 用 cilium 命令行排查 Pod 间不通的问题
  2. 2

    把服务暴露出去:MetalLB、Ingress 与 Gateway API

    实验35 分钟仅大纲

    私有集群没有云厂商的 LB,LoadBalancer 那个 IP 得你自己变出来。

    • 用 MetalLB 给 LoadBalancer 类型的 Service 分配可路由 IP
    • 部署 Ingress Nginx 并配置 TLS 证书的自动签发
    • 说清 Ingress 与 Gateway API 的差异,判断新项目该用哪个
  3. 3

    网络策略与多租户隔离

    原理30 分钟仅大纲

    默认全通的集群,一个租户的 Pod 可以直接连另一个租户的数据库。

    • 写出默认拒绝 + 按需放行的 NetworkPolicy 组合
    • 解释 NetworkPolicy 的生效前提与常见失效原因
    • 判断什么场景需要上 Cilium 的 L7 策略
  4. 4

    PV、PVC、StorageClass 与 CSI

    原理35 分钟

    一个 PVC 从 Pending 到挂进容器,中间经过四个组件。知道是哪四个,排障就有了方向。

    • 讲清 PV / PVC / StorageClass 三者的职责边界与动态供应流程
    • 按业务场景选对 accessModes 与 reclaimPolicy
    • 区分「卷创建不出来」和「卷挂不上」,分别去看哪个组件的日志
  5. 5

    接入后端存储:ceph-csi、gpfs-csi 与快照

    实验40 分钟仅大纲

    把已有的 Ceph 或 GPFS 接进集群,跑通动态供应、扩容和快照这三件事。

    • 部署一个 CSI 驱动并创建可用的 StorageClass
    • 验证动态供应、在线扩容与卷快照的完整链路
    • 为不同业务选择块存储还是共享文件存储
  6. 6

    闯关:PVC 一直 Pending,业务起不来

    闯关30 分钟

    模拟终端里给你一个卡了十分钟的 PVC,按目标一步步定位到真正的根因。

    • 用 events 而不是猜测来定位 PVC 卡住的原因
    • 分清 PVC Pending 与 Pod ContainerCreating 两类故障的排查路径
    • 读懂 CSI provisioner 日志里的关键报错
  7. 7

    可观测性:指标、日志与该盯的那几个数

    实验40 分钟仅大纲

    监控装了一堆面板,出事时还是不知道看哪个 —— 因为没先定义「什么算不正常」。

    • 部署 VictoriaMetrics 与日志采集,把集群指标收上来
    • 列出控制面、节点、工作负载三层各自必须盯的指标
    • 写出几条真正会响、且响了就有动作的告警规则
  8. 8

    镜像仓库与分发:Harbor、Spegel 与离线源

    原理30 分钟仅大纲

    几百个节点同时拉一个 10G 的镜像,仓库和网络会先倒下。

    • 搭出一套私有镜像仓库并接入集群的拉取凭据
    • 用 P2P 分发缓解大规模并发拉取的带宽压力
    • 为离线环境准备镜像、PyPI 与 Conda 源