KKubepath
实验预计 40 分钟

可观测性:指标、日志与该盯的那几个数

监控装了一堆面板,出事时还是不知道看哪个 —— 因为没先定义「什么算不正常」。

学完这节你能做到

  • 部署 VictoriaMetrics 与日志采集,把集群指标收上来
  • 列出控制面、节点、工作负载三层各自必须盯的指标
  • 写出几条真正会响、且响了就有动作的告警规则
正文待编写以下是本节已定稿的小节大纲
  1. 1指标体系:VictoriaMetrics 与 exporter 分工
  2. 2控制面必看:apiserver 延迟、etcd fsync、选主次数
  3. 3节点必看:资源压力、kubelet 与运行时状态
  4. 4工作负载:重启、驱逐与 OOM
  5. 5日志采集与检索
  6. 6告警设计:可动作、有阈值、不重复

延伸资料

  • ·k8s-in-actiono11y/README.md
  • ·k8s-in-actionaddons/metrics-server/README.md