实验预计 40 分钟
可观测性:指标、日志与该盯的那几个数
监控装了一堆面板,出事时还是不知道看哪个 —— 因为没先定义「什么算不正常」。
学完这节你能做到
- 部署 VictoriaMetrics 与日志采集,把集群指标收上来
- 列出控制面、节点、工作负载三层各自必须盯的指标
- 写出几条真正会响、且响了就有动作的告警规则
正文待编写以下是本节已定稿的小节大纲
- 1指标体系:VictoriaMetrics 与 exporter 分工
- 2控制面必看:apiserver 延迟、etcd fsync、选主次数
- 3节点必看:资源压力、kubelet 与运行时状态
- 4工作负载:重启、驱逐与 OOM
- 5日志采集与检索
- 6告警设计:可动作、有阈值、不重复
延伸资料
- ·k8s-in-action
o11y/README.md - ·k8s-in-action
addons/metrics-server/README.md