🔥
Prometheus
从时序数据库与 PromQL 到抓取、relabel、记录/告警规则与 Alertmanager,搭建云原生监控体系。
- 01什么是 Prometheus监控的演进、Pull 模型与核心概念,理解 Prometheus 的定位
- 02整体架构与核心组件Prometheus Server、TSDB、Exporter、Alertmanager、Pushgateway 与抓取流程
- 03安装与基础配置二进制与 Docker 安装、prometheus.yml 结构、启动与常用参数
- 04数据模型指标名、标签、样本与时间戳,理解时序的构成
- 05四种指标类型Counter、Gauge、Histogram、Summary 的语义、命名与典型用法
- 06PromQL 基础即时/区间向量、选择器、匹配器与 offset
- 07PromQL 运算符算术/比较/逻辑运算与向量匹配
- 08常用函数rate/irate、increase、histogram_quantile、topk 等实战函数
- 09抓取配置与 Exporterscrape_configs 全字段详解、node_exporter 与 textfile collector、blackbox exporter 与 Pushgateway
- 10relabel 与指标重标记relabel_configs 与 metric_relabel_configs 的时机差异、八种 action 详解与实战避坑
- 11记录规则与告警规则rule_files 组织方式、recording rules 命名约定与性能优化、alerting rules 结构与模板变量
- 12Alertmanager 告警治理route 路由树、分组去重、抑制与静默、各类 receiver 配置与告警生命周期
- 13服务发现从 static_configs 到 file_sd、DNS、Consul、Kubernetes,让 Prometheus 自动找到抓取目标
- 14联邦用 /federate 端点做分层汇聚与跨集群聚合,以及联邦的适用边界
- 15高可用与长期存储双副本高可用、remote_write 远程存储,以及 Thanos、Cortex、Mimir 的选型对比
- 16黑盒监控与 blackbox_exporter用 probe 探测 http/icmp/tcp/dns,配合 relabel 把抓取重定向到 blackbox
- 17进阶 PromQL 模式子查询、absent 告警、聚合模式、SLO 错误预算与燃烧率、histogram_quantile 进阶与长尾分析
- 18运维最佳实践基数爆炸的诊断与治理、保留期与容量估算、性能调优、记录规则减负、联邦边界与告警疲劳
- 19埋点最佳实践四种指标类型的取舍、客户端库骨架、命名规范、Histogram 与 Summary 的权衡,以及 RED/USE 方法和自定义 Exporter 的 OpenMetrics 格式
- 20毕业项目:搭建一套完整的监控系统用 scrape_configs、relabel、记录规则、告警规则、Alertmanager 路由与 Grafana 面板,为 Nginx + 后端 API + Postgres 三件套搭一套端到端可观测系统