Learn
Grafana/01-what-is-grafana

Grafana 是什么

💡🤖 AI 时代,还要学 Grafana 吗?学到什么程度?

必要,但没必要背语法,概念级加会读就够了。仪表盘 JSON、面板配置乃至 PromQL 都能让 AI 生成初稿,但「该看哪些指标、为什么这条要告警、异常时怎么下钻」这套思路必须自己懂——否则 AI 配的大屏只是花架子,事故时你看不出门道。建议目标:理解可观测性三大支柱(Metrics / Logs / Traces)和监控目标,能读懂现成大屏并在出问题时指出排查方向。

Grafana 是一个开源的、水平可扩展的可视化与可观测性(Observability)平台。它本身不采集数据,而是把来自各种数据源(Prometheus、Loki、Tempo、Elasticsearch、MySQL、InfluxDB……)的数据统一成漂亮的图表与仪表盘,帮助你监控、排查和分析系统。

ℹ️Grafana 不负责存数据

Grafana 是「前端展示 + 查询 + 告警」层。原始指标/日志/链路由专门的存储系统(如 Prometheus)负责,Grafana 通过它们的查询接口拉数据。

1. 可观测性的三大支柱

现代系统的可观测性通常分为三类信号:

信号回答的问题典型数据源
Metrics(指标)「系统现在有多忙 / 多健康?」Prometheus、InfluxDB、CloudWatch
Logs(日志)「具体发生了什么?」Loki、Elasticsearch、ClickHouse
Traces(链路)「一次请求经历了哪些服务、慢在哪?」Tempo、Jaeger、Zipkin

Grafana 的强项正是把这三类信号关联在同一块大屏上:从图表发现 CPU 飙高 → 点开看同时段的日志 → 再下钻到慢调用对应的链路。

2. LGTM 技术栈

Grafana Labs 维护了一整套开源可观测性组件,首字母拼成 LGTM:

  • Loki — 日志聚合(类 Prometheus 理念,索引标签而非全文)
  • Grafana — 可视化与告警
  • Tempo — 分布式链路追踪
  • Mimir — 指标存储(Prometheus 的长期存储方案;也可直接用 Prometheus)
# 一行拉起整套 LGTM(仅演示,生产另有配置)
docker run -d -p 3000:3000 grafana/grafana-oss
💡Grafana OSS 还是 Enterprise?

本教程以 Grafana OSS(开源版) 为主,所有核心能力(数据源、仪表盘、告警、Loki/Tempo 集成)都免费。Enterprise 版额外提供 SSO、高级权限、报表等,社区版用不上。

3. Grafana 能做什么

  • 📊 Dashboard:把任意数据源的查询结果拼成可视化大屏
  • 🔍 Explore:临时查询、排查问题(不落盘成仪表盘)
  • 🚨 Alerting:基于查询定义告警规则,统一路由到邮件/Slack/Webhook
  • 🧩 Provisioning:用代码(YAML)声明数据源与仪表盘,纳入 Git 管理
  • 👥 权限:团队/文件夹级访问控制、LDAP/OAuth 登录

4. 与其他工具的区别

  • 对比 Kibana:Kibana 强在 Elasticsearch 日志检索;Grafana 更通用,能同时吃指标/日志/链路,且仪表盘体验更好。
  • 对比 Prometheus 自带的 UI:Prometheus 只管指标,原生界面仅够调试;Grafana 才是生产级展示与告警入口。

5. 本教程路线

本教程共 18 章,分三阶段:

  1. 基础(1–8 章):概念、安装、数据源、仪表盘、面板、PromQL、转换、模板变量
  2. 进阶(9–16 章):告警体系、Loki 日志、Tempo 链路、Provisioning、认证与权限、最佳实践
  3. 实战(17–18 章):搭建 Prometheus 监控栈、构建完整可观测性平台
🎯想一想

你们的系统中,现在指标、日志、链路分别存在哪里?如果没有,本章的 LGTM 栈是后续章节会逐步搭建的目标。

小结

  • Grafana 是「展示 + 查询 + 告警」层,自己不存数据
  • 可观测性三大支柱:Metrics / Logs / Traces
  • LGTM 是一套开箱即用的开源组合
  • 下一步我们动手把它跑起来 →