0. 导读到上一篇 HPA 自动扩缩容我们已经完成了K8s 部署、发布、网络、配置、存储、弹性伸缩全套核心能力。服务已经可以做到零停机发布、自动扩容、数据持久化、资源均衡。但此时你的集群仍然存在致命盲区Agent 服务 CPU、内存异常飙升完全无感知LLM 推理超时、RAG 检索报错上涨只能用户反馈后才发现集群节点资源爆满、Pod 频繁重启、OOM 崩溃后台毫无提示HPA 伸缩异常、副本数异常波动无法实时观测线上故障只能瞎排查没有数据、没有趋势、没有依据没有监控的生产环境 裸奔上线。本篇我们落地云原生监控告警最后一块闭环Prometheus Grafana 全套生产监控体系。专门针对Java微服务 Python Agent/RAG/LLM服务做适配手把手搭建可视化大盘、指标采集、告警规则、异常预警彻底实现故障前置、问题可视、运维可控。1. 云原生监控核心架构必须吃透传统服务器监控是「单点采集、日志零散」K8s 动态容器环境必须依赖时序指标监控体系。1.1 三大核心组件分工Prometheus时序数据库采集器核心枢纽负责定时抓取集群、节点、Pod、服务的各项指标持久化时序数据Grafana可视化大盘读取 Prometheus 数据绘制曲线图、仪表盘、拓扑图实现资源趋势、性能变化可视化AlertManager告警中心匹配告警规则异常时推送钉钉/企业微信/邮件实现故障实时预警1.2 完整监控数据流集群/服务暴露Metrics指标 → Prometheus定时抓取 → 时序存储 → Grafana可视化展示 → AlertManager异常告警这套架构是目前 K8s 官方标准监控方案零商业成本、原生适配、性能极强可直接支撑企业级 AI 云原生集群。2. 各类服务指标暴露方案双栈适配想要被监控服务必须暴露/metrics指标接口针对我们的 Java Python 双栈体系全网统一标准适配。2.1 Java SpringBoot 服务天然支持SpringBoot 自带 Actuator 监控端点只需引入依赖默认暴露丰富指标JVM 堆内存、非堆内存、GC 次数、GC 耗时接口 QPS、响应耗时、成功率、异常率线程数、连接池、CPU 使用率完全适配集群监控、性能分析、故障定位是 Java 云原生服务的标配。2.2 Python Agent / FastAPI 服务AI核心Python LangChain、LangGraph、RAG 服务需要手动接入prometheus-client暴露自定义指标LLM 调用次数、成功次数、失败次数、超时率RAG 检索耗时、向量查询 QPSAgent 工具调用次数、排队任务数Python 进程内存、CPU、线程状态AI 服务业务指标远比重启、资源指标更重要可以精准定位是模型问题、检索问题、代码问题还是集群资源问题。2.3 K8s 集群原生指标通过 kube-state-metrics 自动采集集群全量指标节点 CPU、内存、磁盘、负载Pod 状态、重启次数、OOM 次数、就绪状态Deployment 副本数、扩缩容事件HPA 伸缩记录、资源使用率趋势3. Prometheus 核心原理与采集方式3.1 核心特性主动拉取Pull模式Prometheus 定时主动抓取各服务指标无需服务推送时序存储按时间戳存储指标数据完美适配趋势分析、故障回溯多维标签支持按节点、命名空间、Pod、服务名多维度筛选监控数据3.2 生产常用采集规则Node 节点采集监控整机资源水位防止节点资源打满雪崩Pod 容器采集监控单个服务资源波动定位异常 PodService 业务采集监控 Java、Agent 业务接口指标HPA 指标采集监控弹性伸缩是否正常生效4. Grafana 生产大盘搭建双栈专属Prometheus 只负责存数据Grafana 负责可视化展示生产环境核心看三大面板。4.1 集群节点总览大盘用于观测集群整体健康度节点在线状态、CPU/内存使用率趋势磁盘使用率、磁盘 IO 负载集群总 Pod 数、异常 Pod 数、重启次数作用快速判断是全局集群问题还是单个服务问题。4.2 Java 微服务监控大盘聚焦业务稳定性JVM 堆内存趋势、GC 频率、GC 耗时接口 QPS、P95/P99 响应耗时、错误率线程活跃数、阻塞线程数Pod 资源使用率、重启记录4.3 Python Agent/RAG 专属监控大盘AI项目重点AI 服务不可只看资源必须看业务语义指标LLM 调用成功率、失败率、超时率RAG 检索平均耗时、TopK 查询波动Agent 工具调用排队数量、堆积趋势Python 进程内存波动、内存泄漏趋势HPA 扩容前后 QPS 变化对比通过这套大盘可以精准定位用户对话卡顿是模型慢、检索慢、代码慢、还是资源瓶颈。5. 生产级告警规则配置核心保命能力可视化只是看数据告警才是保障生产稳定的核心。我整理了一套可直接上线的告警规则适配所有双栈云原生项目。5.1 集群资源告警节点 CPU 使用率持续 5 分钟 80%节点负载过高预警节点内存使用率持续 5 分钟 85%防止内存溢出集群雪崩磁盘使用率 85%防止磁盘打满集群瘫痪5.2 Pod 服务异常告警Pod 重启次数 3 次/10分钟疑似 OOM、代码报错、探针异常Pod 状态异常、就绪探针失败服务不可用告警HPA 持续扩容但负载不降存在服务性能瓶颈5.3 AI Agent 业务告警专属LLM 调用失败率 5%模型密钥、接口、限流异常LLM 平均响应耗时暴涨模型负载过高、网络拥堵RAG 检索超时率飙升向量库压力过大、索引异常Agent 任务堆积持续上涨服务处理能力不足需要扩容5.4 告警推送方式生产首选钉钉/企业微信机器人实时推送告警信息、故障时间、故障级别、对应Pod和服务名无需登录后台即可快速处理事故。6. 监控体系落地后的运维质变搭建整套监控体系后你的 AI 云原生项目彻底脱离“野生部署”具备企业级运维能力故障前置用户没感知运维已收到告警并处理问题精准定位区分是集群、节点、容器、代码、模型、中间件问题容量预判根据资源趋势提前扩容杜绝峰值突发崩溃迭代有据可依每次 Agent 优化、Prompt 迭代、代码升级均可对比性能指标配合HPA实现极致稳定监控看趋势、HPA 做实时伸缩双层保障7. 生产高频踩坑总结指标采集为空服务未暴露 /metrics 接口、容器端口未开放、采集规则路径错误监控数据断断续续Prometheus 资源过低、抓取间隔过长、网络波动告警轰炸、误报过多未配置持续时间判断瞬时波动触发无效告警AI服务看不出问题只监控资源未自定义 LLM/RAG 业务指标Grafana图表无数据标签不匹配、命名空间筛选错误、指标名称变更8. 总结PrometheusGrafana 是 K8s 云原生标准监控方案是生产环境上线的必备条件Java 服务依赖原生监控指标Python Agent 必须自定义 AI 业务指标才能精准观测服务状态节点、Pod、业务、HPA 四层监控体系彻底消除集群运维盲区配合实时告警能力实现故障提前发现、快速定位、快速恢复完成本篇落地后你的双栈云原生项目正式具备企业级生产稳定性