← 回總覽

AI 时代的新可观测性:不只看系统崩没崩,还要看模型有没有胡说

📅 2026-06-26 14:06 InfoQ 中文 软件编程 2 分鐘 1515 字 評分: 86
可观测性 AIOps LLM 软件工程 运维实践
📌 一句话摘要 New Relic 首席技术战略官 Nic Benders 在访谈中阐述可观测性从仪表盘/告警向 AI 驱动的智能理解演进,并探讨了 AI 系统本身的监控挑战与工程师的未来角色。 📝 详细摘要 本文基于对 New Relic 首席技术战略官 Nic Benders 的播客访谈编译整理。Benders 回顾了可观测性从代码插桩、数据平台到智能时代的演进,指出当前以仪表盘和告警为核心的模式已触及天花板——数据太多,人看不过来。他提出可观测性本质应是可理解性(understandability),并将技术路径分为统计方法、机器学习和神经网络三类,认为三者协同才是最佳方案。文章重点

📌 一句话摘要

New Relic 首席技术战略官 Nic Benders 在访谈中阐述可观测性从仪表盘/告警向 AI 驱动的智能理解演进,并探讨了 AI 系统本身的监控挑战与工程师的未来角色。

📝 详细摘要

本文基于对 New Relic 首席技术战略官 Nic Benders 的播客访谈编译整理。Benders 回顾了可观测性从代码插桩、数据平台到智能时代的演进,指出当前以仪表盘和告警为核心的模式已触及天花板——数据太多,人看不过来。他提出可观测性本质应是可理解性(understandability),并将技术路径分为统计方法、机器学习和神经网络三类,认为三者协同才是最佳方案。文章重点讨论了告警疲劳的根源与解决思路:增加告警反而训练人延迟响应,AI 应主动过滤和优先级排序。对于 AI 系统本身的监控,Benders 强调需要新的 golden signals(如 Token 使用量、答案质量、用户情绪),并建议结合 OpenTelemetry 推动标准化。面对新人入行的焦虑,他建议积极使用 AI 工具但不依赖它,把 AI 当作可以解释的导师。最后指出真正的 truth of source 始终是业务目标本身。

💡 主要观点

- 可观测性的本质不是观察,而是理解。 仪表盘和告警只是工具,而非目标。用户最终只想知道系统到底发生了什么,AI 应帮助从海量数据中提取可行动的见解。

增加告警反而降低响应能力,告警疲劳是头号问题。 噪音越多,工程师越倾向于等待自愈而非立即响应。AI 应在通知人之前先过滤、关联和判断严重程度,甚至自动执行已知修复。
AI 与统计方法、机器学习应协同工作,而非替代。 先将海量数据通过统计方法降维到万级,再交给 LLM 做总结和推理,才是可落地的路径。
AI 系统需要新的可观测性信号,如答案质量和用户情绪。 非确定性输出使传统性能指标不够,需引入语义质量评估,甚至用更强的模型作为“主管”抽样评判 AI 的输出。
最终真相来源是业务目标本身。 无论监控什么系统,最核心的信号永远是业务指标(如成交额、用户互动),其他都是诊断工具。

💬 文章金句

- 没人真的想‘观察’,大家要的是‘理解’。

  • 增加 alert 并不会提升响应能力。它会训练人产生一种反应:‘先等一下,看看它会不会自己恢复。’结果响应时间反而被拉长了。噪音越多,响应越慢,但团队却误以为 alert 越多越安全。
  • 真正的‘source of truth’始终是业务本身。
  • AI 不是减少工作,而是让每个人产出更多,历史上从来没有哪次技术进步让人类真的减少工作量。

📊 文章信息

AI 初评:86

来源:InfoQ 中文

作者:InfoQ 中文

分类:软件编程

语言:中文

阅读时间:36 分钟

字数:8927

标签: 可观测性, AIOps, LLM, 软件工程, 运维实践

阅读完整文章

查看原文 → 發佈: 2026-06-26 14:06:00 收錄: 2026-06-26 22:00:39

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。