大家好,我是金全。

过去十几年,可观测性解决的核心问题一直很明确:

系统越复杂,企业越需要知道问题发生在哪里、影响了谁、该从哪里查起。

指标告诉我们哪里异常。

日志告诉我们发生了什么。

Trace 告诉我们请求经过了哪里。

链路和告警让故障不再隐藏。

从这个角度看,

可观测性过去十几年的价值是很清楚的:

让异常可见,

让链路可追,

让影响可评估,

让故障可定位。

但最近几年,我越来越强烈地感觉到:

企业正在遇到另一类问题。

数据越来越多。

日志、Trace、告警和调用链路也越来越完整。

可事故发生以后,最难的往往已经不是“有没有数据”。

而是:

 

能不能说清楚为什么发生。

 

更准确地说,是能不能给出一个可信的解释。

这里说的可信解释,不是简单给一句“根因是某某服务异常”。

它至少要说清楚:

  • 原因是否成立。

  • 影响范围为什么扩大。

  • 哪些可能原因已经被排除。

  • 下一步最应该查哪里。

如果是 AI 参与的系统,还要说清楚:

它当时的判断和动作,是怎么一步步形成的。

这也是我最近几篇一直在讲 AI 可观测性、知识依赖和事故现场还原的原因。

它们背后,其实指向同一个变化:

可观测性正在从“可见、可定位”走向“可解释、可调查”。

可见,让企业知道“发生了什么”。

定位,让企业知道“问题在哪里”。

调查,要进一步回答“为什么发生”。

而 AI 第一次让企业开始需要调查:

决策是怎么形成的。

 

可见和定位为什么重要?

 

先说过去。

传统 IT 系统变复杂以后,企业最怕的是问题已经影响用户,团队还不知道它发生在哪里。

服务挂了,不知道。

接口慢了,不知道。

数据库抖了,不知道。

一条请求经过十几个系统,最后用户报错,运维团队却不知道问题到底卡在哪里。

所以指标、日志、Trace、链路、告警这些能力,一步步发展起来。

指标让异常变得可见。

日志让事件变得可查。

Trace 让调用路径变得可追。

告警让问题不再只能靠用户投诉才发现。

这一阶段可观测性的价值非常清楚:

让异常可见,

让链路可追,

让影响可评估,

让故障可定位。

在那个阶段,企业最需要回答的问题是:

哪里慢了?

哪里错了?

哪里挂了?

哪个服务影响了哪个服务?

这也是 APM 和可观测性过去十几年真正创造价值的地方。

先让复杂系统变得可观测。

再让故障被定位。

 

数据越来越多,解释越来越难

但今天的问题开始变了。

很多企业并不是没有数据。

恰恰相反。

日志越来越多。

指标越来越多。

Trace 越来越完整。

告警越来越细。

Dashboard 越来越多。

可真正出事故以后,大家还是经常问一句话:

 

所以,原因到底是什么?

 

这句话背后很现实。

数据不等于解释。

记录不等于结论。

看见现象,不等于知道原因。

在传统系统里,有些问题还比较容易沿着技术路径解释。

比如:

  • CPU 升高。

  • 数据库慢 SQL 增多。

  • 接口响应变慢。

  • 请求超时。

  • 用户访问失败。

这是一条相对清楚的故障传播路径。

当然真实系统会更复杂,但至少排查方向是清楚的。

沿着指标、日志和 Trace 往下追,很多问题最终能落到某个服务、某次变更、某个资源瓶颈或者某条慢查询上。

可 AI 系统不是这样。

一个 Agent 接到任务。

查了资料。

调用了工具。

形成了判断。

执行了动作。

最后影响了业务结果。

这里每一步都可能有记录。

但事故发生以后,企业真正想知道的是:

  • 为什么它当时这样判断?

  • 为什么它选择这个工具?

  • 为什么它引用了这份资料?

  • 为什么本该拦住它的规则没有生效?

  • 为什么一个看起来正确的动作,最后变成了业务事故?

这时,问题已经不只是系统状态问题。

而是行为形成问题。

 

AI 第一次让企业需要调查决策形成过程

 

过去的软件系统,

行为边界主要由代码和流程预先定义。

AI 不一样。

它会在运行时理解任务、选择资料、调用工具、形成判断。

所以企业需要调查的,不只是执行过程。

还包括决策形成过程。

所以我越来越觉得:

 

数据越来越丰富。

可信解释却越来越稀缺。

AI 把调查推到了前台

这几年,很多企业对 AI 的期待一直在升级。

一开始是问答。

后来是知识库。

再后来是 Agent。

现在开始接入工单、审批、运维平台、数据库、代码仓库和业务系统。

AI 不再只是生成答案。

它开始参与工作。

一旦 AI 开始参与工作,事故调查的难度就变了。

过去我们调查系统事故,核心是追:

请求怎么走。

故障怎么传。

哪个节点出问题。

今天调查 AI 事故,还要追:

任务怎么被理解。

现场信息怎么进入判断。

资料为什么被采用。

工具为什么被调用。

动作为什么被允许。

影响范围为什么会扩大。

这就是第 11 篇讲的:

传统事故调查,追的是故障传播路径。

AI 事故调查,还要追行为形成路径。

这句话放到可观测性行业里看,其实意味着一件事:

仅仅可见、可定位已经不够了。

企业还要能调查。

调查,不是把日志总结一下

这里要小心一个误区。

很多人一听“调查”,会以为就是让 AI 总结日志。

把告警摘要一下。

把错误日志翻译成人话。

把 Trace 链路做个解释。

这些能力有价值。

但它们还不是我说的调查。

真正的调查,至少要多回答几类问题。

第一,哪些现象是结果,哪些可能是原因。

很多事故里,最先被看到的告警不一定是根因。

它可能只是影响扩大以后冒出来的症状。

第二,哪些证据支持这个判断,哪些证据反而排除了这个判断。

如果一个系统只会挑几条日志来证明自己的结论,那不是调查。

那更像事后讲故事。

第三,影响面到底有多大。

一个错误动作影响了哪些客户、哪些交易、哪些服务承诺,和一个接口返回 500,是两类完全不同的问题。

第四,下一步该查哪里。

好的调查不是直接给一个“根因小作文”。

它应该告诉团队:

现在最值得查的方向是什么。

还缺哪一类证据。

哪些可能原因已经被排除。

哪一步如果继续执行,会带来新的风险。

所以,可观测性从定位走向调查,不是多加一个 AI 总结按钮。

而是要把分散的数据,组织成一个可以被验证、可以被复盘、可以继续追问的调查过程。

但调查也不是终点。

调查解决的是:

为什么发生。

更往前一步,企业真正需要的是:

这些解释能不能被验证。

能不能被复用。

能不能帮助下一次做出更可靠的决策和行动。

这也是我在这个系列里一直讨论“因果 AI”的原因。

它不是替代指标、日志和 Trace,也不是简单做 RCA。

 

而是在运行现场里,把证据、行为和影响串起来,形成可信解释。

行业为什么都在往这个方向走?

如果只从国内企业自己的感受看,这个变化已经很明显。

很多团队不是没有日志。

不是没有 Trace。

不是没有告警。

而是事故发生以后,仍然要靠一群专家在群里不断追问:

这个告警是不是原因?

这次变更有没有关系?

这个接口慢,是根因还是结果?

这个 Agent 调用工具之前,到底看到了什么?

这个动作为什么没有被审批拦住?

从 2026 年的行业动作看,国内外厂商也在验证这个方向。

Datadog 在强化 RCA。

Dynatrace 长期强调自动化分析和因果关系。

ServiceNow 把事件、流程和知识库连接到一起。

Resolve、Traversal 这类新公司则更直接,把生产事故调查做成 AI 参与的过程。

国内也在出现类似趋势。

听云、AgentLoop、观测云、博睿等厂商,也都在沿着这个方向推进。

有的从可观测性、AIOps 和根因定位继续往调查能力延伸。

有的开始把 AI 应用和 Agent 的 Session、Trace、工具调用、评估和风险事件纳入观测范围。

重点不在于哪家厂商更强。

重点在于,大家都在往同一个方向走。

真正值得关注的是:

大家都在意识到,单纯记录数据已经不够了。

企业需要把数据组织成解释问题的过程。

 

也就是说,可观测性的下一步,不只是定位得更快。

而是形成更可信的解释。

对中国企业来说,启发是什么?

我不认为中国企业今天应该马上照搬海外某个产品形态。

中国企业更现实的问题是:

  • 你们已经接入了多少 AI?

  • 这些 AI 有没有开始调用工具?

  • 有没有开始进入流程?

  • 有没有接触客户、交易、配置、审批和生产系统?

如果答案是肯定的,那么企业就不能只问:

  • 有没有日志?

  • 有没有 Trace?

  • 有没有看板?

还要继续问:

  • 出了问题以后,能不能还原现场?

  • 能不能形成可信解释?

  • 能不能知道影响范围为什么扩大?

  • 能不能判断下一步该查哪里?

  • 能不能知道哪一道边界没有生效?

对于中国企业来说,这件事的启发不是“买一个类似产品”。

而是重新审视自己的可观测性体系:

它到底只是记录系统状态。

还是已经具备调查问题的能力。

尤其当 AI 开始进入生产系统以后,

这个问题会变得越来越现实。

因为 AI 事故往往不是一个简单报错。

它可能是一次错误判断。

一次错误引用。

一次错误工具调用。

一次越过边界的动作。

一次没有被及时发现的业务后果。

这些东西都不能只靠“可见”和“定位”来解决。

最后

过去,可观测性的价值,是让企业发现异常、追踪链路、定位故障。

这件事仍然重要。

没有指标、日志和 Trace,企业连问题发生在哪里、影响了谁都很难说清。

但今天,仅仅可见、可定位已经不够了。

数据越多,越需要有人把它们组织成可验证的解释。

系统越复杂,越需要调查路径。

AI 越接近生产,越需要还原行为形成过程。

所以我认为:

未来可观测性的价值,不只是告诉企业哪里出了问题。

而是帮助企业回答:

为什么发生?

影响范围是怎么扩大的?

下一步该查哪里?

过去可观测性解决的是“可见”和“可定位”。

未来可观测性越来越多要解决的是“形成可信解释”。

而且不是随便给一个解释。

是给一个经得起核对、复盘和追问的可信解释。

过去可观测性很大程度上竞争的是谁能更完整地采集和关联数据。

未来可观测性竞争的,可能是谁能更快建立可信解释。

调查不是终点。

可信解释,才是企业真正需要建立的能力。

这可能是可观测性行业接下来最重要的一次变化。

#AI系统 #AI可观测性 #因果AI #AgentOps #AI运行系统

  • 现代生活已经深深地依赖于数字技术和互联网连接。无论是工作、娱乐还是日常生活,我们都需要始终保持在线状态,访问各种服务和信息。然而,当数字生活变得如此重要时,IT系统的可靠性和性能就成为了至关重要的因素。在这方面,公司IT运维监控发挥了不可或缺的作用,确保我们能够始终连接到所需的服务。

    2023-10-26

  • 应用性能管理是企业在数字化转型过程中必不可少的一项工作,它可以帮助企业监控和优化应用程序的性能,确保用户体验的稳定和高效。然而,市场上有很多应用性能管理公司,如何选择一家品质好的公司成为了企业面临的难题。

    2023-07-12

  • 在当今技术世界中,应用监控系统已经成为了维持企业日常运营的关键部分。随着业务规模的不断扩大和应用程序的复杂性增加,应用监控系统逐渐展现出其重要性。那么,这种系统到底有哪些优势呢?

    2023-10-19

  • ​apm应用性能管理公司,作为应用性能监测和调优领域的关键性企业,致力于帮助企业提升应用程序的性能效率。在当今信息时代,应用程序已经成为企业运营不可或缺的一部分,而其性能的稳定与高效对于企业的竞争力和用户体验至关重要。

    2023-08-24

  • 在当今数字化时代,监控应用性能已经成为企业成功的关键因素之一。无论是在线交易平台、社交媒体网站,还是云计算基础设施,对应用性能的持续监控都是确保用户满意度和业务稳健运行的关键。

    2023-11-09