
大家好,我是金全。
过去十几年,可观测性解决的核心问题一直很明确:
系统越复杂,企业越需要知道问题发生在哪里、影响了谁、该从哪里查起。
指标告诉我们哪里异常。
日志告诉我们发生了什么。
Trace 告诉我们请求经过了哪里。
链路和告警让故障不再隐藏。
从这个角度看,
可观测性过去十几年的价值是很清楚的:
让异常可见,
让链路可追,
让影响可评估,
让故障可定位。
但最近几年,我越来越强烈地感觉到:
企业正在遇到另一类问题。
数据越来越多。
日志、Trace、告警和调用链路也越来越完整。
可事故发生以后,最难的往往已经不是“有没有数据”。
而是:
能不能说清楚为什么发生。
更准确地说,是能不能给出一个可信的解释。
这里说的可信解释,不是简单给一句“根因是某某服务异常”。
它至少要说清楚:
-
原因是否成立。
-
影响范围为什么扩大。
-
哪些可能原因已经被排除。
-
下一步最应该查哪里。
如果是 AI 参与的系统,还要说清楚:
它当时的判断和动作,是怎么一步步形成的。
这也是我最近几篇一直在讲 AI 可观测性、知识依赖和事故现场还原的原因。
它们背后,其实指向同一个变化:
可观测性正在从“可见、可定位”走向“可解释、可调查”。
可见,让企业知道“发生了什么”。
定位,让企业知道“问题在哪里”。
调查,要进一步回答“为什么发生”。
而 AI 第一次让企业开始需要调查:
决策是怎么形成的。
可见和定位为什么重要?
先说过去。
传统 IT 系统变复杂以后,企业最怕的是问题已经影响用户,团队还不知道它发生在哪里。
服务挂了,不知道。
接口慢了,不知道。
数据库抖了,不知道。
一条请求经过十几个系统,最后用户报错,运维团队却不知道问题到底卡在哪里。
所以指标、日志、Trace、链路、告警这些能力,一步步发展起来。
指标让异常变得可见。
日志让事件变得可查。
Trace 让调用路径变得可追。
告警让问题不再只能靠用户投诉才发现。
这一阶段可观测性的价值非常清楚:
让异常可见,
让链路可追,
让影响可评估,
让故障可定位。
在那个阶段,企业最需要回答的问题是:
哪里慢了?
哪里错了?
哪里挂了?
哪个服务影响了哪个服务?
这也是 APM 和可观测性过去十几年真正创造价值的地方。
先让复杂系统变得可观测。
再让故障被定位。
数据越来越多,解释越来越难
但今天的问题开始变了。
很多企业并不是没有数据。
恰恰相反。
日志越来越多。
指标越来越多。
Trace 越来越完整。
告警越来越细。
Dashboard 越来越多。
可真正出事故以后,大家还是经常问一句话:
所以,原因到底是什么?
这句话背后很现实。
数据不等于解释。
记录不等于结论。
看见现象,不等于知道原因。
在传统系统里,有些问题还比较容易沿着技术路径解释。
比如:
-
CPU 升高。
-
数据库慢 SQL 增多。
-
接口响应变慢。
-
请求超时。
-
用户访问失败。
这是一条相对清楚的故障传播路径。
当然真实系统会更复杂,但至少排查方向是清楚的。
沿着指标、日志和 Trace 往下追,很多问题最终能落到某个服务、某次变更、某个资源瓶颈或者某条慢查询上。
可 AI 系统不是这样。
一个 Agent 接到任务。
查了资料。
调用了工具。
形成了判断。
执行了动作。
最后影响了业务结果。
这里每一步都可能有记录。
但事故发生以后,企业真正想知道的是:
-
为什么它当时这样判断?
-
为什么它选择这个工具?
-
为什么它引用了这份资料?
-
为什么本该拦住它的规则没有生效?
-
为什么一个看起来正确的动作,最后变成了业务事故?
这时,问题已经不只是系统状态问题。
而是行为形成问题。
AI 第一次让企业需要调查决策形成过程
过去的软件系统,
行为边界主要由代码和流程预先定义。
AI 不一样。
它会在运行时理解任务、选择资料、调用工具、形成判断。
所以企业需要调查的,不只是执行过程。
还包括决策形成过程。
所以我越来越觉得:
数据越来越丰富。
可信解释却越来越稀缺。

AI 把调查推到了前台
这几年,很多企业对 AI 的期待一直在升级。
一开始是问答。
后来是知识库。
再后来是 Agent。
现在开始接入工单、审批、运维平台、数据库、代码仓库和业务系统。
AI 不再只是生成答案。
它开始参与工作。
一旦 AI 开始参与工作,事故调查的难度就变了。
过去我们调查系统事故,核心是追:
请求怎么走。
故障怎么传。
哪个节点出问题。
今天调查 AI 事故,还要追:
任务怎么被理解。
现场信息怎么进入判断。
资料为什么被采用。
工具为什么被调用。
动作为什么被允许。
影响范围为什么会扩大。
这就是第 11 篇讲的:
传统事故调查,追的是故障传播路径。
AI 事故调查,还要追行为形成路径。
这句话放到可观测性行业里看,其实意味着一件事:
仅仅可见、可定位已经不够了。
企业还要能调查。
调查,不是把日志总结一下
这里要小心一个误区。
很多人一听“调查”,会以为就是让 AI 总结日志。
把告警摘要一下。
把错误日志翻译成人话。
把 Trace 链路做个解释。
这些能力有价值。
但它们还不是我说的调查。
真正的调查,至少要多回答几类问题。
第一,哪些现象是结果,哪些可能是原因。
很多事故里,最先被看到的告警不一定是根因。
它可能只是影响扩大以后冒出来的症状。
第二,哪些证据支持这个判断,哪些证据反而排除了这个判断。
如果一个系统只会挑几条日志来证明自己的结论,那不是调查。
那更像事后讲故事。
第三,影响面到底有多大。
一个错误动作影响了哪些客户、哪些交易、哪些服务承诺,和一个接口返回 500,是两类完全不同的问题。
第四,下一步该查哪里。
好的调查不是直接给一个“根因小作文”。
它应该告诉团队:
现在最值得查的方向是什么。
还缺哪一类证据。
哪些可能原因已经被排除。
哪一步如果继续执行,会带来新的风险。
所以,可观测性从定位走向调查,不是多加一个 AI 总结按钮。
而是要把分散的数据,组织成一个可以被验证、可以被复盘、可以继续追问的调查过程。
但调查也不是终点。
调查解决的是:
为什么发生。
更往前一步,企业真正需要的是:
这些解释能不能被验证。
能不能被复用。
能不能帮助下一次做出更可靠的决策和行动。
这也是我在这个系列里一直讨论“因果 AI”的原因。
它不是替代指标、日志和 Trace,也不是简单做 RCA。
而是在运行现场里,把证据、行为和影响串起来,形成可信解释。
行业为什么都在往这个方向走?
如果只从国内企业自己的感受看,这个变化已经很明显。
很多团队不是没有日志。
不是没有 Trace。
不是没有告警。
而是事故发生以后,仍然要靠一群专家在群里不断追问:
这个告警是不是原因?
这次变更有没有关系?
这个接口慢,是根因还是结果?
这个 Agent 调用工具之前,到底看到了什么?
这个动作为什么没有被审批拦住?
从 2026 年的行业动作看,国内外厂商也在验证这个方向。
Datadog 在强化 RCA。
Dynatrace 长期强调自动化分析和因果关系。
ServiceNow 把事件、流程和知识库连接到一起。
Resolve、Traversal 这类新公司则更直接,把生产事故调查做成 AI 参与的过程。
国内也在出现类似趋势。
听云、AgentLoop、观测云、博睿等厂商,也都在沿着这个方向推进。
有的从可观测性、AIOps 和根因定位继续往调查能力延伸。
有的开始把 AI 应用和 Agent 的 Session、Trace、工具调用、评估和风险事件纳入观测范围。
重点不在于哪家厂商更强。
重点在于,大家都在往同一个方向走。
真正值得关注的是:
大家都在意识到,单纯记录数据已经不够了。
企业需要把数据组织成解释问题的过程。
也就是说,可观测性的下一步,不只是定位得更快。
而是形成更可信的解释。

对中国企业来说,启发是什么?
我不认为中国企业今天应该马上照搬海外某个产品形态。
中国企业更现实的问题是:
-
你们已经接入了多少 AI?
-
这些 AI 有没有开始调用工具?
-
有没有开始进入流程?
-
有没有接触客户、交易、配置、审批和生产系统?
如果答案是肯定的,那么企业就不能只问:
-
有没有日志?
-
有没有 Trace?
-
有没有看板?
还要继续问:
-
出了问题以后,能不能还原现场?
-
能不能形成可信解释?
-
能不能知道影响范围为什么扩大?
-
能不能判断下一步该查哪里?
-
能不能知道哪一道边界没有生效?
对于中国企业来说,这件事的启发不是“买一个类似产品”。
而是重新审视自己的可观测性体系:
它到底只是记录系统状态。
还是已经具备调查问题的能力。
尤其当 AI 开始进入生产系统以后,
这个问题会变得越来越现实。
因为 AI 事故往往不是一个简单报错。
它可能是一次错误判断。
一次错误引用。
一次错误工具调用。
一次越过边界的动作。
一次没有被及时发现的业务后果。
这些东西都不能只靠“可见”和“定位”来解决。
最后
过去,可观测性的价值,是让企业发现异常、追踪链路、定位故障。
这件事仍然重要。
没有指标、日志和 Trace,企业连问题发生在哪里、影响了谁都很难说清。
但今天,仅仅可见、可定位已经不够了。
数据越多,越需要有人把它们组织成可验证的解释。
系统越复杂,越需要调查路径。
AI 越接近生产,越需要还原行为形成过程。
所以我认为:
未来可观测性的价值,不只是告诉企业哪里出了问题。
而是帮助企业回答:
为什么发生?
影响范围是怎么扩大的?
下一步该查哪里?
过去可观测性解决的是“可见”和“可定位”。
未来可观测性越来越多要解决的是“形成可信解释”。
而且不是随便给一个解释。
是给一个经得起核对、复盘和追问的可信解释。
过去可观测性很大程度上竞争的是谁能更完整地采集和关联数据。
未来可观测性竞争的,可能是谁能更快建立可信解释。
调查不是终点。
可信解释,才是企业真正需要建立的能力。
这可能是可观测性行业接下来最重要的一次变化。



