大家好,我是金全,听云 CEO。

过去一个季度,我密集走访了金融、运营商的一线技术负责人,发现一个非常一致的趋势:大家都在把 AI,真正用到生产系统里。

但问题,也从这一刻开始出现。

现象与困境:

AI 落地生产,但我们却“无从下手”

 

当 AI 出错时,我们并不知道为什么。

不是不能修,而是——不知道该从哪里下手

很多人第一反应是:大模型有“幻觉”。但如果你真的在生产环境里用过AI,你会发现——这解释不了问题。

AI不可控,本质上不是模型问题,而是系统问题。更准确地说:

问题在于整个 AI 运行系统。

认知刷新:

从“执行逻辑”到“生成结果”

这里的“系统”,不是我们过去理解的应用系统。

传统软件里:

  • 代码按既定逻辑执行

  • 调用路径是确定的

  • 输入 → 输出是可预测的

  • 出了问题,可以复现、可以定位、可以修复。

但在 AI 应用里,情况完全不同。一个看似简单的“模型调用”,背后其实是一整套运行体系:

  • Prompt

  • 多轮上下文

  • RAG(检索增强)

  • 外部 API / 工具调用

  • Agent 决策流程

  • 状态与编排逻辑

  • Skills(能力/技能组合)

 

模型,只是其中一个环节。真正运行的,是一个由多组件组成的复杂系统。

 

当系统变成这样之后,问题的性质就变了:AI 系统不再是“执行逻辑”,而是“生成结果”。

这带来三个直接后果:

  • 同一个输入,结果可能不同

  • 问题很难复现

  • 错误很难归因

范式转移:

从运维“代码系统”,到运维“行为系统”

换句话说:我们过去在运维“代码系统”,现在在运维“行为系统”。

甚至可以说:过去系统在执行逻辑,现在系统在“做决策”。

这其实不是第一次发生这样的转变。

在没有可观测性之前:

  • 系统慢了,不知道原因

  • 出错了,找不到位置

  • 故障了,只能靠人排查

后来我们有了“可观测性”,系统才逐渐变得:可理解、可定位、可控制

但在 AI 系统里,“看见”已经不够了。日志、指标、链路解决的是“发生了什么”,但 AI 真正的问题是:“为什么会这样?”

破局之道:

在不确定中建立确定性

所以,当前面临的本质问题,不是“AI 能不能用”,而是:

AI 是否可理解?是否可解释?是否可控制?

 

这也是我现在密切关注的方向:因果 AI(Causal AI)

它的核心不是让模型变得更强,而是让系统具备一种能力:从结果,推回原因

我用一个很简单的框架来理解这件事:Observe · Infer · Decide

Observe(观察):发生了什么

Infer(推断):为什么发生(因果)

Decide(决策):应该怎么做

 

如果说过去的软件系统需要的是可观测性,那么 AI 系统真正需要的是:

在不确定中建立确定性。

我把这个方向叫做:因果 AI(Causal AI)

这也是我写「因果AI」这个公众号的初衷。

未来,我将在这里持续分享关于 AI 系统、可观测性与因果 AI 的思考与实践。

#AI系统 #AI可观测性 #因果AI

推荐阅读

  • 在当今数字化时代,基础设施监控已经成为企业成功的关键因素之一。无论是数据中心、网络设备还是工业自动化系统,有效的监控可以提高可靠性、安全性和效率。

    2023-11-08

  • 随着网络和应用程序在生活和工作中变得越来越重要,很多人企事业单位对网络和应用程序的依赖性越来越高。只有确保网络运行良好、应用程序性能优越,才能提供更好的使用体验。在这种情况下,网络与应用性能监控​成为了不可或缺的工具。那么,该平台有什么功能?

    2023-11-15

  • 压测也叫压力测试或性能测试,是软件开发周期中常见的环节。往往很多时候我们的压测方案都是有问题的,本文将具体阐述怎么做压测,以及如何正确的做压测。

    2022-03-08