向度之桥
26-06-24 17:02 微博认证:科技博主

前几天看到一个演讲,一家零售银行做AI客服,花了6个月、烧了75万人民币,最后没上线。

这种事我见过不少,但这个案例让我印象特别深,因为后来他们重做只花了8周就上线了。

同一个项目,前后差距这么大,问题出在哪?

演讲里有一句话,我觉得说透了大多数企业AI项目为什么会失败。

"顺序反了"

大多数企业做AI,第一件事去找工具、选模型——到底用GPT还是DeepSeek,哪个更准哪个更便宜。

这家银行就是这么做的。他们花了6个月在这个问题上。然后没有上线。

1️⃣ 75万花在哪了?

一位数据AI平台公司Databricks的技术主管复盘了这件事。

他说,钱主要花在了两件事上:

第一,选模型。团队花了大量时间争论到底该用GPT还是Claude,哪个更准、哪个更便宜。

第二,做演示。为了让领导层看到效果,他们不断打磨Demo,Demo跑得很顺滑。

但没有人想清楚:系统上线后,怎么知道它跑得好不好?出了问题,谁负责?数据从哪来,谁管?

演示环境下一切正常。生产环境里,没有人知道它为什么失败。

Demo成功这件事,有时候是一种麻醉剂。

它让你觉得项目在推进,但其实你只是在推进演示。

2️⃣ 失败的真正原因:3个缺口

缺口一:没有评估体系。
没有定义"成功"是什么。准确率要达到多少才算好?延迟超过多少用户会不满意?没有数字,就没有基准,也没有办法知道系统在变好还是在变坏。

缺口二:没有可观测性。
系统上线后,AI做了什么决策,走了哪条路径,完全不可见。出了问题,只能猜。
金融行业还有个额外的问题:监管机构要求能解释每一个AI决策是怎么来的。

没有追踪,就没有可解释性,也就不合规。

缺口三:没有治理机制。
当系统凌晨3点出错,没有人知道该叫谁,没有版本管理,没有回滚机制。
数据是谁的,谁来更新,谁来负责,都是空白。

这三个缺口,和用哪个模型完全无关。

这说明失败从第一天就注定了,不是在生产环境里出了问题,是在项目启动的时候就埋好了失败的条件。

3️⃣ Databricks重做了一遍

关键改变只有一个:把选模型这件事推到了第7周。

第一次看到这个时间线,我觉得很反常识。但越想越觉得合理——在你不知道用什么标准评判的时候,选哪个模型有什么意义?

前6周做什么?
第1-6周:建评估体系。
他们收集了200个真实的人工客服对话,作为"黄金数据集"——这是评判AI好坏的基准。

然后定义了两个核心指标:
• 拦截率:60%(拦截掉60%的简单查询)
• 准确率:85%(给出正确答案的比例)

再把这两个指标做成自动化测试流水线。

每次修改任何东西,自动跑一遍评估,看分数有没有变化。

第7周:基于评估数据选模型。
此时他们已经知道用什么标准来评判了。
把几个候选模型在"黄金数据集"上跑一遍,谁准确率高、谁延迟低、谁成本合理,一目了然。

选模型不再是争论,是对比数据。

4️⃣ 上线之后:真实事故是怎么处理的
比如银行调整利率政策并通知了客户。客户打进来问新政策,AI给了错误答案,客户满意度立刻下滑。

以前这种事会怎样:没有监控,投诉积累到一定程度才发现,找不到根因,只能关掉系统重做。

现在是怎么处理的:
检测——监控系统立刻捕捉到满意度下降的信号。
诊断——通过追踪日志发现:AI在调取的知识库里,还是旧的利率政策文档,新文档没有同步进去。
修复——更新知识库,自动评估跑一遍验证准确率恢复,重新上线。

全程可见,全程可追溯,全程有责任人。

回过头看,之前失败的那6个月,败在哪里?
不是模型选错了。
是顺序反了。
先定义成功是什么,再去找工具实现它。
但现在大多数企业AI项目,都是反着来的。

发布于 上海