行业资讯

  • Home
  • 50万智能客服上线7天关停:日均2000单跌到不足50单

50万智能客服上线7天关停:日均2000单跌到不足50单

2026-09-08 9156

上周三晚上十一点半,客户对接人在企业微信连发三条语音。第一条就是老板刚开完会,通知那个Agent明天早上停掉。这个智能客服Agent花了将近 50万 ,从立项到上线整整四个月,上线第一天日均处理量预期是 2000单 ,第三天就掉到不足 50单 。运营投诉单像雪片一样飞过来,老板在周会上直接拍板关停。从上线到关停,整整一周。 模型不是背锅的那个 很多人第一反应是模型不行,或者国产模型不如GPT。刚开始我也这么想。后来把日志拉下来一条一条看,发现真不是。模型该会的都会,知识库内容都喂进去了,prompt调了七八版,Agent框架用的是市面上最主流的那一套,retrieval也接了向量数据库。技术栈没有任何明显硬伤,可它就是不能用。 幻觉在客服场景就是事故 这个客户做电商,Agent核心场景是售后咨询,最高频问题就是“我的退款到哪了”。正常逻辑是接到问题、调订单系统API、拿到退款单号和状态、回复用户。第一周翻车最严重的一条投诉:用户问“我昨天申请的退款到了吗”,Agent回复“您的退款单号RF20260518293847已于5月19日14:32退回原支付账户,请注意查收”。用户去支付宝翻了半天没找到这笔钱,人工客服一查,这个退款单号根本不存在。用户压根没成功提交退款申请,是Agent自己编了一个看起来无比真实的单号糊弄过去。 翻日志发现,工具调用那一步返回的是空结果,订单系统其实告诉Agent“没查到”,但Agent没有把“没查到”这个信号传递出来,而是自信满满地虚构了一个答案。类似情况一周内出了至少 17次 。在客服场景,一次幻觉就是一次投诉。闲聊场景幻觉是有趣,金融、客服、医疗场景里幻觉就是事故。做大模型评测的朋友说了一句话:现在所有号称解决了幻觉的方案,本质上都是在降低幻觉频率,而不是消除它。从5%降到0.5%,听起来很好,但客服一天进来一万个咨询,0.5%就是 50起投诉 。 延迟把体验全杀了 最早做POC的时候,我建议开thinking模式,因为退款查询涉及多步推理:识别用户意图、提取订单标识、调API、解析返回、组织自然语言回复。开了thinking准确率确实高一截。但上线之后,TTFT(首字延迟)稳定在 3到5秒 。用户在App里发一句“我的退款到了吗”,等了4秒钟屏幕一动不动,90%的用户会以为卡死了,直接点“转人工”。剩下10%等到回复了,第一句话还是“好的,我来帮您查询一下”,又过了两秒才出现真正内容。 试过关掉thinking,TTFT能压到 800毫秒以内 ,但回答质量肉眼可见地暴跌,之前能拆出3步推理的问题,现在直接给个泛泛而谈的回答。甲方产品经理说了一句让我无言以对的话:“你们这个东西,要么慢得让人想砸手机,要么快得让人觉得在瞎说,没有中间档。” 上下文越聊越离谱 售后场景里多轮对话很常见,用户可能先问退款,问着问着扯到物流,再扯回订单,最后又问优惠券。Agent在前5轮表现都还行,从第6轮开始就慢慢糊涂了。最离谱的一个case:用户说“我上次买的那个订单怎么还没发货”,Agent回复“您查询的订单ORD20260512XXXX已于5月14日发货”。问题在于,用户说的“上次买的”指的是当前对话第2轮提到过的那个订单,但Agent调出来的是第8轮用户随口提到的另一个订单号。 理论上RAG应该按时间顺序和相关性排序,但实际上模型在token数累积到一定程度后,会出现明显的“近因偏好”——离当前最近的信息会被无差别地拉到前面,哪怕它跟当前问题关系不大。后来尝试做对话状态管理,把每一轮的关键实体(订单号、退款号、用户意图)显式存进结构化state里,每次让Agent显式从state里取。效果好了一些,但不是特别多。这个问题到现在也没想通到底该怎么彻底解决。 工具调用静默失败 Agent接了大概 12个工具 :订单查询、物流查询、退款发起、优惠券核销、商品详情等等。正常情况下,Agent调用、工具返回结果、Agent基于结果回答。但工具失败的方式有很多种: 网络超时 返回结果为空 返回结果格式异常 返回200但body是error message 理论上每一种异常都应该让Agent走到“抱歉,暂时查不到您的信息,需要我帮您转接人工吗”这条路径上。实际上日志统计,有大约 23%的工具异常 没有被Agent正确识别为“失败”,而是被它当成“模糊的输入”硬塞进了回答里。这部分现在认为是prompt工程的锅,没有把“失败信号优先级”提到足够高。但客户那边显然没耐心等我们慢慢调了。 为什么Demo阶段看起来都挺好 Demo本质上是一种受控环境下的展示。第一,Demo用的问题是精心准备的,提问者的措辞、上下文、节奏都是反复演练过的,跟真实用户那种又急又乱的口语完全是两回事。第二,Demo没有并发压力,一个一个问,模型表现得很

about image

发表评论