明明大模型越来越聪明,为什么生产环境里的 Agent 还是极难落地?
这两年 AI 行业里 Agent 智能体概念非常火。如果只是在 Demo 阶段看着 Agent 自动写个爬虫、自动发个邮件会觉得这技术简直是科幻。但但凡你试过把它往生产环境推去解决复杂的真实业务你就会发现现在阻碍 Agent 落地最大的瓶颈根本不是大模型聪不聪明而是极低的容错率和几乎为零的工程掌控感。做 AI 应用这两年我手头上几乎 90% 以上的 Agent 项目最后都被砍掉了。做到最后大家心里都只有一个感觉这玩意谁敢往生产环境里用很多不可控的因素让你上线后心里非常没底。概率错误叠加传统的后端程序是确定性的。第一步成功了必定能稳稳地走到第二步代码怎么写就怎么跑。但 Agent 本质上是一个概率状态机它每一步决策、选工具、解析返回结果都是概率性的。假设你的大模型非常优秀每一步决策和执行的正确率高达 95%。当一个任务需要 Agent 连续自主执行 10 个步骤时整个流程完全正确的概率是多少计算一下0.95^10 ≈ 60%。如果需要 20 个步骤成功率就直接跌到 35% 左右了。实际业务里任何一个步骤一旦出错比如工具返回了一个非预期的格式或者模型产生了一丁点理解偏差整个 Agent 要么开始胡说八道要么陷入“报错-重试-再报错”的死循环直到把你卡里的 Token 额度全部扣光。这种概率叠加导致的不可控是阻碍它进入核心业务的核心痛点。评估太难了做普通的后端开发我们起码可以写单元测试、集成测试通过跑 CI/CD 来验证代码逻辑。但 Agent 怎么做回归测试你今天微调了某一个步骤的 Prompt或者把底层的大模型升级了你怎么知道这个改动不会导致 Agent 在另外 5% 的边缘场景里行为失控你没法像传统软件那样写断言 Assert因为它的输出和决策路径是非确定性的。你也不可能在每次提交代码时都让 Agent 去跑 1000 次真实的浏览器自动化或者调 1000 次第三方 API。因为那太慢、太贵而且频繁触发外部接口限流。因为无法建立标准化、低成本的自动化测试反馈环研发人员在修改 Agent 逻辑时就像是在拆炸弹每次上线都提心吊胆根本不敢大范围推广。长路径任务的问题现在的推理模型在解决 2-3 步的短路径任务时非常厉害。但只要任务路径变长比如去跑一个持续数小时的复杂软件重构Agent 就会表现出两个极端的问题注意力漂移执行到第 15 步时它可能已经完全忘记了第 1 步用户要它干嘛了。即使它的上下文窗口足够大模型也会在长执行历史中迷失被一些中间步骤的噪音带偏。过度执念它在第 8 步遇到了一个极其微不足道的环境配置报错比如某个不影响全局的本地依赖版本冲突。如果是正常人绕过这个报错或者换个方式实现就行。但 Agent 会开始疯狂地尝试各种方式去修复这个依赖花掉十几美元的 Token最后把整个系统配置搞崩完全没有这种绕道走的人智慧。脆弱的现实交互Agent 如果只在本地沙盒里玩玩都挺完美。一旦它上线跟真实互联网交互环境就变得极其不稳定。API 会超时、网页前端会经常改版导致爬虫失效、目标系统会频繁弹出防爬验证码、网络延迟会偶尔抖动。Agent 的观察和执行模块非常脆弱一次网络超时或者一个格式不对的 API 返回就可能让大模型的推理链断了导致后续的流程完全执行不到。怎么控制这些不确定性大模型是概率的而商业应用是绝对严谨的。现在行业里把 Agent 往生产环境推基本不再采用让模型完全自主规划的方案而是用严格的工程手段来做控制用确定的工作流代替完全自主规划不要放任 Agent 自己决定每一步怎么走。目前的实际做法是在代码里把业务流程定死比如用有向无环图或状态机把步骤固定下来。模型只在某些特定的节点上做局部决策或者信息提取把它的行为轨迹严格限制在工程框架内。强 Schema 校验与数据容错大模型输出的数据绝不能直接传给下游系统。必须在接收端使用工具如 Pydantic 进行格式校验。如果校验失败通过代码进行自动格式修复修复失败再走轻量级的模型重试在工程边界上把脏数据过滤掉。Mock 评估与测试集不能拿真实接口去跑测试。开发时需要积累一批典型的历史业务数据作为测试集。在测试阶段把外部 API 调用全部 Mock 掉让 Agent 在沙盒里跑。跑完之后用一个轻量模型去对运行轨迹和结果进行打分评估检查是否符合预期。人工协同在关键写入操作如扣款、改配置等或者模型判断置信度极低、工具重试多次失败时流程必须停下来触发人工审批确认没问题后再放行。说在最后现在很多人觉得大模型单体能力增速放缓了所以 Agent 是唯一的出路。但作为开发者我们必须清醒地认识到怎么用确定性的手段去控制大模型的不确定性目前的开发难度远远超出了调用大模型本身。这才是限制 Agent 走出 Demo 阶段、真正进入千行百业的最大瓶颈。