独立产品实验结果的边界与解读
独立产品实验结果的边界与解读新 Agent 工作流上线后出现异常并不意味着只要改一段提示词就能解决。工具参数不符合契约、外部服务返回异常、重试策略失控、任务状态无法恢复都可能让一次实验变成重复调用、成本增加或用户任务卡住。处理这类问题时先保存足够的脱敏证据再用明确的任务边界和失败路径收紧系统。记录可行动的运行证据每个任务应有运行标识记录工作流与工具版本、步骤序号、耗时、返回类别和最终状态。日志不需要保存完整对话、授权头或用户资料可保留长度、摘要、受控引用和错误码以便在权限范围内重放。对外部网页、文件或 API 的结果记录来源、时间、响应状态和解析版本避免下次排查时无法判断内容是否已经变化。出现重复调用时先确认是模型再次提出同一请求、执行器重试、消息重投还是客户端重复提交。不同原因需要不同修复。把错误原文直接塞回模型上下文往往会消耗更多 token 却没有增加解决信息更好的方式是转换成结构化、可行动的状态例如“参数不合法停止调用并要求补充字段”或“外部服务暂不可用可稍后重试”。任务标识 → 步骤与工具结果 → 契约校验 → 有界重试或停止 → 脱敏证据与恢复状态这个流程强调停止也是有效结果。系统无法安全继续时应向用户说明任务未完成、已完成的部分和下一步选择而不是让模型不断尝试相同动作。对于有副作用的工具停止条件尤为重要避免一次失败变成重复写入或重复通知。工具调用需要多重边界工具名称、参数 schema、权限范围、调用总数、总耗时和预算都应在执行器中检查。每个任务的步数上限应按任务性质设定而不是盲目使用同一个数值复杂任务可以拆为可恢复阶段简单任务则应尽早返回。重试要区分可重试的暂时故障与不可重试的参数、权限或语义错误并使用退避和总预算。写入型工具需要幂等键、目标范围确认和审计记录。即使模型生成的 JSON 可以解析也不能直接执行服务端应验证字段、访问权和业务规则。外部调用超时后查询其最终状态再决定是否重试避免网络中断时重复创建记录。快照服务于复现不是无边界留存失败材料可帮助建立回归测试但生产中直接将完整 context、prompt 和工具返回写入目录容易引入隐私、磁盘和权限风险。应最小化字段、加密或存入受控诊断系统、设置保留期限并限制谁能查看。保存失败本身也可能失败执行器应避免因记录错误再次阻塞主任务。将最小复现案例加入测试非法参数应停止、重复调用应被拦截、工具超时应产生可恢复状态、取消后不应遗留后台任务。无法稳定复现时记录触发假设和缺失条件继续在小范围内收集证据而不要提前给出唯一根因。让实验结论回到产品决定试点后查看任务完成、用户重试、人工介入、异常类别和实际成本。不要把调用量或模型输出长度当作成功。若某个工具链经常需要人工修复先缩小它的权限和适用场景补齐契约与错误处理再考虑扩展。对无法证明价值的实验停止比持续堆叠防线更合理。独立产品的优势是可以快速试验前提是每次试验有明确边界和退出方式。把不确定的模型行为放进可观察、可停止、可恢复的工程流程里失败也会留下下一次决策能用的材料。