AI 渗透测试无法回避的现实:所有结果仍需人工核验
验证债务AI 发现速度与人工验证能力脱节AI 渗透测试面临一个“魔法师的学徒”难题。你对一把扫帚施咒让它打水它就会不知疲倦地一直打水哪怕工坊早已被水淹没。行业正在忙着衡量 AI 发现漏洞的速度说的就是你Anthropic。但很少有人会去核算这些工作由谁来检查成本几何这个缺口有一个名字validation debt验证债务——当发现速度扩大、而验证能力没有跟上时不断堆积的未经验证的发现。最近的一项调查询问了 158 名安全从业者他们的团队能否对单次渗透测试中 AI 生成的 500 多个漏洞候选进行分诊。只有 20.3% 的人表示已经具备相应工作流程。38.6% 的人认为这个量级会让团队不堪重负29.7% 的人表示完全无法处理。这意味着大多数团队购买的是自己无法处理的“发现能力”。只有团队能够分辨出哪些漏洞真实存在、哪些重要、以及如何处理时发现更多漏洞才有意义。当 AI 的发现超出团队处理能力时会发生什么安全团队多年来一直力图更频繁地测试更多应用。AI 终于让这成为可能。问题是发现速度的增长远快于后续工作的跟进。仍然需要有人复现发现确认漏洞是否可利用并向工程团队提供足够的证据来采取行动。在数量较低时这行之有效。但当发现成百上千条时团队就会不堪重负甚至束手无策。一位受访者花了两天时间验证 AI 工具生成的 300 条发现其中 250 条属于重复、不可利用的问题或引用了不存在的漏洞。花两天时间做人工验证并不是团队购买该工具所期望的效率提升。AI 是在节省时间还是把工作转嫁到别处对某些团队来说或许如此。但大量的人工工作只是把问题向后推。81.7% 使用 AI 工具的从业者表示“至少在某些时候”AI 生成的发现需要大量的人工验证。如果自动化将漏洞发现时间缩短了 10 小时却增加了 15 小时的验证和分诊时间投资回报率ROI在哪里你得到的只是验证债务。发现能力相对容易扩展。AI 可以在人类测试人员所需时间的一小部分内探测潜在弱点并生成候选发现。但每增加一条发现团队就多一项需要检查的工作。验证并没有以同样的速度扩展因为一条看似合理的发现仍然需要证据支持。某些漏洞最终会被证实不可利用另一些则会重复指向同一根本问题。如果受影响的资产并不危及业务单一的严重性评级也说明不了什么问题。那么一条糟糕的发现究竟要花多少成本每一条低置信度的发现都需要花时间丢弃。误报通常被当作准确性问题来讨论。但对于做投资决策的安全负责人来说它们消耗的时间同样重要。按每条 5 分钟计算验证 1000 条发现需要 80 多个小时。而且 5 分钟已经是乐观估计——取决于分析人员是需要复现问题、理解上下文、确认是否可利用还是以上全部。当 AI 的输出看起来非常权威时情况会更糟。AI 生成的发现看起来令人信服因为它们带有精心编写的描述、严重性评级、攻击叙事和修复建议。但这些都不是证据。在让开发人员修复之前仍然需要有人确认发现真实存在。工具的价格一目了然但检查工具产出所花费的时间却不那么明显。为什么有些团队能更好地应对 AI 洪流测试成熟度会产生差异。在每月测试少于 5 次的团队中只有 4% 表示已经建立了处理 AI 生成的大量发现的正式工作流程55% 表示这样的量级将无法管理。测试更频繁的团队能更好地应对大规模发现。他们拥有更好的流程也更不容易被发现淹没。测试频率最高时样本量会变小因此应将其视为一种趋势尽管这个趋势很能说明问题。测试足够频繁你就必须善于分诊——必须有人负责这件事。发现必须达到标准垃圾信息必须排除在队列之外。不频繁的测试可能掩盖薄弱的流程而 AI 生成的大量发现会很快让这些弱点暴露出来。你的团队能处理 AI 工具产出的结果吗首先要考虑团队处理产出的能力。评估 AI 渗透测试工具的安全负责人需要知道当前测试会产生多少工作量以及当工作量突然暴增时会发生什么。几个问题有助于找出差距你的团队每周实际能验证多少条发现在工程团队接受一条发现之前需要附带哪些证据分析人员有多少时间花在了验证毫无结果的发现上如果测试产出增加五倍而修复能力没有增加会发生什么在宣布任何效率收益或鹦鹉学舌地复述你偏爱的供应商的说辞之前应先把这些成本纳入商业论证。如果团队无法处理生成 10 倍的发现并不会让安全能力提升 10 倍只会产生一个更大的队列。你需要更多人还是更好的流程两者都需要但比例并非相等。更好的流程可以帮助团队消化更多发现但不能让专家验证变成零成本。招聘更多分析人员不是唯一答案。减少可避免的工作是一个好的起点。明确“已验证”的标准。坚决去重避免同一个弱点因为技术原因不同而变成多个工单。基于风险进行优先级排序不要将所有技术上有效的漏洞都一视同仁。测试频率也很重要。定期测试的团队有更多机会改进发现从接受到验证、修复、再测试的流程。如果每条 AI 生成的发现仍需要大量专家调查更高的发现率必然意味着更多人力。这一成本属于自动化经济学的一部分。不要只盯着 AI 发现了多少漏洞我们总是以“能发现多少”来评判安全工具。AI 可以把数字推得很高但发现更多并不能说明安全团队是否完成了更多工作。更好的衡量标准是这些发现最终如何被处理。有多少被快速验证有多少促成了修复为此投入了多少人力这些问题的答案才能告诉安全负责人 AI 是否真正帮助他们提升了效率。AI 渗透测试的成本不止于许可证费用还包括验证 AI 所发现漏洞所需的人员和流程。如果忽视这些成本自动化带来的工作量将比它减少的更多。

相关新闻

最新新闻

日新闻

周新闻

月新闻