从ARC-AGI-3刷榜看Agent harness与RLM自我改进
最近社区里热度很高的一个话题是某个开源 Agent 框架在 ARC-AGI-3 上刷出高分随之而来的 RLM「自我改进」机制和 harness 设计也引发了大量讨论。有人觉得这是通用智能的转折点也有人认为这不过是「用 harness 在基准测试上做工程优化」不能说明模型真的变聪明了。其实两边都有道理关键是我们得先把 ARC-AGI-3 到底考什么、harness 在 Agent 工程里承担什么角色、RLM 的自我改进是怎么工作的讲清楚再回头评价这个分数有多大的参考价值。本文不打算替任何一方站队而是从工程视角把整件事拆开。你会看到 ARC-AGI 系列基准的演变逻辑、harness 在 Agent 开发和 agent 框架中的核心地位、RLM 自我改进循环的基本原理以及这套东西为什么在评测公平性上存在争议。最后我会给一个可以直接跑起来的 Python 最小 harness 示例包含程序合成、验证器、搜索循环和「自我改进记忆」让你把概念真正落到代码上。1. ARC-AGI-3 刷榜事件背后的三个关键词1.1 从 ARC-AGI 到 ARC-AGI-3ARC-AGIAbstraction and Reasoning Corpus是 François Chollet 提出的一组抽象推理基准它的测试形式很特别每个任务会给你几个「输入网格到输出网格」的示例要求你推断出背后的变换规则然后把它套到新的测试网格上。网格通常非常小里面只有不同颜色的色块但规则可能是旋转、翻转、填充、对称、计数等等几乎没有语言先验可以依赖所以它被设计成用来衡量「流体智能」而不是「知识记忆能力」。ARC-AGI-1 时代很多大模型在随机猜测线附近挣扎直到有人发现「让模型生成大量候选变换程序再用程序合成 验证器搜索」的方式可以把分数拉到很高。ARC-AGI-2 在 2025 年前后发布时官方明显针对这种暴力搜索做了加固任务更难枚举、更难猜很多旗舰模型直接回到个位数甚至接近随机水平。再到 ARC-AGI-3延续了二代的设计思路进一步压缩随机猜测的得分空间并且加入了更多需要组合推理、多重变换和抽象归纳的任务。需要说明的是ARC-AGI-3 的具体评测规程和防作弊规则请以 ARC Prize 官网最新发布为准网上流传的很多分数截图并不包含完整的算力预算和提交说明。1.2 模型、Agent、harness先分清楚三个概念很多刚接触 Agent 开发的同学会把「模型」「Agent」「harness」混为一谈这是理解后续所有