英伟达(NVIDIA)刚刚证明了围绕AI模型打造的强大“缰绳”日益重要——其AVO编码代理挑战了ARC-AGI-3公开数据集,成功攻克了25个公开游戏中全部183个关卡,并且是在未接收任何预先指令或目标的情况下做到的。

英伟达(NVIDIA)的AVO本质上是对Anthropic旗下Claude Opus 5模型的封装,但在ARC-AGI-3公开集上,Opus 5的得分仅为30%,而AVO则拿下了无可挑剔的100%。
在深入探讨之前,先来聊聊什么是AI“缰绳”。在错综复杂的人工智能世界里,“缰绳”(harness)本质上是一个封装层——即围绕特定AI模型构建的外部软件层。你可以把模型想象成大脑,而“缰绳”则是身体、铠甲和工具,它将一个通用文本预测器转变为能够解决实际问题的执行者。一条有效的“缰绳”具备以下功能:
它将AI模型与外部世界连接起来:通用AI模型自身无法查看网页、运行Python脚本或操作文件,但“缰绳”可以。它让AI模型形成自我纠错的循环,通过反复试错来解决复杂问题。在这个过程中,“缰绳”将每次尝试的结果反馈给模型,使其能够不断迭代优化。它有助于管理长期记忆:随着上下文窗口(输入)的增长,AI模型往往会遗忘较早的细节信息。而“缰绳”如同一个记事本——保存有效的代码片段、过滤掉无用的报错,并保持清晰的模型进度日志,防止其丢失思路。它还能结构化提示和约束条件,强制模型遵循严格的思考规则。
相关阅读:英伟达欲将你家墙壁变为迷你数据中心——液冷壁挂式机箱内塞入16块Blackwell GPU和4颗服务器CPU,零预付成本。
这便引出了今天的核心话题。AVO编码代理本质上是围绕Anthropic的Claude Opus 5模型构建的“缰绳”。英伟达最初开发AVO是为了优化CUDA GPU内核,代理自主运行了7天,探索了500多种方向,最终产出的内核性能比FlashAttention-4提升了高达10.5%。
在不改动底层核心代理架构的情况下,英伟达随后将GPU工程工具替换为ARC-AGI-3任务接口。AVO成功地将自身的代码检查和自我纠错逻辑迁移至一个完全不相关的可视化交互逻辑谜题上,以100%的准确率解决了ARC-AGI-3公开数据集中的183个谜题,且无需任何预先指令或目标。考虑到Opus 5在相同任务上仅取得30%的成绩,AVO刚刚证明了高效“缰绳”能带来多么惊人的价值增量。
据英伟达介绍,AVO总共使用6,624次操作解完了这183个关卡。相比VISTA等其他主流代理封装(需7,542次操作方能通关公开集),其效率提升了12%。值得注意的是,ARC-AGI-3评测平台目前不允许自定义外部代理“缰绳”针对其隐藏私有集进行测试,这意味着我们无从得知AVO在更具参考价值的数据集上会有怎样的表现。



