Agent 越跑越偏?阿里这个开源 Harness 登顶了 HF 周榜
Agent 能连续工作越来越久,但「能跑很久」和「能把事情做完」从来不是一回事。
任务一拉长到几十、几百个操作,前面留下的一次错误判断、一次没验证的修改,都会滚雪球一样进入后面的上下文。历史越来越长,Agent 还得同时记住「做了什么」「哪些真的完成了」「下一步该做什么」——任务很容易越跑越偏。论文把这归纳为三个词:错误累积、上下文退化(Context Rot)、任务状态丢失。
8月3日,阿里巴巴 DreamX Team 开源了 LongHorizon-Harness,把长程任务里的执行、状态管理和结果验证彻底拆开。8月6日,项目登上 Hugging Face Daily Papers 周榜第 1 名;一周之内 GitHub 收获 600+ star,MIT 协议,完全免费。

它解决的不是「模型不够聪明」,而是「没人验收」
现在的 Agent Harness 大多已经能规划、拆解、调工具、派子智能体。真正麻烦的是:执行、状态维护和「我是不是做完了」全部挤在同一个不断膨胀的上下文里。Agent 做完一步,自己判断成功,判断错了,错误状态就被当成事实带进下一步——等于让 Agent 给自己判作业。
LongHorizon-Harness 的做法很直接:把任务状态(Task State)从执行过程里拿出来单独维护。核心是管理—执行—审计(MEA)循环:
- Manager 管状态:读取目标与已验证的状态,选出下一项待解决问题,生成带验收条件和约束的子任务契约
- Executor 只负责干活:每一轮都在全新上下文里执行,此前的点击、命令、推理过程不会一直塞进后续窗口
- Auditor 只读验收:重新检查真实环境——文件、界面、日志、进程、测试结果——只有它确认的事实才能写回状态
最关键的一条:Executor 说「完成了」并不能修改状态,只有经过独立检查的结果才算数。
这套机制最直观的变化,就是把「我觉得做好了」变成「环境证明真的做好了」。论文里有个典型例子:Claude Code 基线直接改文档 XML,标题看着对了,却没按 LibreOffice 工作流应用样式,得分 0.00;套上 LongHorizon-Harness 后,Auditor 解析文档 XML 确认 15 个标题的底层样式,得分 0.89。

不换模型,WeaveBench 从 51.8% 干到 80.7%
最醒目的结果是:模型和执行后端都不变,外面套一层 Harness:
| 基准 | 基线 | + LongHorizon-Harness |
|---|---|---|
| WeaveBench PassRate | 51.8% | **80.7%**(+28.9pp) |
| OSWorld 2.0 完整完成率 | 2.8% | 8.3%(3倍) |
| Terminal-Bench 2.1 | 69.7% | **77.2%**(还少用 24% token) |

拆开看更有意思:WeaveBench 里设计类任务 PassRate 提高 60 个百分点,空间/3D 类提高 50 个百分点——都是「需要持续保存、检查、修改多个相互依赖状态」的任务。Claude Opus 4.7 套上后同样受益(OSWorld 2.0 子集 20.0% → 34.3%)。论文里还有个金句级结论:模型决定单轮能做到什么,Harness 决定这些结果能不能被验证、留下来——Qwen 3.7-Plus 套 Harness 后的平均分 0.733,反超了裸跑的 Claude Opus 4.7(0.680)。
成本上也不是固定加税:WeaveBench 总 token 约 2.3 倍、OSWorld 输出 token 约 3.6 倍,但 Terminal-Bench 2.1 反而少用 24% token 且成功率更高——多花的推理开销,取决于模型需要多少轮执行与恢复。
一条命令,给自己的 Agent 套上「验收官」
官方把它定义为长程任务的执行、状态管理与结果验证系统——不训练新模型,也不替换 Claude Code / Codex,而是运行在这些 Agent 外层。安装已经压缩到一条命令:
uv tool install lh-harness
# 或 pip install lh-harness
用法三步走:
cd /path/to/your/project
lh-harness init # 生成 .lh-harness/config.toml
lh-harness run --task "你的目标" --agent codex # 开跑
- Manager / Executor / Auditor 可以分别配置不同的模型或后端,Claude、GPT、Qwen 都行
- 支持 Claude Code、Codex CLI,也能写自定义 AgentAdapter 保留原 Agent 的执行循环
- Python 3.10+;官方实测 macOS 已完整测试,Windows 支持已包含但尚未充分测试,
lh-harness doctor随时体检
官方的口号是:**Give Claude Code or Codex a goal once. Keep it working for dozens of hours.**(给一次目标,让它在桌面应用和终端里连续工作几十个小时。)
当任务越来越长,「跑得久」和「跑得准」缺一不可。模型负责每一轮能做到什么,Harness 负责这些结果能不能被验证、留下来,成为下一步可信的起点。趁项目还新,去 GitHub 搜 AMAP-ML/LongHorizon-Harness,给自家 Agent 配个验收官。
暂无评论。