上海 AI Lab 提出 Self-Harness:不换模型,让 Agent 外层运行装置自己进化
在 Agent 系统里,模型外面的那层「Harness」——系统提示词、工具使用规则、验证器与运行时控制策略——长期靠工程师手调。上海人工智能实验室团队近期提出的 Self-Harness 把这件事交给了模型自己:先检查自己的运行轨迹,从失败样本中挖出可复用的失败机制(如缺少最终产物、重复无效命令、工具报错后不恢复),再由同一个模型切换成 proposer 提出有边界的 Harness 修改,最后交给回归测试决定是否采纳。这套思路已被 LangChain 联合创始人 Harrison Chase 转发,并被 Lilian Weng 收进自进化 Agent 相关博客。
接受规则相当保守:候选修改必须在 held-in 或 held-out 至少一个 split 上提升、另一个不退化,才能进入下一代 Harness——每一次改动都放进可记录、可复现、可回退的评测闭环,而不是让模型凭感觉拍板。这也是它和普通「自动改 prompt」工具的分界。
在 Terminal-Bench-2.0 上,固定模型、工具环境与评测协议、只改 Harness 的前提下,三个模型后端全部拿到 held-out 提升:Qwen3.5-35B-A3B 总提升 104%,MiniMax M2.5 与 GLM-5 分别提升 28% 和 24%。有意思的是,不同模型暴露的失败模式并不相同——Qwen3.5 容易陷入重复编辑循环,GLM-5 的弱点集中在 shell 会话状态——Self-Harness 会为每个模型生成并筛选适合它的改动,而非加一段通用提示。
论文(arXiv: 2606.09498)与代码(github.com/qzzqzzb/Self-Harness)已公开。需要指出的是,目前结果主要来自 Terminal-Bench-2.0 和固定模型后端,团队也明确表示这并未证明「Agent 可以完全自己进化」;但作为自进化 Agent 的一个组件,它把「改什么、怎么改、怎么验、什么时候拒绝」的边界划得比较清楚。对站内读者来说,这也是 Qwen3.5 系开源模型在 Agent 工程研究中被用作主力后端的又一例证。
