AI Agent 进入 Harness 工程时代:从模型竞赛到基础设施重构
2026 年,AI Agent 领域正经历从模型能力竞赛到基础设施工程化的范式迁移。多家机构的研究与实践表明,Agent 性能的关键瓶颈已从模型本身转向包裹模型的外层系统——Harness(约束工程/控制壳)。
Harness 工程:Agent 性能的新杠杆
上海人工智能实验室提出的 Self-Harness 框架,让模型基于自身执行轨迹自动挖掘失败模式、提出 Harness 修改方案,并通过回归测试验证采纳。在 Terminal-Bench-2.0 上,仅修改 Harness 而不更换模型,Qwen3.5-35B-A3B 总提升达 104%,MiniMax M2.5 和 GLM-5 分别提升 28% 和 24%。该工作被 LangChain CEO 转发、前 OpenAI 副总裁 Lilian Weng 收录。
另一项来自 Impossible Research、UC Berkeley 和 CMU 的 [schema] 框架,在 ARC-AGI-3 Public 集上,与 Claude Opus 4.8 组合达到 98.98% 的 RHAE,与 GPT-5.6 Sol 组合达 95.35%。其核心是将世界模型写成可运行、可验证的程序,让 LLM 像物理学家一样通过假设-实验循环推理。ARC Prize 总裁 Greg Kamradt 肯定了思路,但也指出部分分数依赖固定兜底规则,且官方尚未独立复核。
语义层与数据底座:Agent 落地的关键支撑
Data for AI 社区北京站活动指出,没有语义层,Data Agent 准确率卡在 70%;做好语义层才能逼近 95% 的生产上线线。Datastrato 创始人堵俊平提出数据架构正从 engine centric 走向 metadata centric,元数据系统正从被动查询的 book 变为主动的 control plane。
Apache Ossie(原 Open Semantic Interchange)于 7 月 8 日进入 Apache Incubator,旨在标准化语义元数据交换格式,为 AI Agent 提供统一的业务语言。其 ai_context 字段可为 Agent 补充指令、同义词和示例,帮助自然语言与数据库命名映射。
算力与架构创新:支撑 Agent 规模化
商汤在 WAIC 发布异构混合推理方案,将推理拆分为 Prefill(读题)和 Decode(答题),让国产卡做 Prefill、高端卡做 Decode,实现国产芯片参与的混推集群可盈利。其 Token 产量年初日均 4000 亿,7 月底预计日均 2.42 万亿,年底目标 10 万亿。同时发布 SenseNova U1 Pro,定位为面向长程任务的交付级原生多模态 Agent 基座,首站瞄准设计行业,交付率超 60%。
腾讯云大数据 AI DLC 推出国内首个生产级 Spark+Ray 全托管平台,让数据湖同时长出两套引擎,Agent 预处理、微调、推理全在一个平台上闭环。
技能与记忆:Agent 能力的新维度
SkillsBench 基准数据集(84 项任务,11 领域)量化评估技能(SKILL.md)的真实效能:人工精编技能平均提升任务通过率 16.2 个百分点,而 AI 自生成技能无正向收益。精简、单一职责的技能增益最高,多技能堆叠易造成上下文噪音。
记忆系统方面,MemCon 框架将记忆管理建模为控制问题,用 UCB bandit 自适应选择检索策略,在六项任务上提升成功率最多 15.2 个百分点。A-TMA 框架则揭示了幽灵记忆问题——过时事实与当前事实共存导致时间混淆。
商业落地:从工具到数字员工
面壁智能等机构开源 StaffDeck 数字员工平台,将 AI Agent 视为有工号、岗位、SOP 和绩效数据的正式员工,通过状态机驱动的流程型技能、OKF 结构化知识库和反馈迭代闭环,解决 Agent 在真实业务中的流程混乱、回答无依据等问题。
钛动科技发布 Navos 2.0,将多智能体产品升级为智能体工作流架构,覆盖选品、创意、达人建联等全链路,一个人加 AI 即可完成传统团队工作。Nile 则瞄准 Agent 电商基建,帮商家搭建 AI 原生商品系统,转化率达商家站内 150%-300%。
递归自我改进:Harness 的自进化
Lilian Weng 在最新综述中系统阐述了 Harness Engineering 驱动递归自我改进(RSI)的路径:通过自动化工作流、文件系统持久化记忆、子智能体并行等范式,让模型自主优化外层约束系统。当前已在代码、科研类基准上验证有效性,但仍面临评估量化困难、长期记忆不足、奖励作弊等七大瓶颈。
相关资讯
7月9日 · 综合整理
7月7日 · 综合整理
7月10日 · 综合整理
6月26日 · 综合整理
7月8日 · 综合整理
7月13日 · 综合整理
延伸阅读 · 相关教程
掌握四种循环模式,设计可验证的自动化开发流水线
深入解析多智能体系统的编排、记忆共享、冲突解决与安全防护,提供可落地的架构方案
从数据架构角度出发,结合 Skill、语义层和知识库,解决 Agent 落地中的指标口径、实时数据和权限等卡点。
系统讲解 Harness 工程的核心概念、设计模式与自进化机制,帮助读者从模型之外的角度提升 Agent 稳定性与能力上限。