Meta 研究人员训练了一个 80 亿参数的 AI 模型,使其性能媲美 Claude Opus 4.5,却无需支付前沿模型的昂贵费用。
执行长周期任务(如迁移 CRM 数据)的 AI 智能体不仅需要内部记忆,还依赖运行时层(或称“驾驭层”,harness)来提供执行反馈和状态管理。传统上,开发者以逐步方式脚本化智能体行为,限制了其自主性与适应性。来自 Meta AI 和伊利诺伊大学厄巴纳 - 香槟分校的 EvoHarness-RL 引入了一个名为信念、进展与经验(Belief, Progress, and Experience, BPE)的统一工作空间,以增强智能体能力。其中,Belief 用于追踪环境状态,Progress 管理子目标,Experience 存储历史知识。智能体通过四种元操作与 BPE 交互:track(追踪)、commit(提交)、recall(回忆)和 note(记录)。该框架使智能体能够学习何时以及如何访问和更新其外部状态。EvoHarness-RL 采用监督微调以结构化数据,并结合计算成本感知的强化学习,以根据计算成本优化工具使用。在基准测试中,EvoHarness-RL 显著提升了较小 AI 模型的性能,甚至媲美更大规模的闭源模型。该框架同样使现有前沿模型受益,通过 BPE 提示时驾驭层增强其执行能力。在训练过程中,EvoHarness-RL 展现出“驾驭层退火”(harness annealing)现象,即智能体减少对常规任务中外层工具的依赖;以及“驾驭层演化”(harness evolution),即根据任务复杂度动态调整策略。环境适配器实现了与现有企业系统的无缝集成,无需对当前工具或智能体框架进行彻底重构。EvoHarness-RL 标志着从脚本化智能体行为向构建可学习更优行为的系统的转变,尤其适用于长周期且复杂的任务。