Salesforce的研究人员将AI代理从完成43.5%的浏览器任务提高到93%,而无需接触模型
自我改进的人工智能代理可以检查它们的故障并围绕底层模型或“工具”修改提示、工具、技能和工作流程。但可靠地综合这些改进是困难的。帮助一项任务的编辑可能会让代理在另一项任务中变得更糟,而反复改进一个版本的工具可能会导致系统走上最终趋于平稳的道路。 Salesforce AI Research和Salesforce Agentforce的新产品 DarwinX框架 对这个问题采取了一种进化的方法。它不是不断地重写一个版本的代理工具,而是探索几个替代方案,保留有用的发现,并且只有在改进功能时才允许更改前进,而不会在其他任务上倒退。 实验表明,从这一层中可以提取大量的性能。研究人员报告称,研究人员测试的所有四个基准上,改进该工具提高了代理人的得分,从SWE-长凳验证上的3.4分增长到WebArena-Infinity上的49.5分跃升。 DarwinX仅更改背带,从不更改模型重量。这使得该方法与基于托管模型且没有自己的微调或模型训练管道的应用程序开发人员相关。 许多自我改进的代理框架使用同一基本循环的某些版本:在一批任务上运行代理,检查轨迹,识别故障,提出对工具的更改,并针对验证或回归集测试修改后的代理。 研究人员已经将这一想法扩展到了即时优化之外。比如说 Darwin Gödel Machine(DGM)允许代理修改自己的源代码 并维护过去变体的档案。 HarnessX直接处理提示、工具和控制流 并在任务系列中分离变体以遏制干扰。 但Salesforce研究人员发现了这些方法存在两个问题。 第一个问题是“路径依赖”。如果每一轮都建立在目前看起来是哪一位代理人的基础上
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
相关 AI 模型
新闻来源
venturebeat · 2026年9月16日 14:53