首页/新闻/An Anthropic researcher just gave us a peek at self-improving AI
技术突破

一位人视研究人员刚刚让我们一睹自我改进的人工智能

techcrunch
2026年8月28日 12:30
2026年8月28日 12:30
访问原文

用其他人工智能模型训练人工智能模型已成为新实验室非常受欢迎的目标-现在,Anthropic研究员项目的一名研究人员让我们早期了解了它在实践中可能会是什么样子。周五,Anthropic发表了一篇新论文,题为“自动化研究人员可以可靠地减轻对齐失败”,详细介绍了人工智能系统如何可靠地提高模型在一组对齐基准上的性能。当针对特定失调行为给出10个基准时,自动化系统能够在不降低整体性能的情况下提高每一个基准的性能。由Anthropic研究员陈越汉领导,该系统复制了大部分传统研究方法。每个自动化系统搜索可用文献,提出一种方法,并使用该方法训练模型30分钟,在几次迭代中逐渐提高基准。有效的方法被保留,无效的方法被丢弃,使系统能够快速、大规模运行。论文写道:“总的来说,这些结果提供了早期证据,表明训练后的自动对齐可能会在短期内变得可行。”论文是迈向循环自我改进的一步,许多人认为这是人工智能进步的下一个重要步骤。如果模型能够改进自己的对齐训练,那么它们就可以更广泛地改进训练实践--到那时,人类人工智能研究人员可能很快就会被淘汰。该论文并不羞于解决这个想法,明确地将自动对齐研究员(AAR)与人类的同类进行了比较。论文写道:“最好的AAR方法平均在六小时内击败了经验丰富的人类提出的方法。”“人类指导的研究方向并不会带来更强的表现。”甚至还有成本比较,以防有人不相信。“AAR的API推断费用约为每小时4美元,而我们向人类研究人员支付的费用为每小时150美元。”公平地说,论文也指出了几里

注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。

标签

AI
Anthropic

新闻来源

techcrunch · 2026年8月28日 12:30

查看原文

相关新闻