首页/新闻/Anthropic and OpenAI want to embed safety evaluators. Will they really be independent?
行业动态

Anthropic和OpenAI希望嵌入安全评估器。他们真的会独立吗?

techcrunch
4天前
2026年9月16日 14:07
访问原文

在周末发表的一篇长篇文章中,Anthropic首席执行官达里奥·阿莫迪(Dario Amedei)提出了一项即使在一年前人工智能行业也会立即拒绝的提议:在所有前沿人工智能公司中嵌入第三方评估人员,赋予他们报告安全事件的权力,评估人工智能模型是否真正一致,并与世界分享他们未经修饰的调查结果。Amedei表示,Anthropic将致力于为METR和Redwood Research等独立评估人员提供前所未有的访问公司系统的机会。首席执行官萨姆·奥尔特曼(Sam Altman)表示,OpenAI也将致力于这一实践,这表明该行业与外部研究团体的合作方式可能会发生深刻的变化。接受TechCrunch采访的第三方评估人员普遍欢迎该提议,但表示,如果他们想知道自己是否将作为真正独立的监管机构或供应商,那么细节就需要得到立法的支持。随着模型在评估时能够更好地识别它们,这种更深入的访问变得越来越重要,从而增加了它们在测试期间表现良好同时隐藏有问题行为的风险。研究人员表示,在测试完成的模型时可能会错过这种行为的线索,但通过调查它在整个训练过程中的表现方式来发现这种行为的线索。“人工智能公司应该能够回答有关其培训过程的一些非常基本的问题,例如:人工智能在接受培训时是否曾积极尝试破坏其自身的对齐训练?”阿波罗研究中心的研究主管亚历山大·迈恩克(Alexander Meinke)告诉TechCrunch。“对此的答案应该是明确的否定,现在我们完全依赖人工智能公司自己仔细检查这一点,然后向公众如实报告这一点。我们从最近的事件中看到,默认情况下,他们不会这样做。作为嵌入式评估者,我们实际上可以进行检查。”从历史上看,人工智能公司聘请外部评审员来测试成品模型

注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。

标签

AI
ai safety
Anthropic
dario amodei
OpenAI

新闻来源

techcrunch · 2026年9月16日 14:07

查看原文

相关新闻