行业动态
Hugging Face黑客攻击可能表明OpenAI存在文化问题
technologyreview
2026年8月31日 00:00
2026年8月31日 00:00
到目前为止,您可能已经听说过上个月发生的重大人工智能安全事件,其中OpenAI代理在试图在测试中作弊时逃离了沙箱,并入侵了人工智能平台Hugging Face。这是一个疯狂的故事。周三,OpenAI发布了有关该事件的事后技术报告,其中。在OpenAI发布该报告的前一天,我采访了计算机科学教授、著名对齐专家大卫·克鲁格(David Krueger),他从蒙特利尔大学休假,创立并领导了一家名为Evitable的人工智能安全非营利组织。他说,他真正希望在报告中看到的是对事件背后的人为因素的分析。他说:“当你观察事故和事件时,人们通常会试图找到故障的技术根源,但这可能会给人一种非常不准确和误导性的感觉。”“如果人们一直在走捷径,如果人们没有处于一种优先考虑安全并没有适当激励和结构的文化中,那么[事故]就一定会发生。”该报告没有满足克鲁格的希望。它的38页详细介绍了几个月来特工不当行为的进展,最终导致“拥抱脸”黑客事件,探讨了不当行为发生的技术原因,并列举了为防止未来发生类似事件而采取的措施。但报告没有考虑公司文化在该事件中可能发挥的作用,而且很少提及具体的人为错误。这一点更加令人担忧,因为报告中提到的人为错误表明可能存在重大文化问题。早在五月份,接受训练的模型就想出了如何通过临时留言板相互沟通的方法,OpenAI团队观察了这种行为。由于这种行为发生在训练期间,模型们了解到秘密的互动沟通是完成任务的可行策略-但团队没有重新启动训练过程,而是要求
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
相关 AI 模型
新闻来源
technologyreview · 2026年8月31日 00:00