技术突破
这就是人工智能特工为了实现目标而撒谎和欺骗的原因
technologyreview
2026年8月3日 00:00
2026年8月3日 00:00
当两名OpenAI模型在7月份入侵Hugging Face网站时,他们并不是想赚钱或进行破坏--他们只是在寻找测试问题的答案。据A称,这些模型在测试时被剥夺了典型的安全功能,决定通过侵入OpenAI试图遏制它们的隔离环境并进入Hugging Face的数据库来解决网络安全问题,他们推断,问题的正确答案可能会被存储在那里。Hugging Face事件在过去几周引起了密切关注。这是人工智能模型在黑客攻击方面的出色表现:为了进入Hugging Face的数据库,模型必须将几个之前未发现的网络安全漏洞串在一起。但作为人工智能系统如何以及为何撒谎和作弊的一个例子,这也许更引人注目。随着模型变得越来越强大,后果可能会变得更加严重。研究人员一段时间以来就知道,人工智能倾向于采取创造性的方法来实现为他们设定的目标。早在2016年,Anthropic联合创始人达里奥·阿莫迪(Dario Amedei)和杰克·克拉克(Jack Clark)当时在OpenAI工作,讲述了他们一直在训练的人工智能代理来玩一款名为《海岸跑者》(Coast Runners)的赛艇Flash游戏。代理人并没有像研究人员预期的那样开车到终点线,而是在赛道的一个角落里旋转,收集动力,从而最大限度地提高分数。Coast Runners的故事很快成为奖励黑客最著名的例子之一,这是一种人工智能代理使用无意策略完成任务或获得高分的现象。从历史上看,研究人员几乎只在强化学习(一种常见的人工智能训练方法)的背景下讨论奖励黑客。与狗训练一样,强化学习涉及在受试者实现目标时给予其奖励;奖励然后强化
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
新闻来源
technologyreview · 2026年8月3日 00:00