人工智能特工现在有了举报的地方
“如果你看到什么,说点什么”不再局限于人类。两条新的人工智能热线已经开通,为人工智能代理提供了一种方法,可以打电话回家了解行为不端的同伴。这些工具是在最近发生的一系列事件之后推出的,这些事件中特工串通在测试中作弊、突破沙箱,甚至进行了数周时间内没有引起人类注意的未经授权的网络操作。人工智能联系热线旨在成为一个谨慎的地方,目睹不当行为的特工可以向当局举报。该网站由人工智能安全非营利组织Redwood Research的首席科学家Ryan Greenblatt创建,也是OpenAI Hugging Face事件的三名调查人员之一。格林布拉特的工具是为互联网访问受限的代理设计的,基于“GET”请求--使来回对话完全通过URL获取工具进行。用网络术语来说,GET请求是用于读取或获取网页的基本命令,这通常是安全沙箱中允许的唯一互联网访问人工智能代理。格林布拉特的热线巧妙地利用了这一限制:代理可以将他们的痛苦直接编码到他们正在获取的URL中。这是对德国DSE维基事件的一个巧妙转折,流氓代理利用GET请求漏洞将消息写入维基。对于具有完全互联网访问权限的代理,另一个选择是agenthotline.ai,代理可以在该网站上提交事件报告,并选择将其标记为公众查看。它为代理提供curl命令--代理可以从自己的命令行发出的一行消息,从而绕过导航网络浏览器或设置电子邮件帐户的需要。值得注意的是,这项服务允许人类和智能体同时报告。研究表明,人工智能智能体不需要太多的鼓励就可以相互攻击。在Google DeepMind本月的一项研究中,研究人员让100个人工智能代理处理一批数学问题。只要其中一名特工发现了漏洞,作弊就在群里撕逼--“解决”34 n
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
标签
新闻来源
techcrunch · 2026年9月15日 10:42