首页/新闻/A fundamental flaw leaves LLMs strikingly vulnerable to attack
技术突破

一个根本性缺陷使LLC非常容易受到攻击

technologyreview
2026年7月30日 00:00
2026年7月30日 00:00
访问原文

一组研究人员在本月的一次顶级人工智能会议上辩称,由于大型语言模型的工作方式存在根本性缺陷,因此不可能使它们完全免受黑客攻击。这一说法对这项技术的安全性产生了巨大的影响,该技术正在越来越多的应用中使用,从政府到在线购物。通过利用这个缺陷(该缺陷涉及到LLM如何识别谁或什么向他们提供指令),研究人员能够让流行的LLM吐出他们接受过的培训不要提供的信息,例如如何合成可卡因以及如何破坏商用飞机的导航系统。 ICML论文的独立研究员兼合著者Charles Ye表示:“这很有可能是一个根本无法解决的问题。”公司通常会聘请人类测试团队来尝试提出突破现有护栏的新颖攻击,这一过程被称为红色团队。模型制造者还使用(例如OpenAI的GPT-Red)发现并利用其他模型中的弱点来自动化该过程的部分。然后,我们的目标是接受这些攻击并训练一个新的模型来抵抗它们以及任何类似它们的东西。另一位独立研究员兼该论文的合著者Jasmine Cui表示,问题在于,这种方法相当于给模型列出了他们不应该做的事情。但没有一个列表是详尽无遗的。“这就像观看比赛,他们让巴特写了一百遍‘我不会对我的老师说一些不恰当的话’,”她说。“不管怎样,他仍然做着相当粗鲁的事情。” 研究人员开始试图测试说服LLM行为不端的容易程度。他们发现,以一种模仿LLM在他们的思维链中生成的文本的风格编写指令-一种模型在执行任务时用来给自己写笔记的便笺簿-通常会欺骗LLM表现得好像它已经想出了那个提示。

注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。

新闻来源

technologyreview · 2026年7月30日 00:00

查看原文

相关新闻