首页/新闻/Anthropic found a hidden space where Claude puzzles over concepts
更新迭代

Anthropic发现了一个隐藏的空间,克劳德在其中困惑概念

technologyreview
2026年7月9日 00:00
2026年7月9日 00:00
访问原文

人工智能公司Anthropic开发了一种技术,使其能够最清晰地了解大型语言模型在回答问题或执行任务时内部到底发生了什么。他们的发现范围从平凡到令人不安。该公司的研究人员开发了一种名为Jacobian lens(或J-lens)的工具,并用它来揭开克劳德Opus 4.6(Anthropic的旗舰LLM版本)内部的一个隐藏区域,他们将其命名为J-空间。2月份发布。J空间包含与模型在不久的将来最有可能在响应中吐出的单词和短语相关的单个单词。如果克劳德是一个人(事实并非如此),你可能会说这些隐藏的词语可以在它真正说话之前揭示它的想法。Anthropic发现,法学硕士实际正在做的事情往往与它所说的事情不同。该公司声称,监控J空间中弹出的单词为它提供了一种理解和控制其模型的新方式。该公司本周分享了其结果。它还与Neuronpedia合作,Neuronpedia是一个开源平台,可以让您自己在LLM中探索,制作任何人都可以尝试的。“这是一项非常好且有趣的工作,”Goodfire的首席科学家兼联合创始人汤姆·麦格拉思(Tom McGrath)说,Goodfire是一家也在建造的初创公司。在过去的几年里,Anthropic一直在研究一个名为机械解释性的领域,其中涉及。(被选为今年的顶级突破技术之一。)这项新技术以Anthropic等人之前的工作为基础,揭示了研究人员以前从未见过的LLM内部更深层次的内容。 将LLM想象成一堆书。每本书都是一层被称为神经元的基本计算单元,一层中的每个神经元将信息传递给上面层中的神经元。堆栈底部的书籍是输入层,用于处理进入模型的文本。顶部的书籍是输出层,

注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。

相关 AI 模型

新闻来源

technologyreview · 2026年7月9日 00:00

查看原文

相关新闻