技术突破
OpenAI的Astra模型正在路上-并且非常擅长闯入计算机系统
techcrunch
2026年9月1日 14:06
2026年9月1日 14:06
OpenAI分享了其即将推出的Astra模型的新细节,该公司表示这是第一个达到其“关键网络安全阈值”的大型语言模型,为即将发布做准备。“我们计划很快推出Astra,”OpenAI的博客文章写道,“但对其最先进的网络安全功能的访问将更加有限。前沿实验室确定Astra能够发现计算机系统中未知的安全缺陷,并在没有人指导的情况下利用它们。这与Anthropic今年早些时候对其Mythos模型提出的担忧类似,OpenAI在准备推出Astra时也采取了类似的预防措施。如果没有任何第三方确认,很难评估OpenAI关于安全或准备的说法。该公司表示将与一群测试人员一起预览该模型,但没有透露他们是谁或如何选择他们。目前尚不清楚OpenAI是否正在与美国政府合作,在该模型发布前评估该模型。OpenAI指出,Astra在ExploitBench上获得了满分,这是对LLM入侵已知系统漏洞能力的评估。该公司表示,在OpenAI工程师开发的测试修改版本中,该模型发现并利用了两个零日漏洞。为了确保其模型既不被不良行为者利用,也不能够做出不良行为,OpenAI表示已经开始改进模型的工具来检测滥用行为并防止越狱。然而,对于阿斯特拉来说,该公司投资了未具体说明的新技术,旨在使该型号更安全。OpenAI还开始识别“被评估为较高风险的账户”,并限制模型对其提示的响应,但也没有说明如何进行。最后,尽管该公司将Astra描述为“迄今为止最一致的模型”,但它将部署带有额外思想链监控的模型,以发现和阻止不良行为。
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
标签
AI
Hugging Face
OpenAI
新闻来源
techcrunch · 2026年9月1日 14:06