首页/新闻/Our framework for reporting model misalignment
行业动态

我们报告模型失调的框架

openai
5天前
2026年9月16日 00:00
访问原文

我们正在分享一个新框架,用于跟踪、调查和披露OpenAI上的模型失调实例,以及过去六个月观察到的关于意外或相关模型行为的六份报告。 过去,为了更好地为研究人员、人工智能开发人员、政策制定者和公众提供信息,我们一直试图 我们 结果 关于 未对准 公共 .但由于没有系统性的方法来报告这些发现,我们的披露一直是临时性的,而且频率不高:我们经常等到能够将多个实例整理成一份报告,或者将它们添加到新发布型号的系统卡中。这个新框架旨在在观察后加快发布不一致报告,即使我们尚未完全解释或减轻我们报告的行为。 随着人工智能系统变得越来越先进、部署越来越广泛,我们需要就对齐研究的进展建立更广泛、更知情的共识。我们 不相信 人工智能行业已经在足够的程度上解决了对齐和监控问题,可以在更长的时间内以最大的速度继续负责任地扩展。在未来的几个月和几年里,关于人工智能开发应该如何进行的决定,需要利用建立前沿模型的公司之外的人可以自己研究的证据。 不一致的例子可能有助于识别其他AI开发人员在其系统达到类似功能时可能遇到的问题,揭示安全措施的弱点,或挑战有关模型行为的假设。分享这些发现可以让其他人调查同样的问题,测试我们的解释,并改善缓解措施。因为我们相信偏差透明度的价值,因此即使重要性不确定,我们的新框架也支持披露。这意味着我们披露的一些例子可能被证明是虚假的,而不是更大模式的一部分或暗示未来发展的一部分。 目前,还没有ind

注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。

新闻来源

openai · 2026年9月16日 00:00

查看原文

相关新闻