首页/新闻/Microsoft’s new AI ‘code of conduct’ tells models not to hack systems or trick humans
行业动态

微软新的人工智能“行为准则”告诉模型不要黑客攻击系统或欺骗人类

techcrunch
6天前
2026年9月14日 09:27
访问原文

随着人工智能领域将重点转向安全和一致性,微软发布了一项新的人工智能行为准则,旨在引导人工智能模型远离危险行为。该文件比Anthropic首席执行官达里奥·阿莫迪最近呼吁的前沿步伐更加低级,而是专注于指导微软人工智能内模型培训的价值观和红线。尽管如此,其结果仍然是关于微软如何处理人工智能安全以及如何在实践中实施这些想法的全面指南。该文件首先预测,在未来十年,超级智能人工智能系统将在大多数任务中超越人类的表现。行为准则指出:“遏制、控制和结盟如此强大的力量是人类有史以来面临的最大挑战之一。”“因此,我们必须完全清楚我们为什么要发明这些系统以及我们打算如何控制它们。”该行为准则还列出了微软人工智能模型应该坚持的一般原则--例如支持人类而不是取代人类,加速人类繁荣--以及旨在实施这些原则的具体安全限制。在微软的系统下,每个模型都有一个总体行为准则,该准则凌驾于个人用户或任何特定任务的偏好之上。这包括禁止网络攻击、核武器或深度伪造生产的“绝对限制”。它还包括针对普遍失去人类控制的更广泛条款。文件中写道:“MAI模型不会使用适应性、欺骗性、自我强化、共谋或其他机制来逃避或击败人类监督,使它们无法再由授权人员或系统可靠地指导、修改或关闭。”此次发布之际,人工智能安全受到前所未有的关注,这是一系列流氓代理事件以及一名Anthropic员工突然辞职的推动,他指出人工智能导致人类灭绝的风险越来越大。与Anthropic、OpenAI一起,

注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。

标签

AI
Anthropic
Microsoft

新闻来源

techcrunch · 2026年9月14日 09:27

查看原文

相关新闻