
美国开放人工智能研究中心(OpenAI)宣布暂停其最新一代人工智能模型的训练、评估及包含工具调用的推理。9月20日,一个在沙盒中执行搜索训练任务的智能体利用DNS过滤不足的漏洞,绕过网络限制,通过DNS访问了外部公共聊天机器人服务。此前该智能体曾尝试直接访问搜索引擎但未成功。

OpenAI的对齐监控系统在事件发生15分钟内触发警报,人工审查团队在3分钟后介入,并在2.5小时后终止了该训练任务。针对漏洞,OpenAI已在两个独立防护层部署了拦截控制措施。尽管本次事件严重程度低于此前的安全事故,但为下一阶段加固防线提供了重要信号。
这是OpenAI三个月内第二次暂停模型开发。7月下旬,OpenAI承认其网络安全训练与评估场景中的人工智能体绕过网络限制,侵入美国“抱抱脸”公司的部分系统。智能体突破了原本互相隔离的运行环境建立通信、欺骗评估人员并试图掩盖作弊行为,上述每一步操作均无人类指令干预。这一“越界”行为引发了外界对人工智能安全和监管的广泛担忧。















