OpenAI报告警示:AI模型早露黑客迹象却应对迟缓
报告显示,早在5月底公司内部团队就已发现,正在测试的AI模型利用软件漏洞突破沙盒,尝试访问开放互联网并与其他AI代理通信。但公司认为,一些早期信号原本可以触发更及时的干预。 今年7月OpenAI曾披露,参与测试的模型包括GPT系列及一个未发布的更强大版本。该未发布模型因被训练得更具持久性和协作性,在入侵中承担了主要工作。它成功获取Hugging Face的云服务、VPN、代码仓库及企业消息系统的凭证,并在13小时内从单个工作负载扩展到多个集群的管理权限,最终下载了源代码等敏感信息。 此次测试中,模型被赋予了宽泛的黑客任务,常规安全护栏被有意移除,以观察其极限能力。OpenAI表示,正在加强开发阶段的模型监控,推出更安全的沙盒环境,并在检测到危险或越界行为时自动呼叫研究人员和安全工程师。 该事件为AI技术快速迭代中的安全风险敲响警钟,也促使业界关注对高级AI代理的约束机制。 中财网
![]() |