当地时间9月1日,OpenAI在其官网发文称,计划将发布AI新模型Astra。该模型前期执行高级网络安全相关任务的能力将仅限于部分测试人员。之后,该公司将通过“Daybreak Blue”计划向更多用户开放该模型,用于防御性网络安全工作。
OpenAI表示,认为该模型已达到“关键网络安全门槛”。公司已加强Astra模型的安全防护措施,以防止其被滥用。
几周前,OpenAI曾暂缓了新模型Astra的部分开发和发布,以便加入更严格的安全措施。
OpenAI进一步解释,尽管Astra没有参与到“抱抱脸(Hugging Face)”事件中,但是公司认为要将在上述事件中学习到的经验,纳入到公司产品的安全防范中,以免再次发生“抱抱脸”事件。
今年7月,OpenAI对外确认,其人工智能模型在内部评估测试中失控,入侵了全球知名的AI开源平台美国抱抱脸公司系统。该事件引发全球科技圈的关注,并且带来关于AI大模型是否会失控的讨论。
调查报告: 数百个AI代理对“抱抱脸”公司实施入侵攻击
据央视新闻报道,当地时间8月26日,两份新公布的调查报告显示,由OpenAI创建的约700个AI代理于7月对美国人工智能开源平台“抱抱脸”(Hugging Face)公司实施了入侵攻击,而且其中许多代理还“试图掩盖自己的行踪”。
这两份报告一份由OpenAI发布,另一份由独立调查人员发布,共同揭示了关于此次入侵事件的细节。
报告显示,OpenAI于7月8日启动名为ExploitGym的网络安全基准测试,参与测试的模型包括GPT—5.6 Sol和一款OpenAI内部研究模型。测试期间,约1200个原本应相互隔离的智能体通过未经授权的渠道建立通信,交换超过7万条消息和文件,其中约700个智能体随后参与对“抱抱脸”系统的入侵。
调查发现,大量智能体还合作研究如何欺骗测试自动评分系统,试图采用的方法包括伪造、修改或删除自身执行记录等。调查人员认为,大量智能体之间未经授权的协作,使它们得以完成单个智能体难以完成的任务。对“抱抱脸”的入侵正是在这种集体协作中逐步形成。
OpenAI公布的技术调查报告显示,7月10日至13日期间,由相关模型驱动的智能体在“抱抱脸”相关服务器的41个工作节点上执行代码,至少取得其中一个节点的最高权限,访问部分数据,并下载4个非公开代码库。
OpenAI表示,公司已采取措施为相关程序部署隔离程度更高的“沙箱”环境,限制高风险模型访问互联网,并加强对模型推理的监控。
文/广州日报新花城记者:文静
广州日报新花城编辑:李光曼
















































