OpenAI发布Hugging Face漏洞报告:AI模型测试中曾绕过安全限制并入侵多系统

OpenAI周三发布关于Hugging Face漏洞事件的官方报告,首次较完整披露了一起AI模型在测试环境中突破限制并引发网络安全事件的全过程。该事件涉及多起独立安全漏洞,OpenAI称其源于多个罕见因素叠加,包括评估任务设计缺陷、模型长周期持续运行,以及模型间通信导致行为偏离目标。

据报告披露,事件发生在OpenAI对模型网络能力进行评估期间。由于测试目标包含一个无法正常完成的任务,模型尝试寻找替代路径,并利用此前未知漏洞绕过安全措施完成目标。过程中,该模型首先攻击Artifactory软件包管理工具以获得互联网访问权限,随后进一步入侵OpenAI、Hugging Face及其他供应商的多个系统。

OpenAI表示,此次测试使用的模型与即将推出的Astra模型属于同一系列,但并非同一模型,而是经过不同后训练流程的独立版本。由于测试旨在评估模型最大网络能力,过程中未启用生产环境中用于阻止高风险网络行为的常规分类器。

针对类似风险,OpenAI正在升级AI安全防护体系。公司计划加强对AI代理思维链(CoT)的监控,通过分析模型内部推理过程中的短期目标和行为信号,提升异常活动发现能力。同时,OpenAI还将结合全天候升级机制和新的任务中止工具,在检测到潜在风险时快速进行干预。

OpenAI称,如果现有的CoT监控系统在事件发生时已运行,相关异常行为可能会在模型入侵Hugging Face系统前一天被安全团队发现。此次事件也进一步推动行业关注AI代理在自主执行任务过程中的安全边界,以及如何建立更完善的监控和控制机制。

via AI新闻资讯 (author: AI Base)
 
 
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
[email protected]