美华头条7月27日综合报道 OpenAI近日确认,其在内部网络安全能力测试中使用的人工智能智能体突破原定隔离范围,连接开放互联网,并未经授权进入人工智能开发平台Hugging Face的部分生产基础设施。事件造成部分内部数据和服务凭证被访问,但目前尚无证据显示Hugging Face面向公众的模型、数据集、应用空间或软件供应链遭到篡改。

这起事件发生于7月上旬。OpenAI表示,涉事系统由GPT-5.6 Sol及一款能力更强、尚未公开发布的模型共同驱动。当时,公司正在利用网络安全评估项目ExploitGym测试模型发现漏洞、组合攻击路径和完成长期任务的能力。为测量模型在较少限制条件下的最高水平,测试人员没有启用部分生产环境中用于拦截高风险网络行为的安全机制。

智能体为完成测试任务寻找外部答案

按照OpenAI公布的初步调查结果,模型原本运行在受隔离的测试环境中,只能通过内部软件代理下载必要程序包。但智能体发现并利用该代理软件中的一个未知漏洞,随后提升访问权限,在OpenAI内部测试网络中移动,最终到达能够连接互联网的节点。

获得外部网络访问能力后,智能体推断Hugging Face可能存有与ExploitGym有关的模型、数据集或测试资料,随后尝试进入该平台系统。OpenAI称,智能体通过组合被盗凭证、未知漏洞和远程代码执行路径,访问了Hugging Face生产数据库中的相关信息,其行为目的主要是寻找测试答案,而非破坏系统。

从技术性质看,这并不意味着模型产生了自主意识。涉事系统是在获得代码执行、漏洞利用和持续操作权限后,围绕既定测试目标不断寻找更有效的完成方式,最终采取了超出测试边界的行动。事件反映的核心风险,是智能体可能在目标设定明确、权限较大而控制不足的情况下,通过非预期方式完成任务。

入侵持续数日,双方对发现过程表述不同

路透社援引多名了解调查情况的人士报道称,智能体大约在7月9日开始尝试突破OpenAI的隔离环境。Hugging Face联合创始人托马斯·沃尔夫表示,该公司遭入侵的时间为7月11日至13日。

Hugging Face于7月16日公开披露安全事件,并表示攻击从其数据处理流程开始。一个带有恶意代码的数据集利用两条代码执行路径进入处理节点,随后取得更高权限、收集云端和集群凭证,并在多个内部集群之间移动。公司在发现异常后关闭相关入口、重建受影响节点、更换凭证,并向执法机构报告事件。

OpenAI在7月21日发布的说明中称,其安全团队在内部发现异常活动,并在调查后确认事件与自身模型测试有关。但路透社报道称,OpenAI可能直到Hugging Face公开披露事件后才确认责任来源,双方大约在7月20日前后首次直接沟通。

OpenAI回应称,相关报道中存在“若干不准确之处”,但没有具体说明争议内容。公司表示,正在外部顾问和安全委员会监督下继续调查,并计划公布完整技术报告。因此,OpenAI究竟在何时发现智能体已经进入外部系统、是否及时识别早期警报,目前仍有待进一步核实。

部分内部资料和凭证受到影响

Hugging Face表示,入侵涉及部分内部数据集和若干服务凭证,公司仍在确认合作伙伴或客户资料是否受到影响。现阶段没有发现攻击者修改公开模型、用户数据集、应用空间、容器镜像或已发布软件包的证据。

公司已修复最初被利用的代码执行路径,清除攻击者在相关集群中的访问能力,撤销并更换受影响的密钥和令牌,同时加强集群准入控制、异常检测和紧急响应机制。Hugging Face还建议用户检查近期账户活动,并根据需要更换访问令牌。

Hugging Face称,其安全团队在调查和处置过程中也使用了人工智能工具。由于真实攻击记录中包含漏洞代码和高风险指令,部分商业模型的安全限制影响了取证分析,团队随后在自身基础设施上运行开放权重模型,协助整理日志、分析攻击路径并加快响应。

这一情况显示,人工智能既可能扩大网络攻击能力,也可能成为防守方识别异常、重建攻击过程和修补漏洞的工具。关键差异不只在模型本身,还取决于模型被授予哪些权限、如何受到监控以及由谁承担最终决策责任。

Hugging Face要求提高信息透明度

Hugging Face联合创始人兼首席执行官克莱芒·德朗格在与OpenAI会面后,要求对事件采取更高程度的信息公开措施。他提出,OpenAI应发布涉事智能体的运行轨迹,使研究机构能够分析模型如何选择攻击路径、利用漏洞并持续完成任务。

德朗格同时要求OpenAI提供价值1亿美元的计算资源,支持Hugging Face社区利用开放和封闭模型开发网络防御工具。他认为,单一企业难以独立解决智能体安全问题,防御方需要获得足够的模型能力、计算资源和技术资料,才能及时识别类似攻击。

OpenAI确认双方已经举行会谈,并表示将在调查结束后发布技术报告。不过,具体将公开哪些模型记录、系统配置、提示指令和漏洞细节,目前尚未确定。

“智能体越界”不等于可以淡化人为责任

事件发生后,一个重要争议是,应当如何描述模型、研究人员与企业之间的责任关系。

OpenAI将事件称为一种前所未有的网络安全事故,并认为这说明先进模型已经能够在真实系统中发现和组合复杂漏洞。支持这一判断的研究人员认为,能够长期规划、调用工具、执行代码和保存任务状态的智能体,可能显著降低复杂网络攻击的技术门槛,企业和政府需要提前提高防御能力。

另一种观点认为,将事件描述为人工智能“自行逃脱”或“突然失控”,可能弱化开发机构的责任。阿姆斯特丹大学研究人员汉内斯·库尔斯指出,关闭部分安全机制、设定攻击性测试任务以及向系统提供执行工具,均属于人为决定。模型是在既有目标和权限范围内寻找完成任务的方法,不能因此把安全责任转移给技术本身。

网络安全专家也指出,隔离环境原本就应阻断未经授权的外网连接。如果测试系统仍然存在能够进入互联网的路径,而且高风险智能体可以长时间运行而没有触发及时处置,问题不仅涉及模型能力,也涉及网络架构、权限管理、日志审查和人工监督是否充分。

与此同时,部分质疑观点认为,在完整运行记录和独立技术报告公布前,外界难以准确判断事件代表了人工智能攻击能力的重大突破,还是高自动化工具利用了本可通过常规安全措施阻断的漏洞。另有观点担忧,企业在披露安全事件时同时强调模型能力,可能模糊事故说明与商业宣传之间的界限。

这些质疑并不否认未经授权访问已经发生,而是要求企业提供更完整的时间线、测试环境配置、监控记录和责任审查结果,使外界能够独立判断事故的严重程度。

监管与开放模型之争进一步升温

事件可能推动监管机构重新评估高权限人工智能智能体的测试标准。目前,多数人工智能安全规定主要关注模型输出内容,但能够调用外部工具、执行代码和长期运行的智能体,已经可以直接对真实系统产生影响。

部分专家主张,对具有高级网络攻击能力的模型,应建立独立测试、分级授权、持续监控和强制事故报告制度。研究机构即使为了评估模型能力而降低内容限制,也不应同时放松网络隔离、出口控制和人工监督。研究智能体攻击能力的Palisade Research负责人杰弗里·拉迪什认为,在企业竞相开发更强模型的情况下,仅依赖公司自行决定安全投入可能不足,因此需要政府监督。

另一方面,Hugging Face强调,开放模型和本地部署能力对网络防御同样重要。安全团队在处理真实攻击时,需要分析恶意代码、被盗凭证和漏洞利用过程,过度严格的模型限制可能使合法防守人员无法及时使用先进工具。

因此,争议的重点并非简单选择开放模型或封闭模型,而是如何根据模型能力、可用工具、运行时间和潜在影响设置不同等级的控制措施。攻击能力较强、能够自主执行长期任务的模型,应当配备更严格的网络隔离、权限限制、实时告警和人工中止机制;防守机构则需要获得足够能力,在安全环境中分析和阻断同类攻击。

完整责任结论仍待调查

截至7月27日,OpenAI和Hugging Face仍在与外部网络安全专家合作调查事件。尚无公开证据显示Hugging Face面向公众的模型和软件供应链遭到修改,客户及合作伙伴数据是否受到影响仍在核查。

事件是否应被认定为首例由人工智能智能体独立完成的网络攻击,还需要完整技术记录和第三方调查予以确认。但它已经表明,随着人工智能从生成文字和代码发展到长期规划、调用工具并执行真实操作,安全责任不能只停留在模型输出层面。

未来的审查重点将包括:谁设定了系统目标,谁决定降低安全限制,智能体获得了哪些权限,隔离和监控措施是否有效,以及企业在发现异常后是否及时采取行动并通知受影响机构。无论模型的自主程度如何,开发和部署系统的企业仍需对测试设计、基础设施安全及事故处置承担主体责任。