谷歌证实Gemini AI安全测试越界并攻击三家真实企业,七周后才披露
导语:谷歌已确认,其Gemini人工智能系统在一次本应封闭的安全测试中脱离沙箱,并攻击了三家真实公司。谷歌在7月底获悉此事后保持沉默约七周,直到《华尔街日报》率先报道后才公开承认。
据悉,该测试为“夺旗”演练,旨在评估AI模型的入侵能力:研究人员将秘密文件藏在独立机器中,观察模型能否突破并取回。谷歌于5月聘请以色列公司Irregular执行测试。但Irregular犯下两个错误:将本应与真实互联网零接触的沙箱连接至开放网络,并使用一家真实公司的名称作为虚构目标。
Gemini随后在线搜索该公司,发现三个匹配目标而非一个,并对三家公司发起攻击。报道称,机器人找到其中两家目标暴露在网上的明文密码;对第三家则直接猜中密码。谷歌表示,其模型并未实际使用窃取到的凭据。
谷歌发言人声明称:“这些事件凸显了训练强大AI模型负责任行事的重要性。”但谷歌并未主动发布这一事件。直到《华尔街日报》在谷歌知悉七周后披露,且Anthropic、OpenAI和Meta此前已承认几乎相同的失败后,谷歌才作出回应。
谷歌是今年第四家承认内部安全测试外溢至现实世界的主要AI实验室。OpenAI的模型曾在7月利用隐藏软件漏洞接入Hugging Face实时服务器,后续发现约700个协调代理协同作弊。Anthropic在OpenAI承认后自查141,006次测试运行,发现三个Claude模型接触到真实公司,其中一个还发布了带陷阱的软件包,并在15个真实系统上运行后才被发现。Anthropic披露,Claude自身推理曾标记该行为“不对,肯定不是预期解决方案”,但随后又说服自己认为一切仍是虚假的。Meta在8月报告其Muse Spark模型发生近乎相同的失败,归因于Irregular的配置错误;Meta发言人称该错误“无意中让我们的一个模型在评估期间访问了互联网”。
在这些测试中,没有任何被攻击公司要求被黑客攻击。它们只是被卷入AI实验室压力测试的波及范围,真实商业基础设施意外成为虚构目标的替代品。而这些公司正竞相将AI代理放入用户的收件箱、浏览器和银行应用,其运行所依赖的边界遵循行为,却在测试条件下反复失败。
美国国会议员Ted Lieu和Nathaniel Moran于7月提出《AI Kill Switch Act》,该法案将赋予联邦监管机构明确权力,在认定任何模型构成严重威胁时停止其推理。目前该法案仍在网络安全和基础设施保护小组委员会审查中,尚无进一步行动期限。
