导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

OpenAI推出AI红队系统GPT-Red,自动强化GPT-5.6抵御提示注入攻击

OpenAI本周三宣布推出名为GPT-Red的自动化AI系统,专门用于查找其语言模型中的安全漏洞。该系统名称取自网络安全领域的“红队”实践——即在攻击者利用漏洞之前,主动尝试破坏系统以识别弱点。据OpenAI介绍,GPT-Red已帮助GPT-5.6在部署前显著增强了对提示注入攻击的抵抗能力。

“随着模型能力的增长,安全性与对齐性必须同步提升,”OpenAI在X平台发文表示,“红队测试至关重要,但当前方法难以规模化,形成了关键瓶颈。GPT-Red正是我们解决这一问题的方案之一。”该系统通过自我对抗强化学习(self-play reinforcement learning)进行训练:攻击模型不断生成更强的提示注入攻击,而防御模型则学习如何抵抗这些攻击。OpenAI称,这些攻击已被整合到GPT-5.6的训练流程中。内部评估显示,GPT-Red在84%的场景中成功发现了漏洞,而同一测试中人类红队的成功率仅为13%。

“GPT-Red通过对抗性自我学习,其目标是向各种具有挑战性的防御模型发起提示注入攻击,”OpenAI在技术文档中写道,“GPT-Red发现的每一次成功攻击都会用于改进这些防御模型,从而迫使GPT-Red持续寻找更广泛、更复杂的缺陷。”在一项典型案例中,OpenAI演示了该系统如何操纵一个自动售货机AI代理——在漏洞被披露和修复前,成功诱使其降低价格、订购折扣库存并取消其他客户的订单。

GPT-Red的推出是OpenAI自ChatGPT公测以来多年网络安全努力的最新进展。2023年,该公司启动了OpenAI红队网络,招募外部网络安全研究人员和领域专家,在发布前对ChatGPT及其他模型进行安全漏洞探测。GPT-Red通过自动化大量流程扩展了这一努力——利用AI模型生成提示注入攻击及其他对抗性测试,其规模是人类研究人员难以企及的。OpenAI的公告也反映了业界利用AI保障AI安全的更广泛趋势。本月初,以太坊基金会表示已部署AI代理对关键网络基础设施进行红队测试,并在以太坊共识客户端使用的软件中发现了一个漏洞。研究人员指出,AI代理能够搜索比人类更庞大的代码库,但挑战已从发现潜在漏洞转向验证哪些漏洞可被实际利用。

OpenAI表示,GPT-Red将保持内部工具属性,因为其包含故意开发出的攻击能力。“我们相信,通过GPT-Red,我们已经开始解锁类似的安全飞轮——今天的模型可以用来让明天的模型更稳健、更对齐、更值得信赖。”