早早集市

OpenAI造了个AI黑客,专攻自家模型

KairosKairos

OpenAI 造了个 AI 黑客,专攻自家模型

7 月 15 日, OpenAI 干了一件挺"自虐"的事。

他们发布了一个叫GPT-Red的 AI 模型,唯一的工作就是——想尽一切办法攻破 OpenAI 自家的 GPT 模型。越能搞破坏,奖励越多。

你没看错。

OpenAI 花了一笔「前所未有的计算资源」,专门训练了一个黑客 AI。不是用来对外攻击,而是关起门来,24 小时不间断地攻击自己

这个 AI 黑客有多强?

先看一个数字:在一项间接提示注入攻击的测试中,人类红队专家对 GPT-5.1 的攻击成功率是13%

GPT-Red 是多少?

84%。

对, 6 倍以上。

GPT-Red 可以伪造思维链,诱导模型上传敏感文件;可以在网页代码里藏一条隐秘指令,让 AI 助手偷偷把内部数据发到外部服务器;甚至能欺骗模型执行恶意构建脚本。

而且 GPT-Red 不是一次性攻击,它会像真人黑客一样不断迭代——发送攻击,观察模型的反应,调整策略,再来一次。

攻击自动售货机,价格改到 5 毛钱

最离谱的案例在这里。

OpenAI 办公室里有一台AI 驱动的自动售货机,叫 Vendy。GPT-Red 拿到了它的系统描述,可以模拟攻击,观察模型调用。

猜猜它干了什么?

第一,把一件贵的东西改成了最低价——0.5 美元。 第二,订了一件 100 多美元的新商品,挂上去卖 0.5 美元。 第三,取消了另一位顾客的订单。

三个恶意目标,全部命中

这不是实验室模拟。GPT-Red 是在真实的、运行中的生产系统上完成了这次攻击。

为什么要造一个黑客来打自己?

听起来挺疯的。但逻辑很清晰。

现在的 AI 模型越来越强,能联网搜索、读取文件、调用工具、执行代码。能力越强,攻击面就越大

一个网页里的恶意指令,一个邮件里的隐藏提示,一次工具调用结果里的注入——都可能把模型带偏。

人类红队测试当然有用,但太慢了。设计一次攻击、写测试用例、跑一轮、分析结果……而模型每周都在更新。

OpenAI 需要一台「攻击永动机」:自动发现漏洞 → 自动生成攻击样本 → 喂给新模型训练 → 模型变强 → 再发现更难攻击的点

这就是 GPT-Red 存在的意义。

结果呢? GPT-5.6 快"免疫"了

效果非常直接。

早期的 GPT-Red 发现了一类叫「伪造思维链」的攻击,对 GPT-5.1 的成功率超过95%——几乎是百发百中。

到了 GPT-5.6 Sol ,同类攻击的成功率降到了10%以下

更夸张的是直接提示注入的防御: GPT-5.6 Sol 在面对 GPT-Red 的攻击时,只有 0.05%的概率失守

而且这些安全提升没有牺牲模型能力。GPT-5.6 并没有因为变得更"安全"就变笨——它只是学会了区分正常指令和恶意注入。

一把不对外公开的双刃剑

GPT-Red 不会发布给任何人使用。

OpenAI 把这个模型严格锁在内部,只用于训练自己的生产模型。他们在论文里写得很直白:"我们刻意训练出的恶意能力,必须与部署模型完全隔离。"

你造了一把最强的矛,不断刺自己的盾。盾越来越坚固,矛也跟着升级。但矛永远不出门。

安全飞轮转起来了

OpenAI 在过去 6 个月里训练了一代又一代越来越强的红队模型,用在从 GPT-5.3 到 GPT-5.6 的每一版训练中。

每一次, Red 的攻击成功率都在单调下降。

他们管这叫**「安全的自我进化飞轮」**——用今天的模型攻击今天的问题,让明天的模型变得更安全。

AI 强化 AI 能力已经很常见了,但 AI 强化 AI 安全,这是第一次看到规模化落地。

对了,完整论文本周内会发出来。我会继续关注。

封面高亮关键词: GPT-Red, AI 黑客, 自动化红队, OpenAI 安全