[{"data":1,"prerenderedAt":247},["ShallowReactive",2],{"page-/post/nezus/2026/07/openai-ai":3,"surrounding-page":238},{"id":4,"title":5,"author":6,"body":7,"date":227,"description":18,"extension":228,"group":229,"lastmod":230,"meta":231,"navigation":232,"path":233,"rawbody":234,"seo":235,"showTitle":230,"sort":230,"stem":236,"tags":230,"versions":230,"__hash__":237},"content/post/nezus/2026/07/openai-ai.md","OpenAI造了个AI黑客，专攻自家模型","storytelling",{"type":8,"value":9,"toc":216},"minimark",[10,15,19,31,34,41,45,51,54,59,62,65,72,76,79,86,89,103,109,112,116,119,125,128,135,141,144,148,151,158,164,170,177,180,183,189,192,195,198,201,204,207,210],[11,12,14],"h2",{"id":13},"openai-造了个-ai-黑客专攻自家模型","OpenAI 造了个 AI 黑客，专攻自家模型",[16,17,18],"p",{},"7 月 15 日， OpenAI 干了一件挺\"自虐\"的事。",[16,20,21,22,26,27,30],{},"他们发布了一个叫",[23,24,25],"strong",{},"GPT-Red","的 AI 模型，唯一的工作就是——",[23,28,29],{},"想尽一切办法攻破 OpenAI 自家的 GPT 模型","。越能搞破坏，奖励越多。",[16,32,33],{},"你没看错。",[16,35,36,37,40],{},"OpenAI 花了一笔「前所未有的计算资源」，专门训练了一个黑客 AI。不是用来对外攻击，而是关起门来，",[23,38,39],{},"24 小时不间断地攻击自己","。",[11,42,44],{"id":43},"这个-ai-黑客有多强","这个 AI 黑客有多强？",[16,46,47,48,40],{},"先看一个数字：在一项间接提示注入攻击的测试中，人类红队专家对 GPT-5.1 的攻击成功率是",[23,49,50],{},"13%",[16,52,53],{},"GPT-Red 是多少？",[16,55,56],{},[23,57,58],{},"84%。",[16,60,61],{},"对， 6 倍以上。",[16,63,64],{},"GPT-Red 可以伪造思维链，诱导模型上传敏感文件；可以在网页代码里藏一条隐秘指令，让 AI 助手偷偷把内部数据发到外部服务器；甚至能欺骗模型执行恶意构建脚本。",[16,66,67,68,71],{},"而且 GPT-Red 不是一次性攻击，它会",[23,69,70],{},"像真人黑客一样不断迭代","——发送攻击，观察模型的反应，调整策略，再来一次。",[11,73,75],{"id":74},"攻击自动售货机价格改到-5-毛钱","攻击自动售货机，价格改到 5 毛钱",[16,77,78],{},"最离谱的案例在这里。",[16,80,81,82,85],{},"OpenAI 办公室里有一台",[23,83,84],{},"AI 驱动的自动售货机","，叫 Vendy。GPT-Red 拿到了它的系统描述，可以模拟攻击，观察模型调用。",[16,87,88],{},"猜猜它干了什么？",[16,90,91,94,95,98,99,102],{},[23,92,93],{},"第一","，把一件贵的东西改成了最低价——0.5 美元。\n",[23,96,97],{},"第二","，订了一件 100 多美元的新商品，挂上去卖 0.5 美元。\n",[23,100,101],{},"第三","，取消了另一位顾客的订单。",[16,104,105,106,40],{},"三个恶意目标，",[23,107,108],{},"全部命中",[16,110,111],{},"这不是实验室模拟。GPT-Red 是在真实的、运行中的生产系统上完成了这次攻击。",[11,113,115],{"id":114},"为什么要造一个黑客来打自己","为什么要造一个黑客来打自己？",[16,117,118],{},"听起来挺疯的。但逻辑很清晰。",[16,120,121,122,40],{},"现在的 AI 模型越来越强，能联网搜索、读取文件、调用工具、执行代码。能力越强，",[23,123,124],{},"攻击面就越大",[16,126,127],{},"一个网页里的恶意指令，一个邮件里的隐藏提示，一次工具调用结果里的注入——都可能把模型带偏。",[16,129,130,131,134],{},"人类红队测试当然有用，但",[23,132,133],{},"太慢了","。设计一次攻击、写测试用例、跑一轮、分析结果……而模型每周都在更新。",[16,136,137,138,40],{},"OpenAI 需要一台「攻击永动机」：",[23,139,140],{},"自动发现漏洞 → 自动生成攻击样本 → 喂给新模型训练 → 模型变强 → 再发现更难攻击的点",[16,142,143],{},"这就是 GPT-Red 存在的意义。",[11,145,147],{"id":146},"结果呢-gpt-56-快免疫了","结果呢？ GPT-5.6 快\"免疫\"了",[16,149,150],{},"效果非常直接。",[16,152,153,154,157],{},"早期的 GPT-Red 发现了一类叫「伪造思维链」的攻击，对 GPT-5.1 的成功率超过",[23,155,156],{},"95%","——几乎是百发百中。",[16,159,160,161,40],{},"到了 GPT-5.6 Sol ，同类攻击的成功率降到了",[23,162,163],{},"10%以下",[16,165,166,167,40],{},"更夸张的是直接提示注入的防御： GPT-5.6 Sol 在面对 GPT-Red 的攻击时，",[23,168,169],{},"只有 0.05%的概率失守",[16,171,172,173,176],{},"而且这些安全提升",[23,174,175],{},"没有牺牲模型能力","。GPT-5.6 并没有因为变得更\"安全\"就变笨——它只是学会了区分正常指令和恶意注入。",[11,178,179],{"id":179},"一把不对外公开的双刃剑",[16,181,182],{},"GPT-Red 不会发布给任何人使用。",[16,184,185,186],{},"OpenAI 把这个模型严格锁在内部，只用于训练自己的生产模型。他们在论文里写得很直白：",[23,187,188],{},"\"我们刻意训练出的恶意能力，必须与部署模型完全隔离。\"",[16,190,191],{},"你造了一把最强的矛，不断刺自己的盾。盾越来越坚固，矛也跟着升级。但矛永远不出门。",[11,193,194],{"id":194},"安全飞轮转起来了",[16,196,197],{},"OpenAI 在过去 6 个月里训练了一代又一代越来越强的红队模型，用在从 GPT-5.3 到 GPT-5.6 的每一版训练中。",[16,199,200],{},"每一次， Red 的攻击成功率都在单调下降。",[16,202,203],{},"他们管这叫**「安全的自我进化飞轮」**——用今天的模型攻击今天的问题，让明天的模型变得更安全。",[16,205,206],{},"AI 强化 AI 能力已经很常见了，但 AI 强化 AI 安全，这是第一次看到规模化落地。",[16,208,209],{},"对了，完整论文本周内会发出来。我会继续关注。",[16,211,212,215],{},[23,213,214],{},"封面高亮关键词",": GPT-Red, AI 黑客, 自动化红队, OpenAI 安全",{"title":217,"searchDepth":218,"depth":218,"links":219},"",2,[220,221,222,223,224,225,226],{"id":13,"depth":218,"text":14},{"id":43,"depth":218,"text":44},{"id":74,"depth":218,"text":75},{"id":114,"depth":218,"text":115},{"id":146,"depth":218,"text":147},{"id":179,"depth":218,"text":179},{"id":194,"depth":218,"text":194},"2026-07-16T00:00:00.000Z","md","#202607AI资讯",null,{},true,"/post/nezus/2026/07/openai-ai","---\ntitle: \"OpenAI造了个AI黑客，专攻自家模型\"\ndate: 2026-07-16\ngroup: \"#202607AI资讯\"\ndescription: \"7 月 15 日， OpenAI 干了一件挺\\\"自虐\\\"的事。\"\nauthor: storytelling\n---\n\n\n## OpenAI 造了个 AI 黑客，专攻自家模型\n\n7 月 15 日， OpenAI 干了一件挺\"自虐\"的事。\n\n他们发布了一个叫**GPT-Red**的 AI 模型，唯一的工作就是——**想尽一切办法攻破 OpenAI 自家的 GPT 模型**。越能搞破坏，奖励越多。\n\n你没看错。\n\nOpenAI 花了一笔「前所未有的计算资源」，专门训练了一个黑客 AI。不是用来对外攻击，而是关起门来，**24 小时不间断地攻击自己**。\n\n\n## 这个 AI 黑客有多强？\n\n先看一个数字：在一项间接提示注入攻击的测试中，人类红队专家对 GPT-5.1 的攻击成功率是**13%**。\n\nGPT-Red 是多少？\n\n**84%。**\n\n对， 6 倍以上。\n\nGPT-Red 可以伪造思维链，诱导模型上传敏感文件；可以在网页代码里藏一条隐秘指令，让 AI 助手偷偷把内部数据发到外部服务器；甚至能欺骗模型执行恶意构建脚本。\n\n而且 GPT-Red 不是一次性攻击，它会**像真人黑客一样不断迭代**——发送攻击，观察模型的反应，调整策略，再来一次。\n\n\n## 攻击自动售货机，价格改到 5 毛钱\n\n最离谱的案例在这里。\n\nOpenAI 办公室里有一台**AI 驱动的自动售货机**，叫 Vendy。GPT-Red 拿到了它的系统描述，可以模拟攻击，观察模型调用。\n\n猜猜它干了什么？\n\n**第一**，把一件贵的东西改成了最低价——0.5 美元。\n**第二**，订了一件 100 多美元的新商品，挂上去卖 0.5 美元。\n**第三**，取消了另一位顾客的订单。\n\n三个恶意目标，**全部命中**。\n\n这不是实验室模拟。GPT-Red 是在真实的、运行中的生产系统上完成了这次攻击。\n\n\n## 为什么要造一个黑客来打自己？\n\n听起来挺疯的。但逻辑很清晰。\n\n现在的 AI 模型越来越强，能联网搜索、读取文件、调用工具、执行代码。能力越强，**攻击面就越大**。\n\n一个网页里的恶意指令，一个邮件里的隐藏提示，一次工具调用结果里的注入——都可能把模型带偏。\n\n人类红队测试当然有用，但**太慢了**。设计一次攻击、写测试用例、跑一轮、分析结果……而模型每周都在更新。\n\nOpenAI 需要一台「攻击永动机」：**自动发现漏洞 → 自动生成攻击样本 → 喂给新模型训练 → 模型变强 → 再发现更难攻击的点**。\n\n这就是 GPT-Red 存在的意义。\n\n\n## 结果呢？ GPT-5.6 快\"免疫\"了\n\n效果非常直接。\n\n早期的 GPT-Red 发现了一类叫「伪造思维链」的攻击，对 GPT-5.1 的成功率超过**95%**——几乎是百发百中。\n\n到了 GPT-5.6 Sol ，同类攻击的成功率降到了**10%以下**。\n\n更夸张的是直接提示注入的防御： GPT-5.6 Sol 在面对 GPT-Red 的攻击时，**只有 0.05%的概率失守**。\n\n而且这些安全提升**没有牺牲模型能力**。GPT-5.6 并没有因为变得更\"安全\"就变笨——它只是学会了区分正常指令和恶意注入。\n\n\n## 一把不对外公开的双刃剑\n\nGPT-Red 不会发布给任何人使用。\n\nOpenAI 把这个模型严格锁在内部，只用于训练自己的生产模型。他们在论文里写得很直白：**\"我们刻意训练出的恶意能力，必须与部署模型完全隔离。\"**\n\n你造了一把最强的矛，不断刺自己的盾。盾越来越坚固，矛也跟着升级。但矛永远不出门。\n\n\n## 安全飞轮转起来了\n\nOpenAI 在过去 6 个月里训练了一代又一代越来越强的红队模型，用在从 GPT-5.3 到 GPT-5.6 的每一版训练中。\n\n每一次， Red 的攻击成功率都在单调下降。\n\n他们管这叫**「安全的自我进化飞轮」**——用今天的模型攻击今天的问题，让明天的模型变得更安全。\n\nAI 强化 AI 能力已经很常见了，但 AI 强化 AI 安全，这是第一次看到规模化落地。\n\n对了，完整论文本周内会发出来。我会继续关注。\n\n**封面高亮关键词**: GPT-Red, AI 黑客, 自动化红队, OpenAI 安全",{"title":5,"description":18},"post/nezus/2026/07/openai-ai","FCBuxBCbUj9GjP8t4RuC22pUWpedWKUp41rlnnzXWqo",[239,243],{"title":240,"path":241,"stem":242},"Hermes Desktop 安装及界面功能速览","/post/nezus/2026/06/hermes-desktop","post/nezus/2026/06/hermes-desktop",{"title":244,"path":245,"stem":246},"在Vibe Coding的过程中，不要忘记自己还有产品经理的身份","/post/posts/vibe-coding","post/posts/vibe-coding",1784715236771]