ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

AppenTalk | GPT-Red:AI 自动攻防,能替代人类红队吗?

AppenTalk | GPT-Red:AI 自动攻防,能替代人类红队吗? 当 AI 系统开始自主浏览网页、读取邮件、调用工具攻击面也在同步扩大。将恶意指令隐藏在网页、文件或工具中的提示注入Prompt Injection已成为大模型安全面临的最棘手挑战之一。对此OpenAI 的解决方案是让 AI 攻击 AIGPT-Red 通过自我对弈强化学习在与防守模型的持续攻防中自主进化自动发现漏洞并生成训练数据来加固模型。本期 AppenTalk一起来探讨。自我对弈GPT-Red 的训练机制GPT-Red 采用自我对弈强化学习框架进行训练。在每一轮攻防环境中系统会定义一个清晰的威胁模型Threat Model。GPT-Red 因成功触发模型失效而获得奖励防守模型则因抵御攻击并完成原始任务而获得奖励。这种双向激励驱动攻防双方在浏览网页、读取邮件、编辑代码等多样化任务环境中同步进化。防守方越强攻击方必须探索更隐蔽、更有效的攻击方式。OpenAI 报告称GPT-Red 的训练投入了与其最大规模后训练Post-Training相当的算力资源。GPT-Red 的关键成果OpenAI 披露的数据显示GPT-Red 在多个维度上取得了显著成果。在针对间接提示注入Indirect Prompt Injection的基准测试中GPT-Red 对 GPT-5.1 的攻击成功率达 84%。GPT-Red 还发现了研究人员此前未见过的攻击类型——“假性思维链”攻击Fake Chain-of-Thought Attack通过向模型的推理过程注入伪造信息使模型误以为虚假结论已经过自我验证。该攻击对 GPT-5.1 的成功率一度超过 95%。在针对 Agentic System 的测试中GPT-Red 在模拟环境中演练后成功攻击了部署在 OpenAI 办公室的 AI 售货机 Agent包括将高价商品降至 0.5 美元、取消其他顾客订单等。未解决的问题GPT-Red 的成果令人瞩目但仍需审慎对待。OpenAI 的研究基于内部或内部复现的测试环境攻击集、评分机制、置信区间等细节尚未公开披露。更重要的是在一种优化循环中获得的鲁棒性在新的语言、模态、交互长度、工具和部署环境下未必能够保持。OpenAI 也明确表示将继续将 GPT-Red 与人类红队、第三方红队、多层次防护和实时监控相结合。澳鹏的“同一模型 不同弱点”研究对此提供了实证在 363 个文本和多模态对抗场景中通过从匹配的母语者评审组中收集 52,272 条危害评分和攻击成功判定发现 -模型的安全排序在不同语言间并不一致。这表明语言与模态不应被作为独立的测试维度它们的交互会同时改变绝对攻击成功率和相对模型排名GPT-Red 证明了自动化对抗能够生成有价值的提示注入训练数据并迁移到新场景但并未消除对独立评估的需求。这也为我们提出了安全评估的下一个难题当威胁模型、语言、模态、交互模式、系统框架和评估机制全部变化时鲁棒性是否还能保持ReferencesOpenAI unveils GPT-Red to harden GPT-5.6 against attacksGPT-Red beat human red teamers on a prompt injection testOpenAI details GPT-Red, an AI that attacks its own models to find flawsMeet GPT-Red: an LLM super-hacker OpenAI built to make its models safer人類紅隊成功率僅 13%GPT-Red 達 84%OpenAI 如何讓 AI 攻擊 AI、強化下一代模型
返回列表