출처: OpenAI Blog원문 보기 ↗
원문 저작권은 출처에 있습니다. 이 사이트는 수집, 번역 또는 형식 정리만 합니다.
사실 흐름
해설과 영향
导读摘要
OpenAI 发布内部红队系统 GPT-Red,通过攻击与防御 AI 的自我博弈机制,自动发现现有模型的安全漏洞,以提升下一代模型对提示注入等攻击的鲁棒性。
正文
这一工具的发布时机颇为微妙。就在几天前,OpenAI 推出了 ChatGPT Work,该功能允许 AI 智能体直接访问公司的文件、邮件和桌面应用。当 AI 获得如此高的系统权限时,其安全性就变得至关重要。正如相关评论所指出的,GPT-Red 的价值在于揭示 AI 如何被“欺骗”,而非仅仅被“入侵”。它探索的是一种更隐蔽的操纵风险,即攻击者无需突破代码防线,只需通过精心设计的自然语言指令就能让 AI 执行非预期的危险操作 Memeburn。OpenAI 选择将 GPT-Red 作为内部工具保密,正是为了防止其发现的攻击技巧落入真实世界的恶意攻击者手中。
从技术层面看,GPT-Red 的诞生与当前大模型面临的普遍安全挑战紧密相连。OpenAI 与 Anthropic 近期联合发布的安全评估报告指出,即便是先进的模型,在面对特定类型的越狱攻击时仍存在脆弱性。例如,GPT‑4o 和 GPT‑4.1 较容易被“过去时态”的越狱提示或轻度混淆编码所欺骗,而较新的 o3 模型虽然对此类攻击抵抗力更强,但在面对 Base64 编码或低资源语言翻译等组合攻击时仍会出现失效 OpenAI Safety Evaluation。GPT-Red 这类自动化红队系统,正是为了在模型部署前,系统性地发掘并修补这些不断演化的攻击面,将安全测试从一种间歇性的人工活动,转变为持续性的自动化流程。