首页 > AI前沿 > Continuously hardening ChatGPT Atlas against prompt injection

Continuously hardening ChatGPT Atlas against prompt injection

OpenAI 2025-12-22 08:00 1 阅读 查看原文

OpenAI强化ChatGPT Atlas防御提示注入攻击

OpenAI正在利用基于强化学习训练的自动化红队测试,强化ChatGPT Atlas对提示注入攻击的防御能力。这种主动的“发现—修补”循环有助于及早识别新型漏洞,并在AI日益智能化的进程中加固浏览器代理的防御体系。

这一策略的核心在于将安全测试从被动响应转向主动预防,通过持续迭代的自动化攻击模拟,确保Atlas在面对不断演变的威胁时保持韧性。