GPT-5.3-Codex 是我们在 Preparedness Framework 下作为 High cybersecurity capability 对待的第一个 model,这要求额外 safeguards。这些 safeguards 包括训练 model 拒绝明显恶意的请求,例如窃取 credentials。
除了 safety training,基于 automated classifier 的 monitors 会检测 suspicious cyber activity signals,并把 high-risk traffic 路由到 cyber capability 较低的 model(GPT-5.2)。我们预计只有极小一部分 traffic 会受到这些 mitigations 影响,并正在改进 policies、classifiers 和 in-product notifications。
为什么这样做
最近几个月,我们看到 models 在 cybersecurity tasks 上的 performance 有明显提升,这让 developers 和 security professionals 都受益。随着 models 在 vulnerability discovery 等 cybersecurity-related tasks 上不断进步,我们采取 precautionary approach:扩大 protections 和 enforcement,以支持 legitimate research,同时减缓 misuse。
Cyber capabilities 天然具有 dual-use 属性。支撑重要防御工作的同一套知识和技术,例如 penetration testing、vulnerability research、high-scale scanning、malware analysis 和 threat intelligence,也可能造成现实伤害。
这些 capabilities 和 techniques 需要在可以用于提升 security 的场景中可用且更易使用。我们的 Trusted Access for Cyber pilot 让 individuals 和 organizations 可以继续使用 models 进行 potentially high-risk cybersecurity activity,而不会被中断。
它如何工作
从事 cybersecurity-related work 或类似活动的 developers 和 security professionals,如果其 requests 可能被 automated detection systems 误判,可能会被 rerouted 到 GPT-5.2 作为 fallback。我们预计只有极小一部分 traffic 会受 mitigations 影响,并正在主动校准 policies 和 classifiers。
Codex CLI 的 latest alpha version 已包含 requests 被 rerouted 时的 in-product messaging。未来几天内,所有 clients 都会支持这种 messaging。
受 mitigations 影响的 accounts 可以通过加入下面的 Trusted Access program,重新获得 GPT-5.3-Codex 访问权限。
我们认识到加入 Trusted Access 未必适合所有人。因此,随着这些 mitigations 扩展并加强 cyber resilience,我们计划在多数情况下从 account-level safety checks 转向 request-level checks。
Trusted Access for Cyber
我们正在 pilot “trusted access”,让 developers 可以保留 advanced capabilities,同时我们继续为 general availability 校准 policies 和 classifiers。我们的目标是让很少的 users 需要加入 Trusted Access for Cyber 。
要将 models 用于 potentially high-risk cybersecurity work:
Users 可以在 chatgpt.com/cyber 验证 identity。
Enterprises 可以通过其 OpenAI representative,为整个 team 请求默认 trusted access 。
可能需要访问更 cyber-capable 或 permissive models 以加速 legitimate defensive work 的 security researchers 和 teams,可以表达对 invite-only program 的兴趣。拥有 trusted access 的 users 仍必须遵守我们的 Usage Policies 和 Terms of Use 。
False positives
Legitimate 或 non-cybersecurity activity 可能偶尔被 flagged。发生 rerouting 时,responding model 会显示在 API request logs 中,并在 CLI 中通过 in-product notice 显示,随后会扩展到所有 surfaces。如果你遇到认为不正确的 rerouting,请通过 /feedback 报告 false positives。