GPT-5.2-Codex 深夜发布
OpenAI 刚刚推出 GPT-5.2-Codex——这是迄今为止最强的智能体编程模型之一,专为复杂、真实世界的软件工程而设计。
从命名就能看出,GPT-5.2-Codex 是在 GPT-5.2 基础上的进一步优化版本,并在多个关键方向带来显著升级:
它强化了上下文压缩能力,更适合长时间运行的任务,不容易“断线”。
它在大型代码变更(如重构、迁移)上的表现更稳、更强。
它在原生 Windows 环境下的编程与智能体执行能力明显提升。
同时,OpenAI 强调其具备目前为止最强的网络安全相关能力。
奥特曼表示,OpenAI 团队已经在内部使用,并取得了很不错的效果。
在基准测试中,GPT-5.2-Codex 在软件工程与终端测试任务上,超过了 5.1-Codex-Max、GPT-5.2 与 GPT-5.1。
OpenAI 也在多处强调安全能力提升。一个近期案例中,安全研究员使用 GPT-5.1-Codex-Max 与 Codex CLI,在研究过程中据称发现了一个可能导致 React 源码暴露的问题,体现了这类工具对防御性安全研究的加速作用。
从今天起,所有付费用户都可使用 GPT-5.2-Codex,API 预计将在未来几周开放。
长跑型编程能力:更稳、更省、更持久
从定位上看,GPT-5.2-Codex 更像一次“强强联合”。
它继承了 GPT-5.2 擅长的专业任务处理能力,同时吸收了 5.1-Codex-Max 在智能体编程与终端工作流方面的优势。
因此,它在长上下文理解、工具调用、事实准确性与原生上下文压缩等方面都有明显提升,能够更稳定地支撑长时间编程任务,并在推理时更节省 token。
在业内基准中,GPT-5.2-Codex 据称在 SWE-Bench Pro 与 Terminal-Bench 2.0 上取得了 SOTA,并相对 5.1-Codex 约有 6% 的提升。
这些测试主要用于衡量模型作为“智能体”在真实终端环境中处理多样任务的能力。
与此同时,它的 Windows 原生智能体编程表现也进一步增强,延展了 5.1-Codex-Max 引入的能力范围。
这些改进让 Codex 能够在大型代码库中持续工作并保持完整上下文,使其更可靠地完成大规模重构、迁移、功能开发等复杂任务——即便中途方案调整或出现失败,也更不容易迷失方向。
更强的“视觉理解”,更贴近真实开发输入
GPT-5.2-Codex 的多模态理解也进一步加强。
开发者可以直接提供截图、示意图、图表、UI 界面等输入,模型对这些内容的理解更准确。
它甚至能够读取设计稿并快速生成可运行的原型,团队可在此基础上不断迭代打磨,直至满足上线标准。
三次跃迁:朝真实世界能力更进一步
OpenAI 在一项核心安全评估中描述了能力的阶段性跃迁:
GPT-5-Codex 带来第一次显著提升。
GPT-5.1-Codex-Max 带来第二次提升。
GPT-5.2-Codex 则实现第三次跃迁。
OpenAI 认为这一趋势仍会持续,并表示其规划假设未来模型可能接近 Preparedness Framework 所定义的“高”级安全能力层级——但 GPT-5.2-Codex 目前尚未达到该等级。
真实安全案例:从披露到发现
12 月 11 日,React 团队披露了与 React Server Components 相关的三个安全问题。
Stripe 旗下 Privy 的首席安全工程师 Andrew MacPherson 借此测试当下 AI 编程智能体的能力。在使用 GPT-5.1-Codex-Max 与 Codex CLI(以及其他智能体)复现与研究的过程中,他据称在调查中额外发现了一个关键风险点,并以负责任方式向 React 团队报告。
这说明:在谨慎、合规、以防御为目标的前提下,先进 AI 系统能够显著加速对广泛使用软件的安全研究与排查。
网友实测:反馈不一
有开发者在某些模拟类任务上测试失败。
也有人认为它能生成观感精美的动画效果,与主流竞品同级。
此外还有对游戏原型构建表现亮眼的反馈。
总体而言,OpenAI 将 GPT-5.2-Codex 视为 AI 在真实软件开发与防御性安全领域迈出的重要一步:让开发者更轻松处理复杂、耗时的工程任务,也为安全研究提供更强的工具支持。



