今天凌晨,OpenAI 发布的 GPT-5.3-Codex 可以被视为对近期本地 Agent 工具爆发式增长的一记强有力回击——尤其是对 Anthropic 的直接回应。
配合 OpenAI 最新推出的 Codex 桌面应用,许多此前由 Skill、Cowork、Claude Code、Openclaw 等热门工具分别实现的能力,如今都可以在一个统一的环境中完成,核心由 Codex 的交互外壳与 GPT-5.3-Codex 模型本身共同驱动。
在 Codex 应用中,用户可以直接选择 GPT-5.3-Codex,并精细调节其推理深度。为了评估它在真实场景中的表现,我们给它布置了与此前测试 Cowork 时类似的任务,包括本地文件处理、格式转换、多 Skills 协同调用、生成 Word、PowerPoint、Excel 文档、下载视频,甚至是开发应用程序。
实际表现令人印象深刻。相比从零开始安装和配置 Claude Code 的复杂流程,Codex 提供了一个门槛低得多的入口,尤其对新手用户而言更为友好。这也反映了整个生态中的一个明显趋势:本地 Agent 最初大多诞生于“黑乎乎”的命令行环境,但正在逐步回归到更直观、更易用的图形化界面。
近几天,外界对 Codex 的评价也出现了明显转向。不少开发者表示已从 Claude Code 转向 Codex,一些国内的独立开发者也提到,Codex Plus 会员即可直接使用,而且不像 Claude 那样频繁遭遇无情封号的问题。
OpenAI CEO 山姆·奥特曼也毫不掩饰自己的兴奋,公开宣布 Codex 的活跃用户数已经突破 100 万。在 OpenAI 的模型更新博客中,官方同样不吝赞美之词,称 GPT-5.3-Codex 是公司第一个具备“自我构建”能力的模型,正因如此,才能以如此快的速度推出 5.3-Codex。
结合 Anthropic 使用 Claude Code、100% AI 代码、仅用两周时间构建 Cowork 的成果,以及 OpenAI 此前分享的“28 天内用 Codex 构建 Android 版 Sora”的案例,一个结论已经呼之欲出:Agent 的时代,真的来了。
用 Codex 取代 ChatGPT 和 Claude Code
和大多数本地 Agent 工具一样,Codex 的起点是工作区。用户可以创建多个 Project,每个 Project 对应一个本地文件夹,再在其中开启对话线程(Threads)。对于熟悉 ChatGPT 的用户来说,这套工作流几乎是零学习成本。
从一个最简单的例子开始,我们新建了一个空的下载文件夹,开启一个新的线程,选择 GPT-5.3-Codex,然后直接下达指令。当我们要求它下载一个来自 X 的视频时,Codex 会自动识别可用的 Skills,并调用 yt-dlp 来完成下载。即便是一个长达四个多小时的视频,Codex 也会在对话窗口中持续更新下载进度。
下载完成后,我们进一步要求它提取完整逐字稿,生成一份双语文档,并将整个流程打包成一个可复用的 Skill。随后,同一个线程还能继续完成视频剪辑、GIF 转换或格式转码,全程无需离开 Codex。
例如,我们让 Codex 将视频的第 5 秒到第 25 秒剪辑成一个新视频。得益于 GPT-5.3-Codex 快速的 token 处理能力,整体耗时并不长,更多取决于本地电脑的解码和编码性能。同样地,我们也可以让它直接把前 5 秒转成一个 GIF,限制在 10MB 以内,帧率可调,宽度控制在 640 像素。
很快,对应的 GIF 文件就生成完成了。再极端一些,Codex 甚至可以把整个视频转成图片序列——每秒 30 帧,每一帧都是一张图片。结合 GPT-5.3-Codex 在 Terminal-Bench-2 上的出色表现,这种对本地文件的直接处理能力,使 Codex 足以支撑各种生产力工具和效率工具的实现。
作为对比,刚刚发布的 Claude Opus 4.6 在 Terminal-Bench 2.0 上的得分为 65.4%,而 GPT-5.3-Codex 则达到了 77.3%。
从文件管理到完整应用
在另一项测试中,我们让 Codex 根据图片内容批量重命名文件,要求文件名不超过 20 个英文字母,且不能包含符号。重命名完成后,我们又让它将这些图片进行拼接,无论是纵向还是横向,Codex 都能通过调用合适的工具顺利完成。
和 Claude 的生态类似,Codex 同样拥有丰富的 Skills 市场。应用内已原生集成了 PowerPoint、Excel、Word、Canvas、Notion 等多种常用能力。
回到核心的编程能力上,升级后的 GPT-5.3-Codex 相比 GPT-5.2 有着明显进步。我们直接让它从零开始开发一个“每日一词”的 App。不同于 ChatGPT 的 Canvas 只能生成一个无法带走的网页预览,Codex 会在本地完整构建项目,并通过 Vercel、Cloudflare 等 Skills 进行部署。
在 Extra High 的超强推理模式下,GPT-5.3-Codex 会在每一步操作前询问下一步的选择。这种行为源于 Codex 内部的调度机制:它会根据任务需要,动态调用不同的 Skills,其中包括会自动展开多轮对话的头脑风暴模块。
最终,Codex 基本完成了最初提出的所有功能需求,并且还能进一步扩展到 macOS、iOS 和 Android 版本。如果用户已经有现成的代码项目,也可以直接在 Codex 中打开对应文件夹,让 GPT-5.3-Codex 分析项目中的 Bug,并直接进行修复。
编程模型之战的力量平衡正在改变
在相当长的一段时间里,开发者的首选往往是 Anthropic 的 Sonnet / Opus 模型,配合 Claude Code 工具。OpenAI 在复杂、长逻辑代码推理方面一度被认为有所落后。GPT-5.3-Codex 的出现,显然就是为了缩小,甚至终结这一差距。
无论是在基准测试还是实际体验中,GPT-5.3-Codex 都不仅超越了自家的前代模型,也已经显露出压制竞争对手的迹象。它真正展现出了将代码编写、测试和推理整合为一个完整流程的能力。
在 OpenAI 的发布博客中,游戏开发是一个重点案例,因此我们也让 Codex 做了一个简单的物理弹球游戏。虽然最终界面没有达到我们在提示词中期待的 RPG 风格,但整体是可运行、可游玩的。网络上也已经出现了不少用 GPT-5.3-Codex 制作的小游戏,比如类似超级玛丽的收集金币玩法。
没有绝对赢家,只有更快的轮回
从 Anthropic 的视角来看,OpenAI 今天的动作或许并不陌生。近几年,OpenAI 在技术路线上的确多次紧随 Claude 的脚步:Claude 深耕代码能力时,OpenAI 把重心放在 Sora、日报、浏览器、ChatGPT Agent 等方向,反响有限,于是重新回到代码赛道;Anthropic 在 1 月初推出 Cowork,OpenAI 便在 2 月初发布 Codex 应用。
时间点也凸显了双方的竞争关系。凌晨 1 点 45 分,Anthropic 在 X 上发布 Claude Opus 4.6;不久之后,OpenAI 端出了 GPT-5.3-Codex。两款模型的目标其实高度一致——为 Agent 提供更强的底座能力。话术已经从“vibe coding”演进到一个更直白的事实:Agent 想做好事,本质上还是要“代码写得好”。
虽然 Opus 4.6 在 Terminal-Bench 2.0 和 SWE-Bench 上不如 GPT-5.3-Codex,但它通过将上下文窗口拉长到史无前例的 100 万 token 进行了补偿,而且从整体 benchmark 表现来看,差距并没有被无限放大。
Anthropic 也暗示,真正的杀手锏还没登场——Sonnet 5 才是他们眼中的“真功夫”。
一些早期用户测试进一步强化了这种张力。有开发者表示,Opus 4.6 只用一次调用,就完成了整个代码库的重构,把原本混乱不堪的“屎山”全部模块化;也有人让 Opus 4.6 和 4.5 玩同一款经营游戏,结果是 4.6 在前期花更多时间制定策略,但最终在等级、财富和装备上全面领先。
还有开发者用 Opus 4.6 做了一个宝可梦克隆游戏,称这是他用 AI 做过最酷的项目。根据描述,Opus 4.6 思考了 1 小时 30 分钟,消耗了 11 万个 token,只迭代了三次。
在 Anthropic 官方演示和用户反馈中,Opus 4.6 还展现了强大的项目管理能力:它能在一天内自主关闭 13 个 issue,并将另外 12 个 issue 准确分派给合适的人类成员。类似于 Kimi K2.5 的智能体蜂群,Opus 4.6 也能管理大规模代码库,在 Claude Code 中组建 Agent Teams,让多个 AI 分工协作,有的写代码、有的 Review、有的测试,整体效率最高可提升 2.5 倍。
模型越强,用户越强
从更宏观的角度看,这一切就像一个轮回:先是 Gemini 出风头,然后是 Claude,如今看起来又轮到了 OpenAI,甚至不排除接下来是 Grok。但在这个轮回中,作为用户的我们,能清晰感受到 AI 能力在持续增强。
目前,OpenAI 尚未开放 GPT-5.3-Codex 的 API,理由是模型能力过强,存在较高风险,仍在评估如何安全启用。而 Claude Opus 4.6 已经可以通过 Claude 通用聊天应用、Claude Code 以及 API 多种方式使用。
作为今年海外“御三家”首批亮相的两款重磅模型,GPT-5.3-Codex 和 Claude Opus 4.6 都非常值得一试。展望未来,围绕 Agent 的能力升级、让 Agent 真正为我们做事,仍将是大模型演进的核心方向。

.jpg)

