大家好,我是老张。
先问个扎心的问题:你让 AI 写代码的时候,它到底是在"干活",还是在"表演干活"?
老张自己的体验是,很多模型聊天挺溜,一让它改个真实仓库、跑个完整流程,就开始露馅——不是漏了边界条件,就是把接口参数搞错,最后还得自己吭哧吭哧修到凌晨。
所以判断一个 Agent 强不强,别听它吹,得看它在真实软件工程基准上的分数。今天 DeepSeek V4 Pro 正式版上线,恰好最值得看的就是这块。
一、发生了什么
一句话:deepseek-v4-pro 模型版本更新为 DeepSeek-V4-Pro-0813,调用方式完全不变。
对,还是那个模型名 deepseek-v4-pro,你的代码一行不用改,就能自动用上最新版本。老张最烦的就是换个版本还得改一堆配置,这次官方干得挺利索。
顺带说一句,deepseek-v4-flash 也更新到了 DeepSeek-V4-Flash-0731,同样调用不变。之前 Flash 正式版上线时老张聊过它原生支持 Codex,这次 Pro 也跟上了。
二、性能到底涨了多少
别的不扯,直接上官方 Agent 基准测试的数(DeepSeek-V4-Pro-0813 vs 预览版):

| 基准 | 得分 | 变化 |
|---|---|---|
| Terminal Bench 2.1 | 87.9 | 较预览版提升 |
| Cybergym | 83.3 | 超越 Claude Fable 5 |
| Toolathlon-Verified | 74.1 | 较预览版提升 |
| DSBench-FullStack | 71.1 | 较预览版提升 |
| DeepSWE | 62.7 | 预览版仅 12.8,涨近 5 倍 |
| NL2Repo | 61.5 | 较预览版提升 |
| AutomationBench (Public) | — | 超越 Claude Fable 5 |
最扎眼的是 DeepSWE——这是个考验"长周期、高复杂度真实软件工程"的基准,预览版只有 12.8 分,正式版直接干到 62.7,涨了近 5 倍。这个数字意味着它不是"会做选择题",而是真的能在复杂代码仓库里把活干完。
另一个信号是,在 Cybergym(安全智能体)和 AutomationBench(工作流智能体)上,V4 Pro 正式版的表现直接超过了 Claude 对标旗舰 Fable 5。
对运维和开发者来说,还多了几个实用的能力:支持 JSON 结构化输出、工具调用、Responses API 和 Anthropic API 格式。换句话说,你能用它接更多现成的 Agent 框架和工具链。
老张提醒一句:基准测试反映的是特定评测设置下的表现,实际效果还看任务类型、提示词和推理预算。分数是参考,不是承诺。
三、Pro 原生支持 Codex 了
这是老张觉得最实在的一点。
以前给 Codex 接国产模型,最大的坎是协议不兼容——Codex 走 OpenAI 的 Responses API,国产模型走 Chat Completions,两套东西对不上,你直接改 Base URL 大概率报 404,得在本机跑一层代理做协议翻译,麻烦不说还容易踩坑。
现在 DeepSeek V4 Pro 官方原生支持了 Responses API,意味着 Codex 可以直连 DeepSeek,中间那层代理可以省了。
官方直接给了一键脚本 codex-deepseek-setup.sh。跑起来之后是个菜单,现在你能看到:
Codex DeepSeek Setup v1.1.0
Codex 目录: /Users/xxx/.codex
请选择要执行的操作:
1. 修改 Codex 配置,使用 deepseek-v4-flash 模型
2. 修改 Codex 配置,使用 deepseek-v4-pro 模型
3. 恢复默认的 Codex 配置(删除 deepseek 相关配置)
注意选项 2——deepseek-v4-pro 已经能选了。在这之前,官方文档里明确写着"当前只有 Flash 支持 Codex,Pro 预计 8 月初支持",现在这个"预计"落地了。
脚本会帮你写好 ~/.codex/models.json 和 config.toml,输入 API Key 回车就行。想切换模型再跑一遍,想还原选 3。脚本地址在 DeepSeek 官方文档的「Agent 工具接入指南」里,直接去复制即可。
老张实测建议:跑之前先确认 Codex CLI 或桌面端至少启动过一次,让它生成好 ~/.codex 目录;另外脚本会动你的 config.toml,如果你原来配过 plugins、MCP 或项目信任,记得先备份一下。
四、老张怎么看
几点实话:
1. 这次更新最值钱的不是跑分,是落地。
DeepSWE 涨近 5 倍 + 原生 Codex,说明 DeepSeek 在"让 Agent 真干活"这条路上是动真格的,不是刷个 MMLU 就完事。
2. 免中转代理,省的是维护成本。
少一层代理,就少一个会挂的环节。对个人和小团队来说,这事儿的价值不亚于模型变聪明。
3. 价格还没定,别急着下结论。
官方目前还没公布 V4 Pro 的 API 定价,此前也预告过近期会整体调整定价。想上生产的,建议先关注官方正式通知,别拿现在的价格当长期承诺。
4. 网页端和 API 端有差异的反馈。
社区里有网友提到网页端和 API 调用出来的思维链表现有差异,API 输出的话术偏生硬。如果你觉得 API 效果不对劲,可以留意下这个点,等官方后续优化。
五、适合谁用
| 场景 | 推荐程度 |
|---|---|
| 用 Codex 写代码、想换国产模型的 | ⭐⭐⭐⭐⭐ |
| 搞 Agent 自动化、工具调用的开发者 | ⭐⭐⭐⭐⭐ |
| 对成本敏感的中小团队 | ⭐⭐⭐⭐ |
| 需要极低延迟的实时交互场景 | ⭐⭐⭐(并发上限 500,低于 Flash 的 2500) |
六、资源
- DeepSeek API 文档(首次调用):https://api-docs.deepseek.com/zh-cn/
- Codex 接入指南:https://api-docs.deepseek.com/quick_start/agent_integrations/codex
- 更新日志:https://api-docs.deepseek.com/zh-cn/updates
聊聊你的方案
评论区见:
- 你现在写代码用哪个模型当主力? DeepSeek、还是别的?
- 给 Codex 接国产模型,你踩过协议不兼容的坑吗?
- 如果 AI 能再帮你干一件事,你最希望是什么?
老张先说:我挺期待 DeepSWE 这种"真实工程"基准以后能更普及——跑分吹得再响,都不如看它能不能把一个真实仓库从头改到尾。
你怎么看?留言区聊聊。