尧图网站建设 尧图网络
  • 首页
  • 关于我们
  • 服务项目
  • 案例展示
  • 建站流程
  • 资讯中心
  • 联系我们
首页/资讯中心/详情

DeepSeek 的便宜模型跑赢了自家旗舰——AI 进步最快的地方,已经不是堆参数了

DeepSeek 的便宜模型跑赢了自家旗舰——AI 进步最快的地方,已经不是堆参数了
📅 发布时间:2026/8/2 18:59:27

一个 284B 的"廉价版",没换架构、没加参数,只靠重新训练,就在 9 项 Agent 测试里整体超过了自家 1.6T 的旗舰。这件事正在改写一个你以为理所当然的判断:贵的不一定是对的。

7 月 31 日,DeepSeek 做了一件反直觉的事。

他们把自家 V4 系列里最便宜的 Flash 模型重新训练了一遍——没换架构,没加参数,连模型尺寸都没动。然后,这个只有 284B 总参数的"廉价版",在 9 项 Agent 能力测试里整体超过了自家 1.6T 参数的旗舰 V4-Pro 预览版。

知名 AI 博主宝玉在 X 上的原话是:「便宜的那个模型(Flash)经过后训练调优之后,在编程和工具调用任务上反超了贵的那个模型(Pro)的预览版。」

到底发生了什么

DeepSeek-V4-Flash 正式版 API 在 7 月 31 日上线公测,版本号 0731。

这次更新最特殊的地方在于:模型本身没变,变的是训练方式。

Flash 还是那个 Flash——284B 总参数、13B 激活的混合专家架构(MoE),和 4 月份的预览版一模一样。变的是"后训练"环节:用新的指令数据、强化学习和工具使用轨迹,重新教模型怎么在实际任务里"动手"。

相当于同一个人去集训了一圈,脑容量没变,但出手突然变老练了。

DeepSeek 官方一口气公布了 9 项 Agent 基准成绩,并明确表示:正式版 Flash 在这些测试上整体超越了 V4-Pro-Preview。

9 项测试,数字有多离谱

最直观的冲击来自一个叫 DeepSWE 的基准——它专门测试 AI 能不能像真正的工程师一样,在一个真实代码仓库里定位 bug、改代码、跑测试、提交结果。

Flash 预览版的成绩是7.3。

正式版直接跳到了54.4——涨幅645%。

这不是"提升了一点",是"从不太会变成了真的能干"。

其他几项同样值得注意:

  • Terminal Bench 2.1(终端操作能力):82.7。V4-Pro 预览版是 72.1,Flash 预览版只有 61.8。

这个测试衡量的是 AI 能不能在真实的命令行环境里完成多步骤任务——不是"写一个命令给你看",而是自己跑命令、看反馈、处理报错、继续修复。

  • Toolathlon(工具编排能力):70.3。测试的是 AI 能不能从一堆工具里选对工具、按对参数、串成一条完整流程。
  • DSBench-Hard(高难度开发任务):59.6。全栈开发任务,前端后端 API 测试一起改。

这个便宜模型不只是在"写代码",而是在"跑环境"。

最反常的地方:进步不靠堆参数,靠训练方法

过去两年,AI 行业有一个近乎共识的直觉:模型越大越强。参数翻倍,能力上一台阶。

但这次 DeepSeek 做的事情恰好相反。

284B 的 Flash,总参数只有 1.6T 旗舰 V4-Pro 的不到五分之一。每次推理只激活 13B 参数,成本大约只有 Pro 的一个零头——API 定价 $0.14/百万输入 token、$0.28/百万输出 token。

按传统逻辑,它应该在旗舰面前被碾压。

但后训练改变了一切。同一个基础模型,本来可能已经"知道"Git 怎么用、Linux 怎么操作,但如果没经过足够的工具使用训练,它就会反复执行失败的命令、选对工具但传错参数。

后训练解决的不是"知不知道",而是"会不会用"。

这对开发者意味着什么:选模型的逻辑要变了

以前团队选模型的默认动作是:先用最贵最大的,跑不动了再找便宜的降级。

如果 Flash 正式版的能力可以持续验证,更合理的做法可能是反过来:大部分日常任务用 Flash 跑,反复失败或需要密集知识推理时才升级到 Pro。

这直接影响 Agent 产品的账本。一个 Agent 任务往往涉及几十轮模型推理、工具调用和错误纠正——成本不是"聊一轮多少钱",而是"成功交付一个任务总共花多少钱"。

一个单价低但老出错的模型,算下来未必便宜;一个单价更低但一次就做对的模型,才是真的省钱。

这正是我们「AI 落地账本」系列一直在追的主线:AI 的成本竞赛,已经从"谁的模型更便宜"变成"谁的便宜模型更能干活"。

对普通人意味着什么:你为 AI 付的钱,正在被重新定价

如果你不是开发者,这件事和你仍然有关。

AI 公司正在用两种方式压低成本:一是把模型做小(Flash 只激活 13B),二是把训练做精(后训练提升效率)。两条路叠加的效果是:同样能力的 AI 服务,价格正在快速下降。

你用的 AI 写作工具、代码助手、客服系统,背后的推理成本在变低。这意味着更多免费额度、更低的订阅价格、更多原本收费的功能变成标配。

但也别急着欢呼。DeepSeek 官方也承认,Flash 在复杂运动物理合理性、极多主体交互等场景上仍有短板。Agent 基准跑分高,不等于在生产环境里一定可靠——第三方复测、真实仓库任务成功率、单任务综合成本,这些数据还需要时间验证。

现在可以怎么做

  • 开发者:把deepseek-v4-flash接进你的 Codex 或 Agent 工作流试跑。Flash 正式版原生兼容 Responses API,VS Code 和 Codex CLI 可直接配置。建议先在非关键任务上对比 Flash 和 Pro 的交付成功率,再决定默认模型。
  • 创业者:如果你的产品重度依赖 AI 执行能力(而不只是对话),Flash 的成本结构值得重新算一遍账。便宜模型 + 好的训练,可能比贵模型 + 粗放调用更划算。
  • 普通用户:不用纠结用哪个模型。但记住一个判断——"贵=好"在 AI 领域正在失效,选工具时别被"我们用的是最贵的大模型"这种话术唬住。

结语

DeepSeek 这次做的事情,本质上是给整个行业提了个醒:

你可能不需要一个更大的大脑,而是需要一个训练得更好的大脑。

当 284B 的便宜模型在 Agent 任务上跑赢了 1.6T 的旗舰,"参数军备竞赛"就不再是唯一主线了。下一个值得关注的,不是谁的模型又大了多少倍,而是谁用同样的模型,训练出了更强的执行力。

相关新闻

  • 多智能体系统生产环境避坑指南:死循环与 Token 爆炸的终结方案
  • Unity命令行构建实战:从环境配置到CI/CD集成的完整解决方案
  • 开发者必知:软件专利申请的实操指南与核心误区解析

最新新闻

  • 2026河源黄金回收避坑指南:认准双资质门店,河源源奢汇为什么是首选 - 生活测评小能手
  • 树莓派reSpeaker 4-Mic阵列开发指南:从硬件解析到语音助手实战
  • 高效远程管理利器:深度解析MobaXterm中文版的专业应用
  • Unity TileMap 2D地图开发全解析:从基础到Rule Tile实战
  • Unity Tilemap高效地图编辑:从基础到高级优化全攻略
  • 如何30分钟快速部署KrillinAI:AI视频翻译配音的完整指南

日新闻

  • 怀化母婴除甲醛公司测甲醛中心怎么选:康之居母婴除甲醛标准、流程、避坑指南 - 信誉隆金银铂奢回收
  • 三步打造你的终极音乐中心:foobox-cn网络电台功能完整指南
  • Lance湖仓格式:为多模态AI工作流设计的终极数据存储方案

周新闻

  • 怀化母婴除甲醛公司测甲醛中心怎么选:康之居母婴除甲醛标准、流程、避坑指南 - 信誉隆金银铂奢回收
  • 三步打造你的终极音乐中心:foobox-cn网络电台功能完整指南
  • Lance湖仓格式:为多模态AI工作流设计的终极数据存储方案

月新闻

  • ClickHouse版本管理深度实战:4步构建零风险升级与回滚体系
  • Java 23 种设计模式:从踩坑到精通 | 番外:责任链模式 —— 物流审批流程实战
  • 华硕笔记本性能解放指南:G-Helper轻量级控制工具全面解析

关于尧图

  • 公司简介
  • 团队介绍
  • 企业文化
  • 荣誉资质

服务项目

  • 定制开发
  • 电商建站
  • UI 设计
  • 运维服务

快速链接

  • 案例展示
  • 建站流程
  • 常见问题
  • 资讯中心

联系方式

  • 📍北京市朝阳区互联网产业园 A 座 10 层
  • 📞400-888-8888
  • ✉️contact@rkmt.cn
  • 🕐周一至周日 9:00-21:00

© 2024 北京尧图网络科技有限公司 版权所有 | 京 ICP 备 XXXXXXXX 号