ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

8月13日「发布夜」:DeepSeek V4 Pro、Qwen3.8、Grok 4.6 同台,Agent 与开源权重成主战场

8月13日「发布夜」:DeepSeek V4 Pro、Qwen3.8、Grok 4.6 同台,Agent 与开源权重成主战场

引言

过去一年,AI 大模型的竞争主线是「闭源旗舰越卖越贵」:更长的上下文、更强的工具调用、更复杂的 Agent 任务,往往意味着更高的 API 价格和更封闭的权重。但 2026 年 8 月 13 日的密集发布,把这条主线掰弯了——DeepSeek V4 Pro、阿里 Qwen3.8-2.4T 与 xAI 的 Grok 4.6 在同一天亮相,三者的共同关键词不是「参数更大」,而是长周期 Agent 能力。更关键的是,开源权重已经开始在核心基准上逼近闭源旗舰,同时把调用成本打到约 1/60。

对开发者来说,这意味着选型逻辑变了:不再只看榜单第一是谁,而是看「同样的任务,谁能以可控成本真正跑完」。

一、事实速览:8 月 13 日发生了什么

下表汇总了本文依赖的核心事实。所有数值均来自公开来源;无法独立核实的内容已标注。

事件关键事实来源可信度
DeepSeek V4 Pro 08138 月 12 日深夜 API 版本更新为DeepSeek-V4-Pro-0813;MoE、约 1.6T 总参数 / 49B 激活、1M 上下文、384K 最大输出;输出 6 元/MDeepSeek 官网 API 文档、腾讯科技、ai0.news官方定价+媒体转述
DeepSeek 基准Terminal Bench 2.1 87.9(Fable 5 88.0,差 0.1);CyberGym 83.3(反超 Fable 5 83.1);DeepSWE 从预览版 12.8 跃升至 62.7猎云网、腾讯科技、ai0.news厂商/媒体披露,待独立核实
阿里 Qwen3.8-2.4T-A95B8 月 13 日开放权重;2.4T 总参数 / 95B 激活;首个开放权重的 Max 级模型;Terminal Bench 2.1 从 74.5 升至 86.6腾讯科技、ai0.news官方开放权重+媒体转述
Qwen 限制开放权重无 vision 和 1M 上下文,能力保留在 Qwen3.8-Max 托管 API;BF16 权重约 4.9TB,Unsloth 1-bit 量化 397GBai0.news媒体转述
xAI Grok 4.68 月 12 日发布;长周期 Agent + 多模态视觉;Artificial Analysis Intelligence Index 61,与 GPT-5.6 Sol 持平(+5 vs 4.5);GDPVal-AA v2 1753 Elo 登顶ai0.news、今日头条厂商/媒体披露
Grok 定价输入 $2/M、输出 $6/M;高速版 2 倍;WebDev High 1618 分、第 7 名ai0.news、新浪财经官方定价+媒体转述
Claude Fable 5 定价输出约 360 元/M(媒体披露)腾讯科技、so.html5.qq.com媒体披露,待核实
中国开源下载Hugging Face 2026 春季报告:中国自研开源模型下载占比 41%,首次超过美国腾讯科技机构报告转述
Zuckerberg 长文Meta CEO 发布《The Future is for Everyone》,主张开源普惠路线XR 控/腾讯科技媒体转述
白宫框架Wired:白宫拟把自愿安全框架扩展至接近前沿能力的开放权重模型ai0.news媒体转述
Twitch 训练数据Amazon 默认把 Twitch 内容纳入 AI 训练,opt-out 模式TechCrunch(ai0.news 转述)媒体转述

三件事放在一起看,Agent 能力成为共同的主线,而权重是否开放正在成为定价和部署灵活性的分水岭。

二、DeepSeek V4 Pro:开源权重,逼近 Fable 5

DeepSeek 没有发新闻稿。8 月 12 日深夜,用户发现官网 API 定价页的deepseek-v4-pro版本号变成了DeepSeek-V4-Pro-0813

根据公开信息,正式版的关键规格如下:

  • 架构:MoE,约 1.6T 总参数 / 49B 激活参数(基于公开报道,待官方确认)。
  • 上下文:1M token,单次最大输出 384K token。
  • 模式:支持思考(默认)与非思考两种模式;API 提供普通、高推理、最高推理三档。
  • 接口:新增 Responses API 与 Codex 接入;兼容 OpenAI 与 Anthropic API 格式,保留工具调用、JSON 结构化输出、FIM 补全。
  • 价格(尚未涨价):缓存命中输入 0.025 元/M;缓存未命中输入 3 元/M;输出 6 元/M。

真正值得关注的是它的 Agent 基准:Terminal Bench 2.1 达到 87.9 分,仅落后 Claude Fable 5 的 88.0 分 0.1 分;CyberGym 83.3 分,反超 Fable 5 的 83.1 分;DeepSWE 更是从预览版的 12.8 跳到了 62.7。这些数字如果属实,说明开源权重的天花板已经与闭源旗舰几乎贴平。

三、Qwen3.8-2.4T:Max 级权重首次开放

阿里千问在同一天开放 Qwen3.8-2.4T-A95B 的权重。这是 Qwen 首次把 Max 规模模型对外开放:2.4T 总参数,95B 激活,架构采用约 3:1 的线性注意力与全局注意力混合。

重点转向 Coding Agent 与长程任务后,它的 Terminal Bench 2.1 从 74.5 升至 86.6,虽然略低于 DeepSeek V4 Pro,但已经站在同一梯队。

开放权重不等于「全能可用」。根据英文报道,开放版本不带 vision 和 1M 上下文,多模态与超长窗口仍留在托管的 Qwen3.8-Max API 后面。商用授权也是自定义的:超大规模商用需要署名或额外授权。另外,BF16 权重约 4.9TB,即使 Unsloth 的 1-bit 量化也要 397GB,普通开发者基本只能走 API 或云端部署。

四、Grok 4.6:从回答问题到完成任务

xAI(中文报道中亦称 SpaceXAI)的 Grok 4.6 是同日第三个主角。与 DeepSeek 和 Qwen 不同,Grok 4.6 不是开放权重,而是强化长周期 Agent的闭源模型。

  • Artificial Analysis Intelligence Index 61 分,与 GPT-5.6 Sol 持平,比 Grok 4.5 高 5 分。
  • GDPVal-AA v2 以 1753 Elo 登顶。
  • 输出价格 $6/M,是 DeepSeek 的约 7 倍(按汇率 7.0 折算),但也在 Grok 4.5 的价位区间内。
  • WebDev High 1618 分,排名第 7,紧随 GPT-5.6 Sol 与 Claude Fable 5 之后。

xAI 同时推出了 Grok Bot,定位为「AI 队友」:登录云端桌面、并行执行多步骤任务、学习用户工作流。它的直接竞品是 OpenAI、Anthropic 和微软的企业 Agent 产品。

一个需要注意的细节:Hacker News 上有开发者指出,Grok API 会在每次请求中注入隐藏 system prompt,且该 prompt 会覆盖用户层面的 system prompt。如果你的应用依赖自定义系统提示,发布前建议实测验证。

五、输出价格对比:开源把闭源价格打穿一个数量级

图1:输出价格对比(元/百万 token,对数刻度)。DeepSeek V4 Pro 输出 6 元/M,Grok 4.6 约 42 元/M(按汇率 7.0 折算),Claude Fable 5 约 360 元/M(媒体披露)。Grok 4.6 / Fable 5 数据为厂商或媒体口径,发布前建议复核。

这张图说明三件事:

  1. DeepSeek V4 Pro 的价格只有 Claude Fable 5 的约 1/60——如果它真的能把 Fable 5 级别的 Agent 能力稳定交付,闭源 API 的溢价空间会被大幅压缩。
  2. Grok 4.6 的价格处于中间带:比 DeepSeek 贵约 7 倍,但比 Fable 5 便宜约 8 倍。xAI 的赌注是「更快的响应 + 更强的长程任务执行」值得这 7 倍溢价。
  3. 价格差不再和能力差完全正相关。intelligence gap 在收窄,price gap 没有。

六、Terminal Bench 2.1:能力鸿沟几乎抹平

图2:Terminal Bench 2.1 自主终端操作基准。DeepSeek V4 Pro 87.9 分,仅落后 Claude Fable 5 的 88.0 分 0.1 分;Qwen3.8-2.4T 86.6 分;Grok 4.6 未披露该基准得分,未列入。数据来自厂商/媒体披露。

Terminal Bench 2.1 测的是模型在终端环境中自主操作、排障、完成多步骤任务的能力。这是当前 Agent 落地的核心场景之一。

三个模型的得分集中在 86–88 分区间。考虑到 DeepSeek 是开源权重、Qwen 是首次开放 Max 权重,这个密集分布说明:在 Agent 赛道上,开源/开放权重与闭源旗舰之间的绝对差距已经很小,剩下的差异更多体现在延迟、稳定性、多模态、长上下文和企业合规上。

七、MoE 架构:万亿总参数,数十亿激活

图3:MoE 参数规模对比(对数刻度)。DeepSeek V4 Pro 约 1.6T 总参数 / 49B 激活;Qwen3.8-2.4T-A95B 为 2.4T 总参数 / 95B 激活。基于公开报道整理,待官方确认;Grok 4.6 参数未披露,未列入。

两个开放/开源的 frontier 模型都走 MoE 路线:总参数冲上万亿级,但每轮前向传播只激活其中 3%–4%。这个设计的工程含义是:

  • 训练时可以堆容量,推理时控制显存与延迟。
  • 本地私有化部署虽然「理论上可行」,但 4.9TB 的 BF16 权重对绝大多数团队仍是云端或托管场景。
  • 对开发者来说,MoE 不再是噱头,而是把 frontier 能力塞进可控成本的结构选择

八、可复制动作:如何快速接入新模型

下面给出三个可直接粘贴执行的命令示例。{YOUR_API_KEY}请替换为实际 key;模型名称请以官方最新文档为准。

# 1) DeepSeek V4 Pro(OpenAI 兼容格式) curl https://api.deepseek.com/chat/completions \ -H "Authorization: Bearer $DEEPSEEK_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "deepseek-v4-pro", "messages": [{"role": "user", "content": "用 Python 写一个带单元测试的 Todo Agent"}] }' 2) Grok 4.6(xAI API) curl https://api.x.ai/v1/chat/completions -H "Authorization: Bearer $XAI_API_KEY" -H "Content-Type: application/json" -d '{ "model": "grok-4.6", "messages": [{"role": "user", "content": "把这段需求拆成可执行步骤并生成 MVP"}] }' 3) 拉取 Qwen3.8-2.4T 权重(发布后请到 Hugging Face 仓库确认具体 tag) huggingface-cli download Qwen/Qwen3.8-2.4T-A95B --local-dir ./qwen3.8-2.4t

如果你只是想快速跑 benchmark,建议先用 OpenRouter 的统一接口跑同一 prompt,直接看延迟、价格与输出稳定性,而不是只盯着榜单得分。

九、局限与诚实声明

  • 本文中的基准分数、参数规模、价格等多为厂商自报或媒体转述,已标注「待独立核实」。
  • Qwen3.8-2.4T 开放权重「不带 vision 和 1M 上下文」,如果你需要多模态或超长上下文,仍需使用托管 API。
  • Grok 4.6 的隐藏 system prompt 细节来自 Hacker News 讨论,未经过官方确认;生产接入前请务必实测。
  • 命令示例中的模型名称、API endpoint、CLI tag 为撰写时的公开信息,实际运行前请替换为官方 exact 名称。
  • 价格对比涉及汇率折算,Grok 4.6 的 42 元/M 按 7.0 汇率估算;Claude Fable 5 的 360 元/M 来自中文媒体披露,建议独立验证。
返回列表