
8 月 26 日晚到 27 日国产开源模型扎堆上新阿里通义千问开源了多模态 MoE 模型 Qwen3.8-Flash-Next被看作 Qwen4 架构的早期预览版同一天千问办公首发上线 Qwen3.8-Flash 标准模式智谱也开源了原生多模态模型 GLM-5.3-Flash。这波里最值得聊的是 Qwen 系列——它把稀疏做到了一个新高度。这组数字到底说了什么Qwen3.8-Flash-Next 的核心参数据报道是这样的总参数约 1250 亿125B另配约 510 亿参数的 N-gram 嵌入表每个 token 实际激活的参数只有约 60 亿6B48 层网络MoE 层 512 个专家top-10 路由原生 256K 上下文通过 YaRN 技术扩展到 1M训练成本约为上一代 Qwen3.7-Plus 的九分之一据报道API 定价据报道输入约 1 元/百万 tokens、输出约 3 元/百万 tokens技术本质上有两个变化值得注意。一是激活参数和总参数的差距被拉大到了约 20 倍。稀疏 MoE 不是新东西但 125B 权重、6B 激活这种比例意味着大部分知识躺在权重里但计算时用不到——本质是用内存换容量。N-gram 嵌入表就是典型它驻留在系统 DRAM 里异步预取几乎不增加计算开销等于把模型的容量和算力拆开。翻译成大白话模型越来越像大存储 小计算的组合这是推理成本下降的关键。二是成本模型变了。训练成本降到前代的九分之一据报道API 单价打到输入 1 元/百万 token 的级别据报道。对做 Agent、批量文档处理的人来说Token 成本从要省着花变成可以放开用量变会带来应用形态的质变——以前不敢让 AI 反复重试的流程现在可以放开重试了。没变的是产品思路开源加 API 双轨Flash 走量、旗舰兜底。千问办公把模型分成标准/高级两档报道称标准模式覆盖 95% 日常任务、5% 复杂任务留给高级模式就是这个逻辑的落地。报道还说千问办公标准模式单任务生成速度提升约 100%、Token 消耗平均减少 75%。怎么用、怎么选接入 API 最快。阿里云百炼DashScope提供 OpenAI 兼容接口可直接用现成的 OpenAI SDK真实接口模型名以平台为准fromopenaiimportOpenAI clientOpenAI(base_urlhttps://dashscope.aliyuncs.com/compatible-mode/v1,api_key你的API-KEY,)respclient.chat.completions.create(modelqwen3.8-flash,# 以控制台实际模型名为准messages[{role:user,content:用一句话解释MoE}],)print(resp.choices[0].message.content)**想本地部署也有路。**据报道 SGLang 发布当天就给了 Day-0支持启动方式大致是参数以官方文档为准 bash pip install sglang python-m sglang.launch_server--model-path Qwen/Qwen3.8-Flash-Next--port30000几个容易踩的坑别被6B 激活误导。激活 6B 说的是单 token 的计算量不是显存需求。总权重是 125B 级别加上 510 亿参数的 N-gram 表本地部署对显存/内存的要求并不低消费级显卡大概率要量化或 offload动手前先看官方硬件要求。评测分不等于业务效果。“6B 激活击败 Claude Opus 4.6 Max”据评测报道是榜单口径自己业务的 Agent 链路要拿真实数据说话复杂任务该上旗舰就上旗舰。1M 上下文是上限不是默认。长上下文意味着更高的内存占用和延迟别一上来就全量灌文档先测精度再决定怎么切。价格以平台定价页为准。上面说的 1 元/3 元是报道口径不同时段、不同套餐可能有差异。对打工人的实际意义这波开源模型把AI 干活的单位成本又压低了一截。批量文档、报表初稿、代码审查这类活交给标准模式完全不心疼积分和 token人只需要做校验和拍板。对做 AI 应用的公司建议把成本模型按新价格重算一遍——原来跑不起的方案现在可能跑得起了。结尾稀疏化加内存换容量大概率是这轮大模型降本的主战场。你会在生产环境里用 Qwen3.8 系列吗还是会继续观望评论区聊聊。