ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

“牛来模型”身世大揭秘!国产多模态低价大模型双开源,结尾附加限时免费GLM Coding Plan限量卡!!!!

“牛来模型”身世大揭秘!国产多模态低价大模型双开源,结尾附加限时免费GLM Coding Plan限量卡!!!! 前沿智能不再是奢侈品两个「Flash」改写成本曲线一周之内两款「Flash 系」前沿模型先后落地智谱的 GLM-5.3-Flash通义千问的 Qwen3.8-Flash。把两份官方信息放在一起读能读出同一个信号——前沿智能与前沿价格正在解绑。一、GLM-5.3-Flash同样智力1/40 价格智谱方面提到为收集广大用户的广泛、专业反馈团队在正式发布前以匿名模型Ox-Alpha中文社区称作牛来在OpenCode和OpenRouter上进行了大规模测试。Ox-Alpha迅速成为当周最受欢迎的模型创下双平台调用量新高。很长一段时间里行业有一个默认前提想要前沿能力就得付前沿价格这是技术进步必须支付的成本。今天GLM-5.3-Flash 把这个前提打碎了。能力端。320B 总参数能力超过上一代 GLM-5.2在全球权威的 Artificial Analysis Intelligence IndexAA 综合智能指数取得57 分进入全球前沿模型能力区间与 Anthropic 最受欢迎的模型Claude Opus 4.8 得分持平。在自研 Z.ai Code Bench 体感评估中其编程表现同样与 Claude Opus 4.8 相当。价格端。GLM-5.3-Flash 定价为 GLM-5.3 的1/10限时折扣内为 GLM-5.3 的1/20仅为Opus 4.8 的 1/40。把这两组数字放到同一条轴上会得到一个很刺眼的点57 分的前沿智力落在低价区间的成本上。画在 AA 智能指数的帕累托前沿上GLM-5.3-Flash限时折扣价是低价段少有的拐点——比它便宜一档能力掉得厉害比它贵一个数量级分数却只多几格。一句话同样智力1/40 价格前沿智能第一次不需要省着用。这对开发者的意义比对榜单更大。当前沿模型的单 token 成本降到 1/40过去「偶尔调用大模型」的用法可以换成「让 agent 全天挂着跑」——agentic 应用的规模上限从来不是模型能力决定的是边际成本决定的。二、更深一层国产芯片跑前沿模型如果说定价是显性层基础设施是隐性层。这次智谱走到了一步很多人没料到的地方过去一周首次在大规模流量中用国产芯片集群提供服务芯片通过自研高带宽互联网络连接。国产芯片单卡算力与内存容量相对有限核心瓶颈在内存容量与带宽——在这样一块硬件上撑住 1M 上下文长度是真问题。智谱的解法是在 SGLang 基础上构建专用推理引擎并对底层架构做激进的内存优化核心是两条交换原则以算力换带宽用冗余计算降低访存压力以通信换显存用节点内通信腾出稀缺的片上显存具体技术栈包括用于线性注意力和 LM head 的节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存量化、Layer Split等。集群层面采用生产级Encode–Prefill–DecodeEPD分离式架构把多模态编码、prompt 预填充、逐 token 解码拆成三个可独立调度、独立扩缩容的工作池。结果与同一硬件上的初始基线相比端到端服务性能提升 3 倍硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。还有一个细节值得注意整个构建工作由 GLM-5.3 驱动的 infra agent 大大加速——协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈形成「模型优化系统系统承载模型」的正向循环。模型和底座互相喂养这是这次发布里最有长期想象力的部分。这件事的意义超出一次发布它证明了国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。前沿推理不再只是「谁的英伟达多」的单变量游戏供应链自主第一次进入了第一梯队的记分牌。三、Qwen3.8-Flash每 token 只激活 6B同一周通义千问发布 Qwen3.8-Flash定位与 GLM-5.3-Flash 高度同构高效率前沿模型。它的架构参数很值得细看多模态 MoE主模型125B参数额外配备51B 的 N-gram Embedding每 token 仅激活6B参数原生支持262,144 token上下文可经 YaRN 扩展至1M定价方面API输入 1 元 / 百万 tokens输出 3 元 / 百万 tokens。已上线千问 AI 平台今晚首发上线「千问办公」。这里的设计信号是51B N-gram Embedding它本质上是用「记忆」换「计算」——把高频固定模式从激活路径里挪到查表路径上配合每 token 仅 6B 的激活量把推理成本压到极致。这和 GLM 的「以算力换带宽」殊途同归前沿能力 × 低边际成本的配方正在收敛成一套标准答案。四、「Flash」到底意味着什么行业里「Flash / Lite / Mini」的命名传统长期等于「缩水低端」。但把这次两个发布放在一起看Flash 系的定义被改写了能力基线上移GLM-5.3-Flash 以 AA 指数 57 分进入前沿区间、与 Opus 4.8 持平——Flash 不再是旗舰的小弟而是旗舰的先锋。架构路线收敛MoE 极致激活稀疏 N-gram 记忆压缩 激进量化与内存优化「前沿能力 × 低成本」的配方正在标准化。硬件叙事改变国产芯片集群 EPD 分离架构把「硬件主权」第一次带进前沿推理的一等公民名单。剥到底层正在发生的事是智能的成本正在比智能本身增长得更快下降。当一个 token 的边际成本跌破某个阈值AI 应用的形态会从「工具」变成「基础设施」——agent 可以长时间跑而不看价格这是下一张入场券。五、上手入口GLM-5.3-Flash正式面向全球开源已接入 ZCode 等编码平台同步开放 API 调用纳入 GLM Coding Plan7 天体验卡每天限量发放 10,000 张从未订阅过套餐的用户可领取所有套餐用户的体验卡数量已重置领取链接https://bigmodel.cn/activity/trial-card/PU9MTWG0PMQwen3.8-Flash千问 AI 平台https://www.qianwenai.com/models/qwen3.8-flash技术报告https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf技术博客https://qwen.ai/blog?idqwen3.8-flash-nextHugging Facehttps://huggingface.co/Qwen/Qwen3.8-Flash-NextModelScopehttps://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next以上基准数据均来自官方发布与官方对比图不同评测口径下分数可能存在差异细节以官方技术报告为准。
返回列表