尧图网站建设 尧图网络
  • 首页
  • 关于我们
  • 服务项目
  • 案例展示
  • 建站流程
  • 资讯中心
  • 联系我们
首页/资讯中心/详情

Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试

Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试
📅 发布时间:2026/7/22 15:33:38

Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M token 上下文窗口。

在能力方面,Inkling 面向通用智能、Agent、工具调用以及复杂推理任务进行了优化,同时支持 MTP(Multi-Token Prediction)等推理加速技术,可结合 vLLM、SGLang 等主流推理引擎进行部署。

1. 登录 GPUStack 选择推理后端

测试环境:

  • 8 × H20-141G

2. 添加版本

点击添加版本(Add Version)

镜像名称:

vllm/vllm-openai:nightly

3. 点击部署,开始部署

Node 0 参数

--trust-remote-code --tokenizer-mode=inkling --kernel-config.enable_flashinfer_autotune=False --tensor-parallel-size=8--data-parallel-size=2--data-parallel-size-local=1--enable-expert-parallel --data-parallel-rpc-port=13389--data-parallel-address=10.91.3.213 --data-parallel-hybrid-lb --max-model-len=131072--max-num-seqs=10--enable-auto-tool-choice --tool-call-parser=inkling --speculative-config'{"method":"mtp","num_speculative_tokens":1}'--reasoning-parser=inkling

环境变量:

PYPI_PACKAGES_INSTALL=scipy==1.18.0-ihttps://mirrors.aliyun.com/pypi/simple/

Node 1 参数

--trust-remote-code --tokenizer-mode=inkling --kernel-config.enable_flashinfer_autotune=False --tensor-parallel-size=8--data-parallel-size=2--data-parallel-size-local=1--data-parallel-start-rank1--enable-expert-parallel --data-parallel-rpc-port=13389--data-parallel-address=10.91.3.213 --data-parallel-hybrid-lb --max-model-len=131072--max-num-seqs=10--enable-auto-tool-choice --tool-call-parser=inkling --speculative-config'{"method":"mtp","num_speculative_tokens":1}'--reasoning-parser=inkling

环境变量:

PYPI_PACKAGES_INSTALL=scipy==1.18.0-ihttps://mirrors.aliyun.com/pypi/simple/

模型进入 Running 状态后,可以直接通过 GPUStack 试验场进行交互测试。

在默认配置下,Inkling 输出速度达到80+ Tokens/s,能够正常完成多轮文本对话,并支持思考过程解析。

同时支持原生多模态能力。

4. 测评

测试配置:

  • Input Length:64K
  • Output Length:3K
  • Requests:10

测试结果如下:

指标结果
Output Token Throughput56.10 tok/s
Peak Output Throughput78.00 tok/s
Total Token Throughput1253.09 tok/s
Mean TTFT92.77s
Mean TPOT97.09 ms/token

在长上下文输入场景下,Inkling 可以稳定完成 64K 上下文推理任务,并保持持续输出能力。

相关新闻

  • 从ChatGPT写Hello World到生产环境API上线:一个需求的12小时AI开发实录(含完整日志与耗时拆解)
  • 【会议征稿通知 | 深圳理工大学主办 | ACM出版 | EI 、Scopus稳定检索】第三届智能计算与数据分析国际学术会议(ICDA 2026)
  • TI TMS320TCI6484/C6457 DSP硬件设计:电源、时钟与配置实战指南

最新新闻

  • 秘鲁传统三大支柱产业布局与新兴数字经济发展态势
  • Claude Skills全解析:现代开发者工具箱与实战技巧
  • 5步实现Windows自动化部署:unattend-generator让IT运维效率提升300%
  • 嵌入式系统PRCM模块深度解析:时钟、电源与复位管理实战指南
  • 系统集成项目管理工程师教程(第3版)笔记——第11章:规划过程组
  • 郑州二七奢侈品回收|LV 香奈儿包包,劳力士欧米茄名表上门回收 - 逸程奢侈品回收中心

日新闻

  • AI云原生实战05-金融AI上云最难的不是技术,是“不出事“——TCE银行风控架构拆解
  • 2026年GEOSEO优化公司选型深度测评:五大硬核标准严选,这六家重塑搜索增长新格局 - 品牌前沿专家
  • **核验!2026年7月卡地亚香港**售后网点地址及服务电话公告 - 卡地亚服务中心

周新闻

  • SaaS软件行业GEO实践:AI搜索时代的品牌可见性与获客新路径
  • 什么是PCTFE?医药高端包装的“防潮王牌“材料
  • 【JVM调优实战】16-可视化利器-JConsole-VisualVM-JMC

月新闻

  • 2026年6月公司网站搭建最新热门渠道测评:四大低成本/零代码平台对比+避坑
  • 【Linux】Linux arm 编译QT程序,出现expected “}“报错
  • 【MATLAB例程】四基站二维AOA定位与距离辅助增强对比仿真。基于角度观测和测距修正的固定目标平面定位精度分析

关于尧图

  • 公司简介
  • 团队介绍
  • 企业文化
  • 荣誉资质

服务项目

  • 定制开发
  • 电商建站
  • UI 设计
  • 运维服务

快速链接

  • 案例展示
  • 建站流程
  • 常见问题
  • 资讯中心

联系方式

  • 📍北京市朝阳区互联网产业园 A 座 10 层
  • 📞400-888-8888
  • ✉️contact@rkmt.cn
  • 🕐周一至周日 9:00-21:00

© 2024 北京尧图网络科技有限公司 版权所有 | 京 ICP 备 XXXXXXXX 号