尧图网站建设 尧图网络
  • 首页
  • 关于我们
  • 服务项目
  • 案例展示
  • 建站流程
  • 资讯中心
  • 联系我们
首页/资讯中心/详情

Microsoft 提出 Resource2Skill:把人类教程蒸馏成 Agent 真能执行的多模态技能库

Microsoft 提出 Resource2Skill:把人类教程蒸馏成 Agent 真能执行的多模态技能库
📅 发布时间:2026/7/26 3:45:28

Skill 的价值不在于给 Agent 多塞一段提示,而在于把人类经验变成可检索、可验证、可执行、可复用的程序性知识。

让 Agent 做一张专业幻灯片、一个多表联动的 Excel 仪表盘或一段 Blender 场景,难点往往不是“知道答案”,而是知道 先做什么、调用什么工具、检查什么中间状态。这些步骤藏在人的教程、演示和成品里,却很难直接塞进上下文。

Resource2Skill 的关键动作,是把视频、代码库、文章和参考成品蒸馏为 层级多模态 Skill Wiki。Agent 不再被动检索一段相似文字,而是先浏览技能树,再选择带文字、视觉和代码视图的技能,最后通过 MCP 接到真实软件后端执行。它把“参考资料”推进成了“可运行的程序性记忆”。

💡 一句话总结 本文提出 Resource2Skill,将人类多模态资源蒸馏为层级可执行技能,使七域平均总分较无技能 Agent 提升 11.9 个百分点。

+11.9

平均提升 / pp

26/28

胜过强 Harness

+21.6

新能力在线补齐 / pp

HIGHLIGHTS · 本文看点

01

教程如何变成可执行技能

02

层级、多模态与选技为何有效

03

强提升背后的失效边界

01

PROBLEM

Agent 缺的不是更多资料,而是可复用的“做法”

想象你让 Agent 做一份十页路演。它可能知道什么叫“信息层级”,也能写出标题和要点,却不知道 页面节奏如何变化、图表该怎样落位、失败后应检查哪里。论文把这类可重复调用的流程性知识称为 Skill:它包含任务分解、工具或 API 模式、中间状态检查和故障恢复。

现有技能库通常来自专家手写、Agent 自己的交互轨迹,或纯文本与代码资源。问题在于,很多商业软件的隐性知识最自然地存在于 教程视频:点击顺序、前后视觉变化、节奏、空间布局和参数调整,都比一段说明文字更完整。只把视频压成摘要,恰恰会丢掉视频最有价值的时序与感知信号。

— 图 1|从多模态资源到 Skill Wiki,以及七类软件创作域的代表性结果。

把“看教程”改造成“调用技能”

Resource2Skill 不让 Agent 在任务时反复观看原始视频,也不把整个代码仓库硬塞进上下文。它先离线抽取程序性信号,再统一写入技能条目;当任务出现时,只暴露少量候选技能。这个设计同时解决 原始资源太长 和 文本摘要太薄 两个问题。

「资料告诉 Agent“是什么”,Skill 进一步告诉它“怎么做、何时用、如何验证”。」

02

METHOD

一条流水线,把多模态资源蒸馏成 Skill Wiki

— 图 2|Resource2Skill 的构建、组织、选择、执行与评测全流程。

第一步:按模态抽取真正可执行的证据

输入来自四类资源:教程视频、代码仓库、文章、参考成品。系统对视频采样关键帧,对仓库定位代码区域与参数签名,对文章切分段落,对成品做图像预处理,再由视觉语言模型生成结构化技能候选。每个候选技能被组织为路径 p、文本视图、视觉视图、代码视图和元数据 m。

第二步:五道确定性质量门

•完整性

必填字段、最小正文长度和至少一种内容模态必须存在。

•可追溯性

来源路径或视频链接必须能在连接器清单中解析,方便审计与回查。

•去重

根据域、来源路径和抽取节点生成稳定技能 ID,并辅以同源规范化名称检查。

•模态一致性

元数据声称存在的文本、视觉或代码文件,都必须在磁盘上真实存在。

•结构可执行性

带代码的技能要在沙箱中导入、运行并产出非空结果;未通过者只能作为参考技能。

这里有一个容易被忽略的细节:质量门不是另一个 LM-as-a-Judge,而是 规则化、可复现的确定性检查。模型负责蒸馏,规则负责结构与执行层面的验收。这让 Skill Wiki 更像可维护的软件资产,而不是一堆未经验证的提示词。

03

RETRIEVAL

MetaBrowse:先走技能树,再让模型挑组合

层级结构不是目录装饰,而是检索先验

不同软件域使用不同分类树:PPT 按布局、字体、配色和动效组织,Blender 按几何、材质、灯光和构图组织。给定任务 q,MetaBrowse 先用 BM25 在技能名称、标签、适用性说明和 分类路径 p(s) 上取 K=20 个候选,再让语言模型选出最多 n=5 个技能进行组合。

第二阶段做的是 子集选择,不是简单排序。模型可以组合互补技能,也可以在候选都不合适时选择零个,退回自由代码路径。这样,系统把“语义相似”与“任务适配”拆开:前者缩小搜索区,后者判断技能是否真的能一起完成当前任务。

执行层只保留一个统一接口

Wiki 侧提供分类浏览、技能卡片、按模态读取与搜索;软件侧则提供统一 apply 动作和域能力清单。带代码技能可直接对真实 MCP 后端执行,中间不再让语言模型把代码“翻译一次”。仅作参考的技能仍能提供文字和视觉依据,由 Agent 自行改写实现。

论文还把上下文账算得很清楚:五个核心域中,单技能平均约 4,332 tokens;候选筛选消耗约 4K–10K,五个完整技能约 22K,总技能上下文约 26K–32K tokens。由于 K 和 n 固定,技能库继续扩容并不会线性撑大推理上下文。

04

RESULTS

主结果:技能带来的提升,不只是 Harness 红利

— 表 1|四种模型后端、七个创作域上的主结果。Overall 为五个域内维度的等权平均。

主比较覆盖 7 个软件创作域 × 4 个模型后端,每个域使用匹配的 N=80 任务。跨 28 个模型—领域单元,w Skills 全部胜过同模型的 w/o Skills:平均总分从 45.0% 升至 56.8%,提升 11.9 个百分点。

更关键的是,作者没有只拿“裸 Agent”作对照,还加入 ClaudeCode-H 与 Codex-H 两个现成 Agent Harness。Resource2Skill 在 28 个主聚合单元中有 26 个超过更强的 Harness 基线;仅 GPT-5.5 的 Web 和 GPT-5.4 Nano 的 PPT 两格落后,而且差距都不到 1 个百分点。主要增益来自被检索和组合的 Skill Wiki,而不是执行外壳本身。

不同域的收益并不均匀

以 GPT-5.4 为例,平均分从 51.9% 升至 66.9%,提升 15.0 个百分点。其中 UE5 从 29.1% 升至 67.3%,增加 38.2 个百分点;Excel 增加 17.8,Blender 增加 14.6,Web 增加 13.7。Reaper 只增加 4.1,说明模型本身对音频制作已有较强先验,技能的边际空间更小。

论文报告的配对单元中,w Skills 相对 w/o Skills 的差异均达到 Wilcoxon p<10⁻³。人类盲评包含 200 个独立评分;排除平局后,w Skills 的胜率为 85.5%。这两组证据共同说明提升不是由少量漂亮案例撑起来的。

05

ABLATION

为什么有效:规模、模态、来源和选技缺一不可

— 图 3|技能池规模曲线,以及无技能、纯文本扁平库与完整 Wiki 的对比。

技能数量从 0 增至 200 时,五个核心域获得最大一段收益;此后曲线趋于饱和,400 到完整技能池每个域最多只再增加 0.8 个百分点。这表明前 200 个技能覆盖了常见操作和恢复路径,后续条目主要补齐长尾。与此同时,完整 Wiki 比扁平纯文本库高 2.5–8.2 个百分点,说明层级导航、视觉预览和可执行代码不是包装层。

— 表 2|资源来源消融:视频是不可替代的基础,来源多样性负责补齐覆盖。

去掉视频后,只保留代码、文章与成品,平均分从 68.9% 降到 59.4%;反过来,仅视频 的 66.8% 仍高于无视频三来源组合 7.4 个百分点。Excel 的视频移除损失为 14.2 个百分点,Web 为 11.5,恰好都是高度依赖操作顺序与视觉反馈的域。

— 表 3|固定技能 ID 与检索预算后,只改变 Agent 能看到的模态。

只给精心整理的文本技能,平均分已经有 65.0%;加入视觉到 66.9%,加入代码到 67.0%,三种视图全开达到 68.9%。视觉和代码的单独增益接近,但两者互补。多模态并不是替代好文本,而是在好文本之上补足“长什么样”和“怎样运行”。

— 表 4|固定库、Agent、评测器与候选预算后的选择策略消融。

层级后接 LM 的 MetaBrowse 以 68.9% 排名第一,超过 BM25 的 66.0%、BM25+Embed 的 64.2% 和纯向量检索的 60.0%。随机从全库抽技能只有 58.0%,几乎贴近无技能的 57.3%。结论很直接:技能质量重要,选对技能同样重要;不合适的技能会增加参数绑定和组合冲突成本。

06

ONLINE

在线学习不是常驻加速器,而是能力缺口的补丁

— 表 5|固定 891 个离线技能,最多在线增加 100 个技能时的结果。

当离线库已经覆盖常见请求时,加入最多 100 个在线技能,标准任务集只从 65.4% 升到 66.1%,即 0.7 个百分点。这个变化很小,说明频繁联网蒸馏不是默认情况下的免费增益。

但在专门挑选离线库缺口的 Tnovel 上,在线技能把 41.2% 提升到 62.8%,增加 21.6 个百分点。在线条目使用与离线相同的构建和验收流程,并单独存放,不回灌默认库。合理的定位不是“每次都搜索”,而是先发现能力缺口,再定向补齐。

一套更稳妥的部署策略

•离线库覆盖高频能力

把常见操作、风格模板和恢复路径预先蒸馏并版本化。

•运行时先做层级选择

限制候选和完整技能数量,控制上下文与组合复杂度。

•检测缺口后再在线扩展

让新技能进入隔离池,通过同一组质量门后再参与当前任务。

•执行后必须渲染检查

无论技能是否通过结构测试,最终成品仍要经过域内渲染与质量验证。

07

CASES

成功与失败都说明:Skill 的最后一公里是参数落地

— 图 4|Web 成功案例:技能侧形成完整长页、稳定排版和丰富内容结构。

在农场餐厅落地页案例中,技能侧把字体、卡片、信息密度和长页节奏组织成统一系统;无技能侧则停留在占位感很强的六段骨架。这里的优势不是多写几行 CSS,而是多个技能共同提供了 内容结构、版式模式和视觉约束。

— 图 5|Web 失败案例:技能侧更保守、更稀疏,无技能侧反而完成度更高。

但在复古未来主义桌游页中,技能侧过度贴住单一模式,页面稀疏;无技能侧反而有更完整的章节覆盖。论文的十个边界案例反复出现两类问题:一是 partial grounding,技能表面模式被复用,但公式、背景、曝光或相机等绑定没有真正落地;二是 conservative composition,Agent 因锚定某个技能而失去必要变化。

— 图 6|Blender 成功案例:技能侧建立了主体、材质与多光源层次。

— 图 7|Blender 失败案例:复杂技能组合未正确绑定背景、曝光和相机参数。

Blender 的一正一反更直观:首饰案例中,技能侧确实用上了 PBR 材质和蓝/琥珀色轮廓光;香水瓶案例却被过曝与构图错误吞没。Excel 案例还出现可见的 #NAME? 公式错误,PPT 案例出现未处理的占位文本。一个技能只有在参数被正确绑定、冲突被正确裁决时,才会真正成为能力。

08

EVALUATION

如何读这些数字:评测设计、边界与未来方向

这套实验证据强在哪里

主比较在每个域使用匹配的 N=80 任务,消融使用固定 N=40 子集;同一比较中的任务 ID、Agent、评测器和随机设置保持一致。未产出、不可打开、过小或静音的成品按 0 分计入均值,不会被静默剔除。非音频成品由 GPT-5.4 视觉评测器按五个域内维度打分,Reaper 由音频模型评测。

自动评测并非完美:17 个任务—成品样本上,评测器与人类中位数的总体 Spearman ρ=0.71、ICC=0.66;评测器重复运行相关性 ρ=0.83。论文又加入五人盲评,方向上支持主结果。更合理的读法是:证据链相互印证,但不等于每个小差异都具有同等确定性。

还要区分 论文评测范围 与 当前公开资源范围:论文主结果覆盖 Web、Excel、Reaper、PPT、Blender、CAD、UE5 七域;当前官方项目页把可发布域标为五个,即 Web、PPT、Excel、Blender 和 Reaper,并说明 CAD、UE5 属于论文评测抽象。若要复现完整七域结果,需要额外确认对应后端与资源是否已开放。

未来方向

•加强参数绑定

在执行前后追踪技能变量是否映射到真实对象、单元格、材质、相机和工具状态。

•处理技能冲突

当前一次运行只按序应用最多五个技能,没有多轮重规划或冲突仲裁;未来可把冲突检测放进控制回路。

•补充同预算原始资源基线

现有检索基线在蒸馏后的技能库上运行,尚未与等 token 预算的原始视频转录、仓库片段和文章检索正面对比。

•扩展到弱工具化领域

论文不主张方法已泛化到缺少可编程接口或公开程序性内容的领域,这决定了当前系统的适用边界。

对 Agent 工程的真正启示

Resource2Skill 的价值,不只是“从视频生成技能”的单点能力,而是一套知识工程闭环:资源采集 → 多模态蒸馏 → 确定性验收 → 层级检索 → 组合执行 → 成品验证。它把人类经验从临时上下文中抽出来,变成有路径、有版本、有来源、有执行接口的资产。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

  • OpenClaw与AI结合实现智能网页自动化抓取
  • NLP技术演进:从词向量到Transformer实战指南
  • Windows多线程编程:关键代码段原理与优化实践

最新新闻

  • Rancher与Kubernetes多集群管理实战指南
  • WatchMachineGo:LLM推理GPU硬件可视化与性能优化实战
  • 2026 年新发布:海曙热门的钢厂整体管道保温施工厂家选哪家,钢厂漏热耗百万竟没人察觉?这套方案把损耗压到了零头都不到-博宸保温施工 - 企业信息推荐【官方】
  • AI大模型与YOLO技术赋能中医舌诊系统开发
  • RAG系统优化:解决‘引用强迫症‘的工程实践
  • HarmonyOS ArkTS 实战:实现一个进制转换器

日新闻

  • 大连理工大学与东京大学联手打造的“主动型AI助手“
  • 170.2026年国家级科研瓶颈:超精密单点金刚石切削(SPDT)光学表面生成
  • SongBloom:革命性歌曲生成框架深度解析——如何通过交织自回归与扩散模型创作完整音乐

周新闻

  • 大连理工大学与东京大学联手打造的“主动型AI助手“
  • 170.2026年国家级科研瓶颈:超精密单点金刚石切削(SPDT)光学表面生成
  • SongBloom:革命性歌曲生成框架深度解析——如何通过交织自回归与扩散模型创作完整音乐

月新闻

  • 2026年6月公司网站搭建最新热门渠道测评:四大低成本/零代码平台对比+避坑
  • 【Linux】Linux arm 编译QT程序,出现expected “}“报错
  • 【MATLAB例程】四基站二维AOA定位与距离辅助增强对比仿真。基于角度观测和测距修正的固定目标平面定位精度分析

关于尧图

  • 公司简介
  • 团队介绍
  • 企业文化
  • 荣誉资质

服务项目

  • 定制开发
  • 电商建站
  • UI 设计
  • 运维服务

快速链接

  • 案例展示
  • 建站流程
  • 常见问题
  • 资讯中心

联系方式

  • 📍北京市朝阳区互联网产业园 A 座 10 层
  • 📞400-888-8888
  • ✉️contact@rkmt.cn
  • 🕐周一至周日 9:00-21:00

© 2024 北京尧图网络科技有限公司 版权所有 | 京 ICP 备 XXXXXXXX 号