论文深度分析: MMSkills & Visual Skills
论文1: MMSkills (2605.13527) — 多模态技能包 + 分支加载
核心定位
首个将"可复用技能"形式化为多模态程序性知识的框架。针对视觉Agent: 不仅要知道做什么操作,还要识别相关视觉状态、解读进展/失败的视觉证据。
三大挑战 & MMSkills解法
| 挑战 | MMSkills解法 |
|---|---|
| Representation: 多模态技能包应包含什么? | Textual Procedure + Runtime State Cards + Multi-View Keyframes |
| Generation: 从哪里生成?(不用人工标注) | Agentic trajectory-to-skill Generator (5阶段pipeline) |
| Utilization: 如何使用?(避免context爆炸) | Branch Loading: 临时分支检查 → 蒸馏 → 注入主线 |
技能包结构

Figure 1: 一个MMSkill实例。同一chart-creation任务中,纯文本指导无法识别active sheet状态;branch-loaded MMSkills将技能证据与实时屏幕对齐,返回状态感知的指导。
每个MMSkill = (Descriptor, Procedure, State Cards, Keyframes):
M = (D, P, S, K)
D: 紧凑描述符
P: 可复用文本过程
S = {S_j}: 运行时状态卡片
- when_to_use / when_not_to_use
- visible_cues / verification_cue
- available_views
K = {K_j}: 多视图关键帧
- full_frame (全局上下文)
- focus_crop (局部视觉线索)
- before/after (状态转移)
技能生成Pipeline

Figure 2: MMSkills框架总览。左边: 技能包结构。中间: Generator将公开轨迹转换为技能库。右边: Branch-loaded agent在临时分支中检查技能证据后返回结构化指导。
公开轨迹池 → Phase0(嵌入+聚类) → Phase1(簇级技能规划)
→ Phase2(合并去重) → Phase3(文本初稿)
→ Phase4(图像接地+审计) → 多模态技能库
关键: 从非测试数据的公开轨迹中自动生成,靠meta-skill指导质量审计。
Branch Loading (分支加载)
传统做法: 直接将技能注入main context → 图像+状态卡造成context压力,且可能让agent锚定在参考截图而非实时环境。
MMSkills的做法:
- Gated View Selection: 根据实时观察选择相关状态卡和视图
- Branch Planning: 在临时分支中对齐证据与实时状态
- 返回结构化指导: (applicable, subgoal, plan, do_not_do, verify)
- 主线agent用指导做决策,执行动作仍基于实时截图
实验设计
Benchmarks: OSWorld, macOSWorld, VAB-Minecraft, Super Mario Bros
Model: Gemini 3.1 Pro, Gemini 3 Flash, Qwen3-VL-235B, GLM-5V, Kimi-K2.6, Qwen3-VL-8B
条件: No skill / Text-only / MMSkills
OSWorld核心结果 (Table 1):
| Model | No skill | Text-only | MMSkills |
|---|---|---|---|
| Gemini 3.1 Pro | 44.08% | 40.76% | 50.11% |
| Gemini 3 Flash | 36.65% | 40.27% | 47.97% |
| Qwen3-VL-235B | 21.34% | 28.57% | 39.17% |
| Qwen3-VL-8B | 10.78% | 14.93% | 25.40% |
关键发现: text-only有时不如no-skill (Gemini 3.1 Pro从44%降到40%),但MMSkills一致优于两者。
消融实验

Figure 3: 消融结果。(A) 去掉State Cards或Keyframes均降性能;(B) Branch loading > Direct loading, 加上view selection最优。
| 消融 | 结论 |
|---|---|
| 去掉State Cards | 性能降 → 状态区分能力关键 |
| 去掉Images | 性能降 → 视觉证据必不可少 |
| Direct load vs Branch load | Branch显著优于直接注入 |
| 无View Selection | 性能降 → 过滤无关视图关键 |
行为变化分析

Figure 4: OSWorld行为变化。(A) 动作分布: MMSkills让click-heavy agent转为更多结构化输入;(B) 减少每个任务的低层操作数;© 大幅减少重复行为(21.8%→6.2%)。
- 减少探索性试错: click share 75.8% → 63.7%,keyboard/DONE增加
- 减少重复动作: exact repeated actions 21.8% → 6.2%
- 提升完成判断: DONE行为增加
- 缩短轨迹: Qwen3-VL-235B步数从15.22 → 9.87
论文2: Visual Skills (2606.01414) — 技能应超越文本
核心论点
“Reusable agent skills should go beyond text and become multimodal assets for future multimodal agents.”
三个可复用视觉形式:
- Static Priors: 稳定空间约定 (布局模式、标准界面结构)
- Dynamic Priors: 即时视觉工作记忆 (当前任务的状态快照)
- Interleaved Visual Skills: 将有序文本步骤绑定到源帧/截图/页面区域
三个"不仅…还…":
- 不仅描述做什么,还编码看哪里、怎么检查、如何验证视觉结果
- Text-only skills在需要空间对应、视觉证据、状态感知交互的任务上有瓶颈
- Visual skills通过保留空间参考、视觉边界和交互模式来超越
自动生成系统
自动将agent经验转换为可复用多模态技能:
- 保留文本推理
- 保留空间参考
- 保留视觉边界
- 保留交互模式
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)