首页 VLA 研究专题 当前页面
02 VLA Research Suite
01 论文学习 02 AdaMoE 接入 03 主线收敛 04 实验推进

Vision-Language-Action

研究专题页 / 当前主线与实验路线

OpenVLA-OFT AdaMoE π0 / π0.5 MEDUSA Speculative Decoding

前期完成 AdaMoE 工程接入,当前主线收敛到层级式 speculative VLA。

Trajectory

研究脉络

只保留研究推进里最关键的判断与转折。

Phase 1 论文学习与问题建模

围绕 AdaMoE、MEDUSA、π 系列与流匹配建立 VLA 技术地图。

AdaMoE MEDUSA π0 / π0.5 Flow Matching
Phase 2 OpenVLA + AdaMoE 工程接入

在 OpenVLA-OFT 上完成 AdaMoE 接入,并验证 mix4、多任务训练与恢复链路。

Backbone-tail MoE mix4 Checkpoint Resume
Phase 3 方向收敛与当前主线

在工程实现基础上完成方向调整,当前主线收敛为“高层 speculative + 低层保守执行”。

High-Level Subtask MEDUSA-style Heads Replan
Engineering Snapshot AdaMoE 工程实现与阶段判断

已经完成

  • 完成 OpenVLA-OFT 到 AdaMoE-style action head 的接入。
  • 支持 mix4、多任务验证与 checkpoint 恢复。

当前结论

  • backbone-tail MoE 证明了工程可行,但研究问题还不够聚焦。
  • 后续更适合转向 action-head MoE 与层级式 speculative 主线。

Mainline

当前研究主线

当前更适合在高层语义子任务空间做 speculative reasoning。

Direction A Hierarchical Speculative VLA

在高层子任务 token 空间引入多头 speculative decoding,低层执行保持闭环控制。

  • 与 π0.5 一类层级结构天然兼容。
  • 指标清晰,验证路径也更短。
Direction B Speculative Action Expert

直接把 speculative 扩展到连续动作或 denoising 更新层面。

  • 创新性更强,但 acceptance 机制需要重新定义。
  • 更适合作为主线稳定后的 follow-up。
Current Thesis Hierarchical Speculative Decoding for Vision-Language-Action Models

更合适的论文表述是先提升高层重规划效率,再验证它能否转化为更稳的长时程执行。

Method Figure 三段式方法骨架
Step 1 高层语义理解

图像、语言与状态进入骨干网络,输出语义级子任务 token。

Step 2 高层 speculative verification

并行生成候选前缀,再做 verification 与 acceptance。

Step 3 低层闭环执行

低层执行器保持保守,通过反馈与 replan 维持稳定性。

Roadmap

路线与结果

这一块只保留接下来最值得推进的实验路径。

Stage 1

建立层级基线

明确高层 subtask token 形式与 replan 接口。

输出:可运行基线
Stage 2

加入高层 speculative

实现多头候选、verification 与 acceptance。

输出:方法原型
Stage 3

长时程评测

重点观察延迟、replan、成功率与恢复率。

输出:核心结果
Experiment Snapshot 实验与结果概览
Setup 对照与当前状态
  • Baseline OFT:原始 OpenVLA-OFT。
  • Backbone-tail AdaMoE:当前已跑通版本。
  • Action-head MoE:下一阶段重点补齐。
Done

工程链路已打通。

In Progress

主线已收敛到高层 speculative VLA。

Result Plan 结果与消融

后续优先填入延迟、replan 次数与长时程成功率,再补 acceptance strategy 与 head count 的消融。

Latency Replan Success Rate acceptance strategy head count
Main Claim 更快的高层推理应转化为更频繁的 replan 与更稳的长时程执行

后续只需要把真实成功率、延迟和恢复率填进来,不必再改整体结构。

Chart Placeholder 主结果图
Baseline OFT
Backbone-tail AdaMoE
Hierarchical Speculative VLA

后续建议替换成真实的成功率或 replan 柱状图。

Sources

参考材料与页面依据

这里只保留页面直接参考到的核心材料。

核心参考材料

  • AdaMoE_action_head_最终运行版整理.docx
  • MoE代码实现总结.docx
  • MoE方向调整汇报.pptx
  • Openvla+AdaMoe代码修改进度.pptx
  • AdaMoe.pptx
  • pi系列模型1.3-1.10.pptx
  • 流匹配1.10-1.17.docx
  • 论文学习1.17-2.7.pptx
  • 研究方向汇报_π0_π0.5_speculative_VLA.docx

后续补充

后续如果补真实实验结果,优先填到“路线与结果”即可。