研究问题
模型完成推理后,
机器人如何连续执行?
VLA 策略生成动作块的频率低于机器人执行频率。两者之间的时间差会带来观测过时、动作块切换不连续和系统延迟。本报告在统一的部署协议下,研究从模型计算到真实机器人控制的完整链路。
180真机实验
6种策略对比
2.804×模型推理加速
96.7%最高任务成功率
推理加速比与最高任务成功率来自不同评估配置;将快速采样与执行策略组合后,任务成功率会发生变化。
实验结果
在真实双臂任务中
评估执行效果。
我们使用两台 Agilex Piper 机械臂,在长时序 T 恤折叠任务中对比六种执行策略。各方法使用相同的基础策略、硬件、任务定义和成功判据。
表现最佳 / LEGATO96.7%任务成功率
29 / 30成功次数
47.31成功任务 / 小时
| 方法 | 成功率 | 平均时长 | 成功吞吐量 |
|---|---|---|---|
| Legato |
96.7%
|
73.56 s | 47.31 h−1 |
| VLASH |
93.3%
|
77.73 s | 43.22 h−1 |
| 时序平滑 |
76.7%
|
93.93 s | 29.38 h−1 |
| 训练时 RTC |
63.3%
|
129.37 s | 17.62 h−1 |
| 朴素异步 |
63.3%
|
124.13 s | 18.37 h−1 |
| 推理时 RTC |
60.0%
|
133.73 s | 16.15 h−1 |
左右滑动查看完整表格 →
研究背景
从模型时延
走向系统时序。
实时 VLA 研究涵盖异步推理、动作块间连续性、自适应执行长度、快速动作生成、连续时间表示和系统部署。本报告聚焦这些方法在真实机器人上的可测量执行效果。
系统架构
可追踪的
分布式运行系统。
策略推理、动作发布和机器人控制以不同频率运行。每个动作块的时间信息与来源信息贯穿整个执行链路。
01观测相机画面、机器人状态与时间戳。
02推理按可配置采样方式生成动作块。
03执行独立缓冲、发布动作并记录日志。
时延标定
测量完整链路,
而不只看模型。
同步记录视觉时间码、末端 ArUco 标记、关节指令、图像时间戳与本体反馈,通过信号之间的相位关系估计曝光、读出、运动响应和反馈时延。
01 相机曝光与读出02 主机到机器人的指令时延03 本体反馈时延

执行策略
八种方法应对
推理与执行的时间差。
下方展示八种执行方式,其中六种在统一部署接口下进行了真机对比。点击图片可查看原图。








推理效率
两阶段采样。
缩短等待。
Flow Matching 各积分步对动作生成的贡献并不相同。所提出的采样安排保留前期大步推进与末端短步细化,缩短模型侧推理时间;与已测试的执行策略组合时,任务成功率存在权衡。
标准 Flow61.557 ms10 NFE
两阶段21.956 ms2 NFE


真机实验
面向长时序
操作任务。

我们在长时序 T 恤折叠任务上评估连续执行,并在三种衣物条件下重复同一测试协议。
30 每种方法的测试次数3 种衣物条件2 台机械臂5+ 项以上连续性指标
尾段间隙、切换间隙、速度、加速度与跟踪误差共同揭示动作块边界处的执行行为。









轨迹诊断
连续性问题
显现在动作切换处。
局部位置、速度和加速度曲线揭示任务成功率无法单独呈现的执行行为;阴影区域表示动作块切换。






开放资源
阅读报告,运行代码,
继续研究。
关联论文全文Toward Real-Time VLAs: Stage-Aware Two-Step Flow Denoising and System-Level Evaluation · 技术报告,含附录arXiv ↗推理框架公开的分布式实时推理代码CODE ↗
建议引用
@misc{wu2026realtimevlasstageawaretwostep,
title={Toward Real-Time VLAs: Stage-Aware Two-Step Flow Denoising and System-Level Evaluation},
author={Di Wu and Rongtian Shen and Ping Liu and Yan Shen and Zhenhan Yin and Shun Zuo and Xuhua Chen and He Zheng and Lingfeng Zhang and Jianglin Zhang and Tao Zhang},
year={2026},
eprint={2609.39822},
archivePrefix={arXiv},
primaryClass={cs.RO},
url={https://arxiv.org/abs/2609.39822},
}