Motivation
- 从零开始去噪需要大量的迭代次数, 推理延迟高
- 忽略了物理连续性, 以及历史执行数据的先验信息
- 低维的本体感知信号与高维的视觉表征直接拼接, 会稀释本体感知信号
Methods
- 将历史的action chunk经过多个 1D-CNN 构成的 Encoder 投影到512dim, 作为起点z0
- 将视觉信号经过 ResNet18 提取特征, 然后经过 Linear 层投影得到512dim, 作为条件c
- 将z0作为起点, 经过 AdaLN-MLP 架构的FlowNet, 注入条件c (注入给AdaLN), 经过去噪得到目标z1
- 将z1送入 残差MLP 进行解码, 得到最终的action chunk