Motivation

  1. 从零开始去噪需要大量的迭代次数, 推理延迟高
  2. 忽略了物理连续性, 以及历史执行数据的先验信息
  3. 低维的本体感知信号与高维的视觉表征直接拼接, 会稀释本体感知信号

Methods

  1. 将历史的action chunk经过多个 1D-CNN 构成的 Encoder 投影到512dim, 作为起点
  2. 将视觉信号经过 ResNet18 提取特征, 然后经过 Linear 层投影得到512dim, 作为条件
  3. 作为起点, 经过 AdaLN-MLP 架构的FlowNet, 注入条件 (注入给AdaLN), 经过去噪得到目标
  4. 送入 残差MLP 进行解码, 得到最终的action chunk