| 模倣学習/BC |
ACT |
act |
Transformerで複数ステップのAction Chunkを一括生成 |
|
Diffusion Policy |
diffusion |
ノイズから軌道を反復的に復元して行動列を生成 |
|
VQ-BeT |
vqbet |
行動を離散的な潜在トークンとして学習 |
|
Multitask DiT Policy |
multi_task_dit |
DiTによる言語・画像条件付きのマルチタスク行動生成 |
| VLA |
π₀ / Pi0 |
pi0 |
大規模VLMとFlow Matchingによる汎用ロボット制御 |
|
π₀-FAST / Pi0Fast |
pi0_fast |
Pi0系の高速なAction Token生成モデル |
|
π₀.₅ / Pi0.5 |
pi05 |
オープンワールド汎化を重視したPi0系VLA |
|
GR00T N1.7 |
groot |
NVIDIAのクロス・エンボディメント対応VLA |
|
SmolVLA |
smolvla |
比較的小型・低計算量のVLA |
|
X-VLA |
xvla |
Soft Promptで異なるロボット構成を統合するVLA |
|
EO-1 |
eo1 |
視覚・言語からロボット行動を生成するVLA |
|
MolmoAct2 |
molmoact2 |
Molmo系視覚言語モデルを利用した行動生成 |
|
WALL-OSS |
wall_x |
WALL-X実装をベースとしたオープンVLA |
|
EVO1 |
evo1 |
汎用ロボット操作向けVLA |
| World Model/WAM |
VLA-JEPA |
vla_jepa |
VLAに潜在動画World Modelを組み合わせて学習 |
|
LingBot-VA |
lingbot_va |
Video-Action World Model |
|
FastWAM |
fastwam |
Wan2.2動画モデルを利用するWorld Action Model |
| 強化学習 |
HIL-SERL |
gaussian_actor |
人間介入を組み込んだ実機向けRL基盤 |
|
TDMPC |
tdmpc |
潜在空間のWorld Modelを使うモデルベースRL |
|
QC-FQL |
― |
0.6.0時点では「coming soon」で未対応 |
| Reward Model |
SARM |
― |
操作動画や状態から報酬・成功度を推定 |
|
TOPReward |
― |
タスク進行や達成度を評価する報酬モデル |
|
Robometer |
― |
ロボット操作の品質・成功度を評価 |