コンテンツにスキップ

LeRobot 0.6.0

対応モデル

モデル種別 モデル名 --policy.type 概要
模倣学習/BC ACT act Transformerで複数ステップのAction Chunkを一括生成
Diffusion Policy diffusion ノイズから軌道を反復的に復元して行動列を生成
VQ-BeT vqbet 行動を離散的な潜在トークンとして学習
Multitask DiT Policy multi_task_dit DiTによる言語・画像条件付きのマルチタスク行動生成
VLA π₀ / Pi0 pi0 大規模VLMとFlow Matchingによる汎用ロボット制御
π₀-FAST / Pi0Fast pi0_fast Pi0系の高速なAction Token生成モデル
π₀.₅ / Pi0.5 pi05 オープンワールド汎化を重視したPi0系VLA
GR00T N1.7 groot NVIDIAのクロス・エンボディメント対応VLA
SmolVLA smolvla 比較的小型・低計算量のVLA
X-VLA xvla Soft Promptで異なるロボット構成を統合するVLA
EO-1 eo1 視覚・言語からロボット行動を生成するVLA
MolmoAct2 molmoact2 Molmo系視覚言語モデルを利用した行動生成
WALL-OSS wall_x WALL-X実装をベースとしたオープンVLA
EVO1 evo1 汎用ロボット操作向けVLA
World Model/WAM VLA-JEPA vla_jepa VLAに潜在動画World Modelを組み合わせて学習
LingBot-VA lingbot_va Video-Action World Model
FastWAM fastwam Wan2.2動画モデルを利用するWorld Action Model
強化学習 HIL-SERL gaussian_actor 人間介入を組み込んだ実機向けRL基盤
TDMPC tdmpc 潜在空間のWorld Modelを使うモデルベースRL
QC-FQL ― 0.6.0時点では「coming soon」で未対応
Reward Model SARM ― 操作動画や状態から報酬・成功度を推定
TOPReward ― タスク進行や達成度を評価する報酬モデル
Robometer ― ロボット操作の品質・成功度を評価

モデル種別による違い

種別 主な入力 出力 学習方法 長所 短所 Unitree G1での位置づけ
ACT カメラ、関節状態 Action Chunk 教師あり模倣学習 軽量、高速、少量データでも扱いやすい 未学習タスクへの汎化は弱い 上半身操作の第一候補
Diffusion カメラ、関節状態 Action Sequence 拡散モデルによる模倣学習 滑らかで多峰性のある動作を表現しやすい 学習・推論がACTより重い 複雑な両腕操作の第二候補
VQ-BeT カメラ、関節状態 潜在Action Token 行動量子化+Transformer 複数の異なる動作パターンを表現しやすい チューニング項目が多い 研究比較用
Multitask DiT カメラ、状態、言語 Action Sequence DiT/Diffusion系 複数タスクを1モデルに統合しやすい データ量とGPUを要求 言語付きマルチタスク操作向け
VLA カメラ、言語、関節状態 Action Chunk VLM事前学習+ロボットデータ微調整 言語指示、物体理解、タスク汎化 重い。ロボット構成への適合が必要 多タスク化・汎用化フェーズ
WAM/World Model 動画、状態、言語、行動 未来表現+Action 動画予測・潜在世界予測 動作結果を内部的に予測しながら学習できる まだ研究色が強く計算量も大きい 次世代研究候補
RL 状態、画像、報酬 Action 環境との試行錯誤 成功率、速度、接触動作を直接最適化可能 実機学習は危険性・時間コストが高い 微調整や自律改善向け
Reward Model 画像、動画、言語 スコア/報酬 成功・失敗データによる学習 人手の報酬設計を減らせる 直接ロボットを制御するモデルではない RL・データ選別の補助