実務の流れは、対象ロボットに合うLeRobotデータセットを作成し、`lerobot/smolvla_base`をファインチューニングし、固定した条件で実機評価するという順番になる。公式文書の約50エピソードは開始点であり、万能の必要数ではない。
2026年8月7日の確認時点で最新のLeRobotリリースはv0.6.1だった。`main`の文書と配布版でオプションが変わる可能性があるため、実際に使う版を固定する。カメラ名、行動次元、シリアルポートは例をそのまま使わない。
データ収集前にv0.6.1とスキーマを固定する
LeRobot公式リリースでは、確認日にv0.6.1が最新と表示される。分離した環境に`pip install "lerobot[smolvla]==0.6.1"`で確認済みの依存関係を固定して入れ、LeRobot、Python、PyTorch、CUDA、モデルとデータのリビジョンを実験記録に残す。
SmolVLAは複数カメラ、センサ・関節状態、言語指示から行動チャンクを生成する。収録と実機でカメラキー、関節順序、単位、行動の絶対値・差分表現、周期を一致させる。LeRobot Dataset v3の解説で保存形式を確認し、学習前に全特徴を可視化する。
| 固定項目 | 保存する情報 | 不一致時の症状 |
|---|---|---|
| LeRobot | v0.6.1とロックファイル | CLI引数や読込の不一致 |
| カメラ | キー、順序、解像度、周期 | 視点の欠落・入れ替わり |
| 状態 | 関節順序、単位、正規化 | 姿勢指令のずれ |
| 行動 | 次元、絶対/差分、制御周期 | 逆方向・過大動作 |
| 指示文 | 収録時の課題表現 | 同じ場面で矛盾した行動 |
50エピソードより変化の内訳を見る
v0.6.1のSmolVLA公式文書は約50エピソードを開始点として勧める。例では立方体の位置5種類に各10回を収録し、似た25回のデータでは性能が悪かったとしている。これは特定のpick-and-place実験の経験値だ。
実際には物体位置、種類、照明、背景、初期姿勢、把持失敗後の復旧をどう含めたかが重要になる。総数だけでなく条件ごとの件数を数える。一般的なLoRA選択はVLAのLoRA・アダプター解説に譲り、ここではSmolVLAの一連の手順に絞る。
| 点検 | 方法 | 問題がある場合 |
|---|---|---|
| 条件の網羅 | 位置・物体・照明別に件数集計 | 不足条件を追加収録 |
| 映像整合 | 全カメラを同時系列で表示 | キー・時刻を修正 |
| 行動範囲 | 関節ごとの範囲と急変を描画 | 単位・差分変換を修正 |
| 指示の一貫性 | 意味ごとにデモを分類 | 矛盾ラベルを除去 |
| 評価分割 | 物体や場面を単位に分離 | フレーム漏洩を防止 |
smolvla_baseから学習し設定を保存する
Hugging FaceのSmolVLA紹介は4億5千万パラメータの公開モデルと`lerobot/smolvla_base`を案内する。現行例は`lerobot-train –policy.path=lerobot/smolvla_base –dataset.repo_id=HF_USER/MY_DATASET –batch_size=64 –steps=20000 –output_dir=outputs/train/my_smolvla –policy.device=cuda`が中心だ。
batch 64、20,000 step、A100で約4時間という記述は保証ではない。GPU、画像、I/O、凍結設定で所要時間は変わる。メモリ不足ならbatchを下げ、損失だけでなく処理速度、メモリ、検証時の成功を記録し、データのリビジョンと出力先を実験ごとに分ける。

最小損失ではなく実機の行動で選ぶ
一定間隔でチェックポイントを保存し、同じ開始姿勢、物体配置、制限時間、成功定義で比較する。学習にない位置や物体も含める。損失が低くても、把持のタイミングやカメラ変化への耐性が悪化することがある。
ロボットVLA評価ガイドに沿って、成功、部分成功、遅延、復旧、人の介入、安全停止を記録する。物体を見失った失敗と、到達後にグリッパーを早く閉じた失敗を分けると次の改善が決めやすい。
最初のロールアウトは低速の隔離環境で行う
公式文書は`lerobot-rollout`にロボット種別、ポート、ID、カメラ、課題文、`–policy.path`を渡す例を示す。全項目を実機に置き換え、前処理が期待するカメラキーと一致させる。収録時と意味が同じ課題文を使う。
作業空間を空け、速度・トルク・行動範囲を制限し、物理非常停止と監視者を置く。ポリシー出力は独立した制限器を通す。SmolVLAは安全認証された制御器ではなく、衝突防止装置の代わりにもならない。

採用した版と失敗例まで成果物に含める
LeRobot公式リポジトリではCLIやデータ機能が継続的に変化する。v0.6.1、モデル、データ、設定、乱数seed、ハードウェア、評価条件をチェックポイントと一緒に保存し、更新時は別環境で回帰試験する。
採用判断は、対象作業の反復成功、未学習条件での低下、遅延、復旧、安全停止で行う。50エピソードやA100時間は予算の目安にすぎない。スキーマが一致し、失敗を再現できる状態になって初めて運用可能な学習結果になる。
よくある質問
SmolVLAには必ず50エピソード必要ですか?
いいえ。公式文書が示す開始点であり、作業の変化、デモ品質、カメラ数、ロボット構成によって必要量は変わる。
20,000 stepで学習完了と判断できますか?
できない。保存した各チェックポイントを同じ実機試験で比べ、成功、遅延、復旧、安全停止を見て判断する。
smolvla_baseを未調整のまま実機に使えますか?
公式文書は対象環境のデータでのファインチューニングを推奨する。カメラ・状態・行動スキーマが違うロボットへ直結してはいけない。
確認した公式情報
2026-08-07