LeRobot v0.6.0: Menutup Lingkaran Pembelajaran Robot
Hugging Face telah merilis LeRobot v0.6.0, pembaruan terbesar untuk kerangka kerja pembelajaran robotika sumber terbuka hingga saat ini. Versi baru ini berfokus pada tiga tema inti — bayangkan, evaluasi, dan tingkatkan — memperkenalkan kebijakan model dunia yang memprediksi keadaan masa depan, API model hadiah terpadu, dan enam tolok ukur simulasi baru di bawah satu antarmuka evaluasi.
Model Dunia: Kebijakan yang Membayangkan Masa Depan
Penambahan utama dalam v0.6.0 adalah tiga kebijakan model dunia, masing-masing belajar memprediksi masa depan selama pelatihan sambil mengambil pendekatan berbeda untuk menjaga prediksi tersebut tetap terjangkau pada waktu inferensi.
VLA-JEPA membangun model visi-bahasa-aksi yang ringkas di atas Qwen3-VL-2B. Selama pelatihan, model dunia JEPA mengantisipasi bingkai yang akan datang dari tindakan model itu sendiri. Pada inferensi, model dunia dihapus seluruhnya, memberikan pengawasan model dunia tanpa biaya tambahan. Tiga checkpoint yang telah dilatih sebelumnya tersedia di Hugging Face, termasuk basis yang telah dilatih sebelumnya dengan DROID untuk penyesuaian halus.
LingBot-VA melangkah lebih jauh dengan model video-aksi autoregresif yang memprediksi video dan tindakan masa depan bersama-sama, bagian demi bagian, memberikan umpan balik observasi nyata untuk menjaga prediksi tetap terikat. Peneliti dapat menyimpan apa yang dibayangkan robot dan membandingkannya dengan hasil aktual. Inferensi berjalan pada satu GPU 24–32 GB.
FastWAM mengajukan pertanyaan mendasar: apakah model aksi dunia benar-benar membutuhkan imajinasi masa depan pada waktu pengujian? Ini memasangkan ahli pembuatan video dengan sekitar 5 miliar parameter dengan ahli aksi yang ringkas dalam satu jaringan. Pada inferensi, ia melewatkan langkah imajinasi sepenuhnya dan langsung mereduksi derau pada potongan aksi.
Kebun Binatang VLA Terus Bertambah
GR00T milik NVIDIA telah ditingkatkan ke N1.7, menggantikan VLM sebelumnya dengan Cosmos-Reason2-2B yang dibangun di atas Qwen3-VL, memberi makan kepala aksi pencocokan aliran. Integrasi LeRobot telah diuji kesetaraan terhadap implementasi Isaac-GR00T asli NVIDIA.
MolmoAct2 milik Allen AI telah sepenuhnya dipindahkan ke LeRobot dengan penyesuaian halus, evaluasi, dan penerapan robot nyata yang tercakup dari ujung ke ujung. Checkpoint yang telah dilatih sebelumnya dengan koreksi kalibrasi mendukung penerapan zero-shot pada robot SO-100/101 dengan VRAM sekitar 12 GB. Juga bergabung dalam jajaran adalah EO-1 (backbone Qwen2.5-VL-3B), Multitask DiT dengan ~450M parameter, dan EVO1 ringkas dengan 0,77 miliar parameter.
Model Hadiah: Mengetahui Kapan Robot Anda Berhasil
Deteksi keberhasilan dan estimasi kemajuan telah lama menjadi bagian yang hilang dalam pembelajaran robot. v0.6.0 memperkenalkan API model hadiah terpadu dengan dua tambahan penting: Robometer dan TOPReward.
Robometer adalah model hadiah tujuan umum yang telah dilatih sebelumnya, dibangun di atas Qwen3-VL-4B, dilatih melalui perbandingan lintasan pada kumpulan data lebih dari satu juta lintasan robot. Arahkan ke kumpulan data LeRobot mana pun dan ia akan menilai kemajuan tugas dan keberhasilan dari video mentah ditambah instruksi bahasa, tanpa memerlukan pelatihan khusus tugas.
TOPReward sepenuhnya zero-shot tanpa bobot hadiah sama sekali. Ini membungkus VLM yang tersedia secara komersial dan membaca log-probabilitas token ‘True’ yang diberikan video lintasan dan instruksi tugas, mengubah VLM yang mampu menjadi fungsi hadiah.
Infrastruktur Data, Pelatihan, dan Tolok Ukur
Di sisi data, LeRobot sekarang mendukung penginderaan kedalaman dari ujung ke ujung dengan kamera Intel RealSense, mengompresi peta kedalaman sebagai aliran video 12-bit, dan menawarkan jalur anotasi bahasa otomatis menggunakan VLM. Pemuatan data video hingga sekitar 2x lebih cepat, dengan decoding bingkai multi-kamera secara paralel.
Pelatihan mendapatkan dukungan FSDP (Fully Sharded Data Parallel) melalui Accelerate, memungkinkan model yang melebihi memori GPU tunggal. Pelatihan cloud melalui Hugging Face Jobs bekerja dengan menambahkan satu bendera — dari T4 hingga 8x H200, semuanya dapat diakses dengan perintah lerobot-train yang sama.
Enam tolok ukur simulasi baru berjalan melalui CLI lerobot-eval terpadu: LIBERO-plus menguji tekanan dengan sekitar 10.000 varian yang terganggu, RoboTwin 2.0 mencakup 50 tugas bimanual, RoboCasa365 mencakup 365 tugas dapur di lingkungan yang dihasilkan secara prosedural, RoboCerebra mengevaluasi perilaku jangka panjang, RoboMME menguji kemampuan memori, dan VLABench memeriksa pengetahuan dan penalaran dalam manipulasi.
Penerapan mendapatkan CLI sendiri di lerobot-rollout, dengan strategi DAgger memungkinkan peneliti untuk menyaksikan kebijakan mereka berjalan, mengambil alih dengan lengan pemimpin saat gagal, dan memasukkan setiap koreksi kembali ke siklus penyesuaian halus berikutnya — menutup lingkaran pembelajaran robot.
Detail lebih lanjut tersedia di Blog Hugging Face.
