Saturday, September 12, 2026
AINews

LeRobot v0.6.0: रोबोट लर्निंग लूप को बंद करना

हगिंग फेस ने LeRobot v0.6.0 जारी किया है, जो ओपन-सोर्स रोबोटिक्स लर्निंग फ्रेमवर्क का अब तक का सबसे बड़ा अपडेट है। नया संस्करण तीन मुख्य थीम — कल्पना करना, मूल्यांकन करना और सुधार करना — पर केंद्रित है, जिसमें भविष्य की स्थितियों की भविष्यवाणी करने वाली वर्ल्ड मॉडल पॉलिसी, एक यूनिफाइड रिवॉर्ड मॉडल API, और एक ही मूल्यांकन इंटरफेस के तहत छह नए सिमुलेशन बेंचमार्क शामिल हैं।

वर्ल्ड मॉडल: ऐसी पॉलिसी जो भविष्य की कल्पना करती हैं

v0.6.0 में मुख्य जोड़ तीन वर्ल्ड मॉडल पॉलिसी हैं, जिनमें से प्रत्येक प्रशिक्षण के दौरान भविष्य की भविष्यवाणी करना सीखती है, जबकि अनुमान के समय उस भविष्यवाणी को सस्ता रखने के लिए एक अलग दृष्टिकोण अपनाती है।

VLA-JEPA Qwen3-VL-2B के शीर्ष पर एक कॉम्पैक्ट विज़न-लैंग्वेज-एक्शन मॉडल बनाता है। प्रशिक्षण के दौरान, एक JEPA वर्ल्ड मॉडल मॉडल के अपने कार्यों से आने वाले फ्रेम का अनुमान लगाता है। अनुमान के समय, वर्ल्ड मॉडल को पूरी तरह से हटा दिया जाता है, जिससे बिना किसी अतिरिक्त लागत के वर्ल्ड-मॉडल पर्यवेक्षण मिलता है। हगिंग फेस पर तीन प्री-ट्रेंड चेकपॉइंट उपलब्ध हैं, जिसमें फाइन-ट्यूनिंग के लिए DROID-प्रीट्रेंड बेस शामिल है।

LingBot-VA एक ऑटोरेग्रेसिव वीडियो-एक्शन मॉडल के साथ एक कदम और आगे बढ़ता है जो भविष्य के वीडियो और कार्यों को एक साथ, टुकड़े-दर-टुकड़े भविष्यवाणी करता है, और भविष्यवाणियों को यथार्थवादी बनाए रखने के लिए वास्तविक अवलोकनों को वापस फीड करता है। शोधकर्ता रोबोट ने क्या कल्पना की, इसे सहेज सकते हैं और वास्तविक परिणामों से तुलना कर सकते हैं। अनुमान एक एकल 24–32 GB GPU पर चलता है।

FastWAM एक मौलिक प्रश्न पूछता है: क्या वर्ल्ड एक्शन मॉडल को वास्तव में टेस्ट-टाइम भविष्य की कल्पना की आवश्यकता है? यह एक नेटवर्क में लगभग 5-बिलियन-पैरामीटर वीडियो जनरेशन विशेषज्ञ को एक कॉम्पैक्ट एक्शन विशेषज्ञ के साथ जोड़ता है। अनुमान के समय, यह कल्पना चरण को पूरी तरह से छोड़ देता है और सीधे एक्शन चंक को डीनॉइज़ करता है।

VLA Zoo लगातार बढ़ रहा है

NVIDIA के GR00T को N1.7 में अपग्रेड किया गया है, जो पिछले VLM को Cosmos-Reason2-2B से बदल देता है, जो Qwen3-VL पर बनाया गया है, जो एक फ्लो-मैचिंग एक्शन हेड को फीड करता है। LeRobot एकीकरण का NVIDIA के मूल Isaac-GR00T कार्यान्वयन के खिलाफ पैरिटी-परीक्षण किया गया है।

Allen AI के MolmoAct2 को फाइन-ट्यूनिंग, मूल्यांकन और वास्तविक-रोबोट तैनाती के साथ एंड-टू-एंड LeRobot में पूरी तरह से पोर्ट किया गया है। कैलिब्रेशन सुधार के साथ प्री-ट्रेंड चेकपॉइंट लगभग 12 GB VRAM पर SO-100/101 रोबोट पर जीरो-शॉट तैनाती का समर्थन करते हैं। लाइनअप में EO-1 (Qwen2.5-VL-3B बैकबोन), ~450M-पैरामीटर Multitask DiT, और कॉम्पैक्ट 0.77B-पैरामीटर EVO1 भी शामिल हैं।

रिवॉर्ड मॉडल: यह जानना कि आपका रोबोट कब सफल होता है

सफलता का पता लगाना और प्रगति का अनुमान लगाना लंबे समय से रोबोट लर्निंग में गायब टुकड़े रहे हैं। v0.6.0 दो उल्लेखनीय परिवर्धन के साथ एक यूनिफाइड रिवॉर्ड मॉडल API पेश करता है: Robometer और TOPReward।

Robometer Qwen3-VL-4B पर बनाया गया एक प्री-ट्रेंड, सामान्य-उद्देश्यीय रिवॉर्ड मॉडल है, जिसे दस लाख से अधिक रोबोट ट्रैजेक्टरी के डेटासेट पर ट्रैजेक्टरी तुलनाओं के माध्यम से प्रशिक्षित किया गया है। इसे किसी भी LeRobot डेटासेट पर इंगित करें और यह बिना किसी टास्क-विशिष्ट प्रशिक्षण की आवश्यकता के, रॉ वीडियो और एक भाषा निर्देश से कार्य प्रगति और सफलता का स्कोर करता है।

TOPReward बिना किसी रिवॉर्ड वेट के पूरी तरह से जीरो-शॉट जाता है। यह एक ऑफ-द-शेल्फ VLM को लपेटता है और ट्रैजेक्टरी वीडियो और टास्क निर्देश को देखते हुए “True” टोकन की लॉग-प्रायिकता पढ़ता है, किसी भी सक्षम VLM को एक रिवॉर्ड फंक्शन में बदल देता है।

डेटा, प्रशिक्षण और बेंचमार्क बुनियादी ढांचा

डेटा पक्ष पर, LeRobot अब Intel RealSense कैमरों के साथ एंड-टू-एंड डेप्थ सेंसिंग का समर्थन करता है, डेप्थ मैप को 12-बिट वीडियो स्ट्रीम के रूप में संपीड़ित करता है, और VLMs का उपयोग करके एक स्वचालित भाषा एनोटेशन पाइपलाइन प्रदान करता है। वीडियो डेटा लोडिंग लगभग 2x तेज है, जिसमें मल्टी-कैमरा फ्रेम समानांतर में डिकोड होते हैं।

प्रशिक्षण को Accelerate के माध्यम से FSDP (Fully Sharded Data Parallel) समर्थन मिलता है, जो सिंगल-GPU मेमोरी से अधिक मॉडल को सक्षम बनाता है। Hugging Face Jobs के माध्यम से क्लाउड प्रशिक्षण एक ही फ्लैग जोड़कर काम करता है — T4 से 8x H200 तक, सभी एक ही lerobot-train कमांड से सुलभ हैं।

छह नए सिमुलेशन बेंचमार्क यूनिफाइड lerobot-eval CLI के माध्यम से चलते हैं: LIBERO-plus लगभग 10,000 perturbed वेरिएंट के साथ स्ट्रेस-टेस्ट करता है, RoboTwin 2.0 50 द्वि-मैनुअल कार्यों को कवर करता है, RoboCasa365 प्रक्रियात्मक रूप से उत्पन्न वातावरण में 365 रसोई कार्यों को शामिल करता है, RoboCerebra लंबी-अवधि के व्यवहार का मूल्यांकन करता है, RoboMME मेमोरी क्षमताओं का परीक्षण करता है, और VLABench हेरफेर में ज्ञान और तर्क की जांच करता है।

तैनाती को lerobot-rollout में अपना स्वयं का CLI मिलता है, जिसमें DAgger रणनीति शोधकर्ताओं को अपनी पॉलिसी चलते हुए देखने, विफल होने पर लीडर आर्म के साथ नियंत्रण लेने, और हर सुधार को अगले फाइन-ट्यूनिंग चक्र में वापस फीड करने में सक्षम बनाती है — रोबोट लर्निंग लूप को बंद करना।

अधिक जानकारी हगिंग फेस ब्लॉग पर उपलब्ध है।