LeRobot v0.6.0: Cerrando el bucle de aprendizaje robótico
Hugging Face ha lanzado LeRobot v0.6.0, la mayor actualización hasta la fecha del framework de aprendizaje robótico de código abierto. La nueva versión se centra en tres temas centrales — imaginar, evaluar y mejorar — introduciendo políticas de modelos mundiales que predicen estados futuros, una API unificada de modelos de recompensa y seis nuevos benchmarks de simulación bajo una única interfaz de evaluación.
Modelos Mundiales: Políticas que Imaginan el Futuro
La incorporación principal en v0.6.0 son tres políticas de modelos mundiales, cada una aprende a predecir el futuro durante el entrenamiento mientras adopta un enfoque diferente para mantener esa predicción asequible en el momento de la inferencia.
VLA-JEPA construye un modelo compacto de visión-lenguaje-acción sobre Qwen3-VL-2B. Durante el entrenamiento, un modelo mundial JEPA anticipa los fotogramas venideros a partir de las propias acciones del modelo. En la inferencia, el modelo mundial se elimina por completo, ofreciendo supervisión del modelo mundial a coste cero adicional. Hay tres checkpoints preentrenados disponibles en Hugging Face, incluyendo una base preentrenada con DROID para ajuste fino.
LingBot-VA da un paso más con un modelo autoregresivo de video-acción que predice el video y las acciones futuras juntos, fragmento por fragmento, reintroduciendo observaciones reales para mantener las predicciones fundamentadas. Los investigadores pueden guardar lo que el robot imaginó y compararlo con los resultados reales. La inferencia se ejecuta en una sola GPU de 24–32 GB.
FastWAM plantea una pregunta fundamental: ¿los modelos mundiales de acción realmente necesitan imaginación futura durante la prueba? Combina un experto en generación de video de aproximadamente 5 mil millones de parámetros con un experto en acciones compacto en una sola red. En la inferencia, omite el paso de imaginación por completo y elimina el ruido de los fragmentos de acción directamente.
El Zoológico VLA Sigue Creciendo
El GR00T de NVIDIA se ha actualizado a N1.7, reemplazando el VLM anterior con Cosmos-Reason2-2B construido sobre Qwen3-VL, alimentando un cabezal de acción de emparejamiento de flujo. La integración con LeRobot se ha sometido a pruebas de paridad con respecto a la implementación original de Isaac-GR00T de NVIDIA.
MolmoAct2 de Allen AI se ha portado completamente a LeRobot con ajuste fino, evaluación e implementación en robots reales cubiertos de extremo a extremo. Los checkpoints preentrenados con corrección de calibración admiten implementación zero-shot en robots SO-100/101 con aproximadamente 12 GB de VRAM. También se unen a la alineación EO-1 (backbone Qwen2.5-VL-3B), el Multitask DiT de ~450M de parámetros y el compacto EVO1 de 0.77B de parámetros.
Modelos de Recompensa: Saber Cuándo Tu Robot Tiene Éxito
La detección de éxito y la estimación de progreso han sido piezas faltantes durante mucho tiempo en el aprendizaje robótico. v0.6.0 introduce una API unificada de modelos de recompensa con dos adiciones notables: Robometer y TOPReward.
Robometer es un modelo de recompensa de propósito general preentrenado, construido sobre Qwen3-VL-4B, entrenado mediante comparaciones de trayectorias sobre un conjunto de datos de más de un millón de trayectorias de robots. Apúntalo a cualquier conjunto de datos de LeRobot y puntúa el progreso de la tarea y el éxito a partir de video sin procesar más una instrucción en lenguaje, sin necesidad de entrenamiento específico para la tarea.
TOPReward funciona completamente en modo zero-shot sin ningún peso de recompensa. Envuelve un VLM estándar y lee la log-probabilidad del token “Verdadero” dado el video de la trayectoria y la instrucción de la tarea, convirtiendo cualquier VLM capaz en una función de recompensa.
Infraestructura de Datos, Entrenamiento y Benchmark
En el aspecto de los datos, LeRobot ahora soporta percepción de profundidad de extremo a extremo con cámaras Intel RealSense, comprime mapas de profundidad como flujos de video de 12 bits y ofrece un pipeline de anotación automática de lenguaje utilizando VLMs. La carga de datos de video es hasta aproximadamente 2 veces más rápida, con decodificación de fotogramas de múltiples cámaras en paralelo.
El entrenamiento gana soporte FSDP (Fully Sharded Data Parallel) a través de Accelerate, permitiendo modelos que exceden la memoria de una sola GPU. El entrenamiento en la nube a través de Hugging Face Jobs funciona añadiendo una sola bandera — desde una T4 hasta 8x H200, todo accesible con el mismo comando lerobot-train.
Seis nuevos benchmarks de simulación se ejecutan a través de la CLI unificada lerobot-eval: LIBERO-plus realiza pruebas de estrés con aproximadamente 10,000 variantes perturbadas, RoboTwin 2.0 cubre 50 tareas bimanuales, RoboCasa365 abarca 365 tareas de cocina en entornos generados proceduralmente, RoboCerebra evalúa el comportamiento a largo plazo, RoboMME prueba capacidades de memoria y VLABench examina el conocimiento y el razonamiento en la manipulación.
La implementación tiene su propia CLI en lerobot-rollout, con la estrategia DAgger que permite a los investigadores observar cómo se ejecuta su política, tomar el control con un brazo líder cuando falla y alimentar cada corrección en el siguiente ciclo de ajuste fino — cerrando el bucle de aprendizaje robótico.
Más detalles disponibles en el Blog de Hugging Face.
