🔬 Un equipo de MIT, Nvidia, Caltech y varias universidades creó VLASH, un sistema que deja a robots preparar el siguiente grupo de movimientos mientras ejecutan el actual. En pruebas con dos modelos y dos plataformas, algunas tareas se hicieron entre 1,5 y 2 veces más rápido, sin perder la mayor parte o toda la precisión.
Los robots controlados por modelos visión-lenguaje-acción suelen avanzar a saltos: ejecutan una orden, esperan el siguiente cálculo y retoman el trabajo. VLASH estima dónde acabará el robot a partir de su posición y sus movimientos ya previstos. Desde ahí prepara el siguiente grupo de acciones, sin un modelo aparte ni otro paso de cálculo durante la ejecución.
El equipo probó dos modelos y dos plataformas robóticas con una laptop equipada con una GPU Nvidia RTX 5090. Hizo 20 ensayos por método en tareas de tomar y colocar objetos, apilar y clasificar, además de tenis de mesa y Whac-a-Mole. La demora máxima de respuesta cayó hasta 11,8 veces según el hardware. El trabajo es un preprint en arXiv, pendiente de revisión por pares.
También reorganizaron datos de entrenamiento para ajustar modelos. En una prueba, cada paso de entrenamiento fue 3,26 veces más rápido con precisión comparable. Los autores advierten que eso no implica que todo el entrenamiento cueste o dure 3,26 veces menos.
✅ Las tareas que exigen movimiento continuo y respuestas rápidas, como algunas de manufactura, podrían beneficiarse de menos tiempo de espera. Pero una respuesta más rápida no prueba que el robot sea más seguro cerca de personas. Falta probar VLASH en más robots, entornos, ensayos largos y ante perturbaciones; tampoco se evaluó con humo, poca luz, terreno inestable o equipos dañados.


