Entrenar modelos de visión-lenguaje-acción (VLA) para robótica requiere cantidades masivas de datos, pero los métodos actuales enfrentan una crisis de escalabilidad. La teleoperación, aunque precisa, es demasiado lenta y costosa para escalar. Este artículo explora por qué los videos web ofrecen una alternativa viable, proporcionando datos diversos y abundantes. Discute los desafíos técnicos como la brecha de dominio y el control de calidad, junto con posibles soluciones. Para investigadores e ingenieros en IA encarnada, comprender este cambio es esencial para construir la próxima generación de robots.
Explore el cuello de botella de datos en los modelos VLA y por qué los videos web son la clave para escalar la IA robótica.