RoboTTTは、テスト時トレーニング(TTT)を視覚-言語-行動(VLA)モデルに組み込むことで、ロボットポリシー学習における重要な進歩を示しています。この手法により、ロボットは推論中にメモリを構築し、視覚-運動コンテキストウィンドウを8,000タイムステップに拡張できます。従来の方法のように大規模な再トレーニングや外部メモリモジュールを必要とせず、動的な環境に適応します。ナビゲーションや操作などの長期的なタスクで有望な結果を示しており、開発者や研究者にとって、大規模な再トレーニングのオーバーヘッドなしに、より自律的で適応性のあるロボットシステムを構築する新しい道を開きます。
RoboTTTはVLAモデルにテスト時トレーニングを統合し、ロボットが8Kタイムステップにわたってコンテキストを維持できるようにし、長期的なタスク性能を向上させます。