L'apprentissage par renforcement pour les modèles vision-langage (VLM-RL) est confronté à un défi critique : les signaux de récompense sont souvent épars, bruités ou mal alignés avec les comportements souhaités. TAPO (Task-Adaptive Policy Optimization) introduit un mécanisme pour affiner l'allocation des récompenses pendant l'entraînement, améliorant l'efficacité des échantillons et la qualité finale de la politique. La méthode ajuste dynamiquement les poids des récompenses en fonction de la difficulté de la tâche et de la progression de l'apprentissage, réduisant l'impact des signaux trompeurs. Les premières expériences montrent des gains dans les benchmarks de raisonnement multimodal par rapport aux approches RLHF standard. L'approche est encore expérimentale mais souligne une tendance croissante vers un façonnage plus sophistiqué des récompenses dans l'entraînement des modèles de fondation.
TAPO est une nouvelle méthode d'allocation des récompenses dans l'apprentissage par renforcement des modèles vision-langage, répondant aux défis des récompenses éparses.