Empfehlungssysteme sind entscheidend für das Nutzerengagement, aber ihre Optimierung ist arbeitsintensiv. Das RecHarness-Framework von Kuaishou geht dieses Problem an, indem es Bandit-Algorithmen mit LLM-basierten Agenten integriert. Die Kernidee: Jede Kandidatenänderung am Empfehlungsmodell wird als 'Arm' in einem Multi-Armed-Bandit-Problem behandelt. Das System bewertet, welche Änderungen am vielversprechendsten sind, und verteilt Ressourcen entsprechend, während LLM-Agenten diese Kandidaten generieren und verfeinern. Dieser Ansatz reduziert die Trial-and-Error-Kosten traditioneller MLE-Workflows und ermöglicht es dem System, sich kontinuierlich zu verbessern. RecHarness adressiert eine zentrale Herausforderung: die effiziente Zuweisung begrenzter Testressourcen an die wirkungsvollsten Änderungen. Erste Ergebnisse deuten auf erhebliche Effizienzgewinne hin. Für Ingenieure großer Empfehlungssysteme bietet dies einen Blick in die Zukunft automatisierter ML-Operationen.
Kuaishous RecHarness-Framework kombiniert Bandit-Algorithmen mit LLM-Agenten, um die Optimierung von Empfehlungssystemen zu automatisieren.