Les grands modèles de langage font face à un défi de sécurité persistant : les jailbreaks qui contournent les filtres de sécurité. Ce signal retrace l'évolution des premiers exploits comme l'« exploit de la grand-mère »—où les utilisateurs trompaient les modèles en présentant leurs demandes comme des histoires de grand-mère—aux méthodes plus avancées qui ciblent le raisonnement du modèle. En réponse, les développeurs construisent des systèmes de détection double qui examinent à la fois les entrées utilisateur et les sorties du modèle. Ces garde-fous utilisent des classifieurs, des API de modération de contenu et un entraînement contradictoire pour intercepter les prompts malveillants avant qu'ils n'atteignent le modèle et filtrer les réponses nuisibles avant qu'elles n'atteignent les utilisateurs. La course aux armements est continue : à mesure que les modèles deviennent plus capables, les attaquants trouvent de nouvelles vulnérabilités, et les défenseurs doivent constamment mettre à jour leurs stratégies.
Découvrez comment les techniques de jailbreak LLM évoluent des simples astuces de prompt aux attaques sophistiquées, et comment les garde-fous de sécurité y répondent avec une détection double entrée-sortie.