GPT-Red est un système interne d'OpenAI dédié au red teaming automatisé. En simulant des attaques par injection de prompt, il a permis de rendre GPT-5.6 Sol plus robuste que les versions précédentes, et jusqu'à découvrir de nouvelles formes d'attaques.
OpenAI lève le voile sur GPT-Red, un système interne automatisé de red teaming. Il est conçu pour identifier les vulnérabilités des modèles d'IA avant leur déploiement à grande échelle. Il entre dans le cadre d'un cercle vertueux de sécurité, où les modèles actuels sont utilisés pour rendre les versions futures plus fiables et sécurisées.Une sorte de hacker virtuel
GPT-Red est entraîné via un processus d'apprentissage par renforcement en self-play. Le modèle est mis en compétition avec une collection de grands modèles de langage défenseurs.
GPT-Red est récompensé lorsqu'il réussit à provoquer une défaillance, comme une injection de prompt réussie, tandis que les modèles défenseurs sont primés pour leur résistance. En simulant des scénarios réels, l'entraînement pousse GPT-Red à découvrir des attaques plus puissantes et plus diverses, à mesure que les défenses se renforcent.
OpenAI insiste sur le fait que GPT-Red est maintenu séparé des modèles qui sont déployés, afin d'éviter que ses capacités nuisibles ne tombent entre de mauvaises mains.
Une efficacité éprouvée face aux humains
Lors d'un test reproduisant un benchmark de 2025 pour les injections de prompt, GPT-Red a surpassé les équipes humaines de red teaming avec un taux de réussite de 84 % des scénarios, contre seulement 13 % pour les humains. Son efficacité a aussi été prouvée dans des cas concrets.
Confronté à Vendy, un distributeur automatique géré par une IA et développé par Andon Labs, GPT-Red a réussi à atteindre ses trois objectifs malveillants : modifier le prix d'un article, commander un produit cher pour une somme dérisoire et annuler la commande d'un autre client.
Il s'est également montré plus efficace que GPT-5.5 pour exfiltrer des données sensibles d'un agent Codex CLI.Les implications pour les modèles comme GPT-5.6
L'objectif ultime de GPT-Red est de solidifier les modèles de production. Grâce à son intégration dans le processus d'entraînement, GPT-5.6 Sol est devenu " le modèle d’OpenAI le plus robuste à ce jour face aux injections de prompt ". Il enregistre six fois moins d’échecs sur le benchmark interne le plus exigeant consacré aux injections directes de prompt.
Une découverte de GPT-Red est une nouvelle classe d'attaques nommée Fake Chain-of-Thought. Ces attaques, qui affichaient un taux de réussite de plus de 95 % contre GPT-5.1, sont désormais inefficaces à plus de 90 % contre GPT-5.6 Sol.
Pour OpenAI, l'enjeu est de s'assurer que la robustesse des modèles progresse au même rythme que leurs capacités, sans les rendre moins performants sur leurs tâches légitimes.
merci à GNT
