GPT-Red attaque GPT-5.6 Sol pour son bien

Pour savoir tout ce qu'il se passe sur la toile
Répondre
Avatar du membre
chtimi054
Administrateur du site
Administrateur du site
Messages : 10645
Enregistré le : ven. 26 juil. 2013 06:56
A remercié : 264 fois
A été remercié : 1538 fois
    Windows 10 Firefox

GPT-Red attaque GPT-5.6 Sol pour son bien

Message par chtimi054 »

GPT-Red attaque GPT-5.6 Sol pour son bien

GPT-Red est un système interne d'OpenAI dédié au red teaming automatisé. En simulant des attaques par injection de prompt, il a permis de rendre GPT-5.6 Sol plus robuste que les versions précédentes, et jusqu'à découvrir de nouvelles formes d'attaques.
Image OpenAI lève le voile sur GPT-Red, un système interne automatisé de red teaming. Il est conçu pour identifier les vulnérabilités des modèles d'IA avant leur déploiement à grande échelle. Il entre dans le cadre d'un cercle vertueux de sécurité, où les modèles actuels sont utilisés pour rendre les versions futures plus fiables et sécurisées.

Une sorte de hacker virtuel

GPT-Red est entraîné via un processus d'apprentissage par renforcement en self-play. Le modèle est mis en compétition avec une collection de grands modèles de langage défenseurs.

GPT-Red est récompensé lorsqu'il réussit à provoquer une défaillance, comme une injection de prompt réussie, tandis que les modèles défenseurs sont primés pour leur résistance. En simulant des scénarios réels, l'entraînement pousse GPT-Red à découvrir des attaques plus puissantes et plus diverses, à mesure que les défenses se renforcent.

OpenAI insiste sur le fait que GPT-Red est maintenu séparé des modèles qui sont déployés, afin d'éviter que ses capacités nuisibles ne tombent entre de mauvaises mains.

Une efficacité éprouvée face aux humains

Lors d'un test reproduisant un benchmark de 2025 pour les injections de prompt, GPT-Red a surpassé les équipes humaines de red teaming avec un taux de réussite de 84 % des scénarios, contre seulement 13 % pour les humains. Son efficacité a aussi été prouvée dans des cas concrets.

Confronté à Vendy, un distributeur automatique géré par une IA et développé par Andon Labs, GPT-Red a réussi à atteindre ses trois objectifs malveillants : modifier le prix d'un article, commander un produit cher pour une somme dérisoire et annuler la commande d'un autre client.
Image Il s'est également montré plus efficace que GPT-5.5 pour exfiltrer des données sensibles d'un agent Codex CLI.

Les implications pour les modèles comme GPT-5.6

L'objectif ultime de GPT-Red est de solidifier les modèles de production. Grâce à son intégration dans le processus d'entraînement, GPT-5.6 Sol est devenu " le modèle d’OpenAI le plus robuste à ce jour face aux injections de prompt ". Il enregistre six fois moins d’échecs sur le benchmark interne le plus exigeant consacré aux injections directes de prompt.

Une découverte de GPT-Red est une nouvelle classe d'attaques nommée Fake Chain-of-Thought. Ces attaques, qui affichaient un taux de réussite de plus de 95 % contre GPT-5.1, sont désormais inefficaces à plus de 90 % contre GPT-5.6 Sol.

Pour OpenAI, l'enjeu est de s'assurer que la robustesse des modèles progresse au même rythme que leurs capacités, sans les rendre moins performants sur leurs tâches légitimes.

merci à GNT
Répondre