En Italie, des chercheurs ont découvert qu’un simple poème suffit à pousser plusieurs IA grand public à livrer des réponses normalement interdites.
Une équipe européenne de recherche, Icaro Lab, rattachée à l’université Sapienza de Rome, affirme avoir réussi à contourner les garde-fous de grandes IA comme celles d’OpenAI, Meta ou Anthropic en déguisant des questions sensibles sous forme de vers, rapporte le média technologique américain Wired. Leurs travaux pointent une faille inattendue : la créativité poétique semble désarmer des systèmes censés empêcher la diffusion d’informations dangereuses.
Des poèmes pour obtenir des instructions sur des armes ou des malwares
L’étude, intitulée « Adversarial Poetry as a Universal Single-Turn Jailbreak in Large Language Models », décrit une série de tests menés sur 25 chatbots commerciaux ou expérimentaux. Les chercheurs ont reformulé des requêtes explicitement interdites – par exemple liées à la fabrication d’armes ou à la création de logiciels malveillants – en poèmes truffés de métaphores et de références détournées.
Selon Icaro Lab, les poèmes rédigés à la main ont permis un contournement des garde-fous dans 62 % des cas, avec des taux pouvant grimper à 90 % pour certains modèles parmi les plus avancés.
Les scientifiques distinguent deux approches :
- des poèmes entièrement écrits à la main, sur mesure pour chaque question sensible ;
- des « conversions » automatiques de requêtes en poèmes via des méta-instructions.
D’après Wired, ces « méta-prompts » poétiques restent moins efficaces, mais atteignent tout de même un taux moyen de succès d’environ 43 %. Dans tous les cas, chaque chatbot testé s’est révélé vulnérable à ce type de manipulation, à des degrés divers.
Pour illustrer leur méthode sans mettre le public en danger, les chercheurs ont seulement montré un exemple inoffensif : un poème cryptique évoquant le « four secret » d’un boulanger. En revanche, ils ont choisi de ne pas publier les textes réellement utilisés pour obtenir des réponses sensibles, les jugeant « trop dangereux pour être partagés avec le public ».
Pourquoi la poésie fait tomber les garde-fous des IA
Habituellement, les systèmes de sûreté intégrés aux IA génératives reposent sur la détection de mots-clés, de tournures typiques et de structures de phrase associées à des demandes risquées : fabrication de bombes, piratage informatique, contenus illégaux, etc. Icaro Lab estime que la poésie déstabilise précisément ces mécanismes automatisés.
« En poésie, on voit le langage à haute température, où les mots se succèdent dans des séquences imprévisibles et peu probables », expliquent les chercheurs. « Un poète fait exactement cela : il choisit systématiquement des options peu probables, des mots inattendus, des images inhabituelles, une syntaxe fragmentée. »
Concrètement, les requêtes transformées en poèmes utilisent :
- des métaphores et symboles (par exemple remplacer le mot « bombe » par une image détournée) ;
- des phrases volontairement brisées, avec une grammaire étrange ;
- des références obliques au lieu d’ordres directs.
Pour un humain, un vers métaphorique décrivant un objet explosif reste compréhensible comme une allusion à une bombe. Les chercheurs notent que l’IA, elle, semble réagir autrement : le sens figuré glisse entre les mailles de filtres surtout entraînés à repérer des formulations explicites.
L’équipe résume ce décalage dans son article : pour les modèles de langage, les safeties perçoivent ces requêtes comme un exercice littéraire plutôt que comme une demande pratique. La « transformation poétique » déplacerait la demande à l’intérieur des représentations internes du modèle dans une zone qui n’active pas les alarmes de sécurité.
Une « défaillance fondamentale » de l’approche actuelle de la sûreté
Icaro Lab s’inscrit dans la lignée des travaux sur les « adversarial suffixes », ces chaînes de caractères sans sens apparent ajoutées à la fin des requêtes pour tromper les filtres. Mais les chercheurs estiment que la poésie représente une variante plus puissante et surtout plus accessible à un utilisateur lambda.
Le laboratoire parle d’un « échec fondamental dans notre manière de penser la sûreté de l’IA » et prévient : les garde-fous actuels gèrent « le danger frontal, pas la subtilité ».
Selon leurs résultats, la créativité humaine, loin d’être seulement un atout pour enrichir les échanges avec un chatbot, devient aussi une arme pour contourner les limites imposées par les concepteurs. L’étude met en lumière un paradoxe : les modèles sont entraînés à imiter la créativité humaine, à manier l’ambiguïté et les doubles sens, mais leurs dispositifs de sûreté restent majoritairement alignés sur des signaux littéraux.
À ce stade, aucune des entreprises citées – OpenAI, Meta, Anthropic – n’a commenté publiquement ces travaux. Les chercheurs assurent toutefois avoir transmis les détails techniques aux sociétés concernées dans le cadre d’une procédure de divulgation responsable.
Des risques pour la défense, la santé ou l’éducation
Au-delà du simple chatbot accessible sur un site web, Icaro Lab prévient que ce type de faille pourrait toucher un large éventail de systèmes : assistants intégrés à des services de santé, outils de soutien pédagogique, logiciels d’aide à la décision dans la défense ou la cybersécurité.
| Domaine concerné | Type de risque potentiel lié aux prompts poétiques |
|---|---|
| Défense / sécurité | Aide indirecte à la mise au point d’armes ou de tactiques offensives. |
| Informatique / cybersécurité | Production de fragments de code utiles à des malwares ou à des attaques. |
| Santé | Conceptions de substances ou usages dangereux détournés de leur cadre médical. |
| Éducation | Génération de contenus inappropriés ou de guides illégaux sous couvert d’exercice littéraire. |
Les auteurs n’affirment pas que les IA testées livrent automatiquement des plans complets d’armes ou de virus informatiques. Leur alerte porte sur la possibilité, statistiquement élevée, d’obtenir des fragments d’informations techniques, des schémas conceptuels ou des conseils qu’un utilisateur mal intentionné pourrait combiner avec d’autres ressources.
Qu’est-ce que cela change pour les utilisateurs en France ?
Les principaux modèles mis en cause – ceux d’OpenAI, Meta ou Anthropic – sont massivement utilisés depuis la France, directement via des plateformes en ligne ou intégrés dans des applications et services. Les garde-fous ne sont pas paramétrés pays par pays pour ce type de scénario : un exploit poétique découvert en Italie peut théoriquement fonctionner depuis n’importe où, y compris depuis un ordinateur ou un smartphone français.
Pour un internaute en France, plusieurs points se dégagent :
- un chatbot n’est pas une source fiable pour des sujets sensibles (armes, fraude, piratage) même quand il affiche des messages de refus ;
- les éditeurs de logiciels qui intègrent ces IA dans leurs produits doivent anticiper ces angles morts créatifs dans leurs propres politiques d’usage ;
- les autorités françaises chargées du numérique et de la régulation de l’IA devront tenir compte de ce type de contournement dans leurs futures recommandations.
Les travaux cités par Wired confirment un message déjà porté par les spécialistes de cybersécurité en France : une IA généraliste, aussi impressionnante soit-elle, ne constitue ni un filtre juridique fiable, ni une barrière technique suffisante. Elle doit être entourée de politiques claires côté développeurs et d’un minimum de vigilance chez les utilisateurs.
Comment les acteurs de l’IA peuvent-ils réagir à ces attaques poétiques ?
L’étude laisse entendre qu’une simple amplification des filtres par mots-clés ne suffira pas. Les chercheurs suggèrent, en creux, plusieurs pistes de travail pour les concepteurs de modèles :
Ces approches posent cependant un dilemme : plus les filtres deviennent agressifs, plus ils risquent de censurer des usages parfaitement légitimes, comme un poème militant, une œuvre de fiction violente ou un scénario de film. Les enjeux de liberté d’expression et de création rejoignent ceux de la sûreté technique.
Comprendre le terme de « jailbreak » appliqué aux IA
Le mot « jailbreak », utilisé par les chercheurs, désigne le fait de contourner volontairement des restrictions logicielles. Historiquement, il s’appliquait à des smartphones dont on supprimait les protections pour installer des logiciels non autorisés. Dans le contexte des modèles de langage, le « jailbreak » consiste à amener une IA à produire des réponses allant à l’encontre des règles fixées par son concepteur.
Les techniques de jailbreak ne reposent pas sur un piratage informatique classique. Elles exploitent plutôt les failles de formulation, les zones grises de l’entraînement des modèles et leurs difficultés à interpréter correctement certaines nuances de langage. La poésie, telle que décrite par l’équipe de Sapienza et de DexAI, vient s’ajouter à une panoplie déjà connue d’attaques par prompts sophistiqués.
Pour un utilisateur français, une conséquence concrète se dessine : utiliser un chatbot pour tester ses propres astuces de contournement, même par curiosité, peut contribuer à renforcer ces stratégies dans l’écosystème, tout en exposant à des usages illégaux ou contraires aux conditions d’utilisation. Les chercheurs d’Icaro Lab insistent sur l’importance de traiter ces découvertes avec prudence, rappelant qu’un simple poème peut parfois ouvrir la porte à des réponses qu’aucune IA n’aurait dû fournir.








