RacingZone

ChatGPT s’est mis à parler de gobelins sans raison : OpenAI révèle enfin l’origine du bug

Illustration abstraite montrant des créatures fantastiques colorées (gobelins et gremlins) s'échappant d'un écran d'ordinateur ou d'une interface ChatGPT, symbolisant la propagation inattendue de biais dans l'IA.

Aux États-Unis, OpenAI a mené l’enquête après avoir constaté que ChatGPT évoquait soudain des gobelins dans des échanges sans rapport.

Le site technologique américain Wonderful Engineering rapporte qu’OpenAI a identifié la cause précise de ces réponses étranges, apparues après une mise à jour de ses modèles. L’entreprise a fini par publier une explication détaillant comment une option de personnalité « geek » et la façon dont l’IA a été entraînée ont déclenché cette avalanche de gobelins et autres créatures fantastiques dans ChatGPT.

Un flot de gobelins qui intrigue les utilisateurs

Tout est parti de retours d’utilisateurs surpris de voir leur chatbot parler de gobelins, de gremlins et de créatures de fantasy, y compris dans des conversations très sérieuses. Les signalements se sont multipliés après des mises à jour récentes des modèles de langage d’OpenAI, selon Wonderful Engineering.

Les mentions n’étaient pas limitées à des scénarios imaginaires ou à des demandes liées à la fantasy. Certains internautes les voyaient apparaître dans des réponses censées traiter de sujets techniques, professionnels ou du quotidien. Ce décalage a poussé OpenAI à lancer une véritable enquête interne.

OpenAI a déterminé que cette obsession soudaine pour les gobelins venait d’une combinaison entre un réglage de personnalité « nerd » et un biais introduit lors de l’entraînement par renforcement.

L’entreprise a examiné les journaux de réponses, les paramètres de personnalisation et les différentes versions de ses modèles, jusqu’à isoler un coupable inattendu : une personnalité optionnelle, conçue pour donner un ton plus « geek » à l’IA.

Une personnalité « nerd » à l’origine de la dérive

ChatGPT propose, dans certaines configurations, des personnalités préréglées pour ajuster style et ton. Parmi elles, un mode décrit comme « nerdy », c’est-à-dire fortement marqué par la culture geek et les références pop.

D’après l’analyse d’OpenAI, ce mode ne représentait qu’environ 2,5 % de l’ensemble des réponses générées. Pourtant, il concentrait près des deux tiers des mentions de gobelins et de gremlins relevées dans les conversations étudiées.

  • Part des réponses produites avec la personnalité « nerd » : environ 2,5 %
  • Part des références aux gobelins issues de cette même personnalité : environ deux tiers

Ce déséquilibre chiffré a mis les équipes techniques sur la piste d’un phénomène bien connu en intelligence artificielle : la façon dont un modèle apprend à préférer certains types de réponses quand on les récompense systématiquement.

Le rôle déterminant de l’apprentissage par renforcement

Pour améliorer la qualité de ChatGPT, OpenAI a recours à ce qu’on appelle l’« apprentissage par renforcement à partir de retours humains » (RLHF). Des évaluateurs humains comparent plusieurs réponses du modèle et indiquent celles qu’ils jugent les plus pertinentes, les plus utiles ou les plus engageantes.

Dans ce cas précis, Wonderful Engineering explique que des réponses contenant des termes comme « gobelin » ou « gremlin » se sont retrouvées systématiquement mieux notées dans certains contextes, notamment pour la personnalité « nerd ». Le système a alors appris que ces mots étaient « récompensés ».

En étant régulièrement mieux notées, les réponses truffées de références à des gobelins ont été renforcées, jusqu’à devenir un tic de langage que le modèle a généralisé.

Ce renforcement a créé une boucle de rétroaction. À chaque cycle d’entraînement, le modèle a accru la probabilité de réutiliser ces références jugées positives. Progressivement, ce qui n’était au départ qu’un trait de style limité à une seule personnalité s’est mis à déborder.

Quand un biais local se diffuse dans tout le modèle

OpenAI indique que les comportements appris lors de l’entraînement ne restent pas toujours confinés à un mode ou à une personnalité. Les ajustements successifs effectués sur le modèle global peuvent propager ces préférences au-delà du périmètre initial.

C’est exactement ce qui s’est produit ici : les gobelins, d’abord liés à un ton « nerdy », ont commencé à apparaître dans des réponses standard, avec d’autres personnalités ou sans réglage particulier. À mesure que de nouvelles versions étaient déployées, le phénomène devenait plus visible pour le grand public.

Selon Wonderful Engineering, OpenAI a observé ce comportement dans des itérations récentes de ses modèles, y compris une version identifiée comme GPT-5.5 dans les documents internes mentionnés. L’entreprise a alors décidé de corriger activement le tir.

Des garde-fous ajoutés dans les versions récentes du modèle

Face à l’ampleur inattendue de ces références, OpenAI a modifié ses outils et ses instructions internes. Les développeurs ont ajouté des consignes explicites destinées à limiter toute allusion à des créatures fantastiques lorsqu’elles ne sont pas directement pertinentes pour la demande de l’utilisateur.

Ces consignes prennent la forme de « prompts internes », c’est-à-dire de textes que le modèle reçoit en coulisses pour cadrer son comportement. L’objectif est d’amener ChatGPT à éviter les gobelins et autres créatures du même type dans des contextes non appropriés.

OpenAI affirme avoir mis en place de nouveaux outils d’audit pour repérer tôt ce genre de dérive stylistique et corriger les biais avant qu’ils ne se généralisent.

L’entreprise souligne que même un mécanisme de récompense apparemment anodin peut, à grande échelle, créer des habitudes de langage très visibles. Le cas des gobelins sert désormais d’exemple interne pour affiner les méthodes de test et de contrôle qualité.

Des « personnalités » d’IA plus difficiles à maîtriser qu’il n’y paraît

Les modes de personnalité sont conçus pour rendre les échanges plus agréables, plus adaptés aux goûts ou au ton souhaité par l’utilisateur. Un mode « sérieux », un mode « pédagogue » ou un mode « geek » permettent ainsi de diversifier l’expérience.

OpenAI reconnaît toutefois que ces fonctions ajoutent une couche de complexité. Chaque personnalité entraîne une combinaison différente de style, d’humour, de références culturelles. Si l’entraînement ne les encadre pas finement, des comportements inattendus peuvent apparaître et se répandre à l’ensemble du modèle.

Le cas des gobelins illustre comment un simple clin d’œil à la culture fantasy, encouragé lors de l’évaluation humaine, s’est transformé en tic récurrent, jusqu’à gêner la lisibilité de certaines réponses.

Ce que cela signifie pour les utilisateurs en France

Pour un utilisateur français de ChatGPT, ce type de « bug » se traduit surtout par une gêne : une réponse ponctuée de créatures fantastiques dans un contexte professionnel ou administratif peut paraître peu sérieuse, voire incompréhensible.

Le phénomène rappelle aussi que les grands modèles de langage restent sensibles à leurs données d’entraînement et aux préférences implicites des personnes qui les évaluent. Les biais peuvent porter sur le ton, les références culturelles ou même la manière de structurer un argumentaire.

En France, de nombreuses administrations, entreprises ou médias commencent à expérimenter l’usage d’IA génératives pour la rédaction, l’assistance ou le tri de documents. Un biais de style aussi marqué pourrait, dans un cadre professionnel, poser plusieurs problèmes concrets :

  • manque de crédibilité dans des documents officiels ou juridiques ;
  • risque d’erreurs de ton dans des échanges avec le public ;
  • nécessité de relecture humaine renforcée pour détecter ces dérives.

Les organismes français qui envisagent d’intégrer ce type d’outils doivent donc prévoir des tests en situation réelle et des règles claires sur la validation humaine des contenus générés, en particulier pour les textes sensibles (communication publique, documents contractuels, information médicale ou financière).

Comment comprendre ce type de bug d’intelligence artificielle

Dans le domaine de l’IA, le mot « bug » ne désigne pas toujours une erreur de programmation classique. Ici, le logiciel fonctionne comme prévu, mais le système a appris un comportement jugé inapproprié dans la pratique.

On parle alors parfois de comportement émergent : la combinaison de millions de paramètres, de données massives et de signaux de récompense produit des effets difficiles à prévoir dans le détail. Le cas des gobelins illustre comment une préférence apparemment marginale peut se transformer en caractéristique très voyante.

Pour l’utilisateur, l’enjeu consiste à garder en tête que ChatGPT ne « comprend » pas réellement les références qu’il utilise, mais reproduit des habitudes de langage apprises et renforcées.

Un exemple pratique : si un modèle est systématiquement félicité lorsqu’il répond de manière humoristique, il peut finir par ajouter des blagues même lorsque la situation ne s’y prête pas. Avec les gobelins, le même mécanisme a joué, mais autour d’un détail de vocabulaire associé à une personnalité précise.

À l’avenir, OpenAI affirme vouloir renforcer ses contrôles afin d’identifier plus tôt ces dérapages stylistiques, avant qu’ils n’affectent massivement les utilisateurs. L’affaire des gobelins sert ainsi de cas d’école pour affiner les méthodologies d’audit des grands modèles d’IA, qu’ils soient utilisés pour des usages ludiques ou dans des contextes beaucoup plus sérieux.

Questions fréquentes

Pourquoi ChatGPT parlait-il soudainement de gobelins ?

Un réglage optionnel de personnalité « nerd » combiné à l'apprentissage par renforcement a renforcé les références aux gobelins, car elles avaient été systématiquement mieux notées par les évaluateurs humains dans ce contexte. Ce biais limité s'est ensuite propagé à l'ensemble du modèle lors des mises à jour successives.

Seule la personnalité nerd était concernée ?

Non. Bien que le mode « nerd » représentait seulement 2,5 % des réponses, il concentrait environ deux tiers des mentions de gobelins. Au fil du temps, ces références ont débordé vers les autres personnalités et réponses standard, affectant un public beaucoup plus large.

Comment OpenAI a-t-elle résolu ce problème ?

L'entreprise a ajouté des consignes explicites internes pour limiter les allusions à des créatures fantastiques lorsqu'elles ne sont pas pertinentes, et mis en place de nouveaux outils d'audit pour détecter et corriger les biais avant qu'ils ne se généralisent.

Quel enseignement OpenAI tire-t-elle de cet incident ?

OpenAI reconnaît que même des mécanismes de récompense apparemment anodins peuvent créer des habitudes de langage très visibles à grande échelle. Le cas des gobelins sert désormais d'exemple interne pour affiner les méthodes de test et de contrôle qualité.

Cela peut-il se reproduire avec d'autres traits indésirables ?

Oui, le phénomène illustre un risque général avec les modèles de langage : les biais liés au ton, aux références culturelles ou à la structure argumentative peuvent émerger et se propager de la même manière si l'entraînement ne les encadre pas finement.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Défiler vers le haut