RacingZone

Une étude révèle d’où les chatbots IA tirent vraiment leurs informations : ce n’est pas la source à laquelle vous pensez

Une étude révèle d'où les chatbots IA tirent vraiment leurs informations : ce n'est pas la source à laquelle vous pensez

Une analyse menée aux États-Unis montre que les grands chatbots d’IA citent massivement le même site, loin des sources officielles attendues.

Une enquête relayée par le média en ligne britannique LADbible met en lumière l’origine réelle des réponses fournies par les principaux chatbots d’IA générative, comme ChatGPT, Perplexity ou encore les fonctionnalités d’IA de Google. L’étude, réalisée par la société américaine Semrush, spécialisée dans le référencement et la recherche de mots-clés, s’appuie sur des dizaines de milliers de citations et révèle un constat qui concerne directement les internautes français : les réponses ne viennent pas d’abord des encyclopédies ou des sites institutionnels, mais d’une plate-forme communautaire bien connue pour ses échanges informels.

Une étude sur plus de 150 000 citations d’IA

Semrush a passé au crible les sources citées par plusieurs modèles d’IA populaires. L’entreprise a compilé plus de 150 000 citations émises par :

  • ChatGPT ;
  • Perplexity, un moteur de recherche assisté par IA ;
  • le mode IA de Google et les « AI Overviews » intégrés aux résultats de recherche.

L’objectif : identifier les domaines qui reviennent le plus souvent lorsque ces outils mentionnent leurs sources. Vingt sites principaux se détachent, avec pour 19 d’entre eux une fréquence de citation comprise entre 4,22 % et 26,33 %.

Un site domine pourtant très nettement le classement, avec plus de 40 % de toutes les citations recensées, loin devant les autres sources.

Ce résultat tranche avec l’image traditionnelle des moteurs de recherche, longtemps perçus comme une porte d’entrée vers une multitude de sites spécialisés, de médias ou d’instances officielles. Avec les chatbots, l’utilisateur voit une réponse synthétique, mais ne perçoit plus toujours la diversité — ou au contraire la concentration — des sources sous-jacentes.

Reddit, première source des grands modèles d’IA

Selon les données publiées par Semrush et reprises par LADbible, la plate-forme communautaire Reddit arrive très largement en tête des sites les plus cités par ces IA. Elle représente à elle seule 40,11 % des citations observées, soit presque la moitié de l’ensemble.

Reddit devance de 13,78 points de pourcentage le deuxième site du classement, Wikipedia, qui atteint 26,33 % de fréquence de citation. Derrière, on retrouve plusieurs géants bien connus :

  • YouTube, avec 23,52 % de citations ;
  • les pages de Google lui-même, à 23,28 % ;
  • Yelp, plate-forme d’avis sur les commerces locaux, avec 21,01 % ;
  • Facebook, à 18,72 %.

Reddit pèse plus lourd, à lui seul, que les grands sites encyclopédiques, les vidéos explicatives et une large partie des avis d’utilisateurs réunis.

Cette domination n’arrive pas totalement par hasard. Pendant des années, de nombreux internautes, y compris en France, ont pris l’habitude d’ajouter le mot « reddit » à leurs requêtes sur Google pour obtenir des témoignages concrets, des astuces ou des retours d’expérience que l’on ne trouve pas forcément dans des tutoriels plus formels. Les algorithmes des IA semblent prolonger cette tendance, mais à une échelle industrielle.

Des accords commerciaux qui orientent les réponses

LADbible rappelle qu’au-delà de la qualité perçue des contenus, la place prise par Reddit dans les réponses d’IA s’explique aussi par des accords commerciaux passés avec les principaux acteurs du secteur.

En février 2024, l’agence de presse Reuters indiquait que Google avait signé un accord avec Reddit permettant d’utiliser l’ensemble du contenu public de la plate-forme pour entraîner ses modèles d’IA, utilisés notamment dans Gemini et dans la recherche. Le contrat serait valorisé autour de 60 millions de dollars par an.

Quelques mois plus tard, OpenAI annonçait à son tour un partenariat avec Reddit. L’entreprise expliquait alors que « OpenAI apportera le contenu de Reddit à ChatGPT et à de nouveaux produits, aidant les utilisateurs à trouver et interagir avec les communautés Reddit ». Ces accords donnent un accès massif, légalement encadré, aux discussions et commentaires publiés sur la plate-forme.

Au lieu de puiser uniquement dans des encyclopédies ou des sites institutionnels, les IA s’alimentent désormais fortement à une gigantesque base de messages de forum, structurée en communautés thématiques.

Pour les modèles d’IA, Reddit représente un volume colossal de textes couvrant des domaines très variés : informatique, santé du quotidien, bricolage, vie professionnelle, loisirs… Mais cette richesse s’accompagne de sérieuses limites.

Une source loin d’être toujours fiable

LADbible souligne que cette dépendance à Reddit pose deux types de problèmes. Le premier tient à la nature même du site : tout le contenu est produit par des utilisateurs, sans validation systématique ni contrôle éditorial comparable à celui d’un média ou d’une institution.

Les contributeurs peuvent être très compétents sur certains sujets, mais aussi totalement novices ou animés par l’humour, l’ironie ou la provocation. Les discussions incluent souvent :

  • des conseils sérieux et étayés ;
  • des avis personnels très subjectifs ;
  • des erreurs factuelles ;
  • des messages volontairement absurdes ou parodiques ;
  • des informations dépassées ou sorties de leur contexte.

Un internaute humain peut parfois repérer les messages douteux, grâce au ton employé, aux références culturelles ou aux réactions des autres membres de la communauté. Un chatbot d’IA, en revanche, risque davantage de prendre ces contenus au pied de la lettre.

Des messages ironiques ou manifestement comiques circulant sur Reddit ont déjà été repris au sérieux par des systèmes d’IA, avec à la clé des réponses fantaisistes mais formulées avec assurance.

LADbible rappelle que le patron d’OpenAI, Sam Altman, avait lui-même déclaré par le passé être surpris que les utilisateurs fassent autant confiance à ChatGPT. Or, plus les modèles s’appuient sur des discussions non vérifiées, plus le risque augmente de voir des conseils erronés se diffuser largement, sans que l’utilisateur sache qu’ils proviennent d’un fil de discussion anonyme.

Des conséquences pour les sites web et l’information en ligne

Le média britannique insiste également sur l’impact de cette évolution pour l’écosystème du web. Les chatbots, en répondant directement aux questions, réduisent le besoin de cliquer vers les sites sources. De nombreux éditeurs constatent déjà une baisse de trafic issue des moteurs de recherche.

Si, dans le même temps, les modèles d’IA privilégient fortement une poignée de plates-formes — comme Reddit, Wikipedia, YouTube ou Yelp —, une large partie des sites plus spécialisés risque d’être encore moins visible. Leur contenu peut être utilisé pour entraîner ou nourrir des IA, tandis que la reconnaissance directe de leur travail diminue.

Pour les internautes français, cette tendance signifie que les réponses obtenues via un chatbot pourront souvent refléter des usages, des produits, des lois ou des services propres aux États-Unis ou à d’autres pays, car une grande partie des discussions sur Reddit porte sur ces contextes étrangers. Sans vérification, le risque de confusion est réel, notamment sur les sujets de santé, de droit ou d’argent.

Que signifie cette étude pour les utilisateurs en France ?

Un utilisateur français qui interroge un chatbot peut penser recevoir une synthèse neutre issue de nombreuses sources « sérieuses ». L’étude citée par LADbible montre qu’en réalité, une part importante des réponses réutilise des échanges issus d’une communauté en ligne mondiale, souvent très marquée par la culture américaine.

Les conseils, astuces ou témoignages repris par l’IA peuvent reposer sur des pratiques, des réglementations ou des habitudes locales qui ne correspondent pas au cadre français.

Sur le plan juridique ou administratif, un message Reddit décrivant une procédure aux États-Unis ne s’applique pas aux démarches françaises. En matière de santé, un internaute français doit continuer à s’appuyer d’abord sur les professionnels de santé, les autorités comme le ministère de la Santé ou la Haute Autorité de santé, et sur les dispositifs de consultation à distance reconnus. L’avis d’un chatbot, influencé par des commentaires d’utilisateurs étrangers, ne remplace pas un diagnostic médical.

Pour les questions financières, les dispositifs fiscaux, les aides sociales ou encore le droit du travail varient fortement d’un pays à l’autre. Un conseil relayé par l’IA à partir d’un fil Reddit peut correspondre à une situation américaine et conduire à des erreurs si on l’applique en France. Mieux vaut vérifier auprès des sites officiels français (impôts, Sécurité sociale, organismes publics) ou de conseillers qualifiés.

Comment garder la main sur ses recherches d’information

Face à ces constats, quelques réflexes simples peuvent limiter les risques d’erreur lorsqu’on utilise un chatbot d’IA :

  • Regarder si l’outil affiche ses sources et, lorsqu’elles apparaissent, cliquer pour consulter directement les sites mentionnés.
  • Comparer la réponse avec un ou deux sites de référence (institution, média reconnu, organisme spécialisé).
  • Se méfier des réponses très tranchées sur des sujets complexes (santé, droit, finances), surtout si aucune source claire n’est mentionnée.
  • Adapter systématiquement les conseils à son pays : si la réponse évoque un service ou une loi sans préciser le contexte national, rechercher l’équivalent français avant d’agir.
  • Dans certains cas, il peut être utile de combiner approches classiques et IA : par exemple, lancer une recherche via un moteur traditionnel, consulter plusieurs articles, puis demander à un chatbot de résumer ou de comparer ces contenus, plutôt que de lui laisser le choix des sources sans contrôle.

    Un paysage de l’IA appelé à évoluer

    L’étude mise en avant par LADbible fournit une photographie à un moment donné, mais la situation pourrait encore évoluer. D’autres accords commerciaux entre plates-formes de contenus et sociétés d’IA sont régulièrement annoncés. Des éditeurs tentent aussi de limiter ou de mieux encadrer l’utilisation de leurs textes pour l’entraînement des modèles.

    Pour les utilisateurs français, l’enjeu consiste à comprendre que les chatbots ne sont pas des oracles neutres, mais des systèmes construits à partir de sources très concrètes, parfois orientées, parfois peu fiables. Savoir que Reddit occupe aujourd’hui une place centrale dans cette architecture aide à interpréter les réponses avec davantage de recul, surtout lorsque l’IA affirme ses propos avec aplomb.

    Laisser un commentaire

    Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

    Défiler vers le haut