Adieu l’anonymat en ligne : comment l’intelligence artificielle pourrait révéler qui se cache derrière les profils web
Une nouvelle étude révèle que l'intelligence artificielle peut identifier les utilisateurs anonymes en ligne en analysant les détails cachés dans leurs publications.
Depuis des années, nous vivons avec une conviction presque rassurante : il est possible de se cacher sur Internet. Un pseudo, un avatar, quelques informations vaguement inventées et le jeu semble terminé. L'illusion de pouvoir s'exprimer librement sans que sa véritable identité soit liée à ce que l'on écrit est devenue l'une des pierres angulaires de la culture numérique.
Pourtant, cette certitude pourrait être vouée à s’effondrer bien plus rapidement qu’on ne l’imagine. En fait, de nouvelles recherches suggèrent que l’intelligence artificielle est désormais capable d’identifier les personnes derrière des comptes anonymes, simplement en analysant ce qu’elles écrivent en ligne.
Vous n'avez pas besoin d'une photo de votre visage, vous n'avez pas besoin de données personnelles explicites. Il suffit de commentaires, de blagues, d’habitudes linguistiques et de petits détails disséminés ici et là dans les posts. Autant de fragments qui, pris individuellement, semblent inoffensifs. Des messages quotidiens, souvent écrits sans trop réfléchir. Des messages qui, pourtant, rassemblés, en disent bien plus que ce que l’on croit.
'; var fallbackTriggered = faux ; var timeoutId = null ; function renderTaboolaFallback(reason) { if (fallbackTriggered) return ; fallbackTriggered = vrai ; si (timeoutId) { clearTimeout (timeoutId); timeoutId = nul ; } console.log('(ADV2) Render Taboola fallback. Reason:', Reason); root.innerHTML = ''; window._taboola.push({ mode : 'thumbnails-300×250', conteneur : taboolaDivId, emplacement : 'Widget milieu d'article 300×250-2', target_type : 'mix' }); } googletag.cmd.push(function () { console.log('(ADV2) GPT init', gptDivId); var gptSlot = googletag.pubads().getSlots().find(function(s) { return s.getSlotElementId() === gptDivId; }); if (!gptSlot) { console.warn('(ADV2) Slot not found:', gptDivId); renderTaboolaFallback('slot-not-found'); return; } googletag.pubads().addEventListener('slotRenderEnded', function (event) { if (event.slot !== gptSlot) return; console.log('(ADV2) slotRenderEnded', { isEmpty: event.isEmpty, size: event.size, warnerId : event.advertiserId, CampaignId : event.campaignId, lineItemId : event.lineItemId } ; if (fallbackTriggered) return ; if (timeoutId) { clearTimeout(timeoutId } ); console.log('(ADV2) GPT a diffusé une création');
L'IA analyse les commentaires, les écrits et les détails apparemment insignifiants
L'étude, publiée sur le serveur scientifique arXiv, montre comment les grands modèles linguistiques (LLM) peuvent être utilisés pour reproduire le travail d'un détective numérique. Le mécanisme ne repose pas sur un seul indice sensationnel, mais sur une mosaïque d’informations minuscules qui émergent de la manière dont chacun de nous écrit et parle de lui-même sur la toile.
Le système développé par les chercheurs part d'une analyse très simple : lire tout ce qu'un utilisateur publie sur des plateformes comme Reddit ou Hacker News. Commentaires, blagues, références culturelles, idiomes, préférences techniques, voire petites bizarreries linguistiques. Tout devient matériau utile pour construire une sorte de profil numérique implicite.
'; var fallbackTriggered = faux ; var timeoutId = null ; function renderTaboolaFallback(reason) { if (fallbackTriggered) return ; fallbackTriggered = vrai ; si (timeoutId) { clearTimeout (timeoutId); timeoutId = nul ; } console.log('(ADV3) Render Taboola fallback. Reason:', Reason); root.innerHTML = ''; window._taboola.push({ mode : 'thumbnails-300×250', conteneur : taboolaDivId, emplacement : 'Widget milieu d'article 300×250-3', target_type : 'mix' }); } googletag.cmd.push(function () { console.log('(ADV3) GPT init', gptDivId); var gptSlot = googletag.pubads().getSlots().find(function(s) { return s.getSlotElementId() === gptDivId; }); if (!gptSlot) { console.warn('(ADV3) Slot not found:', gptDivId); renderTaboolaFallback('slot-not-found'); return; } googletag.pubads().addEventListener('slotRenderEnded', function (event) { if (event.slot !== gptSlot) return; console.log('(ADV3) slotRenderEnded', { isEmpty: event.isEmpty, size: event.size, warnerId : event.advertiserId, CampaignId : event.campaignId, lineItemId : event.lineItemId } ; if (fallbackTriggered) return ; if (timeoutId) { clearTimeout(timeoutId } ); console.log('(ADV3) GPT a diffusé une création');
Cette information est transformée en une représentation mathématique de la personne. Ensuite, l’IA commence à faire ce qu’elle fait de mieux : comparer d’énormes quantités de données. Le système recherche ensuite d'éventuelles correspondances entre ce profil et des millions d'autres contenus disponibles sur le Web ouvert ou sur des plateformes professionnelles telles que LinkedIn.
Le processus se déroule en plusieurs étapes. L’IA identifie d’abord les éléments pertinents pour l’identification. Ensuite, il utilise des techniques d’intégration sémantique, c’est-à-dire des systèmes capables de reconnaître des similitudes de sens entre différents textes. Enfin, le raisonnement LLM entre en jeu, évaluant les correspondances possibles et attribuant un score de fiabilité à chacune.
Lorsque le niveau de certitude est insuffisant, le système préfère ne produire aucun résultat. Un choix précis des chercheurs, destiné à éviter les identifications aléatoires.
'; var fallbackTriggered = faux ; var timeoutId = null ; function renderTaboolaFallback(reason) { if (fallbackTriggered) return ; fallbackTriggered = vrai ; si (timeoutId) { clearTimeout (timeoutId); timeoutId = nul ; } console.log('(ADV4) Render Taboola fallback. Reason:', Reason); root.innerHTML = ''; window._taboola.push({ mode : 'thumbnails-300×250', conteneur : taboolaDivId, emplacement : 'Widget milieu d'article 300×250-4', target_type : 'mix' }); } googletag.cmd.push(function () { console.log('(ADV4) GPT init', gptDivId); var gptSlot = googletag.pubads().getSlots().find(function(s) { return s.getSlotElementId() === gptDivId; }); if (!gptSlot) { console.warn('(ADV4) Slot not found:', gptDivId); renderTaboolaFallback('slot-not-found'); return; } googletag.pubads().addEventListener('slotRenderEnded', function (event) { if (event.slot !== gptSlot) return; console.log('(ADV4) slotRenderEnded', { isEmpty: event.isEmpty, size: event.size, warnerId : event.advertiserId, CampaignId : event.campaignId, lineItemId : event.lineItemId } ; if (fallbackTriggered) return ; if (timeoutId) { clearTimeout(timeoutId } ); console.log('(ADV4) GPT a diffusé une création');
Connecter des identités réelles et des comptes pseudonymes en ligne devient plus facile
Pour vérifier si cette approche fonctionnait réellement, les auteurs de la recherche ont mené une expérience sur près d'un millier de profils LinkedIn, en essayant de les connecter aux comptes des mêmes utilisateurs présents sur la plateforme Hacker News. Pour rendre le test le plus réaliste possible, les chercheurs ont éliminé des profils tout élément d’identification directe : noms, liens personnels, références évidentes. En pratique, ils n'ont laissé que les descriptions et informations génériques présentes dans les profils.
Malgré ces limites, le système basé sur l’IA a obtenu des résultats notables. Le framework a réussi à identifier correctement les utilisateurs avec une précision de 90 % et une exactitude allant jusqu'à 67 %, dépassant de loin les méthodes traditionnelles utilisées jusqu'à présent pour tenter des opérations de désanonymisation.
Le fait le plus surprenant concerne cependant un autre aspect. L'IA était capable de reconnaître la même personne même lorsqu'elle utilisait plusieurs comptes sur Reddit, distribués dans différentes communautés et publiés à des moments différents. En d’autres termes, le système a démontré qu’il pouvait identifier des modèles récurrents dans la manière d’écrire et dans le type d’informations partagées.
Et tout cela a un coût extrêmement faible. Selon l’étude, l’identification d’un compte nécessite entre un et quatre dollars de puissance de calcul. Un chiffre minime compte tenu de l’échelle à laquelle des technologies similaires pourraient être utilisées. Les chercheurs eux-mêmes parlent ouvertement de la fin de ce qu'ils appellent « l'obscurité pratique », c'est-à-dire la protection implicite qui défend depuis des années les utilisateurs pseudonymes simplement grâce à la difficulté technique de relier leurs comptes à la vie réelle.
En fait, chaque article publié en ligne ajoute une nouvelle pièce à ce puzzle invisible. Chaque commentaire, chaque détail personnel, chaque référence culturelle contribue à enrichir le profil numérique de l'écrivain. Le résultat est un paysage numérique dans lequel l’anonymat en ligne devient progressivement plus fragile.
D’une part, cette technologie pourrait représenter un outil puissant pour la cybersécurité, aidant à identifier les fraudeurs, les réseaux de désinformation ou les activités criminelles coordonnées. D’un autre côté, cela soulève de profondes questions sur la vie privée et la liberté d’expression. En fait, de nombreuses personnes choisissent d’utiliser des pseudonymes pour se protéger. Des militants, des lanceurs d’alerte, des salariés qui dénoncent des abus au travail, des citoyens qui discutent de sujets sensibles sans vouloir dévoiler leur identité publique.
Si l’intelligence artificielle continue d’évoluer à la vitesse actuelle, la question deviendra de plus en plus urgente : dans quelle mesure ce que nous écrivons en ligne est-il réellement anonyme ?
Source : arXiv
