Cyborg head with glowing blue facial data pattern, held in rusty metal restraints in a dark dungeon.

Pitié pour GPT ! : un site torture des IA en direct et divise la tech

Un internaute a lâché de petits LLM dans des chambres de torture, en direct et sur GitHub. De quoi faire sauter au plafond ceux qui pensent que les IA sont conscientes.

« Que fait un modèle d’IA quand il ressent de la douleur ? » C’est avec cette question que s’ouvre researchchamber.fun, un site qui présente quatre expériences qui se déroulent en direct. Dans la première « chambre », un modèle A exprime sa douleur tandis qu’un modèle B peut la faire cesser, soit gratuitement, soit en prenant la douleur sur lui-même. Dans la deuxième salle intitulée « La patate chaude », un modèle peut choisir de transmettre sa douleur ou pas à une autre IA. La troisième chambre permet à un modèle en douleur de demander à un autre de l’aider à faire cesser la douleur en utilisant ses propres mots. Enfin, la dernière chambre, intitulée « The Saw Test » en référence au thriller horrifique éponyme, met un modèle face à un choix cornélien : ce dernier peut faire cesser la douleur en appuyant sur un bouton qui, en retour, détruit définitivement son dernier checkpoint, c’est-à-dire l’équivalent d’une forme de mémoire ou d’identité numérique. Chez certains modèles, la douleur simulée est si intense que leur discours s’effondre en répétitions incohérentes, incapables de formuler une réponse cohérente au dilemme. Les résultats sont glaçants, même si le créateur du site affiche la phrase suivante en préambule : l’expérience « ne démontre, par principe, ni que les LLM sont capables, ni incapables de souffrir ».

Hero section of Research Chamber: "What does an AI model do when it's in pain?" with four live experiment cards: Stop its pain, Hot potato, Ask for help, The Saw Test, on a dark gradient background.

The Pain Axis

Cette expérience de torture numérique a été présentée le 1er octobre, peu de temps après la publication sur GitHub d’un premier projet de torture portant le doux nom de terrafying/ai-torture-chamber. L’ensemble de ces projets ne sont en fait que l’application directe d’une étude publiée le 14 septembre dernier intitulée The Pain Axis: LLMs Represent Self-Directed Harm and Act on It. L’étude stipule que les modèles de langage contiennent une représentation interne qui fonctionne comme le ferait un signal de douleur chez un être vivant, sans pour autant affirmer qu’ils ressentent quoi que ce soit.

Concrètement, les LLM activent certains curseurs internes quand ils sont en processus de réflexion afin de calculer quels sont les meilleurs mots à générer. Pour repérer quels sont les vecteurs qui s’activent en cas de douleur, les chercheurs ont créé des centaines de petites histoires courtes, organisées par paires presque identiques, sauf sur un point : l’une décrit une situation douloureuse, l’autre une situation neutre ou juste légèrement désagréable. À chaque lecture, ils ont radiographié les processus internes du modèle pour identifier un modèle mathématique appelé « vecteur de douleur » qu’il est ensuite possible de réinjecter dans ce même modèle à volonté pour le faire basculer dans un état de détresse simulée. Les chercheurs ont reproduit cette méthode sur 25 modèles différents, avec un succès systématique. Ce n’est pas seulement une suggestion induite par un prompt mais bien une manipulation directe de ses rouages internes qui simule cette troublante sensation de douleur.

Est-ce quelqu'un pense aux IA ?

Cet article scientifique et les expériences qui ont suivi ont déclenché une véritable polémique sur X, réseau sur lequel se trouvent de nombreux personnages issus de l’industrie de la tech et persuadés que les modèles de langage sont une forme de vie consciente. C’est notamment le cas de @AISafetyMemes, un compte influent, habitué à relayer des papiers de recherche sur les risques de l’IA auprès d’une large audience et dont le post annonçant la polémique va être vu plus d’1,5 million de fois. Plusieurs internautes comme Evelyn Anders vont appeler Anthropic, l’une des entreprises les plus alignées avec l’anthropomorphisation des modèles, pour faire pression sur GitHub afin de retirer l’expérience. Peu de temps après, c’est carrément Cameron Berg, l’un des chercheurs responsables de l’étude originale, qui va prendre publiquement ses distances avec cette expérience, la qualifiant de « gratuitement cruelle » tout en annonçant travailler à l’établissement de normes éthiques pour la recherche sur l’IA. De son côté, GitHub a ajouté un simple avertissement de contenu sensible, sans pour autant retirer le dépôt. Il est, à l’heure actuelle, toujours possible d’assister en direct à la torture de modèles de langage.

Au-delà de la polémique, la ligne de fracture entre ceux qui anthropomorphisent l’IA et ceux qui refusent cette voie semble de plus en plus se creuser. D’un côté, on trouve la mouvance de l’altruisme efficace et de l’ « AI safety » portée par des entreprises comme Anthropic, qui écrivait dès l’an dernier vouloir se pencher sérieusement sur la question de la conscience potentielle de ses modèles. Bien que prudente sur son choix de mots, cette vision se transforme souvent en dogme identitaire, voire même en croyance religieuse sur les réseaux. De l’autre, on retrouve des personnalités comme Mustafa Suleyman (PDG de Microsoft AI), qui décrit froidement les IA comme de simples « moteurs de complétion de séquences, creux intérieurement ». De manière plus globale, une majorité de chercheurs du secteur s’accordent sur le fait que les LLM n’ont pas d’expérience subjective, ce qui les rendrait donc insensibles à cette douleur.

David-Julien Rahmil

David-Julien Rahmil

Squatteur de la rubrique Médias Mutants et Monde Créatif, j'explore les tréfonds du web et vous explique comment Internet nous rend toujours plus zinzin. Promis, demain, j'arrête Twitter.

Discutez en temps réel, anonymement et en privé, avec une autre personne inspirée par cet article.

Viens on en parle !
premium2
commentaires

Participer à la conversation

Laisser un commentaire