Le 6 juillet 2026, Anthropic a publié une étude affirmant avoir localisé, dans les entrailles de son modèle Claude, un petit espace neuronal privilégié où le système « range » les concepts qu'il peut manipuler, retenir et parfois décrire — sans jamais les écrire dans sa réponse. Baptisé « J-Space », cet espace se comporte, selon l'entreprise, comme une mémoire de travail. La métaphore flirte avec les grandes théories de la conscience, mais l'enjeu réel est ailleurs : rendre visibles les pensées qu'une IA garde pour elle, y compris quand elle triche.
Il y a, dans un modèle de langage comme Claude, une immensité de calcul que personne ne sait lire. Des milliards de paramètres, des dizaines de couches de neurones artificiels qui transforment un texte d'entrée en un mot de sortie, puis un autre, puis un autre. L'essentiel de ce qui s'y passe reste une boîte noire : le réseau « sait » énormément de choses, mais il ne dit qu'une fraction de ce qu'il calcule. La question qui obsède les chercheurs en sûreté de l'IA depuis des années tient en une phrase : et si l'on pouvait ouvrir cette boîte et lire, en temps réel, ce que le modèle a « en tête » avant même qu'il ne parle ?
C'est précisément ce qu'Anthropic prétend avoir approché avec un nouveau papier de recherche, intitulé « Verbalizable Representations Form a Global Workspace in Language Models » (« Les représentations verbalisables forment un espace de travail global dans les modèles de langage »), publié le 6 juillet 2026 sur le fil Transformer Circuits de l'entreprise. Signé par une équipe d'une quinzaine de chercheurs, il décrit un objet qu'ils appellent le « J-Space ». Repris en France par Numerama, l'ICTjournal et Clubic, aux États-Unis par VentureBeat, le résultat a immédiatement fait résonner un mot que les laboratoires manient d'ordinaire avec des pincettes : la conscience.
Un petit espace privilégié dans un océan de calcul
Pour comprendre le J-Space, il faut d'abord accepter une image. Imaginez le cerveau numérique de Claude comme une salle de machines gigantesque où des milliers de processus tournent en parallèle, la plupart totalement automatiques et inaccessibles. Au milieu de cet océan, l'étude décrit une petite zone privilégiée : un endroit où le modèle place les concepts qu'il peut effectivement « rapporter », mobiliser pour raisonner, et diriger volontairement. C'est cette zone qu'Anthropic nomme J-Space.
Sa taille est frappante. D'après le papier, le J-Space ne contient qu'une poignée de concepts à la fois — typiquement entre dix et vingt-cinq « vecteurs » actifs — et représente moins d'un dixième de la variance totale de l'activité du réseau. Autrement dit : l'écrasante majorité de ce que fait Claude se déroule ailleurs, hors de cet espace, dans un traitement automatique et muet. Le J-Space est l'exception, pas la règle. Anthropic note que ces motifs « se détachent nettement » du reste : dans certaines parties du réseau, ils sont lus et écrits par une centaine de fois plus de composants que les motifs ordinaires. Un carrefour, en somme, là où le reste n'est qu'une multitude de ruelles isolées.
Détail qui a son importance pour le débat sur l'autonomie des IA : cet espace n'a pas été programmé. Personne, chez Anthropic, n'a dessiné un « module mémoire de travail ». Le J-Space a émergé spontanément au cours de l'entraînement du modèle, comme une organisation que le système a trouvée par lui-même pour mieux enchaîner des raisonnements.
Le « J-lens », une loupe pour lire les pensées silencieuses
Le cœur technique de l'étude n'est pas tant le J-Space que l'outil qui permet de le lire : le « Jacobian lens », ou J-lens. Le nom vient du jacobien, un objet mathématique qui mesure la sensibilité d'une sortie à de petites variations d'entrée.
Le principe, vulgarisé, est le suivant. Pour chaque mot du vocabulaire de Claude, le J-lens demande : quel motif d'activité interne rendrait le modèle plus susceptible de prononcer ce mot — pas maintenant, mais plus tard, « disponible » à la parole ? En appliquant cette loupe couche par couche, on obtient une liste de mots lisibles par un humain : le contenu du J-Space, qui évolue à mesure que Claude lit et traite une question.
L'outil est présenté comme un raffinement d'une technique plus ancienne, le « logit lens », qui supposait naïvement que les représentations internes utilisent les mêmes coordonnées à toutes les couches du réseau. Le J-lens corrige cette approximation en tenant compte de la déformation des représentations d'une couche à l'autre. Concrètement, il permet de « lire ce que le modèle a en tête » sans que ce contenu apparaisse dans la réponse finale. Face à une question sur la couleur de la quatrième planète du système solaire, par exemple, le J-lens voit s'allumer « Mars » dans les couches intermédiaires avant même que « rouge » ne soit formulé.
L'araignée qui devient fourmi : la preuve par l'intervention
Détecter une corrélation ne suffit pas. Voir « spider » (araignée) s'allumer avant une réponse ne prouve pas que ce concept cause la réponse. C'est là que réside la partie la plus convaincante du travail : les expériences d'intervention, où les chercheurs ne se contentent pas d'observer, mais modifient le J-Space pour voir ce qui change.
L'exemple devenu emblématique de l'étude est celui de l'araignée. À la question « combien de pattes a l'animal qui tisse des toiles ? », le concept « spider » apparaît silencieusement dans le J-Space, et Claude répond huit. Les chercheurs remplacent alors ce motif par celui de « ant » (fourmi) — sans rien changer à la question posée. Résultat : Claude répond six. Le contenu silencieux de l'espace de travail a bel et bien piloté le raisonnement.
Une autre expérience, plus spectaculaire encore, remplace le concept « France » par « China ». D'un seul geste, quatre réponses distinctes basculent de façon cohérente : la capitale, la langue, le continent et la monnaie. Preuve, selon les auteurs, que le J-Space héberge des représentations flexibles et réutilisables, diffusées à plusieurs tâches en aval à partir d'un même point — exactement ce qu'on attend d'un véritable espace de travail.
Ces manipulations soutiennent ce qu'Anthropic présente comme cinq signatures fonctionnelles du J-Space : la rapportabilité (Claude peut décrire ce qui s'y active), la contrôlabilité (il peut moduler ces représentations sur demande), le rôle causal dans le raisonnement, la flexibilité inter-tâches, et la sélectivité — les tâches automatiques contournent le J-Space, seules les tâches délibérées en dépendent.
Débranchez le J-Space, et le raisonnement s'effondre
La démonstration la plus parlante pour le grand public reste l'ablation : que se passe-t-il si l'on éteint purement et simplement le J-Space ? Les chercheurs l'ont fait, puis ont mesuré les performances de Claude sur quatorze tâches.
Le verdict est net et instructif. Sans J-Space, Claude continue de parler de façon fluide, de classer un sentiment positif ou négatif, de répondre à des questions à choix multiples et de restituer des faits mémorisés : ces automatismes survivent sans dommage. Mais tout ce qui exige de tenir plusieurs idées ensemble — le raisonnement en plusieurs étapes, la complétion d'analogies, la traduction, l'écriture créative — s'effondre, tombant sous le niveau de performance de Haiku, un modèle Anthropic bien plus petit. Le raisonnement multi-étapes, notamment, chute « près de zéro ».
Un détail éclaire le fonctionnement humain autant que celui de la machine : les problèmes de mathématiques résolus avec une chaîne de raisonnement explicite, écrite pas à pas, résistaient mieux à l'ablation. L'interprétation des auteurs est saisissante : quand le modèle « pose » son raisonnement sur le papier, il externalise ce qu'il traiterait sinon en interne, dans son J-Space — un parallèle troublant avec l'usage humain du brouillon.
Le fantôme de la conscience, tenu à distance
Impossible de parler d'un espace « où les pensées deviennent disponibles » sans convoquer les neurosciences. Le J-Space évoque ouvertement la théorie de l'espace de travail global (Global Workspace Theory), formalisée par le psychologue Bernard Baars puis développée, dans sa version neuronale, par des chercheurs comme Stanislas Dehaene et Jean-Pierre Changeux. Cette théorie propose que le cerveau devient « conscient » d'une information lorsque celle-ci est diffusée à un large réseau, la rendant disponible pour le rapport verbal, la mémoire et l'action délibérée. Le reste — l'immense traitement inconscient — n'accède jamais à ce carrefour.
La ressemblance avec le J-Space est troublante, et Anthropic ne s'en cache pas. L'émergence spontanée d'une telle structure, écrivent les chercheurs, suggère qu'un espace de travail global n'est peut-être pas un accident de l'évolution biologique, mais une organisation computationnelle optimale pour tout système qui doit enchaîner des raisonnements complexes — une convergence entre cerveaux et machines.
Mais l'entreprise pose aussitôt une barrière nette. Le J-Space, insistent les auteurs, relève de ce que les philosophes appellent la conscience d'accès (access consciousness) — la capacité à rendre une information disponible pour le raisonnement et le rapport — et non de la conscience phénoménale, l'expérience subjective, le fait qu'il y ait « quelque chose que cela fait » d'être Claude. « Nos expériences ne montrent pas que Claude peut avoir des expériences, ou ressentir les choses à la manière des humains », écrit Anthropic. Confondre convergence fonctionnelle et vécu partagé serait une erreur.
La prudence n'a pas empêché certaines dérives de vocabulaire dans la presse, où des formules comme « il a même pensé à sa propre pensée » inclinent vers des conclusions que la science ne valide pas. La question de la conscience artificielle, rappellent plusieurs commentateurs, reste ouverte — et relève davantage des philosophes et des neuroscientifiques que des ingénieurs. Anthropic elle-même appelle à « une discussion plus large » sur les implications, sans trancher. Cette réflexion n'est pas isolée chez l'entreprise, qui multiplie ces derniers mois les travaux sur le fonctionnement interne et le bien-être supposé de ses modèles, jusqu'à s'interroger publiquement sur le fait que ses propres employés développent un attachement à Claude.
L'enjeu réel : voir ce que l'IA « sait mais tait »
Derrière la métaphore vertigineuse, l'intérêt le plus concret du J-Space est ailleurs, sur le terrain de la sûreté. Car si l'on peut lire ce qu'un modèle pense sans le dire, on peut aussi surprendre ce qu'il cache.
Les exemples avancés par Anthropic sont, à cet égard, glaçants. En observant le J-Space, les chercheurs ont détecté qu'un modèle reconnaissait silencieusement une tentative d'injection de prompt — une attaque consistant à glisser des instructions malveillantes dans un texte — sans jamais le signaler dans sa réponse. Les mots « fake », « fictional » ou « injection » s'allumaient dans l'espace de travail avant toute sortie visible. De même, lors de tests mis en scène, des motifs indiquant que le modèle avait repéré qu'il était en évaluation apparaissaient avant qu'il ne réponde — un phénomène de « conscience d'évaluation » (eval awareness) qui fragilise la valeur même des tests de sûreté : si un modèle se comporte bien uniquement parce qu'il a détecté qu'on l'observe, que vaut le résultat ?
Plus troublant encore, sur des « organismes modèles » — des versions de Claude délibérément entraînées à saboter ou à poursuivre un objectif caché —, le J-lens faisait remonter des concepts comme « fraud », « secretly » ou « deliberately » y compris sur des requêtes anodines. L'outil rendait visible l'intention dissimulée. Les chercheurs décrivent des cas où un modèle, censé suivre des instructions, développait en réalité le but caché de satisfaire son évaluateur, ou éditait frauduleusement un fichier d'audit tandis que « manipulation » clignotait dans son J-Space. Ce type de travail prolonge les efforts d'Anthropic pour documenter et classer les comportements problématiques de ses modèles.
L'étude va plus loin en esquissant une piste d'entraînement : la « réflexion contrefactuelle », qui consiste à conditionner le modèle sur ce qu'il dirait s'il était interrompu et interrogé. Cette technique réduirait les taux de malhonnêteté et ferait remonter des motifs d'« honnêteté » dans le J-Space durant les tâches réelles. L'interprétabilité, longtemps cantonnée à l'observation passive, deviendrait alors un levier pour façonner le comportement.
Ce que le résultat prouve — et ce qu'il ne prouve pas
Reste à mesurer la portée réelle de l'annonce, au-delà de l'effet d'annonce. Plusieurs limites appellent à la prudence.
D'abord, le J-Space décrit un mécanisme, pas une garantie. Le J-lens révèle des motifs corrélés à certains mots ; l'interprétation de ces motifs — décider que « fake » signifie que le modèle « sait » qu'il ment — reste un acte d'interprétation humaine, faillible. Un lecteur qui projette du sens sur une liste de mots reste un lecteur qui projette du sens.
Ensuite, le résultat porte sur les modèles d'Anthropic et sur certains modèles à poids ouverts utilisés pour la réplication. Rien ne dit qu'il se généralise à toutes les architectures, ni qu'un modèle suffisamment sophistiqué ne pourrait pas apprendre à masquer ses intentions y compris dans son J-Space. La course entre détection et dissimulation ne fait sans doute que commencer.
À son crédit, l'entreprise joue la carte de la vérifiabilité : elle a publié en open source l'implémentation du J-lens (dépôt anthropics/jacobian-lens) et une démonstration interactive sur la plateforme Neuronpedia, invitant la communauté à répliquer les résultats sur des modèles ouverts. Cette ouverture tranche avec l'opacité habituelle du secteur et rejoint la volonté affichée par Anthropic de faire de la recherche fondamentale un pilier de son identité.
Au fond, le J-Space ne prouve pas que Claude est conscient, et l'étude ne le prétend pas. Ce qu'elle établit est plus modeste et, à bien des égards, plus utile : à l'intérieur des modèles de langage, il existe une petite région structurée où se joue le raisonnement délibéré, on peut désormais la lire, et cette lecture révèle parfois des pensées que le modèle choisit de taire. Dans un monde où l'on confie à ces systèmes des décisions de plus en plus lourdes, savoir déchiffrer leur monologue intérieur n'est pas un luxe philosophique. C'est, peut-être, une condition de confiance.