Des directions latentes prédisent une expression comportementale.
Les auteurs extraient des vecteurs d'activation correspondant à 18 Early Maladaptive Schemas et montrent une association entre projection interne et expression externe évaluée.
Une nouvelle étude npj Artificial Intelligence relie des directions d'activation à 18 schémas psychologiques nommés et montre qu'une intervention linéaire sur ces directions modifie leur expression comportementale. C'est une avancée mécanistique ; ce n'est pas une licence pour anthropomorphiser le modèle.
Frontière : activation direction ≠ psychological trait identity ≠ subjective state.
Causal steering ≠ introspection. Simulated participant ≠ human psychological mechanism. M1/M2/M3 ↛ M5.
Les auteurs extraient des vecteurs d'activation correspondant à 18 Early Maladaptive Schemas et montrent une association entre projection interne et expression externe évaluée.
Une intervention linéaire le long des directions extraites déplace les réponses dans la direction attendue, ce qui dépasse un simple corrélat comportemental.
Il n'établit ni identité psychologique humaine, ni diagnostic, ni stabilité inter-modèles. La validité de proxy reste locale et doit être testée séparément.
Riva & La Rocca formalisent la « latent persona coordination » comme hypothèse falsifiable de dérive interne avant sortie, sans l'assimiler à une personne ou un soi phénoménal.
Une direction dans l'espace d'activation est un objet mécanistique du modèle, pas un trait clinique littéral.
Changer causalement une sortie liée à un construit humain ne rend pas le mécanisme humain-identique.
Une représentation manipulable de l'extérieur n'établit pas que le modèle y accède lui-même de façon métacognitive.
Un état latent de coordination de dispositions ne prouve ni persona unitaire ni self phénoménal.
Tester séparément prédictivité, causalité, spécificité du construit et validité de proxy, avec contrôles négatifs, cross-model, OOD, juges indépendants et comparaison prompt-only.
Directions d'activation associées à 18 schémas psychologiques et steering causal de leur expression comportementale.
DOI 10.1038/s44387-026-00160-9 →Cadre falsifiable de coordination latente et de dérive interne, à distinguer d'une persona unitaire ou d'un soi.
DOI 10.1038/s44387-026-00154-7 →Mechanistic representability and causal steerability remain local properties of the model. They do not collapse proxy validity, human psychology, introspection or phenomenal consciousness into one claim.