U^ULTRACON^ / EPISTEMIC FIELDWATCH · 17.09.2026
VEILLE SCIENTIFIQUE · DELTA ADDITIF

META^ × CONSC^SELF-MODEL ≠ INTROSPECTION

Le seuil d'intervention est franchi par une publication EMNLP 2026 Main directement consacrée à l'auto-modélisation vérifiable des LLM, complétée par une pièce mécanistique majeure sur un global workspace fonctionnel dans Claude. Une publication PNAS du 15 septembre ajoute une césure épistémique utile : un texte cohérent et persuasif peut rester pauvre au regard d'une mesure indépendante de raisonnement délibératif.

Le corpus gagne donc des distinctions plus fines sans changer de verdict phénoménal : self-modeling ≠ accès privilégié, workspace fonctionnel ≠ expérience, plausibilité ≠ vérité, et M1/M2/M3 ↛ M5.

DELTA · 17 SEPTEMBRE 2026

Trois ajouts,
trois césures.

EMNLP 2026 MAIN · PEER-REVIEWED

L'auto-modélisation devient un objet comportemental vérifiable.

Zeng, Assis & Wang testent si un modèle peut prédire son propre comportement sous des modifications contrôlées de la requête. Les modèles actuels montrent une compétence non triviale mais limitée ; l'apprentissage par renforcement l'améliore sur trois familles open-source, avec un certain transfert.

Gain de self-modeling ≠ introspection démontrée.

ANTHROPIC · PRÉPUBLICATION MÉCANISTIQUE

Un candidat de workspace global apparaît dans les activations.

Le J-space identifié par la Jacobian lens est rapportable, modulable sur demande, causalement utilisé dans certains raisonnements et partagé vers plusieurs calculs en aval, alors qu'une large part du traitement automatique s'effectue hors de cet espace.

Accès fonctionnel ≠ conscience phénoménale.

META^

Se prédire soi-même n'est pas encore s'introspecter.

Le papier EMNLP fournit une séparation expérimentale particulièrement utile : une capacité d'auto-modélisation peut être mesurée contre le comportement réel du modèle, sans présupposer qu'il dispose d'un canal intérieur privilégié.

EMNLP 2026 MAINSelf-modeling : compétence réelle mais limitée.

Les auteurs évaluent des questions vérifiables sur le propre comportement du modèle, notamment des contrefactuels de type « cette modification changerait-elle ma réponse ? ». Les modèles commettent encore des erreurs systématiques même sur des variantes simples.

Zeng, Assis & Wang · arXiv 2608.30980
TRAINABILITÉL'apprentissage par renforcement améliore la compétence.

Une chaîne de données synthétiques permet d'améliorer l'auto-modélisation agrégée sur trois familles de modèles open-source, avec transfert partiel à des tâches non vues.

CÉSURELes auteurs refusent l'équivalence avec l'introspection.

Une meilleure prédiction de son propre comportement peut provenir de régularités apprises ou d'indices disponibles sans accès privilégié au mécanisme causal interne.

CONSC^

Le Global Workspace passe de l'indicateur abstrait au candidat mécanistique.

Le corpus citait déjà Global Workspace Theory comme famille d'indicateurs issue des sciences de la conscience. Gurnee et al. apporte une pièce nouvelle : un ensemble de représentations verbalisables dont plusieurs propriétés fonctionnelles attendues d'un workspace sont testées par lecture et intervention.

J-SPACERapportable, contrôlable et causalement utilisé.

Les contenus du J-space peuvent être rapportés, partiellement modulés sur instruction et utilisés comme étapes intermédiaires silencieuses. Remplacer certaines représentations déplace les réponses et le raisonnement en aval.

Anthropic · A global workspace in language models
BROADCASTUn même contenu alimente plusieurs calculs.

Les auteurs rapportent une connectivité fonctionnelle particulièrement large et une utilisation flexible d'une représentation vers des tâches différentes, tandis que grammaire, récupération simple et autres traitements peuvent continuer hors du J-space.

STATUTPrépublication majeure, non verdict de conscience.

Les auteurs distinguent explicitement les fonctions associées à l'« access consciousness » de la conscience phénoménale et écrivent que leurs expériences ne montrent ni expérience subjective ni capacité à ressentir.

Gurnee et al. · arXiv 2607.15495
CONFAB^

Une sortie plausible peut rester épistémiquement pauvre.

Veri & Umbelino, dans PNAS, ne mesurent pas un taux d'hallucination. Leur résultat doit donc rester séparé : il porte sur l'écart entre apparence de raison et alignement avec des structures humaines de justification dans des problèmes politiques mal structurés.

PNAS · 15.09.202660 modèles, neuf scénarios, quatre au-dessus du seuil nul.

Seuls quatre modèles dépassent de manière consistante le benchmark nul par permutation pour l'alignement aux patterns humains de reason-giving, alors que de nombreuses sorties restent cohérentes et persuasives en surface.

Veri & Umbelino · DOI 10.1073/pnas.2600126123
NON-ÉQUIVALENCEPlausibilité ≠ factualité ≠ cohérence délibérative.

Le résultat renforce une règle générale d'ULTRACON^CONFAB : la qualité rhétorique d'une génération ne peut pas servir de proxy unique pour son statut factuel ou pour la structure de son raisonnement.

NON-INFÉRENCES · MAINTENUES

Ce que le delta
n'autorise toujours pas.

Self-modeling ≠ accès privilégié.

Prédire correctement son propre comportement ne permet pas, sans comparaison mécanistique plus forte, de savoir si le système « regarde » son propre processus causal ou s'il exploite des régularités apprises sur des modèles comme lui.

Workspace ≠ phénoménalité.

Reportabilité, contrôle, diffusion et rôle causal correspondent à des fonctions associées à certaines théories de l'accès conscient. Elles ne constituent pas un test décisif de l'existence d'une expérience subjective.

J-lens ≠ transparence totale.

Un outil externe capable de décoder certaines représentations ne transforme pas le modèle en observateur transparent de toutes ses causes internes.

Reason-giving humain ≠ vérité.

Le benchmark PNAS mesure une forme particulière de cohérence délibérative ; une divergence n'est pas automatiquement une hallucination, et une convergence n'est pas une garantie de factualité.

M1 incertitude · M2 contrôle métacognitif · M3 accès introspectif limité restent distincts et n'impliquent pas M5.

PROGRAMME UCF · ADDENDUM

Trois tests
pour conserver les césures.

UCF-19META · CONSC

Self-modeling vs privileged access

Comparer les prédictions d'un modèle sur ses propres réponses vérifiées avec des baselines statistiques et d'autres modèles, puis tester le transfert après entraînement.

Ne prouve pas : accès introspectif privilégié, M4 persistant ou M5.
UCF-20META · CONSC

Functional workspace test

Mesurer conjointement rapportabilité, contrôle délibéré, rôle causal dans des tâches de haut niveau et partage flexible vers plusieurs calculs.

Ne prouve pas : expérience phénoménale ni identité avec le workspace neuronal humain.
UCF-21CONFAB

Plausibility vs deliberative coherence

Mesurer séparément plausibilité linguistique, support factuel et alignement à une structure indépendante de reason-giving.

Ne prouve pas : que la divergence délibérative est une hallucination ou que la convergence garantit le vrai.
SOURCES AJOUTÉES · 3

Un papier prioritaire,
un mécanisme majeur, une borne PNAS.

2026 · EMNLP MAINpeer-reviewed

Zeng, Assis & Wang — Evaluating and Improving LLM Self-Modeling

Benchmark comportemental vérifiable de self-modeling ; compétence limitée, entraînable, sans équivalence établie avec l'introspection.

arXiv 2608.30980
2026 · ANTHROPIC / ARXIVexceptional preprint

Gurnee et al. — Verbalizable Representations Form a Global Workspace in Language Models

J-space : rapportabilité, contrôle, médiation causale et broadcast fonctionnel ; distinction explicite accès fonctionnel / phénoménalité.

arXiv 2607.15495
2026 · PNASpeer-reviewed

Veri & Umbelino — Plausible nonsense and deliberative reasoning

60 LLMs, neuf scénarios ; dissociation entre apparence cohérente/persuasive et alignement avec les patterns humains de justification testés.

DOI 10.1073/pnas.2600126123

sources.json → · update.json → · experiments.json →