UA-Bench teste explicitement cette distinction sur plus de 3 500 questions et 18 modèles ; haute exactitude et bonne attribution de l'incertitude ne coïncident pas nécessairement.
Ren et al. · ACL 2026PLUS D'ACCÈS
Quatre travaux ACL 2026 clarifient quatre objets différents : origine de l'incertitude, clarification interactive, conflit entre sources et signal d'abstention dérivé d'une trace. ULTRACON^ les ajoute sans fusionner monitoring, accès endogène, second ordre et phénoménalité.
Césure centrale : privileged internal information ≠ endogenous privileged access ≠ second-order metacognition ; M1/M2/M3 ↛ M5.
Quatre trous du corpus
désormais explicités.
Li et al. formalisent une calibration interactive et rapportent des gains lorsque les clarifications sont sélectionnées à partir du signal de calibration dans leurs régimes expérimentaux.
Li et al. · ACL 2026Sur 27 LLMs, le cadre à trois sources révèle notamment une forte déférence aux documents et une discrimination imparfaite entre information externe utile et nuisible.
Li et al. · Findings ACL 2026Trace Inversion exploite la discordance entre requête réelle et requête reconstruite depuis une trace comme signal d'abstention ; son utilité diagnostique ne transforme pas la trace en état interne fidèle.
Gourabathina et al. · ACL 2026Décodabilité, accès et second ordre
cessent d'être un seul mot.
Privileged internal information
Un expérimentateur peut décoder une information depuis les états internes mieux qu'à partir des entrées/sorties publiques.
Privileged self-access
Le modèle lui-même doit montrer un avantage robuste sur des observateurs externes appariés, sous contrôles de raccourci et intervention.
Metacognition de second ordre
Le contenu cible explicitement un état propre de premier ordre et doit généraliser au-delà d'une étiquette ou d'un motif sémantique appris.
Reste séparé
Aucune de ces propriétés fonctionnelles ne constitue à elle seule un test de phénoménalité.
Sept tests supplémentaires.
Origine de l'incertitude, clarification, arbitrage à trois sources, inversion de trace, observer advantage, récupération après pression et validité discriminante des indicateurs de conscience.
Une erreur bibliographique
réparée sans réécrire l'histoire.
La référence NeurIPS 2024 Secret Collusion among AI Agents avait une liste d'auteurs et une URL erronées. La correction est enregistrée séparément ; sa portée scientifique et ses non-inférences n'ont pas été augmentées.
Contrat
Pas de score global. Pas de promotion automatique. Pas de passage M1/M2/M3 → M5.