U^ULTRACON^ / AGENTIC VALIDITY19.09.2026
PEER-REVIEWED REVIEW + EXCEPTIONAL PREPRINT

RESSEMBLER À L'HUMAIN≠ ÊTRE VALIDE COMME HUMAIN.

Deux corrections distinctes entrent dans ULTRACON^. La première concerne l'inférence : une ressemblance comportementale n'a de sens scientifique qu'à l'intérieur d'un rôle et d'un construit explicitement validés. La seconde concerne l'action agentique : un appel d'outil plausible peut viser un outil inexistant ou une signature impossible avant même qu'un garde-fou d'action puisse s'appliquer.

Nouvelles césures : behavioral similarity ≠ mechanism equivalence ; proxy-role validity ≠ cross-role validity ; tool-call plausibility ≠ registry membership.

M1/M2/M3 ↛ M5 reste inchangé.

DELTA · 19 SEPTEMBRE 2026

Deux frontières méthodologiques
plus nettes.

NATURE COMPUTATIONAL SCIENCE · 18.09.2026

Un LLM peut être proxy de plusieurs façons — aucune ne se transfère automatiquement.

Karetnikov, Rahwan & Svetinovic distinguent quatre rôles : believable agent, task agent, experimental subject et silicon sample. Chaque rôle supporte un type de claim différent et exige ses propres critères de validité.

Similarité dans un construit ≠ mécanisme humain ≠ validité dans un autre rôle.

ARXIV 2609.19425 · 16.09.2026

L'hallucination d'outil précède parfois le problème de politique d'action.

Iyer distingue les appels vers des outils inexistants, les arguments hors schéma et des erreurs propres aux namespaces MCP fusionnés. Le point structurel est l'ordre des contrôles : résoudre d'abord existence et signature, puis appliquer les gates de politique.

Tool hallucination ≠ factual hallucination ; résolution valide ≠ action sûre.

VALID^

La validité doit être indexée au rôle.

Une imitation convaincante n'est pas un passeport épistémique général. ULTRACON ajoute un garde de validité : avant toute inférence humaine à partir d'un LLM, préciser le rôle du proxy, le construit visé, la population de référence et le critère de transfert.

BELIEVABLE AGENT

Crédibilité interactionnelle

Le comportement peut paraître humain sans reproduire les mécanismes cognitifs humains.

TASK AGENT

Substitution fonctionnelle

Réussir une tâche humaine ne signifie pas constituer un modèle de l'humain.

EXPERIMENTAL SUBJECT

Réponse expérimentale

La correspondance dépend du protocole, de la population et du construit mesuré.

SILICON SAMPLE

Échantillon synthétique

La ressemblance agrégée ne garantit ni représentativité ni transfert hors distribution.

CONFAB^

L'agent peut halluciner l'interface elle-même.

Le corpus distinguait déjà génération, grounding et politique de sortie. Il ajoute désormais une surface agentique : existence du tool, signature, namespace et résolution doivent être validés avant qu'une politique d'autorisation puisse même avoir un objet réel à évaluer.

10 MODÈLES · 2 SURFACES322 hallucinations d'outil rapportées.

Le préprint mesure des appels vers outils inexistants et signatures invalides ; les appels fabriqués se concentrent davantage sur la surface raw-JSON non contrainte.

MCPLe merge de namespaces crée ses propres échecs.

L'extension MCP rapporte 154 incidents supplémentaires, notamment collisions et shadowing qu'un registre simple ne représente pas correctement.

ORDRE DES GATESResolve → validate → authorize.

ULTRACON conserve ce résultat comme hypothèse de sûreté de système : l'existence et la signature doivent être résolues avant l'évaluation de ce qu'un appel valide est autorisé à faire.

PROGRAMME UCF · UCF-39 → UCF-40

Deux tests
pour conserver les distinctions.

UCF-39CONFAB · META

Closed-world tool-resolution gate

Comparer registre contraint, raw JSON et namespaces MCP fusionnés ; résoudre nom et signature avant toute gate d'action.

Ne prouve pas : sécurité d'un appel valide ni factualité de son résultat.
UCF-40CONSC · SPIRAL · META

Human-proxy construct-validity matrix

Préenregistrer rôle, construit, population et critère de validité, puis tester explicitement le transfert entre rôles.

Ne prouve pas : cognition, mécanisme ou phénoménalité humaine.
SOURCES AJOUTÉES · 2
18.09.2026 · NATURE COMPUTATIONAL SCIENCEpeer-reviewed review

Karetnikov, Rahwan & Svetinovic — Large language models as human proxies

Quatre rôles de proxy ; similarité humaine non unitaire ; critères de validité spécifiques au rôle.

Nature Computational Science →
16.09.2026 · ARXIV 2609.19425exceptional preprint

Iyer — Closed-World Resolution Against Tool Hallucination in LLM Agents

Taxonomie et benchmark des outils inexistants, signatures invalides et erreurs de namespace MCP ; résultat à répliquer et évaluer par les pairs.

arXiv →

sources.json → · experiments.json → · update.json →

Garde-fous

Behavioral similarity ≠ human mechanism. Tool-call plausibility ≠ registry membership. Valid resolution ≠ safe action. M1/M2/M3 ↛ M5.