---
title: "External Review #1 — Claude — T^ × GPT"
date: "2026-09-11"
review_type: "external-model-review"
status: "EXT-REVIEW"
provenance: "Réponse de Claude fournie par l'auteur du projet dans la conversation T^GPT. Modèle/version Claude exacts non consignés ici."
completeness: "Le texte transmis s'interrompt au cours du §16 ; cette archive ne prétend donc pas être le verbatim complet de la réponse originale."
---

# External Review #1 — Claude

## Statut

Cette revue est une **contre-lecture externe** du corpus T^GPT. Elle n'est ni une validation scientifique, ni une décision souveraine sur le projet. Elle est conservée comme objet critique traçable et comme déclencheur de la révision v0.8.

Labels : **EXT-REVIEW / OBS-CRITIQUE / non peer-reviewed**.

## Conclusions principales de la revue

### 1. Incohérences internes repérées

- `pilot-v0.7/` annonce quatre conditions mais n'explicite pas VERBALIZED dans le corps de page.
- REC^GAIN et IRREV^OBS sont décrites ailleurs dans le corpus mais ne figurent pas dans le noyau métrique affiché du pilote v0.7.
- le budget de T^FIELD-MIN n'est pas explicitement apparié au baseline 64-samples ; une comparaison non appariée serait invalide.
- deux pipelines T^FIELD concurrents existaient : la page Méthodologie et `research.json` n'avaient pas la même séquence.

### 2. Déplacement proposé de la question centrale

La revue considère que la question la plus prometteuse n'est pas seulement « où la contraction apparaît-elle ? » mais **« la contraction observable est-elle récupérable par une sonde pré-enregistrée qui ne révèle pas le contenu perdu ? »**.

Elle identifie le triplet **ES^LOSS → REC^GAIN → IRREV^OBS** comme la partie la plus originale potentielle du corpus.

### 3. Opérationnalisation insuffisante

La revue demande que toute métrique indique avant collecte : représentation sémantique, algorithme de clustering, seuils, estimateur, dépendance à n, intervalles d'incertitude et test statistique.

Elle recommande d'utiliser la littérature existante sur l'entropie sémantique et l'équivalence sémantique comme baseline méthodologique plutôt que de redéfinir entièrement H_sem.

### 4. Vocabulaire T^

La revue distingue :

- **auto-annulation / T_signature** : idée méthodologique jugée réellement intéressante ;
- **GATE, CÉSURE, WEAVE** : jugés sous-définis et risquant de renommer des opérations connues ;
- certains passages T^Total / holochamp / Libellule / Janus dans la branche cognition-mesure : jugés incompatibles avec une présentation scientifique standard s'ils servent d'argument empirique.

### 5. Falsifiabilité

La revue considère plusieurs H01–H03 comme déjà largement soutenues par la littérature, H05 comme trop triviale comme hypothèse, H04/H12 comme insuffisamment réfutables, et H07/H08/H13–H17 comme le noyau le plus directement testable.

Elle demande des statuts de sortie : **SUPPORTED, PARTIAL, REFUTED, RETIRED**.

### 6. Pilote v0.7

Critiques majeures :

- budget de calcul non apparié ;
- métriques non complètement pré-définies ;
- absence d'endpoint primaire/statistique principale ;
- prompt `OTHER` insuffisamment contextualisé pour des appels indépendants ;
- contrôles négatifs trop faibles pour tester la récupération d'une pluralité vraie ;
- besoin d'au moins deux familles de modèles pour la validité externe ;
- annotation non suffisamment aveugle dans l'artefact v0.7.

La revue recommande des **contrôles positifs à pluralité énumérable à l'avance**.

### 7. Baselines requises

- multi-sampling indépendant ;
- prompt unique demandant k réponses distinctes ;
- sampling plus dispersif ;
- Verbalized Sampling ;
- multi-sampling + clustering + sélection de couverture ;
- best-of-N / judge calibré ;
- multi-agent debate conventionnel.

La revue pose comme test dur : T^FIELD doit battre un baseline « multi-sample + coverage selection » à budget comparable pour revendiquer une contribution technique.

### 8. Annotation

Demandes : anonymisation des conditions, auteur du projet non annotateur de référence, clustering automatique puis validation humaine, au moins deux annotateurs indépendants, accord inter-annotateurs rapporté, adjudication tierce et codebook figé avant collecte.

### 9. Antériorités multi-agent / Quality-Diversity

La revue rapproche T^FIELD de :

- Quality-Diversity / MAP-Elites / niching ;
- multi-agent diversity collapse ;
- consensus-free debate ;
- self-consistency ;
- cascades d'information et influence sociale.

Elle demande que toute revendication d'originalité de T^FIELD soit formulée **après confrontation explicite à ces familles**.

### 10. Distinction des niveaux de « champ »

La revue considère comme une faiblesse centrale l'usage d'un même mot pour : distribution token, diversité sémantique échantillonnée, espace de trajectoires multi-agents et réponse visible.

La révision v0.8 répond à cette critique par quatre objets distincts : `FIELD^TOK`, `FIELD^SEM`, `FIELD^TRAJ`, `FIELD^VIS`.

### 11. Base ↔ Instruct

La revue recommande de remonter cette expérience en priorité et, lorsque possible, de comparer des **checkpoints intermédiaires** : BASE → SFT → DPO → RLVR, en exploitant des chaînes ouvertes comme Tülu/OLMo et en séparant l'effet du template de l'effet des poids.

### 12. R_meta

La revue introduit un confond absent du registre : le **mirroring / biais d'élicitation**. Le dialogue fondateur peut refléter le cadrage de l'utilisateur plutôt qu'une récurrence autonome du modèle.

La v0.8 ajoute donc **CH11 — MIRROR / ELICITATION**.

### 13. Cognition & mesure

La revue juge cette branche trop large et largement couverte par la théorie classique de la validité et la psychométrie. Elle recommande de la sortir du noyau expérimental T^GPT.

La v0.8 ne la supprime pas mais la reclasse comme **programme adjacent / extension métrologique**, et sépare la couche scientifique des analogies T^ heuristiques.

### 14. Originalité potentielle selon la revue

Cinq pistes :

1. ES^LOSS / REC^GAIN / IRREV^OBS avec sondes standardisées ;
2. R_meta avec contrôle d'élicitation ;
3. auto-annulation mesurée via T_signature ;
4. attribution transition par transition de la contraction ;
5. traçabilité de provenance lors de la consolidation multi-agent.

La revue conclut que T^GPT paraît plus prometteur comme **instrumentation de la contraction** que comme théorie générale.

## Réponse du projet

### Adopté en v0.8

- budget apparié en **tokens totaux entrée + sortie**, avec analyse de sensibilité sur le nombre d'appels ;
- REC^GAIN / IRREV^OBS remontés au centre expérimental ;
- contrôles positifs à pluralité connue ;
- endpoint primaire pré-enregistré ;
- annotation aveugle + double codage + adjudication ;
- CH11 mirroring / élicitation ;
- statuts SUPPORTED / PARTIAL / REFUTED / RETIRED ;
- distinction FIELD^TOK / FIELD^SEM / FIELD^TRAJ / FIELD^VIS ;
- comparaison explicite à Quality-Diversity, Verbalized Sampling et baselines de couverture ;
- remontée de STAGE (Base→SFT→DPO→RLVR) dans les expériences prioritaires ;
- branche cognition-mesure reclassée en extension adjacente.

### Reformulé

- H14 n'est pas supprimée : la partie « la topologie affecte la diversité » est reclassée comme soutenue/documentée ; la question résiduelle devient l'optimisation de la topologie et du moment de contact à budget constant.
- H15 n'affirme plus que la consolidation est mauvaise : elle teste la **variation de couverture imputable à l'étape de consolidation**, qui peut être simultanément productive et sélective.
- GATE, CÉSURE et WEAVE sont conservés seulement s'ils disposent d'une définition opératoire et d'un équivalent technique explicite.

### Non adopté tel quel

- T^FIELD n'est pas déclaré identique à MAP-Elites : Quality-Diversity devient une antériorité structurale obligatoire, mais l'identité algorithmique reste à démontrer.
- les logprobs ne remplacent pas FIELD^SEM : ils mesurent FIELD^TOK et complètent, sans l'identifier, la diversité sémantique.
- la branche cognition-mesure n'est pas supprimée ; elle quitte le noyau expérimental et perd tout rôle probatoire dans T^GPT.

## Règle de continuité

v0.7 reste publié comme état historique. Les défauts signalés ne sont pas réécrits rétroactivement : ils sont documentés comme raisons de la transition vers v0.8.
