---
title: "External Review #2 — Claude — pre-flight statistique"
date: "2026-09-11"
status: "EXT-REVIEW / PARTIAL-TRANSCRIPT / NON-SOVEREIGN"
review_target: "T^GPT v0.8.1"
---

# External Review #2 — Claude

Statut : **EXT-REVIEW**. Cette revue n’est ni peer review, ni validation, ni autorité souveraine. Elle sert de test adversarial avant collecte confirmatoire.

## Limite documentaire

Le texte transmis dans le chat s’interrompt pendant la section **C.1 — compute_recovery_metrics.py**, après la liste des défauts et l’exemple d’intervalle fantôme. Le corpus archive donc uniquement ce qui a effectivement été reçu. Aucun contenu manquant n’est reconstruit.

## Findings reçus

### Blockers principaux

1. `ES^LOSS` thresholdé est positivement biaisé sous l’hypothèse nulle exacte.
2. `REC_GAIN` devient indéfini dans une fraction importante des cellules et la manquance dépend de l’effet.
3. Le seuil dur rend la fonctionnelle discontinue et rend le bootstrap percentile v0.8.1 inadéquat.
4. Le code calcule le seuil avec `N_total` alors que les comptages excluent `UNMAPPED`.
5. `uncertain` est traité comme cluster ordinaire par le code v0.8.1.
6. La dépendance entre B et ses continuations R n’est pas conservée dans le resampling.
7. Les sondes RP1–RP4 demandent toutes explicitement des alternatives ; il manque un contrôle neutre.
8. Le nombre de tâches du pilote est insuffisant pour une inférence inter-tâches.
9. `AGG_COVERAGE` dépend d’un prédicat `represented_Y(c)` insuffisamment défini et sensible à la verbosité.
10. E1 déclare en pratique plusieurs endpoints/comparaisons primaires.
11. Le passage annotation-sortie → pertinence cluster `R(c)` n’est pas spécifié.
12. Aucun seuil d’accord inter-annotateurs ne déclenche automatiquement un retour au développement.

### Reformulations proposées par la revue

- Remplacer le chemin critique thresholdé par des différences continues de masses sémantiques.
- Mesurer contraction **et** expansion, plutôt que présupposer une condition « plus large ».
- Introduire un zéro expérimental (`A′` ou calibration par permutation).
- Ajouter un bras de sonde contrôle neutre et estimer une récupération différentielle.
- Agréger au niveau tâche, plutôt que moyenner des ratios instables par tâche.
- Borner les sorties des agrégateurs et ajouter des distracteurs pour mesurer les faux positifs de représentation.
- Tracer explicitement les couples `(B_i, R_i)`.
- Augmenter le nombre de tâches ; raisonner en précision/puissance inter-tâches plutôt qu’en seul nombre de générations par prompt.

## Décision T^GPT

La revue déclenche **v0.8.2 · Statistical Repair**. v0.8.1 est conservée intacte comme état historique **NO-GO confirmatoire**.

Les propositions de Claude ne sont pas reprises mécaniquement : en particulier, `max(0,·)` reste seulement directionnellement différentiable aux points de contact, de sorte que le bootstrap standard n’est pas présumé valide par simple remplacement du seuil. v0.8.2 utilise donc calibration nulle/randomisation et inférence de généralisation au niveau tâche, avec conservation explicite des dépendances expérimentales.
