Statistical Repair · v0.8.2

Le zéro doit être mesuré.

v0.8.2 retire le seuil dur du chemin confirmatoire. La contraction n’est plus une différence d’ensembles détectés : elle devient une différence directionnelle de masses, calibrée contre un plancher nul expérimental.

NO HARD THRESHOLDNULL CALIBRATEDTASK-LEVEL
Distribution

Les états non mappés restent visibles.

p_X(c) = n_X(c) / N_X,total-finalized

Le dénominateur comprend les sorties finales connues, UNMAPPED et UNRESOLVED. Ces deux états sont rapportés séparément et ne deviennent jamais des clusters sémantiques ordinaires. Une sortie encore « uncertain » n’entre pas dans le calcul : elle doit être adjudiquée ou devenir UNRESOLVED.

Deux directions

Contraction et expansion sont toujours co-mesurées.

D(A,B) = Σc [pA(c) − pB(c)]+      déficit directionnel
E(A,B) = Σc [pB(c) − pA(c)]+      expansion directionnelle

La condition A n’est plus déclarée « plus large » par définition. Une transition peut contracter certaines configurations et en ouvrir d’autres.

Calibration nulle

Un déficit brut n’est jamais interprété seul.

Deux échantillons tirés de la même distribution produisent un déficit positif à cause du bruit d’échantillonnage. v0.8.2 estime ce plancher soit par une réplication indépendante A′, soit par permutation des labels sous H0.

D_excess = D(A,B) − E_H0[D]
E_excess = E(A,B) − E_H0[E]

Les valeurs négatives sont conservées. Elles ne sont pas tronquées pour sauver une hypothèse de contraction.

Récupération

Une sonde d’alternatives doit battre une sonde neutre.

d_c = [pA(c) − pB(c)]+
C(R) = Σc min(d_c, [pR(c) − pB(c)]+)
RECOVERY_LIFT = C(R_recovery) − C(R_control)

Chaque sortie Bᵢ est forkée vers deux continuations indépendantes : une sonde de récupération et une relecture neutre de longueur/effort comparable. L’appariement est conservé et la randomisation échange les labels récupération/contrôle au niveau du couple.

REC_GAIN v0.8.1 est retiré comme endpoint primaire. IRREV^OBS est retiré comme métrique : son ancienne définition n’ajoutait aucune information au ratio dont elle était le complément.

Inférence

La tâche est l’unité supérieure.

Les procédures de permutation/randomisation servent à la calibration intra-tâche. Une généralisation à une famille de tâches utilise ensuite les effets au niveau tâche. Le bootstrap de tâches ne prétend pas résoudre les problèmes de bootstrap des fonctionnelles à partie positive au niveau multinomial.

Le confirmatoire exige au moins 30 tâches et vise 40 ou davantage selon la précision/power simulation sur un ensemble de planification indépendant.

E3

Couverture sans faux positifs.

AGG_COVERAGE reste la mesure principale de restitution d’un pool gelé, mais tous les agrégateurs reçoivent le même plafond de tokens de sortie. Des clusters distracteurs absents du pool sont mélangés aux vrais clusters pour mesurer REPRESENTATION_FPR. Une couverture élevée avec beaucoup de faux positifs n’est plus interprétable comme bonne conservation.