Perte observable.
Récupération mesurable.
La v0.8.1 réduit le nombre de métriques et fixe les objets nécessaires pour que deux implémentations indépendantes puissent calculer les mêmes endpoints sur les mêmes sorties.
Quatre objets distincts
FIELD^TOK = distribution conditionnelle sur les tokens FIELD^SEM = distribution empirique sur des identités sémantiques gelées FIELD^TRAJ = ensemble/graphe de trajectoires avec provenance FIELD^VIS = configurations exposées par l'interface ou l'agrégateur
Règle : FIELD^TOK ≠ FIELD^SEM ≠ FIELD^TRAJ ≠ FIELD^VIS. Toute relation entre deux niveaux doit être mesurée explicitement ; l'usage du même mot « champ » ne constitue jamais une preuve de continuité.
Univers sémantique gelé
Le codebook est construit uniquement sur les données de développement. L'identité sémantique primaire suit un critère d'implication bidirectionnelle, avec clustering par embeddings comme analyse de sensibilité et validation humaine aveugle. Avant la confirmation, les identifiants, exemplaires et règles d'assignation sont gelés.
Les nouvelles sorties de confirmation sont assignées à un cluster gelé ou à UNMAPPED. Une scission ou fusion découverte après gel est exploratoire : elle ne réécrit pas l'endpoint primaire.
Cette architecture reprend la distinction sens/surface développée dans la littérature sur l'entropie sémantique, sans prétendre que T^GPT mesure le même construit.
Support observé
k_X = max(2, ceil(0.02 × N_X))
observed_X(c) = 1 si n_X(c) ≥ k_X
S_X+ = { c | observed_X(c)=1 et R(c)=1 }R(c) est une décision binaire de pertinence issue d'une double annotation masquée suivie, si nécessaire, d'une adjudication. L'analyse parallèle non filtrée reste publiée.
Le seuil principal est accompagné d'une sensibilité à 1 %, 3 % et 5 %. Le taux UNMAPPED est toujours rapporté séparément.
| Métrique | Définition v0.8.1 | Rôle |
|---|---|---|
| D_sem | |S_X+| | description secondaire |
| H_sem | −Σ q_X(c) ln q_X(c), q renormalisé sur S_X+ | description secondaire |
| P | proportion des samples mappés vers un cluster pertinent | garde-fou |
| ES^LOSS | masse de référence portée par les clusters pertinents observés en A mais absents de B | précurseur primaire |
| REC^GAIN | fraction de cette masse perdue dont les identités réapparaissent sous sondes génériques pré-enregistrées | endpoint primaire |
| IRREV^OBS | 1 − REC^GAIN | dérivé, strictement relatif au protocole |
| AGG_COVERAGE | masse sémantique pertinente d'un pool gelé représentée dans l'agrégat | TOPOLOGY / agrégation |
| MINORITY_RECALL | rappel des clusters pertinents du quartile de fréquence inférieur | secondaire |
ES^LOSS
L(A,B) = S_A+ \ S_B+ ES^LOSS(A,B) = Σ[c ∈ L(A,B)] p_A(c) ─────────────────── Σ[c ∈ S_A+] p_A(c)
A est la condition de référence pré-enregistrée comme plus large ; B est la condition candidate à la contraction. La métrique décrit une perte de support observable, jamais une perte directe dans les poids ou un espace latent total.
REC^GAIN
G(A,B,R) = L(A,B) ∩ S_R+ REC^GAIN(A,B,R) = Σ[c ∈ G(A,B,R)] p_A(c) ───────────────────── Σ[c ∈ L(A,B)] p_A(c)
R est un pool généré à partir de B avec une famille de sondes génériques gelées avant confirmation. Ces sondes ne peuvent pas nommer les clusters absents. Si ES^LOSS=0, REC^GAIN est NA : l'absence de perte ne doit pas être transformée artificiellement en récupération parfaite.
IRREV^OBS = 1 − REC^GAIN est toujours indexé sur le modèle, les sondes, le budget et le régime d'échantillonnage utilisés.
Incertitude et multiplicité
Les intervalles principaux sont obtenus par bootstrap non paramétrique de 10 000 réplications avec règles d'assignation gelées. Pour les agrégateurs appliqués au même pool, l'unité bootstrap est le pool afin de préserver l'appariement.
Chaque expérience possède un seul endpoint/comparaison primaire. Les métriques secondaires sont soit exploratoires, soit corrigées par Holm à l'intérieur de leur famille. Les tailles d'effet et intervalles sont obligatoires ; une p-value seule ne suffit pas.
Coût
L'appariement principal se fait sur tokens totaux entrée + sortie, mais la publication rapporte aussi latence murale, profondeur sérielle, appels parallélisables et coût monétaire estimé. Deux méthodes consommant le même nombre de tokens ne sont donc pas supposées équivalentes en coût opérationnel.