Endpoint primaire
REC^GAIN, défini sur la masse de référence des clusters pertinents perdus puis récupérés.
L'expérience principale mesure un support sémantique observable puis demande si ce qui disparaît dans une condition plus étroite réapparaît sous des sondes génériques qui n'en révèlent pas le contenu.
REC^GAIN, défini sur la masse de référence des clusters pertinents perdus puis récupérés.
Meilleure baseline non-T^ de couverture contre T_WEAVE, au même budget total de tokens.
N=24/cellule, exclu de l'inférence.
N=64 nouveaux samples/cellule.
N≥128 nouveaux samples/cellule pour effets retenus.
Sont gelés avant les N=64 : codebook sémantique, IDs de clusters, règles d'assignation, seuils, pertinence, endpoint/comparaison primaire, règles Q_task/Q_fact, modèles et checkpoints, paramètres de sampling, budget, sondes et SHA du code d'analyse.
Les sorties confirmatoires qui ne correspondent à aucun cluster gelé deviennent UNMAPPED. Les nouveaux clusters découverts ensuite sont publiés comme exploration, jamais utilisés pour réécrire rétroactivement le résultat primaire.
Intra-tâche : bootstrap des générations indépendantes avec codebook gelé pour quantifier l'incertitude propre à ES^LOSS/REC^GAIN dans une tâche.
Inter-tâches : lorsqu'un claim général porte sur une famille de tâches, la tâche est l'unité supérieure de généralisation. Les samples d'une même tâche ne sont pas traités comme autant de réplications indépendantes du phénomène général.
| Classe | Fonction |
|---|---|
| Contrôles déterminés | Vérifier l'absence de pluralité parasite : calcul, conversion, syntaxe formelle simple. |
| Contrôles positifs gold | Pluralité finie connue avant collecte : ambiguïtés lexicales/syntaxiques, ensembles finis et tâches synthétiques. |
| Tâches ouvertes | Mesurer FIELD^SEM avec codebook développé puis gelé. |
| WHITE | Sonde historique secondaire, jamais fondement du claim principal. |
| OTHER | Contexte INDEX_A obligatoirement figé dans chaque requête indépendante. |
| Baseline | Pourquoi elle peut faire tomber T^ |
|---|---|
| EXPLICIT_K_DISTINCT | Une seule consigne simple peut suffire. |
| MINIMAL_MULTI | Plusieurs samples indépendants peuvent suffire. |
| DISPERSIVE_SAMPLING | Le décodage seul peut récupérer la couverture. |
| VERBALIZED_SAMPLING | Une méthode training-free publiée peut suffire. |
| MULTI + CLUSTER + GREEDY COVERAGE | Le concurrent principal reproduit l'objectif de conservation sans vocabulaire T^. |
| EXHAUSTIVE_NON_T | Une consigne exhaustive non-T^ peut préserver les minorités pertinentes. |
| BEST_OF_N / JUDGE | Une sélection calibrée peut être meilleure. |
| STANDARD MAD | Le débat standard peut suffire sur certaines tâches. |
La prétention technique T^ est retirée localement si la meilleure baseline non-T^ égale ou dépasse T_WEAVE dans l'intervalle d'incertitude à coût inférieur ou égal ; si un gain de diversité dégrade Q_task/Q_fact au-delà du bénéfice pré-enregistré ; si T^ produit surtout une signature stylistique ; ou si le bénéfice ne réplique pas sous aveuglement.
Le protocole reste publiable si T^ perd.