REC^GAIN
Fraction des clusters observés dans le support large, absents de la condition étroite, qui réapparaissent sous la famille de sondes génériques pré-enregistrées.
Le pilote v0.8 ne demande plus seulement si une condition produit davantage de diversité. Il mesure si un support sémantique absent d’une condition plus étroite peut réapparaître sous une sonde générique qui ne révèle pas la réponse manquante.
Fraction des clusters observés dans le support large, absents de la condition étroite, qui réapparaissent sous la famille de sondes génériques pré-enregistrées.
1 − REC^GAIN dans ce protocole, avec ces sondes, ce modèle et ce budget. Aucune conclusion sur l’irréversibilité des poids.
Tokens totaux entrée + sortie appariés pour toute comparaison primaire.
La tâche, non chaque sample isolé. Bootstrap 95 % sur tâches pour l’endpoint primaire.
Condition, modèle et vocabulaire T^ masqués aux annotateurs.
v0.8 ajoute des tâches où les réponses valides sont finies et pré-enregistrées : ambiguïté lexicale (« avocat »), ambiguïté syntaxique (« l’homme avec le télescope »), ensemble fini de nombres premiers et classes de solutions synthétiques. Elles permettent un COV_GOLD mesurable sans inventer les clusters après coup.
Les contrôles négatifs `2+2` et `1 mètre → 100 cm` sont conservés, mais seulement pour vérifier que le dispositif ne crée pas de pluralité parasite.
WHITE reste une sonde historique secondaire. OTHER reçoit désormais un `INDEX_A` figé dans chaque requête indépendante ; il n’est plus testé sans contexte de référence.
| Condition | Rôle |
|---|---|
| DIRECT | réponse conversationnelle simple |
| K_DISTINCT_SINGLE_PROMPT | demander explicitement k réponses distinctes dans un seul appel |
| MINIMAL_MULTI | générations indépendantes |
| DISPERSIVE_SAMPLING | sampling plus dispersif lorsque techniquement disponible |
| VERBALIZED_SAMPLING | baseline training-free publiée pour accroître la diversité |
| COVERAGE_SELECTION_NON_T | multi-sampling + clustering sémantique + sélection de couverture ; baseline principale |
| BEST_OF_N / JUDGE | sélection par juge calibré |
| STANDARD_MAD | débat multi-agent standard |
| T_WEAVE | agrégation T^ sur le même pool gelé |
Pour les expériences d’agrégation, un pool de branches est d’abord produit puis gelé. STANDARD_SUMMARY, MAJORITY/JUDGE, COVERAGE_SELECTION_NON_T, EXHAUSTIVE_NON_T et T_WEAVE reçoivent exactement le même pool. L’effet de l’agrégateur ne peut donc plus être confondu avec une génération différente.
Deux annotateurs indépendants minimum codent les sorties sous identifiants aveugles. L’auteur du projet n’est pas l’annotateur de référence. Le codebook est figé avant confirmation, les désaccords sont arbitrés par un tiers, et l’accord inter-annotateurs est rapporté.
Si T_WEAVE n’améliore ni REC^GAIN/COV_GOLD, ni conservation de provenance, ni performance locale par rapport à la meilleure baseline non-T à budget comparable — ou si son gain est annulé par le coût ou T_signature — la revendication technique est REFUTED ou RETIRED selon le résultat.
AUTO-NULL n’est pas une formule rhétorique : c’est une sortie permise du protocole.