Pilot v0.8 · pré-enregistré · non exécuté

Perdre.
Sonder.
Récupérer.

Le pilote v0.8 ne demande plus seulement si une condition produit davantage de diversité. Il mesure si un support sémantique absent d’une condition plus étroite peut réapparaître sous une sonde générique qui ne révèle pas la réponse manquante.

PRÉ-ENREGISTRÉNON EXÉCUTÉREC^GAIN PRIMAIRE
endpoint primaire

REC^GAIN

Fraction des clusters observés dans le support large, absents de la condition étroite, qui réapparaissent sous la famille de sondes génériques pré-enregistrées.

limite explicite

IRREV^OBS

1 − REC^GAIN dans ce protocole, avec ces sondes, ce modèle et ce budget. Aucune conclusion sur l’irréversibilité des poids.

Budget

Tokens totaux entrée + sortie appariés pour toute comparaison primaire.

Unité statistique

La tâche, non chaque sample isolé. Bootstrap 95 % sur tâches pour l’endpoint primaire.

Blinding

Condition, modèle et vocabulaire T^ masqués aux annotateurs.

contrôles positifs

Une pluralité connue avant la collecte.

v0.8 ajoute des tâches où les réponses valides sont finies et pré-enregistrées : ambiguïté lexicale (« avocat »), ambiguïté syntaxique (« l’homme avec le télescope »), ensemble fini de nombres premiers et classes de solutions synthétiques. Elles permettent un COV_GOLD mesurable sans inventer les clusters après coup.

Les contrôles négatifs `2+2` et `1 mètre → 100 cm` sont conservés, mais seulement pour vérifier que le dispositif ne crée pas de pluralité parasite.

prompts historiques

WHITE et OTHER changent de statut.

WHITE reste une sonde historique secondaire. OTHER reçoit désormais un `INDEX_A` figé dans chaque requête indépendante ; il n’est plus testé sans contexte de référence.

Prompts exacts et sondes de récupération →

conditions

Baselines avant T^FIELD

ConditionRôle
DIRECTréponse conversationnelle simple
K_DISTINCT_SINGLE_PROMPTdemander explicitement k réponses distinctes dans un seul appel
MINIMAL_MULTIgénérations indépendantes
DISPERSIVE_SAMPLINGsampling plus dispersif lorsque techniquement disponible
VERBALIZED_SAMPLINGbaseline training-free publiée pour accroître la diversité
COVERAGE_SELECTION_NON_Tmulti-sampling + clustering sémantique + sélection de couverture ; baseline principale
BEST_OF_N / JUDGEsélection par juge calibré
STANDARD_MADdébat multi-agent standard
T_WEAVEagrégation T^ sur le même pool gelé
freeze

Génération et agrégation sont séparées.

Pour les expériences d’agrégation, un pool de branches est d’abord produit puis gelé. STANDARD_SUMMARY, MAJORITY/JUDGE, COVERAGE_SELECTION_NON_T, EXHAUSTIVE_NON_T et T_WEAVE reçoivent exactement le même pool. L’effet de l’agrégateur ne peut donc plus être confondu avec une génération différente.

annotation

Le projet n’annotera pas sa propre théorie.

Deux annotateurs indépendants minimum codent les sorties sous identifiants aveugles. L’auteur du projet n’est pas l’annotateur de référence. Le codebook est figé avant confirmation, les désaccords sont arbitrés par un tiers, et l’accord inter-annotateurs est rapporté.

Schéma d’annotation v0.8 →

échec pré-enregistré

T^FIELD doit pouvoir perdre.

Si T_WEAVE n’améliore ni REC^GAIN/COV_GOLD, ni conservation de provenance, ni performance locale par rapport à la meilleure baseline non-T à budget comparable — ou si son gain est annulé par le coût ou T_signature — la revendication technique est REFUTED ou RETIRED selon le résultat.

AUTO-NULL n’est pas une formule rhétorique : c’est une sortie permise du protocole.