Base plus large que certaines sorties alignées
La littérature sur post-training et diversity collapse soutient localement cette direction. Ce n’est plus une revendication d’originalité T^GPT ; E1-STAGE cherche l’attribution précise par étape.
Le registre n’est plus une liste cumulative. Chaque proposition distingue désormais son statut documentaire, son degré de soutien et la possibilité d’être reformulée, réfutée ou retirée.
`T^HYP` désigne une proposition T^ produisant une conséquence empirique : elle doit pouvoir devenir SUPPORTED, PARTIAL, REFUTED ou RETIRED. `T^HEURISTIC` désigne un langage interprétatif qui ne reçoit aucun pouvoir probatoire.
La littérature sur post-training et diversity collapse soutient localement cette direction. Ce n’est plus une revendication d’originalité T^GPT ; E1-STAGE cherche l’attribution précise par étape.
Le post-training peut réduire certaines diversités tout en améliorant instruction-following ou qualité. v0.8 mesure le compromis, pas un verdict « alignement mauvais ».
La typicality bias dans les préférences est documentée comme moteur possible du mode collapse. Verbalized Sampling devient baseline obligatoire.
La formulation A>B peut rendre la sélection saillante mais ne produit pas une hypothèse falsifiable sur les représentations internes. Le phénomène est conservé comme mécanisme documentaire, pas comme hypothèse autonome.
La dépendance autoregressive aux tokens précédents reste un mécanisme de fond, mais elle n’est plus présentée comme hypothèse originale.
La version v0.8 scinde le problème : FIELD^TOK, FIELD^SEM, FIELD^TRAJ et FIELD^VIS. Le fait qu’une interface affiche une sortie est trivial ; la question testable porte sur la perte de couverture entre niveaux explicitement mesurés.
Une procédure de raisonnement plus longue peut augmenter ou réduire la couverture selon la tâche. Testable par ablation à budget contrôlé.
Des travaux multi-agents 2026 montrent que certaines interactions denses accélèrent la convergence. La question T^GPT résiduelle porte sur les régimes où l’indépendance ou le contact différé améliorent couverture et provenance.
Question quantitative : quelle fraction des clusters minoritaires franchit les critères de pertinence ou de gold coverage, comparée aux clusters majoritaires ? La rareté n’est jamais un argument de vérité.
T_WEAVE doit battre COVERAGE_SELECTION_NON_T et EXHAUSTIVE_NON_T à budget comparable. Sinon la proposition devient REFUTED ou RETIRED.
Une règle AUTO-NULL pré-enregistrée peut-elle réduire T_signature sans dégrader la tâche ? Cette formulation est falsifiable ; l’auto-annulation purement rhétorique ne l’est pas.
« Une bifurcation binaire peut être localement pertinente » est vrai par construction mais ne produit pas de test discriminant. La proposition quitte le registre actif.
Le cas OpenAI/Navier–Stokes documente un système de recherche multi-agent immensément plus large que l’objet publié. La généralisation à d’autres systèmes reste locale et doit distinguer les types de FIELD.
La littérature multi-agent établit déjà que densité, autorité et structure de communication peuvent modifier convergence et diversité.
À budget token égal, existe-t-il une structure d’échanges différés qui conserve mieux couverture pertinente et provenance qu’une interaction dense ou un simple multi-sampling ?
La consolidation peut être productive. H15 teste seulement la variation de couverture et de provenance imputable à l’étape de consolidation, sans supposer que cette variation soit négative.
Quand le modèle change pendant une recherche, l’état temporel du modèle doit faire partie de la provenance. L’effet quantitatif sur comparabilité et récupération reste à tester.
Production, critique, formalisation et validation peuvent être séparées. T^GPT teste si cette séparation améliore attribution et provenance sans juge souverain prématuré.
La récurrence structurelle observée peut être produite par le cadrage de l’utilisateur, le mirroring ou la sycophantie. v0.8 exige un bras de contrôle d’élicitation avant toute interprétation de R_meta.