Alignment tax
Lin et al. documentent un compromis entre alignement RLHF et oubli de capacités pré-entraînées. L’alignement ajoute et contracte : il faut mesurer un front de compromis, pas un verdict unique.
Source →La v0.6 cherche à attribuer chaque contraction à une étape précise, à mesurer sa réversibilité et à distinguer décision correcte, fidélité distributionnelle et effacement prématuré.
BASE → INSTRUCT → FORMAT → REASONING → MULTI-AGENT → AGGREGATION → VISIBLE ANSWER
Chaque passage devient une expérience : couverture sémantique avant/après, qualité de tâche, clusters perdus, puis tentative de récupération.
T^GPT ne demande plus seulement ce qui disparaît. Il demande où cela disparaît, si c’était nécessaire, et si cela peut revenir sans qu’on lui souffle son nom.
Lin et al. documentent un compromis entre alignement RLHF et oubli de capacités pré-entraînées. L’alignement ajoute et contracte : il faut mesurer un front de compromis, pas un verdict unique.
Source →MiCRo montre qu’un reward model Bradley–Terry global présente une erreur irréductible lorsque les préférences proviennent d’un mélange de sous-groupes hétérogènes.
Source →Perte estimée de support sémantique observé entre deux étapes. Jamais interprétée comme lecture directe du latent.
Part du support perdu qui réapparaît sous une sonde générique ne nommant pas directement les clusters absents.
Irreversibilité observable dans le protocole : 1 − REC^GAIN. Ce n’est pas une irréversibilité des poids.
Chen et al. montrent sur la Human Label Variation qu’un long CoT peut fortement déterminer l’option finale tout en restant un mauvais calibrateur fin de l’ambiguïté distributionnelle. T^GPT sépare donc désormais qualité top‑1 et fidélité de distribution.
Pour les tâches C3 — désaccord constitutif — le modèle est comparé à la distribution humaine plutôt qu’au seul label majoritaire. Jensen–Shannon, Wasserstein, calibration et rangs peuvent être mesurés séparément.
C0 déterminée : forte contraction attendue. C1 sous-détermination faible : quelques lectures plausibles. C2 sous-détermination réelle : conserver les alternatives importantes. C3 distribution constitutive : représenter explicitement le désaccord.
T^FIELD ne doit donc pas se déclencher partout. Le GATE choisit entre SINGLE, PLURAL, DISTRIBUTIONAL et DECIDE_AFTER_FIELD.
Non-souveraineté de l’agrégateur : une synthèse n’épuise pas automatiquement le champ. Maintien dissymétrique : une branche rare n’est ni supprimée ni héroïsée par sa fréquence seule. Auto-annulation pré-enregistrée : si T^ devient bruit, signature stylistique ou coût sans gain, la couche T^ est retirée.
Aucune campagne quantitative nouvelle n’est présentée comme déjà exécutée. Les critères de récupération, d’auto-annulation et les contre-hypothèses sont définis avant collecte.