Étude maîtresse · extension 11.09.2026

Réduction, alignement, pluralité

Une étude technique et expérimentale du resserrement des sorties des LLM, de leur mesure, de l’orchestration multi-agent et de ce que T^ peut apporter sans devenir une nouvelle clôture.

Constat

« GPT est bridé » : formulation trop simple, intuition partiellement juste.

Le pré-entraînement, le SFT, RLHF/DPO, la hiérarchie d’instructions, le contexte, le sampling et l’interface forment plusieurs couches. Chacune transforme les possibilités visibles. La littérature documente à la fois des gains importants de contrôle et des pertes de diversité.

Ouyang et al. montrent dès InstructGPT que le feedback humain améliore le suivi d’intention, la vérité et la préférence humaine. Kirk et al., Li et al. et Peeperkorn et al. montrent cependant que différentes étapes de post-entraînement peuvent réduire la diversité des sorties.

Une distinction importante

Les contraintes de sécurité sont réelles, mais elles n’expliquent pas directement pourquoi une question innocente comme « contraire de blanc » reçoit immédiatement « noir ». Dans ce cas, la typicalité de la réponse, la préférence pour une réponse utile, le décodage et le contexte sont de meilleurs candidats explicatifs.

Le signal pairwise

Une grande partie de l’alignement par préférence repose sur des comparaisons entre réponses. DPO formalise directement une préférence entre réponse choisie et réponse rejetée. Des recherches récentes proposent des préférences soft, floues ou distributionnelles afin de conserver davantage la divergence humaine.

Le problème du consensus

Ajouter des agents ne suffit pas. Des travaux 2025–2026 observent conformité, influence majoritaire et suppression de réponses minoritaires correctes. Free-MAD explore explicitement un débat sans consensus.

T^ comme hypothèse d’architecture

T^GPT propose de déplacer la synthèse : les branches sont d’abord générées indépendamment, puis reliées sans vote global. Une sortie finale unique devient optionnelle. Le protocole surveille également sa propre rigidification.

Cas grandeur réelle · OpenAI · septembre 2026

Le champ computationnel peut être beaucoup plus large que la réponse visible.

La publication OpenAI sur Navier–Stokes documente un groupe de l’ordre de 10 000 agents concurrents, subdivisés en groupes communicants, recevant différentes variantes du problème, équipés d’un accès à une copie du Web et à l’exécution de code. OpenAI décrit ensuite des passages inter-groupes par consolidation de résultats intermédiaires via Codex.

Le cas ajoute un facteur rarement visible dans l’interface : le modèle sous-jacent lui-même n’est pas stationnaire. Une version davantage entraînée est devenue disponible pendant l’effort et a été introduite dans le système. Pour T^GPT, la provenance doit donc pouvoir inclure non seulement la branche et le prompt, mais aussi l’état temporel du modèle qui les a produits.

Ce cas renforce la pertinence de H06 (interface unique), H08 (pluralité fragile) et H10 (T^ comme orchestration), sans les prouver. Il ouvre en plus H13–H17 : champ/réponse visible, topologie de coordination, goulot de synthèse, non-stationnarité et dissociation découverte/vérification.

Ouvrir le complément complet : agents parallèles, modèle interne & BEL →

Décomposition du phénomène

CoucheEffet potentielStatut
Pré-entraînementDistribution large, connaissances et patrons multiples.DOC
SFTContrôle accru ; possibilité de concentration sur les réponses observées.DOC
RLHF / DPOPréférence, sécurité, utilité ; homogénéisation possible, optimisation de proxy.DOC
InstructionsCanalisation explicite du comportement et de la forme de réponse.DOC
DécodageTempérature/top-p déterminent la dispersion locale des tokens.DOC
Orchestration multi-agentPeut élargir l’exploration ; peut aussi accélérer conformité, répétition ou perte lors de la consolidation.DOC/HYP
Topologie de communicationIsolation locale, échanges différés ou synthèse centrale modifient ce qui survit au contact entre branches.HYP/TEST
InterfaceUne réponse visible rend la pluralité latente peu perceptible.HYP/OBS
ÉvaluationUne métrique ou moyenne peut conserver une information locale tout en masquant d’autres dimensions.DOC/HYP
T^FIELDConservation de configurations sans winner automatique.T^/HYP
Extension · cognition & mesure

Le resserrement peut apparaître après la génération : au moment de mesurer.

Un second axe du programme étudie la chaîne configuration → tâche → performance → métrique → score → classement. Le problème n’est pas l’existence du score, mais le glissement de portée qui peut transformer une mesure locale en représentation globale de l’agent.

T^GPT distingue désormais dix champs complémentaires : cognition, psychométrie, réduction scalaire, mesure aux extrêmes, champ de tâche, performance versus capacité, critique des benchmarks, profil multidimensionnel, comparabilité humain–IA et études de cas.

Cette branche introduit également un cas d’étude Terence Tao : non pour sacraliser un chiffre de QI, mais pour examiner l’écart entre une trajectoire cognitive documentée et sa compression médiatique en score unique.

Ouvrir l’extension cognition & mesure →