Programme adjacent · reclassement v0.8

Cognition, mesure, validité

Cette branche reste publique mais quitte le noyau expérimental de T^GPT. Elle traite la portée des inférences psychométriques et des benchmarks ; elle ne sert plus d’argument d’originalité ni de preuve pour T^FIELD.

DOC · psychométrieADJACENTT^HEURISTIC séparé
correction v0.8

« Un score n’est pas toute l’intelligence » n’est pas une découverte T^GPT.

La théorie de la validité établit depuis longtemps qu’une interprétation de score doit être défendue pour une inférence et un usage déterminés. Cronbach & Meehl (1955), Messick (1989) et les standards contemporains de testing constituent donc l’arrière-plan principal de cette branche.

La question pertinente pour T^GPT est seulement adjacente : lorsqu’on agrège des mesures de modèles, quelles informations utiles à une décision donnée disparaissent et quelle portée peut-on légitimement attribuer au score obtenu ?

portée

Quatre axes conservés

AxeObjetStatut
VALIDITYvalidité des inférences tirées d’un test ou benchmarkDOC
AGGREGATIONeffet des pondérations et agrégations sur profils de performanceDOC / TEST
HUMAN–AI COMPARABILITYchangement éventuel de construit lorsqu’un instrument humain est appliqué à un LLMHYP / TEST
PROFILEcomparaison entre profil multi-métrique et score agrégé pour une inférence donnéeTEST
séparation des couches

La couche T^ interprétative n’est plus probatoire ici.

Les formulations T^Total, holochamp, Libellule^, Janus, MNL^ ou autres analogies peuvent être conservées ailleurs comme T^HEURISTIC. Elles ne sont plus utilisées dans cette page pour justifier une conclusion psychométrique, définir une métrique ou produire une inférence scientifique.

Une analogie peut orienter une question ; elle ne valide pas une mesure.

cas humain

Terence Tao : cas illustratif, pas expérience centrale

Le contraste entre trajectoire cognitive documentée et chiffre viral reste utile pédagogiquement, mais n’est plus présenté comme contribution scientifique spécifique de T^GPT.

cas LLM

Leaderboards et profils

Comparer plusieurs métriques peut révéler des profils que la moyenne masque ; ce point est déjà largement admis dans l’évaluation holistique. T^GPT ne revendique de nouveauté que si une procédure précise d’agrégation/récupération apporte un résultat mesurable supplémentaire.