Terence Tao : cas illustratif, pas expérience centrale
Le contraste entre trajectoire cognitive documentée et chiffre viral reste utile pédagogiquement, mais n’est plus présenté comme contribution scientifique spécifique de T^GPT.
Cette branche reste publique mais quitte le noyau expérimental de T^GPT. Elle traite la portée des inférences psychométriques et des benchmarks ; elle ne sert plus d’argument d’originalité ni de preuve pour T^FIELD.
La théorie de la validité établit depuis longtemps qu’une interprétation de score doit être défendue pour une inférence et un usage déterminés. Cronbach & Meehl (1955), Messick (1989) et les standards contemporains de testing constituent donc l’arrière-plan principal de cette branche.
La question pertinente pour T^GPT est seulement adjacente : lorsqu’on agrège des mesures de modèles, quelles informations utiles à une décision donnée disparaissent et quelle portée peut-on légitimement attribuer au score obtenu ?
| Axe | Objet | Statut |
|---|---|---|
| VALIDITY | validité des inférences tirées d’un test ou benchmark | DOC |
| AGGREGATION | effet des pondérations et agrégations sur profils de performance | DOC / TEST |
| HUMAN–AI COMPARABILITY | changement éventuel de construit lorsqu’un instrument humain est appliqué à un LLM | HYP / TEST |
| PROFILE | comparaison entre profil multi-métrique et score agrégé pour une inférence donnée | TEST |
Les formulations T^Total, holochamp, Libellule^, Janus, MNL^ ou autres analogies peuvent être conservées ailleurs comme T^HEURISTIC. Elles ne sont plus utilisées dans cette page pour justifier une conclusion psychométrique, définir une métrique ou produire une inférence scientifique.
Une analogie peut orienter une question ; elle ne valide pas une mesure.
Le contraste entre trajectoire cognitive documentée et chiffre viral reste utile pédagogiquement, mais n’est plus présenté comme contribution scientifique spécifique de T^GPT.
Comparer plusieurs métriques peut révéler des profils que la moyenne masque ; ce point est déjà largement admis dans l’évaluation holistique. T^GPT ne revendique de nouveauté que si une procédure précise d’agrégation/récupération apporte un résultat mesurable supplémentaire.
Cronbach & Meehl (1955) — Construct validity in psychological tests
AERA · APA · NCME — Standards for Educational and Psychological Testing
Bommasani, Liang & Lee — Holistic Evaluation of Language Models