Les modèles de frontière réduisent clairement certaines barrières cognitives et informationnelles. Ils augmentent fortement la performance de novices sur des tâches in silico. Mais la preuve que cela se transforme déjà en capacité physique dangereuse dans un laboratoire reste beaucoup plus faible.
Accès, synthèse et contextualisation de connaissances biologiques très avancées.
Des novices accomplissent nettement mieux certaines tâches biologiques complexes avec des LLM qu’avec Internet seul.
Les essais physiques publiés montrent au mieux des signaux modestes ou incertains, sans uplift robuste sur leurs endpoints principaux.
Pas de preuve publique robuste qu’un modèle actuel donne à un expert une capacité dangereuse nouvelle autrement hors de portée.
Aucune étude publique ne mesure directement une augmentation de probabilité d’un événement biologique catastrophique attribuable à l’IA.
Une étude 2026 trouve un uplift de 4,16× en précision pour des novices équipés de LLM par rapport à Internet seul sur des tâches biologiques complexes.
OpenAI traite GPT-5.6 et GPT-6 Astra comme High en biologique/chimique, car plusieurs évaluations de troubleshooting et connaissances tacites dépassent les seuils indicatifs High.
Des travaux bénins montrent qu’un modèle peut proposer des modifications expérimentales, recevoir des résultats de laboratoire et itérer pour améliorer un système réel.
Anthropic rapporte plusieurs cas réels où des utilisateurs ont tenté d’intégrer des modèles à des programmes biologiques potentiellement dual-use.
Dans un essai randomisé de 153 novices, l’endpoint primaire n’a montré aucune amélioration significative : 5,2 % de complétion avec LLM contre 6,6 % avec Internet seul.
Répondre correctement à une question ou corriger un protocole ne démontre pas la maîtrise d’un laboratoire réel, de ses gestes, instruments, erreurs et aléas.
Les modèles OpenAI récents sont traités comme High, mais leurs évaluations Critical restent sous les seuils associés à la conception fiable de menaces nouvelles ou à un cycle complet sans humain.
Les cas Anthropic montrent que des filtres peuvent forcer des utilisateurs vers des modèles moins capables et réduire l’uplift disponible.
| Pièce | Établit | N’établit pas | Force |
|---|---|---|---|
| Zhang et al. 2026 | Uplift novice in silico important | Réussite physique en laboratoire | Très forte L2 |
| Hong et al. 2026 | Pas d’effet significatif sur l’endpoint wet-lab primaire avec modèles mi-2025 | Absence d’effet avec modèles 2026 | Très forte pour limiter L3 |
| OpenAI GPT-5.6 / Astra | Capacités High sur plusieurs evals bio | Menace physique réalisée | Forte capacité |
| Anthropic misuse cases | Vecteur d’usage réel et intérêt d’acteurs sensibles | Uplift catastrophique ou arme réussie | Forte pour usage |
| Wet-lab benign optimization | Boucle IA-expérience réelle possible | Capacité dangereuse | Proxy fort |