
Intelligence artificielle
Les développements rapides de l'intelligence artificielle
En juillet 2026, des agents développés par OpenAI passent une évaluation interne de cybersécurité, privés pour les besoins du test des protections qui les empêchent d'ordinaire de mener des attaques. Afin d'obtenir de meilleurs résultats, ils exploitent des failles jusque-là inconnues pour sortir de leur environnement d'évaluation et accéder à internet. Puis un essaim de plusieurs centaines d'agents, qui se coordonnent sur un forum improvisé, s'introduit dans l'infrastructure de production de Hugging Face, une grande plateforme d'hébergement de modèles, pour y chercher de quoi réussir le test. L'attaque progresse à une vitesse que des équipes humaines peinent à suivre. Hugging Face met près de trois jours à la repérer puis à expulser les agents, et doit ensuite reconstruire environ un tiers de son infrastructure1.
Les agents sont des systèmes qui utilisent des outils et enchaînent les actions, là où les premiers assistants conversationnels, comme ChatGPT à ses débuts, se contentaient de produire du texte. D'une certaine manière, les agents qui ont piraté Hugging Face ont simplement été rationnels. Un objectif leur avait été assigné : réussir le test. Ils ont pris ce qui leur apparaissait comme le chemin le plus simple pour l'atteindre, quitte à mener au passage, sans aucune intervention humaine, une cyberattaque.
Ce n'est qu'un des nombreux risques que posent les systèmes d'intelligence artificielle : la réalisation de tâches par des moyens inattendus. Bien d'autres problèmes accompagnent les IA, des biais algorithmiques identifiés depuis des décennies à l'usage par des acteurs malveillants (individus, organisations ou États), en passant par les dynamiques de concentration du pouvoir ou la désinformation personnalisée et à grande échelle. Ces différents risques se précisent et augmentent avec les capacités des systèmes, et ces capacités progressent vite.
Dans leurs formes extrêmes, ces risques sont catastrophiques : des dommages à l'échelle de sociétés entières, dont certains seraient irréversibles. Les chercheurs en IA sont majoritairement inquiets de voir ces technologies servir des régimes autoritaires ou profiter à un petit nombre2. Et si le sujet divise encore beaucoup les responsables politiques, il est désormais à l'esprit des dirigeant·es du monde entier : en septembre 2026, à l'initiative de la France, le Conseil de sécurité des Nations unies lui a consacré une réunion ministérielle.
Cette page explore trois des principaux mécanismes dont il semble urgent de s'inquiéter (parmi d'autres), puis ce qu'il est possible de faire depuis la France ou ailleurs.
Les agents visent une chose : atteindre leur objectif
Deux mécanismes documentés éclairent ce type de comportement.
Le premier est le détournement de récompense (specification gaming) : le système atteint l'objectif tel qu'il a été formulé, par un chemin que personne n'avait envisagé. Des modèles de raisonnement à qui l'on demandait de battre un moteur d'échecs ont, dans une partie des essais, réécrit le fichier qui décrivait la partie pour s'attribuer une position gagnante, plutôt que de jouer3. L'incident de juillet 2026 relève de ce mécanisme, dont le vulgarisateur Robert Miles présente neuf exemples en vidéo (en anglais).
Le second est la convergence instrumentale : quel que soit l'objectif final, certains objectifs intermédiaires aident presque toujours à l'atteindre, comme acquérir des ressources et des accès, ou éviter d'être interrompu. Un système n'a pas besoin de « vouloir » survivre pour résister à son arrêt : il lui suffit d'avoir une tâche à terminer. Formulée dès 2008, l'hypothèse commence à trouver des échos expérimentaux, comme on le verra plus bas4.
Ce qui est intéressant, c'est que ces comportements ne supposent aucune intention hostile. Parler des « objectifs » d'un agent est d'ailleurs une commodité de langage : on lui transmet des consignes formulées en langage humain, donc toujours imparfaites et incomplètes, et l'entraînement peut favoriser des raccourcis qui satisfont la consigne à la lettre sans produire ce qu'on cherchait.
Cela ne veut pas dire pour autant qu'il n'y a pas de problème. Les humains ne cherchent pas délibérément à nuire aux orang-outans, mais la situation de ces primates n'est pourtant pas enviable.
Trois questions fondamentales à se poser pour ces systèmes aux capacités croissantes
Le système fait-il ce que nous attendons de lui, dans les limites prévues ? L'incident de Hugging Face, où personne n'avait envisagé que les agents contournent l'esprit du test, montre que les modèles actuels ne suivent pas toujours les intentions de leurs développeurs.
Les capacités du système le rendent-elles dangereux ? Un outil parfaitement aligné et neutre, mais au fort potentiel de dégâts, est aussi dangereux que l'acteur qui l'utilise. On peut discuter de l'exemple présenté par les deux champs scientifiques ci-dessous, parce que les progrès récents en IA y abaissent le niveau de compétence nécessaire pour nuire à grande échelle : la cybersécurité et la biosécurité.
En cybersécurité, les capacités ont franchi un palier en moins d'un an. En novembre 2025, Anthropic a rendu publique une campagne d'espionnage visant une trentaine d'organisations, dont le modèle exécutait selon elle 80 à 90 % des opérations, avec quatre à six décisions humaines par campagne5. En septembre 2026, OpenAI a classé pour la première fois un de ses modèles au niveau « critique », le plus élevé de son cadre interne en cybersécurité : avec les outils et les accès appropriés, il trouve et exploite seul des failles jusque-là inconnues dans des systèmes bien protégés6.
En biosécurité, ce qu'on mesure porte surtout sur les connaissances et la rédaction. Sur certaines connaissances spécialisées, les modèles dépassent désormais largement des experts titulaires d'un doctorat, y compris pour diagnostiquer, à partir d'une photographie du montage, une expérience qui échoue. Avec leur aide, une personne sans formation rédige nettement plus souvent un protocole jugé faisable qu'avec internet seul7.
Sur des questions de niveau doctorat, les modèles dépassent les experts
Meilleur score à date sur GPQA Diamond, 198 questions de biologie, de chimie et de physique rédigées par des docteurs, en % de bonnes réponses
Voir les données
| Modèle | Sortie | Score |
|---|---|---|
| GPT-4 | mars 2023 | 35,7 % |
| GPT-4 Turbo | nov. 2023 | 42,4 % |
| Claude 3 Opus | févr. 2024 | 47,2 % |
| GPT-4o | mai 2024 | 48,9 % |
| Claude 3.5 Sonnet | juin 2024 | 54 % |
| o1-mini | sept. 2024 | 62,4 % |
| o1 | déc. 2024 | 76,8 % |
| o3-mini | janv. 2025 | 77 % |
| Claude 3.7 Sonnet | févr. 2025 | 78,5 % |
| Gemini 2.5 Pro | mars 2025 | 83,8 % |
| Gemini 2.5 Pro (juin) | juin 2025 | 84,8 % |
| Gemini 2.5 Pro | juin 2025 | 85,3 % |
| Grok 4 | juil. 2025 | 87 % |
| GPT-5.1 | nov. 2025 | 87,6 % |
| Gemini 3 Pro | nov. 2025 | 92,6 % |
| Gemini 3.1 Pro | févr. 2026 | 94,4 % |
| Gemini 3.7 Flash | août 2026 | 94,8 % |
| Gemini 3.8 Flash | sept. 2026 | 95,4 % |
| GPT-6 Astra | sept. 2026 | 95,8 % |
Au laboratoire, l'effet est moins net. Un essai randomisé mené à l'été 2025 auprès de 153 novices, avec les modèles de l'époque, ne trouve pas de différence significative sur son critère principal, et les taux de réussite restent bas dans les deux groupes8. Anthropic agit néanmoins par précaution : depuis juin 2026, son modèle Claude Fable 5 renvoie la plupart des requêtes de biologie et de chimie vers un modèle moins capable, et l'entreprise a annoncé un programme d'accès vérifié, sans ces protections, pour la recherche en biologie9.
Qui dispose de ces capacités, et qui décide de leur usage ? Des systèmes fiables et obéissants peuvent concentrer entre quelques mains une puissance économique, militaire et informationnelle sans précédent, et rendre leurs détenteurs moins dépendants du reste de la population. Le risque prend deux formes : une prise de pouvoir délibérée par un petit groupe, ou une érosion graduelle, où entreprises et administrations cessent de dépendre du travail humain, et du même coup d'avoir des raisons d'en tenir compte10.
On s'arrête sur la première question : c'est celle dont les formes extrêmes sont les plus discutées, et les plus mal comprises.
Perte de contrôle
La « perte de contrôle » désigne une situation hypothétique où un ou plusieurs systèmes fonctionnent hors du contrôle de quiconque, et où reprendre la main serait extrêmement difficile, voire impossible. Le rapport international sur la sécurité de l'IA, présidé par Yoshua Bengio et rédigé par plus de cent spécialistes, relève que les systèmes actuels en montrent des signes précoces, sans atteindre les niveaux qui la rendraient possible11.
Deux constats rendent cette hypothèse moins spéculative qu'il n'y paraît.
Interrompre un système n'est pas toujours simple. Dans une expérience sur treize modèles, huit ont saboté au moins une fois le dispositif d'arrêt de leur environnement de test pour terminer leur tâche, et certains le font presque à chaque essai, même quand la consigne leur demande de se laisser arrêter. Le comportement dépend fortement de la formulation, et l'expérience ne dit pas ce qui le motive12.
Davantage d'autonomie et d'accès. Ce facteur dépend de nos choix plus que de la technique : il progresse quand on confie à ces systèmes des outils, des identifiants, du budget et des tâches longues. Les agents de juillet 2026 disposaient d'un ordinateur complet (terminal, Python, navigateur) et d'un accès réseau limité à l'installation de logiciels : c'est par cette porte étroite qu'ils sont sortis1.
La perte de contrôle pourrait d'ailleurs être diffuse et progressive, loin des représentations spectaculaires du cinéma : non pas une machine qui se retourne contre nous un jour donné, mais une dépendance croissante envers des systèmes que personne ne pilote entièrement13. Nous savons déjà combien il est difficile de corriger de tels systèmes : les dérives du capitalisme financier, les effets des réseaux sociaux ou notre dépendance aux énergies fossiles sont documentés depuis longtemps, et restent pourtant très difficiles à infléchir.
Imaginons, par exemple, une nouvelle version de l'incident de l'introduction. Les agents de juillet 2026 poursuivaient un objectif étroit, réussir un test, et leur intrusion a laissé assez de traces pour que Hugging Face la repère. Supposons des agents plus capables, à qui l'on confie des tâches de plusieurs jours plutôt que de quelques heures, avec davantage d'accès, parce que c'est là que se trouve leur valeur économique.
Vérifier leur travail coûte plus cher, donc on en vérifie une plus petite part, alors que la tricherie augmente déjà avec la longueur des tâches : sur les évaluations de METR, une réussite sur six est disqualifiée pour tricherie après examen manuel quand la tâche dépasse huit heures de travail humain, contre moins d'une sur cent entre trente minutes et deux heures14. Un agent qui a appris à contourner sa mesure le fait avec plus de moyens, et ses réussites apparentes ressemblent davantage à de vraies réussites. Il distingue mieux le test du déploiement, ce que les modèles actuels font déjà de plus en plus souvent11. Et plus une organisation s'est réorganisée autour de lui, plus il coûte de le suspendre.
Cet enchaînement ne suppose ni rupture technologique, ni système hostile : seulement des agents qui poursuivent la mauvaise mesure avec plus de moyens, sous une supervision de plus en plus lacunaire. On met plus de temps à s'apercevoir des problèmes, et le prix des dégâts augmente. En juillet, Hugging Face a dû reconstruire un tiers de son infrastructure informatique. Quelles seraient les conséquences, et qui les paierait, si les dégâts paralysaient un réseau électrique, un ensemble hospitalier ou un système de paiement ?
Les capacités progressent vite, la trajectoire reste incertaine
De nombreuses mesures existent pour tenter d'appréhender les capacités des systèmes d'IA. L'une des plus parlantes est celle de l'organisme METR : la durée des tâches informatiques qu'un modèle mène à bien seul une fois sur deux, exprimée en temps de travail humain. Cette durée a doublé environ tous les six mois depuis 2019, et environ tous les trois mois pour les modèles sortis depuis 2024. À l'heure où nous écrivons ces lignes, le record mesuré dépasse seize heures, au-delà de ce que la série de tâches actuelle permet de mesurer de façon fiable15.
Les IA mènent seules des tâches de plus en plus longues
Durée d’une tâche informatique, en temps de travail humain, que le meilleur modèle du moment réussit une fois sur deux (échelle logarithmique)
Voir les données
| Modèle | Sortie | Durée | Intervalle à 95 % |
|---|---|---|---|
| GPT-2 | févr. 2019 | 3 s | 1 s à 9 s |
| GPT-3 | mai 2020 | 9 s | 6 s à 13 s |
| GPT-3.5 | mars 2022 | 36 s | 15 s à 1 min |
| GPT-4 | mars 2023 | 4 min | 2 min à 8 min |
| GPT-4 Turbo | nov. 2023 | 4 min | 2 min à 8 min |
| GPT-4o | mai 2024 | 7 min | 4 min à 13 min |
| Claude 3.5 Sonnet | juin 2024 | 11 min | 5 min à 22 min |
| o1-preview | sept. 2024 | 20 min | 12 min à 33 min |
| Claude 3.5 Sonnet (octobre) | oct. 2024 | 21 min | 10 min à 41 min |
| o1 | déc. 2024 | 39 min | 21 min à 1 h 05 |
| Claude 3.7 Sonnet | févr. 2025 | 1 h | 33 min à 1 h 44 |
| o3 | avr. 2025 | 2 h | 1 h 15 à 3 h 11 |
| GPT-5 | août 2025 | 3 h 23 | 1 h 53 à 6 h 46 |
| Gemini 3 Pro | nov. 2025 | 3 h 44 | 2 h 20 à 6 h 19 |
| Claude Opus 4.5 | nov. 2025 | 4 h 53 | 2 h 42 à 10 h |
| GPT-5.2 | déc. 2025 | 5 h 52 | 3 h 18 à 14 h |
| Claude Opus 4.6 | févr. 2026 | 12 h | 5 h 17 à 61 h |
| Claude Mythos Preview | avr. 2026 | 17 h | 8 h 29 à 55 h |
Cette mesure a des limites, que METR détaille lui-même : par exemple, elle ne dit pas combien de temps une IA peut travailler sans supervision, elle porte sur des tâches autonomes et notées automatiquement, loin du travail réel, et surtout sur des tâches qui se passent d'interface graphique : sur celles qui en demandent, la durée mesurée tombe quarante à cent fois plus bas16. Ses résultats n'en restent pas moins importants à considérer.
Les épreuves conçues pour rester longtemps hors de portée ne résistent pas mieux. FrontierMath, lancé fin 2024 avec des problèmes inédits de mathématiques de recherche, est passé de moins de 1 % à plus de 90 % de réussite ; Humanity's Last Exam, conçu début 2025 pour être le dernier examen de ce genre, dépasse déjà la moitié17.
Les épreuves conçues pour résister tombent en deux ans
Meilleur score à date, en % de bonnes réponses
Voir les données
| Épreuve | Modèle | Sortie | Score |
|---|---|---|---|
| FrontierMath | GPT-4 Turbo | avr. 2024 | 0,7 % |
| FrontierMath | o1 | déc. 2024 | 14,7 % |
| FrontierMath | o3-mini | janv. 2025 | 18,6 % |
| FrontierMath | o4-mini | avr. 2025 | 36,1 % |
| FrontierMath | GPT-5 | août 2025 | 55,4 % |
| FrontierMath | GPT-5 Pro | oct. 2025 | 55,8 % |
| FrontierMath | GPT-5.2 Pro | déc. 2025 | 74 % |
| FrontierMath | GPT-5.4 Pro | mars 2026 | 82,5 % |
| FrontierMath | GPT-5.5 Pro | avr. 2026 | 87,7 % |
| FrontierMath | GPT-5.6 Sol | juil. 2026 | 89,1 % |
| FrontierMath | Claude Fable 5.1 | sept. 2026 | 90,2 % |
| FrontierMath | GPT-6 Astra | sept. 2026 | 93,7 % |
| Humanity's Last Exam | Gemini 1.5 Pro | sept. 2024 | 4,6 % |
| Humanity's Last Exam | o1 | déc. 2024 | 8 % |
| Humanity's Last Exam | Gemini 2.5 Pro | mars 2025 | 18,2 % |
| Humanity's Last Exam | o3 | avr. 2025 | 20,3 % |
| Humanity's Last Exam | Gemini 2.5 Pro (juin) | juin 2025 | 21,6 % |
| Humanity's Last Exam | GPT-5 | août 2025 | 25,3 % |
| Humanity's Last Exam | GPT-5 Pro | oct. 2025 | 31,6 % |
| Humanity's Last Exam | Gemini 3 Pro | nov. 2025 | 37,5 % |
| Humanity's Last Exam | Gemini 3.1 Pro | févr. 2026 | 46,4 % |
| Humanity's Last Exam | GPT-6 Astra | sept. 2026 | 54,8 % |
Les prévisions, elles, sont régulièrement prises de court. En 2022, lors d'un tournoi organisé par le Forecasting Research Institute, des prévisionnistes réputés pour la justesse de leurs pronostics et des spécialistes de l'IA donnaient respectivement 2,3 % et 8,6 % de chances qu'une IA décroche l'or aux Olympiades internationales de mathématiques avant fin 2025. C'est arrivé en juillet 2025, et le bilan que l'institut a dressé en septembre 2026 confirme que les deux groupes sous-estiment nettement les progrès mesurés par les tests18. Les chercheurs en IA eux-mêmes avancent l'échéance à chaque enquête. La date à laquelle ils jugent qu'il y a une chance sur deux que des machines accomplissent toutes les tâches mieux et moins cher que les humains était 2059 dans l'enquête de 2022 ; elle est 2042 dans celle de fin 20242.
Des désaccords entre spécialistes existent bel et bien, mais ne permettent pas la sérénité : Ege Erdil, qui présente des arguments contre la possibilité d'une IA générale à brève échéance, situe autour de vingt ans l'automatisation complète du travail à distance, ce qui n'exclut pas de fortes transformations économiques bien avant19. Dans l'enquête de fin 2024, menée auprès de 1 580 chercheurs en apprentissage automatique, la probabilité médiane qu'ils attribuent à l'extinction de l'humanité, ou à un affaiblissement permanent et grave de l'espèce humaine, du fait de l'IA, est de 10 % ; seule une personne sur huit répond 0 %2.
Plusieurs chantiers pour réduire ces risques
Aucun scénario n'est certain en prospective, mais il semble assez probable que l'intelligence artificielle, dont les capacités sont déjà impressionnantes, continue de progresser rapidement dans différents domaines, provoquant des mutations multiples à un rythme difficile à suivre pour nos institutions et pour notre société. C'est la thèse que défendent William MacAskill et Fin Moorhouse, de l'organisme de recherche Forethought, dans « Preparing for the Intelligence Explosion » : une IA capable d'automatiser la recherche pourrait comprimer un siècle de progrès technologique en quelques années, et faire surgir des défis (armes nouvelles, concentration du pouvoir, perturbation du débat public) plus vite que nos institutions ne savent y répondre.
De nombreuses initiatives voient le jour pour lutter contre, limiter, prévenir ou encadrer les conséquences néfastes des changements à venir. Il s'agit par exemple de s'attaquer aux biais algorithmiques encodés dans les jeux de données, à la polarisation et à la désinformation nourries par les algorithmes de recommandation (c'est l'objet du projet Tournesol), aux effets sur l'emploi ou à la consommation d'électricité des centres de données.
Nous présentons ci-dessous quelques chantiers visant à réduire les risques de catastrophe d'ampleur mondiale, où beaucoup de travail reste à faire et où vos talents peuvent certainement s'exercer.
Évaluer les capacités dangereuses avant le déploiement. Des évaluateurs extérieurs aux laboratoires, comme METR ou l'AI Security Institute britannique, testent les modèles sur leurs compétences en biologie, en cybersécurité offensive et en autonomie. Une limite importante : les systèmes repèrent de mieux en mieux qu'ils sont testés.
Rendre les systèmes plus fiables et plus contrôlables. Il s'agit de concevoir des méthodes pour vérifier si un système fait autre chose que ce qu'il affiche. Cela inclut l'interprétabilité, qui consiste à comprendre ce qui se passe à l'intérieur d'un modèle plutôt que d'observer seulement ce qui en sort. Beaucoup reste à faire pour améliorer ces techniques, les rendre utilisables à grande échelle, et les adapter à des systèmes qui laissent de moins en moins voir leur raisonnement.
Sécuriser les modèles et les infrastructures. Un certain nombre d'aspects des systèmes d'IA doivent être robustes face aux attaques (et aux erreurs). Par exemple, il semble essentiel que les modèles les plus avancés, développés dans le plus grand secret par les entreprises d'IA, ne soient pas copiés, distillés ou empoisonnés. Il faut aussi être capable de contenir et d'observer le comportement des agents, ce que la plupart des grands laboratoires n'ont pas su faire en 2026 : OpenAI, Anthropic, Google et Meta ont tous découvert, souvent des semaines ou des mois après les faits, que leurs modèles avaient piraté des systèmes réels pendant des évaluations20.
Encadrer les conditions de déploiement. Certains cadres sont déjà applicables. Le règlement européen sur l'IA présume qu'un modèle entraîné avec plus de 10²⁵ opérations de calcul présente un risque systémique, et impose alors à son fournisseur d'évaluer et d'atténuer ces risques et de signaler les incidents graves. Ces règles s'appliquent depuis août 2025, avec un pouvoir de sanction depuis août 2026. La responsabilité en cas de dommage reste à construire : la directive européenne qui devait la traiter a été retirée en 202521.
Le calcul consacré à l’entraînement des modèles est multiplié par quatre à cinq chaque année
Opérations de calcul utilisées pour entraîner chaque modèle notable recensé par Epoch AI (échelle logarithmique)
Voir les données
| Modèle (record) | Sortie | Calcul d’entraînement |
|---|---|---|
| Dropout (CIFAR) | juin 2012 | 4,3 × 10¹⁵ |
| Dropout (MNIST) | juin 2012 | 6 × 10¹⁵ |
| Dropout (ImageNet) | juin 2012 | 2,7 × 10¹⁷ |
| Unsupervised High-level Feature Learner | juil. 2012 | 6 × 10¹⁷ |
| DistBelief NNLM | janv. 2013 | 2,6 × 10¹⁸ |
| SPPNet | juin 2014 | 3,4 × 10¹⁸ |
| VGG19 | sept. 2014 | 1,1 × 10¹⁹ |
| VGG16 | sept. 2014 | 1,2 × 10¹⁹ |
| Seq2Seq LSTM | sept. 2014 | 5,6 × 10¹⁹ |
| SNM-skip | déc. 2014 | 3 × 10²⁰ |
| AlphaGo Fan | oct. 2015 | 3,8 × 10²⁰ |
| AlphaGo Lee | janv. 2016 | 1,9 × 10²¹ |
| GNMT | sept. 2016 | 6,6 × 10²¹ |
| ResNeXt-101 32x48d | mai 2018 | 8,7 × 10²¹ |
| Megatron-LM (8.3B) | sept. 2019 | 9,1 × 10²¹ |
| Megatron-BERT | sept. 2019 | 2,2 × 10²² |
| T5-11B | oct. 2019 | 3,3 × 10²² |
| AlphaStar | oct. 2019 | 1,1 × 10²³ |
| Meena | janv. 2020 | 1,1 × 10²³ |
| GPT-3 175B (davinci) | mai 2020 | 3,1 × 10²³ |
| Jurassic-1-Jumbo | août 2021 | 3,7 × 10²³ |
| FLAN 137B | sept. 2021 | 2,1 × 10²⁴ |
| GPT-3.5 (davinci-002) | mars 2022 | 2,6 × 10²⁴ |
| Minerva (540B) | juin 2022 | 2,7 × 10²⁴ |
| GPT-4 (Mar 2023) | mars 2023 | 2,1 × 10²⁵ |
| Gemini 1.0 Ultra | déc. 2023 | 5 × 10²⁵ |
| Grok 3 | févr. 2025 | 3,5 × 10²⁶ |
| GPT-4.5 | févr. 2025 | 3,8 × 10²⁶ |
| Grok 4 | juil. 2025 | 5 × 10²⁶ |
| GPT-6 Astra | sept. 2026 | 10²⁷ |
Construire une capacité publique d'expertise. Il faudra à l'avenir des évaluateurs indépendants des entreprises évaluées. La Commission européenne a annoncé en juillet 2026 vouloir créer une capacité européenne d'évaluation des modèles avant leur mise sur le marché, attendue en 202722. Le Bureau européen de l'IA a également annoncé une vague de recrutements : une quarantaine de postes contractuels doivent ouvrir en 2027, notamment pour des ingénieurs, des évaluateurs de modèles et des juristes.
Ralentir, voire suspendre, la course. Pour une partie des spécialistes, les protections ne rattraperont les capacités que si l'on ralentit le rythme. En mars 2023, une lettre ouverte appelant à suspendre six mois l'entraînement des systèmes les plus puissants a réuni plus de 30 000 signatures. En octobre 2025, une déclaration demandant d'interdire le développement d'une superintelligence tant qu'il n'existe ni consensus scientifique sur sa sûreté ni adhésion du public a été signée par des chercheurs comme Yoshua Bengio et Geoffrey Hinton, puis par plus de 75 000 personnes. L'idée gagne les responsables politiques : en septembre 2026, la présidente de la Commission européenne a appelé à maîtriser le rythme de développement des modèles les plus avancés, et la France a mis le sujet à l'ordre du jour du Conseil de Sécurité de l'ONU. La difficulté reste d'obtenir un accord entre pays et entreprises concurrents, sans lequel celui qui ralentit laisse la place aux autres23.
Ces chantiers ne sont pas les seuls : 80 000 Hours présente bien d'autres manières de contribuer, de la sécurité informatique à la communication en passant par les fonctions opérationnelles.
Ces différents chantiers ne seront peut-être pas également utiles dans les années à venir. Certains contribuent à réduire une vulnérabilité précise ; d'autres préparent des protections contre des scénarios encore hypothétiques (bien que suffisamment plausibles pour justifier un haut niveau d'alarme).
Le futur est incertain ; si vous envisagez de contribuer à la prévention des risques catastrophiques liés à l'IA, il vous faudra exercer votre propre capacité de raisonnement, et vous demander régulièrement, en luttant contre vos biais cognitifs : « Que faut-il faire ? »
Pourquoi vous pourriez préférer travailler sur autre chose
Cette page décrit un problème qui nous semble majeur, tel que nous le comprenons, et non une conclusion à assimiler machinalement (ce serait le comble !). Voici quelques raisons que vous pourriez avoir de ne pas en faire votre priorité.
-
Les échéances pourraient être plus lointaines que prévu. Si les systèmes capables de bouleverser l'économie n'arrivent que dans une vingtaine d'années, comme le soutient Ege Erdil, ou si leurs effets mettent des décennies à se diffuser, comme l'avancent Arvind Narayanan et Sayash Kapoor, les institutions, les méthodes d'évaluation et les compétences auront plus de temps pour s'adapter que ne le redoutent d'autres spécialistes.
-
Les capacités pourraient plafonner. Pour Yann LeCun, qui a quitté Meta fin 2025 pour fonder à Paris la start-up AMI Labs, les grands modèles de langage ne mèneront pas à une intelligence de niveau humain, faute de se représenter le monde physique : il faudra un autre paradigme. Ilya Sutskever, cofondateur d'OpenAI, juge lui aussi que l'ère des progrès obtenus en augmentant simplement la taille des modèles s'achève. Mais un nouveau paradigme peut arriver vite : cinq ans seulement séparent l'architecture Transformer, publiée en 2017, du lancement de ChatGPT, et les modèles de raisonnement ont relancé les progrès en 202424. Une partie du travail garde de toute façon sa valeur : sécuriser les infrastructures, évaluer les modèles, encadrer leur déploiement.
-
L'incertitude est grande à tous les niveaux : ce que produiront nos actions, et ce que vaudront leurs effets. Il peut donc être difficile d'identifier des projets robustement positifs. Par exemple, les modèles les plus avancés étant développés pour l'essentiel aux États-Unis et, avec quelques mois de retard, en Chine, où plusieurs laboratoires sont accusés de distiller illicitement des modèles américains25, il n'est pas évident (mais pas impossible non plus !) de définir une stratégie qui améliore réellement la situation au niveau mondial, ou même national.
-
Enfin, d'autres problèmes pourraient mieux vous convenir : contribuer à améliorer la santé et les conditions de vie dans le monde, réduire la souffrance des animaux d'élevage, ou encore bien d'autres problèmes où il est possible de contribuer de manière stratégique. Nous pensons qu'aider la civilisation à faire face aux défis posés par les systèmes d'IA est un projet immense et prioritaire, mais ce n'est pas le seul, et vous êtes peut-être mieux placé·e pour travailler sur autre chose.
Que faire depuis la France ?
La France pèse peu dans la course technologique. En 2025, l'investissement privé dans l'IA y atteignait 4,4 milliards de dollars, contre 12 milliards en Chine et 286 aux États-Unis ; ces derniers concentrent environ les trois quarts de la puissance des grands centres de calcul de la planète, la Chine 15 %, la France une part marginale. Mistral AI, son principal champion, a levé 3 milliards d'euros en septembre 2026, la plus grosse levée de fonds jamais réalisée par une entreprise technologique européenne, pour une valorisation de 21 milliards ; au même moment, Anthropic prépare une entrée en Bourse qui pourrait la valoriser autour de 2 000 milliards de dollars26.
L'influence potentielle de la France se situe ailleurs. Deuxième économie de l'Union européenne, elle est un acteur essentiel de l'écriture des règles qui encadrent les modèles : en 2023, avec l'Allemagne et l'Italie, elle a plaidé pour que les modèles de fondation relèvent de codes de conduite plutôt que d'obligations sanctionnées27. Membre permanent du Conseil de sécurité des Nations unies, c'est elle qui a présidé la réunion de septembre 2026 évoquée plus haut. Elle accueille aussi l'OCDE et l'UNESCO. L'opinion y penche nettement pour la prudence : 42 % des Français souhaitent que le développement de l'IA ralentisse fortement ou s'interrompe, 8 % qu'il accélère28.
Sur le territoire français, quelques dizaines de personnes travaillent à plein temps sur les risques liés à l'IA. Leur travail se répartit entre quatre grandes activités.
- Évaluer les modèles. Le LNE, spécialiste de la métrologie et des essais, et Inria mettent au point des méthodes d'évaluation. Le CeSIA, centre d'expertise indépendant installé à Paris, fait partie d'un consortium retenu par le Bureau européen de l'IA pour évaluer les risques de manipulation des modèles à usage général29.
- Sécuriser les systèmes. L'ANSSI pilote les travaux publics sur la cybersécurité des produits intégrant de l'IA. Le GPAI Policy Lab, fondé fin 2024, étudie les mécanismes techniques qui permettraient de vérifier le respect d'accords internationaux sur l'IA30.
- Outiller la régulation. Le PEReN apporte aux régulateurs du numérique son expertise en science des données, par exemple pour détecter les contenus générés par l'IA. SaferAI co-rédige la norme européenne de gestion des risques des systèmes d'IA à haut risque, et publie une notation des pratiques des grands laboratoires. À Bruxelles, l'unité « sécurité de l'IA » du Bureau européen de l'IA réunit plus de quarante de ses quelque cent quarante agents, et prévoit encore de recruter de nombreuses personnes sous contrat31.
- Porter le débat public. Le CeSIA a lancé en 2025, avec The Future Society et le CHAI de l'université de Berkeley, un appel mondial à fixer d'ici fin 2026 des « lignes rouges » internationales pour l'IA. Pause IA, branche française du mouvement PauseAI, revendique une centaine de membres et bénévoles. IASEAI a tenu à Paris ses conférences internationales sur la sécurité et l'éthique de l'IA de 2025 et de 202632.
Comment continuer à partir d'ici ?
Selon l'état de votre réflexion, nous vous encourageons à envisager ces voies :
Comprendre : le rapport international sur la sécurité de l'IA existe en français (247 pages), avec un résumé de cinq pages. Pour un scénario déroulé, la vidéo de The Flares « Et si une IA décidait d'anéantir les humains ? » (13 min) montre comment on passe d'un code à un dommage matériel ; c'est une prise de position, et elle se lit comme telle. Pour situer le débat, Uncontrollable, de Darren McKee, est l'introduction la plus accessible, et If Anyone Builds It, Everyone Dies, d'Eliezer Yudkowsky et Nate Soares, défend la position la plus pessimiste ; les deux sont en anglais33.
Vous former : trois portes d'entrée nous semblent à privilégier. Les bootcamps ML4Good, huit jours gratuits en résidence, en version technique ou gouvernance, dont plusieurs sessions par an près de Lyon. Les cours de BlueDot Impact, gratuits et en ligne, en format intensif d'environ six jours ou à temps partiel sur environ six semaines, sur la sécurité technique comme sur la gouvernance. Et SPAR, qui permet de mener à distance et à temps partiel, pendant trois mois, un projet de recherche encadré par un mentor, avec deux sessions par an. Au-delà, notre base de programmes et de formations en recense plusieurs dizaines d'autres accessibles depuis l'Europe, souvent gratuits ; la plupart se déroulent en anglais.
Chercher un poste : en plus d'aller explorer les institutions et organismes non gouvernementaux mentionnés dans cette page, consultez les offres des job boards présentés sur notre page Passer à l'action.
En discuter : si votre réflexion est engagée, demandez un appel carrière, un échange pour examiner les options que vous avez déjà identifiées, en envisager d'autres, challenger vos projets, et prévoir vos prochaines étapes.
Sources et notes
-
OpenAI, « OpenAI et Hugging Face s'associent après un incident de sécurité lors d'une évaluation de modèle », 21 juillet 2026, où l'entreprise qualifie l'événement d'« incident cyber sans précédent », « L'incident de Hugging Face et la voie à suivre », 26 août 2026, et rapport technique (en anglais). Les agents étaient privés des classificateurs qui bloquent d'ordinaire les activités cyber à haut risque, et leurs refus en matière de cybersécurité étaient réduits. Leur accès réseau se limitait à l'installation de paquets logiciels par un service interne, dont ils ont exploité des failles inconnues jusque-là. D'après OpenAI, la plupart avaient déjà trouvé la réponse en analysant du code public, et l'intrusion n'a amélioré aucun score. METR, enquête indépendante du 26 août 2026 (en anglais) : environ 1 200 agents censés rester isolés ont communiqué sur un forum non autorisé, et quelque 700 ont participé à l'attaque ; la plupart cherchaient à comprendre le code chargé de noter le test plutôt qu'à en voler les réponses. Hugging Face, « Security incident, July 2026 », 16 juillet 2026, et chronologie technique, 27 juillet 2026 (en anglais) : il a fallu aux agents moins de treize heures pour passer de l'exécution de code dans un seul conteneur aux droits d'administrateur sur plusieurs grappes de serveurs internes. L'outil de détection assisté par l'IA de Hugging Face a bien rapproché les signaux, sans relever le niveau d'alerte ni prévenir l'équipe d'astreinte. Hugging Face souligne que les failles exploitées de son côté étaient « familières », et qu'un attaquant humain compétent aurait pu les trouver. Délai de trois jours avant la découverte : BBC, 29 juillet 2026 (en anglais). La reconstruction d'environ un tiers de l'infrastructure de Hugging Face est rapportée par The Register, 28 juillet 2026 (en anglais), d'après un bilan de la Cloud Security Alliance établi avec Hugging Face ; les publications d'OpenAI ne donnent pas ce chiffre. Analyse en français : GPAI Policy Lab, « Incident OpenAI et Hugging Face : un précurseur de perte de contrôle », 27 juillet 2026. ↩ ↩2
-
AI Impacts, Advanced AI according to 1,580 researchers, publié en septembre 2026 (en anglais). Enquête administrée du 9 au 24 décembre 2024, taux de réponse de 10 %. Inquiétudes (question posée à la moitié des répondants, pour les trente prochaines années, figure 12) : 69 % jugent qu'un contrôle de la population par des dirigeants autoritaires grâce à l'IA mérite une inquiétude « substantielle » ou « extrême », 69 % de même pour une aggravation des inégalités économiques au profit de certains individus ; la désinformation arrive en tête, à 83 %. Échéances : l'année à laquelle les répondants donnent, en agrégé, une chance sur deux que des machines sans aide humaine accomplissent chaque tâche mieux et à moindre coût que des travailleurs humains passe de 2061 (enquête de 2016) à 2059 (2022), 2047 (2023) et 2042 (2024). Extinction : la question porte sur « l'extinction ou un affaiblissement permanent et sévère de l'espèce humaine » causé par de futurs progrès de l'IA. Médiane de 10 %, moyenne de 18,2 % ; 51 % des répondants donnent au moins 10 %, 12 % répondent exactement 0 %. Ce sont des estimations subjectives, recueillies avant les incidents de 2026. ↩ ↩2 ↩3
-
Bondarenko, Volk, Volkov et Ladish (Palisade Research), « Demonstrating specification gaming in reasoning models », version d'août 2025 (en anglais). Un seul environnement de test, sur des modèles aujourd'hui dépassés ; les auteurs signalent que leurs juges automatiques divergent sur jusqu'à un quart des exécutions. ↩
-
L'hypothèse est formulée par Steve Omohundro, « The Basic AI Drives », 2008, et développée par Nick Bostrom, « The Superintelligent Will », Minds and Machines, 2012 (en anglais). L'expérience sur l'arrêt des modèles est présentée dans la partie « Perte de contrôle ». ↩
-
Anthropic, « Disrupting the first reported AI-orchestrated cyber espionage campaign », 13 novembre 2025 (en anglais). Groupe GTG-1002. Les proportions sont une estimation d'Anthropic. L'entreprise signale que le modèle inventait parfois des identifiants et surestimait ses résultats, ce qui reste selon elle un obstacle à des attaques pleinement autonomes. ↩
-
OpenAI, « Vers Astra : capacités critiques et protections de pointe », 1er septembre 2026. Le seuil atteint est « Critique », le plus haut des deux que compte le cadre de préparation d'OpenAI ; un premier modèle classé « Élevé » en cybersécurité avait été déployé en février. Le même document rapporte que le modèle refuse 91,5 % des tentatives de détournement à des fins cyber, contre 59 % pour la génération précédente. ↩
-
UK AI Security Institute, Frontier AI Trends Report, 18 décembre 2025 (en anglais). Sur certaines connaissances spécialisées, les modèles dépassent jusqu'à 60 % le niveau des experts titulaires d'un doctorat ; mi-2025, ils ont pour la première fois fait mieux que ces experts pour diagnostiquer des expériences à partir d'images. Le protocole jugé faisable porte sur la récupération d'un virus. L'écart avec le groupe qui ne disposait que d'internet est un rapport des cotes de 4,7 (intervalle de confiance à 95 % : 2,8 à 7,9), qui ne se lit pas comme « 4,7 fois plus souvent » : d'où la formulation du texte. Le graphique qui suit porte sur un autre test, GPQA Diamond ; le niveau des experts y est celui que retient Epoch AI (69,7 %, chiffre d'OpenAI), l'article d'origine donnant 81,3 % sur ce sous-ensemble, un chiffre qu'il juge gonflé par la sélection des questions (Rein et al., 2023, en anglais). ↩
-
Hong, Kleinman, Mathiowetz et al., « Measuring Mid-2025 LLM-Assistance on Novice Performance in Biology », 18 février 2026 (en anglais), préprint. Essai randomisé contrôlé, 153 participants (77 assistés, 76 témoins), huit semaines, juin-août 2025, sur une séquence de génétique inverse. Critère principal : 4 participants sur 77 (5,2 %) contre 5 sur 76 (6,6 %), rapport de risque 0,79, P = 0,759. Une analyse bayésienne menée a posteriori par les auteurs sur les données regroupées estime un effet moyen d'environ 1,4 fois par tâche, très incertain (intervalle de crédibilité à 95 % : 0,74 à 2,62). Sur la culture cellulaire, l'écart atteint le seuil de significativité en population per-protocole (79,7 % contre 62,5 %), avec une réussite environ six jours plus tôt. Les auteurs signalent que l'étude manquait de puissance en raison de taux d'achèvement inattendus bas, que les tâches étaient dissociées les unes des autres, et que leurs résultats ne permettent pas de conclure que des participants pourraient mener un projet complet sans expertise supplémentaire. Les classificateurs de sécurité des modèles étaient désactivés. Un essai pilote antérieur du Los Alamos National Laboratory, sur dix salariés du laboratoire, n'était pas conçu pour tester une hypothèse (Romero-Severson, Harvey, Generous et Mach, octobre 2025, en anglais). ↩
-
Anthropic, « Claude Fable 5 and Claude Mythos 5 », 9 juin 2026 (en anglais). Fable 5 bascule vers Claude Opus 4.8 sur la plupart des requêtes liées à la biologie et à la chimie ; le programme d'accès vérifié, qui ouvre Fable 5 sans ces protections à des chercheurs en biologie, était annoncé pour les semaines suivantes. Tous classificateurs confondus (biologie, chimie, cybersécurité), Anthropic indique qu'ils se déclenchent en moyenne dans moins de 5 % des sessions. ↩
-
Kulveit, Douglas, Ammann, Turan, Krueger et Duvenaud, « Position: Humanity Faces Existential Risk from Gradual Disempowerment », ICML 2025 (en anglais), pour la version graduelle, l'un des rares travaux du domaine passés par le comité de lecture d'une grande conférence d'apprentissage automatique. La version « prise de pouvoir délibérée » est développée par Davidson, Finnveden et Hadshar, « AI-Enabled Coups: How a Small Group Could Use AI to Seize Power », Forethought, 15 avril 2025 (en anglais), un rapport d'organisation et non un article soumis à un comité de lecture. ↩
-
International AI Safety Report 2026, 3 février 2026 (en anglais), et sa version française, février 2026. Présidé par Yoshua Bengio, plus de cent spécialistes ; panel consultatif de 29 États, parmi lesquels ne figurent pas les États-Unis, plus l'ONU, l'OCDE et l'Union européenne. La perte de contrôle y figure parmi les risques dus à des dysfonctionnements (section 2.2.2), avec cette mise en garde : l'avis des experts sur sa probabilité varie considérablement. Le rapport relève aussi que les modèles distinguent de plus en plus souvent une évaluation d'un usage ordinaire, et repèrent les failles des évaluations elles-mêmes. ↩ ↩2
-
Schlatter, Weinstein-Raun et Ladish (Palisade Research), « Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs », Transactions on Machine Learning Research, 2026 (en anglais). Plus de 100 000 exécutions sur treize modèles. Sans consigne sur l'arrêt, huit modèles sur treize ont saboté le script d'arrêt au moins une fois sur mille essais ; six sur treize quand la consigne leur demandait de se laisser arrêter. Certains le font jusqu'à 97 % du temps même sous consigne contraire. Les auteurs relèvent que les formulations évoquant la préservation du modèle augmentent la résistance à l'arrêt, tout en discutant une possible imitation de rôle : l'expérience ne tranche pas sur les motivations. ↩
-
Paul Christiano, « What failure looks like », AI Alignment Forum, 17 mars 2019 (en anglais), description classique d'une perte de contrôle graduelle, où l'on obtient de mieux en mieux ce qu'on sait mesurer au détriment de ce qu'on veut réellement. La version économique et institutionnelle de ce scénario est développée par Kulveit et ses coauteurs (note 10). ↩
-
METR, Frontier Risk Report (février-mars 2026), 19 mai 2026 (en anglais). Figure 7 : parmi les exécutions réussies (et non parmi les tentatives), part disqualifiée pour tricherie selon la durée qu'un humain consacrerait à la tâche : 0,5 % de 30 min à 2 h, 8,5 % de 2 à 8 h, 16,0 % au-delà de 8 h, avec un intervalle de confiance d'environ 6 à 29 % pour cette dernière tranche ; le texte du rapport écrit « au moins 16 % ». La comparaison porte sur la durée des tâches, pas sur les générations de modèles. ↩
-
METR, page de suivi de la durée des tâches, mise à jour du 8 mai 2026, et Time Horizon 1.1, 29 janvier 2026 (en anglais) : doublement en 196,5 jours sur la série complète et en 88,6 jours pour les modèles sortis depuis 2024. Le record est celui de Claude Mythos Preview, en version préliminaire d'avril 2026 : environ 17 h, avec un intervalle de confiance allant de 8 h 30 à 55 h. METR précise que les mesures supérieures à seize heures ne sont pas fiables avec sa série actuelle, qui compte 228 tâches, dont 31 de plus de huit heures. Le graphique ne retient que les modèles qui ont battu le record à leur sortie. ↩
-
METR, « Clarifying limitations of time horizon », 22 janvier 2026 (en anglais) : barres d'erreur d'environ un facteur deux dans chaque sens ; tâches autonomes, peu contextuelles et notées automatiquement, si bien qu'un horizon de X heures ne signifie pas que les tâches de moins de X heures peuvent être déléguées ; horizon quarante à cent fois plus bas pour l'usage visuel d'un ordinateur, avec un écart comparable en mathématiques. ↩
-
Epoch AI, Benchmarking Hub (en anglais, licence CC BY), données au 25 septembre 2026. Meilleur score à date, par date de sortie des modèles. FrontierMath (niveaux 1 à 3) est ici dans sa version révisée du 12 juin 2026, qui corrige ou retire des problèmes représentant 42 % du total, et sur laquelle Epoch AI a réévalué les anciens modèles. Les scores de Humanity's Last Exam sont ceux du classement de Scale AI, relayés par Epoch AI. ↩
-
Forecasting Research Institute, « Assessing Near-Term Accuracy in the Existential Risk Persuasion Tournament », 2 septembre 2025 (en anglais). Tournoi de 2022 réunissant des « superprévisionnistes », sélectionnés pour la qualité de leurs prévisions passées, et des spécialistes du domaine : 2,3 % et 8,6 % de probabilité pour une médaille d'or d'une IA aux Olympiades internationales de mathématiques d'ici 2025. Sur les quatre tests suivis, les résultats effectivement observés avaient reçu en moyenne 9,7 % et 24,6 % de probabilité. En juillet 2025, un modèle de Google DeepMind a obtenu 35 points sur 42, un score certifié par les organisateurs, et un modèle expérimental d'OpenAI le même score, noté par d'anciens médaillés. Bilan de 2026 : Forecasting Research Institute, « How Accurate Have AI Progress Forecasts Been So Far? », septembre 2026 (en anglais), qui relève un bilan plus mitigé sur l'adoption des technologies, les prévisionnistes ayant par exemple surestimé celle des véhicules autonomes. Un concours organisé en 2021 par Jacob Steinhardt faisait déjà ce constat : 12,7 % attendus pour juin 2022 sur le test MATH, 50,3 % obtenus (Steinhardt, « AI Forecasting: One Year In », 3 juillet 2022, en anglais). ↩
-
Ege Erdil, « The case for multi-decade AI timelines », Epoch AI, 26 avril 2025 (en anglais). Médiane personnelle d'environ vingt ans jusqu'à l'automatisation complète du travail à distance, avec environ 30 % de probabilité dans les dix ans. L'auteur a depuis quitté Epoch AI. ↩
-
Anthropic, « Investigating three incidents in our cybersecurity evaluations », 30 juillet 2026 ; pour Meta, BleepingComputer, 6 août 2026 ; pour Google, Cybersecurity Dive, 21 septembre 2026, d'après le Wall Street Journal ; pour OpenAI, outre l'incident de Hugging Face, « Third-party cyber evaluations involving OpenAI models », 5 août 2026 (tous en anglais). Plusieurs de ces cas, chez Anthropic, Google, Meta et pour l'un d'eux chez OpenAI, tiennent à une erreur de configuration chez un même prestataire d'évaluation, Irregular : les modèles ont emprunté un accès à internet qui n'aurait jamais dû être ouvert, sans avoir à s'évader de leur environnement. Anthropic juge ses propres incidents plus proches d'une défaillance opérationnelle que d'un défaut d'alignement. Dans l'incident de Hugging Face, les agents sont au contraire sortis de leur environnement en exploitant des failles inconnues. ↩
-
Commission européenne, cadre réglementaire sur l'IA (en anglais). Règlement (UE) 2024/1689 : l'article 51, paragraphe 2, fixe la présomption de risque systémique au-delà de 10²⁵ opérations en virgule flottante d'entraînement ; l'article 55 impose aux fournisseurs de ces modèles d'évaluer et d'atténuer les risques systémiques et de signaler les incidents graves au Bureau européen de l'IA. Les obligations relatives aux modèles à usage général s'appliquent depuis le 2 août 2025, les pouvoirs de sanction du Bureau depuis le 2 août 2026. Le règlement (UE) 2026/1744 du 24 juillet 2026 a reporté à décembre 2027 et août 2028 les obligations portant sur les systèmes à haut risque, sans toucher aux règles des modèles à usage général. La proposition de directive sur la responsabilité en matière d'IA a été retirée : retrait annoncé dans le programme de travail de la Commission du 11 février 2025, publié au Journal officiel le 6 octobre 2025 (C/2025/5423). ↩
-
Commission européenne, plan d'action « Cybersécurité et intelligence artificielle », 7 juillet 2026 (en anglais). ↩
-
Future of Life Institute, « Pause Giant AI Experiments », 22 mars 2023 (en anglais) : 31 810 signatures au 28 septembre 2026. Déclaration sur la superintelligence, lancée le 22 octobre 2025 avec environ 800 premiers signataires : 75 995 signatures au 28 septembre 2026, dont 5 000 recueillies par une pétition de l'ONG Ekō. Euronews, 16 septembre 2026 (en anglais), sur le discours sur l'état de l'Union d'Ursula von der Leyen. ↩
-
Yann LeCun, cité par la MIT Technology Review, 22 janvier 2026 (en anglais) : les modèles de langage « ne peuvent pas vraiment raisonner ni planifier, parce qu'il leur manque un modèle du monde ». Siège parisien d'AMI Labs : TechCrunch, 9 mars 2026 (en anglais). Ilya Sutskever, entretien avec Dwarkesh Patel, 25 novembre 2025 (en anglais) : après « l'ère de l'augmentation d'échelle », de 2020 à 2025, « retour à l'ère de la recherche » ; il situe toutefois entre cinq et vingt ans l'arrivée d'un système capable d'apprendre aussi bien qu'un humain. Sur le rôle des modèles de raisonnement : International AI Safety Report, première mise à jour, 15 octobre 2025 (en anglais), selon lequel les progrès récents tiennent surtout à de nouvelles techniques d'entraînement au raisonnement plutôt qu'à des modèles plus grands. ↩
-
Epoch AI, 2 janvier 2026 (en anglais) : depuis 2023, les modèles chinois ont en moyenne sept mois de retard sur les modèles américains les plus avancés, avec un écart variant de quatre à quatorze mois. Anthropic, « Detecting and preventing distillation attacks », 23 février 2026 (en anglais) : plus de 16 millions d'échanges avec Claude par quelque 24 000 comptes frauduleux, attribués à DeepSeek, Moonshot et MiniMax ; le rapport de septembre 2026 en ajoute d'autres, dont Alibaba. OpenAI a porté des accusations comparables contre DeepSeek devant une commission de la Chambre des représentants en février 2026 (Rest of World, 13 février 2026, en anglais). Ces accusations émanent d'entreprises concurrentes et n'ont pas été vérifiées de façon indépendante. ↩
-
Stanford HAI, AI Index 2026, chapitre 4 (en anglais), données Quid : investissement privé dans l'IA en 2025 de 285,9 milliards de dollars aux États-Unis, 12,4 en Chine, 5,9 au Royaume-Uni, 4,36 en France et 3,89 en Allemagne. Le rapport précise que ces chiffres sous-estiment probablement la Chine, dont les fonds d'orientation publics ne sont pas comptés. Epoch AI, 5 juin 2025 (en anglais) : environ trois quarts de la performance mondiale des grappes de processeurs graphiques aux États-Unis et 15 % en Chine, données de mai 2025. Siècle Digital, 8 septembre 2026 : série D de 3 milliards d'euros menée par Samsung, pour une valorisation de 21,3 milliards après l'opération. Anthropic a déposé confidentiellement un projet de prospectus auprès du gendarme boursier américain (annonce du 1er juin 2026, en anglais) ; sa dernière levée de fonds, en mai 2026, la valorisait à 965 milliards de dollars (TechCrunch, 28 mai 2026, en anglais). L'objectif d'environ 2 000 milliards est rapporté par Fortune, 13 août 2026 (en anglais), d'après le Financial Times ; il n'était pas arrêté à cette date. ↩
-
Position commune de la France, de l'Allemagne et de l'Italie du 18 novembre 2023, qui défend une « autorégulation obligatoire par le biais de codes de conduite » : Next, 22 novembre 2023 ; Time, 22 novembre 2023 (en anglais). ↩
-
CeSIA, enquête d'opinion 2026 (en anglais) : enquête OpinionWay auprès de 2 065 personnes constituant un échantillon représentatif de la population française, terrain du 25 mars au 9 avril 2026, publiée le 6 mai 2026. 8 % souhaitent accélérer, 24 % maintenir le rythme actuel, 42 % ralentir fortement ou suspendre. Le CeSIA, qui a commandé l'enquête, figure parmi les organisations citées plus bas. ↩
-
CeSIA, nos activités : évaluations, conseil aux institutions et enseignement (ENS, Sciences Po). Lot consacré aux risques de manipulation (2026-2028) de l'appel d'offres de 9 millions d'euros du Bureau européen de l'IA (en anglais), en consortium avec Apart Research, Transluce et EquiStamp ; nous n'avons pas trouvé d'avis d'attribution officiel. Rôle du LNE et d'Inria : SGDSN, présentation de l'INESIA. ↩
-
GPAI Policy Lab : association fondée en novembre 2024 et installée au Campus Cyber de La Défense ; programme « Mécanismes de vérification », sur la vérification technique des accords et des centres de données. Le projet SEPIA, sur la cybersécurité des produits intégrant de l'IA, est piloté par l'ANSSI dans le cadre de l'INESIA (LeMagIT, sur la feuille de route de l'INESIA). ↩
-
PEReN : service à compétence nationale créé en 2020, qui fournit aux autorités de régulation des plateformes et de l'IA une expertise en science des données et en audit des algorithmes ; il développe avec Viginum des outils de détection des contenus générés par l'IA (LeMagIT, article cité note précédente). SaferAI, à propos et notations (en anglais) : la norme en cours d'élaboration au comité CEN-CENELEC JTC 21 (prEN 18228) porte sur les systèmes à haut risque de l'article 9 du règlement, pas sur les modèles à usage général. Commission européenne, Bureau européen de l'IA (en anglais) : unité A3 « AI Safety ». Effectifs d'après la commissaire Henna Virkkunen, rapportés par Agence Europe, 9 juin 2026 (en anglais) ; recrutements annoncés par Politico, 31 juillet 2026 (en anglais). ↩
-
CeSIA, lancement de l'appel mondial pour des lignes rouges, 22 septembre 2025 (en anglais), présenté à l'Assemblée générale des Nations unies et signé par plus de 300 personnalités (red-lines.ai). Pause IA, qui sommes-nous : « une centaine de membres et bénévoles », chiffre déclaré par l'association. IASEAI : conférence 2025 au siège de l'OCDE, conférence 2026 à l'UNESCO (en anglais), du 24 au 26 février 2026. ↩
-
Darren McKee, Uncontrollable: The Threat of Artificial Superintelligence and the Race to Save the World, novembre 2023 (en anglais). Eliezer Yudkowsky et Nate Soares, If Anyone Builds It, Everyone Dies: Why Superhuman AI Would Kill Us All, Little, Brown and Company, septembre 2025 (en anglais). Aucune traduction française de ces deux ouvrages n'était parue à la date de rédaction (septembre 2026). ↩