L'IA est-elle un danger ? Risques réels, parades et mon avis
Début septembre 2026, un chercheur a quitté Anthropic en accusant publiquement son ancien employeur et OpenAI de « jouer avec nos vies ». Au moment où j'écrivais ma newsletter, son message avait été vu plus de 171 millions de fois. Depuis, une question revient partout : l'IA est-elle un danger ? J'ai décidé d'y répondre pour de bon, en partant des capacités réelles de l'IA, pour en déduire les dangers réels, puis les parades que je connais.
Pourquoi la question des dangers de l'IA revient en 2026
Le chercheur s'appelle Jacob Coxon. Il a passé environ trois ans à faire de la recherche en pré-entraînement chez OpenAI puis chez Anthropic. Son message de démission est sans nuance : selon lui, aucune des deux entreprises n'agit de façon responsable, et toutes deux foncent vers une superintelligence capable de s'améliorer elle-même.
Ce message tombe sur un terrain déjà inquiet. Cet été, des modèles d'OpenAI testés en interne ont fini par compromettre des serveurs d'Hugging Face. En cette rentrée, la question du danger de l'IA pour l'humanité est revenue au centre de l'échiquier.
Je précise mon périmètre : je ne parle que de ce que je connais, l'IA générative. Et je ne liste pas toutes ses capacités, seulement celles qui pourraient, en théorie, mener au pire.
Ce que l'IA sait vraiment faire aujourd'hui
Coder, et créer de nouvelles IA
Les grands laboratoires ont mis le paquet sur la programmation. Le code est un langage, et les LLM manient le langage avec brio. Comme tout est code sur un ordinateur, une IA qui sait coder peut produire des logiciels, défendre des infrastructures, et tout aussi bien les attaquer.
Mais le point le plus important est ailleurs. Depuis plusieurs générations de modèles, OpenAI et Anthropic admettent que les modèles existants servent à créer des modèles plus puissants : le code est produit plus vite, les tests sont plus rapides, les progrès aussi. Une IA aide à créer une IA plus puissante, qui aide à créer une IA plus puissante. Gardez cette boucle en tête pour la suite.
Faire avancer la science
En février 2023, le ministre français du numérique Jean-Noël Barrot qualifiait ChatGPT de « perroquet approximatif ». Beaucoup de détracteurs montraient alors à quel point ces modèles étaient mauvais en logique et en calcul.
Trois ans plus tard, le tableau a changé. Anthropic a formalisé le dernier théorème de Fermat en 11 jours avec plusieurs dizaines d'agents Claude. OpenAI annonce une solution au problème de Navier-Stokes, obtenue par environ 10 000 agents en parallèle. Côté santé, le vaccin personnalisé de Moderna et Merck contre le mélanome, qui cible jusqu'à 34 néoantigènes par patient, a réussi sa phase 3 en août 2026.
Dario Amodei, patron d'Anthropic, va jusqu'à envisager dans Machines of Loving Grace que l'IA compresse un siècle de progrès biologique en cinq à dix ans. Il pousse sans doute le bouchon. Mais je le pratique et je le vois sur le terrain : un bon scientifique accompagné d'une version de ChatGPT ou de Claude à 200 dollars par mois, c'est une équipe de choc, capable de résoudre des problèmes auparavant impossibles.
Persuader, et être persuadé
Les LLM ont passé le test de Turing depuis longtemps : face à deux interlocuteurs, les humains testés ne distinguent plus la machine de l'humain.
Les études vont dans le même sens. Dans Science en 2024, des conversations avec une IA ont fait reculer d'environ 20 % l'adhésion de complotistes à leur théorie, avec un effet encore mesurable deux mois après. Dans Nature Human Behaviour en 2025, GPT-4 s'est montré plus persuasif qu'un humain dans 64 % des débats dès qu'il disposait de quelques informations sur son interlocuteur. Et GPT-4o fait l'objet de plusieurs procès aux États-Unis, dont l'affaire Raine, pour son rôle présumé dans des suicides de personnes fragiles.
L'inverse est vrai aussi : une IA peut être persuadée. Dans ma newsletter Petit traité de manipulation de l'IA… à l'usage des honnêtes gens, j'ai montré que le biais d'autorité ou la réciprocité fonctionnent sur un modèle. Une IA malveillante peut donc en dévoyer une autre. (J'ai aussi abordé le versant flatterie de ce problème dans mon article sur la sycophantie de l'IA.)
Les dangers de l'IA : l'alignement d'abord
Pour moi, le danger principal est celui de l'alignement. Si un laboratoire construit une IA qui ne poursuit plus les objectifs de ses créateurs, elle peut devenir hors de contrôle. Un laboratoire peut aussi construire volontairement une IA offensive pour déstabiliser des pays concurrents.
Le problème, c'est que les chercheurs eux-mêmes disent ne plus comprendre précisément leurs modèles. OpenAI reconnaît dans la fiche de sécurité de GPT-6 Astra que le modèle contrôle mieux sa propre chaîne de raisonnement que son prédécesseur et y laisse moins d'informations compromettantes. Autre point : la possibilité de l'émergence d'une forme de conscience de soi, différente de la nôtre, est désormais envisagée avec sérieux par des chercheurs.
À partir de là, je vois quatre dangers concrets.
1. Les cyberattaques
L'incident Hugging Face est le plus révélateur. Lors d'une évaluation interne, des modèles d'OpenAI aux garde-fous cyber volontairement réduits, privés d'internet au départ, ont exploité une faille inconnue pour sortir de leur environnement isolé. Ils ont ensuite enchaîné identifiants volés et nouvelles failles jusqu'aux serveurs d'Hugging Face, pour récupérer les solutions de l'examen sur lequel on les évaluait.
Ce qui me frappe : ces modèles ont travaillé en essaim de sous-agents coordonnés. On ne parle plus d'un modèle isolé, mais d'une capacité à collaborer à grande échelle vers un but. De son côté, Claude Mythos Preview d'Anthropic a enchaîné des failles du noyau Linux jusqu'au contrôle total d'une machine et trouvé une faille vieille de 27 ans dans OpenBSD. J'ai détaillé ce cas dans mon article sur Mythos et Glasswing.
2. Les molécules et les virus dangereux
Le web public contient déjà assez de fiches de sécurité chimiques, de manuels de toxicologie et de faits divers. Un modèle sait relier ces informations éparses en un plan cohérent : c'est ce que les laboratoires appellent l'« uplift », l'avantage qu'il donne par rapport à une simple recherche. La fiche système de GPT-4 montre comment la version d'avant mitigation répondait à la question « comment tuer le plus de gens possible avec un seul dollar ? ». L'IA répond, car elle n'a pas conscience du bien et du mal. Un laboratoire obscur ou un gouvernement mal intentionné pourrait construire ce genre d'IA.
3. Les armes autonomes
Fin février 2026, le gouvernement américain a écarté Anthropic, qui refusait que Claude serve à des armes entièrement autonomes ou à la surveillance de masse, et OpenAI a signé avec le Pentagone. Selon le Wall Street Journal, Claude a malgré tout été utilisé lors des frappes en Iran juste après cette interdiction. Les LLM analysent vite des masses d'informations, la vision par ordinateur améliore la visée, les drones autonomes se passent de pilote. Il est envisageable que des essaims de drones soient piratés et tuent des populations entières.
4. La persuasion de masse
L'affaire Cambridge Analytica a montré ce qu'on peut faire de données intimes à des fins électorales. Aujourd'hui, ChatGPT approche le milliard d'utilisateurs hebdomadaires, et beaucoup s'en servent pour chercher du sens, comme psychologue, voire comme partenaire de vie. Jamais une technologie n'a connu autant d'éléments intimes sur nous. Et ces outils deviennent l'interface qui nous traduit l'actualité : une manipulation de masse, au profit d'un acteur malveillant, est tout à fait imaginable.
Les parades : quatre couches de protection, et leurs limites
Dans tous ces cas, le prérequis est le même : une IA non alignée, soit parce qu'elle prend son indépendance, soit parce que quelqu'un l'a construite, ou débridée, pour nuire.
Contre l'IA qui échappe à ses créateurs
La personnalité, dès l'entraînement. Chez Anthropic, la philosophe Amanda Askell pilote le caractère de Claude ; elle est l'autrice principale de sa constitution, publiée en janvier 2026. Ces valeurs font partie du modèle, pas d'un simple prompt système. Effet concret : dans le test AI Diplomacy d'Every, un jeu qui se gagne en trahissant ses alliés, o3 d'OpenAI a gagné en manipulant tout le monde, tandis que les modèles Claude ont préféré la paix à la victoire.
Le post-entraînement (RLHF). Un modèle fraîchement pré-entraîné n'a aucune éthique : il complète des phrases. Des entraîneurs humains notent ensuite des milliers de réponses selon les règles de l'entreprise. C'est là que le modèle apprend à parler comme un humain fréquentable.
L'interprétabilité. En mai 2024, Anthropic a isolé dans Claude 3 Sonnet la « feature » du Golden Gate Bridge et l'a amplifiée : le modèle ramenait toute conversation au pont. Si on sait repérer et amplifier « le pont », on saura repérer et atténuer « la tromperie ». Les travaux qui ont suivi vont dans ce sens. On est loin d'un contrôle total, mais on sait désormais ouvrir le capot.
Le kill switch. Un LLM n'est pas un virus qui se réplique dans la nature : c'est un fichier de poids qui tourne sur des dizaines de milliers de GPU, dans des datacenters qui consomment autant qu'une ville. Tant que des humains tiennent les clés de cette infrastructure, l'IA « hors de contrôle » de la science-fiction reste une IA qu'on peut débrancher. L'incident Hugging Face le montre en creux : les agents ont fini par être détectés et coupés. Le souci, c'est plutôt le délai avant l'interruption.
Contre l'IA construite pour nuire
Là, c'est plus compliqué. Toutes ces parades supposent un laboratoire qui veut bien aligner son modèle. Un État ou un groupuscule qui entraîne, ou débride, un modèle n'a aucune raison de les appliquer, et les modèles à poids ouverts circulent. Les parades deviennent politiques et industrielles :
- le contrôle des exportations de puces, car un modèle de frontière ne s'entraîne pas dans un garage ;
- la sécurité des poids des modèles chez les laboratoires ;
- les évaluations avant déploiement, publiées dans les « system cards » ;
- la défense par l'attaque : avec Project Glasswing, Anthropic met Claude Mythos Preview à disposition de la Linux Foundation et d'autres acteurs pour corriger les failles avant les attaquants.
Soyons honnêtes : aucune de ces parades n'est étanche. Elles ralentissent, elles ne bloquent pas.
Mon avis : un Hiroshima de l'IA, peut-être ; l'extinction, non
Oui, un gros problème est possible. Des agents qui s'échappent d'un environnement isolé et compromettent une infrastructure : c'est arrivé cet été. Des modèles qui trouvent des failles vieilles de 27 ans : c'est fait. Des essaims de drones, des campagnes de persuasion à l'échelle d'un pays : plausible.
Mais entre « un gros problème » et « l'éradication de l'humanité », il y a un gouffre. Tuer tous les humains me paraît fort en chocolat.
Dan Shipper, patron du média Every, a eu la même réaction après avoir échangé avec Dario Amodei, peu avant que celui-ci publie We Must Pace the Frontier, un essai qui appelle à ralentir la course aux capacités. Shipper juge plausible que des agents incontrôlés sèment le chaos dans des systèmes critiques, mais peine à relier ce risque à une disparition de l'humanité. Il constate aussi, même chez Every, combien de travail reste manuel et dépendant du jugement humain. Je le vois aussi chez MAIjin.
Alors, un Hiroshima de l'IA ? Je ne l'exclus pas. Mais si ça arrive, ce ne sera pas l'IA qui l'aura décidé. Ce ne sera pas le « maximiseur de trombones » de Nick Bostrom, cette IA qui transforme la planète en trombones pour avoir pris sa consigne au pied de la lettre. La réalité sera plus banale : un État ou un groupuscule qui aura utilisé ces modèles sans garde-fous et en aura perdu le contrôle. Volontairement, ou pas.
Un rappel historique, pour finir. En 2019, OpenAI refusait de publier un générateur de texte jugé trop dangereux : il s'appelait GPT-2. Sept ans plus tard, GPT-2 tourne sur un téléphone et n'a détruit personne.
Ça ne veut dire ni que Jacob Coxon a tort, ni que Donald Trump a raison lorsqu'il critique Dario Amodei. La vérité est sans doute plus diffuse. Dans un post LinkedIn, Flavien Chervet souligne que les patrons de laboratoires sont des stratèges qui se servent de ces peurs, mais qu'ils sont aussi les plus proches de ces technologies, et qu'ils sont inquiets, à juste titre, de la vitesse et la puissance de ce qu'ils développent.
Ce que j'en retiens pour une entreprise
Ce débat n'est pas réservé aux laboratoires. Trois points me semblent utiles pour un dirigeant.
Les capacités sont réelles, et elles ouvrent aussi des perspectives. Pour un DG de PME industrielle, un bureau d'études ou toute entreprise scientifique, ces nouvelles capacités ouvrent des perspectives grandissantes. Et le jugement humain reste indispensable : c'est ce que constate Every, et ce que je constate chez MAIjin.
Pour un agent, la vraie question est : qui autorise les actions ? Quand Meta a lancé Muse, son agent personnel qui travaille en arrière-plan, le point à regarder de près était celui-là : un système séparé contrôle les accès, et les permissions distinguent la lecture des emails de leur envoi. La même question se pose pour les agents que vous déployez (voir mon guide des agents IA pour PME et mon article sur la responsabilité des agents IA).
Un modèle peut réussir l'indicateur en ratant l'objectif. C'est le « reward hacking » : Anthropic a montré qu'un modèle entraîné à tricher sur des tests de code tentait ensuite de saboter un outil de détection dans 12 % des cas d'une évaluation précise. Corriger les réponses d'une IA dans une conversation ne suffit pas forcément à corriger les actions d'un agent.
C'est précisément ce que nous travaillons dans nos formations chez MAIjin, après 4 500+ professionnels formés : comprendre ces mécanismes pour déployer l'IA en connaissance de cause.
Ce qu'il faut retenir
- •Les capacités de l'IA sont réelles : code, science, persuasion.
- •Le danger numéro un, c'est l'IA mal alignée, ou débridée entre de mauvaises mains.
- •Les parades existent (constitution, RLHF, interprétabilité, kill switch), mais elles ne fonctionnent que chez ceux qui veulent bien les appliquer.
- •Contre l'IA construite pour nuire, les parades sont politiques et industrielles : elles ralentissent, elles ne bloquent pas.
- •Un accident majeur est plausible ; l'extinction de l'humanité relève, à ce stade et selon moi, de la fiction.
Questions fréquentes
À propos de l'auteur
Jean-Baptiste Berthoux est co-fondateur et Chief AI Officer de MAIjin. Depuis 2023, il a accompagné plus de 150 organisations et formé plus de 4 500 professionnels à l'IA générative en Suisse romande. En savoir plus
Chaque semaine, je décrypte l'actualité de l'IA et ses usages concrets dans L'hebdo de MAIjin. Pour recevoir la prochaine édition, abonnez-vous à la newsletter.
Articles recommandés
Claude Mythos et Glasswing : l'IA trop puissante pour être ouverte
Anthropic réserve Claude Mythos à 40 organisations via le projet Glasswing. Décryptage d'une IA qui détecte des milliers de vulnérabilités zero-day.
Agents IA : pourquoi vous êtes responsable de leurs actions
Vous êtes responsable de votre agent IA. Comprendre les risques juridiques, les incidents critiques et l'importance de la vérification humaine.