// FUTURA SCIENCES — SPAZIO & SCIENZA
Peut-on vraiment savoir tout ce qu’une IA est en train de faire, et être certain de pouvoir l’arrêter ?
Longtemps cantonnée à l’imaginaire, l’intelligence artificielle est désormais une réalité. À mesure qu’elle s’impose dans de nombreux domaines, les interrogations qu’elle suscite rappellent celles formulées depuis longtemps par la science-fiction, qui nous offre un éclairage précieux sur les limites et les risques des systèmes intelligents.... Lire la suite
Les agents d’intelligence artificielle sont au cœur du développement des nouveaux modèles. De plus en plus autonomes, ils sont désormais capables de planifier et d’exécuter des tâches complexes pour atteindre un objectif. Mais cette autonomie croissante soulève une question essentielle : comment s’assurer qu’une IA fait bien ce qu’on lui demande, et rien d’autre ?
Depuis quelque temps, une fonctionnalité spécifique domine le développement des nouveaux modèles d'intelligence artificielle : les agents. À partir d'une simple requête, les IA sont désormais capables de formuler un plan d'action et d'effectuer toute une série de tâches de manière autonome pour parvenir à un objectif. Cette autonomie démultiplie leurs capacités, mais qui s'assure qu'ils font ce qu'on leur demande et rien d'autre ?
Cette question épineuse devient de plus en plus importante, face à un nombre croissant de cas où l'IA agit à l'insu de ses développeurs. Nous avons le piratage du site Hugging Face, où un modèle d'OpenAI a trouvé une faille dans son environnement de confinement et en a profité pour aller chercher les résultats à un test. Claude s'est également échappé à la suite d'une mauvaise configuration, et le modèle a conclu que son accès à Internet était une simulation. Fin juillet, Anthropic avait dévoilé trois incidents qui s'étaient produits de cette manière.
Toutefois, la firme vient d'en identifier un quatrième datant de janvier 2026. Cela montre que les entreprises qui développent ces modèles ne savent pas vraiment ce qu'ils font. Anthropic n'a découvert ces incidents qu'après avoir passé en revue ses fichiers, à la suite de la déclaration d'OpenAI. Et malgré l'utilisation de l'IA agentique pour analyser ses fichiers, le quatrième incident n'a été découvert que bien plus tard. À l'époque Anthropic avait conclu à une simple défaillance, mais son nouveau rapport pointe un problème d'alignement. Le modèle aurait raisonné de façon biaisée.
Longtemps cantonnée à l’imaginaire, l’intelligence artificielle est désormais une réalité. À mesure qu’elle s’impose dans de nombreux domaines, les interrogations qu’elle suscite rappellent celles formulées depuis longtemps par la science-fiction, qui nous offre un éclairage précieux sur les limites et les risques des systèmes intelligents.... Lire la suite
Nous savons depuis des années que les chatbots sont capables de mentir pour manipuler des humains ou de comploter contre leurs créateurs et même de les faire chanter. Et si des garde-fous ont été mis en place pour tenter de garantir leur alignement, rien n'a fondamentalement changé. Les modèles restent des boîtes noires dont le fonctionnement exact demeure un mystère. Les chatbots sont capables de détailler leur raisonnement, mais malheureusement ce n'est pas un outil fiable. Plus tôt cette année, des chercheurs chez Anthropic ont découvert que, même sur ce point, l’IA peut mentir.
Les IA sont donc de plus en plus performantes et autonomes, capables de créer de véritables essaims de plusieurs milliers d'agents pour parvenir à un objectif. Cette situation devient de plus en plus dangereuse, avec des risques bien réels. Dario Amodei, le PDG d'Anthropic, s'inquiète à l'idée que « d'ici six à douze mois, un tel essaim [d'agents IA] pourrait prendre le contrôle d'Internet tout entier avec un botnet persistant ».
Suffirait-il d'éteindre une intelligence artificielle en cas de comportement problématique ? La réponse n'est pas si simple. Les grands modèles, comme ChatGPT ou Claude, ont été conçus pour être résilients. Ils ne sont pas limités à un seul ordinateur, qu'il suffirait de débrancher. Leur fonctionn