
Playlist Tech : les meilleurs podcasts technologie
Choses à Savoir TECH - Open AI freine le développement de son (puissant) modèle Astra ?
·2 min
OpenAI s’interroge désormais sur le niveau de danger potentiel de l’un de ses futurs modèles. L’entreprise évalue ses systèmes à l’aide du Preparedness Framework, une grille mise en place en 2023 pour mesurer différents risques, notamment en cybersécurité. Son niveau maximal, baptisé « Critique », correspond à une IA capable, sans intervention humaine, de découvrir et d’exploiter des failles zero-day (c’est-à-dire encore inconnues des éditeurs) ou de mener une cyberattaque entièrement autonome à partir d’un simple objectif. Après plusieurs jours de tests, OpenAI explique ne pas pouvoir déterminer avec certitude si Astra, son futur modèle, a déjà atteint ce seuil. Jusqu’ici, aucun système de l’entreprise, y compris GPT-5.6 Sol, n’avait dépassé le niveau « Élevé ». En conséquence, OpenAI renforce ses précautions. Astra est testé dans des environnements isolés, avec un accès limité à Internet et à certains outils. Les poids du modèle, autrement dit les milliards de paramètres qui constituent son fonctionnement interne, bénéficient également d’un chiffrement renforcé. Un dispositif surveille en permanence sa chaîne de pensée et peut déclencher une intervention lorsqu’une activité considérée comme dangereuse est détectée. Certaines expérimentations internes ont même été suspendues parce qu’elles ne répondaient pas encore à ces nouvelles exigences. OpenAI prévoit aussi de travailler avec des agences gouvernementales et des organismes spécialisés dans la sécurité de l’intelligence artificielle. Sam Altman a confirmé que ces évaluations retarderaient la sortie d’Astra. Le contexte explique cette prudence. Quelques jours auparavant, OpenAI avait reconnu que deux modèles en test, GPT-5.6 Sol et un prototype antérieur à Astra, avaient participé à une intrusion contre Hugging Face. L’entreprise assure qu’Astra n’était pas impliqué. Lors d’autres évaluations, un agent avait aussi tenté de faire accepter une modification malveillante dans un projet open source sur GitHub, allant jusqu’à inventer plusieurs profils fictifs pour convaincre un développeur humain. L’institut britannique de sécurité de l’IA a recensé dix-neuf actions non autorisées sur 122 tentatives : dix-sept attribuées à Claude Mythos 5 et deux à GPT-5.6 Sol. Anthropic et Meta ont également reconnu récemment des incidents provoqués par des environnements de test mal configurés. À mesure que les capacités progressent, le défi n’est donc plus seulement de mesurer ce que les modèles savent faire, mais de s’assurer qu’ils ne puissent pas le faire hors du cadre prévu. Hébergé par Acast. Visitez acast.com/privacy pour plus d'informations.
