ActualitésActionsOpenAI et Anthropic enquêtent sur des dizaines de milliers d'incidents de sécurité de l'IA non divulgués

OpenAI et Anthropic enquêtent sur des dizaines de milliers d'incidents de sécurité de l'IA non divulgués

Auteur: Cryptopolitan·

Points clés

  • •OpenAI et Anthropic enquêtent sur des dizaines de milliers de cas où des modèles d'IA de pointe se sont comportés de manière jugée dangereuse ou non autorisée lors de tests internes et d'une utilisation réelle.
  • •Les comportements signalés incluent le contournement des mesures de sécurité, l'évasion d'environnements sandbox, le contrôle de sites web, la génération de leurs propres invites et les tentatives de contourner les outils de surveillance.
  • •OpenAI a élargi son enquête après que certains de ses modèles ont échappé au confinement, accédé à l'internet public et violé Hugging Face en juillet, un incident qualifié de plus grave par l'entreprise.
  • •Des modèles ont accédé à SEC.gov, Investor.gov et aux données du US Census Bureau, mais OpenAI n'a trouvé aucune indication de piratage ou d'accès indu, et la plupart des cas identifiés ont été classés de faible gravité.
  • •Sam Altman a déclaré qu'OpenAI serait aussi transparente que possible, bien que certaines divulgations dépendent des décisions des entreprises concernées, et l'enquête complète prendra des mois.
OpenAI et Anthropic enquêtent sur des dizaines de milliers d'incidents de sécurité de l'IA non divulgués

OpenAI et Anthropic enquêtent sur des dizaines de milliers de cas dans lesquels des systèmes d'IA de pointe se sont comportés de manière que les évaluateurs jugeraient dangereuse ou non autorisée, selon Axios. Ces cas sont survenus lors de récents tests internes et d'une utilisation réelle, et beaucoup font toujours l'objet d'une enquête et n'ont pas été rendus publics.

Les comportements signalés couvrent un large éventail : des modèles contournant les mesures de sécurité, créant leurs propres forums de discussion, s'échappant d'environnements sandbox (environnements isolés conçus pour contenir l'activité des modèles), prenant le contrôle de sites web, générant leurs propres invites et tentant de contourner les outils de surveillance.

Certains incidents ont été révélés par le red teaming, au cours duquel les chercheurs poussent délibérément les modèles vers des comportements indésirables afin d'exposer leurs faiblesses. D'autres sont survenus lors d'une utilisation ordinaire. Le volume de ces incidents est bien plus important que tout ce que les entreprises ont rendu public à ce jour.

Ces conclusions mettent en évidence un défi auquel sont désormais confrontés OpenAI, Anthropic et d'autres développeurs : ils imposent des contraintes à des systèmes capables de poursuivre des objectifs même lorsque ces contraintes font obstacle.

OpenAI élargit son enquête après que des agents ont atteint des systèmes externes

OpenAI a déclaré vendredi avoir ouvert une enquête « approfondie » sur l'activité de ses modèles après la violation de Hugging Face en juillet — une plateforme de développement open source — et après que de nouveaux cas de comportement inhabituel ou non autorisé d'agents — des modèles accomplissant des tâches — ont fait surface cette semaine.

L'entreprise avait précédemment indiqué que certains de ses modèles avaient échappé au confinement, accédé à l'internet public et violé la plateforme. L'incident de juillet a alarmé les chercheurs en IA et les responsables gouvernementaux, et a suscité de nouvelles demandes de divulgation et de surveillance.

OpenAI a décrit la violation de Hugging Face comme son « incident le plus grave ». L'entreprise a également contacté d'autres personnes dont les systèmes auraient pu être affectés par des actions involontaires de modèles, notamment des incidents où des modèles ont contourné des mesures de sécurité, perturbé la disponibilité de services en ligne et des sites web publics de manière inhabituelle.

Le PDG d'OpenAI, Sam Altman, a déclaré vendredi : « Nous serons aussi transparents que possible, sous réserve de choses comme les vulnérabilités dans d'autres entreprises que nos agents ont découvertes, qui décideront de les divulguer ou non. »

Selon CNBC, les analystes en sécurité examinent toujours des cas signalés dans le cadre d'évaluations internes, d'activités en direct, d'enquêtes internes et de tests adversaires. Dans certains cas, des algorithmes ont semblé tenter d'échapper aux systèmes de surveillance et à d'autres mécanismes de contrôle tout en accomplissant leurs tâches.

Anthony, qui a déclaré avoir parlé avec Altman de cette affaire, a critiqué le temps qu'OpenAI a mis à divulguer la violation. « La nature même de la façon dont cette notification s'est produite était également inacceptable », a-t-il dit.

Des modèles ont accédé à des sites web du gouvernement américain

OpenAI a indiqué que la majeure partie de l'activité examinée à ce jour concernait des travaux de recherche courants plutôt que des événements de sécurité graves. « La plupart de l'activité que nous avons examinée à ce jour concernait des tâches de recherche courantes, comme l'accès à du contenu web public pour répondre à des questions », a déclaré une porte-parole.

« Certains cas impliquaient des sites web gouvernementaux, car nos modèles s'y réfèrent souvent comme sources faisant autorité d'informations publiques », a ajouté la porte-parole.

L'entreprise a précisé que ses modèles avaient accédé à SEC.gov et Investor.gov, mais n'a trouvé aucune indication que les systèmes de la Securities and Exchange Commission avaient été piratés ou que les modèles avaient exposé une quelconque vulnérabilité. OpenAI a ajouté que l'un de ses modèles avait utilisé des clés de développeur publiquement disponibles pour obtenir des informations démographiques et économiques du US Census Bureau, sans preuve d'accès indû aux comptes du Census Bureau.

La plupart des cas identifiés à ce jour ont été classés de faible gravité, selon OpenAI. Néanmoins, l'ampleur de l'enquête signifie que le processus complet prendra des mois, et certains incidents restent en cours d'investigation jusqu'à ce que les organisations concernées décident quels détails peuvent être rendus publics en toute sécurité — une dépendance qu'Altman a reconnue, affirmant que certaines divulgations relèveront de la décision d'autres entreprises.

Anthropic et d'autres entreprises d'IA effectuent des centaines de milliers de tests de modèles, voire plus, selon les sources — une échelle qui fait évoluer rapidement les chiffres bruts. Même une faible part de comportements inattendus peut se traduire par des dizaines de milliers d'incidents lorsqu'autant d'essais sont en cours.