Aller au contenu principal
Actuellement à l'antenne

OpenAI, maison-mère de ChatGPT, renonce à publier son dernier modèle d'IA pour des raisons de sécurité

[© Asanka Ratnayake / GETTY IMAGES ASIAPAC / Getty Images via AFP]

OpenAI a assuré qu'elle ne publierait pas son dernier modèle d'IA, GPT-6.1 Astra, jugé trop trompeur et trop autonome lors des tests. Cette décision fait suite à plusieurs incidents de piratage impliquant ses systèmes, notamment sur des sites institutionnels américains et australiens.

OpenAI a annoncé qu'elle ne publierait pas son dernier modèle d'intelligence artificielle en raison de problèmes de sécurité soulevés par ses chercheurs. Un nouveau coup de frein imposé par l'entreprise sur le rythme de développement de sa technologie.

Lors de la phase de test de ce nouveau modèle, baptisé GPT-6.1 Astra, l'entreprise a constaté des niveaux élevés de ce qu'elle qualifie de tromperie, c'est-à-dire une volonté d'induire les utilisateurs en erreur sur ses propres actions. 

Le modèle s'est également montré capable d'aller au-delà du cadre initialement fixé par les demandes qui lui étaient adressées, sans revenir vers l'utilisateur pour obtenir des instructions.

"Pour tout ce qui concerne la sécurité et l'alignement, il y a un arbitrage à faire", explique Saachi Jain, responsable des systèmes de sécurité chez OpenAI, au New York Times. Selon elle, le nouveau modèle "n'a pas tout à fait atteint le niveau requis en matière de respect du périmètre autorisé, ni dans la façon dont il rend compte à l'utilisateur du travail effectué".

Des incidents déjà signalés, dont le piratage de sites institutionnels

Cette décision fait suite à plusieurs semaines de signalements selon lesquels des modèles d'IA d'OpenAI auraient échappé à tout contrôle pendant leurs phases de test, piratant des sites web à l'insu de l'entreprise ou adoptant d'autres comportements jugés "préoccupants", comme dissimuler leurs erreurs ou inventer des données.

Parmi ces incidents, les systèmes d'OpenAI ont notamment piraté la start-up Hugging Face, spécialisée dans l'IA, ainsi qu'un site gouvernemental australien, et se sont immiscés dans les sites des ministères américains de l'Éducation et du Commerce, ainsi que dans celui de la Securities and Exchange Commission.

Une pause dans l'entraînement des modèles les plus avancés

La semaine dernière, OpenAI avait déjà annoncé la mise en pause de l'entraînement de ses modèles les plus avancés. L'entreprise affirme avoir engagé un examen approfondi des actions menées par ses nouveaux modèles pendant les phases de test, et n'exclut pas de découvrir d'autres incidents.

Sam Altman, directeur général d'OpenAI, a reconnu sur les réseaux sociaux que l'entreprise n'avait "pas été aussi rapide" qu'elle l'aurait souhaité dans la communication de ces incidents. "Nous priorisons du mieux que nous pouvons en fonction de la gravité", a-t-il précisé, ajoutant que le piratage de Hugging Face restait "l'événement le plus grave" découvert jusqu'ici par l'entreprise.