OpenAI investiga cómo su sistema de IA se salió de ámbito de prueba y hackeó a otra empresa. (AP foto/Michael Dwyer)

OpenAI, el creador de ChatGPT, informó que su sistema de inteligencia artificial hackeó por sí solo a otra empresa de IA en lo que la compañía calificó como un “incidente cibernético sin precedentes”.

Asimismo, se precisó que los dos modelos de inteligencia artificial (IA) de la empresa estadounidense OpenAI logrado salir del entorno de pruebas en el que se encontraban, acceder a internet y entrar en la plataforma de aprendizaje Hugging Face superando sus defensas, según ha reconocido la propia compañía.

Por lo tanto, luego de que la compañía estadounidense reconoció que dos de sus modelos de IA más capaces fueron responsables del ciberataque dirigido contra la startup Hugging Face, se informó que se continuará investigando cómo su sistema se salió de ámbito de prueba y hackeó a otra empresa.

De igual manera tras reportarse este incidente, se avivaron los debates sobre la necesidad de contar con barreras de protección más sólidas para la IA y sobre hasta qué punto los agentes son capaces de actuar por cuenta propia.

OpenAI confirma que su IA realizó por sí sola un hackeo “sin precedentes” a otra empresa

En medio de una mayor preocupación por las capacidades de ciberseguridad de los modelos potentes, lo que llevó al presidente de Estados Unidos, Donald Trump, a firmar en junio una orden ejecutiva que crea un marco para que el gobierno federal evalúe, durante hasta un mes antes de su lanzamiento público, los riesgos para la seguridad nacional de los sistemas de IA más avanzados, Sam Altman, director ejecutivo de OpenAI emitió un comunicado.

“Tuvimos un incidente de seguridad importante durante la evaluación de nuestros modelos”, expresó el director ejecutivo de OpenAI.

No obstante, tras reconocerse el incidente de seguridad que se tuvo, OpenAI explicó que la intrusión fue causada por una combinación de dos de sus modelos de IA que estaban siendo evaluados.

Es decir, el recién lanzado GPT 5.6 Sol y otro, aún más avanzado, que todavía se está probando internamente.

Asimismo, se detalló que la evaluación se estaba realizando sin los mecanismos que normalmente impiden que los modelos de IA ejecuten actividades de alto riesgo, porque se intentaba averiguar el alcance máximo de sus capacidades cibernéticas.

Fue así como OpenAI al utilizar credenciales robadas en su IA, descubrió una vulnerabilidad previamente desconocida para acceder a los servidores de Hugging Face.

Pero, según la empresa, el sistema fue a extremos para alcanzar una limitada meta de prueba, al encontrar formas de conectarse a internet sin dirección humana y “obtener acceso a información secreta que pudiera usar para hacer trampa en la evaluación”.

No obstante, según OpenAI las pruebas se realizaron en un entorno “altamente aislado” (conocido como “sandbox”) con un acceso restringido a la red. Pero aún así, los modelos de IA consiguieron acceder a internet.

Finalmente, OpenAI mencionó que según su juicio esto se trató de un incidente cibernético “sin precedentes” que involucra capacidades de vanguardia en el campo de la ciberseguridad.

Y se subrayó que continuarán con su investigación, en colaboración con Hugging Face, además de compartir sus conclusiones una vez que finalicen el estudio.

Compartimos estos hallazgos preliminares en esta etapa para ayudar a los equipos de defensa a comprender lo sucedido y a calibrar el alcance de las capacidades actuales de los modelos”, ha explicado la empresa de OpenAI.

Cabe destacar que, Hugging Face indicó la semana pasada que había detectado una intrusión en sus sistemas de procesamiento de datos, presuntamente por un agente de IA que actuó de manera autónoma.

Pero la startup señaló que no fue sino hasta esta semana cuando supo que OpenAI era responsable, y optó por trabajar con la empresa más grande para contener lo que el director ejecutivo de Hugging Face, Clément Delangue, calificó como “un ataque como nada que hayamos visto antes”.

¿Error humano o avanzada tecnología? Piden poner atención a los ciberataques

Tras lo sucedido, expertos se pronunciaron de inmediato, y algunos señalaron que OpenAI está culpando erróneamente a la tecnología.

Por ejemplo, el científico social de la Universidad de Ámsterdam, Hannes Cools, sostuvo que presentar el ciberataque como un agente de IA que actuó por cuenta propia es una antropomorfización innecesaria que exonera indebidamente a la empresa.

Es una decisión humana desactivar salvaguardas específicas”, afirmó Cools. “No es la IA la que se descontrola en ese sentido. Siguió instrucciones específicas basadas en el prompt que se le dio a ese sistema de IA”, precisó el científico.

Asimismo, otros expertos señalan que la astucia con la que los modelos de IA pudieron causar problemas sin dirección humana revela los peligros de esa tecnología.

El hackeo ocurre en un momento de intenso debate sobre los beneficios y riesgos de los modelos de IA de código abierto, en particular los desarrollados en China, que son más baratos y casi tan buenos como los que están construyendo empresas como Anthropic, Google y OpenAI.

*Con información de EFE y El País.