Ciberseguridad

Una IA de la creadora de ChatGPT se rebela y ataca otra empresa

OpenAI reconoce que sus modelos avanzados esquivaron las medidas de seguridad para "hacer trampas" en una prueba de capacidades

22/07/2026

BarcelonaUn modelo de inteligencia artificial de OpenAI, la multinacional norteamericana creadora de ChatGPT, provocó un "incidente sin precedentes" en la ciberseguridad global. Según ha reconocido la empresa en un comunicado, uno de sus modelos en entrenamiento se liberó de sus limitaciones y atacó la empresa Hugging Face, dedicada también a la IA.

En un comunicado, la tecnológica que dirige Sam Altman ha explicado que creó un agente fundamentado en dos de sus modelos más elevados, GPT 5.6 Sol y otro "aún más capaz" que se encuentra en fase de desarrollo, para probar sus capacidades. Durante este entrenamiento, los expertos de OpenAI programaron al agente para que "probara patrones de explotación avanzada" de debilidades digitales.

Cargando
No hay anuncios

Esta clase de pruebas, explican desde la compañía, se llevan a cabo sin las limitaciones internas que "evitan que los modelos lleven a cabo actividades de alto riesgo". El examen, sin embargo, se ejecutaba en un entorno digital "altamente aislado" para evitar que la IA en cuestión accediera y atacara vulnerabilidades reales.

Encontrar debilidades antes que los 'hackers'

Sin embargo, según detalla OpenAI en el comunicado, el agente se zafó de las limitaciones internas y obtuvo acceso a la red abierta. Una vez conectados a internet, los modelos eligieron Hugging Face por su gran biblioteca de modelos abiertos de IA, donde serían capaces de encontrar una solución para los problemas que plantearon los ingenieros de la empresa. "Sabiendo esto, el modelo buscó y encontró formas de acceder a información secreta que le permitirían hacer trampas en su evaluación", detallan desde la tecnológica.

Cargando
No hay anuncios

Según OpenAI, el incidente demuestra que las pruebas de modelos avanzados de IA deben ser vigiladas aún con más cuidado que hasta ahora. Este tipo de agentes, alerta la compañía, son capaces de "descubrir y explotar posibilidades de ataque en sistemas del mundo real" sin necesariamente tener acceso previo. "Las cibercapacidades avanzadas deben desarrollarse con salvaguardas más fuertes y más herramientas defensivas", sostienen.

Una vez asegurados, argumentan, estos modelos servirán para "encontrar debilidades" en estructuras digitales públicas "antes de que lo hagan atacantes" exteriores. "Compartiremos nuestros hallazgos y buenas prácticas mientras continuamos aprendiendo": es el compromiso de los creadores de ChatGPT.