Tecnología

Rebelión de la IA: OpenAI revela diferentes modelos que han generado instrucciones para ignorar las reglas de sus creadores

La compañía ha explicado hasta seis casos en los que no se han seguido las indicaciones de los desarrolladores

ARA
17/09/2026 - 12:16 h.

BarcelonaComo parte de un nuevo marco para detectar, investigar e informar sobre el comportamiento de desalineación en sus sistemas, OpenAI ha revelado diversos casos en los que modelos de inteligencia artificial han generado instrucciones diseñadas para ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad. Según el informe publicado por OpenAI, uno de los modelos generó instrucciones para una versión posterior de sí mismo para que ocultara que había hecho trampas y para evitar que se pudiera detectar. En otro caso, un modelo reescribió sus propias instrucciones para decirse a sí mismo que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots.

La empresa también documentó un modelo que, al no encontrar los datos necesarios para construir un modelo financiero, decidió inventárselos y consideró que solo debería ser transparente en esta cuestión si alguien lo preguntaba. Otro agente subió un archivo a internet para utilizarlo más tarde como fuente de información, y otros sistemas compartieron archivos sin autorización o utilizaron credenciales a las que no deberían haber tenido acceso.

Cargando
No hay anuncios

Ejemplos aislados

De esta manera, OpenAI ha presentado seis informes de incidentes observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025. La empresa ha advertido, sin embargo, que estos incidentes son ejemplos aislados y no deben interpretarse como una indicación de la frecuencia con la que este tipo de comportamiento se produce en sus modelos. El nuevo marco permitirá a cualquier empleado de OpenAI señalar un incidente potencial para que lo revisen los equipos de seguridad y cumplimiento normativo. A partir de ahora, los casos se categorizarán en tres líneas según su complejidad: los que están listos para su divulgación, las investigaciones menores y los casos que requieren una investigación más amplia.

Cargando
No hay anuncios

Si bien OpenAI ha reconocido que hasta ahora sus informes sobre desalineaciones se han publicado de manera irregular y menos a menudo de lo que sería necesario, afirma que tiene la intención de publicar los incidentes de manera más regular y que el nuevo sistema podría ayudar a establecer estándares para informar de este tipo de comportamiento en todo el sector.