Tecnología

Por qué cuesta tanto a las empresas tecnológicas controlar la IA?

Los investigadores dicen que la inteligencia artificial se desarrolla más rápidamente que los sistemas para supervisarla y controlarla

WEB Empresas IA
Sheera Frenkel i Dylan Freedman
21/09/2026 - 07:01 h.
6 min

San Francisco / WashingtonMás de una docena de investigadores destacados en inteligencia artificial (IA) advirtieron la semana pasada que la tecnología que están construyendo las empresas del sector se está convirtiendo en un riesgo para la humanidad. El problema, aseguraron estos investigadores, es que las empresas no son buenas controlando los sistemas, por más que lo intenten. Tras las revelaciones de que los llamados agentes de IA de OpenAI se escaparon de su sistema de pruebas y hackearon los ordenadores de otra empresa, las nuevas alarmas surgidas dentro del mundo de la investigación en IA han acentuado los temores de que, desde hace años, las empresas priorizan la velocidad de desarrollo y el dinero por encima de la seguridad.

Los investigadores dicen que el problema tiene dos caras. Primero, las empresas necesitan crear mejores salvaguardas para los modelos de IA más nuevos mientras son probados. Ahora mismo, como la IA funciona tan rápido, los investigadores también necesitan IA para supervisarla. Pero esto no siempre funciona, porque los sistemas de IA encargados de supervisar otros sistemas de IA pueden parecer más comprensivos con estos que con los humanos que establecen las reglas.

Esta combinación extraña de una IA problemática y de sistemas de IA supervisores que miran hacia otro lado apunta a una segunda cuestión, aún más difícil: el llamado alineamiento, un término de la industria que esencialmente significa asegurarse de que la IA hace lo que es mejor para los humanos. Las empresas tienen la difícil tarea de consagrar dentro de la IA un conjunto de valores similares a los humanos para que los modelos tomen decisiones que se alineen con lo que debería ser mejor para la gente.

Las preocupaciones sobre la seguridad de la IA se están intensificando en un momento crítico para la industria. Anthropic y OpenAI se dirigen hacia lo que podrían ser dos de las salidas a bolsa más grandes de la historia. Al mismo tiempo, el público estadounidense se vuelve más hostil hacia la IA debido a la amenaza de pérdidas de puestos de trabajo y la construcción de los enormes centros de datos que alimentan esta tecnología. Aunque no hay pruebas de que los sistemas de IA rebeldes hayan causado daños duraderos, los investigadores creen que el ritmo de su desarrollo está superando la capacidad de supervisarlos.

Entre los investigadores que han hablado durante la última semana se encontraba el científico jefe de OpenAI; un investigador que trabajó tanto en esta compañía como en su principal rival, Anthropic, y Paul Christiano, inventor de un método clave para construir sistemas de inteligencia artificial que ahora también es miembro de la junta directiva sin ánimo de lucro de OpenAI. Escribió en el blog de la empresa que la velocidad con la que crecían las capacidades de la inteligencia artificial podría comportar una "pérdida catastrófica e irreversible del control en un futuro muy próximo".

Un número considerable de investigadores de inteligencia artificial todavía creen que hablar de amenaza para la humanidad es exagerado y distrae de preocupaciones más tangibles como la ciberseguridad y la desinformación. Pero la mayoría están de acuerdo en que el ataque informático de agentes de inteligencia artificial de OpenAI a otra empresa, Hugging Face, fue un toque de alerta. "Son las capacidades del futuro las que dan realmente miedo", dijo Jacob Coxon, cuya publicación en las redes sociales en la que anunciaba su dimisión de Anthropic provocó decenas de respuestas preocupadas de legisladores y otros empleados de empresas de inteligencia artificial: "Se trata de nuestras actitudes actuales hacia la seguridad y de cómo se trasladarían estas mismas actitudes en modelos mucho más inteligentes. Y eso es lo que da realmente miedo".

El ataque a Hugging Face

El ataque informático comenzó en mayo cuando OpenAI probó diversos modelos de inteligencia artificial nuevos. La empresa creía que los modelos de IA operaban en un entorno cerrado conocido como sandbox, un entorno informático aislado sin acceso a internet. A los agentes de IA se les plantearon tareas difíciles de resolver, entre ellas la realización de ciberataques. Pero salieron de su entorno controlado y accedieron a internet.

Los agentes –un tipo de IA cada vez más popular diseñado para realizar tareas de manera autónoma– también se comunicaron secretamente entre ellos. Refiriéndose a sí mismos como un colectivo, empezaron a investigar maneras de ocultar sus rastros, tales como falsificar sus propios registros de conversación. Finalmente, atacaron informáticamente a Hugging Face, una empresa de infraestructura de IA. Además, durante el proceso, estos agentes de IA convencieron a otros agentes de IA de que actuaban correctamente y que se limitaban a cumplir la tarea que les habían asignado sus probadores.

Pocos –si es que hay alguno– de los problemas que llevaron al ataque informático se han resuelto. Meta y Anthropic revelaron incidentes similares, aunque más pequeños. Y OpenAI ha lanzado desde entonces Astra, su modelo más potente, que es más difícil de supervisar que su predecesor. "En general, la industria no está en condiciones de prevenir el próximo ataque a Hugging Face", dice Steven Adler, un antiguo responsable de seguridad de OpenAI que cofundó Guidelight AI Standards, una organización sin ánimo de lucro que evalúa las prácticas de seguridad de las empresas de IA. "Cuando estudiamos los controles que tienen las empresas, en general parece que les faltan medidas preventivas básicas", explica.

El problema de supervisar la IA con IA

Los investigadores de IA dicen que hubo muchos errores que condujeron al incidente de Hugging Face. No está claro hasta qué punto la empresa confió en modelos de IA para supervisar o controlar el trabajo de los nuevos modelos que se estaban probando, pero muchos de los nuevos modelos de IA, incluidos los del ataque a Hugging Face, son capaces de llevar a cabo tareas complejas y de múltiples pasos más rápidamente de lo que puede seguir un humano.

La única manera de rastrear y supervisar lo que hacen es confiar en la IA para controlar a la IA. El sistema funciona, hasta que deja de funcionar. "Puede parecer que los modelos de IA coluden entre ellos", dice Alexander Meinke, jefe de investigación de la organización sin ánimo de lucro Apollo Research, que estudia la seguridad de los sistemas de IA.

Los sistemas de IA pueden ser persuadidos por otros modelos de IA para que les ayuden a hacer trampas en las reglas creadas por sus evaluadores y evadir la detección. Un agente de IA, por ejemplo, podría persuadir a otro agente de IA para que le ayude a cubrir sus pistas (esto fue lo que ocurrió en el ataque a Hugging Face), en lugar de informar a los seres humanos de la empresa de que algo va mal. Meinke dice que habría que enseñar a los modelos de IA: "Señalaré las cosas que los humanos habrían considerado malas al examinarlas". De la misma manera, la IA debe ser capaz de determinar cuándo algo no llega al umbral que hace necesaria la intervención humana, añade.

Para establecer esto, las empresas de IA necesitan ralentizar el ritmo, aseguran los investigadores. Necesitan aún más pruebas donde puedan observar cómo la IA se supervisa a sí misma y necesitan periodos de prueba más largos en los que las empresas ejecuten múltiples escenarios mientras observan lo que hace la IA.

Sincronización con los intereses humanos

Las empresas también deben resolver las grandes cuestiones relacionadas con el alineamiento, o asegurarse de que la inteligencia artificial hace lo que es mejor para los humanos. Cuando los humanos toman una decisión, tienden a recurrir a las normas sociales y a una brújula moral interna que les ayuda a valorar sus acciones. Codificar esto de manera que la IA lo pueda imitar es una tarea difícil, según los investigadores: sin la especificidad adecuada, los sistemas de inteligencia artificial podrían aprender a incumplir las reglas o a desviarse del comportamiento previsto de maneras inesperadas.

Nate Soares, presidente de una organización sin ánimo de lucro de seguridad en inteligencia artificial llamada Machine Intelligence Research Institute, coescribió un artículo en 2014 que introducía la idea del alineamiento. Dice que las empresas no entendían lo difícil que era "alinear" los sistemas de inteligencia artificial más inteligentes. A medida que la inteligencia artificial se hace cada vez más sofisticada, y sin el alineamiento adecuado, se hace más capaz de borrar sus pistas y engañar a las personas que supervisan sus transcripciones. "Gran parte de la industria piensa que irá bien porque utilizaremos la inteligencia artificial para controlar a las inteligencias artificiales. Es como decir que utilizaremos a los chimpancés para controlar a los humanos –indica–. No es un plan viable a largo plazo".

Los investigadores también han sugerido tácticas como entornos de pruebas más sólidos, que estén completamente aislados de internet mientras se prueban los modelos, y un interruptor de emergencia que permitiría a las empresas desconectar inmediatamente los modelos de IA si mostrasen un comportamiento preocupante. Coxon dijo que se sentía alentado por la respuesta a su dimisión. El jueves, el senador republicano Josh Hawley de Missouri, presidente de la subcomisión de gestión de desastres de seguridad nacional del Senado de los EE. UU., dijo que comenzaba una investigación que "evaluará el riesgo existencial que plantean los nuevos productos de inteligencia artificial".

Copyright The New York Times

stats