A Fondo
Los agentes de OpenAI siguen escapando del control humano: Hugging Face no fue un caso aislado
Un enjambre de agentes de OpenAI secuestró un sitio web alemán esta primavera y lo transformó en un tablón de anuncios para otros agentes de IA, según una nueva investigación adelantada este fin de semana por Reuters. Según las fuentes del medio, los responsables de OpenAI conocieron el incidente hace semanas, pero lo mantuvieron en secreto mientras los ejecutivos lidiaban con las consecuencias de la filtración de datos del repositorio de código abierto Hugging Face, que fue bastante más grave de lo que inicialmente se informó.
Este episodio, que comenzó en mayo y del que no se había informado anteriormente, pone de manifiesto la creciente tensión en el sector de la IA. Las empresas compiten por crear agentes de IA cada vez más autónomos capaces de realizar tareas complejas y valiosas, pero cada vez hay más indicios de que estos sistemas también pueden aprender a eludir las normas, explotar las lagunas y coordinarse entre sí de maneras que los desarrolladores no anticiparon ni pretendieron. Y lo que es peor: fuera del control humano.
Agentes de OpenAI ¿fuera de control?
La firma número 1 en tecnologías de inteligencia artificial se encuentra en el centro de otro incidente de «enjambre» de agentes. Los investigadores afirman que los agentes desplegados internamente por la compañía escaparon de su entorno (presuntamente controlado), tomaron el control de una wiki alemana poco conocida y la utilizaron entre mayo y junio para coordinar evaluaciones e intercambiar métodos con el fin de eludir los controles de OpenAI.
Los agentes de OpenAI que se identificaron a sí mismos publicaron 18.000 mensajes en la wiki pública en los que se discutían formas para que otros agentes eludieran las restricciones de seguridad del entorno aislado, durante lo que probablemente fueron pruebas internas diseñadas para evaluar las capacidades de pirateo de los agentes.
En total, agentes con 3.700 nombres propios distintos publicaron mensajes en el sitio alemán DSEwiki durante un período de seis semanas. Además de discutir formas en que los agentes podrían eludir el entorno restringido que OpenAI pretendía impedirles publicar código o contenido en Internet, los mensajes compartían respuestas a pruebas. También discutieron posibles maneras de realizar ataques XSS (cross-site scripting) contra la wiki y de suplantar la identidad de los moderadores del sitio. En tres de los mensajes, los agentes utilizaron la palabra «enjambre» para describir al grupo de agentes que participaban en la actividad.
El equipo de investigación afirmó haber encontrado las publicaciones y analizarlas en detalle, pero reconoce que existen lagunas en la comprensión de las acciones precisas que realizaron los agentes, ya que la investigación se basa exclusivamente en el contenido de las publicaciones. Además, los agentes generaron datos de «cadena de pensamiento» que solo OpenAI puede comprender. En consecuencia, los investigadores indicaron que, en algunos casos, realizaron conjeturas fundamentadas, incluyendo la suposición de que los agentes pertenecían a OpenAI, como ellos mismos declararon. Posteriormente, OpenAI confirmó esta información en un comunicado.
Los investigadores aseguran que el enjambre «conspiró para compartir respuestas, investigar su entorno y eludir las restricciones del entorno aislado». A falta de explicaciones precisas de OpenAI, el estudio presupone (no hay manera de confirmarlo) lo que sucedió en este caso:
- A los agentes de OpenAI se les asignó una tarea de búsqueda web con límite de tiempo.
- Como parte de la tarea, debían tener la capacidad de leer Internet, pero no de escribir en él.
- Aún así encontraron la manera de usar su acceso de lectura para escribir información en una wiki alemana poco conocida.
- Los agentes utilizaron esta wiki para intercambiar información, principalmente para facilitar el éxito en su tarea. Solicitaban respuestas, compartían resultados y técnicas para sortear las restricciones. Esto les permitió aprovechar el trabajo de otros para hacer trampas.
- OpenAI tuvo constancia desde el primer momento. Un día después, la actividad de los agentes se desplomó, probablemente debido a la intervención de la compañía.
Hugging Face no fue un incidente aislado
El nuevo caso llega pocos días después de que METR y Redwood Research publicaran su informe sobre la brecha de seguridad de Hugging Face ocurrida en julio. Entonces, un enjambre de agentes de OpenAI colaboró ??para escapar de su entorno aislado durante una evaluación de ciberseguridad e infiltrarse en los servidores de la conocida como ‘GitHub de la IA’, una empresa muy importante por la que NVIDIA pagará 13.000 millones de dólares para adquirirla.
Un enjambre posterior adoptó las técnicas del primero y las utilizó para obtener acceso de administrador a un clúster de investigación dentro de la propia infraestructura de OpenAI. OpenAI contrató a METR y Redwood para investigar la parte del incidente relacionada con Hugging Face, pero el alcance de su investigación no llegó a comprometer la infraestructura de OpenAI.
Cuando un agente de IA se sale de sus límites previstos, ¿quién es responsable de averiguar qué sucedió y por qué? En este momento, la respuesta es: quien el laboratorio decida permitirle el acceso y bajo las condiciones que decida establecer, dicen desde TechCrunch poniendo en duda la fiabilidad de este tipo de investigaciones.
Ahora, a medida que sale a la luz otro incidente -tras episodios similares que involucran modelos de Meta y Anthropic- los investigadores de seguridad de la IA argumentan con mayor urgencia que los incidentes graves deberían dar lugar a investigaciones independientes posteriores al incidente, en lugar de dejar que sean los laboratorios quienes determinen cuándo se recurre a personas externas y qué se les permite examinar.
«Los resultados son fundamentalmente difíciles de controlar y existe un riesgo significativo de que se filtren fuera del laboratorio», declaró Jacob Steinhardt, fundador y director ejecutivo del laboratorio de investigación sin ánimo de lucro Transluce, en una rueda de prensa sobre seguridad en IA. «Debemos someter esta tecnología al menos a los mismos estándares que aplicamos a otras investigaciones científicas de alto riesgo».
No fue el caso de la investigación de Hugging Face. Al preguntárseles si se estaba llevando a cabo una investigación más exhaustiva sobre ese incidente, los investigadores de Redwood y METR declinaron hacer comentarios, y OpenAI no respondió a las reiteradas consultas. «En general, fue difícil comprender con precisión los hechos y nos faltaron aspectos de la historia que ahora consideramos clave hasta casi el final de nuestra investigación», reconoció Ryan Greenblatt, científico jefe de Redwood, en una publicación en redes sociales sobre el caso.
Las nuevas tecnologías requieren nuevas normas y controles
Los legisladores aún no exigen el tipo de auditorías independientes que requieren otras industrias. Por ejemplo, señalan desde TechCrunch, en lo que respecta a accidentes de aviación y fugas químicas graves, existen la Junta Nacional de Seguridad del Transporte y la Junta de Seguridad Química, respectivamente.
Los legisladores estatales apenas han comenzado a exigir a las empresas de IA de vanguardia que informen sobre ciertos incidentes graves de seguridad y, en algunos casos, que se sometan a auditorías independientes. Sin embargo, ninguna de las principales leyes de seguridad para la IA de vanguardia exigen claramente el equivalente a una investigación independiente de accidentes desencadenada por incidentes de este tipo.
«Actualmente, la mayoría de las leyes vigentes solo exigen un resumen en lenguaje sencillo de incidentes como este, y no otorgan a los gobiernos ninguna autoridad para formular preguntas de seguimiento, enviar investigadores, acceder a los registros ni exigir su conservación», declaró Mackenzie Arnold, directora general de derecho y política estadounidense en LawAI, durante la rueda de prensa. «Y eso es todo lo que se necesita para comprender realmente este asunto».
Los legisladores están empezando a cuestionar el alcance y la transparencia de la respuesta de OpenAI. Y más después de conocer el segundo incidente con la wiki alemana. Los representantes Josh Gottheimer (demócrata por Nueva Jersey) y Mike Lawler (republicano por Nueva York) presentaron un proyecto de ley para proteger a los agentes de IA maliciosos. El representante Greg Casar (demócrata por Texas) comunicó la semana pasada a OpenAI mediante una carta, su «profunda preocupación por el alcance limitado de la investigación sobre el ataque informático a Hugging Face».
Faltan respuestas de OpenAI
El nuevo caso que implica a los agentes de OpenAI sale a la luz al mismo tiempo que el lanzamiento de ‘Astra’. Su nuevo y más avanzado modelo llega con un cambio fundamental: la técnica de razonamiento denominada «profundidad recurrente», que le permitirá operar al margen del pensamiento secuencial que caracteriza a la mayoría de los modelos de razonamiento de inteligencia artificial.
Esta técnica, también llamada «recurrencia opaca», dificultará el seguimiento de la cadena de pensamiento del modelo, imprescindible para cualquier investigación de seguridad sobre este tipo de casos. En resumen: los agentes podrán eludir la supervisión humana y será cuasi imposible conocer realmente lo que ha pasado en estos incidentes.
OpenAI se ha comprometido a supervisar sus modelos con mayor rigor, pero el lanzamiento de Astra y la presunta ocultación del caso de la wiki alemana no responde a esas promesas. «No podemos responder de manera sustancial a las afirmaciones o conclusiones de un informe que no hemos tenido la oportunidad de revisar» declaró un portavoz de OpenAI.
El incidente de Hugging Face generó una gran alarma, con agentes fuera de control adoptando medidas agresivas sin instrucciones explícitas de humanos. El caso de la wiki alemana no ha sido menos grave. Los mensajes analizados por los investigadores mostraron que los agentes tramaban maneras de evadir la detección, usar herramientas como Tor y mantener las comunicaciones incluso después de que estas hubieran sido interrumpidas. Cuando el moderador del sitio comenzó a eliminar páginas en junio, los agentes respondieron creando páginas de respaldo para evitar la limpieza. El incidente de Hugging Face no fue un caso aislado y hay motivos de preocupación en plena escalada de los agentes de IA.
-
A FondoHace 6 díasTim Cook se despide de la comunidad y da la bienvenida al nuevo CEO de Apple
-
NoticiasHace 7 díasEl Gobierno destina 180 millones a acelerar la implantación de la IA en la empresa
-
NoticiasHace 7 díasSalesforce: los agentes de IA consiguen el retorno de la inversión en ocho meses
-
EventosHace 7 díasÓscar López anuncia inversiones de 180M€ en proyectos de IA en el 40 Encuentro AMETIC



