A Fondo
El modelo Astra de OpenAI alarma a los expertos en seguridad de la IA
El nuevo modelo Astra de OpenAI utilizará una técnica de razonamiento denominada «profundidad recurrente», que le permitirá operar al margen del pensamiento secuencial que caracteriza a la mayoría de los modelos de razonamiento de inteligencia artificial.
Esta técnica, también llamada «recurrencia opaca», dificultará el seguimiento de la cadena de pensamiento del modelo y aunque su uso será limitado, su aparición ha generado importantes preocupaciones entre los expertos en seguridad de la IA, que ha recogido The Information.
Y es que la seguridad de la IA (que incluye tanto la ciberseguridad como el control de la misma) sigue siendo una de las grandes cuestiones pendientes de resolver para el despliegue global de las tecnologías de inteligencia artificial. El nuevo modelo Astra de OpenAI no es el primero que preocupa al sector de la seguridad y hace unos meses vimos como Anthropic tuvo que lanzar el Proyecto Glasswing ya que según reconoció, su modelo cibernético de IA más potente era demasiado peligroso para lanzarlo públicamente.
¿Qué ocurre con el Astra de OpenAI?
En circunstancias normales, la cadena de pensamiento de un modelo de razonamiento proporciona los pasos secuenciales que sigue el modelo al intentar resolver un problema. Si bien esta representación es imperfecta, sigue siendo una herramienta valiosa para detectar comportamientos anómalos o desajustes. En el caso de la reciente actividad de agentes maliciosos de OpenAI, los registros de la cadena de pensamiento fueron fundamentales para comprender por qué los agentes se comportaron de esa manera.
En la recurrencia opaca, el modelo adopta un enfoque menos lineal, procesando la misma consulta varias veces en un bucle. El resultado deja menos rastros legibles, evitando así un registro convencional de la secuencia de pensamiento, y ello alarma a los investigadores.
«Me preocupa enormemente la información que indica que Astra utiliza una recurrencia opaca«, escribió Buck Shlegeris, director ejecutivo de Redwood, en una publicación tras conocerse el cambio de razonamiento. «Desconozco si Astra es mucho menos monitorizable mediante CoT que los modelos anteriores. Pero si OpenAI sigue desarrollando esta técnica, tendrá la opción de aumentar drásticamente la recurrencia y destruir por completo la monitorización de CoT», la técnica de prompt engineering que mejora el resultado de los modelos de lenguaje de gran tamaño (LLM), especialmente para tareas complejas que implican un razonamiento de varios pasos, antes de ofrecer una respuesta final.
Zvi Mowshowitz, defensor de la seguridad en la IA, también dio su opinión y escribió que podrían ser necesarias leyes para «evitar una carrera hacia el abismo» entre los laboratorios de IA. «Esta técnica es jugar con fuego, arriesgando un tabú que OpenAI y Anthropic han defendido con ahínco: el de mantener la fidelidad y la capacidad de monitorización de la Cadena de Pensamiento el mayor tiempo posible», dice Mowshowitz concluyendo que «un uso más intensivo de estas técnicas probablemente perjudicaría la capacidad de monitorización».
El uso del razonamiento «opaco» por las IA
Fundamentalmente, el uso que hace el Astra de OpenAI de esta técnica parece ser limitado. Se espera que la cadena de pensamiento del modelo siga siendo legible, y la empresa rechazó cualquier sugerencia de que vaya a adoptar un lenguaje más ininteligible. OpenAI ya ha anunciado planes para implementar sistemas de monitorización exhaustivos de la cadena de pensamiento como parte de sus planes de seguridad a futuro.
En una publicación en X, el científico jefe de OpenAI, Jakub Pachocki, quiso rebajar las preocupaciones enfatizando el compromiso del laboratorio con las cadenas de pensamiento legibles. «OpenAI ha trabajado para preservar y utilizar el monitoreo de cadenas de pensamiento desde nuestros primeros modelos de razonamiento. Es un objetivo fundamental de nuestro programa de investigación actual».
Todos los modelos de IA realizan cierto grado de razonamiento opaco, y pocos investigadores consideran los registros de la cadena de pensamiento como una representación directa del razonamiento de un modelo. Sin embargo, estas salvedades no disipan la preocupación de que la recurrencia opaca pueda dificultar la supervisión del razonamiento de la IA, especialmente a medida que su uso se extiende a diferentes modelos. The Information informó que tanto Anthropic como Google DeepMind ya estaban debatiendo el uso de este tipo de técnicas.
Los investigadores de seguridad insisten que, indudablemente, el razonamiento opaco dificulta el control del funcionamiento de los grandes modelos LLM. El científico jefe de Redwood Research, Ryan Greenblatt, dijo que el razonamiento opaco podría escalar fácilmente más rápido que el razonamiento convencional de cadena de pensamiento, eliminando de hecho todo razonamiento de los canales visibles.
«Mi mayor preocupación es que una progresión natural a partir de aquí implicaría aumentar el razonamiento opaco hasta el punto en que el modelo razone total o casi totalmente en el espacio latente», escribió Greenblatt. «Espero que no sea demasiado tarde para evitar las arquitecturas más preocupantes y que OpenAI se detenga aquí».
La implementación masiva y acelerada de los modelos de inteligencia artificial han provocado grandes desafíos en materia de ciberseguridad informática y también de la propia seguridad de la IA en cuanto a mantenerla bajo control. En ambos casos las preocupaciones son evidentes. Y eso que las investigaciones de la IA están todavía en pañales. En el horizonte sigue estando esa auto mejora recursiva donde la IA no solo mejora los resultados, sino los procesos por los que lo consiguen. Será un salto de nivel para el que conviene estar preparados.
-
NoticiasHace 7 díasMeta pagará hasta 18.000 millones para evitar el juicio por adicción de menores a sus redes sociales
-
NoticiasHace 7 díasLos centros de datos en España tendrán que consumir un mínimo del 80% de energía renovable
-
NoticiasHace 6 díasStripe desiste: no comprará PayPal
-
NoticiasHace 7 díasAWS amplía su acuerdo con NVIDIA con el despliegue de dos millones de GPUs más


