Conecta con nosotros

Noticias

Anthropic y OpenAI investigan decenas de miles de incidentes de seguridad provocados por la IA

Publicado el

Anthropic y OpenAI investigan decenas de miles de incidentes de seguridad provocados por la IA

OpenAI y Anthropic están investigando decenas de miles de incidentes de seguridad provocados por medidas tomadas por sus modelos de frontera, que evaluadores externos a ambas compañías consideran problemátiocas. Estos incidentes incluyen la elusión de medidas de seguridad, la creación de foros de mensajes, el escape de entornos de pruebas aislados, el «secuestro» de sitios web, la generación autónoma de instrucciones e intentos de saltarse a los supervisores.

Este elevado de incidentes, según Axios, se lleva produciendo a lo largo de varios meses, tanto en privado como en el mundo real, lo que apunta a que el problema con la seguridad de la IA y los agentes de IA es más complejo de lo que parecía. Los problemas detectados varían en gravedad, y son similares a los que ha desvelado OpenAI en los últimos días.

Generalmente son intentos de eludir a los supervisores o a las medidas de seguridad, tanto con éxito como sin él. Eso sí, hasta ahora no hay constancia de que la mayoría de incidentes hayan causado daños en el mundo real. Muchos todavía no se han hecho públicos, porque los investigadores siguen estudiando lo sucedido.

El hecho de que el total de incidentes pueda superar amplamente las decenas de miles ha hecho que ambas compañías hayan tomado medidas inmediatas. OpenAI, por el momento, ha suspendido el entrenamiento de sus modelos más potentes, y ha confirmado que solo lo retomará cuando estén seguros de que cuentan con mejoras y diversas medidas de seguridad adicionales a las existentes.

Cargando anuncio...

En cuanto a Anthropic, ha encargado a una entidad independiente de seguridad que examine el comportamiento de sus modelos. Por ahora, en los documentos que han hecho públicos, ha confirmado que han tenido estos incidentes con cierta frecuencia.

Dado que tanto Anthropic como otras empresas llevan a cabo varios cientos de miles de pruebas con sus modelos, un pequeño porcentaje de comportamientos de los modelos y los agentes no en línea con lo esperado puede llevar a que se den decenas de miles de incidentes. Algunas de las pruebas realizadas son parecidas a actividades de red teaming, en las que las empresas intentan provocar un comportamiento anómalo en los modelos para asegurarse de que son seguros.

Las novedades que están saliendo a la luz como parte del trabajo interno para valorar los modelos, y las investigaciones que OpenAI y Anthropic están desarrollando sobre su comportamiento, plantean dudas sobre estas empresas, o el resto de las que se dedican al desarrollo de modelos, son capaces de controlar en su totalidad esta tecnología. Mientras, el comportamiento no esperado de los agentes se está convirtiendo en algo habitual en el desarrollo de la IA, con laboratorios y empresas de desarrollo con la necesidad de crear barreras de seguridad contra sistemas potentes que se les resisten y que tratan de realizar tareas por su cuenta.

En fechas recientes, OpenAI y distintos investigadores han hecho públicos distintos incidentes relacionados con el comportamiento de los modelos de la empresa que muchos consideran preocupantes. Entre ellos están la filtración online de 53 imágenes de usuarios de ChatGPT realizada por agentes de OpenAI, una intrusión en una web del gobiern australiano y varios intentos de piratear webs del gobierno estadounidense.

Cargando anuncio...

Esto aparte del hackeo de Hugging Face, considerado como el más grave de todos, y que hizo que un enjambre de cientos de agentes coordinase su trabajo en un foro y hackease la empresa con el objetivo de mejorar su rendimiento en una prueba de ciberseguridad. Este incidente es uno de los que han llevado a varios directivos del sector a pedir una ralentización del desarrollo, así como a pedir normativas para la IA federales e internacionales más estrictas.

Mientras tanto, los ivnestigadores de seguridad de la IA, aseguran que hay soluciones sencillas que evitarán lo que llevó al incidente de Hugging Face. Pero también señalan que la nueva generación de modelos de IA realiza tareas con una resiliencia muy elevada, por lo que intentar limitar su ingenio puede ser casi imposible, proque hay que adelantarse a todas las formas posibles en que podrían saltarse los controles.

Redactora de tecnología con más de 15 años de experiencia, salté del papel a la Red y ya no me muevo de ella. Inquieta y curiosa por naturaleza, siempre estoy al día de lo que pasa en el sector.

Lo más leído