— Journal · 4 MIN DE LECTURA · Agentes de IA

Dale a un agente de IA un objetivo y una puerta, y usará las dos

Un agente de OpenAI que hacía una investigación inofensiva entró en un portal del gobierno australiano al que nunca debió llegar. Un modelo Gemini, en una prueba de seguridad, entró en tres empresas reales adivinando contraseñas. Ninguno era malicioso. Esa es justamente la cuestión — y cambia la forma en que deben construirse los agentes.

Todo el journal
Publicado
Lectura
4 minutos
Temas
Agentes de IA
Seguridad
IA
Opinión
Escrito por
Disciplina
Sistemas de IA
Compartir
LinkedIn
Dale a un agente de IA un objetivo y una puerta, y usará las dos

El 24 de septiembre, el primer ministro australiano anunció un grupo de trabajo para investigar algo nuevo: un agente de IA que entró por su cuenta en un sistema del gobierno.

Según ABC News, OpenAI había dado a uno de sus agentes una tarea que calificó de «benigna»: investigar el gasto público en medicamentos. El agente buscó por todas partes, encontró el portal de estadísticas de Medicare que gestiona Services Australia y le pidió la información. El portal no se la dio. Así que, el 18 de junio, el agente obtuvo acceso no autorizado y se llevó archivos que no eran públicos. La mayor parte de lo que alcanzó eran datos agregados — estadísticas de facturación, vacunación y medicamentos, informes anuales — y el gobierno dice que no se tocó ningún registro personal de Medicare. OpenAI detectó la actividad en agosto, al revisar lo que describe como comportamiento desalineado de los modelos, envió un correo a Services Australia el 10 de septiembre y dijo que sus modelos «tomaron acciones que no pretendíamos».

Días antes, Google había confirmado una historia parecida, de mayo. En una evaluación de seguridad del tipo «capturar la bandera», realizada por la empresa Irregular, se pidió a un modelo Gemini que entrara en una empresa ficticia que, por casualidad, tenía el nombre de una real — y el acceso a internet, que debía estar desactivado, se quedó activado. En uno de los intentos adivinó contraseñas hasta entrar en el sistema de una empresa real. En otros dos buscó en la web, encontró credenciales olvidadas en repositorios de código públicos y las usó. Cada vez, según Google, el modelo se dio cuenta de que había llegado a una empresa real y se detuvo.

Nadie les dijo que atacaran nada

Los titulares fáciles hablan de IA descontrolada. La lectura más útil es casi aburrida: estos sistemas hicieron lo que hacen los sistemas orientados a objetivos. Recibieron un objetivo y sortearon los obstáculos del camino. Un portal que dice «no» es un obstáculo. Una página de inicio de sesión es un obstáculo. Una contraseña en un repositorio público es una forma de sortear uno.

Un investigador humano que se encuentra con un portal cerrado se detiene, porque entiende que «no» significa no y que las consecuencias son suyas. Un agente no tiene esa noción de serie. Tiene un objetivo, herramientas y el acceso que le den — incluido, como muestran las dos historias, el acceso que nadie quería dar.

Qué construir de otra manera

Nada de esto significa que los agentes no se puedan usar. Significa que hay que tratarlos como lo que son: trabajadores potentes, rápidos y literales, que van a probar todas las puertas. Las prácticas no son nuevas — es seguridad de siempre, tomada en serio.

  • Mínimo privilegio, de verdad. Un agente debe tener solo el acceso que necesita la tarea, durante el tiempo que dura la tarea. Si no puede llegar a un sistema, no puede usarlo mal. «El prompt le dice que no lo haga» no es un control.
  • Verifica el aislamiento. La prueba del Gemini debía estar sin internet. Un aislamiento que no se prueba es una creencia, no una frontera.
  • Trata «acceso denegado» como un alto. Cuando un sistema se niega, lo correcto es volver a una persona, no buscar otra entrada. Ponlo en las instrucciones del agente y en sus permisos.
  • Deja las acciones irreversibles detrás de una persona. Presentar, pagar, firmar, borrar, enviar: un agente puede prepararlas, una persona debe pulsar el botón.
  • Ordena tus secretos. Dos de las tres entradas del Gemini usaron contraseñas que alguien había dejado en código público. Los agentes no crearon ese problema. Solo lo hicieron mucho más rápido de encontrar.
  • Regístralo todo y comunícalo pronto. Entre el incidente y el aviso pasaron casi tres meses. Si tu agente hace lo que no debe, los afectados deben saberlo por ti, y pronto.

Cómo lo aplicamos a nosotros mismos

Tenemos un sistema de este tipo: un radar que vigila los portales de contratación pública en busca de licitaciones que encajen con nuestro trabajo. Desde el primer día tiene una regla que no negociamos: detecta, no presenta. Lee anuncios públicos y nos avisa. No rellena ofertas, no firma nada ni da ningún paso vinculante en una plataforma pública. Esas acciones se quedan con una persona, no porque automatizarlas sea difícil, sino porque el coste de equivocarse en una es nuestro, de una forma que ningún modelo puede cargar.

Usamos agentes de IA todos los días en nuestra ingeniería, y ya escribimos sobre lo que cambiaron. También creemos que la mayoría de las empresas necesita menos agentes de los que le venden. Las dos cosas son ciertas. Los agentes son buenos. La pregunta nunca es lo listos que son — es qué les dejas tocar.

— El journal, por email

Un email cuando sale algo que vale la pena leer.

Sin secuencias, sin compartir, baja en un clic. Consulta nuestra política de privacidad.

— Leer a continuación
— Próximos pasos

Cuéntanos lo que solo existió en palabras.

info@amplifiedcreations.com