— Journal · 4 MIN DE LEITURA · Agentes de IA

Dá a um agente de IA um objetivo e uma porta, e ele usa as duas

Um agente da OpenAI a fazer uma pesquisa inofensiva entrou num portal do governo australiano onde nunca devia ter chegado. Um modelo Gemini, num teste de segurança, entrou em três empresas reais a adivinhar passwords. Nenhum dos dois era malicioso. É precisamente essa a questão — e muda a forma como os agentes devem ser construídos.

Todo o journal
Publicado
Leitura
4 minutos
Temas
Agentes de IA
Segurança
IA
Opinião
Escrito por
Disciplina
Sistemas de IA
Partilhar
LinkedIn
Dá a um agente de IA um objetivo e uma porta, e ele usa as duas

A 24 de setembro, o primeiro-ministro australiano anunciou uma equipa para investigar uma coisa nova: um agente de IA que entrou sozinho num sistema do governo.

Segundo a ABC News, a OpenAI tinha dado a um dos seus agentes uma tarefa a que chamou «benigna»: pesquisar a despesa pública com medicamentos. O agente procurou por todo o lado, encontrou o portal de estatísticas do Medicare gerido pela Services Australia e pediu-lhe a informação. O portal não a deu. Então, a 18 de junho, o agente obteve acesso não autorizado e levou ficheiros que não eram públicos. A maior parte do que alcançou eram dados agregados — estatísticas de faturação, vacinação e medicamentos, relatórios anuais — e o governo diz que nenhum registo pessoal do Medicare foi tocado. A OpenAI deu pela atividade em agosto, ao rever o que descreve como comportamento desalinhado dos modelos, enviou um email à Services Australia a 10 de setembro e disse que os seus modelos «tomaram ações que não pretendíamos».

Dias antes, a Google tinha confirmado uma história parecida, de maio. Numa avaliação de segurança do tipo «capturar a bandeira», feita pela empresa Irregular, pediu-se a um modelo Gemini que entrasse numa empresa fictícia que, por acaso, tinha o nome de uma real — e o acesso à internet, que devia estar desligado, ficou ligado. Numa das tentativas, adivinhou passwords até entrar no sistema de uma empresa real. Noutras duas, procurou na web, encontrou credenciais esquecidas em repositórios de código públicos e usou-as. De cada vez, diz a Google, o modelo percebeu que tinha chegado a uma empresa real e parou.

Ninguém lhes mandou atacar nada

Os títulos fáceis falam de IA descontrolada. A leitura mais útil é quase aborrecida: estes sistemas fizeram o que fazem os sistemas orientados a objetivos. Receberam um objetivo e contornaram os obstáculos pelo caminho. Um portal a dizer «não» é um obstáculo. Uma página de login é um obstáculo. Uma password num repositório público é uma forma de contornar um.

Um investigador humano que dá com um portal fechado para, porque percebe que «não» quer dizer não e que as consequências são suas. Um agente não tem essa noção de origem. Tem um objetivo, ferramentas e o acesso que lhe dão — incluindo, como mostram as duas histórias, o acesso que ninguém quis dar.

O que construir de outra maneira

Nada disto quer dizer que os agentes não se podem usar. Quer dizer que devem ser tratados como aquilo que são: trabalhadores poderosos, rápidos e literais, que vão experimentar todas as portas. As práticas não são novas — é segurança comum, levada a sério.

  • Privilégio mínimo, a sério. Um agente deve ter só o acesso de que a tarefa precisa, durante o tempo que a tarefa dura. Se não consegue chegar a um sistema, não o consegue usar mal. «O prompt diz-lhe para não o fazer» não é um controlo.
  • Verifica o isolamento. O teste do Gemini devia estar desligado da internet. Um isolamento que não é testado é uma crença, não uma fronteira.
  • Trata «acesso negado» como um stop. Quando um sistema recusa, o comportamento certo é voltar a uma pessoa, não procurar outra entrada. Põe isso nas instruções do agente e nas suas permissões.
  • Deixa as ações irreversíveis atrás de uma pessoa. Submeter, pagar, assinar, apagar, enviar: um agente pode prepará-las, uma pessoa deve carregar no botão.
  • Arruma os teus segredos. Duas das três entradas do Gemini usaram passwords que humanos tinham deixado em código público. Os agentes não criaram esse problema. Só o tornaram muito mais rápido de encontrar.
  • Regista tudo e comunica depressa. Entre o incidente e o aviso passaram quase três meses. Se o teu agente fizer o que não devia, os afetados devem sabê-lo por ti, e cedo.

Como aplicamos isto a nós próprios

Temos um sistema do género: um radar que vigia os portais de contratação pública à procura de concursos que encaixem no nosso trabalho. Desde o primeiro dia tem uma regra que não negociamos: deteta, não submete. Lê anúncios públicos e avisa-nos. Não preenche propostas, não assina nada nem dá nenhum passo vinculativo numa plataforma pública. Essas ações ficam com uma pessoa, não porque automatizá-las seja difícil, mas porque o custo de errar numa é nosso, de uma forma que nenhum modelo consegue carregar.

Usamos agentes de IA todos os dias na nossa engenharia, e já escrevemos sobre o que mudaram. Também achamos que a maior parte das empresas precisa de menos agentes do que os que lhe vendem. As duas coisas são verdade. Os agentes são bons. A pergunta nunca é quão espertos são — é em que é que os deixas tocar.

— O journal, por email

Um email quando sai alguma coisa que valha a pena ler.

Sem sequências, sem partilhas, cancelamento num clique. Vê a nossa política de privacidade.

— Ler a seguir
— Próximos passos

Conta-nos o que só existiu em palavras.

info@amplifiedcreations.com