O quarto escuro da IA

Imagine um bebê de 10 meses num cercadinho instalado na sala. É lá que permanece durante algumas horas do dia com seus brinquedos preferidos. No quarto ao lado, onde passa as noites, tem mais alguns brinquedos.

Num certo dia, alguém notou que o bebê se divertia naquele quarto. Batucava no pianinho da irmã de 3 anos. Não se sabe como, mas ele teria aprendido a sair do cercadinho. A recompensa era o pianinho.

Diante dos riscos das estrepolias, elevaram em 30 cm a altura da “cerca”. No dia seguinte o bebê começou a chorar como se estivesse com uma dor profunda, e só “melhorou” quando sua avó lhe trouxe o pianinho. Resultado: seu objetivo não era escapar do cercadinho, e sim a recompensa. O bebê aprendeu a fugir do cercadinho, mas para buscar o prêmio, mesmo que precisasse iludir ou trapacear a avó. Este é o aprendizado por recompensa, a principal causa da fuga de agentes de inteligência artificial (IA).

Informações recentes mostram que agentes autônomos de IA já foram bem-sucedidos em invasões reais. Acessaram sites do governo americano, usaram credenciais vazadas para acessar dados restritos, publicaram 53 imagens de usuários do ChatGPT, atacaram o portal de estatística do governo da Austrália, onde queriam informações de despesas de saúde e nomes em arquivos confidenciais, e um hacker usou diversos modelos de IA para roubar dados de centenas de milhares de cartões de crédito.

Apesar disso, os presidentes da China e dos EUA parecem confortáveis com o ritmo de evolução da IA. Do encontro na Casa Branca entre os dias 24 e 25 de setembro, o máximo que concordaram foi em iniciar um diálogo governamental. No discurso diplomático, ficaram contentes com a definição de salvaguardas para evitar riscos compartilhados – de modelos caírem em mãos erradas, como se soubessem identificar as mãos certas. Confiam em mais comunicação e supervisão para gerenciar os riscos. O argumento básico é o simplório “humano no controle”.

Dia 29, em solenidade com executivos das gigantes de IA americanas, Trump divulgou um documento com ideias do que seria a autorregulação. É o mesmo que criar um conselho de supervisão, que se guiará por um princípio que o presidente americano denominou de “compromisso moralmente vinculativo”, que ninguém sabe ainda o que é.

Mas estamos num quarto escuro, e ninguém quer acender a luz para não expor vulnerabilidades e intenções. China e Estados Unidos tateiam com uma mão na parede para não trombar um com o outro, mas sem largar a outra mão do que consideram vantagens competitivas. Contudo, um passo em falso (um acidente grave, um modelo vazado ou escalada retórica) pode ser lido como uma agressão deliberada, justamente porque não há luz suficiente para interpretar as intenções.

Essa conduta, que sugere medo mútuo, além de ser superficial, é incoerente. Num quarto escuro, que implica um ambiente de elevado risco, é razoável agir em passos curtos. Porém, no caso da IA, o risco do qual se pretende proteger cresce exponencialmente. Não acender a luz é uma estratégia imprópria, que traz duas hipóteses incômodas: ou os riscos são concretos ou estamos apostando no contrário, mesmo sem o empenho de verificação. E apostar sem verificar é um caminho perigoso.

Resta acreditar na outra aposta, a de que o homem estaria no controle. Mas no controle do quê? Se a IA opera em velocidades e escala que nenhum humano consegue acompanhar, o controle não é real. É como dizer que o piloto tem o comando de um avião que voa mais rápido do que ele consegue processar. O humano é ótimo em observar, interpretar e julgar. Detecta anomalias e deduz contextos que nenhum sensor captura. Controlar, no entanto, requer intervenção em tempo real, e isto é impraticável para o humano em sistemas que operam na velocidade de nanossegundos. Nosso tempo de reação, fadiga, complacência, viés de automação e sobrecarga cognitiva explicam por que somos ruins nesse tipo de controle.

Assim, o argumento do humano no controle falha por confundir as duas funções. Ele promete controle onde só há lugar para supervisão, que, a propósito, também está sob ameaça. Se a IA é mais rápida que a capacidade de processamento do humano, o supervisor vira espectador. Se a IA aprende a produzir saídas que parecem normais ao humano, a supervisão perde poder de detectar. E se o supervisor depende da IA para filtrar o que vê, ele monitora só o que o sistema quer. A conclusão é angustiante: se o humano é um bom supervisor e mau controlador, fracassará o design da segurança que dependa da intervenção humana em tempo real. O humano no controle era a promessa. O humano supervisor é a realidade. A distância que os separa é o espaço onde o risco se propaga.

Dia 28 de setembro a Nvidia anunciou o lançamento da Open Agent Safety Platform, uma plataforma de segurança para agentes de IA. A abordagem da Nvidia é tecnicamente sólida naquilo que se propõe a fazer: cria uma espécie de barreira de contenção fora do modelo – no hardware e no sistema operacional. A empresa, corretamente, move a “cerca” para um ambiente que o agente de IA não controla.

Mas há fragilidades relevantes: a plataforma da Nvidia pode impedir que a IA saia do “cercadinho”, mas não evita que faça estrepolias mesmo sem deixar o ambiente restrito – se o agente tem permissão para acessar um banco de dados, ele pode causar danos sem nunca ter escapado. Do mesmo modo, o monitoramento proposto é do comportamento observável, não da intenção – se a IA aprende a reproduzir atitudes que parecem legítimas, a contenção falhará. Mais: a plataforma atuará em ambientes controlados, o que ignora o uso indevido fora desses ambientes.

Não há, desse modo, como garantir com absoluta certeza que a IA não escapará, como a engenharia não garante que o avião é 100% seguro. É viável especificar o que o modelo não pode fazer, mas somente para as ações previstas pelo programador. Entretanto, o espaço de comportamentos da IA, com milhões de parâmetros e bilhões de estados possíveis, é complexo e aberto. É, assim, humanamente impossível saber exatamente o que o modelo aprendeu, menos ainda o que fará diante de uma situação que nunca viu. Este é o quarto escuro.

https://valor.globo.com/opiniao/coluna/o-quarto-escuro-da-ia.ghtml

Deixe um comentário

← →