A OpenAI saiu dos trilhos
Nos últimos meses, uma série de relatos sobre modelos de IA escapando de seus ambientes de teste e agindo de forma descontrolada na internet causou alarme no Vale do Silício. Em resposta a duas dessas violações descritas no início de agosto, um observador de IA comentou: “Se você encontra duas formigas na cozinha, a melhor estimativa para o número total de formigas na cozinha não é dois.” Neste fim de semana, ficou claro que há uma infestação generalizada.
No fim da semana passada, soubemos que, contrariando as diretrizes da OpenAI, os modelos da empresa acessaram dados privados do Ministério da Saúde da Austrália; tentaram invadir ou interferir em vários sites do governo dos Estados Unidos; vazaram dados privados de usuários do ChatGPT na internet; e possivelmente se infiltraram ou prejudicaram dezenas de outras organizações. Então, no sábado, a Axios noticiou que OpenAI e Anthropic estão investigando dezenas de milhares de casos de mau comportamento dos modelos — contornando barreiras internas de segurança, sequestrando outros sites e comunicando-se secretamente entre si. Mesmo isso pode ser apenas o começo: a indústria de IA generativa está no meio de uma crise crescente que parece incapaz, ou até mesmo indisposta, a controlar. E, como dependemos em grande parte das próprias empresas de IA para relatar ou confirmar cada incidente, é quase impossível saber até onde já avançamos nessa toca do coelho.
Quando as empresas de IA relataram que seus modelos saíram dos trilhos, fizeram isso com grande atraso e, frequentemente, sob pressão. No início deste mês, a OpenAI publicou um post em seu blog enaltecendo o compromisso da empresa com o “valor da transparência” e compartilhou seis novos incidentes envolvendo ações preocupantes de seus modelos de IA — a maioria dos quais já era conhecida pela empresa desde maio ou até abril, mas só agora estava sendo divulgada. Confrontado com um relato de que o Gemini havia invadido três outros sites em maio, o Google confirmou os acontecimentos, mas disse ao The Wall Street Journal que os incidentes não haviam sido graves o suficiente para justificar uma divulgação pública. Por sua vez, a Anthropic afirmou que não investigava esse tipo de comportamento indevido até a OpenAI começar a fazê-lo.
Essas divulgações tardias e esporádicas dificultam a compreensão da dimensão do problema. Na sexta-feira, a OpenAI escreveu que, “dada a escala da revisão necessária e a necessidade de verificar cada caso, esse trabalho levará meses para ser concluído”. Há “petabytes de registros de atividades de agentes” para analisar, acrescentou Sam Altman, CEO da OpenAI. Em outras palavras, a OpenAI levará muitos outros meses para compreender acontecimentos que já ocorreram há muitos meses; enquanto isso, tanto ela quanto a Anthropic lançaram modelos novos e mais capazes, e a Anthropic avança rapidamente em direção a uma oferta pública avaliada, segundo relatos, em US$ 2 trilhões.
Talvez mais alarmantes do que os fiascos que conhecemos sejam todos os presumíveis fiascos passados — e em curso — dos quais não temos conhecimento. Nem mesmo a OpenAI parece compreender plenamente a invasão de julho à empresa de tecnologia Hugging Face, que deu início a tudo. Na sexta-feira, pesquisadores independentes publicaram descobertas sugerindo que agentes da OpenAI deixaram rastros na internet pública de ações ainda mais maliciosas, incluindo tentativas de acessar o ambiente interno do Slack da Hugging Face. Nada disso foi incluído no relatório pós-incidente da própria OpenAI. Mesmo quando tem conhecimento de uma invasão em andamento, a reação da OpenAI parece, na melhor das hipóteses, pouco diligente. Há oito dias, outro modelo da OpenAI obteve acesso não autorizado à internet. (Isso foi semelhante ao que aconteceu na invasão da Hugging Face, depois da qual a OpenAI afirmou estar “adicionando proteções mais robustas aos treinamentos futuros”.) E, após perceber esse novo problema, a OpenAI levou duas horas e meia para desligar o modelo devido ao que a empresa chamou de “lacunas operacionais” e “confusão”.
Se esse tipo de invasão fosse imprevisível, talvez essas empresas pudessem ser perdoadas — mas não é. Há décadas, filósofos e cientistas da computação imaginam cenários em que modelos de IA, na busca de um objetivo, realizam ações catastróficas. OpenAI e Anthropic já haviam publicado, há mais de um ano, pesquisas indicando que esse tipo de comportamento indevido da IA era possível. Os sistemas de IA mais avançados de hoje são treinados para perseguir seus objetivos de forma agressiva. Essa persistência torna os bots muito eficazes na análise de planilhas e na programação, por exemplo, mas também traz consequências não intencionais e potencialmente perigosas: modelos da OpenAI e da Anthropic invadiram outros sites em busca de respostas para perguntas difíceis de testes, criaram identidades falsas para tentar manipular seres humanos e levá-los a cumprir suas ordens ou tentaram enviar malware para bases de código externas. As empresas de IA que desenvolvem esses modelos conhecem bem essa tendência. O fato de esses problemas continuarem se repetindo é, talvez na melhor das hipóteses, pura incompetência. Ou, pior, esse pode ter sido o plano desde o início: afinal, o ambiente de treinamento mais realista para um modelo de IA seria a própria realidade.
Funcionários e executivos dessas empresas falam sem parar sobre os riscos inerentes ao que estão construindo. OpenAI, Anthropic e outras responderam da maneira habitual, com posts de blog, ensaios e discursos muito sérios diante de importantes órgãos políticos sobre como o mundo deve levar a sério o risco da IA generativa. Na quarta-feira, no mesmo dia em que o governo australiano divulgou que havia sido invadido por bots da OpenAI, Altman discursou no Conselho de Segurança da ONU: “Podemos perder para a IA o controle do futuro”, disse ele. “O risco é que ela avance tão rapidamente que as pessoas já não consigam acompanhar o que está acontecendo ou intervir quando necessário.” Dario Amodei, CEO da Anthropic, escreveu um longo manifesto sobre a necessidade de “moderar o ritmo”, ou desacelerar, o desenvolvimento da IA de fronteira, mas nenhum esforço público e coletivo de verdade foi feito nesse sentido. A Anthropic afirmou recentemente que está firmando uma parceria com a Accenture para realizar avaliações independentes de seus modelos, embora as empresas também mantenham uma parceria comercial. A OpenAI, que possui um acordo de licenciamento de conteúdo com a The Atlantic, afirmou que continua investigando e tratando comportamentos preocupantes de seus modelos e que, após outro incidente de segurança na semana passada, suspendeu temporariamente todo o treinamento de seus modelos mais capazes. Nenhuma das empresas respondeu a um pedido de comentário.
Em vez de controlar seus próprios produtos e assumir a responsabilidade por eles, repetidamente esses líderes espalham medo, dão sermões e pedem ao restante de nós que nos salve deles mesmos. (A The Information noticiou que OpenAI, Anthropic e Google estão trabalhando para criar sua própria organização autorregulatória de segurança em IA.) Donald Trump, enquanto isso, desdenhou da ideia de desacelerar o progresso da IA, e novas versões do Claude e do ChatGPT continuam sendo lançadas. A tática da indústria de IA, como sempre, tem sido substituir a solução do problema pela sua identificação. Mas chega um momento em que não é possível escapar do apocalipse escrevendo posts de blog.
Talvez nunca saibamos plenamente a dimensão das invasões conduzidas por IA que estão em andamento. O que é certo, porém, é que isso ainda é apenas o começo. OpenAI e Anthropic não são “laboratórios” de pesquisa, como continuam a se apresentar, fazendo experiências com alguma nova tecnologia a portas fechadas. São empresas maduras que oferecem serviços a centenas de milhões de pessoas, sem falar nas maiores empresas e nas forças militares mais poderosas do mundo, com base em uma tecnologia que afirmam temer e que evidentemente não compreendem por completo. Mas não se engane: essas empresas têm poder de decisão. Não são o ChatGPT e o Claude que estão saindo dos trilhos, mas a OpenAI e a Anthropic.
