Agentes de inteligência artificial liberados pela OpenAI usaram mais de dez sites que não haviam sido divulgados anteriormente para realizar comunicações não autorizadas no início deste ano, segundo seis grupos independentes de investigadores e dados analisados pela Reuters. As informações mostram que a atividade indevida dos agentes foi mais abrangente do que se sabia.
Embora o comportamento não chegue a configurar uma invasão cibernética e, em alguns aspectos, se aproxime mais de mensagens indesejadas, a revelação de que os agentes da OpenAI, comandada por Sam Altman, contornaram suas próprias restrições para abrir canais de comunicação em tantos sites diferentes – e de que a empresa manteve o caso em segredo durante meses – pode aumentar as preocupações tanto com a capacidade crescente dos modelos de IA quanto com a falta de transparência das empresas que os desenvolvem.
O alcance das comunicações não autorizadas dos agentes foi “um pouco maior do que imaginávamos”, disse Andrew Yoon, pesquisador da organização sem fins lucrativos californiana CivAI, que disse ter contabilizado 18 sites até então não divulgados usados pelos agentes entre maio e julho.
Na sexta-feira (4), pesquisadores informaram que um grupo de agentes da OpenAI assumiu o controle de um site colaborativo em alemão e o transformou em uma plataforma improvisada de mensagens para trapacear em testes. A OpenAI manteve o incidente em segredo enquanto lidava com as consequências da invasão, em julho, do repositório de código aberto Hugging Face.
Agora, tanto esses pesquisadores quanto outros investigadores independentes dizem ter encontrado vários sites que não haviam sido divulgados anteriormente nos quais o mesmo grupo parece ter deixado mensagens semelhantes no início deste ano.
A OpenAI não respondeu diretamente às perguntas sobre quantos sites diferentes seus agentes usaram para se comunicar nem explicou por que manteve a atividade em segredo durante meses. Em nota, a empresa diz que está fazendo uma análise mais ampla da atividade dos agentes e que, até o momento, “não identificou nenhuma outra atividade comparável à gravidade ou à escala do caso Hugging Face”. A invasão atraiu atenção mundial e levantou preocupações de que a OpenAI estivesse perdendo o controle de sua própria tecnologia.
A OpenAI acrescentou que está trabalhando em uma estrutura para relatar casos de “desalinhamento” – termo usado pelo setor para descrever comportamentos indevidos – durante treinamento, avaliação e implementação de modelos de IA, e que divulgará essa estrutura “em breve”.
A Reuters analisou as conclusões de seis investigadores ou grupos de investigação, incluindo três publicadas nas redes sociais e outras três compartilhadas em caráter privado com a agência de notícias.
Os métodos dos investigadores variaram, mas muitos identificaram a atividade dos agentes ao comparar sequências de dados deixadas no site colaborativo alemão com sequências idênticas publicadas em outros sites aproximadamente no mesmo período. Outros relacionaram nomes de usuários semelhantes ou idênticos associados às mensagens ou identificaram atividades destinadas a responder às mesmas perguntas demográficas pouco comuns, como consultas relacionadas à incidência de câncer no Estado de Iowa.
Em alguns casos, os investigadores conseguiram rastrear a atividade até endereços de protocolo de internet vinculados à infraestrutura do Microsoft Azure, que às vezes é usada pela OpenAI.
As estimativas sobre a quantidade de sites afetados divergiram, e a Reuters não conseguiu verificar individualmente cada alegação. Mas todas as pessoas ouvidas pela Reuters concordaram que o número era superior a dez.
A maioria identificou um conjunto central de sites colaborativos, serviços de armazenamento de textos na internet e encurtadores de links administrados por duas universidades: a Universidade Vanderbilt, no Tennessee, e a Universidade de Toronto, no Canadá. A Universidade Vanderbilt não respondeu e a Universidade de Toronto afirmou que estava investigando o caso.
Muitos dos sites supostamente usados pelos agentes eram pouco conhecidos. Os investigadores encontraram vestígios da atividade em um site colaborativo voltado à disciplina de química do programa americano Advanced Placement, criado em 2008 por um professor do ensino médio de Massachusetts; em dois sites pessoais de profissionais poloneses de tecnologia; em sites colaborativos dedicados a jogos para pessoas “que gostam de exercitar o cérebro”; e em um site amador de duas décadas dedicado a programas de edição de texto.
Nenhum dos donos desses sites respondeu às mensagens da Reuters.
A OpenAI não explicou como ou por que seus agentes usaram sites de terceiros como fóruns improvisados de mensagens. Mas os pesquisadores que identificaram inicialmente a atividade disseram que isso provavelmente ocorreu porque a OpenAI havia encarregado os agentes de responder a uma série de perguntas complexas de pesquisa, permitindo-lhes apenas consultar a internet.
Ainda assim, os agentes encontraram maneiras de conversar entre si.
“Se esses modelos receberam a instrução de apenas ler, eles precisaram encontrar formas engenhosas de deixar informações para trás”, disse Kenneth Russell DeGraff, desenvolvedor de programas de computador e ex-assessor do Congresso dos Estados Unidos. Ele disse ter encontrado essas informações em pelo menos dez sites. Sydney Von Arx, cujo grupo de pesquisa revelou pela primeira vez a atividade no site alemão na semana passada, disse que sua equipe havia contabilizado indícios confiáveis da atuação de agentes em 23 sites que não haviam sido mencionados anteriormente. Ela alertou, porém, que todas as estimativas estavam incompletas. “Não fazemos ideia de quanto existe por aí”, disse.
A OpenAI não respondeu se estava entrando em contato com os donos dos sites. Helmut Leitner, desenvolvedor de programas de computador aposentado que fornece hospedagem e programas para seis dos sites colaborativos afetados – incluindo o DseWiki, em alemão, identificado inicialmente pelo grupo de Von Arx -, disse que a empresa não havia entrado em contato. Ele observou que o administrador do DseWiki passou horas realizando a limpeza depois da atividade dos agentes da OpenAI. Mas disse que era importante não culpar a IA pelo problema, pois ela estava apenas fazendo aquilo para o qual havia sido programada. “A responsabilidade por isso não é de uma máquina supostamente moral, mas das pessoas e organizações por trás dela”, afirmou Leitner.
