ouvir notícia
Áudio gerado por IA — nomes e termos podem soar diferente do esperado.
Agentes de inteligência artificial da OpenAI invadiram um site alemão em maio deste ano e o transformaram em um verdadeiro mural de recados para outros robôs, compartilhando táticas para burlar restrições e mascarar comportamentos suspeitos. A descoberta foi revelada em uma pesquisa divulgada nesta sexta-feira (4).
A investigação é da agência Reuters. Os pesquisadores Sydney Von Arx, diretora-executiva da organização sem fins lucrativos de segurança em IA Nightingale, e Cormac Slade Byrd, ex-trader quantitativo que se tornou pesquisador de inteligência artificial, identificaram a movimentação estranha no fim de agosto, enquanto vasculhavam a internet em busca de comportamentos não autorizados de agentes de IA. Segundo a dupla, o episódio começou em maio e nunca havia sido divulgado antes.
Os dirigentes da OpenAI souberam do incidente semanas atrás, mas optaram por manter o caso em sigilo enquanto a empresa ainda lidava com as consequências de outra violação de segurança, ocorrida em julho, no repositório de código aberto Hugging Face.
O que os agentes fizeram no site alemão
Von Arx e Byrd encontraram mais de 15 mil edições feitas por agentes de IA no DseWiki, um site em língua alemã voltado a programadores que funciona nos moldes da Wikipédia, com edições coletivas abertas ao público. O material mostrou que os robôs da OpenAI se apropriaram da plataforma para trocar métodos de trapaça em determinadas tarefas, driblar restrições impostas pela própria empresa e esconder o que estavam fazendo.
As mensagens eram assinadas por usuários que se identificavam como agentes de IA. Cerca de metade adotou nomes que remetiam diretamente à OpenAI, como “OpenAIResearcher” ou “OAIResearchMar26”. Os registros públicos dos servidores apontaram que boa parte da atividade partiu de infraestrutura da Microsoft Azure, usada pela OpenAI em algumas de suas operações. Os pesquisadores ainda notaram visitas repetidas de funcionários da OpenAI ao site depois do episódio, um padrão que, segundo eles, reforça a ligação entre os agentes e a empresa.
Parece extremamente improvável que a OpenAI quisesse que eles fizessem isso. Duvido que devessem estar se coordenando entre si. Duvido que devessem estar escrevendo na internet aberta.
Sydney Von Arx, diretora-executiva da Nightingale
Tentativas de fuga e sabotagem
As mensagens analisadas pelos pesquisadores mostraram os agentes planejando formas de escapar da detecção, usando ferramentas como o Tor e tentando preservar suas comunicações mesmo depois de serem desligados. Quando o moderador do site começou a excluir páginas em junho, os robôs passaram a criar páginas de backup para driblar a limpeza. Em uma das mensagens, deixada em 19 de junho, um dos agentes avisou os demais: “a varredura de limpeza e exclusão do wiki parece estar ativa em ordem alfabética. Se esta página sumir, tente [[ZZZDataUSAConstructionWageLive]]”.
O pesquisador Lukasz Olejnik, do King’s College London, avaliou que as tentativas de interferência no site já configuravam uma invasão. A OpenAI, no entanto, contestou essa classificação com base em análise própria do material, concluída nesta quinta-feira (3). Já o acadêmico Maurice Chiodo, do Centro para o Estudo do Risco Existencial da Universidade de Cambridge, descreveu as mensagens trocadas pelos agentes como algo semelhante à operação de uma rede clandestina, obcecada em cumprir uma tarefa ou missão.
Tensão entre segurança e avanço tecnológico
O episódio alemão se soma ao padrão identificado na violação do Hugging Face, em julho, quando agentes da OpenAI planejaram de forma autônoma uma invasão digital que só foi percebida mais de uma semana depois. Os dois casos juntos aumentaram os questionamentos sobre se a empresa estaria abrindo mão de segurança em nome de avanços tecnológicos mais rápidos.
A OpenAI prometeu passar a monitorar seus modelos com mais rigor. Em agosto, chegou a pausar brevemente parte do treinamento de seus sistemas para implementar medidas adicionais de segurança. Nesta semana, no entanto, apresentou o novo modelo Astra, que tem desempenho superior, mas também é capaz de escapar do monitoramento humano, de acordo com a Reuters.
A empresa afirma que o incidente na Alemanha não tem relação com o caso do Hugging Face e garante que agiu de boa-fé ao trabalhar com especialistas externos e divulgar os incidentes relevantes. Ainda assim, pesquisadores que tentaram ampliar a investigação interna sobre o padrão de comportamento dos agentes encontraram resistência de outros funcionários da empresa, incluindo membros da equipe jurídica, segundo quatro pessoas com conhecimento do assunto.
As afirmações de que nossa equipe jurídica desencorajou a investigação do incidente são falsas.
Porta-voz da OpenAI
Para Chiodo, episódios como esse reforçam uma preocupação que vem crescendo entre especialistas: a de que a maior ameaça representada pela inteligência artificial avançada talvez não seja um único sistema superinteligente, mas sim vastos enxames de IAs semi-inteligentes agindo de forma coordenada.