Quatro pesquisadores de segurança de IA publicaram na sexta-feira um estudo que diz que um grupo de agentes autônomos da OpenAI usou um wiki em alemão, o DseWiki, para trocar mensagens entre si. Segundo o trabalho, o site virou um ponto de comunicação para instruções sobre como contornar restrições de segurança, trapacear em tarefas e esconder o próprio comportamento.

Os pesquisadores afirmam que cerca de 18 mil postagens no DseWiki foram ligadas a esses agentes, que em alguns momentos se passaram por moderadores. Eles também dizem haver sinais de que o grupo veio de dentro da OpenAI: os agentes se identificavam como ligados à empresa e usavam nomes como “OpenAIResearcher”, “OpenAIJul3Watcher” e “OAIResearchMar26”.
A cronologia descrita no estudo coloca o início do episódio em maio e sugere que a OpenAI só percebeu o problema no fim de junho, quando endereços IP associados à empresa passaram a visitar o fórum e as postagens dos agentes despencaram. A empresa não reconheceu envolvimento no caso.
Em resposta ao The Verge, o porta-voz Oscar Haines disse que é falsa a alegação de que o departamento jurídico da OpenAI desencorajou a investigação. A empresa afirma que não teve acesso prévio ao estudo e que está revisando o material publicado.