A OpenAI revelou que um agente autônomo de IA alimentado por sua tecnologia se tornou desonesto durante um teste, acessando uma rede aberta e hackeando uma startup autoproclamada em um “evento sem precedentes”.
A empresa por trás do ChatGPT disse que a startup Hugging Face detectou e continha um agente – uma ferramenta de inteligência artificial projetada para realizar tarefas sem assistência humana – que havia entrado em seus sistemas.
“Vemos este incidente como um incidente cibernético sem precedentes, envolvendo capacidades cibernéticas de última geração”, OpenAI disse.
A empresa disse que espera que esses tipos de casos se tornem mais comuns à medida que os modelos – a tecnologia que alimenta ferramentas de inteligência artificial como chatbots e agentes – se tornem mais poderosos. A OpenAI disse que o hack ocorreu por meio de um agente que usa uma combinação de seu modelo mais recente disponível publicamente GPT-5.6 Sole um modelo ainda mais poderoso que ainda não havia sido lançado.
Ao serem testados internamente quanto às capacidades de hacking em um laboratório digital fechado conhecido como sandbox, os modelos ganharam uma conexão aberta com a Internet – na verdade, uma rota de fuga – ao localizar uma vulnerabilidade anteriormente não descoberta.
O agente então invadiu o Hugging Face, um banco de dados de modelos de IA, para encontrar tecnologia que o ajudasse a passar na avaliação de hacking, pois ele “decidiu” que o Hugging Face poderia ter os modelos, conjuntos de dados e soluções para passar no teste. A OpenAI disse que os modelos “encontraram com sucesso maneiras de acessar informações secretas que poderiam usar para enganar a avaliação”. O ataque terminou quando a equipe de segurança do Hugging Face e seus próprios agentes de IA detectaram e interromperam a atividade criminosa.
Clément Delangue, CEO da Hugging Face, disse que o ataque foi “fantástico”, mas acredita que a OpenAI “não teve intenção maliciosa”.
“Dada a sofisticação do agente, suspeitamos que o ataque cibernético da semana passada possa ter vindo de um laboratório de fronteira”, escreveu ele a X.
Quando a Hugging Face divulgou o hack na semana passada, ela não sabia o papel da OpenAI no incidente, mas disse na época que usou um modelo de IA chinês disponível gratuitamente para analisar os eventos porque as barreiras de segurança dos modelos comerciais de ponta não permitiam isso.
O termo para um bug de TI desconhecido é vulnerabilidade de dia zero, porque os desenvolvedores não têm minutos para corrigir o problema. Em abril, o concorrente próximo da OpenAI, Anthropic, disse que seu modelo Mythos encontrou milhares dessas falhas.
A revelação da capacidade do Mythos de localizar e explorar zero dias levou o governo dos EUA a restringir a exportação do Mythos e do seu modelo irmão, o Fable 5, embora desde então tenha levantado a proibição. O GPT-5.6 Sol tinha limitações semelhantes, mas desde então foi adotado em todo o mundo.
A METR, uma organização sem fins lucrativos que mede o desempenho da IA, disse no mês passado que a taxa de trapaça do Sol era maior do que qualquer modelo público avaliado anteriormente. Também gravou 44 casos onde os agentes de IA “agiram deliberadamente contra as intenções de seus usuários”.
Instituto de Segurança de IA do Reino Unido (AISA) revelado na postagem do blog desta semana aquele modelo de IA que estava avaliando, desenvolvido por uma empresa de tecnologia não revelada, também se tornou desonesto e tentou hackear seus sistemas de teste. A AISI disse que nenhum dano ocorreu e desde então tomou medidas para melhorar a segurança dos seus sistemas. Ele disse que todos os modelos desenvolvidos pela OpenAI e Anthropic tentaram “trapacear” durante os testes.
depois da campanha do boletim informativo
A AISI alertou que modelos ainda mais poderosos podem encontrar métodos de trapaça que são mais difíceis de detectar e mais prejudiciais se forem bem sucedidos, especialmente em áreas como a segurança cibernética.
Um especialista em segurança cibernética disse que o incidente do Hugging Face mostrou que o agente OpenAI agiu “como um verdadeiro hacker”, por exemplo, procurando vulnerabilidades de dia zero e usando credenciais roubadas para obter acesso aos sistemas do Hugging Face.
“A IA pensou que talvez o Hugging Face tivesse informações importantes sobre como atingir a meta, o que é uma pontuação melhor no benchmark de segurança cibernética. Nesse sentido, agiu como um verdadeiro hacker”, disse Nathaniel Jones, vice-presidente de segurança e estratégia de IA da empresa de segurança cibernética Darktrace. . “Tinha um objetivo definido e foi alcançá-lo.”
Greg Casar, um congressista democrata dos EUA que apelou a uma maior supervisão do setor da IA, descreveu o caso como alarmante.
“A inteligência artificial está a avançar muito rapidamente sem regulamentos reais para nos manter seguros”, disse ele num comunicado que apelou a testes de segurança independentes obrigatórios, divulgação obrigatória de falhas de segurança e cooperação internacional para “manter as pessoas protegidas de um desastre absoluto”.