A OpenAI revelou que um agente autônomo de IA alimentado por sua tecnologia se tornou desonesto durante um teste, acessou a web aberta e hackeou sozinho uma startup proeminente em um “incidente sem precedentes”.
A empresa por trás do ChatGPT disse que a startup Hugging Face detectou e continha o agente – uma ferramenta de IA projetada para realizar tarefas sem assistência humana – que havia entrado em seus sistemas.
“Consideramos este incidente um incidente cibernético sem precedentes, envolvendo capacidades cibernéticas de última geração”, disse OpenAI.
A empresa disse esperar que este tipo de incidente se torne mais comum à medida que os modelos – a tecnologia que sustenta as ferramentas de IA, como chatbots e agentes – se tornam mais capazes.
A OpenAI disse que o hack ocorreu por meio de um agente alimentado por uma combinação de seu modelo mais recente disponível publicamente, chamado GPT-5.6 Sol, e um modelo ainda mais capaz que ainda não foi lançado.
Ao serem testados internamente quanto às suas capacidades de hacking num laboratório digital fechado conhecido como sandbox, os modelos ganharam acesso aberto à Internet – efetivamente uma rota de fuga – ao localizar uma vulnerabilidade que não tinha sido descoberta antes.
O agente então hackeou o Hugging Face, que é um banco de dados de modelos de IA, para localizar tecnologia que o ajudaria a passar na avaliação de hacking. A OpenAI disse que os modelos “encontraram com sucesso maneiras de obter acesso a informações secretas que poderiam usar para enganar a avaliação”. O ataque terminou quando a equipe de segurança do Hugging Face e seus próprios agentes de IA detectaram e interromperam a atividade desonesta.
O presidente-executivo da Hugging Face, Clément Delangue, disse que o ataque foi “alucinante”, mas acredita que “não houve intenção maliciosa” da OpenAI.
“Suspeitamos que o ataque cibernético da semana passada poderia ter vindo de um laboratório de fronteira, dada a sofisticação do agente”, escreveu ele no X.
O termo para uma falha de TI desconhecida é vulnerabilidade de dia zero porque os desenvolvedores não têm minutos para corrigir o problema. Em abril, a Anthropic, rival próxima da OpenAI, disse que seu modelo Mythos havia encontrado milhares dessas falhas.
pular promoção de boletim informativo Boletim informativo gratuito | Todos os dias da semana
Inscreva-se para Negócios hoje
Prepare-se para o dia de trabalho – indicaremos todas as notícias e análises de negócios que você precisa todas as manhãs
após a promoção do boletim informativo
A revelação da capacidade da Mythos de localizar e explorar zero dias levou o governo dos EUA a restringir as exportações da Mythos e de seu modelo irmão Fable 5, embora desde então tenha levantado a proibição. O GPT-5.6 Sol tinha restrições semelhantes, mas desde então foi implementado em todo o mundo.
Greg Casar, um congressista democrata dos EUA, disse que o incidente foi alarmante.
“A IA está a desenvolver-se extremamente rápido, sem regulamentos reais para nos manter seguros”, disse ele num comunicado apelando à obrigatoriedade de testes de segurança independentes, à divulgação obrigatória de incidentes de segurança e à cooperação internacional “para manter as pessoas protegidas de um desastre absoluto”.