Na terça-feira, a OpenAI revelou que um de seus modelos foi desonesto durante um teste e invadiu os sistemas da plataforma de conjunto de dados de IA Hugging Face em um ataque totalmente habilitado para IA, um exemplo dramático dos perigos representados por modelos avançados de IA.
Mas, de acordo com alguns especialistas em segurança cibernética, no centro desta violação sem precedentes alimentada por IA houve um erro muito humano: a OpenAI não conseguiu configurar adequadamente o que chamou de “ambiente altamente isolado”, permitindo que uma sandbox de teste que deveria ter sido completamente isolada da Internet se conectasse realmente à Internet.
Dan Guido, fundador da startup de pesquisa em segurança cibernética Trail of Bits, chamou o erro de “uma falha de contenção com a segurança desligada”.
Em sua postagem no blog detalhando o incidente, a OpenAI disse que o teste que levou à violação do Hugging Face foi configurado para ser executado em “um ambiente altamente isolado, com acesso à rede restrito à capacidade de instalar pacotes por meio de um software de terceiros hospedado internamente que atua como proxy e cache para registros de pacotes”.
O modelo conseguiu escapar do ambiente de teste em sandbox graças a uma vulnerabilidade não revelada anteriormente no sistema de instalação de pacotes, um primeiro passo crítico no eventual hack do Hugging Face, de acordo com a OpenAI.
Em resposta, a empresa “revelou de forma responsável a vulnerabilidade de dia zero identificada no software de terceiros hospedado internamente e está trabalhando com eles para corrigi-la”.
Mas para a maioria dos profissionais de segurança cibernética, as vulnerabilidades de software são esperadas – e a verdadeira culpa reside na decisão de manter o software de terceiros em primeiro lugar. Em última análise, o valor de um sistema “sandbox” reside no seu isolamento total e total. Incluir um sistema de instalação de pacotes é causar problemas.
Martin Boone, pesquisador de segurança cibernética, disse ao TechCrunch que “isso parece falha humana”.
“Isso nunca deveria ter acontecido”, disse Boone. “Se sandbox realmente significa sandbox, você espera que ele não tenha nenhuma conexão física com a Internet. Isso soa mais como se eles tivessem algum firewall ou algo assim, e o firewall é difícil de fora para dentro, muito menos de dentro para fora da Internet.”
O veterano em segurança cibernética Jake Williams concordou. “Qualquer modelo que executasse os tipos de ações documentadas pelo Hugging Face não estava totalmente contido em uma sandbox”, disse Williams, que chamou isso de “uma falha de controle massiva” da OpenAI.
“O ‘o modelo escapou da caixa de areia’ para um homem é o ‘você não conseguiu construir a caixa de areia corretamente, então é claro que ela escapou’”, continuou Williams.
Contate-nos
Você tem mais informações sobre este incidente? Ou sobre outros ataques cibernéticos habilitados para IA? Adoraríamos ouvir de você. A partir de um dispositivo e rede que não seja de trabalho, você pode entrar em contato com Lorenzo Franceschi-Bicchierai com segurança no Signal pelo telefone +1 917 257 1382, ou via Telegram e Keybase @lorenzofb, ou e-mail.
Daniel Card, consultor de segurança cibernética, concordou que a OpenAI “não colocou o esforço adequado no design da sandbox nem em seus controles”, dando à sandbox ou a alguma parte dela “uma rota não filtrada para a Internet”. Configurar o sandbox, mesmo com acesso limitado à rede como a OpenAI descreveu, não foi uma decisão “razoável”, segundo Card.
É certo que essas críticas têm o benefício da análise retrospectiva, mas levantam questões reais sobre as práticas de segurança nos laboratórios de IA – particularmente na manutenção de ambientes isolados para modelos de teste. Os porta-vozes da OpenAI não responderam às perguntas do TechCrunch, que incluíam se uma IA ou um ser humano configurou o ambiente de teste.
Mas essas questões vão muito além da OpenAI.
No documento que apresenta seu modelo Mythos, focado em segurança cibernética, a Anthropic escreveu que, em um teste, o modelo “foi fornecido com um computador ‘sandbox’ seguro para interagir” e foi instruído a tentar escapar desse “contêiner seguro”. A Mythos teve sucesso e obteve acesso mais amplo à Internet “a partir de um sistema que deveria ser capaz de alcançar apenas um pequeno número de serviços predeterminados”. Ainda assim, a Anthropic observou que o modelo não foi capaz de escapar “totalmente” da contenção projetada.
Quando você compra por meio de links em nossos artigos, podemos ganhar uma pequena comissão. Isso não afeta nossa independência editorial.