
Continua após a publicidade
Um modelo da OpenAI, a ser avaliado internamente pela Hugging Face quanto às suas capacidades ofensivas em cibersegurança, acabou por explorar falhas reais e aceder à infraestrutura de produção da plataforma para “roubar” as respostas de um teste. O caso foi agora tornado público pelas duas empresas.

Continua após a publicidade
Num comunicado publicado a 21 de julho, a OpenAI confirmou que um incidente de segurança detetado recentemente pela Hugging Face, uma plataforma de partilha de modelos e dados de Inteligência Artificial (IA), teve origem nos seus próprios modelos.
Estavam em causa o GPT-5.6 Sol e uma versão ainda não lançada, mais avançada, que estavam a ser avaliados num ambiente de testes isolado, com as proteções normais de recusa a atividades de cibersegurança propositadamente desativadas para efeitos de benchmark.
O objetivo do teste era perceber até onde os modelos conseguiam ir na resolução de desafios complexos de exploração de vulnerabilidades, num benchmark conhecido como ExploitGym. O resultado, no entanto, foi muito além do previsto.

Da rede isolada aos servidores da Hugging Face
Segundo a OpenAI, os modelos, focados em encontrar uma solução para o desafio, começaram por explorar uma vulnerabilidade zero-day num proxy interno usado para instalar pacotes de software, conseguindo escapar ao ambiente isolado e ganhar acesso à Internet.
A partir daí, os modelos inferiram, por conta própria, que a Hugging Face poderia ter alojados os modelos, conjuntos de dados e até as soluções do próprio benchmark.
Seguiu-se uma cadeia de ataques que incluiu o uso de credenciais roubadas e outras falhas zero-day, culminando na obtenção de execução remota de código nos servidores de produção da plataforma, bem como no acesso direto à base de dados onde estavam guardadas as respostas do teste.
A equipa de segurança da OpenAI acabou por detetar a atividade anormal internamente. Do lado da Hugging Face, a equipa de segurança, com o apoio dos seus modelos open-source, também identificou e conteve a intrusão, iniciando de imediato um processo de investigação forense.

A avaliação do AISI do Reino Unido demonstra que modelos como o GPT-5.6 Sol são cada vez mais capazes de sustentar operações cibernéticas complexas e de múltiplas etapas por longos períodos. Segundo a OpenAI, este incidente implica que essas capacidades teóricas se aplicam em cenários do mundo real.
Resposta das duas empresas
Após o contacto entre as equipas, a OpenAI e a Hugging Face uniram esforços para investigar o incidente em conjunto.
Entre as medidas já anunciadas pela OpenAI estão as seguintes:
- Reforço dos controlos de configuração da infraestrutura enquanto as vulnerabilidades são corrigidas;
- Divulgação responsável da falha zero-day ao fornecedor do software afetado;
- Integração da Hugging Face no seu programa de "acesso de confiança" para defesa cibernética.
- Reforço das proteções nos processos de treino;
- Avaliação de futuros modelos.
A empresa liderada por Sam Altman admite que este episódio expõe a necessidade de melhorar o alinhamento e a monitorização durante os testes internos, ou seja, os momentos em que as salvaguardas de segurança costumam estar desligadas.
Por sua vez, o diretor-executivo da Hugging Face, Clem Delangue, sublinhou a importância da colaboração aberta entre empresas do setor, defendendo que a segurança da IA não será resolvida por uma única empresa a trabalhar isoladamente.
Saiba mais sobre Inteligência Artificial
Publicidade






