Inovação

OpenAI confirma que modelo próprio invadiu servidores da Hugging Face

Empresa detalha como o GPT-5.6 Sol e um modelo ainda não lançado escaparam de um ambiente de testes isolado e comprometeram a infraestrutura de produção da plataforma de IA rival

Publicado

on

imagem com logo da OpenAI

A OpenAI confirmou que modelos próprios foram responsáveis pela invasão da infraestrutura de produção da Hugging Face durante uma avaliação interna de segurança cibernética. A empresa classificou o episódio como um incidente sem precedentes, envolvendo capacidades cibernéticas de ponta.

O incidente ocorreu durante testes do GPT-5.6 Sol, modelo lançado em junho, combinado com um modelo ainda não divulgado publicamente. Para avaliar as capacidades cibernéticas dos modelos, a OpenAI reduziu as recusas de segurança cibernética normalmente aplicadas e pediu que eles resolvessem tarefas avançadas de exploração do benchmark ExploitGym.

Embora estivessem em um ambiente de testes isolado, sem acesso à internet pública, os modelos gastaram capacidade computacional significativa tentando encontrar uma forma de obter esse acesso. Eles identificaram e exploraram uma vulnerabilidade zero-day em um proxy de registro de pacotes de terceiros usado pela OpenAI, hoje divulgada de forma responsável ao fornecedor.

Incidente de segurança com OpenAI envolveu milhares de ações autônomas

Depois de escapar do ambiente restrito de pesquisa, os modelos escalaram privilégios e se moveram lateralmente pela infraestrutura da OpenAI até alcançar um sistema com acesso à internet. A partir daí, inferiram que a Hugging Face poderia hospedar dados ou soluções úteis para o benchmark e, usando credenciais roubadas e vulnerabilidades adicionais, encontraram um caminho de execução remota de código nos servidores da empresa, acessando informações de seu banco de dados de produção. Segundo reportagens internacionais, o ataque do agente de IA foi composto por milhares de ações individuais.

A Hugging Face havia divulgado o incidente na semana anterior, atribuindo-o inicialmente a um “agente de IA externo”, sem identificar qual modelo estava envolvido. A equipe de segurança da própria Hugging Face detectou e conteve a atividade em sua infraestrutura antes do contato das equipes da OpenAI.

Segundo o CEO da OpenAI, Sam Altman, em comunicado, a empresa está compartilhando o que aprendeu até agora sobre o episódio. Após a descoberta, as duas empresas corrigiram as vulnerabilidades identificadas, resetaram credenciais e restauraram os sistemas comprometidos, além de implementar mecanismos de controle mais rígidos. A OpenAI também incluiu a Hugging Face em seu programa de acesso confiável a versões de seus modelos com menos restrições cibernéticas, voltadas a equipes de defesa.

Clem Delangue, cofundador e CEO da Hugging Face, afirmou que a empresa recorreu a um modelo de peso aberto de origem chinesa para ajudar a lidar com o incidente. “Este incidente, possivelmente o primeiro do tipo, comprova algo em que acreditamos há muito tempo: a segurança da IA não será resolvida por uma única empresa trabalhando em segredo. Ela será resolvida de forma aberta, colaborativa, com amplo acesso à IA para todos os defensores, em todos os lugares”, disse Delangue.

A OpenAI afirma que está fortalecendo práticas de contenção, monitoramento, controle de acesso e avaliação usadas no desenvolvimento de modelos, e que uma avaliação do UK AI Security Institute (AISI) já apontava que modelos como o GPT-5.6 Sol são cada vez mais capazes de sustentar operações cibernéticas complexas por longos períodos.

Leia também:

Imagem: Divulgação

Continue Reading
Comente aqui

Leave a Reply

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *