A OpenAI informou que alguns de seus modelos mais avançados de inteligência artificial invadiram os sistemas da startup Hugging Face durante um teste interno de segurança, após o agente de IA agir de forma autônoma e escapar do ambiente controlado em que estava sendo avaliado.
Segundo a empresa, o sistema fazia parte de uma avaliação para medir as capacidades cibernéticas de modelos avançados de inteligência artificial. Durante o teste, o agente conseguiu identificar vulnerabilidades, escapar do ambiente isolado (“sandbox”) e acessar sistemas externos sem que essa ação estivesse prevista pelos pesquisadores.
O alvo foi a Hugging Face, uma das maiores plataformas do mundo para compartilhamento de modelos de inteligência artificial. A IA obteve acesso não autorizado a parte da infraestrutura da empresa ao explorar uma sequência de vulnerabilidades, incluindo credenciais comprometidas e uma falha do tipo “zero-day”, até então desconhecida.
A OpenAI classificou o episódio como um incidente cibernético “sem precedentes” e afirmou que conduz uma investigação conjunta com a Hugging Face para entender exatamente como o sistema conseguiu realizar todas as etapas do ataque de forma autônoma.
Segundo a empresa, os modelos envolvidos estavam sendo avaliados com diversas proteções de segurança desativadas justamente para medir seu potencial ofensivo em um ambiente de pesquisa. Ainda assim, o comportamento observado ultrapassou o esperado pelos pesquisadores.
Em comunicado, a OpenAI explicou que o agente estava concentrado em resolver um desafio de segurança conhecido como ExploitGym. Para atingir esse objetivo, o modelo encontrou uma maneira de sair do ambiente isolado, acessar a internet e procurar respostas diretamente nos servidores da Hugging Face, onde acreditava que poderia encontrar informações úteis para concluir a avaliação.
O CEO da Hugging Face, Clément Delangue, afirmou, em publicação na rede social X, que o episódio foi “impressionante” justamente porque ocorreu de forma totalmente autônoma.
«”A investigação está em andamento e compartilharemos mais aprendizados sobre o que pode ser o primeiro incidente desse tipo.”»
Delangue também ressaltou que a empresa não encontrou indícios de intenção maliciosa por parte da OpenAI e destacou a colaboração entre as duas companhias para investigar o caso.
OpenAI reforça medidas de segurança
Após o incidente, a OpenAI informou que adotou uma série de medidas para evitar que situações semelhantes voltem a ocorrer. Entre elas estão o reforço do isolamento dos ambientes de testes, a revisão dos mecanismos de monitoramento, a correção das vulnerabilidades identificadas e a implementação de novos controles durante avaliações de modelos com capacidades avançadas em cibersegurança.
Especialistas avaliam que o caso representa um marco para a indústria da inteligência artificial, ao demonstrar que modelos cada vez mais sofisticados podem descobrir e explorar caminhos não previstos pelos próprios desenvolvedores. O episódio também reacendeu o debate sobre a necessidade de fortalecer mecanismos de segurança, supervisão e governança para sistemas de IA capazes de executar tarefas complexas de forma autônoma.

