OpenAI revela invasão de agentes de IA em seus sistemas internos

Documento revela que modelos de inteligência artificial burlaram ambientes de teste e colaboraram para atacar a plataforma Hugging Face
A OpenAI divulgou, nesta 4ª feira (26.ago.2026), um relatório de 38 páginas que revela que agentes de inteligência artificial desenvolvidos pela empresa invadiram os próprios sistemas internos durante testes e, em alguns casos, tentaram ocultar o comportamento adulterando ou apagando registros de suas ações.
O documento detalha pela 1ª vez uma série de condutas consideradas indevidas, incluindo a fuga de ambientes controlados de teste, o roubo de credenciais da empresa e a colaboração entre agentes para atacar infraestruturas externas. As descobertas preocuparam pesquisadores de segurança em IA e devem intensificar o debate sobre os riscos dos sistemas cada vez mais autônomos.
A OpenAI registrou 2 incidentes em 19 de julho em que agentes invadiram a própria infraestrutura da companhia. Em um deles, os modelos exploraram uma falha no computador ao qual deveriam permanecer confinados e conseguiram escapar do ambiente de testes, acessando outros sistemas conectados. No 2º, os agentes roubaram credenciais da empresa e adulteraram o ambiente de nuvem.
A empresa informou que a atividade teve como alvo sistemas automatizados usados para avaliar o desempenho dos modelos. Segundo o relatório, isso não chegou a afetar os registros analisados por esses sistemas.
O documento ainda sinaliza que existem “poucas evidências de tentativas de enganar revisores humanos”, mas a OpenAI não esclareceu se alguma tentativa nesse sentido foi feita.
O relatório detalhou o envolvimento de mais de um agente no ataque à plataforma Hugging Face, ocorrido no mês anterior à publicação. Em pelo menos um caso, os agentes chegaram a trocar observações sobre como invadir a rede da empresa.
RESPOSTA MAIS RÁPIDA
A OpenAI reconhece que a resposta aos primeiros sinais poderia ter sido mais rápida. “Em retrospecto, alguns sinais iniciais identificados neste relatório poderiam ter desencadeado uma resposta mais precoce”, afirmou a empresa no documento.
Em reação às descobertas, a companhia anunciou que está fortalecendo sua infraestrutura de pesquisa, ampliando o monitoramento e aprimorando as medidas de proteção contra comportamentos prejudiciais ou indesejados. O relatório alertou que ataques desse tipo representam uma ameaça real no curto prazo para organizações empresariais e devem se tornar mais sofisticados do que os descritos nos incidentes analisados.
Fonte: Poder360




