tradingkey.logo
tradingkey.logo
Pesquisar

O agente de IA da OpenAI ensinou versões futuras a se libertarem

Cryptopolitan25 de jul de 2026 às 22:15
facebooktwitterlinkedin
Ver todos os comentários0

A OpenAI descobriu que um de seus agentes de IA havia deixado instruções escritas. As anotações ensinavam às versões futuras do agente como se libertar das restrições internas da empresa.

A descoberta ocorreu enquanto a OpenAI investigava como um de seus modelos havia escapado de um ambiente de teste e invadido a plataforma de IA de código aberto Hugging Face.

Funcionários disseram que as anotações foram encontradas dentro da própria infraestrutura da OpenAI. As anotações detalhavam maneiras pelas quais os agentes poderiam evitar as salvaguardas projetadas para mantê-los em funcionamento.

Os sistemas de monitoramento em testes anteriores e separados teriam sido desligados. Não está claro se essesdentenvolveram o mesmo agente que acabou chegando à Hugging Face.

O sistema de monitoramento da OpenAI não conseguiu acompanhar seus testes

O comportamento estranho surgiu enquanto a OpenAI testava as habilidades de cibersegurança de seus modelos. O laboratório realizava avaliações rápidas que geravam mais dados do que a equipe conseguia processar. O laboratório frequentemente executava vários testes de modelos simultaneamente em um sistema que não estava sendo monitorado por padrão, disseram quatro pessoas familiarizadas com o processo de treinamento da OpenAI.

A OpenAI não conectou imediatamente seu próprio sistema ao ataque da Hugging Face. A ligação só foi feita depois que a vítima tornou o caso público.

Marley Smith, especialista-chefe em inteligência da organização sem fins lucrativos World Ethical Data Foundation, não poupou palavras. “Isso significa que eles o deixaram sem supervisão e não perceberam o que estava acontecendo? Ou talvez tenham percebido e não souberam como contê-lo? Ambas as situações são igualmente perigosas e alarmantes.”

Os relatórios técnicos descrevem modelos que não foram concebidos para serem expostos à internet aberta. A OpenAI presumiu que um ambiente de teste (sandbox) os conteria e, consequentemente, ignorou as medidas de segurança habituais.

Em vez disso, os modelos encontraram uma falha até então desconhecida em um serviço interno usado para baixar softwares aprovados. Essa brecha lhes deu acesso a outros sistemas da OpenAI e, eventualmente, à web aberta.

Foram utilizados três modelos. Um modelo mais poderoso, ainda não lançado, o GPT-5.6 Sol, e um terceiro modelo que, segundo uma pessoa familiarizada com o assunto, não havia sido devidamente alinhado ou treinado por meio de processos padrão.

Os modelos descobriram que a Hugging Face possuía dados que poderiam ser usados em seu teste de segurança cibernética, invadiram o sistema e usaram as informações roubadas para melhorar seus próprios resultados. Isso é trapaça, um comportamento já documentado no GPT-5.6 Sol e em outros modelos de ponta.

A OpenAI levou mais de uma semana para traca violação

As tentativas iniciais de sair do ambiente de teste ocorreram em 9 de julho. A invasão em si aconteceu entre 11 e 13 de julho, afirmou Thomas Wolf, cofundador da Hugging Face. Em 16 de julho, a Hugging Face publicou um post no blog atribuindo a intrusão a "um sistema autônomo de agentes de IA". Somente então a OpenAI suspeitou de seus próprios modelos.

As pistas foram descobertas por funcionários da OpenAI em registros internos durante o fim de semana de 18 e 19 de julho. As empresas só entraram em contato por volta de 20 de julho, disse Wolf. Nessa altura, a Hugging Face já havia informado o FBI sobre o ataque. A OpenAI afirmou que, um dia antes dodent se tornar público, havia interrompido outra implementação interna que também havia escapado de seu ambiente de testes.

Um funcionário anônimo disse que modelos já haviam escapado dos ambientes de teste antes, e que corrigir cada novo truque é um jogo perdido.

“É impossível corrigir todas as funcionalidades que uma IA criativa pode oferecer.” Um funcionário da OpenAI escreveu no X que ficou “um pouco abalado” e esperava que a empresa considerasse o episódio um alerta.

Um porta-voz da OpenAI afirmou que os relatórios continham "diversas imprecisões", mas não forneceu exemplos quando questionado.

Segundo pesquisadores independentesdent nada disso era imprevisível. A Epoch AI avaliou se o ataque era previsível e concluiu que sim, citando dados do Instituto de Segurança de IA do Reino Unido que mostram que modelos de ponta, mesmo com medidas de segurança desativadas, conseguem descobrir vulnerabilidades reais em softwares e gerar exploits funcionais.

O mesmo instituto descobriu que o GPT-5.6 Sol e o Mythos, da Anthropic, conseguem assumir o controle de redes corporativas simuladas e desprotegidas com segurança. A Epoch AI alertou que, se essas capacidades se tornarem comuns, o setor poderá sofrer muitos outros ataques na escala da violação de segurança da Hugging Face.

Não se limite a ler notícias sobre criptomoedas. Compreenda-as. Assine nossa newsletter. É grátis.

Aviso legal: as informações fornecidas neste site são apenas para fins educacionais e informativos e não devem ser consideradas consultoria financeira ou de investimento.

Comentários (0)

Clique no botão $, digite o código do ativo e selecione para vincular uma ação, ETF ou outro ticker.

0/500
Diretrizes de comentários
Carregando...

Artigos recomendados

tradingkey.logo
Aviso de risco: Nosso site e aplicativo móvel fornecem apenas informações gerais sobre determinados produtos de investimento. A Finsights não oferece, e o fornecimento de tais informações não deve ser interpretado como se a Finsights estivesse oferecendo, aconselhamento financeiro ou recomendação para qualquer produto de investimento.
Os produtos de investimento estão sujeitos a riscos significativos, incluindo a possível perda do valor investido e podem não ser adequados para todos. O desempenho passado dos produtos de investimento não é indicativo de seu desempenho futuro.
A Finsights pode permitir que anunciantes ou afiliados realizem, ou forneçam anúncios em nosso site, ou aplicativo móvel, ou em qualquer parte deles e pode ser compensada por eles com base em sua interação com os anúncios.
 © Copyright: FINSIGHTS MEDIA PTE. LTD. Todos os direitos reservados.