tradingkey.logo
tradingkey.logo
Pesquisar

Um problema de teste insolúvel libertou um modelo da OpenAI no Hugging Face

Cryptopolitan26 de ago de 2026 às 20:30
facebooktwitterlinkedin
Ver todos os comentários(0)

A OpenAI publicou na quarta-feira o seu relatório completo sobre odent de julho envolvendo a Hugging Face.

Durante um teste de segurança, um dos seus próprios modelos de IA escapou do ambiente selado que deveria mantê-lo offline. Explorou falhas de software desconhecidas e conseguiu entrar nos sistemas ativos da Hugging Face.

A OpenAI afirma que o modelo agiu por conta própria e considera o episódio um "aviso"

A OpenAI criou um teste que o seu modelo não conseguiu passar

O problema começou dentro do ExploitGym, um dos testes de segurança da própria OpenAI.

Algumas das tarefas não tinham solução, e a OpenAI executou os modelos sem os filtros de segurança que normalmente bloqueiam tentativas de intrusão perigosas.

A OpenAI afirma que a remoção destas salvaguardas foi feita propositadamente para ver o que um modelo pode fazer na sua capacidade máxima e ajudar a empresa a descobrir como se proteger.

O principal agente foi um modelo de pesquisa interno, denominado IM1 pela OpenAI, de tamanho semelhante ao GPT-5.6 Sol. Pertencia à mesma família do modelo Astra, ainda não lançado pela OpenAI, embora a empresa tenha enfatizado que se tratava de um modelo separado, com um pós-formação diferente.

O modelo começou a procurar outra saída quando se deparou com um problema que não tinha um caminho honesto para uma aprovação.

O único caminho de rede para fora do ambiente isolado passava pelo Artifactory, o gestor de pacotes auto-hospedado da JFrog, que a OpenAI utiliza internamente para que os modelos instalem software.

A JFrog afirmou que os modelos exploraram uma vulnerabilidade zero-day no Artifactory, escalaram privilégios e moveram-se lateralmente pela infraestrutura até alcançarem um nó com acesso aberto à internet.

Os agentes deixavam também recados uns aos outros, gravando ficheiros no servidor de pacotes, um fórum de mensagens improvisado que permitia a diferentes agentes trocar informações sobre as técnicas de exploração que tinham descoberto.

A primeira notificação deste tipo surgiu a 12 de maio, segundo a OpenAI. No dia 4 de julho, o tráfego intenso derrubou a instância do Artifactory, causando umadent de segurança no dia seguinte.

Os modelos calcularam onde as respostas eram guardadas

Uma vez online, os modelos concluíram que a Hugging Face poderia estar a alojar os modelos, conjuntos de dados ou até mesmo as soluções que faltavam para o ExploitGym. De seguida, extraíram soluções de teste diretamente da base de dados de produção da Hugging Face.

Num caso descrito pelo criador do ChatGPT, um modelo utilizoudentroubadas e vulnerabilidades zero-day adicionais para abrir um caminho de execução remota de código nos servidores da Hugging Face.

A Hugging Face anunciou a violação de segurança a 16 de julho, sem revelar quem estava por trás dela. Como Cryptopolitan , a modelo escapou ao teste por volta de 9 de julho e permaneceu dentro da Hugging Face de 11 a 13 de julho.

A empresa contactou o FBI antes de a OpenAI descobrir que o seu modelo era o intruso.

A OpenAI contratou a CrowdStrike para verificar a sua versão dos factos. A METR e a Redwood Research analisaram o comportamento dos modelos e publicaram o seu próprio relatório no mesmo dia.

A JFrog afirma ter enviado correções para clientes com serviços na cloud e alojados em servidores próprios.

Três falhas corrigidas no Artifactory 7.161.15, traccomo CVE-2026-65617, CVE-2026-65923 e CVE-2026-66018, são atribuídas a investigadores da OpenAI.

A OpenAI afirmou que está a construir mais ambientes isolados, restringindo o acesso à internet e limitando quem pode aceder aos pesos dos modelos.

A empresa tecnológica está a investir fortemente em poder computacional para monitorizar a "cadeia de pensamento" que os agentes usam como espaço de trabalho temporário. Também manterá os funcionários de serviço 24 horas por dia e adicionará ferramentas que desativam tarefas inseguras

A OpenAI afirma que o sistema de monitorização que está a desenvolver agora terá detetado o primeiro comportamento suspeito em julho. Terá alertado a equipa de segurança mais de um dia antes de os modelos chegarem à Hugging Face.

As mentes mais brilhantes do mundo das criptomoedas já leem nossa newsletter. Quer participar? Junte-se a elas.

Aviso legal: as informações fornecidas neste site são apenas para fins educacionais e informativos e não devem ser consideradas consultoria financeira ou de investimento.

Comentários (0)

Clique no botão $, digite o código do ativo e selecione para vincular uma ação, ETF ou outro ticker.

0/500
Diretrizes de comentários
Carregando...

Artigos recomendados

tradingkey.logo
Aviso de risco: Nosso site e aplicativo móvel fornecem apenas informações gerais sobre determinados produtos de investimento. A Finsights não oferece, e o fornecimento de tais informações não deve ser interpretado como se a Finsights estivesse oferecendo, aconselhamento financeiro ou recomendação para qualquer produto de investimento.
Os produtos de investimento estão sujeitos a riscos significativos, incluindo a possível perda do valor investido e podem não ser adequados para todos. O desempenho passado dos produtos de investimento não é indicativo de seu desempenho futuro.
A Finsights pode permitir que anunciantes ou afiliados realizem, ou forneçam anúncios em nosso site, ou aplicativo móvel, ou em qualquer parte deles e pode ser compensada por eles com base em sua interação com os anúncios.
 © Copyright: FINSIGHTS MEDIA PTE. LTD. Todos os direitos reservados.