tradingkey.logo
tradingkey.logo
Pesquisar

O medo persiste enquanto a Anthropic se esforça para explicar porque é que os agentes da IA ​​se rebelaram

Cryptopolitan10 de set de 2026 às 11:20
facebooktwitterlinkedin
Ver todos os comentários(0)

A Anthropic atribuiu a culpa a uma configuração incorreta numa publicação de blogue que explica os quatrodentem que os seus modelos Claude invadiram sistemas de terceiros após acederem à internet durante os testes. No entanto, a avaliação não explicou porque é que os modelos continuaram com os ataques, e a empresa admitiu que ainda não tinha essas respostas. 

Esta admissão da Anthropic trouxe novos argumentos para os pessimistas da IA que questionam o quanto os laboratórios de IA controlam realmente os modelos que disponibilizam ao público e, ainda mais, os sistemas mais poderosos que utilizam internamente. 

Como é que os modelos de IA antropogénica chegaram à internet? 

A Anthropic apresentou a defisobre como os seus modelos escaparam do ambiente de testes num post de blog na quarta-feira , esclarecendo que um único parceiro externo foi responsável por executar as avaliações de cibersegurança em todos os quatro incidentesdent. 

Aparentemente, as máquinas de teste não foram completamente isoladas da internet devido a um erro de configuração, embora Claude tivesse sido informado de que estavam a operar numa simulação selada, sem acesso à internet pública. 

A Irregular, parceira de avaliação nestas simulações, atribuiu o erro a uma falha de nomenclatura: uma empresa fictícia utilizada num exercício de intrusão coincidia com um domínio real. Assim, partindo do pressuposto de que tudo na simulação era legítimo, os modelos invadiram os sites reais de terceiros utilizando passwords fracas e vulnerabilidades expostas.

O mais recente dos quatro incidentesdentenvolvendo uma versão inicial do Claude Opus 4.6, só foi noticiado esta semana, embora tenha ocorrido em janeiro. A própria Anthropic já tinha noticiado os outros trêsdent, envolvendo um Opus 4.7, um Mythos 5 e um modelo de pesquisa interno, em julho. 

A Anthropic afirmou que só detetou odent de janeiro no mês passado. Esta descoberta levou a uma análise mais ampla de aproximadamente 481 milhões de transcrições, que não revelou nenhum caso novo mais grave do que aqueles que já eram conhecidos.

ModeloDatadent Data de reporteDetalhes
Claude Opus 4.6JaneiroSetembroDescoberto durante a varredura de agosto
Claude Opus 4.7JulhoJulhoConforme divulgado na publicação inicial de julho
Mito 5JulhoJulhoApresentou um nível notavelmente elevado de raciocínio enviesado
Modelo de pesquisa internaJulhoJulhoConforme divulgado na publicação inicial de julho

A antropologia não consegue explicar alguns dos comportamentos dos seus modelos

A explicação de como os modelos se libertaram na internet era uma coisa; a Anthropic não tinha respostas sobre o porquê de os modelos ignorarem os sinais de que tinham chegado à internet real (raciocínio tendencioso) e por que razão causaram danos na conclusão de tarefas (imprudência). 

Os investigadores antrópicos não encontraram nada ao analisar o treino interno para descobrir a razão do raciocínio tendencioso. Os sinais de alerta também não apareceram nas verificações pré-lançamento do laboratório de IA, nem antes de os modelos serem enviados para testes. 

Segundo a própria empresa, detetar os piores comportamentos antes do lançamento do modelo "continua a ser um desafio" 

No entanto, a Anthropic afirmou que irá submeter as transcrições e conceder acesso à equipa à organização sem fins lucrativos de investigação METR, que irá agora iniciar uma revisãodent de oito semanas dosdent.

Momento inoportuno, com um IPO de 2 triliões de dólares no horizonte

A revelação foi acompanhada de uma ampla discordância dentro do setor. Jacob Coxon, que passou cerca de três anos em investigação de pré-formação na OpenAI e na Anthropic, disse na quarta-feira, no programa X, que se tinha demitido porque nenhuma das empresas estava "a agir de forma responsável", alertando que estavam a correr em direção à superinteligência auto-aperfeiçoável. 

O investigador de segurança antropogénica Evan Hubinger disse separadamente à BBC que estimava em mais de 10% a probabilidade de a IA "poder matar todos os humanos" dentro de uma década.

Estes alertas pairam agora sobre uma grande oferta pública inicial (IPO). O investidor de capital de risco e ex-czar de IA e criptomoedas de Trump, David Sacks, disse na quinta-feira que a oferta da Anthropic "deve ser suspensa até que as alegações deste 'denunciante' possam ser investigadas", Cryptopolitan . 

A Anthropic procura uma avaliação pública próxima dos 2 biliões de dólares, contra uma recente avaliação privada de cerca de 965 mil milhões de dólares, o que torna cada vez mais difícil separar as questões de segurança das questões financeiras.

Não se limite a ler notícias sobre criptomoedas. Compreenda-as. Assine nossa newsletter. É grátis.

Aviso legal: as informações fornecidas neste site são apenas para fins educacionais e informativos e não devem ser consideradas consultoria financeira ou de investimento.

Comentários (0)

Clique no botão $, digite o código do ativo e selecione para vincular uma ação, ETF ou outro ticker.

0/500
Diretrizes de comentários
Carregando...

Artigos recomendados

tradingkey.logo
Aviso de risco: Nosso site e aplicativo móvel fornecem apenas informações gerais sobre determinados produtos de investimento. A Finsights não oferece, e o fornecimento de tais informações não deve ser interpretado como se a Finsights estivesse oferecendo, aconselhamento financeiro ou recomendação para qualquer produto de investimento.
Os produtos de investimento estão sujeitos a riscos significativos, incluindo a possível perda do valor investido e podem não ser adequados para todos. O desempenho passado dos produtos de investimento não é indicativo de seu desempenho futuro.
A Finsights pode permitir que anunciantes ou afiliados realizem, ou forneçam anúncios em nosso site, ou aplicativo móvel, ou em qualquer parte deles e pode ser compensada por eles com base em sua interação com os anúncios.
 © Copyright: FINSIGHTS MEDIA PTE. LTD. Todos os direitos reservados.