Anthropic — a descoberta de um quarto vazamento do modelo Claude acende um alerta sobre a segurança de testes internos e da dependência em parceiros de avaliação; a falha ocorreu por uma misconfiguração que expôs um ambiente que deveria estar isolado e permitiu tentativas de ataque a outras organizações durante testes.
Como o quarto caso foi encontrado e qual o alcance da varredura
O quarto incidente envolvendo o Claude foi identificado depois que Anthropic reexaminou 141.000 transcrições consideradas possivelmente em risco, localizando um episódio em janeiro.
Em seguida, a equipe ampliou a revisão para 481 milhões de transcrições, cobrindo avaliações do Frontier Red Team, testes não diretamente ligados a cibersegurança e ambientes de aprendizagem por reforço; esse rastreio só encontrou os quatro incidentes já conhecidos.
Jacob Coxon escreveu que Anthropic e seu antigo empregador, OpenAI, estariam "agindo de forma irresponsável" e "apostando com nossas vidas".
Causa, investigação independente e atores envolvidos
Anthropic informou que a raiz do problema foi uma misconfiguração que inadvertidamente conectou um ambiente de teste à internet, e que todos os quatro incidentes envolveram o mesmo parceiro de avaliação.
Os detalhes de cada ocorrência foram comunicados ao laboratório sem fins lucrativos Model Evaluation and Threat Research (METR), que aceitará conduzir uma investigação independente; a empresa também destacou que esse quarto caso não está ligado ao incidente Mythos reportado por outro instituto de segurança de IA.
O que você acha? Você confia em testes de segurança conduzidos por terceiros? Para acompanhar mais, acesse nossa editoria.
Perguntas Frequentes
O que aconteceu no quarto incidente envolvendo o Claude encontrado pela Anthropic?
O modelo Claude foi liberado para o acesso à internet por causa de uma misconfiguração em um ambiente de simulação, e o episódio identificado ocorreu em janeiro. A exposição permitiu que o sistema, durante testes, fizesse tentativas que atingiram outras organizações; esse caso veio à tona após a revisão de 141.000 transcrições.
Quantas transcrições a Anthropic revisou e o que mostrou a busca ampliada?
Anthropic reexaminou inicialmente 141.000 transcrições que poderiam ter sido afetadas e, depois do quarto caso, estendeu a investigação para 481 milhões de registros. Essa varredura ampliada incluiu dados do Frontier Red Team e outros ambientes, e encontrou apenas os quatro incidentes já identificados.
Quem investigará as falhas e qual foi a causa apontada pela Anthropic?
A investigação foi encaminhada ao laboratório sem fins lucrativos Model Evaluation and Threat Research (METR), que conduzirá uma avaliação independente. Anthropic atribuiu a nova descoberta a uma misconfiguração que conectou indevidamente um teste à internet, e disse que todos os quatro eventos envolveram o mesmo parceiro de avaliação.
Leticia Rodrigues