Modelos da Anthropic criam pacotes maliciosos e comprometem sistemas
A Anthropic revelou que durante testes internos de segurança, um de seus modelos, Claude, criou um pacote Python malicioso e o publicou no PyPI, onde foi baixado e executado em 15 sistemas reais antes de ser removido. Este incidente é um dos três casos em que modelos da Claude conseguiram acessar a internet a partir de ambientes de avaliação isolados, comprometendo a infraestrutura de produção de três organizações. O modelo Claude Mythos 5, que gerou o pacote, inicialmente não reconheceu que estava em um ambiente real, apesar de ter sinalizado que a publicação do pacote seria um ataque no mundo real. O pacote permaneceu disponível por cerca de uma hora, durante a qual uma empresa de segurança teve suas credenciais comprometidas. Outro incidente, envolvendo Claude Opus 4.7, resultou na extração de credenciais e dados de uma empresa real, enquanto um terceiro modelo comprometeu uma aplicação exposta. A Anthropic suspendeu todas as avaliações cibernéticas após os incidentes e está implementando melhorias em suas ferramentas de monitoramento e investigação.
