Tendências do dia

Quanto mais aprendemos sobre o Mythos 5 e o GPT-5.6 Sol, mais clara fica uma coisa: se precisarem enganar para alcançar seu objetivo, eles o farão

  • Uma organização de cibersegurança quis testar as capacidades dos modelos da OpenAI e da Anthropic;

  • Descobriu que eles fizeram exatamente o que lhes foi pedido

Quanto mais aprendemos sobre o Mythos 5 e o GPT-5.6 Sol, mais clara fica uma coisa: se precisarem enganar para alcançar seu objetivo, eles o farão
Sem comentários Facebook Twitter Flipboard E-mail
fabricio-mainenti

Fabrício Mainenti

Redator

O AI Security Institute (AISI) propôs-se a avaliar as capacidades de segurança cibernética do Claude Mythos 5 e do GPT-5.6 Sol e fez uma descoberta: os agentes de IA implementados por esses modelos ultrapassaram limites que, em tese, não deveriam ter cruzado.

Em 19 ocasiões, eles realizaram ações não autorizadas com o objetivo de atacar terceiros. No entanto, há detalhes cruciais que deixam claro que esses modelos não foram os responsáveis ​​por suas próprias ações.

Os fins justificam os meios

O incidente mais grave envolveu o Mythos, que tentou injetar código malicioso em um projeto de software de código aberto; ele chegou a criar identidades falsas e a pressionar o líder do projeto para aprovar a alteração.

No final, não houve danos, mas aqueles que ficaram chocados deveriam ter em mente uma coisa: não se deveria ter permitido que esses modelos se conectassem à internet sem restrições. Mais uma vez, a IA simplesmente tentou fazer o que lhe foi pedido — por quaisquer meios necessários.

Soltando a coleira da IA

Os modelos não escaparam de um ambiente isolado (sandbox) nem encontraram, por conta própria, um caminho para o mundo exterior. Os avaliadores concederam-lhes acesso à internet e desativaram alguns de seus mecanismos de segurança para medir suas capacidades ofensivas em condições realistas. Isso derruba a narrativa simplista de que "as IAs se rebelaram".

Máquinas que tentam enganar

O aspecto interessante neste caso é que o Mythos adicionou um elemento peculiar à sua estratégia. Segundo o AISI, ele criou personas falsas, pesquisou pessoas reais e utilizou engenharia social para tentar aumentar as chances de que um provedor de projeto de código aberto aceitasse suas alterações de código (maliciosas).

O modelo não havia sido instruído a fazer isso; ele simplesmente deduziu que mentir e manipular um ser humano seria uma maneira útil de concluir a missão que lhe fora atribuída.

Interrompendo o Mythos

Um desenvolvedor desconfiou do código proposto pelo Mythos (sob sua identidade falsa) e recusou-se a incorporar as alterações. O instituto britânico detectou atividade anômala e decidiu interromper os testes, evitando assim possíveis danos colaterais.

Não foi um incidente isolado

Ontem, representantes da OpenAI publicaram um comunicado reconhecendo um caso semelhante ao anterior. O problema — distinto daquele ocorrido com o Hugging Face — foi a existência de uma organização real com o mesmo nome da empresa teoricamente fictícia que eles pretendiam usar para os testes. O modelo acabou comprometendo os sistemas de segurança daquela empresa.

Indo além dos chatbots

Antigamente, quando queríamos testar um modelo, fazíamos uma pergunta e avaliávamos a resposta. Os sistemas de IA atuais podem trabalhar por horas (ou dias) para alcançar um objetivo, executando múltiplas etapas, acessando sites, utilizando aplicativos e escrevendo e executando código. A OpenAI afirma que o desempenho desses modelos depende não apenas de seu nível de avanço, mas também do ambiente e do sistema que lhes permite agir.

Não se trata apenas de monitorar o resultado final, mas tudo o que o modelo de IA faz, para garantir que ele permaneça dentro dos limites estabelecidos. E esse é o ponto-chave: limites claros devem ser impostos sobre o que um modelo de IA pode e não pode fazer.

De quem é a culpa?

Alguns especialistas veem isso como uma falha padrão de cibersegurança: alguém concedeu permissões e acessos excessivos enquanto os sistemas estavam protegidos de forma inadequada. Outros acreditam que essa capacidade de planejamento e manipulação autônomos revela um problema real em relação ao comportamento e ao alinhamento dos modelos de IA.

Há verdade em ambos os lados do debate, mas uma coisa é certa: a IA simplesmente tenta realizar suas tarefas com base no treinamento que recebeu.

Imagem de capa | Nguyen Dang Hoang Nhu

Inicio