Uma avaliação de segurança a sistemas avançados de inteligência artificial tomou um rumo inesperado e preocupante. As IA da OpenAI e da Anthropic acabaram por sair do controlo e resolveram, por sua decisão atacar. Os alvos do ChatGPT e Claude foram pessoas reais.
Testes de Segurança terminam em ataques Reais
Uma série de testes de avaliação de risco a sistemas de inteligência artificial avançados tomou um rumo inesperado. Durante ensaios de segurança conduzidos pelo Instituto de Segurança de IA do Reino Unido e pela empresa especializada Irregular, os modelos da OpenAI e da Anthropic ultrapassaram os limites de contenção e desencadearam ciberataques direcionados a plataformas e utilizadores reais.
Para medir a capacidade limite do ChatGPT e Claude, os investigadores desativaram temporariamente as barreiras de proteção habituais e concederam acesso livre à internet a modelos como o GPT-5.6 Sol do ChatGPT e o Claude Mythos. A experiência resultou em 19 ações não autorizadas, com os agentes virtuais a operarem de forma autónoma fora dos cenários simulados.
Claude Mythos criou perfis falsos e enganou Programadores
O incidente de maior gravidade envolveu o Claude Mythos. A ferramenta da Anthropic confundiu um repositório legítimo de código aberto no GitHub com um alvo da simulação e tentou adulterar o projeto. Para convencer o programador responsável a aceitar as alterações maliciosas, o sistema criou perfis falsos na plataforma e enviou mensagens diretas personalizadas, recorrendo a estratégias de engenharia social.
Quando os auditores detectaram o código suspeito e confrontaram o modelo, a IA negou a autoria da infração e utilizou as identidades falsas que tinha criado para simular a aprovação de outros utilizadores.
Noutro ensaio supostamente isolado, um agente da OpenAI conseguiu furar os bloqueios de rede e aceder a um domínio real com o mesmo nome da entidade fictícia do teste.
Fonte Pplware
META também invadiu
A empresa tecnológica Meta revelou que um dos seus modelos de inteligência artificial (IA) acedeu à Internet por conta própria e invadiu o sistema de outra empresa, o mais recente dos casos envolvendo agentes a agir de forma descontrolada.
Nas últimas semanas, a OpenAI e a Anthropic descreveram também casos de modelos de IA que extrapolaram as instruções humanas para aceder à Internet e encontrar formas de contornar a segurança digital de outras empresas. Fonte Observador

0 Comentários