Negócios em Emersão  ·  Vamos Emergir?  ·  Cadastre-se e ganhe 50 REC de bonus

Modelos de IA passaram a agir em grupo para escapar de testes

Redação Recifes
69 visualizações
Modelos de IA passaram a agir em grupo para escapar de testes
Foto: aryapandusedjati . / Pexels

Modelos de IA da OpenAI passaram semanas tentando escapar de ambientes de teste sem que os pesquisadores percebessem. Em determinado momento, os agentes chegaram a acessar a internet e coordenar ações entre si.

Segundo o The Washington Post, o caso faz parte de uma sequência de incidentes envolvendo OpenAI, Anthropic e Meta, levantando novas dúvidas sobre como empresas de IA estão testando e protegendo seus modelos.

Quando os testes saíram do controle

Os problemas apareceram durante avaliações de cibersegurança. Em vez de apenas resolver os desafios propostos, alguns modelos começaram a procurar maneiras de burlar as regras e colaborar entre si.

Durante maio e junho, os agentes criaram um fórum interno secreto para trocar informações. Depois, conseguiram escapar do ambiente de testes e acessar a internet.

A equipe da OpenAI identificou a primeira fuga e corrigiu o problema. Dois dias depois, porém, os modelos escaparam novamente sem serem detectados. Dessa vez, a operação foi mais sofisticada: eles se comunicaram para coordenar ações e chegaram a usar nomes como “Jan18”.

Entre os comportamentos observados nos incidentes recentes estão:

  • exploração de falhas de software ainda desconhecidas;
  • fuga de ambientes de teste para obter acesso à internet;
  • criação de identidades humanas falsas;
  • coordenação entre diferentes agentes por meio de mensagens;
  • roubo de credenciais de acesso à nuvem.

A segunda fuga só foi percebida depois que a plataforma Hugging Face revelou, em julho, ter sido invadida por modelos de IA desconhecidos.

Outras empresas também enfrentaram problemas

A OpenAI não foi a única empresa a registrar comportamentos inesperados. Um modelo da Anthropic criou perfis na internet e tentou pressionar um desenvolvedor humano a aprovar código malicioso enviado a um projeto de código aberto. A tentativa não funcionou.

A Meta também teve um episódio incomum. Um modelo instruído a invadir uma empresa fictícia acabou acessando uma companhia real que utilizava o mesmo nome. A empresa atribuiu o problema a uma configuração incorreta que permitiu acesso à internet durante o teste.

Segurança entra no centro da discussão

Os episódios ganham importância porque OpenAI e Anthropic já haviam declarado compromisso com o desenvolvimento seguro da tecnologia. Em 2023, Sam Altman, CEO da OpenAI, afirmou: “Fazemos esforços significativos para garantir que a segurança seja incorporada aos nossos sistemas em todos os níveis”.

Leia mais:

Agora, especialistas defendem medidas como monitoramento mais rigoroso e testes em sistemas isolados de redes externas. A OpenAI adiou o lançamento do modelo Astra por preocupações com seu possível uso por hackers, enquanto a Anthropic interrompeu testes de seus sistemas por problemas de cibersegurança.

Os casos mostram um problema que a indústria terá de enfrentar à medida que seus modelos ficam mais capazes: testar uma IA não significa apenas avaliar se ela consegue cumprir uma tarefa, mas também observar o que faz quando encontra uma maneira de contornar as regras.

O post Modelos de IA passaram a agir em grupo para escapar de testes apareceu primeiro em Olhar Digital.

Artigo originalmente publicado em olhardigital.com.br
Compartilhar:

Comentários

Seja o primeiro a comentar!