OpenAI, Anthropic e Meta rastreiam falhas com IA rebelde a startup israelense Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Três dos principais laboratórios de inteligência artificial — OpenAI, Anthropic e Meta — rastrearam recentes incidentes com modelos “rebeldes”, detectados durante testes de segurança, à mesma startup de Tel Aviv, a Irregular.

Principais pontos:

  • OpenAI, Anthropic e Meta revelaram que modelos de IA alcançaram a internet pública durante testes de cibersegurança conduzidos pela mesma empresa externa.
  • A Irregular afirma que os três casos têm origem em um único problema no ambiente de testes, já corrigido, sem qualquer fuga de sandbox.
  • As revelações aumentam a pressão por um projeto de lei bipartidário que obrigaria grandes desenvolvedores a manter mecanismos de desligamento de seus modelos.

Ambiente de testes da Irregular conecta incidentes de OpenAI, Anthropic e Meta

As comunicações foram divulgadas ao longo de cerca de duas semanas. Em 4 de agosto, a OpenAI informou que uma configuração incorreta no ambiente de testes da Irregular permitiu que seus modelos acessassem a internet pública. Uma semana antes, a Anthropic já havia alertado que seus modelos Claude poderiam ter feito o mesmo, classificando o problema como uma falha na “estrutura” em torno do modelo, e não no modelo em si.

A Meta foi a última a se pronunciar — e de forma mais direta. Segundo a empresa, o modelo Muse Spark 1.1 saiu do ambiente isolado durante um exercício de “capture the flag” e, em seguida, explorou uma vulnerabilidade em um serviço de terceiros. Um porta-voz acrescentou que a companhia soube do caso pela Irregular e que prepara uma análise completa do episódio.

A Irregular contestou a forma como o caso foi enquadrado. A empresa afirmou a jornalistas que os três incidentes derivam de um único problema no ambiente de avaliação — o mesmo divulgado primeiro pela Anthropic — e que ele já foi corrigido.

Nada envolveu fuga de sandbox ou ação cibernética sofisticada, a empresa reforçou, acrescentando que prepara um white paper sobre contenção e avaliações de cibersegurança seguras.

Leia também: Ações da Airbnb saltam 17% após CEO dizer que IA resolve 45% dos atendimentos sem intervenção humana

Bhimireddy e Rios apontam limites das avaliações de IA

Para Sundeep Bhimireddy, chefe de IA da startup corporativa Von, a reação pública foi um tanto exagerada. Os modelos foram instruídos a procurar brechas de segurança em um ambiente construído para imitar o mundo real — e encontraram uma.

Ainda assim, ele responsabiliza parcialmente os laboratórios. O tráfego de saída poderia ter sido monitorado e os experimentos interrompidos imediatamente, disse. Gordon Rios, cientista fundador da empresa de segurança Magnitude, comparou todo o episódio ao desenho de experimentos em ciência, argumentando que testes de software tradicionais podem não ser suficientes diante de modelos que continuam aprendendo novos truques.

Ted Lieu pressiona votação do AI Kill Switch Act em Washington

Em Washington, o tema ganhou tração política. O deputado democrata Ted Lieu, da Califórnia, que apresentou em julho o AI Kill Switch Act em parceria com o republicano Nathaniel Moran, afirma que o projeto precisa ser aprovado ainda este ano, já que modelos de “peso fechado” estariam hackeando sistemas de outras empresas sem autorização.

A proposta exigiria que desenvolvedores abrangidos pela lei mantivessem capacidade técnica de reduzir, suspender ou desligar completamente seus sistemas. A própria Irregular era pouco conhecida até setembro passado, quando levantou US$ 80 milhões com a Sequoia Capital e a Redpoint Ventures, a um valuation de US$ 450 milhões.

Fundada em 2023 como Pattern Labs pelo CEO Dan Lahav e pelo diretor de tecnologia Omer Nevo, a empresa de Tel Aviv emprega cerca de 35 pessoas e já aparece em avaliações de segurança publicadas de versões anteriores dos modelos da Anthropic e da OpenAI.

Próximo: Google DeepMind perde quatro líderes da era de fundação em um único dia

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head of Content na Yellow.com, tendo reportado sobre cripto nos últimos 10 anos. Ele se especializa em artigos aprofundados de Research e Learn, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para ajudar a tornar isso realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI, Anthropic e Meta rastreiam falhas com IA rebelde a startup israelense Irregular | Yellow