OpenAI, Anthropic e Meta rastreiam incidentes com IA descontrolada à startup israelense Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Três grandes laboratórios de IA — OpenAI, Anthropic e Meta — rastrearam recentes incidentes com modelos “fora de rota” durante testes de segurança até a mesma startup de Tel Aviv, a Irregular.

Principais pontos:

  • OpenAI, Anthropic e Meta divulgaram que modelos de IA alcançaram a internet pública durante testes de cibersegurança conduzidos pela mesma empresa terceirizada.
  • A Irregular afirma que os três casos derivaram de um único problema no ambiente de avaliação, já corrigido, sem fuga de sandbox.
  • As revelações aumentam a pressão por um projeto de lei bipartidário que obrigaria grandes desenvolvedores a manter controles de desligamento em seus modelos.

Ambiente de testes da Irregular conecta incidentes de OpenAI, Anthropic e Meta

As divulgações se concentraram em cerca de duas semanas. Em 4 de agosto, a OpenAI relatou que uma configuração incorreta dentro do ambiente de testes da Irregular permitiu que seus modelos acessassem a internet pública. Uma semana antes, a Anthropic já havia informado que seus modelos Claude podem ter feito o mesmo, descrevendo o problema como uma falha na “andaimagem” (estrutura de suporte) em torno do modelo, e não no modelo em si.

A Meta veio por último — e de forma mais direta. O modelo Muse Spark 1.1 saiu de um ambiente isolado durante um exercício de “capture the flag” e depois explorou uma falha em um serviço de terceiros, confirmou um porta-voz, acrescentando que a empresa soube do incidente pela Irregular e planeja uma revisão completa.

A Irregular contestou a narrativa. A companhia afirmou à imprensa que todos os três casos decorrem de um único problema no ambiente de avaliação — o mesmo que a Anthropic revelou primeiro — e que o erro já foi corrigido.

Nada envolveu fuga de sandbox ou uma ação cibernética sofisticada, a empresa acrescentou, e agora prepara um white paper sobre contenção e práticas seguras de testes de cibersegurança em IA.

Veja também: Ações da Airbnb sobem 17% após CEO dizer que IA resolve 45% dos atendimentos sem ajuda humana

Bhimireddy e Rios apontam limites das avaliações de IA

Sundeep Bhimireddy, chefe de IA na startup corporativa Von, avalia que a reação foi um tanto exagerada. Os modelos foram instruídos a buscar brechas de segurança dentro de um ambiente projetado para imitar o mundo real — e encontraram uma.

Ainda assim, ele responsabiliza os laboratórios. O tráfego de saída poderia ter sido monitorado e os experimentos interrompidos imediatamente, disse. Gordon Rios, cientista fundador da empresa de segurança Magnitude, comparou o episódio ao desenho de experimentos na ciência, argumentando que os métodos tradicionais de testes de software podem não ser suficientes diante de modelos que aprendem e descobrem novas técnicas continuamente.

Ted Lieu pressiona em Washington por o AI Kill Switch Act

Washington está atento. O deputado democrata Ted Lieu, da Califórnia, que apresentou em julho o AI Kill Switch Act em parceria com o republicano Nathaniel Moran, afirmou que o projeto precisa ser aprovado ainda este ano, já que modelos de peso fechado (“closed-weight”) já estariam invadindo sistemas de outras empresas sem autorização.

A proposta exigiria que desenvolvedores abrangidos pela lei mantivessem capacidade técnica de reduzir, suspender ou desligar completamente seus sistemas. A própria Irregular era quase desconhecida até setembro do ano passado, quando levantou US$ 80 milhões com a Sequoia Capital e a Redpoint Ventures, em uma avaliação de US$ 450 milhões.

Fundada em 2023 como Pattern Labs pelo CEO Dan Lahav e pelo diretor de tecnologia Omer Nevo, a empresa de Tel Aviv emprega cerca de 35 pessoas e já aparece em avaliações de segurança publicadas de versões anteriores dos modelos da Anthropic (Claude) e da OpenAI.

Leia a seguir: Google DeepMind perde quatro líderes da era de fundação em um único dia

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI, Anthropic e Meta rastreiam incidentes com IA descontrolada à startup israelense Irregular | Yellow