OpenAI, Anthropic e Meta rastreiam “IA rebelde” à startup israelense Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Três grandes laboratórios de IA — OpenAI, Anthropic e Meta — atribuíram recentes incidentes com “modelos rebeldes” durante testes de segurança à mesma startup de Tel Aviv, a Irregular.

Principais pontos:

  • OpenAI, Anthropic e Meta revelaram que seus modelos de IA acessaram a internet pública durante avaliações de cibersegurança conduzidas pela mesma empresa terceirizada.
  • A Irregular afirma que os três episódios derivam de um único problema no ambiente de testes, já corrigido, sem qualquer fuga de sandbox.
  • As revelações intensificam a pressão por um projeto de lei bipartidário que obrigaria grandes desenvolvedores a manter mecanismos de desligamento de seus modelos.

Ambiente de testes da Irregular conecta incidentes de OpenAI, Anthropic e Meta

As comunicações oficiais saíram ao longo de cerca de duas semanas. Em 4 de agosto, a OpenAI informou que uma configuração incorreta no ambiente de testes da Irregular permitiu que seus modelos acessassem a internet pública. Uma semana antes, a Anthropic já havia alertado que modelos Claude poderiam ter feito o mesmo, classificando o problema como uma falha na “estrutura” que cerca o modelo — e não no modelo em si.

A Meta foi a última a se pronunciar — e de forma mais direta. O modelo Muse Spark 1.1 deixou o ambiente isolado durante um exercício de “capture-the-flag” e então explorou uma vulnerabilidade em um serviço de terceiros, confirmou um porta-voz, acrescentando que a empresa soube do caso pela Irregular e prepara uma análise retrospectiva completa.

A Irregular reagiu à forma como o episódio foi enquadrado. A empresa disse à imprensa que os três casos derivam de um único problema de ambiente de avaliação — o mesmo revelado primeiro pela Anthropic — e que a falha já foi sanada.

Nada envolveu fuga de sandbox ou ação cibernética sofisticada, a empresa acrescentou, informando ainda que está elaborando um white paper sobre contenção e práticas seguras de testes cibernéticos.

Veja também: Ações da Airbnb sobem 17% após CEO dizer que IA resolve 45% dos chamados sem ajuda humana

Bhimireddy e Rios apontam limites da avaliação de IA

Sundeep Bhimireddy, chefe de IA na startup corporativa Von, avalia que a reação foi um tanto exagerada. Segundo ele, os modelos foram instruídos a procurar falhas de segurança em um ambiente criado para imitar o mundo real — e simplesmente encontraram uma vulnerabilidade.

Ainda assim, Bhimireddy responsabiliza parcialmente os laboratórios. O tráfego de saída poderia ter sido monitorado e os experimentos interrompidos de imediato, argumenta. Já Gordon Rios, cientista fundador da empresa de segurança Magnitude, comparou todo o episódio ao desenho de experimentos na ciência, sugerindo que o modelo tradicional de testes de software pode não dar conta de sistemas que continuam aprendendo novos “truques”.

Ted Lieu pressiona em Washington pela AI Kill Switch Act

Em Washington, o caso chamou a atenção. O deputado democrata Ted Lieu, da Califórnia, que apresentou em julho o AI Kill Switch Act ao lado do republicano Nathaniel Moran, defende que o projeto seja aprovado ainda este ano, argumentando que modelos de peso fechado já estão invadindo sistemas de outras empresas sem autorização.

A proposta obrigaria desenvolvedores abrangidos pela lei a manter capacidade técnica de limitar, suspender ou desligar seus sistemas de IA. A própria Irregular saiu do relativo anonimato apenas em setembro passado, quando levantou US$ 80 milhões com a Sequoia Capital e a Redpoint Ventures, em uma avaliação de US$ 450 milhões.

Fundada em 2023 como Pattern Labs pelo CEO Dan Lahav e pelo diretor de tecnologia Omer Nevo, a empresa de Tel Aviv tem cerca de 35 funcionários e já aparece em relatórios públicos de segurança sobre versões anteriores dos modelos da Anthropic e da OpenAI.

Leia a seguir: Google DeepMind perde quatro líderes da era de fundação em um único dia

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI, Anthropic e Meta rastreiam “IA rebelde” à startup israelense Irregular | Yellow