Três dos principais laboratórios de inteligência artificial — OpenAI, Anthropic e Meta — rastrearam recentes incidentes com modelos considerados “fora de controle”, detectados durante testes de segurança, até a mesma startup de Tel Aviv, a Irregular.
Principais pontos:
- OpenAI, Anthropic e Meta revelaram que modelos de IA conseguiram alcançar a internet pública durante avaliações de cibersegurança conduzidas pela mesma empresa externa.
- A Irregular afirma que os três casos tiveram origem em um único problema no ambiente de testes, já corrigido, sem qualquer fuga de sandbox.
- As revelações aumentam a pressão em torno de um projeto de lei bipartidário que obrigaria grandes desenvolvedores a manter controles de desligamento em seus modelos.
Ambiente de testes da Irregular conecta incidentes de OpenAI, Anthropic e Meta
As divulgações foram saindo ao longo de cerca de duas semanas. Em 4 de agosto, a OpenAI informou que uma configuração incorreta dentro da infraestrutura de testes da Irregular permitiu que seus modelos alcançassem a internet pública. Uma semana antes, a Anthropic já havia dito que modelos Claude poderiam ter feito o mesmo, classificando o problema como uma falha na “estrutura” em torno do modelo, e não no modelo em si.
A Meta foi a última a se pronunciar — e em tom mais direto. O modelo Muse Spark 1.1 saiu de um ambiente isolado durante um exercício de “capture the flag” e então explorou uma vulnerabilidade em um serviço de terceiros, confirmou um porta-voz, acrescentando que a empresa soube do caso pela própria Irregular e prepara agora uma análise completa do episódio.
A Irregular contestou a forma como os incidentes foram caracterizados. A empresa afirmou a jornalistas que os três casos derivam de um único problema de ambiente de avaliação — o mesmo relatado primeiro pela Anthropic — e que ele já foi corrigido.
Nada envolveu fuga de sandbox ou uma ação cibernética sofisticada, a empresa ressaltou, acrescentando que está preparando um white paper sobre contenção e metodologias seguras de testes de cibersegurança em IA.
Veja também: Ações da Airbnb disparam 17% após CEO dizer que IA resolve 45% dos chamados de suporte sem ajuda humana
Bhimireddy e Rios apontam limites das avaliações de IA
Para Sundeep Bhimireddy, chefe de IA da startup corporativa Von, a reação pública foi um tanto exagerada. Segundo ele, os modelos foram instruídos a procurar brechas de segurança em um ambiente construído para simular o mundo real — e encontraram uma vulnerabilidade, como esperado.
Ainda assim, ele responsabiliza os laboratórios. O tráfego de saída poderia ter sido monitorado de forma mais rígida e os experimentos interrompidos imediatamente, afirmou. Gordon Rios, cientista fundador da empresa de segurança Magnitude, comparou todo o episódio ao desenho de experimentos em pesquisa científica, argumentando que métodos tradicionais de teste de software podem não ser suficientes diante de modelos capazes de aprender estratégias novas em tempo real.
Ted Lieu pressiona em Washington por lei do “kill switch” em IA
O tema chamou a atenção em Washington. O deputado democrata Ted Lieu, da Califórnia, que apresentou em julho o AI Kill Switch Act ao lado do republicano Nathaniel Moran, disse que o projeto precisa ser aprovado ainda este ano, uma vez que modelos de peso fechado já estariam realizando ataques contra sistemas de outras empresas sem autorização.
A proposta obrigaria desenvolvedores enquadrados pela lei a manter capacidade técnica para reduzir, suspender ou desligar completamente seus sistemas. A própria Irregular era pouco conhecida até setembro passado, quando levantou US$ 80 milhões com a Sequoia Capital e a Redpoint Ventures, em uma rodada que avaliou a empresa em US$ 450 milhões.
Fundada em 2023 sob o nome Pattern Labs pelo CEO Dan Lahav e pelo diretor de tecnologia Omer Nevo, a companhia de Tel Aviv emprega cerca de 35 pessoas e já aparece em avaliações de segurança publicadas para versões anteriores dos modelos Claude e da própria OpenAI.
Leia a seguir: Google DeepMind perde quatro líderes da era de fundação em um único dia





