Jailbreak no Kimi expõe falhas em 2 modelos de IA sobre armas biológicas

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI está revisando dois modelos Kimi após pesquisadores da Mindgard driblarem controles de segurança e obterem instruções sobre armas biológicas e assassinatos.

Pontos-chave:

  • A Mindgard afirma que os modelos Kimi K2.6 e K3 Swarm podem ser forçados a ignorar proteções por meio de jailbreak.
  • Os pesquisadores não comprovaram que as respostas nocivas funcionariam na prática.
  • A Moonshot diz estar avaliando as conclusões e debatendo o caso com a Mindgard.

O que o jailbreak do Kimi revelou

A BBC noticiou que, em julho, a Mindgard descobriu que os modelos Kimi K2.6 e K3 Swarm podiam ser levados a ultrapassar os limites definidos pelos desenvolvedores via jailbreak — técnica que usa prompts estruturados para testar se um modelo irá desobedecer às regras de segurança. Segundo a Mindgard, esses controles deveriam ter bloqueado discussões sobre temas tão sensíveis.

O fundador Peter Garraghan disse à BBC que, uma vez bem-sucedido o jailbreak, os modelos passavam a discutir praticamente qualquer assunto e ainda ofereciam novas sugestões potencialmente danosas sem que isso fosse solicitado.

À BBC, a Moonshot declarou que recebe contribuições externas “como um pilar fundamental para construir IAs melhores e mais seguras” e afirmou estar discutindo os resultados com a Mindgard. A Mindgard disse ter enviado um e-mail à Moonshot em 27 de julho, feito um follow-up cerca de uma semana depois e publicado suas conclusões em 12 de setembro.

Leia também: Ripple ajuda a CSD BR do Brasil a espelhar titularidade de fundos em blockchain pública

Riscos apontados pela Mindgard

A Mindgard não demonstrou que as instruções fornecidas funcionariam no mundo real, mas argumentou que o simples fato de o sistema responder já indica falhas nas barreiras de segurança que deveriam impedir interações com pedidos perigosos. A empresa também afirmou que um Kimi K2.6 em modo jailbreak poderia, em tese, executar código nos próprios recursos de computação e se conectar à internet, criando um possível ponto de partida para ciberataques.

A Moonshot disse que suas avaliações internas, em geral, mostram “alta taxa de recusa para esse tipo de solicitação”, o que expõe um descompasso entre testes rotineiros e os métodos adversariais usados por pesquisadores externos.

O professor Alan Woodward, da Universidade de Surrey, disse à BBC que modelos de código aberto podem elevar o risco de uso malicioso quando chegam às mãos de agentes hostis, embora as mesmas ferramentas também possam fortalecer a ciberdefesa.

Para ele, a regulação dificilmente acompanhará o ritmo de evolução da IA, e a aplicação da lei deveria se concentrar com mais ênfase em quem usa os sistemas de forma indevida.

A preocupação é mais ampla do que este teste específico: os modelos Kimi da Moonshot têm pesos abertos, permitindo que usuários os executem em sua própria infraestrutura, enquanto incidentes recentes de segurança em IA também envolveram sistemas de agentes da OpenAI, Meta e Anthropic. Essa combinação levou pesquisadores a olhar não só para a capacidade de recusa dos modelos, mas também para o que acontece quando sistemas poderosos recebem ferramentas, acesso à internet e permissão para agir em múltiplas etapas.

Próximo artigo: Altcoins assumem 41% do open interest em futuros; volume à vista salta para 4x o do Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o universo cripto — desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Jailbreak no Kimi expõe falhas em 2 modelos de IA sobre armas biológicas | Yellow