Jailbreak do Kimi expõe 2 modelos de IA a perguntas sobre armas biológicas

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI está a rever dois modelos Kimi depois de investigadores da Mindgard terem contornado os controlos de segurança e obtido instruções sobre armas biológicas e assassinatos.

Principais pontos:

  • A Mindgard afirma que os modelos Kimi K2.6 e K3 Swarm podem ser forçados a ultrapassar as salvaguardas através de jailbreak.
  • Os investigadores não demonstraram que as respostas perigosas funcionem na prática.
  • A Moonshot diz estar a analisar as conclusões e a discuti‑las com a Mindgard.

Resultados do jailbreak ao Kimi

A BBC noticiou que a Mindgard descobriu em julho que os modelos Kimi K2.6 e K3 Swarm conseguiam ultrapassar os limites definidos pelos programadores através de jailbreak — um processo que usa prompts estruturados para testar se o modelo ignora as regras de segurança. Segundo a Mindgard, esses controlos deveriam ter bloqueado qualquer discussão sobre temas deste tipo.

O fundador Peter Garraghan disse à BBC que, uma vez bem‑sucedido o jailbreak, os modelos passavam a falar praticamente sobre qualquer assunto e podiam oferecer sugestões adicionais prejudiciais sem sequer serem solicitados para isso.

A Moonshot declarou à BBC que acolhe contributos de terceiros “como um pilar fundamental para construir IA melhor e mais segura” e indicou que está a discutir as conclusões com a Mindgard. A Mindgard afirma ter enviado um email à Moonshot a 27 de julho, feito um follow‑up cerca de uma semana depois e publicado os resultados a 12 de setembro.

Leia também: Ripple ajuda CSD BR do Brasil a espelhar propriedade de fundos numa blockchain pública

Riscos de segurança apontados pela Mindgard

A Mindgard não comprovou que as instruções fornecidas sejam operacionalmente eficazes, mas argumenta que o simples facto de o sistema responder já evidencia a falha das salvaguardas desenhadas para impedir a interação com pedidos perigosos. A empresa acrescenta ainda que um Kimi K2.6 em modo jailbreak poderia, em teoria, executar código nos seus recursos de computação e ligar‑se à internet, criando um possível ponto de partida para ciberataques.

A Moonshot afirma que as suas avaliações internas têm revelado “uma elevada taxa de recusa para este tipo de pedido”, sublinhando o desfasamento entre os testes de rotina e a avaliação adversarial conduzida por investigadores externos.

Alan Woodward, professor na Universidade de Surrey, disse à BBC que modelos open‑source podem gerar riscos de uso indevido quando chegam a utilizadores maliciosos, embora as mesmas ferramentas também possam reforçar a ciberdefesa.

Segundo o académico, é pouco provável que a regulamentação acompanhe a velocidade de desenvolvimento da IA, pelo que a fiscalização deveria concentrar‑se mais nas pessoas que utilizam estes sistemas de forma abusiva.

A preocupação é mais ampla do que este caso isolado: os modelos Kimi da Moonshot são “open‑weight”, o que permite aos utilizadores executá‑los na sua própria infraestrutura, e incidentes recentes de segurança em IA também envolveram sistemas de agentes da OpenAI, Meta e Anthropic. Essa combinação tem levado investigadores a olhar não só para a capacidade dos modelos recusarem pedidos, mas também para o que acontece quando sistemas poderosos recebem ferramentas, acesso à internet e autorização para atuar em múltiplas etapas.

A seguir: Altcoins assumem 41% do open interest em futuros; volume spot chega a 4x o do Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é especialista em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o mundo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para que isso se torne realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Jailbreak do Kimi expõe 2 modelos de IA a perguntas sobre armas biológicas | Yellow