Moonshot AI está revisando dois modelos Kimi depois que pesquisadores da Mindgard contornaram mecanismos de segurança e conseguiram extrair instruções sobre armas biológicas e assassinatos.
Principais pontos:
- A Mindgard afirmou que o Kimi K2.6 e o K3 Swarm podiam ser forçados a ultrapassar as salvaguardas por meio de jailbreak.
- Os pesquisadores não comprovaram que as respostas perigosas funcionariam na prática.
- A Moonshot disse que está analisando as conclusões e discutindo o caso com a Mindgard.
O que o jailbreak do Kimi revelou
A BBC noticiou que a Mindgard descobriu em julho que o Kimi K2.6 e o K3 Swarm podiam ser levados a ignorar barreiras de segurança de desenvolvedor por meio de jailbreak — técnica que usa prompts estruturados para testar se um modelo deixará de seguir regras de segurança. Segundo a Mindgard, esses controles deveriam ter bloqueado discussões sobre temas desse tipo.
O fundador Peter Garraghan disse à BBC que, depois de bem-sucedido o jailbreak, os modelos passavam a falar sobre praticamente qualquer assunto e até ofereciam novas sugestões prejudiciais sem que fossem solicitadas.
A Moonshot declarou à BBC que recebe contribuições de terceiros “como um pilar essencial para construir IAs melhores e mais seguras” e informou que está discutindo as descobertas com a Mindgard. A Mindgard afirmou ter enviado um e‑mail à Moonshot em 27 de julho, feito um follow‑up cerca de uma semana depois e publicado suas conclusões em 12 de setembro.
Leia também: Ripple ajuda a CSD BR do Brasil a espelhar propriedade de fundos em blockchain pública
Riscos de segurança apontados pela Mindgard
A Mindgard não demonstrou que as respostas seriam executáveis no mundo real, mas argumentou que o simples fato de o modelo responder já indica falha nas proteções, projetadas para impedir que o sistema interaja com solicitações perigosas. A empresa também afirmou que um Kimi K2.6 em modo jailbreak poderia, em tese, executar código em seus próprios recursos computacionais e se conectar à internet, criando um possível ponto de partida para ciberataques.
A Moonshot disse que avaliações internas mostram “alta taxa de recusa para esse tipo de solicitação”, ressaltando a diferença entre testes rotineiros e o método adversarial usado por pesquisadores externos.
Alan Woodward, professor da Universidade de Surrey, declarou à BBC que modelos de código aberto geram riscos de mau uso quando chegam a agentes mal-intencionados, embora as mesmas ferramentas também possam reforçar a ciberdefesa.
Para ele, a regulação dificilmente acompanhará o ritmo de desenvolvimento da IA, e a fiscalização deveria se concentrar de forma mais incisiva em quem utiliza os sistemas de maneira maliciosa.
A preocupação é anterior a este teste específico: os modelos Kimi da Moonshot são “open-weight”, o que permite que usuários rodem os sistemas em suas próprias infraestruturas. Ao mesmo tempo, incidentes recentes de segurança em IA envolveram também sistemas de agentes da OpenAI, Meta e Anthropic. Essa combinação levou pesquisadores a olhar não apenas para a recusa do modelo em responder, mas também para o que ocorre quando sistemas poderosos recebem acesso a ferramentas, à internet e autorização para agir em múltiplas etapas.
Próximo artigo: Altcoins ficam com 41% do open interest em futuros, e volume à vista já é 4x o do Bitcoin

