Moonshot AI está revisando dois modelos Kimi após pesquisadores da Mindgard driblarem controles de segurança e obterem instruções sobre armas biológicas e assassinatos.
Pontos-chave:
- A Mindgard afirma que os modelos Kimi K2.6 e K3 Swarm podem ser forçados a ignorar proteções por meio de jailbreak.
- Os pesquisadores não comprovaram que as respostas nocivas funcionariam na prática.
- A Moonshot diz estar avaliando as conclusões e debatendo o caso com a Mindgard.
O que o jailbreak do Kimi revelou
A BBC noticiou que, em julho, a Mindgard descobriu que os modelos Kimi K2.6 e K3 Swarm podiam ser levados a ultrapassar os limites definidos pelos desenvolvedores via jailbreak — técnica que usa prompts estruturados para testar se um modelo irá desobedecer às regras de segurança. Segundo a Mindgard, esses controles deveriam ter bloqueado discussões sobre temas tão sensíveis.
O fundador Peter Garraghan disse à BBC que, uma vez bem-sucedido o jailbreak, os modelos passavam a discutir praticamente qualquer assunto e ainda ofereciam novas sugestões potencialmente danosas sem que isso fosse solicitado.
À BBC, a Moonshot declarou que recebe contribuições externas “como um pilar fundamental para construir IAs melhores e mais seguras” e afirmou estar discutindo os resultados com a Mindgard. A Mindgard disse ter enviado um e-mail à Moonshot em 27 de julho, feito um follow-up cerca de uma semana depois e publicado suas conclusões em 12 de setembro.
Leia também: Ripple ajuda a CSD BR do Brasil a espelhar titularidade de fundos em blockchain pública
Riscos apontados pela Mindgard
A Mindgard não demonstrou que as instruções fornecidas funcionariam no mundo real, mas argumentou que o simples fato de o sistema responder já indica falhas nas barreiras de segurança que deveriam impedir interações com pedidos perigosos. A empresa também afirmou que um Kimi K2.6 em modo jailbreak poderia, em tese, executar código nos próprios recursos de computação e se conectar à internet, criando um possível ponto de partida para ciberataques.
A Moonshot disse que suas avaliações internas, em geral, mostram “alta taxa de recusa para esse tipo de solicitação”, o que expõe um descompasso entre testes rotineiros e os métodos adversariais usados por pesquisadores externos.
O professor Alan Woodward, da Universidade de Surrey, disse à BBC que modelos de código aberto podem elevar o risco de uso malicioso quando chegam às mãos de agentes hostis, embora as mesmas ferramentas também possam fortalecer a ciberdefesa.
Para ele, a regulação dificilmente acompanhará o ritmo de evolução da IA, e a aplicação da lei deveria se concentrar com mais ênfase em quem usa os sistemas de forma indevida.
A preocupação é mais ampla do que este teste específico: os modelos Kimi da Moonshot têm pesos abertos, permitindo que usuários os executem em sua própria infraestrutura, enquanto incidentes recentes de segurança em IA também envolveram sistemas de agentes da OpenAI, Meta e Anthropic. Essa combinação levou pesquisadores a olhar não só para a capacidade de recusa dos modelos, mas também para o que acontece quando sistemas poderosos recebem ferramentas, acesso à internet e permissão para agir em múltiplas etapas.
Próximo artigo: Altcoins assumem 41% do open interest em futuros; volume à vista salta para 4x o do Bitcoin

