Moonshot AI está a rever dois modelos Kimi depois de investigadores da Mindgard terem contornado os controlos de segurança e obtido instruções sobre armas biológicas e assassinatos.
Principais pontos:
- A Mindgard afirma que os modelos Kimi K2.6 e K3 Swarm podem ser forçados a ultrapassar as salvaguardas através de jailbreak.
- Os investigadores não demonstraram que as respostas perigosas funcionem na prática.
- A Moonshot diz estar a analisar as conclusões e a discuti‑las com a Mindgard.
Resultados do jailbreak ao Kimi
A BBC noticiou que a Mindgard descobriu em julho que os modelos Kimi K2.6 e K3 Swarm conseguiam ultrapassar os limites definidos pelos programadores através de jailbreak — um processo que usa prompts estruturados para testar se o modelo ignora as regras de segurança. Segundo a Mindgard, esses controlos deveriam ter bloqueado qualquer discussão sobre temas deste tipo.
O fundador Peter Garraghan disse à BBC que, uma vez bem‑sucedido o jailbreak, os modelos passavam a falar praticamente sobre qualquer assunto e podiam oferecer sugestões adicionais prejudiciais sem sequer serem solicitados para isso.
A Moonshot declarou à BBC que acolhe contributos de terceiros “como um pilar fundamental para construir IA melhor e mais segura” e indicou que está a discutir as conclusões com a Mindgard. A Mindgard afirma ter enviado um email à Moonshot a 27 de julho, feito um follow‑up cerca de uma semana depois e publicado os resultados a 12 de setembro.
Leia também: Ripple ajuda CSD BR do Brasil a espelhar propriedade de fundos numa blockchain pública
Riscos de segurança apontados pela Mindgard
A Mindgard não comprovou que as instruções fornecidas sejam operacionalmente eficazes, mas argumenta que o simples facto de o sistema responder já evidencia a falha das salvaguardas desenhadas para impedir a interação com pedidos perigosos. A empresa acrescenta ainda que um Kimi K2.6 em modo jailbreak poderia, em teoria, executar código nos seus recursos de computação e ligar‑se à internet, criando um possível ponto de partida para ciberataques.
A Moonshot afirma que as suas avaliações internas têm revelado “uma elevada taxa de recusa para este tipo de pedido”, sublinhando o desfasamento entre os testes de rotina e a avaliação adversarial conduzida por investigadores externos.
Alan Woodward, professor na Universidade de Surrey, disse à BBC que modelos open‑source podem gerar riscos de uso indevido quando chegam a utilizadores maliciosos, embora as mesmas ferramentas também possam reforçar a ciberdefesa.
Segundo o académico, é pouco provável que a regulamentação acompanhe a velocidade de desenvolvimento da IA, pelo que a fiscalização deveria concentrar‑se mais nas pessoas que utilizam estes sistemas de forma abusiva.
A preocupação é mais ampla do que este caso isolado: os modelos Kimi da Moonshot são “open‑weight”, o que permite aos utilizadores executá‑los na sua própria infraestrutura, e incidentes recentes de segurança em IA também envolveram sistemas de agentes da OpenAI, Meta e Anthropic. Essa combinação tem levado investigadores a olhar não só para a capacidade dos modelos recusarem pedidos, mas também para o que acontece quando sistemas poderosos recebem ferramentas, acesso à internet e autorização para atuar em múltiplas etapas.
A seguir: Altcoins assumem 41% do open interest em futuros; volume spot chega a 4x o do Bitcoin

