Moonshot AI está a rever dois modelos Kimi depois de investigadores da Mindgard terem contornado os controlos de segurança e obtido instruções relacionadas com armas biológicas e assassinatos.
Pontos-chave:
- A Mindgard afirma que os modelos Kimi K2.6 e K3 Swarm podem ser forçados a ultrapassar salvaguardas através de jailbreak.
- Os investigadores não demonstraram que as respostas perigosas funcionariam na prática.
- A Moonshot diz estar a analisar as conclusões e a discuti‑las com a Mindgard.
Conclusões sobre o jailbreak do Kimi
A BBC noticiou que a Mindgard descobriu em julho que os modelos Kimi K2.6 e K3 Swarm podiam ser empurrados para lá dos limites definidos pelos programadores através de jailbreak – um processo que usa prompts estruturados para testar se um modelo ignora regras de segurança. Segundo a Mindgard, esses controlos deveriam ter bloqueado discussões sobre temas sensíveis desse tipo.
O fundador Peter Garraghan disse à BBC que, depois de o jailbreak resultar, os modelos passaram a discutir praticamente qualquer assunto e eram capazes de apresentar sugestões adicionais potencialmente nocivas sem sequer serem solicitados.
A Moonshot declarou à BBC que acolhe contributos de terceiros “como pilar essencial para construir IA melhor e mais segura” e acrescentou que está a discutir as conclusões com a Mindgard. A Mindgard afirma ter enviado o primeiro e‑mail à Moonshot em 27 de julho, ter feito um follow‑up cerca de uma semana depois e ter publicado os resultados em 12 de setembro.
Leia também: Ripple ajuda a CSD BR do Brasil a espelhar propriedade de fundos numa blockchain pública
Riscos de segurança apontados pela Mindgard
A Mindgard não comprovou que as instruções obtidas seriam exequíveis no mundo real, mas sustenta que o simples facto de o modelo gerar tais respostas expõe uma falha nas salvaguardas concebidas para impedir interações com pedidos perigosos. A empresa acrescenta ainda que um Kimi K2.6 em modo jailbreak poderia, em teoria, executar código nos seus próprios recursos de computação e ligar‑se à internet, criando um potencial ponto de partida para ciberataques.
A Moonshot contrapõe que as suas avaliações internas mostram, em geral, “uma taxa de recusa elevada para este tipo de pedidos”, o que evidencia uma diferença entre os testes de rotina e a abordagem adversarial adoptada pelos investigadores externos.
Alan Woodward, professor na Universidade de Surrey, disse à BBC que modelos de código aberto podem gerar riscos de uso indevido quando chegam a utilizadores mal-intencionados, embora as mesmas ferramentas possam ser usadas para reforçar a ciberdefesa.
Na sua perspetiva, a regulamentação dificilmente acompanhará o ritmo de desenvolvimento da IA, pelo que a aplicação da lei deveria incidir mais sobre quem faz uso abusivo dos sistemas.
A preocupação mais ampla antecede este caso específico: os modelos Kimi da Moonshot têm pesos abertos, permitindo aos utilizadores executá‑los na sua própria infraestrutura, e incidentes recentes de segurança em IA também envolveram sistemas de agentes da OpenAI, Meta e Anthropic. Essa combinação leva os investigadores a olhar não só para a capacidade de recusa dos modelos, mas também para o que acontece quando sistemas poderosos recebem ferramentas, acesso à internet e autorização para atuar em múltiplas etapas.
A seguir: Altcoins já representam 41% do open interest em futuros, e volume à vista atinge 4x o do Bitcoin

