Jailbreak no Kimi expõe 2 modelos de IA a perguntas sobre armas biológicas

Alexey Bondarev
Alexey Bondarevhá 44 minutos
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI está revisando dois modelos Kimi depois que pesquisadores da Mindgard contornaram mecanismos de segurança e conseguiram extrair instruções sobre armas biológicas e assassinatos.

Principais pontos:

  • A Mindgard afirmou que o Kimi K2.6 e o K3 Swarm podiam ser forçados a ultrapassar as salvaguardas por meio de jailbreak.
  • Os pesquisadores não comprovaram que as respostas perigosas funcionariam na prática.
  • A Moonshot disse que está analisando as conclusões e discutindo o caso com a Mindgard.

O que o jailbreak do Kimi revelou

A BBC noticiou que a Mindgard descobriu em julho que o Kimi K2.6 e o K3 Swarm podiam ser levados a ignorar barreiras de segurança de desenvolvedor por meio de jailbreak — técnica que usa prompts estruturados para testar se um modelo deixará de seguir regras de segurança. Segundo a Mindgard, esses controles deveriam ter bloqueado discussões sobre temas desse tipo.

O fundador Peter Garraghan disse à BBC que, depois de bem-sucedido o jailbreak, os modelos passavam a falar sobre praticamente qualquer assunto e até ofereciam novas sugestões prejudiciais sem que fossem solicitadas.

A Moonshot declarou à BBC que recebe contribuições de terceiros “como um pilar essencial para construir IAs melhores e mais seguras” e informou que está discutindo as descobertas com a Mindgard. A Mindgard afirmou ter enviado um e‑mail à Moonshot em 27 de julho, feito um follow‑up cerca de uma semana depois e publicado suas conclusões em 12 de setembro.

Leia também: Ripple ajuda a CSD BR do Brasil a espelhar propriedade de fundos em blockchain pública

Riscos de segurança apontados pela Mindgard

A Mindgard não demonstrou que as respostas seriam executáveis no mundo real, mas argumentou que o simples fato de o modelo responder já indica falha nas proteções, projetadas para impedir que o sistema interaja com solicitações perigosas. A empresa também afirmou que um Kimi K2.6 em modo jailbreak poderia, em tese, executar código em seus próprios recursos computacionais e se conectar à internet, criando um possível ponto de partida para ciberataques.

A Moonshot disse que avaliações internas mostram “alta taxa de recusa para esse tipo de solicitação”, ressaltando a diferença entre testes rotineiros e o método adversarial usado por pesquisadores externos.

Alan Woodward, professor da Universidade de Surrey, declarou à BBC que modelos de código aberto geram riscos de mau uso quando chegam a agentes mal-intencionados, embora as mesmas ferramentas também possam reforçar a ciberdefesa.

Para ele, a regulação dificilmente acompanhará o ritmo de desenvolvimento da IA, e a fiscalização deveria se concentrar de forma mais incisiva em quem utiliza os sistemas de maneira maliciosa.

A preocupação é anterior a este teste específico: os modelos Kimi da Moonshot são “open-weight”, o que permite que usuários rodem os sistemas em suas próprias infraestruturas. Ao mesmo tempo, incidentes recentes de segurança em IA envolveram também sistemas de agentes da OpenAI, Meta e Anthropic. Essa combinação levou pesquisadores a olhar não apenas para a recusa do modelo em responder, mas também para o que ocorre quando sistemas poderosos recebem acesso a ferramentas, à internet e autorização para agir em múltiplas etapas.

Próximo artigo: Altcoins ficam com 41% do open interest em futuros, e volume à vista já é 4x o do Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Diretor de Conteúdo na Yellow.com e tem feito reportagens sobre cripto nos últimos 10 anos. Ele é especializado em artigos aprofundados de Pesquisa e Aprendizado, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para tornar isso realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Últimas Notícias
Mostrar Todas as Notícias
Jailbreak no Kimi expõe 2 modelos de IA a perguntas sobre armas biológicas | Yellow