OpenAI vai passar a embutir uma marca‑d’água invisível no texto gerado pelo ChatGPT e pelo Codex na União Europeia, embora os seus próprios testes mostrem que substituir 10% das palavras já baixa a taxa de deteção para 66%.
Pontos principais:
- A marca‑d’água será disponibilizada, nas próximas semanas, a utilizadores elegíveis do ChatGPT e do Codex em todos os planos na UE, e permanece opcional para clientes de API.
- A substituição de 25% das palavras por sinónimos reduziu a deteção para 17% nos testes internos da empresa.
- O acesso ao detetor será, no arranque, restrito a investigadores aprovados e organizações especializadas.
Lançamento da marca‑d’água da OpenAI
A empresa anunciou o plano na segunda‑feira, em publicação no seu blogue, indicando que a marcação será disponibilizada, ao longo das próximas semanas, a utilizadores elegíveis do ChatGPT e do Codex em todos os planos na UE. A funcionalidade não será, para já, adotada como padrão a nível global.
Programadores que utilizem a API da empresa em qualquer parte do mundo podem ativá‑la desde já em modelos específicos, embora a opção permaneça desligada por omissão. A medida responde ao AI Act da UE, cujas obrigações de marcação entraram em vigor a 2 de agosto e exigem que os fornecedores tornem o texto gerado por IA identificável por máquinas. As empresas já presentes no mercado têm até 2 de dezembro para cumprir.
Leia também: Agente de IA da Binance cria estratégias a partir de frases simples e cobra 19,99 USDC por negociação
Limitações da deteção TextGrain
O método, batizado de textGrain, não acrescenta qualquer símbolo visível, mas condiciona subtilmente as escolhas de palavras do modelo, deixando um padrão estatístico que um detetor consegue captar e que permanece mesmo quando o texto é copiado. A OpenAI afirma que a abordagem iguala ou supera outras técnicas que testou, incluindo o SynthID para texto, da Google, e que pretende disponibilizar a tecnologia em open source.
Edições posteriores enfraquecem esse sinal.
Em testes com excertos de 400 tokens, a substituição de 10% das palavras por sinónimos reduziu a taxa de deteção de cerca de 92% para 66%. A troca de 25% das palavras baixou esse valor para 17%. Textos mais curtos, respostas de matemática e conteúdos traduzidos também são mais difíceis de sinalizar, com o detetor a identificar cerca de 80% dos textos de 200 tokens sobre temas como psicologia, mantendo uma taxa de falsos positivos de 1%.
Acesso ao detetor do ChatGPT
A OpenAI está a limitar, para já, o acesso ao seu detetor a investigadores aprovados e organizações peritas, invocando o risco de marcas‑d’água falhadas e falsos positivos. A empresa avisa ainda que a ausência de marca‑d’água “não prova autoria humana” e sublinha que a marca não identifica o utilizador, a conta ou o prompt que originou o texto.
A decisão segue os passos da Anthropic, que anunciou em agosto que iria marcar globalmente o texto gerado pelo Claude, medida que suscitou críticas de alguns utilizadores. A OpenAI já tinha desenvolvido uma marca‑d’água para texto no passado, mas adiou a sua implementação, em parte por receio de empurrar utilizadores para concorrentes, segundo notícias de 2024. As duas empresas, juntamente com Google, Meta e Microsoft, comprometeram‑se com o código de conduta europeu sobre transparência em conteúdo gerado por IA.

