OpenAI introdurrà un watermark invisibile nei testi generati da ChatGPT e Codex nell’Unione europea, anche se i test interni mostrano che sostituire il 10% delle parole fa crollare il tasso di rilevamento al 66%.
Punti chiave:
- Il watermark sarà esteso nelle prossime settimane agli utenti idonei di ChatGPT e Codex in UE su tutti i piani; per l’API resterà opzionale.
- La sostituzione del 25% delle parole con sinonimi ha ridotto il tasso di rilevamento al 17% nei test dell’azienda.
- L’accesso al sistema di rilevazione sarà inizialmente limitato a ricercatori e organizzazioni specializzate approvate.
Lancio del watermark di OpenAI
L’azienda ha annunciato il piano lunedì in un post sul blog, spiegando che il nuovo sistema di marcatura verrà distribuito nelle prossime settimane agli utenti idonei di ChatGPT e Codex nell’UE, indipendentemente dal piano sottoscritto. Al debutto non sarà un’impostazione predefinita a livello globale.
Gli sviluppatori che utilizzano l’API dell’azienda in qualsiasi parte del mondo possono già attivare il watermark su alcuni modelli, ma la funzione resta disattivata di default. La mossa risponde agli obblighi previsti dall’AI Act europeo, entrati in vigore il 2 agosto, che impongono ai provider di rendere il testo generato dall’IA identificabile in modo automatico. I soggetti già presenti sul mercato hanno tempo fino al 2 dicembre per adeguarsi.
Da leggere anche: L’agente AI di Binance crea strategie da semplici frasi e fa trading per 19,99 USDC
I limiti di rilevazione di textGrain
Il metodo, battezzato textGrain, non inserisce simboli visibili, ma orienta in modo impercettibile le scelte lessicali del modello, lasciando una traccia statistica che un rilevatore può intercettare e che sopravvive al copia‑incolla del testo. OpenAI afferma che la tecnologia eguaglia o supera le altre soluzioni testate, inclusa la SynthID per il testo di Google, e che intende rilasciarla come open source.
Le modifiche manuali però indeboliscono il segnale.
In una valutazione su passaggi di 400 token, sostituire il 10% delle parole con sinonimi ha ridotto il tasso di rilevazione da circa il 92% al 66%. Sostituire il 25% delle parole lo ha portato al 17%. Anche i testi brevi, le risposte a problemi matematici e le traduzioni risultano più difficili da intercettare: su passaggi di 200 token su temi come la psicologia, il sistema individua circa l’80% dei contenuti generati dall’IA, mantenendo l’1% di falsi positivi.
Accesso al rilevatore di ChatGPT
Per ora OpenAI limita l’uso del rilevatore a ricercatori approvati e organizzazioni di comprovata esperienza, richiamando il rischio di watermark non riconosciuti e di falsi allarmi. L’azienda sottolinea inoltre che l’assenza di watermark «non prova l’autorialità umana» e specifica che la marcatura non identifica l’utente, l’account o il prompt che hanno originato il testo.
La decisione segue quella di Anthropic, che ad agosto ha annunciato il watermarking globale dei testi generati da Claude, scelta che ha suscitato critiche da parte di alcuni utenti. OpenAI aveva già sviluppato in passato una tecnologia di watermark per il testo ma ne aveva sospeso il lancio, in parte per il timore che gli utenti migrassero verso competitor, secondo una cronaca del 2024. Entrambe le società, insieme a Google, Meta e Microsoft, hanno aderito al codice di condotta UE sulla trasparenza dei contenuti generati dall’IA.
Prossimo articolo: Giorgia Meloni vuole registrare il marchio sulla sua voce: fermerà i deepfake IA?

