AI / PROVENIENZA / SISTEMI
Un watermark nel testo generato da un modello sembra una soluzione rassicurante: finalmente potremo distinguere ciò che ha scritto una persona da ciò che ha prodotto un’AI. Peccato che non sia questo ciò che il watermark può dirci.
Il 5 ottobre OpenAI ha presentato textGrain, il sistema di watermarking testuale con cui affronterà i requisiti di provenienza dell’AI Act europeo. La parte interessante non è tanto che esista un nuovo detector. È che i numeri pubblicati da OpenAI mostrano con una chiarezza quasi didattica la differenza tra segnale e prova.
La provenienza è un indizio tecnico sull’origine di un contenuto. Trasformarla in un verdetto sull’autore significa chiederle una cosa che non può sapere.
textGrain non nasconde caratteri nel testo
Il meccanismo è più interessante dei vecchi trucchi con spazi invisibili o caratteri Unicode. textGrain modifica statisticamente le scelte del modello durante la generazione: tra i token plausibili favorisce certe alternative secondo una chiave segreta, lasciando nel testo un pattern che un detector può cercare in seguito. Il segnale è quindi incorporato nelle scelte linguistiche, non aggiunto come metadato separato.
Questo ha un vantaggio evidente: copiare e incollare il testo non elimina automaticamente il watermark. Ma introduce anche il limite fondamentale. Se il segnale vive nella distribuzione delle parole scelte, modificare quelle parole può degradarlo.
OpenAI pubblica numeri molto concreti. Con un tasso di falsi positivi target dell’1%, il detector individua circa l’80% dei watermark in passaggi di psicologia da 200 token e circa il 95% a 400 token. Nei domini più vincolati, come la matematica, la rilevazione peggiora perché il modello ha meno libertà nella scelta delle parole. Su passaggi inglesi da 400 token, sostituire con sinonimi il 10% delle parole fa scendere la rilevazione riportata da circa il 92% al 66%; al 25% di sostituzioni arriva al 17%.
Un detector che sbaglia non è un detector inutile
Qui nasce l’equivoco più comune. Se un sistema ha falsi positivi e falsi negativi, qualcuno conclude che non serva. È una lettura troppo semplice. Molti sistemi utili lavorano con segnali probabilistici: antifrode, spam filtering, anomaly detection, scoring del rischio. Il problema non è pretendere errore zero. È decidere quale decisione siamo autorizzati a prendere partendo da quel segnale.
Un watermark rilevato può essere evidenza che un sistema OpenAI ha generato o elaborato un passaggio. Non dice chi abbia scritto il testo nel senso editoriale del termine. Non misura quanto abbia contribuito una persona, non stabilisce proprietà o responsabilità, non identifica l’utente e soprattutto non certifica che il contenuto sia vero. OpenAI lo dice esplicitamente. Anche l’assenza del watermark non dimostra origine umana: il testo può essere stato accorciato, riscritto, tradotto, prodotto con un modello non supportato o semplicemente essere troppo breve per una rilevazione affidabile.
L’AI Act chiede marcatura, non telepatia
Il contesto normativo aiuta a capire perché questa distinzione conta. L’articolo 50 dell’AI Act, applicabile dal 2 agosto 2026, richiede ai provider di sistemi generativi di rendere gli output marcati in formato machine-readable e rilevabili come generati o manipolati artificialmente, nei limiti di ciò che è tecnicamente fattibile. La norma stessa parla di soluzioni efficaci, interoperabili, robuste e affidabili tenendo conto delle limitazioni del tipo di contenuto e dello stato dell’arte.
Questa formulazione è importante: il legislatore non sta chiedendo una macchina infallibile capace di ricostruire la storia intellettuale di un paragrafo. Sta chiedendo un meccanismo tecnico di marcatura e rilevazione. OpenAI, di conseguenza, attiverà nelle prossime settimane il watermark per output testuali idonei di ChatGPT e Codex nell’Unione Europea; per i clienti API il watermarking parte invece come opzione attivabile su modelli selezionati.
La domanda sbagliata è “questo testo è AI?”
La domanda binaria è seducente perché semplifica tutto. Un testo sarebbe umano oppure artificiale, originale oppure sintetico. Ma un workflow reale raramente funziona così. Una persona può costruire una tesi, usare un modello per una prima stesura, riscrivere metà del testo, far correggere due paragrafi, aggiungere dati propri e infine usare ancora l’AI per un controllo grammaticale. Dove mettiamo la linea?
Il watermark non risolve questo problema perché non è stato progettato per farlo. Rileva un segnale nella forma finale disponibile, non ricostruisce il processo editoriale. E questo è un bene: pretendere di inferire responsabilità, intenzione e paternità da una distribuzione statistica di token sarebbe molto più pericoloso che ammettere i limiti dello strumento.
Un sistema di provenienza diventa affidabile quando sappiamo anche quali conclusioni non possiamo trarne.
Il vero pattern è una difesa a strati
La parte più matura dell’approccio non è textGrain preso da solo. È l’idea che la provenienza debba essere stratificata. Per immagini e audio OpenAI usa watermark SynthID; per immagini supportate aggiunge anche Content Credentials basate su C2PA; per il testo introduce un segnale statistico; accanto ai segnali esistono strumenti di verifica e, per il testo, l’accesso iniziale al detector viene limitato a ricercatori e organizzazioni esperte.
È una logica che conosco bene dal software: quando una proprietà è importante non la affidi a un singolo controllo magico. Usi segnali indipendenti, provenance, audit, policy e verifiche nel punto in cui prendi la decisione. Lo stesso vale per gli agenti AI: la sicurezza non può stare soltanto nel prompt. Un’istruzione è un livello; l’enforcement tecnico è un altro. Confonderli produce sistemi che sembrano controllati finché qualcosa non devia dal percorso ideale.
Il paradosso della riscrittura
Il dato più istruttivo di textGrain, per me, resta il crollo della rilevazione dopo la sostituzione di parole. Non perché dimostri che il watermark “non funziona”, ma perché rende visibile un trade-off strutturale. Il testo è un formato estremamente malleabile. Possiamo parafrasarlo senza perdere il significato, tradurlo, riassumerlo, espanderlo. Più vogliamo un segnale resistente a queste trasformazioni, più rischiamo di interferire con la libertà del modello di scegliere l’output migliore o di introdurre pattern troppo forti.
OpenAI sostiene che nei propri benchmark non emergano differenze significative di qualità con il watermark attivo. È un risultato utile, ma va letto per ciò che è: una valutazione del provider sui benchmark dichiarati, non una garanzia universale per ogni lingua, dominio e trasformazione. La stessa documentazione riconosce che la rilevabilità varia tra lingue e che testi brevi o molto vincolati sono più difficili.
Provenienza significa conservare incertezza
Se textGrain verrà usato bene, non avremo un nuovo tribunale automatico dell’autorialità. Avremo un segnale in più dentro sistemi che devono conservare l’incertezza invece di nasconderla.
Per una piattaforma può significare combinare watermark, metadati, storia del file e contesto di pubblicazione. Per un’organizzazione può significare mantenere traccia del workflow con cui un contenuto è stato prodotto. Per chi valuta un testo significa evitare la scorciatoia più pericolosa: “detector positivo, quindi autore AI” oppure “detector negativo, quindi autore umano”.
La tecnologia interessante, alla fine, non è quella che promette di eliminare l’ambiguità. È quella che rende l’ambiguità misurabile e ci impedisce di dimenticarla proprio quando prendiamo una decisione.
Domande frequenti
Che cos'è textGrain?
textGrain è il sistema di watermarking testuale di OpenAI: incorpora un segnale statistico invisibile nelle scelte di parole e token del modello, che un detector può cercare successivamente.
Un watermark textGrain prova che il testo è stato scritto interamente dall'AI?
No. Un rilevamento indica un segnale compatibile con l’uso di un sistema OpenAI, ma non misura il contributo umano, non stabilisce autorialità, proprietà o responsabilità e non certifica l’accuratezza del contenuto.
Perché la riscrittura può indebolire il watermark?
Perché il segnale è incorporato statisticamente nelle scelte linguistiche. Parafrasi, sostituzioni di parole e traduzioni modificano proprio la struttura su cui il detector cerca il pattern.
L'AI Act richiede di marcare il testo generato dall'AI?
L’articolo 50 richiede ai provider di sistemi generativi di rendere gli output sintetici marcati in formato machine-readable e rilevabili come generati o manipolati, nei limiti della fattibilità tecnica e delle eccezioni previste.
