Google DeepMind ha portato SynthID in un territorio in cui la parola “watermark” smette immediatamente di sembrare innocua: le proteine progettate con l’intelligenza artificiale. Con SynthID Bio, presentato come proof of concept e pubblicato su Nature, il watermark può essere incorporato nelle sequenze di amminoacidi e nelle strutture tridimensionali generate dall’AI.
La headline più facile è che adesso possiamo “marchiare” una proteina creata dall’AI. Quella più utile è meno rassicurante: possiamo aggiungere un segnale di provenienza, ma provenienza e sicurezza non sono la stessa cosa.
Un watermark biologico ha un problema che JPEG e testo non hanno
Quando un watermark viene inserito in un’immagine, il requisito principale è che non rovini visibilmente l’immagine. Con una proteina il vincolo cambia completamente. La modifica deve restare rilevabile senza alterare ciò che quella proteina è progettata per fare.
È qui che il lavoro di DeepMind diventa tecnicamente interessante. SynthID Bio non è un unico algoritmo, ma una famiglia di metodi. Per le sequenze, integra il watermark nel processo di generazione con ProteinMPNN; per le strutture tridimensionali, usa una versione di AlphaFold 3 modificata per produrre coordinate che contengono un segnale rilevabile.
Un segnale di provenienza è utile proprio quando smettiamo di pretendere che risponda a domande che non è stato progettato per risolvere.
La parte difficile era non rompere la funzione
Nel lavoro pubblicato su Nature, i ricercatori hanno testato in laboratorio proteine binder watermarked contro tre target: VEGF-A, il receptor-binding domain della proteina spike di SARS-CoV-2 e PD-L1. Nei test riportati, le distribuzioni di affinità e gli hit rate delle versioni watermarked sono rimasti comparabili a quelli delle versioni non watermarked.
Questo non dimostra che qualsiasi proteina possa essere modificata senza conseguenze. Dimostra qualcosa di più preciso: nel perimetro sperimentale studiato, è possibile incorporare un segnale rilevabile mantenendo le proprietà funzionali misurate. È una differenza importante, soprattutto in un settore in cui trasformare un risultato sperimentale in una promessa universale sarebbe un ottimo modo per produrre hype e pessima ingegneria.
Due watermark, due compromessi diversi
SynthID Bio-sequence interviene durante la generazione della sequenza. Il vantaggio è che può essere integrato senza modificare il modello di base e, secondo gli autori, può generalizzare ad altri generatori autoregressivi di sequenze. Il limite è altrettanto chiaro: il meccanismo può essere disattivato e attacchi di resequencing con ProteinMPNN riescono in larga misura a rimuovere il watermark.
SynthID Bio-structure segue un’altra strada: il comportamento di watermarking viene incorporato nei pesi di una versione fine-tuned di AlphaFold 3. I test riportano rilevabilità superiore al 99,8% in alcune configurazioni a un false-positive rate dello 0,1%, mantenendo le metriche strutturali principali. Ma anche qui esistono limiti: una procedura di constrained relaxation testata dagli autori riesce a distruggere il watermark.
Il dettaglio più importante: il watermark dice pochissimo
Le implementazioni descritte sono zero-bit watermark: il segnale indica sostanzialmente la presenza del watermark. Non contiene una storia completa dell’oggetto, non identifica automaticamente chi lo ha generato, non certifica che sia innocuo e non sostituisce un sistema di screening.
Questa limitazione non rende inutile il sistema. Lo rende leggibile. Un provider di sintesi del DNA, un database scientifico o un’altra organizzazione autorizzata a usare la chiave di rilevamento potrebbe ricevere un’informazione aggiuntiva sulla provenienza di un artefatto. Poi dovrà comunque decidere cosa farne.
Provenienza non significa verità
Questo è lo stesso errore concettuale che facciamo spesso con firme, log e audit trail. Sapere da dove arriva qualcosa non significa sapere se quel qualcosa è corretto. Un log firmato può documentare perfettamente un’operazione sbagliata. Un contenuto autenticato può essere falso. Una proteina riconosciuta come generata da un sistema AI può comunque richiedere tutte le verifiche biologiche e di sicurezza previste dal contesto.
DeepMind stessa presenta SynthID Bio come proof of concept e il paper dice esplicitamente che l’uso operativo per biosecurity e integrità scientifica richiederebbe ulteriore innovazione, coordinamento industriale e standardizzazione. È probabilmente la frase più importante dell’intero progetto.
Perché vale comunque la pena farlo
Perché i sistemi complessi funzionano meglio quando dispongono di segnali diversi, ciascuno con un significato preciso. Metadata esterni possono essere rimossi. Database centralizzati introducono problemi di fiducia, privacy e falsi positivi. Un watermark incorporato direttamente nell’artefatto offre un’altra proprietà: il segnale viaggia con l’oggetto.
Non è infallibile, e il paper è abbastanza onesto da mostrare attacchi che funzionano. Ma questo è esattamente ciò che rende interessante la ricerca: non vende la provenienza come una bacchetta magica, la tratta come un componente da inserire in una catena di controllo più ampia.
Quando l’AI produce oggetti, cambia anche il problema dell’attribuzione
Finora abbiamo discusso soprattutto di watermark AI per immagini, audio, video e testo. SynthID Bio sposta il problema: l’output non è soltanto informazione da guardare o leggere. Può diventare un artefatto biologico sintetizzato fisicamente.
A quel punto la provenienza non è più soltanto una questione di copyright, trasparenza editoriale o moderazione. Diventa una proprietà che può entrare nei processi di laboratorio, nei database scientifici e nelle catene di controllo. Non perché risolva da sola il problema, ma perché aggiunge un’informazione verificabile dove prima poteva non esserci.
La lezione architetturale è meno spettacolare del titolo: non chiedere a un singolo meccanismo di essere contemporaneamente firma, identità, screening, garanzia di sicurezza e verità. Definisci il contratto del segnale, misura dove resiste, documenta dove fallisce e costruisci il resto del sistema sapendo esattamente che cosa quel segnale può dimostrare.
SynthID Bio, oggi, dimostra soprattutto questo: un watermark può entrare nel dominio biologico senza distruggere la funzione misurata nei test. Il passo successivo non è chiamarlo “sicurezza”. È capire come trasformare quella provenienza in un’informazione interoperabile, verificabile e realmente utile dentro processi che restano molto più grandi del watermark stesso.
Domande frequenti
Che cosa significa SynthID Bio?
È una famiglia di metodi sperimentali sviluppata da Google DeepMind per incorporare watermark rilevabili nelle sequenze proteiche generate dall’AI e nelle strutture biomolecolari previste, cercando di preservarne la funzione o l’accuratezza.
Il watermark dimostra che una proteina è sicura?
No. Il watermark è un segnale di provenienza: può indicare la presenza della firma, ma non certifica sicurezza, innocuità, correttezza biologica o identità completa di chi ha generato l’artefatto.
Il watermark di SynthID Bio può essere rimosso?
In alcuni scenari sì. Il paper mostra che il resequencing può rimuovere in larga misura il watermark delle sequenze e che una procedura di constrained relaxation può distruggere quello delle strutture. Il lavoro è infatti presentato come proof of concept.
SynthID Bio modifica la funzione delle proteine?
Nei test descritti nel paper, i binder watermarked sui tre target sperimentali hanno mostrato hit rate e distribuzioni di affinità comparabili alle versioni non watermarked. Questo risultato vale per il perimetro sperimentale studiato, non per qualsiasi proteina possibile.
