Non esiste un gene per il destino.

E, paradossalmente, uno strumento capace di interpretare il DNA con una precisione mai raggiunta prima può aiutarci a capire proprio questo.

Da Gattaca alla genomica di oggi

In Gattaca, il film di Andrew Niccol, la sequenza del DNA sembra sufficiente a determinare il destino di una persona. Il patrimonio genetico viene infatti utilizzato per prevedere rischi, malattie e caratteristiche individuali e, sulla base di queste informazioni, stabilire quali opportunità concedere a ciascuno. La società finisce così per dividere gli individui in “validi” e “non validi”, trasformando una semplice probabilità genetica in una vera e propria sentenza sociale.

A quasi trent’anni dall’uscita del film, non sappiamo leggere il destino di una persona a partire dal suo genoma. Abbiamo però imparato a leggere il DNA molto meglio di allora: oggi possiamo sequenziarlo, individuare milioni di differenze tra un individuo e l’altro e, soprattutto, provare a capire che cosa alcune di queste differenze possano comportare dal punto di vista biologico.

Quattro lettere, tre miliardi di basi

Il genoma umano contiene circa tre miliardi di coppie di basi, le unità chimiche che compongono il DNA. Per semplicità, queste basi vengono indicate con quattro lettere: A, C, G e T, iniziali di adenina, citosina, guanina e timina. Ciò che conta nel nostro genoma non è soltanto quali lettere contiene, ma soprattutto l’ordine in cui sono disposte.

Tra due persone la sequenza non è identica. In una certa posizione qualcuno può avere una A e qualcun altro una G. Nella maggior parte dei casi una variazione del genere può avere conseguenze limitate o nessun effetto biologicamente importante; in altri casi, invece, può modificare il funzionamento di un gene oppure alterare una regione che contribuisce a regolarne l’attività.Oggi siamo diventati molto bravi a trovare le differenze nel DNA. Rimane però molto più difficile capire che cosa queste differenze significhino. Ed è proprio in questo spazio, tra leggere una variante e comprenderne il possibile effetto, che entra in gioco AlphaGenome.

AlphaGenome: dalla sequenza alla funzione

AlphaGenome è un modello di intelligenza artificiale sviluppato da Google DeepMind per ricavare dalla sequenza del DNA predizioni su diversi aspetti del suo funzionamento molecolare. Può analizzare sequenze lunghe fino a circa un milione di basi e prevedere migliaia di segnali biologici. Tra questi ci sono l’espressione dei geni, lo splicing dell’RNA, l’accessibilità della cromatina, alcune modificazioni degli istoni, il legame dei fattori di trascrizione e altri processi coinvolti nella regolazione del genoma. Immaginiamo che un ricercatore trovi una variante molto semplice: in un determinato punto del DNA una A è stata sostituita da una G. AlphaGenome non risponde dicendo che quella persona svilupperà una specifica malattia, come l’Alzheimer, avrà un tumore o manifesterà una determinata caratteristica.

La domanda di base è un’altra: che cosa potrebbe succedere, in quella regione del genoma, se quella lettera cambiasse?

Il modello potrebbe suggerire, per esempio, che la variante interferisca con lo splicing di un gene, ne modifichi l’espressione oppure alteri un elemento regolatorio. Non è ancora una risposta definitiva, ma un punto di partenza, una pista. Ed è proprio il valore di quella pista che può fare la differenza in laboratorio: il ricercatore sa che cosa cercare e può progettare un esperimento per verificare se la previsione sia corretta.

Dalle singole predizioni a nove miliardi di possibilità

AlphaGenome Atlas nasce quando questa capacità viene portata su scala genomica. Il genoma umano di riferimento contiene circa tre miliardi di basi. In ogni posizione, la base presente potrebbe, almeno in teoria, essere sostituita da una qualsiasi delle altre tre. In totale si arriva quindi, in ordine di grandezza, a circa nove miliardi di possibili cambiamenti di una singola lettera. Testarli uno per uno in laboratorio sarebbe fuori da ogni scala realistica. DeepMind ha scelto quindi di calcolare in anticipo le predizioni di AlphaGenome per queste possibili varianti e raccoglierle in un’unica grande risorsa.

È qui che il termine “Atlas” acquista davvero senso.

AlphaGenome Atlas, proprio come un atlante geografico, prova a costruire una mappa dei possibili effetti molecolari delle varianti, offrendo ai ricercatori un punto da cui iniziare l’esplorazione. Se AlphaGenome è il modello che genera le predizioni, AlphaGenome Atlas è la risorsa che le rende disponibili e consultabili su scala genomica. L’Atlas occupa circa un petabyte di dati e, per ciascuna variante, può contenere migliaia di predizioni relative a diversi aspetti della regolazione del genoma. Comprende inoltre più di 2.500 motivi ricorrenti di sequenza, brevi schemi del DNA che ricompaiono in diverse regioni e che possono essere associati a funzioni regolatorie.

AVI: come trovare le varianti più interessanti

A questo punto emerge un altro problema: una mappa che contiene miliardi di possibilità rischia a sua volta di essere troppo grande per essere realmente utile. Bisogna capire quali varianti meritano maggiore attenzione. È qui che entra in gioco l’AlphaGenome Variant Impact score (AVI). L’AVI cerca di condensare in un unico punteggio diverse informazioni sul possibile impatto funzionale di una variante. Utilizza le predizioni di AlphaGenome e integra, quando è rilevante la componente proteica, anche informazioni provenienti da AlphaMissense, un altro modello sviluppato da DeepMind per studiare le varianti che modificano gli amminoacidi delle proteine. Il risultato non è una sentenza sulla pericolosità della variante, ma uno strumento per ordinarle e stabilire quali valga la pena analizzare più a fondo. Sono disponibili anche informazioni che aiutano a capire quali caratteristiche abbiano contribuito maggiormente al punteggio: per esempio, un possibile effetto sullo splicing, sull’espressione di un gene o sull’accessibilità della cromatina.

Dalla variante all’esperimento

Immaginiamo un ricercatore che stia studiando una malattia rara. Dopo aver sequenziato il genoma di un paziente si ritrova davanti non a una singola mutazione evidentemente responsabile, ma a un gran numero di varianti. Il problema, a quel punto, non è più trovare le differenze nel DNA. È decidere da quale cominciare.

L’AVI può aiutare a restringere il campo. Tra migliaia di possibilità, alcune varianti possono emergere come più interessanti e AlphaGenome può suggerire il possibile motivo.

Una variante potrebbe alterare lo splicing. Un’altra potrebbe interferire con l’espressione di un gene. Un’altra ancora potrebbe trovarsi in una regione regolatoria e modificarne l’attività. Da una lista apparentemente ingestibile si passa così a un numero più ristretto di ipotesi biologiche da controllare sperimentalmente. Un punteggio AVI alto, naturalmente, non significa che una variante provochi una malattia. Non è una diagnosi. È un modo per stabilire delle priorità.

Il problema del DNA non codificante

Uno dei campi nei quali AlphaGenome potrebbe risultare particolarmente utile è quello del DNA non codificante. Solo circa l’1-2% del genoma umano contiene sequenze che codificano direttamente proteine. Il resto comprende introni, regioni regolatorie, elementi strutturali e moltissime altre sequenze, alcune delle quali hanno funzioni note e altre ancora poco comprese. Se una mutazione cambia direttamente una proteina, almeno in prima battuta possiamo chiederci che cosa sia successo alla sua struttura o alla sua funzione. Una variante in una regione non codificante, invece, è spesso meno intuitiva. Può trovarsi lontano dal gene che influenza, agire soltanto in alcuni tipi cellulari oppure modificare processi di regolazione che non sono immediatamente visibili. Potrebbe cambiare l’espressione di un gene, alterare lo splicing, rendere una regione di DNA più o meno accessibile oppure interferire con il legame di una proteina regolatoria. Potrebbe anche non avere alcuna conseguenza biologicamente importante. AlphaGenome è stato sviluppato proprio per cercare di fare previsioni anche in questo territorio, che rappresenta ancora una delle parti più difficili della genetica da interpretare.

Malattie rare: dal sospetto al meccanismo biologico

Un esempio arriva proprio dallo studio delle malattie rare. In una collaborazione con ricercatori del Broad Institute e del consorzio GREGoR, l’AVI è stato usato per dare priorità a varianti che in precedenza erano state trascurate. Tra queste ne è emersa una nel gene DNM1, già noto per la sua associazione con gravi forme di encefalopatia epilettica. La previsione non si limitava a segnalare la variante come interessante. Suggeriva anche un possibile meccanismo: la creazione di un sito di splicing anomalo, con conseguenze sulla proteina prodotta. Gli esperimenti successivi hanno fornito evidenze a sostegno di questa interpretazione e hanno individuato anche varianti vicine con effetti simili. Il punto interessante è proprio questo: AlphaGenome non si limita a mettere un segno accanto a una variante. Può suggerire un motivo biologico per cui quella variante meriti attenzione. E quel motivo può diventare il punto di partenza per un esperimento.

Da un singolo genoma a decine di migliaia di persone

La stessa idea può essere utilizzata negli studi di popolazione. Gareth Hawkes, dell’Università di Exeter, ha applicato AlphaGenome Atlas ai dati genomici di oltre 54.000 partecipanti alla UK Biobank. Raggruppando varianti rare sulla base degli effetti molecolari previsti dal modello, ha individuato, secondo quanto riportato da DeepMind, il 22% in più di associazioni genetiche non codificanti. In un’altra analisi sull’indice di massa corporea, concentrandosi sull’1% delle varianti non codificanti considerate potenzialmente più impattanti, sono emerse 19 regioni genetiche da approfondire. Non sono stati trovati diciannove “geni dell’obesità”, né diciannove nuove cause della malattia. Sono stati individuati diciannove punti della mappa sui quali può avere senso concentrare altre ricerche.

L’IA non sostituisce il laboratorio

Il possibile cambiamento introdotto da strumenti di questo tipo riguarda quindi soprattutto il modo in cui viene organizzato il lavoro sperimentale. Dopo il sequenziamento si possono avere davanti migliaia, o persino milioni, di varianti. L’AVI può aiutare a ridurre il numero dei candidati. AlphaGenome può suggerire quale meccanismo biologico potrebbe essere coinvolto. Infine arriva il laboratorio, dove quelle ipotesi vengono messe alla prova. L’intelligenza artificiale, in questo scenario, non sostituisce l’esperimento. Serve piuttosto a scegliere con maggiore criterio quali esperimenti fare.

Dal database all’agente

DeepMind sta provando ad ampliare ulteriormente questa idea integrando AlphaGenome e Atlas con sistemi di intelligenza artificiale capaci di operare come agenti, tra cui Google Antigravity. Un sistema di questo tipo può interrogare l’Atlas, recuperare dati su diverse varianti, confrontarne le predizioni e produrre visualizzazioni utili all’analisi. Per un ricercatore potrebbe significare passare più rapidamente da una domanda a una prima lista ragionata di ipotesi da controllare. Ma la velocità con cui si genera un’ipotesi non cambia il modo in cui quella stessa ipotesi deve essere valutata.

I limiti di AlphaGenome

AlphaGenome non è uno strumento diagnostico e i suoi risultati devono essere interpretati nel corretto contesto biologico e, quando necessario, verificati sperimentalmente. Il modello non rappresenta tutta la complessità di un organismo. Gli effetti di elementi regolatori molto distanti sono ancora difficili da prevedere con precisione e alcuni fenomeni dipendono fortemente dal tessuto, dal tipo cellulare e dalle condizioni biologiche considerate. C’è poi un problema ancora più generale: un genoma reale contiene contemporaneamente milioni di differenze rispetto al genoma di riferimento, oltre a inserzioni, delezioni, varianti strutturali e combinazioni di cambiamenti che possono interagire tra loro. AlphaGenome è stato valutato soprattutto sulla capacità di prevedere gli effetti di singole varianti. Passare da questo livello alla previsione delle conseguenze di un intero genoma individuale è un problema molto più difficile. Per malattie come diabete, patologie cardiovascolari, molti tumori o disturbi neurodegenerativi, quasi mai tutto dipende da una singola variazione nel DNA. Il rischio nasce piuttosto dall’intreccio tra molti fattori: patrimonio genetico, età, sviluppo, fisiologia, ambiente ed esposizioni accumulate nel corso della vita. Ed è qui che il discorso torna inevitabilmente a Gattaca.

Il punto in cui Gattaca torna attuale

Una tecnologia capace di interpretare sempre meglio il DNA non è automaticamente una tecnologia capace di prevedere una persona. Nel film, il problema non è soltanto che esistono strumenti genetici estremamente avanzati, ma che la società decide di attribuire alle loro previsioni un valore quasi assoluto. Il protagonista viene giudicato non per quello che riesce a fare, ma per ciò che il suo genoma lascia prevedere.

Il rischio diventa identità.

Ed è proprio qui che una tecnologia capace di rendere sempre più interpretabili le variazioni del DNA apre inevitabilmente una serie di questioni etiche.

Il rischio della discriminazione genetica

Uno scenario particolarmente delicato riguarda la discriminazione genetica.

Se in futuro strumenti di questo tipo contribuissero a rendere più semplice l’identificazione di varianti associate a determinati rischi biologici, si potrebbe essere tentati di utilizzare queste informazioni non soltanto per studiare o prevenire le malattie, ma anche per classificare le persone. Un datore di lavoro, un’assicurazione o un’altra istituzione potrebbero, in assenza di adeguate protezioni, attribuire un peso eccessivo a una predisposizione genetica, trattando un rischio come se fosse una certezza.

Ed è esattamente questo che rende Gattaca particolarmente attuale di fronte a strumenti come Atlas.

Genoma e privacy

C’è poi la questione della privacy genetica. Il genoma contiene informazioni particolarmente sensibili e, a differenza di molte altre informazioni personali, dice qualcosa non soltanto sull’individuo da cui proviene, ma indirettamente anche sui suoi familiari. Più diventiamo capaci di interpretarlo, più diventa importante stabilire chi possa accedere a quei dati e per quali scopi.

La selezione embrionale e il confine etico

La genomica predittiva rende inevitabile anche il dibattito sulla selezione embrionale. AlphaGenome non è uno strumento per scegliere il “migliore” embrione e non può prevedere in modo affidabile il futuro di un individuo. Ma strumenti sempre più sofisticati per interpretare il DNA rendono più concreta una domanda che Gattaca aveva già posto:

fino a che punto è accettabile utilizzare l’informazione genetica per scegliere quali caratteristiche evitare o preferire prima della nascita?

Leggere il DNA non significa leggere il destino

AlphaGenome ci avvicina a Gattaca perché dimostra quanto siamo diventati bravi a estrarre informazioni dal DNA. Allo stesso tempo, però, ce ne allontana, perché più impariamo a studiare il genoma, più diventa evidente la distanza che separa l’effetto molecolare di una variante dalla vita di una persona. Tra una lettera del DNA e una malattia ci sono geni, cellule, tessuti, sviluppo, fisiologia e ambiente.

Tra una lettera del DNA e il destino di un essere umano c’è ancora molto di più.

AlphaGenome può indicare ai ricercatori dove potrebbe valere la pena guardare, quali varianti sembrano più interessanti e quale meccanismo biologico potrebbe esserci dietro. Poi bisogna andare a vedere se quella strada porta davvero da qualche parte. Ed è forse proprio questa la lezione più interessante, anche pensando a Gattaca:

Possiamo leggere il DNA con una precisione sempre maggiore, ma da qui a prevedere il futuro di una persona c’è ancora una distanza enorme.