
Google DeepMind je predstavil novo orodje umetne inteligence, ki lahko napoveduje, kaj bi se lahko zgodilo na molekularni ravni, če bi spremenili posamezno »črko« našega genetskega zapisa. Nova podatkovna zbirka AlphaGenome Atlas vsebuje napovedi za približno devet milijard možnih sprememb v človeškem genomu in raziskovalcem omogoča, da precej hitreje ocenijo, kako bi posamezne genetske različice lahko vplivale na različna tkiva in procese v celicah. Orodje naj bi bilo predvsem pomoč pri enem najzahtevnejših vprašanj sodobne genetike: kako spremembe v zaporedju DNK vplivajo na delovanje celic in razvoj bolezni.
Zemljevid milijard možnih sprememb DNK
Google DeepMind je 8. septembra predstavil prosto dostopno podatkovno zbirko AlphaGenome Atlas, ki temelji na modelu umetne inteligence AlphaGenome. Atlas vsebuje podatke o približno devetih milijardah možnih sprememb človeškega genetskega zapisa ter napovedi njihovih učinkov na različna tkiva in celične procese. Poleg podrobnejših podatkov sistem za posamezno različico izračuna tudi preprostejšo oceno njenega možnega biološkega vpliva, kar raziskovalcem omogoča hitrejše razvrščanje genetskih sprememb glede na njihov potencialni pomen.
Človeški genom sestavlja približno tri milijarde parov baz oziroma »črk« genetskega zapisa. Razumevanje, kako je ta ogromna količina informacij organizirana, kako jo celice berejo in kako iz nje nastane delujoč človeški organizem, ostaja eno temeljnih vprašanj genetike. DeepMind je že leto prej predstavil AlphaGenome, model, ki napoveduje, kako lahko sprememba zaporedja DNK vpliva na različne molekularne in celične procese. AlphaGenome Atlas zdaj te napovedi približuje precej širšemu krogu raziskovalcev.

Zmogljivo orodje, ki pa nima vseh odgovorov
»Videti je kot odličen vir,« je za Live Science povedal Greg Findlay, vodja raziskovalne skupine na londonskem Francis Crick Institute, ki pri projektu ni sodeloval. Kljub temu strokovnjaki opozarjajo, da AlphaGenome še ne more zanesljivo napovedati vseh posledic posamezne spremembe v DNK. Model lahko denimo dobro prepozna nekatere genetske različice, ki bi lahko imele pomemben biološki učinek, težje pa določi, kako velik bo ta učinek in kateri gen bo sprememba dejansko prizadela. Poseben izziv predstavljajo regulatorna območja DNK, ki lahko vplivajo na gene, od katerih so v genomu precej oddaljena. »To ni nekakšen sveti gral,« je zato poudarila Tuuli Lappalainen, profesorica genomike na KTH Royal Institute of Technology v Stockholmu. Njeno opozorilo je pomembno predvsem zato, ker napoved modela še ni dokaz, da bo določena genetska sprememba v celici ali človeškem organizmu res povzročila predvideni učinek.
Lappalainen in njena raziskovalna skupina AlphaGenome že približno leto uporabljajo za proučevanje posledic genetskih različic. Kot pojasnjuje, uporaba računalniških modelov za napovedovanje njihovih učinkov sama po sebi ni nova. Prednost AlphaGenome je predvsem v tem, da lahko spremembo posameznega para baz obravnava v kontekstu zelo dolgega odseka DNK in tako zajame več regulatornih povezav, kot so jih lahko številni starejši modeli. DeepMind navaja, da model pri več nalogah dosega boljše rezultate od prejšnjih pristopov, vendar njegove napovedi še vedno zahtevajo preverjanje z laboratorijskimi poskusi. AlphaGenome Atlas je zato najbolje razumeti kot orodje, ki raziskovalcem pomaga hitreje prepoznati genetske različice, vredne nadaljnjega raziskovanja, ne pa kot sistem, ki bi lahko sam dokončno določil, ali je določena sprememba DNK škodljiva ali povzroča bolezen.

Večina naše DNK ne kodira beljakovin
Približno 98 odstotkov človeške DNK je nekodirajoče, kar pomeni, da je celični mehanizmi ne uporabljajo neposredno kot navodilo za izdelavo beljakovin. Nekoč so velik del nekodirajoče DNK pogosto obravnavali kot nekakšno »odvečno« oziroma »junk« DNK, danes pa genetiki vedo, da imajo številna nekodirajoča območja pomembne regulatorne naloge. Med drugim sodelujejo pri določanju tega, kdaj, kje in v kakšni meri se bodo posamezni geni izražali.
Težava je v tem, da regulatorna navodila niso vedno urejeno razporejena neposredno ob genu, na katerega vplivajo. Posamezni regulatorni elementi so lahko od svojih ciljnih genov precej oddaljeni. AlphaGenome lahko zato pri analizi spremembe enega samega para baz upošteva do milijon parov baz okoliškega zaporedja. Tako lahko zajame precej širši del regulatornega okolja posameznega gena, kot so ga lahko številni prejšnji modeli.
Atlas raziskovalcem olajša dostop do napovedi
Velika zmogljivost AlphaGenome je imela do zdaj tudi praktično slabost. Raziskovalci so za uporabo modela potrebovali znanje bioinformatike in izkušnje z njegovim programskim vmesnikom, ki jih številni genetiki nimajo. Izračunavanje posledic velikega števila genetskih sprememb je bilo poleg tega računsko zelo zahtevno in je lahko močno obremenilo računalniške zmogljivosti posameznih raziskovalnih ustanov.
Pri pripravi AlphaGenome Atlasa so raziskovalci DeepMinda zato vnaprej izračunali vse možne zamenjave posameznih baz in rezultate združili v prosto dostopno zbirko. Skupna količina podatkov znaša približno en petabajt oziroma milijon gigabajtov. Raziskovalcem tako teh izračunov ni več treba izvajati na lastnih računalnikih, do rezultatov pa lahko dostopajo prek uporabniku prijaznejšega spletnega vmesnika. »Res vam ni treba biti strokovnjak za te metode, da lahko odprete stran in nekaj poiščete v brskalniku,« je pojasnila Lappalainen.

Preprostejša ocena možnega vpliva mutacije
Dodatna novost je tako imenovana ocena AlphaGenome Variant Impact, s katero sistem napove, kako velik bi lahko bil biološki učinek določene spremembe v DNK. DeepMind je v spremljajočem prednatisu pokazal, da je bilo s to oceno mogoče v kliničnem naboru podatkov razlikovati med različicami, povezanimi z boleznimi, in takšnimi, ki veljajo za neškodljive.
Preprosta številčna ocena ima sicer tudi omejitve, saj lahko zelo zapleten biološki učinek strne v eno samo vrednost in s tem oteži podrobnejšo razlago posameznega primera. Kljub temu Lappalainen meni, da bi lahko bila koristna predvsem za raziskovalce, ki imajo pred seboj daljši seznam genetskih različic in želijo hitro ugotoviti, katerim bi bilo smiselno nameniti več pozornosti.
Umetna inteligenca še ne vidi vseh posledic
AlphaGenome Atlas kljub svoji zmogljivosti ni popoln napovedovalec. Prednatis raziskave, objavljen 11. septembra pod vodstvom Katie Pollard, direktorice Gladstone Institute of Data Science and Biotechnology in profesorice na Univerzi Kalifornije v San Franciscu, je pokazal, da je AlphaGenome sicer dobro prepoznaval vzročno pomembne mutacije, vendar je njihov dejanski vpliv pogosto podcenjeval.
Raziskovalci so ugotovili tudi, da model ni vedno pravilno povezal sprememb v regulatornih območjih z geni, katerih delovanje ta območja nadzorujejo. Težava je bila izrazitejša takrat, ko sta bila regulatorni element in njegov ciljni gen v genomu bolj oddaljena. »Morda nekoliko naivno upam, da bodo ljudje te napovedi jemali z ustrezno mero previdnosti,« je dejala Lappalainen.

Laboratorijski poskusi ostajajo nepogrešljivi
Kljub omejitvam je AlphaGenome Atlas del širšega premika genetike proti raziskovanju, ki temelji na obsežnih podatkovnih zbirkah, računalniških napovedih in sodelovanju med različnimi raziskovalnimi področji. Orodja umetne inteligence lahko znanstvenikom pomagajo bistveno hitreje pregledovati ogromno število genetskih različic in izbrati tiste, ki so najzanimivejše za nadaljnje raziskovanje. Vendar računalniška napoved sama po sebi še ne more nadomestiti biološkega poskusa.
Lappalainen zato opozarja, da bo moral razvoj podobnih sistemov spremljati tudi nadaljnje delo v laboratoriju. Eksperimentalno preverjanje napovedi je počasnejše in zahtevnejše od iskanja po zbirki AlphaGenome Atlas, vendar je nujno za ugotavljanje, ali so napovedani učinki genetskih različic dejansko prisotni v živih celicah in organizmih. Prav takšni podatki so obenem potrebni za izboljševanje prihodnjih modelov umetne inteligence. »V biologiji smo še vedno zelo omejeni s količino podatkov, te podatke pa je treba ustvariti,« je sklenila Lappalainen.
Novinar
