Modelele AI pentru proteine tocmai au primit un avantaj neașteptat

publicat de Florin Mitrea
6 vizualizări
Modelele AI pentru proteine tocmai au primit un avantaj neașteptat

Pe scurt

Un consorțiu format din companii farmaceutice a testat ce se întâmplă atunci când sunt adăugate peste câteva zeci de mii de structuri proteice proprietare. Modelele AI pentru proteine antrenate astfel au prezis corect peste jumătate dintre structurile dintr-un set de testare, în timp ce versiunea publică a OpenFold3 a reușit acest lucru pentru aproximativ o treime. Diferența arată cât de importantă este calitatea și diversitatea datelor pentru următoarea generație de inteligență artificială aplicată biologiei.

Inteligența artificială a schimbat deja modul în care cercetătorii privesc structura proteinelor. Sisteme precum AlphaFold au demonstrat că algoritmii pot prezice cu o precizie impresionantă felul în care lanțurile de aminoacizi se pliază în structuri tridimensionale, oferind cercetătorilor un instrument nou pentru explorarea mecanismelor vieții și pentru descoperirea unor medicamente.

Însă aceste sisteme se confruntă cu o problemă mai puțin spectaculoasă decât algoritmii înșiși: datele. O mare parte dintre informațiile experimentale disponibile public provin din baze de date precum Protein Data Bank, însă acestea conțin relativ puține exemple în care proteinele sunt surprinse în interacțiune cu molecule asemănătoare medicamentelor. Exact aici se află una dintre cele mai importante surse de informații pentru industria farmaceutică.

Un nou experiment realizat de un consorțiu de companii farmaceutice arată cât de mult poate conta această sursă ascunsă de date. Cercetătorii au antrenat un model AI folosind peste 20.000 de structuri proteice proprietare, iar rezultatele au fost semnificativ mai bune decât cele obținute de modele antrenate exclusiv cu date publice.

Problema pe care o ascunde succesul AlphaFold

Pentru a înțelege importanța rezultatului, trebuie privit mai întâi modul în care a evoluat predicția structurii proteinelor.

Proteinele sunt molecule extrem de complexe, formate din lanțuri de aminoacizi care se pliază în structuri tridimensionale. Forma rezultată determină în mare măsură funcția proteinei. Pentru cercetători, cunoașterea acestei forme este esențială atunci când încearcă să înțeleagă o boală sau să conceapă o moleculă capabilă să influențeze activitatea unei proteine.

Timp de decenii, structura proteinelor a fost determinată experimental, prin metode precum cristalografia cu raze X sau microscopia crio-electronică. Procesul este însă costisitor și dificil.

Aici a intervenit inteligența artificială. AlphaFold a demonstrat că modelele de învățare automată pot utiliza structurile deja cunoscute pentru a învăța regulile care guvernează plierea proteinelor. Baza acestei revoluții a fost, în mare parte, Protein Data Bank, o arhivă publică ce conține peste 200.000 de structuri proteice determinate experimental. Importanța acestei contribuții la biologie structurală a fost recunoscută inclusiv prin acordarea Premiului Nobel pentru Chimie din 2024.

Însă succesul a creat și o nouă problemă. Nu toate tipurile de structuri biologice sunt reprezentate în aceeași măsură în bazele publice. Iar pentru dezvoltarea medicamentelor nu este suficient să știm cum arată o proteină izolată. Este mult mai important să știm cum interacționează ea cu moleculele care ar putea deveni medicamente.

Aceste informații există în cantități mari în laboratoarele companiilor farmaceutice. Doar că nu sunt, în general, publice.

O comoară de date ascunsă în laboratoarele farmaceutice

În procesul de descoperire a medicamentelor, companiile farmaceutice determină numeroase structuri ale proteinelor legate de molecule candidate. Aceste molecule, numite liganzi, pot modifica activitatea proteinelor și reprezintă una dintre piesele centrale ale dezvoltării medicamentelor.

Structurile sunt obținute prin metode experimentale precum cristalografia cu raze X și microscopia crio-electronică. O mare parte dintre ele nu ajung în bazele publice deoarece sunt asociate unor programe de cercetare aflate în desfășurare sau unor proiecte comerciale confidențiale.

Prin urmare, se produce o situație paradoxală. Cercetătorii dispun de modele AI din ce în ce mai sofisticate, dar o parte importantă a datelor de care aceste modele ar avea nevoie pentru a deveni și mai bune se află în arhive private.

În articol publicat în revista Nature notează că dimensiunea totală a acestor colecții este necunoscută, iar unele estimări sugerează că ele ar putea conține chiar mai multe date decât Protein Data Bank.

Pentru modelele AI pentru proteine, această situație reprezintă o limitare importantă. Un algoritm poate fi extraordinar de performant în identificarea tiparelor pe care le-a întâlnit în timpul antrenamentului, dar performanța poate scădea atunci când este pus în fața unor molecule foarte diferite de cele pe care le cunoaște. În cazul descoperirii medicamentelor, tocmai aceste situații dificile pot fi cele mai importante.

20.167 de structuri proteice schimbă rezultatul

Pentru a testa dacă datele proprietare ale industriei pot îmbunătăți modelele de inteligență artificială, mai multe companii farmaceutice au format anul trecut AI Structural Biology Network, o colaborare destinată explorării acestei probleme. Printre participanți se numără AbbVie și Astex Pharmaceuticals, alături de alte companii.

Cercetătorii au pornit de la OpenFold3, o replică open-source a AlphaFold 3, și au adăugat la procesul de antrenare 20.167 de structuri proteice în care proteinele erau legate de potențiale medicamente sau alți liganzi.

Un aspect important este că datele au fost utilizate astfel încât informațiile proprietare ale companiilor să rămână confidențiale. Cu alte cuvinte, cercetătorii au încercat să obțină avantajul combinării seturilor de date fără să fie nevoie ca fiecare companie să-și dezvăluie public arhivele.

Rezultatul a fost impresionant. Modelul antrenat cu datele suplimentare a fost testat pe 1.056 de structuri proteină–ligand care nu fuseseră utilizate în antrenare. Mai mult de jumătate dintre aceste structuri au fost prezise cu un nivel ridicat de acuratețe.

Prin comparație, versiunea publică a OpenFold3, antrenată doar cu datele disponibile public, a atins același nivel de performanță pentru aproximativ o treime dintre structuri. Un alt model open-source, Boltz-2, a obținut aproximativ 40%.

Diferența arată că problema nu este neapărat lipsa unor algoritmi suficient de sofisticați. Uneori, algoritmul are nevoie pur și simplu de mai multe exemple relevante.

Ce ar putea însemna pentru viitorul medicamentelor

Este tentant să privim aceste rezultate și să spunem că inteligența artificială va accelera automat apariția unor medicamente noi. Realitatea este ceva mai nuanțată.

Un model care prezice mai bine structura unui complex proteină–moleculă nu produce, prin el însuși, un medicament. Descoperirea și dezvoltarea unui tratament presupun numeroase etape, de la identificarea unei ținte biologice și proiectarea moleculelor candidate până la experimente de laborator, studii preclinice și, în cele din urmă, studii clinice.

Valoarea unui astfel de model apare însă mult mai devreme în acest proces. Dacă inteligența artificială poate identifica mai bine moleculele care au șanse să se lege de o anumită proteină, cercetătorii pot restrânge numărul de variante care trebuie testate experimental. În loc să exploreze orbește un spațiu molecular uriaș, pot folosi predicțiile pentru a decide unde merită să investească timp și resurse. Cu cât predicțiile devin mai bune, cu atât această selecție poate deveni mai eficientă.

De aceea, experimentul AISB este interesant dincolo de cifrele sale. El sugerează că următoarea etapă a revoluției AI în biologie ar putea depinde de o combinație între algoritmi performanți și acces la seturi de date pe care până acum comunitatea științifică nu le-a avut la dispoziție.

În același timp, experimentul scoate la iveală o dilemă care va deveni probabil tot mai importantă. Companiile farmaceutice au motive comerciale serioase să păstreze aceste date private, dar cercetarea științifică ar beneficia de pe urma unor baze de date mai bogate și mai diverse.

O posibilă soluție este dezvoltarea unor proiecte care să producă și să publice noi structuri. Un astfel de proiect este OpenBind, care beneficiază de o finanțare de până la 8 milioane de lire sterline din partea guvernului britanic și a început deja să pună la dispoziție noi structuri proteice, cu alte mii aflate în pregătire. Poate că acesta este, de fapt, unul dintre cele mai importante mesaje ale experimentului.

Revoluția AlphaFold a arătat cât de mult poate face inteligența artificială atunci când primește suficiente date pentru a învăța regulile unei probleme biologice extrem de complexe. Noua generație de modele AI pentru proteine ar putea merge mai departe dacă oamenii de știință reușesc să le ofere exact acele exemple care lipsesc din arhivele publice.

Iar unele dintre cele mai valoroase exemple nu trebuie neapărat inventate de la zero. Ele există deja, în mii de laboratoare din întreaga lume. Provocarea este să găsim o modalitate prin care aceste cunoștințe să poată contribui la progresul științific fără ca informațiile confidențiale să fie pierdute.

Experimentul prezentat de Nature arată că acest lucru este posibil. Deocamdată, rezultatele trebuie privite cu prudență: studiul nu a trecut încă prin evaluarea colegială, iar modelul rezultat nu este disponibil public. Dar direcția este interesantă. Dacă datele sunt una dintre resursele care limitează evoluția inteligenței artificiale în biologie, atunci următorul salt nu va veni neapărat dintr-un model cu și mai mulți parametri.

Ar putea veni dintr-o idee mult mai simplă și, în același timp, mult mai dificilă: să punem la dispoziția inteligenței artificiale mai multe dintre lucrurile pe care știința le-a descoperit deja.

Sursa: Nature

Din aceeași categorie

Acest site folosește cookies pentru a îmbunătăți experiența de navigare. Acceptă Detalii