Răspunsul vine de la Sakana AI, un laborator de cercetare care a atras atenția prin abordările sale inovatoare. Jeffrey Seely și Julian Gould, doi cercetători de acolo, au propus recent o metodă numită PC-ALM (Augmented Lagrangian Predictive Coding), care ar putea schimba regulile jocului. În esență, PC-ALM este o variantă a codificării predictive, o tehnică inspirată din neuroștiință, care tratează învățarea ca pe un proces de minimizare a erorilor locale la fiecare strat. Spre deosebire de backpropagation, care propagă eroarea globală înapoi prin rețea, codificarea predictivă actualizează fiecare strat pe baza informațiilor locale, ceea ce o face mult mai eficientă din punct de vedere computațional și mai ușor de paralelizat.
Dar până acum, codificarea predictivă avea un dezavantaj major: nu reușea să atingă performanțele backpropagation-ului, mai ales în rețelele adânci. Gradienții calculați local erau aproximativi, iar erorile se acumulau pe măsură ce rețeaua devenea mai adâncă. PC-ALM rezolvă această problemă printr-un truc matematic elegant: atașează un multiplicator Lagrange la fiecare constrângere de strat. Acest multiplicator acționează ca un „gardian” care ajustează actualizările locale astfel încât, în rețelele liniare, gradienții obținuți să fie exact aceiași cu cei din backpropagation. Practic, PC-ALM păstrează avantajele locale ale codificării predictive, dar recuperează precizia backpropagation-ului.
Rezultatele sunt impresionante. În experimentele lor, cercetătorii au testat PC-ALM pe rețele cu lățimi și adâncimi variate, de la 8 la 128 de neuroni pe strat. La un buget de inferență de T = 2L (unde L este numărul de straturi), PC-ALM a reușit să egaleze performanțele backpropagation-ului. Mai mult, într-o celulă de referință, similaritatea cosinus a gradienților cu cei din backpropagation a crescut de la 0.604 la 0.909, ceea ce indică o aliniere aproape perfectă a direcțiilor de actualizare. Dar poate cea mai spectaculoasă realizare este antrenarea unei rețele reziduale cu 1000 de straturi pe MNIST, un set de date clasic de recunoaștere a cifrelor scrise de mână. PC-ALM a reușit să antreneze această rețea uriașă, ajungând la o precizie la doar aproximativ 2 puncte procentuale sub cea obținută cu backpropagation. Pentru o metodă locală, care nu are acces la gradientul global, acest rezultat este remarcabil.
De ce este atât de importantă această realizare? În primul rând, pentru că deschide uși către antrenarea unor rețele mult mai adânci decât cele actuale, fără a fi limitat de memoria și puterea de calcul necesare pentru backpropagation. În al doilea rând, pentru că aduce inteligența artificială mai aproape de biologie. Creierul uman nu folosește backpropagation; el învață prin mecanisme locale, cum ar fi plasticitatea sinaptică. PC-ALM este un pas concret către algoritmi de învățare care imită mai fidel modul în care funcționează neuronii reali. În al treilea rând, PC-ALM este disponibil sub licență MIT, ceea ce înseamnă că oricine poate accesa codul JAX și poate experimenta cu el. Aceasta ar putea accelera cercetarea în domeniu, permițând altor echipe să construiască pe baza acestor idei.
Desigur, există și limitări. PC-ALM a fost testat în principal pe rețele liniare și pe MNIST, un set de date relativ simplu. Rămâne de văzut cum se comportă pe sarcini mai complexe, cum ar fi procesarea imaginilor de înaltă rezoluție sau limbajul natural. De asemenea, bugetul de inferență T = 2L poate fi costisitor pentru rețele foarte adânci, deși este comparabil cu costul backpropagation-ului. Cu toate acestea, rezultatele sunt suficient de promițătoare pentru a atrage atenția comunității științifice.
Într-o eră în care modelele de inteligență artificială devin tot mai mari și mai costisitoare de antrenat, metodele locale precum PC-ALM ar putea oferi o alternativă sustenabilă. Imaginați-vă rețele cu zeci de mii de straturi, antrenate eficient pe hardware distribuit, fără a fi nevoie de sincronizarea globală a gradientilor. Sau imaginați-vă dispozitive edge, cu resurse limitate, care pot învăța continuu din date noi, folosind algoritmi locali. PC-ALM nu este doar o curiozitate academică; este un pas concret către o inteligență artificială mai scalabilă, mai eficientă și mai inspirată din natură.
De ce este important:
Această cercetare demonstrează că backpropagation, deși dominant, nu este singura cale de a antrena rețele neuronale. PC-ALM oferă o alternativă locală care poate egala performanțele backpropagation-ului în anumite condiții, deschizând calea către rețele mai adânci și mai eficiente. În plus, prin publicarea codului sub licență MIT, Sakana AI contribuie la democratizarea cercetării în domeniu, permițând altor cercetători să exploreze și să îmbunătățească această metodă. Pe termen lung, astfel de inovații ar putea reduce costurile de antrenare ale modelelor AI și ar putea aduce algoritmii mai aproape de mecanismele biologice, ceea ce ar putea duce la progrese semnificative în domenii precum calculul neuromorfic și învățarea continuă.