Filtrează articolele

AI

Sakana AI revoluționează învățarea automată: rețele dual-stream antrenate fără backpropagation, cu 96,7% pe MNIST și 61,7% pe CIFAR-10

Sakana AI revoluționează învățarea automată: rețele dual-stream antrenate fără backpropagation, cu 96,7% pe MNIST și 61,7% pe CIFAR-10
În lumea inteligenței artificiale, backpropagation-ul a fost, timp de decenii, coloana vertebrală a antrenării rețelelor neuronale. Fără el, modelele moderne precum GPT sau Stable Diffusion n-ar fi putut exista. Dar o echipă de cercetători de la Sakana AI, un startup japonez specializat în metode bio-inspirate, tocmai a demonstrat că se poate și altfel. Printr-o tehnică numită „Error Diffusion” (difuzia erorii), ei au reușit să antreneze rețele dual-stream (cu două fluxuri paralele) care respectă constrângerile Dale – adică fiecare neuron are o singură conexiune, nu multiple – și au atins performanțe remarcabile: 96,7% acuratețe pe setul de date MNIST (recunoașterea cifrelor scrise de mână) și 61,7% pe CIFAR-10 (clasificarea imaginilor color). Totul fără backpropagation.

Ce înseamnă „fără backpropagation”?


Backpropagation-ul (propagarea inversă a erorii) este algoritmul standard prin care o rețea neuronală își ajustează ponderile: se calculează gradientul erorii față de fiecare parametru și se actualizează ponderile în direcția care minimizează eroarea. Deși extrem de eficient, backpropagation-ul are limitări: necesită memorarea activărilor din timpul propagării înainte, ceea ce consumă multă memorie, și nu este considerat biologic plauzibil – creierul uman nu „propagă erori” înapoi prin sinapse.

Sakana AI propune o alternativă: Error Diffusion. În loc să calculeze gradienți, algoritmul „difuzează” eroarea de la ieșire către intrări printr-un mecanism local, similar cu modul în care undele de activare se propagă în rețelele neuronale biologice. Fiecare neuron primește o „corecție” bazată pe eroarea locală și o transmite mai departe, fără a fi nevoie de o derivată globală.

Rețele dual-stream și constrângerile Dale


O inovație cheie a acestei lucrări este utilizarea rețelelor dual-stream – două fluxuri paralele de procesare care interacționează. Un flux procesează datele de intrare, iar celălalt procesează erorile. Această arhitectură permite ca eroarea să fie „difuzată” în timp real, fără a stoca activări anterioare.

Constrângerile Dale (numite după Henry Dale, un neurobiolog) impun ca fiecare neuron să elibereze același set de neurotransmițători la toate sinapsele sale. În termeni de rețele neuronale artificiale, asta înseamnă că fiecare neuron are o singură conexiune (un singur „weight”) care este folosită atât pentru propagarea înainte, cât și pentru cea înapoi. Aceasta simplifică drastic arhitectura și o face mai apropiată de biologie.

Rezultatele: 96,7% pe MNIST, 61,7% pe CIFAR-10


Pentru a testa metoda, cercetătorii au antrenat rețele dual-stream pe două seturi de date clasice: MNIST (imagini alb-negru de 28x28 pixeli cu cifre) și CIFAR-10 (imagini color de 32x32 pixeli cu 10 clase, cum ar fi avioane, mașini, păsări etc.).

Pe MNIST, rețeaua a atins 96,7% acuratețe – un rezultat excelent, având în vedere că modelele clasice cu backpropagation obțin de obicei peste 99%. Diferența de aproximativ 2-3% este acceptabilă, mai ales că metoda nouă nu folosește backpropagation și are constrângeri suplimentare.

Pe CIFAR-10, rezultatul de 61,7% este mai modest comparativ cu modelele moderne (care depășesc 90%), dar este impresionant pentru o rețea antrenată fără backpropagation și cu arhitectură dual-stream. De fapt, este unul dintre cele mai bune rezultate raportate vreodată pentru antrenamentul fără backpropagation pe CIFAR-10.

De ce este important?


Această descoperire are implicații profunde pentru domeniul inteligenței artificiale. În primul rând, demonstrează că backpropagation-ul nu este singura cale de a antrena rețele neuronale performante. Error Diffusion oferă o alternativă care consumă mult mai puțină memorie (nu trebuie stocate activările) și este mai ușor de implementat pe hardware specializat, cum arfi cipurile neuromorfe.

În al doilea rând, rețelele dual-stream cu constrângeri Dale sunt mult mai apropiate de modul în care funcționează creierul real. Acest lucru ar putea deschide calea către modele AI care învață mai eficient, cu mai puține date și cu un consum energetic redus.

În al treilea rând, succesul pe MNIST și CIFAR-10 sugerează că metoda poate fi scalată la seturi de date mai mari și sarcini mai complexe, cum ar fi recunoașterea obiectelor în imagini sau procesarea limbajului natural. Desigur, mai sunt multe provocări: performanța pe CIFAR-10 este încă sub cea a metodelor clasice, iar scalabilitatea rămâne de demonstrat.

Ce urmează?


Sakana AI a publicat codul și ponderile antrenate ca open-source, permițând comunității să reproducă și să extindă rezultatele. Următorii pași includ aplicarea Error Diffusion la rețele mai adânci, la date nestructurate (text, audio) și la învățarea prin consolidare. De asemenea, cercetătorii explorează combinarea acestei metode cu tehnici de regularizare și augmentare a datelor pentru a reduce decalajul față de backpropagation.

În concluzie, Sakana AI a demonstrat că există viață dincolo de backpropagation. Error Diffusion și rețelele dual-stream reprezintă o direcție promițătoare pentru o AI mai eficientă, mai biologică și mai accesibilă. Rămâne de văzut dacă această abordare va deveni un standard în industrie sau va rămâne o curiozitate academică. Cert este că a stârnit deja un val de interes și dezbateri în comunitatea de cercetare.

De ce este important:


Această lucrare este importantă deoarece oferă o alternativă viabilă la backpropagation, algoritmul dominant de antrenare a rețelelor neuronale. Prin eliminarea necesității de a stoca activări și prin utilizarea unei arhitecturi mai simple (dual-stream, constrângeri Dale), metoda Error Diffusion reduce consumul de memorie și energia necesară, făcând AI mai sustenabilă. În plus, apropierea de mecanismele biologice ale creierului ar putea duce la descoperiri fundamentale în neuroștiință și la crearea unor sisteme AI care învață mai natural și mai eficient. Rezultatele obținute pe MNIST și CIFAR-10, deși nu ating încă performanța metodelor clasice, sunt suficient de bune pentru a demonstra fezabilitatea abordării și pentru a deschide noi direcții de cercetare.

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.