Filtrează articolele

AI

Experții susțin că exploatarea modelului Fable de la Anthropic nu este modul în care Kimi K3 a devenit atât de bun

Experții susțin că exploatarea modelului Fable de la Anthropic nu este modul în care Kimi K3 a devenit atât de bun
În ultimele săptămâni, o dispută aprinsă a cuprins lumea inteligenței artificiale, după ce oficiali americani au acuzat compania chineză Moonshot că ar fi copiat modelul Fable al Anthropic pentru a-și construi propriul LLM, Kimi K3. Consilierul științific al Casei Albe, Michael Kratsios, a declarat public că „distilarea industrială la scară largă, menită să fure tehnologia proprietară a SUA și să submineze cercetarea americană, este inacceptabilă”. În spatele acestor acuzații se află o întrebare fundamentală: poate o simplă distilare să producă un model la fel de puternic ca Kimi K3? Experții intervievați de TechCrunch sunt sceptici și oferă o perspectivă mult mai nuanțată.

Kimi K3 este, fără îndoială, unul dintre cele mai avansate modele open-weight disponibile în prezent. Lansat de Moonshot, acesta a atras atenția nu doar prin performanțe remarcabile, ci și prin viteza cu care a fost dezvoltat. Kratsios a sugerat că Moonshot a folosit cipuri care nu sunt autorizate pentru export în China și a copiat modelul Fable al Anthropic, lansat abia pe 1 iulie. Însă, potrivit cercetătorilor, această teorie are fisuri serioase.

Braden Hancock, cercetător la Laude Institute și co-fondator al Snorkel AI, a explicat pentru TechCrunch: „Nu cred că poți obține un model atât de puternic și atât de rapid doar prin distilare strictă din Fable. Nici măcar nu ai timp suficient. Fable este disponibil public de pe 1 iulie. Nu poți distila atât de multe date, antrena un model și lansa în două săptămâni.” Această observație subliniază o problemă logică evidentă: distilarea necesită timp și resurse considerabile, iar fereastra de lansare a Kimi K3 este mult prea scurtă pentru a fi rezultatul exclusiv al copierii.

Nathan Lambert, cercetător AI la Allen Institute for AI, a oferit o altă perspectivă într-un podcast recent: „Am fost de părere că distilarea devine din ce în ce mai puțin relevantă pe măsură ce modelele chinezești se apropie de frontiera tehnologică și regimul de antrenare se mută spre învățare prin întărire (reinforcement learning). Dacă ar fi fost vorba doar de distilare, toată lumea ar fi putut să ajungă ușor din urmă un model precum GLM sau K3 folosind datele sale pentru distilare. Dar nu am văzut acest lucru, și nu îl vom vedea doar din fine-tuning supervizat.”

Pentru a înțelege mai bine, trebuie să explicăm ce înseamnă distilarea în contextul LLM-urilor. Procesul implică interogarea sistematică a unui model țintă pentru a genera date care pot fi folosite la post-antrenare. Uneori, acest lucru presupune solicitarea explicită a modelului de a-și articula lanțul de gândire, pentru a înțelege cum rezolvă probleme. Alteori, întrebările și răspunsurile sunt folosite pentru a antrena un nou model printr-un proces numit fine-tuning supervizat (SFT). Lambert consideră că SFT este locul unde „modelul își însușește manierele”, dar beneficiile sale devin din ce în ce mai puțin importante pe măsură ce modelele devin mai complexe.

Pentru a distila capacități similare cu cele ale lui Fable, ar fi necesare tehnici de învățare prin întărire. În multe cazuri, asta înseamnă ca un agent al modelului mai mare să evalueze răspunsurile modelului mai mic și să ajusteze în funcție de notă. Tehnicile avansate necesită o infrastructură semnificativă. „Rulările mari de învățare prin întărire pot necesita zeci de milioane de agenți. Folosirea API-ului unui laborator de frontieră pentru asta ar fi extrem de scumpă și, probabil, ar crea un blocaj de timp, deoarece aceste modele sunt destul de lente și, sincer, nici nu ți-ar oferi neapărat o îmbunătățire a performanței”, a adăugat Lambert.

Este posibil ca modele anterioare de frontieră să fi contribuit la Kimi K3. Anthropic a acuzat public Moonshot, DeepSeek și MiniMax de distilare sistematică a modelelor sale încă de la începutul acestui an. Compania a declarat că a descoperit milioane de schimburi între modelele sale și utilizatori identificați ca aparținând acestor companii, prin adrese IP și alte metadate. Aceste interogări erau „distincte de tiparele normale de utilizare, reflectând o extracție deliberată a capacităților, nu o utilizare legitimă”. Cu toate acestea, niciunul dintre experți nu consideră că distilarea singură explică saltul calitativ al Kimi K3.

Secretarul Trezoreriei SUA, Scott Bessent, a afirmat că „găsim amprente de apă ale modelelor noastre lingvistice mari americane pe multe dintre modelele chinezești, iar acest lucru este inacceptabil”. Nu este clar în ce constau aceste amprente, iar Departamentul Trezoreriei nu a răspuns solicitărilor de clarificare. În lipsa unor dovezi concrete, acuzațiile rămân în sfera speculațiilor politice.

Pe de altă parte, Moonshot nu a răspuns întrebărilor TechCrunch despre procesul său de antrenare. Lipsa de transparență alimentează suspiciunile, dar nu oferă o confirmare a furtului de proprietate intelectuală. În plus, discuțiile despre interzicerea modelelor open-weight chinezești în SUA au stârnit controverse în sectorul AI, unii experți avertizând că o astfel de măsură ar putea fragmenta ecosistemul global al cercetării.

Ce înseamnă toate acestea pentru viitorul inteligenței artificiale? În primul rând, este clar că distilarea nu mai este o soluție magică pentru a ajunge din urmă cu modelele de frontieră. Pe măsură ce modelele devin mai complexe și antrenarea se bazează tot mai mult pe învățare prin întărire, simpla copiere a răspunsurilor nu mai este suficientă. În al doilea rând, acuzațiile politice riscă să umbrească progresele reale ale cercetării chinezești, care investește masiv în infrastructură și talente.

În concluzie, deși este posibil ca Moonshot să fi folosit date de la modelele Anthropic pentru a-și îmbunătăți propriul model, experții sunt de acord că performanța Kimi K3 nu poate fi explicată doar prin distilare. Este nevoie de mai multă transparență din partea companiilor chinezești și de o abordare mai puțin politizată a competiției tehnologice. Până atunci, rămânem cu întrebarea: cum a reușit Kimi K3 să devină atât de bun? Răspunsul, probabil, implică o combinație de inovație proprie, acces la resurse și, poate, o doză de inspirație din modelele existente – dar nu furt pur și simplu.

De ce este important:


Această dezbatere nu este doar despre un model AI, ci despre modul în care competiția geopolitică influențează inovația tehnologică. Acuzațiile de furt intelectual pot duce la sancțiuni și restricții care fragmentează cercetarea globală, încetinind progresul în domenii critice precum sănătatea, educația și securitatea. În același timp, înțelegerea corectă a metodelor de antrenare a LLM-urilor este esențială pentru a distinge între inovație legitimă și încălcarea proprietății intelectuale. Fără o analiză riguroasă, riscăm să politizăm știința și să pierdem beneficiile colaborării internaționale.

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.