Knowledgator lansează GLiFormer: un encoder de 575M parametri care atinge 91.10 F1 la extragerea JSON-urilor imbricate fără generare de tokeni
Într-o eră în care datele structurate devin tot mai complexe, iar documentele digitale ascund informații prețioase în structuri ierarhice, extragerea automată a datelor a devenit o provocare centrală pentru inteligența artificială. Compania Knowledgator, cunoscută pentru inovațiile în procesarea limbajului natural, tocmai a dezvăluit GLiFormer, un model encoder cu 575 de milioane de parametri, care promite să schimbe regulile jocului în extragerea JSON-urilor imbricate. Rezultatul? Un scor impresionant de 91.10 F1, obținut fără a genera niciun token. Dar ce înseamnă asta concret și de ce ar trebui să ne pese? Hai să deslușim împreună.## Problema: extragerea JSON-urilor imbricateImaginați-vă un contract juridic, un raport financiar sau un articol științific. În interiorul lor, informațiile nu sunt plate, ci organizate ierarhic: un client are adrese, fiecare adresă are un oraș, un cod poștal, iar fiecare oraș poate avea mai multe clădiri. Această structură „îmbrăcată” în mai multe niveluri se numește JSON imbricat. Extragerea automată a acestor date dintr-un text nestructurat este o sarcină dificilă, deoarece modelul trebuie să înțeleagă nu doar ce entități există, ci și cum se leagă între ele.Metodele tradiționale folosesc modele generative, care „scriu” JSON-ul token cu token, asemenea unui traducător care dictează o propoziție. Deși flexibile, aceste abordări sunt lente, costisitoare din punct de vedere computațional și predispuse la erori de sintaxă. Mai mult, ele necesită resurse uriașe pentru a fi antrenate și rulează greu pe dispozitive cu putere limitată.## GLiFormer: o abordare radical diferităKnowledgator a ales o cale complet diferită. În loc să genereze tokeni, GLiFormer folosește un encoder pur, care analizează textul și identifică direct intervalele (span-urile) care corespund valorilor din JSON-ul țintă. Practic, modelul „citește” documentul și marchează exact unde începe și unde se termină fiecare valoare, apoi le asamblează într-o structură ierarhică. Această metodă elimină complet etapa de generare, ceea ce aduce beneficii uriașe în viteză și eficiență.Cu 575 de milioane de parametri, GLiFormer nu este un model mic, dar nici un gigant de tip GPT. Este proiectat să fie suficient de puternic pentru a înțelege nuanțele limbajului, dar suficient de agil pentru a fi implementat în producție. Rezultatul de 91.10 F1 pe benchmark-uri de extragere a JSON-urilor imbricate demonstrează că abordarea nu doar funcționează, ci chiar rivalizează cu modele generative mult mai mari.## Cum funcționează, de fapt?În spatele acestei performanțe se află o arhitectură inteligentă. GLiFormer folosește un mecanism de atenție care procesează textul în paralel, identificând relațiile dintre entități. Apoi, un strat de clasificare determină pentru fiecare token dacă face parte dintr-o valoare și, dacă da, ce rol are în structura JSON (cheie, valoare, obiect, array). În loc să „inventeze” text, modelul extrage direct din sursă, ceea ce reduce drastic halucinațiile și erorile de formatare.Un alt aspect inovator este modul în care gestionează imbricarea. Prin utilizarea unor reprezentări ierarhice ale atenției, modelul poate urmări simultan mai multe niveluri de adâncime, fără a pierde contextul. De exemplu, dacă textul menționează „adresa biroului central din București, strada Victoriei 10”, GLiFormer poate identifica „București” ca oraș, „strada Victoriei 10” ca adresă și le poate lega corect de obiectul „birou central”.## Comparație cu alte modelePentru a înțelege valoarea acestei realizări, trebuie să o punem în context. Modelele generative precum GPT-4 sau Claude pot extrage JSON, dar o fac prin generare secvențială, ceea ce le face de 10-100 de ori mai lente decât un encoder. În plus, ele necesită prompt-uri elaborate și sunt sensibile la formatul de ieșire. GLiFormer, pe de altă parte, este specializat pentru această sarcină, ceea ce îi permite să fie mai precis și mai rapid.Comparativ cu alte encodere precum BERT sau RoBERTa, GLiFormer aduce îmbunătățiri semnificative în ceea ce privește înțelegerea structurilor ierarhice. Deși BERT poate fi folosit pentru extragerea de entități, el nu este proiectat să gestioneze relații complexe de tip părinte-copil. GLiFormer a fost construit de la zero pentru această provocare, iar rezultatele vorbesc de la sine.## De ce contează pentru industrie?Aplicațiile practice sunt numeroase. În domeniul juridic, poate extrage automat clauzele dintr-un contract și le poate organiza într-un format structurat. În finanțe, poate transforma rapoartele anuale în baze de date interogabile. În sănătate, poate extrage informații din fișele pacienților și le poate integra în sisteme electronice. Toate acestea se pot întâmpla în timp real, fără a fi nevoie de infrastructură masivă.Mai mult, prin eliminarea generării de tokeni, GLiFormer reduce semnificativ amprenta de carbon și costurile de operare. Într-o lume în care sustenabilitatea devine o prioritate, această eficiență este un argument puternic pentru adoptarea sa.## Limitări și perspectiveDesigur, niciun model nu este perfect. GLiFormer este specializat pe extragere, deci nu poate genera text liber sau răspunde la întrebări generale. De asemenea, performanța sa depinde de calitatea datelor de antrenament și de domeniul specific. Cu toate acestea, Knowledgator a anunțat că va publica greutățile modelului, ceea ce va permite comunității să îl testeze și să îl adapteze la nevoi diverse.Pe termen lung, această abordare ar putea deschide calea către modele hibride, care combină viteza encodării cu flexibilitatea generării. Dar până atunci, GLiFormer reprezintă un pas important înainte, demonstrând că nu întotdeauna „mai multă generare” înseamnă „mai bine”. Uneori, soluția elegantă este să nu generezi deloc, ci să înțelegi profund ceea ce deja există.### De ce este important:GLiFormer nu este doar un alt model de inteligență artificială. Este o dovadă că inovația nu înseamnă neapărat creșterea dimensiunii, ci găsirea unor soluții mai inteligente. Prin atingerea unui scor de 91.10 F1 la extragerea JSON-urilor imbricate fără generare de tokeni, Knowledgator oferă industriei un instrument care este simultan mai rapid, mai precis și mai eficient din punct de vedere energetic. Această realizare are potențialul de a democratiza accesul la extragerea structurată a datelor, permițând companiilor mici și mari să proceseze documente complexe fără a investi în infrastructură masivă. Într-o lume în care datele sunt noul petrol, GLiFormer este o rafinărie portabilă, gata să transforme textul brut în informație valoroasă.