Filtrează articolele

AI

Vals, susținut de Andreessen Horowitz, vrea să devină standardul de aur pentru evaluarea inteligenței artificiale

Vals, susținut de Andreessen Horowitz, vrea să devină standardul de aur pentru evaluarea inteligenței artificiale
În industria inteligenței artificiale, benchmark-urile au devenit un fel de ritual de inițiere: fiecare companie care lansează un model nou își etalează scorurile ca pe niște medalii, sperând să convingă piața că produsul lor este cel mai bun. Dar, la fel ca orice sistem de măsurare, și aceste teste pot fi păcălite. Multe dintre ele sunt vechi, gândite pentru modele mai simple, și nu reușesc să țină pasul cu explozia de capabilități pe care o vedem azi. Tocmai aici intervine Vals, un startup înființat în 2024, care își propune să rescrie regulile jocului și să devină noul etalon în evaluarea AI-ului.

Fondat de Rayan Krishnan, un tânăr de doar 25 de ani, Vals a reușit într-un timp record să atragă atenția marilor jucători din industrie. Anul trecut, compania a obținut o rundă seed condusă de 8VC și Bloomberg Beta, iar luna trecută a închis o rundă Series A de 40 de milioane de dolari, cu Andreessen Horowitz în frunte. Nu e puțin lucru pentru un startup care abia a împlinit doi ani de viață. Dar Krishnan nu e un novice: a trecut pe la Palantir, a lucrat în timpul facultății la Stanford pentru Microsoft și pentru laboratorul de inteligență artificială al universității, unul dintre cele mai apreciate din lume.

Ideea din spatele Vals s-a născut dintr-o frustrare personală. Krishnan a observat că modelele noi apăreau pe piață într-un ritm amețitor, dar benchmark-urile academice, cele folosite de toată lumea, rămâneau în urmă. „Vedeam o mulțime de modele foarte capabile care ajungeau rapid pe piață, iar benchmark-urile academice nu țineau pasul cu avansul frontierei”, spune el. Practic, sistemele de evaluare erau depășite de exact lucrurile pe care trebuiau să le măsoare. Și asta nu e doar o problemă tehnică, ci una de încredere: dacă un model spune că poate face ceva, ar trebui să existe o metodă obiectivă să verificăm asta.

Vals încearcă să rezolve această problemă printr-o abordare complet diferită. În loc să testeze cunoștințele generale ale unui model, cum ar fi capacitatea de a trece un examen de barou, compania se concentrează pe sarcini complexe, specifice unor domenii precum dreptul, finanțele sau programarea. „Ce facem noi este să ne uităm la impactul real al modelelor”, explică Krishnan. „Pot ele să producă o muncă de aceeași calitate ca un om, în fiecare domeniu?” Nu e vorba doar de rezultate pozitive, ci și de cele negative. Compania vrea să înțeleagă ce s-ar întâmpla dacă aceste modele ar fi lăsate libere în lume: care ar fi implicațiile negative, ce pericole ar putea apărea.

Un alt aspect care diferențiază Vals de ceilalți jucători este secretul. Majoritatea benchmark-urilor sunt publice, ceea ce înseamnă că o companie își poate antrena modelul pe acele teste, practic trișând la examen. Vals nu își dezvăluie materialele de testare. Astfel, rezultatele sunt mult mai greu de manipulat. E ca și cum ai avea un examen cu subiecte diferite pentru fiecare student, dar toți sunt evaluați după aceleași criterii.

Domeniile pe care le acoperă Vals sunt în continuă expansiune. Pe lângă industriile tradiționale, startup-ul se aventurează în teritorii tot mai neobișnuite. „Avem un benchmark pentru auto-îmbunătățire recursivă. Lucrăm și în domeniul sănătății mintale, securității cibernetice, biosecurității și chiar al legilor conflictelor armate, pentru a vedea dacă modelele știu să aplice Convenția de la Geneva”, dezvăluie Krishnan. Pare science-fiction, dar e realitate: companiile plătesc pentru a afla dacă AI-ul lor ar respecta regulile războiului sau ar putea preveni o catastrofă biologică.

La prima vedere, ideea ca o companie să plătească pentru a afla că modelul său nu e bun pare contraintuitivă. Dar, de fapt, o evaluare corectă te ajută să identifici problemele și să îți îmbunătățești produsul. Krishnan compară modelul de afaceri cu plata pe care o faci către College Board pentru a da SAT-ul. E o investiție în cunoaștere, nu o cheltuială. Și rezultatele încep să se vadă: compania a anunțat recent că veniturile sale sunt acum de opt ori mai mari decât anul trecut. Echipa a crescut de la 8 oameni la 25, iar planurile de extindere sunt pe masă.

Am avut ocazia să vizitez biroul Vals din San Francisco, pe Folsom Street, într-o clădire veche de cărămidă care, acum un secol, găzduia o fabrică de bere. Acum, în loc de bere, acolo se construiește viitorul tehnologiei. Krishnan îmi spune că, pe măsură ce compania crește, vor să se mute într-un spațiu mai mare și să angajeze mai mulți oameni. E clar că Vals nu se mulțumește doar să fie un alt jucător pe piață; vrea să devină standardul de aur, referința absolută în domeniu.

Într-o lume în care AI-ul devine din ce în ce mai prezent în viața noastră, de la asistenți virtuali la decizii medicale, nevoia de evaluare riguroasă devine critică. Nu putem avea încredere în modele care nu au fost testate în mod serios, în condiții reale. Vals pare să fi înțeles asta mai bine decât oricine, iar investitorii par să fie de acord. Rămâne de văzut dacă vor reuși să își îndeplinească misiunea, dar un lucru e sigur: au prins momentul perfect.

De ce este important:



Pe măsură ce inteligența artificială devine omniprezentă, încrederea în modele devine o problemă de securitate națională, economică și socială. Benchmark-urile tradiționale, multe dintre ele create acum ani, nu mai pot evalua corect capabilitățile reale ale AI-ului modern. Vals aduce o abordare nouă, care combină secretul testelor cu evaluarea pe domenii specifice, reducând riscul de „trișare” și oferind o imagine mai clară asupra impactului real al modelelor. Într-o eră în care un model AI poate influența decizii medicale, financiare sau chiar militare, a avea un standard de evaluare riguros nu e doar un moft, ci o necesitate. Succesul Vals ar putea schimba modul în care întreaga industrie își validează produsele, forțând companiile să fie mai transparente și mai responsabile. Iar asta, până la urmă, ne protejează pe toți.

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.