Filtrează articolele

AI

Un nou tip de model AI, creat de un inventator al ChatGPT, entuziasmează dezvoltatorii

Un nou tip de model AI, creat de un inventator al ChatGPT, entuziasmează dezvoltatorii
Există momente în istoria tehnologiei când o idee aparent simplă schimbă complet regulile jocului. Exact așa se întâmplă acum cu Jev, un model de inteligență artificială care nu scrie text, nu conversează și nu generează poezii. În schimb, produce probabilități. Și tocmai această aparentă limitare îl face revoluționar.

Povestea începe cu Théo Almeida, un cercetător care a fost printre primii angajați ai OpenAI și care a contribuit direct la construirea ChatGPT. Mai mult, el este unul dintre inventatorii tehnicii de învățare prin întărire cu feedback uman (RLHF), metoda care a făcut posibil ca modelele de limbaj să devină atât de utile și de populare. Cu alte cuvinte, vorbim despre unul dintre oamenii care au pus bazele erei actuale a inteligenței artificiale.

Și totuși, Almeida era profund dezamăgit. „Avem fulgerul prins în sticlă, dar nu este util”, spunea el într-un interviu recent. După ani de muncă la OpenAI, a ajuns la o concluzie tulburătoare: „Problema este că optimizăm pentru limbajul uman. Am fost extrem de buni la limbajul uman timp de patru ani, dar asta nu este util pentru automatizare, pentru că computerele vorbesc o altă limbă.”

Așa că, acum doi ani, Almeida a părăsit OpenAI și a fondat TypeSafe AI, o companie pornită cu misiunea de a rezolva exact această problemă. Iar săptămâna aceasta, compania a lansat Jev, un model bazat pe arhitectura transformer, dar care nu este un model de limbaj de mari dimensiuni (LLM). Nu scoate text la ieșire. În schimb, produce probabilități – ceea ce compania numește „decizii calibrate”.

De ce este această abordare atât de diferită și de ce îi entuziasmează pe dezvoltatori? În primul rând, pentru că elimină limbajul din ecuație, modelul devine incredibil de ieftin și de rapid. Nu poate halucina, pentru că utilizatorii definesc dinainte toate ieșirile posibile. Tokenurile de ieșire sunt gratuite, iar tokenurile de intrare sunt facturate la miliard, nu la milion. Practic, costurile scad cu ordine de mărime.

Interesul dezvoltatorilor a fost atât de mare încât compania a pierdut temporar capacitatea de a servi cererile prin API, pur și simplu pentru că cererea a depășit orice așteptare. Iar poveștile din teren sunt convingătoare.

Pranit Sharma, inginer software la Vercel, o companie care construiește infrastructură pentru agenți AI, a folosit anterior ChatGPT Luna 5.6 de la OpenAI pentru a rula un clasificator care verifică comenzile pentru siguranță. Când Vercel a înlocuit Luna cu Jev, rezultatele au venit de 5 până la 18 ori mai repede, cu o acuratețe mai mare. Nu e puțin lucru.

Nikhil Mudholkar, CTO la Bryo AI, a testat Jev împotriva Gemini pentru clasificarea emailurilor de afaceri. Gemini a fost ușor mai precis, dar de 10 până la 20 de ori mai scump. Ceea ce l-a impresionat însă cel mai mult pe Mudholkar au fost scorurile de încredere ale lui Jev. „Este singurul care îți oferă o probabilitate reală, ceea ce îl face ideal pentru automatizarea fluxurilor de lucru!”

Dar Jev nu doar înlocuiește modelele de limbaj în anumite cazuri de utilizare. Poate și să le completeze, acționând ca un verificator inteligent al comportamentului. Folosirea agenților pentru a monitoriza alți agenți devine rapid foarte scumpă, dar folosirea lui Jev pentru acest lucru are sens economic. Almeida vede utilizatori care implementează Jev pentru a urmări traseele agenților LLM și pentru a preveni jailbreak-urile.

Armin Ronacher, CTO la Earendil, care construiește harness-ul open-source pentru modele Pi, explică o nuanță importantă: „La finalul zilei, transferă problema halucinației către utilizator. Utilizatorul trebuie să spună: ok, dacă acest lucru revine cu o probabilitate de 50%, poate că este o aruncare cu banul și îl ignor. Dar dacă este 95%, sigur, atunci pot face ceva cu el.”

O altă utilizare potențială pentru Jev este rutarea modelelor. A prezice dacă o anumită sarcină de lucru necesită un model specific ar fi util, dar folosirea unui LLM pentru această treabă ar fi scumpă. Costul redus și viteza lui Jev fac posibilă acest tip de sortare în timp real.

Și aici intervine speranța lui Almeida. Modelul poartă numele lui William Stanley Jevons, economistul din secolul al XIX-lea al cărui paradox eponim descrie cum scăderea costului unei mărfuri poate duce la utilizarea ei din ce în ce mai intensă. În acest caz, scăderea costului inteligenței ar trebui să ducă la implementarea ei pe scară largă.

„Credem că vom avea software inteligent peste tot, într-un mod emergent și distribuit... mult mai asemănător cu internetul timpuriu decât cu mega-aplicațiile pe care unii încearcă să le construiască acum”, spune Almeida.

Despre arhitectura modelului, Almeida este rezervat. Observatorii externi suspectează că este construit pe baza unui LLM cu greutăți deschise. Compania se referă la Jev ca la un „model System One”, concentrat pe intuiție, nu pe raționament, și specific pe sarcina potrivită. Almeida spune că Jev este antrenat exclusiv pe date sintetice, folosind o tehnică pe care o numește „învățare prin întărire din decizii calibrate”.

„Am făcut un pariu timpuriu că vom face toate modelele noastre...” – și aici discuția rămâne suspendată, pentru că restul este încă secret.

Ce înseamnă toate acestea pentru industria AI? Dacă Jev își confirmă potențialul, am putea vedea o schimbare fundamentală în modul în care gândim despre inteligența artificială. Nu mai este doar despre modele uriașe care imită conversația umană, ci despre instrumente mici, rapide și ieftine, care iau decizii precise. Iar asta ar putea democratiza accesul la AI într-un mod pe care nu l-am văzut până acum.

De ce este important:



Această știre contează pentru că semnalează o posibilă schimbare de paradigmă în inteligența artificială. Unul dintre creatorii ChatGPT recunoaște că abordarea actuală, bazată pe limbajul uman, nu este optimă pentru automatizare. Jev demonstrează că există o alternativă viabilă: modele care nu generează text, ci probabilități, fiind mai rapide, mai ieftine și incapabile să halucineze. Pentru dezvoltatori, asta înseamnă costuri reduse cu ordine de mărime și posibilitatea de a integra inteligența în aplicații care anterior nu și-o permiteau. Pentru industrie, ar putea însemna trecerea de la mega-aplicații centralizate la un ecosistem distribuit de software inteligent, similar cu modul în care internetul a evoluat. Dacă tendința se confirmă, s-ar putea să asistăm la o democratizare reală a inteligenței artificiale, cu impact asupra tuturor sectoarelor care depind de automatizare și luarea deciziilor.

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.