Totul a început cu o demonstrație tehnică publicată pe Hacker News în luna mai, care a stârnit un interes uriaș. Kog a reușit să arate că „decodarea extrem de rapidă a cererilor individuale este posibilă pe GPU-urile standard din centrele de date, pe care întreprinderile le dețin deja” – folosind AMD MI300X și NVIDIA H200. Rezultatul? O viteză impresionantă de 3.000 de tokeni pe secundă (TPS) per cerere. Unii au fost dezamăgiți că nu se aplică și la GPU-urile din laptopurile noastre, dar alții au văzut imediat potențialul. Și nu s-au înșelat.
„Am avut 200 de lead-uri de afaceri tangibile”, a declarat CEO-ul Kog, Gaël Delalleau, pentru TechCrunch. Acest interes masiv a venit exact într-un moment în care costurile și viteza de inferență au devenit critice pentru adoptarea pe scară largă a AI-ului. Companiile care rulează modele mari de limbaj (LLM) știu că fiecare secundă de așteptare înseamnă bani pierduți, iar Kog promite să schimbe asta.
Pe baza feedback-ului timpuriu, fondatorul solo estimează că ingineria software va fi primul caz de utilizare. Utilizatorii experimentați ai Claude Code știu prea bine că uneori trebuie să aștepte ore întregi pentru rezultate. Chiar și Anthropic înțelege că viteza valorează bani și percepe un preț mai mare pentru modul Fast al lui Claude. Kog vrea să vizeze clienții care sunt descurajați de aceste întârzieri, de obicei pentru că se bazează pe fluxuri de lucru AI pentru sarcini profesionale. Dar startup-ul are și parteneri de design care le permit utilizatorilor să genereze jocuri și aplicații cu un simplu prompt, iar pentru ei un rezultat mai rapid datorită Kog Inference Engine (KIE) ar însemna mai multe venituri, spune Delalleau.
Cu toate acestea, compania realizează că piața nu este încă matură. Observând cererea, Kog a învățat că potențialii clienți nu sunt pregătiți să facă fine-tuning la modele mici. „Și de aceea, de la lansare, ne-am concentrat complet pe accelerarea dezvoltării modelelor mai mari pentru a răspunde cererii pe care am văzut-o.” Aceasta lasă Kog cu un salt uriaș de făcut pentru a-și respecta promisiunea de „inferență LLM de 30 de ori mai rapidă”. Demonstrația lor a arătat un impresionant 3.000 de tokeni pe secundă per cerere – dar cu un model mic, special construit, cu doar aproximativ 2 miliarde de parametri, numit Laneformer 2B, acum open-source.
Contrazicând scepticii, Delalleau este încrezător că aceeași abordare poate funcționa la fel de bine cu LLM-uri mari, a căror dimensiune poate fi o provocare pentru cipurile de inferență. „GPU-urile au un viitor strălucit”, spune el. Pentru CEO-ul Kog, ideea că GPU-urile nu sunt potrivite pentru decodare a devenit o concepție greșită; GPU-urile mai noi au din ce în ce mai multă lățime de bandă de memorie care doar așteaptă să fie deblocată.
Kog nu este singurul care crede că optimizarea software poate ajuta GPU-urile să facă mai mult decât scrie pe cutie. ZML, tot din Franța, a lansat un software independent de hardware care ocolește CUDA de la Nvidia pentru a suporta inferență rapidă pe cipuri concurente. Dar Delalleau spune că Kog este mai asemănător cu laboratorul Hazy Research de la Universitatea Stanford, cu un focus și mai profund pe accelerarea GPU-urilor.
Delalleau însuși nu este cercetător, iar prima sa startup, Stribe, un absolvent TechCrunch50 2009, nu are nimic de-a face cu cea nouă – în afară de fostul său cofondator devenit VC, Kamel Zeroual, a cărui firmă Varsity VC a co-condus runda seed a Kog. Dar focusul profund al startup-ului provine din background-ul său unic. După ce a studiat fizica solidului la École Polytechnique din Franța, a lucrat în securitate cibernetică ofensivă – cunoscută și sub numele de hacking white hat. Potrivit lui Delalleau, acest lucru a modelat mentalitatea pe care acum o încurajează în echipa sa. Pe partea științifică, „există această mentalitate de a înțelege legile fizicii și legile GPU-ului pentru a le folosi la maximum”. Cât despre hacking, finalist de patru ori la turneul CTF de la DEF CON, el spune că l-a învățat „să faci reverse-engineering la un nivel foarte scăzut – până la limbaj de asamblare și cod binar – pentru a înțelege cum funcționează și pentru a încerca să-l folosești pentru un scop pentru care nu a fost neapărat proiectat”.
Dezavantajul acestei abordări este că este foarte practică și consumatoare de timp. „Pentru fiecare GPU nou, vom dedica săptămâni sau chiar luni pentru a intra cu adevărat în detalii și a face inginerie GPU.”
Într-o piață în care fiecare milisecundă contează, iar costurile de inferență pot decide soarta unei aplicații AI, Kog aduce o perspectivă proaspătă: nu trebuie să arunci hardware-ul vechi, ci să-l înveți să facă mai mult. Rămâne de văzut dacă promisiunea de 30 de ori mai rapidă se va materializa și pe modelele mari, dar până atunci, startup-ul francez a atras deja atenția și interesul pieței. Cu un fondator care combină fizica cu hacking-ul, Kog ar putea fi exact ceea ce GPU-urile aveau nevoie: cineva care să le înțeleagă la nivel de siliciu și să le facă să zboare.
De ce este important:
Viteza de inferență a modelelor de limbaj mari este un factor critic pentru adoptarea AI în producție. Dacă Kog reușește să livreze o accelerare semnificativă pe hardware-ul existent, companiile nu vor mai fi nevoite să investească masiv în cipuri noi și scumpe, ci își pot optimiza infrastructura actuală. Acest lucru ar putea democratiza accesul la AI de înaltă performanță, reducând costurile și timpii de răspuns, ceea ce ar avea un impact direct asupra productivității și inovației în numeroase industrii.