Pe lângă Proiectul Galaxy, SenseTime a semnat un acord de calcul spațial cu producătorul de sateliți Guoxing Aerospace și a încheiat un parteneriat de cercetare cu cinci instituții – inclusiv Laboratorul de Inteligență Artificială din Shanghai – axat pe aplicații de calcul științific. Yang a justificat momentul ales prin trei tendințe convergente: cererea tot mai mare de token-uri în implementările enterprise, adoptarea AI industrial care ajunge din urmă cazurile de utilizare orientate către consumatori și comercializarea cipurilor autohtone, care a atins un punct în care centrele de calcul inteligent construite pe siliciu chinezesc pot fi puse în funcțiune rapid.
Dar cât de deschisă este această fereastră? Depinde de cifrele pe care SenseTime nu le-a verificat independent. Compania susține că platforma sa de dispozitive la scară largă procesează în medie 2,42 trilioane de token-uri pe zi și estimează că această cifră va crește de 25 de ori, până la 10 trilioane de token-uri pe zi, până în trimestrul al patrulea al anului 2026. Este o prognoză, nu un rezultat măsurat, iar cumpărătorii enterprise care evaluează infrastructura SenseTime ar trebui să o trateze ca atare până când cifrele trimestriale vor începe să sosească.
Afirmațiile privind eficiența costurilor asociate acestei creșteri sunt, de asemenea, auto-raportate. SenseTime spune că tehnologia sa de inferență hibridă eterogenă oferă o creștere de 85–152% a utilizării FLOP-urilor modelului pe cipurile autohtone mainstream, împreună cu o eficiență a costurilor de inferență pe care compania o plasează la 1,25x față de componentele din seria H de la Nvidia. Comparativ cu configurațiile de inferență omogene autohtone, SenseTime pretinde o creștere de 2,5x a producției de token-uri la un cost echivalent, un salt care, spune ea, împinge clusterele de inferență hibridă optimizate dincolo de ceea ce industria considera anterior pragul minim de profitabilitate pentru puterea de calcul autohtonă.
Niciuna dintre aceste cifre nu vine cu benchmark-uri terțe, iar diferența dintre un cluster de testare optimizat de furnizor și mediul de producție al unui client – cu conducte de date inegale și actualizări de firmware întârziate – tinde să fie locul unde astfel de numere se înmoaie. Cipurile AI autohtone s-au luptat istoric cu un stack software fragmentat: modelele antrenate pentru o arhitectură necesită adesea re-lucrare pentru a rula pe alta. SenseTime spune că a construit un strat de adaptare full-stack care acoperă modele, framework-uri, operatori, toolchain-uri și hardware pentru a aborda această problemă, cu scopul de a permite clienților să migreze sarcinile de lucru între furnizorii de cipuri autohtone fără rescrieri extensive.
Compania oferă două exemple aplicate. Într-o sarcină de predicție a proteinelor cu secvențe lungi AI4S, SenseTime spune că optimizarea operatorilor fuzionați a redus timpul total de predicție de trei ori. În generarea video AIGC, pretinde o rată de accelerare paralelă multi-card de 93% pentru cipurile autohtone care rulează modele DiT, împreună cu ceea ce descrie drept migrare cu cost zero pentru instrumentele mainstream de dezvoltare AI. Acestea sunt genul de cifre care arată bine într-un sandbox de testare și contează mult mai mult odată ce sunt testate la stres împotriva conductelor reale ale clienților, care rulează generații mixte de hardware.
SenseTime a introdus o metrică pe care o numește Tokeni pe Watt, poziționată ca un nou etalon pentru măsurarea eficienței centrelor de date AI, împreună cu un Agent de Colaborare a Puterii de Calcul care se ocupă de programarea resurselor, predicția prețurilor la electricitate și optimizarea stocării energiei, într-un sistem de date pe opt niveluri cu cinci lanțuri decizionale. Combinând calculul, prețurile la electricitate și programarea automatizată, SenseTime pretinde o creștere de 80% a producției de token-uri pe unitatea de cost al electricității, prețuri medii ale energiei cu 10% mai mici decât centrele de date regionale comparabile și o acuratețe de 96% în predicția sarcinii de calcul.
Acestea sunt afirmații care merită urmărite în următoarele trimestre, mai degrabă decât acceptate ca atare. Arbitrajul prețurilor la electricitate și acuratețea prognozei sarcinii tind să se comporte diferit odată ce un sistem trece printr-un ciclu sezonier complet, cu volatilitate reală a cererii, spre deosebire de condițiile în care un furnizor își rulează de obicei pilotul.
Ecosistemul declarat al Proiectului Galaxy include furnizorii autohtoni de cipuri Cambricon, Muxi, Hygon, Huawei Ascend, Moore Threads, Sunrise și Biren Technology, partenerul de componente Xizhi Technology și firme de infrastructură precum Silicon Motion, Qujing Technology, Zhongke Jiahe, Qingcheng Jizhi, Sophon Information și Jiliu Technology. SenseTime spune că planul acoperă construcția unei „fabrici de token-uri”, cinci clustere de calcul la ceea ce numește scară „10.000 de calorii”, lucru comun în zece domenii tehnologice.
De ce este important:
Proiectul Galaxy al SenseTime nu este doar o inițiativă tehnică, ci un test de rezistență pentru întregul ecosistem AI al Chinei. În contextul sancțiunilor americane care limitează accesul la cipuri avansate precum cele de la Nvidia, China încearcă să-și construiască propria suveranitate tehnologică. Dacă SenseTime reușește să demonstreze că infrastructura bazată pe cipuri autohtone poate atinge performanțe comparabile cu cele occidentale, ar putea schimba dinamica pieței globale de AI. Însă, până când cifrele nu sunt verificate independent, rămâne un pariu uriaș. Pentru investitori, clienți și analiști, urmărirea acestui proiect în următoarele trimestre va oferi indicii cruciale despre viitorul calculului AI în China și despre capacitatea țării de a concura pe scena globală.