AngelSpec nu este doar un alt instrument de optimizare – este o platformă unificată care suportă șase arhitecturi diferite de draftare, de la modele MTP (Multi-Token Prediction) până la cele bloc-paralele. Inima sa o constituie DFly, un „draftor” bazat pe difuzie bloc, care combină condiționarea hibridă a țintei cu un cap autoregresiv de corecție ascunsă. Practic, DFly învață să prezică mai multe tokenuri simultan, dar corectează erorile printr-un mecanism intern, fără a necesita reantrenarea modelului principal.
Un alt element cheie este D-cut, un modul de bugetare adaptivă a verificării la runtime. În loc să verifice toate tokenurile speculate, D-cut decide dinamic câte dintre ele merită validate, în funcție de context și de încrederea draftorului. Rezultatele sunt impresionante: pe modelul HY3-295B-A21B, cu 8 unități de procesare (TP=8), DFly-8 oferă o accelerare de 1,98–2,40× față de decodarea autoregresivă standard, pentru concurențe între 4 și 64 de cereri simultane.
Ce înseamnă acest lucru pentru comunitatea AI?
Până acum, decodarea speculativă era un domeniu fragmentat: fiecare echipă își construia propriile soluții ad-hoc, iar antrenarea modelelor draft necesita resurse masive și expertiză specifică. AngelSpec unifică aceste eforturi, oferind o interfață comună pentru antrenare și inferență. Suportul pentru șase arhitecturi – de la MTP clasic la bloc-paralel cu difuzie – înseamnă că cercetătorii pot experimenta rapid fără a rescrie codul de la zero.
Framework-ul este construit în jurul a trei principii:
1. Unificare: același cod de antrenare poate fi folosit pentru orice arhitectură draft, fie că este vorba de un model mic autoregresiv sau de unul bazat pe difuzie.
2. Eficiență: DFly reduce numărul de pași de inferență prin predicția bloc a tokenurilor, iar D-cut elimină verificările redundante.
3. Scalabilitate: testat pe Hy3-295B-A21B, un model MoE cu 295 de miliarde de parametri (21B activi), AngelSpec demonstrează că poate gestiona atât sarcini cu latență scăzută (batch-uri mici), cât și throughput ridicat (batch-uri mari).
Cum funcționează DFly și D-cut?
DFly (Block-Diffusion Drafter) este probabil cea mai inovativă componentă. În loc să genereze token cu token, DFly produce un bloc întreg de tokenuri printr-un proces de difuzie. Condiționarea hibridă înseamnă că draftorul ține cont atât de contextul anterior, cât și de o „țintă” parțială – de exemplu, primele tokenuri din bloc sunt prezise autoregresiv, iar restul prin difuzie. Capul de corecție ascunsă (hidden-correction autoregressive head) ajustează apoi ieșirea pentru a minimiza erorile înainte ca modelul principal să verifice.
D-cut, pe de altă parte, este un algoritm de bugetare care alocă dinamic resursele de verificare. În loc să verifice toate cele K tokenuri speculate, D-cut estimează probabilitatea ca fiecare token să fie acceptat și oprește verificarea după un număr adaptiv de pași. Acest lucru reduce costul computațional fără a sacrifica acuratețea.
Impactul pe modelele Hy3
Hy3 este o familie de modele MoE dezvoltate de Tencent, concepute pentru a fi eficiente atât în antrenare, cât și în inferență. Cu 295 de miliarde de parametri, dar doar 21 de miliarde activi per token, Hy3-295B-A21B este deja un model puternic. AngelSpec îl face și mai rapid: la o concurență de 64 de cereri, accelerarea de 2,40× înseamnă că timpul de răspuns scade de la, să zicem, 100 ms la aproximativ 42 ms. Pentru aplicații în timp real, cum ar fi chatboții sau asistenții virtuali, aceasta este o diferență uriașă.
De ce este important:
Deschiderea codului sursă al AngelSpec are implicații majore pentru întregul ecosistem AI. În primul rând, democratizează accesul la tehnici avansate de decodare speculativă. Până acum, doar câteva laboratoare mari (Google, Meta, OpenAI) aveau resursele să dezvolte astfel de soluții. Tencent oferă acum un cadru gata de utilizat, care poate fi adaptat la orice model MoE sau dens.
În al doilea rând, AngelSpec stabilește un standard pentru interoperabilitate. Suportul pentru șase arhitecturi înseamnă că cercetătorii pot compara direct performanța diferitelor strategii de draftare, fără a fi nevoiți să implementeze fiecare de la zero. Acest lucru accelerează inovația în domeniu.
În al treilea rând, eficiența energetică. O inferență mai rapidă înseamnă mai puțin consum de energie per cerere. În contextul în care centrele de date AI consumă din ce în ce mai multă electricitate, orice optimizare care reduce numărul de operații este binevenită. AngelSpec, prin D-cut și DFly, reduce semnificativ numărul de apeluri către modelul principal.
Concluzie
Tencent face un pas curajos, deschizând codul AngelSpec. Nu este doar un cadru de antrenare – este o platformă care poate schimba modul în care gândim inferența în modelele mari. Cu DFly și D-cut, compania demonstrează că decodarea speculativă poate fi atât eficientă, cât și practică. Rămâne de văzut cât de repede va fi adoptat de comunitate, dar primele semne sunt promițătoare. Pentru oricine lucrează cu modele lingvistice mari, AngelSpec merită cu siguranță o privire atentă.
De ce este important:
AngelSpec reprezintă un pas major în direcția eficientizării inferenței modelelor de mari dimensiuni, în special a celor de tip MoE. Prin unificarea antrenării draftorilor și prin introducerea unor tehnici inovatoare precum DFly și D-cut, Tencent oferă comunității open-source un instrument care poate reduce semnificativ latența și costurile operaționale. Într-o eră în care scalarea modelelor devine din ce în ce mai costisitoare, soluții ca AngelSpec sunt esențiale pentru a menține ritmul inovației fără a compromite accesibilitatea.