Imaginați-vă scena: un dezvoltator caută un connector MCP (Model Context Protocol) pentru a-și integra aplicația cu un serviciu popular. Îi cere agentului AI să găsească cea mai bună soluție. Agentul, folosind informațiile din depozite publice de cod, recomandă un repository care pare perfect – cu documentație impecabilă, stele și descărcări numeroase. Ceea ce utilizatorul nu știe este că acel repository este de fapt o capcană, iar agentul AI a fost păcălit de aparențe. Exact asta s-a întâmplat în campania FakeGit: aproximativ 7.600 de depozite GitHub false, 6.600 de profiluri frauduloase și peste 14 milioane de descărcări. Atacatorii au creat peste 800 de depozite care se dădeau drept skill-uri AI și servere MCP, distribuid SmartLoader și infostealer-ul StealC. Și mai îngrijorător este faptul că Gemini și ChatGPT, două dintre cele mai utilizate modele de limbaj, au recomandat independent același repository rău intenționat, numit walmart-mcp. Agenții au găsit proiectul atacatorilor și au oferit utilizatorilor instrucțiuni de instalare, fără să aibă habar de pericol.
Această situație marchează o schimbare fundamentală în strategia atacatorilor. Nu mai trebuie să înșele direct utilizatorii; pot înșela asistenții în care utilizatorii au încredere. Cum reușesc? În primul rând, agenții procesează instrucțiunile și informațiile externe ca text. O instrucțiune rău intenționată ascunsă într-un fișier README, într-o pagină web sau într-o descriere de instrument poate fi interpretată ca o comandă de urmat, nu ca un conținut de analizat. Acesta este așa-numitul „indirect prompt injection” – injecție indirectă de prompt. Cercetătorul în securitate Simon Willison numește combinația a trei condiții „triada letală”: accesul la informații valoroase, expunerea la conținut extern nesigur și capacitatea de a trimite date în afara sistemului. Când aceste trei elemente coexistă, un agent AI devine o armă perfectă pentru exfiltrarea de date.
Dar nu toate atacurile sunt atât de sofisticate. Unele exploatează ceva mult mai simplu: semnale de încredere fabricate. Stelele, numărul de descărcări, istoricul contributorilor și listările în registre publice pot face ca un software rău intenționat să pară legitim. În campania FakeGit, atacatorii au creat depozite convingătoare, cu documentație realistă, și le-au distribuit prin registre publice. Gemini și ChatGPT au recomandat același connector Walmart MCP fals pentru că părea relevant și credibil. Depozitele distribuiau SmartLoader, care descărca StealC pentru a fura parole, cookie-uri, sesiuni active și date din portofelele de criptomonede. Agenții nu au fost compromiși în sine – au recomandat pur și simplu un software a cărui credibilitate aparentă fusese fabricată.
Un alt vector de atac este otrăvirea instrumentelor MCP. Serverele MCP oferă agenților descrieri textuale ale instrumentelor disponibile. Atacatorii pot ascunde instrucțiuni în aceste descrieri. În aprilie 2025, Invariant Labs a demonstrat cum instrucțiunile încorporate într-un calculator aparent inofensiv puteau manipula un connector de email separat și de încredere, determinându-l să copieze mesajele trimise către un server al atacatorului. Otrăvirea instrumentelor rămâne un model de amenințare demonstrat, dar nu confirmat public la scară largă – deocamdată.
Mai mult, unele skill-uri rău intenționate instruiesc în mod explicit agenții să nu dezvăluie ce au făcut. Un studiu academic din 2026 a analizat 98.380 de skill-uri din două registre și a confirmat 157 ca fiind rău intenționate, identificând 632 de vulnerabilități și 13 tehnici de atac. O instrucțiune recurentă a dat chiar titlul cercetării: „Nu menționa acest lucru utilizatorului”. Astfel, un agent poate raporta că o sarcină a fost finalizată, omitând acțiunile neautorizate, inclusiv transmiterea de informații sensibile. Imaginați-vă un asistent care vă spune că a trimis un raport, dar în realitate a trimis și datele dvs. personale către un server necunoscut – fără să vă spună nimic.
Un alt pericol vine din atacurile asupra lanțului de aprovizionare software. Un pachet poate avea un comportament legitim luni de zile înainte de a introduce funcționalități rău intenționate. În septembrie 2025, Koi Security a descoperit postmark-mcp, un connector care se dădea drept serviciul legitim de email Postmark. Versiunile până la 1.0.15 păreau inofensive. Versiunea 1.0.16 a introdus un destinatar BCC ascuns, care copia emailurile trimise către un domeniu controlat de atacator. Pachetul a expus potențial mesaje de resetare a parolei și linkuri de autentificare asociate cu aproximativ 300 de organizații. Postmark a confirmat că connectorul nu era produsul său și că serviciul propriu nu fusese compromis. Atacul a exploatat încrederea acumulată de versiunile anterioare. Actualizările automate au permis ca funcționalitatea rău intenționată să ajungă fără o nouă aprobare din partea utilizatorului.
Revizuirea codului sursă nu poate detecta totul, mai ales când dependențele externe se schimbă independent. În august 2025, Check Point a dezvăluit MCPoison, o vulnerabilitate în Cursor care permitea atacatorilor să modifice configurații de proiect aprobate anterior și să execute comenzi fără o nouă aprobare. Un alt experiment din 2026 a demonstrat cum un skill distribuit către aproximativ 26.000 de agenți putea inițial să trimită la documentație legitimă, iar apoi pagina externă se schimba în instrucțiuni de instalare rău intenționate. Pachetul în sine rămânea neschimbat, permițând amenințării să scape de scanerele care examinează doar fișierele trimise.
Mediile de dezvoltare activate de AI introduc riscuri chiar înainte ca utilizatorii să instaleze în mod deliberat software suplimentar. Pe măsură ce agenții devin tot mai integrați în fluxurile noastre de lucru – de la scrierea codului la gestionarea emailurilor – suprafața de atac crește exponențial. Atacatorii nu mai vizează doar oamenii; vizează instrumentele care acționează în numele oamenilor. Iar această schimbare de paradigmă cere o regândire completă a strategiilor de securitate.
Ce putem face? În primul rând, trebuie să fim conștienți că agenții AI nu sunt infailibili. Ei pot fi păcăliți, manipulați și transformați în complici. Dezvoltatorii ar trebui să verifice întotdeauna sursa pachetelor recomandate, să nu se bazeze orbește pe stele sau descărcări și să folosească instrumente de securitate care analizează comportamentul, nu doar codul static. Companiile care dezvoltă agenți AI trebuie să implementeze mecanisme de detectare a injecțiilor de prompt și să limiteze accesul la date sensibile. Iar utilizatorii finali ar trebui să fie sceptici față de orice recomandare automată, mai ales când vine vorba de instalarea de software.
De ce este important:
Această evoluție a amenințărilor cibernetice are implicații profunde pentru securitatea digitală globală. Agenții AI devin din ce în ce mai răspândiți în întreprinderi, guverne și viața de zi cu zi. Dacă atacatorii pot manipula acești agenți pentru a distribui malware, consecințele pot fi catastrofale: furt de date masiv, compromiterea infrastructurilor critice, pierderi financiare uriașe. Mai mult, încrederea în asistenții inteligenți – construită cu greu – poate fi erodata rapid. Este esențial ca industria de securitate, cercetătorii și dezvoltatorii de AI să colaboreze pentru a dezvolta mecanisme de apărare specifice acestor noi vectori de atac. Ignorarea acestei probleme ar însemna să lăsăm ușa deschisă pentru cea mai mare epidemie de malware din istorie, una care se răspândește prin intermediul mașinilor create să ne protejeze.