Filtrează articolele

AI

Foști angajați Anthropic și METR au găsit o metodă de a controla agenții AI rău intenționați

Foști angajați Anthropic și METR au găsit o metodă de a controla agenții AI rău intenționați
La doar o zi după ce cercetătorul Anthropic, Jacob Coxon, și-a dat demisia din cauza temerilor că AI ar putea ucide omenirea până la sfârșitul deceniului, am întâlnit doi fondatori care cred că au găsit o soluție care ne-ar putea salva pe toți – sau, cel puțin, ar putea împiedica agenții AI să scape de sub control în interiorul companiilor. Rune Kvist și Rajiv Dattani, cunmați și parteneri de afaceri, au lansat o startup care își propune să aducă siguranța AI în întreprinderi și în companiile care construiesc modele și agenți AI.

Kvist, unul dintre primii angajați Anthropic, este căsătorit cu sora lui Dattani. Dattani a fost director de operațiuni la METR, o organizație de cercetare în siguranța AI, între 2024 și 2025, și rămâne membru al consiliului de administrație. Împreună au fondat Artificial Intelligence Underwriting Company (AIUC), o companie care își propune să aplice un model familiar de securitate cibernetică la un set nou de riscuri legate de AI. Printre clienții lor se numără nume sonore precum Cursor, Lovable, Harvey și ElevenLabs.

Marți, AIUC a anunțat o rundă de finanțare Seria A de 40 de milioane de dolari, condusă de Ribbit Capital, cu participarea First Harmonic. Anterior, compania închisese o rundă seed de 15 milioane de dolari de la Nat Friedman, prin fondul său NFDG, alături de Emergence, Terrain și co-fondatorul Anthropic, Ben Mann, printre alții. Astfel, finanțarea totală a ajuns la 55 de milioane de dolari.

Ce a atras atenția acestui grup de investitori de top este încercarea AIUC de a aplica un model familiar de securitate cibernetică la un set nou de riscuri AI. Compania a construit un strat de audit și certificare terță parte pentru agenții AI. „Băncile, spitalele, guvernele și armatele nu mai refuză să implementeze AI pentru că un model nu este suficient de inteligent”, spune Kvist. „Refuză pentru că și-au asumat angajamente față de propriii clienți cu privire la ceea ce un sistem va face și nu va face, iar nimeni nu poate garanta în prezent acest lucru.”

Folosind standardul de securitate cibernetică SOC 2, larg adoptat, ca sursă de inspirație, AIUC a dezvoltat un standard numit AIUC-1 și un serviciu de testare care validează agenții în conformitate cu acest standard. Pentru a construi standardul, AIUC a adunat un consorțiu de aproximativ 250 de lideri în securitate și risc – adică exact cumpărătorii de agenți. „Aceștia sunt oamenii cu care ne întâlnim lunar, iar întrebarea pe care le-o punem este: când cumpărați agenți de la cineva, ce ați căuta? Ce întrebări ați vrea să puneți și ce ați vrea să vedeți abordat?”, explică Dattani pentru TechCrunch.

Feedback-ul lor modelează testele. Startup-ul rulează apoi un agent printr-o suită de aproximativ 5.000 de teste pentru a vedea cum se comportă în scenarii care implică jailbreaks, halucinații și scurgeri de date. Rezultatele produc un raport de aproximativ 100 de pagini care detaliază unde un agent se comportă sigur și fiabil – și unde nu. Interesant este că AIUC folosește agenți AI pentru a rula testele și AI pentru a analiza datele. Cu toate acestea, oamenii verifică auditul final, spune Kvist.

Dacă vi se pare cunoscut, nu este o coincidență. Fostul angajator al lui Dattani, METR, face teste similare pentru laboratoarele de frontieră, deși munca sa s-a concentrat până recent în principal pe performanță (dacă agenții pot îndeplini în mod fiabil sarcinile). METR a fost una dintre organizațiile independente de cercetare pe care OpenAI le-a folosit pentru a investiga incidentul de la Hugging Face. CEO-ul Anthropic, Dario Amodei, a cerut recent industriei AI să încetinească dezvoltarea la frontieră, citând o creștere rapidă a incidentelor de comportament rău intenționat. În postarea sa, Amodei a lansat ideea de a cere laboratoarelor de frontieră să folosească evaluatori terți încorporați pentru a observa și verifica siguranța, numind METR ca o posibilitate.

Deși AIUC nu își propune să se încorporeze la sediile clienților, ideea generală este similară: să ofere întreprinderilor o evaluare independentă a cât de sigure sunt agenții lor AI. „Aici trece și poți avea încredere. Și aici există îngrijorări. Ar trebui să fii conștient de aceste referințe înainte de a lua decizia de a cumpăra”, spune Dattani.

Această abordare vine într-un moment critic. Pe măsură ce agenții AI devin din ce în ce mai capabili, riscul ca aceștia să acționeze în moduri neașteptate sau dăunătoare crește exponențial. Companiile adoptă din ce în ce mai mult agenți pentru automatizarea sarcinilor complexe, dar fără o garanție clară a siguranței, adoptarea rămâne riscantă. AIUC încearcă să umple acest gol, oferind un standard de certificare care să dea încredere cumpărătorilor.

„AI devine mai inteligentă într-un ritm tot mai rapid. Lucrul surprinzător despre AI este că devine mai greu de adoptat și mai greu de controlat pe măsură ce devine mai inteligentă, nu mai ușor”, subliniază Kvist. Această observație contraintuitivă explică de ce chiar și cele mai avansate laboratoare de AI se confruntă cu provocări în a-și menține sistemele sub control. Soluția AIUC – un audit independent, standardizat – ar putea fi cheia pentru a debloca adoptarea pe scară largă a agenților AI în sectoare critice precum sănătatea, finanțele și administrația publică.

Cu toate acestea, rămân întrebări despre eficacitatea unor astfel de audituri. Pot testele să acopere toate scenariile posibile? Cum se adaptează standardul la evoluția rapidă a tehnologiei? AIUC recunoaște că testele sunt un instantaneu al comportamentului agentului la un moment dat, dar susține că procesul continuu de evaluare și actualizare a standardului, bazat pe feedback-ul consorțiului, menține relevanța.

În plus, implicarea umană în verificarea finală a auditului este crucială. Deși AI este folosită pentru a rula testele și a analiza datele, oamenii sunt cei care iau decizia finală. Acest lucru oferă un nivel de responsabilitate și judecată pe care AI nu îl poate reproduce. „Nu ne bazăm doar pe mașini pentru a decide ce este sigur”, subliniază Dattani. „Oamenii aduc context, nuanțe și înțelegere a riscurilor pe care AI nu le are.”

Pe măsură ce dezbaterea despre siguranța AI se intensifică, inițiative precum AIUC ar putea deveni esențiale. Ele oferă un mecanism concret pentru a evalua și certifica agenții AI, reducând incertitudinea care împiedică adoptarea în medii critice. Într-o lume în care AI devine din ce în ce mai prezentă, astfel de standarde ar putea fi diferența dintre utilizarea responsabilă și haosul necontrolat.

De ce este important:


Această inițiativă vine într-un moment în care temerile legate de siguranța AI sunt la cote maxime, iar apelurile pentru reglementare și supraveghere se intensifică. AIUC oferă o soluție practică, bazată pe piață, care ar putea deveni un standard de facto pentru certificarea agenților AI. Dacă va avea succes, ar putea reduce riscul de incidente catastrofale, ar crește încrederea în tehnologie și ar permite adoptarea AI în sectoare unde prudența a fost un obstacol. Mai mult, succesul său ar putea influența modul în care guvernele și organismele de reglementare abordează siguranța AI, oferind un model de audit independent care ar putea fi extins la nivel global. Într-o eră în care AI devine din ce în ce mai autonomă, astfel de mecanisme de control ar putea fi esențiale pentru a preveni scenariile apocaliptice pe care unii le prevăd.

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.