Filtrează articolele

AI

Google Research lansează ToolGrad: Framework-ul "Răspunsul Întâi" care atinge 99,8% rată de succes în generarea datelor pentru utilizarea uneltelor

Într-o mișcare care promit să redefinească modul în care modelele de limbaj mari (LLM-uri) învață să interacționeze cu lumea digitală, echipa Google Research a făcut public un framework inovator denumit ToolGrad. Prezentat ca lucrare la secțiunea Findings a conferinței ACL 2026, ToolGrad nu este doar o alta îmbunătățire incrementală; este o inversare fundamentală a paradigmei actuale de generare a datelor de antrenament pentru utilizarea uneltelor (tool use).

Tradițional, construirea seturilor de date pentru a învăța un model să apeleze API-uri a fost un proces dureros, plin de erori și, cel mai important, ineficient. Abordarea standard, adesea bazată pe căutarea în adâncime (DFS - Depth-First Search) sau pe generare aleatorie, pornea de la o întrebare a utilizatorului și încerc să construiască un lanț de apeluri de funcții care să ducă la un răspuns. Problema? Majoritatea acestor lanțuri se spargeau, halucinau parametri sau pur și simplu nu funcționau la execuție. Rezultatul? O rată de validare (pass rate) mizerabilă, care forța cercetătorii să filtreze manual sau să genereze volume masive de gunoi pentru a găsi puținele pepite de aur.

ToolGrad schimbă complet jocul. În loc să ghicească calea spre răspuns, framework-ul construiește mai întâi lanțul de API-uri verificat, funcțional și executabil, și abia apoi scrie întrebarea utilizatorului care ar duce natural la acel lanț. Este o abordare "answer-first" (răspunsul întâi) aplicată la generarea de date sintetice, și rezultatele sunt, fără exagerare, spectaculoase.

Motorul ascuns: Bucla Propunere-Executare-Selectare-Actualizare



Secretul nu este o baghetă magică, ci o inginerie riguroasă a unui ciclu de feedback textual pe care autori-l numesc "graident textuale" (textual gradients). Gândiți-vă la ele ca pe echivalentul grazienților din backpropagation, dar pentru text: semnale concrete, lingvistice, care spun modelului de ce a greșit și cum să corecteze, nu doar o scor numeric abstract.

Bucla are patru module distincte, care lucrează în tandemu:

1. Propunere (Propose): Un model generator propune un lanț de apeluri de API (un plan de acțiune) bazat pe o intenție sau un scenariu dat.
2. Executare (Execute): Lanțul propus este rulat într-un mediu sandbox real. Aici nu există simulare. Dacă API-ul returnează eroare, dacă parametrii sunt greșiti, dacă autentificarea eșuează – totul este prins aici. Acesta este "validatorul de realitate".
3. Selectare (Select): Rezultatele execuției (succes, erori, output-uri) sunt analizate. Modulele de selecție filtrează lanțurile care funcționează perfect de cele defectuoase.
4. Actualizare (Update): Aici intervine magia "gradientelor". Pe baza erorilor concrete returnate de mediu (ex: "Parametrul 'data' trebuie să fie format ISO 8601, nu 'ieri'"), un model de actualizare rescrise lanțul sau parametrii pentru a corecta greșeala. Apoi bucla reia.

Această buclă se repetă până când lanțul este garantat executabil. Doar la final, un modul de generare a întrebărilor (Question Generator) privește lanțul final, perfect funcțional, și redactează o cerere naturală a utilizatorului care ar duce la acel rezultat. Este inginerie inversă la nivel de dataset: știi destinația (răspunsul corect), construiești autostrada (lanțul API), și abia la final pui semnele de circulație (întrebarea user-ului).

Numerele care contează: 99,8% vs 63,8%



Articolul de pe MarkTechPost evidențiază o comparație directă, brută, pe benchmark-ul ToolBench, standardul de aur actual pentru evaluarea utilizării uneltelor.

  • DFS Search (Abordarea clasică): 63,8% Pass Rate. Asta înseamnă că aproape 4 din 10 exemple generate erau gunoi. Pentru un cercetător, asta înseamnă costuri uriașe de curățare a datelor sau un model antrenat pe zgomot.

  • ToolGrad: 99,8% Pass Rate. Asta nu este o îmbunătățire; este o eliminare a problemei de calitate a datelor. Aproape fiecare singur exemplu generat de ToolGrad este un exemplu de antrenament valid, executabil și corect.


  • Implicațiile sunt uriașe. Calitatea datelor depășește cantitatea. Un dataset mic, dar curat generat de ToolGrad, este exponențial mai valoros decât unul uriaș, dar murdar generat de metodele vechi.

    Demonstrarea puterii: Gemma-3-12B ajunge la nivelul Gemini 2.5 Pro



    Cel mai puternic argument nu este benchmark-ul pe ToolBench, ci rezultatul downstream – adică cum performează un model antrenat pe aceste date. Google a fintunat un model Gemma-3-12B (un model deschis, relativ mic, de 12 miliarde parametri) pe doar 500 de exemple generate de ToolGrad.

    Rezultatul pe BFCL (Berkeley Function Calling Leaderboard), cel mai respectat benchmark pentru function calling?

  • Gemma-3-12B + ToolGrad (500 sample-uri): 83.1

  • Gemini 2.5 Pro (Modelul flagship, masiv, proprietary al Google): 83.2


  • Citiți din nou. Un model open-source de 12B parametri, antrenat pe doar 500 de exemple de înaltă calitate, se află la 0,1 puncte distanță de modelul suveran, masiv, de top al Google. Acesta este "Holy Grail" al eficienței datelor. Demonstrează că, dacă datele sunt perfecte, nu ai nevoie de miliarde de parametri, nici de miliarde de tokeni de antrenament. Ai nevoie de corectitudine.

    Open Source real: Apache 2.0



    Într-o epocă în care "open source" adesea înseamnă "cod disponibil, dar modelul e gheață" sau "datele sunt proprietare", Google Research a lansat totul sub licența Apache-2.0.

  • Codul sursă: Pentru a rula pipeline-ul ToolGrad.

  • Dataset-ul: Exemplele generate de înaltă calitate.

  • Modelele: Checkpoint-urile fintunate (inclusiv varianta Gemma-3-12B).


  • Aceasta permite oricărui cercetător, startup sau student să reproduce rezultatele, să extindă framework-ul la noi API-uri (ToolGrad este agnostic la domeniu), sau să antreneze propriile modele specializată pentru tool-use fără să plătească costuri de API pentru generarea datelor sau să se bată cu halucinațiile.

    De ce este important:



    De ce este important:


    ToolGrad nu este doar un nou paper de la o conferință de top; este un schimb de paradigă în inginerie date pentru AI. Timp de ani, comunitatea s-a concentrat pe modele mai mari (scaling up), ignorând adesea calitatea "combustibilului" (datele). ToolGrad demonstrează că "Data Quality > Data Quantity > Model Size" pentru capacitatea specifică de function calling.

    1. Democratizează Agentic AI: Până acum, construirea unui agent care să rezerveze zboruri, să caute în baze de date sau să scrie cod necesită acces la modele masive (GPT-4, Claude, Gemini) pentru a genera datele de antrenament sau pentru a rula inferența. ToolGrad + modele mici open-source (Gemma, Llama, Qwen) = Agenti puternici, locali, ieftini și controlabili.
    2. Rezolvă "Data Flywheel" pentru Enterprises: Companiile au sute de API-uri interne. Generarea manuală a datelor de antrenament pentru ele este imposibilă. ToolGrad poate fi rulat pe API-urile interne ale unei companii pentru a genera automat date de antrenament perfecte pentru agenții lor interni.
    3. Validează abordarea "Verifier-In-The-Loop": Succesul buclei Propose-Execute-Select-Update validează ideea că execuția reală este singurul validator adevărat pentru cod/API calls. Nu putem simula corectitudinea; trebuie să o rulăm.
    4. Presiune pe Closed Source: Când un model de 12B bate un model flagship pe un benchmark critic folosind 500 de exemple, mesajul pentru OpenAI, Anthropic și Google DeepMind este clar: avantajul competitiv nu este doar arhitectura modelului, ci pipeline-ul de date. Și pipeline-ul de date acum este public.

    ToolGrad este, probabil, cel mai important lucru de tip "data-centric AI" lansat în 2024/2025 pentru ecosistemul open-source. Nu uitați să verificați repository-ul GitHub și să încercați să generați date pentru propriile voastre API-uri. Viitorul agenților nu este mai mare, este mai curat.

    Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.