Google lansează Gemini 3.6 Flash: un salt major în eficiența token-urilor pentru agenții AI enterprise
Google a dezvăluit recent două noi modele de inteligență artificială – Gemini 3.6 Flash și Gemini 3.5 Flash-Lite – concepute special pentru a reduce latența și costurile asociate token-urilor în cadrul agenților AI enterprise. În spatele acestei lansări se află o realitate pe care puțini furnizori o recunosc deschis: economia agenților autonomi care rulează în medii de producție se reduce la o ecuație simplă, dar dură. Un model trebuie să raționeze corect printr-o sarcină multi-etapă, dar fiecare token suplimentar generat în acest proces adaugă costuri și întârzieri unui flux de lucru care poate rula de mii de ori pe oră. Echipele care construiesc agenți de fundal, nu interfețe de chat, au nevoie în primul rând de debit, nu de numărul de parametri. Răspunsul Google, anunțat săptămâna aceasta, împarte acest compromis în trei modele: Gemini 3.6 Flash pentru codare și raționament multimodal, Gemini 3.5 Flash-Lite pentru volume mari și latență redusă, și o variantă restricționată Gemini 3.5 Flash Cyber, construită pentru remedierea vulnerabilităților.Documentația pentru dezvoltatori a lui 3.6 Flash se concentrează pe o singură cifră: cu 17% mai puține token-uri de ieșire decât versiunea anterioară 3.5 Flash, pe baza măsurătorilor din Artificial Analysis Index. În teste sintetice specifice, inclusiv benchmark-ul Datacurve DeepSWE, Google raportează scăderi ale utilizării token-urilor de până la 65%. Prețul este de 1,50 USD per milion de token-uri de intrare și 7,50 USD per milion de token-uri de ieșire, poziționând modelul pentru bucle de raționament care rulează continuu, nu la cerere. Pe DeepSWE, compania înregistrează o rată de succes de 49% pentru 3.6 Flash, față de 37% pentru predecesorul său. Pe MLE Bench, scorul crește de la 49,7% la 63,9%, iar pe testul GDPval-AA v2 al Google – care încearcă să măsoare munca intelectuală din lumea reală, nu doar puzzle-uri de codare – 3.6 Flash obține 1421 față de 1349 pentru modelul mai vechi.Figma a integrat deja 3.6 Flash în infrastructura sa de prototipare, iar conform lui Matt Colyer, Director de Inginerie a Produselor la Figma, modelul oferă dezvoltatorilor o cale mai rapidă prin iterațiile de design, fără o scădere a calității rezultatelor. Platforma juridică Harvey și instrumentul de cercetare Hebbia direcționează datele prin model pentru lucrul cu documente multimodale: ingerarea de depuneri financiare brute, analiza structurii documentelor, citirea graficelor încorporate și producerea de rapoarte draft pentru revizuire.Google a inclus, de asemenea, un instrument nativ de utilizare a computerului direct în API-ul Gemini și platformele Gemini Enterprise, eliminând software-ul intermediar personalizat pe care inginerii îl construiau anterior pentru a permite modelelor să opereze deasupra unui sistem de operare. Compania raportează un scor OSWorld-Verified de 83,0%, față de 78,4%, și spune că măsurile de siguranță actualizate împotriva utilizării greșite chimice, biologice, radiologice și nucleare îmbunătățesc rezistența la jailbreak fără a crește ratele de refuz pentru solicitările benigne.Gemini 3.5 Flash-Lite vizează o altă sarcină: procesarea documentelor și căutarea agentică la volume mari, nu profunzimea raționamentului. Artificial Analysis Index a măsurat modelul la 350 de token-uri de ieșire pe secundă, cel mai rapid din seria 3.5, conform Google. Prețul este de 0,30 USD per milion de token-uri de intrare și 2,50 USD per milion de token-uri de ieșire, suficient de ieftin încât echipele de inginerie pot direcționa cererile simple, de volum mare, către un nivel minim de gândire și pot rezerva nivelurile superioare pentru munca multi-etapă. Pe testul GDM-MRCR v2 de context lung al Google, Gemini 3.5 Flash-Lite a înregistrat o rată de succes de 72,2% față de 60,1% pentru predecesorul său, iar scorul GDPval-AA v2 aproape s-a dublat, de la 642 la 1140. Modelul are același instrument nativ de utilizare a computerului ca 3.6 Flash.Separat, Google spune că Gemini 3.5 Pro rămâne în testare cu parteneri înainte de o lansare completă, iar pre-antrenamentul pentru următoarea arhitectură Gemini 4 este deja în desfășurare.Scanerele automate de vulnerabilități descoperă acum defecte mai repede decât pot repara majoritatea echipelor de securitate, iar acest decalaj este locul unde Google poziționează Gemini 3.5 Flash Cyber. Modelul este construit pentru a valida și remedia vulnerabilitățile de cod, iar Google raportează performanțe pe benchmark-ul CyberGym competitive cu modelele de frontieră (deși nu a făcut publice aceste cifre în același detaliu ca lansările pentru consumatori). Distribuția rămâne restricționată la guverne și parteneri verificați printr-un program pilot, o limitare pe care Google o justifică drept o măsură de siguranță împotriva generării de cod de exploatare pentru utilizare ofensivă. În interiorul agentului de securitate CodeMender al Google, mai multe instanțe ale 3.5 Flash Cyber rulează în paralel, verificând reciproc constatările înainte de a produce un singur raport de remediere pe care un revizor uman îl semnează.Echipele de inginerie care doresc să integreze aceste noi modele le pot accesa prin API-ul Gemini, prin Google AI Studio, Android Studio sau platforma Gemini Enterprise Agent. Consumatorii pot accesa, de asemenea, noile modele în aplicația Gemini, iar 3.5 Flash-Lite este implementată și în Google Search.### De ce este important:Această lansare marchează o schimbare fundamentală în economia inteligenței artificiale enterprise. Până acum, companiile se confruntau cu o alegere dificilă: fie plăteau prețuri exorbitante pentru modele capabile să raționeze profund, fie sacrificau acuratețea pentru viteză și costuri reduse. Cu Gemini 3.6 Flash și Flash-Lite, Google oferă o soluție care reduce semnificativ numărul de token-uri necesare pentru sarcini complexe, ceea ce se traduce direct în costuri operaționale mai mici și timpi de răspuns mai rapizi. Pentru companiile care implementează agenți AI la scară largă – fie în servicii financiare, juridice, de securitate cibernetică sau cercetare – aceasta înseamnă posibilitatea de a automatiza fluxuri de lucru care anterior erau prea costisitoare sau lente. Mai mult, includerea unui instrument nativ de control al computerului elimină barierele tehnice, permițând agenților să interacționeze direct cu sistemele de operare fără middleware personalizat. În contextul unei competiții acerbe cu OpenAI, Anthropic și alți jucători, Google demonstrează că înțelege nevoile reale ale întreprinderilor: nu doar putere brută, ci eficiență economică și scalabilitate. Această direcție va modela viitorul agenților AI enterprise, făcându-i mai accesibili și mai practici pentru o gamă largă de industrii.