Filtrează articolele

Subiect: #Reinforcement Learning

AI Pionierul ChatGPT lansează modelul Jev pentru logică programatică

Pionierul ChatGPT lansează modelul Jev pentru logică programatică

TypeSafe, compania fondată de co-inventatorul ChatGPT Diogo Almeida, lansează Jev, un model specializat în logică programatică, care generează decizii structurate direct în cod, fără text, cu latențe de milisecunde și costuri infime. O schimbare de paradigmă pentru automatizarea deciziilor.

🕒 2 zile în urmă
AI Cercetătorii UC Berkeley lansează CUA-Lite: Platforma open-source care schimbă jocul pentru agenții AI care folosesc calculatoarele

Cercetătorii UC Berkeley lansează CUA-Lite: Platforma open-source care schimbă jocul pentru agenții AI care folosesc calculatoarele

Cercetătorii de la UC Berkeley lansează CUA-Lite, o platformă open-source care unifică sandbox-uri, date, evaluare și RL pentru agenții computer-use. Articolul analizează arhitectura, impactul și de ce acest lucru democratizează dezvoltarea agenților AI autonomi.

🕒 1 săptămâni în urmă
AI Hugging Face lansează Microduck: un robot biped open-source de 25 cm, la doar 399 de dolari, pe care îl antrenezi cu învățare prin consolidare

Hugging Face lansează Microduck: un robot biped open-source de 25 cm, la doar 399 de dolari, pe care îl antrenezi cu învățare prin consolidare

Hugging Face a dezvăluit Microduck, un robot biped open-source de 25 cm, la doar 399 de dolari, care poate fi antrenat prin învățare prin consolidare. Acest proiect democratizează robotica, oferind o platformă accesibilă pentru educație, cercetare și experimentare.

🕒 2 săptămâni în urmă
AI NVIDIA lansează Molt: Un cadru de învățare prin consolidare agentic, nativ PyTorch

NVIDIA lansează Molt: Un cadru de învățare prin consolidare agentic, nativ PyTorch

NVIDIA a lansat Molt, un cadru open-source de învățare prin consolidare, nativ PyTorch, conceput pentru a simplifica crearea de agenți inteligenți. Articolul explică caracteristicile, impactul și cum să începi să folosești Molt.

🕒 1 luni în urmă
AI Open Dreamer: Reproducerea completă a modelului Dreamer 4, acum open-source și gata de antrenat

Open Dreamer: Reproducerea completă a modelului Dreamer 4, acum open-source și gata de antrenat

Open Dreamer este o reproducere completă a pipeline-ului Dreamer 4, construită în JAX și Flax, cu rețeta completă de antrenament publicată. Acest proiect open-source democratizează accesul la unul dintre cele mai avansate modele de world model, permițând cercetătorilor și dezvoltatorilor să reproducă, să modifice și să inoveze pe baza sa.

🕒 1 luni în urmă
AI Cercetătorii de la Stanford prezintă TRACE: un sistem de instruire agentică ce transformă eșecurile recurente în medii sintetice de învățare prin consolidare

Cercetătorii de la Stanford prezintă TRACE: un sistem de instruire agentică ce transformă eșecurile recurente în medii sintetice de învățare prin consolidare

Cercetătorii de la Stanford au dezvoltat TRACE, un sistem care transformă eșecurile recurente ale agenților AI în medii sintetice de antrenament prin consolidare, accelerând învățarea și îmbunătățind robustețea. Articolul explică mecanismul, rezultatele și implicațiile acestei abordări inovatoare.

🕒 2 luni în urmă
AI Google aprofundează legăturile cu Thinking Machines Lab printr-un acord de mai multe miliarde de dolari

Google aprofundează legăturile cu Thinking Machines Lab printr-un acord de mai multe miliarde de dolari

Google a semnat un acord de mai multe miliarde de dolari cu Thinking Machines Lab, startup-ul fondat de Mira Murati, pentru a oferi acces la infrastructura de cloud de ultima generație, inclusiv sistemele alimentate de cipurile Nvidia GB300, în cadrul unei strategii mai largă de a se asigura poziția de lider în infrastructura de IA prin parteneriate timpurie cu laboratorii de frontiera.

🕒 5 luni în urmă
AI Kimina-Prover: Revoluția în Demonstrația Automată de Teoreme prin Căutare RL în Timpul Testării

Kimina-Prover: Revoluția în Demonstrația Automată de Teoreme prin Căutare RL în Timpul Testării

Kimina-Prover-72B stabilește un nou standard în demonstrația automată de teoreme, atingând o rată de succes de 92.2% pe benchmark-ul miniF2F. Inovația sa principală, cadrul TTRL Search, permite modelului să descopere și combine recursiv leme, transformând procesul dintr-o simplă generare într-o căutare agentică strategică și profundă.

🕒 5 luni în urmă
AI Kimina-Prover-RL: O nouă eră în demonstrarea automată a teoremelor prin învățare prin întărire

Kimina-Prover-RL: O nouă eră în demonstrarea automată a teoremelor prin învățare prin întărire

Echipa Kimina lansează kimina-prover-rl, un pipeline open-source de învățare prin întărire pentru demonstrarea teoremelor în Lean 4, care utilizează un paradigmă de raționament structurat și un mecanism inovator de corecție a erorilor, obținând performanțe de top pentru modelele de dimensiuni mici.

🕒 5 luni în urmă
AI NVIDIA AI prezintă ProRL Agent: O infrastructură decuplată de tip „Rollout-as-a-Service” pentru învățarea prin întărire a agenților LLM multi-turn la scară largă

NVIDIA AI prezintă ProRL Agent: O infrastructură decuplată de tip „Rollout-as-a-Service” pentru învățarea prin întărire a agenților LLM multi-turn la scară largă

Cercetătorii de la NVIDIA au lansat ProRL Agent, o infrastructură scalabilă care revoluționează antrenarea agenților LLM prin decuplarea procesului de colectare a experiențelor (rollout) de bucla de antrenament, rezolvând astfel conflictele majore de resurse care îngreunează dezvoltarea AI-ului la scară largă.

🕒 5 luni în urmă
AI Familia Palmyra-mini: Modele puternice, ușoare și pregătite pentru raționament complex

Familia Palmyra-mini: Modele puternice, ușoare și pregătite pentru raționament complex

Familia Palmyra-mini redefinesc standardele modelelor de limbaj ușoare, combinând eficiența computațională cu capacități avansate de raționament. Descoperă noile modele „thinking”, antrenate cu Chain of Thought, care obțin scoruri remarcabile pe benchmark-uri precum GSM8K și AMC23.

🕒 5 luni în urmă
AI Construirea Ecosistemului Open Agent Împreună: Prezentarea OpenEnv

Construirea Ecosistemului Open Agent Împreună: Prezentarea OpenEnv

Meta-PyTorch și Hugging Face lansează OpenEnv, un standard deschis pentru medii agențiale care redefinesc antrenamentul și implementarea AI. Acest ecosistem oferă siguranță, scalabilitate și un cadru standardizat pentru dezvoltarea agenților autonomi.

🕒 5 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.