Filtrează articolele

Subiect: #învățare prin întărire

AI Prime Intellect lansează Verifiers v1: seturi de sarcini, hamuri și runtime-uri compozabile pentru antrenamentul și evaluarea RL agentic

Prime Intellect lansează Verifiers v1: seturi de sarcini, hamuri și runtime-uri compozabile pentru antrenamentul și evaluarea RL agentic

Prime Intellect a lansat Verifiers v1, o suită open-source de instrumente modulare pentru antrenamentul și evaluarea agenților RL. Include seturi de sarcini compozabile, hamuri de testare standardizate și runtime-uri flexibile, facilitând reproductibilitatea și inovația în cercetarea AI.

🕒 3 săptămâni în urmă
AI Prime Intellect atrage 130 de milioane de dolari pentru a ajuta companiile să-și construiască proprii agenți AI

Prime Intellect atrage 130 de milioane de dolari pentru a ajuta companiile să-și construiască proprii agenți AI

Prime Intellect, un startup care oferă putere de calcul și instrumente pentru construirea de agenți AI, a strâns 130 de milioane de dolari într-o rundă Seria A, evaluându-se la un miliard de dolari. Runda a fost condusă de Radical Ventures, cu participarea Nvidia, Intel, Dell și a unor fondatori celebri. Compania vrea să ajute întreprinderile să-și antreneze propriii agenți fără a depinde de laboratoarele de frontieră AI.

🕒 3 săptămâni în urmă
AI NVIDIA HORIZON: Agentul autonom care revoluționează Git Worktrees și atinge 100% la benchmark-ul RTL

NVIDIA HORIZON: Agentul autonom care revoluționează Git Worktrees și atinge 100% la benchmark-ul RTL

NVIDIA a dezvăluit HORIZON, un agent AI hands-free care automatizează Git worktrees și a obținut 100% la benchmark-ul RTL. Descoperiți cum funcționează și ce înseamnă pentru viitorul dezvoltării software.

🕒 1 luni în urmă
AI NVIDIA AI lansează ASPIRE: un cadru robotic auto-îmbunătățit care atinge 31% performanță zero-shot în sarcinile lungi LIBERO-Pro

NVIDIA AI lansează ASPIRE: un cadru robotic auto-îmbunătățit care atinge 31% performanță zero-shot în sarcinile lungi LIBERO-Pro

NVIDIA a lansat ASPIRE, un cadru robotic auto-îmbunătățit care atinge 31% performanță zero-shot în sarcinile lungi LIBERO-Pro. Sistemul combină învățarea prin întărire cu modele de limbaj și auto-reflecție, permițând roboților să se adapteze la sarcini noi fără antrenament suplimentar. Articolul explică funcționarea, importanța și provocările acestei inovații.

🕒 1 luni în urmă

Prime Intellect lansează prime-rl 0.6.0: un cadru deschis pentru antrenarea modelelor MoE de trilioane de parametri prin învățare prin întărire agentică

Prime Intellect a lansat prime-rl 0.6.0, un cadru open-source pentru învățare prin întărire asincronă pe modele MoE de trilioane de parametri. Cu optimizări precum inferența FP8, paralelism expert larg și disociere prefill/decode, a antrenat GLM-5 pe sarcini SWE cu performanțe remarcabile pe doar 28 de noduri H200.

🕒 1 luni în urmă

Harness-1: Agentul de căutare de 20B antrenat cu învățare prin întărire într-un mediu de căutare cu stare

Harness-1, un subagent de căutare de 20 de miliarde de parametri dezvoltat de UIUC și Chroma, folosește învățarea prin întărire într-un mediu cu stare pentru a găsi, curata și verifica informații. Cu o medie de 0,730 curated recall pe opt benchmark-uri, depășește cu 11,4 puncte următorul agent open-source și este disponibil public.

🕒 1 luni în urmă
Societate & Lifestyle Microsoft Research lansează World-R1: Consistență geometrică în Wan 2.1 fără modificări arhitecturale

Microsoft Research lansează World-R1: Consistență geometrică în Wan 2.1 fără modificări arhitecturale

Microsoft Research a dezvoltat World-R1, o metodă care îmbunătățește consistența geometrică a modelului de generare video Wan 2.1 fără a-i modifica arhitectura. Folosind Flow-GRPO și recompense 3D-aware, această abordare bazată pe învățare prin întărire promite videoclipuri mai realiste și mai coerente spațial.

🕒 3 luni în urmă

Ghid de codare pentru post-antrenamentul LLM cu TRL: de la Supervised Fine Tuning la DPO și GRPO Reasoning

Un ghid practic de codare pentru post-antrenamentul modelelor de limbaj mari (LLM) folosind biblioteca TRL, acoperind Supervised Fine Tuning (SFT), Direct Preference Optimization (DPO) și Group Relative Policy Optimization (GRPO), cu exemple de cod și explicații detaliate.

🕒 3 luni în urmă

Construiește un agent bazat pe învățare prin întărire care învață să recupereze amintiri relevante pe termen lung pentru răspunsuri precise la întrebări cu LLM

Descoperă cum poți construi un agent bazat pe învățare prin întărire care învață să recupereze amintiri relevante pe termen lung pentru a îmbunătăți acuratețea răspunsurilor modelelor de limbaj mari (LLM). Articolul explică arhitectura, antrenarea și aplicațiile practice ale acestei tehnologii inovatoare.

🕒 3 luni în urmă
AI David Silver, fostul cercetător DeepMind, strânge 1,1 miliarde de dolari pentru a construi o inteligență artificială care învață fără date umane

David Silver, fostul cercetător DeepMind, strânge 1,1 miliarde de dolari pentru a construi o inteligență artificială care învață fără date umane

David Silver, fostul cercetător DeepMind, a strâns 1,1 miliarde de dolari pentru Ineffable Intelligence, un startup AI care vrea să construiască un sistem capabil să învețe fără date umane, folosind învățarea prin întărire. Compania este evaluată la 5,1 miliarde de dolari și are sprijinul unor investitori de top precum Sequoia Capital și Lightspeed.

🕒 3 luni în urmă

Cercetarea revoluționară Google DeepMind permite unui LLM să-și rescrie propriile algoritmi de teoria jocurilor — și i-a depășit pe experți

Google DeepMind a dezvoltat AlphaEvolve, un sistem AI capabil să-și rescrie autonom algoritmii de teoria jocurilor, demonstrând performanțe care depășesc expertiza umană în jocuri cu informație imperfectă precum poker.

🕒 4 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.