Filtrează articolele

Subiect: #învățare prin consolidare

AI OpenAI lansează un cadru de dezvăluire a nealinierii modelelor cu 3 căi de revizuire și 6 rapoarte de incidente din antrenamentul RL

OpenAI lansează un cadru de dezvăluire a nealinierii modelelor cu 3 căi de revizuire și 6 rapoarte de incidente din antrenamentul RL

OpenAI a lansat un cadru inovator pentru dezvăluirea nealinierii modelelor, cu trei căi de revizuire și șase rapoarte de incidente din antrenamentul RL. Acest pas spre transparență ar putea deveni un standard în industrie.

🕒 2 zile în urmă

Google Research introduce R4T: un retriever difuzie antrenat prin RL care accelerează de 12-20 de ori interogările

Google Research a introdus R4T, un cadru care antrenează un retriever difuzie prin RL, oferind rezultate coerente și diverse, de 12-20 de ori mai rapid decât metodele autoregresive. Acest articol explică funcționarea, beneficiile și impactul potențial al acestei inovații.

🕒 2 zile în urmă
AI Acest antreprenor AI dezvoltă agenți care pot planifica în avans pentru situații neprevăzute

Acest antreprenor AI dezvoltă agenți care pot planifica în avans pentru situații neprevăzute

Danijar Hafner, un antreprenor AI cu un trecut impresionant la Google DeepMind, dezvoltă agenți capabili să planifice în avans pentru situații neprevăzute, folosind modele ale lumii și învățare prin consolidare. Tehnica sa ar putea revoluționa robotica, permițând roboților să navigheze în medii necunoscute fără antrenament extensiv în lumea reală.

🕒 1 săptămâni în urmă
AI Hugging Face lansează Microduck: un robot biped open-source de 25 cm, la doar 399 de dolari, pe care îl antrenezi cu învățare prin consolidare

Hugging Face lansează Microduck: un robot biped open-source de 25 cm, la doar 399 de dolari, pe care îl antrenezi cu învățare prin consolidare

Hugging Face a dezvăluit Microduck, un robot biped open-source de 25 cm, la doar 399 de dolari, care poate fi antrenat prin învățare prin consolidare. Acest proiect democratizează robotica, oferind o platformă accesibilă pentru educație, cercetare și experimentare.

🕒 2 săptămâni în urmă
AI ByteDance și Tsinghua AIR lansează CUDA Agent: un sistem RL agentic la scară largă pentru generarea kernel-urilor CUDA

ByteDance și Tsinghua AIR lansează CUDA Agent: un sistem RL agentic la scară largă pentru generarea kernel-urilor CUDA

ByteDance Seed și Tsinghua AIR au lansat CUDA Agent, un sistem de învățare prin consolidare agentic la scară largă care generează automat kernel-uri CUDA optimizate. Acesta promite să revoluționeze programarea GPU, reducând timpul de dezvoltare și îmbunătățind performanța aplicațiilor de înaltă performanță.

🕒 1 luni în urmă
AI Kimi AI și kvcache-ai lansează open-source AgentENV: Sistemul distribuit care alimentează antrenamentul de învățare prin consolidare agentică pentru Kimi K3

Kimi AI și kvcache-ai lansează open-source AgentENV: Sistemul distribuit care alimentează antrenamentul de învățare prin consolidare agentică pentru Kimi K3

Kimi AI și kvcache-ai au deschis codul sursă al AgentENV, un sistem distribuit pentru antrenamentul de învățare prin consolidare agentică, care a stat la baza modelului Kimi K3. Platforma democratizează accesul la infrastructura necesară pentru agenți AI avansați.

🕒 1 luni în urmă
AI Trio-ul DeepMind care a creat un AI de poker face acum bani pentru fondurile speculative cantitative

Trio-ul DeepMind care a creat un AI de poker face acum bani pentru fondurile speculative cantitative

Trei foști cercetători DeepMind, creatori ai AI-ului de poker DeepStack, au fondat EquiLibre Technologies, un laborator care aplică învățarea prin consolidare în tranzacționarea pe piețele financiare. Startup-ul, evaluat la 500 de milioane de dolari după o rundă Series A condusă de Creandum, tranzacționează deja miliarde de dolari zilnic pe S&P 500 și NASDAQ, cu un istoric de zero luni negative.

🕒 2 luni în urmă
AI Patronus AI atrage 50 de milioane de dolari pentru a construi „lumi digitale” care testează agenții AI

Patronus AI atrage 50 de milioane de dolari pentru a construi „lumi digitale” care testează agenții AI

Patronus AI, un startup fondat de foști cercetători Meta, a strâns 50 de milioane de dolari pentru a construi lumi digitale simulate în care agenții AI sunt testați la limită. Scopul: să se asigure că acești agenți pot executa sarcini complexe fără a face greșeli periculoase. Veniturile au crescut de 15 ori, iar clienții includ toate marile laboratoare AI.

🕒 2 luni în urmă

NVIDIA lansează Polar: un cadru de rollout fidel token-urilor pentru antrenamentul GRPO pe Codex, Claude Code și Qwen Code

NVIDIA a lansat Polar, un cadru de rollout care antrenează agenți lingvistici prin învățare prin consolidare fără a modifica harness-urile. Folosind GRPO pe un model Qwen3.5-4B, Polar îmbunătățește scorul SWE-Bench Verified cu până la 22,6 puncte, fiind integrat în NeMo Gym și ProRL Agent Server.

🕒 3 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.