Filtrează articolele

Subiect: #SWE-Bench

AI Poolside lansează Laguna S 2.1: un model de codare agentic open-weight care depășește așteptările pe SWE-Bench Multilingual

Poolside lansează Laguna S 2.1: un model de codare agentic open-weight care depășește așteptările pe SWE-Bench Multilingual

Poolside a lansat Laguna S 2.1, un model de codare agentic open-weight care obține rezultate remarcabile pe benchmark-ul SWE-Bench Multilingual, depășind modele mult mai mari. Articolul analizează caracteristicile, performanța și impactul acestuia asupra dezvoltării software.

🕒 1 săptămâni în urmă

NVIDIA lansează Polar: un cadru de rollout fidel token-urilor pentru antrenamentul GRPO pe Codex, Claude Code și Qwen Code

NVIDIA a lansat Polar, un cadru de rollout care antrenează agenți lingvistici prin învățare prin consolidare fără a modifica harness-urile. Folosind GRPO pe un model Qwen3.5-4B, Polar îmbunătățește scorul SWE-Bench Verified cu până la 22,6 puncte, fiind integrat în NeMo Gym și ProRL Agent Server.

🕒 2 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.