Filtrează articolele

Subiect: #HarnessDev

Pot LLM-urile să-și construiască singure hamul de agent? ByteDance Seed spune că doar 34 din 64 de modificări se generalizează

ByteDance Seed și partenerii săi academici au lansat HarnessDev, un benchmark care măsoară nu răspunsurile unui LLM, ci hamul de agent pe care acesta reușește să și-l construiască singur. Rezultatele arată progres real la scris și experimente ML, dar și o problemă serioasă de generalizare: doar 34 din 64 de modificări auto-generate funcționează și pe sarcini noi.

🕒 1 săptămâni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.