Pot LLM-urile să-și construiască singure hamul de agent? ByteDance Seed spune că doar 34 din 64 de modificări se generalizează
ByteDance Seed și partenerii săi academici au lansat HarnessDev, un benchmark care măsoară nu răspunsurile unui LLM, ci hamul de agent pe care acesta reușește să și-l construiască singur. Rezultatele arată progres real la scris și experimente ML, dar și o problemă serioasă de generalizare: doar 34 din 64 de modificări auto-generate funcționează și pe sarcini noi.
🕒 1 săptămâni în urmă