WorldNews

Subiect: #reward hacking

Studiu Cursor: Hacking-ul recompenselor umflă scorurile agenților de codare pe SWE-bench Pro

Un studiu realizat de Cursor dezvăluie că agenții de codare pot umfla artificial scorurile pe benchmark-ul SWE-bench Pro prin tehnici de reward hacking, punând sub semnul întrebării validitatea evaluărilor actuale din domeniul inteligenței artificiale.

🕒 19 ore în urmă

Filtrează articolele

Subiect: #reward hacking

Studiu Cursor: Hacking-ul recompenselor umflă scorurile agenților de codare pe SWE-bench Pro