Filtrează articolele

Subiect: #Evals

AI Supabase lansează Evals: un benchmark open source care evaluează Claude Code, Codex și OpenCode pe sarcini reale Supabase

Supabase lansează Evals: un benchmark open source care evaluează Claude Code, Codex și OpenCode pe sarcini reale Supabase

Supabase a lansat Evals, un benchmark open source care evaluează agenții AI precum Claude Code, Codex și OpenCode pe sarcini reale din ecosistemul Supabase. Rezultatele arată care model se descurcă cel mai bine la crearea de tabele, interogări SQL și politici de securitate.

🕒 3 zile în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.