Supabase lansează Evals: un benchmark open source care evaluează Claude Code, Codex și OpenCode pe sarcini reale Supabase
Supabase a lansat Evals, un benchmark open source care evaluează agenții AI precum Claude Code, Codex și OpenCode pe sarcini reale din ecosistemul Supabase. Rezultatele arată care model se descurcă cel mai bine la crearea de tabele, interogări SQL și politici de securitate.
🕒 3 zile în urmă