Filtrează articolele

Subiect: #Terminal Bench

Anthropic lansează Claude Fable 5.1 și Mythos 5.1: Performanțe de top în știință și costuri tăiate cu trei sferturi pentru cache

Anthropic lansează Claude Fable 5.1 (public) și Mythos 5.1 (restrâns, Project Glasswing). Același model, două straturi de siguranță. Fable 5.1 atinge 52,6% pe Terminal-Bench-Science (vs 24,7% la v5), are 1M tokeni context și reduce costul cache reads cu 75% (la $0,25/M token). API-ul suferă 3 breaking changes majore, incluzând eliminarea forced tool use. O analiză profundă a impactului economic și arhitectural.

🕒 2 săptămâni în urmă
AI GPT-5.5: Cel mai avansat model AI agentic al OpenAI până în prezent

GPT-5.5: Cel mai avansat model AI agentic al OpenAI până în prezent

OpenAI a lansat GPT-5.5, cel mai avansat model AI agentic, cu performanțe superioare pe benchmark-uri cheie, dar cu prețuri duble față de predecesor. Articolul analizează capabilitățile, costurile și implicațiile pentru utilizatori.

🕒 4 luni în urmă
AI MiniMax a Lansat Open-Source MiniMax M2.7: Un Model de Agent Auto-Evolutiv care Obține 56,22% pe SWE-Pro și 57,0% pe Terminal Bench 2

MiniMax a Lansat Open-Source MiniMax M2.7: Un Model de Agent Auto-Evolutiv care Obține 56,22% pe SWE-Pro și 57,0% pe Terminal Bench 2

MiniMax a lansat open-source modelul M2.7, un agent AI auto-evolutiv care obține rezultate impresionante: 56,22% pe SWE-Pro și 57,0% pe Terminal Bench 2, demonstrând capacitatea sistemelor de a se îmbunătăți autonom.

🕒 5 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.