Filtrează articolele

Subiect: #Benchmark

Pot LLM-urile să-și construiască singure hamul de agent? ByteDance Seed spune că doar 34 din 64 de modificări se generalizează

ByteDance Seed și partenerii săi academici au lansat HarnessDev, un benchmark care măsoară nu răspunsurile unui LLM, ci hamul de agent pe care acesta reușește să și-l construiască singur. Rezultatele arată progres real la scris și experimente ML, dar și o problemă serioasă de generalizare: doar 34 din 64 de modificări auto-generate funcționează și pe sarcini noi.

🕒 1 săptămâni în urmă
AI Keenable AI lansează open-source NEEDLE: un benchmark de căutare live care își reconstruiește setul de interogări în fiecare oră

Keenable AI lansează open-source NEEDLE: un benchmark de căutare live care își reconstruiește setul de interogări în fiecare oră

Keenable AI a lansat open-source NEEDLE, un benchmark de căutare live care își reconstruiește setul de interogări în fiecare oră. Această abordare dinamică oferă o evaluare realistă a sistemelor AI, testând capacitatea lor de a se adapta la informații noi. Articolul analizează importanța acestui instrument pentru cercetarea și dezvoltarea AI.

🕒 2 săptămâni în urmă
AI Cipul Jalapeño de la OpenAI: performanțe remarcabile la inferență, dar concurența nu doarme

Cipul Jalapeño de la OpenAI: performanțe remarcabile la inferență, dar concurența nu doarme

OpenAI a prezentat la Hot Chips primele rezultate de benchmark pentru cipul său Jalapeño, care arată o performanță semnificativă la inferență, cu mai multe tokenuri per utilizator și mai mult throughput per kilowatt decât sistemele actuale. Cipul, dezvoltat cu Broadcom, este proiectat pentru a minimiza întârzierile în prefill și comunicare, și va fi implementat în volume mici la sfârșitul lui 2026. Această mișcare strategică ar putea schimba echilibrul de putere în industria AI.

🕒 3 săptămâni în urmă
AI Supabase lansează Evals: un benchmark open source care evaluează Claude Code, Codex și OpenCode pe sarcini reale Supabase

Supabase lansează Evals: un benchmark open source care evaluează Claude Code, Codex și OpenCode pe sarcini reale Supabase

Supabase a lansat Evals, un benchmark open source care evaluează agenții AI precum Claude Code, Codex și OpenCode pe sarcini reale din ecosistemul Supabase. Rezultatele arată care model se descurcă cel mai bine la crearea de tabele, interogări SQL și politici de securitate.

🕒 1 luni în urmă
Tehnologie Datalab Marker v2 vs MinerU, Docling și Liteparse: Analiză comparativă a performanțelor

Datalab Marker v2 vs MinerU, Docling și Liteparse: Analiză comparativă a performanțelor

O analiză detaliată a patru instrumente open-source de parsing de documente: Datalab Marker v2, MinerU, Docling și Liteparse. Comparăm acuratețea, viteza și consumul de resurse pentru a te ajuta să alegi soluția potrivită nevoilor tale.

🕒 1 luni în urmă
AI Marker 2 de la Datalab zdrobește competiția: 76.0 pe olmOCR-bench, de 5 ori mai rapid decât MinerU

Marker 2 de la Datalab zdrobește competiția: 76.0 pe olmOCR-bench, de 5 ori mai rapid decât MinerU

Marker 2 de la Datalab a obținut un scor de 76.0 pe benchmark-ul olmOCR, depășind MinerU, Docling și LiteParse, și oferind un debit de cinci ori mai mare. Descoperiți cum această performanță redefinește standardele în procesarea documentelor.

🕒 1 luni în urmă
AI Anthropic lansează Opus 5: noul model AI care promite performanță superioară și mai puține restricții

Anthropic lansează Opus 5: noul model AI care promite performanță superioară și mai puține restricții

Anthropic a lansat Opus 5, un model AI mai ieftin și mai puțin restrictiv decât Fable 5, dar care îl depășește pe unele benchmark-uri. Noua funcție Automatic Fallbacks reduce perturbările cauzate de măsurile de siguranță.

🕒 1 luni în urmă
AI Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2: Comparație între modelele MoE de scară trilionară – benchmark-uri, licențe și costuri de servire

Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2: Comparație între modelele MoE de scară trilionară – benchmark-uri, licențe și costuri de servire

Comparație detaliată între trei modele MoE de scară trilionară: Kimi K3, DeepSeek V4 Pro și GLM-5.2. Analizăm benchmark-uri, licențe și costuri de servire pentru a te ajuta să alegi cel mai potrivit model pentru proiectele tale.

🕒 2 luni în urmă
AI Anthropic Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8: Comparație de benchmark-uri, prețuri API și raport cost-performanță

Anthropic Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8: Comparație de benchmark-uri, prețuri API și raport cost-performanță

Comparație detaliată între modelele Anthropic Claude Sonnet 5, Sonnet 4.6 și Opus 4.8, incluzând benchmark-uri agentice, prețuri API și analiza cost-performanță. Descoperă care model oferă cel mai bun raport calitate-preț pentru sarcinile tale de codare.

🕒 2 luni în urmă
AI Anthropic Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8: Comparație de benchmark-uri pentru codare agentică, prețuri API și raport cost-performanță

Anthropic Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8: Comparație de benchmark-uri pentru codare agentică, prețuri API și raport cost-performanță

Analizăm performanțele modelelor Anthropic Claude Sonnet 5, Sonnet 4.6 și Opus 4.8 în benchmark-uri de codare agentică, comparăm prețurile API și evaluăm raportul cost-performanță pentru a ajuta dezvoltatorii să aleagă cel mai potrivit model.

🕒 2 luni în urmă
AI OpenAI lansează LifeSciBench: un benchmark cu 750 de sarcini pentru evaluarea modelelor AI în cercetarea științifică reală

OpenAI lansează LifeSciBench: un benchmark cu 750 de sarcini pentru evaluarea modelelor AI în cercetarea științifică reală

OpenAI a lansat LifeSciBench, un benchmark cu 750 de sarcini și rubrici create de experți, pentru a evalua capacitatea modelelor AI de a rezolva probleme reale din științele vieții. Primele teste arată că modelele performează bine la sarcini de memorare, dar se luptă cu raționamentul complex.

🕒 3 luni în urmă
AI Moonshot AI lansează Kimi K2.7-Code: un model de codare care raportează o îmbunătățire de +21,8% pe Kimi Code Bench v2 față de K2.6

Moonshot AI lansează Kimi K2.7-Code: un model de codare care raportează o îmbunătățire de +21,8% pe Kimi Code Bench v2 față de K2.6

Moonshot AI a lansat Kimi K2.7-Code, un model de codare care înregistrează o îmbunătățire de +21,8% pe Kimi Code Bench v2 față de versiunea anterioară. Articolul analizează caracteristicile, impactul asupra dezvoltatorilor și provocările asociate, subliniind importanța acestui salt înainte pentru industria AI.

🕒 3 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.