Filtrează articolele

Subiect: #Viziune Computerizată

Evaluarea modelelor vizuale multimodale cu Moonshot PerceptionBench: un flux de lucru robust pentru încărcarea datelor și judecata automată

Un tutorial recent prezintă un flux de lucru end-to-end pentru evaluarea modelelor vizuale multimodale folosind Moonshot PerceptionBench, punând accent pe încărcarea robustă a datelor și judecata automată. Articolul analizează sarcinile benchmark-ului, de la OCR la detectarea halucinațiilor, și explică de această abordare este esențială pentru viitorul AI.

🕒 1 luni în urmă
AI NVIDIA lansează DeepStream 9.1: Inteligența artificială agentică ajunge în domeniul viziunii computerizate cu 13 abilități și urmărire 3D multi-vedere

NVIDIA lansează DeepStream 9.1: Inteligența artificială agentică ajunge în domeniul viziunii computerizate cu 13 abilități și urmărire 3D multi-vedere

NVIDIA a lansat DeepStream 9.1, aducând inteligența artificială agentică în viziunea computerizată. Platforma include 13 abilități predefinite și urmărire 3D multi-vedere, permițând sistemelor să perceapă, să raționeze și să acționeze autonom în timp real.

🕒 2 luni în urmă
AI Ant Group lansează open-source LingBot-Vision: Un model de viziune de 1 miliard de parametri pentru percepția spațială densă

Ant Group lansează open-source LingBot-Vision: Un model de viziune de 1 miliard de parametri pentru percepția spațială densă

Ant Group, prin divizia Robbyant, a lansat open-source LingBot-Vision, un model de viziune computerizată de 1 miliard de parametri, centrat pe granițe, pentru percepție spațială densă. Articolul explică arhitectura, aplicațiile și impactul asupra roboticii, vehiculelor autonome și altor domenii.

🕒 2 luni în urmă
AI Un model, trei modalități: ByteDance lansează Lance pentru înțelegerea, generarea și editarea imaginilor și videoclipurilor

Un model, trei modalități: ByteDance lansează Lance pentru înțelegerea, generarea și editarea imaginilor și videoclipurilor

ByteDance a lansat Lance, un model AI unificat care integrează înțelegerea, generarea și editarea imaginilor și videoclipurilor într-o singură arhitectură. Articolul explorează funcționalitățile, aplicațiile potențiale și impactul acestei inovații asupra industriei tehnologice.

🕒 4 luni în urmă
AI Meta AI lansează Sapiens2: Modelul revoluționar de viziune uman-centrică pentru poziție, segmentare, normale, hartă de puncte și albedo

Meta AI lansează Sapiens2: Modelul revoluționar de viziune uman-centrică pentru poziție, segmentare, normale, hartă de puncte și albedo

Meta AI a lansat Sapiens2, un model de viziune computerizată de înaltă rezoluție specializat pe sarcini uman-centrice: estimarea poziției, segmentarea corpului, hărți de normale, hărți de puncte și albedo. Modelul open-source promite să revoluționeze realitatea augmentată, robotica și animația digitală.

🕒 4 luni în urmă
Tehnologie NVIDIA Cosmos Reason 2: O nouă eră în raționamentul artificial pentru roboți și sisteme autonome

NVIDIA Cosmos Reason 2: O nouă eră în raționamentul artificial pentru roboți și sisteme autonome

NVIDIA lansează Cosmos Reason 2, un model vizual-lingvistic revoluționar care oferă roboților și agenților AI capacitatea de a raționa și planifica în lumea fizică. Cu îmbunătățiri majore în înțelegerea spațio-temporală și suport pentru 256K tokeni, modelul lider pe Physical AI Bench transformă analiza video, adnotarea datelor și planificarea robotică.

🕒 5 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.