Filtrează articolele

Subiect: #Mixture of Experts

AI AMD lansează Instella-MoE-16B-A3B: un model lingvistic open-source cu arhitectură Mixture-of-Experts, antrenat pe GPU-uri Instinct

AMD lansează Instella-MoE-16B-A3B: un model lingvistic open-source cu arhitectură Mixture-of-Experts, antrenat pe GPU-uri Instinct

AMD a lansat Instella-MoE-16B-A3B, un model lingvistic open-source cu arhitectură Mixture-of-Experts, având 16 miliarde de parametri totali, dar doar 2,8 miliarde activi. Antrenat pe GPU-uri AMD Instinct, modelul oferă o alternativă eficientă și accesibilă la soluțiile bazate pe NVIDIA, deschizând calea către o AI mai democratizată.

🕒 3 zile în urmă

Robbyant lansează LingBot-VLA 2.0: un model open-source de tip Vision-Language-Action (VLA) cu 6 miliarde de parametri pentru manipularea robotică multi-embodiment

Robbyant, divizia de cercetare a Ant Group, a lansat LingBot-VLA 2.0, un model open-source de tip Vision-Language-Action cu 6 miliarde de parametri, capabil să controleze multiple configurații robotice. Antrenat pe 60.000 de ore de date, modelul folosește un spațiu de acțiune canonic de 55 de dimensiuni și tehnici avansate de distilare, depășind modelele anterioare pe benchmark-ul GM-100.

🕒 3 săptămâni în urmă
AI Google lansează DiffusionGemma: un model open-source de 26 de miliarde de parametri care generează text de 4 ori mai rapid

Google lansează DiffusionGemma: un model open-source de 26 de miliarde de parametri care generează text de 4 ori mai rapid

Google a lansat DiffusionGemma, un model open-source de 26 de miliarde de parametri care folosește difuzia textuală pentru a genera text de până la 4 ori mai rapid decât modelele tradiționale. Acest model inovator promite să revoluționeze generarea de text, oferind viteză și eficiență sporite, fiind disponibil gratuit pentru comunitatea AI.

🕒 1 luni în urmă
AI NVIDIA lansează Nemotron 3 Ultra: un model deschis de 550 de miliarde de parametri, hibrid Mamba-Transformer, pentru agenți cu execuție îndelungată

NVIDIA lansează Nemotron 3 Ultra: un model deschis de 550 de miliarde de parametri, hibrid Mamba-Transformer, pentru agenți cu execuție îndelungată

NVIDIA a lansat Nemotron 3 Ultra, un model open-source de 550 de miliarde de parametri, care combină arhitecturile Mamba și Transformer într-un sistem Mixture-of-Experts, optimizat pentru agenți AI cu execuție îndelungată. Este un pas major spre democratizarea AI-ului de ultimă generație.

🕒 2 luni în urmă
AI DeepSeek prezintă un nou model de AI care „îmbrățișează spațiul” cu modelele de frontieră

DeepSeek prezintă un nou model de AI care „îmbrățișează spațiul” cu modelele de frontieră

DeepSeek lansează modelele V4 Flash și V4 Pro, cu până la 1,6 biliardi de parametri,preturi subțepătoare și performanțe aproape la nivelul modelelor de frontiera, marcând un pas semnificativ în cursa globală de AI.

🕒 3 luni în urmă
AI Alegeri Arhitecturale în Ecosistemul AI Open-Source din China: Construcția Dincolo de DeepSeek

Alegeri Arhitecturale în Ecosistemul AI Open-Source din China: Construcția Dincolo de DeepSeek

Analiza detaliată a schimbărilor arhitecturale din ecosistemul AI open-source din China post-DeepSeek, evidențiind adoptarea arhitecturii Mixture of Experts (MoE), diversificarea modalităților, preferința pentru modelele mici și trecerea strategică la hardware domestic.

🕒 4 luni în urmă
AI Mixture of Experts (MoE) în Transformers: O Revoluție în Arhitectura Modelelor de Limbaj

Mixture of Experts (MoE) în Transformers: O Revoluție în Arhitectura Modelelor de Limbaj

Modelele Mixture of Experts (MoE) revoluționează AI-ul prin decuplarea capacității de învățare de costul computațional. Acest articol explorează integrarea lor în Transformers, de la refactorizarea încărcării greutăților și materializarea leneșă a tensorilor, până la backend-uri optimizate și paralelismul experților.

🕒 4 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.