Filtrează articolele

Subiect: #MoE

AI Cursor lansează open-source Mixture-of-Kittens (MoK): un megakernel deterministic pentru antrenamentul MoE pe rack-urile GB300 NVL72

Cursor lansează open-source Mixture-of-Kittens (MoK): un megakernel deterministic pentru antrenamentul MoE pe rack-urile GB300 NVL72

Cursor a deschis codul sursă pentru Mixture-of-Kittens (MoK), un megakernel deterministic pentru antrenamentul modelelor MoE pe rack-urile GB300 NVL72. Soluția promite reproductibilitate și performanță superioară, fiind un pas important pentru cercetarea AI open-source.

🕒 4 zile în urmă
AI Alibaba Qwen lansează Qwen3.8-Max: un model MoE cu 2,4 trilioane de parametri, cel mai puternic din familia Qwen până în prezent

Alibaba Qwen lansează Qwen3.8-Max: un model MoE cu 2,4 trilioane de parametri, cel mai puternic din familia Qwen până în prezent

Alibaba a lansat Qwen3.8-Max, un model de limbaj MoE cu 2,4 trilioane de parametri, cel mai puternic din familia Qwen. Articolul analizează arhitectura, performanța, impactul și provocările acestui model, subliniind importanța sa în competiția globală pentru inteligența artificială.

🕒 5 zile în urmă

Tencent lansează open-source AngelSpec: un cadru unificat de antrenament pentru decodarea speculativă MTP și bloc-paralelă pe modele Hy3

Tencent a deschis codul sursă al AngelSpec, un cadru unificat de antrenare pentru decodarea speculativă pe modele Hy3. Include DFly, un draftor bazat pe difuzie bloc, și D-cut, un modul de bugetare adaptivă, oferind o accelerare de până la 2,40× față de decodarea autoregresivă standard.

🕒 1 săptămâni în urmă
AI Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2: Comparație între modelele MoE de scară trilionară – benchmark-uri, licențe și costuri de servire

Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2: Comparație între modelele MoE de scară trilionară – benchmark-uri, licențe și costuri de servire

Comparație detaliată între trei modele MoE de scară trilionară: Kimi K3, DeepSeek V4 Pro și GLM-5.2. Analizăm benchmark-uri, licențe și costuri de servire pentru a te ajuta să alegi cel mai potrivit model pentru proiectele tale.

🕒 3 săptămâni în urmă

Thinking Machines Lab lansează Inkling: un model multimodal MoE cu 975 de miliarde de parametri, 41 de miliarde activi și efort de gândire controlabil

Thinking Machines Lab a lansat Inkling, un model AI deschis cu 975 de miliarde de parametri, 41 de miliarde activi și efort de gândire controlabil. Disponibil sub licență Apache 2.0, Inkling se poziționează ca o bază de personalizare, nu ca cel mai puternic model, oferind transparență și flexibilitate comunității.

🕒 3 săptămâni în urmă
AI Consorțiul Soofi lansează Soofi S 30B-A3B: un model fundamental hibrid Mamba-Transformer MoE, open-source, pentru germană și engleză

Consorțiul Soofi lansează Soofi S 30B-A3B: un model fundamental hibrid Mamba-Transformer MoE, open-source, pentru germană și engleză

Consorțiul Soofi a lansat Soofi S 30B-A3B, un model fundamental open-source hibrid Mamba-Transformer MoE, specializat pentru limbile germană și engleză. Cu 30 de miliarde de parametri totali și doar 3 miliarde activi per inferență, oferă performanță ridicată la costuri reduse, fiind ideal pentru cercetători și companii.

🕒 3 săptămâni în urmă
AI Nemotron Labs 3 Puzzle 75B A9B: Un model lingvistic hibrid MoE comprimat care oferă o performanță de 2,03 ori mai mare pe server

Nemotron Labs 3 Puzzle 75B A9B: Un model lingvistic hibrid MoE comprimat care oferă o performanță de 2,03 ori mai mare pe server

Nemotron Labs a lansat modelul lingvistic Nemotron Labs 3 Puzzle 75B A9B, un LLM hibrid MoE comprimat care oferă o creștere de 2,03 ori a debitului pe server, permițând rularea pe un singur GPU și reducând costurile de infrastructură.

🕒 1 luni în urmă

NVIDIA lansează Nemotron-Labs-3-Puzzle-75B-A9B: un model lingvistic hibrid MoE comprimat care oferă o performanță de server de 2,03 ori mai mare la același debit per utilizator

NVIDIA a lansat Nemotron-Labs-3-Puzzle-75B-A9B, un model lingvistic hibrid MoE comprimat, care oferă o performanță de server de 2,03 ori mai mare decât predecesorul său, la același debit per utilizator. Modelul folosește o tehnică inovatoare de compresie structurală iterativă, reducând parametrii de la 120,7B la 75,3B, și permite o concurență de 8 ori mai mare pe un singur GPU H100.

🕒 1 luni în urmă
AI Tencent lansează Hy3: un model MoE deschis cu 295 de miliarde de parametri, 21 de miliarde activi și context de 256K

Tencent lansează Hy3: un model MoE deschis cu 295 de miliarde de parametri, 21 de miliarde activi și context de 256K

Tencent a lansat Hy3, un model open-source de tip Mixture-of-Experts cu 295 de miliarde de parametri, dintre care doar 21 de miliarde sunt activi, și o fereastră de context de 256.000 de tokeni. Modelul promite eficiență și accesibilitate pentru cercetători și dezvoltatori din întreaga lume.

🕒 1 luni în urmă
AI Meituan lansează LongCat-2.0: Un model MoE deschis cu 1,6 trilioane de parametri și context nativ de 1 milion de tokeni

Meituan lansează LongCat-2.0: Un model MoE deschis cu 1,6 trilioane de parametri și context nativ de 1 milion de tokeni

Meituan a lansat LongCat-2.0, un model MoE open-source cu 1,6 trilioane de parametri și context nativ de 1 milion de tokeni, folosind atenția rară LongCat. Este un pas major spre democratizarea AI-ului de ultimă generație.

🕒 1 luni în urmă

Prime Intellect lansează prime-rl 0.6.0: un cadru deschis pentru antrenarea modelelor MoE de trilioane de parametri prin învățare prin întărire agentică

Prime Intellect a lansat prime-rl 0.6.0, un cadru open-source pentru învățare prin întărire asincronă pe modele MoE de trilioane de parametri. Cu optimizări precum inferența FP8, paralelism expert larg și disociere prefill/decode, a antrenat GLM-5 pe sarcini SWE cu performanțe remarcabile pe doar 28 de noduri H200.

🕒 1 luni în urmă
AI MiniMax Sparse Attention (MSA): O Revoluție în Atenția Dispersată cu Două Ramuri, Antrenată pe un Model MoE de 109 Miliarde de Parametri cu un Buget de 3 Tiloane de Token-uri

MiniMax Sparse Attention (MSA): O Revoluție în Atenția Dispersată cu Două Ramuri, Antrenată pe un Model MoE de 109 Miliarde de Parametri cu un Buget de 3 Tiloane de Token-uri

MiniMax Sparse Attention (MSA) este o arhitectură inovatoare de atenție dispersată cu două ramuri, antrenată pe un model MoE de 109 miliarde de parametri cu un buget de 3 trilioane de token-uri. MSA combină atenția locală și globală pentru a reduce costul computațional, permițând modelelor să gestioneze contexte mai lungi eficient. Această tehnologie ar putea democratiza accesul la AI și permite aplicații noi.

🕒 1 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.