Cursor a deschis codul sursă pentru Mixture-of-Kittens (MoK), un megakernel deterministic pentru antrenamentul modelelor MoE pe rack-urile GB300 NVL72. Soluția promite reproductibilitate și performanță superioară, fiind un pas important pentru cercetarea AI open-source.
Alibaba a lansat Qwen3.8-Max, un model de limbaj MoE cu 2,4 trilioane de parametri, cel mai puternic din familia Qwen. Articolul analizează arhitectura, performanța, impactul și provocările acestui model, subliniind importanța sa în competiția globală pentru inteligența artificială.
Tencent a deschis codul sursă al AngelSpec, un cadru unificat de antrenare pentru decodarea speculativă pe modele Hy3. Include DFly, un draftor bazat pe difuzie bloc, și D-cut, un modul de bugetare adaptivă, oferind o accelerare de până la 2,40× față de decodarea autoregresivă standard.
Comparație detaliată între trei modele MoE de scară trilionară: Kimi K3, DeepSeek V4 Pro și GLM-5.2. Analizăm benchmark-uri, licențe și costuri de servire pentru a te ajuta să alegi cel mai potrivit model pentru proiectele tale.
Thinking Machines Lab a lansat Inkling, un model AI deschis cu 975 de miliarde de parametri, 41 de miliarde activi și efort de gândire controlabil. Disponibil sub licență Apache 2.0, Inkling se poziționează ca o bază de personalizare, nu ca cel mai puternic model, oferind transparență și flexibilitate comunității.
Consorțiul Soofi a lansat Soofi S 30B-A3B, un model fundamental open-source hibrid Mamba-Transformer MoE, specializat pentru limbile germană și engleză. Cu 30 de miliarde de parametri totali și doar 3 miliarde activi per inferență, oferă performanță ridicată la costuri reduse, fiind ideal pentru cercetători și companii.
Nemotron Labs a lansat modelul lingvistic Nemotron Labs 3 Puzzle 75B A9B, un LLM hibrid MoE comprimat care oferă o creștere de 2,03 ori a debitului pe server, permițând rularea pe un singur GPU și reducând costurile de infrastructură.
NVIDIA a lansat Nemotron-Labs-3-Puzzle-75B-A9B, un model lingvistic hibrid MoE comprimat, care oferă o performanță de server de 2,03 ori mai mare decât predecesorul său, la același debit per utilizator. Modelul folosește o tehnică inovatoare de compresie structurală iterativă, reducând parametrii de la 120,7B la 75,3B, și permite o concurență de 8 ori mai mare pe un singur GPU H100.
Tencent a lansat Hy3, un model open-source de tip Mixture-of-Experts cu 295 de miliarde de parametri, dintre care doar 21 de miliarde sunt activi, și o fereastră de context de 256.000 de tokeni. Modelul promite eficiență și accesibilitate pentru cercetători și dezvoltatori din întreaga lume.
Meituan a lansat LongCat-2.0, un model MoE open-source cu 1,6 trilioane de parametri și context nativ de 1 milion de tokeni, folosind atenția rară LongCat. Este un pas major spre democratizarea AI-ului de ultimă generație.
Prime Intellect a lansat prime-rl 0.6.0, un cadru open-source pentru învățare prin întărire asincronă pe modele MoE de trilioane de parametri. Cu optimizări precum inferența FP8, paralelism expert larg și disociere prefill/decode, a antrenat GLM-5 pe sarcini SWE cu performanțe remarcabile pe doar 28 de noduri H200.
MiniMax Sparse Attention (MSA) este o arhitectură inovatoare de atenție dispersată cu două ramuri, antrenată pe un model MoE de 109 miliarde de parametri cu un buget de 3 trilioane de token-uri. MSA combină atenția locală și globală pentru a reduce costul computațional, permițând modelelor să gestioneze contexte mai lungi eficient. Această tehnologie ar putea democratiza accesul la AI și permite aplicații noi.
Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.