Cohere a lansat North Small Translate, un model de traducere cu 218B parametri și arhitectură MoE, care obține 83,6 pe WMT26 și suportă 50 de limbi. Acest model promite să revoluționeze traducerea automată prin acuratețe, viteză și accesibilitate.
FreeToken este un motor de servire open-source care rulează modelul GLM-5.2 de 753 de miliarde de parametri pe un singur GPU de workstation, folosind tehnici avansate de offloading și cuantizare. Acest lucru democratizează accesul la AI de ultimă generație și face posibilă rularea locală a modelelor complexe.
NVIDIA a lansat Nemotron 3.5 Lightning, un model open source cu arhitectură MoE de 30B parametri, dar doar 3B activi, alături de routerul NeMo Switchyard. Această combinație promite eficiență și accesibilitate, democratizând accesul la AI de ultimă generație.
Cursor a deschis codul sursă pentru Mixture-of-Kittens (MoK), un megakernel deterministic pentru antrenamentul modelelor MoE pe rack-urile GB300 NVL72. Soluția promite reproductibilitate și performanță superioară, fiind un pas important pentru cercetarea AI open-source.
Alibaba a lansat Qwen3.8-Max, un model de limbaj MoE cu 2,4 trilioane de parametri, cel mai puternic din familia Qwen. Articolul analizează arhitectura, performanța, impactul și provocările acestui model, subliniind importanța sa în competiția globală pentru inteligența artificială.
Tencent a deschis codul sursă al AngelSpec, un cadru unificat de antrenare pentru decodarea speculativă pe modele Hy3. Include DFly, un draftor bazat pe difuzie bloc, și D-cut, un modul de bugetare adaptivă, oferind o accelerare de până la 2,40× față de decodarea autoregresivă standard.
Comparație detaliată între trei modele MoE de scară trilionară: Kimi K3, DeepSeek V4 Pro și GLM-5.2. Analizăm benchmark-uri, licențe și costuri de servire pentru a te ajuta să alegi cel mai potrivit model pentru proiectele tale.
Thinking Machines Lab a lansat Inkling, un model AI deschis cu 975 de miliarde de parametri, 41 de miliarde activi și efort de gândire controlabil. Disponibil sub licență Apache 2.0, Inkling se poziționează ca o bază de personalizare, nu ca cel mai puternic model, oferind transparență și flexibilitate comunității.
Consorțiul Soofi a lansat Soofi S 30B-A3B, un model fundamental open-source hibrid Mamba-Transformer MoE, specializat pentru limbile germană și engleză. Cu 30 de miliarde de parametri totali și doar 3 miliarde activi per inferență, oferă performanță ridicată la costuri reduse, fiind ideal pentru cercetători și companii.
Nemotron Labs a lansat modelul lingvistic Nemotron Labs 3 Puzzle 75B A9B, un LLM hibrid MoE comprimat care oferă o creștere de 2,03 ori a debitului pe server, permițând rularea pe un singur GPU și reducând costurile de infrastructură.
NVIDIA a lansat Nemotron-Labs-3-Puzzle-75B-A9B, un model lingvistic hibrid MoE comprimat, care oferă o performanță de server de 2,03 ori mai mare decât predecesorul său, la același debit per utilizator. Modelul folosește o tehnică inovatoare de compresie structurală iterativă, reducând parametrii de la 120,7B la 75,3B, și permite o concurență de 8 ori mai mare pe un singur GPU H100.
Tencent a lansat Hy3, un model open-source de tip Mixture-of-Experts cu 295 de miliarde de parametri, dintre care doar 21 de miliarde sunt activi, și o fereastră de context de 256.000 de tokeni. Modelul promite eficiență și accesibilitate pentru cercetători și dezvoltatori din întreaga lume.
Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.