Startup-ul francez Kog promite o inferență AI de 30 de ori mai rapidă pe GPU-urile standard, printr-o optimizare software profundă. Cu o demonstrație de 3.000 de tokeni pe secundă și un fondator cu background în fizică și hacking, Kog atrage deja interesul pieței, vizând în special ingineria software.
Startupul Etched, fondat de trei foști studenți Harvard, a strâns 300 de milioane de dolari la o evaluare de 10,3 miliarde, sfidând scepticii cu cipuri AI specializate pentru inferență rapidă și eficientă.
General Compute, un startup de cloud AI, a obținut un împrumut de 400 de milioane de dolari de la Upper90, folosind cipuri de inferență ca garanție. Este prima tranzacție de acest gen și semnalează o schimbare majoră de la GPU-urile scumpe la soluții mai eficiente pentru rularea modelelor AI open-source.
NVIDIA a lansat Nemotron-Labs-3-Puzzle-75B-A9B, un model lingvistic hibrid MoE comprimat, care oferă o performanță de server de 2,03 ori mai mare decât predecesorul său, la același debit per utilizator. Modelul folosește o tehnică inovatoare de compresie structurală iterativă, reducând parametrii de la 120,7B la 75,3B, și permite o concurență de 8 ori mai mare pe un singur GPU H100.
SambaNova Systems a strâns 1 miliard de dolari la o evaluare de 11 miliarde, la doar cinci luni după ultima rundă majoră. Compania, specializată în cipuri AI pentru inferență, a atras atenția JPMorgan ca partener de infrastructură și colaborează strâns cu Intel. Runda subliniază creșterea explozivă a pieței de inferență AI și tendința marilor bănci de a-și construi propriile centre de date sigure.
Startup-ul Etched, rival al Nvidia, a atins o evaluare de 5 miliarde de dolari și a înregistrat comenzi de 1 miliard de dolari pentru cipurile sale AI specializate în inferență. Fondat de foști studenți Harvard, compania a strâns 800 de milioane de dolari de la investitori de top și promite să revoluționeze eficiența și costurile în domeniul inteligenței artificiale.
NVIDIA a lansat Dynamo Snapshot, un sistem bazat pe CRIU care permite pornirea aproape instantanee a containerelor de inferență AI pe Kubernetes, reducând timpii de inițializare de la zeci de secunde la sub o secundă. Articolul explică tehnologia din spate, integrarea cu Kubernetes și impactul asupra costurilor și performanței.
Startup-ul XCENA a strâns 135 de milioane de dolari pentru un cip care mută procesarea datelor mai aproape de memorie, eliminând drumurile costisitoare dintre CPU, GPU și DRAM. Fondat de veterani ai Samsung și SK Hynix, MX1 promite să reducă de zece ori numărul de servere necesare pentru inferența AI.
Ghid comprehensiv pentru construirea unui pipeline de generare AI production-ready cu modelul Gemma 3 1B Instruct, folosind Hugging Face Transformers, șabloane de chat și inferență pe Google Colab.
NVIDIA anunță integrarea microserviciilor NIM cu platforma Hugging Face, deblocând accesul rapid la peste 100.000 de modele LLM. Soluția oferă un singur container Docker capabil să optimizeze automat implementarea, detectând arhitectura și selectând backend-ul ideal pentru performanță maximă.
Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.