Filtrează articolele

Subiect: #Inferență AI

AI Kog: Cum să obții inferență AI de 30 de ori mai rapidă pe GPU-urile pe care le ai deja

Kog: Cum să obții inferență AI de 30 de ori mai rapidă pe GPU-urile pe care le ai deja

Startup-ul francez Kog promite o inferență AI de 30 de ori mai rapidă pe GPU-urile standard, printr-o optimizare software profundă. Cu o demonstrație de 3.000 de tokeni pe secundă și un fondator cu background în fizică și hacking, Kog atrage deja interesul pieței, vizând în special ingineria software.

🕒 1 zile în urmă
AI Startupul de cipuri AI Etched sfidează scepticii și atinge o evaluare de 10,3 miliarde de dolari de la investitori de renume

Startupul de cipuri AI Etched sfidează scepticii și atinge o evaluare de 10,3 miliarde de dolari de la investitori de renume

Startupul Etched, fondat de trei foști studenți Harvard, a strâns 300 de milioane de dolari la o evaluare de 10,3 miliarde, sfidând scepticii cu cipuri AI specializate pentru inferență rapidă și eficientă.

🕒 3 săptămâni în urmă
AI De ce primii finanțatori de GPU-uri se orientează acum către cipuri de inferență, într-o tranzacție de 400 de milioane de dolari

De ce primii finanțatori de GPU-uri se orientează acum către cipuri de inferență, într-o tranzacție de 400 de milioane de dolari

General Compute, un startup de cloud AI, a obținut un împrumut de 400 de milioane de dolari de la Upper90, folosind cipuri de inferență ca garanție. Este prima tranzacție de acest gen și semnalează o schimbare majoră de la GPU-urile scumpe la soluții mai eficiente pentru rularea modelelor AI open-source.

🕒 4 săptămâni în urmă

NVIDIA lansează Nemotron-Labs-3-Puzzle-75B-A9B: un model lingvistic hibrid MoE comprimat care oferă o performanță de server de 2,03 ori mai mare la același debit per utilizator

NVIDIA a lansat Nemotron-Labs-3-Puzzle-75B-A9B, un model lingvistic hibrid MoE comprimat, care oferă o performanță de server de 2,03 ori mai mare decât predecesorul său, la același debit per utilizator. Modelul folosește o tehnică inovatoare de compresie structurală iterativă, reducând parametrii de la 120,7B la 75,3B, și permite o concurență de 8 ori mai mare pe un singur GPU H100.

🕒 1 luni în urmă
AI SambaNova, producătorul de cipuri AI, atrage 1 miliard de dolari la o evaluare de 11 miliarde, la doar 5 luni după ultima rundă uriașă

SambaNova, producătorul de cipuri AI, atrage 1 miliard de dolari la o evaluare de 11 miliarde, la doar 5 luni după ultima rundă uriașă

SambaNova Systems a strâns 1 miliard de dolari la o evaluare de 11 miliarde, la doar cinci luni după ultima rundă majoră. Compania, specializată în cipuri AI pentru inferență, a atras atenția JPMorgan ca partener de infrastructură și colaborează strâns cu Intel. Runda subliniază creșterea explozivă a pieței de inferență AI și tendința marilor bănci de a-și construi propriile centre de date sigure.

🕒 1 luni în urmă
AI Concurentul Nvidia, Etched, atinge o evaluare de 5 miliarde de dolari și vânzări de 1 miliard pentru cipul AI

Concurentul Nvidia, Etched, atinge o evaluare de 5 miliarde de dolari și vânzări de 1 miliard pentru cipul AI

Startup-ul Etched, rival al Nvidia, a atins o evaluare de 5 miliarde de dolari și a înregistrat comenzi de 1 miliard de dolari pentru cipurile sale AI specializate în inferență. Fondat de foști studenți Harvard, compania a strâns 800 de milioane de dolari de la investitori de top și promite să revoluționeze eficiența și costurile în domeniul inteligenței artificiale.

🕒 1 luni în urmă
AI NVIDIA lansează Dynamo Snapshot: un sistem de pornire rapidă pentru inferență AI pe Kubernetes bazat pe CRIU

NVIDIA lansează Dynamo Snapshot: un sistem de pornire rapidă pentru inferență AI pe Kubernetes bazat pe CRIU

NVIDIA a lansat Dynamo Snapshot, un sistem bazat pe CRIU care permite pornirea aproape instantanee a containerelor de inferență AI pe Kubernetes, reducând timpii de inițializare de la zeci de secunde la sub o secundă. Articolul explică tehnologia din spate, integrarea cu Kubernetes și impactul asupra costurilor și performanței.

🕒 2 luni în urmă
AI Startup-ul care a strâns 135 de milioane de dolari pe o idee simplă: principala problemă a AI nu este puterea de calcul, ci memoria

Startup-ul care a strâns 135 de milioane de dolari pe o idee simplă: principala problemă a AI nu este puterea de calcul, ci memoria

Startup-ul XCENA a strâns 135 de milioane de dolari pentru un cip care mută procesarea datelor mai aproape de memorie, eliminând drumurile costisitoare dintre CPU, GPU și DRAM. Fondat de veterani ai Samsung și SK Hynix, MX1 promite să reducă de zece ori numărul de servere necesare pentru inferența AI.

🕒 2 luni în urmă
AI Cum să Construiești un Pipeline de Generare AI cu Gemma 3 1B Instruct Pregătit pentru Producție,folosind Hugging Face Transformers, Șabloane de Chat și Inferență pe Colab

Cum să Construiești un Pipeline de Generare AI cu Gemma 3 1B Instruct Pregătit pentru Producție,folosind Hugging Face Transformers, Șabloane de Chat și Inferență pe Colab

Ghid comprehensiv pentru construirea unui pipeline de generare AI production-ready cu modelul Gemma 3 1B Instruct, folosind Hugging Face Transformers, șabloane de chat și inferență pe Google Colab.

🕒 4 luni în urmă
AI Accelerarea implementării modelelor lingvistice mari (LLM) de pe Hugging Face prin NVIDIA NIM: O revoluție în infrastructura AI enterprise

Accelerarea implementării modelelor lingvistice mari (LLM) de pe Hugging Face prin NVIDIA NIM: O revoluție în infrastructura AI enterprise

NVIDIA anunță integrarea microserviciilor NIM cu platforma Hugging Face, deblocând accesul rapid la peste 100.000 de modele LLM. Soluția oferă un singur container Docker capabil să optimizeze automat implementarea, detectând arhitectura și selectând backend-ul ideal pentru performanță maximă.

🕒 4 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.