Filtrează articolele

Subiect: #Speech-to-Speech

Cursa împotriva timpului: De ce latenta de inferență ucide agenții vocali mult înainte de lipsa de inteligență

Un benchmark rigoros din 30 august 2026 dezvăluie că majoritatea echipelor optimizează greșit latenta agenților vocali, concentrându-se pe Time to First Token (TTFT) în detrimentul latentei end-to-end reale. Articolul analizează ierarhia API-urilor (integrate vs. DIY), impactul co-locării STT-LLM-TTS și de ce viteza este singurul feature care contează în voce.

🕒 2 săptămâni în urmă
AI NVIDIA lansează NemotronLabs VoiceChat 11B: un model open-source de vorbire complet duplex cu latență de ~450 ms și apeluri live de instrumente

NVIDIA lansează NemotronLabs VoiceChat 11B: un model open-source de vorbire complet duplex cu latență de ~450 ms și apeluri live de instrumente

NVIDIA a lansat NemotronLabs VoiceChat 11B, un model open-source speech-to-speech complet duplex, cu latență de ~450 ms și apeluri live de instrumente. Acesta promite conversații naturale și acțiuni în timp real prin voce, deschizând noi posibilități în AI-ul vocal.

🕒 1 luni în urmă
AI Google lansează Gemini 3.5 Live Translate: un model audio streaming speech-to-speech care acoperă peste 70 de limbi în Meet, Translate și Live API

Google lansează Gemini 3.5 Live Translate: un model audio streaming speech-to-speech care acoperă peste 70 de limbi în Meet, Translate și Live API

Google lansează Gemini 3.5 Live Translate, un model audio streaming speech-to-speech care traduce în timp real peste 70 de limbi, integrat în Google Meet, Translate și Live API. Tehnologia promite să revoluționeze comunicarea globală, eliminând barierele lingvistice.

🕒 3 luni în urmă
AI Sakana AI lansează KAME: O arhitectură tandem vorbire-vorbire care injectează cunoștințe LLM în timp real

Sakana AI lansează KAME: O arhitectură tandem vorbire-vorbire care injectează cunoștințe LLM în timp real

Sakana AI a dezvăluit KAME, o arhitectură tandem vorbire-vorbire care integrează cunoștințe LLM în timp real, eliminând etapa de text și oferind răspunsuri vocale mai naturale și mai rapide.

🕒 4 luni în urmă
AI Tutorial Practic de Programare pentru Microsoft VibeVoice: ASR cu Detectare a Vorbitorului, TTS în Timp Real și Pipeline-uri Speech-to-Speech

Tutorial Practic de Programare pentru Microsoft VibeVoice: ASR cu Detectare a Vorbitorului, TTS în Timp Real și Pipeline-uri Speech-to-Speech

Un ghid complet și practic pentru dezvoltatori care doresc să implementeze Microsoft VibeVoice, acoperind recunoașterea vocală cu identificarea vorbitorului, sinteza vocală în timp real și construirea pipeline-urilor speech-to-speech complete.

🕒 5 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.