Google lansează Gemini 3.5 Transcribe: model de recunoaștere vocală cu 2,6% WER mediu în peste 85 de limbi
Google a lansat Gemini 3.5 Transcribe, un model de recunoaștere vocală cu două endpoint-uri: unul pentru streaming cu latență sub secundă și unul pentru procesare în lot, cu diarizare și timestamp-uri, la jumătate de cost. Cu 2,6% WER mediu în peste 85 de limbi și o viteză cu 70% mai mare decât Chirp 3, modelul oferă dezvoltatorilor flexibilitate și performanță fără precedent.
🕒 3 săptămâni în urmă