Fish Audio a început ca un mic proiect al fostului cercetător NVIDIA, Shijia Liao, care, frustrat de vocile sintetice neexpresive disponibile pe piață, a antrenat un model de generare a vocii pe un singur GPU, pe care l-a lansat ca open-source. Depozitul Fish Speech de pe GitHub are acum peste 31.000 de stele și este folosit de dezvoltatori independenți, designeri de jocuri video și creatori. Compania a lansat cinci modele în ultimul an: patru modele de generare a vorbirii și un model de vorbire în text. Trei dintre modelele sale de generare a vorbirii au fost lansate ca open-source, dar cel mai recent model S2.1 Pro este disponibil doar prin API-ul său plătit.
Fish Audio oferă planuri lunare plătite potrivite pentru creatori și echipe, care deblochează un număr stabilit de minute de generare, plus funcții de clonare a vocii. Compania oferă, de asemenea, o versiune enterprise a API-urilor și platformei sale și spune că organizații precum HeyGen, Sanas și Plaud îl folosesc deja. „Fiecare întreprindere are cazuri de utilizare diferite și preferințe diferite. De exemplu, companii precum HeyGen, care folosesc vocile noastre pentru a alimenta avatare AI, doresc realism în voci; un studio de jocuri ar dori voci expresive pentru personajele sale; iar companiile de agenți vocali precum LiveKit doresc voci mai naturale, cu latență scăzută și suficient de expresive pentru apeluri”, a spus Cao.
Un mod prin care startup-ul și-a construit biblioteca de voci este prin a le cere pur și simplu utilizatorilor să își trimită propriile voci pentru antrenarea modelelor și să îi compenseze dacă vocile lor sunt folosite. Acest lucru a dus la unele probleme acum câteva luni, deoarece unii creatori au susținut că vocile lor au fost încărcate pe Fish Audio fără consimțământul lor. Startup-ul avea un proces de eliminare a conținutului conform DMCA pentru a aborda astfel de preocupări, dar eliminările în sine durau mult timp. CEO-ul și co-fondatoarea Fish Audio, Rissa Cao, a declarat pentru TechCrunch că compania a automatizat acum procesul de eliminare. Creatorii pot trimite cu ușurință o scurtă mostră vocală sau un contract pentru a dovedi că o voce încărcată le aparține, iar vocea lor va fi eliminată de pe platforma startup-ului în mai puțin de 3 minute, a spus ea. Totuși, acest lucru nu împiedică pe nimeni să încarce vocea unui artist fără știrea acestuia. Și până când artistul află, vocea sa va continua să fie folosită pe platformă până când acesta solicită eliminarea.
Oskue Honda, partener la Coreline Ventures, a spus că un model bazat pe comunitate funcționează doar atunci când creatorii au încredere în platformă. „O abordare centrată pe comunitate poate deveni un avantaj durabil doar dacă creatorii au încredere în platformă. Asta înseamnă că consimțământul, transparența și atribuirea trebuie să fie integrate în produs, nu tratate ca o idee ulterioară. Cred că industria trebuie să se îndrepte către verificarea proprietății vocii, termeni de licențiere clari, procese ușoare de raportare și eliminare și, în cele din urmă, modele de partajare a veniturilor în care creatorii beneficiază financiar atunci când vocile lor sunt licențiate sau utilizate comercial”, a spus el.
Cao a spus că atunci când startup-ul oferea doar produsul său ca proiect open-source cu planuri pentru creatori, funcționa eficient și nu avea nevoie de bani. Dar a vrut să dezvolte modele mai avansate și, de asemenea, a vrut să găzduiască întreprinderi, pe măsură ce interesul investitorilor creștea, ceea ce a determinat-o să caute capital. Privind în perspectivă, Fish Audio intenționează să folosească noile fonduri pentru a-și extinde echipa, a accelera cercetarea și dezvoltarea și a îmbunătăți infrastructura pentru a deservi atât creatorii individuali, cât și clienții enterprise. Cu o concurență tot mai mare în spațiul vocilor AI, de la ElevenLabs la Respeecher, Fish Audio mizează pe deschiderea sa open-source și pe biblioteca vastă de comenzi pentru a se diferenția. Rămâne de văzut dacă această strategie va fi suficientă pentru a menține ritmul de creștere și a câștiga încrederea comunității de creatori.
De ce este important:
Această rundă de finanțare seed de 50 de milioane de dolari pentru Fish Audio subliniază apetitul uriaș al pieței pentru soluții de voce AI personalizabile și scalabile. Într-o eră în care conținutul generat de AI devine din ce în ce mai prezent, capacitatea de a produce voci naturale, expresive și ușor de controlat este crucială atât pentru creatori, cât și pentru întreprinderi. Mai mult, controversa legată de consimțământul vocal și procesul de eliminare rapidă arată că industria trebuie să găsească un echilibru între inovație și etică. Fish Audio, prin abordarea sa open-source și accentul pe comunitate, ar putea stabili un standard pentru modul în care vocile AI sunt dezvoltate și utilizate responsabil.