Voice Design - Den första generativa AI:n för ljud
- Publicerad
LyssnaLyssna på den här artikeln
Förra månaden meddelade vi att vår generativa modell för röstskapande var på väg. Nu är den äntligen här, och den är den första i sitt slag – vi kallar den Voice Design. Med funktionen kan du skapa nya röster från grunden genom att välja deras grundläggande egenskaper, som kön, ålder och accent. Även med samma grundinställningar lägger vår modell till slumpmässighet varje gång du klickar på generera, så att varje röst du hör blir helt unik. Voice Design är en del av vårt bredare arbete med att ge publicister och kreatörer de mest flexibla AI-verktygen för berättande.
Voice Design
Modellen bakom Voice Design är till stor del resultatet av vår forskning inom talsyntes och Voice Cloning, men vi har länge gillat idén om ett generativt verktyg för tal. Vi har redan sett praktiska användningar för generativa text-till-bild- och chatbotmodeller, men ett liknande verktyg för ljud saknades. Sedan lanseringen har vi fått önskemål om att lägga till fler röster i vårt bibliotek. I stället för att överfylla biblioteket med otaliga röster och låta dig lyssna på varje förhandsvisning för att veta vem som är vem, bestämde vi oss för att vända på det och låta dig avgöra talarens identitet, samtidigt som du får oändlig variation inom dessa ramar.
Det var viktigt att ge dig viss kontroll över röstvalet, eftersom våra användare ofta söker specifika talegenskaper för sina manus. Att säkerställa att varje genererad röst är unik var lika viktigt, eftersom många användningsområden kräver, eller åtminstone gynnas av, exklusiv tillgång till en röst. Utöver att ge användare ett nytt kreativt utlopp är röster som genereras med Voice Design helt artificiella och tillhör inte någon verklig person.
Användningsområden
Utöver att enkelt omvandla text till högkvalitativt ljud med vårt etablerade verktyg Speech Synthesis kan bokförfattare nu använda Voice Design för att få konstnärlig kontroll över berättarrösten och forma varje karaktärs personlighet med skräddarsydda röster.
Nyhetsutgivare som satsar på ljud behöver röster till sina berättelser. Eftersom berättarröster förknippas med de publikationer de representerar blir valet av rätt voice-over en viktig uppgift som sällan upprepas. Med Voice Design kan utgivare välja och jämföra nästintill otaliga berättarröster direkt. Det ger dem också tryggheten i att en viss röst representerar just dem – och ingen annan.
Spelutvecklare behöver inte längre avgöra om en viss karaktär motiverar kostnaden för inspelning. Tiotusentals NPC:er som tidigare saknade röster kan nu få unika personligheter och flytta gränserna för virtuell inlevelse.
Oavsett om du är en innehållsskapare som arbetar med din nästa lansering eller en företagsledare som vill ge företagets kommunikation en röst, är möjligheterna att skapa verklighetstroget och fängslande ljud för specifika användningsområden och målgrupper nu obegränsade.
Ekosystem
Voice Design är en av flera funktioner för redigering av berättarröst som vi planerar att lansera i år. Näst på tur är Studio – vår nya arbetsyta för att strukturera stora texter, lägga in pauser, generera om ljudavsnitt och tilldela delar av texten till olika talare. Studio kommer i slutet av mars och får senare under årets andra kvartal stöd för redigering av intonation.



.jpg&w=3840&q=80)
