Voice Design - Pierwsze Generatywne AI dla Audio
- Opublikowano
PosłuchajPosłuchaj tego artykułu
W zeszłym miesiącu ogłosiliśmy nadchodzącą premierę naszego generatywnego modelu do tworzenia głosów. Wreszcie jest — pierwszy taki model, który nazywamy Voice Design. Ta funkcja pozwala tworzyć nowe głosy od podstaw — wybierasz ich kluczowe cechy, takie jak płeć, wiek i akcent. Nawet przy tych samych ustawieniach model za każdym kliknięciem „Generuj” dodaje losowy element, dzięki czemu każdy głos jest całkowicie wyjątkowy. Voice Design to część naszych szerszych działań, by dać wydawcom i twórcom jak najbardziej wszechstronne narzędzia AI do opowiadania historii.
Voice Design
Model stojący za Voice Design powstał głównie w wyniku naszych badań nad syntezą mowy i Voice Cloning, ale od dawna podobał nam się też pomysł generatywnego narzędzia do mowy. Widzieliśmy już praktyczne zastosowania generatywnych modeli tekst-obraz i chatbotów, ale brakowało podobnego narzędzia do audio. Od premiery stale dostawaliśmy prośby o dodanie większej liczby głosów do naszej biblioteki. Zamiast zapełniać ją niezliczonymi głosami i kazać ci odsłuchiwać każde demo, by wiedzieć, kto jest kim, odwróciliśmy podejście: to ty określasz tożsamość mówcy, zachowując przy tym nieskończoną różnorodność w tych ramach.
Pewien poziom kontroli nad wyborem głosu był ważny, bo użytkownicy często szukają konkretnych cech mowy do swoich tekstów. Równie istotne było zapewnienie wyjątkowości każdego wygenerowanego głosu, ponieważ wiele zastosowań wymaga — lub przynajmniej zyskuje — wyłącznego dostępu do głosu. Głosy tworzone przez Voice Design dają użytkownikom nową przestrzeń twórczą, są całkowicie sztuczne i nie należą do żadnej prawdziwej osoby.
Zastosowania
Oprócz łatwej zamiany tekstu na wysokiej jakości audio za pomocą naszego podstawowego narzędzia Speech Synthesis, autorzy książek mogą teraz używać Voice Design, by artystycznie kontrolować narrację i kształtować osobowość każdej postaci za pomocą dopasowanych głosów.
Wydawcy wiadomości wchodzący w świat audio potrzebują głosów do swoich historii. Ponieważ narratorzy zaczynają być kojarzeni z publikacjami, które reprezentują, wybór właściwego nałożonego głosu staje się ważnym zadaniem, którego zwykle się nie powtarza. Voice Design pozwala od razu wybierać i porównywać praktycznie niezliczoną liczbę narratorów. Daje też pewność, że dany głos będzie reprezentować tylko ich.
Twórcy gier nie muszą już decydować, czy dana postać uzasadnia koszty nagrania. Dziesiątki tysięcy wcześniej niemych NPC-ów może teraz zyskać wyjątkową osobowość, przesuwając granice wirtualnej immersji.
Niezależnie od tego, czy jesteś twórcą treści pracującym nad kolejną publikacją, czy pracownikiem firmy chcącym nadać głos firmowej komunikacji — możliwości tworzenia realistycznego, angażującego audio dla konkretnych zastosowań i odbiorców są teraz nieograniczone.
Ekosystem
Voice Design to jedna z kilku funkcji do edycji narracji, które planujemy wprowadzić w tym roku. Kolejna to Studio — nasze nowe środowisko do porządkowania długich tekstów, wstawiania pauz, ponownego generowania fragmentów audio i przypisywania części tekstu różnym mówcom. Studio pojawi się pod koniec marca, a później, w drugim kwartale tego roku, dodamy obsługę edycji intonacji.



.jpg&w=3840&q=80)
