Vi presenterar Eleven v3 (alpha)
- Publicerad
LyssnaLyssna på den här artikeln
Vi är glada att kunna presentera Eleven v3 (alpha) — den mest uttrycksfulla Text to Speech-modellen.
Den här forskningsförhandsvisningen ger oöverträffad kontroll och realism i talgenerering med:
- Över 70 språk
- Dialog med flera talare
- Ljudtaggar som [excited], [whispers] och [sighs]
Eleven v3 (alpha) kräver mer prompt engineering än tidigare modeller — men resultatet är häpnadsväckande.
Om du arbetar med videor, ljudböcker eller medieverktyg — öppnar detta för en ny nivå av uttrycksfullhet. För användning i realtid och samtal rekommenderar vi att du fortsätter använda v2.5 Turbo eller Flash tills vidare. En realtidsversion av v3 är under utveckling.
Eleven v3 finns tillgänglig redan idag på vår webbplats och i API:t.
Varför vi skapade v3
Sedan lanseringen av Multilingual v2 har vi sett AI-röster användas i professionell film, spelutveckling, utbildning och tillgänglighet. Men den återkommande begränsningen var inte ljudkvaliteten — utan uttrycksfullheten. Det var svårt att få fram mer överdrivna känslor, avbrott i samtal och trovärdigt samspel.
Eleven v3 fyller det här tomrummet. Den är byggd från grunden för att ge röster som suckar, viskar, skrattar och reagerar — och skapar tal som känns genuint lyhört och levande.
Nyheter i Eleven v3 (alpha)
| Feature | What it unlocks |
|---|---|
| Audio tags | Inline control of tone, emotion, and non-verbal reactions |
| Dialogue mode | Multi-speaker conversations with natural pacing and interruptions |
| 70+ languages | Full coverage of high-demand global languages |
| Deeper text understanding | Better stress, cadence, and expressivity from text input |
Använda ljudtaggar
Ljudtaggar placeras direkt i ditt manus och skrivs med gemener inom hakparenteser. Du kan läsa mer om ljudtaggar i vår guide för prompting av v3 i dokumentationen.
Professional Voice Clones (PVC) är för närvarande inte fullt optimerade för Eleven v3, vilket kan ge lägre klonkvalitet jämfört med tidigare modeller. Under den här forskningsförhandsvisningen är det bäst att hitta en Instant Voice Clone (IVC) eller en designad röst för ditt projekt om du behöver använda v3-funktioner. PVC-optimering för v3 kommer inom en snar framtid.
Du kan till exempel skriva: ”[whispers] Något är på väg… [sighs] Jag kan känna det.” Du kan också kombinera flera taggar för mer uttrycksfull kontroll:
Skapa dialog med flera talare
Eleven v3 stöds i vår befintliga Text to Speech-endpoint. Dessutom introducerar vi en ny Text to Dialogue API-endpoint. Ange en strukturerad array med JSON-objekt — där varje objekt representerar en talares replik — så genererar modellen en sammanhängande ljudfil med överlappningar:
Endpointen hanterar automatiskt övergångar mellan talare, känsloförändringar och avbrott.
Läs mer här.
Priser och tillgänglighet
| Plan | Launch promo | At the end of June |
|---|---|---|
| UI (self-serve) | 80% off (~5× cheaper) | Same as Multilingual V2 |
| UI (enterprise) | 80% off business plan pricing | Business plan pricing |
Så här aktiverar du v3:
- Använd modellväljaren och välj Eleven v3 (alpha)
API-åtkomst och stöd i Studio kommer snart. För tidig åtkomst, kontakta säljteamet.
När du inte ska använda v3
Eleven v3 (alpha) kräver mer prompt engineering än våra tidigare modeller. När den fungerar är resultatet häpnadsväckande, men dess tillförlitlighet och högre fördröjning gör att den inte lämpar sig för användning i realtid eller samtal. För detta rekommenderar vi Eleven v2.5 Turbo/Flash.
Mer information finns i den fullständiga v3-dokumentationen och vanliga frågor.
- Logga in på ElevenLabs UI
- Välj v3 (alpha) i modellrullgardinsmenyn
- Klistra in ditt manus — använd taggar eller dialog
- Generera ljud
Vi ser fram emot att se hur du väcker v3 till liv i nya användningsområden — från uppslukande berättande till filmiska produktionsflöden.
Liknande artiklar




