Vi presenterar Eleven v4Möt Eleven v4, vår mest uttrycksfulla modell hittills. Med 3× fler krediter inkluderade i Creator+ till och med den 12 oktober

Hoppa till innehållet

Vad är Audio Tags? Den kompletta guiden till emotionell TTS

Skriven av
Jack Limebear
Publicerad
Senast uppdaterad

LyssnaLyssna på den här artikeln

Audio Tags är ledtrådar på naturligt språk inom hakparenteser, till exempel [laughs], [gasps], [excited] och [worried], som Eleven v3 tolkar som instruktioner för framförandet snarare än ord som ska sägas. När du skriver ett manus för en Text to Speech-modell ger dessa Audio Tags dig detaljerad kontroll över den känslomässiga leveransen i texten. 

Eleven v3 blev allmänt tillgänglig i mars 2026. Före v3 var det en process av att generera om innehåll och hoppas på det bästa för att få ett specifikt känslomässigt framförande från en Text to Speech-modell. Audio Tags tar bort gissningsarbetet och ger dig full kontroll över ett känslomässigt Text to Speech-framförande.

Den här guiden beskriver vad Audio Tags är, hur de fungerar, alla tillgängliga taggkategorier och hur de jämförs med SSML (Speech Synthesis Markup Language). Vi tar även upp vanliga användningsområden, med länkar till en särskild guide för vart och ett.

Sammanfattning

  • Audio Tags är ledtrådar inom hakparenteser, som [shouts] eller [excited], som styr känsla, tempo, framförande och ton i TTS i Eleven v3.
  • Eleven v3 stöder inte SSML, men ersätter det med Audio Tags för en mer naturlig skrivupplevelse.
  • Taggar finns i flera kategorier, exempelvis känslor, framförande och tempo, mänskliga reaktioner, accenter och ljudeffekter.
  • Interpunktion och versaler i texten låter dig forma tempot i ett AI-röstframförande.
  • Du kan använda Audio Tags i ElevenLabs via gränssnittet eller API:et.

Hur fungerar Audio Tags?

Audio Tags placeras direkt i transkriberingen och omsluts av hakparenteser. När du vill ändra framförandet, till exempel från normalt till [worried], behöver du bara lägga till en Audio Tag.

Du kan också använda fler än en tagg i samma mening och kombinera taggar för ett mer nyanserat framförande, till exempel [tired] Det har varit en lång dag… [upset] Hur många dagar till orkar jag?

Arkitekturen bakom Eleven v3 gör att modellen kan läsa kontext på en djupare nivå än tidigare modeller. Den kan följa känslomässiga signaler, tonförändringar, talarbyten och kontextledtrådar utan att behöva en separat parameter eller inställning. Tala bara om för modellen vad situationen kräver, så framför den repliken precis som du har tänkt dig.

Eleven v3 hanterar även dialog med flera talare som känns spontan, inklusive avbrott, humörskiften och det naturliga samspelet i verkliga samtal – allt enbart utifrån taggar och manusets struktur. 

Audio Tags jämfört med SSML

Om du har arbetat med andra TTS-system har du troligen stött på Speech Synthesis Markup Language. Plattformar som Amazon Polly och Microsoft Azure Speech använder SSML-taggar som <break> eller <emphasis> för att ge ett TTS-manus ytterligare kontext. 

Eleven v3 stöder inte SSML:s break-taggar eller resten av SSML-tagguppsättningen. I stället tar Audio Tags, interpunktion och själva textstrukturen över den rollen, samtidigt som du får detaljerad kontroll över framförandet.

Du kan använda tabellen nedan för att matcha vanliga SSML-taggar med motsvarigheten i Eleven v3.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Ur skribentens perspektiv kräver det mycket mindre arbete att lägga till [whispers] i en replik än att konfigurera en prosody-hastighet.

Kategorierna av Audio Tags i v3: Styr framförandet med Audio Tags

Du kan placera Audio Tags var som helst i manuset för att forma framförandet i realtid. Du kan också använda kombinationer av taggar i ett manus eller till och med i en mening.

Taggarna delas in i följande huvudkategorier.

Känslor

De här taggarna kan hjälpa dig att ange röstens känslomässiga ton, oavsett om den är dyster, intensiv eller uppåt. Du kan till exempel använda en eller en kombination av [sad], [angry], [happily] och [sorrowful].

[sorrowful] I couldn't sleep that night. The air was too still, and the moonlight kept sliding through the blinds like it was trying to tell me something.
[quietly] And suddenly,
that's when I saw it.
0:00
Okay, you are not going to believe this. You know how I've been totally stuck on that short story, like staring at the screen for hours, just nothing? [sighs] I was seriously about to just trash the whole thing, start over, give up probably.
But then [chuckles] last night, I was just doodling, not even thinking about it, right? And this one little phrase popped into my head, just completely out of the blue. And it wasn't even for the story initially, but then I typed it out just to see, and it was like the floodgates opened. Suddenly, I knew exactly where the character needed to go, what the ending had to be. It all just clicked. [sighs] I stayed up till like 3:00 a.m. just typing like a maniac. Didn't even stop for coffee. [chuckles] And it's, it's good, like really good. It feels so complete now, you know? Like it finally has a soul. [sighs] I am so incredibly pumped to finish editing it now. It went from feeling like a chore to feeling like
magic. Seriously, I'm still buzzing.
0:00

Framförande och tempo

De handlar mer om ton och framförande. Du kan använda dessa taggar för att justera volym och energi i scener som behöver återhållsamhet eller kraft. Exempel är taggar som [whispers], [shouts] och [softly].

Could you switch my accent in the old model? [dismissive] Didn't think so, [cheeky] but you can now, so check this out. In just a sec, I'm going to speak with a different accent. And just between you and me, [whispers] I don't really know how, but okay. First, let's change it up [australian accent] so that I can fit in with the locals in Melbourne when I visit next month. [laughing] Whoa. Yeah, man, this is sick. Okay, let's try a different one, see if you can guess. [french accent] My love is like a red, red rose.
0:00
So, I was thinking we could-
[jumping in] Test our new timing features.
[surprised] Exactly! How did you-
[overlapping] Know what you were thinking? Lucky guess. Sorry, go ahead.
[cautiously] Okay. So if we both try to talk at the same time-
We'll probably crash the system?
[panicking] Wait, are we crashing? I can't tell if this is a feature or a-
[interrupting] Bug. Did I just cut you off again?
[sighing] Yes. But honestly, this is kind of fun.
0:00

Mänskliga reaktioner

Verkligt naturligt tal innehåller reaktioner. Du kan till exempel göra talet mer verklighetstroget genom att lägga in naturliga, orepeterade ögonblick. Taggar som [laughs], [clears throat] och [sighs] bidrar alla till en TTS-modell som kan förmedla mänskliga känslor.

Andra exempel på kategorier av Audio Tags är:

  • Accenter och karaktärsröster: Accenttaggar förflyttar rösten till en specifik region eller persona utan att byta modell, till exempel [French accent], [British accent] eller [pirate voice]. Använd dem för att förvandla en enda röst till en flexibel ensemble i stället för ett fast framförande.
  • Ljudeffekter: Taggar för ljudeffekter lägger till ljud som inte är tal direkt i genereringen, till exempel [gunshot], [explosion] och [clapping]. De fungerar bra för uppslukande ljud, spel och dramatiserad berättarröst där scenen behöver mer än en röst. Du kan även använda ElevenCreative AI-ljudeffektgenerator.

Taggar ger dig mycket kontroll, men du kan också använda interpunktion för att forma rytm och betoning. Lägg till exempel till en ellips för en naturlig paus eller använd kommatecken för att skapa naturliga andningsmönster. Prova att skriva ett ord med versaler för att betona det: ”Jag vill ha det NU.”

We're off under the lights here for this semifinal clash, the stadium buzzing with anticipation. Eleven Labs united in their iconic black and white shirts, pushing forward with intent straight from the opening whistle. [excited] The ball is zipped out wide, early attack here. Driving down the wing, pace to burn, [shouting] he skids past one, skips past two. Oh, this is beautiful. One-on-one with the fullback, cuts inside. Oh, that's a lovely bit of footwork. PURE MAGIC on the pitch. ElevenLabs on top form tonight.
0:00
Oh my God. [laughing] You guys, like no joke, I just tried this TTS thing and it was, like, weirdly emotional. Like, it literally said hi, and I was, like, on the verge of tears. [laughing] I don't even cry, okay? I'm a Capricorn.
0:00

Vad kan du göra med Audio Tags?

Audio Tags öppnar upp manusens känslomässiga komplexitet på ett intuitivt sätt. Skriv naturligt och lägg till taggar längs vägen.

Här är en snabb överblick över några användningsområden för känslomässig TTS med Audio Tags.

Situationsmedvetenhet i AI-ljud

Taggar som [whisper] eller [shouting] låter Eleven v3 reagera på situationen. Du kan bygga in dynamisk situationsmedvetenhet i manuset, från att tona ned en varning till att hålla en utdragen paus för att skapa spänning.

Se vår guide om situationsmedvetenhet i AI-ljud för en fullständig genomgång.

Styra karaktärers framförande i tal

När du bygger ett manus med flera karaktärer vill du tydligt visa hur varje röst skiljer sig åt. Från att justera deras personlighet med [sarcastically] till att definiera hur de talar med [British accent] kan du fånga ett helt spektrum av känslor med vår TTS-motor.

Läs mer om att styra karaktärers framförande i AI-tal.

Uttrycka känslomässig kontext i tal

Med Audio Tags kan du forma en repliks känslomässiga framförande medan den utvecklas. Du kan bygga upp känslor genom hela ett tal och nå ett crescendo i det ögonblick du ser din karaktär nå sin fulla potential. Taggar som [awe], [booming] och [big laugh] hjälper dig att bygga in ett helt känsloregister i ditt AI-röstframförande.

Läs mer om hur du använder känslomässig kontext i AI-tal. 

Ge liv åt dialog med flera karaktärer

När du bygger dialoger med flera karaktärer kan du inleda varje replik med en Audio Tag för att skapa rika karaktärssamtal. 

Ta följande som exempel: Tom: [coughing] [beginning to speak] ursäkta, jag är lite sjuk i dag— Emma: [interrupting] —Sjuk? Du vet hur mycket jag hatar hosta, Tom! Tom: [surprised] Det är bara lite hosta, det är inget allvarligt. Hur skulle du känna om— Emma: [overlapping] [annoyed] —Jag tycker att du ska gå hem. 

Se vad mer du kan göra med dialog med flera karaktärer i Eleven v3.

Exakt kontroll över AI-talets framförande

Du kan styra talets tempo i Eleven v3 med Audio Tags eller interpunktion. Taggar som [pause], [rushed] eller [drawn out] låter dig aktivt forma repliken med precision. Du kan också lägga till ellipser, punkter och utropstecken för att naturligt bygga in känslor i ditt TTS-framförande.

Vi har skrivit en detaljerad guide om exakt kontroll över framförandet i Eleven v3.

Känslomässig TTS är tillgänglig via API:et

Audio Tags fungerar på samma sätt via Text to Speech API som i ElevenLabs gränssnitt. Skriv taggen direkt i manustexten, så returnerar API:et det taggade framförandet i det genererade ljudet, från ljudboksflöden till röstpålägg för reklam. 

Läs mer om Eleven v3 eller kontakta säljteamet för att komma igång i dag.

Vanliga frågor om Audio Tags och känslomässig TTS

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet