Vad är Audio Tags? Den kompletta guiden till emotionell TTS
- Skriven av
- Jack Limebear
- Publicerad
- Senast uppdaterad
Audio Tags är ledtrådar på naturligt språk inom hakparenteser, till exempel [laughs], [gasps], [excited] och [worried], som Eleven v3 tolkar som instruktioner för framförandet snarare än ord som ska sägas. När du skriver ett manus för en Text to Speech-modell ger dessa Audio Tags dig detaljerad kontroll över den känslomässiga leveransen i texten.
Eleven v3 blev allmänt tillgänglig i mars 2026. Före v3 var det en process av att generera om innehåll och hoppas på det bästa för att få ett specifikt känslomässigt framförande från en Text to Speech-modell. Audio Tags tar bort gissningsarbetet och ger dig full kontroll över ett känslomässigt Text to Speech-framförande.
Den här guiden beskriver vad Audio Tags är, hur de fungerar, alla tillgängliga taggkategorier och hur de jämförs med SSML (Speech Synthesis Markup Language). Vi tar även upp vanliga användningsområden, med länkar till en särskild guide för vart och ett.
Sammanfattning
- Audio Tags är ledtrådar inom hakparenteser, som [shouts] eller [excited], som styr känsla, tempo, framförande och ton i TTS i Eleven v3.
- Eleven v3 stöder inte SSML, men ersätter det med Audio Tags för en mer naturlig skrivupplevelse.
- Taggar finns i flera kategorier, exempelvis känslor, framförande och tempo, mänskliga reaktioner, accenter och ljudeffekter.
- Interpunktion och versaler i texten låter dig forma tempot i ett AI-röstframförande.
- Du kan använda Audio Tags i ElevenLabs via gränssnittet eller API:et.
Hur fungerar Audio Tags?
Audio Tags placeras direkt i transkriberingen och omsluts av hakparenteser. När du vill ändra framförandet, till exempel från normalt till [worried], behöver du bara lägga till en Audio Tag.
Du kan också använda fler än en tagg i samma mening och kombinera taggar för ett mer nyanserat framförande, till exempel [tired] Det har varit en lång dag… [upset] Hur många dagar till orkar jag?
Arkitekturen bakom Eleven v3 gör att modellen kan läsa kontext på en djupare nivå än tidigare modeller. Den kan följa känslomässiga signaler, tonförändringar, talarbyten och kontextledtrådar utan att behöva en separat parameter eller inställning. Tala bara om för modellen vad situationen kräver, så framför den repliken precis som du har tänkt dig.
Eleven v3 hanterar även dialog med flera talare som känns spontan, inklusive avbrott, humörskiften och det naturliga samspelet i verkliga samtal – allt enbart utifrån taggar och manusets struktur.
Audio Tags jämfört med SSML
Om du har arbetat med andra TTS-system har du troligen stött på Speech Synthesis Markup Language. Plattformar som Amazon Polly och Microsoft Azure Speech använder SSML-taggar som <break> eller <emphasis> för att ge ett TTS-manus ytterligare kontext.
Eleven v3 stöder inte SSML:s break-taggar eller resten av SSML-tagguppsättningen. I stället tar Audio Tags, interpunktion och själva textstrukturen över den rollen, samtidigt som du får detaljerad kontroll över framförandet.
Du kan använda tabellen nedan för att matcha vanliga SSML-taggar med motsvarigheten i Eleven v3.
Ur skribentens perspektiv kräver det mycket mindre arbete att lägga till [whispers] i en replik än att konfigurera en prosody-hastighet.
Kategorierna av Audio Tags i v3: Styr framförandet med Audio Tags
Du kan placera Audio Tags var som helst i manuset för att forma framförandet i realtid. Du kan också använda kombinationer av taggar i ett manus eller till och med i en mening.
Taggarna delas in i följande huvudkategorier.
Känslor
De här taggarna kan hjälpa dig att ange röstens känslomässiga ton, oavsett om den är dyster, intensiv eller uppåt. Du kan till exempel använda en eller en kombination av [sad], [angry], [happily] och [sorrowful].
Framförande och tempo
De handlar mer om ton och framförande. Du kan använda dessa taggar för att justera volym och energi i scener som behöver återhållsamhet eller kraft. Exempel är taggar som [whispers], [shouts] och [softly].
Mänskliga reaktioner
Verkligt naturligt tal innehåller reaktioner. Du kan till exempel göra talet mer verklighetstroget genom att lägga in naturliga, orepeterade ögonblick. Taggar som [laughs], [clears throat] och [sighs] bidrar alla till en TTS-modell som kan förmedla mänskliga känslor.
Andra exempel på kategorier av Audio Tags är:
- Accenter och karaktärsröster: Accenttaggar förflyttar rösten till en specifik region eller persona utan att byta modell, till exempel [French accent], [British accent] eller [pirate voice]. Använd dem för att förvandla en enda röst till en flexibel ensemble i stället för ett fast framförande.
- Ljudeffekter: Taggar för ljudeffekter lägger till ljud som inte är tal direkt i genereringen, till exempel [gunshot], [explosion] och [clapping]. De fungerar bra för uppslukande ljud, spel och dramatiserad berättarröst där scenen behöver mer än en röst. Du kan även använda ElevenCreative AI-ljudeffektgenerator.
Taggar ger dig mycket kontroll, men du kan också använda interpunktion för att forma rytm och betoning. Lägg till exempel till en ellips för en naturlig paus eller använd kommatecken för att skapa naturliga andningsmönster. Prova att skriva ett ord med versaler för att betona det: ”Jag vill ha det NU.”
Vad kan du göra med Audio Tags?
Audio Tags öppnar upp manusens känslomässiga komplexitet på ett intuitivt sätt. Skriv naturligt och lägg till taggar längs vägen.
Här är en snabb överblick över några användningsområden för känslomässig TTS med Audio Tags.
Situationsmedvetenhet i AI-ljud
Taggar som [whisper] eller [shouting] låter Eleven v3 reagera på situationen. Du kan bygga in dynamisk situationsmedvetenhet i manuset, från att tona ned en varning till att hålla en utdragen paus för att skapa spänning.
Se vår guide om situationsmedvetenhet i AI-ljud för en fullständig genomgång.
Styra karaktärers framförande i tal
När du bygger ett manus med flera karaktärer vill du tydligt visa hur varje röst skiljer sig åt. Från att justera deras personlighet med [sarcastically] till att definiera hur de talar med [British accent] kan du fånga ett helt spektrum av känslor med vår TTS-motor.
Läs mer om att styra karaktärers framförande i AI-tal.
Uttrycka känslomässig kontext i tal
Med Audio Tags kan du forma en repliks känslomässiga framförande medan den utvecklas. Du kan bygga upp känslor genom hela ett tal och nå ett crescendo i det ögonblick du ser din karaktär nå sin fulla potential. Taggar som [awe], [booming] och [big laugh] hjälper dig att bygga in ett helt känsloregister i ditt AI-röstframförande.
Läs mer om hur du använder känslomässig kontext i AI-tal.
Ge liv åt dialog med flera karaktärer
När du bygger dialoger med flera karaktärer kan du inleda varje replik med en Audio Tag för att skapa rika karaktärssamtal.
Ta följande som exempel: Tom: [coughing] [beginning to speak] ursäkta, jag är lite sjuk i dag— Emma: [interrupting] —Sjuk? Du vet hur mycket jag hatar hosta, Tom! Tom: [surprised] Det är bara lite hosta, det är inget allvarligt. Hur skulle du känna om— Emma: [overlapping] [annoyed] —Jag tycker att du ska gå hem.
Se vad mer du kan göra med dialog med flera karaktärer i Eleven v3.
Exakt kontroll över AI-talets framförande
Du kan styra talets tempo i Eleven v3 med Audio Tags eller interpunktion. Taggar som [pause], [rushed] eller [drawn out] låter dig aktivt forma repliken med precision. Du kan också lägga till ellipser, punkter och utropstecken för att naturligt bygga in känslor i ditt TTS-framförande.
Vi har skrivit en detaljerad guide om exakt kontroll över framförandet i Eleven v3.
Känslomässig TTS är tillgänglig via API:et
Audio Tags fungerar på samma sätt via Text to Speech API som i ElevenLabs gränssnitt. Skriv taggen direkt i manustexten, så returnerar API:et det taggade framförandet i det genererade ljudet, från ljudboksflöden till röstpålägg för reklam.
Läs mer om Eleven v3 eller kontakta säljteamet för att komma igång i dag.




