Att skriva av en timmes intervju för hand tar de flesta mellan fyra och sex timmar. Har du åtta intervjuer i en uppsats är det en arbetsvecka innan analysen ens börjat.
Automatisk transkribering tar bort merparten av det arbetet, men inte allt — och för studentarbete finns två frågor som avgör vilket verktyg som duger: hur noggrann utskriften behöver vara, och vad du får göra med ljudet.
Först: vilken sorts utskrift behöver du?
Metodlitteraturen skiljer på nivåer, och valet påverkar hur mycket efterarbete som återstår.
| Nivå | Vad den innehåller | När den används |
|---|---|---|
| Ordagrann | Varje ord, inklusive "öh", omtagningar och avbrott | Samtalsanalys, språkvetenskap |
| Innehållsnära | Det som sägs, städat från utfyllnad | Vanligast i kvalitativa uppsatser |
| Sammanfattande | Referat av innehållet | Bakgrundsintervjuer, research |
Automatisk transkribering ger en innehållsnära utskrift. Ska du göra samtalsanalys räcker den inte utan genomgång; ska du koda teman i en intervjustudie räcker den ofta rakt av, efter en snabb korrekturläsning av namn och fackord.
Fråga din handledare vilken nivå kursen kräver innan du väljer verktyg. Kräver metoden ordagrannhet är automatisk transkribering ett utkast, inte ett resultat.
Intervjuer: ljudet innehåller personuppgifter
En inspelad intervju är nästan alltid personuppgifter — rösten i sig, och ofta betydligt mer. Det påverkar var ljudet får hamna.
De flesta lärosäten har egna regler för studentarbeten som behandlar personuppgifter, och många kräver att data hålls inom vissa system. Kolla vad som gäller på ditt lärosäte innan du laddar upp något, särskilt om intervjuerna rör hälsa, etnicitet, politiska åsikter, sexualliv eller fackligt medlemskap — kategorier som hanteras strängare i dataskyddsförordningen.
Det praktiska rådet: laddar du upp ljudet till en webbtjänst lämnar det din dator, och då blir leverantörens villkor en del av din metoddel. Kör du transkriberingen lokalt på din egen dator uppstår aldrig den frågan.
Två saker som brukar krävas oavsett verktyg:
- Informerat samtycke från den du intervjuar, med information om vad materialet ska användas till och hur länge det sparas.
- En plan för radering. Ljudfiler har en tendens att bli kvar i nedladdningsmappen långt efter att uppsatsen är inlämnad.
Föreläsningar: fråga innan du spelar in
Här är det inte dataskydd utan upphandling av tillstånd som gäller. En föreläsning är någon annans framförande, och reglerna varierar mellan lärosäten och mellan lärare.
Det vanliga mönstret är att inspelning för eget bruk accepteras om du frågar, och att spridning aldrig gör det. Fråga läraren. Det tar tio sekunder och tar bort hela frågan.
Transkribering är däremot särskilt användbart just för föreläsningar av ett skäl som sällan nämns: en sökbar text gör att du kan hitta var något sades utan att skrubba genom nittio minuters ljud.
Vad som fungerar på svenska
Svenska är svårare för taligenkänning än engelska, eftersom de flesta modeller tränas på material där engelska dominerar kraftigt. Resultatet syns tydligast på sammansatta ord och namn — "riksdagsledamoten" blir "riksdags ledamoten".
För svenskt tal finns KB-Whisper från Kungliga biblioteket, tränad på över 50 000 timmar svenskt tal. Enligt KBLab:s egna utvärderingar gör den omkring 47 procent färre ordfel på svenska än OpenAI:s generella whisper-large-v3. Den är fritt tillgänglig och kan köras lokalt.
Ligger intervjun eller föreläsningen i ett Teams- eller Zoom-möte finns transkribering inbyggd — men den sitter bakom licenser och inställningar som mötets arrangör äger, vilket sällan är du som student.
Vad det behöver kosta
Ingenting, för de flesta studentbehov.
Whisper-modeller körs lokalt utan minutkostnad. Begränsningen är tid: en större modell ger bättre text men tar längre tid på en processor än på ett grafikkort. För en handfull intervjuer spelar det ingen roll — du startar transkriberingen och gör något annat.
Molntjänster tar oftast betalt per minut. Räkna på det innan du börjar: åtta intervjuer à 60 minuter är 480 minuter, och per-minutpriser som ser små ut blir synliga summor på ett uppsatsmaterial.
Om Sagt.ai
Sagt.ai är en Windows-app som kör KB-Whisper lokalt på din dator. Den lyssnar på datorns eget ljud — mikrofon och systemljud — vilket gör att den fångar både en intervju i rummet och en föreläsning som spelas upp eller sänds i Teams, Zoom eller Meet.
Gratisnivån är obegränsad, kräver inget konto och fungerar utan internet. För en uppsats med ett tiotal intervjuer räcker den hela vägen — ljudet lämnar aldrig datorn, vilket gör metoddelen enklare att skriva.
Källkoden till skrivbordsappen är publik under MIT-licens, så integritetspåståendena går att granska i stället för att tas på förtroende.