Uitleg
Speech-to-text (STT), of automatische spraakherkenning, zet gesproken taal om in geschreven tekst. Het model luistert naar het audiosignaal, deelt het op in korte fragmenten en voorspelt welke woorden het meest waarschijnlijk zijn, rekening houdend met context.
Moderne systemen gebruiken neurale netwerken die op grote hoeveelheden spraak zijn getraind. Daardoor werken ze beter bij accenten en achtergrondgeluid dan oudere, regelgebaseerde herkenners. Toepassingen zijn ondertiteling, vergadernotulen, dicteren en spraakbesturing.
STT is niet foutloos: eigennamen, vaktaal en overlappingen van sprekers blijven lastig. Voor belangrijke notulen is een menselijke controle nog steeds verstandig.
⚡ Voorbeelden
- •Zoom realtime vergaderingstranscriptie
- •Apple Siri stemmycommando's
- •Otter.ai vergaderingsnotules automatisatie