Categorieën
Tech

Attendi Model Update: Nauwkeuriger, verbeterde automatische interpunctie en snellere reactiesnelheid

Bij Attendi onderzoeken we constant hoe onze oplossing de natuurlijk uitgesproken woorden van zorgprofessionals nauwkeurig omzet in goed leesbare rapportages. In dit artikel bespreken we hoe we met 200+ uur aan ingesproken rapportages het taal- en interpunctiemodel hebben verbeterd, de verdubbeling van de kwaliteit van de automatische interpunctie op rapportageniveau, de verhoogde nauwkeurigheid van ons spraak-naar-tekst model en de verbeteringen in de reactiesnelheid. Ook bekijken we hoe deze updates het kwalitatief rapporteren voor zorgprofessionals makkelijker maakt. 

Wat is een AutoPunctuator model?

De AutoPunctuator is een machine learning-model dat gesproken tekst waar nog geen interpunctie in verwerkt is automatisch voorziet van de juiste leestekens. Het doel van dit model is om de context te begrijpen en de meest passende interpunctie toe te voegen. Interpunctie, zoals punten, komma’s of vraagtekens spelen een essentiële rol om geschreven taal goed leesbaar te maken. Daarmee is de juiste plaatsing van interpunctie belangrijk bij de leesbaarheid van rapportages. Zorgprofessionals hebben echter niet altijd de tijd om rapportages netjes van de juiste interpunctie te voorzien.  

Wat is de verbetering die is doorgevoerd in ons AutoPunctuator model?

Voorheen maakten we gebruik van een interpunctiemodel dat was getraind op algemene Nederlandse gesproken data, maar niet specifiek op medische transcripties. Met deze update hebben we een open source AutoPunctuator model getraind met 200 extra uur aan ingesproken rapportages welke door ons zijn voorzien van de juiste interpunctie. Deze data hebben we gebruikt om het model opnieuw te trainen. Op deze manier leerden we het systeem beter te voorspellen hoe interpunctie moet worden toegepast.  

Dat betekent concreet dat we in de laatste update het volgende hebben bereikt: 

  1. Verbetering van 90,11% → 98,32% op het niveau van individuele interpunctie; 
  1. Een verdubbeling van de prestatie van de plaatsing van interpunctie op rapportniveau (van 36% naar 70%); 
  1. Verbeterde interpunctie bij ingesproken rapportages die verkeerd getranscribeerd zijn.

Wat verwachten we dat deze update betekent voor zorgprofessionals?

We verwachten dat deze verbeteringen zullen leiden tot meer grammaticaal correcte, passende en natuurlijke interpunctie in de ingesproken rapportages. De verbeterde interpunctie draagt direct bij aan een betere leesbaarheid van de rapportages voor zowel zorgprofessionals als de cliënten en (eventuele) mantelzorgers die meelezen met de rapportages. Daarnaast zorgt het ervoor dat zorgprofessionals in een natuurlijke taal de rapportage kunnen inspreken waarna er een goed leesbare rapportage ontstaat, inclusief de juiste interpunctie.

Wat zijn de verbeteringen die zijn doorgevoerd in het spraak-naar-tekst taalmodel?

Onderdeel van het verbeteren van ons spraak-naar-tekst model is het toetsen van de resultaten die ons model genereert ten opzichte van wat er daadwerkelijk is ingesproken. Voor deze update hebben we 200+ uur aan rapportages gebruikt, waar ruim 300 miljoen ingesproken woorden instonden die voorkomen in de domeinen van zorg waarin wij actief zijn. Deze omvang van data zorgt ervoor dat we in heel Nederland per domein steeds nauwkeuriger gesproken taal kunnen omzetten in bruikbare rapportages.

Door de verbeteringen in het spraak-naar-tekst model hebben we de accuraatheid van ons systeem kunnen verhogen van 93,5% naar 95%. Daarnaast is het belangrijk om te kijken naar de WER (Word Error Rate) die het percentage fouten vertegenwoordigt in het omzetten van gesproken woorden naar tekst. Een lagere WER duidt op minder fouten en dus een nauwkeurigere omzetting. In het geval van de laatste verbetering van het taalmodel is de WER gedaald met 22,3%, wat aangeeft dat de kwaliteit van de omzetting van spraak naar tekst aanzienlijk is verbeterd.    

Een verbeterde Response Time Factor voor ons taalmodel

De Response Time Factor (RTF) is een metriek die wordt gebruikt om responsiviteit en prestaties van een API te evalueren. Het vertegenwoordigt het tijdsverschil tussen het moment waarop een verzoek naar de API wordt verzonden (bijvoorbeeld een ingesproken rapportage) en het moment waarop de respons door de applicatie wordt ontvangen. We streven ernaar om dit getal zo laag mogelijk te houden, wat betekent dat de verwerking van een ingesproken rapportage snel verloopt. We hebben met de laatste update de RTF met (gemiddeld genomen) 10% kunnen verbeteren. Conclusie: dankzij deze updates krijgen zorgprofessionals nu sneller en nauwkeuriger resultaat, wat direct is voorzien van de juiste automatische interpunctie.  

Wil je graag meer weten over spraakgestuurd rapporteren? Onze collega Rik kan je hier meer over vertellen in een persoonlijk gesprek; plan hier een demo in met Rik!