Nieuwe spatio-temporele continue herkenning van gebarentaal met behulp van een attent netwerk met meerdere functies(1)

Jun 01, 2023

Abstract: Gezien videostreams streven we ernaar om niet-gesegmenteerde tekens die verband houden met continue gebarentaalherkenning (CSLR) correct te detecteren. Ondanks de toename van voorgestelde deep learning-methoden op dit gebied, richten de meeste zich voornamelijk op het gebruik van alleen een RGB-functie, ofwel het full-frame beeld of details van handen en gezicht. De schaarste aan informatie voor het CSLR-trainingsproces beperkt sterk de mogelijkheid om meerdere functies te leren met behulp van video-invoerframes. Bovendien zou het benutten van alle frames in een video voor de CSLR-taak kunnen leiden tot suboptimale prestaties, aangezien elk frame een ander informatieniveau bevat, inclusief de belangrijkste kenmerken bij het afleiden van ruis. Daarom stellen we nieuwe spatiotemporele continue gebarentaalherkenning voor met behulp van het attente multi-feature netwerk om CSLR te verbeteren door extra keypoint-functies te bieden. Daarnaast benutten we de aandachtslaag in de ruimtelijke en temporele modules om tegelijkertijd meerdere belangrijke kenmerken te benadrukken. Experimentele resultaten van beide CSLR-datasets tonen aan dat de voorgestelde methode superieure prestaties levert in vergelijking met de huidige state-of-the-art methoden met respectievelijk 0.76 en 20.56 voor de WER-score op CSL- en PHOENIX-datasets.

Desert living cistanche

Superman kruiden cistanche

Trefwoorden: continue gebarentaal; ruimtelijk; tijdelijk; meerdere functies; kernpunten; zelf-aandacht

1. Inleiding

Gebarentaal geeft prioriteit aan handmatige communicatie met behulp van handgebaren, lichaamstaal en lipbewegingen in plaats van geluid om te communiceren [1,2]. Meestal wordt gebarentaal gebruikt door mensen die doof of slechthorend zijn, maar het kan ook worden gebruikt in situaties waarin het niet of moeilijk is om geluiden te horen. Daarom is een systeem voor gebarentaalherkenning (SLR) nodig, omdat het helpt om mensen die slechthorend zijn en degenen die dat niet zijn met elkaar in contact te brengen.

De afgelopen jaren hebben onderzoekers veel aandacht besteed aan spiegelreflexcamera's vanwege de rijke visuele informatie die het biedt. Recente SLR-onderzoeken zijn meestal gegroepeerd in geïsoleerde gebarentaalherkenning (ISLR) of continue gebarentaalherkenning (CSLR). Verschillende werken behandelen alleen ISLR [3,4], terwijl andere alleen eenvoudigere taken analyseren, zoals statische gebaren voor alfabetherkenning [5]. Ondertussen zijn de nieuwste methoden meestal ingewikkelder omdat ze CSLR-taken oplossen [6–8]. In vergelijking met ISLR is CSLR een uitdagender probleem omdat het gaat om de reconstructie van zinnen.

Cistanche tea2

Cistanche-thee

Klik hier om de theeproducten van Cistanche deserticola te bekijken

【Vraag om meer】 E-mail:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Er is nog steeds veel vraag naar CSLR-onderzoek omdat de uitvoering ervan nauw verband houdt met de alledaagse omstandigheden in de echte wereld. Deze benadering heeft tot doel de reeks glossen die voorkomen in een videoreeks te herkennen zonder duidelijke segmentering of zelfs helemaal geen. Bovendien bevat het veel onderzoek naar machine learning en een grondig begrip van menselijk gedrag. Het gaat bijvoorbeeld om het volgen van menselijke bewegingen [9], gebarenherkenning [10] en gezichtsherkenning [11]. Desalniettemin zijn er verschillende uitdagingen bij het uitvoeren van CSLR-taken.

Ten eerste zijn gegevensverzameling en annotatie duur voor CSLR [12]. Dit is misschien een van de uitdagingen bij de ontwikkeling ervan, aangezien de CSLR betrokken is bij een groot netwerk en de hoeveelheid gegevens een grote invloed heeft op de prestaties [13]. Bovendien zijn verschillende beschikbare datasets voor gebarentaal zwak geannoteerd [12,14,15]. Om dit probleem op te lossen, hebben tal van studies een zwak gecontroleerde aanpak gebruikt, naast de toepassing van een uitlijnings- en een feature-extractormodule op de netwerkarchitectuur [12].

Ten tweede, vergeleken met ISLR, is CSLR ingewikkelder. Door gebruik te maken van meerdere features wordt voldoende informatie verkregen; het is bewezen dat dit betere prestaties oplevert dan het gebruik van een enkele functie, zoals gerapporteerd in eerdere werken [16-18]. Deze meerdere kenmerken bestaan ​​uit het hoofdkenmerk, namelijk een lichaamsbeeld dat de hoogste nauwkeurigheid bereikt en extra functies, zoals pose, hoofd, linkerhand en rechterhand, die een lagere nauwkeurigheid hebben voor individuele prestaties [17,18]. Het trainen van een groot netwerk met een grote hoeveelheid data is tijdrovend [13]. Het toevoegen van de invoerstroom verhoogt ook de trainingstijd, terwijl het gebruik van extra op afbeeldingen gebaseerde functies de kosten verhoogt [19]. Daarom moeten we belangrijke functies kiezen, zodat we efficiënt kunnen trainen.

Cistanche deserticola slice (1)

Chinese kruidencistanche

Ten derde heeft video-invoer een groot aantal afbeeldingen in de reeks. Sommige afbeeldingen hebben een onduidelijke handvorm door de snelle beweging, mogelijk leidend tot onjuiste informatie. Daarom maakt ons voorgestelde model gebruik van zelfaandacht op basis van [20] om te helpen bij het selecteren van belangrijke informatie. Bovendien heeft zelfaandacht bewezen door [21,22] een impact op het verbeteren van prestaties.

Daarom stellen we een nieuw model voor, de nieuwe spatiotemporele attente multi-feature (STAMF) genaamd, om alle problemen aan te pakken. We volgden eerdere werken [17,23], waarvan is bewezen dat ze werken voor CSLR met zwakke annotatieproblemen. Ze construeren het model met behulp van drie hoofdcomponenten: de eerste is de ruimtelijke module, de tweede is de temporele module en de derde is de sequentie-leermodule. We stellen efficiënte en effectieve invoer met meerdere functies voor met behulp van de full-frame-functie samen met keypoint-functies om CSLR-taken uit te voeren. De full-frame functie vertegenwoordigt het lichaamsbeeld als het hoofdkenmerk en de hoofdkenmerken als het aanvullende kenmerk. Het belangrijkste kenmerk is de lichaamshouding, inclusief het detail van de handhouding. Deze lichaamshouding is de meest effectieve aanvullende functie, aangezien in sommige werken is bewezen dat deze de hoogste nauwkeurigheid bereikt na de full-frame functie [17,18]. We gebruiken ook een aandachtsmodule die zelfaandacht gebruikt op basis van [20] om het belangrijke kenmerk vast te leggen en om de volgorde te helpen leren om de prestaties te verbeteren.

De bijdrage van dit manuscript wordt als volgt samengevat: • We introduceren nieuwe temporele aandacht in de sequentiemodule om de belangrijke tijdstippen vast te leggen die bijdragen aan de uiteindelijke output; • We introduceren de multi-feature die bestaat uit de full-frame feature van de RGB-waarde van het frame als de belangrijkste feature en keypoint-features die de lichaamshouding met het handvormdetail bevatten als extra feature om de modelherkenningsprestaties te verbeteren; • We gebruiken de WER-metriek om aan te tonen dat ons voorgestelde STAMF-model via de experimenten beter presteert dan geavanceerde modellen op beide CSLR-benchmarkdatasets.

cistanche—Improve memory4

Cistanche-supplement bij mij in de buurt - geheugen verbeteren

2. Gerelateerde werken

Er zijn verschillende technologische vorderingen gemaakt en er is veel onderzoek gedaan naar spiegelreflexcamera's. Eerdere studies [24-27] onderzochten de mogelijkheid om ISLR te gebruiken, dat een segmentatie voor elk woord heeft. In de afgelopen jaren zijn op deep learning gebaseerde methoden gebruikt om functies te extraheren met behulp van convolutionele netwerken, hetzij 2D [28,29] of 3D [30,31], vanwege hun sterke visuele weergave. Het merendeel van het vroege onderzoek naar gebarentaalherkenning concentreerde zich op ISLR met multimodale kenmerken [30-32], zoals RGB, dieptekaarten en skeletten, die betere prestaties leveren.

Tegenwoordig is CSLR populairder geworden, hoewel het niet duidelijk tussen elk woord is gesegmenteerd. Vroege werken gebruiken een CNN-functie-extractor [6,33] en HMM [34] om het reeksdoel te bouwen. Recent onderzoek naar CSLR-systemen [17,23] omvatte drie hoofdstappen bij het uitvoeren van de taak van probleemherkenning. Eerst voerden ze de ruimtelijke kenmerkextractie uit, vervolgens temporele segmentatie en ten slotte zinssynthese met een taalmodel [35], of ze gebruikten sequentieel leren [17,23]. Dit sequentieleren gebruikte Bi-LSTM en CTC om de relatie tussen tekenglans in de videosequenties te onderzoeken. Hoewel het een zwakke annotatie gebruikt met niet-gesegmenteerde videosequenties om de glossen van tekens te definiëren, hebben deze benaderingen veelbelovende resultaten opgeleverd.

In de meest recente gerelateerde CLSR-studie waarin een multi-feature-benadering werd geïmplementeerd [17] werden echter vijf features tegelijkertijd gebruikt. De benadering met meerdere functies is zwaarder in vergelijking met het gebruik van minder functies [19]. Deze benadering kan ook niet overweg met de ruisige frames van de videoreeks die onduidelijke informatie bevatten, zoals een wazige handvorm als gevolg van snelle bewegingen. Bovendien kan het vertrouwen op RNN-gebaseerd leren van sequenties problemen opleveren met lange sequenties en de globale context verliezen [20].

cistanche—Improve memory3

Cistanche-supplement bij mij in de buurt - geheugen verbeteren

Het huidige onderzoek heeft tot doel de prestaties te verbeteren door een mechanisme voor zelfaandacht toe te voegen [21,22] dat langere reeksen aankan om de globale context te leren kennen. Zelfaandacht is gebaseerd op vroeg onderzoek [20] dat aantoonde dat zelfaandacht het voordeel heeft dat het lange afhankelijkheden aankan. Deze zelfaandacht is echter gemakkelijker te leren op een korter pad in vergelijking met een langer pad met lange afhankelijkheden. In de vorige CLSR-werken [21,22] zou zelfaandacht het netwerk kunnen helpen om de functie effectiever te leren.

Daarom introduceren we in dit artikel een nieuw spatiotemporeel attent multi-feature model. Dit voorgestelde model extraheert effectief de belangrijke kenmerken en leert de reeks beter door belangrijke informatie te geven met behulp van een zelfaandachtsmechanisme van multi-feature. Alle processen worden uitgevoerd in een end-to-end benadering.

3. Voorgestelde methode

In dit gedeelte worden de kerntechnieken van ons voorgestelde model voor CSLR beschreven. Daarom beginnen we deze sectie met het uitleggen van het overzicht van ons voorgestelde model. Daarnaast geven we meer details over elk belangrijk onderdeel, inclusief de ruimtelijke module, de temporele module en de sequentieleermodule. Daarnaast leggen we ook onze voorgestelde aandachtsmodule uit om het model te helpen beter te leren. Ten slotte kunnen we het raamwerk voor training en inferentie integreren in ons voorgestelde model.

3.1. Kader overzicht

Gegeven een video-invoer, heeft ons voorgestelde model tot doel het corresponderende teken te voorspellen in een correcte glanszin. De eerste module genereert meerdere ruimtelijke kenmerken, zoals full-frame en keypoint-kenmerken voor elk T-frame van de video. Vervolgens stelt de temporele module ons in staat om temporele correlaties te extraheren van de ruimtelijke kenmerken tussen frames voor beide streams. Als laatste stap zijn de ruimtelijke en temporele netwerken gekoppeld aan bidirectioneel lange-kortetermijngeheugen (Bi-LSTM) en CTC voor sequentieleren en inferentie. Vervolgens lichten we onze hoofdcomponenten nader en achtereenvolgens nader toe. Het overzicht van onze voorgestelde architectuur wordt weergegeven in figuur 1.

Figure 1


Figuur 1. De algemene architectuur van de voorgestelde methode bestaat uit drie componenten: een ruimtelijke module, een temporele module en een sequentieleermodule. De ruimtelijke module neemt eerst de afbeeldingsreeks om framegewijze kenmerken te extraheren en past vervolgens de temporele module toe om de tijdelijke kenmerken te extraheren. Vervolgens worden de temporele kenmerken naar de sequentie-leermodule gestuurd om woordvoorspelling uit te voeren en deze in een zin te construeren

3.2. Ruimtelijke module

De ruimtelijke module maakt gebruik van een full-frame functie en keypoint-functies, zoals weergegeven in afbeelding 2. Deze module gebruikt 2D-CNN-netwerkarchitectuur als ruggengraat en ResNet50 is gekozen om de multi-functies vast te leggen. ResNet50 is effectiever in gebruik in vergelijking met recente ResNet-architectuur in termen van tijd terwijl het een vergelijkbaar resultaat heeft [36,37]. De RGB maakt rechtstreeks gebruik van ResNet50, terwijl het keypoint wordt verkregen door HRNet [38] uit het videoframe en wordt geëxtraheerd met behulp van ResNet50 om de keypoint-functies te verkrijgen.

Figure 2


Afbeelding 2. De architectuur van de ruimtelijke module maakt gebruik van multi-stream input. RGB-stream als full-framefunctie en keypoints-stream als keypoint-functie.

3.2.1. Full-Frame-functie

We hebben onze voorbewerkingsstappen toegepast op de RGB-gegevens en vervolgens onze gegevens in het model ingevoerd. We stoppen ze vervolgens als een full-frame input in onze architectuur. Afbeelding 3 toont de illustratie van de originele RGB-afbeelding aan de linkerkant en de bijgesneden afbeelding aan de rechterkant. De bijgesneden afbeelding wordt door het model als input gebruikt. Dit illustreert de voorbewerkingsstap die de minder belangrijke delen van de afbeelding verkleint en meer focus legt op de ondertekenaar. Dit bijsnijden gebruikt een willekeurige bijsnijdmethode uit [12] om de dataset te vergroten. De fullframe-functie wordt voor elk frame in de reeks uit de bijgesneden afbeelding gehaald met behulp van de ResNet50.

Figure 3


Afbeelding 3. Full-frame-functie met RGB-afbeelding, de (linkerafbeelding) is de originele afbeelding en de (rechterafbeelding) is de bijgesneden afbeelding om aan te passen aan het voorgestelde model

3.2.2. Keypoint-functies

We hebben de belangrijkste kenmerken in de ruimtelijke module uit de RGB-gegevens gehaald voor elk frame in de video-invoer. De kwaliteit van keypoint-functies speelt een belangrijke rol in ons voorgestelde model, dus we moeten een robuuste aanpak gebruiken, zoals HRNet [38]. We gebruikten vooraf getraind HRNet [38] om alle 133 kernpunten van het lichaam te schatten, en we gebruikten 27 van de 133 kernpunten uit het resultaat. Zoals weergegeven in afbeelding 4, is de linkerkant het oorspronkelijke sleutelpunt van het bovenlichaam en de rechterkant de geselecteerde 27 sleutelpunten van het bovenlichaam. Deze 27 kernpunten omvatten polsen, ellebogen, schouders, nek, handen en vingers.

Figure 4


Figuur 4. Belangrijkste kenmerken van de PHOENIX-RWTH dataset [33,39], (linker afbeelding) extractie van RGB-afbeelding, en de (rechter afbeelding) is het geselecteerde sleutelpunt dat door het voorgestelde model wordt gebruikt.

3.3. Tijdelijke module

De temporele module heeft tot doel spatiotemporele informatie te leren van de ruimtelijke module. Tijdelijke modules worden geconstrueerd door gestapelde tijdelijke pooling voor elke stream. Zoals weergegeven in figuur 5, bestaat de Temporal pooling-module uit een temporele convolutielaag en een poolinglaag om functies uit sequentiële invoer te extraheren.

Figure 5.


Afbeelding 5. Tijdelijke module-architectuur bestaat uit een gestapelde 1D-CNN en een poolinglaag ingebed met een aandachtsmodule. Werk parallel voor beide kenmerkstromen die aan het einde van de gestapelde lagen zijn samengevoegd, en produceer een enkel tijdelijk kenmerk met een reekslengte die vier keer kleiner is.

De invoer is een lijst met ruimtelijke multifuncties uit de vorige fase. Het temporele kenmerk wordt verkregen met behulp van de temporele convolutielaag, die een enkele 1D convolutionele laag is met dezelfde invoer- en uitvoerlengtes, gevolgd door een enkele poollaag die de grootte verkleint tot de helft. Het gebruik van deze twee gestapelde tijdelijke poollagen is de beste configuratie, volgens de eerdere werken [12]. Na elke tijdelijke pooling integreren we een aandachtsmodule die in detail wordt uitgelegd in paragraaf 3.4. Uiteindelijk voegen we de output van tijdelijke pooling van beide streams samen.

3.4. Aandachtsmodule

De video heeft meerdere frames waarbij sommige delen van het beeld soms wazig zijn. De RTWH-PHOENIX-dataset [33,39] heeft meer defecte frames dan de CSL-dataset [8,40,41]. Dit gebeurt wanneer de beweging te snel is, waardoor een wazig beeld ontstaat en de verkeerde keypoint-locatie ontstaat. Dit frame wordt als defect beschouwd en leidt mogelijk tot een verkeerde interpretatie van zowel de RGB- als keypoint-functies. Figuur 6 toont een illustratie van defecte frames in de RTWH-PHOENIX dataset [33]. Om dit probleem aan te pakken, hebben we een aandachtslaag toegevoegd.

Figure 6


Figuur 6. Illustratie van defecte frames op RWTH-PHOENIX dataset [33,39]. Sommige van de belangrijkste punten in het handgebied bevinden zich in de verkeerde positie vanwege wazige beelden.

Met behulp van het CTC-algoritme wordt de uitlijning van het pad samen met de labeling uitgevoerd door een leeg label te gebruiken en de herhalende labels te verwijderen. CTC geeft er de voorkeur aan blanco etiketten te voorspellen in plaats van glansgrenzen wanneer het de glansgrens niet kan onderscheiden, maar geen van de resultaten is overtuigend. Dit leidt ertoe dat het netwerk CTC gebruikt om pieken in de resultaten te produceren bij het analyseren, leren en voorspellen [42,43]. Over het algemeen zoekt het CTC-verlies naar de sleutelframes en het laatste resultaat is de voorspelling van een bepaald sleutelframe waarvan de kans groot is dat het een blanco label of een niet-blanco label is. Als de glans achtereenvolgens hetzelfde label of blanco label voorspelt, resulteert dit in dezelfde uitvoer. Als er echter een insteeklabel tussen hetzelfde label zit, zelfs als er maar één fout is, resulteert dit in een veel groter verlies. Hier helpt de toevoeging van een aandachtslaag om de belangrijke temporele volgorde te selecteren voordat deze wordt gebruikt voor sequentieel leren.

De aandachtsmodule maakt gebruik van een meerkoppig zelfaandachtsmechanisme [20]. De multi-head module wordt gebruikt om meerdere parallelle aandachtsmechanismen tegelijkertijd te laten draaien. Multi-head aandacht loopt onafhankelijk om zich te concentreren op de afhankelijkheden op korte termijn of de afhankelijkheden op lange termijn in een afzonderlijk hoofd. Elke uitvoer wordt vervolgens lineair aaneengeschakeld en omgezet in de gewenste vorm.

Tegelijkertijd zorgt het multi-head self-attention-mechanisme voor informatie uit meerdere representatiesubruimten, afhankelijk van de geschiedenis van waarnemingen. Voor de eenvoud duiden we de invoerreeksen aan als X. Wiskundig gezien, voor het aandachtsmodel met één hoofd, gegeven invoer X t − T plus 1:t=[X t − T plus 1, · · ·, X t ] ∈ RT × N × P, worden drie deelruimten verkregen, namelijk de vraagdeelruimte Q ∈ RN ×dq, sleuteldeelruimte K ∈ RN × dk, en de waardedeelruimte V ∈ RN × dv. Het latente leerproces van de subruimte kan worden geformuleerd als [20]:

Q=XWQ, K=XWK , V=XWV ,

Vervolgens wordt de geschaalde puntproductaandacht gebruikt om de aandachtsoutput te berekenen als [20]:

Aandacht(Q, K, V)=dus f tmaxQKT/ p dkV,

Bovendien, als we meerdere koppen hebben die tegelijkertijd de meerdere representaties van de invoer volgen, kunnen we tegelijkertijd relevantere resultaten verkrijgen. De laatste stap is om alle hoofden aaneen te schakelen en ze opnieuw te projecteren om de eindscore te berekenen [20]:

MultiHead(Q,K,V)=Concat(head1,..., heads )WO,

hoofd=Attentie(Qi,Ki,Vi),

waarbij Qi=XWQ i , Ki=XWVi en WO ∈ R hd × dmodel. Ten slotte kan het het belangrijkste deel uit de reeks kenmerken selecteren, omdat niet alle informatie in de reeks belangrijk is.

Zoals weergegeven in figuur 7, gebruiken we de aandachtsmodule in verschillende configuraties. De eerste aandachtsmodule wordt aan het einde van de ruimtelijke module geplaatst, terwijl de tweede en derde aandachtsmodule in de temporele module worden geplaatst. De tweede aandachtsmodule, de vroege temporele module genaamd, wordt na het eerste blok van tijdelijke pooling als invoer geplaatst, terwijl de derde tijdelijke aandachtsmodule, de late temporele aandachtsmodule genoemd, na het tweede blok van tijdelijke pooling wordt geplaatst.

Figure 7

Figuur 7. Aandachtsmodules zijn ingebed in ruimtelijke en temporele modules in verschillende configuraties.

Misschien vind je dit ook leuk