Nieuwe spatio-temporele continue herkenning van gebarentaal met behulp van een attent netwerk met meerdere functies(2)
Jun 01, 2023
3.5. Volgorde leren
Sequence Learning Nadat we de resultaten van de ruimtelijke en temporele functie-extractor in de vorm van een gloss-functie hebben verkregen, moeten we ze in een volledige zin rangschikken. Daarom moeten we sequentieel leren gebruiken om ervoor te zorgen dat de glans wordt beheerd om een goede zin te vormen. De meest voorkomende methode in het huidige onderzoek verwijst naar Bidirectioneel Lange Korte Termijn Geheugen (Bi-LSTM) en Connectionistische temporele classificatie (CTC) [17,23] voor problemen die kunnen worden opgelost met behulp van CTC en verschillende recente werken [17,23] stellen voor CTC als een end-to-end trainingsproces voor CSLR.

Cistanche-extract poeder
Klik hier om de producten van Cistanche te bekijken
【Vraag om meer】 E-mail:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Lang kortetermijngeheugen (LSTM) [44] is een variant van het terugkerende neurale netwerk (RNN) en wordt veel gebruikt bij sequentiemodellering. LSTM modelleert uitstekend langdurige afhankelijkheden; het kan hele reeksen invoer verwerken en hun interne toestand gebruiken om de toestandsovergangen te modelleren. De tekortkoming van deze voorwaartse RNN's is echter dat de verborgen toestanden alleen worden geleerd vanuit een eenrichtingsrichting. De RNN produceert een verborgen toestand zoals beschreven door de onderstaande vergelijking na ontvangst van de functiereeks als invoer.
ht=RNN(ht−1,ot),
waarbij ht de verborgen toestand vertegenwoordigt, waarbij de begintoestand h0 een vaste nulvector is, en t de tijdstap is. RNN wordt gebruikt om de tekenglosses te voorspellen volgens de invoer van de ruimtelijke kenmerkreeks.
Bovendien zijn SL-taken vrij complex. Daarom heeft het niet alleen kenmerken nodig die zijn ontvangen uit een eenrichtingscontext, maar heeft het ook hulp nodig bij het gebruik van tweerichtingsinformatie om het voorkomen van woorden te leren die voor en na de andere woorden in de zin komen. Daarom gebruiken we Bi-LSTM [45] om de complexe dynamische afhankelijkheden van beeldreeksen te leren door ze met behulp van ruimtelijke en temporele representaties om te zetten in reeksen glanskenmerken. Volgens de eerder gegeven uitleg kan de Bi-LSTM-methode tweerichtingswerk verrichten met de LSTM-methode. Dit betekent dat de Bi-LSTM-methode sequentiële gegevens beter kan classificeren. De berekening van Bi-LSTM die in twee richtingen verborgen toestanden gebruikt, kan ook worden gezien als herhaalde berekeningen van de LSTM die van voor naar achter en vervolgens van achter naar voren wordt verwerkt. Daarna wordt de verborgen status van elke tijdstap door een volledig verbonden laag en een softmax-laag geleid [17].

Cistanche-poeder
bij=W(ht plus b),
yt,j=e at,j ∑ke at,j ,
waarbij b een biasvector is en y(t,j) de waarschijnlijkheid vertegenwoordigt van label j in tijdstap t. In onze TSL-taak is label j de woordenschat die uit de zin wordt gehaald. In de praktijk verbetert Bi-LSTM aanzienlijk de hoeveelheid informatie waartoe een netwerk toegang heeft, wat op zijn beurt de context van informatie die beschikbaar is in het algoritme verbetert. De informatie bevat de kennis van welk woord na of voor het huidige frame in de invoer van de zinkenmerkreeks komt.
Bi-LSTM stuurt voor elke tijdstap verborgen toestanden als uitvoer naar de CTC-laag. Omdat de resultaten van deze Bi-LSTM geen aandacht besteden aan de glansrangschikking, gebruiken we CTC om videosequentiemapping te verwerken o={ot} T 0 t=1 om een teken te produceren glansreeks `={` i} IL =1 (L Kleiner dan of gelijk aan T) met een betere rangschikking. CTC wordt op veel gebieden gebruikt, waaronder handschriftherkenning [46], spraakherkenning [47] en gebarentaalherkenning [17,23]. In dit domein wordt het gebruikt als een scorefunctie zonder de invoer- en uitvoerreeksen op elkaar af te stemmen. In CSLR staat CTC bekend als een module die is ontwikkeld voor end-to-end-taken waarbij tijdelijke gegevens zonder segmentatie worden geclassificeerd. Door middel van dynamische programmering kan CSLR het uitlijningsprobleem oplossen door een leeg label (-) te maken waarmee het systeem optimale resultaten kan produceren voor de weergave van gegevens die geen labels hebben (zoals epenthesis-gegevens en segmenten van niet-gebaren gegevens). CTC genereert met name een blanco label "-" om de woordenschat V uit te breiden, waarbij V=Vorigin ∪ {-}. Het doel van dit lege label is om de overgang weer te geven en om het bestaan van een lege glans aan te geven die geen informatie verschaft voor het leerproces, zoals π={πt} T 0 t{{20 }}, waarbij πt ∈ V. Als gevolg hiervan kan CTC de uitvoerparameters van de ruimtelijke en temporele functie-extractor en ook de Bi-LSTM als de uitlijningsmodule beheren door de kansen van alle mogelijke paden samen te vatten. Alle uitlijningspaden π hebben een kans dat de invoervolgorde als volgt wordt gegeven [17]:

Cistanche deserticola-experiment
p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, πt
In de volgende stap definiëren we een veel-op-een toewijzingsbewerking B, die alle lege ruimte verwijdert en woorden uit het uitlijningspad dupliceert. Bijvoorbeeld, B (II-ben- -een- -dokter)=ik, ben, een, dokter. Als gevolg hiervan kunnen we de voorwaardelijke kans van de tekenglansreeks l berekenen als het totaal van de kansen van alle routes die vanuit B naar l kunnen worden afgebeeld, op de manier die hieronder wordt beschreven [17]:
p(π|o) = ∑ π∈B−1 p(π|o)
waarbij B −1 (l)={π|B(π)=l} de omgekeerde bewerking van B is. Ten slotte worden de CTC-verliezen van de kenmerkreeks als volgt gedefinieerd [17]:
Lctc=− ln p(` |o)
De voorwaardelijke kans p(π|X) kan worden berekend volgens de aanname van voorwaardelijke onafhankelijkheid.
4. Experimentele resultaten en discussie

Cistanche-supplement bij mij in de buurt - geheugen verbeteren
In deze sectie zullen we de details van ons experiment met de voorgestelde configuratie uitleggen, zoals uitgelegd in de eerdere sectie.
4.1. Gegevenssets
In deze sectie leggen we de datasets uit die we tijdens dit experiment hebben gebruikt. We hebben twee datasets gebruikt, de eerste is de CSL-dataset [8,40,41] en de tweede is de RWTH-PHOENIX-dataset [33,39]. Beide datasets zijn doorlopende datasets in gebarentaal, die worden gebruikt om een reeks gebaren in een volledige zin te vertalen.
4.1.1. CSL-gegevensset
De CSL-dataset is door verschillende werken gebruikt [8,40,41]. Er zijn in totaal 100 zinnen en 178 woorden aanwezig in deze dataset, die vaak worden gebruikt in de dagelijkse communicatie. Deze dataset bevat gemiddeld 5 woorden per zin. Elke zin werd 5 keer uitgevoerd door 50 gebarentaal. Het totale aantal video's is dus 25,000, waarmee dit een van de grootste datasets is. Om ons CSL-model te trainen, hebben we de dataset verdeeld in data voor training met 20,{11}} video's en voor testen met 5000 video's van dezelfde zin maar met verschillende ondertekenaars.
4.1.2. RWTH-PHOENIX-gegevensset
De RWTH-PHOENIX-dataset [33,39] is een dataset in Duitse gebarentaal, die een opname is van openbare weeruitzendingen van televisiestations in Duitsland. Deze video is zo bewerkt dat hij een formaat heeft van 210 × 260. Er zijn 6841 verschillende zinnen ondertekend door 9 verschillende ondertekenaars. Alle ondertekenaars droegen donkergekleurde kleding op een lichtgekleurde achtergrond. In totaal zijn er 1232 woorden met ongeveer 80,000 glossen. Deze dataset is verdeeld volgens een vooraf bepaald formaat, bestaande uit 5672 trainingssamples, 540 validatie/dev-samples en 629 testsamples.
4.2. Voorbewerking van gegevens
Het eerste dat we moesten doen, was onze dataset voorbewerken om in ons voorgestelde model te passen. We hebben het formaat gewijzigd en bijgesneden, zoals geïllustreerd in figuur 3; aan de linkerkant kunnen we zien dat de oorspronkelijke gegevens een resolutie hadden van Full HD of 1920 × 1080. We moesten het bijsnijden en verkleinen naar een resolutie van 224 × 224, omdat onze ruimtelijke module invoer ontvangt die even groot is als de ResNet50-invoer. Daarna hebben we de gegevens in ons ruimtelijk model ingevoerd, dat de 7 × 7-tensor uit een enkel beeld zou produceren.
Het voorbewerkte full-frame beeld werd vervolgens gebruikt om de keypoint-kenmerken te genereren. We hebben het HRNet-model gebruikt om de 133 belangrijkste punten van deze RGB-afbeeldingen te voorspellen. We gebruiken echter alleen 27 sleutelpunten van het bovenlichaam in ons voorgestelde model. De invoergrootte voor de keypoint-objecten is 27 × 3 aangezien we 3-as (x, y en z) coördinaatgegevens per punt hebben. De invoerdimensie van het model is N × 224 × 224 × 3 voor de full-frame functie en N × 1 × 27 × 3 voor de keypoint-invoer, waarbij N het aantal frames is. Om de variatie van de dataset te vergroten, volgen we de augmentatie van [12], inclusief willekeurig bijsnijden, horizontaal spiegelen en willekeurig temporeel schalen. Willekeurig bijsnijden wordt ook gebruikt als onderdeel van een voorbewerkingsstap om de originele afbeelding bij te snijden.

Cistanche-supplement bij mij in de buurt - geheugen verbeteren
4.3. Evaluatie Metriek
Om de herkenningsprestaties van ons voorgestelde model te evalueren, gebruiken we een metriek voor woordfoutpercentages (WER), een metriek die veel wordt gebruikt in CSLR om de herkenningsnauwkeurigheid van een voorspelde zin te schatten, zoals blijkt uit de onderstaande vergelijking [17]:
WER=S plus I plus DT=S plus I plus DS plus C plus D
waarbij S het aantal vervangingen van het oorspronkelijke woord is, I het aantal toevoegingen dat niet in de oorspronkelijke zin voorkomt, D het aantal verwijderingen is dat in de oorspronkelijke zin had moeten staan, C het aantal correcte woorden dat overeenkomt de oorspronkelijke zin, en T is het totale aantal woorden in de zin of dat kan worden verkregen uit het totaal van vervangingen, weglatingen en correcte woorden. Voor CSL wordt elk teken gebruikt om een woord weer te geven.
4.4. Experimenteer met invoerstromen
Dit experiment richt zich voornamelijk op het vergelijken van single-stream en multi-stream invoer op ons model. Het doel is om de beste configuratie van de invoerstroom te vinden. We gebruiken alleen de RWTH-PHOENIX dataset in dit experiment. Ons model zou twee afzonderlijke invoer ontvangen, full-frame en keypoint-invoer. De single-stream input gebruikt alleen de RGB-functie van het full-frame beeld. Er zijn twee invoerexperimenten met één stroom. De eerste gebruikt alleen de full-frame-functie van de RGB-afbeelding en de tweede gebruikt keypoint-functies van de keypoint-invoer. De multi-stream input die we voorstellen bestaat uit RGB en keypoint features. Het vergelijkingsresultaat met een enkele stream en multi-stream wordt weergegeven in Tabel 1. Hier kunnen we zien dat we door de multi-stream-functie te gebruiken een beter resultaat kunnen behalen dan met een enkele stream. De mainstream wordt verkregen uit een full-frame RGB-functie en de extra stream gebruikt de keypoint-functies. De extra keypoint-stream helpt het model om beter te leren, vooral om de details van de handvorm vast te leggen.
Tabel 1. Vergelijking van WER-prestaties met invoer van één stream en meerdere streams.

4.5. Experimenteer met de Aandachtsmodule
Het doel van dit experiment was om de beste configuratie van de aandachtsmodule te kiezen. In dit experiment gebruiken we de configuratie van het beste resultaat van het vorige experimentresultaat en dezelfde dataset. We duiden ruimtelijke aandacht aan als het model met een zelfaandachtslaag aan het einde van de ruimtelijke module voor elk kenmerk. Vroegtijdige aandacht is de laag van zelfaandacht na de eerste tijdelijke bundeling, en late temporele aandacht is de laag van zelfaandacht na de tweede tijdelijke bundeling. Hier zullen we alle bovenstaande configuraties en de combinatie van ruimtelijke en temporele aandacht vergelijken. Het resultaat wordt weergegeven in Tabel 2. Het resultaat van ruimtelijke aandacht is slechter dan temporele aandacht. Het ruimtelijke niveau bevat een reeks kenmerken voor elk frame. Zoals vermeld in [20], is de zelfaandachtslaag gemakkelijker om het kortere pad tussen lange afhankelijkheden te leren. Daarom kan ruimtelijke aandacht de WER niet verlagen vanwege de lange reeks. Aan de andere kant waren we in staat om een verbeterd resultaat te krijgen door tijdelijke aandacht te gebruiken door het na de pooling te plaatsen, zodat het een kortere reekslengte zou krijgen. De late aandacht met de kortste reekslengte krijgt het beste resultaat. Bovendien is de combinatie van de aandachtsmodule in ruimtelijk en temporeel slechter dan het gebruik van slechts enkele aandacht. Op basis van deze resultaten passen we de beste configuratie toe voor de volgende experimenten.
Tabel 2. Vergelijking van WER-prestaties met verschillende aandachtsconfiguraties

4.6. Ablatie-experiment op het STAMF-netwerk
Verder voeren we een ablatie-experiment uit met dezelfde dataset en de beste configuratie van de invoerstroom en aandachtsmodule. Tabel 3 over een experiment met late temporele aandacht zonder pooling bewijst dat de lengte van de reeks de aandachtsprestaties beïnvloedt. De experimenten die gebruik maken van poollagen met kortere sequentielengtes verkrijgen betere resultaten. We voeren ook een ablatie-experiment uit om de prestaties te kennen met behulp van verschillende modellen voor het leren van sequenties. Het resultaat in tabel 4 laat zien dat het gebruik van LSTM, dat slechts informatie in één richting heeft, een lagere prestatie heeft dan het gebruik van Bi-LSTM, dat informatie in twee richtingen heeft.
Tabel 3. Vergelijking van WER-prestaties met behulp van verschillende late temporele aandachtsconfiguraties.

Tabel 4. WER-prestatievergelijking met behulp van verschillende configuraties voor het leren van sequenties.

4.7. Experimenteer op het STAMF-netwerk
In deze sectie leggen we het volledige trainingsproces uit voor ons voorgestelde model genaamd Spatiotemporal Attent Multi-Feature (STAMF). Dit behandelt stap voor stap hoe we onze invoergegevens in de ruimtelijke module, temporele module en sequentieleermodule passen. In deze sectie gebruiken we multi-stream input en late temporele aandachtsconfiguratie.
4.7.1. Implementatie Details
We voeren end-to-end training en testen uit met invoerframes met afmetingen 224 × 224. Voor de optimizer gebruiken we een Adam-optimizer met 10−4 als leersnelheid en delen deze door 2 in tijdperken 10 en 15 voor de CSL en tijdperken 30, 40 en 60 voor de RWTH PHOENIX. We stellen de batchgrootte in op 4 en voeren 80 tijdperken uit voor de RWTH-PHOENIX en 20 tijdperken voor CSL. De training en testen werden uitgevoerd op NVIDIA Tesla V100 en 128G RAM.
In eerste instantie hebben we de functie uit RGB-streams gehaald met ResNet50 en HRNet gebruikt om het keypoint te verkrijgen en vervolgens de keypoint-functies te extraheren met ResNet50. Merk op dat we te maken hadden met sequentiële gegevens of een video. Daarom moesten we onze invoergrootte configureren, afhankelijk van de lengte van de video. Om technische redenen moest de invoergrootte voor alle gegevens identiek aan elkaar zijn. Daarom moeten we de langste video in onze dataset kennen, daarna hebben we onze invoerframelengte opgevuld zodat deze overeenkomt met het grootste framenummer
Deze opeenvolgend geëxtraheerde functies werden gebruikt door de tijdelijke module. Elke sequentiële stroom ging door twee gestapelde tijdelijke pooling. Elke tijdelijke pooling bestond uit een 1-dimensionaal convolutienetwerk en een maximale poolinglaag, waardoor de lengte van de reeks met de helft afnam. De uitvoer van de tijdelijke pooling van beide streams werd vervolgens verbonden met de aandachtslaag en voor de laatste tijdelijke pooling, na de aandachtslaag, werd deze aan het einde samengevoegd als de uitvoer van de tijdelijke module.
De temporele uitvoer werd verwerkt door de sequentie-leermodule. Het proces gebruikte de Bi-LSTM-laag verbonden met de CTC om de uiteindelijke uitlijning te krijgen en de glans samen te stellen tot een laatste zin.
4.7.2. Kwantitatief resultaat
De laatste zinnen werden vergeleken met de grondwaarheid om de WER-score als kwantitatief resultaat te berekenen. Voor de CSL hebben we de dataset gesplitst in 80 procent voor de trainingsgegevens en 2{10}} procent voor de testgegevens. Zoals weergegeven in Tabel 5, kan ons voorgestelde multi-feature model (STMF) dat gebruik maakt van de full-frame en de keypoint-functies een beter resultaat behalen en de WER verlagen tot 0,8 in vergelijking met het model dat alleen de full-frame feature gebruikt [23]. Ons beste resultaat werd behaald door het voorgestelde multi-feature model met behulp van het aandachtsmechanisme (STAMF), dat 0,7 behaalde voor de WER. De attentielaag verbeterde het resultaat nog enigszins, ook al had de CSL-dataset geen defecte frames. Dit bewijst dat de aandachtslaag een impact heeft op het model. Het voorgestelde multi-feature model zelf is superieur aan de state-of-the-art methoden en de aandachtslaag draagt bij aan het verlagen van de WER-score op de CSL-dataset. Het belangrijkste punt op CSL heeft een aanzienlijke impact omdat het effectieve informatie kan geven in vergelijking met de andere methode met meerdere functies [17] die gebruik maakt van handen, gezicht en lichaamshouding.
Voor de RWTH-PHOENIX-dataset hebben we de kunstmatige configuratie gebruikt om de trainings- en testgegevens te splitsen. De dataset was verdeeld in 5672 voorbeeldvideo's voor training, 540 voorbeeldvideo's voor zelfvalidatie en 629 voorbeeldvideo's voor testen. Zoals weergegeven in Tabel 6, had ons voorgestelde multi-feature model (STMF) resultaat met behulp van de full-frame en de keypoint-functies 24 procent WER, en ons beste resultaat was 20,5 procent, verkregen door het voorgestelde model met behulp van de aandachtsmodule (STAMF) in het trainingsresultaat. De testresultaten zijn het op een na beste in vergelijking met [17] omdat ze meer functies als invoer gebruiken. Wel is gebleken dat de attentiemodule een significante bijdrage levert aan het verlagen van de WER-score voor de RWTHPHOENIX-dataset. Anders dan ons resultaat voor de CSL-dataset, leverde ons voorgestelde model met multi-stream geen optimaal resultaat op. Dit komt doordat de RWTH-PHOENIX-dataset veel defecte frames bevat; ze hebben een wazig deel, vooral in het handgebied. Dit frame geeft inconsistente keypoint-informatie door de ontbrekende of onjuiste keypoint-positie en maakt het model minder optimaal. Dit probleem wordt opgelost door de aandachtslaag toe te voegen aan ons voorgestelde multi-feature model, wat helpt om de juiste informatie te selecteren en resulteert in een significante verbetering in vergelijking met het voorgestelde multi-feature model zonder aandacht.
Tabel 5. Vergelijking van WER-prestaties op de CSL-dataset.

Tabel 6. WER Prestatievergelijking op de RWTH-PHOENIX dataset.

4.7.3. Kwalitatief resultaat
We hebben ook een kwalitatieve evaluatie van ons model uitgevoerd, met behulp van een visualisatie van het herkenningsresultaat. Figuur 8 toont de details van onze kwalitatieve evaluatie aan de hand van drie voorbeelden van zinnen. De eerste zin bestaat uit 10 woorden en het totale aantal frames is 220. De tweede zin bestaat uit 12 woorden en het totale aantal frames is 168. De derde zin bestaat uit 9 woorden en het totale aantal frames is 135.
Het voorbeeldresultaat laat zien dat sommige glossen niet correct worden voorspeld door de modellen, en we geven dit aan met de rode markering. Het kan echter nog steeds de meeste correcte woorden voorspellen. Het grootste aantal fouten zit in de eerste zin, die het langste framenummer heeft. In deze zin bevat het begin van de zin meer fouten, omdat verschillende gebaren voor de vroege woorden slechts een klein beetje verschillen, waardoor het moeilijk is om de grenzen te onderscheiden. Het voorgestelde model met meerdere functies en aandacht (STAMF) kon echter meer woorden identificeren, maar ze waren verkeerd gelabeld. Bovendien levert de modelconfiguratie met aandacht een beter herkenningsresultaat op voor nog eens twee monsters, in vergelijking met het voorgestelde model zonder aandacht.

Figuur 8. Kwalitatieve evaluatie van het herkenningsresultaat met een andere configuratie van de RWTH-PHOENIX dataset [33,39]. De verkeerd voorspelde glossen zijn rood gemarkeerd.
5. Conclusies
In dit artikel presenteren we een nieuwe spatiotemporele attente multi-feature (STAMF) voor CSLR, die tot doel heeft om ruimtelijk-temporele correlaties en de belangrijke informatie uit de reeks visuele kenmerken en keypoint-kenmerken in de end-to-end-benadering te leren. In ons raamwerk is een ruimtelijke module ontwikkeld met een full-frame feature van RGB-data en key points van de body key points, inclusief de handen als multi-features. Deze combinaties die werden gebruikt als multi-stream feature-invoer gaven superieure prestaties in vergelijking met de state-of-the-art benadering die alleen full-frame gebruikt of in vergelijking met de methode Afbeelding 8. Kwalitatieve evaluatie van het herkenningsresultaat met een andere configuratie van de RWTH -PHOENIX-gegevensset [33,39]. De verkeerd voorspelde glossen zijn rood gemarkeerd. 5. Conclusies In dit artikel presenteren we een nieuwe spatiotemporele attente multi-feature (STAMF) voor CSLR, die tot doel heeft om ruimtelijk-temporele correlaties en de belangrijke informatie uit de opeenvolging van visuele kenmerken en belangrijke puntkenmerken in de end-to- eind nadering. In ons raamwerk is een ruimtelijke module ontwikkeld met een full-frame feature van RGB-data en key points van de body key points, inclusief de handen als multi-features. Deze combinaties die werden gebruikt als multi-stream feature-invoer leverden superieure prestaties op in vergelijking met de state-of-the-art benadering die alleen full-frame gebruikt of in vergelijking met de methode die een andere multi-feature combinatie gebruikt, vooral voor de CSL-dataset. Vervolgens stellen we een tijdelijke module voor die bestaat uit tijdelijke pooling en tijdelijke aandacht om de belangrijke informatie in het tijdelijke domein vast te leggen. De toevoeging van late temporele aandacht is in staat om het belangrijke kenmerk uit de reeks te halen die onjuiste informatie bevat en geeft een aanzienlijke verbetering in vergelijking met ons voorgestelde model met meerdere functies. Het helpt ook het leren van sequenties om beter te leren en verbetert de prestaties zoals in het experiment van de CSL-dataset. Uitgebreide experimenten op veelgebruikte datasets tonen de superioriteit aan van ons voorgestelde model ten opzichte van het state-of-the-art model met WER-scores die met meer dan 50 procent afnemen voor de CSL-dataset en met 5 procent voor de RWTH-PHOENIX-dataset. In de toekomst zijn we van plan om de overdrachtsleertechniek te implementeren met ons huidige model en ons lopende werk toe te passen in een echte branche.
Referenties
1. Dreuw, P.; Rybach, D.; Deselaers, T.; Zahedi, M.; Ney, H. Spraakherkenningstechnieken voor een gebarentaalherkenningssysteem. In Proceedings of the INTERSPEECH 2007, 8e jaarlijkse conferentie van de International Speech Communication Association, Antwerpen, België, 27-31 augustus 2007; blz. 2513-2516.
2. Ong, SCW; Ranganath, S. Automatische gebarentaalanalyse: een onderzoek en de toekomst voorbij de lexicale betekenis. IEEE Trans. Patroon anaal. Mach. Intel. 2005, 27, 873-891. [Kruisreferentie] [PubMed]
3. Vogler, C.; Metaxas, D. Een raamwerk voor het herkennen van de gelijktijdige aspecten van Amerikaanse gebarentaal. Bereken. Vis. Afbeelding Onderst. 2001, 81, 358-384. [KruisRef]
4. Bowden, R.; Windridge, D.; Kadir, T.; Zisserman, A.; Brady, M. Een taalkenmerkvector voor de visuele interpretatie van gebarentaal. In Proceedings of the European Conference on Computer Vision (ECCV), Praag, Tsjechische Republiek, 11–14 mei 2004; blz. 390-401.
5. Kasukurthi, N.; Rokad, B.; Bidani, S.; Dennisan, DA American Sign Language Alphabet Recognition met behulp van Deep Learning. arXiv 2019, arXiv:1905.05487.
6. Koller, O.; Zargaran, S.; Ney, H.; Bowden, R. Deep Sign: robuuste statistische continue gebarentaalherkenning mogelijk maken via hybride CNN-HMM's. Int. J. Comput. Vis. 2018, 126, 1311-1325. [KruisRef]
7. Pu, J.; Zhou, W.; Li, H. Dilated Convolutional Network met iteratieve optimalisatie voor continue gebarentaalherkenning. In Proceedings of the Twenty-Seventh International Joint Conference on Artificial Intelligence, Stockholm, Zweden, 13–19 juli 2018; blz. 885-891.
8. Pu, J.; Zhou, W.; Li, H. Iteratief afstemmingsnetwerk voor continue gebarentaalherkenning. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, VS, 15–20 juni 2019; blz. 4160-4169.
9. Kumar, N. Op bewegingstraject gebaseerde tracking van menselijk gezicht en handen voor gebarentaalherkenning. In Proceedings of the 2017 4th IEEE Uttar Pradesh Section International Conference on Electrical, Computer and Electronics, Mathura, India, 26–28 oktober 2017; blz. 211-216.
10. Bhuyan, MK; Ghoah, D.; Bora, PK Een raamwerk voor handgebarenherkenning met toepassingen in gebarentaal. In Proceedings of the 2006 Annual India Conference, INDICON, New Delhi, India, 15–17 september 2006; blz. 1-6.
11. Das, SP; Talukdar, AK; Sarma, KK Gebarentaalherkenning met gezichtsuitdrukking. In Proceedings of the Procedia Computer Science, Kerala, India, 10–13 augustus 2015; blz. 210-216.
12. Rastgoo, R.; Kiani, K.; Escalera, S.; Sabokrou, M. Gebarentaalproductie: een overzicht. In Proceedings of the 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), Nashville, TN, VS, 19–25 juni 2021; blz. 3446-3456.
13. Dong, S.; Wang, P.; Abbas, K. Een onderzoek naar diep leren en de toepassingen ervan. Bereken. Wetenschap. Rev. 2021, 40, 100379. [CrossRef]
14. Athitsos, V.; Neidle, C.; Sclaroff, S.; Nash, J.; Stefan, A.; Yuan, Q.; Thangali, A. De American Sign Language Lexicon Video Dataset. In Proceedings of the 2008 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, CVPR Workshops, Anchorage, Alaska, 23–28 juni 2008; blz. 1-8.
15. Bungeroth, J.; Stein, D.; Dreuw, P.; Ney, H.; Morrissey, S.; Manier, A.; Zijl, LV Het ATIS-gebarentaalcorpus. In Proceedings of the 6th International Conference on Language Resources and Evaluation, LREC 2008, Marrakesh, Marokko, 28–30 mei 2008; blz. 2943-2946.
16. Papastratis, I.; Chatzikonstantinou, C.; Konstantinidis, D.; Dimitropoulos, K.; Daras, P. Kunstmatige intelligentietechnologieën voor gebarentaal. Sensoren 2021, 21, 5843. [CrossRef] [PubMed]
17. Zhou, H.; Zhou, W.; Zhou, Y.; Li, H. Ruimtelijk-temporeel multi-cue-netwerk voor continue gebarentaalherkenning. In Proceedings of the AAAI 2020—The Thirty-Fourth AAAI Conference on Artificial Intelligence, New York, NY, VS, 7–12 februari 2020; blz. 13009-13016.
18. Gündüz, C.; Polat, H. Turkse gebarentaalherkenning op basis van multistream datafusie. Turkse J. Elektr. Eng. Bereken. Wetenschap. 2021, 29, 1171–1186. [KruisRef]
19. Bohacek, M.; Hruz, M. Sign Pose-gebaseerde transformator voor gebarentaalherkenning op woordniveau. In Proceedings of the 2022 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops, WACVW, Waikoloa, HI, VS, 4–8 januari 2022; blz. 182-191.
20. Vaswani, A. Aandacht is alles wat je nodig hebt. In Proceedings of the Conference on Neural Information Processing Systems, Long Beach, CA, VS, 4–9 december 2017; blz. 1-11.
21. Zhou, M.; Ng, M.; Cai, Z.; Cheung, KC Op zichzelf gerichte, volledig inception-netwerken voor continue gebarentaalherkenning. Voorkant. Artef. Intel. Appl. 2020, 325, 2832-2839.
22. Camgoz, NC; Koller, O.; Hadfifield, S.; Bowden, R. Gebarentaaltransformatoren: gezamenlijke end-to-end gebarentaalherkenning en -vertaling. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Seattle, WA, VS, 14–19 juni 2020; blz. 10020-10030.
23. Min, Y.; Hao, A.; Chai, X.; Chen, X. Visuele uitlijningsbeperking voor continue gebarentaalherkenning. In Proceedings of the IEEE International Conference on Computer Vision (ICCV), Montreal, BC, Canada, 10–17 oktober 2021; blz. 11542-11551.
24. Guo, D.; Zhou, W.; Wang, M.; Li, H. Gebarentaalherkenning op basis van adaptieve HMM's met gegevensvergroting. In Proceedings of the IEEE International Conference on Image Processing (ICIP), Phoenix, AZ, VS, 25–28 september 2016; blz. 2876-2880.
25. Huang, J.; Zhou, W.; Li, H.; Li, W. Gebarentaalherkenning met behulp van 3D convolutionele neurale netwerken. In Proceedings of the IEEE International Conference on Multimedia and Expo (ICME), Turijn, Italië, 29 juni - 3 juli 2015; blz. 1-6.
26. Guo, D.; Zhou, W.; Li, H.; Wang, M. Online vroege-late fusie op basis van adaptieve HMM voor gebarentaalherkenning. ACM Trans. Multimed. Bereken. gemeenschappelijk. Appl. 2017, 14, 1–18. [KruisRef]
27. Al-hammadi, M.; Mohammed, G.; Lid, S. Herkenning van handgebaren voor gebarentaal met behulp van 3DCNN. IEEE-toegang 2020, 8, 79491-79509. [KruisRef]
28. Reza, H.; Joze, V. MS-ASL: een grootschalige dataset en benchmark voor het begrijpen van Amerikaanse gebarentaal. arXiv 2019, arXiv:1812.01053.
29. Li, D.; Opazo, CR; Yu, X.; Li, H. Diepe gebarentaalherkenning op woordniveau van video: een nieuwe grootschalige vergelijking van datasets en methoden. In Proceedings of the 2020 IEEE Winter Conference on Applications of Computer Vision, WACV, Snowmass Village, CO, VS, 1–5 maart 2020; blz. 1448-1458.
30. Pu, J.; Zhou, W.; Li, H. Gebarentaalherkenning met multimodale functies. In Proceedings of the Pacific Rim Conference on Multimedia, Xi'an, China, 15–16 september 2016; blz. 252-261.
31. Jiang, S.; zon, B.; Wang, L.; Baai, Y.; Li, K.; Fu, Y. Skeleton Aware Multimodale Gebarentaalherkenning. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, Nashville, TN, VS, 19–25 juni 2021; blz. 3408-3418.
32. Sidig, AAI; Luqman, H.; Mahmoud, S.; Mohandes, M. KArSL: database met Arabische gebarentaal. ACM Trans. Aziatische Low-Resour. Lang. Inf. Verwerking 2021, 20, 1–19. [KruisRef]
33. Koller, O.; Forster, J.; Ney, H. Continue gebarentaalherkenning: op weg naar statistische herkenningssystemen met een groot vocabulaire die meerdere ondertekenaars verwerken. Bereken. Vis. Afbeelding Onderst. 2015, 141, 108-125. [KruisRef]
34. Koller, O.; Camgoz, NC; Ney, H. Zwak begeleid leren met multi-stream CNN-LSTM-HMM's om sequentiële parallelliteit in gebarentaalvideo's te ontdekken. IEEE Trans. Patroon anaal. Mach. Intel. 2020, 42, 2306-2320. [Kruisreferentie] [PubMed]
35. Camgoz, NC; Hadfifield, S.; Koller, O.; Bowden, R. SubUNets: end-to-end handvorm en continue gebarentaalherkenning. In Proceedings of the 2017 IEEE International Conference on Computer Vision (ICCV), Venetië, Italië, 22–29 oktober 2017; blz. 3075-3084.
36.Dong, C.; Loy, CC; Hij, K.; Tang, X. Beeldsuperresolutie met behulp van diepe convolutionele netwerken. IEEE Trans. Patroon anaal. Mach. Intel. 2014, 38, 295-307. [Kruisreferentie] [PubMed]
37. Bressem, KK; Adams, LC; Erxleben, C.; Hamm, B.; Niehues, SM; Vahldiek, JL Vergelijking van verschillende deep learning-architecturen voor classificatie van thoraxfoto's. Wetenschap. Rep. 2020, 10, 13590. [CrossRef]
38. Zon, K.; Xiao, B.; Liu, D.; Wang, J. Deep High-resolution Representation Learning voor schatting van menselijke poses. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, VS, 15–20 juni 2019; blz. 5686-5696.
39. Koller, O.; Zargaran, S.; Ney, H. Re-Sign: opnieuw uitgelijnde end-to-end sequentiemodellering met diep terugkerende CNN-HMM's. In Proceedings of the 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Honululu, HI, VS, 21–26 juli 2017; blz. 3416-3424.
40. Zhou, H.; Zhou, W.; Li, H. Dynamische pseudo-labeldecodering voor continue gebarentaalherkenning. In Proceedings of the 2019 IEEE International Conference on Multimedia and Expo (ICME), Shanghai, China, 18–21 juli 2019; blz. 1282-1287.
41. Xiao, Q.; Chang, X.; Zhang, X.; Liu, X. Op video gebaseerde gebarentaalherkenning zonder temporele segmentatie. In Proceedings of the Thirty-Second AAAI Conference on Artificial Intelligence, New Orleans, LA, VS, 2–7 februari 2018; blz. 2257-2264.
42. Graven, A.; Fernandez, S.; Gomez, F.; Schmidhuber, J. Connectionistische tijdelijke classificatie: niet-gesegmenteerde sequentiegegevens labelen met terugkerende neurale netwerken. In Proceedings of the ICML '06: Proceedings of the 23rd international conference on Machine learning, Pittsburgh, PA, VS, 25–29 juni 2006; blz. 369-376.
43. Graven, A.; Liwicki, M.; Fernandez, S.; Bertolami, R.; Bunke, H.; Schmidhuber, J. Een nieuw connectionistisch systeem voor onbeperkte handschriftherkenning. IEEE Trans. Patroon anaal. Mach. Intel. 2009, 31, 855–868. [KruisRef]
44. Guo, D.; Zhou, W.; Li, H.; Wang, M. Hiërarchische LSTM voor gebarentaalvertaling. In Proceedings of the AAAI Conference on Artificial Intelligence, New Orleans, LA, VS, 2–7 februari 2018; blz. 6845-6852.
45. Rahman, MM; Watanobe, Y.; Nakamura, K. Een bidirectioneel LSTM-taalmodel voor code-evaluatie en -reparatie. Symmetrie 2021, 13, 247. [CrossRef]
46. Hu, W.; Cai, M.; Chen, K.; Ding, H.; zon, L.; Liang, S.; Mo, X.; Huo, Q. Sequence Discriminative Training voor offline handschriftherkenning door een geïnterpoleerde CTC en roostervrije MMI-objectieve functie. In Proceedings of the International Conference on Document Analysis and Recognition, ICDAR, Kyoto, Japan, 9–15 november 2017; Deel 1, blz. 61-66.
47. Yoshimura, T.; Hayashi, T.; Takeda, K.; Watanabe, S. End-to-end automatische spraakherkenning geïntegreerd met op CTC gebaseerde detectie van spraakactiviteit. In Proceedings of the ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing, Barcelona, Spanje, 4–8 mei 2020; blz. 6999-7003.
48. Guo, D.; Wang, S.; Tian, Q.; Wang, M. Dense Temporal Convolution Network voor gebarentaalvertaling. In Proceedings of the Twenty-Eightth International Joint Conference on Artificial Intelligence (IJCAI-19), Macao, China, 10–16 augustus 2017; blz. 744-750.
49. Wang, S.; Guo, D.; Zhou, W.; Zha, Z.; Wang, M. Connectionist Temporal Fusion voor gebarentaalvertaling. In Proceedings of the 26th ACM International Conference on Multimedia, Seoul, Korea, 22–26 oktober 2018; blz. 1483-1491.
50. Yang, Z.; Shi, Z. SF-Net: gestructureerd functienetwerk voor continue gebarentaalherkenning. arXiv 2019, arXiv:1908.01341.
51. Cheng, KL; Yang, Z.; Chen, Q.; Tai, Y. Volledig convolutionele netwerken voor continue gebarentaalherkenning. In Proceedings of the European Conference on Computer Vision, Glasgow, VK, 23–28 augustus 2020; blz. 697-714.
52. Koller, O.; Ney, H.; Bowden, R. Deep Hand: hoe een CNN te trainen op 1 miljoen handbeelden wanneer uw gegevens continu en zwak gelabeld zijn. In Proceedings of the 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, VS, 27–30 juni 2016; blz. 3793-3802.
53. Slimane, FB Context doet ertoe: zelfaandacht voor gebarentaalherkenning. arXiv 2021, arXiv:2101.04632.
54. Niu, Z.; Mak, B. Stochastische fijnkorrelige labeling van multi-state tekenglans voor continue gebarentaalherkenning. In Proceedings of the European Conference on Computer Vision, Glasgow, VK, 23–28 augustus 2020; blz. 1-16.
55. Cui, R.; Liu, H.; Zhang, C. Een diep neuraal raamwerk voor continue gebarentaalherkenning door iteratieve training. IEEE Trans. Multimed. 2019, 21, 1880-1891. [KruisRef]
56. Pu, J.; Zhou, W.; Hu, H.; Li, H. Stimuleren van continue gebarentaalherkenning via cross-modaliteitsvergroting. In Proceedings of the 28th ACM International Conference on Multimedia, Seattle, WA, VS, 12–16 oktober 2020; blz. 1497-1505.






