Novo prostorno-vremensko kontinuirano prepoznavanje znakovnog jezika upotrebom pažljive mreže s više značajki (1)

Jun 01, 2023

Sažetak: S obzirom na video streamove, cilj nam je ispravno detektirati nesegmentirane znakove povezane s kontinuiranim prepoznavanjem znakovnog jezika (CSLR). Unatoč porastu predloženih metoda dubokog učenja u ovom području, većina njih uglavnom se usredotočuje na korištenje samo RGB značajke, bilo slike u punom kadru ili detalja ruku i lica. Oskudica informacija za proces obuke CSLR-a uvelike ograničava sposobnost učenja višestrukih značajki korištenjem video ulaznih okvira. Štoviše, iskorištavanje svih okvira u videu za CSLR zadatak moglo bi dovesti do suboptimalnih performansi jer svaki okvir sadrži različitu razinu informacija, uključujući glavne značajke u zaključivanju šuma. Stoga predlažemo novo prostorno-vremensko kontinuirano prepoznavanje znakovnog jezika korištenjem pažljive mreže s više značajki za poboljšanje CSLR-a pružanjem dodatnih značajki ključnih točaka. Osim toga, iskorištavamo sloj pažnje u prostornim i vremenskim modulima kako bismo istovremeno naglasili više važnih značajki. Eksperimentalni rezultati iz oba CSLR skupa podataka pokazuju da predložena metoda postiže superiornu izvedbu u usporedbi s trenutnim najsuvremenijim metodama za 0.76 i 20.56 za WER rezultat na CSL i PHOENIX skupovima podataka, redom.

Desert living cistanche

Superman bilje cistanche

Ključne riječi: kontinuirani znakovni jezik; prostorni; temporalni; višestruka značajka; ključne točke; samopažnja

1. Uvod

Znakovni jezik daje prednost ručnoj komunikaciji korištenjem gestikulacija rukama, govora tijela i pokreta usana umjesto zvuka za komunikaciju [1,2]. Znakovni jezik obično koriste osobe koje su gluhe ili nagluhe, ali se može koristiti iu situacijama kada je nemoguće ili teško čuti zvukove. Stoga je potreban sustav za prepoznavanje znakovnog jezika (SLR) jer pomaže u povezivanju ljudi koji imaju oštećenje sluha i onih koji ne čuju.

Posljednjih su godina istraživači usmjerili veliku pozornost na SLR fotoaparate zbog bogatih vizualnih informacija koje pruža. Nedavne SLR studije obično se grupiraju u izolirano prepoznavanje znakovnog jezika (ISLR) ili kontinuirano prepoznavanje znakovnog jezika (CSLR). Nekoliko radova bavi se samo ISLR [3,4], dok drugi analiziraju samo lakše zadatke, kao što su statične geste za prepoznavanje abecede [5]. U međuvremenu, najnovije metode obično su kompliciranije jer rješavaju CSLR zadatke [6-8]. U usporedbi s ISLR-om, CSLR je zahtjevniji problem jer uključuje rekonstrukciju rečenica.

Cistanche tea2

Cistanche čaj

Kliknite ovdje za pregled proizvoda od čaja Cistanche deserticola

【Tražite više】 E-pošta:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Istraživanje CSLR-a i dalje je vrlo traženo jer je njegova provedba usko povezana sa svakodnevnim uvjetima u stvarnom svijetu. Ovaj pristup ima za cilj prepoznati niz sjaja koji se pojavljuju u video nizu bez jasne segmentacije ili je uopće nema. Nadalje, uključuje velik dio istraživanja strojnog učenja i temeljito razumijevanje ljudskog ponašanja. Na primjer, uključuje praćenje ljudskih pokreta [9], prepoznavanje gesta [10] i prepoznavanje lica [11]. Unatoč tome, postoji nekoliko izazova u obavljanju CSLR zadataka.

Prvo, prikupljanje podataka i označavanje su skupi za CSLR [12]. Ovo je možda jedan od izazova s ​​kojima se suočava u svom razvoju budući da je CSLR uključen u veliku mrežu i količina podataka snažno utječe na performanse [13]. Štoviše, nekoliko dostupnih skupova podataka za znakovni jezik slabo su označeni [12,14,15]. Kako bi se riješio ovaj problem, brojne su studije koristile slabo nadzirani pristup, uz primjenu modula za usklađivanje i izdvajanje značajki na mrežnu arhitekturu [12].

Drugo, u usporedbi s ISLR-om, CSLR je kompliciraniji. Dovoljno informacija dobiva se korištenjem nekoliko značajki; dokazano je da se time postižu bolje performanse od korištenja jedne značajke kako je navedeno u prethodnim radovima [16-18]. Ove višestruke značajke sastoje se od glavne značajke koja je slika tijela koja postiže najveću točnost i dodatnih značajki, kao što su poza, glava, lijeva ruka i desna ruka, koja ima manju točnost za individualnu izvedbu [17,18]. Osposobljavanje velike mreže s velikom količinom podataka zahtijeva puno vremena [13]. Dodavanje ulaznog toka također povećava vrijeme obuke, dok korištenje dodatnih značajki temeljenih na slici povećava trošak [19]. Stoga moramo odabrati važne značajke kako bismo mogli učinkovito trenirati.

Cistanche deserticola slice (1)

Kineska biljka cistanche

Treće, video ulaz ima veliki broj slika u nizu. Neke slike imaju nejasan oblik ruke zbog brzog pokreta, što može dovesti do netočnih informacija. Stoga naš predloženi model koristi samopažnju temeljenu na [20] kako bi pomogao u odabiru važnih informacija. Štoviše, samopažnja dokazana u [21,22] ima utjecaj na poboljšanje performansi.

Stoga predlažemo novi model koji se zove nova prostorno-vremenska pažljiva višestruka značajka (STAMF) za rješavanje svih problema. Pratili smo prethodne radove [17,23], za koje je dokazano da rade za CSLR sa slabim problemima označavanja. Oni konstruiraju model koristeći tri glavne komponente: prva je prostorni modul, druga je vremenski modul, a treća je modul učenja slijeda. Predlažemo učinkovit i djelotvoran unos s više značajki koristeći značajku punog okvira zajedno sa značajkama ključnih točaka za izvođenje CSLR zadataka. Značajka punog kadra predstavlja sliku tijela kao glavnu značajku, a značajke ključnih točaka kao dodatnu značajku. Ključna značajka je poza tijela, uključujući detalj poze ruku. Ova poza tijela najučinkovitija je dodatna značajka jer je u nekim radovima dokazano da postiže najveću točnost nakon značajke punog kadra [17,18]. Također koristimo modul pažnje koji koristi samopažnju temeljen na [20] kako bismo uhvatili važnu značajku i pomogli u učenju slijeda da poboljša izvedbu.

Doprinos ovog rukopisa sažet je na sljedeći način: • Uvodimo novu temporalnu pozornost u modul sekvence kako bismo uhvatili važne vremenske točke koje pridonose konačnom rezultatu; • Predstavljamo višestruku značajku koja se sastoji od značajke punog kadra iz RGB vrijednosti okvira kao glavne značajke i značajki ključnih točaka koje uključuju pozu tijela s detaljima u obliku ruke kao dodatnu značajku za poboljšanje performansi prepoznavanja modela; • Koristimo metriku WER kako bismo pokazali da naš predloženi STAMF model nadmašuje najsuvremenije modele na oba CSLR referentna skupa podataka kroz eksperimente.

cistanche—Improve memory4

Suplement Cistanche blizu mene-poboljšava pamćenje

2. Srodni radovi

Došlo je do nekoliko napretka u tehnologiji, a o SLR-u je provedeno mnogo istraživanja. Prethodne studije [24-27] istraživale su mogućnost korištenja ISLR-a koji ima segmentaciju za svaku riječ. Posljednjih godina, metode temeljene na dubokom učenju korištene su za izdvajanje značajki korištenjem konvolucijskih mreža, bilo 2D [28,29] ili 3D [30,31], za njihovo snažno vizualno predstavljanje. Većina ranih istraživanja o prepoznavanju znakovnog jezika bila je usredotočena na ISLR s multimodalnim karakteristikama [30-32], kao što su RGB, mape dubine i kosturi, koji daju bolju izvedbu.

Danas je CSLR postao popularniji, iako nije jasno segmentiran između svake riječi. Rani radovi koriste CNN-ov alat za izvlačenje značajki [6,33] i HMM [34] za izradu ciljne sekvence. Neka nedavna istraživanja za CSLR sustave [17,23] uključila su tri glavna koraka u obavljanju zadatka prepoznavanja problema. Prvo su proveli ekstrakciju prostornih značajki, zatim vremensku segmentaciju i na kraju sintezu rečenice s jezičnim modelom [35] ili su koristili učenje sekvenci [17,23]. Ovo učenje sekvence koristilo je Bi-LSTM i CTC za istraživanje odnosa između sjaja znakova u video sekvencama. Iako koristi slabu napomenu koja ima nesegmentirane video sekvence za definiranje sjaja znakova, ovi su pristupi pokazali obećavajuće rezultate.

Međutim, najnovija povezana CLSR studija koja je implementirala pristup s više značajki [17] koristila je pet značajki istovremeno. Pristup s više značajki je teži u usporedbi s korištenjem manje značajki [19]. Ovaj pristup također ne može podnijeti okvire s šumom iz video sekvence koji imaju nejasne informacije, poput mutnog oblika ruke zbog brzog kretanja. Štoviše, oslanjanje na učenje sekvenci temeljeno na RNN-u može naići na probleme s dugim sekvencama i može izgubiti globalni kontekst [20].

cistanche—Improve memory3

Suplement Cistanche blizu mene-poboljšava pamćenje

Trenutno istraživanje ima za cilj poboljšati izvedbu dodavanjem mehanizma samopažnje [21,22] koji može obraditi dulje sekvence za učenje globalnog konteksta. Pažnja na sebe temelji se na ranim istraživanjima [20] koja su pokazala da pažnja na sebe ima prednost jer se može nositi s dugim ovisnostima. Međutim, ovu samopažnju lakše je naučiti kraćim putem u usporedbi s dužim putem s dugim ovisnostima. U prethodnim radovima CLSR-a [21,22] samopažnja bi mogla pomoći mreži da učinkovitije nauči značajku.

Stoga u ovom radu predstavljamo novi prostorno-vremenski model s više značajki. Ovaj predloženi model učinkovito izvlači važne značajke i bolje uči slijed davanjem važnih informacija pomoću mehanizma samopažnje iz više značajki. Svi se procesi izvode u pristupu od kraja do kraja.

3. Predložena metoda

Ovaj odjeljak detaljno opisuje temeljne tehnike našeg predloženog modela za CSLR. Stoga ovaj odjeljak započinjemo objašnjavanjem pregleda predloženog modela. Osim toga, pružamo više pojedinosti o svakoj ključnoj komponenti, uključujući prostorni modul, vremenski modul i modul učenja slijeda. Osim toga, također objašnjavamo naš predloženi modul pažnje kako bismo pomogli modelu da bolje uči. Konačno, možemo integrirati okvir za obuku i zaključivanje u naš predloženi model.

3.1. Pregled okvira

S obzirom na video ulaz, naš predloženi model ima za cilj predvidjeti odgovarajući znak u ispravnu gloss rečenicu. Prvi modul generira više prostornih značajki, kao što su značajke punog kadra i ključne točke za svaki T okvir videa. Zatim nam vremenski modul omogućuje izvlačenje vremenskih korelacija prostornih značajki između okvira za oba toka. Kao posljednji korak, prostorne i vremenske mreže povezane su s dvosmjernim dugotrajnim pamćenjem (Bi-LSTM) i CTC za učenje slijeda i zaključivanje. Zatim detaljnije i uzastopno objašnjavamo naše glavne komponente. Pregled naše predložene arhitekture prikazan je na slici 1.

Figure 1


Slika 1. Cjelokupna arhitektura predložene metode sastoji se od tri komponente: prostornog modula, vremenskog modula i modula učenja slijeda. Prostorni modul prvo uzima sekvencu slike za izdvajanje okvirnih značajki, a zatim primjenjuje vremenski modul za izdvajanje vremenskih značajki. Zatim se vremenske značajke šalju modulu za učenje niza kako bi izvršio predviđanje riječi i konstruirao je u rečenicu

3.2. Prostorni modul

Prostorni modul iskorištava značajku punog kadra i značajke ključnih točaka, kao što je prikazano na slici 2. Ovaj modul koristi 2D-CNN mrežnu arhitekturu kao okosnicu, a ResNet50 je odabran za snimanje višestrukih značajki. ResNet50 je učinkovitiji za korištenje u usporedbi s nedavnom ResNet arhitekturom u smislu vremena, a ima usporediv rezultat [36,37]. RGB izravno koristi ResNet50, dok ključnu točku dobiva HRNet [38] iz video okvira i izdvaja se pomoću ResNet50 da bi se dobile značajke ključne točke.

Figure 2


Slika 2. Arhitektura prostornog modula koristi multi-stream ulaz. RGB stream kao značajka punog kadra i stream ključnih točaka kao značajka ključnih točaka.

3.2.1. Značajka punog okvira

Primijenili smo naše korake pretprocesiranja na RGB podatke, a zatim unijeli naše podatke u model. Zatim ih stavljamo kao full-frame input u našu arhitekturu. Slika 3 prikazuje ilustraciju izvorne RGB slike s lijeve strane i izrezane slike s desne strane. Izrezanu sliku model koristi kao ulaz. Ovo ilustrira korak predobrade koji smanjuje manje važne dijelove slike i stavlja veći fokus na potpisnika. Ovo izrezivanje koristi metodu nasumičnog izrezivanja iz [12] za povećanje skupa podataka. Značajka punog okvira izdvaja se iz izrezane slike za svaki okvir u nizu pomoću ResNet50.

Figure 3


Slika 3. Značajka punog kadra koja koristi RGB sliku, (lijeva slika) je izvorna slika, a (desna slika) je izrezana slika za prilagodbu s predloženim modelom

3.2.2. Značajke ključnih točaka

Izdvojili smo značajke ključnih točaka u prostornom modulu iz podataka RGB za svaki okvir u video ulazu. Kvaliteta značajki ključnih točaka ima važnu ulogu u našem predloženom modelu, tako da moramo koristiti robustan pristup, kao što je HRNet [38]. Upotrijebili smo prethodno obučeni HRNet [38] za procjenu svih 133 ključne točke tijela, a upotrijebili smo 27 od 133 ključne točke iz njegovih rezultata. Kao što je prikazano na slici 4, lijeva strana je izvorna ključna točka gornjeg dijela tijela, a desna strana je odabranih 27 ključnih točaka gornjeg dijela tijela. Ovih 27 ključnih točaka uključuje zapešća, laktove, ramena, vrat, ruke i prste.

Figure 4


Slika 4. Značajke ključnih točaka skupa podataka PHOENIX-RWTH [33,39], (lijeva slika) ekstrakcija iz RGB slike, a (desna slika) je odabrana ključna točka koju koristi predloženi model.

3.3. Vremenski modul

Vremenski modul ima za cilj naučiti prostorno-vremenske informacije iz prostornog modula. Vremenski moduli konstruirani su naslaganim vremenskim skupljanjem za svaki tok. Kao što je prikazano na slici 5, modul Temporal pooling sastoji se od sloja vremenske konvolucije i sloja skupljanja za izdvajanje značajki iz sekvencijalnih ulaza.

Figure 5.


Slika 5. Arhitektura vremenskog modula sastoji se od naslaganog 1D-CNN-a i sloja za udruživanje u koji je ugrađen modul pažnje. Radite paralelno za oba toka značajki povezanih na kraju naslaganih slojeva i proizvedite jednu vremensku značajku s četiri puta manjom dužinom sekvence.

Ulaz je popis prostornih višeznačajki iz prethodne faze. Vremenska značajka dobiva se korištenjem sloja vremenske konvolucije koji je jedan 1D konvolucijski sloj s istim ulaznim i izlaznim duljinama, nakon čega slijedi jedan sloj za udruživanje koji smanjuje veličinu na pola. Korištenje ova dva naslagana sloja vremenskog udruživanja je najbolja konfiguracija, prema prethodnim radovima [12]. Nakon svakog vremenskog skupljanja, ugrađujemo modul pažnje koji će biti detaljno objašnjen u odjeljku 3.4. Na kraju spajamo izlaz vremenskog udruživanja iz oba toka.

3.4. Modul pažnje

Video ima više okvira u kojima su neki dijelovi slike ponekad mutni. Skup podataka RTWH-PHOENIX [33,39] ima više neispravnih okvira nego skup podataka CSL [8,40,41]. To se događa kada je kretanje prebrzo, stvarajući mutnu sliku i rezultirajući pogrešnom lokacijom ključne točke. Ovaj se okvir smatra neispravnim i potencijalno dovodi do pogrešnog tumačenja značajki RGB-a i ključnih točaka. Slika 6 prikazuje ilustraciju neispravnih okvira u skupu podataka RTWH-PHOENIX [33]. Kako bismo riješili ovaj problem, dodali smo sloj pažnje.

Figure 6


Slika 6. Ilustracija defektnih okvira na skupu podataka RWTH-PHOENIX [33,39]. Neke od ključnih točaka u području ruku su u pogrešnom položaju zbog mutnih slika.

Korištenjem CTC algoritma, poravnanje staze zajedno s njezinim označavanjem izvodi se korištenjem prazne oznake i uklanjanjem ponovljenih oznaka. CTC radije predviđa prazne naljepnice nego granice sjaja kada ne može razlikovati granicu sjaja, ali niti jedan od rezultata nije uvjerljiv. To navodi mrežu da koristi CTC za stvaranje skokova u rezultatima pri analizi, učenju i predviđanju [42,43]. Općenito, gubitak CTC-a traži ključne okvire, a posljednji rezultat je predviđanje određenog ključnog okvira za koji postoji velika vjerojatnost da je prazna oznaka ili neprazna oznaka. Ako sjaj predviđa istu oznaku ili praznu oznaku uzastopno, to rezultira istim rezultatom. Međutim, ako postoji oznaka za umetanje između iste oznake, čak i ako postoji samo jedna pogreška, to rezultira puno većim gubitkom. Ovdje dodavanje sloja pažnje pomaže u odabiru važnog vremenskog slijeda prije nego što se koristi za sekvencijalno učenje.

Modul pažnje koristi mehanizam samopažnje s više glava [20]. Modul s više glava koristi se za pokretanje nekoliko paralelnih mehanizama pažnje u isto vrijeme. Pozornost s više glava odvija se neovisno kako bi se usredotočila na kratkoročne ovisnosti ili dugoročne ovisnosti u zasebnoj glavi. Svaki se izlaz zatim linearno povezuje i transformira u željeni oblik.

Istodobno, mehanizam samopažnje s više glava brine o informacijama iz višestrukih podprostora reprezentacije, ovisno o povijesti opažanja. Radi jednostavnosti, označavamo ulazne sekvence kao X. Matematički, za model pažnje s jednom glavom, dan je ulaz X t − T plus 1:t=[X t − T plus 1, · · ·, X t ] ∈ RT × N × P, dobivena su tri potprostora, i to upitni potprostor Q ∈ RN × dq, ključni potprostor K ∈ RN × dk i vrijednosni potprostor V ∈ RN × dv. Latentni proces učenja potprostora može se formulirati kao [20]:

Q=XWQ, K=XWK , V=XWV ,

Zatim se skalirana pažnja točkastog produkta koristi za izračun izlazne pažnje kao [20]:

Pažnja (Q, K, V)=pa f tmaxQKT/ p dkV,

Nadalje, ako imamo više glava koje istovremeno prate višestruke prikaze ulaza, možemo dobiti relevantnije rezultate u isto vrijeme. Posljednji korak je spojiti sve glave i ponovno ih projicirati kako bi se izračunao konačni rezultat [20]:

MultiHead(Q,K,V)=Concat(glava1,... , heads )WO,

glava=Pažnja(Qi,Ki,Vi),

gdje su Qi=XWQ i, Ki=XWVi i WO ∈ R hd × dmodel. Konačno, može odabrati važan dio iz niza značajki jer nisu sve informacije u nizu važne.

Kao što je prikazano na slici 7, koristimo modul pažnje u nekoliko konfiguracija. Prvi modul pažnje nalazi se na kraju prostornog modula, dok se drugi i treći modul pažnje nalaze u vremenskom modulu. Drugi modul pažnje koji se naziva rani temporalni modul, postavlja se nakon prvog bloka vremenskog skupljanja kao ulaz, dok se treći temporalni modul pažnje, naziva kasni temporalni modul pažnje, postavlja nakon drugog bloka vremenskog skupljanja.

Figure 7

Slika 7. Moduli pozornosti ugrađeni su u prostorne i vremenske module u različitim konfiguracijama.

Mogli biste i voljeti