Istraživanje transformatora vida sa samonadzorom za prepoznavanje hoda u divljini 1. dio

Nov 24, 2023

Sažetak:

Način hoda (hod) moćna je biometrija koja se koristi kao jedinstvena metoda uzimanja otisaka prstiju, omogućujući nenametljivu analitiku ponašanja na daljinu bez suradnje subjekta.

Svi znamo da vježbanje pomaže dobrom zdravlju. Osim toga, tjelovježba također pomaže u poboljšanju pamćenja. Hodanje je najjednostavniji i najlakši oblik tjelovježbe za vježbanje, a mnogi ljudi uživaju u opuštanju tijekom hodanja ili trčanja. Sada više istraživanja pokazuje da hodanje čini moćne stvari za mozak.

Prvo, hodanje stimulira živčani sustav mozga, što pomaže u jačanju funkcije mozga. Kada se tijelo kreće, naš otkucaj srca i protok krvi se povećavaju, što također stimulira mozak da proizvodi više neurona i sinapsi. Veze između tih neurona i sinapsi mogu stvoriti nove neuronske mreže i brže misaone procese.

Drugo, hodanje može ublažiti stres i tjeskobu, što je vrlo važno za poboljšanje pamćenja. Kada su um i tijelo u stanju napetosti, depresije ili tjeskobe, mozak oslobađa hormon koji se zove kortizol. Kortizol oštećuje neurone i sinapse u mozgu, što može dovesti do gubitka pamćenja. Hodanje ublažava stres i tjeskobu, smanjuje proizvodnju kortizola u tijelu i pomaže u održavanju zdravih neurona i sinapsi.

Konačno, hodanje povećava cirkulaciju krvi u mozgu. Neka istraživanja pokazuju da dobra cirkulacija krvi može poboljšati pamćenje. Kako starimo, krvne žile u mozgu postupno se začepljuju, što dovodi do nedovoljne opskrbe mozga kisikom. Hodanje može poboljšati zdravlje srca, dopuštajući srcu da učinkovitije isporučuje kisik i hranjive tvari mozgu, čime se potiče pamćenje i rad mozga.

Stoga je hodanje odličan oblik tjelovježbe i za mlade i za starije. Osim poboljšanja fizičkog zdravlja, hodanje također može pomoći u poboljšanju pamćenja. Prijeđimo put svaki dan kako bismo bili zdraviji i bolji! Vidi se da moramo poboljšati pamćenje, a Cistanche deserticola može značajno poboljšati pamćenje jer je Cistanche deserticola tradicionalni kineski ljekoviti materijal koji ima mnogo jedinstvenih učinaka, a jedno od njih je i poboljšanje pamćenja. Djelotvornost mljevenog mesa dolazi od raznih aktivnih sastojaka koje sadrži, uključujući kiseline, polisaharide, flavonoide itd. Ovi sastojci mogu na različite načine promicati zdravlje mozga.

improve memory

Kliknite na 10 načina za poboljšanje pamćenja

Za razliku od tradicionalnijih biometrijskih metoda autentifikacije, analiza hoda ne zahtijeva eksplicitnu suradnju subjekta i može se izvesti u postavkama niske razlučivosti, bez potrebe da lice subjekta bude neometano/vidljivo. Većina aktualnih pristupa razvijena je u kontroliranom okruženju, s čistim podacima označenim zlatnim standardom, koji su potaknuli razvoj neuronskih arhitektura za prepoznavanje i klasifikaciju.

Tek se nedavno analiza hoda usudila koristiti raznolikije, opsežnije i realističnije skupove podataka za unaprijed obučene mreže na samonadzoran način. Režim samonadzora treninga omogućuje učenje raznolikih i robusnih prikaza hoda bez skupih ručnih ljudskih bilješki. Potaknuti sveprisutnom upotrebom modela transformatora u svim područjima dubinskog učenja, uključujući računalni vid, u ovom radu istražujemo upotrebu pet različitih arhitektura transformatora vida izravno primijenjenih na samonadzorno prepoznavanje hoda.

Prilagođavamo i ponovno obučavamo jednostavne ViT, CaiT, CrossFormer, Token2Token i TwinsSVT na dva različita velika skupa podataka o hodu: GREW i DenseGait. Pružamo opsežne rezultate za zero-shot i fino podešavanje na dva referentna skupa podataka za prepoznavanje hoda, CASIA-B i FVG, i istražujemo odnos između količine prostornih i vremenskih informacija o hodu koje koristi vizualni transformator.

Naši rezultati pokazuju da dizajniranje transformatorskih modela za obradu gibanja koristi hijerarhijski pristup (tj. CrossFormer modele) na sajmovima finijeg kretanja relativno bolje od prethodnih pristupa cijelom kosturu.

Ključne riječi:

prepoznavanje hoda; biometrijska autentifikacija; transformator vida; procjena poze; samonadzorno učenje; kontrastivno učenje.

1. Uvod

Način na koji se krećemo sadrži značajne tragove o nama samima. Posebno je naš hod (način hodanja) pomno proučavan u medicini [1], psihologiji [2] i sportskoj znanosti [3]. Nedavno je analiza hoda dobila povećanu pozornost [4,5] zajednice računalnih znanosti što se podudara s eksponencijalnim napretkom dubokog učenja i širokom dostupnošću računalnog hardvera.

Sustavi za analizu hoda pokretani AI-om uspjeli su uspješno prepoznati subjekte [6-10], procijeniti demografske podatke kao što su spol i dob [11] i procijeniti vanjske atribute kao što je odjeća [12], bez korištenja ikakvih znakova vanjskog izgleda. Ovi rezultati nisu iznenađujući, s obzirom na veliku količinu individualnih razlika u hodu, koje su posljedica razlika u strukturi mišićno-koštanog sustava, genetskih i okolišnih čimbenika, kao i emocionalnog stanja i osobnosti hodača [13].

Trenutačni sustavi stvarno su uvježbani i testirani samo u kontroliranim zatvorenim okruženjima. Većina metoda koristi skup podataka CASIA-B [6] kao standardnu ​​referentnu vrijednost za modele prepoznavanja hoda, koji sadrži 124 subjekta koji hodaju u zatvorenom prostoru na strogo kontroliran način snimljen s više kamera. Složenost u stvarnom svijetu ne može se u potpunosti modelirati takvim suzdržanim scenarijima. Nedavno je fokus bio na modeliranju hoda "u divljini", sa skupovima podataka kao što su DenseGait [12], GREW [7] i Gait3D [14].

short term memory how to improve

Prikupljanje opsežnog skupa podataka koji je čist i potpuno označen predstavlja ogroman napor u smislu financijskih sredstava i dodijeljenog vremena. Skup podataka GREW [7] navodno je trebao 3 mjeseca neprekidnog rada da se prikupi i označi. Dok su takvi pristupi bili korisni u razvoju neuronskih arhitektura za obradu hoda [8,9], nisu dovoljno raznoliki da bi se pravilno koristili u opuštenijim, stvarnim okruženjima.

Zajednica umjetne inteligencije polako se udaljava od ovog pristupa u drugim područjima, s metodama za samonadzorno učenje za vid [15] i jezik [16] koje dobivaju značajnu privlačnost i često nadmašuju tradicionalne nadzirane metode. Nedavni napredak u samonadzornom učenju pokazao je da su samonadzorni modeli robusniji i da pokazuju nova ponašanja, koja nisu eksplicitno definirana tijekom obuke.

Na primjer, DINO [17], transformator vida obučen u režimu samonadzora, naučio je značajke specifične za klasu koje omogućuju segmentaciju objekata bez nadzora bez korištenja takvih oznaka tijekom obuke. Cosmaand Radoi [10] je predložio prvu kontrastivnu metodu za samonadzorno učenje za gaitanalysis, treniranjem ST-GCN [18] na manjoj verziji DenseGait [12]. Njihova je metoda dala razumne rezultate na zadacima prepoznavanja hoda nizvodno i pokazala da postoji jaka korelacija između veličine prethodno obučenog skupa podataka i izvedbe zero-shot prijenosa.

Dok mnogi pristupi analizi hoda koriste siluete izvučene iz pozadinskog oduzimanja [6,8,9], izdvajanje silueta u stvarnim scenarijima nadzora podrazumijeva upotrebu naprednijih tehnika, kao što je segmentacija instanci [19], što ima visoku računsku cijenu. Nizovi silueta zauzimaju značajan prostor za pohranjivanje i nisu dovoljno fleksibilni da bi se koristili u drugim susjednim zadacima, kao što je prepoznavanje aktivnosti. Štoviše, siluete kodiraju suptilne znakove izgleda, zbog čega nije jasno u kojoj se mjeri pokret koristi u identifikaciji [20].

S druge strane, 2D modeli za procjenu položaja postali su sve točniji i računalno učinkovitiji [21,22]. Kosturi su jeftini za izdvajanje i trenutno su pouzdaniji od 3D mreža i 3D poza, posebno na daljinu. Štoviše, 2D kosturi znatno su lakši od silueta u smislu dugotrajne pohrane.

Trenutne arhitekture za obradu nizova kostura koriste strukturu prirodnog prostornog grafa prisutnu u ljudskom kosturu, uvodeći induktivnu pristranost u dizajn modela. Modeli kao što su popularni ST-GCN [18] i MS-G3D [23] imaju impresivne rezultate za prepoznavanje radnji na temelju kostura.

Istodobno, došlo je do eksplozije u korištenju transformatorskih modela u gotovo svim područjima dubokog učenja od njihove početne primjene za obradu prirodnog jezika.

Transformatori se smatraju općenitijom arhitekturom, s nekoliko induktivnih predrasuda. U početku, transformatori su se borili za usklađivanje s CNN modelima za klasifikaciju slika [24], ali trenutno nadmašuju druge modele i pokazuju obećavajuće rezultate u samonadzornim scenarijima, više nego druge vrste arhitektura, transformatori su pokazali impresivnu sposobnost učenja i pojavno ponašanje pod samim sobom -nadzor [17].

Cosma i Radoi [12] bili su prvi koji su predložili GaitFormer, izravnu prilagodbu modela kodera transformatora vida za prepoznavanje hoda, koristeći pojedinačne kosture kao ulazne "zakrpe", u biti obavljajući samo temporalnu pažnju, zanemarujući odnose prostorne pažnje.

GaitFormer je treniran na samonadzirani način i nadmašio je druge metode prepoznavanja hoda čak i bez ikakvog finog podešavanja. Takav prethodni rad je ohrabrujući i utire put za dublju studiju potencijalne primjene transformatorskih arhitektura za analizu hoda. Mogu li se modeli transformatora vida prilagoditi za samonadzorno učenje prikaza kosturskog hoda?

Glavni arhitektonski problem u transformatorima vida je definiranje odgovarajućih odnosa između zakrpa slika, koje definiraju lokalne i globalne informacije. Kada se primijeni na hod, izbor dimenzija zakrpe odgovara količini kodiranih vremenskih i prostornih informacija niza kostura.

U ovom radu predstavljamo opsežnu studiju pet različitih transformatora vida, prilagođenih za prepoznavanje hoda. Istražujemo klasični ViT model [24], CaiT [25], CrossFormer [26], TwinsSVT [27] i token-token ViT [28].

ways to improve memory

Svaka se arhitektura trenira zasebno na kontrastivan samonadgledani način na dva skupa podataka velikih razmjera "u divljini" 2D kosturnih sekvenci hoda: DenseGait—automatski prikupljeni skup podataka iz neobrađenih tokova nadzora i GREW, manji skup podataka koji sadrži čiste ljudske bilješke.

Istražujemo mogućnosti prijenosa kroz dva kontrolirana skupa podataka za prepoznavanje hoda, CASIA [6] i FVG [29]. Za svaki skup podataka analiziramo izravan (bez nule) prijenos i učinkovitost podataka tijekom finog podešavanja uvježbavanjem s progresivno većim podskupovima skupova podataka. Štoviše, provodimo studiju ablacije o odnosu između prostornih i vremenskih dimenzija za veličine zakrpa za SimpleViT i CaiT , standardne okosnice za većinu dosadašnjih transformatora za viziju.

Ostatak rada organiziran je na sljedeći način. Provodimo pregled na visokoj razini srodnih radova o modelima prepoznavanja hoda i transformatorima vida. Primjećujemo da modeli reprezentacije hoda imaju veliku korist od samonadzornog treninga kako bi imali robusnije i općenitije ugradnje, a transformatorski modeli pokazali su veliki kapacitet modeliranja u samonadzornim režimima treninga.

Nadalje, matematički opisujemo pet arhitektura koje mjerimo i opisujemo predobradu podataka i kosturne transformacije koje je potrebno izvršiti, tako da transformatori vida moraju neprimjetno raditi na kosturnim sekvencama. Također opisujemo proširenja podataka, skupove podataka za obuku i benchmarking te eksperimentalne postavke.

Prikazujemo rezultate na CASIA-B i FVG za svaku od pet arhitektura i dva skupa podataka 'prettraining in-the-wild'. Na kraju, provodimo studiju ablacije o odnosu između prostorne i vremenske veličine mrlje i pružamo kratku raspravu o našim rezultatima. Naš izvorni kod činimo javno dostupnim na GitHubu (https://github.com/cosmaadrian/gait-vit, pristupljeno 28. veljače 2023.) radi transparentnosti i ponovljivosti.

2. Povezani rad

U ovom odjeljku donosimo kratki pregled postojećih metoda za prepoznavanje hoda u kontroliranim okruženjima i "u divljini". Nadalje, opisujemo glavni razvoj modela transformatora i, posebno, njihovu primjenu u domeni vida.

2.1. Prepoznavanje hoda

Slično identifikaciji na temelju lica, prepoznavanje hoda oslanja se na metričko učenje. Za razliku od tradicionalnih biometrijskih metoda provjere autentičnosti, koje se oslanjaju na jednu sliku (npr. prepoznavanje lica) i zahtijevaju opsežnu suradnju (npr. biometrijska autentifikacija temeljena na šarenici), značajke hoda obrađuju se kao niz snimaka kretanja. Takva dinamika pokreta zahtijeva veću složenost u određivanju najinformativnijeg podslijeda, ali omogućuje korištenje nenametljive autentifikacije na daljinu.

U ovom kontekstu, zadatak podrazumijeva osposobljavanje mreže kodera za preslikavanje sekvenci hodanja u prostor ugradnje gdje sličnost ugradnje odgovara sličnosti hoda. Ugrađivanja hodanja koja pripadaju istoj osobi trebala bi biti blizu prostora ugrađivanja, a oni koji dolaze iz različitih identiteta moraju biti udaljeniji. U ovom prostoru ugrađivanja zaključak se može izvesti dobivanjem ugradnje slijeda hoda i korištenjem najbližeg susjeda pristup bazi podataka poznatih šetnji.

Trenutačni pristupi u prepoznavanju na temelju hoda podijeljeni su u dvije kategorije: na temelju izgleda [8,9] i na temelju modela [10,12,30]. Metode koje se temelje na izgledu prvo dobivaju siluete subjekata koji hodaju pomoću algoritama oduzimanja pozadine ili segmentacije iz svakog video okvira.

Zatim se slijed silueta unosi u CNN-ove arhitekture koje izdvajaju prostorne i vremenske značajke koje se agregiraju u konačno ugrađivanje za prepoznavanje. Pristupi koji se temelje na modelima izdvajaju kosture iz RGB videa s modelima za procjenu položaja [21,22]. Sekvence kostura obično se obrađuju modelima koji se oslanjaju na konvolucije grafova [10,30] za dobivanje ugradnje hoda.

GaitSet, rad Chaoa i sur. [8], smatra hod neuređenim skupom silueta. Autori tvrde da je ovaj prikaz fleksibilniji od niza silueta jer je otporan na različite rasporede okvira ili kombinaciju više smjerova i varijacija hodanja. Oni koriste konvolucijske slojeve za svaku siluetu kako bi dobili značajke na razini slike i kombinirali ih u značajku na razini skupa sa skupom skupova. Konačni rezultat dobivaju korištenjem svoje verzije HorizontalPyramid Matching [31].

Fan i sur. [9] uočili su činjenicu da određeni dijelovi ljudske siluete trebaju imati svoj prostorno-vremenski izraz jer svaki od njih ima jedinstveni uzorak. Njihova arhitektura, GaitPart, koristi žarišne slojeve zavoja (FConvs), koji su specijalizirani tip zavoja s ograničenijim receptivnim poljem. Autori tvrde da FConvs pomaže njihovoj arhitekturi u učenju preciznijih značajki za različite dijelove tijela koje se kreće. Oni također uvode module za snimanje mikrokretanja koji se koriste za izdvajanje značajki malih vremenskih sekvenci.

Teepe i sur. [30] predlažu GaitGraph, koji koristi prilagođenu konvolucionu mrežu grafova nazvanu ResGCN [32] za kodiranje prostorno-vremenskih značajki dobivenih iz niza kostura. Li et al. [33] predlažu PTP, što je struktura koja agregira višestruke vremenske značajke iz jednog ciklusa hoda na temelju njihove analize najvažnijih faza hodanja.

Oni također koriste konvolucionu mrežu grafikona za izdvajanje prostornih značajki, koja radi zajedno s PTP-om. Autori predstavljaju novu metodu povećanja podataka koja modificira hod kako bi imao više koraka u realističnijem ciklusu.

Međutim, za razliku od prethodnih radova, cilj nam je istražiti izvedbu arhitektura prepoznavanja hoda u scenarijima samonadzora. Nadahnuti ogromnim napretkom u domeni računalnog vida, predlažemo prilagodbu postojećih arhitektura transformatora vida za rad na kosturnim sekvencama umjesto na slikama i testiranje njihove sposobnosti modeliranja u samonadziranim scenarijima. Većina drugih radova [8,9,30] usmjerava svoje napore na razvoj neuronskih arhitektura koje postižu impresivne rezultate u prepoznavanju hoda na kontroliranim skupovima podataka.

Međutim, namjeravamo ukloniti potrebu za vrlo skupim ručnim komentarima za skupove podataka o hodu i istražiti načine na koje je učenje pod vlastitim nadzorom prikladno za analizu hoda.

memory enhancement

Prethodni radovi u ovoj domeni [10,12] pokazali su potencijal za učenje dobrih prikaza hoda iz slabo označenih skupova podataka. Cosmaand Radoi [12] predložio je GaitFormer, prvu arhitekturu temeljenu na transformatorima za obradu sekvenci kostura, inspiriranu modelom ViT [24]. Slično [12], pokušavamo istražiti izvedbu drugih modela transformatora vida, s različitom prostornom i vremenskom dinamikom u mehanizmu obrade zakrpa. Skupovi podataka velikih razmjera za prepoznavanje hoda predloženi su u prošlosti [7,12], što omogućuje razvoj općih arhitektura za reprezentacijsko učenje.


For more information:1950477648nn@gmail.com


Mogli biste i voljeti