AttentionMNIST: skup podataka za praćenje pozornosti klikom miša za prepoznavanje rukom pisanih brojeva i abecede
Feb 22, 2024
Višestruki modeli temeljeni na pažnji koji prepoznaju objekte putem niza brzih pogleda izvijestili su o rezultatima prepoznavanja rukom pisanih brojeva. Međutim, nisu dostupni podaci za praćenje pažnje za prepoznavanje rukom pisanih brojeva ili slova. Dostupnost takvih podataka omogućila bi procjenu modela temeljenih na pažnji u usporedbi s ljudskom izvedbom. Prikupljamo podatke o praćenju pažnje klikom miša od 382 sudionika koji pokušavaju prepoznati rukom pisane brojeve i slova (velika i mala slova) sa slika putem sekvencijalnog uzorkovanja. Slike iz skupova referentnih podataka predstavljaju se kao podražaji. Prikupljeni skup podataka, nazvan AttentionMNIST, sastoji se od niza uzoraka (klik mišem) lokacija, prizdane oznake klase pri svakom uzorkovanju i trajanje svakog uzorkovanja. U prosjeku, naši sudionici promatraju samo 12,8% slike za prepoznavanje. Predlažemo osnovni model za predviđanje lokacije i razreda(a) koje će sudionik odabrati pri sljedećem uzorkovanju. Kada je izložen istim podražajima i eksperimentalnim uvjetima kao naši sudionici, visoko citirani model potkrepljenja temeljen na pažnji zaostaje za ljudskom učinkovitošću.

kineski cistanchebiljka- Proizvodi za sprječavanje Alzheimerove bolesti
Modeli strojnog učenja (ML) koji prepoznaju objekte putem slijeda brzih pregleda posljednjih su godina postali zainteresirani zbog svoje skalabilnosti i učinkovitosti. Mnogi od tih modela, poput 1–7, izvijestili su o eksperimentalnim rezultatima na referentnom skupu podataka MNIST za prepoznavanje rukom pisanih brojeva. Nažalost, podaci o praćenju pažnje za MNIST nisu dostupni. To sprječava procjenu modela temeljenih na pažnji u usporedbi s ljudskom izvedbom. Upali smo u tu prazninu skupljajući skup podataka od odraslih sudionika koji su pokušavali prepoznati rukom pisane brojeve i slova sa slika putem sekvencijalnog uzorkovanja. Za razliku od praćenja pažnje pokretom oka (emAT), sudionik klikne mjesto na slici koju želi vidjeti (oblik praćenja pažnje klikom miša (mcAT)). Odmah nakon toga odabire klasu(e) za koju predviđa da bi objekt mogao pripadati na temelju svojih dosadašnjih opažanja. Stoga se u svakoj epizodi uzorkovanja naši podaci sastoje od odabrane lokacije slike, predviđene oznake klase i vremena koje je sudionik proveo od posljednje epizode. Nakon svake slike, sudionik dobiva nagradu na temelju svoje izvedbe (točnost i učinkovitost).

Dobrobiti cistanche tubulosa-Protiv Alzheimerove bolesti
Prednosti mcAT-a u odnosu na emAT za prepoznavanje rukom pisanih brojeva/abecede.
(1) meso sadrži značajnu intra- i inter-personalnu varijabilnost u mjestu fiksacije, posebno za statične podražaje (slike)8,9. Stoga je potrebna velika količina podataka o fiksaciji oka da bi se došli do statistički značajnih zaključaka. mcAT nije osjetljiv na neke od izvora tehničke buke uobičajene za podatke praćenja oka10. (2) Pokreti očiju mogu biti rezultat i voljnih i nevoljnih mehanizama11. Kako bismo olakšali donošenje odluka ovisno o zadatku, sudionicima predstavljamo odgovarajuće vrijeme, kontekst i signale pojačanja, koji se također mogu predstaviti ML modelu. (3) Preciznost i točnost podataka emAT-a ovise o uređaju za praćenje oka, dok su podaci mcAT-a neovisni o bilo kojem uređaju. (4) Izazov je uskladiti pokrete očiju s odabirom klase. Kako bi se to prevladalo, u našem slučaju, mjesto uzorkovanja i klasa(e) odabiru se u istoj epizodi. (5) Naposljetku, naša metoda omogućuje prikupljanje podataka korištenjem Amazon Mechanical Turk (MTurk), kao u 12,13, što je troškovno i vremenski učinkovito i lako se može ponoviti.
Prilozi.
Skupljamo mcAT skup podataka pod nazivom AttentionMNIST, koristeći MTurk od 382 sudionika, nagrađenih za točno i učinkovito prepoznavanje rukom pisanih brojeva i slova (velikih i malih slova) sa slika putem sekvencijalnog uzorkovanja. Slike iz referentnih skupova podataka (MNIST, EMNIST) predstavljene su kao podražaji. U prosjeku se bilježi 169,1 odgovor po razredu broja/abecede. Koristeći ovaj skup podataka, pokazujemo sljedeće: • U prosjeku, sudionicima je potrebno 4,2, 4,7 i 4,9 uzoraka za prepoznavanje brojeva, velikih i malih slova, što odgovara samo 11,3%, 13,4%, odnosno 13,7% površine slike . Točnost klasifikacije povećava se s nekoliko uzoraka. • Model, predstavljen kao osnovna linija, može predvidjeti klasu(e) i lokaciju koju će sudionik odabrati u sljedećoj epizodi uzorkovanja sa 74,4% odnosno 67,7% točnosti, oba u prosjeku za sva uzorkovanja i skupove podataka. Točnost predviđanja klase se povećava, a točnost predviđanja lokacije smanjuje s povećanjem uzoraka. • Kada su izloženi istim podražajima i uvjetima kao naši sudionici, visoko citirani model ponavljajuće pažnje (RAM)3 koji se temelji na potkrepljenju zahtijeva 3,7, 8,5 i 7,6 uzoraka za prepoznavanje brojeva, velikih i malih slova, što odgovara 8,9% , 21.0%, redom 18,7% površine slike. Drugi modeli potkrepljenja temeljeni na pažnji (npr. 1,2,4,5,7,14) mogu se na sličan način ocijeniti u usporedbi s ljudskom izvedbom.

Dodatak Cistanche blizu mene-Poboljšanje pamćenja
【Tražite više】 E-pošta:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Povezani posao
Vremenski slijed klikova mišem u mcAT-u analogan je putanji skeniranja pokreta oka10. mcAT može učinkovito zamijeniti emAT jer su značajno povezani10,12,13,15–17. U studijama mcAT-a korištene su različite vrste podražaja, kao što su slike živih i neživih objekata10, slike prirodnih scena12,13, statične web-stranice13, izgledi stranica za pretraživanje16 i dva popisa alfanumeričkih nizova za vizualnu usporedbu17. Međutim, mcAT se nije koristio za rukom pisane zadatke klasifikacije brojeva/abecede ili evaluaciju modela klasifikacije temeljene na pažnji. Studije mcAT-a koristile su značajke kao što su vrijeme do kontakta, relativna učestalost fiksacije u područjima interesa (AOI), relativni udio subjekata koji su kliknuli barem jednom u AOI10, broj fiksacija po ispitivanju, ponovno fiksiranje unutar ispitivanja, vremena zadržavanja i putanje skeniranja17 , mape fiksacije12,13, AOI i obrazac protoka informacija16. Niz vremenski označenih lokacija klikova i predviđenih oznaka klasa čine neobrađene podatke potrebne za procjenu učinkovitosti i točnosti modela temeljenih na pažnji ili ljudi u zadacima klasifikacije. Iz ovih podataka mogu se izvesti različite značajke. Naš mcAT skup podataka, s višestrukim prednostima u odnosu na podatke praćenja oka, ispunjava ključnu prazninu u istraživanju modela temeljenog na pažnji u AI, ML i drugim područjima. Naš skup podataka omogućit će procjenu modela temeljenih na pažnji u usporedbi s ljudskom izvedbom. Između ostalog, ovo će olakšati razvoj učinkovitih sustava za optičko prepoznavanje znakova u stvarnom vremenu koji imaju široku primjenu u praksi (vidi primjerice 18–20). Načela koja vode vizualne fiksacije mogu se pretpostaviti i testirati pomoću našeg skupa podataka. Uspješna načela mogu se prenijeti na razvoj sustava za zadatke vizualnog prepoznavanja u stvarnom svijetu gdje je učinkovitost ključna briga, kao što je autonomna vožnja.
Podaci
Naši podaci sastoje se od niza T epizoda za svakog sudionika. Podaci iz svake epizode sastoje se od (1) lokacije na slici koju je kliknuo sudionik (jedan klik na sliku po epizodi), (2) razreda(a) koje je odabrao sudionik i (3) vremena potrebnog sudioniku da registrira trenutni uzorak (tj. vrijeme proteklo između zadnjeg i trenutnog klika na sliku). Ovaj odjeljak objasnit će naš proces prikupljanja podataka uključujući odabir podražaja, sudionika, vizualne zadatke, bodovanje izvedbe i filtriranje podataka.
Izbor podražaja. Podražaji su odabrani iz slika u dva referentna skupa podataka: (1)
Skup podataka MNIST21 sastoji se od 70,000 označenih slika (28×28 piksela) od 10 rukom pisanih brojeva {0, 1, ..., 9}. (2)
Skup podataka EMNIST22 sastoji se od 145 600 slika (28×28 piksela) rukom pisanih engleskih abeceda velikim i malim slovima, tvoreći uravnoteženu klasu. Sve slike označene su jednom od 26 klasa {a, b, ..., z}. Međutim, oznaka velikim ili malim slovima nije povezana ni s jednom slikom. Iz svake kategorije odabiremo 15 dobro oblikovanih brojeva iz MNIST-a i 15 dobro oblikovanih abeceda iz skupova podataka EMNIST velikih i EMNIST malih slova. Dobro oblikovana brojka ili abeceda slična je normi svoje klase. Stoga predstavljamo podražaje iz skupa od 15 (10 + 26 + 26)=930 jedinstvenih slika, s 15 slika koje pripadaju svakoj od 62 klase. Dobro oblikovane 930 slike odabrane su na sljedeći način:
Korak 1: Normalizirajte svaku sliku koristeći min-max za skaliranje intenziteta između 0 i 1.
Korak 2: Označite dobro oblikovane EMNIST slike velikim ili malim slovima. Za svaku klasu abecede ručno se odabire i označava dobro oblikovana abeceda od slika velikih i malih slova. Izračunava se kosinusna sličnost svih slika koje pripadaju toj klasi s dvije označene slike. Slikama koje su iznad praga kosinusne sličnosti (empirijski odabrano kao 0.8) dodjeljuje se oznaka velikim ili malim slovima.
Korak 3: Izračunajte srednju vrijednost slika koje pripadaju svakoj klasi. Srednja slika klase čini njezinu normu. Slika može biti podražaj ako je njena kosinusna sličnost sa srednjom slikom svoje klase veća od empirijski određenog praga (0.7 za MNIST, 0.75 za EMNIST).
Korak 4: Među slikama koje ispunjavaju uvjete, 15 slika iz svake klase bira se ručno na temelju toga koliko su dobro oblikovane. Svaka slika, izvorno 28 × 28 piksela, smanjena je na 27 × 25 uklanjanjem piksela u blizini granica jer nemaju varijaciju intenziteta. Srednja vrijednost ovih 15 slika izračunata je za svaku od 62 klase. Ove srednje slike označavamo kao I1, I2, ..., In za n klasa u svakom skupu podataka.
Sudionici.
U našem istraživanju sudjelovale su ukupno 382 različite odrasle osobe. Nisu korišteni kriteriji odabira. Sudionik može odgovoriti na više slika. Za svaki od 62 razreda zabilježeno je prosječno 169,1 odgovora.

Prednosti cistanche tubulosa-Protiv Alzheimerove bolesti
Vizualni zadatak.
MTurk sučelje za naš vizualni zadatak prikazano je na slici 1. Platno veličine 270×250 cijelo vrijeme prikazuje pozadinsku sliku niskog intenziteta. Slike pozadine i podražaja povećavaju se deset puta do 270×250. Središte platna je poravnato sa središtem slika. Pozadina U početku je pozadina srednja vrijednost svih slika u skupu podataka iz kojih je izvučen podražaj. Nakon prve epizode, pozadina je srednja vrijednost svih slika iz skupa klasa koje je odabrao sudionik u posljednjoj epizodi. U stvarnom svijetu, kontekst za lokaciju, veličinu i orijentaciju broja ili abecede dobiva se iz pisma u njegovoj blizini, što ovdje nedostaje. Kad su naši eksperimenti provedeni s praznom pozadinom, sudionici su često uzorkovali lokacije slike koje nisu sadržavale niti jedan dio objekta. Ovo ponašanje je obuzdano predstavljanjem srednje slike odabrane(ih) klase(a) u pozadini niskog intenziteta i smanjenjem veličine svih MNIST i EMNIST slika sa 28×28 piksela na 27×25. Svaki put kada sudionik odabere mjesto na platnu klikom na njega, otkriva se mrlja veličine 50 × 50 piksela usredotočena na to mjesto sa slike podražaja. Jednom otkrivena zakrpa nastavlja se prikazivati do posljednje epizode. Zadatak sudionika sastoji se od tri koraka u svakoj epizodi t (t=1, ..., T):
Korak 1: Kliknite bilo gdje na platnu veličine 270 × 250 da biste otkrili zakrpu koju želite uzorkovati. Prihvaća se samo prvi klik.
Korak 2: Prepoznajte broj/abecedu iz svih do sada promatranih uzoraka. Sudionik može odabrati više razreda i mora odabrati najmanje jedan razred s popisa razreda prikazanog ispod platna.
Korak 3: Kliknite "Dalje" na dnu ekrana za nastavak. Kako bi točno i brzo zaključio klasu, sudionik će morati promišljeno odabrati lokacije s obzirom na svoja zapažanja do trenutne epizode. Ne postoji vremensko ograničenje za jednu epizodu. Međutim, ograničavamo ukupno vrijeme za T epizoda slike na šest minuta. Odabrali smo T=12 jer su visoko citirani radovi o prepoznavanju rukopisa ili generiranju temeljenom na pažnji koristili manje od 12 brzih pogleda (npr. RAM3 je mogao prepoznati MNIST brojeve unutar 7 brzih pogleda, DRAW23 je mogao generirati MNIST brojeve unutar 11 brzih pogleda), i ljudi mogu prepoznati rukom pisane brojeve i slova u mnogo manje od 12 brzih pogleda.
Bodovanje učinka. Bodovanje se dodjeljuje sudioniku na temelju njegove točnosti i učinkovitosti u smislu broja promatranih uzoraka. Neka to bude skup klasa koje je odabrao u bilo kojoj epizodi t. Deset, njegov rezultat na t je:

Slika 1. Naše MTurk sučelje kako ga vidi sudionik. Prikazan je drugi uzorak za EMNIST velika slova.

gdje |.| označava kardinalnost skupa. Ukupni rezultat dodijeljen u T epizodama je h {{0}} T t=1 Pt. Stoga je maksimum koji netko može postići u T epizoda T ako uvijek odabere samo točnu klasu. Najmanji rezultat koji netko može postići u T epizodama je nula ako uvijek odabere skup klasa koji ne uključuje točnu klasu. Dakle, 0 Manje ili jednako h Manje ili jednako T. Što prije sudionik odabere točan razred, to će njegov rezultat biti viši. Stoga ovaj mehanizam bodovanja uzima u obzir točnost prepoznavanja i učinkovitost uzorkovanja. Pokušaj maksimiziranja rezultata odabirom samo jedne klase iz prve epizode bit će riskantan jer će se rezultat nula dodijeliti ako to nije ispravan razred, dok će rezultat veći od nule biti dodijeljen ako sudionik odabere više razreda ( čak i sve klase) koje uključuju ispravnu klasu. To će motivirati sudionika da odgovori na temelju vjerojatnih razreda u svom umu u bilo kojoj epizodi. Rezultat dodijeljen u svakoj epizodi otkriva se tek nakon završetka T epizoda kako bi se suzdržali od davanja bilo kakvih nagovještaja sudioniku. U MTurk-u, naknada koju sudionik prima za sliku proporcionalna je njegovom ukupnom rezultatu, h.
Filtriranje podataka.
Ako je rezultat sudionika u posljednjoj (tj. T-toj) epizodi za sliku podražaja nula, njegovi podaci snimljeni za tu sliku se odbacuju. Podaci se također odbacuju ako sudionik ostavi zadatak nedovršenim. Ovim kriterijem odabira dobili smo odgovore na 1736 podražaja iz MNIST-a, 4431 podražaja iz EMNIST-a velikim slovima i 4315 podražaja iz EMNIST-a malim slovima; odnosno prosječno 169,1 odgovor po razredu.
Modeli i metode korištenja podataka
U ovom odjeljku ilustriramo korisnost prikupljenih podataka tako što (4.1) pružamo osnovni model za predviđanje ponašanja sudionika i (4.2) pokazujemo kako se postojeći model pojačanja temeljen na pažnji može usporediti s ljudskim prepoznavanjem brojeva/abecede izvođenje. Osnova za predviđanje ponašanja. Ponašanje u bilo kojoj epizodi t sastoji se od odabira lokacije i odabira klase. Budući da uzorak sadrži različite količine informacija za različite promatrače, ili čak za istog promatrača u različito vrijeme9, predviđanje ponašanja svakog sudionika je težak problem. Neka n bude broj klasa u skupu podataka, ηt bude pojedinačni skup koji sadrži pravu klasu za sliku podražaja u t, ct bude skup klasa i lt bude lokacija koju je odabrao sudionik u t, da bude njegovo opažanje u t t, a 1:t označava niz 1, 2, ..., t. Do bilo kojeg t, zapažanja sudionika su o1:t, a lokacije koje je odabrao su l1:t. Problem predviđanja ponašanja sudionika formuliramo na sljedeći način: Predviđanje klase Procijenite vjerojatnost i∈ct (i=1, 2, ..., n) s obzirom na njegove o1:t i l1:t, tj. P( i ∈ ct|o1:t, l1:t). Predviđanje lokacije Procijenite vjerojatnost lt+1 s obzirom na njegove o1:t, l1:t i ct, tj. P(lt+1|o1:t, l1:t,ct). Predviđanje klase. Kako bismo predvidjeli klasu koju će sudionik odabrati u epizodi t, izračunavamo vjerojatnost da podražaj slike u t pripada klasi I s obzirom na odabrane lokacije sudionika l1:t i odgovarajuća opažanja o1:t, kako slijedi:

gdje je Ii srednja vrijednost slika podražaja (27×25) koje pripadaju klasi i, I′ je slika 27×25 koja sadrži o1:t u l1:t, · označava skalarni produkt, a .označava euklidsku normu. Svi intenziteti piksela su nenegativni. U bilo kojoj epizodi t, k najvećih vjerojatnih klasa iz distribucije uvjerenja P(i|o1:t, l1:t) čini skup klasa, ˆct, predviđenih našim modelom, gdje je k=|ct|. Točnost klasifikacije mjeri se pomoću Jaccardovog indeksa (JI). JI mjeri sličnost između dva skupa, X i Y, kao: J(X, Y) {{10}} |X ∩ Y|/|X ∪ Y|. JI je ograničen između 0 i 1; ako je X=Y, J(X, Y)=1. U bilo kojoj epizodi t, točnost klasifikacije sudionika je J(ηt,ct), dok je točnost našeg modela J(ηt, ˆct). Zbog svog nazivnika, JI penalizira više što se povećava broj elemenata u predviđenom skupu (ct ili ˆct) koji nisu u ηt, što je poželjno svojstvo za naš slučaj. Sličnost između klasifikacije sudionika i našeg modela mjeri se J(ct, ˆct). Naš se model također procjenjuje u smislu odabira razreda i točnosti odbijanja s obzirom na svakog sudionika. Neka je st=ct − ct−1 skup novih odabranih klasa i rt=ct−1 − ct skup klasa koje je sudionik odbio u t. Slično, ˆst=ˆct − ct−1 je skup novih odabranih klasa, a ˆrt=ct−1 − ˆct je skup klasa koje je naš model odbacio u t. Tada se izbor klase i odbijanje modela može usporediti sa sudionikom prema J(st, ˆst) kada je |st| > 0 i J(rt, ˆrt) kada je |rt| > 0, odnosno. Predviđanje lokacije. Hipoteza U idealnom slučaju, distribucija uvjerenja u svim klasama trebala bi biti unimodalna (tj. samo jedan vrh) i tankog Gaussovog oblika (tj. mala standardna devijacija) što pokazuje da je sudionik siguran u klasu (stanje) podražaja (okruženje). Međutim, kao što je vidljivo iz naših podataka (ref. Slika 2), sudionik je često zbunjen između više razreda, osobito tijekom prvih nekoliko epizoda. U tim slučajevima, njegova distribucija uvjerenja ima više vrhova ili je debeli Gaussov. Pretpostavljamo da je cilj sudionika konvergirati prema unimodalnom i tankom Gaussovu, da bi to postigao on selektivno uzorkuje lokacije koje smanjuju vjerojatnost svih klasa osim jedne. Ova hipoteza dovodi do minimiziranja neizvjesnosti u pogledu klasa (stanja okoliša) što je dobro poznato načelo kojim se vode radnje24, uključujući pokrete očiju25.

Slika 2. Trajanje i raspodjela razreda po svim sudionicima i podražajima koji pripadaju kategorijama '0', 'a' i 'A'.
Te observations at certain locations in a stimulus image can discriminate between certain classes. Te observation at a location l might indicate that the numeral/alphabet belongs to class I and not to class j. Such locations are more salient than others in achieving a participant's goal. To sample such locations, a saliency map, Dij, is computed such that if l is salient, the observation at l is evidence to increase the probability of class I and decrease that of j. Mathematically, Dij = N (., σ ) ∗ g(.), where ∗ is the convolution operator, g(.) is a saliency scoring function, and N (., σ ) is a 5×5 Gaussian kernel with standard deviation σ = 6 to smooth the saliency scores. We denote the set of all saliency maps as D = {Dij: i, j ∈ {1, 2, ..., n}, i �= j}. A location l in a stimulus image is salient for class i with respect to class j if Dij(l)>θ, gdje je prag θ=0.5 × max(D) empirijski određena skalarna veličina.
Dvije asimetrične metrike, Kullback-Leiblerovu (KL) divergenciju i razliku, smatramo kandidatima za funkciju g. KL divergencija S obzirom na dvije normalizirane srednje slike, Ii i Ij, KL divergencija KL(Ii, Ij) mjeri gubitak informacija kada se Ij koristi za aproksimaciju Ii. Ovo se izračunava za svaki piksel k kao26: KL(Ii,k, Ij,k)=Ii,k log δ + Ii,k Ij,k+δ, gdje je Ij,k intenzitet k-tog piksela od Ij, a δ je regularizacijska konstanta. Kada je Ii,k=Ij,k, KL(Ii,k,Ij,k) → 0. Razlika S obzirom na dvije normalizirane srednje slike, Ii i Ij, razlika za svaki piksel k je Diff (Ii,k, Ij,k)=Ii,k − Ij,k. Kada je Ii,k=Ij,k, Diff (Ii,k, Ij,k)=0. Sudionik nije siguran u pogledu skupa klasa, ct, koje je odabrao u trenutnoj epizodi. Stoga, za predviđanje lokacije, uzimamo u obzir samo one karte istaknutosti u D koje uključuju klase u ct. Lokacija je predviđena ako je istaknuta na temelju ovih karata istaknutosti i ako je sudionik nikada nije odabrao. Dakle, s obzirom na o1:t, l1:t i ct, lokacija lt+1 predviđena je na sljedeći način:

gdje je Ŵ skup 3-torki koje sadrže predviđenu lokaciju ˆl, klasu za koju je istaknuta (i) i s obzirom na koju klasu (j). Lokacija je točno predviđena ako postoji �ˆl, i, j� ∈ Ŵ takvo da je �ˆl − lt+1� < ǫ, I ∈ ct+1 i j /∈ ct{{3} }, gdje je ǫ maksimalna euklidska udaljenost između središnjeg piksela i bilo kojeg piksela u promatranom dijelu. Pseudokod za predviđanje lokacije prikazan je u Algoritmu 1. Detaljno objašnjenje pseudokoda uključeno je u Odjeljku S1 dodatnog materijala. (Distribucija vjerojatnosti, P(lt+1|o1:t, l1:t,ct), može se izračunati pretpostavkom da je rezultat istaknutosti lokacija koje nisu u Ŵ nula, a zatim normaliziranjem rezultata istaknutosti svih lokacije zbrajati do jedinice. Međutim, ova vjerojatnost nije korištena, jer je jednadžba (3) dovoljna za potrebe ovog rada.)

Evaluacija modela temeljenih na pozornosti.
Kao predstavnik modela koji se temelje na pozornosti, smatramo često citirani model ponavljajuće pažnje (RAM)3 koji izvještava o eksperimentalnim rezultatima na MNIST skupu podataka. Ovaj model pojačanja sekvencijalno uzorkuje sliku i odlučuje gdje uzorkovati sljedeće u svakom trenutku uzorkovanja, što ga čini prikladnim za procjenu pomoću prikupljenih podataka.
radna memorija
klasificira slike pomoću niza brzih pogleda. Sljedeća lokacija bira se stohastički iz distribucije koju parametrira lokacijska mreža. Model se obučava od kraja do kraja maksimiziranjem sljedećeg cilja3:

gdje je M broj epizoda, T je broj opažanja, xi 1:t sekvence interakcije dobivene pokretanjem trenutnog agenta do I epizoda, ui t trenutna radnja, θ je skup parametara koji se mogu trenirati, Ri t je kumulativna nagrada, bt je osnovna linija, a π(ui t|xi 1:t; θ ) je politika. RAM-ovo ponašanje može se usporediti s ponašanjem sudionika usporedbom mapa fiksacije dobivenih iz niza lokacija koje je predvidio RAM i onih koje su odabrali sudionici. Karta fksacije izračunava se dodjeljivanjem vrijednosti svakoj lokaciji jednakoj učestalosti njezinog odabira, a zatim normaliziranjem tih vrijednosti kako bi se stvorila distribucija na svim lokacijama.
Metrike za usporedbu mapa fiksacije. Za metriku koja uspoređuje dvije mape fiksacije, P i Q, pomno slijedimo 26. Koristimo tri metrike temeljene na distribuciji: KL divergenciju (KL), Pearsonov koeficijent korelacije (CC) i sličnost (SIM), za usporedbu distribucije lokacija uzorkovanja iz modela s onim od sudionika kako je zabilježeno u prikupljenim podacima.
KL (ranije definiran) vrlo je osjetljiv na nulte vrijednosti.
CC može procijeniti linearni odnos između dviju mapa kao26: CC(P, Q)=σ (P, Q) σ (P)σ (Q), gdje je σ varijanca ili kovarijanca. Budući da je CC simetričan, ne uspijeva zaključiti jesu li razlike između mapa fiksacije posljedica lažno pozitivnih ili lažno negativnih rezultata.
SIM se mjeri kao 26: SIM(P, Q)=k min(Pk, Qk), gdje je k Pk=k Qk=1. Kao i CC, SIM je simetričan i nasljeđuje isti nedostatak. Također, SIM je vrlo osjetljiv na nedostajuće vrijednosti i kažnjava predviđanja koja ne uzimaju u obzir gustoću istinitosti temelja.
Istraživanja na ljudima i životinjama.
Institucionalni odbor za reviziju na Sveučilištu u Memphisu utvrdio je da ova studija ne ispunjava definiciju Ureda za zaštitu ljudskih subjekata istraživanja ljudskih subjekata i da se 45 CFR dio 46 ne primjenjuje. Stoga ova studija ne zahtijeva odobrenje ili pregled IRB-a.
Eksperimentalni rezultati Analiza podataka.
Prikupljeni podaci mogu se vizualizirati u smislu slijeda distribucije odabranih lokacija (Slika 3), odabranih klasa (Slika 2) i trajanja između uzastopnih epizoda (Slika 2). Ove su distribucije vrlo slične za tri skupa podataka. Za bilo koju brojku ili abecedu, distribucija odabranih lokacija nakon posljednje epizode nalikuje distribuciji intenziteta piksela svoje klase iz skupa podataka. Međutim, slijed odabranih lokacija je stohastičke prirode. Raspodjela klasa ukazuje na zbrku između kategorija sa sličnim strukturama u prvih nekoliko epizoda kada sudionici odaberu više klasa. Ova se zabuna smanjuje s više uzorkovanja. Postoji značajna pozitivna korelacija između stupnja zabune (# odabranih klasa/ukupno # klasa) i trajanja uzorkovanja (vidi sliku 4). Ako je broj odabranih razreda visok (nizak), trajanje između uzastopnih epizoda je veliko (nisko). CC slijeda lokacija koje je sudionik odabrao za nastavu nije značajan (Tablica 1). To je očekivano zbog varijabilnosti između ispitanika u uzorkovanju statičnih slika. Prosječan broj uzorkovanja koji je potreban sudioniku za točno predviđanje klase prilično je nizak. U prosjeku je potrebno 4,2, 4,7 i 4,9 uzoraka koji odgovaraju 36, 44,1 i 48,1 sekundi za točnu klasifikaciju MNIST, EMNIST slika velikim i malim slovima. Sudionici su u prosjeku pregledali samo 11,3%, 13,4% i 13,7% površine slike za točnu klasifikaciju slike brojeva, velikih i malih slova (vidi sliku S2 u dodatnom materijalu). Ovi rezultati naglašavaju učinkovitost ljudskog sustava vizualnog zaključivanja, iako na nižoj razlučivosti od podataka praćenja oka, ali s manje šuma i varijabilnosti. Ovi empirijski rezultati mogu biti korisni za dizajniranje modela temeljenih na pozornosti za aplikacije u stvarnom svijetu. Predviđanje ponašanja. U ovom se odjeljku procjenjuje izvedba našeg osnovnog modela u smislu koliko točno može predvidjeti lokaciju svakog sudionika i odabir klase. Budući da su naši eksperimentalni rezultati koji koriste dvije funkcije bodovanja istaknutosti, KL divergenciju i razliku, prilično slični, rezultati su prikazani samo uz korištenje razlike, osim ako nije drugačije navedeno. Predviđanje klase. Predviđanje klase i metode procjene točnosti opisane su u odjeljku "Predviđanje klase". Klasa točnosti predviđanja, prikazana na slici 5, izračunata je za sve klase za sva uzorkovanja. Prosječna točnost predviđanja klase za sva uzorkovanja i skupove podataka je 74,4% (std. dev. 26,5). Slike 5a i b pokazuju da je skup klasa koje su odabrali sudionici i naš osnovni model (jednadžba 2) prilično netočan u početnim epizodama i poboljšava se s povećanjem uzoraka. Slika 5c pokazuje da su, tijekom početnih epizoda, ova dva skupa, ct i ˆct, prilično različita; sličnost raste s povećanjem uzoraka. Isto se odnosi na nove odabire klasa (ref. Slika 5f). Međutim, razredna su odbijanja slična u početnim epizodama; sličnost se dodatno povećava s više uzoraka (ref. slika 5e). Budući da je J(st, ˆst)=|(ct ∩ ˆct) − ct−1| |(ct ∪ ˆct) − ct−1| i J(rt, ˆrt)=|ct−1 − (ct ∪ ˆct)| |ct−1 − (ct ∩ ˆct)|, može se zaključiti iz slike 5e, f da je u početnim epizodama sjecište između ct−1 i ct ∪ ˆct malo, što ukazuje da su u početku sudionici i naš osnovni model napraviti mnogo promjena u odabiru klase između uzastopnih epizoda. Stoga je u početku proces odabira klase visoko stohastičan. Iako postoje neke razlike između predviđanja klase sudionika i našeg modela tijekom početnih epizoda, ponašanja postaju sve sličnija s više uzoraka. Tijekom prvih nekoliko (obično 4 do 7) epizoda, otkrivaju se vrlo istaknuti dijelovi podražaja. To pomaže odabrati samo ispravnu klasu u kasnijim uzorkovanjima, što povećava točnost predviđanja. Budući da postoje mnoge klase čiji se srednji predlošci podudaraju s promatranim dijelovima podražaja tijekom prvih nekoliko epizoda, proces odabira klase znatno je stohastičniji, što dovodi do niske točnosti klasifikacije sudionika, kao i našeg modela.

Slika 3. Distribucija mjesta uzorkovanja na sve sudionike za svaki brojčani/abecedni razred i svaku epizodu uzorkovanja. Svaki redak odgovara klasi, svaki stupac odgovara epizodi uzorkovanja koja se povećava s lijeva na desno.
Predviđanje lokacije. Točnost predviđanja lokacije našeg osnovnog modela (jednadžba 3), prosječna za sva uzorkovanja i skupove podataka, iznosi 67,7% (std. dev. 14.1) (ref. slika 5d). Trend točnosti predviđanja suprotan je trendu točnosti predviđanja klase. Međutim, objašnjenje ostaje isto. Preciznost predviđanja lokacije visoka je tijekom početnog uzorkovanja jer se tijekom ovih epizoda odabiru visoko istaknute lokacije, ostavljajući manje istaknute lokacije za odabir u kasnijim epizodama. Budući da postoji mnogo lokacija s niskom istaknutošću, njihov je proces odabira vrlo stohastičan i stoga ga je teško predvidjeti, što dovodi do smanjenja točnosti predviđanja s povećanjem uzorkovanja. Trend smanjenja jedinstven je za svaki skup podataka (ref. slika 5d) budući da se broj klasa i broj vrlo istaknutih lokacija korisnih za diskriminaciju razlikuju između skupova podataka. Što je niži broj klasa i visoko istaknutih diskriminirajućih lokacija, to će brže biti smanjenje točnosti predviđanja lokacije s povećanjem uzorkovanja.

Slika 4. (Lijevo) Grafik trake pogrešaka vremenske razlike (sekunde) između uzastopnih uzoraka u prosjeku za sve klase. Naime, vrijednost prikazana u epizodi uzorkovanja t je vrijeme koje je proteklo između sudionikovih klikova na sliku u t − 1 i t. (Desno) Traka pogrešaka dijagram zbunjenosti u prosjeku za sve razrede u svakoj epizodi. Trake pogrešaka označavaju st. dev.

Slika 5. Procjena našeg osnovnog modela (ref. odjeljak "Osnovna linija za predviđanje ponašanja"). (a) Točnost klasifikacije (prema) sudionika i (b) točnost našeg osnovnog modela sa stvarnim oznakama kao osnovnom istinom. (c) Sličnost klasifikacije (J(ct, ˆct)), (d) točnost predviđanja lokacije, (e) točnost odbijanja klase i (f) točnost odabira klase našeg osnovnog modela s podacima sudionika kao osnovnom istinom. Pogledajte odjeljak "Predviđanje ponašanja" za detalje.

Tablica 1. Prosječni Pearsonov koeficijent korelacije (kor.) za fiksacijske sekvence za istu klasu. Za bilo koju fiksaciju, udaljenost je euklidska, a smjer se mjeri kao polarni kut u odnosu na središte podražaja kao ishodište. Std. dev. uključeni su u zagrade.
Procjena RAM-a.
Za svaku klasu i uzorkovanje uspoređuju se mape fiksiranja iz RAM-a (koristili smo implementaciju RAM-a s github.com/hehefan/Recurrent-Attention-Model) i prikupljeni podaci za iste podražaje predstavljene u MTurku. Za poštenu usporedbu sa sudionicima, u RAM-u smo fiksirali duljinu niza na T=12, prvo mjesto uzorkovanja u središtu slike, ulazno promatranje na 5×5 zakrpu s odabranom lokacijom kao središtem i modificirao funkciju nagrađivanja jednadžbom. (1). Kumulativna nagrada, Rt u jednadžbi (4,) zamjenjuje se kumulativnim rezultatom t τ=1 Pτ dobivenim iz jednadžbe. (1). Kako sudionik može odabrati više klasa u bilo kojoj epizodi, za RAM model, umjesto predviđanja jedne klase na temelju najveće vjerojatnosti, smatramo srednju vjerojatnost za sve klase kao prag i predviđamo skup klasa ct s vjerojatnostima većim od prag. Ovaj ct se koristi za izračunavanje rezultata pomoću jednadžbe. (1). Pod ovim uvjetima, RAM-u je potrebno 3,7, 8,5 i 7,6 uzoraka za prepoznavanje MNIST brojeva, velikih i malih slova EMNIST abecede, što odgovara 8,9%, 21.0%, 18,7% područja slike. Dakle, u usporedbi s našim sudionicima (ref. odjeljak "Analiza podataka"), RAM je manje učinkovit. Vidi tablicu 2. Rezultati usporedbe mapa fiksacije iz RAM-a i prikupljenih podataka prikazani su u tablici 3. KL je veći zbog svoje osjetljivosti na nulte vrijednosti. To znači da su sudionici uzorkovali nekoliko lokacija, ali ne i RAM. Ovi se eksperimenti mogu koristiti kao osnova za procjenu lokacija uzorkovanih modelom pažnje.

prednosti cistanche - Poboljšanje pamćenja
Rasprave
Paradigma mcAT, kako se koristi u ovom radu, ima određene točke razlike od onih koje se primarno oslanjaju na pokrete očiju i poglede za proučavanje mehanizama prepoznavanja objekata. U potonjem, istaknuti dijelovi prizora prvo privlače pozornost, a zatim slijede sakadični pokreti očiju koji usmjeravaju pogled na istaknuta mjesta27. Pogled pokreću signali odozdo prema gore i odozgo prema dolje koji, zajedno s informacijama o istaknutosti, tvore mape prioriteta koje vode pokrete očiju za prepoznavanje predmeta. Budući da su sudionici u ovoj studiji gledali statične slike u uvjetima slobodnog gledanja i s dovoljno vremena (šest minuta za T=12 uzorkovanje), vjerojatno su se uključili u niz sakadičnih pokreta očiju ili vizualnog razmišljanja28 kako bi istražili sliku prije klika na AOI. Ovi pokreti očiju mogli su biti snimljeni u emAT-u (pomoću uređaja za praćenje oka), ali ne i u mcAT-u. Međutim, na ove pokrete očiju utječe lutanje uma. Dok na mcAT također utječe lutanje uma29, učinak može biti smanjen kad god sudionici odgovore nakon vizualnog razmišljanja. Budući da su pokreti očiju kao odgovor na podražaj pod utjecajem zadatka30, na obrasce pokreta očiju sudionika vjerojatno je utjecao dodijeljeni zadatak u tri koraka pri svakom uzorkovanju (ref. odjeljak "Vizualni zadatak"). Da je korišten uređaj za praćenje oka, pokreti očiju sudionika za istraživanje uzorka bili bi pomiješani s pokretima očiju za klikanje njihovih odabranih razreda, što bi zakompliciralo tumačenje vizualnog istraživanja uzorka. Klik na razred(e) nužan je korak jer otkriva, iako introspektivno, predviđeni razred(e) u umu sudionika. Vjerojatno je da su pogledi neposredno prije i nakon odabira AOI - možda također potpomognuti fiksacijskim pokretima očiju31-najviše pridonijeli prepoznavanju brojeva/abecede. Doista, pretpostavljamo da su sudionici odabrali dijagnostička područja slike kako bi razlikovali klase, a ta područja vjerojatno sadrže mješavinu dijagnostičkih informacija odozdo prema gore (npr. vizualni kontrast) i odozgo prema dolje (predložak brojeva/abecede). To je u skladu s našim nalazom da su sudionici brzo (unutar 5 uzoraka u prosjeku) razlikovali klase podražaja navodno odabirom dijagnostičkih zakrpa.

Tablica 2. Usporedba učinkovitosti između naših sudionika i RAM modela u smislu prosječnog broja uzoraka potrebnih za prepoznavanje broja/abecede. Postotak promatranog područja slike uključen je u zagrade.

Tablica 3. Procjena mapa fiksacije iz RAM-a za podražaje predstavljene u MTurk eksperimentima u prosjeku za sve klase i uzorke. Std. dev. uključeni su u zagrade.
Zaključci
Uveli smo mcAT skup podataka za prepoznavanje rukom pisanih brojeva i slova putem sekvencijalnog uzorkovanja. Podaci su prikupljeni od 382 sudionika prikazanih slikama odabranim iz referentnih skupova podataka (MNIST, EMNIST). U prosjeku se bilježi 169,1 odgovor po razredu broja/abecede. Podaci se rigorozno analiziraju kako bi se otkrila učinkovitost ljudskog vizualnog prepoznavanja. Sudionici su promatrali samo 12,8% slike za prepoznavanje. Predložili smo osnovni model za predviđanje lokacije i klase(a) koju bi sudionik odabrao pri sljedećem uzorkovanju. Pokazali smo kako se naši eksperimentalni uvjeti i podaci mogu koristiti za procjenu modela pojačanja temeljenog na pažnji u usporedbi s ljudskom izvedbom. Ovaj mcAT skup podataka, s višestrukim prednostima u odnosu na podatke praćenja oka, ispunjava ključnu prazninu u istraživanju modela temeljenog na pažnji u AI, ML i drugim područjima.
Reference
1. Ranzato, MA O učenju gdje tražiti. arXiv:1405.5488, (2014).
2. Ba, J., Salakhutdinov, RR, Grosse, RB, & Frey, BJ Učenje modela rekurentne pažnje budnost-spavanje. U NIPS, 2593–2601 (2015).
3. Mnih, V. i sur. Rekurentni modeli vizualne pažnje. U NIPS, 2204–2212 (2014).
4. Ba, J., Mnih, V. i Kavukcuoglu, K. Prepoznavanje više objekata vizualnom pažnjom. arXiv:1412.7755 (2014).
5. Dutta, JK & Banerjee, B. Varijacije u točnosti klasifikacije s brojem brzih pregleda. U IJCNN, 447–453 (IEEE, 2017.).
6. Larochelle, H. & Hinton, GE Učenje kombiniranja fovealnih pregleda s Boltzmannovim strojem trećeg reda. U NIPS, 1243–1251 (2010).
7. Elsayed, G., Kornblith, S. & Le, QV Saccader: Poboljšanje točnosti modela čvrste pažnje za vid. U NIPS, 702–714 (2019).
8. van Beers, RJ Izvori varijabilnosti sakadičnih pokreta očiju. J. Neurosci. 27(33), 8757-8770 (2007).
9. Itti, L. & Baldi, P. Bayesovo iznenađenje privlači ljudsku pozornost. Vis. Res. 49(10), 1295–1306 (2009).
10. Egner, S. i sur. Pažnja i prikupljanje informacija: Usporedba praćenja pozornosti klika mišem s praćenjem pokreta očiju. J. Eye Mov. Res. 11(6), (2018).
11. Peterson, MS, Kramer, AF & Irwin, DE Prikriveni pomaci pažnje prethode nevoljnim pokretima očiju. Percept. Psychophys. 66(3), 398-405 (2004).
12. Jiang, M. i sur. Silicij: istaknutost u kontekstu. U CVPR, 1072–1080 (2015).
13. Kim, NW i sur. BubbleView: sučelje za prikupljanje mapa važnosti slika i praćenje vizualne pažnje. ACM Trans. Računanje. Pjevušiti. Interakcija. 24(5), 1–40 (2017).
14. Sermanet, P., Frome, A. & Real, E. Pažnja za finu kategorizaciju. arXiv:1412.7054 (2014).
15. Egner, S., Itti, L. & Scheier, C. Usporedba modela pažnje s različitim vrstama podataka o ponašanju. Istražite. Ophthalmol. Vis. Sci. 41(4), S39 (2000).
16. Navalpakkam, V. et al. Mjerenje i modeliranje ponašanja oko-miš u prisutnosti nelinearnih rasporeda stranica. U Proc. Int. Konf. WWW, 953–964 (2013).
17. Matzen, LE, Stites, MC & Gastelum, ZN Proučavanje vizualnog pretraživanja bez uređaja za praćenje oka: Procjena umjetne foveacije. Cogn. Res. Princ. Implicitno. 6(1), 1–22 (2021).
18. Tafi, AP i sur. OCR kao usluga: Eksperimentalna procjena Google Docs OCR, Tesseract, ABBYY FineReader i Transym. U Int. Symp. Vis. Comput., 735–746 (Springer, 2016).
19. Memon, J., Sami, M., Khan, RA & Uddin, M. Rukopisno optičko prepoznavanje znakova (OCR): Sveobuhvatni sustavni pregled literature (SLR). IEEE Access 8, 142642–142668 (2020).
20. Chaudhuri, A., Mandaviya, K., Badelia, P. & Ghosh, SK Optički sustavi za prepoznavanje znakova. U sustavima za optičko prepoznavanje znakova za različite jezike sa Sof Computingom, 9–41 (Springer, 2017).
21. LeCun, Y. i sur. Učenje na temelju gradijenta primijenjeno na prepoznavanje dokumenata. Proc. IEEE 86(11), 2278–2324 (1998).
22. Cohen, G., Afshar, S., Tapson, J. & van Schaik, A. EMNIST: Proširenje MNIST-a na rukom pisana slova. arXiv:1702.05373, (2017).
23. Gregor, K., Danihelka, I., Graves, A., Rezende, D. & Wierstra, D. DRAW: Rekurentna neuronska mreža za generiranje slika. U ICML, 1462–1471 (2015).
24. Friston, K. Načelo slobodne energije: Grubi vodič do mozga?. Trends Cogn. Sci. 13(7), 293–301 (2009).
25. Mirza, MB, Adams, RA, Friston, K. & Parr, T. Uvođenje Bayesovog modela selektivne pažnje temeljene na aktivnom zaključivanju. Sci. Rep. 9(1), 1–22 (2019).
26. Bylinskii, Z., Judd, T., Oliva, A., Torralba, A. i Durand, F. Što nam različite metrike evaluacije govore o modelima istaknutosti? IEEE Trans. Analni uzorak. Mach. Intell. 41(3), 740–757 (2018).
27. Itti, L. & Koch, C. Računalno modeliranje vizualne pažnje. Nat. Neurosci vlč. 2(3), 194–203 (2001).
28. Lamme, VAF Vidne funkcije koje stvaraju svjesno gledanje. Ispred. Psihologija, 11, (2020).
29. da Silva, MRD & Postma, M. Lutajući umovi, lutajući miševi: Praćenje računalnog miša kao metoda otkrivanja lutanja uma. Računanje. Pjevušiti. ponašaj se 112, 106453 (2020).
30. Schütz, AC, Braun, DI & Gegenfurtner, KR Pokreti očiju i percepcija: selektivni pregled. J. Vis. 11(5), 9–9 (2011).
31. Intoy, J. & Rucci, M. Fino usklađeni pokreti očiju povećavaju vidnu oštrinu. Nat. Komun. 11(1), 1–11 (2020).






