Prepoznavanje govora samoglasnika iz štakorske elektroencefalografije pomoću neuronske mreže dugog kratkoročnog pamćenja, 1. dio

Dec 27, 2023

Sažetak

Tijekom godina provedena su značajna istraživanja kako bi se istražili mehanizmi percepcije i prepoznavanja govora.

Između percepcije govora i pamćenja postoji neodvojiva veza. Percepcija govora važna je sposobnost da budemo svjesni audio signala, a pamćenje je važan način na koji se koristimo za pohranjivanje i dohvaćanje informacija. Kada bolje percipiramo govor, bolje smo i zapamtiti informacije koje čujemo.

Istraživanja pokazuju da je odnos između percepcije govora i pamćenja dvosmjeran. S jedne strane, loša percepcija govora može dovesti do oštećenja pamćenja. To je zato što kada ne možemo jasno čuti govor, ne možemo se točno sjetiti informacija koje smo čuli. S druge strane, snažna percepcija govora može poboljšati naše pamćenje. Kada možemo ispravno percipirati i razumjeti govor, lakše možemo zapamtiti i ono što čujemo.

Stoga bismo se trebali usredotočiti na kultiviranje vještina percepcije govora kako bismo poboljšali svoje pamćenje. To se može postići vježbanjem naših vještina slušanja i razumijevanja govora. Svoju percepciju govora i pamćenje možemo poboljšati aktivnostima kao što su slušanje snimaka, gledanje filmova i pohađanje tečajeva jezika.

Ukratko, postoji tijesan odnos između percepcije govora i pamćenja i trebali bismo se usredotočiti na kultiviranje vještina percepcije govora kako bismo poboljšali svoje pamćenje. Aktivnim treningom i vježbanjem možemo kontinuirano poboljšavati razinu percepcije govora te bolje razumjeti i zapamtiti ono što čujemo. Vidi se da moramo poboljšati pamćenje, a Cistanche deserticola može značajno poboljšati pamćenje, jer Cistanche deserticola također može regulirati ravnotežu neurotransmitera, poput povećanja razine acetilkolina i faktora rasta. Ove tvari su vrlo važne za pamćenje i učenje. Osim toga, meso također može poboljšati protok krvi i pospješiti opskrbu kisikom, što može osigurati da mozak dobije dovoljno hranjivih tvari i energije, čime se poboljšava vitalnost i izdržljivost mozga.

increase brain power

Pritisnite Know za poboljšanje kratkoročnog pamćenja

Elektroencefalografija (EEG) moćan je alat za utvrđivanje aktivnosti mozga; stoga se naširoko koristi za određivanje neuralne osnove prepoznavanja govora.

Konkretno, za klasifikaciju prepoznavanja govora, pristupi temeljeni na dubokom učenju su u središtu pozornosti jer mogu automatski učiti i izdvajati reprezentativne značajke kroz učenje od kraja do kraja.

Ovo je istraživanje imalo za cilj identificirati određene komponente koje su potencijalno povezane s reprezentacijom fonema u mozgu štakora i razlikovati moždanu aktivnost za svaki podražaj samoglasnika na temelju jednog pokušaja korištenjem mreže dvosmjernog kratkoročnog pamćenja (BiLSTM) i klasičnih metoda strojnog učenja.

Korišteno je devetnaest mužjaka Sprague-Dawley štakora podvrgnutih operaciji implantacije mikroelektroda za snimanje EEG signala iz bilateralnih prednjih slušnih polja. Odabrano je pet različitih podražaja govora samoglasnika, /a/, /e/, /i/, /o/ i /u/, koji imaju vrlo različite frekvencije formanata. EEG snimljen pod nasumično danim podražajima samoglasnika minimalno je prethodno obrađen i normaliziran transformacijom z-rezultata da bi se koristio kao ulaz za klasifikaciju prepoznavanja govora.

BiLSTM mreža pokazala je najbolju izvedbu među klasifikatorima postigavši ​​ukupnu točnost, f{{0}}rezultat i Cohenove κ vrijednosti od 75,18%, 0,75, odnosno 0,68, korištenjem 10-pristupa unakrsne provjere.

Ovi rezultati pokazuju da LSTM slojevi mogu učinkovito modelirati sekvencijalne podatke, kao što je EEG; stoga se informativne značajke mogu izvesti putem BiLSTM-a obučenog s end-to-end učenjem bez ikakvih dodatnih ručno izrađenih metoda ekstrakcije značajki.

Uvod

Govor prenosi ogromne količine informacija u mozak, a jedna je od tipičnih značajki mozga da prepozna i kategorizira zvukove životinja koje se ponašaju.

S obzirom na njegovu važnost, pokušaji istraživanja mehanizama prepoznavanja zvuka govora provode se više od 100 godina. Jedno od prvih neurolingvističkih istraživanja prepoznavanja govora provedeno je kroz opservacijsku studiju 1870-ih od strane njemačkog neuropsihijatra koji je otkrio ključnu ulogu gornjeg temporalnog girusa u percepciji govora, zaključivši da su nedostaci u prepoznavanju govora povezani s oštećenjem lijevog gornjeg temporalnog girusa [ 1].

Sada je poznato da se prepoznavanje govora pretežno oslanja na dorzolateralne temporalne režnjeve, uključujući gornji temporalni girus, koji sadrži primarni slušni korteks (A1) i prednje slušno polje (AAF) [2].

increase memory

Iako je način na koji se fonemi kodiraju i interpretiraju u mozgu i dalje kontroverzan, široko je prihvaćeno da je prepoznavanje zvuka kategorično. To jest, razlikovanje je bolje za podražaje koji pripadaju različitim fonetskim kategorijama nego za podražaje koji pripadaju istoj kategoriji, čak i ako su akustičke razlike ekvivalentne [3, 4].

Ne samo ljudi, već i perceptivni sustavi životinja sortiraju zvučne podražaje koji kontinuirano variraju u skup diskretnih kategorija [5].

S napretkom u neurofiziološkim studijama, elektroencefalografija (EEG) se široko koristi u istraživanjima koja uključuju neuroznanost i neuralni inženjering [6].

Visoka vremenska rezolucija i osjetljivost na različita funkcionalna stanja mozga čine EEG moćnim alatom za istraživanje moždane aktivnosti u stvarnom vremenu, a postoji sve veći interes za rasvjetljavanjem neuralne osnove za kategoričku percepciju. Tradicionalno, EEG signali se snimaju neinvazivno sa vlasišta u studijama na ljudima. Na razini percepcije zvuka ili govora, negativnost neusklađenosti (MMN), komponenta slušnog evociranog potencijala (AEP), koju izazivaju čudni zvukovi, široko se koristi za proučavanje neuralnih korelata kategoričke percepcije [7, 8]. Naatanen i sur. pronašao dokaze za reprezentacije samoglasnika ovisne o jeziku u ljudskom mozgu [9].

Druga studija ispitivala je kategoričku percepciju leksičkih tonova i otkrila da je kontrast među kategorijama izazvao veći MMN nego razlika unutar kategorije [10]. U pokusima na životinjama točniji EEG signali dobiveni su invazivnim postupcima.

Na primjer, neuralni korelati kategoričke percepcije i neuralne reprezentacije različitih zvukova proučavani su korištenjem izvanstaničnog snimanja akcijskog potencijala.

Neuroni ptica pjevica koji projiciraju strijatum pokazuju kategoričke slušne reakcije i vrlo su osjetljivi na promjene u trajanju note [11]. Osim toga, Kilgard et al.proučavali su različite živčane reprezentacije suglasnika i samoglasnika koristeći intraparenhimsko snimanje u mozgu štakora. Snimajući više- i pojedinačne odgovore iz donjeg kolikulusa i A1, sugerirali su da šiljasto brojanje kodira zvukove samoglasnika, dok šiljasto mjerenje vremena kodira suglasnike [12, 13].

Učinci treninga razlikovanja zvuka u štakorskom modelu autizma također su istraženi na temelju prethodnih otkrića u korelaciji neuralnih odgovora na zvučne podražaje sa sposobnošću percepcije zvuka [14].

Štoviše, nedavna studija pokazala je da elektrokortikografija snimljena višekanalnim nizom korelira s pasivnom izloženošću specifičnom zvuku čak i u slušnom korteksu anesteziranih štakora [15].

Pristupi strojnog učenja korišteni su za praktičnu upotrebu EEG-a u velikom broju studija. Korištenje metoda strojnog učenja omogućuje istraživanje bogatih informacija koje su svojstvene i teško ih je otkriti iz EEG signala [6].

Stoga se klasifikacija temeljena na EEG-u može izvesti u sljedećim poljima putem konvencionalnih algoritama strojnog učenja (npr. stroj potpornih vektora (SVM), k-najbliži susjedi (KNN) i naivni Bayes (NB)): motoričke slike, prepoznavanje emocija, otkrivanje mentalnih bolesti, otkrivanje potencijala povezanog s događajima (ERP), i tako dalje [16, 17].

improve your memory

Nadalje, posljednjih godina, zahvaljujući sve većem napretku jedinica za grafičku obradu i dostupnosti velikih skupova podataka, postalo je moguće provesti klasifikaciju temeljenu na EEG-u korištenjem različitih mreža dubokog učenja [6, 18, 19]. U usporedbi s konvencionalnim metodama strojnog učenja , mreže dubokog učenja mogu automatski otkriti i izdvojiti odgovarajuće prikaze iz ulaznih podataka [20, 21].

Stoga, čak i uz nedovoljno prethodnog stručnog znanja, obećavajući rezultati mogu se dobiti putem algoritama dubinskog učenja koji ne zahtijevaju dodatni ručno izrađeni proces ekstrakcije značajki [22, 23].

Na primjer, u području govora, slika i videa, rezultati su značajno poboljšani primjenom algoritama dubokog učenja [24-26]. Međutim, nije jasno prate li tako izvrsni rezultati uvijek EEG klasifikacijsku domenu kada se koriste pristupi dubokog učenja umjesto tradicionalnih metoda strojnog učenja [27].

Roy i suradnici pokazali su da je u većini studija (isključujući četiri od 102 studije) pristup dubokog učenja doveo do boljeg učinka od tradicionalnog pristupa strojnog učenja, a najveće poboljšanje u točnosti bilo je 35,3% [18, 28].

Nadalje, među različitim poljima klasifikacijskih studija temeljenih na EEG-u, ERP klasifikacijske studije aktivno se provode primjenom metoda konvencionalnog strojnog učenja i dubinskog učenja.

U ranoj studiji, tradicionalna metoda velikog prosjeka korištena je za poboljšanje niskog omjera signala i šuma (SNR), jednog od ograničenja EEG signala, i za dobivanje ERP signala.

U tim je studijama nekoliko ERP komponenti tretirano kao skupovi značajki za klasifikaciju [29, 30]. U studijama na životinjama, ERP značajke kao što su vršna amplituda i latencija također se koriste za razlikovanje ERP signala [31, 32].

Međutim, EEG klasifikacija temeljena na jednom pokusu također je dobila veliku pozornost, jer je poznato da EEG podaci na razini jednog pokusa posjeduju više funkcionalnih i bogatijih informacija od ERP signala dobivenih tradicionalnom metodom velikog prosjeka [33, 34].

Stoga su u kasnijim studijama značajke izdvojene različitim algoritmima kao što su algoritmi temeljeni na valićima [35], Gaussovi modeli mješavine [36] i prostorno filtriranje [37] za klasifikaciju korištenjem konvencionalnih metoda strojnog učenja [38, 39]. Međutim, izdvajanje optimalnog ručno izrađenih značajki iz jednog probnog EEG-a oduzima puno vremena i rada jer se moraju izvršiti dodatni koraci obrade. U tom kontekstu, metode dubokog učenja mogu ublažiti ovaj problem dopuštajući učenje od kraja do kraja.

Najraširenija arhitektura dubokog učenja je konvolucijska neuronska mreža (CNN), a slijedi je rekurentna neuronska mreža (RNN). CNN je posebna vrsta arhitekture dubokog učenja koja se naširoko koristi za klasifikaciju temeljenu na EEG-u u jednom pokusu [6]. Unosi CNN-a izvedeni su iz neobrađenih ili prethodno obrađenih EEG podataka, prvenstveno u sljedećem obliku: broj kanala × broj vremenskih točaka u jednom pokusu.

Štoviše, pokazani su značajni rezultati klasifikacije i poznato je da ima najbolje rezultate kada se kao ulaz koriste slike spektrograma [40-44]. Za razliku od CNN-a, RNN je vrlo poželjna arhitektura, posebno kada se rukuje sekvencijalnim podacima (kao u aplikacijama za obradu prirodnog jezika) jer rekurentna veza RNN arhitekture učenja omogućuje rekurzivno korištenje prethodnih informacija mreže kao trenutnih ulaznih podataka [45 ].

Dugo kratkoročno pamćenje (LSTM) vrsta je RNN arhitekture koju su predložili Hochreiter i Schmidhuber za prevladavanje problema eksplozivnog i nestajajućeg gradijenta RNN-a [46]. Dvosmjerni LSTM (BiLSTM) daljnji je razvoj LSTM-a koji kombinira naprijed i natrag skrivene slojeve za pristup i prethodnim i sljedećim informacijama.

Iako je BiLSTM model puno složeniji i možda će mu trebati dodatna računalna snaga, očekuje se da će bolje riješiti zadatak sekvencijalnog modeliranja i klasifikacije nego LSTM [47].

Prethodno smo pokušali klasificirati EEG signale na temelju jednog pokušaja za tri glasa samoglasnika, /a/,/o/ i /u/, koristeći tehnike strojnog učenja za ljudski mozak.

Nakon primjene odgovarajućih algoritama za obradu signala, uključujući dekompoziciju multivarijatnog empirijskog načina (MEMD), EEG odgovori su učinkovito klasificirani prema svakom zvuku samoglasnika pomoću klasifikatora linearne diskriminacijske analize (LDA). Iz vremensko-frekvencijske reprezentacije (TFR) EEG signala, također je utvrđeno da su komponente alfa vrpce najsrodnije živčane reakcije percepcije zvuka samoglasnika [48].
Međutim, zbog niskog SNR-a ljudskih EEG signala, reprezentaciju fonema u mozgu potrebno je dodatno procijeniti invazivnijom tehnikom snimanja, što omogućuje dobivanje pouzdanijih EEG signala.

Osim toga, potrebno je provesti daljnja istraživanja o učinkovitosti klasifikacije svakog algoritma strojnog učenja u klasifikaciji EEG odgovora na različite foneme.

Primarna svrha ove studije bila je odrediti specifične komponente EEG-a koje bi mogle biti povezane s govornom reprezentacijom u mozgu štakora kako bi se dodatno rasvijetlili odgovori mozga na prepoznavanje zvuka govora.

Kako bi se dobili točniji EEG signali, epiduralni EEG signali kao odgovor na slušne podražaje snimljeni su u AAF, za koji je poznato da ima bitnu ulogu u slušnoj percepciji i kategorizaciji [2]. Osim toga, ova je studija pokušala razlikovati različite odgovore mozga za svaki zvuk govora na temelju jednog pokušaja koristeći LSTM mreže i druge konvencionalne tehnike strojnog učenja.

Pretpostavlja se da bi mreža BiLSTM bila prikladna za klasifikaciju EEG odgovora na glasovne podražaje i da bi nadmašila druge klasične klasifikatore jer mreža može robusno raditi u modeliranju dugoročnih ovisnosti sekvencijalnih podataka kao što je EEG. Koliko je autoru poznato, LSTM mreže nisu primijenjene na klasifikaciju EEG odgovora na slušne podražaje, a ovo je prva studija koja koristi algoritam dubokog učenja za analizu epiduralnih EEG signala iz AAF.

improving brain function

Štoviše, korištenjem algoritma dubokog učenja, EEG odgovori su klasificirani kao slušni podražaji korištenjem end-to-end učenja s minimalno prethodno obrađenim EEG signalima bez dodatnih metoda ekstrakcije značajki.


For more information:1950477648nn@gmail.com


Mogli biste i voljeti