Prepoznavanje govora samoglasnika iz štakorske elektroencefalografije pomoću neuronske mreže dugog kratkoročnog pamćenja, dio 3
Dec 28, 2023
Klasifikatori strojnog učenja
Izvedba BiLSTM-a uspoređena je s konvencionalnim klasifikatorima strojnog učenja: SVM s linearnom jezgrom (SVM_lin), SVM s jezgrom funkcije radijalne baze (SVM_rbf), nasumične šume (RF), NB i KNN.
Nasumična šuma je algoritam strojnog učenja koji se trenutno široko koristi u različitim poljima analize podataka i predviđanja. U usporedbi s drugim algoritmima strojnog učenja, ima bolju robusnost i točnost, a također učinkovito smanjuje prekomjerno opremanje. Posljednjih godina opseg primjene nasumičnih šuma se širi, a može se koristiti čak i za predviđanje određenih sposobnosti ljudskog pamćenja.
U području kognitivne psihologije pamćenje je vrlo važan smjer istraživanja. Znanstvenici su tražili jednostavan i učinkovit način za procjenu razine ljudskog pamćenja. Posljednjih godina pojava nasumičnih šuma donijela je nove ideje i metode u ovo područje.
Random Forest može uvježbati model za predviđanje varijable, što može biti bilo što što želite predvidjeti, uključujući sposobnost pamćenja. Znanstvenici mogu unijeti relevantne čimbenike u nasumični šumski model kako bi predvidjeli koliko će osoba postići rezultate na testu pamćenja. Ti čimbenici mogu biti čimbenici poput dobi, razine obrazovanja, spola, težine itd. ili biološki pokazatelji poput strukture mozga. Prema istraživanjima, postoji određeni odnos između ovih čimbenika i ljudske sposobnosti pamćenja.
Prikupljanjem i analizom velikih količina testnih podataka od ispitanika, znanstvenici mogu izgraditi model koji predviđa sposobnost pamćenja u modelu slučajne šume. Predviđanje rezultata može pružiti vrijedne informacije o budućoj izvedbi ispitanika na određenom testu pamćenja.
Ukratko, algoritam nasumične šume znanstvenicima pruža novi način za procjenu razine ljudskog pamćenja. U budućnosti bi njegova primjena mogla igrati važnu ulogu u kognitivnoj psihologiji, neuroznanosti i drugim područjima. Imamo razloga vjerovati da kombinacija nasumičnih šuma i drugih tehnika može pružiti širu perspektivu i dublje razumijevanje istraživanja funkcije ljudskog mozga. Vidi se da moramo poboljšati pamćenje, a Cistanche deserticola može značajno poboljšati pamćenje, jer Cistanche deserticola također može regulirati ravnotežu neurotransmitera, poput povećanja razine acetilkolina i faktora rasta. Ove tvari su vrlo važne za pamćenje i učenje. Osim toga, meso također može poboljšati protok krvi i pospješiti opskrbu kisikom, što može osigurati da mozak dobije dovoljno hranjivih tvari i energije, čime se poboljšava vitalnost i izdržljivost mozga.

Kliknite na načine za poboljšanje rada mozga
SVM [74] ima za cilj odrediti optimalno odvojenu hiperravninu maksimiziranjem margine, što je udaljenost između nosivih vektora. Korištenjem trika s kernelom, SVM je sposoban mapirati prostor značajki od niske do visoke dimenzije; stoga može učinkovito izvršiti linearnu i nelinearnu klasifikaciju.
RF [75] radi konstruiranjem više stabala odlučivanja tijekom faze obuke i generiranjem konačne klase koja kombinira rezultate svakog stabla odlučivanja. NB [76, 77] je probabilistički klasifikator temeljen na Bayesovom teoremu i uvjetnoj vjerojatnosti koji obično pretpostavlja da su sve značajke neovisne jedna o drugoj.
KNN [78] je neparametarski pristup koji klasificira ulaz na temelju većinske klase njegovih k-najbližih susjeda u prostoru značajki. Obično se vrijednost k odabire kao neparan broj kako bi se izbjegle povezane klase.
Za obuku i procjenu gore navedenih modela strojnog učenja korišten je isti 10-CV kao u BiLSTM-u. Svi modeli strojnog učenja implementirani su pomoću biblioteke Scikit-Learn [73] u Pythonu.
Statističke analize
Sve statističke analize provedene su pomoću softvera SPSS (SPSS verzija 20.0, SPSS Inc., Armonk, NY, SAD) i softvera MATLAB verzija 2017b (Mathworks, Inc., MA, SAD).
Podaci su analizirani parametarskom statistikom budući da su svi podaci u studiji pokazali normalnu distribuciju u Shapiro–Wilkovom testu (p > 0,05). ANOVA je korištena za analizu statističke značajnosti TFR-ova prema različitim podražajima samoglasnika.
Osim toga, provedena je ANOVA ponovljenih mjerenja kako bi se usporedila izvedba svakog klasifikatora. Nakon toga, uparene usporedbe pomoću uparenih t-testova provedene su između BiLSTM mreže i drugih klasičnih klasifikatora strojnog učenja, a izvršena je i Bonferronijeva korekcija za prilagodbu inflacije stope pogreške tipa I.
Statistička značajnost p-vrijednosti postavljena je na 0.01 kada se uspoređuje TFR EEG odgovora, dok je razina značajnosti p-vrijednosti postavljena na 0,05 kada se uspoređuje izvedba između BiLSTM mreže i drugi klasifikatori strojnog učenja.
Rezultati
Auditivni evocirani potencijali kao odgovor na samoglasnike
Ukupno 19 štakora Sprague-Dawley podvrgnuto je operaciji implantacije epiduralne elektrode, a svi su štakori preživjeli operaciju. Kao rezultat toga, EEG odgovori na pet engleskih samoglasnika snimljeni su kod 19 štakora anesteziranih izofluranom. Da bi se izdvojili srednji AEP valni oblici, svi živčani odgovori su prosječno izračunati za subjekte za svaki podražaj. Slika 4 prikazuje prosječne AEP valne oblike za svaki glas samoglasnika iz bilateralnog AAF-a.
Kao što se očekivalo, svaki zvuk kategoričkog samoglasnika izazvao je različite neuralne aktivnosti u bilateralnom AAF-u s različitim vršnim amplitudama i latencijama. Vršna amplituda AEP-ova, definirana kao najveći zabilježeni napon nakon podražaja samoglasnika, bila je najmanja za /i/ (61,74 ㎶ u lijevom AAF-u i 61,27 ㎶ u desnom AAF-u), dok su AEP-ovi kao odgovor na /a/ pokazali najveće vršne amplitude (92,12 ㎶ u lijevom AAF-u i 90,18 ㎶ u desnom AAF-u).
Vršna latencija, definirana kao trajanje od početka podražaja do vršne amplitude bila je približno {{0}}.39 s do 0.5 s, najkraće u /i/(0. 39 s u lijevom i desnom AAF-u), a najduže u /o/ glasu (0,51 s u lijevom i desnom AAF-u). Kao što je prikazano na slici 4, slični AEP valni oblici uočeni su s lijevog i desnog AAF-a.

Vremensko-frekvencijska analiza EEG signala
Vremensko-frekvencijska analiza moćna je metoda za analizu nestacionarnih EEG signala u vremensko-frekvencijskoj ravnini i koristi se za pružanje kvalitativnih informacija za klasifikaciju EEG-a [79, 80]. Stoga je TFR velikog prosjeka EEG-a izračunat za svaki zvuk kako bi se identificirale promjene povezane s prepoznavanjem samoglasnika u veličini i fazi EEG oscilacija na određenim frekvencijama (Slika 5A).
Iz TFR analize primijećena je aktivacija velike snage oko delta (1–4 Hz), theta (4–8 Hz) i alfa (8–12 Hz) pojasa na 0.3–{{8} }.6 s od početka podražaja, bez obzira na stimulaciju zvukom govora.

Osim toga, proveden je ANOVA test s Bonferronijevom korekcijom kako bi se analizirale statistički značajne TFR komponente prema svakom vokalskom podražaju.
Nakon toga, snaga statistički značajnih područja (p < {{0}}.01) predstavljena je F-vrijednošću (Slika 5B). U analizi je većina frekvencijskih pojaseva EEG-a od 0,2–0,8 s bila značajno različita prema glasovnim podražajima.
Osim toga, dio TFR-a od {{0}}.8–1 s također je bio statistički različit za svaki podražaj. Uzimajući u obzir valne oblike AEP-a i rezultate ANOVA testova, zaključeno je da su AEP-ovi od 0.2–0.8 s nakon podražaja samoglasnika bili najinformativniji živčani odgovori i bili su povezani s prepoznavanjem zvuka samoglasnika.
Obuka modela i evaluacija BiLSTM mreža
Na temelju rezultata sa slike 5B, odabrani su EEG podaci koji su bili pojasno filtrirani između 1–60 Hz s vremenskim prozorom od 0.2–0,8 s. Zatim su z-rezultati odabranih EEG podataka korišteni kao ulaz u BiLSTM mrežu.
Svi EEG podaci podijeljeni su u 10 puta unutar svakog subjekta kako bi se procijenile BiLSTM mreže. Stoga je izvedba testa dobivena savijanjem uvježbanog modela s preostalim naborima u 10-CV shemi.
Učinkovitost mreže procijenjena je korištenjem metrike točnosti, f{{0}}rezultata i Cohenove kappa statistike κ (Slika 6 i Tablica 1). Prosječna točnost EEG diskriminacije od pet klasa BiLSTM mreže bila je 75,18 ± 7.06%, a f1-rezultat bio je 0.74 ± 0.08 . Cohenov κ bio je 0,68 ± 0,09, što je protumačeno kao umjereno slaganje [81].
Kako bi se detaljnije analizirala izvedba BiLSTM mreže, nacrtana je matrica zabune na slici 7. Ovo je pokazalo da su mnoge pogreške nastale zbog pogrešne klasifikacije EEG odgovora na /u/ kao /a/ i /e/ kao /o/. Međutim, mreža BiLSTM klasificirala je većinu EEG odgovora s više od 50% točnosti, što je visoka točnost u EEG klasifikaciji od pet klasa.

Usporedba BiLSTM mreže s drugim metodama strojnog učenja
Kako bi se potvrdila učinkovitost BiLSTM mreža u klasificiranju EEG-a za prepoznavanje zvukova samoglasnika, rezultati su uspoređeni s onima drugih konvencionalnih metoda strojnog učenja. Slika 6 i tablica 1 prikazuju izvedbu klasifikatora strojnog učenja.
RF je pokazao najveću točnost klasifikacije među konvencionalnim algoritmima strojnog učenja (točnost: 63,21 ± 7,41%, f1-rezultat: 0.62 ± 0.09, i Cohenov : 0.52 ± 0.1). U statističkoj analizi, klasifikacijska izvedba RF-a nije bila značajno viša od one za SVM_lin i SVM_rbf, dok je pokazala veću izvedbu u usporedbi s onima za NB i KNN.
Međutim, kada je izvedba konvencionalnih algoritama strojnog učenja, uključujući RF, uspoređena s BiLSTM, bilo je očito da je BiLSTM mreža bolja za sve metrike korištene u studiji (p < 0.01).
U matrici zabune, konvencionalni algoritmi strojnog učenja ne mogu dobro razlikovati određene EEG odgovore. Konkretno, svi konvencionalni algoritmi strojnog učenja imali su poteškoća u razlikovanju glasa /u/. Primijećeno je da su algoritmi pokazali tendenciju pogrešnog klasificiranja glasa /u/ kao /a/ u prosjeku 30% vremena (25,96% u NB do 36,97% u KNN), što je rezultiralo smanjenjem ukupne izvedbe klasifikacije (Slika 7) .

Rasprava
U ovoj studiji epiduralni EEG odgovori štakora na pet kategoričkih samoglasnika (/a/, /e/, /i/, /o/ i/u/) razlikovani su korištenjem BiLSTM mreže. Klasifikacije epiduralnih EEG signala u pet klasa provedene su na temelju jednog pokusa, što je poznato kao izazovno. Kako bi se maksimizirala izvedba učenja, ova je studija pokušala odrediti specifične komponente EEG-a koje bi mogle biti povezane s prepoznavanjem govornih zvukova u mozgu štakora i upotrijebila te komponente EEG-a kao ulazne značajke. Kao rezultat toga, korištenjem BiLSTM postignuta je relativno visoka izvedba u klasificiranju AEP-ova u pet različitih samoglasnika. Usporedba učinkovitosti klasifikacije BiLSTM mreže s drugim algoritmima strojnog učenja pokazala je da je BiLSTM mreža nadmašila druge klasične klasifikatore. Ovi rezultati pokazuju da BiLSTM mreža obučena s komponentama EEG-a povezanim s prepoznavanjem govora pouzdano klasificira AEP-ove za svaki kategorički glas samoglasnika s visokim stupnjem točnosti. Koliko znamo, LSTM mreže nisu primijenjene na klasifikaciju EEG odgovora na slušne podražaje, a ovo je prva studija koja koristi algoritam dubokog učenja za analizu EEG signala iz AAF štakora.

Trenutno je samo nekoliko studija koristilo LSTM arhitekturu za postizanje najsuvremenijih rezultata u klasifikaciji temeljenoj na EEG-u. Arhitektura LSTM prikladna je za klasifikaciju temeljenu na EEG-u jer njezina lančana struktura može uhvatiti vremenski slijed EEG podataka [82]. U početku su istraživanja usmjerena na poboljšanje rezultata klasifikacije kroz različite LSTM arhitekture; međutim, ulazne značajke i dalje su ekstrahirane ručno, kao u konvencionalnim metodama strojnog učenja [83, 84].
Tsiouris i sur. procijenili su izvedbu različitih kombinacija LSTM mrežnih elemenata kako bi pronašli najučinkovitije LSTM arhitekture za otkrivanje epileptičkih napadaja, čime su dobili gotovo savršene rezultate u predviđanju napadaja (100% osjetljivost i 99.86% specifičnost) [83]. Budući da je LSTM moćna struktura za obradu sekvencijalnih podataka, neke studije koriste neobrađene EEG podatke kao ulazne značajke uz minimalnu prethodnu obradu. Kako LSTM mreža izravno uči značajke iz neobrađenih EEG podataka, izvedba u studijama prepoznavanja emocija poboljšana je za najmanje 12% [85], a rezultati studija klasifikacije motornih slika također su poboljšani [86], u usporedbi s drugim tradicionalnim tehnike izdvajanja obilježja.
Štoviše, BiLSTM arhitektura korištena je za klasifikaciju temeljenu na EEG-u jer može pristupiti informacijama iz prošlih i budućih stanja. Stoga, neotkrivajući različita stanja mozga koja se odražavaju u EEG podacima, kao što su napadaji, spavanje, itd. [63-67], mreža BiLSTM općenito je nadmašila mrežu LSTM koja bilježi samo prošle informacije iz niza u smjeru naprijed. Iz tog razloga, visoka učinkovitost je prijavljena u nedavnoj klasifikaciji temeljenoj na EEG-u korištenjem BiLSTM mreža. Sharma i sur. postigao je 82,01% točnosti klasifikacije za četiri vrste emocija na temelju BiLSTM algoritma i statistike višeg reda [87]. Osim toga, mreže BiLSTM uspješno su klasificirale tipove epilepsije i faze spavanja [88, 89].
Slično prethodnim studijama, ova studija je postigla relativno dobre rezultate koristeći BiLSTMnetworks. Predloženi algoritam uspješno je razlikovao EEG odgovore na pet zvukova samoglasnika s visokim vrijednostima točnosti, f{{0}}rezultatom i Cohenovim κ od 75,18%, 74,43%, odnosno 0.68. Vrijednost Cohenovog κ za klasifikaciju od pet klasa veća je od one koja se vidi u većini suvremenih studija [90]. Kao što je prikazano na slici 6, metoda BiLSTM proizvela je najveću vrijednost za sve metrike u usporedbi s drugim metodama strojnog učenja. Osim toga, kako bi se odredila statistička razlika u učinkovitosti klasifikacije, ponovljeno izmjereni rezultati ANOVA analizirani su između BiLSTM i drugih klasičnih metoda strojnog učenja koristeći sve tematske vrijednosti. Statističkom analizom utvrđeno je da je klasifikacijska izvedba BiLSTM mreže značajno viša od one kod drugih klasičnih metoda strojnog učenja (p < 0,01). Ovaj je rezultat također bio u skladu s matricom zabune. Kao što je prikazano na slici 7, BiLSTM mreža je dobro predvidjela prave oznake pet glasova samoglasnika, dok klasične metode strojnog učenja nisu.
Predviđanje dobiveno konvencionalnim klasifikatorom strojnog učenja bilo je posebno loše u klasificiranju glasa /u/; glas /u/ uglavnom je pogrešno protumačen kao /a/. Čak je i RF, koji je pokazao najbolju izvedbu među pet konvencionalnih klasifikatora strojnog učenja, imao stopu klasifikacije od 34,48% za glas/u/, sa stopom pogrešne klasifikacije glasa /u/ kao glasa /a/ od 33,89%. Kao što se može vidjeti na slici 4, zvukovi /a/ i /u/ imali su sličnu vršnu latenciju, što je jedna od glavnih karakteristika AEP valnih oblika (vršna latencija zvuka /a/: 0.448, vršna latencija zvuka /u/: 0.444). Kada je klasifikacija obavljena na temelju minimalno prethodno obrađenih EEG signala jednog pokušaja, čini se da se takve sličnosti ne mogu razlikovati konvencionalnim algoritmima strojnog učenja, dok je BiLSTM mreža mogao ih razlikovati.
S obzirom da BiLSTM mreža može istovremeno pristupiti svim prošlim i budućim kontekstima, bogate informacije mogu se naučiti kroz ovu mrežu. Osim toga, iako su značajke koje odražavaju karakteristike EEG odgovora na svaki glas samoglasnika ekstrahirane izravno iz smjerova naprijed i nazad sloja LSTM, izvedba klasifikacije je poboljšana. U ovoj studiji možemo izvući dobre rezultate klasifikacije koristeći jednostavnu BiLSTM arhitekturu bez dodatnog ručno izrađenog procesa ekstrakcije značajki.
Klasificiranje odgovora ERP-a na govorne podražaje u jednom pokusu vrlo je izazovno zbog karakteristika niskog SNR-a EEG-a. Iako je jedna od ključnih prednosti metode dubinskog učenja njezina sposobnost učenja značajki visoke razine bez ekstrakcije hardcore značajki, pokušali smo odabrati najrelevantnije EEG signale povezane s prepoznavanjem govora kako bismo postigli bolju izvedbu. U ovoj studiji, različiti valni oblici AEP-a koji odgovaraju svakom govornom zvučnom podražaju uočeni su s visokom aktivacijom niskofrekventnog pojasa, uključujući delta, theta i alfa pojaseve, u TFR analizama. Opće je poznato da neuronske oscilacije u alfa pojasu igraju važnu ulogu u slušnoj obradi. Mazaheri et al. izvješćuju da je slabljenje alfa aktivnosti usko povezano s razlikovanjem slušnih ciljeva [91].
Staruß i sur. dokazao je da su kortikalne alfa oscilacije ključni mehanizam za selektivnu inhibiciju obrade buke za poboljšanje slušne selektivne pozornosti prema ciljnim signalima [92]. Prethodno smo također otkrili da je alfa snaga visoko aktivirana u bilateralnim temporalnim područjima nakon specifičnih zvučnih podražaja koji su se statistički razlikovali u smislu vrste zvuka [48]. Osim toga, poznato je da su delta i theta vrpce povezane s oblikovanjem segmentacije i perceptivnog utjecaja akustičnih informacija [93].
Iako se ova studija temelji na eksperimentalnim podacima na životinjama, slične komponente povezane s govorom, u usporedbi s prethodnim studijama na ljudskim subjektima, primijećene su u analizama TFR-a. Štoviše, u statističkoj analizi, sve EEG trake su bile značajne unutar 1 je bio sigurniji od podražaja i predstavljao je komponente EEG-a povezane s percepcijom zvuka. Ovi rezultati bili su donekle drugačiji od onih iz prethodnih studija, sugerirajući da su samo specifični EEG pojasovi, kao što je alfa pojas, povezani s percepcijom zvuka. Očekuje se da se čak i suptilne promjene u svim aktivnostima EEG pojasa bilježe putem epiduralnog EEG snimanja jer osigurava veći SNR smanjenjem vodljivosti volumena i uklanjanjem artefakata koji su svojstveni ekstrakranijalnim EEG snimkama.
U ovoj studiji utvrđene su komponente EEG-a štakora povezane s prepoznavanjem zvuka govora i komponente AEP-a uspješno su klasificirane korištenjem BiLSTM mreže. Međutim, ova je studija imala neka ograničenja. Prvo, broj uključenih predmeta bio je premalen, posebno za duboko učenje. Štoviše, ova studija nije procijenila izvedbu svakog klasifikatora s vanjskom provjerom valjanosti, već je umjesto toga upotrijebila 10-CV za prevladavanje ograničenih veličina uzorka. Osim toga, ne možemo isključiti mogućnost da slušni sustav štakora kontinuirano reagira na zvuk budući da je u ovoj studiji korišten samo jedan izgovor svakog samoglasnika. Osim toga, učinci anestetika utjecali su na stečene EEG odgovore. Iako je korištena minimalna doza anestetika, usporavanje frekvencije s povećanjem delta snage tipičan je nalaz EEG promjena nakon inhalacije izoflurana [94]. Stoga se komponente EEG-a za prepoznavanje samoglasnika predložene u ovoj studiji mogu razlikovati od EEG signala dobivenih od štakora koji su budni. Međutim, vjerujemo da je kvaliteta EEG signala dovoljno dobra budući da je EEG snimljen putem implantacije epiduralne elektrode i nije kontaminiran artefaktima kretanja.
Zaključci
Zaključno, ova je studija izdvojila značajne neuralne komponente povezane s kategoričkom percepcijom govora. Nadalje, na temelju karakteristika LSTM mreža, dokazano je da je BiLSTM mreža prikladna za klasifikaciju EEG odgovora s minimalno prethodno obrađenim AEP-ovima. Budući da je ovo istraživanje pionirsko istraživanje s podacima o životinjama, možda se neće izravno prenijeti na druge praktične primjene kao što su sučelja mozak-računalo ili alternativna komunikacijska pomagala za ljude.

Stoga su potrebne buduće studije s ljudskim EEG podacima kako bi se potvrdila učinkovitost BiLSTM mreže u klasificiranju slušnog prepoznavanja govora temeljenog na EEG-u. Osim toga, potrebno ga je ponovno procijeniti za optimalno podešavanje parametara i izdvajanje značajki. Očekuje se da će ova studija pružiti novi pristup analizi EEG signala, kao i vrijedne informacije o mehanizmima percepcije i prepoznavanja govora u mozgu.

Reference
1. Wernicke C. Kompleks simptoma afazije. U: Cohen RS, Wartofsky MW, urednici. Zbornik radova Bostonskog kolokvija za filozofiju znanosti 1966./1968. Dordrecht: Springer Nizozemska;1969. str. 34–97.
2. Shi Z, Yan S, Ding Y, Zhou C, Qian S, Wang Z, et al. Prednje slušno polje potrebno je za kategorizaciju zvuka u zadatku uvjetovanja straha kod odraslih štakora. Front Neurosci. 2019.; 13: 1374.
3. Liberman AM, Harris KS, Hoffman HS, Griffith BC. Razlikovanje govornih glasova unutar i preko granica fonema. J Exp Psychol. 1957; 54: 358–368.
4. Johnson K. Akustična i slušna fonetika. Chichester: Wiley-Blackwell; 2012.
5. Green PA, Brandley NC, Nowicki S. Kategorička percepcija u komunikaciji i donošenju odluka kod životinja. Behav Ecol. 2020.; 31: 859–867.
6. Craik A, He Y, Contreras-Vidal JL. Duboko učenje za zadatke klasifikacije elektroencefalograma (EEG): pregled. J Neural Eng. 2019.; 16:28.
7. Na¨a¨ta¨nen R, Paavilainen P, Rinne T, Alho K. Nepodudarnost negativnosti (MMN) u osnovnim istraživanjima središnje slušne obrade: pregled. Klinička neurofiziologija. Elsevier; 2007. str. 2544–2590.
8. Garrido MI, Kilner JM, Stephan KE, Friston KJ. Nepodudarnost negativnosti: pregled temeljnih mehanizama. Klinička neurofiziologija. Elsevier; 2009. str. 453–463
For more information:1950477648nn@gmail.com






