Predviđanje klasifikacije raka dojke na temelju strojnog učenja
Sep 12, 2023
Rak dojke najčešća je i najsmrtonosnija vrsta raka na svijetu. Na temelju algoritama strojnog učenja kao što su XGBoost, slučajna šuma, logistička regresija i K-najbliži susjed, ovaj rad uspostavlja različite modele za klasifikaciju i predviđanje raka dojke, kako bi pružio referencu za ranu dijagnozu raka dojke. Prisjećanje ukazuje na vjerojatnost otkrivanja stanica raka u medicinskoj dijagnozi, što je od velike važnosti za klasifikaciju raka dojke, tako da ovaj članak uzima prisjećanje kao primarni indeks procjene i razmatra preciznost, točnost i ocjenu F1-boda pokazatelji za procjenu i usporedbu učinka predviđanja svakog modela. Kako bi se eliminirao utjecaj različitih dimenzionalnih koncepata na učinak modela, podaci su standardizirani.
Algoritam K najbližeg susjeda jedan je od najosnovnijih algoritama u području strojnog učenja. Njegova glavna ideja je pronaći K uzorke najbliže ciljnom uzorku, a zatim predvidjeti oznaku ciljanog uzorka na temelju oznaka tih K uzoraka. U ljudskom svakodnevnom životu često koristimo slične metode za donošenje odluka. Na primjer, kad se suočimo s određenim problemom, prisjećamo se sličnih situacija s kojima smo se već susretali, zatim tražimo najsličnije situacije i donosimo odluke na temelju njihovih rezultata. Razviti rješenja. Stoga je algoritam K najbližeg susjeda usko povezan s ljudskom memorijom.
Prije svega, K algoritam najbližeg susjeda zahtijeva veliki broj skupova za obuku za učenje i uspostavljanje strukture podataka grafa najbližeg susjeda. Slično tome, ljudi moraju neprestano doživljavati razne stvari i ta iskustva pohranjivati u sjećanju. Samo skupljanjem velikog iskustva i znanja možemo točnije donositi odluke i prosuđivati.
Drugo, algoritam K najbližeg susjeda naglašava utjecaj sličnosti na predviđanje. Slično tome, kada donose odluke, ljudi često prvo razmatraju prošla iskustva i pokušavaju pronaći iskustva slična trenutnoj situaciji kao referencu. Ovaj proces pronalaženja sličnosti također je jedna od važnih karakteristika pamćenja.
Konačno, u K algoritmu najbližeg susjeda, vrijednost K ima veliki utjecaj na rezultate predviđanja. Različite vrijednosti K dovest će do različitih rezultata predviđanja. Slično tome, kada se ljudi prisjećaju prošlih iskustava, trebaju odabrati različite referentne točke i metode ovisno o trenutnoj situaciji. Ova fleksibilnost i prilagodljivost također je važna karakteristika pamćenja. Vidi se da moramo poboljšati pamćenje. Cistanche deserticola može značajno poboljšati pamćenje jer je Cistanche deserticola tradicionalni kineski ljekoviti materijal s brojnim jedinstvenim učincima, a jedno od njih je poboljšanje pamćenja. Djelotvornost mljevenog mesa dolazi od raznih aktivnih sastojaka koje sadrži, uključujući kiseline, polisaharide, flavonoide itd. Ovi sastojci mogu na različite načine promicati zdravlje mozga.

Pritisnite Know za poboljšanje kratkoročnog pamćenja
Kako bi se pronašao optimalni podskup i poboljšala točnost modela, 15 značajki je odabrano kao ulaz u model kroz Pearsonov test korelacije. Model K-najbližeg susjeda koristi metodu unakrsne provjere za odabir optimalne vrijednosti k korištenjem prisjećanja kao indeksa procjene. Za problem neravnoteže pozitivnog i negativnog uzorka koristi se metoda hijerarhijskog uzorkovanja za izdvajanje skupa za obuku i skupa za testiranje proporcionalno prema različitim kategorijama. Eksperimentalni rezultati pokazuju da će pod različitim podjelama skupova podataka (8:2 i 7:3), učinak predviđanja istog modela imati različite promjene. Komparativna analiza pokazuje da XGBoost model uspostavljen u ovom radu (koji dijeli set za vježbanje i set za testiranje s 8:2) ima bolje učinke, a njegov prisjećanje, preciznost, točnost i F1-rezultat su 1.{{ 11}}, 0.960, 0.974, odnosno 0,980.
1. Uvod
U posljednjih deset godina, incidencija raka dojke u Kini porasla je za 47%, a incidencija raste iz godine u godinu, a incidencija raka dojke postupno je mlađa [1]. Patogeneza raka dojke povezana je s osobnim hormonima, obiteljskom poviješću, brakom i poviješću rađanja [2]. Karcinom dojke nije lako otkriti u ranom stadiju i ima karakteristike ranog početka, ali kasne prezentacije [3, 4]. Trenutno se glavna dijagnoza raka dojke temelji na tri metode: punkcijska citologija [5], ultrazvučno skeniranje [6] i rendgenska mamografija [7]. Ako se kod pacijentice rano otkrije rak dojke, veća je vjerojatnost da će se izliječiti i bolja je prognoza. Stoga su redoviti pregledi i rana dijagnoza prijeko potrebni za prevenciju i pravovremeno otkrivanje raka dojke.
U medicinskom području, uspostavljanje modela putem metoda strojnog učenja može pomoći liječnicima u poboljšanju stope otkrivanja raka, kako bi se postigla svrha ranog otkrivanja i ranog liječenja. Metode strojnog učenja dale su dobre rezultate u dijagnostici raka [8, 9]. Wu i sur. [10] promatrali su morfologiju stanica pod mikroskopom i otkrili da postoje očite razlike između stanica raka dojke i parametara normalnih zdravih stanica. Ovo otkriće daje teorijsku osnovu za mnoga istraživanja. Iako postoje mnoge metode strojnog učenja koje se trenutno primjenjuju na klasifikaciju stanica raka dojke, niti jedan algoritam ne može se primijeniti na sve probleme. Svaka vrsta algoritma strojnog učenja ima svoja područja stručnosti, tako da je izbor algoritma različit u različitim scenarijima.
Shen i sur. [11] koristili su model XGBoost za klasifikaciju i predviđanje raka dojke, a točnost je dosegla 97.86%, a prisjećanje je doseglo 95,83%. Deng i sur. [12] koristili su algoritam XGBoost za klasifikaciju i predviđanje raka dojke s točnošću od 0.96 i prisjećanjem od 0.97. Monirujjaman Khan i sur. [13] koristili su više modela strojnog učenja za prepoznavanje raka dojke, a nasumična šuma, stablo odlučivanja, K-najbliži susjed i logistička regresija bili su algoritmi s višim F1- rezultatom, 96%, 95%, 90%, odnosno 98%. Bhardwaj i sur. [14] koristili su višeslojni perceptron (MLP), K-najbliži susjed (KNN), genetski algoritam (GP) i slučajnu šumu (RF) za klasifikaciju benignih i malignih stanica raka dojke, a eksperimentalni rezultati su pokazali da je optimalni klasifikator RF uz točnost klasifikacije od 96,24%. Dong i Ma [15] proučavali su moguće markere trostruko negativnog raka dojke, a algoritmi strojnog učenja korišteni su za predviđanje imaju li ljudi trostruko negativan rak dojke. Rezultati pokazuju da točnost modela predviđanja klasifikacijskog stroja potpornih vektora (SVM) doseže 97,8%.
Kako bi poboljšali točnost metoda identifikacije raka dojke i poboljšali algoritme strojnog učenja, Wang et al. [16] predložio je ponderirani AUC skupni model učenja koji se temelji na SVM-u za dijagnozu raka dojke, koristeći C-SVM i V-SVM sa 6 kernel funkcija za povećanje raznolikosti skupa osnovnog modela i uspoređujući različite rezultate odluka s integracijom područja (WAUCE ) model ispod ponderirane krivulje radne karakteristike prijema. Rezultati pokazuju da na malom skupu podataka predložena struktura WAUCE smanjuje varijancu dijagnostičke točnosti do 69,23% i poboljšava točnost za 0,94%. Zheng i sur. [17] testirali su skup podataka o raku dojke u Wisconsinu (WDBC) prema K-srednjim vrijednostima i hibridni algoritam stroja potpornih vektora izdvaja karakteristike tumora i dijagnosticira rak dojke, a rezultati pokazuju da hibridni algoritam poboljšava točnost na 97,38%. Jia i sur. [18] predložio je novi algoritam optimizacije populacije, Whale Optimization Algorithm (WOA), koji inteligentno prilagođava parametre SVM modela, a eksperimentalni rezultati pokazuju da je izvedba WOA-SVM modela značajno bolja od one tradicionalnog model prepoznavanja raka dojke, s točnošću od 97,5%.
Kako bi riješili problem pretjeranog prilagođavanja tehnika strojnog učenja u klasifikaciji raka dojke, Singh et al. [19] predložili su funkcionalno povezanu umjetnu neuronsku mrežu (FLANN) i eksperimentalno otkrili da model ima visoku točnost za ranu dijagnozu raka dojke. Mahesh i sur. [20] predlažu XGBoost skupnu tehniku predviđanja raka dojke koja se temelji na poznatim obrascima značajki, prvo koristeći tehnologiju sintetskog manjinskog preduzorkovanja (SMOTE) za rješavanje neravnoteže podataka i problema s šumom, a zatim koristeći Bayesov klasifikator, klasifikator stabla odlučivanja i slučajnu šumu, redom , u kombinaciji s XGBoostom i klasificiranjem podataka. Prema eksperimentalnoj analizi, klasifikator ansambla XGBoost-Random Forest ima stopu točnosti od 98,20% u ranom otkrivanju raka dojke.
Na temelju XGBoosta, slučajne šume, logističke regresije, K-najbližeg susjeda i drugih metoda strojnog učenja, ovaj rad uspostavlja različite modele za klasifikaciju i predviđanje raka dojke, što daje referencu za ranu dijagnozu raka dojke. Kada većina studija primjenjuje modele strojnog učenja na dijagnozu stanica raka dojke, usredotočuju se na korištenje preciznosti, točnosti i F1-rezultata modela kao pokazatelja za procjenu kvalitete modela, dok zanemaruju medicinsku dijagnostičku važnost recall modela, koji pokazuje udio malignih stanica raka dojke koji su predviđeni, a što je veći recall, to je veća vjerojatnost da će maligne stanice biti predviđene u stanicama raka dojke. Stoga ovaj članak uzima prisjećanje kao primarni indeks i uzima u obzir preciznost, točnost i F1-rezultat za procjenu korištenog modela.
U procesu modeliranja, pretprocesiranje podataka je vrlo važan dio, a učinak prediktivnog modela je različit ovisno o metodi obrade. Kako bi se eliminirao utjecaj različitih dimenzionalnih koncepata na učinak modela, podaci su standardizirani. Kako bi se pronašao optimalni podskup i poboljšala točnost modela, izbor značajki je napravljen prema Pearsonovom koeficijentu korelacije između varijable značajke i ciljne varijable. Za problem neravnoteže pozitivnog i negativnog uzorka koristi se metoda hijerarhijskog uzorkovanja za izdvajanje skupa za obuku i skupa za testiranje proporcionalno prema različitim kategorijama. Uzimajući u obzir da učinak predviđanja modela strojnog učenja varira u različitim podjelama skupova podataka, ovaj će rad koristiti različite podjele skupova podataka (8: 2 i 7 : 3) kao dva skupa eksperimenata za promatranje učinka predviđanja modela uspostavljenog u ovom radu.
2. Predobrada podataka
2.1. Uvod u podatke. Skup podataka koji se koristi u ovom radu jesu podaci o raku dojke u UCI skupu podataka, koji je osigurao poznati dr. William sa Instituta za kliničku medicinu Sveučilišta Wisconsin [21]. Značajke su izračunate iz digitalizirane slike aspirata fine igle (FNA) mase dojke. Oni opisuju karakteristike staničnih jezgri prisutnih na slici. Skup podataka sadržavao je 569 eksperimentalnih uzoraka, uključujući 357 benignih uzoraka i 212 malignih uzoraka raka dojke. Za stanice izvađene iz svakog eksperimentalnog objekta uglavnom se prikuplja sljedećih deset značajki njegove jezgre: radijus (srednja vrijednost udaljenosti od središta do točaka na perimetru), perimetar, glatkoća (lokalna varijacija u duljinama radijusa), površina, kompaktnost ( perimetar ∗ ∗ 2/područje-1.0), konkavnost (ozbiljnost konkavnih dijelova konture), simetrija, tekstura (standardna devijacija vrijednosti sive skale), konkavne točke (broj konkavnih dijelova konture) i fraktalnu_dimenziju ("aproksimacija obale"-1). Srednja vrijednost, standardna pogreška i "najgora" ili najveća (srednja vrijednost od tri najveće vrijednosti) ovih značajki izračunate su za svaku sliku, što je rezultiralo s 30 značajki. Klasifikacijska oznaka predstavlja vrstu raka dojke. Stoga skup podataka uzorka sadrži ukupno 30 obilježja i jedno obilježje oznake uzorka (maligni i benigni).
2.2. Standardizacija podataka.
Promatrajući raspon vrijednosti svake značajke, utvrđuje se da se vrijednosti podataka različitih značajki jako razlikuju. U nekim modelima različite dimenzije imaju veliki utjecaj na učinak predviđanja. Na primjer, algoritam k-najbližeg susjeda temeljen na dijeljenju udaljenosti mora održavati dimenziju podataka konzistentnom, tako da podatke treba standardizirati prije modeliranja. Međutim, na neke modele dimenzionalnost manje utječe, poput algoritma slučajne šume. Kako bi eksperiment bio usporedan, podaci različitih modela tretiraju se na isti način.
Za probleme s različitim dimenzijama podataka uzorka, najčešće korištene bezdimenzionalne metode obrade uključuju standardizaciju podataka, a metode standardizacije podataka uključuju standardizaciju Min-max i standardizaciju Z-rezultata. Među njima, kada korišteni podaci imaju outliere izvan raspona vrijednosti ili su maksimalne i minimalne vrijednosti nekih pokazatelja nepoznate, može se koristiti standardizacija Z-rezultata.

U ovom radu, prema karakteristikama WDBC skupa podataka o raku dojke, standardizacija Z-skora odabrana je za obradu podataka. Podaci obrađeni standardizacijom Zscore [22] slijede standardnu normalnu distribuciju, to jest, srednja vrijednost je 0, a varijanca je 1. Formula za standardizaciju Z-score je sljedeća:

2.3. Odabir značajki. Kao važan dio procesa predobrade podataka, odabir značajki je pronaći optimalni podskup. Odabir značajki može smanjiti suvišne i beskorisne značajke kako bi se poboljšala točnost modela. Metoda odabira značajki općenito se dijeli na metodu pretjeranog razmišljanja, metodu enkapsulacije i metodu ugrađivanja. Metoda filtriranja može biti neovisna o algoritmu koji se kasnije koristi u studiji i ima visoku računsku učinkovitost i jaku sposobnost generalizacije [23], tako da metoda odabira značajki u ovom radu koristi metodu filtera, a opći sažetak metode u metodi filtriranja je prikazano u tablici 2.
Podaci o raku dojke nakon 0 srednje normalizacije zadovoljavaju zahtjeve Pearsonovog testa koeficijenta korelacije u metodi filtriranja; pa se u ovom radu Pearsonov koeficijent korelacije [24] koristi za testiranje korelacije između svake značajke i ciljne varijable. Pearsonova formula koeficijenta korelacije je sljedeća:

3. Izrada modela
U ovom su radu kategorije raka dojke predviđene na temelju XGBoosta, slučajne šume, logističke regresije i K-nearest Neighbor modela. Maligni rak dojke smatra se pozitivnim uzorkom, dok se benigni rak dojke smatra negativnim uzorkom
Kako bi se riješio problem neravnoteže uzorka, ovaj rad koristi metodu stratificiranog uzorkovanja [25] za izdvajanje skupa za obuku i skupa za testiranje u odnosu na sve vrste podataka uzorka. Stratificirano uzorkovanje naziva se i tipsko uzorkovanje. Populacija uzorka podijeljena je na subpopulacije koje su neovisne jedna o drugoj. Nasumično uzorkovanje provedeno je proporcionalno svakoj subpopulaciji. Stratificirano uzorkovanje daje reprezentativniji uzorak i prikladnije je za neuravnotežene uzorke.
Različite particije skupa podataka mogu dovesti do različitih učinaka modela. Stoga ovaj rad provodi dvije skupine eksperimenata prema različitoj podjeli skupa podataka uzorka. Prva skupina podijelila je skup podataka u skup za obuku i skup za testiranje u omjeru 8:2, a druga skupina skup podataka podijelila je skup podataka u skup za treniranje i skup za testiranje u omjeru 7:3. Promatrajte izvedbu modela četiri algoritma pod različitim particioniranjem skupa podataka.
3.1. Pokazatelji evaluacije. U ovoj studiji, točnost, preciznost, prisjećanje i F1-rezultat [26, 27] korišteni su za procjenu učinka predviđanja modela. S obzirom na specifičnost medicinske dijagnoze, za očekivati je da se svi zloćudni karcinomi dojke mogu predvidjeti. Stoga se sjećanje ovdje uzima kao važan indeks procjene. Što je veći opoziv, veći je udio malignog raka dojke koji se može predvidjeti. Rezultati klasifikacije modela mogu generirati matricu zabune [28], kao što je prikazano u tablici 4
Ovdje je TP istinski pozitivan, označavajući broj pozitivnih uzoraka predviđenih kao pozitivni uzorci. TN je istinski negativan, označavajući broj negativnih uzoraka predviđenih kao negativni uzorci. FP je lažno pozitivan, pokazuje broj pozitivnih uzoraka predviđenih od negativnih uzoraka, što se naziva pogreška tipa 1. FN je lažno negativan, označavajući broj pozitivnih uzoraka predviđenih kao negativni uzorci, što se naziva pogreška tipa 2
Preciznost, skraćeno P. Za predviđene rezultate, preciznost predstavlja koliko je pozitivnih predviđenih uzoraka pozitivnih uzoraka, a formula je:


3.2. Model predviđanja raka dojke temeljen na XGBoostu. XGBoost, skraćenica za extreme gradient boosting, je algoritam za pojačavanje [29]. I XGBoost i slučajna šuma integracijski su algoritmi temeljeni na stablu odlučivanja. Za razliku od Bagging algoritma, Boosting algoritam gradi slabe učenike jednog po jednog, akumulirajući više slabih učenika kontinuiranom iteracijom [30]. Ciljna funkcija je

. (9) Dodavanje regularnih članova može smanjiti varijancu modela i učiniti model dobiven skupom za obuku jednostavnijim, kako bi se spriječila pojava preokreta. Algoritam XGBoost koristi se za obuku modela na skupu podataka za obuku. U procesu učenja modela parametri se prilagođavaju kako bi se dobio bolji skup parametara, te se na kraju dobiva optimalan predikcijski model. Model je korišten za predviđanje kategorija raka dojke u
postavljanje. Kada je skup podataka podijeljen na skup za vježbanje i skup za testiranje u omjeru 8:2, točnost, preciznost, prisjećanje i F1-rezultat XGBoost modela bili su 0.974, {{5} }.960, 1.00, odnosno 0.980. Kada je model XGBoost podijeljen na set za vježbanje i set za testiranje u omjeru 7 : 3, točnost, preciznost, prisjećanje i F1-rezultat XGBoost modela bili su 0.959, {{20} },946, 0,991, odnosno 0,968. Rezultati pokazuju da model XGBoost ima bolju izvedbu predviđanja kada se skup podataka podijeli s 8:2. Stopa prisjećanja od 1 ukazuje da je model XGBoost ispravno predvidio sve zloćudne karcinome dojke u uzorku, što je vrlo važno za medicinsku dijagnozu
osis. 3.3. Model predviđanja raka dojke temeljen na slučajnoj šumi. Slučajna šuma je nadzirani algoritam učenja koji integrira više stabala kroz Bagging ideju [31-33]. Bootstrap metoda koristi se za izdvajanje skupa uzoraka za obuku iz izvornih podataka uzorka, a odgovarajući model stabla odlučivanja se trenira za svaki skup za obuku. Na kraju se glasuje o svim osnovnim klasifikatorima, a onaj s najviše glasova je konačna kategorija.

krvav. Kada je skup podataka podijeljen na skup za vježbanje i skup za testiranje u omjeru 8:2, točnost, preciznost, prisjećanje i F1-rezultat modela slučajne šume bili su 0.965, {{5 }}.947, 1.00, odnosno 0.973. Kada je skup podataka podijeljen na skup za vježbanje i skup za testiranje u omjeru 7 : 3, točnost, preciznost, prisjećanje i F1- rezultat bili su 0.953, 0.946, { {18}}.981, odnosno 0.963. Rezultati pokazuju da nasumični šumski model ima bolju izvedbu predviđanja kada se skup podataka podijeli s 8:2. Stopa prisjećanja ovog modela također je bila 1, što ukazuje da je nasumični šumski model također ispravno predvidio sve maligne dojke.

ali l. Tri osnovna elementa algoritma k-najbližeg susjeda su mjerenje udaljenosti, odabir k-vrijednosti, odluka o klasifikaciji. Tri osnovna elementa algoritma k-najbližeg susjeda su mjerenje udaljenosti, odabir k-vrijednosti i pravilo odlučivanja o klasifikaciji.
Za problem odabira vrijednosti K u algoritmu k najbližeg susjeda, ovaj rad koristi metodu deseterostruke unakrsne provjere (38, 39) i uzima stopu prisjećanja kao indeks procjene modela za odabir odgovarajuće k vrijednosti. Neka raspon vrijednosti k bude 1–40, a za svaki k izvodi se deseterostruka unakrsna provjera valjanosti. K vrijednost s maksimalnom stopom prisjećanja je optimalna k vrijednost. Prisjećanje različitih vrijednosti k pod deseterostrukom unakrsnom provjerom prikazano je na slici 1.
Na slici 1 može se vidjeti da kako k vrijednost raste, prisjećanje se smanjuje. Kada je k �3 i k �5, opoziv je najveći. Budući da je k vrijednost postavljena premalo, lako ju je pretjerati, pa je k vrijednost postavljena na 5 ovdje.
Kada je skup podataka podijeljen na set za obuku i skup za testiranje u omjeru 8:2, točnost, preciznost, prisjećanje i F1-rezultat k-najbližeg susjednog modela bili su 0.912, { {6}}.888, 0.986, odnosno {{10}}.934. Kada je skup podataka podijeljen na skup za vježbanje i skup za testiranje u omjeru 7 : 3, točnost, preciznost, prisjećanje i F1-rezultat bili su 0.930, {{21} }.906, 0.991, odnosno 0.946. Rezultati pokazuju da model k-najbližeg susjeda ima bolju izvedbu predviđanja kada se skup podataka podijeli sa 7 : 3.
4. Usporedba i analiza
Kako bismo bolje razumjeli izvedbu modela uspostavljenog u ovom radu, ovaj se dokument temelji na razvojnom okruženju Python 3.9.7 i koristi podatke o raku dojke koje je za eksperimente dao dr. William s Instituta za klinička medicinska istraživanja Sveučilišta Wisconsin.
Eksperimentalno okruženje je operativni sustav Windows 11, procesor Intel(R) Core(TM) i5-1155G7@ 2.50 GHz 2.50 GHz, a memorija 8.00 GB.
Eksperimentalni parametri svakog modela prikazani su u tablici 5, a bit će provedena sljedeća tri usporedna rezultata analize: (1) usporedba performansi svakog modela u ovom radu kada je skup podataka podijeljen na skup za obuku i skup za testiranje u 8 : 2. (2) Usporedba performansi svakog modela u ovom radu kada je skup podataka podijeljen na skup za obuku i skup za testiranje u 7 : 3. (3) Usporedba s nekim modelima u literaturi [11-14].
(1) Kada je skup podataka podijeljen na skup za obuku i skup za testiranje u odnosu 8:2, izvedba svakog modela prikazana je u tablici 6.
Kao što se može vidjeti iz tablice 4, kada se set za obuku i skup za testiranje podijeli u omjeru 8:2, točnost četiri metode strojnog učenja je iznad 0.9, među kojima su XGBoost i RF iznad { {5}}.95. Točnost predviđanja XGBoost-a je 0.974, što ukazuje na visoku točnost predviđanja. Što se tiče preciznosti, preciznost KNN modela nije visoka, ispod 0.9, samo 0.888. XGBoost ima najveću preciznost, koja iznosi 0.960. Što se tiče prisjećanja, prisjećanje algoritama XGBoost, nasumične šume i logističke regresije je 1. Algoritam k-najbližeg susjeda ima najniže prisjećanje, ali je i iznad 0.95. Za ovu studiju, stope prisjećanja predstavljaju udio uzoraka malignog raka dojke koji su ispravno dijagnosticirani. U medicini, bolest treba dijagnosticirati. Posljedica nedijagnosticiranja je odgođeno liječenje, zbog čega pacijenti mogu propustiti najbolje vrijeme za liječenje. Ovo je mnogo ozbiljnije nego da vam je dijagnosticirana bolest, a da je nemate. Stoga je stopa prisjećanja vrlo važan pokazatelj u području dijagnostike bolesti. Ovdje su opoziv XGBoost-a, nasumične šume i algoritma logističke regresije svi 1, što ukazuje da su svi maligni karcinomi dojke u uzorcima dijagnosticirani. Za F{{20}}rezultat, može se vidjeti da su F1-rezultati XGBoost-a, nasumične šume i logističke regresije iznad 0.95. F1-rezultat algoritma XGBoost je najviši i doseže 0.980. Model K-najbližeg susjeda ima najniži F1- rezultat od 0,934. Uzimajući u obzir četiri pokazatelja, može se reći da kada se skup podataka podijeli na skup za obuku i skup za testiranje u odnosu 8:2, ukupni učinak modela algoritma XGBoost bolji je od ostala tri modela. XGBoost ne samo da je postigao opoziv od 1, već je postigao i prisjećanje od 0,95 ili više za ostale tri metrike.
(2) Kada se skup podataka podijeli na skup za obuku i skup za testiranje u omjeru 7 : 3, izvedba svakog modela prikazana je u tablici 7.
Kao što se može vidjeti iz tablice 7, kada su set za obuku i set za testiranje podijeljeni sa 7 : 3, učinak modela XGBoost i RF nije tako dobar kao onaj od 8 : 2. Prije svega, u smislu važnog indeksa podsjetimo, kada se skup podataka podijeli s 8:2, opoziv XGBoosta i RF-a bio je 1, ali sada se smanjio na 0.991 odnosno {{10}}.981 . Dva modela su također blago pala u ostala tri indeksa. Međutim, promjena učinka predviđanja logističke regresije i modela K-najbližeg susjeda razlikuje se od ova dva algoritma. Za logistički regresijski model, četiri pokazatelja jedva su se promijenila kada su set za obuku i skup za testiranje podijeljeni sa 7:3, odnosno 8:2. To pokazuje da na model logističke regresije gotovo ne utječu različite particije skupa podataka. U slučaju podjele 7 : 3 između skupa za obuku i skupa za testiranje, logistička regresija pokazala je nižu točnost, preciznost i F1- rezultat od XGBoosta i slučajne šume. Međutim, opoziv modela logističke regresije je 1, što znači da su svi zloćudni karcinomi dojke predviđeni, što je od velike važnosti za dijagnozu bolesti. Stoga se može reći da je učinak predviđanja modela logističke regresije bolji od ostala tri algoritma. Za KNN model, kada su set za obuku i skup za testiranje podijeljeni sa 7 : 3, sva četiri indeksa su porasla. Prisjećanje se povećalo na 0.991, što je više od onoga u nasumičnoj šumi. Točnost, preciznost i F1-rezultat porastao je s 0.912, {{30}}.887 i 0.934 na 0 0,930, 0,906, odnosno 0,946. Stoga, model KNN ima bolju izvedbu u slučaju skupa za obuku i skupa za testiranje podijeljenog sa 7 : 3 nego kod modela podijeljenog s 8: 2. Analiza pokazuje da podjela skupova podataka nije fiksna. Za različite modele, različite podjele donose različite promjene u učinku predviđanja modela.
(3) Prema komparativnoj analizi tablica 6 i 7, XGBoost model uspostavljen u ovom radu (dijeleći set za obuku i skup za testiranje s 8:2) ima najbolji učinak, au nastavku se uspoređuje s izvedbom modela u literature [11–14], a specifični rezultati prikazani su u tablici 8.
Kao što se može vidjeti iz tablice 8, modeli s boljom izvedbom od pet modela su model logističke regresije iz literature [13] i model XGBoost uspostavljen u ovom radu. Prisjećanje i točnost modela u literaturi [13] su 0.99 odnosno 0.98, a prisjećanje i točnost modela u ovom radu su 1.{{8} } odnosno 0.974, u usporedbi s literaturom [13], prisjećanje modela je visoko, a prisjećanje u medicinskoj dijagnostici ukazuje na vjerojatnost otkrivanja stanica raka, što je od velike važnosti za klasifikaciju stanica raka dojke, tako da model XGBoost uspostavljen u ovom radu ima bolji učinak predviđanja i može se koristiti kao medicinski alat za pomoć liječnicima u izradi planova liječenja za pacijentice s rakom dojke.

5. Zaključak
Ovaj rad uglavnom je predvidio kategorije raka dojke, od predobrade podataka do odabira značajki, a zatim do uspostave modela. Na kraju, rezultati predviđanja su uspoređeni i analizirani s više aspekata.
U ovom se radu prisjećanje uzima kao važan pokazatelj za što preciznije predviđanje uzoraka malignog raka dojke. Izvorni skup podataka sadržavao je 30 značajki, a 15 značajki odabrano je kao ulaz u model kroz Pearsonov test korelacije. Prije izgradnje modela, podaci su standardizirani kako bi se eliminirao utjecaj različitih dimenzija na učinke modela. Za problem neuravnoteženih pozitivnih i negativnih uzoraka koristi se metoda stratificiranog uzorkovanja za izdvajanje skupova za obuku i skupova za testiranje proporcionalno prema različitim kategorijama podataka. Pri odabiru optimalne k vrijednosti u k-najbližem susjedu, opoziv se koristi kao indeks procjene modela, tako da je k vrijednost s najvećom stopom prisjećanja optimalna vrijednost.
Modeli su uspoređeni i analizirani s tri aspekta. Rezultati su prikazani kako slijedi:
pects. Rezultati su prikazani kako slijedi: (1) U slučaju dijeljenja skupa za vježbanje i skupa testova s 8:2, opoziv XGBoost-a, slučajne šume i logističke regresije je 1, što može predvidjeti sve maligne karcinome dojke K -poziv najbližeg susjeda nešto je niži od 0.986 u usporedbi s ostala tri modela. Za točnost predviđanja, preciznost i F1-rezultat modela, rezultati XGBoost modela bolji su od rezultata slučajne šume i logističke regresije, koji su 0.974, {{1 0}}.96, odnosno 0,98, tako da je model XGboost odabran kao konačni model predviđanja pod uvjetom podjele skupa za obuku i skupa za testiranje u omjeru 8:2.
(2) U slučaju podjele skupa za treniranje i skupa za testiranje u omjeru 7 : 3, vrijednosti četiri evaluacijska indikatora za XGBoost i slučajnu šumu su se smanjile, dok su vrijednosti četiri evaluacijska indikatora za model K-najbližeg susjeda bile poboljšan, ali za prisjećanje, samo prisjećanje modela logističke regresije bilo je 1, a ostali modeli su bili iznad 0.98, tako da je učinak predviđanja modela logističke regresije bio najbolji, a točnost predviđanja, preciznost , i F1-rezultat logističke regresije bio je 0.947, {{10}}.922, odnosno 0,96.

(3) Iz eksperimenata se može vidjeti da pod različitim podjelama učinak predviđanja modela ima različite promjene. Uspoređujući optimalne modele u dva skupa različitih eksperimenata, može se vidjeti da su točnost predviđanja, preciznost i F1-rezultat XGBoost modela (koji dijeli skup za obuku i skup za testiranje s 8:2) viši su od modela logističke regresije (koji dijeli skup za obuku i skup za testiranje sa 7 : 3) kada je opoziv 1, tako da XGBoost model (koji dijeli skup za treniranje i skup za testiranje s 8: 2) radi najbolje u modelu uspostavljenom u ovom radu. Osim toga, u usporedbi s modelima u literaturi [11-14], model XGBoost uspostavljen u ovom radu ima bolji učinak i može točno identificirati maligne stanice raka dojke. Međutim, ovo je istraživanje ograničeno na numeričke skupove podataka, au budućnosti ćemo pokušati upotrijebiti algoritme dubokog učenja za primjenu različitih tehnika izdvajanja značajki na slikovne podatke (kao što su rendgenske slike) kako bismo dobili bolje rezultate klasifikacije.
Dostupnost podataka
Podaci koji podupiru nalaze ove studije javno su dostupni u UCI-jevom repozitoriju strojnog učenja na https://archive.ics.uci.edu/ml/datasets/Breast+Cancer+Wisconsin+ %28Diagnostic%29.
Sukob interesa
Autori izjavljuju da nisu u sukobu interesa.
Priznanja
Ovaj rad podržali su Nacionalna zaklada za prirodne znanosti Kine (potpora br. 61502156), Projekt podučavanja i istraživanja Odbora za obrazovanje Hubeija (potpora br. 282) i Doktorska zaklada tehnološkog sveučilišta Hubei (potpora br. BSQD13051).
Reference
[1] V. Fotedar, S. Fotedar, P. Takur, S. Vats, A. Negi i L. Chanderkant, "Poznavanje faktora rizika od raka dojke i metoda za njegovo rano otkrivanje među radnicima primarne zdravstvene zaštite u Shimli, Himachal Pradesh," Journal of Education and Health Promotion, sv. 8, str. 265, 2019.
[2] MS Simon, TA Hastert, A. Barac, et al., "Kardiometabolički čimbenici rizika i preživljavanje nakon raka u inicijativi za zdravlje žena", Cancer, sv. 127, br. 4, str. 598–608, 2021.
[3] HF Pasha, RH Mohamed, MM Toam i AM Yehia, "Genetske i epigenetske modifikacije gena adiponektina: p," The Journal of Gene Medicine, sv. 21, br. 10, str. e3120, 2019.
[4] D. Hong, AJ Fritz, SK Zaidi, et al., "Epitelni u mezenhimalni prijelaz i matične stanice raka doprinose heterogenosti raka dojke", Journal of Cellular Physiology, sv. 233, br. 12, str. 9136-9144, 2018.
[5] J. Zhong, D. Sun, W. Wei, et al., "Aspiracija tankom iglom vođena ultrazvukom pojačanim kontrastom za biopsiju sentinel limfnog čvora u ranom stadiju raka dojke", Ultrazvuk u medicini i biologiji, sv. . 44, br. 7, str. 1371-1378, 2018.
[6] K. Babić, C. Siguan-Bell, M. Hee i SC Lin, "Okular g: ultrazvučna B-sken procjena zadržane kirurške spužve nakon operacije Ahmedove valvule: slučaj r," Journal of Glaucoma, sv. 26, br. 10, str. e239-e241, 2017.
[7] A. Yala, PG Mikhael, F. Strand, et al., "Prema robusnim modelima koji se temelje na mamografiji za rizik od raka dojke", Science Translational Medicine, sv. 13, br. 578, ID članka eaba4373, 2021.
[8] G. Zheng, X. Liu i G. Han, "Računalno potpomognuto otkrivanje medicinske slike i pregled sustava za dijagnozu," Journal of Software, sv. 29, br. 5, str. 1471–1514, 2018.
[9] EY Huang, S. Knight, CR Guetter, et al., "Telemedicina i telementorstvo u kirurškim specijalitetima: narativni pregled, The American Journal of Surgery, vol. 218, br. 4, str. 760-766, 2019.
[10] Q. Wu, BT Wang, HR Rao, Y. Jiang i C. Liu, "Rak dojke i stanice benigne bolesti formiraju mjeriteljska istraživanja," Journal of Anhui Medical University, sv. 31, br. 02, str. 91–93, 1996.
[11] Q. Shen, F. Shao i R. Sun, "Model predviđanja raka dojke temeljen na xgboostu," Journal of Qingdao University (Natural Science Edition), sv. 32, br. 1. 2019.
[12] Z. Deng, B. Su i K. Zhan. g, "Klasifikacija raka dojke temeljena na skupnom učenju," China Medical Devices, sv. 35, br. 12. 2020.
[13] M. Monirujjaman Khan, S. Islam, S. Sarkar, et al., "Komparativna analiza temeljena na strojnom učenju za predviđanje raka dojke", Journal of Healthcare Engineering, sv. 2022., šifra članka 4365855, 15 str., 2022.
[14] A. Bhardwaj, H. Bhardwaj, A. Sakalle, Z. Uddin, M. Sakalle i W. Ibrahim, "Analiza algoritma baziranog na stablu i strojnog učenja za klasifikaciju raka dojke", Computational Intelligence and Neuroscience, sv. 2022., šifra članka 6715406, 6 stranica, 2022.
[15] H. Dong i L. Ma, "Model predviđanja trostruko negativnog raka dojke temeljen na strojnom učenju," Journal of Yunnan University, sv. 39, br. 1, str. 111–115, 2017.
For more information:1950477648nn@gmail.com






