Klasifikasi Prediksi Kanker Payudara Berdasarkan Machine Learning
Sep 12, 2023
Kanker payudara adalah jenis kanker yang paling umum dan mematikan di dunia. Berdasarkan algoritma pembelajaran mesin seperti XGBoost, random forest, regresi logistik, dan K-nearest neighbour, makalah ini menetapkan model berbeda untuk mengklasifikasikan dan memprediksi kanker payudara, guna memberikan referensi dalam diagnosis dini kanker payudara. Penarikan kembali menunjukkan kemungkinan mendeteksi sel kanker dalam diagnosis medis, yang sangat penting untuk klasifikasi kanker payudara, sehingga artikel ini menggunakan penarikan kembali sebagai indeks evaluasi utama dan mempertimbangkan evaluasi presisi, akurasi, dan skor F1- indikator untuk mengevaluasi dan membandingkan efek prediksi setiap model. Untuk menghilangkan pengaruh konsep dimensi yang berbeda terhadap pengaruh model, data distandarisasi.
Algoritma K tetangga terdekat adalah salah satu algoritma paling dasar di bidang pembelajaran mesin. Ide utamanya adalah menemukan K sampel yang paling dekat dengan sampel target, dan kemudian memprediksi label sampel target berdasarkan label K sampel tersebut. Dalam kehidupan manusia sehari-hari, kita sering menggunakan cara serupa untuk mengambil keputusan. Misalnya, ketika menghadapi masalah tertentu, kita mengingat kembali situasi serupa yang pernah kita hadapi sebelumnya, lalu mencari situasi yang paling mirip dan mengambil keputusan berdasarkan hasil yang diperoleh. Mengembangkan solusi. Oleh karena itu, algoritma K tetangga terdekat erat kaitannya dengan memori manusia.
Pertama-tama, algoritma K tetangga terdekat memerlukan sejumlah besar set pelatihan untuk mempelajari dan membangun struktur data grafik tetangga terdekat. Demikian pula manusia perlu terus-menerus mengalami berbagai hal dan menyimpan pengalaman tersebut dalam ingatan. Hanya dengan mengumpulkan banyak pengalaman dan pengetahuan kita dapat membuat keputusan dan penilaian dengan lebih akurat.
Kedua, algoritma K tetangga terdekat menekankan dampak kesamaan pada prediksi. Demikian pula ketika mengambil keputusan, manusia seringkali terlebih dahulu mempertimbangkan pengalaman masa lalu dan mencoba mencari pengalaman serupa dengan situasi saat ini sebagai referensi. Proses menemukan kesamaan ini juga merupakan salah satu ciri penting ingatan.
Terakhir pada algoritma K tetangga terdekat, nilai K mempunyai pengaruh yang besar terhadap hasil prediksi. Nilai K yang berbeda akan menimbulkan hasil prediksi yang berbeda pula. Demikian pula, ketika manusia mengingat pengalaman masa lalu, mereka perlu memilih titik referensi dan metode yang berbeda tergantung pada situasi saat ini. Fleksibilitas dan kemampuan beradaptasi ini juga merupakan karakteristik penting dari memori. Terlihat bahwa kita perlu meningkatkan daya ingat kita. Cistanche deserticola dapat meningkatkan daya ingat secara signifikan karena Cistanche deserticola merupakan bahan obat tradisional Tiongkok yang memiliki banyak khasiat unik, salah satunya meningkatkan daya ingat. Khasiat daging cincang berasal dari berbagai bahan aktif yang dikandungnya, antara lain asam, polisakarida, flavonoid, dll. Bahan-bahan tersebut dapat meningkatkan kesehatan otak dengan berbagai cara.

Klik Tahu untuk meningkatkan memori jangka pendek
Untuk mencari subset optimal dan meningkatkan akurasi model, 15 fitur disaring sebagai masukan ke model melalui uji korelasi Pearson. Model K-nearest neighbour menggunakan metode cross-validation untuk memilih nilai k optimal dengan menggunakan recall sebagai indeks evaluasi. Untuk masalah ketidakseimbangan sampel positif dan negatif, metode pengambilan sampel hierarki digunakan untuk mengekstraksi set pelatihan dan set pengujian secara proporsional menurut kategori yang berbeda. Hasil eksperimen menunjukkan bahwa pada pembagian dataset yang berbeda (8:2 dan 7:3), efek prediksi model yang sama akan mengalami perubahan yang berbeda. Analisis komparatif menunjukkan bahwa model XGBoost yang dibuat dalam makalah ini (yang membagi set pelatihan dan set pengujian dengan 8:2) memiliki efek yang lebih baik, dan skor perolehan, presisi, akurasi, dan F1-adalah 1.{{ 11}}, 0.960, 0.974, dan 0.980, masing-masing.
1. Perkenalan
Dalam sepuluh tahun terakhir, kejadian kanker payudara di Tiongkok telah meningkat sebesar 47%, dan kejadian tersebut meningkat dari tahun ke tahun, dan kejadian kanker payudara secara bertahap semakin muda [1]. Patogenesis kanker payudara berhubungan dengan hormon pribadi, riwayat keluarga, pernikahan, dan riwayat melahirkan anak [2]. Kanker payudara tidak mudah dideteksi pada stadium dini, dan mempunyai ciri-ciri timbulnya pada usia dini namun presentasinya terlambat [3, 4]. Saat ini, diagnosis utama kanker payudara didasarkan pada tiga metode: sitologi tusukan [5], pemindaian ultrasonografi [6], dan rontgen mammogram [7]. Jika seorang pasien diketahui mengidap kanker payudara sejak dini, semakin besar kemungkinan untuk disembuhkan dan semakin baik pula prognosisnya. Oleh karena itu, pemeriksaan rutin dan diagnosis dini sangat diperlukan untuk pencegahan dan deteksi dini kanker payudara.
Di bidang medis, pembentukan model melalui metode pembelajaran mesin dapat membantu dokter dalam meningkatkan tingkat deteksi kanker, untuk mencapai tujuan deteksi dini dan pengobatan dini. Metode pembelajaran mesin telah memberikan hasil yang baik dalam diagnosis kanker [8, 9]. Wu dkk. [10] mengamati morfologi sel di bawah mikroskop dan menemukan bahwa terdapat perbedaan nyata antara sel kanker payudara dan parameter sel sehat normal. Temuan ini memberikan landasan teoritis bagi banyak penelitian. Meskipun saat ini terdapat banyak metode pembelajaran mesin yang diterapkan pada klasifikasi sel kanker payudara, tidak ada algoritma tunggal yang dapat diterapkan untuk semua masalah. Setiap jenis algoritme pembelajaran mesin memiliki bidang keahliannya masing-masing, sehingga pilihan algoritme berbeda-beda dalam skenario yang berbeda.
Shen dkk. [11] menggunakan model XGBoost untuk mengklasifikasikan dan memprediksi kanker payudara, dan akurasinya mencapai 97.86%, dan recall mencapai 95,83%. Deng dkk. [12] menggunakan algoritma XGBoost untuk mengklasifikasikan dan memprediksi kanker payudara dengan akurasi 0,96 dan recall sebesar 0,97. Monirujjaman Khan dkk. [13] menggunakan beberapa model pembelajaran mesin untuk mengidentifikasi kanker payudara, dan hutan acak, pohon keputusan, K-tetangga terdekat, dan regresi logistik adalah algoritme dengan skor F1-lebih tinggi, 96%, 95%, 90%, dan 98%, masing-masing. Bhardwaj dkk. [14] menggunakan multilayer perceptron (MLP), K-nearest neighbour (KNN), algoritma genetika (GP), dan random forest (RF) untuk mengklasifikasikan sel kanker payudara jinak dan ganas, dan hasil eksperimen menunjukkan bahwa pengklasifikasi optimal adalah RF dengan akurasi klasifikasi sebesar 96,24%. Dong dan Ma [15] mempelajari kemungkinan penanda kanker payudara triple-negatif, dan algoritma pembelajaran mesin digunakan untuk memprediksi apakah orang menderita kanker payudara triple-negatif. Hasilnya menunjukkan akurasi model prediksi klasifikasi support vector machine (SVM) mencapai 97,8%.
Untuk meningkatkan akurasi metode identifikasi kanker payudara dan meningkatkan algoritma pembelajaran mesin, Wang et al. [16] mengusulkan model pembelajaran ansambel AUC tertimbang berdasarkan SVM untuk diagnosis kanker payudara, menggunakan C-SVM dan V-SVM dengan 6 fungsi kernel untuk meningkatkan keragaman kumpulan model dasar dan membandingkan hasil keputusan yang berbeda dengan Integrasi Area (WAUCE ) model di bawah kurva karakteristik kerja penerimaan tertimbang. Hasilnya menunjukkan bahwa pada kumpulan data kecil, struktur WAUCE yang diusulkan mengurangi varian akurasi diagnostik hingga 69,23% dan meningkatkan akurasi sebesar 0,94%. Zheng dkk. [17] menguji kumpulan data Wisconsin Breast Cancer (WDBC) menurut algoritma hibrid K-means dan mesin vektor dukungan yang mengekstrak fitur tumor dan mendiagnosis kanker payudara, dan hasilnya menunjukkan bahwa algoritma hibrid meningkatkan akurasi hingga 97,38%. Jia dkk. [18] mengusulkan algoritma optimasi populasi baru, Algoritma Optimasi Paus (WOA), yang secara cerdas menyesuaikan parameter model SVM, dan hasil eksperimen menunjukkan bahwa kinerja model WOA-SVM secara signifikan lebih baik daripada model tradisional. model pengenalan kanker payudara, dengan akurasi 97,5%.
Untuk mengatasi masalah teknik pembelajaran mesin yang berlebihan dalam klasifikasi kanker payudara, Singh et al. [19] mengusulkan jaringan saraf tiruan yang terhubung secara fungsional (FLANN) dan secara eksperimental menemukan bahwa model tersebut memiliki akurasi tinggi untuk diagnosis dini kanker payudara. Mahesh dkk. [20] mengusulkan teknik ansambel XGBoost prediksi kanker payudara berdasarkan pola fitur yang diketahui, pertama menggunakan teknologi pengambilan sampel minoritas sintetis (SMOTE) untuk menangani masalah ketidakseimbangan data dan kebisingan dan kemudian menggunakan pengklasifikasi Bayes, pengklasifikasi pohon keputusan, dan hutan acak. , dikombinasikan dengan XGBoost dan mengklasifikasikan data. Berdasarkan analisis eksperimental, pengklasifikasi ansambel XGBoost-Random Forest memiliki tingkat akurasi 98,20% dalam deteksi dini kanker payudara.
Berdasarkan XGBoost, hutan acak, regresi logistik, K-nearest neighbour, dan metode pembelajaran mesin lainnya, makalah ini menetapkan model berbeda untuk mengklasifikasikan dan memprediksi kanker payudara, yang memberikan referensi untuk diagnosis dini kanker payudara. Ketika sebagian besar penelitian menerapkan model pembelajaran mesin pada diagnosis sel kanker payudara, penelitian tersebut berfokus pada penggunaan presisi, akurasi, dan skor F1-model sebagai indikator untuk mengevaluasi kualitas model, dan mengabaikan signifikansi diagnostik medis dari model tersebut. recall model yang menunjukkan proporsi sel kanker payudara ganas yang diprediksi, dan semakin tinggi recall maka semakin besar kemungkinan terprediksi sel ganas pada sel kanker payudara. Oleh karena itu, artikel ini menggunakan recall sebagai indeks utama dan mempertimbangkan presisi, akurasi, dan skor F1-untuk mengevaluasi model yang digunakan.
Dalam proses pemodelan, prapemrosesan data merupakan bagian yang sangat penting, dan efek model prediktif berbeda-beda bergantung pada metode pemrosesan. Untuk menghilangkan pengaruh konsep dimensi yang berbeda terhadap pengaruh model, data distandarisasi. Untuk mencari subset optimal dan meningkatkan akurasi model, dilakukan pemilihan fitur berdasarkan koefisien korelasi Pearson antara variabel fitur dan variabel target. Untuk masalah ketidakseimbangan sampel positif dan negatif, metode pengambilan sampel hierarki digunakan untuk mengekstraksi set pelatihan dan set pengujian secara proporsional menurut kategori yang berbeda. Mengingat efek prediksi model pembelajaran mesin bervariasi berdasarkan divisi kumpulan data yang berbeda, makalah ini akan menggunakan divisi kumpulan data yang berbeda (8:2 dan 7:3) sebagai dua rangkaian eksperimen untuk mengamati efek prediksi model yang dibuat dalam makalah ini.
2. Pemrosesan Awal Data
2.1. Pengenalan Data. Kumpulan data yang digunakan dalam makalah ini adalah data kanker payudara dalam kumpulan data UCI, yang disediakan oleh Dr. William yang terkenal dari Clinical Medicine Research Institute di University of Wisconsin [21]. Fitur dihitung dari gambar digital aspirasi jarum halus (FNA) dari massa payudara. Mereka menggambarkan karakteristik inti sel yang ada pada gambar. Kumpulan data berisi 569 sampel percobaan, termasuk 357 sampel jinak dan 212 sampel kanker payudara ganas. Untuk sel-sel yang diekstraksi dari setiap objek percobaan, sepuluh ciri-ciri inti berikut dikumpulkan: jari-jari (rata-rata jarak dari pusat ke titik-titik pada keliling), keliling, kehalusan (variasi lokal dalam panjang jari-jari), luas, kekompakan ( perimeter ∗ ∗ 2/area-1.0), cekung (keparahan bagian cekung pada kontur), simetri, tekstur (standar deviasi nilai skala abu-abu), titik cekung (jumlah bagian cekung kontur), dan_dimensi fraktal ("perkiraan garis pantai"-1). Rata-rata, kesalahan standar, dan "terburuk" atau terbesar (rata-rata dari tiga nilai terbesar) dari fitur-fitur ini dihitung untuk setiap gambar, sehingga menghasilkan 30 fitur. Label klasifikasi mewakili jenis kanker payudara. Oleh karena itu, kumpulan data sampel berisi total 30 fitur dan satu fitur label sampel (ganas dan jinak).
2.2. Standardisasi Data.
Dengan mengamati rentang nilai setiap fitur, ditemukan bahwa nilai data fitur yang berbeda sangat berbeda. Dalam beberapa model, dimensi yang berbeda mempunyai pengaruh besar terhadap efek prediksi. Misalnya, algoritma k-nearest neighbour berdasarkan pembagian jarak perlu menjaga konsistensi dimensi data, sehingga data perlu distandarisasi sebelum dimodelkan. Namun, beberapa model tidak terlalu terpengaruh oleh dimensi, seperti algoritma hutan acak. Untuk membuat eksperimen bersifat komparatif, data dari model yang berbeda diperlakukan dengan cara yang sama.
Untuk permasalahan dengan dimensi data sampel yang berbeda, metode pemrosesan tanpa dimensi yang umum digunakan meliputi standarisasi data, dan metode standarisasi data meliputi standarisasi Min-max dan standarisasi Z-score. Diantaranya, ketika data yang digunakan terdapat outlier di luar rentang nilai, atau nilai maksimum dan minimum beberapa indikator tidak diketahui, maka standarisasi Z-score dapat digunakan.

Dalam makalah ini, sesuai dengan karakteristik dataset kanker payudara WDBC, standarisasi Z-score dipilih untuk mengolah data. Data yang diolah dengan standardisasi Zscore [22] mengikuti distribusi normal standar yaitu mean 0 dan variansnya 1. Rumus standardisasi Z-score adalah sebagai berikut:

2.3. Pemilihan Fitur. Sebagai bagian penting dari proses prapemrosesan data, pemilihan fitur adalah untuk menemukan subset yang optimal, Pemilihan fitur dapat mengurangi fitur-fitur yang berlebihan dan tidak berguna untuk meningkatkan akurasi model. Metode pemilihan fitur secara umum dibagi menjadi metode overthinking, metode enkapsulasi, dan metode embedding. Metode pemfilteran dapat independen dari algoritma yang digunakan nanti dalam penelitian dan memiliki efisiensi komputasi yang tinggi serta kemampuan generalisasi yang kuat [23], sehingga metode pemilihan fitur dalam makalah ini menggunakan metode filter, dan ringkasan metode umum dalam metode pemfilteran adalah ditunjukkan pada Tabel 2.
Data kanker payudara setelah normalisasi rata-rata 0 memenuhi persyaratan uji koefisien korelasi Pearson dalam metode penyaringan; sehingga dalam tulisan ini koefisien korelasi Pearson [24] digunakan untuk menguji korelasi setiap fitur dengan variabel target. Rumus koefisien korelasi Pearson adalah sebagai berikut:

3. Konstruksi Model
Dalam tulisan ini, kategori kanker payudara diprediksi berdasarkan model XGBoost, random forest, regresi logistik, dan K-nearest Neighbor. Kanker payudara ganas dianggap sebagai sampel positif, sedangkan kanker payudara jinak dianggap sebagai sampel negatif
Untuk mengatasi masalah ketidakseimbangan sampel, makalah ini menggunakan metode pengambilan sampel bertingkat [25] untuk mengekstrak set pelatihan dan set pengujian secara proporsional dengan semua jenis data sampel. Pengambilan sampel bertingkat juga disebut pengambilan sampel tipe. Populasi sampel dibagi menjadi subpopulasi yang independen satu sama lain. Pengambilan sampel secara acak dilakukan secara proporsional pada setiap subpopulasi. Pengambilan sampel bertingkat mengambil sampel yang lebih representatif dan lebih cocok untuk sampel yang tidak seimbang.
Partisi kumpulan data yang berbeda dapat menyebabkan efek model yang berbeda. Oleh karena itu, makalah ini melakukan dua kelompok eksperimen menurut pembagian kumpulan data sampel yang berbeda. Kelompok pertama membagi data set menjadi training set dan test set dengan perbandingan 8:2, dan kelompok kedua membagi data set menjadi training set dan test set dengan perbandingan 7:3. empat algoritma di bawah partisi kumpulan data yang berbeda.
3.1. Indikator Evaluasi. Dalam penelitian ini, akurasi, presisi, perolehan, dan skor F1-[26, 27] digunakan untuk mengevaluasi efek prediksi model. Mengingat kekhususan diagnosis medis, diharapkan semua kanker payudara ganas dapat diprediksi. Oleh karena itu, penarikan kembali diambil sebagai indeks evaluasi yang penting di sini. Semakin tinggi recall maka semakin tinggi pula proporsi kanker payudara ganas yang dapat diprediksi. Hasil klasifikasi model dapat menghasilkan matriks konfusi [28], seperti terlihat pada Tabel 4
Di sini, TP adalah benar-benar positif, yang menunjukkan jumlah sampel positif yang diprediksi sebagai sampel positif. TN adalah negatif sebenarnya, menunjukkan jumlah sampel negatif yang diprediksi sebagai sampel negatif. FP adalah positif palsu, menunjukkan jumlah sampel positif yang diprediksi dari sampel negatif, yang disebut kesalahan tipe 1. FN adalah negatif palsu, menunjukkan jumlah sampel positif yang diprediksi sebagai sampel negatif, yang disebut kesalahan tipe 2
Presisi disingkat P. Untuk hasil prediksi, presisi mewakili berapa banyak sampel prediksi positif yang merupakan sampel positif, dan rumusnya adalah:


3.2. Model Prediksi Kanker Payudara Berdasarkan XGBoost. XGBoost, kependekan dari peningkatan gradien ekstrim, adalah algoritma Peningkatan [29]. XGBoost dan random forest adalah algoritma integrasi berdasarkan pohon keputusan. Berbeda dengan algoritma Bagging, algoritma Boosting membangun pembelajar yang lemah satu per satu, mengumpulkan beberapa pembelajar yang lemah melalui iterasi yang berkelanjutan [30]. Fungsi tujuannya adalah

. (9) Penambahan regular term dapat mengurangi variance model dan membuat model yang diperoleh dari training set menjadi lebih sederhana, untuk mencegah terjadinya overting. Algoritma XGBoost digunakan untuk melatih model pada kumpulan data pelatihan. Dalam proses pelatihan model, parameter disesuaikan untuk mendapatkan kumpulan parameter yang lebih baik, dan akhirnya diperoleh model prediksi yang optimal. Model tersebut digunakan untuk memprediksi kategori kanker payudara di
pengaturan. Ketika kumpulan data dibagi menjadi kumpulan pelatihan dan kumpulan pengujian dengan perbandingan 8:2, akurasi, presisi, perolehan, dan skor F1-model XGBoost adalah 0.974, {{5} }.960, 1.00, dan 0.980, masing-masing. Ketika model XGBoost dibagi menjadi set pelatihan dan set pengujian dengan perbandingan 7 : 3, akurasi, presisi, perolehan, dan skor F1-model XGBoost adalah 0.959, {{20} },946, 0,991, dan 0,968, masing-masing. Hasilnya menunjukkan bahwa model XGBoost memiliki kinerja prediksi yang lebih baik ketika kumpulan data dibagi 8:2. Tingkat recall sebesar 1 menunjukkan bahwa model XGBoost dengan tepat memprediksi semua kanker payudara ganas dalam sampel, yang sangat penting untuk diagnosis medis.
osis. 3.3. Model Prediksi Kanker Payudara Berdasarkan Random Forest. Hutan acak adalah algoritma pembelajaran terawasi yang mengintegrasikan banyak pohon melalui ide Bagging [31–33]. Metode bootstrap digunakan untuk mengekstrak kumpulan sampel pelatihan dari data sampel asli, dan model pohon keputusan yang sesuai dilatih untuk setiap set pelatihan. Terakhir, semua pengklasifikasi dasar dipilih, dan kategori yang mendapat suara terbanyak adalah kategori akhir.

berdarah. Ketika kumpulan data dibagi menjadi kumpulan pelatihan dan kumpulan pengujian dengan perbandingan 8:2, akurasi, presisi, perolehan, dan skor F1-model hutan acak adalah 0.965, {{5 }}.947, 1.00, dan 0.973, masing-masing. Ketika kumpulan data dibagi menjadi kumpulan pelatihan dan kumpulan pengujian dengan perbandingan 7 : 3, skor akurasi, presisi, perolehan, dan F1- adalah 0.953, 0.946, { {18}},981, dan 0,963, masing-masing. Hasilnya menunjukkan bahwa model random forest memiliki kinerja prediksi yang lebih baik ketika kumpulan data dibagi 8:2. Tingkat recall model ini juga 1, yang menunjukkan bahwa model random forest juga memprediksi dengan tepat semua payudara ganas.

tapi aku. Tiga elemen dasar algoritma k-nearest neighbour adalah pengukuran jarak, pemilihan nilai k, keputusan klasifikasi. Tiga elemen dasar algoritma k-nearest neighbour adalah pengukuran jarak, pemilihan nilai k, dan aturan keputusan klasifikasi.
Untuk permasalahan pemilihan nilai K pada algoritma k tetangga terdekat, tulisan ini menggunakan metode tenfold cross-validation (38, 39) dan mengambil recall rate sebagai indeks evaluasi model untuk memilih nilai k yang sesuai. Misalkan rentang nilai k adalah 1–40, dan untuk setiap k, dilakukan validasi silang sepuluh kali lipat. Nilai k dengan recall rate maksimum merupakan nilai k optimal. Penarikan kembali nilai k yang berbeda di bawah validasi silang sepuluh kali lipat ditunjukkan pada Gambar 1.
Terlihat dari Gambar 1 bahwa semakin besar nilai k maka recall semakin menurun. Ketika k � 3 dan k � 5, penarikan kembali adalah yang terbesar. Karena nilai k yang disetel terlalu kecil, maka mudah untuk overfit, sehingga nilai k di sini ditetapkan sebagai 5.
Ketika kumpulan data dibagi menjadi kumpulan pelatihan dan kumpulan pengujian dengan perbandingan 8:2, maka akurasi, presisi, perolehan, dan skor F1-model k-nearest Neighbor adalah 0.912, { {6}}.888, 0.986, dan {{10}}.934, masing-masing. Ketika kumpulan data dibagi menjadi kumpulan pelatihan dan kumpulan pengujian dengan perbandingan 7 : 3, akurasi, presisi, perolehan, dan skor F1-adalah 0.930, {{21} },906, 0,991, dan 0,946, masing-masing. Hasilnya menunjukkan bahwa model k-nearest neighbour memiliki performa prediksi yang lebih baik ketika kumpulan data dibagi 7 : 3.
4. Perbandingan dan Analisis
Untuk lebih memahami kinerja model yang dibuat dalam makalah ini, makalah ini didasarkan pada lingkungan pengembangan Python 3.9.7 dan menggunakan data kanker payudara yang disediakan oleh Dr. William dari Institut Penelitian Medis Klinis Universitas Wisconsin untuk eksperimen.
Lingkungan eksperimental adalah sistem operasi Windows 11, prosesornya adalah Intel(R) Core(TM) i5-1155G7@ 2,50 GHz 2,50 GHz, dan memorinya 8.00 GB.
Parameter eksperimen masing-masing model ditunjukkan pada Tabel 5, dan akan dilakukan tiga hasil analisis komparatif berikut: (1) perbandingan kinerja masing-masing model dalam makalah ini ketika kumpulan data dibagi menjadi set pelatihan dan set pengujian di 8 : 2. (2) Perbandingan kinerja masing-masing model dalam makalah ini ketika kumpulan data dibagi menjadi set pelatihan dan set pengujian dalam 7 : 3. (3) Perbandingan dengan beberapa model dalam literatur [11–14].
(1) Jika kumpulan data dibagi menjadi set pelatihan dan set pengujian dengan perbandingan 8:2, performa masing-masing model ditunjukkan pada Tabel 6.
Terlihat dari Tabel 4, ketika membagi set pelatihan dan set pengujian dengan rasio 8:2, akurasi keempat metode pembelajaran mesin berada di atas 0.9, di antaranya XGBoost dan RF berada di atas { {5}},95. Akurasi prediksi XGBoost adalah 0,974, yang menunjukkan akurasi prediksi yang tinggi. Untuk presisi, presisi model KNN tidak tinggi, dibawah 0.9, hanya 0.888. XGBoost memiliki presisi tertinggi yaitu 0.960. Sedangkan untuk recall, recall algoritma XGBoost, random forest, dan regresi logistik semuanya 1. Algoritma k-nearest neighbour memiliki recall yang paling rendah, namun juga diatas 0,95. Untuk penelitian ini, tingkat penarikan kembali mewakili proporsi sampel kanker payudara ganas yang didiagnosis dengan benar. Dalam dunia kedokteran, suatu penyakit perlu didiagnosis. Akibat tidak terdiagnosisnya adalah tertundanya pengobatan, yang dapat mengakibatkan pasien kehilangan waktu terbaik untuk berobat. Ini jauh lebih serius daripada didiagnosis menderita suatu penyakit tanpa menderita penyakit apa pun. Oleh karena itu, tingkat recall merupakan indikator yang sangat penting dalam bidang diagnosis penyakit. Di sini, penarikan kembali algoritma XGBoost, random forest, dan regresi logistik semuanya 1, menunjukkan bahwa semua kanker payudara ganas dalam sampel telah didiagnosis. Untuk skor F{{20}}terlihat F1-skor XGBoost, random forest, dan regresi logistik semuanya berada diatas 0.95. Skor F1-algoritma XGBoost merupakan yang tertinggi yaitu mencapai 0.980. Model K-nearest neighbour memiliki skor F1-terendah sebesar 0,934. Dengan mempertimbangkan keempat indikator tersebut, dapat dikatakan bahwa ketika kumpulan data dibagi menjadi kumpulan pelatihan dan kumpulan pengujian dengan perbandingan 8:2, efek model keseluruhan dari algoritma XGBoost lebih baik daripada ketiga model lainnya. XGBoost tidak hanya mencapai recall sebesar 1 tetapi juga mencapai recall sebesar 0,95 atau lebih untuk tiga metrik lainnya.
(2) Jika kumpulan data dibagi menjadi set pelatihan dan set pengujian dengan perbandingan 7 : 3, performa masing-masing model ditunjukkan pada Tabel 7.
Seperti terlihat pada Tabel 7, ketika training set dan test set dibagi 7 : 3, efek model XGBoost dan RF tidak sebaik 8: 2. Pertama-tama, dalam hal indeks penting ingat, ketika membagi kumpulan data dengan 8: 2, penarikan kembali XGBoost dan RF sama-sama 1, tetapi sekarang berkurang masing-masing menjadi 0.991 dan {{10}}.981 . Kedua model tersebut juga mengalami sedikit penurunan pada tiga indeks lainnya. Namun perubahan efek prediksi regresi logistik dan model K-nearest neighbour berbeda dari kedua algoritma ini. Untuk model regresi logistik, keempat indikator hampir tidak berubah ketika set pelatihan dan set pengujian dibagi masing-masing 7:3 dan 8:2. Hal ini menunjukkan bahwa model regresi logistik hampir tidak terpengaruh oleh partisi kumpulan data yang berbeda. Dalam kasus pembagian 7 : 3 antara set pelatihan dan set pengujian, regresi logistik menunjukkan akurasi, presisi, dan skor F1- yang lebih rendah dibandingkan XGBoost dan random forest. Namun, penarikan kembali model regresi logistik adalah 1, yang menunjukkan bahwa semua kanker payudara ganas telah diprediksi, yang sangat penting untuk diagnosis penyakit. Oleh karena itu, dapat dikatakan bahwa efek prediksi model regresi logistik lebih baik dibandingkan ketiga algoritma lainnya. Untuk model KNN, ketika training set dan test set dibagi 7 : 3, keempat indeksnya meningkat. Penarikan kembali meningkat menjadi 0,991, lebih tinggi dibandingkan hutan acak. Akurasi, presisi, dan skor F1-meningkat dari 0.912, {{30}}.887, dan 0.934 menjadi 0 0,930, 0,906, dan 0,946, masing-masing. Oleh karena itu, kinerja model KNN lebih baik jika set pelatihan dan set pengujian dibagi 7 : 3 dibandingkan model dibagi 8: 2. Analisis menunjukkan bahwa pembagian kumpulan data tidak tetap. Untuk model yang berbeda, pembagian yang berbeda membawa perubahan yang berbeda pula pada efek prediksi model.
(3) Menurut analisis komparatif Tabel 6 dan 7, model XGBoost yang dibuat dalam makalah ini (membagi set pelatihan dan set pengujian dengan 8: 2) memiliki efek terbaik, dan berikut ini membandingkannya dengan kinerja model di literatur [11-14] dan hasil spesifiknya ditunjukkan pada Tabel 8.
Seperti dapat dilihat dari Tabel 8, model yang berkinerja lebih baik dari kelima model tersebut adalah model regresi logistik dari literatur [13] dan model XGBoost yang dibuat dalam makalah ini. Perolehan dan keakuratan model dalam literatur [13] masing-masing adalah 0,99 dan 0,98, dan perolehan serta keakuratan model dalam makalah ini adalah 1.{{8} } dan 0.974, masing-masing, dibandingkan dengan literatur [13], penarikan kembali model tersebut tinggi, dan penarikan kembali dalam diagnosis medis menunjukkan kemungkinan mendeteksi sel kanker, yang sangat penting untuk klasifikasi sel kanker payudara, sehingga model XGBoost yang dibuat dalam makalah ini memiliki efek prediksi yang lebih baik dan dapat digunakan sebagai alat medis untuk membantu dokter membuat rencana pengobatan bagi pasien kanker payudara.

5. Kesimpulan
Makalah ini terutama memperkirakan kategori kanker payudara, mulai dari prapemrosesan data hingga pemilihan fitur, dan kemudian pembuatan model. Terakhir, hasil prediksi dibandingkan dan dianalisis dari berbagai aspek.
Dalam tulisan ini, recall dijadikan sebagai indeks penting untuk memprediksi sampel kanker payudara ganas seakurat mungkin. Kumpulan data asli berisi 30 fitur, dan 15 fitur dipilih sebagai masukan model melalui uji korelasi Pearson. Sebelum pembuatan model, data distandarisasi untuk menghilangkan dampak dimensi yang berbeda pada efek model. Untuk masalah sampel positif dan negatif yang tidak seimbang, metode pengambilan sampel bertingkat digunakan untuk mengekstrak set pelatihan dan set pengujian secara proporsional sesuai dengan kategori data yang berbeda. Saat memilih nilai k optimal pada k-nearest neighbour, recall digunakan sebagai indeks evaluasi model, sehingga nilai k dengan recall rate tertinggi merupakan nilai optimal.
Model-model tersebut dibandingkan dan dianalisis dari tiga aspek. Hasilnya ditunjukkan sebagai berikut:
hal. Hasilnya adalah sebagai berikut: (1) Jika training set dan test set dibagi 8:2, recall XGBoost, random forest, dan regresi logistik adalah 1, yang dapat memprediksi semua kanker payudara ganas K -penarikan kembali tetangga terdekat sedikit lebih rendah dari 00,986 dibandingkan dengan tiga model lainnya. Untuk akurasi prediksi, presisi, dan F1-score model, hasil model XGBoost lebih baik dibandingkan dengan hasil random forest dan regresi logistik yaitu 0.974, {{1 0}},96, dan 0,98, sehingga model XGboost dipilih sebagai model prediksi akhir dengan kondisi pembagian set pelatihan dan set pengujian 8:2.
(2) Jika training set dan test set dibagi 7 : 3, maka nilai keempat indikator evaluasi XGBoost dan random forest mengalami penurunan, sedangkan nilai keempat indikator evaluasi model K-nearest neighbour adalah ditingkatkan, tetapi untuk recall, hanya recall model regresi logistik yang bernilai 1, dan model lainnya berada di atas 0.98, sehingga efek prediksi model regresi logistik adalah yang terbaik, dan akurasi prediksi, presisi , dan skor F1-regresi logistik masing-masing adalah 0.947, {{10}}.922, dan 0.96.

(3) Terlihat dari percobaan bahwa pada divisi yang berbeda, efek prediksi model mengalami perubahan yang berbeda-beda. Membandingkan model optimal pada dua set percobaan yang berbeda, terlihat akurasi prediksi, presisi, dan skor F1-model XGBoost (yang membagi set pelatihan dan set pengujian dengan 8:2) lebih tinggi dibandingkan model regresi logistik (yang membagi set pelatihan dan set pengujian dengan 7 : 3) ketika recall adalah 1, sehingga model XGBoost (yang membagi set pelatihan dan set pengujian dengan 8: 2) berfungsi terbaik dalam model yang ditetapkan dalam makalah ini. Selain itu, dibandingkan dengan model dalam literatur [11-14], model XGBoost yang dibuat dalam makalah ini memiliki efek yang lebih baik dan dapat mengidentifikasi sel kanker payudara ganas secara akurat. Namun penelitian ini terbatas pada dataset numerik, dan kedepannya kami akan mencoba menggunakan algoritma deep learning untuk menerapkan berbagai teknik ekstraksi fitur pada data gambar (seperti gambar sinar-X) untuk memperoleh hasil klasifikasi yang lebih baik.
Ketersediaan Data
Data yang mendukung temuan penelitian ini tersedia secara terbuka di Repositori Pembelajaran Mesin UCI di https://archive.ics.uci.edu/ml/datasets/Breast+Cancer+Wisconsin+ %28Diagnostic%29.
Konflik kepentingan
Para penulis menyatakan bahwa mereka tidak memiliki konflik kepentingan.
Ucapan Terima Kasih
Pekerjaan ini didukung oleh National Natural Science Foundation of China (Hibah no 61502156), Proyek Pengajaran dan Penelitian Komite Pendidikan Hubei (Hibah no 282), dan Yayasan Doktor Universitas Teknologi Hubei (Hibah no. BSQD13051).
Referensi
[1] V. Fotedar, S. Fotedar, P. Takur, S. Vats, A. Negi, dan L. Chanderkant, "Pengetahuan tentang faktor risiko kanker payudara dan metode deteksi dini di kalangan petugas kesehatan primer di Shimla, Himachal Pradesh," Jurnal Pendidikan dan Promosi Kesehatan, vol. 8, hal. 265, 2019.
[2] MS Simon, TA Hastert, A. Barac, dkk., "Faktor risiko kardiometabolik dan kelangsungan hidup setelah kanker dalam inisiatif kesehatan wanita," Cancer, vol. 127, tidak. 4, hlm.598–608, 2021.
[3] HF Pasha, RH Mohamed, MM Toam, dan AM Yehia, "Modifikasi genetik dan epigenetik gen adiponektin: p," The Journal of Gene Medicine, vol. 21, tidak. 10, hal. e3120, 2019.
[4] D. Hong, AJ Fritz, SK Zaidi, dkk., "Transisi epitel ke mesenkim dan sel induk kanker berkontribusi terhadap heterogenitas kanker payudara," Journal of Cellular Physiology, vol. 233, tidak. 12, hlm.9136–9144, 2018.
[5] J. Zhong, D. Sun, W. Wei, dkk., "Aspirasi jarum halus dengan panduan ultrasonografi yang ditingkatkan kontras untuk biopsi kelenjar getah bening sentinel pada kanker payudara stadium awal," Ultrasound in Medicine and Biology, vol . 44, tidak. 7, hal.1371–1378, 2018.
[6] K. Babic, C. Siguan-Bell, M. Hee, dan SC Lin, "Ocular g: penilaian USG B-scan dari sisa spons bedah setelah operasi katup Ahmed: kasus r," Journal of Glaucoma, vol. 26, tidak. 10, hal.e239–e241, 2017.
[7] A. Yala, PG Mikhael, F. Strand, dkk., "Menuju model berbasis mamografi yang kuat untuk risiko kanker payudara," Science Translational Medicine, vol. 13, tidak. 578, ID Artikel eaba4373, 2021.
[8] G. Zheng, X. Liu, dan G. Han, "Tinjauan sistem deteksi dan diagnosis berbantuan komputer gambar medis," Journal of Software, vol. 29, tidak. 5, hal.1471–1514, 2018.
[9] EY Huang, S. Knight, CR Guetter, dkk., "Telemedis dan telementoring dalam spesialisasi bedah: tinjauan naratif, The American Journal of Surgery, vol. 218, no. 4, hlm. 760–766, 2019.
[10] Q. Wu, BT Wang, HR Rao, Y. Jiang, dan C. Liu, "Kanker payudara dan sel penyakit jinak membentuk penelitian metrologi," Jurnal Universitas Kedokteran Anhui, vol. 31, tidak. 02, hal.91–93, 1996.
[11] Q. Shen, F. Shao, dan R. Sun, "Model prediksi kanker payudara berdasarkan xgboost," Jurnal Universitas Qingdao (Natural Science Edition), vol. 32, tidak. 1 Januari 2019.
[12] Z.Deng, B.Su, dan K.Zhan. g, "Klasifikasi kanker payudara berdasarkan pembelajaran ansambel," China Medical Devices, vol. 35, tidak. 12, 2020.
[13] M. Monirujjaman Khan, S. Islam, S. Sarkar, dkk., "Analisis komparatif berbasis pembelajaran mesin untuk prediksi kanker payudara," Journal of Healthcare Engineering, vol. 2022, ID Artikel 4365855, 15 halaman, 2022.
[14] A. Bhardwaj, H. Bhardwaj, A. Sakalle, Z. Uddin, M. Sakalle, dan W. Ibrahim, "Analisis algoritma pembelajaran berbasis pohon dan mesin untuk klasifikasi kanker payudara," Computational Intelligence and Neuroscience, vol. 2022, ID Artikel 6715406, 6 halaman, 2022.
[15] H. Dong dan L. Ma, "Model prediksi kanker payudara triple-negatif berdasarkan pembelajaran mesin," Jurnal Universitas Yunnan, vol. 39, tidak. 1, hal.111–115, 2017.
For more information:1950477648nn@gmail.com






