Tantangan Dan Peluang Dengan Algoritma Penemuan Kausal: Aplikasi Untuk Patofisiologi Alzheimer

Feb 19, 2022

Xinpeng Shen1*, Sisi Ma1dkk


Causal Structure Discovery (cSD) adalah masalah mengidentifikasi hubungan sebab akibat dari sejumlah besar data melalui metode komputasi. Dengan keterbatasan kemampuan metode komputasi berbasis asosiasi tradisional untuk menemukan hubungan sebab akibat, metodologi cSD semakin populer. tujuan dari penelitian ini adalah untuk menguji secara sistematis apakah (i) metode cSD dapat menemukan hubungan sebab akibat yang diketahui dari data klinis observasional dan (ii) untuk menawarkan panduan untuk secara akurat menemukan hubungan sebab akibat yang diketahui. Kami menggunakanpenyakit alzheimer(AD), penyakit progresif yang kompleks, sebagai model karena bukti mapan memberikan grafik kausal "standar emas" untuk evaluasi. Kami mengevaluasi dua metode cSD, inferensi kausal cepat (FCI) dan Pencarian kesetaraan Greedy yang cepat (fGeS) dalam kemampuan mereka untuk menemukan struktur ini dari data yang dikumpulkan olehpenyakit alzheimerinisiatif neuroimaging (ADni). Kami menggunakan model persamaan struktural (yang tidak dirancang untuk cSD) sebagai kontrol. Kami menerapkan metode ini di bawah tiga skenario yang ditentukan dengan meningkatkan jumlah pengetahuan latar belakang yang diberikan untuk metode tersebut. metode dievaluasi dengan membandingkan hubungan sebab akibat yang dihasilkan dengan grafik "standar emas" yang dibangun dari literatur. Metode cSD khusus berhasil menemukan grafik yang hampir sesuai dengan standar emas. untuk hasil terbaik, algoritma cSD harus digunakan dengan data longitudinal yang menyediakan sebanyak mungkin pengetahuan sebelumnya.

Kontak:{0}}/ WhatsApp: 008618081934791

the effect of cistanche extract phenethanol glycosides on Alzheimer's

Efek dariekstrak cistancheglikosida fenoksietanol padaAlzheimer

Analisis data besar, pembelajaran mesin, dan pembelajaran mendalam telah mengumpulkan minat yang signifikan dalam bidang ilmu kesehatan1,2. Karena akurasi prediksi yang sangat baik, mereka semakin banyak digunakan untuk diagnosis penyakit dan prediksi risiko3. Namun, dalam banyak aplikasi biomedis, mencapai akurasi prediksi yang tinggi dengan sendirinya bukanlah tujuan utama; menemukan faktor risiko atau mekanisme yang dapat diubah sering kali menjadi pertanyaan penelitian utama.

Aplikasi pembelajaran mesin saat ini sebagian besar didasarkan pada asosiasi. Meskipun faktor risiko dapat dikaitkan dengan penyakit, itu tidak berarti bahwa hal itu dapat mengubah proses penyakit. Pada awal 2018, uji coba Fase 3 yang disebut "TOMORROW" menguji efek obat diabetes pada penguranganpenyakit alzheimer(AD) risiko demensia4. Studi ini mengukur deposisi amiloid, yang merupakan tanda awal penyakit Alzheimer dan juga terkait dengan diabetes. Namun, karena diabetes tidak menyebabkan amiloidosis, penelitian ini gagal dalam analisis sementara5,6. Untuk intervensi yang berhasil, faktor risiko yang kita intervensi harus memiliki hubungan kausal (bukan hanya asosiatif) denganpenyakithasil.

Penelitian klinis sebagian besar difokuskan pada hubungan sebab akibat. Penelitian klinis yang didorong oleh hipotesis, misalnya, sering mengasumsikan struktur kausal, serangkaian hubungan kausal antara biomarker dan hasil, dan peneliti memperkirakan ukuran efek dari hubungan ini (misalnya inferensi kausal). Dalam penelitian seperti itu, menarik kesimpulan kausal adalah valid, karena pengetahuan sebelumnya memastikan bahwa hubungan itu memang kausal. Namun, ketika tidak ada pengetahuan tentang kausalitas, struktur kausal itu sendiri perlu ditemukan dari data melalui proses yang dikenal sebagai penemuan struktur kausal. Praktik yang umum digunakan tetapi salah adalah mengasumsikan struktur kausal parsial dan menyesuaikannya berdasarkan statistik keluaran dari model yang dipasang menggunakan metode seperti model persamaan struktural (SEM).


Dalam karya ini, menggunakan biomarker AD sebagai prediktor dan kognisi sebagai hasilnya, kami mulai menentukan cara optimal untuk menemukan hubungan sebab akibat. Kami menggunakan AD sebagai model untuk masalah ini karena kaskade biomarker AD dipahami dengan baik7 dan hubungan sebab akibat antara prediktor utama juga telah dikarakterisasi dengan baik sehingga grafik "standar emas" dapat dibangun. Selanjutnya, kumpulan data publik daripenyakit alzheimerinisiatif neuroimaging (ADNI) memiliki data longitudinal ekstensif yang tersedia yang kondusif untuk perbandingan sistematis yang direncanakan dalam naskah ini. Di sini, kami fokus untuk membandingkan hasil dari algoritme penemuan kausal khusus dan algoritme penelusuran berdasarkan SEM, dengan grafik "standar emas" kami. Kami juga menyelidiki alasan di balik kesalahan umum dan mengeksplorasi metode untuk mencegahnya. Eksperimen ini memungkinkan kami untuk memberikan pedoman untuk menemukan struktur kausal menggunakan data observasional.

Cistanche Prevents Alzheimer's

Mencegah CistancheAlzheimer

Latar belakang

algoritma penemuan struktur kausal.Secara informal, kausalitas didefinisikan sebagai hubungan antara dua variabel X dan Y sedemikian rupa sehingga perubahan pada X menyebabkan perubahan pada Y8. Perbedaan utama antara asosiasi dan sebab-akibat terletak pada potensi perancu. Misalkan tidak ada hubungan kausal langsung antara X dan Y, melainkan variabel ketiga Z menyebabkan X dan Y. Dalam kasus ini, meskipun X dan Y sangat terkait, mengubah X tidak akan menyebabkan perubahan pada Y. Z disebut a pembaur. Lebih formal, kausalitas adalah efek langsung antara A dan B yang tersisa setelah disesuaikan untuk perancu. Confounding dapat diamati atau tidak teramati (laten).

Struktur kausal adalah seperangkat hubungan kausal antara satu set variabel, dan penemuan struktur kausal adalah masalah mempelajari struktur kausal dari data observasi. Ada algoritma penemuan struktur kausal khusus dan dapat dipisahkan menjadi dua subtipe, berbasis kendala dan berbasis skor. Algoritme berbasis kendala membangun struktur kausal berdasarkan kendala independensi bersyarat, sedangkan algoritme berbasis skor menghasilkan sejumlah kandidat grafik kausal, menetapkan skor untuk masing-masing, dan memilih grafik akhir berdasarkan skor. Dalam penelitian ini, kami memilih satu algoritma yang menonjol dari setiap jenis: Fast Causal Inference Algorithm (FCI), yang merupakan algoritma berbasis kendala, dan Fast Greedy Equivalence Search (FGES), yang merupakan algoritma berbasis skor. Untuk singkatnya, kami memberikan deskripsi tingkat tinggi untuk FGES dan FCI. Untuk deskripsi lebih rinci, kami merujuk pembaca ke referensi9-11. Kedua metode dapat menyesuaikan pengganggu yang diamati dan salah satu algoritma, FCI, memiliki beberapa kemampuan untuk menemukan pengganggu laten.

inferensi kausal cepat (fci).Konsep sentral di balik algoritma penemuan kausal berbasis kendala adalah gagasan bahwa struktur kausal yang berbeda menyiratkan hubungan independensi yang berbeda. Sebagai contoh, hubungan kausal A→- B →C, menyiratkan bahwa variabel A tidak tergantung pada C yang diberikan B. Sebaliknya, ketika A →C←B, A, dan B adalah independen (tanpa syarat), tetapi menjadi tergantung kondisional pada C. Struktur yang terakhir disebut struktur "V" (juga dikenal sebagai collider) yang memiliki hubungan independensi yang unik dibandingkan dengan hubungan sebab akibat lainnya. Faktanya, ini adalah salah satu "primitif" yang dicari oleh algoritma berbasis kendala, seperti FCI.

Sebuah fitur khusus untuk FCI bahkan di antara metode berbasis kendala adalah kemampuannya untuk menemukan pembaur laten (tidak teramati). Ini diaktifkan oleh primitif lain, struktur "Y". Empat variabel mendefinisikan struktur "Y" ketika mereka memiliki hubungan kausal berikut: W1 →X W2 dan X →Y. Dalam struktur "Y", baik W1 dan W2 tidak bergantung pada Y bersyarat pada X. Independensi bersyarat ini membantu mengesampingkan kemungkinan pembaur yang tidak terukur antara X dan Y. Dengan kata lain, ketika FCI menemukan struktur "Y" dalam struktur "Y" grafik, hubungan kausal dari X ke Y dijamin tidak tertukar; jika tidak, FCI mengasumsikan bahwa kemungkinan pembaur yang tidak teramati ada12.

Algoritma inferensi kausal cepat (FCI). FCI membuat graf kausal yang dimulai dengan graf tak berarah yang terhubung penuh, dan menghilangkan sisi-sisi yang menghubungkan variabel bebas bersyarat. Pada fase kedua, ia mengorientasikan tepi dengan mengidentifikasi struktur "V" dan "Y" dan mencoba mengorientasikan tepi yang tersisa berdasarkan seperangkat aturan yang telah dijelaskan secara rinci di tempat lain9,13.

Algoritma pencarian kesetaraan serakah cepat (FGES).Algoritma Greedy Equivalence Search (GES) juga memiliki dua fase. Fase pertama dimulai dengan grafik yang tidak mengandung sisi (sesuai dengan semua variabel yang independen satu sama lain) dan dengan rakus menambahkan sisi (dependensi) satu per satu dalam orientasi yang meminimalkan Bayes Information Score14 (BIC), yang kemungkinan dihukum untuk kompleksitas untuk mengurangi overfitting. GES kemudian menghilangkan tepi satu per satu selama itu menurunkan BIC. Algoritma FGES10 yang digunakan dalam pekerjaan ini hanyalah versi "cepat" (paralel) dari GES11,15. Mirip dengan FCI, FGES juga bergantung pada struktur "V" untuk mengorientasikan tepi. Kemungkinan tersirat dari struktur "V" adalah unik sedangkan kemungkinan dari A →B →C, C →B →A, dan A BC adalah sama. Jadi, FGES akan memilih struktur "V" ketika itu menyiratkan kemungkinan yang lebih tinggi daripada struktur lainnya.


Pemodelan persamaan struktural (SEM).Structural Equation Modeling (SEM) adalah keluarga model statistik, yang, berdasarkan struktur kausal yang mendasarinya, dapat memperkirakan ukuran efek (dan juga statistik lainnya) dari setiap hubungan16. SEM juga dapat menyarankan modifikasi pada struktur kausal yang diberikan untuk meningkatkan statistik model fit.

Sementara SEM tidak dirancang untuk menemukan struktur kausal, tidak jarang menggunakan modifikasi yang disarankan SEM untuk "memperhalus" struktur grafik. Fitur ini dapat dimanfaatkan untuk secara iteratif membangun grafik kausal, di setiap iterasi, menambahkan satu sisi sesuai saran SEM. Kami menerapkan metode pencarian (salah) ini di bawah dua skenario: (1) mulai dari grafik kosong (Penemuan kausal); dan (2) dimulai dari graf yang diperoleh dengan menghapus 1 atau 2 sisi dari graf "standar emas". Perhatikan bahwa, dalam ruang lingkup makalah ini, kami menggunakan istilah "SEM" untuk mewakili algoritma yang menggunakan SEM untuk melakukan pencarian tepi, bukan untuk memperkirakan ukuran efek.

Perbedaan utama antara algoritma. Baik SEM dan FGES adalah algoritma bertahap yang memodifikasi struktur dengan menambahkan atau menghapus tepi. Keuntungan terbesar dari FGES adalah memperluas ruang pencarian dengan mengubah struktur saat ini ke struktur "setara" lainnya. Sebagai contoh, jika diketahui sisinya, A →B ada pada graf A, B, dan C. SEM akan mencoba menambahkan satu tepi terarah antara C dan A atau C dan B, menghasilkan empat kemungkinan. Namun, FGES mempertimbangkan lebih banyak kemungkinan karena juga dapat membalikkan tepi A →B yang ada menjadi A B, menghasilkan empat kemungkinan struktur tambahan.

Selain strategi pencarian (Constraint versus Score based), FCI juga berbeda dari dua algoritma lainnya dalam asumsi tentang sebab-akibat: baik SEM dan FGES beroperasi di bawah asumsi tidak ada pembaur yang tidak terukur. Dengan kata lain, semua variabel pengganggu diukur dalam dataset. FCI, bagaimanapun, melonggarkan asumsi ini dan melaporkan hubungan yang tidak dikacaukan hanya ketika bertemu dengan struktur "Y"17.

Algoritma FCI dan FGES diimplementasikan dalam paket perangkat lunak Tetrad (Versi 6.5.4). Gambar 1 menunjukkan interpretasi dari jenis tepi yang berbeda dalam grafik output. Untuk SEM, kami menggunakan paket R 'lavaan'18.



metode

Data.Data yang digunakan dalam penyusunan artikel ini diperoleh daripenyakit alzheimerBasis data Inisiatif Neuroimaging (ADNI) (adni.loni.usc.edu). ADNI diluncurkan pada tahun 2003 sebagai kemitraan publik-swasta, dipimpin oleh Principal Investigator Michael W. Weiner, MD. Tujuan utama ADNI adalah untuk menguji apakah serial magnetic resonance imaging (MRI), positron emission tomography (PET), penanda biologis lainnya, dan penilaian klinis dan neuropsikologis dapat digabungkan untuk mengukur perkembangan gangguan kognitif ringan (MCI) dan awalAlzheimerpenyakit(AD)19. Ada tiga fase studi ADNI dimana yang terakhir, ADNI3, masih berlangsung. Semua peserta penelitian memberikan persetujuan tertulis, dan protokol penelitian disetujui oleh dewan peninjau institusional masing-masing situs lokal. Semua metode dilakukan sesuai dengan pedoman dan peraturan yang relevan. Untuk informasi terkini, lihat www.adni-info.org. Tinjauan IRB tidak diperlukan karena data ADNI tidak teridentifikasi dan tersedia untuk diunduh secara publik. Kami memfokuskan studi kami pada dua yang pertama: ADNI 1 dan ADNI 2/GO. Variabel yang diekstraksi dari data adalah fludeoxyglucose PET (FDG), amyloid-beta (ABETA), phosphorylated tau (PTAU), alel apolipoprotein E (APOE) 4; informasi demografis: usia, jenis kelamin, pendidikan (EDU); dan diagnosis pada AD (DX). Tabel 1 menyajikan statistik ringkasan dari kumpulan data. Setelah menghapus catatan dengan nilai yang hilang, ada 1.008 peserta yang tersisa dengan setidaknya satu catatan lengkap, dan 266 dengan kunjungan tindak lanjut reguler dua tahun.

Figure 1. Te interpretation of edges

grafik "Standar emas".Kaskade biomarker AD telah dievaluasi secara luas. Deposisi ABETA di otak merupakan kejadian awal dalam proses penyakit dan ditangkap melalui penurunan CSF ABETA. Faktor risiko ABETA yang ditunjukkan adalah usia dan jumlah alel APOE46,20,21. ABETA menyebabkan pembentukan kusut neurofibrillary hilir dan selanjutnya neurodegenerasi, yang keduanya ditangkap oleh disfungsi metabolik melalui FDG-PET22 dan peningkatan PTAU yang diukur pada CSF23. Kedua penanda FDG-PET dan CSF PTAU adalah prediktor terkuat dari disfungsi kognitif atau diagnosis24,25 (dibandingkan dengan ABETA). Pendidikan, pengganti ketahanan kognitif, mempengaruhi status kognitif individu26. Semua ini adalah hubungan yang mapan dalam literatur. Ada asosiasi kausal yang lebih lemah seperti jenis kelamin yang mempengaruhi beberapa asosiasi ini yang tidak kami pertimbangkan untuk mengevaluasi algoritme karena dampak dari asosiasi ini jauh lebih kecil dibandingkan dengan efek utama yang dipertimbangkan dalam grafik "standar emas". Hubungan yang dijelaskan di atas ditunjukkan pada Gambar. 2.

Pengetahuan latar belakang dan data cross-sectional vs longitudinal.Untuk membatasi hubungan yang dapat ditemukan oleh algoritme, pengetahuan latar belakang dapat diberikan dalam bentuk tepi yang harus dimiliki atau tidak dimiliki (dilarang). Dalam makalah ini, kami mendefinisikan tiga derajat latar belakang pengetahuan sebagai: (Tingkat 1) Tidak ada pengetahuan: struktur yang ditemukan murni mencerminkan data; tidak ada tepi yang dilarang. (Level 2) Pengetahuan latar belakang yang sepele: (a) tepi di antara variabel demografis dilarang (walaupun hubungan di antara mereka dapat tetap ada) (b) tepi dari biomarker atau diagnosis ke variabel demografis dilarang. (Tingkat 3)

Figure 2. Te

Desain studi.Studi penemuan kausal. Kami mengekstrak dua set data dari ANDI untuk bagian penelitian ini: satu adalah cross-sectional tunggal, dan data dikumpulkan pada kunjungan awal yang dilakukan oleh setiap peserta. Yang kedua adalah longitudinal, di mana kami memasukkan data dari dua bagian: kunjungan awal, dan kunjungan yang dilakukan pada 24 bulan. Catatan dengan data yang hilang telah dihapus dari studi lebih lanjut.

Untuk menghasilkan hasil yang kuat, baik data cross-sectional dan longitudinal di-bootstrap 100 kali di tingkat peserta. Sepuluh, tiga algoritma, SEM, FCI, dan FGES diuji pada semua sampel bootstrap untuk evaluasi, menggabungkan tiga tingkat pengetahuan yang berbeda yang dijelaskan di bagian sebelumnya.

Table 1. Characteristics for Continuous and Categorical Variables. N=1008.

Studi pemulihan SEM. Karena sebagian besar peneliti akan memulai dengan grafik yang dihipotesiskan dan hanya menggunakan SEM untuk menambahkan sisi, kami juga menguji SEM dalam kasus penggunaan yang diasumsikan ini: kami menginisialisasi (dihipotesiskan) grafik dengan menghapus setiap sisi tunggal dan setiap pasang sisi dari grafik "standar emas" , dan kemudian diuji apakah SEM dapat memulihkan tepi yang dihapus setelah tidak lebih dari lima iterasi penambahan tepi. Kami memilih lima dalam penelitian ini karena lebih dari lima kali penambahan tepi akan menghasilkan grafik dengan daya ingat yang rendah.

metrik evaluasi. Untuk menilai kinerja metode, kami mendefinisikan metrik evaluasi berikut. Sebuah tepi benar, jika dan hanya jika tepi yang sama ada dalam grafik "standar emas" dan orientasi tepi bertepatan dengan orientasi dalam grafik "standar emas"; sebuah tepi semi-benar, jika dan hanya jika tepi yang sama ada dalam grafik "standar emas" dan orientasinya tidak bertentangan dengan orientasi sebenarnya dari tepi dalam grafik "standar emas"; Dan akhirnya, sebuah edge salah jika edge tersebut tidak ada dalam grafik "gold standard" atau jika ada tetapi orientasinya berlawanan dengan orientasi sebenarnya.

Kami akan menyajikan metrik berikut:

1. Jumlah tepi yang benar, semi benar, salah

2. Presisi: proporsi tepi yang benar atau semi-benar atas semua tepi yang dilaporkan oleh algoritme

3. Ingat: proporsi tepi dalam grafik "standar emas" yang benar atau semi-benar dilaporkan

4. Occurrence rate: persentase adjacency yang ditunjukkan pada hasil dari 100 bootstrap run




Hasil

studi penemuan kausal. Struktur kausal yang ditemukan yang dihasilkan oleh algoritma SEM, FCI, dan FGES di tiga tingkat "pengetahuan" sebelumnya ditunjukkan di bagian ini. Mekanisme kesalahan tipikal di balik layar akan dibahas lebih lanjut di bagian diskusi.

Eksperimen 1: Tanpa latar belakang pengetahuan. Pada Gambar. 3, kami menyajikan tepi dengan setidaknya 80 persen tingkat kemunculan dalam sampel bootstrap 100 (nomor Te terletak di dekat setiap tepi). Tepi yang tidak ada dalam grafik standar emas diwarnai dengan warna merah. Angka-angka di sebelah kanan setiap grafik adalah presisi, recall, dan jumlah edge yang benar, semi-benar, dan salah yang dirata-ratakan pada 100 sampel bootstrap. Untuk memudahkan perbandingan langsung, variabel diletakkan hampir identik: variabel yang sama menempati lokasi relatif yang sama di ketiga grafik. SEM hanya mampu mengambil dua tepi yang benar dari grafik "standar emas" (dengan presisi rata-rata 0.24 dan mengingat 0,30), sementara FCI dan FGES menemukan 4 dari 8 tepi dengan benar atau semi-benar (presisi 0,24 dan 0,44, mengingat 0,46 dan 0,6 secara bersamaan). Baik FCI maupun FGES berhasil memulihkan hubungan kausal antara variabel genetik APOE41 dengan ABETA, ABETA dengan FDG, dan FDG, PTAU dengan DX. Namun, algoritme gagal menentukan arah beberapa hubungan. Kami juga mengamati bahwa ketiga algoritme melaporkan tepi dari biomarker ke variabel demografis yang tentunya merupakan kesalahan (misalnya ABETA menyebabkan APOE42 dalam grafik FCI). Penting untuk dicatat bahwa beberapa hubungan mapan seperti usia dan amiloid serta pendidikan dan diagnosis tidak ditemukan dalam grafik yang tidak memiliki latar belakang pengetahuan.

Eksperimen 2: Penambahan pengetahuan latar belakang sepele. Gambar 4 menyajikan struktur kausal yang ditemukan oleh tiga algoritme yang menggabungkan pengetahuan latar belakang sepele: variabel demografis tidak dapat disebabkan oleh variabel demografis lain atau oleh biomarker (misalnya usia peserta tidak dipengaruhi oleh pendidikan atau tingkat ABETA). Struktur Gambar 4 analog dengan Gambar 3.

Sementara semua metode membuat beberapa kesalahan, ada peningkatan yang signifikan ketika informasi latar belakang yang sepele ditambahkan. Beberapa penyebab salah yang ditemukan oleh SEM sebenarnya adalah hubungan sebab akibat tidak langsung dalam "standar emas". Misalnya, efek dari APOE42 ke DX adalah efek tidak langsung yang mengalir melalui ABETA dalam grafik 'standar emas'. Ketiga algoritma menemukan tepi ABETA →DX. Meskipun ini bukan efek kausal langsung dalam grafik "standar emas" kami, ABETA adalah penyebab umum penurunan FDG serta peningkatan PTAU dan baik FDG maupun PTAU mengarah ke DX. Oleh karena itu, pengaruh ABETA dan DX dapat diantisipasi. Baik FCI dan FGES melaporkan tepi yang salah arah antara PTAU dan DX. Kita akan melihat kesalahan ini dikoreksi dengan menggunakan data longitudinal. Algoritme FCI juga melaporkan perancu yang tidak terukur antara PTAU dan DX dengan FDG, yang merupakan hipotesis menarik yang memerlukan penelitian lebih lanjut. Di antara ketiga algoritme, SEM mencapai kinerja terendah (Precision 0.31, recall 0.39) sementara FCI dan FGES mencapai kinerja yang lebih tinggi dan jauh lebih tinggi (FCI: 0.42 presisi dan 0.55 recall; FGES {{10}}.71 presisi dan 0.68 recall).

Eksperimen 3: Penambahan data longitudinal dan pengetahuan latar belakang sepele. Gambar 5 menyajikan tepi yang paling sering ditemukan oleh tiga algoritma dan metrik kinerjanya. Tata letak grafik berbeda dari Gambar sebelumnya karena dibangun di atas kumpulan data longitudinal. Semua node yang terkait dengan biomarker atau diagnosis karenanya muncul dua kali: sekali dengan nilai dasarnya (dilambangkan dengan akhiran '0.0') dan sekali pada 24 bulan (dilambangkan dengan '0. 24' akhiran). Sebagian besar statistik lebih ditingkatkan relatif terhadap hasil sebelumnya dan FGES memulihkan grafik dengan hanya satu tepi yang salah.

Kinerja algoritma SEM tertinggal di belakang dua algoritma penemuan kausal khusus lainnya. Dalam beberapa bootstrap berjalan, SEM melewatkan efek langsung antara pengukuran longitudinal dari biomarker yang sama (misalnya perkiraan probabilitas SEM menemukan tepi ABETA.{{0}} →ABETA.24 adalah 0,47 di mana FCI dan FGES selalu menyertakan tepi ini).

Algoritma FCI selanjutnya mengidentifikasi bahwa PTAU pada kunjungan awal memiliki efek pada diagnosis (AD) pada 24 bulan. Dengan kata lain, PTAU mungkin memiliki efek tertinggal pada diagnosis AD yang merupakan hipotesis yang sangat masuk akal. Kami juga mengamati bahwa USIA dan PENDIDIKAN mengarah pada FDG dan diagnosis yang berbeda pada kunjungan pertama, tetapi tidak langsung ke penilaian pada 24 bulan (setelah menyesuaikan penilaian pada kunjungan awal).

Algoritma FGES menggabungkan data longitudinal dan berhasil menemukan tepi FDG ke DX. Itu juga menghapus tepi yang salah dari DX ke PTAU. Selanjutnya, dengan data longitudinal, tepi yang sebelumnya tidak terarah yang diidentifikasi oleh FGES diarahkan tanpa mengurangi presisi dan daya ingat keseluruhan.

Studi pemulihan eM.Tabel 2 menunjukkan statistik saat kami menguji kemampuan SEM untuk memulihkan tepi yang dihapus dari grafik "standar emas". Dalam setiap proses, kami menghapus satu sisi atau sepasang sisi. "Tingkat pemulihan penuh" mewakili persentase proses di mana SEM berhasil memulihkan sepenuhnya tepi yang dihapus. Kolom "presisi" dan "recall" didefinisikan dengan cara yang sama seperti pada eksperimen sebelumnya. Seperti yang dapat kita lihat dari Tabel 2, ketika kita menghapus hanya satu sisi, tingkat pemulihan sangat rendah (12,5 persen). Saat kami menghapus dua sisi dari grafik "standar emas", SEM tidak dapat memulihkan grafik yang sebenarnya.


Diskusi

Dalam studi ini, kami membandingkan tiga metodologi berbeda untuk menciptakan kembali struktur kausal kebenaran dasar yang diketahui berdasarkan dataset observasional menggunakan tiga tingkat "pengetahuan" yang berbeda. Kami menggunakanpenyakit alzheimerdata dari ADNI yang merupakan kumpulan data yang dapat diakses secara terbuka. Karena hubungan antara biomarker dan diagnosis dipenyakit alzheimerdipahami dengan baik, kami mulai dengan struktur kausal "standar emas" berdasarkan literatur yang ada. Sepuluh, kami menerapkan tiga algoritma untuk menemukan struktur kausal ini dari data. Karya ini menyoroti kesalahan umum yang dibuat oleh algoritme yang berbeda dan menawarkan kami ide dan saran untuk menghindari kesalahan ini. Pada akhirnya, panduan rinci tentang bagaimana algoritma penemuan kausal dapat diterapkan untuk menemukan hubungan kausal berkualitas tinggi disediakan.

Masing-masing dari tiga algoritma yang digunakan dalam pekerjaan ini mewakili kelas algoritma dengan karakteristik spesifiknya. Dua dari algoritma, FCI dan FGES, adalah algoritma penemuan kausal khusus, sedangkan yang ketiga, SEM, terutama dirancang sebagai alat konfirmasi. Algoritme penemuan kausal khusus mengungguli SEM di ketiga tingkat latar belakang pengetahuan. Hal ini tidak mengherankan, karena SEM tidak dirancang secara khusus untuk menemukan struktur kausal; statistik yang dilaporkan oleh SEM hanya menunjukkan kemungkinan penyesuaian pada struktur kausal yang ditentukan pengguna apriori. Yang mengejutkan adalah sejauh mana FGES mengungguli SEM, karena baik FGES dan SEM mengoptimalkan kriteria yang sama, yaitu BIC. Perbedaan utama antara FGES dan SEM adalah skala ruang pencarian yang mendasarinya: FGES mempertimbangkan susunan grafik yang lebih luas, semua grafik yang memiliki struktur ketergantungan yang sama (kumpulan hubungan kemandirian bersyarat yang sama di antara variabel). Dari percobaan pemulihan SEM, kami juga mengamati bahwa saran SEM untuk menambahkan tepi umumnya tidak dapat diandalkan. Tepi ini dapat memaksimalkan BIC dalam ruang pencarian SEM yang terbatas, tetapi ini bukanlah tepi optimal secara keseluruhan: FGES, dengan ruang pencariannya yang lebih besar, berhasil (hampir sempurna) memulihkan grafik "standar emas".

Dengan FCI dan FGES memiliki ruang pencarian yang serupa, perbedaan utama di antara mereka terletak pada algoritma pencarian mereka. Kinerja algoritma berbasis skor FGES lebih tinggi dan lebih stabil daripada algoritma berbasis kendala FCI dalam penelitian kami. Pengambilan keputusan FCI dipengaruhi oleh tes independensi yang salah yang disebabkan oleh bias seleksi atau artefak data. Kesalahan ini menyebar ke bagian lain dari grafik dengan menghasilkan struktur "V" atau "Y" yang salah dan akhirnya menyebabkan kerusakan pada sebagian besar grafik. Sebaliknya, algoritma berbasis skor mempertimbangkan kemungkinan struktur global saat membuat keputusan lokal; jadi, kesalahan ini tetap terlokalisasi. Ini menjelaskan mengapa struktur FGES yang ditemukan sebelum atau sesudah menambahkan pengetahuan trivia lebih konsisten. FCI memiliki keuntungan karena dapat mengendurkan asumsi tipikal tidak ada pembaur yang tidak terukur. Relaksasi ini dapat berguna ketika mengidentifikasi perancu yang tidak terukur atau mendanai hubungan sebab akibat yang tidak terkait adalah penting. Dalam penelitian kami, FCI menemukan bahwa hubungan dari ABETA ke FDG tidak dikacaukan dan bahwa pembaur yang tidak terukur mungkin ada antara FDG, DX (Gbr. 4-FCI)

Kami menyelidiki lebih lanjut kesalahan yang dibuat FCI dan FGES. Kami mengelompokkan kesalahan ini ke dalam tiga kategori dan menjelaskan penyebab dan solusinya di Tabel 3.



1. Jenis kesalahan pertama terjadi ketika artefak dalam data menyebabkan tepi yang salah. Misalnya, FCI melaporkan keunggulan antara EDU dan SEX (Gbr. 3-FCI), karena, dalam sampel kami, tingkat pendidikan rata-rata peserta pria lebih tinggi. Menghindari tepi yang salah seperti itu penting karena berpotensi menciptakan struktur "V" atau "Y" yang salah yang membahayakan langkah-langkah penemuan kausal yang tersisa. Menambahkan pengetahuan latar belakang yang sepele dapat menyelesaikan masalah ini dengan mencegah algoritme memperlakukan asosiasi sebagai sebab-akibat.

2. Ketika pengetahuan latar belakang yang diterima secara universal tidak tersedia, kompensasi untuk artefak data lebih sulit dan dapat memiliki efek hilir yang jauh. Misalnya, struktur APOE42-PTAU-FDG disimpulkan sebagai struktur "V" (APOE42 →PTAU FDG) di beberapa bootstrap berjalan. Kesalahan ini adalah hasil dari independensi tunggal yang salah disimpulkan antara APOE42 dan FDG dari data sampel. Kesalahan ini menyebar melalui tiga asosiasi antara (1) APOE42 dan PTAU, (2) PTAU dan FDG, dan (3) APOE42 dan FDG bergantung pada PTAU, yang menyebabkan struktur "V" di antara ketiganya. Kita tidak dapat mencegah tepi ini menggunakan pengetahuan latar belakang kecuali kita mengetahui hubungan independensi bersyarat antara APOE42 dan FDG sebelumnya. Penggunaan data longitudinal membantu memperbaiki kesalahan ini; seperti yang dapat kita lihat pada Gambar. 5-FCI, substruktur dikoreksi ketika data longitudinal digunakan.

3. Sementara data longitudinal memberikan solusi untuk sejumlah masalah, persyaratan pengamatan berulang dapat membatasi ukuran sampel dan menimbulkan beberapa kesalahannya sendiri. Misalnya, FCI menemukan kemungkinan hubungan tertinggal antara PTAU pada waktu 0 dan DX pada bulan 24 (Gbr. 5-FCI), namun, hubungan yang sama tidak diamati pada hasil FGES (Gbr. 5-FGES)–mungkin karena ukuran sampel yang kecil.

Dalam studi longitudinal, struktur lokal lintas titik waktu tidak dijamin sama. Misalnya, dalam grafik yang ditemukan oleh FGES, ABETA.{{0}} menyebabkan PTAU.0 tetapi ABETA.24 tidak menyebabkan PTAU.24. Alasannya adalah bahwa ABETA.0 adalah induk umum dari ABETA.24 dan PTAU.0. PTAU.24 adalah independen bersyarat dari ABETA.24 yang diberikan baik ABETA.{{10}} atau PTAU.0. Hubungan independensi bersyarat ini menyiratkan bahwa dengan adanya ABETA.0 atau PTAU.0, ABETA.24 tidak diperlukan untuk menjelaskan variasi dalam PTAU.24.

Meskipun grafik akhir yang dipelajari dari data pengamatan sangat cocok dengan grafik "standar emas", kesimpulan kami masih bergantung pada kebenaran "standar emas". Secara umum, kami memiliki keyakinan tinggi pada grafik "standar emas" karena mekanisme biologis di balik kaskade biomarker AD dipahami dengan baik dan FGES berhasil menemukan "standar emas" dengan hampir sempurna. Namun, sangat mungkin bahwa FDG dan PTAU hanya menjelaskan sebagian dari efek ABETA pada diagnosis DA; penyebab langsung dari ABETA pada DX bisa ada. Meskipun kami merekomendasikan data longitudinal, pengumpulan data secara longitudinal seringkali memakan biaya yang biasanya menghasilkan ukuran sampel yang lebih kecil. Ukuran sampel yang kecil menurunkan kekuatan statistik dalam algoritma penemuan kausal yang merupakan trade-off. Kami mencoba mengurangi ukuran sampel sebesar 50 persen dan 75 persen dan melakukan analisis yang sama. Ketika kami mengurangi ukuran sampel sebesar 50 persen , jumlah total tepi yang ditemukan di 100 iterasi bootstrap berkurang. Namun, tepi yang secara konsisten ditemukan pada sampel penuh juga ditemukan secara konsisten pada sampel yang dikurangi. Kami mencapai presisi dan recall yang serupa. Ketika kami semakin mengurangi ukuran sampel (dengan total 75 persen ), jumlah total tepi semakin berkurang. Sementara tepi yang paling sering ditemukan terus ditemukan, jumlah "tepi kebisingan", tepi yang ditemukan hanya dalam beberapa iterasi bootstrap, meningkat.

Kesimpulannya, algoritma penemuan kausal yang berdedikasi mengungguli SEM dalam menemukan struktur kausal. Dalam analisis data dunia nyata, kualitas data memengaruhi kebenaran struktur yang ditemukan. Memasukkan pengetahuan sebelumnya dan menggunakan data longitudinal dapat meningkatkan hasil yang ditemukan dengan mencegah algoritma membuat beberapa kesalahan potensial.

1. Jenis kesalahan pertama terjadi ketika artefak dalam data menyebabkan tepi yang salah. Misalnya, FCI melaporkan keunggulan antara EDU dan SEX (Gbr. 3-FCI), karena, dalam sampel kami, tingkat pendidikan rata-rata peserta pria lebih tinggi. Menghindari tepi yang salah seperti itu penting karena berpotensi menciptakan struktur "V" atau "Y" yang salah yang membahayakan langkah-langkah penemuan kausal yang tersisa. Menambahkan pengetahuan latar belakang yang sepele dapat menyelesaikan masalah ini dengan mencegah algoritme memperlakukan asosiasi sebagai sebab-akibat.

2. Ketika pengetahuan latar belakang yang diterima secara universal tidak tersedia, kompensasi untuk artefak data lebih sulit dan dapat memiliki efek hilir yang jauh. Misalnya, struktur APOE42-PTAU-FDG disimpulkan sebagai struktur "V" (APOE42 →PTAU FDG) di beberapa bootstrap berjalan. Kesalahan ini adalah hasil dari independensi tunggal yang salah disimpulkan antara APOE42 dan FDG dari data sampel. Kesalahan ini menyebar melalui tiga asosiasi antara (1) APOE42 dan PTAU, (2) PTAU dan FDG, dan (3) APOE42 dan FDG bergantung pada PTAU, yang menyebabkan struktur "V" di antara ketiganya. Kita tidak dapat mencegah tepi ini menggunakan pengetahuan latar belakang kecuali kita mengetahui hubungan independensi bersyarat antara APOE42 dan FDG sebelumnya. Penggunaan data longitudinal membantu memperbaiki kesalahan ini; seperti yang dapat kita lihat pada Gambar. 5-FCI, substruktur dikoreksi ketika data longitudinal digunakan.

3. Sementara data longitudinal memberikan solusi untuk sejumlah masalah, persyaratan pengamatan berulang dapat membatasi ukuran sampel dan menimbulkan beberapa kesalahannya sendiri. Misalnya, FCI menemukan kemungkinan hubungan tertinggal antara PTAU pada waktu 0 dan DX pada bulan 24 (Gbr. 5-FCI), namun, hubungan yang sama tidak diamati pada hasil FGES (Gbr. 5-FGES)–mungkin karena ukuran sampel yang kecil.

Dalam studi longitudinal, struktur lokal lintas titik waktu tidak dijamin sama. Misalnya, dalam grafik yang ditemukan oleh FGES, ABETA.{{0}} menyebabkan PTAU.0 tetapi ABETA.24 tidak menyebabkan PTAU.24. Alasannya adalah bahwa ABETA.0 adalah induk umum dari ABETA.24 dan PTAU.0. PTAU.24 adalah independen bersyarat dari ABETA.24 yang diberikan baik ABETA.{{10}} atau PTAU.0. Hubungan independensi bersyarat ini menyiratkan bahwa dengan adanya ABETA.0 atau PTAU.0, ABETA.24 tidak diperlukan untuk menjelaskan variasi dalam PTAU.24.

Meskipun grafik akhir yang dipelajari dari data pengamatan sangat cocok dengan grafik "standar emas", kesimpulan kami masih bergantung pada kebenaran "standar emas". Secara umum, kami memiliki keyakinan tinggi pada grafik "standar emas" karena mekanisme biologis di balik kaskade biomarker AD dipahami dengan baik dan FGES berhasil menemukan "standar emas" dengan hampir sempurna. Namun, sangat mungkin bahwa FDG dan PTAU hanya menjelaskan sebagian dari efek ABETA pada diagnosis DA; penyebab langsung dari ABETA pada DX bisa ada. Meskipun kami merekomendasikan data longitudinal, pengumpulan data secara longitudinal seringkali memakan biaya yang biasanya menghasilkan ukuran sampel yang lebih kecil. Ukuran sampel yang kecil menurunkan kekuatan statistik dalam algoritma penemuan kausal yang merupakan trade-off. Kami mencoba mengurangi ukuran sampel sebesar 50 persen dan 75 persen dan melakukan analisis yang sama. Ketika kami mengurangi ukuran sampel sebesar 50 persen , jumlah total tepi yang ditemukan di 100 iterasi bootstrap berkurang. Namun, tepi yang secara konsisten ditemukan pada sampel penuh juga ditemukan secara konsisten pada sampel yang dikurangi. Kami mencapai presisi dan recall yang serupa. Ketika kami semakin mengurangi ukuran sampel (dengan total 75 persen ), jumlah total tepi semakin berkurang. Sementara tepi yang paling sering ditemukan terus ditemukan, jumlah "tepi kebisingan", tepi yang ditemukan hanya dalam beberapa iterasi bootstrap, meningkat.

Kesimpulannya, algoritma penemuan kausal yang berdedikasi mengungguli SEM dalam menemukan struktur kausal. Dalam analisis data dunia nyata, kualitas data memengaruhi kebenaran struktur yang ditemukan. Memasukkan pengetahuan sebelumnya dan menggunakan data longitudinal dapat meningkatkan hasil yang ditemukan dengan mencegah algoritma membuat beberapa kesalahan potensial.

Cistanche can prevent Alzheimer's disease, choose Cistanche for brain health, click here to get samples

Cistanche dapat mencegah penyakit Alzheimer, pilih Cistanche untuk kesehatan otak, klik di sini untuk mendapatkan sampel




Referensi

1. Beam, AL & Kohane, IS Big Data dan Machine Learning dalam Perawatan KesehatanBig Data dan Machine Learning dalam Perawatan KesehatanBig Data dan Machine Learning dalam Perawatan Kesehatan. JAMA 319, 1317–1318, https://doi.org/10.1001/jama.2017.18391 (2018).

2. Murdoch, TB & Detsky, AS Aplikasi Big Data ke Layanan Kesehatan Tak Terelakkan Penerapan Big Data ke Layanan Kesehatan. JAMA 309, 1351–1352.

3. Trister, AD, Buist, DSM & Lee, CI Akankah Machine Learning Mengimbangi Keseimbangan dalam Skrining Kanker Payudara? Akankah Machine Learning Mengimbangi Keseimbangan dalam Skrining Kanker Payudara? Akankah Machine Learning Mengimbangi Keseimbangan dalam Skrining Kanker Payudara? JAMA Onkologi 3, 1463–1464.

4. Rogers, MB Tidak Ada Hari Esok untuk BESOK. ALZFORUM.

5. Arvanitakis, Z. et al. Diabetes berhubungan dengan infark serebral tetapi tidak dengan patologi AD pada orang tua. Neurologi 67, 1960–1965.

6. Vemuri, P. et al. Usia, kesehatan pembuluh darah, dan biomarker penyakit Alzheimer dalam sampel lansia. Ann. saraf. 82, 706–718.

7. Jack, CR Jr. dkk. Melacak proses patofisiologi pada penyakit Alzheimer: model hipotetis terbaru dari biomarker dinamis. Lancet Neurol. 12, 207–216, https://doi.org/10.1016/s1474-4422(12)70291-0 (2013).

8. Mutiara, J. Kausalitas: Model, Penalaran, dan Inferensi. Jil. 64 (Cambridge University Press, 2000).

9. Spirtes, P., Meek, C. & Richardson, TS Inferensi Kausal di Kehadiran Variabel Laten dan Bias Seleksi. CoRR abs/1302.4983 (2013).

10. Ramsey, JD Meningkatkan Pencarian Kesetaraan Greedy untuk Variabel Kontinu. CoRR abs/1507.07749 (2015).

11. Chickering, Identifikasi Struktur Optimal DM Dengan Pencarian Greedy. Jurnal Penelitian Pembelajaran Mesin 3, 507–554 (2002).

12. Mani, S., Spirtes, P. & Cooper, GF Sebuah studi teoritis struktur Y untuk penemuan kausal. CoRR abs/1206.6853 (2012).

13. Spirtes, P., Clark, G. & Scheines, R. Penyebab, Prediksi, dan Pencarian. (Te MIT Press, 2000).

14. Schwarz, G. Memperkirakan Dimensi Model. Sejarah Statistik 6, 461–464.

15. Meek, C. Model Grafis: Memilih model kausal dan statistik, (1997).

16. Kline, RB Prinsip dan praktik pemodelan persamaan struktural, edisi ke-3. 265–295 (Guilford Press, 2011).

17. Heckerman, D., Meek, C. & Cooper, G. Dalam Inovasi dalam Pembelajaran Mesin: Teori dan Aplikasi (eds. Dawn E. Holmes & Lakhmi C. Jain) 1-28 (Springer Berlin Heidelberg, 2006).

18. Rosseel, Y. lavaan: Paket R untuk Pemodelan Persamaan Struktural. Jurnal Perangkat Lunak Statistik 48, 36, https://doi.org/10.18637/ jss.v048.i02 (2012).

19. Weiner, MW dkk. Dampak Inisiatif Neuroimaging Penyakit Alzheimer, 2004 hingga 2014. Alzheimer & demensia: jurnal Asosiasi Alzheimer 11, 865–884.

20. Mishra, S. dkk. Pencitraan otak longitudinal pada penyakit Alzheimer praklinis: dampak genotipe epsilon4 APOE. Otak 141, 1828–1839.


Anda Mungkin Juga Menyukai