Menjelajahi Transformator Penglihatan yang Diawasi Sendiri Untuk Pengenalan Gaya Berjalan di Alam Liar Bagian 1

Nov 24, 2023

Abstrak:

Cara berjalan (gait) adalah biometrik yang kuat yang digunakan sebagai metode sidik jari yang unik, memungkinkan analisis perilaku yang tidak mengganggu dilakukan dari jarak jauh tanpa kerja sama subjek.

Kita semua tahu bahwa olahraga membantu kesehatan yang baik. Selain itu, olahraga juga membantu meningkatkan daya ingat. Jalan kaki adalah bentuk olahraga yang paling sederhana dan termudah untuk dilakukan, dan banyak orang menikmati bersantai sambil berjalan atau jogging. Kini, lebih banyak penelitian menunjukkan bahwa berjalan kaki memberikan manfaat yang bermanfaat bagi otak.

Pertama, jalan kaki merangsang sistem saraf otak, sehingga membantu memperkuat fungsi otak. Saat tubuh bergerak, detak jantung dan aliran darah kita meningkat, yang juga merangsang otak untuk memproduksi lebih banyak neuron dan sinapsis. Koneksi antara neuron dan sinapsis ini dapat menciptakan jaringan saraf baru dan proses berpikir yang lebih cepat.

Kedua, jalan kaki dapat menghilangkan stres dan kecemasan yang sangat penting untuk meningkatkan daya ingat. Saat pikiran dan tubuh berada dalam keadaan tegang, depresi, atau cemas, otak melepaskan hormon yang disebut kortisol. Kortisol merusak neuron dan sinapsis di otak, yang dapat menyebabkan hilangnya memori. Jalan kaki meredakan stres dan kecemasan, mengurangi produksi kortisol dalam tubuh, serta membantu menjaga kesehatan neuron dan sinapsis.

Terakhir, jalan kaki meningkatkan sirkulasi darah ke otak. Beberapa penelitian menunjukkan bahwa sirkulasi darah yang baik dapat membantu meningkatkan daya ingat. Seiring bertambahnya usia, pembuluh darah di otak lambat laun tersumbat, sehingga suplai oksigen ke otak tidak mencukupi. Jalan kaki dapat meningkatkan kesehatan jantung, memungkinkan jantung mengantarkan oksigen dan nutrisi ke otak dengan lebih efektif, sehingga meningkatkan daya ingat dan fungsi otak.

Oleh karena itu, jalan kaki merupakan salah satu bentuk olah raga yang baik bagi tua maupun muda. Selain meningkatkan kesehatan fisik, jalan kaki juga dapat membantu meningkatkan daya ingat. Mari kita berjalan jauh setiap hari untuk menjadikan diri kita lebih sehat dan lebih baik! Terlihat bahwa kita perlu meningkatkan daya ingat, dan Cistanche deserticola dapat meningkatkan daya ingat secara signifikan karena Cistanche deserticola merupakan bahan obat tradisional Tiongkok yang memiliki banyak khasiat unik, salah satunya meningkatkan daya ingat. Khasiat daging cincang berasal dari berbagai bahan aktif yang dikandungnya, antara lain asam, polisakarida, flavonoid, dll. Bahan-bahan tersebut dapat meningkatkan kesehatan otak dengan berbagai cara.

improve memory

Klik tahu 10 cara meningkatkan daya ingat

Berbeda dengan metode otentikasi biometrik yang lebih tradisional, analisis gaya berjalan tidak memerlukan kerja sama eksplisit dari subjek dan dapat dilakukan dalam pengaturan resolusi rendah, tanpa mengharuskan wajah subjek tidak terhalang/terlihat. Sebagian besar pendekatan terkini dikembangkan dalam lingkungan yang terkontrol, dengan data beranotasi yang bersih dan berstandar emas, yang mendukung pengembangan arsitektur saraf untuk pengenalan dan klasifikasi.

Baru-baru ini analisis gaya berjalan berani menggunakan kumpulan data yang lebih beragam, berskala besar, dan realistis untuk jaringan yang telah dilatih sebelumnya dengan cara yang diawasi sendiri. Rezim pelatihan yang diawasi sendiri memungkinkan pembelajaran representasi gaya berjalan yang beragam dan kuat tanpa anotasi manual yang mahal. Didorong oleh penggunaan model transformator di semua bidang pembelajaran mendalam, termasuk visi komputer, dalam karya ini, kami mengeksplorasi penggunaan lima arsitektur transformator visi berbeda yang secara langsung diterapkan pada pengenalan gaya berjalan yang diawasi sendiri.

Kami mengadaptasi dan melatih kembali ViT, CaiT, CrossFormer, Token2Token, dan TwinsSVT sederhana pada dua kumpulan data gaya berjalan skala besar yang berbeda: GREW dan DenseGait. Kami memberikan hasil ekstensif untuk zero-shot dan fine-tuning pada dua kumpulan data pengenalan gaya berjalan acuan, CASIA-B dan FVG, dan mengeksplorasi hubungan antara jumlah informasi gaya berjalan spasial dan temporal yang digunakan oleh transformator visual.

Hasil kami menunjukkan bahwa perancangan model trafo untuk memproses gerakan menggunakan pendekatan hierarki (yaitu, model CrossFormer) pada pergerakan yang lebih halus secara komparatif lebih baik daripada pendekatan keseluruhan kerangka sebelumnya.

Kata kunci:

pengenalan gaya berjalan; otentikasi biometrik; transformator penglihatan; estimasi pose; pembelajaran dengan pengawasan mandiri; pembelajaran kontrastif.

1. Perkenalan

Cara kita bergerak mengandung petunjuk penting tentang diri kita sendiri. Secara khusus, gaya berjalan kita (cara berjalan) telah dipelajari secara mendalam dalam bidang kedokteran [1], psikologi [2], dan ilmu olahraga [3]. Baru-baru ini, analisis gaya berjalan telah mendapat perhatian yang meningkat [4,5] dari komunitas ilmu komputer bertepatan dengan kemajuan eksponensial pembelajaran mendalam dan ketersediaan perangkat keras komputasi yang luas.

Sistem analisis gaya berjalan yang didukung AI telah berhasil mengenali subjek [6-10], memperkirakan demografi seperti jenis kelamin dan usia [11], dan memperkirakan atribut eksternal seperti pakaian [12], tanpa menggunakan isyarat penampilan eksternal apa pun. Hasil ini tidak mengejutkan, mengingat banyaknya perbedaan gaya berjalan individu, yang disebabkan oleh perbedaan struktur muskuloskeletal, faktor genetik dan lingkungan, serta keadaan emosi dan kepribadian orang yang berjalan kaki [13].

Sistem saat ini hanya benar-benar dilatih dan diuji di lingkungan dalam ruangan yang terkendali. Sebagian besar metode menggunakan kumpulan data CASIA-B [6] sebagai tolok ukur standar untuk model pengenalan gaya berjalan, yang berisi 124 subjek yang berjalan di dalam ruangan dengan cara yang dikontrol secara ketat dan ditangkap dengan beberapa kamera. Kompleksitas di dunia nyata tidak dapat sepenuhnya dimodelkan dengan skenario yang terbatas seperti itu. Baru-baru ini fokusnya adalah pada pemodelan gaya berjalan "di alam liar", dengan kumpulan data seperti DenseGait [12], GREW [7], dan Gait3D [14].

short term memory how to improve

Mengumpulkan kumpulan data berskala besar yang bersih dan diberi anotasi lengkap merupakan upaya yang luar biasa baik dari segi sumber daya finansial maupun waktu yang dialokasikan. Kumpulan data GREW [7] dilaporkan membutuhkan waktu 3 bulan kerja terus menerus untuk dikumpulkan dan diberi anotasi. Meskipun pendekatan tersebut berguna dalam mengembangkan arsitektur saraf untuk memproses gaya berjalan [8,9], pendekatan tersebut tidak cukup beragam untuk digunakan dengan tepat di lingkungan dunia nyata yang lebih santai.

Komunitas AI perlahan-lahan beralih dari pendekatan ini di bidang lain, dengan metode pembelajaran mandiri untuk penglihatan [15] dan bahasa [16] mendapatkan daya tarik yang signifikan dan seringkali melampaui metode tradisional yang diawasi. Kemajuan terbaru dalam pembelajaran dengan pengawasan mandiri menunjukkan bahwa model dengan pengawasan mandiri lebih kuat dan menunjukkan perilaku yang muncul, tidak didefinisikan secara eksplisit selama pelatihan.

Misalnya, DINO [17], seorang visiontransformer yang dilatih dalam rezim yang diawasi sendiri, mempelajari fitur khusus kelas yang memungkinkan segmentasi objek tanpa pengawasan tanpa menggunakan label apa pun selama pelatihan. Cosmaand Radoi [10] mengusulkan metode kontrastif pertama untuk pembelajaran mandiri untuk analisis gaya berjalan, dengan melatih ST-GCN [18] pada versi DenseGait yang lebih kecil [12]. Metode mereka memperoleh hasil yang masuk akal pada tugas pengenalan gaya berjalan hilir dan menunjukkan bahwa ada korelasi kuat antara ukuran kumpulan data yang telah dilatih sebelumnya dan kinerja transfer zero-shot.

Meskipun banyak pendekatan untuk analisis gaya berjalan telah memanfaatkan siluet yang diekstraksi dari pengurangan latar belakang [6,8,9], mengekstraksi siluet dalam skenario pengawasan nyata menyiratkan penggunaan teknik yang lebih canggih, seperti segmentasi contoh [19], yang memerlukan biaya komputasi yang tinggi. Urutan siluet menempati ruang penyimpanan yang signifikan dan tidak cukup fleksibel untuk digunakan dalam tugas lain yang berdekatan, seperti pengenalan aktivitas. Selain itu, siluet memberikan isyarat penampilan yang halus, sehingga tidak jelas sejauh mana gerakan digunakan dalam identifikasi [20].

Di sisi lain, model estimasi pose 2D menjadi semakin akurat dan efisien secara komputasi [21,22]. Kerangka lebih murah untuk diekstraksi, dan saat ini lebih dapat diandalkan dibandingkan jerat 3D dan pose 3D, terutama pada jarak jauh. Selain itu, kerangka 2D secara signifikan lebih ringan dibandingkan siluet dalam hal penyimpanan jangka panjang.

Arsitektur saat ini untuk memproses rangkaian kerangka memanfaatkan struktur grafik spasial alami yang ada pada kerangka manusia, sehingga menimbulkan bias induktif dalam desain model. Model seperti ST-GCN [18] dan MS-G3D [23] yang populer telah menunjukkan hasil yang mengesankan untuk pengenalan tindakan berbasis kerangka.

Pada saat yang sama, telah terjadi ledakan penggunaan model transformator di hampir semua bidang pembelajaran mendalam sejak penerapan awal model tersebut untuk pemrosesan bahasa alami.

Transformer dianggap sebagai arsitektur yang lebih umum, dengan sedikit bias induktif. Awalnya, transformator kesulitan untuk mencocokkan model CNN untuk klasifikasi gambar [24], namun saat ini melampaui model lain dan menunjukkan hasil yang menjanjikan dalam skenario yang diawasi sendiri, lebih dari jenis arsitektur lainnya, transformator telah menunjukkan kapasitas pembelajaran yang mengesankan dan perilaku yang muncul dalam diri mereka sendiri. -pengawasan [17].

Cosma dan Radoi [12] adalah orang pertama yang mengusulkan GaitFormer, adaptasi langsung dari model encoder transformator visi untuk pengenalan gaya berjalan, memanfaatkan kerangka individu sebagai "tambalan" masukan, yang pada dasarnya hanya melakukan perhatian temporal, mengabaikan hubungan perhatian spasial.

GaitFormer dilatih dengan cara yang diawasi sendiri dan melampaui metode pengenalan gaya berjalan lainnya bahkan tanpa penyesuaian apa pun. Penelitian sebelumnya memberikan semangat dan membuka jalan bagi studi yang lebih mendalam tentang potensi penerapan arsitektur transformator untuk analisis gaya berjalan. Dapatkah model transformator visi diadaptasi untuk pembelajaran representasi gaya berjalan kerangka yang diawasi sendiri?

Masalah arsitektural utama dalam transformator visi adalah menentukan hubungan yang tepat antara patch gambar, yang menentukan informasi lokal dan global. Ketika diterapkan pada gaya berjalan, pilihan dimensi tambalan berhubungan dengan jumlah informasi temporal dan spasial yang dikodekan dari urutan kerangka.

Dalam karya ini, kami menyajikan studi ekstensif tentang lima transformator penglihatan berbeda, yang diadaptasi untuk pengenalan gaya berjalan. Kami mengeksplorasi model ViT klasik [24], CaiT [25], CrossFormer [26], TwinsSVT [27], dan ViT token-to-token [28].

ways to improve memory

Setiap arsitektur dilatih secara terpisah dengan cara pengawasan mandiri yang kontras pada dua kumpulan data "di alam liar" berskala besar dari rangkaian kerangka gaya berjalan 2D: DenseGait—kumpulan data yang dikumpulkan secara otomatis dari aliran pengawasan mentah, dan GREW, kumpulan data lebih kecil yang berisi anotasi manusia yang bersih.

Kami mengeksplorasi kemampuan transfer di dua kumpulan data terkontrol untuk pengenalan gaya berjalan, CASIA [6], dan FVG [29]. Untuk setiap dataset, kami menganalisis transfer langsung (zero-shot) dan efisiensi data selama penyesuaian dengan melatih subset data yang semakin besar. Selain itu, kami melakukan studi ablasi pada hubungan antara dimensi spasial dan temporal untuk ukuran patch untuk SimpleViT dan CaiT , tulang punggung standar untuk sebagian besar transformator visi hingga saat ini.

Sisa makalah ini disusun sebagai berikut. Kami melakukan tinjauan tingkat tinggi terhadap karya terkait tentang model pengenalan gaya berjalan dan transformator penglihatan. Kami mengamati bahwa model representasi gaya berjalan mendapatkan manfaat yang besar dari pelatihan yang diawasi sendiri agar memiliki embeddings yang lebih kuat dan umum, dan model transformator telah menunjukkan kapasitas pemodelan yang besar dalam sistem pelatihan yang diawasi sendiri.

Selanjutnya, kami mendeskripsikan secara matematis lima arsitektur yang kami tolak ukur dan mendeskripsikan pra-pemrosesan data dan transformasi kerangka yang perlu dilakukan, sehingga transformator visi harus beroperasi secara mulus pada rangkaian kerangka. Kami juga menjelaskan augmentasi data, kumpulan data pelatihan dan benchmarking, serta penyiapan eksperimental.

Kami menampilkan hasil CASIA-B dan FVG untuk masing-masing dari lima arsitektur dan dua kumpulan data 'pra-pelatihan di alam liar'. Terakhir, kami melakukan studi ablasi mengenai hubungan antara ukuran patch spasial dan temporal dan memberikan diskusi singkat mengenai hasil kami. Kami membuat kode sumber kami tersedia untuk umum di GitHub (https://github.com/cosmaadrian/gait-vit, diakses pada 28 Februari 2023) untuk transparansi dan reproduktifitas.

2. Pekerjaan Terkait

Pada bagian ini, kami membuat gambaran singkat tentang metode yang ada untuk mengenali gaya berjalan di lingkungan yang tidak terkendali dan "di alam liar". Selanjutnya, kami menjelaskan perkembangan utama model transformator dan, khususnya, penerapannya dalam domain visi.

2.1. Pengenalan Gaya Berjalan

Sama halnya dengan identifikasi berbasis wajah, pengenalan gaya berjalan bergantung pada pembelajaran metrik. Berbeda dengan metode otentikasi biometrik tradisional, yang mengandalkan satu gambar (misalnya pengenalan wajah) dan memerlukan kerja sama yang luas (misalnya otentikasi biometrik berbasis iris mata), fitur gaya berjalan diproses sebagai rangkaian cuplikan gerakan. Dinamika gerakan seperti itu memerlukan lebih banyak kerumitan dalam menentukan sub-urutan yang paling informatif namun memungkinkan penggunaan otentikasi yang tidak mengganggu dari jarak jauh.

Dalam konteks ini, tugas tersebut menyiratkan pelatihan jaringan encoder untuk memetakan urutan berjalan ke ruang penyematan di mana kesamaan penyematan sesuai dengan kesamaan gaya berjalan. Penyematan jalan milik orang yang sama harus dekat dengan ruang penyematan dan mereka yang berasal dari identitas berbeda harus lebih jauh. Dalam ruang penyematan ini, inferensi dapat dilakukan dengan mendapatkan penyematan urutan berjalan dan memanfaatkan tetangga terdekat. pendekatan pada database jalan-jalan yang diketahui.

Pendekatan saat ini dalam pengenalan berbasis gaya berjalan dibagi menjadi dua kategori: berbasis penampilan [8,9] dan berbasis model [10,12,30]. Metode berbasis penampilan terlebih dahulu memperoleh siluet subjek berjalan dengan algoritma pengurangan latar belakang atau segmentasi dari setiap frame video.

Kemudian rangkaian siluet dimasukkan ke dalam arsitektur berbasis CNN yang mengekstrak fitur spasial dan temporal yang dikumpulkan ke dalam penyematan akhir untuk dikenali. Pendekatan berbasis model mengekstrak kerangka dari video RGB dengan model estimasi pose [21,22]. Urutan kerangka biasanya diproses oleh model yang mengandalkan konvolusi grafik [10,30] untuk mendapatkan penyematan gaya berjalan.

GaitSet, karya Chao dkk. [8], menganggap gaya berjalan sebagai serangkaian siluet yang tidak teratur. Para penulis berpendapat bahwa representasi ini lebih fleksibel daripada rangkaian siluet karena kuat terhadap susunan bingkai yang berbeda atau kombinasi dari beberapa arah dan variasi berjalan. Mereka menggunakan lapisan konvolusi untuk setiap siluet untuk mendapatkan fitur tingkat gambar dan menggabungkannya ke dalam fitur tingkat set dengan Set Pooling. Mereka memperoleh hasil akhir dengan menggunakan Pencocokan Piramida Horizontal versi mereka [31].

Penggemar dkk. [9] memperhatikan fakta bahwa bagian tertentu dari siluet manusia harus memiliki ekspresi spatiotemporal karena masing-masing memiliki pola yang unik. Arsitekturnya, GaitPart, menggunakan lapisan konvolusi fokus (FConvs), yang merupakan jenis konvolusi khusus dengan bidang reseptif yang lebih terbatas. Para penulis berpendapat bahwa FConvs membantu arsitektur mereka dalam mempelajari fitur-fitur yang lebih detail untuk berbagai bagian tubuh yang bergerak. Mereka juga memperkenalkan modul penangkapan gerak mikro, yang digunakan untuk mengekstraksi fitur-fitur rangkaian temporal kecil.

Teepe dkk. [30] mengusulkan GaitGraph, yang memanfaatkan jaringan konvolusional grafik yang diadaptasi yang disebut ResGCN [32] untuk mengkodekan fitur spatiotemporal yang diperoleh dari urutan kerangka. Li dkk. [33] mengusulkan PTP, yang merupakan struktur yang menggabungkan beberapa fitur temporal dari satu siklus gaya berjalan berdasarkan analisis tahapan berjalan yang paling penting.

Mereka juga memanfaatkan jaringan konvolusional grafik untuk ekstraksi fitur spasial, yang bekerja sama dengan PTP. Penulis memperkenalkan metode augmentasi data baru yang mengubah gaya berjalan menjadi beberapa langkah dalam siklus yang lebih realistis.

Namun, berbeda dari penelitian sebelumnya, kami bertujuan untuk mengeksplorasi kinerja arsitektur pengenalan gaya berjalan dalam skenario yang diawasi sendiri. Terinspirasi oleh kemajuan luar biasa dalam domain visi komputer, kami mengusulkan untuk mengadaptasi arsitektur transformator visi yang ada untuk beroperasi pada rangkaian kerangka, bukan gambar, dan untuk menguji kapasitas pemodelannya dalam skenario yang diawasi sendiri. Sebagian besar karya lain [8,9,30] memfokuskan upaya mereka pada pengembangan arsitektur saraf yang mencapai hasil yang mengesankan pada pengenalan gaya berjalan pada kumpulan data terkontrol.

Namun, kami bermaksud untuk menghilangkan kebutuhan akan anotasi manual yang mahal untuk kumpulan data gaya berjalan dan mengeksplorasi cara-cara pembelajaran mandiri yang sesuai untuk analisis gaya berjalan.

memory enhancement

Karya sebelumnya dalam domain ini [10,12] menunjukkan potensi untuk mempelajari representasi gaya berjalan yang baik dari kumpulan data yang beranotasi lemah. Cosmaand Radoi [12] mengusulkan GaitFormer, arsitektur berbasis transformator pertama untuk memproses rangkaian kerangka, terinspirasi oleh model ViT [24]. Mirip dengan [12], kami mencoba mengeksplorasi kinerja model transformator visi lainnya, dengan dinamika spasial dan temporal yang berbeda dalam mekanisme pemrosesan patch. Kumpulan data skala besar untuk pengenalan gaya berjalan telah diusulkan di masa lalu [7,12], yang memungkinkan pengembangan arsitektur umum untuk pembelajaran representasi.


For more information:1950477648nn@gmail.com


Anda Mungkin Juga Menyukai