Pengenalan Bahasa Isyarat Spatio-Temporal Berkelanjutan Menggunakan Jaringan Multi-Fitur Penuh Perhatian(1)

Jun 01, 2023

Abstrak: Mengingat aliran video, kami bertujuan untuk mendeteksi dengan benar tanda-tanda yang tidak tersegmentasi terkait dengan pengenalan bahasa isyarat berkelanjutan (CSLR). Terlepas dari peningkatan dalam metode pembelajaran mendalam yang diusulkan di area ini, kebanyakan dari mereka hanya berfokus pada penggunaan fitur RGB saja, baik gambar full-frame atau detail tangan dan wajah. Kelangkaan informasi untuk proses pelatihan CSLR sangat membatasi kemampuan untuk mempelajari banyak fitur menggunakan frame input video. Selain itu, mengeksploitasi semua bingkai dalam video untuk tugas CSLR dapat menghasilkan kinerja yang kurang optimal karena setiap bingkai berisi tingkat informasi yang berbeda, termasuk fitur utama dalam inferensi kebisingan. Oleh karena itu, kami mengusulkan pengenalan bahasa isyarat berkelanjutan spatiotemporal baru menggunakan jaringan multi-fitur yang penuh perhatian untuk meningkatkan CSLR dengan menyediakan fitur titik kunci tambahan. Selain itu, kami mengeksploitasi lapisan perhatian dalam modul spasial dan temporal untuk secara bersamaan menekankan beberapa fitur penting. Hasil eksperimen dari kedua set data CSLR menunjukkan bahwa metode yang diusulkan mencapai kinerja superior dibandingkan dengan metode canggih saat ini sebesar 0.76 dan 20.56 untuk skor WER pada set data CSL dan PHOENIX.

Desert living cistanche

Cistanche herbal Superman

Kata kunci: bahasa isyarat terus menerus; spasial; sementara; multi-fitur; poin kunci; perhatian diri

1. Perkenalan

Bahasa isyarat mengutamakan komunikasi manual menggunakan isyarat tangan, bahasa tubuh, dan gerakan bibir daripada suara untuk berkomunikasi [1,2]. Biasanya, bahasa isyarat digunakan oleh orang yang tuli atau sulit mendengar, tetapi juga dapat digunakan dalam situasi di mana tidak mungkin atau sulit untuk mendengar suara. Oleh karena itu, sistem pengenalan bahasa isyarat (SLR) diperlukan karena membantu menghubungkan orang-orang yang mengalami gangguan pendengaran dan mereka yang tidak.

Dalam beberapa tahun terakhir, para peneliti memusatkan banyak perhatian pada SLR karena informasi visual yang kaya yang diberikannya. Studi SLR terbaru biasanya dikelompokkan menjadi pengenalan bahasa isyarat terisolasi (ISLR) atau pengenalan bahasa isyarat berkelanjutan (CSLR). Beberapa karya hanya membahas ISLR [3,4], sementara yang lain hanya menganalisis tugas yang lebih mudah, seperti gerakan statis untuk pengenalan alfabet [5]. Sementara itu, metode terbaru biasanya lebih rumit karena menyelesaikan tugas-tugas CSLR [6-8]. Dibandingkan dengan ISLR, CSLR adalah masalah yang lebih menantang karena melibatkan rekonstruksi kalimat.

Cistanche tea2

Teh cistanche

Klik di sini untuk melihat produk teh Cistanche deserticola

【Minta lebih lanjut】 Email:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Riset CSLR masih banyak diminati karena implementasinya sangat erat kaitannya dengan kondisi sehari-hari di dunia nyata. Pendekatan ini bertujuan untuk mengenali rangkaian glos yang terjadi pada sebuah serial video tanpa segmentasi yang jelas atau bahkan tidak ada sama sekali. Selain itu, ini menggabungkan banyak penelitian pembelajaran mesin dan pemahaman menyeluruh tentang perilaku manusia. Misalnya, ini melibatkan pelacakan gerakan manusia [9], pengenalan gerakan [10], dan pengenalan wajah [11]. Namun demikian, ada beberapa tantangan untuk melakukan tugas-tugas CSLR.

Pertama, pengumpulan data dan anotasi mahal untuk CSLR [12]. Ini mungkin salah satu tantangan yang dihadapi dalam pengembangannya karena CSLR terlibat dalam jaringan yang besar dan jumlah data yang sangat mempengaruhi kinerja [13]. Selain itu, beberapa kumpulan data yang tersedia untuk bahasa isyarat dianotasi dengan lemah [12,14,15]. Untuk mengatasi masalah ini, banyak penelitian telah menggunakan pendekatan yang diawasi secara lemah, di samping penerapan modul penyelarasan dan ekstraktor fitur ke arsitektur jaringan [12].

Kedua, dibandingkan dengan ISLR, CSLR lebih rumit. Informasi yang cukup diperoleh dengan menggunakan beberapa fitur; ini telah terbukti mencapai kinerja yang lebih baik daripada menggunakan satu fitur seperti yang dilaporkan dalam karya sebelumnya [16-18]. Beberapa fitur tersebut terdiri dari fitur utama yaitu body image yang mencapai akurasi tertinggi dan fitur tambahan, seperti pose, kepala, tangan kiri, dan tangan kanan, yang memiliki akurasi lebih rendah untuk kinerja individu [17,18]. Pelatihan jaringan besar dengan jumlah data yang besar memakan waktu [13]. Menambahkan aliran input juga meningkatkan waktu pelatihan, sementara menggunakan fitur berbasis gambar tambahan meningkatkan biaya [19]. Oleh karena itu, kita perlu memilih fitur-fitur penting agar kita dapat berlatih secara efisien.

Cistanche deserticola slice (1)

Cistanche ramuan Cina

Ketiga, input video memiliki sejumlah besar gambar secara berurutan. Beberapa gambar memiliki bentuk tangan yang tidak jelas karena gerakannya yang cepat, kemungkinan mengarah ke informasi yang salah. Oleh karena itu, model yang kami usulkan memanfaatkan perhatian diri berdasarkan [20] untuk membantu memilih informasi penting. Selain itu, perhatian diri dibuktikan oleh [21,22] berdampak pada peningkatan kinerja.

Oleh karena itu, kami mengusulkan model novel yang disebut novel spatiotemporal attention multi-feature (STAMF) untuk menangani semua masalah. Kami mengikuti karya sebelumnya [17,23], yang telah terbukti berhasil untuk CSLR dengan masalah anotasi yang lemah. Mereka membangun model dengan menggunakan tiga komponen utama: yang pertama adalah modul spasial, yang kedua adalah modul temporal, dan yang ketiga adalah modul sequence learning. Kami mengusulkan input multi-fitur yang efisien dan efektif menggunakan fitur full frame bersama dengan fitur keypoint untuk melakukan tugas CSLR. Fitur full-frame merepresentasikan body image sebagai fitur utama, dan fitur keypoint sebagai fitur tambahan. Fitur poin utamanya adalah pose tubuh, termasuk detail pose tangan. Pose tubuh ini adalah fitur tambahan yang paling efektif karena dalam beberapa karya telah terbukti mencapai akurasi tertinggi setelah fitur full-frame [17,18]. Kami juga menggunakan modul perhatian yang menggunakan perhatian diri berdasarkan [20] untuk menangkap fitur penting dan membantu pembelajaran urutan untuk meningkatkan kinerja.

Kontribusi dari manuskrip ini diringkas sebagai berikut: • Kami memperkenalkan perhatian temporal baru ke dalam modul sekuens untuk menangkap titik waktu penting yang berkontribusi pada hasil akhir; • Kami memperkenalkan multi-fitur yang terdiri dari fitur full-frame dari nilai RGB frame sebagai fitur utama dan fitur keypoint yang mencakup pose tubuh dengan detail bentuk tangan sebagai fitur tambahan untuk meningkatkan performa pengenalan model; • Kami menggunakan metrik WER untuk menunjukkan bahwa model STAMF yang kami usulkan mengungguli model canggih pada kedua set data tolok ukur CSLR melalui eksperimen.

cistanche—Improve memory4

Suplemen Cistanche dekat saya-Meningkatkan Memori

2. Pekerjaan Terkait

Ada beberapa kemajuan dalam teknologi, dan banyak penelitian telah dilakukan pada SLR. Studi sebelumnya [24-27] mengeksplorasi kemungkinan penggunaan ISLR yang memiliki segmentasi untuk setiap kata. Dalam beberapa tahun terakhir, metode berbasis pembelajaran mendalam telah digunakan untuk mengekstraksi fitur menggunakan jaringan konvolusional, baik 2D [28,29] atau 3D [30,31], untuk representasi visualnya yang kuat. Sebagian besar penelitian awal tentang pengenalan bahasa isyarat berpusat pada ISLR dengan karakteristik multimodal [30-32], seperti RGB, peta kedalaman, dan kerangka, yang memberikan kinerja yang lebih baik.

Saat ini, CSLR menjadi lebih populer, meskipun belum tersegmentasi dengan jelas di antara setiap kata. Pekerjaan awal menggunakan ekstraktor fitur CNN [6,33] dan HMM [34] untuk membangun target urutan. Beberapa penelitian terbaru untuk sistem CSLR [17,23] telah memasukkan tiga langkah utama dalam melakukan tugas pengenalan masalah. Pertama, mereka melakukan ekstraksi fitur spasial, kemudian segmentasi temporal, dan terakhir sintesis kalimat dengan model bahasa [35], atau mereka menggunakan pembelajaran sekuens [17,23]. Pembelajaran sequence ini menggunakan Bi-LSTM dan CTC untuk menggali hubungan antara sign gloss pada sequence video. Meskipun menggunakan anotasi yang lemah yang memiliki urutan video yang tidak tersegmentasi untuk menentukan glos tanda, pendekatan ini telah menunjukkan hasil yang menjanjikan.

Namun, studi CLSR terkait terbaru yang menerapkan pendekatan multi-fitur [17] menggunakan lima fitur secara bersamaan. Pendekatan multi fitur lebih berat dibandingkan dengan menggunakan lebih sedikit fitur [19]. Pendekatan ini juga tidak dapat menangani frame yang berisik dari urutan video yang memiliki informasi yang tidak jelas, seperti bentuk tangan yang buram akibat gerakan yang cepat. Selain itu, mengandalkan pembelajaran urutan berbasis RNN mungkin menghadapi masalah dengan urutan panjang dan mungkin kehilangan konteks global [20].

cistanche—Improve memory3

Suplemen Cistanche dekat saya-Meningkatkan Memori

Penelitian saat ini bertujuan untuk meningkatkan kinerja dengan menambahkan mekanisme perhatian diri [21,22] yang dapat menangani urutan yang lebih panjang untuk mempelajari konteks global. Perhatian diri didasarkan pada penelitian awal [20] yang menunjukkan bahwa perhatian diri memiliki keunggulan mampu menangani ketergantungan yang lama. Namun, perhatian diri ini lebih mudah mempelajari jalur yang lebih pendek dibandingkan dengan jalur yang lebih panjang dengan ketergantungan yang panjang. Pada karya CLSR sebelumnya [21,22] self-attention dapat membantu jaringan untuk mempelajari fitur secara lebih efektif.

Oleh karena itu, dalam makalah ini, kami memperkenalkan model multi-fitur perhatian spatiotemporal baru. Model yang diusulkan ini secara efektif mengekstraksi fitur-fitur penting dan mempelajari urutannya dengan lebih baik dengan memberikan informasi penting menggunakan mekanisme perhatian diri dari multi-fitur. Semua proses dijalankan dalam pendekatan end-to-end.

3. Usulan Metode

Bagian ini merinci teknik inti dari model yang kami usulkan untuk CSLR. Oleh karena itu, kami memulai bagian ini dengan menjelaskan ikhtisar model yang kami usulkan. Selain itu, kami memberikan detail lebih lanjut tentang setiap komponen utama, termasuk modul spasial, modul temporal, dan modul pembelajaran urutan. Selain itu, kami juga menjelaskan modul perhatian yang kami usulkan untuk membantu model belajar lebih baik. Terakhir, kami dapat mengintegrasikan kerangka kerja untuk pelatihan dan inferensi ke dalam model yang kami usulkan.

3.1. Tinjauan Kerangka Kerja

Diberikan input video, model yang kami usulkan bertujuan untuk memprediksi tanda yang sesuai menjadi kalimat gloss yang benar. Modul pertama menghasilkan beberapa fitur spasial, seperti fitur full-frame dan keypoint untuk setiap T frame video. Kemudian, modul temporal memungkinkan kita untuk mengekstraksi korelasi temporal dari fitur spasial antara bingkai untuk kedua aliran. Sebagai langkah terakhir, jaringan spasial dan temporal telah dikaitkan dengan memori jangka panjang-pendek (Bi-LSTM) dua arah dan CTC untuk pembelajaran dan inferensi urutan. Selanjutnya, kami menjelaskan komponen utama kami secara lebih rinci dan berurutan. Gambaran umum arsitektur yang kami usulkan ditunjukkan pada Gambar 1.

Figure 1


Gambar 1. Arsitektur keseluruhan dari metode yang diusulkan terdiri dari tiga komponen: modul spasial, modul temporal, dan modul pembelajaran urutan. Modul spasial pertama-tama mengambil urutan gambar untuk mengekstrak fitur berdasarkan bingkai dan kemudian menerapkan modul temporal untuk mengekstrak fitur temporal. Kemudian, fitur temporal dikirim ke modul sequence learning untuk melakukan prediksi kata dan menyusunnya menjadi sebuah kalimat

3.2. Modul Spasial

Modul spasial mengeksploitasi fitur full-frame dan fitur keypoint, seperti yang ditunjukkan pada Gambar 2. Modul ini menggunakan arsitektur jaringan 2D-CNN sebagai tulang punggung, dan ResNet50 dipilih untuk menangkap multi-fitur. ResNet50 lebih efektif untuk digunakan dibandingkan dengan arsitektur ResNet terbaru dalam hal waktu dengan hasil yang sebanding [36,37]. RGB menggunakan ResNet50 secara langsung, sedangkan keypoint diperoleh HRNet [38] dari frame video dan diekstraksi menggunakan ResNet50 untuk mendapatkan fitur keypoint.

Figure 2


Gambar 2. Arsitektur modul spasial menggunakan multi-stream input. Stream RGB sebagai fitur full-frame dan aliran keypoints sebagai fitur keypoint.

3.2.1. Fitur Bingkai Penuh

Kami menerapkan langkah-langkah preprocessing kami ke data RGB dan kemudian memasukkan data kami ke dalam model. Kami kemudian menempatkannya sebagai input full-frame ke dalam arsitektur kami. Gambar 3 menunjukkan ilustrasi gambar RGB asli di sisi kiri dan gambar yang di-crop di sisi kanan. Gambar yang dipotong digunakan sebagai masukan oleh model. Ini mengilustrasikan langkah prapemrosesan yang mengurangi bagian gambar yang kurang penting dan lebih fokus pada penanda tangan. Pemotongan ini menggunakan metode pemotongan acak dari [12] untuk menambah dataset. Fitur fullframe diekstraksi dari gambar yang dipotong untuk setiap frame dalam urutan menggunakan ResNet50.

Figure 3


Gambar 3. Fitur full-frame menggunakan gambar RGB, (gambar kiri) adalah gambar asli, dan (gambar kanan) adalah gambar yang di-crop untuk menyesuaikan dengan model yang diusulkan

3.2.2. Fitur Titik Kunci

Kami mengekstraksi fitur titik kunci dalam modul spasial dari data RGB untuk setiap bingkai dalam input video. Kualitas fitur keypoint memiliki peran penting dalam model yang kami usulkan, jadi kami perlu menggunakan pendekatan yang kuat, seperti HRNet [38]. Kami menggunakan HRNet terlatih [38] untuk memperkirakan semua dari 133 poin kunci tubuh, dan kami menggunakan 27 dari 133 poin kunci dari hasilnya. Seperti yang ditunjukkan pada Gambar 4, sisi kiri adalah titik kunci tubuh bagian atas yang asli, dan sisi kanan adalah 27 titik kunci tubuh bagian atas yang dipilih. 27 titik kunci ini termasuk pergelangan tangan, siku, bahu, leher, tangan, dan jari.

Figure 4


Gambar 4. Fitur keypoint dari dataset PHOENIX-RWTH [33,39], ekstraksi (gambar kiri) dari citra RGB, dan (gambar kanan) adalah keypoint terpilih yang digunakan oleh model yang diusulkan.

3.3. Modul Temporal

Modul temporal bertujuan untuk mempelajari informasi spatiotemporal dari modul spasial. Modul temporal dibuat dengan Stacking Temporal Pooling untuk setiap aliran. Seperti yang ditunjukkan pada Gambar 5, modul pengumpulan Temporal terdiri dari lapisan konvolusi temporal dan lapisan penyatuan untuk mengekstraksi fitur dari input berurutan.

Figure 5.


Gambar 5. Arsitektur modul temporal terdiri dari tumpukan 1D-CNN dan lapisan penyatuan yang disematkan dengan modul perhatian. Bekerja secara paralel untuk kedua aliran fitur yang digabungkan di ujung lapisan yang ditumpuk, dan menghasilkan satu fitur temporal dengan panjang urutan empat kali lebih kecil.

Inputnya adalah daftar multi-fitur spasial dari tahap sebelumnya. Fitur temporal diperoleh dengan menggunakan lapisan konvolusi temporal yang merupakan lapisan konvolusional 1D tunggal dengan panjang input dan output yang sama, diikuti oleh satu lapisan penyatuan yang memperkecil ukuran menjadi setengahnya. Menggunakan dua layer pooling temporal yang ditumpuk ini adalah konfigurasi terbaik, menurut karya sebelumnya [12]. Setelah setiap pengumpulan waktu, kami menyematkan modul perhatian yang akan dijelaskan secara rinci di Bagian 3.4. Pada akhirnya, kami menggabungkan output dari kumpulan temporal dari kedua aliran.

3.4. Modul Perhatian

Video memiliki banyak bingkai di mana beberapa bagian gambar terkadang buram. Dataset RTWH-PHOENIX [33,39] memiliki lebih banyak frame cacat daripada dataset CSL [8,40,41]. Ini terjadi ketika gerakan terlalu cepat, membuat gambar buram dan menghasilkan lokasi titik kunci yang salah. Frame ini dianggap cacat dan berpotensi menyebabkan salah interpretasi fitur RGB dan keypoint. Gambar 6 menunjukkan ilustrasi frame yang rusak pada dataset RTWH-PHOENIX [33]. Untuk mengatasi masalah ini, kami menambahkan lapisan perhatian.

Figure 6


Gambar 6. Ilustrasi frame cacat pada dataset RWTH-PHOENIX [33,39]. Beberapa titik kunci di area tangan berada di posisi yang salah akibat gambar buram.

Menggunakan algoritma CTC, penyelarasan jalur beserta pelabelannya dilakukan dengan menggunakan label kosong dan menghapus label berulang. CTC lebih suka memprediksi label kosong daripada batas gloss ketika tidak dapat membedakan batas gloss, tetapi tidak ada hasil yang meyakinkan. Ini mengarahkan jaringan untuk menggunakan CTC untuk menghasilkan lonjakan hasil saat menganalisis, mempelajari, dan memprediksi [42,43]. Umumnya, CTC loss mencari keyframe, dan hasil terakhir adalah prediksi keyframe tertentu yang memiliki probabilitas tinggi menjadi label kosong atau label kosong. Jika kilap memprediksi label yang sama atau label kosong secara berurutan, hasilnya adalah output yang sama. Namun, jika ada label penyisipan di antara label yang sama, meskipun hanya satu kesalahan, itu akan menghasilkan kerugian yang jauh lebih besar. Di sini penambahan lapisan perhatian membantu memilih urutan waktu yang penting sebelum digunakan untuk pembelajaran berurutan.

Modul perhatian menggunakan mekanisme perhatian diri multi-kepala [20]. Modul multi-kepala digunakan untuk menjalankan beberapa mekanisme perhatian paralel secara bersamaan. Perhatian multi-head berjalan secara independen untuk fokus pada dependensi jangka pendek atau dependensi jangka panjang di head terpisah. Setiap keluaran kemudian digabungkan secara linier dan diubah menjadi bentuk yang diinginkan.

Bersamaan dengan itu, mekanisme perhatian diri multi-kepala menangani informasi dari beberapa subruang representasi, bergantung pada riwayat pengamatan. Untuk penyederhanaan, kami menyatakan urutan masukan sebagai X. Secara matematis, untuk model perhatian kepala tunggal, diberi masukan X t − T ditambah 1:t=[X t − T ditambah 1, · · ·, X t ] ∈ RT × N × P, diperoleh tiga subruang, yaitu subruang kueri Q ∈ RN ×dq, subruang kunci K ∈ RN × dk, dan nilai subruang V ∈ RN × dv. Proses pembelajaran subruang laten dapat dirumuskan sebagai [20]:

Q=XWQ, K=XWK , V=XWV ,

Kemudian, perhatian produk titik yang diskalakan digunakan untuk menghitung keluaran perhatian sebagai [20]:

Perhatian(Q, K, V)=jadi f tmaxQKT/ p dkV,

Selanjutnya, jika kita memiliki beberapa kepala yang secara bersamaan mengikuti beberapa representasi input, kita dapat memperoleh hasil yang lebih relevan pada saat yang bersamaan. Langkah terakhir adalah menggabungkan semua kepala dan memproyeksikannya lagi untuk menghitung skor akhir [20]:

MultiHead (Q% 2cK% 2cV) % 7b% 7b0% 7d% 7d Concat (head1% 2c ... , kepala )WO,

head=Perhatian(Qi,Ki,Vi),

di mana Qi=XWQ i , Ki=XWVi , dan WO ∈ R hd × dmodel. Terakhir, dapat memilih bagian yang penting dari urutan fitur karena tidak semua informasi dalam urutan itu penting.

Seperti yang ditunjukkan pada Gambar 7, kami menggunakan modul perhatian dalam beberapa konfigurasi. Modul atensi pertama ditempatkan pada bagian akhir modul spasial, sedangkan modul atensi kedua dan ketiga ditempatkan pada modul temporal. Modul perhatian kedua yang disebut modul temporal awal, ditempatkan setelah blok pertama pengumpulan temporal sebagai input, sedangkan modul perhatian temporal ketiga, yang disebut modul perhatian temporal akhir, ditempatkan setelah blok kedua pengumpulan temporal.

Figure 7

Gambar 7. Modul perhatian tertanam dalam modul spasial dan temporal dalam konfigurasi yang berbeda.

Anda Mungkin Juga Menyukai