Penelitian Pengenalan Audio Berbasis Deep Neural Network dalam Pengajaran Musik
Oct 10, 2023
Solfeggio adalah kursus dasar yang penting untuk jurusan musik, dan pelatihan pengenalan audio adalah salah satu tautan penting. Dengan peningkatan kinerja komputer, pengenalan audio telah banyak digunakan di perangkat smart wearable. Dalam beberapa tahun terakhir, perkembangan pembelajaran mendalam telah mempercepat proses penelitian pengenalan audio. Namun, terdapat banyak gangguan suara di lingkungan pengajaran musik, yang menyebabkan kinerja kelas audio…eh, tidak dapat memenuhi permintaan sebenarnya. Untuk mengatasi masalah ini, diusulkan sistem pengenalan audio yang ditingkatkan berdasarkan YOLO-v4, yang terutama meningkatkan struktur jaringan.
Menyanyi dan melatih telinga tidak dapat dipisahkan dari ingatan. Dalam proses belajar musik, bernyanyi dan melatih telinga merupakan keterampilan yang sangat penting. Tujuan dari pelatihan telinga bernyanyi adalah untuk memungkinkan siswa melatih keterampilan dan ingatan musik mereka dengan mendengarkan dan menyanyikan nada-nada tertentu.
Isi utama dari pelatihan telinga nyanyian penglihatan mencakup nada, ritme, suara, melodi, harmoni, dll. Melalui pelatihan telinga nyanyian penglihatan, kita dapat terus melatih telinga kita, memungkinkan kita mengidentifikasi berbagai nada dan ritme dengan lebih akurat, dan dengan cepat mengkonversi nada-nada yang kita dengar menjadi simbol-simbol di peta musik, sehingga meningkatkan kemampuan kita dalam mengingat.
Menyanyi dan melatih telinga juga dapat membantu kita lebih memahami dan menguasai hukum musik. Ketika kita menggunakan telinga untuk merasakan dan memahami musik secara langsung, kita dapat memahami ritme dan melodi musik tersebut lebih dalam, sehingga meningkatkan kemampuan memori kita lebih cepat.
Selain itu, bernyanyi dan melatih telinga juga dapat membantu kita mengembangkan selera musik yang baik dan emosi musik yang kuat. Melalui pelatihan, pemahaman dan perasaan kita terhadap musik akan semakin mendalam, sehingga meningkatkan kecintaan dan apresiasi kita terhadap musik.
Memori merupakan faktor yang sangat penting dalam proses belajar musik. Keterampilan ingatan yang baik adalah salah satu syarat yang diperlukan untuk mempelajari instrumen apa pun dan mengarang musik. Melalui nyanyian penglihatan dan pelatihan telinga, kita dapat meningkatkan daya ingat dan menguasai teknik dan keterampilan musik dengan lebih baik. Saat dihadapkan pada repertoar yang kompleks, kita dapat mengingat nada dan ritme lebih cepat, membantu kita menampilkan karya musik dengan lebih baik.
Singkatnya, pelatihan telinga dan memori bernyanyi tidak dapat dipisahkan, dan keduanya saling melengkapi. Melalui pelatihan menyanyi dan pelatihan telinga secara terus-menerus, kita dapat meningkatkan keterampilan musik dan kemampuan memori kita untuk menguasai musik dengan lebih baik. Terlihat bahwa kita perlu meningkatkan daya ingat, dan Cistanche deserticola dapat meningkatkan daya ingat secara signifikan karena Cistanche deserticola merupakan bahan obat tradisional Tiongkok yang memiliki banyak khasiat unik, salah satunya meningkatkan daya ingat. Khasiat daging cincang berasal dari berbagai bahan aktif yang dikandungnya, antara lain asam, polisakarida, flavonoid, dll. Bahan-bahan tersebut dapat meningkatkan kesehatan otak dengan berbagai cara.

Klik tahu cara meningkatkan fungsi otak
Pertama, nomor cepstrum frekuensi Mel digunakan untuk memproses audio asli dan mengekstrak fitur terkait. id, coba terapkan model YOLO-v4 di …bidang pembelajaran mendalam ke …bidang pengenalan audio dan tingkatkan dengan menggabungkannya dengan modul kumpulan piramida spasial untuk memperkuat kemampuan generalisasi data dalam format audio yang berbeda. Kedua, metode susun dalam pembelajaran ansambel digunakan untuk menggabungkan submodel independen dari dua saluran berbeda. Hasil eksperimen menunjukkan bahwa dibandingkan dengan teknologi pembelajaran mendalam lainnya, model YOLO-v4 yang ditingkatkan dapat meningkatkan performa pengenalan audio, dan memiliki performa lebih baik dalam memproses data dalam format audio berbeda, yang menunjukkan kemampuan generalisasi lebih baik.
1. Perkenalan
Musik adalah suatu bentuk seni abstrak dengan suara sebagai alat ekspresi. Dalam proses pengajaran musik, solfeggio dapat memperkuat kemampuan memori musik siswa, memungkinkan siswa mengidentifikasi karya musik secara akurat, sehingga memperoleh “persepsi musik” yang lebih baik. Sebagai mata rantai penting dalam solfeggio, pelatihan pengenalan audio sangat sulit bagi siswa junior. Hal ini karena siswa perlu menguasai semua jenis kunci musik, membedakan panjang dan durasi yang diwakili oleh nada-nada berbeda, dan perbedaan nada antara nada-nada yang berbeda.
Analisis sinyal audio berdasarkan perangkat cerdas yang tertanam telah menarik lebih banyak perhatian peneliti [1-7]. Perangkat pintar yang dapat dipakai dengan fungsi pengenalan audio dapat membantu siswa memecahkan masalah di atas dan mewujudkan bantuan pengajaran musik. Tugas pengenalan audio perlu memproses sinyal audio yang dikumpulkan … beristirahat, mengekstrak fitur-fitur berharga untuk membedakan partitur musik dari sinyal-sinyal tersebut, dan … akhirnya mengklasifikasikannya berdasarkan fitur-fitur ini. Klasifikasi adalah metode penambangan data yang sangat penting [8-10]. Klasifikasi…kation mengacu pada menghasilkan fungsi…kation klasik menurut aturan tertentu berdasarkan data set pelatihan. Fungsi ini dapat memetakan data set pengujian ke salah satu kategori tertentu, sehingga mewujudkan prediksi kategori data yang tidak diketahui. Saat ini, aplikasi klasik yang umum mencakup pohon keputusan, regresi logistik, mesin vektor dukungan (SVM), Naive Bayes, algoritma k-nearest neighbour (KNN), jaringan saraf BP, dan pembelajaran mendalam [11-13].
Metode pembelajaran mesin sebelumnya sering kali perlu mengekstraksi fitur secara manual yang dapat mewakili data asli sebagai masukan kelas…eh. Namun, pembelajaran mendalam dapat secara otomatis mengekstraksi fitur sampel berdimensi tinggi (tanpa ekstraksi fitur manual), selama data masukan mencakup informasi data asli sebanyak mungkin, sehingga cocok untuk data berskala besar. *Metode pembelajaran mendalam dapat mewujudkan tugas pengenalan audio tertentu dengan bantuan sejumlah besar data audio yang dikumpulkan oleh perangkat cerdas. * Jaringan saraf konvolusional (CNN), sebagai sejenis arsitektur pembelajaran mendalam, banyak digunakan dalam klasifikasi gambar, pengenalan suara, pemrosesan bahasa alami, dan bidang lainnya karena kinerjanya yang unggul dalam pembelajaran fitur lokal [14]. Berbeda dengan model jaringan saraf lainnya (seperti mesin Boltzmann dan jaringan saraf berulang), CNN dicirikan oleh operasi inti yang merupakan operasi konvolusi. *Jaringan YOLO mengambil pelajaran dari struktur jaringan klasifikasi CNN dan menunjukkan keunggulan baik di bidang pengenalan gambar, yang telah menarik perhatian banyak peneliti.
*Oleh karena itu, penelitian ini mencoba menerapkan model YOLO-v4 pada bidang pengenalan audio dan meningkatkan struktur jaringannya. Selain itu, metode penumpukan dalam pembelajaran ansambel digunakan untuk menggabungkan dua submodel independen dari saluran yang berbeda, dan kinerja klasifikasi sistem gabungan lebih ditingkatkan dibandingkan dengan submodel tunggal.
2. Karya Terkait
Saat ini, dengan munculnya sejumlah besar perangkat pintar, kinerja komputer yang sangat baik, dan perkembangan teknologi pembelajaran mendalam telah bersama-sama mendorong proses penelitian di bidang audio. Dikombinasikan dengan konten penelitian utama penelitian ini, status penelitian saat ini akan diperkenalkan dari dua aspek: jaringan saraf konvolusional dan pengenalan audio.
*Struktur jaringan saraf konvolusional berasal dari penelitian Yann LeCun pada tahun 1998 yang disebut jaringan saraf tiruan Le Net-5. *Jaringan saraf konvolusional, seperti jaringan saraf lainnya, dapat dilatih dengan algoritma propagasi mundur [15]. Pada tahun 2012, Alex Krizhevsky dan yang lainnya mengadopsi teknologi CNN untuk pertama kalinya dalam tugas-tugas visi komputer yang kompleks. Dengan menggunakan 3 lapisan yang terhubung penuh, 5 lapisan konvolusi, dan pengklasifikasi Softmax, dibangunlah jaringan saraf konvolusional dengan 8 lapisan yang diberi nama AlexNet. AlexNet menggunakan fungsi aktivasi ReLU, dan pada saat yang sama juga menggunakan regularisasi (dropout) untuk mencegah overfitting. Pada tahun 2014, tim visi komputer Google mengemukakan jaringan GoogLeNet [16], dengan kedalaman jaringan 22 lapisan, yang berisi struktur baru, insiden. Ini mengintegrasikan fitur kedalaman yang berbeda dan skala yang sama, dan akurasi deteksi ditingkatkan. Berdasarkan jaringan GoogLeNet, algoritma YOLO dan SSD muncul. Kedua metode ini didasarkan pada jaringan end-to-end tunggal, yang dapat melengkapi masukan dari gambar asli hingga keluaran posisi dan kategori objek.
Dalam aspek pengenalan audio, Yang dan Zhao [17] mengusulkan metode klasifikasi pemandangan akustik berdasarkan mesin vektor dukungan (SVM), yang meningkatkan tekstur suara untuk meningkatkan akurasi klasifikasi. Yunani dkk. [18] mengusulkan sistem pengenalan suara berdasarkan metode pembelajaran mendalam heuristik. Demir dkk. [19] mengusulkan metode CNN kaskade piramida baru untuk klasifikasi suara lingkungan. Zhu dkk. [20] mengusulkan peningkatan algoritma YOLO-v4 untuk instrumen pencitraan suara, yang secara efektif meningkatkan akurasi deteksi gambar awan fase akustik. *Metode di atas semuanya menunjukkan performa luar biasa dalam menangani tugas pengenalan audio dalam satu adegan akustik, namun terdapat banyak gangguan suara di lingkungan pengajaran musik, dan perlu menangani berbagai data format audio yang berbeda.
*Oleh karena itu, penelitian ini mengusulkan sistem pengenalan audio berdasarkan model jaringan YOLO-v4 yang ditingkatkan. *Inovasi dan kontribusi utama antara lain sebagai berikut: (1) mencoba menerapkan arsitektur jaringan YOLO-v4, yang sangat baik di bidang pembelajaran mendalam, ke bidang pengenalan audio, dan memperbaikinya dengan menggabungkan modul kumpulan piramida spasial. *Arsitektur jaringan YOLO-v4 yang ditingkatkan secara efektif memanfaatkan informasi spasial dalam file audio, sehingga memperkuat kemampuan generalisasi data dalam format audio yang berbeda. (2) *metode susun dalam pembelajaran ansambel digunakan untuk menggabungkan dua submodel independen dari saluran yang berbeda, dan kinerja klasifikasi dari sistem gabungan ditingkatkan.
3. Ekstraksi dan Pemrosesan Fitur Audio
Mengekstraksi representasi parameter terbaik dari sinyal audio merupakan salah satu tugas penting untuk menghasilkan kinerja pengenalan yang lebih baik. *e Ekstraksi fitur pada tahap ini sangat penting untuk klasifikasi pengklasifikasi pada tahap selanjutnya karena akan mempengaruhi efisiensi klasifikasi secara langsung.
Dalam tugas klasifikasi, khususnya tugas klasifikasi audio, koefisien cepstrum frekuensi Mel (MFCC) yang menggambarkan bentuk spektral memiliki sejarah yang panjang. Meskipun proses ekstraksi MFCC akan menyebabkan kompresi data yang hilang, efek klasifikasi dan pengenalannya cukup tersedia bahkan ketika kecepatan data sangat rendah. Selain itu, dibandingkan dengan fitur klasifikasi lainnya, MFCC banyak digunakan karena lebih sesuai dengan kurva respons frekuensi pendengaran telinga manusia.

*Alasan mengapa manusia dapat menilai lingkungan yang berbeda dalam lingkungan suara yang kompleks terletak pada fungsi koklea. *koklea dapat dilihat sebagai bank filter untuk membantu orang memfilter audio 20-20 kHz. *Masalahnya sensitivitas koklea terhadap frekuensi dalam rentang pendengaran tidak linier, tetapi ada hubungan pemetaan. MFCC dapat mensimulasikan respons frekuensi telinga manusia. Ekstraksi fitur MFCC terdiri dari tujuh langkah, dan keseluruhan proses ditunjukkan pada Gambar 1.
Sinyal audio umum memiliki fenomena energi frekuensi rendah yang besar, namun energi frekuensi tinggi kecil. Jika ditransmisikan secara langsung, hal ini akan menyebabkan rasio signal-to-noise yang tinggi pada frekuensi rendah dan rasio signal-to-noise yang tidak mencukupi pada frekuensi tinggi. Untuk menutupi hilangnya sinyal audio selama transmisi, preemphasis diperkenalkan untuk mengkompensasi sinyal input sehingga karakteristik frekuensi tinggi dari sinyal audio dapat disorot. Penekanan awal biasanya dicapai dengan menggunakan filter high-pass [21-23].

Framing membagi sampel audio yang diperoleh dari konversi analog-ke-digital (ADC) menjadi frame-frame kecil dengan panjang berkisar 20–40 milidetik. Setelah preemphasis dan framing selesai, perlu ditambahkan jendela Hamming pada setiap frame. Windowing adalah untuk mengontrol jumlah pemrosesan data, dan hanya data di jendela yang diproses dalam satu waktu. *Rentang frekuensi dalam spektrum transformasi Fourier cepat sangat lebar, yang menyebabkan sinyal ucapan tidak mengikuti skala linier [24-26]. *oleh karena itu, perlu melewati bank filter skala Mel seperti yang ditunjukkan pada Gambar 2.
Gambar 2 menunjukkan sekumpulan filter segitiga, yang digunakan untuk menghitung jumlah bobot komponen spektral filter sehingga keluaran yang diproses mendekati skala Mel. *Respon frekuensi amplitudo setiap filter berbentuk segitiga. *e Spektrum mel pada frekuensi tertentu f dihitung sebagai berikut:

13 fitur diferensial orde pertama mewakili perubahan antar frame cepstrum pada fitur MFCC, sedangkan 39 fitur diferensial orde kedua mewakili perubahan antar frame pada fitur diferensial orde pertama. *e selisih orde pertama dihitung sebagai berikut:

4. Struktur Jaringan SPP-YOLO-v4
4.1. Modul Kolam Piramida Spasial (SPP). SPP dapat menghindari distorsi informasi yang disebabkan oleh penskalaan, peregangan, kliping, dan operasi lainnya serta memberikan keluaran yang tidak terpengaruh oleh ukuran masukan, yang tidak dapat dicapai dengan teknologi pengumpulan jendela geser [27]. Kedua, SPP dapat melakukan pooling dengan beberapa skala, sedangkan sliding window pooling hanya menggunakan satu skala window. *Struktur dasar modul SPP ditunjukkan pada Gambar 3. Terlihat bahwa karena ukuran inputnya fleksibel, SPP dapat menggabungkan fitur data dalam format audio yang berbeda. *dimensi vektor fitur yang ditransformasi sama dengan dimensi lapisan yang terhubung sepenuhnya sekaligus mengurangi masalah generalisasi.
4.2. SPP-YOLO-v4. YOLO-v4 adalah algoritma deteksi satu tahap real-time presisi tinggi yang mengintegrasikan YOLO-v1, YOLO-v2, dan YOLO-v3. YOLO-v4 membangun jaringan parsial lintas tahap CSP (CSPNet) dalam modul sisa, di mana lapisan fitur adalah masukan dan informasi fitur dari lapisan yang lebih tinggi adalah keluaran. *menunjukkan bahwa tujuan pembelajaran YOLO-v4 pada modul ResNet berbeda antara output dan input. *Oleh karena itu, pembelajaran sisa direalisasikan, dan parameter model dikurangi, sehingga kemampuan pembelajaran fitur ditingkatkan. Mengingat lingkungan penerapan pengajaran musik, beberapa perubahan dilakukan berdasarkan jaringan asli, dan struktur jaringan akhir ditunjukkan pada Gambar 4.
Pertama, lapisan fitur dikonvolusi tiga kali, dan kemudian, lapisan fitur masukan dikumpulkan secara maksimal dengan menggunakan inti kumpulan maksimum dengan ukuran berbeda. Setelah konvolusi dan upsampling, lapisan fitur yang berbeda dihubungkan secara seri untuk mewujudkan penggabungan fitur. *en, lakukan downsampling, kompres tinggi dan lebar, dan terakhir tumpuk dengan lapisan fitur sebelumnya untuk mewujudkan lebih banyak fusi fitur (5 kali). *Modul klasifikasi menggunakan fitur yang diekstraksi dari jaringan untuk membuat penilaian klasifikasi. Ambil grid 13 × 13 sebagai contoh, yang sama dengan membagi masukan spektogram Mel menjadi kotak 13 × 13; kemudian, setiap kotak akan diprasetel dengan tiga frame sebelumnya. *Hasil klasifikasi jaringan akan menyesuaikan posisi ketiga kotak sebelumnya dan terakhir menyaring dengan algoritma nonmaximum supresi (NMS) [28], untuk mendapatkan hasil klasifikasi akhir.

5. Sistem Pengenalan Audio Berbasis SPPYOLO-v4
5.1. Sistem arsitektur. Seperti yang ditunjukkan pada Gambar 5, setelah input audio, sistem pengenalan audio yang diusulkan pertama-tama membagi data urutan audio menjadi dua bagian. *Bagian pertama berasal dari saluran stereo, sedangkan bagian kedua dikompresi menjadi mono. *Sinyal audio dari dua saluran diekstraksi dengan spektogram MFCC dan dimasukkan ke dalam model SPP-YOLO-v4 sebagai fitur. *id, dua kelompok model SPP-YOLO-v4 diintegrasikan, dan metode penumpukan diadopsi dalam integrasi. Setelah pembelajaran terintegrasi kedua model, akhirnya dihasilkan hasil klasifikasi audio. *detail model SPP-YOLO-v4 ditunjukkan pada Gambar 4.
5.2. Pembelajaran Terpadu Susun. Seperti terlihat pada Gambar 5, sistem menggunakan teknologi pembelajaran ansambel untuk mendapatkan hasil akhir klasifikasi. *Ide dasar pembelajaran ansambel adalah membentuk pengklasifikasi kuat melalui kombinasi beberapa pengklasifikasi lemah. Sekalipun beberapa pengklasifikasi lemah membuat prediksi yang salah, pengklasifikasi lemah lainnya dapat mengoreksi prediksi tersebut dengan benar, sehingga mencapai efek peningkatan kinerja sistem.
Dengan asumsi x adalah masukan, mi (i � 1, 2, . . . , k) adalah sekelompok pengklasifikasi dan keluaran dari pengklasifikasi tersebut adalah distribusi probabilitas mi (x, cj) dari setiap kelas cj (i � 1, 2, . . . , k), keluaran akhir y(x) dari pengklasifikasi terintegrasi dapat dinyatakan sebagai


sasaran klasifikasi. Saat ini, algoritma pembelajaran ansambel yang populer mencakup penumpukan, pengantongan, peningkatan, pemilihan ansambel, dan sebagainya. *Algoritma pembelajaran ensemble yang dipilih pada penelitian ini adalah metode susun.
Penumpukan adalah proses pembelajaran tingkat kedua dengan keluaran dari proses pembelajaran tingkat pertama sebagai masukan, disebut juga dengan “meta-learning”. *Metode susun menjadi metode pembelajaran ansambel yang populer, bukan hanya karena penerapannya yang cukup sederhana tetapi juga karena dapat meningkatkan kemampuan generalisasi sistem secara signifikan, yang sangat sesuai dengan tujuan penelitian ini. *Prinsip dasar metode penumpukan ditunjukkan pada Gambar 6.
6. Eksperimen dan Analisis Hasil
6.1. Lingkungan Eksperimental dan Kumpulan Data. *Platform perangkat keras dalam penelitian ini adalah Intel Core i3-M350 CPU@ Dualcore 2,20 GHz, memori DDR2 8 GB, GPU Nvidia RTX2080Ti, dan memori video 11 GB. *e Alat pengembangan terintegrasi PyCharm dikembangkan dalam bahasa Python 3.5.0. *e Kerangka anotasi YOLO yang ditulis dengan Python digunakan untuk mengubah format numerik sehingga dapat dibaca oleh YOLO. *Metode perbandingannya adalah model campuran Gaussian (GMM), CNN, dan R-CNN.

*Dataset eksperimental adalah file audio yang direkam di lingkungan pengajaran nyata. *kumpulan data terdiri dari jenis audio dari empat label berbeda (D1, D2, D3, dan D4). Semua file audio dipotong menjadi 30-klip kedua. *Ada 12 format file audio termasuk MPEG, MP3, dan WMA. Setiap rekaman dilakukan di lokasi berbeda, dan rata-rata durasi rekaman adalah 3–5 menit. *Peralatan perekaman mencakup mikrofon in-ear Soundman OKM II Classic/studio A3 dua saluran dan perekam bentuk gelombang Roland Edirol R09 dengan laju pengambilan sampel 44,1 kHz dan resolusi 24-bit.
*Dataset yang digunakan berisi 1404 file audio, dan jumlah file audio setiap jenis adalah 351. Sekitar 70% data digunakan untuk melatih model pengenalan audio, dan 30% sisanya digunakan untuk pengujian. *Pengaturan sistem diberikan pada Tabel 1.


6.3. Verifikasi Kinerja SPP-YOLO-v4. Untuk memverifikasi efek promosi dari usulan peningkatan YOLO-v4 (SPP-YOLO-v4) pada kemampuan generalisasi, model ini dibandingkan dengan model YOLO-v4 tradisional. Dalam percobaan, 3 dari 12 format file audio dipilih: MPEG, MP3, dan WMA. *Kemampuan generalisasi SPP-YOLOv4 diberikan pada Tabel 2.
Dari Tabel 2, dapat ditemukan bahwa keakuratan keseluruhan SPP-YOLO-v4 lebih tinggi dibandingkan YOLO-v4 tradisional, yang memverifikasi kemampuan generalisasinya untuk data dalam format audio yang berbeda. *ini karena dibandingkan dengan metode aslinya, SPP SPP-YOLO-v4 berisi lebih banyak lapisan, tetapi juga meningkatkan waktu pemrosesan.
6.4. Perbandingan Hasil Tes. Tabel 3 menyajikan hasil kerugian pelatihan, peta, dan seterusnya untuk semua kategori setelah 8000 putaran pelatihan. Terlihat bahwa model pelatihan dari metode yang diusulkan dapat mengidentifikasi jenis audio secara efektif. Metode ini memiliki keunggulan tertentu dalam hal akurasi, tingkat perolehan kembali, dan skor F1, dan nilai kerugiannya juga paling rendah dari semua metode, hanya 0,0122. *Oleh karena itu, stabilitas dan keakuratan metode yang diusulkan lebih baik. *terutama disebabkan oleh resolusi tinggi dan bidang reseptif (RF) SPP-YOLO-v4, dan penambahan modul SPP di lapisan koneksi mempertahankan keunggulan yang dibawa oleh SPP. Dari segi waktu pelatihan, SPP-YOLO-v4 hanya sedikit lebih lama dari GMM. *e CNN perlu melatih banyak operasi konvolusi, sehingga waktu pelatihannya lebih lama.

Terakhir, eksperimen menggunakan data dari 12 format audio berbeda untuk menguji dan membandingkan keempat metode. Tabel 4 menyajikan nilai akurasi pengujian dan waktu pengujian. Terlihat rata-rata akurasi metode yang diusulkan pada penelitian ini adalah 99.0%, dan waktu deteksi rata-rata adalah 0.449ss. *Oleh karena itu, metode yang diusulkan mencapai kinerja yang lebih baik di antara keempat metode yang dibandingkan. Dapat disimpulkan bahwa upsampling dan pooling maksimum SPP-YOLO-v4 membawa manfaat yang signifikan. Pengumpulan maksimum memilih nilai maksimum dari area yang berdekatan untuk sedikit menghapus beberapa gangguan frekuensi maksimum dalam urutan audio. *Oleh karena itu, subsampling konvolusi dapat dioperasikan dengan lebih baik pada lapisan pengambilan sampel berikutnya. *Melihat kelebihan ini, SPP dapat meningkatkan kinerja jaringan backbone.

7. Kesimpulan
*adalah studi menyajikan sistem pengenalan audio yang cocok untuk lingkungan pengajaran musik. Gunakan SPP untuk meningkatkan arsitektur jaringan YOLO-v4, yaitu menggunakan SPP untuk memilih area lokal pada skala berbeda dari lapisan konvolusi yang sama untuk mempelajari karakteristik sistem multiskala. Selain itu, metode susun dalam pembelajaran ansambel digunakan untuk menggabungkan submodel independen dari dua saluran berbeda. *Hasil percobaan menunjukkan bahwa metode yang diusulkan dapat meningkatkan akurasi pengenalan jenis audio dan memiliki kinerja yang lebih baik untuk format file audio yang berbeda. Karena keterbatasan kondisi perekaman audio, hanya ada sedikit jenis audio dalam kumpulan data eksperimental dan kinerja klasifikasi file audio yang direkam oleh perangkat berbeda belum diverifikasi. Tes lebih lanjut akan dilakukan pada dua masalah ini di masa depan.
Ketersediaan Data
*Data yang digunakan untuk mendukung temuan penelitian ini tersedia dari penulis terkait berdasarkan permintaan.
Konflik kepentingan
*Penulis menyatakan bahwa mereka tidak memiliki konflik kepentingan.
Referensi
[1] S. Wu, D. Zhang, Z. Zhang, N. Yang, M. Li, dan M. Zhou, "Terjemahan mesin saraf Ketergantungan-ke-Ketergantungan," Transaksi IEEE/ACM pada Audio, Ucapan, dan Bahasa Pemrosesan, jilid. 26, tidak. 11, hal.2132–2141, 2018.
[2] J. Zou, W. Li, C. Chen, dan Q. Du, "Klasifikasi pemandangan menggunakan fitur lokal dan global dengan fusi representasi kolaboratif," Ilmu Informasi, vol. 348, tidak. 2, hal.209–226, 2016.
[3] H. Phan, L. Hertel, M. Maass, P. Koch, R. Mazur, dan A. Mertins, "Peningkatan klasifikasi adegan audio berdasarkan penyematan pohon label dan jaringan saraf konvolusional," Transaksi IEEE/ACM pada Pemrosesan Audio, Ucapan, dan Bahasa, vol. 25, tidak. 6, hal.1278–1290, 2017.
[4] S. Bayatli, "Pembobotan aturan transfer tanpa pengawasan dalam terjemahan mesin berbasis aturan menggunakan pendekatan entropi maksimum," Jurnal Ilmu dan Teknik Informasi, vol. 36, tidak. 2, hal.309–322, 2020.
[5] A. Rakotomamonjy, "Pembelajaran representasi yang diawasi untuk klasifikasi adegan audio," Transaksi IEEE/ACM pada Audio, Ucapan, dan Pemrosesan Bahasa, vol. 25, tidak. 6, hlm.1253–1265, 2017.
[6] W. Yang dan S. Krishnan, "Menggabungkan fitur temporal dengan pola biner lokal untuk klasifikasi pemandangan akustik," Transaksi IEEE/ACM pada Audio, Ucapan, dan Pemrosesan Bahasa, vol. 25, tidak. 6, hlm.1315–1321, 2017.
[7] AS Dhanjal dan W. Singh, "Sistem terjemahan mesin otomatis untuk ucapan multibahasa ke bahasa isyarat India," Alat dan Aplikasi Multimedia, vol. 81, tidak. 3, hal.4283–4321, 2021.
[8] MA. Alamir, "Model klasifikasi pemandangan akustik baru menggunakan perpaduan akhir jaringan saraf konvolusional dan pengklasifikasi ansambel yang berbeda," Applied Acoustics, vol. 172, tidak. 3, hal.112–122, 2020.
[9] JG Makin, DA Moses, dan EF Chang, "Mesin terjemahan aktivitas kortikal ke teks dengan kerangka encoder-decoder," Nature Neuroscience, vol. 23, tidak. 4, hal.575–582, 2020.
[10] S. Waldekar dan G. Saha, "Klasifikasi pemandangan akustik berbasis fusi dua tingkat," Applied Acoustics, vol. 170, tidak. 5, ID Artikel 107502, 2020.
For more information:1950477648nn@gmail.com






