Perakitan Transkriptome De Novo Berbasis RNA-Seq Dan Penemuan Gen Batang Berdaging Cistanche Deserticola-Ⅰ
Sep 03, 2024
Latar Belakang
Cistanche deserticola adalah tanaman parasit non-fotosintesis dengan nilai obat yang tinggi dan terutama tersebar di gurun Cina Barat Laut. Batangnya yang berdaging kering merupakan tonik yang pentingpengobatan tradisional Tiongkokdengan peran utama dalam meningkatkan fungsi seksual pria dan memperkuat kekebalan tubuh, namun hanya sedikit penelitian mekanistik yang telah dilakukan, sebagian karena kurangnya sumber daya genomik dan transkriptomik.

CISTANCHE TUBULOSA ALAMI OBAT TRADISIONAL CINA PHGS75% ECH 30% ACT 12%
Hasil
Dalam studi ini, kami melakukan pengurutan transkriptom mendalam pada batang berdaging C. deserticola, dan sekitar 8{14}} juta pembacaan dihasilkan menggunakan pengurutan ujung berpasangan Illumina pada platform HiSeq2000. Dengan menggunakan trinity assembler, kami memperoleh 95.787 urutan transkrip dengan panjang transkrip berkisar antara 200bp hingga 15.698bp, memiliki panjang rata-rata 950 basis dan panjang N50 1.519 basis. 63.957 transkrip diidentifikasi sebagai diekspresikan secara aktif dengan FPKM Lebih besar dari atau sama dengan 0,5, di mana 30.098 transkrip dianotasi dengan deskripsi gen atau istilah ontologi gen melalui analisis kesamaan urutan terhadap beberapa database publik (Uniprot, NR, dan Nt di NCBI, dan KEGG) . Selain itu, kami mengidentifikasi gen enzim kunci yang terlibat dalam biosintesis lignin dan feniletanoid glikosida (PhGs) yang diketahui sebagai bahan aktif utama. Empat gen fenilalanin amonia-lyase (PAL), enzim kunci pertama dalam biosintesis lignin dan PhG diidentifikasi berdasarkan perbandingan urutan dan analisis filogenetik. Dua jalur biosintesis PhG juga diusulkan untuk pertama kalinya.
Kesimpulan
Secara keseluruhan, kami menyelesaikan analisis global transkriptom batang berdaging C. deserticola menggunakan teknologi RNA-seq. Kumpulan gen enzim yang terkait dengan biosintesis lignin dan glikosida feniletanoid diidentifikasi dari transkrip yang dirakit dan dianotasi, dan keluarga gen PAL juga diprediksi. Data sekuens dari penelitian ini akan memberikan sumber daya berharga untuk melakukan penelitian biosintesis feniletanoid glikosida di masa depan dan studi genom fungsional pada tanaman obat penting ini.
Perkenalan
C. deserticola adalah genus tanaman gurun abadi di seluruh dunia dari keluarga Orobanchaceae dan merupakan spesies non-fotosintesis sepenuhnya dan biasanya tumbuh tanaman holoparasit bawah tanah. Ia diparasit pada akar psammophyte Haloxylon ammodendron (Chenopodiaceae), yang terutama mendiami gurun dan semi-gurun karena toleransinya yang tinggi terhadap kekeringan dan salinitas. C. deserticola menunjukkan ketahanan yang kuat terhadap kondisi lingkungan yang keras dan terutama tersebar di Tiongkok Barat Laut, terutama di Mongolia Dalam, Gansu, dan Xinjiang. Ini dianggap sebagai spesies liar yang terancam punah dalam beberapa tahun terakhir karena meningkatnya konsumsi oleh manusia. C. deserticola yang sering disebut ginseng gurun umumnya dikenal sebagai sapu gurun dan batang berdaging keringnya telah banyak digunakan sebagai tonik tradisional yang penting di Tiongkok dan Jepang selama bertahun-tahun. Ini awalnya dicatat dalam Shen Nong Ben Cao Jing (Kamus Bahasa Mandarin Materia Medica, 1977) sekitar 1800 tahun yang lalu dan dianggap sebagai salah satu sumber utamaRamuan obat Cina Cistanche.

CISTANCHE TUBULOSA ALAMI UNTUK MENINGKATKAN FUNGSI SEKSUAL PHGS75% ECH 30% ACT 12%
Ekstrak C. deserticola memiliki berbagai fungsi pengobatan, terutama untuk digunakan dalam meningkatkan fungsi seksual, menguatkan ginjal, melindungi hati, aktivitas obat, meningkatkan daya ingat, imunomodulator, aktivitas antioksidan, anti-inflamasi, aktivitas antivirus, dll. komponen bioaktif utama C. deserticola adalah glikosida Phenylethanoid (PheGs, PhGs). Sampai saat ini, lebih dari 20 glikosida feniletanoid telah diisolasi dari batang sukulen C.deserticola. Diantaranya,akteosida dan echinakosidaadalah dua komponen utama dengan aktivitas farmakologis yang signifikan dan didokumentasikan sebagai standar kualitas C. deserticola dalam farmakope Tiongkok (edisi 2005 dan 2010). Tiga komponen kimia PhGs adalah asam organik, sakarida, dan feniletanoid, namun rincian mengenai jalur biosintesis feniletanoid masih kurang dipahami di C.deserticola.
Meskipun C.deserticola memiliki kepentingan komersial dan pengobatan, data genomik dan transkriptomik spesies ini sangat terbatas. Tidak ada EST yang tersedia di database NCBI dan informasi genom lengkap untuk spesies ini masih belum tersedia kecuali urutan genom kloroplas. Data transkriptomik yang terbatas menghambat studi mekanisme biosintetik PhG. Teknologi RNA-seq dapat menghasilkan urutan bagian yang diekspresikan dari genom target dan mengidentifikasi gen [18] menggunakan platform teknologi NGS (seperti Applied Biosystems SOLiD, Illumina HiSeq, dan Roche 454). Ini menjadi semakin populer dalam perakitan transkriptome de novo, karena ini merupakan pendekatan yang hemat biaya dan kuat dengan resolusi tinggi dan rentang dinamis yang luas, terutama karena pendekatan ini memiliki keuntungan untuk mengeksplorasi transkrip dengan kelimpahan rendah. Karena berbagai kelebihannya, RNA-seq secara khusus menarik bagi organisme non-model dengan sumber daya genetik terbatas. Namun, belum ada penelitian mendetail tentang transkriptom C. deserticola dengan RNA-seq.
Dalam studi ini, kami mengurutkan transkriptom batang secara global untuk C. deserticola menggunakan platform Illumina Hiseq2000 dan mendapatkan data mentah 7,9G. Melalui perakitan dan anotasi, kami menambang gen yang terlibat dalam biosintesis PhG dan gen yang bertanggung jawab atas keseluruhan biosintesis lignin. Analisis RNA-seq kami menghasilkan transkriptom konsensus C. deserticola yang pertama dan memberikan wawasan baru ke dalam pemahaman komprehensif tentang nilai pengobatan C. deserticola. Selain itu, metode yang dijelaskan di sini dapat diterapkan secara luas pada transkriptom profil untuk memfasilitasi penemuan gen yang terlibat dalam jalur biosintesis komponen obat tertentu pada tanaman obat lain dengan sumber daya genom yang sangat terbatas.
Bahan dan Metode
Koleksi bahan tanaman
Batang sukulen segar untuk C. deserticola dalam tahap penggalian dikumpulkan dari basis tanaman di BayanHot City of Alxa League di Mongolia Dalam di barat laut Tiongkok. Izin pengumpulan diperoleh dari pemilik (Grup HongKui CongRong) dari pabrik. Spesimen voucher disimpan di Fasilitas Genomik Inti di Institut Genomics Beijing, Akademi Ilmu Pengetahuan Tiongkok. Setelah dibersihkan, jaringan batang sukulen dipotong kecil-kecil dan segera dibekukan dalam nitrogen cair, lalu disimpan pada suhu -80 derajat hingga diproses lebih lanjut.
Ekstraksi RNA, konstruksi perpustakaan cDNA, dan pengurutan Illumina
Total RNA diekstraksi dari batang sukulen menggunakan Reagen TRIzol (Invitrogen Inc., California, USA) sesuai dengan instruksi pabrik. Sampel yang dihasilkan diperlakukan dengan DNase I untuk menghilangkan DNA genom apa pun. RNA yang diekstraksi diukur menggunakan bioanalyzer Agilent 2100 (Agilent Technologies) dan diperiksa integritasnya menggunakan denaturasi elektroforesis gel agarosa dengan pewarnaan etidium bromida. Sampel RNA dengan rasio A260/A280 antara 1,9 dan 2,1, rasio RNA 28S:18S lebih tinggi dari 1,0, dan angka integritas RNA (RIN) -8,5 digunakan dalam analisis selanjutnya.
Perpustakaan RNA-seq dihasilkan menggunakan Kit Persiapan Sampel RNA Illumina Truseq. Poli(A)+ RNA diisolasi dari RNA total menggunakan manik-manik Dynal ligo(dT)25 sesuai dengan instruksi pabrik. Setelah pemurnian, buffer fragmentasi ditambahkan untuk memecah mRNA menjadi fragmen pendek. CDNA untai pertama disintesis menggunakan fragmen pendek ini sebagai templat, bersama dengan transkriptase balik SuperScript III dan primer hexamer acak N6. CDNA untai kedua kemudian disintesis menggunakan buffer, dNTPs, RNaseH, dan DNA polimerase I. CDNA untai ganda yang dihasilkan dilakukan perbaikan akhir menggunakan DNA polimerase T4, fragmen DNA polimerase I Klenow, dan polinukleotida kinase T4, dan diikat ke adaptor menggunakan ligase DNA T4. Fragmen yang diikat dengan adaptor dimurnikan menggunakan kit ekstraksi QiaQuick PCR dan dielusi dengan buffer EB. Setelah dianalisis menggunakan elektroforesis gel agarosa, fragmen yang sesuai dipilih sebagai templat untuk amplifikasi PCR. Pengurutan perpustakaan cDNA yang dihasilkan dilakukan dengan sistem Illumina HiSeq 2000.
Transkrip perakitan de novo dan kuantifikasi ekspresi gen
Bacaan mentah yang dihasilkan dari pengurutan dibersihkan dengan menghapus urutan adaptor (ATCTCGTATGCCGTC) menggunakan metode internal. Kami kemudian melakukan proses penyaringan berkualitas rendah yang ketat. Pertama, basis dengan skor kualitas phred lebih rendah dari 20 akan dipangkas dari ujung 3 urutan, hingga menjadi satu basis dengan kualitas lebih tinggi (Lebih besar dari atau sama dengan 20). Jika panjang baca lebih pendek dari 50bp, maka akan dibuang. Kedua, pembacaan akan disaring lebih lanjut berdasarkan kriteria bahwa 70% basis dalam satu pembacaan memiliki skor berkualitas tinggi (Lebih besar dari atau sama dengan 20). Ketiga, hanya pembacaan berpasangan yang digunakan untuk perakitan lebih lanjut. Perakitan transkrip de novo dilakukan menggunakan rilis Trinity_20130216 [30] yang terdiri dari tiga modul perangkat lunak berturut-turut: Inchworm, Chrysalis, dan Butterfly. Parameter perakitan ditetapkan sebagai berikut:-seqType fq-JM 300G -min_contig_length 200-CPU 20-inchworm_cpu {{21} }bflyCPU 20.
Untuk mengukur kelimpahan transkrip, pembacaan pasangan-akhir yang diurutkan diselaraskan kembali dengan transkrip yang dikumpulkan menggunakan skrip di Trinity. Bacaan yang dipetakan digunakan untuk kuantifikasi oleh perangkat lunak RSEM (RNA-Seq by Expectation Maximization). Kelimpahan gen atau isoform diwakili oleh nilai fragmen per kilobase transkrip per juta fragmen yang dipetakan (FPKM), transkrip dengan nilai FPKM sama dengan atau lebih besar dari 0.05 didefinisikan sebagai dinyatakan.
Anotasi fungsional dari transkrip yang diungkapkan
Tidak ada kumpulan anotasi gen C. deserticola kecuali genom kloroplas [1]. Kami memberi anotasi pada transkrip yang diungkapkan dengan membandingkannya dengan kumpulan data Genbank Nt, Genbank Nr, dan TAIR10_ pep_20101214_yang diperbarui secara terpisah menggunakan program BLAST (E< = 1e-20). Meanwhile, all expressed transcripts were translated into potential proteins according to ORF prediction by TransDecoder and predicated for the conserved domains based on the Pfam database.
Anotasi Gene Ontology dan jalur KEGG Dengan penyelarasan kesamaan urutan ke database Uniprot ( anotasi Gene Ontology (GO) dari semua transkrip yang dirakit diperoleh dengan menggunakan file asosiasi yang diunduh dari (ftp://ftp.ebi.ac.uk/pub/ databases/GO/goa/UNIPROT/gene_association.goa_uniprot.gz). Pengelompokan istilah GO dari gen yang diekspresikan dilakukan dengan menggunakan skrip khusus, dan kami memberi anotasi pada gen pada tingkat keempat untuk tersebut Kategori CC, BP, dan MF secara terpisah.
Informasi jalur KEGG ditugaskan untuk semua urutan protein yang diprediksi menggunakan alat online KAAS (KEGG Automatic Annotation Server) (34). Urutan dalam format fasta diserahkan ke permintaan KAAS, dan file yang dihasilkan dari semua informasi jalur yang terkait dengan transkriptom batang C. deserticola diunduh. 13 kumpulan data gen organisme tumbuhan di KEGG digunakan untuk anotasi menggunakan metode BBH (bi-direction best hit).

EKSTRAK CISTANCHE TUBULOSA CISTANCHE ALAMI PHGS75% ECH 30% ACT 12%
Analisis RT-qPCR
Setelah pencernaan dengan DNase I, sekitar 5ug RNA total diubah menjadi cDNA untai pertama melalui reaksi transkripsi balik dengan primer oligo(dT)15 dan Sistem Transkripsi Terbalik GoScript (Promega). Produk cDNA kemudian diencerkan 10-kali lipat dengan air deionisasi bebas nuklease sebelum digunakan sebagai templat dalam PCR waktu nyata. CDNA spesifik diamplifikasi oleh sistem GoTaq 2-Step RT-qPCR (Promega) dalam volume 20 ul. Amplifikasi PCR dilakukan pada suhu anil 60 derajat dengan 7500 Real-Time PCR Detection System (Applied Biosystems) sesuai dengan instruksi pabrik. Kelimpahan transkrip relatif dihitung dengan metode ambang batas siklus komparatif dengan gen "comp10579_c0" sebagai standar internal, menggunakan perangkat lunak 7500 Manager.
Pasangan primer untuk RT-PCR dirancang berdasarkan perangkat lunak online (http://primer3.ut.ee/) dan tercantum dalam Dataset S1.
Hasil
Urutan RNA dan perakitan transkriptome de novo dari batang berdaging C. deserticola
Batang C. deserticola telah banyak digunakan sebagai tonik tradisional yang penting di Tiongkok dan Jepang selama bertahun-tahun. Untuk mendapatkan gambaran global tentang ekspresi gen pada batang berdaging C. deserticola, kami mengumpulkan sampel batang C. deserticola dari basis tanaman yang sama masing-masing pada tahun 2013 dan 2014. Total RNA diekstraksi dan poliA + RNA dimurnikan untuk membangun perpustakaan RNA-seq berpasangan. 79.433.734 dan 86.019.176 pembacaan ujung berpasangan yang sesuai dengan hampir 8 miliar dan 8,6 miliar basis rangkaian diperoleh dengan menggunakan pengurutan Illumina HiSeq 2000

platform dalam sampel 2013-tahun dan 2014-tahun (Tabel 1). Setelah menghapus urutan adaptor dan memfilter pembacaan berkualitas rendah (lihat detailnya di Metode), 64.831.040 pembacaan berpasangan berkualitas tinggi dalam sampel 2013-tahun digunakan untuk perakitan transkriptome de novo. Menggunakan perakit sekuens Trinity [30], 51.719 gen dan 95.787 sekuens transkrip dihasilkan dengan panjang transkrip berkisar antara 200 bp hingga 15.698 bp. Rata-rata panjang transkrip yang dirangkai adalah 950 basis dan panjang N50 adalah 1.519 basis. Jumlah transkrip dalam panjang yang berbeda mengungkapkan bahwa 57,32% dari transkrip yang dikumpulkan berukuran sekitar 500 bp atau lebih panjang (Gambar 1A). Pembacaan ujung berpasangan berkualitas tinggi dalam sampel 2014-tahun dipetakan ke transkriptom yang telah dirakit. Selain itu, kami menemukan bahwa nomor transkrip untuk setiap gen yang dirangkai bervariasi dan 69% gen dengan satu isoform diekspresikan sementara 31% gen mengekspresikan dua atau lebih transkrip (Gambar 1B).
Kuantifikasi ekspresi dan anotasi fungsional dari transkrip yang dikumpulkan
Kelimpahan gen atau transkrip dikuantifikasi menggunakan paket RSEM, di mana pembacaan yang diurutkan diselaraskan kembali dengan urutan gen atau transkrip yang dirangkai menggunakan Bowtie, dan pembacaan yang dipetakan tersebut digunakan untuk kuantifikasi. Nilai FPKM untuk setiap gen atau transkrip dihitung, dan akhirnya, kami mengidentifikasi 63.957 dan 52.857 transkrip yang diekspresikan secara aktif (nilai FPKM lebih besar dari atau sama dengan 0.5) pada sampel batang berdaging C. deserticola di 2{{17} }13 dan 2014, masing-masing. 44.776 transkrip (70,01% dalam sampel 2013-tahun, 84,71% dalam sampel 2014-tahun) umumnya dinyatakan dalam dua ulangan, dan korelasinya (koefisien korelasi Pearson: 0,91979) dari data ekspresinya adalah ditunjukkan pada Gambar S1. Data mentah pengurutan telah diunggah ke database NCBI SRA (nomor tambahan: SRX857402 dan SRX858938). Kami menggunakan gen terekspresikan yang diidentifikasi dalam sampel 2013-tahun untuk analisis lebih lanjut. Informasi anotasi fungsional untuk semua transkrip yang diungkapkan diperoleh dengan menggunakan dua metode. Pertama, semua transkrip yang diekspresikan diselaraskan dengan database nukleotida yang diketahui (GenBank nt) dan urutan peptida (GenBank nr dan Arabidopsis peptida) secara terpisah dengan algoritma BLAST. Dari 63.957 transkrip yang diungkapkan,

29.220 (45,7%) dianotasi dan menunjukkan homologi terhadap urutan di salah satu dari tiga database subjek dengan batas nilai-E 1e-20. Sementara itu, wilayah pengkodean kandidat untuk semua urutan transkrip yang diungkapkan diprediksi menggunakan perangkat lunak TransDecoder, dan ORF terpanjang untuk setiap transkrip digunakan untuk pencarian domain Pfam. Hasilnya, 21.358 (33,4%) transkrip diberi anotasi berdasarkan database Pfam. Secara keseluruhan, 30.098 (47,1%) transkrip secara signifikan dicocokkan dengan gen yang diketahui di database publik dengan menggabungkan kedua metode di atas. Daftar transkrip lengkap dengan anotasi fungsi ditunjukkan dalam data tambahan (Dataset S2).
Kami mensurvei 20 transkrip yang paling banyak diekspresikan (Tabel 2) yang mewakili 18,99% dari seluruh pembacaan sekuensing, dan menemukan bahwa sebagian besar dari transkrip tersebut adalah gen yang merespons terhadap abiotik.

rangsangan stres. Dehydrin (DHNs), suatu kelas protein stres hidrofilik dan termostabil dengan sejumlah besar asam amino bermuatan yang termasuk dalam keluarga Grup II Late Embryogenesis Abundant (LEA), adalah gen yang paling banyak diekspresikan. Tiga transkrip Dehyrin yang berbeda (comp28713_c0_seq1/2/4) terdeteksi memiliki ekspresi tinggi pada batang berdaging yang mungkin terlibat dalam melindungi sel dari kerusakan yang disebabkan oleh cekaman kekeringan. Gen terkait stres lainnya seperti protein heat shock, protein terkait patogen, dan metallothionein juga ditemukan memiliki ekspresi tinggi, yang mungkin terkait dengan lingkungan kelangsungan hidup yang buruk. Selain itu, beberapa gen konstitutif termasuk gen RNA ribosom 26S (comp22329_c2_seq1), protein terkait auksin/dormansi (comp20999_c0_seq1), Faktor ribosilasi ADP (comp20499_ c0_seq1) juga sangat ditranskripsi.

CISTANCHE TUBULOSA ALAMI UNTUK MENINGKATKAN IMUNITAS PHGS75% ECH 30% ACT 12%







