Sastavljanje De Novo transkriptoma temeljeno na RNA-Seq i otkriće gena mesnate stabljike Cistanche Deserticola-Ⅰ
Sep 03, 2024
Pozadine
Cistanche deserticola je potpuno nefotosintetska parazitska biljka s velikom ljekovitom vrijednošću i uglavnom je rasprostranjena u pustinji sjeverozapadne Kine. Njegova osušena mesnata stabljika ključni je toniktradicionalna kineska medicinas ulogama uglavnom poboljšanja muške spolne funkcije i jačanja imuniteta, no provedeno je nekoliko mehaničkih studija dijelom zbog nedostatka genomskih i transkriptomskih izvora.

PRIRODNA CISTANCHE TUBULOSA KINESKA TRADICIONALNA MEDICINA PHGS75% ECH 30% ACT 12%
Rezultati
U ovoj smo studiji izvršili duboko sekvenciranje transkriptoma u mesnatoj stabljici C. deserticola i oko 80 milijuna očitavanja generirano je korištenjem Illumina sekvenciranja na kraju para na platformi HiSeq2000. Koristeći trinity asembler, dobili smo 95.787 sekvenci transkripta s duljinama transkripta u rasponu od 200 bp do 15.698 bp, prosječne duljine od 950 baza i N50 duljine od 1.519 baza. 63 957 transkripata identificirano je kao aktivno izraženo s FPKM-om većim od ili jednakim 0,5, u kojima je 30 098 transkripata označeno opisima gena ili pojmovima ontologije gena analizama sličnosti sekvenci prema nekoliko javnih baza podataka (Uniprot, NR i Nt u NCBI-u i KEGG) . Nadalje, identificirali smo ključne enzimske gene uključene u biosintezu lignina i feniletanoidnih glikozida (PhG) za koje se zna da su primarni aktivni sastojci. Četiri gena za fenilalanin amonijak-liazu (PAL), prvi ključni enzim u biosintezi lignina i PhG, identificirana su na temelju usporedbe sekvenci i filogenetske analize. Također su prvi put predložena dva puta biosinteze PhG-a.
Zaključci
Sve u svemu, dovršili smo globalnu analizu transkriptoma mesnate stabljike C. deserticola koristeći RNA-seq tehnologiju. Kolekcija enzimskih gena povezanih s biosintezom lignina i feniletanoidnih glikozida identificirana je iz sastavljenih i označenih transkripata, a također je predviđena obitelj gena PAL. Podaci o sekvencama iz ove studije pružit će vrijedan izvor za provođenje budućih istraživanja biosinteze feniletanoidnih glikozida i funkcionalnih genomskih studija ove važne ljekovite biljke.
Uvod
C. deserticola svjetski je rod višegodišnjih pustinjskih biljaka iz obitelji Orobanchaceae i potpuno je nefotosintetska vrsta te obično raste podzemna holoparazitska biljka. Parazitira na korijenju psamofita Haloxylon ammodendron (Chenopodiaceae), koji uglavnom nastanjuje pustinje i polupustinje zbog visoke otpornosti na sušu i slanost. C. deserticola pokazuje jaku otpornost na teške uvjete okoliša i uglavnom je rasprostranjena u sjeverozapadnoj Kini, posebno u Unutrašnjoj Mongoliji, Gansu i Xinjiangu. Posljednjih godina smatra se ugroženom divljom vrstom zbog povećane potrošnje od strane ljudi. C. deserticola, koja se često naziva pustinjskim ginsengom, obično je poznata kao pustinjska repa, a osušena mesnata stabljika već se mnogo godina koristi kao tradicionalno važan tonik u Kini i Japanu. Prvobitno je zabilježeno u Shen Nong Ben Cao Jingu (Rječnik kineske Materije Medice, 1977.) prije otprilike 1800 godina i smatralo se jednim od glavnih izvoraKineska ljekovita biljka Cistanche.

PRIRODNA CISTANCHE TUBULOSA ZA POBOLJŠANJE SEKSUALNE FUNKCIJE PHGS75% ECH 30% ACT 12%
Ekstrakti C. deserticola posjeduju širok raspon ljekovitih funkcija, posebno za poboljšanje seksualne funkcije, toniziranje bubrega, zaštitu jetre, radnu aktivnost, poboljšanje pamćenja, imunomodulatorno, antioksidativno djelovanje, protuupalno, antivirusno djelovanje itd. glavne bioaktivne komponente C. deserticola su feniletanoidni glikozidi (PheGs, PhGs). Do danas je iz sočne stabljike C.deserticola izolirano više od 20 feniletanoidnih glikozida. Među njima,akteozid i ehinakoziddvije su glavne komponente sa značajnim farmakološkim djelovanjem i dokumentirane su kao standardi kvalitete C. deserticola u kineskoj farmakopeji (izdanja 2005. i 2010.). Tri kemijske komponente PhG-a su organska kiselina, saharid i feniletanoid, međutim, detalji koji se tiču biosintetskih putova feniletanoida ostaju nedovoljno poznati u C. deserticola.
Unatoč komercijalnoj i medicinskoj važnosti C. deserticola, genomski i transkriptomski podaci ove vrste vrlo su ograničeni. Nema dostupnih EST-ova u bazi podataka NCBI-a i potpuni podaci o genomu ove vrste ostaju nedostupni osim sekvence genoma kloroplasta. Ograničeni transkriptomski podaci ometaju proučavanje biosintetskih mehanizama PhG. RNA-seq tehnologija može generirati sekvence eksprimiranih dijelova ciljanog genoma i identificirati gene [18] koristeći NGS tehnološke platforme (kao što su Applied Biosystems SOLiD, Illumina HiSeq i Roche 454). Postaje sve popularniji u sastavljanju transkriptoma de novo, budući da je to isplativ i moćan pristup s visokom rezolucijom i širokim dinamičkim rasponom, posebno jer ima prednost u istraživanju transkripata niske zastupljenosti. Zbog raznih prednosti, RNA-seq je posebno privlačan za nemodelne organizme s ograničenim genetskim resursima. Međutim, ne postoje detaljna istraživanja transkriptoma C. deserticola pomoću RNA-seq.
U ovoj smo studiji globalno sekvencionirali transkriptom stabljike za C. deserticola pomoću platforme Illumina Hiseq2000 i dobili 7,9G neobrađenih podataka. Sklapanjem i označavanjem otkrili smo gene uključene u biosintezu PhG i gene odgovorne za cjelokupnu biosintezu lignina. Naša RNA-seq analiza generirala je prvi konsenzusni transkriptom C. deserticola i pružila nove uvide u sveobuhvatno razumijevanje medicinske vrijednosti C. deserticola. Dodatno, ovdje opisana metoda može se naširoko primijeniti na profiliranje transkriptoma kako bi se olakšalo otkrivanje gena uključenih u specifične puteve biosinteze medicinskih komponenti u drugoj ljekovitoj biljci s vrlo ograničenim genomskim resursima.
Materijali i metode
Sakupljanje biljnog materijala
Svježa sukulentna stabljika za C. deserticola u fazi iskapanja prikupljena je iz baze biljaka u gradu BayanHot u Alxa ligi u unutarnjoj Mongoliji u sjeverozapadnoj Kini. Dozvola za sakupljanje dobivena je od vlasnika (HongKui CongRong Group) baze postrojenja. Uzorak vaučera pohranjen je u Core Genomic Facility na Pekinškom institutu za genomiku Kineske akademije znanosti. Nakon čišćenja, sočna tkiva stabljike izrezana su u male komadiće i odmah zamrznuta u tekućem dušiku, a zatim pohranjena na -80 stupnjeva do daljnje obrade.
Ekstrakcija RNA, konstrukcija cDNA biblioteke i Illumina sekvenciranje
Ukupna RNA ekstrahirana je iz stabljike sukulenta pomoću TRIzol reagensa (Invitrogen Inc., Kalifornija, SAD) prema uputama proizvođača. Dobiveni uzorci tretirani su DNazom I kako bi se uklonila sva genomska DNK. Ekstrahirane RNA kvantificirane su pomoću bioanalizatora Agilent 2100 (Agilent Technologies) i provjerena cjelovitost pomoću elektroforeze u denaturirajućem agaroznom gelu s bojanjem etidijevim bromidom. Uzorci RNA s omjerima A260/A280 između 1,9 i 2,1, omjerima RNA 28S:18S višim od 1,0 i brojevima integriteta RNA (RIN) -8.5 korišteni su u naknadnim analizama.
Knjižnice RNA-seq generirane su korištenjem kompleta za pripremu uzoraka Illumina Truseq RNA. Poly(A)+ RNA izolirana je iz ukupne RNA pomoću Dynal ligo(dT)25 kuglica prema uputama proizvođača. Nakon pročišćavanja, dodan je pufer za fragmentaciju da se mRNA razbije na kratke fragmente. Prvi lanac cDNA sintetiziran je korištenjem ovih kratkih fragmenata kao predložaka, zajedno sa SuperScript III reverznom transkriptazom i N6 nasumičnim heksamer početnikom. Drugi lanac cDNA zatim je sintetiziran upotrebom pufera, dNTP-ova, RNaseH i DNA polimeraze I. Rezultirajuća dvolančana cDNA podvrgnuta je popravljanju kraja upotrebom T4 DNA polimeraze, DNA polimeraze I Klenow fragmenta i T4 polinukleotidne kinaze, te vezana za adapteri koji koriste T4 DNA ligazu. Fragmenti povezani s adapterom su pročišćeni korištenjem QiaQuick PCR ekstrakcijskog kompleta i eluirani s EB puferom. Nakon analize pomoću elektroforeze u agaroznom gelu, odabrani su prikladni fragmenti kao uzorci za PCR amplificiranje. Sekvenciranje dobivene cDNA biblioteke provedeno je s Illumina HiSeq 2000 sustavom.
Sklapanje transkripata de novo i kvantifikacija ekspresije gena
Neobrađena čitanja generirana sekvenciranjem očišćena su uklanjanjem sekvenci adaptera (ATCTCGTATGCCGTC) korištenjem interne metode. Zatim smo proveli strogi postupak filtriranja niske kvalitete. Prvo, baze s phred ocjenom kvalitete nižom od 20 bile bi odrezane od 3'kraja niza, sve dok ne naiđu na jednu bazu više kvalitete (veća ili jednaka 20). Ako je duljina čitanja bila kraća od 50 bp, bila bi odbačena. Drugo, očitavanja će se dodatno filtrirati prema kriteriju da 70% baza u jednom očitavanju ima rezultate visoke kvalitete (veće ili jednako 20). Treće, za daljnju montažu korištena su samo uparena očitavanja. Sastavljanje transkripta de novo provedeno je pomoću izdanja Trinity_20130216 [30] koje se sastojalo od tri uzastopna softverska modula: Inchworm, Chrysalis i Butterfly. Parametri montaže postavljeni su kao ispod:-seqType fq-JM 300G -min_contig_duljina 200-CPU 20-inchworm_cpu {{21} }bflyCPU 20.
Kako bi se kvantificiralo obilje transkripta, sekvencirana čitanja na kraju para ponovno su poravnata sa sastavljenim transkriptima pomoću skripte u Trinityju. Mapirana očitanja korištena su za kvantifikaciju softverom RSEM (RNA-Seq by Expectation Maximization). Obilje gena ili izoforme predstavljeno je vrijednošću fragmenta po kilobazi transkripta po milijunu mapiranih fragmenata (FPKM), oni transkripti s FPKM vrijednošću jednakom ili većom od 0.05 definirani su kao izraženi.
Funkcionalna anotacija izraženih prijepisa
Ne postoje skupovi genskih oznaka C. deserticola osim za genom kloroplasta [1]. Izražene transkripte označili smo uspoređujući ih s Genbank Nt, Genbank Nr i TAIR10_ pep_20101214_ažuriranim skupovima podataka zasebno pomoću programa BLAST (E< = 1e-20). Meanwhile, all expressed transcripts were translated into potential proteins according to ORF prediction by TransDecoder and predicated for the conserved domains based on the Pfam database.
Bilješka o ontologiji gena i KEGG putu Usklađivanjem sličnosti sekvenci s bazom podataka Uniprot ( anotacija genske ontologije (GO) svih sastavljenih transkripata dobivena je korištenjem datoteke pridruživanja preuzete s (ftp://ftp.ebi.ac.uk/pub/ baze podataka/GO/goa/gene_asocijacija goa_uniprot.gz). CC, BP i MF kategorije zasebno.
Informacije o KEGG putu dodijeljene su za sve predviđene sekvence proteina pomoću online alata KAAS (KEGG Automatic Annotation Server) [34]. Sekvence u formatu fasta poslane su na zahtjev KAAS-a, a dobivene datoteke sa svim informacijama o putevima povezanim s transkriptomom stabljike C. deserticola preuzete su. Skupovi genskih podataka 13 biljnih organizama u KEGG-u korišteni su za označavanje korištenjem BBH (bi-directional best hit) metode.

PRIRODNI EKSTRAKT CISTANCHE TUBULOSA CISTANCHE PHGS75% ECH 30% ACT 12%
RT-qPCR analiza
Nakon probave s DNazom I, približno 5 ug ukupne RNA pretvoreno je u prvi lanac cDNA putem reakcije obrnute transkripcije s oligo(dT)15 početnicama i GoScript sustavom obrnute transkripcije (Promega). Produkti cDNA zatim su 10-struko razrijeđeni deioniziranom vodom bez nukleaza prije upotrebe kao uzorka u PCR-u u stvarnom vremenu. Specifične cDNA umnožene su GoTaq 2-Step RT-qPCR sustavom (Promega) u volumenu od 20 ul. PCR amplifikacija je izvedena na temperaturi žarenja od 60 stupnjeva sa 7500 Real-Time PCR Detection System (Applied Biosystems) prema uputama proizvođača. Relativna zastupljenost transkripata izračunata je metodom praga usporednog ciklusa s genom "comp10579_c0" kao internim standardom, korištenjem softvera 7500 Manager.
Parovi primera za RT-PCR dizajnirani su na temelju online softvera (http://primer3.ut.ee/) i navedeni su u S1 skupu podataka.
Rezultati
Sekvenciranje RNA i sklapanje de novo transkriptoma mesnate stabljike C. deserticola
Stabljika C. deserticola se godinama intenzivno koristi kao tradicionalno važan tonik u Kini i Japanu. Kako bismo dobili globalni pregled ekspresije gena u mesnatoj stabljici C. deserticola, prikupili smo uzorke stabljike C. deserticola iste biljne baze 2013., odnosno 2014. godine. Ukupne RNA su ekstrahirane i polyA+ RNA su pročišćene za konstruiranje uparenih end RNA-seq biblioteka. 79,433,734 i 86,019,176 čitanja na kraju para koja odgovaraju gotovo 8 milijardi i 8,6 milijardi baza sekvence dobivena su korištenjem Illumina HiSeq 2000 sekvenciranja

platforma u uzorcima 2013-godine i 2014-godine (Tablica 1). Nakon uklanjanja adapterskih sekvenci i filtriranja čitanja niske kvalitete (pogledajte detalje u Metodama), 64 831 040 visokokvalitetnih čitanja na kraju para u 2013-godišnjem uzorku korišteno je za de novo sastavljanje transkriptoma. Koristeći Trinity sekvencijski asembler [30], generirano je 51 719 gena i 95 787 transkripcijskih sekvenci s duljinama transkripta u rasponu od 200 bp do 15 698 bp. Prosječna duljina sastavljenih prijepisa je 950 baza, a N50 duljina je 1519 baza. Broj transkripata različitih duljina otkrio je da je 57,32% sastavljenih transkripata bilo oko 500 bp ili dulje (Slika 1A). Visokokvalitetna čitanja na kraju para u 2014-godišnjem uzorku mapirana su na sastavljeni transkriptom. Osim toga, otkrili smo da broj transkripata za svaki skupljeni gen varira i 69% gena s jednom eksprimiranom izoformom, dok 31% gena eksprimira dva ili više transkripata (Slika 1B).
Kvantifikacija ekspresije i funkcionalna anotacija sklopljenih prijepisa
Obilje gena ili transkripata kvantificirano je korištenjem RSEM paketa, u kojem su sekvencirana očitavanja ponovno poravnata sa sastavljenim genima ili sekvencama transkripata pomoću Bowtie, a ta mapirana očitavanja korištena su za kvantifikaciju. Izračunata je vrijednost FPKM za svaki gen ili transkript i na kraju smo identificirali 63 957 i 52 857 transkripata s aktivnom ekspresijom (vrijednost FPKM veća od ili jednaka 0.5) u uzorcima mesnate stabljike C. deserticola u 2{{17} }13 odnosno 2014. 44.776 transkripata (70,01% u uzorku 2013-godine, 84,71% u uzorku 2014-godine) uobičajeno je eksprimirano u dva ponavljanja, a korelacija (Pearsonov koeficijent korelacije: 0,91979) njihovih podataka o ekspresiji bila je prikazano na slici S1. Neobrađeni podaci sekvenciranja učitani su u bazu podataka NCBI SRA (pristupni brojevi: SRX857402 i SRX858938). Koristili smo eksprimirane gene identificirane u 2013-godišnjem uzorku za daljnju analizu. Informacije o funkcionalnoj napomeni za sve ekspresirane transkripte dobivene su pomoću dvije metode. Prvo, svi eksprimirani transkripti su usklađeni s poznatim nukleotidnim (GenBank nt) i bazama podataka sekvenci peptida (GenBank nr i Arabidopsis peptid) odvojeno algoritmom BLAST. Od 63.957 izraženih transkripata,

29 220 (45,7%) je označeno i pokazalo je homologiju sa sekvencama u bilo kojoj od tri predmetne baze podataka s graničnom vrijednosti E-vrijednosti 1e-20. U međuvremenu, područja kandidata za kodiranje za sve izražene sekvence transkripta predviđena su pomoću softvera TransDecoder, a najduži ORF-ovi za svaki transkript korišteni su za pretraživanje domene Pfam. Kao rezultat toga, 21.358 (33,4%) transkripata je označeno na temelju Pfam baze podataka. Sveukupno, 30 098 (47,1%) transkripata značajno je usklađeno s poznatim genima u javnim bazama podataka kombinacijom dvije gore navedene metode. Kompletan popis ekspresiranih prijepisa s napomenom funkcije prikazan je u dodatnim podacima (S2 skup podataka).
Anketirali smo 20 najizraženijih transkripata (Tablica 2) koji odgovaraju 18,99% svih očitavanja sekvenciranja i otkrili da su većina njih geni koji reagiraju na abiotičke

podražaj stresa. Dehidrin (DHN), klasa hidrofilnih i termostabilnih stresnih proteina s velikim brojem nabijenih aminokiselina koji pripadaju grupi II obilne kasne embriogeneze (LEA), gen je s najvećom ekspresijom. Tri različita transkripta Dehyrina (comp28713_c0_seq1/2/4) otkrivena su kao visoko izražena u mesnatim stabljikama koje mogu biti uključene u zaštitu stanica od oštećenja uzrokovanih stresom od suše. Drugi geni povezani sa stresom, poput proteina toplinskog šoka, proteina povezanog s patogenima i metalotioneina, također su bili izraženi u visokoj mjeri, što bi moglo biti povezano s njegovim teškim okruženjem za preživljavanje. Dodatno, neki konstitutivni geni uključujući 26S gen ribosomske RNA (komp22329_c2_seq1), protein potisnut auksinom/povezan s mirovanjem (komp20999_c0_seq1), Faktor ADP-ribozilacije (komp20499_ c0_seq1) također je visoko transkribiran.

PRIRODNA CISTANCHE TUBULOSA ZA POBOLJŠANJE IMUNITETA PHGS75% ECH 30% ACT 12%







