Friday, July 15, 2011

A Practical Comparison of De Novo Genome Assembly Software Tools for NGS Tech.

de novo assembly에 대해서 여러가지 툴들을 비교 분석한다. 음.. abstract를 보면 너무 뻔한 소리를 하고 있긴 한다만.. 그래도 그 과정이 궁금하기에 한번 보자.


intro를 보자면
아하.. quality-value를 input으로 하는 것은 SHARCGS와 ALLPATHS-LG 밖에 없단다.


memory saving과 data inquiry의 편의성을 위해서 요즘 assembler는 크게 두가지 형태의 data structure를 채택하는데
1. string-based model : Greedy-extension algorithm 채택, 상대적으로 작은 사이즈의 게놈에 이용
2.graph-based model : OLC (overlap-layout consensus)와 DeBruijn graph를 이용한 방식, complex genome을 핸들링 하는데 사용


요즘 assembler의 bottleneck은 어떻게 repetitive fragment를 처리하냐인데 paired end로 수습하려는 시도가 있다. 두번째 큰 문제는 시간이 엄청 걸린다는 것, 이것을 해결하기 위해 thread의 병렬화 이용.
아래 그림은 이제 이 논문에서 비교하려는 24개의 assembler를 그들이 취급하는 data structure에 따라 분류한 그림
이 논문에서는 24가지 전체 비교는 아니고 8가지 assembler로만(이것들이 4개의 assembly strategy를 대표) 4개의 genome에 대해서 test 한다. 물론 이 논문의 목적은 각각의 assembler의 performance 비교 (memory cost, assembly accuracy, completeness, size distribution of contigs) 하는 것.


result를 보자면..
speed 랑 memory 를 얼마나 차지하나를 보는데.. 건질건 없다. 4개의 quad core CPU, 32GB of RAM에서 실행한건데... 그냥 De Buijn graph를 이용하는 것들이 메모리도 적게 먹고 빠르다.
그 담엔 accuracy랑 integrity를 봤는데.. 뭐 accuracy와 integrity의 정의가 뭐 그닥 fancy 하지 않다. 그냥 굉장히 단순하게 계산을 했다. "shorter than Ybp" 라고 한건 오타가 아닐까 생각이 들고 integrity 를 정의 할때 contig의 cover region에 대한 redundancy를 왜 고려하지 않았을까란 생각이 든다. 그냥 mapped contig의 길이의 총합을 이용했는데.. 이건 좀 정확한 의미의 integrity가 아닐거란 생각이 든다.


이 논문은 끝까지 안보련다.. 시간 낭비란 생각이 들어서




------------------------checkList-----------------------
1.string based model 이란게 정확하게 뭔지.. 알고리즘적인 접근 필요

Friday, July 8, 2011

Whole-genome DNA methylation profiling using MethylCap-seq

아래 포스팅은 MBD-Seq 중에 MiGS. 이건 MethylCap-Seq. 차이점이 정확히 무엇인지 알기 위해 본다. 특히나 중요한 것중에 하나가 elution시 salt 농도를 gradient를 줘서 elution 하는거 같은데 확실히 알아볼 필요가 있다.



MBD-isolated Genome Sequencing provides a high-throught and comprehensive survey of AND methylation in the human genome

보건원 발표 자료가 BS-Seq인줄 알고 BS-Seq 만 보다가 건네 받은 데이터까 MBD-Seq 이라는 걸 알고 급선회한다. 

이 사람들은 자기네 방식을 MiGS (MBD-isolated Genome Sequencing) 이라고 한다(뭔놈의 용어들을 이렇게 만들어 내는지.. 헷갈리게 시리). MBD2 protein의 recombinant MBD를 이용해서 random하게 짤린 DNA 중 methylated 된것만 precipitation 시켜서 이를 parallel 하게 시퀀싱한다는 것. 여기서 말하길 MBD 가 서로 가까이에 위치한 multiple methylated cytosine에 대해 bind affinity가 증가하므로 MeDIP(anti-5-methyl cytosine antibody를 사용하는 실험 방법으로 이는 하나 이상의 mCpG의 DNA 가닥에 bind 하므로 좀 sporadically mCpG를 위주로 immunoprecipitation 시킨단다)에 비해 생물학적으로 좀 더 연관되어 있는, 그러니까 좀 densely mCpG를 잡는다고. 그리고 DNA shearing은 sonication으로 해야 restriction enzyme 보다 bias 가 적단다. 
뭐 여튼 이건 실험적인 방법이고 그래서 이 논문에서는 이 방법으로 뭘 본거냐. 3개의 isogenic human cancer cell line(1.parental HCT116 colon cancer cell line: colon cancer cell의 평균의 methylation level을 보임, 2.DICERex5 cell: HCT116에서 유도된건데 DICER1 allele들이 짤린거로 약간의 유전자의 promoter 부위의 methylation 변화가 생긴 것, 3.DNMT1, DNMT3b double knockout cell (DKO cells): DNMT 를 knockout 시켰으니 대부분의 methylation을 잃은 cell)의 methylation profile을 봤단다. 


실험에 대한 이해가 많이 떨어지는데 그래도 대충 보니까 elution 할 때 Proteinase K의 농도를 고정한거 같은데.. 이 말은 salt 농도를 일정하게 했다는 거고 그렇다면 예전에 봤던 논문(MethylCap-Seq)만 salt 농도를 변화 시킨건가.. 음 여튼. 실험 방법 순서를 다시 정리하면 1.DNA extraction, 2.sonication(150-600bp가 되게끔), 그리고 이때 100bp보다 작은건 제거, 3. recombinant MBD2_MBD를 조각낸 DNA에 붙임, 4.library를 만드는데 이때 길이가 120bp 위주로, 5.GAII로 36bp를 읽는다.


bowtie로 align 했고 unique mapped read 만 분석에 사용. duplication read 제거. genome을 unoverlapped 100bp window로 만들고 36bp read를 120bp까지 extend 한다음에 이 120bp가 많이 커버하는 window로 이 read를 할당. 곧 genome 상의 methylation이 됐다 안됐다, 그리고 DMR 같은 것을 판단 할때 이 100bp window를 단위로 생각. RepeatMasker로 read들을 분석해서 repeat element확인. DMR은 각 윈도우별 unique mapped read를 가지고 Fisher's exact test로 p-value 구해서 찾음.


아래표는 실험 read의 throughput


아래 그림은 MiGS로 새롭게 찾아진 methylated region을 bisulfite sequencing으로 confirm 한 그림. 기다란 네모가 MiGS의 결과 window들인데 까맣다면 methylation 된거 하얗다면 unmethylation. 아래 점들은 개개인 별로다가 bisulfite 한것.


아래 표는 genome 상의 영역별 methylation의 정도를 나타낸 표. 
5'end는 TSS로 부터 500bp 안의 window들
3'end는 TES(transcription end site 혹은 stop site)로 부터 500bp 안의 window들
genic 은 5'end와 3'end 사이의 window
intergenic은 나머지 window




------------------------check list------------------------
1.method 지에 나왔던 MethylCap-Seq 논문에서 elution 할때 농도 변화를 줬는데.. 그 방법과 이유 확인.
2.library size selection 할때 sonication 하고 바로 size selection 하는건지 아니면 MDB 붙이고 elution시키고 나서 size selection을 하는 건지 확인. 내 생각으로는 sonication하고 바로 size selection 할거 같은데.. method를 볼때는 그때는 단지 100bp 아래로만 제거하는거 같은데.. 
3.FDR을 구할때 특정 read 갯수를 갖는 window의 수랑 expected window 수랑 비교해서 군한다고 하는데.. expected window 수를 어떻게 구하는지. 람다가 나오는데 이게 정확하게 무슨 의미인지.
4.왜 mapping 안된 read들을 Venter's genome의 sanger read에 mapping 했는지.
5.그림 1에서 bisulfite로 확인했을때 methylation 됐다 안됐다의 기준이 무엇인지(percentage?)

Thursday, July 7, 2011

Dynamic changes in the human methylome during differentiation

바로 아래 포스팅도 급하게 method만 봤는데.. DMR을 찾을때의 방법을 정확하게 모르겠어서 다른 논문에서는 어떻게 하는게 찾다가 나온 논문. 생물학적인 의미는 읽지 않은채 거의 method 위주로 읽고 있는데.. 아.. 어쩔수 없다. 다음주 수요일 보건원 발표 때까지 분석 방향을 잡아야 해서.. 어짜피 나중에 다 보게 될거다. 그 때 그때 포스팅 수정하기로 한다.

Wednesday, July 6, 2011

The DNA Methylome of Human Peripheral Blood Mononuclear Cells

예전에 포스팅 했던 논문의 reference 데이터로 사용되었던 BS-Seq 데이터에 대한 논문.
YH project로 아시아 최소 genome sequencing 한 사람의 PBMC(peripheral blood mononuclear cells)의 whole genome BS-Seq을 한 논문으로 CpG methylation pattern과 ASM(allele-specific methylation), ASE(allele-specific expression)에 대해서 조사하였다.

Results
<Data Generation and Quality Assessment>
103.5Gbp paired-end 데이터 생성, 그중 70.4Gbp (68%) 가 genome에 align됨. 2.21Gb genome (haploid part만 고려) 에서 18,962,679 CpG 사이트가 있는데 그중 한쪽 strand 이상 커버한 것이 99.86%, 양쪽 strand 모두 커버한 것이 92.62% (quality score가 14이상인 것들만 고려). 아 그리고 정말 궁금했던 것이 여기서 나오는데.. 어떻게 ASM이라는 걸 detecting 하는걸까 궁금했는데. 



Materials and Methods


<Sample Preparation and Bisulfite Sequencine>
DNA methylation의 strand specificity 때문에 Watson and Crick strand를 합쳐서 6Gbp의 reference를 만들고("original form") C을 T으로 변환한다("alignment form"). read들 역시 conversion 하는데 read가 paired-end 이기 때문에  1.forward read의 cytosine을 thymine으로 변환, 2.reverse read는 G를 A로 변환. 이 변환된 read를 변환된 reference("alignment form")에 align 한다.
unambiguous alignment : 허용 범위 안의 mismatch로 unique alignment된 hit.
Local copy number of a genomic location : 특정 genomic location에 align 된 read의 hit count를 평균한 값. 이때 read는 ambiguous read도 사용. 그러니까 특정 영역의 genome에 align된 read들이 unique mapped된것 뿐만 아니라 ambiguously aligned read도 있으니까 각 read마다 게놈상에 align hit들이 있을텐데 이를 평균한 값. 이게 높다면 redundant alignment가 많다는거고 이 genome 영역은 분석에 사용하기에 적합하지 않다고 판단(이 기준이 1.5). 이 1.5 안넘는 genome의 영역이 2.21Gbp.
potentially methylated site : reference랑 read를 alignment하고 난뒤 "alignment form" 에서 "original form"으로 변환했을때 둘 다 C인 site.


<Estimation of Methylation Level>
methylation의 ascertainment가 sequencing error에 의한 것일수도 있기 때문에 이를 방지 하기 위한 quality threshold를 정해야 하는데 >14 이상이 되니까 non-CpG site의 methylation level이 변화가 없더라. methylation level은 이 >14 이상 read중에 ascertainment read의 percentage.


<Identification of Potential Tissue-Specific Differentially Methylated Regions (tDMR)>
최소 5개 이상의 CpG site를 포함하는 window중 2-fold change 이상의 methylation 차이가 있거나 fisher test p-value가 <1e-20 인 window들을 tDMR이라고 한다. 두 tDMR이 인접해 있을때 ...


<Identification of Haploid Differentially Methylated Regions (hDMR)>
tDMR과 pvalue만 <0.001 이라는 점만 제외하고 같다. 인접한 hDMR은 ...




------------------알아야 할 점----------------------
1.region의 uniqueness를 알기 위해 local copy number를 계산할 때 region영역을 얼마로 잡았는지.
2.FP 공식 이해.
3.coverage depth에서 "could provide 5 different results"의 의미
4.tDMR, hDMR에서 2 fold 만 보는건지 그 이상을 보는건지.
5.tDMR, hDMR의 인접한 DMR을 join하는 기준이 정확히 무엇인지.

Tuesday, July 5, 2011

Integrated genomic analyses of ovarian carcinoma

한 일주일 전쯤에 TCGA1 (The Cancer Genome Atlas)에서 nature지에 낸 논문. 음.. genomics의 통합 분석이란다. 알아두어야 할 만하다. 사실 지금이야 돈이 많이 들어가니까 큰 프로젝트 단위로 해야 통합 분석 논문이 나오는데 조만간 실험실 단위에서 이런식의 논문이 많이 나올 것으로 생각된다.

abstract를 보면 ovarian cancer의 대부분의 tumor에서 TP53의 mutation이 발견되었고 이와 동반해서 9개 유전자의 mutation, 113 개의 CNV, 168개 유전자의 promoter methylation event가 발견되었다고. 그리고 survival duration에 따라 각 genetic signature 별 subtype을 나눴다. 그리고 pathway analysis 결과 homologous recombination에서 결함이 있는걸로 발견되었고 NOTCH와 FOXM1 signalling이 ovarian cancer와 연관이 높은 것으로 나타났다.

Samples and clinical data
489 HGS-OvCa(high-grade serous ovarian cancer) sample



mutation analysis
316 clinical sample과 이에 상응한 normal sample을 exome capture & sequencing. ~180,000 exon, ~18,500 gene, ~33 Mb 까지 cover를 했고 sample당 ~14Gb 를 sequencing. 총 19,356개의 somatic mutation(tumor당 61개정도)를 찾았다. 이 중에서 non-synonymous mutation, splice site mutation, COSMIC(Catalogue of Somatic Mutations in Cancer)와  OMIM(online mendelian inheritance in men)과 비교하고 또 protein function에 영향을 고려해서(CHASM 사용) 유의하다고 생각하는 mutation을 골랐다. non-synonymous mutation과 splice site의 mutation의 분석에서 최종적으로 9가지 gene을 뽑은게 아래 표와 같다.
COSMIC과 OMIM과의 비교로 477, 211개의 mutation이 match됨을 확인했다.
CHASM이라는 프로그램을 이용해서(기존에 알려져 있는 oncogene과 tumor suppressor의 mutation으로 CHASM을 training 한뒤 사용) diver mutation



mRNA and miRNA expression and DNA methylation analysis
mRNA의 경우 3개의 platform의 chip을 사용. 2개의 affymetrix과 하나의 agilent chip. affymetrix의 경우 RMA와 affymetrix.aroma로 processing 했고, agilet의 경우 lowess normalizaion을 함. 이 3개의 platform에서 true underlying gene expression을 구하기 위해 factor analysis5를 적용한다(자세한 내용은 다음 논문의 supplementary note 참조). 3개의 platform에서 factor analysis로 unified expression estimate를 구하고 각 platform의 MAD6의 평균으로 variation의 estimate를 구해서 rescaling 한다(두 estimate를 구하고 나서 이걸로 어떻게 rescaling 하는지는 이해가 어렵다). 이렇게 3개의 platform으로부터 하나의 gene expression estimate를 구한뒤 filtering 과정(expression estimate와 3개의 platform간의 correlation이 있고, high variability across patient 인 유전자만 선택)을 거쳐 clustering을 위한 유전자 set을 골라낸다.





--------------------------reference------------------------------
1.TCGA (the cancer genome atlas) : 2005년부터 시작된 프로젝트로 cancer에 영향이 있는 genetic mutation 목록을 만드는데 목표가 있다. 2006년에는 glioblastoma multiforme(brain cancer), lung, ovarian cancer에 대해서 genomic level의 모든 정보(gene expression, copy number variation, SNP genotyping, methylation, microRNA등)를 통합 분석을 위한 작업을 착수 하였으며 2009년부터는 20-25가지의 cancer로 프로젝트를 넓히게 되었다.

2.PFS (progression free survival) : 암환자 집단이 있을 때 특정 치료(?)이후에 몇 퍼센트나 암이 progression을 멈췄나를 나타내는 것으로 특정 치료의 효율을 나타내는 지표로 사용.

3.OS (overall survival)

4.driver mutation : a mutation that gives a selective advantage to a clone in its microenvironment, through either increasing its survival or reproduction. Driver mutations tend to cause clonal expansions. 다르게 말하면 A subset of these mutations contribute to tumor progression


5.factor analysis : 여기 참조, 아마도 factor를 1로 고정해서 계산한게 아닐까 싶다.


6.MAD : 위키 참조

Sunday, July 3, 2011

Whole Transcriptome Sequencing Reveals Gene Expression and Splicing Differences in Brain Regions Affected by Alzheimers's Disease

cufflinks를 설치, test 및 그 사이트에서 추천하는 procedure까지 알아봤다. 그럼 대충 cufflinks 의 내용과 사용법을 알았으니 이를 이용한 논문에서 어떻게 사용하고 데이터를 핸들했는지 알아보자. 왜냐.. cufflinks 결과만 주면 뻘쭘하잖아..


저자 왈 처음으로 AD(Alzheimer's disease) 환자의 뇌의 서로 다른 영역에서의 transcriptome을 RNA-Seq으로 분석했단다. 건강한 사람과 AD 환자의 post-mortem tissue(죽고 나서) 의 total brain, frontal and temporal lobe 영역(위 그림 참조)에서 transcriptome을 조사해서 gene expression의 quantification, splicing isoform, 그리고 alternative transcript start site를 찾았단다. 그리고 overrepresentative 유전자들의GO enrichment analysis를 해보니 음.. neuron 관련 유전자들이란다. 결론은 APOE (apolipoprotein E) 유전자의 alternative splicing 과 promoter usage가 AD 랑 관련있다는것.

그럼 내가 여기서 초점을 맞춰야 할 사항. 1. quantification of gene expression, 2. splicing isoform, 3.alternative transcript start site, 4.GO enrichment analysis의 방법에 대해서 확실히 알아보자.

SRA데이터가 좀 이상하다. 분면 논문 material에서는 paired end adaptor를 붙였다는데 데이터는 single이다. 뭐 여튼 건 중요한건 아니고. 

mapping은 tophat을 이용, cufflinks로 assembly하고 .. cuffcompare로 기존의 annotation과 비교하고 거기서 나온 combine.gtf 파일을 새로운 annotation파일로 써서 cuffdiff를 이용하여 transcript의 양 차이와 alternative splicing 을 찾아냄. 
그리고 GO enrichment analysis는 DAVID를 이용.

싱겁긴 하지만 일단은 여기까지.