Showing posts with label PLoS ONE. Show all posts
Showing posts with label PLoS ONE. Show all posts

Wednesday, November 2, 2011

Evaluation of Algorithm Performance in ChIP-Seq Peak Detection

제목 그대로 ChIP-Seq 프로그램 performance를 비교한 것인데.. 음 이런 논문이야 말로 짐 회사에서 내기 좋은 주제가 않을까 싶은데.. 아숩다.


ChIP-Seq 데이터 분석에서 필요한 peak finding을 위한 프로그램이 31개나 있단다. introduction에 보면 ChIP-Seq 분석 프로그램의 대략적인 알고리즘 개요가 나온다. NGS 특성상 5' 쪽의 tag만 읽기 때문에 생기는 strand-dependent bimodality를 보정하기 위한 방법(paired-end 는 몇개의 프로그램에서만 지원된단다), read가 많이 mapping된 genomic region을 찾는 방법, peak region을 찾기 위해 threshold를 정하는 방법(background signal model 이용:1.manual threshold,2.Poisson or negative binomial model 이용,3.control data 이용), peak의 significance를 정하는 방법에 대한 여러 알고리즘의 간략한 소개가 있다.

일단 여기서는 11개의 peak calling algorithm을 3개의 transcription factor ChIP-Seq 데이터를 가지고 비교한다. 이것이 이 논문의 목적.


Results
overview
3가지 dataset은 NRSF(human neuron-restrictive silencer factor), GABP(growth-associated binding protein), FoxA1(hepatocyte nuclear factor 3a)의 ChIP-Seq데이터. 
테스트한 프로그램들 11개의 리스트는 아래와 같고 각 프로그램의 option들은 default를 이용(control data를 이용할 수 있는 프로그램만 선택).
Sensitivity
3개의 dataset에 대해 11개의 program에서 찾는 peak의 수는 차이가 있다. 

Friday, July 15, 2011

A Practical Comparison of De Novo Genome Assembly Software Tools for NGS Tech.

de novo assembly에 대해서 여러가지 툴들을 비교 분석한다. 음.. abstract를 보면 너무 뻔한 소리를 하고 있긴 한다만.. 그래도 그 과정이 궁금하기에 한번 보자.


intro를 보자면
아하.. quality-value를 input으로 하는 것은 SHARCGS와 ALLPATHS-LG 밖에 없단다.


memory saving과 data inquiry의 편의성을 위해서 요즘 assembler는 크게 두가지 형태의 data structure를 채택하는데
1. string-based model : Greedy-extension algorithm 채택, 상대적으로 작은 사이즈의 게놈에 이용
2.graph-based model : OLC (overlap-layout consensus)와 DeBruijn graph를 이용한 방식, complex genome을 핸들링 하는데 사용


요즘 assembler의 bottleneck은 어떻게 repetitive fragment를 처리하냐인데 paired end로 수습하려는 시도가 있다. 두번째 큰 문제는 시간이 엄청 걸린다는 것, 이것을 해결하기 위해 thread의 병렬화 이용.
아래 그림은 이제 이 논문에서 비교하려는 24개의 assembler를 그들이 취급하는 data structure에 따라 분류한 그림
이 논문에서는 24가지 전체 비교는 아니고 8가지 assembler로만(이것들이 4개의 assembly strategy를 대표) 4개의 genome에 대해서 test 한다. 물론 이 논문의 목적은 각각의 assembler의 performance 비교 (memory cost, assembly accuracy, completeness, size distribution of contigs) 하는 것.


result를 보자면..
speed 랑 memory 를 얼마나 차지하나를 보는데.. 건질건 없다. 4개의 quad core CPU, 32GB of RAM에서 실행한건데... 그냥 De Buijn graph를 이용하는 것들이 메모리도 적게 먹고 빠르다.
그 담엔 accuracy랑 integrity를 봤는데.. 뭐 accuracy와 integrity의 정의가 뭐 그닥 fancy 하지 않다. 그냥 굉장히 단순하게 계산을 했다. "shorter than Ybp" 라고 한건 오타가 아닐까 생각이 들고 integrity 를 정의 할때 contig의 cover region에 대한 redundancy를 왜 고려하지 않았을까란 생각이 든다. 그냥 mapped contig의 길이의 총합을 이용했는데.. 이건 좀 정확한 의미의 integrity가 아닐거란 생각이 든다.


이 논문은 끝까지 안보련다.. 시간 낭비란 생각이 들어서




------------------------checkList-----------------------
1.string based model 이란게 정확하게 뭔지.. 알고리즘적인 접근 필요

Sunday, July 3, 2011

Whole Transcriptome Sequencing Reveals Gene Expression and Splicing Differences in Brain Regions Affected by Alzheimers's Disease

cufflinks를 설치, test 및 그 사이트에서 추천하는 procedure까지 알아봤다. 그럼 대충 cufflinks 의 내용과 사용법을 알았으니 이를 이용한 논문에서 어떻게 사용하고 데이터를 핸들했는지 알아보자. 왜냐.. cufflinks 결과만 주면 뻘쭘하잖아..


저자 왈 처음으로 AD(Alzheimer's disease) 환자의 뇌의 서로 다른 영역에서의 transcriptome을 RNA-Seq으로 분석했단다. 건강한 사람과 AD 환자의 post-mortem tissue(죽고 나서) 의 total brain, frontal and temporal lobe 영역(위 그림 참조)에서 transcriptome을 조사해서 gene expression의 quantification, splicing isoform, 그리고 alternative transcript start site를 찾았단다. 그리고 overrepresentative 유전자들의GO enrichment analysis를 해보니 음.. neuron 관련 유전자들이란다. 결론은 APOE (apolipoprotein E) 유전자의 alternative splicing 과 promoter usage가 AD 랑 관련있다는것.

그럼 내가 여기서 초점을 맞춰야 할 사항. 1. quantification of gene expression, 2. splicing isoform, 3.alternative transcript start site, 4.GO enrichment analysis의 방법에 대해서 확실히 알아보자.

SRA데이터가 좀 이상하다. 분면 논문 material에서는 paired end adaptor를 붙였다는데 데이터는 single이다. 뭐 여튼 건 중요한건 아니고. 

mapping은 tophat을 이용, cufflinks로 assembly하고 .. cuffcompare로 기존의 annotation과 비교하고 거기서 나온 combine.gtf 파일을 새로운 annotation파일로 써서 cuffdiff를 이용하여 transcript의 양 차이와 alternative splicing 을 찾아냄. 
그리고 GO enrichment analysis는 DAVID를 이용.

싱겁긴 하지만 일단은 여기까지.

Thursday, June 23, 2011

Epigenetic Predictor of Age

어제 plos one에 epigenetic predictor of age 란 제목으로 논문이 나왔다. 제목에서 느낄수 있듯이 DNA methylation pattern으로 나이를 예측할 수 있다는 내용의 논문이다. 재밌지 않은가? 물론 여느 연구자들은 당연한거 아닌가란 반응을 할테지만(내가 만나본 대부분의 researcher들은 남들이 뭔가를 발표하면 거 뭐 당연한거 아닌가라는 반응을 많이 한다) methylation pattern과 나이에 상관관계가 있다는 사실을 증명한건데. 논문 보기 전에 생각을 해보면.. 그렇다면 노화랑 methylation이랑 연관이 있다는 거고.. 좀더 과장되서 생각해보면 나이든 사람이 보통 cancer와 같은 complex disease에 많이 걸리는데 어떻게 보면 methylation이 이와 같은 것에 연관이 있는게 아닌가(이 역시 물론이지만). 여튼 왠지 흥미를 유발하는 논문이다.
abstract를 보면.. 
21살에서 55살까지의 34쌍의 남자 일란성 쌍둥이의 침에서 부터 나이와 correlation이 높은 80여개의 유전자의 내부나 근처의 88개의 methylation site를 찾았다. 이 중 3개의 유전자의 promoter 부위의 methylation pattern을 다른 샘플을 통해 validation 했다. 이들 loci에서부터 단 2개의 cytosine을 가지고 regression model을 만들고 나이를 예측했는데 나름 잘 맞나보다(생각보다 완전 정확한거 같진 않다). 이들은 이를 법의학에서 사용될 수있고 의학적으로 겉으로 보이는 나이가 아니라 실제 신체나이로 이를 사용할 수 있지 않나라고 마무리를 짓는다.