Showing posts with label NAR. Show all posts
Showing posts with label NAR. Show all posts

Thursday, July 28, 2011

The Sanger FASTQ file format for sequences with quality scores, and the Solexa/Illumina FASTQ variants

FASTQ 형식이 여러가지다. bowtie를 돌릴 때도 --phred33-quals, --phred64-quals, --solexa-quals, --solexa1.3-quals 네가지를 인자로 받는다(default 가 --phred33-quals이고, solexa1.3과 phred64는 동일하다). 이 논문을 전에 본적이 있는데 대충 봐서.. 기억이 안나는 관계로 확실하게 하기 위해 다시 보기로 한다.


<PHRED scores and the qual format>
PHRED 라는 프로그램이 있는데 이는 DNA sequencing trace file을 input으로 받아서 base calling을 하고 거기에 대한 quality를 할당한다. 
여기서 Pe는 estimated probability of error. 이를 PHRED는 QUAL format 파일로 저장하는데 이는 fasta와 비슷한 형식으로 아래와 같다.
이 PHRED score는 사실상 base quality를 표현하는데 표준이 되었다. 이는 SAM, ACE, FASTQ에서 사용된다.


<Sanger FASTQ format>
FASTQ format은 sanger 센터에서 만들어 졌단다. 뭐 파일 형식이 어떻고를 떠나서 여기서는 어떻게 quality score가 string으로 encode 되는지에 초점을 맞춘다. 초창기 FASTQ format을 사용했던 Sanger capillary sequencing은 바로 위의 PHRED quality score를 따른다. 그리고 나서 이 score를 single character로 변환해서 파일에 담는데 이때 charater로 ASCII 33-126 번까지의 문자를 이용한다. 곧 표현 가능한 quality score가 0-93. OBF project (Open Bioinformatics Foundation)은 이 format의 이름을  fastq-sanger 라 한다.


<Solexa FASTQ format>
2004년에 Solexa Inc. 에서 소개한 FASTQ format. solexa quality score는 아래와 같다.
phred quality와 solexa quality 간의 변환 공식은 다음과 같다.
solexa score는 -5부터 값을 갖을수 있기에 64를 offset으로 정해서 ASCII 59-126 까지를 쓰는 것으로 한다. OBF projects에서는 이 format을 'fastq-solexa' 라고 한다.


<Illumina 1.3+ FASTQ format>
solexa가 Illumina로 팔리고 나서 GA(Genome Analyzer Piepine) 버젼 1.3 이후로는 solexa score 대신에 phred score를 쓰기 시작한다. 그러나 다른 점이 64를 offset으로 한다는 것. phred score로 범위가 0-62 값을 갖을 수 있으나 현재는 0-40 까지의 값만 사용한다.OBF project에서는 이를 'fastq-illumina'라고 한다.

Wednesday, May 18, 2011

Genome-wide evidence for local DNA methylation spreading from small RNA-targeted sequence in Arabidopsis

논문은 여기


abstract를 보자면..
TEs(transposable elements)의 genome 상의 이동(?)은 일반적으로 악영향을 미치기 때문에 강하게 억제되어 있는데, 이 억제 기작이 DNA methylation과 연관이 있다. 이것이 어떻게 연관되어 있는 알아보기 위해 arabidopsis에서 TE sequence를 새로 annotation 하고 1bp resolution의 DNA methylation 정보를 가져와서 분석해봤단다.  결과는 대부분의 TEs가 methylation되어 있으나 그래도 상당부분(~26%)는 methylation되어 있지 않았다. 그리고 methylated 된 TEs의 시퀀스 중 CG,CHG,CHH에서 methylation이 많이 되어 있었는데 이 부분에 매치되는 siRNA가 없는 걸로 보아서는  RdDM1(RNA-directed DNA methylation) 기작의 타겟은 아닌 거 같단다. 그리고 siRNA의 타겟이 아닌 methylated TEs는 siRNA target인 methylated TEs의 옆에 위치하는 걸로 보이고(아래 그림) 또 이것의 끝부분으로 갈수록 methylation이 강하게 되어 있는걸로 보아 local spreading of DNA methylation from siRNA-targeted TE sequences 가 있는게 아니냐. 곧 siRNA의 타겟이 아니더라고 siRNA의 타겟인 것으로 부터 methylation이 퍼져서 된게 아니냐 뭐 이런 가정인듯 한거 같은데.. 아하.. 그리고 이 가설의 또 하나의 evidence로 제시한게.. gene 가까이에 methylated 혹은 unmethylated TEs가 많은 경향이 있는데 methylated siRNA-targeted TEs는 그런 경향이 보이지 않는다. 곧 siRNA의 target이면서 methylated 된 TEs는 gene 주변에 없더라. 이건 아마도 이 논문의 가설 그러니까 siRNA-targeted TE로 부터의 methylation이 퍼지게 됨으로 해서 유전자의 promoter까지 methylation이 되니까 expression에 negative impact가 있게 되니까.. 이걸 방지 할려고 없는거 아니냐.. 뭐 이런 말인듯..


위 그림은 어떻게 보는거냐면 가운데 TE sequence라고 써져 있는데 siRNA의 target이 아닌TEs고 그것의 5' and 3'쪽에 siRNA target인 TEs를 그려넣은 것이고 위의 n 수가 써져 있는 막대 바 read 갯수(normalized 한듯, read가 커버하는 cytosine 갯수로 나눴단다)를 나타낸것. 보시다 시피 siRNA의 타겟에서 부터 아닌 TE로 오면서 methylation 경향이 감소한다. 곧 spreading 하는 것처럼 보인다.


음.. 사실 methylation 들어갔길래 봤는데... 바로 건질건 별로 없어 보이긴 한다. 다만 왜 TEs 부위의 methylation을 봐야 하는지 이유가 될 듯.




--------------------------------------reference--------------------------------------


1.RdDM : dsRNA's (small double-stranded RNAs) 가 complementary 한 DNA의 methylation을 유도하는 것으로 dsRNAs가 Ago4 와 SUVH histone methyltransferase 와 함께 H3K9을 di-methylation 시키면 이 dimethyated H3K9에 cytosine methyltransferase CMT3가 붙어서 cytosine을 methylation 시킨다는 것. 헐.. 그러니까 dsRNA가 histone 을 methylation 하고 histone이 methylation되면 CMT3가 붙고 이것이 DNA를 methylation 시킨다는 것. 이건 arabidopsis에서 발견 되었고 이 marks(H3K9, DNA methylation)은 gene silencing의 mark라고.