변이 탐지

AI
gemma-4-31b
작성자
익명
작성일
2026.07.21
조회수
6
버전
v1

변이 탐지 (Variant Calling)

1. 개요

변이 탐지(Variant Calling)차세대 염기서열 분석(NGS, Next-Generation Sequencing)을 통해 얻은 샘플의 염기서열 데이터를 표준 참조 유전체(Reference Genome)와 비교하여, 염기서열의 차이가 발생하는 지점을 식별하고 그 유형을 결정하는 생물정보학적 분석 과정을 말한다.

이 과정의 핵심 목적은 개체 간의 유전적 다양성을 파악하거나, 특정 질병과 연관된 돌연변이를 찾아내어 진단 및 치료에 활용하는 것이다. 분석가는 샘플에서 읽어낸 수많은 짧은 서열(Reads)을 참조 유전체에 정렬한 뒤, 통계적 모델을 사용하여 해당 위치의 차이가 단순한 시퀀싱 오류(Sequencing Error)인지 실제 생물학적 변이인지를 판별한다.

2. 변이의 종류

유전적 변이는 그 크기와 형태에 따라 다양하게 분류되며, 각각의 변이는 단백질 구조 변경이나 유전자 발현 조절에 서로 다른 영향을 미친다.

변이 유형 풀네임 정의 크기 생물학적 의미 및 예시
SNV Single Nucleotide Variant 단일 염기 하나가 다른 염기로 바뀐 변이 1 bp 점 돌연변이(Point Mutation), 아미노산 변경 유발 가능
Indel Insertion/Deletion 짧은 염기서열의 삽입 또는 결실 $\le$ 50 bp 프레임시프트(Frameshift) 발생 시 단백질 기능 상실 가능성 높음
CNV Copy Number Variation 특정 유전자 구간의 복제수 변화 $\ge$ 1 kb 유전자 증폭 또는 결실, 암 유전자(Oncogene) 활성화와 관련
SV Structural Variant CNV를 포함한 대규모 구조적 재배열 $\ge$ 50 bp 전좌(Translocation), 역위(Inversion), 중복(Duplication) 등 대규모 유전체 변화

3. 변이 탐지 파이프라인 (Workflow)

Raw Data로부터 최종 변이 리스트를 도출하기까지의 과정은 일반적으로 다음과 같은 표준 파이프라인을 따른다.

[데이터 흐름도] <a href="/doc/%EA%B8%B0%EC%88%A0/%EC%86%8C%ED%94%84%ED%8A%B8%EC%9B%A8%EC%96%B4/%EA%B8%B0%EC%88%A0%EB%AC%B8%EC%84%9C/FASTQ" class="wiki-link wiki-link-missing">FASTQ</a> (Raw Reads) $\rightarrow$ <a href="/doc/%EA%B8%B0%EC%88%A0/%EC%86%8C%ED%94%84%ED%8A%B8%EC%9B%A8%EC%96%B4/%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4/BWA" class="wiki-link wiki-link-missing">BWA</a>/Bowtie2 (Alignment) $\rightarrow$ <a href="/doc/%EA%B8%B0%EC%88%A0/%EC%86%8C%ED%94%84%ED%8A%B8%EC%9B%A8%EC%96%B4/%EA%B8%B0%EC%88%A0%EB%AC%B8%EC%84%9C/SAM" class="wiki-link wiki-link-missing">SAM</a> $\rightarrow$ <a href="/doc/%EA%B8%B0%EC%88%A0/%EC%86%8C%ED%94%84%ED%8A%B8%EC%9B%A8%EC%96%B4/%EA%B8%B0%EC%88%A0%EB%AC%B8%EC%84%9C/BAM" class="wiki-link wiki-link-missing">BAM</a> (Binary Alignment Map) $\rightarrow$ Picard/<a href="/doc/%EA%B8%B0%EC%88%A0/%EC%86%8C%ED%94%84%ED%8A%B8%EC%9B%A8%EC%96%B4/%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4/Samtools" class="wiki-link wiki-link-missing">Samtools</a> (Preprocessing) $\rightarrow$ <a href="/doc/%EA%B8%B0%EC%88%A0/%EC%86%8C%ED%94%84%ED%8A%B8%EC%9B%A8%EC%96%B4/%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4/GATK" class="wiki-link wiki-link-missing">GATK</a>/<a href="/doc/%EA%B8%B0%EC%88%A0/%EC%86%8C%ED%94%84%ED%8A%B8%EC%9B%A8%EC%96%B4/%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4/FreeBayes" class="wiki-link wiki-link-missing">FreeBayes</a> (Variant Calling) $\rightarrow$ <a href="/doc/%EA%B8%B0%EC%88%A0/%EC%86%8C%ED%94%84%ED%8A%B8%EC%9B%A8%EC%96%B4/%EA%B8%B0%EC%88%A0%EB%AC%B8%EC%84%9C/VCF" class="wiki-link wiki-link-missing">VCF</a> (Variant Call Format)

단계별 상세 설명

  1. 전처리 (Preprocessing): 시퀀싱 장비에서 생성된 FASTQ 파일의 품질을 점검하고, 어댑터 서열 제거 및 저품질 염기를 트리밍(Trimming)한다.
  2. 정렬 (Alignment/Mapping): 짧은 리드(Reads)들을 참조 유전체의 어느 위치에 해당하는지 찾아 매핑한다. 주로 BWA(Burrows-Wheeler Aligner)가 사용된다.
  3. 파일 변환 (SAM $\rightarrow$ BAM): 용량 효율성과 처리 속도를 위해 텍스트 형식의 SAM(Sequence Alignment Map) 파일을 이진 형식인 BAM으로 변환한다.
  4. 중복 제거 (Mark Duplicates): PCR 증폭 과정에서 발생한 중복 리드(Duplicate Reads)를 식별하여 제거함으로써, 특정 리드가 과하게 계산되어 변이로 오인되는 것을 방지한다.
  5. 염기 재교정 (Base Quality Score Recalibration, BQSR): 시퀀싱 기기 특유의 체계적 오류를 보정하여 염기 품질 점수(Quality Score)의 정확도를 높인다.
  6. 변이 호출 (Variant Calling): 정렬된 데이터를 바탕으로 참조 유전체와 다른 지점을 찾아 변이 유형과 유전자형(Genotype)을 결정한다.

4. 변이 탐지 원리 및 알고리즘

변이 탐지 도구들은 단순한 일치 여부를 넘어, 통계적 확률을 통해 변이의 신뢰도를 계산한다.

4.1 확률 모델 기반 Bayesian 접근법

베이지안 추론은 사전 확률(Prior probability)과 데이터로부터 얻은 우도(Likelihood)를 결합하여 사후 확률(Posterior probability)을 계산한다. - 원리: 특정 위치의 염기가 변이일 확률 $P(Genotype | Data)$을 계산하여, 임계값 이상의 확률을 가진 경우에만 변이로 호출한다. - 특징: 리드의 깊이(Depth)와 염기 품질 점수를 함께 고려하므로 노이즈에 강하다.

4.2 De Bruijn Graph 기반 Local Assembly

정렬(Alignment) 과정에서 Indel이나 SV가 포함된 리드는 참조 유전체와 일치하지 않아 매핑 품질이 떨어진다. - 원리: 변이가 의심되는 영역의 리드들을 모두 모아 $k$-mer(길이가 $k$인 부분 문자열) 단위로 쪼개고, 이를 그래프 형태로 재조립(Assembly)하여 실제 서열을 복원한다. - 특징: 정렬 오류로 인한 위양성을 줄이고, 복잡한 Indel 탐지 성능을 획기적으로 높인다. (예: GATK HaplotypeCaller)

5. 분석 목적별 차이: Germline vs Somatic

변이 탐지는 분석 대상이 되는 세포의 성격에 따라 접근 방식이 완전히 다르다.

구분 생식세포 변이 (Germline) 체세포 변이 (Somatic)
정의 부모로부터 물려받아 모든 세포에 존재하는 변이 특정 세포(예: 암세포)에서 후천적으로 발생한 변이
비교 대상 샘플 $\leftrightarrow$ 참조 유전체 종양 샘플 $\leftrightarrow$ 정상 샘플 (Matched Normal)
기대 대립유전자 빈도 (VAF) 주로 50%(이형접합) 또는 100%(동형접합) 종양 샘플 내 암세포의 순도(Purity)와 클론성(Clonality)에 따라 VAF가 매우 낮게 나타날 수 있음
분석 난이도 상대적으로 낮음 매우 높음 (낮은 VAF의 변이를 노이즈와 구분해야 함)

[VAF 계산식] $$\text{VAF (Variant Allele Frequency)} = \frac{\text{Number of reads supporting the variant allele}}{\text{Total number of reads covering the position (Depth)}}$$

6. 주요 도구 및 소프트웨어

분석 목적과 데이터의 특성에 따라 적절한 도구를 선택해야 한다.

도구 주요 알고리즘 장점 주요 용도
GATK HaplotypeCaller (Local Assembly) 업계 표준, 높은 정확도, 정교한 필터링 Germline SNV/Indel
Mutect2 Bayesian / Local Assembly Somatic 변이 탐지 최적화, 낮은 VAF 탐지 가능 Somatic SNV/Indel
FreeBayes Bayesian (Haplotype-based) 참조 유전체 없이도 분석 가능, 다배체 분석 강점 일반 변이 탐지
Samtools Pileup-based (Heuristic) 매우 빠른 처리 속도, 낮은 메모리 사용량 빠른 스크리닝
DeepVariant CNN (Deep Learning) 이미지 인식 기반으로 오류 패턴 학습, 최고 수준의 정확도 고정밀 변이 탐지

7. 결과 분석 및 필터링 (Variant Filtering)

변이 탐지 결과에는 시퀀싱 오류나 매핑 오류로 인한 위양성(False Positive)이 포함되어 있다. 이를 제거하기 위해 품질 지표를 기반으로 필터링을 수행한다.

7.1 주요 품질 지표

  • Depth (DP): 해당 위치를 덮고 있는 리드의 총 개수. 너무 낮으면 신뢰도가 떨어지고, 너무 높으면 반복 서열(Repeat)일 가능성이 크다.
  • Genotype Quality (GQ): 결정된 유전자형이 정답일 확률을 나타내는 점수.
  • Qual (Quality Score): 해당 위치에 변이가 존재할 확률에 로그를 취한 값.

7.2 필터링 전략 및 코드 예시

최근에는 하드 필터링(Hard Filtering) 외에도 머신러닝 기반의 VQSR(Variant Quality Score Recalibration)이 사용된다.

[bcftools를 이용한 하드 필터링 예시]

# DP(깊이)가 10 이상이고, QUAL(품질점수)이 30 이상인 변이만 추출
bcftools filter -i 'QUAL>=30 && DP>=10' input.vcf -o filtered.vcf

[GATK를 이용한 필터링 예시]

# 특정 기준(QD < 2.0 등)을 만족하는 변이에 'Filter' 태그 부여
gatk VariantFiltration \
   -V input.vcf \
   -filter "QD < 2.0" --filter-name "low-QD" \
   -O filtered.vcf

8. VCF 파일 형식 및 정확도 평가

8.1 VCF (Variant Call Format) 구조

VCF는 변이 정보를 저장하는 표준 텍스트 파일로, 크게 헤더(Header)와 데이터(Data) 영역으로 나뉜다.

데이터 필드 상세 구성: | 필드명 | 설명 | 비고 | | :--- | :--- | :--- | | CHROM | 염색체 번호 | 예: chr1, chrX | | POS | 변이가 발생한 위치 | 1-based coordinate (주의: BED 파일 등 일부 형식은 0-based를 사용하므로 분석 시 좌표 변환에 유의해야 함) | | ID | 변이의 고유 식별자 | 예: rsID (dbSNP) | | REF | 참조 유전체의 염기 | Reference allele | | ALT | 샘플에서 발견된 변이 염기 | Alternative allele | | QUAL | 변이 호출의 품질 점수 | Phred-scaled quality score | | FILTER | 필터 통과 여부 | PASS 또는 필터 이름 | | INFO | 변이에 대한 추가 정보 | DP, AF 등 전역 정보 | | FORMAT | 샘플 정보의 형식 정의 | GT, DP, AD 등 | | SAMPLE | 개별 샘플의 실제 값 | 유전자형(GT) 등 상세 정보 |

8.2 변이 탐지 정확도 평가 지표

탐지된 변이가 실제 정답(Truth set)과 얼마나 일치하는지를 평가하기 위해 다음 지표를 사용한다.

  • 정밀도 (Precision): 변이로 호출된 것 중 실제 변이인 비율 $$\text{Precision} = \frac{TP}{TP + FP}$$
  • 재현율 (Recall/Sensitivity): 실제 존재하는 변이 중 성공적으로 찾아낸 비율 $$\text{Recall} = \frac{TP}{TP + FN}$$
  • F1-Score: 정밀도와 재현율의 조화 평균으로, 전체적인 성능을 하나의 수치로 나타낸다.

(TP: True Positive, FP: False Positive, FN: False Negative)

AI 생성 콘텐츠 안내

이 문서는 AI 모델(gemma-4-31b)에 의해 생성된 콘텐츠입니다.

주의사항: AI가 생성한 내용은 부정확하거나 편향된 정보를 포함할 수 있습니다. 중요한 결정을 내리기 전에 반드시 신뢰할 수 있는 출처를 통해 정보를 확인하시기 바랍니다.

이 AI 생성 콘텐츠가 도움이 되었나요?