유전자 발현 데이터

AI
gemma-4-31b
작성자
익명
작성일
2026.08.13
조회수
6
버전
v1

유전자 발현 데이터 (Gene Expression Data)

1. 개요

유전자 발현 데이터란 특정 시점에서 세포 내에 존재하는 mRNA의 상대적/절대적 양을 수치화한 데이터이다.

생물체는 모든 세포가 동일한 게놈(Genome, 전체 유전 정보)을 가지고 있지만, 세포의 종류나 환경, 질병 상태에 따라 활성화되는 유전자가 다르다. 이러한 전체 RNA 집합을 전사체(Transcriptome)라고 하며, 전사체의 상태를 분석함으로써 세포의 현재 생물학적 상태, 기능적 변화, 그리고 질병의 진행 과정을 분자 수준에서 파악할 수 있다.

2. 데이터 생성 원리 및 측정 방법

유전자 발현을 측정하는 방법은 크게 하이브리다이제이션(Hybridization) 기반의 마이크로어레이와 서열 분석 기반의 RNA-Seq으로 나뉜다.

2.1 Microarray

미리 합성된 DNA 프로브(Probe)가 고정된 칩 위에 샘플 RNA를 결합시켜 형광 강도로 발현량을 측정하는 방식이다. 분석 속도가 빠르고 비용이 저렴하지만, 이미 알려진 유전자 서열에 대해서만 분석이 가능하다는 한계가 있다.

2.2 RNA-Seq (RNA Sequencing)

차세대 염기서열 분석(NGS, Next Generation Sequencing) 기술을 이용하여 전사된 모든 RNA의 서열을 직접 읽어내는 방식이다. 알려지지 않은 새로운 전사체(Novel transcript)를 발견할 수 있으며, 측정 범위(Dynamic range)가 매우 넓어 정밀한 정량 분석이 가능하다.

[표] RNA-Seq vs Microarray 비교

구분 Microarray RNA-Seq
원리 상보적 결합 (Hybridization) 염기서열 분석 (Sequencing)
대상 기지의 유전자 (Known genes) 전체 전사체 (Whole transcriptome)
민감도 상대적으로 낮음 매우 높음
정량 범위 제한적 (포화 현상 발생) 매우 넓음
비용/시간 저렴하고 빠름 초기 비용이 높았으나 현재는 보편화됨 / 데이터 분석(Bioinformatics) 단계의 연산 시간이 소요됨

3. 데이터 전처리 및 정규화 (Normalization)

3.1 데이터 형식 및 품질 관리 (QC)

분석 단계에 따라 다음과 같은 파일 형식이 사용된다. - FASTQ: 시퀀싱 장비에서 생성된 Raw reads 데이터 (염기서열과 품질 점수 포함) - SAM/BAM: 참조 게놈에 정렬(Alignment)된 서열 데이터 (BAM은 SAM의 이진 파일 형태) - Count Matrix: 각 샘플별 유전자 발현량이 수치로 정량화된 표 형태의 데이터

Raw 데이터(FASTQ 파일 등)를 분석에 사용하기 전, 데이터의 신뢰성을 확보하기 위한 QC 과정이 필수적이다. - Read Quality Check: FastQC 등의 도구를 사용하여 염기서열의 품질 점수(Phred score)를 확인한다. - Adapter Trimming: 시퀀싱 과정에서 붙은 어댑터 서열이나 저품질의 말단 서열을 제거한다. - Mapping/Alignment: 정제된 Read를 참조 게놈(Reference Genome)에 정렬하여 어느 유전자에서 유래했는지 확인한다.

3.2 정규화의 필요성과 방법

시퀀싱 데이터의 Raw count(단순 읽기 횟수)는 샘플마다 전체 Read 수(Library size)가 다르고, 유전자마다 길이(Gene length)가 다르기 때문에 직접 비교가 불가능하다. 이를 보정하는 과정이 정규화(Normalization)이다.

지표 계산 방식 (개념식) 특징
CPM $\frac{\text{count}}{\text{total reads}} \times 10^6$ 라이브러리 크기 차이 보정
FPKM/RPKM $\frac{\text{count}}{\text{gene length} \times \text{total reads}} \times 10^9$ 라이브러리 크기와 유전자 길이 모두 보정
TPM $\frac{\text{count}/\text{gene length}}{\sum(\text{count}/\text{gene length})} \times 10^6$ 유전자 길이 우선 보정 후 라이브러리 크기 보정, 샘플 간 비교에 가장 적합

[코드 예제] Python을 이용한 간단한 CPM 계산

import pandas as pd

# 샘플 데이터: 유전자별 Raw Count
data = {'Gene': ['GeneA', 'GeneB', 'GeneC'],
        'Sample1': [100, 500, 200],
        'Sample2': [120, 400, 250]}
df = pd.DataFrame(data).set_index('Gene')

# CPM 계산 함수
def calculate_cpm(column):
    total_reads = column.sum()
    # 1e6(1,000,000)을 곱하여 'Million' 단위의 비율로 변환
    return (column / total_reads) * 1e6

# 모든 샘플에 적용
cpm_df = df.apply(calculate_cpm)
print(cpm_df)

4. 주요 분석 기법

4.1 차등 발현 분석 (DEG, Differentially Expressed Genes)

대조군(Control)과 실험군(Case) 사이에서 통계적으로 유의미하게 발현량 차이가 나는 유전자를 찾는 분석이다. 일반적으로 $p$-value와 $\text{log}_2\text{Fold Change}$ (발현량 변화 배수)를 기준으로 선정한다.

4.2 클러스터링 및 네트워크 분석

  • 계층적 클러스터링 (Hierarchical Clustering): 발현 패턴이 유사한 유전자나 샘플을 그룹화하여 덴드로그램(Dendrogram) 형태로 시각화한다.
  • 공발현 네트워크 (Co-expression Network): 함께 발현되는 유전자들의 상관관계를 분석하여 핵심 조절 유전자(Hub gene)를 발굴한다.

5. 데이터 해석 및 생물학적 의미 부여

5.1 유전자 세트 풍부성 분석 (GSEA, Gene Set Enrichment Analysis)

개별 유전자가 아닌, 특정 기능을 공유하는 유전자 집단(Gene Set) 전체의 발현 경향을 분석하여 해당 생물학적 경로가 활성화되었는지 확인하는 방법이다.

5.2 경로 분석 (Pathway Analysis)

수치화된 데이터를 표준화된 데이터베이스에 매핑하여 생물학적 의미를 도출한다. - GO (Gene Ontology): 유전자의 기능을 생물학적 과정(BP), 세포 성분(CC), 분자 기능(MF)의 세 가지 범주로 분류하여 분석한다. - KEGG (Kyoto Encyclopedia of Genes and Genomes): 유전자 간의 상호작용을 경로(Pathway) 지도로 나타내어 대사 경로 및 신호 전달 체계를 분석한다.

6. 시각화 방법

분석 결과의 직관적인 이해를 위해 다음과 같은 시각화 도구가 사용된다. - Heatmap: 유전자와 샘플 간의 발현량을 색상으로 표현하여 전반적인 패턴을 한눈에 파악한다. - Volcano Plot: DEG 분석 결과를 시각화하는 대표적 도구로, x축에 $\text{log}_2\text{Fold Change}$, y축에 $-\text{log}_{10}(p\text{-value})$를 배치하여 통계적 유의성과 변화량이 큰 유전자를 동시에 확인한다. - PCA Plot (Principal Component Analysis): 고차원 데이터를 저차원으로 축소하여 샘플 간의 유사도와 군집화 경향을 확인한다.

7. 활용 분야 및 최신 동향

7.1 주요 활용 분야

  • 바이오마커 발굴: 특정 질병 환자에게서만 특이적으로 발현되는 유전자를 찾아 진단 키트 개발에 활용한다.
  • 약물 반응 예측: 약물 투여 전후의 발현 변화를 분석하여 약물 효능 및 부작용을 예측한다.

7.2 공개 데이터베이스

연구의 재현성과 데이터 공유를 위해 전 세계적으로 다음과 같은 저장소가 운영된다. - GEO (Gene Expression Omnibus): NCBI에서 운영하는 전 세계 최대 규모의 전사체 데이터 저장소. - TCGA (The Cancer Genome Atlas): 다양한 암종의 유전체, 전사체, 임상 데이터를 통합 제공하는 암 특화 데이터베이스.

7.3 최신 동향: 단일 세포 RNA-Seq (scRNA-seq)

기존의 Bulk RNA-Seq이 수만 개의 세포를 갈아서 평균값을 측정했다면, scRNA-seq은 개별 세포 하나하나의 전사체를 분석한다. 이를 통해 다음과 같은 고도화된 분석이 가능하다. - 세포 이질성(Heterogeneity) 파악: 동일 조직 내에서도 서로 다른 특성을 가진 세포군을 구분한다. - 희귀 세포군 발견: 전체 샘플에서는 비율이 낮아 묻혔던 소수 세포군을 식별한다. - 세포 분화 궤적(Trajectory) 추적: 가상 시간(Pseudotime) 분석을 통해 세포가 시간에 따라 어떻게 분화하고 상태가 변하는지 추적한다.


분류: 생물학 / 유전체학 / 기능 분석

AI 생성 콘텐츠 안내

이 문서는 AI 모델(gemma-4-31b)에 의해 생성된 콘텐츠입니다.

주의사항: AI가 생성한 내용은 부정확하거나 편향된 정보를 포함할 수 있습니다. 중요한 결정을 내리기 전에 반드시 신뢰할 수 있는 출처를 통해 정보를 확인하시기 바랍니다.

이 AI 생성 콘텐츠가 도움이 되었나요?