C4 (Colossal Clean Crawled Corpus) 개요 C4 (Colossal Clean Crawled Corpus)는 구글(Google)이 T5(Text-to-Text Transfer Transformer) 모델의 사전 학습(Pre-training)을 위해 구축한 대규모 정제 텍스트 데이터셋이다. 웹상의 방대한 데이터를 수집하는 Common …
검색 결과
"mT5"에 대한 검색 결과 (총 2개)
XLM-R (Cross-lingual Language Model-RoBERTa) 1. 개요 XLM-R(Cross-lingual Language Model-RoBERTa)은 Facebook AI Research(FAIR)에서 개발한 대규모 다국어 사전 훈련 언어 모델로, 단일 모델 내에서 100개 이상의 언어를 동시에 처리할 수 있도록 설계된 Transfor…