DALL·E 1. 개요 DALL·E는 [[OpenAI]]가 개발한 텍스트-투-이미지(Text-to-Image) 생성 모델로, 사용자가 입력한 자연어 설명(프롬프트)을 해석하여 이에 부합하는 고해상도 이미지를 생성하는 인공지능 시스템이다. 이 모델의 핵심 목적은 인간의 언어적 개념을 시각적 표현으로 정밀하게 변환함으로써 창작 활동의 효율성을 높이고, 새로운 …
검색 결과
검색어를 입력하세요.
다중 모달 분석 (Multimodal Analysis) 1. 개요 다중 모달 분석(Multimodal Analysis)이란 텍스트, 이미지, 오디오, 비디오, 센서 데이터 등 서로 다른 형태의 데이터 양식(Modality, 모달리티)을 통합적으로 처리하여 정보의 의미를 추출하고 분석하는 인공지능 기술이다. 인간이 시각, 청각, 촉각 등 다양한 감각 기관을 …
Stable Diffusion Stable Diffusion(스테이블 디퓨전)은 텍스트 설명(text prompt)을 바탕으로 고품질의 디지털 이미지를 생성하는 딥러닝 기반의 생성형 인공지능 모델입니다. 2022년 독일의 스태빌리티 AI(Stability AI)와 라이덴 대학교, 컴팩트 랩스(CompVis)가 공동으로 개발하여 공개했으며, 현재 가장 널리 …
Zero-Shot 분류 개요 Zero-shot 분류(Zero-Shot Classification, ZSC)는 머신러닝 및 인공지능 분야에서 훈련 데이터에 포함되지 않은 새로운 클래스를 식별하고 범주화하는 기술입니다. 기존 지도 학습이 레이블이 명시된 데이터를 통해 모델을 최적화하는 것과 달리, zero-shot 분류는 모델이 테스트 시점에 처음 접하는 미지…
CLIP: 컨텍스트 기반 다중 모달 모델 개요 CLIPContrastive Language–Image Pre-training)은 OpenAI에서 2021에 발표한 티모달 인공지능 모델로, 이미지와 텍스트 간의 관계를 학습하여 시각적 정보와 언어 정보를 동시에 이해하는 능력을 갖춘 대표적인 모델입니다. CLIP은 전통적인 컴퓨터 비전 모델과 달리, 특정 태스…