ORC (Optimized Row Columnar) 1. 개요 ORC(Optimized Row Columnar)는 Apache Hive를 위해 설계된 고성능 열 지향(Columnar) 저장 형식으로, 대규모 데이터 세트에 대해 효율적인 압축과 빠른 읽기 성능을 제공하는 바이너리 파일 포맷입니다. 빅데이터 환경에서는 수 페타바이트(PB) 이상의 데이터를 처리…
검색 결과
"벤치마크"에 대한 검색 결과 (총 85개)
V-SLAM (Visual Simultaneous Localization and Mapping) 1. 개요 V-SLAM(Visual Simultaneous Localization and Mapping)은 카메라를 통해 획득한 시각 정보만을 이용하여 로봇이나 장치가 자신의 현재 위치를 추정(Localization)함과 동시에 주변 환경의 지도(Mapping)…
의미 왜곡 방지 (Prevention of Semantic Distortion) 1. 개요 의미 왜곡 방지란 생성형 AI 및 자연어 처리(NLP) 모델이 텍스트를 생성, 요약, 번역하는 과정에서 입력된 원문의 핵심 의미나 의도를 변형시키지 않고 정확하게 유지하도록 제어하는 기술적 접근을 의미한다. 대규모 언어 모델(LLM)은 확률적으로 다음 토큰을 예측하는…
XLM-R (Cross-lingual Language Model-RoBERTa) 1. 개요 XLM-R(Cross-lingual Language Model-RoBERTa)은 Facebook AI Research(FAIR)에서 개발한 대규모 다국어 사전 훈련 언어 모델로, 단일 모델 내에서 100개 이상의 언어를 동시에 처리할 수 있도록 설계된 Transfor…
대규모 언어 모델 (Large Language Model, LLM) 1. 개요 대규모 언어 모델(Large Language Model, 이하 LLM)은 방대한 양의 텍스트 데이터를 학습하여 인간과 유사한 자연어를 이해하고 생성할 수 있도록 설계된 거대 인공 신경망 모델이다. LLM은 수십억 개 이상의 파라미터(Parameter, 모델 내부의 가중치로 학습을…
어휘 확장자연어처리(NLP, Natural Language Processing) 모델 성능은 모델이 이해하고 처리할 수 있는 어휘의 범위에 크게 영향을 받습니다. 특히 언어는 지속적으로 진화하고, 새로운 단어, 줄임말, 신조어, 전문 용어 등이 등장하기 때문에, 모델의 어휘가 고정되어 있을 경우 성능 저하가 불가피합니다. 어휘 확장(Vocabulary Ex…
Generic Receive Offload (GRO) 1. 개요 Generic Receive Offload (GRO)는 네트워크 인터페이스 카드(NIC)를 통해 수신되는 다수의 작은 TCP 세그먼트들을 상위 네트워크 스택으로 전달하기 전에 하나의 큰 패킷으로 병합하여 처리하는 네트워크 최적화 기술이다. 현대 고속 네트워크 환경에서 패킷 하나하나를 개별적으로…
화자 인식 (Speaker Recognition) 1. 개요 화자 인식(Speaker Recognition)이란 입력된 음성 신호를 분석하여 해당 음성을 생성한 사람이 누구인지 식별하는 생체 인식 기술이다. 이 기술의 핵심 목적은 음성 속에 포함된 화자의 고유한 생체적 특성(성대 구조, 구강 구조 등)과 습관적 특성(말투, 억양 등)을 추출하여 특정 개인을…
WER (Word Error Rate, 단어 오류율) 1. 개요 WER(Word Error Rate, 단어 오류율)은 자동 음성 인식(ASR, Automatic Speech Recognition) 및 기계 번역 시스템의 성능을 측정하기 위해 사용되는 표준 지표로, 정답(Reference)과 결과(Hypothesis) 사이의 단어 단위 차이를 수치화한 것입니…
SymPy 개요 SymPy는 파이썬(Python) 언어로 작성된 오픈소스 심볼릭 연산(Symbolic Computation) 라이브러리입니다. 일반적인 계산기가 숫자를 입력받아 결과값을 산출하는 것과 달리, SymPy는 수학적 기호(Symbol)를 그대로 유지하며 수식을 조작하고 해결하는 컴퓨터 대수 시스템(Computer Algebra System, CA…
래퍼 클래스 (Wrapper Class) 1. 개요 래퍼 클래스(Wrapper Class)란 Java의 8가지 기본 타입(Primitive Type) 데이터를 객체로 다루기 위해 이를 '감싸는(Wrap)' 형태의 클래스를 의미합니다. Java는 성능 향상을 위해 스택(Stack) 영역에 값을 직접 저장하는 기본 타입을 제공하지만, 객체 지향 언어로서의 특성…
데이터 형식 변환 (Data Format Conversion) 1. 개요 데이터 형식 변환이란 특정 소프트웨어나 시스템에서 생성된 데이터의 구조와 표현 방식(Format)을 다른 시스템이나 애플리케이션에서 인식하고 처리할 수 있는 다른 형식으로 변경하는 과정을 의미한다. 현대의 데이터 생태계는 다양한 언어와 플랫폼으로 구성되어 있어, 서로 다른 시스템 간의…
다중 모달 분석 (Multimodal Analysis) 1. 개요 다중 모달 분석(Multimodal Analysis)이란 텍스트, 이미지, 오디오, 비디오, 센서 데이터 등 서로 다른 형태의 데이터 양식(Modality, 모달리티)을 통합적으로 처리하여 정보의 의미를 추출하고 분석하는 인공지능 기술이다. 인간이 시각, 청각, 촉각 등 다양한 감각 기관을 …
패리티 모델 (Parity Model) 1. 개요 패리티 모델(Parity Model)은 사용되는 맥락에 따라 크게 두 가지 서로 다른 의미로 정의됩니다. [컴퓨터 과학: 오류 검출]: 데이터 전송 중 발생하는 비트 오류를 검출하기 위해 데이터의 짝수/홀수 성질(동등성)을 이용하는 논리적 모델입니다. 주로 패리티 비트(Parity Bit) 개념으로 활용됩니…
추론 속도 (Inference Speed) 1. 개요 추론 속도(Inference Speed)란 학습이 완료된 AI 모델에 새로운 입력 데이터를 넣었을 때, 모델이 예측 결과(출력)를 내놓기까지 걸리는 시간을 의미한다. AI 모델 서비스(Serving) 단계에서 추론 속도는 서비스의 실용성을 결정짓는 핵심 요소이다. 특히 실시간 상호작용이 필요한 챗봇, 자…
AMD Instinct MI300 1. 개요 AMD Instinct MI300은 AMD가 설계한 데이터센터용 고성능 컴퓨팅(HPC) 및 인공지능(AI) 가속기로, 차세대 CDNA 3 아키텍처를 기반으로 한 칩렛(Chiplet) 설계의 정점을 보여주는 제품군이다. 본 제품은 거대 언어 모델(LLM)의 학습 및 추론, 복잡한 과학적 시뮬레이션 등 막대한 연산량…
도메인 적합성 (Domain Suitability) 1. 개요 도메인 적합성(Domain Suitability)이란 인공지능 모델이 특정 분야(Domain)의 지식, 용어, 문맥 및 관습을 정확하게 이해하고 이를 바탕으로 해당 분야의 요구사항에 부합하는 결과물을 생성하는 능력을 의미한다. 일반적인 AI 모델 평가에서 사용되는 정확도(Accuracy), F1…
ELECTRA 개요 ELECTRA(Efficiently Learning an Encoder that Classifies Token Replacements Accurately)는 2020년 구글 리서치(Google Research) 팀이 제안한 자연어 처리(NLP) 기반 사전 학습(pre-training) 방법론입니다. 기존 BERT 모델에서 널리 사용되던 …
BERT (Bidirectional Encoder Representations from Transformers) BERT(Bidirectional Encoder Representations from Transformers)는 Google AI Language 팀에서 개발한 언어 이해를 위한 양방향 사전 학습 모델입니다. 기존의 언어 모델들이 텍스트를 왼쪽에…
Basic Linear Algebra Subprograms Basic Linear Algebra Subprograms(BL)는 선형대수 계을 위한 기본적인 연산들을 표화한 인터페이스 사양이다. BLAS는 벡터와렬의 덧셈 스칼라 곱, 내적, 행렬-벡터 곱, 행렬-행렬 곱 등과 같은 수치 선형대수의 핵심 연산들을 정의하며, 과학 계산, 머신러닝, 공학 시뮬레이…