신호 품질 향상 (Signal Quality Enhancement) 1. 개요 신호 품질 향상(Signal Quality Enhancement), 특히 음성 분야에서의 음성 향상(Speech Enhancement)이란 입력된 음성 신호에서 불필요한 잡음을 제거하고 왜곡을 보정하여, 신호의 명료도를 높이고 원래의 깨끗한 음성(Clean Speech)에 가깝게…
검색 결과
"Mel-spectrogram"에 대한 검색 결과 (총 5개)
OpenAI Whisper OpenAI에서 개발한 오픈소스 자동 음성 인식(Automatic Speech Recognition, ASR) 모델입니다. 방대한 양의 다국어 및 다중 작업 웹 데이터를 학습하여 음성 인식, 언어 식별, 그리고 영어 번역 기능을 통합적으로 제공합니다. 특징 다국어 지원: 수십 개의 언어를 인식하고 처리할 수 있으며, 다양한 언어의…
DeepSpeech 개요 DeepSpeech는 머신러닝 기반의 오픈소스 음성 인식(Speech-to-Text) 엔진으로, 원래 구글의 연구팀에서 개발한 딥러닝 음성 인식 기술(Deep Speech)을 기반으로 하며, 현재는 Mozilla Foundation에서 주도적으로 개발 및 유지보수 중인 프로젝트이다. DeepSpeech는 전통적인 음성 인식 시스템에…
음향 모델 개 음향 모델Acoustic Model) 음성 인식 시템의 핵심 요소 중 하나, 입력된 음성 신호를 음소(phoneme) 소리 단위 변환하는 역할을 수행한다. 음성 인식은 인간의 언를 기계가할 수 있도록 음성를 텍스트로환하는 기술, 이 과정에서향 모델은 소리와 언 단위 사이의 매을 담당한다 즉, 사람이 말한리를 듣고 "어떤 음들이 연속해서 발화되…
시간 영역 정규 시간 영역 정규(Time Domain Normalization, T)는 음성식 시스템에서 음성 신호의 시간적 변동성을 보정하기 위한 전처리 기법 중 하나이다. 인간의 발화 속도는 상, 감정, 개인 차이 등에 따라 크게 달라질 수 있으며, 이로 인해 동일한 단어나 문장이라도 길이가 다르게 나타날 수 있다. 시간 영역 정규화는 이러한 시간적 불…