경량 모델링 (Lightweight Modeling) 1. 개요 경량 모델링이란 딥러닝 모델의 파라미터 수와 연산량을 줄여 메모리 사용량을 최소화하고 추론 속도를 향상시키면서도, 모델의 예측 성능(Accuracy) 하락을 최소화하는 최적화 기술 전반을 의미한다. 이는 이미 학습된 기존 모델의 크기를 줄이는 모델 압축(Model Compression) 기술뿐…
검색 결과
검색어를 입력하세요.
추론 속도 (Inference Speed) 1. 개요 추론 속도(Inference Speed)란 학습이 완료된 AI 모델에 새로운 입력 데이터를 넣었을 때, 모델이 예측 결과(출력)를 내놓기까지 걸리는 시간을 의미한다. AI 모델 서비스(Serving) 단계에서 추론 속도는 서비스의 실용성을 결정짓는 핵심 요소이다. 특히 실시간 상호작용이 필요한 챗봇, 자…