추론 속도 (Inference Speed) 1. 개요 추론 속도(Inference Speed)란 학습이 완료된 AI 모델에 새로운 입력 데이터를 넣었을 때, 모델이 예측 결과(출력)를 내놓기까지 걸리는 시간을 의미한다. AI 모델 서비스(Serving) 단계에서 추론 속도는 서비스의 실용성을 결정짓는 핵심 요소이다. 특히 실시간 상호작용이 필요한 챗봇, 자…
검색 결과
"vLLM"에 대한 검색 결과 (총 2개)
AMD Instinct MI300 1. 개요 AMD Instinct MI300은 AMD가 설계한 데이터센터용 고성능 컴퓨팅(HPC) 및 인공지능(AI) 가속기로, 차세대 CDNA 3 아키텍처를 기반으로 한 칩렛(Chiplet) 설계의 정점을 보여주는 제품군이다. 본 제품은 거대 언어 모델(LLM)의 학습 및 추론, 복잡한 과학적 시뮬레이션 등 막대한 연산량…