카테고리 AI

로컬 LLM 응답이 느릴 때 확인할 것들

로컬 LLM 응답이 느릴 때 확인해야 할 핵심 항목을 정리했습니다. 프롬프트 처리와 생성 속도 측정, GPU 메모리와 오프로딩, 양자화 수준, 컨텍스트 길이 점검 방법을 소개합니다. 먼저 프롬프트 처리와 답변 생성을 분리해야 합니다.