클라우드 AI에 질문하는 대신, 내 컴퓨터에서 직접 AI 언어 모델을 실행해보고 싶다면 LM Studio가 좋은 입문 도구입니다.
이 글은 Windows 또는 macOS에 LM Studio를 설치할 수 있고, 기본적인 파일 설치와 폴더 선택이 가능한 환경을 전제로 합니다. Windows는 RAM 16GB 이상과 전용 VRAM 4GB 이상을 권장하며, Apple Silicon 기반 macOS는 RAM 16GB 이상을 권장합니다. 처음에는 4B~8B급 모델부터 시작하고, 모델 크기가 커질수록 필요한 RAM과 VRAM도 늘어난다는 점을 고려합니다.
목차
LM Studio 설치와 모델 검색
LM Studio는 복잡한 명령어 대신 GUI(그래픽 화면)로 로컬 LLM을 관리하는 프로그램입니다. 공식 배포 페이지에서 운영체제에 맞는 설치 파일을 내려받아 설치한 뒤 실행하면, 모델을 검색하고 다운로드할 수 있는 화면이 표시됩니다.
검색 화면에서는 대화 목적에 맞는 모델을 찾고, 파일 크기와 양자화 정보를 확인합니다. 처음 선택할 때는 4B~8B 정도의 작은 모델과 Q4 계열을 기준으로 삼고, 컴퓨터의 RAM이나 VRAM보다 지나치게 큰 모델은 피하는 편이 좋습니다. 같은 모델이라도 Q4와 Q8처럼 양자화 방식에 따라 파일 크기와 메모리 요구량이 달라집니다. Q3, Q4, Q8 등의 양자화는 용량을 줄이는 대신 일정 수준의 품질 손실이 발생할 수 있으므로, 작은 파일이 항상 더 좋은 선택은 아닙니다. 다운로드가 끝난 모델은 컴퓨터의 저장공간을 사용하므로 여유 공간도 미리 확인합니다.
모델 로드와 채팅 화면 사용
Chat 탭에서 모델 로더를 열고 다운로드한 모델을 선택한 뒤 Load를 누릅니다. 로드 중에는 실행 준비가 진행되며 모델 크기에 따라 준비 시간이 달라집니다. 화면에 채팅 입력창이 나타나면 질문을 입력해 응답을 확인합니다.
처음에는 “이 문장을 쉽게 설명해줘”처럼 짧은 요청으로 테스트하는 것이 좋습니다. 응답이 지나치게 느리거나 프로그램이 멈춘다면 더 작은 모델을 선택하거나 다른 프로그램을 종료해 메모리를 확보하는 방법이 있습니다. 모델을 다운로드한 뒤에는 인터넷에 연결하지 않고도 로컬에서 대화할 수 있으며, 모델 다운로드와 프로그램 업데이트에는 네트워크가 필요합니다.
생성 파라미터 설정
채팅 화면의 설정 영역에서는 생성 방식을 조절할 수 있습니다. Temperature는 응답의 다양성, Context Length는 모델이 한 번에 처리할 수 있는 입력과 대화 내용의 토큰 범위, Maximum Tokens는 한 번에 생성할 최대 길이를 의미합니다.
처음에는 기본값으로 테스트한 뒤, 답변의 다양성을 조절할 필요가 있을 때 Temperature를 변경합니다. 아래 값은 설정 예시입니다.
Temperature: 0.7
Context Length: 기본값
Maximum Tokens: 기본값
Temperature를 낮추면 답변이 비교적 일정해지고, 높이면 표현의 다양성이 커집니다. Context Length를 크게 설정하면 더 많은 대화 내용을 참고하지만 메모리 사용량도 늘어날 수 있으므로 무조건 크게 잡을 필요는 없습니다. 생성은 종료 조건을 만나거나 최대 생성 길이에 도달하면 끝납니다.
정리
LM Studio는 설치부터 모델 다운로드, 실행, 채팅, 세부 설정까지 GUI에서 처리할 수 있어 로컬 LLM 입문에 적합합니다. 작은 모델로 기본 동작을 확인한 뒤, 목적과 컴퓨터 성능에 맞춰 모델과 파라미터를 조정해보세요.