GPU 없이 로컬 AI를 실행할 수 있을까? CPU 기반 LLM 활용법
GPU 없이도 로컬 AI를 실행할 수 있지만, 모델 크기와 응답 속도 사이에서 타협이 필요합니다. 이 글은 Windows 또는 Linux에서 명령어를 실행할 수 있는 환경을 가정하고, GGUF 모델과 llama.cpp로 CPU에서 LLM을 돌리는 방법을 다룹니다. 목차 CPU 기반 LLM은 어떻게 추론할까? GGUF와…
GPU 없이도 로컬 AI를 실행할 수 있지만, 모델 크기와 응답 속도 사이에서 타협이 필요합니다. 이 글은 Windows 또는 Linux에서 명령어를 실행할 수 있는 환경을 가정하고, GGUF 모델과 llama.cpp로 CPU에서 LLM을 돌리는 방법을 다룹니다. 목차 CPU 기반 LLM은 어떻게 추론할까? GGUF와…
목차 시작 전 하드웨어 확인 Ollama 설치 모델 다운로드와 실행 문제 해결과 운영 팁 결론 이 글은 Linux와 macOS에서는 터미널 명령으로, Windows에서는 설치 프로그램으로 Ollama를 설치한 뒤 로컬 LLM을 처음 실행하는 과정을 안내합니다. 로컬 실행은 프라이버시와 오프라인 사용 측면의 장점이…
목차 MCP의 정의와 등장 배경 호스트·클라이언트·서버 구조 프리미티브와 JSON-RPC 흐름 도구 발견·호출과 전송 방식 활용 예시 결론 MCP의 정의와 등장 배경 이 글은 MCP를 특정 서비스의 사용법이 아니라, AI 애플리케이션과 외부 도구를 연결하는 표준 구조로 이해하는 것을 전제로 합니다. MCP(Model…
목차 먼저 알아둘 전제 일반 챗봇은 어떻게 동작할까? AI 에이전트의 동작 원리 Tool 사용 능력과 작업 범위 기억과 컨텍스트 관리 자율적 계획과 의사결정 결론 최근 AI 기술의 발전은 챗봇과 AI 에이전트라는 두 가지 주요 형태로 나타나고 있습니다. 이 둘은 모두…
AI 언어 모델은 방대한 정보를 학습하지만, 학습 시점 이후의 최신 정보나 특정 분야의 상세 지식에 접근하지 못해 답변에 한계가 있습니다. 이러한 문제를 해결하고 모델이 외부 지식을 참고하게 만드는 핵심 기술이 바로 RAG(Retrieval-Augmented Generation)입니다. RAG는 외부 지식 기반에서 필요한 정보를 ‘검색’하여…