로컬 GGUF 모델 가이드

로컬 모델을 사용하면 외부 클라우드 제공업체로 프롬프트를 전송하지 않고 나만의 기기에서 완전히 독립적으로 AI 채팅을 구동할 수 있습니다. Tavern Studio는 적절한 하드웨어를 보유한 사용자를 위해 로컬 GGUF 기반 워크플로우를 완벽히 지원합니다.

대상 독자

  • 고성능 CPU, GPU 혹은 별도의 로컬 AI 연산 인프라를 갖춘 사용자
  • 완전한 오프라인 또는 로컬 우선(local-first) 역할극 대화를 원하는 사용자
  • 메모리 부족(OOM) 오류나 심각한 연산 지연 현상을 해결하려는 사용자

배울 내용

  • GGUF 포맷의 개념
  • 로컬 구동 모델과 클라우드 API의 차이점
  • 로컬 모델을 가져오거나 다운로드하는 방법
  • GPU 레이어(GPU Layers) 및 관련 설정이 성능에 미치는 영향
  • 로컬 구동 시 발생하는 크래시(Crash) 해결법

GGUF 및 컴퓨터 사양 권장안

GGUF는 로컬 LLM 추론을 위해 널리 사용되는 파일 형식입니다. 양자화(Quantized) 모델을 사용하면 요구 메모리를 크게 낮출 수 있으나, 여전히 대규모 모델을 돌리려면 충분한 용량의 시스템 RAM 또는 그래픽 VRAM이 필요합니다.


1단계: GGUF 모델 다운로드 또는 가져오기

Tavern Studio model download panel
모델 관리 패널: 로컬 모델 파일을 다운로드하거나 인포트합니다.

모델 관리 화면을 통해 .gguf 확장자 파일을 직접 다운로드하거나 내 컴퓨터의 파일을 가져옵니다. 이때 본인 컴퓨터의 하드웨어가 감당할 수 있는 적절한 크기의 모델을 선택하는 것이 중요합니다.

2단계: 로컬 모델 시작하기

Tavern Studio local LLM settings
로컬 LLM 설정 페이지: 백엔드를 선택하고 모델 파일을 로드하며 실행 매개변수를 제어합니다.

로컬 모델 설정을 열어 다음 항목들을 구성합니다:

  • 백엔드 유형(Backend type)
  • 콘텍스트 크기(Context size)
  • GPU 레이어(GPU Layers): GPU로 오프로딩할 레이어의 개수입니다.
  • CPU 스레드 수(CPU threads)
  • 대화 템플릿 포맷(Chat format): 모델이 요구하는 특수 포맷입니다.

문제 해결 (Troubleshooting)

앱이 강제로 꺼지거나 “Out of Memory” 오류가 발생합니다.

GPU 레이어(GPU Layers) 개수를 낮추거나, 더 낮게 압축된 양자화(Quantization) 버전을 선택하거나, 아예 파라미터가 더 적은 가벼운 모델을 다운로드해 보세요.

텍스트 한 글자 나오는 속도가 너무 느립니다.

더 가벼운 모델로 변경하고, 사용 중인 CPU 사양에 맞게 스레드 개수를 조절하십시오. 외장 그래픽 카드를 사용할 수 있다면 GPU 가속 기능을 켜고, 콘텍스트 크기(Context size) 설정을 줄여보세요.

파일 가져오기가 실패합니다.

다운로드한 파일이 깨졌거나 중간에 끊겼을 수 있습니다. 정상적으로 인코딩된 GGUF 표준 포맷 파일인지 재차 확인해 보십시오.


다음 단계

Tavern Studio 다운로드
Windows