Guía de modelos GGUF locales

Los modelos locales te permiten ejecutar chats de IA sin enviar prompts a un proveedor de modelos en la nube. Tavern Studio admite flujos de trabajo locales de GGUF para usuarios con hardware adecuado.

Para quién es esto

  • Usuarios con CPUs, GPUs capaces o configuraciones de modelos locales dedicadas.
  • Usuarios que prefieren el juego de rol sin conexión o local-first.
  • Usuarios que intentan solucionar problemas de errores por falta de memoria (out-of-memory) o generación lenta.

Qué aprenderás

  • Qué es GGUF.
  • En qué se diferencian los modelos locales de las APIs en la nube.
  • Cómo importar o descargar un modelo local.
  • Cómo afectan las capas GPU (GPU Layers) y los ajustes relacionados al rendimiento.
  • Cómo solucionar problemas de bloqueos.

GGUF y expectativas de hardware

GGUF es un formato común para la inferencia de LLM locales. Los modelos cuantizados reducen los requisitos de memoria, pero los modelos más grandes aún necesitan suficiente RAM o VRAM.

Paso 1: Descargar o importar un modelo GGUF

Tavern Studio model download panel
Panel de gestión de modelos para descargar o importar archivos de modelos locales.

Utiliza el área de gestión de modelos para descargar o importar un archivo .gguf. Elige un tamaño de modelo que tu hardware pueda manejar.

Paso 2: Iniciar el modelo local

Tavern Studio local LLM settings
Los ajustes de LLM local controlan el backend, archivo de modelo y parámetros de tiempo de ejecución.

Abre los ajustes del modelo local y configura:

  • Tipo de backend.
  • Tamaño del contexto (Context size).
  • Capas GPU (GPU Layers).
  • Hilos de CPU (CPU threads).
  • Formato de chat (cuando sea necesario).

Solución de problemas

¿Por qué la aplicación se bloquea o muestra "Out of Memory" (Falta de memoria)?

Reduce las capas GPU, utiliza una cuantización más pequeña o elige un modelo de menor tamaño.

¿Por qué la generación es muy lenta?

Prueba con un modelo más pequeño, ajusta los hilos, utiliza la aceleración de GPU si está disponible o reduce el tamaño del contexto.

¿Por qué falla la importación?

Es posible que el archivo esté incompleto, dañado o que no sea un modelo GGUF válido.


Siguientes pasos

Descargar Tavern Studio
Windows