Guía de modelos GGUF locales
Los modelos locales te permiten ejecutar chats de IA sin enviar prompts a un proveedor de modelos en la nube. Tavern Studio admite flujos de trabajo locales de GGUF para usuarios con hardware adecuado.
Para quién es esto
- Usuarios con CPUs, GPUs capaces o configuraciones de modelos locales dedicadas.
- Usuarios que prefieren el juego de rol sin conexión o local-first.
- Usuarios que intentan solucionar problemas de errores por falta de memoria (out-of-memory) o generación lenta.
Qué aprenderás
- Qué es GGUF.
- En qué se diferencian los modelos locales de las APIs en la nube.
- Cómo importar o descargar un modelo local.
- Cómo afectan las capas GPU (GPU Layers) y los ajustes relacionados al rendimiento.
- Cómo solucionar problemas de bloqueos.
GGUF y expectativas de hardware
GGUF es un formato común para la inferencia de LLM locales. Los modelos cuantizados reducen los requisitos de memoria, pero los modelos más grandes aún necesitan suficiente RAM o VRAM.
Paso 1: Descargar o importar un modelo GGUF
Utiliza el área de gestión de modelos para descargar o importar un archivo .gguf. Elige un tamaño de modelo que tu hardware pueda manejar.
Paso 2: Iniciar el modelo local
Abre los ajustes del modelo local y configura:
- Tipo de backend.
- Tamaño del contexto (Context size).
- Capas GPU (GPU Layers).
- Hilos de CPU (CPU threads).
- Formato de chat (cuando sea necesario).
Solución de problemas
¿Por qué la aplicación se bloquea o muestra "Out of Memory" (Falta de memoria)?
Reduce las capas GPU, utiliza una cuantización más pequeña o elige un modelo de menor tamaño.
¿Por qué la generación es muy lenta?
Prueba con un modelo más pequeño, ajusta los hilos, utiliza la aceleración de GPU si está disponible o reduce el tamaño del contexto.
¿Por qué falla la importación?
Es posible que el archivo esté incompleto, dañado o que no sea un modelo GGUF válido.
Siguientes pasos
- Descripción general de la interfaz: comprende dónde aparecen los ajustes del modelo local.
- Configura tu primera API: utiliza APIs en la nube cuando el hardware local no sea suficiente.
- FAQ: revisa más preguntas sobre resolución de problemas.