Exécuter des LLM locaux sous Windows avec llama.cpp dans Tavern Studio
Sous Windows, Tavern Studio gère l'inférence locale comme une fonctionnalité native. Il intègre le runtime llama.cpp pour exécuter le modèle GGUF choisi, ce qui permet à votre modèle local d'être utilisé dans le même espace de travail que vos cartes de personnage, livres de lore, presets et chats.
llama.cpp est largement plébiscité pour l'inférence locale en raison de sa simplicité de configuration pour exécuter des grands modèles de langage sur de nombreuses architectures matérielles. Tavern Studio s'appuie sur cet écosystème sans vous imposer de gérer un espace de travail de chat distinct.
À qui cela s'adresse
- Aux utilisateurs de Windows qui recherchent un chat IA hors ligne.
- Aux utilisateurs de modèle GGUF.
- Aux utilisateurs à la recherche d'une Alternative à SillyTavern sous forme d'application native, sans configuration serveur/navigateur complexe.
- Aux écrivains qui souhaitent un client de chat IA privé pour leurs personnages, sans transmettre chaque requête à une API cloud.
Concepts clés
Le flux de travail d'un LLM local sous Windows repose sur trois éléments : un fichier de modèle compatible, un runtime d'exécution et une interface de chat capable d'assembler un contexte IA pertinent. Le format GGUF est le standard pour les modèles locaux compatibles avec llama.cpp.
Le matériel est crucial. Les modèles légers et quantifiés s'exécutent beaucoup plus facilement. Les modèles plus imposants requièrent davantage de mémoire vive et peuvent être plus lents, selon les capacités de votre CPU, de votre GPU, de votre backend et de la longueur de contexte configurée.
La solution Tavern Studio
Tavern Studio connecte la route du modèle local au même système d'assemblage de prompt que celui utilisé par les API cloud. Cela signifie que vos fiches de personnage, vos informations World Info, vos presets et vos historiques de discussions conservent toute leur utilité. Le modèle local n'est pas un gadget à part.
Les versions pour Windows peuvent intégrer les composants nécessaires du runtime d'application LLM locale, l'intégration du backend étant gérée via nos configurations de build.
Étapes d'utilisation
- Choisissez un modèle GGUF adapté à votre configuration matérielle.
- Importez ou téléchargez le modèle dans Tavern Studio.
- Ouvrez les paramètres des modèles et des API, puis sélectionnez la route du modèle local.
- Choisissez un preset avec une longueur de contexte et de réponse réaliste.
- Démarrez un court chat de test.
- Si le temps de réponse est trop long, réduisez la taille du modèle, son niveau de quantification, sa longueur de contexte ou sa longueur de réponse.
- N'utilisez les API cloud que si vous avez besoin d'un modèle distant plus puissant.
FAQ
Tavern Studio permet-il d'exécuter une application LLM locale sous Windows ?
Oui. L'inférence locale sous Windows fait partie des fonctionnalités clés de Tavern Studio.
Quel format de modèle dois-je utiliser ?
Le format modèle GGUF est le format le plus pratique pour le flux de travail de modèles locaux basé sur llama.cpp.
Ai-je besoin de LM Studio ou d'Ollama ?
Non, pas pour le fonctionnement natif de l'application LLM locale dans Tavern Studio. Vous pouvez cependant continuer à utiliser ces points de terminaison externes si vous le souhaitez.
Tous les modèles s'exécutent-ils rapidement ?
Non. La vitesse dépend de la taille du modèle, de sa quantification, de votre matériel, du backend et de la longueur du contexte.
Les modèles locaux peuvent-ils exploiter les cartes de personnage et les livres de lore ?
Oui. Le même workflow d'assemblage de prompt de Tavern Studio s'applique.
Étapes suivantes
- Ajoutez un modèle grâce au guide sur comment Importer un modèle GGUF.
- Comparez avec notre guide sur l'Application LLM locale.
- Configurez une solution de secours cloud dans le Client de chat API cloud.