本地 LLM 應用程式:Windows 與 Android 原生本地大模型客戶端

一個真正的本地 LLM 應用程式不應該只是指向外部伺服器的簡單前端。Tavern Studio 提供了原生本地大模型推理支援,將本地模型深度嵌入到核心工作流中,而不僅僅是作為一個附加選項。

通過在 Windows 上利用 llama.cpp 以及在 Android 上利用 LiteRT,Tavern Studio 讓用戶能夠直接在自己的硬體上運行模型。它支援直接導入 GGUF 模型以及應用程式內下載模型,使私有 AI 聊天工作流與角色卡、世界書、生成預設和多分支對話管理等高級功能緊密集成。

儘管該應用程式專為本地優先操作而設計,但它也提供了靈活的 API 路由,以便在需要更強推理能力時連接雲端模型。

適用人群

  • 本地模型愛好者:希望在 Windows 或 Android 設備上原生運行 LLM 的用戶。
  • 隱私倡導者:希望對自己的聊天記錄、預設和模型路由有更多控制的個人。
  • 創作者與角色扮演玩家:在使用本地模型的同時,需要豐富的角色卡、世界設定世界書以及深度上下文管理的用戶。
  • 混合 AI 使用者:希望在單個工作區中無縫切換本地推理與外部雲端 API 的開發者或創作者。

核心功能

本地大模型工作流包含兩個主要部分:可靠的模型運行器以及圍繞其構建的高功能工作區。雖然標準的運行器可以加載模型權重並生成原始文本,但完整的聊天體驗還需要強大的歷史記錄管理、系統提示詞、上下文注入、生成預設、分支路徑以及資產管理。

Tavern Studio 將這些組件集成到了一個統一的界面中:

  • 原生本地推理:在支援的平臺上針對硬體進行優化的模型執行。
  • GGUF 模型管理:無縫導入現有 GGUF 文件並支援簡單的應用程式內下載。
  • 集成模型選擇器:可直接從聊天窗口中快速切換活動模型。
  • 高級角色卡與 Bot 卡:可復用的智慧體角色,帶有自定義歡迎詞和配置備註。
  • 世界設定與世界書:根據用戶關鍵詞觸發的動態上下文注入,用於豐富的背景設定。
  • 自定義預設與提示詞管理:對 Temperature、Top-K、Top-P 和系統提示詞格式進行細粒度控制。
  • 多分支對話:輕鬆創建分支以測試不同的模型響應,而不會丟失原始聊天樹。
  • 靈活的 API 路由:原生支援主流雲端提供商和自定義 OpenAI-compatible API 終點。

運行表現取決於您設備的硬體、所選模型的大小、量化級別以及活動上下文長度。我們建議先從較小的量化模型開始,以評估您系統的能力,然後再加載更大的架構。

Tavern Studio 如何解決這一問題

Tavern Studio 將本地推理作為首要路由進行設計。在 Windows 上,應用程式程式利用 llama.cpp;而在 Android 上,則運行於 LiteRT。用戶可以導入本地 GGUF 模型或使用內置的下載器直接獲取權重,使本地執行與雲端配置並存。

這種混合設計意味著您可以使用快速的本地模型進行草稿撰寫或頭腦風暴,切換到雲端 API 進行複雜的邏輯推理,或者通過 OpenAI-compatible API 終點連接到自定義伺服器。無論您選擇何種後端模型,您的角色卡、世界書、預設和分支聊天工具都將保持可用且持久存在。

與通用本地大模型運行工具的關係

許多本地 LLM 工具僅專注於將模型作為 network endpoint(網路接口)進行服務。相比之下,Tavern Studio 是一個圍繞聊天工作區構建的獨立客戶端應用程式。如果您只需要暴露一個 API 接口,那麼專用的後端運行器就足夠了。但如果您希望進行寫作、聊天、管理自定義角色、綁定互動式世界書以及管理多分支對話時間線,Tavern Studio 提供了所需的前端編排。

對於從 SillyTavern 遷移過來的用戶,Tavern Studio 是一個現代、獨立的酒館替代品。您無需在豐富的角色卡工作流與原生本地模型運行之間做出妥協。Tavern Studio 同時支援兩者,並包含一個內置的 SillyTavern 導入器(可通過 Settings -> Data Management -> Import from SillyTavern 訪問)。

從 SillyTavern 導入

該遷移工具在嚴格的參數下運行,以確保安全的只讀過渡:

  • 只讀操作:導入器掃描您的 SillyTavern 項目根目錄(必須包含 data 文件夾)並複製文件。它絕不會修改、刪除或移動您原始 SillyTavern 安裝路徑下的任何文件。
  • 掃描與預覽:該工具會顯示可檢測資產的預覽,允許您選擇要導入的用戶和內容範圍。
  • 支援導入的項目:它可以導入角色卡、世界書/世界信息、OpenAI 兼容預設、API 密鑰/配置,以及標準的 JSONL 聊天文件。
  • 需要手動調整的部分:部分配置在導入後必須手動重新配置。其中包括自定義終點、本地服務、反向代理、Azure OpenAI、Cloudflare Workers AI、自定義代理地址、帳號 ID、缺失的 base URL 或缺失的預設模型。
  • 局限性:目前尚未完全支援群組聊天;導入過程中可能會跳過一些不支援的結構。
  • 導入後驗證:我們建議驗證您的角色列表、聊天記錄、世界書和 API 設置。如果新導入的資源沒有立即顯示,請重啟應用程式程式或刷新頁面。

操作步驟

  1. 在您的 Windows 或 Android 設備上打開 Tavern Studio。
  2. 導航至本地模型配置區域。
  3. 導入本地 GGUF 文件或使用下載工具獲取新模型。
  4. 確認該模型已顯示在您的活動列表中。
  5. 在您的聊天工作區或預設配置中選擇該模型。
  6. 使用簡短的提示詞開始對話,以評估生成速度、記憶體佔用和輸出質量。
  7. 如果設備出現卡頓,請調整上下文長度、預設參數或切換到更輕量的模型。
  8. 在基礎連接穩定後,綁定角色卡或世界書以定製聊天體驗。

常見問題

Tavern Studio 是一款本地 LLM 應用程式嗎?

是的。Tavern Studio 是一款原生本地 LLM 應用程式,可在支援的設備上直接運行模型,在 Windows 上使用 llama.cpp,在 Android 上使用 LiteRT。

Tavern Studio 支援 GGUF 模型嗎?

是的。Tavern Studio 支援導入和下載 GGUF 模型,用於本地推理工作流。

Tavern Studio 只是一個 API 套殼嗎?

不是。雖然它支援雲端 API,但 Tavern Studio 內置了原生本地推理引擎,支援完全離線的模型運行。

我可以混合使用雲端 API 和本地模型嗎?

是的。您可以在同一個工作區中管理本地模型和外部 API(如 OpenAI、Claude、Gemini、OpenRouter 或自定義 OpenAI-compatible API 終點)。

所有的本地大模型都能在我的設備上流暢運行嗎?

不能。運行速度和資源佔用取決於您系統的硬體、模型參數、量化級別和上下文限制。我們建議先測試較小的模型。

我可以在本地模型中使用角色卡嗎?

是的。所有的前端功能——包括角色卡、世界書、多分支對話和自定義預設——均與本地模型路由常見格式兼容。

下一步

下載 Tavern Studio
Windows