Skip to content

安裝與上手(llama.cpp) ​

llama.cpp 提供高性能 GGUF 推理;其中的 llama-server(或發行版中的 server 二進制)可暴露 HTTP API,供 MiniTavern 使用。

適合:已經會下 GGUF、希望依賴少、參數可控的用戶。新手若只想點選下載,可先看 LM Studio 或 Ollama。

獲取 ​

  1. 從官方倉庫 Releases 下載預編譯包,或按文檔自行編譯(CUDA / Metal / Vulkan)。
  2. 確認包內有 server 相關可執行文件(名稱可能為 llama-server、server 等,以你下載的版本為準)。
  3. 準備 GGUF 模型,見 推薦模型。

快速驗證 ​

在模型能本機推理後,再開啟 HTTP 服務(見下一頁)。先保證命令行加載模型無報錯。

下一步 ​

開啟 server → 在 MiniTavern 中配置