安裝與上手(llama.cpp)
llama.cpp 提供高性能 GGUF 推理;其中的 llama-server(或發行版中的 server 二進制)可暴露 HTTP API,供 MiniTavern 使用。
適合:已經會下 GGUF、希望依賴少、參數可控的用戶。新手若只想點選下載,可先看 LM Studio 或 Ollama。
獲取
- 從官方倉庫 Releases 下載預編譯包,或按文檔自行編譯(CUDA / Metal / Vulkan)。
- 確認包內有 server 相關可執行文件(名稱可能為
llama-server、server等,以你下載的版本為準)。 - 準備 GGUF 模型,見 推薦模型。
快速驗證
在模型能本機推理後,再開啟 HTTP 服務(見下一頁)。先保證命令行加載模型無報錯。