Skip to content

安装与上手(llama.cpp) ​

llama.cpp 提供高性能 GGUF 推理;其中的 llama-server(或发行版中的 server 二进制)可暴露 HTTP API,供 MiniTavern 使用。

适合:已经会下 GGUF、希望依赖少、参数可控的用户。新手若只想点选下载,可先看 LM Studio 或 Ollama。

获取 ​

  1. 从官方仓库 Releases 下载预编译包,或按文档自行编译(CUDA / Metal / Vulkan)。
  2. 确认包内有 server 相关可执行文件(名称可能为 llama-server、server 等,以你下载的版本为准)。
  3. 准备 GGUF 模型,见 推荐模型。

快速验证 ​

在模型能本机推理后,再开启 HTTP 服务(见下一页)。先保证命令行加载模型无报错。

下一步 ​

开启 server → 在 MiniTavern 中配置