Skip to content

安装与上手(llama.cpp)

llama.cpp 提供高性能 GGUF 推理;其中的 llama-server(或发行版中的 server 二进制)可暴露 HTTP API,供 MiniTavern 使用。

适合:已经会下 GGUF、希望依赖少、参数可控的用户。新手若只想点选下载,可先看 LM StudioOllama

获取

  1. 从官方仓库 Releases 下载预编译包,或按文档自行编译(CUDA / Metal / Vulkan)。
  2. 确认包内有 server 相关可执行文件(名称可能为 llama-serverserver 等,以你下载的版本为准)。
  3. 准备 GGUF 模型,见 推荐模型

快速验证

在模型能本机推理后,再开启 HTTP 服务(见下一页)。先保证命令行加载模型无报错。

下一步

开启 server在 MiniTavern 中配置