Skip to content

Installieren & Einstieg (llama.cpp) ​

llama.cpp liefert schnelle GGUF-Inference; llama-server (oder server-Binary der Distribution) exponiert HTTP für MiniTavern.

Für: GGUF schon da, wenig Abhängigkeit, Kontrolle. Nur Klick-Download: zuerst LM Studio oder Ollama.

Bezug ​

  1. Vorcompilierte Packages aus Releases oder selbst bauen (CUDA / Metal / Vulkan).
  2. Ausführbare server-Datei (llama-server, server … je Version).
  3. GGUF: Empfohlene Modelle.

Schnellcheck ​

Erst lokal ohne Fehler laden, dann HTTP (nächste Seite).

Weiter ​

Server starten → In MiniTavern konfigurieren