Installieren & Einstieg (llama.cpp)
llama.cpp liefert schnelle GGUF-Inference; llama-server (oder server-Binary der Distribution) exponiert HTTP für MiniTavern.
Für: GGUF schon da, wenig Abhängigkeit, Kontrolle. Nur Klick-Download: zuerst LM Studio oder Ollama.
Bezug
- Vorcompilierte Packages aus Releases oder selbst bauen (CUDA / Metal / Vulkan).
- Ausführbare server-Datei (
llama-server,server… je Version). - GGUF: Empfohlene Modelle.
Schnellcheck
Erst lokal ohne Fehler laden, dann HTTP (nächste Seite).