Skip to content

Empfohlene Modelle ​

Namen und Downloads je Tool; Tabelle = Größe und Zweck. Pull-/Dateinamen laut Tool-Seiten.

Größe nach Hardware ​

ca. GrößeRAM/VRAM grobGeeignet für
1B–3Bca. 4–8GBPfad zuerst prüfen, schwache Hardware
7B–9Bca. 8–16GBRoleplay-Sweetspot
12B–14B16GB+bessere Qualität, Tempo je GPU
32B+24GB+ oder starke QuantisierungHigh-End; Handy wartet länger

Kleinere Quantisierung (Q4 / Q5 / IQ …) spart Ressourcen, Qualität leicht runter. GGUF: Community-übliche Q4_K_M / Q5_K_M.

Pfadtest (kleine Modelle zuerst) ​

SzenarioOllama-BeispielGGUF / sonst
schnellster Testllama3.2:3b, qwen2.5:3bbeliebiges 3B Instruct-GGUF
Chinesisch leichtqwen2.5:3b / qwen2.5:7bQwen2.5 Instruct quantisiert

Zuerst Verbindungstest, dann größere Modelle.

Roleplay-Hinweise ​

  • Instruct / Chat-Finetunes, keine reinen Base-Completion-Modelle.
  • Community-RP-Weights ändern sich; was stabil lädt und genug Kontext hat, zählt.
  • Zu kleiner Kontext schneidet Lorebook/Settings; bei 7B zuerst 4k–8k, dann nach VRAM erhöhen.
  • In MiniTavern Modellname exakt wie in der Tool-Liste (inkl. Tag :7b).

Ollama-Pull-Beispiele ​

bash
ollama pull llama3.2:3b
ollama pull qwen2.5:7b
ollama pull qwen2.5:14b

Mehr: Ollama · Modelle.

LM Studio / KoboldCPP / llama.cpp ​

  1. GGUF von Hugging Face usw. (Lizenz & Quelle prüfen).
  2. In dem Tool laden.
  3. API / Server an → model id aus der UI in MiniTavern.

Weiter ​

Tool-Übersicht → «Dienst starten» des Tools → In MiniTavern konfigurieren