Empfohlene Modelle
Namen und Downloads je Tool; Tabelle = Größe und Zweck. Pull-/Dateinamen laut Tool-Seiten.
Größe nach Hardware
| ca. Größe | RAM/VRAM grob | Geeignet für |
|---|---|---|
| 1B–3B | ca. 4–8GB | Pfad zuerst prüfen, schwache Hardware |
| 7B–9B | ca. 8–16GB | Roleplay-Sweetspot |
| 12B–14B | 16GB+ | bessere Qualität, Tempo je GPU |
| 32B+ | 24GB+ oder starke Quantisierung | High-End; Handy wartet länger |
Kleinere Quantisierung (Q4 / Q5 / IQ …) spart Ressourcen, Qualität leicht runter. GGUF: Community-übliche Q4_K_M / Q5_K_M.
Pfadtest (kleine Modelle zuerst)
| Szenario | Ollama-Beispiel | GGUF / sonst |
|---|---|---|
| schnellster Test | llama3.2:3b, qwen2.5:3b | beliebiges 3B Instruct-GGUF |
| Chinesisch leicht | qwen2.5:3b / qwen2.5:7b | Qwen2.5 Instruct quantisiert |
Zuerst Verbindungstest, dann größere Modelle.
Roleplay-Hinweise
- Instruct / Chat-Finetunes, keine reinen Base-Completion-Modelle.
- Community-RP-Weights ändern sich; was stabil lädt und genug Kontext hat, zählt.
- Zu kleiner Kontext schneidet Lorebook/Settings; bei 7B zuerst 4k–8k, dann nach VRAM erhöhen.
- In MiniTavern Modellname exakt wie in der Tool-Liste (inkl. Tag
:7b).
Ollama-Pull-Beispiele
bash
ollama pull llama3.2:3b
ollama pull qwen2.5:7b
ollama pull qwen2.5:14bMehr: Ollama · Modelle.
LM Studio / KoboldCPP / llama.cpp
- GGUF von Hugging Face usw. (Lizenz & Quelle prüfen).
- In dem Tool laden.
- API / Server an → model id aus der UI in MiniTavern.
Weiter
Tool-Übersicht → «Dienst starten» des Tools → In MiniTavern konfigurieren