推薦模型
模型名與下載方式因工具而異;下表給出 體量與用途 建議。具體 pull / 文件名以各工具頁面為準。
按硬件選體量
| 大致規模 | 內存/顯存粗略參考 | 適合 |
|---|---|---|
| 1B–3B | 約 4–8GB | 先驗證通路、低配機器 |
| 7B–9B | 約 8–16GB | 角色扮演常用甜點區 |
| 12B–14B | 16GB+ | 質量更好,速度看顯卡 |
| 32B+ | 24GB+ 或大力量化 | 高配;手機連著也會等更久 |
量化(Q4 / Q5 / IQ 等)越小越省資源、質量略降。GGUF 用戶優先選社區常用的 Q4_K_M / Q5_K_M。
驗證通路(優先小模型)
| 場景 | Ollama 示例 | GGUF / 其它 |
|---|---|---|
| 最快測通 | llama3.2:3b、qwen2.5:3b | 任意 3B 級 instruct GGUF |
| 中文輕量 | qwen2.5:3b / qwen2.5:7b | Qwen2.5 Instruct 量化 |
先保證 測連成功,再換大模型。
角色扮演向提示
- 優先 Instruct / Chat 微調,而不是純基座補全模型。
- 社區常討論的 RP 向權重會隨時間變化;以你工具內能穩定加載、且上下文長度夠用為準。
- 上下文(context)太小會導致長設定/世界書截斷;7B 級可先從 4k–8k 試起,再按顯存加大。
- 在 MiniTavern 填寫的 模型名 必須與工具列表中的名稱 完全一致(含 tag,如
:7b)。
Ollama 常用拉取示例
bash
ollama pull llama3.2:3b
ollama pull qwen2.5:7b
ollama pull qwen2.5:14b更多命令見 Ollama · 下載與選擇模型。
LM Studio / KoboldCPP / llama.cpp
- 在 Hugging Face 等來源下載 GGUF(注意許可證與來源可信)。
- 在對應工具中加載同一文件。
- 打開 API / Server 後,把界面顯示的 model id 抄到 MiniTavern。
下一步
工具總覽 → 選定工具的「開服務」章節 → 在 MiniTavern 中配置