Skip to content

推薦模型 ​

模型名與下載方式因工具而異;下表給出 體量與用途 建議。具體 pull / 文件名以各工具頁面為準。

按硬件選體量 ​

大致規模內存/顯存粗略參考適合
1B–3B約 4–8GB先驗證通路、低配機器
7B–9B約 8–16GB角色扮演常用甜點區
12B–14B16GB+質量更好,速度看顯卡
32B+24GB+ 或大力量化高配;手機連著也會等更久

量化(Q4 / Q5 / IQ 等)越小越省資源、質量略降。GGUF 用戶優先選社區常用的 Q4_K_M / Q5_K_M。

驗證通路(優先小模型) ​

場景Ollama 示例GGUF / 其它
最快測通llama3.2:3b、qwen2.5:3b任意 3B 級 instruct GGUF
中文輕量qwen2.5:3b / qwen2.5:7bQwen2.5 Instruct 量化

先保證 測連成功,再換大模型。

角色扮演向提示 ​

  • 優先 Instruct / Chat 微調,而不是純基座補全模型。
  • 社區常討論的 RP 向權重會隨時間變化;以你工具內能穩定加載、且上下文長度夠用為準。
  • 上下文(context)太小會導致長設定/世界書截斷;7B 級可先從 4k–8k 試起,再按顯存加大。
  • 在 MiniTavern 填寫的 模型名 必須與工具列表中的名稱 完全一致(含 tag,如 :7b)。

Ollama 常用拉取示例 ​

bash
ollama pull llama3.2:3b
ollama pull qwen2.5:7b
ollama pull qwen2.5:14b

更多命令見 Ollama · 下載與選擇模型。

LM Studio / KoboldCPP / llama.cpp ​

  1. 在 Hugging Face 等來源下載 GGUF(注意許可證與來源可信)。
  2. 在對應工具中加載同一文件。
  3. 打開 API / Server 後,把界面顯示的 model id 抄到 MiniTavern。

下一步 ​

工具總覽 → 選定工具的「開服務」章節 → 在 MiniTavern 中配置