Skip to content

推荐模型

模型名与下载方式因工具而异;下表给出 体量与用途 建议。具体 pull / 文件名以各工具页面为准。

按硬件选体量

大致规模内存/显存粗略参考适合
1B–3B约 4–8GB先验证通路、低配机器
7B–9B约 8–16GB角色扮演常用甜点区
12B–14B16GB+质量更好,速度看显卡
32B+24GB+ 或大力量化高配;手机连着也会等更久

量化(Q4 / Q5 / IQ 等)越小越省资源、质量略降。GGUF 用户优先选社区常用的 Q4_K_M / Q5_K_M

验证通路(优先小模型)

场景Ollama 示例GGUF / 其它
最快测通llama3.2:3bqwen2.5:3b任意 3B 级 instruct GGUF
中文轻量qwen2.5:3b / qwen2.5:7bQwen2.5 Instruct 量化

先保证 测连成功,再换大模型。

角色扮演向提示

  • 优先 Instruct / Chat 微调,而不是纯基座补全模型。
  • 社区常讨论的 RP 向权重会随时间变化;以你工具内能稳定加载、且上下文长度够用为准。
  • 上下文(context)太小会导致长设定/世界书截断;7B 级可先从 4k–8k 试起,再按显存加大。
  • 在 MiniTavern 填写的 模型名 必须与工具列表中的名称 完全一致(含 tag,如 :7b)。

Ollama 常用拉取示例

bash
ollama pull llama3.2:3b
ollama pull qwen2.5:7b
ollama pull qwen2.5:14b

更多命令见 Ollama · 下载与选择模型

LM Studio / KoboldCPP / llama.cpp

  1. Hugging Face 等来源下载 GGUF(注意许可证与来源可信)。
  2. 在对应工具中加载同一文件。
  3. 打开 API / Server 后,把界面显示的 model id 抄到 MiniTavern。

下一步

工具总览 → 选定工具的「开服务」章节 → 在 MiniTavern 中配置