推荐模型
模型名与下载方式因工具而异;下表给出 体量与用途 建议。具体 pull / 文件名以各工具页面为准。
按硬件选体量
| 大致规模 | 内存/显存粗略参考 | 适合 |
|---|---|---|
| 1B–3B | 约 4–8GB | 先验证通路、低配机器 |
| 7B–9B | 约 8–16GB | 角色扮演常用甜点区 |
| 12B–14B | 16GB+ | 质量更好,速度看显卡 |
| 32B+ | 24GB+ 或大力量化 | 高配;手机连着也会等更久 |
量化(Q4 / Q5 / IQ 等)越小越省资源、质量略降。GGUF 用户优先选社区常用的 Q4_K_M / Q5_K_M。
验证通路(优先小模型)
| 场景 | Ollama 示例 | GGUF / 其它 |
|---|---|---|
| 最快测通 | llama3.2:3b、qwen2.5:3b | 任意 3B 级 instruct GGUF |
| 中文轻量 | qwen2.5:3b / qwen2.5:7b | Qwen2.5 Instruct 量化 |
先保证 测连成功,再换大模型。
角色扮演向提示
- 优先 Instruct / Chat 微调,而不是纯基座补全模型。
- 社区常讨论的 RP 向权重会随时间变化;以你工具内能稳定加载、且上下文长度够用为准。
- 上下文(context)太小会导致长设定/世界书截断;7B 级可先从 4k–8k 试起,再按显存加大。
- 在 MiniTavern 填写的 模型名 必须与工具列表中的名称 完全一致(含 tag,如
:7b)。
Ollama 常用拉取示例
bash
ollama pull llama3.2:3b
ollama pull qwen2.5:7b
ollama pull qwen2.5:14b更多命令见 Ollama · 下载与选择模型。
LM Studio / KoboldCPP / llama.cpp
- 在 Hugging Face 等来源下载 GGUF(注意许可证与来源可信)。
- 在对应工具中加载同一文件。
- 打开 API / Server 后,把界面显示的 model id 抄到 MiniTavern。
下一步
工具总览 → 选定工具的「开服务」章节 → 在 MiniTavern 中配置