推奨モデル
モデル名と取得方法はツールごとに異なる;下表は 体量と用途 の目安。具体的な pull/ファイル名は各ツールページ準拠。
ハードウェアで体量を選ぶ
| おおよその規模 | メモリ/显存の目安 | 向く用途 |
|---|---|---|
| 1B–3B | 約 4–8GB | まず通路を検証、低スペック |
| 7B–9B | 約 8–16GB | ロールプレイのよくあるスイートスポット |
| 12B–14B | 16GB+ | 品質向上、速度は GPU 次第 |
| 32B+ | 24GB+ または強い量子化 | 高スペック;スマホ接続でも待ちが長い |
量子化(Q4/Q5/IQ など)が小さいほど省リソース、品質は少し下がる。GGUF はコミュニティ定番の Q4_K_M/Q5_K_M を優先。
通路検証(小モデル優先)
| シーン | Ollama 例 | GGUF/その他 |
|---|---|---|
| 最速で測通 | llama3.2:3b、qwen2.5:3b | 任意の 3B 級 instruct GGUF |
| 中国語軽量 | qwen2.5:3b/qwen2.5:7b | Qwen2.5 Instruct 量子化 |
先に 測連成功 してから大モデルへ。
ロールプレイ向けのヒント
- Instruct/Chat 微調を優先し、純基座の補完モデルは避ける。
- コミュニティで語られる RP 向け重みは時期で変わる;ツールで安定ロードでき、コンテキスト長が足りるものを正とする。
- コンテキストが小さすぎると長設定/ワールドブックが切れる;7B 級はまず 4k–8k から試し、显存に応じて拡大。
- MiniTavern に記入する モデル名 はツール一覧と 完全一致(tag 含む、例
:7b)。
Ollama よくある pull 例
bash
ollama pull llama3.2:3b
ollama pull qwen2.5:7b
ollama pull qwen2.5:14bコマンド詳細は Ollama · モデルの取得と選択。
LM Studio/KoboldCPP/llama.cpp
- Hugging Face などから GGUF を取得(ライセンスと出所の信頼性に注意)。
- 対応ツールで同一ファイルをロード。
- API/Server を開き、UI 表示の model id を MiniTavern へ転記。
次のステップ
ツール一覧 → 選んだツールの「サービス開始」章 → MiniTavern での設定