Skip to content

推奨モデル ​

モデル名と取得方法はツールごとに異なる;下表は 体量と用途 の目安。具体的な pull/ファイル名は各ツールページ準拠。

ハードウェアで体量を選ぶ ​

おおよその規模メモリ/显存の目安向く用途
1B–3B約 4–8GBまず通路を検証、低スペック
7B–9B約 8–16GBロールプレイのよくあるスイートスポット
12B–14B16GB+品質向上、速度は GPU 次第
32B+24GB+ または強い量子化高スペック;スマホ接続でも待ちが長い

量子化(Q4/Q5/IQ など)が小さいほど省リソース、品質は少し下がる。GGUF はコミュニティ定番の Q4_K_M/Q5_K_M を優先。

通路検証(小モデル優先) ​

シーンOllama 例GGUF/その他
最速で測通llama3.2:3b、qwen2.5:3b任意の 3B 級 instruct GGUF
中国語軽量qwen2.5:3b/qwen2.5:7bQwen2.5 Instruct 量子化

先に 測連成功 してから大モデルへ。

ロールプレイ向けのヒント ​

  • Instruct/Chat 微調を優先し、純基座の補完モデルは避ける。
  • コミュニティで語られる RP 向け重みは時期で変わる;ツールで安定ロードでき、コンテキスト長が足りるものを正とする。
  • コンテキストが小さすぎると長設定/ワールドブックが切れる;7B 級はまず 4k–8k から試し、显存に応じて拡大。
  • MiniTavern に記入する モデル名 はツール一覧と 完全一致(tag 含む、例 :7b)。

Ollama よくある pull 例 ​

bash
ollama pull llama3.2:3b
ollama pull qwen2.5:7b
ollama pull qwen2.5:14b

コマンド詳細は Ollama · モデルの取得と選択。

LM Studio/KoboldCPP/llama.cpp ​

  1. Hugging Face などから GGUF を取得(ライセンスと出所の信頼性に注意)。
  2. 対応ツールで同一ファイルをロード。
  3. API/Server を開き、UI 表示の model id を MiniTavern へ転記。

次のステップ ​

ツール一覧 → 選んだツールの「サービス開始」章 → MiniTavern での設定