インストールと入門(llama.cpp)
llama.cpp は高性能 GGUF 推論を提供;うち llama-server(または配布物の server バイナリ)が HTTP API を公開し、MiniTavern から使えます。
向いている人:すでに GGUF を取れ、依存を少なくパラメータを制御したい。クリックだけでダウンロードしたい初心者は先に LM Studio または Ollama。
入手
- 公式倉庫 Releases からプリビルドを取得、またはドキュメントどおり自分でビルド(CUDA/Metal/Vulkan)。
- パッケージ内に server 関連実行ファイルがあることを確認(名称は
llama-server、serverなど、ダウンロード版準拠)。 - GGUF モデルを用意、推奨モデル。
クイック検証
本機推論が通ってから HTTP サービスを開始(次ページ)。先にコマンドラインでモデルロードにエラーがないことを確認。