Skip to content

インストールと入門(llama.cpp) ​

llama.cpp は高性能 GGUF 推論を提供;うち llama-server(または配布物の server バイナリ)が HTTP API を公開し、MiniTavern から使えます。

向いている人:すでに GGUF を取れ、依存を少なくパラメータを制御したい。クリックだけでダウンロードしたい初心者は先に LM Studio または Ollama。

入手 ​

  1. 公式倉庫 Releases からプリビルドを取得、またはドキュメントどおり自分でビルド(CUDA/Metal/Vulkan)。
  2. パッケージ内に server 関連実行ファイルがあることを確認(名称は llama-server、server など、ダウンロード版準拠)。
  3. GGUF モデルを用意、推奨モデル。

クイック検証 ​

本機推論が通ってから HTTP サービスを開始(次ページ)。先にコマンドラインでモデルロードにエラーがないことを確認。

次のステップ ​

server の開始 → MiniTavern での設定