Skip to content

설치와 시작(llama.cpp) ​

llama.cpp는 고성능 GGUF 추론; llama-server(또는 배포의 server 바이너리)가 HTTP API를 노출해 MiniTavern에 연결됩니다.

적합: GGUF를 받을 수 있고 의존 최소·파라미터 통제를 원하는 사용자. 초보가 클릭 다운로드만 원하면 LM Studio 또는 Ollama.

받기 ​

  1. 공식 Releases 프리빌드, 또는 문서대로 컴파일(CUDA / Metal / Vulkan).
  2. 패키지에 server 실행 파일(llama-server, server 등 — 버전 기준).
  3. GGUF: 추천 모델.

빠른 검증 ​

로컬 추론이 된 뒤 HTTP(다음 페이지). CLI 로드 무오류 먼저.

다음 ​

server → MiniTavern 설정