설치와 시작(llama.cpp)
llama.cpp는 고성능 GGUF 추론; llama-server(또는 배포의 server 바이너리)가 HTTP API를 노출해 MiniTavern에 연결됩니다.
적합: GGUF를 받을 수 있고 의존 최소·파라미터 통제를 원하는 사용자. 초보가 클릭 다운로드만 원하면 LM Studio 또는 Ollama.
받기
- 공식 Releases 프리빌드, 또는 문서대로 컴파일(CUDA / Metal / Vulkan).
- 패키지에 server 실행 파일(
llama-server,server등 — 버전 기준). - GGUF: 추천 모델.
빠른 검증
로컬 추론이 된 뒤 HTTP(다음 페이지). CLI 로드 무오류 먼저.