추천 모델
모델명·다운로드는 도구마다 다릅니다. 아래는 규모와 용도 제안. pull / 파일명은 각 도구 페이지 기준.
하드웨어별 규모
| 대략 규모 | 메모리/VRAM 대략 | 적합 |
|---|---|---|
| 1B–3B | 약 4–8GB | 경로 먼저 검증, 저사양 |
| 7B–9B | 약 8–16GB | 롤플레이 스위트 스팟 |
| 12B–14B | 16GB+ | 품질↑, 속도는 GPU |
| 32B+ | 24GB+ 또는 강한 양자화 | 고사양; 폰 연결도 대기↑ |
양자화(Q4 / Q5 / IQ 등)가 작을수록 자원↓·품질 소폭↓. GGUF는 커뮤니티 흔한 Q4_K_M / Q5_K_M 우선.
경로 검증(작은 모델 우선)
| 장면 | Ollama 예 | GGUF / 기타 |
|---|---|---|
| 최단 검증 | llama3.2:3b, qwen2.5:3b | 임의 3B급 instruct GGUF |
| 중국어 경량 | qwen2.5:3b / qwen2.5:7b | Qwen2.5 Instruct 양자화 |
먼저 연결 테스트 성공, 그다음 큰 모델.
롤플레이 팁
- Instruct / Chat 파인튜닝 우선, 순수 베이스 완성 모델 비권장.
- 커뮤니티 RP 가중치는 시간에 따라 변함; 도구에서 안정 로드·충분한 컨텍스트가 기준.
- 컨텍스트가 작으면 장설정/월드북이 잘림; 7B는 4k–8k부터, VRAM에 맞춰 확대.
- MiniTavern 모델명은 도구 목록과 완전 일치(tag 포함, 예
:7b).
Ollama 자주 쓰는 pull
bash
ollama pull llama3.2:3b
ollama pull qwen2.5:7b
ollama pull qwen2.5:14b더 보기: Ollama · 다운로드와 선택.
LM Studio / KoboldCPP / llama.cpp
- Hugging Face 등에서 GGUF(라이선스·출처 주의).
- 해당 도구에서 같은 파일 로드.
- API / Server 켠 뒤 표시 model id를 MiniTavern에.
다음
도구 개요 → 선택한 도구의 「서비스」장 → MiniTavern 설정