86 lines
2.4 KiB
Markdown
86 lines
2.4 KiB
Markdown
|
|
---
|
||
|
|
license: mit
|
||
|
|
base_model: deepseek-ai/DeepSeek-R1-Distill-Qwen-32B
|
||
|
|
tags:
|
||
|
|
- awq
|
||
|
|
- 4-bit
|
||
|
|
- quantized
|
||
|
|
- deepseek
|
||
|
|
- reasoning
|
||
|
|
- chain-of-thought
|
||
|
|
language:
|
||
|
|
- ko
|
||
|
|
- en
|
||
|
|
pipeline_tag: text-generation
|
||
|
|
---
|
||
|
|
|
||
|
|
# DeepSeek-R1-32B-v2 AWQ
|
||
|
|
|
||
|
|
DeepSeek-R1-Distill-Qwen-32B의 **AWQ 4-bit** 양자화 모델입니다.
|
||
|
|
GPTQ 대비 추론 속도와 메모리 효율에서 장점을 가지며, 한국어 학술 지문 기반 수능 풀이 특화 프로젝트에서 활용되었습니다.
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
## 모델 정보
|
||
|
|
|
||
|
|
| 항목 | 내용 |
|
||
|
|
|------|------|
|
||
|
|
| Base Model | [deepseek-ai/DeepSeek-R1-Distill-Qwen-32B](https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-32B) |
|
||
|
|
| 양자화 방식 | AWQ 4-bit |
|
||
|
|
| 파라미터 수 | 32.8B |
|
||
|
|
| 아키텍처 | Qwen2 |
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
## GPTQ 버전과 비교
|
||
|
|
|
||
|
|
| 항목 | AWQ (이 모델) | GPTQ |
|
||
|
|
|------|--------------|------|
|
||
|
|
| 추론 속도 | ✅ 빠름 | 보통 |
|
||
|
|
| 메모리 효율 | ✅ 높음 | 보통 |
|
||
|
|
| 호환 라이브러리 | autoawq, vLLM | auto-gptq, vLLM |
|
||
|
|
| 링크 | 현재 모델 | [xeker/deepseek-r1-32b-v2-gptq](https://huggingface.co/xeker/deepseek-r1-32b-v2-gptq) |
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
## 사용 방법
|
||
|
|
|
||
|
|
```python
|
||
|
|
from transformers import AutoTokenizer, AutoModelForCausalLM
|
||
|
|
|
||
|
|
tokenizer = AutoTokenizer.from_pretrained("xeker/deepseek-r1-32b-v2-awq")
|
||
|
|
model = AutoModelForCausalLM.from_pretrained(
|
||
|
|
"xeker/deepseek-r1-32b-v2-awq",
|
||
|
|
device_map="auto"
|
||
|
|
)
|
||
|
|
|
||
|
|
messages = [
|
||
|
|
{"role": "user", "content": "다음 문제를 단계적으로 풀어보세요.\n\n[문제]"}
|
||
|
|
]
|
||
|
|
|
||
|
|
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
|
||
|
|
inputs = tokenizer(text, return_tensors="pt").to(model.device)
|
||
|
|
outputs = model.generate(**inputs, max_new_tokens=4096)
|
||
|
|
print(tokenizer.decode(outputs[0], skip_special_tokens=False))
|
||
|
|
```
|
||
|
|
|
||
|
|
### vLLM 사용 (권장)
|
||
|
|
|
||
|
|
```python
|
||
|
|
from vllm import LLM, SamplingParams
|
||
|
|
|
||
|
|
llm = LLM(model="xeker/deepseek-r1-32b-v2-awq", quantization="awq")
|
||
|
|
sampling_params = SamplingParams(temperature=0.7, max_tokens=4096)
|
||
|
|
|
||
|
|
outputs = llm.generate(["다음 문제를 풀어보세요."], sampling_params)
|
||
|
|
print(outputs[0].outputs[0].text)
|
||
|
|
```
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
## 프로젝트 배경
|
||
|
|
|
||
|
|
네이버 부스트캠프 AI Tech 8기 팀 프로젝트의 일환으로 진행된 **수능 풀이 특화 LLM 개발** 프로젝트에서 활용된 모델입니다.
|
||
|
|
|
||
|
|
- GitHub: [boostcampaitech8/pro-nlp-mrc-nlp-01](https://github.com/boostcampaitech8/pro-nlp-mrc-nlp-01)
|