license, base_model, tags, language, pipeline_tag
license base_model tags language pipeline_tag
mit deepseek-ai/DeepSeek-R1-Distill-Qwen-32B
awq
4-bit
quantized
deepseek
reasoning
chain-of-thought
ko
en
text-generation

DeepSeek-R1-32B-v2 AWQ

DeepSeek-R1-Distill-Qwen-32B의 AWQ 4-bit 양자화 모델입니다.
GPTQ 대비 추론 속도와 메모리 효율에서 장점을 가지며, 한국어 학술 지문 기반 수능 풀이 특화 프로젝트에서 활용되었습니다.


모델 정보

항목 내용
Base Model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B
양자화 방식 AWQ 4-bit
파라미터 수 32.8B
아키텍처 Qwen2

GPTQ 버전과 비교

항목 AWQ (이 모델) GPTQ
추론 속도 ✅ 빠름 보통
메모리 효율 ✅ 높음 보통
호환 라이브러리 autoawq, vLLM auto-gptq, vLLM
링크 현재 모델 xeker/deepseek-r1-32b-v2-gptq

사용 방법

from transformers import AutoTokenizer, AutoModelForCausalLM

tokenizer = AutoTokenizer.from_pretrained("xeker/deepseek-r1-32b-v2-awq")
model = AutoModelForCausalLM.from_pretrained(
    "xeker/deepseek-r1-32b-v2-awq",
    device_map="auto"
)

messages = [
    {"role": "user", "content": "다음 문제를 단계적으로 풀어보세요.\n\n[문제]"}
]

text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(text, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=4096)
print(tokenizer.decode(outputs[0], skip_special_tokens=False))

vLLM 사용 (권장)

from vllm import LLM, SamplingParams

llm = LLM(model="xeker/deepseek-r1-32b-v2-awq", quantization="awq")
sampling_params = SamplingParams(temperature=0.7, max_tokens=4096)

outputs = llm.generate(["다음 문제를 풀어보세요."], sampling_params)
print(outputs[0].outputs[0].text)

프로젝트 배경

네이버 부스트캠프 AI Tech 8기 팀 프로젝트의 일환으로 진행된 수능 풀이 특화 LLM 개발 프로젝트에서 활용된 모델입니다.

Description
Model synced from source: xeker/deepseek-r1-32b-v2-awq
Readme 34 KiB