初始化项目,由ModelHub XC社区提供模型
Model: kaividlabs/qwen3-4b-awq Source: Original Platform
This commit is contained in:
27
README.md
Normal file
27
README.md
Normal file
@@ -0,0 +1,27 @@
|
||||
---
|
||||
license: mit
|
||||
language:
|
||||
- en
|
||||
---
|
||||
|
||||
Inference
|
||||
|
||||
```bash
|
||||
pip install vllm
|
||||
```
|
||||
|
||||
```py
|
||||
import os
|
||||
from vllm import LLM, SamplingParams
|
||||
|
||||
os.environ["LD_LIBRARY_PATH"] = "/usr/local/lib/python3.12/dist-packages/nvidia/cu13/lib:" + os.environ.get("LD_LIBRARY_PATH", "")
|
||||
os.environ["VLLM_WORKER_MULTIPROC_METHOD"] = "spawn"
|
||||
|
||||
llm = LLM(model="kaividlabs/qwen3-4b-awq", quantization="awq_marlin")
|
||||
sampling_params = SamplingParams(temperature=0.7, top_p=0.8, max_tokens=512)
|
||||
|
||||
messages = [{"role": "user", "content": "Give me a short introduction to Formula-1"}]
|
||||
prompt = llm.get_tokenizer().apply_chat_template(messages, tokenize=False, add_generation_prompt=True, enable_thinking=False)
|
||||
|
||||
print(outputs[0].outputs[0].text)
|
||||
```
|
||||
Reference in New Issue
Block a user