初始化项目,由ModelHub XC社区提供模型
Model: RedHatAI/QwQ-32B-Preview-quantized.w8a8 Source: Original Platform
This commit is contained in:
22
quant_w8a8.sh
Normal file
22
quant_w8a8.sh
Normal file
@@ -0,0 +1,22 @@
|
||||
#!/bin/bash
|
||||
|
||||
# for DAMPENING_FRAC 0.01 0.1;
|
||||
# do
|
||||
# for OBSERVER minmax mse;
|
||||
# do
|
||||
# for ACTORDER False group;
|
||||
# do
|
||||
|
||||
# export DAMPENING_FRAC=0.01
|
||||
# export OBSERVER="minmax"
|
||||
|
||||
export CUDA_VISIBLE_DEVICES=${1}
|
||||
export MDL=${2}
|
||||
export OBSERVER=${3} # minmax mse
|
||||
export DAMPENING_FRAC=${4} # 0.01 0.1
|
||||
|
||||
for CALIB_SIZE in 128 512 1024;
|
||||
do
|
||||
python w8a8.py --model_path ${MDL} --quant_path "output_dir_w8a8/${MDL}/calib${CALIB_SIZE}_eosFalse_damp${DAMPENING_FRAC}_obs${OBSERVER}" --calib_size ${CALIB_SIZE} --dampening_frac ${DAMPENING_FRAC} --observer ${OBSERVER}
|
||||
done
|
||||
|
||||
Reference in New Issue
Block a user