15 lines
513 B
Plaintext
15 lines
513 B
Plaintext
# 1. Конвертация в bf16 (как договорились)
|
|
python convert_hf_to_gguf.py /mnt/nfs_share/JiRackUlrta_1 \
|
|
--outfile /mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.gguf --outtype bf16
|
|
|
|
# 2. Сборка llama-quantize (один раз)
|
|
cd /mnt/nfs_share/llama.cpp
|
|
cmake -B build
|
|
cmake --build build -j
|
|
|
|
# 3. Квантование в Q4_K_M
|
|
./build/bin/llama-quantize \
|
|
/mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.gguf \
|
|
/mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.Q4_K_M.gguf \
|
|
Q4_K_M
|