# 1. Конвертация в bf16 (как договорились) python convert_hf_to_gguf.py /mnt/nfs_share/JiRackUlrta_1 \ --outfile /mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.gguf --outtype bf16 # 2. Сборка llama-quantize (один раз) cd /mnt/nfs_share/llama.cpp cmake -B build cmake --build build -j # 3. Квантование в Q4_K_M ./build/bin/llama-quantize \ /mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.gguf \ /mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.Q4_K_M.gguf \ Q4_K_M