# 1. Конвертация в bf16 (как договорились)
python convert_hf_to_gguf.py /mnt/nfs_share/JiRackUlrta_1 \
    --outfile /mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.gguf --outtype bf16

# 2. Сборка llama-quantize (один раз)
cd /mnt/nfs_share/llama.cpp
cmake -B build
cmake --build build -j

# 3. Квантование в Q4_K_M
./build/bin/llama-quantize \
    /mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.gguf \
    /mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.Q4_K_M.gguf \
    Q4_K_M
