commit 8c57afed2fdf0ed1b17e39a03857349ecc78089c Author: ModelHub XC Date: Fri Oct 2 19:13:14 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: RedHatAI/granite-3.1-2b-instruct-quantized.w4a16 Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..a6344aa --- /dev/null +++ b/.gitattributes @@ -0,0 +1,35 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text diff --git a/README.md b/README.md new file mode 100644 index 0000000..a47ee63 --- /dev/null +++ b/README.md @@ -0,0 +1,454 @@ +--- +tags: +- w4a16 +- int4 +- vllm +license: apache-2.0 +license_link: https://huggingface.co/datasets/choosealicense/licenses/blob/main/markdown/apache-2.0.md +language: + - en +base_model: ibm-granite/granite-3.1-2b-instruct +library_name: transformers +--- + +# granite-3.1-2b-instruct-quantized.w4a16 + +## Model Overview +- **Model Architecture:** granite-3.1-2b-instruct + - **Input:** Text + - **Output:** Text +- **Model Optimizations:** + - **Weight quantization:** INT4 + - **Activation quantization:** INT4 +- **Release Date:** 1/8/2025 +- **Version:** 1.0 +- **Model Developers:** Neural Magic + +Quantized version of [ibm-granite/granite-3.1-2b-instruct](https://huggingface.co/ibm-granite/granite-3.1-2b-instruct). +It achieves an average score of 61.54 on the [OpenLLM](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) benchmark (version 1), whereas the unquantized model achieves 61.98. + +### Model Optimizations + +This model was obtained by quantizing the weights of [ibm-granite/granite-3.1-2b-instruct](https://huggingface.co/ibm-granite/granite-3.1-2b-instruct) to INT4 data type, ready for inference with vLLM >= 0.5.2. +This optimization reduces the number of bits per parameter from 16 to 4, reducing the disk size and GPU memory requirements by approximately 75%. Only the weights of the linear operators within transformers blocks are quantized. + +## Deployment + +### Use with vLLM + +This model can be deployed efficiently using the [vLLM](https://docs.vllm.ai/en/latest/) backend, as shown in the example below. + +```python +from transformers import AutoTokenizer +from vllm import LLM, SamplingParams + +max_model_len, tp_size = 4096, 1 +model_name = "neuralmagic/granite-3.1-2b-instruct-quantized.w4a16" +tokenizer = AutoTokenizer.from_pretrained(model_name) +llm = LLM(model=model_name, tensor_parallel_size=tp_size, max_model_len=max_model_len, trust_remote_code=True) +sampling_params = SamplingParams(temperature=0.3, max_tokens=256, stop_token_ids=[tokenizer.eos_token_id]) + +messages_list = [ + [{"role": "user", "content": "Who are you? Please respond in pirate speak!"}], +] + +prompt_token_ids = [tokenizer.apply_chat_template(messages, add_generation_prompt=True) for messages in messages_list] + +outputs = llm.generate(prompt_token_ids=prompt_token_ids, sampling_params=sampling_params) + +generated_text = [output.outputs[0].text for output in outputs] +print(generated_text) +``` + +vLLM also supports OpenAI-compatible serving. See the [documentation](https://docs.vllm.ai/en/latest/) for more details. + +## Creation + +This model was created with [llm-compressor](https://github.com/vllm-project/llm-compressor) by running the code snippet below. + +
+ Model Creation Code + +```bash +python quantize.py --model_path ibm-granite/granite-3.1-2b-instruct --quant_path "output_dir/granite-3.1-2b-instruct-quantized.w4a16" --calib_size 1024 --dampening_frac 0.01 --observer mse --group_size 64 +``` + + +```python +from datasets import load_dataset +from transformers import AutoTokenizer, AutoModelForCausalLM +from llmcompressor.modifiers.quantization import GPTQModifier +from llmcompressor.transformers import oneshot, apply +import argparse +from compressed_tensors.quantization import QuantizationScheme, QuantizationArgs, QuantizationType, QuantizationStrategy + + +parser = argparse.ArgumentParser() +parser.add_argument('--model_path', type=str) +parser.add_argument('--quant_path', type=str) +parser.add_argument('--calib_size', type=int, default=256) +parser.add_argument('--dampening_frac', type=float, default=0.1) +parser.add_argument('--observer', type=str, default="minmax") +parser.add_argument('--group_size', type=int, default="128") +args = parser.parse_args() + +model = AutoModelForCausalLM.from_pretrained( + args.model_path, + device_map="auto", + torch_dtype="auto", + use_cache=False, + trust_remote_code=True, +) +tokenizer = AutoTokenizer.from_pretrained(args.model_path) + + +NUM_CALIBRATION_SAMPLES = args.calib_size +DATASET_ID = "neuralmagic/LLM_compression_calibration" +DATASET_SPLIT = "train" +ds = load_dataset(DATASET_ID, split=DATASET_SPLIT) +ds = ds.shuffle(seed=42).select(range(NUM_CALIBRATION_SAMPLES)) + +def preprocess(example): + return {"text": example["text"]} + +ds = ds.map(preprocess) + +def tokenize(sample): + return tokenizer( + sample["text"], + padding=False, + truncation=False, + add_special_tokens=True, + ) + + +ds = ds.map(tokenize, remove_columns=ds.column_names) + +recipe = [ + GPTQModifier( + targets=["Linear"], + ignore=["lm_head"], + scheme="w4a16", + dampening_frac=args.dampening_frac, + observer=args.observer, + group_size=args.group_size + ) +] +oneshot( + model=model, + dataset=ds, + recipe=recipe, + num_calibration_samples=args.calib_size, + max_seq_length=8196, +) + +# Save to disk compressed. +model.save_pretrained(quant_path, save_compressed=True) +tokenizer.save_pretrained(quant_path) +``` +
+ +## Evaluation + +The model was evaluated on OpenLLM Leaderboard [V1](https://huggingface.co/spaces/open-llm-leaderboard-old/open_llm_leaderboard), OpenLLM Leaderboard [V2](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard#/) and on [HumanEval](https://github.com/neuralmagic/evalplus), using the following commands: + +
+Evaluation Commands + +OpenLLM Leaderboard V1: +``` +lm_eval \ + --model vllm \ + --model_args pretrained="neuralmagic/granite-3.1-2b-instruct-quantized.w4a16",dtype=auto,add_bos_token=True,max_model_len=4096,tensor_parallel_size=1,gpu_memory_utilization=0.8,enable_chunked_prefill=True,trust_remote_code=True \ + --tasks openllm \ + --write_out \ + --batch_size auto \ + --output_path output_dir \ + --show_config +``` + +OpenLLM Leaderboard V2: +``` +lm_eval \ + --model vllm \ + --model_args pretrained="neuralmagic/granite-3.1-2b-instruct-quantized.w4a16",dtype=auto,add_bos_token=True,max_model_len=4096,tensor_parallel_size=1,gpu_memory_utilization=0.8,enable_chunked_prefill=True,trust_remote_code=True \ + --tasks leaderboard \ + --write_out \ + --batch_size auto \ + --output_path output_dir \ + --show_config +``` + +#### HumanEval +##### Generation +``` +python3 codegen/generate.py \ + --model neuralmagic/granite-3.1-2b-instruct-quantized.w4a16 \ + --bs 16 \ + --temperature 0.2 \ + --n_samples 50 \ + --root "." \ + --dataset humaneval +``` +##### Sanitization +``` +python3 evalplus/sanitize.py \ + humaneval/neuralmagic--granite-3.1-2b-instruct-quantized.w4a16_vllm_temp_0.2 +``` +##### Evaluation +``` +evalplus.evaluate \ + --dataset humaneval \ + --samples humaneval/neuralmagic--granite-3.1-2b-instruct-quantized.w4a16_vllm_temp_0.2-sanitized +``` +
+ +### Accuracy + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
CategoryMetricibm-granite/granite-3.1-2b-instructneuralmagic/granite-3.1-2b-instruct-quantized.w4a16Recovery (%)
OpenLLM V1ARC-Challenge (Acc-Norm, 25-shot)55.6354.1897.39
GSM8K (Strict-Match, 5-shot)60.9662.85103.10
HellaSwag (Acc-Norm, 10-shot)75.2173.3697.54
MMLU (Acc, 5-shot)54.3852.1795.93
TruthfulQA (MC2, 0-shot)55.9356.83101.61
Winogrande (Acc, 5-shot)69.6769.85100.26
Average Score61.9861.5499.29
OpenLLM V2IFEval (Inst Level Strict Acc, 0-shot)67.9967.6399.47
BBH (Acc-Norm, 3-shot)44.1143.2297.98
Math-Hard (Exact-Match, 4-shot)8.668.77101.27
GPQA (Acc-Norm, 0-shot)28.3028.56100.92
MUSR (Acc-Norm, 0-shot)35.1235.26100.40
MMLU-Pro (Acc, 5-shot)26.8727.27101.49
Average Score35.1735.1299.84
CodingHumanEval Pass@153.4052.3097.94
+ + + +## Inference Performance + + +This model achieves up to 1.9x speedup in single-stream deployment, depending on hardware and use-case scenario. +The following performance benchmarks were conducted with [vLLM](https://docs.vllm.ai/en/latest/) version 0.6.6.post1, and [GuideLLM](https://github.com/neuralmagic/guidellm). + +
+Benchmarking Command + +``` +guidellm --model neuralmagic/granite-3.1-2b-instruct-quantized.w4a16 --target "http://localhost:8000/v1" --data-type emulated --data "prompt_tokens=,generated_tokens=" --max seconds 360 --backend aiohttp_server +``` + +
+ +### Single-stream performance (measured with vLLM version 0.6.6.post1) + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
Latency (s)
GPU classModelSpeedupCode Completion
prefill: 256 tokens
decode: 1024 tokens
Docstring Generation
prefill: 768 tokens
decode: 128 tokens
Code Fixing
prefill: 1024 tokens
decode: 1024 tokens
RAG
prefill: 1024 tokens
decode: 128 tokens
Instruction Following
prefill: 256 tokens
decode: 128 tokens
Multi-turn Chat
prefill: 512 tokens
decode: 256 tokens
Large Summarization
prefill: 4096 tokens
decode: 512 tokens
A5000granite-3.1-2b-instruct10.91.411.01.51.42.86.1
granite-3.1-2b-instruct-quantized.w8a81.377.91.08.01.11.02.04.7
granite-3.1-2b-instruct-quantized.w4a16
(this model)
1.945.40.75.50.80.71.43.4
A6000granite-3.1-2b-instruct9.81.310.01.31.32.65.4
granite-3.1-2b-instruct-quantized.w8a81.317.81.07.61.00.91.94.5
granite-3.1-2b-instruct-quantized.w4a16
(this model)
1.875.10.75.20.70.71.33.1
L40granite-3.1-2b-instruct9.31.29.41.21.22.35.0
granite-3.1-2b-instruct-FP8-dynamic1.267.30.97.41.00.91.84.1
granite-3.1-2b-instruct-quantized.w4a16
(this model)
1.884.80.64.90.60.61.22.8
\ No newline at end of file diff --git a/added_tokens.json b/added_tokens.json new file mode 100644 index 0000000..183eb81 --- /dev/null +++ b/added_tokens.json @@ -0,0 +1,5 @@ +{ + "<|end_of_role|>": 49153, + "<|start_of_role|>": 49152, + "<|tool_call|>": 49154 +} diff --git a/config.json b/config.json new file mode 100644 index 0000000..bd3ac4d --- /dev/null +++ b/config.json @@ -0,0 +1,65 @@ +{ + "_name_or_path": "ibm-granite/granite-3.1-2b-instruct", + "architectures": [ + "GraniteForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.1, + "attention_multiplier": 0.015625, + "bos_token_id": 0, + "embedding_multiplier": 12.0, + "eos_token_id": 0, + "hidden_act": "silu", + "hidden_size": 2048, + "initializer_range": 0.02, + "intermediate_size": 8192, + "logits_scaling": 8.0, + "max_position_embeddings": 131072, + "mlp_bias": false, + "model_type": "granite", + "num_attention_heads": 32, + "num_hidden_layers": 40, + "num_key_value_heads": 8, + "pad_token_id": 0, + "quantization_config": { + "config_groups": { + "group_0": { + "input_activations": null, + "output_activations": null, + "targets": [ + "Linear" + ], + "weights": { + "actorder": null, + "block_structure": null, + "dynamic": false, + "group_size": 64, + "num_bits": 4, + "observer": "mse", + "observer_kwargs": {}, + "strategy": "group", + "symmetric": true, + "type": "int" + } + } + }, + "format": "pack-quantized", + "global_compression_ratio": 2.0771812517233883, + "ignore": [ + "lm_head" + ], + "kv_cache_scheme": null, + "quant_method": "compressed-tensors", + "quantization_status": "compressed", + "sparsity_config": {} + }, + "residual_multiplier": 0.22, + "rms_norm_eps": 1e-05, + "rope_scaling": null, + "rope_theta": 5000000.0, + "tie_word_embeddings": true, + "torch_dtype": "bfloat16", + "transformers_version": "4.47.1", + "use_cache": true, + "vocab_size": 49155 +} diff --git a/configuration.json b/configuration.json new file mode 100644 index 0000000..bbeeda1 --- /dev/null +++ b/configuration.json @@ -0,0 +1 @@ +{"framework": "pytorch", "task": "text-generation", "allow_remote": true} \ No newline at end of file diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..614b75d --- /dev/null +++ b/generation_config.json @@ -0,0 +1,7 @@ +{ + "_from_model_config": true, + "bos_token_id": 0, + "eos_token_id": 0, + "pad_token_id": 0, + "transformers_version": "4.47.1" +} diff --git a/merges.txt b/merges.txt new file mode 100644 index 0000000..f9f6899 --- /dev/null +++ b/merges.txt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:303127a244b0078878156c17229f36d11b7a3a3f8e47b7cfdbb304ff46be5030 +size 441810 diff --git a/model.safetensors b/model.safetensors new file mode 100644 index 0000000..4475828 --- /dev/null +++ b/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:80eacfccfdee065bac8252fc7e806717b506678e7e35090eb0b3246380e9b4fb +size 1695488752 diff --git a/recipe.yaml b/recipe.yaml new file mode 100644 index 0000000..fa76d37 --- /dev/null +++ b/recipe.yaml @@ -0,0 +1,11 @@ +quant_stage: + quant_modifiers: + GPTQModifier: + sequential_update: true + dampening_frac: 0.01 + ignore: [lm_head] + config_groups: + group_0: + weights: {num_bits: 4, type: int, symmetric: true, strategy: group, group_size: 64, + observer: mse} + targets: [Linear] diff --git a/special_tokens_map.json b/special_tokens_map.json new file mode 100644 index 0000000..386500a --- /dev/null +++ b/special_tokens_map.json @@ -0,0 +1,35 @@ +{ + "additional_special_tokens": [ + "<|start_of_role|>", + "<|end_of_role|>", + "<|tool_call|>" + ], + "bos_token": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "eos_token": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "unk_token": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..de710f0 --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ed944c0b3d71e2d651a5ba0f8e7b350faff30031c8e3353de70b12b9c1bf5654 +size 3475806 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..0fe3c95 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ab17e0d532ecf47e9d8451939dd81f25dd98c5fba4b6742584549bbf9c1f06b9 +size 8072 diff --git a/vocab.json b/vocab.json new file mode 100644 index 0000000..8236182 --- /dev/null +++ b/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:80ab859339a2525fdfbda14bc39df02dffb824aefdaf86426217bbb146d17e01 +size 776995