初始化项目,由ModelHub XC社区提供模型

Model: bartowski/granite-3.0-1b-a400m-instruct-GGUF
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-18 02:37:06 +08:00
commit f43242dec5
24 changed files with 363 additions and 0 deletions

56
.gitattributes vendored Normal file
View File

@@ -0,0 +1,56 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q6_K_L.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q6_K.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q5_K_L.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q5_K_M.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q5_K_S.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q4_K_L.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q4_K_M.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q4_K_S.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q4_0_8_8.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q4_0_4_8.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q4_0_4_4.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q4_0.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-IQ4_XS.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q3_K_XL.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q3_K_L.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q3_K_M.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-IQ3_M.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-Q3_K_S.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct-f16.gguf filter=lfs diff=lfs merge=lfs -text
granite-3.0-1b-a400m-instruct.imatrix filter=lfs diff=lfs merge=lfs -text

243
README.md Normal file
View File

@@ -0,0 +1,243 @@
---
base_model: ibm-granite/granite-3.0-1b-a400m-instruct
license: apache-2.0
pipeline_tag: text-generation
tags:
- language
- granite-3.0
quantized_by: bartowski
inference: false
model-index:
- name: granite-3.0-2b-instruct
results:
- task:
type: text-generation
dataset:
name: IFEval
type: instruction-following
metrics:
- type: pass@1
value: 32.39
name: pass@1
- type: pass@1
value: 6.17
name: pass@1
- task:
type: text-generation
dataset:
name: AGI-Eval
type: human-exams
metrics:
- type: pass@1
value: 20.35
name: pass@1
- type: pass@1
value: 32.0
name: pass@1
- type: pass@1
value: 12.21
name: pass@1
- task:
type: text-generation
dataset:
name: OBQA
type: commonsense
metrics:
- type: pass@1
value: 38.4
name: pass@1
- type: pass@1
value: 47.55
name: pass@1
- type: pass@1
value: 65.59
name: pass@1
- type: pass@1
value: 61.17
name: pass@1
- type: pass@1
value: 49.11
name: pass@1
- task:
type: text-generation
dataset:
name: BoolQ
type: reading-comprehension
metrics:
- type: pass@1
value: 70.12
name: pass@1
- type: pass@1
value: 1.27
name: pass@1
- task:
type: text-generation
dataset:
name: ARC-C
type: reasoning
metrics:
- type: pass@1
value: 41.21
name: pass@1
- type: pass@1
value: 23.07
name: pass@1
- type: pass@1
value: 31.77
name: pass@1
- task:
type: text-generation
dataset:
name: HumanEvalSynthesis
type: code
metrics:
- type: pass@1
value: 30.18
name: pass@1
- type: pass@1
value: 26.22
name: pass@1
- type: pass@1
value: 21.95
name: pass@1
- type: pass@1
value: 15.4
name: pass@1
- task:
type: text-generation
dataset:
name: GSM8K
type: math
metrics:
- type: pass@1
value: 26.31
name: pass@1
- type: pass@1
value: 10.88
name: pass@1
- task:
type: text-generation
dataset:
name: PAWS-X (7 langs)
type: multilingual
metrics:
- type: pass@1
value: 45.84
name: pass@1
- type: pass@1
value: 11.8
name: pass@1
---
## Llamacpp imatrix Quantizations of granite-3.0-1b-a400m-instruct
Using <a href="https://github.com/ggerganov/llama.cpp/">llama.cpp</a> release <a href="https://github.com/ggerganov/llama.cpp/releases/tag/b3930">b3930</a> for quantization.
Original model: https://huggingface.co/ibm-granite/granite-3.0-1b-a400m-instruct
All quants made using imatrix option with dataset from [here](https://gist.github.com/bartowski1182/eb213dccb3571f863da82e99418f81e8)
Run them in [LM Studio](https://lmstudio.ai/)
## Prompt format
```
<|start_of_role|>system<|end_of_role|>{system_prompt}<|end_of_text|>
<|start_of_role|>user<|end_of_role|>{prompt}<|end_of_text|>
<|start_of_role|>assistant<|end_of_role|>
```
## Download a file (not the whole branch) from below:
| Filename | Quant type | File Size | Split | Description |
| -------- | ---------- | --------- | ----- | ----------- |
| [granite-3.0-1b-a400m-instruct-f16.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-f16.gguf) | f16 | 2.67GB | false | Full F16 weights. |
| [granite-3.0-1b-a400m-instruct-Q8_0.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q8_0.gguf) | Q8_0 | 1.42GB | false | Extremely high quality, generally unneeded but max available quant. |
| [granite-3.0-1b-a400m-instruct-Q6_K_L.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q6_K_L.gguf) | Q6_K_L | 1.11GB | false | Uses Q8_0 for embed and output weights. Very high quality, near perfect, *recommended*. |
| [granite-3.0-1b-a400m-instruct-Q6_K.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q6_K.gguf) | Q6_K | 1.10GB | false | Very high quality, near perfect, *recommended*. |
| [granite-3.0-1b-a400m-instruct-Q5_K_L.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q5_K_L.gguf) | Q5_K_L | 0.97GB | false | Uses Q8_0 for embed and output weights. High quality, *recommended*. |
| [granite-3.0-1b-a400m-instruct-Q5_K_M.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q5_K_M.gguf) | Q5_K_M | 0.96GB | false | High quality, *recommended*. |
| [granite-3.0-1b-a400m-instruct-Q5_K_S.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q5_K_S.gguf) | Q5_K_S | 0.93GB | false | High quality, *recommended*. |
| [granite-3.0-1b-a400m-instruct-Q4_K_L.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q4_K_L.gguf) | Q4_K_L | 0.83GB | false | Uses Q8_0 for embed and output weights. Good quality, *recommended*. |
| [granite-3.0-1b-a400m-instruct-Q4_K_M.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q4_K_M.gguf) | Q4_K_M | 0.82GB | false | Good quality, default size for must use cases, *recommended*. |
| [granite-3.0-1b-a400m-instruct-Q4_K_S.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q4_K_S.gguf) | Q4_K_S | 0.77GB | false | Slightly lower quality with more space savings, *recommended*. |
| [granite-3.0-1b-a400m-instruct-Q4_0_8_8.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q4_0_8_8.gguf) | Q4_0_8_8 | 0.77GB | false | Optimized for ARM inference. Requires 'sve' support (see link below). *Don't use on Mac or Windows*. |
| [granite-3.0-1b-a400m-instruct-Q4_0_4_8.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q4_0_4_8.gguf) | Q4_0_4_8 | 0.77GB | false | Optimized for ARM inference. Requires 'i8mm' support (see link below). *Don't use on Mac or Windows*. |
| [granite-3.0-1b-a400m-instruct-Q4_0_4_4.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q4_0_4_4.gguf) | Q4_0_4_4 | 0.77GB | false | Optimized for ARM inference. Should work well on all ARM chips, pick this if you're unsure. *Don't use on Mac or Windows*. |
| [granite-3.0-1b-a400m-instruct-Q4_0.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q4_0.gguf) | Q4_0 | 0.77GB | false | Legacy format, generally not worth using over similarly sized formats |
| [granite-3.0-1b-a400m-instruct-IQ4_XS.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-IQ4_XS.gguf) | IQ4_XS | 0.73GB | false | Decent quality, smaller than Q4_K_S with similar performance, *recommended*. |
| [granite-3.0-1b-a400m-instruct-Q3_K_XL.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q3_K_XL.gguf) | Q3_K_XL | 0.72GB | false | Uses Q8_0 for embed and output weights. Lower quality but usable, good for low RAM availability. |
| [granite-3.0-1b-a400m-instruct-Q3_K_L.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q3_K_L.gguf) | Q3_K_L | 0.71GB | false | Lower quality but usable, good for low RAM availability. |
| [granite-3.0-1b-a400m-instruct-Q3_K_M.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q3_K_M.gguf) | Q3_K_M | 0.66GB | false | Low quality. |
| [granite-3.0-1b-a400m-instruct-IQ3_M.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-IQ3_M.gguf) | IQ3_M | 0.61GB | false | Medium-low quality, new method with decent performance comparable to Q3_K_M. |
| [granite-3.0-1b-a400m-instruct-Q3_K_S.gguf](https://huggingface.co/bartowski/granite-3.0-1b-a400m-instruct-GGUF/blob/main/granite-3.0-1b-a400m-instruct-Q3_K_S.gguf) | Q3_K_S | 0.60GB | false | Low quality, not recommended. |
## Embed/output weights
Some of these quants (Q3_K_XL, Q4_K_L etc) are the standard quantization method with the embeddings and output weights quantized to Q8_0 instead of what they would normally default to.
Some say that this improves the quality, others don't notice any difference. If you use these models PLEASE COMMENT with your findings. I would like feedback that these are actually used and useful so I don't keep uploading quants no one is using.
Thanks!
## Downloading using huggingface-cli
First, make sure you have hugginface-cli installed:
```
pip install -U "huggingface_hub[cli]"
```
Then, you can target the specific file you want:
```
huggingface-cli download bartowski/granite-3.0-1b-a400m-instruct-GGUF --include "granite-3.0-1b-a400m-instruct-Q4_K_M.gguf" --local-dir ./
```
If the model is bigger than 50GB, it will have been split into multiple files. In order to download them all to a local folder, run:
```
huggingface-cli download bartowski/granite-3.0-1b-a400m-instruct-GGUF --include "granite-3.0-1b-a400m-instruct-Q8_0/*" --local-dir ./
```
You can either specify a new local-dir (granite-3.0-1b-a400m-instruct-Q8_0) or download them all in place (./)
## Q4_0_X_X
These are *NOT* for Metal (Apple) offloading, only ARM chips.
If you're using an ARM chip, the Q4_0_X_X quants will have a substantial speedup. Check out Q4_0_4_4 speed comparisons [on the original pull request](https://github.com/ggerganov/llama.cpp/pull/5780#pullrequestreview-21657544660)
To check which one would work best for your ARM chip, you can check [AArch64 SoC features](https://gpages.juszkiewicz.com.pl/arm-socs-table/arm-socs.html) (thanks EloyOn!).
## Which file should I choose?
A great write up with charts showing various performances is provided by Artefact2 [here](https://gist.github.com/Artefact2/b5f810600771265fc1e39442288e8ec9)
The first thing to figure out is how big a model you can run. To do this, you'll need to figure out how much RAM and/or VRAM you have.
If you want your model running as FAST as possible, you'll want to fit the whole thing on your GPU's VRAM. Aim for a quant with a file size 1-2GB smaller than your GPU's total VRAM.
If you want the absolute maximum quality, add both your system RAM and your GPU's VRAM together, then similarly grab a quant with a file size 1-2GB Smaller than that total.
Next, you'll need to decide if you want to use an 'I-quant' or a 'K-quant'.
If you don't want to think too much, grab one of the K-quants. These are in format 'QX_K_X', like Q5_K_M.
If you want to get more into the weeds, you can check out this extremely useful feature chart:
[llama.cpp feature matrix](https://github.com/ggerganov/llama.cpp/wiki/Feature-matrix)
But basically, if you're aiming for below Q4, and you're running cuBLAS (Nvidia) or rocBLAS (AMD), you should look towards the I-quants. These are in format IQX_X, like IQ3_M. These are newer and offer better performance for their size.
These I-quants can also be used on CPU and Apple Metal, but will be slower than their K-quant equivalent, so speed vs performance is a tradeoff you'll have to decide.
The I-quants are *not* compatible with Vulcan, which is also AMD, so if you have an AMD card double check if you're using the rocBLAS build or the Vulcan build. At the time of writing this, LM Studio has a preview with ROCm support, and other inference engines have specific builds for ROCm.
## Credits
Thank you kalomaze and Dampf for assistance in creating the imatrix calibration dataset
Thank you ZeroWw for the inspiration to experiment with embed/output
Want to support my work? Visit my ko-fi page here: https://ko-fi.com/bartowski

1
configuration.json Normal file
View File

@@ -0,0 +1 @@
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6bdab05e59df5cbdff928a10dfec4264fbcd679295541ef21af6d5cff0757995
size 609557536

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5fb4e64937a52d710c46228f568e17a2a5c1e5c115d58c5db5f2957c04b7a91f
size 728210464

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:8ddcf56fb979c5b7e0433a9d61e7f2a53937a2ca2ba031d4a32d667843c84281
size 711400480

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:076a608da534196f774d6146aa145033c5835096bf745a202e4639b0aaf27c48
size 658578464

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:3b30dcdd4a3657ddb3b030c916a810a1b8445e817bbd31be2dd66c71a77f19f8
size 597859360

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:699e817f7b905df3184168e18beb38e21c07893f1ac1b56576274afa2bddfe74
size 723590912

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:726a6c488697828d075880a3c06d99df9b8fee0f5cb820072d5c86c8e553440e
size 771464224

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5e57c34c1138e9bdda8ef0eff6f13dafc87e473841259690a39033d9dc4c6867
size 768318496

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0014683e61e4a74f497b9c7a8761c081666670a2443232baf8fb6e7f5bf0a8de
size 768318496

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:333ac2a5c0ba5ea965bb661ec35c0ab79e5236fcd552d78cb4507cef82f9bdd6
size 768318496

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:01bb6abe27bb19338fc108ee3a52f2ede5369c49c0b094f12f921e26c1aff295
size 834035456

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:074f09e13484e54e73c93830d34e9fa9917a6319fb8bae762a22594b9b4da0dc
size 821845024

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d5b8fd681d3443e447b3a0b1a96dffc2ee817be51451e51279b89d1891c3ef79
size 774872096

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:a681e97d4bb871efd0c136ea92794aa68fa98028f2ac85073d1c2b3897da0f0d
size 968515328

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b3c31ddd2430b2280150809dff74c6343a1aeb570167eeed0ef8c407862f227a
size 956324896

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:de51215cda4567edb8f565d36e186e4d8e4842c18d9f060f2230093d631852ee
size 928750624

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:64b64ca07d7167c558ad4d491bbdbf8a36968b8145e2f0f1744a6025777b17eb
size 1099209760

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:8000e151206d9b5e5caad8c60d5e210e3ec2b338d9f5fe404df6a770610890d7
size 1111400192

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:8c37dd0c10b73e9304b98a242be4adcd3050c09e9042c4862d49e2cfccf35411
size 1422237440

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:e3682702031125622ad01b0269add4a7416ef604fae213f06744867b4bb38846
size 2672666912

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:dd783c1af5d12e51913c9d72f926cd67890d18ab58e0546396e98e5c180e8f69
size 8362672