初始化项目,由ModelHub XC社区提供模型

Model: bartowski/Duet_Minitron8b_v0.5-GGUF
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-05 22:58:12 +08:00
commit 933f6882c8
28 changed files with 249 additions and 0 deletions

60
.gitattributes vendored Normal file
View File

@@ -0,0 +1,60 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q6_K_L.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q6_K.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q5_K_L.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q5_K_M.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q5_K_S.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q4_K_L.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q4_K_M.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q4_K_S.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q4_0_8_8.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q4_0_4_8.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q4_0_4_4.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q4_0.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-IQ4_XS.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q3_K_XL.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q3_K_L.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q3_K_M.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-IQ3_M.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q3_K_S.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-IQ3_XS.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q2_K_L.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-Q2_K.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-IQ2_M.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5-f16.gguf filter=lfs diff=lfs merge=lfs -text
Duet_Minitron8b_v0.5.imatrix filter=lfs diff=lfs merge=lfs -text

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:46adfb7483be6d592392e57b17bbff0ceacffa21362e684b5cba76ae45799e63
size 3099936128

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:a92facbdf442510cd01a6fec2a0f30bd7c4e51c3c767cde7d4d1436bd59e3ce9
size 3976963456

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5e4cd8f8d3750b9f2e3f976e048e33e0304605a031b42a9e143bd7ff08d5664c
size 3684468096

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6dcd1062009bc38e83809d6b4a57e1f826392304f44d1d159dd1f4a924d0bca4
size 4660430208

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:f0bc48a2b39ab30da95688625f91efc20167604f1b69cf3b1d7df8a3f29c0f27
size 3333391744

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:70439758482604ab306efdf1c1ffee89990f5a89952b232efb8250f153be3225
size 3857679744

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5f7242b55058a074e23c8992131b74d6b22dcd56fb0944cd6323d6b437c0688f
size 4537091456

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:bffdaf1464f3c79a77f61920789e3985567784099f0a3796be0bacdde3a40e35
size 4209149312

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:138fbea7c1bc2f77a47133cc36b9d27d1b1239f59149a100d01730ba0ee939ec
size 3834217856

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:442cc00aa007cf4379324e9c57f700f59c68d29fc7d17b1aa85a7a9ba982555c
size 5006853504

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:9be1faf8e56fc1e529ea22fe25b28f5f2b9422110419b331072f8a9190429f0e
size 4895114624

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:ef9a5b23cf182751932bb2f5a09f98489e05adafdc2ed83b06f2576cd289a7a2
size 4880369024

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:7617d81f260f07af6c72e740fcf96a35bbc975a37e1c48f4f2d2f99f346cf116
size 4880369024

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:f985ef48817401d72677e115645136d4538b8829d16dd30a9c1786d9f86a327e
size 4880369024

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:307a3b1238b833612a5447c9817984a4f681dcb75935a3b8453d347a97596d7d
size 5543757184

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:9a3108ff1415f99dbcc9590e36b22f10ad4a5f178b4a00e7436f9927b42993c5
size 5145298304

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:7a4a0a62d07087f1acfc756fed6bde45795f1052509f05988aafadd7c19eed90
size 4911957376

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6233d2c0109f4a64b2afa45f10d63e8cd632e7558754bdea3bd3056695c4f21a
size 6332810624

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0bce08d3073e4151dc585d6a4055d29aa8b06887c1c5044acb065969e4391e54
size 6001460608

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d87d8a2427a3b78e37c19af81d6be7e146500d0bf37c1c6bc19e5e417ed9fb81
size 5864981888

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4d87c7fdc0a9ac21af38e348c686b8cafe7145f4ef27d09b10301ffbb9ed47fb
size 6911133056

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6af1276b98dc8abfcbd8a190bc77c7c5fad1d22379249a1b4a0fb76b295ffe0c
size 7171179904

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:e4defe9893232712e14c02afd321e12623a302888d6f4b1ee54161a516c27860
size 8948843904

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:3db02095ddda99fa3de3651a97d2f5917dcc90aae4185c92587e65faf68ab8de
size 16836756608

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c5f91566940088f358b6ab81cb10eee637af4a687d8e64d4a149a3837ad2ab7d
size 5784658

113
README.md Normal file
View File

@@ -0,0 +1,113 @@
---
base_model: G-reen/Duet_Minitron8b_v0.5
library_name: transformers
license: cc-by-2.0
pipeline_tag: text-generation
quantized_by: bartowski
---
## Llamacpp imatrix Quantizations of Duet_Minitron8b_v0.5
Using <a href="https://github.com/ggerganov/llama.cpp/">llama.cpp</a> release <a href="https://github.com/ggerganov/llama.cpp/releases/tag/b3634">b3634</a> for quantization.
Original model: https://huggingface.co/G-reen/Duet_Minitron8b_v0.5
All quants made using imatrix option with dataset from [here](https://gist.github.com/bartowski1182/eb213dccb3571f863da82e99418f81e8)
Run them in [LM Studio](https://lmstudio.ai/)
## Prompt format
No prompt format found, check original model page
## Download a file (not the whole branch) from below:
| Filename | Quant type | File Size | Split | Description |
| -------- | ---------- | --------- | ----- | ----------- |
| [Duet_Minitron8b_v0.5-f16.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-f16.gguf) | f16 | 16.84GB | false | Full F16 weights. |
| [Duet_Minitron8b_v0.5-Q8_0.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q8_0.gguf) | Q8_0 | 8.95GB | false | Extremely high quality, generally unneeded but max available quant. |
| [Duet_Minitron8b_v0.5-Q6_K_L.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q6_K_L.gguf) | Q6_K_L | 7.17GB | false | Uses Q8_0 for embed and output weights. Very high quality, near perfect, *recommended*. |
| [Duet_Minitron8b_v0.5-Q6_K.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q6_K.gguf) | Q6_K | 6.91GB | false | Very high quality, near perfect, *recommended*. |
| [Duet_Minitron8b_v0.5-Q5_K_L.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q5_K_L.gguf) | Q5_K_L | 6.33GB | false | Uses Q8_0 for embed and output weights. High quality, *recommended*. |
| [Duet_Minitron8b_v0.5-Q5_K_M.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q5_K_M.gguf) | Q5_K_M | 6.00GB | false | High quality, *recommended*. |
| [Duet_Minitron8b_v0.5-Q5_K_S.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q5_K_S.gguf) | Q5_K_S | 5.86GB | false | High quality, *recommended*. |
| [Duet_Minitron8b_v0.5-Q4_K_L.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q4_K_L.gguf) | Q4_K_L | 5.54GB | false | Uses Q8_0 for embed and output weights. Good quality, *recommended*. |
| [Duet_Minitron8b_v0.5-Q4_K_M.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q4_K_M.gguf) | Q4_K_M | 5.15GB | false | Good quality, default size for must use cases, *recommended*. |
| [Duet_Minitron8b_v0.5-Q3_K_XL.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q3_K_XL.gguf) | Q3_K_XL | 5.01GB | false | Uses Q8_0 for embed and output weights. Lower quality but usable, good for low RAM availability. |
| [Duet_Minitron8b_v0.5-Q4_K_S.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q4_K_S.gguf) | Q4_K_S | 4.91GB | false | Slightly lower quality with more space savings, *recommended*. |
| [Duet_Minitron8b_v0.5-Q4_0.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q4_0.gguf) | Q4_0 | 4.90GB | false | Legacy format, generally not worth using over similarly sized formats |
| [Duet_Minitron8b_v0.5-Q4_0_8_8.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q4_0_8_8.gguf) | Q4_0_8_8 | 4.88GB | false | Optimized for ARM and CPU inference, much faster than Q4_0 at similar quality. |
| [Duet_Minitron8b_v0.5-Q4_0_4_8.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q4_0_4_8.gguf) | Q4_0_4_8 | 4.88GB | false | Optimized for ARM and CPU inference, much faster than Q4_0 at similar quality. |
| [Duet_Minitron8b_v0.5-Q4_0_4_4.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q4_0_4_4.gguf) | Q4_0_4_4 | 4.88GB | false | Optimized for ARM and CPU inference, much faster than Q4_0 at similar quality. |
| [Duet_Minitron8b_v0.5-IQ4_XS.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-IQ4_XS.gguf) | IQ4_XS | 4.66GB | false | Decent quality, smaller than Q4_K_S with similar performance, *recommended*. |
| [Duet_Minitron8b_v0.5-Q3_K_L.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q3_K_L.gguf) | Q3_K_L | 4.54GB | false | Lower quality but usable, good for low RAM availability. |
| [Duet_Minitron8b_v0.5-Q3_K_M.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q3_K_M.gguf) | Q3_K_M | 4.21GB | false | Low quality. |
| [Duet_Minitron8b_v0.5-IQ3_M.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-IQ3_M.gguf) | IQ3_M | 3.98GB | false | Medium-low quality, new method with decent performance comparable to Q3_K_M. |
| [Duet_Minitron8b_v0.5-Q2_K_L.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q2_K_L.gguf) | Q2_K_L | 3.86GB | false | Uses Q8_0 for embed and output weights. Very low quality but surprisingly usable. |
| [Duet_Minitron8b_v0.5-Q3_K_S.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q3_K_S.gguf) | Q3_K_S | 3.83GB | false | Low quality, not recommended. |
| [Duet_Minitron8b_v0.5-IQ3_XS.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-IQ3_XS.gguf) | IQ3_XS | 3.68GB | false | Lower quality, new method with decent performance, slightly better than Q3_K_S. |
| [Duet_Minitron8b_v0.5-Q2_K.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-Q2_K.gguf) | Q2_K | 3.33GB | false | Very low quality but surprisingly usable. |
| [Duet_Minitron8b_v0.5-IQ2_M.gguf](https://huggingface.co/bartowski/Duet_Minitron8b_v0.5-GGUF/blob/main/Duet_Minitron8b_v0.5-IQ2_M.gguf) | IQ2_M | 3.10GB | false | Relatively low quality, uses SOTA techniques to be surprisingly usable. |
## Embed/output weights
Some of these quants (Q3_K_XL, Q4_K_L etc) are the standard quantization method with the embeddings and output weights quantized to Q8_0 instead of what they would normally default to.
Some say that this improves the quality, others don't notice any difference. If you use these models PLEASE COMMENT with your findings. I would like feedback that these are actually used and useful so I don't keep uploading quants no one is using.
Thanks!
## Credits
Thank you kalomaze and Dampf for assistance in creating the imatrix calibration dataset
Thank you ZeroWw for the inspiration to experiment with embed/output
## Downloading using huggingface-cli
First, make sure you have hugginface-cli installed:
```
pip install -U "huggingface_hub[cli]"
```
Then, you can target the specific file you want:
```
huggingface-cli download bartowski/Duet_Minitron8b_v0.5-GGUF --include "Duet_Minitron8b_v0.5-Q4_K_M.gguf" --local-dir ./
```
If the model is bigger than 50GB, it will have been split into multiple files. In order to download them all to a local folder, run:
```
huggingface-cli download bartowski/Duet_Minitron8b_v0.5-GGUF --include "Duet_Minitron8b_v0.5-Q8_0/*" --local-dir ./
```
You can either specify a new local-dir (Duet_Minitron8b_v0.5-Q8_0) or download them all in place (./)
## Which file should I choose?
A great write up with charts showing various performances is provided by Artefact2 [here](https://gist.github.com/Artefact2/b5f810600771265fc1e39442288e8ec9)
The first thing to figure out is how big a model you can run. To do this, you'll need to figure out how much RAM and/or VRAM you have.
If you want your model running as FAST as possible, you'll want to fit the whole thing on your GPU's VRAM. Aim for a quant with a file size 1-2GB smaller than your GPU's total VRAM.
If you want the absolute maximum quality, add both your system RAM and your GPU's VRAM together, then similarly grab a quant with a file size 1-2GB Smaller than that total.
Next, you'll need to decide if you want to use an 'I-quant' or a 'K-quant'.
If you don't want to think too much, grab one of the K-quants. These are in format 'QX_K_X', like Q5_K_M.
If you want to get more into the weeds, you can check out this extremely useful feature chart:
[llama.cpp feature matrix](https://github.com/ggerganov/llama.cpp/wiki/Feature-matrix)
But basically, if you're aiming for below Q4, and you're running cuBLAS (Nvidia) or rocBLAS (AMD), you should look towards the I-quants. These are in format IQX_X, like IQ3_M. These are newer and offer better performance for their size.
These I-quants can also be used on CPU and Apple Metal, but will be slower than their K-quant equivalent, so speed vs performance is a tradeoff you'll have to decide.
The I-quants are *not* compatible with Vulcan, which is also AMD, so if you have an AMD card double check if you're using the rocBLAS build or the Vulcan build. At the time of writing this, LM Studio has a preview with ROCm support, and other inference engines have specific builds for ROCm.
Want to support my work? Visit my ko-fi page here: https://ko-fi.com/bartowski

1
configuration.json Normal file
View File

@@ -0,0 +1 @@
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}