初始化项目,由ModelHub XC社区提供模型

Model: bartowski/magnum-v2-4b-GGUF
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-18 02:42:06 +08:00
commit 5d7c06f40c
28 changed files with 258 additions and 0 deletions

60
.gitattributes vendored Normal file
View File

@@ -0,0 +1,60 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q6_K_L.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q6_K.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q5_K_L.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q5_K_M.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q5_K_S.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q4_K_L.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q4_K_M.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q4_K_S.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q4_0_8_8.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q4_0_4_8.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q4_0_4_4.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q4_0.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-IQ4_XS.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q3_K_XL.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q3_K_L.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q3_K_M.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-IQ3_M.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q3_K_S.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-IQ3_XS.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q2_K_L.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-Q2_K.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-IQ2_M.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b-f16.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v2-4b.imatrix filter=lfs diff=lfs merge=lfs -text

122
README.md Normal file
View File

@@ -0,0 +1,122 @@
---
base_model: anthracite-org/magnum-v2-4b
language:
- en
license: apache-2.0
pipeline_tag: text-generation
tags:
- chat
quantized_by: bartowski
---
## Llamacpp imatrix Quantizations of magnum-v2-4b
Using <a href="https://github.com/ggerganov/llama.cpp/">llama.cpp</a> release <a href="https://github.com/ggerganov/llama.cpp/releases/tag/b3634">b3634</a> for quantization.
Original model: https://huggingface.co/anthracite-org/magnum-v2-4b
All quants made using imatrix option with dataset from [here](https://gist.github.com/bartowski1182/eb213dccb3571f863da82e99418f81e8)
Run them in [LM Studio](https://lmstudio.ai/)
## Prompt format
```
<|im_start|>system
{system_prompt}<|im_end|>
<|im_start|>user
{prompt}<|im_end|>
<|im_start|>assistant
```
## Download a file (not the whole branch) from below:
| Filename | Quant type | File Size | Split | Description |
| -------- | ---------- | --------- | ----- | ----------- |
| [magnum-v2-4b-f16.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-f16.gguf) | f16 | 9.03GB | false | Full F16 weights. |
| [magnum-v2-4b-Q8_0.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q8_0.gguf) | Q8_0 | 4.80GB | false | Extremely high quality, generally unneeded but max available quant. |
| [magnum-v2-4b-Q6_K_L.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q6_K_L.gguf) | Q6_K_L | 3.90GB | false | Uses Q8_0 for embed and output weights. Very high quality, near perfect, *recommended*. |
| [magnum-v2-4b-Q6_K.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q6_K.gguf) | Q6_K | 3.71GB | false | Very high quality, near perfect, *recommended*. |
| [magnum-v2-4b-Q5_K_L.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q5_K_L.gguf) | Q5_K_L | 3.47GB | false | Uses Q8_0 for embed and output weights. High quality, *recommended*. |
| [magnum-v2-4b-Q5_K_M.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q5_K_M.gguf) | Q5_K_M | 3.23GB | false | High quality, *recommended*. |
| [magnum-v2-4b-Q5_K_S.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q5_K_S.gguf) | Q5_K_S | 3.16GB | false | High quality, *recommended*. |
| [magnum-v2-4b-Q4_K_L.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q4_K_L.gguf) | Q4_K_L | 3.07GB | false | Uses Q8_0 for embed and output weights. Good quality, *recommended*. |
| [magnum-v2-4b-Q3_K_XL.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q3_K_XL.gguf) | Q3_K_XL | 2.81GB | false | Uses Q8_0 for embed and output weights. Lower quality but usable, good for low RAM availability. |
| [magnum-v2-4b-Q4_K_M.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q4_K_M.gguf) | Q4_K_M | 2.78GB | false | Good quality, default size for must use cases, *recommended*. |
| [magnum-v2-4b-Q4_K_S.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q4_K_S.gguf) | Q4_K_S | 2.66GB | false | Slightly lower quality with more space savings, *recommended*. |
| [magnum-v2-4b-Q4_0.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q4_0.gguf) | Q4_0 | 2.66GB | false | Legacy format, generally not worth using over similarly sized formats |
| [magnum-v2-4b-Q4_0_8_8.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q4_0_8_8.gguf) | Q4_0_8_8 | 2.65GB | false | Optimized for ARM and CPU inference, much faster than Q4_0 at similar quality. |
| [magnum-v2-4b-Q4_0_4_8.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q4_0_4_8.gguf) | Q4_0_4_8 | 2.65GB | false | Optimized for ARM and CPU inference, much faster than Q4_0 at similar quality. |
| [magnum-v2-4b-Q4_0_4_4.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q4_0_4_4.gguf) | Q4_0_4_4 | 2.65GB | false | Optimized for ARM and CPU inference, much faster than Q4_0 at similar quality. |
| [magnum-v2-4b-IQ4_XS.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-IQ4_XS.gguf) | IQ4_XS | 2.54GB | false | Decent quality, smaller than Q4_K_S with similar performance, *recommended*. |
| [magnum-v2-4b-Q3_K_L.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q3_K_L.gguf) | Q3_K_L | 2.46GB | false | Lower quality but usable, good for low RAM availability. |
| [magnum-v2-4b-Q3_K_M.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q3_K_M.gguf) | Q3_K_M | 2.30GB | false | Low quality. |
| [magnum-v2-4b-Q2_K_L.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q2_K_L.gguf) | Q2_K_L | 2.22GB | false | Uses Q8_0 for embed and output weights. Very low quality but surprisingly usable. |
| [magnum-v2-4b-IQ3_M.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-IQ3_M.gguf) | IQ3_M | 2.18GB | false | Medium-low quality, new method with decent performance comparable to Q3_K_M. |
| [magnum-v2-4b-Q3_K_S.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q3_K_S.gguf) | Q3_K_S | 2.10GB | false | Low quality, not recommended. |
| [magnum-v2-4b-IQ3_XS.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-IQ3_XS.gguf) | IQ3_XS | 2.03GB | false | Lower quality, new method with decent performance, slightly better than Q3_K_S. |
| [magnum-v2-4b-Q2_K.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-Q2_K.gguf) | Q2_K | 1.84GB | false | Very low quality but surprisingly usable. |
| [magnum-v2-4b-IQ2_M.gguf](https://huggingface.co/bartowski/magnum-v2-4b-GGUF/blob/main/magnum-v2-4b-IQ2_M.gguf) | IQ2_M | 1.72GB | false | Relatively low quality, uses SOTA techniques to be surprisingly usable. |
## Embed/output weights
Some of these quants (Q3_K_XL, Q4_K_L etc) are the standard quantization method with the embeddings and output weights quantized to Q8_0 instead of what they would normally default to.
Some say that this improves the quality, others don't notice any difference. If you use these models PLEASE COMMENT with your findings. I would like feedback that these are actually used and useful so I don't keep uploading quants no one is using.
Thanks!
## Credits
Thank you kalomaze and Dampf for assistance in creating the imatrix calibration dataset
Thank you ZeroWw for the inspiration to experiment with embed/output
## Downloading using huggingface-cli
First, make sure you have hugginface-cli installed:
```
pip install -U "huggingface_hub[cli]"
```
Then, you can target the specific file you want:
```
huggingface-cli download bartowski/magnum-v2-4b-GGUF --include "magnum-v2-4b-Q4_K_M.gguf" --local-dir ./
```
If the model is bigger than 50GB, it will have been split into multiple files. In order to download them all to a local folder, run:
```
huggingface-cli download bartowski/magnum-v2-4b-GGUF --include "magnum-v2-4b-Q8_0/*" --local-dir ./
```
You can either specify a new local-dir (magnum-v2-4b-Q8_0) or download them all in place (./)
## Which file should I choose?
A great write up with charts showing various performances is provided by Artefact2 [here](https://gist.github.com/Artefact2/b5f810600771265fc1e39442288e8ec9)
The first thing to figure out is how big a model you can run. To do this, you'll need to figure out how much RAM and/or VRAM you have.
If you want your model running as FAST as possible, you'll want to fit the whole thing on your GPU's VRAM. Aim for a quant with a file size 1-2GB smaller than your GPU's total VRAM.
If you want the absolute maximum quality, add both your system RAM and your GPU's VRAM together, then similarly grab a quant with a file size 1-2GB Smaller than that total.
Next, you'll need to decide if you want to use an 'I-quant' or a 'K-quant'.
If you don't want to think too much, grab one of the K-quants. These are in format 'QX_K_X', like Q5_K_M.
If you want to get more into the weeds, you can check out this extremely useful feature chart:
[llama.cpp feature matrix](https://github.com/ggerganov/llama.cpp/wiki/Feature-matrix)
But basically, if you're aiming for below Q4, and you're running cuBLAS (Nvidia) or rocBLAS (AMD), you should look towards the I-quants. These are in format IQX_X, like IQ3_M. These are newer and offer better performance for their size.
These I-quants can also be used on CPU and Apple Metal, but will be slower than their K-quant equivalent, so speed vs performance is a tradeoff you'll have to decide.
The I-quants are *not* compatible with Vulcan, which is also AMD, so if you have an AMD card double check if you're using the rocBLAS build or the Vulcan build. At the time of writing this, LM Studio has a preview with ROCm support, and other inference engines have specific builds for ROCm.
Want to support my work? Visit my ko-fi page here: https://ko-fi.com/bartowski

1
configuration.json Normal file
View File

@@ -0,0 +1 @@
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}

3
magnum-v2-4b-IQ2_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:35e4ca887b06fdbcd12456b905a41289aa986f425f23bdb842ad927c803f5e66
size 1722633696

3
magnum-v2-4b-IQ3_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b4a50c9975f8afe10e9f96a04f8e346f013637ecdfb5150a84443353fc6c68ad
size 2183415264

3
magnum-v2-4b-IQ3_XS.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:9c0ca5c5785f3856d9a7ea63a27404dd19cb33c1efe17134383b7427c90c7aa0
size 2027603424

3
magnum-v2-4b-IQ4_XS.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:895526cd66df8359b3987f6029d87b2a3b17cf1bbf65f77d342bfe586c6fbb00
size 2535546336

3
magnum-v2-4b-Q2_K.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0a226ad081e6e7e6fc4b486bfd91dcc75b0a61b7e3e34efa6b995c73e890387c
size 1839738336

3
magnum-v2-4b-Q2_K_L.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:15aae2aad62695b0c7ea8a2220131f836968b8a08c18118c26be67e4c47e0629
size 2224506336

3
magnum-v2-4b-Q3_K_L.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:e798398589203a25e73997186838ec59050b615d3a2aac7eb8d9b82a31d4c0d4
size 2464859616

3
magnum-v2-4b-Q3_K_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b3938260e0ce7cf05a684087a6093a9e99b31e83abd36b2d3320ee76ea03eebb
size 2296563168

3
magnum-v2-4b-Q3_K_S.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:f1800ae67ab433ffe4afc76a69e0285a484d9c56a0486f3a4f3c8c7a11e7d889
size 2101528032

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:f11933d450b8268d65d5ff753a420596d1f16cd0a09c9b2f7072cbc6f8e6a0f1
size 2809611744

3
magnum-v2-4b-Q4_0.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0c0e3f1f768139c14f5a36ea6a2a2c54682cc1f0043ed7a2c43ea191f2c7417e
size 2655600096

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:a202cd6ba3962f595a1da2b62493c77fda3feb955b408d1a010ea7db7d3c3dee
size 2648522208

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d2e006448aea6f773d4fa8601d4fd4e3cb72850e3003845b26c5049d0ceedd7d
size 2648522208

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1f832249d524da9fceb9b251bfcbad57904a8c6627c68b5a832a85d67ecad3e1
size 2648522208

3
magnum-v2-4b-Q4_K_L.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:7765c42cc5765e24e1974324b5168f3bcc4f3a76832aa10f8feda8fca6867538
size 3070707168

3
magnum-v2-4b-Q4_K_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:777b5b091b4d883d7b68eb2349f1f34ad66e436d69c6a75a1cf9ef3ea3864343
size 2778283488

3
magnum-v2-4b-Q4_K_S.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0c1a59aa2b15c9d7537d42069e84837214e78b4e28f0157a7e2f18f6d1da6e27
size 2664250848

3
magnum-v2-4b-Q5_K_L.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:91e17d8683a1f7686da3c87612559b8e04d6ed07124feea5da8bd82a0720b3be
size 3473360352

3
magnum-v2-4b-Q5_K_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:79153f7de32441bded0a31c0531c873fa627e9657a8d168dc6f9f74b912706cb
size 3230186976

3
magnum-v2-4b-Q5_K_S.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6c0b74a4f19cfd29e5e95c13962ccaee804666cab758526659c532432282637d
size 3163340256

3
magnum-v2-4b-Q6_K.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:2c1d61fb39302bbfac01ed6861de5db606bad53e57697a4a284efd6b3d49386a
size 3710334432

3
magnum-v2-4b-Q6_K_L.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:856b9f00fed3b893af4df31592f0b191e4b64299aeef8c5679627e6bda74c9fe
size 3901179360

3
magnum-v2-4b-Q8_0.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:844834b80f93d32844a4fed84f94573bcb212a8c9630058d0a3557384df91d68
size 4803216864

3
magnum-v2-4b-f16.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:cda807f13524bc60d508d76e8855005694a670ada77804dd0c2f8013e6c29be8
size 9033729248

3
magnum-v2-4b.imatrix Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:9377ebde26eaa38e1be342193567c7668711875c8ac204becf66ae6ad49172be
size 3677450