初始化项目,由ModelHub XC社区提供模型

Model: bartowski/magnum-v3-9b-customgemma2-GGUF
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-14 00:53:13 +08:00
commit e55f607422
28 changed files with 258 additions and 0 deletions

60
.gitattributes vendored Normal file
View File

@@ -0,0 +1,60 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q6_K_L.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q6_K.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q5_K_L.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q5_K_M.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q5_K_S.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q4_K_L.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q4_K_M.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q4_K_S.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q4_0_8_8.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q4_0_4_8.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q4_0_4_4.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q4_0.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-IQ4_XS.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q3_K_XL.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q3_K_L.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q3_K_M.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-IQ3_M.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q3_K_S.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-IQ3_XS.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q2_K_L.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-Q2_K.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-IQ2_M.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2-f16.gguf filter=lfs diff=lfs merge=lfs -text
magnum-v3-9b-customgemma2.imatrix filter=lfs diff=lfs merge=lfs -text

122
README.md Normal file
View File

@@ -0,0 +1,122 @@
---
base_model: anthracite-org/magnum-v3-9b-customgemma2
license: gemma
pipeline_tag: text-generation
quantized_by: bartowski
model-index:
- name: magnum-v3-9b-customgemma2
results: []
---
## Llamacpp imatrix Quantizations of magnum-v3-9b-customgemma2
Using <a href="https://github.com/ggerganov/llama.cpp/">llama.cpp</a> release <a href="https://github.com/ggerganov/llama.cpp/releases/tag/b3658">b3658</a> for quantization.
Original model: https://huggingface.co/anthracite-org/magnum-v3-9b-customgemma2
All quants made using imatrix option with dataset from [here](https://gist.github.com/bartowski1182/eb213dccb3571f863da82e99418f81e8)
Run them in [LM Studio](https://lmstudio.ai/)
## Prompt format
No prompt format found, check original model page
## Download a file (not the whole branch) from below:
| Filename | Quant type | File Size | Split | Description |
| -------- | ---------- | --------- | ----- | ----------- |
| [magnum-v3-9b-customgemma2-f16.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-f16.gguf) | f16 | 18.49GB | false | Full F16 weights. |
| [magnum-v3-9b-customgemma2-Q8_0.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q8_0.gguf) | Q8_0 | 9.83GB | false | Extremely high quality, generally unneeded but max available quant. |
| [magnum-v3-9b-customgemma2-Q6_K_L.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q6_K_L.gguf) | Q6_K_L | 7.81GB | false | Uses Q8_0 for embed and output weights. Very high quality, near perfect, *recommended*. |
| [magnum-v3-9b-customgemma2-Q6_K.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q6_K.gguf) | Q6_K | 7.59GB | false | Very high quality, near perfect, *recommended*. |
| [magnum-v3-9b-customgemma2-Q5_K_L.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q5_K_L.gguf) | Q5_K_L | 6.87GB | false | Uses Q8_0 for embed and output weights. High quality, *recommended*. |
| [magnum-v3-9b-customgemma2-Q5_K_M.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q5_K_M.gguf) | Q5_K_M | 6.65GB | false | High quality, *recommended*. |
| [magnum-v3-9b-customgemma2-Q5_K_S.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q5_K_S.gguf) | Q5_K_S | 6.48GB | false | High quality, *recommended*. |
| [magnum-v3-9b-customgemma2-Q4_K_L.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q4_K_L.gguf) | Q4_K_L | 5.98GB | false | Uses Q8_0 for embed and output weights. Good quality, *recommended*. |
| [magnum-v3-9b-customgemma2-Q4_K_M.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q4_K_M.gguf) | Q4_K_M | 5.76GB | false | Good quality, default size for must use cases, *recommended*. |
| [magnum-v3-9b-customgemma2-Q4_K_S.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q4_K_S.gguf) | Q4_K_S | 5.48GB | false | Slightly lower quality with more space savings, *recommended*. |
| [magnum-v3-9b-customgemma2-Q4_0.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q4_0.gguf) | Q4_0 | 5.46GB | false | Legacy format, generally not worth using over similarly sized formats |
| [magnum-v3-9b-customgemma2-Q4_0_8_8.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q4_0_8_8.gguf) | Q4_0_8_8 | 5.44GB | false | Optimized for ARM inference. Requires 'sve' support (see link below). |
| [magnum-v3-9b-customgemma2-Q4_0_4_8.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q4_0_4_8.gguf) | Q4_0_4_8 | 5.44GB | false | Optimized for ARM inference. Requires 'i8mm' support (see link below). |
| [magnum-v3-9b-customgemma2-Q4_0_4_4.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q4_0_4_4.gguf) | Q4_0_4_4 | 5.44GB | false | Optimized for ARM inference. Should work well on all ARM chips, pick this if you're unsure. |
| [magnum-v3-9b-customgemma2-Q3_K_XL.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q3_K_XL.gguf) | Q3_K_XL | 5.35GB | false | Uses Q8_0 for embed and output weights. Lower quality but usable, good for low RAM availability. |
| [magnum-v3-9b-customgemma2-IQ4_XS.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-IQ4_XS.gguf) | IQ4_XS | 5.18GB | false | Decent quality, smaller than Q4_K_S with similar performance, *recommended*. |
| [magnum-v3-9b-customgemma2-Q3_K_L.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q3_K_L.gguf) | Q3_K_L | 5.13GB | false | Lower quality but usable, good for low RAM availability. |
| [magnum-v3-9b-customgemma2-Q3_K_M.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q3_K_M.gguf) | Q3_K_M | 4.76GB | false | Low quality. |
| [magnum-v3-9b-customgemma2-IQ3_M.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-IQ3_M.gguf) | IQ3_M | 4.49GB | false | Medium-low quality, new method with decent performance comparable to Q3_K_M. |
| [magnum-v3-9b-customgemma2-Q3_K_S.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q3_K_S.gguf) | Q3_K_S | 4.34GB | false | Low quality, not recommended. |
| [magnum-v3-9b-customgemma2-IQ3_XS.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-IQ3_XS.gguf) | IQ3_XS | 4.14GB | false | Lower quality, new method with decent performance, slightly better than Q3_K_S. |
| [magnum-v3-9b-customgemma2-Q2_K_L.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q2_K_L.gguf) | Q2_K_L | 4.03GB | false | Uses Q8_0 for embed and output weights. Very low quality but surprisingly usable. |
| [magnum-v3-9b-customgemma2-Q2_K.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-Q2_K.gguf) | Q2_K | 3.81GB | false | Very low quality but surprisingly usable. |
| [magnum-v3-9b-customgemma2-IQ2_M.gguf](https://huggingface.co/bartowski/magnum-v3-9b-customgemma2-GGUF/blob/main/magnum-v3-9b-customgemma2-IQ2_M.gguf) | IQ2_M | 3.43GB | false | Relatively low quality, uses SOTA techniques to be surprisingly usable. |
## Embed/output weights
Some of these quants (Q3_K_XL, Q4_K_L etc) are the standard quantization method with the embeddings and output weights quantized to Q8_0 instead of what they would normally default to.
Some say that this improves the quality, others don't notice any difference. If you use these models PLEASE COMMENT with your findings. I would like feedback that these are actually used and useful so I don't keep uploading quants no one is using.
Thanks!
## Downloading using huggingface-cli
First, make sure you have hugginface-cli installed:
```
pip install -U "huggingface_hub[cli]"
```
Then, you can target the specific file you want:
```
huggingface-cli download bartowski/magnum-v3-9b-customgemma2-GGUF --include "magnum-v3-9b-customgemma2-Q4_K_M.gguf" --local-dir ./
```
If the model is bigger than 50GB, it will have been split into multiple files. In order to download them all to a local folder, run:
```
huggingface-cli download bartowski/magnum-v3-9b-customgemma2-GGUF --include "magnum-v3-9b-customgemma2-Q8_0/*" --local-dir ./
```
You can either specify a new local-dir (magnum-v3-9b-customgemma2-Q8_0) or download them all in place (./)
## Q4_0_X_X
These are *NOT* for Metal (Apple) offloading, only ARM chips.
If you're using an ARM chip, the Q4_0_X_X quants will have a substantial speedup. Check out Q4_0_4_4 speed comparisons [on the original pull request](https://github.com/ggerganov/llama.cpp/pull/5780#pullrequestreview-21657544660)
To check which one would work best for your ARM chip, you can check [AArch64 SoC features](https://gpages.juszkiewicz.com.pl/arm-socs-table/arm-socs.html) (thanks EloyOn!).
## Which file should I choose?
A great write up with charts showing various performances is provided by Artefact2 [here](https://gist.github.com/Artefact2/b5f810600771265fc1e39442288e8ec9)
The first thing to figure out is how big a model you can run. To do this, you'll need to figure out how much RAM and/or VRAM you have.
If you want your model running as FAST as possible, you'll want to fit the whole thing on your GPU's VRAM. Aim for a quant with a file size 1-2GB smaller than your GPU's total VRAM.
If you want the absolute maximum quality, add both your system RAM and your GPU's VRAM together, then similarly grab a quant with a file size 1-2GB Smaller than that total.
Next, you'll need to decide if you want to use an 'I-quant' or a 'K-quant'.
If you don't want to think too much, grab one of the K-quants. These are in format 'QX_K_X', like Q5_K_M.
If you want to get more into the weeds, you can check out this extremely useful feature chart:
[llama.cpp feature matrix](https://github.com/ggerganov/llama.cpp/wiki/Feature-matrix)
But basically, if you're aiming for below Q4, and you're running cuBLAS (Nvidia) or rocBLAS (AMD), you should look towards the I-quants. These are in format IQX_X, like IQ3_M. These are newer and offer better performance for their size.
These I-quants can also be used on CPU and Apple Metal, but will be slower than their K-quant equivalent, so speed vs performance is a tradeoff you'll have to decide.
The I-quants are *not* compatible with Vulcan, which is also AMD, so if you have an AMD card double check if you're using the rocBLAS build or the Vulcan build. At the time of writing this, LM Studio has a preview with ROCm support, and other inference engines have specific builds for ROCm.
## Credits
Thank you kalomaze and Dampf for assistance in creating the imatrix calibration dataset
Thank you ZeroWw for the inspiration to experiment with embed/output
Want to support my work? Visit my ko-fi page here: https://ko-fi.com/bartowski

1
configuration.json Normal file
View File

@@ -0,0 +1 @@
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:a05ad1212db64a2d7d1854fabe935ee7f81dbf61e34f6d77d7cc56e4ac0651c2
size 3434668864

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0d3f1b7d066c786bfa63e6e479f05586bc45cfd0c206ba1146aed0b0e8eddc0c
size 4494615360

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:66224f272b215aacca455ccae9bd64aae4540222b8c9cbd9df39fbccd137e099
size 4144988992

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:bd1ba21c2fca1abf42188217653dd6157a1f436095b8dbfba1c5be60c14f8ff1
size 5183030080

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b41a2550c507e72cff98139957f0501415bdd822477a786dd68715d4e08cc259
size 3805397824

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:7df9cf6b9a3ef26a6993b3011c9e494e24596131e58241aa9e8d2a2b1094df46
size 4027605824

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b82867ad236224c15f2b6d9e7dfa8cae56fab04ab9b1335ad22181191a82a703
size 5132452672

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4412539565211540b1de60abd01b771dfac704d8f8a23ae151c74677d3cf3fda
size 4761781056

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:39826f6c3d30a173d54ad33bdaae4ad1850c882d3c8170980c14f71fac52ab96
size 4337664832

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d17d8da3d153cf430175932b37da10a2c3e483f5cda82fd213a57e934d74dbad
size 5354660672

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:50f94dec7780b2387fc3bb80381bf44ae96c86bbf1721e1f295d8d71e7cf3d2d
size 5459198784

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:a988db3b24cb054e6dcdd1702c4d781a9c7e98c06333db832197abee7631ef83
size 5443142464

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fe162688f9f2055bbb0875a8874c6f0f21584fcc16dda5a9685dd562e71f74fb
size 5443142464

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:41c59d61d07a7baa7a37b92f4f76a94a5a9ada3e8592d73b5dee24a0a1496b66
size 5443142464

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:118f937420f5b5830632e9ce550ebae2c909c36ae9754198d3bc03bc8ef0ec46
size 5983265600

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5dea706b24e478d70691d11a5f33ca417e73c78cdb306963378331370253947d
size 5761057600

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:aa2c81ebec369eb830835d835dd496752313ef698a4c23ac9c888be5e0ab2b74
size 5478925120

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d88fc2aedf0293a5e1c6471666da52c2558163b3f5db344939570010502833a9
size 6869574464

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5141ee31e300faf77e50d21e9c702f2930538d64ba632f59e88db4c659e06abf
size 6647366464

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0ad8ffefd47a9a88d3816caa184e305119ed87f2909fad8d4b4b5865511f359e
size 6483592000

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:df6cdda4487961b42673c2465df6d3f19ef03bd46b96071d5ed8e20bbab4c667
size 7589069632

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fd67e6dc1f936f4170c14158107662e6dc34f9d887a40d008e5d6591ee8fb9fb
size 7811277632

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:ade9d129ba9d352f2658cce5c3eab25b9c7d08242adf708fd06d4e8dd6c6b4a8
size 9827148608

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:22458a7516be8c110c045fb1bfe44b0881f84e232e9b0d311311795ec8c9a5a2
size 18490679840

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4ff3d683cf2dc83200a8f0fbe140df2f61c4f18fce8b7ae966a98afa6d01a9b4
size 6116900