初始化项目,由ModelHub XC社区提供模型

Model: bartowski/Ellaria-9B-GGUF
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-03 19:31:12 +08:00
commit 83571da002
28 changed files with 264 additions and 0 deletions

60
.gitattributes vendored Normal file
View File

@@ -0,0 +1,60 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q6_K_L.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q6_K.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q5_K_L.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q5_K_M.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q5_K_S.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q4_K_L.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q4_K_M.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q4_K_S.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q4_0_8_8.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q4_0_4_8.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q4_0_4_4.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q4_0.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-IQ4_XS.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q3_K_XL.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q3_K_L.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q3_K_M.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-IQ3_M.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q3_K_S.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-IQ3_XS.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q2_K_L.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-Q2_K.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-IQ2_M.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B-f16.gguf filter=lfs diff=lfs merge=lfs -text
Ellaria-9B.imatrix filter=lfs diff=lfs merge=lfs -text

3
Ellaria-9B-IQ2_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:9d1c8b074cb495337b72d6bae749a3ef5427d1b986010dc1a71e8296aac6258d
size 3434669888

3
Ellaria-9B-IQ3_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1d972a74ac872bbcd15fc5561bdef591ad584768948a3c8e34518e97b8d4ea9a
size 4494616384

3
Ellaria-9B-IQ3_XS.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:a4a4530f1f56b07a94c1a04e7438ee6a2c7992bfc5cce71bee79690e1659efc7
size 4144990016

3
Ellaria-9B-IQ4_XS.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b0706ac99b020bcbc0b9de91dfadb53976508fff931d079bc8d6addb74d697aa
size 5183031104

3
Ellaria-9B-Q2_K.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:182e8864fac101265b9c5ae7db9f6b67fb27f20135219518f53bd99633bd7694
size 3805398848

3
Ellaria-9B-Q2_K_L.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:563a716f1e854b33464a751ce441d34f5cb8b47118afdc7590e72f0fdac92859
size 4027606848

3
Ellaria-9B-Q3_K_L.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:aceb5c67968e7032387f3a792d2a64ff9b86b469bc1ae48ebf66a7df4542fc9b
size 5132453696

3
Ellaria-9B-Q3_K_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:2303d4208a6b76832910126fef8f18d2179ed38b403ec2d3a0a9f7d62c5ff9b3
size 4761782080

3
Ellaria-9B-Q3_K_S.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:27ad3c337d2cc25f50c19df501e7b34d33908042c7853348f61a10c1de309510
size 4337665856

3
Ellaria-9B-Q3_K_XL.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:67e2675b4da933a55b40f6dc9d896aa8a6e25c1efdcaf8647356c4d981521904
size 5354661696

3
Ellaria-9B-Q4_0.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d5c018cc3258a963388c73362b039578d458d1ccc39a310f6564912841f43439
size 5459199808

3
Ellaria-9B-Q4_0_4_4.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1b8c64e50a7ef54730476ec302eb8e90073ea24258162745bec3db7d2bd8675d
size 5443143488

3
Ellaria-9B-Q4_0_4_8.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:a858525b284e6e19cd89a76c8185f9f64f1880586c87cf31946e6846918deb5e
size 5443143488

3
Ellaria-9B-Q4_0_8_8.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4db46c2984ffd2b5de6a060cbb125009953f11340dd4af11c736d705d44b3789
size 5443143488

3
Ellaria-9B-Q4_K_L.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d5568285ce26fe6ad93b00eb72d9ff8f657bba9cd5ed58eb742146e9ac6c36b5
size 5983266624

3
Ellaria-9B-Q4_K_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4a4d61b32c5d0f23a5301a7ded25fe1501090ccd2cbb7de6020fcbd6d1095e0e
size 5761058624

3
Ellaria-9B-Q4_K_S.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:ed6ada9fcb0d8ba111dc67ec590af42d6b156859bab88557131dcb4cd400751f
size 5478926144

3
Ellaria-9B-Q5_K_L.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:de783d1bb7548e4ea831b17b0a515e0cd9fc275f81590b8006e63fdcfc6f0a79
size 6869575488

3
Ellaria-9B-Q5_K_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:a237bdda579d315717a1f0cd45fd25be95fdf51ae1bdd8b8222b08d63eb43cf8
size 6647367488

3
Ellaria-9B-Q5_K_S.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:40a4c10d1eecbd22708acde7ea95a19970f24cb4d8b7ce4cc3dffc8a71c804aa
size 6483593024

3
Ellaria-9B-Q6_K.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6284c434154468c62bf1e4aff624421046b25ad6e21092ee95dffd3ae23c433a
size 7589070656

3
Ellaria-9B-Q6_K_L.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:3c80836aab2ededf1bea73fa51a8241b591450ecba5504a47ddb86230be6ac2e
size 7811278656

3
Ellaria-9B-Q8_0.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fe5013a365b90a8efc6f51bab631b72cc717e676d24dc0c4d9160e27f46c1c37
size 9827149632

3
Ellaria-9B-f16.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5f79494c351f325d2362e1004b1ab3892c30d10272ce0ad47f20d79605b1bd78
size 18490680896

3
Ellaria-9B.imatrix Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d2d5883296a553f14d5d29c11ec5c50ffead5c5c53ab2fa50ece41cb8ea95ad1
size 6116900

128
README.md Normal file
View File

@@ -0,0 +1,128 @@
---
base_model: tannedbum/Ellaria-9B
language:
- en
library_name: transformers
pipeline_tag: text-generation
tags:
- mergekit
- merge
- roleplay
- sillytavern
- gemma2
quantized_by: bartowski
---
## Llamacpp imatrix Quantizations of Ellaria-9B
Using <a href="https://github.com/ggerganov/llama.cpp/">llama.cpp</a> release <a href="https://github.com/ggerganov/llama.cpp/releases/tag/b3634">b3634</a> for quantization.
Original model: https://huggingface.co/tannedbum/Ellaria-9B
All quants made using imatrix option with dataset from [here](https://gist.github.com/bartowski1182/eb213dccb3571f863da82e99418f81e8)
Run them in [LM Studio](https://lmstudio.ai/)
## Prompt format
```
<bos><start_of_turn>user
{prompt}<end_of_turn>
<start_of_turn>model
<end_of_turn>
<start_of_turn>model
```
Note that this model does not support a System prompt.
## Download a file (not the whole branch) from below:
| Filename | Quant type | File Size | Split | Description |
| -------- | ---------- | --------- | ----- | ----------- |
| [Ellaria-9B-f16.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-f16.gguf) | f16 | 18.49GB | false | Full F16 weights. |
| [Ellaria-9B-Q8_0.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q8_0.gguf) | Q8_0 | 9.83GB | false | Extremely high quality, generally unneeded but max available quant. |
| [Ellaria-9B-Q6_K_L.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q6_K_L.gguf) | Q6_K_L | 7.81GB | false | Uses Q8_0 for embed and output weights. Very high quality, near perfect, *recommended*. |
| [Ellaria-9B-Q6_K.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q6_K.gguf) | Q6_K | 7.59GB | false | Very high quality, near perfect, *recommended*. |
| [Ellaria-9B-Q5_K_L.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q5_K_L.gguf) | Q5_K_L | 6.87GB | false | Uses Q8_0 for embed and output weights. High quality, *recommended*. |
| [Ellaria-9B-Q5_K_M.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q5_K_M.gguf) | Q5_K_M | 6.65GB | false | High quality, *recommended*. |
| [Ellaria-9B-Q5_K_S.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q5_K_S.gguf) | Q5_K_S | 6.48GB | false | High quality, *recommended*. |
| [Ellaria-9B-Q4_K_L.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q4_K_L.gguf) | Q4_K_L | 5.98GB | false | Uses Q8_0 for embed and output weights. Good quality, *recommended*. |
| [Ellaria-9B-Q4_K_M.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q4_K_M.gguf) | Q4_K_M | 5.76GB | false | Good quality, default size for must use cases, *recommended*. |
| [Ellaria-9B-Q4_K_S.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q4_K_S.gguf) | Q4_K_S | 5.48GB | false | Slightly lower quality with more space savings, *recommended*. |
| [Ellaria-9B-Q4_0.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q4_0.gguf) | Q4_0 | 5.46GB | false | Legacy format, generally not worth using over similarly sized formats |
| [Ellaria-9B-Q4_0_8_8.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q4_0_8_8.gguf) | Q4_0_8_8 | 5.44GB | false | Optimized for ARM and CPU inference, much faster than Q4_0 at similar quality. |
| [Ellaria-9B-Q4_0_4_8.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q4_0_4_8.gguf) | Q4_0_4_8 | 5.44GB | false | Optimized for ARM and CPU inference, much faster than Q4_0 at similar quality. |
| [Ellaria-9B-Q4_0_4_4.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q4_0_4_4.gguf) | Q4_0_4_4 | 5.44GB | false | Optimized for ARM and CPU inference, much faster than Q4_0 at similar quality. |
| [Ellaria-9B-Q3_K_XL.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q3_K_XL.gguf) | Q3_K_XL | 5.35GB | false | Uses Q8_0 for embed and output weights. Lower quality but usable, good for low RAM availability. |
| [Ellaria-9B-IQ4_XS.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-IQ4_XS.gguf) | IQ4_XS | 5.18GB | false | Decent quality, smaller than Q4_K_S with similar performance, *recommended*. |
| [Ellaria-9B-Q3_K_L.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q3_K_L.gguf) | Q3_K_L | 5.13GB | false | Lower quality but usable, good for low RAM availability. |
| [Ellaria-9B-Q3_K_M.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q3_K_M.gguf) | Q3_K_M | 4.76GB | false | Low quality. |
| [Ellaria-9B-IQ3_M.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-IQ3_M.gguf) | IQ3_M | 4.49GB | false | Medium-low quality, new method with decent performance comparable to Q3_K_M. |
| [Ellaria-9B-Q3_K_S.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q3_K_S.gguf) | Q3_K_S | 4.34GB | false | Low quality, not recommended. |
| [Ellaria-9B-IQ3_XS.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-IQ3_XS.gguf) | IQ3_XS | 4.14GB | false | Lower quality, new method with decent performance, slightly better than Q3_K_S. |
| [Ellaria-9B-Q2_K_L.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q2_K_L.gguf) | Q2_K_L | 4.03GB | false | Uses Q8_0 for embed and output weights. Very low quality but surprisingly usable. |
| [Ellaria-9B-Q2_K.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-Q2_K.gguf) | Q2_K | 3.81GB | false | Very low quality but surprisingly usable. |
| [Ellaria-9B-IQ2_M.gguf](https://huggingface.co/bartowski/Ellaria-9B-GGUF/blob/main/Ellaria-9B-IQ2_M.gguf) | IQ2_M | 3.43GB | false | Relatively low quality, uses SOTA techniques to be surprisingly usable. |
## Embed/output weights
Some of these quants (Q3_K_XL, Q4_K_L etc) are the standard quantization method with the embeddings and output weights quantized to Q8_0 instead of what they would normally default to.
Some say that this improves the quality, others don't notice any difference. If you use these models PLEASE COMMENT with your findings. I would like feedback that these are actually used and useful so I don't keep uploading quants no one is using.
Thanks!
## Credits
Thank you kalomaze and Dampf for assistance in creating the imatrix calibration dataset
Thank you ZeroWw for the inspiration to experiment with embed/output
## Downloading using huggingface-cli
First, make sure you have hugginface-cli installed:
```
pip install -U "huggingface_hub[cli]"
```
Then, you can target the specific file you want:
```
huggingface-cli download bartowski/Ellaria-9B-GGUF --include "Ellaria-9B-Q4_K_M.gguf" --local-dir ./
```
If the model is bigger than 50GB, it will have been split into multiple files. In order to download them all to a local folder, run:
```
huggingface-cli download bartowski/Ellaria-9B-GGUF --include "Ellaria-9B-Q8_0/*" --local-dir ./
```
You can either specify a new local-dir (Ellaria-9B-Q8_0) or download them all in place (./)
## Which file should I choose?
A great write up with charts showing various performances is provided by Artefact2 [here](https://gist.github.com/Artefact2/b5f810600771265fc1e39442288e8ec9)
The first thing to figure out is how big a model you can run. To do this, you'll need to figure out how much RAM and/or VRAM you have.
If you want your model running as FAST as possible, you'll want to fit the whole thing on your GPU's VRAM. Aim for a quant with a file size 1-2GB smaller than your GPU's total VRAM.
If you want the absolute maximum quality, add both your system RAM and your GPU's VRAM together, then similarly grab a quant with a file size 1-2GB Smaller than that total.
Next, you'll need to decide if you want to use an 'I-quant' or a 'K-quant'.
If you don't want to think too much, grab one of the K-quants. These are in format 'QX_K_X', like Q5_K_M.
If you want to get more into the weeds, you can check out this extremely useful feature chart:
[llama.cpp feature matrix](https://github.com/ggerganov/llama.cpp/wiki/Feature-matrix)
But basically, if you're aiming for below Q4, and you're running cuBLAS (Nvidia) or rocBLAS (AMD), you should look towards the I-quants. These are in format IQX_X, like IQ3_M. These are newer and offer better performance for their size.
These I-quants can also be used on CPU and Apple Metal, but will be slower than their K-quant equivalent, so speed vs performance is a tradeoff you'll have to decide.
The I-quants are *not* compatible with Vulcan, which is also AMD, so if you have an AMD card double check if you're using the rocBLAS build or the Vulcan build. At the time of writing this, LM Studio has a preview with ROCm support, and other inference engines have specific builds for ROCm.
Want to support my work? Visit my ko-fi page here: https://ko-fi.com/bartowski

1
configuration.json Normal file
View File

@@ -0,0 +1 @@
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}