commit 6213402452b17a644845f9e063da79d8e1ea2331 Author: ModelHub XC Date: Mon Aug 31 09:10:13 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: prithivMLmods/Qwen3-4B-Instruct-2507-GGUF Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..53d7257 --- /dev/null +++ b/.gitattributes @@ -0,0 +1,47 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bin.* filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zstandard filter=lfs diff=lfs merge=lfs -text +*.tfevents* filter=lfs diff=lfs merge=lfs -text +*.db* filter=lfs diff=lfs merge=lfs -text +*.ark* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.gguf* filter=lfs diff=lfs merge=lfs -text +*.ggml filter=lfs diff=lfs merge=lfs -text +*.llamafile* filter=lfs diff=lfs merge=lfs -text +*.pt2 filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text \ No newline at end of file diff --git a/Qwen3-4B-Instruct-2507.BF16.gguf b/Qwen3-4B-Instruct-2507.BF16.gguf new file mode 100644 index 0000000..0487e9f --- /dev/null +++ b/Qwen3-4B-Instruct-2507.BF16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c4f4fc5d4ad5b13bdf63b1addf20f52128715b3233a82b46c38e95cda9a00775 +size 8051284576 diff --git a/Qwen3-4B-Instruct-2507.F16.gguf b/Qwen3-4B-Instruct-2507.F16.gguf new file mode 100644 index 0000000..718f1a4 --- /dev/null +++ b/Qwen3-4B-Instruct-2507.F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6100016fd4ae14673b13697ceaee0deec9753d0335bdf7661a8cde4cbafad41f +size 8051284576 diff --git a/Qwen3-4B-Instruct-2507.F32.gguf b/Qwen3-4B-Instruct-2507.F32.gguf new file mode 100644 index 0000000..2a2342a --- /dev/null +++ b/Qwen3-4B-Instruct-2507.F32.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:813a79ed32a4513c5f4dbf0a3c804dfe85595c98697cedd3316160ad705b098f +size 16095828576 diff --git a/Qwen3-4B-Instruct-2507.Q2_K.gguf b/Qwen3-4B-Instruct-2507.Q2_K.gguf new file mode 100644 index 0000000..5a91905 --- /dev/null +++ b/Qwen3-4B-Instruct-2507.Q2_K.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4fb23c152a59c5fe55d10c984b45a938e68c196d18438755011d87520fd23ad2 +size 1669498976 diff --git a/Qwen3-4B-Instruct-2507.Q3_K_L.gguf b/Qwen3-4B-Instruct-2507.Q3_K_L.gguf new file mode 100644 index 0000000..61e9f9f --- /dev/null +++ b/Qwen3-4B-Instruct-2507.Q3_K_L.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b6e467b653fc328ff9aeddd21b60dab76dba748597d7571b820a9cb7f3c2cbc5 +size 2239785056 diff --git a/Qwen3-4B-Instruct-2507.Q3_K_M.gguf b/Qwen3-4B-Instruct-2507.Q3_K_M.gguf new file mode 100644 index 0000000..69ff951 --- /dev/null +++ b/Qwen3-4B-Instruct-2507.Q3_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:633e2a364499b058348102e35579603bcbb04d03fe60ae0ab957d036dcc256da +size 2075617376 diff --git a/Qwen3-4B-Instruct-2507.Q3_K_S.gguf b/Qwen3-4B-Instruct-2507.Q3_K_S.gguf new file mode 100644 index 0000000..d3cab7f --- /dev/null +++ b/Qwen3-4B-Instruct-2507.Q3_K_S.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:92788813858b2cad77a8b5623e612306b9003db374ff21c94a794e2383d7d53e +size 1886996576 diff --git a/Qwen3-4B-Instruct-2507.Q4_K_M.gguf b/Qwen3-4B-Instruct-2507.Q4_K_M.gguf new file mode 100644 index 0000000..64626de --- /dev/null +++ b/Qwen3-4B-Instruct-2507.Q4_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a5d24019650b6f5ac125cc6c1e4182245ce6898bcd077a11bb149eab1664af43 +size 2497280096 diff --git a/Qwen3-4B-Instruct-2507.Q4_K_S.gguf b/Qwen3-4B-Instruct-2507.Q4_K_S.gguf new file mode 100644 index 0000000..1b78157 --- /dev/null +++ b/Qwen3-4B-Instruct-2507.Q4_K_S.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:45656fb5579c20cae6baefb6cb5461b0b3fe34aaaf356189daa757f6b7cd0902 +size 2383308896 diff --git a/Qwen3-4B-Instruct-2507.Q5_K_M.gguf b/Qwen3-4B-Instruct-2507.Q5_K_M.gguf new file mode 100644 index 0000000..9f9cc73 --- /dev/null +++ b/Qwen3-4B-Instruct-2507.Q5_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2a241fe5968b7c6c3833e3a34494cf82c295e1801820ae9727da2f5f34c30437 +size 2889513056 diff --git a/Qwen3-4B-Instruct-2507.Q5_K_S.gguf b/Qwen3-4B-Instruct-2507.Q5_K_S.gguf new file mode 100644 index 0000000..b52cb42 --- /dev/null +++ b/Qwen3-4B-Instruct-2507.Q5_K_S.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:09c7c486d80654acb0015337a6a0aa292ba5a235ab0e96d0c12196820dc70c35 +size 2823710816 diff --git a/Qwen3-4B-Instruct-2507.Q6_K.gguf b/Qwen3-4B-Instruct-2507.Q6_K.gguf new file mode 100644 index 0000000..2171945 --- /dev/null +++ b/Qwen3-4B-Instruct-2507.Q6_K.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f21aae096ad0d3537bb55673b466ccad520ad259e6f9a9b75426b5a51396c0d6 +size 3306260576 diff --git a/Qwen3-4B-Instruct-2507.Q8_0.gguf b/Qwen3-4B-Instruct-2507.Q8_0.gguf new file mode 100644 index 0000000..a27a204 --- /dev/null +++ b/Qwen3-4B-Instruct-2507.Q8_0.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:260c3833acfecac9b69495ae0cd55aebad6f66d83080498572d91659e7deb11c +size 4280404576 diff --git a/README.md b/README.md new file mode 100644 index 0000000..becf684 --- /dev/null +++ b/README.md @@ -0,0 +1,46 @@ +--- +license: apache-2.0 +base_model: +- Qwen/Qwen3-4B-Instruct-2507 +language: +- en +pipeline_tag: text-generation +library_name: transformers +tags: +- text-generation-inference +- it +- llama.cpp +--- + +# **Qwen3-4B-Instruct-2507-GGUF** + +> [Qwen3-4B-Instruct-2507](https://huggingface.co/Qwen/Qwen3-4B-Instruct-2507) is a 4-billion-parameter causal language model designed for advanced instruction following, logical reasoning, text comprehension, mathematics, science, coding, and tool usage, with significant improvements in these general capabilities and substantial gains in long-tail knowledge coverage across multiple languages. It operates in a non-thinking mode without generating explicit reasoning step tags, features 36 layers, 32 query and 8 key-value attention heads using GQA, and supports an extremely long native context length of 262,144 tokens. + +> The [model](https://huggingface.co/Qwen/Qwen3-4B-Instruct-2507) is pretrained and post-trained for enhanced performance and alignment with user preferences, excelling in subjective and open-ended tasks with more helpful and higher-quality responses. It can be deployed efficiently via popular toolkits such as Hugging Face Transformers, SGLang, and vLLM, and supports extensive long-context understanding suitable for complex tasks. Code examples, benchmark evaluations, deployment instructions, and agentic tool-calling capabilities with Qwen-Agent are fully documented in its official repository on [Hugging Face](huggingface.co/Qwen/Qwen3-4B-Instruct-2507). + +# Model Files + +| File Name | Size | Quant Type | +|-----------|------|------------| +| Qwen3-4B-Thinking-2507.BF16.gguf | 8.05 GB | BF16 | +| Qwen3-4B-Thinking-2507.F16.gguf | 8.05 GB | F16 | +| Qwen3-4B-Thinking-2507.F32.gguf | 16.1 GB | F32 | +| Qwen3-4B-Thinking-2507.Q2_K.gguf | 1.67 GB | Q2_K | +| Qwen3-4B-Thinking-2507.Q3_K_L.gguf | 2.24 GB | Q3_K_L | +| Qwen3-4B-Thinking-2507.Q3_K_M.gguf | 2.08 GB | Q3_K_M | +| Qwen3-4B-Thinking-2507.Q3_K_S.gguf | 1.89 GB | Q3_K_S | +| Qwen3-4B-Thinking-2507.Q4_K_M.gguf | 2.5 GB | Q4_K_M | +| Qwen3-4B-Thinking-2507.Q4_K_S.gguf | 2.38 GB | Q4_K_S | +| Qwen3-4B-Thinking-2507.Q5_K_M.gguf | 2.89 GB | Q5_K_M | +| Qwen3-4B-Thinking-2507.Q5_K_S.gguf | 2.82 GB | Q5_K_S | +| Qwen3-4B-Thinking-2507.Q6_K.gguf | 3.31 GB | Q6_K | +| Qwen3-4B-Thinking-2507.Q8_0.gguf | 4.28 GB | Q8_0 | + +## Quants Usage + +(sorted by size, not necessarily quality. IQ-quants are often preferable over similar sized non-IQ quants) + +Here is a handy graph by ikawrakow comparing some lower-quality quant +types (lower is better): + +![image.png](https://www.nethype.de/huggingface_embed/quantpplgraph.png) \ No newline at end of file diff --git a/config.json b/config.json new file mode 100644 index 0000000..5d0c447 --- /dev/null +++ b/config.json @@ -0,0 +1,3 @@ +{ + "model_type": "qwen3" +} \ No newline at end of file diff --git a/configuration.json b/configuration.json new file mode 100644 index 0000000..bbeeda1 --- /dev/null +++ b/configuration.json @@ -0,0 +1 @@ +{"framework": "pytorch", "task": "text-generation", "allow_remote": true} \ No newline at end of file