commit 36b66bb3a5907057d4ff2953d62a5b7ec83f0975 Author: ModelHub XC Date: Thu Oct 1 19:55:13 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: NexaAIDev/Qwen3-VL-4B-Instruct-GGUF Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..b6f0a97 --- /dev/null +++ b/.gitattributes @@ -0,0 +1,64 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bin.* filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zstandard filter=lfs diff=lfs merge=lfs -text +*.tfevents* filter=lfs diff=lfs merge=lfs -text +*.db* filter=lfs diff=lfs merge=lfs -text +*.ark* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text + +*.ggml filter=lfs diff=lfs merge=lfs -text +*.llamafile* filter=lfs diff=lfs merge=lfs -text +*.pt2 filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text + +mmproj.F16.gguf filter=lfs diff=lfs merge=lfs -text +Qwen3-VL-4B-Instruct.Q4_0.gguf filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text +Qwen3-VL-4B-Instruct.Q5_K.gguf filter=lfs diff=lfs merge=lfs -text +mmproj.F32.gguf filter=lfs diff=lfs merge=lfs -text +Qwen3-VL-4B-Instruct.Q8_0.gguf filter=lfs diff=lfs merge=lfs -text +Qwen3-VL-4B-Instruct.Q4_K.gguf filter=lfs diff=lfs merge=lfs -text +Qwen3-VL-4B-Instruct.Q6_K.gguf filter=lfs diff=lfs merge=lfs -text +Qwen3-VL-4B-Instruct.F16.gguf filter=lfs diff=lfs merge=lfs -text +mmproj.Q8_0.gguf filter=lfs diff=lfs merge=lfs -text + +Qwen3VL-4B-Instruct-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text +Qwen3VL-4B-Instruct-F16.gguf filter=lfs diff=lfs merge=lfs -text +mmproj-Qwen3VL-4B-Instruct-F16.gguf filter=lfs diff=lfs merge=lfs -text +Qwen3VL-4B-Instruct-Q4_K_M.gguf filter=lfs diff=lfs merge=lfs -text +mmproj-Qwen3VL-4B-Instruct-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text \ No newline at end of file diff --git a/Qwen3VL-4B-Instruct-F16.gguf b/Qwen3VL-4B-Instruct-F16.gguf new file mode 100644 index 0000000..8f13a8d --- /dev/null +++ b/Qwen3VL-4B-Instruct-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4a6fb1ed053e162887bfc372bd7ffaaa9b8e4049ac6e9b9398ae7277162ec761 +size 8051286144 diff --git a/Qwen3VL-4B-Instruct-Q4_K_M.gguf b/Qwen3VL-4B-Instruct-Q4_K_M.gguf new file mode 100644 index 0000000..db83763 --- /dev/null +++ b/Qwen3VL-4B-Instruct-Q4_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:66358cb18bb6b3b1b6675aa412c7a88ef01d228f481184d13668e5201c730a0a +size 2497281664 diff --git a/Qwen3VL-4B-Instruct-Q8_0.gguf b/Qwen3VL-4B-Instruct-Q8_0.gguf new file mode 100644 index 0000000..19338a7 --- /dev/null +++ b/Qwen3VL-4B-Instruct-Q8_0.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:054721f478bc5fa6beffb7f38eae575d45298f88cbb8d2f83ef675a727863eb1 +size 4280406144 diff --git a/README.md b/README.md new file mode 100644 index 0000000..5b89942 --- /dev/null +++ b/README.md @@ -0,0 +1,48 @@ +--- +pipeline_tag: image-text-to-text +base_model: +- Qwen/Qwen3-VL-4B-Instruct +--- +# Qwen3-VL-4B-Instruct + +Run **Qwen3-VL-4B-Instruct** optimized for CPU/GPU with [NexaSDK](https://github.com/NexaAI/nexa-sdk). + +## Quickstart + +1. **Install [NexaSDK](https://github.com/NexaAI/nexa-sdk)** +2. Run the model locally with one line of code: + + ```bash + nexa infer NexaAI/Qwen3-VL-4B-Instruct-GGUF + ``` + +## Model Description +**Qwen3-VL-4B-Instruct** is a 4-billion-parameter instruction-tuned multimodal large language model from Alibaba Cloud’s Qwen team. +As part of the **Qwen3-VL** series, it fuses powerful vision-language understanding with conversational fine-tuning, optimized for real-world applications such as chat-based reasoning, document analysis, and visual dialogue. + +The *Instruct* variant is tuned for following user prompts naturally and safely — producing concise, relevant, and user-aligned responses across text, image, and video contexts. + +## Features +- **Instruction-Following**: Optimized for dialogue, explanation, and user-friendly task completion. +- **Vision-Language Fusion**: Understands and reasons across text, images, and video frames. +- **Multilingual Capability**: Handles multiple languages for diverse global use cases. +- **Contextual Coherence**: Balances reasoning ability with natural, grounded conversational tone. +- **Lightweight & Deployable**: 4B parameters make it efficient for edge and device-level inference. + +## Use Cases +- Visual chatbots and assistants +- Image captioning and scene understanding +- Chart, document, or screenshot analysis +- Educational or tutoring systems with visual inputs +- Multilingual, multimodal question answering + +## Inputs and Outputs +**Input:** +- Text prompts, image(s), or mixed multimodal instructions. + +**Output:** +- Natural-language responses or visual reasoning explanations. +- Can return structured text (summaries, captions, answers, etc.) depending on the prompt. + +## License +Refer to the [official Qwen license](https://huggingface.co/Qwen) for terms of use and redistribution. \ No newline at end of file diff --git a/configuration.json b/configuration.json new file mode 100644 index 0000000..4aef15d --- /dev/null +++ b/configuration.json @@ -0,0 +1 @@ +{"framework": "pytorch", "task": "image-text-to-text", "allow_remote": true} \ No newline at end of file diff --git a/mmproj-Qwen3VL-4B-Instruct-F16.gguf b/mmproj-Qwen3VL-4B-Instruct-F16.gguf new file mode 100644 index 0000000..c4c45d3 --- /dev/null +++ b/mmproj-Qwen3VL-4B-Instruct-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:256f3a43bd4205ffef48d6b92715e1e70b5b0e9aef06522584967513a9985331 +size 836180256 diff --git a/mmproj-Qwen3VL-4B-Instruct-Q8_0.gguf b/mmproj-Qwen3VL-4B-Instruct-Q8_0.gguf new file mode 100644 index 0000000..c46a102 --- /dev/null +++ b/mmproj-Qwen3VL-4B-Instruct-Q8_0.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:30ba2c7dd3127a4561b6cba9d13d0f711c91bdb38742e2f56d73c8cb596bd06d +size 453974304 diff --git a/nexa.manifest b/nexa.manifest new file mode 100644 index 0000000..edaf0f9 --- /dev/null +++ b/nexa.manifest @@ -0,0 +1,6 @@ +{ + "ModelName":"qwen3vl", + "ModelType":"vlm", + "PluginId":"cpu_gpu", + "MinSDKVersion": "v0.2.64" +}