初始化项目,由ModelHub XC社区提供模型
Model: McGill-NLP/AfriqueGemma-4B Source: Original Platform
This commit is contained in:
36
.gitattributes
vendored
Normal file
36
.gitattributes
vendored
Normal file
@@ -0,0 +1,36 @@
|
||||
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||
*.model filter=lfs diff=lfs merge=lfs -text
|
||||
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
tokenizer.json filter=lfs diff=lfs merge=lfs -text
|
||||
223
README.md
Normal file
223
README.md
Normal file
@@ -0,0 +1,223 @@
|
||||
---
|
||||
library_name: transformers
|
||||
license: cc-by-4.0
|
||||
base_model: google/gemma-3-4b-pt
|
||||
language:
|
||||
- af # Afrikaans
|
||||
- am # Amharic
|
||||
- ar # Arabic
|
||||
- en # English
|
||||
- fr # French
|
||||
- ha # Hausa
|
||||
- ig # Igbo
|
||||
- mg # Malagasy (Plateau)
|
||||
- ny # Nyanja
|
||||
- om # Oromo
|
||||
- pt # Portuguese
|
||||
- rw # Kinyarwanda
|
||||
- sn # Shona
|
||||
- so # Somali
|
||||
- st # Southern Sotho
|
||||
- sw # Swahili
|
||||
- ti # Tigrinya
|
||||
- tn # Tswana
|
||||
- xh # Xhosa
|
||||
- yo # Yoruba
|
||||
- zu # Zulu
|
||||
pipeline_tag: text-generation
|
||||
tags:
|
||||
- african-languages
|
||||
- multilingual
|
||||
- continued-pretraining
|
||||
- afrique-llm
|
||||
- gemma3
|
||||
- image-text-to-text
|
||||
- gemma
|
||||
- llamafactory
|
||||
---
|
||||
|
||||
# AfriqueGemma-4B
|
||||
|
||||
## Model Overview
|
||||
|
||||
**AfriqueGemma-4B** is part of the **AfriqueLLM** suite, a collection of open language models adapted to **20 African languages** through continued pre-training (CPT) on **~26B tokens**. This model is based on [google/gemma-3-4b-pt](https://huggingface.co/google/gemma-3-4b-pt) and has been specifically adapted for improved performance on African languages while maintaining strong capabilities in high-resource languages.
|
||||
|
||||
|
||||
### Key Features
|
||||
|
||||
- **Type**: Causal Language Model (Base/Pre-trained)
|
||||
- **Base Model**: Gemma 3 4B PT
|
||||
- **Parameters**: 4B
|
||||
- **Context Length**: 8,192 tokens (native)
|
||||
- **Training Tokens**: ~26B tokens of carefully curated multilingual data
|
||||
|
||||
## Supported Languages
|
||||
|
||||
AfriqueGemma-4B has been adapted for the following 20 African languages:
|
||||
|
||||
| Language | Code | Family | Script |
|
||||
|----------|------|--------|--------|
|
||||
| Afrikaans | afr_Latn | Germanic | Latin |
|
||||
| Swahili | swh_Latn | Bantu | Latin |
|
||||
| Moroccan Arabic | ary_Arab | Semitic | Arabic |
|
||||
| Somali | som_Latn | Cushitic | Latin |
|
||||
| Amharic | amh_Ethi | Semitic | Ethiopic |
|
||||
| Egyptian Arabic | arz_Arab | Semitic | Arabic |
|
||||
| Hausa | hau_Latn | Chadic | Latin |
|
||||
| Kinyarwanda | kin_Latn | Bantu | Latin |
|
||||
| Zulu | zul_Latn | Bantu | Latin |
|
||||
| Igbo | ibo_Latn | Volta-Niger | Latin |
|
||||
| Plateau Malagasy | plt_Latn | Austronesian | Latin |
|
||||
| Xhosa | xho_Latn | Bantu | Latin |
|
||||
| Shona | sna_Latn | Bantu | Latin |
|
||||
| Yoruba | yor_Latn | Volta-Niger | Latin |
|
||||
| Nyanja | nya_Latn | Bantu | Latin |
|
||||
| Southern Sotho | sot_Latn | Bantu | Latin |
|
||||
| Tigrinya | tir_Ethi | Semitic | Ethiopic |
|
||||
| Tunisian Arabic | aeb_Arab | Semitic | Arabic |
|
||||
| Oromo | gaz_Latn | Cushitic | Latin |
|
||||
| Tswana | tsn_Latn | Bantu | Latin |
|
||||
|
||||
**High-resource languages used for catastrophic forgetting mitigation:** English, French, Portuguese, Arabic
|
||||
|
||||
## Training Data
|
||||
|
||||
Our training corpus combines multiple high-quality sources:
|
||||
|
||||
- **African Monolingual Data** (~22.8B tokens): FineWeb2, WURA, and MADLAD-400
|
||||
- **Code** (~1B tokens): CornStack-Python for reasoning capabilities
|
||||
- **Mathematics** (~1B tokens): FineMath-4+ for mathematical understanding
|
||||
- **Synthetic Data** (~324M tokens): GPT-4.1 translated domain-specific content across 10 domains
|
||||
|
||||
|
||||
We use **UniMax sampling** to create a balanced distribution, capping high-resource languages at approximately 1B tokens and upsampling lower-resource languages for up to five epochs.
|
||||
|
||||
## Quickstart
|
||||
|
||||
```python
|
||||
from transformers import AutoModelForCausalLM, AutoTokenizer
|
||||
|
||||
model_name = "McGill-NLP/AfriqueGemma-4B"
|
||||
|
||||
# Load the tokenizer and the model
|
||||
tokenizer = AutoTokenizer.from_pretrained(model_name)
|
||||
model = AutoModelForCausalLM.from_pretrained(
|
||||
model_name,
|
||||
torch_dtype="auto",
|
||||
device_map="auto"
|
||||
)
|
||||
|
||||
# Prepare the model input
|
||||
prompt = "Bawo ni o ṣe n ṣe?" # Yoruba: "How are you doing?"
|
||||
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
|
||||
|
||||
# Generate text
|
||||
generated_ids = model.generate(
|
||||
**inputs,
|
||||
max_new_tokens=100,
|
||||
)
|
||||
output = tokenizer.decode(generated_ids[0], skip_special_tokens=True)
|
||||
print(output)
|
||||
```
|
||||
|
||||
## Deployment
|
||||
|
||||
For deployment, you can use `vllm` or `sglang` to create an OpenAI-compatible API endpoint:
|
||||
|
||||
**vLLM:**
|
||||
```shell
|
||||
vllm serve McGill-NLP/AfriqueGemma-4B
|
||||
```
|
||||
|
||||
**SGLang:**
|
||||
```shell
|
||||
python -m sglang.launch_server --model-path McGill-NLP/AfriqueGemma-4B
|
||||
```
|
||||
|
||||
## Training Details
|
||||
|
||||
### Hyperparameters
|
||||
|
||||
- **Learning Rate**: 5e-5 (with warmup and cosine decay)
|
||||
- **Context Length**: 16,384 tokens
|
||||
- **Optimizer**: AdamW
|
||||
- **Precision**: BF16 mixed precision
|
||||
|
||||
### Infrastructure
|
||||
|
||||
Training was conducted using the LLaMA-Factory framework on up to 64 NVIDIA H100 GPUs with:
|
||||
- DeepSpeed ZeRO-1/ZeRO-2
|
||||
- Flash Attention 3
|
||||
- Sequence packing
|
||||
- Liger Kernel optimizations
|
||||
|
||||
## Evaluation
|
||||
|
||||
All AfriqueLLM models are evaluated on multiple multilingual benchmarks. FLORES is reported only in the English-to-target direction (`eng->xxx`):
|
||||
|
||||
| Model | AfriMGSM | AfriMMLU | AfriXNLI | Belebele | FLORES (eng->xxx) | INJONG | SIB-200 | Overall | Δ (Δ %) |
|
||||
|-------|----------|----------|----------|----------|--------|--------|---------|---------|---|
|
||||
| [Gemma3-4B](https://huggingface.co/google/gemma-3-4b-pt) | 10.24 | 33.89 | 37.76 | 45.79 | 35.36 | 55.52 | 63.59 | 40.31 | |
|
||||
| <u>[AfriqueGemma-4B](https://huggingface.co/McGill-NLP/AfriqueGemma-4B)</u> | <u>14.86</u> | <u>36.73</u> | <u>39.62</u> | <u>50.52</u> | <u>54.95</u> | <u>69.28</u> | <u>69.21</u> | <u>47.88</u> | <u>+7.6 (18.8%)</u> |
|
||||
| [Gemma3-12B](https://huggingface.co/google/gemma-3-12b-pt) | 25.21 | 48.76 | 44.01 | 68.84 | 44.09 | 73.53 | 79.17 | 54.80 | |
|
||||
| [AfriqueGemma-12B](https://huggingface.co/McGill-NLP/AfriqueGemma-12B) | 32.14 | 49.47 | 44.60 | 68.65 | 65.04 | 76.79 | 75.08 | 58.82 | +4.0 (7.3%) |
|
||||
| [Qwen3-4B](https://huggingface.co/Qwen/Qwen3-4B-Base) | 8.26 | 33.84 | 37.12 | 41.50 | 20.16 | 21.69 | 57.88 | 31.49 | |
|
||||
| [AfriqueQwen-4B](https://huggingface.co/McGill-NLP/AfriqueQwen-4B) | 33.09 | 43.04 | 44.88 | 63.62 | 59.82 | 65.34 | 74.77 | 54.94 | +23.4 (74.4%) |
|
||||
| [Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B-Base) | 20.79 | 38.63 | 40.36 | 55.82 | 32.06 | 59.43 | 74.96 | 46.01 | |
|
||||
| [AfriqueQwen3.5-4B](https://huggingface.co/McGill-NLP/AfriqueQwen3.5-4B) | 30.47 | 43.66 | 41.05 | 66.01 | 63.55 | 75.46 | 79.66 | 57.12 | +11.1 (24.2%) |
|
||||
| [AfriqueQwen3.5-4B-ExtendedCM](https://huggingface.co/McGill-NLP/AfriqueQwen3.5-4B-ExtendedCM) | 34.17 | 45.26 | 41.94 | 66.45 | 63.76 | 75.97 | 80.52 | 58.30 | +1.2 (2.1%) |
|
||||
| [AfriqueQwen3.5-4B-50Langs](https://huggingface.co/McGill-NLP/AfriqueQwen3.5-4B-50Langs) | 34.06 | 45.23 | 41.79 | 66.83 | 64.56 | 75.82 | 79.83 | 58.30 | +0.0 (0.0%) |
|
||||
| [Qwen3-8B](https://huggingface.co/Qwen/Qwen3-8B-Base) | 11.22 | 36.56 | 38.24 | 44.63 | 21.13 | 29.47 | 53.06 | 33.47 | |
|
||||
| [AfriqueQwen-8B](https://huggingface.co/McGill-NLP/AfriqueQwen-8B) | 39.68 | 46.91 | 45.99 | 68.46 | 62.18 | 73.36 | 77.00 | 59.08 | +25.6 (76.5%) |
|
||||
| [Qwen3-14B](https://huggingface.co/Qwen/Qwen3-14B-Base) | 16.60 | 39.66 | 43.22 | 50.74 | 23.61 | 41.80 | 66.29 | 40.27 | |
|
||||
| **[AfriqueQwen-14B](https://huggingface.co/McGill-NLP/AfriqueQwen-14B)** | **45.01** | **52.22** | **49.01** | **74.63** | **63.77** | **77.80** | **82.63** | **63.58** | **+23.3 (57.9%)** |
|
||||
| [Llama3.1-8B](https://huggingface.co/meta-llama/Llama-3.1-8B) | 8.14 | 32.27 | 37.90 | 40.95 | 26.69 | 41.37 | 59.99 | 35.33 | |
|
||||
| [AfriqueLlama-8B](https://huggingface.co/McGill-NLP/AfriqueLlama-8B) | 17.51 | 36.57 | 37.39 | 50.51 | 63.60 | 71.17 | 69.14 | 49.41 | +14.1 (39.9%) |
|
||||
| [Lugha-Llama-8B-wura](https://huggingface.co/Lugha/Meta-Llama-3.1-8B-wura) | 9.46 | 37.00 | 39.24 | 47.86 | 49.90 | 62.30 | 75.81 | 45.94 | |
|
||||
| [Gemma3-27B](https://huggingface.co/google/gemma-3-27b-pt) | 35.37 | 55.47 | 46.85 | 74.81 | 48.41 | 79.70 | 84.34 | 60.71 | |
|
||||
|
||||
### Additional-Language Evaluation
|
||||
|
||||
This table averages only evaluated African languages outside the first 20-language CPT set: Ewe, Lingala, Ganda, Twi, and Wolof. Benchmark cells average the available languages for that benchmark; FLORES is English-to-target only (`eng->xxx`).
|
||||
|
||||
| Model | AfriMGSM | AfriMMLU | AfriXNLI | Belebele | FLORES (eng->xxx) | INJONG | SIB-200 | Avg | Δ (Δ %) |
|
||||
|-------|----------|----------|----------|----------|-------------------|--------|---------|-----|--------|
|
||||
| [Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B-Base) | 8.30 | 32.35 | 34.30 | 36.90 | 22.20 | 33.27 | 58.96 | 32.33 | |
|
||||
| [AfriqueQwen3.5-4B](https://huggingface.co/McGill-NLP/AfriqueQwen3.5-4B) | 7.52 | 31.17 | 33.56 | 35.82 | 26.28 | 33.10 | 56.66 | 32.02 | -0.31 (-1.0%) |
|
||||
| [AfriqueQwen3.5-4B-ExtendedCM](https://huggingface.co/McGill-NLP/AfriqueQwen3.5-4B-ExtendedCM) | 8.13 | 32.72 | 33.74 | 36.76 | 24.06 | 32.41 | 56.00 | 31.97 | -0.05 (-0.2%) |
|
||||
| [AfriqueQwen3.5-4B-50Langs](https://huggingface.co/McGill-NLP/AfriqueQwen3.5-4B-50Langs) | 21.07 | 37.65 | 36.31 | 51.56 | 56.33 | 61.37 | 75.75 | 48.58 | +16.61 (+52.0%) |
|
||||
|
||||
## Model Variants
|
||||
|
||||
- [AfriqueQwen-14B](https://huggingface.co/McGill-NLP/AfriqueQwen-14B) - Qwen-based 14B model (flagship)
|
||||
- [AfriqueQwen-8B](https://huggingface.co/McGill-NLP/AfriqueQwen-8B) - Qwen-based 8B model
|
||||
- [AfriqueQwen-4B](https://huggingface.co/McGill-NLP/AfriqueQwen-4B) - Qwen-based 4B model
|
||||
- [AfriqueQwen3.5-4B](https://huggingface.co/McGill-NLP/AfriqueQwen3.5-4B) - Qwen 3.5-based 4B model
|
||||
- [AfriqueQwen3.5-4B-ExtendedCM](https://huggingface.co/McGill-NLP/AfriqueQwen3.5-4B-ExtendedCM) - Qwen 3.5-based 4B model with extended continued pre-training
|
||||
- [AfriqueQwen3.5-4B-50Langs](https://huggingface.co/McGill-NLP/AfriqueQwen3.5-4B-50Langs) - Qwen 3.5-based 4B model with 50-language coverage
|
||||
- [AfriqueGemma-12B](https://huggingface.co/McGill-NLP/AfriqueGemma-12B) - Gemma-based 12B model
|
||||
- [AfriqueLlama-8B](https://huggingface.co/McGill-NLP/AfriqueLlama-8B) - Llama-based 8B model
|
||||
|
||||
## Citation
|
||||
|
||||
If you find our work helpful, please cite:
|
||||
|
||||
```bibtex
|
||||
@misc{yu2026afriquellmdatamixingmodel,
|
||||
title={AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages},
|
||||
author={Hao Yu and Tianyi Xu and Michael A. Hedderich and Wassim Hamidouche and Syed Waqas Zamir and David Ifeoluwa Adelani},
|
||||
year={2026},
|
||||
eprint={2601.06395},
|
||||
archivePrefix={arXiv},
|
||||
primaryClass={cs.CL},
|
||||
url={https://arxiv.org/abs/2601.06395},
|
||||
}
|
||||
```
|
||||
|
||||
## License
|
||||
|
||||
This model is released under the [CC BY 4.0 License](https://creativecommons.org/licenses/by/4.0/). Please review the license terms before use.
|
||||
|
||||
## Acknowledgments
|
||||
|
||||
We thank the creators of the base models, datasets and compute resources that made this work possible, including Mila, Compute Canada, Microsoft, the FineWeb team, WURA, MADLAD-400 and etc..
|
||||
3
added_tokens.json
Normal file
3
added_tokens.json
Normal file
@@ -0,0 +1,3 @@
|
||||
{
|
||||
"<image_soft_token>": 262144
|
||||
}
|
||||
1
chat_template.jinja
Normal file
1
chat_template.jinja
Normal file
@@ -0,0 +1 @@
|
||||
{% if messages[0]['role'] == 'system' %}{% set loop_messages = messages[1:] %}{% set system_message = messages[0]['content'] %}{% else %}{% set loop_messages = messages %}{% endif %}{% if system_message is defined %}{{ system_message }}{% endif %}{% for message in loop_messages %}{% set content = message['content'] %}{% if message['role'] == 'user' %}{{ content }}{% elif message['role'] == 'assistant' %}{{ content }}{% endif %}{% endfor %}
|
||||
95
config.json
Normal file
95
config.json
Normal file
@@ -0,0 +1,95 @@
|
||||
{
|
||||
"architectures": [
|
||||
"Gemma3ForConditionalGeneration"
|
||||
],
|
||||
"boi_token_index": 255999,
|
||||
"eoi_token_index": 256000,
|
||||
"hidden_size": 2560,
|
||||
"image_token_index": 262144,
|
||||
"initializer_range": 0.02,
|
||||
"mm_tokens_per_image": 256,
|
||||
"model_type": "gemma3",
|
||||
"text_config": {
|
||||
"_sliding_window_pattern": 6,
|
||||
"attention_bias": false,
|
||||
"attention_dropout": 0.0,
|
||||
"attn_logit_softcapping": null,
|
||||
"final_logit_softcapping": null,
|
||||
"head_dim": 256,
|
||||
"hidden_activation": "gelu_pytorch_tanh",
|
||||
"hidden_size": 2560,
|
||||
"initializer_range": 0.02,
|
||||
"intermediate_size": 10240,
|
||||
"layer_types": [
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"full_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"full_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"full_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"full_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"full_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention",
|
||||
"sliding_attention"
|
||||
],
|
||||
"max_position_embeddings": 131072,
|
||||
"model_type": "gemma3_text",
|
||||
"num_attention_heads": 8,
|
||||
"num_hidden_layers": 34,
|
||||
"num_key_value_heads": 4,
|
||||
"query_pre_attn_scalar": 256,
|
||||
"rms_norm_eps": 1e-06,
|
||||
"rope_local_base_freq": 10000.0,
|
||||
"rope_scaling": {
|
||||
"factor": 8.0,
|
||||
"rope_type": "linear"
|
||||
},
|
||||
"rope_theta": 1000000.0,
|
||||
"sliding_window": 1024,
|
||||
"torch_dtype": "bfloat16",
|
||||
"use_cache": false,
|
||||
"vocab_size": 262208
|
||||
},
|
||||
"torch_dtype": "bfloat16",
|
||||
"transformers_version": "4.55.4",
|
||||
"use_cache": false,
|
||||
"vision_config": {
|
||||
"attention_dropout": 0.0,
|
||||
"hidden_act": "gelu_pytorch_tanh",
|
||||
"hidden_size": 1152,
|
||||
"image_size": 896,
|
||||
"intermediate_size": 4304,
|
||||
"layer_norm_eps": 1e-06,
|
||||
"model_type": "siglip_vision_model",
|
||||
"num_attention_heads": 16,
|
||||
"num_channels": 3,
|
||||
"num_hidden_layers": 27,
|
||||
"patch_size": 14,
|
||||
"torch_dtype": "bfloat16",
|
||||
"vision_use_head": false
|
||||
}
|
||||
}
|
||||
13
generation_config.json
Normal file
13
generation_config.json
Normal file
@@ -0,0 +1,13 @@
|
||||
{
|
||||
"bos_token_id": 2,
|
||||
"cache_implementation": "hybrid",
|
||||
"do_sample": true,
|
||||
"eos_token_id": [
|
||||
1,
|
||||
106
|
||||
],
|
||||
"pad_token_id": 0,
|
||||
"top_k": 64,
|
||||
"top_p": 0.95,
|
||||
"transformers_version": "4.55.4"
|
||||
}
|
||||
BIN
language_group_scores.pdf
Normal file
BIN
language_group_scores.pdf
Normal file
Binary file not shown.
3
model-00001-of-00002.safetensors
Normal file
3
model-00001-of-00002.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:09398b2cf311ee097b8e2c773138cfa01ec6e04918765fdce215d59a6f648d95
|
||||
size 4961251752
|
||||
3
model-00002-of-00002.safetensors
Normal file
3
model-00002-of-00002.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:e8924d6de839c0970036fce73d74332344be7ef954be928e5a03783c8f28652e
|
||||
size 4981531360
|
||||
892
model.safetensors.index.json
Normal file
892
model.safetensors.index.json
Normal file
@@ -0,0 +1,892 @@
|
||||
{
|
||||
"metadata": {
|
||||
"total_parameters": 4300079472,
|
||||
"total_size": 9942663904
|
||||
},
|
||||
"weight_map": {
|
||||
"language_model.lm_head.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.embed_tokens.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.14.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.14.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.14.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.14.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.14.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.14.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.14.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.15.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.15.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.16.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.17.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.18.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.19.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.20.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.20.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.21.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.22.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.23.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.24.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.25.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.26.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.27.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.28.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.29.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.30.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.30.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.31.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.32.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.33.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"language_model.model.norm.weight": "model-00002-of-00002.safetensors",
|
||||
"multi_modal_projector.mm_input_projection_weight": "model-00001-of-00002.safetensors",
|
||||
"multi_modal_projector.mm_soft_emb_norm.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.embeddings.patch_embedding.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.embeddings.patch_embedding.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.embeddings.position_embedding.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.layer_norm1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.layer_norm1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.layer_norm2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.layer_norm2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.mlp.fc1.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.mlp.fc1.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.mlp.fc2.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.mlp.fc2.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.encoder.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.post_layernorm.bias": "model-00001-of-00002.safetensors",
|
||||
"vision_tower.vision_model.post_layernorm.weight": "model-00001-of-00002.safetensors"
|
||||
}
|
||||
}
|
||||
37
preprocessor_config.json
Normal file
37
preprocessor_config.json
Normal file
@@ -0,0 +1,37 @@
|
||||
{
|
||||
"crop_size": null,
|
||||
"data_format": "channels_first",
|
||||
"default_to_square": true,
|
||||
"device": null,
|
||||
"disable_grouping": null,
|
||||
"do_center_crop": null,
|
||||
"do_convert_rgb": null,
|
||||
"do_normalize": true,
|
||||
"do_pan_and_scan": null,
|
||||
"do_rescale": true,
|
||||
"do_resize": true,
|
||||
"image_mean": [
|
||||
0.5,
|
||||
0.5,
|
||||
0.5
|
||||
],
|
||||
"image_processor_type": "Gemma3ImageProcessorFast",
|
||||
"image_seq_length": 256,
|
||||
"image_std": [
|
||||
0.5,
|
||||
0.5,
|
||||
0.5
|
||||
],
|
||||
"input_data_format": null,
|
||||
"pan_and_scan_max_num_crops": null,
|
||||
"pan_and_scan_min_crop_size": null,
|
||||
"pan_and_scan_min_ratio_to_activate": null,
|
||||
"processor_class": "Gemma3Processor",
|
||||
"resample": 2,
|
||||
"rescale_factor": 0.00392156862745098,
|
||||
"return_tensors": null,
|
||||
"size": {
|
||||
"height": 896,
|
||||
"width": 896
|
||||
}
|
||||
}
|
||||
4
processor_config.json
Normal file
4
processor_config.json
Normal file
@@ -0,0 +1,4 @@
|
||||
{
|
||||
"image_seq_length": 256,
|
||||
"processor_class": "Gemma3Processor"
|
||||
}
|
||||
33
special_tokens_map.json
Normal file
33
special_tokens_map.json
Normal file
@@ -0,0 +1,33 @@
|
||||
{
|
||||
"boi_token": "<start_of_image>",
|
||||
"bos_token": {
|
||||
"content": "<bos>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"eoi_token": "<end_of_image>",
|
||||
"eos_token": {
|
||||
"content": "<eos>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"image_token": "<image_soft_token>",
|
||||
"pad_token": {
|
||||
"content": "<pad>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"unk_token": {
|
||||
"content": "<unk>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
}
|
||||
}
|
||||
3
tokenizer.json
Normal file
3
tokenizer.json
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:4667f2089529e8e7657cfb6d1c19910ae71ff5f28aa7ab2ff2763330affad795
|
||||
size 33384568
|
||||
3
tokenizer.model
Normal file
3
tokenizer.model
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:1299c11d7cf632ef3b4e11937501358ada021bbdf7c47638d13c0ee982f2e79c
|
||||
size 4689074
|
||||
51347
tokenizer_config.json
Normal file
51347
tokenizer_config.json
Normal file
File diff suppressed because it is too large
Load Diff
Reference in New Issue
Block a user