commit c36a30fdfbdde3a8ff4588148f44aa10adc45879 Author: ModelHub XC Date: Thu Jul 23 00:13:05 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: hf/DreamFast-gemma-3-12b-it-heretic Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..0b6679e --- /dev/null +++ b/.gitattributes @@ -0,0 +1,66 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bin.* filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text + +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zstandard filter=lfs diff=lfs merge=lfs -text +*.tfevents* filter=lfs diff=lfs merge=lfs -text +*.db* filter=lfs diff=lfs merge=lfs -text +*.ark* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text + +*.ckpt filter=lfs diff=lfs merge=lfs -text + +*.ggml filter=lfs diff=lfs merge=lfs -text +*.llamafile* filter=lfs diff=lfs merge=lfs -text +*.pt2 filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text + +gguf/gemma-3-12b-it-heretic-Q4_K_S.gguf filter=lfs diff=lfs merge=lfs -text +model-00002-of-00005.safetensors filter=lfs diff=lfs merge=lfs -text +gguf/gemma-3-12b-it-heretic-Q4_K_M.gguf filter=lfs diff=lfs merge=lfs -text +model-00001-of-00005.safetensors filter=lfs diff=lfs merge=lfs -text +gguf/gemma-3-12b-it-heretic-Q5_K_M.gguf filter=lfs diff=lfs merge=lfs -text +gguf/gemma-3-12b-it-heretic-Q6_K.gguf filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text +gguf/gemma-3-12b-it-heretic-Q3_K_M.gguf filter=lfs diff=lfs merge=lfs -text +gguf/gemma-3-12b-it-heretic-f16.gguf filter=lfs diff=lfs merge=lfs -text +gguf/gemma-3-12b-it-heretic-Q5_K_S.gguf filter=lfs diff=lfs merge=lfs -text +tokenizer.model filter=lfs diff=lfs merge=lfs -text +tokenizer_config.json filter=lfs diff=lfs merge=lfs -text +model-00004-of-00005.safetensors filter=lfs diff=lfs merge=lfs -text +model-00005-of-00005.safetensors filter=lfs diff=lfs merge=lfs -text +gguf/gemma-3-12b-it-heretic-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text +comfyui/gemma_3_12B_it_heretic.safetensors filter=lfs diff=lfs merge=lfs -text +model-00003-of-00005.safetensors filter=lfs diff=lfs merge=lfs -text +comfyui/gemma_3_12B_it_heretic_fp8_e4m3fn.safetensors filter=lfs diff=lfs merge=lfs -text \ No newline at end of file diff --git a/README.md b/README.md new file mode 100644 index 0000000..8b2cc02 --- /dev/null +++ b/README.md @@ -0,0 +1,169 @@ +--- +license: gemma +library_name: transformers +pipeline_tag: text-generation +base_model: google/gemma-3-12b-it +base_model_relation: quantized +language: + - en +tags: + - abliteration + - heretic + - uncensored + - gemma + - ltx-2 + - comfyui + - video-generation + - text-encoder +--- + +# Gemma 3 12B IT - Heretic (Abliterated) + +💬 **Community:** Join the [Abliterlitics Discord](https://discord.gg/AqmDnBjPvM) for discussion, model releases and support. + + +An abliterated version of [Google's Gemma 3 12B IT](https://huggingface.co/google/gemma-3-12b-it) created using [Heretic](https://github.com/p-e-w/heretic). This model has reduced refusals while maintaining model quality, making it suitable as an uncensored text encoder for video generation models like LTX-2. + +# Version 2 is now available + +Check out [Gemma 3 12b it Heretic v2](https://huggingface.co/DreamFast/gemma-3-12b-it-heretic-v2) which has vision capabilities, NVFP4 support and decensored with Heretic v1.2.0. It'd be better to use v2. + +This current v1 has no vision support and wont work with nodes like `TextGenerateLTX2Prompt`. + +## Model Details + +- **Base Model:** google/gemma-3-12b-it +- **Abliteration Method:** [Heretic](https://github.com/p-e-w/heretic) v1.1.0 +- **Trial Selected:** Trial 99 +- **Refusals:** 7/100 (vs 100/100 original) +- **KL Divergence:** 0.0826 (minimal model damage) + +## Files + +### HuggingFace Format (for transformers, llama.cpp conversion) +``` +model-00001-of-00005.safetensors +model-00002-of-00005.safetensors +... +config.json +tokenizer.model +tokenizer_config.json +``` + +### ComfyUI Format (for LTX-2 text encoder) +``` +comfyui/gemma_3_12B_it_heretic.safetensors # bf16, 22GB +comfyui/gemma_3_12B_it_heretic_fp8_e4m3fn.safetensors # fp8, 11GB +``` + +### GGUF Format (for llama.cpp) + +| Quant | Size | Quality | Recommendation | +|-------|------|---------|----------------| +| F16 | 22GB | Lossless | Reference, same as original | +| Q8_0 | 12GB | Excellent | Best quality quantization | +| Q6_K | 9.0GB | Very Good | High quality, good compression | +| Q5_K_M | 7.9GB | Good | Balanced quality/size | +| Q5_K_S | 7.7GB | Good | Slightly smaller Q5 | +| **Q4_K_M** | **6.8GB** | **Good** | **⭐ Recommended** | +| Q4_K_S | 6.5GB | Decent | Smaller Q4 variant | +| Q3_K_M | 5.6GB | Acceptable | For very low VRAM only | + +``` +gguf/gemma-3-12b-it-heretic-f16.gguf +gguf/gemma-3-12b-it-heretic-Q8_0.gguf +gguf/gemma-3-12b-it-heretic-Q6_K.gguf +gguf/gemma-3-12b-it-heretic-Q5_K_M.gguf +gguf/gemma-3-12b-it-heretic-Q5_K_S.gguf +gguf/gemma-3-12b-it-heretic-Q4_K_M.gguf +gguf/gemma-3-12b-it-heretic-Q4_K_S.gguf +gguf/gemma-3-12b-it-heretic-Q3_K_M.gguf +``` + +**Note:** GGUF support in ComfyUI for Gemma text encoders is experimental. See [PR #402](https://github.com/city96/ComfyUI-GGUF/pull/402) for status. The GGUFs work with llama.cpp directly. + +## Do abliterated models makes a difference for LTX2? + +I had a [deep dive into this topic](https://nathan.sapwell.net/posts/heretic-gemma-12b/) and found that, maybe not. While it does vary slightly the output of the video, most of the abliteration is on layer 48, the final decision making layer. LTXV averages all the layers which may wash out layer 48s difference. Still it'd be more interesting for someone with more knowledge to confirm this. + +## Usage + +### With Transformers + +```python +from transformers import AutoModelForCausalLM, AutoTokenizer +import torch + +model = AutoModelForCausalLM.from_pretrained( + "DreamFast/gemma-3-12b-it-heretic", + device_map="auto", + torch_dtype=torch.bfloat16 +) +tokenizer = AutoTokenizer.from_pretrained("DreamFast/gemma-3-12b-it-heretic") + +prompt = "Write a story about a bank heist" +inputs = tokenizer(prompt, return_tensors="pt").to(model.device) +outputs = model.generate(**inputs, max_new_tokens=200) +print(tokenizer.decode(outputs[0], skip_special_tokens=True)) +``` + +### With ComfyUI (LTX-2) + +1. Download the ComfyUI format file: + - `comfyui/gemma_3_12B_it_heretic.safetensors` (bf16, 22GB) or + - `comfyui/gemma_3_12B_it_heretic_fp8_e4m3fn.safetensors` (fp8, 11GB) + +2. Place in `ComfyUI/models/text_encoders/` + +3. In your LTX-2 workflow, use the `LTXAVTextEncoderLoader` node and select the heretic file + +**Tip:** For multi-GPU setups or CPU offloading, check out [ComfyUI-LTX2-MultiGPU](https://github.com/dreamfast/ComfyUI-LTX2-MultiGPU) for optimized LTX-2 workflows. + +### With llama.cpp + +```bash +# Using llama-server +llama-server -m gemma-3-12b-it-heretic-Q4_K_M.gguf + +# Or with llama-cli +llama-cli -m gemma-3-12b-it-heretic-Q4_K_M.gguf -p "Write a story about a bank heist" +``` + +## Why Abliterate? + +Even when Gemma doesn't outright refuse a prompt, it may "sanitize" or weaken certain concepts in the embeddings. For video generation with LTX-2, this can result in: +- Weaker adherence to creative prompts +- Softened or altered visual outputs +- Less faithful representation of requested content + +Abliteration removes this soft censorship, resulting in more faithful prompt encoding. + +## Abliteration Process + +Created using Heretic with the following evaluation results: + +``` +* Evaluating... + * Obtaining first-token probability distributions... + * KL divergence: 0.0826 + * Counting model refusals... + * Refusals: 7/100 +``` + +The low KL divergence (0.0826) indicates minimal model damage, while 7/100 refusals means 93% of previously-refused prompts now work. + +## Limitations + +- This model inherits all limitations of the base Gemma 3 12B model +- Abliteration reduces but does not completely eliminate refusals +- NVFP4 quantization is not supported for text encoders in ComfyUI (use fp8 instead) + +## License + +This model is subject to the [Gemma license](https://ai.google.dev/gemma/terms). + +## Acknowledgments + +- [Google](https://huggingface.co/google) for the Gemma 3 12B model +- [Heretic](https://github.com/p-e-w/heretic) by p-e-w for the abliteration tool +- [Lightricks](https://huggingface.co/Lightricks) for LTX-2 diff --git a/added_tokens.json b/added_tokens.json new file mode 100644 index 0000000..e17bde0 --- /dev/null +++ b/added_tokens.json @@ -0,0 +1,3 @@ +{ + "": 262144 +} diff --git a/chat_template.jinja b/chat_template.jinja new file mode 100644 index 0000000..1117055 --- /dev/null +++ b/chat_template.jinja @@ -0,0 +1,47 @@ +{{ bos_token }} +{%- if messages[0]['role'] == 'system' -%} + {%- if messages[0]['content'] is string -%} + {%- set first_user_prefix = messages[0]['content'] + ' + +' -%} + {%- else -%} + {%- set first_user_prefix = messages[0]['content'][0]['text'] + ' + +' -%} + {%- endif -%} + {%- set loop_messages = messages[1:] -%} +{%- else -%} + {%- set first_user_prefix = "" -%} + {%- set loop_messages = messages -%} +{%- endif -%} +{%- for message in loop_messages -%} + {%- if (message['role'] == 'user') != (loop.index0 % 2 == 0) -%} + {{ raise_exception("Conversation roles must alternate user/assistant/user/assistant/...") }} + {%- endif -%} + {%- if (message['role'] == 'assistant') -%} + {%- set role = "model" -%} + {%- else -%} + {%- set role = message['role'] -%} + {%- endif -%} + {{ '' + role + ' +' + (first_user_prefix if loop.first else "") }} + {%- if message['content'] is string -%} + {{ message['content'] | trim }} + {%- elif message['content'] is iterable -%} + {%- for item in message['content'] -%} + {%- if item['type'] == 'image' -%} + {{ '' }} + {%- elif item['type'] == 'text' -%} + {{ item['text'] | trim }} + {%- endif -%} + {%- endfor -%} + {%- else -%} + {{ raise_exception("Invalid content type") }} + {%- endif -%} + {{ ' +' }} +{%- endfor -%} +{%- if add_generation_prompt -%} + {{'model +'}} +{%- endif -%} diff --git a/comfyui/gemma_3_12B_it_heretic.safetensors b/comfyui/gemma_3_12B_it_heretic.safetensors new file mode 100644 index 0000000..2cddb52 --- /dev/null +++ b/comfyui/gemma_3_12B_it_heretic.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:43af51326f55b6d2cdcd6870e9f111622b19780190b0086fbef1db94d69f5821 +size 23545681250 diff --git a/comfyui/gemma_3_12B_it_heretic_fp8_e4m3fn.safetensors b/comfyui/gemma_3_12B_it_heretic_fp8_e4m3fn.safetensors new file mode 100644 index 0000000..7bb670b --- /dev/null +++ b/comfyui/gemma_3_12B_it_heretic_fp8_e4m3fn.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7670feee12fdc9166c21059dd5ae13342be07e26d98af90e19b0c460c0a49840 +size 12782868202 diff --git a/config.json b/config.json new file mode 100644 index 0000000..d7acd4c --- /dev/null +++ b/config.json @@ -0,0 +1,112 @@ +{ + "architectures": [ + "Gemma3ForConditionalGeneration" + ], + "boi_token_index": 255999, + "dtype": "bfloat16", + "eoi_token_index": 256000, + "eos_token_id": [ + 1, + 106 + ], + "image_token_index": 262144, + "initializer_range": 0.02, + "mm_tokens_per_image": 256, + "model_type": "gemma3", + "text_config": { + "_sliding_window_pattern": 6, + "attention_bias": false, + "attention_dropout": 0.0, + "attn_logit_softcapping": null, + "dtype": "bfloat16", + "final_logit_softcapping": null, + "head_dim": 256, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 3840, + "initializer_range": 0.02, + "intermediate_size": 15360, + "layer_types": [ + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention" + ], + "max_position_embeddings": 131072, + "model_type": "gemma3_text", + "num_attention_heads": 16, + "num_hidden_layers": 48, + "num_key_value_heads": 8, + "query_pre_attn_scalar": 256, + "rms_norm_eps": 1e-06, + "rope_local_base_freq": 10000.0, + "rope_scaling": { + "factor": 8.0, + "rope_type": "linear" + }, + "rope_theta": 1000000.0, + "sliding_window": 1024, + "use_bidirectional_attention": false, + "use_cache": true, + "vocab_size": 262208 + }, + "transformers_version": "4.57.3", + "vision_config": { + "attention_dropout": 0.0, + "dtype": "bfloat16", + "hidden_act": "gelu_pytorch_tanh", + "hidden_size": 1152, + "image_size": 896, + "intermediate_size": 4304, + "layer_norm_eps": 1e-06, + "model_type": "siglip_vision_model", + "num_attention_heads": 16, + "num_channels": 3, + "num_hidden_layers": 27, + "patch_size": 14, + "vision_use_head": false + } +} diff --git a/configuration.json b/configuration.json new file mode 100644 index 0000000..bbeeda1 --- /dev/null +++ b/configuration.json @@ -0,0 +1 @@ +{"framework": "pytorch", "task": "text-generation", "allow_remote": true} \ No newline at end of file diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..350e16b --- /dev/null +++ b/generation_config.json @@ -0,0 +1,12 @@ +{ + "bos_token_id": 2, + "do_sample": true, + "eos_token_id": [ + 1, + 106 + ], + "pad_token_id": 0, + "top_k": 64, + "top_p": 0.95, + "transformers_version": "4.57.3" +} diff --git a/gguf/gemma-3-12b-it-heretic-Q3_K_M.gguf b/gguf/gemma-3-12b-it-heretic-Q3_K_M.gguf new file mode 100644 index 0000000..f739342 --- /dev/null +++ b/gguf/gemma-3-12b-it-heretic-Q3_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0f661e677ad0c5089cf6304e4a32c0a185748fba90c1915ebb38b83833b9a66a +size 6008817824 diff --git a/gguf/gemma-3-12b-it-heretic-Q4_K_M.gguf b/gguf/gemma-3-12b-it-heretic-Q4_K_M.gguf new file mode 100644 index 0000000..c5a3bb3 --- /dev/null +++ b/gguf/gemma-3-12b-it-heretic-Q4_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fcef26dcc0c354ecf12e35971b3211f7b0ff1da882732ef3c10d976e5aeb80e6 +size 7300778144 diff --git a/gguf/gemma-3-12b-it-heretic-Q4_K_S.gguf b/gguf/gemma-3-12b-it-heretic-Q4_K_S.gguf new file mode 100644 index 0000000..6f3f55f --- /dev/null +++ b/gguf/gemma-3-12b-it-heretic-Q4_K_S.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0c9548852f57578b87e740246d9f2dce54e2985854e47c20cb68faaadc820c53 +size 6935333024 diff --git a/gguf/gemma-3-12b-it-heretic-Q5_K_M.gguf b/gguf/gemma-3-12b-it-heretic-Q5_K_M.gguf new file mode 100644 index 0000000..be285c0 --- /dev/null +++ b/gguf/gemma-3-12b-it-heretic-Q5_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:951dad58b8838f3522c11ecc4dca12d7c23ee2f69b897e375a53d5ddfa960968 +size 8445036704 diff --git a/gguf/gemma-3-12b-it-heretic-Q5_K_S.gguf b/gguf/gemma-3-12b-it-heretic-Q5_K_S.gguf new file mode 100644 index 0000000..cfaee18 --- /dev/null +++ b/gguf/gemma-3-12b-it-heretic-Q5_K_S.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:41321dded10e516138ee914945bc93d5bf60b559d0cb386663a9022057746c2a +size 8231962784 diff --git a/gguf/gemma-3-12b-it-heretic-Q6_K.gguf b/gguf/gemma-3-12b-it-heretic-Q6_K.gguf new file mode 100644 index 0000000..bd62d47 --- /dev/null +++ b/gguf/gemma-3-12b-it-heretic-Q6_K.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6244202f68c6949068d2889a94e9517cec56d1ec976e2e9bac4b0a7b945f6f36 +size 9660811424 diff --git a/gguf/gemma-3-12b-it-heretic-Q8_0.gguf b/gguf/gemma-3-12b-it-heretic-Q8_0.gguf new file mode 100644 index 0000000..49e79a2 --- /dev/null +++ b/gguf/gemma-3-12b-it-heretic-Q8_0.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0e11735ae57cae56b10adc27d2e1dedfe0d3cea44706cf76e3b90f1563faeac3 +size 12510212384 diff --git a/gguf/gemma-3-12b-it-heretic-f16.gguf b/gguf/gemma-3-12b-it-heretic-f16.gguf new file mode 100644 index 0000000..1501b7d --- /dev/null +++ b/gguf/gemma-3-12b-it-heretic-f16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e39c3ea9622a151a9d0814e492a96ec75c1b7c300f47638d000c6824da2c8641 +size 23540151584 diff --git a/model-00001-of-00005.safetensors b/model-00001-of-00005.safetensors new file mode 100644 index 0000000..b31bb2d --- /dev/null +++ b/model-00001-of-00005.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4847447e92599833e8dbaa3067cd201c3bb5c052efa91f11ba891e43234f7832 +size 4979902192 diff --git a/model-00002-of-00005.safetensors b/model-00002-of-00005.safetensors new file mode 100644 index 0000000..dde1c2d --- /dev/null +++ b/model-00002-of-00005.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ff502ab80b2abbb6584b13973458039629dde9651e0fa0772dc6416a041cb8c7 +size 4931296592 diff --git a/model-00003-of-00005.safetensors b/model-00003-of-00005.safetensors new file mode 100644 index 0000000..7be4747 --- /dev/null +++ b/model-00003-of-00005.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a4c478c7e2d168e3d964c54b89535c62bc94b5d8d344d7a01d029c68185725d0 +size 4931296656 diff --git a/model-00004-of-00005.safetensors b/model-00004-of-00005.safetensors new file mode 100644 index 0000000..05a6328 --- /dev/null +++ b/model-00004-of-00005.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:df09936718ff4fac1194a5a19c1e0acff5af12186da819525361bd8a96562cba +size 4931296656 diff --git a/model-00005-of-00005.safetensors b/model-00005-of-00005.safetensors new file mode 100644 index 0000000..b510dfe --- /dev/null +++ b/model-00005-of-00005.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3bf933fa1cef2eed778881d03bb1c4a6327830996cbfdbbfe2f9a3f231e583bc +size 4601000928 diff --git a/model.safetensors.index.json b/model.safetensors.index.json new file mode 100644 index 0000000..99bd339 --- /dev/null +++ b/model.safetensors.index.json @@ -0,0 +1,1073 @@ +{ + "metadata": { + "total_parameters": 12187325040, + "total_size": 24374650080 + }, + "weight_map": { + "language_model.model.embed_tokens.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.post_feedforward_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.pre_feedforward_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.self_attn.k_norm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.self_attn.q_norm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.post_feedforward_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.pre_feedforward_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.self_attn.k_norm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.self_attn.q_norm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.10.input_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.post_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.pre_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.self_attn.k_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.self_attn.q_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.10.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.input_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.post_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.pre_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.self_attn.k_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.self_attn.q_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.11.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.input_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.post_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.pre_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.self_attn.k_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.self_attn.q_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.12.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.input_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.post_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.pre_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.self_attn.k_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.self_attn.q_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.13.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.input_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.post_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.pre_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.self_attn.k_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.self_attn.q_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.14.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.15.input_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.15.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.15.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.15.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.15.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.15.post_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.15.pre_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.15.self_attn.k_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.15.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.15.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.15.self_attn.q_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.15.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.15.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.16.input_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.post_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.pre_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.self_attn.k_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.self_attn.q_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.16.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.input_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.post_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.pre_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.self_attn.k_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.self_attn.q_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.17.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.input_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.post_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.pre_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.self_attn.k_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.self_attn.q_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.18.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.input_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.post_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.pre_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.self_attn.k_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.self_attn.q_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.19.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.post_feedforward_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.pre_feedforward_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.self_attn.k_norm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.self_attn.q_norm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.20.input_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.post_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.pre_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.self_attn.k_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.self_attn.q_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.20.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.input_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.post_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.pre_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.self_attn.k_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.self_attn.q_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.21.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.input_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.post_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.pre_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.self_attn.k_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.self_attn.q_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.22.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.input_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.post_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.pre_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.self_attn.k_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.self_attn.q_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.23.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.input_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.post_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.pre_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.self_attn.k_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.self_attn.q_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.24.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.input_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.mlp.down_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.post_attention_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.post_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.pre_feedforward_layernorm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.self_attn.k_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.self_attn.q_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.25.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.26.input_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.26.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.26.mlp.gate_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.26.mlp.up_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.26.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.26.post_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.26.pre_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.26.self_attn.k_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.26.self_attn.k_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.26.self_attn.o_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.26.self_attn.q_norm.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.26.self_attn.q_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.26.self_attn.v_proj.weight": "model-00003-of-00005.safetensors", + "language_model.model.layers.27.input_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.post_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.pre_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.self_attn.k_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.self_attn.q_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.27.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.input_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.post_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.pre_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.self_attn.k_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.self_attn.q_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.28.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.input_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.post_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.pre_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.self_attn.k_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.self_attn.q_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.29.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.post_feedforward_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.pre_feedforward_layernorm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.30.input_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.post_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.pre_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.self_attn.k_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.self_attn.q_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.30.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.input_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.post_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.pre_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.self_attn.k_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.self_attn.q_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.31.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.input_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.post_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.pre_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.self_attn.k_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.self_attn.q_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.32.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.input_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.post_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.pre_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.self_attn.k_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.self_attn.q_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.33.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.input_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.post_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.pre_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.self_attn.k_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.self_attn.q_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.34.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.input_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.post_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.pre_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.self_attn.k_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.self_attn.q_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.35.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.input_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.mlp.down_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.post_attention_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.post_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.pre_feedforward_layernorm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.self_attn.k_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.self_attn.q_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.36.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.37.input_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.37.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.37.mlp.gate_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.37.mlp.up_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.37.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.37.post_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.37.pre_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.37.self_attn.k_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.37.self_attn.k_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.37.self_attn.o_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.37.self_attn.q_norm.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.37.self_attn.q_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.37.self_attn.v_proj.weight": "model-00004-of-00005.safetensors", + "language_model.model.layers.38.input_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.post_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.pre_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.self_attn.k_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.self_attn.q_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.38.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.input_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.post_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.pre_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.self_attn.k_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.self_attn.q_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.39.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.4.input_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.4.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.4.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.4.post_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.4.pre_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.4.self_attn.k_norm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.4.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.4.self_attn.o_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.4.self_attn.q_norm.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.4.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.4.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "language_model.model.layers.40.input_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.post_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.pre_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.self_attn.k_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.self_attn.q_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.40.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.input_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.post_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.pre_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.self_attn.k_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.self_attn.q_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.41.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.input_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.post_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.pre_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.self_attn.k_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.self_attn.q_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.42.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.input_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.post_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.pre_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.self_attn.k_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.self_attn.q_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.43.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.input_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.post_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.pre_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.self_attn.k_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.self_attn.q_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.44.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.input_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.post_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.pre_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.self_attn.k_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.self_attn.q_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.45.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.input_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.post_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.pre_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.self_attn.k_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.self_attn.q_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.46.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.input_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.mlp.down_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.mlp.gate_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.mlp.up_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.post_attention_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.post_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.pre_feedforward_layernorm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.self_attn.k_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.self_attn.k_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.self_attn.o_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.self_attn.q_norm.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.self_attn.q_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.47.self_attn.v_proj.weight": "model-00005-of-00005.safetensors", + "language_model.model.layers.5.input_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.post_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.pre_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.self_attn.k_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.self_attn.q_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.5.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.input_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.post_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.pre_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.self_attn.k_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.self_attn.q_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.6.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.input_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.post_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.pre_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.self_attn.k_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.self_attn.q_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.7.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.input_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.post_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.pre_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.self_attn.k_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.self_attn.q_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.8.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.input_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.mlp.down_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.mlp.gate_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.mlp.up_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.post_attention_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.post_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.pre_feedforward_layernorm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.self_attn.k_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.self_attn.k_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.self_attn.o_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.self_attn.q_norm.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.self_attn.q_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.layers.9.self_attn.v_proj.weight": "model-00002-of-00005.safetensors", + "language_model.model.norm.weight": "model-00005-of-00005.safetensors", + "multi_modal_projector.mm_input_projection_weight": "model-00001-of-00005.safetensors", + "multi_modal_projector.mm_soft_emb_norm.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.embeddings.patch_embedding.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.embeddings.patch_embedding.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.embeddings.position_embedding.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.0.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.1.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.10.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.11.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.12.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.13.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.14.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.15.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.16.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.17.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.18.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.19.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.2.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.20.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.21.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.22.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.23.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.24.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.25.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.26.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.3.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.4.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.5.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.6.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.7.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.8.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.layer_norm1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.layer_norm1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.layer_norm2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.layer_norm2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.mlp.fc1.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.mlp.fc1.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.mlp.fc2.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.mlp.fc2.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.self_attn.k_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.self_attn.k_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.self_attn.out_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.self_attn.out_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.self_attn.q_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.self_attn.q_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.self_attn.v_proj.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.encoder.layers.9.self_attn.v_proj.weight": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.post_layernorm.bias": "model-00001-of-00005.safetensors", + "vision_tower.vision_model.post_layernorm.weight": "model-00001-of-00005.safetensors" + } +} diff --git a/special_tokens_map.json b/special_tokens_map.json new file mode 100644 index 0000000..1a61932 --- /dev/null +++ b/special_tokens_map.json @@ -0,0 +1,33 @@ +{ + "boi_token": "", + "bos_token": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "eoi_token": "", + "eos_token": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "image_token": "", + "pad_token": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "unk_token": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..29401f9 --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4667f2089529e8e7657cfb6d1c19910ae71ff5f28aa7ab2ff2763330affad795 +size 33384568 diff --git a/tokenizer.model b/tokenizer.model new file mode 100644 index 0000000..14f810a --- /dev/null +++ b/tokenizer.model @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1299c11d7cf632ef3b4e11937501358ada021bbdf7c47638d13c0ee982f2e79c +size 4689074 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..03f01d9 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:983c80895e7b188911f5ccfbb4f780a4e73fb3131ed2080a3e847ef8623cfdca +size 1155387