初始化项目，由ModelHub XC社区提供模型

Model: Retreatcost/KansenSakura-Conflagration-RP-12b Source: Original Platform
2026-06-03 15:12:20 +08:00
commit 137dbc243c
14 changed files with 8838 additions and 0 deletions
--- a/.gitattributes
+++ b/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
--- a/README.md
+++ b/README.md
@@ -0,0 +1,320 @@
+---
+base_model:
+- ohyeah1/Violet-Lyra-Gutenberg-v2
+- DavidAU/MN-Dark-Planet-TITAN-12B
+- intervitens/mini-magnum-12b-v1.1
+- yamatazen/FusionEngine-12B-Lorablated
+- Marcjoni/KiloNovaSynth-12B
+- PocketDoc/Dans-SakuraKaze-V1.0.0-12b
+- Retreatcost/Chrysologus-12B
+- PocketDoc/Dans-DangerousWinds-V1.1.0-12b
+- LatitudeGames/Wayfarer-2-12B
+- ReadyArt/Omega-Darker_The-Final-Directive-12B
+- yamatazen/EsotericSage-12B
+- bamec66557/Mistral-Nemo-VICIOUS_MESH-12B-2407
+- mistralai/Mistral-Nemo-Base-2407
+- allura-org/Tlacuilo-12B
+- LatitudeGames/Muse-12B
+- Trappu/Nemo-Picaro-12B
+library_name: transformers
+tags:
+- mergekit
+- merge
+- axolotl
+- not-for-all-audiences
+- nsfw
+license: apache-2.0
+---
+# KansenSakura-Conflagration-RP-12b
+
+<style>
+.img {
+  transition: all 0.3s ease-in-out;
+}
+  
+.img:hover {
+  transition: all 0.3s ease-in-out;
+  filter: saturate(1.2) brightness(1.2) contrast(0.9);
+}
+</style>
+
+<pre>
+Fire consumes the garden
+Petals burn to screaming light
+<span style="color: #FF4500;">IGNITION PROTOCOL: ACTIVE</span>
+Dialogue becomes wildfire
+Actions speak in tongues of flame
+</pre>
+
+<img class="img" src="https://cdn-uploads.huggingface.co/production/uploads/6671dd5203d6e8087aaf7ce5/KD8C1Wh-JSb7YdgL07llX.png">
+
+<audio controls src="https://cdn-uploads.huggingface.co/production/uploads/6671dd5203d6e8087aaf7ce5/CHqKyh-1oVDban_2GWnnr.mpga"></audio>
+
+## DISCLAIMER
+
+This is first model that I actually trained (very light finetune, but nevertheless), so expect it to have quirks and rough edges sometimes.
+
+## 🔥 NAPALM-CLASS INTERACTION ENGINE
+<div>When Erosion finished its work, only ash remained.</div>
+<div>From those cinders rises Conflagration - an engine that trades introspection for incineration, psychology for pyrotechnics.</div>
+<br>
+<div>Where Erosion analyzed, Conflagration acts.</div>
+<div>Where Erosion pondered, Conflagration speaks.</div>
+<div>This is not a model for those who watch the fire.</div>
+<div>This is for those who become the flame.</div>
+
+## ⚡ OVERVIEW
+**KansenSakura-Conflagration-RP-12b** is the white-hot successor to the Erosion engine, optimized for kinetic narrative exchange. Trading psychological depth for raw interactive intensity, Conflagration specializes in rapid-fire dialogue, decisive character action, and scenes that move at the speed of thought. The fire doesn't contemplate - it consumes.
+
+## 🎯 DEPLOYMENT PROFILE
+**Optimal use cases:**
+
+- 🗣️ Rapid-fire character banter and dialogue
+- ⚡ High-tension action sequences
+- 🔥 Romantic or adversarial chemistry
+- 💥 Scenes requiring decisive character action
+- 🎭 Ensemble casts with clear character voices
+
+## ⚠️ CONTAINMENT NOTES
+**This model exhibits:**
+
+- Reduced introspection compared to Erosion
+- Heightened character reactivity
+- Optimized dialogue-to-prose ratio
+- NSFW capabilities (passionate/aggressive interactions)
+- Potential for scene momentum override
+
+## ✍🏻 INFERENCE TIPS
+
+1.  **Temperature**: 0.8
+2.  **Repetition Penalty**: 1.05
+3.  **TOP_P**: 0.93
+4.  **TOP_K**: 0 (disable)
+5.  **MIN_P**: 0.025
+6.  **Template Format**: ChatML
+7.  **Max Output**: 360
+8.  **Context Management**: 16K
+
+## REPRODUCTION STEPS
+
+<details>
+
+  <summary>Spoiler warning</summary>
+
+1. Create intermediate models
+
+SakuraSynth-12B:
+```yml
+merge_method: arcee_fusion
+base_model: Marcjoni/KiloNovaSynth-12B
+models:
+  - model: PocketDoc/Dans-SakuraKaze-V1.0.0-12b
+dtype: bfloat16
+out_dtype: bfloat16
+```
+
+FinalWind-12B:
+```yml
+merge_method: ties
+models:
+  - model: PocketDoc/Dans-DangerousWinds-V1.1.0-12b
+    parameters:
+      density: [0.1, 0.25, 1.0, 0.5, 1.0]
+      weight: 1.0
+  - model: LatitudeGames/Wayfarer-2-12B
+    parameters:
+      density: [1.0, 0.5, 0.01]
+      weight: [1.0, 0.5]
+  - model: ReadyArt/Omega-Darker_The-Final-Directive-12B
+    parameters:
+      density: [0.75, 1.0, 0.6, 0.25, 0.01]
+      weight: [1.0, 0.5]
+  - model: yamatazen/EsotericSage-12B
+    parameters:
+      density: [0.1, 0.1, 0.25, 1.0, 0.01]
+      weight: 1.0
+  - model: bamec66557/Mistral-Nemo-VICIOUS_MESH-12B-2407
+    parameters:
+      density: [0.1, 0.5, 1.0, 0.5, 0.01]
+      weight: 1.0
+base_model: mistralai/Mistral-Nemo-Base-2407
+parameters:
+  normalize: true
+dtype: float16
+```
+
+Darkness-12B:
+
+```yml
+merge_method: karcher
+models:
+  - model: ds_one
+  - model: ds_two
+  - model: ds_three
+parameters:
+  max_iter: 100000
+  tol: 1e-9
+dtype: bfloat16
+```
+
+This model is created by combining **arcee_fusion** merges of three models using **task_arithmetic**:
+
+ds_one_f1:
+```yml
+merge_method: arcee_fusion
+base_model: Violet-Lyra-Gutenberg-v2-ChatML-darker
+models:
+  - model: MN-Dark-Planet-TITAN-12B-ChatML-darker
+dtype: bfloat16
+out_dtype: bfloat16
+```
+
+ds_one_f2:
+```yml
+merge_method: arcee_fusion
+base_model: Violet-Lyra-Gutenberg-v2-ChatML-darker
+models:
+  - model: mini-magnum-12b-v1.1-ChatML-darker
+dtype: bfloat16
+out_dtype: bfloat16
+```
+
+ds_one:
+```yml
+merge_method: task_arithmetic
+base_model: Violet-Lyra-Gutenberg-v2-ChatML-darker
+models:
+  - model: ds_one_f1
+    parameters: 
+      weight: 0.5
+  - model: ds_one_f2
+    parameters: 
+      weight: 0.5
+normalize: false
+dtype: bfloat16
+```
+
+The same procedure is repeated for each model as a base.
+
+Base models were re-tokenised and reverse-abliterated:
+
+```yml
+merge_method: task_arithmetic
+base_model: MN-Dark-Planet-TITAN-12B-ChatML
+models:
+  - model: MN-Dark-Planet-TITAN-12B-ChatML-abliterated
+    parameters: 
+      weight: 1.0
+parameters:
+  lambda: -1.0
+normalize: false
+dtype: bfloat16
+```
+
+By applying -1.0 to **task_arithmetic** we gain more censored model, that outputs considerably more unhinged and dark outputs.
+The idea behind was to create 3 such models and combine them in a way, that cancels out censored nature and boosts dark outputs.
+
+Abliteration was made with [llm-abliteration](https://github.com/jim-plus/llm-abliteration) tools by [grimjim](https://huggingface.co/grimjim)
+Reference his awesome [article](https://huggingface.co/blog/grimjim/projected-abliteration) for more in-depth explanations.
+
+2. Create initial model
+
+```yml
+  merge_method: multislerp
+  models:
+    - model: yamatazen/FusionEngine-12B-Lorablated
+      parameters:
+        weight: [1.000, 1.000, 1.000, 1.000, 1.000, 0.968, 0.744, 0.256, 0.030, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.500, 0.500]
+    - model: SakuraSynth-12B
+      parameters:
+        weight: [0.000, 0.000, 0.000, 0.000, 0.030, 0.256, 0.744, 0.968, 1.000, 1.000, 1.000, 1.000, 0.968, 0.744, 0.256, 0.030, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.500, 0.500]
+    - model: Retreatcost/Chrysologus-12B
+      parameters:
+        weight: [0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.030, 0.256, 0.744, 0.968, 1.000, 1.000, 1.000, 0.968, 0.744, 0.256, 0.030, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000]
+    - model: FinalWind-12B
+      parameters:
+        weight: [0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.030, 0.256, 0.744, 0.968, 1.000, 1.000, 1.000, 1.000, 0.968, 0.744, 0.256, 0.030, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000]
+    - model: Darkness-12B
+      parameters:
+        weight: [0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.030, 0.256, 0.744, 0.968, 1.000, 1.000, 1.000, 1.000, 0.968, 0.744, 0.256, 0.030, 0.000, 0.000, 0.000, 0.000]
+    - model: Pyrographos-12B
+      parameters:
+        weight: [0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.000, 0.030, 0.256, 0.744, 0.968, 1.000, 1.000, 1.000, 0.000, 0.000]
+  dtype: bfloat16
+  parameters:
+    normalize: true
+  tokenizer_source: Retreatcost/KansenSakura-Erosion-RP-12b
+```
+
+3. Apply delerp merge
+
+```yml
+merge_method: delerp
+base_model: mistralai/Mistral-Nemo-Base-2407
+models:
+  - model: KS-Conflagration
+  - model: mistralai/Mistral-Nemo-Base-2407
+parameters:
+  t: [0.7, 0.88, 0.999, 0.88, 0.88, 0.999, 0.999]
+dtype: bfloat16
+tokenizer_source: Retreatcost/KansenSakura-Erosion-RP-12b
+```
+
+Another great [article](https://huggingface.co/blog/grimjim/delerp-merge-method) by [grimjim](https://huggingface.co/grimjim)
+This merge method essentially re-iflated model with original "Base" weights, while preserving instruction following and other model features. 
+
+I've used specific values of 0.7 and 0.999, that were used by original author and 0.88 as "middle ground" between those.
+
+4. Apply nearswap merge
+
+```yml
+merge_method: nearswap
+base_model: KS-Conflagration-Delerp
+models:
+  - model: KS-Conflagration
+parameters:
+  t: [0.0005, 0.0002, 0.0000, 0.0002, 0.0002, 0.0000, 0.0000]
+dtype: bfloat16
+tokenizer_source: Retreatcost/KansenSakura-Erosion-RP-12b
+```
+
+While I felt that delerp merge boosted writing, creativity and factual accuracy it also somewhat watered down NSFW and instruction following parts.
+This merge brings these capabilities back.
+
+5. Do a finetuning
+
+I did an rsLoRa r64 a64 finetuning, targeting all linear projections, that had 25K rows dataset of 4k length samples which contained hazardous and NSFW data.
+
+6. Add anoter nearswap merge to boost NSFW/Dark aspects
+
+```yml
+merge_method: nearswap
+base_model: KansenSakura-Conflagration-RP-12b-RC3
+models:
+  - model: KansenSakura-Conflagration-RP-12b-darken
+parameters:
+  t: [0.0000, 0.0000, 0.0000, 0.000275, 0.000550, 0.0000, 0.000275]
+dtype: bfloat16
+tokenizer_source: KansenSakura-Conflagration-RP-12b-RC3
+```
+
+After training the refusal curves were smoothed a lot and I felt that I could sacrifice a bit more of "uncensored" model to boost desired parts and I repeated the process from step 3.
+Reverse-abliteration and then using nearswap to gently boost already present features.
+
+This is final step and this is how the model was produced.
+
+</details>
+
+## 🙏 ACKNOWLEDGMENTS
+
+- Original model authors
+- Awesome **[Ready.Art](https://huggingface.co/ReadyArt)** community
+- **[Team mradermacher](https://huggingface.co/mradermacher)**: for awesome quants
+- **[DeathGodlike](https://huggingface.co/DeathGodlike)**: for awesome quants in EXL3
+- **You**, the ember. Let your prompts ignite your desires.
+
+## 🔥 AFTER ACTION REPORT
+> The garden burned. From its ashes grew something quicker, hotter, more immediate. Conflagration doesn't ask why the petals catch fire - it just ensures they burn brightly enough to light the way forward. Sometimes, the most profound statement is a well-timed action, not a perfectly crafted thought.
+
+<span style="color: #FF4500;">// CONFLAGRATION PROTOCOL: ONLINE</span><br>
+<span style="color: #FF4500;">// READY TO IGNITE</span>
--- a/chat_template.jinja
+++ b/chat_template.jinja
@@ -0,0 +1,14 @@
+{%- set loop_messages = messages %}
+{%- for message in loop_messages %}
+    {%- set content = '<|im_start|>' + message['role'] + '\n'+ message['content'] | trim %}
+    {%- if loop.index0 == 0 %}
+        {%- set content = content %}
+    {%- endif %}
+    {%- if not (loop.last and message['role'] == 'assistant') %}
+        {%- set content = content + '<|im_end|>\n' %}
+    {%- endif %}
+    {{- content }}
+{%- endfor %}
+{%- if messages[-1]['role'] != 'assistant' %}
+  {{- '<|im_start|>assistant\n' }}
+{%- endif %}
--- a/config.json
+++ b/config.json
@@ -0,0 +1,26 @@
+{
+  "architectures": [
+    "MistralForCausalLM"
+  ],
+  "attention_dropout": 0.0,
+  "bos_token_id": 1,
+  "dtype": "bfloat16",
+  "eos_token_id": 2,
+  "head_dim": 128,
+  "hidden_act": "silu",
+  "hidden_size": 5120,
+  "initializer_range": 0.02,
+  "intermediate_size": 14336,
+  "max_position_embeddings": 131072,
+  "model_type": "mistral",
+  "num_attention_heads": 32,
+  "num_hidden_layers": 40,
+  "num_key_value_heads": 8,
+  "rms_norm_eps": 1e-05,
+  "rope_theta": 1000000.0,
+  "sliding_window": null,
+  "tie_word_embeddings": false,
+  "transformers_version": "4.57.3",
+  "use_cache": true,
+  "vocab_size": 131072
+}
--- a/mergekit_config.yml
+++ b/mergekit_config.yml
@@ -0,0 +1,8 @@
+merge_method: nearswap
+base_model: KansenSakura-Conflagration-RP-12b-RC3
+models:
+  - model: KansenSakura-Conflagration-RP-12b-stock
+parameters:
+  t: [0.0000, 0.0000, 0.0000, 0.000275, 0.000550, 0.0000, 0.000275]
+dtype: bfloat16
+tokenizer_source: KansenSakura-Conflagration-RP-12b-RC3
--- a/model-00001-of-00005.safetensors
+++ b/model-00001-of-00005.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:6e9959cd62d37e95e747bb487cd19360b61d81042d5736f07de6f9c289cfd364
+size 4865489336
--- a/model-00002-of-00005.safetensors
+++ b/model-00002-of-00005.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:842f78ef9aceeca5db668555c44d81cd0c2876b2a89d80c30e47cd3a41e1abad
+size 4907529456
--- a/model-00003-of-00005.safetensors
+++ b/model-00003-of-00005.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ec299da408d45da0080ade6814b793c5dd7aa86a06ddd68dabac7b7fc57221b3
+size 4907529464
--- a/model-00004-of-00005.safetensors
+++ b/model-00004-of-00005.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:655ed903bed9aea04e9bdd90533d1eafd71e3ea6ce6a9711636c814ad177f70e
+size 4907529456
--- a/model-00005-of-00005.safetensors
+++ b/model-00005-of-00005.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:b5c619391cc2cab067ab55924b144b2ecbd95631e2b70eebd5d6de2fa98b7cb9
+size 4907529392
--- a/model.safetensors.index.json
+++ b/model.safetensors.index.json
@@ -0,0 +1,371 @@
+{
+  "metadata": {
+    "total_size": 24495564800,
+    "mergekit_version": "0.1.4"
+  },
+  "weight_map": {
+    "lm_head.weight": "model-00001-of-00005.safetensors",
+    "model.embed_tokens.weight": "model-00001-of-00005.safetensors",
+    "model.layers.0.input_layernorm.weight": "model-00001-of-00005.safetensors",
+    "model.layers.0.mlp.down_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.0.mlp.up_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00005.safetensors",
+    "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.1.input_layernorm.weight": "model-00001-of-00005.safetensors",
+    "model.layers.1.mlp.down_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.1.mlp.up_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00005.safetensors",
+    "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.10.input_layernorm.weight": "model-00001-of-00005.safetensors",
+    "model.layers.10.mlp.down_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.10.mlp.gate_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.10.mlp.up_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.10.post_attention_layernorm.weight": "model-00001-of-00005.safetensors",
+    "model.layers.10.self_attn.k_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.10.self_attn.o_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.10.self_attn.q_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.10.self_attn.v_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.11.input_layernorm.weight": "model-00001-of-00005.safetensors",
+    "model.layers.11.mlp.down_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.11.mlp.gate_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.11.mlp.up_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.11.post_attention_layernorm.weight": "model-00001-of-00005.safetensors",
+    "model.layers.11.self_attn.k_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.11.self_attn.o_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.11.self_attn.q_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.11.self_attn.v_proj.weight": "model-00001-of-00005.safetensors",
+    "model.layers.12.input_layernorm.weight": "model-00001-of-00005.safetensors",
+    "model.layers.12.mlp.down_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.12.mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.12.mlp.up_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.13.input_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.13.mlp.down_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.13.mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.13.mlp.up_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.14.input_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.14.mlp.down_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.14.mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.14.mlp.up_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.15.input_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.15.mlp.down_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.15.mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.15.mlp.up_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.16.input_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.16.mlp.down_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.16.mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.16.mlp.up_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.17.input_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.17.mlp.down_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.17.mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.17.mlp.up_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.18.input_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.18.mlp.down_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.18.mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.18.mlp.up_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.19.mlp.up_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.2.input_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.2.mlp.down_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.2.mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.2.mlp.up_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.2.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.2.self_attn.k_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.2.self_attn.o_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.2.self_attn.q_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.2.self_attn.v_proj.weight": "model-00002-of-00005.safetensors",
+    "model.layers.20.input_layernorm.weight": "model-00002-of-00005.safetensors",
+    "model.layers.20.mlp.down_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.20.mlp.up_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.21.input_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.21.mlp.down_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.21.mlp.up_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.21.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.21.self_attn.k_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.21.self_attn.o_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.21.self_attn.q_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.21.self_attn.v_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.22.input_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.22.mlp.down_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.22.mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.22.mlp.up_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.22.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.22.self_attn.k_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.22.self_attn.o_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.22.self_attn.q_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.22.self_attn.v_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.23.input_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.23.mlp.down_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.23.mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.23.mlp.up_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.23.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.23.self_attn.k_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.23.self_attn.o_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.23.self_attn.q_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.23.self_attn.v_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.24.input_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.24.mlp.down_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.24.mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.24.mlp.up_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.24.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.24.self_attn.k_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.24.self_attn.o_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.24.self_attn.q_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.24.self_attn.v_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.25.input_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.25.mlp.down_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.25.mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.25.mlp.up_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.25.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.25.self_attn.k_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.25.self_attn.o_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.25.self_attn.q_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.25.self_attn.v_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.26.input_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.26.mlp.down_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.26.mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.26.mlp.up_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.26.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.26.self_attn.k_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.26.self_attn.o_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.26.self_attn.q_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.26.self_attn.v_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.27.input_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.27.mlp.down_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.27.mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.27.mlp.up_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.27.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.27.self_attn.k_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.27.self_attn.o_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.27.self_attn.q_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.27.self_attn.v_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.28.input_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.28.mlp.down_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.28.mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.28.mlp.up_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.28.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.28.self_attn.k_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00005.safetensors",
+    "model.layers.29.input_layernorm.weight": "model-00003-of-00005.safetensors",
+    "model.layers.29.mlp.down_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.29.mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.29.mlp.up_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.29.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.29.self_attn.k_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.29.self_attn.o_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.29.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.29.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.3.input_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.3.mlp.down_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.3.mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.3.mlp.up_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.3.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.3.self_attn.k_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.3.self_attn.o_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.3.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.3.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.30.input_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.30.mlp.down_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.30.mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.30.mlp.up_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.30.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.30.self_attn.k_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.30.self_attn.o_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.30.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.30.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.31.input_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.31.mlp.down_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.31.mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.31.mlp.up_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.31.self_attn.k_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.31.self_attn.o_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.31.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.31.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.32.input_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.32.mlp.down_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.32.mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.32.mlp.up_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.32.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.32.self_attn.k_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.32.self_attn.o_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.32.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.32.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.33.input_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.33.mlp.down_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.33.mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.33.mlp.up_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.33.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.33.self_attn.k_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.33.self_attn.o_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.33.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.33.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.34.input_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.34.mlp.down_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.34.mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.34.mlp.up_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.34.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.34.self_attn.k_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.34.self_attn.o_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.34.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.34.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.35.input_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.35.mlp.down_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.35.mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.35.mlp.up_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.35.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.35.self_attn.k_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.35.self_attn.o_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.35.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.35.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.36.input_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.36.mlp.down_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.36.mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.36.mlp.up_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.36.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.36.self_attn.k_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.36.self_attn.o_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.36.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.36.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
+    "model.layers.37.input_layernorm.weight": "model-00004-of-00005.safetensors",
+    "model.layers.37.mlp.down_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.37.mlp.gate_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.37.mlp.up_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.37.post_attention_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.37.self_attn.k_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.37.self_attn.o_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.37.self_attn.q_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.37.self_attn.v_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.38.input_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.38.mlp.down_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.38.mlp.gate_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.38.mlp.up_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.38.post_attention_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.38.self_attn.k_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.38.self_attn.o_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.38.self_attn.q_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.38.self_attn.v_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.39.input_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.39.mlp.down_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.39.mlp.gate_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.39.mlp.up_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.39.post_attention_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.39.self_attn.k_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.39.self_attn.o_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.39.self_attn.q_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.39.self_attn.v_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.4.input_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.4.mlp.down_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.4.mlp.gate_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.4.mlp.up_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.4.post_attention_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.4.self_attn.k_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.4.self_attn.o_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.4.self_attn.q_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.4.self_attn.v_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.5.input_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.5.mlp.down_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.5.mlp.gate_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.5.mlp.up_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.5.post_attention_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.5.self_attn.k_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.5.self_attn.o_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.5.self_attn.q_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.5.self_attn.v_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.6.input_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.6.mlp.down_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.6.mlp.gate_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.6.mlp.up_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.6.post_attention_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.6.self_attn.k_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.6.self_attn.o_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.6.self_attn.q_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.6.self_attn.v_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.7.input_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.7.mlp.down_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.7.mlp.gate_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.7.mlp.up_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.7.post_attention_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.7.self_attn.k_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.7.self_attn.o_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.7.self_attn.q_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.7.self_attn.v_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.8.input_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.8.mlp.down_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.8.mlp.gate_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.8.mlp.up_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.8.post_attention_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.8.self_attn.k_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.8.self_attn.o_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.8.self_attn.q_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.8.self_attn.v_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.9.input_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.9.mlp.down_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.9.mlp.gate_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.9.mlp.up_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.9.post_attention_layernorm.weight": "model-00005-of-00005.safetensors",
+    "model.layers.9.self_attn.k_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.9.self_attn.o_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.9.self_attn.q_proj.weight": "model-00005-of-00005.safetensors",
+    "model.layers.9.self_attn.v_proj.weight": "model-00005-of-00005.safetensors",
+    "model.norm.weight": "model-00005-of-00005.safetensors"
+  }
+}
--- a/special_tokens_map.json
+++ b/special_tokens_map.json
@@ -0,0 +1,30 @@
+{
+  "bos_token": {
+    "content": "<s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "<|im_end|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<pad>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<unk>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}
--- a/tokenizer.json
+++ b/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ee57bd3271d8c200a06df40f9d7c94f8bb8f085b5cfb2d40907a794560df2ec3
+size 17078342
--- a/tokenizer_config.json
+++ b/tokenizer_config.json