初始化项目，由ModelHub XC社区提供模型

Model: MexIvanov/zephyr-python-ru-merged Source: Original Platform
2026-05-13 12:51:38 +08:00
commit 620f31bdb5
17 changed files with 91710 additions and 0 deletions
--- a/.gitattributes
+++ b/.gitattributes
@@ -0,0 +1,35 @@
 *.7z filter=lfs diff=lfs merge=lfs -text
 *.arrow filter=lfs diff=lfs merge=lfs -text
 *.bin filter=lfs diff=lfs merge=lfs -text
 *.bz2 filter=lfs diff=lfs merge=lfs -text
 *.ckpt filter=lfs diff=lfs merge=lfs -text
 *.ftz filter=lfs diff=lfs merge=lfs -text
 *.gz filter=lfs diff=lfs merge=lfs -text
 *.h5 filter=lfs diff=lfs merge=lfs -text
 *.joblib filter=lfs diff=lfs merge=lfs -text
 *.lfs.* filter=lfs diff=lfs merge=lfs -text
 *.mlmodel filter=lfs diff=lfs merge=lfs -text
 *.model filter=lfs diff=lfs merge=lfs -text
 *.msgpack filter=lfs diff=lfs merge=lfs -text
 *.npy filter=lfs diff=lfs merge=lfs -text
 *.npz filter=lfs diff=lfs merge=lfs -text
 *.onnx filter=lfs diff=lfs merge=lfs -text
 *.ot filter=lfs diff=lfs merge=lfs -text
 *.parquet filter=lfs diff=lfs merge=lfs -text
 *.pb filter=lfs diff=lfs merge=lfs -text
 *.pickle filter=lfs diff=lfs merge=lfs -text
 *.pkl filter=lfs diff=lfs merge=lfs -text
 *.pt filter=lfs diff=lfs merge=lfs -text
 *.pth filter=lfs diff=lfs merge=lfs -text
 *.rar filter=lfs diff=lfs merge=lfs -text
 *.safetensors filter=lfs diff=lfs merge=lfs -text
 saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.tar.* filter=lfs diff=lfs merge=lfs -text
 *.tar filter=lfs diff=lfs merge=lfs -text
 *.tflite filter=lfs diff=lfs merge=lfs -text
 *.tgz filter=lfs diff=lfs merge=lfs -text
 *.wasm filter=lfs diff=lfs merge=lfs -text
 *.xz filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
--- a/README.md
+++ b/README.md
@@ -0,0 +1,112 @@
 ---
 pipeline_tag: text-generation
 license: mit
 datasets:
 - MexIvanov/Vezora-Tested-22k-Python-Alpaca-ru
 - MexIvanov/CodeExercise-Python-27k-ru
 - zelkame/ru-stackoverflow-py
 language:
 - en
 - ru
 base_model:
 - HuggingFaceH4/zephyr-7b-beta
 ---
 # Model Card for zephyr-python-ru-merged
 <!-- Provide a quick summary of what the model is/does. -->
 ## Model Details
 ### Model Description
 <!-- Provide a longer summary of what this model is. -->
 - **Developed by:** C.B. Pronin, A.V. Volosova, A.V. Ostroukh, Yu.N. Strogov, V.V. Kurbatov, A.S. Umarova.
 - **Model type:** Base model HuggingFaceH4/zephyr-7b-beta merged with LoRA (Peft) adapter model MexIvanov/zephyr-python-ru trained on a mix of publicly available data and machine-translated synthetic python coding datasets.
 - **Language(s) (NLP):** Russian, English, Python
 - **License:** MIT
 - **Finetuned from model:** HuggingFaceH4/zephyr-7b-beta
 ### Model Sources
 <!-- Provide the basic links for the model. -->
 - **Paper:** https://arxiv.org/abs/2409.09353
 ## Uses
 <!-- Address questions around how the model is intended to be used, including the foreseeable users of the model and those affected by the model. -->
 An experimental finetune of Zephyr-7b-beta, aimed at improving coding performance and support for coding-related instructions written in Russian language.
 ### Direct Use
 <!-- This section is for the model use without fine-tuning or plugging into a larger ecosystem/app. -->
 Instruction-based coding in Python, based of instructions written in natural language (English or Russian)
 Prompt template - Zephyr:
 ```  
 <|system|>
 </s>
 <|user|>
 {prompt}</s>
 <|assistant|>
 ```  
 ## Bias, Risks, and Limitations
 <!-- This section is meant to convey both technical and sociotechnical limitations. -->
 This adapter model is intended (but not limited) for research usage only. It was trained on a code based instruction set and it does not have any moderation mechanisms. Use at your own risk, we are not responsible for any usage or output of this model.
 Quote from Zephyr (base-model) repository: "Zephyr-7B-β has not been aligned to human preferences for safety within the RLHF phase or deployed with in-the-loop filtering of responses like ChatGPT, so the model can produce problematic outputs (especially when prompted to do so). It is also unknown what the size and composition of the corpus was used to train the base model (mistralai/Mistral-7B-v0.1), however it is likely to have included a mix of Web data and technical sources like books and code. See the Falcon 180B model card for an example of this."
 ### Recommendations
 <!-- This section is meant to convey recommendations with respect to the bias, risk, and technical limitations. -->
 Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
 ## Training procedure
 The following `bitsandbytes` quantization config was used during training:
 - quant_method: QuantizationMethod.BITS_AND_BYTES
 - load_in_8bit: False
 - load_in_4bit: True
 - llm_int8_threshold: 6.0
 - llm_int8_skip_modules: None
 - llm_int8_enable_fp32_cpu_offload: False
 - llm_int8_has_fp16_weight: False
 - bnb_4bit_quant_type: nf4
 - bnb_4bit_use_double_quant: False
 - bnb_4bit_compute_dtype: float16
 ### Framework versions
 - PEFT 0.6.2
 ## Training procedure
 The following `bitsandbytes` quantization config was used during training:
 - quant_method: QuantizationMethod.BITS_AND_BYTES
 - load_in_8bit: False
 - load_in_4bit: True
 - llm_int8_threshold: 6.0
 - llm_int8_skip_modules: None
 - llm_int8_enable_fp32_cpu_offload: False
 - llm_int8_has_fp16_weight: False
 - bnb_4bit_quant_type: nf4
 - bnb_4bit_use_double_quant: False
 - bnb_4bit_compute_dtype: float16
 ### Framework versions
 - PEFT 0.6.2
--- a/config.json
+++ b/config.json
@@ -0,0 +1,27 @@
 {
  "_name_or_path": "HuggingFaceH4/zephyr-7b-beta",
  "architectures": [
    "MistralForCausalLM"
  ],
  "attention_dropout": 0.0,
  "bos_token_id": 1,
  "eos_token_id": 2,
  "hidden_act": "silu",
  "hidden_size": 4096,
  "initializer_range": 0.02,
  "intermediate_size": 14336,
  "max_position_embeddings": 32768,
  "model_type": "mistral",
  "num_attention_heads": 32,
  "num_hidden_layers": 32,
  "num_key_value_heads": 8,
  "pad_token_id": 2,
  "rms_norm_eps": 1e-05,
  "rope_theta": 10000.0,
  "sliding_window": 4096,
  "tie_word_embeddings": false,
  "torch_dtype": "float16",
  "transformers_version": "4.36.1",
  "use_cache": true,
  "vocab_size": 32000
 }
--- a/generation_config.json
+++ b/generation_config.json
@@ -0,0 +1,6 @@
 {
  "_from_model_config": true,
  "bos_token_id": 1,
  "eos_token_id": 2,
  "transformers_version": "4.36.1"
 }
--- a/model-00001-of-00008.safetensors
+++ b/model-00001-of-00008.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:cd9a7b619602798695dde0d2d874c64ea9df6c91a70967cda3c8b3d244f54209
 size 1889587008
--- a/model-00002-of-00008.safetensors
+++ b/model-00002-of-00008.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:e750012a2e11102b9e422486205789df7bc2aeeac5711570218238bea368f3df
 size 1946243896
--- a/model-00003-of-00008.safetensors
+++ b/model-00003-of-00008.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:f9491f7a873406bf5a7602f6bd49ff3cb00a20fb0bc0ef5242c06d1893f2fe5b
 size 1979781392
--- a/model-00004-of-00008.safetensors
+++ b/model-00004-of-00008.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:0136d29c760aacaa3156c0916bc1964bffceb310bef54c90a9eab1035d8a6f4d
 size 1946243936
--- a/model-00005-of-00008.safetensors
+++ b/model-00005-of-00008.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:94dbdadda7d14bcd0d7ed8a06839965cd9b02708a62aaeef0b2ae1e1e33654a9
 size 1979781416
--- a/model-00006-of-00008.safetensors
+++ b/model-00006-of-00008.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:b5e4ad97e94d680a191a3a10e02d6c4cc639ae310a6b06f1279197774d2813c4
 size 1946243936
--- a/model-00007-of-00008.safetensors
+++ b/model-00007-of-00008.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:a655268fdb1fe2635154fa0523fb4281ed4313a88fcb7d2577d960b337f7209c
 size 1979781416
--- a/model-00008-of-00008.safetensors
+++ b/model-00008-of-00008.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:6299f2cdbf105cf4355654430986db6b0ecf90eaab52440075d97714f9dc068b
 size 815834664
--- a/model.safetensors.index.json
+++ b/model.safetensors.index.json
@@ -0,0 +1,298 @@
 {
  "metadata": {
    "total_size": 14483464192
  },
  "weight_map": {
    "lm_head.weight": "model-00008-of-00008.safetensors",
    "model.embed_tokens.weight": "model-00001-of-00008.safetensors",
    "model.layers.0.input_layernorm.weight": "model-00001-of-00008.safetensors",
    "model.layers.0.mlp.down_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.0.mlp.up_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00008.safetensors",
    "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.1.input_layernorm.weight": "model-00001-of-00008.safetensors",
    "model.layers.1.mlp.down_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.1.mlp.up_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00008.safetensors",
    "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.10.input_layernorm.weight": "model-00003-of-00008.safetensors",
    "model.layers.10.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.10.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.10.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.10.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
    "model.layers.10.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.10.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.10.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.10.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.11.input_layernorm.weight": "model-00003-of-00008.safetensors",
    "model.layers.11.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.11.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.11.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.11.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
    "model.layers.11.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.11.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.11.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.11.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.12.input_layernorm.weight": "model-00004-of-00008.safetensors",
    "model.layers.12.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.12.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.12.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.12.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
    "model.layers.12.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.12.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.12.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.12.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.13.input_layernorm.weight": "model-00004-of-00008.safetensors",
    "model.layers.13.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.13.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.13.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.13.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
    "model.layers.13.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.13.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.13.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.13.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.14.input_layernorm.weight": "model-00004-of-00008.safetensors",
    "model.layers.14.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.14.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.14.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.14.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
    "model.layers.14.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.14.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.14.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.14.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.15.input_layernorm.weight": "model-00004-of-00008.safetensors",
    "model.layers.15.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.15.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.15.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.15.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
    "model.layers.15.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.15.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.15.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.15.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.16.input_layernorm.weight": "model-00004-of-00008.safetensors",
    "model.layers.16.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.16.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.16.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.16.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
    "model.layers.16.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.16.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.16.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.16.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.17.input_layernorm.weight": "model-00005-of-00008.safetensors",
    "model.layers.17.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.17.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.17.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.17.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
    "model.layers.17.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.17.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.17.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.17.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
    "model.layers.18.input_layernorm.weight": "model-00005-of-00008.safetensors",
    "model.layers.18.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.18.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.18.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.18.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
    "model.layers.18.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.18.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.18.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.18.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.19.input_layernorm.weight": "model-00005-of-00008.safetensors",
    "model.layers.19.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.19.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.19.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.19.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
    "model.layers.19.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.19.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.19.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.19.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.2.input_layernorm.weight": "model-00001-of-00008.safetensors",
    "model.layers.2.mlp.down_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.2.mlp.up_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00008.safetensors",
    "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.20.input_layernorm.weight": "model-00005-of-00008.safetensors",
    "model.layers.20.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.20.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.20.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.20.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
    "model.layers.20.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.20.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.20.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.20.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.21.input_layernorm.weight": "model-00006-of-00008.safetensors",
    "model.layers.21.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.21.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.21.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.21.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
    "model.layers.21.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.21.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.21.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.21.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
    "model.layers.22.input_layernorm.weight": "model-00006-of-00008.safetensors",
    "model.layers.22.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.22.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.22.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.22.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
    "model.layers.22.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.22.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.22.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.22.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.23.input_layernorm.weight": "model-00006-of-00008.safetensors",
    "model.layers.23.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.23.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.23.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.23.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
    "model.layers.23.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.23.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.23.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.23.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.24.input_layernorm.weight": "model-00006-of-00008.safetensors",
    "model.layers.24.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.24.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.24.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.24.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
    "model.layers.24.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.24.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.24.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.24.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.25.input_layernorm.weight": "model-00006-of-00008.safetensors",
    "model.layers.25.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.25.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.25.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.25.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
    "model.layers.25.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.25.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.25.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.25.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.26.input_layernorm.weight": "model-00007-of-00008.safetensors",
    "model.layers.26.mlp.down_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.26.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.26.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.26.post_attention_layernorm.weight": "model-00007-of-00008.safetensors",
    "model.layers.26.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.26.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.26.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.26.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
    "model.layers.27.input_layernorm.weight": "model-00007-of-00008.safetensors",
    "model.layers.27.mlp.down_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.27.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.27.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.27.post_attention_layernorm.weight": "model-00007-of-00008.safetensors",
    "model.layers.27.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.27.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.27.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.27.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.28.input_layernorm.weight": "model-00007-of-00008.safetensors",
    "model.layers.28.mlp.down_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.28.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.28.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.28.post_attention_layernorm.weight": "model-00007-of-00008.safetensors",
    "model.layers.28.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.28.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.28.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.28.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.29.input_layernorm.weight": "model-00007-of-00008.safetensors",
    "model.layers.29.mlp.down_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.29.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.29.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.29.post_attention_layernorm.weight": "model-00007-of-00008.safetensors",
    "model.layers.29.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.29.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.29.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.29.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.3.input_layernorm.weight": "model-00002-of-00008.safetensors",
    "model.layers.3.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.3.mlp.up_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.3.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
    "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00008.safetensors",
    "model.layers.30.input_layernorm.weight": "model-00008-of-00008.safetensors",
    "model.layers.30.mlp.down_proj.weight": "model-00008-of-00008.safetensors",
    "model.layers.30.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.30.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.30.post_attention_layernorm.weight": "model-00008-of-00008.safetensors",
    "model.layers.30.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.30.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.30.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.30.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
    "model.layers.31.input_layernorm.weight": "model-00008-of-00008.safetensors",
    "model.layers.31.mlp.down_proj.weight": "model-00008-of-00008.safetensors",
    "model.layers.31.mlp.gate_proj.weight": "model-00008-of-00008.safetensors",
    "model.layers.31.mlp.up_proj.weight": "model-00008-of-00008.safetensors",
    "model.layers.31.post_attention_layernorm.weight": "model-00008-of-00008.safetensors",
    "model.layers.31.self_attn.k_proj.weight": "model-00008-of-00008.safetensors",
    "model.layers.31.self_attn.o_proj.weight": "model-00008-of-00008.safetensors",
    "model.layers.31.self_attn.q_proj.weight": "model-00008-of-00008.safetensors",
    "model.layers.31.self_attn.v_proj.weight": "model-00008-of-00008.safetensors",
    "model.layers.4.input_layernorm.weight": "model-00002-of-00008.safetensors",
    "model.layers.4.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.4.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.4.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.4.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
    "model.layers.4.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.4.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.4.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.4.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.5.input_layernorm.weight": "model-00002-of-00008.safetensors",
    "model.layers.5.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.5.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.5.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.5.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
    "model.layers.5.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.5.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.5.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.5.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.6.input_layernorm.weight": "model-00002-of-00008.safetensors",
    "model.layers.6.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.6.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.6.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.6.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
    "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.6.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.6.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.6.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.7.input_layernorm.weight": "model-00002-of-00008.safetensors",
    "model.layers.7.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.7.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.7.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.7.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
    "model.layers.7.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.7.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.7.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.7.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.8.input_layernorm.weight": "model-00003-of-00008.safetensors",
    "model.layers.8.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.8.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.8.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.8.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
    "model.layers.8.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.8.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.8.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.8.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
    "model.layers.9.input_layernorm.weight": "model-00003-of-00008.safetensors",
    "model.layers.9.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.9.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.9.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.9.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
    "model.layers.9.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.9.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.9.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
    "model.layers.9.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
    "model.norm.weight": "model-00008-of-00008.safetensors"
  }
 }
--- a/special_tokens_map.json
+++ b/special_tokens_map.json
@@ -0,0 +1,35 @@
 {
  "additional_special_tokens": [
    "<unk>",
    "<s>",
    "</s>"
  ],
  "bos_token": {
    "content": "<s>",
    "lstrip": false,
    "normalized": false,
    "rstrip": false,
    "single_word": false
  },
  "eos_token": {
    "content": "</s>",
    "lstrip": false,
    "normalized": false,
    "rstrip": false,
    "single_word": false
  },
  "pad_token": {
    "content": "</s>",
    "lstrip": false,
    "normalized": false,
    "rstrip": false,
    "single_word": false
  },
  "unk_token": {
    "content": "<unk>",
    "lstrip": false,
    "normalized": false,
    "rstrip": false,
    "single_word": false
  }
 }
--- a/tokenizer.json
+++ b/tokenizer.json
--- a/tokenizer.model
+++ b/tokenizer.model
--- a/tokenizer_config.json
+++ b/tokenizer_config.json
@@ -0,0 +1,48 @@
 {
  "add_bos_token": true,
  "add_eos_token": false,
  "added_tokens_decoder": {
    "0": {
      "content": "<unk>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "1": {
      "content": "<s>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "2": {
      "content": "</s>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    }
  },
  "additional_special_tokens": [
    "<unk>",
    "<s>",
    "</s>"
  ],
  "bos_token": "<s>",
  "chat_template": "{% for message in messages %}\n{% if message['role'] == 'user' %}\n{{ '<|user|>\n' + message['content'] + eos_token }}\n{% elif message['role'] == 'system' %}\n{{ '<|system|>\n' + message['content'] + eos_token }}\n{% elif message['role'] == 'assistant' %}\n{{ '<|assistant|>\n'  + message['content'] + eos_token }}\n{% endif %}\n{% if loop.last and add_generation_prompt %}\n{{ '<|assistant|>' }}\n{% endif %}\n{% endfor %}",
  "clean_up_tokenization_spaces": false,
  "eos_token": "</s>",
  "legacy": true,
  "model_max_length": 1024,
  "pad_token": "</s>",
  "sp_model_kwargs": {},
  "spaces_between_special_tokens": false,
  "tokenizer_class": "LlamaTokenizer",
  "truncation_side": "left",
  "unk_token": "<unk>",
  "use_default_system_prompt": true
 }