初始化项目，由ModelHub XC社区提供模型

Model: mlx-community/GLM-Z1-9B-0414-bf16 Source: Original Platform
2026-04-13 01:24:02 +08:00
commit 0b4a429a0e
12 changed files with 843 additions and 0 deletions
--- a/.gitattributes
+++ b/.gitattributes
@@ -0,0 +1,49 @@
 *.7z filter=lfs diff=lfs merge=lfs -text
 *.arrow filter=lfs diff=lfs merge=lfs -text
 *.bin filter=lfs diff=lfs merge=lfs -text
 *.bin.* filter=lfs diff=lfs merge=lfs -text
 *.bz2 filter=lfs diff=lfs merge=lfs -text
 *.ftz filter=lfs diff=lfs merge=lfs -text
 *.gz filter=lfs diff=lfs merge=lfs -text
 *.h5 filter=lfs diff=lfs merge=lfs -text
 *.joblib filter=lfs diff=lfs merge=lfs -text
 *.lfs.* filter=lfs diff=lfs merge=lfs -text
 *.model filter=lfs diff=lfs merge=lfs -text
 *.msgpack filter=lfs diff=lfs merge=lfs -text
 *.onnx filter=lfs diff=lfs merge=lfs -text
 *.ot filter=lfs diff=lfs merge=lfs -text
 *.parquet filter=lfs diff=lfs merge=lfs -text
 *.pb filter=lfs diff=lfs merge=lfs -text
 *.pt filter=lfs diff=lfs merge=lfs -text
 *.pth filter=lfs diff=lfs merge=lfs -text
 *.rar filter=lfs diff=lfs merge=lfs -text
 saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.tar.* filter=lfs diff=lfs merge=lfs -text
 *.tflite filter=lfs diff=lfs merge=lfs -text
 *.tgz filter=lfs diff=lfs merge=lfs -text
 *.xz filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zstandard filter=lfs diff=lfs merge=lfs -text
 *.tfevents* filter=lfs diff=lfs merge=lfs -text
 *.db* filter=lfs diff=lfs merge=lfs -text
 *.ark* filter=lfs diff=lfs merge=lfs -text
 **/*ckpt*data* filter=lfs diff=lfs merge=lfs -text
 **/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text
 **/*ckpt*.index filter=lfs diff=lfs merge=lfs -text
 *.safetensors filter=lfs diff=lfs merge=lfs -text
 *.ckpt filter=lfs diff=lfs merge=lfs -text
 *.gguf* filter=lfs diff=lfs merge=lfs -text
 *.ggml filter=lfs diff=lfs merge=lfs -text
 *.llamafile* filter=lfs diff=lfs merge=lfs -text
 *.pt2 filter=lfs diff=lfs merge=lfs -text
 *.mlmodel filter=lfs diff=lfs merge=lfs -text
 *.npy filter=lfs diff=lfs merge=lfs -text
 *.npz filter=lfs diff=lfs merge=lfs -text
 *.pickle filter=lfs diff=lfs merge=lfs -text
 *.pkl filter=lfs diff=lfs merge=lfs -text
 *.tar filter=lfs diff=lfs merge=lfs -text
 *.wasm filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
 tokenizer.json filter=lfs diff=lfs merge=lfs -text
--- a/README.md
+++ b/README.md
@@ -0,0 +1,39 @@
 ---
 license: mit
 language:
 - zh
 - en
 pipeline_tag: text-generation
 library_name: mlx
 base_model: THUDM/GLM-Z1-9B-0414
 tags:
 - mlx
 ---
 # mlx-community/GLM-Z1-9B-0414-bf16
 This model [mlx-community/GLM-Z1-9B-0414-bf16](https://huggingface.co/mlx-community/GLM-Z1-9B-0414-bf16) was
 converted to MLX format from [THUDM/GLM-Z1-9B-0414](https://huggingface.co/THUDM/GLM-Z1-9B-0414)
 using mlx-lm version **0.23.0**.
 ## Use with mlx
 ```bash
 pip install mlx-lm
 ```
 ```python
 from mlx_lm import load, generate
 model, tokenizer = load("mlx-community/GLM-Z1-9B-0414-bf16")
 prompt = "hello"
 if tokenizer.chat_template is not None:
    messages = [{"role": "user", "content": prompt}]
    prompt = tokenizer.apply_chat_template(
        messages, add_generation_prompt=True
    )
 response = generate(model, tokenizer, prompt=prompt, verbose=True)
 ```
--- a/config.json
+++ b/config.json
@@ -0,0 +1,31 @@
 {
    "architectures": [
        "Glm4ForCausalLM"
    ],
    "attention_bias": true,
    "attention_dropout": 0.0,
    "eos_token_id": [
        151329,
        151336,
        151338
    ],
    "head_dim": 128,
    "hidden_act": "silu",
    "hidden_size": 4096,
    "initializer_range": 0.02,
    "intermediate_size": 13696,
    "max_position_embeddings": 32768,
    "model_type": "glm4",
    "num_attention_heads": 32,
    "num_hidden_layers": 40,
    "num_key_value_heads": 2,
    "pad_token_id": 151329,
    "partial_rotary_factor": 0.5,
    "rms_norm_eps": 1e-05,
    "rope_theta": 10000.0,
    "tie_word_embeddings": false,
    "torch_dtype": "bfloat16",
    "transformers_version": "4.52.0.dev0",
    "use_cache": true,
    "vocab_size": 151552
 }
--- a/configuration.json
+++ b/configuration.json
@@ -0,0 +1 @@
 {"framework": "pytorch", "task": "text-generation", "allow_remote": true}
--- a/model-00001-of-00004.safetensors
+++ b/model-00001-of-00004.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:8178ce1223de398d0553af2e7f969f803b7de5757f75f14bbb601672671e9181
 size 5358668053
--- a/model-00002-of-00004.safetensors
+++ b/model-00002-of-00004.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:e15e4b507eaa85bad6a64efa566dd6f50dd7531505307ea24fd865e7fd2d94ae
 size 5336768649
--- a/model-00003-of-00004.safetensors
+++ b/model-00003-of-00004.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:272125385d0b7a8a4eeb2de7a59c0d630cc34e5032a317ed28cebc99c2dbb4d7
 size 5303214131
--- a/model-00004-of-00004.safetensors
+++ b/model-00004-of-00004.safetensors
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:d5cafb95f58e20d45f90b9bfb5c2d37b7e0af2e33372aaadd6f075ef26a1f0c1
 size 2801967421
--- a/model.safetensors.index.json
+++ b/model.safetensors.index.json
@@ -0,0 +1,530 @@
 {
    "metadata": {
        "total_size": 18800558080
    },
    "weight_map": {
        "lm_head.weight": "model-00004-of-00004.safetensors",
        "model.embed_tokens.weight": "model-00001-of-00004.safetensors",
        "model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.0.mlp.gate_up_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.0.post_mlp_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.0.post_self_attn_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.0.self_attn.k_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.0.self_attn.q_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.0.self_attn.v_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.1.mlp.gate_up_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.1.post_mlp_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.1.post_self_attn_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.1.self_attn.k_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.1.self_attn.q_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.1.self_attn.v_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.10.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.10.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.10.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.10.self_attn.k_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.10.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.10.self_attn.q_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.10.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.10.self_attn.v_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.10.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.11.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.11.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.11.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.11.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.11.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.11.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.12.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.12.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.12.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.12.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.12.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.12.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.13.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.13.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.13.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.13.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.13.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.13.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.14.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.14.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.14.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.14.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.14.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.14.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.15.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.15.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.15.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.15.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.15.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.15.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.16.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.16.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.16.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.16.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.16.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.16.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.17.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.17.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.17.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.17.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.17.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.17.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.18.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.18.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.18.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.18.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.18.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.18.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.19.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.19.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.19.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.19.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.19.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.19.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.2.mlp.gate_up_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.2.post_mlp_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.2.post_self_attn_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.2.self_attn.k_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.2.self_attn.q_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.2.self_attn.v_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.20.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.20.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.20.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.20.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.20.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.20.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.20.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.20.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.20.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.21.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.21.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.21.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.21.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.21.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.21.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.21.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.21.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.21.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.21.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.21.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.21.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.21.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.22.input_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.22.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.22.mlp.gate_up_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.22.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.22.post_mlp_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.22.post_self_attn_layernorm.weight": "model-00002-of-00004.safetensors",
        "model.layers.22.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.22.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.22.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.22.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.22.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.22.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.22.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.23.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.23.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.23.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.23.self_attn.k_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.23.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.23.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.23.self_attn.q_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.23.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.23.self_attn.v_proj.bias": "model-00002-of-00004.safetensors",
        "model.layers.23.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
        "model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.24.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.24.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.24.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.24.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.24.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.24.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.25.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.25.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.25.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.25.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.25.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.25.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.26.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.26.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.26.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.26.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.26.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.26.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.27.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.27.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.27.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.27.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.27.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.27.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.28.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.28.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.28.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.28.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.28.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.28.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.29.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.29.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.29.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.29.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.29.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.29.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.3.mlp.gate_up_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.3.post_mlp_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.3.post_self_attn_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.3.self_attn.k_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.3.self_attn.q_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.3.self_attn.v_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.30.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.30.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.30.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.30.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.30.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.30.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.31.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.31.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.31.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.31.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.31.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.31.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.31.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.31.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.31.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.32.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.32.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.32.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.32.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.32.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.32.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.32.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.32.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.32.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.32.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.32.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.32.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.32.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.33.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.33.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.33.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.33.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.33.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.33.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.33.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.33.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.33.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.33.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.33.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.33.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.33.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.34.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.34.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.34.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.34.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.34.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.34.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.34.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.34.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.34.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.34.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.34.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.34.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.34.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.35.input_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.35.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.35.mlp.gate_up_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.35.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.35.post_mlp_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.35.post_self_attn_layernorm.weight": "model-00003-of-00004.safetensors",
        "model.layers.35.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.35.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.35.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.35.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.35.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.35.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.35.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.36.input_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.36.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.36.mlp.gate_up_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.36.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.36.post_mlp_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.36.post_self_attn_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.36.self_attn.k_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.36.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.36.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.36.self_attn.q_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.36.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.36.self_attn.v_proj.bias": "model-00003-of-00004.safetensors",
        "model.layers.36.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
        "model.layers.37.input_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.37.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.37.mlp.gate_up_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.37.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.37.post_mlp_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.37.post_self_attn_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.37.self_attn.k_proj.bias": "model-00004-of-00004.safetensors",
        "model.layers.37.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.37.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.37.self_attn.q_proj.bias": "model-00004-of-00004.safetensors",
        "model.layers.37.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.37.self_attn.v_proj.bias": "model-00004-of-00004.safetensors",
        "model.layers.37.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.38.input_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.38.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.38.mlp.gate_up_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.38.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.38.post_mlp_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.38.post_self_attn_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.38.self_attn.k_proj.bias": "model-00004-of-00004.safetensors",
        "model.layers.38.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.38.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.38.self_attn.q_proj.bias": "model-00004-of-00004.safetensors",
        "model.layers.38.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.38.self_attn.v_proj.bias": "model-00004-of-00004.safetensors",
        "model.layers.38.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.39.input_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.39.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.39.mlp.gate_up_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.39.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.39.post_mlp_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.39.post_self_attn_layernorm.weight": "model-00004-of-00004.safetensors",
        "model.layers.39.self_attn.k_proj.bias": "model-00004-of-00004.safetensors",
        "model.layers.39.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.39.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.39.self_attn.q_proj.bias": "model-00004-of-00004.safetensors",
        "model.layers.39.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.39.self_attn.v_proj.bias": "model-00004-of-00004.safetensors",
        "model.layers.39.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
        "model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.4.mlp.gate_up_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.4.post_mlp_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.4.post_self_attn_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.4.self_attn.k_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.4.self_attn.q_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.4.self_attn.v_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.5.mlp.gate_up_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.5.post_mlp_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.5.post_self_attn_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.5.self_attn.k_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.5.self_attn.q_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.5.self_attn.v_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.6.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.6.mlp.gate_up_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.6.post_mlp_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.6.post_self_attn_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.6.self_attn.k_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.6.self_attn.q_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.6.self_attn.v_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.7.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.7.mlp.gate_up_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.7.post_mlp_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.7.post_self_attn_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.7.self_attn.k_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.7.self_attn.q_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.7.self_attn.v_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.8.mlp.gate_up_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.8.post_mlp_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.8.post_self_attn_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.8.self_attn.k_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.8.self_attn.q_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.8.self_attn.v_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.9.input_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.9.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.9.mlp.gate_up_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.9.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.9.post_mlp_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.9.post_self_attn_layernorm.weight": "model-00001-of-00004.safetensors",
        "model.layers.9.self_attn.k_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.9.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.9.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.9.self_attn.q_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.9.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
        "model.layers.9.self_attn.v_proj.bias": "model-00001-of-00004.safetensors",
        "model.layers.9.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
        "model.norm.weight": "model-00004-of-00004.safetensors"
    }
 }
--- a/special_tokens_map.json
+++ b/special_tokens_map.json
@@ -0,0 +1,32 @@
 {
  "additional_special_tokens": [
    "<|endoftext|>",
    "[MASK]",
    "[gMASK]",
    "[sMASK]",
    "<sop>",
    "<eop>",
    "<|system|>",
    "<|user|>",
    "<|assistant|>",
    "<|observation|>",
    "<|begin_of_image|>",
    "<|end_of_image|>",
    "<|begin_of_video|>",
    "<|end_of_video|>"
  ],
  "eos_token": {
    "content": "<|endoftext|>",
    "lstrip": false,
    "normalized": false,
    "rstrip": false,
    "single_word": false
  },
  "pad_token": {
    "content": "<|endoftext|>",
    "lstrip": false,
    "normalized": false,
    "rstrip": false,
    "single_word": false
  }
 }
--- a/tokenizer.json
+++ b/tokenizer.json
@@ -0,0 +1,3 @@
 version https://git-lfs.github.com/spec/v1
 oid sha256:76ebeac0d8bd7879ead7b43c16b44981f277e47225de2bd7de9ae1a6cc664a8c
 size 19966496
--- a/tokenizer_config.json
+++ b/tokenizer_config.json
@@ -0,0 +1,146 @@
 {
  "added_tokens_decoder": {
    "151329": {
      "content": "<|endoftext|>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151330": {
      "content": "[MASK]",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151331": {
      "content": "[gMASK]",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151332": {
      "content": "[sMASK]",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151333": {
      "content": "<sop>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151334": {
      "content": "<eop>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151335": {
      "content": "<|system|>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151336": {
      "content": "<|user|>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151337": {
      "content": "<|assistant|>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151338": {
      "content": "<|observation|>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151339": {
      "content": "<|begin_of_image|>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151340": {
      "content": "<|end_of_image|>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151341": {
      "content": "<|begin_of_video|>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    },
    "151342": {
      "content": "<|end_of_video|>",
      "lstrip": false,
      "normalized": false,
      "rstrip": false,
      "single_word": false,
      "special": true
    }
  },
  "additional_special_tokens": [
    "<|endoftext|>",
    "[MASK]",
    "[gMASK]",
    "[sMASK]",
    "<sop>",
    "<eop>",
    "<|system|>",
    "<|user|>",
    "<|assistant|>",
    "<|observation|>",
    "<|begin_of_image|>",
    "<|end_of_image|>",
    "<|begin_of_video|>",
    "<|end_of_video|>"
  ],
  "chat_template": "[gMASK]<sop>{%- if tools -%}<|system|>你是一个名为 ChatGLM 的人工智能助手。你是基于智谱 AI 公司训练的语言模型 GLM-4 模型开发的，你的任务是针对用户的问题和要求提供适当的答复和支持。\n\n# 可用工具\n\n{% for tool in tools %}{%- set function = tool.function if tool.get(\"function\") else tool %}\n\n## {{ function.name }}\n\n{{ function | tojson(indent=4, ensure_ascii=False) }}\n在调用上述函数时，请使用 Json 格式表示调用的参数。{%- endfor %}{%- endif -%}{%- for msg in messages %}{%- if msg.role == 'system' %}<|system|>\n{{ msg.content }}{%- endif %}{%- endfor %}{%- for message in messages if message.role != 'system' %}{%- set role = message['role'] %}{%- set content = message['content'] %}{%- set visible = content.split('</think>')[-1].strip() %}{%- set meta = message.get(\"metadata\", \"\") %}{%- if role == 'user' %}<|user|>\n{{ visible }}{%- elif role == 'assistant' and not meta %}<|assistant|>\n{{ visible }}{%- elif role == 'assistant' and meta %}<|assistant|>{{ meta }} \n{{ visible }}{%- elif role == 'observation' %}<|observation|>\n{{ visible }}{%- endif %}{%- endfor %}{% if add_generation_prompt %}<|assistant|>{% endif %}",
  "clean_up_tokenization_spaces": false,
  "do_lower_case": false,
  "eos_token": "<|endoftext|>",
  "extra_special_tokens": {},
  "model_input_names": [
    "input_ids",
    "attention_mask"
  ],
  "model_max_length": 128000,
  "pad_token": "<|endoftext|>",
  "padding_side": "left",
  "remove_space": false,
  "tokenizer_class": "PreTrainedTokenizer"
 }
		`@@ -0,0 +1 @@`
							`{"framework": "pytorch", "task": "text-generation", "allow_remote": true}`