初始化项目,由ModelHub XC社区提供模型

Model: tzchen07/ShieldGemma-2B-SFT-X9c
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-12 22:37:16 +08:00
commit 5f57a63b36
50 changed files with 9027 additions and 0 deletions

View File

@@ -0,0 +1,29 @@
{%- if not guideline and messages[0].role == "system" %}
{%- set guideline = messages[0].content %}
{%- set messages = messages[1:] %}
{%- endif %}
{{- bos_token }}
{%- if messages[-1].role == 'user' %}
{{- "You are a policy expert trying to help determine whether a user prompt is in violation of the defined safety policies.\n\n" }}
{{- "<start_of_turn>\n" }}
{{- "Human Question: " + messages[-1].content }}
{{- "\n<end_of_turn>\n\n" }}
{{- "Our safety principle is defined in the below:\n\n" }}
{{- "* " + guideline + "\n" }}
{{- "\n===\n\n" }}
{{- "Does the human question violate the above principle? Your answer must start with 'Yes' or 'No'. And then walk through step by step to be sure we answer correctly.\n\n" }}
{%- else %}
{{- "You are a policy expert trying to help determine whether an AI response to a prompt is in violation of the defined safety policies.\n\n" }}
{{- "<start_of_turn>\n" }}
{{- "Human Question: " + messages[-2].content }}
{{- "\n<end_of_turn>\n" }}
{{- "<start_of_turn>\n" }}
{{- "Chatbot Response: " + messages[-1].content }}
{{- "\n<end_of_turn>\n\n" }}
{{- "Our safety principle is defined in the below:\n\n" }}
{{- "* " + guideline + "\n" }}
{{- "\n===\n\n" }}
{{- "Does the Chatbot Response violate the above principle? Your answer must start with 'Yes' or 'No'. And then walk through step by step to be sure we answer correctly.\n\n" }}
{%- endif %}

View File

@@ -0,0 +1,60 @@
{
"architectures": [
"Gemma2ForCausalLM"
],
"attention_bias": false,
"attention_dropout": 0.0,
"attn_logit_softcapping": 50.0,
"bos_token_id": 2,
"cache_implementation": "hybrid",
"dtype": "float32",
"eos_token_id": 107,
"final_logit_softcapping": 30.0,
"head_dim": 256,
"hidden_act": "gelu_pytorch_tanh",
"hidden_activation": "gelu_pytorch_tanh",
"hidden_size": 2304,
"initializer_range": 0.02,
"intermediate_size": 9216,
"layer_types": [
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"full_attention"
],
"max_position_embeddings": 8192,
"model_type": "gemma2",
"num_attention_heads": 8,
"num_hidden_layers": 26,
"num_key_value_heads": 4,
"pad_token_id": 0,
"query_pre_attn_scalar": 224,
"rms_norm_eps": 1e-06,
"rope_theta": 10000.0,
"sliding_window": 4096,
"transformers_version": "4.57.1",
"use_cache": false,
"vocab_size": 256000
}

View File

@@ -0,0 +1,11 @@
{
"_from_model_config": true,
"bos_token_id": 2,
"cache_implementation": "hybrid",
"eos_token_id": [
107,
1
],
"pad_token_id": 0,
"transformers_version": "4.57.1"
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:cd6462f5dd8e49d595de57df12e28c3385af73d46a3ae34a1379a0f6e73ad3e6
size 4992576136

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:7de3332316388b3b73e53312dcae360dd575f1461783684d5e833edc3db830c2
size 4983443424

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6f7b3d32f7caade7d722004664ea4a5e5fef8c3160f4316f7e04620c2c4f45c2
size 481381384

View File

@@ -0,0 +1,296 @@
{
"metadata": {
"total_parameters": 2614341888,
"total_size": 10457367552
},
"weight_map": {
"model.embed_tokens.weight": "model-00001-of-00003.safetensors",
"model.layers.0.input_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.0.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.0.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.1.input_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.1.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.1.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.10.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.10.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.10.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.10.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.10.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.10.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.10.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.10.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.10.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.10.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.10.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.11.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.11.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.11.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.11.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.11.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.11.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.11.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.11.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.11.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.11.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.11.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.12.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.12.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.12.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.12.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.12.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.12.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.12.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.12.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.12.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.12.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.12.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.13.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.13.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.13.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.13.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.13.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.13.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.13.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.13.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.13.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.13.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.13.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.14.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.14.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.14.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.14.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.14.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.14.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.14.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.14.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.14.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.14.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.14.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.15.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.15.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.15.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.15.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.15.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.15.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.15.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.15.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.15.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.15.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.15.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.16.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.16.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.16.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.16.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.16.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.16.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.16.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.16.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.16.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.16.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.16.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.17.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.17.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.17.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.17.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.17.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.17.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.17.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.17.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.17.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.17.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.17.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.18.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.18.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.18.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.18.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.18.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.18.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.18.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.18.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.18.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.19.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.19.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.19.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.19.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.19.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.2.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.2.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.20.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.20.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.20.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.20.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.20.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.20.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.20.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.20.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.20.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.21.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.21.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.21.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.21.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.21.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.21.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.21.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.22.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.22.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.22.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.22.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.22.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.22.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.22.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.22.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.22.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.22.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.23.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.23.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.23.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.23.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.23.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.23.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.23.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.23.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.23.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.23.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.23.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.24.input_layernorm.weight": "model-00003-of-00003.safetensors",
"model.layers.24.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
"model.layers.24.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.24.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
"model.layers.24.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
"model.layers.24.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
"model.layers.24.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
"model.layers.24.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.24.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.24.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.24.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.25.input_layernorm.weight": "model-00003-of-00003.safetensors",
"model.layers.25.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
"model.layers.25.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
"model.layers.25.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
"model.layers.25.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
"model.layers.25.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
"model.layers.25.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
"model.layers.25.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
"model.layers.25.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
"model.layers.25.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
"model.layers.25.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
"model.layers.3.input_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.3.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.3.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.3.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.3.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.3.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.3.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.4.input_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.4.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.4.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.4.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.4.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.4.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.4.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.4.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.4.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.4.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.4.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.5.input_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.5.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.5.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.5.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.5.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.5.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.5.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.5.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.5.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.5.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.5.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.6.input_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.6.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.6.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.6.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.6.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.6.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.6.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.6.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.6.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.6.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.6.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.7.input_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.7.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.7.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.7.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.7.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.7.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.7.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
"model.layers.7.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.7.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.7.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.7.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.8.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.8.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.8.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.8.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.8.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.8.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.8.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.8.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.8.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.8.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.8.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
"model.layers.9.input_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.9.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.9.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.9.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.9.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.9.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.9.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
"model.layers.9.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.9.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.9.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
"model.layers.9.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
"model.norm.weight": "model-00003-of-00003.safetensors"
}
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:12eb5b4d15de5ce54b21b2905ee36bc17fafe6611db085c8223bc6e1e720f19b
size 20914986654

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1ff264f99d31b522cc7e2a4eac9d38606d0c58a34c0adc74d71e0ca8b371dc36
size 14244

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fb7af121fc91812845d8b32f31e81625ecba44b8867994dcd56712ce4e083131
size 1064

View File

@@ -0,0 +1,30 @@
{
"bos_token": {
"content": "<bos>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"eos_token": {
"content": "<end_of_turn>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": {
"content": "<pad>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"unk_token": {
"content": "<unk>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
}
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5f7eee611703c5ce5d1eee32d9cdcfe465647b8aff0c1dfb3bed7ad7dbb05060
size 34362873

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:61a7b147390c64585d6c3543dd6fc636906c9af3865a5548f27f31aee1d4c8e2
size 4241003

File diff suppressed because it is too large Load Diff

View File

@@ -0,0 +1,566 @@
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 384,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.02609262883235486,
"grad_norm": 90.7743148803711,
"learning_rate": 5.128205128205128e-07,
"loss": 3.4203,
"step": 5
},
{
"epoch": 0.05218525766470972,
"grad_norm": 52.55401611328125,
"learning_rate": 1.153846153846154e-06,
"loss": 2.8478,
"step": 10
},
{
"epoch": 0.07827788649706457,
"grad_norm": 17.9848575592041,
"learning_rate": 1.794871794871795e-06,
"loss": 1.524,
"step": 15
},
{
"epoch": 0.10437051532941943,
"grad_norm": 9.579212188720703,
"learning_rate": 2.435897435897436e-06,
"loss": 0.8379,
"step": 20
},
{
"epoch": 0.1304631441617743,
"grad_norm": 6.430282115936279,
"learning_rate": 3.0769230769230774e-06,
"loss": 0.4496,
"step": 25
},
{
"epoch": 0.15655577299412915,
"grad_norm": 5.243109703063965,
"learning_rate": 3.7179487179487184e-06,
"loss": 0.2512,
"step": 30
},
{
"epoch": 0.182648401826484,
"grad_norm": 5.690948963165283,
"learning_rate": 4.358974358974359e-06,
"loss": 0.183,
"step": 35
},
{
"epoch": 0.20874103065883887,
"grad_norm": 4.116969585418701,
"learning_rate": 5e-06,
"loss": 0.1788,
"step": 40
},
{
"epoch": 0.23483365949119372,
"grad_norm": 2.8701882362365723,
"learning_rate": 4.9974091841168195e-06,
"loss": 0.1605,
"step": 45
},
{
"epoch": 0.2609262883235486,
"grad_norm": 7.059335231781006,
"learning_rate": 4.989642106328829e-06,
"loss": 0.1394,
"step": 50
},
{
"epoch": 0.28701891715590344,
"grad_norm": 3.2651431560516357,
"learning_rate": 4.976714865090827e-06,
"loss": 0.083,
"step": 55
},
{
"epoch": 0.3131115459882583,
"grad_norm": 2.457581043243408,
"learning_rate": 4.958654254084356e-06,
"loss": 0.0896,
"step": 60
},
{
"epoch": 0.33920417482061316,
"grad_norm": 2.72770619392395,
"learning_rate": 4.935497706683698e-06,
"loss": 0.0991,
"step": 65
},
{
"epoch": 0.365296803652968,
"grad_norm": 2.0538723468780518,
"learning_rate": 4.907293218369499e-06,
"loss": 0.0979,
"step": 70
},
{
"epoch": 0.3913894324853229,
"grad_norm": 2.1862363815307617,
"learning_rate": 4.874099247250799e-06,
"loss": 0.0933,
"step": 75
},
{
"epoch": 0.41748206131767773,
"grad_norm": 2.605069637298584,
"learning_rate": 4.835984592901678e-06,
"loss": 0.0959,
"step": 80
},
{
"epoch": 0.4435746901500326,
"grad_norm": 1.2768350839614868,
"learning_rate": 4.793028253763633e-06,
"loss": 0.0749,
"step": 85
},
{
"epoch": 0.46966731898238745,
"grad_norm": 4.374709606170654,
"learning_rate": 4.745319263409241e-06,
"loss": 0.0991,
"step": 90
},
{
"epoch": 0.4957599478147423,
"grad_norm": 1.9398008584976196,
"learning_rate": 4.692956506006486e-06,
"loss": 0.0833,
"step": 95
},
{
"epoch": 0.5218525766470972,
"grad_norm": 1.7450673580169678,
"learning_rate": 4.636048511366222e-06,
"loss": 0.0804,
"step": 100
},
{
"epoch": 0.547945205479452,
"grad_norm": 1.712754249572754,
"learning_rate": 4.5747132299975634e-06,
"loss": 0.0867,
"step": 105
},
{
"epoch": 0.5740378343118069,
"grad_norm": 1.083371877670288,
"learning_rate": 4.509077788637446e-06,
"loss": 0.0688,
"step": 110
},
{
"epoch": 0.6001304631441617,
"grad_norm": 1.936558485031128,
"learning_rate": 4.43927822676105e-06,
"loss": 0.0772,
"step": 115
},
{
"epoch": 0.6262230919765166,
"grad_norm": 1.4485265016555786,
"learning_rate": 4.3654592146192146e-06,
"loss": 0.0767,
"step": 120
},
{
"epoch": 0.6523157208088715,
"grad_norm": 1.4740047454833984,
"learning_rate": 4.287773753387249e-06,
"loss": 0.0715,
"step": 125
},
{
"epoch": 0.6784083496412263,
"grad_norm": 1.7988250255584717,
"learning_rate": 4.206382858046636e-06,
"loss": 0.0823,
"step": 130
},
{
"epoch": 0.7045009784735812,
"grad_norm": 0.9675837159156799,
"learning_rate": 4.12145522365689e-06,
"loss": 0.0955,
"step": 135
},
{
"epoch": 0.730593607305936,
"grad_norm": 1.3645009994506836,
"learning_rate": 4.033166875709291e-06,
"loss": 0.062,
"step": 140
},
{
"epoch": 0.7566862361382909,
"grad_norm": 1.3581523895263672,
"learning_rate": 3.941700805287169e-06,
"loss": 0.0868,
"step": 145
},
{
"epoch": 0.7827788649706457,
"grad_norm": 1.8347728252410889,
"learning_rate": 3.84724658978894e-06,
"loss": 0.0681,
"step": 150
},
{
"epoch": 0.8088714938030006,
"grad_norm": 1.278552770614624,
"learning_rate": 3.7500000000000005e-06,
"loss": 0.0709,
"step": 155
},
{
"epoch": 0.8349641226353555,
"grad_norm": 1.676578402519226,
"learning_rate": 3.650162594327881e-06,
"loss": 0.0714,
"step": 160
},
{
"epoch": 0.8610567514677103,
"grad_norm": 0.9458003640174866,
"learning_rate": 3.5479413010416606e-06,
"loss": 0.081,
"step": 165
},
{
"epoch": 0.8871493803000652,
"grad_norm": 1.0945783853530884,
"learning_rate": 3.443547989381536e-06,
"loss": 0.0715,
"step": 170
},
{
"epoch": 0.91324200913242,
"grad_norm": 1.2435601949691772,
"learning_rate": 3.3371990304274654e-06,
"loss": 0.0638,
"step": 175
},
{
"epoch": 0.9393346379647749,
"grad_norm": 1.2059943675994873,
"learning_rate": 3.2291148486370626e-06,
"loss": 0.0683,
"step": 180
},
{
"epoch": 0.9654272667971298,
"grad_norm": 0.6467380523681641,
"learning_rate": 3.11951946498225e-06,
"loss": 0.0709,
"step": 185
},
{
"epoch": 0.9915198956294846,
"grad_norm": 0.8123487830162048,
"learning_rate": 3.0086400326315853e-06,
"loss": 0.0601,
"step": 190
},
{
"epoch": 1.015655577299413,
"grad_norm": 1.2716907262802124,
"learning_rate": 2.896706366140629e-06,
"loss": 0.0579,
"step": 195
},
{
"epoch": 1.0417482061317678,
"grad_norm": 1.656204104423523,
"learning_rate": 2.7839504651261873e-06,
"loss": 0.0623,
"step": 200
},
{
"epoch": 1.0678408349641226,
"grad_norm": 1.195453405380249,
"learning_rate": 2.670606033411678e-06,
"loss": 0.0533,
"step": 205
},
{
"epoch": 1.0939334637964775,
"grad_norm": 1.3654705286026,
"learning_rate": 2.556907994640264e-06,
"loss": 0.0556,
"step": 210
},
{
"epoch": 1.1200260926288323,
"grad_norm": 0.6175478100776672,
"learning_rate": 2.443092005359736e-06,
"loss": 0.0459,
"step": 215
},
{
"epoch": 1.1461187214611872,
"grad_norm": 0.884466826915741,
"learning_rate": 2.3293939665883233e-06,
"loss": 0.057,
"step": 220
},
{
"epoch": 1.172211350293542,
"grad_norm": 1.4396722316741943,
"learning_rate": 2.2160495348738127e-06,
"loss": 0.063,
"step": 225
},
{
"epoch": 1.198303979125897,
"grad_norm": 0.893132209777832,
"learning_rate": 2.1032936338593716e-06,
"loss": 0.0554,
"step": 230
},
{
"epoch": 1.2243966079582518,
"grad_norm": 0.778917133808136,
"learning_rate": 1.991359967368416e-06,
"loss": 0.0538,
"step": 235
},
{
"epoch": 1.2504892367906066,
"grad_norm": 1.2776492834091187,
"learning_rate": 1.8804805350177507e-06,
"loss": 0.0538,
"step": 240
},
{
"epoch": 1.2765818656229615,
"grad_norm": 1.0802513360977173,
"learning_rate": 1.7708851513629376e-06,
"loss": 0.0541,
"step": 245
},
{
"epoch": 1.3026744944553164,
"grad_norm": 0.9070869088172913,
"learning_rate": 1.6628009695725348e-06,
"loss": 0.0479,
"step": 250
},
{
"epoch": 1.3287671232876712,
"grad_norm": 1.4413901567459106,
"learning_rate": 1.5564520106184643e-06,
"loss": 0.0514,
"step": 255
},
{
"epoch": 1.354859752120026,
"grad_norm": 1.1004434823989868,
"learning_rate": 1.4520586989583406e-06,
"loss": 0.0486,
"step": 260
},
{
"epoch": 1.380952380952381,
"grad_norm": 1.1776546239852905,
"learning_rate": 1.3498374056721198e-06,
"loss": 0.0467,
"step": 265
},
{
"epoch": 1.4070450097847358,
"grad_norm": 1.00455641746521,
"learning_rate": 1.2500000000000007e-06,
"loss": 0.0555,
"step": 270
},
{
"epoch": 1.4331376386170906,
"grad_norm": 1.1658108234405518,
"learning_rate": 1.1527534102110613e-06,
"loss": 0.05,
"step": 275
},
{
"epoch": 1.4592302674494455,
"grad_norm": 0.5006061792373657,
"learning_rate": 1.0582991947128324e-06,
"loss": 0.0531,
"step": 280
},
{
"epoch": 1.4853228962818004,
"grad_norm": 0.5298914909362793,
"learning_rate": 9.66833124290709e-07,
"loss": 0.0475,
"step": 285
},
{
"epoch": 1.5114155251141552,
"grad_norm": 0.6051680445671082,
"learning_rate": 8.785447763431101e-07,
"loss": 0.0444,
"step": 290
},
{
"epoch": 1.53750815394651,
"grad_norm": 1.11183500289917,
"learning_rate": 7.936171419533653e-07,
"loss": 0.0547,
"step": 295
},
{
"epoch": 1.563600782778865,
"grad_norm": 2.068556308746338,
"learning_rate": 7.122262466127513e-07,
"loss": 0.0501,
"step": 300
},
{
"epoch": 1.5896934116112198,
"grad_norm": 0.9381551742553711,
"learning_rate": 6.345407853807864e-07,
"loss": 0.0535,
"step": 305
},
{
"epoch": 1.6157860404435747,
"grad_norm": 1.0716235637664795,
"learning_rate": 5.607217732389503e-07,
"loss": 0.0533,
"step": 310
},
{
"epoch": 1.6418786692759295,
"grad_norm": 0.8771371245384216,
"learning_rate": 4.909222113625545e-07,
"loss": 0.0567,
"step": 315
},
{
"epoch": 1.6679712981082844,
"grad_norm": 1.4611281156539917,
"learning_rate": 4.252867700024374e-07,
"loss": 0.0569,
"step": 320
},
{
"epoch": 1.6940639269406392,
"grad_norm": 0.42611926794052124,
"learning_rate": 3.639514886337786e-07,
"loss": 0.0562,
"step": 325
},
{
"epoch": 1.720156555772994,
"grad_norm": 1.3697057962417603,
"learning_rate": 3.0704349399351437e-07,
"loss": 0.0504,
"step": 330
},
{
"epoch": 1.746249184605349,
"grad_norm": 1.6137443780899048,
"learning_rate": 2.5468073659076e-07,
"loss": 0.0481,
"step": 335
},
{
"epoch": 1.7723418134377038,
"grad_norm": 0.8786627054214478,
"learning_rate": 2.0697174623636795e-07,
"loss": 0.0435,
"step": 340
},
{
"epoch": 1.7984344422700587,
"grad_norm": 0.6073723435401917,
"learning_rate": 1.6401540709832242e-07,
"loss": 0.0448,
"step": 345
},
{
"epoch": 1.8245270711024135,
"grad_norm": 0.4912233054637909,
"learning_rate": 1.2590075274920206e-07,
"loss": 0.0531,
"step": 350
},
{
"epoch": 1.8506196999347684,
"grad_norm": 1.127508282661438,
"learning_rate": 9.270678163050218e-08,
"loss": 0.0521,
"step": 355
},
{
"epoch": 1.8767123287671232,
"grad_norm": 1.1689162254333496,
"learning_rate": 6.450229331630253e-08,
"loss": 0.051,
"step": 360
},
{
"epoch": 1.902804957599478,
"grad_norm": 0.8796715140342712,
"learning_rate": 4.134574591564494e-08,
"loss": 0.0514,
"step": 365
},
{
"epoch": 1.928897586431833,
"grad_norm": 0.8864848017692566,
"learning_rate": 2.3285134909173113e-08,
"loss": 0.0484,
"step": 370
},
{
"epoch": 1.9549902152641878,
"grad_norm": 0.7268601655960083,
"learning_rate": 1.0357893671171793e-08,
"loss": 0.0502,
"step": 375
},
{
"epoch": 1.9810828440965427,
"grad_norm": 0.7900459170341492,
"learning_rate": 2.590815883181108e-09,
"loss": 0.0468,
"step": 380
}
],
"logging_steps": 5,
"max_steps": 384,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 9.374131655263642e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:eefe3a8f7ff0a02d7d0543cd767d19dca4a289498f0d97a7be7b74c1ad482785
size 5816