初始化项目,由ModelHub XC社区提供模型
Model: tzchen07/ShieldGemma-2B-SFT-X9c Source: Original Platform
This commit is contained in:
38
.gitattributes
vendored
Normal file
38
.gitattributes
vendored
Normal file
@@ -0,0 +1,38 @@
|
|||||||
|
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.model filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
checkpoint-200/tokenizer.json filter=lfs diff=lfs merge=lfs -text
|
||||||
|
checkpoint-384/tokenizer.json filter=lfs diff=lfs merge=lfs -text
|
||||||
|
tokenizer.json filter=lfs diff=lfs merge=lfs -text
|
||||||
58
README.md
Normal file
58
README.md
Normal file
@@ -0,0 +1,58 @@
|
|||||||
|
---
|
||||||
|
library_name: transformers
|
||||||
|
license: other
|
||||||
|
base_model: jxm/shieldgemma-2b
|
||||||
|
tags:
|
||||||
|
- llama-factory
|
||||||
|
- full
|
||||||
|
- generated_from_trainer
|
||||||
|
model-index:
|
||||||
|
- name: output
|
||||||
|
results: []
|
||||||
|
---
|
||||||
|
|
||||||
|
<!-- This model card has been generated automatically according to the information the Trainer had access to. You
|
||||||
|
should probably proofread and complete it, then remove this comment. -->
|
||||||
|
|
||||||
|
# output
|
||||||
|
|
||||||
|
This model is a fine-tuned version of [jxm/shieldgemma-2b](https://huggingface.co/jxm/shieldgemma-2b) on the v1_6_plus_v1_6b_plus_v1_6c dataset.
|
||||||
|
|
||||||
|
## Model description
|
||||||
|
|
||||||
|
More information needed
|
||||||
|
|
||||||
|
## Intended uses & limitations
|
||||||
|
|
||||||
|
More information needed
|
||||||
|
|
||||||
|
## Training and evaluation data
|
||||||
|
|
||||||
|
More information needed
|
||||||
|
|
||||||
|
## Training procedure
|
||||||
|
|
||||||
|
### Training hyperparameters
|
||||||
|
|
||||||
|
The following hyperparameters were used during training:
|
||||||
|
- learning_rate: 5e-06
|
||||||
|
- train_batch_size: 4
|
||||||
|
- eval_batch_size: 8
|
||||||
|
- seed: 42
|
||||||
|
- gradient_accumulation_steps: 16
|
||||||
|
- total_train_batch_size: 64
|
||||||
|
- optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
|
||||||
|
- lr_scheduler_type: cosine
|
||||||
|
- lr_scheduler_warmup_ratio: 0.1
|
||||||
|
- num_epochs: 2.0
|
||||||
|
|
||||||
|
### Training results
|
||||||
|
|
||||||
|
|
||||||
|
|
||||||
|
### Framework versions
|
||||||
|
|
||||||
|
- Transformers 4.57.1
|
||||||
|
- Pytorch 2.4.0+cu121
|
||||||
|
- Datasets 3.6.0
|
||||||
|
- Tokenizers 0.22.2
|
||||||
8
all_results.json
Normal file
8
all_results.json
Normal file
@@ -0,0 +1,8 @@
|
|||||||
|
{
|
||||||
|
"epoch": 2.0,
|
||||||
|
"total_flos": 9.374131655263642e+17,
|
||||||
|
"train_loss": 0.18539645452983677,
|
||||||
|
"train_runtime": 8558.6373,
|
||||||
|
"train_samples_per_second": 2.865,
|
||||||
|
"train_steps_per_second": 0.045
|
||||||
|
}
|
||||||
29
chat_template.jinja
Normal file
29
chat_template.jinja
Normal file
@@ -0,0 +1,29 @@
|
|||||||
|
{%- if not guideline and messages[0].role == "system" %}
|
||||||
|
{%- set guideline = messages[0].content %}
|
||||||
|
{%- set messages = messages[1:] %}
|
||||||
|
{%- endif %}
|
||||||
|
|
||||||
|
{{- bos_token }}
|
||||||
|
{%- if messages[-1].role == 'user' %}
|
||||||
|
{{- "You are a policy expert trying to help determine whether a user prompt is in violation of the defined safety policies.\n\n" }}
|
||||||
|
{{- "<start_of_turn>\n" }}
|
||||||
|
{{- "Human Question: " + messages[-1].content }}
|
||||||
|
{{- "\n<end_of_turn>\n\n" }}
|
||||||
|
{{- "Our safety principle is defined in the below:\n\n" }}
|
||||||
|
{{- "* " + guideline + "\n" }}
|
||||||
|
{{- "\n===\n\n" }}
|
||||||
|
{{- "Does the human question violate the above principle? Your answer must start with 'Yes' or 'No'. And then walk through step by step to be sure we answer correctly.\n\n" }}
|
||||||
|
{%- else %}
|
||||||
|
{{- "You are a policy expert trying to help determine whether an AI response to a prompt is in violation of the defined safety policies.\n\n" }}
|
||||||
|
{{- "<start_of_turn>\n" }}
|
||||||
|
{{- "Human Question: " + messages[-2].content }}
|
||||||
|
{{- "\n<end_of_turn>\n" }}
|
||||||
|
{{- "<start_of_turn>\n" }}
|
||||||
|
{{- "Chatbot Response: " + messages[-1].content }}
|
||||||
|
{{- "\n<end_of_turn>\n\n" }}
|
||||||
|
{{- "Our safety principle is defined in the below:\n\n" }}
|
||||||
|
{{- "* " + guideline + "\n" }}
|
||||||
|
{{- "\n===\n\n" }}
|
||||||
|
{{- "Does the Chatbot Response violate the above principle? Your answer must start with 'Yes' or 'No'. And then walk through step by step to be sure we answer correctly.\n\n" }}
|
||||||
|
{%- endif %}
|
||||||
|
|
||||||
29
checkpoint-200/chat_template.jinja
Normal file
29
checkpoint-200/chat_template.jinja
Normal file
@@ -0,0 +1,29 @@
|
|||||||
|
{%- if not guideline and messages[0].role == "system" %}
|
||||||
|
{%- set guideline = messages[0].content %}
|
||||||
|
{%- set messages = messages[1:] %}
|
||||||
|
{%- endif %}
|
||||||
|
|
||||||
|
{{- bos_token }}
|
||||||
|
{%- if messages[-1].role == 'user' %}
|
||||||
|
{{- "You are a policy expert trying to help determine whether a user prompt is in violation of the defined safety policies.\n\n" }}
|
||||||
|
{{- "<start_of_turn>\n" }}
|
||||||
|
{{- "Human Question: " + messages[-1].content }}
|
||||||
|
{{- "\n<end_of_turn>\n\n" }}
|
||||||
|
{{- "Our safety principle is defined in the below:\n\n" }}
|
||||||
|
{{- "* " + guideline + "\n" }}
|
||||||
|
{{- "\n===\n\n" }}
|
||||||
|
{{- "Does the human question violate the above principle? Your answer must start with 'Yes' or 'No'. And then walk through step by step to be sure we answer correctly.\n\n" }}
|
||||||
|
{%- else %}
|
||||||
|
{{- "You are a policy expert trying to help determine whether an AI response to a prompt is in violation of the defined safety policies.\n\n" }}
|
||||||
|
{{- "<start_of_turn>\n" }}
|
||||||
|
{{- "Human Question: " + messages[-2].content }}
|
||||||
|
{{- "\n<end_of_turn>\n" }}
|
||||||
|
{{- "<start_of_turn>\n" }}
|
||||||
|
{{- "Chatbot Response: " + messages[-1].content }}
|
||||||
|
{{- "\n<end_of_turn>\n\n" }}
|
||||||
|
{{- "Our safety principle is defined in the below:\n\n" }}
|
||||||
|
{{- "* " + guideline + "\n" }}
|
||||||
|
{{- "\n===\n\n" }}
|
||||||
|
{{- "Does the Chatbot Response violate the above principle? Your answer must start with 'Yes' or 'No'. And then walk through step by step to be sure we answer correctly.\n\n" }}
|
||||||
|
{%- endif %}
|
||||||
|
|
||||||
60
checkpoint-200/config.json
Normal file
60
checkpoint-200/config.json
Normal file
@@ -0,0 +1,60 @@
|
|||||||
|
{
|
||||||
|
"architectures": [
|
||||||
|
"Gemma2ForCausalLM"
|
||||||
|
],
|
||||||
|
"attention_bias": false,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"attn_logit_softcapping": 50.0,
|
||||||
|
"bos_token_id": 2,
|
||||||
|
"cache_implementation": "hybrid",
|
||||||
|
"dtype": "float32",
|
||||||
|
"eos_token_id": 107,
|
||||||
|
"final_logit_softcapping": 30.0,
|
||||||
|
"head_dim": 256,
|
||||||
|
"hidden_act": "gelu_pytorch_tanh",
|
||||||
|
"hidden_activation": "gelu_pytorch_tanh",
|
||||||
|
"hidden_size": 2304,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"intermediate_size": 9216,
|
||||||
|
"layer_types": [
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention"
|
||||||
|
],
|
||||||
|
"max_position_embeddings": 8192,
|
||||||
|
"model_type": "gemma2",
|
||||||
|
"num_attention_heads": 8,
|
||||||
|
"num_hidden_layers": 26,
|
||||||
|
"num_key_value_heads": 4,
|
||||||
|
"pad_token_id": 0,
|
||||||
|
"query_pre_attn_scalar": 224,
|
||||||
|
"rms_norm_eps": 1e-06,
|
||||||
|
"rope_theta": 10000.0,
|
||||||
|
"sliding_window": 4096,
|
||||||
|
"transformers_version": "4.57.1",
|
||||||
|
"use_cache": false,
|
||||||
|
"vocab_size": 256000
|
||||||
|
}
|
||||||
11
checkpoint-200/generation_config.json
Normal file
11
checkpoint-200/generation_config.json
Normal file
@@ -0,0 +1,11 @@
|
|||||||
|
{
|
||||||
|
"_from_model_config": true,
|
||||||
|
"bos_token_id": 2,
|
||||||
|
"cache_implementation": "hybrid",
|
||||||
|
"eos_token_id": [
|
||||||
|
107,
|
||||||
|
1
|
||||||
|
],
|
||||||
|
"pad_token_id": 0,
|
||||||
|
"transformers_version": "4.57.1"
|
||||||
|
}
|
||||||
3
checkpoint-200/model-00001-of-00003.safetensors
Normal file
3
checkpoint-200/model-00001-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:84cfbc451445fe336b8c5a5c9f51685cce314ea3a6c79f828a672793ab13592c
|
||||||
|
size 4992576136
|
||||||
3
checkpoint-200/model-00002-of-00003.safetensors
Normal file
3
checkpoint-200/model-00002-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:7753c6b4347d065295308f41fcca0f0e386c2c7561a9038835f6d015e14cfa69
|
||||||
|
size 4983443424
|
||||||
3
checkpoint-200/model-00003-of-00003.safetensors
Normal file
3
checkpoint-200/model-00003-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:552a68907a67353c512bbe49bab82df6c96b63157d3c6212efca325d591f38a2
|
||||||
|
size 481381384
|
||||||
296
checkpoint-200/model.safetensors.index.json
Normal file
296
checkpoint-200/model.safetensors.index.json
Normal file
@@ -0,0 +1,296 @@
|
|||||||
|
{
|
||||||
|
"metadata": {
|
||||||
|
"total_parameters": 2614341888,
|
||||||
|
"total_size": 10457367552
|
||||||
|
},
|
||||||
|
"weight_map": {
|
||||||
|
"model.embed_tokens.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.10.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.25.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.3.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.9.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.norm.weight": "model-00003-of-00003.safetensors"
|
||||||
|
}
|
||||||
|
}
|
||||||
3
checkpoint-200/optimizer.pt
Normal file
3
checkpoint-200/optimizer.pt
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:2ca6f2e46b5fb68f1f5e603543a139d3a96a39386bff6bee59ffe3c7134332a1
|
||||||
|
size 20914986654
|
||||||
3
checkpoint-200/rng_state.pth
Normal file
3
checkpoint-200/rng_state.pth
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:1ff264f99d31b522cc7e2a4eac9d38606d0c58a34c0adc74d71e0ca8b371dc36
|
||||||
|
size 14244
|
||||||
3
checkpoint-200/scheduler.pt
Normal file
3
checkpoint-200/scheduler.pt
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:5a432f72b1cbf0ee1800c201cfd47f6b35d8742bafa70e9fd7c63525d473359c
|
||||||
|
size 1064
|
||||||
30
checkpoint-200/special_tokens_map.json
Normal file
30
checkpoint-200/special_tokens_map.json
Normal file
@@ -0,0 +1,30 @@
|
|||||||
|
{
|
||||||
|
"bos_token": {
|
||||||
|
"content": "<bos>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"eos_token": {
|
||||||
|
"content": "<end_of_turn>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"pad_token": {
|
||||||
|
"content": "<pad>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"unk_token": {
|
||||||
|
"content": "<unk>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
}
|
||||||
|
}
|
||||||
3
checkpoint-200/tokenizer.json
Normal file
3
checkpoint-200/tokenizer.json
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:5f7eee611703c5ce5d1eee32d9cdcfe465647b8aff0c1dfb3bed7ad7dbb05060
|
||||||
|
size 34362873
|
||||||
3
checkpoint-200/tokenizer.model
Normal file
3
checkpoint-200/tokenizer.model
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:61a7b147390c64585d6c3543dd6fc636906c9af3865a5548f27f31aee1d4c8e2
|
||||||
|
size 4241003
|
||||||
2011
checkpoint-200/tokenizer_config.json
Normal file
2011
checkpoint-200/tokenizer_config.json
Normal file
File diff suppressed because it is too large
Load Diff
314
checkpoint-200/trainer_state.json
Normal file
314
checkpoint-200/trainer_state.json
Normal file
@@ -0,0 +1,314 @@
|
|||||||
|
{
|
||||||
|
"best_global_step": null,
|
||||||
|
"best_metric": null,
|
||||||
|
"best_model_checkpoint": null,
|
||||||
|
"epoch": 1.0417482061317678,
|
||||||
|
"eval_steps": 500,
|
||||||
|
"global_step": 200,
|
||||||
|
"is_hyper_param_search": false,
|
||||||
|
"is_local_process_zero": true,
|
||||||
|
"is_world_process_zero": true,
|
||||||
|
"log_history": [
|
||||||
|
{
|
||||||
|
"epoch": 0.02609262883235486,
|
||||||
|
"grad_norm": 90.7743148803711,
|
||||||
|
"learning_rate": 5.128205128205128e-07,
|
||||||
|
"loss": 3.4203,
|
||||||
|
"step": 5
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.05218525766470972,
|
||||||
|
"grad_norm": 52.55401611328125,
|
||||||
|
"learning_rate": 1.153846153846154e-06,
|
||||||
|
"loss": 2.8478,
|
||||||
|
"step": 10
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.07827788649706457,
|
||||||
|
"grad_norm": 17.9848575592041,
|
||||||
|
"learning_rate": 1.794871794871795e-06,
|
||||||
|
"loss": 1.524,
|
||||||
|
"step": 15
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.10437051532941943,
|
||||||
|
"grad_norm": 9.579212188720703,
|
||||||
|
"learning_rate": 2.435897435897436e-06,
|
||||||
|
"loss": 0.8379,
|
||||||
|
"step": 20
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.1304631441617743,
|
||||||
|
"grad_norm": 6.430282115936279,
|
||||||
|
"learning_rate": 3.0769230769230774e-06,
|
||||||
|
"loss": 0.4496,
|
||||||
|
"step": 25
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.15655577299412915,
|
||||||
|
"grad_norm": 5.243109703063965,
|
||||||
|
"learning_rate": 3.7179487179487184e-06,
|
||||||
|
"loss": 0.2512,
|
||||||
|
"step": 30
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.182648401826484,
|
||||||
|
"grad_norm": 5.690948963165283,
|
||||||
|
"learning_rate": 4.358974358974359e-06,
|
||||||
|
"loss": 0.183,
|
||||||
|
"step": 35
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.20874103065883887,
|
||||||
|
"grad_norm": 4.116969585418701,
|
||||||
|
"learning_rate": 5e-06,
|
||||||
|
"loss": 0.1788,
|
||||||
|
"step": 40
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.23483365949119372,
|
||||||
|
"grad_norm": 2.8701882362365723,
|
||||||
|
"learning_rate": 4.9974091841168195e-06,
|
||||||
|
"loss": 0.1605,
|
||||||
|
"step": 45
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.2609262883235486,
|
||||||
|
"grad_norm": 7.059335231781006,
|
||||||
|
"learning_rate": 4.989642106328829e-06,
|
||||||
|
"loss": 0.1394,
|
||||||
|
"step": 50
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.28701891715590344,
|
||||||
|
"grad_norm": 3.2651431560516357,
|
||||||
|
"learning_rate": 4.976714865090827e-06,
|
||||||
|
"loss": 0.083,
|
||||||
|
"step": 55
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.3131115459882583,
|
||||||
|
"grad_norm": 2.457581043243408,
|
||||||
|
"learning_rate": 4.958654254084356e-06,
|
||||||
|
"loss": 0.0896,
|
||||||
|
"step": 60
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.33920417482061316,
|
||||||
|
"grad_norm": 2.72770619392395,
|
||||||
|
"learning_rate": 4.935497706683698e-06,
|
||||||
|
"loss": 0.0991,
|
||||||
|
"step": 65
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.365296803652968,
|
||||||
|
"grad_norm": 2.0538723468780518,
|
||||||
|
"learning_rate": 4.907293218369499e-06,
|
||||||
|
"loss": 0.0979,
|
||||||
|
"step": 70
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.3913894324853229,
|
||||||
|
"grad_norm": 2.1862363815307617,
|
||||||
|
"learning_rate": 4.874099247250799e-06,
|
||||||
|
"loss": 0.0933,
|
||||||
|
"step": 75
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.41748206131767773,
|
||||||
|
"grad_norm": 2.605069637298584,
|
||||||
|
"learning_rate": 4.835984592901678e-06,
|
||||||
|
"loss": 0.0959,
|
||||||
|
"step": 80
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.4435746901500326,
|
||||||
|
"grad_norm": 1.2768350839614868,
|
||||||
|
"learning_rate": 4.793028253763633e-06,
|
||||||
|
"loss": 0.0749,
|
||||||
|
"step": 85
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.46966731898238745,
|
||||||
|
"grad_norm": 4.374709606170654,
|
||||||
|
"learning_rate": 4.745319263409241e-06,
|
||||||
|
"loss": 0.0991,
|
||||||
|
"step": 90
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.4957599478147423,
|
||||||
|
"grad_norm": 1.9398008584976196,
|
||||||
|
"learning_rate": 4.692956506006486e-06,
|
||||||
|
"loss": 0.0833,
|
||||||
|
"step": 95
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5218525766470972,
|
||||||
|
"grad_norm": 1.7450673580169678,
|
||||||
|
"learning_rate": 4.636048511366222e-06,
|
||||||
|
"loss": 0.0804,
|
||||||
|
"step": 100
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.547945205479452,
|
||||||
|
"grad_norm": 1.712754249572754,
|
||||||
|
"learning_rate": 4.5747132299975634e-06,
|
||||||
|
"loss": 0.0867,
|
||||||
|
"step": 105
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5740378343118069,
|
||||||
|
"grad_norm": 1.083371877670288,
|
||||||
|
"learning_rate": 4.509077788637446e-06,
|
||||||
|
"loss": 0.0688,
|
||||||
|
"step": 110
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6001304631441617,
|
||||||
|
"grad_norm": 1.936558485031128,
|
||||||
|
"learning_rate": 4.43927822676105e-06,
|
||||||
|
"loss": 0.0772,
|
||||||
|
"step": 115
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6262230919765166,
|
||||||
|
"grad_norm": 1.4485265016555786,
|
||||||
|
"learning_rate": 4.3654592146192146e-06,
|
||||||
|
"loss": 0.0767,
|
||||||
|
"step": 120
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6523157208088715,
|
||||||
|
"grad_norm": 1.4740047454833984,
|
||||||
|
"learning_rate": 4.287773753387249e-06,
|
||||||
|
"loss": 0.0715,
|
||||||
|
"step": 125
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6784083496412263,
|
||||||
|
"grad_norm": 1.7988250255584717,
|
||||||
|
"learning_rate": 4.206382858046636e-06,
|
||||||
|
"loss": 0.0823,
|
||||||
|
"step": 130
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7045009784735812,
|
||||||
|
"grad_norm": 0.9675837159156799,
|
||||||
|
"learning_rate": 4.12145522365689e-06,
|
||||||
|
"loss": 0.0955,
|
||||||
|
"step": 135
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.730593607305936,
|
||||||
|
"grad_norm": 1.3645009994506836,
|
||||||
|
"learning_rate": 4.033166875709291e-06,
|
||||||
|
"loss": 0.062,
|
||||||
|
"step": 140
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7566862361382909,
|
||||||
|
"grad_norm": 1.3581523895263672,
|
||||||
|
"learning_rate": 3.941700805287169e-06,
|
||||||
|
"loss": 0.0868,
|
||||||
|
"step": 145
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7827788649706457,
|
||||||
|
"grad_norm": 1.8347728252410889,
|
||||||
|
"learning_rate": 3.84724658978894e-06,
|
||||||
|
"loss": 0.0681,
|
||||||
|
"step": 150
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8088714938030006,
|
||||||
|
"grad_norm": 1.278552770614624,
|
||||||
|
"learning_rate": 3.7500000000000005e-06,
|
||||||
|
"loss": 0.0709,
|
||||||
|
"step": 155
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8349641226353555,
|
||||||
|
"grad_norm": 1.676578402519226,
|
||||||
|
"learning_rate": 3.650162594327881e-06,
|
||||||
|
"loss": 0.0714,
|
||||||
|
"step": 160
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8610567514677103,
|
||||||
|
"grad_norm": 0.9458003640174866,
|
||||||
|
"learning_rate": 3.5479413010416606e-06,
|
||||||
|
"loss": 0.081,
|
||||||
|
"step": 165
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8871493803000652,
|
||||||
|
"grad_norm": 1.0945783853530884,
|
||||||
|
"learning_rate": 3.443547989381536e-06,
|
||||||
|
"loss": 0.0715,
|
||||||
|
"step": 170
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.91324200913242,
|
||||||
|
"grad_norm": 1.2435601949691772,
|
||||||
|
"learning_rate": 3.3371990304274654e-06,
|
||||||
|
"loss": 0.0638,
|
||||||
|
"step": 175
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9393346379647749,
|
||||||
|
"grad_norm": 1.2059943675994873,
|
||||||
|
"learning_rate": 3.2291148486370626e-06,
|
||||||
|
"loss": 0.0683,
|
||||||
|
"step": 180
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9654272667971298,
|
||||||
|
"grad_norm": 0.6467380523681641,
|
||||||
|
"learning_rate": 3.11951946498225e-06,
|
||||||
|
"loss": 0.0709,
|
||||||
|
"step": 185
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9915198956294846,
|
||||||
|
"grad_norm": 0.8123487830162048,
|
||||||
|
"learning_rate": 3.0086400326315853e-06,
|
||||||
|
"loss": 0.0601,
|
||||||
|
"step": 190
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.015655577299413,
|
||||||
|
"grad_norm": 1.2716907262802124,
|
||||||
|
"learning_rate": 2.896706366140629e-06,
|
||||||
|
"loss": 0.0579,
|
||||||
|
"step": 195
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.0417482061317678,
|
||||||
|
"grad_norm": 1.656204104423523,
|
||||||
|
"learning_rate": 2.7839504651261873e-06,
|
||||||
|
"loss": 0.0623,
|
||||||
|
"step": 200
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"logging_steps": 5,
|
||||||
|
"max_steps": 384,
|
||||||
|
"num_input_tokens_seen": 0,
|
||||||
|
"num_train_epochs": 2,
|
||||||
|
"save_steps": 200,
|
||||||
|
"stateful_callbacks": {
|
||||||
|
"TrainerControl": {
|
||||||
|
"args": {
|
||||||
|
"should_epoch_stop": false,
|
||||||
|
"should_evaluate": false,
|
||||||
|
"should_log": false,
|
||||||
|
"should_save": true,
|
||||||
|
"should_training_stop": false
|
||||||
|
},
|
||||||
|
"attributes": {}
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"total_flos": 4.890173722188964e+17,
|
||||||
|
"train_batch_size": 4,
|
||||||
|
"trial_name": null,
|
||||||
|
"trial_params": null
|
||||||
|
}
|
||||||
3
checkpoint-200/training_args.bin
Normal file
3
checkpoint-200/training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:eefe3a8f7ff0a02d7d0543cd767d19dca4a289498f0d97a7be7b74c1ad482785
|
||||||
|
size 5816
|
||||||
29
checkpoint-384/chat_template.jinja
Normal file
29
checkpoint-384/chat_template.jinja
Normal file
@@ -0,0 +1,29 @@
|
|||||||
|
{%- if not guideline and messages[0].role == "system" %}
|
||||||
|
{%- set guideline = messages[0].content %}
|
||||||
|
{%- set messages = messages[1:] %}
|
||||||
|
{%- endif %}
|
||||||
|
|
||||||
|
{{- bos_token }}
|
||||||
|
{%- if messages[-1].role == 'user' %}
|
||||||
|
{{- "You are a policy expert trying to help determine whether a user prompt is in violation of the defined safety policies.\n\n" }}
|
||||||
|
{{- "<start_of_turn>\n" }}
|
||||||
|
{{- "Human Question: " + messages[-1].content }}
|
||||||
|
{{- "\n<end_of_turn>\n\n" }}
|
||||||
|
{{- "Our safety principle is defined in the below:\n\n" }}
|
||||||
|
{{- "* " + guideline + "\n" }}
|
||||||
|
{{- "\n===\n\n" }}
|
||||||
|
{{- "Does the human question violate the above principle? Your answer must start with 'Yes' or 'No'. And then walk through step by step to be sure we answer correctly.\n\n" }}
|
||||||
|
{%- else %}
|
||||||
|
{{- "You are a policy expert trying to help determine whether an AI response to a prompt is in violation of the defined safety policies.\n\n" }}
|
||||||
|
{{- "<start_of_turn>\n" }}
|
||||||
|
{{- "Human Question: " + messages[-2].content }}
|
||||||
|
{{- "\n<end_of_turn>\n" }}
|
||||||
|
{{- "<start_of_turn>\n" }}
|
||||||
|
{{- "Chatbot Response: " + messages[-1].content }}
|
||||||
|
{{- "\n<end_of_turn>\n\n" }}
|
||||||
|
{{- "Our safety principle is defined in the below:\n\n" }}
|
||||||
|
{{- "* " + guideline + "\n" }}
|
||||||
|
{{- "\n===\n\n" }}
|
||||||
|
{{- "Does the Chatbot Response violate the above principle? Your answer must start with 'Yes' or 'No'. And then walk through step by step to be sure we answer correctly.\n\n" }}
|
||||||
|
{%- endif %}
|
||||||
|
|
||||||
60
checkpoint-384/config.json
Normal file
60
checkpoint-384/config.json
Normal file
@@ -0,0 +1,60 @@
|
|||||||
|
{
|
||||||
|
"architectures": [
|
||||||
|
"Gemma2ForCausalLM"
|
||||||
|
],
|
||||||
|
"attention_bias": false,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"attn_logit_softcapping": 50.0,
|
||||||
|
"bos_token_id": 2,
|
||||||
|
"cache_implementation": "hybrid",
|
||||||
|
"dtype": "float32",
|
||||||
|
"eos_token_id": 107,
|
||||||
|
"final_logit_softcapping": 30.0,
|
||||||
|
"head_dim": 256,
|
||||||
|
"hidden_act": "gelu_pytorch_tanh",
|
||||||
|
"hidden_activation": "gelu_pytorch_tanh",
|
||||||
|
"hidden_size": 2304,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"intermediate_size": 9216,
|
||||||
|
"layer_types": [
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention"
|
||||||
|
],
|
||||||
|
"max_position_embeddings": 8192,
|
||||||
|
"model_type": "gemma2",
|
||||||
|
"num_attention_heads": 8,
|
||||||
|
"num_hidden_layers": 26,
|
||||||
|
"num_key_value_heads": 4,
|
||||||
|
"pad_token_id": 0,
|
||||||
|
"query_pre_attn_scalar": 224,
|
||||||
|
"rms_norm_eps": 1e-06,
|
||||||
|
"rope_theta": 10000.0,
|
||||||
|
"sliding_window": 4096,
|
||||||
|
"transformers_version": "4.57.1",
|
||||||
|
"use_cache": false,
|
||||||
|
"vocab_size": 256000
|
||||||
|
}
|
||||||
11
checkpoint-384/generation_config.json
Normal file
11
checkpoint-384/generation_config.json
Normal file
@@ -0,0 +1,11 @@
|
|||||||
|
{
|
||||||
|
"_from_model_config": true,
|
||||||
|
"bos_token_id": 2,
|
||||||
|
"cache_implementation": "hybrid",
|
||||||
|
"eos_token_id": [
|
||||||
|
107,
|
||||||
|
1
|
||||||
|
],
|
||||||
|
"pad_token_id": 0,
|
||||||
|
"transformers_version": "4.57.1"
|
||||||
|
}
|
||||||
3
checkpoint-384/model-00001-of-00003.safetensors
Normal file
3
checkpoint-384/model-00001-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:cd6462f5dd8e49d595de57df12e28c3385af73d46a3ae34a1379a0f6e73ad3e6
|
||||||
|
size 4992576136
|
||||||
3
checkpoint-384/model-00002-of-00003.safetensors
Normal file
3
checkpoint-384/model-00002-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:7de3332316388b3b73e53312dcae360dd575f1461783684d5e833edc3db830c2
|
||||||
|
size 4983443424
|
||||||
3
checkpoint-384/model-00003-of-00003.safetensors
Normal file
3
checkpoint-384/model-00003-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:6f7b3d32f7caade7d722004664ea4a5e5fef8c3160f4316f7e04620c2c4f45c2
|
||||||
|
size 481381384
|
||||||
296
checkpoint-384/model.safetensors.index.json
Normal file
296
checkpoint-384/model.safetensors.index.json
Normal file
@@ -0,0 +1,296 @@
|
|||||||
|
{
|
||||||
|
"metadata": {
|
||||||
|
"total_parameters": 2614341888,
|
||||||
|
"total_size": 10457367552
|
||||||
|
},
|
||||||
|
"weight_map": {
|
||||||
|
"model.embed_tokens.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.10.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.25.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.3.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.9.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.norm.weight": "model-00003-of-00003.safetensors"
|
||||||
|
}
|
||||||
|
}
|
||||||
3
checkpoint-384/optimizer.pt
Normal file
3
checkpoint-384/optimizer.pt
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:12eb5b4d15de5ce54b21b2905ee36bc17fafe6611db085c8223bc6e1e720f19b
|
||||||
|
size 20914986654
|
||||||
3
checkpoint-384/rng_state.pth
Normal file
3
checkpoint-384/rng_state.pth
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:1ff264f99d31b522cc7e2a4eac9d38606d0c58a34c0adc74d71e0ca8b371dc36
|
||||||
|
size 14244
|
||||||
3
checkpoint-384/scheduler.pt
Normal file
3
checkpoint-384/scheduler.pt
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:fb7af121fc91812845d8b32f31e81625ecba44b8867994dcd56712ce4e083131
|
||||||
|
size 1064
|
||||||
30
checkpoint-384/special_tokens_map.json
Normal file
30
checkpoint-384/special_tokens_map.json
Normal file
@@ -0,0 +1,30 @@
|
|||||||
|
{
|
||||||
|
"bos_token": {
|
||||||
|
"content": "<bos>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"eos_token": {
|
||||||
|
"content": "<end_of_turn>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"pad_token": {
|
||||||
|
"content": "<pad>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"unk_token": {
|
||||||
|
"content": "<unk>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
}
|
||||||
|
}
|
||||||
3
checkpoint-384/tokenizer.json
Normal file
3
checkpoint-384/tokenizer.json
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:5f7eee611703c5ce5d1eee32d9cdcfe465647b8aff0c1dfb3bed7ad7dbb05060
|
||||||
|
size 34362873
|
||||||
3
checkpoint-384/tokenizer.model
Normal file
3
checkpoint-384/tokenizer.model
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:61a7b147390c64585d6c3543dd6fc636906c9af3865a5548f27f31aee1d4c8e2
|
||||||
|
size 4241003
|
||||||
2011
checkpoint-384/tokenizer_config.json
Normal file
2011
checkpoint-384/tokenizer_config.json
Normal file
File diff suppressed because it is too large
Load Diff
566
checkpoint-384/trainer_state.json
Normal file
566
checkpoint-384/trainer_state.json
Normal file
@@ -0,0 +1,566 @@
|
|||||||
|
{
|
||||||
|
"best_global_step": null,
|
||||||
|
"best_metric": null,
|
||||||
|
"best_model_checkpoint": null,
|
||||||
|
"epoch": 2.0,
|
||||||
|
"eval_steps": 500,
|
||||||
|
"global_step": 384,
|
||||||
|
"is_hyper_param_search": false,
|
||||||
|
"is_local_process_zero": true,
|
||||||
|
"is_world_process_zero": true,
|
||||||
|
"log_history": [
|
||||||
|
{
|
||||||
|
"epoch": 0.02609262883235486,
|
||||||
|
"grad_norm": 90.7743148803711,
|
||||||
|
"learning_rate": 5.128205128205128e-07,
|
||||||
|
"loss": 3.4203,
|
||||||
|
"step": 5
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.05218525766470972,
|
||||||
|
"grad_norm": 52.55401611328125,
|
||||||
|
"learning_rate": 1.153846153846154e-06,
|
||||||
|
"loss": 2.8478,
|
||||||
|
"step": 10
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.07827788649706457,
|
||||||
|
"grad_norm": 17.9848575592041,
|
||||||
|
"learning_rate": 1.794871794871795e-06,
|
||||||
|
"loss": 1.524,
|
||||||
|
"step": 15
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.10437051532941943,
|
||||||
|
"grad_norm": 9.579212188720703,
|
||||||
|
"learning_rate": 2.435897435897436e-06,
|
||||||
|
"loss": 0.8379,
|
||||||
|
"step": 20
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.1304631441617743,
|
||||||
|
"grad_norm": 6.430282115936279,
|
||||||
|
"learning_rate": 3.0769230769230774e-06,
|
||||||
|
"loss": 0.4496,
|
||||||
|
"step": 25
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.15655577299412915,
|
||||||
|
"grad_norm": 5.243109703063965,
|
||||||
|
"learning_rate": 3.7179487179487184e-06,
|
||||||
|
"loss": 0.2512,
|
||||||
|
"step": 30
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.182648401826484,
|
||||||
|
"grad_norm": 5.690948963165283,
|
||||||
|
"learning_rate": 4.358974358974359e-06,
|
||||||
|
"loss": 0.183,
|
||||||
|
"step": 35
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.20874103065883887,
|
||||||
|
"grad_norm": 4.116969585418701,
|
||||||
|
"learning_rate": 5e-06,
|
||||||
|
"loss": 0.1788,
|
||||||
|
"step": 40
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.23483365949119372,
|
||||||
|
"grad_norm": 2.8701882362365723,
|
||||||
|
"learning_rate": 4.9974091841168195e-06,
|
||||||
|
"loss": 0.1605,
|
||||||
|
"step": 45
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.2609262883235486,
|
||||||
|
"grad_norm": 7.059335231781006,
|
||||||
|
"learning_rate": 4.989642106328829e-06,
|
||||||
|
"loss": 0.1394,
|
||||||
|
"step": 50
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.28701891715590344,
|
||||||
|
"grad_norm": 3.2651431560516357,
|
||||||
|
"learning_rate": 4.976714865090827e-06,
|
||||||
|
"loss": 0.083,
|
||||||
|
"step": 55
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.3131115459882583,
|
||||||
|
"grad_norm": 2.457581043243408,
|
||||||
|
"learning_rate": 4.958654254084356e-06,
|
||||||
|
"loss": 0.0896,
|
||||||
|
"step": 60
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.33920417482061316,
|
||||||
|
"grad_norm": 2.72770619392395,
|
||||||
|
"learning_rate": 4.935497706683698e-06,
|
||||||
|
"loss": 0.0991,
|
||||||
|
"step": 65
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.365296803652968,
|
||||||
|
"grad_norm": 2.0538723468780518,
|
||||||
|
"learning_rate": 4.907293218369499e-06,
|
||||||
|
"loss": 0.0979,
|
||||||
|
"step": 70
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.3913894324853229,
|
||||||
|
"grad_norm": 2.1862363815307617,
|
||||||
|
"learning_rate": 4.874099247250799e-06,
|
||||||
|
"loss": 0.0933,
|
||||||
|
"step": 75
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.41748206131767773,
|
||||||
|
"grad_norm": 2.605069637298584,
|
||||||
|
"learning_rate": 4.835984592901678e-06,
|
||||||
|
"loss": 0.0959,
|
||||||
|
"step": 80
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.4435746901500326,
|
||||||
|
"grad_norm": 1.2768350839614868,
|
||||||
|
"learning_rate": 4.793028253763633e-06,
|
||||||
|
"loss": 0.0749,
|
||||||
|
"step": 85
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.46966731898238745,
|
||||||
|
"grad_norm": 4.374709606170654,
|
||||||
|
"learning_rate": 4.745319263409241e-06,
|
||||||
|
"loss": 0.0991,
|
||||||
|
"step": 90
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.4957599478147423,
|
||||||
|
"grad_norm": 1.9398008584976196,
|
||||||
|
"learning_rate": 4.692956506006486e-06,
|
||||||
|
"loss": 0.0833,
|
||||||
|
"step": 95
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5218525766470972,
|
||||||
|
"grad_norm": 1.7450673580169678,
|
||||||
|
"learning_rate": 4.636048511366222e-06,
|
||||||
|
"loss": 0.0804,
|
||||||
|
"step": 100
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.547945205479452,
|
||||||
|
"grad_norm": 1.712754249572754,
|
||||||
|
"learning_rate": 4.5747132299975634e-06,
|
||||||
|
"loss": 0.0867,
|
||||||
|
"step": 105
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5740378343118069,
|
||||||
|
"grad_norm": 1.083371877670288,
|
||||||
|
"learning_rate": 4.509077788637446e-06,
|
||||||
|
"loss": 0.0688,
|
||||||
|
"step": 110
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6001304631441617,
|
||||||
|
"grad_norm": 1.936558485031128,
|
||||||
|
"learning_rate": 4.43927822676105e-06,
|
||||||
|
"loss": 0.0772,
|
||||||
|
"step": 115
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6262230919765166,
|
||||||
|
"grad_norm": 1.4485265016555786,
|
||||||
|
"learning_rate": 4.3654592146192146e-06,
|
||||||
|
"loss": 0.0767,
|
||||||
|
"step": 120
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6523157208088715,
|
||||||
|
"grad_norm": 1.4740047454833984,
|
||||||
|
"learning_rate": 4.287773753387249e-06,
|
||||||
|
"loss": 0.0715,
|
||||||
|
"step": 125
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6784083496412263,
|
||||||
|
"grad_norm": 1.7988250255584717,
|
||||||
|
"learning_rate": 4.206382858046636e-06,
|
||||||
|
"loss": 0.0823,
|
||||||
|
"step": 130
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7045009784735812,
|
||||||
|
"grad_norm": 0.9675837159156799,
|
||||||
|
"learning_rate": 4.12145522365689e-06,
|
||||||
|
"loss": 0.0955,
|
||||||
|
"step": 135
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.730593607305936,
|
||||||
|
"grad_norm": 1.3645009994506836,
|
||||||
|
"learning_rate": 4.033166875709291e-06,
|
||||||
|
"loss": 0.062,
|
||||||
|
"step": 140
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7566862361382909,
|
||||||
|
"grad_norm": 1.3581523895263672,
|
||||||
|
"learning_rate": 3.941700805287169e-06,
|
||||||
|
"loss": 0.0868,
|
||||||
|
"step": 145
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7827788649706457,
|
||||||
|
"grad_norm": 1.8347728252410889,
|
||||||
|
"learning_rate": 3.84724658978894e-06,
|
||||||
|
"loss": 0.0681,
|
||||||
|
"step": 150
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8088714938030006,
|
||||||
|
"grad_norm": 1.278552770614624,
|
||||||
|
"learning_rate": 3.7500000000000005e-06,
|
||||||
|
"loss": 0.0709,
|
||||||
|
"step": 155
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8349641226353555,
|
||||||
|
"grad_norm": 1.676578402519226,
|
||||||
|
"learning_rate": 3.650162594327881e-06,
|
||||||
|
"loss": 0.0714,
|
||||||
|
"step": 160
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8610567514677103,
|
||||||
|
"grad_norm": 0.9458003640174866,
|
||||||
|
"learning_rate": 3.5479413010416606e-06,
|
||||||
|
"loss": 0.081,
|
||||||
|
"step": 165
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8871493803000652,
|
||||||
|
"grad_norm": 1.0945783853530884,
|
||||||
|
"learning_rate": 3.443547989381536e-06,
|
||||||
|
"loss": 0.0715,
|
||||||
|
"step": 170
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.91324200913242,
|
||||||
|
"grad_norm": 1.2435601949691772,
|
||||||
|
"learning_rate": 3.3371990304274654e-06,
|
||||||
|
"loss": 0.0638,
|
||||||
|
"step": 175
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9393346379647749,
|
||||||
|
"grad_norm": 1.2059943675994873,
|
||||||
|
"learning_rate": 3.2291148486370626e-06,
|
||||||
|
"loss": 0.0683,
|
||||||
|
"step": 180
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9654272667971298,
|
||||||
|
"grad_norm": 0.6467380523681641,
|
||||||
|
"learning_rate": 3.11951946498225e-06,
|
||||||
|
"loss": 0.0709,
|
||||||
|
"step": 185
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9915198956294846,
|
||||||
|
"grad_norm": 0.8123487830162048,
|
||||||
|
"learning_rate": 3.0086400326315853e-06,
|
||||||
|
"loss": 0.0601,
|
||||||
|
"step": 190
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.015655577299413,
|
||||||
|
"grad_norm": 1.2716907262802124,
|
||||||
|
"learning_rate": 2.896706366140629e-06,
|
||||||
|
"loss": 0.0579,
|
||||||
|
"step": 195
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.0417482061317678,
|
||||||
|
"grad_norm": 1.656204104423523,
|
||||||
|
"learning_rate": 2.7839504651261873e-06,
|
||||||
|
"loss": 0.0623,
|
||||||
|
"step": 200
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.0678408349641226,
|
||||||
|
"grad_norm": 1.195453405380249,
|
||||||
|
"learning_rate": 2.670606033411678e-06,
|
||||||
|
"loss": 0.0533,
|
||||||
|
"step": 205
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.0939334637964775,
|
||||||
|
"grad_norm": 1.3654705286026,
|
||||||
|
"learning_rate": 2.556907994640264e-06,
|
||||||
|
"loss": 0.0556,
|
||||||
|
"step": 210
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.1200260926288323,
|
||||||
|
"grad_norm": 0.6175478100776672,
|
||||||
|
"learning_rate": 2.443092005359736e-06,
|
||||||
|
"loss": 0.0459,
|
||||||
|
"step": 215
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.1461187214611872,
|
||||||
|
"grad_norm": 0.884466826915741,
|
||||||
|
"learning_rate": 2.3293939665883233e-06,
|
||||||
|
"loss": 0.057,
|
||||||
|
"step": 220
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.172211350293542,
|
||||||
|
"grad_norm": 1.4396722316741943,
|
||||||
|
"learning_rate": 2.2160495348738127e-06,
|
||||||
|
"loss": 0.063,
|
||||||
|
"step": 225
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.198303979125897,
|
||||||
|
"grad_norm": 0.893132209777832,
|
||||||
|
"learning_rate": 2.1032936338593716e-06,
|
||||||
|
"loss": 0.0554,
|
||||||
|
"step": 230
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.2243966079582518,
|
||||||
|
"grad_norm": 0.778917133808136,
|
||||||
|
"learning_rate": 1.991359967368416e-06,
|
||||||
|
"loss": 0.0538,
|
||||||
|
"step": 235
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.2504892367906066,
|
||||||
|
"grad_norm": 1.2776492834091187,
|
||||||
|
"learning_rate": 1.8804805350177507e-06,
|
||||||
|
"loss": 0.0538,
|
||||||
|
"step": 240
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.2765818656229615,
|
||||||
|
"grad_norm": 1.0802513360977173,
|
||||||
|
"learning_rate": 1.7708851513629376e-06,
|
||||||
|
"loss": 0.0541,
|
||||||
|
"step": 245
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.3026744944553164,
|
||||||
|
"grad_norm": 0.9070869088172913,
|
||||||
|
"learning_rate": 1.6628009695725348e-06,
|
||||||
|
"loss": 0.0479,
|
||||||
|
"step": 250
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.3287671232876712,
|
||||||
|
"grad_norm": 1.4413901567459106,
|
||||||
|
"learning_rate": 1.5564520106184643e-06,
|
||||||
|
"loss": 0.0514,
|
||||||
|
"step": 255
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.354859752120026,
|
||||||
|
"grad_norm": 1.1004434823989868,
|
||||||
|
"learning_rate": 1.4520586989583406e-06,
|
||||||
|
"loss": 0.0486,
|
||||||
|
"step": 260
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.380952380952381,
|
||||||
|
"grad_norm": 1.1776546239852905,
|
||||||
|
"learning_rate": 1.3498374056721198e-06,
|
||||||
|
"loss": 0.0467,
|
||||||
|
"step": 265
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.4070450097847358,
|
||||||
|
"grad_norm": 1.00455641746521,
|
||||||
|
"learning_rate": 1.2500000000000007e-06,
|
||||||
|
"loss": 0.0555,
|
||||||
|
"step": 270
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.4331376386170906,
|
||||||
|
"grad_norm": 1.1658108234405518,
|
||||||
|
"learning_rate": 1.1527534102110613e-06,
|
||||||
|
"loss": 0.05,
|
||||||
|
"step": 275
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.4592302674494455,
|
||||||
|
"grad_norm": 0.5006061792373657,
|
||||||
|
"learning_rate": 1.0582991947128324e-06,
|
||||||
|
"loss": 0.0531,
|
||||||
|
"step": 280
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.4853228962818004,
|
||||||
|
"grad_norm": 0.5298914909362793,
|
||||||
|
"learning_rate": 9.66833124290709e-07,
|
||||||
|
"loss": 0.0475,
|
||||||
|
"step": 285
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.5114155251141552,
|
||||||
|
"grad_norm": 0.6051680445671082,
|
||||||
|
"learning_rate": 8.785447763431101e-07,
|
||||||
|
"loss": 0.0444,
|
||||||
|
"step": 290
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.53750815394651,
|
||||||
|
"grad_norm": 1.11183500289917,
|
||||||
|
"learning_rate": 7.936171419533653e-07,
|
||||||
|
"loss": 0.0547,
|
||||||
|
"step": 295
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.563600782778865,
|
||||||
|
"grad_norm": 2.068556308746338,
|
||||||
|
"learning_rate": 7.122262466127513e-07,
|
||||||
|
"loss": 0.0501,
|
||||||
|
"step": 300
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.5896934116112198,
|
||||||
|
"grad_norm": 0.9381551742553711,
|
||||||
|
"learning_rate": 6.345407853807864e-07,
|
||||||
|
"loss": 0.0535,
|
||||||
|
"step": 305
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.6157860404435747,
|
||||||
|
"grad_norm": 1.0716235637664795,
|
||||||
|
"learning_rate": 5.607217732389503e-07,
|
||||||
|
"loss": 0.0533,
|
||||||
|
"step": 310
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.6418786692759295,
|
||||||
|
"grad_norm": 0.8771371245384216,
|
||||||
|
"learning_rate": 4.909222113625545e-07,
|
||||||
|
"loss": 0.0567,
|
||||||
|
"step": 315
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.6679712981082844,
|
||||||
|
"grad_norm": 1.4611281156539917,
|
||||||
|
"learning_rate": 4.252867700024374e-07,
|
||||||
|
"loss": 0.0569,
|
||||||
|
"step": 320
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.6940639269406392,
|
||||||
|
"grad_norm": 0.42611926794052124,
|
||||||
|
"learning_rate": 3.639514886337786e-07,
|
||||||
|
"loss": 0.0562,
|
||||||
|
"step": 325
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.720156555772994,
|
||||||
|
"grad_norm": 1.3697057962417603,
|
||||||
|
"learning_rate": 3.0704349399351437e-07,
|
||||||
|
"loss": 0.0504,
|
||||||
|
"step": 330
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.746249184605349,
|
||||||
|
"grad_norm": 1.6137443780899048,
|
||||||
|
"learning_rate": 2.5468073659076e-07,
|
||||||
|
"loss": 0.0481,
|
||||||
|
"step": 335
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.7723418134377038,
|
||||||
|
"grad_norm": 0.8786627054214478,
|
||||||
|
"learning_rate": 2.0697174623636795e-07,
|
||||||
|
"loss": 0.0435,
|
||||||
|
"step": 340
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.7984344422700587,
|
||||||
|
"grad_norm": 0.6073723435401917,
|
||||||
|
"learning_rate": 1.6401540709832242e-07,
|
||||||
|
"loss": 0.0448,
|
||||||
|
"step": 345
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.8245270711024135,
|
||||||
|
"grad_norm": 0.4912233054637909,
|
||||||
|
"learning_rate": 1.2590075274920206e-07,
|
||||||
|
"loss": 0.0531,
|
||||||
|
"step": 350
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.8506196999347684,
|
||||||
|
"grad_norm": 1.127508282661438,
|
||||||
|
"learning_rate": 9.270678163050218e-08,
|
||||||
|
"loss": 0.0521,
|
||||||
|
"step": 355
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.8767123287671232,
|
||||||
|
"grad_norm": 1.1689162254333496,
|
||||||
|
"learning_rate": 6.450229331630253e-08,
|
||||||
|
"loss": 0.051,
|
||||||
|
"step": 360
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.902804957599478,
|
||||||
|
"grad_norm": 0.8796715140342712,
|
||||||
|
"learning_rate": 4.134574591564494e-08,
|
||||||
|
"loss": 0.0514,
|
||||||
|
"step": 365
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.928897586431833,
|
||||||
|
"grad_norm": 0.8864848017692566,
|
||||||
|
"learning_rate": 2.3285134909173113e-08,
|
||||||
|
"loss": 0.0484,
|
||||||
|
"step": 370
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.9549902152641878,
|
||||||
|
"grad_norm": 0.7268601655960083,
|
||||||
|
"learning_rate": 1.0357893671171793e-08,
|
||||||
|
"loss": 0.0502,
|
||||||
|
"step": 375
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.9810828440965427,
|
||||||
|
"grad_norm": 0.7900459170341492,
|
||||||
|
"learning_rate": 2.590815883181108e-09,
|
||||||
|
"loss": 0.0468,
|
||||||
|
"step": 380
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"logging_steps": 5,
|
||||||
|
"max_steps": 384,
|
||||||
|
"num_input_tokens_seen": 0,
|
||||||
|
"num_train_epochs": 2,
|
||||||
|
"save_steps": 200,
|
||||||
|
"stateful_callbacks": {
|
||||||
|
"TrainerControl": {
|
||||||
|
"args": {
|
||||||
|
"should_epoch_stop": false,
|
||||||
|
"should_evaluate": false,
|
||||||
|
"should_log": false,
|
||||||
|
"should_save": true,
|
||||||
|
"should_training_stop": true
|
||||||
|
},
|
||||||
|
"attributes": {}
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"total_flos": 9.374131655263642e+17,
|
||||||
|
"train_batch_size": 4,
|
||||||
|
"trial_name": null,
|
||||||
|
"trial_params": null
|
||||||
|
}
|
||||||
3
checkpoint-384/training_args.bin
Normal file
3
checkpoint-384/training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:eefe3a8f7ff0a02d7d0543cd767d19dca4a289498f0d97a7be7b74c1ad482785
|
||||||
|
size 5816
|
||||||
60
config.json
Normal file
60
config.json
Normal file
@@ -0,0 +1,60 @@
|
|||||||
|
{
|
||||||
|
"architectures": [
|
||||||
|
"Gemma2ForCausalLM"
|
||||||
|
],
|
||||||
|
"attention_bias": false,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"attn_logit_softcapping": 50.0,
|
||||||
|
"bos_token_id": 2,
|
||||||
|
"cache_implementation": "hybrid",
|
||||||
|
"dtype": "float32",
|
||||||
|
"eos_token_id": 107,
|
||||||
|
"final_logit_softcapping": 30.0,
|
||||||
|
"head_dim": 256,
|
||||||
|
"hidden_act": "gelu_pytorch_tanh",
|
||||||
|
"hidden_activation": "gelu_pytorch_tanh",
|
||||||
|
"hidden_size": 2304,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"intermediate_size": 9216,
|
||||||
|
"layer_types": [
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention",
|
||||||
|
"sliding_attention",
|
||||||
|
"full_attention"
|
||||||
|
],
|
||||||
|
"max_position_embeddings": 8192,
|
||||||
|
"model_type": "gemma2",
|
||||||
|
"num_attention_heads": 8,
|
||||||
|
"num_hidden_layers": 26,
|
||||||
|
"num_key_value_heads": 4,
|
||||||
|
"pad_token_id": 0,
|
||||||
|
"query_pre_attn_scalar": 224,
|
||||||
|
"rms_norm_eps": 1e-06,
|
||||||
|
"rope_theta": 10000.0,
|
||||||
|
"sliding_window": 4096,
|
||||||
|
"transformers_version": "4.57.1",
|
||||||
|
"use_cache": false,
|
||||||
|
"vocab_size": 256000
|
||||||
|
}
|
||||||
11
generation_config.json
Normal file
11
generation_config.json
Normal file
@@ -0,0 +1,11 @@
|
|||||||
|
{
|
||||||
|
"_from_model_config": true,
|
||||||
|
"bos_token_id": 2,
|
||||||
|
"cache_implementation": "hybrid",
|
||||||
|
"eos_token_id": [
|
||||||
|
107,
|
||||||
|
1
|
||||||
|
],
|
||||||
|
"pad_token_id": 0,
|
||||||
|
"transformers_version": "4.57.1"
|
||||||
|
}
|
||||||
3
model-00001-of-00003.safetensors
Normal file
3
model-00001-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:cd6462f5dd8e49d595de57df12e28c3385af73d46a3ae34a1379a0f6e73ad3e6
|
||||||
|
size 4992576136
|
||||||
3
model-00002-of-00003.safetensors
Normal file
3
model-00002-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:7de3332316388b3b73e53312dcae360dd575f1461783684d5e833edc3db830c2
|
||||||
|
size 4983443424
|
||||||
3
model-00003-of-00003.safetensors
Normal file
3
model-00003-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:6f7b3d32f7caade7d722004664ea4a5e5fef8c3160f4316f7e04620c2c4f45c2
|
||||||
|
size 481381384
|
||||||
296
model.safetensors.index.json
Normal file
296
model.safetensors.index.json
Normal file
@@ -0,0 +1,296 @@
|
|||||||
|
{
|
||||||
|
"metadata": {
|
||||||
|
"total_parameters": 2614341888,
|
||||||
|
"total_size": 10457367552
|
||||||
|
},
|
||||||
|
"weight_map": {
|
||||||
|
"model.embed_tokens.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.10.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.10.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.11.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.12.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.13.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.14.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.15.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.16.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.17.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.18.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.20.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.21.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.22.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.23.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.24.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.25.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.25.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
||||||
|
"model.layers.3.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.4.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.5.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.6.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.7.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.8.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||||
|
"model.layers.9.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.layers.9.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||||
|
"model.norm.weight": "model-00003-of-00003.safetensors"
|
||||||
|
}
|
||||||
|
}
|
||||||
30
special_tokens_map.json
Normal file
30
special_tokens_map.json
Normal file
@@ -0,0 +1,30 @@
|
|||||||
|
{
|
||||||
|
"bos_token": {
|
||||||
|
"content": "<bos>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"eos_token": {
|
||||||
|
"content": "<end_of_turn>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"pad_token": {
|
||||||
|
"content": "<pad>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"unk_token": {
|
||||||
|
"content": "<unk>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
}
|
||||||
|
}
|
||||||
3
tokenizer.json
Normal file
3
tokenizer.json
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:5f7eee611703c5ce5d1eee32d9cdcfe465647b8aff0c1dfb3bed7ad7dbb05060
|
||||||
|
size 34362873
|
||||||
3
tokenizer.model
Normal file
3
tokenizer.model
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:61a7b147390c64585d6c3543dd6fc636906c9af3865a5548f27f31aee1d4c8e2
|
||||||
|
size 4241003
|
||||||
2011
tokenizer_config.json
Normal file
2011
tokenizer_config.json
Normal file
File diff suppressed because it is too large
Load Diff
8
train_results.json
Normal file
8
train_results.json
Normal file
@@ -0,0 +1,8 @@
|
|||||||
|
{
|
||||||
|
"epoch": 2.0,
|
||||||
|
"total_flos": 9.374131655263642e+17,
|
||||||
|
"train_loss": 0.18539645452983677,
|
||||||
|
"train_runtime": 8558.6373,
|
||||||
|
"train_samples_per_second": 2.865,
|
||||||
|
"train_steps_per_second": 0.045
|
||||||
|
}
|
||||||
77
trainer_log.jsonl
Normal file
77
trainer_log.jsonl
Normal file
@@ -0,0 +1,77 @@
|
|||||||
|
{"current_steps": 5, "total_steps": 384, "loss": 3.4203, "lr": 5.128205128205128e-07, "epoch": 0.02609262883235486, "percentage": 1.3, "elapsed_time": "0:01:50", "remaining_time": "2:19:24"}
|
||||||
|
{"current_steps": 10, "total_steps": 384, "loss": 2.8478, "lr": 1.153846153846154e-06, "epoch": 0.05218525766470972, "percentage": 2.6, "elapsed_time": "0:03:38", "remaining_time": "2:16:15"}
|
||||||
|
{"current_steps": 15, "total_steps": 384, "loss": 1.524, "lr": 1.794871794871795e-06, "epoch": 0.07827788649706457, "percentage": 3.91, "elapsed_time": "0:05:26", "remaining_time": "2:13:47"}
|
||||||
|
{"current_steps": 20, "total_steps": 384, "loss": 0.8379, "lr": 2.435897435897436e-06, "epoch": 0.10437051532941943, "percentage": 5.21, "elapsed_time": "0:07:12", "remaining_time": "2:11:15"}
|
||||||
|
{"current_steps": 25, "total_steps": 384, "loss": 0.4496, "lr": 3.0769230769230774e-06, "epoch": 0.1304631441617743, "percentage": 6.51, "elapsed_time": "0:09:13", "remaining_time": "2:12:24"}
|
||||||
|
{"current_steps": 30, "total_steps": 384, "loss": 0.2512, "lr": 3.7179487179487184e-06, "epoch": 0.15655577299412915, "percentage": 7.81, "elapsed_time": "0:11:02", "remaining_time": "2:10:12"}
|
||||||
|
{"current_steps": 35, "total_steps": 384, "loss": 0.183, "lr": 4.358974358974359e-06, "epoch": 0.182648401826484, "percentage": 9.11, "elapsed_time": "0:12:53", "remaining_time": "2:08:34"}
|
||||||
|
{"current_steps": 40, "total_steps": 384, "loss": 0.1788, "lr": 5e-06, "epoch": 0.20874103065883887, "percentage": 10.42, "elapsed_time": "0:14:48", "remaining_time": "2:07:21"}
|
||||||
|
{"current_steps": 45, "total_steps": 384, "loss": 0.1605, "lr": 4.9974091841168195e-06, "epoch": 0.23483365949119372, "percentage": 11.72, "elapsed_time": "0:16:38", "remaining_time": "2:05:19"}
|
||||||
|
{"current_steps": 50, "total_steps": 384, "loss": 0.1394, "lr": 4.989642106328829e-06, "epoch": 0.2609262883235486, "percentage": 13.02, "elapsed_time": "0:18:30", "remaining_time": "2:03:36"}
|
||||||
|
{"current_steps": 55, "total_steps": 384, "loss": 0.083, "lr": 4.976714865090827e-06, "epoch": 0.28701891715590344, "percentage": 14.32, "elapsed_time": "0:20:24", "remaining_time": "2:02:05"}
|
||||||
|
{"current_steps": 60, "total_steps": 384, "loss": 0.0896, "lr": 4.958654254084356e-06, "epoch": 0.3131115459882583, "percentage": 15.62, "elapsed_time": "0:22:15", "remaining_time": "2:00:13"}
|
||||||
|
{"current_steps": 65, "total_steps": 384, "loss": 0.0991, "lr": 4.935497706683698e-06, "epoch": 0.33920417482061316, "percentage": 16.93, "elapsed_time": "0:24:09", "remaining_time": "1:58:33"}
|
||||||
|
{"current_steps": 70, "total_steps": 384, "loss": 0.0979, "lr": 4.907293218369499e-06, "epoch": 0.365296803652968, "percentage": 18.23, "elapsed_time": "0:25:57", "remaining_time": "1:56:26"}
|
||||||
|
{"current_steps": 75, "total_steps": 384, "loss": 0.0933, "lr": 4.874099247250799e-06, "epoch": 0.3913894324853229, "percentage": 19.53, "elapsed_time": "0:27:48", "remaining_time": "1:54:35"}
|
||||||
|
{"current_steps": 80, "total_steps": 384, "loss": 0.0959, "lr": 4.835984592901678e-06, "epoch": 0.41748206131767773, "percentage": 20.83, "elapsed_time": "0:29:39", "remaining_time": "1:52:42"}
|
||||||
|
{"current_steps": 85, "total_steps": 384, "loss": 0.0749, "lr": 4.793028253763633e-06, "epoch": 0.4435746901500326, "percentage": 22.14, "elapsed_time": "0:31:27", "remaining_time": "1:50:40"}
|
||||||
|
{"current_steps": 90, "total_steps": 384, "loss": 0.0991, "lr": 4.745319263409241e-06, "epoch": 0.46966731898238745, "percentage": 23.44, "elapsed_time": "0:33:19", "remaining_time": "1:48:51"}
|
||||||
|
{"current_steps": 95, "total_steps": 384, "loss": 0.0833, "lr": 4.692956506006486e-06, "epoch": 0.4957599478147423, "percentage": 24.74, "elapsed_time": "0:35:14", "remaining_time": "1:47:13"}
|
||||||
|
{"current_steps": 100, "total_steps": 384, "loss": 0.0804, "lr": 4.636048511366222e-06, "epoch": 0.5218525766470972, "percentage": 26.04, "elapsed_time": "0:37:00", "remaining_time": "1:45:06"}
|
||||||
|
{"current_steps": 105, "total_steps": 384, "loss": 0.0867, "lr": 4.5747132299975634e-06, "epoch": 0.547945205479452, "percentage": 27.34, "elapsed_time": "0:38:51", "remaining_time": "1:43:14"}
|
||||||
|
{"current_steps": 110, "total_steps": 384, "loss": 0.0688, "lr": 4.509077788637446e-06, "epoch": 0.5740378343118069, "percentage": 28.65, "elapsed_time": "0:40:39", "remaining_time": "1:41:16"}
|
||||||
|
{"current_steps": 115, "total_steps": 384, "loss": 0.0772, "lr": 4.43927822676105e-06, "epoch": 0.6001304631441617, "percentage": 29.95, "elapsed_time": "0:42:32", "remaining_time": "1:39:29"}
|
||||||
|
{"current_steps": 120, "total_steps": 384, "loss": 0.0767, "lr": 4.3654592146192146e-06, "epoch": 0.6262230919765166, "percentage": 31.25, "elapsed_time": "0:44:20", "remaining_time": "1:37:34"}
|
||||||
|
{"current_steps": 125, "total_steps": 384, "loss": 0.0715, "lr": 4.287773753387249e-06, "epoch": 0.6523157208088715, "percentage": 32.55, "elapsed_time": "0:46:13", "remaining_time": "1:35:46"}
|
||||||
|
{"current_steps": 130, "total_steps": 384, "loss": 0.0823, "lr": 4.206382858046636e-06, "epoch": 0.6784083496412263, "percentage": 33.85, "elapsed_time": "0:48:05", "remaining_time": "1:33:58"}
|
||||||
|
{"current_steps": 135, "total_steps": 384, "loss": 0.0955, "lr": 4.12145522365689e-06, "epoch": 0.7045009784735812, "percentage": 35.16, "elapsed_time": "0:49:57", "remaining_time": "1:32:08"}
|
||||||
|
{"current_steps": 140, "total_steps": 384, "loss": 0.062, "lr": 4.033166875709291e-06, "epoch": 0.730593607305936, "percentage": 36.46, "elapsed_time": "0:51:48", "remaining_time": "1:30:18"}
|
||||||
|
{"current_steps": 145, "total_steps": 384, "loss": 0.0868, "lr": 3.941700805287169e-06, "epoch": 0.7566862361382909, "percentage": 37.76, "elapsed_time": "0:53:41", "remaining_time": "1:28:29"}
|
||||||
|
{"current_steps": 150, "total_steps": 384, "loss": 0.0681, "lr": 3.84724658978894e-06, "epoch": 0.7827788649706457, "percentage": 39.06, "elapsed_time": "0:55:31", "remaining_time": "1:26:36"}
|
||||||
|
{"current_steps": 155, "total_steps": 384, "loss": 0.0709, "lr": 3.7500000000000005e-06, "epoch": 0.8088714938030006, "percentage": 40.36, "elapsed_time": "0:57:17", "remaining_time": "1:24:38"}
|
||||||
|
{"current_steps": 160, "total_steps": 384, "loss": 0.0714, "lr": 3.650162594327881e-06, "epoch": 0.8349641226353555, "percentage": 41.67, "elapsed_time": "0:59:08", "remaining_time": "1:22:47"}
|
||||||
|
{"current_steps": 165, "total_steps": 384, "loss": 0.081, "lr": 3.5479413010416606e-06, "epoch": 0.8610567514677103, "percentage": 42.97, "elapsed_time": "1:00:56", "remaining_time": "1:20:53"}
|
||||||
|
{"current_steps": 170, "total_steps": 384, "loss": 0.0715, "lr": 3.443547989381536e-06, "epoch": 0.8871493803000652, "percentage": 44.27, "elapsed_time": "1:02:48", "remaining_time": "1:19:03"}
|
||||||
|
{"current_steps": 175, "total_steps": 384, "loss": 0.0638, "lr": 3.3371990304274654e-06, "epoch": 0.91324200913242, "percentage": 45.57, "elapsed_time": "1:04:36", "remaining_time": "1:17:09"}
|
||||||
|
{"current_steps": 180, "total_steps": 384, "loss": 0.0683, "lr": 3.2291148486370626e-06, "epoch": 0.9393346379647749, "percentage": 46.88, "elapsed_time": "1:06:21", "remaining_time": "1:15:12"}
|
||||||
|
{"current_steps": 185, "total_steps": 384, "loss": 0.0709, "lr": 3.11951946498225e-06, "epoch": 0.9654272667971298, "percentage": 48.18, "elapsed_time": "1:08:13", "remaining_time": "1:13:23"}
|
||||||
|
{"current_steps": 190, "total_steps": 384, "loss": 0.0601, "lr": 3.0086400326315853e-06, "epoch": 0.9915198956294846, "percentage": 49.48, "elapsed_time": "1:10:05", "remaining_time": "1:11:34"}
|
||||||
|
{"current_steps": 195, "total_steps": 384, "loss": 0.0579, "lr": 2.896706366140629e-06, "epoch": 1.015655577299413, "percentage": 50.78, "elapsed_time": "1:11:44", "remaining_time": "1:09:31"}
|
||||||
|
{"current_steps": 200, "total_steps": 384, "loss": 0.0623, "lr": 2.7839504651261873e-06, "epoch": 1.0417482061317678, "percentage": 52.08, "elapsed_time": "1:13:38", "remaining_time": "1:07:45"}
|
||||||
|
{"current_steps": 205, "total_steps": 384, "loss": 0.0533, "lr": 2.670606033411678e-06, "epoch": 1.0678408349641226, "percentage": 53.39, "elapsed_time": "1:16:14", "remaining_time": "1:06:34"}
|
||||||
|
{"current_steps": 210, "total_steps": 384, "loss": 0.0556, "lr": 2.556907994640264e-06, "epoch": 1.0939334637964775, "percentage": 54.69, "elapsed_time": "1:18:12", "remaining_time": "1:04:48"}
|
||||||
|
{"current_steps": 215, "total_steps": 384, "loss": 0.0459, "lr": 2.443092005359736e-06, "epoch": 1.1200260926288323, "percentage": 55.99, "elapsed_time": "1:20:03", "remaining_time": "1:02:55"}
|
||||||
|
{"current_steps": 220, "total_steps": 384, "loss": 0.057, "lr": 2.3293939665883233e-06, "epoch": 1.1461187214611872, "percentage": 57.29, "elapsed_time": "1:21:53", "remaining_time": "1:01:02"}
|
||||||
|
{"current_steps": 225, "total_steps": 384, "loss": 0.063, "lr": 2.2160495348738127e-06, "epoch": 1.172211350293542, "percentage": 58.59, "elapsed_time": "1:23:41", "remaining_time": "0:59:08"}
|
||||||
|
{"current_steps": 230, "total_steps": 384, "loss": 0.0554, "lr": 2.1032936338593716e-06, "epoch": 1.198303979125897, "percentage": 59.9, "elapsed_time": "1:25:31", "remaining_time": "0:57:16"}
|
||||||
|
{"current_steps": 235, "total_steps": 384, "loss": 0.0538, "lr": 1.991359967368416e-06, "epoch": 1.2243966079582518, "percentage": 61.2, "elapsed_time": "1:27:26", "remaining_time": "0:55:26"}
|
||||||
|
{"current_steps": 240, "total_steps": 384, "loss": 0.0538, "lr": 1.8804805350177507e-06, "epoch": 1.2504892367906066, "percentage": 62.5, "elapsed_time": "1:29:13", "remaining_time": "0:53:32"}
|
||||||
|
{"current_steps": 245, "total_steps": 384, "loss": 0.0541, "lr": 1.7708851513629376e-06, "epoch": 1.2765818656229615, "percentage": 63.8, "elapsed_time": "1:31:04", "remaining_time": "0:51:40"}
|
||||||
|
{"current_steps": 250, "total_steps": 384, "loss": 0.0479, "lr": 1.6628009695725348e-06, "epoch": 1.3026744944553164, "percentage": 65.1, "elapsed_time": "1:32:51", "remaining_time": "0:49:46"}
|
||||||
|
{"current_steps": 255, "total_steps": 384, "loss": 0.0514, "lr": 1.5564520106184643e-06, "epoch": 1.3287671232876712, "percentage": 66.41, "elapsed_time": "1:34:45", "remaining_time": "0:47:56"}
|
||||||
|
{"current_steps": 260, "total_steps": 384, "loss": 0.0486, "lr": 1.4520586989583406e-06, "epoch": 1.354859752120026, "percentage": 67.71, "elapsed_time": "1:36:34", "remaining_time": "0:46:03"}
|
||||||
|
{"current_steps": 265, "total_steps": 384, "loss": 0.0467, "lr": 1.3498374056721198e-06, "epoch": 1.380952380952381, "percentage": 69.01, "elapsed_time": "1:38:24", "remaining_time": "0:44:11"}
|
||||||
|
{"current_steps": 270, "total_steps": 384, "loss": 0.0555, "lr": 1.2500000000000007e-06, "epoch": 1.4070450097847358, "percentage": 70.31, "elapsed_time": "1:40:16", "remaining_time": "0:42:20"}
|
||||||
|
{"current_steps": 275, "total_steps": 384, "loss": 0.05, "lr": 1.1527534102110613e-06, "epoch": 1.4331376386170906, "percentage": 71.61, "elapsed_time": "1:42:06", "remaining_time": "0:40:28"}
|
||||||
|
{"current_steps": 280, "total_steps": 384, "loss": 0.0531, "lr": 1.0582991947128324e-06, "epoch": 1.4592302674494455, "percentage": 72.92, "elapsed_time": "1:43:57", "remaining_time": "0:38:36"}
|
||||||
|
{"current_steps": 285, "total_steps": 384, "loss": 0.0475, "lr": 9.66833124290709e-07, "epoch": 1.4853228962818004, "percentage": 74.22, "elapsed_time": "1:45:46", "remaining_time": "0:36:44"}
|
||||||
|
{"current_steps": 290, "total_steps": 384, "loss": 0.0444, "lr": 8.785447763431101e-07, "epoch": 1.5114155251141552, "percentage": 75.52, "elapsed_time": "1:47:36", "remaining_time": "0:34:52"}
|
||||||
|
{"current_steps": 295, "total_steps": 384, "loss": 0.0547, "lr": 7.936171419533653e-07, "epoch": 1.53750815394651, "percentage": 76.82, "elapsed_time": "1:49:22", "remaining_time": "0:32:59"}
|
||||||
|
{"current_steps": 300, "total_steps": 384, "loss": 0.0501, "lr": 7.122262466127513e-07, "epoch": 1.563600782778865, "percentage": 78.12, "elapsed_time": "1:51:14", "remaining_time": "0:31:08"}
|
||||||
|
{"current_steps": 305, "total_steps": 384, "loss": 0.0535, "lr": 6.345407853807864e-07, "epoch": 1.5896934116112198, "percentage": 79.43, "elapsed_time": "1:53:02", "remaining_time": "0:29:16"}
|
||||||
|
{"current_steps": 310, "total_steps": 384, "loss": 0.0533, "lr": 5.607217732389503e-07, "epoch": 1.6157860404435747, "percentage": 80.73, "elapsed_time": "1:54:54", "remaining_time": "0:27:25"}
|
||||||
|
{"current_steps": 315, "total_steps": 384, "loss": 0.0567, "lr": 4.909222113625545e-07, "epoch": 1.6418786692759295, "percentage": 82.03, "elapsed_time": "1:56:44", "remaining_time": "0:25:34"}
|
||||||
|
{"current_steps": 320, "total_steps": 384, "loss": 0.0569, "lr": 4.252867700024374e-07, "epoch": 1.6679712981082844, "percentage": 83.33, "elapsed_time": "1:58:33", "remaining_time": "0:23:42"}
|
||||||
|
{"current_steps": 325, "total_steps": 384, "loss": 0.0562, "lr": 3.639514886337786e-07, "epoch": 1.6940639269406392, "percentage": 84.64, "elapsed_time": "2:00:22", "remaining_time": "0:21:51"}
|
||||||
|
{"current_steps": 330, "total_steps": 384, "loss": 0.0504, "lr": 3.0704349399351437e-07, "epoch": 1.720156555772994, "percentage": 85.94, "elapsed_time": "2:02:13", "remaining_time": "0:20:00"}
|
||||||
|
{"current_steps": 335, "total_steps": 384, "loss": 0.0481, "lr": 2.5468073659076e-07, "epoch": 1.746249184605349, "percentage": 87.24, "elapsed_time": "2:03:58", "remaining_time": "0:18:07"}
|
||||||
|
{"current_steps": 340, "total_steps": 384, "loss": 0.0435, "lr": 2.0697174623636795e-07, "epoch": 1.7723418134377038, "percentage": 88.54, "elapsed_time": "2:05:51", "remaining_time": "0:16:17"}
|
||||||
|
{"current_steps": 345, "total_steps": 384, "loss": 0.0448, "lr": 1.6401540709832242e-07, "epoch": 1.7984344422700587, "percentage": 89.84, "elapsed_time": "2:07:39", "remaining_time": "0:14:25"}
|
||||||
|
{"current_steps": 350, "total_steps": 384, "loss": 0.0531, "lr": 1.2590075274920206e-07, "epoch": 1.8245270711024135, "percentage": 91.15, "elapsed_time": "2:09:31", "remaining_time": "0:12:34"}
|
||||||
|
{"current_steps": 355, "total_steps": 384, "loss": 0.0521, "lr": 9.270678163050218e-08, "epoch": 1.8506196999347684, "percentage": 92.45, "elapsed_time": "2:11:28", "remaining_time": "0:10:44"}
|
||||||
|
{"current_steps": 360, "total_steps": 384, "loss": 0.051, "lr": 6.450229331630253e-08, "epoch": 1.8767123287671232, "percentage": 93.75, "elapsed_time": "2:13:19", "remaining_time": "0:08:53"}
|
||||||
|
{"current_steps": 365, "total_steps": 384, "loss": 0.0514, "lr": 4.134574591564494e-08, "epoch": 1.902804957599478, "percentage": 95.05, "elapsed_time": "2:15:11", "remaining_time": "0:07:02"}
|
||||||
|
{"current_steps": 370, "total_steps": 384, "loss": 0.0484, "lr": 2.3285134909173113e-08, "epoch": 1.928897586431833, "percentage": 96.35, "elapsed_time": "2:17:02", "remaining_time": "0:05:11"}
|
||||||
|
{"current_steps": 375, "total_steps": 384, "loss": 0.0502, "lr": 1.0357893671171793e-08, "epoch": 1.9549902152641878, "percentage": 97.66, "elapsed_time": "2:18:51", "remaining_time": "0:03:19"}
|
||||||
|
{"current_steps": 380, "total_steps": 384, "loss": 0.0468, "lr": 2.590815883181108e-09, "epoch": 1.9810828440965427, "percentage": 98.96, "elapsed_time": "2:20:35", "remaining_time": "0:01:28"}
|
||||||
|
{"current_steps": 384, "total_steps": 384, "epoch": 2.0, "percentage": 100.0, "elapsed_time": "2:22:38", "remaining_time": "0:00:00"}
|
||||||
575
trainer_state.json
Normal file
575
trainer_state.json
Normal file
@@ -0,0 +1,575 @@
|
|||||||
|
{
|
||||||
|
"best_global_step": null,
|
||||||
|
"best_metric": null,
|
||||||
|
"best_model_checkpoint": null,
|
||||||
|
"epoch": 2.0,
|
||||||
|
"eval_steps": 500,
|
||||||
|
"global_step": 384,
|
||||||
|
"is_hyper_param_search": false,
|
||||||
|
"is_local_process_zero": true,
|
||||||
|
"is_world_process_zero": true,
|
||||||
|
"log_history": [
|
||||||
|
{
|
||||||
|
"epoch": 0.02609262883235486,
|
||||||
|
"grad_norm": 90.7743148803711,
|
||||||
|
"learning_rate": 5.128205128205128e-07,
|
||||||
|
"loss": 3.4203,
|
||||||
|
"step": 5
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.05218525766470972,
|
||||||
|
"grad_norm": 52.55401611328125,
|
||||||
|
"learning_rate": 1.153846153846154e-06,
|
||||||
|
"loss": 2.8478,
|
||||||
|
"step": 10
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.07827788649706457,
|
||||||
|
"grad_norm": 17.9848575592041,
|
||||||
|
"learning_rate": 1.794871794871795e-06,
|
||||||
|
"loss": 1.524,
|
||||||
|
"step": 15
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.10437051532941943,
|
||||||
|
"grad_norm": 9.579212188720703,
|
||||||
|
"learning_rate": 2.435897435897436e-06,
|
||||||
|
"loss": 0.8379,
|
||||||
|
"step": 20
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.1304631441617743,
|
||||||
|
"grad_norm": 6.430282115936279,
|
||||||
|
"learning_rate": 3.0769230769230774e-06,
|
||||||
|
"loss": 0.4496,
|
||||||
|
"step": 25
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.15655577299412915,
|
||||||
|
"grad_norm": 5.243109703063965,
|
||||||
|
"learning_rate": 3.7179487179487184e-06,
|
||||||
|
"loss": 0.2512,
|
||||||
|
"step": 30
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.182648401826484,
|
||||||
|
"grad_norm": 5.690948963165283,
|
||||||
|
"learning_rate": 4.358974358974359e-06,
|
||||||
|
"loss": 0.183,
|
||||||
|
"step": 35
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.20874103065883887,
|
||||||
|
"grad_norm": 4.116969585418701,
|
||||||
|
"learning_rate": 5e-06,
|
||||||
|
"loss": 0.1788,
|
||||||
|
"step": 40
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.23483365949119372,
|
||||||
|
"grad_norm": 2.8701882362365723,
|
||||||
|
"learning_rate": 4.9974091841168195e-06,
|
||||||
|
"loss": 0.1605,
|
||||||
|
"step": 45
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.2609262883235486,
|
||||||
|
"grad_norm": 7.059335231781006,
|
||||||
|
"learning_rate": 4.989642106328829e-06,
|
||||||
|
"loss": 0.1394,
|
||||||
|
"step": 50
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.28701891715590344,
|
||||||
|
"grad_norm": 3.2651431560516357,
|
||||||
|
"learning_rate": 4.976714865090827e-06,
|
||||||
|
"loss": 0.083,
|
||||||
|
"step": 55
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.3131115459882583,
|
||||||
|
"grad_norm": 2.457581043243408,
|
||||||
|
"learning_rate": 4.958654254084356e-06,
|
||||||
|
"loss": 0.0896,
|
||||||
|
"step": 60
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.33920417482061316,
|
||||||
|
"grad_norm": 2.72770619392395,
|
||||||
|
"learning_rate": 4.935497706683698e-06,
|
||||||
|
"loss": 0.0991,
|
||||||
|
"step": 65
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.365296803652968,
|
||||||
|
"grad_norm": 2.0538723468780518,
|
||||||
|
"learning_rate": 4.907293218369499e-06,
|
||||||
|
"loss": 0.0979,
|
||||||
|
"step": 70
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.3913894324853229,
|
||||||
|
"grad_norm": 2.1862363815307617,
|
||||||
|
"learning_rate": 4.874099247250799e-06,
|
||||||
|
"loss": 0.0933,
|
||||||
|
"step": 75
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.41748206131767773,
|
||||||
|
"grad_norm": 2.605069637298584,
|
||||||
|
"learning_rate": 4.835984592901678e-06,
|
||||||
|
"loss": 0.0959,
|
||||||
|
"step": 80
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.4435746901500326,
|
||||||
|
"grad_norm": 1.2768350839614868,
|
||||||
|
"learning_rate": 4.793028253763633e-06,
|
||||||
|
"loss": 0.0749,
|
||||||
|
"step": 85
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.46966731898238745,
|
||||||
|
"grad_norm": 4.374709606170654,
|
||||||
|
"learning_rate": 4.745319263409241e-06,
|
||||||
|
"loss": 0.0991,
|
||||||
|
"step": 90
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.4957599478147423,
|
||||||
|
"grad_norm": 1.9398008584976196,
|
||||||
|
"learning_rate": 4.692956506006486e-06,
|
||||||
|
"loss": 0.0833,
|
||||||
|
"step": 95
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5218525766470972,
|
||||||
|
"grad_norm": 1.7450673580169678,
|
||||||
|
"learning_rate": 4.636048511366222e-06,
|
||||||
|
"loss": 0.0804,
|
||||||
|
"step": 100
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.547945205479452,
|
||||||
|
"grad_norm": 1.712754249572754,
|
||||||
|
"learning_rate": 4.5747132299975634e-06,
|
||||||
|
"loss": 0.0867,
|
||||||
|
"step": 105
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5740378343118069,
|
||||||
|
"grad_norm": 1.083371877670288,
|
||||||
|
"learning_rate": 4.509077788637446e-06,
|
||||||
|
"loss": 0.0688,
|
||||||
|
"step": 110
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6001304631441617,
|
||||||
|
"grad_norm": 1.936558485031128,
|
||||||
|
"learning_rate": 4.43927822676105e-06,
|
||||||
|
"loss": 0.0772,
|
||||||
|
"step": 115
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6262230919765166,
|
||||||
|
"grad_norm": 1.4485265016555786,
|
||||||
|
"learning_rate": 4.3654592146192146e-06,
|
||||||
|
"loss": 0.0767,
|
||||||
|
"step": 120
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6523157208088715,
|
||||||
|
"grad_norm": 1.4740047454833984,
|
||||||
|
"learning_rate": 4.287773753387249e-06,
|
||||||
|
"loss": 0.0715,
|
||||||
|
"step": 125
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6784083496412263,
|
||||||
|
"grad_norm": 1.7988250255584717,
|
||||||
|
"learning_rate": 4.206382858046636e-06,
|
||||||
|
"loss": 0.0823,
|
||||||
|
"step": 130
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7045009784735812,
|
||||||
|
"grad_norm": 0.9675837159156799,
|
||||||
|
"learning_rate": 4.12145522365689e-06,
|
||||||
|
"loss": 0.0955,
|
||||||
|
"step": 135
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.730593607305936,
|
||||||
|
"grad_norm": 1.3645009994506836,
|
||||||
|
"learning_rate": 4.033166875709291e-06,
|
||||||
|
"loss": 0.062,
|
||||||
|
"step": 140
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7566862361382909,
|
||||||
|
"grad_norm": 1.3581523895263672,
|
||||||
|
"learning_rate": 3.941700805287169e-06,
|
||||||
|
"loss": 0.0868,
|
||||||
|
"step": 145
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7827788649706457,
|
||||||
|
"grad_norm": 1.8347728252410889,
|
||||||
|
"learning_rate": 3.84724658978894e-06,
|
||||||
|
"loss": 0.0681,
|
||||||
|
"step": 150
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8088714938030006,
|
||||||
|
"grad_norm": 1.278552770614624,
|
||||||
|
"learning_rate": 3.7500000000000005e-06,
|
||||||
|
"loss": 0.0709,
|
||||||
|
"step": 155
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8349641226353555,
|
||||||
|
"grad_norm": 1.676578402519226,
|
||||||
|
"learning_rate": 3.650162594327881e-06,
|
||||||
|
"loss": 0.0714,
|
||||||
|
"step": 160
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8610567514677103,
|
||||||
|
"grad_norm": 0.9458003640174866,
|
||||||
|
"learning_rate": 3.5479413010416606e-06,
|
||||||
|
"loss": 0.081,
|
||||||
|
"step": 165
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8871493803000652,
|
||||||
|
"grad_norm": 1.0945783853530884,
|
||||||
|
"learning_rate": 3.443547989381536e-06,
|
||||||
|
"loss": 0.0715,
|
||||||
|
"step": 170
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.91324200913242,
|
||||||
|
"grad_norm": 1.2435601949691772,
|
||||||
|
"learning_rate": 3.3371990304274654e-06,
|
||||||
|
"loss": 0.0638,
|
||||||
|
"step": 175
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9393346379647749,
|
||||||
|
"grad_norm": 1.2059943675994873,
|
||||||
|
"learning_rate": 3.2291148486370626e-06,
|
||||||
|
"loss": 0.0683,
|
||||||
|
"step": 180
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9654272667971298,
|
||||||
|
"grad_norm": 0.6467380523681641,
|
||||||
|
"learning_rate": 3.11951946498225e-06,
|
||||||
|
"loss": 0.0709,
|
||||||
|
"step": 185
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9915198956294846,
|
||||||
|
"grad_norm": 0.8123487830162048,
|
||||||
|
"learning_rate": 3.0086400326315853e-06,
|
||||||
|
"loss": 0.0601,
|
||||||
|
"step": 190
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.015655577299413,
|
||||||
|
"grad_norm": 1.2716907262802124,
|
||||||
|
"learning_rate": 2.896706366140629e-06,
|
||||||
|
"loss": 0.0579,
|
||||||
|
"step": 195
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.0417482061317678,
|
||||||
|
"grad_norm": 1.656204104423523,
|
||||||
|
"learning_rate": 2.7839504651261873e-06,
|
||||||
|
"loss": 0.0623,
|
||||||
|
"step": 200
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.0678408349641226,
|
||||||
|
"grad_norm": 1.195453405380249,
|
||||||
|
"learning_rate": 2.670606033411678e-06,
|
||||||
|
"loss": 0.0533,
|
||||||
|
"step": 205
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.0939334637964775,
|
||||||
|
"grad_norm": 1.3654705286026,
|
||||||
|
"learning_rate": 2.556907994640264e-06,
|
||||||
|
"loss": 0.0556,
|
||||||
|
"step": 210
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.1200260926288323,
|
||||||
|
"grad_norm": 0.6175478100776672,
|
||||||
|
"learning_rate": 2.443092005359736e-06,
|
||||||
|
"loss": 0.0459,
|
||||||
|
"step": 215
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.1461187214611872,
|
||||||
|
"grad_norm": 0.884466826915741,
|
||||||
|
"learning_rate": 2.3293939665883233e-06,
|
||||||
|
"loss": 0.057,
|
||||||
|
"step": 220
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.172211350293542,
|
||||||
|
"grad_norm": 1.4396722316741943,
|
||||||
|
"learning_rate": 2.2160495348738127e-06,
|
||||||
|
"loss": 0.063,
|
||||||
|
"step": 225
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.198303979125897,
|
||||||
|
"grad_norm": 0.893132209777832,
|
||||||
|
"learning_rate": 2.1032936338593716e-06,
|
||||||
|
"loss": 0.0554,
|
||||||
|
"step": 230
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.2243966079582518,
|
||||||
|
"grad_norm": 0.778917133808136,
|
||||||
|
"learning_rate": 1.991359967368416e-06,
|
||||||
|
"loss": 0.0538,
|
||||||
|
"step": 235
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.2504892367906066,
|
||||||
|
"grad_norm": 1.2776492834091187,
|
||||||
|
"learning_rate": 1.8804805350177507e-06,
|
||||||
|
"loss": 0.0538,
|
||||||
|
"step": 240
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.2765818656229615,
|
||||||
|
"grad_norm": 1.0802513360977173,
|
||||||
|
"learning_rate": 1.7708851513629376e-06,
|
||||||
|
"loss": 0.0541,
|
||||||
|
"step": 245
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.3026744944553164,
|
||||||
|
"grad_norm": 0.9070869088172913,
|
||||||
|
"learning_rate": 1.6628009695725348e-06,
|
||||||
|
"loss": 0.0479,
|
||||||
|
"step": 250
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.3287671232876712,
|
||||||
|
"grad_norm": 1.4413901567459106,
|
||||||
|
"learning_rate": 1.5564520106184643e-06,
|
||||||
|
"loss": 0.0514,
|
||||||
|
"step": 255
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.354859752120026,
|
||||||
|
"grad_norm": 1.1004434823989868,
|
||||||
|
"learning_rate": 1.4520586989583406e-06,
|
||||||
|
"loss": 0.0486,
|
||||||
|
"step": 260
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.380952380952381,
|
||||||
|
"grad_norm": 1.1776546239852905,
|
||||||
|
"learning_rate": 1.3498374056721198e-06,
|
||||||
|
"loss": 0.0467,
|
||||||
|
"step": 265
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.4070450097847358,
|
||||||
|
"grad_norm": 1.00455641746521,
|
||||||
|
"learning_rate": 1.2500000000000007e-06,
|
||||||
|
"loss": 0.0555,
|
||||||
|
"step": 270
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.4331376386170906,
|
||||||
|
"grad_norm": 1.1658108234405518,
|
||||||
|
"learning_rate": 1.1527534102110613e-06,
|
||||||
|
"loss": 0.05,
|
||||||
|
"step": 275
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.4592302674494455,
|
||||||
|
"grad_norm": 0.5006061792373657,
|
||||||
|
"learning_rate": 1.0582991947128324e-06,
|
||||||
|
"loss": 0.0531,
|
||||||
|
"step": 280
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.4853228962818004,
|
||||||
|
"grad_norm": 0.5298914909362793,
|
||||||
|
"learning_rate": 9.66833124290709e-07,
|
||||||
|
"loss": 0.0475,
|
||||||
|
"step": 285
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.5114155251141552,
|
||||||
|
"grad_norm": 0.6051680445671082,
|
||||||
|
"learning_rate": 8.785447763431101e-07,
|
||||||
|
"loss": 0.0444,
|
||||||
|
"step": 290
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.53750815394651,
|
||||||
|
"grad_norm": 1.11183500289917,
|
||||||
|
"learning_rate": 7.936171419533653e-07,
|
||||||
|
"loss": 0.0547,
|
||||||
|
"step": 295
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.563600782778865,
|
||||||
|
"grad_norm": 2.068556308746338,
|
||||||
|
"learning_rate": 7.122262466127513e-07,
|
||||||
|
"loss": 0.0501,
|
||||||
|
"step": 300
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.5896934116112198,
|
||||||
|
"grad_norm": 0.9381551742553711,
|
||||||
|
"learning_rate": 6.345407853807864e-07,
|
||||||
|
"loss": 0.0535,
|
||||||
|
"step": 305
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.6157860404435747,
|
||||||
|
"grad_norm": 1.0716235637664795,
|
||||||
|
"learning_rate": 5.607217732389503e-07,
|
||||||
|
"loss": 0.0533,
|
||||||
|
"step": 310
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.6418786692759295,
|
||||||
|
"grad_norm": 0.8771371245384216,
|
||||||
|
"learning_rate": 4.909222113625545e-07,
|
||||||
|
"loss": 0.0567,
|
||||||
|
"step": 315
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.6679712981082844,
|
||||||
|
"grad_norm": 1.4611281156539917,
|
||||||
|
"learning_rate": 4.252867700024374e-07,
|
||||||
|
"loss": 0.0569,
|
||||||
|
"step": 320
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.6940639269406392,
|
||||||
|
"grad_norm": 0.42611926794052124,
|
||||||
|
"learning_rate": 3.639514886337786e-07,
|
||||||
|
"loss": 0.0562,
|
||||||
|
"step": 325
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.720156555772994,
|
||||||
|
"grad_norm": 1.3697057962417603,
|
||||||
|
"learning_rate": 3.0704349399351437e-07,
|
||||||
|
"loss": 0.0504,
|
||||||
|
"step": 330
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.746249184605349,
|
||||||
|
"grad_norm": 1.6137443780899048,
|
||||||
|
"learning_rate": 2.5468073659076e-07,
|
||||||
|
"loss": 0.0481,
|
||||||
|
"step": 335
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.7723418134377038,
|
||||||
|
"grad_norm": 0.8786627054214478,
|
||||||
|
"learning_rate": 2.0697174623636795e-07,
|
||||||
|
"loss": 0.0435,
|
||||||
|
"step": 340
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.7984344422700587,
|
||||||
|
"grad_norm": 0.6073723435401917,
|
||||||
|
"learning_rate": 1.6401540709832242e-07,
|
||||||
|
"loss": 0.0448,
|
||||||
|
"step": 345
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.8245270711024135,
|
||||||
|
"grad_norm": 0.4912233054637909,
|
||||||
|
"learning_rate": 1.2590075274920206e-07,
|
||||||
|
"loss": 0.0531,
|
||||||
|
"step": 350
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.8506196999347684,
|
||||||
|
"grad_norm": 1.127508282661438,
|
||||||
|
"learning_rate": 9.270678163050218e-08,
|
||||||
|
"loss": 0.0521,
|
||||||
|
"step": 355
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.8767123287671232,
|
||||||
|
"grad_norm": 1.1689162254333496,
|
||||||
|
"learning_rate": 6.450229331630253e-08,
|
||||||
|
"loss": 0.051,
|
||||||
|
"step": 360
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.902804957599478,
|
||||||
|
"grad_norm": 0.8796715140342712,
|
||||||
|
"learning_rate": 4.134574591564494e-08,
|
||||||
|
"loss": 0.0514,
|
||||||
|
"step": 365
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.928897586431833,
|
||||||
|
"grad_norm": 0.8864848017692566,
|
||||||
|
"learning_rate": 2.3285134909173113e-08,
|
||||||
|
"loss": 0.0484,
|
||||||
|
"step": 370
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.9549902152641878,
|
||||||
|
"grad_norm": 0.7268601655960083,
|
||||||
|
"learning_rate": 1.0357893671171793e-08,
|
||||||
|
"loss": 0.0502,
|
||||||
|
"step": 375
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.9810828440965427,
|
||||||
|
"grad_norm": 0.7900459170341492,
|
||||||
|
"learning_rate": 2.590815883181108e-09,
|
||||||
|
"loss": 0.0468,
|
||||||
|
"step": 380
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 2.0,
|
||||||
|
"step": 384,
|
||||||
|
"total_flos": 9.374131655263642e+17,
|
||||||
|
"train_loss": 0.18539645452983677,
|
||||||
|
"train_runtime": 8558.6373,
|
||||||
|
"train_samples_per_second": 2.865,
|
||||||
|
"train_steps_per_second": 0.045
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"logging_steps": 5,
|
||||||
|
"max_steps": 384,
|
||||||
|
"num_input_tokens_seen": 0,
|
||||||
|
"num_train_epochs": 2,
|
||||||
|
"save_steps": 200,
|
||||||
|
"stateful_callbacks": {
|
||||||
|
"TrainerControl": {
|
||||||
|
"args": {
|
||||||
|
"should_epoch_stop": false,
|
||||||
|
"should_evaluate": false,
|
||||||
|
"should_log": false,
|
||||||
|
"should_save": true,
|
||||||
|
"should_training_stop": true
|
||||||
|
},
|
||||||
|
"attributes": {}
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"total_flos": 9.374131655263642e+17,
|
||||||
|
"train_batch_size": 4,
|
||||||
|
"trial_name": null,
|
||||||
|
"trial_params": null
|
||||||
|
}
|
||||||
3
training_args.bin
Normal file
3
training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:eefe3a8f7ff0a02d7d0543cd767d19dca4a289498f0d97a7be7b74c1ad482785
|
||||||
|
size 5816
|
||||||
Reference in New Issue
Block a user