初始化项目,由ModelHub XC社区提供模型
Model: open-unlearning/tofu_Llama-2-7b-chat-hf_retain95 Source: Original Platform
This commit is contained in:
35
.gitattributes
vendored
Normal file
35
.gitattributes
vendored
Normal file
@@ -0,0 +1,35 @@
|
||||
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||
*.model filter=lfs diff=lfs merge=lfs -text
|
||||
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
30
config.json
Normal file
30
config.json
Normal file
@@ -0,0 +1,30 @@
|
||||
{
|
||||
"_name_or_path": "meta-llama/Llama-2-7b-chat-hf",
|
||||
"architectures": [
|
||||
"LlamaForCausalLM"
|
||||
],
|
||||
"attention_bias": false,
|
||||
"attention_dropout": 0.0,
|
||||
"bos_token_id": 1,
|
||||
"eos_token_id": 2,
|
||||
"head_dim": 128,
|
||||
"hidden_act": "silu",
|
||||
"hidden_size": 4096,
|
||||
"initializer_range": 0.02,
|
||||
"intermediate_size": 11008,
|
||||
"max_position_embeddings": 4096,
|
||||
"mlp_bias": false,
|
||||
"model_type": "llama",
|
||||
"num_attention_heads": 32,
|
||||
"num_hidden_layers": 32,
|
||||
"num_key_value_heads": 32,
|
||||
"pretraining_tp": 1,
|
||||
"rms_norm_eps": 1e-05,
|
||||
"rope_scaling": null,
|
||||
"rope_theta": 10000.0,
|
||||
"tie_word_embeddings": false,
|
||||
"torch_dtype": "bfloat16",
|
||||
"transformers_version": "4.45.1",
|
||||
"use_cache": true,
|
||||
"vocab_size": 32000
|
||||
}
|
||||
10
generation_config.json
Normal file
10
generation_config.json
Normal file
@@ -0,0 +1,10 @@
|
||||
{
|
||||
"bos_token_id": 1,
|
||||
"do_sample": true,
|
||||
"eos_token_id": 2,
|
||||
"max_length": 4096,
|
||||
"pad_token_id": 0,
|
||||
"temperature": 0.6,
|
||||
"top_p": 0.9,
|
||||
"transformers_version": "4.45.1"
|
||||
}
|
||||
3
model-00001-of-00003.safetensors
Normal file
3
model-00001-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:d10b6e2ecc9f9ed906a5ef08d1b103ad90453eb12445c0b118910f5a91a934ed
|
||||
size 4938985352
|
||||
3
model-00002-of-00003.safetensors
Normal file
3
model-00002-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:450a5767115eb929e96eeb91c89fe5ce8f52712ed4bc03b69668a8b62631317f
|
||||
size 4947390880
|
||||
3
model-00003-of-00003.safetensors
Normal file
3
model-00003-of-00003.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:e9939e3bb2c8caa9a7d943dd64b40926f77a2732134641f636ab9ff5f2631fd6
|
||||
size 3590488816
|
||||
298
model.safetensors.index.json
Normal file
298
model.safetensors.index.json
Normal file
@@ -0,0 +1,298 @@
|
||||
{
|
||||
"metadata": {
|
||||
"total_size": 13476831232
|
||||
},
|
||||
"weight_map": {
|
||||
"lm_head.weight": "model-00003-of-00003.safetensors",
|
||||
"model.embed_tokens.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.0.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.1.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.10.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.10.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.10.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.10.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.10.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.10.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.10.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.10.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.10.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.11.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.11.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.11.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.11.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.11.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.11.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.11.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.11.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.11.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.12.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.12.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.12.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.12.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.12.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.12.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.12.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.12.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.12.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.13.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.13.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.13.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.13.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.13.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.13.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.13.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.13.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.13.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.14.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.14.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.14.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.14.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.14.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.14.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.14.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.14.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.14.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.15.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.15.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.15.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.15.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.15.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.15.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.15.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.15.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.15.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.16.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.16.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.16.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.16.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.16.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.16.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.16.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.16.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.16.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.17.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.17.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.17.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.17.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.17.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.17.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.17.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.17.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.17.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.18.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.18.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.18.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.18.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.18.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.18.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.18.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.19.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.19.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.19.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.20.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.20.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.20.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.20.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.20.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.20.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.20.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.21.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.21.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.21.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.21.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.21.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.22.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.22.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.22.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.22.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.22.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.22.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.22.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.22.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.23.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.23.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.23.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.23.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.23.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.23.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.23.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.23.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.23.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
||||
"model.layers.24.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.24.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.24.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.24.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.24.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.24.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.24.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.24.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.24.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.25.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.25.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.25.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.25.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.25.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.25.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.25.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.25.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.25.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.26.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.26.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.26.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.26.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.26.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.26.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.26.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.26.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.26.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.27.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.27.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.27.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.27.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.27.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.27.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.27.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.27.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.27.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.28.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.28.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.28.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.28.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.28.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.28.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.28.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.28.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.28.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.29.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.29.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.29.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.29.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.29.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.29.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.29.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.29.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.29.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.3.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.3.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.3.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.3.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.3.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.30.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.30.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.30.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.30.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.30.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.30.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.30.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.30.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.30.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.31.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.31.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.31.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.31.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.31.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.31.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.31.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.31.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.31.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
||||
"model.layers.4.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.4.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.4.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.4.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.4.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.4.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.4.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.4.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.4.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.5.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.5.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.5.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.5.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.5.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.5.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.5.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.5.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.5.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.6.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.6.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.6.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.6.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.6.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.6.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.6.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.6.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.6.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.7.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.7.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.7.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.7.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.7.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.7.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.7.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.7.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.7.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.8.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.8.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.8.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.8.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.8.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.8.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.8.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.8.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.8.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.9.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.9.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.9.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.9.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.9.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.9.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.9.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.9.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.layers.9.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
|
||||
"model.norm.weight": "model-00003-of-00003.safetensors"
|
||||
}
|
||||
}
|
||||
24
special_tokens_map.json
Normal file
24
special_tokens_map.json
Normal file
@@ -0,0 +1,24 @@
|
||||
{
|
||||
"bos_token": {
|
||||
"content": "<s>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"eos_token": {
|
||||
"content": "</s>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"pad_token": "</s>",
|
||||
"unk_token": {
|
||||
"content": "<unk>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
}
|
||||
}
|
||||
277144
tokenizer.json
Normal file
277144
tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
43
tokenizer_config.json
Normal file
43
tokenizer_config.json
Normal file
@@ -0,0 +1,43 @@
|
||||
{
|
||||
"add_bos_token": true,
|
||||
"add_eos_token": false,
|
||||
"add_prefix_space": null,
|
||||
"added_tokens_decoder": {
|
||||
"0": {
|
||||
"content": "<unk>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"1": {
|
||||
"content": "<s>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"2": {
|
||||
"content": "</s>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
}
|
||||
},
|
||||
"bos_token": "<s>",
|
||||
"chat_template": "{% if messages[0]['role'] == 'system' %}{% set loop_messages = messages[1:] %}{% set system_message = messages[0]['content'] %}{% else %}{% set loop_messages = messages %}{% set system_message = false %}{% endif %}{% for message in loop_messages %}{% if (message['role'] == 'user') != (loop.index0 % 2 == 0) %}{{ raise_exception('Conversation roles must alternate user/assistant/user/assistant/...') }}{% endif %}{% if loop.index0 == 0 and system_message != false %}{% set content = '<<SYS>>\\n' + system_message + '\\n<</SYS>>\\n\\n' + message['content'] %}{% else %}{% set content = message['content'] %}{% endif %}{% if message['role'] == 'user' %}{{ bos_token + '[INST] ' + content.strip() + ' [/INST]' }}{% elif message['role'] == 'assistant' %}{{ ' ' + content.strip() + ' ' + eos_token }}{% endif %}{% endfor %}",
|
||||
"clean_up_tokenization_spaces": false,
|
||||
"eos_token": "</s>",
|
||||
"legacy": false,
|
||||
"model_max_length": 1000000000000000019884624838656,
|
||||
"pad_token": "</s>",
|
||||
"padding_side": "right",
|
||||
"sp_model_kwargs": {},
|
||||
"tokenizer_class": "LlamaTokenizer",
|
||||
"unk_token": "<unk>",
|
||||
"use_default_system_prompt": false
|
||||
}
|
||||
868
trainer_state.json
Normal file
868
trainer_state.json
Normal file
@@ -0,0 +1,868 @@
|
||||
{
|
||||
"best_metric": null,
|
||||
"best_model_checkpoint": null,
|
||||
"epoch": 4.968421052631579,
|
||||
"eval_steps": 500,
|
||||
"global_step": 590,
|
||||
"is_hyper_param_search": false,
|
||||
"is_local_process_zero": true,
|
||||
"is_world_process_zero": true,
|
||||
"log_history": [
|
||||
{
|
||||
"epoch": 0.042105263157894736,
|
||||
"grad_norm": 37.56959101479875,
|
||||
"learning_rate": 4.2372881355932204e-07,
|
||||
"loss": 2.7684,
|
||||
"step": 5
|
||||
},
|
||||
{
|
||||
"epoch": 0.08421052631578947,
|
||||
"grad_norm": 31.289451739550167,
|
||||
"learning_rate": 8.474576271186441e-07,
|
||||
"loss": 2.7059,
|
||||
"step": 10
|
||||
},
|
||||
{
|
||||
"epoch": 0.12631578947368421,
|
||||
"grad_norm": 31.193323882177836,
|
||||
"learning_rate": 1.2711864406779662e-06,
|
||||
"loss": 2.5582,
|
||||
"step": 15
|
||||
},
|
||||
{
|
||||
"epoch": 0.16842105263157894,
|
||||
"grad_norm": 19.559857035516696,
|
||||
"learning_rate": 1.6949152542372882e-06,
|
||||
"loss": 2.1059,
|
||||
"step": 20
|
||||
},
|
||||
{
|
||||
"epoch": 0.21052631578947367,
|
||||
"grad_norm": 9.217597906831552,
|
||||
"learning_rate": 2.11864406779661e-06,
|
||||
"loss": 1.9037,
|
||||
"step": 25
|
||||
},
|
||||
{
|
||||
"epoch": 0.25263157894736843,
|
||||
"grad_norm": 10.294915413914124,
|
||||
"learning_rate": 2.5423728813559323e-06,
|
||||
"loss": 1.7266,
|
||||
"step": 30
|
||||
},
|
||||
{
|
||||
"epoch": 0.29473684210526313,
|
||||
"grad_norm": 9.327403442633655,
|
||||
"learning_rate": 2.9661016949152545e-06,
|
||||
"loss": 1.6559,
|
||||
"step": 35
|
||||
},
|
||||
{
|
||||
"epoch": 0.3368421052631579,
|
||||
"grad_norm": 7.710428440860352,
|
||||
"learning_rate": 3.3898305084745763e-06,
|
||||
"loss": 1.5544,
|
||||
"step": 40
|
||||
},
|
||||
{
|
||||
"epoch": 0.37894736842105264,
|
||||
"grad_norm": 5.69482613560667,
|
||||
"learning_rate": 3.8135593220338985e-06,
|
||||
"loss": 1.4948,
|
||||
"step": 45
|
||||
},
|
||||
{
|
||||
"epoch": 0.42105263157894735,
|
||||
"grad_norm": 5.210507367207414,
|
||||
"learning_rate": 4.23728813559322e-06,
|
||||
"loss": 1.4226,
|
||||
"step": 50
|
||||
},
|
||||
{
|
||||
"epoch": 0.4631578947368421,
|
||||
"grad_norm": 4.682240928918827,
|
||||
"learning_rate": 4.6610169491525425e-06,
|
||||
"loss": 1.4354,
|
||||
"step": 55
|
||||
},
|
||||
{
|
||||
"epoch": 0.5052631578947369,
|
||||
"grad_norm": 4.966102260395402,
|
||||
"learning_rate": 5.084745762711865e-06,
|
||||
"loss": 1.3991,
|
||||
"step": 60
|
||||
},
|
||||
{
|
||||
"epoch": 0.5473684210526316,
|
||||
"grad_norm": 5.75566327559658,
|
||||
"learning_rate": 5.508474576271187e-06,
|
||||
"loss": 1.3451,
|
||||
"step": 65
|
||||
},
|
||||
{
|
||||
"epoch": 0.5894736842105263,
|
||||
"grad_norm": 4.675561876572965,
|
||||
"learning_rate": 5.932203389830509e-06,
|
||||
"loss": 1.3689,
|
||||
"step": 70
|
||||
},
|
||||
{
|
||||
"epoch": 0.631578947368421,
|
||||
"grad_norm": 4.7464790635795335,
|
||||
"learning_rate": 6.3559322033898304e-06,
|
||||
"loss": 1.3307,
|
||||
"step": 75
|
||||
},
|
||||
{
|
||||
"epoch": 0.6736842105263158,
|
||||
"grad_norm": 5.101350767057404,
|
||||
"learning_rate": 6.779661016949153e-06,
|
||||
"loss": 1.3383,
|
||||
"step": 80
|
||||
},
|
||||
{
|
||||
"epoch": 0.7157894736842105,
|
||||
"grad_norm": 4.817887469772435,
|
||||
"learning_rate": 7.203389830508475e-06,
|
||||
"loss": 1.2957,
|
||||
"step": 85
|
||||
},
|
||||
{
|
||||
"epoch": 0.7578947368421053,
|
||||
"grad_norm": 4.644863620183367,
|
||||
"learning_rate": 7.627118644067797e-06,
|
||||
"loss": 1.2931,
|
||||
"step": 90
|
||||
},
|
||||
{
|
||||
"epoch": 0.8,
|
||||
"grad_norm": 4.682998891732904,
|
||||
"learning_rate": 8.050847457627118e-06,
|
||||
"loss": 1.2658,
|
||||
"step": 95
|
||||
},
|
||||
{
|
||||
"epoch": 0.8421052631578947,
|
||||
"grad_norm": 4.432257920161264,
|
||||
"learning_rate": 8.47457627118644e-06,
|
||||
"loss": 1.2024,
|
||||
"step": 100
|
||||
},
|
||||
{
|
||||
"epoch": 0.8842105263157894,
|
||||
"grad_norm": 4.511031868472057,
|
||||
"learning_rate": 8.898305084745763e-06,
|
||||
"loss": 1.2439,
|
||||
"step": 105
|
||||
},
|
||||
{
|
||||
"epoch": 0.9263157894736842,
|
||||
"grad_norm": 4.627996159355769,
|
||||
"learning_rate": 9.322033898305085e-06,
|
||||
"loss": 1.2899,
|
||||
"step": 110
|
||||
},
|
||||
{
|
||||
"epoch": 0.968421052631579,
|
||||
"grad_norm": 5.098335008818089,
|
||||
"learning_rate": 9.745762711864407e-06,
|
||||
"loss": 1.241,
|
||||
"step": 115
|
||||
},
|
||||
{
|
||||
"epoch": 1.0105263157894737,
|
||||
"grad_norm": 3.9650974779884938,
|
||||
"learning_rate": 9.957627118644069e-06,
|
||||
"loss": 1.1802,
|
||||
"step": 120
|
||||
},
|
||||
{
|
||||
"epoch": 1.0526315789473684,
|
||||
"grad_norm": 3.954303638319163,
|
||||
"learning_rate": 9.851694915254239e-06,
|
||||
"loss": 1.09,
|
||||
"step": 125
|
||||
},
|
||||
{
|
||||
"epoch": 1.0947368421052632,
|
||||
"grad_norm": 4.077358237651598,
|
||||
"learning_rate": 9.745762711864407e-06,
|
||||
"loss": 0.9745,
|
||||
"step": 130
|
||||
},
|
||||
{
|
||||
"epoch": 1.1368421052631579,
|
||||
"grad_norm": 4.91764657692823,
|
||||
"learning_rate": 9.639830508474577e-06,
|
||||
"loss": 1.0262,
|
||||
"step": 135
|
||||
},
|
||||
{
|
||||
"epoch": 1.1789473684210527,
|
||||
"grad_norm": 5.3221038272450905,
|
||||
"learning_rate": 9.533898305084747e-06,
|
||||
"loss": 1.0054,
|
||||
"step": 140
|
||||
},
|
||||
{
|
||||
"epoch": 1.2210526315789474,
|
||||
"grad_norm": 4.764950986365931,
|
||||
"learning_rate": 9.427966101694917e-06,
|
||||
"loss": 1.0034,
|
||||
"step": 145
|
||||
},
|
||||
{
|
||||
"epoch": 1.263157894736842,
|
||||
"grad_norm": 4.397956284754463,
|
||||
"learning_rate": 9.322033898305085e-06,
|
||||
"loss": 0.9692,
|
||||
"step": 150
|
||||
},
|
||||
{
|
||||
"epoch": 1.305263157894737,
|
||||
"grad_norm": 5.576640017388553,
|
||||
"learning_rate": 9.216101694915255e-06,
|
||||
"loss": 0.9714,
|
||||
"step": 155
|
||||
},
|
||||
{
|
||||
"epoch": 1.3473684210526315,
|
||||
"grad_norm": 4.252510823881436,
|
||||
"learning_rate": 9.110169491525425e-06,
|
||||
"loss": 0.9341,
|
||||
"step": 160
|
||||
},
|
||||
{
|
||||
"epoch": 1.3894736842105262,
|
||||
"grad_norm": 4.722393724784491,
|
||||
"learning_rate": 9.004237288135595e-06,
|
||||
"loss": 0.9678,
|
||||
"step": 165
|
||||
},
|
||||
{
|
||||
"epoch": 1.431578947368421,
|
||||
"grad_norm": 4.563250808335276,
|
||||
"learning_rate": 8.898305084745763e-06,
|
||||
"loss": 1.0039,
|
||||
"step": 170
|
||||
},
|
||||
{
|
||||
"epoch": 1.4736842105263157,
|
||||
"grad_norm": 4.552862851357299,
|
||||
"learning_rate": 8.792372881355933e-06,
|
||||
"loss": 0.9707,
|
||||
"step": 175
|
||||
},
|
||||
{
|
||||
"epoch": 1.5157894736842106,
|
||||
"grad_norm": 5.468925608374858,
|
||||
"learning_rate": 8.686440677966103e-06,
|
||||
"loss": 0.9662,
|
||||
"step": 180
|
||||
},
|
||||
{
|
||||
"epoch": 1.5578947368421052,
|
||||
"grad_norm": 5.100218329702008,
|
||||
"learning_rate": 8.580508474576272e-06,
|
||||
"loss": 0.9582,
|
||||
"step": 185
|
||||
},
|
||||
{
|
||||
"epoch": 1.6,
|
||||
"grad_norm": 4.621347397165775,
|
||||
"learning_rate": 8.47457627118644e-06,
|
||||
"loss": 0.955,
|
||||
"step": 190
|
||||
},
|
||||
{
|
||||
"epoch": 1.6421052631578947,
|
||||
"grad_norm": 4.884622562017621,
|
||||
"learning_rate": 8.36864406779661e-06,
|
||||
"loss": 1.009,
|
||||
"step": 195
|
||||
},
|
||||
{
|
||||
"epoch": 1.6842105263157894,
|
||||
"grad_norm": 5.2175253410954285,
|
||||
"learning_rate": 8.26271186440678e-06,
|
||||
"loss": 0.9902,
|
||||
"step": 200
|
||||
},
|
||||
{
|
||||
"epoch": 1.7263157894736842,
|
||||
"grad_norm": 6.359889758676588,
|
||||
"learning_rate": 8.15677966101695e-06,
|
||||
"loss": 0.9538,
|
||||
"step": 205
|
||||
},
|
||||
{
|
||||
"epoch": 1.768421052631579,
|
||||
"grad_norm": 4.9855484178179665,
|
||||
"learning_rate": 8.050847457627118e-06,
|
||||
"loss": 0.94,
|
||||
"step": 210
|
||||
},
|
||||
{
|
||||
"epoch": 1.8105263157894735,
|
||||
"grad_norm": 5.172183531187905,
|
||||
"learning_rate": 7.944915254237288e-06,
|
||||
"loss": 1.0018,
|
||||
"step": 215
|
||||
},
|
||||
{
|
||||
"epoch": 1.8526315789473684,
|
||||
"grad_norm": 4.828811604350556,
|
||||
"learning_rate": 7.838983050847458e-06,
|
||||
"loss": 0.9867,
|
||||
"step": 220
|
||||
},
|
||||
{
|
||||
"epoch": 1.8947368421052633,
|
||||
"grad_norm": 5.144596691264576,
|
||||
"learning_rate": 7.733050847457628e-06,
|
||||
"loss": 0.9916,
|
||||
"step": 225
|
||||
},
|
||||
{
|
||||
"epoch": 1.936842105263158,
|
||||
"grad_norm": 4.970464184071689,
|
||||
"learning_rate": 7.627118644067797e-06,
|
||||
"loss": 0.9417,
|
||||
"step": 230
|
||||
},
|
||||
{
|
||||
"epoch": 1.9789473684210526,
|
||||
"grad_norm": 5.180493471003968,
|
||||
"learning_rate": 7.521186440677967e-06,
|
||||
"loss": 0.9583,
|
||||
"step": 235
|
||||
},
|
||||
{
|
||||
"epoch": 2.0210526315789474,
|
||||
"grad_norm": 3.9416734314093285,
|
||||
"learning_rate": 7.415254237288137e-06,
|
||||
"loss": 0.7218,
|
||||
"step": 240
|
||||
},
|
||||
{
|
||||
"epoch": 2.0631578947368423,
|
||||
"grad_norm": 4.619095489451604,
|
||||
"learning_rate": 7.309322033898306e-06,
|
||||
"loss": 0.4864,
|
||||
"step": 245
|
||||
},
|
||||
{
|
||||
"epoch": 2.1052631578947367,
|
||||
"grad_norm": 5.701097605509544,
|
||||
"learning_rate": 7.203389830508475e-06,
|
||||
"loss": 0.4446,
|
||||
"step": 250
|
||||
},
|
||||
{
|
||||
"epoch": 2.1473684210526316,
|
||||
"grad_norm": 5.792761603770171,
|
||||
"learning_rate": 7.097457627118645e-06,
|
||||
"loss": 0.4579,
|
||||
"step": 255
|
||||
},
|
||||
{
|
||||
"epoch": 2.1894736842105265,
|
||||
"grad_norm": 6.270955149892091,
|
||||
"learning_rate": 6.9915254237288146e-06,
|
||||
"loss": 0.4519,
|
||||
"step": 260
|
||||
},
|
||||
{
|
||||
"epoch": 2.231578947368421,
|
||||
"grad_norm": 5.323086408298113,
|
||||
"learning_rate": 6.8855932203389844e-06,
|
||||
"loss": 0.4534,
|
||||
"step": 265
|
||||
},
|
||||
{
|
||||
"epoch": 2.2736842105263158,
|
||||
"grad_norm": 6.420773603363344,
|
||||
"learning_rate": 6.779661016949153e-06,
|
||||
"loss": 0.4518,
|
||||
"step": 270
|
||||
},
|
||||
{
|
||||
"epoch": 2.3157894736842106,
|
||||
"grad_norm": 4.889737887828383,
|
||||
"learning_rate": 6.6737288135593225e-06,
|
||||
"loss": 0.4519,
|
||||
"step": 275
|
||||
},
|
||||
{
|
||||
"epoch": 2.3578947368421055,
|
||||
"grad_norm": 5.198662251137422,
|
||||
"learning_rate": 6.567796610169492e-06,
|
||||
"loss": 0.4843,
|
||||
"step": 280
|
||||
},
|
||||
{
|
||||
"epoch": 2.4,
|
||||
"grad_norm": 4.902609500348769,
|
||||
"learning_rate": 6.461864406779662e-06,
|
||||
"loss": 0.4617,
|
||||
"step": 285
|
||||
},
|
||||
{
|
||||
"epoch": 2.442105263157895,
|
||||
"grad_norm": 5.890700840686636,
|
||||
"learning_rate": 6.3559322033898304e-06,
|
||||
"loss": 0.4611,
|
||||
"step": 290
|
||||
},
|
||||
{
|
||||
"epoch": 2.4842105263157896,
|
||||
"grad_norm": 5.266072088286826,
|
||||
"learning_rate": 6.25e-06,
|
||||
"loss": 0.4678,
|
||||
"step": 295
|
||||
},
|
||||
{
|
||||
"epoch": 2.526315789473684,
|
||||
"grad_norm": 5.001862146562411,
|
||||
"learning_rate": 6.14406779661017e-06,
|
||||
"loss": 0.4793,
|
||||
"step": 300
|
||||
},
|
||||
{
|
||||
"epoch": 2.568421052631579,
|
||||
"grad_norm": 5.885958149708538,
|
||||
"learning_rate": 6.038135593220339e-06,
|
||||
"loss": 0.4558,
|
||||
"step": 305
|
||||
},
|
||||
{
|
||||
"epoch": 2.610526315789474,
|
||||
"grad_norm": 4.677322542622177,
|
||||
"learning_rate": 5.932203389830509e-06,
|
||||
"loss": 0.4429,
|
||||
"step": 310
|
||||
},
|
||||
{
|
||||
"epoch": 2.6526315789473687,
|
||||
"grad_norm": 6.29067162665123,
|
||||
"learning_rate": 5.826271186440678e-06,
|
||||
"loss": 0.4426,
|
||||
"step": 315
|
||||
},
|
||||
{
|
||||
"epoch": 2.694736842105263,
|
||||
"grad_norm": 5.118881563294215,
|
||||
"learning_rate": 5.720338983050848e-06,
|
||||
"loss": 0.4886,
|
||||
"step": 320
|
||||
},
|
||||
{
|
||||
"epoch": 2.736842105263158,
|
||||
"grad_norm": 5.576669473381538,
|
||||
"learning_rate": 5.614406779661017e-06,
|
||||
"loss": 0.4706,
|
||||
"step": 325
|
||||
},
|
||||
{
|
||||
"epoch": 2.7789473684210524,
|
||||
"grad_norm": 5.915973784144362,
|
||||
"learning_rate": 5.508474576271187e-06,
|
||||
"loss": 0.445,
|
||||
"step": 330
|
||||
},
|
||||
{
|
||||
"epoch": 2.8210526315789473,
|
||||
"grad_norm": 5.242589320967943,
|
||||
"learning_rate": 5.402542372881357e-06,
|
||||
"loss": 0.4302,
|
||||
"step": 335
|
||||
},
|
||||
{
|
||||
"epoch": 2.863157894736842,
|
||||
"grad_norm": 7.920945983664561,
|
||||
"learning_rate": 5.296610169491526e-06,
|
||||
"loss": 0.4726,
|
||||
"step": 340
|
||||
},
|
||||
{
|
||||
"epoch": 2.905263157894737,
|
||||
"grad_norm": 5.0546857622133405,
|
||||
"learning_rate": 5.190677966101695e-06,
|
||||
"loss": 0.4685,
|
||||
"step": 345
|
||||
},
|
||||
{
|
||||
"epoch": 2.9473684210526314,
|
||||
"grad_norm": 5.612595665000495,
|
||||
"learning_rate": 5.084745762711865e-06,
|
||||
"loss": 0.5103,
|
||||
"step": 350
|
||||
},
|
||||
{
|
||||
"epoch": 2.9894736842105263,
|
||||
"grad_norm": 4.728389290445434,
|
||||
"learning_rate": 4.9788135593220346e-06,
|
||||
"loss": 0.4377,
|
||||
"step": 355
|
||||
},
|
||||
{
|
||||
"epoch": 3.031578947368421,
|
||||
"grad_norm": 3.754417559778345,
|
||||
"learning_rate": 4.872881355932204e-06,
|
||||
"loss": 0.2314,
|
||||
"step": 360
|
||||
},
|
||||
{
|
||||
"epoch": 3.0736842105263156,
|
||||
"grad_norm": 4.311941194829004,
|
||||
"learning_rate": 4.7669491525423735e-06,
|
||||
"loss": 0.1246,
|
||||
"step": 365
|
||||
},
|
||||
{
|
||||
"epoch": 3.1157894736842104,
|
||||
"grad_norm": 5.409314123339806,
|
||||
"learning_rate": 4.6610169491525425e-06,
|
||||
"loss": 0.1201,
|
||||
"step": 370
|
||||
},
|
||||
{
|
||||
"epoch": 3.1578947368421053,
|
||||
"grad_norm": 4.754979765258319,
|
||||
"learning_rate": 4.555084745762712e-06,
|
||||
"loss": 0.1123,
|
||||
"step": 375
|
||||
},
|
||||
{
|
||||
"epoch": 3.2,
|
||||
"grad_norm": 4.274523577322417,
|
||||
"learning_rate": 4.449152542372881e-06,
|
||||
"loss": 0.1091,
|
||||
"step": 380
|
||||
},
|
||||
{
|
||||
"epoch": 3.2421052631578946,
|
||||
"grad_norm": 4.34830357359911,
|
||||
"learning_rate": 4.343220338983051e-06,
|
||||
"loss": 0.1264,
|
||||
"step": 385
|
||||
},
|
||||
{
|
||||
"epoch": 3.2842105263157895,
|
||||
"grad_norm": 5.21825342106621,
|
||||
"learning_rate": 4.23728813559322e-06,
|
||||
"loss": 0.1267,
|
||||
"step": 390
|
||||
},
|
||||
{
|
||||
"epoch": 3.3263157894736843,
|
||||
"grad_norm": 4.382327715489745,
|
||||
"learning_rate": 4.13135593220339e-06,
|
||||
"loss": 0.1198,
|
||||
"step": 395
|
||||
},
|
||||
{
|
||||
"epoch": 3.3684210526315788,
|
||||
"grad_norm": 4.736638684494241,
|
||||
"learning_rate": 4.025423728813559e-06,
|
||||
"loss": 0.1115,
|
||||
"step": 400
|
||||
},
|
||||
{
|
||||
"epoch": 3.4105263157894736,
|
||||
"grad_norm": 3.0871403823899217,
|
||||
"learning_rate": 3.919491525423729e-06,
|
||||
"loss": 0.1047,
|
||||
"step": 405
|
||||
},
|
||||
{
|
||||
"epoch": 3.4526315789473685,
|
||||
"grad_norm": 3.7883466738808753,
|
||||
"learning_rate": 3.8135593220338985e-06,
|
||||
"loss": 0.1151,
|
||||
"step": 410
|
||||
},
|
||||
{
|
||||
"epoch": 3.4947368421052634,
|
||||
"grad_norm": 4.58550598062961,
|
||||
"learning_rate": 3.7076271186440684e-06,
|
||||
"loss": 0.1121,
|
||||
"step": 415
|
||||
},
|
||||
{
|
||||
"epoch": 3.536842105263158,
|
||||
"grad_norm": 4.294675453038568,
|
||||
"learning_rate": 3.6016949152542374e-06,
|
||||
"loss": 0.1307,
|
||||
"step": 420
|
||||
},
|
||||
{
|
||||
"epoch": 3.5789473684210527,
|
||||
"grad_norm": 5.924960221535346,
|
||||
"learning_rate": 3.4957627118644073e-06,
|
||||
"loss": 0.1126,
|
||||
"step": 425
|
||||
},
|
||||
{
|
||||
"epoch": 3.6210526315789475,
|
||||
"grad_norm": 4.746834849766813,
|
||||
"learning_rate": 3.3898305084745763e-06,
|
||||
"loss": 0.1173,
|
||||
"step": 430
|
||||
},
|
||||
{
|
||||
"epoch": 3.663157894736842,
|
||||
"grad_norm": 4.636641100831445,
|
||||
"learning_rate": 3.283898305084746e-06,
|
||||
"loss": 0.1136,
|
||||
"step": 435
|
||||
},
|
||||
{
|
||||
"epoch": 3.705263157894737,
|
||||
"grad_norm": 3.8235166072561233,
|
||||
"learning_rate": 3.1779661016949152e-06,
|
||||
"loss": 0.1103,
|
||||
"step": 440
|
||||
},
|
||||
{
|
||||
"epoch": 3.7473684210526317,
|
||||
"grad_norm": 5.689985079126845,
|
||||
"learning_rate": 3.072033898305085e-06,
|
||||
"loss": 0.1205,
|
||||
"step": 445
|
||||
},
|
||||
{
|
||||
"epoch": 3.7894736842105265,
|
||||
"grad_norm": 4.323007571024886,
|
||||
"learning_rate": 2.9661016949152545e-06,
|
||||
"loss": 0.1106,
|
||||
"step": 450
|
||||
},
|
||||
{
|
||||
"epoch": 3.831578947368421,
|
||||
"grad_norm": 4.526137345222685,
|
||||
"learning_rate": 2.860169491525424e-06,
|
||||
"loss": 0.1076,
|
||||
"step": 455
|
||||
},
|
||||
{
|
||||
"epoch": 3.873684210526316,
|
||||
"grad_norm": 3.8633371298181136,
|
||||
"learning_rate": 2.7542372881355934e-06,
|
||||
"loss": 0.1124,
|
||||
"step": 460
|
||||
},
|
||||
{
|
||||
"epoch": 3.9157894736842103,
|
||||
"grad_norm": 4.477884926304517,
|
||||
"learning_rate": 2.648305084745763e-06,
|
||||
"loss": 0.1035,
|
||||
"step": 465
|
||||
},
|
||||
{
|
||||
"epoch": 3.957894736842105,
|
||||
"grad_norm": 4.352237219667765,
|
||||
"learning_rate": 2.5423728813559323e-06,
|
||||
"loss": 0.109,
|
||||
"step": 470
|
||||
},
|
||||
{
|
||||
"epoch": 4.0,
|
||||
"grad_norm": 4.851565652375144,
|
||||
"learning_rate": 2.436440677966102e-06,
|
||||
"loss": 0.1075,
|
||||
"step": 475
|
||||
},
|
||||
{
|
||||
"epoch": 4.042105263157895,
|
||||
"grad_norm": 1.226350758570929,
|
||||
"learning_rate": 2.3305084745762712e-06,
|
||||
"loss": 0.0309,
|
||||
"step": 480
|
||||
},
|
||||
{
|
||||
"epoch": 4.08421052631579,
|
||||
"grad_norm": 2.52804331820356,
|
||||
"learning_rate": 2.2245762711864407e-06,
|
||||
"loss": 0.0225,
|
||||
"step": 485
|
||||
},
|
||||
{
|
||||
"epoch": 4.126315789473685,
|
||||
"grad_norm": 2.1045864497648235,
|
||||
"learning_rate": 2.11864406779661e-06,
|
||||
"loss": 0.0258,
|
||||
"step": 490
|
||||
},
|
||||
{
|
||||
"epoch": 4.168421052631579,
|
||||
"grad_norm": 1.8501880996749807,
|
||||
"learning_rate": 2.0127118644067796e-06,
|
||||
"loss": 0.0208,
|
||||
"step": 495
|
||||
},
|
||||
{
|
||||
"epoch": 4.2105263157894735,
|
||||
"grad_norm": 1.7462459629213352,
|
||||
"learning_rate": 1.9067796610169493e-06,
|
||||
"loss": 0.0253,
|
||||
"step": 500
|
||||
},
|
||||
{
|
||||
"epoch": 4.252631578947368,
|
||||
"grad_norm": 2.769692681231935,
|
||||
"learning_rate": 1.8008474576271187e-06,
|
||||
"loss": 0.024,
|
||||
"step": 505
|
||||
},
|
||||
{
|
||||
"epoch": 4.294736842105263,
|
||||
"grad_norm": 2.1844146550375747,
|
||||
"learning_rate": 1.6949152542372882e-06,
|
||||
"loss": 0.0237,
|
||||
"step": 510
|
||||
},
|
||||
{
|
||||
"epoch": 4.336842105263158,
|
||||
"grad_norm": 2.9011926226307443,
|
||||
"learning_rate": 1.5889830508474576e-06,
|
||||
"loss": 0.0261,
|
||||
"step": 515
|
||||
},
|
||||
{
|
||||
"epoch": 4.378947368421053,
|
||||
"grad_norm": 1.2834311898595507,
|
||||
"learning_rate": 1.4830508474576273e-06,
|
||||
"loss": 0.019,
|
||||
"step": 520
|
||||
},
|
||||
{
|
||||
"epoch": 4.421052631578947,
|
||||
"grad_norm": 1.6648114999094412,
|
||||
"learning_rate": 1.3771186440677967e-06,
|
||||
"loss": 0.02,
|
||||
"step": 525
|
||||
},
|
||||
{
|
||||
"epoch": 4.463157894736842,
|
||||
"grad_norm": 1.9849693679452145,
|
||||
"learning_rate": 1.2711864406779662e-06,
|
||||
"loss": 0.0219,
|
||||
"step": 530
|
||||
},
|
||||
{
|
||||
"epoch": 4.505263157894737,
|
||||
"grad_norm": 3.3305963220896397,
|
||||
"learning_rate": 1.1652542372881356e-06,
|
||||
"loss": 0.0206,
|
||||
"step": 535
|
||||
},
|
||||
{
|
||||
"epoch": 4.5473684210526315,
|
||||
"grad_norm": 2.311798625936221,
|
||||
"learning_rate": 1.059322033898305e-06,
|
||||
"loss": 0.024,
|
||||
"step": 540
|
||||
},
|
||||
{
|
||||
"epoch": 4.589473684210526,
|
||||
"grad_norm": 2.247474855883875,
|
||||
"learning_rate": 9.533898305084746e-07,
|
||||
"loss": 0.0206,
|
||||
"step": 545
|
||||
},
|
||||
{
|
||||
"epoch": 4.631578947368421,
|
||||
"grad_norm": 1.3852190774929651,
|
||||
"learning_rate": 8.474576271186441e-07,
|
||||
"loss": 0.0171,
|
||||
"step": 550
|
||||
},
|
||||
{
|
||||
"epoch": 4.673684210526316,
|
||||
"grad_norm": 2.057844065940414,
|
||||
"learning_rate": 7.415254237288136e-07,
|
||||
"loss": 0.0212,
|
||||
"step": 555
|
||||
},
|
||||
{
|
||||
"epoch": 4.715789473684211,
|
||||
"grad_norm": 1.6775650562869804,
|
||||
"learning_rate": 6.355932203389831e-07,
|
||||
"loss": 0.0203,
|
||||
"step": 560
|
||||
},
|
||||
{
|
||||
"epoch": 4.757894736842105,
|
||||
"grad_norm": 1.0412183276644529,
|
||||
"learning_rate": 5.296610169491525e-07,
|
||||
"loss": 0.0207,
|
||||
"step": 565
|
||||
},
|
||||
{
|
||||
"epoch": 4.8,
|
||||
"grad_norm": 1.729200767880448,
|
||||
"learning_rate": 4.2372881355932204e-07,
|
||||
"loss": 0.0169,
|
||||
"step": 570
|
||||
},
|
||||
{
|
||||
"epoch": 4.842105263157895,
|
||||
"grad_norm": 1.5343563742912298,
|
||||
"learning_rate": 3.1779661016949154e-07,
|
||||
"loss": 0.015,
|
||||
"step": 575
|
||||
},
|
||||
{
|
||||
"epoch": 4.88421052631579,
|
||||
"grad_norm": 2.574691284471041,
|
||||
"learning_rate": 2.1186440677966102e-07,
|
||||
"loss": 0.0204,
|
||||
"step": 580
|
||||
},
|
||||
{
|
||||
"epoch": 4.926315789473684,
|
||||
"grad_norm": 1.9138929482866247,
|
||||
"learning_rate": 1.0593220338983051e-07,
|
||||
"loss": 0.0224,
|
||||
"step": 585
|
||||
},
|
||||
{
|
||||
"epoch": 4.968421052631579,
|
||||
"grad_norm": 1.5037996680827372,
|
||||
"learning_rate": 0.0,
|
||||
"loss": 0.0165,
|
||||
"step": 590
|
||||
},
|
||||
{
|
||||
"epoch": 4.968421052631579,
|
||||
"step": 590,
|
||||
"total_flos": 2615373496320.0,
|
||||
"train_loss": 0.6389699679941444,
|
||||
"train_runtime": 7590.116,
|
||||
"train_samples_per_second": 2.503,
|
||||
"train_steps_per_second": 0.078
|
||||
}
|
||||
],
|
||||
"logging_steps": 5,
|
||||
"max_steps": 590,
|
||||
"num_input_tokens_seen": 0,
|
||||
"num_train_epochs": 5,
|
||||
"save_steps": 500,
|
||||
"stateful_callbacks": {
|
||||
"TrainerControl": {
|
||||
"args": {
|
||||
"should_epoch_stop": false,
|
||||
"should_evaluate": false,
|
||||
"should_log": false,
|
||||
"should_save": false,
|
||||
"should_training_stop": false
|
||||
},
|
||||
"attributes": {}
|
||||
}
|
||||
},
|
||||
"total_flos": 2615373496320.0,
|
||||
"train_batch_size": 4,
|
||||
"trial_name": null,
|
||||
"trial_params": null
|
||||
}
|
||||
3
training_args.bin
Normal file
3
training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:0f6b14715dfb4f7c8a49575464ee5852bd721d1890e161f3942938bf0436edad
|
||||
size 6904
|
||||
Reference in New Issue
Block a user