初始化项目,由ModelHub XC社区提供模型
Model: jackf857/qwen3-8b-base-sft-ultrachat-4xh200-batch-128 Source: Original Platform
This commit is contained in:
36
.gitattributes
vendored
Normal file
36
.gitattributes
vendored
Normal file
@@ -0,0 +1,36 @@
|
|||||||
|
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.model filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
tokenizer.json filter=lfs diff=lfs merge=lfs -text
|
||||||
69
README.md
Normal file
69
README.md
Normal file
@@ -0,0 +1,69 @@
|
|||||||
|
---
|
||||||
|
library_name: transformers
|
||||||
|
base_model: Qwen/Qwen3-8B-Base
|
||||||
|
tags:
|
||||||
|
- alignment-handbook
|
||||||
|
- generated_from_trainer
|
||||||
|
datasets:
|
||||||
|
- HuggingFaceH4/ultrachat_200k
|
||||||
|
model-index:
|
||||||
|
- name: qwen3-8b-base-sft-ultrachat-4xh200-batch-128-20260420-124036
|
||||||
|
results: []
|
||||||
|
---
|
||||||
|
|
||||||
|
<!-- This model card has been generated automatically according to the information the Trainer had access to. You
|
||||||
|
should probably proofread and complete it, then remove this comment. -->
|
||||||
|
|
||||||
|
# qwen3-8b-base-sft-ultrachat-4xh200-batch-128-20260420-124036
|
||||||
|
|
||||||
|
This model is a fine-tuned version of [Qwen/Qwen3-8B-Base](https://huggingface.co/Qwen/Qwen3-8B-Base) on the HuggingFaceH4/ultrachat_200k dataset.
|
||||||
|
It achieves the following results on the evaluation set:
|
||||||
|
- Loss: 1.0849
|
||||||
|
|
||||||
|
## Model description
|
||||||
|
|
||||||
|
More information needed
|
||||||
|
|
||||||
|
## Intended uses & limitations
|
||||||
|
|
||||||
|
More information needed
|
||||||
|
|
||||||
|
## Training and evaluation data
|
||||||
|
|
||||||
|
More information needed
|
||||||
|
|
||||||
|
## Training procedure
|
||||||
|
|
||||||
|
### Training hyperparameters
|
||||||
|
|
||||||
|
The following hyperparameters were used during training:
|
||||||
|
- learning_rate: 2e-05
|
||||||
|
- train_batch_size: 16
|
||||||
|
- eval_batch_size: 16
|
||||||
|
- seed: 42
|
||||||
|
- distributed_type: multi-GPU
|
||||||
|
- num_devices: 4
|
||||||
|
- gradient_accumulation_steps: 2
|
||||||
|
- total_train_batch_size: 128
|
||||||
|
- total_eval_batch_size: 64
|
||||||
|
- optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
|
||||||
|
- lr_scheduler_type: cosine
|
||||||
|
- lr_scheduler_warmup_ratio: 0.1
|
||||||
|
- num_epochs: 1
|
||||||
|
|
||||||
|
### Training results
|
||||||
|
|
||||||
|
| Training Loss | Epoch | Step | Validation Loss |
|
||||||
|
|:-------------:|:------:|:----:|:---------------:|
|
||||||
|
| 1.0891 | 0.2111 | 200 | 1.1102 |
|
||||||
|
| 1.095 | 0.4222 | 400 | 1.0990 |
|
||||||
|
| 1.0886 | 0.6332 | 600 | 1.0901 |
|
||||||
|
| 1.0856 | 0.8443 | 800 | 1.0849 |
|
||||||
|
|
||||||
|
|
||||||
|
### Framework versions
|
||||||
|
|
||||||
|
- Transformers 4.51.0
|
||||||
|
- Pytorch 2.3.1+cu121
|
||||||
|
- Datasets 2.21.0
|
||||||
|
- Tokenizers 0.21.4
|
||||||
28
added_tokens.json
Normal file
28
added_tokens.json
Normal file
@@ -0,0 +1,28 @@
|
|||||||
|
{
|
||||||
|
"</think>": 151668,
|
||||||
|
"</tool_call>": 151658,
|
||||||
|
"</tool_response>": 151666,
|
||||||
|
"<think>": 151667,
|
||||||
|
"<tool_call>": 151657,
|
||||||
|
"<tool_response>": 151665,
|
||||||
|
"<|box_end|>": 151649,
|
||||||
|
"<|box_start|>": 151648,
|
||||||
|
"<|endoftext|>": 151643,
|
||||||
|
"<|file_sep|>": 151664,
|
||||||
|
"<|fim_middle|>": 151660,
|
||||||
|
"<|fim_pad|>": 151662,
|
||||||
|
"<|fim_prefix|>": 151659,
|
||||||
|
"<|fim_suffix|>": 151661,
|
||||||
|
"<|im_end|>": 151645,
|
||||||
|
"<|im_start|>": 151644,
|
||||||
|
"<|image_pad|>": 151655,
|
||||||
|
"<|object_ref_end|>": 151647,
|
||||||
|
"<|object_ref_start|>": 151646,
|
||||||
|
"<|quad_end|>": 151651,
|
||||||
|
"<|quad_start|>": 151650,
|
||||||
|
"<|repo_name|>": 151663,
|
||||||
|
"<|video_pad|>": 151656,
|
||||||
|
"<|vision_end|>": 151653,
|
||||||
|
"<|vision_pad|>": 151654,
|
||||||
|
"<|vision_start|>": 151652
|
||||||
|
}
|
||||||
14
all_results.json
Normal file
14
all_results.json
Normal file
@@ -0,0 +1,14 @@
|
|||||||
|
{
|
||||||
|
"epoch": 0.9994722955145119,
|
||||||
|
"eval_loss": 1.084205985069275,
|
||||||
|
"eval_runtime": 268.589,
|
||||||
|
"eval_samples": 23109,
|
||||||
|
"eval_samples_per_second": 49.954,
|
||||||
|
"eval_steps_per_second": 0.782,
|
||||||
|
"total_flos": 2.8182891025525637e+18,
|
||||||
|
"train_loss": 1.100929617000608,
|
||||||
|
"train_runtime": 11309.6924,
|
||||||
|
"train_samples": 207864,
|
||||||
|
"train_samples_per_second": 10.721,
|
||||||
|
"train_steps_per_second": 0.084
|
||||||
|
}
|
||||||
30
config.json
Normal file
30
config.json
Normal file
@@ -0,0 +1,30 @@
|
|||||||
|
{
|
||||||
|
"architectures": [
|
||||||
|
"Qwen3ForCausalLM"
|
||||||
|
],
|
||||||
|
"attention_bias": false,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"bos_token_id": 151643,
|
||||||
|
"eos_token_id": 151643,
|
||||||
|
"head_dim": 128,
|
||||||
|
"hidden_act": "silu",
|
||||||
|
"hidden_size": 4096,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"intermediate_size": 12288,
|
||||||
|
"max_position_embeddings": 32768,
|
||||||
|
"max_window_layers": 36,
|
||||||
|
"model_type": "qwen3",
|
||||||
|
"num_attention_heads": 32,
|
||||||
|
"num_hidden_layers": 36,
|
||||||
|
"num_key_value_heads": 8,
|
||||||
|
"rms_norm_eps": 1e-06,
|
||||||
|
"rope_scaling": null,
|
||||||
|
"rope_theta": 1000000,
|
||||||
|
"sliding_window": null,
|
||||||
|
"tie_word_embeddings": false,
|
||||||
|
"torch_dtype": "float32",
|
||||||
|
"transformers_version": "4.51.0",
|
||||||
|
"use_cache": true,
|
||||||
|
"use_sliding_window": false,
|
||||||
|
"vocab_size": 151936
|
||||||
|
}
|
||||||
8
eval_results.json
Normal file
8
eval_results.json
Normal file
@@ -0,0 +1,8 @@
|
|||||||
|
{
|
||||||
|
"epoch": 0.9994722955145119,
|
||||||
|
"eval_loss": 1.084205985069275,
|
||||||
|
"eval_runtime": 268.589,
|
||||||
|
"eval_samples": 23109,
|
||||||
|
"eval_samples_per_second": 49.954,
|
||||||
|
"eval_steps_per_second": 0.782
|
||||||
|
}
|
||||||
6
generation_config.json
Normal file
6
generation_config.json
Normal file
@@ -0,0 +1,6 @@
|
|||||||
|
{
|
||||||
|
"bos_token_id": 151643,
|
||||||
|
"eos_token_id": 151643,
|
||||||
|
"max_new_tokens": 2048,
|
||||||
|
"transformers_version": "4.51.0"
|
||||||
|
}
|
||||||
151388
merges.txt
Normal file
151388
merges.txt
Normal file
File diff suppressed because it is too large
Load Diff
3
model-00001-of-00007.safetensors
Normal file
3
model-00001-of-00007.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:f76f1c54c6608a0d3eb2bef8c307d841b0093af4b4c363c89da6e4f2193294e4
|
||||||
|
size 4972454376
|
||||||
3
model-00002-of-00007.safetensors
Normal file
3
model-00002-of-00007.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:078e0d33058f2fe12fb85dce665c13a2b896fc00ceac85cea125071ce1cc27b1
|
||||||
|
size 4832048608
|
||||||
3
model-00003-of-00007.safetensors
Normal file
3
model-00003-of-00007.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:09b8ec82a609f105d28a2e1976dc83c44f7a8051b72a472535504aa90593912d
|
||||||
|
size 4832048656
|
||||||
3
model-00004-of-00007.safetensors
Normal file
3
model-00004-of-00007.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:c3a6edf78f5855d228458b922dd9bbbeff16aa51ece2bbd8f5bf594bce012f3d
|
||||||
|
size 4999855528
|
||||||
3
model-00005-of-00007.safetensors
Normal file
3
model-00005-of-00007.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:4625d2a7af6cd6da567f4d5646a9b87001aaa788e880aaec0019f6d9ccc41f83
|
||||||
|
size 4832048672
|
||||||
3
model-00006-of-00007.safetensors
Normal file
3
model-00006-of-00007.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:196329d5490cdaf6e3c80078b802e8f301f69ad18f2fd4f05a04c3a5c2f1a658
|
||||||
|
size 4832048672
|
||||||
3
model-00007-of-00007.safetensors
Normal file
3
model-00007-of-00007.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:cac641adcef45a28ede965972faabd970cbddc698e9b5617149fd6a2588cc6d3
|
||||||
|
size 3462482728
|
||||||
406
model.safetensors.index.json
Normal file
406
model.safetensors.index.json
Normal file
@@ -0,0 +1,406 @@
|
|||||||
|
{
|
||||||
|
"metadata": {
|
||||||
|
"total_size": 32762941440
|
||||||
|
},
|
||||||
|
"weight_map": {
|
||||||
|
"lm_head.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.embed_tokens.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.0.input_layernorm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.0.self_attn.k_norm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.0.self_attn.q_norm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.1.input_layernorm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.1.self_attn.k_norm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.1.self_attn.q_norm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.10.input_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.10.mlp.down_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.10.mlp.gate_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.10.mlp.up_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.10.post_attention_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.10.self_attn.k_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.10.self_attn.k_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.10.self_attn.o_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.10.self_attn.q_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.10.self_attn.q_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.10.self_attn.v_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.11.input_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.11.mlp.down_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.11.mlp.gate_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.11.mlp.up_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.11.post_attention_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.11.self_attn.k_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.11.self_attn.k_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.11.self_attn.o_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.11.self_attn.q_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.11.self_attn.q_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.11.self_attn.v_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.12.input_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.12.mlp.down_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.12.mlp.gate_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.12.mlp.up_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.12.post_attention_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.12.self_attn.k_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.12.self_attn.k_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.12.self_attn.o_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.12.self_attn.q_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.12.self_attn.q_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.12.self_attn.v_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.13.input_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.13.mlp.down_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.13.mlp.gate_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.13.mlp.up_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.13.post_attention_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.13.self_attn.k_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.13.self_attn.k_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.13.self_attn.o_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.13.self_attn.q_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.13.self_attn.q_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.13.self_attn.v_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.14.input_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.14.mlp.down_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.14.mlp.gate_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.14.mlp.up_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.14.post_attention_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.14.self_attn.k_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.14.self_attn.k_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.14.self_attn.o_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.14.self_attn.q_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.14.self_attn.q_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.14.self_attn.v_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.15.input_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.15.mlp.down_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.15.mlp.gate_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.15.mlp.up_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.15.post_attention_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.15.self_attn.k_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.15.self_attn.k_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.15.self_attn.o_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.15.self_attn.q_norm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.15.self_attn.q_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.15.self_attn.v_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.16.input_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.16.mlp.down_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.16.mlp.gate_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.16.mlp.up_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.16.post_attention_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.16.self_attn.k_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.16.self_attn.k_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.16.self_attn.o_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.16.self_attn.q_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.16.self_attn.q_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.16.self_attn.v_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.17.input_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.17.mlp.down_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.17.mlp.gate_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.17.mlp.up_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.17.post_attention_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.17.self_attn.k_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.17.self_attn.k_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.17.self_attn.o_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.17.self_attn.q_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.17.self_attn.q_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.17.self_attn.v_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.18.input_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.18.mlp.down_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.18.mlp.gate_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.18.mlp.up_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.18.post_attention_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.18.self_attn.k_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.18.self_attn.k_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.18.self_attn.o_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.18.self_attn.q_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.18.self_attn.q_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.18.self_attn.v_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.19.input_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.19.mlp.down_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.19.mlp.gate_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.19.mlp.up_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.19.post_attention_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.19.self_attn.k_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.19.self_attn.k_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.19.self_attn.o_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.19.self_attn.q_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.19.self_attn.q_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.19.self_attn.v_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.2.input_layernorm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.2.self_attn.k_norm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.2.self_attn.q_norm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.20.input_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.20.mlp.down_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.20.mlp.gate_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.20.mlp.up_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.20.post_attention_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.20.self_attn.k_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.20.self_attn.k_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.20.self_attn.o_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.20.self_attn.q_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.20.self_attn.q_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.20.self_attn.v_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.21.input_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.21.mlp.down_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.21.mlp.gate_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.21.mlp.up_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.21.post_attention_layernorm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.21.self_attn.k_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.21.self_attn.k_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.21.self_attn.o_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.21.self_attn.q_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.21.self_attn.q_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.21.self_attn.v_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.22.input_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.22.mlp.down_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.22.mlp.gate_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.22.mlp.up_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.22.post_attention_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.22.self_attn.k_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.22.self_attn.k_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.22.self_attn.o_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.22.self_attn.q_norm.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.22.self_attn.q_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.22.self_attn.v_proj.weight": "model-00004-of-00007.safetensors",
|
||||||
|
"model.layers.23.input_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.23.mlp.down_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.23.mlp.gate_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.23.mlp.up_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.23.post_attention_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.23.self_attn.k_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.23.self_attn.k_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.23.self_attn.o_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.23.self_attn.q_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.23.self_attn.q_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.23.self_attn.v_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.24.input_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.24.mlp.down_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.24.mlp.gate_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.24.mlp.up_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.24.post_attention_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.24.self_attn.k_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.24.self_attn.k_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.24.self_attn.o_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.24.self_attn.q_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.24.self_attn.q_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.24.self_attn.v_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.25.input_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.25.mlp.down_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.25.mlp.gate_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.25.mlp.up_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.25.post_attention_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.25.self_attn.k_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.25.self_attn.k_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.25.self_attn.o_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.25.self_attn.q_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.25.self_attn.q_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.25.self_attn.v_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.26.input_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.26.mlp.down_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.26.mlp.gate_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.26.mlp.up_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.26.post_attention_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.26.self_attn.k_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.26.self_attn.k_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.26.self_attn.o_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.26.self_attn.q_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.26.self_attn.q_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.26.self_attn.v_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.27.input_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.27.mlp.down_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.27.mlp.gate_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.27.mlp.up_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.27.post_attention_layernorm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.27.self_attn.k_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.27.self_attn.k_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.27.self_attn.o_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.27.self_attn.q_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.27.self_attn.q_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.27.self_attn.v_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.28.input_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.28.mlp.down_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.28.mlp.gate_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.28.mlp.up_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.28.post_attention_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.28.self_attn.k_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.28.self_attn.k_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.28.self_attn.o_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.28.self_attn.q_norm.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.28.self_attn.q_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.28.self_attn.v_proj.weight": "model-00005-of-00007.safetensors",
|
||||||
|
"model.layers.29.input_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.29.mlp.down_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.29.mlp.gate_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.29.mlp.up_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.29.post_attention_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.29.self_attn.k_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.29.self_attn.k_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.29.self_attn.o_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.29.self_attn.q_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.29.self_attn.q_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.29.self_attn.v_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.3.input_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.3.mlp.down_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.3.mlp.gate_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.3.mlp.up_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.3.post_attention_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.3.self_attn.k_norm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.3.self_attn.q_norm.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00007.safetensors",
|
||||||
|
"model.layers.30.input_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.30.mlp.down_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.30.mlp.gate_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.30.mlp.up_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.30.post_attention_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.30.self_attn.k_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.30.self_attn.k_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.30.self_attn.o_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.30.self_attn.q_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.30.self_attn.q_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.30.self_attn.v_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.31.input_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.31.mlp.down_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.31.mlp.gate_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.31.mlp.up_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.31.post_attention_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.31.self_attn.k_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.31.self_attn.k_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.31.self_attn.o_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.31.self_attn.q_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.31.self_attn.q_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.31.self_attn.v_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.32.input_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.32.mlp.down_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.32.mlp.gate_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.32.mlp.up_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.32.post_attention_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.32.self_attn.k_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.32.self_attn.k_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.32.self_attn.o_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.32.self_attn.q_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.32.self_attn.q_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.32.self_attn.v_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.33.input_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.33.mlp.down_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.33.mlp.gate_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.33.mlp.up_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.33.post_attention_layernorm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.33.self_attn.k_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.33.self_attn.k_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.33.self_attn.o_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.33.self_attn.q_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.33.self_attn.q_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.33.self_attn.v_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.34.input_layernorm.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.34.mlp.down_proj.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.34.mlp.gate_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.34.mlp.up_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.34.post_attention_layernorm.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.34.self_attn.k_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.34.self_attn.k_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.34.self_attn.o_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.34.self_attn.q_norm.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.34.self_attn.q_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.34.self_attn.v_proj.weight": "model-00006-of-00007.safetensors",
|
||||||
|
"model.layers.35.input_layernorm.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.35.mlp.down_proj.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.35.mlp.gate_proj.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.35.mlp.up_proj.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.35.post_attention_layernorm.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.35.self_attn.k_norm.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.35.self_attn.k_proj.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.35.self_attn.o_proj.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.35.self_attn.q_norm.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.35.self_attn.q_proj.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.35.self_attn.v_proj.weight": "model-00007-of-00007.safetensors",
|
||||||
|
"model.layers.4.input_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.4.mlp.down_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.4.mlp.gate_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.4.mlp.up_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.4.post_attention_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.4.self_attn.k_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.4.self_attn.k_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.4.self_attn.o_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.4.self_attn.q_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.4.self_attn.q_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.4.self_attn.v_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.5.input_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.5.mlp.down_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.5.mlp.gate_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.5.mlp.up_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.5.post_attention_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.5.self_attn.k_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.5.self_attn.k_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.5.self_attn.o_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.5.self_attn.q_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.5.self_attn.q_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.5.self_attn.v_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.6.input_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.6.mlp.down_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.6.mlp.gate_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.6.mlp.up_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.6.post_attention_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.6.self_attn.k_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.6.self_attn.k_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.6.self_attn.o_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.6.self_attn.q_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.6.self_attn.q_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.6.self_attn.v_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.7.input_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.7.mlp.down_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.7.mlp.gate_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.7.mlp.up_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.7.post_attention_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.7.self_attn.k_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.7.self_attn.k_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.7.self_attn.o_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.7.self_attn.q_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.7.self_attn.q_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.7.self_attn.v_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.8.input_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.8.mlp.down_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.8.mlp.gate_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.8.mlp.up_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.8.post_attention_layernorm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.8.self_attn.k_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.8.self_attn.k_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.8.self_attn.o_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.8.self_attn.q_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.8.self_attn.q_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.8.self_attn.v_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.9.input_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.9.mlp.down_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.9.mlp.gate_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.9.mlp.up_proj.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.9.post_attention_layernorm.weight": "model-00003-of-00007.safetensors",
|
||||||
|
"model.layers.9.self_attn.k_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.9.self_attn.k_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.9.self_attn.o_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.9.self_attn.q_norm.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.9.self_attn.q_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.layers.9.self_attn.v_proj.weight": "model-00002-of-00007.safetensors",
|
||||||
|
"model.norm.weight": "model-00007-of-00007.safetensors"
|
||||||
|
}
|
||||||
|
}
|
||||||
31
special_tokens_map.json
Normal file
31
special_tokens_map.json
Normal file
@@ -0,0 +1,31 @@
|
|||||||
|
{
|
||||||
|
"additional_special_tokens": [
|
||||||
|
"<|im_start|>",
|
||||||
|
"<|im_end|>",
|
||||||
|
"<|object_ref_start|>",
|
||||||
|
"<|object_ref_end|>",
|
||||||
|
"<|box_start|>",
|
||||||
|
"<|box_end|>",
|
||||||
|
"<|quad_start|>",
|
||||||
|
"<|quad_end|>",
|
||||||
|
"<|vision_start|>",
|
||||||
|
"<|vision_end|>",
|
||||||
|
"<|vision_pad|>",
|
||||||
|
"<|image_pad|>",
|
||||||
|
"<|video_pad|>"
|
||||||
|
],
|
||||||
|
"eos_token": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"pad_token": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
}
|
||||||
|
}
|
||||||
BIN
tokenizer.json
(Stored with Git LFS)
Normal file
BIN
tokenizer.json
(Stored with Git LFS)
Normal file
Binary file not shown.
240
tokenizer_config.json
Normal file
240
tokenizer_config.json
Normal file
@@ -0,0 +1,240 @@
|
|||||||
|
{
|
||||||
|
"add_bos_token": false,
|
||||||
|
"add_prefix_space": false,
|
||||||
|
"added_tokens_decoder": {
|
||||||
|
"151643": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151644": {
|
||||||
|
"content": "<|im_start|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151645": {
|
||||||
|
"content": "<|im_end|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151646": {
|
||||||
|
"content": "<|object_ref_start|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151647": {
|
||||||
|
"content": "<|object_ref_end|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151648": {
|
||||||
|
"content": "<|box_start|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151649": {
|
||||||
|
"content": "<|box_end|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151650": {
|
||||||
|
"content": "<|quad_start|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151651": {
|
||||||
|
"content": "<|quad_end|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151652": {
|
||||||
|
"content": "<|vision_start|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151653": {
|
||||||
|
"content": "<|vision_end|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151654": {
|
||||||
|
"content": "<|vision_pad|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151655": {
|
||||||
|
"content": "<|image_pad|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151656": {
|
||||||
|
"content": "<|video_pad|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"151657": {
|
||||||
|
"content": "<tool_call>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
},
|
||||||
|
"151658": {
|
||||||
|
"content": "</tool_call>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
},
|
||||||
|
"151659": {
|
||||||
|
"content": "<|fim_prefix|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
},
|
||||||
|
"151660": {
|
||||||
|
"content": "<|fim_middle|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
},
|
||||||
|
"151661": {
|
||||||
|
"content": "<|fim_suffix|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
},
|
||||||
|
"151662": {
|
||||||
|
"content": "<|fim_pad|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
},
|
||||||
|
"151663": {
|
||||||
|
"content": "<|repo_name|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
},
|
||||||
|
"151664": {
|
||||||
|
"content": "<|file_sep|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
},
|
||||||
|
"151665": {
|
||||||
|
"content": "<tool_response>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
},
|
||||||
|
"151666": {
|
||||||
|
"content": "</tool_response>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
},
|
||||||
|
"151667": {
|
||||||
|
"content": "<think>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
},
|
||||||
|
"151668": {
|
||||||
|
"content": "</think>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": false
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"additional_special_tokens": [
|
||||||
|
"<|im_start|>",
|
||||||
|
"<|im_end|>",
|
||||||
|
"<|object_ref_start|>",
|
||||||
|
"<|object_ref_end|>",
|
||||||
|
"<|box_start|>",
|
||||||
|
"<|box_end|>",
|
||||||
|
"<|quad_start|>",
|
||||||
|
"<|quad_end|>",
|
||||||
|
"<|vision_start|>",
|
||||||
|
"<|vision_end|>",
|
||||||
|
"<|vision_pad|>",
|
||||||
|
"<|image_pad|>",
|
||||||
|
"<|video_pad|>"
|
||||||
|
],
|
||||||
|
"bos_token": null,
|
||||||
|
"chat_template": "{%- if tools %}\n {{- '<|im_start|>system\\n' }}\n {%- if messages[0].role == 'system' %}\n {{- messages[0].content + '\\n\\n' }}\n {%- endif %}\n {{- \"# Tools\\n\\nYou may call one or more functions to assist with the user query.\\n\\nYou are provided with function signatures within <tools></tools> XML tags:\\n<tools>\" }}\n {%- for tool in tools %}\n {{- \"\\n\" }}\n {{- tool | tojson }}\n {%- endfor %}\n {{- \"\\n</tools>\\n\\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\\n<tool_call>\\n{\\\"name\\\": <function-name>, \\\"arguments\\\": <args-json-object>}\\n</tool_call><|im_end|>\\n\" }}\n{%- else %}\n {%- if messages[0].role == 'system' %}\n {{- '<|im_start|>system\\n' + messages[0].content + '<|im_end|>\\n' }}\n {%- endif %}\n{%- endif %}\n{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}\n{%- for message in messages[::-1] %}\n {%- set index = (messages|length - 1) - loop.index0 %}\n {%- if ns.multi_step_tool and message.role == \"user\" and not(message.content.startswith('<tool_response>') and message.content.endswith('</tool_response>')) %}\n {%- set ns.multi_step_tool = false %}\n {%- set ns.last_query_index = index %}\n {%- endif %}\n{%- endfor %}\n{%- for message in messages %}\n {%- if (message.role == \"user\") or (message.role == \"system\" and not loop.first) %}\n {{- '<|im_start|>' + message.role + '\\n' + message.content + '<|im_end|>' + '\\n' }}\n {%- elif message.role == \"assistant\" %}\n {%- set content = message.content %}\n {%- set reasoning_content = '' %}\n {%- if message.reasoning_content is defined and message.reasoning_content is not none %}\n {%- set reasoning_content = message.reasoning_content %}\n {%- else %}\n {%- if '</think>' in message.content %}\n {%- set content = message.content.split('</think>')[-1].lstrip('\\n') %}\n {%- set reasoning_content = message.content.split('</think>')[0].rstrip('\\n').split('<think>')[-1].lstrip('\\n') %}\n {%- endif %}\n {%- endif %}\n {%- if loop.index0 > ns.last_query_index %}\n {%- if loop.last or (not loop.last and reasoning_content) %}\n {{- '<|im_start|>' + message.role + '\\n<think>\\n' + reasoning_content.strip('\\n') + '\\n</think>\\n\\n' + content.lstrip('\\n') }}\n {%- else %}\n {{- '<|im_start|>' + message.role + '\\n' + content }}\n {%- endif %}\n {%- else %}\n {{- '<|im_start|>' + message.role + '\\n' + content }}\n {%- endif %}\n {%- if message.tool_calls %}\n {%- for tool_call in message.tool_calls %}\n {%- if (loop.first and content) or (not loop.first) %}\n {{- '\\n' }}\n {%- endif %}\n {%- if tool_call.function %}\n {%- set tool_call = tool_call.function %}\n {%- endif %}\n {{- '<tool_call>\\n{\"name\": \"' }}\n {{- tool_call.name }}\n {{- '\", \"arguments\": ' }}\n {%- if tool_call.arguments is string %}\n {{- tool_call.arguments }}\n {%- else %}\n {{- tool_call.arguments | tojson }}\n {%- endif %}\n {{- '}\\n</tool_call>' }}\n {%- endfor %}\n {%- endif %}\n {{- '<|im_end|>\\n' }}\n {%- elif message.role == \"tool\" %}\n {%- if loop.first or (messages[loop.index0 - 1].role != \"tool\") %}\n {{- '<|im_start|>user' }}\n {%- endif %}\n {{- '\\n<tool_response>\\n' }}\n {{- message.content }}\n {{- '\\n</tool_response>' }}\n {%- if loop.last or (messages[loop.index0 + 1].role != \"tool\") %}\n {{- '<|im_end|>\\n' }}\n {%- endif %}\n {%- endif %}\n{%- endfor %}\n{%- if add_generation_prompt %}\n {{- '<|im_start|>assistant\\n' }}\n {%- if enable_thinking is defined and enable_thinking is false %}\n {{- '<think>\\n\\n</think>\\n\\n' }}\n {%- endif %}\n{%- endif %}",
|
||||||
|
"clean_up_tokenization_spaces": false,
|
||||||
|
"eos_token": "<|endoftext|>",
|
||||||
|
"errors": "replace",
|
||||||
|
"extra_special_tokens": {},
|
||||||
|
"model_max_length": 2048,
|
||||||
|
"pad_token": "<|endoftext|>",
|
||||||
|
"split_special_tokens": false,
|
||||||
|
"tokenizer_class": "Qwen2Tokenizer",
|
||||||
|
"unk_token": null
|
||||||
|
}
|
||||||
9
train_results.json
Normal file
9
train_results.json
Normal file
@@ -0,0 +1,9 @@
|
|||||||
|
{
|
||||||
|
"epoch": 0.9994722955145119,
|
||||||
|
"total_flos": 2.8182891025525637e+18,
|
||||||
|
"train_loss": 1.100929617000608,
|
||||||
|
"train_runtime": 11309.6924,
|
||||||
|
"train_samples": 207864,
|
||||||
|
"train_samples_per_second": 10.721,
|
||||||
|
"train_steps_per_second": 0.084
|
||||||
|
}
|
||||||
740
trainer_state.json
Normal file
740
trainer_state.json
Normal file
@@ -0,0 +1,740 @@
|
|||||||
|
{
|
||||||
|
"best_global_step": null,
|
||||||
|
"best_metric": null,
|
||||||
|
"best_model_checkpoint": null,
|
||||||
|
"epoch": 0.9994722955145119,
|
||||||
|
"eval_steps": 200,
|
||||||
|
"global_step": 947,
|
||||||
|
"is_hyper_param_search": false,
|
||||||
|
"is_local_process_zero": true,
|
||||||
|
"is_world_process_zero": true,
|
||||||
|
"log_history": [
|
||||||
|
{
|
||||||
|
"epoch": 0.0010554089709762533,
|
||||||
|
"grad_norm": 4.428989887237549,
|
||||||
|
"learning_rate": 0.0,
|
||||||
|
"loss": 1.4444,
|
||||||
|
"step": 1
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.010554089709762533,
|
||||||
|
"grad_norm": 3.5337846279144287,
|
||||||
|
"learning_rate": 1.8947368421052634e-06,
|
||||||
|
"loss": 1.4272,
|
||||||
|
"step": 10
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.021108179419525065,
|
||||||
|
"grad_norm": 1.0835645198822021,
|
||||||
|
"learning_rate": 4.000000000000001e-06,
|
||||||
|
"loss": 1.3383,
|
||||||
|
"step": 20
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.0316622691292876,
|
||||||
|
"grad_norm": 1.217992901802063,
|
||||||
|
"learning_rate": 6.105263157894738e-06,
|
||||||
|
"loss": 1.2714,
|
||||||
|
"step": 30
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.04221635883905013,
|
||||||
|
"grad_norm": 1.7282902002334595,
|
||||||
|
"learning_rate": 8.210526315789475e-06,
|
||||||
|
"loss": 1.2262,
|
||||||
|
"step": 40
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.052770448548812667,
|
||||||
|
"grad_norm": 1.640160322189331,
|
||||||
|
"learning_rate": 1.0315789473684213e-05,
|
||||||
|
"loss": 1.1945,
|
||||||
|
"step": 50
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.0633245382585752,
|
||||||
|
"grad_norm": 1.4558825492858887,
|
||||||
|
"learning_rate": 1.2421052631578949e-05,
|
||||||
|
"loss": 1.1686,
|
||||||
|
"step": 60
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.07387862796833773,
|
||||||
|
"grad_norm": 1.016249656677246,
|
||||||
|
"learning_rate": 1.4526315789473687e-05,
|
||||||
|
"loss": 1.1422,
|
||||||
|
"step": 70
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.08443271767810026,
|
||||||
|
"grad_norm": 0.7121432423591614,
|
||||||
|
"learning_rate": 1.6631578947368423e-05,
|
||||||
|
"loss": 1.1314,
|
||||||
|
"step": 80
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.09498680738786279,
|
||||||
|
"grad_norm": 0.7841984033584595,
|
||||||
|
"learning_rate": 1.873684210526316e-05,
|
||||||
|
"loss": 1.1275,
|
||||||
|
"step": 90
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.10554089709762533,
|
||||||
|
"grad_norm": 0.6388397216796875,
|
||||||
|
"learning_rate": 1.999891231617599e-05,
|
||||||
|
"loss": 1.1178,
|
||||||
|
"step": 100
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.11609498680738786,
|
||||||
|
"grad_norm": 0.5346229076385498,
|
||||||
|
"learning_rate": 1.9986678590325273e-05,
|
||||||
|
"loss": 1.1205,
|
||||||
|
"step": 110
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.1266490765171504,
|
||||||
|
"grad_norm": 0.6061886548995972,
|
||||||
|
"learning_rate": 1.996086822074945e-05,
|
||||||
|
"loss": 1.1135,
|
||||||
|
"step": 120
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.13720316622691292,
|
||||||
|
"grad_norm": 0.5429868698120117,
|
||||||
|
"learning_rate": 1.9921516296010645e-05,
|
||||||
|
"loss": 1.1072,
|
||||||
|
"step": 130
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.14775725593667546,
|
||||||
|
"grad_norm": 0.5146633386611938,
|
||||||
|
"learning_rate": 1.9868676314081907e-05,
|
||||||
|
"loss": 1.0997,
|
||||||
|
"step": 140
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.158311345646438,
|
||||||
|
"grad_norm": 0.5138978362083435,
|
||||||
|
"learning_rate": 1.980242010961803e-05,
|
||||||
|
"loss": 1.0973,
|
||||||
|
"step": 150
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.16886543535620052,
|
||||||
|
"grad_norm": 0.48871827125549316,
|
||||||
|
"learning_rate": 1.9722837756298112e-05,
|
||||||
|
"loss": 1.1089,
|
||||||
|
"step": 160
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.17941952506596306,
|
||||||
|
"grad_norm": 0.5564476251602173,
|
||||||
|
"learning_rate": 1.96300374443726e-05,
|
||||||
|
"loss": 1.0914,
|
||||||
|
"step": 170
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.18997361477572558,
|
||||||
|
"grad_norm": 0.48119252920150757,
|
||||||
|
"learning_rate": 1.9524145333581315e-05,
|
||||||
|
"loss": 1.1018,
|
||||||
|
"step": 180
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.20052770448548812,
|
||||||
|
"grad_norm": 0.45517972111701965,
|
||||||
|
"learning_rate": 1.9405305381642376e-05,
|
||||||
|
"loss": 1.0982,
|
||||||
|
"step": 190
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.21108179419525067,
|
||||||
|
"grad_norm": 0.47854238748550415,
|
||||||
|
"learning_rate": 1.9273679148545246e-05,
|
||||||
|
"loss": 1.0891,
|
||||||
|
"step": 200
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.21108179419525067,
|
||||||
|
"eval_loss": 1.11018705368042,
|
||||||
|
"eval_runtime": 269.0491,
|
||||||
|
"eval_samples_per_second": 49.868,
|
||||||
|
"eval_steps_per_second": 0.781,
|
||||||
|
"step": 200
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.22163588390501318,
|
||||||
|
"grad_norm": 0.43568843603134155,
|
||||||
|
"learning_rate": 1.9129445576913886e-05,
|
||||||
|
"loss": 1.0998,
|
||||||
|
"step": 210
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.23218997361477572,
|
||||||
|
"grad_norm": 0.4271477162837982,
|
||||||
|
"learning_rate": 1.897280074873868e-05,
|
||||||
|
"loss": 1.1231,
|
||||||
|
"step": 220
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.24274406332453827,
|
||||||
|
"grad_norm": 0.44812774658203125,
|
||||||
|
"learning_rate": 1.8803957618807764e-05,
|
||||||
|
"loss": 1.1038,
|
||||||
|
"step": 230
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.2532981530343008,
|
||||||
|
"grad_norm": 0.4037184417247772,
|
||||||
|
"learning_rate": 1.862314572520028e-05,
|
||||||
|
"loss": 1.1104,
|
||||||
|
"step": 240
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.2638522427440633,
|
||||||
|
"grad_norm": 0.44267192482948303,
|
||||||
|
"learning_rate": 1.843061087723496e-05,
|
||||||
|
"loss": 1.0939,
|
||||||
|
"step": 250
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.27440633245382584,
|
||||||
|
"grad_norm": 0.44187697768211365,
|
||||||
|
"learning_rate": 1.8226614821298444e-05,
|
||||||
|
"loss": 1.1081,
|
||||||
|
"step": 260
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.2849604221635884,
|
||||||
|
"grad_norm": 0.41764840483665466,
|
||||||
|
"learning_rate": 1.8011434885007482e-05,
|
||||||
|
"loss": 1.0985,
|
||||||
|
"step": 270
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.2955145118733509,
|
||||||
|
"grad_norm": 0.3874802589416504,
|
||||||
|
"learning_rate": 1.7785363600188894e-05,
|
||||||
|
"loss": 1.1005,
|
||||||
|
"step": 280
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.30606860158311344,
|
||||||
|
"grad_norm": 0.3772076666355133,
|
||||||
|
"learning_rate": 1.7548708305189724e-05,
|
||||||
|
"loss": 1.09,
|
||||||
|
"step": 290
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.316622691292876,
|
||||||
|
"grad_norm": 0.4143645167350769,
|
||||||
|
"learning_rate": 1.7301790727058344e-05,
|
||||||
|
"loss": 1.0849,
|
||||||
|
"step": 300
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.32717678100263853,
|
||||||
|
"grad_norm": 0.43071797490119934,
|
||||||
|
"learning_rate": 1.7044946544164434e-05,
|
||||||
|
"loss": 1.0956,
|
||||||
|
"step": 310
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.33773087071240104,
|
||||||
|
"grad_norm": 0.3988950252532959,
|
||||||
|
"learning_rate": 1.6778524929852513e-05,
|
||||||
|
"loss": 1.1042,
|
||||||
|
"step": 320
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.3482849604221636,
|
||||||
|
"grad_norm": 0.40434718132019043,
|
||||||
|
"learning_rate": 1.650288807774937e-05,
|
||||||
|
"loss": 1.0978,
|
||||||
|
"step": 330
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.35883905013192613,
|
||||||
|
"grad_norm": 0.41674408316612244,
|
||||||
|
"learning_rate": 1.6218410709370735e-05,
|
||||||
|
"loss": 1.0914,
|
||||||
|
"step": 340
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.36939313984168864,
|
||||||
|
"grad_norm": 0.395465224981308,
|
||||||
|
"learning_rate": 1.592547956469662e-05,
|
||||||
|
"loss": 1.1126,
|
||||||
|
"step": 350
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.37994722955145116,
|
||||||
|
"grad_norm": 0.3750782608985901,
|
||||||
|
"learning_rate": 1.562449287640781e-05,
|
||||||
|
"loss": 1.099,
|
||||||
|
"step": 360
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.39050131926121373,
|
||||||
|
"grad_norm": 0.3862684369087219,
|
||||||
|
"learning_rate": 1.5315859828498353e-05,
|
||||||
|
"loss": 1.0933,
|
||||||
|
"step": 370
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.40105540897097625,
|
||||||
|
"grad_norm": 0.40379074215888977,
|
||||||
|
"learning_rate": 1.5000000000000002e-05,
|
||||||
|
"loss": 1.0905,
|
||||||
|
"step": 380
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.41160949868073876,
|
||||||
|
"grad_norm": 0.3791244328022003,
|
||||||
|
"learning_rate": 1.4677342794574819e-05,
|
||||||
|
"loss": 1.0835,
|
||||||
|
"step": 390
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.42216358839050133,
|
||||||
|
"grad_norm": 0.36901775002479553,
|
||||||
|
"learning_rate": 1.4348326856751496e-05,
|
||||||
|
"loss": 1.095,
|
||||||
|
"step": 400
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.42216358839050133,
|
||||||
|
"eval_loss": 1.0990158319473267,
|
||||||
|
"eval_runtime": 269.2071,
|
||||||
|
"eval_samples_per_second": 49.839,
|
||||||
|
"eval_steps_per_second": 0.78,
|
||||||
|
"step": 400
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.43271767810026385,
|
||||||
|
"grad_norm": 0.38086214661598206,
|
||||||
|
"learning_rate": 1.401339947559889e-05,
|
||||||
|
"loss": 1.1001,
|
||||||
|
"step": 410
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.44327176781002636,
|
||||||
|
"grad_norm": 0.42641252279281616,
|
||||||
|
"learning_rate": 1.367301597664757e-05,
|
||||||
|
"loss": 1.085,
|
||||||
|
"step": 420
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.45382585751978893,
|
||||||
|
"grad_norm": 0.37229016423225403,
|
||||||
|
"learning_rate": 1.3327639102885939e-05,
|
||||||
|
"loss": 1.0852,
|
||||||
|
"step": 430
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.46437994722955145,
|
||||||
|
"grad_norm": 0.38543465733528137,
|
||||||
|
"learning_rate": 1.2977738385672558e-05,
|
||||||
|
"loss": 1.0982,
|
||||||
|
"step": 440
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.47493403693931396,
|
||||||
|
"grad_norm": 0.36999842524528503,
|
||||||
|
"learning_rate": 1.2623789506419792e-05,
|
||||||
|
"loss": 1.0844,
|
||||||
|
"step": 450
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.48548812664907653,
|
||||||
|
"grad_norm": 0.3730550706386566,
|
||||||
|
"learning_rate": 1.2266273649916669e-05,
|
||||||
|
"loss": 1.0838,
|
||||||
|
"step": 460
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.49604221635883905,
|
||||||
|
"grad_norm": 0.35631632804870605,
|
||||||
|
"learning_rate": 1.190567685016998e-05,
|
||||||
|
"loss": 1.076,
|
||||||
|
"step": 470
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5065963060686016,
|
||||||
|
"grad_norm": 0.3838544487953186,
|
||||||
|
"learning_rate": 1.1542489329653024e-05,
|
||||||
|
"loss": 1.0831,
|
||||||
|
"step": 480
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5171503957783641,
|
||||||
|
"grad_norm": 0.40018004179000854,
|
||||||
|
"learning_rate": 1.1177204832860214e-05,
|
||||||
|
"loss": 1.0813,
|
||||||
|
"step": 490
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5277044854881267,
|
||||||
|
"grad_norm": 0.3892735540866852,
|
||||||
|
"learning_rate": 1.08103199550736e-05,
|
||||||
|
"loss": 1.0909,
|
||||||
|
"step": 500
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5382585751978892,
|
||||||
|
"grad_norm": 0.42785775661468506,
|
||||||
|
"learning_rate": 1.044233346725379e-05,
|
||||||
|
"loss": 1.0827,
|
||||||
|
"step": 510
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5488126649076517,
|
||||||
|
"grad_norm": 0.37400808930397034,
|
||||||
|
"learning_rate": 1.0073745637973125e-05,
|
||||||
|
"loss": 1.0896,
|
||||||
|
"step": 520
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5593667546174143,
|
||||||
|
"grad_norm": 0.38293296098709106,
|
||||||
|
"learning_rate": 9.705057553312857e-06,
|
||||||
|
"loss": 1.0847,
|
||||||
|
"step": 530
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5699208443271768,
|
||||||
|
"grad_norm": 0.39219433069229126,
|
||||||
|
"learning_rate": 9.336770435648963e-06,
|
||||||
|
"loss": 1.0833,
|
||||||
|
"step": 540
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5804749340369393,
|
||||||
|
"grad_norm": 0.3722192645072937,
|
||||||
|
"learning_rate": 8.969384962252646e-06,
|
||||||
|
"loss": 1.0823,
|
||||||
|
"step": 550
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.5910290237467019,
|
||||||
|
"grad_norm": 0.4041948914527893,
|
||||||
|
"learning_rate": 8.60340058463194e-06,
|
||||||
|
"loss": 1.0733,
|
||||||
|
"step": 560
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6015831134564644,
|
||||||
|
"grad_norm": 0.36892595887184143,
|
||||||
|
"learning_rate": 8.239314849539639e-06,
|
||||||
|
"loss": 1.0618,
|
||||||
|
"step": 570
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6121372031662269,
|
||||||
|
"grad_norm": 0.3803699314594269,
|
||||||
|
"learning_rate": 7.877622722570772e-06,
|
||||||
|
"loss": 1.0896,
|
||||||
|
"step": 580
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6226912928759895,
|
||||||
|
"grad_norm": 0.3644523620605469,
|
||||||
|
"learning_rate": 7.518815915269025e-06,
|
||||||
|
"loss": 1.0819,
|
||||||
|
"step": 590
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.633245382585752,
|
||||||
|
"grad_norm": 0.3542793095111847,
|
||||||
|
"learning_rate": 7.163382216657033e-06,
|
||||||
|
"loss": 1.0886,
|
||||||
|
"step": 600
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.633245382585752,
|
||||||
|
"eval_loss": 1.090126872062683,
|
||||||
|
"eval_runtime": 268.9072,
|
||||||
|
"eval_samples_per_second": 49.895,
|
||||||
|
"eval_steps_per_second": 0.781,
|
||||||
|
"step": 600
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6437994722955145,
|
||||||
|
"grad_norm": 0.3555884063243866,
|
||||||
|
"learning_rate": 6.811804830099186e-06,
|
||||||
|
"loss": 1.0655,
|
||||||
|
"step": 610
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6543535620052771,
|
||||||
|
"grad_norm": 0.3567143380641937,
|
||||||
|
"learning_rate": 6.464561716398565e-06,
|
||||||
|
"loss": 1.078,
|
||||||
|
"step": 620
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6649076517150396,
|
||||||
|
"grad_norm": 0.3770051598548889,
|
||||||
|
"learning_rate": 6.122124944020978e-06,
|
||||||
|
"loss": 1.0836,
|
||||||
|
"step": 630
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6754617414248021,
|
||||||
|
"grad_norm": 0.352397084236145,
|
||||||
|
"learning_rate": 5.78496004732952e-06,
|
||||||
|
"loss": 1.0719,
|
||||||
|
"step": 640
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6860158311345647,
|
||||||
|
"grad_norm": 0.3588451147079468,
|
||||||
|
"learning_rate": 5.453525393702053e-06,
|
||||||
|
"loss": 1.0849,
|
||||||
|
"step": 650
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.6965699208443272,
|
||||||
|
"grad_norm": 0.40011218190193176,
|
||||||
|
"learning_rate": 5.128271560392037e-06,
|
||||||
|
"loss": 1.082,
|
||||||
|
"step": 660
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7071240105540897,
|
||||||
|
"grad_norm": 0.34496238827705383,
|
||||||
|
"learning_rate": 4.809640721979856e-06,
|
||||||
|
"loss": 1.077,
|
||||||
|
"step": 670
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7176781002638523,
|
||||||
|
"grad_norm": 0.38083967566490173,
|
||||||
|
"learning_rate": 4.498066049247344e-06,
|
||||||
|
"loss": 1.0639,
|
||||||
|
"step": 680
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7282321899736148,
|
||||||
|
"grad_norm": 0.3846307098865509,
|
||||||
|
"learning_rate": 4.193971120292793e-06,
|
||||||
|
"loss": 1.0778,
|
||||||
|
"step": 690
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7387862796833773,
|
||||||
|
"grad_norm": 0.33913660049438477,
|
||||||
|
"learning_rate": 3.897769344686929e-06,
|
||||||
|
"loss": 1.0952,
|
||||||
|
"step": 700
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7493403693931399,
|
||||||
|
"grad_norm": 0.3537193536758423,
|
||||||
|
"learning_rate": 3.6098634014527866e-06,
|
||||||
|
"loss": 1.0853,
|
||||||
|
"step": 710
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7598944591029023,
|
||||||
|
"grad_norm": 0.3514321446418762,
|
||||||
|
"learning_rate": 3.330644691633492e-06,
|
||||||
|
"loss": 1.0786,
|
||||||
|
"step": 720
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7704485488126649,
|
||||||
|
"grad_norm": 0.34657713770866394,
|
||||||
|
"learning_rate": 3.0604928061921847e-06,
|
||||||
|
"loss": 1.0609,
|
||||||
|
"step": 730
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7810026385224275,
|
||||||
|
"grad_norm": 0.34931546449661255,
|
||||||
|
"learning_rate": 2.7997750099674282e-06,
|
||||||
|
"loss": 1.0845,
|
||||||
|
"step": 740
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7915567282321899,
|
||||||
|
"grad_norm": 0.3565938174724579,
|
||||||
|
"learning_rate": 2.548845742385717e-06,
|
||||||
|
"loss": 1.0762,
|
||||||
|
"step": 750
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8021108179419525,
|
||||||
|
"grad_norm": 0.36780357360839844,
|
||||||
|
"learning_rate": 2.3080461356097938e-06,
|
||||||
|
"loss": 1.0719,
|
||||||
|
"step": 760
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8126649076517151,
|
||||||
|
"grad_norm": 0.3430708348751068,
|
||||||
|
"learning_rate": 2.077703550777882e-06,
|
||||||
|
"loss": 1.0945,
|
||||||
|
"step": 770
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8232189973614775,
|
||||||
|
"grad_norm": 0.361824631690979,
|
||||||
|
"learning_rate": 1.8581311329642592e-06,
|
||||||
|
"loss": 1.0916,
|
||||||
|
"step": 780
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8337730870712401,
|
||||||
|
"grad_norm": 0.3385472893714905,
|
||||||
|
"learning_rate": 1.6496273854662482e-06,
|
||||||
|
"loss": 1.084,
|
||||||
|
"step": 790
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8443271767810027,
|
||||||
|
"grad_norm": 0.3720723092556,
|
||||||
|
"learning_rate": 1.452475763996326e-06,
|
||||||
|
"loss": 1.0856,
|
||||||
|
"step": 800
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8443271767810027,
|
||||||
|
"eval_loss": 1.0849097967147827,
|
||||||
|
"eval_runtime": 268.3585,
|
||||||
|
"eval_samples_per_second": 49.997,
|
||||||
|
"eval_steps_per_second": 0.783,
|
||||||
|
"step": 800
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8548812664907651,
|
||||||
|
"grad_norm": 0.3724263906478882,
|
||||||
|
"learning_rate": 1.2669442913310725e-06,
|
||||||
|
"loss": 1.0773,
|
||||||
|
"step": 810
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8654353562005277,
|
||||||
|
"grad_norm": 0.38541847467422485,
|
||||||
|
"learning_rate": 1.0932851929407828e-06,
|
||||||
|
"loss": 1.0793,
|
||||||
|
"step": 820
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8759894459102903,
|
||||||
|
"grad_norm": 0.3606375753879547,
|
||||||
|
"learning_rate": 9.31734554095165e-07,
|
||||||
|
"loss": 1.0976,
|
||||||
|
"step": 830
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8865435356200527,
|
||||||
|
"grad_norm": 0.34657078981399536,
|
||||||
|
"learning_rate": 7.825119989112173e-07,
|
||||||
|
"loss": 1.0815,
|
||||||
|
"step": 840
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8970976253298153,
|
||||||
|
"grad_norm": 0.34550759196281433,
|
||||||
|
"learning_rate": 6.458203917796546e-07,
|
||||||
|
"loss": 1.0883,
|
||||||
|
"step": 850
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9076517150395779,
|
||||||
|
"grad_norm": 0.34100624918937683,
|
||||||
|
"learning_rate": 5.218455615757601e-07,
|
||||||
|
"loss": 1.0781,
|
||||||
|
"step": 860
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9182058047493403,
|
||||||
|
"grad_norm": 0.336028516292572,
|
||||||
|
"learning_rate": 4.107560490295992e-07,
|
||||||
|
"loss": 1.0716,
|
||||||
|
"step": 870
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9287598944591029,
|
||||||
|
"grad_norm": 0.35316023230552673,
|
||||||
|
"learning_rate": 3.127028775990515e-07,
|
||||||
|
"loss": 1.0755,
|
||||||
|
"step": 880
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9393139841688655,
|
||||||
|
"grad_norm": 0.3301040232181549,
|
||||||
|
"learning_rate": 2.2781934815713224e-07,
|
||||||
|
"loss": 1.0718,
|
||||||
|
"step": 890
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9498680738786279,
|
||||||
|
"grad_norm": 0.3545936048030853,
|
||||||
|
"learning_rate": 1.562208577727442e-07,
|
||||||
|
"loss": 1.0812,
|
||||||
|
"step": 900
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9604221635883905,
|
||||||
|
"grad_norm": 0.3564644455909729,
|
||||||
|
"learning_rate": 9.800474283119143e-08,
|
||||||
|
"loss": 1.0775,
|
||||||
|
"step": 910
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9709762532981531,
|
||||||
|
"grad_norm": 0.34894269704818726,
|
||||||
|
"learning_rate": 5.325014670776951e-08,
|
||||||
|
"loss": 1.0694,
|
||||||
|
"step": 920
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9815303430079155,
|
||||||
|
"grad_norm": 0.3846621811389923,
|
||||||
|
"learning_rate": 2.201791217428917e-08,
|
||||||
|
"loss": 1.0691,
|
||||||
|
"step": 930
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9920844327176781,
|
||||||
|
"grad_norm": 0.3404500186443329,
|
||||||
|
"learning_rate": 4.3504986848297295e-09,
|
||||||
|
"loss": 1.0701,
|
||||||
|
"step": 940
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9994722955145119,
|
||||||
|
"step": 947,
|
||||||
|
"total_flos": 2.8182891025525637e+18,
|
||||||
|
"train_loss": 1.100929617000608,
|
||||||
|
"train_runtime": 11309.6924,
|
||||||
|
"train_samples_per_second": 10.721,
|
||||||
|
"train_steps_per_second": 0.084
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"logging_steps": 10,
|
||||||
|
"max_steps": 947,
|
||||||
|
"num_input_tokens_seen": 0,
|
||||||
|
"num_train_epochs": 1,
|
||||||
|
"save_steps": 200,
|
||||||
|
"stateful_callbacks": {
|
||||||
|
"TrainerControl": {
|
||||||
|
"args": {
|
||||||
|
"should_epoch_stop": false,
|
||||||
|
"should_evaluate": false,
|
||||||
|
"should_log": false,
|
||||||
|
"should_save": true,
|
||||||
|
"should_training_stop": true
|
||||||
|
},
|
||||||
|
"attributes": {}
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"total_flos": 2.8182891025525637e+18,
|
||||||
|
"train_batch_size": 16,
|
||||||
|
"trial_name": null,
|
||||||
|
"trial_params": null
|
||||||
|
}
|
||||||
1
vocab.json
Normal file
1
vocab.json
Normal file
File diff suppressed because one or more lines are too long
Reference in New Issue
Block a user