初始化项目,由ModelHub XC社区提供模型
Model: devika-tiwari/gpt2_small_expandedbabyLM_100M_exp3_conj_ratio_0p50_mix_0p25_44 Source: Original Platform
This commit is contained in:
35
.gitattributes
vendored
Normal file
35
.gitattributes
vendored
Normal file
@@ -0,0 +1,35 @@
|
||||
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||
*.model filter=lfs diff=lfs merge=lfs -text
|
||||
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
1
.gitignore
vendored
Normal file
1
.gitignore
vendored
Normal file
@@ -0,0 +1 @@
|
||||
checkpoint-*/
|
||||
62
README.md
Normal file
62
README.md
Normal file
@@ -0,0 +1,62 @@
|
||||
---
|
||||
tags:
|
||||
- generated_from_trainer
|
||||
model-index:
|
||||
- name: gpt2_small_expandedbabyLM_100M_exp3_conj_ratio_0p50_mix_0p25_44
|
||||
results: []
|
||||
---
|
||||
|
||||
<!-- This model card has been generated automatically according to the information the Trainer had access to. You
|
||||
should probably proofread and complete it, then remove this comment. -->
|
||||
|
||||
# gpt2_small_expandedbabyLM_100M_exp3_conj_ratio_0p50_mix_0p25_44
|
||||
|
||||
This model is a fine-tuned version of [](https://huggingface.co/) on an unknown dataset.
|
||||
It achieves the following results on the evaluation set:
|
||||
- Loss: 3.6381
|
||||
|
||||
## Model description
|
||||
|
||||
More information needed
|
||||
|
||||
## Intended uses & limitations
|
||||
|
||||
More information needed
|
||||
|
||||
## Training and evaluation data
|
||||
|
||||
More information needed
|
||||
|
||||
## Training procedure
|
||||
|
||||
### Training hyperparameters
|
||||
|
||||
The following hyperparameters were used during training:
|
||||
- learning_rate: 0.0001
|
||||
- train_batch_size: 256
|
||||
- eval_batch_size: 256
|
||||
- seed: 44
|
||||
- optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
|
||||
- lr_scheduler_type: linear
|
||||
- lr_scheduler_warmup_steps: 4000
|
||||
- num_epochs: 20
|
||||
|
||||
### Training results
|
||||
|
||||
| Training Loss | Epoch | Step | Validation Loss |
|
||||
|:-------------:|:-----:|:-----:|:---------------:|
|
||||
| 3.6708 | 1.0 | 4328 | 4.3745 |
|
||||
| 3.3094 | 2.0 | 8656 | 3.8184 |
|
||||
| 3.1753 | 3.0 | 12984 | 3.7183 |
|
||||
| 3.0931 | 4.0 | 17312 | 3.6381 |
|
||||
| 3.0391 | 5.0 | 21640 | 3.6747 |
|
||||
| 2.9887 | 6.0 | 25968 | 3.6645 |
|
||||
| 2.9551 | 7.0 | 30296 | 3.7202 |
|
||||
|
||||
|
||||
### Framework versions
|
||||
|
||||
- Transformers 4.30.2
|
||||
- Pytorch 2.11.0+cu130
|
||||
- Datasets 4.1.1
|
||||
- Tokenizers 0.13.3
|
||||
14
all_results.json
Normal file
14
all_results.json
Normal file
@@ -0,0 +1,14 @@
|
||||
{
|
||||
"epoch": 7.0,
|
||||
"eval_loss": 3.638052463531494,
|
||||
"eval_runtime": 70.018,
|
||||
"eval_samples": 144585,
|
||||
"eval_samples_per_second": 2064.97,
|
||||
"eval_steps_per_second": 8.069,
|
||||
"perplexity": 38.01772367658188,
|
||||
"train_loss": 3.3377098091554602,
|
||||
"train_runtime": 10454.0455,
|
||||
"train_samples": 1107930,
|
||||
"train_samples_per_second": 2119.62,
|
||||
"train_steps_per_second": 8.28
|
||||
}
|
||||
31
config.json
Normal file
31
config.json
Normal file
@@ -0,0 +1,31 @@
|
||||
{
|
||||
"activation_function": "gelu_new",
|
||||
"architectures": [
|
||||
"GPT2LMHeadModel"
|
||||
],
|
||||
"attn_pdrop": 0.1,
|
||||
"bos_token_id": 50256,
|
||||
"embd_pdrop": 0.1,
|
||||
"eos_token_id": 50256,
|
||||
"initializer_range": 0.02,
|
||||
"layer_norm_epsilon": 1e-05,
|
||||
"model_type": "gpt2",
|
||||
"n_embd": 768,
|
||||
"n_head": 12,
|
||||
"n_inner": null,
|
||||
"n_layer": 12,
|
||||
"n_positions": 1024,
|
||||
"reorder_and_upcast_attn": false,
|
||||
"resid_pdrop": 0.1,
|
||||
"scale_attn_by_inverse_layer_idx": false,
|
||||
"scale_attn_weights": true,
|
||||
"summary_activation": null,
|
||||
"summary_first_dropout": 0.1,
|
||||
"summary_proj_to_labels": true,
|
||||
"summary_type": "cls_index",
|
||||
"summary_use_proj": true,
|
||||
"torch_dtype": "float32",
|
||||
"transformers_version": "4.30.2",
|
||||
"use_cache": true,
|
||||
"vocab_size": 50257
|
||||
}
|
||||
9
eval_results.json
Normal file
9
eval_results.json
Normal file
@@ -0,0 +1,9 @@
|
||||
{
|
||||
"epoch": 7.0,
|
||||
"eval_loss": 3.638052463531494,
|
||||
"eval_runtime": 70.018,
|
||||
"eval_samples": 144585,
|
||||
"eval_samples_per_second": 2064.97,
|
||||
"eval_steps_per_second": 8.069,
|
||||
"perplexity": 38.01772367658188
|
||||
}
|
||||
6
generation_config.json
Normal file
6
generation_config.json
Normal file
@@ -0,0 +1,6 @@
|
||||
{
|
||||
"_from_model_config": true,
|
||||
"bos_token_id": 50256,
|
||||
"eos_token_id": 50256,
|
||||
"transformers_version": "4.30.2"
|
||||
}
|
||||
50001
merges.txt
Normal file
50001
merges.txt
Normal file
File diff suppressed because it is too large
Load Diff
3
pytorch_model.bin
Normal file
3
pytorch_model.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:57fb9b6e8fd323deeccca3f7f43422520fb85bc97aee3878792bcac1e9d27e2d
|
||||
size 497808115
|
||||
5
special_tokens_map.json
Normal file
5
special_tokens_map.json
Normal file
@@ -0,0 +1,5 @@
|
||||
{
|
||||
"bos_token": "<|endoftext|>",
|
||||
"eos_token": "<|endoftext|>",
|
||||
"unk_token": "<|endoftext|>"
|
||||
}
|
||||
100305
tokenizer.json
Normal file
100305
tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
10
tokenizer_config.json
Normal file
10
tokenizer_config.json
Normal file
@@ -0,0 +1,10 @@
|
||||
{
|
||||
"add_prefix_space": false,
|
||||
"bos_token": "<|endoftext|>",
|
||||
"clean_up_tokenization_spaces": true,
|
||||
"eos_token": "<|endoftext|>",
|
||||
"model_max_length": 1024,
|
||||
"token": null,
|
||||
"tokenizer_class": "GPT2Tokenizer",
|
||||
"unk_token": "<|endoftext|>"
|
||||
}
|
||||
8
train_results.json
Normal file
8
train_results.json
Normal file
@@ -0,0 +1,8 @@
|
||||
{
|
||||
"epoch": 7.0,
|
||||
"train_loss": 3.3377098091554602,
|
||||
"train_runtime": 10454.0455,
|
||||
"train_samples": 1107930,
|
||||
"train_samples_per_second": 2119.62,
|
||||
"train_steps_per_second": 8.28
|
||||
}
|
||||
987
trainer_state.json
Normal file
987
trainer_state.json
Normal file
@@ -0,0 +1,987 @@
|
||||
{
|
||||
"best_metric": 3.638052463531494,
|
||||
"best_model_checkpoint": "/scratch/dt719/causal_lm_training/models/gpt2_small_expandedbabyLM_100M_exp3_conj_ratio_0p50_mix_0p25_44/checkpoint-17312",
|
||||
"epoch": 7.0,
|
||||
"global_step": 30296,
|
||||
"is_hyper_param_search": false,
|
||||
"is_local_process_zero": true,
|
||||
"is_world_process_zero": true,
|
||||
"log_history": [
|
||||
{
|
||||
"epoch": 0.05,
|
||||
"learning_rate": 5e-06,
|
||||
"loss": 8.8066,
|
||||
"step": 200
|
||||
},
|
||||
{
|
||||
"epoch": 0.09,
|
||||
"learning_rate": 1e-05,
|
||||
"loss": 6.9962,
|
||||
"step": 400
|
||||
},
|
||||
{
|
||||
"epoch": 0.14,
|
||||
"learning_rate": 1.5e-05,
|
||||
"loss": 5.9242,
|
||||
"step": 600
|
||||
},
|
||||
{
|
||||
"epoch": 0.18,
|
||||
"learning_rate": 2e-05,
|
||||
"loss": 5.3728,
|
||||
"step": 800
|
||||
},
|
||||
{
|
||||
"epoch": 0.23,
|
||||
"learning_rate": 2.5e-05,
|
||||
"loss": 5.0667,
|
||||
"step": 1000
|
||||
},
|
||||
{
|
||||
"epoch": 0.28,
|
||||
"learning_rate": 3e-05,
|
||||
"loss": 4.8352,
|
||||
"step": 1200
|
||||
},
|
||||
{
|
||||
"epoch": 0.32,
|
||||
"learning_rate": 3.5e-05,
|
||||
"loss": 4.6462,
|
||||
"step": 1400
|
||||
},
|
||||
{
|
||||
"epoch": 0.37,
|
||||
"learning_rate": 4e-05,
|
||||
"loss": 4.5149,
|
||||
"step": 1600
|
||||
},
|
||||
{
|
||||
"epoch": 0.42,
|
||||
"learning_rate": 4.5e-05,
|
||||
"loss": 4.3926,
|
||||
"step": 1800
|
||||
},
|
||||
{
|
||||
"epoch": 0.46,
|
||||
"learning_rate": 5e-05,
|
||||
"loss": 4.2811,
|
||||
"step": 2000
|
||||
},
|
||||
{
|
||||
"epoch": 0.51,
|
||||
"learning_rate": 5.500000000000001e-05,
|
||||
"loss": 4.1934,
|
||||
"step": 2200
|
||||
},
|
||||
{
|
||||
"epoch": 0.55,
|
||||
"learning_rate": 6e-05,
|
||||
"loss": 4.1181,
|
||||
"step": 2400
|
||||
},
|
||||
{
|
||||
"epoch": 0.6,
|
||||
"learning_rate": 6.500000000000001e-05,
|
||||
"loss": 4.045,
|
||||
"step": 2600
|
||||
},
|
||||
{
|
||||
"epoch": 0.65,
|
||||
"learning_rate": 7e-05,
|
||||
"loss": 3.9695,
|
||||
"step": 2800
|
||||
},
|
||||
{
|
||||
"epoch": 0.69,
|
||||
"learning_rate": 7.500000000000001e-05,
|
||||
"loss": 3.9137,
|
||||
"step": 3000
|
||||
},
|
||||
{
|
||||
"epoch": 0.74,
|
||||
"learning_rate": 8e-05,
|
||||
"loss": 3.8624,
|
||||
"step": 3200
|
||||
},
|
||||
{
|
||||
"epoch": 0.79,
|
||||
"learning_rate": 8.5e-05,
|
||||
"loss": 3.809,
|
||||
"step": 3400
|
||||
},
|
||||
{
|
||||
"epoch": 0.83,
|
||||
"learning_rate": 9e-05,
|
||||
"loss": 3.7745,
|
||||
"step": 3600
|
||||
},
|
||||
{
|
||||
"epoch": 0.88,
|
||||
"learning_rate": 9.5e-05,
|
||||
"loss": 3.7355,
|
||||
"step": 3800
|
||||
},
|
||||
{
|
||||
"epoch": 0.92,
|
||||
"learning_rate": 0.0001,
|
||||
"loss": 3.7044,
|
||||
"step": 4000
|
||||
},
|
||||
{
|
||||
"epoch": 0.97,
|
||||
"learning_rate": 9.97577519379845e-05,
|
||||
"loss": 3.6708,
|
||||
"step": 4200
|
||||
},
|
||||
{
|
||||
"epoch": 1.0,
|
||||
"eval_loss": 4.374502182006836,
|
||||
"eval_runtime": 69.7852,
|
||||
"eval_samples_per_second": 2071.858,
|
||||
"eval_steps_per_second": 8.096,
|
||||
"step": 4328
|
||||
},
|
||||
{
|
||||
"epoch": 1.02,
|
||||
"learning_rate": 9.9515503875969e-05,
|
||||
"loss": 3.6304,
|
||||
"step": 4400
|
||||
},
|
||||
{
|
||||
"epoch": 1.06,
|
||||
"learning_rate": 9.927325581395349e-05,
|
||||
"loss": 3.5928,
|
||||
"step": 4600
|
||||
},
|
||||
{
|
||||
"epoch": 1.11,
|
||||
"learning_rate": 9.903100775193799e-05,
|
||||
"loss": 3.5721,
|
||||
"step": 4800
|
||||
},
|
||||
{
|
||||
"epoch": 1.16,
|
||||
"learning_rate": 9.878875968992248e-05,
|
||||
"loss": 3.5423,
|
||||
"step": 5000
|
||||
},
|
||||
{
|
||||
"epoch": 1.2,
|
||||
"learning_rate": 9.854651162790698e-05,
|
||||
"loss": 3.5221,
|
||||
"step": 5200
|
||||
},
|
||||
{
|
||||
"epoch": 1.25,
|
||||
"learning_rate": 9.830426356589147e-05,
|
||||
"loss": 3.5002,
|
||||
"step": 5400
|
||||
},
|
||||
{
|
||||
"epoch": 1.29,
|
||||
"learning_rate": 9.806201550387597e-05,
|
||||
"loss": 3.4933,
|
||||
"step": 5600
|
||||
},
|
||||
{
|
||||
"epoch": 1.34,
|
||||
"learning_rate": 9.781976744186046e-05,
|
||||
"loss": 3.4708,
|
||||
"step": 5800
|
||||
},
|
||||
{
|
||||
"epoch": 1.39,
|
||||
"learning_rate": 9.757751937984496e-05,
|
||||
"loss": 3.4472,
|
||||
"step": 6000
|
||||
},
|
||||
{
|
||||
"epoch": 1.43,
|
||||
"learning_rate": 9.733527131782945e-05,
|
||||
"loss": 3.4309,
|
||||
"step": 6200
|
||||
},
|
||||
{
|
||||
"epoch": 1.48,
|
||||
"learning_rate": 9.709302325581396e-05,
|
||||
"loss": 3.4261,
|
||||
"step": 6400
|
||||
},
|
||||
{
|
||||
"epoch": 1.52,
|
||||
"learning_rate": 9.685077519379846e-05,
|
||||
"loss": 3.4044,
|
||||
"step": 6600
|
||||
},
|
||||
{
|
||||
"epoch": 1.57,
|
||||
"learning_rate": 9.660852713178296e-05,
|
||||
"loss": 3.4006,
|
||||
"step": 6800
|
||||
},
|
||||
{
|
||||
"epoch": 1.62,
|
||||
"learning_rate": 9.636627906976745e-05,
|
||||
"loss": 3.3831,
|
||||
"step": 7000
|
||||
},
|
||||
{
|
||||
"epoch": 1.66,
|
||||
"learning_rate": 9.612403100775195e-05,
|
||||
"loss": 3.3736,
|
||||
"step": 7200
|
||||
},
|
||||
{
|
||||
"epoch": 1.71,
|
||||
"learning_rate": 9.588178294573644e-05,
|
||||
"loss": 3.3591,
|
||||
"step": 7400
|
||||
},
|
||||
{
|
||||
"epoch": 1.76,
|
||||
"learning_rate": 9.563953488372094e-05,
|
||||
"loss": 3.3528,
|
||||
"step": 7600
|
||||
},
|
||||
{
|
||||
"epoch": 1.8,
|
||||
"learning_rate": 9.539728682170543e-05,
|
||||
"loss": 3.3477,
|
||||
"step": 7800
|
||||
},
|
||||
{
|
||||
"epoch": 1.85,
|
||||
"learning_rate": 9.515503875968994e-05,
|
||||
"loss": 3.3387,
|
||||
"step": 8000
|
||||
},
|
||||
{
|
||||
"epoch": 1.89,
|
||||
"learning_rate": 9.491279069767442e-05,
|
||||
"loss": 3.3275,
|
||||
"step": 8200
|
||||
},
|
||||
{
|
||||
"epoch": 1.94,
|
||||
"learning_rate": 9.467054263565893e-05,
|
||||
"loss": 3.3176,
|
||||
"step": 8400
|
||||
},
|
||||
{
|
||||
"epoch": 1.99,
|
||||
"learning_rate": 9.442829457364342e-05,
|
||||
"loss": 3.3094,
|
||||
"step": 8600
|
||||
},
|
||||
{
|
||||
"epoch": 2.0,
|
||||
"eval_loss": 3.81843900680542,
|
||||
"eval_runtime": 69.7786,
|
||||
"eval_samples_per_second": 2072.054,
|
||||
"eval_steps_per_second": 8.097,
|
||||
"step": 8656
|
||||
},
|
||||
{
|
||||
"epoch": 2.03,
|
||||
"learning_rate": 9.418604651162792e-05,
|
||||
"loss": 3.2732,
|
||||
"step": 8800
|
||||
},
|
||||
{
|
||||
"epoch": 2.08,
|
||||
"learning_rate": 9.394379844961241e-05,
|
||||
"loss": 3.2588,
|
||||
"step": 9000
|
||||
},
|
||||
{
|
||||
"epoch": 2.13,
|
||||
"learning_rate": 9.37015503875969e-05,
|
||||
"loss": 3.2546,
|
||||
"step": 9200
|
||||
},
|
||||
{
|
||||
"epoch": 2.17,
|
||||
"learning_rate": 9.34593023255814e-05,
|
||||
"loss": 3.2454,
|
||||
"step": 9400
|
||||
},
|
||||
{
|
||||
"epoch": 2.22,
|
||||
"learning_rate": 9.321705426356589e-05,
|
||||
"loss": 3.2464,
|
||||
"step": 9600
|
||||
},
|
||||
{
|
||||
"epoch": 2.26,
|
||||
"learning_rate": 9.297480620155039e-05,
|
||||
"loss": 3.243,
|
||||
"step": 9800
|
||||
},
|
||||
{
|
||||
"epoch": 2.31,
|
||||
"learning_rate": 9.273255813953488e-05,
|
||||
"loss": 3.2405,
|
||||
"step": 10000
|
||||
},
|
||||
{
|
||||
"epoch": 2.36,
|
||||
"learning_rate": 9.249031007751938e-05,
|
||||
"loss": 3.2321,
|
||||
"step": 10200
|
||||
},
|
||||
{
|
||||
"epoch": 2.4,
|
||||
"learning_rate": 9.224806201550387e-05,
|
||||
"loss": 3.2235,
|
||||
"step": 10400
|
||||
},
|
||||
{
|
||||
"epoch": 2.45,
|
||||
"learning_rate": 9.200581395348837e-05,
|
||||
"loss": 3.2285,
|
||||
"step": 10600
|
||||
},
|
||||
{
|
||||
"epoch": 2.5,
|
||||
"learning_rate": 9.176356589147286e-05,
|
||||
"loss": 3.2164,
|
||||
"step": 10800
|
||||
},
|
||||
{
|
||||
"epoch": 2.54,
|
||||
"learning_rate": 9.152131782945737e-05,
|
||||
"loss": 3.2173,
|
||||
"step": 11000
|
||||
},
|
||||
{
|
||||
"epoch": 2.59,
|
||||
"learning_rate": 9.127906976744186e-05,
|
||||
"loss": 3.2093,
|
||||
"step": 11200
|
||||
},
|
||||
{
|
||||
"epoch": 2.63,
|
||||
"learning_rate": 9.103682170542636e-05,
|
||||
"loss": 3.2067,
|
||||
"step": 11400
|
||||
},
|
||||
{
|
||||
"epoch": 2.68,
|
||||
"learning_rate": 9.079457364341085e-05,
|
||||
"loss": 3.1984,
|
||||
"step": 11600
|
||||
},
|
||||
{
|
||||
"epoch": 2.73,
|
||||
"learning_rate": 9.055232558139536e-05,
|
||||
"loss": 3.1929,
|
||||
"step": 11800
|
||||
},
|
||||
{
|
||||
"epoch": 2.77,
|
||||
"learning_rate": 9.031007751937985e-05,
|
||||
"loss": 3.194,
|
||||
"step": 12000
|
||||
},
|
||||
{
|
||||
"epoch": 2.82,
|
||||
"learning_rate": 9.006782945736436e-05,
|
||||
"loss": 3.1965,
|
||||
"step": 12200
|
||||
},
|
||||
{
|
||||
"epoch": 2.87,
|
||||
"learning_rate": 8.982558139534884e-05,
|
||||
"loss": 3.192,
|
||||
"step": 12400
|
||||
},
|
||||
{
|
||||
"epoch": 2.91,
|
||||
"learning_rate": 8.958333333333335e-05,
|
||||
"loss": 3.1865,
|
||||
"step": 12600
|
||||
},
|
||||
{
|
||||
"epoch": 2.96,
|
||||
"learning_rate": 8.934108527131784e-05,
|
||||
"loss": 3.1753,
|
||||
"step": 12800
|
||||
},
|
||||
{
|
||||
"epoch": 3.0,
|
||||
"eval_loss": 3.7183403968811035,
|
||||
"eval_runtime": 70.1268,
|
||||
"eval_samples_per_second": 2061.764,
|
||||
"eval_steps_per_second": 8.057,
|
||||
"step": 12984
|
||||
},
|
||||
{
|
||||
"epoch": 3.0,
|
||||
"learning_rate": 8.909883720930234e-05,
|
||||
"loss": 3.1739,
|
||||
"step": 13000
|
||||
},
|
||||
{
|
||||
"epoch": 3.05,
|
||||
"learning_rate": 8.885658914728683e-05,
|
||||
"loss": 3.135,
|
||||
"step": 13200
|
||||
},
|
||||
{
|
||||
"epoch": 3.1,
|
||||
"learning_rate": 8.861434108527133e-05,
|
||||
"loss": 3.131,
|
||||
"step": 13400
|
||||
},
|
||||
{
|
||||
"epoch": 3.14,
|
||||
"learning_rate": 8.837209302325582e-05,
|
||||
"loss": 3.1289,
|
||||
"step": 13600
|
||||
},
|
||||
{
|
||||
"epoch": 3.19,
|
||||
"learning_rate": 8.812984496124032e-05,
|
||||
"loss": 3.1231,
|
||||
"step": 13800
|
||||
},
|
||||
{
|
||||
"epoch": 3.23,
|
||||
"learning_rate": 8.788759689922481e-05,
|
||||
"loss": 3.1257,
|
||||
"step": 14000
|
||||
},
|
||||
{
|
||||
"epoch": 3.28,
|
||||
"learning_rate": 8.76453488372093e-05,
|
||||
"loss": 3.1196,
|
||||
"step": 14200
|
||||
},
|
||||
{
|
||||
"epoch": 3.33,
|
||||
"learning_rate": 8.74031007751938e-05,
|
||||
"loss": 3.1188,
|
||||
"step": 14400
|
||||
},
|
||||
{
|
||||
"epoch": 3.37,
|
||||
"learning_rate": 8.716085271317829e-05,
|
||||
"loss": 3.1195,
|
||||
"step": 14600
|
||||
},
|
||||
{
|
||||
"epoch": 3.42,
|
||||
"learning_rate": 8.69186046511628e-05,
|
||||
"loss": 3.1217,
|
||||
"step": 14800
|
||||
},
|
||||
{
|
||||
"epoch": 3.47,
|
||||
"learning_rate": 8.667635658914728e-05,
|
||||
"loss": 3.1124,
|
||||
"step": 15000
|
||||
},
|
||||
{
|
||||
"epoch": 3.51,
|
||||
"learning_rate": 8.643410852713179e-05,
|
||||
"loss": 3.1165,
|
||||
"step": 15200
|
||||
},
|
||||
{
|
||||
"epoch": 3.56,
|
||||
"learning_rate": 8.619186046511628e-05,
|
||||
"loss": 3.1126,
|
||||
"step": 15400
|
||||
},
|
||||
{
|
||||
"epoch": 3.6,
|
||||
"learning_rate": 8.594961240310078e-05,
|
||||
"loss": 3.1091,
|
||||
"step": 15600
|
||||
},
|
||||
{
|
||||
"epoch": 3.65,
|
||||
"learning_rate": 8.570736434108527e-05,
|
||||
"loss": 3.1096,
|
||||
"step": 15800
|
||||
},
|
||||
{
|
||||
"epoch": 3.7,
|
||||
"learning_rate": 8.546511627906977e-05,
|
||||
"loss": 3.1094,
|
||||
"step": 16000
|
||||
},
|
||||
{
|
||||
"epoch": 3.74,
|
||||
"learning_rate": 8.522286821705426e-05,
|
||||
"loss": 3.1093,
|
||||
"step": 16200
|
||||
},
|
||||
{
|
||||
"epoch": 3.79,
|
||||
"learning_rate": 8.498062015503876e-05,
|
||||
"loss": 3.101,
|
||||
"step": 16400
|
||||
},
|
||||
{
|
||||
"epoch": 3.84,
|
||||
"learning_rate": 8.473837209302325e-05,
|
||||
"loss": 3.0979,
|
||||
"step": 16600
|
||||
},
|
||||
{
|
||||
"epoch": 3.88,
|
||||
"learning_rate": 8.449612403100775e-05,
|
||||
"loss": 3.1027,
|
||||
"step": 16800
|
||||
},
|
||||
{
|
||||
"epoch": 3.93,
|
||||
"learning_rate": 8.425387596899226e-05,
|
||||
"loss": 3.1032,
|
||||
"step": 17000
|
||||
},
|
||||
{
|
||||
"epoch": 3.97,
|
||||
"learning_rate": 8.401162790697676e-05,
|
||||
"loss": 3.0931,
|
||||
"step": 17200
|
||||
},
|
||||
{
|
||||
"epoch": 4.0,
|
||||
"eval_loss": 3.638052463531494,
|
||||
"eval_runtime": 69.9503,
|
||||
"eval_samples_per_second": 2066.967,
|
||||
"eval_steps_per_second": 8.077,
|
||||
"step": 17312
|
||||
},
|
||||
{
|
||||
"epoch": 4.02,
|
||||
"learning_rate": 8.376937984496125e-05,
|
||||
"loss": 3.0693,
|
||||
"step": 17400
|
||||
},
|
||||
{
|
||||
"epoch": 4.07,
|
||||
"learning_rate": 8.352713178294575e-05,
|
||||
"loss": 3.0446,
|
||||
"step": 17600
|
||||
},
|
||||
{
|
||||
"epoch": 4.11,
|
||||
"learning_rate": 8.328488372093024e-05,
|
||||
"loss": 3.0407,
|
||||
"step": 17800
|
||||
},
|
||||
{
|
||||
"epoch": 4.16,
|
||||
"learning_rate": 8.304263565891474e-05,
|
||||
"loss": 3.0426,
|
||||
"step": 18000
|
||||
},
|
||||
{
|
||||
"epoch": 4.21,
|
||||
"learning_rate": 8.280038759689923e-05,
|
||||
"loss": 3.0515,
|
||||
"step": 18200
|
||||
},
|
||||
{
|
||||
"epoch": 4.25,
|
||||
"learning_rate": 8.255813953488373e-05,
|
||||
"loss": 3.0456,
|
||||
"step": 18400
|
||||
},
|
||||
{
|
||||
"epoch": 4.3,
|
||||
"learning_rate": 8.231589147286822e-05,
|
||||
"loss": 3.0496,
|
||||
"step": 18600
|
||||
},
|
||||
{
|
||||
"epoch": 4.34,
|
||||
"learning_rate": 8.207364341085273e-05,
|
||||
"loss": 3.0526,
|
||||
"step": 18800
|
||||
},
|
||||
{
|
||||
"epoch": 4.39,
|
||||
"learning_rate": 8.183139534883721e-05,
|
||||
"loss": 3.0485,
|
||||
"step": 19000
|
||||
},
|
||||
{
|
||||
"epoch": 4.44,
|
||||
"learning_rate": 8.15891472868217e-05,
|
||||
"loss": 3.0525,
|
||||
"step": 19200
|
||||
},
|
||||
{
|
||||
"epoch": 4.48,
|
||||
"learning_rate": 8.13468992248062e-05,
|
||||
"loss": 3.0478,
|
||||
"step": 19400
|
||||
},
|
||||
{
|
||||
"epoch": 4.53,
|
||||
"learning_rate": 8.11046511627907e-05,
|
||||
"loss": 3.0447,
|
||||
"step": 19600
|
||||
},
|
||||
{
|
||||
"epoch": 4.57,
|
||||
"learning_rate": 8.08624031007752e-05,
|
||||
"loss": 3.0497,
|
||||
"step": 19800
|
||||
},
|
||||
{
|
||||
"epoch": 4.62,
|
||||
"learning_rate": 8.062015503875969e-05,
|
||||
"loss": 3.0404,
|
||||
"step": 20000
|
||||
},
|
||||
{
|
||||
"epoch": 4.67,
|
||||
"learning_rate": 8.037790697674419e-05,
|
||||
"loss": 3.0483,
|
||||
"step": 20200
|
||||
},
|
||||
{
|
||||
"epoch": 4.71,
|
||||
"learning_rate": 8.013565891472868e-05,
|
||||
"loss": 3.0367,
|
||||
"step": 20400
|
||||
},
|
||||
{
|
||||
"epoch": 4.76,
|
||||
"learning_rate": 7.989341085271318e-05,
|
||||
"loss": 3.0439,
|
||||
"step": 20600
|
||||
},
|
||||
{
|
||||
"epoch": 4.81,
|
||||
"learning_rate": 7.965116279069767e-05,
|
||||
"loss": 3.0358,
|
||||
"step": 20800
|
||||
},
|
||||
{
|
||||
"epoch": 4.85,
|
||||
"learning_rate": 7.940891472868217e-05,
|
||||
"loss": 3.0479,
|
||||
"step": 21000
|
||||
},
|
||||
{
|
||||
"epoch": 4.9,
|
||||
"learning_rate": 7.916666666666666e-05,
|
||||
"loss": 3.0383,
|
||||
"step": 21200
|
||||
},
|
||||
{
|
||||
"epoch": 4.94,
|
||||
"learning_rate": 7.892441860465116e-05,
|
||||
"loss": 3.0362,
|
||||
"step": 21400
|
||||
},
|
||||
{
|
||||
"epoch": 4.99,
|
||||
"learning_rate": 7.868217054263565e-05,
|
||||
"loss": 3.0391,
|
||||
"step": 21600
|
||||
},
|
||||
{
|
||||
"epoch": 5.0,
|
||||
"eval_loss": 3.6747233867645264,
|
||||
"eval_runtime": 69.8384,
|
||||
"eval_samples_per_second": 2070.278,
|
||||
"eval_steps_per_second": 8.09,
|
||||
"step": 21640
|
||||
},
|
||||
{
|
||||
"epoch": 5.04,
|
||||
"learning_rate": 7.843992248062016e-05,
|
||||
"loss": 2.9892,
|
||||
"step": 21800
|
||||
},
|
||||
{
|
||||
"epoch": 5.08,
|
||||
"learning_rate": 7.819767441860465e-05,
|
||||
"loss": 2.9863,
|
||||
"step": 22000
|
||||
},
|
||||
{
|
||||
"epoch": 5.13,
|
||||
"learning_rate": 7.795542635658916e-05,
|
||||
"loss": 2.9889,
|
||||
"step": 22200
|
||||
},
|
||||
{
|
||||
"epoch": 5.18,
|
||||
"learning_rate": 7.771317829457365e-05,
|
||||
"loss": 2.9895,
|
||||
"step": 22400
|
||||
},
|
||||
{
|
||||
"epoch": 5.22,
|
||||
"learning_rate": 7.747093023255815e-05,
|
||||
"loss": 2.9949,
|
||||
"step": 22600
|
||||
},
|
||||
{
|
||||
"epoch": 5.27,
|
||||
"learning_rate": 7.722868217054264e-05,
|
||||
"loss": 2.9947,
|
||||
"step": 22800
|
||||
},
|
||||
{
|
||||
"epoch": 5.31,
|
||||
"learning_rate": 7.698643410852715e-05,
|
||||
"loss": 2.9983,
|
||||
"step": 23000
|
||||
},
|
||||
{
|
||||
"epoch": 5.36,
|
||||
"learning_rate": 7.674418604651163e-05,
|
||||
"loss": 2.9908,
|
||||
"step": 23200
|
||||
},
|
||||
{
|
||||
"epoch": 5.41,
|
||||
"learning_rate": 7.650193798449614e-05,
|
||||
"loss": 2.9917,
|
||||
"step": 23400
|
||||
},
|
||||
{
|
||||
"epoch": 5.45,
|
||||
"learning_rate": 7.625968992248063e-05,
|
||||
"loss": 2.9973,
|
||||
"step": 23600
|
||||
},
|
||||
{
|
||||
"epoch": 5.5,
|
||||
"learning_rate": 7.601744186046513e-05,
|
||||
"loss": 2.9912,
|
||||
"step": 23800
|
||||
},
|
||||
{
|
||||
"epoch": 5.55,
|
||||
"learning_rate": 7.577519379844962e-05,
|
||||
"loss": 2.9915,
|
||||
"step": 24000
|
||||
},
|
||||
{
|
||||
"epoch": 5.59,
|
||||
"learning_rate": 7.55329457364341e-05,
|
||||
"loss": 2.9916,
|
||||
"step": 24200
|
||||
},
|
||||
{
|
||||
"epoch": 5.64,
|
||||
"learning_rate": 7.529069767441861e-05,
|
||||
"loss": 2.9982,
|
||||
"step": 24400
|
||||
},
|
||||
{
|
||||
"epoch": 5.68,
|
||||
"learning_rate": 7.50484496124031e-05,
|
||||
"loss": 2.992,
|
||||
"step": 24600
|
||||
},
|
||||
{
|
||||
"epoch": 5.73,
|
||||
"learning_rate": 7.48062015503876e-05,
|
||||
"loss": 2.9924,
|
||||
"step": 24800
|
||||
},
|
||||
{
|
||||
"epoch": 5.78,
|
||||
"learning_rate": 7.456395348837209e-05,
|
||||
"loss": 2.9978,
|
||||
"step": 25000
|
||||
},
|
||||
{
|
||||
"epoch": 5.82,
|
||||
"learning_rate": 7.432170542635659e-05,
|
||||
"loss": 2.9975,
|
||||
"step": 25200
|
||||
},
|
||||
{
|
||||
"epoch": 5.87,
|
||||
"learning_rate": 7.407945736434108e-05,
|
||||
"loss": 2.9943,
|
||||
"step": 25400
|
||||
},
|
||||
{
|
||||
"epoch": 5.91,
|
||||
"learning_rate": 7.383720930232558e-05,
|
||||
"loss": 2.9943,
|
||||
"step": 25600
|
||||
},
|
||||
{
|
||||
"epoch": 5.96,
|
||||
"learning_rate": 7.359496124031007e-05,
|
||||
"loss": 2.9887,
|
||||
"step": 25800
|
||||
},
|
||||
{
|
||||
"epoch": 6.0,
|
||||
"eval_loss": 3.664537191390991,
|
||||
"eval_runtime": 69.9543,
|
||||
"eval_samples_per_second": 2066.849,
|
||||
"eval_steps_per_second": 8.077,
|
||||
"step": 25968
|
||||
},
|
||||
{
|
||||
"epoch": 6.01,
|
||||
"learning_rate": 7.335271317829458e-05,
|
||||
"loss": 2.9792,
|
||||
"step": 26000
|
||||
},
|
||||
{
|
||||
"epoch": 6.05,
|
||||
"learning_rate": 7.311046511627907e-05,
|
||||
"loss": 2.9363,
|
||||
"step": 26200
|
||||
},
|
||||
{
|
||||
"epoch": 6.1,
|
||||
"learning_rate": 7.286821705426357e-05,
|
||||
"loss": 2.9363,
|
||||
"step": 26400
|
||||
},
|
||||
{
|
||||
"epoch": 6.15,
|
||||
"learning_rate": 7.262596899224806e-05,
|
||||
"loss": 2.9499,
|
||||
"step": 26600
|
||||
},
|
||||
{
|
||||
"epoch": 6.19,
|
||||
"learning_rate": 7.238372093023256e-05,
|
||||
"loss": 2.9495,
|
||||
"step": 26800
|
||||
},
|
||||
{
|
||||
"epoch": 6.24,
|
||||
"learning_rate": 7.214147286821705e-05,
|
||||
"loss": 2.951,
|
||||
"step": 27000
|
||||
},
|
||||
{
|
||||
"epoch": 6.28,
|
||||
"learning_rate": 7.189922480620155e-05,
|
||||
"loss": 2.9476,
|
||||
"step": 27200
|
||||
},
|
||||
{
|
||||
"epoch": 6.33,
|
||||
"learning_rate": 7.165697674418605e-05,
|
||||
"loss": 2.9509,
|
||||
"step": 27400
|
||||
},
|
||||
{
|
||||
"epoch": 6.38,
|
||||
"learning_rate": 7.141472868217056e-05,
|
||||
"loss": 2.9539,
|
||||
"step": 27600
|
||||
},
|
||||
{
|
||||
"epoch": 6.42,
|
||||
"learning_rate": 7.117248062015505e-05,
|
||||
"loss": 2.9492,
|
||||
"step": 27800
|
||||
},
|
||||
{
|
||||
"epoch": 6.47,
|
||||
"learning_rate": 7.093023255813955e-05,
|
||||
"loss": 2.9536,
|
||||
"step": 28000
|
||||
},
|
||||
{
|
||||
"epoch": 6.52,
|
||||
"learning_rate": 7.068798449612404e-05,
|
||||
"loss": 2.9509,
|
||||
"step": 28200
|
||||
},
|
||||
{
|
||||
"epoch": 6.56,
|
||||
"learning_rate": 7.044573643410854e-05,
|
||||
"loss": 2.9511,
|
||||
"step": 28400
|
||||
},
|
||||
{
|
||||
"epoch": 6.61,
|
||||
"learning_rate": 7.020348837209303e-05,
|
||||
"loss": 2.9537,
|
||||
"step": 28600
|
||||
},
|
||||
{
|
||||
"epoch": 6.65,
|
||||
"learning_rate": 6.996124031007753e-05,
|
||||
"loss": 2.9516,
|
||||
"step": 28800
|
||||
},
|
||||
{
|
||||
"epoch": 6.7,
|
||||
"learning_rate": 6.971899224806202e-05,
|
||||
"loss": 2.9552,
|
||||
"step": 29000
|
||||
},
|
||||
{
|
||||
"epoch": 6.75,
|
||||
"learning_rate": 6.947674418604651e-05,
|
||||
"loss": 2.9536,
|
||||
"step": 29200
|
||||
},
|
||||
{
|
||||
"epoch": 6.79,
|
||||
"learning_rate": 6.923449612403101e-05,
|
||||
"loss": 2.9548,
|
||||
"step": 29400
|
||||
},
|
||||
{
|
||||
"epoch": 6.84,
|
||||
"learning_rate": 6.89922480620155e-05,
|
||||
"loss": 2.9433,
|
||||
"step": 29600
|
||||
},
|
||||
{
|
||||
"epoch": 6.89,
|
||||
"learning_rate": 6.875e-05,
|
||||
"loss": 2.9549,
|
||||
"step": 29800
|
||||
},
|
||||
{
|
||||
"epoch": 6.93,
|
||||
"learning_rate": 6.850775193798449e-05,
|
||||
"loss": 2.9591,
|
||||
"step": 30000
|
||||
},
|
||||
{
|
||||
"epoch": 6.98,
|
||||
"learning_rate": 6.8265503875969e-05,
|
||||
"loss": 2.9551,
|
||||
"step": 30200
|
||||
},
|
||||
{
|
||||
"epoch": 7.0,
|
||||
"eval_loss": 3.720215082168579,
|
||||
"eval_runtime": 70.0938,
|
||||
"eval_samples_per_second": 2062.736,
|
||||
"eval_steps_per_second": 8.061,
|
||||
"step": 30296
|
||||
},
|
||||
{
|
||||
"epoch": 7.0,
|
||||
"step": 30296,
|
||||
"total_flos": 5.0661324177408e+17,
|
||||
"train_loss": 3.3377098091554602,
|
||||
"train_runtime": 10454.0455,
|
||||
"train_samples_per_second": 2119.62,
|
||||
"train_steps_per_second": 8.28
|
||||
}
|
||||
],
|
||||
"max_steps": 86560,
|
||||
"num_train_epochs": 20,
|
||||
"total_flos": 5.0661324177408e+17,
|
||||
"trial_name": null,
|
||||
"trial_params": null
|
||||
}
|
||||
3
training_args.bin
Normal file
3
training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:2920de5d31cd004adfc8c92a631f52e9c3658bd8ab306eef60631b3b8cb646fb
|
||||
size 5073
|
||||
1
vocab.json
Normal file
1
vocab.json
Normal file
File diff suppressed because one or more lines are too long
Reference in New Issue
Block a user