初始化项目,由ModelHub XC社区提供模型
Model: devika-tiwari/gpt2_small_expandedbabyLM_100M_exp3_conj_ratio_0p50_mix_0p50_44 Source: Original Platform
This commit is contained in:
35
.gitattributes
vendored
Normal file
35
.gitattributes
vendored
Normal file
@@ -0,0 +1,35 @@
|
||||
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||
*.model filter=lfs diff=lfs merge=lfs -text
|
||||
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
1
.gitignore
vendored
Normal file
1
.gitignore
vendored
Normal file
@@ -0,0 +1 @@
|
||||
checkpoint-*/
|
||||
62
README.md
Normal file
62
README.md
Normal file
@@ -0,0 +1,62 @@
|
||||
---
|
||||
tags:
|
||||
- generated_from_trainer
|
||||
model-index:
|
||||
- name: gpt2_small_expandedbabyLM_100M_exp3_conj_ratio_0p50_mix_0p50_44
|
||||
results: []
|
||||
---
|
||||
|
||||
<!-- This model card has been generated automatically according to the information the Trainer had access to. You
|
||||
should probably proofread and complete it, then remove this comment. -->
|
||||
|
||||
# gpt2_small_expandedbabyLM_100M_exp3_conj_ratio_0p50_mix_0p50_44
|
||||
|
||||
This model is a fine-tuned version of [](https://huggingface.co/) on an unknown dataset.
|
||||
It achieves the following results on the evaluation set:
|
||||
- Loss: 3.7068
|
||||
|
||||
## Model description
|
||||
|
||||
More information needed
|
||||
|
||||
## Intended uses & limitations
|
||||
|
||||
More information needed
|
||||
|
||||
## Training and evaluation data
|
||||
|
||||
More information needed
|
||||
|
||||
## Training procedure
|
||||
|
||||
### Training hyperparameters
|
||||
|
||||
The following hyperparameters were used during training:
|
||||
- learning_rate: 0.0001
|
||||
- train_batch_size: 256
|
||||
- eval_batch_size: 256
|
||||
- seed: 44
|
||||
- optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
|
||||
- lr_scheduler_type: linear
|
||||
- lr_scheduler_warmup_steps: 4000
|
||||
- num_epochs: 20
|
||||
|
||||
### Training results
|
||||
|
||||
| Training Loss | Epoch | Step | Validation Loss |
|
||||
|:-------------:|:-----:|:-----:|:---------------:|
|
||||
| 3.4398 | 1.0 | 4205 | 4.5278 |
|
||||
| 3.1147 | 2.0 | 8410 | 3.8604 |
|
||||
| 2.977 | 3.0 | 12615 | 3.8150 |
|
||||
| 2.9028 | 4.0 | 16820 | 3.7068 |
|
||||
| 2.8524 | 5.0 | 21025 | 3.7256 |
|
||||
| 2.7943 | 6.0 | 25230 | 3.7306 |
|
||||
| 2.7664 | 7.0 | 29435 | 3.7186 |
|
||||
|
||||
|
||||
### Framework versions
|
||||
|
||||
- Transformers 4.30.2
|
||||
- Pytorch 2.11.0+cu130
|
||||
- Datasets 4.1.1
|
||||
- Tokenizers 0.13.3
|
||||
14
all_results.json
Normal file
14
all_results.json
Normal file
@@ -0,0 +1,14 @@
|
||||
{
|
||||
"epoch": 7.0,
|
||||
"eval_loss": 3.7067978382110596,
|
||||
"eval_runtime": 69.893,
|
||||
"eval_samples": 144585,
|
||||
"eval_samples_per_second": 2068.662,
|
||||
"eval_steps_per_second": 8.084,
|
||||
"perplexity": 40.72319525960715,
|
||||
"train_loss": 3.1480036618087093,
|
||||
"train_runtime": 10171.5358,
|
||||
"train_samples": 1076355,
|
||||
"train_samples_per_second": 2116.406,
|
||||
"train_steps_per_second": 8.268
|
||||
}
|
||||
31
config.json
Normal file
31
config.json
Normal file
@@ -0,0 +1,31 @@
|
||||
{
|
||||
"activation_function": "gelu_new",
|
||||
"architectures": [
|
||||
"GPT2LMHeadModel"
|
||||
],
|
||||
"attn_pdrop": 0.1,
|
||||
"bos_token_id": 50256,
|
||||
"embd_pdrop": 0.1,
|
||||
"eos_token_id": 50256,
|
||||
"initializer_range": 0.02,
|
||||
"layer_norm_epsilon": 1e-05,
|
||||
"model_type": "gpt2",
|
||||
"n_embd": 768,
|
||||
"n_head": 12,
|
||||
"n_inner": null,
|
||||
"n_layer": 12,
|
||||
"n_positions": 1024,
|
||||
"reorder_and_upcast_attn": false,
|
||||
"resid_pdrop": 0.1,
|
||||
"scale_attn_by_inverse_layer_idx": false,
|
||||
"scale_attn_weights": true,
|
||||
"summary_activation": null,
|
||||
"summary_first_dropout": 0.1,
|
||||
"summary_proj_to_labels": true,
|
||||
"summary_type": "cls_index",
|
||||
"summary_use_proj": true,
|
||||
"torch_dtype": "float32",
|
||||
"transformers_version": "4.30.2",
|
||||
"use_cache": true,
|
||||
"vocab_size": 50257
|
||||
}
|
||||
9
eval_results.json
Normal file
9
eval_results.json
Normal file
@@ -0,0 +1,9 @@
|
||||
{
|
||||
"epoch": 7.0,
|
||||
"eval_loss": 3.7067978382110596,
|
||||
"eval_runtime": 69.893,
|
||||
"eval_samples": 144585,
|
||||
"eval_samples_per_second": 2068.662,
|
||||
"eval_steps_per_second": 8.084,
|
||||
"perplexity": 40.72319525960715
|
||||
}
|
||||
6
generation_config.json
Normal file
6
generation_config.json
Normal file
@@ -0,0 +1,6 @@
|
||||
{
|
||||
"_from_model_config": true,
|
||||
"bos_token_id": 50256,
|
||||
"eos_token_id": 50256,
|
||||
"transformers_version": "4.30.2"
|
||||
}
|
||||
50001
merges.txt
Normal file
50001
merges.txt
Normal file
File diff suppressed because it is too large
Load Diff
3
pytorch_model.bin
Normal file
3
pytorch_model.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:66d4c05ce49c79cc76adaa1be8ad0150847408f10031d6abc09f2042cfc3b87c
|
||||
size 497808115
|
||||
5
special_tokens_map.json
Normal file
5
special_tokens_map.json
Normal file
@@ -0,0 +1,5 @@
|
||||
{
|
||||
"bos_token": "<|endoftext|>",
|
||||
"eos_token": "<|endoftext|>",
|
||||
"unk_token": "<|endoftext|>"
|
||||
}
|
||||
100305
tokenizer.json
Normal file
100305
tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
10
tokenizer_config.json
Normal file
10
tokenizer_config.json
Normal file
@@ -0,0 +1,10 @@
|
||||
{
|
||||
"add_prefix_space": false,
|
||||
"bos_token": "<|endoftext|>",
|
||||
"clean_up_tokenization_spaces": true,
|
||||
"eos_token": "<|endoftext|>",
|
||||
"model_max_length": 1024,
|
||||
"token": null,
|
||||
"tokenizer_class": "GPT2Tokenizer",
|
||||
"unk_token": "<|endoftext|>"
|
||||
}
|
||||
8
train_results.json
Normal file
8
train_results.json
Normal file
@@ -0,0 +1,8 @@
|
||||
{
|
||||
"epoch": 7.0,
|
||||
"train_loss": 3.1480036618087093,
|
||||
"train_runtime": 10171.5358,
|
||||
"train_samples": 1076355,
|
||||
"train_samples_per_second": 2116.406,
|
||||
"train_steps_per_second": 8.268
|
||||
}
|
||||
963
trainer_state.json
Normal file
963
trainer_state.json
Normal file
@@ -0,0 +1,963 @@
|
||||
{
|
||||
"best_metric": 3.7067978382110596,
|
||||
"best_model_checkpoint": "/scratch/dt719/causal_lm_training/models/gpt2_small_expandedbabyLM_100M_exp3_conj_ratio_0p50_mix_0p50_44/checkpoint-16820",
|
||||
"epoch": 7.0,
|
||||
"global_step": 29435,
|
||||
"is_hyper_param_search": false,
|
||||
"is_local_process_zero": true,
|
||||
"is_world_process_zero": true,
|
||||
"log_history": [
|
||||
{
|
||||
"epoch": 0.05,
|
||||
"learning_rate": 5e-06,
|
||||
"loss": 8.8203,
|
||||
"step": 200
|
||||
},
|
||||
{
|
||||
"epoch": 0.1,
|
||||
"learning_rate": 1e-05,
|
||||
"loss": 6.9256,
|
||||
"step": 400
|
||||
},
|
||||
{
|
||||
"epoch": 0.14,
|
||||
"learning_rate": 1.5e-05,
|
||||
"loss": 5.8151,
|
||||
"step": 600
|
||||
},
|
||||
{
|
||||
"epoch": 0.19,
|
||||
"learning_rate": 2e-05,
|
||||
"loss": 5.2337,
|
||||
"step": 800
|
||||
},
|
||||
{
|
||||
"epoch": 0.24,
|
||||
"learning_rate": 2.5e-05,
|
||||
"loss": 4.8901,
|
||||
"step": 1000
|
||||
},
|
||||
{
|
||||
"epoch": 0.29,
|
||||
"learning_rate": 3e-05,
|
||||
"loss": 4.6386,
|
||||
"step": 1200
|
||||
},
|
||||
{
|
||||
"epoch": 0.33,
|
||||
"learning_rate": 3.5e-05,
|
||||
"loss": 4.4492,
|
||||
"step": 1400
|
||||
},
|
||||
{
|
||||
"epoch": 0.38,
|
||||
"learning_rate": 4e-05,
|
||||
"loss": 4.3048,
|
||||
"step": 1600
|
||||
},
|
||||
{
|
||||
"epoch": 0.43,
|
||||
"learning_rate": 4.5e-05,
|
||||
"loss": 4.1693,
|
||||
"step": 1800
|
||||
},
|
||||
{
|
||||
"epoch": 0.48,
|
||||
"learning_rate": 5e-05,
|
||||
"loss": 4.0527,
|
||||
"step": 2000
|
||||
},
|
||||
{
|
||||
"epoch": 0.52,
|
||||
"learning_rate": 5.500000000000001e-05,
|
||||
"loss": 3.9597,
|
||||
"step": 2200
|
||||
},
|
||||
{
|
||||
"epoch": 0.57,
|
||||
"learning_rate": 6e-05,
|
||||
"loss": 3.8778,
|
||||
"step": 2400
|
||||
},
|
||||
{
|
||||
"epoch": 0.62,
|
||||
"learning_rate": 6.500000000000001e-05,
|
||||
"loss": 3.808,
|
||||
"step": 2600
|
||||
},
|
||||
{
|
||||
"epoch": 0.67,
|
||||
"learning_rate": 7e-05,
|
||||
"loss": 3.7436,
|
||||
"step": 2800
|
||||
},
|
||||
{
|
||||
"epoch": 0.71,
|
||||
"learning_rate": 7.500000000000001e-05,
|
||||
"loss": 3.6804,
|
||||
"step": 3000
|
||||
},
|
||||
{
|
||||
"epoch": 0.76,
|
||||
"learning_rate": 8e-05,
|
||||
"loss": 3.6291,
|
||||
"step": 3200
|
||||
},
|
||||
{
|
||||
"epoch": 0.81,
|
||||
"learning_rate": 8.5e-05,
|
||||
"loss": 3.5821,
|
||||
"step": 3400
|
||||
},
|
||||
{
|
||||
"epoch": 0.86,
|
||||
"learning_rate": 9e-05,
|
||||
"loss": 3.539,
|
||||
"step": 3600
|
||||
},
|
||||
{
|
||||
"epoch": 0.9,
|
||||
"learning_rate": 9.5e-05,
|
||||
"loss": 3.5098,
|
||||
"step": 3800
|
||||
},
|
||||
{
|
||||
"epoch": 0.95,
|
||||
"learning_rate": 0.0001,
|
||||
"loss": 3.4758,
|
||||
"step": 4000
|
||||
},
|
||||
{
|
||||
"epoch": 1.0,
|
||||
"learning_rate": 9.975031210986268e-05,
|
||||
"loss": 3.4398,
|
||||
"step": 4200
|
||||
},
|
||||
{
|
||||
"epoch": 1.0,
|
||||
"eval_loss": 4.527769088745117,
|
||||
"eval_runtime": 69.6926,
|
||||
"eval_samples_per_second": 2074.609,
|
||||
"eval_steps_per_second": 8.107,
|
||||
"step": 4205
|
||||
},
|
||||
{
|
||||
"epoch": 1.05,
|
||||
"learning_rate": 9.950062421972534e-05,
|
||||
"loss": 3.3975,
|
||||
"step": 4400
|
||||
},
|
||||
{
|
||||
"epoch": 1.09,
|
||||
"learning_rate": 9.925093632958801e-05,
|
||||
"loss": 3.3629,
|
||||
"step": 4600
|
||||
},
|
||||
{
|
||||
"epoch": 1.14,
|
||||
"learning_rate": 9.900124843945069e-05,
|
||||
"loss": 3.3427,
|
||||
"step": 4800
|
||||
},
|
||||
{
|
||||
"epoch": 1.19,
|
||||
"learning_rate": 9.875156054931336e-05,
|
||||
"loss": 3.3352,
|
||||
"step": 5000
|
||||
},
|
||||
{
|
||||
"epoch": 1.24,
|
||||
"learning_rate": 9.850187265917602e-05,
|
||||
"loss": 3.3096,
|
||||
"step": 5200
|
||||
},
|
||||
{
|
||||
"epoch": 1.28,
|
||||
"learning_rate": 9.82521847690387e-05,
|
||||
"loss": 3.2845,
|
||||
"step": 5400
|
||||
},
|
||||
{
|
||||
"epoch": 1.33,
|
||||
"learning_rate": 9.800249687890137e-05,
|
||||
"loss": 3.267,
|
||||
"step": 5600
|
||||
},
|
||||
{
|
||||
"epoch": 1.38,
|
||||
"learning_rate": 9.775280898876405e-05,
|
||||
"loss": 3.2614,
|
||||
"step": 5800
|
||||
},
|
||||
{
|
||||
"epoch": 1.43,
|
||||
"learning_rate": 9.750312109862672e-05,
|
||||
"loss": 3.2412,
|
||||
"step": 6000
|
||||
},
|
||||
{
|
||||
"epoch": 1.47,
|
||||
"learning_rate": 9.72534332084894e-05,
|
||||
"loss": 3.2142,
|
||||
"step": 6200
|
||||
},
|
||||
{
|
||||
"epoch": 1.52,
|
||||
"learning_rate": 9.700374531835207e-05,
|
||||
"loss": 3.2037,
|
||||
"step": 6400
|
||||
},
|
||||
{
|
||||
"epoch": 1.57,
|
||||
"learning_rate": 9.675405742821473e-05,
|
||||
"loss": 3.1935,
|
||||
"step": 6600
|
||||
},
|
||||
{
|
||||
"epoch": 1.62,
|
||||
"learning_rate": 9.650436953807741e-05,
|
||||
"loss": 3.1846,
|
||||
"step": 6800
|
||||
},
|
||||
{
|
||||
"epoch": 1.66,
|
||||
"learning_rate": 9.625468164794008e-05,
|
||||
"loss": 3.1735,
|
||||
"step": 7000
|
||||
},
|
||||
{
|
||||
"epoch": 1.71,
|
||||
"learning_rate": 9.600499375780276e-05,
|
||||
"loss": 3.1624,
|
||||
"step": 7200
|
||||
},
|
||||
{
|
||||
"epoch": 1.76,
|
||||
"learning_rate": 9.575530586766542e-05,
|
||||
"loss": 3.1508,
|
||||
"step": 7400
|
||||
},
|
||||
{
|
||||
"epoch": 1.81,
|
||||
"learning_rate": 9.550561797752809e-05,
|
||||
"loss": 3.1459,
|
||||
"step": 7600
|
||||
},
|
||||
{
|
||||
"epoch": 1.85,
|
||||
"learning_rate": 9.525593008739077e-05,
|
||||
"loss": 3.1228,
|
||||
"step": 7800
|
||||
},
|
||||
{
|
||||
"epoch": 1.9,
|
||||
"learning_rate": 9.500624219725344e-05,
|
||||
"loss": 3.1278,
|
||||
"step": 8000
|
||||
},
|
||||
{
|
||||
"epoch": 1.95,
|
||||
"learning_rate": 9.47565543071161e-05,
|
||||
"loss": 3.1262,
|
||||
"step": 8200
|
||||
},
|
||||
{
|
||||
"epoch": 2.0,
|
||||
"learning_rate": 9.450686641697878e-05,
|
||||
"loss": 3.1147,
|
||||
"step": 8400
|
||||
},
|
||||
{
|
||||
"epoch": 2.0,
|
||||
"eval_loss": 3.8604354858398438,
|
||||
"eval_runtime": 69.9605,
|
||||
"eval_samples_per_second": 2066.666,
|
||||
"eval_steps_per_second": 8.076,
|
||||
"step": 8410
|
||||
},
|
||||
{
|
||||
"epoch": 2.05,
|
||||
"learning_rate": 9.425717852684145e-05,
|
||||
"loss": 3.0569,
|
||||
"step": 8600
|
||||
},
|
||||
{
|
||||
"epoch": 2.09,
|
||||
"learning_rate": 9.400749063670413e-05,
|
||||
"loss": 3.0572,
|
||||
"step": 8800
|
||||
},
|
||||
{
|
||||
"epoch": 2.14,
|
||||
"learning_rate": 9.375780274656679e-05,
|
||||
"loss": 3.0638,
|
||||
"step": 9000
|
||||
},
|
||||
{
|
||||
"epoch": 2.19,
|
||||
"learning_rate": 9.350811485642946e-05,
|
||||
"loss": 3.0502,
|
||||
"step": 9200
|
||||
},
|
||||
{
|
||||
"epoch": 2.24,
|
||||
"learning_rate": 9.325842696629214e-05,
|
||||
"loss": 3.0546,
|
||||
"step": 9400
|
||||
},
|
||||
{
|
||||
"epoch": 2.28,
|
||||
"learning_rate": 9.300873907615481e-05,
|
||||
"loss": 3.04,
|
||||
"step": 9600
|
||||
},
|
||||
{
|
||||
"epoch": 2.33,
|
||||
"learning_rate": 9.275905118601749e-05,
|
||||
"loss": 3.0391,
|
||||
"step": 9800
|
||||
},
|
||||
{
|
||||
"epoch": 2.38,
|
||||
"learning_rate": 9.250936329588016e-05,
|
||||
"loss": 3.0355,
|
||||
"step": 10000
|
||||
},
|
||||
{
|
||||
"epoch": 2.43,
|
||||
"learning_rate": 9.225967540574283e-05,
|
||||
"loss": 3.0179,
|
||||
"step": 10200
|
||||
},
|
||||
{
|
||||
"epoch": 2.47,
|
||||
"learning_rate": 9.20099875156055e-05,
|
||||
"loss": 3.0379,
|
||||
"step": 10400
|
||||
},
|
||||
{
|
||||
"epoch": 2.52,
|
||||
"learning_rate": 9.176029962546817e-05,
|
||||
"loss": 3.0168,
|
||||
"step": 10600
|
||||
},
|
||||
{
|
||||
"epoch": 2.57,
|
||||
"learning_rate": 9.151061173533084e-05,
|
||||
"loss": 3.0159,
|
||||
"step": 10800
|
||||
},
|
||||
{
|
||||
"epoch": 2.62,
|
||||
"learning_rate": 9.126092384519352e-05,
|
||||
"loss": 3.0095,
|
||||
"step": 11000
|
||||
},
|
||||
{
|
||||
"epoch": 2.66,
|
||||
"learning_rate": 9.101123595505618e-05,
|
||||
"loss": 3.0104,
|
||||
"step": 11200
|
||||
},
|
||||
{
|
||||
"epoch": 2.71,
|
||||
"learning_rate": 9.076154806491885e-05,
|
||||
"loss": 3.0119,
|
||||
"step": 11400
|
||||
},
|
||||
{
|
||||
"epoch": 2.76,
|
||||
"learning_rate": 9.051186017478153e-05,
|
||||
"loss": 3.006,
|
||||
"step": 11600
|
||||
},
|
||||
{
|
||||
"epoch": 2.81,
|
||||
"learning_rate": 9.02621722846442e-05,
|
||||
"loss": 2.9941,
|
||||
"step": 11800
|
||||
},
|
||||
{
|
||||
"epoch": 2.85,
|
||||
"learning_rate": 9.001248439450686e-05,
|
||||
"loss": 2.9901,
|
||||
"step": 12000
|
||||
},
|
||||
{
|
||||
"epoch": 2.9,
|
||||
"learning_rate": 8.976279650436954e-05,
|
||||
"loss": 2.9872,
|
||||
"step": 12200
|
||||
},
|
||||
{
|
||||
"epoch": 2.95,
|
||||
"learning_rate": 8.951310861423221e-05,
|
||||
"loss": 2.9842,
|
||||
"step": 12400
|
||||
},
|
||||
{
|
||||
"epoch": 3.0,
|
||||
"learning_rate": 8.926342072409489e-05,
|
||||
"loss": 2.977,
|
||||
"step": 12600
|
||||
},
|
||||
{
|
||||
"epoch": 3.0,
|
||||
"eval_loss": 3.8149802684783936,
|
||||
"eval_runtime": 69.8762,
|
||||
"eval_samples_per_second": 2069.16,
|
||||
"eval_steps_per_second": 8.086,
|
||||
"step": 12615
|
||||
},
|
||||
{
|
||||
"epoch": 3.04,
|
||||
"learning_rate": 8.901373283395755e-05,
|
||||
"loss": 2.9357,
|
||||
"step": 12800
|
||||
},
|
||||
{
|
||||
"epoch": 3.09,
|
||||
"learning_rate": 8.876404494382022e-05,
|
||||
"loss": 2.9308,
|
||||
"step": 13000
|
||||
},
|
||||
{
|
||||
"epoch": 3.14,
|
||||
"learning_rate": 8.851435705368291e-05,
|
||||
"loss": 2.9432,
|
||||
"step": 13200
|
||||
},
|
||||
{
|
||||
"epoch": 3.19,
|
||||
"learning_rate": 8.826466916354557e-05,
|
||||
"loss": 2.9358,
|
||||
"step": 13400
|
||||
},
|
||||
{
|
||||
"epoch": 3.23,
|
||||
"learning_rate": 8.801498127340825e-05,
|
||||
"loss": 2.934,
|
||||
"step": 13600
|
||||
},
|
||||
{
|
||||
"epoch": 3.28,
|
||||
"learning_rate": 8.776529338327092e-05,
|
||||
"loss": 2.9329,
|
||||
"step": 13800
|
||||
},
|
||||
{
|
||||
"epoch": 3.33,
|
||||
"learning_rate": 8.75156054931336e-05,
|
||||
"loss": 2.922,
|
||||
"step": 14000
|
||||
},
|
||||
{
|
||||
"epoch": 3.38,
|
||||
"learning_rate": 8.726591760299626e-05,
|
||||
"loss": 2.9273,
|
||||
"step": 14200
|
||||
},
|
||||
{
|
||||
"epoch": 3.42,
|
||||
"learning_rate": 8.701622971285893e-05,
|
||||
"loss": 2.9251,
|
||||
"step": 14400
|
||||
},
|
||||
{
|
||||
"epoch": 3.47,
|
||||
"learning_rate": 8.67665418227216e-05,
|
||||
"loss": 2.92,
|
||||
"step": 14600
|
||||
},
|
||||
{
|
||||
"epoch": 3.52,
|
||||
"learning_rate": 8.651685393258427e-05,
|
||||
"loss": 2.9273,
|
||||
"step": 14800
|
||||
},
|
||||
{
|
||||
"epoch": 3.57,
|
||||
"learning_rate": 8.626716604244694e-05,
|
||||
"loss": 2.9232,
|
||||
"step": 15000
|
||||
},
|
||||
{
|
||||
"epoch": 3.61,
|
||||
"learning_rate": 8.601747815230962e-05,
|
||||
"loss": 2.9127,
|
||||
"step": 15200
|
||||
},
|
||||
{
|
||||
"epoch": 3.66,
|
||||
"learning_rate": 8.576779026217229e-05,
|
||||
"loss": 2.9086,
|
||||
"step": 15400
|
||||
},
|
||||
{
|
||||
"epoch": 3.71,
|
||||
"learning_rate": 8.551810237203495e-05,
|
||||
"loss": 2.9148,
|
||||
"step": 15600
|
||||
},
|
||||
{
|
||||
"epoch": 3.76,
|
||||
"learning_rate": 8.526841448189763e-05,
|
||||
"loss": 2.9116,
|
||||
"step": 15800
|
||||
},
|
||||
{
|
||||
"epoch": 3.8,
|
||||
"learning_rate": 8.50187265917603e-05,
|
||||
"loss": 2.903,
|
||||
"step": 16000
|
||||
},
|
||||
{
|
||||
"epoch": 3.85,
|
||||
"learning_rate": 8.476903870162298e-05,
|
||||
"loss": 2.9114,
|
||||
"step": 16200
|
||||
},
|
||||
{
|
||||
"epoch": 3.9,
|
||||
"learning_rate": 8.451935081148564e-05,
|
||||
"loss": 2.9135,
|
||||
"step": 16400
|
||||
},
|
||||
{
|
||||
"epoch": 3.95,
|
||||
"learning_rate": 8.426966292134831e-05,
|
||||
"loss": 2.9033,
|
||||
"step": 16600
|
||||
},
|
||||
{
|
||||
"epoch": 4.0,
|
||||
"learning_rate": 8.4019975031211e-05,
|
||||
"loss": 2.9028,
|
||||
"step": 16800
|
||||
},
|
||||
{
|
||||
"epoch": 4.0,
|
||||
"eval_loss": 3.7067978382110596,
|
||||
"eval_runtime": 69.9394,
|
||||
"eval_samples_per_second": 2067.29,
|
||||
"eval_steps_per_second": 8.078,
|
||||
"step": 16820
|
||||
},
|
||||
{
|
||||
"epoch": 4.04,
|
||||
"learning_rate": 8.377028714107366e-05,
|
||||
"loss": 2.8564,
|
||||
"step": 17000
|
||||
},
|
||||
{
|
||||
"epoch": 4.09,
|
||||
"learning_rate": 8.352059925093633e-05,
|
||||
"loss": 2.8527,
|
||||
"step": 17200
|
||||
},
|
||||
{
|
||||
"epoch": 4.14,
|
||||
"learning_rate": 8.327091136079901e-05,
|
||||
"loss": 2.8623,
|
||||
"step": 17400
|
||||
},
|
||||
{
|
||||
"epoch": 4.19,
|
||||
"learning_rate": 8.302122347066168e-05,
|
||||
"loss": 2.8583,
|
||||
"step": 17600
|
||||
},
|
||||
{
|
||||
"epoch": 4.23,
|
||||
"learning_rate": 8.277153558052434e-05,
|
||||
"loss": 2.858,
|
||||
"step": 17800
|
||||
},
|
||||
{
|
||||
"epoch": 4.28,
|
||||
"learning_rate": 8.252184769038702e-05,
|
||||
"loss": 2.849,
|
||||
"step": 18000
|
||||
},
|
||||
{
|
||||
"epoch": 4.33,
|
||||
"learning_rate": 8.22721598002497e-05,
|
||||
"loss": 2.8498,
|
||||
"step": 18200
|
||||
},
|
||||
{
|
||||
"epoch": 4.38,
|
||||
"learning_rate": 8.202247191011237e-05,
|
||||
"loss": 2.8505,
|
||||
"step": 18400
|
||||
},
|
||||
{
|
||||
"epoch": 4.42,
|
||||
"learning_rate": 8.177278401997503e-05,
|
||||
"loss": 2.857,
|
||||
"step": 18600
|
||||
},
|
||||
{
|
||||
"epoch": 4.47,
|
||||
"learning_rate": 8.15230961298377e-05,
|
||||
"loss": 2.8509,
|
||||
"step": 18800
|
||||
},
|
||||
{
|
||||
"epoch": 4.52,
|
||||
"learning_rate": 8.127340823970038e-05,
|
||||
"loss": 2.8516,
|
||||
"step": 19000
|
||||
},
|
||||
{
|
||||
"epoch": 4.57,
|
||||
"learning_rate": 8.102372034956305e-05,
|
||||
"loss": 2.858,
|
||||
"step": 19200
|
||||
},
|
||||
{
|
||||
"epoch": 4.61,
|
||||
"learning_rate": 8.077403245942571e-05,
|
||||
"loss": 2.8533,
|
||||
"step": 19400
|
||||
},
|
||||
{
|
||||
"epoch": 4.66,
|
||||
"learning_rate": 8.052434456928839e-05,
|
||||
"loss": 2.8498,
|
||||
"step": 19600
|
||||
},
|
||||
{
|
||||
"epoch": 4.71,
|
||||
"learning_rate": 8.027465667915106e-05,
|
||||
"loss": 2.8536,
|
||||
"step": 19800
|
||||
},
|
||||
{
|
||||
"epoch": 4.76,
|
||||
"learning_rate": 8.002496878901374e-05,
|
||||
"loss": 2.8533,
|
||||
"step": 20000
|
||||
},
|
||||
{
|
||||
"epoch": 4.8,
|
||||
"learning_rate": 7.97752808988764e-05,
|
||||
"loss": 2.8491,
|
||||
"step": 20200
|
||||
},
|
||||
{
|
||||
"epoch": 4.85,
|
||||
"learning_rate": 7.952559300873909e-05,
|
||||
"loss": 2.8524,
|
||||
"step": 20400
|
||||
},
|
||||
{
|
||||
"epoch": 4.9,
|
||||
"learning_rate": 7.927590511860176e-05,
|
||||
"loss": 2.8543,
|
||||
"step": 20600
|
||||
},
|
||||
{
|
||||
"epoch": 4.95,
|
||||
"learning_rate": 7.902621722846442e-05,
|
||||
"loss": 2.847,
|
||||
"step": 20800
|
||||
},
|
||||
{
|
||||
"epoch": 4.99,
|
||||
"learning_rate": 7.87765293383271e-05,
|
||||
"loss": 2.8524,
|
||||
"step": 21000
|
||||
},
|
||||
{
|
||||
"epoch": 5.0,
|
||||
"eval_loss": 3.725551128387451,
|
||||
"eval_runtime": 69.8877,
|
||||
"eval_samples_per_second": 2068.818,
|
||||
"eval_steps_per_second": 8.084,
|
||||
"step": 21025
|
||||
},
|
||||
{
|
||||
"epoch": 5.04,
|
||||
"learning_rate": 7.852684144818977e-05,
|
||||
"loss": 2.7957,
|
||||
"step": 21200
|
||||
},
|
||||
{
|
||||
"epoch": 5.09,
|
||||
"learning_rate": 7.827715355805245e-05,
|
||||
"loss": 2.7934,
|
||||
"step": 21400
|
||||
},
|
||||
{
|
||||
"epoch": 5.14,
|
||||
"learning_rate": 7.802746566791511e-05,
|
||||
"loss": 2.7955,
|
||||
"step": 21600
|
||||
},
|
||||
{
|
||||
"epoch": 5.18,
|
||||
"learning_rate": 7.777777777777778e-05,
|
||||
"loss": 2.8026,
|
||||
"step": 21800
|
||||
},
|
||||
{
|
||||
"epoch": 5.23,
|
||||
"learning_rate": 7.752808988764046e-05,
|
||||
"loss": 2.8058,
|
||||
"step": 22000
|
||||
},
|
||||
{
|
||||
"epoch": 5.28,
|
||||
"learning_rate": 7.727840199750313e-05,
|
||||
"loss": 2.8122,
|
||||
"step": 22200
|
||||
},
|
||||
{
|
||||
"epoch": 5.33,
|
||||
"learning_rate": 7.702871410736579e-05,
|
||||
"loss": 2.7967,
|
||||
"step": 22400
|
||||
},
|
||||
{
|
||||
"epoch": 5.37,
|
||||
"learning_rate": 7.677902621722847e-05,
|
||||
"loss": 2.8113,
|
||||
"step": 22600
|
||||
},
|
||||
{
|
||||
"epoch": 5.42,
|
||||
"learning_rate": 7.652933832709114e-05,
|
||||
"loss": 2.8059,
|
||||
"step": 22800
|
||||
},
|
||||
{
|
||||
"epoch": 5.47,
|
||||
"learning_rate": 7.627965043695382e-05,
|
||||
"loss": 2.8063,
|
||||
"step": 23000
|
||||
},
|
||||
{
|
||||
"epoch": 5.52,
|
||||
"learning_rate": 7.602996254681648e-05,
|
||||
"loss": 2.8093,
|
||||
"step": 23200
|
||||
},
|
||||
{
|
||||
"epoch": 5.56,
|
||||
"learning_rate": 7.578027465667915e-05,
|
||||
"loss": 2.8027,
|
||||
"step": 23400
|
||||
},
|
||||
{
|
||||
"epoch": 5.61,
|
||||
"learning_rate": 7.553058676654183e-05,
|
||||
"loss": 2.808,
|
||||
"step": 23600
|
||||
},
|
||||
{
|
||||
"epoch": 5.66,
|
||||
"learning_rate": 7.52808988764045e-05,
|
||||
"loss": 2.8086,
|
||||
"step": 23800
|
||||
},
|
||||
{
|
||||
"epoch": 5.71,
|
||||
"learning_rate": 7.503121098626716e-05,
|
||||
"loss": 2.8048,
|
||||
"step": 24000
|
||||
},
|
||||
{
|
||||
"epoch": 5.76,
|
||||
"learning_rate": 7.478152309612985e-05,
|
||||
"loss": 2.8041,
|
||||
"step": 24200
|
||||
},
|
||||
{
|
||||
"epoch": 5.8,
|
||||
"learning_rate": 7.453183520599252e-05,
|
||||
"loss": 2.8002,
|
||||
"step": 24400
|
||||
},
|
||||
{
|
||||
"epoch": 5.85,
|
||||
"learning_rate": 7.428214731585518e-05,
|
||||
"loss": 2.7973,
|
||||
"step": 24600
|
||||
},
|
||||
{
|
||||
"epoch": 5.9,
|
||||
"learning_rate": 7.403245942571786e-05,
|
||||
"loss": 2.8017,
|
||||
"step": 24800
|
||||
},
|
||||
{
|
||||
"epoch": 5.95,
|
||||
"learning_rate": 7.378277153558053e-05,
|
||||
"loss": 2.7955,
|
||||
"step": 25000
|
||||
},
|
||||
{
|
||||
"epoch": 5.99,
|
||||
"learning_rate": 7.353308364544321e-05,
|
||||
"loss": 2.7943,
|
||||
"step": 25200
|
||||
},
|
||||
{
|
||||
"epoch": 6.0,
|
||||
"eval_loss": 3.7305667400360107,
|
||||
"eval_runtime": 70.0386,
|
||||
"eval_samples_per_second": 2064.363,
|
||||
"eval_steps_per_second": 8.067,
|
||||
"step": 25230
|
||||
},
|
||||
{
|
||||
"epoch": 6.04,
|
||||
"learning_rate": 7.328339575530587e-05,
|
||||
"loss": 2.7591,
|
||||
"step": 25400
|
||||
},
|
||||
{
|
||||
"epoch": 6.09,
|
||||
"learning_rate": 7.303370786516854e-05,
|
||||
"loss": 2.7513,
|
||||
"step": 25600
|
||||
},
|
||||
{
|
||||
"epoch": 6.14,
|
||||
"learning_rate": 7.278401997503122e-05,
|
||||
"loss": 2.7542,
|
||||
"step": 25800
|
||||
},
|
||||
{
|
||||
"epoch": 6.18,
|
||||
"learning_rate": 7.253433208489388e-05,
|
||||
"loss": 2.7604,
|
||||
"step": 26000
|
||||
},
|
||||
{
|
||||
"epoch": 6.23,
|
||||
"learning_rate": 7.228464419475655e-05,
|
||||
"loss": 2.754,
|
||||
"step": 26200
|
||||
},
|
||||
{
|
||||
"epoch": 6.28,
|
||||
"learning_rate": 7.203495630461923e-05,
|
||||
"loss": 2.7608,
|
||||
"step": 26400
|
||||
},
|
||||
{
|
||||
"epoch": 6.33,
|
||||
"learning_rate": 7.17852684144819e-05,
|
||||
"loss": 2.7645,
|
||||
"step": 26600
|
||||
},
|
||||
{
|
||||
"epoch": 6.37,
|
||||
"learning_rate": 7.153558052434456e-05,
|
||||
"loss": 2.7594,
|
||||
"step": 26800
|
||||
},
|
||||
{
|
||||
"epoch": 6.42,
|
||||
"learning_rate": 7.128589263420724e-05,
|
||||
"loss": 2.7628,
|
||||
"step": 27000
|
||||
},
|
||||
{
|
||||
"epoch": 6.47,
|
||||
"learning_rate": 7.103620474406991e-05,
|
||||
"loss": 2.7642,
|
||||
"step": 27200
|
||||
},
|
||||
{
|
||||
"epoch": 6.52,
|
||||
"learning_rate": 7.078651685393259e-05,
|
||||
"loss": 2.7591,
|
||||
"step": 27400
|
||||
},
|
||||
{
|
||||
"epoch": 6.56,
|
||||
"learning_rate": 7.053682896379525e-05,
|
||||
"loss": 2.7654,
|
||||
"step": 27600
|
||||
},
|
||||
{
|
||||
"epoch": 6.61,
|
||||
"learning_rate": 7.028714107365794e-05,
|
||||
"loss": 2.7674,
|
||||
"step": 27800
|
||||
},
|
||||
{
|
||||
"epoch": 6.66,
|
||||
"learning_rate": 7.003745318352061e-05,
|
||||
"loss": 2.7636,
|
||||
"step": 28000
|
||||
},
|
||||
{
|
||||
"epoch": 6.71,
|
||||
"learning_rate": 6.978776529338327e-05,
|
||||
"loss": 2.7635,
|
||||
"step": 28200
|
||||
},
|
||||
{
|
||||
"epoch": 6.75,
|
||||
"learning_rate": 6.953807740324595e-05,
|
||||
"loss": 2.7635,
|
||||
"step": 28400
|
||||
},
|
||||
{
|
||||
"epoch": 6.8,
|
||||
"learning_rate": 6.928838951310862e-05,
|
||||
"loss": 2.7609,
|
||||
"step": 28600
|
||||
},
|
||||
{
|
||||
"epoch": 6.85,
|
||||
"learning_rate": 6.90387016229713e-05,
|
||||
"loss": 2.7588,
|
||||
"step": 28800
|
||||
},
|
||||
{
|
||||
"epoch": 6.9,
|
||||
"learning_rate": 6.878901373283396e-05,
|
||||
"loss": 2.7602,
|
||||
"step": 29000
|
||||
},
|
||||
{
|
||||
"epoch": 6.94,
|
||||
"learning_rate": 6.853932584269663e-05,
|
||||
"loss": 2.7684,
|
||||
"step": 29200
|
||||
},
|
||||
{
|
||||
"epoch": 6.99,
|
||||
"learning_rate": 6.82896379525593e-05,
|
||||
"loss": 2.7664,
|
||||
"step": 29400
|
||||
},
|
||||
{
|
||||
"epoch": 7.0,
|
||||
"eval_loss": 3.7185802459716797,
|
||||
"eval_runtime": 70.007,
|
||||
"eval_samples_per_second": 2065.293,
|
||||
"eval_steps_per_second": 8.071,
|
||||
"step": 29435
|
||||
},
|
||||
{
|
||||
"epoch": 7.0,
|
||||
"step": 29435,
|
||||
"total_flos": 4.9217522393088e+17,
|
||||
"train_loss": 3.1480036618087093,
|
||||
"train_runtime": 10171.5358,
|
||||
"train_samples_per_second": 2116.406,
|
||||
"train_steps_per_second": 8.268
|
||||
}
|
||||
],
|
||||
"max_steps": 84100,
|
||||
"num_train_epochs": 20,
|
||||
"total_flos": 4.9217522393088e+17,
|
||||
"trial_name": null,
|
||||
"trial_params": null
|
||||
}
|
||||
3
training_args.bin
Normal file
3
training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:5b9a08b1399b8418fc42b7c180502ca96705c2bc03c5dc36f3c760ead44a5021
|
||||
size 5073
|
||||
1
vocab.json
Normal file
1
vocab.json
Normal file
File diff suppressed because one or more lines are too long
Reference in New Issue
Block a user