84 lines
1.9 KiB
JSON
84 lines
1.9 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.3861003861003861,
|
|
"eval_steps": 500,
|
|
"global_step": 150,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.05148005148005148,
|
|
"grad_norm": 3.7984347343444824,
|
|
"learning_rate": 2.435897435897436e-06,
|
|
"loss": 3.0721,
|
|
"step": 20
|
|
},
|
|
{
|
|
"epoch": 0.10296010296010295,
|
|
"grad_norm": 2.0532360076904297,
|
|
"learning_rate": 5e-06,
|
|
"loss": 2.7105,
|
|
"step": 40
|
|
},
|
|
{
|
|
"epoch": 0.15444015444015444,
|
|
"grad_norm": 1.889143466949463,
|
|
"learning_rate": 7.564102564102564e-06,
|
|
"loss": 2.397,
|
|
"step": 60
|
|
},
|
|
{
|
|
"epoch": 0.2059202059202059,
|
|
"grad_norm": 2.206676959991455,
|
|
"learning_rate": 9.999949644960027e-06,
|
|
"loss": 2.1587,
|
|
"step": 80
|
|
},
|
|
{
|
|
"epoch": 0.2574002574002574,
|
|
"grad_norm": 2.4184727668762207,
|
|
"learning_rate": 9.9778098230154e-06,
|
|
"loss": 1.9613,
|
|
"step": 100
|
|
},
|
|
{
|
|
"epoch": 0.3088803088803089,
|
|
"grad_norm": 2.1078503131866455,
|
|
"learning_rate": 9.915591603280632e-06,
|
|
"loss": 1.9187,
|
|
"step": 120
|
|
},
|
|
{
|
|
"epoch": 0.36036036036036034,
|
|
"grad_norm": 2.228259801864624,
|
|
"learning_rate": 9.813795930277306e-06,
|
|
"loss": 1.863,
|
|
"step": 140
|
|
}
|
|
],
|
|
"logging_steps": 20,
|
|
"max_steps": 778,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 2,
|
|
"save_steps": 50,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1.0967871654039552e+16,
|
|
"train_batch_size": 4,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|