Files
v24_v15_cot_light_repair_lr…/trainer_state.json

191 lines
4.6 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.351575456053068,
"eval_steps": 500,
"global_step": 106,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.01658374792703151,
"grad_norm": 26.625,
"learning_rate": 2.4994186045291896e-06,
"loss": 1.9901918411254882,
"step": 5
},
{
"epoch": 0.03316749585406302,
"grad_norm": 21.75,
"learning_rate": 2.4791264942053156e-06,
"loss": 2.094209098815918,
"step": 10
},
{
"epoch": 0.04975124378109453,
"grad_norm": 19.25,
"learning_rate": 2.4303031863746234e-06,
"loss": 1.80328426361084,
"step": 15
},
{
"epoch": 0.06633499170812604,
"grad_norm": 26.375,
"learning_rate": 2.354081995993076e-06,
"loss": 2.002113914489746,
"step": 20
},
{
"epoch": 0.08291873963515754,
"grad_norm": 20.375,
"learning_rate": 2.2522322135667634e-06,
"loss": 1.559170913696289,
"step": 25
},
{
"epoch": 0.09950248756218906,
"grad_norm": 12.6875,
"learning_rate": 2.127118035353867e-06,
"loss": 1.7275423049926757,
"step": 30
},
{
"epoch": 0.11608623548922056,
"grad_norm": 23.125,
"learning_rate": 1.9816436842690527e-06,
"loss": 1.4820417404174804,
"step": 35
},
{
"epoch": 0.13266998341625208,
"grad_norm": 10.8125,
"learning_rate": 1.819185995375714e-06,
"loss": 1.4906288146972657,
"step": 40
},
{
"epoch": 0.14925373134328357,
"grad_norm": 12.6875,
"learning_rate": 1.6435160308307313e-06,
"loss": 1.7329635620117188,
"step": 45
},
{
"epoch": 0.16583747927031509,
"grad_norm": 36.75,
"learning_rate": 1.458711543801153e-06,
"loss": 1.8760557174682617,
"step": 50
},
{
"epoch": 0.1824212271973466,
"grad_norm": 10.5625,
"learning_rate": 1.2690623232911575e-06,
"loss": 1.546410369873047,
"step": 55
},
{
"epoch": 0.19900497512437812,
"grad_norm": 46.25,
"learning_rate": 1.0789706170701125e-06,
"loss": 1.8373964309692383,
"step": 60
},
{
"epoch": 0.2155887230514096,
"grad_norm": 54.25,
"learning_rate": 8.928489441425056e-07,
"loss": 2.1412117004394533,
"step": 65
},
{
"epoch": 0.23217247097844113,
"grad_norm": 17.75,
"learning_rate": 7.15017668796009e-07,
"loss": 1.5714065551757812,
"step": 70
},
{
"epoch": 0.24875621890547264,
"grad_norm": 10.8125,
"learning_rate": 5.496047137983128e-07,
"loss": 1.6369653701782227,
"step": 75
},
{
"epoch": 0.26533996683250416,
"grad_norm": 17.625,
"learning_rate": 4.0044974065819974e-07,
"loss": 1.8116127014160157,
"step": 80
},
{
"epoch": 0.28192371475953565,
"grad_norm": 12.1875,
"learning_rate": 2.7101502117425833e-07,
"loss": 1.5387956619262695,
"step": 85
},
{
"epoch": 0.29850746268656714,
"grad_norm": 12.3125,
"learning_rate": 1.6430506917256422e-07,
"loss": 1.850395393371582,
"step": 90
},
{
"epoch": 0.3150912106135987,
"grad_norm": 7.78125,
"learning_rate": 8.279689798808068e-08,
"loss": 1.588356113433838,
"step": 95
},
{
"epoch": 0.33167495854063017,
"grad_norm": 7.0,
"learning_rate": 2.8382522593593807e-08,
"loss": 1.513393497467041,
"step": 100
},
{
"epoch": 0.3482587064676617,
"grad_norm": 56.75,
"learning_rate": 2.3250410501327037e-09,
"loss": 1.58885498046875,
"step": 105
},
{
"epoch": 0.351575456053068,
"step": 106,
"total_flos": 5.062818542541619e+16,
"train_loss": 1.7334247456406646,
"train_runtime": 876.5295,
"train_samples_per_second": 0.482,
"train_steps_per_second": 0.121
}
],
"logging_steps": 5,
"max_steps": 106,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5.062818542541619e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}