Files
OpsLM-v1/last-checkpoint/trainer_state.json

207 lines
5.0 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.98876404494382,
"eval_steps": 50,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.149812734082397,
"grad_norm": 0.5950071811676025,
"learning_rate": 0.00016363636363636366,
"loss": 2.3793,
"step": 10
},
{
"epoch": 0.299625468164794,
"grad_norm": 0.6472743153572083,
"learning_rate": 0.00019912640693269752,
"loss": 1.9763,
"step": 20
},
{
"epoch": 0.449438202247191,
"grad_norm": 0.4513455033302307,
"learning_rate": 0.00019560357815343577,
"loss": 1.7276,
"step": 30
},
{
"epoch": 0.599250936329588,
"grad_norm": 0.41116923093795776,
"learning_rate": 0.00018947293298207635,
"loss": 1.7337,
"step": 40
},
{
"epoch": 0.7490636704119851,
"grad_norm": 0.516603410243988,
"learning_rate": 0.00018090169943749476,
"loss": 1.5853,
"step": 50
},
{
"epoch": 0.7490636704119851,
"eval_loss": 1.577757716178894,
"eval_runtime": 8.4577,
"eval_samples_per_second": 6.976,
"eval_steps_per_second": 1.774,
"step": 50
},
{
"epoch": 0.898876404494382,
"grad_norm": 0.534030556678772,
"learning_rate": 0.00017012367842724887,
"loss": 1.59,
"step": 60
},
{
"epoch": 1.0449438202247192,
"grad_norm": 0.40544188022613525,
"learning_rate": 0.00015743286626829437,
"loss": 1.5288,
"step": 70
},
{
"epoch": 1.1947565543071161,
"grad_norm": 0.5801761746406555,
"learning_rate": 0.00014317543523384928,
"loss": 1.4823,
"step": 80
},
{
"epoch": 1.344569288389513,
"grad_norm": 0.5626828670501709,
"learning_rate": 0.00012774029087618446,
"loss": 1.4503,
"step": 90
},
{
"epoch": 1.49438202247191,
"grad_norm": 0.6915966272354126,
"learning_rate": 0.00011154846369695863,
"loss": 1.4354,
"step": 100
},
{
"epoch": 1.49438202247191,
"eval_loss": 1.5176668167114258,
"eval_runtime": 7.8374,
"eval_samples_per_second": 7.528,
"eval_steps_per_second": 1.914,
"step": 100
},
{
"epoch": 1.6441947565543071,
"grad_norm": 0.6429805159568787,
"learning_rate": 9.504162453267777e-05,
"loss": 1.4173,
"step": 110
},
{
"epoch": 1.7940074906367043,
"grad_norm": 0.5912101864814758,
"learning_rate": 7.867003692562534e-05,
"loss": 1.3651,
"step": 120
},
{
"epoch": 1.9438202247191012,
"grad_norm": 0.6238114237785339,
"learning_rate": 6.28802751081779e-05,
"loss": 1.4081,
"step": 130
},
{
"epoch": 2.0898876404494384,
"grad_norm": 0.5546865463256836,
"learning_rate": 4.810304262187852e-05,
"loss": 1.3884,
"step": 140
},
{
"epoch": 2.2397003745318353,
"grad_norm": 0.7205243110656738,
"learning_rate": 3.4741423847583134e-05,
"loss": 1.1613,
"step": 150
},
{
"epoch": 2.2397003745318353,
"eval_loss": 1.5284953117370605,
"eval_runtime": 7.895,
"eval_samples_per_second": 7.473,
"eval_steps_per_second": 1.9,
"step": 150
},
{
"epoch": 2.3895131086142323,
"grad_norm": 0.7052301168441772,
"learning_rate": 2.315988891431412e-05,
"loss": 1.2287,
"step": 160
},
{
"epoch": 2.539325842696629,
"grad_norm": 0.8039580583572388,
"learning_rate": 1.3674351904242611e-05,
"loss": 1.2225,
"step": 170
},
{
"epoch": 2.689138576779026,
"grad_norm": 0.8460856080055237,
"learning_rate": 6.543553540053926e-06,
"loss": 1.2547,
"step": 180
},
{
"epoch": 2.8389513108614235,
"grad_norm": 0.869657039642334,
"learning_rate": 1.9620034125190644e-06,
"loss": 1.1826,
"step": 190
},
{
"epoch": 2.98876404494382,
"grad_norm": 0.7707263827323914,
"learning_rate": 5.467426590739511e-08,
"loss": 1.1658,
"step": 200
},
{
"epoch": 2.98876404494382,
"eval_loss": 1.527919888496399,
"eval_runtime": 7.7439,
"eval_samples_per_second": 7.619,
"eval_steps_per_second": 1.937,
"step": 200
}
],
"logging_steps": 10,
"max_steps": 201,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 7623466959651840.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}