Files
qwen3-8b-ipo-avg-beta0p1-s42/trainer_state.json

270 lines
8.5 KiB
JSON
Raw Permalink Normal View History

{
"best_global_step": 146,
"best_metric": 23.90784454345703,
"best_model_checkpoint": "/NHNHOME/WORKSPACE/26msit001_A/mnpo/revision_qwen3_8b/full_iter1/train/ipo_avg_beta0p1_s42_nhn-b200-q3-seq-07101430-ipo/checkpoint-146",
"epoch": 1.0,
"eval_steps": 500,
"global_step": 146,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.06864006864006864,
"grad_norm": 946.3972141968312,
"learning_rate": 3e-07,
"logits/chosen": -0.8046875,
"logits/rejected": -0.8125,
"logps/chosen": -16.0,
"logps/rejected": -15.9375,
"loss": 24.708133697509766,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": -153.47763061523438,
"rewards/margins": 1.1338882446289062,
"rewards/rejected": -154.61151123046875,
"step": 10
},
{
"epoch": 0.13728013728013727,
"grad_norm": 1114.6296794744821,
"learning_rate": 4.988506452457066e-07,
"logits/chosen": -0.88671875,
"logits/rejected": -0.86328125,
"logps/chosen": -15.8125,
"logps/rejected": -15.875,
"loss": 23.966333389282227,
"rewards/accuracies": 0.5062500238418579,
"rewards/chosen": -153.10357666015625,
"rewards/margins": 1.342376708984375,
"rewards/rejected": -154.44595336914062,
"step": 20
},
{
"epoch": 0.2059202059202059,
"grad_norm": 889.7596588174916,
"learning_rate": 4.860414659112948e-07,
"logits/chosen": -0.7734375,
"logits/rejected": -0.78125,
"logps/chosen": -15.9375,
"logps/rejected": -15.875,
"loss": 25.885950088500977,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": -154.28179931640625,
"rewards/margins": -0.187957763671875,
"rewards/rejected": -154.09384155273438,
"step": 30
},
{
"epoch": 0.27456027456027454,
"grad_norm": 849.2347387176682,
"learning_rate": 4.597220474379125e-07,
"logits/chosen": -0.78125,
"logits/rejected": -0.79296875,
"logps/chosen": -15.875,
"logps/rejected": -15.875,
"loss": 25.355098724365234,
"rewards/accuracies": 0.5562499761581421,
"rewards/chosen": -153.62156677246094,
"rewards/margins": 0.29400634765625,
"rewards/rejected": -153.91555786132812,
"step": 40
},
{
"epoch": 0.3432003432003432,
"grad_norm": 841.6754120513388,
"learning_rate": 4.2139882699413613e-07,
"logits/chosen": -0.7890625,
"logits/rejected": -0.78125,
"logps/chosen": -15.875,
"logps/rejected": -15.8125,
"loss": 24.766250610351562,
"rewards/accuracies": 0.518750011920929,
"rewards/chosen": -152.64520263671875,
"rewards/margins": 0.9361648559570312,
"rewards/rejected": -153.5813751220703,
"step": 50
},
{
"epoch": 0.4118404118404118,
"grad_norm": 881.2956684704218,
"learning_rate": 3.7326529999303633e-07,
"logits/chosen": -0.77734375,
"logits/rejected": -0.78125,
"logps/chosen": -15.75,
"logps/rejected": -15.6875,
"loss": 25.237834930419922,
"rewards/accuracies": 0.5562499761581421,
"rewards/chosen": -152.76690673828125,
"rewards/margins": 0.15995025634765625,
"rewards/rejected": -152.92684936523438,
"step": 60
},
{
"epoch": 0.4804804804804805,
"grad_norm": 847.5060900325763,
"learning_rate": 3.1807647161082797e-07,
"logits/chosen": -0.7890625,
"logits/rejected": -0.76953125,
"logps/chosen": -15.625,
"logps/rejected": -15.625,
"loss": 24.342920303344727,
"rewards/accuracies": 0.5874999761581421,
"rewards/chosen": -151.05902099609375,
"rewards/margins": 1.297332763671875,
"rewards/rejected": -152.35635375976562,
"step": 70
},
{
"epoch": 0.5491205491205491,
"grad_norm": 1018.8684011913645,
"learning_rate": 2.5899116932879534e-07,
"logits/chosen": -0.78515625,
"logits/rejected": -0.80078125,
"logps/chosen": -15.625,
"logps/rejected": -15.625,
"loss": 25.037967681884766,
"rewards/accuracies": 0.5,
"rewards/chosen": -151.04458618164062,
"rewards/margins": 0.520965576171875,
"rewards/rejected": -151.5655517578125,
"step": 80
},
{
"epoch": 0.6177606177606177,
"grad_norm": 845.4769875876663,
"learning_rate": 1.993912420112756e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.828125,
"logps/chosen": -15.5,
"logps/rejected": -15.4375,
"loss": 24.371807098388672,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": -149.18389892578125,
"rewards/margins": 1.032012939453125,
"rewards/rejected": -150.21591186523438,
"step": 90
},
{
"epoch": 0.6864006864006864,
"grad_norm": 741.7784259326611,
"learning_rate": 1.426879939713322e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.796875,
"logps/chosen": -15.375,
"logps/rejected": -15.4375,
"loss": 24.30291748046875,
"rewards/accuracies": 0.581250011920929,
"rewards/chosen": -148.29949951171875,
"rewards/margins": 1.22161865234375,
"rewards/rejected": -149.52110290527344,
"step": 100
},
{
"epoch": 0.7550407550407551,
"grad_norm": 891.2761904365972,
"learning_rate": 9.212693310317479e-08,
"logits/chosen": -0.81640625,
"logits/rejected": -0.80859375,
"logps/chosen": -15.4375,
"logps/rejected": -15.4375,
"loss": 24.666929244995117,
"rewards/accuracies": 0.512499988079071,
"rewards/chosen": -148.9534912109375,
"rewards/margins": 0.953338623046875,
"rewards/rejected": -149.90682983398438,
"step": 110
},
{
"epoch": 0.8236808236808236,
"grad_norm": 837.0292977089434,
"learning_rate": 5.060200865767605e-08,
"logits/chosen": -0.77734375,
"logits/rejected": -0.78515625,
"logps/chosen": -15.5,
"logps/rejected": -15.5,
"loss": 24.336681365966797,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": -148.3778076171875,
"rewards/margins": 1.705291748046875,
"rewards/rejected": -150.08309936523438,
"step": 120
},
{
"epoch": 0.8923208923208923,
"grad_norm": 912.1427660596082,
"learning_rate": 2.0489971081290193e-08,
"logits/chosen": -0.79296875,
"logits/rejected": -0.77734375,
"logps/chosen": -15.3125,
"logps/rejected": -15.375,
"loss": 24.866641998291016,
"rewards/accuracies": 0.512499988079071,
"rewards/chosen": -148.61953735351562,
"rewards/margins": 0.5936431884765625,
"rewards/rejected": -149.2131805419922,
"step": 130
},
{
"epoch": 0.960960960960961,
"grad_norm": 1236.4699022849795,
"learning_rate": 3.5143346177878565e-09,
"logits/chosen": -0.77734375,
"logits/rejected": -0.78125,
"logps/chosen": -15.375,
"logps/rejected": -15.375,
"loss": 24.20675277709961,
"rewards/accuracies": 0.5562499761581421,
"rewards/chosen": -148.130126953125,
"rewards/margins": 1.1678466796875,
"rewards/rejected": -149.2979736328125,
"step": 140
},
{
"epoch": 1.0,
"eval_logits/chosen": -0.8125,
"eval_logits/rejected": -0.7734375,
"eval_logps/chosen": -15.25,
"eval_logps/rejected": -15.375,
"eval_loss": 23.90784454345703,
"eval_rewards/accuracies": 0.5526315569877625,
"eval_rewards/chosen": -148.4471893310547,
"eval_rewards/margins": 1.3118354082107544,
"eval_rewards/rejected": -149.759033203125,
"eval_runtime": 70.7414,
"eval_samples_per_second": 8.538,
"eval_steps_per_second": 1.074,
"step": 146
},
{
"epoch": 1.0,
"step": 146,
"total_flos": 0.0,
"train_loss": 24.544400567877783,
"train_runtime": 3326.8166,
"train_samples_per_second": 5.604,
"train_steps_per_second": 0.044
}
],
"logging_steps": 10,
"max_steps": 146,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}