Files
qwen3-8b-inpo-avg-eta0p005-s42/trainer_state.json

270 lines
8.4 KiB
JSON
Raw Normal View History

{
"best_global_step": 146,
"best_metric": 9972.7021484375,
"best_model_checkpoint": "/NHNHOME/WORKSPACE/26msit001_A/mnpo/revision_qwen3_8b/full_iter1/train/inpo_avg_eta0p005_s42_nhn-b200-q3-seq-07101430-inpo/checkpoint-146",
"epoch": 1.0,
"eval_steps": 500,
"global_step": 146,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.06864006864006864,
"grad_norm": 20387.03686881509,
"learning_rate": 4.990077890125363e-07,
"logits/chosen": -0.796875,
"logits/rejected": -0.8046875,
"logps/chosen": -16.0,
"logps/rejected": -15.9375,
"loss": 9979.939453125,
"rewards/accuracies": 0.518750011920929,
"rewards/chosen": -153.50888061523438,
"rewards/margins": 1.0440444946289062,
"rewards/rejected": -154.55291748046875,
"step": 10
},
{
"epoch": 0.13728013728013727,
"grad_norm": 16463.56555342243,
"learning_rate": 4.879356673988089e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.84765625,
"logps/chosen": -15.8125,
"logps/rejected": -15.875,
"loss": 9975.23828125,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": -153.51373291015625,
"rewards/margins": 1.252532958984375,
"rewards/rejected": -154.76626586914062,
"step": 20
},
{
"epoch": 0.2059202059202059,
"grad_norm": 28044.862093220032,
"learning_rate": 4.6510039481503485e-07,
"logits/chosen": -0.74609375,
"logits/rejected": -0.7421875,
"logps/chosen": -16.0,
"logps/rejected": -16.0,
"loss": 9996.552734375,
"rewards/accuracies": 0.48124998807907104,
"rewards/chosen": -155.00054931640625,
"rewards/margins": 0.214385986328125,
"rewards/rejected": -155.21493530273438,
"step": 30
},
{
"epoch": 0.27456027456027454,
"grad_norm": 19615.09853150976,
"learning_rate": 4.3163090985954074e-07,
"logits/chosen": -0.734375,
"logits/rejected": -0.74609375,
"logps/chosen": -16.0,
"logps/rejected": -16.0,
"loss": 9994.1796875,
"rewards/accuracies": 0.53125,
"rewards/chosen": -155.23875427246094,
"rewards/margins": 0.32525634765625,
"rewards/rejected": -155.56399536132812,
"step": 40
},
{
"epoch": 0.3432003432003432,
"grad_norm": 18075.561008642915,
"learning_rate": 3.891818892301304e-07,
"logits/chosen": -0.71484375,
"logits/rejected": -0.71875,
"logps/chosen": -16.125,
"logps/rejected": -16.125,
"loss": 9973.58203125,
"rewards/accuracies": 0.518750011920929,
"rewards/chosen": -154.60614013671875,
"rewards/margins": 1.3658523559570312,
"rewards/rejected": -155.9720001220703,
"step": 50
},
{
"epoch": 0.4118404118404118,
"grad_norm": 21829.673229552107,
"learning_rate": 3.3985194320937815e-07,
"logits/chosen": -0.6953125,
"logits/rejected": -0.6875,
"logps/chosen": -16.125,
"logps/rejected": -16.125,
"loss": 9989.525390625,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": -156.18487548828125,
"rewards/margins": 0.5427627563476562,
"rewards/rejected": -156.72763061523438,
"step": 60
},
{
"epoch": 0.4804804804804805,
"grad_norm": 19354.982747194757,
"learning_rate": 2.8607986379820664e-07,
"logits/chosen": -0.66015625,
"logits/rejected": -0.6484375,
"logps/chosen": -16.0,
"logps/rejected": -16.125,
"loss": 9972.458984375,
"rewards/accuracies": 0.581250011920929,
"rewards/chosen": -155.47698974609375,
"rewards/margins": 1.410614013671875,
"rewards/rejected": -156.88760375976562,
"step": 70
},
{
"epoch": 0.5491205491205491,
"grad_norm": 23696.769639901566,
"learning_rate": 2.3052405482064919e-07,
"logits/chosen": -0.65625,
"logits/rejected": -0.67578125,
"logps/chosen": -16.125,
"logps/rejected": -16.0,
"loss": 9998.822265625,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": -155.87271118164062,
"rewards/margins": 0.087371826171875,
"rewards/rejected": -155.9600830078125,
"step": 80
},
{
"epoch": 0.6177606177606177,
"grad_norm": 40006.950593012094,
"learning_rate": 1.7593110477859152e-07,
"logits/chosen": -0.67578125,
"logits/rejected": -0.671875,
"logps/chosen": -16.0,
"logps/rejected": -16.0,
"loss": 9985.57421875,
"rewards/accuracies": 0.543749988079071,
"rewards/chosen": -154.62530517578125,
"rewards/margins": 0.742950439453125,
"rewards/rejected": -155.36825561523438,
"step": 90
},
{
"epoch": 0.6864006864006864,
"grad_norm": 18244.96636423906,
"learning_rate": 1.2500000000000005e-07,
"logits/chosen": -0.62890625,
"logits/rejected": -0.6171875,
"logps/chosen": -16.0,
"logps/rejected": -16.0,
"loss": 9980.126953125,
"rewards/accuracies": 0.5874999761581421,
"rewards/chosen": -154.44403076171875,
"rewards/margins": 1.02630615234375,
"rewards/rejected": -155.47032165527344,
"step": 100
},
{
"epoch": 0.7550407550407551,
"grad_norm": 27502.551311382453,
"learning_rate": 8.024869116091879e-08,
"logits/chosen": -0.6484375,
"logits/rejected": -0.62890625,
"logps/chosen": -16.0,
"logps/rejected": -16.125,
"loss": 9976.1513671875,
"rewards/accuracies": 0.5687500238418579,
"rewards/chosen": -155.1019287109375,
"rewards/margins": 1.234588623046875,
"rewards/rejected": -156.33651733398438,
"step": 110
},
{
"epoch": 0.8236808236808236,
"grad_norm": 19647.533994105936,
"learning_rate": 4.388960991455998e-08,
"logits/chosen": -0.58984375,
"logits/rejected": -0.59375,
"logps/chosen": -16.125,
"logps/rejected": -16.125,
"loss": 9963.115234375,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": -154.8621826171875,
"rewards/margins": 1.900604248046875,
"rewards/rejected": -156.76278686523438,
"step": 120
},
{
"epoch": 0.8923208923208923,
"grad_norm": 20937.34630051602,
"learning_rate": 1.7720289882128092e-08,
"logits/chosen": -0.62109375,
"logits/rejected": -0.609375,
"logps/chosen": -16.0,
"logps/rejected": -16.0,
"loss": 9983.845703125,
"rewards/accuracies": 0.53125,
"rewards/chosen": -155.11953735351562,
"rewards/margins": 0.8319244384765625,
"rewards/rejected": -155.9514617919922,
"step": 130
},
{
"epoch": 0.960960960960961,
"grad_norm": 20078.25155988699,
"learning_rate": 3.0344995250326245e-09,
"logits/chosen": -0.578125,
"logits/rejected": -0.58984375,
"logps/chosen": -16.0,
"logps/rejected": -16.0,
"loss": 9975.1064453125,
"rewards/accuracies": 0.5562499761581421,
"rewards/chosen": -155.063720703125,
"rewards/margins": 1.2694091796875,
"rewards/rejected": -156.3331298828125,
"step": 140
},
{
"epoch": 1.0,
"eval_logits/chosen": -0.63671875,
"eval_logits/rejected": -0.60546875,
"eval_logps/chosen": -15.9375,
"eval_logps/rejected": -16.0,
"eval_loss": 9972.7021484375,
"eval_rewards/accuracies": 0.5526315569877625,
"eval_rewards/chosen": -155.34686279296875,
"eval_rewards/margins": 1.3776253461837769,
"eval_rewards/rejected": -156.7244873046875,
"eval_runtime": 68.5896,
"eval_samples_per_second": 8.806,
"eval_steps_per_second": 1.108,
"step": 146
},
{
"epoch": 1.0,
"step": 146,
"total_flos": 0.0,
"train_loss": 9980.011584974314,
"train_runtime": 3282.8375,
"train_samples_per_second": 5.679,
"train_steps_per_second": 0.044
}
],
"logging_steps": 10,
"max_steps": 146,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}