{ "best_global_step": 146, "best_metric": 9972.7021484375, "best_model_checkpoint": "/NHNHOME/WORKSPACE/26msit001_A/mnpo/revision_qwen3_8b/full_iter1/train/inpo_avg_eta0p005_s42_nhn-b200-q3-seq-07101430-inpo/checkpoint-146", "epoch": 1.0, "eval_steps": 500, "global_step": 146, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.06864006864006864, "grad_norm": 20387.03686881509, "learning_rate": 4.990077890125363e-07, "logits/chosen": -0.796875, "logits/rejected": -0.8046875, "logps/chosen": -16.0, "logps/rejected": -15.9375, "loss": 9979.939453125, "rewards/accuracies": 0.518750011920929, "rewards/chosen": -153.50888061523438, "rewards/margins": 1.0440444946289062, "rewards/rejected": -154.55291748046875, "step": 10 }, { "epoch": 0.13728013728013727, "grad_norm": 16463.56555342243, "learning_rate": 4.879356673988089e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.84765625, "logps/chosen": -15.8125, "logps/rejected": -15.875, "loss": 9975.23828125, "rewards/accuracies": 0.5249999761581421, "rewards/chosen": -153.51373291015625, "rewards/margins": 1.252532958984375, "rewards/rejected": -154.76626586914062, "step": 20 }, { "epoch": 0.2059202059202059, "grad_norm": 28044.862093220032, "learning_rate": 4.6510039481503485e-07, "logits/chosen": -0.74609375, "logits/rejected": -0.7421875, "logps/chosen": -16.0, "logps/rejected": -16.0, "loss": 9996.552734375, "rewards/accuracies": 0.48124998807907104, "rewards/chosen": -155.00054931640625, "rewards/margins": 0.214385986328125, "rewards/rejected": -155.21493530273438, "step": 30 }, { "epoch": 0.27456027456027454, "grad_norm": 19615.09853150976, "learning_rate": 4.3163090985954074e-07, "logits/chosen": -0.734375, "logits/rejected": -0.74609375, "logps/chosen": -16.0, "logps/rejected": -16.0, "loss": 9994.1796875, "rewards/accuracies": 0.53125, "rewards/chosen": -155.23875427246094, "rewards/margins": 0.32525634765625, "rewards/rejected": -155.56399536132812, "step": 40 }, { "epoch": 0.3432003432003432, "grad_norm": 18075.561008642915, "learning_rate": 3.891818892301304e-07, "logits/chosen": -0.71484375, "logits/rejected": -0.71875, "logps/chosen": -16.125, "logps/rejected": -16.125, "loss": 9973.58203125, "rewards/accuracies": 0.518750011920929, "rewards/chosen": -154.60614013671875, "rewards/margins": 1.3658523559570312, "rewards/rejected": -155.9720001220703, "step": 50 }, { "epoch": 0.4118404118404118, "grad_norm": 21829.673229552107, "learning_rate": 3.3985194320937815e-07, "logits/chosen": -0.6953125, "logits/rejected": -0.6875, "logps/chosen": -16.125, "logps/rejected": -16.125, "loss": 9989.525390625, "rewards/accuracies": 0.550000011920929, "rewards/chosen": -156.18487548828125, "rewards/margins": 0.5427627563476562, "rewards/rejected": -156.72763061523438, "step": 60 }, { "epoch": 0.4804804804804805, "grad_norm": 19354.982747194757, "learning_rate": 2.8607986379820664e-07, "logits/chosen": -0.66015625, "logits/rejected": -0.6484375, "logps/chosen": -16.0, "logps/rejected": -16.125, "loss": 9972.458984375, "rewards/accuracies": 0.581250011920929, "rewards/chosen": -155.47698974609375, "rewards/margins": 1.410614013671875, "rewards/rejected": -156.88760375976562, "step": 70 }, { "epoch": 0.5491205491205491, "grad_norm": 23696.769639901566, "learning_rate": 2.3052405482064919e-07, "logits/chosen": -0.65625, "logits/rejected": -0.67578125, "logps/chosen": -16.125, "logps/rejected": -16.0, "loss": 9998.822265625, "rewards/accuracies": 0.4749999940395355, "rewards/chosen": -155.87271118164062, "rewards/margins": 0.087371826171875, "rewards/rejected": -155.9600830078125, "step": 80 }, { "epoch": 0.6177606177606177, "grad_norm": 40006.950593012094, "learning_rate": 1.7593110477859152e-07, "logits/chosen": -0.67578125, "logits/rejected": -0.671875, "logps/chosen": -16.0, "logps/rejected": -16.0, "loss": 9985.57421875, "rewards/accuracies": 0.543749988079071, "rewards/chosen": -154.62530517578125, "rewards/margins": 0.742950439453125, "rewards/rejected": -155.36825561523438, "step": 90 }, { "epoch": 0.6864006864006864, "grad_norm": 18244.96636423906, "learning_rate": 1.2500000000000005e-07, "logits/chosen": -0.62890625, "logits/rejected": -0.6171875, "logps/chosen": -16.0, "logps/rejected": -16.0, "loss": 9980.126953125, "rewards/accuracies": 0.5874999761581421, "rewards/chosen": -154.44403076171875, "rewards/margins": 1.02630615234375, "rewards/rejected": -155.47032165527344, "step": 100 }, { "epoch": 0.7550407550407551, "grad_norm": 27502.551311382453, "learning_rate": 8.024869116091879e-08, "logits/chosen": -0.6484375, "logits/rejected": -0.62890625, "logps/chosen": -16.0, "logps/rejected": -16.125, "loss": 9976.1513671875, "rewards/accuracies": 0.5687500238418579, "rewards/chosen": -155.1019287109375, "rewards/margins": 1.234588623046875, "rewards/rejected": -156.33651733398438, "step": 110 }, { "epoch": 0.8236808236808236, "grad_norm": 19647.533994105936, "learning_rate": 4.388960991455998e-08, "logits/chosen": -0.58984375, "logits/rejected": -0.59375, "logps/chosen": -16.125, "logps/rejected": -16.125, "loss": 9963.115234375, "rewards/accuracies": 0.550000011920929, "rewards/chosen": -154.8621826171875, "rewards/margins": 1.900604248046875, "rewards/rejected": -156.76278686523438, "step": 120 }, { "epoch": 0.8923208923208923, "grad_norm": 20937.34630051602, "learning_rate": 1.7720289882128092e-08, "logits/chosen": -0.62109375, "logits/rejected": -0.609375, "logps/chosen": -16.0, "logps/rejected": -16.0, "loss": 9983.845703125, "rewards/accuracies": 0.53125, "rewards/chosen": -155.11953735351562, "rewards/margins": 0.8319244384765625, "rewards/rejected": -155.9514617919922, "step": 130 }, { "epoch": 0.960960960960961, "grad_norm": 20078.25155988699, "learning_rate": 3.0344995250326245e-09, "logits/chosen": -0.578125, "logits/rejected": -0.58984375, "logps/chosen": -16.0, "logps/rejected": -16.0, "loss": 9975.1064453125, "rewards/accuracies": 0.5562499761581421, "rewards/chosen": -155.063720703125, "rewards/margins": 1.2694091796875, "rewards/rejected": -156.3331298828125, "step": 140 }, { "epoch": 1.0, "eval_logits/chosen": -0.63671875, "eval_logits/rejected": -0.60546875, "eval_logps/chosen": -15.9375, "eval_logps/rejected": -16.0, "eval_loss": 9972.7021484375, "eval_rewards/accuracies": 0.5526315569877625, "eval_rewards/chosen": -155.34686279296875, "eval_rewards/margins": 1.3776253461837769, "eval_rewards/rejected": -156.7244873046875, "eval_runtime": 68.5896, "eval_samples_per_second": 8.806, "eval_steps_per_second": 1.108, "step": 146 }, { "epoch": 1.0, "step": 146, "total_flos": 0.0, "train_loss": 9980.011584974314, "train_runtime": 3282.8375, "train_samples_per_second": 5.679, "train_steps_per_second": 0.044 } ], "logging_steps": 10, "max_steps": 146, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }