479 lines
15 KiB
JSON
479 lines
15 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 1.0,
|
|
"eval_steps": 500,
|
|
"global_step": 292,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.03432003432003432,
|
|
"grad_norm": 10.203938715992143,
|
|
"learning_rate": 1.5e-07,
|
|
"logits/chosen": -1.8046875,
|
|
"logits/rejected": -1.734375,
|
|
"logps/chosen": -0.28125,
|
|
"logps/rejected": -0.283203125,
|
|
"loss": 1.3126378059387207,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 2.9130210876464844,
|
|
"rewards/margins": 0.8968315124511719,
|
|
"rewards/rejected": 2.0161895751953125,
|
|
"step": 10
|
|
},
|
|
{
|
|
"epoch": 0.06864006864006864,
|
|
"grad_norm": 34.812950350142344,
|
|
"learning_rate": 3.166666666666666e-07,
|
|
"logits/chosen": -1.734375,
|
|
"logits/rejected": -1.71875,
|
|
"logps/chosen": -0.28515625,
|
|
"logps/rejected": -0.296875,
|
|
"loss": 1.2969410419464111,
|
|
"rewards/accuracies": 0.887499988079071,
|
|
"rewards/chosen": 3.2256202697753906,
|
|
"rewards/margins": 1.8563461303710938,
|
|
"rewards/rejected": 1.3692741394042969,
|
|
"step": 20
|
|
},
|
|
{
|
|
"epoch": 0.10296010296010295,
|
|
"grad_norm": 18.043733604549054,
|
|
"learning_rate": 4.833333333333333e-07,
|
|
"logits/chosen": -1.8828125,
|
|
"logits/rejected": -1.828125,
|
|
"logps/chosen": -0.2578125,
|
|
"logps/rejected": -0.27734375,
|
|
"loss": 1.2808767557144165,
|
|
"rewards/accuracies": 0.8500000238418579,
|
|
"rewards/chosen": 2.254518508911133,
|
|
"rewards/margins": 0.9522342681884766,
|
|
"rewards/rejected": 1.3022842407226562,
|
|
"step": 30
|
|
},
|
|
{
|
|
"epoch": 0.13728013728013727,
|
|
"grad_norm": 14.522579405037842,
|
|
"learning_rate": 4.985456442051682e-07,
|
|
"logits/chosen": -1.7421875,
|
|
"logits/rejected": -1.7578125,
|
|
"logps/chosen": -0.28515625,
|
|
"logps/rejected": -0.30078125,
|
|
"loss": 1.2971984148025513,
|
|
"rewards/accuracies": 0.8687499761581421,
|
|
"rewards/chosen": 2.7966461181640625,
|
|
"rewards/margins": 0.865142822265625,
|
|
"rewards/rejected": 1.9315032958984375,
|
|
"step": 40
|
|
},
|
|
{
|
|
"epoch": 0.1716001716001716,
|
|
"grad_norm": 9.44153398614957,
|
|
"learning_rate": 4.935399618791793e-07,
|
|
"logits/chosen": -1.6953125,
|
|
"logits/rejected": -1.671875,
|
|
"logps/chosen": -0.29296875,
|
|
"logps/rejected": -0.314453125,
|
|
"loss": 1.2938823699951172,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 3.333526611328125,
|
|
"rewards/margins": 1.3265352249145508,
|
|
"rewards/rejected": 2.006991386413574,
|
|
"step": 50
|
|
},
|
|
{
|
|
"epoch": 0.2059202059202059,
|
|
"grad_norm": 7.8411658071056864,
|
|
"learning_rate": 4.850368660819092e-07,
|
|
"logits/chosen": -1.8515625,
|
|
"logits/rejected": -1.8046875,
|
|
"logps/chosen": -0.291015625,
|
|
"logps/rejected": -0.310546875,
|
|
"loss": 1.2829803228378296,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.5130538940429688,
|
|
"rewards/margins": 0.6417007446289062,
|
|
"rewards/rejected": 0.8713531494140625,
|
|
"step": 60
|
|
},
|
|
{
|
|
"epoch": 0.24024024024024024,
|
|
"grad_norm": 28.26163110598253,
|
|
"learning_rate": 4.731584675403184e-07,
|
|
"logits/chosen": -1.65625,
|
|
"logits/rejected": -1.640625,
|
|
"logps/chosen": -0.30859375,
|
|
"logps/rejected": -0.30078125,
|
|
"loss": 1.3537184000015259,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 3.1701087951660156,
|
|
"rewards/margins": 1.6411056518554688,
|
|
"rewards/rejected": 1.5290031433105469,
|
|
"step": 70
|
|
},
|
|
{
|
|
"epoch": 0.27456027456027454,
|
|
"grad_norm": 8.444828433926622,
|
|
"learning_rate": 4.5807534881817183e-07,
|
|
"logits/chosen": -1.7890625,
|
|
"logits/rejected": -1.7109375,
|
|
"logps/chosen": -0.294921875,
|
|
"logps/rejected": -0.3125,
|
|
"loss": 1.3036760091781616,
|
|
"rewards/accuracies": 0.8812500238418579,
|
|
"rewards/chosen": 2.192584991455078,
|
|
"rewards/margins": 0.8953938484191895,
|
|
"rewards/rejected": 1.2971911430358887,
|
|
"step": 80
|
|
},
|
|
{
|
|
"epoch": 0.3088803088803089,
|
|
"grad_norm": 20.244100591742612,
|
|
"learning_rate": 4.400041146246136e-07,
|
|
"logits/chosen": -1.7578125,
|
|
"logits/rejected": -1.6875,
|
|
"logps/chosen": -0.3125,
|
|
"logps/rejected": -0.3203125,
|
|
"loss": 1.3008702993392944,
|
|
"rewards/accuracies": 0.856249988079071,
|
|
"rewards/chosen": 3.269622802734375,
|
|
"rewards/margins": 1.627532958984375,
|
|
"rewards/rejected": 1.64208984375,
|
|
"step": 90
|
|
},
|
|
{
|
|
"epoch": 0.3432003432003432,
|
|
"grad_norm": 7.960625256781812,
|
|
"learning_rate": 4.1920428121079e-07,
|
|
"logits/chosen": -1.71875,
|
|
"logits/rejected": -1.6796875,
|
|
"logps/chosen": -0.283203125,
|
|
"logps/rejected": -0.330078125,
|
|
"loss": 1.2717617750167847,
|
|
"rewards/accuracies": 0.8687499761581421,
|
|
"rewards/chosen": 2.0637588500976562,
|
|
"rewards/margins": 1.0487861633300781,
|
|
"rewards/rejected": 1.0149726867675781,
|
|
"step": 100
|
|
},
|
|
{
|
|
"epoch": 0.37752037752037754,
|
|
"grad_norm": 36.274471498701175,
|
|
"learning_rate": 3.959745495250818e-07,
|
|
"logits/chosen": -1.9921875,
|
|
"logits/rejected": -1.9140625,
|
|
"logps/chosen": -0.275390625,
|
|
"logps/rejected": -0.306640625,
|
|
"loss": 1.2781312465667725,
|
|
"rewards/accuracies": 0.8812500238418579,
|
|
"rewards/chosen": 2.068091630935669,
|
|
"rewards/margins": 1.2525169849395752,
|
|
"rewards/rejected": 0.8155746459960938,
|
|
"step": 110
|
|
},
|
|
{
|
|
"epoch": 0.4118404118404118,
|
|
"grad_norm": 32.62769321502908,
|
|
"learning_rate": 3.7064851564718353e-07,
|
|
"logits/chosen": -1.8203125,
|
|
"logits/rejected": -1.7109375,
|
|
"logps/chosen": -0.287109375,
|
|
"logps/rejected": -0.353515625,
|
|
"loss": 1.2694454193115234,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 3.714447021484375,
|
|
"rewards/margins": 2.37420654296875,
|
|
"rewards/rejected": 1.340240478515625,
|
|
"step": 120
|
|
},
|
|
{
|
|
"epoch": 0.44616044616044614,
|
|
"grad_norm": 8.666298132652223,
|
|
"learning_rate": 3.4358988010236103e-07,
|
|
"logits/chosen": -1.765625,
|
|
"logits/rejected": -1.765625,
|
|
"logps/chosen": -0.322265625,
|
|
"logps/rejected": -0.3046875,
|
|
"loss": 1.377197504043579,
|
|
"rewards/accuracies": 0.8812500238418579,
|
|
"rewards/chosen": 2.362274169921875,
|
|
"rewards/margins": 1.509368896484375,
|
|
"rewards/rejected": 0.8529052734375,
|
|
"step": 130
|
|
},
|
|
{
|
|
"epoch": 0.4804804804804805,
|
|
"grad_norm": 17.229310324932,
|
|
"learning_rate": 3.1518722485366754e-07,
|
|
"logits/chosen": -1.90625,
|
|
"logits/rejected": -1.875,
|
|
"logps/chosen": -0.294921875,
|
|
"logps/rejected": -0.3203125,
|
|
"loss": 1.3077561855316162,
|
|
"rewards/accuracies": 0.8999999761581421,
|
|
"rewards/chosen": 2.7135581970214844,
|
|
"rewards/margins": 1.8327293395996094,
|
|
"rewards/rejected": 0.880828857421875,
|
|
"step": 140
|
|
},
|
|
{
|
|
"epoch": 0.5148005148005148,
|
|
"grad_norm": 8.648271514841943,
|
|
"learning_rate": 2.8584843297836277e-07,
|
|
"logits/chosen": -1.8203125,
|
|
"logits/rejected": -1.8046875,
|
|
"logps/chosen": -0.28125,
|
|
"logps/rejected": -0.33984375,
|
|
"loss": 1.2540769577026367,
|
|
"rewards/accuracies": 0.8687499761581421,
|
|
"rewards/chosen": 2.5254592895507812,
|
|
"rewards/margins": 1.1835556030273438,
|
|
"rewards/rejected": 1.3419036865234375,
|
|
"step": 150
|
|
},
|
|
{
|
|
"epoch": 0.5491205491205491,
|
|
"grad_norm": 49.83862434409446,
|
|
"learning_rate": 2.5599483116609544e-07,
|
|
"logits/chosen": -1.7734375,
|
|
"logits/rejected": -1.6953125,
|
|
"logps/chosen": -0.298828125,
|
|
"logps/rejected": -0.33203125,
|
|
"loss": 1.273056983947754,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": 2.8408203125,
|
|
"rewards/margins": 1.439300537109375,
|
|
"rewards/rejected": 1.401519775390625,
|
|
"step": 160
|
|
},
|
|
{
|
|
"epoch": 0.5834405834405835,
|
|
"grad_norm": 25.723956384719525,
|
|
"learning_rate": 2.2605513915689874e-07,
|
|
"logits/chosen": -1.796875,
|
|
"logits/rejected": -1.7578125,
|
|
"logps/chosen": -0.28515625,
|
|
"logps/rejected": -0.44140625,
|
|
"loss": 1.2432403564453125,
|
|
"rewards/accuracies": 0.893750011920929,
|
|
"rewards/chosen": 2.3864269256591797,
|
|
"rewards/margins": 1.9962539672851562,
|
|
"rewards/rejected": 0.39017295837402344,
|
|
"step": 170
|
|
},
|
|
{
|
|
"epoch": 0.6177606177606177,
|
|
"grad_norm": 73.0500683832465,
|
|
"learning_rate": 1.9645931300952795e-07,
|
|
"logits/chosen": -1.9296875,
|
|
"logits/rejected": -1.8828125,
|
|
"logps/chosen": -0.30078125,
|
|
"logps/rejected": -0.373046875,
|
|
"loss": 1.3145594596862793,
|
|
"rewards/accuracies": 0.887499988079071,
|
|
"rewards/chosen": 2.933912515640259,
|
|
"rewards/margins": 1.966554880142212,
|
|
"rewards/rejected": 0.9673576354980469,
|
|
"step": 180
|
|
},
|
|
{
|
|
"epoch": 0.6520806520806521,
|
|
"grad_norm": 10.570188964120872,
|
|
"learning_rate": 1.6763237061535008e-07,
|
|
"logits/chosen": -1.8125,
|
|
"logits/rejected": -1.78125,
|
|
"logps/chosen": -0.279296875,
|
|
"logps/rejected": -0.33984375,
|
|
"loss": 1.2554752826690674,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 2.1903152465820312,
|
|
"rewards/margins": 1.0904598236083984,
|
|
"rewards/rejected": 1.0998554229736328,
|
|
"step": 190
|
|
},
|
|
{
|
|
"epoch": 0.6864006864006864,
|
|
"grad_norm": 8.018004144482099,
|
|
"learning_rate": 1.3998828812795932e-07,
|
|
"logits/chosen": -1.7734375,
|
|
"logits/rejected": -1.6953125,
|
|
"logps/chosen": -0.3046875,
|
|
"logps/rejected": -0.349609375,
|
|
"loss": 1.2610969543457031,
|
|
"rewards/accuracies": 0.862500011920929,
|
|
"rewards/chosen": 2.4741287231445312,
|
|
"rewards/margins": 1.5025177001953125,
|
|
"rewards/rejected": 0.9716110229492188,
|
|
"step": 200
|
|
},
|
|
{
|
|
"epoch": 0.7207207207207207,
|
|
"grad_norm": 13.917673494093787,
|
|
"learning_rate": 1.1392405496029076e-07,
|
|
"logits/chosen": -1.859375,
|
|
"logits/rejected": -1.828125,
|
|
"logps/chosen": -0.291015625,
|
|
"logps/rejected": -0.37890625,
|
|
"loss": 1.2743440866470337,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 2.3770370483398438,
|
|
"rewards/margins": 1.9193801879882812,
|
|
"rewards/rejected": 0.4576568603515625,
|
|
"step": 210
|
|
},
|
|
{
|
|
"epoch": 0.7550407550407551,
|
|
"grad_norm": 7.293229087932327,
|
|
"learning_rate": 8.981397272385738e-08,
|
|
"logits/chosen": -1.90625,
|
|
"logits/rejected": -1.8203125,
|
|
"logps/chosen": -0.296875,
|
|
"logps/rejected": -0.359375,
|
|
"loss": 1.2591865062713623,
|
|
"rewards/accuracies": 0.8999999761581421,
|
|
"rewards/chosen": 1.8160285949707031,
|
|
"rewards/margins": 1.0967063903808594,
|
|
"rewards/rejected": 0.7193222045898438,
|
|
"step": 220
|
|
},
|
|
{
|
|
"epoch": 0.7893607893607893,
|
|
"grad_norm": 14.94242869882904,
|
|
"learning_rate": 6.800427998154968e-08,
|
|
"logits/chosen": -1.9609375,
|
|
"logits/rejected": -1.875,
|
|
"logps/chosen": -0.302734375,
|
|
"logps/rejected": -0.439453125,
|
|
"loss": 1.2168002128601074,
|
|
"rewards/accuracies": 0.862500011920929,
|
|
"rewards/chosen": 3.1121368408203125,
|
|
"rewards/margins": 1.8566741943359375,
|
|
"rewards/rejected": 1.255462646484375,
|
|
"step": 230
|
|
},
|
|
{
|
|
"epoch": 0.8236808236808236,
|
|
"grad_norm": 6.26084322691984,
|
|
"learning_rate": 4.8808180006509356e-08,
|
|
"logits/chosen": -1.8671875,
|
|
"logits/rejected": -1.78125,
|
|
"logps/chosen": -0.2890625,
|
|
"logps/rejected": -0.375,
|
|
"loss": 1.2628111839294434,
|
|
"rewards/accuracies": 0.8687499761581421,
|
|
"rewards/chosen": 2.628856658935547,
|
|
"rewards/margins": 1.8339424133300781,
|
|
"rewards/rejected": 0.7949142456054688,
|
|
"step": 240
|
|
},
|
|
{
|
|
"epoch": 0.858000858000858,
|
|
"grad_norm": 7.036498888058669,
|
|
"learning_rate": 3.250134295213053e-08,
|
|
"logits/chosen": -1.8515625,
|
|
"logits/rejected": -1.78125,
|
|
"logps/chosen": -0.306640625,
|
|
"logps/rejected": -0.328125,
|
|
"loss": 1.3013354539871216,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": 2.027191162109375,
|
|
"rewards/margins": 1.3493232727050781,
|
|
"rewards/rejected": 0.6778678894042969,
|
|
"step": 250
|
|
},
|
|
{
|
|
"epoch": 0.8923208923208923,
|
|
"grad_norm": 26.20577632403144,
|
|
"learning_rate": 1.9317947025340232e-08,
|
|
"logits/chosen": -1.8125,
|
|
"logits/rejected": -1.734375,
|
|
"logps/chosen": -0.30859375,
|
|
"logps/rejected": -0.390625,
|
|
"loss": 1.249146819114685,
|
|
"rewards/accuracies": 0.887499988079071,
|
|
"rewards/chosen": 3.2939453125,
|
|
"rewards/margins": 2.5830841064453125,
|
|
"rewards/rejected": 0.7108612060546875,
|
|
"step": 260
|
|
},
|
|
{
|
|
"epoch": 0.9266409266409267,
|
|
"grad_norm": 9.303768228574064,
|
|
"learning_rate": 9.447315514833353e-09,
|
|
"logits/chosen": -1.8359375,
|
|
"logits/rejected": -1.734375,
|
|
"logps/chosen": -0.28515625,
|
|
"logps/rejected": -0.31640625,
|
|
"loss": 1.2721102237701416,
|
|
"rewards/accuracies": 0.9125000238418579,
|
|
"rewards/chosen": 2.105621337890625,
|
|
"rewards/margins": 1.446533203125,
|
|
"rewards/rejected": 0.659088134765625,
|
|
"step": 270
|
|
},
|
|
{
|
|
"epoch": 0.960960960960961,
|
|
"grad_norm": 6.727511885545749,
|
|
"learning_rate": 3.0311979690147426e-09,
|
|
"logits/chosen": -1.78125,
|
|
"logits/rejected": -1.6640625,
|
|
"logps/chosen": -0.291015625,
|
|
"logps/rejected": -0.33203125,
|
|
"loss": 1.2691892385482788,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": 2.3777236938476562,
|
|
"rewards/margins": 1.4847488403320312,
|
|
"rewards/rejected": 0.892974853515625,
|
|
"step": 280
|
|
},
|
|
{
|
|
"epoch": 0.9952809952809952,
|
|
"grad_norm": 6.168691664518052,
|
|
"learning_rate": 1.6173456793908135e-10,
|
|
"logits/chosen": -1.9140625,
|
|
"logits/rejected": -1.8828125,
|
|
"logps/chosen": -0.287109375,
|
|
"logps/rejected": -0.302734375,
|
|
"loss": 1.300573706626892,
|
|
"rewards/accuracies": 0.925000011920929,
|
|
"rewards/chosen": 2.7515792846679688,
|
|
"rewards/margins": 1.7214431762695312,
|
|
"rewards/rejected": 1.0301361083984375,
|
|
"step": 290
|
|
},
|
|
{
|
|
"epoch": 1.0,
|
|
"step": 292,
|
|
"total_flos": 0.0,
|
|
"train_loss": 1.2802449281085027,
|
|
"train_runtime": 10579.5096,
|
|
"train_samples_per_second": 1.762,
|
|
"train_steps_per_second": 0.028
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 292,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 1000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 0.0,
|
|
"train_batch_size": 2,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|