15065 lines
446 KiB
JSON
15065 lines
446 KiB
JSON
{
|
|
"best_metric": 0.4581940472126007,
|
|
"best_model_checkpoint": "models/qwen2.5-3b-dpo-vanilla/checkpoint-10000",
|
|
"epoch": 0.3722246003238354,
|
|
"eval_steps": 10000,
|
|
"global_step": 10000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 3.722246003238354e-05,
|
|
"grad_norm": 1.909734052867258,
|
|
"learning_rate": 1.8608113137327875e-10,
|
|
"logits/chosen": -2.65625,
|
|
"logits/rejected": -2.1875,
|
|
"logps/chosen": -128.0,
|
|
"logps/rejected": -128.0,
|
|
"loss": 0.6914,
|
|
"rewards/accuracies": 0.0,
|
|
"rewards/chosen": 0.0,
|
|
"rewards/margins": 0.0,
|
|
"rewards/rejected": 0.0,
|
|
"step": 1
|
|
},
|
|
{
|
|
"epoch": 0.0003722246003238354,
|
|
"grad_norm": 2.27001634205206,
|
|
"learning_rate": 1.8608113137327875e-09,
|
|
"logits/chosen": -2.484375,
|
|
"logits/rejected": -2.28125,
|
|
"logps/chosen": -166.0,
|
|
"logps/rejected": -165.0,
|
|
"loss": 0.6921,
|
|
"rewards/accuracies": 0.0902777761220932,
|
|
"rewards/chosen": -0.0004520416259765625,
|
|
"rewards/margins": -0.00093841552734375,
|
|
"rewards/rejected": 0.0004863739013671875,
|
|
"step": 10
|
|
},
|
|
{
|
|
"epoch": 0.0007444492006476708,
|
|
"grad_norm": 1.944229602517856,
|
|
"learning_rate": 3.721622627465575e-09,
|
|
"logits/chosen": -2.4375,
|
|
"logits/rejected": -2.46875,
|
|
"logps/chosen": -196.0,
|
|
"logps/rejected": -175.0,
|
|
"loss": 0.6927,
|
|
"rewards/accuracies": 0.3187499940395355,
|
|
"rewards/chosen": -0.000640869140625,
|
|
"rewards/margins": -0.0001888275146484375,
|
|
"rewards/rejected": -0.000453948974609375,
|
|
"step": 20
|
|
},
|
|
{
|
|
"epoch": 0.0011166738009715062,
|
|
"grad_norm": 1.6686587196870428,
|
|
"learning_rate": 5.5824339411983625e-09,
|
|
"logits/chosen": -2.515625,
|
|
"logits/rejected": -2.28125,
|
|
"logps/chosen": -183.0,
|
|
"logps/rejected": -164.0,
|
|
"loss": 0.6926,
|
|
"rewards/accuracies": 0.30000001192092896,
|
|
"rewards/chosen": -0.00086212158203125,
|
|
"rewards/margins": -0.0009918212890625,
|
|
"rewards/rejected": 0.00012493133544921875,
|
|
"step": 30
|
|
},
|
|
{
|
|
"epoch": 0.0014888984012953416,
|
|
"grad_norm": 1.6479666303692577,
|
|
"learning_rate": 7.44324525493115e-09,
|
|
"logits/chosen": -2.53125,
|
|
"logits/rejected": -2.375,
|
|
"logps/chosen": -188.0,
|
|
"logps/rejected": -162.0,
|
|
"loss": 0.6924,
|
|
"rewards/accuracies": 0.3687500059604645,
|
|
"rewards/chosen": -1.2993812561035156e-05,
|
|
"rewards/margins": 0.0007781982421875,
|
|
"rewards/rejected": -0.000797271728515625,
|
|
"step": 40
|
|
},
|
|
{
|
|
"epoch": 0.001861123001619177,
|
|
"grad_norm": 1.8722931582272013,
|
|
"learning_rate": 9.304056568663937e-09,
|
|
"logits/chosen": -2.484375,
|
|
"logits/rejected": -2.28125,
|
|
"logps/chosen": -177.0,
|
|
"logps/rejected": -153.0,
|
|
"loss": 0.6925,
|
|
"rewards/accuracies": 0.30000001192092896,
|
|
"rewards/chosen": 0.00015354156494140625,
|
|
"rewards/margins": 0.000186920166015625,
|
|
"rewards/rejected": -2.9802322387695312e-05,
|
|
"step": 50
|
|
},
|
|
{
|
|
"epoch": 0.0022333476019430125,
|
|
"grad_norm": 1.8791508809725042,
|
|
"learning_rate": 1.1164867882396725e-08,
|
|
"logits/chosen": -2.65625,
|
|
"logits/rejected": -2.46875,
|
|
"logps/chosen": -170.0,
|
|
"logps/rejected": -145.0,
|
|
"loss": 0.6927,
|
|
"rewards/accuracies": 0.33125001192092896,
|
|
"rewards/chosen": 0.0006103515625,
|
|
"rewards/margins": 0.00054931640625,
|
|
"rewards/rejected": 6.246566772460938e-05,
|
|
"step": 60
|
|
},
|
|
{
|
|
"epoch": 0.002605572202266848,
|
|
"grad_norm": 2.026846571369839,
|
|
"learning_rate": 1.3025679196129512e-08,
|
|
"logits/chosen": -2.5,
|
|
"logits/rejected": -2.328125,
|
|
"logps/chosen": -181.0,
|
|
"logps/rejected": -169.0,
|
|
"loss": 0.6927,
|
|
"rewards/accuracies": 0.3062500059604645,
|
|
"rewards/chosen": -0.0004405975341796875,
|
|
"rewards/margins": 0.00020503997802734375,
|
|
"rewards/rejected": -0.000640869140625,
|
|
"step": 70
|
|
},
|
|
{
|
|
"epoch": 0.002977796802590683,
|
|
"grad_norm": 1.8717258776080847,
|
|
"learning_rate": 1.48864905098623e-08,
|
|
"logits/chosen": -2.421875,
|
|
"logits/rejected": -2.234375,
|
|
"logps/chosen": -161.0,
|
|
"logps/rejected": -142.0,
|
|
"loss": 0.6924,
|
|
"rewards/accuracies": 0.3687500059604645,
|
|
"rewards/chosen": -0.000766754150390625,
|
|
"rewards/margins": 0.00067138671875,
|
|
"rewards/rejected": -0.00144195556640625,
|
|
"step": 80
|
|
},
|
|
{
|
|
"epoch": 0.0033500214029145185,
|
|
"grad_norm": 1.829868682345127,
|
|
"learning_rate": 1.6747301823595087e-08,
|
|
"logits/chosen": -2.515625,
|
|
"logits/rejected": -2.359375,
|
|
"logps/chosen": -196.0,
|
|
"logps/rejected": -186.0,
|
|
"loss": 0.6925,
|
|
"rewards/accuracies": 0.3499999940395355,
|
|
"rewards/chosen": -0.00018596649169921875,
|
|
"rewards/margins": -0.00018596649169921875,
|
|
"rewards/rejected": -7.636845111846924e-07,
|
|
"step": 90
|
|
},
|
|
{
|
|
"epoch": 0.003722246003238354,
|
|
"grad_norm": 1.9924116659754334,
|
|
"learning_rate": 1.8608113137327873e-08,
|
|
"logits/chosen": -2.484375,
|
|
"logits/rejected": -2.359375,
|
|
"logps/chosen": -211.0,
|
|
"logps/rejected": -179.0,
|
|
"loss": 0.6922,
|
|
"rewards/accuracies": 0.3499999940395355,
|
|
"rewards/chosen": 0.00140380859375,
|
|
"rewards/margins": 0.002227783203125,
|
|
"rewards/rejected": -0.000812530517578125,
|
|
"step": 100
|
|
},
|
|
{
|
|
"epoch": 0.004094470603562189,
|
|
"grad_norm": 1.7583918647858459,
|
|
"learning_rate": 2.0468924451060663e-08,
|
|
"logits/chosen": -2.484375,
|
|
"logits/rejected": -2.328125,
|
|
"logps/chosen": -196.0,
|
|
"logps/rejected": -176.0,
|
|
"loss": 0.6925,
|
|
"rewards/accuracies": 0.3125,
|
|
"rewards/chosen": -0.000202178955078125,
|
|
"rewards/margins": -0.000156402587890625,
|
|
"rewards/rejected": -4.649162292480469e-05,
|
|
"step": 110
|
|
},
|
|
{
|
|
"epoch": 0.004466695203886025,
|
|
"grad_norm": 1.749356736425924,
|
|
"learning_rate": 2.232973576479345e-08,
|
|
"logits/chosen": -2.546875,
|
|
"logits/rejected": -2.3125,
|
|
"logps/chosen": -182.0,
|
|
"logps/rejected": -173.0,
|
|
"loss": 0.6926,
|
|
"rewards/accuracies": 0.3812499940395355,
|
|
"rewards/chosen": -0.001190185546875,
|
|
"rewards/margins": -0.000263214111328125,
|
|
"rewards/rejected": -0.00092315673828125,
|
|
"step": 120
|
|
},
|
|
{
|
|
"epoch": 0.00483891980420986,
|
|
"grad_norm": 1.9863481162171532,
|
|
"learning_rate": 2.4190547078526237e-08,
|
|
"logits/chosen": -2.59375,
|
|
"logits/rejected": -2.328125,
|
|
"logps/chosen": -187.0,
|
|
"logps/rejected": -180.0,
|
|
"loss": 0.6927,
|
|
"rewards/accuracies": 0.3062500059604645,
|
|
"rewards/chosen": -0.00138092041015625,
|
|
"rewards/margins": 0.000141143798828125,
|
|
"rewards/rejected": -0.00151824951171875,
|
|
"step": 130
|
|
},
|
|
{
|
|
"epoch": 0.005211144404533696,
|
|
"grad_norm": 1.7434811793002054,
|
|
"learning_rate": 2.6051358392259023e-08,
|
|
"logits/chosen": -2.515625,
|
|
"logits/rejected": -2.203125,
|
|
"logps/chosen": -188.0,
|
|
"logps/rejected": -168.0,
|
|
"loss": 0.6927,
|
|
"rewards/accuracies": 0.34375,
|
|
"rewards/chosen": -0.000797271728515625,
|
|
"rewards/margins": 0.0004863739013671875,
|
|
"rewards/rejected": -0.00128173828125,
|
|
"step": 140
|
|
},
|
|
{
|
|
"epoch": 0.005583369004857531,
|
|
"grad_norm": 2.0956524520987228,
|
|
"learning_rate": 2.791216970599181e-08,
|
|
"logits/chosen": -2.53125,
|
|
"logits/rejected": -2.28125,
|
|
"logps/chosen": -180.0,
|
|
"logps/rejected": -158.0,
|
|
"loss": 0.6925,
|
|
"rewards/accuracies": 0.36250001192092896,
|
|
"rewards/chosen": 0.00041961669921875,
|
|
"rewards/margins": 0.0001392364501953125,
|
|
"rewards/rejected": 0.00028228759765625,
|
|
"step": 150
|
|
},
|
|
{
|
|
"epoch": 0.005955593605181366,
|
|
"grad_norm": 1.956063700802031,
|
|
"learning_rate": 2.97729810197246e-08,
|
|
"logits/chosen": -2.578125,
|
|
"logits/rejected": -2.34375,
|
|
"logps/chosen": -176.0,
|
|
"logps/rejected": -155.0,
|
|
"loss": 0.6927,
|
|
"rewards/accuracies": 0.28125,
|
|
"rewards/chosen": 0.0004367828369140625,
|
|
"rewards/margins": -0.0003910064697265625,
|
|
"rewards/rejected": 0.00083160400390625,
|
|
"step": 160
|
|
},
|
|
{
|
|
"epoch": 0.006327818205505202,
|
|
"grad_norm": 1.8958883076227333,
|
|
"learning_rate": 3.163379233345739e-08,
|
|
"logits/chosen": -2.484375,
|
|
"logits/rejected": -2.203125,
|
|
"logps/chosen": -171.0,
|
|
"logps/rejected": -157.0,
|
|
"loss": 0.6923,
|
|
"rewards/accuracies": 0.34375,
|
|
"rewards/chosen": 0.00084686279296875,
|
|
"rewards/margins": 0.001068115234375,
|
|
"rewards/rejected": -0.00021839141845703125,
|
|
"step": 170
|
|
},
|
|
{
|
|
"epoch": 0.006700042805829037,
|
|
"grad_norm": 1.7428685916939655,
|
|
"learning_rate": 3.3494603647190173e-08,
|
|
"logits/chosen": -2.46875,
|
|
"logits/rejected": -2.40625,
|
|
"logps/chosen": -189.0,
|
|
"logps/rejected": -159.0,
|
|
"loss": 0.6928,
|
|
"rewards/accuracies": 0.38749998807907104,
|
|
"rewards/chosen": -0.000423431396484375,
|
|
"rewards/margins": 0.0003910064697265625,
|
|
"rewards/rejected": -0.00081634521484375,
|
|
"step": 180
|
|
},
|
|
{
|
|
"epoch": 0.007072267406152873,
|
|
"grad_norm": 1.9433027302325678,
|
|
"learning_rate": 3.535541496092296e-08,
|
|
"logits/chosen": -2.53125,
|
|
"logits/rejected": -2.3125,
|
|
"logps/chosen": -165.0,
|
|
"logps/rejected": -157.0,
|
|
"loss": 0.6927,
|
|
"rewards/accuracies": 0.32499998807907104,
|
|
"rewards/chosen": -0.000438690185546875,
|
|
"rewards/margins": -0.00102996826171875,
|
|
"rewards/rejected": 0.0005950927734375,
|
|
"step": 190
|
|
},
|
|
{
|
|
"epoch": 0.007444492006476708,
|
|
"grad_norm": 1.907942453475148,
|
|
"learning_rate": 3.721622627465575e-08,
|
|
"logits/chosen": -2.640625,
|
|
"logits/rejected": -2.390625,
|
|
"logps/chosen": -194.0,
|
|
"logps/rejected": -182.0,
|
|
"loss": 0.6924,
|
|
"rewards/accuracies": 0.3687500059604645,
|
|
"rewards/chosen": 0.0013275146484375,
|
|
"rewards/margins": 0.00189208984375,
|
|
"rewards/rejected": -0.0005645751953125,
|
|
"step": 200
|
|
},
|
|
{
|
|
"epoch": 0.007816716606800543,
|
|
"grad_norm": 2.081361068965789,
|
|
"learning_rate": 3.9077037588388533e-08,
|
|
"logits/chosen": -2.46875,
|
|
"logits/rejected": -2.25,
|
|
"logps/chosen": -175.0,
|
|
"logps/rejected": -163.0,
|
|
"loss": 0.6922,
|
|
"rewards/accuracies": 0.4312500059604645,
|
|
"rewards/chosen": 0.0027923583984375,
|
|
"rewards/margins": 0.0023651123046875,
|
|
"rewards/rejected": 0.000415802001953125,
|
|
"step": 210
|
|
},
|
|
{
|
|
"epoch": 0.008188941207124378,
|
|
"grad_norm": 1.7353430125248785,
|
|
"learning_rate": 4.093784890212133e-08,
|
|
"logits/chosen": -2.4375,
|
|
"logits/rejected": -2.1875,
|
|
"logps/chosen": -180.0,
|
|
"logps/rejected": -160.0,
|
|
"loss": 0.6923,
|
|
"rewards/accuracies": 0.39375001192092896,
|
|
"rewards/chosen": 0.00165557861328125,
|
|
"rewards/margins": 0.00142669677734375,
|
|
"rewards/rejected": 0.0002346038818359375,
|
|
"step": 220
|
|
},
|
|
{
|
|
"epoch": 0.008561165807448215,
|
|
"grad_norm": 1.8793193185098336,
|
|
"learning_rate": 4.2798660215854113e-08,
|
|
"logits/chosen": -2.515625,
|
|
"logits/rejected": -2.25,
|
|
"logps/chosen": -172.0,
|
|
"logps/rejected": -154.0,
|
|
"loss": 0.6929,
|
|
"rewards/accuracies": 0.375,
|
|
"rewards/chosen": -0.0012054443359375,
|
|
"rewards/margins": -0.000732421875,
|
|
"rewards/rejected": -0.000469207763671875,
|
|
"step": 230
|
|
},
|
|
{
|
|
"epoch": 0.00893339040777205,
|
|
"grad_norm": 1.5991670999722476,
|
|
"learning_rate": 4.46594715295869e-08,
|
|
"logits/chosen": -2.5,
|
|
"logits/rejected": -2.375,
|
|
"logps/chosen": -187.0,
|
|
"logps/rejected": -156.0,
|
|
"loss": 0.6922,
|
|
"rewards/accuracies": 0.38749998807907104,
|
|
"rewards/chosen": 0.00140380859375,
|
|
"rewards/margins": 0.00164031982421875,
|
|
"rewards/rejected": -0.00023555755615234375,
|
|
"step": 240
|
|
},
|
|
{
|
|
"epoch": 0.009305615008095885,
|
|
"grad_norm": 1.8317490248709312,
|
|
"learning_rate": 4.652028284331969e-08,
|
|
"logits/chosen": -2.4375,
|
|
"logits/rejected": -2.265625,
|
|
"logps/chosen": -182.0,
|
|
"logps/rejected": -177.0,
|
|
"loss": 0.6924,
|
|
"rewards/accuracies": 0.41874998807907104,
|
|
"rewards/chosen": 0.00147247314453125,
|
|
"rewards/margins": 0.00092315673828125,
|
|
"rewards/rejected": 0.000545501708984375,
|
|
"step": 250
|
|
},
|
|
{
|
|
"epoch": 0.00967783960841972,
|
|
"grad_norm": 1.8903059221093619,
|
|
"learning_rate": 4.8381094157052473e-08,
|
|
"logits/chosen": -2.578125,
|
|
"logits/rejected": -2.296875,
|
|
"logps/chosen": -181.0,
|
|
"logps/rejected": -178.0,
|
|
"loss": 0.692,
|
|
"rewards/accuracies": 0.4437499940395355,
|
|
"rewards/chosen": 0.00148773193359375,
|
|
"rewards/margins": 0.002166748046875,
|
|
"rewards/rejected": -0.00067138671875,
|
|
"step": 260
|
|
},
|
|
{
|
|
"epoch": 0.010050064208743556,
|
|
"grad_norm": 1.8628444868828153,
|
|
"learning_rate": 5.024190547078526e-08,
|
|
"logits/chosen": -2.546875,
|
|
"logits/rejected": -2.1875,
|
|
"logps/chosen": -183.0,
|
|
"logps/rejected": -185.0,
|
|
"loss": 0.6918,
|
|
"rewards/accuracies": 0.4437499940395355,
|
|
"rewards/chosen": 0.001190185546875,
|
|
"rewards/margins": 0.0019073486328125,
|
|
"rewards/rejected": -0.000720977783203125,
|
|
"step": 270
|
|
},
|
|
{
|
|
"epoch": 0.010422288809067391,
|
|
"grad_norm": 1.8657600217578134,
|
|
"learning_rate": 5.210271678451805e-08,
|
|
"logits/chosen": -2.5,
|
|
"logits/rejected": -2.265625,
|
|
"logps/chosen": -188.0,
|
|
"logps/rejected": -178.0,
|
|
"loss": 0.692,
|
|
"rewards/accuracies": 0.3812499940395355,
|
|
"rewards/chosen": 0.00089263916015625,
|
|
"rewards/margins": 0.00157928466796875,
|
|
"rewards/rejected": -0.000690460205078125,
|
|
"step": 280
|
|
},
|
|
{
|
|
"epoch": 0.010794513409391226,
|
|
"grad_norm": 1.8903717891223304,
|
|
"learning_rate": 5.3963528098250833e-08,
|
|
"logits/chosen": -2.53125,
|
|
"logits/rejected": -2.265625,
|
|
"logps/chosen": -185.0,
|
|
"logps/rejected": -163.0,
|
|
"loss": 0.6918,
|
|
"rewards/accuracies": 0.4375,
|
|
"rewards/chosen": 0.002471923828125,
|
|
"rewards/margins": 0.0020294189453125,
|
|
"rewards/rejected": 0.0004405975341796875,
|
|
"step": 290
|
|
},
|
|
{
|
|
"epoch": 0.011166738009715063,
|
|
"grad_norm": 1.8026622779801416,
|
|
"learning_rate": 5.582433941198362e-08,
|
|
"logits/chosen": -2.46875,
|
|
"logits/rejected": -2.3125,
|
|
"logps/chosen": -185.0,
|
|
"logps/rejected": -174.0,
|
|
"loss": 0.6916,
|
|
"rewards/accuracies": 0.4437499940395355,
|
|
"rewards/chosen": 0.002899169921875,
|
|
"rewards/margins": 0.0024261474609375,
|
|
"rewards/rejected": 0.0004673004150390625,
|
|
"step": 300
|
|
},
|
|
{
|
|
"epoch": 0.011538962610038898,
|
|
"grad_norm": 1.8453511130821298,
|
|
"learning_rate": 5.7685150725716413e-08,
|
|
"logits/chosen": -2.5625,
|
|
"logits/rejected": -2.421875,
|
|
"logps/chosen": -186.0,
|
|
"logps/rejected": -162.0,
|
|
"loss": 0.6914,
|
|
"rewards/accuracies": 0.3812499940395355,
|
|
"rewards/chosen": 0.0035400390625,
|
|
"rewards/margins": 0.00054168701171875,
|
|
"rewards/rejected": 0.00299072265625,
|
|
"step": 310
|
|
},
|
|
{
|
|
"epoch": 0.011911187210362733,
|
|
"grad_norm": 1.7802917874049597,
|
|
"learning_rate": 5.95459620394492e-08,
|
|
"logits/chosen": -2.65625,
|
|
"logits/rejected": -2.375,
|
|
"logps/chosen": -178.0,
|
|
"logps/rejected": -162.0,
|
|
"loss": 0.6912,
|
|
"rewards/accuracies": 0.48750001192092896,
|
|
"rewards/chosen": 0.00457763671875,
|
|
"rewards/margins": 0.004241943359375,
|
|
"rewards/rejected": 0.00032806396484375,
|
|
"step": 320
|
|
},
|
|
{
|
|
"epoch": 0.012283411810686568,
|
|
"grad_norm": 1.9319359790545254,
|
|
"learning_rate": 6.140677335318198e-08,
|
|
"logits/chosen": -2.484375,
|
|
"logits/rejected": -2.390625,
|
|
"logps/chosen": -168.0,
|
|
"logps/rejected": -152.0,
|
|
"loss": 0.6914,
|
|
"rewards/accuracies": 0.44999998807907104,
|
|
"rewards/chosen": 0.0047607421875,
|
|
"rewards/margins": 0.0016021728515625,
|
|
"rewards/rejected": 0.0031585693359375,
|
|
"step": 330
|
|
},
|
|
{
|
|
"epoch": 0.012655636411010404,
|
|
"grad_norm": 1.8113164196825542,
|
|
"learning_rate": 6.326758466691477e-08,
|
|
"logits/chosen": -2.53125,
|
|
"logits/rejected": -2.1875,
|
|
"logps/chosen": -188.0,
|
|
"logps/rejected": -164.0,
|
|
"loss": 0.6914,
|
|
"rewards/accuracies": 0.48124998807907104,
|
|
"rewards/chosen": 0.0028839111328125,
|
|
"rewards/margins": 0.0020751953125,
|
|
"rewards/rejected": 0.000797271728515625,
|
|
"step": 340
|
|
},
|
|
{
|
|
"epoch": 0.013027861011334239,
|
|
"grad_norm": 1.919143447401499,
|
|
"learning_rate": 6.512839598064757e-08,
|
|
"logits/chosen": -2.515625,
|
|
"logits/rejected": -2.265625,
|
|
"logps/chosen": -200.0,
|
|
"logps/rejected": -181.0,
|
|
"loss": 0.691,
|
|
"rewards/accuracies": 0.512499988079071,
|
|
"rewards/chosen": 0.00689697265625,
|
|
"rewards/margins": 0.0030364990234375,
|
|
"rewards/rejected": 0.003875732421875,
|
|
"step": 350
|
|
},
|
|
{
|
|
"epoch": 0.013400085611658074,
|
|
"grad_norm": 1.9196252684766513,
|
|
"learning_rate": 6.698920729438035e-08,
|
|
"logits/chosen": -2.578125,
|
|
"logits/rejected": -2.421875,
|
|
"logps/chosen": -182.0,
|
|
"logps/rejected": -167.0,
|
|
"loss": 0.6902,
|
|
"rewards/accuracies": 0.550000011920929,
|
|
"rewards/chosen": 0.0064697265625,
|
|
"rewards/margins": 0.0059814453125,
|
|
"rewards/rejected": 0.0004711151123046875,
|
|
"step": 360
|
|
},
|
|
{
|
|
"epoch": 0.01377231021198191,
|
|
"grad_norm": 1.6718237175379975,
|
|
"learning_rate": 6.885001860811314e-08,
|
|
"logits/chosen": -2.609375,
|
|
"logits/rejected": -2.359375,
|
|
"logps/chosen": -174.0,
|
|
"logps/rejected": -171.0,
|
|
"loss": 0.6901,
|
|
"rewards/accuracies": 0.5249999761581421,
|
|
"rewards/chosen": 0.00848388671875,
|
|
"rewards/margins": 0.005584716796875,
|
|
"rewards/rejected": 0.00286865234375,
|
|
"step": 370
|
|
},
|
|
{
|
|
"epoch": 0.014144534812305746,
|
|
"grad_norm": 1.8861986635424035,
|
|
"learning_rate": 7.071082992184592e-08,
|
|
"logits/chosen": -2.46875,
|
|
"logits/rejected": -2.21875,
|
|
"logps/chosen": -171.0,
|
|
"logps/rejected": -161.0,
|
|
"loss": 0.69,
|
|
"rewards/accuracies": 0.4625000059604645,
|
|
"rewards/chosen": 0.0108642578125,
|
|
"rewards/margins": 0.002471923828125,
|
|
"rewards/rejected": 0.0084228515625,
|
|
"step": 380
|
|
},
|
|
{
|
|
"epoch": 0.01451675941262958,
|
|
"grad_norm": 1.8157426593933548,
|
|
"learning_rate": 7.257164123557871e-08,
|
|
"logits/chosen": -2.59375,
|
|
"logits/rejected": -2.4375,
|
|
"logps/chosen": -188.0,
|
|
"logps/rejected": -157.0,
|
|
"loss": 0.6899,
|
|
"rewards/accuracies": 0.550000011920929,
|
|
"rewards/chosen": 0.0093994140625,
|
|
"rewards/margins": 0.005035400390625,
|
|
"rewards/rejected": 0.004364013671875,
|
|
"step": 390
|
|
},
|
|
{
|
|
"epoch": 0.014888984012953415,
|
|
"grad_norm": 1.9750645980727437,
|
|
"learning_rate": 7.44324525493115e-08,
|
|
"logits/chosen": -2.625,
|
|
"logits/rejected": -2.484375,
|
|
"logps/chosen": -201.0,
|
|
"logps/rejected": -183.0,
|
|
"loss": 0.6893,
|
|
"rewards/accuracies": 0.5687500238418579,
|
|
"rewards/chosen": 0.011962890625,
|
|
"rewards/margins": 0.0078125,
|
|
"rewards/rejected": 0.004119873046875,
|
|
"step": 400
|
|
},
|
|
{
|
|
"epoch": 0.015261208613277252,
|
|
"grad_norm": 1.7364650095687586,
|
|
"learning_rate": 7.629326386304429e-08,
|
|
"logits/chosen": -2.625,
|
|
"logits/rejected": -2.4375,
|
|
"logps/chosen": -193.0,
|
|
"logps/rejected": -166.0,
|
|
"loss": 0.689,
|
|
"rewards/accuracies": 0.5562499761581421,
|
|
"rewards/chosen": 0.0111083984375,
|
|
"rewards/margins": 0.00665283203125,
|
|
"rewards/rejected": 0.004425048828125,
|
|
"step": 410
|
|
},
|
|
{
|
|
"epoch": 0.015633433213601087,
|
|
"grad_norm": 1.8522890628366313,
|
|
"learning_rate": 7.815407517677707e-08,
|
|
"logits/chosen": -2.59375,
|
|
"logits/rejected": -2.28125,
|
|
"logps/chosen": -183.0,
|
|
"logps/rejected": -169.0,
|
|
"loss": 0.6888,
|
|
"rewards/accuracies": 0.6000000238418579,
|
|
"rewards/chosen": 0.01275634765625,
|
|
"rewards/margins": 0.0101318359375,
|
|
"rewards/rejected": 0.0025787353515625,
|
|
"step": 420
|
|
},
|
|
{
|
|
"epoch": 0.016005657813924924,
|
|
"grad_norm": 1.6973792061969148,
|
|
"learning_rate": 8.001488649050986e-08,
|
|
"logits/chosen": -2.5625,
|
|
"logits/rejected": -2.234375,
|
|
"logps/chosen": -179.0,
|
|
"logps/rejected": -168.0,
|
|
"loss": 0.6885,
|
|
"rewards/accuracies": 0.59375,
|
|
"rewards/chosen": 0.01416015625,
|
|
"rewards/margins": 0.00897216796875,
|
|
"rewards/rejected": 0.00518798828125,
|
|
"step": 430
|
|
},
|
|
{
|
|
"epoch": 0.016377882414248757,
|
|
"grad_norm": 1.8728373803184584,
|
|
"learning_rate": 8.187569780424265e-08,
|
|
"logits/chosen": -2.5,
|
|
"logits/rejected": -2.5,
|
|
"logps/chosen": -184.0,
|
|
"logps/rejected": -172.0,
|
|
"loss": 0.6885,
|
|
"rewards/accuracies": 0.59375,
|
|
"rewards/chosen": 0.0103759765625,
|
|
"rewards/margins": 0.0078125,
|
|
"rewards/rejected": 0.0025787353515625,
|
|
"step": 440
|
|
},
|
|
{
|
|
"epoch": 0.016750107014572593,
|
|
"grad_norm": 1.8412197892057298,
|
|
"learning_rate": 8.373650911797543e-08,
|
|
"logits/chosen": -2.59375,
|
|
"logits/rejected": -2.46875,
|
|
"logps/chosen": -179.0,
|
|
"logps/rejected": -164.0,
|
|
"loss": 0.6875,
|
|
"rewards/accuracies": 0.6187499761581421,
|
|
"rewards/chosen": 0.0159912109375,
|
|
"rewards/margins": 0.01129150390625,
|
|
"rewards/rejected": 0.004669189453125,
|
|
"step": 450
|
|
},
|
|
{
|
|
"epoch": 0.01712233161489643,
|
|
"grad_norm": 1.9204236222643143,
|
|
"learning_rate": 8.559732043170823e-08,
|
|
"logits/chosen": -2.359375,
|
|
"logits/rejected": -2.328125,
|
|
"logps/chosen": -193.0,
|
|
"logps/rejected": -162.0,
|
|
"loss": 0.688,
|
|
"rewards/accuracies": 0.543749988079071,
|
|
"rewards/chosen": 0.015869140625,
|
|
"rewards/margins": 0.008056640625,
|
|
"rewards/rejected": 0.00787353515625,
|
|
"step": 460
|
|
},
|
|
{
|
|
"epoch": 0.017494556215220263,
|
|
"grad_norm": 1.894920797253737,
|
|
"learning_rate": 8.745813174544101e-08,
|
|
"logits/chosen": -2.5,
|
|
"logits/rejected": -2.25,
|
|
"logps/chosen": -176.0,
|
|
"logps/rejected": -171.0,
|
|
"loss": 0.6881,
|
|
"rewards/accuracies": 0.6312500238418579,
|
|
"rewards/chosen": 0.0159912109375,
|
|
"rewards/margins": 0.012451171875,
|
|
"rewards/rejected": 0.003509521484375,
|
|
"step": 470
|
|
},
|
|
{
|
|
"epoch": 0.0178667808155441,
|
|
"grad_norm": 1.7997148704363772,
|
|
"learning_rate": 8.93189430591738e-08,
|
|
"logits/chosen": -2.578125,
|
|
"logits/rejected": -2.53125,
|
|
"logps/chosen": -194.0,
|
|
"logps/rejected": -185.0,
|
|
"loss": 0.6864,
|
|
"rewards/accuracies": 0.518750011920929,
|
|
"rewards/chosen": 0.01092529296875,
|
|
"rewards/margins": 0.0054931640625,
|
|
"rewards/rejected": 0.005462646484375,
|
|
"step": 480
|
|
},
|
|
{
|
|
"epoch": 0.018239005415867936,
|
|
"grad_norm": 1.6728829704360577,
|
|
"learning_rate": 9.117975437290658e-08,
|
|
"logits/chosen": -2.578125,
|
|
"logits/rejected": -2.359375,
|
|
"logps/chosen": -187.0,
|
|
"logps/rejected": -169.0,
|
|
"loss": 0.6872,
|
|
"rewards/accuracies": 0.637499988079071,
|
|
"rewards/chosen": 0.01507568359375,
|
|
"rewards/margins": 0.01080322265625,
|
|
"rewards/rejected": 0.004241943359375,
|
|
"step": 490
|
|
},
|
|
{
|
|
"epoch": 0.01861123001619177,
|
|
"grad_norm": 1.8678860471817902,
|
|
"learning_rate": 9.304056568663937e-08,
|
|
"logits/chosen": -2.59375,
|
|
"logits/rejected": -2.390625,
|
|
"logps/chosen": -202.0,
|
|
"logps/rejected": -182.0,
|
|
"loss": 0.6856,
|
|
"rewards/accuracies": 0.675000011920929,
|
|
"rewards/chosen": 0.01202392578125,
|
|
"rewards/margins": 0.0157470703125,
|
|
"rewards/rejected": -0.0037689208984375,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 0.018983454616515606,
|
|
"grad_norm": 1.9112424142761917,
|
|
"learning_rate": 9.490137700037215e-08,
|
|
"logits/chosen": -2.5,
|
|
"logits/rejected": -2.328125,
|
|
"logps/chosen": -194.0,
|
|
"logps/rejected": -170.0,
|
|
"loss": 0.6854,
|
|
"rewards/accuracies": 0.668749988079071,
|
|
"rewards/chosen": 0.011474609375,
|
|
"rewards/margins": 0.01556396484375,
|
|
"rewards/rejected": -0.004058837890625,
|
|
"step": 510
|
|
},
|
|
{
|
|
"epoch": 0.01935567921683944,
|
|
"grad_norm": 1.979614660486799,
|
|
"learning_rate": 9.676218831410495e-08,
|
|
"logits/chosen": -2.53125,
|
|
"logits/rejected": -2.46875,
|
|
"logps/chosen": -200.0,
|
|
"logps/rejected": -181.0,
|
|
"loss": 0.6851,
|
|
"rewards/accuracies": 0.6312500238418579,
|
|
"rewards/chosen": 0.01251220703125,
|
|
"rewards/margins": 0.01416015625,
|
|
"rewards/rejected": -0.0015869140625,
|
|
"step": 520
|
|
},
|
|
{
|
|
"epoch": 0.019727903817163276,
|
|
"grad_norm": 1.792134524724197,
|
|
"learning_rate": 9.862299962783774e-08,
|
|
"logits/chosen": -2.671875,
|
|
"logits/rejected": -2.359375,
|
|
"logps/chosen": -191.0,
|
|
"logps/rejected": -174.0,
|
|
"loss": 0.6856,
|
|
"rewards/accuracies": 0.574999988079071,
|
|
"rewards/chosen": 0.01025390625,
|
|
"rewards/margins": 0.0133056640625,
|
|
"rewards/rejected": -0.0029754638671875,
|
|
"step": 530
|
|
},
|
|
{
|
|
"epoch": 0.020100128417487113,
|
|
"grad_norm": 2.2953611386539396,
|
|
"learning_rate": 1.0048381094157052e-07,
|
|
"logits/chosen": -2.671875,
|
|
"logits/rejected": -2.390625,
|
|
"logps/chosen": -180.0,
|
|
"logps/rejected": -166.0,
|
|
"loss": 0.6841,
|
|
"rewards/accuracies": 0.643750011920929,
|
|
"rewards/chosen": 0.007049560546875,
|
|
"rewards/margins": 0.016845703125,
|
|
"rewards/rejected": -0.009765625,
|
|
"step": 540
|
|
},
|
|
{
|
|
"epoch": 0.020472353017810946,
|
|
"grad_norm": 1.8662655435134705,
|
|
"learning_rate": 1.0234462225530331e-07,
|
|
"logits/chosen": -2.59375,
|
|
"logits/rejected": -2.4375,
|
|
"logps/chosen": -191.0,
|
|
"logps/rejected": -186.0,
|
|
"loss": 0.6824,
|
|
"rewards/accuracies": 0.6499999761581421,
|
|
"rewards/chosen": 0.005523681640625,
|
|
"rewards/margins": 0.02099609375,
|
|
"rewards/rejected": -0.01544189453125,
|
|
"step": 550
|
|
},
|
|
{
|
|
"epoch": 0.020844577618134782,
|
|
"grad_norm": 1.9136571833641907,
|
|
"learning_rate": 1.042054335690361e-07,
|
|
"logits/chosen": -2.59375,
|
|
"logits/rejected": -2.421875,
|
|
"logps/chosen": -179.0,
|
|
"logps/rejected": -147.0,
|
|
"loss": 0.684,
|
|
"rewards/accuracies": 0.625,
|
|
"rewards/chosen": 0.00830078125,
|
|
"rewards/margins": 0.014404296875,
|
|
"rewards/rejected": -0.006072998046875,
|
|
"step": 560
|
|
},
|
|
{
|
|
"epoch": 0.02121680221845862,
|
|
"grad_norm": 1.8371922091545678,
|
|
"learning_rate": 1.0606624488276889e-07,
|
|
"logits/chosen": -2.5625,
|
|
"logits/rejected": -2.5,
|
|
"logps/chosen": -177.0,
|
|
"logps/rejected": -168.0,
|
|
"loss": 0.6811,
|
|
"rewards/accuracies": 0.6187499761581421,
|
|
"rewards/chosen": 0.0111083984375,
|
|
"rewards/margins": 0.0213623046875,
|
|
"rewards/rejected": -0.01031494140625,
|
|
"step": 570
|
|
},
|
|
{
|
|
"epoch": 0.021589026818782452,
|
|
"grad_norm": 1.8850692074402484,
|
|
"learning_rate": 1.0792705619650167e-07,
|
|
"logits/chosen": -2.71875,
|
|
"logits/rejected": -2.5,
|
|
"logps/chosen": -188.0,
|
|
"logps/rejected": -180.0,
|
|
"loss": 0.6809,
|
|
"rewards/accuracies": 0.6499999761581421,
|
|
"rewards/chosen": 0.004852294921875,
|
|
"rewards/margins": 0.02490234375,
|
|
"rewards/rejected": -0.0201416015625,
|
|
"step": 580
|
|
},
|
|
{
|
|
"epoch": 0.02196125141910629,
|
|
"grad_norm": 1.8515974929922816,
|
|
"learning_rate": 1.0978786751023446e-07,
|
|
"logits/chosen": -2.640625,
|
|
"logits/rejected": -2.265625,
|
|
"logps/chosen": -180.0,
|
|
"logps/rejected": -181.0,
|
|
"loss": 0.6793,
|
|
"rewards/accuracies": 0.6812499761581421,
|
|
"rewards/chosen": 0.0167236328125,
|
|
"rewards/margins": 0.0296630859375,
|
|
"rewards/rejected": -0.01300048828125,
|
|
"step": 590
|
|
},
|
|
{
|
|
"epoch": 0.022333476019430126,
|
|
"grad_norm": 1.9579725733414266,
|
|
"learning_rate": 1.1164867882396724e-07,
|
|
"logits/chosen": -2.671875,
|
|
"logits/rejected": -2.6875,
|
|
"logps/chosen": -203.0,
|
|
"logps/rejected": -179.0,
|
|
"loss": 0.6791,
|
|
"rewards/accuracies": 0.6812499761581421,
|
|
"rewards/chosen": 0.006134033203125,
|
|
"rewards/margins": 0.0296630859375,
|
|
"rewards/rejected": -0.0235595703125,
|
|
"step": 600
|
|
},
|
|
{
|
|
"epoch": 0.02270570061975396,
|
|
"grad_norm": 1.6937757035889593,
|
|
"learning_rate": 1.1350949013770003e-07,
|
|
"logits/chosen": -2.65625,
|
|
"logits/rejected": -2.453125,
|
|
"logps/chosen": -171.0,
|
|
"logps/rejected": -149.0,
|
|
"loss": 0.679,
|
|
"rewards/accuracies": 0.6875,
|
|
"rewards/chosen": 0.0037689208984375,
|
|
"rewards/margins": 0.03173828125,
|
|
"rewards/rejected": -0.0279541015625,
|
|
"step": 610
|
|
},
|
|
{
|
|
"epoch": 0.023077925220077795,
|
|
"grad_norm": 1.9641278343114261,
|
|
"learning_rate": 1.1537030145143283e-07,
|
|
"logits/chosen": -2.703125,
|
|
"logits/rejected": -2.46875,
|
|
"logps/chosen": -170.0,
|
|
"logps/rejected": -165.0,
|
|
"loss": 0.6774,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -0.00555419921875,
|
|
"rewards/margins": 0.035400390625,
|
|
"rewards/rejected": -0.041015625,
|
|
"step": 620
|
|
},
|
|
{
|
|
"epoch": 0.023450149820401632,
|
|
"grad_norm": 1.8818760286985359,
|
|
"learning_rate": 1.1723111276516561e-07,
|
|
"logits/chosen": -2.609375,
|
|
"logits/rejected": -2.34375,
|
|
"logps/chosen": -176.0,
|
|
"logps/rejected": -159.0,
|
|
"loss": 0.6751,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": 0.004852294921875,
|
|
"rewards/margins": 0.034912109375,
|
|
"rewards/rejected": -0.030029296875,
|
|
"step": 630
|
|
},
|
|
{
|
|
"epoch": 0.023822374420725465,
|
|
"grad_norm": 2.0529907152598987,
|
|
"learning_rate": 1.190919240788984e-07,
|
|
"logits/chosen": -2.671875,
|
|
"logits/rejected": -2.421875,
|
|
"logps/chosen": -171.0,
|
|
"logps/rejected": -178.0,
|
|
"loss": 0.6758,
|
|
"rewards/accuracies": 0.6937500238418579,
|
|
"rewards/chosen": -0.005157470703125,
|
|
"rewards/margins": 0.041748046875,
|
|
"rewards/rejected": -0.046875,
|
|
"step": 640
|
|
},
|
|
{
|
|
"epoch": 0.024194599021049302,
|
|
"grad_norm": 1.986217709788575,
|
|
"learning_rate": 1.2095273539263117e-07,
|
|
"logits/chosen": -2.625,
|
|
"logits/rejected": -2.421875,
|
|
"logps/chosen": -192.0,
|
|
"logps/rejected": -180.0,
|
|
"loss": 0.6752,
|
|
"rewards/accuracies": 0.625,
|
|
"rewards/chosen": -0.02001953125,
|
|
"rewards/margins": 0.037109375,
|
|
"rewards/rejected": -0.05712890625,
|
|
"step": 650
|
|
},
|
|
{
|
|
"epoch": 0.024566823621373135,
|
|
"grad_norm": 1.9703999515170558,
|
|
"learning_rate": 1.2281354670636396e-07,
|
|
"logits/chosen": -2.671875,
|
|
"logits/rejected": -2.46875,
|
|
"logps/chosen": -193.0,
|
|
"logps/rejected": -180.0,
|
|
"loss": 0.6727,
|
|
"rewards/accuracies": 0.6875,
|
|
"rewards/chosen": -0.024658203125,
|
|
"rewards/margins": 0.040283203125,
|
|
"rewards/rejected": -0.06494140625,
|
|
"step": 660
|
|
},
|
|
{
|
|
"epoch": 0.02493904822169697,
|
|
"grad_norm": 2.264020590375023,
|
|
"learning_rate": 1.2467435802009675e-07,
|
|
"logits/chosen": -2.65625,
|
|
"logits/rejected": -2.515625,
|
|
"logps/chosen": -192.0,
|
|
"logps/rejected": -182.0,
|
|
"loss": 0.6722,
|
|
"rewards/accuracies": 0.699999988079071,
|
|
"rewards/chosen": -0.03515625,
|
|
"rewards/margins": 0.05126953125,
|
|
"rewards/rejected": -0.08642578125,
|
|
"step": 670
|
|
},
|
|
{
|
|
"epoch": 0.02531127282202081,
|
|
"grad_norm": 2.1399376124201086,
|
|
"learning_rate": 1.2653516933382955e-07,
|
|
"logits/chosen": -2.75,
|
|
"logits/rejected": -2.734375,
|
|
"logps/chosen": -215.0,
|
|
"logps/rejected": -187.0,
|
|
"loss": 0.669,
|
|
"rewards/accuracies": 0.6499999761581421,
|
|
"rewards/chosen": -0.042724609375,
|
|
"rewards/margins": 0.0294189453125,
|
|
"rewards/rejected": -0.07177734375,
|
|
"step": 680
|
|
},
|
|
{
|
|
"epoch": 0.02568349742234464,
|
|
"grad_norm": 1.990696398679575,
|
|
"learning_rate": 1.2839598064756231e-07,
|
|
"logits/chosen": -2.75,
|
|
"logits/rejected": -2.671875,
|
|
"logps/chosen": -191.0,
|
|
"logps/rejected": -171.0,
|
|
"loss": 0.6685,
|
|
"rewards/accuracies": 0.6937500238418579,
|
|
"rewards/chosen": -0.050537109375,
|
|
"rewards/margins": 0.05029296875,
|
|
"rewards/rejected": -0.10107421875,
|
|
"step": 690
|
|
},
|
|
{
|
|
"epoch": 0.026055722022668478,
|
|
"grad_norm": 1.9644294881089854,
|
|
"learning_rate": 1.3025679196129513e-07,
|
|
"logits/chosen": -2.765625,
|
|
"logits/rejected": -2.546875,
|
|
"logps/chosen": -174.0,
|
|
"logps/rejected": -175.0,
|
|
"loss": 0.6672,
|
|
"rewards/accuracies": 0.643750011920929,
|
|
"rewards/chosen": -0.06103515625,
|
|
"rewards/margins": 0.04638671875,
|
|
"rewards/rejected": -0.107421875,
|
|
"step": 700
|
|
},
|
|
{
|
|
"epoch": 0.026427946622992315,
|
|
"grad_norm": 2.0626276391960907,
|
|
"learning_rate": 1.321176032750279e-07,
|
|
"logits/chosen": -2.75,
|
|
"logits/rejected": -2.59375,
|
|
"logps/chosen": -186.0,
|
|
"logps/rejected": -172.0,
|
|
"loss": 0.6664,
|
|
"rewards/accuracies": 0.6625000238418579,
|
|
"rewards/chosen": -0.06103515625,
|
|
"rewards/margins": 0.04736328125,
|
|
"rewards/rejected": -0.1083984375,
|
|
"step": 710
|
|
},
|
|
{
|
|
"epoch": 0.026800171223316148,
|
|
"grad_norm": 2.0714043329819365,
|
|
"learning_rate": 1.339784145887607e-07,
|
|
"logits/chosen": -2.78125,
|
|
"logits/rejected": -2.578125,
|
|
"logps/chosen": -172.0,
|
|
"logps/rejected": -168.0,
|
|
"loss": 0.6649,
|
|
"rewards/accuracies": 0.675000011920929,
|
|
"rewards/chosen": -0.064453125,
|
|
"rewards/margins": 0.076171875,
|
|
"rewards/rejected": -0.140625,
|
|
"step": 720
|
|
},
|
|
{
|
|
"epoch": 0.027172395823639985,
|
|
"grad_norm": 2.0999461633523144,
|
|
"learning_rate": 1.3583922590249346e-07,
|
|
"logits/chosen": -2.75,
|
|
"logits/rejected": -2.5625,
|
|
"logps/chosen": -194.0,
|
|
"logps/rejected": -192.0,
|
|
"loss": 0.6609,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -0.078125,
|
|
"rewards/margins": 0.09033203125,
|
|
"rewards/rejected": -0.1689453125,
|
|
"step": 730
|
|
},
|
|
{
|
|
"epoch": 0.02754462042396382,
|
|
"grad_norm": 1.9342673807765878,
|
|
"learning_rate": 1.3770003721622628e-07,
|
|
"logits/chosen": -2.6875,
|
|
"logits/rejected": -2.609375,
|
|
"logps/chosen": -187.0,
|
|
"logps/rejected": -158.0,
|
|
"loss": 0.6572,
|
|
"rewards/accuracies": 0.643750011920929,
|
|
"rewards/chosen": -0.10888671875,
|
|
"rewards/margins": 0.05810546875,
|
|
"rewards/rejected": -0.1669921875,
|
|
"step": 740
|
|
},
|
|
{
|
|
"epoch": 0.027916845024287654,
|
|
"grad_norm": 1.9998689351104397,
|
|
"learning_rate": 1.3956084852995905e-07,
|
|
"logits/chosen": -2.8125,
|
|
"logits/rejected": -2.640625,
|
|
"logps/chosen": -227.0,
|
|
"logps/rejected": -191.0,
|
|
"loss": 0.6544,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -0.1162109375,
|
|
"rewards/margins": 0.0966796875,
|
|
"rewards/rejected": -0.212890625,
|
|
"step": 750
|
|
},
|
|
{
|
|
"epoch": 0.02828906962461149,
|
|
"grad_norm": 2.2477309453236227,
|
|
"learning_rate": 1.4142165984369184e-07,
|
|
"logits/chosen": -2.78125,
|
|
"logits/rejected": -2.515625,
|
|
"logps/chosen": -187.0,
|
|
"logps/rejected": -203.0,
|
|
"loss": 0.6513,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -0.134765625,
|
|
"rewards/margins": 0.10595703125,
|
|
"rewards/rejected": -0.2412109375,
|
|
"step": 760
|
|
},
|
|
{
|
|
"epoch": 0.028661294224935328,
|
|
"grad_norm": 2.060954816992896,
|
|
"learning_rate": 1.432824711574246e-07,
|
|
"logits/chosen": -2.75,
|
|
"logits/rejected": -2.640625,
|
|
"logps/chosen": -194.0,
|
|
"logps/rejected": -179.0,
|
|
"loss": 0.6522,
|
|
"rewards/accuracies": 0.65625,
|
|
"rewards/chosen": -0.1669921875,
|
|
"rewards/margins": 0.08544921875,
|
|
"rewards/rejected": -0.251953125,
|
|
"step": 770
|
|
},
|
|
{
|
|
"epoch": 0.02903351882525916,
|
|
"grad_norm": 2.1266109757052862,
|
|
"learning_rate": 1.4514328247115743e-07,
|
|
"logits/chosen": -2.796875,
|
|
"logits/rejected": -2.734375,
|
|
"logps/chosen": -203.0,
|
|
"logps/rejected": -210.0,
|
|
"loss": 0.644,
|
|
"rewards/accuracies": 0.675000011920929,
|
|
"rewards/chosen": -0.2060546875,
|
|
"rewards/margins": 0.119140625,
|
|
"rewards/rejected": -0.326171875,
|
|
"step": 780
|
|
},
|
|
{
|
|
"epoch": 0.029405743425582997,
|
|
"grad_norm": 2.2396300152325614,
|
|
"learning_rate": 1.470040937848902e-07,
|
|
"logits/chosen": -2.890625,
|
|
"logits/rejected": -2.671875,
|
|
"logps/chosen": -217.0,
|
|
"logps/rejected": -225.0,
|
|
"loss": 0.6371,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -0.228515625,
|
|
"rewards/margins": 0.1201171875,
|
|
"rewards/rejected": -0.34765625,
|
|
"step": 790
|
|
},
|
|
{
|
|
"epoch": 0.02977796802590683,
|
|
"grad_norm": 2.2146992604089,
|
|
"learning_rate": 1.48864905098623e-07,
|
|
"logits/chosen": -2.84375,
|
|
"logits/rejected": -2.609375,
|
|
"logps/chosen": -238.0,
|
|
"logps/rejected": -240.0,
|
|
"loss": 0.6448,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -0.2099609375,
|
|
"rewards/margins": 0.2001953125,
|
|
"rewards/rejected": -0.41015625,
|
|
"step": 800
|
|
},
|
|
{
|
|
"epoch": 0.030150192626230667,
|
|
"grad_norm": 2.295329355568062,
|
|
"learning_rate": 1.5072571641235578e-07,
|
|
"logits/chosen": -2.890625,
|
|
"logits/rejected": -2.71875,
|
|
"logps/chosen": -222.0,
|
|
"logps/rejected": -224.0,
|
|
"loss": 0.6383,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -0.302734375,
|
|
"rewards/margins": 0.142578125,
|
|
"rewards/rejected": -0.4453125,
|
|
"step": 810
|
|
},
|
|
{
|
|
"epoch": 0.030522417226554504,
|
|
"grad_norm": 2.2993476230328076,
|
|
"learning_rate": 1.5258652772608857e-07,
|
|
"logits/chosen": -2.859375,
|
|
"logits/rejected": -2.671875,
|
|
"logps/chosen": -202.0,
|
|
"logps/rejected": -199.0,
|
|
"loss": 0.637,
|
|
"rewards/accuracies": 0.6187499761581421,
|
|
"rewards/chosen": -0.35546875,
|
|
"rewards/margins": 0.0966796875,
|
|
"rewards/rejected": -0.453125,
|
|
"step": 820
|
|
},
|
|
{
|
|
"epoch": 0.030894641826878337,
|
|
"grad_norm": 2.410686221160502,
|
|
"learning_rate": 1.5444733903982134e-07,
|
|
"logits/chosen": -2.890625,
|
|
"logits/rejected": -2.625,
|
|
"logps/chosen": -206.0,
|
|
"logps/rejected": -209.0,
|
|
"loss": 0.6276,
|
|
"rewards/accuracies": 0.699999988079071,
|
|
"rewards/chosen": -0.359375,
|
|
"rewards/margins": 0.1572265625,
|
|
"rewards/rejected": -0.515625,
|
|
"step": 830
|
|
},
|
|
{
|
|
"epoch": 0.031266866427202174,
|
|
"grad_norm": 2.351956208749687,
|
|
"learning_rate": 1.5630815035355413e-07,
|
|
"logits/chosen": -2.890625,
|
|
"logits/rejected": -2.65625,
|
|
"logps/chosen": -218.0,
|
|
"logps/rejected": -216.0,
|
|
"loss": 0.6247,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -0.404296875,
|
|
"rewards/margins": 0.203125,
|
|
"rewards/rejected": -0.609375,
|
|
"step": 840
|
|
},
|
|
{
|
|
"epoch": 0.03163909102752601,
|
|
"grad_norm": 2.204629059737825,
|
|
"learning_rate": 1.5816896166728693e-07,
|
|
"logits/chosen": -2.984375,
|
|
"logits/rejected": -2.734375,
|
|
"logps/chosen": -197.0,
|
|
"logps/rejected": -207.0,
|
|
"loss": 0.6232,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -0.41796875,
|
|
"rewards/margins": 0.1904296875,
|
|
"rewards/rejected": -0.609375,
|
|
"step": 850
|
|
},
|
|
{
|
|
"epoch": 0.03201131562784985,
|
|
"grad_norm": 2.4311568025578314,
|
|
"learning_rate": 1.6002977298101972e-07,
|
|
"logits/chosen": -2.828125,
|
|
"logits/rejected": -2.75,
|
|
"logps/chosen": -231.0,
|
|
"logps/rejected": -204.0,
|
|
"loss": 0.6281,
|
|
"rewards/accuracies": 0.637499988079071,
|
|
"rewards/chosen": -0.423828125,
|
|
"rewards/margins": 0.123046875,
|
|
"rewards/rejected": -0.546875,
|
|
"step": 860
|
|
},
|
|
{
|
|
"epoch": 0.03238354022817368,
|
|
"grad_norm": 2.5905040497602,
|
|
"learning_rate": 1.618905842947525e-07,
|
|
"logits/chosen": -3.046875,
|
|
"logits/rejected": -2.828125,
|
|
"logps/chosen": -238.0,
|
|
"logps/rejected": -245.0,
|
|
"loss": 0.6243,
|
|
"rewards/accuracies": 0.6875,
|
|
"rewards/chosen": -0.4765625,
|
|
"rewards/margins": 0.19921875,
|
|
"rewards/rejected": -0.67578125,
|
|
"step": 870
|
|
},
|
|
{
|
|
"epoch": 0.03275576482849751,
|
|
"grad_norm": 2.3496266988874495,
|
|
"learning_rate": 1.637513956084853e-07,
|
|
"logits/chosen": -2.859375,
|
|
"logits/rejected": -2.640625,
|
|
"logps/chosen": -234.0,
|
|
"logps/rejected": -224.0,
|
|
"loss": 0.6269,
|
|
"rewards/accuracies": 0.6812499761581421,
|
|
"rewards/chosen": -0.50390625,
|
|
"rewards/margins": 0.158203125,
|
|
"rewards/rejected": -0.6640625,
|
|
"step": 880
|
|
},
|
|
{
|
|
"epoch": 0.03312798942882135,
|
|
"grad_norm": 2.6617243292209003,
|
|
"learning_rate": 1.6561220692221807e-07,
|
|
"logits/chosen": -2.875,
|
|
"logits/rejected": -2.8125,
|
|
"logps/chosen": -221.0,
|
|
"logps/rejected": -223.0,
|
|
"loss": 0.6162,
|
|
"rewards/accuracies": 0.706250011920929,
|
|
"rewards/chosen": -0.474609375,
|
|
"rewards/margins": 0.2001953125,
|
|
"rewards/rejected": -0.67578125,
|
|
"step": 890
|
|
},
|
|
{
|
|
"epoch": 0.03350021402914519,
|
|
"grad_norm": 2.7726282183168927,
|
|
"learning_rate": 1.6747301823595087e-07,
|
|
"logits/chosen": -3.015625,
|
|
"logits/rejected": -2.84375,
|
|
"logps/chosen": -233.0,
|
|
"logps/rejected": -238.0,
|
|
"loss": 0.6085,
|
|
"rewards/accuracies": 0.6625000238418579,
|
|
"rewards/chosen": -0.53515625,
|
|
"rewards/margins": 0.2431640625,
|
|
"rewards/rejected": -0.78125,
|
|
"step": 900
|
|
},
|
|
{
|
|
"epoch": 0.03387243862946902,
|
|
"grad_norm": 2.706212443208337,
|
|
"learning_rate": 1.6933382954968363e-07,
|
|
"logits/chosen": -3.015625,
|
|
"logits/rejected": -2.828125,
|
|
"logps/chosen": -244.0,
|
|
"logps/rejected": -262.0,
|
|
"loss": 0.5865,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -0.59765625,
|
|
"rewards/margins": 0.341796875,
|
|
"rewards/rejected": -0.9375,
|
|
"step": 910
|
|
},
|
|
{
|
|
"epoch": 0.03424466322979286,
|
|
"grad_norm": 2.7082318302504023,
|
|
"learning_rate": 1.7119464086341645e-07,
|
|
"logits/chosen": -3.09375,
|
|
"logits/rejected": -3.015625,
|
|
"logps/chosen": -241.0,
|
|
"logps/rejected": -249.0,
|
|
"loss": 0.5963,
|
|
"rewards/accuracies": 0.6625000238418579,
|
|
"rewards/chosen": -0.6484375,
|
|
"rewards/margins": 0.2490234375,
|
|
"rewards/rejected": -0.8984375,
|
|
"step": 920
|
|
},
|
|
{
|
|
"epoch": 0.03461688783011669,
|
|
"grad_norm": 2.8004941194812867,
|
|
"learning_rate": 1.7305545217714922e-07,
|
|
"logits/chosen": -2.953125,
|
|
"logits/rejected": -2.953125,
|
|
"logps/chosen": -252.0,
|
|
"logps/rejected": -248.0,
|
|
"loss": 0.5974,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -0.61328125,
|
|
"rewards/margins": 0.27734375,
|
|
"rewards/rejected": -0.890625,
|
|
"step": 930
|
|
},
|
|
{
|
|
"epoch": 0.034989112430440526,
|
|
"grad_norm": 3.336638684956353,
|
|
"learning_rate": 1.7491626349088201e-07,
|
|
"logits/chosen": -3.0625,
|
|
"logits/rejected": -2.953125,
|
|
"logps/chosen": -252.0,
|
|
"logps/rejected": -264.0,
|
|
"loss": 0.5936,
|
|
"rewards/accuracies": 0.6812499761581421,
|
|
"rewards/chosen": -0.69921875,
|
|
"rewards/margins": 0.265625,
|
|
"rewards/rejected": -0.9609375,
|
|
"step": 940
|
|
},
|
|
{
|
|
"epoch": 0.03536133703076436,
|
|
"grad_norm": 3.2330647952855767,
|
|
"learning_rate": 1.767770748046148e-07,
|
|
"logits/chosen": -3.15625,
|
|
"logits/rejected": -2.96875,
|
|
"logps/chosen": -255.0,
|
|
"logps/rejected": -276.0,
|
|
"loss": 0.5862,
|
|
"rewards/accuracies": 0.699999988079071,
|
|
"rewards/chosen": -0.71875,
|
|
"rewards/margins": 0.306640625,
|
|
"rewards/rejected": -1.0234375,
|
|
"step": 950
|
|
},
|
|
{
|
|
"epoch": 0.0357335616310882,
|
|
"grad_norm": 3.5863137960887053,
|
|
"learning_rate": 1.786378861183476e-07,
|
|
"logits/chosen": -3.09375,
|
|
"logits/rejected": -2.96875,
|
|
"logps/chosen": -251.0,
|
|
"logps/rejected": -268.0,
|
|
"loss": 0.5854,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -0.75390625,
|
|
"rewards/margins": 0.30859375,
|
|
"rewards/rejected": -1.0625,
|
|
"step": 960
|
|
},
|
|
{
|
|
"epoch": 0.036105786231412036,
|
|
"grad_norm": 3.1684550919691397,
|
|
"learning_rate": 1.8049869743208037e-07,
|
|
"logits/chosen": -3.125,
|
|
"logits/rejected": -3.0625,
|
|
"logps/chosen": -268.0,
|
|
"logps/rejected": -274.0,
|
|
"loss": 0.5866,
|
|
"rewards/accuracies": 0.675000011920929,
|
|
"rewards/chosen": -0.7421875,
|
|
"rewards/margins": 0.259765625,
|
|
"rewards/rejected": -1.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"epoch": 0.03647801083173587,
|
|
"grad_norm": 3.2428149852296877,
|
|
"learning_rate": 1.8235950874581316e-07,
|
|
"logits/chosen": -3.1875,
|
|
"logits/rejected": -3.09375,
|
|
"logps/chosen": -268.0,
|
|
"logps/rejected": -278.0,
|
|
"loss": 0.5783,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -0.7109375,
|
|
"rewards/margins": 0.35546875,
|
|
"rewards/rejected": -1.0703125,
|
|
"step": 980
|
|
},
|
|
{
|
|
"epoch": 0.0368502354320597,
|
|
"grad_norm": 3.164181259665228,
|
|
"learning_rate": 1.8422032005954595e-07,
|
|
"logits/chosen": -3.15625,
|
|
"logits/rejected": -3.046875,
|
|
"logps/chosen": -276.0,
|
|
"logps/rejected": -300.0,
|
|
"loss": 0.5762,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -0.76171875,
|
|
"rewards/margins": 0.375,
|
|
"rewards/rejected": -1.1328125,
|
|
"step": 990
|
|
},
|
|
{
|
|
"epoch": 0.03722246003238354,
|
|
"grad_norm": 3.4176535410789417,
|
|
"learning_rate": 1.8608113137327875e-07,
|
|
"logits/chosen": -3.359375,
|
|
"logits/rejected": -3.234375,
|
|
"logps/chosen": -270.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.5697,
|
|
"rewards/accuracies": 0.699999988079071,
|
|
"rewards/chosen": -0.82421875,
|
|
"rewards/margins": 0.3828125,
|
|
"rewards/rejected": -1.203125,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 0.037594684632707376,
|
|
"grad_norm": 4.727247211530869,
|
|
"learning_rate": 1.8794194268701151e-07,
|
|
"logits/chosen": -3.28125,
|
|
"logits/rejected": -3.15625,
|
|
"logps/chosen": -270.0,
|
|
"logps/rejected": -302.0,
|
|
"loss": 0.5626,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -0.8359375,
|
|
"rewards/margins": 0.421875,
|
|
"rewards/rejected": -1.2578125,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"epoch": 0.03796690923303121,
|
|
"grad_norm": 3.5772984638610925,
|
|
"learning_rate": 1.898027540007443e-07,
|
|
"logits/chosen": -3.34375,
|
|
"logits/rejected": -3.21875,
|
|
"logps/chosen": -274.0,
|
|
"logps/rejected": -292.0,
|
|
"loss": 0.571,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -0.91015625,
|
|
"rewards/margins": 0.5,
|
|
"rewards/rejected": -1.4140625,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"epoch": 0.03833913383335505,
|
|
"grad_norm": 4.044261559460498,
|
|
"learning_rate": 1.916635653144771e-07,
|
|
"logits/chosen": -3.359375,
|
|
"logits/rejected": -3.21875,
|
|
"logps/chosen": -272.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.5623,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -0.92578125,
|
|
"rewards/margins": 0.5078125,
|
|
"rewards/rejected": -1.4375,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"epoch": 0.03871135843367888,
|
|
"grad_norm": 3.442293008605092,
|
|
"learning_rate": 1.935243766282099e-07,
|
|
"logits/chosen": -3.34375,
|
|
"logits/rejected": -3.0625,
|
|
"logps/chosen": -260.0,
|
|
"logps/rejected": -302.0,
|
|
"loss": 0.5731,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -0.890625,
|
|
"rewards/margins": 0.451171875,
|
|
"rewards/rejected": -1.34375,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"epoch": 0.039083583034002715,
|
|
"grad_norm": 3.6629199991861467,
|
|
"learning_rate": 1.9538518794194266e-07,
|
|
"logits/chosen": -3.25,
|
|
"logits/rejected": -3.15625,
|
|
"logps/chosen": -276.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.5737,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -0.91015625,
|
|
"rewards/margins": 0.4453125,
|
|
"rewards/rejected": -1.359375,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"epoch": 0.03945580763432655,
|
|
"grad_norm": 3.7278237031608388,
|
|
"learning_rate": 1.9724599925567548e-07,
|
|
"logits/chosen": -3.359375,
|
|
"logits/rejected": -3.203125,
|
|
"logps/chosen": -266.0,
|
|
"logps/rejected": -304.0,
|
|
"loss": 0.563,
|
|
"rewards/accuracies": 0.706250011920929,
|
|
"rewards/chosen": -0.890625,
|
|
"rewards/margins": 0.4296875,
|
|
"rewards/rejected": -1.3203125,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"epoch": 0.03982803223465039,
|
|
"grad_norm": 4.909104297787964,
|
|
"learning_rate": 1.9910681056940825e-07,
|
|
"logits/chosen": -3.328125,
|
|
"logits/rejected": -3.203125,
|
|
"logps/chosen": -282.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.5556,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -0.95703125,
|
|
"rewards/margins": 0.5703125,
|
|
"rewards/rejected": -1.53125,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"epoch": 0.040200256834974225,
|
|
"grad_norm": 4.289178459607553,
|
|
"learning_rate": 2.0096762188314104e-07,
|
|
"logits/chosen": -3.296875,
|
|
"logits/rejected": -3.234375,
|
|
"logps/chosen": -298.0,
|
|
"logps/rejected": -310.0,
|
|
"loss": 0.5649,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -1.015625,
|
|
"rewards/margins": 0.423828125,
|
|
"rewards/rejected": -1.4375,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"epoch": 0.04057248143529806,
|
|
"grad_norm": 4.549142571625994,
|
|
"learning_rate": 2.028284331968738e-07,
|
|
"logits/chosen": -3.421875,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -288.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.5664,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -0.94921875,
|
|
"rewards/margins": 0.44921875,
|
|
"rewards/rejected": -1.3984375,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"epoch": 0.04094470603562189,
|
|
"grad_norm": 4.304854151005621,
|
|
"learning_rate": 2.0468924451060663e-07,
|
|
"logits/chosen": -3.375,
|
|
"logits/rejected": -3.234375,
|
|
"logps/chosen": -276.0,
|
|
"logps/rejected": -314.0,
|
|
"loss": 0.5369,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -0.97265625,
|
|
"rewards/margins": 0.5859375,
|
|
"rewards/rejected": -1.5625,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"epoch": 0.04131693063594573,
|
|
"grad_norm": 4.337380241949519,
|
|
"learning_rate": 2.065500558243394e-07,
|
|
"logits/chosen": -3.28125,
|
|
"logits/rejected": -3.1875,
|
|
"logps/chosen": -276.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.5347,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -1.0234375,
|
|
"rewards/margins": 0.62109375,
|
|
"rewards/rejected": -1.640625,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"epoch": 0.041689155236269565,
|
|
"grad_norm": 4.300189933067445,
|
|
"learning_rate": 2.084108671380722e-07,
|
|
"logits/chosen": -3.359375,
|
|
"logits/rejected": -3.203125,
|
|
"logps/chosen": -280.0,
|
|
"logps/rejected": -308.0,
|
|
"loss": 0.5766,
|
|
"rewards/accuracies": 0.6875,
|
|
"rewards/chosen": -1.09375,
|
|
"rewards/margins": 0.48046875,
|
|
"rewards/rejected": -1.578125,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"epoch": 0.0420613798365934,
|
|
"grad_norm": 4.890466944643528,
|
|
"learning_rate": 2.1027167845180498e-07,
|
|
"logits/chosen": -3.40625,
|
|
"logits/rejected": -3.15625,
|
|
"logps/chosen": -272.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.5407,
|
|
"rewards/accuracies": 0.8500000238418579,
|
|
"rewards/chosen": -0.8828125,
|
|
"rewards/margins": 0.66796875,
|
|
"rewards/rejected": -1.5546875,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"epoch": 0.04243360443691724,
|
|
"grad_norm": 4.664611967902792,
|
|
"learning_rate": 2.1213248976553777e-07,
|
|
"logits/chosen": -3.328125,
|
|
"logits/rejected": -3.234375,
|
|
"logps/chosen": -288.0,
|
|
"logps/rejected": -312.0,
|
|
"loss": 0.5594,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -1.0703125,
|
|
"rewards/margins": 0.435546875,
|
|
"rewards/rejected": -1.5078125,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"epoch": 0.04280582903724107,
|
|
"grad_norm": 4.942468938353393,
|
|
"learning_rate": 2.1399330107927054e-07,
|
|
"logits/chosen": -3.421875,
|
|
"logits/rejected": -3.15625,
|
|
"logps/chosen": -274.0,
|
|
"logps/rejected": -312.0,
|
|
"loss": 0.5503,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -1.1171875,
|
|
"rewards/margins": 0.482421875,
|
|
"rewards/rejected": -1.6015625,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"epoch": 0.043178053637564905,
|
|
"grad_norm": 4.935776595126225,
|
|
"learning_rate": 2.1585411239300333e-07,
|
|
"logits/chosen": -3.515625,
|
|
"logits/rejected": -3.34375,
|
|
"logps/chosen": -294.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.5471,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -1.078125,
|
|
"rewards/margins": 0.51953125,
|
|
"rewards/rejected": -1.6015625,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"epoch": 0.04355027823788874,
|
|
"grad_norm": 4.793351753907498,
|
|
"learning_rate": 2.1771492370673613e-07,
|
|
"logits/chosen": -3.34375,
|
|
"logits/rejected": -3.171875,
|
|
"logps/chosen": -274.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.554,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -0.9921875,
|
|
"rewards/margins": 0.53515625,
|
|
"rewards/rejected": -1.5234375,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"epoch": 0.04392250283821258,
|
|
"grad_norm": 5.48400197202018,
|
|
"learning_rate": 2.1957573502046892e-07,
|
|
"logits/chosen": -3.375,
|
|
"logits/rejected": -3.046875,
|
|
"logps/chosen": -272.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.532,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -0.94921875,
|
|
"rewards/margins": 0.5625,
|
|
"rewards/rejected": -1.5078125,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"epoch": 0.044294727438536415,
|
|
"grad_norm": 4.493529879184713,
|
|
"learning_rate": 2.214365463342017e-07,
|
|
"logits/chosen": -3.34375,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -294.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.5541,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -1.1015625,
|
|
"rewards/margins": 0.53515625,
|
|
"rewards/rejected": -1.640625,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"epoch": 0.04466695203886025,
|
|
"grad_norm": 5.301914504399541,
|
|
"learning_rate": 2.2329735764793448e-07,
|
|
"logits/chosen": -3.5,
|
|
"logits/rejected": -3.34375,
|
|
"logps/chosen": -286.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.5421,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -1.0859375,
|
|
"rewards/margins": 0.57421875,
|
|
"rewards/rejected": -1.6640625,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"epoch": 0.04503917663918408,
|
|
"grad_norm": 4.987000608823246,
|
|
"learning_rate": 2.2515816896166727e-07,
|
|
"logits/chosen": -3.421875,
|
|
"logits/rejected": -3.328125,
|
|
"logps/chosen": -292.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.5489,
|
|
"rewards/accuracies": 0.668749988079071,
|
|
"rewards/chosen": -1.09375,
|
|
"rewards/margins": 0.451171875,
|
|
"rewards/rejected": -1.546875,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"epoch": 0.04541140123950792,
|
|
"grad_norm": 5.708169792189986,
|
|
"learning_rate": 2.2701898027540007e-07,
|
|
"logits/chosen": -3.359375,
|
|
"logits/rejected": -3.296875,
|
|
"logps/chosen": -294.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.5339,
|
|
"rewards/accuracies": 0.668749988079071,
|
|
"rewards/chosen": -1.125,
|
|
"rewards/margins": 0.42578125,
|
|
"rewards/rejected": -1.546875,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"epoch": 0.045783625839831754,
|
|
"grad_norm": 4.915909641193549,
|
|
"learning_rate": 2.2887979158913283e-07,
|
|
"logits/chosen": -3.40625,
|
|
"logits/rejected": -3.328125,
|
|
"logps/chosen": -302.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.5376,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -1.1015625,
|
|
"rewards/margins": 0.6328125,
|
|
"rewards/rejected": -1.734375,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"epoch": 0.04615585044015559,
|
|
"grad_norm": 4.255741576380326,
|
|
"learning_rate": 2.3074060290286565e-07,
|
|
"logits/chosen": -3.40625,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -316.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.5675,
|
|
"rewards/accuracies": 0.643750011920929,
|
|
"rewards/chosen": -1.1484375,
|
|
"rewards/margins": 0.419921875,
|
|
"rewards/rejected": -1.5625,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"epoch": 0.04652807504047943,
|
|
"grad_norm": 4.601416833791625,
|
|
"learning_rate": 2.3260141421659842e-07,
|
|
"logits/chosen": -3.40625,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -308.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.5461,
|
|
"rewards/accuracies": 0.668749988079071,
|
|
"rewards/chosen": -1.09375,
|
|
"rewards/margins": 0.5546875,
|
|
"rewards/rejected": -1.6484375,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"epoch": 0.046900299640803264,
|
|
"grad_norm": 8.233795954417303,
|
|
"learning_rate": 2.3446222553033121e-07,
|
|
"logits/chosen": -3.34375,
|
|
"logits/rejected": -3.3125,
|
|
"logps/chosen": -308.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.5647,
|
|
"rewards/accuracies": 0.581250011920929,
|
|
"rewards/chosen": -1.15625,
|
|
"rewards/margins": 0.45703125,
|
|
"rewards/rejected": -1.6171875,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"epoch": 0.047272524241127094,
|
|
"grad_norm": 4.651834426567815,
|
|
"learning_rate": 2.3632303684406398e-07,
|
|
"logits/chosen": -3.328125,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -314.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.5355,
|
|
"rewards/accuracies": 0.699999988079071,
|
|
"rewards/chosen": -1.140625,
|
|
"rewards/margins": 0.47265625,
|
|
"rewards/rejected": -1.609375,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"epoch": 0.04764474884145093,
|
|
"grad_norm": 5.083390252185782,
|
|
"learning_rate": 2.381838481577968e-07,
|
|
"logits/chosen": -3.40625,
|
|
"logits/rejected": -3.359375,
|
|
"logps/chosen": -300.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.5296,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -1.09375,
|
|
"rewards/margins": 0.6015625,
|
|
"rewards/rejected": -1.6875,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"epoch": 0.04801697344177477,
|
|
"grad_norm": 4.550219702551529,
|
|
"learning_rate": 2.4004465947152957e-07,
|
|
"logits/chosen": -3.40625,
|
|
"logits/rejected": -3.265625,
|
|
"logps/chosen": -318.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.5355,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -1.234375,
|
|
"rewards/margins": 0.5859375,
|
|
"rewards/rejected": -1.8203125,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"epoch": 0.048389198042098604,
|
|
"grad_norm": 6.584872576687741,
|
|
"learning_rate": 2.4190547078526233e-07,
|
|
"logits/chosen": -3.34375,
|
|
"logits/rejected": -3.40625,
|
|
"logps/chosen": -322.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.5441,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -1.2109375,
|
|
"rewards/margins": 0.734375,
|
|
"rewards/rejected": -1.9453125,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"epoch": 0.04876142264242244,
|
|
"grad_norm": 5.354127669259726,
|
|
"learning_rate": 2.4376628209899515e-07,
|
|
"logits/chosen": -3.34375,
|
|
"logits/rejected": -3.265625,
|
|
"logps/chosen": -288.0,
|
|
"logps/rejected": -322.0,
|
|
"loss": 0.5271,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -1.09375,
|
|
"rewards/margins": 0.66015625,
|
|
"rewards/rejected": -1.7578125,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"epoch": 0.04913364724274627,
|
|
"grad_norm": 6.293180352073142,
|
|
"learning_rate": 2.456270934127279e-07,
|
|
"logits/chosen": -3.5625,
|
|
"logits/rejected": -3.4375,
|
|
"logps/chosen": -314.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.527,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -1.2265625,
|
|
"rewards/margins": 0.6328125,
|
|
"rewards/rejected": -1.859375,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"epoch": 0.04950587184307011,
|
|
"grad_norm": 6.589478898199543,
|
|
"learning_rate": 2.4748790472646074e-07,
|
|
"logits/chosen": -3.484375,
|
|
"logits/rejected": -3.375,
|
|
"logps/chosen": -310.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.5578,
|
|
"rewards/accuracies": 0.675000011920929,
|
|
"rewards/chosen": -1.3203125,
|
|
"rewards/margins": 0.40234375,
|
|
"rewards/rejected": -1.71875,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"epoch": 0.04987809644339394,
|
|
"grad_norm": 5.835837740313499,
|
|
"learning_rate": 2.493487160401935e-07,
|
|
"logits/chosen": -3.53125,
|
|
"logits/rejected": -3.234375,
|
|
"logps/chosen": -288.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.532,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -1.09375,
|
|
"rewards/margins": 0.609375,
|
|
"rewards/rejected": -1.6953125,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"epoch": 0.05025032104371778,
|
|
"grad_norm": 5.826110770220833,
|
|
"learning_rate": 2.5120952735392633e-07,
|
|
"logits/chosen": -3.40625,
|
|
"logits/rejected": -3.390625,
|
|
"logps/chosen": -314.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.5388,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -1.2578125,
|
|
"rewards/margins": 0.59375,
|
|
"rewards/rejected": -1.8515625,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"epoch": 0.05062254564404162,
|
|
"grad_norm": 4.607455687504676,
|
|
"learning_rate": 2.530703386676591e-07,
|
|
"logits/chosen": -3.359375,
|
|
"logits/rejected": -3.484375,
|
|
"logps/chosen": -336.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.546,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -1.3046875,
|
|
"rewards/margins": 0.515625,
|
|
"rewards/rejected": -1.8125,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"epoch": 0.05099477024436545,
|
|
"grad_norm": 4.798281770709719,
|
|
"learning_rate": 2.5493114998139186e-07,
|
|
"logits/chosen": -3.421875,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -302.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.5213,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -1.2421875,
|
|
"rewards/margins": 0.6171875,
|
|
"rewards/rejected": -1.859375,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"epoch": 0.05136699484468928,
|
|
"grad_norm": 5.911814051243962,
|
|
"learning_rate": 2.5679196129512463e-07,
|
|
"logits/chosen": -3.546875,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -318.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.5524,
|
|
"rewards/accuracies": 0.706250011920929,
|
|
"rewards/chosen": -1.234375,
|
|
"rewards/margins": 0.62109375,
|
|
"rewards/rejected": -1.859375,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"epoch": 0.05173921944501312,
|
|
"grad_norm": 6.315439881014484,
|
|
"learning_rate": 2.5865277260885745e-07,
|
|
"logits/chosen": -3.53125,
|
|
"logits/rejected": -3.375,
|
|
"logps/chosen": -306.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.5407,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -1.25,
|
|
"rewards/margins": 0.73046875,
|
|
"rewards/rejected": -1.984375,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"epoch": 0.052111444045336956,
|
|
"grad_norm": 6.3816523341835625,
|
|
"learning_rate": 2.6051358392259027e-07,
|
|
"logits/chosen": -3.625,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.5187,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -1.5234375,
|
|
"rewards/margins": 0.609375,
|
|
"rewards/rejected": -2.125,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"epoch": 0.05248366864566079,
|
|
"grad_norm": 8.34074589234693,
|
|
"learning_rate": 2.6237439523632303e-07,
|
|
"logits/chosen": -3.359375,
|
|
"logits/rejected": -3.3125,
|
|
"logps/chosen": -354.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.5349,
|
|
"rewards/accuracies": 0.6812499761581421,
|
|
"rewards/chosen": -1.546875,
|
|
"rewards/margins": 0.625,
|
|
"rewards/rejected": -2.171875,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"epoch": 0.05285589324598463,
|
|
"grad_norm": 5.547059345045155,
|
|
"learning_rate": 2.642352065500558e-07,
|
|
"logits/chosen": -3.40625,
|
|
"logits/rejected": -3.34375,
|
|
"logps/chosen": -328.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.5161,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -1.4375,
|
|
"rewards/margins": 0.71484375,
|
|
"rewards/rejected": -2.15625,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"epoch": 0.05322811784630846,
|
|
"grad_norm": 6.194268883311141,
|
|
"learning_rate": 2.660960178637886e-07,
|
|
"logits/chosen": -3.3125,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -346.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.5082,
|
|
"rewards/accuracies": 0.6937500238418579,
|
|
"rewards/chosen": -1.46875,
|
|
"rewards/margins": 0.65234375,
|
|
"rewards/rejected": -2.125,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"epoch": 0.053600342446632296,
|
|
"grad_norm": 6.28333908227948,
|
|
"learning_rate": 2.679568291775214e-07,
|
|
"logits/chosen": -3.46875,
|
|
"logits/rejected": -3.203125,
|
|
"logps/chosen": -346.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.5071,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -1.6015625,
|
|
"rewards/margins": 0.8125,
|
|
"rewards/rejected": -2.421875,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"epoch": 0.05397256704695613,
|
|
"grad_norm": 7.660789095769654,
|
|
"learning_rate": 2.6981764049125415e-07,
|
|
"logits/chosen": -3.375,
|
|
"logits/rejected": -3.203125,
|
|
"logps/chosen": -338.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.5023,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -1.5703125,
|
|
"rewards/margins": 0.7890625,
|
|
"rewards/rejected": -2.359375,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"epoch": 0.05434479164727997,
|
|
"grad_norm": 6.3843861768941625,
|
|
"learning_rate": 2.716784518049869e-07,
|
|
"logits/chosen": -3.28125,
|
|
"logits/rejected": -3.21875,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.5385,
|
|
"rewards/accuracies": 0.675000011920929,
|
|
"rewards/chosen": -1.7109375,
|
|
"rewards/margins": 0.60546875,
|
|
"rewards/rejected": -2.3125,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"epoch": 0.054717016247603806,
|
|
"grad_norm": 5.273430639524879,
|
|
"learning_rate": 2.735392631187198e-07,
|
|
"logits/chosen": -3.359375,
|
|
"logits/rejected": -3.328125,
|
|
"logps/chosen": -340.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.5101,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -1.4296875,
|
|
"rewards/margins": 0.70703125,
|
|
"rewards/rejected": -2.140625,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"epoch": 0.05508924084792764,
|
|
"grad_norm": 6.68285628738834,
|
|
"learning_rate": 2.7540007443245256e-07,
|
|
"logits/chosen": -3.359375,
|
|
"logits/rejected": -3.234375,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.504,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -1.7578125,
|
|
"rewards/margins": 0.76953125,
|
|
"rewards/rejected": -2.53125,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"epoch": 0.05546146544825147,
|
|
"grad_norm": 5.618700604924483,
|
|
"learning_rate": 2.7726088574618533e-07,
|
|
"logits/chosen": -3.53125,
|
|
"logits/rejected": -3.328125,
|
|
"logps/chosen": -328.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.512,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -1.6171875,
|
|
"rewards/margins": 0.77734375,
|
|
"rewards/rejected": -2.40625,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"epoch": 0.05583369004857531,
|
|
"grad_norm": 7.385793453071723,
|
|
"learning_rate": 2.791216970599181e-07,
|
|
"logits/chosen": -3.53125,
|
|
"logits/rejected": -3.34375,
|
|
"logps/chosen": -322.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.5139,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -1.4140625,
|
|
"rewards/margins": 0.84375,
|
|
"rewards/rejected": -2.25,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"epoch": 0.056205914648899145,
|
|
"grad_norm": 9.131881751521462,
|
|
"learning_rate": 2.809825083736509e-07,
|
|
"logits/chosen": -3.5,
|
|
"logits/rejected": -3.265625,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -472.0,
|
|
"loss": 0.5095,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -1.875,
|
|
"rewards/margins": 0.9140625,
|
|
"rewards/rejected": -2.78125,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"epoch": 0.05657813924922298,
|
|
"grad_norm": 5.557968050400609,
|
|
"learning_rate": 2.828433196873837e-07,
|
|
"logits/chosen": -3.4375,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -348.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.5186,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -1.6484375,
|
|
"rewards/margins": 0.80859375,
|
|
"rewards/rejected": -2.453125,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"epoch": 0.05695036384954682,
|
|
"grad_norm": 8.992491744756656,
|
|
"learning_rate": 2.8470413100111645e-07,
|
|
"logits/chosen": -3.3125,
|
|
"logits/rejected": -3.203125,
|
|
"logps/chosen": -334.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.4997,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -1.5078125,
|
|
"rewards/margins": 0.765625,
|
|
"rewards/rejected": -2.28125,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"epoch": 0.057322588449870655,
|
|
"grad_norm": 7.731748608613605,
|
|
"learning_rate": 2.865649423148492e-07,
|
|
"logits/chosen": -3.5,
|
|
"logits/rejected": -3.328125,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.5122,
|
|
"rewards/accuracies": 0.699999988079071,
|
|
"rewards/chosen": -1.9296875,
|
|
"rewards/margins": 0.7109375,
|
|
"rewards/rejected": -2.640625,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"epoch": 0.057694813050194485,
|
|
"grad_norm": 5.311753845164432,
|
|
"learning_rate": 2.884257536285821e-07,
|
|
"logits/chosen": -3.40625,
|
|
"logits/rejected": -3.296875,
|
|
"logps/chosen": -348.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.506,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -1.5234375,
|
|
"rewards/margins": 0.9140625,
|
|
"rewards/rejected": -2.4375,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"epoch": 0.05806703765051832,
|
|
"grad_norm": 5.32907569317797,
|
|
"learning_rate": 2.9028656494231485e-07,
|
|
"logits/chosen": -3.390625,
|
|
"logits/rejected": -3.21875,
|
|
"logps/chosen": -340.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.5211,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -1.640625,
|
|
"rewards/margins": 0.8359375,
|
|
"rewards/rejected": -2.484375,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"epoch": 0.05843926225084216,
|
|
"grad_norm": 7.635655915842599,
|
|
"learning_rate": 2.921473762560476e-07,
|
|
"logits/chosen": -3.390625,
|
|
"logits/rejected": -3.21875,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.5095,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -1.6875,
|
|
"rewards/margins": 0.8828125,
|
|
"rewards/rejected": -2.5625,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"epoch": 0.058811486851165995,
|
|
"grad_norm": 6.608327844564691,
|
|
"learning_rate": 2.940081875697804e-07,
|
|
"logits/chosen": -3.328125,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -452.0,
|
|
"loss": 0.5039,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -2.015625,
|
|
"rewards/margins": 0.7578125,
|
|
"rewards/rejected": -2.765625,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"epoch": 0.05918371145148983,
|
|
"grad_norm": 6.778090332548805,
|
|
"learning_rate": 2.958689988835132e-07,
|
|
"logits/chosen": -3.3125,
|
|
"logits/rejected": -3.203125,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -472.0,
|
|
"loss": 0.4881,
|
|
"rewards/accuracies": 0.675000011920929,
|
|
"rewards/chosen": -1.921875,
|
|
"rewards/margins": 0.82421875,
|
|
"rewards/rejected": -2.75,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"epoch": 0.05955593605181366,
|
|
"grad_norm": 5.971408337951184,
|
|
"learning_rate": 2.97729810197246e-07,
|
|
"logits/chosen": -3.515625,
|
|
"logits/rejected": -3.21875,
|
|
"logps/chosen": -340.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.503,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -1.7890625,
|
|
"rewards/margins": 0.88671875,
|
|
"rewards/rejected": -2.671875,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"epoch": 0.0599281606521375,
|
|
"grad_norm": 6.789859874378571,
|
|
"learning_rate": 2.9959062151097874e-07,
|
|
"logits/chosen": -3.421875,
|
|
"logits/rejected": -3.234375,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.4997,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -1.8359375,
|
|
"rewards/margins": 0.85546875,
|
|
"rewards/rejected": -2.6875,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"epoch": 0.060300385252461335,
|
|
"grad_norm": 6.166048650905424,
|
|
"learning_rate": 3.0145143282471156e-07,
|
|
"logits/chosen": -3.375,
|
|
"logits/rejected": -3.3125,
|
|
"logps/chosen": -352.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.5049,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -1.640625,
|
|
"rewards/margins": 0.78125,
|
|
"rewards/rejected": -2.421875,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"epoch": 0.06067260985278517,
|
|
"grad_norm": 6.101789918238695,
|
|
"learning_rate": 3.033122441384444e-07,
|
|
"logits/chosen": -3.359375,
|
|
"logits/rejected": -3.15625,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -470.0,
|
|
"loss": 0.4974,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 0.88671875,
|
|
"rewards/rejected": -2.90625,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"epoch": 0.06104483445310901,
|
|
"grad_norm": 6.135484413003626,
|
|
"learning_rate": 3.0517305545217715e-07,
|
|
"logits/chosen": -3.390625,
|
|
"logits/rejected": -3.265625,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.493,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -1.859375,
|
|
"rewards/margins": 0.859375,
|
|
"rewards/rejected": -2.71875,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"epoch": 0.061417059053432844,
|
|
"grad_norm": 5.505631441835803,
|
|
"learning_rate": 3.070338667659099e-07,
|
|
"logits/chosen": -3.421875,
|
|
"logits/rejected": -3.34375,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.5239,
|
|
"rewards/accuracies": 0.6625000238418579,
|
|
"rewards/chosen": -2.046875,
|
|
"rewards/margins": 0.75390625,
|
|
"rewards/rejected": -2.796875,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"epoch": 0.061789283653756674,
|
|
"grad_norm": 12.098147126661164,
|
|
"learning_rate": 3.088946780796427e-07,
|
|
"logits/chosen": -3.4375,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -470.0,
|
|
"loss": 0.4813,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -2.09375,
|
|
"rewards/margins": 0.8828125,
|
|
"rewards/rejected": -2.984375,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"epoch": 0.06216150825408051,
|
|
"grad_norm": 6.772250695058595,
|
|
"learning_rate": 3.107554893933755e-07,
|
|
"logits/chosen": -3.328125,
|
|
"logits/rejected": -3.21875,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.5249,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -1.8984375,
|
|
"rewards/margins": 0.88671875,
|
|
"rewards/rejected": -2.78125,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"epoch": 0.06253373285440435,
|
|
"grad_norm": 5.468142537091393,
|
|
"learning_rate": 3.1261630070710827e-07,
|
|
"logits/chosen": -3.3125,
|
|
"logits/rejected": -3.21875,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.5078,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -1.9375,
|
|
"rewards/margins": 0.69921875,
|
|
"rewards/rejected": -2.640625,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"epoch": 0.06290595745472818,
|
|
"grad_norm": 7.741085979284499,
|
|
"learning_rate": 3.144771120208411e-07,
|
|
"logits/chosen": -3.34375,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.4899,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -1.875,
|
|
"rewards/margins": 0.98828125,
|
|
"rewards/rejected": -2.859375,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"epoch": 0.06327818205505202,
|
|
"grad_norm": 5.958263874369148,
|
|
"learning_rate": 3.1633792333457385e-07,
|
|
"logits/chosen": -3.390625,
|
|
"logits/rejected": -3.3125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -472.0,
|
|
"loss": 0.4978,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 0.9453125,
|
|
"rewards/rejected": -2.96875,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"epoch": 0.06365040665537586,
|
|
"grad_norm": 6.501126511734826,
|
|
"learning_rate": 3.181987346483067e-07,
|
|
"logits/chosen": -3.515625,
|
|
"logits/rejected": -3.34375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.5076,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -2.109375,
|
|
"rewards/margins": 0.7890625,
|
|
"rewards/rejected": -2.90625,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"epoch": 0.0640226312556997,
|
|
"grad_norm": 6.27027575089657,
|
|
"learning_rate": 3.2005954596203944e-07,
|
|
"logits/chosen": -3.421875,
|
|
"logits/rejected": -3.265625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -472.0,
|
|
"loss": 0.4805,
|
|
"rewards/accuracies": 0.6812499761581421,
|
|
"rewards/chosen": -2.265625,
|
|
"rewards/margins": 0.83984375,
|
|
"rewards/rejected": -3.09375,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"epoch": 0.06439485585602353,
|
|
"grad_norm": 6.106140440630774,
|
|
"learning_rate": 3.219203572757722e-07,
|
|
"logits/chosen": -3.453125,
|
|
"logits/rejected": -3.265625,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.5104,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -2.0625,
|
|
"rewards/margins": 0.84765625,
|
|
"rewards/rejected": -2.90625,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"epoch": 0.06476708045634735,
|
|
"grad_norm": 5.9280110995386215,
|
|
"learning_rate": 3.23781168589505e-07,
|
|
"logits/chosen": -3.515625,
|
|
"logits/rejected": -3.328125,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.4954,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -1.84375,
|
|
"rewards/margins": 0.97265625,
|
|
"rewards/rejected": -2.8125,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"epoch": 0.06513930505667119,
|
|
"grad_norm": 6.574248401473447,
|
|
"learning_rate": 3.256419799032378e-07,
|
|
"logits/chosen": -3.4375,
|
|
"logits/rejected": -3.3125,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.5184,
|
|
"rewards/accuracies": 0.6937500238418579,
|
|
"rewards/chosen": -1.7578125,
|
|
"rewards/margins": 0.66796875,
|
|
"rewards/rejected": -2.421875,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"epoch": 0.06551152965699503,
|
|
"grad_norm": 5.849233018979067,
|
|
"learning_rate": 3.275027912169706e-07,
|
|
"logits/chosen": -3.421875,
|
|
"logits/rejected": -3.3125,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -488.0,
|
|
"loss": 0.4899,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -2.046875,
|
|
"rewards/margins": 0.875,
|
|
"rewards/rejected": -2.921875,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"epoch": 0.06588375425731886,
|
|
"grad_norm": 5.8974565519068305,
|
|
"learning_rate": 3.293636025307034e-07,
|
|
"logits/chosen": -3.5,
|
|
"logits/rejected": -3.40625,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -508.0,
|
|
"loss": 0.4984,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -2.453125,
|
|
"rewards/margins": 0.921875,
|
|
"rewards/rejected": -3.375,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"epoch": 0.0662559788576427,
|
|
"grad_norm": 8.018391725298722,
|
|
"learning_rate": 3.3122441384443615e-07,
|
|
"logits/chosen": -3.5,
|
|
"logits/rejected": -3.359375,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.5038,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -1.828125,
|
|
"rewards/margins": 0.85546875,
|
|
"rewards/rejected": -2.6875,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"epoch": 0.06662820345796654,
|
|
"grad_norm": 6.219744150368751,
|
|
"learning_rate": 3.3308522515816897e-07,
|
|
"logits/chosen": -3.546875,
|
|
"logits/rejected": -3.390625,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.4941,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -2.015625,
|
|
"rewards/margins": 0.85546875,
|
|
"rewards/rejected": -2.875,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"epoch": 0.06700042805829037,
|
|
"grad_norm": 10.757972805570088,
|
|
"learning_rate": 3.3494603647190173e-07,
|
|
"logits/chosen": -3.609375,
|
|
"logits/rejected": -3.4375,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -524.0,
|
|
"loss": 0.5043,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -2.65625,
|
|
"rewards/margins": 0.8984375,
|
|
"rewards/rejected": -3.546875,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"epoch": 0.06737265265861421,
|
|
"grad_norm": 7.793214262783194,
|
|
"learning_rate": 3.368068477856345e-07,
|
|
"logits/chosen": -3.5,
|
|
"logits/rejected": -3.375,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -484.0,
|
|
"loss": 0.4779,
|
|
"rewards/accuracies": 0.706250011920929,
|
|
"rewards/chosen": -2.4375,
|
|
"rewards/margins": 0.828125,
|
|
"rewards/rejected": -3.265625,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"epoch": 0.06774487725893805,
|
|
"grad_norm": 7.52057370608622,
|
|
"learning_rate": 3.3866765909936727e-07,
|
|
"logits/chosen": -3.625,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -460.0,
|
|
"loss": 0.4898,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -1.90625,
|
|
"rewards/margins": 1.015625,
|
|
"rewards/rejected": -2.921875,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"epoch": 0.06811710185926188,
|
|
"grad_norm": 6.76354734193844,
|
|
"learning_rate": 3.4052847041310014e-07,
|
|
"logits/chosen": -3.484375,
|
|
"logits/rejected": -3.203125,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.4937,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -2.125,
|
|
"rewards/margins": 0.91015625,
|
|
"rewards/rejected": -3.03125,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"epoch": 0.06848932645958572,
|
|
"grad_norm": 7.56921741102404,
|
|
"learning_rate": 3.423892817268329e-07,
|
|
"logits/chosen": -3.515625,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -492.0,
|
|
"loss": 0.4962,
|
|
"rewards/accuracies": 0.699999988079071,
|
|
"rewards/chosen": -2.140625,
|
|
"rewards/margins": 0.97265625,
|
|
"rewards/rejected": -3.109375,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"epoch": 0.06886155105990954,
|
|
"grad_norm": 9.080547138345112,
|
|
"learning_rate": 3.442500930405657e-07,
|
|
"logits/chosen": -3.59375,
|
|
"logits/rejected": -3.484375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -488.0,
|
|
"loss": 0.4815,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -2.25,
|
|
"rewards/margins": 0.8984375,
|
|
"rewards/rejected": -3.15625,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"epoch": 0.06923377566023338,
|
|
"grad_norm": 6.29737254648851,
|
|
"learning_rate": 3.4611090435429844e-07,
|
|
"logits/chosen": -3.453125,
|
|
"logits/rejected": -3.421875,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -490.0,
|
|
"loss": 0.4914,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -2.234375,
|
|
"rewards/margins": 0.88671875,
|
|
"rewards/rejected": -3.109375,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"epoch": 0.06960600026055722,
|
|
"grad_norm": 7.517613218540249,
|
|
"learning_rate": 3.4797171566803126e-07,
|
|
"logits/chosen": -3.40625,
|
|
"logits/rejected": -3.328125,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -472.0,
|
|
"loss": 0.4652,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -2.15625,
|
|
"rewards/margins": 0.859375,
|
|
"rewards/rejected": -3.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"epoch": 0.06997822486088105,
|
|
"grad_norm": 11.144996982874401,
|
|
"learning_rate": 3.4983252698176403e-07,
|
|
"logits/chosen": -3.453125,
|
|
"logits/rejected": -3.15625,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -510.0,
|
|
"loss": 0.5077,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -2.53125,
|
|
"rewards/margins": 0.8828125,
|
|
"rewards/rejected": -3.40625,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"epoch": 0.07035044946120489,
|
|
"grad_norm": 7.801867883753414,
|
|
"learning_rate": 3.516933382954968e-07,
|
|
"logits/chosen": -3.5,
|
|
"logits/rejected": -3.46875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -478.0,
|
|
"loss": 0.4787,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -2.09375,
|
|
"rewards/margins": 0.91796875,
|
|
"rewards/rejected": -3.015625,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"epoch": 0.07072267406152873,
|
|
"grad_norm": 7.7839330396146895,
|
|
"learning_rate": 3.535541496092296e-07,
|
|
"logits/chosen": -3.578125,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -470.0,
|
|
"logps/rejected": -536.0,
|
|
"loss": 0.4892,
|
|
"rewards/accuracies": 0.6937500238418579,
|
|
"rewards/chosen": -2.6875,
|
|
"rewards/margins": 0.89453125,
|
|
"rewards/rejected": -3.578125,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"epoch": 0.07109489866185256,
|
|
"grad_norm": 6.578620581724611,
|
|
"learning_rate": 3.5541496092296243e-07,
|
|
"logits/chosen": -3.71875,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -524.0,
|
|
"loss": 0.4962,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -2.484375,
|
|
"rewards/margins": 0.96875,
|
|
"rewards/rejected": -3.453125,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"epoch": 0.0714671232621764,
|
|
"grad_norm": 6.272864465633893,
|
|
"learning_rate": 3.572757722366952e-07,
|
|
"logits/chosen": -3.609375,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -460.0,
|
|
"loss": 0.4991,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -2.234375,
|
|
"rewards/margins": 0.7734375,
|
|
"rewards/rejected": -3.015625,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"epoch": 0.07183934786250024,
|
|
"grad_norm": 8.192434922872225,
|
|
"learning_rate": 3.5913658355042797e-07,
|
|
"logits/chosen": -3.5625,
|
|
"logits/rejected": -3.375,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -496.0,
|
|
"loss": 0.503,
|
|
"rewards/accuracies": 0.6937500238418579,
|
|
"rewards/chosen": -2.5,
|
|
"rewards/margins": 0.734375,
|
|
"rewards/rejected": -3.234375,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"epoch": 0.07221157246282407,
|
|
"grad_norm": 8.266227005876804,
|
|
"learning_rate": 3.6099739486416073e-07,
|
|
"logits/chosen": -3.453125,
|
|
"logits/rejected": -3.3125,
|
|
"logps/chosen": -482.0,
|
|
"logps/rejected": -540.0,
|
|
"loss": 0.5006,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -2.796875,
|
|
"rewards/margins": 0.8515625,
|
|
"rewards/rejected": -3.65625,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"epoch": 0.07258379706314791,
|
|
"grad_norm": 5.648100260022086,
|
|
"learning_rate": 3.6285820617789355e-07,
|
|
"logits/chosen": -3.4375,
|
|
"logits/rejected": -3.25,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -488.0,
|
|
"loss": 0.5073,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -2.3125,
|
|
"rewards/margins": 0.8203125,
|
|
"rewards/rejected": -3.125,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"epoch": 0.07295602166347175,
|
|
"grad_norm": 8.402952917263368,
|
|
"learning_rate": 3.647190174916263e-07,
|
|
"logits/chosen": -3.484375,
|
|
"logits/rejected": -3.5,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -504.0,
|
|
"loss": 0.5016,
|
|
"rewards/accuracies": 0.699999988079071,
|
|
"rewards/chosen": -2.328125,
|
|
"rewards/margins": 0.7734375,
|
|
"rewards/rejected": -3.09375,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"epoch": 0.07332824626379557,
|
|
"grad_norm": 8.519398872873577,
|
|
"learning_rate": 3.665798288053591e-07,
|
|
"logits/chosen": -3.5625,
|
|
"logits/rejected": -3.40625,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -472.0,
|
|
"loss": 0.4778,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -2.375,
|
|
"rewards/margins": 0.921875,
|
|
"rewards/rejected": -3.296875,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"epoch": 0.0737004708641194,
|
|
"grad_norm": 6.0929979281222915,
|
|
"learning_rate": 3.684406401190919e-07,
|
|
"logits/chosen": -3.546875,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -476.0,
|
|
"loss": 0.5153,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -2.21875,
|
|
"rewards/margins": 0.84765625,
|
|
"rewards/rejected": -3.0625,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"epoch": 0.07407269546444324,
|
|
"grad_norm": 7.579804731883034,
|
|
"learning_rate": 3.7030145143282473e-07,
|
|
"logits/chosen": -3.625,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -510.0,
|
|
"loss": 0.4795,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -2.5625,
|
|
"rewards/margins": 0.9609375,
|
|
"rewards/rejected": -3.53125,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"epoch": 0.07444492006476708,
|
|
"grad_norm": 6.777010716505804,
|
|
"learning_rate": 3.721622627465575e-07,
|
|
"logits/chosen": -3.5,
|
|
"logits/rejected": -3.421875,
|
|
"logps/chosen": -478.0,
|
|
"logps/rejected": -552.0,
|
|
"loss": 0.4725,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -2.75,
|
|
"rewards/margins": 1.0,
|
|
"rewards/rejected": -3.75,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"epoch": 0.07481714466509091,
|
|
"grad_norm": 7.877962084278623,
|
|
"learning_rate": 3.7402307406029026e-07,
|
|
"logits/chosen": -3.484375,
|
|
"logits/rejected": -3.296875,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -472.0,
|
|
"loss": 0.5049,
|
|
"rewards/accuracies": 0.699999988079071,
|
|
"rewards/chosen": -2.34375,
|
|
"rewards/margins": 0.8828125,
|
|
"rewards/rejected": -3.21875,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"epoch": 0.07518936926541475,
|
|
"grad_norm": 6.5521323559610245,
|
|
"learning_rate": 3.7588388537402303e-07,
|
|
"logits/chosen": -3.515625,
|
|
"logits/rejected": -3.34375,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -472.0,
|
|
"loss": 0.4811,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -2.265625,
|
|
"rewards/margins": 0.95703125,
|
|
"rewards/rejected": -3.21875,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"epoch": 0.07556159386573859,
|
|
"grad_norm": 10.371968651489745,
|
|
"learning_rate": 3.7774469668775585e-07,
|
|
"logits/chosen": -3.484375,
|
|
"logits/rejected": -3.328125,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -498.0,
|
|
"loss": 0.4834,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -2.734375,
|
|
"rewards/margins": 0.9140625,
|
|
"rewards/rejected": -3.65625,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"epoch": 0.07593381846606242,
|
|
"grad_norm": 7.268850054113197,
|
|
"learning_rate": 3.796055080014886e-07,
|
|
"logits/chosen": -3.46875,
|
|
"logits/rejected": -3.515625,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -520.0,
|
|
"loss": 0.4965,
|
|
"rewards/accuracies": 0.675000011920929,
|
|
"rewards/chosen": -2.6875,
|
|
"rewards/margins": 0.8359375,
|
|
"rewards/rejected": -3.515625,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"epoch": 0.07630604306638626,
|
|
"grad_norm": 9.101765248024416,
|
|
"learning_rate": 3.8146631931522143e-07,
|
|
"logits/chosen": -3.453125,
|
|
"logits/rejected": -3.375,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -548.0,
|
|
"loss": 0.4665,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -2.671875,
|
|
"rewards/margins": 1.15625,
|
|
"rewards/rejected": -3.8125,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"epoch": 0.0766782676667101,
|
|
"grad_norm": 7.977249857002326,
|
|
"learning_rate": 3.833271306289542e-07,
|
|
"logits/chosen": -3.484375,
|
|
"logits/rejected": -3.3125,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -544.0,
|
|
"loss": 0.4635,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -2.890625,
|
|
"rewards/margins": 1.1015625,
|
|
"rewards/rejected": -4.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"epoch": 0.07705049226703393,
|
|
"grad_norm": 8.285848628565708,
|
|
"learning_rate": 3.85187941942687e-07,
|
|
"logits/chosen": -3.53125,
|
|
"logits/rejected": -3.328125,
|
|
"logps/chosen": -468.0,
|
|
"logps/rejected": -552.0,
|
|
"loss": 0.4919,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -2.59375,
|
|
"rewards/margins": 1.0,
|
|
"rewards/rejected": -3.59375,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"epoch": 0.07742271686735776,
|
|
"grad_norm": 7.660587395619919,
|
|
"learning_rate": 3.870487532564198e-07,
|
|
"logits/chosen": -3.671875,
|
|
"logits/rejected": -3.546875,
|
|
"logps/chosen": -466.0,
|
|
"logps/rejected": -544.0,
|
|
"loss": 0.4886,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -2.828125,
|
|
"rewards/margins": 0.89453125,
|
|
"rewards/rejected": -3.734375,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"epoch": 0.0777949414676816,
|
|
"grad_norm": 6.2914110312102,
|
|
"learning_rate": 3.8890956457015255e-07,
|
|
"logits/chosen": -3.65625,
|
|
"logits/rejected": -3.484375,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -516.0,
|
|
"loss": 0.4788,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -2.625,
|
|
"rewards/margins": 0.7890625,
|
|
"rewards/rejected": -3.421875,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"epoch": 0.07816716606800543,
|
|
"grad_norm": 6.612583563249112,
|
|
"learning_rate": 3.907703758838853e-07,
|
|
"logits/chosen": -3.5,
|
|
"logits/rejected": -3.5,
|
|
"logps/chosen": -484.0,
|
|
"logps/rejected": -568.0,
|
|
"loss": 0.4708,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -2.875,
|
|
"rewards/margins": 1.109375,
|
|
"rewards/rejected": -3.984375,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"epoch": 0.07853939066832927,
|
|
"grad_norm": 7.541886875709588,
|
|
"learning_rate": 3.9263118719761814e-07,
|
|
"logits/chosen": -3.53125,
|
|
"logits/rejected": -3.4375,
|
|
"logps/chosen": -478.0,
|
|
"logps/rejected": -588.0,
|
|
"loss": 0.4718,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -2.953125,
|
|
"rewards/margins": 1.140625,
|
|
"rewards/rejected": -4.09375,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"epoch": 0.0789116152686531,
|
|
"grad_norm": 7.403493751575397,
|
|
"learning_rate": 3.9449199851135096e-07,
|
|
"logits/chosen": -3.546875,
|
|
"logits/rejected": -3.40625,
|
|
"logps/chosen": -486.0,
|
|
"logps/rejected": -556.0,
|
|
"loss": 0.4998,
|
|
"rewards/accuracies": 0.699999988079071,
|
|
"rewards/chosen": -3.125,
|
|
"rewards/margins": 0.8984375,
|
|
"rewards/rejected": -4.03125,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"epoch": 0.07928383986897694,
|
|
"grad_norm": 7.636053360461304,
|
|
"learning_rate": 3.9635280982508373e-07,
|
|
"logits/chosen": -3.625,
|
|
"logits/rejected": -3.5,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -520.0,
|
|
"loss": 0.4606,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -2.671875,
|
|
"rewards/margins": 0.92578125,
|
|
"rewards/rejected": -3.59375,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"epoch": 0.07965606446930078,
|
|
"grad_norm": 6.995222207530676,
|
|
"learning_rate": 3.982136211388165e-07,
|
|
"logits/chosen": -3.578125,
|
|
"logits/rejected": -3.46875,
|
|
"logps/chosen": -496.0,
|
|
"logps/rejected": -576.0,
|
|
"loss": 0.4656,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -3.015625,
|
|
"rewards/margins": 1.078125,
|
|
"rewards/rejected": -4.09375,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"epoch": 0.08002828906962461,
|
|
"grad_norm": 6.35027390290969,
|
|
"learning_rate": 4.000744324525493e-07,
|
|
"logits/chosen": -3.640625,
|
|
"logits/rejected": -3.390625,
|
|
"logps/chosen": -468.0,
|
|
"logps/rejected": -572.0,
|
|
"loss": 0.4815,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -2.890625,
|
|
"rewards/margins": 1.078125,
|
|
"rewards/rejected": -3.96875,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"epoch": 0.08040051366994845,
|
|
"grad_norm": 8.305965505985583,
|
|
"learning_rate": 4.019352437662821e-07,
|
|
"logits/chosen": -3.578125,
|
|
"logits/rejected": -3.546875,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -528.0,
|
|
"loss": 0.4668,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -2.703125,
|
|
"rewards/margins": 0.85546875,
|
|
"rewards/rejected": -3.5625,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"epoch": 0.08077273827027229,
|
|
"grad_norm": 9.07576399707983,
|
|
"learning_rate": 4.0379605508001485e-07,
|
|
"logits/chosen": -3.625,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -510.0,
|
|
"logps/rejected": -600.0,
|
|
"loss": 0.4852,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -3.109375,
|
|
"rewards/margins": 1.1484375,
|
|
"rewards/rejected": -4.25,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"epoch": 0.08114496287059612,
|
|
"grad_norm": 6.12625628924914,
|
|
"learning_rate": 4.056568663937476e-07,
|
|
"logits/chosen": -3.546875,
|
|
"logits/rejected": -3.265625,
|
|
"logps/chosen": -516.0,
|
|
"logps/rejected": -604.0,
|
|
"loss": 0.4739,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -3.28125,
|
|
"rewards/margins": 1.109375,
|
|
"rewards/rejected": -4.40625,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"epoch": 0.08151718747091995,
|
|
"grad_norm": 6.544507966611785,
|
|
"learning_rate": 4.075176777074805e-07,
|
|
"logits/chosen": -3.453125,
|
|
"logits/rejected": -3.5,
|
|
"logps/chosen": -470.0,
|
|
"logps/rejected": -532.0,
|
|
"loss": 0.4782,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -2.609375,
|
|
"rewards/margins": 0.99609375,
|
|
"rewards/rejected": -3.59375,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"epoch": 0.08188941207124378,
|
|
"grad_norm": 5.385034258739545,
|
|
"learning_rate": 4.0937848902121325e-07,
|
|
"logits/chosen": -3.578125,
|
|
"logits/rejected": -3.484375,
|
|
"logps/chosen": -528.0,
|
|
"logps/rejected": -592.0,
|
|
"loss": 0.4817,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -3.46875,
|
|
"rewards/margins": 0.859375,
|
|
"rewards/rejected": -4.3125,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"epoch": 0.08226163667156762,
|
|
"grad_norm": 6.5116283708203735,
|
|
"learning_rate": 4.11239300334946e-07,
|
|
"logits/chosen": -3.59375,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -494.0,
|
|
"logps/rejected": -540.0,
|
|
"loss": 0.4893,
|
|
"rewards/accuracies": 0.6812499761581421,
|
|
"rewards/chosen": -3.09375,
|
|
"rewards/margins": 0.75,
|
|
"rewards/rejected": -3.859375,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"epoch": 0.08263386127189146,
|
|
"grad_norm": 8.889763195218695,
|
|
"learning_rate": 4.131001116486788e-07,
|
|
"logits/chosen": -3.578125,
|
|
"logits/rejected": -3.53125,
|
|
"logps/chosen": -510.0,
|
|
"logps/rejected": -576.0,
|
|
"loss": 0.4677,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -3.171875,
|
|
"rewards/margins": 0.890625,
|
|
"rewards/rejected": -4.0625,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"epoch": 0.0830060858722153,
|
|
"grad_norm": 6.614280229899724,
|
|
"learning_rate": 4.149609229624116e-07,
|
|
"logits/chosen": -3.546875,
|
|
"logits/rejected": -3.40625,
|
|
"logps/chosen": -504.0,
|
|
"logps/rejected": -572.0,
|
|
"loss": 0.4802,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -3.09375,
|
|
"rewards/margins": 1.0078125,
|
|
"rewards/rejected": -4.09375,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"epoch": 0.08337831047253913,
|
|
"grad_norm": 6.203608504808656,
|
|
"learning_rate": 4.168217342761444e-07,
|
|
"logits/chosen": -3.640625,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -480.0,
|
|
"logps/rejected": -548.0,
|
|
"loss": 0.4752,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -2.890625,
|
|
"rewards/margins": 1.0390625,
|
|
"rewards/rejected": -3.921875,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"epoch": 0.08375053507286297,
|
|
"grad_norm": 8.792204618142273,
|
|
"learning_rate": 4.1868254558987714e-07,
|
|
"logits/chosen": -3.515625,
|
|
"logits/rejected": -3.34375,
|
|
"logps/chosen": -490.0,
|
|
"logps/rejected": -548.0,
|
|
"loss": 0.4787,
|
|
"rewards/accuracies": 0.6875,
|
|
"rewards/chosen": -3.0625,
|
|
"rewards/margins": 0.84375,
|
|
"rewards/rejected": -3.90625,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"epoch": 0.0841227596731868,
|
|
"grad_norm": 8.883928868598451,
|
|
"learning_rate": 4.2054335690360996e-07,
|
|
"logits/chosen": -3.71875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -478.0,
|
|
"logps/rejected": -580.0,
|
|
"loss": 0.4764,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -2.984375,
|
|
"rewards/margins": 1.03125,
|
|
"rewards/rejected": -4.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"epoch": 0.08449498427351064,
|
|
"grad_norm": 8.003135021321002,
|
|
"learning_rate": 4.224041682173428e-07,
|
|
"logits/chosen": -3.75,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -508.0,
|
|
"logps/rejected": -604.0,
|
|
"loss": 0.4988,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -3.265625,
|
|
"rewards/margins": 0.84765625,
|
|
"rewards/rejected": -4.125,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"epoch": 0.08486720887383448,
|
|
"grad_norm": 5.65226505535633,
|
|
"learning_rate": 4.2426497953107555e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -524.0,
|
|
"logps/rejected": -604.0,
|
|
"loss": 0.468,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -3.34375,
|
|
"rewards/margins": 0.9296875,
|
|
"rewards/rejected": -4.28125,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"epoch": 0.08523943347415831,
|
|
"grad_norm": 6.179490889540778,
|
|
"learning_rate": 4.261257908448083e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -524.0,
|
|
"logps/rejected": -604.0,
|
|
"loss": 0.4939,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -3.1875,
|
|
"rewards/margins": 1.046875,
|
|
"rewards/rejected": -4.25,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"epoch": 0.08561165807448214,
|
|
"grad_norm": 5.801450335577568,
|
|
"learning_rate": 4.279866021585411e-07,
|
|
"logits/chosen": -3.75,
|
|
"logits/rejected": -3.546875,
|
|
"logps/chosen": -516.0,
|
|
"logps/rejected": -588.0,
|
|
"loss": 0.4774,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -3.21875,
|
|
"rewards/margins": 0.953125,
|
|
"rewards/rejected": -4.15625,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"epoch": 0.08598388267480597,
|
|
"grad_norm": 6.04888665530274,
|
|
"learning_rate": 4.298474134722739e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -552.0,
|
|
"logps/rejected": -664.0,
|
|
"loss": 0.4416,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -3.578125,
|
|
"rewards/margins": 1.2734375,
|
|
"rewards/rejected": -4.84375,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"epoch": 0.08635610727512981,
|
|
"grad_norm": 7.9370533049546435,
|
|
"learning_rate": 4.3170822478600667e-07,
|
|
"logits/chosen": -3.546875,
|
|
"logits/rejected": -3.515625,
|
|
"logps/chosen": -540.0,
|
|
"logps/rejected": -624.0,
|
|
"loss": 0.473,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -3.4375,
|
|
"rewards/margins": 1.0234375,
|
|
"rewards/rejected": -4.46875,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"epoch": 0.08672833187545365,
|
|
"grad_norm": 7.029632975823499,
|
|
"learning_rate": 4.335690360997395e-07,
|
|
"logits/chosen": -3.65625,
|
|
"logits/rejected": -3.40625,
|
|
"logps/chosen": -528.0,
|
|
"logps/rejected": -616.0,
|
|
"loss": 0.4548,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -3.40625,
|
|
"rewards/margins": 1.109375,
|
|
"rewards/rejected": -4.53125,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"epoch": 0.08710055647577748,
|
|
"grad_norm": 8.542576339215444,
|
|
"learning_rate": 4.3542984741347225e-07,
|
|
"logits/chosen": -3.640625,
|
|
"logits/rejected": -3.53125,
|
|
"logps/chosen": -564.0,
|
|
"logps/rejected": -660.0,
|
|
"loss": 0.4731,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -3.75,
|
|
"rewards/margins": 1.0859375,
|
|
"rewards/rejected": -4.8125,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"epoch": 0.08747278107610132,
|
|
"grad_norm": 6.607106523171658,
|
|
"learning_rate": 4.372906587272051e-07,
|
|
"logits/chosen": -3.5625,
|
|
"logits/rejected": -3.484375,
|
|
"logps/chosen": -560.0,
|
|
"logps/rejected": -636.0,
|
|
"loss": 0.4753,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -3.75,
|
|
"rewards/margins": 1.078125,
|
|
"rewards/rejected": -4.84375,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"epoch": 0.08784500567642516,
|
|
"grad_norm": 6.991018012972489,
|
|
"learning_rate": 4.3915147004093784e-07,
|
|
"logits/chosen": -3.640625,
|
|
"logits/rejected": -3.53125,
|
|
"logps/chosen": -544.0,
|
|
"logps/rejected": -600.0,
|
|
"loss": 0.4553,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -3.703125,
|
|
"rewards/margins": 0.8359375,
|
|
"rewards/rejected": -4.53125,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"epoch": 0.08821723027674899,
|
|
"grad_norm": 7.676829082785754,
|
|
"learning_rate": 4.410122813546706e-07,
|
|
"logits/chosen": -3.578125,
|
|
"logits/rejected": -3.578125,
|
|
"logps/chosen": -502.0,
|
|
"logps/rejected": -560.0,
|
|
"loss": 0.4849,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -3.15625,
|
|
"rewards/margins": 1.0,
|
|
"rewards/rejected": -4.15625,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"epoch": 0.08858945487707283,
|
|
"grad_norm": 7.527652000753536,
|
|
"learning_rate": 4.428730926684034e-07,
|
|
"logits/chosen": -3.5625,
|
|
"logits/rejected": -3.5,
|
|
"logps/chosen": -532.0,
|
|
"logps/rejected": -588.0,
|
|
"loss": 0.5043,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -3.28125,
|
|
"rewards/margins": 0.89453125,
|
|
"rewards/rejected": -4.1875,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"epoch": 0.08896167947739667,
|
|
"grad_norm": 5.531822712679618,
|
|
"learning_rate": 4.447339039821362e-07,
|
|
"logits/chosen": -3.609375,
|
|
"logits/rejected": -3.5,
|
|
"logps/chosen": -552.0,
|
|
"logps/rejected": -648.0,
|
|
"loss": 0.457,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -3.59375,
|
|
"rewards/margins": 1.15625,
|
|
"rewards/rejected": -4.75,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"epoch": 0.0893339040777205,
|
|
"grad_norm": 6.682482626969178,
|
|
"learning_rate": 4.4659471529586896e-07,
|
|
"logits/chosen": -3.75,
|
|
"logits/rejected": -3.515625,
|
|
"logps/chosen": -484.0,
|
|
"logps/rejected": -600.0,
|
|
"loss": 0.4789,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -2.96875,
|
|
"rewards/margins": 1.140625,
|
|
"rewards/rejected": -4.09375,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"epoch": 0.08970612867804433,
|
|
"grad_norm": 8.302427926878842,
|
|
"learning_rate": 4.484555266096018e-07,
|
|
"logits/chosen": -3.578125,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -500.0,
|
|
"logps/rejected": -604.0,
|
|
"loss": 0.4751,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -3.421875,
|
|
"rewards/margins": 1.1875,
|
|
"rewards/rejected": -4.625,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"epoch": 0.09007835327836816,
|
|
"grad_norm": 5.977955107350341,
|
|
"learning_rate": 4.5031633792333455e-07,
|
|
"logits/chosen": -3.75,
|
|
"logits/rejected": -3.578125,
|
|
"logps/chosen": -560.0,
|
|
"logps/rejected": -636.0,
|
|
"loss": 0.4853,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -3.71875,
|
|
"rewards/margins": 1.0703125,
|
|
"rewards/rejected": -4.78125,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"epoch": 0.090450577878692,
|
|
"grad_norm": 6.23030548847072,
|
|
"learning_rate": 4.5217714923706737e-07,
|
|
"logits/chosen": -3.703125,
|
|
"logits/rejected": -3.53125,
|
|
"logps/chosen": -490.0,
|
|
"logps/rejected": -600.0,
|
|
"loss": 0.4668,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -3.171875,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -4.40625,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"epoch": 0.09082280247901584,
|
|
"grad_norm": 7.091500663393886,
|
|
"learning_rate": 4.5403796055080013e-07,
|
|
"logits/chosen": -3.71875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -548.0,
|
|
"logps/rejected": -624.0,
|
|
"loss": 0.4546,
|
|
"rewards/accuracies": 0.706250011920929,
|
|
"rewards/chosen": -3.375,
|
|
"rewards/margins": 1.1171875,
|
|
"rewards/rejected": -4.5,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"epoch": 0.09119502707933967,
|
|
"grad_norm": 7.004741424516515,
|
|
"learning_rate": 4.558987718645329e-07,
|
|
"logits/chosen": -3.6875,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -502.0,
|
|
"logps/rejected": -596.0,
|
|
"loss": 0.4576,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -3.328125,
|
|
"rewards/margins": 1.046875,
|
|
"rewards/rejected": -4.375,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"epoch": 0.09156725167966351,
|
|
"grad_norm": 6.611813344962854,
|
|
"learning_rate": 4.5775958317826567e-07,
|
|
"logits/chosen": -3.5625,
|
|
"logits/rejected": -3.5,
|
|
"logps/chosen": -564.0,
|
|
"logps/rejected": -616.0,
|
|
"loss": 0.4805,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -3.53125,
|
|
"rewards/margins": 0.91796875,
|
|
"rewards/rejected": -4.4375,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"epoch": 0.09193947627998734,
|
|
"grad_norm": 6.416497922144062,
|
|
"learning_rate": 4.596203944919985e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.53125,
|
|
"logps/chosen": -580.0,
|
|
"logps/rejected": -672.0,
|
|
"loss": 0.4841,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -3.921875,
|
|
"rewards/margins": 0.984375,
|
|
"rewards/rejected": -4.90625,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"epoch": 0.09231170088031118,
|
|
"grad_norm": 6.102285637173607,
|
|
"learning_rate": 4.614812058057313e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -556.0,
|
|
"logps/rejected": -608.0,
|
|
"loss": 0.4645,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -3.5625,
|
|
"rewards/margins": 0.89453125,
|
|
"rewards/rejected": -4.4375,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"epoch": 0.09268392548063502,
|
|
"grad_norm": 5.718071657531197,
|
|
"learning_rate": 4.633420171194641e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -528.0,
|
|
"logps/rejected": -620.0,
|
|
"loss": 0.4933,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -3.359375,
|
|
"rewards/margins": 0.92578125,
|
|
"rewards/rejected": -4.28125,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"epoch": 0.09305615008095885,
|
|
"grad_norm": 6.298059347419434,
|
|
"learning_rate": 4.6520282843319684e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -536.0,
|
|
"logps/rejected": -624.0,
|
|
"loss": 0.4895,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -3.59375,
|
|
"rewards/margins": 0.9609375,
|
|
"rewards/rejected": -4.53125,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"epoch": 0.09342837468128269,
|
|
"grad_norm": 7.644118403626093,
|
|
"learning_rate": 4.6706363974692966e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -560.0,
|
|
"logps/rejected": -628.0,
|
|
"loss": 0.5008,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -3.84375,
|
|
"rewards/margins": 0.984375,
|
|
"rewards/rejected": -4.8125,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"epoch": 0.09380059928160653,
|
|
"grad_norm": 7.371156916827325,
|
|
"learning_rate": 4.6892445106066243e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -548.0,
|
|
"logps/rejected": -616.0,
|
|
"loss": 0.471,
|
|
"rewards/accuracies": 0.699999988079071,
|
|
"rewards/chosen": -3.46875,
|
|
"rewards/margins": 0.921875,
|
|
"rewards/rejected": -4.375,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"epoch": 0.09417282388193035,
|
|
"grad_norm": 5.053817248660392,
|
|
"learning_rate": 4.707852623743952e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -596.0,
|
|
"logps/rejected": -664.0,
|
|
"loss": 0.4944,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -3.984375,
|
|
"rewards/margins": 1.0078125,
|
|
"rewards/rejected": -5.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"epoch": 0.09454504848225419,
|
|
"grad_norm": 6.609709896985202,
|
|
"learning_rate": 4.7264607368812796e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -540.0,
|
|
"logps/rejected": -644.0,
|
|
"loss": 0.4804,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -3.5625,
|
|
"rewards/margins": 1.015625,
|
|
"rewards/rejected": -4.59375,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"epoch": 0.09491727308257802,
|
|
"grad_norm": 7.593526504461849,
|
|
"learning_rate": 4.7450688500186083e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -600.0,
|
|
"logps/rejected": -676.0,
|
|
"loss": 0.4454,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -4.09375,
|
|
"rewards/margins": 0.9765625,
|
|
"rewards/rejected": -5.0625,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"epoch": 0.09528949768290186,
|
|
"grad_norm": 8.46313028709872,
|
|
"learning_rate": 4.763676963155936e-07,
|
|
"logits/chosen": -3.609375,
|
|
"logits/rejected": -3.546875,
|
|
"logps/chosen": -600.0,
|
|
"logps/rejected": -704.0,
|
|
"loss": 0.4735,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -4.1875,
|
|
"rewards/margins": 1.15625,
|
|
"rewards/rejected": -5.34375,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"epoch": 0.0956617222832257,
|
|
"grad_norm": 8.179385105457904,
|
|
"learning_rate": 4.782285076293264e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -516.0,
|
|
"logps/rejected": -612.0,
|
|
"loss": 0.4653,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -3.328125,
|
|
"rewards/margins": 1.1171875,
|
|
"rewards/rejected": -4.4375,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"epoch": 0.09603394688354953,
|
|
"grad_norm": 5.882894822920484,
|
|
"learning_rate": 4.800893189430591e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -564.0,
|
|
"logps/rejected": -656.0,
|
|
"loss": 0.4578,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -3.78125,
|
|
"rewards/margins": 1.09375,
|
|
"rewards/rejected": -4.875,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"epoch": 0.09640617148387337,
|
|
"grad_norm": 6.136891241565959,
|
|
"learning_rate": 4.81950130256792e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -552.0,
|
|
"logps/rejected": -660.0,
|
|
"loss": 0.4623,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -3.734375,
|
|
"rewards/margins": 1.2265625,
|
|
"rewards/rejected": -4.96875,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"epoch": 0.09677839608419721,
|
|
"grad_norm": 5.995934797811196,
|
|
"learning_rate": 4.838109415705247e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -552.0,
|
|
"logps/rejected": -632.0,
|
|
"loss": 0.4682,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -3.75,
|
|
"rewards/margins": 0.92578125,
|
|
"rewards/rejected": -4.65625,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"epoch": 0.09715062068452104,
|
|
"grad_norm": 8.39140037485633,
|
|
"learning_rate": 4.856717528842575e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -556.0,
|
|
"logps/rejected": -640.0,
|
|
"loss": 0.4679,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -3.84375,
|
|
"rewards/margins": 0.9375,
|
|
"rewards/rejected": -4.78125,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"epoch": 0.09752284528484488,
|
|
"grad_norm": 6.728658542049892,
|
|
"learning_rate": 4.875325641979903e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.59375,
|
|
"logps/chosen": -512.0,
|
|
"logps/rejected": -596.0,
|
|
"loss": 0.4658,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -3.375,
|
|
"rewards/margins": 1.1015625,
|
|
"rewards/rejected": -4.46875,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"epoch": 0.09789506988516872,
|
|
"grad_norm": 5.961291210522545,
|
|
"learning_rate": 4.893933755117231e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -516.0,
|
|
"logps/rejected": -604.0,
|
|
"loss": 0.4693,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -3.25,
|
|
"rewards/margins": 1.0625,
|
|
"rewards/rejected": -4.3125,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"epoch": 0.09826729448549254,
|
|
"grad_norm": 6.374922100398644,
|
|
"learning_rate": 4.912541868254558e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -596.0,
|
|
"logps/rejected": -664.0,
|
|
"loss": 0.4851,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -3.953125,
|
|
"rewards/margins": 0.984375,
|
|
"rewards/rejected": -4.9375,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"epoch": 0.09863951908581638,
|
|
"grad_norm": 6.008215668867427,
|
|
"learning_rate": 4.931149981391887e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -612.0,
|
|
"logps/rejected": -696.0,
|
|
"loss": 0.4813,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -4.25,
|
|
"rewards/margins": 0.91015625,
|
|
"rewards/rejected": -5.15625,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"epoch": 0.09901174368614021,
|
|
"grad_norm": 7.095347167166638,
|
|
"learning_rate": 4.949758094529215e-07,
|
|
"logits/chosen": -3.734375,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -572.0,
|
|
"logps/rejected": -652.0,
|
|
"loss": 0.4847,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -3.875,
|
|
"rewards/margins": 1.1484375,
|
|
"rewards/rejected": -5.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"epoch": 0.09938396828646405,
|
|
"grad_norm": 6.5667446269543115,
|
|
"learning_rate": 4.968366207666542e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -584.0,
|
|
"logps/rejected": -660.0,
|
|
"loss": 0.4679,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -3.890625,
|
|
"rewards/margins": 1.0234375,
|
|
"rewards/rejected": -4.9375,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"epoch": 0.09975619288678789,
|
|
"grad_norm": 7.083716586923517,
|
|
"learning_rate": 4.98697432080387e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -600.0,
|
|
"logps/rejected": -712.0,
|
|
"loss": 0.4665,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -4.15625,
|
|
"rewards/margins": 1.21875,
|
|
"rewards/rejected": -5.34375,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"epoch": 0.10012841748711172,
|
|
"grad_norm": 6.254478167134791,
|
|
"learning_rate": 4.999999810062151e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -604.0,
|
|
"logps/rejected": -660.0,
|
|
"loss": 0.4631,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -4.125,
|
|
"rewards/margins": 0.84375,
|
|
"rewards/rejected": -5.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"epoch": 0.10050064208743556,
|
|
"grad_norm": 7.351190394023517,
|
|
"learning_rate": 4.99999643339008e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -588.0,
|
|
"logps/rejected": -688.0,
|
|
"loss": 0.4632,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -4.125,
|
|
"rewards/margins": 1.125,
|
|
"rewards/rejected": -5.25,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"epoch": 0.1008728666877594,
|
|
"grad_norm": 7.912122090881811,
|
|
"learning_rate": 4.999988835883477e-07,
|
|
"logits/chosen": -3.59375,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -588.0,
|
|
"logps/rejected": -672.0,
|
|
"loss": 0.4627,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -4.0,
|
|
"rewards/margins": 1.1171875,
|
|
"rewards/rejected": -5.125,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"epoch": 0.10124509128808323,
|
|
"grad_norm": 9.566048432876075,
|
|
"learning_rate": 4.999977017555171e-07,
|
|
"logits/chosen": -3.65625,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -520.0,
|
|
"logps/rejected": -564.0,
|
|
"loss": 0.4796,
|
|
"rewards/accuracies": 0.706250011920929,
|
|
"rewards/chosen": -3.15625,
|
|
"rewards/margins": 0.8515625,
|
|
"rewards/rejected": -4.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"epoch": 0.10161731588840707,
|
|
"grad_norm": 6.662788071697429,
|
|
"learning_rate": 4.999960978425113e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -556.0,
|
|
"logps/rejected": -620.0,
|
|
"loss": 0.4441,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -3.609375,
|
|
"rewards/margins": 0.8984375,
|
|
"rewards/rejected": -4.5,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"epoch": 0.1019895404887309,
|
|
"grad_norm": 7.872813273518058,
|
|
"learning_rate": 4.999940718520385e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -568.0,
|
|
"logps/rejected": -680.0,
|
|
"loss": 0.4778,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -3.921875,
|
|
"rewards/margins": 1.1328125,
|
|
"rewards/rejected": -5.03125,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"epoch": 0.10236176508905473,
|
|
"grad_norm": 5.599470744457507,
|
|
"learning_rate": 4.999916237875191e-07,
|
|
"logits/chosen": -3.671875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -584.0,
|
|
"logps/rejected": -676.0,
|
|
"loss": 0.4441,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -3.984375,
|
|
"rewards/margins": 1.140625,
|
|
"rewards/rejected": -5.125,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"epoch": 0.10273398968937857,
|
|
"grad_norm": 6.068554789034378,
|
|
"learning_rate": 4.999887536530864e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -620.0,
|
|
"logps/rejected": -700.0,
|
|
"loss": 0.4644,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -4.40625,
|
|
"rewards/margins": 1.0546875,
|
|
"rewards/rejected": -5.46875,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"epoch": 0.1031062142897024,
|
|
"grad_norm": 6.028131826751676,
|
|
"learning_rate": 4.999854614535859e-07,
|
|
"logits/chosen": -3.6875,
|
|
"logits/rejected": -3.46875,
|
|
"logps/chosen": -616.0,
|
|
"logps/rejected": -704.0,
|
|
"loss": 0.4599,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -4.28125,
|
|
"rewards/margins": 0.91015625,
|
|
"rewards/rejected": -5.1875,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"epoch": 0.10347843889002624,
|
|
"grad_norm": 6.558263540906065,
|
|
"learning_rate": 4.999817471945762e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -572.0,
|
|
"logps/rejected": -648.0,
|
|
"loss": 0.4716,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -3.953125,
|
|
"rewards/margins": 0.9140625,
|
|
"rewards/rejected": -4.875,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"epoch": 0.10385066349035008,
|
|
"grad_norm": 6.6512482573387635,
|
|
"learning_rate": 4.99977610882328e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -612.0,
|
|
"logps/rejected": -704.0,
|
|
"loss": 0.4511,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -4.09375,
|
|
"rewards/margins": 1.1015625,
|
|
"rewards/rejected": -5.1875,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"epoch": 0.10422288809067391,
|
|
"grad_norm": 6.478428424893469,
|
|
"learning_rate": 4.99973052523825e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -644.0,
|
|
"logps/rejected": -720.0,
|
|
"loss": 0.4629,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -4.53125,
|
|
"rewards/margins": 0.95703125,
|
|
"rewards/rejected": -5.5,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"epoch": 0.10459511269099775,
|
|
"grad_norm": 6.531824310237248,
|
|
"learning_rate": 4.999680721267631e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -608.0,
|
|
"logps/rejected": -712.0,
|
|
"loss": 0.4643,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -4.125,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -5.40625,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"epoch": 0.10496733729132159,
|
|
"grad_norm": 6.2098151772372665,
|
|
"learning_rate": 4.999626696995509e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -608.0,
|
|
"logps/rejected": -684.0,
|
|
"loss": 0.4594,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -4.3125,
|
|
"rewards/margins": 1.0234375,
|
|
"rewards/rejected": -5.3125,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"epoch": 0.10533956189164542,
|
|
"grad_norm": 6.5872029603125615,
|
|
"learning_rate": 4.999568452513096e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -592.0,
|
|
"logps/rejected": -680.0,
|
|
"loss": 0.4756,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -4.0,
|
|
"rewards/margins": 1.1171875,
|
|
"rewards/rejected": -5.125,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"epoch": 0.10571178649196926,
|
|
"grad_norm": 7.105239867700983,
|
|
"learning_rate": 4.999505987918727e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -584.0,
|
|
"logps/rejected": -676.0,
|
|
"loss": 0.4726,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -4.125,
|
|
"rewards/margins": 1.0078125,
|
|
"rewards/rejected": -5.125,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"epoch": 0.1060840110922931,
|
|
"grad_norm": 7.548169483272573,
|
|
"learning_rate": 4.999439303317864e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.484375,
|
|
"logps/chosen": -616.0,
|
|
"logps/rejected": -732.0,
|
|
"loss": 0.4815,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -4.375,
|
|
"rewards/margins": 1.2421875,
|
|
"rewards/rejected": -5.625,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"epoch": 0.10645623569261692,
|
|
"grad_norm": 7.939773320795078,
|
|
"learning_rate": 4.999368398823093e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -4.0,
|
|
"logps/chosen": -600.0,
|
|
"logps/rejected": -672.0,
|
|
"loss": 0.444,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -3.984375,
|
|
"rewards/margins": 0.96484375,
|
|
"rewards/rejected": -4.9375,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"epoch": 0.10682846029294076,
|
|
"grad_norm": 7.050604047206517,
|
|
"learning_rate": 4.999293274554124e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -576.0,
|
|
"logps/rejected": -684.0,
|
|
"loss": 0.4654,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -3.890625,
|
|
"rewards/margins": 1.234375,
|
|
"rewards/rejected": -5.125,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"epoch": 0.10720068489326459,
|
|
"grad_norm": 7.817614304146132,
|
|
"learning_rate": 4.999213930637793e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -600.0,
|
|
"logps/rejected": -708.0,
|
|
"loss": 0.4577,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -4.09375,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -5.34375,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"epoch": 0.10757290949358843,
|
|
"grad_norm": 7.134591620777526,
|
|
"learning_rate": 4.999130367208059e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -632.0,
|
|
"logps/rejected": -716.0,
|
|
"loss": 0.4533,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -4.40625,
|
|
"rewards/margins": 1.125,
|
|
"rewards/rejected": -5.53125,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"epoch": 0.10794513409391226,
|
|
"grad_norm": 6.27829079218225,
|
|
"learning_rate": 4.999042584406005e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -616.0,
|
|
"logps/rejected": -724.0,
|
|
"loss": 0.4484,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -4.25,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -5.5,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"epoch": 0.1083173586942361,
|
|
"grad_norm": 7.389929100160467,
|
|
"learning_rate": 4.998950582379836e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -640.0,
|
|
"logps/rejected": -736.0,
|
|
"loss": 0.4542,
|
|
"rewards/accuracies": 0.6812499761581421,
|
|
"rewards/chosen": -4.5,
|
|
"rewards/margins": 1.125,
|
|
"rewards/rejected": -5.59375,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"epoch": 0.10868958329455994,
|
|
"grad_norm": 5.800758881234425,
|
|
"learning_rate": 4.998854361284885e-07,
|
|
"logits/chosen": -3.671875,
|
|
"logits/rejected": -3.484375,
|
|
"logps/chosen": -548.0,
|
|
"logps/rejected": -640.0,
|
|
"loss": 0.4683,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -3.5625,
|
|
"rewards/margins": 0.98046875,
|
|
"rewards/rejected": -4.53125,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"epoch": 0.10906180789488377,
|
|
"grad_norm": 6.72891021751421,
|
|
"learning_rate": 4.998753921283606e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -584.0,
|
|
"logps/rejected": -680.0,
|
|
"loss": 0.4601,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -4.125,
|
|
"rewards/margins": 1.0078125,
|
|
"rewards/rejected": -5.125,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"epoch": 0.10943403249520761,
|
|
"grad_norm": 5.891736829425196,
|
|
"learning_rate": 4.998649262545573e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -588.0,
|
|
"logps/rejected": -692.0,
|
|
"loss": 0.4532,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -4.125,
|
|
"rewards/margins": 1.234375,
|
|
"rewards/rejected": -5.34375,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"epoch": 0.10980625709553145,
|
|
"grad_norm": 6.256548268320358,
|
|
"learning_rate": 4.998540385247487e-07,
|
|
"logits/chosen": -3.640625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -548.0,
|
|
"logps/rejected": -616.0,
|
|
"loss": 0.4882,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -3.6875,
|
|
"rewards/margins": 0.84375,
|
|
"rewards/rejected": -4.53125,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"epoch": 0.11017848169585528,
|
|
"grad_norm": 6.650850428889748,
|
|
"learning_rate": 4.998427289573168e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -564.0,
|
|
"logps/rejected": -648.0,
|
|
"loss": 0.4889,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -3.8125,
|
|
"rewards/margins": 0.9375,
|
|
"rewards/rejected": -4.75,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"epoch": 0.11055070629617911,
|
|
"grad_norm": 5.198683697814229,
|
|
"learning_rate": 4.998309975713561e-07,
|
|
"logits/chosen": -3.734375,
|
|
"logits/rejected": -3.546875,
|
|
"logps/chosen": -568.0,
|
|
"logps/rejected": -644.0,
|
|
"loss": 0.4819,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -3.9375,
|
|
"rewards/margins": 0.921875,
|
|
"rewards/rejected": -4.84375,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"epoch": 0.11092293089650294,
|
|
"grad_norm": 5.95366015046444,
|
|
"learning_rate": 4.99818844386673e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -620.0,
|
|
"logps/rejected": -712.0,
|
|
"loss": 0.4656,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -4.4375,
|
|
"rewards/margins": 1.0078125,
|
|
"rewards/rejected": -5.4375,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"epoch": 0.11129515549682678,
|
|
"grad_norm": 6.993680918575246,
|
|
"learning_rate": 4.998062694237862e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -640.0,
|
|
"logps/rejected": -756.0,
|
|
"loss": 0.454,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -4.5,
|
|
"rewards/margins": 1.203125,
|
|
"rewards/rejected": -5.6875,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"epoch": 0.11166738009715062,
|
|
"grad_norm": 5.499983831778576,
|
|
"learning_rate": 4.997932727039265e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -576.0,
|
|
"logps/rejected": -668.0,
|
|
"loss": 0.477,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -3.796875,
|
|
"rewards/margins": 1.078125,
|
|
"rewards/rejected": -4.875,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"epoch": 0.11203960469747445,
|
|
"grad_norm": 6.275016541282044,
|
|
"learning_rate": 4.997798542490368e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -588.0,
|
|
"logps/rejected": -688.0,
|
|
"loss": 0.4388,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -4.125,
|
|
"rewards/margins": 0.9765625,
|
|
"rewards/rejected": -5.09375,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"epoch": 0.11241182929779829,
|
|
"grad_norm": 6.533187769494032,
|
|
"learning_rate": 4.997660140817717e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -664.0,
|
|
"logps/rejected": -764.0,
|
|
"loss": 0.4315,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -4.71875,
|
|
"rewards/margins": 1.1875,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"epoch": 0.11278405389812213,
|
|
"grad_norm": 7.138963727779762,
|
|
"learning_rate": 4.997517522254984e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.421875,
|
|
"logps/chosen": -600.0,
|
|
"logps/rejected": -684.0,
|
|
"loss": 0.4499,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -4.0625,
|
|
"rewards/margins": 1.0546875,
|
|
"rewards/rejected": -5.125,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"epoch": 0.11315627849844596,
|
|
"grad_norm": 7.886282113255406,
|
|
"learning_rate": 4.997370687042956e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -660.0,
|
|
"logps/rejected": -748.0,
|
|
"loss": 0.4578,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -4.6875,
|
|
"rewards/margins": 1.1171875,
|
|
"rewards/rejected": -5.8125,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"epoch": 0.1135285030987698,
|
|
"grad_norm": 6.5135054900143246,
|
|
"learning_rate": 4.997219635429538e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -620.0,
|
|
"logps/rejected": -744.0,
|
|
"loss": 0.4422,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -4.34375,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -5.59375,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"epoch": 0.11390072769909364,
|
|
"grad_norm": 7.277785076865823,
|
|
"learning_rate": 4.997064367669758e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -624.0,
|
|
"logps/rejected": -720.0,
|
|
"loss": 0.4561,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -4.46875,
|
|
"rewards/margins": 0.9609375,
|
|
"rewards/rejected": -5.4375,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"epoch": 0.11427295229941747,
|
|
"grad_norm": 5.747350850395194,
|
|
"learning_rate": 4.996904884025761e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -616.0,
|
|
"logps/rejected": -704.0,
|
|
"loss": 0.4631,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -4.1875,
|
|
"rewards/margins": 1.265625,
|
|
"rewards/rejected": -5.4375,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"epoch": 0.11464517689974131,
|
|
"grad_norm": 5.935492702675676,
|
|
"learning_rate": 4.996741184766806e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -616.0,
|
|
"logps/rejected": -732.0,
|
|
"loss": 0.4427,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -4.4375,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -5.6875,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"epoch": 0.11501740150006513,
|
|
"grad_norm": 7.403083936549838,
|
|
"learning_rate": 4.996573270169275e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -612.0,
|
|
"logps/rejected": -688.0,
|
|
"loss": 0.4474,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -4.1875,
|
|
"rewards/margins": 1.078125,
|
|
"rewards/rejected": -5.28125,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"epoch": 0.11538962610038897,
|
|
"grad_norm": 6.384910704133043,
|
|
"learning_rate": 4.996401140516663e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -676.0,
|
|
"logps/rejected": -772.0,
|
|
"loss": 0.4433,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -4.90625,
|
|
"rewards/margins": 1.09375,
|
|
"rewards/rejected": -6.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"epoch": 0.1157618507007128,
|
|
"grad_norm": 7.451103451639324,
|
|
"learning_rate": 4.996224796099584e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -616.0,
|
|
"logps/rejected": -720.0,
|
|
"loss": 0.4448,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -4.3125,
|
|
"rewards/margins": 1.2890625,
|
|
"rewards/rejected": -5.625,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"epoch": 0.11613407530103664,
|
|
"grad_norm": 10.66435519539687,
|
|
"learning_rate": 4.996044237215765e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -648.0,
|
|
"logps/rejected": -756.0,
|
|
"loss": 0.451,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -4.65625,
|
|
"rewards/margins": 1.1484375,
|
|
"rewards/rejected": -5.8125,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"epoch": 0.11650629990136048,
|
|
"grad_norm": 8.614773529495455,
|
|
"learning_rate": 4.995859464170051e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -652.0,
|
|
"logps/rejected": -760.0,
|
|
"loss": 0.4423,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -4.75,
|
|
"rewards/margins": 1.140625,
|
|
"rewards/rejected": -5.875,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"epoch": 0.11687852450168432,
|
|
"grad_norm": 6.230168528893165,
|
|
"learning_rate": 4.995670477274402e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -600.0,
|
|
"logps/rejected": -716.0,
|
|
"loss": 0.4662,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -4.25,
|
|
"rewards/margins": 1.171875,
|
|
"rewards/rejected": -5.4375,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"epoch": 0.11725074910200815,
|
|
"grad_norm": 6.630347638446134,
|
|
"learning_rate": 4.995477276847889e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -620.0,
|
|
"logps/rejected": -736.0,
|
|
"loss": 0.4494,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -4.5,
|
|
"rewards/margins": 1.0703125,
|
|
"rewards/rejected": -5.5625,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"epoch": 0.11762297370233199,
|
|
"grad_norm": 5.989919817361233,
|
|
"learning_rate": 4.995279863216701e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -596.0,
|
|
"logps/rejected": -680.0,
|
|
"loss": 0.4379,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -4.21875,
|
|
"rewards/margins": 1.0625,
|
|
"rewards/rejected": -5.28125,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"epoch": 0.11799519830265583,
|
|
"grad_norm": 6.854189392325609,
|
|
"learning_rate": 4.995078236714138e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -620.0,
|
|
"logps/rejected": -780.0,
|
|
"loss": 0.4494,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -4.34375,
|
|
"rewards/margins": 1.5703125,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"epoch": 0.11836742290297966,
|
|
"grad_norm": 6.482345899476014,
|
|
"learning_rate": 4.994872397680615e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -608.0,
|
|
"logps/rejected": -704.0,
|
|
"loss": 0.467,
|
|
"rewards/accuracies": 0.6937500238418579,
|
|
"rewards/chosen": -4.375,
|
|
"rewards/margins": 0.95703125,
|
|
"rewards/rejected": -5.34375,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"epoch": 0.1187396475033035,
|
|
"grad_norm": 10.550904343312228,
|
|
"learning_rate": 4.994662346463655e-07,
|
|
"logits/chosen": -3.75,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -616.0,
|
|
"logps/rejected": -692.0,
|
|
"loss": 0.4632,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -4.28125,
|
|
"rewards/margins": 1.0625,
|
|
"rewards/rejected": -5.34375,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"epoch": 0.11911187210362732,
|
|
"grad_norm": 8.62618156176352,
|
|
"learning_rate": 4.994448083417896e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -648.0,
|
|
"logps/rejected": -772.0,
|
|
"loss": 0.4431,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -4.6875,
|
|
"rewards/margins": 1.2109375,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"epoch": 0.11948409670395116,
|
|
"grad_norm": 6.102173546807845,
|
|
"learning_rate": 4.994229608905087e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -620.0,
|
|
"logps/rejected": -792.0,
|
|
"loss": 0.4563,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -4.3125,
|
|
"rewards/margins": 1.7578125,
|
|
"rewards/rejected": -6.09375,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"epoch": 0.119856321304275,
|
|
"grad_norm": 6.465859881852491,
|
|
"learning_rate": 4.994006923294085e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -600.0,
|
|
"logps/rejected": -708.0,
|
|
"loss": 0.458,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -4.3125,
|
|
"rewards/margins": 1.1484375,
|
|
"rewards/rejected": -5.46875,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"epoch": 0.12022854590459883,
|
|
"grad_norm": 6.7089494535421155,
|
|
"learning_rate": 4.993780026960859e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -664.0,
|
|
"logps/rejected": -740.0,
|
|
"loss": 0.4764,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -4.5,
|
|
"rewards/margins": 1.09375,
|
|
"rewards/rejected": -5.625,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"epoch": 0.12060077050492267,
|
|
"grad_norm": 6.321312713360913,
|
|
"learning_rate": 4.993548920288487e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -624.0,
|
|
"logps/rejected": -732.0,
|
|
"loss": 0.4619,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -4.40625,
|
|
"rewards/margins": 1.265625,
|
|
"rewards/rejected": -5.6875,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"epoch": 0.1209729951052465,
|
|
"grad_norm": 6.254706530958953,
|
|
"learning_rate": 4.993313603667152e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -648.0,
|
|
"logps/rejected": -752.0,
|
|
"loss": 0.4426,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -4.75,
|
|
"rewards/margins": 1.140625,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"epoch": 0.12134521970557034,
|
|
"grad_norm": 6.052365903405565,
|
|
"learning_rate": 4.993074077494151e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -648.0,
|
|
"logps/rejected": -780.0,
|
|
"loss": 0.4474,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -4.8125,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -6.1875,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"epoch": 0.12171744430589418,
|
|
"grad_norm": 8.853479006674554,
|
|
"learning_rate": 4.992830342173883e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -644.0,
|
|
"logps/rejected": -752.0,
|
|
"loss": 0.4225,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -4.40625,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -5.75,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"epoch": 0.12208966890621802,
|
|
"grad_norm": 10.536193454846627,
|
|
"learning_rate": 4.992582398117854e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.484375,
|
|
"logps/chosen": -652.0,
|
|
"logps/rejected": -788.0,
|
|
"loss": 0.4519,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -4.8125,
|
|
"rewards/margins": 1.59375,
|
|
"rewards/rejected": -6.40625,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"epoch": 0.12246189350654185,
|
|
"grad_norm": 6.233893886072476,
|
|
"learning_rate": 4.992330245744679e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -660.0,
|
|
"logps/rejected": -772.0,
|
|
"loss": 0.4553,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -4.75,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -6.03125,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"epoch": 0.12283411810686569,
|
|
"grad_norm": 5.553090857036375,
|
|
"learning_rate": 4.992073885480076e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.984375,
|
|
"logps/chosen": -648.0,
|
|
"logps/rejected": -696.0,
|
|
"loss": 0.4666,
|
|
"rewards/accuracies": 0.6875,
|
|
"rewards/chosen": -4.53125,
|
|
"rewards/margins": 0.8828125,
|
|
"rewards/rejected": -5.40625,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"epoch": 0.12320634270718951,
|
|
"grad_norm": 6.546810988650163,
|
|
"learning_rate": 4.991813317756866e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -676.0,
|
|
"logps/rejected": -776.0,
|
|
"loss": 0.4557,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -4.90625,
|
|
"rewards/margins": 1.265625,
|
|
"rewards/rejected": -6.1875,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"epoch": 0.12357856730751335,
|
|
"grad_norm": 7.251938441351107,
|
|
"learning_rate": 4.991548543014975e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -696.0,
|
|
"logps/rejected": -804.0,
|
|
"loss": 0.4771,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.09375,
|
|
"rewards/margins": 1.296875,
|
|
"rewards/rejected": -6.40625,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"epoch": 0.12395079190783719,
|
|
"grad_norm": 6.497208555996562,
|
|
"learning_rate": 4.991279561701434e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -640.0,
|
|
"logps/rejected": -764.0,
|
|
"loss": 0.4487,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -4.5625,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -5.96875,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"epoch": 0.12432301650816102,
|
|
"grad_norm": 7.213693539521206,
|
|
"learning_rate": 4.991006374270371e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -708.0,
|
|
"logps/rejected": -812.0,
|
|
"loss": 0.4531,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.125,
|
|
"rewards/margins": 1.1875,
|
|
"rewards/rejected": -6.3125,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"epoch": 0.12469524110848486,
|
|
"grad_norm": 8.12069495771951,
|
|
"learning_rate": 4.990728981183019e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -692.0,
|
|
"logps/rejected": -796.0,
|
|
"loss": 0.4554,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -4.9375,
|
|
"rewards/margins": 1.2734375,
|
|
"rewards/rejected": -6.21875,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"epoch": 0.1250674657088087,
|
|
"grad_norm": 5.857658506415699,
|
|
"learning_rate": 4.990447382907713e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -640.0,
|
|
"logps/rejected": -736.0,
|
|
"loss": 0.4743,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -4.59375,
|
|
"rewards/margins": 1.0625,
|
|
"rewards/rejected": -5.65625,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"epoch": 0.12543969030913252,
|
|
"grad_norm": 6.156044660966783,
|
|
"learning_rate": 4.990161579919882e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -676.0,
|
|
"logps/rejected": -776.0,
|
|
"loss": 0.4445,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -4.78125,
|
|
"rewards/margins": 1.1875,
|
|
"rewards/rejected": -5.96875,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"epoch": 0.12581191490945637,
|
|
"grad_norm": 5.802920761503324,
|
|
"learning_rate": 4.98987157270206e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -664.0,
|
|
"logps/rejected": -760.0,
|
|
"loss": 0.4552,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -4.75,
|
|
"rewards/margins": 1.140625,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"epoch": 0.1261841395097802,
|
|
"grad_norm": 7.167183431933801,
|
|
"learning_rate": 4.989577361743875e-07,
|
|
"logits/chosen": -3.75,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -664.0,
|
|
"logps/rejected": -752.0,
|
|
"loss": 0.4587,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -4.71875,
|
|
"rewards/margins": 1.0234375,
|
|
"rewards/rejected": -5.75,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"epoch": 0.12655636411010404,
|
|
"grad_norm": 6.918307973359023,
|
|
"learning_rate": 4.989278947542056e-07,
|
|
"logits/chosen": -3.75,
|
|
"logits/rejected": -3.46875,
|
|
"logps/chosen": -704.0,
|
|
"logps/rejected": -796.0,
|
|
"loss": 0.415,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -4.90625,
|
|
"rewards/margins": 1.2421875,
|
|
"rewards/rejected": -6.15625,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"epoch": 0.12692858871042786,
|
|
"grad_norm": 7.79049417383309,
|
|
"learning_rate": 4.988976330600426e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -664.0,
|
|
"logps/rejected": -780.0,
|
|
"loss": 0.461,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -4.9375,
|
|
"rewards/margins": 1.359375,
|
|
"rewards/rejected": -6.28125,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"epoch": 0.12730081331075171,
|
|
"grad_norm": 5.812979506475925,
|
|
"learning_rate": 4.988669511429902e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -668.0,
|
|
"logps/rejected": -764.0,
|
|
"loss": 0.4646,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -4.84375,
|
|
"rewards/margins": 1.078125,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"epoch": 0.12767303791107554,
|
|
"grad_norm": 5.202303192793724,
|
|
"learning_rate": 4.988358490548501e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -664.0,
|
|
"logps/rejected": -756.0,
|
|
"loss": 0.4758,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -4.59375,
|
|
"rewards/margins": 1.171875,
|
|
"rewards/rejected": -5.78125,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"epoch": 0.1280452625113994,
|
|
"grad_norm": 5.126752700574202,
|
|
"learning_rate": 4.988043268481329e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -688.0,
|
|
"logps/rejected": -816.0,
|
|
"loss": 0.4271,
|
|
"rewards/accuracies": 0.8500000238418579,
|
|
"rewards/chosen": -4.9375,
|
|
"rewards/margins": 1.4765625,
|
|
"rewards/rejected": -6.4375,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"epoch": 0.1284174871117232,
|
|
"grad_norm": 8.729319429305749,
|
|
"learning_rate": 4.987723845760587e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -672.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.4415,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -4.875,
|
|
"rewards/margins": 1.2734375,
|
|
"rewards/rejected": -6.15625,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"epoch": 0.12878971171204706,
|
|
"grad_norm": 6.724077120857691,
|
|
"learning_rate": 4.987400222925569e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -696.0,
|
|
"logps/rejected": -792.0,
|
|
"loss": 0.4464,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -5.1875,
|
|
"rewards/margins": 0.9921875,
|
|
"rewards/rejected": -6.1875,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"epoch": 0.12916193631237088,
|
|
"grad_norm": 5.831736342369829,
|
|
"learning_rate": 4.987072400522658e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -660.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.429,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -5.21875,
|
|
"rewards/margins": 1.21875,
|
|
"rewards/rejected": -6.4375,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"epoch": 0.1295341609126947,
|
|
"grad_norm": 8.807065955668172,
|
|
"learning_rate": 4.986740379105328e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -668.0,
|
|
"logps/rejected": -772.0,
|
|
"loss": 0.4597,
|
|
"rewards/accuracies": 0.668749988079071,
|
|
"rewards/chosen": -4.90625,
|
|
"rewards/margins": 0.99609375,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"epoch": 0.12990638551301856,
|
|
"grad_norm": 5.358912099415164,
|
|
"learning_rate": 4.986404159234145e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -684.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.4327,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -4.8125,
|
|
"rewards/margins": 1.2734375,
|
|
"rewards/rejected": -6.0625,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"epoch": 0.13027861011334238,
|
|
"grad_norm": 5.53604733587871,
|
|
"learning_rate": 4.986063741476759e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -728.0,
|
|
"logps/rejected": -852.0,
|
|
"loss": 0.4544,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.25,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -6.65625,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"epoch": 0.13065083471366623,
|
|
"grad_norm": 6.606069813717992,
|
|
"learning_rate": 4.985719126407912e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -720.0,
|
|
"logps/rejected": -828.0,
|
|
"loss": 0.4361,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.40625,
|
|
"rewards/margins": 1.3828125,
|
|
"rewards/rejected": -6.78125,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"epoch": 0.13102305931399005,
|
|
"grad_norm": 5.712788808270214,
|
|
"learning_rate": 4.985370314609426e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -676.0,
|
|
"logps/rejected": -800.0,
|
|
"loss": 0.4451,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -4.8125,
|
|
"rewards/margins": 1.4453125,
|
|
"rewards/rejected": -6.25,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"epoch": 0.1313952839143139,
|
|
"grad_norm": 7.268630466589827,
|
|
"learning_rate": 4.985017306670216e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.5,
|
|
"logps/chosen": -680.0,
|
|
"logps/rejected": -812.0,
|
|
"loss": 0.4517,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -4.875,
|
|
"rewards/margins": 1.5703125,
|
|
"rewards/rejected": -6.4375,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"epoch": 0.13176750851463773,
|
|
"grad_norm": 5.380960300414308,
|
|
"learning_rate": 4.984660103186278e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -732.0,
|
|
"logps/rejected": -852.0,
|
|
"loss": 0.4583,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.40625,
|
|
"rewards/margins": 1.2734375,
|
|
"rewards/rejected": -6.6875,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"epoch": 0.13213973311496158,
|
|
"grad_norm": 5.495748931798036,
|
|
"learning_rate": 4.984298704760689e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -696.0,
|
|
"logps/rejected": -796.0,
|
|
"loss": 0.4337,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -5.0625,
|
|
"rewards/margins": 1.1015625,
|
|
"rewards/rejected": -6.15625,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"epoch": 0.1325119577152854,
|
|
"grad_norm": 7.020317782921593,
|
|
"learning_rate": 4.983933112003615e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -680.0,
|
|
"logps/rejected": -808.0,
|
|
"loss": 0.4384,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -5.0,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -6.5,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"epoch": 0.13288418231560925,
|
|
"grad_norm": 6.2531181232625705,
|
|
"learning_rate": 4.983563325532295e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -716.0,
|
|
"logps/rejected": -836.0,
|
|
"loss": 0.4424,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.4375,
|
|
"rewards/margins": 1.3515625,
|
|
"rewards/rejected": -6.78125,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"epoch": 0.13325640691593307,
|
|
"grad_norm": 6.767773681407881,
|
|
"learning_rate": 4.983189345971056e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -712.0,
|
|
"logps/rejected": -816.0,
|
|
"loss": 0.4388,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -5.28125,
|
|
"rewards/margins": 1.1640625,
|
|
"rewards/rejected": -6.4375,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"epoch": 0.1336286315162569,
|
|
"grad_norm": 6.5538001866067725,
|
|
"learning_rate": 4.982811173951301e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -684.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.4531,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.1875,
|
|
"rewards/margins": 1.15625,
|
|
"rewards/rejected": -6.34375,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"epoch": 0.13400085611658075,
|
|
"grad_norm": 5.932105974565392,
|
|
"learning_rate": 4.982428810111512e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -708.0,
|
|
"logps/rejected": -804.0,
|
|
"loss": 0.4587,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -5.125,
|
|
"rewards/margins": 0.98828125,
|
|
"rewards/rejected": -6.125,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"epoch": 0.13437308071690457,
|
|
"grad_norm": 5.929016937619805,
|
|
"learning_rate": 4.982042255097245e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -684.0,
|
|
"logps/rejected": -800.0,
|
|
"loss": 0.4311,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -4.90625,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -6.3125,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"epoch": 0.13474530531722842,
|
|
"grad_norm": 6.9391839889692735,
|
|
"learning_rate": 4.981651509561137e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -684.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.4472,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -4.96875,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -6.21875,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"epoch": 0.13511752991755224,
|
|
"grad_norm": 7.020061956926156,
|
|
"learning_rate": 4.981256574162897e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -676.0,
|
|
"logps/rejected": -808.0,
|
|
"loss": 0.4495,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -4.875,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -6.46875,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"epoch": 0.1354897545178761,
|
|
"grad_norm": 6.6193532141218006,
|
|
"learning_rate": 4.980857449569309e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -676.0,
|
|
"logps/rejected": -788.0,
|
|
"loss": 0.4653,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -4.90625,
|
|
"rewards/margins": 1.203125,
|
|
"rewards/rejected": -6.125,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"epoch": 0.13586197911819992,
|
|
"grad_norm": 7.247700675584012,
|
|
"learning_rate": 4.98045413645423e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -712.0,
|
|
"logps/rejected": -832.0,
|
|
"loss": 0.4359,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.0625,
|
|
"rewards/margins": 1.4921875,
|
|
"rewards/rejected": -6.5625,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"epoch": 0.13623420371852377,
|
|
"grad_norm": 5.159949207335705,
|
|
"learning_rate": 4.980046635498589e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.484375,
|
|
"logps/chosen": -688.0,
|
|
"logps/rejected": -820.0,
|
|
"loss": 0.4559,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.21875,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -6.5625,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"epoch": 0.1366064283188476,
|
|
"grad_norm": 6.062641438365062,
|
|
"learning_rate": 4.979634947390381e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -692.0,
|
|
"logps/rejected": -804.0,
|
|
"loss": 0.4615,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.0,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -6.25,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"epoch": 0.13697865291917144,
|
|
"grad_norm": 5.254162964861059,
|
|
"learning_rate": 4.979219072824678e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -672.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.445,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.03125,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -6.34375,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"epoch": 0.13735087751949526,
|
|
"grad_norm": 5.487312528948721,
|
|
"learning_rate": 4.978799012503614e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -680.0,
|
|
"logps/rejected": -812.0,
|
|
"loss": 0.4355,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -4.90625,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -6.3125,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"epoch": 0.13772310211981909,
|
|
"grad_norm": 7.594908714571471,
|
|
"learning_rate": 4.978374767136391e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -696.0,
|
|
"logps/rejected": -804.0,
|
|
"loss": 0.4589,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.1875,
|
|
"rewards/margins": 1.2734375,
|
|
"rewards/rejected": -6.46875,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"epoch": 0.13809532672014294,
|
|
"grad_norm": 7.736311008629555,
|
|
"learning_rate": 4.977946337439281e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -704.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.4331,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -4.8125,
|
|
"rewards/margins": 1.2734375,
|
|
"rewards/rejected": -6.09375,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"epoch": 0.13846755132046676,
|
|
"grad_norm": 5.947985224213836,
|
|
"learning_rate": 4.977513724135615e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.59375,
|
|
"logps/chosen": -636.0,
|
|
"logps/rejected": -772.0,
|
|
"loss": 0.4452,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -4.5625,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"epoch": 0.1388397759207906,
|
|
"grad_norm": 5.988840734504288,
|
|
"learning_rate": 4.977076927955792e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -668.0,
|
|
"logps/rejected": -764.0,
|
|
"loss": 0.455,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -4.75,
|
|
"rewards/margins": 1.1953125,
|
|
"rewards/rejected": -5.9375,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"epoch": 0.13921200052111443,
|
|
"grad_norm": 5.5971885556830046,
|
|
"learning_rate": 4.976635949637268e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.578125,
|
|
"logps/chosen": -672.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.4511,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -4.9375,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -6.28125,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"epoch": 0.13958422512143828,
|
|
"grad_norm": 8.287435415630837,
|
|
"learning_rate": 4.976190789924563e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.59375,
|
|
"logps/chosen": -656.0,
|
|
"logps/rejected": -760.0,
|
|
"loss": 0.4412,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -4.8125,
|
|
"rewards/margins": 1.1484375,
|
|
"rewards/rejected": -5.96875,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"epoch": 0.1399564497217621,
|
|
"grad_norm": 5.790382201491668,
|
|
"learning_rate": 4.975741449569258e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -656.0,
|
|
"logps/rejected": -740.0,
|
|
"loss": 0.4597,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -4.96875,
|
|
"rewards/margins": 0.9296875,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"epoch": 0.14032867432208596,
|
|
"grad_norm": 5.124825008551274,
|
|
"learning_rate": 4.975287929329989e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -684.0,
|
|
"logps/rejected": -792.0,
|
|
"loss": 0.4558,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -4.875,
|
|
"rewards/margins": 1.2421875,
|
|
"rewards/rejected": -6.125,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"epoch": 0.14070089892240978,
|
|
"grad_norm": 6.493436880612706,
|
|
"learning_rate": 4.974830229972452e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.578125,
|
|
"logps/chosen": -660.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.4346,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -4.90625,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -6.28125,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"epoch": 0.14107312352273363,
|
|
"grad_norm": 6.250102477323721,
|
|
"learning_rate": 4.974368352269397e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -664.0,
|
|
"logps/rejected": -796.0,
|
|
"loss": 0.4242,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -4.9375,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -6.21875,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"epoch": 0.14144534812305745,
|
|
"grad_norm": 7.074324449573555,
|
|
"learning_rate": 4.973902297000628e-07,
|
|
"logits/chosen": -3.6875,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -692.0,
|
|
"logps/rejected": -788.0,
|
|
"loss": 0.4489,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.15625,
|
|
"rewards/margins": 1.1796875,
|
|
"rewards/rejected": -6.34375,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"epoch": 0.14181757272338127,
|
|
"grad_norm": 5.72103871873261,
|
|
"learning_rate": 4.973432064953004e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -712.0,
|
|
"logps/rejected": -832.0,
|
|
"loss": 0.4726,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.28125,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -6.53125,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"epoch": 0.14218979732370512,
|
|
"grad_norm": 5.227702220552182,
|
|
"learning_rate": 4.972957656920434e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -652.0,
|
|
"logps/rejected": -788.0,
|
|
"loss": 0.4352,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -4.71875,
|
|
"rewards/margins": 1.3671875,
|
|
"rewards/rejected": -6.09375,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"epoch": 0.14256202192402895,
|
|
"grad_norm": 5.856768027961113,
|
|
"learning_rate": 4.972479073703879e-07,
|
|
"logits/chosen": -3.75,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -740.0,
|
|
"logps/rejected": -836.0,
|
|
"loss": 0.4596,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.25,
|
|
"rewards/margins": 1.125,
|
|
"rewards/rejected": -6.375,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"epoch": 0.1429342465243528,
|
|
"grad_norm": 6.732949783918141,
|
|
"learning_rate": 4.971996316111347e-07,
|
|
"logits/chosen": -3.734375,
|
|
"logits/rejected": -3.46875,
|
|
"logps/chosen": -724.0,
|
|
"logps/rejected": -816.0,
|
|
"loss": 0.4298,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.25,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -6.5625,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"epoch": 0.14330647112467662,
|
|
"grad_norm": 7.137832407271159,
|
|
"learning_rate": 4.971509384957899e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -656.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.4276,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -5.0,
|
|
"rewards/margins": 1.203125,
|
|
"rewards/rejected": -6.21875,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"epoch": 0.14367869572500047,
|
|
"grad_norm": 5.67480806034546,
|
|
"learning_rate": 4.971018281065632e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -720.0,
|
|
"logps/rejected": -832.0,
|
|
"loss": 0.4135,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.1875,
|
|
"rewards/margins": 1.3828125,
|
|
"rewards/rejected": -6.5625,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"epoch": 0.1440509203253243,
|
|
"grad_norm": 5.725539657155525,
|
|
"learning_rate": 4.9705230052637e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -708.0,
|
|
"logps/rejected": -804.0,
|
|
"loss": 0.4571,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -4.96875,
|
|
"rewards/margins": 1.296875,
|
|
"rewards/rejected": -6.25,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"epoch": 0.14442314492564814,
|
|
"grad_norm": 6.9494194463470045,
|
|
"learning_rate": 4.970023558388294e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -672.0,
|
|
"logps/rejected": -764.0,
|
|
"loss": 0.4452,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -4.8125,
|
|
"rewards/margins": 1.1796875,
|
|
"rewards/rejected": -6.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"epoch": 0.14479536952597197,
|
|
"grad_norm": 5.073889264949155,
|
|
"learning_rate": 4.969519941282647e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -696.0,
|
|
"logps/rejected": -780.0,
|
|
"loss": 0.4293,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -4.9375,
|
|
"rewards/margins": 1.0390625,
|
|
"rewards/rejected": -6.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"epoch": 0.14516759412629582,
|
|
"grad_norm": 22.01836030547002,
|
|
"learning_rate": 4.969012154797034e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -676.0,
|
|
"logps/rejected": -808.0,
|
|
"loss": 0.4385,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -4.9375,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -6.4375,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"epoch": 0.14553981872661964,
|
|
"grad_norm": 7.421473800191189,
|
|
"learning_rate": 4.96850019978877e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -668.0,
|
|
"logps/rejected": -808.0,
|
|
"loss": 0.4516,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -4.96875,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -6.34375,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"epoch": 0.1459120433269435,
|
|
"grad_norm": 5.44044171086137,
|
|
"learning_rate": 4.967984077122207e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -628.0,
|
|
"logps/rejected": -732.0,
|
|
"loss": 0.4638,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -4.46875,
|
|
"rewards/margins": 1.1640625,
|
|
"rewards/rejected": -5.625,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"epoch": 0.14628426792726731,
|
|
"grad_norm": 6.467042854573016,
|
|
"learning_rate": 4.967463787668734e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -676.0,
|
|
"logps/rejected": -792.0,
|
|
"loss": 0.4384,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -4.6875,
|
|
"rewards/margins": 1.359375,
|
|
"rewards/rejected": -6.03125,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"epoch": 0.14665649252759114,
|
|
"grad_norm": 5.704803025637172,
|
|
"learning_rate": 4.966939332306773e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -704.0,
|
|
"logps/rejected": -820.0,
|
|
"loss": 0.4512,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -5.1875,
|
|
"rewards/margins": 1.109375,
|
|
"rewards/rejected": -6.28125,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"epoch": 0.147028717127915,
|
|
"grad_norm": 5.4415373853794025,
|
|
"learning_rate": 4.966410711921784e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -684.0,
|
|
"logps/rejected": -768.0,
|
|
"loss": 0.4341,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -5.15625,
|
|
"rewards/margins": 0.93359375,
|
|
"rewards/rejected": -6.09375,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"epoch": 0.1474009417282388,
|
|
"grad_norm": 6.177926810269377,
|
|
"learning_rate": 4.965877927406252e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -692.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.4473,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.21875,
|
|
"rewards/margins": 1.1484375,
|
|
"rewards/rejected": -6.375,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"epoch": 0.14777316632856266,
|
|
"grad_norm": 5.659221212517091,
|
|
"learning_rate": 4.965340979659699e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -696.0,
|
|
"logps/rejected": -804.0,
|
|
"loss": 0.4514,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -5.21875,
|
|
"rewards/margins": 1.125,
|
|
"rewards/rejected": -6.34375,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"epoch": 0.14814539092888648,
|
|
"grad_norm": 6.423794139715007,
|
|
"learning_rate": 4.964799869588673e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -668.0,
|
|
"logps/rejected": -792.0,
|
|
"loss": 0.4713,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -4.875,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -6.1875,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"epoch": 0.14851761552921033,
|
|
"grad_norm": 6.008728480613058,
|
|
"learning_rate": 4.964254598106751e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -672.0,
|
|
"logps/rejected": -780.0,
|
|
"loss": 0.4413,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -4.6875,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -6.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"epoch": 0.14888984012953416,
|
|
"grad_norm": 6.688998752516995,
|
|
"learning_rate": 4.96370516613453e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -720.0,
|
|
"logps/rejected": -816.0,
|
|
"loss": 0.4574,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -5.3125,
|
|
"rewards/margins": 1.0,
|
|
"rewards/rejected": -6.3125,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"epoch": 0.149262064729858,
|
|
"grad_norm": 5.101392987007391,
|
|
"learning_rate": 4.963151574599641e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.515625,
|
|
"logps/chosen": -672.0,
|
|
"logps/rejected": -804.0,
|
|
"loss": 0.4559,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.0625,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -6.375,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"epoch": 0.14963428933018183,
|
|
"grad_norm": 6.072334332905822,
|
|
"learning_rate": 4.962593824436731e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -684.0,
|
|
"logps/rejected": -812.0,
|
|
"loss": 0.4317,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.0,
|
|
"rewards/margins": 1.21875,
|
|
"rewards/rejected": -6.21875,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"epoch": 0.15000651393050568,
|
|
"grad_norm": 5.549039175033328,
|
|
"learning_rate": 4.962031916587469e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -676.0,
|
|
"logps/rejected": -796.0,
|
|
"loss": 0.4369,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.125,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -6.46875,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"epoch": 0.1503787385308295,
|
|
"grad_norm": 8.33290523579846,
|
|
"learning_rate": 4.961465852000545e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -712.0,
|
|
"logps/rejected": -828.0,
|
|
"loss": 0.453,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.25,
|
|
"rewards/margins": 1.2265625,
|
|
"rewards/rejected": -6.46875,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"epoch": 0.15075096313115333,
|
|
"grad_norm": 6.004519762772136,
|
|
"learning_rate": 4.960895631631665e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.984375,
|
|
"logps/chosen": -728.0,
|
|
"logps/rejected": -840.0,
|
|
"loss": 0.4448,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -5.28125,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -6.8125,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"epoch": 0.15112318773147718,
|
|
"grad_norm": 6.192962219611233,
|
|
"learning_rate": 4.960321256443555e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -844.0,
|
|
"loss": 0.4421,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.21875,
|
|
"rewards/margins": 1.359375,
|
|
"rewards/rejected": -6.5625,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"epoch": 0.151495412331801,
|
|
"grad_norm": 5.612093016508565,
|
|
"learning_rate": 4.959742727405952e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -700.0,
|
|
"logps/rejected": -804.0,
|
|
"loss": 0.4233,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.0625,
|
|
"rewards/margins": 1.2421875,
|
|
"rewards/rejected": -6.3125,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"epoch": 0.15186763693212485,
|
|
"grad_norm": 6.4443742174587095,
|
|
"learning_rate": 4.959160045495607e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -652.0,
|
|
"logps/rejected": -772.0,
|
|
"loss": 0.4588,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -4.65625,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"epoch": 0.15223986153244867,
|
|
"grad_norm": 6.848896537334838,
|
|
"learning_rate": 4.958573211696285e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -692.0,
|
|
"logps/rejected": -808.0,
|
|
"loss": 0.4566,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.0625,
|
|
"rewards/margins": 1.203125,
|
|
"rewards/rejected": -6.25,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"epoch": 0.15261208613277252,
|
|
"grad_norm": 6.139629914407962,
|
|
"learning_rate": 4.957982226998757e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -664.0,
|
|
"logps/rejected": -804.0,
|
|
"loss": 0.4534,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -4.9375,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -6.25,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"epoch": 0.15298431073309635,
|
|
"grad_norm": 5.784631101553206,
|
|
"learning_rate": 4.957387092400805e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -696.0,
|
|
"logps/rejected": -800.0,
|
|
"loss": 0.4207,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.125,
|
|
"rewards/margins": 1.2421875,
|
|
"rewards/rejected": -6.34375,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"epoch": 0.1533565353334202,
|
|
"grad_norm": 6.765687916525139,
|
|
"learning_rate": 4.956787808907215e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -732.0,
|
|
"logps/rejected": -824.0,
|
|
"loss": 0.4489,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -5.46875,
|
|
"rewards/margins": 1.0546875,
|
|
"rewards/rejected": -6.53125,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"epoch": 0.15372875993374402,
|
|
"grad_norm": 6.521721627054844,
|
|
"learning_rate": 4.95618437752978e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -736.0,
|
|
"logps/rejected": -860.0,
|
|
"loss": 0.4517,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -5.3125,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -6.8125,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"epoch": 0.15410098453406787,
|
|
"grad_norm": 5.413985954025465,
|
|
"learning_rate": 4.955576799287296e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -696.0,
|
|
"logps/rejected": -800.0,
|
|
"loss": 0.4504,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.0625,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -6.34375,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"epoch": 0.1544732091343917,
|
|
"grad_norm": 5.911781831250542,
|
|
"learning_rate": 4.954965075205556e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -692.0,
|
|
"logps/rejected": -768.0,
|
|
"loss": 0.4517,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -5.125,
|
|
"rewards/margins": 1.0234375,
|
|
"rewards/rejected": -6.15625,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"epoch": 0.15484543373471552,
|
|
"grad_norm": 5.936563366401604,
|
|
"learning_rate": 4.954349206317359e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -716.0,
|
|
"logps/rejected": -832.0,
|
|
"loss": 0.4484,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.375,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -6.625,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"epoch": 0.15521765833503937,
|
|
"grad_norm": 6.114561969034227,
|
|
"learning_rate": 4.953729193662498e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -728.0,
|
|
"logps/rejected": -836.0,
|
|
"loss": 0.4359,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.5,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -6.75,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"epoch": 0.1555898829353632,
|
|
"grad_norm": 6.144001273005528,
|
|
"learning_rate": 4.953105038287762e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.96875,
|
|
"logps/chosen": -724.0,
|
|
"logps/rejected": -820.0,
|
|
"loss": 0.4461,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.25,
|
|
"rewards/margins": 1.1875,
|
|
"rewards/rejected": -6.4375,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"epoch": 0.15596210753568704,
|
|
"grad_norm": 4.898030636757637,
|
|
"learning_rate": 4.952476741246937e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -696.0,
|
|
"logps/rejected": -820.0,
|
|
"loss": 0.4313,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.28125,
|
|
"rewards/margins": 1.2421875,
|
|
"rewards/rejected": -6.53125,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"epoch": 0.15633433213601086,
|
|
"grad_norm": 8.419495217349095,
|
|
"learning_rate": 4.951844303600798e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -728.0,
|
|
"logps/rejected": -840.0,
|
|
"loss": 0.4361,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.375,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -6.625,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"epoch": 0.1567065567363347,
|
|
"grad_norm": 7.844881973490722,
|
|
"learning_rate": 4.951207726417113e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -716.0,
|
|
"logps/rejected": -808.0,
|
|
"loss": 0.4424,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -5.3125,
|
|
"rewards/margins": 1.2109375,
|
|
"rewards/rejected": -6.5,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"epoch": 0.15707878133665854,
|
|
"grad_norm": 4.96456993515639,
|
|
"learning_rate": 4.950567010770638e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -672.0,
|
|
"logps/rejected": -780.0,
|
|
"loss": 0.4335,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -4.96875,
|
|
"rewards/margins": 1.265625,
|
|
"rewards/rejected": -6.25,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"epoch": 0.15745100593698239,
|
|
"grad_norm": 6.592505789673692,
|
|
"learning_rate": 4.949922157743116e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -720.0,
|
|
"logps/rejected": -828.0,
|
|
"loss": 0.4695,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.3125,
|
|
"rewards/margins": 1.0703125,
|
|
"rewards/rejected": -6.375,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"epoch": 0.1578232305373062,
|
|
"grad_norm": 6.618473760560034,
|
|
"learning_rate": 4.949273168423277e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.96875,
|
|
"logps/chosen": -760.0,
|
|
"logps/rejected": -848.0,
|
|
"loss": 0.4295,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -5.59375,
|
|
"rewards/margins": 1.1328125,
|
|
"rewards/rejected": -6.71875,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"epoch": 0.15819545513763006,
|
|
"grad_norm": 5.821891734797481,
|
|
"learning_rate": 4.948620043906832e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -712.0,
|
|
"logps/rejected": -836.0,
|
|
"loss": 0.4372,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.21875,
|
|
"rewards/margins": 1.3515625,
|
|
"rewards/rejected": -6.59375,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"epoch": 0.15856767973795388,
|
|
"grad_norm": 6.0086092587290105,
|
|
"learning_rate": 4.947962785296475e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -740.0,
|
|
"logps/rejected": -868.0,
|
|
"loss": 0.4156,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.4375,
|
|
"rewards/margins": 1.46875,
|
|
"rewards/rejected": -6.90625,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"epoch": 0.1589399043382777,
|
|
"grad_norm": 5.309939126927046,
|
|
"learning_rate": 4.947301393701881e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -732.0,
|
|
"logps/rejected": -828.0,
|
|
"loss": 0.408,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.34375,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -6.65625,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"epoch": 0.15931212893860155,
|
|
"grad_norm": 8.673672537331084,
|
|
"learning_rate": 4.946635870239699e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -864.0,
|
|
"loss": 0.4327,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -5.625,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -6.96875,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"epoch": 0.15968435353892538,
|
|
"grad_norm": 5.252446644861524,
|
|
"learning_rate": 4.945966216033558e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -756.0,
|
|
"logps/rejected": -844.0,
|
|
"loss": 0.4371,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.46875,
|
|
"rewards/margins": 1.2734375,
|
|
"rewards/rejected": -6.75,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"epoch": 0.16005657813924923,
|
|
"grad_norm": 6.268235076776519,
|
|
"learning_rate": 4.945292432214059e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -724.0,
|
|
"logps/rejected": -840.0,
|
|
"loss": 0.4123,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.5,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -6.8125,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"epoch": 0.16042880273957305,
|
|
"grad_norm": 7.476476019382571,
|
|
"learning_rate": 4.944614519918775e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.484375,
|
|
"logps/chosen": -716.0,
|
|
"logps/rejected": -856.0,
|
|
"loss": 0.4605,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.5,
|
|
"rewards/margins": 1.390625,
|
|
"rewards/rejected": -6.90625,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"epoch": 0.1608010273398969,
|
|
"grad_norm": 5.587260733077475,
|
|
"learning_rate": 4.943932480292251e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -848.0,
|
|
"loss": 0.4271,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.53125,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -6.8125,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"epoch": 0.16117325194022072,
|
|
"grad_norm": 6.9502310176294815,
|
|
"learning_rate": 4.943246314485999e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -724.0,
|
|
"logps/rejected": -808.0,
|
|
"loss": 0.4418,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -5.1875,
|
|
"rewards/margins": 1.1640625,
|
|
"rewards/rejected": -6.375,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"epoch": 0.16154547654054457,
|
|
"grad_norm": 5.86286884636875,
|
|
"learning_rate": 4.942556023658497e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -708.0,
|
|
"logps/rejected": -788.0,
|
|
"loss": 0.4245,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.09375,
|
|
"rewards/margins": 1.2265625,
|
|
"rewards/rejected": -6.3125,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"epoch": 0.1619177011408684,
|
|
"grad_norm": 6.997931998512149,
|
|
"learning_rate": 4.941861608975188e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -720.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.4372,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -5.3125,
|
|
"rewards/margins": 1.65625,
|
|
"rewards/rejected": -6.96875,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"epoch": 0.16228992574119225,
|
|
"grad_norm": 5.649918984566045,
|
|
"learning_rate": 4.941163071608479e-07,
|
|
"logits/chosen": -4.09375,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -704.0,
|
|
"logps/rejected": -840.0,
|
|
"loss": 0.4421,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.21875,
|
|
"rewards/margins": 1.59375,
|
|
"rewards/rejected": -6.84375,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"epoch": 0.16266215034151607,
|
|
"grad_norm": 5.857293100370255,
|
|
"learning_rate": 4.940460412737733e-07,
|
|
"logits/chosen": -4.1875,
|
|
"logits/rejected": -3.953125,
|
|
"logps/chosen": -676.0,
|
|
"logps/rejected": -804.0,
|
|
"loss": 0.4316,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -4.9375,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -6.34375,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"epoch": 0.1630343749418399,
|
|
"grad_norm": 5.730729125273545,
|
|
"learning_rate": 4.939753633549277e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -700.0,
|
|
"logps/rejected": -824.0,
|
|
"loss": 0.4294,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.40625,
|
|
"rewards/margins": 1.171875,
|
|
"rewards/rejected": -6.59375,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"epoch": 0.16340659954216374,
|
|
"grad_norm": 6.425107180249275,
|
|
"learning_rate": 4.93904273523639e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -748.0,
|
|
"logps/rejected": -888.0,
|
|
"loss": 0.4478,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.6875,
|
|
"rewards/margins": 1.3671875,
|
|
"rewards/rejected": -7.03125,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"epoch": 0.16377882414248757,
|
|
"grad_norm": 4.92933089294134,
|
|
"learning_rate": 4.93832771899931e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -696.0,
|
|
"logps/rejected": -784.0,
|
|
"loss": 0.4365,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -5.15625,
|
|
"rewards/margins": 1.1640625,
|
|
"rewards/rejected": -6.34375,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"epoch": 0.16415104874281142,
|
|
"grad_norm": 6.048220715930868,
|
|
"learning_rate": 4.937608586045223e-07,
|
|
"logits/chosen": -4.09375,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -724.0,
|
|
"logps/rejected": -832.0,
|
|
"loss": 0.4345,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.53125,
|
|
"rewards/margins": 1.1953125,
|
|
"rewards/rejected": -6.71875,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"epoch": 0.16452327334313524,
|
|
"grad_norm": 5.724400811555856,
|
|
"learning_rate": 4.936885337588266e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -752.0,
|
|
"logps/rejected": -864.0,
|
|
"loss": 0.4472,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.625,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -6.875,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"epoch": 0.1648954979434591,
|
|
"grad_norm": 4.948245805297778,
|
|
"learning_rate": 4.936157974849528e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -732.0,
|
|
"logps/rejected": -860.0,
|
|
"loss": 0.4539,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -5.5625,
|
|
"rewards/margins": 1.5390625,
|
|
"rewards/rejected": -7.09375,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"epoch": 0.1652677225437829,
|
|
"grad_norm": 5.107834343718509,
|
|
"learning_rate": 4.93542649905704e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -716.0,
|
|
"logps/rejected": -832.0,
|
|
"loss": 0.4305,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.4375,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -6.6875,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"epoch": 0.16563994714410676,
|
|
"grad_norm": 5.687476188902605,
|
|
"learning_rate": 4.934690911445782e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -704.0,
|
|
"logps/rejected": -836.0,
|
|
"loss": 0.4144,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.28125,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -6.625,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"epoch": 0.1660121717444306,
|
|
"grad_norm": 6.4280671159075595,
|
|
"learning_rate": 4.933951213257669e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -896.0,
|
|
"loss": 0.4558,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -7.03125,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"epoch": 0.16638439634475444,
|
|
"grad_norm": 5.7637883085404855,
|
|
"learning_rate": 4.933207405741563e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.953125,
|
|
"logps/chosen": -736.0,
|
|
"logps/rejected": -832.0,
|
|
"loss": 0.4357,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.4375,
|
|
"rewards/margins": 1.171875,
|
|
"rewards/rejected": -6.59375,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"epoch": 0.16675662094507826,
|
|
"grad_norm": 6.174611383526687,
|
|
"learning_rate": 4.93245949015326e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -724.0,
|
|
"logps/rejected": -840.0,
|
|
"loss": 0.4445,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -5.34375,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -6.75,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"epoch": 0.16712884554540208,
|
|
"grad_norm": 5.727568163139461,
|
|
"learning_rate": 4.931707467755495e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -760.0,
|
|
"logps/rejected": -892.0,
|
|
"loss": 0.4424,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.59375,
|
|
"rewards/margins": 1.4765625,
|
|
"rewards/rejected": -7.0625,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"epoch": 0.16750107014572593,
|
|
"grad_norm": 4.96978651041345,
|
|
"learning_rate": 4.930951339817932e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -860.0,
|
|
"loss": 0.4443,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.3671875,
|
|
"rewards/rejected": -7.125,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"epoch": 0.16787329474604976,
|
|
"grad_norm": 6.606143113936588,
|
|
"learning_rate": 4.93019110761717e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.578125,
|
|
"logps/chosen": -712.0,
|
|
"logps/rejected": -844.0,
|
|
"loss": 0.4461,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.40625,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -6.75,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"epoch": 0.1682455193463736,
|
|
"grad_norm": 5.280551169780135,
|
|
"learning_rate": 4.929426772436738e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -716.0,
|
|
"logps/rejected": -832.0,
|
|
"loss": 0.4594,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -5.4375,
|
|
"rewards/margins": 1.203125,
|
|
"rewards/rejected": -6.65625,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"epoch": 0.16861774394669743,
|
|
"grad_norm": 5.903286901824118,
|
|
"learning_rate": 4.928658335567088e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -856.0,
|
|
"loss": 0.4336,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -5.53125,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -6.84375,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"epoch": 0.16898996854702128,
|
|
"grad_norm": 5.421764382713266,
|
|
"learning_rate": 4.927885798305603e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -756.0,
|
|
"logps/rejected": -892.0,
|
|
"loss": 0.432,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -5.625,
|
|
"rewards/margins": 1.6171875,
|
|
"rewards/rejected": -7.25,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"epoch": 0.1693621931473451,
|
|
"grad_norm": 5.463647088242241,
|
|
"learning_rate": 4.927109161956584e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -768.0,
|
|
"logps/rejected": -856.0,
|
|
"loss": 0.4502,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.875,
|
|
"rewards/margins": 1.0,
|
|
"rewards/rejected": -6.875,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"epoch": 0.16973441774766895,
|
|
"grad_norm": 7.0277650426833596,
|
|
"learning_rate": 4.926328427831254e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -852.0,
|
|
"loss": 0.4375,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.5625,
|
|
"rewards/margins": 1.3125,
|
|
"rewards/rejected": -6.875,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"epoch": 0.17010664234799278,
|
|
"grad_norm": 5.163554543735777,
|
|
"learning_rate": 4.925543597247756e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -912.0,
|
|
"loss": 0.4278,
|
|
"rewards/accuracies": 0.862500011920929,
|
|
"rewards/chosen": -5.65625,
|
|
"rewards/margins": 1.703125,
|
|
"rewards/rejected": -7.34375,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"epoch": 0.17047886694831663,
|
|
"grad_norm": 5.520417597352931,
|
|
"learning_rate": 4.924754671531145e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -752.0,
|
|
"logps/rejected": -876.0,
|
|
"loss": 0.3997,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -5.71875,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -7.125,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"epoch": 0.17085109154864045,
|
|
"grad_norm": 5.835278895528116,
|
|
"learning_rate": 4.923961652013396e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -760.0,
|
|
"logps/rejected": -868.0,
|
|
"loss": 0.4337,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.6875,
|
|
"rewards/margins": 1.2734375,
|
|
"rewards/rejected": -6.96875,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"epoch": 0.17122331614896427,
|
|
"grad_norm": 6.289577139251418,
|
|
"learning_rate": 4.923164540033392e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -680.0,
|
|
"logps/rejected": -768.0,
|
|
"loss": 0.4395,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.125,
|
|
"rewards/margins": 1.1171875,
|
|
"rewards/rejected": -6.25,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"epoch": 0.17159554074928812,
|
|
"grad_norm": 5.124573188721107,
|
|
"learning_rate": 4.922363336936926e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -732.0,
|
|
"logps/rejected": -840.0,
|
|
"loss": 0.424,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.4375,
|
|
"rewards/margins": 1.359375,
|
|
"rewards/rejected": -6.8125,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"epoch": 0.17196776534961195,
|
|
"grad_norm": 5.0454831945737,
|
|
"learning_rate": 4.921558044076696e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -720.0,
|
|
"logps/rejected": -852.0,
|
|
"loss": 0.4346,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.4375,
|
|
"rewards/margins": 1.453125,
|
|
"rewards/rejected": -6.90625,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"epoch": 0.1723399899499358,
|
|
"grad_norm": 5.347507423472996,
|
|
"learning_rate": 4.920748662812309e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.4591,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.09375,
|
|
"rewards/rejected": -6.875,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"epoch": 0.17271221455025962,
|
|
"grad_norm": 5.887680168469224,
|
|
"learning_rate": 4.919935194510274e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -760.0,
|
|
"logps/rejected": -868.0,
|
|
"loss": 0.4363,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.71875,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -7.0625,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"epoch": 0.17308443915058347,
|
|
"grad_norm": 5.01156054278049,
|
|
"learning_rate": 4.919117640543996e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -880.0,
|
|
"loss": 0.4401,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.34375,
|
|
"rewards/rejected": -7.09375,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"epoch": 0.1734566637509073,
|
|
"grad_norm": 5.984393551781648,
|
|
"learning_rate": 4.918296002293782e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -768.0,
|
|
"logps/rejected": -848.0,
|
|
"loss": 0.4405,
|
|
"rewards/accuracies": 0.6875,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 0.9296875,
|
|
"rewards/rejected": -6.6875,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"epoch": 0.17382888835123114,
|
|
"grad_norm": 5.486756525242989,
|
|
"learning_rate": 4.917470281146836e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -740.0,
|
|
"logps/rejected": -876.0,
|
|
"loss": 0.4384,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"epoch": 0.17420111295155497,
|
|
"grad_norm": 6.836449830380156,
|
|
"learning_rate": 4.916640478497249e-07,
|
|
"logits/chosen": -3.71875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -760.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.4185,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.625,
|
|
"rewards/margins": 1.390625,
|
|
"rewards/rejected": -7.03125,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"epoch": 0.17457333755187882,
|
|
"grad_norm": 6.681647488020188,
|
|
"learning_rate": 4.91580659574601e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -796.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4412,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -7.34375,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"epoch": 0.17494556215220264,
|
|
"grad_norm": 6.294748260060898,
|
|
"learning_rate": 4.914968634300993e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.59375,
|
|
"logps/chosen": -760.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4471,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.84375,
|
|
"rewards/margins": 1.65625,
|
|
"rewards/rejected": -7.5,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"epoch": 0.17531778675252646,
|
|
"grad_norm": 5.943100595893998,
|
|
"learning_rate": 4.914126595576957e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -760.0,
|
|
"logps/rejected": -864.0,
|
|
"loss": 0.4246,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.59375,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -6.875,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"epoch": 0.1756900113528503,
|
|
"grad_norm": 6.101951406933382,
|
|
"learning_rate": 4.913280480995547e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -888.0,
|
|
"loss": 0.4535,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -7.03125,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"epoch": 0.17606223595317413,
|
|
"grad_norm": 8.302285652731438,
|
|
"learning_rate": 4.912430291985291e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -756.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.4365,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.4375,
|
|
"rewards/rejected": -7.1875,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"epoch": 0.17643446055349798,
|
|
"grad_norm": 6.811876284942206,
|
|
"learning_rate": 4.911576029981591e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.53125,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4267,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.03125,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"epoch": 0.1768066851538218,
|
|
"grad_norm": 6.426324871968156,
|
|
"learning_rate": 4.91071769642673e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -760.0,
|
|
"logps/rejected": -884.0,
|
|
"loss": 0.4309,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.65625,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -7.0625,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"epoch": 0.17717890975414566,
|
|
"grad_norm": 5.803178246026337,
|
|
"learning_rate": 4.909855292769863e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -724.0,
|
|
"logps/rejected": -868.0,
|
|
"loss": 0.4506,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.34375,
|
|
"rewards/margins": 1.578125,
|
|
"rewards/rejected": -6.90625,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"epoch": 0.17755113435446948,
|
|
"grad_norm": 6.950723716770103,
|
|
"learning_rate": 4.908988820467018e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -852.0,
|
|
"loss": 0.4353,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.53125,
|
|
"rewards/margins": 1.3515625,
|
|
"rewards/rejected": -6.875,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"epoch": 0.17792335895479333,
|
|
"grad_norm": 5.9514924809140535,
|
|
"learning_rate": 4.908118280981091e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -740.0,
|
|
"logps/rejected": -860.0,
|
|
"loss": 0.4409,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.5,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -6.9375,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"epoch": 0.17829558355511715,
|
|
"grad_norm": 5.418539622734764,
|
|
"learning_rate": 4.907243675781847e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.53125,
|
|
"logps/chosen": -736.0,
|
|
"logps/rejected": -848.0,
|
|
"loss": 0.4251,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.59375,
|
|
"rewards/margins": 1.34375,
|
|
"rewards/rejected": -6.9375,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"epoch": 0.178667808155441,
|
|
"grad_norm": 6.290411507285996,
|
|
"learning_rate": 4.90636500634591e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -892.0,
|
|
"loss": 0.4211,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.90625,
|
|
"rewards/margins": 1.1953125,
|
|
"rewards/rejected": -7.09375,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"epoch": 0.17904003275576483,
|
|
"grad_norm": 6.944629306948202,
|
|
"learning_rate": 4.905482274156773e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -768.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.4403,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.84375,
|
|
"rewards/margins": 1.4375,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"epoch": 0.17941225735608865,
|
|
"grad_norm": 6.05476571168117,
|
|
"learning_rate": 4.904595480704784e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -728.0,
|
|
"logps/rejected": -868.0,
|
|
"loss": 0.452,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.59375,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -6.9375,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"epoch": 0.1797844819564125,
|
|
"grad_norm": 6.155027965189672,
|
|
"learning_rate": 4.903704627487148e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -740.0,
|
|
"logps/rejected": -840.0,
|
|
"loss": 0.4216,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.625,
|
|
"rewards/margins": 1.0546875,
|
|
"rewards/rejected": -6.6875,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"epoch": 0.18015670655673632,
|
|
"grad_norm": 5.568715078016802,
|
|
"learning_rate": 4.902809716007923e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -748.0,
|
|
"logps/rejected": -860.0,
|
|
"loss": 0.4478,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -7.125,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"epoch": 0.18052893115706017,
|
|
"grad_norm": 6.21218353743708,
|
|
"learning_rate": 4.901910747778023e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -732.0,
|
|
"logps/rejected": -844.0,
|
|
"loss": 0.4445,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -5.5,
|
|
"rewards/margins": 1.2421875,
|
|
"rewards/rejected": -6.75,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"epoch": 0.180901155757384,
|
|
"grad_norm": 6.46285181147374,
|
|
"learning_rate": 4.901007724315209e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -740.0,
|
|
"logps/rejected": -868.0,
|
|
"loss": 0.419,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -5.40625,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -6.78125,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"epoch": 0.18127338035770785,
|
|
"grad_norm": 5.760644621772445,
|
|
"learning_rate": 4.900100647144085e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -876.0,
|
|
"loss": 0.4443,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.234375,
|
|
"rewards/rejected": -6.96875,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"epoch": 0.18164560495803167,
|
|
"grad_norm": 6.191332890605878,
|
|
"learning_rate": 4.899189517796105e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -748.0,
|
|
"logps/rejected": -880.0,
|
|
"loss": 0.4357,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.4453125,
|
|
"rewards/rejected": -7.25,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"epoch": 0.18201782955835552,
|
|
"grad_norm": 5.754330079438478,
|
|
"learning_rate": 4.898274337809562e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4243,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -5.84375,
|
|
"rewards/margins": 1.640625,
|
|
"rewards/rejected": -7.5,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"epoch": 0.18239005415867934,
|
|
"grad_norm": 6.10788076623001,
|
|
"learning_rate": 4.897355108729585e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4273,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -7.34375,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"epoch": 0.1827622787590032,
|
|
"grad_norm": 8.019138920938525,
|
|
"learning_rate": 4.896431832108143e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4498,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -7.375,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"epoch": 0.18313450335932702,
|
|
"grad_norm": 5.790248495304021,
|
|
"learning_rate": 4.895504509504038e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -892.0,
|
|
"loss": 0.4152,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.03125,
|
|
"rewards/margins": 1.1875,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"epoch": 0.18350672795965087,
|
|
"grad_norm": 5.005123399748186,
|
|
"learning_rate": 4.894573142482902e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -760.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4314,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"epoch": 0.1838789525599747,
|
|
"grad_norm": 5.863132919555019,
|
|
"learning_rate": 4.893637732617196e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -860.0,
|
|
"loss": 0.4293,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.5625,
|
|
"rewards/margins": 1.2421875,
|
|
"rewards/rejected": -6.8125,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"epoch": 0.1842511771602985,
|
|
"grad_norm": 5.565479595150576,
|
|
"learning_rate": 4.892698281486206e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -796.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4177,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.96875,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"epoch": 0.18462340176062236,
|
|
"grad_norm": 5.740628607292125,
|
|
"learning_rate": 4.89175479067604e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -756.0,
|
|
"logps/rejected": -896.0,
|
|
"loss": 0.4349,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"epoch": 0.18499562636094619,
|
|
"grad_norm": 5.952183752271304,
|
|
"learning_rate": 4.890807261779631e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -892.0,
|
|
"loss": 0.4411,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.3671875,
|
|
"rewards/rejected": -7.15625,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"epoch": 0.18536785096127004,
|
|
"grad_norm": 7.133701595887453,
|
|
"learning_rate": 4.889855696396722e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -864.0,
|
|
"loss": 0.4398,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -5.71875,
|
|
"rewards/margins": 1.140625,
|
|
"rewards/rejected": -6.875,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"epoch": 0.18574007556159386,
|
|
"grad_norm": 6.923918556888372,
|
|
"learning_rate": 4.88890009613388e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -736.0,
|
|
"logps/rejected": -860.0,
|
|
"loss": 0.4227,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.65625,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -6.96875,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"epoch": 0.1861123001619177,
|
|
"grad_norm": 6.291949952274157,
|
|
"learning_rate": 4.887940462604475e-07,
|
|
"logits/chosen": -3.6875,
|
|
"logits/rejected": -3.359375,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -912.0,
|
|
"loss": 0.4437,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -5.71875,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"epoch": 0.18648452476224153,
|
|
"grad_norm": 5.824934736201254,
|
|
"learning_rate": 4.886976797428694e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -864.0,
|
|
"loss": 0.4433,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -5.71875,
|
|
"rewards/margins": 1.2109375,
|
|
"rewards/rejected": -6.9375,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"epoch": 0.18685674936256538,
|
|
"grad_norm": 6.7809786186754994,
|
|
"learning_rate": 4.886009102233528e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -740.0,
|
|
"logps/rejected": -860.0,
|
|
"loss": 0.4446,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.4375,
|
|
"rewards/margins": 1.4765625,
|
|
"rewards/rejected": -6.9375,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"epoch": 0.1872289739628892,
|
|
"grad_norm": 6.572483137865605,
|
|
"learning_rate": 4.88503737865277e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -736.0,
|
|
"logps/rejected": -864.0,
|
|
"loss": 0.4388,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -5.625,
|
|
"rewards/margins": 1.34375,
|
|
"rewards/rejected": -7.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"epoch": 0.18760119856321306,
|
|
"grad_norm": 5.875787555846081,
|
|
"learning_rate": 4.884061628327018e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4408,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -5.96875,
|
|
"rewards/margins": 1.3515625,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"epoch": 0.18797342316353688,
|
|
"grad_norm": 6.63099560911551,
|
|
"learning_rate": 4.883081852903665e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -748.0,
|
|
"logps/rejected": -880.0,
|
|
"loss": 0.3993,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.59375,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -7.09375,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"epoch": 0.1883456477638607,
|
|
"grad_norm": 6.192004094990947,
|
|
"learning_rate": 4.882098054036901e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.4449,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -7.15625,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"epoch": 0.18871787236418455,
|
|
"grad_norm": 5.449841513167424,
|
|
"learning_rate": 4.881110233387711e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -880.0,
|
|
"loss": 0.4014,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.59375,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -7.09375,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"epoch": 0.18909009696450838,
|
|
"grad_norm": 6.611642424312423,
|
|
"learning_rate": 4.880118392623869e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -728.0,
|
|
"logps/rejected": -868.0,
|
|
"loss": 0.4422,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.5,
|
|
"rewards/margins": 1.609375,
|
|
"rewards/rejected": -7.125,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"epoch": 0.18946232156483223,
|
|
"grad_norm": 6.406689262062489,
|
|
"learning_rate": 4.879122533419933e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -756.0,
|
|
"logps/rejected": -880.0,
|
|
"loss": 0.4273,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -7.25,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"epoch": 0.18983454616515605,
|
|
"grad_norm": 6.870439202846314,
|
|
"learning_rate": 4.87812265745725e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -840.0,
|
|
"loss": 0.4398,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -5.6875,
|
|
"rewards/margins": 1.2109375,
|
|
"rewards/rejected": -6.875,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"epoch": 0.1902067707654799,
|
|
"grad_norm": 5.810037669339324,
|
|
"learning_rate": 4.877118766423945e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -740.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.4212,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.5625,
|
|
"rewards/margins": 1.2890625,
|
|
"rewards/rejected": -6.84375,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"epoch": 0.19057899536580372,
|
|
"grad_norm": 6.766938365906897,
|
|
"learning_rate": 4.876110862014926e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -784.0,
|
|
"logps/rejected": -916.0,
|
|
"loss": 0.4369,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.4375,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"epoch": 0.19095121996612757,
|
|
"grad_norm": 6.761489994304975,
|
|
"learning_rate": 4.875098945931873e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -752.0,
|
|
"logps/rejected": -888.0,
|
|
"loss": 0.4173,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.6015625,
|
|
"rewards/rejected": -7.375,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"epoch": 0.1913234445664514,
|
|
"grad_norm": 7.698292169233494,
|
|
"learning_rate": 4.874083019883242e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -756.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.4515,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.203125,
|
|
"rewards/rejected": -7.125,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"epoch": 0.19169566916677525,
|
|
"grad_norm": 6.269374749190229,
|
|
"learning_rate": 4.873063085584256e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -748.0,
|
|
"logps/rejected": -860.0,
|
|
"loss": 0.4388,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.1484375,
|
|
"rewards/rejected": -6.9375,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"epoch": 0.19206789376709907,
|
|
"grad_norm": 7.319111042537406,
|
|
"learning_rate": 4.872039144756907e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -724.0,
|
|
"logps/rejected": -856.0,
|
|
"loss": 0.4154,
|
|
"rewards/accuracies": 0.8500000238418579,
|
|
"rewards/chosen": -5.5,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -6.96875,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"epoch": 0.1924401183674229,
|
|
"grad_norm": 5.771849169408466,
|
|
"learning_rate": 4.871011199129953e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -752.0,
|
|
"logps/rejected": -884.0,
|
|
"loss": 0.4296,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -5.84375,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"epoch": 0.19281234296774674,
|
|
"grad_norm": 8.346007061944526,
|
|
"learning_rate": 4.869979250438911e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.546875,
|
|
"logps/chosen": -736.0,
|
|
"logps/rejected": -896.0,
|
|
"loss": 0.4258,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.53125,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"epoch": 0.19318456756807056,
|
|
"grad_norm": 5.882045339240376,
|
|
"learning_rate": 4.868943300426057e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -748.0,
|
|
"logps/rejected": -860.0,
|
|
"loss": 0.4616,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -5.71875,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -7.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"epoch": 0.19355679216839441,
|
|
"grad_norm": 8.188921380148814,
|
|
"learning_rate": 4.867903350840423e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -760.0,
|
|
"logps/rejected": -836.0,
|
|
"loss": 0.4367,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.09375,
|
|
"rewards/rejected": -6.84375,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"epoch": 0.19392901676871824,
|
|
"grad_norm": 6.594589444122374,
|
|
"learning_rate": 4.866859403437795e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4035,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.03125,
|
|
"rewards/margins": 1.3828125,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"epoch": 0.1943012413690421,
|
|
"grad_norm": 6.496047738910236,
|
|
"learning_rate": 4.865811459980705e-07,
|
|
"logits/chosen": -3.75,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -876.0,
|
|
"loss": 0.4143,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.3515625,
|
|
"rewards/rejected": -7.09375,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"epoch": 0.1946734659693659,
|
|
"grad_norm": 6.510238689502243,
|
|
"learning_rate": 4.864759522238435e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -736.0,
|
|
"logps/rejected": -840.0,
|
|
"loss": 0.4582,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -5.65625,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -7.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"epoch": 0.19504569056968976,
|
|
"grad_norm": 4.970398430245081,
|
|
"learning_rate": 4.86370359198701e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.4327,
|
|
"rewards/accuracies": 0.862500011920929,
|
|
"rewards/chosen": -5.71875,
|
|
"rewards/margins": 1.6953125,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"epoch": 0.19541791517001358,
|
|
"grad_norm": 5.626167819252166,
|
|
"learning_rate": 4.862643671009193e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.4347,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.171875,
|
|
"rewards/rejected": -7.1875,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"epoch": 0.19579013977033743,
|
|
"grad_norm": 5.719147146022044,
|
|
"learning_rate": 4.861579761094491e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -752.0,
|
|
"logps/rejected": -876.0,
|
|
"loss": 0.4216,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.8125,
|
|
"rewards/margins": 1.4921875,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"epoch": 0.19616236437066126,
|
|
"grad_norm": 5.982037492273309,
|
|
"learning_rate": 4.860511864039139e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4495,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -7.25,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"epoch": 0.19653458897098508,
|
|
"grad_norm": 5.7757974423024905,
|
|
"learning_rate": 4.859439981646106e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -708.0,
|
|
"logps/rejected": -832.0,
|
|
"loss": 0.4094,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -5.15625,
|
|
"rewards/margins": 1.6171875,
|
|
"rewards/rejected": -6.78125,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"epoch": 0.19690681357130893,
|
|
"grad_norm": 5.935875763124951,
|
|
"learning_rate": 4.858364115725091e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -752.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.424,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.65625,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -7.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"epoch": 0.19727903817163275,
|
|
"grad_norm": 7.208331646547231,
|
|
"learning_rate": 4.857284268092516e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -752.0,
|
|
"logps/rejected": -888.0,
|
|
"loss": 0.4362,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -7.375,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"epoch": 0.1976512627719566,
|
|
"grad_norm": 5.132504170247751,
|
|
"learning_rate": 4.856200440571529e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.5,
|
|
"logps/chosen": -740.0,
|
|
"logps/rejected": -884.0,
|
|
"loss": 0.413,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.71875,
|
|
"rewards/margins": 1.6875,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"epoch": 0.19802348737228043,
|
|
"grad_norm": 7.103692250248847,
|
|
"learning_rate": 4.855112634991994e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -740.0,
|
|
"logps/rejected": -856.0,
|
|
"loss": 0.4255,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.625,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -6.90625,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"epoch": 0.19839571197260428,
|
|
"grad_norm": 6.060147946883416,
|
|
"learning_rate": 4.854020853190492e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -912.0,
|
|
"loss": 0.4336,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.90625,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"epoch": 0.1987679365729281,
|
|
"grad_norm": 8.111034449123615,
|
|
"learning_rate": 4.85292509701032e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -796.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4222,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.1953125,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"epoch": 0.19914016117325195,
|
|
"grad_norm": 6.418688758365402,
|
|
"learning_rate": 4.85182536830148e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -744.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4177,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.578125,
|
|
"rewards/rejected": -7.375,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"epoch": 0.19951238577357577,
|
|
"grad_norm": 8.499175173716342,
|
|
"learning_rate": 4.850721668920684e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -732.0,
|
|
"logps/rejected": -852.0,
|
|
"loss": 0.4399,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -5.53125,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -6.96875,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"epoch": 0.19988461037389962,
|
|
"grad_norm": 5.648775417303448,
|
|
"learning_rate": 4.84961400073135e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -732.0,
|
|
"logps/rejected": -844.0,
|
|
"loss": 0.4235,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.5625,
|
|
"rewards/margins": 1.3125,
|
|
"rewards/rejected": -6.875,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"epoch": 0.20025683497422345,
|
|
"grad_norm": 6.147892375161948,
|
|
"learning_rate": 4.848502365603593e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.984375,
|
|
"logps/chosen": -724.0,
|
|
"logps/rejected": -840.0,
|
|
"loss": 0.4263,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.40625,
|
|
"rewards/margins": 1.296875,
|
|
"rewards/rejected": -6.6875,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"epoch": 0.20062905957454727,
|
|
"grad_norm": 6.305737555389114,
|
|
"learning_rate": 4.847386765414227e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -788.0,
|
|
"logps/rejected": -876.0,
|
|
"loss": 0.4134,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.296875,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"epoch": 0.20100128417487112,
|
|
"grad_norm": 6.756698949690817,
|
|
"learning_rate": 4.84626720204676e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4111,
|
|
"rewards/accuracies": 0.706250011920929,
|
|
"rewards/chosen": -6.1875,
|
|
"rewards/margins": 1.234375,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"epoch": 0.20137350877519494,
|
|
"grad_norm": 6.583951650314223,
|
|
"learning_rate": 4.845143677391392e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.4008,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -5.84375,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -7.25,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"epoch": 0.2017457333755188,
|
|
"grad_norm": 8.150984712049954,
|
|
"learning_rate": 4.84401619334501e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -788.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4487,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.03125,
|
|
"rewards/margins": 1.265625,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"epoch": 0.20211795797584262,
|
|
"grad_norm": 11.44870084333935,
|
|
"learning_rate": 4.842884751811185e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -788.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4272,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.5234375,
|
|
"rewards/rejected": -7.625,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"epoch": 0.20249018257616647,
|
|
"grad_norm": 6.4106474615628875,
|
|
"learning_rate": 4.841749354700172e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4384,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.96875,
|
|
"rewards/margins": 1.34375,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"epoch": 0.2028624071764903,
|
|
"grad_norm": 7.794629882532868,
|
|
"learning_rate": 4.840610003928902e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.984375,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.423,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.1875,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"epoch": 0.20323463177681414,
|
|
"grad_norm": 6.853660297097755,
|
|
"learning_rate": 4.839466701420985e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4598,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.1875,
|
|
"rewards/margins": 1.390625,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"epoch": 0.20360685637713796,
|
|
"grad_norm": 5.5885088165224435,
|
|
"learning_rate": 4.838319449106697e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -876.0,
|
|
"loss": 0.4248,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.875,
|
|
"rewards/margins": 1.21875,
|
|
"rewards/rejected": -7.09375,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"epoch": 0.2039790809774618,
|
|
"grad_norm": 6.098976321073987,
|
|
"learning_rate": 4.837168248922986e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4095,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.3125,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"epoch": 0.20435130557778564,
|
|
"grad_norm": 6.9691567272920345,
|
|
"learning_rate": 4.836013102813467e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.416,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.5390625,
|
|
"rewards/rejected": -7.875,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"epoch": 0.20472353017810946,
|
|
"grad_norm": 6.987026770248282,
|
|
"learning_rate": 4.834854012728412e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4467,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"epoch": 0.2050957547784333,
|
|
"grad_norm": 7.332931226582443,
|
|
"learning_rate": 4.833690980624758e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.4421,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.90625,
|
|
"rewards/margins": 1.15625,
|
|
"rewards/rejected": -7.03125,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"epoch": 0.20546797937875713,
|
|
"grad_norm": 5.574105363176493,
|
|
"learning_rate": 4.832524008466091e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.4302,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -7.375,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"epoch": 0.20584020397908098,
|
|
"grad_norm": 5.818091335733473,
|
|
"learning_rate": 4.831353098222655e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4418,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.5390625,
|
|
"rewards/rejected": -7.625,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"epoch": 0.2062124285794048,
|
|
"grad_norm": 6.318937634194189,
|
|
"learning_rate": 4.83017825187134e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4136,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -5.8125,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -7.375,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"epoch": 0.20658465317972866,
|
|
"grad_norm": 6.362560807781102,
|
|
"learning_rate": 4.828999471395679e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4171,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"epoch": 0.20695687778005248,
|
|
"grad_norm": 6.837123822999831,
|
|
"learning_rate": 4.827816758785853e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4168,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.1796875,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"epoch": 0.20732910238037633,
|
|
"grad_norm": 7.634964550191584,
|
|
"learning_rate": 4.826630116038677e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.9375,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4264,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.390625,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"epoch": 0.20770132698070015,
|
|
"grad_norm": 6.576149738258397,
|
|
"learning_rate": 4.825439545157603e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -916.0,
|
|
"loss": 0.4539,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -5.96875,
|
|
"rewards/margins": 1.3671875,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"epoch": 0.208073551581024,
|
|
"grad_norm": 5.342907939993414,
|
|
"learning_rate": 4.824245048152715e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.4379,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.203125,
|
|
"rewards/rejected": -6.9375,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"epoch": 0.20844577618134782,
|
|
"grad_norm": 5.576272430665703,
|
|
"learning_rate": 4.823046627040725e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -880.0,
|
|
"loss": 0.4479,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -5.96875,
|
|
"rewards/margins": 1.2890625,
|
|
"rewards/rejected": -7.25,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"epoch": 0.20881800078167165,
|
|
"grad_norm": 6.132824090079501,
|
|
"learning_rate": 4.821844283844972e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4256,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.8125,
|
|
"rewards/margins": 1.4375,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"epoch": 0.2091902253819955,
|
|
"grad_norm": 6.744167887351889,
|
|
"learning_rate": 4.820638020595414e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4362,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.03125,
|
|
"rewards/margins": 1.2265625,
|
|
"rewards/rejected": -7.25,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"epoch": 0.20956244998231932,
|
|
"grad_norm": 6.68286891786841,
|
|
"learning_rate": 4.819427839328632e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -884.0,
|
|
"loss": 0.4326,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -5.96875,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"epoch": 0.20993467458264317,
|
|
"grad_norm": 5.760935231480335,
|
|
"learning_rate": 4.818213742087815e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -796.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4208,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.5,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"epoch": 0.210306899182967,
|
|
"grad_norm": 6.890033542530431,
|
|
"learning_rate": 4.81699573092277e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4133,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.03125,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"epoch": 0.21067912378329084,
|
|
"grad_norm": 6.569652591342706,
|
|
"learning_rate": 4.815773807889907e-07,
|
|
"logits/chosen": -4.09375,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -756.0,
|
|
"logps/rejected": -896.0,
|
|
"loss": 0.4139,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"epoch": 0.21105134838361467,
|
|
"grad_norm": 5.474514412647331,
|
|
"learning_rate": 4.814547975052244e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4429,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.1015625,
|
|
"rewards/rejected": -7.34375,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"epoch": 0.21142357298393852,
|
|
"grad_norm": 8.429225542364062,
|
|
"learning_rate": 4.813318234479401e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4303,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"epoch": 0.21179579758426234,
|
|
"grad_norm": 7.135542873605128,
|
|
"learning_rate": 4.812084588247592e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -916.0,
|
|
"loss": 0.4211,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.1875,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"epoch": 0.2121680221845862,
|
|
"grad_norm": 6.292181622463565,
|
|
"learning_rate": 4.810847038439626e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -888.0,
|
|
"loss": 0.4401,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.1953125,
|
|
"rewards/rejected": -7.25,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"epoch": 0.21254024678491001,
|
|
"grad_norm": 5.891486428128075,
|
|
"learning_rate": 4.809605587144904e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4401,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.4921875,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"epoch": 0.21291247138523384,
|
|
"grad_norm": 5.959544850834762,
|
|
"learning_rate": 4.808360236459412e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4149,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.15625,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"epoch": 0.2132846959855577,
|
|
"grad_norm": 5.303988732591514,
|
|
"learning_rate": 4.807110988485721e-07,
|
|
"logits/chosen": -4.09375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4346,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.6953125,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"epoch": 0.2136569205858815,
|
|
"grad_norm": 5.241951241473354,
|
|
"learning_rate": 4.805857845332983e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.9375,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.3852,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"epoch": 0.21402914518620536,
|
|
"grad_norm": 5.724771685599554,
|
|
"learning_rate": 4.804600809116925e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.9375,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4182,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.125,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"epoch": 0.21440136978652918,
|
|
"grad_norm": 7.018939661902944,
|
|
"learning_rate": 4.803339881959845e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -768.0,
|
|
"logps/rejected": -888.0,
|
|
"loss": 0.4365,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"epoch": 0.21477359438685303,
|
|
"grad_norm": 7.1140689469871115,
|
|
"learning_rate": 4.802075065990613e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -876.0,
|
|
"loss": 0.4382,
|
|
"rewards/accuracies": 0.6937500238418579,
|
|
"rewards/chosen": -6.125,
|
|
"rewards/margins": 1.0234375,
|
|
"rewards/rejected": -7.15625,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"epoch": 0.21514581898717686,
|
|
"grad_norm": 6.4150311160162135,
|
|
"learning_rate": 4.800806363344663e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4447,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.15625,
|
|
"rewards/margins": 1.125,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"epoch": 0.2155180435875007,
|
|
"grad_norm": 5.750678354752301,
|
|
"learning_rate": 4.799533776163993e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4239,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.2890625,
|
|
"rewards/rejected": -7.34375,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"epoch": 0.21589026818782453,
|
|
"grad_norm": 6.160905396738596,
|
|
"learning_rate": 4.798257306597156e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -912.0,
|
|
"loss": 0.405,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.1875,
|
|
"rewards/margins": 1.078125,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"epoch": 0.21626249278814838,
|
|
"grad_norm": 6.255992324791328,
|
|
"learning_rate": 4.796976956799264e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4387,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"epoch": 0.2166347173884722,
|
|
"grad_norm": 6.358479027139798,
|
|
"learning_rate": 4.795692728931977e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.438,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.4453125,
|
|
"rewards/rejected": -8.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"epoch": 0.21700694198879603,
|
|
"grad_norm": 5.584716791155845,
|
|
"learning_rate": 4.794404625163503e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4163,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.234375,
|
|
"rewards/rejected": -7.5,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"epoch": 0.21737916658911988,
|
|
"grad_norm": 5.02637272530766,
|
|
"learning_rate": 4.793112647668594e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -752.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4232,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.5625,
|
|
"rewards/rejected": -7.34375,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"epoch": 0.2177513911894437,
|
|
"grad_norm": 6.243005960274981,
|
|
"learning_rate": 4.791816798628544e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -916.0,
|
|
"loss": 0.4275,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.6171875,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"epoch": 0.21812361578976755,
|
|
"grad_norm": 6.334112755551554,
|
|
"learning_rate": 4.790517080231179e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4553,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"epoch": 0.21849584039009137,
|
|
"grad_norm": 8.624590744980026,
|
|
"learning_rate": 4.789213494670864e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -892.0,
|
|
"loss": 0.4376,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.1015625,
|
|
"rewards/rejected": -7.1875,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"epoch": 0.21886806499041522,
|
|
"grad_norm": 5.302347633998562,
|
|
"learning_rate": 4.787906044148489e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -752.0,
|
|
"logps/rejected": -884.0,
|
|
"loss": 0.4204,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.46875,
|
|
"rewards/margins": 1.609375,
|
|
"rewards/rejected": -7.09375,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"epoch": 0.21924028959073905,
|
|
"grad_norm": 5.760136212014773,
|
|
"learning_rate": 4.786594730871467e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4121,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -6.125,
|
|
"rewards/margins": 1.4375,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"epoch": 0.2196125141910629,
|
|
"grad_norm": 6.194875548358758,
|
|
"learning_rate": 4.785279557053739e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4523,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"epoch": 0.21998473879138672,
|
|
"grad_norm": 5.9746838607629,
|
|
"learning_rate": 4.78396052491576e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4174,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"epoch": 0.22035696339171057,
|
|
"grad_norm": 5.004404488177059,
|
|
"learning_rate": 4.782637636684499e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -788.0,
|
|
"logps/rejected": -912.0,
|
|
"loss": 0.4086,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"epoch": 0.2207291879920344,
|
|
"grad_norm": 6.276216370797568,
|
|
"learning_rate": 4.781310894593437e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4375,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.0546875,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"epoch": 0.22110141259235822,
|
|
"grad_norm": 6.831699485958554,
|
|
"learning_rate": 4.779980300882559e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -788.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.407,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.1875,
|
|
"rewards/margins": 1.6328125,
|
|
"rewards/rejected": -7.84375,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"epoch": 0.22147363719268207,
|
|
"grad_norm": 6.5151009940251,
|
|
"learning_rate": 4.778645857798357e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -756.0,
|
|
"logps/rejected": -860.0,
|
|
"loss": 0.4257,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 0.984375,
|
|
"rewards/rejected": -7.0625,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"epoch": 0.2218458617930059,
|
|
"grad_norm": 6.108704670003317,
|
|
"learning_rate": 4.777307567593818e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4277,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -5.90625,
|
|
"rewards/margins": 1.453125,
|
|
"rewards/rejected": -7.375,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"epoch": 0.22221808639332974,
|
|
"grad_norm": 6.840284114854557,
|
|
"learning_rate": 4.775965432528426e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4125,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.4375,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"epoch": 0.22259031099365356,
|
|
"grad_norm": 6.289011208186768,
|
|
"learning_rate": 4.774619454868156e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -916.0,
|
|
"loss": 0.4215,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.6484375,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"epoch": 0.2229625355939774,
|
|
"grad_norm": 5.619923035928777,
|
|
"learning_rate": 4.773269636885471e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4095,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.03125,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"epoch": 0.22333476019430124,
|
|
"grad_norm": 5.705051528328636,
|
|
"learning_rate": 4.771915980859318e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.9375,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.4239,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"epoch": 0.22370698479462509,
|
|
"grad_norm": 8.73830036477818,
|
|
"learning_rate": 4.770558489075124e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.953125,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4103,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.03125,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -7.5,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"epoch": 0.2240792093949489,
|
|
"grad_norm": 7.699953594593835,
|
|
"learning_rate": 4.76919716382479e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4203,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"epoch": 0.22445143399527276,
|
|
"grad_norm": 5.641880745608248,
|
|
"learning_rate": 4.7678320074066925e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.3997,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.6953125,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"epoch": 0.22482365859559658,
|
|
"grad_norm": 7.766493501204703,
|
|
"learning_rate": 4.766463022125673e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.96875,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4192,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.5234375,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"epoch": 0.22519588319592043,
|
|
"grad_norm": 11.90030598484292,
|
|
"learning_rate": 4.765090210293039e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4338,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.3671875,
|
|
"rewards/rejected": -7.625,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"epoch": 0.22556810779624425,
|
|
"grad_norm": 5.3912321345938645,
|
|
"learning_rate": 4.76371357422656e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.413,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.3125,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"epoch": 0.22594033239656808,
|
|
"grad_norm": 6.247487437915781,
|
|
"learning_rate": 4.7623331162504585e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.4274,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -5.96875,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -7.5,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"epoch": 0.22631255699689193,
|
|
"grad_norm": 4.912612975965821,
|
|
"learning_rate": 4.7609488386954137e-07,
|
|
"logits/chosen": -4.09375,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -896.0,
|
|
"loss": 0.4312,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.875,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -7.1875,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"epoch": 0.22668478159721575,
|
|
"grad_norm": 6.238925386472296,
|
|
"learning_rate": 4.759560743898551e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4039,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.15625,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"epoch": 0.2270570061975396,
|
|
"grad_norm": 5.1875835889428465,
|
|
"learning_rate": 4.758168834203439e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.3976,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.6328125,
|
|
"rewards/rejected": -7.75,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"epoch": 0.22742923079786342,
|
|
"grad_norm": 8.485382086718937,
|
|
"learning_rate": 4.7567731119600916e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.414,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.90625,
|
|
"rewards/margins": 1.828125,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"epoch": 0.22780145539818727,
|
|
"grad_norm": 6.1986468421974354,
|
|
"learning_rate": 4.755373579524957e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4438,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.296875,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"epoch": 0.2281736799985111,
|
|
"grad_norm": 5.09697993938089,
|
|
"learning_rate": 4.753970239260916e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4568,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.1640625,
|
|
"rewards/rejected": -7.625,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"epoch": 0.22854590459883495,
|
|
"grad_norm": 5.216105600386573,
|
|
"learning_rate": 4.752563093537279e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -768.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4172,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -5.90625,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -7.375,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"epoch": 0.22891812919915877,
|
|
"grad_norm": 5.771226303646994,
|
|
"learning_rate": 4.751152144729781e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -916.0,
|
|
"loss": 0.4235,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.34375,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"epoch": 0.22929035379948262,
|
|
"grad_norm": 6.631240571601773,
|
|
"learning_rate": 4.749737395220578e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -796.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4056,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -5.96875,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"epoch": 0.22966257839980644,
|
|
"grad_norm": 5.943297152893245,
|
|
"learning_rate": 4.748318847398242e-07,
|
|
"logits/chosen": -3.734375,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4205,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.03125,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -7.5,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"epoch": 0.23003480300013027,
|
|
"grad_norm": 5.159509186113557,
|
|
"learning_rate": 4.746896503657759e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.546875,
|
|
"logps/chosen": -752.0,
|
|
"logps/rejected": -892.0,
|
|
"loss": 0.4269,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.78125,
|
|
"rewards/margins": 1.53125,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"epoch": 0.23040702760045412,
|
|
"grad_norm": 5.278332364946635,
|
|
"learning_rate": 4.745470366400525e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4082,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.84375,
|
|
"rewards/margins": 1.5703125,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"epoch": 0.23077925220077794,
|
|
"grad_norm": 6.3291603399206995,
|
|
"learning_rate": 4.744040438034338e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -784.0,
|
|
"logps/rejected": -888.0,
|
|
"loss": 0.4303,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.3515625,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"epoch": 0.2311514768011018,
|
|
"grad_norm": 5.6835786857173805,
|
|
"learning_rate": 4.7426067209733977e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -756.0,
|
|
"logps/rejected": -864.0,
|
|
"loss": 0.4292,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -5.5625,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -6.875,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"epoch": 0.2315237014014256,
|
|
"grad_norm": 6.795692015670665,
|
|
"learning_rate": 4.7411692176383013e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4084,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.71875,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"epoch": 0.23189592600174946,
|
|
"grad_norm": 5.928900460558585,
|
|
"learning_rate": 4.739727930456037e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4134,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"epoch": 0.2322681506020733,
|
|
"grad_norm": 5.694796850977235,
|
|
"learning_rate": 4.738282861859982e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4298,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.5234375,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"epoch": 0.23264037520239714,
|
|
"grad_norm": 5.276815425170437,
|
|
"learning_rate": 4.7368340142898983e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -768.0,
|
|
"logps/rejected": -872.0,
|
|
"loss": 0.4339,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.03125,
|
|
"rewards/margins": 1.1796875,
|
|
"rewards/rejected": -7.1875,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"epoch": 0.23301259980272096,
|
|
"grad_norm": 6.11808955978257,
|
|
"learning_rate": 4.7353813901919283e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -764.0,
|
|
"logps/rejected": -896.0,
|
|
"loss": 0.4197,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -7.375,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"epoch": 0.2333848244030448,
|
|
"grad_norm": 6.585944369333626,
|
|
"learning_rate": 4.7339249920185885e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4155,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -7.75,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"epoch": 0.23375704900336863,
|
|
"grad_norm": 5.665815747348609,
|
|
"learning_rate": 4.73246482222877e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.394,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.578125,
|
|
"rewards/rejected": -8.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"epoch": 0.23412927360369246,
|
|
"grad_norm": 8.25782804113197,
|
|
"learning_rate": 4.73100088328773e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.4289,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.3125,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"epoch": 0.2345014982040163,
|
|
"grad_norm": 5.321909412094669,
|
|
"learning_rate": 4.72953317766709e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4366,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.4375,
|
|
"rewards/rejected": -7.5,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"epoch": 0.23487372280434013,
|
|
"grad_norm": 5.675167377702157,
|
|
"learning_rate": 4.7280617078448294e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4287,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.296875,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"epoch": 0.23524594740466398,
|
|
"grad_norm": 5.980308610466193,
|
|
"learning_rate": 4.726586476305285e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4276,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.4921875,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"epoch": 0.2356181720049878,
|
|
"grad_norm": 5.240960005134948,
|
|
"learning_rate": 4.725107485539143e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4393,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"epoch": 0.23599039660531165,
|
|
"grad_norm": 5.477851232251246,
|
|
"learning_rate": 4.723624738043438e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4293,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"epoch": 0.23636262120563548,
|
|
"grad_norm": 5.841123757011323,
|
|
"learning_rate": 4.7221382363215447e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.4363,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.4765625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"epoch": 0.23673484580595933,
|
|
"grad_norm": 5.710257314719626,
|
|
"learning_rate": 4.72064798288318e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4062,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.203125,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"epoch": 0.23710707040628315,
|
|
"grad_norm": 6.599006254069624,
|
|
"learning_rate": 4.7191539802443906e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4179,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.5234375,
|
|
"rewards/rejected": -7.875,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"epoch": 0.237479295006607,
|
|
"grad_norm": 5.709786268939416,
|
|
"learning_rate": 4.717656230927557e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4261,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.5390625,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"epoch": 0.23785151960693082,
|
|
"grad_norm": 6.7867426232994275,
|
|
"learning_rate": 4.7161547374613817e-07,
|
|
"logits/chosen": -3.734375,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4168,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.4765625,
|
|
"rewards/rejected": -7.75,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"epoch": 0.23822374420725465,
|
|
"grad_norm": 6.53386853099891,
|
|
"learning_rate": 4.714649502380893e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4198,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -7.625,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"epoch": 0.2385959688075785,
|
|
"grad_norm": 6.391274328229158,
|
|
"learning_rate": 4.7131405282274315e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.4478,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.0625,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"epoch": 0.23896819340790232,
|
|
"grad_norm": 5.107772466037207,
|
|
"learning_rate": 4.7116278175486546e-07,
|
|
"logits/chosen": -3.703125,
|
|
"logits/rejected": -3.515625,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4437,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.15625,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -7.5,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"epoch": 0.23934041800822617,
|
|
"grad_norm": 4.827325580734079,
|
|
"learning_rate": 4.7101113728985253e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4199,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.3828125,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"epoch": 0.23971264260855,
|
|
"grad_norm": 5.7011857021652945,
|
|
"learning_rate": 4.7085911968373135e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -788.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.406,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.3671875,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"epoch": 0.24008486720887384,
|
|
"grad_norm": 5.461782220817337,
|
|
"learning_rate": 4.7070672919315856e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -912.0,
|
|
"loss": 0.4192,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.234375,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"epoch": 0.24045709180919767,
|
|
"grad_norm": 6.381709528302522,
|
|
"learning_rate": 4.705539660754207e-07,
|
|
"logits/chosen": -3.6875,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4285,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"epoch": 0.24082931640952152,
|
|
"grad_norm": 5.25881298503053,
|
|
"learning_rate": 4.704008305884332e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4421,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.4921875,
|
|
"rewards/rejected": -7.75,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"epoch": 0.24120154100984534,
|
|
"grad_norm": 6.1454630595308295,
|
|
"learning_rate": 4.7024732299074023e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4231,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.1875,
|
|
"rewards/margins": 1.3671875,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"epoch": 0.2415737656101692,
|
|
"grad_norm": 7.608828921397016,
|
|
"learning_rate": 4.7009344354151424e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.424,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -7.75,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"epoch": 0.241945990210493,
|
|
"grad_norm": 7.361323116966944,
|
|
"learning_rate": 4.6993919250055557e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.439,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.34375,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"epoch": 0.24231821481081683,
|
|
"grad_norm": 6.519730606394934,
|
|
"learning_rate": 4.6978457012829174e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.4027,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -8.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"epoch": 0.24269043941114068,
|
|
"grad_norm": 6.195135220830553,
|
|
"learning_rate": 4.6962957668577736e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4291,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"epoch": 0.2430626640114645,
|
|
"grad_norm": 5.530513448208236,
|
|
"learning_rate": 4.694742124346934e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4383,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.2890625,
|
|
"rewards/rejected": -7.625,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"epoch": 0.24343488861178836,
|
|
"grad_norm": 6.563109720471082,
|
|
"learning_rate": 4.6931847763734703e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4279,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.125,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"epoch": 0.24380711321211218,
|
|
"grad_norm": 5.592632811272104,
|
|
"learning_rate": 4.6916237255667093e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -788.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4265,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.03125,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"epoch": 0.24417933781243603,
|
|
"grad_norm": 5.819942978536498,
|
|
"learning_rate": 4.6900589745622294e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -796.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4306,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -6.15625,
|
|
"rewards/margins": 1.265625,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"epoch": 0.24455156241275985,
|
|
"grad_norm": 6.01567534022582,
|
|
"learning_rate": 4.688490526001856e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -856.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4141,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -8.125,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"epoch": 0.2449237870130837,
|
|
"grad_norm": 8.31094093560855,
|
|
"learning_rate": 4.6869183825336587e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.455,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"epoch": 0.24529601161340753,
|
|
"grad_norm": 5.487859257431511,
|
|
"learning_rate": 4.685342546811943e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4281,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.5390625,
|
|
"rewards/rejected": -7.625,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"epoch": 0.24566823621373138,
|
|
"grad_norm": 6.186567569700576,
|
|
"learning_rate": 4.6837630214972514e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4476,
|
|
"rewards/accuracies": 0.6937500238418579,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.0625,
|
|
"rewards/rejected": -7.5,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"epoch": 0.2460404608140552,
|
|
"grad_norm": 5.841327794112783,
|
|
"learning_rate": 4.6821798092563514e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4076,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.125,
|
|
"rewards/margins": 1.1953125,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"epoch": 0.24641268541437902,
|
|
"grad_norm": 6.629758179486839,
|
|
"learning_rate": 4.680592912762238e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4066,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"epoch": 0.24678491001470287,
|
|
"grad_norm": 8.464610313608668,
|
|
"learning_rate": 4.6790023346941274e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.4185,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.4765625,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"epoch": 0.2471571346150267,
|
|
"grad_norm": 7.712268152224804,
|
|
"learning_rate": 4.677408077737449e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.96875,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4408,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.3828125,
|
|
"rewards/rejected": -7.625,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"epoch": 0.24752935921535055,
|
|
"grad_norm": 5.4645917339902415,
|
|
"learning_rate": 4.6758101445838457e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4343,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.203125,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"epoch": 0.24790158381567437,
|
|
"grad_norm": 7.6134801516815065,
|
|
"learning_rate": 4.6742085379311645e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4069,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"epoch": 0.24827380841599822,
|
|
"grad_norm": 5.942050379509909,
|
|
"learning_rate": 4.6726032604834566e-07,
|
|
"logits/chosen": -4.09375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4161,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.46875,
|
|
"rewards/rejected": -7.84375,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"epoch": 0.24864603301632204,
|
|
"grad_norm": 5.822387109912939,
|
|
"learning_rate": 4.67099431495097e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.427,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.1484375,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"epoch": 0.2490182576166459,
|
|
"grad_norm": 8.346740221535079,
|
|
"learning_rate": 4.669381704050146e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4247,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.140625,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"epoch": 0.24939048221696972,
|
|
"grad_norm": 5.849544355776524,
|
|
"learning_rate": 4.6677654305036136e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -784.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.439,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.125,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"epoch": 0.24976270681729357,
|
|
"grad_norm": 5.3230508705704915,
|
|
"learning_rate": 4.666145497040186e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4151,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.5390625,
|
|
"rewards/rejected": -7.75,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"epoch": 0.2501349314176174,
|
|
"grad_norm": 6.019226326104658,
|
|
"learning_rate": 4.664521906394856e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.59375,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4254,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.125,
|
|
"rewards/margins": 1.6640625,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"epoch": 0.2505071560179412,
|
|
"grad_norm": 9.714162090429475,
|
|
"learning_rate": 4.662894661308789e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -788.0,
|
|
"logps/rejected": -888.0,
|
|
"loss": 0.4502,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -6.1875,
|
|
"rewards/margins": 1.2890625,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"epoch": 0.25087938061826504,
|
|
"grad_norm": 5.802439874398323,
|
|
"learning_rate": 4.6612637645293243e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.44,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -5.96875,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -7.375,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"epoch": 0.2512516052185889,
|
|
"grad_norm": 6.056722990489438,
|
|
"learning_rate": 4.659629218809963e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4106,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.5703125,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"epoch": 0.25162382981891274,
|
|
"grad_norm": 5.567097289524385,
|
|
"learning_rate": 4.657991026910366e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4099,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.4375,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"epoch": 0.25199605441923656,
|
|
"grad_norm": 6.667974417121959,
|
|
"learning_rate": 4.656349191596355e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4031,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"epoch": 0.2523682790195604,
|
|
"grad_norm": 7.8323725233471935,
|
|
"learning_rate": 4.6547037156398976e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -708.0,
|
|
"logps/rejected": -840.0,
|
|
"loss": 0.4167,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -5.46875,
|
|
"rewards/margins": 1.453125,
|
|
"rewards/rejected": -6.9375,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"epoch": 0.25274050361988426,
|
|
"grad_norm": 6.077973638002682,
|
|
"learning_rate": 4.653054601819112e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -756.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4232,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.6796875,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"epoch": 0.2531127282202081,
|
|
"grad_norm": 6.566988113849512,
|
|
"learning_rate": 4.651401852918256e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.4461,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.1875,
|
|
"rewards/margins": 1.6015625,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"epoch": 0.2534849528205319,
|
|
"grad_norm": 5.971675664298436,
|
|
"learning_rate": 4.6497454717277253e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -788.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.4189,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -7.375,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"epoch": 0.25385717742085573,
|
|
"grad_norm": 5.721771079114988,
|
|
"learning_rate": 4.648085461044049e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -768.0,
|
|
"logps/rejected": -884.0,
|
|
"loss": 0.427,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.6875,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -7.125,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"epoch": 0.2542294020211796,
|
|
"grad_norm": 5.818955687434478,
|
|
"learning_rate": 4.646421823669883e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -796.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4371,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"epoch": 0.25460162662150343,
|
|
"grad_norm": 5.935606451539939,
|
|
"learning_rate": 4.644754562414006e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -768.0,
|
|
"logps/rejected": -892.0,
|
|
"loss": 0.4195,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -7.25,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"epoch": 0.25497385122182725,
|
|
"grad_norm": 4.920274001439463,
|
|
"learning_rate": 4.6430836800913167e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -796.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.3982,
|
|
"rewards/accuracies": 0.8687499761581421,
|
|
"rewards/chosen": -5.96875,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"epoch": 0.2553460758221511,
|
|
"grad_norm": 7.030292287431365,
|
|
"learning_rate": 4.6414091795228247e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4015,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.53125,
|
|
"rewards/rejected": -8.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"epoch": 0.2557183004224749,
|
|
"grad_norm": 6.75799958648115,
|
|
"learning_rate": 4.6397310635356514e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4338,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.296875,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"epoch": 0.2560905250227988,
|
|
"grad_norm": 5.712416690771472,
|
|
"learning_rate": 4.63804933496302e-07,
|
|
"logits/chosen": -3.75,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -912.0,
|
|
"loss": 0.4282,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"epoch": 0.2564627496231226,
|
|
"grad_norm": 5.805375772360747,
|
|
"learning_rate": 4.6363639966442535e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4298,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.1875,
|
|
"rewards/margins": 1.640625,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"epoch": 0.2568349742234464,
|
|
"grad_norm": 8.145232038439593,
|
|
"learning_rate": 4.634675051424771e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.4341,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"epoch": 0.25720719882377024,
|
|
"grad_norm": 5.980559160504537,
|
|
"learning_rate": 4.632982502156078e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4239,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.15625,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"epoch": 0.2575794234240941,
|
|
"grad_norm": 6.764275312649953,
|
|
"learning_rate": 4.6312863516957686e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4192,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.59375,
|
|
"rewards/margins": 1.359375,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"epoch": 0.25795164802441795,
|
|
"grad_norm": 5.7918311969978955,
|
|
"learning_rate": 4.629586602907514e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4516,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"epoch": 0.25832387262474177,
|
|
"grad_norm": 5.931704932586348,
|
|
"learning_rate": 4.627883258661061e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -796.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4195,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.59375,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"epoch": 0.2586960972250656,
|
|
"grad_norm": 6.120552916217351,
|
|
"learning_rate": 4.626176321832229e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4186,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"epoch": 0.2590683218253894,
|
|
"grad_norm": 6.18407137107997,
|
|
"learning_rate": 4.6244657953029005e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4157,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.3515625,
|
|
"rewards/rejected": -7.625,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"epoch": 0.2594405464257133,
|
|
"grad_norm": 6.3884031653947435,
|
|
"learning_rate": 4.622751681961019e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4237,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.53125,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"epoch": 0.2598127710260371,
|
|
"grad_norm": 5.758457196120104,
|
|
"learning_rate": 4.621033984700585e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4061,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"epoch": 0.26018499562636094,
|
|
"grad_norm": 5.825420787649575,
|
|
"learning_rate": 4.6193127064216486e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.3914,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.578125,
|
|
"rewards/rejected": -7.875,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"epoch": 0.26055722022668476,
|
|
"grad_norm": 5.613717574869501,
|
|
"learning_rate": 4.6175878500303054e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.4008,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.671875,
|
|
"rewards/rejected": -8.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"epoch": 0.26092944482700864,
|
|
"grad_norm": 7.354862413572649,
|
|
"learning_rate": 4.615859418438695e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4195,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.4765625,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 7010
|
|
},
|
|
{
|
|
"epoch": 0.26130166942733246,
|
|
"grad_norm": 5.708966665313372,
|
|
"learning_rate": 4.6141274145649876e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4245,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.1015625,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 7020
|
|
},
|
|
{
|
|
"epoch": 0.2616738940276563,
|
|
"grad_norm": 5.64831204522663,
|
|
"learning_rate": 4.612391841333392e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4065,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.640625,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 7030
|
|
},
|
|
{
|
|
"epoch": 0.2620461186279801,
|
|
"grad_norm": 5.614310797181401,
|
|
"learning_rate": 4.6106527016741377e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4126,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.1875,
|
|
"rewards/margins": 1.3515625,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 7040
|
|
},
|
|
{
|
|
"epoch": 0.262418343228304,
|
|
"grad_norm": 7.4644644596942005,
|
|
"learning_rate": 4.608909998523476e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4261,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.46875,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"epoch": 0.2627905678286278,
|
|
"grad_norm": 6.188756503030487,
|
|
"learning_rate": 4.607163734823678e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4042,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.5,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 7060
|
|
},
|
|
{
|
|
"epoch": 0.26316279242895163,
|
|
"grad_norm": 5.7489193983212585,
|
|
"learning_rate": 4.605413913523022e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.421,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 7070
|
|
},
|
|
{
|
|
"epoch": 0.26353501702927545,
|
|
"grad_norm": 6.267474216073482,
|
|
"learning_rate": 4.603660537575796e-07,
|
|
"logits/chosen": -3.734375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4193,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 7080
|
|
},
|
|
{
|
|
"epoch": 0.2639072416295993,
|
|
"grad_norm": 7.087242445477736,
|
|
"learning_rate": 4.601903609942287e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.417,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.46875,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 7090
|
|
},
|
|
{
|
|
"epoch": 0.26427946622992315,
|
|
"grad_norm": 6.325037036344175,
|
|
"learning_rate": 4.600143133588781e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.3953,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.5234375,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"epoch": 0.264651690830247,
|
|
"grad_norm": 7.109490718254207,
|
|
"learning_rate": 4.598379111487552e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.546875,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4288,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.6484375,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7110
|
|
},
|
|
{
|
|
"epoch": 0.2650239154305708,
|
|
"grad_norm": 6.612417698596598,
|
|
"learning_rate": 4.5966115466168645e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4257,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.59375,
|
|
"rewards/margins": 1.296875,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7120
|
|
},
|
|
{
|
|
"epoch": 0.2653961400308946,
|
|
"grad_norm": 7.0194486136726875,
|
|
"learning_rate": 4.594840441960961e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4227,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7130
|
|
},
|
|
{
|
|
"epoch": 0.2657683646312185,
|
|
"grad_norm": 5.401212137042596,
|
|
"learning_rate": 4.593065800510062e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.425,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.234375,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 7140
|
|
},
|
|
{
|
|
"epoch": 0.2661405892315423,
|
|
"grad_norm": 5.232057431338868,
|
|
"learning_rate": 4.5912876252603585e-07,
|
|
"logits/chosen": -3.6875,
|
|
"logits/rejected": -3.515625,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4113,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.53125,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -7.84375,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"epoch": 0.26651281383186615,
|
|
"grad_norm": 6.052061286777042,
|
|
"learning_rate": 4.5895059192140095e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.4289,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -6.6875,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -8.0,
|
|
"step": 7160
|
|
},
|
|
{
|
|
"epoch": 0.26688503843218997,
|
|
"grad_norm": 6.368459265997135,
|
|
"learning_rate": 4.587720685379132e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4355,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.34375,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7170
|
|
},
|
|
{
|
|
"epoch": 0.2672572630325138,
|
|
"grad_norm": 6.558928363280608,
|
|
"learning_rate": 4.5859319267698025e-07,
|
|
"logits/chosen": -3.71875,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4352,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.53125,
|
|
"rewards/margins": 1.390625,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 7180
|
|
},
|
|
{
|
|
"epoch": 0.26762948763283767,
|
|
"grad_norm": 5.963429130104855,
|
|
"learning_rate": 4.584139646406047e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4025,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 7190
|
|
},
|
|
{
|
|
"epoch": 0.2680017122331615,
|
|
"grad_norm": 5.280230908834761,
|
|
"learning_rate": 4.5823438473138353e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4213,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.3125,
|
|
"rewards/rejected": -7.75,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"epoch": 0.2683739368334853,
|
|
"grad_norm": 5.847075646593318,
|
|
"learning_rate": 4.5805445325250826e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.4083,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.6640625,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 7210
|
|
},
|
|
{
|
|
"epoch": 0.26874616143380914,
|
|
"grad_norm": 8.482225886648067,
|
|
"learning_rate": 4.578741705077636e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4446,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.3828125,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 7220
|
|
},
|
|
{
|
|
"epoch": 0.269118386034133,
|
|
"grad_norm": 5.399312421088563,
|
|
"learning_rate": 4.5769353680152735e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4355,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 7230
|
|
},
|
|
{
|
|
"epoch": 0.26949061063445684,
|
|
"grad_norm": 5.441411541551882,
|
|
"learning_rate": 4.575125524387701e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4255,
|
|
"rewards/accuracies": 0.8500000238418579,
|
|
"rewards/chosen": -6.15625,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -7.5,
|
|
"step": 7240
|
|
},
|
|
{
|
|
"epoch": 0.26986283523478066,
|
|
"grad_norm": 5.607984311565896,
|
|
"learning_rate": 4.573312177250543e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4139,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"epoch": 0.2702350598351045,
|
|
"grad_norm": 6.039940537323914,
|
|
"learning_rate": 4.571495329665338e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4401,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.8125,
|
|
"rewards/margins": 1.2734375,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 7260
|
|
},
|
|
{
|
|
"epoch": 0.27060728443542836,
|
|
"grad_norm": 5.790152845082641,
|
|
"learning_rate": 4.5696749846995365e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4374,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -6.6875,
|
|
"rewards/margins": 1.3515625,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 7270
|
|
},
|
|
{
|
|
"epoch": 0.2709795090357522,
|
|
"grad_norm": 6.1954310400298835,
|
|
"learning_rate": 4.5678511454264924e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -784.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4117,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.875,
|
|
"rewards/margins": 1.59375,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 7280
|
|
},
|
|
{
|
|
"epoch": 0.271351733636076,
|
|
"grad_norm": 6.029955581819493,
|
|
"learning_rate": 4.566023814925459e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -792.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.4281,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 7290
|
|
},
|
|
{
|
|
"epoch": 0.27172395823639983,
|
|
"grad_norm": 6.191821880326933,
|
|
"learning_rate": 4.5641929962815863e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4421,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"epoch": 0.27209618283672365,
|
|
"grad_norm": 5.089637557125682,
|
|
"learning_rate": 4.56235869258591e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -788.0,
|
|
"logps/rejected": -896.0,
|
|
"loss": 0.4345,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -7.5,
|
|
"step": 7310
|
|
},
|
|
{
|
|
"epoch": 0.27246840743704753,
|
|
"grad_norm": 5.611604046597495,
|
|
"learning_rate": 4.5605209069353525e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.3938,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.640625,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7320
|
|
},
|
|
{
|
|
"epoch": 0.27284063203737136,
|
|
"grad_norm": 5.955603263327238,
|
|
"learning_rate": 4.5586796424327135e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4405,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -8.0,
|
|
"step": 7330
|
|
},
|
|
{
|
|
"epoch": 0.2732128566376952,
|
|
"grad_norm": 6.377692630412435,
|
|
"learning_rate": 4.5568349021866666e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.53125,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4138,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 7340
|
|
},
|
|
{
|
|
"epoch": 0.273585081238019,
|
|
"grad_norm": 6.7136703934171775,
|
|
"learning_rate": 4.554986689311754e-07,
|
|
"logits/chosen": -3.6875,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4345,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.5234375,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"epoch": 0.2739573058383429,
|
|
"grad_norm": 6.01075360902772,
|
|
"learning_rate": 4.553135006928379e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.4349,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.6875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 7360
|
|
},
|
|
{
|
|
"epoch": 0.2743295304386667,
|
|
"grad_norm": 7.956713507898213,
|
|
"learning_rate": 4.551279858162806e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4025,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.6640625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 7370
|
|
},
|
|
{
|
|
"epoch": 0.2747017550389905,
|
|
"grad_norm": 6.412918379270744,
|
|
"learning_rate": 4.549421246147149e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4217,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7380
|
|
},
|
|
{
|
|
"epoch": 0.27507397963931435,
|
|
"grad_norm": 5.9595415971913175,
|
|
"learning_rate": 4.547559174019369e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.578125,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4068,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.640625,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 7390
|
|
},
|
|
{
|
|
"epoch": 0.27544620423963817,
|
|
"grad_norm": 6.131025186944429,
|
|
"learning_rate": 4.5456936449232715e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4158,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.125,
|
|
"rewards/margins": 1.4765625,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"epoch": 0.27581842883996205,
|
|
"grad_norm": 5.7655881844347245,
|
|
"learning_rate": 4.543824662008496e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4091,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 7410
|
|
},
|
|
{
|
|
"epoch": 0.27619065344028587,
|
|
"grad_norm": 6.058077064969408,
|
|
"learning_rate": 4.541952228430514e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -916.0,
|
|
"loss": 0.4294,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -7.625,
|
|
"step": 7420
|
|
},
|
|
{
|
|
"epoch": 0.2765628780406097,
|
|
"grad_norm": 8.553526571063612,
|
|
"learning_rate": 4.540076347350623e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.3932,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.125,
|
|
"rewards/margins": 1.59375,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 7430
|
|
},
|
|
{
|
|
"epoch": 0.2769351026409335,
|
|
"grad_norm": 11.03091735656846,
|
|
"learning_rate": 4.538197021935941e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.3978,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.578125,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 7440
|
|
},
|
|
{
|
|
"epoch": 0.2773073272412574,
|
|
"grad_norm": 6.61976796266326,
|
|
"learning_rate": 4.5363142553594014e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -916.0,
|
|
"loss": 0.4055,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -5.71875,
|
|
"rewards/margins": 1.6796875,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"epoch": 0.2776795518415812,
|
|
"grad_norm": 6.8849285588537885,
|
|
"learning_rate": 4.534428050799747e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -912.0,
|
|
"loss": 0.4169,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -5.90625,
|
|
"rewards/margins": 1.5703125,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 7460
|
|
},
|
|
{
|
|
"epoch": 0.27805177644190504,
|
|
"grad_norm": 5.805460007962187,
|
|
"learning_rate": 4.5325384114415254e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.4094,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.875,
|
|
"rewards/margins": 1.65625,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 7470
|
|
},
|
|
{
|
|
"epoch": 0.27842400104222886,
|
|
"grad_norm": 7.638616985649138,
|
|
"learning_rate": 4.530645340475083e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -768.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4068,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -5.75,
|
|
"rewards/margins": 1.59375,
|
|
"rewards/rejected": -7.34375,
|
|
"step": 7480
|
|
},
|
|
{
|
|
"epoch": 0.27879622564255274,
|
|
"grad_norm": 6.657490517120866,
|
|
"learning_rate": 4.52874884109656e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -736.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4189,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -5.5625,
|
|
"rewards/margins": 1.59375,
|
|
"rewards/rejected": -7.15625,
|
|
"step": 7490
|
|
},
|
|
{
|
|
"epoch": 0.27916845024287656,
|
|
"grad_norm": 5.88141696203444,
|
|
"learning_rate": 4.5268489165078855e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4326,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"epoch": 0.2795406748432004,
|
|
"grad_norm": 6.871904732080597,
|
|
"learning_rate": 4.5249455699167706e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -760.0,
|
|
"logps/rejected": -880.0,
|
|
"loss": 0.4171,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.84375,
|
|
"rewards/margins": 1.390625,
|
|
"rewards/rejected": -7.25,
|
|
"step": 7510
|
|
},
|
|
{
|
|
"epoch": 0.2799128994435242,
|
|
"grad_norm": 6.612468422522421,
|
|
"learning_rate": 4.523038804536704e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -908.0,
|
|
"loss": 0.4151,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -5.90625,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 7520
|
|
},
|
|
{
|
|
"epoch": 0.28028512404384803,
|
|
"grad_norm": 6.992999825567599,
|
|
"learning_rate": 4.521128623586947e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4343,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.453125,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 7530
|
|
},
|
|
{
|
|
"epoch": 0.2806573486441719,
|
|
"grad_norm": 6.188508914849754,
|
|
"learning_rate": 4.519215030292527e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4374,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.15625,
|
|
"rewards/margins": 1.46875,
|
|
"rewards/rejected": -7.625,
|
|
"step": 7540
|
|
},
|
|
{
|
|
"epoch": 0.28102957324449573,
|
|
"grad_norm": 5.878247526319351,
|
|
"learning_rate": 4.517298027884234e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.43,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.3828125,
|
|
"rewards/rejected": -7.5,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"epoch": 0.28140179784481956,
|
|
"grad_norm": 6.09574265694494,
|
|
"learning_rate": 4.5153776195986113e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -912.0,
|
|
"loss": 0.4354,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.046875,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 7560
|
|
},
|
|
{
|
|
"epoch": 0.2817740224451434,
|
|
"grad_norm": 5.579202560668251,
|
|
"learning_rate": 4.513453808677955e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.3867,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.125,
|
|
"rewards/margins": 1.3671875,
|
|
"rewards/rejected": -7.5,
|
|
"step": 7570
|
|
},
|
|
{
|
|
"epoch": 0.28214624704546726,
|
|
"grad_norm": 6.414315148440845,
|
|
"learning_rate": 4.5115265983703036e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4086,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.53125,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 7580
|
|
},
|
|
{
|
|
"epoch": 0.2825184716457911,
|
|
"grad_norm": 5.37839396130642,
|
|
"learning_rate": 4.5095959919294366e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4132,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 7590
|
|
},
|
|
{
|
|
"epoch": 0.2828906962461149,
|
|
"grad_norm": 8.683317484337856,
|
|
"learning_rate": 4.5076619926148673e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -868.0,
|
|
"logps/rejected": -1012.0,
|
|
"loss": 0.4209,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -8.25,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"epoch": 0.2832629208464387,
|
|
"grad_norm": 6.779098935746247,
|
|
"learning_rate": 4.5057246036918357e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -1004.0,
|
|
"loss": 0.4081,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.671875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 7610
|
|
},
|
|
{
|
|
"epoch": 0.28363514544676255,
|
|
"grad_norm": 5.788869742179201,
|
|
"learning_rate": 4.503783828431306e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4149,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 7620
|
|
},
|
|
{
|
|
"epoch": 0.2840073700470864,
|
|
"grad_norm": 8.676483883656678,
|
|
"learning_rate": 4.50183967010996e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4161,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -7.625,
|
|
"step": 7630
|
|
},
|
|
{
|
|
"epoch": 0.28437959464741025,
|
|
"grad_norm": 5.407369224295794,
|
|
"learning_rate": 4.49989213201019e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -772.0,
|
|
"logps/rejected": -900.0,
|
|
"loss": 0.4227,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.9375,
|
|
"rewards/margins": 1.4453125,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 7640
|
|
},
|
|
{
|
|
"epoch": 0.2847518192477341,
|
|
"grad_norm": 5.496551436680179,
|
|
"learning_rate": 4.497941217420095e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -924.0,
|
|
"loss": 0.4007,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.0625,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"epoch": 0.2851240438480579,
|
|
"grad_norm": 6.3776460810407665,
|
|
"learning_rate": 4.495986929633476e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4334,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -7.625,
|
|
"step": 7660
|
|
},
|
|
{
|
|
"epoch": 0.2854962684483818,
|
|
"grad_norm": 7.728309008830767,
|
|
"learning_rate": 4.494029271949826e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4077,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.53125,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 7670
|
|
},
|
|
{
|
|
"epoch": 0.2858684930487056,
|
|
"grad_norm": 6.387763824439387,
|
|
"learning_rate": 4.492068247674331e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.578125,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4597,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.59375,
|
|
"rewards/margins": 1.578125,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 7680
|
|
},
|
|
{
|
|
"epoch": 0.2862407176490294,
|
|
"grad_norm": 7.421524518905735,
|
|
"learning_rate": 4.490103860117858e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4338,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.46875,
|
|
"rewards/rejected": -7.75,
|
|
"step": 7690
|
|
},
|
|
{
|
|
"epoch": 0.28661294224935324,
|
|
"grad_norm": 5.350457321169909,
|
|
"learning_rate": 4.4881361125969546e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4127,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.15625,
|
|
"rewards/margins": 1.7109375,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"epoch": 0.2869851668496771,
|
|
"grad_norm": 5.835040909626544,
|
|
"learning_rate": 4.48616500843384e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4233,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.390625,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7710
|
|
},
|
|
{
|
|
"epoch": 0.28735739145000094,
|
|
"grad_norm": 6.0248412291469435,
|
|
"learning_rate": 4.4841905509564e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -4.0625,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.3886,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.1875,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 7720
|
|
},
|
|
{
|
|
"epoch": 0.28772961605032477,
|
|
"grad_norm": 5.837526251953547,
|
|
"learning_rate": 4.4822127434981845e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4066,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.6015625,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 7730
|
|
},
|
|
{
|
|
"epoch": 0.2881018406506486,
|
|
"grad_norm": 6.5140837455567695,
|
|
"learning_rate": 4.4802315893983957e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.4104,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.21875,
|
|
"rewards/margins": 1.6328125,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7740
|
|
},
|
|
{
|
|
"epoch": 0.2884740652509724,
|
|
"grad_norm": 5.619844171623824,
|
|
"learning_rate": 4.4782470920018875e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4229,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.6015625,
|
|
"rewards/rejected": -8.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"epoch": 0.2888462898512963,
|
|
"grad_norm": 5.647042840024987,
|
|
"learning_rate": 4.4762592546591617e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4305,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.3671875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 7760
|
|
},
|
|
{
|
|
"epoch": 0.2892185144516201,
|
|
"grad_norm": 5.718864330463644,
|
|
"learning_rate": 4.4742680807263524e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4264,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.5625,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 7770
|
|
},
|
|
{
|
|
"epoch": 0.28959073905194394,
|
|
"grad_norm": 6.107401923218653,
|
|
"learning_rate": 4.4722735735652327e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4453,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.453125,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 7780
|
|
},
|
|
{
|
|
"epoch": 0.28996296365226776,
|
|
"grad_norm": 5.147574770400471,
|
|
"learning_rate": 4.4702757365432007e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4153,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.3125,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 7790
|
|
},
|
|
{
|
|
"epoch": 0.29033518825259164,
|
|
"grad_norm": 5.677173879103329,
|
|
"learning_rate": 4.468274573033278e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4251,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.3515625,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"epoch": 0.29070741285291546,
|
|
"grad_norm": 5.766540373890742,
|
|
"learning_rate": 4.4662700864141e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4182,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 7810
|
|
},
|
|
{
|
|
"epoch": 0.2910796374532393,
|
|
"grad_norm": 6.9286497803910265,
|
|
"learning_rate": 4.4642622800699155e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4193,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.328125,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7820
|
|
},
|
|
{
|
|
"epoch": 0.2914518620535631,
|
|
"grad_norm": 5.93524793533176,
|
|
"learning_rate": 4.4622511573905754e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4076,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.5,
|
|
"rewards/rejected": -7.75,
|
|
"step": 7830
|
|
},
|
|
{
|
|
"epoch": 0.291824086653887,
|
|
"grad_norm": 5.557305101607596,
|
|
"learning_rate": 4.460236721771531e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.9375,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4139,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 7840
|
|
},
|
|
{
|
|
"epoch": 0.2921963112542108,
|
|
"grad_norm": 8.193446093915714,
|
|
"learning_rate": 4.458218976613828e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.425,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"epoch": 0.29256853585453463,
|
|
"grad_norm": 6.122405971175107,
|
|
"learning_rate": 4.456197925324098e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.426,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -7.84375,
|
|
"step": 7860
|
|
},
|
|
{
|
|
"epoch": 0.29294076045485845,
|
|
"grad_norm": 5.771768562447178,
|
|
"learning_rate": 4.4541735713145546e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4111,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 7870
|
|
},
|
|
{
|
|
"epoch": 0.2933129850551823,
|
|
"grad_norm": 5.6990150415497185,
|
|
"learning_rate": 4.4521459180029884e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4269,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 7880
|
|
},
|
|
{
|
|
"epoch": 0.29368520965550615,
|
|
"grad_norm": 5.681072560503333,
|
|
"learning_rate": 4.45011496881276e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4146,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.5234375,
|
|
"rewards/rejected": -7.875,
|
|
"step": 7890
|
|
},
|
|
{
|
|
"epoch": 0.29405743425583,
|
|
"grad_norm": 5.931316505507531,
|
|
"learning_rate": 4.4480807271727954e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.4124,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"epoch": 0.2944296588561538,
|
|
"grad_norm": 6.555282071925908,
|
|
"learning_rate": 4.446043196517577e-07,
|
|
"logits/chosen": -4.15625,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4446,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.1640625,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 7910
|
|
},
|
|
{
|
|
"epoch": 0.2948018834564776,
|
|
"grad_norm": 6.99953419167626,
|
|
"learning_rate": 4.444002380287143e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4173,
|
|
"rewards/accuracies": 0.8500000238418579,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.53125,
|
|
"rewards/rejected": -7.84375,
|
|
"step": 7920
|
|
},
|
|
{
|
|
"epoch": 0.2951741080568015,
|
|
"grad_norm": 5.614691661723048,
|
|
"learning_rate": 4.441958281927075e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4182,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 7930
|
|
},
|
|
{
|
|
"epoch": 0.2955463326571253,
|
|
"grad_norm": 6.5137816481943345,
|
|
"learning_rate": 4.4399109048885006e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4264,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.875,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 7940
|
|
},
|
|
{
|
|
"epoch": 0.29591855725744914,
|
|
"grad_norm": 6.137050836358027,
|
|
"learning_rate": 4.437860252628081e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.3919,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"epoch": 0.29629078185777297,
|
|
"grad_norm": 6.602019028812518,
|
|
"learning_rate": 4.435806328608004e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4004,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.609375,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 7960
|
|
},
|
|
{
|
|
"epoch": 0.2966630064580968,
|
|
"grad_norm": 6.383267054442638,
|
|
"learning_rate": 4.4337491362959854e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -1000.0,
|
|
"loss": 0.4067,
|
|
"rewards/accuracies": 0.8500000238418579,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.7109375,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 7970
|
|
},
|
|
{
|
|
"epoch": 0.29703523105842067,
|
|
"grad_norm": 7.246108384770167,
|
|
"learning_rate": 4.4316886791652584e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -868.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4143,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -6.90625,
|
|
"rewards/margins": 1.234375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 7980
|
|
},
|
|
{
|
|
"epoch": 0.2974074556587445,
|
|
"grad_norm": 7.119303505897672,
|
|
"learning_rate": 4.429624960694566e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -1004.0,
|
|
"loss": 0.4212,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.78125,
|
|
"rewards/margins": 1.53125,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 7990
|
|
},
|
|
{
|
|
"epoch": 0.2977796802590683,
|
|
"grad_norm": 7.49237550667767,
|
|
"learning_rate": 4.42755798436816e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4071,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"epoch": 0.29815190485939214,
|
|
"grad_norm": 5.940738972935634,
|
|
"learning_rate": 4.42548775367579e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4075,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.5703125,
|
|
"rewards/rejected": -8.0,
|
|
"step": 8010
|
|
},
|
|
{
|
|
"epoch": 0.298524129459716,
|
|
"grad_norm": 6.9285959946410625,
|
|
"learning_rate": 4.4234142721127026e-07,
|
|
"logits/chosen": -4.1875,
|
|
"logits/rejected": -4.03125,
|
|
"logps/chosen": -856.0,
|
|
"logps/rejected": -1000.0,
|
|
"loss": 0.4152,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.5703125,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 8020
|
|
},
|
|
{
|
|
"epoch": 0.29889635406003984,
|
|
"grad_norm": 5.13595531237585,
|
|
"learning_rate": 4.4213375431796316e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4053,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8030
|
|
},
|
|
{
|
|
"epoch": 0.29926857866036366,
|
|
"grad_norm": 5.936162615807526,
|
|
"learning_rate": 4.419257570382793e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -1004.0,
|
|
"loss": 0.4263,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.7109375,
|
|
"rewards/rejected": -8.5,
|
|
"step": 8040
|
|
},
|
|
{
|
|
"epoch": 0.2996408032606875,
|
|
"grad_norm": 6.419512204504135,
|
|
"learning_rate": 4.4171743572338813e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.9375,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.4599,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.78125,
|
|
"rewards/margins": 1.296875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"epoch": 0.30001302786101136,
|
|
"grad_norm": 5.8554478476790255,
|
|
"learning_rate": 4.4150879072500604e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.398,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 8060
|
|
},
|
|
{
|
|
"epoch": 0.3003852524613352,
|
|
"grad_norm": 5.931214591098493,
|
|
"learning_rate": 4.4129982239539594e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.953125,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4166,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -8.25,
|
|
"step": 8070
|
|
},
|
|
{
|
|
"epoch": 0.300757477061659,
|
|
"grad_norm": 5.611931945679536,
|
|
"learning_rate": 4.410905310873665e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4274,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.53125,
|
|
"rewards/margins": 1.34375,
|
|
"rewards/rejected": -7.875,
|
|
"step": 8080
|
|
},
|
|
{
|
|
"epoch": 0.30112970166198283,
|
|
"grad_norm": 5.574444546827678,
|
|
"learning_rate": 4.40880917154272e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -888.0,
|
|
"logps/rejected": -1024.0,
|
|
"loss": 0.4028,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -8.25,
|
|
"step": 8090
|
|
},
|
|
{
|
|
"epoch": 0.30150192626230665,
|
|
"grad_norm": 7.186521731548357,
|
|
"learning_rate": 4.4067098095001113e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4158,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.6875,
|
|
"rewards/margins": 1.46875,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"epoch": 0.30187415086263053,
|
|
"grad_norm": 7.481605924985874,
|
|
"learning_rate": 4.4046072282902687e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.59375,
|
|
"logps/chosen": -796.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4124,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.15625,
|
|
"rewards/margins": 1.7890625,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 8110
|
|
},
|
|
{
|
|
"epoch": 0.30224637546295435,
|
|
"grad_norm": 6.3696058520993155,
|
|
"learning_rate": 4.402501431463055e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -932.0,
|
|
"loss": 0.4327,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.3125,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 8120
|
|
},
|
|
{
|
|
"epoch": 0.3026186000632782,
|
|
"grad_norm": 7.618684490235694,
|
|
"learning_rate": 4.4003924225737643e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -756.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4096,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -5.96875,
|
|
"rewards/margins": 1.8515625,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 8130
|
|
},
|
|
{
|
|
"epoch": 0.302990824663602,
|
|
"grad_norm": 5.540607847130943,
|
|
"learning_rate": 4.3982802051831127e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.3978,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.5234375,
|
|
"rewards/rejected": -8.0,
|
|
"step": 8140
|
|
},
|
|
{
|
|
"epoch": 0.3033630492639259,
|
|
"grad_norm": 6.278444493282474,
|
|
"learning_rate": 4.396164782857232e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -872.0,
|
|
"logps/rejected": -1020.0,
|
|
"loss": 0.416,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.90625,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"epoch": 0.3037352738642497,
|
|
"grad_norm": 5.626823879718762,
|
|
"learning_rate": 4.3940461591676683e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -880.0,
|
|
"logps/rejected": -1000.0,
|
|
"loss": 0.4027,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.6875,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8160
|
|
},
|
|
{
|
|
"epoch": 0.3041074984645735,
|
|
"grad_norm": 6.691950006306523,
|
|
"learning_rate": 4.391924337691368e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.3957,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 8170
|
|
},
|
|
{
|
|
"epoch": 0.30447972306489735,
|
|
"grad_norm": 6.886288410461233,
|
|
"learning_rate": 4.3897993220106825e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -856.0,
|
|
"logps/rejected": -1016.0,
|
|
"loss": 0.4083,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.671875,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 8180
|
|
},
|
|
{
|
|
"epoch": 0.30485194766522117,
|
|
"grad_norm": 7.030614261123283,
|
|
"learning_rate": 4.3876711157133506e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4104,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.59375,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 8190
|
|
},
|
|
{
|
|
"epoch": 0.30522417226554505,
|
|
"grad_norm": 5.28685154258976,
|
|
"learning_rate": 4.385539722392501e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4016,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"epoch": 0.30559639686586887,
|
|
"grad_norm": 6.1831163140416,
|
|
"learning_rate": 4.3834051456466414e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4147,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.46875,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 8210
|
|
},
|
|
{
|
|
"epoch": 0.3059686214661927,
|
|
"grad_norm": 6.8383476647506205,
|
|
"learning_rate": 4.381267389079656e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.46875,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4041,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.6875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 8220
|
|
},
|
|
{
|
|
"epoch": 0.3063408460665165,
|
|
"grad_norm": 8.026714295802059,
|
|
"learning_rate": 4.379126456300796e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.4079,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 8230
|
|
},
|
|
{
|
|
"epoch": 0.3067130706668404,
|
|
"grad_norm": 5.558690125341562,
|
|
"learning_rate": 4.3769823509246753e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4347,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 8240
|
|
},
|
|
{
|
|
"epoch": 0.3070852952671642,
|
|
"grad_norm": 5.815296242571299,
|
|
"learning_rate": 4.374835076571265e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4121,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.3828125,
|
|
"rewards/rejected": -7.625,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"epoch": 0.30745751986748804,
|
|
"grad_norm": 7.325015608535012,
|
|
"learning_rate": 4.3726846368658874e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4266,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 8260
|
|
},
|
|
{
|
|
"epoch": 0.30782974446781186,
|
|
"grad_norm": 8.500449221632431,
|
|
"learning_rate": 4.370531035439206e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -776.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4356,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.0,
|
|
"rewards/margins": 1.625,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 8270
|
|
},
|
|
{
|
|
"epoch": 0.30820196906813574,
|
|
"grad_norm": 5.416677126597945,
|
|
"learning_rate": 4.3683742759272255e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4142,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 8280
|
|
},
|
|
{
|
|
"epoch": 0.30857419366845956,
|
|
"grad_norm": 5.580238074384531,
|
|
"learning_rate": 4.36621436197128e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4044,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.875,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8290
|
|
},
|
|
{
|
|
"epoch": 0.3089464182687834,
|
|
"grad_norm": 6.409107181809076,
|
|
"learning_rate": 4.364051297218031e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -1024.0,
|
|
"loss": 0.4133,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.7265625,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"epoch": 0.3093186428691072,
|
|
"grad_norm": 6.8985678741594745,
|
|
"learning_rate": 4.361885085319459e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4349,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -7.875,
|
|
"step": 8310
|
|
},
|
|
{
|
|
"epoch": 0.30969086746943103,
|
|
"grad_norm": 5.638952892806989,
|
|
"learning_rate": 4.359715729932858e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -920.0,
|
|
"loss": 0.4192,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 8320
|
|
},
|
|
{
|
|
"epoch": 0.3100630920697549,
|
|
"grad_norm": 7.246221958164084,
|
|
"learning_rate": 4.357543234720829e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4257,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 8330
|
|
},
|
|
{
|
|
"epoch": 0.31043531667007873,
|
|
"grad_norm": 6.092445253017867,
|
|
"learning_rate": 4.355367603351275e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.407,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.5,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 8340
|
|
},
|
|
{
|
|
"epoch": 0.31080754127040255,
|
|
"grad_norm": 5.426934262227511,
|
|
"learning_rate": 4.353188839497393e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.96875,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.4023,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"epoch": 0.3111797658707264,
|
|
"grad_norm": 7.317631447645299,
|
|
"learning_rate": 4.3510069468376687e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4053,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.53125,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 8360
|
|
},
|
|
{
|
|
"epoch": 0.31155199047105026,
|
|
"grad_norm": 6.952255929461985,
|
|
"learning_rate": 4.34882192905587e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.3986,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -8.25,
|
|
"step": 8370
|
|
},
|
|
{
|
|
"epoch": 0.3119242150713741,
|
|
"grad_norm": 5.970769551386224,
|
|
"learning_rate": 4.3466337898410435e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.9375,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4021,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.4921875,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8380
|
|
},
|
|
{
|
|
"epoch": 0.3122964396716979,
|
|
"grad_norm": 6.849106146083491,
|
|
"learning_rate": 4.3444425328875013e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -868.0,
|
|
"logps/rejected": -1032.0,
|
|
"loss": 0.4166,
|
|
"rewards/accuracies": 0.8500000238418579,
|
|
"rewards/chosen": -6.78125,
|
|
"rewards/margins": 1.9453125,
|
|
"rewards/rejected": -8.75,
|
|
"step": 8390
|
|
},
|
|
{
|
|
"epoch": 0.3126686642720217,
|
|
"grad_norm": 6.2180243526623356,
|
|
"learning_rate": 4.3422481618948236e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.9375,
|
|
"logps/chosen": -868.0,
|
|
"logps/rejected": -996.0,
|
|
"loss": 0.4049,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.96875,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -8.375,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"epoch": 0.31304088887234555,
|
|
"grad_norm": 6.082562983185604,
|
|
"learning_rate": 4.340050680567846e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.4232,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.6875,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 8410
|
|
},
|
|
{
|
|
"epoch": 0.3134131134726694,
|
|
"grad_norm": 7.44201695017634,
|
|
"learning_rate": 4.337850092616656e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.3922,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.765625,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8420
|
|
},
|
|
{
|
|
"epoch": 0.31378533807299325,
|
|
"grad_norm": 5.9405189431510745,
|
|
"learning_rate": 4.3356464017565856e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -892.0,
|
|
"logps/rejected": -1000.0,
|
|
"loss": 0.4195,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -7.09375,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -8.375,
|
|
"step": 8430
|
|
},
|
|
{
|
|
"epoch": 0.31415756267331707,
|
|
"grad_norm": 5.924181931732808,
|
|
"learning_rate": 4.333439611708206e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -856.0,
|
|
"logps/rejected": -1024.0,
|
|
"loss": 0.3944,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.703125,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 8440
|
|
},
|
|
{
|
|
"epoch": 0.3145297872736409,
|
|
"grad_norm": 6.4765620173851115,
|
|
"learning_rate": 4.3312297261973206e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -856.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.4054,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"epoch": 0.31490201187396477,
|
|
"grad_norm": 5.671122846877211,
|
|
"learning_rate": 4.32901674895496e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -940.0,
|
|
"loss": 0.4111,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.5390625,
|
|
"rewards/rejected": -7.875,
|
|
"step": 8460
|
|
},
|
|
{
|
|
"epoch": 0.3152742364742886,
|
|
"grad_norm": 6.657463307251734,
|
|
"learning_rate": 4.326800683717373e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -1020.0,
|
|
"loss": 0.4179,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.71875,
|
|
"rewards/rejected": -8.375,
|
|
"step": 8470
|
|
},
|
|
{
|
|
"epoch": 0.3156464610746124,
|
|
"grad_norm": 5.75342405182809,
|
|
"learning_rate": 4.324581534226023e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -904.0,
|
|
"logps/rejected": -1000.0,
|
|
"loss": 0.4293,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -7.0625,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -8.375,
|
|
"step": 8480
|
|
},
|
|
{
|
|
"epoch": 0.31601868567493624,
|
|
"grad_norm": 6.836465597847896,
|
|
"learning_rate": 4.32235930422758e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.9375,
|
|
"logps/chosen": -880.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.3967,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.265625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8490
|
|
},
|
|
{
|
|
"epoch": 0.3163909102752601,
|
|
"grad_norm": 6.651365659289901,
|
|
"learning_rate": 4.3201339974739165e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -856.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.4233,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.6875,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"epoch": 0.31676313487558394,
|
|
"grad_norm": 7.359793337944927,
|
|
"learning_rate": 4.3179056177220976e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.4236,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8510
|
|
},
|
|
{
|
|
"epoch": 0.31713535947590776,
|
|
"grad_norm": 7.067853932231795,
|
|
"learning_rate": 4.3156741687343776e-07,
|
|
"logits/chosen": -4.09375,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4426,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.6875,
|
|
"rewards/margins": 1.3125,
|
|
"rewards/rejected": -8.0,
|
|
"step": 8520
|
|
},
|
|
{
|
|
"epoch": 0.3175075840762316,
|
|
"grad_norm": 5.996014220524351,
|
|
"learning_rate": 4.313439654278194e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.953125,
|
|
"logps/chosen": -868.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.4108,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.6875,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -8.0,
|
|
"step": 8530
|
|
},
|
|
{
|
|
"epoch": 0.3178798086765554,
|
|
"grad_norm": 5.238535042979966,
|
|
"learning_rate": 4.311202078126156e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -880.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4161,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.6875,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8540
|
|
},
|
|
{
|
|
"epoch": 0.3182520332768793,
|
|
"grad_norm": 5.012702460857521,
|
|
"learning_rate": 4.308961444056046e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.4208,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.28125,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"epoch": 0.3186242578772031,
|
|
"grad_norm": 11.305688686391719,
|
|
"learning_rate": 4.306717755850808e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.4059,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.53125,
|
|
"rewards/margins": 1.4921875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 8560
|
|
},
|
|
{
|
|
"epoch": 0.31899648247752693,
|
|
"grad_norm": 5.295829030657762,
|
|
"learning_rate": 4.304471017298542e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.4067,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8570
|
|
},
|
|
{
|
|
"epoch": 0.31936870707785076,
|
|
"grad_norm": 5.913689328599416,
|
|
"learning_rate": 4.302221232192497e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -996.0,
|
|
"loss": 0.4283,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -8.25,
|
|
"step": 8580
|
|
},
|
|
{
|
|
"epoch": 0.31974093167817463,
|
|
"grad_norm": 5.784266238781056,
|
|
"learning_rate": 4.2999684043310667e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.3987,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -8.0,
|
|
"step": 8590
|
|
},
|
|
{
|
|
"epoch": 0.32011315627849846,
|
|
"grad_norm": 5.464018820974973,
|
|
"learning_rate": 4.297712537517784e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -996.0,
|
|
"loss": 0.3807,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.59375,
|
|
"rewards/margins": 1.4921875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"epoch": 0.3204853808788223,
|
|
"grad_norm": 7.923595559439052,
|
|
"learning_rate": 4.295453635561308e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -876.0,
|
|
"logps/rejected": -1020.0,
|
|
"loss": 0.4234,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.8125,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 8610
|
|
},
|
|
{
|
|
"epoch": 0.3208576054791461,
|
|
"grad_norm": 5.0265425003094455,
|
|
"learning_rate": 4.293191702275426e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.399,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.90625,
|
|
"rewards/margins": 1.390625,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 8620
|
|
},
|
|
{
|
|
"epoch": 0.3212298300794699,
|
|
"grad_norm": 6.43312477412012,
|
|
"learning_rate": 4.290926741479043e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.424,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 8630
|
|
},
|
|
{
|
|
"epoch": 0.3216020546797938,
|
|
"grad_norm": 6.491899681684533,
|
|
"learning_rate": 4.288658756996172e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -1000.0,
|
|
"loss": 0.4087,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.625,
|
|
"rewards/rejected": -8.25,
|
|
"step": 8640
|
|
},
|
|
{
|
|
"epoch": 0.3219742792801176,
|
|
"grad_norm": 6.426639427626988,
|
|
"learning_rate": 4.2863877526559344e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.59375,
|
|
"logps/chosen": -876.0,
|
|
"logps/rejected": -1004.0,
|
|
"loss": 0.4083,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.8125,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"epoch": 0.32234650388044145,
|
|
"grad_norm": 6.168189668870453,
|
|
"learning_rate": 4.2841137322925493e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -996.0,
|
|
"loss": 0.3971,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -8.375,
|
|
"step": 8660
|
|
},
|
|
{
|
|
"epoch": 0.32271872848076527,
|
|
"grad_norm": 6.127930009387289,
|
|
"learning_rate": 4.281836699745327e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -872.0,
|
|
"logps/rejected": -1016.0,
|
|
"loss": 0.4042,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.9375,
|
|
"rewards/margins": 1.625,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 8670
|
|
},
|
|
{
|
|
"epoch": 0.32309095308108915,
|
|
"grad_norm": 6.702853514547645,
|
|
"learning_rate": 4.279556658858665e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -876.0,
|
|
"logps/rejected": -1012.0,
|
|
"loss": 0.4368,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.875,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -8.375,
|
|
"step": 8680
|
|
},
|
|
{
|
|
"epoch": 0.32346317768141297,
|
|
"grad_norm": 5.723774547547514,
|
|
"learning_rate": 4.2772736134820385e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.921875,
|
|
"logps/chosen": -884.0,
|
|
"logps/rejected": -1016.0,
|
|
"loss": 0.402,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.8125,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -8.375,
|
|
"step": 8690
|
|
},
|
|
{
|
|
"epoch": 0.3238354022817368,
|
|
"grad_norm": 5.980546634229164,
|
|
"learning_rate": 4.2749875674699954e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -868.0,
|
|
"logps/rejected": -1000.0,
|
|
"loss": 0.4152,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.5234375,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"epoch": 0.3242076268820606,
|
|
"grad_norm": 6.209159869839144,
|
|
"learning_rate": 4.2726985246821507e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -996.0,
|
|
"loss": 0.3925,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.625,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 8710
|
|
},
|
|
{
|
|
"epoch": 0.3245798514823845,
|
|
"grad_norm": 6.267291076001385,
|
|
"learning_rate": 4.270406488983177e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.4185,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.71875,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 8720
|
|
},
|
|
{
|
|
"epoch": 0.3249520760827083,
|
|
"grad_norm": 7.578543422656428,
|
|
"learning_rate": 4.268111464242803e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -996.0,
|
|
"loss": 0.4124,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.59375,
|
|
"rewards/margins": 1.59375,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8730
|
|
},
|
|
{
|
|
"epoch": 0.32532430068303214,
|
|
"grad_norm": 7.375260990815802,
|
|
"learning_rate": 4.2658134543358e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -856.0,
|
|
"logps/rejected": -1000.0,
|
|
"loss": 0.388,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.78125,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -8.25,
|
|
"step": 8740
|
|
},
|
|
{
|
|
"epoch": 0.32569652528335596,
|
|
"grad_norm": 6.525551561252898,
|
|
"learning_rate": 4.2635124631419827e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.406,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.390625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"epoch": 0.3260687498836798,
|
|
"grad_norm": 7.26237339228251,
|
|
"learning_rate": 4.261208494546198e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4243,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -8.25,
|
|
"step": 8760
|
|
},
|
|
{
|
|
"epoch": 0.32644097448400367,
|
|
"grad_norm": 5.842136712955005,
|
|
"learning_rate": 4.2589015524383187e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4155,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.40625,
|
|
"rewards/margins": 1.65625,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 8770
|
|
},
|
|
{
|
|
"epoch": 0.3268131990843275,
|
|
"grad_norm": 6.234556903970917,
|
|
"learning_rate": 4.2565916407132393e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -872.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4092,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.3125,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 8780
|
|
},
|
|
{
|
|
"epoch": 0.3271854236846513,
|
|
"grad_norm": 6.349897441965635,
|
|
"learning_rate": 4.254278763270867e-07,
|
|
"logits/chosen": -4.21875,
|
|
"logits/rejected": -3.953125,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4305,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.78125,
|
|
"rewards/margins": 1.390625,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8790
|
|
},
|
|
{
|
|
"epoch": 0.32755764828497513,
|
|
"grad_norm": 6.7361433127902215,
|
|
"learning_rate": 4.251962924016117e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -856.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.4152,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"epoch": 0.327929872885299,
|
|
"grad_norm": 7.804511550663237,
|
|
"learning_rate": 4.2496441268589047e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.984375,
|
|
"logps/chosen": -872.0,
|
|
"logps/rejected": -996.0,
|
|
"loss": 0.4002,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8810
|
|
},
|
|
{
|
|
"epoch": 0.32830209748562283,
|
|
"grad_norm": 6.655558491999033,
|
|
"learning_rate": 4.2473223757141386e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.9375,
|
|
"logps/chosen": -900.0,
|
|
"logps/rejected": -1056.0,
|
|
"loss": 0.393,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -7.0,
|
|
"rewards/margins": 1.734375,
|
|
"rewards/rejected": -8.75,
|
|
"step": 8820
|
|
},
|
|
{
|
|
"epoch": 0.32867432208594666,
|
|
"grad_norm": 6.864977853309613,
|
|
"learning_rate": 4.2449976745017157e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -880.0,
|
|
"logps/rejected": -1016.0,
|
|
"loss": 0.41,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.78125,
|
|
"rewards/margins": 1.5703125,
|
|
"rewards/rejected": -8.375,
|
|
"step": 8830
|
|
},
|
|
{
|
|
"epoch": 0.3290465466862705,
|
|
"grad_norm": 6.5844947633559,
|
|
"learning_rate": 4.2426700271465134e-07,
|
|
"logits/chosen": -4.09375,
|
|
"logits/rejected": -4.0625,
|
|
"logps/chosen": -856.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.3999,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.59375,
|
|
"rewards/margins": 1.578125,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8840
|
|
},
|
|
{
|
|
"epoch": 0.32941877128659436,
|
|
"grad_norm": 6.819245813260431,
|
|
"learning_rate": 4.240339437578383e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4102,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.6328125,
|
|
"rewards/rejected": -7.875,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"epoch": 0.3297909958869182,
|
|
"grad_norm": 5.76134641555927,
|
|
"learning_rate": 4.238005909732144e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.3932,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.859375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8860
|
|
},
|
|
{
|
|
"epoch": 0.330163220487242,
|
|
"grad_norm": 5.874282433157733,
|
|
"learning_rate": 4.235669447547574e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4129,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.6328125,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 8870
|
|
},
|
|
{
|
|
"epoch": 0.3305354450875658,
|
|
"grad_norm": 5.972758576716602,
|
|
"learning_rate": 4.2333300549694085e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4176,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.34375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8880
|
|
},
|
|
{
|
|
"epoch": 0.33090766968788965,
|
|
"grad_norm": 5.067748708967267,
|
|
"learning_rate": 4.2309877359473277e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -904.0,
|
|
"loss": 0.4214,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.25,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 8890
|
|
},
|
|
{
|
|
"epoch": 0.33127989428821353,
|
|
"grad_norm": 6.122715243608545,
|
|
"learning_rate": 4.2286424944359547e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.953125,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4249,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.609375,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"epoch": 0.33165211888853735,
|
|
"grad_norm": 6.74866694741633,
|
|
"learning_rate": 4.2262943343948445e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4089,
|
|
"rewards/accuracies": 0.7124999761581421,
|
|
"rewards/chosen": -6.8125,
|
|
"rewards/margins": 1.1875,
|
|
"rewards/rejected": -8.0,
|
|
"step": 8910
|
|
},
|
|
{
|
|
"epoch": 0.3320243434888612,
|
|
"grad_norm": 5.646707898613816,
|
|
"learning_rate": 4.223943259788481e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.3928,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.53125,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 8920
|
|
},
|
|
{
|
|
"epoch": 0.332396568089185,
|
|
"grad_norm": 5.631200896660625,
|
|
"learning_rate": 4.22158927458627e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.4221,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.59375,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8930
|
|
},
|
|
{
|
|
"epoch": 0.3327687926895089,
|
|
"grad_norm": 6.053408040794421,
|
|
"learning_rate": 4.219232382762528e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.4045,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.5390625,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 8940
|
|
},
|
|
{
|
|
"epoch": 0.3331410172898327,
|
|
"grad_norm": 6.323042450967391,
|
|
"learning_rate": 4.2168725882964825e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -780.0,
|
|
"logps/rejected": -928.0,
|
|
"loss": 0.4261,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.09375,
|
|
"rewards/margins": 1.4921875,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"epoch": 0.3335132418901565,
|
|
"grad_norm": 5.828864435359478,
|
|
"learning_rate": 4.2145098951722584e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4267,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.671875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8960
|
|
},
|
|
{
|
|
"epoch": 0.33388546649048034,
|
|
"grad_norm": 5.70859261213098,
|
|
"learning_rate": 4.2121443073788775e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.3929,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.6328125,
|
|
"rewards/rejected": -8.0,
|
|
"step": 8970
|
|
},
|
|
{
|
|
"epoch": 0.33425769109080417,
|
|
"grad_norm": 6.088627683559499,
|
|
"learning_rate": 4.209775828910247e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.4091,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.6484375,
|
|
"rewards/rejected": -8.0,
|
|
"step": 8980
|
|
},
|
|
{
|
|
"epoch": 0.33462991569112804,
|
|
"grad_norm": 5.693198970274243,
|
|
"learning_rate": 4.207404463765154e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.96875,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.3978,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.6875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 8990
|
|
},
|
|
{
|
|
"epoch": 0.33500214029145187,
|
|
"grad_norm": 6.190797373208319,
|
|
"learning_rate": 4.205030215947261e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.4231,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"epoch": 0.3353743648917757,
|
|
"grad_norm": 7.9204455765894775,
|
|
"learning_rate": 4.202653089465097e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -964.0,
|
|
"loss": 0.4138,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.25,
|
|
"rewards/margins": 1.5703125,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 9010
|
|
},
|
|
{
|
|
"epoch": 0.3357465894920995,
|
|
"grad_norm": 5.967744946826578,
|
|
"learning_rate": 4.2002730883320493e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -4.0,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4155,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.609375,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 9020
|
|
},
|
|
{
|
|
"epoch": 0.3361188140924234,
|
|
"grad_norm": 5.457856710766668,
|
|
"learning_rate": 4.1978902165663616e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.4214,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 9030
|
|
},
|
|
{
|
|
"epoch": 0.3364910386927472,
|
|
"grad_norm": 5.747191781439095,
|
|
"learning_rate": 4.1955044781911215e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -884.0,
|
|
"logps/rejected": -1024.0,
|
|
"loss": 0.4429,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -7.0625,
|
|
"rewards/margins": 1.3359375,
|
|
"rewards/rejected": -8.375,
|
|
"step": 9040
|
|
},
|
|
{
|
|
"epoch": 0.33686326329307104,
|
|
"grad_norm": 7.912218403652893,
|
|
"learning_rate": 4.193115877234258e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4238,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.2734375,
|
|
"rewards/rejected": -8.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"epoch": 0.33723548789339486,
|
|
"grad_norm": 5.910070642286067,
|
|
"learning_rate": 4.1907244177285326e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.984375,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4219,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9060
|
|
},
|
|
{
|
|
"epoch": 0.33760771249371874,
|
|
"grad_norm": 6.0530639916655335,
|
|
"learning_rate": 4.188330103711533e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.4013,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.640625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 9070
|
|
},
|
|
{
|
|
"epoch": 0.33797993709404256,
|
|
"grad_norm": 7.750779225230822,
|
|
"learning_rate": 4.185932939225666e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -880.0,
|
|
"logps/rejected": -1000.0,
|
|
"loss": 0.4266,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.9375,
|
|
"rewards/margins": 1.265625,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 9080
|
|
},
|
|
{
|
|
"epoch": 0.3383521616943664,
|
|
"grad_norm": 6.525563977104109,
|
|
"learning_rate": 4.1835329283181506e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.402,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.4453125,
|
|
"rewards/rejected": -8.125,
|
|
"step": 9090
|
|
},
|
|
{
|
|
"epoch": 0.3387243862946902,
|
|
"grad_norm": 8.283249004397994,
|
|
"learning_rate": 4.1811300750410137e-07,
|
|
"logits/chosen": -4.09375,
|
|
"logits/rejected": -3.890625,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4178,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.78125,
|
|
"rewards/margins": 1.4375,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"epoch": 0.33909661089501403,
|
|
"grad_norm": 6.208206273735844,
|
|
"learning_rate": 4.1787243834510793e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4196,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 9110
|
|
},
|
|
{
|
|
"epoch": 0.3394688354953379,
|
|
"grad_norm": 6.669403185375734,
|
|
"learning_rate": 4.176315857609963e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.953125,
|
|
"logps/chosen": -896.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.4304,
|
|
"rewards/accuracies": 0.706250011920929,
|
|
"rewards/chosen": -6.6875,
|
|
"rewards/margins": 1.2265625,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 9120
|
|
},
|
|
{
|
|
"epoch": 0.33984106009566173,
|
|
"grad_norm": 6.434839914194607,
|
|
"learning_rate": 4.173904501584066e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -872.0,
|
|
"logps/rejected": -1000.0,
|
|
"loss": 0.4271,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.90625,
|
|
"rewards/margins": 1.53125,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 9130
|
|
},
|
|
{
|
|
"epoch": 0.34021328469598555,
|
|
"grad_norm": 6.27853766790502,
|
|
"learning_rate": 4.1714903194445686e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -880.0,
|
|
"logps/rejected": -1016.0,
|
|
"loss": 0.4217,
|
|
"rewards/accuracies": 0.856249988079071,
|
|
"rewards/chosen": -6.8125,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 9140
|
|
},
|
|
{
|
|
"epoch": 0.3405855092963094,
|
|
"grad_norm": 9.105893065582725,
|
|
"learning_rate": 4.169073315267421e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.953125,
|
|
"logps/chosen": -876.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.4118,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.8125,
|
|
"rewards/margins": 1.234375,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"epoch": 0.34095773389663325,
|
|
"grad_norm": 6.875435651786618,
|
|
"learning_rate": 4.1666534931333406e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.96875,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4209,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.59375,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -8.0,
|
|
"step": 9160
|
|
},
|
|
{
|
|
"epoch": 0.3413299584969571,
|
|
"grad_norm": 6.786260650352042,
|
|
"learning_rate": 4.1642308571277996e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.4189,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.53125,
|
|
"rewards/margins": 1.59375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 9170
|
|
},
|
|
{
|
|
"epoch": 0.3417021830972809,
|
|
"grad_norm": 5.698368402847716,
|
|
"learning_rate": 4.1618054113410217e-07,
|
|
"logits/chosen": -4.0625,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.3933,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.453125,
|
|
"rewards/rejected": -8.0,
|
|
"step": 9180
|
|
},
|
|
{
|
|
"epoch": 0.3420744076976047,
|
|
"grad_norm": 6.952095882586489,
|
|
"learning_rate": 4.159377159867976e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -1004.0,
|
|
"loss": 0.4129,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.96875,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -8.5,
|
|
"step": 9190
|
|
},
|
|
{
|
|
"epoch": 0.34244663229792854,
|
|
"grad_norm": 5.850135960583494,
|
|
"learning_rate": 4.1569461068083664e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -884.0,
|
|
"logps/rejected": -1020.0,
|
|
"loss": 0.4274,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.9375,
|
|
"rewards/margins": 1.453125,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 9200
|
|
},
|
|
{
|
|
"epoch": 0.3428188568982524,
|
|
"grad_norm": 6.146542333464643,
|
|
"learning_rate": 4.154512256266629e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -948.0,
|
|
"loss": 0.4171,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.4375,
|
|
"rewards/margins": 1.359375,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 9210
|
|
},
|
|
{
|
|
"epoch": 0.34319108149857624,
|
|
"grad_norm": 5.97886901598888,
|
|
"learning_rate": 4.152075612351921e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.3955,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -6.53125,
|
|
"rewards/margins": 1.53125,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9220
|
|
},
|
|
{
|
|
"epoch": 0.34356330609890007,
|
|
"grad_norm": 6.71364261876551,
|
|
"learning_rate": 4.149636179178117e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -872.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4243,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -8.25,
|
|
"step": 9230
|
|
},
|
|
{
|
|
"epoch": 0.3439355306992239,
|
|
"grad_norm": 6.884692592393682,
|
|
"learning_rate": 4.1471939608637997e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -852.0,
|
|
"logps/rejected": -1016.0,
|
|
"loss": 0.4274,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.6328125,
|
|
"rewards/rejected": -8.375,
|
|
"step": 9240
|
|
},
|
|
{
|
|
"epoch": 0.34430775529954777,
|
|
"grad_norm": 6.071302294765108,
|
|
"learning_rate": 4.144748961532255e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4061,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.59375,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 9250
|
|
},
|
|
{
|
|
"epoch": 0.3446799798998716,
|
|
"grad_norm": 6.698432883381243,
|
|
"learning_rate": 4.1423011853114644e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.9375,
|
|
"logps/chosen": -856.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4203,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.53125,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 9260
|
|
},
|
|
{
|
|
"epoch": 0.3450522045001954,
|
|
"grad_norm": 5.822996174621156,
|
|
"learning_rate": 4.1398506363340965e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4018,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.53125,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 9270
|
|
},
|
|
{
|
|
"epoch": 0.34542442910051924,
|
|
"grad_norm": 6.298107470087667,
|
|
"learning_rate": 4.137397318737502e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4012,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.6328125,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 9280
|
|
},
|
|
{
|
|
"epoch": 0.3457966537008431,
|
|
"grad_norm": 7.357744810723383,
|
|
"learning_rate": 4.134941236663706e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -1016.0,
|
|
"loss": 0.4217,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.9765625,
|
|
"rewards/rejected": -8.5,
|
|
"step": 9290
|
|
},
|
|
{
|
|
"epoch": 0.34616887830116694,
|
|
"grad_norm": 7.3558803264435095,
|
|
"learning_rate": 4.132482394259401e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -804.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.4099,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.5625,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 9300
|
|
},
|
|
{
|
|
"epoch": 0.34654110290149076,
|
|
"grad_norm": 6.240883295217108,
|
|
"learning_rate": 4.1300207956759395e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4239,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.40625,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9310
|
|
},
|
|
{
|
|
"epoch": 0.3469133275018146,
|
|
"grad_norm": 6.970894711514693,
|
|
"learning_rate": 4.127556445069328e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -808.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.4069,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.28125,
|
|
"rewards/margins": 1.6328125,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 9320
|
|
},
|
|
{
|
|
"epoch": 0.3472855521021384,
|
|
"grad_norm": 7.136146202820999,
|
|
"learning_rate": 4.125089346600218e-07,
|
|
"logits/chosen": -4.09375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -872.0,
|
|
"logps/rejected": -1020.0,
|
|
"loss": 0.4092,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.875,
|
|
"rewards/margins": 1.625,
|
|
"rewards/rejected": -8.5,
|
|
"step": 9330
|
|
},
|
|
{
|
|
"epoch": 0.3476577767024623,
|
|
"grad_norm": 7.032592923553457,
|
|
"learning_rate": 4.122619504433902e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -868.0,
|
|
"logps/rejected": -996.0,
|
|
"loss": 0.4206,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 9340
|
|
},
|
|
{
|
|
"epoch": 0.3480300013027861,
|
|
"grad_norm": 5.578080483299949,
|
|
"learning_rate": 4.120146922740303e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4159,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 9350
|
|
},
|
|
{
|
|
"epoch": 0.34840222590310993,
|
|
"grad_norm": 5.528673313535459,
|
|
"learning_rate": 4.1176716056939715e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.90625,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.3917,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.59375,
|
|
"rewards/margins": 1.484375,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9360
|
|
},
|
|
{
|
|
"epoch": 0.34877445050343375,
|
|
"grad_norm": 6.46712489092406,
|
|
"learning_rate": 4.115193557474074e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -812.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.4092,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 9370
|
|
},
|
|
{
|
|
"epoch": 0.34914667510375763,
|
|
"grad_norm": 6.86728024748694,
|
|
"learning_rate": 4.1127127822643894e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.4133,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9380
|
|
},
|
|
{
|
|
"epoch": 0.34951889970408145,
|
|
"grad_norm": 6.6586310848932,
|
|
"learning_rate": 4.1102292842533004e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -876.0,
|
|
"logps/rejected": -1016.0,
|
|
"loss": 0.4126,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.625,
|
|
"rewards/rejected": -8.5,
|
|
"step": 9390
|
|
},
|
|
{
|
|
"epoch": 0.3498911243044053,
|
|
"grad_norm": 4.9953986320876655,
|
|
"learning_rate": 4.1077430676337867e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.5,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.405,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.6875,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -8.25,
|
|
"step": 9400
|
|
},
|
|
{
|
|
"epoch": 0.3502633489047291,
|
|
"grad_norm": 7.19618775434978,
|
|
"learning_rate": 4.1052541366034174e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.609375,
|
|
"logps/chosen": -800.0,
|
|
"logps/rejected": -944.0,
|
|
"loss": 0.4018,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.625,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 9410
|
|
},
|
|
{
|
|
"epoch": 0.3506355735050529,
|
|
"grad_norm": 7.731108481797667,
|
|
"learning_rate": 4.102762495364346e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.4289,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.5625,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 9420
|
|
},
|
|
{
|
|
"epoch": 0.3510077981053768,
|
|
"grad_norm": 5.849057935096351,
|
|
"learning_rate": 4.100268148123299e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -872.0,
|
|
"logps/rejected": -996.0,
|
|
"loss": 0.4066,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.453125,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 9430
|
|
},
|
|
{
|
|
"epoch": 0.3513800227057006,
|
|
"grad_norm": 5.54189743324542,
|
|
"learning_rate": 4.0977710990915747e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.3992,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.46875,
|
|
"rewards/rejected": -8.25,
|
|
"step": 9440
|
|
},
|
|
{
|
|
"epoch": 0.35175224730602445,
|
|
"grad_norm": 5.862439017008876,
|
|
"learning_rate": 4.0952713524850313e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -856.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4107,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.5625,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9450
|
|
},
|
|
{
|
|
"epoch": 0.35212447190634827,
|
|
"grad_norm": 6.7294433609781255,
|
|
"learning_rate": 4.0927689125240806e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4275,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -7.84375,
|
|
"step": 9460
|
|
},
|
|
{
|
|
"epoch": 0.35249669650667215,
|
|
"grad_norm": 5.542091200007172,
|
|
"learning_rate": 4.090263783433683e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.435,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.4609375,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9470
|
|
},
|
|
{
|
|
"epoch": 0.35286892110699597,
|
|
"grad_norm": 6.639174527773383,
|
|
"learning_rate": 4.0877559694433384e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.3922,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.625,
|
|
"rewards/margins": 1.515625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 9480
|
|
},
|
|
{
|
|
"epoch": 0.3532411457073198,
|
|
"grad_norm": 7.359094817030376,
|
|
"learning_rate": 4.0852454747870807e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -968.0,
|
|
"loss": 0.4344,
|
|
"rewards/accuracies": 0.7250000238418579,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.1875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9490
|
|
},
|
|
{
|
|
"epoch": 0.3536133703076436,
|
|
"grad_norm": 6.545935248321405,
|
|
"learning_rate": 4.082732303703469e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -820.0,
|
|
"logps/rejected": -936.0,
|
|
"loss": 0.4126,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.296875,
|
|
"rewards/rejected": -7.625,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"epoch": 0.3539855949079675,
|
|
"grad_norm": 5.968054422175286,
|
|
"learning_rate": 4.0802164604355805e-07,
|
|
"logits/chosen": -4.03125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4083,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.78125,
|
|
"rewards/margins": 1.3125,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9510
|
|
},
|
|
{
|
|
"epoch": 0.3543578195082913,
|
|
"grad_norm": 6.526012259525071,
|
|
"learning_rate": 4.077697949231005e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4163,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.4453125,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 9520
|
|
},
|
|
{
|
|
"epoch": 0.35473004410861514,
|
|
"grad_norm": 6.880366350953438,
|
|
"learning_rate": 4.075176774341835e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.671875,
|
|
"logps/chosen": -848.0,
|
|
"logps/rejected": -972.0,
|
|
"loss": 0.4116,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.2890625,
|
|
"rewards/rejected": -8.0,
|
|
"step": 9530
|
|
},
|
|
{
|
|
"epoch": 0.35510226870893896,
|
|
"grad_norm": 6.483557917102565,
|
|
"learning_rate": 4.0726529400246634e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -788.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.4139,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -6.34375,
|
|
"rewards/margins": 1.65625,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 9540
|
|
},
|
|
{
|
|
"epoch": 0.3554744933092628,
|
|
"grad_norm": 6.541046197839035,
|
|
"learning_rate": 4.070126450540569e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -888.0,
|
|
"logps/rejected": -1008.0,
|
|
"loss": 0.411,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -6.875,
|
|
"rewards/margins": 1.3828125,
|
|
"rewards/rejected": -8.25,
|
|
"step": 9550
|
|
},
|
|
{
|
|
"epoch": 0.35584671790958666,
|
|
"grad_norm": 5.704995921378098,
|
|
"learning_rate": 4.0675973101551177e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -816.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4026,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.609375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 9560
|
|
},
|
|
{
|
|
"epoch": 0.3562189425099105,
|
|
"grad_norm": 6.6939980321479915,
|
|
"learning_rate": 4.065065523138347e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.4145,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 9570
|
|
},
|
|
{
|
|
"epoch": 0.3565911671102343,
|
|
"grad_norm": 10.286463291727507,
|
|
"learning_rate": 4.062531093764764e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.4133,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.65625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 9580
|
|
},
|
|
{
|
|
"epoch": 0.35696339171055813,
|
|
"grad_norm": 6.240640847775624,
|
|
"learning_rate": 4.05999402631334e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -872.0,
|
|
"logps/rejected": -1012.0,
|
|
"loss": 0.413,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.6875,
|
|
"rewards/margins": 1.5703125,
|
|
"rewards/rejected": -8.25,
|
|
"step": 9590
|
|
},
|
|
{
|
|
"epoch": 0.357335616310882,
|
|
"grad_norm": 5.7953061492719895,
|
|
"learning_rate": 4.0574543250674973e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.84375,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.4207,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.4140625,
|
|
"rewards/rejected": -8.25,
|
|
"step": 9600
|
|
},
|
|
{
|
|
"epoch": 0.35770784091120583,
|
|
"grad_norm": 6.151665591033918,
|
|
"learning_rate": 4.054911994315104e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -912.0,
|
|
"logps/rejected": -1032.0,
|
|
"loss": 0.3904,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.78125,
|
|
"rewards/margins": 1.578125,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 9610
|
|
},
|
|
{
|
|
"epoch": 0.35808006551152965,
|
|
"grad_norm": 7.724056079487011,
|
|
"learning_rate": 4.052367038348471e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -880.0,
|
|
"logps/rejected": -1004.0,
|
|
"loss": 0.3775,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.640625,
|
|
"rewards/rejected": -8.5,
|
|
"step": 9620
|
|
},
|
|
{
|
|
"epoch": 0.3584522901118535,
|
|
"grad_norm": 6.531161377753698,
|
|
"learning_rate": 4.049819461464338e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.406,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.9375,
|
|
"rewards/margins": 1.53125,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 9630
|
|
},
|
|
{
|
|
"epoch": 0.3588245147121773,
|
|
"grad_norm": 7.062915441804796,
|
|
"learning_rate": 4.0472692679638733e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -1024.0,
|
|
"loss": 0.3979,
|
|
"rewards/accuracies": 0.793749988079071,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.8359375,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 9640
|
|
},
|
|
{
|
|
"epoch": 0.3591967393125012,
|
|
"grad_norm": 10.243709215827634,
|
|
"learning_rate": 4.0447164621526586e-07,
|
|
"logits/chosen": -4.125,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -884.0,
|
|
"logps/rejected": -1056.0,
|
|
"loss": 0.3967,
|
|
"rewards/accuracies": 0.768750011920929,
|
|
"rewards/chosen": -6.96875,
|
|
"rewards/margins": 1.7109375,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 9650
|
|
},
|
|
{
|
|
"epoch": 0.359568963912825,
|
|
"grad_norm": 6.09437279859335,
|
|
"learning_rate": 4.04216104834069e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.75,
|
|
"logps/chosen": -904.0,
|
|
"logps/rejected": -1056.0,
|
|
"loss": 0.4109,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -7.09375,
|
|
"rewards/margins": 1.640625,
|
|
"rewards/rejected": -8.75,
|
|
"step": 9660
|
|
},
|
|
{
|
|
"epoch": 0.3599411885131488,
|
|
"grad_norm": 7.0834473527037165,
|
|
"learning_rate": 4.0396030308423643e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -868.0,
|
|
"logps/rejected": -1040.0,
|
|
"loss": 0.4302,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.8125,
|
|
"rewards/margins": 1.765625,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 9670
|
|
},
|
|
{
|
|
"epoch": 0.36031341311347265,
|
|
"grad_norm": 6.095238905555106,
|
|
"learning_rate": 4.037042413976476e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -1004.0,
|
|
"loss": 0.3889,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.5859375,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 9680
|
|
},
|
|
{
|
|
"epoch": 0.3606856377137965,
|
|
"grad_norm": 5.5030409006530725,
|
|
"learning_rate": 4.0344792020662067e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.3855,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.78125,
|
|
"rewards/margins": 1.53125,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 9690
|
|
},
|
|
{
|
|
"epoch": 0.36105786231412035,
|
|
"grad_norm": 7.250256115255806,
|
|
"learning_rate": 4.0319133994391206e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -892.0,
|
|
"logps/rejected": -1040.0,
|
|
"loss": 0.4189,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.90625,
|
|
"rewards/margins": 1.6171875,
|
|
"rewards/rejected": -8.5,
|
|
"step": 9700
|
|
},
|
|
{
|
|
"epoch": 0.36143008691444417,
|
|
"grad_norm": 6.441598010604168,
|
|
"learning_rate": 4.0293450104271544e-07,
|
|
"logits/chosen": -3.765625,
|
|
"logits/rejected": -3.703125,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -996.0,
|
|
"loss": 0.4102,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.9375,
|
|
"rewards/margins": 1.4921875,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 9710
|
|
},
|
|
{
|
|
"epoch": 0.361802311514768,
|
|
"grad_norm": 6.773528920002974,
|
|
"learning_rate": 4.026774039366612e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -1016.0,
|
|
"loss": 0.404,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.8125,
|
|
"rewards/margins": 1.6015625,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 9720
|
|
},
|
|
{
|
|
"epoch": 0.36217453611509187,
|
|
"grad_norm": 6.876868653444924,
|
|
"learning_rate": 4.0242004905981587e-07,
|
|
"logits/chosen": -3.890625,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -876.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4301,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -7.15625,
|
|
"rewards/margins": 1.296875,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 9730
|
|
},
|
|
{
|
|
"epoch": 0.3625467607154157,
|
|
"grad_norm": 6.354287464530844,
|
|
"learning_rate": 4.0216243684668073e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4027,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.8125,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 9740
|
|
},
|
|
{
|
|
"epoch": 0.3629189853157395,
|
|
"grad_norm": 8.013897971181141,
|
|
"learning_rate": 4.019045677321921e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -864.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.4076,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.546875,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 9750
|
|
},
|
|
{
|
|
"epoch": 0.36329120991606334,
|
|
"grad_norm": 5.972597439875224,
|
|
"learning_rate": 4.016464421517196e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.875,
|
|
"logps/chosen": -844.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4049,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.65625,
|
|
"rewards/margins": 1.5234375,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 9760
|
|
},
|
|
{
|
|
"epoch": 0.36366343451638716,
|
|
"grad_norm": 5.760478609996771,
|
|
"learning_rate": 4.0138806054106604e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -892.0,
|
|
"logps/rejected": -1008.0,
|
|
"loss": 0.4095,
|
|
"rewards/accuracies": 0.737500011920929,
|
|
"rewards/chosen": -7.03125,
|
|
"rewards/margins": 1.3046875,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 9770
|
|
},
|
|
{
|
|
"epoch": 0.36403565911671104,
|
|
"grad_norm": 6.8187297576482075,
|
|
"learning_rate": 4.011294233364664e-07,
|
|
"logits/chosen": -3.78125,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -880.0,
|
|
"logps/rejected": -1032.0,
|
|
"loss": 0.3928,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.875,
|
|
"rewards/margins": 1.765625,
|
|
"rewards/rejected": -8.625,
|
|
"step": 9780
|
|
},
|
|
{
|
|
"epoch": 0.36440788371703486,
|
|
"grad_norm": 6.077472359176952,
|
|
"learning_rate": 4.0087053097458735e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -896.0,
|
|
"logps/rejected": -1040.0,
|
|
"loss": 0.375,
|
|
"rewards/accuracies": 0.831250011920929,
|
|
"rewards/chosen": -7.15625,
|
|
"rewards/margins": 1.640625,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 9790
|
|
},
|
|
{
|
|
"epoch": 0.3647801083173587,
|
|
"grad_norm": 7.558862444911248,
|
|
"learning_rate": 4.00611383892526e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.78125,
|
|
"logps/chosen": -828.0,
|
|
"logps/rejected": -984.0,
|
|
"loss": 0.4482,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.71875,
|
|
"rewards/margins": 1.6796875,
|
|
"rewards/rejected": -8.375,
|
|
"step": 9800
|
|
},
|
|
{
|
|
"epoch": 0.3651523329176825,
|
|
"grad_norm": 6.7384897044264145,
|
|
"learning_rate": 4.003519825278101e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.625,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -988.0,
|
|
"loss": 0.4252,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.6171875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9810
|
|
},
|
|
{
|
|
"epoch": 0.3655245575180064,
|
|
"grad_norm": 6.987283324033663,
|
|
"learning_rate": 4.000923273183961e-07,
|
|
"logits/chosen": -3.859375,
|
|
"logits/rejected": -3.5625,
|
|
"logps/chosen": -796.0,
|
|
"logps/rejected": -952.0,
|
|
"loss": 0.3997,
|
|
"rewards/accuracies": 0.824999988079071,
|
|
"rewards/chosen": -6.3125,
|
|
"rewards/margins": 1.7421875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9820
|
|
},
|
|
{
|
|
"epoch": 0.3658967821183302,
|
|
"grad_norm": 6.05933441587129,
|
|
"learning_rate": 3.9983241870266935e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.6875,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -996.0,
|
|
"loss": 0.3919,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -6.84375,
|
|
"rewards/margins": 1.4296875,
|
|
"rewards/rejected": -8.25,
|
|
"step": 9830
|
|
},
|
|
{
|
|
"epoch": 0.36626900671865403,
|
|
"grad_norm": 6.529010763233826,
|
|
"learning_rate": 3.995722571194431e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.734375,
|
|
"logps/chosen": -868.0,
|
|
"logps/rejected": -1008.0,
|
|
"loss": 0.4073,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -7.0,
|
|
"rewards/margins": 1.375,
|
|
"rewards/rejected": -8.375,
|
|
"step": 9840
|
|
},
|
|
{
|
|
"epoch": 0.36664123131897786,
|
|
"grad_norm": 7.803463998982988,
|
|
"learning_rate": 3.9931184300795746e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -876.0,
|
|
"logps/rejected": -1012.0,
|
|
"loss": 0.4128,
|
|
"rewards/accuracies": 0.8500000238418579,
|
|
"rewards/chosen": -6.875,
|
|
"rewards/margins": 1.609375,
|
|
"rewards/rejected": -8.5,
|
|
"step": 9850
|
|
},
|
|
{
|
|
"epoch": 0.36701345591930173,
|
|
"grad_norm": 6.249855727102126,
|
|
"learning_rate": 3.9905117680787906e-07,
|
|
"logits/chosen": -3.921875,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -884.0,
|
|
"logps/rejected": -1016.0,
|
|
"loss": 0.4231,
|
|
"rewards/accuracies": 0.7749999761581421,
|
|
"rewards/chosen": -6.96875,
|
|
"rewards/margins": 1.421875,
|
|
"rewards/rejected": -8.375,
|
|
"step": 9860
|
|
},
|
|
{
|
|
"epoch": 0.36738568051962556,
|
|
"grad_norm": 5.671708959671821,
|
|
"learning_rate": 3.987902589593e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.828125,
|
|
"logps/chosen": -892.0,
|
|
"logps/rejected": -1012.0,
|
|
"loss": 0.4168,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.78125,
|
|
"rewards/margins": 1.5625,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 9870
|
|
},
|
|
{
|
|
"epoch": 0.3677579051199494,
|
|
"grad_norm": 5.452023733195032,
|
|
"learning_rate": 3.9852908990273737e-07,
|
|
"logits/chosen": -3.9375,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -868.0,
|
|
"logps/rejected": -1008.0,
|
|
"loss": 0.4047,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.90625,
|
|
"rewards/margins": 1.5625,
|
|
"rewards/rejected": -8.5,
|
|
"step": 9880
|
|
},
|
|
{
|
|
"epoch": 0.3681301297202732,
|
|
"grad_norm": 5.643034118918705,
|
|
"learning_rate": 3.9826767007913246e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.453125,
|
|
"logps/chosen": -836.0,
|
|
"logps/rejected": -992.0,
|
|
"loss": 0.4076,
|
|
"rewards/accuracies": 0.8187500238418579,
|
|
"rewards/chosen": -6.59375,
|
|
"rewards/margins": 1.65625,
|
|
"rewards/rejected": -8.25,
|
|
"step": 9890
|
|
},
|
|
{
|
|
"epoch": 0.368502354320597,
|
|
"grad_norm": 5.949504261642717,
|
|
"learning_rate": 3.9800599992984973e-07,
|
|
"logits/chosen": -3.90625,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -832.0,
|
|
"logps/rejected": -980.0,
|
|
"loss": 0.4144,
|
|
"rewards/accuracies": 0.800000011920929,
|
|
"rewards/chosen": -6.46875,
|
|
"rewards/margins": 1.6640625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 9900
|
|
},
|
|
{
|
|
"epoch": 0.3688745789209209,
|
|
"grad_norm": 6.7321939179405526,
|
|
"learning_rate": 3.9774407989667637e-07,
|
|
"logits/chosen": -3.796875,
|
|
"logits/rejected": -3.59375,
|
|
"logps/chosen": -840.0,
|
|
"logps/rejected": -960.0,
|
|
"loss": 0.4065,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.5,
|
|
"rewards/margins": 1.5546875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9910
|
|
},
|
|
{
|
|
"epoch": 0.3692468035212447,
|
|
"grad_norm": 6.042659898746077,
|
|
"learning_rate": 3.9748191042182143e-07,
|
|
"logits/chosen": -3.96875,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -880.0,
|
|
"logps/rejected": -1024.0,
|
|
"loss": 0.3821,
|
|
"rewards/accuracies": 0.8062499761581421,
|
|
"rewards/chosen": -7.0,
|
|
"rewards/margins": 1.59375,
|
|
"rewards/rejected": -8.625,
|
|
"step": 9920
|
|
},
|
|
{
|
|
"epoch": 0.36961902812156855,
|
|
"grad_norm": 6.836182453809051,
|
|
"learning_rate": 3.9721949194791527e-07,
|
|
"logits/chosen": -3.828125,
|
|
"logits/rejected": -3.640625,
|
|
"logps/chosen": -904.0,
|
|
"logps/rejected": -1032.0,
|
|
"loss": 0.3979,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.96875,
|
|
"rewards/margins": 1.75,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 9930
|
|
},
|
|
{
|
|
"epoch": 0.36999125272189237,
|
|
"grad_norm": 5.827364938139911,
|
|
"learning_rate": 3.969568249180083e-07,
|
|
"logits/chosen": -3.84375,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -872.0,
|
|
"logps/rejected": -976.0,
|
|
"loss": 0.4351,
|
|
"rewards/accuracies": 0.762499988079071,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.3203125,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 9940
|
|
},
|
|
{
|
|
"epoch": 0.37036347732221625,
|
|
"grad_norm": 5.892075689843871,
|
|
"learning_rate": 3.96693909775571e-07,
|
|
"logits/chosen": -3.8125,
|
|
"logits/rejected": -3.71875,
|
|
"logps/chosen": -824.0,
|
|
"logps/rejected": -956.0,
|
|
"loss": 0.3992,
|
|
"rewards/accuracies": 0.8374999761581421,
|
|
"rewards/chosen": -6.375,
|
|
"rewards/margins": 1.609375,
|
|
"rewards/rejected": -8.0,
|
|
"step": 9950
|
|
},
|
|
{
|
|
"epoch": 0.3707357019225401,
|
|
"grad_norm": 6.905053086738602,
|
|
"learning_rate": 3.9643074696449235e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.765625,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -1020.0,
|
|
"loss": 0.4052,
|
|
"rewards/accuracies": 0.7437499761581421,
|
|
"rewards/chosen": -6.8125,
|
|
"rewards/margins": 1.6171875,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 9960
|
|
},
|
|
{
|
|
"epoch": 0.3711079265228639,
|
|
"grad_norm": 6.39690664427754,
|
|
"learning_rate": 3.961673369290798e-07,
|
|
"logits/chosen": -4.0,
|
|
"logits/rejected": -3.859375,
|
|
"logps/chosen": -892.0,
|
|
"logps/rejected": -1012.0,
|
|
"loss": 0.4034,
|
|
"rewards/accuracies": 0.731249988079071,
|
|
"rewards/chosen": -6.875,
|
|
"rewards/margins": 1.3984375,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 9970
|
|
},
|
|
{
|
|
"epoch": 0.3714801511231877,
|
|
"grad_norm": 6.412933081381276,
|
|
"learning_rate": 3.9590368011405786e-07,
|
|
"logits/chosen": -3.953125,
|
|
"logits/rejected": -3.796875,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -1020.0,
|
|
"loss": 0.3882,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -6.75,
|
|
"rewards/margins": 1.6953125,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 9980
|
|
},
|
|
{
|
|
"epoch": 0.37185237572351154,
|
|
"grad_norm": 6.635149179644065,
|
|
"learning_rate": 3.956397769645681e-07,
|
|
"logits/chosen": -3.984375,
|
|
"logits/rejected": -3.8125,
|
|
"logps/chosen": -860.0,
|
|
"logps/rejected": -1008.0,
|
|
"loss": 0.3986,
|
|
"rewards/accuracies": 0.7875000238418579,
|
|
"rewards/chosen": -6.875,
|
|
"rewards/margins": 1.609375,
|
|
"rewards/rejected": -8.5,
|
|
"step": 9990
|
|
},
|
|
{
|
|
"epoch": 0.3722246003238354,
|
|
"grad_norm": 7.024506799311308,
|
|
"learning_rate": 3.9537562792616753e-07,
|
|
"logits/chosen": -3.875,
|
|
"logits/rejected": -3.65625,
|
|
"logps/chosen": -884.0,
|
|
"logps/rejected": -1016.0,
|
|
"loss": 0.413,
|
|
"rewards/accuracies": 0.7562500238418579,
|
|
"rewards/chosen": -7.0625,
|
|
"rewards/margins": 1.5078125,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"epoch": 0.3722246003238354,
|
|
"eval_logits/chosen": -3.890625,
|
|
"eval_logits/rejected": -3.71875,
|
|
"eval_logps/chosen": -912.0,
|
|
"eval_logps/rejected": -1020.0,
|
|
"eval_loss": 0.4581940472126007,
|
|
"eval_rewards/accuracies": 0.7553164958953857,
|
|
"eval_rewards/chosen": -7.09375,
|
|
"eval_rewards/margins": 1.40625,
|
|
"eval_rewards/rejected": -8.5,
|
|
"eval_runtime": 6317.7485,
|
|
"eval_samples_per_second": 30.241,
|
|
"eval_steps_per_second": 0.473,
|
|
"step": 10000
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 26865,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 10000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 0.0,
|
|
"train_batch_size": 8,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|