Model: shisa-ai/ablation-148-a128.dpo.armorm.rp.tl.2e6-shisa-v2-llama-3.1-8b Source: Original Platform
24485 lines
722 KiB
JSON
24485 lines
722 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 2.0,
|
|
"eval_steps": 500,
|
|
"global_step": 1630,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.001226993865030675,
|
|
"grad_norm": 151.57908825646035,
|
|
"learning_rate": 8e-08,
|
|
"logits/chosen": -0.32421875,
|
|
"logits/rejected": -0.515625,
|
|
"logps/chosen": -474.0,
|
|
"logps/rejected": -316.0,
|
|
"loss": 0.6914,
|
|
"rewards/accuracies": 0.0,
|
|
"rewards/chosen": 0.0,
|
|
"rewards/margins": 0.0,
|
|
"rewards/rejected": 0.0,
|
|
"step": 1
|
|
},
|
|
{
|
|
"epoch": 0.00245398773006135,
|
|
"grad_norm": 162.02529424316268,
|
|
"learning_rate": 1.6e-07,
|
|
"logits/chosen": -0.22265625,
|
|
"logits/rejected": -0.439453125,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -292.0,
|
|
"loss": 0.6914,
|
|
"rewards/accuracies": 0.0,
|
|
"rewards/chosen": 0.0,
|
|
"rewards/margins": 0.0,
|
|
"rewards/rejected": 0.0,
|
|
"step": 2
|
|
},
|
|
{
|
|
"epoch": 0.0036809815950920245,
|
|
"grad_norm": 115.26127545692574,
|
|
"learning_rate": 2.4e-07,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -272.0,
|
|
"loss": 0.697,
|
|
"rewards/accuracies": 0.34375,
|
|
"rewards/chosen": 0.006317138671875,
|
|
"rewards/margins": -0.00144195556640625,
|
|
"rewards/rejected": 0.007781982421875,
|
|
"step": 3
|
|
},
|
|
{
|
|
"epoch": 0.0049079754601227,
|
|
"grad_norm": 156.48930570622863,
|
|
"learning_rate": 3.2e-07,
|
|
"logits/chosen": -0.166015625,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -242.0,
|
|
"loss": 0.7128,
|
|
"rewards/accuracies": 0.3515625,
|
|
"rewards/chosen": -0.01470947265625,
|
|
"rewards/margins": -0.0264892578125,
|
|
"rewards/rejected": 0.01171875,
|
|
"step": 4
|
|
},
|
|
{
|
|
"epoch": 0.006134969325153374,
|
|
"grad_norm": 303.9882890698684,
|
|
"learning_rate": 4e-07,
|
|
"logits/chosen": -0.1845703125,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -270.0,
|
|
"loss": 0.6982,
|
|
"rewards/accuracies": 0.3046875,
|
|
"rewards/chosen": 0.009765625,
|
|
"rewards/margins": -0.00164794921875,
|
|
"rewards/rejected": 0.01141357421875,
|
|
"step": 5
|
|
},
|
|
{
|
|
"epoch": 0.007361963190184049,
|
|
"grad_norm": 326.9746232098939,
|
|
"learning_rate": 4.8e-07,
|
|
"logits/chosen": -0.25390625,
|
|
"logits/rejected": -0.34375,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -306.0,
|
|
"loss": 0.684,
|
|
"rewards/accuracies": 0.328125,
|
|
"rewards/chosen": -0.0006103515625,
|
|
"rewards/margins": 0.02099609375,
|
|
"rewards/rejected": -0.0216064453125,
|
|
"step": 6
|
|
},
|
|
{
|
|
"epoch": 0.008588957055214725,
|
|
"grad_norm": 226.40926938346539,
|
|
"learning_rate": 5.6e-07,
|
|
"logits/chosen": -0.203125,
|
|
"logits/rejected": -0.384765625,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -266.0,
|
|
"loss": 0.6663,
|
|
"rewards/accuracies": 0.5234375,
|
|
"rewards/chosen": 0.0264892578125,
|
|
"rewards/margins": 0.06884765625,
|
|
"rewards/rejected": -0.042724609375,
|
|
"step": 7
|
|
},
|
|
{
|
|
"epoch": 0.0098159509202454,
|
|
"grad_norm": 132.7750836984092,
|
|
"learning_rate": 6.4e-07,
|
|
"logits/chosen": -0.111328125,
|
|
"logits/rejected": -0.3203125,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -292.0,
|
|
"loss": 0.6488,
|
|
"rewards/accuracies": 0.515625,
|
|
"rewards/chosen": 0.0654296875,
|
|
"rewards/margins": 0.10986328125,
|
|
"rewards/rejected": -0.044677734375,
|
|
"step": 8
|
|
},
|
|
{
|
|
"epoch": 0.011042944785276074,
|
|
"grad_norm": 97.38590935108355,
|
|
"learning_rate": 7.2e-07,
|
|
"logits/chosen": -0.1279296875,
|
|
"logits/rejected": -0.35546875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -294.0,
|
|
"loss": 0.6144,
|
|
"rewards/accuracies": 0.5625,
|
|
"rewards/chosen": 0.138671875,
|
|
"rewards/margins": 0.2080078125,
|
|
"rewards/rejected": -0.06884765625,
|
|
"step": 9
|
|
},
|
|
{
|
|
"epoch": 0.012269938650306749,
|
|
"grad_norm": 109.2806037798003,
|
|
"learning_rate": 8e-07,
|
|
"logits/chosen": -0.189453125,
|
|
"logits/rejected": -0.345703125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -280.0,
|
|
"loss": 0.5575,
|
|
"rewards/accuracies": 0.6796875,
|
|
"rewards/chosen": 0.265625,
|
|
"rewards/margins": 0.388671875,
|
|
"rewards/rejected": -0.12353515625,
|
|
"step": 10
|
|
},
|
|
{
|
|
"epoch": 0.013496932515337423,
|
|
"grad_norm": 63.80484281566978,
|
|
"learning_rate": 8.799999999999999e-07,
|
|
"logits/chosen": -0.37109375,
|
|
"logits/rejected": -0.51171875,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -298.0,
|
|
"loss": 0.5237,
|
|
"rewards/accuracies": 0.7578125,
|
|
"rewards/chosen": 0.302734375,
|
|
"rewards/margins": 0.53515625,
|
|
"rewards/rejected": -0.232421875,
|
|
"step": 11
|
|
},
|
|
{
|
|
"epoch": 0.014723926380368098,
|
|
"grad_norm": 56.12151232997638,
|
|
"learning_rate": 9.6e-07,
|
|
"logits/chosen": -0.1279296875,
|
|
"logits/rejected": -0.2392578125,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -264.0,
|
|
"loss": 0.5143,
|
|
"rewards/accuracies": 0.7265625,
|
|
"rewards/chosen": 0.41015625,
|
|
"rewards/margins": 0.6328125,
|
|
"rewards/rejected": -0.220703125,
|
|
"step": 12
|
|
},
|
|
{
|
|
"epoch": 0.015950920245398775,
|
|
"grad_norm": 55.00840570479743,
|
|
"learning_rate": 1.04e-06,
|
|
"logits/chosen": -0.2314453125,
|
|
"logits/rejected": -0.40234375,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -254.0,
|
|
"loss": 0.459,
|
|
"rewards/accuracies": 0.7578125,
|
|
"rewards/chosen": 0.60546875,
|
|
"rewards/margins": 1.1171875,
|
|
"rewards/rejected": -0.5078125,
|
|
"step": 13
|
|
},
|
|
{
|
|
"epoch": 0.01717791411042945,
|
|
"grad_norm": 45.25533648934274,
|
|
"learning_rate": 1.12e-06,
|
|
"logits/chosen": -0.20703125,
|
|
"logits/rejected": -0.396484375,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -316.0,
|
|
"loss": 0.4332,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 1.0546875,
|
|
"rewards/margins": 1.671875,
|
|
"rewards/rejected": -0.62109375,
|
|
"step": 14
|
|
},
|
|
{
|
|
"epoch": 0.018404907975460124,
|
|
"grad_norm": 69.06405670291454,
|
|
"learning_rate": 1.2e-06,
|
|
"logits/chosen": -0.10009765625,
|
|
"logits/rejected": -0.17578125,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -294.0,
|
|
"loss": 0.4944,
|
|
"rewards/accuracies": 0.703125,
|
|
"rewards/chosen": 0.78515625,
|
|
"rewards/margins": 1.2578125,
|
|
"rewards/rejected": -0.47265625,
|
|
"step": 15
|
|
},
|
|
{
|
|
"epoch": 0.0196319018404908,
|
|
"grad_norm": 46.372079444775025,
|
|
"learning_rate": 1.28e-06,
|
|
"logits/chosen": -0.24609375,
|
|
"logits/rejected": -0.423828125,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -312.0,
|
|
"loss": 0.4167,
|
|
"rewards/accuracies": 0.7578125,
|
|
"rewards/chosen": 1.015625,
|
|
"rewards/margins": 1.8359375,
|
|
"rewards/rejected": -0.8203125,
|
|
"step": 16
|
|
},
|
|
{
|
|
"epoch": 0.020858895705521473,
|
|
"grad_norm": 40.52093766223854,
|
|
"learning_rate": 1.3600000000000001e-06,
|
|
"logits/chosen": -0.1533203125,
|
|
"logits/rejected": -0.318359375,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -264.0,
|
|
"loss": 0.3872,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 1.296875,
|
|
"rewards/margins": 2.34375,
|
|
"rewards/rejected": -1.046875,
|
|
"step": 17
|
|
},
|
|
{
|
|
"epoch": 0.022085889570552148,
|
|
"grad_norm": 59.54999431168163,
|
|
"learning_rate": 1.44e-06,
|
|
"logits/chosen": -0.1337890625,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -290.0,
|
|
"loss": 0.3963,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 1.1875,
|
|
"rewards/margins": 2.796875,
|
|
"rewards/rejected": -1.609375,
|
|
"step": 18
|
|
},
|
|
{
|
|
"epoch": 0.023312883435582823,
|
|
"grad_norm": 52.778803915151975,
|
|
"learning_rate": 1.5199999999999998e-06,
|
|
"logits/chosen": -0.1748046875,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -306.0,
|
|
"loss": 0.4856,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 0.8359375,
|
|
"rewards/margins": 2.765625,
|
|
"rewards/rejected": -1.9296875,
|
|
"step": 19
|
|
},
|
|
{
|
|
"epoch": 0.024539877300613498,
|
|
"grad_norm": 42.84608644509601,
|
|
"learning_rate": 1.6e-06,
|
|
"logits/chosen": -0.26171875,
|
|
"logits/rejected": -0.439453125,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.3732,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.6640625,
|
|
"rewards/margins": 4.3125,
|
|
"rewards/rejected": -2.65625,
|
|
"step": 20
|
|
},
|
|
{
|
|
"epoch": 0.025766871165644172,
|
|
"grad_norm": 34.391152104873825,
|
|
"learning_rate": 1.6799999999999998e-06,
|
|
"logits/chosen": -0.126953125,
|
|
"logits/rejected": -0.318359375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -280.0,
|
|
"loss": 0.3204,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 1.2109375,
|
|
"rewards/margins": 3.421875,
|
|
"rewards/rejected": -2.203125,
|
|
"step": 21
|
|
},
|
|
{
|
|
"epoch": 0.026993865030674847,
|
|
"grad_norm": 41.55569100164525,
|
|
"learning_rate": 1.7599999999999999e-06,
|
|
"logits/chosen": -0.125,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -314.0,
|
|
"loss": 0.3869,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 1.1015625,
|
|
"rewards/margins": 3.578125,
|
|
"rewards/rejected": -2.484375,
|
|
"step": 22
|
|
},
|
|
{
|
|
"epoch": 0.02822085889570552,
|
|
"grad_norm": 49.71451476170413,
|
|
"learning_rate": 1.84e-06,
|
|
"logits/chosen": -0.25,
|
|
"logits/rejected": -0.314453125,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.4151,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 1.4921875,
|
|
"rewards/margins": 3.953125,
|
|
"rewards/rejected": -2.453125,
|
|
"step": 23
|
|
},
|
|
{
|
|
"epoch": 0.029447852760736196,
|
|
"grad_norm": 60.25239910809378,
|
|
"learning_rate": 1.92e-06,
|
|
"logits/chosen": -0.1865234375,
|
|
"logits/rejected": -0.373046875,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -296.0,
|
|
"loss": 0.5039,
|
|
"rewards/accuracies": 0.7421875,
|
|
"rewards/chosen": 0.36328125,
|
|
"rewards/margins": 2.78125,
|
|
"rewards/rejected": -2.40625,
|
|
"step": 24
|
|
},
|
|
{
|
|
"epoch": 0.03067484662576687,
|
|
"grad_norm": 48.096597017259874,
|
|
"learning_rate": 2e-06,
|
|
"logits/chosen": -0.2490234375,
|
|
"logits/rejected": -0.43359375,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -322.0,
|
|
"loss": 0.3548,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.0390625,
|
|
"rewards/margins": 4.21875,
|
|
"rewards/rejected": -3.171875,
|
|
"step": 25
|
|
},
|
|
{
|
|
"epoch": 0.03190184049079755,
|
|
"grad_norm": 44.98461125679787,
|
|
"learning_rate": 1.999173553719008e-06,
|
|
"logits/chosen": -0.142578125,
|
|
"logits/rejected": -0.298828125,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -298.0,
|
|
"loss": 0.4087,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 1.46875,
|
|
"rewards/margins": 4.375,
|
|
"rewards/rejected": -2.921875,
|
|
"step": 26
|
|
},
|
|
{
|
|
"epoch": 0.033128834355828224,
|
|
"grad_norm": 36.85864755565715,
|
|
"learning_rate": 1.9983471074380163e-06,
|
|
"logits/chosen": -0.0732421875,
|
|
"logits/rejected": -0.2470703125,
|
|
"logps/chosen": -354.0,
|
|
"logps/rejected": -302.0,
|
|
"loss": 0.359,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": 1.6796875,
|
|
"rewards/margins": 5.0625,
|
|
"rewards/rejected": -3.390625,
|
|
"step": 27
|
|
},
|
|
{
|
|
"epoch": 0.0343558282208589,
|
|
"grad_norm": 38.08863369343569,
|
|
"learning_rate": 1.997520661157025e-06,
|
|
"logits/chosen": -0.005828857421875,
|
|
"logits/rejected": -0.11572265625,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -280.0,
|
|
"loss": 0.3635,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 1.6015625,
|
|
"rewards/margins": 4.15625,
|
|
"rewards/rejected": -2.5625,
|
|
"step": 28
|
|
},
|
|
{
|
|
"epoch": 0.03558282208588957,
|
|
"grad_norm": 37.878563173704045,
|
|
"learning_rate": 1.996694214876033e-06,
|
|
"logits/chosen": -0.2216796875,
|
|
"logits/rejected": -0.36328125,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.3282,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 1.765625,
|
|
"rewards/margins": 4.71875,
|
|
"rewards/rejected": -2.953125,
|
|
"step": 29
|
|
},
|
|
{
|
|
"epoch": 0.03680981595092025,
|
|
"grad_norm": 41.182338389245814,
|
|
"learning_rate": 1.9958677685950413e-06,
|
|
"logits/chosen": -0.091796875,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -332.0,
|
|
"logps/rejected": -284.0,
|
|
"loss": 0.3527,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 1.2734375,
|
|
"rewards/margins": 4.0625,
|
|
"rewards/rejected": -2.796875,
|
|
"step": 30
|
|
},
|
|
{
|
|
"epoch": 0.03803680981595092,
|
|
"grad_norm": 34.67189974475117,
|
|
"learning_rate": 1.9950413223140495e-06,
|
|
"logits/chosen": -0.0654296875,
|
|
"logits/rejected": -0.173828125,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -292.0,
|
|
"loss": 0.3635,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 2.109375,
|
|
"rewards/margins": 4.90625,
|
|
"rewards/rejected": -2.796875,
|
|
"step": 31
|
|
},
|
|
{
|
|
"epoch": 0.0392638036809816,
|
|
"grad_norm": 44.12813423898393,
|
|
"learning_rate": 1.9942148760330577e-06,
|
|
"logits/chosen": -0.1201171875,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -302.0,
|
|
"loss": 0.4208,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": 1.8359375,
|
|
"rewards/margins": 4.53125,
|
|
"rewards/rejected": -2.71875,
|
|
"step": 32
|
|
},
|
|
{
|
|
"epoch": 0.04049079754601227,
|
|
"grad_norm": 34.71582549479338,
|
|
"learning_rate": 1.993388429752066e-06,
|
|
"logits/chosen": -0.0177001953125,
|
|
"logits/rejected": -0.1484375,
|
|
"logps/chosen": -328.0,
|
|
"logps/rejected": -254.0,
|
|
"loss": 0.3119,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 1.09375,
|
|
"rewards/margins": 4.15625,
|
|
"rewards/rejected": -3.046875,
|
|
"step": 33
|
|
},
|
|
{
|
|
"epoch": 0.04171779141104295,
|
|
"grad_norm": 42.308925473685655,
|
|
"learning_rate": 1.9925619834710745e-06,
|
|
"logits/chosen": -0.15234375,
|
|
"logits/rejected": -0.26171875,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -322.0,
|
|
"loss": 0.4193,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": 1.5703125,
|
|
"rewards/margins": 5.03125,
|
|
"rewards/rejected": -3.46875,
|
|
"step": 34
|
|
},
|
|
{
|
|
"epoch": 0.04294478527607362,
|
|
"grad_norm": 42.01808473170447,
|
|
"learning_rate": 1.9917355371900826e-06,
|
|
"logits/chosen": -0.055908203125,
|
|
"logits/rejected": -0.1884765625,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -282.0,
|
|
"loss": 0.3779,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 1.1796875,
|
|
"rewards/margins": 4.6875,
|
|
"rewards/rejected": -3.5,
|
|
"step": 35
|
|
},
|
|
{
|
|
"epoch": 0.044171779141104296,
|
|
"grad_norm": 38.44265678506082,
|
|
"learning_rate": 1.990909090909091e-06,
|
|
"logits/chosen": -0.11865234375,
|
|
"logits/rejected": -0.181640625,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -316.0,
|
|
"loss": 0.3356,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.578125,
|
|
"rewards/margins": 5.28125,
|
|
"rewards/rejected": -3.703125,
|
|
"step": 36
|
|
},
|
|
{
|
|
"epoch": 0.04539877300613497,
|
|
"grad_norm": 39.89211897896586,
|
|
"learning_rate": 1.990082644628099e-06,
|
|
"logits/chosen": -0.07421875,
|
|
"logits/rejected": -0.1728515625,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.3546,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 2.3125,
|
|
"rewards/margins": 5.09375,
|
|
"rewards/rejected": -2.765625,
|
|
"step": 37
|
|
},
|
|
{
|
|
"epoch": 0.046625766871165646,
|
|
"grad_norm": 37.62529056872124,
|
|
"learning_rate": 1.9892561983471076e-06,
|
|
"logits/chosen": -0.018310546875,
|
|
"logits/rejected": -0.1259765625,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.3704,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 2.578125,
|
|
"rewards/margins": 5.59375,
|
|
"rewards/rejected": -3.0,
|
|
"step": 38
|
|
},
|
|
{
|
|
"epoch": 0.04785276073619632,
|
|
"grad_norm": 35.77776984532311,
|
|
"learning_rate": 1.9884297520661154e-06,
|
|
"logits/chosen": -0.12353515625,
|
|
"logits/rejected": -0.259765625,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -322.0,
|
|
"loss": 0.3257,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 2.34375,
|
|
"rewards/margins": 5.6875,
|
|
"rewards/rejected": -3.34375,
|
|
"step": 39
|
|
},
|
|
{
|
|
"epoch": 0.049079754601226995,
|
|
"grad_norm": 32.41938405609689,
|
|
"learning_rate": 1.987603305785124e-06,
|
|
"logits/chosen": -0.054443359375,
|
|
"logits/rejected": -0.1611328125,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -300.0,
|
|
"loss": 0.2842,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 2.109375,
|
|
"rewards/margins": 5.3125,
|
|
"rewards/rejected": -3.21875,
|
|
"step": 40
|
|
},
|
|
{
|
|
"epoch": 0.05030674846625767,
|
|
"grad_norm": 37.17636342144083,
|
|
"learning_rate": 1.986776859504132e-06,
|
|
"logits/chosen": -0.061767578125,
|
|
"logits/rejected": -0.2275390625,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -290.0,
|
|
"loss": 0.3885,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 1.8359375,
|
|
"rewards/margins": 4.875,
|
|
"rewards/rejected": -3.03125,
|
|
"step": 41
|
|
},
|
|
{
|
|
"epoch": 0.051533742331288344,
|
|
"grad_norm": 35.70973516699018,
|
|
"learning_rate": 1.9859504132231404e-06,
|
|
"logits/chosen": -0.004241943359375,
|
|
"logits/rejected": -0.134765625,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -298.0,
|
|
"loss": 0.3055,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.703125,
|
|
"rewards/margins": 4.59375,
|
|
"rewards/rejected": -2.875,
|
|
"step": 42
|
|
},
|
|
{
|
|
"epoch": 0.05276073619631902,
|
|
"grad_norm": 42.04321959772472,
|
|
"learning_rate": 1.9851239669421486e-06,
|
|
"logits/chosen": -0.06982421875,
|
|
"logits/rejected": -0.2177734375,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.3197,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 2.09375,
|
|
"rewards/margins": 5.40625,
|
|
"rewards/rejected": -3.3125,
|
|
"step": 43
|
|
},
|
|
{
|
|
"epoch": 0.053987730061349694,
|
|
"grad_norm": 47.96119964972139,
|
|
"learning_rate": 1.9842975206611568e-06,
|
|
"logits/chosen": -0.12255859375,
|
|
"logits/rejected": -0.21484375,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -308.0,
|
|
"loss": 0.4231,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 1.5546875,
|
|
"rewards/margins": 4.8125,
|
|
"rewards/rejected": -3.25,
|
|
"step": 44
|
|
},
|
|
{
|
|
"epoch": 0.05521472392638037,
|
|
"grad_norm": 40.69492767433013,
|
|
"learning_rate": 1.9834710743801654e-06,
|
|
"logits/chosen": -0.197265625,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -302.0,
|
|
"loss": 0.3937,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 1.84375,
|
|
"rewards/margins": 5.1875,
|
|
"rewards/rejected": -3.328125,
|
|
"step": 45
|
|
},
|
|
{
|
|
"epoch": 0.05644171779141104,
|
|
"grad_norm": 33.19833542496733,
|
|
"learning_rate": 1.9826446280991736e-06,
|
|
"logits/chosen": -0.0732421875,
|
|
"logits/rejected": -0.23046875,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -304.0,
|
|
"loss": 0.284,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 2.5,
|
|
"rewards/margins": 5.65625,
|
|
"rewards/rejected": -3.15625,
|
|
"step": 46
|
|
},
|
|
{
|
|
"epoch": 0.05766871165644172,
|
|
"grad_norm": 54.3681639315945,
|
|
"learning_rate": 1.9818181818181817e-06,
|
|
"logits/chosen": -0.1337890625,
|
|
"logits/rejected": -0.185546875,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.5448,
|
|
"rewards/accuracies": 0.71875,
|
|
"rewards/chosen": 1.5234375,
|
|
"rewards/margins": 4.375,
|
|
"rewards/rejected": -2.859375,
|
|
"step": 47
|
|
},
|
|
{
|
|
"epoch": 0.05889570552147239,
|
|
"grad_norm": 46.59084125923199,
|
|
"learning_rate": 1.98099173553719e-06,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.23828125,
|
|
"logps/chosen": -352.0,
|
|
"logps/rejected": -290.0,
|
|
"loss": 0.4882,
|
|
"rewards/accuracies": 0.7109375,
|
|
"rewards/chosen": 1.0234375,
|
|
"rewards/margins": 4.0,
|
|
"rewards/rejected": -2.984375,
|
|
"step": 48
|
|
},
|
|
{
|
|
"epoch": 0.06012269938650307,
|
|
"grad_norm": 35.99740809785637,
|
|
"learning_rate": 1.980165289256198e-06,
|
|
"logits/chosen": -0.12109375,
|
|
"logits/rejected": -0.296875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -304.0,
|
|
"loss": 0.2926,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 2.234375,
|
|
"rewards/margins": 5.78125,
|
|
"rewards/rejected": -3.546875,
|
|
"step": 49
|
|
},
|
|
{
|
|
"epoch": 0.06134969325153374,
|
|
"grad_norm": 47.19532636295041,
|
|
"learning_rate": 1.9793388429752063e-06,
|
|
"logits/chosen": -0.1201171875,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.4234,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 1.5,
|
|
"rewards/margins": 5.03125,
|
|
"rewards/rejected": -3.53125,
|
|
"step": 50
|
|
},
|
|
{
|
|
"epoch": 0.06257668711656442,
|
|
"grad_norm": 36.261549591784416,
|
|
"learning_rate": 1.978512396694215e-06,
|
|
"logits/chosen": -0.06005859375,
|
|
"logits/rejected": -0.189453125,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.2876,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 1.9296875,
|
|
"rewards/margins": 5.5625,
|
|
"rewards/rejected": -3.640625,
|
|
"step": 51
|
|
},
|
|
{
|
|
"epoch": 0.0638036809815951,
|
|
"grad_norm": 37.2148935681707,
|
|
"learning_rate": 1.977685950413223e-06,
|
|
"logits/chosen": -0.08154296875,
|
|
"logits/rejected": -0.2392578125,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.3422,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.5546875,
|
|
"rewards/margins": 5.28125,
|
|
"rewards/rejected": -3.734375,
|
|
"step": 52
|
|
},
|
|
{
|
|
"epoch": 0.06503067484662577,
|
|
"grad_norm": 38.81231049694607,
|
|
"learning_rate": 1.9768595041322313e-06,
|
|
"logits/chosen": -0.03125,
|
|
"logits/rejected": -0.162109375,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.3506,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 1.84375,
|
|
"rewards/margins": 5.15625,
|
|
"rewards/rejected": -3.328125,
|
|
"step": 53
|
|
},
|
|
{
|
|
"epoch": 0.06625766871165645,
|
|
"grad_norm": 31.062301252165657,
|
|
"learning_rate": 1.9760330578512395e-06,
|
|
"logits/chosen": 0.072265625,
|
|
"logits/rejected": -0.08935546875,
|
|
"logps/chosen": -338.0,
|
|
"logps/rejected": -274.0,
|
|
"loss": 0.2661,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 1.09375,
|
|
"rewards/margins": 5.25,
|
|
"rewards/rejected": -4.15625,
|
|
"step": 54
|
|
},
|
|
{
|
|
"epoch": 0.06748466257668712,
|
|
"grad_norm": 41.02704710465016,
|
|
"learning_rate": 1.975206611570248e-06,
|
|
"logits/chosen": -0.03955078125,
|
|
"logits/rejected": -0.1787109375,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -310.0,
|
|
"loss": 0.39,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 1.5859375,
|
|
"rewards/margins": 5.6875,
|
|
"rewards/rejected": -4.09375,
|
|
"step": 55
|
|
},
|
|
{
|
|
"epoch": 0.0687116564417178,
|
|
"grad_norm": 42.48463042177234,
|
|
"learning_rate": 1.9743801652892563e-06,
|
|
"logits/chosen": -0.0084228515625,
|
|
"logits/rejected": -0.1494140625,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.4254,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.7890625,
|
|
"rewards/margins": 5.46875,
|
|
"rewards/rejected": -3.6875,
|
|
"step": 56
|
|
},
|
|
{
|
|
"epoch": 0.06993865030674846,
|
|
"grad_norm": 50.90181875068464,
|
|
"learning_rate": 1.9735537190082645e-06,
|
|
"logits/chosen": -0.0169677734375,
|
|
"logits/rejected": -0.0625,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.5598,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 1.2109375,
|
|
"rewards/margins": 5.09375,
|
|
"rewards/rejected": -3.890625,
|
|
"step": 57
|
|
},
|
|
{
|
|
"epoch": 0.07116564417177915,
|
|
"grad_norm": 48.70480490400624,
|
|
"learning_rate": 1.9727272727272727e-06,
|
|
"logits/chosen": -0.018798828125,
|
|
"logits/rejected": -0.06396484375,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.4177,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.21875,
|
|
"rewards/margins": 5.5,
|
|
"rewards/rejected": -4.28125,
|
|
"step": 58
|
|
},
|
|
{
|
|
"epoch": 0.07239263803680981,
|
|
"grad_norm": 43.21817467009683,
|
|
"learning_rate": 1.971900826446281e-06,
|
|
"logits/chosen": 0.0537109375,
|
|
"logits/rejected": -0.0208740234375,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -312.0,
|
|
"loss": 0.4239,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.84375,
|
|
"rewards/margins": 4.8125,
|
|
"rewards/rejected": -3.96875,
|
|
"step": 59
|
|
},
|
|
{
|
|
"epoch": 0.0736196319018405,
|
|
"grad_norm": 42.04774661964234,
|
|
"learning_rate": 1.971074380165289e-06,
|
|
"logits/chosen": -0.025634765625,
|
|
"logits/rejected": -0.1435546875,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -304.0,
|
|
"loss": 0.4275,
|
|
"rewards/accuracies": 0.7578125,
|
|
"rewards/chosen": 0.37109375,
|
|
"rewards/margins": 4.6875,
|
|
"rewards/rejected": -4.3125,
|
|
"step": 60
|
|
},
|
|
{
|
|
"epoch": 0.07484662576687116,
|
|
"grad_norm": 41.91867978712621,
|
|
"learning_rate": 1.9702479338842972e-06,
|
|
"logits/chosen": -0.04736328125,
|
|
"logits/rejected": -0.1494140625,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.4056,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.2890625,
|
|
"rewards/margins": 6.3125,
|
|
"rewards/rejected": -5.03125,
|
|
"step": 61
|
|
},
|
|
{
|
|
"epoch": 0.07607361963190185,
|
|
"grad_norm": 38.74949615267823,
|
|
"learning_rate": 1.969421487603306e-06,
|
|
"logits/chosen": -0.0390625,
|
|
"logits/rejected": -0.212890625,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.3502,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.9296875,
|
|
"rewards/margins": 7.0,
|
|
"rewards/rejected": -5.0625,
|
|
"step": 62
|
|
},
|
|
{
|
|
"epoch": 0.07730061349693251,
|
|
"grad_norm": 41.67251680362869,
|
|
"learning_rate": 1.968595041322314e-06,
|
|
"logits/chosen": 0.05615234375,
|
|
"logits/rejected": -0.09423828125,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.3406,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 0.98828125,
|
|
"rewards/margins": 5.46875,
|
|
"rewards/rejected": -4.46875,
|
|
"step": 63
|
|
},
|
|
{
|
|
"epoch": 0.0785276073619632,
|
|
"grad_norm": 42.945343464423395,
|
|
"learning_rate": 1.9677685950413222e-06,
|
|
"logits/chosen": -0.11669921875,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.4147,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": 1.453125,
|
|
"rewards/margins": 6.09375,
|
|
"rewards/rejected": -4.65625,
|
|
"step": 64
|
|
},
|
|
{
|
|
"epoch": 0.07975460122699386,
|
|
"grad_norm": 34.50465343172243,
|
|
"learning_rate": 1.9669421487603304e-06,
|
|
"logits/chosen": -0.177734375,
|
|
"logits/rejected": -0.24609375,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.2968,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 1.7265625,
|
|
"rewards/margins": 6.21875,
|
|
"rewards/rejected": -4.46875,
|
|
"step": 65
|
|
},
|
|
{
|
|
"epoch": 0.08098159509202454,
|
|
"grad_norm": 31.866076526342532,
|
|
"learning_rate": 1.9661157024793386e-06,
|
|
"logits/chosen": -0.158203125,
|
|
"logits/rejected": -0.28125,
|
|
"logps/chosen": -318.0,
|
|
"logps/rejected": -280.0,
|
|
"loss": 0.2815,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 2.046875,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -4.8125,
|
|
"step": 66
|
|
},
|
|
{
|
|
"epoch": 0.08220858895705521,
|
|
"grad_norm": 42.91535130586503,
|
|
"learning_rate": 1.9652892561983468e-06,
|
|
"logits/chosen": -0.05908203125,
|
|
"logits/rejected": -0.1650390625,
|
|
"logps/chosen": -336.0,
|
|
"logps/rejected": -312.0,
|
|
"loss": 0.4407,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.890625,
|
|
"rewards/margins": 5.40625,
|
|
"rewards/rejected": -4.53125,
|
|
"step": 67
|
|
},
|
|
{
|
|
"epoch": 0.0834355828220859,
|
|
"grad_norm": 40.67843186478658,
|
|
"learning_rate": 1.9644628099173554e-06,
|
|
"logits/chosen": -0.1337890625,
|
|
"logits/rejected": -0.1806640625,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.4204,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 1.3203125,
|
|
"rewards/margins": 5.46875,
|
|
"rewards/rejected": -4.15625,
|
|
"step": 68
|
|
},
|
|
{
|
|
"epoch": 0.08466257668711656,
|
|
"grad_norm": 44.775633050997016,
|
|
"learning_rate": 1.9636363636363636e-06,
|
|
"logits/chosen": -0.2177734375,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -298.0,
|
|
"loss": 0.372,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 2.234375,
|
|
"rewards/margins": 6.5625,
|
|
"rewards/rejected": -4.3125,
|
|
"step": 69
|
|
},
|
|
{
|
|
"epoch": 0.08588957055214724,
|
|
"grad_norm": 43.44574420327807,
|
|
"learning_rate": 1.9628099173553718e-06,
|
|
"logits/chosen": -0.0751953125,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.4461,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 2.3125,
|
|
"rewards/margins": 6.03125,
|
|
"rewards/rejected": -3.71875,
|
|
"step": 70
|
|
},
|
|
{
|
|
"epoch": 0.08711656441717791,
|
|
"grad_norm": 38.65676390509551,
|
|
"learning_rate": 1.96198347107438e-06,
|
|
"logits/chosen": -0.016357421875,
|
|
"logits/rejected": -0.0791015625,
|
|
"logps/chosen": -346.0,
|
|
"logps/rejected": -292.0,
|
|
"loss": 0.4024,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.2578125,
|
|
"rewards/margins": 5.0,
|
|
"rewards/rejected": -3.75,
|
|
"step": 71
|
|
},
|
|
{
|
|
"epoch": 0.08834355828220859,
|
|
"grad_norm": 42.94632026754794,
|
|
"learning_rate": 1.9611570247933886e-06,
|
|
"logits/chosen": -0.1884765625,
|
|
"logits/rejected": -0.318359375,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.422,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 1.8359375,
|
|
"rewards/margins": 5.46875,
|
|
"rewards/rejected": -3.640625,
|
|
"step": 72
|
|
},
|
|
{
|
|
"epoch": 0.08957055214723926,
|
|
"grad_norm": 43.90915615206006,
|
|
"learning_rate": 1.9603305785123968e-06,
|
|
"logits/chosen": -0.12890625,
|
|
"logits/rejected": -0.197265625,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -316.0,
|
|
"loss": 0.4327,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 1.1953125,
|
|
"rewards/margins": 5.625,
|
|
"rewards/rejected": -4.4375,
|
|
"step": 73
|
|
},
|
|
{
|
|
"epoch": 0.09079754601226994,
|
|
"grad_norm": 37.0933378070661,
|
|
"learning_rate": 1.959504132231405e-06,
|
|
"logits/chosen": -0.123046875,
|
|
"logits/rejected": -0.1826171875,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.3207,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 0.94140625,
|
|
"rewards/margins": 5.3125,
|
|
"rewards/rejected": -4.375,
|
|
"step": 74
|
|
},
|
|
{
|
|
"epoch": 0.09202453987730061,
|
|
"grad_norm": 39.8586944756322,
|
|
"learning_rate": 1.958677685950413e-06,
|
|
"logits/chosen": -0.08447265625,
|
|
"logits/rejected": -0.232421875,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.3787,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 1.765625,
|
|
"rewards/margins": 6.15625,
|
|
"rewards/rejected": -4.40625,
|
|
"step": 75
|
|
},
|
|
{
|
|
"epoch": 0.09325153374233129,
|
|
"grad_norm": 39.578705781971905,
|
|
"learning_rate": 1.9578512396694213e-06,
|
|
"logits/chosen": -0.08349609375,
|
|
"logits/rejected": -0.248046875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -302.0,
|
|
"loss": 0.3605,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 1.7265625,
|
|
"rewards/margins": 5.78125,
|
|
"rewards/rejected": -4.0625,
|
|
"step": 76
|
|
},
|
|
{
|
|
"epoch": 0.09447852760736196,
|
|
"grad_norm": 42.38064361943649,
|
|
"learning_rate": 1.9570247933884295e-06,
|
|
"logits/chosen": -0.10693359375,
|
|
"logits/rejected": -0.2333984375,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -314.0,
|
|
"loss": 0.4385,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 0.69140625,
|
|
"rewards/margins": 5.34375,
|
|
"rewards/rejected": -4.65625,
|
|
"step": 77
|
|
},
|
|
{
|
|
"epoch": 0.09570552147239264,
|
|
"grad_norm": 37.90382847921675,
|
|
"learning_rate": 1.956198347107438e-06,
|
|
"logits/chosen": -0.062255859375,
|
|
"logits/rejected": -0.208984375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.3815,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.375,
|
|
"rewards/margins": 5.96875,
|
|
"rewards/rejected": -4.5625,
|
|
"step": 78
|
|
},
|
|
{
|
|
"epoch": 0.09693251533742331,
|
|
"grad_norm": 44.65830730901311,
|
|
"learning_rate": 1.9553719008264463e-06,
|
|
"logits/chosen": -0.04931640625,
|
|
"logits/rejected": -0.1806640625,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -308.0,
|
|
"loss": 0.4445,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": 0.546875,
|
|
"rewards/margins": 5.4375,
|
|
"rewards/rejected": -4.90625,
|
|
"step": 79
|
|
},
|
|
{
|
|
"epoch": 0.09815950920245399,
|
|
"grad_norm": 38.74942042723456,
|
|
"learning_rate": 1.9545454545454545e-06,
|
|
"logits/chosen": -0.1171875,
|
|
"logits/rejected": -0.310546875,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.3839,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 1.8203125,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -5.34375,
|
|
"step": 80
|
|
},
|
|
{
|
|
"epoch": 0.09938650306748466,
|
|
"grad_norm": 32.27256865143061,
|
|
"learning_rate": 1.9537190082644627e-06,
|
|
"logits/chosen": -0.1865234375,
|
|
"logits/rejected": -0.33984375,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.3105,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.2734375,
|
|
"rewards/margins": 6.71875,
|
|
"rewards/rejected": -5.4375,
|
|
"step": 81
|
|
},
|
|
{
|
|
"epoch": 0.10061349693251534,
|
|
"grad_norm": 45.536447420591436,
|
|
"learning_rate": 1.952892561983471e-06,
|
|
"logits/chosen": -0.08642578125,
|
|
"logits/rejected": -0.19921875,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.4527,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 0.30859375,
|
|
"rewards/margins": 5.8125,
|
|
"rewards/rejected": -5.5,
|
|
"step": 82
|
|
},
|
|
{
|
|
"epoch": 0.10184049079754601,
|
|
"grad_norm": 70.89237547890794,
|
|
"learning_rate": 1.952066115702479e-06,
|
|
"logits/chosen": -0.07568359375,
|
|
"logits/rejected": -0.21875,
|
|
"logps/chosen": -360.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.4202,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.283203125,
|
|
"rewards/margins": 5.625,
|
|
"rewards/rejected": -5.34375,
|
|
"step": 83
|
|
},
|
|
{
|
|
"epoch": 0.10306748466257669,
|
|
"grad_norm": 49.05569998583272,
|
|
"learning_rate": 1.9512396694214873e-06,
|
|
"logits/chosen": -0.060791015625,
|
|
"logits/rejected": -0.28515625,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.3037,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 0.76953125,
|
|
"rewards/margins": 6.5,
|
|
"rewards/rejected": -5.71875,
|
|
"step": 84
|
|
},
|
|
{
|
|
"epoch": 0.10429447852760736,
|
|
"grad_norm": 36.291246022142694,
|
|
"learning_rate": 1.950413223140496e-06,
|
|
"logits/chosen": -0.173828125,
|
|
"logits/rejected": -0.31640625,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.3024,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 0.10107421875,
|
|
"rewards/margins": 6.0,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 85
|
|
},
|
|
{
|
|
"epoch": 0.10552147239263804,
|
|
"grad_norm": 40.9699360174541,
|
|
"learning_rate": 1.949586776859504e-06,
|
|
"logits/chosen": -0.09228515625,
|
|
"logits/rejected": -0.193359375,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -322.0,
|
|
"loss": 0.4352,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 0.73046875,
|
|
"rewards/margins": 5.90625,
|
|
"rewards/rejected": -5.15625,
|
|
"step": 86
|
|
},
|
|
{
|
|
"epoch": 0.1067484662576687,
|
|
"grad_norm": 33.3955251072495,
|
|
"learning_rate": 1.9487603305785122e-06,
|
|
"logits/chosen": -0.1494140625,
|
|
"logits/rejected": -0.28125,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -282.0,
|
|
"loss": 0.3522,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.16796875,
|
|
"rewards/margins": 5.65625,
|
|
"rewards/rejected": -5.8125,
|
|
"step": 87
|
|
},
|
|
{
|
|
"epoch": 0.10797546012269939,
|
|
"grad_norm": 34.50414562639353,
|
|
"learning_rate": 1.9479338842975204e-06,
|
|
"logits/chosen": -0.11669921875,
|
|
"logits/rejected": -0.27734375,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -296.0,
|
|
"loss": 0.3259,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 0.30859375,
|
|
"rewards/margins": 5.78125,
|
|
"rewards/rejected": -5.46875,
|
|
"step": 88
|
|
},
|
|
{
|
|
"epoch": 0.10920245398773006,
|
|
"grad_norm": 41.0799182962333,
|
|
"learning_rate": 1.947107438016529e-06,
|
|
"logits/chosen": -0.1474609375,
|
|
"logits/rejected": -0.2470703125,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.4595,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 0.546875,
|
|
"rewards/margins": 5.8125,
|
|
"rewards/rejected": -5.25,
|
|
"step": 89
|
|
},
|
|
{
|
|
"epoch": 0.11042944785276074,
|
|
"grad_norm": 33.253271252980205,
|
|
"learning_rate": 1.9462809917355372e-06,
|
|
"logits/chosen": -0.1826171875,
|
|
"logits/rejected": -0.353515625,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.3655,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 0.2109375,
|
|
"rewards/margins": 5.78125,
|
|
"rewards/rejected": -5.5625,
|
|
"step": 90
|
|
},
|
|
{
|
|
"epoch": 0.1116564417177914,
|
|
"grad_norm": 38.366812260947825,
|
|
"learning_rate": 1.9454545454545454e-06,
|
|
"logits/chosen": -0.000293731689453125,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.3605,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.72265625,
|
|
"rewards/margins": 6.0625,
|
|
"rewards/rejected": -5.34375,
|
|
"step": 91
|
|
},
|
|
{
|
|
"epoch": 0.11288343558282209,
|
|
"grad_norm": 37.025282629040696,
|
|
"learning_rate": 1.9446280991735536e-06,
|
|
"logits/chosen": -0.10693359375,
|
|
"logits/rejected": -0.212890625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.3471,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.65625,
|
|
"rewards/margins": 6.46875,
|
|
"rewards/rejected": -5.8125,
|
|
"step": 92
|
|
},
|
|
{
|
|
"epoch": 0.11411042944785275,
|
|
"grad_norm": 35.50534211413326,
|
|
"learning_rate": 1.943801652892562e-06,
|
|
"logits/chosen": -0.138671875,
|
|
"logits/rejected": -0.345703125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -322.0,
|
|
"loss": 0.3373,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 1.5,
|
|
"rewards/margins": 6.9375,
|
|
"rewards/rejected": -5.4375,
|
|
"step": 93
|
|
},
|
|
{
|
|
"epoch": 0.11533742331288344,
|
|
"grad_norm": 33.01350969605299,
|
|
"learning_rate": 1.94297520661157e-06,
|
|
"logits/chosen": -0.15234375,
|
|
"logits/rejected": -0.369140625,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.2847,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": 1.984375,
|
|
"rewards/margins": 7.5625,
|
|
"rewards/rejected": -5.5625,
|
|
"step": 94
|
|
},
|
|
{
|
|
"epoch": 0.1165644171779141,
|
|
"grad_norm": 31.862487845664326,
|
|
"learning_rate": 1.9421487603305786e-06,
|
|
"logits/chosen": -0.234375,
|
|
"logits/rejected": -0.376953125,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.3067,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.421875,
|
|
"rewards/margins": 7.15625,
|
|
"rewards/rejected": -5.75,
|
|
"step": 95
|
|
},
|
|
{
|
|
"epoch": 0.11779141104294479,
|
|
"grad_norm": 34.73601056959897,
|
|
"learning_rate": 1.941322314049587e-06,
|
|
"logits/chosen": -0.232421875,
|
|
"logits/rejected": -0.388671875,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.3118,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.9453125,
|
|
"rewards/margins": 7.5625,
|
|
"rewards/rejected": -5.625,
|
|
"step": 96
|
|
},
|
|
{
|
|
"epoch": 0.11901840490797547,
|
|
"grad_norm": 45.83847615237391,
|
|
"learning_rate": 1.940495867768595e-06,
|
|
"logits/chosen": -0.2275390625,
|
|
"logits/rejected": -0.357421875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.5206,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.40625,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -5.125,
|
|
"step": 97
|
|
},
|
|
{
|
|
"epoch": 0.12024539877300613,
|
|
"grad_norm": 38.11201034490425,
|
|
"learning_rate": 1.939669421487603e-06,
|
|
"logits/chosen": -0.023193359375,
|
|
"logits/rejected": -0.21875,
|
|
"logps/chosen": -360.0,
|
|
"logps/rejected": -306.0,
|
|
"loss": 0.3372,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 1.3671875,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -5.1875,
|
|
"step": 98
|
|
},
|
|
{
|
|
"epoch": 0.12147239263803682,
|
|
"grad_norm": 35.709300650712045,
|
|
"learning_rate": 1.9388429752066114e-06,
|
|
"logits/chosen": -0.169921875,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -266.0,
|
|
"loss": 0.307,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 0.76953125,
|
|
"rewards/margins": 5.75,
|
|
"rewards/rejected": -4.96875,
|
|
"step": 99
|
|
},
|
|
{
|
|
"epoch": 0.12269938650306748,
|
|
"grad_norm": 31.163430631909584,
|
|
"learning_rate": 1.93801652892562e-06,
|
|
"logits/chosen": -0.205078125,
|
|
"logits/rejected": -0.384765625,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.3029,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.53125,
|
|
"rewards/margins": 6.71875,
|
|
"rewards/rejected": -5.1875,
|
|
"step": 100
|
|
},
|
|
{
|
|
"epoch": 0.12392638036809817,
|
|
"grad_norm": 43.35164194138606,
|
|
"learning_rate": 1.9371900826446277e-06,
|
|
"logits/chosen": -0.205078125,
|
|
"logits/rejected": -0.37890625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.4617,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 1.609375,
|
|
"rewards/margins": 6.40625,
|
|
"rewards/rejected": -4.8125,
|
|
"step": 101
|
|
},
|
|
{
|
|
"epoch": 0.12515337423312883,
|
|
"grad_norm": 38.300666714309216,
|
|
"learning_rate": 1.9363636363636363e-06,
|
|
"logits/chosen": -0.1611328125,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.3996,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 1.9140625,
|
|
"rewards/margins": 6.125,
|
|
"rewards/rejected": -4.1875,
|
|
"step": 102
|
|
},
|
|
{
|
|
"epoch": 0.1263803680981595,
|
|
"grad_norm": 35.64289970183451,
|
|
"learning_rate": 1.9355371900826445e-06,
|
|
"logits/chosen": -0.1455078125,
|
|
"logits/rejected": -0.291015625,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -310.0,
|
|
"loss": 0.3528,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 1.5,
|
|
"rewards/margins": 5.9375,
|
|
"rewards/rejected": -4.46875,
|
|
"step": 103
|
|
},
|
|
{
|
|
"epoch": 0.1276073619631902,
|
|
"grad_norm": 40.755279919146126,
|
|
"learning_rate": 1.9347107438016527e-06,
|
|
"logits/chosen": -0.0478515625,
|
|
"logits/rejected": -0.1748046875,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.3817,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 1.5859375,
|
|
"rewards/margins": 5.84375,
|
|
"rewards/rejected": -4.25,
|
|
"step": 104
|
|
},
|
|
{
|
|
"epoch": 0.12883435582822086,
|
|
"grad_norm": 33.12870235669601,
|
|
"learning_rate": 1.933884297520661e-06,
|
|
"logits/chosen": -0.14453125,
|
|
"logits/rejected": -0.34765625,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.3315,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 2.078125,
|
|
"rewards/margins": 6.75,
|
|
"rewards/rejected": -4.65625,
|
|
"step": 105
|
|
},
|
|
{
|
|
"epoch": 0.13006134969325153,
|
|
"grad_norm": 37.26299310783144,
|
|
"learning_rate": 1.9330578512396695e-06,
|
|
"logits/chosen": -0.11572265625,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -322.0,
|
|
"loss": 0.3901,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 1.8515625,
|
|
"rewards/margins": 6.15625,
|
|
"rewards/rejected": -4.3125,
|
|
"step": 106
|
|
},
|
|
{
|
|
"epoch": 0.1312883435582822,
|
|
"grad_norm": 32.692119431844716,
|
|
"learning_rate": 1.9322314049586777e-06,
|
|
"logits/chosen": -0.1435546875,
|
|
"logits/rejected": -0.2177734375,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -312.0,
|
|
"loss": 0.2869,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 1.546875,
|
|
"rewards/margins": 5.96875,
|
|
"rewards/rejected": -4.4375,
|
|
"step": 107
|
|
},
|
|
{
|
|
"epoch": 0.1325153374233129,
|
|
"grad_norm": 31.238198640139856,
|
|
"learning_rate": 1.931404958677686e-06,
|
|
"logits/chosen": -0.15625,
|
|
"logits/rejected": -0.36328125,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.2526,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": 1.625,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -5.25,
|
|
"step": 108
|
|
},
|
|
{
|
|
"epoch": 0.13374233128834356,
|
|
"grad_norm": 31.313807796476095,
|
|
"learning_rate": 1.930578512396694e-06,
|
|
"logits/chosen": -0.140625,
|
|
"logits/rejected": -0.30859375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.3696,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 2.984375,
|
|
"rewards/margins": 7.5,
|
|
"rewards/rejected": -4.5,
|
|
"step": 109
|
|
},
|
|
{
|
|
"epoch": 0.13496932515337423,
|
|
"grad_norm": 55.26135095805823,
|
|
"learning_rate": 1.9297520661157023e-06,
|
|
"logits/chosen": -0.123046875,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.4029,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 2.1875,
|
|
"rewards/margins": 6.8125,
|
|
"rewards/rejected": -4.65625,
|
|
"step": 110
|
|
},
|
|
{
|
|
"epoch": 0.1361963190184049,
|
|
"grad_norm": 30.918211789348547,
|
|
"learning_rate": 1.9289256198347105e-06,
|
|
"logits/chosen": -0.039794921875,
|
|
"logits/rejected": -0.1953125,
|
|
"logps/chosen": -332.0,
|
|
"logps/rejected": -286.0,
|
|
"loss": 0.3262,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 1.3828125,
|
|
"rewards/margins": 5.90625,
|
|
"rewards/rejected": -4.5,
|
|
"step": 111
|
|
},
|
|
{
|
|
"epoch": 0.1374233128834356,
|
|
"grad_norm": 33.146957985170864,
|
|
"learning_rate": 1.928099173553719e-06,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.2412109375,
|
|
"logps/chosen": -346.0,
|
|
"logps/rejected": -298.0,
|
|
"loss": 0.3843,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.99609375,
|
|
"rewards/margins": 6.125,
|
|
"rewards/rejected": -5.125,
|
|
"step": 112
|
|
},
|
|
{
|
|
"epoch": 0.13865030674846626,
|
|
"grad_norm": 35.941768464246515,
|
|
"learning_rate": 1.9272727272727273e-06,
|
|
"logits/chosen": -0.029541015625,
|
|
"logits/rejected": -0.107421875,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.4812,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 1.3125,
|
|
"rewards/margins": 5.96875,
|
|
"rewards/rejected": -4.65625,
|
|
"step": 113
|
|
},
|
|
{
|
|
"epoch": 0.13987730061349693,
|
|
"grad_norm": 35.678880117573186,
|
|
"learning_rate": 1.9264462809917355e-06,
|
|
"logits/chosen": -0.06982421875,
|
|
"logits/rejected": -0.21875,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.4366,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": 0.7578125,
|
|
"rewards/margins": 5.59375,
|
|
"rewards/rejected": -4.84375,
|
|
"step": 114
|
|
},
|
|
{
|
|
"epoch": 0.1411042944785276,
|
|
"grad_norm": 42.97654524727648,
|
|
"learning_rate": 1.9256198347107436e-06,
|
|
"logits/chosen": -0.078125,
|
|
"logits/rejected": -0.193359375,
|
|
"logps/chosen": -348.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.5519,
|
|
"rewards/accuracies": 0.7265625,
|
|
"rewards/chosen": 0.126953125,
|
|
"rewards/margins": 4.875,
|
|
"rewards/rejected": -4.75,
|
|
"step": 115
|
|
},
|
|
{
|
|
"epoch": 0.1423312883435583,
|
|
"grad_norm": 32.044910051093204,
|
|
"learning_rate": 1.924793388429752e-06,
|
|
"logits/chosen": -0.1396484375,
|
|
"logits/rejected": -0.357421875,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.3344,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 1.609375,
|
|
"rewards/margins": 6.25,
|
|
"rewards/rejected": -4.65625,
|
|
"step": 116
|
|
},
|
|
{
|
|
"epoch": 0.14355828220858896,
|
|
"grad_norm": 36.79751505676989,
|
|
"learning_rate": 1.9239669421487604e-06,
|
|
"logits/chosen": -0.0810546875,
|
|
"logits/rejected": -0.216796875,
|
|
"logps/chosen": -332.0,
|
|
"logps/rejected": -280.0,
|
|
"loss": 0.4879,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 0.578125,
|
|
"rewards/margins": 5.78125,
|
|
"rewards/rejected": -5.1875,
|
|
"step": 117
|
|
},
|
|
{
|
|
"epoch": 0.14478527607361963,
|
|
"grad_norm": 39.861211046062785,
|
|
"learning_rate": 1.9231404958677686e-06,
|
|
"logits/chosen": -0.10693359375,
|
|
"logits/rejected": -0.2451171875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.441,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 1.515625,
|
|
"rewards/margins": 6.40625,
|
|
"rewards/rejected": -4.875,
|
|
"step": 118
|
|
},
|
|
{
|
|
"epoch": 0.1460122699386503,
|
|
"grad_norm": 31.059311442315625,
|
|
"learning_rate": 1.922314049586777e-06,
|
|
"logits/chosen": -0.17578125,
|
|
"logits/rejected": -0.2578125,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.3019,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 1.078125,
|
|
"rewards/margins": 6.03125,
|
|
"rewards/rejected": -4.9375,
|
|
"step": 119
|
|
},
|
|
{
|
|
"epoch": 0.147239263803681,
|
|
"grad_norm": 36.71684766907722,
|
|
"learning_rate": 1.921487603305785e-06,
|
|
"logits/chosen": -0.158203125,
|
|
"logits/rejected": -0.330078125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.4122,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 2.1875,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -4.875,
|
|
"step": 120
|
|
},
|
|
{
|
|
"epoch": 0.14846625766871166,
|
|
"grad_norm": 31.580600140009683,
|
|
"learning_rate": 1.920661157024793e-06,
|
|
"logits/chosen": -0.0751953125,
|
|
"logits/rejected": -0.2265625,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.318,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 2.234375,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -4.78125,
|
|
"step": 121
|
|
},
|
|
{
|
|
"epoch": 0.14969325153374233,
|
|
"grad_norm": 38.07479588174048,
|
|
"learning_rate": 1.9198347107438014e-06,
|
|
"logits/chosen": -0.08642578125,
|
|
"logits/rejected": -0.2333984375,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -300.0,
|
|
"loss": 0.4213,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 1.5234375,
|
|
"rewards/margins": 5.78125,
|
|
"rewards/rejected": -4.25,
|
|
"step": 122
|
|
},
|
|
{
|
|
"epoch": 0.150920245398773,
|
|
"grad_norm": 38.70926544812021,
|
|
"learning_rate": 1.91900826446281e-06,
|
|
"logits/chosen": 0.037109375,
|
|
"logits/rejected": -0.134765625,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -292.0,
|
|
"loss": 0.4465,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.1015625,
|
|
"rewards/margins": 5.625,
|
|
"rewards/rejected": -4.53125,
|
|
"step": 123
|
|
},
|
|
{
|
|
"epoch": 0.1521472392638037,
|
|
"grad_norm": 30.104729040601388,
|
|
"learning_rate": 1.918181818181818e-06,
|
|
"logits/chosen": -0.1513671875,
|
|
"logits/rejected": -0.2080078125,
|
|
"logps/chosen": -348.0,
|
|
"logps/rejected": -294.0,
|
|
"loss": 0.2893,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 2.25,
|
|
"rewards/margins": 7.0,
|
|
"rewards/rejected": -4.75,
|
|
"step": 124
|
|
},
|
|
{
|
|
"epoch": 0.15337423312883436,
|
|
"grad_norm": 33.272882764937705,
|
|
"learning_rate": 1.9173553719008264e-06,
|
|
"logits/chosen": -0.2216796875,
|
|
"logits/rejected": -0.392578125,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.3599,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 1.9453125,
|
|
"rewards/margins": 6.65625,
|
|
"rewards/rejected": -4.71875,
|
|
"step": 125
|
|
},
|
|
{
|
|
"epoch": 0.15460122699386503,
|
|
"grad_norm": 42.7456801600713,
|
|
"learning_rate": 1.9165289256198346e-06,
|
|
"logits/chosen": -0.0673828125,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.4402,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 0.95703125,
|
|
"rewards/margins": 5.8125,
|
|
"rewards/rejected": -4.84375,
|
|
"step": 126
|
|
},
|
|
{
|
|
"epoch": 0.1558282208588957,
|
|
"grad_norm": 38.3840180629571,
|
|
"learning_rate": 1.915702479338843e-06,
|
|
"logits/chosen": -0.0267333984375,
|
|
"logits/rejected": -0.2021484375,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.4874,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 1.796875,
|
|
"rewards/margins": 6.25,
|
|
"rewards/rejected": -4.4375,
|
|
"step": 127
|
|
},
|
|
{
|
|
"epoch": 0.1570552147239264,
|
|
"grad_norm": 41.71305992138482,
|
|
"learning_rate": 1.914876033057851e-06,
|
|
"logits/chosen": -0.06494140625,
|
|
"logits/rejected": -0.2451171875,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.4317,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.6640625,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -4.875,
|
|
"step": 128
|
|
},
|
|
{
|
|
"epoch": 0.15828220858895706,
|
|
"grad_norm": 30.46951522169217,
|
|
"learning_rate": 1.9140495867768595e-06,
|
|
"logits/chosen": 0.038818359375,
|
|
"logits/rejected": -0.08203125,
|
|
"logps/chosen": -340.0,
|
|
"logps/rejected": -300.0,
|
|
"loss": 0.3383,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.890625,
|
|
"rewards/margins": 5.5,
|
|
"rewards/rejected": -4.625,
|
|
"step": 129
|
|
},
|
|
{
|
|
"epoch": 0.15950920245398773,
|
|
"grad_norm": 39.03675957302347,
|
|
"learning_rate": 1.9132231404958677e-06,
|
|
"logits/chosen": -0.08154296875,
|
|
"logits/rejected": -0.2138671875,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -322.0,
|
|
"loss": 0.431,
|
|
"rewards/accuracies": 0.7421875,
|
|
"rewards/chosen": 0.9453125,
|
|
"rewards/margins": 5.96875,
|
|
"rewards/rejected": -5.03125,
|
|
"step": 130
|
|
},
|
|
{
|
|
"epoch": 0.1607361963190184,
|
|
"grad_norm": 34.53910295433846,
|
|
"learning_rate": 1.912396694214876e-06,
|
|
"logits/chosen": -0.19921875,
|
|
"logits/rejected": -0.330078125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.3021,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": 1.6171875,
|
|
"rewards/margins": 6.84375,
|
|
"rewards/rejected": -5.21875,
|
|
"step": 131
|
|
},
|
|
{
|
|
"epoch": 0.1619631901840491,
|
|
"grad_norm": 39.326983546154786,
|
|
"learning_rate": 1.911570247933884e-06,
|
|
"logits/chosen": -0.154296875,
|
|
"logits/rejected": -0.330078125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.4658,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 1.453125,
|
|
"rewards/margins": 6.09375,
|
|
"rewards/rejected": -4.625,
|
|
"step": 132
|
|
},
|
|
{
|
|
"epoch": 0.16319018404907976,
|
|
"grad_norm": 36.903545902575146,
|
|
"learning_rate": 1.9107438016528923e-06,
|
|
"logits/chosen": -0.197265625,
|
|
"logits/rejected": -0.345703125,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.3493,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 1.1875,
|
|
"rewards/margins": 6.25,
|
|
"rewards/rejected": -5.0625,
|
|
"step": 133
|
|
},
|
|
{
|
|
"epoch": 0.16441717791411042,
|
|
"grad_norm": 50.21305412716651,
|
|
"learning_rate": 1.909917355371901e-06,
|
|
"logits/chosen": -0.10986328125,
|
|
"logits/rejected": -0.31640625,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.4597,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.87109375,
|
|
"rewards/margins": 5.3125,
|
|
"rewards/rejected": -4.4375,
|
|
"step": 134
|
|
},
|
|
{
|
|
"epoch": 0.1656441717791411,
|
|
"grad_norm": 40.08910479710188,
|
|
"learning_rate": 1.909090909090909e-06,
|
|
"logits/chosen": 0.0223388671875,
|
|
"logits/rejected": -0.07958984375,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.4875,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.40625,
|
|
"rewards/margins": 5.25,
|
|
"rewards/rejected": -4.84375,
|
|
"step": 135
|
|
},
|
|
{
|
|
"epoch": 0.1668711656441718,
|
|
"grad_norm": 33.25948422978582,
|
|
"learning_rate": 1.9082644628099173e-06,
|
|
"logits/chosen": -0.23828125,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.341,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.90625,
|
|
"rewards/margins": 6.1875,
|
|
"rewards/rejected": -5.28125,
|
|
"step": 136
|
|
},
|
|
{
|
|
"epoch": 0.16809815950920245,
|
|
"grad_norm": 41.732736479742044,
|
|
"learning_rate": 1.9074380165289255e-06,
|
|
"logits/chosen": 0.01385498046875,
|
|
"logits/rejected": -0.1279296875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.4942,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 0.50390625,
|
|
"rewards/margins": 5.15625,
|
|
"rewards/rejected": -4.625,
|
|
"step": 137
|
|
},
|
|
{
|
|
"epoch": 0.16932515337423312,
|
|
"grad_norm": 40.733053910497496,
|
|
"learning_rate": 1.9066115702479337e-06,
|
|
"logits/chosen": -0.08056640625,
|
|
"logits/rejected": -0.2158203125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.4638,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 0.62890625,
|
|
"rewards/margins": 5.53125,
|
|
"rewards/rejected": -4.875,
|
|
"step": 138
|
|
},
|
|
{
|
|
"epoch": 0.1705521472392638,
|
|
"grad_norm": 41.75429610561302,
|
|
"learning_rate": 1.905785123966942e-06,
|
|
"logits/chosen": -0.08544921875,
|
|
"logits/rejected": -0.2451171875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.4655,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.1875,
|
|
"rewards/margins": 6.6875,
|
|
"rewards/rejected": -5.5,
|
|
"step": 139
|
|
},
|
|
{
|
|
"epoch": 0.17177914110429449,
|
|
"grad_norm": 41.411470035597695,
|
|
"learning_rate": 1.9049586776859503e-06,
|
|
"logits/chosen": -0.0478515625,
|
|
"logits/rejected": -0.2255859375,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.4414,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.765625,
|
|
"rewards/margins": 6.25,
|
|
"rewards/rejected": -5.46875,
|
|
"step": 140
|
|
},
|
|
{
|
|
"epoch": 0.17300613496932515,
|
|
"grad_norm": 32.754374609189824,
|
|
"learning_rate": 1.9041322314049587e-06,
|
|
"logits/chosen": -0.030029296875,
|
|
"logits/rejected": -0.1513671875,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.3183,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 0.65625,
|
|
"rewards/margins": 6.5,
|
|
"rewards/rejected": -5.84375,
|
|
"step": 141
|
|
},
|
|
{
|
|
"epoch": 0.17423312883435582,
|
|
"grad_norm": 40.07898004444572,
|
|
"learning_rate": 1.9033057851239668e-06,
|
|
"logits/chosen": -0.06884765625,
|
|
"logits/rejected": -0.24609375,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.4872,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 0.671875,
|
|
"rewards/margins": 6.375,
|
|
"rewards/rejected": -5.71875,
|
|
"step": 142
|
|
},
|
|
{
|
|
"epoch": 0.1754601226993865,
|
|
"grad_norm": 40.28203339750631,
|
|
"learning_rate": 1.9024793388429752e-06,
|
|
"logits/chosen": -0.1083984375,
|
|
"logits/rejected": -0.322265625,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.4004,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.3203125,
|
|
"rewards/margins": 6.40625,
|
|
"rewards/rejected": -6.09375,
|
|
"step": 143
|
|
},
|
|
{
|
|
"epoch": 0.17668711656441718,
|
|
"grad_norm": 35.751934493011035,
|
|
"learning_rate": 1.9016528925619834e-06,
|
|
"logits/chosen": -0.212890625,
|
|
"logits/rejected": -0.380859375,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.4017,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 1.109375,
|
|
"rewards/margins": 6.84375,
|
|
"rewards/rejected": -5.75,
|
|
"step": 144
|
|
},
|
|
{
|
|
"epoch": 0.17791411042944785,
|
|
"grad_norm": 35.307761901556404,
|
|
"learning_rate": 1.9008264462809918e-06,
|
|
"logits/chosen": -0.1904296875,
|
|
"logits/rejected": -0.330078125,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.2959,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 0.8984375,
|
|
"rewards/margins": 6.9375,
|
|
"rewards/rejected": -6.0625,
|
|
"step": 145
|
|
},
|
|
{
|
|
"epoch": 0.17914110429447852,
|
|
"grad_norm": 29.518646600128047,
|
|
"learning_rate": 1.8999999999999998e-06,
|
|
"logits/chosen": -0.1904296875,
|
|
"logits/rejected": -0.291015625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.2849,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.06591796875,
|
|
"rewards/margins": 6.09375,
|
|
"rewards/rejected": -6.15625,
|
|
"step": 146
|
|
},
|
|
{
|
|
"epoch": 0.18036809815950922,
|
|
"grad_norm": 34.48271141529981,
|
|
"learning_rate": 1.8991735537190082e-06,
|
|
"logits/chosen": -0.18359375,
|
|
"logits/rejected": -0.33203125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.3822,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.859375,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -6.21875,
|
|
"step": 147
|
|
},
|
|
{
|
|
"epoch": 0.18159509202453988,
|
|
"grad_norm": 49.115362801311825,
|
|
"learning_rate": 1.8983471074380164e-06,
|
|
"logits/chosen": -0.2001953125,
|
|
"logits/rejected": -0.328125,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.4881,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 0.1494140625,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -6.375,
|
|
"step": 148
|
|
},
|
|
{
|
|
"epoch": 0.18282208588957055,
|
|
"grad_norm": 38.86108802614245,
|
|
"learning_rate": 1.8975206611570248e-06,
|
|
"logits/chosen": -0.07177734375,
|
|
"logits/rejected": -0.2197265625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.2952,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 0.83203125,
|
|
"rewards/margins": 6.84375,
|
|
"rewards/rejected": -6.0,
|
|
"step": 149
|
|
},
|
|
{
|
|
"epoch": 0.18404907975460122,
|
|
"grad_norm": 38.51930492178913,
|
|
"learning_rate": 1.896694214876033e-06,
|
|
"logits/chosen": -0.08447265625,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.412,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 0.44921875,
|
|
"rewards/margins": 6.0,
|
|
"rewards/rejected": -5.5625,
|
|
"step": 150
|
|
},
|
|
{
|
|
"epoch": 0.18527607361963191,
|
|
"grad_norm": 32.190177217257066,
|
|
"learning_rate": 1.8958677685950412e-06,
|
|
"logits/chosen": -0.10498046875,
|
|
"logits/rejected": -0.2294921875,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.348,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 0.5625,
|
|
"rewards/margins": 6.0,
|
|
"rewards/rejected": -5.4375,
|
|
"step": 151
|
|
},
|
|
{
|
|
"epoch": 0.18650306748466258,
|
|
"grad_norm": 33.69803480693185,
|
|
"learning_rate": 1.8950413223140496e-06,
|
|
"logits/chosen": -0.1923828125,
|
|
"logits/rejected": -0.43359375,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.3364,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": 0.55078125,
|
|
"rewards/margins": 6.75,
|
|
"rewards/rejected": -6.1875,
|
|
"step": 152
|
|
},
|
|
{
|
|
"epoch": 0.18773006134969325,
|
|
"grad_norm": 32.06678113416197,
|
|
"learning_rate": 1.8942148760330578e-06,
|
|
"logits/chosen": -0.138671875,
|
|
"logits/rejected": -0.24609375,
|
|
"logps/chosen": -352.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.3374,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 1.0625,
|
|
"rewards/margins": 6.625,
|
|
"rewards/rejected": -5.5625,
|
|
"step": 153
|
|
},
|
|
{
|
|
"epoch": 0.18895705521472392,
|
|
"grad_norm": 40.996857221624495,
|
|
"learning_rate": 1.8933884297520662e-06,
|
|
"logits/chosen": -0.01409912109375,
|
|
"logits/rejected": -0.1904296875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.4112,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 1.453125,
|
|
"rewards/margins": 6.5,
|
|
"rewards/rejected": -5.03125,
|
|
"step": 154
|
|
},
|
|
{
|
|
"epoch": 0.1901840490797546,
|
|
"grad_norm": 24.729104560024417,
|
|
"learning_rate": 1.8925619834710741e-06,
|
|
"logits/chosen": -0.1318359375,
|
|
"logits/rejected": -0.37890625,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.2101,
|
|
"rewards/accuracies": 0.921875,
|
|
"rewards/chosen": 2.3125,
|
|
"rewards/margins": 7.8125,
|
|
"rewards/rejected": -5.5,
|
|
"step": 155
|
|
},
|
|
{
|
|
"epoch": 0.19141104294478528,
|
|
"grad_norm": 40.24404266274937,
|
|
"learning_rate": 1.8917355371900825e-06,
|
|
"logits/chosen": -0.00141143798828125,
|
|
"logits/rejected": -0.10498046875,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.4515,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.7734375,
|
|
"rewards/margins": 6.03125,
|
|
"rewards/rejected": -5.25,
|
|
"step": 156
|
|
},
|
|
{
|
|
"epoch": 0.19263803680981595,
|
|
"grad_norm": 34.404145229474516,
|
|
"learning_rate": 1.8909090909090907e-06,
|
|
"logits/chosen": 0.002410888671875,
|
|
"logits/rejected": -0.111328125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -314.0,
|
|
"loss": 0.353,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 1.25,
|
|
"rewards/margins": 6.40625,
|
|
"rewards/rejected": -5.15625,
|
|
"step": 157
|
|
},
|
|
{
|
|
"epoch": 0.19386503067484662,
|
|
"grad_norm": 26.84815928052319,
|
|
"learning_rate": 1.8900826446280991e-06,
|
|
"logits/chosen": -0.2373046875,
|
|
"logits/rejected": -0.40625,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.2445,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 1.2421875,
|
|
"rewards/margins": 7.0,
|
|
"rewards/rejected": -5.75,
|
|
"step": 158
|
|
},
|
|
{
|
|
"epoch": 0.1950920245398773,
|
|
"grad_norm": 37.97373380612299,
|
|
"learning_rate": 1.8892561983471073e-06,
|
|
"logits/chosen": -0.10986328125,
|
|
"logits/rejected": -0.2265625,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.4114,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 1.109375,
|
|
"rewards/margins": 5.84375,
|
|
"rewards/rejected": -4.71875,
|
|
"step": 159
|
|
},
|
|
{
|
|
"epoch": 0.19631901840490798,
|
|
"grad_norm": 27.482546285866437,
|
|
"learning_rate": 1.8884297520661157e-06,
|
|
"logits/chosen": 0.0027923583984375,
|
|
"logits/rejected": -0.2216796875,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -316.0,
|
|
"loss": 0.2806,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": 0.76171875,
|
|
"rewards/margins": 6.625,
|
|
"rewards/rejected": -5.875,
|
|
"step": 160
|
|
},
|
|
{
|
|
"epoch": 0.19754601226993865,
|
|
"grad_norm": 30.442059402847082,
|
|
"learning_rate": 1.887603305785124e-06,
|
|
"logits/chosen": -0.1796875,
|
|
"logits/rejected": -0.37890625,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -304.0,
|
|
"loss": 0.3275,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 1.84375,
|
|
"rewards/margins": 6.90625,
|
|
"rewards/rejected": -5.0625,
|
|
"step": 161
|
|
},
|
|
{
|
|
"epoch": 0.19877300613496932,
|
|
"grad_norm": 38.550031984431975,
|
|
"learning_rate": 1.8867768595041323e-06,
|
|
"logits/chosen": -0.08056640625,
|
|
"logits/rejected": -0.138671875,
|
|
"logps/chosen": -354.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.4289,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": 1.0703125,
|
|
"rewards/margins": 5.8125,
|
|
"rewards/rejected": -4.75,
|
|
"step": 162
|
|
},
|
|
{
|
|
"epoch": 0.2,
|
|
"grad_norm": 33.61198599967516,
|
|
"learning_rate": 1.8859504132231403e-06,
|
|
"logits/chosen": -0.0069580078125,
|
|
"logits/rejected": -0.15625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.3118,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 1.21875,
|
|
"rewards/margins": 6.4375,
|
|
"rewards/rejected": -5.21875,
|
|
"step": 163
|
|
},
|
|
{
|
|
"epoch": 0.20122699386503068,
|
|
"grad_norm": 27.270676204046016,
|
|
"learning_rate": 1.8851239669421487e-06,
|
|
"logits/chosen": -0.185546875,
|
|
"logits/rejected": -0.4140625,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -308.0,
|
|
"loss": 0.3204,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 2.296875,
|
|
"rewards/margins": 7.4375,
|
|
"rewards/rejected": -5.125,
|
|
"step": 164
|
|
},
|
|
{
|
|
"epoch": 0.20245398773006135,
|
|
"grad_norm": 41.330075772434604,
|
|
"learning_rate": 1.8842975206611569e-06,
|
|
"logits/chosen": 0.043701171875,
|
|
"logits/rejected": -0.142578125,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.476,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 1.3984375,
|
|
"rewards/margins": 6.09375,
|
|
"rewards/rejected": -4.6875,
|
|
"step": 165
|
|
},
|
|
{
|
|
"epoch": 0.20368098159509201,
|
|
"grad_norm": 35.202023456383465,
|
|
"learning_rate": 1.8834710743801653e-06,
|
|
"logits/chosen": -0.039306640625,
|
|
"logits/rejected": -0.25,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.4262,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 1.75,
|
|
"rewards/margins": 6.40625,
|
|
"rewards/rejected": -4.65625,
|
|
"step": 166
|
|
},
|
|
{
|
|
"epoch": 0.2049079754601227,
|
|
"grad_norm": 39.52153640463411,
|
|
"learning_rate": 1.8826446280991735e-06,
|
|
"logits/chosen": 0.0042724609375,
|
|
"logits/rejected": -0.126953125,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -316.0,
|
|
"loss": 0.4278,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 1.921875,
|
|
"rewards/margins": 6.5,
|
|
"rewards/rejected": -4.59375,
|
|
"step": 167
|
|
},
|
|
{
|
|
"epoch": 0.20613496932515338,
|
|
"grad_norm": 35.134649088519375,
|
|
"learning_rate": 1.8818181818181816e-06,
|
|
"logits/chosen": 0.0218505859375,
|
|
"logits/rejected": -0.06640625,
|
|
"logps/chosen": -348.0,
|
|
"logps/rejected": -290.0,
|
|
"loss": 0.351,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 1.0078125,
|
|
"rewards/margins": 6.3125,
|
|
"rewards/rejected": -5.3125,
|
|
"step": 168
|
|
},
|
|
{
|
|
"epoch": 0.20736196319018405,
|
|
"grad_norm": 32.449216562532385,
|
|
"learning_rate": 1.88099173553719e-06,
|
|
"logits/chosen": -0.0625,
|
|
"logits/rejected": -0.2041015625,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.3181,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 1.1171875,
|
|
"rewards/margins": 5.875,
|
|
"rewards/rejected": -4.75,
|
|
"step": 169
|
|
},
|
|
{
|
|
"epoch": 0.2085889570552147,
|
|
"grad_norm": 33.40022661196834,
|
|
"learning_rate": 1.8801652892561982e-06,
|
|
"logits/chosen": -0.054931640625,
|
|
"logits/rejected": -0.29296875,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.3402,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 1.9921875,
|
|
"rewards/margins": 7.21875,
|
|
"rewards/rejected": -5.21875,
|
|
"step": 170
|
|
},
|
|
{
|
|
"epoch": 0.2098159509202454,
|
|
"grad_norm": 27.947158933463847,
|
|
"learning_rate": 1.8793388429752066e-06,
|
|
"logits/chosen": -0.049560546875,
|
|
"logits/rejected": -0.2119140625,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.2666,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": 1.4765625,
|
|
"rewards/margins": 7.375,
|
|
"rewards/rejected": -5.875,
|
|
"step": 171
|
|
},
|
|
{
|
|
"epoch": 0.21104294478527608,
|
|
"grad_norm": 30.869364523733665,
|
|
"learning_rate": 1.8785123966942146e-06,
|
|
"logits/chosen": 0.000576019287109375,
|
|
"logits/rejected": -0.1513671875,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.3213,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 1.859375,
|
|
"rewards/margins": 7.78125,
|
|
"rewards/rejected": -5.9375,
|
|
"step": 172
|
|
},
|
|
{
|
|
"epoch": 0.21226993865030674,
|
|
"grad_norm": 25.503527087315327,
|
|
"learning_rate": 1.877685950413223e-06,
|
|
"logits/chosen": -0.0654296875,
|
|
"logits/rejected": -0.29296875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.2261,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": 1.8671875,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -6.53125,
|
|
"step": 173
|
|
},
|
|
{
|
|
"epoch": 0.2134969325153374,
|
|
"grad_norm": 41.45487694767724,
|
|
"learning_rate": 1.8768595041322312e-06,
|
|
"logits/chosen": 0.1220703125,
|
|
"logits/rejected": -0.08349609375,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.6127,
|
|
"rewards/accuracies": 0.7578125,
|
|
"rewards/chosen": 0.34765625,
|
|
"rewards/margins": 7.0,
|
|
"rewards/rejected": -6.65625,
|
|
"step": 174
|
|
},
|
|
{
|
|
"epoch": 0.2147239263803681,
|
|
"grad_norm": 41.942169731050996,
|
|
"learning_rate": 1.8760330578512396e-06,
|
|
"logits/chosen": -0.0478515625,
|
|
"logits/rejected": -0.1533203125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.4923,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.65234375,
|
|
"rewards/margins": 7.625,
|
|
"rewards/rejected": -6.96875,
|
|
"step": 175
|
|
},
|
|
{
|
|
"epoch": 0.21595092024539878,
|
|
"grad_norm": 33.02715498525285,
|
|
"learning_rate": 1.8752066115702478e-06,
|
|
"logits/chosen": -0.06982421875,
|
|
"logits/rejected": -0.24609375,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.3583,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.55859375,
|
|
"rewards/margins": 7.6875,
|
|
"rewards/rejected": -7.125,
|
|
"step": 176
|
|
},
|
|
{
|
|
"epoch": 0.21717791411042944,
|
|
"grad_norm": 25.66769359217322,
|
|
"learning_rate": 1.8743801652892562e-06,
|
|
"logits/chosen": -0.0322265625,
|
|
"logits/rejected": -0.259765625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.3192,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 1.1875,
|
|
"rewards/margins": 8.875,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 177
|
|
},
|
|
{
|
|
"epoch": 0.2184049079754601,
|
|
"grad_norm": 36.222765395806164,
|
|
"learning_rate": 1.8735537190082644e-06,
|
|
"logits/chosen": -0.01397705078125,
|
|
"logits/rejected": -0.1552734375,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.4812,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.109375,
|
|
"rewards/margins": 6.5625,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 178
|
|
},
|
|
{
|
|
"epoch": 0.2196319018404908,
|
|
"grad_norm": 35.662361802451635,
|
|
"learning_rate": 1.8727272727272728e-06,
|
|
"logits/chosen": -0.045654296875,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.3996,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -0.8984375,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 179
|
|
},
|
|
{
|
|
"epoch": 0.22085889570552147,
|
|
"grad_norm": 39.55523149344556,
|
|
"learning_rate": 1.871900826446281e-06,
|
|
"logits/chosen": -0.036376953125,
|
|
"logits/rejected": -0.1455078125,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.4414,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -0.193359375,
|
|
"rewards/margins": 6.4375,
|
|
"rewards/rejected": -6.65625,
|
|
"step": 180
|
|
},
|
|
{
|
|
"epoch": 0.22208588957055214,
|
|
"grad_norm": 34.73055438874572,
|
|
"learning_rate": 1.8710743801652892e-06,
|
|
"logits/chosen": -0.03955078125,
|
|
"logits/rejected": -0.18359375,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.3822,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.08056640625,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -6.96875,
|
|
"step": 181
|
|
},
|
|
{
|
|
"epoch": 0.2233128834355828,
|
|
"grad_norm": 35.549083959412364,
|
|
"learning_rate": 1.8702479338842973e-06,
|
|
"logits/chosen": -0.0751953125,
|
|
"logits/rejected": -0.1904296875,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.4471,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.404296875,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -6.9375,
|
|
"step": 182
|
|
},
|
|
{
|
|
"epoch": 0.2245398773006135,
|
|
"grad_norm": 34.334033511280325,
|
|
"learning_rate": 1.8694214876033057e-06,
|
|
"logits/chosen": 0.06884765625,
|
|
"logits/rejected": -0.10400390625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.4001,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.46875,
|
|
"rewards/margins": 5.8125,
|
|
"rewards/rejected": -6.28125,
|
|
"step": 183
|
|
},
|
|
{
|
|
"epoch": 0.22576687116564417,
|
|
"grad_norm": 41.54844712953319,
|
|
"learning_rate": 1.868595041322314e-06,
|
|
"logits/chosen": 0.046875,
|
|
"logits/rejected": -0.0576171875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.4696,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.275390625,
|
|
"rewards/margins": 6.0,
|
|
"rewards/rejected": -6.25,
|
|
"step": 184
|
|
},
|
|
{
|
|
"epoch": 0.22699386503067484,
|
|
"grad_norm": 43.753107851750954,
|
|
"learning_rate": 1.8677685950413223e-06,
|
|
"logits/chosen": -0.000835418701171875,
|
|
"logits/rejected": -0.045654296875,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.4815,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": 0.81640625,
|
|
"rewards/margins": 6.46875,
|
|
"rewards/rejected": -5.65625,
|
|
"step": 185
|
|
},
|
|
{
|
|
"epoch": 0.2282208588957055,
|
|
"grad_norm": 31.045678715411483,
|
|
"learning_rate": 1.8669421487603305e-06,
|
|
"logits/chosen": -0.005645751953125,
|
|
"logits/rejected": -0.1171875,
|
|
"logps/chosen": -346.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.3289,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.55859375,
|
|
"rewards/margins": 6.46875,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 186
|
|
},
|
|
{
|
|
"epoch": 0.2294478527607362,
|
|
"grad_norm": 28.180859457617533,
|
|
"learning_rate": 1.8661157024793387e-06,
|
|
"logits/chosen": -0.0026092529296875,
|
|
"logits/rejected": -0.1591796875,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.2624,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": 0.84375,
|
|
"rewards/margins": 7.25,
|
|
"rewards/rejected": -6.40625,
|
|
"step": 187
|
|
},
|
|
{
|
|
"epoch": 0.23067484662576687,
|
|
"grad_norm": 34.6454692796615,
|
|
"learning_rate": 1.8652892561983471e-06,
|
|
"logits/chosen": 0.09716796875,
|
|
"logits/rejected": 0.020751953125,
|
|
"logps/chosen": -338.0,
|
|
"logps/rejected": -306.0,
|
|
"loss": 0.4244,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 0.62109375,
|
|
"rewards/margins": 6.375,
|
|
"rewards/rejected": -5.75,
|
|
"step": 188
|
|
},
|
|
{
|
|
"epoch": 0.23190184049079754,
|
|
"grad_norm": 29.626045464559624,
|
|
"learning_rate": 1.8644628099173553e-06,
|
|
"logits/chosen": -0.016845703125,
|
|
"logits/rejected": -0.2041015625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.2424,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 1.390625,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -5.78125,
|
|
"step": 189
|
|
},
|
|
{
|
|
"epoch": 0.2331288343558282,
|
|
"grad_norm": 30.762979161416748,
|
|
"learning_rate": 1.8636363636363635e-06,
|
|
"logits/chosen": 0.125,
|
|
"logits/rejected": -0.0177001953125,
|
|
"logps/chosen": -348.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.3577,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.6953125,
|
|
"rewards/margins": 6.28125,
|
|
"rewards/rejected": -5.5625,
|
|
"step": 190
|
|
},
|
|
{
|
|
"epoch": 0.2343558282208589,
|
|
"grad_norm": 39.505528847896215,
|
|
"learning_rate": 1.8628099173553717e-06,
|
|
"logits/chosen": 0.0380859375,
|
|
"logits/rejected": -0.142578125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -312.0,
|
|
"loss": 0.3813,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 1.4921875,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -5.5625,
|
|
"step": 191
|
|
},
|
|
{
|
|
"epoch": 0.23558282208588957,
|
|
"grad_norm": 36.116008803592244,
|
|
"learning_rate": 1.86198347107438e-06,
|
|
"logits/chosen": 0.021728515625,
|
|
"logits/rejected": -0.1748046875,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -304.0,
|
|
"loss": 0.388,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 0.7890625,
|
|
"rewards/margins": 5.59375,
|
|
"rewards/rejected": -4.8125,
|
|
"step": 192
|
|
},
|
|
{
|
|
"epoch": 0.23680981595092024,
|
|
"grad_norm": 27.40230966095949,
|
|
"learning_rate": 1.8611570247933883e-06,
|
|
"logits/chosen": -0.11328125,
|
|
"logits/rejected": -0.359375,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.2434,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": 1.5390625,
|
|
"rewards/margins": 7.28125,
|
|
"rewards/rejected": -5.75,
|
|
"step": 193
|
|
},
|
|
{
|
|
"epoch": 0.23803680981595093,
|
|
"grad_norm": 33.62467485299581,
|
|
"learning_rate": 1.8603305785123967e-06,
|
|
"logits/chosen": -0.1591796875,
|
|
"logits/rejected": -0.2578125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.3113,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 0.84375,
|
|
"rewards/margins": 6.625,
|
|
"rewards/rejected": -5.78125,
|
|
"step": 194
|
|
},
|
|
{
|
|
"epoch": 0.2392638036809816,
|
|
"grad_norm": 32.17428701370047,
|
|
"learning_rate": 1.8595041322314049e-06,
|
|
"logits/chosen": 0.02490234375,
|
|
"logits/rejected": -0.232421875,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.3146,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 1.8828125,
|
|
"rewards/margins": 7.78125,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 195
|
|
},
|
|
{
|
|
"epoch": 0.24049079754601227,
|
|
"grad_norm": 35.079148108918936,
|
|
"learning_rate": 1.8586776859504133e-06,
|
|
"logits/chosen": 0.0791015625,
|
|
"logits/rejected": -0.1201171875,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -306.0,
|
|
"loss": 0.35,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.0625,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -5.46875,
|
|
"step": 196
|
|
},
|
|
{
|
|
"epoch": 0.24171779141104294,
|
|
"grad_norm": 28.38496677798881,
|
|
"learning_rate": 1.8578512396694214e-06,
|
|
"logits/chosen": -0.06884765625,
|
|
"logits/rejected": -0.29296875,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.3581,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 1.3046875,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -5.46875,
|
|
"step": 197
|
|
},
|
|
{
|
|
"epoch": 0.24294478527607363,
|
|
"grad_norm": 34.75855042205488,
|
|
"learning_rate": 1.8570247933884298e-06,
|
|
"logits/chosen": 0.044189453125,
|
|
"logits/rejected": -0.03955078125,
|
|
"logps/chosen": -348.0,
|
|
"logps/rejected": -274.0,
|
|
"loss": 0.4955,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.5390625,
|
|
"rewards/margins": 5.9375,
|
|
"rewards/rejected": -5.40625,
|
|
"step": 198
|
|
},
|
|
{
|
|
"epoch": 0.2441717791411043,
|
|
"grad_norm": 24.3391639569881,
|
|
"learning_rate": 1.8561983471074378e-06,
|
|
"logits/chosen": -0.00836181640625,
|
|
"logits/rejected": -0.2099609375,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.2205,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": 1.9453125,
|
|
"rewards/margins": 7.59375,
|
|
"rewards/rejected": -5.65625,
|
|
"step": 199
|
|
},
|
|
{
|
|
"epoch": 0.24539877300613497,
|
|
"grad_norm": 33.67790011389976,
|
|
"learning_rate": 1.8553719008264462e-06,
|
|
"logits/chosen": 0.00171661376953125,
|
|
"logits/rejected": -0.208984375,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.3635,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.4296875,
|
|
"rewards/margins": 7.34375,
|
|
"rewards/rejected": -5.9375,
|
|
"step": 200
|
|
},
|
|
{
|
|
"epoch": 0.24662576687116564,
|
|
"grad_norm": 29.94304119699642,
|
|
"learning_rate": 1.8545454545454544e-06,
|
|
"logits/chosen": 0.0040283203125,
|
|
"logits/rejected": -0.2216796875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.2723,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 1.34375,
|
|
"rewards/margins": 7.21875,
|
|
"rewards/rejected": -5.875,
|
|
"step": 201
|
|
},
|
|
{
|
|
"epoch": 0.24785276073619633,
|
|
"grad_norm": 28.765821444293348,
|
|
"learning_rate": 1.8537190082644628e-06,
|
|
"logits/chosen": 0.01214599609375,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.3032,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 1.078125,
|
|
"rewards/margins": 7.125,
|
|
"rewards/rejected": -6.0625,
|
|
"step": 202
|
|
},
|
|
{
|
|
"epoch": 0.249079754601227,
|
|
"grad_norm": 34.905817372902206,
|
|
"learning_rate": 1.852892561983471e-06,
|
|
"logits/chosen": 0.06396484375,
|
|
"logits/rejected": -0.10693359375,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.5268,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.8515625,
|
|
"rewards/margins": 6.125,
|
|
"rewards/rejected": -5.25,
|
|
"step": 203
|
|
},
|
|
{
|
|
"epoch": 0.25030674846625767,
|
|
"grad_norm": 31.956685722412658,
|
|
"learning_rate": 1.8520661157024792e-06,
|
|
"logits/chosen": 0.0751953125,
|
|
"logits/rejected": -0.06201171875,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -296.0,
|
|
"loss": 0.4338,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.34375,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -6.4375,
|
|
"step": 204
|
|
},
|
|
{
|
|
"epoch": 0.25153374233128833,
|
|
"grad_norm": 37.935814784521064,
|
|
"learning_rate": 1.8512396694214876e-06,
|
|
"logits/chosen": 0.12451171875,
|
|
"logits/rejected": -0.0078125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.4439,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.40234375,
|
|
"rewards/margins": 6.5,
|
|
"rewards/rejected": -6.09375,
|
|
"step": 205
|
|
},
|
|
{
|
|
"epoch": 0.252760736196319,
|
|
"grad_norm": 28.711197288901985,
|
|
"learning_rate": 1.8504132231404958e-06,
|
|
"logits/chosen": -0.013671875,
|
|
"logits/rejected": -0.291015625,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.2712,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": 0.765625,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 206
|
|
},
|
|
{
|
|
"epoch": 0.25398773006134967,
|
|
"grad_norm": 36.2137572830465,
|
|
"learning_rate": 1.8495867768595042e-06,
|
|
"logits/chosen": -0.1435546875,
|
|
"logits/rejected": -0.333984375,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.4606,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.64453125,
|
|
"rewards/margins": 7.25,
|
|
"rewards/rejected": -6.59375,
|
|
"step": 207
|
|
},
|
|
{
|
|
"epoch": 0.2552147239263804,
|
|
"grad_norm": 36.36125991050883,
|
|
"learning_rate": 1.8487603305785121e-06,
|
|
"logits/chosen": -0.10400390625,
|
|
"logits/rejected": -0.232421875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.4728,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.2099609375,
|
|
"rewards/margins": 7.34375,
|
|
"rewards/rejected": -7.125,
|
|
"step": 208
|
|
},
|
|
{
|
|
"epoch": 0.25644171779141106,
|
|
"grad_norm": 29.48688226760878,
|
|
"learning_rate": 1.8479338842975205e-06,
|
|
"logits/chosen": -0.10888671875,
|
|
"logits/rejected": -0.2119140625,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.3045,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.01483154296875,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -7.0625,
|
|
"step": 209
|
|
},
|
|
{
|
|
"epoch": 0.25766871165644173,
|
|
"grad_norm": 43.32418692899722,
|
|
"learning_rate": 1.8471074380165287e-06,
|
|
"logits/chosen": -0.057373046875,
|
|
"logits/rejected": -0.1640625,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.4799,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.58203125,
|
|
"rewards/margins": 6.5,
|
|
"rewards/rejected": -7.09375,
|
|
"step": 210
|
|
},
|
|
{
|
|
"epoch": 0.2588957055214724,
|
|
"grad_norm": 32.875594911340926,
|
|
"learning_rate": 1.8462809917355371e-06,
|
|
"logits/chosen": -0.1796875,
|
|
"logits/rejected": -0.369140625,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.4038,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.12451171875,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 211
|
|
},
|
|
{
|
|
"epoch": 0.26012269938650306,
|
|
"grad_norm": 32.229612216659156,
|
|
"learning_rate": 1.8454545454545453e-06,
|
|
"logits/chosen": -0.091796875,
|
|
"logits/rejected": -0.2421875,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.4005,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.0693359375,
|
|
"rewards/margins": 7.34375,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 212
|
|
},
|
|
{
|
|
"epoch": 0.26134969325153373,
|
|
"grad_norm": 33.986071909620065,
|
|
"learning_rate": 1.8446280991735537e-06,
|
|
"logits/chosen": -0.0184326171875,
|
|
"logits/rejected": -0.0732421875,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.3423,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.83203125,
|
|
"rewards/margins": 6.625,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 213
|
|
},
|
|
{
|
|
"epoch": 0.2625766871165644,
|
|
"grad_norm": 37.10851232974184,
|
|
"learning_rate": 1.843801652892562e-06,
|
|
"logits/chosen": -0.009033203125,
|
|
"logits/rejected": -0.1591796875,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.4335,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -0.439453125,
|
|
"rewards/margins": 6.96875,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 214
|
|
},
|
|
{
|
|
"epoch": 0.26380368098159507,
|
|
"grad_norm": 36.733063444572046,
|
|
"learning_rate": 1.8429752066115703e-06,
|
|
"logits/chosen": 0.03955078125,
|
|
"logits/rejected": -0.04833984375,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.4476,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -0.9765625,
|
|
"rewards/margins": 6.25,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 215
|
|
},
|
|
{
|
|
"epoch": 0.2650306748466258,
|
|
"grad_norm": 34.01324686588401,
|
|
"learning_rate": 1.8421487603305785e-06,
|
|
"logits/chosen": -0.0233154296875,
|
|
"logits/rejected": -0.140625,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.3626,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.171875,
|
|
"rewards/margins": 6.34375,
|
|
"rewards/rejected": -7.5,
|
|
"step": 216
|
|
},
|
|
{
|
|
"epoch": 0.26625766871165646,
|
|
"grad_norm": 33.9425395489284,
|
|
"learning_rate": 1.8413223140495867e-06,
|
|
"logits/chosen": 0.07861328125,
|
|
"logits/rejected": -0.05712890625,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.4867,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -0.37109375,
|
|
"rewards/margins": 6.8125,
|
|
"rewards/rejected": -7.1875,
|
|
"step": 217
|
|
},
|
|
{
|
|
"epoch": 0.2674846625766871,
|
|
"grad_norm": 36.88406469678275,
|
|
"learning_rate": 1.8404958677685949e-06,
|
|
"logits/chosen": 0.0286865234375,
|
|
"logits/rejected": -0.0673828125,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.6112,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -0.55078125,
|
|
"rewards/margins": 6.1875,
|
|
"rewards/rejected": -6.75,
|
|
"step": 218
|
|
},
|
|
{
|
|
"epoch": 0.2687116564417178,
|
|
"grad_norm": 27.106981198592187,
|
|
"learning_rate": 1.8396694214876033e-06,
|
|
"logits/chosen": -0.06982421875,
|
|
"logits/rejected": -0.1650390625,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.3271,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.34375,
|
|
"rewards/margins": 6.75,
|
|
"rewards/rejected": -7.09375,
|
|
"step": 219
|
|
},
|
|
{
|
|
"epoch": 0.26993865030674846,
|
|
"grad_norm": 41.33290696076488,
|
|
"learning_rate": 1.8388429752066115e-06,
|
|
"logits/chosen": 0.10546875,
|
|
"logits/rejected": 0.04150390625,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.484,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -0.54296875,
|
|
"rewards/margins": 5.5,
|
|
"rewards/rejected": -6.0625,
|
|
"step": 220
|
|
},
|
|
{
|
|
"epoch": 0.27116564417177913,
|
|
"grad_norm": 34.82671379199956,
|
|
"learning_rate": 1.8380165289256197e-06,
|
|
"logits/chosen": -0.03125,
|
|
"logits/rejected": -0.2353515625,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -320.0,
|
|
"loss": 0.4323,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -0.515625,
|
|
"rewards/margins": 6.15625,
|
|
"rewards/rejected": -6.6875,
|
|
"step": 221
|
|
},
|
|
{
|
|
"epoch": 0.2723926380368098,
|
|
"grad_norm": 32.09209252085318,
|
|
"learning_rate": 1.837190082644628e-06,
|
|
"logits/chosen": -0.2294921875,
|
|
"logits/rejected": -0.35546875,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.3723,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 0.64453125,
|
|
"rewards/margins": 7.65625,
|
|
"rewards/rejected": -7.03125,
|
|
"step": 222
|
|
},
|
|
{
|
|
"epoch": 0.27361963190184047,
|
|
"grad_norm": 30.360418922302767,
|
|
"learning_rate": 1.8363636363636362e-06,
|
|
"logits/chosen": -0.0025177001953125,
|
|
"logits/rejected": -0.1767578125,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.3446,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.1201171875,
|
|
"rewards/margins": 6.5,
|
|
"rewards/rejected": -6.625,
|
|
"step": 223
|
|
},
|
|
{
|
|
"epoch": 0.2748466257668712,
|
|
"grad_norm": 33.28343727553535,
|
|
"learning_rate": 1.8355371900826446e-06,
|
|
"logits/chosen": -0.1494140625,
|
|
"logits/rejected": -0.314453125,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.3381,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.8125,
|
|
"rewards/margins": 7.4375,
|
|
"rewards/rejected": -6.625,
|
|
"step": 224
|
|
},
|
|
{
|
|
"epoch": 0.27607361963190186,
|
|
"grad_norm": 27.575287222312205,
|
|
"learning_rate": 1.8347107438016528e-06,
|
|
"logits/chosen": -0.0074462890625,
|
|
"logits/rejected": -0.197265625,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.2979,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.1240234375,
|
|
"rewards/margins": 6.75,
|
|
"rewards/rejected": -6.875,
|
|
"step": 225
|
|
},
|
|
{
|
|
"epoch": 0.2773006134969325,
|
|
"grad_norm": 35.804717446072374,
|
|
"learning_rate": 1.833884297520661e-06,
|
|
"logits/chosen": -0.0263671875,
|
|
"logits/rejected": -0.1533203125,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.5311,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": 0.2490234375,
|
|
"rewards/margins": 6.40625,
|
|
"rewards/rejected": -6.15625,
|
|
"step": 226
|
|
},
|
|
{
|
|
"epoch": 0.2785276073619632,
|
|
"grad_norm": 33.17082749696476,
|
|
"learning_rate": 1.8330578512396692e-06,
|
|
"logits/chosen": -0.0654296875,
|
|
"logits/rejected": -0.11962890625,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.3674,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 0.271484375,
|
|
"rewards/margins": 6.8125,
|
|
"rewards/rejected": -6.5625,
|
|
"step": 227
|
|
},
|
|
{
|
|
"epoch": 0.27975460122699386,
|
|
"grad_norm": 39.03709023154875,
|
|
"learning_rate": 1.8322314049586776e-06,
|
|
"logits/chosen": -0.0859375,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.3658,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.08642578125,
|
|
"rewards/margins": 6.21875,
|
|
"rewards/rejected": -6.125,
|
|
"step": 228
|
|
},
|
|
{
|
|
"epoch": 0.2809815950920245,
|
|
"grad_norm": 33.405275623628135,
|
|
"learning_rate": 1.8314049586776858e-06,
|
|
"logits/chosen": 0.033447265625,
|
|
"logits/rejected": -0.1650390625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.4121,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.94921875,
|
|
"rewards/margins": 6.0625,
|
|
"rewards/rejected": -5.125,
|
|
"step": 229
|
|
},
|
|
{
|
|
"epoch": 0.2822085889570552,
|
|
"grad_norm": 28.934513872861842,
|
|
"learning_rate": 1.8305785123966942e-06,
|
|
"logits/chosen": 0.01422119140625,
|
|
"logits/rejected": -0.171875,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.3171,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.31640625,
|
|
"rewards/margins": 6.6875,
|
|
"rewards/rejected": -6.34375,
|
|
"step": 230
|
|
},
|
|
{
|
|
"epoch": 0.28343558282208586,
|
|
"grad_norm": 42.101697675910884,
|
|
"learning_rate": 1.8297520661157024e-06,
|
|
"logits/chosen": -0.0458984375,
|
|
"logits/rejected": -0.1591796875,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.5022,
|
|
"rewards/accuracies": 0.765625,
|
|
"rewards/chosen": 0.1884765625,
|
|
"rewards/margins": 5.75,
|
|
"rewards/rejected": -5.5625,
|
|
"step": 231
|
|
},
|
|
{
|
|
"epoch": 0.2846625766871166,
|
|
"grad_norm": 31.041614627432494,
|
|
"learning_rate": 1.8289256198347108e-06,
|
|
"logits/chosen": -0.1416015625,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.3309,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.154296875,
|
|
"rewards/margins": 5.9375,
|
|
"rewards/rejected": -5.78125,
|
|
"step": 232
|
|
},
|
|
{
|
|
"epoch": 0.28588957055214725,
|
|
"grad_norm": 33.208288428637466,
|
|
"learning_rate": 1.828099173553719e-06,
|
|
"logits/chosen": -0.031982421875,
|
|
"logits/rejected": -0.240234375,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -304.0,
|
|
"loss": 0.3639,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.84375,
|
|
"rewards/margins": 6.5625,
|
|
"rewards/rejected": -5.71875,
|
|
"step": 233
|
|
},
|
|
{
|
|
"epoch": 0.2871165644171779,
|
|
"grad_norm": 34.551985856914754,
|
|
"learning_rate": 1.8272727272727274e-06,
|
|
"logits/chosen": -0.181640625,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.3713,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.7421875,
|
|
"rewards/margins": 5.75,
|
|
"rewards/rejected": -5.0,
|
|
"step": 234
|
|
},
|
|
{
|
|
"epoch": 0.2883435582822086,
|
|
"grad_norm": 33.24252120404476,
|
|
"learning_rate": 1.8264462809917353e-06,
|
|
"logits/chosen": -0.1884765625,
|
|
"logits/rejected": -0.33203125,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.4505,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 0.64453125,
|
|
"rewards/margins": 6.375,
|
|
"rewards/rejected": -5.71875,
|
|
"step": 235
|
|
},
|
|
{
|
|
"epoch": 0.28957055214723926,
|
|
"grad_norm": 35.77389224303484,
|
|
"learning_rate": 1.8256198347107437e-06,
|
|
"logits/chosen": 0.0810546875,
|
|
"logits/rejected": -0.087890625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.5182,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 1.2890625,
|
|
"rewards/margins": 6.125,
|
|
"rewards/rejected": -4.84375,
|
|
"step": 236
|
|
},
|
|
{
|
|
"epoch": 0.2907975460122699,
|
|
"grad_norm": 31.129635224715592,
|
|
"learning_rate": 1.824793388429752e-06,
|
|
"logits/chosen": -0.09228515625,
|
|
"logits/rejected": -0.234375,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.3941,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 1.1015625,
|
|
"rewards/margins": 6.75,
|
|
"rewards/rejected": -5.625,
|
|
"step": 237
|
|
},
|
|
{
|
|
"epoch": 0.2920245398773006,
|
|
"grad_norm": 35.65380017849091,
|
|
"learning_rate": 1.8239669421487603e-06,
|
|
"logits/chosen": -0.0908203125,
|
|
"logits/rejected": -0.234375,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.5599,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.96484375,
|
|
"rewards/margins": 6.0625,
|
|
"rewards/rejected": -5.09375,
|
|
"step": 238
|
|
},
|
|
{
|
|
"epoch": 0.29325153374233126,
|
|
"grad_norm": 32.052298425748006,
|
|
"learning_rate": 1.8231404958677685e-06,
|
|
"logits/chosen": -0.12158203125,
|
|
"logits/rejected": -0.283203125,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.3905,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 1.5078125,
|
|
"rewards/margins": 6.84375,
|
|
"rewards/rejected": -5.34375,
|
|
"step": 239
|
|
},
|
|
{
|
|
"epoch": 0.294478527607362,
|
|
"grad_norm": 35.84557042473533,
|
|
"learning_rate": 1.8223140495867767e-06,
|
|
"logits/chosen": -0.14453125,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.3132,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 1.21875,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -5.96875,
|
|
"step": 240
|
|
},
|
|
{
|
|
"epoch": 0.29570552147239265,
|
|
"grad_norm": 30.402376947293806,
|
|
"learning_rate": 1.8214876033057851e-06,
|
|
"logits/chosen": -0.06298828125,
|
|
"logits/rejected": -0.18359375,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.3285,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 0.90234375,
|
|
"rewards/margins": 6.9375,
|
|
"rewards/rejected": -6.0625,
|
|
"step": 241
|
|
},
|
|
{
|
|
"epoch": 0.2969325153374233,
|
|
"grad_norm": 29.56214225717774,
|
|
"learning_rate": 1.8206611570247933e-06,
|
|
"logits/chosen": -0.09130859375,
|
|
"logits/rejected": -0.2373046875,
|
|
"logps/chosen": -360.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.3124,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 0.333984375,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -6.6875,
|
|
"step": 242
|
|
},
|
|
{
|
|
"epoch": 0.298159509202454,
|
|
"grad_norm": 38.918268887194166,
|
|
"learning_rate": 1.8198347107438015e-06,
|
|
"logits/chosen": -0.189453125,
|
|
"logits/rejected": -0.322265625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.4651,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 0.361328125,
|
|
"rewards/margins": 6.0625,
|
|
"rewards/rejected": -5.6875,
|
|
"step": 243
|
|
},
|
|
{
|
|
"epoch": 0.29938650306748466,
|
|
"grad_norm": 37.49319000473201,
|
|
"learning_rate": 1.8190082644628097e-06,
|
|
"logits/chosen": -0.177734375,
|
|
"logits/rejected": -0.38671875,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.6062,
|
|
"rewards/accuracies": 0.765625,
|
|
"rewards/chosen": 0.119140625,
|
|
"rewards/margins": 6.0625,
|
|
"rewards/rejected": -5.9375,
|
|
"step": 244
|
|
},
|
|
{
|
|
"epoch": 0.3006134969325153,
|
|
"grad_norm": 27.548754613441176,
|
|
"learning_rate": 1.818181818181818e-06,
|
|
"logits/chosen": -0.150390625,
|
|
"logits/rejected": -0.283203125,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.3154,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 0.89453125,
|
|
"rewards/margins": 7.09375,
|
|
"rewards/rejected": -6.1875,
|
|
"step": 245
|
|
},
|
|
{
|
|
"epoch": 0.301840490797546,
|
|
"grad_norm": 31.428983894448056,
|
|
"learning_rate": 1.8173553719008263e-06,
|
|
"logits/chosen": -0.1689453125,
|
|
"logits/rejected": -0.31640625,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.4208,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 0.91796875,
|
|
"rewards/margins": 6.96875,
|
|
"rewards/rejected": -6.0625,
|
|
"step": 246
|
|
},
|
|
{
|
|
"epoch": 0.3030674846625767,
|
|
"grad_norm": 35.8356562486741,
|
|
"learning_rate": 1.8165289256198347e-06,
|
|
"logits/chosen": -0.1494140625,
|
|
"logits/rejected": -0.3359375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.4266,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.1875,
|
|
"rewards/margins": 6.40625,
|
|
"rewards/rejected": -6.59375,
|
|
"step": 247
|
|
},
|
|
{
|
|
"epoch": 0.3042944785276074,
|
|
"grad_norm": 30.06552672230669,
|
|
"learning_rate": 1.8157024793388429e-06,
|
|
"logits/chosen": -0.0732421875,
|
|
"logits/rejected": -0.314453125,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.2547,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 0.494140625,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -6.28125,
|
|
"step": 248
|
|
},
|
|
{
|
|
"epoch": 0.30552147239263805,
|
|
"grad_norm": 36.83655921915478,
|
|
"learning_rate": 1.8148760330578513e-06,
|
|
"logits/chosen": -0.2099609375,
|
|
"logits/rejected": -0.40625,
|
|
"logps/chosen": -486.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.391,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 1.4765625,
|
|
"rewards/margins": 7.375,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 249
|
|
},
|
|
{
|
|
"epoch": 0.3067484662576687,
|
|
"grad_norm": 37.752184625467414,
|
|
"learning_rate": 1.8140495867768594e-06,
|
|
"logits/chosen": -0.296875,
|
|
"logits/rejected": -0.341796875,
|
|
"logps/chosen": -352.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.4516,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.1357421875,
|
|
"rewards/margins": 6.4375,
|
|
"rewards/rejected": -6.28125,
|
|
"step": 250
|
|
},
|
|
{
|
|
"epoch": 0.3079754601226994,
|
|
"grad_norm": 37.215429535528145,
|
|
"learning_rate": 1.8132231404958678e-06,
|
|
"logits/chosen": 0.046875,
|
|
"logits/rejected": -0.1123046875,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.4531,
|
|
"rewards/accuracies": 0.765625,
|
|
"rewards/chosen": 0.1396484375,
|
|
"rewards/margins": 5.9375,
|
|
"rewards/rejected": -5.78125,
|
|
"step": 251
|
|
},
|
|
{
|
|
"epoch": 0.30920245398773005,
|
|
"grad_norm": 36.33063050800995,
|
|
"learning_rate": 1.8123966942148758e-06,
|
|
"logits/chosen": -0.1337890625,
|
|
"logits/rejected": -0.279296875,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.5192,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": 0.6796875,
|
|
"rewards/margins": 6.40625,
|
|
"rewards/rejected": -5.71875,
|
|
"step": 252
|
|
},
|
|
{
|
|
"epoch": 0.3104294478527607,
|
|
"grad_norm": 23.572885198304117,
|
|
"learning_rate": 1.8115702479338842e-06,
|
|
"logits/chosen": -0.1513671875,
|
|
"logits/rejected": -0.384765625,
|
|
"logps/chosen": -348.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.2557,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": 0.369140625,
|
|
"rewards/margins": 6.9375,
|
|
"rewards/rejected": -6.59375,
|
|
"step": 253
|
|
},
|
|
{
|
|
"epoch": 0.3116564417177914,
|
|
"grad_norm": 31.88920391109181,
|
|
"learning_rate": 1.8107438016528924e-06,
|
|
"logits/chosen": -0.09765625,
|
|
"logits/rejected": -0.2421875,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.4349,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.6953125,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -6.1875,
|
|
"step": 254
|
|
},
|
|
{
|
|
"epoch": 0.3128834355828221,
|
|
"grad_norm": 34.98844147021467,
|
|
"learning_rate": 1.8099173553719008e-06,
|
|
"logits/chosen": -0.059326171875,
|
|
"logits/rejected": -0.203125,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.483,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 0.66796875,
|
|
"rewards/margins": 6.21875,
|
|
"rewards/rejected": -5.5625,
|
|
"step": 255
|
|
},
|
|
{
|
|
"epoch": 0.3141104294478528,
|
|
"grad_norm": 30.717298361863232,
|
|
"learning_rate": 1.809090909090909e-06,
|
|
"logits/chosen": -0.1533203125,
|
|
"logits/rejected": -0.314453125,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.3686,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 1.2578125,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -6.46875,
|
|
"step": 256
|
|
},
|
|
{
|
|
"epoch": 0.31533742331288345,
|
|
"grad_norm": 32.38957302493671,
|
|
"learning_rate": 1.8082644628099172e-06,
|
|
"logits/chosen": -0.125,
|
|
"logits/rejected": -0.26953125,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.3988,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 1.2578125,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -5.9375,
|
|
"step": 257
|
|
},
|
|
{
|
|
"epoch": 0.3165644171779141,
|
|
"grad_norm": 32.251415399902235,
|
|
"learning_rate": 1.8074380165289256e-06,
|
|
"logits/chosen": -0.062255859375,
|
|
"logits/rejected": -0.2578125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.3654,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": 1.0234375,
|
|
"rewards/margins": 7.28125,
|
|
"rewards/rejected": -6.25,
|
|
"step": 258
|
|
},
|
|
{
|
|
"epoch": 0.3177914110429448,
|
|
"grad_norm": 29.92303190987881,
|
|
"learning_rate": 1.8066115702479338e-06,
|
|
"logits/chosen": -0.150390625,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -354.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.3777,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.44140625,
|
|
"rewards/margins": 6.84375,
|
|
"rewards/rejected": -6.40625,
|
|
"step": 259
|
|
},
|
|
{
|
|
"epoch": 0.31901840490797545,
|
|
"grad_norm": 35.81124429262747,
|
|
"learning_rate": 1.8057851239669422e-06,
|
|
"logits/chosen": -0.162109375,
|
|
"logits/rejected": -0.2373046875,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.3848,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.51953125,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -6.28125,
|
|
"step": 260
|
|
},
|
|
{
|
|
"epoch": 0.3202453987730061,
|
|
"grad_norm": 35.92574955807426,
|
|
"learning_rate": 1.8049586776859502e-06,
|
|
"logits/chosen": -0.07861328125,
|
|
"logits/rejected": -0.2255859375,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.4494,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.765625,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -6.28125,
|
|
"step": 261
|
|
},
|
|
{
|
|
"epoch": 0.3214723926380368,
|
|
"grad_norm": 36.90912873255913,
|
|
"learning_rate": 1.8041322314049586e-06,
|
|
"logits/chosen": -0.1259765625,
|
|
"logits/rejected": -0.29296875,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.407,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 1.2421875,
|
|
"rewards/margins": 7.09375,
|
|
"rewards/rejected": -5.84375,
|
|
"step": 262
|
|
},
|
|
{
|
|
"epoch": 0.3226993865030675,
|
|
"grad_norm": 44.13843960126915,
|
|
"learning_rate": 1.8033057851239667e-06,
|
|
"logits/chosen": -0.109375,
|
|
"logits/rejected": -0.2265625,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.5838,
|
|
"rewards/accuracies": 0.7578125,
|
|
"rewards/chosen": 0.038330078125,
|
|
"rewards/margins": 5.5625,
|
|
"rewards/rejected": -5.5,
|
|
"step": 263
|
|
},
|
|
{
|
|
"epoch": 0.3239263803680982,
|
|
"grad_norm": 35.844763168882,
|
|
"learning_rate": 1.8024793388429751e-06,
|
|
"logits/chosen": -0.0478515625,
|
|
"logits/rejected": -0.1533203125,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -312.0,
|
|
"loss": 0.4203,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.5625,
|
|
"rewards/margins": 6.03125,
|
|
"rewards/rejected": -5.46875,
|
|
"step": 264
|
|
},
|
|
{
|
|
"epoch": 0.32515337423312884,
|
|
"grad_norm": 38.77846474424905,
|
|
"learning_rate": 1.8016528925619833e-06,
|
|
"logits/chosen": -0.05908203125,
|
|
"logits/rejected": -0.2197265625,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -290.0,
|
|
"loss": 0.3753,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.55859375,
|
|
"rewards/margins": 6.59375,
|
|
"rewards/rejected": -6.03125,
|
|
"step": 265
|
|
},
|
|
{
|
|
"epoch": 0.3263803680981595,
|
|
"grad_norm": 38.91032929227862,
|
|
"learning_rate": 1.8008264462809917e-06,
|
|
"logits/chosen": -0.03369140625,
|
|
"logits/rejected": -0.1787109375,
|
|
"logps/chosen": -328.0,
|
|
"logps/rejected": -316.0,
|
|
"loss": 0.537,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -0.54296875,
|
|
"rewards/margins": 5.03125,
|
|
"rewards/rejected": -5.5625,
|
|
"step": 266
|
|
},
|
|
{
|
|
"epoch": 0.3276073619631902,
|
|
"grad_norm": 37.161118868538544,
|
|
"learning_rate": 1.8e-06,
|
|
"logits/chosen": -0.04736328125,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.408,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 1.109375,
|
|
"rewards/margins": 6.3125,
|
|
"rewards/rejected": -5.21875,
|
|
"step": 267
|
|
},
|
|
{
|
|
"epoch": 0.32883435582822085,
|
|
"grad_norm": 32.186263942809234,
|
|
"learning_rate": 1.7991735537190083e-06,
|
|
"logits/chosen": -0.216796875,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.2732,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 0.97265625,
|
|
"rewards/margins": 6.8125,
|
|
"rewards/rejected": -5.84375,
|
|
"step": 268
|
|
},
|
|
{
|
|
"epoch": 0.3300613496932515,
|
|
"grad_norm": 37.074021485498456,
|
|
"learning_rate": 1.7983471074380165e-06,
|
|
"logits/chosen": -0.08447265625,
|
|
"logits/rejected": -0.392578125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -314.0,
|
|
"loss": 0.2972,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 1.125,
|
|
"rewards/margins": 6.6875,
|
|
"rewards/rejected": -5.5625,
|
|
"step": 269
|
|
},
|
|
{
|
|
"epoch": 0.3312883435582822,
|
|
"grad_norm": 35.52997559394852,
|
|
"learning_rate": 1.7975206611570247e-06,
|
|
"logits/chosen": -0.043701171875,
|
|
"logits/rejected": -0.1591796875,
|
|
"logps/chosen": -334.0,
|
|
"logps/rejected": -304.0,
|
|
"loss": 0.5512,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 0.341796875,
|
|
"rewards/margins": 5.15625,
|
|
"rewards/rejected": -4.8125,
|
|
"step": 270
|
|
},
|
|
{
|
|
"epoch": 0.3325153374233129,
|
|
"grad_norm": 26.18507952887063,
|
|
"learning_rate": 1.7966942148760329e-06,
|
|
"logits/chosen": -0.08740234375,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.3691,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": 1.5546875,
|
|
"rewards/margins": 6.96875,
|
|
"rewards/rejected": -5.40625,
|
|
"step": 271
|
|
},
|
|
{
|
|
"epoch": 0.3337423312883436,
|
|
"grad_norm": 30.65997550912457,
|
|
"learning_rate": 1.7958677685950413e-06,
|
|
"logits/chosen": 0.0308837890625,
|
|
"logits/rejected": -0.1259765625,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.2986,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 0.302734375,
|
|
"rewards/margins": 6.65625,
|
|
"rewards/rejected": -6.375,
|
|
"step": 272
|
|
},
|
|
{
|
|
"epoch": 0.33496932515337424,
|
|
"grad_norm": 36.582111868528614,
|
|
"learning_rate": 1.7950413223140495e-06,
|
|
"logits/chosen": 0.1240234375,
|
|
"logits/rejected": 0.05126953125,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -316.0,
|
|
"loss": 0.5599,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": 0.07177734375,
|
|
"rewards/margins": 5.75,
|
|
"rewards/rejected": -5.6875,
|
|
"step": 273
|
|
},
|
|
{
|
|
"epoch": 0.3361963190184049,
|
|
"grad_norm": 33.279143248477546,
|
|
"learning_rate": 1.7942148760330579e-06,
|
|
"logits/chosen": 0.0888671875,
|
|
"logits/rejected": -0.055419921875,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.4479,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 0.58984375,
|
|
"rewards/margins": 6.46875,
|
|
"rewards/rejected": -5.875,
|
|
"step": 274
|
|
},
|
|
{
|
|
"epoch": 0.3374233128834356,
|
|
"grad_norm": 32.24834004521387,
|
|
"learning_rate": 1.793388429752066e-06,
|
|
"logits/chosen": 0.0167236328125,
|
|
"logits/rejected": -0.06689453125,
|
|
"logps/chosen": -330.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.4847,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 0.08984375,
|
|
"rewards/margins": 5.90625,
|
|
"rewards/rejected": -5.8125,
|
|
"step": 275
|
|
},
|
|
{
|
|
"epoch": 0.33865030674846625,
|
|
"grad_norm": 27.386781158674737,
|
|
"learning_rate": 1.7925619834710742e-06,
|
|
"logits/chosen": 0.10009765625,
|
|
"logits/rejected": -0.119140625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.3805,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.2275390625,
|
|
"rewards/margins": 6.375,
|
|
"rewards/rejected": -6.59375,
|
|
"step": 276
|
|
},
|
|
{
|
|
"epoch": 0.3398773006134969,
|
|
"grad_norm": 28.87751276737049,
|
|
"learning_rate": 1.7917355371900826e-06,
|
|
"logits/chosen": -0.1201171875,
|
|
"logits/rejected": -0.3046875,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.2843,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": 0.70703125,
|
|
"rewards/margins": 7.40625,
|
|
"rewards/rejected": -6.6875,
|
|
"step": 277
|
|
},
|
|
{
|
|
"epoch": 0.3411042944785276,
|
|
"grad_norm": 33.8069348498851,
|
|
"learning_rate": 1.7909090909090908e-06,
|
|
"logits/chosen": 0.01556396484375,
|
|
"logits/rejected": -0.028076171875,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.3724,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.1943359375,
|
|
"rewards/margins": 6.625,
|
|
"rewards/rejected": -6.8125,
|
|
"step": 278
|
|
},
|
|
{
|
|
"epoch": 0.3423312883435583,
|
|
"grad_norm": 23.691833106444715,
|
|
"learning_rate": 1.790082644628099e-06,
|
|
"logits/chosen": -0.06689453125,
|
|
"logits/rejected": -0.251953125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.2062,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -0.2373046875,
|
|
"rewards/margins": 7.59375,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 279
|
|
},
|
|
{
|
|
"epoch": 0.34355828220858897,
|
|
"grad_norm": 32.92127336551771,
|
|
"learning_rate": 1.7892561983471072e-06,
|
|
"logits/chosen": -0.054931640625,
|
|
"logits/rejected": -0.1904296875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.4097,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.2099609375,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -7.375,
|
|
"step": 280
|
|
},
|
|
{
|
|
"epoch": 0.34478527607361964,
|
|
"grad_norm": 31.92199907548239,
|
|
"learning_rate": 1.7884297520661156e-06,
|
|
"logits/chosen": 0.04931640625,
|
|
"logits/rejected": -0.1435546875,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.4396,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.93359375,
|
|
"rewards/margins": 5.875,
|
|
"rewards/rejected": -6.8125,
|
|
"step": 281
|
|
},
|
|
{
|
|
"epoch": 0.3460122699386503,
|
|
"grad_norm": 26.710409053663327,
|
|
"learning_rate": 1.7876033057851238e-06,
|
|
"logits/chosen": -0.1533203125,
|
|
"logits/rejected": -0.28515625,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.262,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.37890625,
|
|
"rewards/margins": 7.5,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 282
|
|
},
|
|
{
|
|
"epoch": 0.347239263803681,
|
|
"grad_norm": 31.34681509597123,
|
|
"learning_rate": 1.7867768595041322e-06,
|
|
"logits/chosen": -0.1708984375,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -316.0,
|
|
"loss": 0.3721,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.9453125,
|
|
"rewards/margins": 6.40625,
|
|
"rewards/rejected": -7.375,
|
|
"step": 283
|
|
},
|
|
{
|
|
"epoch": 0.34846625766871164,
|
|
"grad_norm": 29.846783324542276,
|
|
"learning_rate": 1.7859504132231404e-06,
|
|
"logits/chosen": 0.0216064453125,
|
|
"logits/rejected": -0.111328125,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.3148,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.8515625,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 284
|
|
},
|
|
{
|
|
"epoch": 0.3496932515337423,
|
|
"grad_norm": 29.07841735224466,
|
|
"learning_rate": 1.7851239669421488e-06,
|
|
"logits/chosen": -0.08056640625,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.325,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.87109375,
|
|
"rewards/margins": 7.15625,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 285
|
|
},
|
|
{
|
|
"epoch": 0.350920245398773,
|
|
"grad_norm": 31.101201313842562,
|
|
"learning_rate": 1.784297520661157e-06,
|
|
"logits/chosen": 0.007110595703125,
|
|
"logits/rejected": -0.18359375,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.4065,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.95703125,
|
|
"rewards/margins": 7.5,
|
|
"rewards/rejected": -8.5,
|
|
"step": 286
|
|
},
|
|
{
|
|
"epoch": 0.3521472392638037,
|
|
"grad_norm": 32.42950485642569,
|
|
"learning_rate": 1.7834710743801654e-06,
|
|
"logits/chosen": -0.0986328125,
|
|
"logits/rejected": -0.2294921875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.3281,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.375,
|
|
"rewards/margins": 6.90625,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 287
|
|
},
|
|
{
|
|
"epoch": 0.35337423312883437,
|
|
"grad_norm": 29.079563891537067,
|
|
"learning_rate": 1.7826446280991734e-06,
|
|
"logits/chosen": 0.12255859375,
|
|
"logits/rejected": -0.0252685546875,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.4199,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.8359375,
|
|
"rewards/margins": 6.4375,
|
|
"rewards/rejected": -8.25,
|
|
"step": 288
|
|
},
|
|
{
|
|
"epoch": 0.35460122699386504,
|
|
"grad_norm": 24.362186652478755,
|
|
"learning_rate": 1.7818181818181818e-06,
|
|
"logits/chosen": -0.06640625,
|
|
"logits/rejected": -0.208984375,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.2252,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": -1.03125,
|
|
"rewards/margins": 8.25,
|
|
"rewards/rejected": -9.25,
|
|
"step": 289
|
|
},
|
|
{
|
|
"epoch": 0.3558282208588957,
|
|
"grad_norm": 24.833763702732224,
|
|
"learning_rate": 1.78099173553719e-06,
|
|
"logits/chosen": -0.2421875,
|
|
"logits/rejected": -0.376953125,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.2186,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -1.03125,
|
|
"rewards/margins": 8.1875,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 290
|
|
},
|
|
{
|
|
"epoch": 0.3570552147239264,
|
|
"grad_norm": 32.36383730629053,
|
|
"learning_rate": 1.7801652892561983e-06,
|
|
"logits/chosen": -0.1884765625,
|
|
"logits/rejected": -0.29296875,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.4522,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.3671875,
|
|
"rewards/margins": 7.625,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 291
|
|
},
|
|
{
|
|
"epoch": 0.35828220858895704,
|
|
"grad_norm": 29.731019014801593,
|
|
"learning_rate": 1.7793388429752065e-06,
|
|
"logits/chosen": -0.12890625,
|
|
"logits/rejected": -0.35546875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.2581,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.21875,
|
|
"rewards/margins": 7.9375,
|
|
"rewards/rejected": -9.125,
|
|
"step": 292
|
|
},
|
|
{
|
|
"epoch": 0.3595092024539877,
|
|
"grad_norm": 24.960712282687606,
|
|
"learning_rate": 1.7785123966942147e-06,
|
|
"logits/chosen": -0.0213623046875,
|
|
"logits/rejected": -0.2275390625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.2337,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -1.953125,
|
|
"rewards/margins": 7.46875,
|
|
"rewards/rejected": -9.375,
|
|
"step": 293
|
|
},
|
|
{
|
|
"epoch": 0.36073619631901843,
|
|
"grad_norm": 26.249698002048582,
|
|
"learning_rate": 1.7776859504132231e-06,
|
|
"logits/chosen": -0.322265625,
|
|
"logits/rejected": -0.455078125,
|
|
"logps/chosen": -488.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.3401,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -1.0390625,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -9.4375,
|
|
"step": 294
|
|
},
|
|
{
|
|
"epoch": 0.3619631901840491,
|
|
"grad_norm": 27.064994791758675,
|
|
"learning_rate": 1.7768595041322313e-06,
|
|
"logits/chosen": 0.00921630859375,
|
|
"logits/rejected": -0.1376953125,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.2706,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -1.4609375,
|
|
"rewards/margins": 7.3125,
|
|
"rewards/rejected": -8.75,
|
|
"step": 295
|
|
},
|
|
{
|
|
"epoch": 0.36319018404907977,
|
|
"grad_norm": 35.43162888450131,
|
|
"learning_rate": 1.7760330578512397e-06,
|
|
"logits/chosen": 0.0537109375,
|
|
"logits/rejected": -0.08984375,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.4592,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.83984375,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -8.0,
|
|
"step": 296
|
|
},
|
|
{
|
|
"epoch": 0.36441717791411044,
|
|
"grad_norm": 26.093937890387547,
|
|
"learning_rate": 1.7752066115702477e-06,
|
|
"logits/chosen": -0.099609375,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.275,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.046875,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -8.75,
|
|
"step": 297
|
|
},
|
|
{
|
|
"epoch": 0.3656441717791411,
|
|
"grad_norm": 34.67507683293938,
|
|
"learning_rate": 1.774380165289256e-06,
|
|
"logits/chosen": 0.060302734375,
|
|
"logits/rejected": -0.0279541015625,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.3801,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.515625,
|
|
"rewards/margins": 6.5625,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 298
|
|
},
|
|
{
|
|
"epoch": 0.36687116564417177,
|
|
"grad_norm": 36.26270235220453,
|
|
"learning_rate": 1.7735537190082643e-06,
|
|
"logits/chosen": 0.0030517578125,
|
|
"logits/rejected": -0.173828125,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.4301,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -2.140625,
|
|
"rewards/margins": 6.21875,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 299
|
|
},
|
|
{
|
|
"epoch": 0.36809815950920244,
|
|
"grad_norm": 35.40586729670696,
|
|
"learning_rate": 1.7727272727272727e-06,
|
|
"logits/chosen": -0.1220703125,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.5165,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.546875,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -8.625,
|
|
"step": 300
|
|
},
|
|
{
|
|
"epoch": 0.3693251533742331,
|
|
"grad_norm": 34.10518739995848,
|
|
"learning_rate": 1.7719008264462809e-06,
|
|
"logits/chosen": -0.0712890625,
|
|
"logits/rejected": -0.25,
|
|
"logps/chosen": -484.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.4117,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -1.4609375,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -9.0,
|
|
"step": 301
|
|
},
|
|
{
|
|
"epoch": 0.37055214723926383,
|
|
"grad_norm": 28.682377601987284,
|
|
"learning_rate": 1.7710743801652893e-06,
|
|
"logits/chosen": -0.09228515625,
|
|
"logits/rejected": -0.298828125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.2799,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.8828125,
|
|
"rewards/margins": 6.90625,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 302
|
|
},
|
|
{
|
|
"epoch": 0.3717791411042945,
|
|
"grad_norm": 40.69913245313932,
|
|
"learning_rate": 1.7702479338842975e-06,
|
|
"logits/chosen": -0.0966796875,
|
|
"logits/rejected": -0.2021484375,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.5452,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -2.625,
|
|
"rewards/margins": 6.34375,
|
|
"rewards/rejected": -9.0,
|
|
"step": 303
|
|
},
|
|
{
|
|
"epoch": 0.37300613496932516,
|
|
"grad_norm": 30.045946343013274,
|
|
"learning_rate": 1.7694214876033059e-06,
|
|
"logits/chosen": 0.033447265625,
|
|
"logits/rejected": -0.2412109375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.3544,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -2.390625,
|
|
"rewards/margins": 7.09375,
|
|
"rewards/rejected": -9.5,
|
|
"step": 304
|
|
},
|
|
{
|
|
"epoch": 0.37423312883435583,
|
|
"grad_norm": 26.000139518526083,
|
|
"learning_rate": 1.768595041322314e-06,
|
|
"logits/chosen": -0.05029296875,
|
|
"logits/rejected": -0.1875,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.2725,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -1.546875,
|
|
"rewards/margins": 8.0,
|
|
"rewards/rejected": -9.5625,
|
|
"step": 305
|
|
},
|
|
{
|
|
"epoch": 0.3754601226993865,
|
|
"grad_norm": 28.483050353321193,
|
|
"learning_rate": 1.7677685950413222e-06,
|
|
"logits/chosen": -0.1669921875,
|
|
"logits/rejected": -0.333984375,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.2525,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -2.0625,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -9.25,
|
|
"step": 306
|
|
},
|
|
{
|
|
"epoch": 0.37668711656441717,
|
|
"grad_norm": 33.659968783805994,
|
|
"learning_rate": 1.7669421487603304e-06,
|
|
"logits/chosen": -0.01007080078125,
|
|
"logits/rejected": -0.1357421875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.5429,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.8828125,
|
|
"rewards/margins": 7.3125,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 307
|
|
},
|
|
{
|
|
"epoch": 0.37791411042944784,
|
|
"grad_norm": 33.27798405952561,
|
|
"learning_rate": 1.7661157024793388e-06,
|
|
"logits/chosen": 0.059814453125,
|
|
"logits/rejected": -0.1025390625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.474,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -2.125,
|
|
"rewards/margins": 6.21875,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 308
|
|
},
|
|
{
|
|
"epoch": 0.3791411042944785,
|
|
"grad_norm": 35.55367970177758,
|
|
"learning_rate": 1.765289256198347e-06,
|
|
"logits/chosen": -0.171875,
|
|
"logits/rejected": -0.27734375,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.3057,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.5234375,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -8.375,
|
|
"step": 309
|
|
},
|
|
{
|
|
"epoch": 0.3803680981595092,
|
|
"grad_norm": 28.89582404017667,
|
|
"learning_rate": 1.7644628099173552e-06,
|
|
"logits/chosen": 0.10986328125,
|
|
"logits/rejected": 0.02490234375,
|
|
"logps/chosen": -332.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.3957,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.8203125,
|
|
"rewards/margins": 5.8125,
|
|
"rewards/rejected": -7.625,
|
|
"step": 310
|
|
},
|
|
{
|
|
"epoch": 0.3815950920245399,
|
|
"grad_norm": 28.96615638829631,
|
|
"learning_rate": 1.7636363636363636e-06,
|
|
"logits/chosen": -0.11767578125,
|
|
"logits/rejected": -0.296875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.3969,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.376953125,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 311
|
|
},
|
|
{
|
|
"epoch": 0.38282208588957056,
|
|
"grad_norm": 37.63927932099697,
|
|
"learning_rate": 1.7628099173553718e-06,
|
|
"logits/chosen": 0.07568359375,
|
|
"logits/rejected": -0.05810546875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.6106,
|
|
"rewards/accuracies": 0.7578125,
|
|
"rewards/chosen": -0.84765625,
|
|
"rewards/margins": 6.46875,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 312
|
|
},
|
|
{
|
|
"epoch": 0.38404907975460123,
|
|
"grad_norm": 29.537362160889604,
|
|
"learning_rate": 1.7619834710743802e-06,
|
|
"logits/chosen": 0.0162353515625,
|
|
"logits/rejected": -0.259765625,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.3486,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.486328125,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -7.875,
|
|
"step": 313
|
|
},
|
|
{
|
|
"epoch": 0.3852760736196319,
|
|
"grad_norm": 26.210720376336045,
|
|
"learning_rate": 1.7611570247933884e-06,
|
|
"logits/chosen": -0.0107421875,
|
|
"logits/rejected": -0.1953125,
|
|
"logps/chosen": -466.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.2853,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": 1.328125,
|
|
"rewards/margins": 9.3125,
|
|
"rewards/rejected": -8.0,
|
|
"step": 314
|
|
},
|
|
{
|
|
"epoch": 0.38650306748466257,
|
|
"grad_norm": 31.1253075063973,
|
|
"learning_rate": 1.7603305785123966e-06,
|
|
"logits/chosen": 0.1328125,
|
|
"logits/rejected": -0.068359375,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -308.0,
|
|
"loss": 0.387,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.52734375,
|
|
"rewards/margins": 6.75,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 315
|
|
},
|
|
{
|
|
"epoch": 0.38773006134969323,
|
|
"grad_norm": 27.073834425971683,
|
|
"learning_rate": 1.7595041322314047e-06,
|
|
"logits/chosen": 0.10302734375,
|
|
"logits/rejected": -0.03515625,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -314.0,
|
|
"loss": 0.3848,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.01165771484375,
|
|
"rewards/margins": 7.4375,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 316
|
|
},
|
|
{
|
|
"epoch": 0.3889570552147239,
|
|
"grad_norm": 28.98605055057774,
|
|
"learning_rate": 1.7586776859504131e-06,
|
|
"logits/chosen": -0.0537109375,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.3474,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.263671875,
|
|
"rewards/margins": 7.84375,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 317
|
|
},
|
|
{
|
|
"epoch": 0.3901840490797546,
|
|
"grad_norm": 39.2536826011772,
|
|
"learning_rate": 1.7578512396694213e-06,
|
|
"logits/chosen": -0.1025390625,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.4691,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.039794921875,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -6.84375,
|
|
"step": 318
|
|
},
|
|
{
|
|
"epoch": 0.3914110429447853,
|
|
"grad_norm": 21.757881067498776,
|
|
"learning_rate": 1.7570247933884297e-06,
|
|
"logits/chosen": -0.03173828125,
|
|
"logits/rejected": -0.2177734375,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.1796,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": 0.416015625,
|
|
"rewards/margins": 8.5625,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 319
|
|
},
|
|
{
|
|
"epoch": 0.39263803680981596,
|
|
"grad_norm": 31.845194282419403,
|
|
"learning_rate": 1.756198347107438e-06,
|
|
"logits/chosen": -0.0022125244140625,
|
|
"logits/rejected": -0.1123046875,
|
|
"logps/chosen": -332.0,
|
|
"logps/rejected": -296.0,
|
|
"loss": 0.3812,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.84765625,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -7.625,
|
|
"step": 320
|
|
},
|
|
{
|
|
"epoch": 0.39386503067484663,
|
|
"grad_norm": 37.332413007576875,
|
|
"learning_rate": 1.7553719008264463e-06,
|
|
"logits/chosen": -0.162109375,
|
|
"logits/rejected": -0.30859375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.4505,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.56640625,
|
|
"rewards/margins": 7.6875,
|
|
"rewards/rejected": -8.25,
|
|
"step": 321
|
|
},
|
|
{
|
|
"epoch": 0.3950920245398773,
|
|
"grad_norm": 26.763545530847892,
|
|
"learning_rate": 1.7545454545454545e-06,
|
|
"logits/chosen": -0.0654296875,
|
|
"logits/rejected": -0.2138671875,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.3361,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 0.05810546875,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 322
|
|
},
|
|
{
|
|
"epoch": 0.39631901840490796,
|
|
"grad_norm": 36.23320501006155,
|
|
"learning_rate": 1.753719008264463e-06,
|
|
"logits/chosen": -0.0888671875,
|
|
"logits/rejected": -0.22265625,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.4543,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.70703125,
|
|
"rewards/margins": 6.28125,
|
|
"rewards/rejected": -6.96875,
|
|
"step": 323
|
|
},
|
|
{
|
|
"epoch": 0.39754601226993863,
|
|
"grad_norm": 25.797612826053182,
|
|
"learning_rate": 1.7528925619834709e-06,
|
|
"logits/chosen": -0.158203125,
|
|
"logits/rejected": -0.328125,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.3194,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.40625,
|
|
"rewards/margins": 7.59375,
|
|
"rewards/rejected": -8.0,
|
|
"step": 324
|
|
},
|
|
{
|
|
"epoch": 0.3987730061349693,
|
|
"grad_norm": 35.32099995396031,
|
|
"learning_rate": 1.7520661157024793e-06,
|
|
"logits/chosen": 0.024658203125,
|
|
"logits/rejected": -0.03466796875,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.6162,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -1.0625,
|
|
"rewards/margins": 6.1875,
|
|
"rewards/rejected": -7.25,
|
|
"step": 325
|
|
},
|
|
{
|
|
"epoch": 0.4,
|
|
"grad_norm": 26.28245320040819,
|
|
"learning_rate": 1.7512396694214875e-06,
|
|
"logits/chosen": -0.1953125,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.2342,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 0.45703125,
|
|
"rewards/margins": 8.5625,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 326
|
|
},
|
|
{
|
|
"epoch": 0.4012269938650307,
|
|
"grad_norm": 38.737200091377495,
|
|
"learning_rate": 1.7504132231404959e-06,
|
|
"logits/chosen": -0.048828125,
|
|
"logits/rejected": -0.216796875,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.507,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.70703125,
|
|
"rewards/margins": 5.9375,
|
|
"rewards/rejected": -6.65625,
|
|
"step": 327
|
|
},
|
|
{
|
|
"epoch": 0.40245398773006136,
|
|
"grad_norm": 29.75047013457242,
|
|
"learning_rate": 1.749586776859504e-06,
|
|
"logits/chosen": -0.08154296875,
|
|
"logits/rejected": -0.2099609375,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -304.0,
|
|
"loss": 0.344,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.28125,
|
|
"rewards/margins": 6.3125,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 328
|
|
},
|
|
{
|
|
"epoch": 0.403680981595092,
|
|
"grad_norm": 29.83011076964678,
|
|
"learning_rate": 1.7487603305785123e-06,
|
|
"logits/chosen": -0.040771484375,
|
|
"logits/rejected": -0.240234375,
|
|
"logps/chosen": -482.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.3719,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.5546875,
|
|
"rewards/margins": 8.4375,
|
|
"rewards/rejected": -9.0,
|
|
"step": 329
|
|
},
|
|
{
|
|
"epoch": 0.4049079754601227,
|
|
"grad_norm": 23.40191432839614,
|
|
"learning_rate": 1.7479338842975207e-06,
|
|
"logits/chosen": -0.1826171875,
|
|
"logits/rejected": -0.3828125,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.2362,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.416015625,
|
|
"rewards/margins": 8.4375,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 330
|
|
},
|
|
{
|
|
"epoch": 0.40613496932515336,
|
|
"grad_norm": 26.098835314213307,
|
|
"learning_rate": 1.7471074380165288e-06,
|
|
"logits/chosen": -0.1318359375,
|
|
"logits/rejected": -0.2392578125,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.3222,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.49609375,
|
|
"rewards/margins": 7.84375,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 331
|
|
},
|
|
{
|
|
"epoch": 0.40736196319018403,
|
|
"grad_norm": 22.96275837318382,
|
|
"learning_rate": 1.746280991735537e-06,
|
|
"logits/chosen": -0.1337890625,
|
|
"logits/rejected": -0.330078125,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.222,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -0.70703125,
|
|
"rewards/margins": 8.25,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 332
|
|
},
|
|
{
|
|
"epoch": 0.4085889570552147,
|
|
"grad_norm": 31.858485693574398,
|
|
"learning_rate": 1.7454545454545452e-06,
|
|
"logits/chosen": 0.0712890625,
|
|
"logits/rejected": -0.051513671875,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.423,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.40625,
|
|
"rewards/margins": 6.46875,
|
|
"rewards/rejected": -7.875,
|
|
"step": 333
|
|
},
|
|
{
|
|
"epoch": 0.4098159509202454,
|
|
"grad_norm": 27.957364910858917,
|
|
"learning_rate": 1.7446280991735536e-06,
|
|
"logits/chosen": -0.080078125,
|
|
"logits/rejected": -0.30859375,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.3448,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.2890625,
|
|
"rewards/margins": 7.65625,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 334
|
|
},
|
|
{
|
|
"epoch": 0.4110429447852761,
|
|
"grad_norm": 26.96892215593624,
|
|
"learning_rate": 1.7438016528925618e-06,
|
|
"logits/chosen": 0.037353515625,
|
|
"logits/rejected": -0.236328125,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.2357,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": -1.6640625,
|
|
"rewards/margins": 7.25,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 335
|
|
},
|
|
{
|
|
"epoch": 0.41226993865030676,
|
|
"grad_norm": 31.129366723267793,
|
|
"learning_rate": 1.7429752066115702e-06,
|
|
"logits/chosen": -0.12890625,
|
|
"logits/rejected": -0.275390625,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.3437,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.671875,
|
|
"rewards/margins": 7.34375,
|
|
"rewards/rejected": -9.0,
|
|
"step": 336
|
|
},
|
|
{
|
|
"epoch": 0.4134969325153374,
|
|
"grad_norm": 33.0574105356729,
|
|
"learning_rate": 1.7421487603305784e-06,
|
|
"logits/chosen": 0.072265625,
|
|
"logits/rejected": -0.080078125,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.448,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.75,
|
|
"rewards/margins": 7.0,
|
|
"rewards/rejected": -8.75,
|
|
"step": 337
|
|
},
|
|
{
|
|
"epoch": 0.4147239263803681,
|
|
"grad_norm": 33.43282145955899,
|
|
"learning_rate": 1.7413223140495868e-06,
|
|
"logits/chosen": 0.05078125,
|
|
"logits/rejected": -0.08349609375,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.3974,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.703125,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -8.75,
|
|
"step": 338
|
|
},
|
|
{
|
|
"epoch": 0.41595092024539876,
|
|
"grad_norm": 37.78258657108814,
|
|
"learning_rate": 1.740495867768595e-06,
|
|
"logits/chosen": 0.126953125,
|
|
"logits/rejected": -0.00148773193359375,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.4457,
|
|
"rewards/accuracies": 0.7421875,
|
|
"rewards/chosen": -2.328125,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 339
|
|
},
|
|
{
|
|
"epoch": 0.4171779141104294,
|
|
"grad_norm": 38.091264811731946,
|
|
"learning_rate": 1.7396694214876034e-06,
|
|
"logits/chosen": 0.01190185546875,
|
|
"logits/rejected": -0.21875,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.4535,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -2.109375,
|
|
"rewards/margins": 6.0,
|
|
"rewards/rejected": -8.125,
|
|
"step": 340
|
|
},
|
|
{
|
|
"epoch": 0.41840490797546015,
|
|
"grad_norm": 28.56735350898946,
|
|
"learning_rate": 1.7388429752066114e-06,
|
|
"logits/chosen": -0.051513671875,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.4213,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.0234375,
|
|
"rewards/margins": 7.125,
|
|
"rewards/rejected": -8.125,
|
|
"step": 341
|
|
},
|
|
{
|
|
"epoch": 0.4196319018404908,
|
|
"grad_norm": 35.90928541046158,
|
|
"learning_rate": 1.7380165289256198e-06,
|
|
"logits/chosen": 0.0400390625,
|
|
"logits/rejected": -0.058837890625,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.4382,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -1.671875,
|
|
"rewards/margins": 6.09375,
|
|
"rewards/rejected": -7.75,
|
|
"step": 342
|
|
},
|
|
{
|
|
"epoch": 0.4208588957055215,
|
|
"grad_norm": 32.798361112567775,
|
|
"learning_rate": 1.737190082644628e-06,
|
|
"logits/chosen": -0.01092529296875,
|
|
"logits/rejected": -0.09375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.4573,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -2.109375,
|
|
"rewards/margins": 5.5,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 343
|
|
},
|
|
{
|
|
"epoch": 0.42208588957055215,
|
|
"grad_norm": 33.41501439475392,
|
|
"learning_rate": 1.7363636363636364e-06,
|
|
"logits/chosen": -0.003692626953125,
|
|
"logits/rejected": -0.1455078125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.4771,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -1.3203125,
|
|
"rewards/margins": 5.90625,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 344
|
|
},
|
|
{
|
|
"epoch": 0.4233128834355828,
|
|
"grad_norm": 29.62905133697734,
|
|
"learning_rate": 1.7355371900826445e-06,
|
|
"logits/chosen": 0.0031280517578125,
|
|
"logits/rejected": -0.1728515625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.3645,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.2109375,
|
|
"rewards/margins": 6.5,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 345
|
|
},
|
|
{
|
|
"epoch": 0.4245398773006135,
|
|
"grad_norm": 33.83312728123592,
|
|
"learning_rate": 1.7347107438016527e-06,
|
|
"logits/chosen": 0.024658203125,
|
|
"logits/rejected": -0.1728515625,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.4849,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.5390625,
|
|
"rewards/margins": 5.78125,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 346
|
|
},
|
|
{
|
|
"epoch": 0.42576687116564416,
|
|
"grad_norm": 26.732035700407028,
|
|
"learning_rate": 1.7338842975206611e-06,
|
|
"logits/chosen": -0.0096435546875,
|
|
"logits/rejected": -0.125,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.3745,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.0859375,
|
|
"rewards/margins": 6.15625,
|
|
"rewards/rejected": -7.25,
|
|
"step": 347
|
|
},
|
|
{
|
|
"epoch": 0.4269938650306748,
|
|
"grad_norm": 24.034744290597516,
|
|
"learning_rate": 1.7330578512396693e-06,
|
|
"logits/chosen": -0.08056640625,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.3082,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.73046875,
|
|
"rewards/margins": 7.40625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 348
|
|
},
|
|
{
|
|
"epoch": 0.42822085889570555,
|
|
"grad_norm": 33.16648036520517,
|
|
"learning_rate": 1.7322314049586777e-06,
|
|
"logits/chosen": -0.050537109375,
|
|
"logits/rejected": -0.1943359375,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.3973,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.8046875,
|
|
"rewards/margins": 7.21875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 349
|
|
},
|
|
{
|
|
"epoch": 0.4294478527607362,
|
|
"grad_norm": 32.075615627406215,
|
|
"learning_rate": 1.7314049586776857e-06,
|
|
"logits/chosen": 0.12060546875,
|
|
"logits/rejected": -0.07568359375,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.3882,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.09375,
|
|
"rewards/margins": 6.34375,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 350
|
|
},
|
|
{
|
|
"epoch": 0.4306748466257669,
|
|
"grad_norm": 31.727375282436817,
|
|
"learning_rate": 1.730578512396694e-06,
|
|
"logits/chosen": -0.06982421875,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.4572,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.8359375,
|
|
"rewards/margins": 6.21875,
|
|
"rewards/rejected": -7.0625,
|
|
"step": 351
|
|
},
|
|
{
|
|
"epoch": 0.43190184049079755,
|
|
"grad_norm": 30.509189174847993,
|
|
"learning_rate": 1.7297520661157023e-06,
|
|
"logits/chosen": 0.022216796875,
|
|
"logits/rejected": -0.1728515625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.5106,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.1044921875,
|
|
"rewards/margins": 6.65625,
|
|
"rewards/rejected": -6.5625,
|
|
"step": 352
|
|
},
|
|
{
|
|
"epoch": 0.4331288343558282,
|
|
"grad_norm": 24.069694219856217,
|
|
"learning_rate": 1.7289256198347107e-06,
|
|
"logits/chosen": -0.03271484375,
|
|
"logits/rejected": -0.2041015625,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.2823,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": 0.2060546875,
|
|
"rewards/margins": 7.84375,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 353
|
|
},
|
|
{
|
|
"epoch": 0.4343558282208589,
|
|
"grad_norm": 30.55186134035927,
|
|
"learning_rate": 1.7280991735537189e-06,
|
|
"logits/chosen": 0.051513671875,
|
|
"logits/rejected": -0.11669921875,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.3823,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 0.2216796875,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -6.5625,
|
|
"step": 354
|
|
},
|
|
{
|
|
"epoch": 0.43558282208588955,
|
|
"grad_norm": 29.806161868685802,
|
|
"learning_rate": 1.7272727272727273e-06,
|
|
"logits/chosen": -0.11962890625,
|
|
"logits/rejected": -0.2060546875,
|
|
"logps/chosen": -352.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.4971,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.2099609375,
|
|
"rewards/margins": 6.59375,
|
|
"rewards/rejected": -6.8125,
|
|
"step": 355
|
|
},
|
|
{
|
|
"epoch": 0.4368098159509202,
|
|
"grad_norm": 28.997448738112062,
|
|
"learning_rate": 1.7264462809917355e-06,
|
|
"logits/chosen": 0.10400390625,
|
|
"logits/rejected": -0.050048828125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.4177,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.44921875,
|
|
"rewards/margins": 6.59375,
|
|
"rewards/rejected": -7.03125,
|
|
"step": 356
|
|
},
|
|
{
|
|
"epoch": 0.43803680981595094,
|
|
"grad_norm": 25.796166704510906,
|
|
"learning_rate": 1.7256198347107439e-06,
|
|
"logits/chosen": -0.1953125,
|
|
"logits/rejected": -0.34375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.386,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": 0.267578125,
|
|
"rewards/margins": 7.78125,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 357
|
|
},
|
|
{
|
|
"epoch": 0.4392638036809816,
|
|
"grad_norm": 29.76888453399602,
|
|
"learning_rate": 1.724793388429752e-06,
|
|
"logits/chosen": -0.1328125,
|
|
"logits/rejected": -0.291015625,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.3357,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 0.7734375,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -6.75,
|
|
"step": 358
|
|
},
|
|
{
|
|
"epoch": 0.4404907975460123,
|
|
"grad_norm": 32.264562546278825,
|
|
"learning_rate": 1.7239669421487602e-06,
|
|
"logits/chosen": -0.004486083984375,
|
|
"logits/rejected": -0.1103515625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.4028,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 0.40234375,
|
|
"rewards/margins": 7.3125,
|
|
"rewards/rejected": -6.90625,
|
|
"step": 359
|
|
},
|
|
{
|
|
"epoch": 0.44171779141104295,
|
|
"grad_norm": 30.707161953362395,
|
|
"learning_rate": 1.7231404958677684e-06,
|
|
"logits/chosen": 0.0027923583984375,
|
|
"logits/rejected": -0.1142578125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.2964,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.036376953125,
|
|
"rewards/margins": 7.40625,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 360
|
|
},
|
|
{
|
|
"epoch": 0.4429447852760736,
|
|
"grad_norm": 28.2532161282973,
|
|
"learning_rate": 1.7223140495867768e-06,
|
|
"logits/chosen": 0.035888671875,
|
|
"logits/rejected": -0.14453125,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.3447,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 0.09423828125,
|
|
"rewards/margins": 8.125,
|
|
"rewards/rejected": -8.0,
|
|
"step": 361
|
|
},
|
|
{
|
|
"epoch": 0.4441717791411043,
|
|
"grad_norm": 30.63004713476651,
|
|
"learning_rate": 1.721487603305785e-06,
|
|
"logits/chosen": -0.0791015625,
|
|
"logits/rejected": -0.234375,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.393,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.0478515625,
|
|
"rewards/margins": 7.625,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 362
|
|
},
|
|
{
|
|
"epoch": 0.44539877300613495,
|
|
"grad_norm": 24.181127169354465,
|
|
"learning_rate": 1.7206611570247934e-06,
|
|
"logits/chosen": 0.01141357421875,
|
|
"logits/rejected": -0.134765625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.265,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.0281982421875,
|
|
"rewards/margins": 7.34375,
|
|
"rewards/rejected": -7.34375,
|
|
"step": 363
|
|
},
|
|
{
|
|
"epoch": 0.4466257668711656,
|
|
"grad_norm": 38.68918129355689,
|
|
"learning_rate": 1.7198347107438016e-06,
|
|
"logits/chosen": 0.1015625,
|
|
"logits/rejected": -0.06884765625,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.4892,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.515625,
|
|
"rewards/margins": 7.125,
|
|
"rewards/rejected": -7.625,
|
|
"step": 364
|
|
},
|
|
{
|
|
"epoch": 0.44785276073619634,
|
|
"grad_norm": 26.54302110111711,
|
|
"learning_rate": 1.7190082644628098e-06,
|
|
"logits/chosen": 0.036376953125,
|
|
"logits/rejected": -0.1044921875,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.3292,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.443359375,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 365
|
|
},
|
|
{
|
|
"epoch": 0.449079754601227,
|
|
"grad_norm": 31.437353393628033,
|
|
"learning_rate": 1.7181818181818182e-06,
|
|
"logits/chosen": 0.07177734375,
|
|
"logits/rejected": -0.0167236328125,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.4862,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.283203125,
|
|
"rewards/margins": 6.28125,
|
|
"rewards/rejected": -6.5625,
|
|
"step": 366
|
|
},
|
|
{
|
|
"epoch": 0.4503067484662577,
|
|
"grad_norm": 24.936304243498505,
|
|
"learning_rate": 1.7173553719008264e-06,
|
|
"logits/chosen": -0.10546875,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.2301,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.0166015625,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -7.03125,
|
|
"step": 367
|
|
},
|
|
{
|
|
"epoch": 0.45153374233128835,
|
|
"grad_norm": 33.06699625077162,
|
|
"learning_rate": 1.7165289256198346e-06,
|
|
"logits/chosen": 0.11083984375,
|
|
"logits/rejected": 0.0703125,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.4432,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.71484375,
|
|
"rewards/margins": 6.125,
|
|
"rewards/rejected": -6.84375,
|
|
"step": 368
|
|
},
|
|
{
|
|
"epoch": 0.452760736196319,
|
|
"grad_norm": 32.05752953588176,
|
|
"learning_rate": 1.7157024793388428e-06,
|
|
"logits/chosen": 0.10302734375,
|
|
"logits/rejected": -0.0185546875,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -314.0,
|
|
"loss": 0.4169,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.2109375,
|
|
"rewards/margins": 5.9375,
|
|
"rewards/rejected": -7.15625,
|
|
"step": 369
|
|
},
|
|
{
|
|
"epoch": 0.4539877300613497,
|
|
"grad_norm": 28.897289479795006,
|
|
"learning_rate": 1.7148760330578512e-06,
|
|
"logits/chosen": -0.11328125,
|
|
"logits/rejected": -0.2890625,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.3875,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.68359375,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -6.1875,
|
|
"step": 370
|
|
},
|
|
{
|
|
"epoch": 0.45521472392638035,
|
|
"grad_norm": 28.480183749828473,
|
|
"learning_rate": 1.7140495867768593e-06,
|
|
"logits/chosen": -0.091796875,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -472.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.3191,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 0.37890625,
|
|
"rewards/margins": 6.1875,
|
|
"rewards/rejected": -5.78125,
|
|
"step": 371
|
|
},
|
|
{
|
|
"epoch": 0.456441717791411,
|
|
"grad_norm": 25.3244703029385,
|
|
"learning_rate": 1.7132231404958677e-06,
|
|
"logits/chosen": 0.01361083984375,
|
|
"logits/rejected": -0.142578125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.2574,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 0.1650390625,
|
|
"rewards/margins": 6.71875,
|
|
"rewards/rejected": -6.53125,
|
|
"step": 372
|
|
},
|
|
{
|
|
"epoch": 0.45766871165644174,
|
|
"grad_norm": 29.284880465036775,
|
|
"learning_rate": 1.712396694214876e-06,
|
|
"logits/chosen": -0.010009765625,
|
|
"logits/rejected": -0.11572265625,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.4752,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.8515625,
|
|
"rewards/margins": 6.03125,
|
|
"rewards/rejected": -6.875,
|
|
"step": 373
|
|
},
|
|
{
|
|
"epoch": 0.4588957055214724,
|
|
"grad_norm": 26.631358414161173,
|
|
"learning_rate": 1.7115702479338843e-06,
|
|
"logits/chosen": -0.04443359375,
|
|
"logits/rejected": -0.16796875,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.3031,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": 0.63671875,
|
|
"rewards/margins": 7.09375,
|
|
"rewards/rejected": -6.46875,
|
|
"step": 374
|
|
},
|
|
{
|
|
"epoch": 0.4601226993865031,
|
|
"grad_norm": 32.968452883704536,
|
|
"learning_rate": 1.7107438016528925e-06,
|
|
"logits/chosen": -0.0966796875,
|
|
"logits/rejected": -0.166015625,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.3377,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 0.138671875,
|
|
"rewards/margins": 6.0625,
|
|
"rewards/rejected": -5.90625,
|
|
"step": 375
|
|
},
|
|
{
|
|
"epoch": 0.46134969325153374,
|
|
"grad_norm": 34.51257771820218,
|
|
"learning_rate": 1.709917355371901e-06,
|
|
"logits/chosen": 0.038818359375,
|
|
"logits/rejected": -0.1025390625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.4323,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.041259765625,
|
|
"rewards/margins": 5.78125,
|
|
"rewards/rejected": -5.8125,
|
|
"step": 376
|
|
},
|
|
{
|
|
"epoch": 0.4625766871165644,
|
|
"grad_norm": 33.75836559175619,
|
|
"learning_rate": 1.709090909090909e-06,
|
|
"logits/chosen": -0.04638671875,
|
|
"logits/rejected": -0.099609375,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.459,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": 0.028076171875,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -7.0,
|
|
"step": 377
|
|
},
|
|
{
|
|
"epoch": 0.4638036809815951,
|
|
"grad_norm": 33.30516444032953,
|
|
"learning_rate": 1.7082644628099173e-06,
|
|
"logits/chosen": -0.10498046875,
|
|
"logits/rejected": -0.337890625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.4247,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -0.11962890625,
|
|
"rewards/margins": 6.71875,
|
|
"rewards/rejected": -6.8125,
|
|
"step": 378
|
|
},
|
|
{
|
|
"epoch": 0.46503067484662575,
|
|
"grad_norm": 30.763840707194113,
|
|
"learning_rate": 1.7074380165289255e-06,
|
|
"logits/chosen": -0.1513671875,
|
|
"logits/rejected": -0.3125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.3412,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 0.193359375,
|
|
"rewards/margins": 7.4375,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 379
|
|
},
|
|
{
|
|
"epoch": 0.4662576687116564,
|
|
"grad_norm": 31.392021389760224,
|
|
"learning_rate": 1.7066115702479339e-06,
|
|
"logits/chosen": -0.048095703125,
|
|
"logits/rejected": -0.1845703125,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.3494,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.0283203125,
|
|
"rewards/margins": 6.90625,
|
|
"rewards/rejected": -6.875,
|
|
"step": 380
|
|
},
|
|
{
|
|
"epoch": 0.46748466257668714,
|
|
"grad_norm": 29.785310021888524,
|
|
"learning_rate": 1.705785123966942e-06,
|
|
"logits/chosen": -0.1552734375,
|
|
"logits/rejected": -0.330078125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.3816,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.72265625,
|
|
"rewards/margins": 7.25,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 381
|
|
},
|
|
{
|
|
"epoch": 0.4687116564417178,
|
|
"grad_norm": 27.088976045563662,
|
|
"learning_rate": 1.7049586776859503e-06,
|
|
"logits/chosen": -0.1435546875,
|
|
"logits/rejected": -0.234375,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.327,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.8046875,
|
|
"rewards/margins": 7.28125,
|
|
"rewards/rejected": -8.125,
|
|
"step": 382
|
|
},
|
|
{
|
|
"epoch": 0.4699386503067485,
|
|
"grad_norm": 33.53080318242638,
|
|
"learning_rate": 1.7041322314049587e-06,
|
|
"logits/chosen": -0.06005859375,
|
|
"logits/rejected": -0.21484375,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.5224,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.90234375,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 383
|
|
},
|
|
{
|
|
"epoch": 0.47116564417177914,
|
|
"grad_norm": 32.34787146638268,
|
|
"learning_rate": 1.7033057851239669e-06,
|
|
"logits/chosen": -0.166015625,
|
|
"logits/rejected": -0.3984375,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.3162,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.21875,
|
|
"rewards/margins": 7.84375,
|
|
"rewards/rejected": -9.0625,
|
|
"step": 384
|
|
},
|
|
{
|
|
"epoch": 0.4723926380368098,
|
|
"grad_norm": 31.518120862909818,
|
|
"learning_rate": 1.7024793388429753e-06,
|
|
"logits/chosen": -0.07080078125,
|
|
"logits/rejected": -0.244140625,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.3444,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.453125,
|
|
"rewards/margins": 6.59375,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 385
|
|
},
|
|
{
|
|
"epoch": 0.4736196319018405,
|
|
"grad_norm": 32.78015750065005,
|
|
"learning_rate": 1.7016528925619832e-06,
|
|
"logits/chosen": 0.00141143798828125,
|
|
"logits/rejected": -0.15625,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.3851,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.921875,
|
|
"rewards/margins": 6.21875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 386
|
|
},
|
|
{
|
|
"epoch": 0.47484662576687114,
|
|
"grad_norm": 49.31088394399299,
|
|
"learning_rate": 1.7008264462809916e-06,
|
|
"logits/chosen": -0.031005859375,
|
|
"logits/rejected": -0.2275390625,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.4591,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.0859375,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -8.625,
|
|
"step": 387
|
|
},
|
|
{
|
|
"epoch": 0.47607361963190187,
|
|
"grad_norm": 41.217564371521156,
|
|
"learning_rate": 1.6999999999999998e-06,
|
|
"logits/chosen": -0.037841796875,
|
|
"logits/rejected": -0.1318359375,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.5822,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -1.7734375,
|
|
"rewards/margins": 5.8125,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 388
|
|
},
|
|
{
|
|
"epoch": 0.47730061349693254,
|
|
"grad_norm": 36.38322446074805,
|
|
"learning_rate": 1.6991735537190082e-06,
|
|
"logits/chosen": -0.1083984375,
|
|
"logits/rejected": -0.1845703125,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.4835,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -1.4140625,
|
|
"rewards/margins": 6.625,
|
|
"rewards/rejected": -8.0,
|
|
"step": 389
|
|
},
|
|
{
|
|
"epoch": 0.4785276073619632,
|
|
"grad_norm": 35.6042632525022,
|
|
"learning_rate": 1.6983471074380164e-06,
|
|
"logits/chosen": -0.193359375,
|
|
"logits/rejected": -0.302734375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.5877,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -2.09375,
|
|
"rewards/margins": 6.3125,
|
|
"rewards/rejected": -8.375,
|
|
"step": 390
|
|
},
|
|
{
|
|
"epoch": 0.47975460122699387,
|
|
"grad_norm": 37.78834615655166,
|
|
"learning_rate": 1.6975206611570248e-06,
|
|
"logits/chosen": -0.08056640625,
|
|
"logits/rejected": -0.1943359375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.5839,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.765625,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 391
|
|
},
|
|
{
|
|
"epoch": 0.48098159509202454,
|
|
"grad_norm": 28.396924135723918,
|
|
"learning_rate": 1.696694214876033e-06,
|
|
"logits/chosen": -0.0213623046875,
|
|
"logits/rejected": -0.1650390625,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.356,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.5078125,
|
|
"rewards/margins": 7.125,
|
|
"rewards/rejected": -8.625,
|
|
"step": 392
|
|
},
|
|
{
|
|
"epoch": 0.4822085889570552,
|
|
"grad_norm": 30.381091525330017,
|
|
"learning_rate": 1.6958677685950414e-06,
|
|
"logits/chosen": 0.015380859375,
|
|
"logits/rejected": -0.12158203125,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.3579,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.78125,
|
|
"rewards/margins": 6.9375,
|
|
"rewards/rejected": -8.75,
|
|
"step": 393
|
|
},
|
|
{
|
|
"epoch": 0.4834355828220859,
|
|
"grad_norm": 31.404216078333306,
|
|
"learning_rate": 1.6950413223140496e-06,
|
|
"logits/chosen": -0.052001953125,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.323,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.9140625,
|
|
"rewards/margins": 6.5,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 394
|
|
},
|
|
{
|
|
"epoch": 0.48466257668711654,
|
|
"grad_norm": 32.32011609319193,
|
|
"learning_rate": 1.6942148760330578e-06,
|
|
"logits/chosen": -0.0556640625,
|
|
"logits/rejected": -0.1669921875,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.4117,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -1.703125,
|
|
"rewards/margins": 6.625,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 395
|
|
},
|
|
{
|
|
"epoch": 0.48588957055214727,
|
|
"grad_norm": 19.40179268006029,
|
|
"learning_rate": 1.693388429752066e-06,
|
|
"logits/chosen": -0.1396484375,
|
|
"logits/rejected": -0.3515625,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.2091,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -1.9609375,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -9.0,
|
|
"step": 396
|
|
},
|
|
{
|
|
"epoch": 0.48711656441717793,
|
|
"grad_norm": 29.664560996119025,
|
|
"learning_rate": 1.6925619834710744e-06,
|
|
"logits/chosen": -0.10595703125,
|
|
"logits/rejected": -0.26953125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.3894,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -2.15625,
|
|
"rewards/margins": 7.46875,
|
|
"rewards/rejected": -9.625,
|
|
"step": 397
|
|
},
|
|
{
|
|
"epoch": 0.4883435582822086,
|
|
"grad_norm": 35.227773979950804,
|
|
"learning_rate": 1.6917355371900825e-06,
|
|
"logits/chosen": -0.08642578125,
|
|
"logits/rejected": -0.234375,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.4568,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -1.6328125,
|
|
"rewards/margins": 7.0,
|
|
"rewards/rejected": -8.625,
|
|
"step": 398
|
|
},
|
|
{
|
|
"epoch": 0.48957055214723927,
|
|
"grad_norm": 25.713713057648395,
|
|
"learning_rate": 1.6909090909090907e-06,
|
|
"logits/chosen": -0.1142578125,
|
|
"logits/rejected": -0.2451171875,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.2951,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -1.4296875,
|
|
"rewards/margins": 7.15625,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 399
|
|
},
|
|
{
|
|
"epoch": 0.49079754601226994,
|
|
"grad_norm": 38.29848512087874,
|
|
"learning_rate": 1.6900826446280991e-06,
|
|
"logits/chosen": -0.034912109375,
|
|
"logits/rejected": -0.109375,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.5312,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.984375,
|
|
"rewards/margins": 6.21875,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 400
|
|
},
|
|
{
|
|
"epoch": 0.4920245398773006,
|
|
"grad_norm": 28.109129917116697,
|
|
"learning_rate": 1.6892561983471073e-06,
|
|
"logits/chosen": -0.1953125,
|
|
"logits/rejected": -0.328125,
|
|
"logps/chosen": -466.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.3478,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.6796875,
|
|
"rewards/margins": 8.25,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 401
|
|
},
|
|
{
|
|
"epoch": 0.49325153374233127,
|
|
"grad_norm": 30.844594503009763,
|
|
"learning_rate": 1.6884297520661157e-06,
|
|
"logits/chosen": -0.0240478515625,
|
|
"logits/rejected": -0.1240234375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.3713,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.3515625,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -8.375,
|
|
"step": 402
|
|
},
|
|
{
|
|
"epoch": 0.49447852760736194,
|
|
"grad_norm": 31.31430113596148,
|
|
"learning_rate": 1.687603305785124e-06,
|
|
"logits/chosen": -0.0257568359375,
|
|
"logits/rejected": -0.0966796875,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.3707,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.21875,
|
|
"rewards/margins": 7.4375,
|
|
"rewards/rejected": -8.625,
|
|
"step": 403
|
|
},
|
|
{
|
|
"epoch": 0.49570552147239266,
|
|
"grad_norm": 22.348999852720777,
|
|
"learning_rate": 1.686776859504132e-06,
|
|
"logits/chosen": 0.04052734375,
|
|
"logits/rejected": -0.08251953125,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.2533,
|
|
"rewards/accuracies": 0.921875,
|
|
"rewards/chosen": -0.875,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 404
|
|
},
|
|
{
|
|
"epoch": 0.49693251533742333,
|
|
"grad_norm": 33.32428200450095,
|
|
"learning_rate": 1.6859504132231403e-06,
|
|
"logits/chosen": -0.04931640625,
|
|
"logits/rejected": -0.275390625,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.4779,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.23046875,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -7.25,
|
|
"step": 405
|
|
},
|
|
{
|
|
"epoch": 0.498159509202454,
|
|
"grad_norm": 33.838303003033246,
|
|
"learning_rate": 1.6851239669421487e-06,
|
|
"logits/chosen": 0.0869140625,
|
|
"logits/rejected": 0.01220703125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.5869,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.8046875,
|
|
"rewards/margins": 6.4375,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 406
|
|
},
|
|
{
|
|
"epoch": 0.49938650306748467,
|
|
"grad_norm": 34.523252957550035,
|
|
"learning_rate": 1.6842975206611569e-06,
|
|
"logits/chosen": 0.07470703125,
|
|
"logits/rejected": -0.068359375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.4983,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.10400390625,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 407
|
|
},
|
|
{
|
|
"epoch": 0.5006134969325153,
|
|
"grad_norm": 37.89839337386224,
|
|
"learning_rate": 1.6834710743801653e-06,
|
|
"logits/chosen": -0.0157470703125,
|
|
"logits/rejected": -0.06494140625,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.5683,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -1.3203125,
|
|
"rewards/margins": 5.34375,
|
|
"rewards/rejected": -6.6875,
|
|
"step": 408
|
|
},
|
|
{
|
|
"epoch": 0.501840490797546,
|
|
"grad_norm": 42.296056623701546,
|
|
"learning_rate": 1.6826446280991735e-06,
|
|
"logits/chosen": 0.06396484375,
|
|
"logits/rejected": -0.1396484375,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.5362,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -0.69921875,
|
|
"rewards/margins": 6.625,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 409
|
|
},
|
|
{
|
|
"epoch": 0.5030674846625767,
|
|
"grad_norm": 29.901013858681456,
|
|
"learning_rate": 1.6818181818181819e-06,
|
|
"logits/chosen": 0.060791015625,
|
|
"logits/rejected": -0.1298828125,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.433,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.73046875,
|
|
"rewards/margins": 6.25,
|
|
"rewards/rejected": -7.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"epoch": 0.5042944785276073,
|
|
"grad_norm": 27.8739976076756,
|
|
"learning_rate": 1.68099173553719e-06,
|
|
"logits/chosen": 0.08740234375,
|
|
"logits/rejected": -0.060302734375,
|
|
"logps/chosen": -352.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.328,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.83203125,
|
|
"rewards/margins": 6.625,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 411
|
|
},
|
|
{
|
|
"epoch": 0.505521472392638,
|
|
"grad_norm": 39.10573268043823,
|
|
"learning_rate": 1.6801652892561985e-06,
|
|
"logits/chosen": 0.07275390625,
|
|
"logits/rejected": -0.061279296875,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.4836,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.89453125,
|
|
"rewards/margins": 6.125,
|
|
"rewards/rejected": -7.03125,
|
|
"step": 412
|
|
},
|
|
{
|
|
"epoch": 0.5067484662576687,
|
|
"grad_norm": 32.18764811981767,
|
|
"learning_rate": 1.6793388429752064e-06,
|
|
"logits/chosen": 0.01202392578125,
|
|
"logits/rejected": -0.205078125,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.3895,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.330078125,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -7.40625,
|
|
"step": 413
|
|
},
|
|
{
|
|
"epoch": 0.5079754601226993,
|
|
"grad_norm": 37.47692684242266,
|
|
"learning_rate": 1.6785123966942148e-06,
|
|
"logits/chosen": -0.0361328125,
|
|
"logits/rejected": -0.17578125,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.3699,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.259765625,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -7.125,
|
|
"step": 414
|
|
},
|
|
{
|
|
"epoch": 0.50920245398773,
|
|
"grad_norm": 28.99864003821869,
|
|
"learning_rate": 1.677685950413223e-06,
|
|
"logits/chosen": 0.009765625,
|
|
"logits/rejected": -0.162109375,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.3426,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.73046875,
|
|
"rewards/margins": 7.09375,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 415
|
|
},
|
|
{
|
|
"epoch": 0.5104294478527608,
|
|
"grad_norm": 24.822903845830673,
|
|
"learning_rate": 1.6768595041322314e-06,
|
|
"logits/chosen": 0.0439453125,
|
|
"logits/rejected": -0.1796875,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.1781,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": -0.8125,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -8.0,
|
|
"step": 416
|
|
},
|
|
{
|
|
"epoch": 0.5116564417177915,
|
|
"grad_norm": 31.299263604053785,
|
|
"learning_rate": 1.6760330578512396e-06,
|
|
"logits/chosen": -0.1865234375,
|
|
"logits/rejected": -0.3515625,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.3577,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": 0.09228515625,
|
|
"rewards/margins": 8.625,
|
|
"rewards/rejected": -8.5,
|
|
"step": 417
|
|
},
|
|
{
|
|
"epoch": 0.5128834355828221,
|
|
"grad_norm": 29.613749931860756,
|
|
"learning_rate": 1.6752066115702478e-06,
|
|
"logits/chosen": -0.09130859375,
|
|
"logits/rejected": -0.173828125,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.4501,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.703125,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 418
|
|
},
|
|
{
|
|
"epoch": 0.5141104294478528,
|
|
"grad_norm": 26.144467778424943,
|
|
"learning_rate": 1.6743801652892562e-06,
|
|
"logits/chosen": -0.0308837890625,
|
|
"logits/rejected": -0.19140625,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.3464,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.734375,
|
|
"rewards/margins": 8.5,
|
|
"rewards/rejected": -9.25,
|
|
"step": 419
|
|
},
|
|
{
|
|
"epoch": 0.5153374233128835,
|
|
"grad_norm": 26.869642618021608,
|
|
"learning_rate": 1.6735537190082644e-06,
|
|
"logits/chosen": 0.05908203125,
|
|
"logits/rejected": -0.099609375,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.367,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.1171875,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 420
|
|
},
|
|
{
|
|
"epoch": 0.5165644171779141,
|
|
"grad_norm": 29.165183667347375,
|
|
"learning_rate": 1.6727272727272726e-06,
|
|
"logits/chosen": 0.01806640625,
|
|
"logits/rejected": -0.1923828125,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.4518,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.046875,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 421
|
|
},
|
|
{
|
|
"epoch": 0.5177914110429448,
|
|
"grad_norm": 33.09732508946622,
|
|
"learning_rate": 1.6719008264462808e-06,
|
|
"logits/chosen": 0.08837890625,
|
|
"logits/rejected": -0.07275390625,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.4467,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.7265625,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -9.25,
|
|
"step": 422
|
|
},
|
|
{
|
|
"epoch": 0.5190184049079755,
|
|
"grad_norm": 34.07363427937366,
|
|
"learning_rate": 1.6710743801652892e-06,
|
|
"logits/chosen": -0.038818359375,
|
|
"logits/rejected": -0.1865234375,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.5543,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -2.0,
|
|
"rewards/margins": 6.6875,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 423
|
|
},
|
|
{
|
|
"epoch": 0.5202453987730061,
|
|
"grad_norm": 31.17924504882386,
|
|
"learning_rate": 1.6702479338842974e-06,
|
|
"logits/chosen": 0.051025390625,
|
|
"logits/rejected": -0.1416015625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.4885,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.21875,
|
|
"rewards/margins": 8.3125,
|
|
"rewards/rejected": -9.5,
|
|
"step": 424
|
|
},
|
|
{
|
|
"epoch": 0.5214723926380368,
|
|
"grad_norm": 33.85685434554039,
|
|
"learning_rate": 1.6694214876033058e-06,
|
|
"logits/chosen": 0.01318359375,
|
|
"logits/rejected": -0.0888671875,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.5854,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.515625,
|
|
"rewards/margins": 7.9375,
|
|
"rewards/rejected": -9.4375,
|
|
"step": 425
|
|
},
|
|
{
|
|
"epoch": 0.5226993865030675,
|
|
"grad_norm": 29.831685706099364,
|
|
"learning_rate": 1.668595041322314e-06,
|
|
"logits/chosen": -0.040771484375,
|
|
"logits/rejected": -0.1396484375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.4125,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.609375,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -9.625,
|
|
"step": 426
|
|
},
|
|
{
|
|
"epoch": 0.5239263803680981,
|
|
"grad_norm": 39.1961982480204,
|
|
"learning_rate": 1.6677685950413223e-06,
|
|
"logits/chosen": 0.01611328125,
|
|
"logits/rejected": -0.10400390625,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.512,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.6640625,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 427
|
|
},
|
|
{
|
|
"epoch": 0.5251533742331288,
|
|
"grad_norm": 32.948802126796025,
|
|
"learning_rate": 1.6669421487603305e-06,
|
|
"logits/chosen": -0.00872802734375,
|
|
"logits/rejected": -0.11962890625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.4635,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -2.5625,
|
|
"rewards/margins": 7.09375,
|
|
"rewards/rejected": -9.625,
|
|
"step": 428
|
|
},
|
|
{
|
|
"epoch": 0.5263803680981595,
|
|
"grad_norm": 26.957031491450675,
|
|
"learning_rate": 1.666115702479339e-06,
|
|
"logits/chosen": -0.01080322265625,
|
|
"logits/rejected": -0.11572265625,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.3077,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -2.390625,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -10.75,
|
|
"step": 429
|
|
},
|
|
{
|
|
"epoch": 0.5276073619631901,
|
|
"grad_norm": 24.559659605383004,
|
|
"learning_rate": 1.665289256198347e-06,
|
|
"logits/chosen": -0.0810546875,
|
|
"logits/rejected": -0.24609375,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.2681,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.4375,
|
|
"rewards/margins": 8.25,
|
|
"rewards/rejected": -9.6875,
|
|
"step": 430
|
|
},
|
|
{
|
|
"epoch": 0.5288343558282208,
|
|
"grad_norm": 37.10052986780247,
|
|
"learning_rate": 1.6644628099173553e-06,
|
|
"logits/chosen": 0.06103515625,
|
|
"logits/rejected": -0.1123046875,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.5234,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -2.59375,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -9.4375,
|
|
"step": 431
|
|
},
|
|
{
|
|
"epoch": 0.5300613496932516,
|
|
"grad_norm": 32.114960158791014,
|
|
"learning_rate": 1.6636363636363635e-06,
|
|
"logits/chosen": 0.10400390625,
|
|
"logits/rejected": 0.07373046875,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.4615,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -1.734375,
|
|
"rewards/margins": 7.09375,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 432
|
|
},
|
|
{
|
|
"epoch": 0.5312883435582823,
|
|
"grad_norm": 37.08856614918871,
|
|
"learning_rate": 1.6628099173553719e-06,
|
|
"logits/chosen": 0.1259765625,
|
|
"logits/rejected": -0.09716796875,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.5312,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -2.453125,
|
|
"rewards/margins": 6.9375,
|
|
"rewards/rejected": -9.375,
|
|
"step": 433
|
|
},
|
|
{
|
|
"epoch": 0.5325153374233129,
|
|
"grad_norm": 32.338206003482526,
|
|
"learning_rate": 1.66198347107438e-06,
|
|
"logits/chosen": -0.051513671875,
|
|
"logits/rejected": -0.1240234375,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.3539,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.9375,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 434
|
|
},
|
|
{
|
|
"epoch": 0.5337423312883436,
|
|
"grad_norm": 35.63181748097062,
|
|
"learning_rate": 1.6611570247933883e-06,
|
|
"logits/chosen": 0.026611328125,
|
|
"logits/rejected": -0.16796875,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.4125,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.5078125,
|
|
"rewards/margins": 7.59375,
|
|
"rewards/rejected": -9.125,
|
|
"step": 435
|
|
},
|
|
{
|
|
"epoch": 0.5349693251533743,
|
|
"grad_norm": 26.79650669342074,
|
|
"learning_rate": 1.6603305785123967e-06,
|
|
"logits/chosen": 0.004302978515625,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.2852,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.6875,
|
|
"rewards/margins": 8.25,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 436
|
|
},
|
|
{
|
|
"epoch": 0.5361963190184049,
|
|
"grad_norm": 25.79868080404115,
|
|
"learning_rate": 1.6595041322314049e-06,
|
|
"logits/chosen": -0.053955078125,
|
|
"logits/rejected": -0.22265625,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.2641,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.375,
|
|
"rewards/margins": 7.84375,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 437
|
|
},
|
|
{
|
|
"epoch": 0.5374233128834356,
|
|
"grad_norm": 32.79503864117327,
|
|
"learning_rate": 1.6586776859504133e-06,
|
|
"logits/chosen": 0.04833984375,
|
|
"logits/rejected": -0.040283203125,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.5513,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -2.0625,
|
|
"rewards/margins": 6.21875,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 438
|
|
},
|
|
{
|
|
"epoch": 0.5386503067484663,
|
|
"grad_norm": 33.94594995824427,
|
|
"learning_rate": 1.6578512396694212e-06,
|
|
"logits/chosen": 0.09130859375,
|
|
"logits/rejected": -0.09521484375,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.4675,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -2.0,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -9.0625,
|
|
"step": 439
|
|
},
|
|
{
|
|
"epoch": 0.5398773006134969,
|
|
"grad_norm": 36.04971662826716,
|
|
"learning_rate": 1.6570247933884296e-06,
|
|
"logits/chosen": 0.0556640625,
|
|
"logits/rejected": -0.048095703125,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.498,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -2.234375,
|
|
"rewards/margins": 5.96875,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 440
|
|
},
|
|
{
|
|
"epoch": 0.5411042944785276,
|
|
"grad_norm": 32.030469564543935,
|
|
"learning_rate": 1.6561983471074378e-06,
|
|
"logits/chosen": 0.130859375,
|
|
"logits/rejected": 0.02001953125,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.5277,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.9140625,
|
|
"rewards/margins": 6.65625,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 441
|
|
},
|
|
{
|
|
"epoch": 0.5423312883435583,
|
|
"grad_norm": 29.151132970928362,
|
|
"learning_rate": 1.6553719008264462e-06,
|
|
"logits/chosen": -0.035400390625,
|
|
"logits/rejected": -0.169921875,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.41,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -1.2578125,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 442
|
|
},
|
|
{
|
|
"epoch": 0.5435582822085889,
|
|
"grad_norm": 33.995027646717034,
|
|
"learning_rate": 1.6545454545454544e-06,
|
|
"logits/chosen": 0.005706787109375,
|
|
"logits/rejected": -0.11279296875,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.3994,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.0859375,
|
|
"rewards/margins": 7.4375,
|
|
"rewards/rejected": -8.5,
|
|
"step": 443
|
|
},
|
|
{
|
|
"epoch": 0.5447852760736196,
|
|
"grad_norm": 33.498123985496186,
|
|
"learning_rate": 1.6537190082644628e-06,
|
|
"logits/chosen": -0.032958984375,
|
|
"logits/rejected": -0.275390625,
|
|
"logps/chosen": -468.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.4238,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.1650390625,
|
|
"rewards/margins": 8.5625,
|
|
"rewards/rejected": -8.75,
|
|
"step": 444
|
|
},
|
|
{
|
|
"epoch": 0.5460122699386503,
|
|
"grad_norm": 30.345571262302183,
|
|
"learning_rate": 1.652892561983471e-06,
|
|
"logits/chosen": 0.01611328125,
|
|
"logits/rejected": -0.1865234375,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.4495,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.1171875,
|
|
"rewards/margins": 6.59375,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 445
|
|
},
|
|
{
|
|
"epoch": 0.5472392638036809,
|
|
"grad_norm": 25.42294156133156,
|
|
"learning_rate": 1.6520661157024794e-06,
|
|
"logits/chosen": -0.0213623046875,
|
|
"logits/rejected": -0.1806640625,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.2667,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.203125,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -8.25,
|
|
"step": 446
|
|
},
|
|
{
|
|
"epoch": 0.5484662576687117,
|
|
"grad_norm": 26.626753504524636,
|
|
"learning_rate": 1.6512396694214876e-06,
|
|
"logits/chosen": -0.0140380859375,
|
|
"logits/rejected": -0.2138671875,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.3418,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.2734375,
|
|
"rewards/margins": 9.0,
|
|
"rewards/rejected": -9.25,
|
|
"step": 447
|
|
},
|
|
{
|
|
"epoch": 0.5496932515337424,
|
|
"grad_norm": 29.24067416322435,
|
|
"learning_rate": 1.6504132231404958e-06,
|
|
"logits/chosen": 0.060546875,
|
|
"logits/rejected": -0.07958984375,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.3879,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.765625,
|
|
"rewards/margins": 6.65625,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 448
|
|
},
|
|
{
|
|
"epoch": 0.550920245398773,
|
|
"grad_norm": 30.067697923036302,
|
|
"learning_rate": 1.649586776859504e-06,
|
|
"logits/chosen": -0.01446533203125,
|
|
"logits/rejected": -0.1435546875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.386,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.70703125,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 449
|
|
},
|
|
{
|
|
"epoch": 0.5521472392638037,
|
|
"grad_norm": 21.694636403313346,
|
|
"learning_rate": 1.6487603305785124e-06,
|
|
"logits/chosen": -0.08984375,
|
|
"logits/rejected": -0.1298828125,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.2156,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -1.1015625,
|
|
"rewards/margins": 7.46875,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 450
|
|
},
|
|
{
|
|
"epoch": 0.5533742331288344,
|
|
"grad_norm": 29.05380302467979,
|
|
"learning_rate": 1.6479338842975206e-06,
|
|
"logits/chosen": 0.04931640625,
|
|
"logits/rejected": -0.1220703125,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.3986,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.1953125,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -8.25,
|
|
"step": 451
|
|
},
|
|
{
|
|
"epoch": 0.554601226993865,
|
|
"grad_norm": 27.760646528113295,
|
|
"learning_rate": 1.647107438016529e-06,
|
|
"logits/chosen": -0.0255126953125,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -478.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.3005,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 0.0673828125,
|
|
"rewards/margins": 8.25,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 452
|
|
},
|
|
{
|
|
"epoch": 0.5558282208588957,
|
|
"grad_norm": 25.281076585136077,
|
|
"learning_rate": 1.6462809917355371e-06,
|
|
"logits/chosen": -0.1201171875,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.3418,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": 0.310546875,
|
|
"rewards/margins": 8.6875,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 453
|
|
},
|
|
{
|
|
"epoch": 0.5570552147239264,
|
|
"grad_norm": 30.44623133664489,
|
|
"learning_rate": 1.6454545454545453e-06,
|
|
"logits/chosen": 0.062255859375,
|
|
"logits/rejected": -0.0074462890625,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.3232,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.96875,
|
|
"rewards/margins": 6.65625,
|
|
"rewards/rejected": -8.625,
|
|
"step": 454
|
|
},
|
|
{
|
|
"epoch": 0.558282208588957,
|
|
"grad_norm": 24.33104579537843,
|
|
"learning_rate": 1.6446280991735537e-06,
|
|
"logits/chosen": -0.061279296875,
|
|
"logits/rejected": -0.1806640625,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.2398,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.28125,
|
|
"rewards/margins": 8.3125,
|
|
"rewards/rejected": -8.625,
|
|
"step": 455
|
|
},
|
|
{
|
|
"epoch": 0.5595092024539877,
|
|
"grad_norm": 31.508968261672358,
|
|
"learning_rate": 1.643801652892562e-06,
|
|
"logits/chosen": 0.062255859375,
|
|
"logits/rejected": -0.039306640625,
|
|
"logps/chosen": -338.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.4011,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.4140625,
|
|
"rewards/margins": 7.34375,
|
|
"rewards/rejected": -8.75,
|
|
"step": 456
|
|
},
|
|
{
|
|
"epoch": 0.5607361963190184,
|
|
"grad_norm": 34.26099970076489,
|
|
"learning_rate": 1.6429752066115701e-06,
|
|
"logits/chosen": 0.03466796875,
|
|
"logits/rejected": -0.09033203125,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.3637,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -1.296875,
|
|
"rewards/margins": 6.84375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 457
|
|
},
|
|
{
|
|
"epoch": 0.561963190184049,
|
|
"grad_norm": 30.109525941506696,
|
|
"learning_rate": 1.6421487603305783e-06,
|
|
"logits/chosen": -0.00640869140625,
|
|
"logits/rejected": -0.1630859375,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.3595,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.5390625,
|
|
"rewards/margins": 8.0,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 458
|
|
},
|
|
{
|
|
"epoch": 0.5631901840490797,
|
|
"grad_norm": 36.85257202668565,
|
|
"learning_rate": 1.6413223140495867e-06,
|
|
"logits/chosen": 0.007232666015625,
|
|
"logits/rejected": -0.154296875,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.5023,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.6484375,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -8.5,
|
|
"step": 459
|
|
},
|
|
{
|
|
"epoch": 0.5644171779141104,
|
|
"grad_norm": 26.689470495593376,
|
|
"learning_rate": 1.6404958677685949e-06,
|
|
"logits/chosen": 0.00799560546875,
|
|
"logits/rejected": -0.08837890625,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.2689,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -1.3046875,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 460
|
|
},
|
|
{
|
|
"epoch": 0.5656441717791411,
|
|
"grad_norm": 30.131225321307415,
|
|
"learning_rate": 1.6396694214876033e-06,
|
|
"logits/chosen": -0.193359375,
|
|
"logits/rejected": -0.30859375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.3315,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.3125,
|
|
"rewards/margins": 7.0,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 461
|
|
},
|
|
{
|
|
"epoch": 0.5668711656441717,
|
|
"grad_norm": 36.664773364106914,
|
|
"learning_rate": 1.6388429752066115e-06,
|
|
"logits/chosen": 0.0751953125,
|
|
"logits/rejected": -0.1318359375,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.4811,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.9453125,
|
|
"rewards/margins": 6.34375,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 462
|
|
},
|
|
{
|
|
"epoch": 0.5680981595092025,
|
|
"grad_norm": 33.81030632438629,
|
|
"learning_rate": 1.6380165289256199e-06,
|
|
"logits/chosen": -0.061767578125,
|
|
"logits/rejected": -0.16015625,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.4107,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -0.796875,
|
|
"rewards/margins": 7.5,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 463
|
|
},
|
|
{
|
|
"epoch": 0.5693251533742332,
|
|
"grad_norm": 32.34074085259671,
|
|
"learning_rate": 1.637190082644628e-06,
|
|
"logits/chosen": 0.08056640625,
|
|
"logits/rejected": -0.0859375,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.3949,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.95703125,
|
|
"rewards/margins": 7.34375,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 464
|
|
},
|
|
{
|
|
"epoch": 0.5705521472392638,
|
|
"grad_norm": 21.5163436057995,
|
|
"learning_rate": 1.6363636363636365e-06,
|
|
"logits/chosen": -0.0439453125,
|
|
"logits/rejected": -0.283203125,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.1748,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -0.494140625,
|
|
"rewards/margins": 8.6875,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 465
|
|
},
|
|
{
|
|
"epoch": 0.5717791411042945,
|
|
"grad_norm": 28.68434013700241,
|
|
"learning_rate": 1.6355371900826444e-06,
|
|
"logits/chosen": 0.005279541015625,
|
|
"logits/rejected": -0.11474609375,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.3459,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.2890625,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -9.375,
|
|
"step": 466
|
|
},
|
|
{
|
|
"epoch": 0.5730061349693252,
|
|
"grad_norm": 36.260436829882615,
|
|
"learning_rate": 1.6347107438016528e-06,
|
|
"logits/chosen": -0.0074462890625,
|
|
"logits/rejected": -0.216796875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.4537,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.40234375,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 467
|
|
},
|
|
{
|
|
"epoch": 0.5742331288343558,
|
|
"grad_norm": 30.576534183272877,
|
|
"learning_rate": 1.633884297520661e-06,
|
|
"logits/chosen": -0.0302734375,
|
|
"logits/rejected": -0.1708984375,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.358,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.56640625,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -8.625,
|
|
"step": 468
|
|
},
|
|
{
|
|
"epoch": 0.5754601226993865,
|
|
"grad_norm": 20.828105770865267,
|
|
"learning_rate": 1.6330578512396694e-06,
|
|
"logits/chosen": 0.039306640625,
|
|
"logits/rejected": -0.1328125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.2384,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -0.25390625,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -8.625,
|
|
"step": 469
|
|
},
|
|
{
|
|
"epoch": 0.5766871165644172,
|
|
"grad_norm": 32.1934779412918,
|
|
"learning_rate": 1.6322314049586776e-06,
|
|
"logits/chosen": 0.00182342529296875,
|
|
"logits/rejected": -0.059326171875,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.4375,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.330078125,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 470
|
|
},
|
|
{
|
|
"epoch": 0.5779141104294478,
|
|
"grad_norm": 30.801755679882532,
|
|
"learning_rate": 1.6314049586776858e-06,
|
|
"logits/chosen": 0.12890625,
|
|
"logits/rejected": -0.0341796875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.3906,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.7734375,
|
|
"rewards/margins": 7.125,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 471
|
|
},
|
|
{
|
|
"epoch": 0.5791411042944785,
|
|
"grad_norm": 29.381294679796277,
|
|
"learning_rate": 1.6305785123966942e-06,
|
|
"logits/chosen": 0.07568359375,
|
|
"logits/rejected": -0.1435546875,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.4164,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.58203125,
|
|
"rewards/margins": 7.46875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 472
|
|
},
|
|
{
|
|
"epoch": 0.5803680981595092,
|
|
"grad_norm": 28.86485366882726,
|
|
"learning_rate": 1.6297520661157024e-06,
|
|
"logits/chosen": -0.1005859375,
|
|
"logits/rejected": -0.2080078125,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.3996,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.9609375,
|
|
"rewards/margins": 7.34375,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 473
|
|
},
|
|
{
|
|
"epoch": 0.5815950920245399,
|
|
"grad_norm": 34.86225551699741,
|
|
"learning_rate": 1.6289256198347108e-06,
|
|
"logits/chosen": -0.05712890625,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.417,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.1015625,
|
|
"rewards/margins": 7.09375,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 474
|
|
},
|
|
{
|
|
"epoch": 0.5828220858895705,
|
|
"grad_norm": 27.36425660979793,
|
|
"learning_rate": 1.6280991735537188e-06,
|
|
"logits/chosen": -0.0634765625,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.2677,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": 0.330078125,
|
|
"rewards/margins": 9.0625,
|
|
"rewards/rejected": -8.75,
|
|
"step": 475
|
|
},
|
|
{
|
|
"epoch": 0.5840490797546012,
|
|
"grad_norm": 31.880656616958664,
|
|
"learning_rate": 1.6272727272727272e-06,
|
|
"logits/chosen": 0.019287109375,
|
|
"logits/rejected": -0.171875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.4031,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -2.0625,
|
|
"rewards/margins": 7.0,
|
|
"rewards/rejected": -9.0625,
|
|
"step": 476
|
|
},
|
|
{
|
|
"epoch": 0.5852760736196319,
|
|
"grad_norm": 30.464791239585146,
|
|
"learning_rate": 1.6264462809917354e-06,
|
|
"logits/chosen": -0.11083984375,
|
|
"logits/rejected": -0.251953125,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.3943,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.1015625,
|
|
"rewards/margins": 8.125,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 477
|
|
},
|
|
{
|
|
"epoch": 0.5865030674846625,
|
|
"grad_norm": 29.036598686433265,
|
|
"learning_rate": 1.6256198347107438e-06,
|
|
"logits/chosen": -0.041015625,
|
|
"logits/rejected": -0.2060546875,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.4365,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.15625,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -9.25,
|
|
"step": 478
|
|
},
|
|
{
|
|
"epoch": 0.5877300613496933,
|
|
"grad_norm": 35.33691552489953,
|
|
"learning_rate": 1.624793388429752e-06,
|
|
"logits/chosen": -0.03515625,
|
|
"logits/rejected": -0.294921875,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.4108,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -2.515625,
|
|
"rewards/margins": 6.9375,
|
|
"rewards/rejected": -9.4375,
|
|
"step": 479
|
|
},
|
|
{
|
|
"epoch": 0.588957055214724,
|
|
"grad_norm": 23.80285309086163,
|
|
"learning_rate": 1.6239669421487603e-06,
|
|
"logits/chosen": -0.07763671875,
|
|
"logits/rejected": -0.2119140625,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.2707,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -2.265625,
|
|
"rewards/margins": 7.78125,
|
|
"rewards/rejected": -10.0625,
|
|
"step": 480
|
|
},
|
|
{
|
|
"epoch": 0.5901840490797546,
|
|
"grad_norm": 35.80293196148993,
|
|
"learning_rate": 1.6231404958677685e-06,
|
|
"logits/chosen": -0.0673828125,
|
|
"logits/rejected": -0.1708984375,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.622,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": -2.453125,
|
|
"rewards/margins": 7.125,
|
|
"rewards/rejected": -9.5625,
|
|
"step": 481
|
|
},
|
|
{
|
|
"epoch": 0.5914110429447853,
|
|
"grad_norm": 34.65439060835562,
|
|
"learning_rate": 1.622314049586777e-06,
|
|
"logits/chosen": -0.0673828125,
|
|
"logits/rejected": -0.2421875,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.4303,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -2.1875,
|
|
"rewards/margins": 7.25,
|
|
"rewards/rejected": -9.4375,
|
|
"step": 482
|
|
},
|
|
{
|
|
"epoch": 0.592638036809816,
|
|
"grad_norm": 31.444826892788168,
|
|
"learning_rate": 1.6214876033057851e-06,
|
|
"logits/chosen": 0.095703125,
|
|
"logits/rejected": -0.0390625,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.3818,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -2.515625,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -9.6875,
|
|
"step": 483
|
|
},
|
|
{
|
|
"epoch": 0.5938650306748466,
|
|
"grad_norm": 27.51029947994524,
|
|
"learning_rate": 1.6206611570247933e-06,
|
|
"logits/chosen": 0.01904296875,
|
|
"logits/rejected": -0.12890625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.3657,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -2.015625,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 484
|
|
},
|
|
{
|
|
"epoch": 0.5950920245398773,
|
|
"grad_norm": 26.154018775320584,
|
|
"learning_rate": 1.6198347107438015e-06,
|
|
"logits/chosen": 0.048095703125,
|
|
"logits/rejected": -0.09814453125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.3404,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -2.34375,
|
|
"rewards/margins": 7.3125,
|
|
"rewards/rejected": -9.6875,
|
|
"step": 485
|
|
},
|
|
{
|
|
"epoch": 0.596319018404908,
|
|
"grad_norm": 34.37685592814866,
|
|
"learning_rate": 1.61900826446281e-06,
|
|
"logits/chosen": 0.0174560546875,
|
|
"logits/rejected": -0.123046875,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.4585,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.796875,
|
|
"rewards/margins": 7.40625,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 486
|
|
},
|
|
{
|
|
"epoch": 0.5975460122699386,
|
|
"grad_norm": 27.47900846288338,
|
|
"learning_rate": 1.618181818181818e-06,
|
|
"logits/chosen": -0.0615234375,
|
|
"logits/rejected": -0.25,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.3123,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.4375,
|
|
"rewards/margins": 7.8125,
|
|
"rewards/rejected": -9.25,
|
|
"step": 487
|
|
},
|
|
{
|
|
"epoch": 0.5987730061349693,
|
|
"grad_norm": 36.13068312451185,
|
|
"learning_rate": 1.6173553719008263e-06,
|
|
"logits/chosen": -0.04541015625,
|
|
"logits/rejected": -0.11572265625,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.3745,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.1796875,
|
|
"rewards/margins": 7.5625,
|
|
"rewards/rejected": -8.75,
|
|
"step": 488
|
|
},
|
|
{
|
|
"epoch": 0.6,
|
|
"grad_norm": 26.73911141460869,
|
|
"learning_rate": 1.6165289256198347e-06,
|
|
"logits/chosen": 0.041015625,
|
|
"logits/rejected": -0.197265625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.3578,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.703125,
|
|
"rewards/margins": 8.5,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 489
|
|
},
|
|
{
|
|
"epoch": 0.6012269938650306,
|
|
"grad_norm": 36.382967520176734,
|
|
"learning_rate": 1.6157024793388429e-06,
|
|
"logits/chosen": 0.08251953125,
|
|
"logits/rejected": -0.140625,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.4165,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.4921875,
|
|
"rewards/margins": 7.46875,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 490
|
|
},
|
|
{
|
|
"epoch": 0.6024539877300613,
|
|
"grad_norm": 27.49616128734612,
|
|
"learning_rate": 1.6148760330578513e-06,
|
|
"logits/chosen": 0.10595703125,
|
|
"logits/rejected": -0.1083984375,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.3207,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.71875,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 491
|
|
},
|
|
{
|
|
"epoch": 0.603680981595092,
|
|
"grad_norm": 31.229926152563383,
|
|
"learning_rate": 1.6140495867768595e-06,
|
|
"logits/chosen": 0.0120849609375,
|
|
"logits/rejected": -0.126953125,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.395,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.95703125,
|
|
"rewards/margins": 7.125,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 492
|
|
},
|
|
{
|
|
"epoch": 0.6049079754601226,
|
|
"grad_norm": 36.65718970012216,
|
|
"learning_rate": 1.6132231404958676e-06,
|
|
"logits/chosen": 0.1748046875,
|
|
"logits/rejected": 0.0751953125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.5391,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -1.1953125,
|
|
"rewards/margins": 6.3125,
|
|
"rewards/rejected": -7.5,
|
|
"step": 493
|
|
},
|
|
{
|
|
"epoch": 0.6061349693251534,
|
|
"grad_norm": 27.396936278667518,
|
|
"learning_rate": 1.6123966942148758e-06,
|
|
"logits/chosen": 0.0703125,
|
|
"logits/rejected": -0.123046875,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.348,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 0.263671875,
|
|
"rewards/margins": 7.8125,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 494
|
|
},
|
|
{
|
|
"epoch": 0.6073619631901841,
|
|
"grad_norm": 29.785285979180106,
|
|
"learning_rate": 1.6115702479338842e-06,
|
|
"logits/chosen": 0.05810546875,
|
|
"logits/rejected": -0.0751953125,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.333,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": 0.0908203125,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -7.625,
|
|
"step": 495
|
|
},
|
|
{
|
|
"epoch": 0.6085889570552148,
|
|
"grad_norm": 32.75051850367622,
|
|
"learning_rate": 1.6107438016528924e-06,
|
|
"logits/chosen": 0.0289306640625,
|
|
"logits/rejected": -0.177734375,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.4067,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.859375,
|
|
"rewards/margins": 6.65625,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 496
|
|
},
|
|
{
|
|
"epoch": 0.6098159509202454,
|
|
"grad_norm": 35.788337904833995,
|
|
"learning_rate": 1.6099173553719008e-06,
|
|
"logits/chosen": 0.064453125,
|
|
"logits/rejected": -0.09716796875,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.5822,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -0.7578125,
|
|
"rewards/margins": 6.71875,
|
|
"rewards/rejected": -7.5,
|
|
"step": 497
|
|
},
|
|
{
|
|
"epoch": 0.6110429447852761,
|
|
"grad_norm": 22.907226961366156,
|
|
"learning_rate": 1.609090909090909e-06,
|
|
"logits/chosen": -0.07666015625,
|
|
"logits/rejected": -0.2431640625,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.2661,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 0.27734375,
|
|
"rewards/margins": 7.96875,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 498
|
|
},
|
|
{
|
|
"epoch": 0.6122699386503068,
|
|
"grad_norm": 34.24843898159494,
|
|
"learning_rate": 1.6082644628099174e-06,
|
|
"logits/chosen": 0.06591796875,
|
|
"logits/rejected": -0.15234375,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.3593,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 0.09423828125,
|
|
"rewards/margins": 7.4375,
|
|
"rewards/rejected": -7.34375,
|
|
"step": 499
|
|
},
|
|
{
|
|
"epoch": 0.6134969325153374,
|
|
"grad_norm": 28.722358927789386,
|
|
"learning_rate": 1.6074380165289256e-06,
|
|
"logits/chosen": 0.0517578125,
|
|
"logits/rejected": -0.06494140625,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.4054,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.036376953125,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -7.90625,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 0.6147239263803681,
|
|
"grad_norm": 34.150010229312755,
|
|
"learning_rate": 1.6066115702479338e-06,
|
|
"logits/chosen": -0.0091552734375,
|
|
"logits/rejected": -0.14453125,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.5046,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": 0.34375,
|
|
"rewards/margins": 7.84375,
|
|
"rewards/rejected": -7.5,
|
|
"step": 501
|
|
},
|
|
{
|
|
"epoch": 0.6159509202453988,
|
|
"grad_norm": 26.403907755376803,
|
|
"learning_rate": 1.605785123966942e-06,
|
|
"logits/chosen": 0.01611328125,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.3918,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.1611328125,
|
|
"rewards/margins": 8.25,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 502
|
|
},
|
|
{
|
|
"epoch": 0.6171779141104294,
|
|
"grad_norm": 24.760791882275143,
|
|
"learning_rate": 1.6049586776859504e-06,
|
|
"logits/chosen": 0.2294921875,
|
|
"logits/rejected": 0.039306640625,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.2949,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.69140625,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -7.875,
|
|
"step": 503
|
|
},
|
|
{
|
|
"epoch": 0.6184049079754601,
|
|
"grad_norm": 23.71665205403551,
|
|
"learning_rate": 1.6041322314049586e-06,
|
|
"logits/chosen": -0.0230712890625,
|
|
"logits/rejected": -0.197265625,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.3141,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -0.921875,
|
|
"rewards/margins": 6.75,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 504
|
|
},
|
|
{
|
|
"epoch": 0.6196319018404908,
|
|
"grad_norm": 38.50109225572899,
|
|
"learning_rate": 1.603305785123967e-06,
|
|
"logits/chosen": -0.04296875,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.4973,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.4375,
|
|
"rewards/margins": 7.34375,
|
|
"rewards/rejected": -8.75,
|
|
"step": 505
|
|
},
|
|
{
|
|
"epoch": 0.6208588957055214,
|
|
"grad_norm": 71.7214412137413,
|
|
"learning_rate": 1.6024793388429752e-06,
|
|
"logits/chosen": 0.11181640625,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.3839,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.71875,
|
|
"rewards/margins": 7.59375,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 506
|
|
},
|
|
{
|
|
"epoch": 0.6220858895705521,
|
|
"grad_norm": 21.732522573710003,
|
|
"learning_rate": 1.6016528925619833e-06,
|
|
"logits/chosen": -0.003875732421875,
|
|
"logits/rejected": -0.1103515625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.1964,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -0.53125,
|
|
"rewards/margins": 7.96875,
|
|
"rewards/rejected": -8.5,
|
|
"step": 507
|
|
},
|
|
{
|
|
"epoch": 0.6233128834355828,
|
|
"grad_norm": 30.43220654300823,
|
|
"learning_rate": 1.6008264462809917e-06,
|
|
"logits/chosen": 0.1923828125,
|
|
"logits/rejected": 0.01165771484375,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.3349,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.828125,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -7.875,
|
|
"step": 508
|
|
},
|
|
{
|
|
"epoch": 0.6245398773006134,
|
|
"grad_norm": 35.34543973547442,
|
|
"learning_rate": 1.6e-06,
|
|
"logits/chosen": 0.01458740234375,
|
|
"logits/rejected": -0.2177734375,
|
|
"logps/chosen": -480.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.6533,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": 0.515625,
|
|
"rewards/margins": 8.75,
|
|
"rewards/rejected": -8.25,
|
|
"step": 509
|
|
},
|
|
{
|
|
"epoch": 0.6257668711656442,
|
|
"grad_norm": 25.003483454597998,
|
|
"learning_rate": 1.5991735537190081e-06,
|
|
"logits/chosen": -0.06103515625,
|
|
"logits/rejected": -0.2470703125,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.3203,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -1.0,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 510
|
|
},
|
|
{
|
|
"epoch": 0.6269938650306749,
|
|
"grad_norm": 30.436670043501266,
|
|
"learning_rate": 1.5983471074380163e-06,
|
|
"logits/chosen": -0.0908203125,
|
|
"logits/rejected": -0.2138671875,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.3842,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.423828125,
|
|
"rewards/margins": 7.90625,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 511
|
|
},
|
|
{
|
|
"epoch": 0.6282208588957056,
|
|
"grad_norm": 32.41055767899847,
|
|
"learning_rate": 1.5975206611570247e-06,
|
|
"logits/chosen": 0.134765625,
|
|
"logits/rejected": -0.00994873046875,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.5097,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.40625,
|
|
"rewards/margins": 6.25,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 512
|
|
},
|
|
{
|
|
"epoch": 0.6294478527607362,
|
|
"grad_norm": 30.869411742460052,
|
|
"learning_rate": 1.5966942148760329e-06,
|
|
"logits/chosen": 0.13671875,
|
|
"logits/rejected": 0.00860595703125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.4822,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -0.8671875,
|
|
"rewards/margins": 7.40625,
|
|
"rewards/rejected": -8.25,
|
|
"step": 513
|
|
},
|
|
{
|
|
"epoch": 0.6306748466257669,
|
|
"grad_norm": 27.57757346290667,
|
|
"learning_rate": 1.5958677685950413e-06,
|
|
"logits/chosen": 0.158203125,
|
|
"logits/rejected": 0.004974365234375,
|
|
"logps/chosen": -346.0,
|
|
"logps/rejected": -314.0,
|
|
"loss": 0.2937,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.7578125,
|
|
"rewards/margins": 6.96875,
|
|
"rewards/rejected": -8.75,
|
|
"step": 514
|
|
},
|
|
{
|
|
"epoch": 0.6319018404907976,
|
|
"grad_norm": 30.371864264428428,
|
|
"learning_rate": 1.5950413223140495e-06,
|
|
"logits/chosen": 0.130859375,
|
|
"logits/rejected": -0.0194091796875,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.3528,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.890625,
|
|
"rewards/margins": 6.84375,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 515
|
|
},
|
|
{
|
|
"epoch": 0.6331288343558282,
|
|
"grad_norm": 25.700607667521123,
|
|
"learning_rate": 1.5942148760330579e-06,
|
|
"logits/chosen": 0.0927734375,
|
|
"logits/rejected": -0.020263671875,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.2479,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.71875,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -8.75,
|
|
"step": 516
|
|
},
|
|
{
|
|
"epoch": 0.6343558282208589,
|
|
"grad_norm": 35.013987422735795,
|
|
"learning_rate": 1.593388429752066e-06,
|
|
"logits/chosen": 0.138671875,
|
|
"logits/rejected": -0.0169677734375,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.5313,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -1.59375,
|
|
"rewards/margins": 6.625,
|
|
"rewards/rejected": -8.25,
|
|
"step": 517
|
|
},
|
|
{
|
|
"epoch": 0.6355828220858896,
|
|
"grad_norm": 25.25730204534431,
|
|
"learning_rate": 1.5925619834710745e-06,
|
|
"logits/chosen": 0.01300048828125,
|
|
"logits/rejected": -0.0869140625,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.2264,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.77734375,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 518
|
|
},
|
|
{
|
|
"epoch": 0.6368098159509202,
|
|
"grad_norm": 33.20839003769473,
|
|
"learning_rate": 1.5917355371900824e-06,
|
|
"logits/chosen": 0.03564453125,
|
|
"logits/rejected": -0.107421875,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.3779,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.8671875,
|
|
"rewards/margins": 7.40625,
|
|
"rewards/rejected": -9.25,
|
|
"step": 519
|
|
},
|
|
{
|
|
"epoch": 0.6380368098159509,
|
|
"grad_norm": 27.098797675737742,
|
|
"learning_rate": 1.5909090909090908e-06,
|
|
"logits/chosen": 0.01080322265625,
|
|
"logits/rejected": -0.2197265625,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.3268,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.515625,
|
|
"rewards/margins": 8.5,
|
|
"rewards/rejected": -10.0625,
|
|
"step": 520
|
|
},
|
|
{
|
|
"epoch": 0.6392638036809816,
|
|
"grad_norm": 25.557455564203316,
|
|
"learning_rate": 1.590082644628099e-06,
|
|
"logits/chosen": 0.2158203125,
|
|
"logits/rejected": 0.0673828125,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.3273,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -1.7734375,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -10.125,
|
|
"step": 521
|
|
},
|
|
{
|
|
"epoch": 0.6404907975460122,
|
|
"grad_norm": 26.296777147407337,
|
|
"learning_rate": 1.5892561983471074e-06,
|
|
"logits/chosen": -0.00885009765625,
|
|
"logits/rejected": -0.158203125,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.3643,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -2.34375,
|
|
"rewards/margins": 8.625,
|
|
"rewards/rejected": -11.0,
|
|
"step": 522
|
|
},
|
|
{
|
|
"epoch": 0.6417177914110429,
|
|
"grad_norm": 34.909791507886766,
|
|
"learning_rate": 1.5884297520661156e-06,
|
|
"logits/chosen": 0.07177734375,
|
|
"logits/rejected": -0.08447265625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.5212,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -3.34375,
|
|
"rewards/margins": 6.65625,
|
|
"rewards/rejected": -10.0,
|
|
"step": 523
|
|
},
|
|
{
|
|
"epoch": 0.6429447852760736,
|
|
"grad_norm": 35.306110095538884,
|
|
"learning_rate": 1.5876033057851238e-06,
|
|
"logits/chosen": 0.09619140625,
|
|
"logits/rejected": -0.107421875,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.4883,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -3.65625,
|
|
"rewards/margins": 6.59375,
|
|
"rewards/rejected": -10.25,
|
|
"step": 524
|
|
},
|
|
{
|
|
"epoch": 0.6441717791411042,
|
|
"grad_norm": 42.08361150244396,
|
|
"learning_rate": 1.5867768595041322e-06,
|
|
"logits/chosen": 0.12353515625,
|
|
"logits/rejected": 0.07373046875,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.6614,
|
|
"rewards/accuracies": 0.7578125,
|
|
"rewards/chosen": -4.125,
|
|
"rewards/margins": 5.78125,
|
|
"rewards/rejected": -9.9375,
|
|
"step": 525
|
|
},
|
|
{
|
|
"epoch": 0.645398773006135,
|
|
"grad_norm": 30.66385671655035,
|
|
"learning_rate": 1.5859504132231404e-06,
|
|
"logits/chosen": 0.0888671875,
|
|
"logits/rejected": -0.06005859375,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.3992,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -3.390625,
|
|
"rewards/margins": 7.3125,
|
|
"rewards/rejected": -10.6875,
|
|
"step": 526
|
|
},
|
|
{
|
|
"epoch": 0.6466257668711657,
|
|
"grad_norm": 29.996892955815646,
|
|
"learning_rate": 1.5851239669421488e-06,
|
|
"logits/chosen": 0.1611328125,
|
|
"logits/rejected": -0.061279296875,
|
|
"logps/chosen": -466.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.3949,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -3.59375,
|
|
"rewards/margins": 7.21875,
|
|
"rewards/rejected": -10.8125,
|
|
"step": 527
|
|
},
|
|
{
|
|
"epoch": 0.6478527607361964,
|
|
"grad_norm": 24.00032978466971,
|
|
"learning_rate": 1.5842975206611568e-06,
|
|
"logits/chosen": -0.00897216796875,
|
|
"logits/rejected": -0.19140625,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.3277,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -3.59375,
|
|
"rewards/margins": 7.59375,
|
|
"rewards/rejected": -11.1875,
|
|
"step": 528
|
|
},
|
|
{
|
|
"epoch": 0.649079754601227,
|
|
"grad_norm": 29.084542618150397,
|
|
"learning_rate": 1.5834710743801652e-06,
|
|
"logits/chosen": 0.06396484375,
|
|
"logits/rejected": -0.1142578125,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.4317,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -3.578125,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -10.75,
|
|
"step": 529
|
|
},
|
|
{
|
|
"epoch": 0.6503067484662577,
|
|
"grad_norm": 25.801081390477748,
|
|
"learning_rate": 1.5826446280991734e-06,
|
|
"logits/chosen": 0.1123046875,
|
|
"logits/rejected": -0.01495361328125,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.2661,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -3.28125,
|
|
"rewards/margins": 7.6875,
|
|
"rewards/rejected": -10.9375,
|
|
"step": 530
|
|
},
|
|
{
|
|
"epoch": 0.6515337423312884,
|
|
"grad_norm": 23.866451346648457,
|
|
"learning_rate": 1.5818181818181818e-06,
|
|
"logits/chosen": 0.037841796875,
|
|
"logits/rejected": -0.1416015625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.2961,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -3.40625,
|
|
"rewards/margins": 7.3125,
|
|
"rewards/rejected": -10.75,
|
|
"step": 531
|
|
},
|
|
{
|
|
"epoch": 0.652760736196319,
|
|
"grad_norm": 27.455946324648277,
|
|
"learning_rate": 1.58099173553719e-06,
|
|
"logits/chosen": 0.1611328125,
|
|
"logits/rejected": 0.018310546875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.3709,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -3.375,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -10.25,
|
|
"step": 532
|
|
},
|
|
{
|
|
"epoch": 0.6539877300613497,
|
|
"grad_norm": 25.813940321838846,
|
|
"learning_rate": 1.5801652892561984e-06,
|
|
"logits/chosen": -0.030517578125,
|
|
"logits/rejected": -0.2333984375,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.3182,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -2.203125,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -10.5625,
|
|
"step": 533
|
|
},
|
|
{
|
|
"epoch": 0.6552147239263804,
|
|
"grad_norm": 25.906290815392918,
|
|
"learning_rate": 1.5793388429752065e-06,
|
|
"logits/chosen": 0.1259765625,
|
|
"logits/rejected": 0.004913330078125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.3372,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -3.0625,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -9.9375,
|
|
"step": 534
|
|
},
|
|
{
|
|
"epoch": 0.656441717791411,
|
|
"grad_norm": 32.230057629912686,
|
|
"learning_rate": 1.578512396694215e-06,
|
|
"logits/chosen": 0.0155029296875,
|
|
"logits/rejected": -0.0888671875,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.3744,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -3.671875,
|
|
"rewards/margins": 6.96875,
|
|
"rewards/rejected": -10.625,
|
|
"step": 535
|
|
},
|
|
{
|
|
"epoch": 0.6576687116564417,
|
|
"grad_norm": 21.470589864019242,
|
|
"learning_rate": 1.5776859504132231e-06,
|
|
"logits/chosen": 0.056884765625,
|
|
"logits/rejected": -0.04150390625,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.2251,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -1.921875,
|
|
"rewards/margins": 8.1875,
|
|
"rewards/rejected": -10.125,
|
|
"step": 536
|
|
},
|
|
{
|
|
"epoch": 0.6588957055214724,
|
|
"grad_norm": 40.221164894996356,
|
|
"learning_rate": 1.5768595041322313e-06,
|
|
"logits/chosen": 0.10400390625,
|
|
"logits/rejected": -0.055419921875,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.6504,
|
|
"rewards/accuracies": 0.75,
|
|
"rewards/chosen": -2.96875,
|
|
"rewards/margins": 5.71875,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 537
|
|
},
|
|
{
|
|
"epoch": 0.660122699386503,
|
|
"grad_norm": 32.42512557852992,
|
|
"learning_rate": 1.5760330578512395e-06,
|
|
"logits/chosen": 0.10107421875,
|
|
"logits/rejected": -0.0693359375,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.5261,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.6328125,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -9.375,
|
|
"step": 538
|
|
},
|
|
{
|
|
"epoch": 0.6613496932515337,
|
|
"grad_norm": 29.534640861584272,
|
|
"learning_rate": 1.575206611570248e-06,
|
|
"logits/chosen": 0.11474609375,
|
|
"logits/rejected": -0.004486083984375,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.5435,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.34375,
|
|
"rewards/margins": 6.84375,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 539
|
|
},
|
|
{
|
|
"epoch": 0.6625766871165644,
|
|
"grad_norm": 31.036305365350792,
|
|
"learning_rate": 1.574380165289256e-06,
|
|
"logits/chosen": 0.1376953125,
|
|
"logits/rejected": -0.033447265625,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.5134,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.421875,
|
|
"rewards/margins": 7.25,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 540
|
|
},
|
|
{
|
|
"epoch": 0.6638036809815951,
|
|
"grad_norm": 33.567702018570266,
|
|
"learning_rate": 1.5735537190082645e-06,
|
|
"logits/chosen": 0.1337890625,
|
|
"logits/rejected": 0.03759765625,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.405,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.8125,
|
|
"rewards/margins": 6.625,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 541
|
|
},
|
|
{
|
|
"epoch": 0.6650306748466258,
|
|
"grad_norm": 27.257076226417922,
|
|
"learning_rate": 1.5727272727272727e-06,
|
|
"logits/chosen": 0.0771484375,
|
|
"logits/rejected": -0.009521484375,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.4032,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.0078125,
|
|
"rewards/margins": 6.8125,
|
|
"rewards/rejected": -7.8125,
|
|
"step": 542
|
|
},
|
|
{
|
|
"epoch": 0.6662576687116565,
|
|
"grad_norm": 29.161632484611417,
|
|
"learning_rate": 1.5719008264462809e-06,
|
|
"logits/chosen": 0.0245361328125,
|
|
"logits/rejected": -0.1640625,
|
|
"logps/chosen": -468.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.3993,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.1884765625,
|
|
"rewards/margins": 7.6875,
|
|
"rewards/rejected": -7.875,
|
|
"step": 543
|
|
},
|
|
{
|
|
"epoch": 0.6674846625766871,
|
|
"grad_norm": 34.520687337307265,
|
|
"learning_rate": 1.5710743801652893e-06,
|
|
"logits/chosen": 0.052734375,
|
|
"logits/rejected": -0.08935546875,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.5406,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -1.078125,
|
|
"rewards/margins": 6.59375,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 544
|
|
},
|
|
{
|
|
"epoch": 0.6687116564417178,
|
|
"grad_norm": 33.97863952629742,
|
|
"learning_rate": 1.5702479338842975e-06,
|
|
"logits/chosen": -0.006134033203125,
|
|
"logits/rejected": -0.1767578125,
|
|
"logps/chosen": -476.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.4504,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.71875,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 545
|
|
},
|
|
{
|
|
"epoch": 0.6699386503067485,
|
|
"grad_norm": 32.39648902259067,
|
|
"learning_rate": 1.5694214876033057e-06,
|
|
"logits/chosen": 0.11376953125,
|
|
"logits/rejected": 0.0107421875,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.4618,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.8046875,
|
|
"rewards/margins": 6.75,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 546
|
|
},
|
|
{
|
|
"epoch": 0.6711656441717792,
|
|
"grad_norm": 26.434328780260252,
|
|
"learning_rate": 1.5685950413223138e-06,
|
|
"logits/chosen": 0.05908203125,
|
|
"logits/rejected": -0.1279296875,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.3104,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.34375,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 547
|
|
},
|
|
{
|
|
"epoch": 0.6723926380368098,
|
|
"grad_norm": 36.794045043015835,
|
|
"learning_rate": 1.5677685950413222e-06,
|
|
"logits/chosen": -0.0247802734375,
|
|
"logits/rejected": -0.2275390625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.3867,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.038818359375,
|
|
"rewards/margins": 6.375,
|
|
"rewards/rejected": -6.40625,
|
|
"step": 548
|
|
},
|
|
{
|
|
"epoch": 0.6736196319018405,
|
|
"grad_norm": 31.042635603273403,
|
|
"learning_rate": 1.5669421487603304e-06,
|
|
"logits/chosen": 0.08740234375,
|
|
"logits/rejected": -0.11669921875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.3804,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.4765625,
|
|
"rewards/margins": 6.28125,
|
|
"rewards/rejected": -6.75,
|
|
"step": 549
|
|
},
|
|
{
|
|
"epoch": 0.6748466257668712,
|
|
"grad_norm": 28.58856278951386,
|
|
"learning_rate": 1.5661157024793388e-06,
|
|
"logits/chosen": 0.01904296875,
|
|
"logits/rejected": -0.048583984375,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.4403,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.09375,
|
|
"rewards/margins": 6.0,
|
|
"rewards/rejected": -7.09375,
|
|
"step": 550
|
|
},
|
|
{
|
|
"epoch": 0.6760736196319018,
|
|
"grad_norm": 25.362529579052058,
|
|
"learning_rate": 1.565289256198347e-06,
|
|
"logits/chosen": 0.1103515625,
|
|
"logits/rejected": -0.009765625,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.373,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 0.287109375,
|
|
"rewards/margins": 6.90625,
|
|
"rewards/rejected": -6.625,
|
|
"step": 551
|
|
},
|
|
{
|
|
"epoch": 0.6773006134969325,
|
|
"grad_norm": 27.078129855159084,
|
|
"learning_rate": 1.5644628099173554e-06,
|
|
"logits/chosen": 0.0172119140625,
|
|
"logits/rejected": -0.1259765625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.3205,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.173828125,
|
|
"rewards/margins": 6.59375,
|
|
"rewards/rejected": -6.78125,
|
|
"step": 552
|
|
},
|
|
{
|
|
"epoch": 0.6785276073619632,
|
|
"grad_norm": 30.3677321608354,
|
|
"learning_rate": 1.5636363636363636e-06,
|
|
"logits/chosen": 0.054931640625,
|
|
"logits/rejected": -0.08984375,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.4096,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.953125,
|
|
"rewards/margins": 5.65625,
|
|
"rewards/rejected": -6.625,
|
|
"step": 553
|
|
},
|
|
{
|
|
"epoch": 0.6797546012269938,
|
|
"grad_norm": 31.118820825566615,
|
|
"learning_rate": 1.562809917355372e-06,
|
|
"logits/chosen": 0.115234375,
|
|
"logits/rejected": -0.08056640625,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.3757,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.1181640625,
|
|
"rewards/margins": 6.4375,
|
|
"rewards/rejected": -6.5625,
|
|
"step": 554
|
|
},
|
|
{
|
|
"epoch": 0.6809815950920245,
|
|
"grad_norm": 30.25830591807912,
|
|
"learning_rate": 1.56198347107438e-06,
|
|
"logits/chosen": 0.236328125,
|
|
"logits/rejected": 0.1240234375,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.383,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.68359375,
|
|
"rewards/margins": 6.375,
|
|
"rewards/rejected": -7.0625,
|
|
"step": 555
|
|
},
|
|
{
|
|
"epoch": 0.6822085889570552,
|
|
"grad_norm": 23.74286637882293,
|
|
"learning_rate": 1.5611570247933884e-06,
|
|
"logits/chosen": 0.0859375,
|
|
"logits/rejected": -0.130859375,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.2854,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 0.1708984375,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -7.5625,
|
|
"step": 556
|
|
},
|
|
{
|
|
"epoch": 0.6834355828220859,
|
|
"grad_norm": 28.47005861846514,
|
|
"learning_rate": 1.5603305785123966e-06,
|
|
"logits/chosen": 0.08251953125,
|
|
"logits/rejected": -0.1376953125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.376,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.5390625,
|
|
"rewards/margins": 6.71875,
|
|
"rewards/rejected": -7.25,
|
|
"step": 557
|
|
},
|
|
{
|
|
"epoch": 0.6846625766871166,
|
|
"grad_norm": 23.800569126231828,
|
|
"learning_rate": 1.559504132231405e-06,
|
|
"logits/chosen": 0.11865234375,
|
|
"logits/rejected": -0.049560546875,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.3018,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.98828125,
|
|
"rewards/margins": 7.21875,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 558
|
|
},
|
|
{
|
|
"epoch": 0.6858895705521473,
|
|
"grad_norm": 32.26680257778667,
|
|
"learning_rate": 1.5586776859504132e-06,
|
|
"logits/chosen": -0.04052734375,
|
|
"logits/rejected": -0.1240234375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.4383,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.0703125,
|
|
"rewards/margins": 6.71875,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 559
|
|
},
|
|
{
|
|
"epoch": 0.6871165644171779,
|
|
"grad_norm": 22.365677248331806,
|
|
"learning_rate": 1.5578512396694213e-06,
|
|
"logits/chosen": -0.146484375,
|
|
"logits/rejected": -0.279296875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.2877,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -0.408203125,
|
|
"rewards/margins": 8.125,
|
|
"rewards/rejected": -8.5,
|
|
"step": 560
|
|
},
|
|
{
|
|
"epoch": 0.6883435582822086,
|
|
"grad_norm": 24.634630895620287,
|
|
"learning_rate": 1.5570247933884297e-06,
|
|
"logits/chosen": 0.0283203125,
|
|
"logits/rejected": -0.14453125,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -326.0,
|
|
"loss": 0.2368,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -0.8046875,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -8.375,
|
|
"step": 561
|
|
},
|
|
{
|
|
"epoch": 0.6895705521472393,
|
|
"grad_norm": 22.374160429629676,
|
|
"learning_rate": 1.556198347107438e-06,
|
|
"logits/chosen": 0.171875,
|
|
"logits/rejected": -0.03662109375,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.2198,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -1.5078125,
|
|
"rewards/margins": 7.3125,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 562
|
|
},
|
|
{
|
|
"epoch": 0.69079754601227,
|
|
"grad_norm": 31.54406859623512,
|
|
"learning_rate": 1.5553719008264463e-06,
|
|
"logits/chosen": -0.0264892578125,
|
|
"logits/rejected": -0.1787109375,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.4203,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.333984375,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -8.75,
|
|
"step": 563
|
|
},
|
|
{
|
|
"epoch": 0.6920245398773006,
|
|
"grad_norm": 24.058898026260223,
|
|
"learning_rate": 1.5545454545454543e-06,
|
|
"logits/chosen": -0.008544921875,
|
|
"logits/rejected": -0.12255859375,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.351,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.40625,
|
|
"rewards/margins": 6.96875,
|
|
"rewards/rejected": -8.375,
|
|
"step": 564
|
|
},
|
|
{
|
|
"epoch": 0.6932515337423313,
|
|
"grad_norm": 29.340521512150396,
|
|
"learning_rate": 1.5537190082644627e-06,
|
|
"logits/chosen": 0.035400390625,
|
|
"logits/rejected": -0.15234375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.5463,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.9140625,
|
|
"rewards/margins": 6.5,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 565
|
|
},
|
|
{
|
|
"epoch": 0.694478527607362,
|
|
"grad_norm": 32.21389471809945,
|
|
"learning_rate": 1.552892561983471e-06,
|
|
"logits/chosen": 0.0400390625,
|
|
"logits/rejected": -0.05419921875,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.342,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.6640625,
|
|
"rewards/margins": 7.5625,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 566
|
|
},
|
|
{
|
|
"epoch": 0.6957055214723926,
|
|
"grad_norm": 21.917368910045532,
|
|
"learning_rate": 1.5520661157024793e-06,
|
|
"logits/chosen": 0.1494140625,
|
|
"logits/rejected": 0.0191650390625,
|
|
"logps/chosen": -336.0,
|
|
"logps/rejected": -306.0,
|
|
"loss": 0.2178,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -1.734375,
|
|
"rewards/margins": 6.46875,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 567
|
|
},
|
|
{
|
|
"epoch": 0.6969325153374233,
|
|
"grad_norm": 29.04560621007937,
|
|
"learning_rate": 1.5512396694214875e-06,
|
|
"logits/chosen": -0.01556396484375,
|
|
"logits/rejected": -0.059326171875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.367,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.0625,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 568
|
|
},
|
|
{
|
|
"epoch": 0.698159509202454,
|
|
"grad_norm": 29.65708766378445,
|
|
"learning_rate": 1.5504132231404959e-06,
|
|
"logits/chosen": 0.068359375,
|
|
"logits/rejected": -0.080078125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.3189,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.6796875,
|
|
"rewards/margins": 6.46875,
|
|
"rewards/rejected": -8.125,
|
|
"step": 569
|
|
},
|
|
{
|
|
"epoch": 0.6993865030674846,
|
|
"grad_norm": 31.47023159862534,
|
|
"learning_rate": 1.549586776859504e-06,
|
|
"logits/chosen": -0.1083984375,
|
|
"logits/rejected": -0.232421875,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.2566,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.66796875,
|
|
"rewards/margins": 8.0,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 570
|
|
},
|
|
{
|
|
"epoch": 0.7006134969325153,
|
|
"grad_norm": 29.00025801151588,
|
|
"learning_rate": 1.5487603305785125e-06,
|
|
"logits/chosen": 0.0380859375,
|
|
"logits/rejected": -0.0849609375,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.3851,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.7578125,
|
|
"rewards/margins": 6.3125,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 571
|
|
},
|
|
{
|
|
"epoch": 0.701840490797546,
|
|
"grad_norm": 28.43874652292678,
|
|
"learning_rate": 1.5479338842975207e-06,
|
|
"logits/chosen": 0.0478515625,
|
|
"logits/rejected": -0.10400390625,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.2895,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.61328125,
|
|
"rewards/margins": 8.1875,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 572
|
|
},
|
|
{
|
|
"epoch": 0.7030674846625767,
|
|
"grad_norm": 31.974101424964097,
|
|
"learning_rate": 1.5471074380165289e-06,
|
|
"logits/chosen": 0.08251953125,
|
|
"logits/rejected": -0.043701171875,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.5633,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -2.15625,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -9.25,
|
|
"step": 573
|
|
},
|
|
{
|
|
"epoch": 0.7042944785276074,
|
|
"grad_norm": 31.879449258141157,
|
|
"learning_rate": 1.546280991735537e-06,
|
|
"logits/chosen": -0.05322265625,
|
|
"logits/rejected": -0.185546875,
|
|
"logps/chosen": -346.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.3867,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.5234375,
|
|
"rewards/margins": 7.5,
|
|
"rewards/rejected": -9.0625,
|
|
"step": 574
|
|
},
|
|
{
|
|
"epoch": 0.7055214723926381,
|
|
"grad_norm": 29.486616809481717,
|
|
"learning_rate": 1.5454545454545454e-06,
|
|
"logits/chosen": -0.1171875,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.2805,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.75390625,
|
|
"rewards/margins": 9.25,
|
|
"rewards/rejected": -10.0625,
|
|
"step": 575
|
|
},
|
|
{
|
|
"epoch": 0.7067484662576687,
|
|
"grad_norm": 20.384749054808264,
|
|
"learning_rate": 1.5446280991735536e-06,
|
|
"logits/chosen": 0.032958984375,
|
|
"logits/rejected": -0.1767578125,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.1897,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -0.58203125,
|
|
"rewards/margins": 9.4375,
|
|
"rewards/rejected": -10.0,
|
|
"step": 576
|
|
},
|
|
{
|
|
"epoch": 0.7079754601226994,
|
|
"grad_norm": 32.821988719859526,
|
|
"learning_rate": 1.5438016528925618e-06,
|
|
"logits/chosen": 0.0859375,
|
|
"logits/rejected": -0.031494140625,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.4854,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.8671875,
|
|
"rewards/margins": 9.0,
|
|
"rewards/rejected": -9.875,
|
|
"step": 577
|
|
},
|
|
{
|
|
"epoch": 0.7092024539877301,
|
|
"grad_norm": 32.009542067645974,
|
|
"learning_rate": 1.5429752066115702e-06,
|
|
"logits/chosen": -0.06787109375,
|
|
"logits/rejected": -0.21484375,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.4126,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.0390625,
|
|
"rewards/margins": 9.5,
|
|
"rewards/rejected": -10.5,
|
|
"step": 578
|
|
},
|
|
{
|
|
"epoch": 0.7104294478527607,
|
|
"grad_norm": 36.86286983429948,
|
|
"learning_rate": 1.5421487603305784e-06,
|
|
"logits/chosen": -0.025146484375,
|
|
"logits/rejected": -0.12255859375,
|
|
"logps/chosen": -466.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.522,
|
|
"rewards/accuracies": 0.765625,
|
|
"rewards/chosen": -3.21875,
|
|
"rewards/margins": 6.9375,
|
|
"rewards/rejected": -10.1875,
|
|
"step": 579
|
|
},
|
|
{
|
|
"epoch": 0.7116564417177914,
|
|
"grad_norm": 33.83544892119213,
|
|
"learning_rate": 1.5413223140495868e-06,
|
|
"logits/chosen": 0.06494140625,
|
|
"logits/rejected": -0.1142578125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.2903,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.96875,
|
|
"rewards/margins": 9.0,
|
|
"rewards/rejected": -11.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"epoch": 0.7128834355828221,
|
|
"grad_norm": 26.31261089547377,
|
|
"learning_rate": 1.540495867768595e-06,
|
|
"logits/chosen": -0.05078125,
|
|
"logits/rejected": -0.2490234375,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.2563,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -1.6484375,
|
|
"rewards/margins": 9.125,
|
|
"rewards/rejected": -10.8125,
|
|
"step": 581
|
|
},
|
|
{
|
|
"epoch": 0.7141104294478527,
|
|
"grad_norm": 32.303625869068206,
|
|
"learning_rate": 1.5396694214876032e-06,
|
|
"logits/chosen": 0.1953125,
|
|
"logits/rejected": -0.0306396484375,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.3773,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -2.421875,
|
|
"rewards/margins": 7.78125,
|
|
"rewards/rejected": -10.1875,
|
|
"step": 582
|
|
},
|
|
{
|
|
"epoch": 0.7153374233128834,
|
|
"grad_norm": 31.249678572637528,
|
|
"learning_rate": 1.5388429752066114e-06,
|
|
"logits/chosen": -0.035888671875,
|
|
"logits/rejected": -0.1845703125,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.3792,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.9296875,
|
|
"rewards/margins": 8.1875,
|
|
"rewards/rejected": -10.125,
|
|
"step": 583
|
|
},
|
|
{
|
|
"epoch": 0.7165644171779141,
|
|
"grad_norm": 35.19712562385684,
|
|
"learning_rate": 1.5380165289256198e-06,
|
|
"logits/chosen": 0.07080078125,
|
|
"logits/rejected": 0.01214599609375,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.5182,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -2.984375,
|
|
"rewards/margins": 6.21875,
|
|
"rewards/rejected": -9.25,
|
|
"step": 584
|
|
},
|
|
{
|
|
"epoch": 0.7177914110429447,
|
|
"grad_norm": 42.163190326894934,
|
|
"learning_rate": 1.537190082644628e-06,
|
|
"logits/chosen": 0.162109375,
|
|
"logits/rejected": 0.04638671875,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.7286,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": -2.3125,
|
|
"rewards/margins": 6.8125,
|
|
"rewards/rejected": -9.125,
|
|
"step": 585
|
|
},
|
|
{
|
|
"epoch": 0.7190184049079754,
|
|
"grad_norm": 32.981762650345296,
|
|
"learning_rate": 1.5363636363636364e-06,
|
|
"logits/chosen": 0.0211181640625,
|
|
"logits/rejected": -0.0888671875,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.3953,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.9921875,
|
|
"rewards/margins": 7.40625,
|
|
"rewards/rejected": -9.375,
|
|
"step": 586
|
|
},
|
|
{
|
|
"epoch": 0.7202453987730061,
|
|
"grad_norm": 27.432785526510457,
|
|
"learning_rate": 1.5355371900826445e-06,
|
|
"logits/chosen": 0.0001220703125,
|
|
"logits/rejected": -0.11474609375,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.3823,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.828125,
|
|
"rewards/margins": 7.59375,
|
|
"rewards/rejected": -9.4375,
|
|
"step": 587
|
|
},
|
|
{
|
|
"epoch": 0.7214723926380369,
|
|
"grad_norm": 23.66359373618013,
|
|
"learning_rate": 1.534710743801653e-06,
|
|
"logits/chosen": -0.043212890625,
|
|
"logits/rejected": -0.197265625,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.3267,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.58203125,
|
|
"rewards/margins": 8.5625,
|
|
"rewards/rejected": -9.125,
|
|
"step": 588
|
|
},
|
|
{
|
|
"epoch": 0.7226993865030675,
|
|
"grad_norm": 23.386867855314378,
|
|
"learning_rate": 1.5338842975206611e-06,
|
|
"logits/chosen": -0.11376953125,
|
|
"logits/rejected": -0.2236328125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.3111,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -2.34375,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -9.375,
|
|
"step": 589
|
|
},
|
|
{
|
|
"epoch": 0.7239263803680982,
|
|
"grad_norm": 31.15551320155721,
|
|
"learning_rate": 1.5330578512396693e-06,
|
|
"logits/chosen": -0.01129150390625,
|
|
"logits/rejected": -0.1240234375,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.4364,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -2.25,
|
|
"rewards/margins": 7.25,
|
|
"rewards/rejected": -9.5,
|
|
"step": 590
|
|
},
|
|
{
|
|
"epoch": 0.7251533742331289,
|
|
"grad_norm": 32.28054810617703,
|
|
"learning_rate": 1.5322314049586775e-06,
|
|
"logits/chosen": -0.1845703125,
|
|
"logits/rejected": -0.388671875,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.2741,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -1.0546875,
|
|
"rewards/margins": 8.5625,
|
|
"rewards/rejected": -9.625,
|
|
"step": 591
|
|
},
|
|
{
|
|
"epoch": 0.7263803680981595,
|
|
"grad_norm": 27.5726026871591,
|
|
"learning_rate": 1.531404958677686e-06,
|
|
"logits/chosen": -0.0400390625,
|
|
"logits/rejected": -0.23046875,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.3069,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -1.28125,
|
|
"rewards/margins": 8.9375,
|
|
"rewards/rejected": -10.25,
|
|
"step": 592
|
|
},
|
|
{
|
|
"epoch": 0.7276073619631902,
|
|
"grad_norm": 36.01336820443863,
|
|
"learning_rate": 1.530578512396694e-06,
|
|
"logits/chosen": 0.0012054443359375,
|
|
"logits/rejected": -0.248046875,
|
|
"logps/chosen": -474.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.4487,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.3515625,
|
|
"rewards/margins": 8.25,
|
|
"rewards/rejected": -9.625,
|
|
"step": 593
|
|
},
|
|
{
|
|
"epoch": 0.7288343558282209,
|
|
"grad_norm": 31.432239305878504,
|
|
"learning_rate": 1.5297520661157025e-06,
|
|
"logits/chosen": -0.05615234375,
|
|
"logits/rejected": -0.212890625,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.397,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -2.125,
|
|
"rewards/margins": 7.65625,
|
|
"rewards/rejected": -9.8125,
|
|
"step": 594
|
|
},
|
|
{
|
|
"epoch": 0.7300613496932515,
|
|
"grad_norm": 32.78075859841031,
|
|
"learning_rate": 1.5289256198347107e-06,
|
|
"logits/chosen": -0.078125,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -472.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.3211,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": -1.2890625,
|
|
"rewards/margins": 8.5625,
|
|
"rewards/rejected": -9.875,
|
|
"step": 595
|
|
},
|
|
{
|
|
"epoch": 0.7312883435582822,
|
|
"grad_norm": 37.09538956451303,
|
|
"learning_rate": 1.5280991735537189e-06,
|
|
"logits/chosen": -0.05517578125,
|
|
"logits/rejected": -0.20703125,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.4995,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 7.375,
|
|
"rewards/rejected": -9.375,
|
|
"step": 596
|
|
},
|
|
{
|
|
"epoch": 0.7325153374233129,
|
|
"grad_norm": 30.38608812480124,
|
|
"learning_rate": 1.5272727272727273e-06,
|
|
"logits/chosen": 0.06103515625,
|
|
"logits/rejected": -0.1162109375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -328.0,
|
|
"loss": 0.4722,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.625,
|
|
"rewards/margins": 7.0,
|
|
"rewards/rejected": -8.625,
|
|
"step": 597
|
|
},
|
|
{
|
|
"epoch": 0.7337423312883435,
|
|
"grad_norm": 24.96224727342717,
|
|
"learning_rate": 1.5264462809917355e-06,
|
|
"logits/chosen": -0.042236328125,
|
|
"logits/rejected": -0.240234375,
|
|
"logps/chosen": -462.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.2659,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.359375,
|
|
"rewards/margins": 8.4375,
|
|
"rewards/rejected": -8.75,
|
|
"step": 598
|
|
},
|
|
{
|
|
"epoch": 0.7349693251533742,
|
|
"grad_norm": 27.231923547025172,
|
|
"learning_rate": 1.5256198347107437e-06,
|
|
"logits/chosen": -0.19140625,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -468.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.3553,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.439453125,
|
|
"rewards/margins": 8.3125,
|
|
"rewards/rejected": -8.75,
|
|
"step": 599
|
|
},
|
|
{
|
|
"epoch": 0.7361963190184049,
|
|
"grad_norm": 31.336627885808458,
|
|
"learning_rate": 1.5247933884297518e-06,
|
|
"logits/chosen": -0.2021484375,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.5022,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.1015625,
|
|
"rewards/margins": 7.46875,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 600
|
|
},
|
|
{
|
|
"epoch": 0.7374233128834355,
|
|
"grad_norm": 26.47772076736151,
|
|
"learning_rate": 1.5239669421487602e-06,
|
|
"logits/chosen": -0.05712890625,
|
|
"logits/rejected": -0.2431640625,
|
|
"logps/chosen": -360.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.3024,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -1.671875,
|
|
"rewards/margins": 7.34375,
|
|
"rewards/rejected": -9.0,
|
|
"step": 601
|
|
},
|
|
{
|
|
"epoch": 0.7386503067484662,
|
|
"grad_norm": 28.06837562889773,
|
|
"learning_rate": 1.5231404958677684e-06,
|
|
"logits/chosen": 0.0869140625,
|
|
"logits/rejected": -0.07080078125,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.3123,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.39453125,
|
|
"rewards/margins": 8.3125,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 602
|
|
},
|
|
{
|
|
"epoch": 0.7398773006134969,
|
|
"grad_norm": 23.585510852292025,
|
|
"learning_rate": 1.5223140495867768e-06,
|
|
"logits/chosen": -0.08203125,
|
|
"logits/rejected": -0.2109375,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.3208,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.265625,
|
|
"rewards/margins": 8.1875,
|
|
"rewards/rejected": -8.5,
|
|
"step": 603
|
|
},
|
|
{
|
|
"epoch": 0.7411042944785277,
|
|
"grad_norm": 29.623466911959838,
|
|
"learning_rate": 1.521487603305785e-06,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.283203125,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.3527,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.578125,
|
|
"rewards/margins": 7.9375,
|
|
"rewards/rejected": -8.5,
|
|
"step": 604
|
|
},
|
|
{
|
|
"epoch": 0.7423312883435583,
|
|
"grad_norm": 26.542623136863696,
|
|
"learning_rate": 1.5206611570247934e-06,
|
|
"logits/chosen": -0.078125,
|
|
"logits/rejected": -0.26171875,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.2974,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.5078125,
|
|
"rewards/margins": 8.3125,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 605
|
|
},
|
|
{
|
|
"epoch": 0.743558282208589,
|
|
"grad_norm": 30.27478018190493,
|
|
"learning_rate": 1.5198347107438016e-06,
|
|
"logits/chosen": -0.1572265625,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.453,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.5625,
|
|
"rewards/margins": 7.15625,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 606
|
|
},
|
|
{
|
|
"epoch": 0.7447852760736197,
|
|
"grad_norm": 29.55279807825864,
|
|
"learning_rate": 1.51900826446281e-06,
|
|
"logits/chosen": -0.046630859375,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.3935,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.796875,
|
|
"rewards/margins": 7.8125,
|
|
"rewards/rejected": -8.625,
|
|
"step": 607
|
|
},
|
|
{
|
|
"epoch": 0.7460122699386503,
|
|
"grad_norm": 30.00982757412949,
|
|
"learning_rate": 1.518181818181818e-06,
|
|
"logits/chosen": 0.08984375,
|
|
"logits/rejected": -0.1484375,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.4166,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.8046875,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -8.375,
|
|
"step": 608
|
|
},
|
|
{
|
|
"epoch": 0.747239263803681,
|
|
"grad_norm": 31.74812049299925,
|
|
"learning_rate": 1.5173553719008264e-06,
|
|
"logits/chosen": -0.037109375,
|
|
"logits/rejected": -0.19921875,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.4428,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.9453125,
|
|
"rewards/margins": 7.8125,
|
|
"rewards/rejected": -8.75,
|
|
"step": 609
|
|
},
|
|
{
|
|
"epoch": 0.7484662576687117,
|
|
"grad_norm": 25.131626088463726,
|
|
"learning_rate": 1.5165289256198346e-06,
|
|
"logits/chosen": -0.11083984375,
|
|
"logits/rejected": -0.318359375,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.2651,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.5234375,
|
|
"rewards/margins": 8.4375,
|
|
"rewards/rejected": -9.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"epoch": 0.7496932515337423,
|
|
"grad_norm": 39.73416137414698,
|
|
"learning_rate": 1.515702479338843e-06,
|
|
"logits/chosen": -0.052978515625,
|
|
"logits/rejected": -0.220703125,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.5685,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -2.234375,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -8.75,
|
|
"step": 611
|
|
},
|
|
{
|
|
"epoch": 0.750920245398773,
|
|
"grad_norm": 32.048420022414305,
|
|
"learning_rate": 1.5148760330578512e-06,
|
|
"logits/chosen": -0.040283203125,
|
|
"logits/rejected": -0.17578125,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.4866,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.5703125,
|
|
"rewards/margins": 6.59375,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 612
|
|
},
|
|
{
|
|
"epoch": 0.7521472392638037,
|
|
"grad_norm": 31.74945608082927,
|
|
"learning_rate": 1.5140495867768594e-06,
|
|
"logits/chosen": -0.045654296875,
|
|
"logits/rejected": -0.08837890625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.4784,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -2.25,
|
|
"rewards/margins": 6.59375,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 613
|
|
},
|
|
{
|
|
"epoch": 0.7533742331288343,
|
|
"grad_norm": 36.930153188921594,
|
|
"learning_rate": 1.5132231404958678e-06,
|
|
"logits/chosen": -0.09375,
|
|
"logits/rejected": -0.216796875,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.5188,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -1.5625,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 614
|
|
},
|
|
{
|
|
"epoch": 0.754601226993865,
|
|
"grad_norm": 30.44342763152856,
|
|
"learning_rate": 1.512396694214876e-06,
|
|
"logits/chosen": -0.07421875,
|
|
"logits/rejected": -0.1611328125,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.393,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.171875,
|
|
"rewards/margins": 7.3125,
|
|
"rewards/rejected": -8.5,
|
|
"step": 615
|
|
},
|
|
{
|
|
"epoch": 0.7558282208588957,
|
|
"grad_norm": 28.70066590412152,
|
|
"learning_rate": 1.5115702479338843e-06,
|
|
"logits/chosen": -0.0005035400390625,
|
|
"logits/rejected": -0.1474609375,
|
|
"logps/chosen": -346.0,
|
|
"logps/rejected": -322.0,
|
|
"loss": 0.3475,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -2.1875,
|
|
"rewards/margins": 6.1875,
|
|
"rewards/rejected": -8.375,
|
|
"step": 616
|
|
},
|
|
{
|
|
"epoch": 0.7570552147239263,
|
|
"grad_norm": 27.872660098071364,
|
|
"learning_rate": 1.5107438016528923e-06,
|
|
"logits/chosen": 0.0400390625,
|
|
"logits/rejected": -0.0257568359375,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.3236,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -2.09375,
|
|
"rewards/margins": 6.59375,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 617
|
|
},
|
|
{
|
|
"epoch": 0.758282208588957,
|
|
"grad_norm": 44.37398776062372,
|
|
"learning_rate": 1.5099173553719007e-06,
|
|
"logits/chosen": 0.1142578125,
|
|
"logits/rejected": -0.0478515625,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.5947,
|
|
"rewards/accuracies": 0.7578125,
|
|
"rewards/chosen": -2.34375,
|
|
"rewards/margins": 5.8125,
|
|
"rewards/rejected": -8.125,
|
|
"step": 618
|
|
},
|
|
{
|
|
"epoch": 0.7595092024539877,
|
|
"grad_norm": 30.52042734733885,
|
|
"learning_rate": 1.509090909090909e-06,
|
|
"logits/chosen": 0.08837890625,
|
|
"logits/rejected": -0.11083984375,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.33,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.2109375,
|
|
"rewards/margins": 7.40625,
|
|
"rewards/rejected": -8.625,
|
|
"step": 619
|
|
},
|
|
{
|
|
"epoch": 0.7607361963190185,
|
|
"grad_norm": 34.288657959614106,
|
|
"learning_rate": 1.5082644628099173e-06,
|
|
"logits/chosen": 0.08740234375,
|
|
"logits/rejected": -0.09716796875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.32,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.5859375,
|
|
"rewards/margins": 6.5625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 620
|
|
},
|
|
{
|
|
"epoch": 0.7619631901840491,
|
|
"grad_norm": 30.081394584471248,
|
|
"learning_rate": 1.5074380165289255e-06,
|
|
"logits/chosen": -0.046875,
|
|
"logits/rejected": -0.193359375,
|
|
"logps/chosen": -496.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.4241,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.6015625,
|
|
"rewards/margins": 8.0,
|
|
"rewards/rejected": -8.625,
|
|
"step": 621
|
|
},
|
|
{
|
|
"epoch": 0.7631901840490798,
|
|
"grad_norm": 28.055390118710246,
|
|
"learning_rate": 1.506611570247934e-06,
|
|
"logits/chosen": 0.07275390625,
|
|
"logits/rejected": -0.078125,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.414,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.15625,
|
|
"rewards/margins": 7.4375,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 622
|
|
},
|
|
{
|
|
"epoch": 0.7644171779141105,
|
|
"grad_norm": 30.135628517542635,
|
|
"learning_rate": 1.505785123966942e-06,
|
|
"logits/chosen": 0.03466796875,
|
|
"logits/rejected": -0.1357421875,
|
|
"logps/chosen": -472.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.3729,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.458984375,
|
|
"rewards/margins": 7.96875,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 623
|
|
},
|
|
{
|
|
"epoch": 0.7656441717791411,
|
|
"grad_norm": 30.413030957188685,
|
|
"learning_rate": 1.5049586776859505e-06,
|
|
"logits/chosen": -0.042724609375,
|
|
"logits/rejected": -0.21484375,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.3593,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.3515625,
|
|
"rewards/margins": 8.8125,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 624
|
|
},
|
|
{
|
|
"epoch": 0.7668711656441718,
|
|
"grad_norm": 28.497434559578014,
|
|
"learning_rate": 1.5041322314049587e-06,
|
|
"logits/chosen": -0.003204345703125,
|
|
"logits/rejected": -0.1376953125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.2916,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.7578125,
|
|
"rewards/margins": 7.59375,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 625
|
|
},
|
|
{
|
|
"epoch": 0.7680981595092025,
|
|
"grad_norm": 34.77802419683538,
|
|
"learning_rate": 1.5033057851239669e-06,
|
|
"logits/chosen": -0.1328125,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.4555,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.11962890625,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -7.65625,
|
|
"step": 626
|
|
},
|
|
{
|
|
"epoch": 0.7693251533742331,
|
|
"grad_norm": 31.232324709961738,
|
|
"learning_rate": 1.502479338842975e-06,
|
|
"logits/chosen": 0.07470703125,
|
|
"logits/rejected": 0.00176239013671875,
|
|
"logps/chosen": -330.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.4537,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -2.125,
|
|
"rewards/margins": 5.65625,
|
|
"rewards/rejected": -7.78125,
|
|
"step": 627
|
|
},
|
|
{
|
|
"epoch": 0.7705521472392638,
|
|
"grad_norm": 27.078767146825378,
|
|
"learning_rate": 1.5016528925619834e-06,
|
|
"logits/chosen": 0.050537109375,
|
|
"logits/rejected": -0.09814453125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.3413,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.70703125,
|
|
"rewards/margins": 6.96875,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 628
|
|
},
|
|
{
|
|
"epoch": 0.7717791411042945,
|
|
"grad_norm": 26.995519017475925,
|
|
"learning_rate": 1.5008264462809916e-06,
|
|
"logits/chosen": 0.0048828125,
|
|
"logits/rejected": -0.11474609375,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -312.0,
|
|
"loss": 0.2447,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": -0.83203125,
|
|
"rewards/margins": 7.375,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 629
|
|
},
|
|
{
|
|
"epoch": 0.7730061349693251,
|
|
"grad_norm": 37.908685925186354,
|
|
"learning_rate": 1.5e-06,
|
|
"logits/chosen": 0.0771484375,
|
|
"logits/rejected": -0.1474609375,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.4056,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.1201171875,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -7.84375,
|
|
"step": 630
|
|
},
|
|
{
|
|
"epoch": 0.7742331288343558,
|
|
"grad_norm": 31.987483581709707,
|
|
"learning_rate": 1.4991735537190082e-06,
|
|
"logits/chosen": -0.1328125,
|
|
"logits/rejected": -0.216796875,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.4456,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -0.28515625,
|
|
"rewards/margins": 7.46875,
|
|
"rewards/rejected": -7.75,
|
|
"step": 631
|
|
},
|
|
{
|
|
"epoch": 0.7754601226993865,
|
|
"grad_norm": 28.841217050963028,
|
|
"learning_rate": 1.4983471074380164e-06,
|
|
"logits/chosen": -0.03125,
|
|
"logits/rejected": -0.1552734375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.3419,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.28125,
|
|
"rewards/margins": 7.21875,
|
|
"rewards/rejected": -7.5,
|
|
"step": 632
|
|
},
|
|
{
|
|
"epoch": 0.7766871165644171,
|
|
"grad_norm": 34.39881672142265,
|
|
"learning_rate": 1.4975206611570248e-06,
|
|
"logits/chosen": 0.054931640625,
|
|
"logits/rejected": -0.056640625,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.4147,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -1.0,
|
|
"rewards/margins": 6.375,
|
|
"rewards/rejected": -7.375,
|
|
"step": 633
|
|
},
|
|
{
|
|
"epoch": 0.7779141104294478,
|
|
"grad_norm": 26.652870260622375,
|
|
"learning_rate": 1.496694214876033e-06,
|
|
"logits/chosen": -0.0654296875,
|
|
"logits/rejected": -0.2578125,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.2238,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": 1.28125,
|
|
"rewards/margins": 9.375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 634
|
|
},
|
|
{
|
|
"epoch": 0.7791411042944786,
|
|
"grad_norm": 22.91550745058302,
|
|
"learning_rate": 1.4958677685950412e-06,
|
|
"logits/chosen": -0.05078125,
|
|
"logits/rejected": -0.119140625,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -324.0,
|
|
"loss": 0.2554,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -0.69140625,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 635
|
|
},
|
|
{
|
|
"epoch": 0.7803680981595092,
|
|
"grad_norm": 35.731763745917725,
|
|
"learning_rate": 1.4950413223140494e-06,
|
|
"logits/chosen": -0.07470703125,
|
|
"logits/rejected": -0.177734375,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.5242,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.005889892578125,
|
|
"rewards/margins": 7.59375,
|
|
"rewards/rejected": -7.59375,
|
|
"step": 636
|
|
},
|
|
{
|
|
"epoch": 0.7815950920245399,
|
|
"grad_norm": 37.67735509679774,
|
|
"learning_rate": 1.4942148760330578e-06,
|
|
"logits/chosen": 0.10302734375,
|
|
"logits/rejected": -0.080078125,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -330.0,
|
|
"loss": 0.4897,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.1328125,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -8.0,
|
|
"step": 637
|
|
},
|
|
{
|
|
"epoch": 0.7828220858895706,
|
|
"grad_norm": 28.360694731541145,
|
|
"learning_rate": 1.493388429752066e-06,
|
|
"logits/chosen": -0.06494140625,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.3245,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -0.271484375,
|
|
"rewards/margins": 7.75,
|
|
"rewards/rejected": -8.0,
|
|
"step": 638
|
|
},
|
|
{
|
|
"epoch": 0.7840490797546013,
|
|
"grad_norm": 34.11184459648905,
|
|
"learning_rate": 1.4925619834710744e-06,
|
|
"logits/chosen": 0.064453125,
|
|
"logits/rejected": -0.10009765625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.5196,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.8515625,
|
|
"rewards/margins": 7.21875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 639
|
|
},
|
|
{
|
|
"epoch": 0.7852760736196319,
|
|
"grad_norm": 28.094071707833443,
|
|
"learning_rate": 1.4917355371900826e-06,
|
|
"logits/chosen": -0.10546875,
|
|
"logits/rejected": -0.23046875,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.3126,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.1884765625,
|
|
"rewards/margins": 8.5,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 640
|
|
},
|
|
{
|
|
"epoch": 0.7865030674846626,
|
|
"grad_norm": 36.241517750247986,
|
|
"learning_rate": 1.490909090909091e-06,
|
|
"logits/chosen": -0.146484375,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.6696,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -1.2734375,
|
|
"rewards/margins": 6.75,
|
|
"rewards/rejected": -8.0,
|
|
"step": 641
|
|
},
|
|
{
|
|
"epoch": 0.7877300613496933,
|
|
"grad_norm": 19.04510317464584,
|
|
"learning_rate": 1.4900826446280991e-06,
|
|
"logits/chosen": -0.031982421875,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.2417,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -1.0625,
|
|
"rewards/margins": 7.90625,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 642
|
|
},
|
|
{
|
|
"epoch": 0.7889570552147239,
|
|
"grad_norm": 31.405897455216135,
|
|
"learning_rate": 1.4892561983471075e-06,
|
|
"logits/chosen": -0.189453125,
|
|
"logits/rejected": -0.345703125,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.3286,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -1.171875,
|
|
"rewards/margins": 7.625,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 643
|
|
},
|
|
{
|
|
"epoch": 0.7901840490797546,
|
|
"grad_norm": 27.366634664404017,
|
|
"learning_rate": 1.4884297520661155e-06,
|
|
"logits/chosen": -0.10107421875,
|
|
"logits/rejected": -0.2490234375,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.4229,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -1.1328125,
|
|
"rewards/margins": 8.1875,
|
|
"rewards/rejected": -9.3125,
|
|
"step": 644
|
|
},
|
|
{
|
|
"epoch": 0.7914110429447853,
|
|
"grad_norm": 29.73627781193197,
|
|
"learning_rate": 1.487603305785124e-06,
|
|
"logits/chosen": -0.06591796875,
|
|
"logits/rejected": -0.2578125,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.3118,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.1328125,
|
|
"rewards/margins": 8.25,
|
|
"rewards/rejected": -9.4375,
|
|
"step": 645
|
|
},
|
|
{
|
|
"epoch": 0.7926380368098159,
|
|
"grad_norm": 32.15075062928481,
|
|
"learning_rate": 1.4867768595041321e-06,
|
|
"logits/chosen": 0.02197265625,
|
|
"logits/rejected": -0.15625,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.3289,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.5234375,
|
|
"rewards/margins": 7.625,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 646
|
|
},
|
|
{
|
|
"epoch": 0.7938650306748466,
|
|
"grad_norm": 31.704459481417484,
|
|
"learning_rate": 1.4859504132231405e-06,
|
|
"logits/chosen": -0.05908203125,
|
|
"logits/rejected": -0.1923828125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.3989,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -0.85546875,
|
|
"rewards/margins": 7.96875,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 647
|
|
},
|
|
{
|
|
"epoch": 0.7950920245398773,
|
|
"grad_norm": 36.63393493327759,
|
|
"learning_rate": 1.4851239669421487e-06,
|
|
"logits/chosen": -0.10791015625,
|
|
"logits/rejected": -0.1083984375,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.518,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.7734375,
|
|
"rewards/margins": 6.4375,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 648
|
|
},
|
|
{
|
|
"epoch": 0.7963190184049079,
|
|
"grad_norm": 31.3887880166484,
|
|
"learning_rate": 1.4842975206611569e-06,
|
|
"logits/chosen": 0.04150390625,
|
|
"logits/rejected": -0.04833984375,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.5288,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.640625,
|
|
"rewards/margins": 5.8125,
|
|
"rewards/rejected": -7.46875,
|
|
"step": 649
|
|
},
|
|
{
|
|
"epoch": 0.7975460122699386,
|
|
"grad_norm": 35.19357807219741,
|
|
"learning_rate": 1.4834710743801653e-06,
|
|
"logits/chosen": 0.005035400390625,
|
|
"logits/rejected": -0.1455078125,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.5002,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.0078125,
|
|
"rewards/margins": 6.1875,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 650
|
|
},
|
|
{
|
|
"epoch": 0.7987730061349694,
|
|
"grad_norm": 35.39802370538856,
|
|
"learning_rate": 1.4826446280991735e-06,
|
|
"logits/chosen": -0.1279296875,
|
|
"logits/rejected": -0.1962890625,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.4878,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.2138671875,
|
|
"rewards/margins": 7.46875,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 651
|
|
},
|
|
{
|
|
"epoch": 0.8,
|
|
"grad_norm": 31.850658115907073,
|
|
"learning_rate": 1.4818181818181819e-06,
|
|
"logits/chosen": -0.03857421875,
|
|
"logits/rejected": -0.1474609375,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.5013,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.7578125,
|
|
"rewards/margins": 6.21875,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 652
|
|
},
|
|
{
|
|
"epoch": 0.8012269938650307,
|
|
"grad_norm": 27.809940613872435,
|
|
"learning_rate": 1.4809917355371899e-06,
|
|
"logits/chosen": 0.0252685546875,
|
|
"logits/rejected": -0.1396484375,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.2946,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.92578125,
|
|
"rewards/margins": 6.8125,
|
|
"rewards/rejected": -7.75,
|
|
"step": 653
|
|
},
|
|
{
|
|
"epoch": 0.8024539877300614,
|
|
"grad_norm": 25.196262513153428,
|
|
"learning_rate": 1.4801652892561983e-06,
|
|
"logits/chosen": 0.041259765625,
|
|
"logits/rejected": -0.1552734375,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.2938,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.7421875,
|
|
"rewards/margins": 6.96875,
|
|
"rewards/rejected": -7.71875,
|
|
"step": 654
|
|
},
|
|
{
|
|
"epoch": 0.803680981595092,
|
|
"grad_norm": 32.55370820352105,
|
|
"learning_rate": 1.4793388429752064e-06,
|
|
"logits/chosen": -0.01458740234375,
|
|
"logits/rejected": -0.18359375,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.4016,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.03125,
|
|
"rewards/margins": 6.0625,
|
|
"rewards/rejected": -7.0625,
|
|
"step": 655
|
|
},
|
|
{
|
|
"epoch": 0.8049079754601227,
|
|
"grad_norm": 36.85883245142648,
|
|
"learning_rate": 1.4785123966942148e-06,
|
|
"logits/chosen": 0.05029296875,
|
|
"logits/rejected": -0.087890625,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -336.0,
|
|
"loss": 0.482,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.0546875,
|
|
"rewards/margins": 5.75,
|
|
"rewards/rejected": -6.78125,
|
|
"step": 656
|
|
},
|
|
{
|
|
"epoch": 0.8061349693251534,
|
|
"grad_norm": 25.458699629502085,
|
|
"learning_rate": 1.477685950413223e-06,
|
|
"logits/chosen": -0.09716796875,
|
|
"logits/rejected": -0.2314453125,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.3363,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.765625,
|
|
"rewards/margins": 6.0625,
|
|
"rewards/rejected": -6.84375,
|
|
"step": 657
|
|
},
|
|
{
|
|
"epoch": 0.807361963190184,
|
|
"grad_norm": 29.410306637836257,
|
|
"learning_rate": 1.4768595041322314e-06,
|
|
"logits/chosen": -0.07568359375,
|
|
"logits/rejected": -0.203125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.3754,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.71484375,
|
|
"rewards/margins": 6.0,
|
|
"rewards/rejected": -6.71875,
|
|
"step": 658
|
|
},
|
|
{
|
|
"epoch": 0.8085889570552147,
|
|
"grad_norm": 31.46664227556155,
|
|
"learning_rate": 1.4760330578512396e-06,
|
|
"logits/chosen": -0.025634765625,
|
|
"logits/rejected": -0.16015625,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.4448,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.2421875,
|
|
"rewards/margins": 5.71875,
|
|
"rewards/rejected": -6.96875,
|
|
"step": 659
|
|
},
|
|
{
|
|
"epoch": 0.8098159509202454,
|
|
"grad_norm": 28.21553466859993,
|
|
"learning_rate": 1.475206611570248e-06,
|
|
"logits/chosen": -0.0419921875,
|
|
"logits/rejected": -0.2177734375,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.3795,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.419921875,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -6.9375,
|
|
"step": 660
|
|
},
|
|
{
|
|
"epoch": 0.811042944785276,
|
|
"grad_norm": 37.78781324517118,
|
|
"learning_rate": 1.4743801652892562e-06,
|
|
"logits/chosen": 0.05712890625,
|
|
"logits/rejected": -0.050048828125,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -314.0,
|
|
"loss": 0.546,
|
|
"rewards/accuracies": 0.765625,
|
|
"rewards/chosen": -1.7734375,
|
|
"rewards/margins": 5.4375,
|
|
"rewards/rejected": -7.21875,
|
|
"step": 661
|
|
},
|
|
{
|
|
"epoch": 0.8122699386503067,
|
|
"grad_norm": 20.96160828276327,
|
|
"learning_rate": 1.4735537190082644e-06,
|
|
"logits/chosen": 0.05810546875,
|
|
"logits/rejected": -0.056640625,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.2145,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.171875,
|
|
"rewards/margins": 7.09375,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 662
|
|
},
|
|
{
|
|
"epoch": 0.8134969325153374,
|
|
"grad_norm": 25.21125046878929,
|
|
"learning_rate": 1.4727272727272726e-06,
|
|
"logits/chosen": 0.111328125,
|
|
"logits/rejected": -0.07666015625,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.3529,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.2490234375,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -6.78125,
|
|
"step": 663
|
|
},
|
|
{
|
|
"epoch": 0.8147239263803681,
|
|
"grad_norm": 25.92352688135653,
|
|
"learning_rate": 1.471900826446281e-06,
|
|
"logits/chosen": -0.21484375,
|
|
"logits/rejected": -0.33984375,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.2527,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": 0.421875,
|
|
"rewards/margins": 7.9375,
|
|
"rewards/rejected": -7.53125,
|
|
"step": 664
|
|
},
|
|
{
|
|
"epoch": 0.8159509202453987,
|
|
"grad_norm": 30.423590286493077,
|
|
"learning_rate": 1.4710743801652892e-06,
|
|
"logits/chosen": 0.1259765625,
|
|
"logits/rejected": -0.0361328125,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -308.0,
|
|
"loss": 0.4031,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.9296875,
|
|
"rewards/margins": 6.40625,
|
|
"rewards/rejected": -7.34375,
|
|
"step": 665
|
|
},
|
|
{
|
|
"epoch": 0.8171779141104294,
|
|
"grad_norm": 34.68883884219752,
|
|
"learning_rate": 1.4702479338842974e-06,
|
|
"logits/chosen": 0.078125,
|
|
"logits/rejected": -0.08740234375,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.53,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.474609375,
|
|
"rewards/margins": 6.6875,
|
|
"rewards/rejected": -7.15625,
|
|
"step": 666
|
|
},
|
|
{
|
|
"epoch": 0.8184049079754602,
|
|
"grad_norm": 25.374410525378718,
|
|
"learning_rate": 1.4694214876033058e-06,
|
|
"logits/chosen": -0.00909423828125,
|
|
"logits/rejected": -0.2021484375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.3167,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.24609375,
|
|
"rewards/margins": 7.1875,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 667
|
|
},
|
|
{
|
|
"epoch": 0.8196319018404908,
|
|
"grad_norm": 28.726155717525497,
|
|
"learning_rate": 1.468595041322314e-06,
|
|
"logits/chosen": 0.01116943359375,
|
|
"logits/rejected": -0.125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.4085,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.6328125,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -7.4375,
|
|
"step": 668
|
|
},
|
|
{
|
|
"epoch": 0.8208588957055215,
|
|
"grad_norm": 31.107351564988974,
|
|
"learning_rate": 1.4677685950413223e-06,
|
|
"logits/chosen": -0.051025390625,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.3181,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.31640625,
|
|
"rewards/margins": 7.03125,
|
|
"rewards/rejected": -7.34375,
|
|
"step": 669
|
|
},
|
|
{
|
|
"epoch": 0.8220858895705522,
|
|
"grad_norm": 23.334995347430365,
|
|
"learning_rate": 1.4669421487603305e-06,
|
|
"logits/chosen": 0.1767578125,
|
|
"logits/rejected": 0.02783203125,
|
|
"logps/chosen": -334.0,
|
|
"logps/rejected": -314.0,
|
|
"loss": 0.2454,
|
|
"rewards/accuracies": 0.9140625,
|
|
"rewards/chosen": -0.11328125,
|
|
"rewards/margins": 6.90625,
|
|
"rewards/rejected": -7.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"epoch": 0.8233128834355828,
|
|
"grad_norm": 28.996479865272974,
|
|
"learning_rate": 1.4661157024793387e-06,
|
|
"logits/chosen": 0.04345703125,
|
|
"logits/rejected": -0.1142578125,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.3446,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 0.40234375,
|
|
"rewards/margins": 7.59375,
|
|
"rewards/rejected": -7.1875,
|
|
"step": 671
|
|
},
|
|
{
|
|
"epoch": 0.8245398773006135,
|
|
"grad_norm": 28.7983416415084,
|
|
"learning_rate": 1.465289256198347e-06,
|
|
"logits/chosen": 0.060546875,
|
|
"logits/rejected": -0.208984375,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.3188,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": 0.6015625,
|
|
"rewards/margins": 7.9375,
|
|
"rewards/rejected": -7.3125,
|
|
"step": 672
|
|
},
|
|
{
|
|
"epoch": 0.8257668711656442,
|
|
"grad_norm": 30.439536228635117,
|
|
"learning_rate": 1.4644628099173553e-06,
|
|
"logits/chosen": 0.140625,
|
|
"logits/rejected": -0.09423828125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.3206,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.5703125,
|
|
"rewards/margins": 6.6875,
|
|
"rewards/rejected": -7.28125,
|
|
"step": 673
|
|
},
|
|
{
|
|
"epoch": 0.8269938650306748,
|
|
"grad_norm": 32.172451597856636,
|
|
"learning_rate": 1.4636363636363635e-06,
|
|
"logits/chosen": 0.158203125,
|
|
"logits/rejected": 0.00136566162109375,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.4855,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -0.875,
|
|
"rewards/margins": 7.0625,
|
|
"rewards/rejected": -7.9375,
|
|
"step": 674
|
|
},
|
|
{
|
|
"epoch": 0.8282208588957055,
|
|
"grad_norm": 29.896957123078558,
|
|
"learning_rate": 1.462809917355372e-06,
|
|
"logits/chosen": 0.0859375,
|
|
"logits/rejected": -0.1220703125,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.5364,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.275390625,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -8.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"epoch": 0.8294478527607362,
|
|
"grad_norm": 34.520059752466025,
|
|
"learning_rate": 1.46198347107438e-06,
|
|
"logits/chosen": -0.034912109375,
|
|
"logits/rejected": -0.1416015625,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.4196,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.1875,
|
|
"rewards/margins": 7.25,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 676
|
|
},
|
|
{
|
|
"epoch": 0.8306748466257668,
|
|
"grad_norm": 25.80650712803427,
|
|
"learning_rate": 1.4611570247933885e-06,
|
|
"logits/chosen": 0.09814453125,
|
|
"logits/rejected": -0.08447265625,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.3818,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.7734375,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -9.5,
|
|
"step": 677
|
|
},
|
|
{
|
|
"epoch": 0.8319018404907975,
|
|
"grad_norm": 32.549007655347566,
|
|
"learning_rate": 1.4603305785123967e-06,
|
|
"logits/chosen": 0.07568359375,
|
|
"logits/rejected": -0.134765625,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.5133,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -2.078125,
|
|
"rewards/margins": 7.21875,
|
|
"rewards/rejected": -9.3125,
|
|
"step": 678
|
|
},
|
|
{
|
|
"epoch": 0.8331288343558282,
|
|
"grad_norm": 28.24908049312222,
|
|
"learning_rate": 1.4595041322314049e-06,
|
|
"logits/chosen": 0.166015625,
|
|
"logits/rejected": 0.058837890625,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.4139,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -2.6875,
|
|
"rewards/margins": 6.75,
|
|
"rewards/rejected": -9.4375,
|
|
"step": 679
|
|
},
|
|
{
|
|
"epoch": 0.8343558282208589,
|
|
"grad_norm": 27.716668413166527,
|
|
"learning_rate": 1.458677685950413e-06,
|
|
"logits/chosen": 0.029296875,
|
|
"logits/rejected": -0.146484375,
|
|
"logps/chosen": -482.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.3225,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.4453125,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -9.8125,
|
|
"step": 680
|
|
},
|
|
{
|
|
"epoch": 0.8355828220858895,
|
|
"grad_norm": 22.83938713224214,
|
|
"learning_rate": 1.4578512396694215e-06,
|
|
"logits/chosen": -0.026611328125,
|
|
"logits/rejected": -0.1787109375,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.2259,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -2.328125,
|
|
"rewards/margins": 8.5,
|
|
"rewards/rejected": -10.8125,
|
|
"step": 681
|
|
},
|
|
{
|
|
"epoch": 0.8368098159509203,
|
|
"grad_norm": 26.927865724525695,
|
|
"learning_rate": 1.4570247933884296e-06,
|
|
"logits/chosen": -0.00433349609375,
|
|
"logits/rejected": -0.12255859375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.4388,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -2.6875,
|
|
"rewards/margins": 7.5,
|
|
"rewards/rejected": -10.1875,
|
|
"step": 682
|
|
},
|
|
{
|
|
"epoch": 0.838036809815951,
|
|
"grad_norm": 28.48111409969154,
|
|
"learning_rate": 1.456198347107438e-06,
|
|
"logits/chosen": -0.032470703125,
|
|
"logits/rejected": -0.1455078125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.3907,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -2.71875,
|
|
"rewards/margins": 7.9375,
|
|
"rewards/rejected": -10.625,
|
|
"step": 683
|
|
},
|
|
{
|
|
"epoch": 0.8392638036809816,
|
|
"grad_norm": 25.384242987665978,
|
|
"learning_rate": 1.4553719008264462e-06,
|
|
"logits/chosen": 0.1982421875,
|
|
"logits/rejected": 0.08056640625,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.3465,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -4.1875,
|
|
"rewards/margins": 6.375,
|
|
"rewards/rejected": -10.5625,
|
|
"step": 684
|
|
},
|
|
{
|
|
"epoch": 0.8404907975460123,
|
|
"grad_norm": 32.12795978669184,
|
|
"learning_rate": 1.4545454545454544e-06,
|
|
"logits/chosen": 0.032470703125,
|
|
"logits/rejected": -0.126953125,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.3812,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -2.734375,
|
|
"rewards/margins": 8.6875,
|
|
"rewards/rejected": -11.4375,
|
|
"step": 685
|
|
},
|
|
{
|
|
"epoch": 0.841717791411043,
|
|
"grad_norm": 20.94926346062215,
|
|
"learning_rate": 1.4537190082644628e-06,
|
|
"logits/chosen": 0.02734375,
|
|
"logits/rejected": -0.10302734375,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.2907,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -3.359375,
|
|
"rewards/margins": 7.90625,
|
|
"rewards/rejected": -11.25,
|
|
"step": 686
|
|
},
|
|
{
|
|
"epoch": 0.8429447852760736,
|
|
"grad_norm": 28.546478615273625,
|
|
"learning_rate": 1.452892561983471e-06,
|
|
"logits/chosen": 0.0277099609375,
|
|
"logits/rejected": -0.11474609375,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.3323,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -3.046875,
|
|
"rewards/margins": 8.125,
|
|
"rewards/rejected": -11.125,
|
|
"step": 687
|
|
},
|
|
{
|
|
"epoch": 0.8441717791411043,
|
|
"grad_norm": 28.462016204604527,
|
|
"learning_rate": 1.4520661157024792e-06,
|
|
"logits/chosen": -0.006927490234375,
|
|
"logits/rejected": -0.166015625,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.4034,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -3.828125,
|
|
"rewards/margins": 7.4375,
|
|
"rewards/rejected": -11.25,
|
|
"step": 688
|
|
},
|
|
{
|
|
"epoch": 0.845398773006135,
|
|
"grad_norm": 27.07857679187277,
|
|
"learning_rate": 1.4512396694214874e-06,
|
|
"logits/chosen": 0.01348876953125,
|
|
"logits/rejected": -0.0732421875,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.3169,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -2.65625,
|
|
"rewards/margins": 7.90625,
|
|
"rewards/rejected": -10.5625,
|
|
"step": 689
|
|
},
|
|
{
|
|
"epoch": 0.8466257668711656,
|
|
"grad_norm": 39.121660005293045,
|
|
"learning_rate": 1.4504132231404958e-06,
|
|
"logits/chosen": 0.154296875,
|
|
"logits/rejected": -0.03466796875,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.6079,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -2.4375,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -10.3125,
|
|
"step": 690
|
|
},
|
|
{
|
|
"epoch": 0.8478527607361963,
|
|
"grad_norm": 21.76491354614814,
|
|
"learning_rate": 1.449586776859504e-06,
|
|
"logits/chosen": -0.1787109375,
|
|
"logits/rejected": -0.291015625,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.252,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -1.953125,
|
|
"rewards/margins": 8.6875,
|
|
"rewards/rejected": -10.625,
|
|
"step": 691
|
|
},
|
|
{
|
|
"epoch": 0.849079754601227,
|
|
"grad_norm": 32.02003293503873,
|
|
"learning_rate": 1.4487603305785124e-06,
|
|
"logits/chosen": -0.0086669921875,
|
|
"logits/rejected": -0.1669921875,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.3402,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.5859375,
|
|
"rewards/margins": 8.625,
|
|
"rewards/rejected": -10.25,
|
|
"step": 692
|
|
},
|
|
{
|
|
"epoch": 0.8503067484662576,
|
|
"grad_norm": 27.414163330501403,
|
|
"learning_rate": 1.4479338842975206e-06,
|
|
"logits/chosen": -0.023681640625,
|
|
"logits/rejected": -0.2138671875,
|
|
"logps/chosen": -472.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.3703,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.84375,
|
|
"rewards/margins": 9.1875,
|
|
"rewards/rejected": -10.0625,
|
|
"step": 693
|
|
},
|
|
{
|
|
"epoch": 0.8515337423312883,
|
|
"grad_norm": 39.642457752407,
|
|
"learning_rate": 1.447107438016529e-06,
|
|
"logits/chosen": -0.007568359375,
|
|
"logits/rejected": -0.1943359375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.6025,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -2.484375,
|
|
"rewards/margins": 6.28125,
|
|
"rewards/rejected": -8.75,
|
|
"step": 694
|
|
},
|
|
{
|
|
"epoch": 0.852760736196319,
|
|
"grad_norm": 36.16807222911162,
|
|
"learning_rate": 1.4462809917355372e-06,
|
|
"logits/chosen": 0.022216796875,
|
|
"logits/rejected": -0.05908203125,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.5588,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -2.296875,
|
|
"rewards/margins": 5.75,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 695
|
|
},
|
|
{
|
|
"epoch": 0.8539877300613496,
|
|
"grad_norm": 29.70676917089465,
|
|
"learning_rate": 1.4454545454545456e-06,
|
|
"logits/chosen": 0.05419921875,
|
|
"logits/rejected": -0.12158203125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.3273,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.109375,
|
|
"rewards/margins": 7.84375,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 696
|
|
},
|
|
{
|
|
"epoch": 0.8552147239263803,
|
|
"grad_norm": 35.22010457179923,
|
|
"learning_rate": 1.4446280991735535e-06,
|
|
"logits/chosen": -0.11376953125,
|
|
"logits/rejected": -0.1494140625,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.5057,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.294921875,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 697
|
|
},
|
|
{
|
|
"epoch": 0.8564417177914111,
|
|
"grad_norm": 29.432728874044596,
|
|
"learning_rate": 1.443801652892562e-06,
|
|
"logits/chosen": 0.047607421875,
|
|
"logits/rejected": -0.07373046875,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.4517,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.7421875,
|
|
"rewards/margins": 7.75,
|
|
"rewards/rejected": -8.5,
|
|
"step": 698
|
|
},
|
|
{
|
|
"epoch": 0.8576687116564418,
|
|
"grad_norm": 24.19674153808839,
|
|
"learning_rate": 1.4429752066115701e-06,
|
|
"logits/chosen": -0.015625,
|
|
"logits/rejected": -0.099609375,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.2956,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -1.2109375,
|
|
"rewards/margins": 6.78125,
|
|
"rewards/rejected": -7.96875,
|
|
"step": 699
|
|
},
|
|
{
|
|
"epoch": 0.8588957055214724,
|
|
"grad_norm": 30.49738374159626,
|
|
"learning_rate": 1.4421487603305785e-06,
|
|
"logits/chosen": 0.10498046875,
|
|
"logits/rejected": 0.0118408203125,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.4495,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.1640625,
|
|
"rewards/margins": 6.53125,
|
|
"rewards/rejected": -7.6875,
|
|
"step": 700
|
|
},
|
|
{
|
|
"epoch": 0.8601226993865031,
|
|
"grad_norm": 34.42692978508714,
|
|
"learning_rate": 1.4413223140495867e-06,
|
|
"logits/chosen": 0.1259765625,
|
|
"logits/rejected": 0.0159912109375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.524,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -1.5078125,
|
|
"rewards/margins": 6.8125,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 701
|
|
},
|
|
{
|
|
"epoch": 0.8613496932515338,
|
|
"grad_norm": 28.491225794492916,
|
|
"learning_rate": 1.440495867768595e-06,
|
|
"logits/chosen": -0.0279541015625,
|
|
"logits/rejected": -0.32421875,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.2766,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.033935546875,
|
|
"rewards/margins": 8.3125,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 702
|
|
},
|
|
{
|
|
"epoch": 0.8625766871165644,
|
|
"grad_norm": 29.809130872353457,
|
|
"learning_rate": 1.4396694214876033e-06,
|
|
"logits/chosen": 0.11572265625,
|
|
"logits/rejected": -0.014404296875,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.3615,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.3203125,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -8.1875,
|
|
"step": 703
|
|
},
|
|
{
|
|
"epoch": 0.8638036809815951,
|
|
"grad_norm": 26.475832213271982,
|
|
"learning_rate": 1.4388429752066115e-06,
|
|
"logits/chosen": 0.029296875,
|
|
"logits/rejected": -0.1279296875,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -332.0,
|
|
"loss": 0.3837,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.03125,
|
|
"rewards/margins": 7.375,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 704
|
|
},
|
|
{
|
|
"epoch": 0.8650306748466258,
|
|
"grad_norm": 33.410232854812115,
|
|
"learning_rate": 1.4380165289256199e-06,
|
|
"logits/chosen": -0.08984375,
|
|
"logits/rejected": -0.212890625,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.3586,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.62109375,
|
|
"rewards/margins": 8.625,
|
|
"rewards/rejected": -9.25,
|
|
"step": 705
|
|
},
|
|
{
|
|
"epoch": 0.8662576687116564,
|
|
"grad_norm": 32.736741072215864,
|
|
"learning_rate": 1.4371900826446279e-06,
|
|
"logits/chosen": -0.0185546875,
|
|
"logits/rejected": -0.220703125,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -334.0,
|
|
"loss": 0.4525,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.140625,
|
|
"rewards/margins": 7.34375,
|
|
"rewards/rejected": -8.5,
|
|
"step": 706
|
|
},
|
|
{
|
|
"epoch": 0.8674846625766871,
|
|
"grad_norm": 34.51576760656713,
|
|
"learning_rate": 1.4363636363636363e-06,
|
|
"logits/chosen": -0.041748046875,
|
|
"logits/rejected": -0.20703125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.3675,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.515625,
|
|
"rewards/margins": 7.96875,
|
|
"rewards/rejected": -9.5,
|
|
"step": 707
|
|
},
|
|
{
|
|
"epoch": 0.8687116564417178,
|
|
"grad_norm": 26.415911063275388,
|
|
"learning_rate": 1.4355371900826444e-06,
|
|
"logits/chosen": -0.0164794921875,
|
|
"logits/rejected": -0.236328125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.279,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.74609375,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 708
|
|
},
|
|
{
|
|
"epoch": 0.8699386503067484,
|
|
"grad_norm": 22.544329099857716,
|
|
"learning_rate": 1.4347107438016528e-06,
|
|
"logits/chosen": 0.07421875,
|
|
"logits/rejected": -0.0791015625,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.2553,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.40625,
|
|
"rewards/margins": 9.25,
|
|
"rewards/rejected": -9.6875,
|
|
"step": 709
|
|
},
|
|
{
|
|
"epoch": 0.8711656441717791,
|
|
"grad_norm": 28.529561462599776,
|
|
"learning_rate": 1.433884297520661e-06,
|
|
"logits/chosen": 0.1337890625,
|
|
"logits/rejected": 0.006072998046875,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.414,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.4765625,
|
|
"rewards/margins": 7.21875,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 710
|
|
},
|
|
{
|
|
"epoch": 0.8723926380368098,
|
|
"grad_norm": 26.292208659052864,
|
|
"learning_rate": 1.4330578512396694e-06,
|
|
"logits/chosen": 0.10400390625,
|
|
"logits/rejected": -0.095703125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.3861,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.15625,
|
|
"rewards/margins": 7.84375,
|
|
"rewards/rejected": -9.0,
|
|
"step": 711
|
|
},
|
|
{
|
|
"epoch": 0.8736196319018404,
|
|
"grad_norm": 29.55452586068932,
|
|
"learning_rate": 1.4322314049586776e-06,
|
|
"logits/chosen": 0.09375,
|
|
"logits/rejected": -0.056640625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.4511,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -0.5234375,
|
|
"rewards/margins": 7.78125,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 712
|
|
},
|
|
{
|
|
"epoch": 0.8748466257668711,
|
|
"grad_norm": 24.284151309581777,
|
|
"learning_rate": 1.431404958677686e-06,
|
|
"logits/chosen": 0.00897216796875,
|
|
"logits/rejected": -0.20703125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.3247,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -1.1953125,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -9.625,
|
|
"step": 713
|
|
},
|
|
{
|
|
"epoch": 0.8760736196319019,
|
|
"grad_norm": 27.147595372766023,
|
|
"learning_rate": 1.4305785123966942e-06,
|
|
"logits/chosen": 0.1357421875,
|
|
"logits/rejected": -0.0859375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.3173,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -0.734375,
|
|
"rewards/margins": 7.8125,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 714
|
|
},
|
|
{
|
|
"epoch": 0.8773006134969326,
|
|
"grad_norm": 26.988571669436155,
|
|
"learning_rate": 1.4297520661157024e-06,
|
|
"logits/chosen": -0.10302734375,
|
|
"logits/rejected": -0.181640625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.3565,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.6953125,
|
|
"rewards/margins": 8.5,
|
|
"rewards/rejected": -9.25,
|
|
"step": 715
|
|
},
|
|
{
|
|
"epoch": 0.8785276073619632,
|
|
"grad_norm": 22.190701460200966,
|
|
"learning_rate": 1.4289256198347106e-06,
|
|
"logits/chosen": -0.062255859375,
|
|
"logits/rejected": -0.2333984375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.277,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.6328125,
|
|
"rewards/margins": 7.9375,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 716
|
|
},
|
|
{
|
|
"epoch": 0.8797546012269939,
|
|
"grad_norm": 25.791214816251124,
|
|
"learning_rate": 1.428099173553719e-06,
|
|
"logits/chosen": 0.02880859375,
|
|
"logits/rejected": -0.12890625,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -312.0,
|
|
"loss": 0.3465,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.203125,
|
|
"rewards/margins": 7.6875,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 717
|
|
},
|
|
{
|
|
"epoch": 0.8809815950920246,
|
|
"grad_norm": 21.677038331933062,
|
|
"learning_rate": 1.4272727272727272e-06,
|
|
"logits/chosen": -0.080078125,
|
|
"logits/rejected": -0.2158203125,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.2486,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -0.22265625,
|
|
"rewards/margins": 8.875,
|
|
"rewards/rejected": -9.0625,
|
|
"step": 718
|
|
},
|
|
{
|
|
"epoch": 0.8822085889570552,
|
|
"grad_norm": 31.275102961470218,
|
|
"learning_rate": 1.4264462809917354e-06,
|
|
"logits/chosen": -0.12158203125,
|
|
"logits/rejected": -0.251953125,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.3328,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": 0.169921875,
|
|
"rewards/margins": 8.9375,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 719
|
|
},
|
|
{
|
|
"epoch": 0.8834355828220859,
|
|
"grad_norm": 28.177039424566583,
|
|
"learning_rate": 1.4256198347107438e-06,
|
|
"logits/chosen": -0.11669921875,
|
|
"logits/rejected": -0.322265625,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.3401,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": 0.1484375,
|
|
"rewards/margins": 8.9375,
|
|
"rewards/rejected": -8.75,
|
|
"step": 720
|
|
},
|
|
{
|
|
"epoch": 0.8846625766871166,
|
|
"grad_norm": 24.36988004036112,
|
|
"learning_rate": 1.424793388429752e-06,
|
|
"logits/chosen": -0.11474609375,
|
|
"logits/rejected": -0.373046875,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.3233,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": 0.1591796875,
|
|
"rewards/margins": 9.75,
|
|
"rewards/rejected": -9.5625,
|
|
"step": 721
|
|
},
|
|
{
|
|
"epoch": 0.8858895705521472,
|
|
"grad_norm": 26.34423022787914,
|
|
"learning_rate": 1.4239669421487604e-06,
|
|
"logits/chosen": -0.0849609375,
|
|
"logits/rejected": -0.1787109375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.3255,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": -0.0693359375,
|
|
"rewards/margins": 8.5625,
|
|
"rewards/rejected": -8.625,
|
|
"step": 722
|
|
},
|
|
{
|
|
"epoch": 0.8871165644171779,
|
|
"grad_norm": 30.186809880156144,
|
|
"learning_rate": 1.4231404958677685e-06,
|
|
"logits/chosen": -0.07373046875,
|
|
"logits/rejected": -0.1787109375,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.3484,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.482421875,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -8.375,
|
|
"step": 723
|
|
},
|
|
{
|
|
"epoch": 0.8883435582822086,
|
|
"grad_norm": 28.732160993316025,
|
|
"learning_rate": 1.4223140495867767e-06,
|
|
"logits/chosen": -0.06787109375,
|
|
"logits/rejected": -0.2890625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.3932,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.0145263671875,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -8.375,
|
|
"step": 724
|
|
},
|
|
{
|
|
"epoch": 0.8895705521472392,
|
|
"grad_norm": 28.878669838062223,
|
|
"learning_rate": 1.421487603305785e-06,
|
|
"logits/chosen": 0.09130859375,
|
|
"logits/rejected": -0.083984375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.4533,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.56640625,
|
|
"rewards/margins": 7.5625,
|
|
"rewards/rejected": -8.125,
|
|
"step": 725
|
|
},
|
|
{
|
|
"epoch": 0.8907975460122699,
|
|
"grad_norm": 30.17893494033232,
|
|
"learning_rate": 1.4206611570247933e-06,
|
|
"logits/chosen": -0.056884765625,
|
|
"logits/rejected": -0.1826171875,
|
|
"logps/chosen": -352.0,
|
|
"logps/rejected": -318.0,
|
|
"loss": 0.329,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.67578125,
|
|
"rewards/margins": 7.90625,
|
|
"rewards/rejected": -8.625,
|
|
"step": 726
|
|
},
|
|
{
|
|
"epoch": 0.8920245398773006,
|
|
"grad_norm": 33.608941642903545,
|
|
"learning_rate": 1.4198347107438015e-06,
|
|
"logits/chosen": -0.02880859375,
|
|
"logits/rejected": -0.177734375,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.2906,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.421875,
|
|
"rewards/margins": 7.84375,
|
|
"rewards/rejected": -8.25,
|
|
"step": 727
|
|
},
|
|
{
|
|
"epoch": 0.8932515337423312,
|
|
"grad_norm": 28.91416626418709,
|
|
"learning_rate": 1.41900826446281e-06,
|
|
"logits/chosen": -0.051025390625,
|
|
"logits/rejected": -0.19140625,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.3732,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": 0.030517578125,
|
|
"rewards/margins": 9.125,
|
|
"rewards/rejected": -9.125,
|
|
"step": 728
|
|
},
|
|
{
|
|
"epoch": 0.894478527607362,
|
|
"grad_norm": 26.23208605642664,
|
|
"learning_rate": 1.418181818181818e-06,
|
|
"logits/chosen": -0.06201171875,
|
|
"logits/rejected": -0.1943359375,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.2404,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.283203125,
|
|
"rewards/margins": 9.0,
|
|
"rewards/rejected": -9.3125,
|
|
"step": 729
|
|
},
|
|
{
|
|
"epoch": 0.8957055214723927,
|
|
"grad_norm": 25.774838299998283,
|
|
"learning_rate": 1.4173553719008265e-06,
|
|
"logits/chosen": -0.12109375,
|
|
"logits/rejected": -0.2236328125,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.2348,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": 0.447265625,
|
|
"rewards/margins": 8.75,
|
|
"rewards/rejected": -8.3125,
|
|
"step": 730
|
|
},
|
|
{
|
|
"epoch": 0.8969325153374234,
|
|
"grad_norm": 31.842104798671258,
|
|
"learning_rate": 1.4165289256198347e-06,
|
|
"logits/chosen": 0.0927734375,
|
|
"logits/rejected": -0.0220947265625,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.3761,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.51171875,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 731
|
|
},
|
|
{
|
|
"epoch": 0.898159509202454,
|
|
"grad_norm": 28.21943911685738,
|
|
"learning_rate": 1.415702479338843e-06,
|
|
"logits/chosen": -0.080078125,
|
|
"logits/rejected": -0.234375,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.3918,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.322265625,
|
|
"rewards/margins": 7.8125,
|
|
"rewards/rejected": -8.125,
|
|
"step": 732
|
|
},
|
|
{
|
|
"epoch": 0.8993865030674847,
|
|
"grad_norm": 29.041683327276143,
|
|
"learning_rate": 1.414876033057851e-06,
|
|
"logits/chosen": 0.043701171875,
|
|
"logits/rejected": -0.10595703125,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.3207,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.0703125,
|
|
"rewards/margins": 7.5625,
|
|
"rewards/rejected": -8.625,
|
|
"step": 733
|
|
},
|
|
{
|
|
"epoch": 0.9006134969325154,
|
|
"grad_norm": 30.30128813839964,
|
|
"learning_rate": 1.4140495867768595e-06,
|
|
"logits/chosen": 0.056884765625,
|
|
"logits/rejected": -0.12255859375,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.3404,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.388671875,
|
|
"rewards/margins": 8.375,
|
|
"rewards/rejected": -8.75,
|
|
"step": 734
|
|
},
|
|
{
|
|
"epoch": 0.901840490797546,
|
|
"grad_norm": 28.991498564684523,
|
|
"learning_rate": 1.4132231404958677e-06,
|
|
"logits/chosen": -0.0517578125,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.3195,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.734375,
|
|
"rewards/margins": 9.0625,
|
|
"rewards/rejected": -9.8125,
|
|
"step": 735
|
|
},
|
|
{
|
|
"epoch": 0.9030674846625767,
|
|
"grad_norm": 27.484399578704373,
|
|
"learning_rate": 1.412396694214876e-06,
|
|
"logits/chosen": 0.1357421875,
|
|
"logits/rejected": 0.012451171875,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.4043,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.6640625,
|
|
"rewards/margins": 7.125,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 736
|
|
},
|
|
{
|
|
"epoch": 0.9042944785276074,
|
|
"grad_norm": 34.0157091638658,
|
|
"learning_rate": 1.4115702479338842e-06,
|
|
"logits/chosen": 0.0301513671875,
|
|
"logits/rejected": -0.07275390625,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.521,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.6484375,
|
|
"rewards/margins": 7.25,
|
|
"rewards/rejected": -8.875,
|
|
"step": 737
|
|
},
|
|
{
|
|
"epoch": 0.905521472392638,
|
|
"grad_norm": 29.26954900442495,
|
|
"learning_rate": 1.4107438016528924e-06,
|
|
"logits/chosen": -0.052734375,
|
|
"logits/rejected": -0.1630859375,
|
|
"logps/chosen": -462.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.3774,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -0.76171875,
|
|
"rewards/margins": 8.625,
|
|
"rewards/rejected": -9.4375,
|
|
"step": 738
|
|
},
|
|
{
|
|
"epoch": 0.9067484662576687,
|
|
"grad_norm": 26.555268317808686,
|
|
"learning_rate": 1.4099173553719008e-06,
|
|
"logits/chosen": 0.044921875,
|
|
"logits/rejected": -0.08056640625,
|
|
"logps/chosen": -360.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.275,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.390625,
|
|
"rewards/margins": 7.5,
|
|
"rewards/rejected": -8.875,
|
|
"step": 739
|
|
},
|
|
{
|
|
"epoch": 0.9079754601226994,
|
|
"grad_norm": 27.061032091197205,
|
|
"learning_rate": 1.409090909090909e-06,
|
|
"logits/chosen": -0.0361328125,
|
|
"logits/rejected": -0.193359375,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.3565,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.1796875,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -9.0625,
|
|
"step": 740
|
|
},
|
|
{
|
|
"epoch": 0.90920245398773,
|
|
"grad_norm": 31.60349380035715,
|
|
"learning_rate": 1.4082644628099174e-06,
|
|
"logits/chosen": -0.0211181640625,
|
|
"logits/rejected": -0.1806640625,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.4085,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.4140625,
|
|
"rewards/margins": 9.0,
|
|
"rewards/rejected": -9.4375,
|
|
"step": 741
|
|
},
|
|
{
|
|
"epoch": 0.9104294478527607,
|
|
"grad_norm": 26.61394408236033,
|
|
"learning_rate": 1.4074380165289254e-06,
|
|
"logits/chosen": -0.0458984375,
|
|
"logits/rejected": -0.20703125,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.3156,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.58984375,
|
|
"rewards/margins": 9.0,
|
|
"rewards/rejected": -9.625,
|
|
"step": 742
|
|
},
|
|
{
|
|
"epoch": 0.9116564417177914,
|
|
"grad_norm": 32.61195100311176,
|
|
"learning_rate": 1.4066115702479338e-06,
|
|
"logits/chosen": -0.00848388671875,
|
|
"logits/rejected": -0.06640625,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.4269,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.59375,
|
|
"rewards/margins": 7.46875,
|
|
"rewards/rejected": -9.0625,
|
|
"step": 743
|
|
},
|
|
{
|
|
"epoch": 0.912883435582822,
|
|
"grad_norm": 28.563408773577645,
|
|
"learning_rate": 1.405785123966942e-06,
|
|
"logits/chosen": 0.0189208984375,
|
|
"logits/rejected": -0.1640625,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.3528,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -0.59765625,
|
|
"rewards/margins": 9.3125,
|
|
"rewards/rejected": -9.875,
|
|
"step": 744
|
|
},
|
|
{
|
|
"epoch": 0.9141104294478528,
|
|
"grad_norm": 28.351305424214722,
|
|
"learning_rate": 1.4049586776859504e-06,
|
|
"logits/chosen": 0.06982421875,
|
|
"logits/rejected": -0.021240234375,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.3199,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.5625,
|
|
"rewards/margins": 7.25,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 745
|
|
},
|
|
{
|
|
"epoch": 0.9153374233128835,
|
|
"grad_norm": 33.96507331459219,
|
|
"learning_rate": 1.4041322314049586e-06,
|
|
"logits/chosen": 0.07470703125,
|
|
"logits/rejected": -0.10009765625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.4361,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.2734375,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -9.3125,
|
|
"step": 746
|
|
},
|
|
{
|
|
"epoch": 0.9165644171779141,
|
|
"grad_norm": 26.76986957266807,
|
|
"learning_rate": 1.403305785123967e-06,
|
|
"logits/chosen": -0.126953125,
|
|
"logits/rejected": -0.240234375,
|
|
"logps/chosen": -358.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.2992,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.5078125,
|
|
"rewards/margins": 7.5,
|
|
"rewards/rejected": -9.0,
|
|
"step": 747
|
|
},
|
|
{
|
|
"epoch": 0.9177914110429448,
|
|
"grad_norm": 32.7326110006311,
|
|
"learning_rate": 1.4024793388429752e-06,
|
|
"logits/chosen": 0.107421875,
|
|
"logits/rejected": -0.0062255859375,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.5331,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": -2.34375,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 748
|
|
},
|
|
{
|
|
"epoch": 0.9190184049079755,
|
|
"grad_norm": 30.856327543823536,
|
|
"learning_rate": 1.4016528925619836e-06,
|
|
"logits/chosen": -0.06640625,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.4432,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -1.46875,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -9.5625,
|
|
"step": 749
|
|
},
|
|
{
|
|
"epoch": 0.9202453987730062,
|
|
"grad_norm": 32.95828711550431,
|
|
"learning_rate": 1.4008264462809917e-06,
|
|
"logits/chosen": -0.0023651123046875,
|
|
"logits/rejected": -0.138671875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.4616,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.6640625,
|
|
"rewards/margins": 8.1875,
|
|
"rewards/rejected": -9.8125,
|
|
"step": 750
|
|
},
|
|
{
|
|
"epoch": 0.9214723926380368,
|
|
"grad_norm": 34.25501142385686,
|
|
"learning_rate": 1.4e-06,
|
|
"logits/chosen": -0.0296630859375,
|
|
"logits/rejected": -0.1943359375,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.3754,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.234375,
|
|
"rewards/margins": 9.25,
|
|
"rewards/rejected": -10.5,
|
|
"step": 751
|
|
},
|
|
{
|
|
"epoch": 0.9226993865030675,
|
|
"grad_norm": 30.76023258106853,
|
|
"learning_rate": 1.3991735537190081e-06,
|
|
"logits/chosen": -0.05078125,
|
|
"logits/rejected": -0.296875,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.4164,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.046875,
|
|
"rewards/margins": 9.25,
|
|
"rewards/rejected": -10.3125,
|
|
"step": 752
|
|
},
|
|
{
|
|
"epoch": 0.9239263803680982,
|
|
"grad_norm": 27.654836403118072,
|
|
"learning_rate": 1.3983471074380165e-06,
|
|
"logits/chosen": 0.1201171875,
|
|
"logits/rejected": -0.014404296875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.3484,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.6875,
|
|
"rewards/margins": 8.1875,
|
|
"rewards/rejected": -9.875,
|
|
"step": 753
|
|
},
|
|
{
|
|
"epoch": 0.9251533742331288,
|
|
"grad_norm": 32.354546439688335,
|
|
"learning_rate": 1.3975206611570247e-06,
|
|
"logits/chosen": 0.04296875,
|
|
"logits/rejected": -0.1318359375,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.458,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -1.9921875,
|
|
"rewards/margins": 7.65625,
|
|
"rewards/rejected": -9.625,
|
|
"step": 754
|
|
},
|
|
{
|
|
"epoch": 0.9263803680981595,
|
|
"grad_norm": 29.017964657934716,
|
|
"learning_rate": 1.396694214876033e-06,
|
|
"logits/chosen": -0.004119873046875,
|
|
"logits/rejected": -0.1328125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.3862,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -2.0625,
|
|
"rewards/margins": 8.125,
|
|
"rewards/rejected": -10.1875,
|
|
"step": 755
|
|
},
|
|
{
|
|
"epoch": 0.9276073619631902,
|
|
"grad_norm": 24.680066346312046,
|
|
"learning_rate": 1.3958677685950413e-06,
|
|
"logits/chosen": 0.08837890625,
|
|
"logits/rejected": -0.00445556640625,
|
|
"logps/chosen": -360.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.3137,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -2.4375,
|
|
"rewards/margins": 7.8125,
|
|
"rewards/rejected": -10.25,
|
|
"step": 756
|
|
},
|
|
{
|
|
"epoch": 0.9288343558282208,
|
|
"grad_norm": 21.628298869025013,
|
|
"learning_rate": 1.3950413223140495e-06,
|
|
"logits/chosen": 0.1376953125,
|
|
"logits/rejected": -0.0830078125,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.2783,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.8515625,
|
|
"rewards/margins": 9.125,
|
|
"rewards/rejected": -9.9375,
|
|
"step": 757
|
|
},
|
|
{
|
|
"epoch": 0.9300613496932515,
|
|
"grad_norm": 35.66137842607611,
|
|
"learning_rate": 1.3942148760330579e-06,
|
|
"logits/chosen": 0.05908203125,
|
|
"logits/rejected": -0.10546875,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.4513,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -2.234375,
|
|
"rewards/margins": 7.625,
|
|
"rewards/rejected": -9.875,
|
|
"step": 758
|
|
},
|
|
{
|
|
"epoch": 0.9312883435582822,
|
|
"grad_norm": 26.26811416539099,
|
|
"learning_rate": 1.393388429752066e-06,
|
|
"logits/chosen": 0.08203125,
|
|
"logits/rejected": -0.14453125,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.326,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.6015625,
|
|
"rewards/margins": 7.78125,
|
|
"rewards/rejected": -9.375,
|
|
"step": 759
|
|
},
|
|
{
|
|
"epoch": 0.9325153374233128,
|
|
"grad_norm": 24.851920470373752,
|
|
"learning_rate": 1.3925619834710743e-06,
|
|
"logits/chosen": -0.1220703125,
|
|
"logits/rejected": -0.380859375,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.3206,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.4453125,
|
|
"rewards/margins": 9.4375,
|
|
"rewards/rejected": -9.875,
|
|
"step": 760
|
|
},
|
|
{
|
|
"epoch": 0.9337423312883436,
|
|
"grad_norm": 30.55354124740392,
|
|
"learning_rate": 1.3917355371900825e-06,
|
|
"logits/chosen": 0.12109375,
|
|
"logits/rejected": -0.006622314453125,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.4391,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.1328125,
|
|
"rewards/margins": 7.9375,
|
|
"rewards/rejected": -9.0625,
|
|
"step": 761
|
|
},
|
|
{
|
|
"epoch": 0.9349693251533743,
|
|
"grad_norm": 31.618904719465664,
|
|
"learning_rate": 1.3909090909090909e-06,
|
|
"logits/chosen": 0.1259765625,
|
|
"logits/rejected": -0.05908203125,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.3448,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.2109375,
|
|
"rewards/margins": 8.4375,
|
|
"rewards/rejected": -9.625,
|
|
"step": 762
|
|
},
|
|
{
|
|
"epoch": 0.9361963190184049,
|
|
"grad_norm": 27.471562829766043,
|
|
"learning_rate": 1.390082644628099e-06,
|
|
"logits/chosen": 0.0673828125,
|
|
"logits/rejected": -0.0220947265625,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.422,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.15625,
|
|
"rewards/margins": 8.1875,
|
|
"rewards/rejected": -9.375,
|
|
"step": 763
|
|
},
|
|
{
|
|
"epoch": 0.9374233128834356,
|
|
"grad_norm": 27.813477501412212,
|
|
"learning_rate": 1.3892561983471074e-06,
|
|
"logits/chosen": -0.158203125,
|
|
"logits/rejected": -0.3203125,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.3219,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -1.8984375,
|
|
"rewards/margins": 7.8125,
|
|
"rewards/rejected": -9.6875,
|
|
"step": 764
|
|
},
|
|
{
|
|
"epoch": 0.9386503067484663,
|
|
"grad_norm": 35.1646310481215,
|
|
"learning_rate": 1.3884297520661156e-06,
|
|
"logits/chosen": 0.08837890625,
|
|
"logits/rejected": -0.03955078125,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.4236,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.75,
|
|
"rewards/margins": 6.8125,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 765
|
|
},
|
|
{
|
|
"epoch": 0.939877300613497,
|
|
"grad_norm": 27.592476560371697,
|
|
"learning_rate": 1.387603305785124e-06,
|
|
"logits/chosen": 0.01409912109375,
|
|
"logits/rejected": -0.1826171875,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.3505,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -0.82421875,
|
|
"rewards/margins": 8.1875,
|
|
"rewards/rejected": -9.0625,
|
|
"step": 766
|
|
},
|
|
{
|
|
"epoch": 0.9411042944785276,
|
|
"grad_norm": 31.90981191788155,
|
|
"learning_rate": 1.3867768595041322e-06,
|
|
"logits/chosen": 0.00347900390625,
|
|
"logits/rejected": -0.14453125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.3799,
|
|
"rewards/accuracies": 0.796875,
|
|
"rewards/chosen": -1.328125,
|
|
"rewards/margins": 8.3125,
|
|
"rewards/rejected": -9.625,
|
|
"step": 767
|
|
},
|
|
{
|
|
"epoch": 0.9423312883435583,
|
|
"grad_norm": 32.31524381355194,
|
|
"learning_rate": 1.3859504132231404e-06,
|
|
"logits/chosen": -0.0296630859375,
|
|
"logits/rejected": -0.197265625,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.5188,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -0.83984375,
|
|
"rewards/margins": 7.9375,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 768
|
|
},
|
|
{
|
|
"epoch": 0.943558282208589,
|
|
"grad_norm": 24.9484574754309,
|
|
"learning_rate": 1.3851239669421486e-06,
|
|
"logits/chosen": -0.036376953125,
|
|
"logits/rejected": -0.1845703125,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.3514,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.359375,
|
|
"rewards/margins": 8.125,
|
|
"rewards/rejected": -9.5,
|
|
"step": 769
|
|
},
|
|
{
|
|
"epoch": 0.9447852760736196,
|
|
"grad_norm": 29.724831207517727,
|
|
"learning_rate": 1.384297520661157e-06,
|
|
"logits/chosen": -0.054931640625,
|
|
"logits/rejected": -0.298828125,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.3526,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -0.451171875,
|
|
"rewards/margins": 8.0,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 770
|
|
},
|
|
{
|
|
"epoch": 0.9460122699386503,
|
|
"grad_norm": 34.49223344860793,
|
|
"learning_rate": 1.3834710743801652e-06,
|
|
"logits/chosen": -0.038818359375,
|
|
"logits/rejected": -0.0537109375,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.5503,
|
|
"rewards/accuracies": 0.78125,
|
|
"rewards/chosen": -2.046875,
|
|
"rewards/margins": 6.75,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 771
|
|
},
|
|
{
|
|
"epoch": 0.947239263803681,
|
|
"grad_norm": 27.871880415257962,
|
|
"learning_rate": 1.3826446280991736e-06,
|
|
"logits/chosen": 0.09130859375,
|
|
"logits/rejected": -0.1279296875,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.3883,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.83984375,
|
|
"rewards/margins": 7.8125,
|
|
"rewards/rejected": -8.625,
|
|
"step": 772
|
|
},
|
|
{
|
|
"epoch": 0.9484662576687116,
|
|
"grad_norm": 33.61022001136346,
|
|
"learning_rate": 1.3818181818181818e-06,
|
|
"logits/chosen": 0.10888671875,
|
|
"logits/rejected": -0.0693359375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -340.0,
|
|
"loss": 0.4304,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.859375,
|
|
"rewards/margins": 6.8125,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 773
|
|
},
|
|
{
|
|
"epoch": 0.9496932515337423,
|
|
"grad_norm": 31.238399838630126,
|
|
"learning_rate": 1.38099173553719e-06,
|
|
"logits/chosen": 0.09765625,
|
|
"logits/rejected": -0.044921875,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.4225,
|
|
"rewards/accuracies": 0.8046875,
|
|
"rewards/chosen": -2.859375,
|
|
"rewards/margins": 5.5,
|
|
"rewards/rejected": -8.375,
|
|
"step": 774
|
|
},
|
|
{
|
|
"epoch": 0.950920245398773,
|
|
"grad_norm": 31.68469327733575,
|
|
"learning_rate": 1.3801652892561984e-06,
|
|
"logits/chosen": 0.173828125,
|
|
"logits/rejected": -0.0042724609375,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.4133,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -1.96875,
|
|
"rewards/margins": 6.46875,
|
|
"rewards/rejected": -8.4375,
|
|
"step": 775
|
|
},
|
|
{
|
|
"epoch": 0.9521472392638037,
|
|
"grad_norm": 29.267036991785805,
|
|
"learning_rate": 1.3793388429752066e-06,
|
|
"logits/chosen": -0.046142578125,
|
|
"logits/rejected": -0.2041015625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.4733,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -1.1640625,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -8.0625,
|
|
"step": 776
|
|
},
|
|
{
|
|
"epoch": 0.9533742331288344,
|
|
"grad_norm": 28.583966780563642,
|
|
"learning_rate": 1.3785123966942147e-06,
|
|
"logits/chosen": -0.0089111328125,
|
|
"logits/rejected": -0.1357421875,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.4234,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.8125,
|
|
"rewards/margins": 6.875,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 777
|
|
},
|
|
{
|
|
"epoch": 0.9546012269938651,
|
|
"grad_norm": 28.160692020645605,
|
|
"learning_rate": 1.377685950413223e-06,
|
|
"logits/chosen": 0.0289306640625,
|
|
"logits/rejected": -0.1669921875,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.2711,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.953125,
|
|
"rewards/margins": 6.0625,
|
|
"rewards/rejected": -8.0,
|
|
"step": 778
|
|
},
|
|
{
|
|
"epoch": 0.9558282208588957,
|
|
"grad_norm": 28.786162074277648,
|
|
"learning_rate": 1.3768595041322313e-06,
|
|
"logits/chosen": -0.031005859375,
|
|
"logits/rejected": -0.1923828125,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.3692,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.1953125,
|
|
"rewards/margins": 7.75,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 779
|
|
},
|
|
{
|
|
"epoch": 0.9570552147239264,
|
|
"grad_norm": 33.93000816819851,
|
|
"learning_rate": 1.3760330578512395e-06,
|
|
"logits/chosen": 0.09375,
|
|
"logits/rejected": -0.0810546875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.5206,
|
|
"rewards/accuracies": 0.7734375,
|
|
"rewards/chosen": -2.453125,
|
|
"rewards/margins": 6.15625,
|
|
"rewards/rejected": -8.625,
|
|
"step": 780
|
|
},
|
|
{
|
|
"epoch": 0.9582822085889571,
|
|
"grad_norm": 26.56406725425245,
|
|
"learning_rate": 1.375206611570248e-06,
|
|
"logits/chosen": -0.049072265625,
|
|
"logits/rejected": -0.27734375,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.2804,
|
|
"rewards/accuracies": 0.8828125,
|
|
"rewards/chosen": -0.453125,
|
|
"rewards/margins": 8.875,
|
|
"rewards/rejected": -9.3125,
|
|
"step": 781
|
|
},
|
|
{
|
|
"epoch": 0.9595092024539877,
|
|
"grad_norm": 25.348486184371342,
|
|
"learning_rate": 1.374380165289256e-06,
|
|
"logits/chosen": -0.006195068359375,
|
|
"logits/rejected": -0.099609375,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.3026,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.4921875,
|
|
"rewards/margins": 7.3125,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 782
|
|
},
|
|
{
|
|
"epoch": 0.9607361963190184,
|
|
"grad_norm": 63.770958134013526,
|
|
"learning_rate": 1.3735537190082645e-06,
|
|
"logits/chosen": -0.026123046875,
|
|
"logits/rejected": -0.1640625,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.3397,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -1.015625,
|
|
"rewards/margins": 8.25,
|
|
"rewards/rejected": -9.25,
|
|
"step": 783
|
|
},
|
|
{
|
|
"epoch": 0.9619631901840491,
|
|
"grad_norm": 32.288193349248125,
|
|
"learning_rate": 1.3727272727272727e-06,
|
|
"logits/chosen": 0.053955078125,
|
|
"logits/rejected": 0.006134033203125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.4502,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -2.359375,
|
|
"rewards/margins": 6.3125,
|
|
"rewards/rejected": -8.6875,
|
|
"step": 784
|
|
},
|
|
{
|
|
"epoch": 0.9631901840490797,
|
|
"grad_norm": 21.993651500393696,
|
|
"learning_rate": 1.371900826446281e-06,
|
|
"logits/chosen": 0.08154296875,
|
|
"logits/rejected": -0.08447265625,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -338.0,
|
|
"loss": 0.1918,
|
|
"rewards/accuracies": 0.921875,
|
|
"rewards/chosen": -1.40625,
|
|
"rewards/margins": 7.4375,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 785
|
|
},
|
|
{
|
|
"epoch": 0.9644171779141104,
|
|
"grad_norm": 23.05424200363552,
|
|
"learning_rate": 1.371074380165289e-06,
|
|
"logits/chosen": 0.0673828125,
|
|
"logits/rejected": -0.1337890625,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -346.0,
|
|
"loss": 0.2392,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.7890625,
|
|
"rewards/margins": 7.3125,
|
|
"rewards/rejected": -9.125,
|
|
"step": 786
|
|
},
|
|
{
|
|
"epoch": 0.9656441717791411,
|
|
"grad_norm": 33.84343849581761,
|
|
"learning_rate": 1.3702479338842975e-06,
|
|
"logits/chosen": -0.0194091796875,
|
|
"logits/rejected": -0.1337890625,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.3952,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.8828125,
|
|
"rewards/margins": 7.6875,
|
|
"rewards/rejected": -9.5625,
|
|
"step": 787
|
|
},
|
|
{
|
|
"epoch": 0.9668711656441717,
|
|
"grad_norm": 25.257200964506605,
|
|
"learning_rate": 1.3694214876033057e-06,
|
|
"logits/chosen": -0.041748046875,
|
|
"logits/rejected": -0.20703125,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.2111,
|
|
"rewards/accuracies": 0.8984375,
|
|
"rewards/chosen": -0.78125,
|
|
"rewards/margins": 8.0625,
|
|
"rewards/rejected": -8.875,
|
|
"step": 788
|
|
},
|
|
{
|
|
"epoch": 0.9680981595092024,
|
|
"grad_norm": 27.6408264153912,
|
|
"learning_rate": 1.368595041322314e-06,
|
|
"logits/chosen": 0.076171875,
|
|
"logits/rejected": -0.10546875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.4365,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -2.15625,
|
|
"rewards/margins": 7.0,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 789
|
|
},
|
|
{
|
|
"epoch": 0.9693251533742331,
|
|
"grad_norm": 29.798816940792484,
|
|
"learning_rate": 1.3677685950413222e-06,
|
|
"logits/chosen": -0.06640625,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.2237,
|
|
"rewards/accuracies": 0.90625,
|
|
"rewards/chosen": -1.609375,
|
|
"rewards/margins": 7.46875,
|
|
"rewards/rejected": -9.0625,
|
|
"step": 790
|
|
},
|
|
{
|
|
"epoch": 0.9705521472392638,
|
|
"grad_norm": 31.358117893593867,
|
|
"learning_rate": 1.3669421487603304e-06,
|
|
"logits/chosen": -0.0693359375,
|
|
"logits/rejected": -0.26171875,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.4102,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.0546875,
|
|
"rewards/margins": 8.3125,
|
|
"rewards/rejected": -9.375,
|
|
"step": 791
|
|
},
|
|
{
|
|
"epoch": 0.9717791411042945,
|
|
"grad_norm": 29.723517426719823,
|
|
"learning_rate": 1.3661157024793388e-06,
|
|
"logits/chosen": -0.037109375,
|
|
"logits/rejected": -0.1650390625,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.4537,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -1.1875,
|
|
"rewards/margins": 6.9375,
|
|
"rewards/rejected": -8.125,
|
|
"step": 792
|
|
},
|
|
{
|
|
"epoch": 0.9730061349693252,
|
|
"grad_norm": 29.941763131336998,
|
|
"learning_rate": 1.365289256198347e-06,
|
|
"logits/chosen": -0.01611328125,
|
|
"logits/rejected": -0.14453125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.4007,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.6953125,
|
|
"rewards/margins": 6.6875,
|
|
"rewards/rejected": -8.375,
|
|
"step": 793
|
|
},
|
|
{
|
|
"epoch": 0.9742331288343559,
|
|
"grad_norm": 32.53853431959141,
|
|
"learning_rate": 1.3644628099173554e-06,
|
|
"logits/chosen": 0.035400390625,
|
|
"logits/rejected": -0.08935546875,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.5349,
|
|
"rewards/accuracies": 0.8203125,
|
|
"rewards/chosen": -2.21875,
|
|
"rewards/margins": 6.5625,
|
|
"rewards/rejected": -8.75,
|
|
"step": 794
|
|
},
|
|
{
|
|
"epoch": 0.9754601226993865,
|
|
"grad_norm": 21.371634989628767,
|
|
"learning_rate": 1.3636363636363634e-06,
|
|
"logits/chosen": -0.185546875,
|
|
"logits/rejected": -0.330078125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.3106,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -0.5625,
|
|
"rewards/margins": 9.1875,
|
|
"rewards/rejected": -9.75,
|
|
"step": 795
|
|
},
|
|
{
|
|
"epoch": 0.9766871165644172,
|
|
"grad_norm": 33.741391271868395,
|
|
"learning_rate": 1.3628099173553718e-06,
|
|
"logits/chosen": -0.0654296875,
|
|
"logits/rejected": -0.26171875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.3692,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -2.484375,
|
|
"rewards/margins": 7.125,
|
|
"rewards/rejected": -9.625,
|
|
"step": 796
|
|
},
|
|
{
|
|
"epoch": 0.9779141104294479,
|
|
"grad_norm": 23.345670575024723,
|
|
"learning_rate": 1.36198347107438e-06,
|
|
"logits/chosen": 0.01483154296875,
|
|
"logits/rejected": -0.1650390625,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.2477,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -2.078125,
|
|
"rewards/margins": 7.15625,
|
|
"rewards/rejected": -9.25,
|
|
"step": 797
|
|
},
|
|
{
|
|
"epoch": 0.9791411042944785,
|
|
"grad_norm": 33.658901557419405,
|
|
"learning_rate": 1.3611570247933884e-06,
|
|
"logits/chosen": -0.03369140625,
|
|
"logits/rejected": -0.20703125,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.3878,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.4453125,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -9.3125,
|
|
"step": 798
|
|
},
|
|
{
|
|
"epoch": 0.9803680981595092,
|
|
"grad_norm": 29.15355444814546,
|
|
"learning_rate": 1.3603305785123966e-06,
|
|
"logits/chosen": -0.08935546875,
|
|
"logits/rejected": -0.2451171875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.361,
|
|
"rewards/accuracies": 0.8359375,
|
|
"rewards/chosen": -1.4765625,
|
|
"rewards/margins": 7.96875,
|
|
"rewards/rejected": -9.4375,
|
|
"step": 799
|
|
},
|
|
{
|
|
"epoch": 0.9815950920245399,
|
|
"grad_norm": 29.90426744282101,
|
|
"learning_rate": 1.359504132231405e-06,
|
|
"logits/chosen": -0.055908203125,
|
|
"logits/rejected": -0.2412109375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.335,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": -1.59375,
|
|
"rewards/margins": 7.46875,
|
|
"rewards/rejected": -9.0625,
|
|
"step": 800
|
|
},
|
|
{
|
|
"epoch": 0.9828220858895705,
|
|
"grad_norm": 33.28235046112419,
|
|
"learning_rate": 1.3586776859504132e-06,
|
|
"logits/chosen": -0.061279296875,
|
|
"logits/rejected": -0.21484375,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.4711,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.8359375,
|
|
"rewards/margins": 6.71875,
|
|
"rewards/rejected": -8.5625,
|
|
"step": 801
|
|
},
|
|
{
|
|
"epoch": 0.9840490797546012,
|
|
"grad_norm": 33.439121725020144,
|
|
"learning_rate": 1.3578512396694216e-06,
|
|
"logits/chosen": -0.11865234375,
|
|
"logits/rejected": -0.259765625,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.5122,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.875,
|
|
"rewards/margins": 6.96875,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 802
|
|
},
|
|
{
|
|
"epoch": 0.9852760736196319,
|
|
"grad_norm": 28.780793215852647,
|
|
"learning_rate": 1.3570247933884298e-06,
|
|
"logits/chosen": -0.1826171875,
|
|
"logits/rejected": -0.3359375,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.3669,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -1.0,
|
|
"rewards/margins": 7.78125,
|
|
"rewards/rejected": -8.75,
|
|
"step": 803
|
|
},
|
|
{
|
|
"epoch": 0.9865030674846625,
|
|
"grad_norm": 30.526208765254125,
|
|
"learning_rate": 1.356198347107438e-06,
|
|
"logits/chosen": 0.004180908203125,
|
|
"logits/rejected": -0.107421875,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.3932,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -2.265625,
|
|
"rewards/margins": 6.90625,
|
|
"rewards/rejected": -9.1875,
|
|
"step": 804
|
|
},
|
|
{
|
|
"epoch": 0.9877300613496932,
|
|
"grad_norm": 31.397135878242935,
|
|
"learning_rate": 1.3553719008264461e-06,
|
|
"logits/chosen": -0.11181640625,
|
|
"logits/rejected": -0.2451171875,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.5187,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -1.4375,
|
|
"rewards/margins": 7.8125,
|
|
"rewards/rejected": -9.25,
|
|
"step": 805
|
|
},
|
|
{
|
|
"epoch": 0.9889570552147239,
|
|
"grad_norm": 31.9035120566701,
|
|
"learning_rate": 1.3545454545454545e-06,
|
|
"logits/chosen": 0.12109375,
|
|
"logits/rejected": -0.004241943359375,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.4677,
|
|
"rewards/accuracies": 0.8125,
|
|
"rewards/chosen": -1.7265625,
|
|
"rewards/margins": 7.15625,
|
|
"rewards/rejected": -8.875,
|
|
"step": 806
|
|
},
|
|
{
|
|
"epoch": 0.9901840490797545,
|
|
"grad_norm": 32.3834218507154,
|
|
"learning_rate": 1.3537190082644627e-06,
|
|
"logits/chosen": 0.02294921875,
|
|
"logits/rejected": -0.1279296875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.427,
|
|
"rewards/accuracies": 0.8671875,
|
|
"rewards/chosen": -1.375,
|
|
"rewards/margins": 8.4375,
|
|
"rewards/rejected": -9.8125,
|
|
"step": 807
|
|
},
|
|
{
|
|
"epoch": 0.9914110429447853,
|
|
"grad_norm": 26.16505359058739,
|
|
"learning_rate": 1.352892561983471e-06,
|
|
"logits/chosen": -0.11279296875,
|
|
"logits/rejected": -0.1298828125,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.3583,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -2.265625,
|
|
"rewards/margins": 7.78125,
|
|
"rewards/rejected": -10.0625,
|
|
"step": 808
|
|
},
|
|
{
|
|
"epoch": 0.992638036809816,
|
|
"grad_norm": 30.884948310504473,
|
|
"learning_rate": 1.3520661157024793e-06,
|
|
"logits/chosen": -0.041259765625,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.3529,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -0.8515625,
|
|
"rewards/margins": 8.6875,
|
|
"rewards/rejected": -9.5625,
|
|
"step": 809
|
|
},
|
|
{
|
|
"epoch": 0.9938650306748467,
|
|
"grad_norm": 24.2565802115778,
|
|
"learning_rate": 1.3512396694214875e-06,
|
|
"logits/chosen": -0.1435546875,
|
|
"logits/rejected": -0.310546875,
|
|
"logps/chosen": -462.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.2396,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -1.25,
|
|
"rewards/margins": 8.125,
|
|
"rewards/rejected": -9.375,
|
|
"step": 810
|
|
},
|
|
{
|
|
"epoch": 0.9950920245398773,
|
|
"grad_norm": 25.407958302423644,
|
|
"learning_rate": 1.350413223140496e-06,
|
|
"logits/chosen": -0.1162109375,
|
|
"logits/rejected": -0.2470703125,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.3705,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -1.4140625,
|
|
"rewards/margins": 7.53125,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 811
|
|
},
|
|
{
|
|
"epoch": 0.996319018404908,
|
|
"grad_norm": 34.05939574037828,
|
|
"learning_rate": 1.349586776859504e-06,
|
|
"logits/chosen": -0.0888671875,
|
|
"logits/rejected": -0.1572265625,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -356.0,
|
|
"loss": 0.4438,
|
|
"rewards/accuracies": 0.8515625,
|
|
"rewards/chosen": -1.671875,
|
|
"rewards/margins": 7.71875,
|
|
"rewards/rejected": -9.375,
|
|
"step": 812
|
|
},
|
|
{
|
|
"epoch": 0.9975460122699387,
|
|
"grad_norm": 25.330838160708396,
|
|
"learning_rate": 1.3487603305785123e-06,
|
|
"logits/chosen": -0.0194091796875,
|
|
"logits/rejected": -0.15234375,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.2459,
|
|
"rewards/accuracies": 0.890625,
|
|
"rewards/chosen": -0.93359375,
|
|
"rewards/margins": 7.875,
|
|
"rewards/rejected": -8.8125,
|
|
"step": 813
|
|
},
|
|
{
|
|
"epoch": 0.9987730061349693,
|
|
"grad_norm": 30.50590414254102,
|
|
"learning_rate": 1.3479338842975205e-06,
|
|
"logits/chosen": 0.01202392578125,
|
|
"logits/rejected": -0.06689453125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.3759,
|
|
"rewards/accuracies": 0.7890625,
|
|
"rewards/chosen": -2.453125,
|
|
"rewards/margins": 6.46875,
|
|
"rewards/rejected": -8.9375,
|
|
"step": 814
|
|
},
|
|
{
|
|
"epoch": 1.0,
|
|
"grad_norm": 28.53278445551448,
|
|
"learning_rate": 1.3471074380165289e-06,
|
|
"logits/chosen": 0.087890625,
|
|
"logits/rejected": -0.1025390625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.247,
|
|
"rewards/accuracies": 0.8823530077934265,
|
|
"rewards/chosen": -1.6328125,
|
|
"rewards/margins": 7.9375,
|
|
"rewards/rejected": -9.5625,
|
|
"step": 815
|
|
},
|
|
{
|
|
"epoch": 1.0012269938650307,
|
|
"grad_norm": 5.788908987319821,
|
|
"learning_rate": 1.346280991735537e-06,
|
|
"logits/chosen": 0.01031494140625,
|
|
"logits/rejected": -0.12890625,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.0346,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.37109375,
|
|
"rewards/margins": 9.9375,
|
|
"rewards/rejected": -10.3125,
|
|
"step": 816
|
|
},
|
|
{
|
|
"epoch": 1.0024539877300613,
|
|
"grad_norm": 8.697184625477801,
|
|
"learning_rate": 1.3454545454545455e-06,
|
|
"logits/chosen": -0.00604248046875,
|
|
"logits/rejected": -0.154296875,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.0454,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.77734375,
|
|
"rewards/margins": 9.25,
|
|
"rewards/rejected": -10.0625,
|
|
"step": 817
|
|
},
|
|
{
|
|
"epoch": 1.003680981595092,
|
|
"grad_norm": 5.742008660241724,
|
|
"learning_rate": 1.3446280991735536e-06,
|
|
"logits/chosen": -0.134765625,
|
|
"logits/rejected": -0.2158203125,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0324,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.09228515625,
|
|
"rewards/margins": 9.9375,
|
|
"rewards/rejected": -10.0,
|
|
"step": 818
|
|
},
|
|
{
|
|
"epoch": 1.0049079754601227,
|
|
"grad_norm": 6.150716954787426,
|
|
"learning_rate": 1.343801652892562e-06,
|
|
"logits/chosen": 0.00714111328125,
|
|
"logits/rejected": -0.166015625,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.027,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.006439208984375,
|
|
"rewards/margins": 10.625,
|
|
"rewards/rejected": -10.625,
|
|
"step": 819
|
|
},
|
|
{
|
|
"epoch": 1.0061349693251533,
|
|
"grad_norm": 5.863008957712078,
|
|
"learning_rate": 1.3429752066115702e-06,
|
|
"logits/chosen": 0.041259765625,
|
|
"logits/rejected": -0.08203125,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0265,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.08544921875,
|
|
"rewards/margins": 9.875,
|
|
"rewards/rejected": -9.9375,
|
|
"step": 820
|
|
},
|
|
{
|
|
"epoch": 1.007361963190184,
|
|
"grad_norm": 13.28418747108858,
|
|
"learning_rate": 1.3421487603305786e-06,
|
|
"logits/chosen": -0.05029296875,
|
|
"logits/rejected": -0.1728515625,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.0861,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": 0.041748046875,
|
|
"rewards/margins": 10.0,
|
|
"rewards/rejected": -9.9375,
|
|
"step": 821
|
|
},
|
|
{
|
|
"epoch": 1.0085889570552147,
|
|
"grad_norm": 15.022810643238998,
|
|
"learning_rate": 1.3413223140495866e-06,
|
|
"logits/chosen": -0.04296875,
|
|
"logits/rejected": -0.173828125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0615,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -0.06689453125,
|
|
"rewards/margins": 9.5,
|
|
"rewards/rejected": -9.5625,
|
|
"step": 822
|
|
},
|
|
{
|
|
"epoch": 1.0098159509202453,
|
|
"grad_norm": 11.51053203290327,
|
|
"learning_rate": 1.340495867768595e-06,
|
|
"logits/chosen": -0.018310546875,
|
|
"logits/rejected": -0.197265625,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.0476,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": 0.1318359375,
|
|
"rewards/margins": 10.1875,
|
|
"rewards/rejected": -10.0625,
|
|
"step": 823
|
|
},
|
|
{
|
|
"epoch": 1.011042944785276,
|
|
"grad_norm": 12.791890120895983,
|
|
"learning_rate": 1.3396694214876032e-06,
|
|
"logits/chosen": -0.09521484375,
|
|
"logits/rejected": -0.232421875,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0378,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": 0.16015625,
|
|
"rewards/margins": 9.25,
|
|
"rewards/rejected": -9.125,
|
|
"step": 824
|
|
},
|
|
{
|
|
"epoch": 1.0122699386503067,
|
|
"grad_norm": 8.030022327829245,
|
|
"learning_rate": 1.3388429752066116e-06,
|
|
"logits/chosen": 0.08984375,
|
|
"logits/rejected": -0.1728515625,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.0348,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.1142578125,
|
|
"rewards/margins": 10.0,
|
|
"rewards/rejected": -10.125,
|
|
"step": 825
|
|
},
|
|
{
|
|
"epoch": 1.0134969325153373,
|
|
"grad_norm": 17.49835332495942,
|
|
"learning_rate": 1.3380165289256198e-06,
|
|
"logits/chosen": -0.1142578125,
|
|
"logits/rejected": -0.25,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.1191,
|
|
"rewards/accuracies": 0.9453125,
|
|
"rewards/chosen": -0.341796875,
|
|
"rewards/margins": 9.4375,
|
|
"rewards/rejected": -9.75,
|
|
"step": 826
|
|
},
|
|
{
|
|
"epoch": 1.014723926380368,
|
|
"grad_norm": 8.286688878591844,
|
|
"learning_rate": 1.337190082644628e-06,
|
|
"logits/chosen": -0.03515625,
|
|
"logits/rejected": -0.1435546875,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -358.0,
|
|
"loss": 0.042,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.046875,
|
|
"rewards/margins": 8.75,
|
|
"rewards/rejected": -9.8125,
|
|
"step": 827
|
|
},
|
|
{
|
|
"epoch": 1.0159509202453987,
|
|
"grad_norm": 4.526592144175515,
|
|
"learning_rate": 1.3363636363636364e-06,
|
|
"logits/chosen": 0.10107421875,
|
|
"logits/rejected": -0.08935546875,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.0304,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.5,
|
|
"rewards/margins": 9.3125,
|
|
"rewards/rejected": -9.8125,
|
|
"step": 828
|
|
},
|
|
{
|
|
"epoch": 1.0171779141104293,
|
|
"grad_norm": 12.437406803058959,
|
|
"learning_rate": 1.3355371900826446e-06,
|
|
"logits/chosen": -0.173828125,
|
|
"logits/rejected": -0.2158203125,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.063,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": 0.3203125,
|
|
"rewards/margins": 10.125,
|
|
"rewards/rejected": -9.8125,
|
|
"step": 829
|
|
},
|
|
{
|
|
"epoch": 1.01840490797546,
|
|
"grad_norm": 6.685346021125586,
|
|
"learning_rate": 1.334710743801653e-06,
|
|
"logits/chosen": -0.09619140625,
|
|
"logits/rejected": -0.28515625,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0336,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": 0.97265625,
|
|
"rewards/margins": 11.1875,
|
|
"rewards/rejected": -10.1875,
|
|
"step": 830
|
|
},
|
|
{
|
|
"epoch": 1.019631901840491,
|
|
"grad_norm": 16.99015772568169,
|
|
"learning_rate": 1.333884297520661e-06,
|
|
"logits/chosen": -0.0732421875,
|
|
"logits/rejected": -0.1259765625,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0807,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": 0.416015625,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -10.9375,
|
|
"step": 831
|
|
},
|
|
{
|
|
"epoch": 1.0208588957055216,
|
|
"grad_norm": 11.431723848321804,
|
|
"learning_rate": 1.3330578512396693e-06,
|
|
"logits/chosen": -0.0693359375,
|
|
"logits/rejected": -0.26953125,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0482,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": 0.0250244140625,
|
|
"rewards/margins": 9.75,
|
|
"rewards/rejected": -9.6875,
|
|
"step": 832
|
|
},
|
|
{
|
|
"epoch": 1.0220858895705522,
|
|
"grad_norm": 16.58275538607598,
|
|
"learning_rate": 1.3322314049586775e-06,
|
|
"logits/chosen": -0.1376953125,
|
|
"logits/rejected": -0.291015625,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0991,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": 0.1748046875,
|
|
"rewards/margins": 10.125,
|
|
"rewards/rejected": -9.9375,
|
|
"step": 833
|
|
},
|
|
{
|
|
"epoch": 1.023312883435583,
|
|
"grad_norm": 9.686701105258097,
|
|
"learning_rate": 1.331404958677686e-06,
|
|
"logits/chosen": -0.0172119140625,
|
|
"logits/rejected": -0.043212890625,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0331,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.125,
|
|
"rewards/margins": 9.1875,
|
|
"rewards/rejected": -10.3125,
|
|
"step": 834
|
|
},
|
|
{
|
|
"epoch": 1.0245398773006136,
|
|
"grad_norm": 16.391027647227297,
|
|
"learning_rate": 1.3305785123966941e-06,
|
|
"logits/chosen": 0.029541015625,
|
|
"logits/rejected": -0.1787109375,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0722,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.482421875,
|
|
"rewards/margins": 10.0625,
|
|
"rewards/rejected": -10.5625,
|
|
"step": 835
|
|
},
|
|
{
|
|
"epoch": 1.0257668711656442,
|
|
"grad_norm": 20.046891618112777,
|
|
"learning_rate": 1.3297520661157025e-06,
|
|
"logits/chosen": -0.06982421875,
|
|
"logits/rejected": -0.1484375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.1107,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -0.2216796875,
|
|
"rewards/margins": 10.4375,
|
|
"rewards/rejected": -10.6875,
|
|
"step": 836
|
|
},
|
|
{
|
|
"epoch": 1.026993865030675,
|
|
"grad_norm": 7.709008126462052,
|
|
"learning_rate": 1.3289256198347107e-06,
|
|
"logits/chosen": 0.083984375,
|
|
"logits/rejected": -0.16796875,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0381,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.41015625,
|
|
"rewards/margins": 10.4375,
|
|
"rewards/rejected": -10.8125,
|
|
"step": 837
|
|
},
|
|
{
|
|
"epoch": 1.0282208588957056,
|
|
"grad_norm": 15.911547986783308,
|
|
"learning_rate": 1.328099173553719e-06,
|
|
"logits/chosen": -0.07177734375,
|
|
"logits/rejected": -0.251953125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.073,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.77734375,
|
|
"rewards/margins": 10.5,
|
|
"rewards/rejected": -11.25,
|
|
"step": 838
|
|
},
|
|
{
|
|
"epoch": 1.0294478527607362,
|
|
"grad_norm": 17.686745572720934,
|
|
"learning_rate": 1.3272727272727273e-06,
|
|
"logits/chosen": -0.02294921875,
|
|
"logits/rejected": -0.1640625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0674,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -0.79296875,
|
|
"rewards/margins": 10.625,
|
|
"rewards/rejected": -11.4375,
|
|
"step": 839
|
|
},
|
|
{
|
|
"epoch": 1.030674846625767,
|
|
"grad_norm": 16.5579708094439,
|
|
"learning_rate": 1.3264462809917355e-06,
|
|
"logits/chosen": -0.043701171875,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0549,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.52734375,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -12.375,
|
|
"step": 840
|
|
},
|
|
{
|
|
"epoch": 1.0319018404907976,
|
|
"grad_norm": 9.374559144151373,
|
|
"learning_rate": 1.3256198347107437e-06,
|
|
"logits/chosen": 0.0257568359375,
|
|
"logits/rejected": -0.125,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0677,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.4140625,
|
|
"rewards/margins": 10.875,
|
|
"rewards/rejected": -12.25,
|
|
"step": 841
|
|
},
|
|
{
|
|
"epoch": 1.0331288343558283,
|
|
"grad_norm": 6.844859088271391,
|
|
"learning_rate": 1.324793388429752e-06,
|
|
"logits/chosen": -0.06640625,
|
|
"logits/rejected": -0.1865234375,
|
|
"logps/chosen": -476.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0414,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.46875,
|
|
"rewards/margins": 10.6875,
|
|
"rewards/rejected": -12.1875,
|
|
"step": 842
|
|
},
|
|
{
|
|
"epoch": 1.034355828220859,
|
|
"grad_norm": 15.343682501752589,
|
|
"learning_rate": 1.3239669421487603e-06,
|
|
"logits/chosen": -0.06201171875,
|
|
"logits/rejected": -0.1826171875,
|
|
"logps/chosen": -480.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0889,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.5,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -12.5625,
|
|
"step": 843
|
|
},
|
|
{
|
|
"epoch": 1.0355828220858896,
|
|
"grad_norm": 11.926860809694226,
|
|
"learning_rate": 1.3231404958677684e-06,
|
|
"logits/chosen": 0.039306640625,
|
|
"logits/rejected": -0.1796875,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0428,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.67578125,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 844
|
|
},
|
|
{
|
|
"epoch": 1.0368098159509203,
|
|
"grad_norm": 7.092484849007815,
|
|
"learning_rate": 1.3223140495867768e-06,
|
|
"logits/chosen": -0.033203125,
|
|
"logits/rejected": -0.1416015625,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0267,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.75,
|
|
"rewards/margins": 10.0,
|
|
"rewards/rejected": -11.75,
|
|
"step": 845
|
|
},
|
|
{
|
|
"epoch": 1.038036809815951,
|
|
"grad_norm": 8.395431032730178,
|
|
"learning_rate": 1.321487603305785e-06,
|
|
"logits/chosen": 0.0693359375,
|
|
"logits/rejected": -0.1416015625,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0429,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.484375,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -13.375,
|
|
"step": 846
|
|
},
|
|
{
|
|
"epoch": 1.0392638036809816,
|
|
"grad_norm": 9.116821917662776,
|
|
"learning_rate": 1.3206611570247934e-06,
|
|
"logits/chosen": 0.04931640625,
|
|
"logits/rejected": -0.11083984375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0375,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.3125,
|
|
"rewards/margins": 10.5625,
|
|
"rewards/rejected": -12.875,
|
|
"step": 847
|
|
},
|
|
{
|
|
"epoch": 1.0404907975460123,
|
|
"grad_norm": 3.865755311086331,
|
|
"learning_rate": 1.3198347107438014e-06,
|
|
"logits/chosen": -0.056640625,
|
|
"logits/rejected": -0.1552734375,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0224,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.515625,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -14.0,
|
|
"step": 848
|
|
},
|
|
{
|
|
"epoch": 1.041717791411043,
|
|
"grad_norm": 14.30080337286753,
|
|
"learning_rate": 1.3190082644628098e-06,
|
|
"logits/chosen": -0.005218505859375,
|
|
"logits/rejected": -0.08056640625,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -464.0,
|
|
"loss": 0.0845,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -3.328125,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -14.75,
|
|
"step": 849
|
|
},
|
|
{
|
|
"epoch": 1.0429447852760736,
|
|
"grad_norm": 9.515634879793929,
|
|
"learning_rate": 1.318181818181818e-06,
|
|
"logits/chosen": -0.03369140625,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0381,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.40625,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -14.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"epoch": 1.0441717791411043,
|
|
"grad_norm": 2.7291849020374754,
|
|
"learning_rate": 1.3173553719008264e-06,
|
|
"logits/chosen": -0.0810546875,
|
|
"logits/rejected": -0.28515625,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0096,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.34375,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -14.375,
|
|
"step": 851
|
|
},
|
|
{
|
|
"epoch": 1.045398773006135,
|
|
"grad_norm": 3.7138511500625406,
|
|
"learning_rate": 1.3165289256198346e-06,
|
|
"logits/chosen": -0.142578125,
|
|
"logits/rejected": -0.291015625,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.0174,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.3125,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 852
|
|
},
|
|
{
|
|
"epoch": 1.0466257668711656,
|
|
"grad_norm": 4.925467253309806,
|
|
"learning_rate": 1.315702479338843e-06,
|
|
"logits/chosen": -0.05859375,
|
|
"logits/rejected": -0.1640625,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0179,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.078125,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 853
|
|
},
|
|
{
|
|
"epoch": 1.0478527607361963,
|
|
"grad_norm": 22.411530083884138,
|
|
"learning_rate": 1.3148760330578512e-06,
|
|
"logits/chosen": 0.03759765625,
|
|
"logits/rejected": -0.09814453125,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.1408,
|
|
"rewards/accuracies": 0.953125,
|
|
"rewards/chosen": -2.765625,
|
|
"rewards/margins": 10.1875,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 854
|
|
},
|
|
{
|
|
"epoch": 1.049079754601227,
|
|
"grad_norm": 6.4786052852219775,
|
|
"learning_rate": 1.3140495867768596e-06,
|
|
"logits/chosen": 0.09814453125,
|
|
"logits/rejected": -0.05224609375,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.0353,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.40625,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -13.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"epoch": 1.0503067484662576,
|
|
"grad_norm": 5.973518916812513,
|
|
"learning_rate": 1.3132231404958678e-06,
|
|
"logits/chosen": -0.01043701171875,
|
|
"logits/rejected": -0.1923828125,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.0274,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.2421875,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -12.5,
|
|
"step": 856
|
|
},
|
|
{
|
|
"epoch": 1.0515337423312883,
|
|
"grad_norm": 5.456709479494061,
|
|
"learning_rate": 1.312396694214876e-06,
|
|
"logits/chosen": -0.1259765625,
|
|
"logits/rejected": -0.298828125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0259,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.8203125,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -12.4375,
|
|
"step": 857
|
|
},
|
|
{
|
|
"epoch": 1.052760736196319,
|
|
"grad_norm": 9.852424035696899,
|
|
"learning_rate": 1.3115702479338841e-06,
|
|
"logits/chosen": 0.00531005859375,
|
|
"logits/rejected": -0.0595703125,
|
|
"logps/chosen": -342.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.0413,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.71875,
|
|
"rewards/margins": 11.6875,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 858
|
|
},
|
|
{
|
|
"epoch": 1.0539877300613496,
|
|
"grad_norm": 11.583750763906302,
|
|
"learning_rate": 1.3107438016528925e-06,
|
|
"logits/chosen": -0.040771484375,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0666,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.265625,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -12.75,
|
|
"step": 859
|
|
},
|
|
{
|
|
"epoch": 1.0552147239263803,
|
|
"grad_norm": 9.827193256235123,
|
|
"learning_rate": 1.3099173553719007e-06,
|
|
"logits/chosen": 0.04833984375,
|
|
"logits/rejected": -0.1650390625,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0489,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 10.125,
|
|
"rewards/rejected": -12.1875,
|
|
"step": 860
|
|
},
|
|
{
|
|
"epoch": 1.056441717791411,
|
|
"grad_norm": 8.972662560553697,
|
|
"learning_rate": 1.3090909090909091e-06,
|
|
"logits/chosen": 0.00457763671875,
|
|
"logits/rejected": -0.1904296875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0318,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.80078125,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -11.875,
|
|
"step": 861
|
|
},
|
|
{
|
|
"epoch": 1.0576687116564418,
|
|
"grad_norm": 15.67835032114997,
|
|
"learning_rate": 1.3082644628099173e-06,
|
|
"logits/chosen": -0.1220703125,
|
|
"logits/rejected": -0.19921875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0678,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.9453125,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -13.0,
|
|
"step": 862
|
|
},
|
|
{
|
|
"epoch": 1.0588957055214725,
|
|
"grad_norm": 8.109733874609805,
|
|
"learning_rate": 1.3074380165289255e-06,
|
|
"logits/chosen": -0.1318359375,
|
|
"logits/rejected": -0.34765625,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0251,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": 0.412109375,
|
|
"rewards/margins": 12.8125,
|
|
"rewards/rejected": -12.375,
|
|
"step": 863
|
|
},
|
|
{
|
|
"epoch": 1.0601226993865032,
|
|
"grad_norm": 2.8617240293125077,
|
|
"learning_rate": 1.306611570247934e-06,
|
|
"logits/chosen": -0.052978515625,
|
|
"logits/rejected": -0.2470703125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0159,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.99609375,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -12.75,
|
|
"step": 864
|
|
},
|
|
{
|
|
"epoch": 1.0613496932515338,
|
|
"grad_norm": 6.342988680233583,
|
|
"learning_rate": 1.305785123966942e-06,
|
|
"logits/chosen": -0.2119140625,
|
|
"logits/rejected": -0.310546875,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0269,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.0625,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -12.5,
|
|
"step": 865
|
|
},
|
|
{
|
|
"epoch": 1.0625766871165645,
|
|
"grad_norm": 9.676853178030932,
|
|
"learning_rate": 1.3049586776859503e-06,
|
|
"logits/chosen": -0.1689453125,
|
|
"logits/rejected": -0.353515625,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0484,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.384765625,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -12.375,
|
|
"step": 866
|
|
},
|
|
{
|
|
"epoch": 1.0638036809815952,
|
|
"grad_norm": 6.86376081456906,
|
|
"learning_rate": 1.3041322314049585e-06,
|
|
"logits/chosen": -0.11474609375,
|
|
"logits/rejected": -0.26171875,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0442,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.453125,
|
|
"rewards/margins": 10.375,
|
|
"rewards/rejected": -11.875,
|
|
"step": 867
|
|
},
|
|
{
|
|
"epoch": 1.0650306748466258,
|
|
"grad_norm": 13.494921556285234,
|
|
"learning_rate": 1.3033057851239669e-06,
|
|
"logits/chosen": 0.11181640625,
|
|
"logits/rejected": -0.08642578125,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.0612,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.5625,
|
|
"rewards/margins": 10.0,
|
|
"rewards/rejected": -11.5625,
|
|
"step": 868
|
|
},
|
|
{
|
|
"epoch": 1.0662576687116565,
|
|
"grad_norm": 11.31535114702991,
|
|
"learning_rate": 1.302479338842975e-06,
|
|
"logits/chosen": -0.107421875,
|
|
"logits/rejected": -0.228515625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0434,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.25,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -12.875,
|
|
"step": 869
|
|
},
|
|
{
|
|
"epoch": 1.0674846625766872,
|
|
"grad_norm": 17.308246619390637,
|
|
"learning_rate": 1.3016528925619835e-06,
|
|
"logits/chosen": 0.0439453125,
|
|
"logits/rejected": -0.1318359375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0851,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.1171875,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -12.625,
|
|
"step": 870
|
|
},
|
|
{
|
|
"epoch": 1.0687116564417178,
|
|
"grad_norm": 12.453448936699616,
|
|
"learning_rate": 1.3008264462809916e-06,
|
|
"logits/chosen": 0.05810546875,
|
|
"logits/rejected": -0.10888671875,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0575,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.6640625,
|
|
"rewards/margins": 10.4375,
|
|
"rewards/rejected": -12.0625,
|
|
"step": 871
|
|
},
|
|
{
|
|
"epoch": 1.0699386503067485,
|
|
"grad_norm": 9.049294109604224,
|
|
"learning_rate": 1.3e-06,
|
|
"logits/chosen": 0.02294921875,
|
|
"logits/rejected": -0.10107421875,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -362.0,
|
|
"loss": 0.0312,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.1796875,
|
|
"rewards/margins": 10.75,
|
|
"rewards/rejected": -11.9375,
|
|
"step": 872
|
|
},
|
|
{
|
|
"epoch": 1.0711656441717792,
|
|
"grad_norm": 8.97823587253812,
|
|
"learning_rate": 1.2991735537190082e-06,
|
|
"logits/chosen": -0.064453125,
|
|
"logits/rejected": -0.2216796875,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0487,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.7265625,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 873
|
|
},
|
|
{
|
|
"epoch": 1.0723926380368098,
|
|
"grad_norm": 20.804782732106812,
|
|
"learning_rate": 1.2983471074380166e-06,
|
|
"logits/chosen": -0.09814453125,
|
|
"logits/rejected": -0.2255859375,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.1232,
|
|
"rewards/accuracies": 0.953125,
|
|
"rewards/chosen": -0.52734375,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -12.625,
|
|
"step": 874
|
|
},
|
|
{
|
|
"epoch": 1.0736196319018405,
|
|
"grad_norm": 8.305071581325844,
|
|
"learning_rate": 1.2975206611570246e-06,
|
|
"logits/chosen": 0.0242919921875,
|
|
"logits/rejected": -0.1279296875,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0385,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.421875,
|
|
"rewards/margins": 10.9375,
|
|
"rewards/rejected": -12.375,
|
|
"step": 875
|
|
},
|
|
{
|
|
"epoch": 1.0748466257668712,
|
|
"grad_norm": 6.888284555099352,
|
|
"learning_rate": 1.296694214876033e-06,
|
|
"logits/chosen": -0.10595703125,
|
|
"logits/rejected": -0.28515625,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0234,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.4921875,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -13.75,
|
|
"step": 876
|
|
},
|
|
{
|
|
"epoch": 1.0760736196319018,
|
|
"grad_norm": 3.514889904551701,
|
|
"learning_rate": 1.2958677685950412e-06,
|
|
"logits/chosen": 0.0869140625,
|
|
"logits/rejected": -0.059326171875,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0132,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.7265625,
|
|
"rewards/margins": 11.0,
|
|
"rewards/rejected": -12.75,
|
|
"step": 877
|
|
},
|
|
{
|
|
"epoch": 1.0773006134969325,
|
|
"grad_norm": 15.028382357150559,
|
|
"learning_rate": 1.2950413223140496e-06,
|
|
"logits/chosen": -0.08642578125,
|
|
"logits/rejected": -0.29296875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0781,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.015625,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -13.25,
|
|
"step": 878
|
|
},
|
|
{
|
|
"epoch": 1.0785276073619632,
|
|
"grad_norm": 5.215036247602813,
|
|
"learning_rate": 1.2942148760330578e-06,
|
|
"logits/chosen": 0.041748046875,
|
|
"logits/rejected": -0.220703125,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.0177,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.490234375,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -12.4375,
|
|
"step": 879
|
|
},
|
|
{
|
|
"epoch": 1.0797546012269938,
|
|
"grad_norm": 9.34102612397062,
|
|
"learning_rate": 1.293388429752066e-06,
|
|
"logits/chosen": 0.0419921875,
|
|
"logits/rejected": -0.203125,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.0457,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.75,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 880
|
|
},
|
|
{
|
|
"epoch": 1.0809815950920245,
|
|
"grad_norm": 12.29195877168792,
|
|
"learning_rate": 1.2925619834710744e-06,
|
|
"logits/chosen": 0.0908203125,
|
|
"logits/rejected": -0.05029296875,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -348.0,
|
|
"loss": 0.0482,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.4140625,
|
|
"rewards/margins": 10.0,
|
|
"rewards/rejected": -11.4375,
|
|
"step": 881
|
|
},
|
|
{
|
|
"epoch": 1.0822085889570552,
|
|
"grad_norm": 18.244018217570957,
|
|
"learning_rate": 1.2917355371900826e-06,
|
|
"logits/chosen": -0.060302734375,
|
|
"logits/rejected": -0.2021484375,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.1025,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -0.2431640625,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -11.6875,
|
|
"step": 882
|
|
},
|
|
{
|
|
"epoch": 1.0834355828220859,
|
|
"grad_norm": 13.915963438783027,
|
|
"learning_rate": 1.290909090909091e-06,
|
|
"logits/chosen": -0.10107421875,
|
|
"logits/rejected": -0.2236328125,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0421,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": 0.10302734375,
|
|
"rewards/margins": 10.75,
|
|
"rewards/rejected": -10.6875,
|
|
"step": 883
|
|
},
|
|
{
|
|
"epoch": 1.0846625766871165,
|
|
"grad_norm": 10.11378213997985,
|
|
"learning_rate": 1.290082644628099e-06,
|
|
"logits/chosen": -0.08837890625,
|
|
"logits/rejected": -0.2490234375,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.028,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": 0.51171875,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -12.0625,
|
|
"step": 884
|
|
},
|
|
{
|
|
"epoch": 1.0858895705521472,
|
|
"grad_norm": 4.138508137248215,
|
|
"learning_rate": 1.2892561983471073e-06,
|
|
"logits/chosen": -0.007171630859375,
|
|
"logits/rejected": -0.1474609375,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.0271,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": 0.142578125,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -10.9375,
|
|
"step": 885
|
|
},
|
|
{
|
|
"epoch": 1.0871165644171779,
|
|
"grad_norm": 8.274091371317361,
|
|
"learning_rate": 1.2884297520661155e-06,
|
|
"logits/chosen": 0.0888671875,
|
|
"logits/rejected": -0.11328125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0421,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.97265625,
|
|
"rewards/margins": 10.4375,
|
|
"rewards/rejected": -11.4375,
|
|
"step": 886
|
|
},
|
|
{
|
|
"epoch": 1.0883435582822085,
|
|
"grad_norm": 9.112369408801136,
|
|
"learning_rate": 1.287603305785124e-06,
|
|
"logits/chosen": -0.09033203125,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0473,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.333984375,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -12.3125,
|
|
"step": 887
|
|
},
|
|
{
|
|
"epoch": 1.0895705521472392,
|
|
"grad_norm": 9.854679815729673,
|
|
"learning_rate": 1.2867768595041321e-06,
|
|
"logits/chosen": -0.06689453125,
|
|
"logits/rejected": -0.33984375,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0298,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.1328125,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -11.875,
|
|
"step": 888
|
|
},
|
|
{
|
|
"epoch": 1.0907975460122699,
|
|
"grad_norm": 16.9455885147046,
|
|
"learning_rate": 1.2859504132231405e-06,
|
|
"logits/chosen": -0.0247802734375,
|
|
"logits/rejected": -0.138671875,
|
|
"logps/chosen": -468.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0586,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.1005859375,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -12.25,
|
|
"step": 889
|
|
},
|
|
{
|
|
"epoch": 1.0920245398773005,
|
|
"grad_norm": 7.67997087393842,
|
|
"learning_rate": 1.2851239669421487e-06,
|
|
"logits/chosen": -0.080078125,
|
|
"logits/rejected": -0.2060546875,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0468,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.37890625,
|
|
"rewards/margins": 11.125,
|
|
"rewards/rejected": -11.5,
|
|
"step": 890
|
|
},
|
|
{
|
|
"epoch": 1.0932515337423312,
|
|
"grad_norm": 4.2045422369346745,
|
|
"learning_rate": 1.2842975206611571e-06,
|
|
"logits/chosen": -0.12060546875,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0254,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.95703125,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -12.5625,
|
|
"step": 891
|
|
},
|
|
{
|
|
"epoch": 1.0944785276073619,
|
|
"grad_norm": 10.513410285587861,
|
|
"learning_rate": 1.2834710743801653e-06,
|
|
"logits/chosen": -0.0294189453125,
|
|
"logits/rejected": -0.26171875,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0552,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.4765625,
|
|
"rewards/margins": 11.6875,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 892
|
|
},
|
|
{
|
|
"epoch": 1.0957055214723925,
|
|
"grad_norm": 7.81031762086179,
|
|
"learning_rate": 1.2826446280991735e-06,
|
|
"logits/chosen": -0.07666015625,
|
|
"logits/rejected": -0.087890625,
|
|
"logps/chosen": -336.0,
|
|
"logps/rejected": -360.0,
|
|
"loss": 0.0437,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.109375,
|
|
"rewards/margins": 10.875,
|
|
"rewards/rejected": -11.9375,
|
|
"step": 893
|
|
},
|
|
{
|
|
"epoch": 1.0969325153374232,
|
|
"grad_norm": 15.642534196874868,
|
|
"learning_rate": 1.2818181818181817e-06,
|
|
"logits/chosen": -0.056640625,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.0821,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.53125,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.0,
|
|
"step": 894
|
|
},
|
|
{
|
|
"epoch": 1.098159509202454,
|
|
"grad_norm": 11.412582814931287,
|
|
"learning_rate": 1.28099173553719e-06,
|
|
"logits/chosen": -0.0361328125,
|
|
"logits/rejected": -0.203125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0432,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.384765625,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -12.25,
|
|
"step": 895
|
|
},
|
|
{
|
|
"epoch": 1.0993865030674848,
|
|
"grad_norm": 11.416860652227472,
|
|
"learning_rate": 1.2801652892561983e-06,
|
|
"logits/chosen": -0.07763671875,
|
|
"logits/rejected": -0.240234375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0462,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.69140625,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -12.0625,
|
|
"step": 896
|
|
},
|
|
{
|
|
"epoch": 1.1006134969325154,
|
|
"grad_norm": 12.564527551772402,
|
|
"learning_rate": 1.2793388429752065e-06,
|
|
"logits/chosen": -0.10595703125,
|
|
"logits/rejected": -0.345703125,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0343,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.62890625,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 897
|
|
},
|
|
{
|
|
"epoch": 1.101840490797546,
|
|
"grad_norm": 9.504318144890796,
|
|
"learning_rate": 1.2785123966942149e-06,
|
|
"logits/chosen": -0.1025390625,
|
|
"logits/rejected": -0.30859375,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0349,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.130859375,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 898
|
|
},
|
|
{
|
|
"epoch": 1.1030674846625768,
|
|
"grad_norm": 11.108964675901117,
|
|
"learning_rate": 1.277685950413223e-06,
|
|
"logits/chosen": -0.025390625,
|
|
"logits/rejected": -0.15234375,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.0336,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.0703125,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -12.5,
|
|
"step": 899
|
|
},
|
|
{
|
|
"epoch": 1.1042944785276074,
|
|
"grad_norm": 13.852498236070456,
|
|
"learning_rate": 1.2768595041322314e-06,
|
|
"logits/chosen": 0.048583984375,
|
|
"logits/rejected": -0.1435546875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0864,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.015625,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -12.5625,
|
|
"step": 900
|
|
},
|
|
{
|
|
"epoch": 1.105521472392638,
|
|
"grad_norm": 4.733438173592714,
|
|
"learning_rate": 1.2760330578512396e-06,
|
|
"logits/chosen": -0.1123046875,
|
|
"logits/rejected": -0.328125,
|
|
"logps/chosen": -504.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0228,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": 0.4296875,
|
|
"rewards/margins": 14.1875,
|
|
"rewards/rejected": -13.75,
|
|
"step": 901
|
|
},
|
|
{
|
|
"epoch": 1.1067484662576688,
|
|
"grad_norm": 8.484315986474956,
|
|
"learning_rate": 1.2752066115702478e-06,
|
|
"logits/chosen": -0.146484375,
|
|
"logits/rejected": -0.302734375,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0515,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.765625,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -12.625,
|
|
"step": 902
|
|
},
|
|
{
|
|
"epoch": 1.1079754601226994,
|
|
"grad_norm": 8.855648149513486,
|
|
"learning_rate": 1.274380165289256e-06,
|
|
"logits/chosen": -0.044677734375,
|
|
"logits/rejected": -0.259765625,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0308,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.52734375,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -12.625,
|
|
"step": 903
|
|
},
|
|
{
|
|
"epoch": 1.10920245398773,
|
|
"grad_norm": 9.051987833954742,
|
|
"learning_rate": 1.2735537190082644e-06,
|
|
"logits/chosen": -0.04541015625,
|
|
"logits/rejected": -0.1787109375,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0324,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": 0.0498046875,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -12.5,
|
|
"step": 904
|
|
},
|
|
{
|
|
"epoch": 1.1104294478527608,
|
|
"grad_norm": 12.048891685038269,
|
|
"learning_rate": 1.2727272727272726e-06,
|
|
"logits/chosen": -0.216796875,
|
|
"logits/rejected": -0.416015625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0419,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": 0.58203125,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -12.4375,
|
|
"step": 905
|
|
},
|
|
{
|
|
"epoch": 1.1116564417177914,
|
|
"grad_norm": 7.683696149710046,
|
|
"learning_rate": 1.271900826446281e-06,
|
|
"logits/chosen": -0.1259765625,
|
|
"logits/rejected": -0.2158203125,
|
|
"logps/chosen": -354.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0318,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.515625,
|
|
"rewards/margins": 10.25,
|
|
"rewards/rejected": -11.75,
|
|
"step": 906
|
|
},
|
|
{
|
|
"epoch": 1.112883435582822,
|
|
"grad_norm": 9.463274872399804,
|
|
"learning_rate": 1.2710743801652892e-06,
|
|
"logits/chosen": -0.07421875,
|
|
"logits/rejected": -0.3515625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0341,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.404296875,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -12.8125,
|
|
"step": 907
|
|
},
|
|
{
|
|
"epoch": 1.1141104294478528,
|
|
"grad_norm": 13.442425696135015,
|
|
"learning_rate": 1.2702479338842976e-06,
|
|
"logits/chosen": -0.12158203125,
|
|
"logits/rejected": -0.1923828125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0538,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": 0.2734375,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -11.75,
|
|
"step": 908
|
|
},
|
|
{
|
|
"epoch": 1.1153374233128834,
|
|
"grad_norm": 9.861015901315275,
|
|
"learning_rate": 1.2694214876033058e-06,
|
|
"logits/chosen": 0.031494140625,
|
|
"logits/rejected": -0.072265625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -576.0,
|
|
"loss": 0.0371,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.416015625,
|
|
"rewards/margins": 23.75,
|
|
"rewards/rejected": -24.125,
|
|
"step": 909
|
|
},
|
|
{
|
|
"epoch": 1.116564417177914,
|
|
"grad_norm": 10.034686967609899,
|
|
"learning_rate": 1.2685950413223142e-06,
|
|
"logits/chosen": -0.1181640625,
|
|
"logits/rejected": -0.294921875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0363,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.02099609375,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -12.5,
|
|
"step": 910
|
|
},
|
|
{
|
|
"epoch": 1.1177914110429448,
|
|
"grad_norm": 11.917727210359411,
|
|
"learning_rate": 1.2677685950413221e-06,
|
|
"logits/chosen": -0.08056640625,
|
|
"logits/rejected": -0.3203125,
|
|
"logps/chosen": -482.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0755,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": 0.62890625,
|
|
"rewards/margins": 14.0625,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 911
|
|
},
|
|
{
|
|
"epoch": 1.1190184049079754,
|
|
"grad_norm": 13.61479931680405,
|
|
"learning_rate": 1.2669421487603305e-06,
|
|
"logits/chosen": 0.05029296875,
|
|
"logits/rejected": -0.045654296875,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0427,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.98046875,
|
|
"rewards/margins": 11.0,
|
|
"rewards/rejected": -11.9375,
|
|
"step": 912
|
|
},
|
|
{
|
|
"epoch": 1.120245398773006,
|
|
"grad_norm": 5.722716592878231,
|
|
"learning_rate": 1.2661157024793387e-06,
|
|
"logits/chosen": -0.1455078125,
|
|
"logits/rejected": -0.25,
|
|
"logps/chosen": -336.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0216,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.2421875,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -12.4375,
|
|
"step": 913
|
|
},
|
|
{
|
|
"epoch": 1.1214723926380368,
|
|
"grad_norm": 15.315717662601804,
|
|
"learning_rate": 1.2652892561983471e-06,
|
|
"logits/chosen": 0.03857421875,
|
|
"logits/rejected": -0.140625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0926,
|
|
"rewards/accuracies": 0.9453125,
|
|
"rewards/chosen": -1.453125,
|
|
"rewards/margins": 10.6875,
|
|
"rewards/rejected": -12.125,
|
|
"step": 914
|
|
},
|
|
{
|
|
"epoch": 1.1226993865030674,
|
|
"grad_norm": 8.29885427815819,
|
|
"learning_rate": 1.2644628099173553e-06,
|
|
"logits/chosen": 0.002105712890625,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0181,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.4453125,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 915
|
|
},
|
|
{
|
|
"epoch": 1.123926380368098,
|
|
"grad_norm": 6.550986659275621,
|
|
"learning_rate": 1.2636363636363635e-06,
|
|
"logits/chosen": -0.1669921875,
|
|
"logits/rejected": -0.314453125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0261,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.8125,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.25,
|
|
"step": 916
|
|
},
|
|
{
|
|
"epoch": 1.1251533742331288,
|
|
"grad_norm": 11.88490369990794,
|
|
"learning_rate": 1.262809917355372e-06,
|
|
"logits/chosen": -0.1337890625,
|
|
"logits/rejected": -0.36328125,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -456.0,
|
|
"loss": 0.0599,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.9921875,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 917
|
|
},
|
|
{
|
|
"epoch": 1.1263803680981594,
|
|
"grad_norm": 23.872483214200095,
|
|
"learning_rate": 1.26198347107438e-06,
|
|
"logits/chosen": -0.0017547607421875,
|
|
"logits/rejected": -0.1435546875,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0937,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.3125,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 918
|
|
},
|
|
{
|
|
"epoch": 1.1276073619631901,
|
|
"grad_norm": 11.238016206654214,
|
|
"learning_rate": 1.2611570247933885e-06,
|
|
"logits/chosen": -0.2099609375,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0576,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.0625,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -14.375,
|
|
"step": 919
|
|
},
|
|
{
|
|
"epoch": 1.1288343558282208,
|
|
"grad_norm": 4.993439391026325,
|
|
"learning_rate": 1.2603305785123965e-06,
|
|
"logits/chosen": -0.03759765625,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0164,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.78125,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 920
|
|
},
|
|
{
|
|
"epoch": 1.1300613496932514,
|
|
"grad_norm": 7.864089020242171,
|
|
"learning_rate": 1.2595041322314049e-06,
|
|
"logits/chosen": -0.061279296875,
|
|
"logits/rejected": -0.21484375,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0223,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.54296875,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -13.5,
|
|
"step": 921
|
|
},
|
|
{
|
|
"epoch": 1.1312883435582821,
|
|
"grad_norm": 16.73562616420389,
|
|
"learning_rate": 1.258677685950413e-06,
|
|
"logits/chosen": -0.01422119140625,
|
|
"logits/rejected": -0.126953125,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0743,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.2421875,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -13.375,
|
|
"step": 922
|
|
},
|
|
{
|
|
"epoch": 1.132515337423313,
|
|
"grad_norm": 14.52993832417819,
|
|
"learning_rate": 1.2578512396694215e-06,
|
|
"logits/chosen": 0.041015625,
|
|
"logits/rejected": -0.05419921875,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0433,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.0078125,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 923
|
|
},
|
|
{
|
|
"epoch": 1.1337423312883437,
|
|
"grad_norm": 10.565117185339505,
|
|
"learning_rate": 1.2570247933884297e-06,
|
|
"logits/chosen": -0.11669921875,
|
|
"logits/rejected": -0.203125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0394,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.64453125,
|
|
"rewards/margins": 13.0625,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 924
|
|
},
|
|
{
|
|
"epoch": 1.1349693251533743,
|
|
"grad_norm": 9.24365199770807,
|
|
"learning_rate": 1.256198347107438e-06,
|
|
"logits/chosen": -0.181640625,
|
|
"logits/rejected": -0.38671875,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0259,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.53125,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 925
|
|
},
|
|
{
|
|
"epoch": 1.136196319018405,
|
|
"grad_norm": 13.074225584556196,
|
|
"learning_rate": 1.2553719008264462e-06,
|
|
"logits/chosen": -0.1953125,
|
|
"logits/rejected": -0.37109375,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.103,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.8359375,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.625,
|
|
"step": 926
|
|
},
|
|
{
|
|
"epoch": 1.1374233128834357,
|
|
"grad_norm": 14.129592351964368,
|
|
"learning_rate": 1.2545454545454546e-06,
|
|
"logits/chosen": -0.0693359375,
|
|
"logits/rejected": -0.228515625,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0643,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.0703125,
|
|
"rewards/margins": 12.8125,
|
|
"rewards/rejected": -13.875,
|
|
"step": 927
|
|
},
|
|
{
|
|
"epoch": 1.1386503067484663,
|
|
"grad_norm": 4.103229864409712,
|
|
"learning_rate": 1.2537190082644628e-06,
|
|
"logits/chosen": -0.050537109375,
|
|
"logits/rejected": -0.259765625,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0203,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.265625,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 928
|
|
},
|
|
{
|
|
"epoch": 1.139877300613497,
|
|
"grad_norm": 12.788232600580178,
|
|
"learning_rate": 1.252892561983471e-06,
|
|
"logits/chosen": -0.012939453125,
|
|
"logits/rejected": -0.19140625,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0529,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.1953125,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 929
|
|
},
|
|
{
|
|
"epoch": 1.1411042944785277,
|
|
"grad_norm": 6.121038532093352,
|
|
"learning_rate": 1.2520661157024792e-06,
|
|
"logits/chosen": -0.04736328125,
|
|
"logits/rejected": -0.283203125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0176,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.8671875,
|
|
"rewards/margins": 13.5625,
|
|
"rewards/rejected": -14.375,
|
|
"step": 930
|
|
},
|
|
{
|
|
"epoch": 1.1423312883435583,
|
|
"grad_norm": 13.508596981176845,
|
|
"learning_rate": 1.2512396694214876e-06,
|
|
"logits/chosen": -0.0400390625,
|
|
"logits/rejected": -0.1279296875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.067,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.7890625,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -12.875,
|
|
"step": 931
|
|
},
|
|
{
|
|
"epoch": 1.143558282208589,
|
|
"grad_norm": 10.222567348725061,
|
|
"learning_rate": 1.2504132231404958e-06,
|
|
"logits/chosen": -0.177734375,
|
|
"logits/rejected": -0.35546875,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0621,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.453125,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 932
|
|
},
|
|
{
|
|
"epoch": 1.1447852760736197,
|
|
"grad_norm": 16.863270427365446,
|
|
"learning_rate": 1.249586776859504e-06,
|
|
"logits/chosen": -0.0208740234375,
|
|
"logits/rejected": -0.11083984375,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0816,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.125,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -13.0,
|
|
"step": 933
|
|
},
|
|
{
|
|
"epoch": 1.1460122699386504,
|
|
"grad_norm": 10.013621594088688,
|
|
"learning_rate": 1.2487603305785124e-06,
|
|
"logits/chosen": -0.046875,
|
|
"logits/rejected": -0.2158203125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0444,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.93359375,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -12.5,
|
|
"step": 934
|
|
},
|
|
{
|
|
"epoch": 1.147239263803681,
|
|
"grad_norm": 6.873242667684438,
|
|
"learning_rate": 1.2479338842975206e-06,
|
|
"logits/chosen": -0.107421875,
|
|
"logits/rejected": -0.2470703125,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0244,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.125,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -13.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"epoch": 1.1484662576687117,
|
|
"grad_norm": 14.89317546756919,
|
|
"learning_rate": 1.247107438016529e-06,
|
|
"logits/chosen": 0.0625,
|
|
"logits/rejected": -0.1796875,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0964,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -13.875,
|
|
"step": 936
|
|
},
|
|
{
|
|
"epoch": 1.1496932515337424,
|
|
"grad_norm": 7.982857945277371,
|
|
"learning_rate": 1.246280991735537e-06,
|
|
"logits/chosen": -0.017822265625,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0263,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.5234375,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -14.0,
|
|
"step": 937
|
|
},
|
|
{
|
|
"epoch": 1.150920245398773,
|
|
"grad_norm": 8.846805319628498,
|
|
"learning_rate": 1.2454545454545454e-06,
|
|
"logits/chosen": 0.014892578125,
|
|
"logits/rejected": -0.034423828125,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0393,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.6640625,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 938
|
|
},
|
|
{
|
|
"epoch": 1.1521472392638037,
|
|
"grad_norm": 3.2077133405437586,
|
|
"learning_rate": 1.2446280991735535e-06,
|
|
"logits/chosen": -0.1572265625,
|
|
"logits/rejected": -0.298828125,
|
|
"logps/chosen": -468.0,
|
|
"logps/rejected": -452.0,
|
|
"loss": 0.0109,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.67578125,
|
|
"rewards/margins": 13.5,
|
|
"rewards/rejected": -14.125,
|
|
"step": 939
|
|
},
|
|
{
|
|
"epoch": 1.1533742331288344,
|
|
"grad_norm": 5.851720087027257,
|
|
"learning_rate": 1.243801652892562e-06,
|
|
"logits/chosen": -0.1484375,
|
|
"logits/rejected": -0.33984375,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0229,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.8125,
|
|
"rewards/margins": 13.5625,
|
|
"rewards/rejected": -14.375,
|
|
"step": 940
|
|
},
|
|
{
|
|
"epoch": 1.154601226993865,
|
|
"grad_norm": 12.832514340549876,
|
|
"learning_rate": 1.2429752066115701e-06,
|
|
"logits/chosen": 0.006011962890625,
|
|
"logits/rejected": -0.197265625,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0473,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.373046875,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -12.5,
|
|
"step": 941
|
|
},
|
|
{
|
|
"epoch": 1.1558282208588957,
|
|
"grad_norm": 8.486663453729426,
|
|
"learning_rate": 1.2421487603305785e-06,
|
|
"logits/chosen": -0.23046875,
|
|
"logits/rejected": -0.37109375,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0279,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.39453125,
|
|
"rewards/margins": 13.5,
|
|
"rewards/rejected": -13.875,
|
|
"step": 942
|
|
},
|
|
{
|
|
"epoch": 1.1570552147239264,
|
|
"grad_norm": 10.666575713276558,
|
|
"learning_rate": 1.2413223140495867e-06,
|
|
"logits/chosen": 0.02685546875,
|
|
"logits/rejected": -0.134765625,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0414,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.5078125,
|
|
"rewards/margins": 11.6875,
|
|
"rewards/rejected": -13.25,
|
|
"step": 943
|
|
},
|
|
{
|
|
"epoch": 1.158282208588957,
|
|
"grad_norm": 9.64349458342075,
|
|
"learning_rate": 1.2404958677685951e-06,
|
|
"logits/chosen": -0.0712890625,
|
|
"logits/rejected": -0.24609375,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.028,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.046875,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.0,
|
|
"step": 944
|
|
},
|
|
{
|
|
"epoch": 1.1595092024539877,
|
|
"grad_norm": 7.949142582252125,
|
|
"learning_rate": 1.2396694214876033e-06,
|
|
"logits/chosen": -0.15625,
|
|
"logits/rejected": -0.330078125,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0292,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.66015625,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.125,
|
|
"step": 945
|
|
},
|
|
{
|
|
"epoch": 1.1607361963190184,
|
|
"grad_norm": 8.932186397300311,
|
|
"learning_rate": 1.2388429752066115e-06,
|
|
"logits/chosen": 0.010498046875,
|
|
"logits/rejected": -0.060791015625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0343,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.0625,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -13.625,
|
|
"step": 946
|
|
},
|
|
{
|
|
"epoch": 1.161963190184049,
|
|
"grad_norm": 10.514109678390449,
|
|
"learning_rate": 1.2380165289256197e-06,
|
|
"logits/chosen": -0.2021484375,
|
|
"logits/rejected": -0.390625,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0477,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.1640625,
|
|
"rewards/margins": 11.6875,
|
|
"rewards/rejected": -12.875,
|
|
"step": 947
|
|
},
|
|
{
|
|
"epoch": 1.1631901840490797,
|
|
"grad_norm": 8.877325372648517,
|
|
"learning_rate": 1.237190082644628e-06,
|
|
"logits/chosen": -0.1806640625,
|
|
"logits/rejected": -0.4140625,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0407,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.51953125,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -12.8125,
|
|
"step": 948
|
|
},
|
|
{
|
|
"epoch": 1.1644171779141104,
|
|
"grad_norm": 8.754355293262861,
|
|
"learning_rate": 1.2363636363636363e-06,
|
|
"logits/chosen": 0.02685546875,
|
|
"logits/rejected": -0.251953125,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0418,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.54296875,
|
|
"rewards/margins": 13.5,
|
|
"rewards/rejected": -14.0625,
|
|
"step": 949
|
|
},
|
|
{
|
|
"epoch": 1.165644171779141,
|
|
"grad_norm": 4.1108349538584825,
|
|
"learning_rate": 1.2355371900826447e-06,
|
|
"logits/chosen": -0.11474609375,
|
|
"logits/rejected": -0.22265625,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.0164,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.5703125,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.5,
|
|
"step": 950
|
|
},
|
|
{
|
|
"epoch": 1.1668711656441717,
|
|
"grad_norm": 9.31776042696322,
|
|
"learning_rate": 1.2347107438016529e-06,
|
|
"logits/chosen": 0.0091552734375,
|
|
"logits/rejected": -0.11669921875,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0323,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.3515625,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 951
|
|
},
|
|
{
|
|
"epoch": 1.1680981595092024,
|
|
"grad_norm": 8.933208458194814,
|
|
"learning_rate": 1.233884297520661e-06,
|
|
"logits/chosen": -0.201171875,
|
|
"logits/rejected": -0.4765625,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0287,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.2275390625,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -13.125,
|
|
"step": 952
|
|
},
|
|
{
|
|
"epoch": 1.169325153374233,
|
|
"grad_norm": 9.190704531144403,
|
|
"learning_rate": 1.2330578512396694e-06,
|
|
"logits/chosen": -0.03857421875,
|
|
"logits/rejected": -0.2431640625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0568,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.447265625,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 953
|
|
},
|
|
{
|
|
"epoch": 1.1705521472392637,
|
|
"grad_norm": 15.447894329208678,
|
|
"learning_rate": 1.2322314049586776e-06,
|
|
"logits/chosen": -0.03125,
|
|
"logits/rejected": -0.248046875,
|
|
"logps/chosen": -336.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.0516,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.9296875,
|
|
"rewards/margins": 10.75,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 954
|
|
},
|
|
{
|
|
"epoch": 1.1717791411042944,
|
|
"grad_norm": 9.786150682980374,
|
|
"learning_rate": 1.2314049586776858e-06,
|
|
"logits/chosen": 0.039794921875,
|
|
"logits/rejected": -0.02734375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0325,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.50390625,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -12.625,
|
|
"step": 955
|
|
},
|
|
{
|
|
"epoch": 1.173006134969325,
|
|
"grad_norm": 10.192839968241447,
|
|
"learning_rate": 1.230578512396694e-06,
|
|
"logits/chosen": -0.053955078125,
|
|
"logits/rejected": -0.162109375,
|
|
"logps/chosen": -328.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.0394,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.0,
|
|
"rewards/margins": 10.75,
|
|
"rewards/rejected": -11.75,
|
|
"step": 956
|
|
},
|
|
{
|
|
"epoch": 1.1742331288343557,
|
|
"grad_norm": 9.482261644753402,
|
|
"learning_rate": 1.2297520661157024e-06,
|
|
"logits/chosen": -0.0966796875,
|
|
"logits/rejected": -0.314453125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0452,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.40234375,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -12.25,
|
|
"step": 957
|
|
},
|
|
{
|
|
"epoch": 1.1754601226993864,
|
|
"grad_norm": 11.911094206094816,
|
|
"learning_rate": 1.2289256198347106e-06,
|
|
"logits/chosen": -0.01373291015625,
|
|
"logits/rejected": -0.10888671875,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0444,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.69921875,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 958
|
|
},
|
|
{
|
|
"epoch": 1.1766871165644173,
|
|
"grad_norm": 11.530120779052213,
|
|
"learning_rate": 1.228099173553719e-06,
|
|
"logits/chosen": -0.05517578125,
|
|
"logits/rejected": -0.228515625,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0372,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.72265625,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 959
|
|
},
|
|
{
|
|
"epoch": 1.177914110429448,
|
|
"grad_norm": 3.1550473881150807,
|
|
"learning_rate": 1.2272727272727272e-06,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.29296875,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.0124,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.015625,
|
|
"rewards/margins": 11.125,
|
|
"rewards/rejected": -13.125,
|
|
"step": 960
|
|
},
|
|
{
|
|
"epoch": 1.1791411042944786,
|
|
"grad_norm": 12.944181255499222,
|
|
"learning_rate": 1.2264462809917356e-06,
|
|
"logits/chosen": -0.09130859375,
|
|
"logits/rejected": -0.1943359375,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0344,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.439453125,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 961
|
|
},
|
|
{
|
|
"epoch": 1.1803680981595093,
|
|
"grad_norm": 7.505423517064192,
|
|
"learning_rate": 1.2256198347107438e-06,
|
|
"logits/chosen": 0.052001953125,
|
|
"logits/rejected": -0.11767578125,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.0321,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.203125,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.25,
|
|
"step": 962
|
|
},
|
|
{
|
|
"epoch": 1.18159509202454,
|
|
"grad_norm": 8.634387194412563,
|
|
"learning_rate": 1.2247933884297522e-06,
|
|
"logits/chosen": -0.0869140625,
|
|
"logits/rejected": -0.275390625,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0337,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.66015625,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 963
|
|
},
|
|
{
|
|
"epoch": 1.1828220858895706,
|
|
"grad_norm": 7.968338693139223,
|
|
"learning_rate": 1.2239669421487602e-06,
|
|
"logits/chosen": -0.021484375,
|
|
"logits/rejected": -0.2041015625,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0221,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.498046875,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 964
|
|
},
|
|
{
|
|
"epoch": 1.1840490797546013,
|
|
"grad_norm": 20.464410540441207,
|
|
"learning_rate": 1.2231404958677686e-06,
|
|
"logits/chosen": -0.09912109375,
|
|
"logits/rejected": -0.2265625,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0776,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.65625,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -13.875,
|
|
"step": 965
|
|
},
|
|
{
|
|
"epoch": 1.185276073619632,
|
|
"grad_norm": 12.408473848345519,
|
|
"learning_rate": 1.2223140495867767e-06,
|
|
"logits/chosen": -0.1630859375,
|
|
"logits/rejected": -0.294921875,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0521,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.4375,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 966
|
|
},
|
|
{
|
|
"epoch": 1.1865030674846626,
|
|
"grad_norm": 7.549537773527989,
|
|
"learning_rate": 1.2214876033057851e-06,
|
|
"logits/chosen": -0.09423828125,
|
|
"logits/rejected": -0.26171875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0224,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.78515625,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 967
|
|
},
|
|
{
|
|
"epoch": 1.1877300613496933,
|
|
"grad_norm": 21.356090528669018,
|
|
"learning_rate": 1.2206611570247933e-06,
|
|
"logits/chosen": -0.0189208984375,
|
|
"logits/rejected": -0.2060546875,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0856,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.76953125,
|
|
"rewards/margins": 14.0625,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 968
|
|
},
|
|
{
|
|
"epoch": 1.188957055214724,
|
|
"grad_norm": 4.75344602409549,
|
|
"learning_rate": 1.2198347107438015e-06,
|
|
"logits/chosen": -0.1181640625,
|
|
"logits/rejected": -0.28125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0196,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -3.15625,
|
|
"rewards/margins": 11.3125,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 969
|
|
},
|
|
{
|
|
"epoch": 1.1901840490797546,
|
|
"grad_norm": 12.850006718300646,
|
|
"learning_rate": 1.21900826446281e-06,
|
|
"logits/chosen": -0.0849609375,
|
|
"logits/rejected": -0.234375,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -540.0,
|
|
"loss": 0.0502,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.75,
|
|
"rewards/margins": 24.875,
|
|
"rewards/rejected": -26.625,
|
|
"step": 970
|
|
},
|
|
{
|
|
"epoch": 1.1914110429447853,
|
|
"grad_norm": 5.746825962849126,
|
|
"learning_rate": 1.2181818181818181e-06,
|
|
"logits/chosen": 0.009765625,
|
|
"logits/rejected": -0.23046875,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0216,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.7421875,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 971
|
|
},
|
|
{
|
|
"epoch": 1.192638036809816,
|
|
"grad_norm": 7.646865150926059,
|
|
"learning_rate": 1.2173553719008265e-06,
|
|
"logits/chosen": -0.028076171875,
|
|
"logits/rejected": -0.171875,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -344.0,
|
|
"loss": 0.0363,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.390625,
|
|
"rewards/margins": 10.75,
|
|
"rewards/rejected": -13.125,
|
|
"step": 972
|
|
},
|
|
{
|
|
"epoch": 1.1938650306748466,
|
|
"grad_norm": 16.639992283251654,
|
|
"learning_rate": 1.2165289256198345e-06,
|
|
"logits/chosen": -0.1328125,
|
|
"logits/rejected": -0.251953125,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -466.0,
|
|
"loss": 0.0605,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.5859375,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 973
|
|
},
|
|
{
|
|
"epoch": 1.1950920245398773,
|
|
"grad_norm": 4.567276764371933,
|
|
"learning_rate": 1.2157024793388429e-06,
|
|
"logits/chosen": -0.2109375,
|
|
"logits/rejected": -0.3984375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.0146,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.0546875,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 974
|
|
},
|
|
{
|
|
"epoch": 1.196319018404908,
|
|
"grad_norm": 16.538248085370746,
|
|
"learning_rate": 1.214876033057851e-06,
|
|
"logits/chosen": 0.0810546875,
|
|
"logits/rejected": -0.04248046875,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.0592,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.109375,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -13.75,
|
|
"step": 975
|
|
},
|
|
{
|
|
"epoch": 1.1975460122699386,
|
|
"grad_norm": 9.847022221108725,
|
|
"learning_rate": 1.2140495867768595e-06,
|
|
"logits/chosen": -0.15234375,
|
|
"logits/rejected": -0.373046875,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0362,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.046875,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.125,
|
|
"step": 976
|
|
},
|
|
{
|
|
"epoch": 1.1987730061349693,
|
|
"grad_norm": 7.542773701887827,
|
|
"learning_rate": 1.2132231404958677e-06,
|
|
"logits/chosen": -0.04833984375,
|
|
"logits/rejected": -0.248046875,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0212,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.28125,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 977
|
|
},
|
|
{
|
|
"epoch": 1.2,
|
|
"grad_norm": 15.424661364927971,
|
|
"learning_rate": 1.212396694214876e-06,
|
|
"logits/chosen": -0.08837890625,
|
|
"logits/rejected": -0.1181640625,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0879,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.734375,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 978
|
|
},
|
|
{
|
|
"epoch": 1.2012269938650306,
|
|
"grad_norm": 9.396706852674509,
|
|
"learning_rate": 1.2115702479338842e-06,
|
|
"logits/chosen": 0.0262451171875,
|
|
"logits/rejected": -0.10107421875,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0293,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.671875,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 979
|
|
},
|
|
{
|
|
"epoch": 1.2024539877300613,
|
|
"grad_norm": 6.571933361630648,
|
|
"learning_rate": 1.2107438016528926e-06,
|
|
"logits/chosen": -0.162109375,
|
|
"logits/rejected": -0.341796875,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0236,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.5234375,
|
|
"rewards/margins": 13.4375,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 980
|
|
},
|
|
{
|
|
"epoch": 1.203680981595092,
|
|
"grad_norm": 11.474305445699706,
|
|
"learning_rate": 1.2099173553719008e-06,
|
|
"logits/chosen": -0.068359375,
|
|
"logits/rejected": -0.154296875,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0421,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.6796875,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -14.0,
|
|
"step": 981
|
|
},
|
|
{
|
|
"epoch": 1.2049079754601226,
|
|
"grad_norm": 10.20449927069489,
|
|
"learning_rate": 1.209090909090909e-06,
|
|
"logits/chosen": -0.07470703125,
|
|
"logits/rejected": -0.24609375,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0438,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.75,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 982
|
|
},
|
|
{
|
|
"epoch": 1.2061349693251533,
|
|
"grad_norm": 14.97705311254297,
|
|
"learning_rate": 1.2082644628099172e-06,
|
|
"logits/chosen": -0.076171875,
|
|
"logits/rejected": -0.2578125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0822,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.8203125,
|
|
"rewards/margins": 10.875,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 983
|
|
},
|
|
{
|
|
"epoch": 1.207361963190184,
|
|
"grad_norm": 13.05578709428694,
|
|
"learning_rate": 1.2074380165289256e-06,
|
|
"logits/chosen": -0.10888671875,
|
|
"logits/rejected": -0.283203125,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.0485,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.734375,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -13.125,
|
|
"step": 984
|
|
},
|
|
{
|
|
"epoch": 1.2085889570552146,
|
|
"grad_norm": 8.73456726352084,
|
|
"learning_rate": 1.2066115702479338e-06,
|
|
"logits/chosen": -0.0225830078125,
|
|
"logits/rejected": -0.1845703125,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0374,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.296875,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -12.875,
|
|
"step": 985
|
|
},
|
|
{
|
|
"epoch": 1.2098159509202455,
|
|
"grad_norm": 7.861853834042409,
|
|
"learning_rate": 1.205785123966942e-06,
|
|
"logits/chosen": 0.08740234375,
|
|
"logits/rejected": -0.061767578125,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.027,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.3125,
|
|
"rewards/margins": 10.875,
|
|
"rewards/rejected": -12.1875,
|
|
"step": 986
|
|
},
|
|
{
|
|
"epoch": 1.2110429447852762,
|
|
"grad_norm": 8.766298480592287,
|
|
"learning_rate": 1.2049586776859504e-06,
|
|
"logits/chosen": -0.12451171875,
|
|
"logits/rejected": -0.373046875,
|
|
"logps/chosen": -474.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0384,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.236328125,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -12.8125,
|
|
"step": 987
|
|
},
|
|
{
|
|
"epoch": 1.2122699386503069,
|
|
"grad_norm": 4.029272452040693,
|
|
"learning_rate": 1.2041322314049586e-06,
|
|
"logits/chosen": -0.01458740234375,
|
|
"logits/rejected": -0.2421875,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.0122,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.53125,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 988
|
|
},
|
|
{
|
|
"epoch": 1.2134969325153375,
|
|
"grad_norm": 8.944026149848822,
|
|
"learning_rate": 1.203305785123967e-06,
|
|
"logits/chosen": 0.023193359375,
|
|
"logits/rejected": -0.146484375,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.0399,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.0625,
|
|
"rewards/margins": 10.375,
|
|
"rewards/rejected": -12.4375,
|
|
"step": 989
|
|
},
|
|
{
|
|
"epoch": 1.2147239263803682,
|
|
"grad_norm": 5.179320439212364,
|
|
"learning_rate": 1.2024793388429752e-06,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.3125,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0227,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.8515625,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.125,
|
|
"step": 990
|
|
},
|
|
{
|
|
"epoch": 1.2159509202453989,
|
|
"grad_norm": 15.977051854013217,
|
|
"learning_rate": 1.2016528925619834e-06,
|
|
"logits/chosen": -0.0703125,
|
|
"logits/rejected": -0.2021484375,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0379,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.40625,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.375,
|
|
"step": 991
|
|
},
|
|
{
|
|
"epoch": 1.2171779141104295,
|
|
"grad_norm": 15.858494272070253,
|
|
"learning_rate": 1.2008264462809915e-06,
|
|
"logits/chosen": -0.1005859375,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.093,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.15625,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 992
|
|
},
|
|
{
|
|
"epoch": 1.2184049079754602,
|
|
"grad_norm": 16.14251495033581,
|
|
"learning_rate": 1.2e-06,
|
|
"logits/chosen": -0.158203125,
|
|
"logits/rejected": -0.30078125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0951,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.5390625,
|
|
"rewards/margins": 11.125,
|
|
"rewards/rejected": -11.6875,
|
|
"step": 993
|
|
},
|
|
{
|
|
"epoch": 1.2196319018404909,
|
|
"grad_norm": 8.547796922186873,
|
|
"learning_rate": 1.1991735537190081e-06,
|
|
"logits/chosen": -0.15625,
|
|
"logits/rejected": -0.330078125,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0287,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.92578125,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -12.5625,
|
|
"step": 994
|
|
},
|
|
{
|
|
"epoch": 1.2208588957055215,
|
|
"grad_norm": 10.160029663539905,
|
|
"learning_rate": 1.1983471074380165e-06,
|
|
"logits/chosen": -0.08544921875,
|
|
"logits/rejected": -0.232421875,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0215,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.4140625,
|
|
"rewards/margins": 10.6875,
|
|
"rewards/rejected": -12.125,
|
|
"step": 995
|
|
},
|
|
{
|
|
"epoch": 1.2220858895705522,
|
|
"grad_norm": 19.452317804705746,
|
|
"learning_rate": 1.1975206611570247e-06,
|
|
"logits/chosen": -0.01116943359375,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0656,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1953125,
|
|
"rewards/margins": 10.5,
|
|
"rewards/rejected": -11.6875,
|
|
"step": 996
|
|
},
|
|
{
|
|
"epoch": 1.2233128834355829,
|
|
"grad_norm": 13.533791677083688,
|
|
"learning_rate": 1.1966942148760331e-06,
|
|
"logits/chosen": -0.181640625,
|
|
"logits/rejected": -0.3671875,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0515,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": 0.25390625,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -11.5,
|
|
"step": 997
|
|
},
|
|
{
|
|
"epoch": 1.2245398773006135,
|
|
"grad_norm": 11.848136882520404,
|
|
"learning_rate": 1.1958677685950413e-06,
|
|
"logits/chosen": -0.0086669921875,
|
|
"logits/rejected": -0.2060546875,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.027,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.28515625,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -11.8125,
|
|
"step": 998
|
|
},
|
|
{
|
|
"epoch": 1.2257668711656442,
|
|
"grad_norm": 9.541868816097741,
|
|
"learning_rate": 1.1950413223140497e-06,
|
|
"logits/chosen": -0.06787109375,
|
|
"logits/rejected": -0.234375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0397,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": 0.26171875,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -11.625,
|
|
"step": 999
|
|
},
|
|
{
|
|
"epoch": 1.2269938650306749,
|
|
"grad_norm": 10.980857798677132,
|
|
"learning_rate": 1.1942148760330577e-06,
|
|
"logits/chosen": -0.00372314453125,
|
|
"logits/rejected": -0.09033203125,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.066,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.107421875,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -11.875,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 1.2282208588957055,
|
|
"grad_norm": 4.634321275932294,
|
|
"learning_rate": 1.193388429752066e-06,
|
|
"logits/chosen": -0.1845703125,
|
|
"logits/rejected": -0.3515625,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0159,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": 0.45703125,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -11.6875,
|
|
"step": 1001
|
|
},
|
|
{
|
|
"epoch": 1.2294478527607362,
|
|
"grad_norm": 14.691871767924098,
|
|
"learning_rate": 1.1925619834710743e-06,
|
|
"logits/chosen": -0.05712890625,
|
|
"logits/rejected": -0.09033203125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0631,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.3671875,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -11.875,
|
|
"step": 1002
|
|
},
|
|
{
|
|
"epoch": 1.2306748466257669,
|
|
"grad_norm": 16.78704234522903,
|
|
"learning_rate": 1.1917355371900827e-06,
|
|
"logits/chosen": -0.150390625,
|
|
"logits/rejected": -0.283203125,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.1099,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -0.73046875,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -12.3125,
|
|
"step": 1003
|
|
},
|
|
{
|
|
"epoch": 1.2319018404907975,
|
|
"grad_norm": 12.437884297351662,
|
|
"learning_rate": 1.1909090909090909e-06,
|
|
"logits/chosen": -0.024169921875,
|
|
"logits/rejected": -0.234375,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -350.0,
|
|
"loss": 0.0418,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.77734375,
|
|
"rewards/margins": 10.5625,
|
|
"rewards/rejected": -11.375,
|
|
"step": 1004
|
|
},
|
|
{
|
|
"epoch": 1.2331288343558282,
|
|
"grad_norm": 5.325399930170229,
|
|
"learning_rate": 1.190082644628099e-06,
|
|
"logits/chosen": -0.024169921875,
|
|
"logits/rejected": -0.2119140625,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0238,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.76171875,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -12.125,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"epoch": 1.2343558282208589,
|
|
"grad_norm": 7.7871544288260175,
|
|
"learning_rate": 1.1892561983471075e-06,
|
|
"logits/chosen": -0.08837890625,
|
|
"logits/rejected": -0.259765625,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0315,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.953125,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -12.3125,
|
|
"step": 1006
|
|
},
|
|
{
|
|
"epoch": 1.2355828220858895,
|
|
"grad_norm": 15.329760712489666,
|
|
"learning_rate": 1.1884297520661156e-06,
|
|
"logits/chosen": -0.05615234375,
|
|
"logits/rejected": -0.212890625,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0657,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -0.5078125,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -12.5,
|
|
"step": 1007
|
|
},
|
|
{
|
|
"epoch": 1.2368098159509202,
|
|
"grad_norm": 8.444858942456518,
|
|
"learning_rate": 1.187603305785124e-06,
|
|
"logits/chosen": -0.06591796875,
|
|
"logits/rejected": -0.1865234375,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.0417,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.1640625,
|
|
"rewards/margins": 10.9375,
|
|
"rewards/rejected": -12.125,
|
|
"step": 1008
|
|
},
|
|
{
|
|
"epoch": 1.2380368098159509,
|
|
"grad_norm": 16.143259489433873,
|
|
"learning_rate": 1.186776859504132e-06,
|
|
"logits/chosen": 0.027099609375,
|
|
"logits/rejected": -0.173828125,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0912,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.4453125,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -12.4375,
|
|
"step": 1009
|
|
},
|
|
{
|
|
"epoch": 1.2392638036809815,
|
|
"grad_norm": 10.769295507845479,
|
|
"learning_rate": 1.1859504132231404e-06,
|
|
"logits/chosen": -0.001007080078125,
|
|
"logits/rejected": -0.087890625,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0471,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.7890625,
|
|
"rewards/margins": 11.3125,
|
|
"rewards/rejected": -13.125,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"epoch": 1.2404907975460122,
|
|
"grad_norm": 4.694884526096991,
|
|
"learning_rate": 1.1851239669421486e-06,
|
|
"logits/chosen": -0.0174560546875,
|
|
"logits/rejected": -0.2080078125,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0187,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.015625,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.0,
|
|
"step": 1011
|
|
},
|
|
{
|
|
"epoch": 1.2417177914110429,
|
|
"grad_norm": 11.14299328967405,
|
|
"learning_rate": 1.184297520661157e-06,
|
|
"logits/chosen": -0.09228515625,
|
|
"logits/rejected": -0.2431640625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0563,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.1953125,
|
|
"rewards/margins": 11.1875,
|
|
"rewards/rejected": -12.375,
|
|
"step": 1012
|
|
},
|
|
{
|
|
"epoch": 1.2429447852760735,
|
|
"grad_norm": 15.432263414767332,
|
|
"learning_rate": 1.1834710743801652e-06,
|
|
"logits/chosen": 0.0260009765625,
|
|
"logits/rejected": -0.037841796875,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0618,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.8984375,
|
|
"rewards/margins": 10.0625,
|
|
"rewards/rejected": -11.9375,
|
|
"step": 1013
|
|
},
|
|
{
|
|
"epoch": 1.2441717791411042,
|
|
"grad_norm": 8.051839192246304,
|
|
"learning_rate": 1.1826446280991736e-06,
|
|
"logits/chosen": -0.08203125,
|
|
"logits/rejected": -0.2109375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0408,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.984375,
|
|
"rewards/margins": 10.75,
|
|
"rewards/rejected": -12.75,
|
|
"step": 1014
|
|
},
|
|
{
|
|
"epoch": 1.2453987730061349,
|
|
"grad_norm": 10.159231355173494,
|
|
"learning_rate": 1.1818181818181818e-06,
|
|
"logits/chosen": -0.05419921875,
|
|
"logits/rejected": -0.169921875,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0431,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.13671875,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"epoch": 1.2466257668711656,
|
|
"grad_norm": 14.588997195276331,
|
|
"learning_rate": 1.1809917355371902e-06,
|
|
"logits/chosen": -0.059814453125,
|
|
"logits/rejected": -0.142578125,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.0848,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.078125,
|
|
"rewards/margins": 10.4375,
|
|
"rewards/rejected": -12.5625,
|
|
"step": 1016
|
|
},
|
|
{
|
|
"epoch": 1.2478527607361962,
|
|
"grad_norm": 1.7622734192520961,
|
|
"learning_rate": 1.1801652892561984e-06,
|
|
"logits/chosen": -0.0673828125,
|
|
"logits/rejected": -0.298828125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0087,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.55078125,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1017
|
|
},
|
|
{
|
|
"epoch": 1.2490797546012269,
|
|
"grad_norm": 8.586072122468636,
|
|
"learning_rate": 1.1793388429752066e-06,
|
|
"logits/chosen": -0.09814453125,
|
|
"logits/rejected": -0.1806640625,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0326,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.3828125,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1018
|
|
},
|
|
{
|
|
"epoch": 1.2503067484662576,
|
|
"grad_norm": 7.454525084876923,
|
|
"learning_rate": 1.1785123966942147e-06,
|
|
"logits/chosen": -0.1396484375,
|
|
"logits/rejected": -0.28515625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0316,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.4609375,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1019
|
|
},
|
|
{
|
|
"epoch": 1.2515337423312882,
|
|
"grad_norm": 8.753659634452339,
|
|
"learning_rate": 1.1776859504132231e-06,
|
|
"logits/chosen": -0.076171875,
|
|
"logits/rejected": -0.169921875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0408,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.234375,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"epoch": 1.252760736196319,
|
|
"grad_norm": 4.422275674570636,
|
|
"learning_rate": 1.1768595041322313e-06,
|
|
"logits/chosen": -0.04345703125,
|
|
"logits/rejected": -0.12451171875,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0211,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.9375,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 1021
|
|
},
|
|
{
|
|
"epoch": 1.2539877300613496,
|
|
"grad_norm": 5.7879749078778815,
|
|
"learning_rate": 1.1760330578512395e-06,
|
|
"logits/chosen": -0.166015625,
|
|
"logits/rejected": -0.306640625,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0228,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.25,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1022
|
|
},
|
|
{
|
|
"epoch": 1.2552147239263804,
|
|
"grad_norm": 8.969057204677366,
|
|
"learning_rate": 1.175206611570248e-06,
|
|
"logits/chosen": -0.1357421875,
|
|
"logits/rejected": -0.306640625,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0389,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.9609375,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1023
|
|
},
|
|
{
|
|
"epoch": 1.2564417177914111,
|
|
"grad_norm": 7.130825092354974,
|
|
"learning_rate": 1.1743801652892561e-06,
|
|
"logits/chosen": -0.01904296875,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.023,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.7734375,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -15.0625,
|
|
"step": 1024
|
|
},
|
|
{
|
|
"epoch": 1.2576687116564418,
|
|
"grad_norm": 16.852326885416577,
|
|
"learning_rate": 1.1735537190082645e-06,
|
|
"logits/chosen": -0.0299072265625,
|
|
"logits/rejected": -0.1865234375,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -452.0,
|
|
"loss": 0.0466,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.2265625,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"epoch": 1.2588957055214725,
|
|
"grad_norm": 5.356931220922423,
|
|
"learning_rate": 1.1727272727272725e-06,
|
|
"logits/chosen": -0.126953125,
|
|
"logits/rejected": -0.2890625,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0268,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.734375,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1026
|
|
},
|
|
{
|
|
"epoch": 1.2601226993865031,
|
|
"grad_norm": 4.025169633529637,
|
|
"learning_rate": 1.1719008264462809e-06,
|
|
"logits/chosen": -0.1669921875,
|
|
"logits/rejected": -0.40234375,
|
|
"logps/chosen": -466.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.0153,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.2890625,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1027
|
|
},
|
|
{
|
|
"epoch": 1.2613496932515338,
|
|
"grad_norm": 4.592967156765468,
|
|
"learning_rate": 1.171074380165289e-06,
|
|
"logits/chosen": -0.1494140625,
|
|
"logits/rejected": -0.302734375,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0142,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.52734375,
|
|
"rewards/margins": 13.75,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1028
|
|
},
|
|
{
|
|
"epoch": 1.2625766871165645,
|
|
"grad_norm": 7.1473694166433965,
|
|
"learning_rate": 1.1702479338842975e-06,
|
|
"logits/chosen": -0.08740234375,
|
|
"logits/rejected": -0.279296875,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0285,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.59375,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -12.8125,
|
|
"step": 1029
|
|
},
|
|
{
|
|
"epoch": 1.2638036809815951,
|
|
"grad_norm": 7.5317745769902755,
|
|
"learning_rate": 1.1694214876033057e-06,
|
|
"logits/chosen": -0.2890625,
|
|
"logits/rejected": -0.373046875,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0188,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.2119140625,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"epoch": 1.2650306748466258,
|
|
"grad_norm": 9.28796641990803,
|
|
"learning_rate": 1.168595041322314e-06,
|
|
"logits/chosen": -0.052734375,
|
|
"logits/rejected": -0.294921875,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0588,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.984375,
|
|
"rewards/margins": 11.1875,
|
|
"rewards/rejected": -12.1875,
|
|
"step": 1031
|
|
},
|
|
{
|
|
"epoch": 1.2662576687116565,
|
|
"grad_norm": 10.17581121642878,
|
|
"learning_rate": 1.1677685950413223e-06,
|
|
"logits/chosen": 0.05908203125,
|
|
"logits/rejected": -0.1513671875,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0294,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.0546875,
|
|
"rewards/margins": 11.3125,
|
|
"rewards/rejected": -12.375,
|
|
"step": 1032
|
|
},
|
|
{
|
|
"epoch": 1.2674846625766871,
|
|
"grad_norm": 17.629407303632064,
|
|
"learning_rate": 1.1669421487603307e-06,
|
|
"logits/chosen": -0.1044921875,
|
|
"logits/rejected": -0.31640625,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0942,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.7109375,
|
|
"rewards/margins": 11.0,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 1033
|
|
},
|
|
{
|
|
"epoch": 1.2687116564417178,
|
|
"grad_norm": 7.921949810579345,
|
|
"learning_rate": 1.1661157024793388e-06,
|
|
"logits/chosen": -0.140625,
|
|
"logits/rejected": -0.369140625,
|
|
"logps/chosen": -480.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.0225,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.3203125,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1034
|
|
},
|
|
{
|
|
"epoch": 1.2699386503067485,
|
|
"grad_norm": 8.2688209516239,
|
|
"learning_rate": 1.165289256198347e-06,
|
|
"logits/chosen": -0.05322265625,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0309,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.6328125,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -12.625,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"epoch": 1.2711656441717791,
|
|
"grad_norm": 12.060040768536464,
|
|
"learning_rate": 1.1644628099173552e-06,
|
|
"logits/chosen": -0.048095703125,
|
|
"logits/rejected": -0.1826171875,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0348,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.47265625,
|
|
"rewards/margins": 11.125,
|
|
"rewards/rejected": -11.625,
|
|
"step": 1036
|
|
},
|
|
{
|
|
"epoch": 1.2723926380368098,
|
|
"grad_norm": 9.716295747684459,
|
|
"learning_rate": 1.1636363636363636e-06,
|
|
"logits/chosen": -0.259765625,
|
|
"logits/rejected": -0.388671875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0301,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.330078125,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -12.375,
|
|
"step": 1037
|
|
},
|
|
{
|
|
"epoch": 1.2736196319018405,
|
|
"grad_norm": 8.828924438984327,
|
|
"learning_rate": 1.1628099173553718e-06,
|
|
"logits/chosen": -0.087890625,
|
|
"logits/rejected": -0.251953125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0182,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.6484375,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -12.625,
|
|
"step": 1038
|
|
},
|
|
{
|
|
"epoch": 1.2748466257668711,
|
|
"grad_norm": 11.843727477483496,
|
|
"learning_rate": 1.1619834710743802e-06,
|
|
"logits/chosen": -0.12353515625,
|
|
"logits/rejected": -0.2138671875,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0418,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.3828125,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -13.0,
|
|
"step": 1039
|
|
},
|
|
{
|
|
"epoch": 1.2760736196319018,
|
|
"grad_norm": 12.673779303634513,
|
|
"learning_rate": 1.1611570247933884e-06,
|
|
"logits/chosen": -0.15234375,
|
|
"logits/rejected": -0.439453125,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0572,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.28125,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -12.875,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"epoch": 1.2773006134969325,
|
|
"grad_norm": 9.27637004981359,
|
|
"learning_rate": 1.1603305785123966e-06,
|
|
"logits/chosen": -0.1064453125,
|
|
"logits/rejected": -0.24609375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0312,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1015625,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1041
|
|
},
|
|
{
|
|
"epoch": 1.2785276073619631,
|
|
"grad_norm": 5.240907133996138,
|
|
"learning_rate": 1.159504132231405e-06,
|
|
"logits/chosen": -0.27734375,
|
|
"logits/rejected": -0.4765625,
|
|
"logps/chosen": -462.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0109,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.359375,
|
|
"rewards/margins": 13.6875,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1042
|
|
},
|
|
{
|
|
"epoch": 1.2797546012269938,
|
|
"grad_norm": 14.408088097702748,
|
|
"learning_rate": 1.1586776859504132e-06,
|
|
"logits/chosen": -0.06884765625,
|
|
"logits/rejected": -0.251953125,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0626,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.15625,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1043
|
|
},
|
|
{
|
|
"epoch": 1.2809815950920245,
|
|
"grad_norm": 6.481935579315082,
|
|
"learning_rate": 1.1578512396694214e-06,
|
|
"logits/chosen": -0.173828125,
|
|
"logits/rejected": -0.390625,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0152,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": 0.0179443359375,
|
|
"rewards/margins": 13.0625,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 1044
|
|
},
|
|
{
|
|
"epoch": 1.2822085889570551,
|
|
"grad_norm": 6.5837250988984355,
|
|
"learning_rate": 1.1570247933884296e-06,
|
|
"logits/chosen": -0.21484375,
|
|
"logits/rejected": -0.4921875,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0212,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.490234375,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.25,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"epoch": 1.2834355828220858,
|
|
"grad_norm": 7.360555654135404,
|
|
"learning_rate": 1.156198347107438e-06,
|
|
"logits/chosen": 0.03466796875,
|
|
"logits/rejected": -0.11572265625,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0283,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.640625,
|
|
"rewards/margins": 11.1875,
|
|
"rewards/rejected": -12.8125,
|
|
"step": 1046
|
|
},
|
|
{
|
|
"epoch": 1.2846625766871167,
|
|
"grad_norm": 11.92972158256486,
|
|
"learning_rate": 1.1553719008264461e-06,
|
|
"logits/chosen": -0.13671875,
|
|
"logits/rejected": -0.279296875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0348,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.62890625,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1047
|
|
},
|
|
{
|
|
"epoch": 1.2858895705521474,
|
|
"grad_norm": 6.532999108856601,
|
|
"learning_rate": 1.1545454545454545e-06,
|
|
"logits/chosen": -0.0294189453125,
|
|
"logits/rejected": -0.2294921875,
|
|
"logps/chosen": -354.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.0242,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.15625,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 1048
|
|
},
|
|
{
|
|
"epoch": 1.287116564417178,
|
|
"grad_norm": 7.374695524155877,
|
|
"learning_rate": 1.1537190082644627e-06,
|
|
"logits/chosen": -0.055908203125,
|
|
"logits/rejected": -0.279296875,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0301,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.4921875,
|
|
"rewards/margins": 11.125,
|
|
"rewards/rejected": -12.625,
|
|
"step": 1049
|
|
},
|
|
{
|
|
"epoch": 1.2883435582822087,
|
|
"grad_norm": 13.182547731072962,
|
|
"learning_rate": 1.1528925619834711e-06,
|
|
"logits/chosen": -0.2041015625,
|
|
"logits/rejected": -0.34375,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0551,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.3359375,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"epoch": 1.2895705521472394,
|
|
"grad_norm": 4.933273422582305,
|
|
"learning_rate": 1.1520661157024793e-06,
|
|
"logits/chosen": -0.232421875,
|
|
"logits/rejected": -0.421875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0183,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.1953125,
|
|
"rewards/margins": 13.75,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1051
|
|
},
|
|
{
|
|
"epoch": 1.29079754601227,
|
|
"grad_norm": 13.147335745579854,
|
|
"learning_rate": 1.1512396694214877e-06,
|
|
"logits/chosen": -0.083984375,
|
|
"logits/rejected": -0.2890625,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0707,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.7734375,
|
|
"rewards/margins": 11.0,
|
|
"rewards/rejected": -12.8125,
|
|
"step": 1052
|
|
},
|
|
{
|
|
"epoch": 1.2920245398773007,
|
|
"grad_norm": 17.89117182973075,
|
|
"learning_rate": 1.1504132231404957e-06,
|
|
"logits/chosen": -0.0233154296875,
|
|
"logits/rejected": -0.2431640625,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.0706,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.0390625,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1053
|
|
},
|
|
{
|
|
"epoch": 1.2932515337423314,
|
|
"grad_norm": 11.894902603375346,
|
|
"learning_rate": 1.149586776859504e-06,
|
|
"logits/chosen": -0.080078125,
|
|
"logits/rejected": -0.30078125,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0684,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.1328125,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1054
|
|
},
|
|
{
|
|
"epoch": 1.294478527607362,
|
|
"grad_norm": 11.855826173867971,
|
|
"learning_rate": 1.1487603305785123e-06,
|
|
"logits/chosen": -0.09375,
|
|
"logits/rejected": -0.310546875,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0403,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.3671875,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"epoch": 1.2957055214723927,
|
|
"grad_norm": 6.54120593399342,
|
|
"learning_rate": 1.1479338842975207e-06,
|
|
"logits/chosen": -0.12890625,
|
|
"logits/rejected": -0.318359375,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.0218,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.375,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1056
|
|
},
|
|
{
|
|
"epoch": 1.2969325153374234,
|
|
"grad_norm": 12.069194034475203,
|
|
"learning_rate": 1.1471074380165289e-06,
|
|
"logits/chosen": -0.11083984375,
|
|
"logits/rejected": -0.2470703125,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.034,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.3046875,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1057
|
|
},
|
|
{
|
|
"epoch": 1.298159509202454,
|
|
"grad_norm": 12.81723443687315,
|
|
"learning_rate": 1.146280991735537e-06,
|
|
"logits/chosen": -0.12109375,
|
|
"logits/rejected": -0.345703125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0442,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.1171875,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 1058
|
|
},
|
|
{
|
|
"epoch": 1.2993865030674847,
|
|
"grad_norm": 19.668616593165343,
|
|
"learning_rate": 1.1454545454545455e-06,
|
|
"logits/chosen": -0.1669921875,
|
|
"logits/rejected": -0.369140625,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0771,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.9296875,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1059
|
|
},
|
|
{
|
|
"epoch": 1.3006134969325154,
|
|
"grad_norm": 4.764240636634084,
|
|
"learning_rate": 1.1446280991735536e-06,
|
|
"logits/chosen": -0.1328125,
|
|
"logits/rejected": -0.2236328125,
|
|
"logps/chosen": -354.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.0166,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.3046875,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"epoch": 1.301840490797546,
|
|
"grad_norm": 13.349737415518328,
|
|
"learning_rate": 1.143801652892562e-06,
|
|
"logits/chosen": -0.04150390625,
|
|
"logits/rejected": -0.1396484375,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.051,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.125,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1061
|
|
},
|
|
{
|
|
"epoch": 1.3030674846625767,
|
|
"grad_norm": 17.311517850074033,
|
|
"learning_rate": 1.14297520661157e-06,
|
|
"logits/chosen": -0.07958984375,
|
|
"logits/rejected": -0.2099609375,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0964,
|
|
"rewards/accuracies": 0.953125,
|
|
"rewards/chosen": -1.9140625,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1062
|
|
},
|
|
{
|
|
"epoch": 1.3042944785276074,
|
|
"grad_norm": 16.89674032193128,
|
|
"learning_rate": 1.1421487603305784e-06,
|
|
"logits/chosen": -0.142578125,
|
|
"logits/rejected": -0.28125,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.1149,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.90625,
|
|
"rewards/margins": 11.6875,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1063
|
|
},
|
|
{
|
|
"epoch": 1.305521472392638,
|
|
"grad_norm": 6.913627860848936,
|
|
"learning_rate": 1.1413223140495866e-06,
|
|
"logits/chosen": -0.1494140625,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0272,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.453125,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1064
|
|
},
|
|
{
|
|
"epoch": 1.3067484662576687,
|
|
"grad_norm": 12.33620790684063,
|
|
"learning_rate": 1.140495867768595e-06,
|
|
"logits/chosen": -0.095703125,
|
|
"logits/rejected": -0.412109375,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0578,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.4609375,
|
|
"rewards/margins": 14.125,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"epoch": 1.3079754601226994,
|
|
"grad_norm": 7.54472806810441,
|
|
"learning_rate": 1.1396694214876032e-06,
|
|
"logits/chosen": -0.119140625,
|
|
"logits/rejected": -0.41015625,
|
|
"logps/chosen": -482.0,
|
|
"logps/rejected": -456.0,
|
|
"loss": 0.029,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.3984375,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1066
|
|
},
|
|
{
|
|
"epoch": 1.30920245398773,
|
|
"grad_norm": 8.813890231917389,
|
|
"learning_rate": 1.1388429752066116e-06,
|
|
"logits/chosen": -0.1396484375,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0292,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.296875,
|
|
"rewards/margins": 10.75,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 1067
|
|
},
|
|
{
|
|
"epoch": 1.3104294478527607,
|
|
"grad_norm": 11.457689134913586,
|
|
"learning_rate": 1.1380165289256198e-06,
|
|
"logits/chosen": -0.1572265625,
|
|
"logits/rejected": -0.3046875,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0573,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.4765625,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1068
|
|
},
|
|
{
|
|
"epoch": 1.3116564417177914,
|
|
"grad_norm": 9.193072844310997,
|
|
"learning_rate": 1.1371900826446282e-06,
|
|
"logits/chosen": -0.051513671875,
|
|
"logits/rejected": -0.27734375,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0467,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.5625,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1069
|
|
},
|
|
{
|
|
"epoch": 1.312883435582822,
|
|
"grad_norm": 7.739296185791426,
|
|
"learning_rate": 1.1363636363636364e-06,
|
|
"logits/chosen": -0.1640625,
|
|
"logits/rejected": -0.240234375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0246,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.66015625,
|
|
"rewards/margins": 13.5625,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"epoch": 1.3141104294478527,
|
|
"grad_norm": 11.923582671449667,
|
|
"learning_rate": 1.1355371900826446e-06,
|
|
"logits/chosen": -0.2001953125,
|
|
"logits/rejected": -0.390625,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0828,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.0546875,
|
|
"rewards/margins": 13.0625,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1071
|
|
},
|
|
{
|
|
"epoch": 1.3153374233128834,
|
|
"grad_norm": 7.011783516581803,
|
|
"learning_rate": 1.1347107438016528e-06,
|
|
"logits/chosen": 0.0196533203125,
|
|
"logits/rejected": -0.171875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0263,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.4609375,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1072
|
|
},
|
|
{
|
|
"epoch": 1.316564417177914,
|
|
"grad_norm": 8.705400307021929,
|
|
"learning_rate": 1.1338842975206612e-06,
|
|
"logits/chosen": -0.1689453125,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -346.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0254,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.5546875,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1073
|
|
},
|
|
{
|
|
"epoch": 1.3177914110429447,
|
|
"grad_norm": 8.904135421291642,
|
|
"learning_rate": 1.1330578512396693e-06,
|
|
"logits/chosen": -0.181640625,
|
|
"logits/rejected": -0.30078125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0355,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.484375,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1074
|
|
},
|
|
{
|
|
"epoch": 1.3190184049079754,
|
|
"grad_norm": 11.515080176449112,
|
|
"learning_rate": 1.1322314049586775e-06,
|
|
"logits/chosen": -0.036865234375,
|
|
"logits/rejected": -0.20703125,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0492,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.6875,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"epoch": 1.320245398773006,
|
|
"grad_norm": 9.03764988799755,
|
|
"learning_rate": 1.131404958677686e-06,
|
|
"logits/chosen": -0.01287841796875,
|
|
"logits/rejected": -0.095703125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0416,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.9921875,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1076
|
|
},
|
|
{
|
|
"epoch": 1.3214723926380367,
|
|
"grad_norm": 10.099191955462704,
|
|
"learning_rate": 1.1305785123966941e-06,
|
|
"logits/chosen": -0.1748046875,
|
|
"logits/rejected": -0.314453125,
|
|
"logps/chosen": -322.0,
|
|
"logps/rejected": -342.0,
|
|
"loss": 0.0544,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.296875,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1077
|
|
},
|
|
{
|
|
"epoch": 1.3226993865030674,
|
|
"grad_norm": 5.486875279495536,
|
|
"learning_rate": 1.1297520661157025e-06,
|
|
"logits/chosen": -0.0194091796875,
|
|
"logits/rejected": -0.130859375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0292,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.640625,
|
|
"rewards/margins": 10.5,
|
|
"rewards/rejected": -13.125,
|
|
"step": 1078
|
|
},
|
|
{
|
|
"epoch": 1.323926380368098,
|
|
"grad_norm": 15.612402485436549,
|
|
"learning_rate": 1.1289256198347107e-06,
|
|
"logits/chosen": -0.0908203125,
|
|
"logits/rejected": -0.236328125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.049,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.9921875,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1079
|
|
},
|
|
{
|
|
"epoch": 1.3251533742331287,
|
|
"grad_norm": 11.695955328947008,
|
|
"learning_rate": 1.128099173553719e-06,
|
|
"logits/chosen": -0.028564453125,
|
|
"logits/rejected": -0.2265625,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0454,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.671875,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -12.875,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"epoch": 1.3263803680981594,
|
|
"grad_norm": 12.95159332825153,
|
|
"learning_rate": 1.127272727272727e-06,
|
|
"logits/chosen": -0.0693359375,
|
|
"logits/rejected": -0.23046875,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0718,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.3671875,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1081
|
|
},
|
|
{
|
|
"epoch": 1.32760736196319,
|
|
"grad_norm": 9.81940001837259,
|
|
"learning_rate": 1.1264462809917355e-06,
|
|
"logits/chosen": -0.162109375,
|
|
"logits/rejected": -0.400390625,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.0374,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.53125,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -13.0,
|
|
"step": 1082
|
|
},
|
|
{
|
|
"epoch": 1.3288343558282207,
|
|
"grad_norm": 6.400253744341072,
|
|
"learning_rate": 1.1256198347107437e-06,
|
|
"logits/chosen": -0.0595703125,
|
|
"logits/rejected": -0.2490234375,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -352.0,
|
|
"loss": 0.0257,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.765625,
|
|
"rewards/margins": 10.5625,
|
|
"rewards/rejected": -12.375,
|
|
"step": 1083
|
|
},
|
|
{
|
|
"epoch": 1.3300613496932514,
|
|
"grad_norm": 8.444026170405825,
|
|
"learning_rate": 1.124793388429752e-06,
|
|
"logits/chosen": -0.10693359375,
|
|
"logits/rejected": -0.1142578125,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.0373,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.453125,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 1084
|
|
},
|
|
{
|
|
"epoch": 1.331288343558282,
|
|
"grad_norm": 9.169663665787084,
|
|
"learning_rate": 1.1239669421487603e-06,
|
|
"logits/chosen": 0.0068359375,
|
|
"logits/rejected": -0.1357421875,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0308,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.96875,
|
|
"rewards/margins": 10.875,
|
|
"rewards/rejected": -12.875,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"epoch": 1.332515337423313,
|
|
"grad_norm": 12.388648096466534,
|
|
"learning_rate": 1.1231404958677687e-06,
|
|
"logits/chosen": -0.060546875,
|
|
"logits/rejected": -0.1884765625,
|
|
"logps/chosen": -330.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.049,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.046875,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -12.5625,
|
|
"step": 1086
|
|
},
|
|
{
|
|
"epoch": 1.3337423312883436,
|
|
"grad_norm": 11.999502595211819,
|
|
"learning_rate": 1.1223140495867769e-06,
|
|
"logits/chosen": -0.1689453125,
|
|
"logits/rejected": -0.302734375,
|
|
"logps/chosen": -334.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.0504,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.453125,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -12.5,
|
|
"step": 1087
|
|
},
|
|
{
|
|
"epoch": 1.3349693251533743,
|
|
"grad_norm": 8.891255801535511,
|
|
"learning_rate": 1.1214876033057853e-06,
|
|
"logits/chosen": -0.09619140625,
|
|
"logits/rejected": -0.322265625,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0318,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.75390625,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -12.875,
|
|
"step": 1088
|
|
},
|
|
{
|
|
"epoch": 1.336196319018405,
|
|
"grad_norm": 8.918347449638453,
|
|
"learning_rate": 1.1206611570247932e-06,
|
|
"logits/chosen": -0.142578125,
|
|
"logits/rejected": -0.302734375,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0442,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.25,
|
|
"rewards/margins": 10.375,
|
|
"rewards/rejected": -12.625,
|
|
"step": 1089
|
|
},
|
|
{
|
|
"epoch": 1.3374233128834356,
|
|
"grad_norm": 12.793929135194107,
|
|
"learning_rate": 1.1198347107438016e-06,
|
|
"logits/chosen": -0.091796875,
|
|
"logits/rejected": -0.294921875,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.0414,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.7578125,
|
|
"rewards/margins": 10.5,
|
|
"rewards/rejected": -12.25,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"epoch": 1.3386503067484663,
|
|
"grad_norm": 16.499007058381682,
|
|
"learning_rate": 1.1190082644628098e-06,
|
|
"logits/chosen": 0.06103515625,
|
|
"logits/rejected": -0.10986328125,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.1058,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.71875,
|
|
"rewards/margins": 10.8125,
|
|
"rewards/rejected": -12.5,
|
|
"step": 1091
|
|
},
|
|
{
|
|
"epoch": 1.339877300613497,
|
|
"grad_norm": 8.500740173918128,
|
|
"learning_rate": 1.1181818181818182e-06,
|
|
"logits/chosen": -0.10498046875,
|
|
"logits/rejected": -0.275390625,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0261,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.28125,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 1092
|
|
},
|
|
{
|
|
"epoch": 1.3411042944785276,
|
|
"grad_norm": 3.5758332131591115,
|
|
"learning_rate": 1.1173553719008264e-06,
|
|
"logits/chosen": -0.1650390625,
|
|
"logits/rejected": -0.306640625,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.0151,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.0078125,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -12.0625,
|
|
"step": 1093
|
|
},
|
|
{
|
|
"epoch": 1.3423312883435583,
|
|
"grad_norm": 10.250127714023796,
|
|
"learning_rate": 1.1165289256198346e-06,
|
|
"logits/chosen": -0.038818359375,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.0459,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.140625,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 1094
|
|
},
|
|
{
|
|
"epoch": 1.343558282208589,
|
|
"grad_norm": 7.549182170613035,
|
|
"learning_rate": 1.115702479338843e-06,
|
|
"logits/chosen": -0.09716796875,
|
|
"logits/rejected": -0.310546875,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -456.0,
|
|
"loss": 0.03,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.828125,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"epoch": 1.3447852760736196,
|
|
"grad_norm": 18.418565843621806,
|
|
"learning_rate": 1.1148760330578512e-06,
|
|
"logits/chosen": -0.10791015625,
|
|
"logits/rejected": -0.2451171875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.1051,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.9140625,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -13.0,
|
|
"step": 1096
|
|
},
|
|
{
|
|
"epoch": 1.3460122699386503,
|
|
"grad_norm": 10.197334871983669,
|
|
"learning_rate": 1.1140495867768596e-06,
|
|
"logits/chosen": -0.0625,
|
|
"logits/rejected": -0.2490234375,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0318,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.28125,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1097
|
|
},
|
|
{
|
|
"epoch": 1.347239263803681,
|
|
"grad_norm": 15.038795320690456,
|
|
"learning_rate": 1.1132231404958676e-06,
|
|
"logits/chosen": 0.000812530517578125,
|
|
"logits/rejected": -0.1533203125,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0516,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.296875,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1098
|
|
},
|
|
{
|
|
"epoch": 1.3484662576687116,
|
|
"grad_norm": 11.79834009669459,
|
|
"learning_rate": 1.112396694214876e-06,
|
|
"logits/chosen": -0.05859375,
|
|
"logits/rejected": -0.1728515625,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0578,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.8359375,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1099
|
|
},
|
|
{
|
|
"epoch": 1.3496932515337423,
|
|
"grad_norm": 12.08925789040524,
|
|
"learning_rate": 1.1115702479338841e-06,
|
|
"logits/chosen": -0.12255859375,
|
|
"logits/rejected": -0.3515625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0332,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.046875,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"epoch": 1.350920245398773,
|
|
"grad_norm": 14.594290361661232,
|
|
"learning_rate": 1.1107438016528925e-06,
|
|
"logits/chosen": 0.07275390625,
|
|
"logits/rejected": -0.09033203125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0934,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.3515625,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -14.0625,
|
|
"step": 1101
|
|
},
|
|
{
|
|
"epoch": 1.3521472392638036,
|
|
"grad_norm": 16.392401563130303,
|
|
"learning_rate": 1.1099173553719007e-06,
|
|
"logits/chosen": -0.2255859375,
|
|
"logits/rejected": -0.404296875,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.1283,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.94921875,
|
|
"rewards/margins": 13.0625,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1102
|
|
},
|
|
{
|
|
"epoch": 1.3533742331288343,
|
|
"grad_norm": 11.589221885924317,
|
|
"learning_rate": 1.1090909090909091e-06,
|
|
"logits/chosen": -0.09765625,
|
|
"logits/rejected": -0.251953125,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.044,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.46875,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1103
|
|
},
|
|
{
|
|
"epoch": 1.354601226993865,
|
|
"grad_norm": 11.569191498481278,
|
|
"learning_rate": 1.1082644628099173e-06,
|
|
"logits/chosen": -0.052734375,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0622,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.4921875,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1104
|
|
},
|
|
{
|
|
"epoch": 1.3558282208588956,
|
|
"grad_norm": 3.868808082562751,
|
|
"learning_rate": 1.1074380165289257e-06,
|
|
"logits/chosen": -0.2001953125,
|
|
"logits/rejected": -0.34765625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0137,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.734375,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"epoch": 1.3570552147239263,
|
|
"grad_norm": 16.223504437577937,
|
|
"learning_rate": 1.1066115702479337e-06,
|
|
"logits/chosen": -0.12890625,
|
|
"logits/rejected": -0.2412109375,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0502,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.7734375,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1106
|
|
},
|
|
{
|
|
"epoch": 1.358282208588957,
|
|
"grad_norm": 12.163334554633638,
|
|
"learning_rate": 1.105785123966942e-06,
|
|
"logits/chosen": 0.06494140625,
|
|
"logits/rejected": -0.056396484375,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0542,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.2734375,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1107
|
|
},
|
|
{
|
|
"epoch": 1.3595092024539877,
|
|
"grad_norm": 4.111674738323493,
|
|
"learning_rate": 1.1049586776859503e-06,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.310546875,
|
|
"logps/chosen": -462.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0166,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.875,
|
|
"rewards/margins": 13.9375,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 1108
|
|
},
|
|
{
|
|
"epoch": 1.3607361963190185,
|
|
"grad_norm": 9.586036719606902,
|
|
"learning_rate": 1.1041322314049587e-06,
|
|
"logits/chosen": -0.0107421875,
|
|
"logits/rejected": -0.1591796875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0388,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.9375,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 1109
|
|
},
|
|
{
|
|
"epoch": 1.3619631901840492,
|
|
"grad_norm": 9.423691628063677,
|
|
"learning_rate": 1.1033057851239669e-06,
|
|
"logits/chosen": -0.10107421875,
|
|
"logits/rejected": -0.31640625,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0333,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.609375,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"epoch": 1.3631901840490799,
|
|
"grad_norm": 3.887903082881031,
|
|
"learning_rate": 1.102479338842975e-06,
|
|
"logits/chosen": -0.1318359375,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0121,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.5546875,
|
|
"rewards/margins": 13.1875,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1111
|
|
},
|
|
{
|
|
"epoch": 1.3644171779141105,
|
|
"grad_norm": 21.75364320203141,
|
|
"learning_rate": 1.1016528925619835e-06,
|
|
"logits/chosen": -0.12109375,
|
|
"logits/rejected": -0.21484375,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.128,
|
|
"rewards/accuracies": 0.953125,
|
|
"rewards/chosen": -2.21875,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -15.0,
|
|
"step": 1112
|
|
},
|
|
{
|
|
"epoch": 1.3656441717791412,
|
|
"grad_norm": 11.723144845985662,
|
|
"learning_rate": 1.1008264462809917e-06,
|
|
"logits/chosen": -0.09375,
|
|
"logits/rejected": -0.15234375,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.048,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.53125,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1113
|
|
},
|
|
{
|
|
"epoch": 1.3668711656441719,
|
|
"grad_norm": 14.4541664951003,
|
|
"learning_rate": 1.1e-06,
|
|
"logits/chosen": -0.244140625,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0484,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.875,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -14.5,
|
|
"step": 1114
|
|
},
|
|
{
|
|
"epoch": 1.3680981595092025,
|
|
"grad_norm": 12.99737927975128,
|
|
"learning_rate": 1.099173553719008e-06,
|
|
"logits/chosen": -0.1328125,
|
|
"logits/rejected": -0.2470703125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.042,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.109375,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -15.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"epoch": 1.3693251533742332,
|
|
"grad_norm": 4.63602627137829,
|
|
"learning_rate": 1.0983471074380164e-06,
|
|
"logits/chosen": -0.0615234375,
|
|
"logits/rejected": -0.2470703125,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.023,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.390625,
|
|
"rewards/margins": 13.9375,
|
|
"rewards/rejected": -16.375,
|
|
"step": 1116
|
|
},
|
|
{
|
|
"epoch": 1.3705521472392639,
|
|
"grad_norm": 6.228478350481593,
|
|
"learning_rate": 1.0975206611570246e-06,
|
|
"logits/chosen": -0.244140625,
|
|
"logits/rejected": -0.46875,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0202,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.203125,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -15.5625,
|
|
"step": 1117
|
|
},
|
|
{
|
|
"epoch": 1.3717791411042946,
|
|
"grad_norm": 13.957316343629058,
|
|
"learning_rate": 1.096694214876033e-06,
|
|
"logits/chosen": -0.049560546875,
|
|
"logits/rejected": -0.2255859375,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0812,
|
|
"rewards/accuracies": 0.953125,
|
|
"rewards/chosen": -3.1875,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -15.1875,
|
|
"step": 1118
|
|
},
|
|
{
|
|
"epoch": 1.3730061349693252,
|
|
"grad_norm": 13.063057761778065,
|
|
"learning_rate": 1.0958677685950412e-06,
|
|
"logits/chosen": -0.146484375,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -464.0,
|
|
"loss": 0.0711,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -3.109375,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -15.5625,
|
|
"step": 1119
|
|
},
|
|
{
|
|
"epoch": 1.3742331288343559,
|
|
"grad_norm": 10.199819984826927,
|
|
"learning_rate": 1.0950413223140496e-06,
|
|
"logits/chosen": -0.1044921875,
|
|
"logits/rejected": -0.400390625,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0302,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.140625,
|
|
"rewards/margins": 13.5625,
|
|
"rewards/rejected": -15.6875,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"epoch": 1.3754601226993866,
|
|
"grad_norm": 12.945149935356588,
|
|
"learning_rate": 1.0942148760330578e-06,
|
|
"logits/chosen": -0.21875,
|
|
"logits/rejected": -0.3828125,
|
|
"logps/chosen": -470.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0471,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.59375,
|
|
"rewards/margins": 13.0625,
|
|
"rewards/rejected": -15.625,
|
|
"step": 1121
|
|
},
|
|
{
|
|
"epoch": 1.3766871165644172,
|
|
"grad_norm": 44.95428070783949,
|
|
"learning_rate": 1.0933884297520662e-06,
|
|
"logits/chosen": -0.2353515625,
|
|
"logits/rejected": -0.37109375,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0564,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -3.875,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -15.625,
|
|
"step": 1122
|
|
},
|
|
{
|
|
"epoch": 1.377914110429448,
|
|
"grad_norm": 4.007931665438838,
|
|
"learning_rate": 1.0925619834710744e-06,
|
|
"logits/chosen": -0.232421875,
|
|
"logits/rejected": -0.38671875,
|
|
"logps/chosen": -472.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0127,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -3.265625,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -15.875,
|
|
"step": 1123
|
|
},
|
|
{
|
|
"epoch": 1.3791411042944786,
|
|
"grad_norm": 9.868525682809,
|
|
"learning_rate": 1.0917355371900826e-06,
|
|
"logits/chosen": -0.1533203125,
|
|
"logits/rejected": -0.34765625,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0264,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.828125,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -16.125,
|
|
"step": 1124
|
|
},
|
|
{
|
|
"epoch": 1.3803680981595092,
|
|
"grad_norm": 11.166114244137697,
|
|
"learning_rate": 1.0909090909090908e-06,
|
|
"logits/chosen": -0.224609375,
|
|
"logits/rejected": -0.380859375,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0372,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -3.484375,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -15.625,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"epoch": 1.38159509202454,
|
|
"grad_norm": 13.280915899781382,
|
|
"learning_rate": 1.0900826446280992e-06,
|
|
"logits/chosen": -0.2216796875,
|
|
"logits/rejected": -0.357421875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0423,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.890625,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -15.875,
|
|
"step": 1126
|
|
},
|
|
{
|
|
"epoch": 1.3828220858895706,
|
|
"grad_norm": 14.128061178067208,
|
|
"learning_rate": 1.0892561983471074e-06,
|
|
"logits/chosen": -0.1787109375,
|
|
"logits/rejected": -0.39453125,
|
|
"logps/chosen": -482.0,
|
|
"logps/rejected": -478.0,
|
|
"loss": 0.0629,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.390625,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -15.5625,
|
|
"step": 1127
|
|
},
|
|
{
|
|
"epoch": 1.3840490797546012,
|
|
"grad_norm": 21.084699918466672,
|
|
"learning_rate": 1.0884297520661158e-06,
|
|
"logits/chosen": -0.134765625,
|
|
"logits/rejected": -0.296875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.0941,
|
|
"rewards/accuracies": 0.953125,
|
|
"rewards/chosen": -3.65625,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -15.1875,
|
|
"step": 1128
|
|
},
|
|
{
|
|
"epoch": 1.385276073619632,
|
|
"grad_norm": 11.280833468857944,
|
|
"learning_rate": 1.087603305785124e-06,
|
|
"logits/chosen": -0.0223388671875,
|
|
"logits/rejected": -0.173828125,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0381,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.640625,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -14.9375,
|
|
"step": 1129
|
|
},
|
|
{
|
|
"epoch": 1.3865030674846626,
|
|
"grad_norm": 14.123568665705431,
|
|
"learning_rate": 1.0867768595041321e-06,
|
|
"logits/chosen": 0.037109375,
|
|
"logits/rejected": -0.193359375,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0441,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.671875,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -15.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"epoch": 1.3877300613496932,
|
|
"grad_norm": 6.178909028368577,
|
|
"learning_rate": 1.0859504132231405e-06,
|
|
"logits/chosen": -0.2275390625,
|
|
"logits/rejected": -0.52734375,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.02,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.09375,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 1131
|
|
},
|
|
{
|
|
"epoch": 1.388957055214724,
|
|
"grad_norm": 10.805776636910203,
|
|
"learning_rate": 1.0851239669421487e-06,
|
|
"logits/chosen": -0.1279296875,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -512.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0368,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.09375,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1132
|
|
},
|
|
{
|
|
"epoch": 1.3901840490797546,
|
|
"grad_norm": 19.841864661673558,
|
|
"learning_rate": 1.084297520661157e-06,
|
|
"logits/chosen": -0.208984375,
|
|
"logits/rejected": -0.349609375,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.0922,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.2109375,
|
|
"rewards/margins": 13.625,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 1133
|
|
},
|
|
{
|
|
"epoch": 1.3914110429447852,
|
|
"grad_norm": 10.194863335887721,
|
|
"learning_rate": 1.083471074380165e-06,
|
|
"logits/chosen": -0.2001953125,
|
|
"logits/rejected": -0.416015625,
|
|
"logps/chosen": -346.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.0495,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -3.046875,
|
|
"rewards/margins": 11.0,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1134
|
|
},
|
|
{
|
|
"epoch": 1.392638036809816,
|
|
"grad_norm": 7.326038004027609,
|
|
"learning_rate": 1.0826446280991735e-06,
|
|
"logits/chosen": -0.14453125,
|
|
"logits/rejected": -0.341796875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.033,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.234375,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"epoch": 1.3938650306748466,
|
|
"grad_norm": 9.877857564056603,
|
|
"learning_rate": 1.0818181818181817e-06,
|
|
"logits/chosen": -0.294921875,
|
|
"logits/rejected": -0.451171875,
|
|
"logps/chosen": -484.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.0328,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.66796875,
|
|
"rewards/margins": 13.6875,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1136
|
|
},
|
|
{
|
|
"epoch": 1.3950920245398772,
|
|
"grad_norm": 13.659752886354067,
|
|
"learning_rate": 1.08099173553719e-06,
|
|
"logits/chosen": -0.232421875,
|
|
"logits/rejected": -0.484375,
|
|
"logps/chosen": -484.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0743,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.3046875,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 1137
|
|
},
|
|
{
|
|
"epoch": 1.396319018404908,
|
|
"grad_norm": 14.524155747469125,
|
|
"learning_rate": 1.0801652892561983e-06,
|
|
"logits/chosen": -0.04931640625,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0553,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.8203125,
|
|
"rewards/margins": 10.9375,
|
|
"rewards/rejected": -12.75,
|
|
"step": 1138
|
|
},
|
|
{
|
|
"epoch": 1.3975460122699386,
|
|
"grad_norm": 10.894448699490265,
|
|
"learning_rate": 1.0793388429752067e-06,
|
|
"logits/chosen": -0.1982421875,
|
|
"logits/rejected": -0.40625,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0446,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.28125,
|
|
"rewards/margins": 12.8125,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1139
|
|
},
|
|
{
|
|
"epoch": 1.3987730061349692,
|
|
"grad_norm": 15.91233768493971,
|
|
"learning_rate": 1.0785123966942149e-06,
|
|
"logits/chosen": -0.09814453125,
|
|
"logits/rejected": -0.2392578125,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0726,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.9140625,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"epoch": 1.4,
|
|
"grad_norm": 6.640740366705044,
|
|
"learning_rate": 1.0776859504132233e-06,
|
|
"logits/chosen": -0.1630859375,
|
|
"logits/rejected": -0.392578125,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0252,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.4375,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -12.8125,
|
|
"step": 1141
|
|
},
|
|
{
|
|
"epoch": 1.4012269938650306,
|
|
"grad_norm": 7.153198912223154,
|
|
"learning_rate": 1.0768595041322312e-06,
|
|
"logits/chosen": -0.046875,
|
|
"logits/rejected": -0.189453125,
|
|
"logps/chosen": -360.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0239,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.94921875,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 1142
|
|
},
|
|
{
|
|
"epoch": 1.4024539877300612,
|
|
"grad_norm": 9.642681019052885,
|
|
"learning_rate": 1.0760330578512396e-06,
|
|
"logits/chosen": -0.12109375,
|
|
"logits/rejected": -0.2451171875,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0358,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.171875,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1143
|
|
},
|
|
{
|
|
"epoch": 1.403680981595092,
|
|
"grad_norm": 14.227675253016205,
|
|
"learning_rate": 1.0752066115702478e-06,
|
|
"logits/chosen": -0.2431640625,
|
|
"logits/rejected": -0.3828125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0513,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.265625,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 1144
|
|
},
|
|
{
|
|
"epoch": 1.4049079754601226,
|
|
"grad_norm": 11.800571213742684,
|
|
"learning_rate": 1.0743801652892562e-06,
|
|
"logits/chosen": -0.140625,
|
|
"logits/rejected": -0.328125,
|
|
"logps/chosen": -472.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0427,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.625,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"epoch": 1.4061349693251532,
|
|
"grad_norm": 14.914551219811399,
|
|
"learning_rate": 1.0735537190082644e-06,
|
|
"logits/chosen": -0.0322265625,
|
|
"logits/rejected": -0.1572265625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.061,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.8359375,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1146
|
|
},
|
|
{
|
|
"epoch": 1.407361963190184,
|
|
"grad_norm": 6.858664975772462,
|
|
"learning_rate": 1.0727272727272726e-06,
|
|
"logits/chosen": -0.1513671875,
|
|
"logits/rejected": -0.35546875,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0241,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.5859375,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1147
|
|
},
|
|
{
|
|
"epoch": 1.4085889570552146,
|
|
"grad_norm": 10.962257082037691,
|
|
"learning_rate": 1.071900826446281e-06,
|
|
"logits/chosen": -0.072265625,
|
|
"logits/rejected": -0.2333984375,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0583,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.328125,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.125,
|
|
"step": 1148
|
|
},
|
|
{
|
|
"epoch": 1.4098159509202455,
|
|
"grad_norm": 6.794326014079488,
|
|
"learning_rate": 1.0710743801652892e-06,
|
|
"logits/chosen": -0.1279296875,
|
|
"logits/rejected": -0.30078125,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0196,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.5,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1149
|
|
},
|
|
{
|
|
"epoch": 1.4110429447852761,
|
|
"grad_norm": 9.508505178960478,
|
|
"learning_rate": 1.0702479338842976e-06,
|
|
"logits/chosen": -0.051513671875,
|
|
"logits/rejected": -0.2353515625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0448,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.21875,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"epoch": 1.4122699386503068,
|
|
"grad_norm": 5.663071454826858,
|
|
"learning_rate": 1.0694214876033056e-06,
|
|
"logits/chosen": -0.12060546875,
|
|
"logits/rejected": -0.318359375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0197,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.609375,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1151
|
|
},
|
|
{
|
|
"epoch": 1.4134969325153375,
|
|
"grad_norm": 9.091569922950566,
|
|
"learning_rate": 1.068595041322314e-06,
|
|
"logits/chosen": -0.1904296875,
|
|
"logits/rejected": -0.306640625,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.0319,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.65625,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1152
|
|
},
|
|
{
|
|
"epoch": 1.4147239263803681,
|
|
"grad_norm": 13.128211932921769,
|
|
"learning_rate": 1.0677685950413222e-06,
|
|
"logits/chosen": -0.1083984375,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0658,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.8671875,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1153
|
|
},
|
|
{
|
|
"epoch": 1.4159509202453988,
|
|
"grad_norm": 11.294169081027212,
|
|
"learning_rate": 1.0669421487603306e-06,
|
|
"logits/chosen": -0.1943359375,
|
|
"logits/rejected": -0.365234375,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.0473,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.76171875,
|
|
"rewards/margins": 13.875,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1154
|
|
},
|
|
{
|
|
"epoch": 1.4171779141104295,
|
|
"grad_norm": 12.509865559648775,
|
|
"learning_rate": 1.0661157024793387e-06,
|
|
"logits/chosen": -0.1865234375,
|
|
"logits/rejected": -0.306640625,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0541,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.515625,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"epoch": 1.4184049079754601,
|
|
"grad_norm": 9.578194633018429,
|
|
"learning_rate": 1.0652892561983471e-06,
|
|
"logits/chosen": -0.11181640625,
|
|
"logits/rejected": -0.376953125,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0308,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.64453125,
|
|
"rewards/margins": 13.6875,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1156
|
|
},
|
|
{
|
|
"epoch": 1.4196319018404908,
|
|
"grad_norm": 18.224674000278817,
|
|
"learning_rate": 1.0644628099173553e-06,
|
|
"logits/chosen": -0.1357421875,
|
|
"logits/rejected": -0.26953125,
|
|
"logps/chosen": -468.0,
|
|
"logps/rejected": -452.0,
|
|
"loss": 0.0601,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.69921875,
|
|
"rewards/margins": 13.0625,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1157
|
|
},
|
|
{
|
|
"epoch": 1.4208588957055215,
|
|
"grad_norm": 7.115474354709706,
|
|
"learning_rate": 1.0636363636363637e-06,
|
|
"logits/chosen": -0.1572265625,
|
|
"logits/rejected": -0.310546875,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0254,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.234375,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1158
|
|
},
|
|
{
|
|
"epoch": 1.4220858895705522,
|
|
"grad_norm": 15.973404988960032,
|
|
"learning_rate": 1.062809917355372e-06,
|
|
"logits/chosen": -0.10302734375,
|
|
"logits/rejected": -0.18359375,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0867,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.625,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -14.0625,
|
|
"step": 1159
|
|
},
|
|
{
|
|
"epoch": 1.4233128834355828,
|
|
"grad_norm": 14.365704372419215,
|
|
"learning_rate": 1.0619834710743801e-06,
|
|
"logits/chosen": -0.2265625,
|
|
"logits/rejected": -0.3984375,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.074,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.4453125,
|
|
"rewards/margins": 12.8125,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"epoch": 1.4245398773006135,
|
|
"grad_norm": 9.476208059624636,
|
|
"learning_rate": 1.0611570247933883e-06,
|
|
"logits/chosen": -0.0673828125,
|
|
"logits/rejected": -0.1923828125,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.104,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.9765625,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1161
|
|
},
|
|
{
|
|
"epoch": 1.4257668711656442,
|
|
"grad_norm": 9.6888401476112,
|
|
"learning_rate": 1.0603305785123967e-06,
|
|
"logits/chosen": -0.177734375,
|
|
"logits/rejected": -0.306640625,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0424,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.7734375,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1162
|
|
},
|
|
{
|
|
"epoch": 1.4269938650306748,
|
|
"grad_norm": 8.768687516162553,
|
|
"learning_rate": 1.0595041322314049e-06,
|
|
"logits/chosen": -0.26953125,
|
|
"logits/rejected": -0.5234375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0244,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.375,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -14.5,
|
|
"step": 1163
|
|
},
|
|
{
|
|
"epoch": 1.4282208588957055,
|
|
"grad_norm": 17.370413456407626,
|
|
"learning_rate": 1.058677685950413e-06,
|
|
"logits/chosen": -0.06591796875,
|
|
"logits/rejected": -0.10791015625,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0999,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1164
|
|
},
|
|
{
|
|
"epoch": 1.4294478527607362,
|
|
"grad_norm": 7.7047074063867464,
|
|
"learning_rate": 1.0578512396694215e-06,
|
|
"logits/chosen": -0.083984375,
|
|
"logits/rejected": -0.228515625,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.027,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.9140625,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"epoch": 1.4306748466257668,
|
|
"grad_norm": 13.14829439569346,
|
|
"learning_rate": 1.0570247933884297e-06,
|
|
"logits/chosen": -0.12255859375,
|
|
"logits/rejected": -0.36328125,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0317,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.546875,
|
|
"rewards/margins": 11.1875,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1166
|
|
},
|
|
{
|
|
"epoch": 1.4319018404907975,
|
|
"grad_norm": 3.67221489210726,
|
|
"learning_rate": 1.056198347107438e-06,
|
|
"logits/chosen": -0.1494140625,
|
|
"logits/rejected": -0.34375,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.011,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.71875,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -15.125,
|
|
"step": 1167
|
|
},
|
|
{
|
|
"epoch": 1.4331288343558282,
|
|
"grad_norm": 12.68303541143202,
|
|
"learning_rate": 1.0553719008264463e-06,
|
|
"logits/chosen": -0.12890625,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0602,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.59375,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -15.125,
|
|
"step": 1168
|
|
},
|
|
{
|
|
"epoch": 1.4343558282208588,
|
|
"grad_norm": 13.166789252257422,
|
|
"learning_rate": 1.0545454545454544e-06,
|
|
"logits/chosen": -0.055419921875,
|
|
"logits/rejected": -0.2197265625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0581,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.015625,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1169
|
|
},
|
|
{
|
|
"epoch": 1.4355828220858895,
|
|
"grad_norm": 10.122182839810499,
|
|
"learning_rate": 1.0537190082644626e-06,
|
|
"logits/chosen": -0.15625,
|
|
"logits/rejected": -0.412109375,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0439,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.703125,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"epoch": 1.4368098159509202,
|
|
"grad_norm": 12.28593650410948,
|
|
"learning_rate": 1.052892561983471e-06,
|
|
"logits/chosen": -0.10888671875,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0511,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.5703125,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1171
|
|
},
|
|
{
|
|
"epoch": 1.438036809815951,
|
|
"grad_norm": 16.416802043884378,
|
|
"learning_rate": 1.0520661157024792e-06,
|
|
"logits/chosen": -0.0281982421875,
|
|
"logits/rejected": -0.1533203125,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.071,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.671875,
|
|
"rewards/margins": 10.625,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1172
|
|
},
|
|
{
|
|
"epoch": 1.4392638036809817,
|
|
"grad_norm": 11.495432692757694,
|
|
"learning_rate": 1.0512396694214876e-06,
|
|
"logits/chosen": -0.109375,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -452.0,
|
|
"loss": 0.0411,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.796875,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1173
|
|
},
|
|
{
|
|
"epoch": 1.4404907975460124,
|
|
"grad_norm": 7.827933882471983,
|
|
"learning_rate": 1.0504132231404958e-06,
|
|
"logits/chosen": -0.11865234375,
|
|
"logits/rejected": -0.1474609375,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0169,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1174
|
|
},
|
|
{
|
|
"epoch": 1.441717791411043,
|
|
"grad_norm": 6.911761370873668,
|
|
"learning_rate": 1.0495867768595042e-06,
|
|
"logits/chosen": -0.0888671875,
|
|
"logits/rejected": -0.1630859375,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.038,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.5,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"epoch": 1.4429447852760737,
|
|
"grad_norm": 14.093934930652209,
|
|
"learning_rate": 1.0487603305785124e-06,
|
|
"logits/chosen": -0.171875,
|
|
"logits/rejected": -0.30078125,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.0594,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.609375,
|
|
"rewards/margins": 11.6875,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1176
|
|
},
|
|
{
|
|
"epoch": 1.4441717791411044,
|
|
"grad_norm": 11.398235074758908,
|
|
"learning_rate": 1.0479338842975208e-06,
|
|
"logits/chosen": -0.0250244140625,
|
|
"logits/rejected": -0.2236328125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.0362,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.9453125,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1177
|
|
},
|
|
{
|
|
"epoch": 1.445398773006135,
|
|
"grad_norm": 8.650828823930954,
|
|
"learning_rate": 1.0471074380165288e-06,
|
|
"logits/chosen": -0.1171875,
|
|
"logits/rejected": -0.333984375,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0318,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.65625,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1178
|
|
},
|
|
{
|
|
"epoch": 1.4466257668711657,
|
|
"grad_norm": 15.383094090660647,
|
|
"learning_rate": 1.0462809917355372e-06,
|
|
"logits/chosen": -0.2255859375,
|
|
"logits/rejected": -0.43359375,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0532,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.203125,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1179
|
|
},
|
|
{
|
|
"epoch": 1.4478527607361964,
|
|
"grad_norm": 5.966722490536281,
|
|
"learning_rate": 1.0454545454545454e-06,
|
|
"logits/chosen": -0.10400390625,
|
|
"logits/rejected": -0.15234375,
|
|
"logps/chosen": -360.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0232,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.5234375,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"epoch": 1.449079754601227,
|
|
"grad_norm": 7.062609195059248,
|
|
"learning_rate": 1.0446280991735538e-06,
|
|
"logits/chosen": -0.140625,
|
|
"logits/rejected": -0.275390625,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -464.0,
|
|
"loss": 0.0256,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.5625,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -13.25,
|
|
"step": 1181
|
|
},
|
|
{
|
|
"epoch": 1.4503067484662577,
|
|
"grad_norm": 8.984623434884268,
|
|
"learning_rate": 1.043801652892562e-06,
|
|
"logits/chosen": -0.08154296875,
|
|
"logits/rejected": -0.2314453125,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0394,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.09375,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1182
|
|
},
|
|
{
|
|
"epoch": 1.4515337423312884,
|
|
"grad_norm": 12.747447422128472,
|
|
"learning_rate": 1.0429752066115701e-06,
|
|
"logits/chosen": -0.111328125,
|
|
"logits/rejected": -0.1767578125,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0512,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.703125,
|
|
"rewards/margins": 11.1875,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 1183
|
|
},
|
|
{
|
|
"epoch": 1.452760736196319,
|
|
"grad_norm": 7.606005889724365,
|
|
"learning_rate": 1.0421487603305785e-06,
|
|
"logits/chosen": -0.126953125,
|
|
"logits/rejected": -0.33203125,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.0397,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.15625,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.125,
|
|
"step": 1184
|
|
},
|
|
{
|
|
"epoch": 1.4539877300613497,
|
|
"grad_norm": 10.21035569809519,
|
|
"learning_rate": 1.0413223140495867e-06,
|
|
"logits/chosen": -0.0167236328125,
|
|
"logits/rejected": -0.16796875,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0372,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.1171875,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.125,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"epoch": 1.4552147239263804,
|
|
"grad_norm": 11.435692772633331,
|
|
"learning_rate": 1.0404958677685951e-06,
|
|
"logits/chosen": -0.09228515625,
|
|
"logits/rejected": -0.248046875,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0579,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.5546875,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 1186
|
|
},
|
|
{
|
|
"epoch": 1.456441717791411,
|
|
"grad_norm": 9.387405560750024,
|
|
"learning_rate": 1.039669421487603e-06,
|
|
"logits/chosen": -0.11474609375,
|
|
"logits/rejected": -0.322265625,
|
|
"logps/chosen": -474.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.045,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.0,
|
|
"rewards/margins": 11.3125,
|
|
"rewards/rejected": -12.3125,
|
|
"step": 1187
|
|
},
|
|
{
|
|
"epoch": 1.4576687116564417,
|
|
"grad_norm": 15.569141511930194,
|
|
"learning_rate": 1.0388429752066115e-06,
|
|
"logits/chosen": -0.038818359375,
|
|
"logits/rejected": -0.1611328125,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -460.0,
|
|
"loss": 0.1006,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.4453125,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -12.875,
|
|
"step": 1188
|
|
},
|
|
{
|
|
"epoch": 1.4588957055214724,
|
|
"grad_norm": 11.43706799193642,
|
|
"learning_rate": 1.0380165289256197e-06,
|
|
"logits/chosen": -0.146484375,
|
|
"logits/rejected": -0.333984375,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0836,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.03125,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 1189
|
|
},
|
|
{
|
|
"epoch": 1.460122699386503,
|
|
"grad_norm": 8.525040760730164,
|
|
"learning_rate": 1.037190082644628e-06,
|
|
"logits/chosen": -0.154296875,
|
|
"logits/rejected": -0.37890625,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0359,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.453125,
|
|
"rewards/margins": 13.625,
|
|
"rewards/rejected": -14.0625,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"epoch": 1.4613496932515337,
|
|
"grad_norm": 11.626307215028127,
|
|
"learning_rate": 1.0363636363636363e-06,
|
|
"logits/chosen": 0.0279541015625,
|
|
"logits/rejected": -0.12353515625,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0389,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1484375,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1191
|
|
},
|
|
{
|
|
"epoch": 1.4625766871165644,
|
|
"grad_norm": 8.257653707089931,
|
|
"learning_rate": 1.0355371900826447e-06,
|
|
"logits/chosen": -0.09765625,
|
|
"logits/rejected": -0.27734375,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0314,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.25,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1192
|
|
},
|
|
{
|
|
"epoch": 1.463803680981595,
|
|
"grad_norm": 12.281186684503984,
|
|
"learning_rate": 1.0347107438016529e-06,
|
|
"logits/chosen": -0.166015625,
|
|
"logits/rejected": -0.3671875,
|
|
"logps/chosen": -470.0,
|
|
"logps/rejected": -474.0,
|
|
"loss": 0.0411,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.73046875,
|
|
"rewards/margins": 15.625,
|
|
"rewards/rejected": -16.375,
|
|
"step": 1193
|
|
},
|
|
{
|
|
"epoch": 1.4650306748466257,
|
|
"grad_norm": 4.313717676376673,
|
|
"learning_rate": 1.0338842975206613e-06,
|
|
"logits/chosen": -0.140625,
|
|
"logits/rejected": -0.26953125,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0125,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.265625,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 1194
|
|
},
|
|
{
|
|
"epoch": 1.4662576687116564,
|
|
"grad_norm": 13.88877509717408,
|
|
"learning_rate": 1.0330578512396692e-06,
|
|
"logits/chosen": -0.11767578125,
|
|
"logits/rejected": -0.2373046875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0466,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.59375,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"epoch": 1.467484662576687,
|
|
"grad_norm": 12.964619413353676,
|
|
"learning_rate": 1.0322314049586776e-06,
|
|
"logits/chosen": -0.02783203125,
|
|
"logits/rejected": -0.158203125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0487,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.78125,
|
|
"rewards/margins": 10.6875,
|
|
"rewards/rejected": -12.5,
|
|
"step": 1196
|
|
},
|
|
{
|
|
"epoch": 1.4687116564417177,
|
|
"grad_norm": 16.143742441817903,
|
|
"learning_rate": 1.0314049586776858e-06,
|
|
"logits/chosen": -0.041748046875,
|
|
"logits/rejected": -0.228515625,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0678,
|
|
"rewards/accuracies": 0.953125,
|
|
"rewards/chosen": -1.953125,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1197
|
|
},
|
|
{
|
|
"epoch": 1.4699386503067484,
|
|
"grad_norm": 9.55388473183669,
|
|
"learning_rate": 1.0305785123966942e-06,
|
|
"logits/chosen": 0.0269775390625,
|
|
"logits/rejected": -0.1298828125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0492,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.921875,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -13.375,
|
|
"step": 1198
|
|
},
|
|
{
|
|
"epoch": 1.471165644171779,
|
|
"grad_norm": 14.139992024133479,
|
|
"learning_rate": 1.0297520661157024e-06,
|
|
"logits/chosen": -0.203125,
|
|
"logits/rejected": -0.376953125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0408,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1484375,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1199
|
|
},
|
|
{
|
|
"epoch": 1.4723926380368098,
|
|
"grad_norm": 9.626395290959188,
|
|
"learning_rate": 1.0289256198347106e-06,
|
|
"logits/chosen": -0.138671875,
|
|
"logits/rejected": -0.3046875,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0258,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.046875,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"epoch": 1.4736196319018404,
|
|
"grad_norm": 16.075503296089575,
|
|
"learning_rate": 1.028099173553719e-06,
|
|
"logits/chosen": -0.048095703125,
|
|
"logits/rejected": -0.197265625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0545,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.046875,
|
|
"rewards/margins": 11.6875,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1201
|
|
},
|
|
{
|
|
"epoch": 1.474846625766871,
|
|
"grad_norm": 15.592021837628844,
|
|
"learning_rate": 1.0272727272727272e-06,
|
|
"logits/chosen": -0.138671875,
|
|
"logits/rejected": -0.28515625,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0587,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.3515625,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1202
|
|
},
|
|
{
|
|
"epoch": 1.4760736196319018,
|
|
"grad_norm": 6.45016518360233,
|
|
"learning_rate": 1.0264462809917356e-06,
|
|
"logits/chosen": -0.2392578125,
|
|
"logits/rejected": -0.421875,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0372,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.46875,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1203
|
|
},
|
|
{
|
|
"epoch": 1.4773006134969324,
|
|
"grad_norm": 8.846408526453407,
|
|
"learning_rate": 1.0256198347107436e-06,
|
|
"logits/chosen": -0.07861328125,
|
|
"logits/rejected": -0.3125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0291,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.2890625,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1204
|
|
},
|
|
{
|
|
"epoch": 1.478527607361963,
|
|
"grad_norm": 16.10058807172318,
|
|
"learning_rate": 1.024793388429752e-06,
|
|
"logits/chosen": 0.036865234375,
|
|
"logits/rejected": -0.201171875,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0824,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.09375,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"epoch": 1.4797546012269938,
|
|
"grad_norm": 6.469506353472691,
|
|
"learning_rate": 1.0239669421487602e-06,
|
|
"logits/chosen": -0.010498046875,
|
|
"logits/rejected": -0.30078125,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.0358,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.8828125,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -13.125,
|
|
"step": 1206
|
|
},
|
|
{
|
|
"epoch": 1.4809815950920244,
|
|
"grad_norm": 9.780191610021085,
|
|
"learning_rate": 1.0231404958677686e-06,
|
|
"logits/chosen": -0.0791015625,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0336,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.015625,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1207
|
|
},
|
|
{
|
|
"epoch": 1.482208588957055,
|
|
"grad_norm": 10.486888457679001,
|
|
"learning_rate": 1.0223140495867768e-06,
|
|
"logits/chosen": -0.0859375,
|
|
"logits/rejected": -0.25,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0548,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.078125,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1208
|
|
},
|
|
{
|
|
"epoch": 1.4834355828220858,
|
|
"grad_norm": 10.047817635797577,
|
|
"learning_rate": 1.0214876033057852e-06,
|
|
"logits/chosen": -0.06005859375,
|
|
"logits/rejected": -0.2421875,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0579,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.140625,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1209
|
|
},
|
|
{
|
|
"epoch": 1.4846625766871164,
|
|
"grad_norm": 13.308086407088918,
|
|
"learning_rate": 1.0206611570247933e-06,
|
|
"logits/chosen": -0.01019287109375,
|
|
"logits/rejected": -0.16796875,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0481,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.453125,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"epoch": 1.4858895705521473,
|
|
"grad_norm": 9.41424461600161,
|
|
"learning_rate": 1.0198347107438017e-06,
|
|
"logits/chosen": -0.037353515625,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.023,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.953125,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1211
|
|
},
|
|
{
|
|
"epoch": 1.487116564417178,
|
|
"grad_norm": 8.327167588802823,
|
|
"learning_rate": 1.01900826446281e-06,
|
|
"logits/chosen": -0.1474609375,
|
|
"logits/rejected": -0.2578125,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0302,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.15625,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1212
|
|
},
|
|
{
|
|
"epoch": 1.4883435582822087,
|
|
"grad_norm": 13.15092274885723,
|
|
"learning_rate": 1.0181818181818181e-06,
|
|
"logits/chosen": -0.13671875,
|
|
"logits/rejected": -0.3984375,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0511,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.1171875,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1213
|
|
},
|
|
{
|
|
"epoch": 1.4895705521472393,
|
|
"grad_norm": 9.065357608147506,
|
|
"learning_rate": 1.0173553719008263e-06,
|
|
"logits/chosen": -0.0869140625,
|
|
"logits/rejected": -0.216796875,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0404,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.203125,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -14.0625,
|
|
"step": 1214
|
|
},
|
|
{
|
|
"epoch": 1.49079754601227,
|
|
"grad_norm": 14.293577666490417,
|
|
"learning_rate": 1.0165289256198347e-06,
|
|
"logits/chosen": -0.146484375,
|
|
"logits/rejected": -0.369140625,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0539,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1796875,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.5,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"epoch": 1.4920245398773007,
|
|
"grad_norm": 8.39168826799615,
|
|
"learning_rate": 1.0157024793388429e-06,
|
|
"logits/chosen": -0.099609375,
|
|
"logits/rejected": -0.146484375,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.028,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.359375,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1216
|
|
},
|
|
{
|
|
"epoch": 1.4932515337423313,
|
|
"grad_norm": 11.106412166909418,
|
|
"learning_rate": 1.0148760330578513e-06,
|
|
"logits/chosen": -0.10986328125,
|
|
"logits/rejected": -0.232421875,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0318,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.796875,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1217
|
|
},
|
|
{
|
|
"epoch": 1.494478527607362,
|
|
"grad_norm": 12.063242433285243,
|
|
"learning_rate": 1.0140495867768595e-06,
|
|
"logits/chosen": -0.0164794921875,
|
|
"logits/rejected": -0.1923828125,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0455,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.921875,
|
|
"rewards/margins": 10.75,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1218
|
|
},
|
|
{
|
|
"epoch": 1.4957055214723927,
|
|
"grad_norm": 13.89389372851753,
|
|
"learning_rate": 1.0132231404958677e-06,
|
|
"logits/chosen": -0.1171875,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0554,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.8046875,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1219
|
|
},
|
|
{
|
|
"epoch": 1.4969325153374233,
|
|
"grad_norm": 12.017753208964738,
|
|
"learning_rate": 1.012396694214876e-06,
|
|
"logits/chosen": -0.140625,
|
|
"logits/rejected": -0.2333984375,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.0476,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.046875,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"epoch": 1.498159509202454,
|
|
"grad_norm": 10.473250772416604,
|
|
"learning_rate": 1.0115702479338843e-06,
|
|
"logits/chosen": -0.169921875,
|
|
"logits/rejected": -0.33203125,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0379,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.25,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 1221
|
|
},
|
|
{
|
|
"epoch": 1.4993865030674847,
|
|
"grad_norm": 8.317899279262472,
|
|
"learning_rate": 1.0107438016528924e-06,
|
|
"logits/chosen": -0.0556640625,
|
|
"logits/rejected": -0.232421875,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0388,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.40625,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1222
|
|
},
|
|
{
|
|
"epoch": 1.5006134969325153,
|
|
"grad_norm": 7.618560046103496,
|
|
"learning_rate": 1.0099173553719006e-06,
|
|
"logits/chosen": -0.07275390625,
|
|
"logits/rejected": -0.20703125,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0242,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.140625,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1223
|
|
},
|
|
{
|
|
"epoch": 1.501840490797546,
|
|
"grad_norm": 10.163884901417632,
|
|
"learning_rate": 1.009090909090909e-06,
|
|
"logits/chosen": -0.0556640625,
|
|
"logits/rejected": -0.1591796875,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.056,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.671875,
|
|
"rewards/margins": 10.5625,
|
|
"rewards/rejected": -13.25,
|
|
"step": 1224
|
|
},
|
|
{
|
|
"epoch": 1.5030674846625767,
|
|
"grad_norm": 6.709949597185231,
|
|
"learning_rate": 1.0082644628099172e-06,
|
|
"logits/chosen": -0.053466796875,
|
|
"logits/rejected": -0.185546875,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.027,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.9765625,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -13.375,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"epoch": 1.5042944785276073,
|
|
"grad_norm": 11.335768851255144,
|
|
"learning_rate": 1.0074380165289256e-06,
|
|
"logits/chosen": -0.126953125,
|
|
"logits/rejected": -0.3125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0523,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.09375,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1226
|
|
},
|
|
{
|
|
"epoch": 1.505521472392638,
|
|
"grad_norm": 10.294381533365499,
|
|
"learning_rate": 1.0066115702479338e-06,
|
|
"logits/chosen": -0.29296875,
|
|
"logits/rejected": -0.369140625,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.029,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.25,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1227
|
|
},
|
|
{
|
|
"epoch": 1.5067484662576687,
|
|
"grad_norm": 20.051676248124764,
|
|
"learning_rate": 1.0057851239669422e-06,
|
|
"logits/chosen": -0.1025390625,
|
|
"logits/rejected": -0.20703125,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0986,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.046875,
|
|
"rewards/margins": 11.125,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1228
|
|
},
|
|
{
|
|
"epoch": 1.5079754601226993,
|
|
"grad_norm": 5.70876551224663,
|
|
"learning_rate": 1.0049586776859504e-06,
|
|
"logits/chosen": -0.1962890625,
|
|
"logits/rejected": -0.31640625,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0221,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.78125,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1229
|
|
},
|
|
{
|
|
"epoch": 1.50920245398773,
|
|
"grad_norm": 11.620088040403106,
|
|
"learning_rate": 1.0041322314049588e-06,
|
|
"logits/chosen": -0.0830078125,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0488,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.484375,
|
|
"rewards/margins": 11.3125,
|
|
"rewards/rejected": -12.75,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"epoch": 1.510429447852761,
|
|
"grad_norm": 14.466395056240852,
|
|
"learning_rate": 1.0033057851239668e-06,
|
|
"logits/chosen": -0.0201416015625,
|
|
"logits/rejected": -0.189453125,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.0443,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.71875,
|
|
"rewards/margins": 10.9375,
|
|
"rewards/rejected": -12.625,
|
|
"step": 1231
|
|
},
|
|
{
|
|
"epoch": 1.5116564417177916,
|
|
"grad_norm": 9.476481447528245,
|
|
"learning_rate": 1.0024793388429752e-06,
|
|
"logits/chosen": -0.267578125,
|
|
"logits/rejected": -0.458984375,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0247,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.92578125,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1232
|
|
},
|
|
{
|
|
"epoch": 1.5128834355828222,
|
|
"grad_norm": 4.234590504273159,
|
|
"learning_rate": 1.0016528925619834e-06,
|
|
"logits/chosen": -0.1689453125,
|
|
"logits/rejected": -0.35546875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0139,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.8359375,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1233
|
|
},
|
|
{
|
|
"epoch": 1.514110429447853,
|
|
"grad_norm": 18.011746894539794,
|
|
"learning_rate": 1.0008264462809918e-06,
|
|
"logits/chosen": -0.09814453125,
|
|
"logits/rejected": -0.296875,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0876,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.1484375,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 1234
|
|
},
|
|
{
|
|
"epoch": 1.5153374233128836,
|
|
"grad_norm": 8.82857831183976,
|
|
"learning_rate": 1e-06,
|
|
"logits/chosen": -0.0208740234375,
|
|
"logits/rejected": -0.1689453125,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0237,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.71875,
|
|
"rewards/margins": 11.0,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"epoch": 1.5165644171779142,
|
|
"grad_norm": 11.767641629473584,
|
|
"learning_rate": 9.991735537190081e-07,
|
|
"logits/chosen": -0.10498046875,
|
|
"logits/rejected": -0.28125,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0513,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.8671875,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 1236
|
|
},
|
|
{
|
|
"epoch": 1.517791411042945,
|
|
"grad_norm": 18.38939401821609,
|
|
"learning_rate": 9.983471074380165e-07,
|
|
"logits/chosen": -0.22265625,
|
|
"logits/rejected": -0.38671875,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0772,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.5546875,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 1237
|
|
},
|
|
{
|
|
"epoch": 1.5190184049079756,
|
|
"grad_norm": 7.197558238265637,
|
|
"learning_rate": 9.975206611570247e-07,
|
|
"logits/chosen": -0.038330078125,
|
|
"logits/rejected": -0.1953125,
|
|
"logps/chosen": -482.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0262,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1015625,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1238
|
|
},
|
|
{
|
|
"epoch": 1.5202453987730062,
|
|
"grad_norm": 15.662388417998418,
|
|
"learning_rate": 9.96694214876033e-07,
|
|
"logits/chosen": -0.1669921875,
|
|
"logits/rejected": -0.3828125,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0601,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.7265625,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1239
|
|
},
|
|
{
|
|
"epoch": 1.521472392638037,
|
|
"grad_norm": 6.277183773852738,
|
|
"learning_rate": 9.958677685950413e-07,
|
|
"logits/chosen": -0.050048828125,
|
|
"logits/rejected": -0.2490234375,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0306,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.125,
|
|
"rewards/margins": 11.3125,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"epoch": 1.5226993865030676,
|
|
"grad_norm": 9.884741573105416,
|
|
"learning_rate": 9.950413223140495e-07,
|
|
"logits/chosen": 0.01123046875,
|
|
"logits/rejected": -0.1474609375,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0518,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.5,
|
|
"rewards/margins": 10.75,
|
|
"rewards/rejected": -13.25,
|
|
"step": 1241
|
|
},
|
|
{
|
|
"epoch": 1.5239263803680982,
|
|
"grad_norm": 11.061419272154637,
|
|
"learning_rate": 9.942148760330577e-07,
|
|
"logits/chosen": -0.2353515625,
|
|
"logits/rejected": -0.404296875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0568,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.125,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1242
|
|
},
|
|
{
|
|
"epoch": 1.525153374233129,
|
|
"grad_norm": 8.704895919155105,
|
|
"learning_rate": 9.93388429752066e-07,
|
|
"logits/chosen": -0.0211181640625,
|
|
"logits/rejected": -0.1865234375,
|
|
"logps/chosen": -352.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.033,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.578125,
|
|
"rewards/margins": 10.8125,
|
|
"rewards/rejected": -13.375,
|
|
"step": 1243
|
|
},
|
|
{
|
|
"epoch": 1.5263803680981596,
|
|
"grad_norm": 4.709489142754261,
|
|
"learning_rate": 9.925619834710743e-07,
|
|
"logits/chosen": -0.01324462890625,
|
|
"logits/rejected": -0.10986328125,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0189,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.484375,
|
|
"rewards/margins": 10.8125,
|
|
"rewards/rejected": -13.25,
|
|
"step": 1244
|
|
},
|
|
{
|
|
"epoch": 1.5276073619631902,
|
|
"grad_norm": 15.627733749459543,
|
|
"learning_rate": 9.917355371900827e-07,
|
|
"logits/chosen": -0.068359375,
|
|
"logits/rejected": -0.26953125,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0628,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.8828125,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"epoch": 1.528834355828221,
|
|
"grad_norm": 9.822569951010871,
|
|
"learning_rate": 9.909090909090909e-07,
|
|
"logits/chosen": -0.201171875,
|
|
"logits/rejected": -0.373046875,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.0456,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.4296875,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 1246
|
|
},
|
|
{
|
|
"epoch": 1.5300613496932516,
|
|
"grad_norm": 11.126202025567135,
|
|
"learning_rate": 9.90082644628099e-07,
|
|
"logits/chosen": -0.1513671875,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0242,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.234375,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1247
|
|
},
|
|
{
|
|
"epoch": 1.5312883435582823,
|
|
"grad_norm": 11.372498906055963,
|
|
"learning_rate": 9.892561983471075e-07,
|
|
"logits/chosen": -0.1123046875,
|
|
"logits/rejected": -0.30078125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0361,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.9609375,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 1248
|
|
},
|
|
{
|
|
"epoch": 1.532515337423313,
|
|
"grad_norm": 9.495687690026228,
|
|
"learning_rate": 9.884297520661157e-07,
|
|
"logits/chosen": 0.07861328125,
|
|
"logits/rejected": -0.025146484375,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0421,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.25,
|
|
"rewards/margins": 11.6875,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1249
|
|
},
|
|
{
|
|
"epoch": 1.5337423312883436,
|
|
"grad_norm": 9.429046291035485,
|
|
"learning_rate": 9.87603305785124e-07,
|
|
"logits/chosen": -0.2041015625,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -486.0,
|
|
"loss": 0.0275,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.65234375,
|
|
"rewards/margins": 13.5625,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"epoch": 1.5349693251533743,
|
|
"grad_norm": 12.639866145919319,
|
|
"learning_rate": 9.867768595041322e-07,
|
|
"logits/chosen": -0.25,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.039,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.015625,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.0625,
|
|
"step": 1251
|
|
},
|
|
{
|
|
"epoch": 1.536196319018405,
|
|
"grad_norm": 8.764497938959002,
|
|
"learning_rate": 9.859504132231404e-07,
|
|
"logits/chosen": -0.1435546875,
|
|
"logits/rejected": -0.314453125,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.0401,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.1171875,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1252
|
|
},
|
|
{
|
|
"epoch": 1.5374233128834356,
|
|
"grad_norm": 9.43151117319145,
|
|
"learning_rate": 9.851239669421486e-07,
|
|
"logits/chosen": -0.1328125,
|
|
"logits/rejected": -0.294921875,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0311,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.3828125,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 1253
|
|
},
|
|
{
|
|
"epoch": 1.5386503067484663,
|
|
"grad_norm": 12.118961622207411,
|
|
"learning_rate": 9.84297520661157e-07,
|
|
"logits/chosen": -0.03076171875,
|
|
"logits/rejected": -0.1689453125,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0481,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.4375,
|
|
"rewards/margins": 11.1875,
|
|
"rewards/rejected": -12.625,
|
|
"step": 1254
|
|
},
|
|
{
|
|
"epoch": 1.539877300613497,
|
|
"grad_norm": 8.772127224796138,
|
|
"learning_rate": 9.834710743801652e-07,
|
|
"logits/chosen": -0.1826171875,
|
|
"logits/rejected": -0.40625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -452.0,
|
|
"loss": 0.028,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.88671875,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"epoch": 1.5411042944785276,
|
|
"grad_norm": 13.866956631534878,
|
|
"learning_rate": 9.826446280991734e-07,
|
|
"logits/chosen": -0.09423828125,
|
|
"logits/rejected": -0.310546875,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0354,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.75,
|
|
"rewards/margins": 10.875,
|
|
"rewards/rejected": -12.625,
|
|
"step": 1256
|
|
},
|
|
{
|
|
"epoch": 1.5423312883435583,
|
|
"grad_norm": 11.245467613343983,
|
|
"learning_rate": 9.818181818181818e-07,
|
|
"logits/chosen": -0.05224609375,
|
|
"logits/rejected": -0.24609375,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0428,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.828125,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1257
|
|
},
|
|
{
|
|
"epoch": 1.543558282208589,
|
|
"grad_norm": 8.292880493914762,
|
|
"learning_rate": 9.8099173553719e-07,
|
|
"logits/chosen": -0.09814453125,
|
|
"logits/rejected": -0.306640625,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0313,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.9375,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 1258
|
|
},
|
|
{
|
|
"epoch": 1.5447852760736196,
|
|
"grad_norm": 15.243061529529134,
|
|
"learning_rate": 9.801652892561984e-07,
|
|
"logits/chosen": -0.099609375,
|
|
"logits/rejected": -0.341796875,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0676,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.4453125,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 1259
|
|
},
|
|
{
|
|
"epoch": 1.5460122699386503,
|
|
"grad_norm": 10.577241635378371,
|
|
"learning_rate": 9.793388429752066e-07,
|
|
"logits/chosen": -0.1669921875,
|
|
"logits/rejected": -0.34375,
|
|
"logps/chosen": -466.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0359,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.7578125,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"epoch": 1.547239263803681,
|
|
"grad_norm": 12.83289975558173,
|
|
"learning_rate": 9.785123966942148e-07,
|
|
"logits/chosen": -0.228515625,
|
|
"logits/rejected": -0.353515625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0678,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.6484375,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 1261
|
|
},
|
|
{
|
|
"epoch": 1.5484662576687116,
|
|
"grad_norm": 8.912075287643129,
|
|
"learning_rate": 9.776859504132232e-07,
|
|
"logits/chosen": -0.1533203125,
|
|
"logits/rejected": -0.33984375,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0324,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.96875,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1262
|
|
},
|
|
{
|
|
"epoch": 1.5496932515337423,
|
|
"grad_norm": 8.426880917372406,
|
|
"learning_rate": 9.768595041322313e-07,
|
|
"logits/chosen": -0.09716796875,
|
|
"logits/rejected": -0.310546875,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0322,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.3203125,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 1263
|
|
},
|
|
{
|
|
"epoch": 1.550920245398773,
|
|
"grad_norm": 19.715550992495395,
|
|
"learning_rate": 9.760330578512395e-07,
|
|
"logits/chosen": -0.028076171875,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.1062,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.53125,
|
|
"rewards/margins": 10.8125,
|
|
"rewards/rejected": -13.375,
|
|
"step": 1264
|
|
},
|
|
{
|
|
"epoch": 1.5521472392638036,
|
|
"grad_norm": 8.875641717471945,
|
|
"learning_rate": 9.75206611570248e-07,
|
|
"logits/chosen": -0.1767578125,
|
|
"logits/rejected": -0.35546875,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0312,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.890625,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"epoch": 1.5533742331288343,
|
|
"grad_norm": 7.232895661850965,
|
|
"learning_rate": 9.743801652892561e-07,
|
|
"logits/chosen": -0.2099609375,
|
|
"logits/rejected": -0.302734375,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0189,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.890625,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -13.375,
|
|
"step": 1266
|
|
},
|
|
{
|
|
"epoch": 1.554601226993865,
|
|
"grad_norm": 16.09377763932608,
|
|
"learning_rate": 9.735537190082645e-07,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.0977,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.8125,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1267
|
|
},
|
|
{
|
|
"epoch": 1.5558282208588956,
|
|
"grad_norm": 19.10859135550339,
|
|
"learning_rate": 9.727272727272727e-07,
|
|
"logits/chosen": -0.1474609375,
|
|
"logits/rejected": -0.26171875,
|
|
"logps/chosen": -520.0,
|
|
"logps/rejected": -456.0,
|
|
"loss": 0.0853,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.4609375,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1268
|
|
},
|
|
{
|
|
"epoch": 1.5570552147239263,
|
|
"grad_norm": 5.568010791740834,
|
|
"learning_rate": 9.71900826446281e-07,
|
|
"logits/chosen": -0.1826171875,
|
|
"logits/rejected": -0.31640625,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0168,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.96484375,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 1269
|
|
},
|
|
{
|
|
"epoch": 1.558282208588957,
|
|
"grad_norm": 12.468368113698983,
|
|
"learning_rate": 9.710743801652893e-07,
|
|
"logits/chosen": -0.169921875,
|
|
"logits/rejected": -0.2265625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0367,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.6640625,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"epoch": 1.5595092024539876,
|
|
"grad_norm": 20.597813871094168,
|
|
"learning_rate": 9.702479338842975e-07,
|
|
"logits/chosen": -0.08056640625,
|
|
"logits/rejected": -0.1708984375,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.1063,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.53125,
|
|
"rewards/margins": 11.6875,
|
|
"rewards/rejected": -13.25,
|
|
"step": 1271
|
|
},
|
|
{
|
|
"epoch": 1.5607361963190183,
|
|
"grad_norm": 11.091131952158705,
|
|
"learning_rate": 9.694214876033057e-07,
|
|
"logits/chosen": -0.255859375,
|
|
"logits/rejected": -0.416015625,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0393,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.07177734375,
|
|
"rewards/margins": 14.0,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1272
|
|
},
|
|
{
|
|
"epoch": 1.561963190184049,
|
|
"grad_norm": 11.360447287761163,
|
|
"learning_rate": 9.685950413223139e-07,
|
|
"logits/chosen": -0.2060546875,
|
|
"logits/rejected": -0.3046875,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0664,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.5234375,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1273
|
|
},
|
|
{
|
|
"epoch": 1.5631901840490796,
|
|
"grad_norm": 4.637651986819552,
|
|
"learning_rate": 9.677685950413223e-07,
|
|
"logits/chosen": -0.3125,
|
|
"logits/rejected": -0.5078125,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0127,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.4609375,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1274
|
|
},
|
|
{
|
|
"epoch": 1.5644171779141103,
|
|
"grad_norm": 14.1119790875733,
|
|
"learning_rate": 9.669421487603305e-07,
|
|
"logits/chosen": -0.1005859375,
|
|
"logits/rejected": -0.26171875,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.088,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.890625,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"epoch": 1.565644171779141,
|
|
"grad_norm": 12.939584595920241,
|
|
"learning_rate": 9.661157024793389e-07,
|
|
"logits/chosen": -0.005859375,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0766,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.4609375,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1276
|
|
},
|
|
{
|
|
"epoch": 1.5668711656441716,
|
|
"grad_norm": 7.363791473461773,
|
|
"learning_rate": 9.65289256198347e-07,
|
|
"logits/chosen": -0.1669921875,
|
|
"logits/rejected": -0.302734375,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0313,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.65625,
|
|
"rewards/margins": 10.9375,
|
|
"rewards/rejected": -12.625,
|
|
"step": 1277
|
|
},
|
|
{
|
|
"epoch": 1.5680981595092025,
|
|
"grad_norm": 6.582521820083355,
|
|
"learning_rate": 9.644628099173552e-07,
|
|
"logits/chosen": -0.1357421875,
|
|
"logits/rejected": -0.3515625,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0189,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.43359375,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1278
|
|
},
|
|
{
|
|
"epoch": 1.5693251533742332,
|
|
"grad_norm": 9.590189078550395,
|
|
"learning_rate": 9.636363636363636e-07,
|
|
"logits/chosen": -0.1474609375,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0394,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.3515625,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -12.875,
|
|
"step": 1279
|
|
},
|
|
{
|
|
"epoch": 1.5705521472392638,
|
|
"grad_norm": 11.52653510111759,
|
|
"learning_rate": 9.628099173553718e-07,
|
|
"logits/chosen": -0.2099609375,
|
|
"logits/rejected": -0.337890625,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0301,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.5546875,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"epoch": 1.5717791411042945,
|
|
"grad_norm": 10.705339949228822,
|
|
"learning_rate": 9.619834710743802e-07,
|
|
"logits/chosen": -0.2021484375,
|
|
"logits/rejected": -0.365234375,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.0739,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.0322265625,
|
|
"rewards/margins": 13.4375,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1281
|
|
},
|
|
{
|
|
"epoch": 1.5730061349693252,
|
|
"grad_norm": 7.914232376096601,
|
|
"learning_rate": 9.611570247933884e-07,
|
|
"logits/chosen": 0.0810546875,
|
|
"logits/rejected": -0.1611328125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0279,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.296875,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1282
|
|
},
|
|
{
|
|
"epoch": 1.5742331288343558,
|
|
"grad_norm": 9.2263736657431,
|
|
"learning_rate": 9.603305785123966e-07,
|
|
"logits/chosen": 0.0341796875,
|
|
"logits/rejected": -0.08203125,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0377,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.265625,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 1283
|
|
},
|
|
{
|
|
"epoch": 1.5754601226993865,
|
|
"grad_norm": 9.58838328282707,
|
|
"learning_rate": 9.59504132231405e-07,
|
|
"logits/chosen": -0.0272216796875,
|
|
"logits/rejected": -0.2119140625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0599,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.2734375,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1284
|
|
},
|
|
{
|
|
"epoch": 1.5766871165644172,
|
|
"grad_norm": 11.937185182948856,
|
|
"learning_rate": 9.586776859504132e-07,
|
|
"logits/chosen": -0.09130859375,
|
|
"logits/rejected": -0.341796875,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0677,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.21875,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"epoch": 1.5779141104294478,
|
|
"grad_norm": 13.463301558454244,
|
|
"learning_rate": 9.578512396694216e-07,
|
|
"logits/chosen": -0.032958984375,
|
|
"logits/rejected": -0.2294921875,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.0448,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.5703125,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1286
|
|
},
|
|
{
|
|
"epoch": 1.5791411042944785,
|
|
"grad_norm": 11.56864577031034,
|
|
"learning_rate": 9.570247933884298e-07,
|
|
"logits/chosen": -0.12890625,
|
|
"logits/rejected": -0.208984375,
|
|
"logps/chosen": -338.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0508,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.25,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1287
|
|
},
|
|
{
|
|
"epoch": 1.5803680981595092,
|
|
"grad_norm": 9.552370361542511,
|
|
"learning_rate": 9.56198347107438e-07,
|
|
"logits/chosen": -0.1875,
|
|
"logits/rejected": -0.36328125,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0358,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.96484375,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1288
|
|
},
|
|
{
|
|
"epoch": 1.5815950920245399,
|
|
"grad_norm": 7.192440609380427,
|
|
"learning_rate": 9.553719008264462e-07,
|
|
"logits/chosen": -0.04296875,
|
|
"logits/rejected": -0.1904296875,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -364.0,
|
|
"loss": 0.0376,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.09375,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1289
|
|
},
|
|
{
|
|
"epoch": 1.5828220858895705,
|
|
"grad_norm": 8.915549893521046,
|
|
"learning_rate": 9.545454545454546e-07,
|
|
"logits/chosen": -0.1962890625,
|
|
"logits/rejected": -0.3671875,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0269,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.515625,
|
|
"rewards/margins": 13.75,
|
|
"rewards/rejected": -15.25,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"epoch": 1.5840490797546012,
|
|
"grad_norm": 4.9086913682593485,
|
|
"learning_rate": 9.537190082644627e-07,
|
|
"logits/chosen": -0.06396484375,
|
|
"logits/rejected": -0.177734375,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.0153,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.671875,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1291
|
|
},
|
|
{
|
|
"epoch": 1.5852760736196319,
|
|
"grad_norm": 6.3611459828522605,
|
|
"learning_rate": 9.52892561983471e-07,
|
|
"logits/chosen": -0.2236328125,
|
|
"logits/rejected": -0.333984375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.023,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.828125,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1292
|
|
},
|
|
{
|
|
"epoch": 1.5865030674846625,
|
|
"grad_norm": 10.387641657005787,
|
|
"learning_rate": 9.520661157024793e-07,
|
|
"logits/chosen": 0.0224609375,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0262,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.3203125,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1293
|
|
},
|
|
{
|
|
"epoch": 1.5877300613496934,
|
|
"grad_norm": 2.6296997510598374,
|
|
"learning_rate": 9.512396694214876e-07,
|
|
"logits/chosen": -0.0810546875,
|
|
"logits/rejected": -0.275390625,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0087,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.65625,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -15.0,
|
|
"step": 1294
|
|
},
|
|
{
|
|
"epoch": 1.588957055214724,
|
|
"grad_norm": 5.31648524230237,
|
|
"learning_rate": 9.504132231404959e-07,
|
|
"logits/chosen": -0.22265625,
|
|
"logits/rejected": -0.41796875,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.028,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.9453125,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"epoch": 1.5901840490797547,
|
|
"grad_norm": 16.24397472242787,
|
|
"learning_rate": 9.495867768595041e-07,
|
|
"logits/chosen": -0.099609375,
|
|
"logits/rejected": -0.1826171875,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0801,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.859375,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -14.875,
|
|
"step": 1296
|
|
},
|
|
{
|
|
"epoch": 1.5914110429447854,
|
|
"grad_norm": 12.833234825790893,
|
|
"learning_rate": 9.487603305785124e-07,
|
|
"logits/chosen": -0.01007080078125,
|
|
"logits/rejected": -0.1787109375,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0357,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.703125,
|
|
"rewards/margins": 10.5625,
|
|
"rewards/rejected": -13.25,
|
|
"step": 1297
|
|
},
|
|
{
|
|
"epoch": 1.592638036809816,
|
|
"grad_norm": 14.008944130190512,
|
|
"learning_rate": 9.479338842975206e-07,
|
|
"logits/chosen": -0.047119140625,
|
|
"logits/rejected": -0.169921875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0553,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.6640625,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1298
|
|
},
|
|
{
|
|
"epoch": 1.5938650306748468,
|
|
"grad_norm": 16.43406113725855,
|
|
"learning_rate": 9.471074380165289e-07,
|
|
"logits/chosen": -0.1728515625,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0838,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.203125,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1299
|
|
},
|
|
{
|
|
"epoch": 1.5950920245398774,
|
|
"grad_norm": 7.594180252515016,
|
|
"learning_rate": 9.462809917355371e-07,
|
|
"logits/chosen": -0.06201171875,
|
|
"logits/rejected": -0.259765625,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0261,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.5234375,
|
|
"rewards/margins": 12.8125,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"epoch": 1.596319018404908,
|
|
"grad_norm": 4.285068909220888,
|
|
"learning_rate": 9.454545454545454e-07,
|
|
"logits/chosen": -0.062255859375,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.015,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1301
|
|
},
|
|
{
|
|
"epoch": 1.5975460122699388,
|
|
"grad_norm": 13.265637550707137,
|
|
"learning_rate": 9.446280991735537e-07,
|
|
"logits/chosen": -0.275390625,
|
|
"logits/rejected": -0.388671875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0366,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.6015625,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1302
|
|
},
|
|
{
|
|
"epoch": 1.5987730061349694,
|
|
"grad_norm": 6.548870459600642,
|
|
"learning_rate": 9.43801652892562e-07,
|
|
"logits/chosen": -0.1455078125,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -462.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0322,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.5078125,
|
|
"rewards/margins": 13.9375,
|
|
"rewards/rejected": -15.4375,
|
|
"step": 1303
|
|
},
|
|
{
|
|
"epoch": 1.6,
|
|
"grad_norm": 11.463970926018966,
|
|
"learning_rate": 9.429752066115701e-07,
|
|
"logits/chosen": -0.2138671875,
|
|
"logits/rejected": -0.384765625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0312,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.2734375,
|
|
"rewards/margins": 13.9375,
|
|
"rewards/rejected": -15.1875,
|
|
"step": 1304
|
|
},
|
|
{
|
|
"epoch": 1.6012269938650308,
|
|
"grad_norm": 9.415806324610234,
|
|
"learning_rate": 9.421487603305784e-07,
|
|
"logits/chosen": -0.11181640625,
|
|
"logits/rejected": -0.251953125,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0359,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.109375,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"epoch": 1.6024539877300614,
|
|
"grad_norm": 11.890901870355478,
|
|
"learning_rate": 9.413223140495867e-07,
|
|
"logits/chosen": -0.1806640625,
|
|
"logits/rejected": -0.2890625,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0372,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.8046875,
|
|
"rewards/margins": 12.8125,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1306
|
|
},
|
|
{
|
|
"epoch": 1.603680981595092,
|
|
"grad_norm": 11.16252011245357,
|
|
"learning_rate": 9.40495867768595e-07,
|
|
"logits/chosen": -0.1884765625,
|
|
"logits/rejected": -0.376953125,
|
|
"logps/chosen": -462.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0384,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1640625,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1307
|
|
},
|
|
{
|
|
"epoch": 1.6049079754601228,
|
|
"grad_norm": 5.679322602920968,
|
|
"learning_rate": 9.396694214876033e-07,
|
|
"logits/chosen": -0.244140625,
|
|
"logits/rejected": -0.388671875,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.014,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.5390625,
|
|
"rewards/margins": 13.1875,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1308
|
|
},
|
|
{
|
|
"epoch": 1.6061349693251534,
|
|
"grad_norm": 9.569153983001263,
|
|
"learning_rate": 9.388429752066115e-07,
|
|
"logits/chosen": -0.18359375,
|
|
"logits/rejected": -0.306640625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0259,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -14.875,
|
|
"step": 1309
|
|
},
|
|
{
|
|
"epoch": 1.607361963190184,
|
|
"grad_norm": 6.425025155641295,
|
|
"learning_rate": 9.380165289256198e-07,
|
|
"logits/chosen": -0.099609375,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -354.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.0218,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.3046875,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"epoch": 1.6085889570552148,
|
|
"grad_norm": 17.800848129087864,
|
|
"learning_rate": 9.371900826446281e-07,
|
|
"logits/chosen": -0.046630859375,
|
|
"logits/rejected": -0.259765625,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0666,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.96875,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -14.0625,
|
|
"step": 1311
|
|
},
|
|
{
|
|
"epoch": 1.6098159509202454,
|
|
"grad_norm": 5.556020415598615,
|
|
"learning_rate": 9.363636363636364e-07,
|
|
"logits/chosen": -0.234375,
|
|
"logits/rejected": -0.470703125,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0178,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.46875,
|
|
"rewards/margins": 13.6875,
|
|
"rewards/rejected": -15.1875,
|
|
"step": 1312
|
|
},
|
|
{
|
|
"epoch": 1.611042944785276,
|
|
"grad_norm": 6.4048066084093085,
|
|
"learning_rate": 9.355371900826446e-07,
|
|
"logits/chosen": -0.1494140625,
|
|
"logits/rejected": -0.296875,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0356,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.296875,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1313
|
|
},
|
|
{
|
|
"epoch": 1.6122699386503068,
|
|
"grad_norm": 5.829147747044031,
|
|
"learning_rate": 9.347107438016529e-07,
|
|
"logits/chosen": -0.330078125,
|
|
"logits/rejected": -0.41015625,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.0139,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.71484375,
|
|
"rewards/margins": 14.0625,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1314
|
|
},
|
|
{
|
|
"epoch": 1.6134969325153374,
|
|
"grad_norm": 17.83003895742431,
|
|
"learning_rate": 9.338842975206612e-07,
|
|
"logits/chosen": -0.1728515625,
|
|
"logits/rejected": -0.3984375,
|
|
"logps/chosen": -478.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.0748,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.1875,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"epoch": 1.614723926380368,
|
|
"grad_norm": 17.110861200505923,
|
|
"learning_rate": 9.330578512396694e-07,
|
|
"logits/chosen": -0.0419921875,
|
|
"logits/rejected": -0.23828125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0623,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.421875,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1316
|
|
},
|
|
{
|
|
"epoch": 1.6159509202453988,
|
|
"grad_norm": 11.010541116058228,
|
|
"learning_rate": 9.322314049586776e-07,
|
|
"logits/chosen": -0.2109375,
|
|
"logits/rejected": -0.3203125,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0413,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.15625,
|
|
"rewards/margins": 12.8125,
|
|
"rewards/rejected": -15.0,
|
|
"step": 1317
|
|
},
|
|
{
|
|
"epoch": 1.6171779141104294,
|
|
"grad_norm": 9.048541596144348,
|
|
"learning_rate": 9.314049586776858e-07,
|
|
"logits/chosen": -0.1455078125,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0188,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.28125,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -15.4375,
|
|
"step": 1318
|
|
},
|
|
{
|
|
"epoch": 1.61840490797546,
|
|
"grad_norm": 14.740903912942425,
|
|
"learning_rate": 9.305785123966941e-07,
|
|
"logits/chosen": -0.1748046875,
|
|
"logits/rejected": -0.33203125,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -462.0,
|
|
"loss": 0.0685,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.9453125,
|
|
"rewards/margins": 13.5625,
|
|
"rewards/rejected": -15.5,
|
|
"step": 1319
|
|
},
|
|
{
|
|
"epoch": 1.6196319018404908,
|
|
"grad_norm": 14.237407011740913,
|
|
"learning_rate": 9.297520661157024e-07,
|
|
"logits/chosen": -0.1474609375,
|
|
"logits/rejected": -0.337890625,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0541,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.5390625,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"epoch": 1.6208588957055214,
|
|
"grad_norm": 16.42125801755334,
|
|
"learning_rate": 9.289256198347107e-07,
|
|
"logits/chosen": -0.197265625,
|
|
"logits/rejected": -0.330078125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0435,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.8046875,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 1321
|
|
},
|
|
{
|
|
"epoch": 1.622085889570552,
|
|
"grad_norm": 15.87448389315227,
|
|
"learning_rate": 9.280991735537189e-07,
|
|
"logits/chosen": -0.212890625,
|
|
"logits/rejected": -0.369140625,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0648,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1322
|
|
},
|
|
{
|
|
"epoch": 1.6233128834355828,
|
|
"grad_norm": 7.505627434298467,
|
|
"learning_rate": 9.272727272727272e-07,
|
|
"logits/chosen": -0.04736328125,
|
|
"logits/rejected": -0.2451171875,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0205,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.984375,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1323
|
|
},
|
|
{
|
|
"epoch": 1.6245398773006134,
|
|
"grad_norm": 10.381572742786943,
|
|
"learning_rate": 9.264462809917355e-07,
|
|
"logits/chosen": -0.20703125,
|
|
"logits/rejected": -0.43359375,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0399,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.546875,
|
|
"rewards/margins": 13.6875,
|
|
"rewards/rejected": -15.1875,
|
|
"step": 1324
|
|
},
|
|
{
|
|
"epoch": 1.6257668711656441,
|
|
"grad_norm": 7.941912196683046,
|
|
"learning_rate": 9.256198347107438e-07,
|
|
"logits/chosen": -0.1064453125,
|
|
"logits/rejected": -0.369140625,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0348,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.515625,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -15.5,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"epoch": 1.6269938650306748,
|
|
"grad_norm": 14.495673016632852,
|
|
"learning_rate": 9.247933884297521e-07,
|
|
"logits/chosen": -0.2265625,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -456.0,
|
|
"loss": 0.0456,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.25,
|
|
"rewards/margins": 13.9375,
|
|
"rewards/rejected": -16.25,
|
|
"step": 1326
|
|
},
|
|
{
|
|
"epoch": 1.6282208588957054,
|
|
"grad_norm": 16.18783168026297,
|
|
"learning_rate": 9.239669421487603e-07,
|
|
"logits/chosen": -0.15234375,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0851,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -3.078125,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -15.5625,
|
|
"step": 1327
|
|
},
|
|
{
|
|
"epoch": 1.6294478527607361,
|
|
"grad_norm": 17.02205561554116,
|
|
"learning_rate": 9.231404958677686e-07,
|
|
"logits/chosen": -0.2275390625,
|
|
"logits/rejected": -0.44140625,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0483,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.765625,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -15.4375,
|
|
"step": 1328
|
|
},
|
|
{
|
|
"epoch": 1.6306748466257668,
|
|
"grad_norm": 13.259175145560656,
|
|
"learning_rate": 9.223140495867769e-07,
|
|
"logits/chosen": -0.259765625,
|
|
"logits/rejected": -0.439453125,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.047,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.90625,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -15.75,
|
|
"step": 1329
|
|
},
|
|
{
|
|
"epoch": 1.6319018404907975,
|
|
"grad_norm": 15.5016428721918,
|
|
"learning_rate": 9.214876033057852e-07,
|
|
"logits/chosen": -0.1484375,
|
|
"logits/rejected": -0.3671875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0576,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.90625,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -15.8125,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"epoch": 1.6331288343558281,
|
|
"grad_norm": 8.305494421061486,
|
|
"learning_rate": 9.206611570247933e-07,
|
|
"logits/chosen": -0.2021484375,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0229,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -3.6875,
|
|
"rewards/margins": 12.8125,
|
|
"rewards/rejected": -16.5,
|
|
"step": 1331
|
|
},
|
|
{
|
|
"epoch": 1.6343558282208588,
|
|
"grad_norm": 6.604476022543088,
|
|
"learning_rate": 9.198347107438016e-07,
|
|
"logits/chosen": -0.291015625,
|
|
"logits/rejected": -0.4453125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0163,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.28125,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -15.5625,
|
|
"step": 1332
|
|
},
|
|
{
|
|
"epoch": 1.6355828220858895,
|
|
"grad_norm": 17.709710398270747,
|
|
"learning_rate": 9.190082644628098e-07,
|
|
"logits/chosen": -0.3046875,
|
|
"logits/rejected": -0.4453125,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -482.0,
|
|
"loss": 0.0616,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -3.4375,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -16.125,
|
|
"step": 1333
|
|
},
|
|
{
|
|
"epoch": 1.6368098159509201,
|
|
"grad_norm": 7.6418660273051575,
|
|
"learning_rate": 9.181818181818181e-07,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.025,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.9296875,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -15.3125,
|
|
"step": 1334
|
|
},
|
|
{
|
|
"epoch": 1.6380368098159508,
|
|
"grad_norm": 16.333081187186348,
|
|
"learning_rate": 9.173553719008264e-07,
|
|
"logits/chosen": -0.263671875,
|
|
"logits/rejected": -0.47265625,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0443,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.2109375,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"epoch": 1.6392638036809815,
|
|
"grad_norm": 15.284451020700127,
|
|
"learning_rate": 9.165289256198346e-07,
|
|
"logits/chosen": -0.38671875,
|
|
"logits/rejected": -0.55859375,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -472.0,
|
|
"loss": 0.045,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.921875,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -16.25,
|
|
"step": 1336
|
|
},
|
|
{
|
|
"epoch": 1.6404907975460121,
|
|
"grad_norm": 16.58621383658074,
|
|
"learning_rate": 9.157024793388429e-07,
|
|
"logits/chosen": -0.2275390625,
|
|
"logits/rejected": -0.408203125,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0576,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.265625,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -14.9375,
|
|
"step": 1337
|
|
},
|
|
{
|
|
"epoch": 1.6417177914110428,
|
|
"grad_norm": 8.96432355990632,
|
|
"learning_rate": 9.148760330578512e-07,
|
|
"logits/chosen": -0.302734375,
|
|
"logits/rejected": -0.42578125,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.03,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.8203125,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1338
|
|
},
|
|
{
|
|
"epoch": 1.6429447852760735,
|
|
"grad_norm": 20.297262294819006,
|
|
"learning_rate": 9.140495867768595e-07,
|
|
"logits/chosen": -0.1513671875,
|
|
"logits/rejected": -0.2109375,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.1217,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.59375,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1339
|
|
},
|
|
{
|
|
"epoch": 1.6441717791411041,
|
|
"grad_norm": 16.959246435499818,
|
|
"learning_rate": 9.132231404958677e-07,
|
|
"logits/chosen": -0.08447265625,
|
|
"logits/rejected": -0.2412109375,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0832,
|
|
"rewards/accuracies": 0.953125,
|
|
"rewards/chosen": -2.1875,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"epoch": 1.645398773006135,
|
|
"grad_norm": 3.941235607303432,
|
|
"learning_rate": 9.12396694214876e-07,
|
|
"logits/chosen": -0.251953125,
|
|
"logits/rejected": -0.482421875,
|
|
"logps/chosen": -466.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0113,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.0,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -15.0,
|
|
"step": 1341
|
|
},
|
|
{
|
|
"epoch": 1.6466257668711657,
|
|
"grad_norm": 13.465072086608481,
|
|
"learning_rate": 9.115702479338843e-07,
|
|
"logits/chosen": -0.27734375,
|
|
"logits/rejected": -0.5,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.036,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.578125,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1342
|
|
},
|
|
{
|
|
"epoch": 1.6478527607361964,
|
|
"grad_norm": 22.54111740486076,
|
|
"learning_rate": 9.107438016528926e-07,
|
|
"logits/chosen": -0.1845703125,
|
|
"logits/rejected": -0.421875,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.1415,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.5,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1343
|
|
},
|
|
{
|
|
"epoch": 1.649079754601227,
|
|
"grad_norm": 15.375871926972172,
|
|
"learning_rate": 9.099173553719007e-07,
|
|
"logits/chosen": -0.16796875,
|
|
"logits/rejected": -0.43359375,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0509,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.140625,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1344
|
|
},
|
|
{
|
|
"epoch": 1.6503067484662577,
|
|
"grad_norm": 15.548034161822667,
|
|
"learning_rate": 9.09090909090909e-07,
|
|
"logits/chosen": -0.197265625,
|
|
"logits/rejected": -0.353515625,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0852,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.84375,
|
|
"rewards/margins": 11.0,
|
|
"rewards/rejected": -12.8125,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"epoch": 1.6515337423312884,
|
|
"grad_norm": 22.360906708807086,
|
|
"learning_rate": 9.082644628099173e-07,
|
|
"logits/chosen": -0.1259765625,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0863,
|
|
"rewards/accuracies": 0.9453125,
|
|
"rewards/chosen": -1.3828125,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1346
|
|
},
|
|
{
|
|
"epoch": 1.652760736196319,
|
|
"grad_norm": 11.885454277052277,
|
|
"learning_rate": 9.074380165289256e-07,
|
|
"logits/chosen": -0.1494140625,
|
|
"logits/rejected": -0.3125,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0554,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.0,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1347
|
|
},
|
|
{
|
|
"epoch": 1.6539877300613497,
|
|
"grad_norm": 9.451376089668251,
|
|
"learning_rate": 9.066115702479339e-07,
|
|
"logits/chosen": -0.1455078125,
|
|
"logits/rejected": -0.328125,
|
|
"logps/chosen": -362.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0399,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.1875,
|
|
"rewards/margins": 11.375,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1348
|
|
},
|
|
{
|
|
"epoch": 1.6552147239263804,
|
|
"grad_norm": 6.988928928049771,
|
|
"learning_rate": 9.057851239669421e-07,
|
|
"logits/chosen": -0.12890625,
|
|
"logits/rejected": -0.3359375,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0265,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.6171875,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1349
|
|
},
|
|
{
|
|
"epoch": 1.656441717791411,
|
|
"grad_norm": 16.243737250154922,
|
|
"learning_rate": 9.049586776859504e-07,
|
|
"logits/chosen": -0.1728515625,
|
|
"logits/rejected": -0.359375,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -456.0,
|
|
"loss": 0.0634,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.31640625,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"epoch": 1.6576687116564417,
|
|
"grad_norm": 18.229675107125082,
|
|
"learning_rate": 9.041322314049586e-07,
|
|
"logits/chosen": -0.12353515625,
|
|
"logits/rejected": -0.26953125,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0988,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.8359375,
|
|
"rewards/margins": 11.3125,
|
|
"rewards/rejected": -13.125,
|
|
"step": 1351
|
|
},
|
|
{
|
|
"epoch": 1.6588957055214724,
|
|
"grad_norm": 8.769525071323859,
|
|
"learning_rate": 9.033057851239669e-07,
|
|
"logits/chosen": -0.22265625,
|
|
"logits/rejected": -0.373046875,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0249,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.4765625,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1352
|
|
},
|
|
{
|
|
"epoch": 1.660122699386503,
|
|
"grad_norm": 14.502978040508614,
|
|
"learning_rate": 9.024793388429751e-07,
|
|
"logits/chosen": -0.11376953125,
|
|
"logits/rejected": -0.1484375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.0544,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.21875,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1353
|
|
},
|
|
{
|
|
"epoch": 1.6613496932515337,
|
|
"grad_norm": 14.167491840283715,
|
|
"learning_rate": 9.016528925619834e-07,
|
|
"logits/chosen": -0.1884765625,
|
|
"logits/rejected": -0.345703125,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0448,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.03125,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1354
|
|
},
|
|
{
|
|
"epoch": 1.6625766871165644,
|
|
"grad_norm": 14.907961946583502,
|
|
"learning_rate": 9.008264462809917e-07,
|
|
"logits/chosen": -0.2099609375,
|
|
"logits/rejected": -0.345703125,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0511,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.8671875,
|
|
"rewards/margins": 11.1875,
|
|
"rewards/rejected": -13.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"epoch": 1.6638036809815953,
|
|
"grad_norm": 6.199366044704542,
|
|
"learning_rate": 9e-07,
|
|
"logits/chosen": -0.162109375,
|
|
"logits/rejected": -0.333984375,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0262,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.078125,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -14.875,
|
|
"step": 1356
|
|
},
|
|
{
|
|
"epoch": 1.665030674846626,
|
|
"grad_norm": 7.777763276581302,
|
|
"learning_rate": 8.991735537190083e-07,
|
|
"logits/chosen": -0.126953125,
|
|
"logits/rejected": -0.359375,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0187,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.140625,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1357
|
|
},
|
|
{
|
|
"epoch": 1.6662576687116566,
|
|
"grad_norm": 9.435812724576301,
|
|
"learning_rate": 8.983471074380164e-07,
|
|
"logits/chosen": -0.2138671875,
|
|
"logits/rejected": -0.4609375,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0429,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.84375,
|
|
"rewards/margins": 10.6875,
|
|
"rewards/rejected": -12.5625,
|
|
"step": 1358
|
|
},
|
|
{
|
|
"epoch": 1.6674846625766873,
|
|
"grad_norm": 4.155607552455537,
|
|
"learning_rate": 8.975206611570247e-07,
|
|
"logits/chosen": -0.1171875,
|
|
"logits/rejected": -0.31640625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0188,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.1953125,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1359
|
|
},
|
|
{
|
|
"epoch": 1.668711656441718,
|
|
"grad_norm": 12.468924980897397,
|
|
"learning_rate": 8.96694214876033e-07,
|
|
"logits/chosen": -0.38671875,
|
|
"logits/rejected": -0.61328125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0559,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -0.5703125,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -12.4375,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"epoch": 1.6699386503067486,
|
|
"grad_norm": 10.99794230165957,
|
|
"learning_rate": 8.958677685950413e-07,
|
|
"logits/chosen": -0.06982421875,
|
|
"logits/rejected": -0.234375,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0372,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.7578125,
|
|
"rewards/margins": 11.3125,
|
|
"rewards/rejected": -13.0625,
|
|
"step": 1361
|
|
},
|
|
{
|
|
"epoch": 1.6711656441717793,
|
|
"grad_norm": 15.394549211761396,
|
|
"learning_rate": 8.950413223140495e-07,
|
|
"logits/chosen": -0.1064453125,
|
|
"logits/rejected": -0.23828125,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0521,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1796875,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1362
|
|
},
|
|
{
|
|
"epoch": 1.67239263803681,
|
|
"grad_norm": 3.482355176057617,
|
|
"learning_rate": 8.942148760330578e-07,
|
|
"logits/chosen": -0.2001953125,
|
|
"logits/rejected": -0.400390625,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0111,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.82421875,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 1363
|
|
},
|
|
{
|
|
"epoch": 1.6736196319018406,
|
|
"grad_norm": 12.417237075751807,
|
|
"learning_rate": 8.933884297520661e-07,
|
|
"logits/chosen": -0.07568359375,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.0225,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.453125,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -13.1875,
|
|
"step": 1364
|
|
},
|
|
{
|
|
"epoch": 1.6748466257668713,
|
|
"grad_norm": 10.79947731327148,
|
|
"learning_rate": 8.925619834710744e-07,
|
|
"logits/chosen": -0.01409912109375,
|
|
"logits/rejected": -0.197265625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0387,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.03125,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"epoch": 1.676073619631902,
|
|
"grad_norm": 10.748873895750465,
|
|
"learning_rate": 8.917355371900827e-07,
|
|
"logits/chosen": -0.09814453125,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.0414,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.828125,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -12.0625,
|
|
"step": 1366
|
|
},
|
|
{
|
|
"epoch": 1.6773006134969326,
|
|
"grad_norm": 9.47666595268894,
|
|
"learning_rate": 8.909090909090909e-07,
|
|
"logits/chosen": -0.0712890625,
|
|
"logits/rejected": -0.22265625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0385,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.28125,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1367
|
|
},
|
|
{
|
|
"epoch": 1.6785276073619633,
|
|
"grad_norm": 13.326208138435703,
|
|
"learning_rate": 8.900826446280992e-07,
|
|
"logits/chosen": -0.287109375,
|
|
"logits/rejected": -0.43359375,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0418,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.7109375,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 1368
|
|
},
|
|
{
|
|
"epoch": 1.679754601226994,
|
|
"grad_norm": 12.783191443198902,
|
|
"learning_rate": 8.892561983471074e-07,
|
|
"logits/chosen": -0.208984375,
|
|
"logits/rejected": -0.40625,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0687,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.6328125,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -12.75,
|
|
"step": 1369
|
|
},
|
|
{
|
|
"epoch": 1.6809815950920246,
|
|
"grad_norm": 9.76188769745529,
|
|
"learning_rate": 8.884297520661157e-07,
|
|
"logits/chosen": -0.1455078125,
|
|
"logits/rejected": -0.259765625,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0313,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.80078125,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -12.875,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"epoch": 1.6822085889570553,
|
|
"grad_norm": 12.787572490005264,
|
|
"learning_rate": 8.876033057851238e-07,
|
|
"logits/chosen": -0.08447265625,
|
|
"logits/rejected": -0.3515625,
|
|
"logps/chosen": -484.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0701,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.8203125,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1371
|
|
},
|
|
{
|
|
"epoch": 1.683435582822086,
|
|
"grad_norm": 14.53994484302953,
|
|
"learning_rate": 8.867768595041321e-07,
|
|
"logits/chosen": -0.1396484375,
|
|
"logits/rejected": -0.3671875,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.09,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.93359375,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 1372
|
|
},
|
|
{
|
|
"epoch": 1.6846625766871166,
|
|
"grad_norm": 13.632516261440003,
|
|
"learning_rate": 8.859504132231404e-07,
|
|
"logits/chosen": -0.0986328125,
|
|
"logits/rejected": -0.181640625,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0821,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.015625,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -12.8125,
|
|
"step": 1373
|
|
},
|
|
{
|
|
"epoch": 1.6858895705521473,
|
|
"grad_norm": 16.48214090098275,
|
|
"learning_rate": 8.851239669421487e-07,
|
|
"logits/chosen": -0.00830078125,
|
|
"logits/rejected": -0.2451171875,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0792,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.59375,
|
|
"rewards/margins": 11.0,
|
|
"rewards/rejected": -12.625,
|
|
"step": 1374
|
|
},
|
|
{
|
|
"epoch": 1.687116564417178,
|
|
"grad_norm": 7.821232753322752,
|
|
"learning_rate": 8.84297520661157e-07,
|
|
"logits/chosen": -0.04443359375,
|
|
"logits/rejected": -0.150390625,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0278,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.40625,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -12.625,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"epoch": 1.6883435582822086,
|
|
"grad_norm": 11.83013820549058,
|
|
"learning_rate": 8.834710743801652e-07,
|
|
"logits/chosen": -0.2060546875,
|
|
"logits/rejected": -0.3125,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0366,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.171875,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1376
|
|
},
|
|
{
|
|
"epoch": 1.6895705521472393,
|
|
"grad_norm": 7.666549312007542,
|
|
"learning_rate": 8.826446280991735e-07,
|
|
"logits/chosen": -0.1748046875,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0243,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.5703125,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1377
|
|
},
|
|
{
|
|
"epoch": 1.69079754601227,
|
|
"grad_norm": 9.39508387311802,
|
|
"learning_rate": 8.818181818181818e-07,
|
|
"logits/chosen": -0.1337890625,
|
|
"logits/rejected": -0.314453125,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.034,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.078125,
|
|
"rewards/margins": 10.6875,
|
|
"rewards/rejected": -12.8125,
|
|
"step": 1378
|
|
},
|
|
{
|
|
"epoch": 1.6920245398773006,
|
|
"grad_norm": 14.31936771528684,
|
|
"learning_rate": 8.809917355371901e-07,
|
|
"logits/chosen": -0.1533203125,
|
|
"logits/rejected": -0.306640625,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0565,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.9765625,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -12.0625,
|
|
"step": 1379
|
|
},
|
|
{
|
|
"epoch": 1.6932515337423313,
|
|
"grad_norm": 10.898597216986863,
|
|
"learning_rate": 8.801652892561983e-07,
|
|
"logits/chosen": -0.10400390625,
|
|
"logits/rejected": -0.333984375,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.0278,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.0234375,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -12.5,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"epoch": 1.694478527607362,
|
|
"grad_norm": 10.992398343790574,
|
|
"learning_rate": 8.793388429752066e-07,
|
|
"logits/chosen": -0.03271484375,
|
|
"logits/rejected": -0.06494140625,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0534,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.6875,
|
|
"rewards/margins": 10.5625,
|
|
"rewards/rejected": -12.25,
|
|
"step": 1381
|
|
},
|
|
{
|
|
"epoch": 1.6957055214723926,
|
|
"grad_norm": 20.464481466405882,
|
|
"learning_rate": 8.785123966942149e-07,
|
|
"logits/chosen": -0.109375,
|
|
"logits/rejected": -0.2265625,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.1138,
|
|
"rewards/accuracies": 0.953125,
|
|
"rewards/chosen": -1.828125,
|
|
"rewards/margins": 10.6875,
|
|
"rewards/rejected": -12.5,
|
|
"step": 1382
|
|
},
|
|
{
|
|
"epoch": 1.6969325153374233,
|
|
"grad_norm": 6.270153833401205,
|
|
"learning_rate": 8.776859504132232e-07,
|
|
"logits/chosen": -0.11767578125,
|
|
"logits/rejected": -0.30078125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0219,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.9140625,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -13.125,
|
|
"step": 1383
|
|
},
|
|
{
|
|
"epoch": 1.698159509202454,
|
|
"grad_norm": 15.776034006349834,
|
|
"learning_rate": 8.768595041322315e-07,
|
|
"logits/chosen": 0.0147705078125,
|
|
"logits/rejected": -0.10791015625,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0684,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 10.6875,
|
|
"rewards/rejected": -12.6875,
|
|
"step": 1384
|
|
},
|
|
{
|
|
"epoch": 1.6993865030674846,
|
|
"grad_norm": 10.334829477248885,
|
|
"learning_rate": 8.760330578512396e-07,
|
|
"logits/chosen": -0.115234375,
|
|
"logits/rejected": -0.2373046875,
|
|
"logps/chosen": -348.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.0556,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.3671875,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -12.4375,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"epoch": 1.7006134969325153,
|
|
"grad_norm": 7.7823206823810676,
|
|
"learning_rate": 8.752066115702479e-07,
|
|
"logits/chosen": -0.2578125,
|
|
"logits/rejected": -0.470703125,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0336,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.58984375,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1386
|
|
},
|
|
{
|
|
"epoch": 1.701840490797546,
|
|
"grad_norm": 7.437543918838008,
|
|
"learning_rate": 8.743801652892561e-07,
|
|
"logits/chosen": -0.2041015625,
|
|
"logits/rejected": -0.380859375,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -466.0,
|
|
"loss": 0.024,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.9765625,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.25,
|
|
"step": 1387
|
|
},
|
|
{
|
|
"epoch": 1.7030674846625766,
|
|
"grad_norm": 9.766676771989493,
|
|
"learning_rate": 8.735537190082644e-07,
|
|
"logits/chosen": 0.020263671875,
|
|
"logits/rejected": -0.12255859375,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0339,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.90625,
|
|
"rewards/margins": 10.625,
|
|
"rewards/rejected": -12.5,
|
|
"step": 1388
|
|
},
|
|
{
|
|
"epoch": 1.7042944785276073,
|
|
"grad_norm": 4.994405881939517,
|
|
"learning_rate": 8.727272727272726e-07,
|
|
"logits/chosen": -0.259765625,
|
|
"logits/rejected": -0.375,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0175,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.5703125,
|
|
"rewards/margins": 12.8125,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1389
|
|
},
|
|
{
|
|
"epoch": 1.705521472392638,
|
|
"grad_norm": 17.579302907222175,
|
|
"learning_rate": 8.719008264462809e-07,
|
|
"logits/chosen": -0.130859375,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0619,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.328125,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"epoch": 1.7067484662576686,
|
|
"grad_norm": 9.312469510621938,
|
|
"learning_rate": 8.710743801652892e-07,
|
|
"logits/chosen": -0.13671875,
|
|
"logits/rejected": -0.38671875,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0406,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.248046875,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -12.625,
|
|
"step": 1391
|
|
},
|
|
{
|
|
"epoch": 1.7079754601226993,
|
|
"grad_norm": 9.256518305214534,
|
|
"learning_rate": 8.702479338842975e-07,
|
|
"logits/chosen": 0.044189453125,
|
|
"logits/rejected": -0.1328125,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.0427,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.234375,
|
|
"rewards/margins": 10.0625,
|
|
"rewards/rejected": -12.3125,
|
|
"step": 1392
|
|
},
|
|
{
|
|
"epoch": 1.70920245398773,
|
|
"grad_norm": 7.978440132624637,
|
|
"learning_rate": 8.694214876033057e-07,
|
|
"logits/chosen": -0.1806640625,
|
|
"logits/rejected": -0.376953125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -366.0,
|
|
"loss": 0.0264,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.99609375,
|
|
"rewards/margins": 11.0,
|
|
"rewards/rejected": -12.0,
|
|
"step": 1393
|
|
},
|
|
{
|
|
"epoch": 1.7104294478527606,
|
|
"grad_norm": 15.435615666072344,
|
|
"learning_rate": 8.68595041322314e-07,
|
|
"logits/chosen": -0.2294921875,
|
|
"logits/rejected": -0.39453125,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0762,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.484375,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -13.0,
|
|
"step": 1394
|
|
},
|
|
{
|
|
"epoch": 1.7116564417177913,
|
|
"grad_norm": 4.291578312759804,
|
|
"learning_rate": 8.677685950413223e-07,
|
|
"logits/chosen": -0.13671875,
|
|
"logits/rejected": -0.341796875,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0177,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.7890625,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -12.375,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"epoch": 1.712883435582822,
|
|
"grad_norm": 6.057095991809985,
|
|
"learning_rate": 8.669421487603306e-07,
|
|
"logits/chosen": 0.0191650390625,
|
|
"logits/rejected": -0.2060546875,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0171,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.0390625,
|
|
"rewards/margins": 12.8125,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1396
|
|
},
|
|
{
|
|
"epoch": 1.7141104294478526,
|
|
"grad_norm": 4.297553257973654,
|
|
"learning_rate": 8.661157024793389e-07,
|
|
"logits/chosen": -0.16015625,
|
|
"logits/rejected": -0.306640625,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0136,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.5859375,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1397
|
|
},
|
|
{
|
|
"epoch": 1.7153374233128833,
|
|
"grad_norm": 18.047286138704802,
|
|
"learning_rate": 8.65289256198347e-07,
|
|
"logits/chosen": -0.1064453125,
|
|
"logits/rejected": -0.2177734375,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0676,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.375,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1398
|
|
},
|
|
{
|
|
"epoch": 1.716564417177914,
|
|
"grad_norm": 9.052400441474742,
|
|
"learning_rate": 8.644628099173553e-07,
|
|
"logits/chosen": -0.08447265625,
|
|
"logits/rejected": -0.19921875,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0321,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.8984375,
|
|
"rewards/margins": 11.0625,
|
|
"rewards/rejected": -12.9375,
|
|
"step": 1399
|
|
},
|
|
{
|
|
"epoch": 1.7177914110429446,
|
|
"grad_norm": 8.12246763954807,
|
|
"learning_rate": 8.636363636363636e-07,
|
|
"logits/chosen": -0.09130859375,
|
|
"logits/rejected": -0.2890625,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -376.0,
|
|
"loss": 0.0223,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.328125,
|
|
"rewards/margins": 10.875,
|
|
"rewards/rejected": -13.25,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"epoch": 1.7190184049079753,
|
|
"grad_norm": 5.881346141257154,
|
|
"learning_rate": 8.628099173553719e-07,
|
|
"logits/chosen": -0.1474609375,
|
|
"logits/rejected": -0.380859375,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -470.0,
|
|
"loss": 0.0211,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.0703125,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1401
|
|
},
|
|
{
|
|
"epoch": 1.720245398773006,
|
|
"grad_norm": 7.876391407551083,
|
|
"learning_rate": 8.619834710743801e-07,
|
|
"logits/chosen": -0.1806640625,
|
|
"logits/rejected": -0.40234375,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0334,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.3984375,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1402
|
|
},
|
|
{
|
|
"epoch": 1.7214723926380369,
|
|
"grad_norm": 17.096894939040883,
|
|
"learning_rate": 8.611570247933884e-07,
|
|
"logits/chosen": -0.07666015625,
|
|
"logits/rejected": -0.23046875,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0561,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.9609375,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1403
|
|
},
|
|
{
|
|
"epoch": 1.7226993865030675,
|
|
"grad_norm": 5.351690273001028,
|
|
"learning_rate": 8.603305785123967e-07,
|
|
"logits/chosen": -0.1015625,
|
|
"logits/rejected": -0.255859375,
|
|
"logps/chosen": -352.0,
|
|
"logps/rejected": -354.0,
|
|
"loss": 0.0196,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.8203125,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -13.375,
|
|
"step": 1404
|
|
},
|
|
{
|
|
"epoch": 1.7239263803680982,
|
|
"grad_norm": 11.479482395279408,
|
|
"learning_rate": 8.595041322314049e-07,
|
|
"logits/chosen": -0.2109375,
|
|
"logits/rejected": -0.380859375,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0384,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.7265625,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"epoch": 1.7251533742331289,
|
|
"grad_norm": 6.094464818773876,
|
|
"learning_rate": 8.586776859504132e-07,
|
|
"logits/chosen": -0.337890625,
|
|
"logits/rejected": -0.458984375,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0145,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.9140625,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1406
|
|
},
|
|
{
|
|
"epoch": 1.7263803680981595,
|
|
"grad_norm": 15.531525799270492,
|
|
"learning_rate": 8.578512396694214e-07,
|
|
"logits/chosen": -0.1552734375,
|
|
"logits/rejected": -0.435546875,
|
|
"logps/chosen": -466.0,
|
|
"logps/rejected": -456.0,
|
|
"loss": 0.0525,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.84375,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1407
|
|
},
|
|
{
|
|
"epoch": 1.7276073619631902,
|
|
"grad_norm": 7.64929466578026,
|
|
"learning_rate": 8.570247933884297e-07,
|
|
"logits/chosen": -0.1728515625,
|
|
"logits/rejected": -0.345703125,
|
|
"logps/chosen": -494.0,
|
|
"logps/rejected": -472.0,
|
|
"loss": 0.0288,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.59375,
|
|
"rewards/margins": 13.8125,
|
|
"rewards/rejected": -15.4375,
|
|
"step": 1408
|
|
},
|
|
{
|
|
"epoch": 1.7288343558282209,
|
|
"grad_norm": 14.709074361585227,
|
|
"learning_rate": 8.56198347107438e-07,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.302734375,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0807,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.921875,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1409
|
|
},
|
|
{
|
|
"epoch": 1.7300613496932515,
|
|
"grad_norm": 10.852332997081168,
|
|
"learning_rate": 8.553719008264463e-07,
|
|
"logits/chosen": -0.2177734375,
|
|
"logits/rejected": -0.3984375,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0567,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.890625,
|
|
"rewards/margins": 11.125,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"epoch": 1.7312883435582822,
|
|
"grad_norm": 6.655231153245812,
|
|
"learning_rate": 8.545454545454544e-07,
|
|
"logits/chosen": -0.1708984375,
|
|
"logits/rejected": -0.318359375,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0208,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.5,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1411
|
|
},
|
|
{
|
|
"epoch": 1.7325153374233129,
|
|
"grad_norm": 11.888467520244667,
|
|
"learning_rate": 8.537190082644627e-07,
|
|
"logits/chosen": -0.12109375,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0764,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.546875,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1412
|
|
},
|
|
{
|
|
"epoch": 1.7337423312883435,
|
|
"grad_norm": 12.064972855751652,
|
|
"learning_rate": 8.52892561983471e-07,
|
|
"logits/chosen": -0.265625,
|
|
"logits/rejected": -0.482421875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0459,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.53125,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -15.125,
|
|
"step": 1413
|
|
},
|
|
{
|
|
"epoch": 1.7349693251533742,
|
|
"grad_norm": 7.092872717094714,
|
|
"learning_rate": 8.520661157024793e-07,
|
|
"logits/chosen": -0.1376953125,
|
|
"logits/rejected": -0.322265625,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0305,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.8984375,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1414
|
|
},
|
|
{
|
|
"epoch": 1.7361963190184049,
|
|
"grad_norm": 6.351683265351178,
|
|
"learning_rate": 8.512396694214876e-07,
|
|
"logits/chosen": -0.19921875,
|
|
"logits/rejected": -0.3828125,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0419,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.890625,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"epoch": 1.7374233128834355,
|
|
"grad_norm": 12.243640180893975,
|
|
"learning_rate": 8.504132231404958e-07,
|
|
"logits/chosen": -0.1201171875,
|
|
"logits/rejected": -0.38671875,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0473,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.5234375,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -14.5,
|
|
"step": 1416
|
|
},
|
|
{
|
|
"epoch": 1.7386503067484662,
|
|
"grad_norm": 9.992881854403064,
|
|
"learning_rate": 8.495867768595041e-07,
|
|
"logits/chosen": -0.259765625,
|
|
"logits/rejected": -0.400390625,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0325,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.9921875,
|
|
"rewards/margins": 15.1875,
|
|
"rewards/rejected": -17.25,
|
|
"step": 1417
|
|
},
|
|
{
|
|
"epoch": 1.7398773006134969,
|
|
"grad_norm": 14.680535177471516,
|
|
"learning_rate": 8.487603305785124e-07,
|
|
"logits/chosen": -0.1455078125,
|
|
"logits/rejected": -0.38671875,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0459,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -15.375,
|
|
"step": 1418
|
|
},
|
|
{
|
|
"epoch": 1.7411042944785278,
|
|
"grad_norm": 11.912035091982608,
|
|
"learning_rate": 8.479338842975207e-07,
|
|
"logits/chosen": -0.1064453125,
|
|
"logits/rejected": -0.2392578125,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.0517,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.84375,
|
|
"rewards/margins": 11.125,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1419
|
|
},
|
|
{
|
|
"epoch": 1.7423312883435584,
|
|
"grad_norm": 10.36690557190644,
|
|
"learning_rate": 8.471074380165289e-07,
|
|
"logits/chosen": -0.337890625,
|
|
"logits/rejected": -0.48828125,
|
|
"logps/chosen": -448.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0341,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.8828125,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.875,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"epoch": 1.743558282208589,
|
|
"grad_norm": 7.577882176685783,
|
|
"learning_rate": 8.462809917355372e-07,
|
|
"logits/chosen": -0.2236328125,
|
|
"logits/rejected": -0.423828125,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0242,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.8125,
|
|
"rewards/margins": 13.4375,
|
|
"rewards/rejected": -15.25,
|
|
"step": 1421
|
|
},
|
|
{
|
|
"epoch": 1.7447852760736198,
|
|
"grad_norm": 21.924224990444568,
|
|
"learning_rate": 8.454545454545454e-07,
|
|
"logits/chosen": -0.09814453125,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.1269,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.625,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1422
|
|
},
|
|
{
|
|
"epoch": 1.7460122699386504,
|
|
"grad_norm": 4.878766510345756,
|
|
"learning_rate": 8.446280991735537e-07,
|
|
"logits/chosen": -0.1787109375,
|
|
"logits/rejected": -0.359375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0147,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.984375,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -16.25,
|
|
"step": 1423
|
|
},
|
|
{
|
|
"epoch": 1.747239263803681,
|
|
"grad_norm": 6.7512716597255045,
|
|
"learning_rate": 8.43801652892562e-07,
|
|
"logits/chosen": -0.271484375,
|
|
"logits/rejected": -0.5078125,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0182,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.5703125,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1424
|
|
},
|
|
{
|
|
"epoch": 1.7484662576687118,
|
|
"grad_norm": 6.312558713834704,
|
|
"learning_rate": 8.429752066115701e-07,
|
|
"logits/chosen": -0.1396484375,
|
|
"logits/rejected": -0.2578125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0169,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.6796875,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -15.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"epoch": 1.7496932515337424,
|
|
"grad_norm": 16.911489526733224,
|
|
"learning_rate": 8.421487603305784e-07,
|
|
"logits/chosen": -0.1376953125,
|
|
"logits/rejected": -0.31640625,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0679,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.6484375,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1426
|
|
},
|
|
{
|
|
"epoch": 1.7509202453987731,
|
|
"grad_norm": 16.23891466552936,
|
|
"learning_rate": 8.413223140495867e-07,
|
|
"logits/chosen": -0.1435546875,
|
|
"logits/rejected": -0.275390625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0767,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.6953125,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1427
|
|
},
|
|
{
|
|
"epoch": 1.7521472392638038,
|
|
"grad_norm": 5.402598900404919,
|
|
"learning_rate": 8.40495867768595e-07,
|
|
"logits/chosen": -0.1904296875,
|
|
"logits/rejected": -0.302734375,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.019,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.94140625,
|
|
"rewards/margins": 13.75,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 1428
|
|
},
|
|
{
|
|
"epoch": 1.7533742331288344,
|
|
"grad_norm": 16.81478239806244,
|
|
"learning_rate": 8.396694214876032e-07,
|
|
"logits/chosen": -0.1416015625,
|
|
"logits/rejected": -0.30859375,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0404,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.125,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1429
|
|
},
|
|
{
|
|
"epoch": 1.7546012269938651,
|
|
"grad_norm": 10.453530917447333,
|
|
"learning_rate": 8.388429752066115e-07,
|
|
"logits/chosen": -0.2265625,
|
|
"logits/rejected": -0.314453125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.0335,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.7578125,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"epoch": 1.7558282208588958,
|
|
"grad_norm": 19.652204676954934,
|
|
"learning_rate": 8.380165289256198e-07,
|
|
"logits/chosen": -0.03369140625,
|
|
"logits/rejected": -0.19921875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0713,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.046875,
|
|
"rewards/margins": 11.5,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1431
|
|
},
|
|
{
|
|
"epoch": 1.7570552147239265,
|
|
"grad_norm": 5.988594919951452,
|
|
"learning_rate": 8.371900826446281e-07,
|
|
"logits/chosen": -0.1953125,
|
|
"logits/rejected": -0.244140625,
|
|
"logps/chosen": -354.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0127,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.4765625,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1432
|
|
},
|
|
{
|
|
"epoch": 1.7582822085889571,
|
|
"grad_norm": 14.532270409007625,
|
|
"learning_rate": 8.363636363636363e-07,
|
|
"logits/chosen": -0.0030059814453125,
|
|
"logits/rejected": -0.12451171875,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.0794,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -3.0,
|
|
"rewards/margins": 11.125,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1433
|
|
},
|
|
{
|
|
"epoch": 1.7595092024539878,
|
|
"grad_norm": 9.745512220554525,
|
|
"learning_rate": 8.355371900826446e-07,
|
|
"logits/chosen": -0.03369140625,
|
|
"logits/rejected": -0.1298828125,
|
|
"logps/chosen": -366.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0272,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.9609375,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1434
|
|
},
|
|
{
|
|
"epoch": 1.7607361963190185,
|
|
"grad_norm": 6.934740711385021,
|
|
"learning_rate": 8.347107438016529e-07,
|
|
"logits/chosen": -0.08349609375,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0309,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.765625,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"epoch": 1.7619631901840491,
|
|
"grad_norm": 7.158308263530979,
|
|
"learning_rate": 8.338842975206612e-07,
|
|
"logits/chosen": -0.123046875,
|
|
"logits/rejected": -0.341796875,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0196,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.203125,
|
|
"rewards/margins": 14.0,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1436
|
|
},
|
|
{
|
|
"epoch": 1.7631901840490798,
|
|
"grad_norm": 17.490770780783436,
|
|
"learning_rate": 8.330578512396695e-07,
|
|
"logits/chosen": -0.271484375,
|
|
"logits/rejected": -0.482421875,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.1,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.046875,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1437
|
|
},
|
|
{
|
|
"epoch": 1.7644171779141105,
|
|
"grad_norm": 12.779786949895705,
|
|
"learning_rate": 8.322314049586777e-07,
|
|
"logits/chosen": -0.150390625,
|
|
"logits/rejected": -0.30859375,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0418,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.765625,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1438
|
|
},
|
|
{
|
|
"epoch": 1.7656441717791411,
|
|
"grad_norm": 7.544173520665693,
|
|
"learning_rate": 8.314049586776859e-07,
|
|
"logits/chosen": -0.2060546875,
|
|
"logits/rejected": -0.4453125,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0201,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.8515625,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1439
|
|
},
|
|
{
|
|
"epoch": 1.7668711656441718,
|
|
"grad_norm": 11.97903800164342,
|
|
"learning_rate": 8.305785123966941e-07,
|
|
"logits/chosen": -0.1650390625,
|
|
"logits/rejected": -0.375,
|
|
"logps/chosen": -492.0,
|
|
"logps/rejected": -464.0,
|
|
"loss": 0.0356,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.296875,
|
|
"rewards/margins": 13.625,
|
|
"rewards/rejected": -14.9375,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"epoch": 1.7680981595092025,
|
|
"grad_norm": 11.524568867802012,
|
|
"learning_rate": 8.297520661157024e-07,
|
|
"logits/chosen": -0.3125,
|
|
"logits/rejected": -0.392578125,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0574,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.171875,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1441
|
|
},
|
|
{
|
|
"epoch": 1.7693251533742331,
|
|
"grad_norm": 17.064990732948186,
|
|
"learning_rate": 8.289256198347106e-07,
|
|
"logits/chosen": -0.2412109375,
|
|
"logits/rejected": -0.46484375,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0584,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.046875,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1442
|
|
},
|
|
{
|
|
"epoch": 1.7705521472392638,
|
|
"grad_norm": 7.6897818341002955,
|
|
"learning_rate": 8.280991735537189e-07,
|
|
"logits/chosen": -0.09716796875,
|
|
"logits/rejected": -0.244140625,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.0301,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.765625,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1443
|
|
},
|
|
{
|
|
"epoch": 1.7717791411042945,
|
|
"grad_norm": 10.154504504256899,
|
|
"learning_rate": 8.272727272727272e-07,
|
|
"logits/chosen": -0.173828125,
|
|
"logits/rejected": -0.33984375,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.037,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.0703125,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1444
|
|
},
|
|
{
|
|
"epoch": 1.7730061349693251,
|
|
"grad_norm": 4.211609848161802,
|
|
"learning_rate": 8.264462809917355e-07,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.3125,
|
|
"logps/chosen": -346.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.0185,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.78125,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"epoch": 1.7742331288343558,
|
|
"grad_norm": 11.004454554243601,
|
|
"learning_rate": 8.256198347107438e-07,
|
|
"logits/chosen": -0.1181640625,
|
|
"logits/rejected": -0.275390625,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.0455,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.859375,
|
|
"rewards/margins": 13.5625,
|
|
"rewards/rejected": -15.4375,
|
|
"step": 1446
|
|
},
|
|
{
|
|
"epoch": 1.7754601226993865,
|
|
"grad_norm": 7.902423493642877,
|
|
"learning_rate": 8.24793388429752e-07,
|
|
"logits/chosen": -0.26953125,
|
|
"logits/rejected": -0.44140625,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0342,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.0625,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -14.9375,
|
|
"step": 1447
|
|
},
|
|
{
|
|
"epoch": 1.7766871165644171,
|
|
"grad_norm": 16.107815036818316,
|
|
"learning_rate": 8.239669421487603e-07,
|
|
"logits/chosen": -0.119140625,
|
|
"logits/rejected": -0.248046875,
|
|
"logps/chosen": -364.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0458,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.671875,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1448
|
|
},
|
|
{
|
|
"epoch": 1.7779141104294478,
|
|
"grad_norm": 10.545906451552389,
|
|
"learning_rate": 8.231404958677686e-07,
|
|
"logits/chosen": -0.035888671875,
|
|
"logits/rejected": -0.228515625,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.0364,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.7109375,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1449
|
|
},
|
|
{
|
|
"epoch": 1.7791411042944785,
|
|
"grad_norm": 11.22957614989993,
|
|
"learning_rate": 8.223140495867769e-07,
|
|
"logits/chosen": -0.193359375,
|
|
"logits/rejected": -0.36328125,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0357,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.4375,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"epoch": 1.7803680981595091,
|
|
"grad_norm": 7.976385598249082,
|
|
"learning_rate": 8.214876033057851e-07,
|
|
"logits/chosen": -0.10302734375,
|
|
"logits/rejected": -0.26171875,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0205,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.265625,
|
|
"rewards/margins": 13.4375,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 1451
|
|
},
|
|
{
|
|
"epoch": 1.7815950920245398,
|
|
"grad_norm": 10.110737179008327,
|
|
"learning_rate": 8.206611570247933e-07,
|
|
"logits/chosen": -0.3125,
|
|
"logits/rejected": -0.578125,
|
|
"logps/chosen": -466.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0163,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": 0.345703125,
|
|
"rewards/margins": 14.375,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1452
|
|
},
|
|
{
|
|
"epoch": 1.7828220858895705,
|
|
"grad_norm": 19.579068812216534,
|
|
"learning_rate": 8.198347107438016e-07,
|
|
"logits/chosen": -0.177734375,
|
|
"logits/rejected": -0.384765625,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0807,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.3046875,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1453
|
|
},
|
|
{
|
|
"epoch": 1.7840490797546011,
|
|
"grad_norm": 17.909563593809587,
|
|
"learning_rate": 8.190082644628099e-07,
|
|
"logits/chosen": -0.072265625,
|
|
"logits/rejected": -0.27734375,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0627,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.28125,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1454
|
|
},
|
|
{
|
|
"epoch": 1.7852760736196318,
|
|
"grad_norm": 7.975168709997291,
|
|
"learning_rate": 8.181818181818182e-07,
|
|
"logits/chosen": -0.1552734375,
|
|
"logits/rejected": -0.28125,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0383,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.734375,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"epoch": 1.7865030674846625,
|
|
"grad_norm": 6.451698136731205,
|
|
"learning_rate": 8.173553719008264e-07,
|
|
"logits/chosen": -0.1767578125,
|
|
"logits/rejected": -0.296875,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.0261,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1456
|
|
},
|
|
{
|
|
"epoch": 1.7877300613496931,
|
|
"grad_norm": 13.832898169450077,
|
|
"learning_rate": 8.165289256198347e-07,
|
|
"logits/chosen": -0.19921875,
|
|
"logits/rejected": -0.4296875,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0674,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.34375,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1457
|
|
},
|
|
{
|
|
"epoch": 1.7889570552147238,
|
|
"grad_norm": 11.950932725064204,
|
|
"learning_rate": 8.157024793388429e-07,
|
|
"logits/chosen": -0.05029296875,
|
|
"logits/rejected": -0.13671875,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0329,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.046875,
|
|
"rewards/margins": 11.3125,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1458
|
|
},
|
|
{
|
|
"epoch": 1.7901840490797545,
|
|
"grad_norm": 3299.794435885176,
|
|
"learning_rate": 8.148760330578512e-07,
|
|
"logits/chosen": -0.1591796875,
|
|
"logits/rejected": -0.388671875,
|
|
"logps/chosen": -612.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 20.9129,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -21.875,
|
|
"rewards/margins": -7.59375,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1459
|
|
},
|
|
{
|
|
"epoch": 1.7914110429447851,
|
|
"grad_norm": 6.622830365064994,
|
|
"learning_rate": 8.140495867768594e-07,
|
|
"logits/chosen": -0.125,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0256,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.421875,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"epoch": 1.7926380368098158,
|
|
"grad_norm": 13.881535402235917,
|
|
"learning_rate": 8.132231404958677e-07,
|
|
"logits/chosen": -0.12353515625,
|
|
"logits/rejected": -0.3359375,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.06,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.0546875,
|
|
"rewards/margins": 14.4375,
|
|
"rewards/rejected": -15.4375,
|
|
"step": 1461
|
|
},
|
|
{
|
|
"epoch": 1.7938650306748465,
|
|
"grad_norm": 10.348121505071811,
|
|
"learning_rate": 8.12396694214876e-07,
|
|
"logits/chosen": -0.12890625,
|
|
"logits/rejected": -0.2001953125,
|
|
"logps/chosen": -342.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0629,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.515625,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1462
|
|
},
|
|
{
|
|
"epoch": 1.7950920245398772,
|
|
"grad_norm": 6.932694869302806,
|
|
"learning_rate": 8.115702479338843e-07,
|
|
"logits/chosen": -0.05615234375,
|
|
"logits/rejected": -0.294921875,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0212,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.4140625,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1463
|
|
},
|
|
{
|
|
"epoch": 1.7963190184049078,
|
|
"grad_norm": 10.574264997532612,
|
|
"learning_rate": 8.107438016528926e-07,
|
|
"logits/chosen": -0.185546875,
|
|
"logits/rejected": -0.33203125,
|
|
"logps/chosen": -356.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0357,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.9296875,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1464
|
|
},
|
|
{
|
|
"epoch": 1.7975460122699385,
|
|
"grad_norm": 24.3418712342261,
|
|
"learning_rate": 8.099173553719008e-07,
|
|
"logits/chosen": -0.2294921875,
|
|
"logits/rejected": -0.35546875,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.1072,
|
|
"rewards/accuracies": 0.9453125,
|
|
"rewards/chosen": -1.03125,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"epoch": 1.7987730061349694,
|
|
"grad_norm": 6.3254317917292155,
|
|
"learning_rate": 8.09090909090909e-07,
|
|
"logits/chosen": -0.15234375,
|
|
"logits/rejected": -0.37109375,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0167,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.3828125,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1466
|
|
},
|
|
{
|
|
"epoch": 1.8,
|
|
"grad_norm": 16.570570079618726,
|
|
"learning_rate": 8.082644628099173e-07,
|
|
"logits/chosen": -0.2099609375,
|
|
"logits/rejected": -0.310546875,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0592,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.0078125,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.375,
|
|
"step": 1467
|
|
},
|
|
{
|
|
"epoch": 1.8012269938650307,
|
|
"grad_norm": 15.738865838591,
|
|
"learning_rate": 8.074380165289256e-07,
|
|
"logits/chosen": -0.09814453125,
|
|
"logits/rejected": -0.298828125,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0475,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.68359375,
|
|
"rewards/margins": 13.6875,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1468
|
|
},
|
|
{
|
|
"epoch": 1.8024539877300614,
|
|
"grad_norm": 9.667257990756262,
|
|
"learning_rate": 8.066115702479338e-07,
|
|
"logits/chosen": -0.08154296875,
|
|
"logits/rejected": -0.2265625,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0405,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.703125,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1469
|
|
},
|
|
{
|
|
"epoch": 1.803680981595092,
|
|
"grad_norm": 7.2948304370554755,
|
|
"learning_rate": 8.057851239669421e-07,
|
|
"logits/chosen": -0.0546875,
|
|
"logits/rejected": -0.28125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0337,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.171875,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"epoch": 1.8049079754601227,
|
|
"grad_norm": 7.708776699518576,
|
|
"learning_rate": 8.049586776859504e-07,
|
|
"logits/chosen": -0.0673828125,
|
|
"logits/rejected": -0.1748046875,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0273,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.578125,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -13.3125,
|
|
"step": 1471
|
|
},
|
|
{
|
|
"epoch": 1.8061349693251534,
|
|
"grad_norm": 10.50520663004266,
|
|
"learning_rate": 8.041322314049587e-07,
|
|
"logits/chosen": -0.1064453125,
|
|
"logits/rejected": -0.25,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0373,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.125,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1472
|
|
},
|
|
{
|
|
"epoch": 1.807361963190184,
|
|
"grad_norm": 11.220112442508238,
|
|
"learning_rate": 8.033057851239669e-07,
|
|
"logits/chosen": -0.1435546875,
|
|
"logits/rejected": -0.400390625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0543,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.5078125,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1473
|
|
},
|
|
{
|
|
"epoch": 1.8085889570552147,
|
|
"grad_norm": 14.056634161393513,
|
|
"learning_rate": 8.024793388429752e-07,
|
|
"logits/chosen": -0.01708984375,
|
|
"logits/rejected": -0.23046875,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.0377,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.625,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1474
|
|
},
|
|
{
|
|
"epoch": 1.8098159509202454,
|
|
"grad_norm": 9.423252953165358,
|
|
"learning_rate": 8.016528925619835e-07,
|
|
"logits/chosen": -0.1533203125,
|
|
"logits/rejected": -0.34375,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0342,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.796875,
|
|
"rewards/margins": 13.0625,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"epoch": 1.811042944785276,
|
|
"grad_norm": 15.296807299702936,
|
|
"learning_rate": 8.008264462809917e-07,
|
|
"logits/chosen": -0.1875,
|
|
"logits/rejected": -0.34375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0605,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.7421875,
|
|
"rewards/margins": 13.1875,
|
|
"rewards/rejected": -14.9375,
|
|
"step": 1476
|
|
},
|
|
{
|
|
"epoch": 1.8122699386503067,
|
|
"grad_norm": 18.125847891374626,
|
|
"learning_rate": 8e-07,
|
|
"logits/chosen": -0.062255859375,
|
|
"logits/rejected": -0.1884765625,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0854,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.671875,
|
|
"rewards/margins": 11.625,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1477
|
|
},
|
|
{
|
|
"epoch": 1.8134969325153374,
|
|
"grad_norm": 8.862440370155301,
|
|
"learning_rate": 7.991735537190082e-07,
|
|
"logits/chosen": -0.095703125,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0244,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.1875,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1478
|
|
},
|
|
{
|
|
"epoch": 1.814723926380368,
|
|
"grad_norm": 3.2080827187958083,
|
|
"learning_rate": 7.983471074380164e-07,
|
|
"logits/chosen": -0.1884765625,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0114,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.3515625,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 1479
|
|
},
|
|
{
|
|
"epoch": 1.8159509202453987,
|
|
"grad_norm": 6.483435633987567,
|
|
"learning_rate": 7.975206611570247e-07,
|
|
"logits/chosen": -0.267578125,
|
|
"logits/rejected": -0.408203125,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.0279,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.3515625,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"epoch": 1.8171779141104294,
|
|
"grad_norm": 13.364338309777926,
|
|
"learning_rate": 7.96694214876033e-07,
|
|
"logits/chosen": -0.2255859375,
|
|
"logits/rejected": -0.34375,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -460.0,
|
|
"loss": 0.0461,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.109375,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 1481
|
|
},
|
|
{
|
|
"epoch": 1.8184049079754603,
|
|
"grad_norm": 13.416142675368022,
|
|
"learning_rate": 7.958677685950412e-07,
|
|
"logits/chosen": -0.05126953125,
|
|
"logits/rejected": -0.212890625,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0868,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -2.140625,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1482
|
|
},
|
|
{
|
|
"epoch": 1.819631901840491,
|
|
"grad_norm": 18.062506501700554,
|
|
"learning_rate": 7.950413223140495e-07,
|
|
"logits/chosen": 0.01324462890625,
|
|
"logits/rejected": -0.150390625,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.1124,
|
|
"rewards/accuracies": 0.9453125,
|
|
"rewards/chosen": -2.828125,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1483
|
|
},
|
|
{
|
|
"epoch": 1.8208588957055216,
|
|
"grad_norm": 8.181265676234366,
|
|
"learning_rate": 7.942148760330578e-07,
|
|
"logits/chosen": -0.22265625,
|
|
"logits/rejected": -0.376953125,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0311,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.171875,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1484
|
|
},
|
|
{
|
|
"epoch": 1.8220858895705523,
|
|
"grad_norm": 11.44343043929689,
|
|
"learning_rate": 7.933884297520661e-07,
|
|
"logits/chosen": -0.208984375,
|
|
"logits/rejected": -0.240234375,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0357,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.421875,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"epoch": 1.823312883435583,
|
|
"grad_norm": 9.90427252004485,
|
|
"learning_rate": 7.925619834710744e-07,
|
|
"logits/chosen": -0.287109375,
|
|
"logits/rejected": -0.451171875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0462,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.265625,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -15.0,
|
|
"step": 1486
|
|
},
|
|
{
|
|
"epoch": 1.8245398773006136,
|
|
"grad_norm": 7.184480583156823,
|
|
"learning_rate": 7.917355371900826e-07,
|
|
"logits/chosen": -0.34375,
|
|
"logits/rejected": -0.51171875,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0243,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.4296875,
|
|
"rewards/margins": 13.5,
|
|
"rewards/rejected": -14.875,
|
|
"step": 1487
|
|
},
|
|
{
|
|
"epoch": 1.8257668711656443,
|
|
"grad_norm": 12.853477099110478,
|
|
"learning_rate": 7.909090909090909e-07,
|
|
"logits/chosen": -0.1953125,
|
|
"logits/rejected": -0.462890625,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0523,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.40625,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 1488
|
|
},
|
|
{
|
|
"epoch": 1.826993865030675,
|
|
"grad_norm": 8.176432782897919,
|
|
"learning_rate": 7.900826446280992e-07,
|
|
"logits/chosen": -0.3359375,
|
|
"logits/rejected": -0.54296875,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0293,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.4140625,
|
|
"rewards/margins": 13.9375,
|
|
"rewards/rejected": -15.375,
|
|
"step": 1489
|
|
},
|
|
{
|
|
"epoch": 1.8282208588957056,
|
|
"grad_norm": 7.731766346251227,
|
|
"learning_rate": 7.892561983471075e-07,
|
|
"logits/chosen": -0.1826171875,
|
|
"logits/rejected": -0.408203125,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0241,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.953125,
|
|
"rewards/margins": 13.875,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"epoch": 1.8294478527607363,
|
|
"grad_norm": 4.739968760458063,
|
|
"learning_rate": 7.884297520661157e-07,
|
|
"logits/chosen": -0.2080078125,
|
|
"logits/rejected": -0.466796875,
|
|
"logps/chosen": -498.0,
|
|
"logps/rejected": -474.0,
|
|
"loss": 0.0148,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.59375,
|
|
"rewards/margins": 14.5,
|
|
"rewards/rejected": -15.0625,
|
|
"step": 1491
|
|
},
|
|
{
|
|
"epoch": 1.830674846625767,
|
|
"grad_norm": 16.34711580837951,
|
|
"learning_rate": 7.87603305785124e-07,
|
|
"logits/chosen": -0.341796875,
|
|
"logits/rejected": -0.498046875,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0526,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.5078125,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1492
|
|
},
|
|
{
|
|
"epoch": 1.8319018404907976,
|
|
"grad_norm": 7.107963413840639,
|
|
"learning_rate": 7.867768595041322e-07,
|
|
"logits/chosen": -0.30859375,
|
|
"logits/rejected": -0.427734375,
|
|
"logps/chosen": -344.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0294,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.484375,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 1493
|
|
},
|
|
{
|
|
"epoch": 1.8331288343558283,
|
|
"grad_norm": 5.613408975161089,
|
|
"learning_rate": 7.859504132231404e-07,
|
|
"logits/chosen": -0.24609375,
|
|
"logits/rejected": -0.38671875,
|
|
"logps/chosen": -458.0,
|
|
"logps/rejected": -466.0,
|
|
"loss": 0.0217,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.84375,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -15.125,
|
|
"step": 1494
|
|
},
|
|
{
|
|
"epoch": 1.834355828220859,
|
|
"grad_norm": 13.098254113739143,
|
|
"learning_rate": 7.851239669421487e-07,
|
|
"logits/chosen": -0.2080078125,
|
|
"logits/rejected": -0.373046875,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0443,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.421875,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"epoch": 1.8355828220858896,
|
|
"grad_norm": 8.78117635480224,
|
|
"learning_rate": 7.842975206611569e-07,
|
|
"logits/chosen": -0.1513671875,
|
|
"logits/rejected": -0.294921875,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0318,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1484375,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.5,
|
|
"step": 1496
|
|
},
|
|
{
|
|
"epoch": 1.8368098159509203,
|
|
"grad_norm": 8.273148884106954,
|
|
"learning_rate": 7.834710743801652e-07,
|
|
"logits/chosen": -0.1396484375,
|
|
"logits/rejected": -0.380859375,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.025,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.0078125,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1497
|
|
},
|
|
{
|
|
"epoch": 1.838036809815951,
|
|
"grad_norm": 21.138608747159992,
|
|
"learning_rate": 7.826446280991735e-07,
|
|
"logits/chosen": -0.31640625,
|
|
"logits/rejected": -0.50390625,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -460.0,
|
|
"loss": 0.0906,
|
|
"rewards/accuracies": 0.953125,
|
|
"rewards/chosen": -0.97265625,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1498
|
|
},
|
|
{
|
|
"epoch": 1.8392638036809816,
|
|
"grad_norm": 13.450717371026645,
|
|
"learning_rate": 7.818181818181818e-07,
|
|
"logits/chosen": -0.11328125,
|
|
"logits/rejected": -0.3046875,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0579,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.21875,
|
|
"rewards/margins": 12.8125,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1499
|
|
},
|
|
{
|
|
"epoch": 1.8404907975460123,
|
|
"grad_norm": 9.5168049111157,
|
|
"learning_rate": 7.8099173553719e-07,
|
|
"logits/chosen": -0.14453125,
|
|
"logits/rejected": -0.3671875,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -370.0,
|
|
"loss": 0.0395,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.5234375,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -13.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"epoch": 1.841717791411043,
|
|
"grad_norm": 10.638498503833137,
|
|
"learning_rate": 7.801652892561983e-07,
|
|
"logits/chosen": -0.142578125,
|
|
"logits/rejected": -0.279296875,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0422,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.046875,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1501
|
|
},
|
|
{
|
|
"epoch": 1.8429447852760736,
|
|
"grad_norm": 13.694183232767102,
|
|
"learning_rate": 7.793388429752066e-07,
|
|
"logits/chosen": -0.09912109375,
|
|
"logits/rejected": -0.208984375,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0659,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.46875,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1502
|
|
},
|
|
{
|
|
"epoch": 1.8441717791411043,
|
|
"grad_norm": 4.563452214084135,
|
|
"learning_rate": 7.785123966942149e-07,
|
|
"logits/chosen": -0.205078125,
|
|
"logits/rejected": -0.419921875,
|
|
"logps/chosen": -446.0,
|
|
"logps/rejected": -484.0,
|
|
"loss": 0.0171,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.1328125,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -14.5,
|
|
"step": 1503
|
|
},
|
|
{
|
|
"epoch": 1.845398773006135,
|
|
"grad_norm": 7.091255084250044,
|
|
"learning_rate": 7.776859504132232e-07,
|
|
"logits/chosen": -0.263671875,
|
|
"logits/rejected": -0.416015625,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0262,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.359375,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1504
|
|
},
|
|
{
|
|
"epoch": 1.8466257668711656,
|
|
"grad_norm": 6.848767113677235,
|
|
"learning_rate": 7.768595041322314e-07,
|
|
"logits/chosen": -0.2421875,
|
|
"logits/rejected": -0.41015625,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.03,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.6328125,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"epoch": 1.8478527607361963,
|
|
"grad_norm": 9.273171488865707,
|
|
"learning_rate": 7.760330578512397e-07,
|
|
"logits/chosen": -0.1826171875,
|
|
"logits/rejected": -0.361328125,
|
|
"logps/chosen": -374.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0338,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.140625,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1506
|
|
},
|
|
{
|
|
"epoch": 1.849079754601227,
|
|
"grad_norm": 10.64315051922298,
|
|
"learning_rate": 7.752066115702479e-07,
|
|
"logits/chosen": -0.1640625,
|
|
"logits/rejected": -0.3828125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0352,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.421875,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1507
|
|
},
|
|
{
|
|
"epoch": 1.8503067484662576,
|
|
"grad_norm": 7.6047839394533625,
|
|
"learning_rate": 7.743801652892562e-07,
|
|
"logits/chosen": -0.07275390625,
|
|
"logits/rejected": -0.24609375,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0298,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.203125,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1508
|
|
},
|
|
{
|
|
"epoch": 1.8515337423312883,
|
|
"grad_norm": 5.493283871607361,
|
|
"learning_rate": 7.735537190082644e-07,
|
|
"logits/chosen": -0.1640625,
|
|
"logits/rejected": -0.3671875,
|
|
"logps/chosen": -464.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0194,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.4453125,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1509
|
|
},
|
|
{
|
|
"epoch": 1.852760736196319,
|
|
"grad_norm": 5.24900957883192,
|
|
"learning_rate": 7.727272727272727e-07,
|
|
"logits/chosen": -0.1328125,
|
|
"logits/rejected": -0.3828125,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.016,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.265625,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"epoch": 1.8539877300613496,
|
|
"grad_norm": 6.181938286000045,
|
|
"learning_rate": 7.719008264462809e-07,
|
|
"logits/chosen": -0.212890625,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -482.0,
|
|
"loss": 0.0154,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.296875,
|
|
"rewards/margins": 13.4375,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1511
|
|
},
|
|
{
|
|
"epoch": 1.8552147239263803,
|
|
"grad_norm": 10.451305753039685,
|
|
"learning_rate": 7.710743801652892e-07,
|
|
"logits/chosen": -0.154296875,
|
|
"logits/rejected": -0.384765625,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0251,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.8359375,
|
|
"rewards/margins": 13.5,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1512
|
|
},
|
|
{
|
|
"epoch": 1.856441717791411,
|
|
"grad_norm": 13.462785355394733,
|
|
"learning_rate": 7.702479338842975e-07,
|
|
"logits/chosen": -0.1552734375,
|
|
"logits/rejected": -0.3828125,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0468,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.453125,
|
|
"rewards/margins": 13.0625,
|
|
"rewards/rejected": -14.5,
|
|
"step": 1513
|
|
},
|
|
{
|
|
"epoch": 1.8576687116564417,
|
|
"grad_norm": 9.524803750366768,
|
|
"learning_rate": 7.694214876033057e-07,
|
|
"logits/chosen": -0.201171875,
|
|
"logits/rejected": -0.384765625,
|
|
"logps/chosen": -430.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0411,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.4375,
|
|
"rewards/margins": 14.125,
|
|
"rewards/rejected": -15.5625,
|
|
"step": 1514
|
|
},
|
|
{
|
|
"epoch": 1.8588957055214723,
|
|
"grad_norm": 5.894843489816778,
|
|
"learning_rate": 7.68595041322314e-07,
|
|
"logits/chosen": -0.2275390625,
|
|
"logits/rejected": -0.455078125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0171,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.50390625,
|
|
"rewards/margins": 14.0625,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"epoch": 1.860122699386503,
|
|
"grad_norm": 11.494715146279521,
|
|
"learning_rate": 7.677685950413223e-07,
|
|
"logits/chosen": -0.1845703125,
|
|
"logits/rejected": -0.330078125,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0391,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.703125,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -14.875,
|
|
"step": 1516
|
|
},
|
|
{
|
|
"epoch": 1.8613496932515337,
|
|
"grad_norm": 2.178911266960936,
|
|
"learning_rate": 7.669421487603306e-07,
|
|
"logits/chosen": -0.228515625,
|
|
"logits/rejected": -0.431640625,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0089,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.0078125,
|
|
"rewards/margins": 14.375,
|
|
"rewards/rejected": -15.375,
|
|
"step": 1517
|
|
},
|
|
{
|
|
"epoch": 1.8625766871165643,
|
|
"grad_norm": 13.576294310507379,
|
|
"learning_rate": 7.661157024793388e-07,
|
|
"logits/chosen": -0.24609375,
|
|
"logits/rejected": -0.4453125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0582,
|
|
"rewards/accuracies": 0.953125,
|
|
"rewards/chosen": -1.8203125,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -15.1875,
|
|
"step": 1518
|
|
},
|
|
{
|
|
"epoch": 1.863803680981595,
|
|
"grad_norm": 20.061133205285515,
|
|
"learning_rate": 7.65289256198347e-07,
|
|
"logits/chosen": -0.2373046875,
|
|
"logits/rejected": -0.359375,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.0866,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.8125,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -15.1875,
|
|
"step": 1519
|
|
},
|
|
{
|
|
"epoch": 1.8650306748466257,
|
|
"grad_norm": 14.129015471911169,
|
|
"learning_rate": 7.644628099173553e-07,
|
|
"logits/chosen": -0.228515625,
|
|
"logits/rejected": -0.314453125,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0509,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.3125,
|
|
"rewards/margins": 13.1875,
|
|
"rewards/rejected": -15.5,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"epoch": 1.8662576687116563,
|
|
"grad_norm": 12.106552118774427,
|
|
"learning_rate": 7.636363636363636e-07,
|
|
"logits/chosen": -0.1416015625,
|
|
"logits/rejected": -0.34375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.057,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.46875,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -14.875,
|
|
"step": 1521
|
|
},
|
|
{
|
|
"epoch": 1.867484662576687,
|
|
"grad_norm": 12.525306037497732,
|
|
"learning_rate": 7.628099173553718e-07,
|
|
"logits/chosen": -0.1708984375,
|
|
"logits/rejected": -0.365234375,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.056,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.8515625,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1522
|
|
},
|
|
{
|
|
"epoch": 1.8687116564417177,
|
|
"grad_norm": 8.669313542817841,
|
|
"learning_rate": 7.619834710743801e-07,
|
|
"logits/chosen": -0.240234375,
|
|
"logits/rejected": -0.3828125,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0315,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.7265625,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -14.875,
|
|
"step": 1523
|
|
},
|
|
{
|
|
"epoch": 1.8699386503067483,
|
|
"grad_norm": 7.171137359247992,
|
|
"learning_rate": 7.611570247933884e-07,
|
|
"logits/chosen": -0.09375,
|
|
"logits/rejected": -0.25390625,
|
|
"logps/chosen": -368.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0247,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.734375,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -15.3125,
|
|
"step": 1524
|
|
},
|
|
{
|
|
"epoch": 1.871165644171779,
|
|
"grad_norm": 12.486897148967087,
|
|
"learning_rate": 7.603305785123967e-07,
|
|
"logits/chosen": -0.2158203125,
|
|
"logits/rejected": -0.373046875,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0349,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.46875,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"epoch": 1.8723926380368097,
|
|
"grad_norm": 9.946526391656043,
|
|
"learning_rate": 7.59504132231405e-07,
|
|
"logits/chosen": -0.08154296875,
|
|
"logits/rejected": -0.275390625,
|
|
"logps/chosen": -432.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0415,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.5234375,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1526
|
|
},
|
|
{
|
|
"epoch": 1.8736196319018403,
|
|
"grad_norm": 12.598698164695472,
|
|
"learning_rate": 7.586776859504132e-07,
|
|
"logits/chosen": -0.1162109375,
|
|
"logits/rejected": -0.333984375,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0457,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.75,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1527
|
|
},
|
|
{
|
|
"epoch": 1.874846625766871,
|
|
"grad_norm": 16.241862409012366,
|
|
"learning_rate": 7.578512396694215e-07,
|
|
"logits/chosen": -0.080078125,
|
|
"logits/rejected": -0.3046875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -396.0,
|
|
"loss": 0.0927,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.640625,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -14.875,
|
|
"step": 1528
|
|
},
|
|
{
|
|
"epoch": 1.876073619631902,
|
|
"grad_norm": 2.993809987176909,
|
|
"learning_rate": 7.570247933884297e-07,
|
|
"logits/chosen": -0.2109375,
|
|
"logits/rejected": -0.455078125,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0091,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -0.51171875,
|
|
"rewards/margins": 15.0,
|
|
"rewards/rejected": -15.5,
|
|
"step": 1529
|
|
},
|
|
{
|
|
"epoch": 1.8773006134969326,
|
|
"grad_norm": 9.513712024522786,
|
|
"learning_rate": 7.56198347107438e-07,
|
|
"logits/chosen": -0.197265625,
|
|
"logits/rejected": -0.34375,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -400.0,
|
|
"loss": 0.0345,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.921875,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -15.8125,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"epoch": 1.8785276073619632,
|
|
"grad_norm": 7.006523582079429,
|
|
"learning_rate": 7.553719008264462e-07,
|
|
"logits/chosen": -0.048828125,
|
|
"logits/rejected": -0.203125,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0279,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.671875,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -15.0625,
|
|
"step": 1531
|
|
},
|
|
{
|
|
"epoch": 1.879754601226994,
|
|
"grad_norm": 10.676992819808984,
|
|
"learning_rate": 7.545454545454545e-07,
|
|
"logits/chosen": -0.330078125,
|
|
"logits/rejected": -0.49609375,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -476.0,
|
|
"loss": 0.0436,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.83984375,
|
|
"rewards/margins": 14.75,
|
|
"rewards/rejected": -15.5625,
|
|
"step": 1532
|
|
},
|
|
{
|
|
"epoch": 1.8809815950920246,
|
|
"grad_norm": 12.974034958143907,
|
|
"learning_rate": 7.537190082644627e-07,
|
|
"logits/chosen": -0.12158203125,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0445,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.109375,
|
|
"rewards/margins": 12.0,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1533
|
|
},
|
|
{
|
|
"epoch": 1.8822085889570552,
|
|
"grad_norm": 11.78612785274464,
|
|
"learning_rate": 7.52892561983471e-07,
|
|
"logits/chosen": -0.20703125,
|
|
"logits/rejected": -0.34765625,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0375,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.65625,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -15.4375,
|
|
"step": 1534
|
|
},
|
|
{
|
|
"epoch": 1.883435582822086,
|
|
"grad_norm": 12.331006996175937,
|
|
"learning_rate": 7.520661157024793e-07,
|
|
"logits/chosen": -0.049072265625,
|
|
"logits/rejected": -0.31640625,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -386.0,
|
|
"loss": 0.0727,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.4765625,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"epoch": 1.8846625766871166,
|
|
"grad_norm": 16.765850483219367,
|
|
"learning_rate": 7.512396694214875e-07,
|
|
"logits/chosen": -0.06298828125,
|
|
"logits/rejected": -0.248046875,
|
|
"logps/chosen": -478.0,
|
|
"logps/rejected": -468.0,
|
|
"loss": 0.0885,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.765625,
|
|
"rewards/margins": 12.6875,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1536
|
|
},
|
|
{
|
|
"epoch": 1.8858895705521472,
|
|
"grad_norm": 2.7485005320139124,
|
|
"learning_rate": 7.504132231404958e-07,
|
|
"logits/chosen": -0.1220703125,
|
|
"logits/rejected": -0.357421875,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0087,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.671875,
|
|
"rewards/margins": 13.0625,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1537
|
|
},
|
|
{
|
|
"epoch": 1.887116564417178,
|
|
"grad_norm": 12.602800676345558,
|
|
"learning_rate": 7.495867768595041e-07,
|
|
"logits/chosen": -0.10986328125,
|
|
"logits/rejected": -0.267578125,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0314,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.0546875,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1538
|
|
},
|
|
{
|
|
"epoch": 1.8883435582822086,
|
|
"grad_norm": 3.5133244640890138,
|
|
"learning_rate": 7.487603305785124e-07,
|
|
"logits/chosen": -0.01611328125,
|
|
"logits/rejected": -0.251953125,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0136,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.6875,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1539
|
|
},
|
|
{
|
|
"epoch": 1.8895705521472392,
|
|
"grad_norm": 7.119436687638344,
|
|
"learning_rate": 7.479338842975206e-07,
|
|
"logits/chosen": -0.3046875,
|
|
"logits/rejected": -0.4453125,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -490.0,
|
|
"loss": 0.0208,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.125,
|
|
"rewards/margins": 13.1875,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"epoch": 1.89079754601227,
|
|
"grad_norm": 11.572169999605313,
|
|
"learning_rate": 7.471074380165289e-07,
|
|
"logits/chosen": -0.251953125,
|
|
"logits/rejected": -0.416015625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0563,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.6171875,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1541
|
|
},
|
|
{
|
|
"epoch": 1.8920245398773006,
|
|
"grad_norm": 5.8629742402764595,
|
|
"learning_rate": 7.462809917355372e-07,
|
|
"logits/chosen": -0.2099609375,
|
|
"logits/rejected": -0.390625,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0168,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.86328125,
|
|
"rewards/margins": 14.0625,
|
|
"rewards/rejected": -14.9375,
|
|
"step": 1542
|
|
},
|
|
{
|
|
"epoch": 1.8932515337423312,
|
|
"grad_norm": 5.281836941502651,
|
|
"learning_rate": 7.454545454545455e-07,
|
|
"logits/chosen": -0.205078125,
|
|
"logits/rejected": -0.375,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.018,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.4921875,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 1543
|
|
},
|
|
{
|
|
"epoch": 1.8944785276073621,
|
|
"grad_norm": 8.540563113484346,
|
|
"learning_rate": 7.446280991735538e-07,
|
|
"logits/chosen": -0.2578125,
|
|
"logits/rejected": -0.423828125,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -474.0,
|
|
"loss": 0.026,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.3828125,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 1544
|
|
},
|
|
{
|
|
"epoch": 1.8957055214723928,
|
|
"grad_norm": 12.375691683062389,
|
|
"learning_rate": 7.43801652892562e-07,
|
|
"logits/chosen": -0.1328125,
|
|
"logits/rejected": -0.345703125,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.049,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.171875,
|
|
"rewards/margins": 11.5625,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"epoch": 1.8969325153374235,
|
|
"grad_norm": 20.0893097112506,
|
|
"learning_rate": 7.429752066115703e-07,
|
|
"logits/chosen": -0.1767578125,
|
|
"logits/rejected": -0.357421875,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0485,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.7734375,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1546
|
|
},
|
|
{
|
|
"epoch": 1.8981595092024541,
|
|
"grad_norm": 10.335715206456626,
|
|
"learning_rate": 7.421487603305784e-07,
|
|
"logits/chosen": -0.162109375,
|
|
"logits/rejected": -0.5,
|
|
"logps/chosen": -508.0,
|
|
"logps/rejected": -440.0,
|
|
"loss": 0.0387,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.40625,
|
|
"rewards/margins": 13.5625,
|
|
"rewards/rejected": -14.9375,
|
|
"step": 1547
|
|
},
|
|
{
|
|
"epoch": 1.8993865030674848,
|
|
"grad_norm": 19.072960495868333,
|
|
"learning_rate": 7.413223140495867e-07,
|
|
"logits/chosen": -0.16796875,
|
|
"logits/rejected": -0.21484375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.049,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.09375,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 1548
|
|
},
|
|
{
|
|
"epoch": 1.9006134969325155,
|
|
"grad_norm": 6.11625064079758,
|
|
"learning_rate": 7.404958677685949e-07,
|
|
"logits/chosen": -0.054443359375,
|
|
"logits/rejected": -0.28125,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.025,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.8125,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1549
|
|
},
|
|
{
|
|
"epoch": 1.9018404907975461,
|
|
"grad_norm": 12.537023686920781,
|
|
"learning_rate": 7.396694214876032e-07,
|
|
"logits/chosen": -0.201171875,
|
|
"logits/rejected": -0.3046875,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.044,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.78125,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -15.1875,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"epoch": 1.9030674846625768,
|
|
"grad_norm": 10.772519895679293,
|
|
"learning_rate": 7.388429752066115e-07,
|
|
"logits/chosen": -0.21875,
|
|
"logits/rejected": -0.435546875,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0351,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1551
|
|
},
|
|
{
|
|
"epoch": 1.9042944785276075,
|
|
"grad_norm": 12.666754566617103,
|
|
"learning_rate": 7.380165289256198e-07,
|
|
"logits/chosen": -0.1396484375,
|
|
"logits/rejected": -0.271484375,
|
|
"logps/chosen": -376.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.0577,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.984375,
|
|
"rewards/margins": 11.0,
|
|
"rewards/rejected": -13.0,
|
|
"step": 1552
|
|
},
|
|
{
|
|
"epoch": 1.9055214723926381,
|
|
"grad_norm": 6.969793207195761,
|
|
"learning_rate": 7.371900826446281e-07,
|
|
"logits/chosen": -0.07861328125,
|
|
"logits/rejected": -0.205078125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -382.0,
|
|
"loss": 0.0193,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.7421875,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -14.0,
|
|
"step": 1553
|
|
},
|
|
{
|
|
"epoch": 1.9067484662576688,
|
|
"grad_norm": 11.935809288218362,
|
|
"learning_rate": 7.363636363636363e-07,
|
|
"logits/chosen": -0.296875,
|
|
"logits/rejected": -0.5546875,
|
|
"logps/chosen": -440.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0325,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.3828125,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1554
|
|
},
|
|
{
|
|
"epoch": 1.9079754601226995,
|
|
"grad_norm": 10.547646827650535,
|
|
"learning_rate": 7.355371900826446e-07,
|
|
"logits/chosen": -0.310546875,
|
|
"logits/rejected": -0.322265625,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0324,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.7890625,
|
|
"rewards/margins": 12.5,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"epoch": 1.9092024539877301,
|
|
"grad_norm": 5.626132483362647,
|
|
"learning_rate": 7.347107438016529e-07,
|
|
"logits/chosen": -0.10595703125,
|
|
"logits/rejected": -0.34375,
|
|
"logps/chosen": -426.0,
|
|
"logps/rejected": -416.0,
|
|
"loss": 0.0202,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.40625,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1556
|
|
},
|
|
{
|
|
"epoch": 1.9104294478527608,
|
|
"grad_norm": 12.406478226571439,
|
|
"learning_rate": 7.338842975206612e-07,
|
|
"logits/chosen": -0.013916015625,
|
|
"logits/rejected": -0.2734375,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -438.0,
|
|
"loss": 0.0522,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.7734375,
|
|
"rewards/margins": 11.75,
|
|
"rewards/rejected": -13.5625,
|
|
"step": 1557
|
|
},
|
|
{
|
|
"epoch": 1.9116564417177915,
|
|
"grad_norm": 13.715039413680758,
|
|
"learning_rate": 7.330578512396694e-07,
|
|
"logits/chosen": -0.1884765625,
|
|
"logits/rejected": -0.349609375,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0292,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.91015625,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1558
|
|
},
|
|
{
|
|
"epoch": 1.9128834355828221,
|
|
"grad_norm": 8.338422782672891,
|
|
"learning_rate": 7.322314049586777e-07,
|
|
"logits/chosen": -0.032958984375,
|
|
"logits/rejected": -0.12890625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -380.0,
|
|
"loss": 0.0317,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.9765625,
|
|
"rewards/margins": 11.8125,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1559
|
|
},
|
|
{
|
|
"epoch": 1.9141104294478528,
|
|
"grad_norm": 12.074418171132558,
|
|
"learning_rate": 7.31404958677686e-07,
|
|
"logits/chosen": -0.10107421875,
|
|
"logits/rejected": -0.298828125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0541,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.421875,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -14.375,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"epoch": 1.9153374233128835,
|
|
"grad_norm": 15.37715368474599,
|
|
"learning_rate": 7.305785123966942e-07,
|
|
"logits/chosen": -0.2001953125,
|
|
"logits/rejected": -0.478515625,
|
|
"logps/chosen": -470.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0633,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.7734375,
|
|
"rewards/margins": 13.75,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1561
|
|
},
|
|
{
|
|
"epoch": 1.9165644171779141,
|
|
"grad_norm": 11.339393590564708,
|
|
"learning_rate": 7.297520661157024e-07,
|
|
"logits/chosen": -0.2197265625,
|
|
"logits/rejected": -0.435546875,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.0274,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": 0.026611328125,
|
|
"rewards/margins": 13.4375,
|
|
"rewards/rejected": -13.375,
|
|
"step": 1562
|
|
},
|
|
{
|
|
"epoch": 1.9177914110429448,
|
|
"grad_norm": 7.792629495875165,
|
|
"learning_rate": 7.289256198347107e-07,
|
|
"logits/chosen": -0.1796875,
|
|
"logits/rejected": -0.41796875,
|
|
"logps/chosen": -418.0,
|
|
"logps/rejected": -426.0,
|
|
"loss": 0.0375,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.65234375,
|
|
"rewards/margins": 13.5,
|
|
"rewards/rejected": -14.125,
|
|
"step": 1563
|
|
},
|
|
{
|
|
"epoch": 1.9190184049079755,
|
|
"grad_norm": 2.6371817425478614,
|
|
"learning_rate": 7.28099173553719e-07,
|
|
"logits/chosen": -0.1748046875,
|
|
"logits/rejected": -0.3671875,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0088,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.5546875,
|
|
"rewards/margins": 11.875,
|
|
"rewards/rejected": -13.4375,
|
|
"step": 1564
|
|
},
|
|
{
|
|
"epoch": 1.9202453987730062,
|
|
"grad_norm": 6.0361304321411495,
|
|
"learning_rate": 7.272727272727272e-07,
|
|
"logits/chosen": -0.306640625,
|
|
"logits/rejected": -0.50390625,
|
|
"logps/chosen": -334.0,
|
|
"logps/rejected": -368.0,
|
|
"loss": 0.0248,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.71875,
|
|
"rewards/margins": 13.5625,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"epoch": 1.9214723926380368,
|
|
"grad_norm": 15.99984528178758,
|
|
"learning_rate": 7.264462809917355e-07,
|
|
"logits/chosen": -0.138671875,
|
|
"logits/rejected": -0.28125,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0693,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.65234375,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -13.8125,
|
|
"step": 1566
|
|
},
|
|
{
|
|
"epoch": 1.9226993865030675,
|
|
"grad_norm": 12.13372536905135,
|
|
"learning_rate": 7.256198347107437e-07,
|
|
"logits/chosen": -0.16796875,
|
|
"logits/rejected": -0.32421875,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0462,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.3125,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -14.0625,
|
|
"step": 1567
|
|
},
|
|
{
|
|
"epoch": 1.9239263803680982,
|
|
"grad_norm": 14.209951191797739,
|
|
"learning_rate": 7.24793388429752e-07,
|
|
"logits/chosen": -0.12158203125,
|
|
"logits/rejected": -0.353515625,
|
|
"logps/chosen": -410.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.0532,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -0.5625,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -13.6875,
|
|
"step": 1568
|
|
},
|
|
{
|
|
"epoch": 1.9251533742331288,
|
|
"grad_norm": 7.04354544652744,
|
|
"learning_rate": 7.239669421487603e-07,
|
|
"logits/chosen": 0.001983642578125,
|
|
"logits/rejected": -0.1484375,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -398.0,
|
|
"loss": 0.0136,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.484375,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1569
|
|
},
|
|
{
|
|
"epoch": 1.9263803680981595,
|
|
"grad_norm": 5.304297061872547,
|
|
"learning_rate": 7.231404958677686e-07,
|
|
"logits/chosen": -0.1357421875,
|
|
"logits/rejected": -0.369140625,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0251,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.640625,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -13.75,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"epoch": 1.9276073619631902,
|
|
"grad_norm": 10.278636413268362,
|
|
"learning_rate": 7.223140495867768e-07,
|
|
"logits/chosen": -0.1689453125,
|
|
"logits/rejected": -0.326171875,
|
|
"logps/chosen": -444.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.0537,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.2109375,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1571
|
|
},
|
|
{
|
|
"epoch": 1.9288343558282208,
|
|
"grad_norm": 4.917396618428534,
|
|
"learning_rate": 7.214876033057851e-07,
|
|
"logits/chosen": -0.216796875,
|
|
"logits/rejected": -0.4296875,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0102,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.15625,
|
|
"rewards/margins": 13.8125,
|
|
"rewards/rejected": -14.9375,
|
|
"step": 1572
|
|
},
|
|
{
|
|
"epoch": 1.9300613496932515,
|
|
"grad_norm": 11.131774953589117,
|
|
"learning_rate": 7.206611570247934e-07,
|
|
"logits/chosen": -0.205078125,
|
|
"logits/rejected": -0.341796875,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -424.0,
|
|
"loss": 0.0476,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.390625,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -14.5,
|
|
"step": 1573
|
|
},
|
|
{
|
|
"epoch": 1.9312883435582822,
|
|
"grad_norm": 9.981916907725461,
|
|
"learning_rate": 7.198347107438016e-07,
|
|
"logits/chosen": -0.06396484375,
|
|
"logits/rejected": -0.2021484375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0321,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1574
|
|
},
|
|
{
|
|
"epoch": 1.9325153374233128,
|
|
"grad_norm": 14.02643231888889,
|
|
"learning_rate": 7.190082644628099e-07,
|
|
"logits/chosen": -0.197265625,
|
|
"logits/rejected": -0.33984375,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.0729,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.28125,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"epoch": 1.9337423312883435,
|
|
"grad_norm": 13.206619390046587,
|
|
"learning_rate": 7.181818181818181e-07,
|
|
"logits/chosen": -0.1962890625,
|
|
"logits/rejected": -0.416015625,
|
|
"logps/chosen": -396.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0351,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.515625,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -15.25,
|
|
"step": 1576
|
|
},
|
|
{
|
|
"epoch": 1.9349693251533742,
|
|
"grad_norm": 8.628626362271302,
|
|
"learning_rate": 7.173553719008264e-07,
|
|
"logits/chosen": -0.14453125,
|
|
"logits/rejected": -0.337890625,
|
|
"logps/chosen": -406.0,
|
|
"logps/rejected": -378.0,
|
|
"loss": 0.0292,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.87890625,
|
|
"rewards/margins": 13.875,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1577
|
|
},
|
|
{
|
|
"epoch": 1.9361963190184048,
|
|
"grad_norm": 9.252275671498813,
|
|
"learning_rate": 7.165289256198347e-07,
|
|
"logits/chosen": -0.1669921875,
|
|
"logits/rejected": -0.341796875,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0358,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.84375,
|
|
"rewards/margins": 13.875,
|
|
"rewards/rejected": -15.75,
|
|
"step": 1578
|
|
},
|
|
{
|
|
"epoch": 1.9374233128834355,
|
|
"grad_norm": 10.574155078620965,
|
|
"learning_rate": 7.15702479338843e-07,
|
|
"logits/chosen": -0.193359375,
|
|
"logits/rejected": -0.3046875,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0284,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.7890625,
|
|
"rewards/margins": 13.5,
|
|
"rewards/rejected": -15.25,
|
|
"step": 1579
|
|
},
|
|
{
|
|
"epoch": 1.9386503067484662,
|
|
"grad_norm": 10.432760638611116,
|
|
"learning_rate": 7.148760330578512e-07,
|
|
"logits/chosen": -0.1953125,
|
|
"logits/rejected": -0.42578125,
|
|
"logps/chosen": -462.0,
|
|
"logps/rejected": -450.0,
|
|
"loss": 0.0281,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1484375,
|
|
"rewards/margins": 13.8125,
|
|
"rewards/rejected": -15.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"epoch": 1.9398773006134968,
|
|
"grad_norm": 6.639958720647097,
|
|
"learning_rate": 7.140495867768595e-07,
|
|
"logits/chosen": -0.146484375,
|
|
"logits/rejected": -0.3046875,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -444.0,
|
|
"loss": 0.0185,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.5,
|
|
"rewards/margins": 13.6875,
|
|
"rewards/rejected": -15.1875,
|
|
"step": 1581
|
|
},
|
|
{
|
|
"epoch": 1.9411042944785275,
|
|
"grad_norm": 6.827592238478363,
|
|
"learning_rate": 7.132231404958677e-07,
|
|
"logits/chosen": -0.076171875,
|
|
"logits/rejected": -0.197265625,
|
|
"logps/chosen": -354.0,
|
|
"logps/rejected": -388.0,
|
|
"loss": 0.0374,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.53125,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 1582
|
|
},
|
|
{
|
|
"epoch": 1.9423312883435582,
|
|
"grad_norm": 12.802796544727078,
|
|
"learning_rate": 7.12396694214876e-07,
|
|
"logits/chosen": -0.1689453125,
|
|
"logits/rejected": -0.349609375,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0566,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.1640625,
|
|
"rewards/margins": 13.625,
|
|
"rewards/rejected": -14.8125,
|
|
"step": 1583
|
|
},
|
|
{
|
|
"epoch": 1.9435582822085888,
|
|
"grad_norm": 19.067684481237826,
|
|
"learning_rate": 7.115702479338843e-07,
|
|
"logits/chosen": -0.1298828125,
|
|
"logits/rejected": -0.32421875,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0965,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.09375,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1584
|
|
},
|
|
{
|
|
"epoch": 1.9447852760736195,
|
|
"grad_norm": 16.97072434557295,
|
|
"learning_rate": 7.107438016528925e-07,
|
|
"logits/chosen": -0.2294921875,
|
|
"logits/rejected": -0.376953125,
|
|
"logps/chosen": -438.0,
|
|
"logps/rejected": -466.0,
|
|
"loss": 0.052,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1796875,
|
|
"rewards/margins": 14.4375,
|
|
"rewards/rejected": -15.625,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"epoch": 1.9460122699386502,
|
|
"grad_norm": 9.852918729623598,
|
|
"learning_rate": 7.099173553719008e-07,
|
|
"logits/chosen": -0.2421875,
|
|
"logits/rejected": -0.427734375,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0417,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -2.21875,
|
|
"rewards/margins": 11.9375,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1586
|
|
},
|
|
{
|
|
"epoch": 1.9472392638036808,
|
|
"grad_norm": 11.168636850358272,
|
|
"learning_rate": 7.09090909090909e-07,
|
|
"logits/chosen": -0.2138671875,
|
|
"logits/rejected": -0.40234375,
|
|
"logps/chosen": -380.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0534,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.3125,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1587
|
|
},
|
|
{
|
|
"epoch": 1.9484662576687115,
|
|
"grad_norm": 10.29993753533456,
|
|
"learning_rate": 7.082644628099173e-07,
|
|
"logits/chosen": -0.142578125,
|
|
"logits/rejected": -0.318359375,
|
|
"logps/chosen": -398.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.0343,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.03125,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -14.25,
|
|
"step": 1588
|
|
},
|
|
{
|
|
"epoch": 1.9496932515337422,
|
|
"grad_norm": 14.223154222626455,
|
|
"learning_rate": 7.074380165289255e-07,
|
|
"logits/chosen": -0.2197265625,
|
|
"logits/rejected": -0.392578125,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0477,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.015625,
|
|
"rewards/margins": 13.625,
|
|
"rewards/rejected": -15.625,
|
|
"step": 1589
|
|
},
|
|
{
|
|
"epoch": 1.9509202453987728,
|
|
"grad_norm": 12.453079518633523,
|
|
"learning_rate": 7.066115702479338e-07,
|
|
"logits/chosen": -0.1435546875,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0335,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.9140625,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -15.3125,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"epoch": 1.9521472392638037,
|
|
"grad_norm": 7.8773680278995375,
|
|
"learning_rate": 7.057851239669421e-07,
|
|
"logits/chosen": -0.23046875,
|
|
"logits/rejected": -0.384765625,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -406.0,
|
|
"loss": 0.0171,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.109375,
|
|
"rewards/margins": 13.5,
|
|
"rewards/rejected": -15.625,
|
|
"step": 1591
|
|
},
|
|
{
|
|
"epoch": 1.9533742331288344,
|
|
"grad_norm": 16.735680592899843,
|
|
"learning_rate": 7.049586776859504e-07,
|
|
"logits/chosen": -0.11962890625,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -402.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0631,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.875,
|
|
"rewards/margins": 12.375,
|
|
"rewards/rejected": -15.25,
|
|
"step": 1592
|
|
},
|
|
{
|
|
"epoch": 1.954601226993865,
|
|
"grad_norm": 21.980643477359607,
|
|
"learning_rate": 7.041322314049587e-07,
|
|
"logits/chosen": -0.154296875,
|
|
"logits/rejected": -0.3125,
|
|
"logps/chosen": -428.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.1011,
|
|
"rewards/accuracies": 0.9453125,
|
|
"rewards/chosen": -2.828125,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -15.75,
|
|
"step": 1593
|
|
},
|
|
{
|
|
"epoch": 1.9558282208588957,
|
|
"grad_norm": 12.924426395398994,
|
|
"learning_rate": 7.033057851239669e-07,
|
|
"logits/chosen": -0.2373046875,
|
|
"logits/rejected": -0.3984375,
|
|
"logps/chosen": -350.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.0722,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.9296875,
|
|
"rewards/margins": 12.25,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1594
|
|
},
|
|
{
|
|
"epoch": 1.9570552147239264,
|
|
"grad_norm": 25.619194490819055,
|
|
"learning_rate": 7.024793388429752e-07,
|
|
"logits/chosen": -0.1875,
|
|
"logits/rejected": -0.265625,
|
|
"logps/chosen": -404.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.105,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -3.0625,
|
|
"rewards/margins": 13.4375,
|
|
"rewards/rejected": -16.5,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"epoch": 1.958282208588957,
|
|
"grad_norm": 4.199255846633373,
|
|
"learning_rate": 7.016528925619835e-07,
|
|
"logits/chosen": -0.251953125,
|
|
"logits/rejected": -0.30859375,
|
|
"logps/chosen": -384.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0148,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.671875,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -15.5625,
|
|
"step": 1596
|
|
},
|
|
{
|
|
"epoch": 1.9595092024539877,
|
|
"grad_norm": 8.538199632867174,
|
|
"learning_rate": 7.008264462809918e-07,
|
|
"logits/chosen": -0.15234375,
|
|
"logits/rejected": -0.369140625,
|
|
"logps/chosen": -422.0,
|
|
"logps/rejected": -428.0,
|
|
"loss": 0.026,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.234375,
|
|
"rewards/margins": 13.875,
|
|
"rewards/rejected": -16.125,
|
|
"step": 1597
|
|
},
|
|
{
|
|
"epoch": 1.9607361963190184,
|
|
"grad_norm": 16.765528483594718,
|
|
"learning_rate": 7e-07,
|
|
"logits/chosen": -0.25,
|
|
"logits/rejected": -0.3359375,
|
|
"logps/chosen": -416.0,
|
|
"logps/rejected": -462.0,
|
|
"loss": 0.0658,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -3.0,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -15.75,
|
|
"step": 1598
|
|
},
|
|
{
|
|
"epoch": 1.961963190184049,
|
|
"grad_norm": 2.073937713879576,
|
|
"learning_rate": 6.991735537190083e-07,
|
|
"logits/chosen": -0.15234375,
|
|
"logits/rejected": -0.3984375,
|
|
"logps/chosen": -420.0,
|
|
"logps/rejected": -418.0,
|
|
"loss": 0.0091,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -2.078125,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -15.25,
|
|
"step": 1599
|
|
},
|
|
{
|
|
"epoch": 1.9631901840490797,
|
|
"grad_norm": 10.932012179083754,
|
|
"learning_rate": 6.983471074380165e-07,
|
|
"logits/chosen": -0.09814453125,
|
|
"logits/rejected": -0.275390625,
|
|
"logps/chosen": -436.0,
|
|
"logps/rejected": -442.0,
|
|
"loss": 0.0356,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.578125,
|
|
"rewards/margins": 12.75,
|
|
"rewards/rejected": -15.3125,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"epoch": 1.9644171779141104,
|
|
"grad_norm": 7.649583715313472,
|
|
"learning_rate": 6.975206611570247e-07,
|
|
"logits/chosen": -0.0703125,
|
|
"logits/rejected": -0.177734375,
|
|
"logps/chosen": -370.0,
|
|
"logps/rejected": -402.0,
|
|
"loss": 0.0324,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -3.21875,
|
|
"rewards/margins": 11.4375,
|
|
"rewards/rejected": -14.625,
|
|
"step": 1601
|
|
},
|
|
{
|
|
"epoch": 1.965644171779141,
|
|
"grad_norm": 15.179814031877818,
|
|
"learning_rate": 6.96694214876033e-07,
|
|
"logits/chosen": -0.15234375,
|
|
"logits/rejected": -0.37109375,
|
|
"logps/chosen": -462.0,
|
|
"logps/rejected": -408.0,
|
|
"loss": 0.047,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.703125,
|
|
"rewards/margins": 13.0625,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1602
|
|
},
|
|
{
|
|
"epoch": 1.9668711656441717,
|
|
"grad_norm": 11.446886140775492,
|
|
"learning_rate": 6.958677685950412e-07,
|
|
"logits/chosen": -0.17578125,
|
|
"logits/rejected": -0.373046875,
|
|
"logps/chosen": -492.0,
|
|
"logps/rejected": -462.0,
|
|
"loss": 0.0524,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.265625,
|
|
"rewards/margins": 13.75,
|
|
"rewards/rejected": -16.0,
|
|
"step": 1603
|
|
},
|
|
{
|
|
"epoch": 1.9680981595092024,
|
|
"grad_norm": 12.440414697811256,
|
|
"learning_rate": 6.950413223140495e-07,
|
|
"logits/chosen": -0.11669921875,
|
|
"logits/rejected": -0.30859375,
|
|
"logps/chosen": -412.0,
|
|
"logps/rejected": -420.0,
|
|
"loss": 0.0437,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.9140625,
|
|
"rewards/margins": 12.1875,
|
|
"rewards/rejected": -14.0625,
|
|
"step": 1604
|
|
},
|
|
{
|
|
"epoch": 1.969325153374233,
|
|
"grad_norm": 10.105467224707297,
|
|
"learning_rate": 6.942148760330578e-07,
|
|
"logits/chosen": -0.1083984375,
|
|
"logits/rejected": -0.26171875,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -468.0,
|
|
"loss": 0.0453,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.90625,
|
|
"rewards/margins": 12.625,
|
|
"rewards/rejected": -15.5,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"epoch": 1.9705521472392638,
|
|
"grad_norm": 12.75530347235316,
|
|
"learning_rate": 6.933884297520661e-07,
|
|
"logits/chosen": -0.2314453125,
|
|
"logits/rejected": -0.455078125,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -458.0,
|
|
"loss": 0.0542,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.5078125,
|
|
"rewards/margins": 13.0,
|
|
"rewards/rejected": -14.5,
|
|
"step": 1606
|
|
},
|
|
{
|
|
"epoch": 1.9717791411042946,
|
|
"grad_norm": 7.46884420785602,
|
|
"learning_rate": 6.925619834710743e-07,
|
|
"logits/chosen": -0.1826171875,
|
|
"logits/rejected": -0.42578125,
|
|
"logps/chosen": -400.0,
|
|
"logps/rejected": -392.0,
|
|
"loss": 0.0214,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.5,
|
|
"rewards/margins": 13.1875,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 1607
|
|
},
|
|
{
|
|
"epoch": 1.9730061349693253,
|
|
"grad_norm": 15.399212590445346,
|
|
"learning_rate": 6.917355371900826e-07,
|
|
"logits/chosen": -0.19140625,
|
|
"logits/rejected": -0.39453125,
|
|
"logps/chosen": -408.0,
|
|
"logps/rejected": -436.0,
|
|
"loss": 0.053,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.4375,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1608
|
|
},
|
|
{
|
|
"epoch": 1.974233128834356,
|
|
"grad_norm": 11.856025547749626,
|
|
"learning_rate": 6.909090909090909e-07,
|
|
"logits/chosen": -0.19140625,
|
|
"logits/rejected": -0.3359375,
|
|
"logps/chosen": -394.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.0488,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -2.046875,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -15.0,
|
|
"step": 1609
|
|
},
|
|
{
|
|
"epoch": 1.9754601226993866,
|
|
"grad_norm": 12.703840358172142,
|
|
"learning_rate": 6.900826446280992e-07,
|
|
"logits/chosen": -0.2353515625,
|
|
"logits/rejected": -0.333984375,
|
|
"logps/chosen": -378.0,
|
|
"logps/rejected": -384.0,
|
|
"loss": 0.0493,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -1.34375,
|
|
"rewards/margins": 12.875,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"epoch": 1.9766871165644173,
|
|
"grad_norm": 13.998285839343135,
|
|
"learning_rate": 6.892561983471074e-07,
|
|
"logits/chosen": -0.1064453125,
|
|
"logits/rejected": -0.2431640625,
|
|
"logps/chosen": -352.0,
|
|
"logps/rejected": -372.0,
|
|
"loss": 0.0667,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -3.078125,
|
|
"rewards/margins": 11.25,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1611
|
|
},
|
|
{
|
|
"epoch": 1.977914110429448,
|
|
"grad_norm": 18.438784360262748,
|
|
"learning_rate": 6.884297520661157e-07,
|
|
"logits/chosen": -0.08642578125,
|
|
"logits/rejected": -0.291015625,
|
|
"logps/chosen": -454.0,
|
|
"logps/rejected": -486.0,
|
|
"loss": 0.0785,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -1.3203125,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -14.6875,
|
|
"step": 1612
|
|
},
|
|
{
|
|
"epoch": 1.9791411042944786,
|
|
"grad_norm": 3.4851659010385676,
|
|
"learning_rate": 6.87603305785124e-07,
|
|
"logits/chosen": -0.0615234375,
|
|
"logits/rejected": -0.2333984375,
|
|
"logps/chosen": -460.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0112,
|
|
"rewards/accuracies": 1.0,
|
|
"rewards/chosen": -1.7109375,
|
|
"rewards/margins": 14.0625,
|
|
"rewards/rejected": -15.75,
|
|
"step": 1613
|
|
},
|
|
{
|
|
"epoch": 1.9803680981595093,
|
|
"grad_norm": 12.606281125983013,
|
|
"learning_rate": 6.867768595041323e-07,
|
|
"logits/chosen": -0.267578125,
|
|
"logits/rejected": -0.48828125,
|
|
"logps/chosen": -452.0,
|
|
"logps/rejected": -454.0,
|
|
"loss": 0.0668,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/chosen": -1.46875,
|
|
"rewards/margins": 13.625,
|
|
"rewards/rejected": -15.0625,
|
|
"step": 1614
|
|
},
|
|
{
|
|
"epoch": 1.98159509202454,
|
|
"grad_norm": 9.90525420849227,
|
|
"learning_rate": 6.859504132231405e-07,
|
|
"logits/chosen": -0.291015625,
|
|
"logits/rejected": -0.392578125,
|
|
"logps/chosen": -390.0,
|
|
"logps/rejected": -434.0,
|
|
"loss": 0.0476,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.3359375,
|
|
"rewards/margins": 13.4375,
|
|
"rewards/rejected": -14.75,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"epoch": 1.9828220858895707,
|
|
"grad_norm": 15.81916128621746,
|
|
"learning_rate": 6.851239669421487e-07,
|
|
"logits/chosen": -0.099609375,
|
|
"logits/rejected": -0.263671875,
|
|
"logps/chosen": -372.0,
|
|
"logps/rejected": -374.0,
|
|
"loss": 0.075,
|
|
"rewards/accuracies": 0.9609375,
|
|
"rewards/chosen": -2.28125,
|
|
"rewards/margins": 12.125,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1616
|
|
},
|
|
{
|
|
"epoch": 1.9840490797546013,
|
|
"grad_norm": 8.150805055881774,
|
|
"learning_rate": 6.84297520661157e-07,
|
|
"logits/chosen": -0.040283203125,
|
|
"logits/rejected": -0.228515625,
|
|
"logps/chosen": -382.0,
|
|
"logps/rejected": -404.0,
|
|
"loss": 0.0354,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -2.140625,
|
|
"rewards/margins": 12.0625,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1617
|
|
},
|
|
{
|
|
"epoch": 1.985276073619632,
|
|
"grad_norm": 13.151183898630745,
|
|
"learning_rate": 6.834710743801652e-07,
|
|
"logits/chosen": -0.2138671875,
|
|
"logits/rejected": -0.333984375,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -410.0,
|
|
"loss": 0.027,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.6484375,
|
|
"rewards/margins": 13.1875,
|
|
"rewards/rejected": -14.875,
|
|
"step": 1618
|
|
},
|
|
{
|
|
"epoch": 1.9865030674846627,
|
|
"grad_norm": 7.977242068564573,
|
|
"learning_rate": 6.826446280991735e-07,
|
|
"logits/chosen": -0.23046875,
|
|
"logits/rejected": -0.388671875,
|
|
"logps/chosen": -434.0,
|
|
"logps/rejected": -414.0,
|
|
"loss": 0.0314,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.8515625,
|
|
"rewards/margins": 12.5625,
|
|
"rewards/rejected": -14.4375,
|
|
"step": 1619
|
|
},
|
|
{
|
|
"epoch": 1.9877300613496933,
|
|
"grad_norm": 7.717132929367279,
|
|
"learning_rate": 6.818181818181817e-07,
|
|
"logits/chosen": -0.134765625,
|
|
"logits/rejected": -0.322265625,
|
|
"logps/chosen": -388.0,
|
|
"logps/rejected": -394.0,
|
|
"loss": 0.0255,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.28125,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -13.625,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"epoch": 1.988957055214724,
|
|
"grad_norm": 12.277942790500736,
|
|
"learning_rate": 6.8099173553719e-07,
|
|
"logits/chosen": -0.1064453125,
|
|
"logits/rejected": -0.232421875,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0384,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.171875,
|
|
"rewards/margins": 13.375,
|
|
"rewards/rejected": -14.5625,
|
|
"step": 1621
|
|
},
|
|
{
|
|
"epoch": 1.9901840490797547,
|
|
"grad_norm": 13.789540960182217,
|
|
"learning_rate": 6.801652892561983e-07,
|
|
"logits/chosen": -0.3671875,
|
|
"logits/rejected": -0.4921875,
|
|
"logps/chosen": -424.0,
|
|
"logps/rejected": -464.0,
|
|
"loss": 0.0493,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.7265625,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -14.1875,
|
|
"step": 1622
|
|
},
|
|
{
|
|
"epoch": 1.9914110429447853,
|
|
"grad_norm": 11.784412601953619,
|
|
"learning_rate": 6.793388429752066e-07,
|
|
"logits/chosen": -0.08349609375,
|
|
"logits/rejected": -0.29296875,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -422.0,
|
|
"loss": 0.039,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.6953125,
|
|
"rewards/margins": 13.25,
|
|
"rewards/rejected": -13.9375,
|
|
"step": 1623
|
|
},
|
|
{
|
|
"epoch": 1.992638036809816,
|
|
"grad_norm": 9.375105242990639,
|
|
"learning_rate": 6.785123966942149e-07,
|
|
"logits/chosen": -0.189453125,
|
|
"logits/rejected": -0.451171875,
|
|
"logps/chosen": -392.0,
|
|
"logps/rejected": -412.0,
|
|
"loss": 0.0233,
|
|
"rewards/accuracies": 0.9921875,
|
|
"rewards/chosen": -0.82421875,
|
|
"rewards/margins": 13.0625,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1624
|
|
},
|
|
{
|
|
"epoch": 1.9938650306748467,
|
|
"grad_norm": 19.779116155549996,
|
|
"learning_rate": 6.776859504132231e-07,
|
|
"logits/chosen": -0.033447265625,
|
|
"logits/rejected": -0.2470703125,
|
|
"logps/chosen": -456.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.094,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -0.765625,
|
|
"rewards/margins": 13.3125,
|
|
"rewards/rejected": -14.0625,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"epoch": 1.9950920245398773,
|
|
"grad_norm": 15.56250197673987,
|
|
"learning_rate": 6.768595041322314e-07,
|
|
"logits/chosen": -0.1533203125,
|
|
"logits/rejected": -0.259765625,
|
|
"logps/chosen": -450.0,
|
|
"logps/rejected": -448.0,
|
|
"loss": 0.0473,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.4296875,
|
|
"rewards/margins": 12.4375,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1626
|
|
},
|
|
{
|
|
"epoch": 1.996319018404908,
|
|
"grad_norm": 10.271607340994601,
|
|
"learning_rate": 6.760330578512397e-07,
|
|
"logits/chosen": -0.224609375,
|
|
"logits/rejected": -0.33203125,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -390.0,
|
|
"loss": 0.0421,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -0.94140625,
|
|
"rewards/margins": 12.9375,
|
|
"rewards/rejected": -13.875,
|
|
"step": 1627
|
|
},
|
|
{
|
|
"epoch": 1.9975460122699387,
|
|
"grad_norm": 10.638643766191663,
|
|
"learning_rate": 6.75206611570248e-07,
|
|
"logits/chosen": -0.1572265625,
|
|
"logits/rejected": -0.287109375,
|
|
"logps/chosen": -386.0,
|
|
"logps/rejected": -430.0,
|
|
"loss": 0.0438,
|
|
"rewards/accuracies": 0.984375,
|
|
"rewards/chosen": -1.1640625,
|
|
"rewards/margins": 13.125,
|
|
"rewards/rejected": -14.3125,
|
|
"step": 1628
|
|
},
|
|
{
|
|
"epoch": 1.9987730061349693,
|
|
"grad_norm": 13.333208390753416,
|
|
"learning_rate": 6.743801652892561e-07,
|
|
"logits/chosen": -0.04248046875,
|
|
"logits/rejected": -0.2041015625,
|
|
"logps/chosen": -414.0,
|
|
"logps/rejected": -432.0,
|
|
"loss": 0.0573,
|
|
"rewards/accuracies": 0.9765625,
|
|
"rewards/chosen": -1.7421875,
|
|
"rewards/margins": 12.3125,
|
|
"rewards/rejected": -14.0625,
|
|
"step": 1629
|
|
},
|
|
{
|
|
"epoch": 2.0,
|
|
"grad_norm": 12.464295436509438,
|
|
"learning_rate": 6.735537190082644e-07,
|
|
"logits/chosen": -0.154296875,
|
|
"logits/rejected": -0.328125,
|
|
"logps/chosen": -442.0,
|
|
"logps/rejected": -446.0,
|
|
"loss": 0.0462,
|
|
"rewards/accuracies": 0.9747899770736694,
|
|
"rewards/chosen": -1.203125,
|
|
"rewards/margins": 13.6875,
|
|
"rewards/rejected": -14.9375,
|
|
"step": 1630
|
|
}
|
|
],
|
|
"logging_steps": 1,
|
|
"max_steps": 2445,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 3,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 0.0,
|
|
"train_batch_size": 4,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|