Files
ablation-148-a128.dpo.armor…/checkpoint-1630/trainer_state.json
ModelHub XC 88a4103d15 初始化项目,由ModelHub XC社区提供模型
Model: shisa-ai/ablation-148-a128.dpo.armorm.rp.tl.2e6-shisa-v2-llama-3.1-8b
Source: Original Platform
2026-08-19 19:15:13 +08:00

24485 lines
722 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 1630,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.001226993865030675,
"grad_norm": 151.57908825646035,
"learning_rate": 8e-08,
"logits/chosen": -0.32421875,
"logits/rejected": -0.515625,
"logps/chosen": -474.0,
"logps/rejected": -316.0,
"loss": 0.6914,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1
},
{
"epoch": 0.00245398773006135,
"grad_norm": 162.02529424316268,
"learning_rate": 1.6e-07,
"logits/chosen": -0.22265625,
"logits/rejected": -0.439453125,
"logps/chosen": -436.0,
"logps/rejected": -292.0,
"loss": 0.6914,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2
},
{
"epoch": 0.0036809815950920245,
"grad_norm": 115.26127545692574,
"learning_rate": 2.4e-07,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.255859375,
"logps/chosen": -368.0,
"logps/rejected": -272.0,
"loss": 0.697,
"rewards/accuracies": 0.34375,
"rewards/chosen": 0.006317138671875,
"rewards/margins": -0.00144195556640625,
"rewards/rejected": 0.007781982421875,
"step": 3
},
{
"epoch": 0.0049079754601227,
"grad_norm": 156.48930570622863,
"learning_rate": 3.2e-07,
"logits/chosen": -0.166015625,
"logits/rejected": -0.326171875,
"logps/chosen": -422.0,
"logps/rejected": -242.0,
"loss": 0.7128,
"rewards/accuracies": 0.3515625,
"rewards/chosen": -0.01470947265625,
"rewards/margins": -0.0264892578125,
"rewards/rejected": 0.01171875,
"step": 4
},
{
"epoch": 0.006134969325153374,
"grad_norm": 303.9882890698684,
"learning_rate": 4e-07,
"logits/chosen": -0.1845703125,
"logits/rejected": -0.326171875,
"logps/chosen": -380.0,
"logps/rejected": -270.0,
"loss": 0.6982,
"rewards/accuracies": 0.3046875,
"rewards/chosen": 0.009765625,
"rewards/margins": -0.00164794921875,
"rewards/rejected": 0.01141357421875,
"step": 5
},
{
"epoch": 0.007361963190184049,
"grad_norm": 326.9746232098939,
"learning_rate": 4.8e-07,
"logits/chosen": -0.25390625,
"logits/rejected": -0.34375,
"logps/chosen": -412.0,
"logps/rejected": -306.0,
"loss": 0.684,
"rewards/accuracies": 0.328125,
"rewards/chosen": -0.0006103515625,
"rewards/margins": 0.02099609375,
"rewards/rejected": -0.0216064453125,
"step": 6
},
{
"epoch": 0.008588957055214725,
"grad_norm": 226.40926938346539,
"learning_rate": 5.6e-07,
"logits/chosen": -0.203125,
"logits/rejected": -0.384765625,
"logps/chosen": -378.0,
"logps/rejected": -266.0,
"loss": 0.6663,
"rewards/accuracies": 0.5234375,
"rewards/chosen": 0.0264892578125,
"rewards/margins": 0.06884765625,
"rewards/rejected": -0.042724609375,
"step": 7
},
{
"epoch": 0.0098159509202454,
"grad_norm": 132.7750836984092,
"learning_rate": 6.4e-07,
"logits/chosen": -0.111328125,
"logits/rejected": -0.3203125,
"logps/chosen": -432.0,
"logps/rejected": -292.0,
"loss": 0.6488,
"rewards/accuracies": 0.515625,
"rewards/chosen": 0.0654296875,
"rewards/margins": 0.10986328125,
"rewards/rejected": -0.044677734375,
"step": 8
},
{
"epoch": 0.011042944785276074,
"grad_norm": 97.38590935108355,
"learning_rate": 7.2e-07,
"logits/chosen": -0.1279296875,
"logits/rejected": -0.35546875,
"logps/chosen": -402.0,
"logps/rejected": -294.0,
"loss": 0.6144,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.138671875,
"rewards/margins": 0.2080078125,
"rewards/rejected": -0.06884765625,
"step": 9
},
{
"epoch": 0.012269938650306749,
"grad_norm": 109.2806037798003,
"learning_rate": 8e-07,
"logits/chosen": -0.189453125,
"logits/rejected": -0.345703125,
"logps/chosen": -400.0,
"logps/rejected": -280.0,
"loss": 0.5575,
"rewards/accuracies": 0.6796875,
"rewards/chosen": 0.265625,
"rewards/margins": 0.388671875,
"rewards/rejected": -0.12353515625,
"step": 10
},
{
"epoch": 0.013496932515337423,
"grad_norm": 63.80484281566978,
"learning_rate": 8.799999999999999e-07,
"logits/chosen": -0.37109375,
"logits/rejected": -0.51171875,
"logps/chosen": -420.0,
"logps/rejected": -298.0,
"loss": 0.5237,
"rewards/accuracies": 0.7578125,
"rewards/chosen": 0.302734375,
"rewards/margins": 0.53515625,
"rewards/rejected": -0.232421875,
"step": 11
},
{
"epoch": 0.014723926380368098,
"grad_norm": 56.12151232997638,
"learning_rate": 9.6e-07,
"logits/chosen": -0.1279296875,
"logits/rejected": -0.2392578125,
"logps/chosen": -370.0,
"logps/rejected": -264.0,
"loss": 0.5143,
"rewards/accuracies": 0.7265625,
"rewards/chosen": 0.41015625,
"rewards/margins": 0.6328125,
"rewards/rejected": -0.220703125,
"step": 12
},
{
"epoch": 0.015950920245398775,
"grad_norm": 55.00840570479743,
"learning_rate": 1.04e-06,
"logits/chosen": -0.2314453125,
"logits/rejected": -0.40234375,
"logps/chosen": -388.0,
"logps/rejected": -254.0,
"loss": 0.459,
"rewards/accuracies": 0.7578125,
"rewards/chosen": 0.60546875,
"rewards/margins": 1.1171875,
"rewards/rejected": -0.5078125,
"step": 13
},
{
"epoch": 0.01717791411042945,
"grad_norm": 45.25533648934274,
"learning_rate": 1.12e-06,
"logits/chosen": -0.20703125,
"logits/rejected": -0.396484375,
"logps/chosen": -464.0,
"logps/rejected": -316.0,
"loss": 0.4332,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 1.0546875,
"rewards/margins": 1.671875,
"rewards/rejected": -0.62109375,
"step": 14
},
{
"epoch": 0.018404907975460124,
"grad_norm": 69.06405670291454,
"learning_rate": 1.2e-06,
"logits/chosen": -0.10009765625,
"logits/rejected": -0.17578125,
"logps/chosen": -412.0,
"logps/rejected": -294.0,
"loss": 0.4944,
"rewards/accuracies": 0.703125,
"rewards/chosen": 0.78515625,
"rewards/margins": 1.2578125,
"rewards/rejected": -0.47265625,
"step": 15
},
{
"epoch": 0.0196319018404908,
"grad_norm": 46.372079444775025,
"learning_rate": 1.28e-06,
"logits/chosen": -0.24609375,
"logits/rejected": -0.423828125,
"logps/chosen": -398.0,
"logps/rejected": -312.0,
"loss": 0.4167,
"rewards/accuracies": 0.7578125,
"rewards/chosen": 1.015625,
"rewards/margins": 1.8359375,
"rewards/rejected": -0.8203125,
"step": 16
},
{
"epoch": 0.020858895705521473,
"grad_norm": 40.52093766223854,
"learning_rate": 1.3600000000000001e-06,
"logits/chosen": -0.1533203125,
"logits/rejected": -0.318359375,
"logps/chosen": -424.0,
"logps/rejected": -264.0,
"loss": 0.3872,
"rewards/accuracies": 0.8125,
"rewards/chosen": 1.296875,
"rewards/margins": 2.34375,
"rewards/rejected": -1.046875,
"step": 17
},
{
"epoch": 0.022085889570552148,
"grad_norm": 59.54999431168163,
"learning_rate": 1.44e-06,
"logits/chosen": -0.1337890625,
"logits/rejected": -0.326171875,
"logps/chosen": -396.0,
"logps/rejected": -290.0,
"loss": 0.3963,
"rewards/accuracies": 0.8125,
"rewards/chosen": 1.1875,
"rewards/margins": 2.796875,
"rewards/rejected": -1.609375,
"step": 18
},
{
"epoch": 0.023312883435582823,
"grad_norm": 52.778803915151975,
"learning_rate": 1.5199999999999998e-06,
"logits/chosen": -0.1748046875,
"logits/rejected": -0.361328125,
"logps/chosen": -382.0,
"logps/rejected": -306.0,
"loss": 0.4856,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 0.8359375,
"rewards/margins": 2.765625,
"rewards/rejected": -1.9296875,
"step": 19
},
{
"epoch": 0.024539877300613498,
"grad_norm": 42.84608644509601,
"learning_rate": 1.6e-06,
"logits/chosen": -0.26171875,
"logits/rejected": -0.439453125,
"logps/chosen": -454.0,
"logps/rejected": -334.0,
"loss": 0.3732,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.6640625,
"rewards/margins": 4.3125,
"rewards/rejected": -2.65625,
"step": 20
},
{
"epoch": 0.025766871165644172,
"grad_norm": 34.391152104873825,
"learning_rate": 1.6799999999999998e-06,
"logits/chosen": -0.126953125,
"logits/rejected": -0.318359375,
"logps/chosen": -402.0,
"logps/rejected": -280.0,
"loss": 0.3204,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.2109375,
"rewards/margins": 3.421875,
"rewards/rejected": -2.203125,
"step": 21
},
{
"epoch": 0.026993865030674847,
"grad_norm": 41.55569100164525,
"learning_rate": 1.7599999999999999e-06,
"logits/chosen": -0.125,
"logits/rejected": -0.271484375,
"logps/chosen": -374.0,
"logps/rejected": -314.0,
"loss": 0.3869,
"rewards/accuracies": 0.828125,
"rewards/chosen": 1.1015625,
"rewards/margins": 3.578125,
"rewards/rejected": -2.484375,
"step": 22
},
{
"epoch": 0.02822085889570552,
"grad_norm": 49.71451476170413,
"learning_rate": 1.84e-06,
"logits/chosen": -0.25,
"logits/rejected": -0.314453125,
"logps/chosen": -370.0,
"logps/rejected": -324.0,
"loss": 0.4151,
"rewards/accuracies": 0.796875,
"rewards/chosen": 1.4921875,
"rewards/margins": 3.953125,
"rewards/rejected": -2.453125,
"step": 23
},
{
"epoch": 0.029447852760736196,
"grad_norm": 60.25239910809378,
"learning_rate": 1.92e-06,
"logits/chosen": -0.1865234375,
"logits/rejected": -0.373046875,
"logps/chosen": -378.0,
"logps/rejected": -296.0,
"loss": 0.5039,
"rewards/accuracies": 0.7421875,
"rewards/chosen": 0.36328125,
"rewards/margins": 2.78125,
"rewards/rejected": -2.40625,
"step": 24
},
{
"epoch": 0.03067484662576687,
"grad_norm": 48.096597017259874,
"learning_rate": 2e-06,
"logits/chosen": -0.2490234375,
"logits/rejected": -0.43359375,
"logps/chosen": -432.0,
"logps/rejected": -322.0,
"loss": 0.3548,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.0390625,
"rewards/margins": 4.21875,
"rewards/rejected": -3.171875,
"step": 25
},
{
"epoch": 0.03190184049079755,
"grad_norm": 44.98461125679787,
"learning_rate": 1.999173553719008e-06,
"logits/chosen": -0.142578125,
"logits/rejected": -0.298828125,
"logps/chosen": -382.0,
"logps/rejected": -298.0,
"loss": 0.4087,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 1.46875,
"rewards/margins": 4.375,
"rewards/rejected": -2.921875,
"step": 26
},
{
"epoch": 0.033128834355828224,
"grad_norm": 36.85864755565715,
"learning_rate": 1.9983471074380163e-06,
"logits/chosen": -0.0732421875,
"logits/rejected": -0.2470703125,
"logps/chosen": -354.0,
"logps/rejected": -302.0,
"loss": 0.359,
"rewards/accuracies": 0.7734375,
"rewards/chosen": 1.6796875,
"rewards/margins": 5.0625,
"rewards/rejected": -3.390625,
"step": 27
},
{
"epoch": 0.0343558282208589,
"grad_norm": 38.08863369343569,
"learning_rate": 1.997520661157025e-06,
"logits/chosen": -0.005828857421875,
"logits/rejected": -0.11572265625,
"logps/chosen": -374.0,
"logps/rejected": -280.0,
"loss": 0.3635,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 1.6015625,
"rewards/margins": 4.15625,
"rewards/rejected": -2.5625,
"step": 28
},
{
"epoch": 0.03558282208588957,
"grad_norm": 37.878563173704045,
"learning_rate": 1.996694214876033e-06,
"logits/chosen": -0.2216796875,
"logits/rejected": -0.36328125,
"logps/chosen": -414.0,
"logps/rejected": -340.0,
"loss": 0.3282,
"rewards/accuracies": 0.796875,
"rewards/chosen": 1.765625,
"rewards/margins": 4.71875,
"rewards/rejected": -2.953125,
"step": 29
},
{
"epoch": 0.03680981595092025,
"grad_norm": 41.182338389245814,
"learning_rate": 1.9958677685950413e-06,
"logits/chosen": -0.091796875,
"logits/rejected": -0.2001953125,
"logps/chosen": -332.0,
"logps/rejected": -284.0,
"loss": 0.3527,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 1.2734375,
"rewards/margins": 4.0625,
"rewards/rejected": -2.796875,
"step": 30
},
{
"epoch": 0.03803680981595092,
"grad_norm": 34.67189974475117,
"learning_rate": 1.9950413223140495e-06,
"logits/chosen": -0.0654296875,
"logits/rejected": -0.173828125,
"logps/chosen": -376.0,
"logps/rejected": -292.0,
"loss": 0.3635,
"rewards/accuracies": 0.8125,
"rewards/chosen": 2.109375,
"rewards/margins": 4.90625,
"rewards/rejected": -2.796875,
"step": 31
},
{
"epoch": 0.0392638036809816,
"grad_norm": 44.12813423898393,
"learning_rate": 1.9942148760330577e-06,
"logits/chosen": -0.1201171875,
"logits/rejected": -0.287109375,
"logps/chosen": -386.0,
"logps/rejected": -302.0,
"loss": 0.4208,
"rewards/accuracies": 0.7734375,
"rewards/chosen": 1.8359375,
"rewards/margins": 4.53125,
"rewards/rejected": -2.71875,
"step": 32
},
{
"epoch": 0.04049079754601227,
"grad_norm": 34.71582549479338,
"learning_rate": 1.993388429752066e-06,
"logits/chosen": -0.0177001953125,
"logits/rejected": -0.1484375,
"logps/chosen": -328.0,
"logps/rejected": -254.0,
"loss": 0.3119,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 1.09375,
"rewards/margins": 4.15625,
"rewards/rejected": -3.046875,
"step": 33
},
{
"epoch": 0.04171779141104295,
"grad_norm": 42.308925473685655,
"learning_rate": 1.9925619834710745e-06,
"logits/chosen": -0.15234375,
"logits/rejected": -0.26171875,
"logps/chosen": -384.0,
"logps/rejected": -322.0,
"loss": 0.4193,
"rewards/accuracies": 0.7734375,
"rewards/chosen": 1.5703125,
"rewards/margins": 5.03125,
"rewards/rejected": -3.46875,
"step": 34
},
{
"epoch": 0.04294478527607362,
"grad_norm": 42.01808473170447,
"learning_rate": 1.9917355371900826e-06,
"logits/chosen": -0.055908203125,
"logits/rejected": -0.1884765625,
"logps/chosen": -356.0,
"logps/rejected": -282.0,
"loss": 0.3779,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 1.1796875,
"rewards/margins": 4.6875,
"rewards/rejected": -3.5,
"step": 35
},
{
"epoch": 0.044171779141104296,
"grad_norm": 38.44265678506082,
"learning_rate": 1.990909090909091e-06,
"logits/chosen": -0.11865234375,
"logits/rejected": -0.181640625,
"logps/chosen": -398.0,
"logps/rejected": -316.0,
"loss": 0.3356,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.578125,
"rewards/margins": 5.28125,
"rewards/rejected": -3.703125,
"step": 36
},
{
"epoch": 0.04539877300613497,
"grad_norm": 39.89211897896586,
"learning_rate": 1.990082644628099e-06,
"logits/chosen": -0.07421875,
"logits/rejected": -0.1728515625,
"logps/chosen": -384.0,
"logps/rejected": -326.0,
"loss": 0.3546,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 2.3125,
"rewards/margins": 5.09375,
"rewards/rejected": -2.765625,
"step": 37
},
{
"epoch": 0.046625766871165646,
"grad_norm": 37.62529056872124,
"learning_rate": 1.9892561983471076e-06,
"logits/chosen": -0.018310546875,
"logits/rejected": -0.1259765625,
"logps/chosen": -390.0,
"logps/rejected": -318.0,
"loss": 0.3704,
"rewards/accuracies": 0.8125,
"rewards/chosen": 2.578125,
"rewards/margins": 5.59375,
"rewards/rejected": -3.0,
"step": 38
},
{
"epoch": 0.04785276073619632,
"grad_norm": 35.77776984532311,
"learning_rate": 1.9884297520661154e-06,
"logits/chosen": -0.12353515625,
"logits/rejected": -0.259765625,
"logps/chosen": -418.0,
"logps/rejected": -322.0,
"loss": 0.3257,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 2.34375,
"rewards/margins": 5.6875,
"rewards/rejected": -3.34375,
"step": 39
},
{
"epoch": 0.049079754601226995,
"grad_norm": 32.41938405609689,
"learning_rate": 1.987603305785124e-06,
"logits/chosen": -0.054443359375,
"logits/rejected": -0.1611328125,
"logps/chosen": -368.0,
"logps/rejected": -300.0,
"loss": 0.2842,
"rewards/accuracies": 0.8125,
"rewards/chosen": 2.109375,
"rewards/margins": 5.3125,
"rewards/rejected": -3.21875,
"step": 40
},
{
"epoch": 0.05030674846625767,
"grad_norm": 37.17636342144083,
"learning_rate": 1.986776859504132e-06,
"logits/chosen": -0.061767578125,
"logits/rejected": -0.2275390625,
"logps/chosen": -376.0,
"logps/rejected": -290.0,
"loss": 0.3885,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 1.8359375,
"rewards/margins": 4.875,
"rewards/rejected": -3.03125,
"step": 41
},
{
"epoch": 0.051533742331288344,
"grad_norm": 35.70973516699018,
"learning_rate": 1.9859504132231404e-06,
"logits/chosen": -0.004241943359375,
"logits/rejected": -0.134765625,
"logps/chosen": -362.0,
"logps/rejected": -298.0,
"loss": 0.3055,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.703125,
"rewards/margins": 4.59375,
"rewards/rejected": -2.875,
"step": 42
},
{
"epoch": 0.05276073619631902,
"grad_norm": 42.04321959772472,
"learning_rate": 1.9851239669421486e-06,
"logits/chosen": -0.06982421875,
"logits/rejected": -0.2177734375,
"logps/chosen": -412.0,
"logps/rejected": -338.0,
"loss": 0.3197,
"rewards/accuracies": 0.859375,
"rewards/chosen": 2.09375,
"rewards/margins": 5.40625,
"rewards/rejected": -3.3125,
"step": 43
},
{
"epoch": 0.053987730061349694,
"grad_norm": 47.96119964972139,
"learning_rate": 1.9842975206611568e-06,
"logits/chosen": -0.12255859375,
"logits/rejected": -0.21484375,
"logps/chosen": -384.0,
"logps/rejected": -308.0,
"loss": 0.4231,
"rewards/accuracies": 0.8125,
"rewards/chosen": 1.5546875,
"rewards/margins": 4.8125,
"rewards/rejected": -3.25,
"step": 44
},
{
"epoch": 0.05521472392638037,
"grad_norm": 40.69492767433013,
"learning_rate": 1.9834710743801654e-06,
"logits/chosen": -0.197265625,
"logits/rejected": -0.265625,
"logps/chosen": -350.0,
"logps/rejected": -302.0,
"loss": 0.3937,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 1.84375,
"rewards/margins": 5.1875,
"rewards/rejected": -3.328125,
"step": 45
},
{
"epoch": 0.05644171779141104,
"grad_norm": 33.19833542496733,
"learning_rate": 1.9826446280991736e-06,
"logits/chosen": -0.0732421875,
"logits/rejected": -0.23046875,
"logps/chosen": -416.0,
"logps/rejected": -304.0,
"loss": 0.284,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 2.5,
"rewards/margins": 5.65625,
"rewards/rejected": -3.15625,
"step": 46
},
{
"epoch": 0.05766871165644172,
"grad_norm": 54.3681639315945,
"learning_rate": 1.9818181818181817e-06,
"logits/chosen": -0.1337890625,
"logits/rejected": -0.185546875,
"logps/chosen": -390.0,
"logps/rejected": -374.0,
"loss": 0.5448,
"rewards/accuracies": 0.71875,
"rewards/chosen": 1.5234375,
"rewards/margins": 4.375,
"rewards/rejected": -2.859375,
"step": 47
},
{
"epoch": 0.05889570552147239,
"grad_norm": 46.59084125923199,
"learning_rate": 1.98099173553719e-06,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.23828125,
"logps/chosen": -352.0,
"logps/rejected": -290.0,
"loss": 0.4882,
"rewards/accuracies": 0.7109375,
"rewards/chosen": 1.0234375,
"rewards/margins": 4.0,
"rewards/rejected": -2.984375,
"step": 48
},
{
"epoch": 0.06012269938650307,
"grad_norm": 35.99740809785637,
"learning_rate": 1.980165289256198e-06,
"logits/chosen": -0.12109375,
"logits/rejected": -0.296875,
"logps/chosen": -400.0,
"logps/rejected": -304.0,
"loss": 0.2926,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 2.234375,
"rewards/margins": 5.78125,
"rewards/rejected": -3.546875,
"step": 49
},
{
"epoch": 0.06134969325153374,
"grad_norm": 47.19532636295041,
"learning_rate": 1.9793388429752063e-06,
"logits/chosen": -0.1201171875,
"logits/rejected": -0.265625,
"logps/chosen": -404.0,
"logps/rejected": -328.0,
"loss": 0.4234,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 1.5,
"rewards/margins": 5.03125,
"rewards/rejected": -3.53125,
"step": 50
},
{
"epoch": 0.06257668711656442,
"grad_norm": 36.261549591784416,
"learning_rate": 1.978512396694215e-06,
"logits/chosen": -0.06005859375,
"logits/rejected": -0.189453125,
"logps/chosen": -442.0,
"logps/rejected": -368.0,
"loss": 0.2876,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 1.9296875,
"rewards/margins": 5.5625,
"rewards/rejected": -3.640625,
"step": 51
},
{
"epoch": 0.0638036809815951,
"grad_norm": 37.2148935681707,
"learning_rate": 1.977685950413223e-06,
"logits/chosen": -0.08154296875,
"logits/rejected": -0.2392578125,
"logps/chosen": -398.0,
"logps/rejected": -344.0,
"loss": 0.3422,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.5546875,
"rewards/margins": 5.28125,
"rewards/rejected": -3.734375,
"step": 52
},
{
"epoch": 0.06503067484662577,
"grad_norm": 38.81231049694607,
"learning_rate": 1.9768595041322313e-06,
"logits/chosen": -0.03125,
"logits/rejected": -0.162109375,
"logps/chosen": -398.0,
"logps/rejected": -330.0,
"loss": 0.3506,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 1.84375,
"rewards/margins": 5.15625,
"rewards/rejected": -3.328125,
"step": 53
},
{
"epoch": 0.06625766871165645,
"grad_norm": 31.062301252165657,
"learning_rate": 1.9760330578512395e-06,
"logits/chosen": 0.072265625,
"logits/rejected": -0.08935546875,
"logps/chosen": -338.0,
"logps/rejected": -274.0,
"loss": 0.2661,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 1.09375,
"rewards/margins": 5.25,
"rewards/rejected": -4.15625,
"step": 54
},
{
"epoch": 0.06748466257668712,
"grad_norm": 41.02704710465016,
"learning_rate": 1.975206611570248e-06,
"logits/chosen": -0.03955078125,
"logits/rejected": -0.1787109375,
"logps/chosen": -378.0,
"logps/rejected": -310.0,
"loss": 0.39,
"rewards/accuracies": 0.8125,
"rewards/chosen": 1.5859375,
"rewards/margins": 5.6875,
"rewards/rejected": -4.09375,
"step": 55
},
{
"epoch": 0.0687116564417178,
"grad_norm": 42.48463042177234,
"learning_rate": 1.9743801652892563e-06,
"logits/chosen": -0.0084228515625,
"logits/rejected": -0.1494140625,
"logps/chosen": -388.0,
"logps/rejected": -342.0,
"loss": 0.4254,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.7890625,
"rewards/margins": 5.46875,
"rewards/rejected": -3.6875,
"step": 56
},
{
"epoch": 0.06993865030674846,
"grad_norm": 50.90181875068464,
"learning_rate": 1.9735537190082645e-06,
"logits/chosen": -0.0169677734375,
"logits/rejected": -0.0625,
"logps/chosen": -356.0,
"logps/rejected": -334.0,
"loss": 0.5598,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 1.2109375,
"rewards/margins": 5.09375,
"rewards/rejected": -3.890625,
"step": 57
},
{
"epoch": 0.07116564417177915,
"grad_norm": 48.70480490400624,
"learning_rate": 1.9727272727272727e-06,
"logits/chosen": -0.018798828125,
"logits/rejected": -0.06396484375,
"logps/chosen": -380.0,
"logps/rejected": -344.0,
"loss": 0.4177,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.21875,
"rewards/margins": 5.5,
"rewards/rejected": -4.28125,
"step": 58
},
{
"epoch": 0.07239263803680981,
"grad_norm": 43.21817467009683,
"learning_rate": 1.971900826446281e-06,
"logits/chosen": 0.0537109375,
"logits/rejected": -0.0208740234375,
"logps/chosen": -384.0,
"logps/rejected": -312.0,
"loss": 0.4239,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.84375,
"rewards/margins": 4.8125,
"rewards/rejected": -3.96875,
"step": 59
},
{
"epoch": 0.0736196319018405,
"grad_norm": 42.04774661964234,
"learning_rate": 1.971074380165289e-06,
"logits/chosen": -0.025634765625,
"logits/rejected": -0.1435546875,
"logps/chosen": -394.0,
"logps/rejected": -304.0,
"loss": 0.4275,
"rewards/accuracies": 0.7578125,
"rewards/chosen": 0.37109375,
"rewards/margins": 4.6875,
"rewards/rejected": -4.3125,
"step": 60
},
{
"epoch": 0.07484662576687116,
"grad_norm": 41.91867978712621,
"learning_rate": 1.9702479338842972e-06,
"logits/chosen": -0.04736328125,
"logits/rejected": -0.1494140625,
"logps/chosen": -424.0,
"logps/rejected": -340.0,
"loss": 0.4056,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.2890625,
"rewards/margins": 6.3125,
"rewards/rejected": -5.03125,
"step": 61
},
{
"epoch": 0.07607361963190185,
"grad_norm": 38.74949615267823,
"learning_rate": 1.969421487603306e-06,
"logits/chosen": -0.0390625,
"logits/rejected": -0.212890625,
"logps/chosen": -432.0,
"logps/rejected": -330.0,
"loss": 0.3502,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.9296875,
"rewards/margins": 7.0,
"rewards/rejected": -5.0625,
"step": 62
},
{
"epoch": 0.07730061349693251,
"grad_norm": 41.67251680362869,
"learning_rate": 1.968595041322314e-06,
"logits/chosen": 0.05615234375,
"logits/rejected": -0.09423828125,
"logps/chosen": -424.0,
"logps/rejected": -326.0,
"loss": 0.3406,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.98828125,
"rewards/margins": 5.46875,
"rewards/rejected": -4.46875,
"step": 63
},
{
"epoch": 0.0785276073619632,
"grad_norm": 42.945343464423395,
"learning_rate": 1.9677685950413222e-06,
"logits/chosen": -0.11669921875,
"logits/rejected": -0.271484375,
"logps/chosen": -406.0,
"logps/rejected": -348.0,
"loss": 0.4147,
"rewards/accuracies": 0.7734375,
"rewards/chosen": 1.453125,
"rewards/margins": 6.09375,
"rewards/rejected": -4.65625,
"step": 64
},
{
"epoch": 0.07975460122699386,
"grad_norm": 34.50465343172243,
"learning_rate": 1.9669421487603304e-06,
"logits/chosen": -0.177734375,
"logits/rejected": -0.24609375,
"logps/chosen": -394.0,
"logps/rejected": -320.0,
"loss": 0.2968,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 1.7265625,
"rewards/margins": 6.21875,
"rewards/rejected": -4.46875,
"step": 65
},
{
"epoch": 0.08098159509202454,
"grad_norm": 31.866076526342532,
"learning_rate": 1.9661157024793386e-06,
"logits/chosen": -0.158203125,
"logits/rejected": -0.28125,
"logps/chosen": -318.0,
"logps/rejected": -280.0,
"loss": 0.2815,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 2.046875,
"rewards/margins": 6.875,
"rewards/rejected": -4.8125,
"step": 66
},
{
"epoch": 0.08220858895705521,
"grad_norm": 42.91535130586503,
"learning_rate": 1.9652892561983468e-06,
"logits/chosen": -0.05908203125,
"logits/rejected": -0.1650390625,
"logps/chosen": -336.0,
"logps/rejected": -312.0,
"loss": 0.4407,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.890625,
"rewards/margins": 5.40625,
"rewards/rejected": -4.53125,
"step": 67
},
{
"epoch": 0.0834355828220859,
"grad_norm": 40.67843186478658,
"learning_rate": 1.9644628099173554e-06,
"logits/chosen": -0.1337890625,
"logits/rejected": -0.1806640625,
"logps/chosen": -362.0,
"logps/rejected": -346.0,
"loss": 0.4204,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 1.3203125,
"rewards/margins": 5.46875,
"rewards/rejected": -4.15625,
"step": 68
},
{
"epoch": 0.08466257668711656,
"grad_norm": 44.775633050997016,
"learning_rate": 1.9636363636363636e-06,
"logits/chosen": -0.2177734375,
"logits/rejected": -0.361328125,
"logps/chosen": -410.0,
"logps/rejected": -298.0,
"loss": 0.372,
"rewards/accuracies": 0.828125,
"rewards/chosen": 2.234375,
"rewards/margins": 6.5625,
"rewards/rejected": -4.3125,
"step": 69
},
{
"epoch": 0.08588957055214724,
"grad_norm": 43.44574420327807,
"learning_rate": 1.9628099173553718e-06,
"logits/chosen": -0.0751953125,
"logits/rejected": -0.25390625,
"logps/chosen": -408.0,
"logps/rejected": -352.0,
"loss": 0.4461,
"rewards/accuracies": 0.796875,
"rewards/chosen": 2.3125,
"rewards/margins": 6.03125,
"rewards/rejected": -3.71875,
"step": 70
},
{
"epoch": 0.08711656441717791,
"grad_norm": 38.65676390509551,
"learning_rate": 1.96198347107438e-06,
"logits/chosen": -0.016357421875,
"logits/rejected": -0.0791015625,
"logps/chosen": -346.0,
"logps/rejected": -292.0,
"loss": 0.4024,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.2578125,
"rewards/margins": 5.0,
"rewards/rejected": -3.75,
"step": 71
},
{
"epoch": 0.08834355828220859,
"grad_norm": 42.94632026754794,
"learning_rate": 1.9611570247933886e-06,
"logits/chosen": -0.1884765625,
"logits/rejected": -0.318359375,
"logps/chosen": -432.0,
"logps/rejected": -360.0,
"loss": 0.422,
"rewards/accuracies": 0.8125,
"rewards/chosen": 1.8359375,
"rewards/margins": 5.46875,
"rewards/rejected": -3.640625,
"step": 72
},
{
"epoch": 0.08957055214723926,
"grad_norm": 43.90915615206006,
"learning_rate": 1.9603305785123968e-06,
"logits/chosen": -0.12890625,
"logits/rejected": -0.197265625,
"logps/chosen": -350.0,
"logps/rejected": -316.0,
"loss": 0.4327,
"rewards/accuracies": 0.796875,
"rewards/chosen": 1.1953125,
"rewards/margins": 5.625,
"rewards/rejected": -4.4375,
"step": 73
},
{
"epoch": 0.09079754601226994,
"grad_norm": 37.0933378070661,
"learning_rate": 1.959504132231405e-06,
"logits/chosen": -0.123046875,
"logits/rejected": -0.1826171875,
"logps/chosen": -356.0,
"logps/rejected": -346.0,
"loss": 0.3207,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.94140625,
"rewards/margins": 5.3125,
"rewards/rejected": -4.375,
"step": 74
},
{
"epoch": 0.09202453987730061,
"grad_norm": 39.8586944756322,
"learning_rate": 1.958677685950413e-06,
"logits/chosen": -0.08447265625,
"logits/rejected": -0.232421875,
"logps/chosen": -382.0,
"logps/rejected": -334.0,
"loss": 0.3787,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 1.765625,
"rewards/margins": 6.15625,
"rewards/rejected": -4.40625,
"step": 75
},
{
"epoch": 0.09325153374233129,
"grad_norm": 39.578705781971905,
"learning_rate": 1.9578512396694213e-06,
"logits/chosen": -0.08349609375,
"logits/rejected": -0.248046875,
"logps/chosen": -400.0,
"logps/rejected": -302.0,
"loss": 0.3605,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 1.7265625,
"rewards/margins": 5.78125,
"rewards/rejected": -4.0625,
"step": 76
},
{
"epoch": 0.09447852760736196,
"grad_norm": 42.38064361943649,
"learning_rate": 1.9570247933884295e-06,
"logits/chosen": -0.10693359375,
"logits/rejected": -0.2333984375,
"logps/chosen": -358.0,
"logps/rejected": -314.0,
"loss": 0.4385,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.69140625,
"rewards/margins": 5.34375,
"rewards/rejected": -4.65625,
"step": 77
},
{
"epoch": 0.09570552147239264,
"grad_norm": 37.90382847921675,
"learning_rate": 1.956198347107438e-06,
"logits/chosen": -0.062255859375,
"logits/rejected": -0.208984375,
"logps/chosen": -420.0,
"logps/rejected": -332.0,
"loss": 0.3815,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.375,
"rewards/margins": 5.96875,
"rewards/rejected": -4.5625,
"step": 78
},
{
"epoch": 0.09693251533742331,
"grad_norm": 44.65830730901311,
"learning_rate": 1.9553719008264463e-06,
"logits/chosen": -0.04931640625,
"logits/rejected": -0.1806640625,
"logps/chosen": -362.0,
"logps/rejected": -308.0,
"loss": 0.4445,
"rewards/accuracies": 0.7734375,
"rewards/chosen": 0.546875,
"rewards/margins": 5.4375,
"rewards/rejected": -4.90625,
"step": 79
},
{
"epoch": 0.09815950920245399,
"grad_norm": 38.74942042723456,
"learning_rate": 1.9545454545454545e-06,
"logits/chosen": -0.1171875,
"logits/rejected": -0.310546875,
"logps/chosen": -410.0,
"logps/rejected": -346.0,
"loss": 0.3839,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 1.8203125,
"rewards/margins": 7.1875,
"rewards/rejected": -5.34375,
"step": 80
},
{
"epoch": 0.09938650306748466,
"grad_norm": 32.27256865143061,
"learning_rate": 1.9537190082644627e-06,
"logits/chosen": -0.1865234375,
"logits/rejected": -0.33984375,
"logps/chosen": -442.0,
"logps/rejected": -362.0,
"loss": 0.3105,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.2734375,
"rewards/margins": 6.71875,
"rewards/rejected": -5.4375,
"step": 81
},
{
"epoch": 0.10061349693251534,
"grad_norm": 45.536447420591436,
"learning_rate": 1.952892561983471e-06,
"logits/chosen": -0.08642578125,
"logits/rejected": -0.19921875,
"logps/chosen": -436.0,
"logps/rejected": -354.0,
"loss": 0.4527,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.30859375,
"rewards/margins": 5.8125,
"rewards/rejected": -5.5,
"step": 82
},
{
"epoch": 0.10184049079754601,
"grad_norm": 70.89237547890794,
"learning_rate": 1.952066115702479e-06,
"logits/chosen": -0.07568359375,
"logits/rejected": -0.21875,
"logps/chosen": -360.0,
"logps/rejected": -326.0,
"loss": 0.4202,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.283203125,
"rewards/margins": 5.625,
"rewards/rejected": -5.34375,
"step": 83
},
{
"epoch": 0.10306748466257669,
"grad_norm": 49.05569998583272,
"learning_rate": 1.9512396694214873e-06,
"logits/chosen": -0.060791015625,
"logits/rejected": -0.28515625,
"logps/chosen": -458.0,
"logps/rejected": -366.0,
"loss": 0.3037,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.76953125,
"rewards/margins": 6.5,
"rewards/rejected": -5.71875,
"step": 84
},
{
"epoch": 0.10429447852760736,
"grad_norm": 36.291246022142694,
"learning_rate": 1.950413223140496e-06,
"logits/chosen": -0.173828125,
"logits/rejected": -0.31640625,
"logps/chosen": -386.0,
"logps/rejected": -346.0,
"loss": 0.3024,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 0.10107421875,
"rewards/margins": 6.0,
"rewards/rejected": -5.90625,
"step": 85
},
{
"epoch": 0.10552147239263804,
"grad_norm": 40.9699360174541,
"learning_rate": 1.949586776859504e-06,
"logits/chosen": -0.09228515625,
"logits/rejected": -0.193359375,
"logps/chosen": -432.0,
"logps/rejected": -322.0,
"loss": 0.4352,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.73046875,
"rewards/margins": 5.90625,
"rewards/rejected": -5.15625,
"step": 86
},
{
"epoch": 0.1067484662576687,
"grad_norm": 33.3955251072495,
"learning_rate": 1.9487603305785122e-06,
"logits/chosen": -0.1494140625,
"logits/rejected": -0.28125,
"logps/chosen": -362.0,
"logps/rejected": -282.0,
"loss": 0.3522,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.16796875,
"rewards/margins": 5.65625,
"rewards/rejected": -5.8125,
"step": 87
},
{
"epoch": 0.10797546012269939,
"grad_norm": 34.50414562639353,
"learning_rate": 1.9479338842975204e-06,
"logits/chosen": -0.11669921875,
"logits/rejected": -0.27734375,
"logps/chosen": -372.0,
"logps/rejected": -296.0,
"loss": 0.3259,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.30859375,
"rewards/margins": 5.78125,
"rewards/rejected": -5.46875,
"step": 88
},
{
"epoch": 0.10920245398773006,
"grad_norm": 41.0799182962333,
"learning_rate": 1.947107438016529e-06,
"logits/chosen": -0.1474609375,
"logits/rejected": -0.2470703125,
"logps/chosen": -402.0,
"logps/rejected": -350.0,
"loss": 0.4595,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.546875,
"rewards/margins": 5.8125,
"rewards/rejected": -5.25,
"step": 89
},
{
"epoch": 0.11042944785276074,
"grad_norm": 33.253271252980205,
"learning_rate": 1.9462809917355372e-06,
"logits/chosen": -0.1826171875,
"logits/rejected": -0.353515625,
"logps/chosen": -388.0,
"logps/rejected": -344.0,
"loss": 0.3655,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 0.2109375,
"rewards/margins": 5.78125,
"rewards/rejected": -5.5625,
"step": 90
},
{
"epoch": 0.1116564417177914,
"grad_norm": 38.366812260947825,
"learning_rate": 1.9454545454545454e-06,
"logits/chosen": -0.000293731689453125,
"logits/rejected": -0.25390625,
"logps/chosen": -400.0,
"logps/rejected": -318.0,
"loss": 0.3605,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.72265625,
"rewards/margins": 6.0625,
"rewards/rejected": -5.34375,
"step": 91
},
{
"epoch": 0.11288343558282209,
"grad_norm": 37.025282629040696,
"learning_rate": 1.9446280991735536e-06,
"logits/chosen": -0.10693359375,
"logits/rejected": -0.212890625,
"logps/chosen": -400.0,
"logps/rejected": -326.0,
"loss": 0.3471,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.65625,
"rewards/margins": 6.46875,
"rewards/rejected": -5.8125,
"step": 92
},
{
"epoch": 0.11411042944785275,
"grad_norm": 35.50534211413326,
"learning_rate": 1.943801652892562e-06,
"logits/chosen": -0.138671875,
"logits/rejected": -0.345703125,
"logps/chosen": -408.0,
"logps/rejected": -322.0,
"loss": 0.3373,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 1.5,
"rewards/margins": 6.9375,
"rewards/rejected": -5.4375,
"step": 93
},
{
"epoch": 0.11533742331288344,
"grad_norm": 33.01350969605299,
"learning_rate": 1.94297520661157e-06,
"logits/chosen": -0.15234375,
"logits/rejected": -0.369140625,
"logps/chosen": -434.0,
"logps/rejected": -366.0,
"loss": 0.2847,
"rewards/accuracies": 0.8671875,
"rewards/chosen": 1.984375,
"rewards/margins": 7.5625,
"rewards/rejected": -5.5625,
"step": 94
},
{
"epoch": 0.1165644171779141,
"grad_norm": 31.862487845664326,
"learning_rate": 1.9421487603305786e-06,
"logits/chosen": -0.234375,
"logits/rejected": -0.376953125,
"logps/chosen": -384.0,
"logps/rejected": -330.0,
"loss": 0.3067,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.421875,
"rewards/margins": 7.15625,
"rewards/rejected": -5.75,
"step": 95
},
{
"epoch": 0.11779141104294479,
"grad_norm": 34.73601056959897,
"learning_rate": 1.941322314049587e-06,
"logits/chosen": -0.232421875,
"logits/rejected": -0.388671875,
"logps/chosen": -374.0,
"logps/rejected": -332.0,
"loss": 0.3118,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.9453125,
"rewards/margins": 7.5625,
"rewards/rejected": -5.625,
"step": 96
},
{
"epoch": 0.11901840490797547,
"grad_norm": 45.83847615237391,
"learning_rate": 1.940495867768595e-06,
"logits/chosen": -0.2275390625,
"logits/rejected": -0.357421875,
"logps/chosen": -430.0,
"logps/rejected": -374.0,
"loss": 0.5206,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.40625,
"rewards/margins": 6.53125,
"rewards/rejected": -5.125,
"step": 97
},
{
"epoch": 0.12024539877300613,
"grad_norm": 38.11201034490425,
"learning_rate": 1.939669421487603e-06,
"logits/chosen": -0.023193359375,
"logits/rejected": -0.21875,
"logps/chosen": -360.0,
"logps/rejected": -306.0,
"loss": 0.3372,
"rewards/accuracies": 0.828125,
"rewards/chosen": 1.3671875,
"rewards/margins": 6.53125,
"rewards/rejected": -5.1875,
"step": 98
},
{
"epoch": 0.12147239263803682,
"grad_norm": 35.709300650712045,
"learning_rate": 1.9388429752066114e-06,
"logits/chosen": -0.169921875,
"logits/rejected": -0.267578125,
"logps/chosen": -344.0,
"logps/rejected": -266.0,
"loss": 0.307,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.76953125,
"rewards/margins": 5.75,
"rewards/rejected": -4.96875,
"step": 99
},
{
"epoch": 0.12269938650306748,
"grad_norm": 31.163430631909584,
"learning_rate": 1.93801652892562e-06,
"logits/chosen": -0.205078125,
"logits/rejected": -0.384765625,
"logps/chosen": -396.0,
"logps/rejected": -338.0,
"loss": 0.3029,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.53125,
"rewards/margins": 6.71875,
"rewards/rejected": -5.1875,
"step": 100
},
{
"epoch": 0.12392638036809817,
"grad_norm": 43.35164194138606,
"learning_rate": 1.9371900826446277e-06,
"logits/chosen": -0.205078125,
"logits/rejected": -0.37890625,
"logps/chosen": -414.0,
"logps/rejected": -356.0,
"loss": 0.4617,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 1.609375,
"rewards/margins": 6.40625,
"rewards/rejected": -4.8125,
"step": 101
},
{
"epoch": 0.12515337423312883,
"grad_norm": 38.300666714309216,
"learning_rate": 1.9363636363636363e-06,
"logits/chosen": -0.1611328125,
"logits/rejected": -0.267578125,
"logps/chosen": -394.0,
"logps/rejected": -332.0,
"loss": 0.3996,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 1.9140625,
"rewards/margins": 6.125,
"rewards/rejected": -4.1875,
"step": 102
},
{
"epoch": 0.1263803680981595,
"grad_norm": 35.64289970183451,
"learning_rate": 1.9355371900826445e-06,
"logits/chosen": -0.1455078125,
"logits/rejected": -0.291015625,
"logps/chosen": -350.0,
"logps/rejected": -310.0,
"loss": 0.3528,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 1.5,
"rewards/margins": 5.9375,
"rewards/rejected": -4.46875,
"step": 103
},
{
"epoch": 0.1276073619631902,
"grad_norm": 40.755279919146126,
"learning_rate": 1.9347107438016527e-06,
"logits/chosen": -0.0478515625,
"logits/rejected": -0.1748046875,
"logps/chosen": -416.0,
"logps/rejected": -350.0,
"loss": 0.3817,
"rewards/accuracies": 0.796875,
"rewards/chosen": 1.5859375,
"rewards/margins": 5.84375,
"rewards/rejected": -4.25,
"step": 104
},
{
"epoch": 0.12883435582822086,
"grad_norm": 33.12870235669601,
"learning_rate": 1.933884297520661e-06,
"logits/chosen": -0.14453125,
"logits/rejected": -0.34765625,
"logps/chosen": -374.0,
"logps/rejected": -320.0,
"loss": 0.3315,
"rewards/accuracies": 0.859375,
"rewards/chosen": 2.078125,
"rewards/margins": 6.75,
"rewards/rejected": -4.65625,
"step": 105
},
{
"epoch": 0.13006134969325153,
"grad_norm": 37.26299310783144,
"learning_rate": 1.9330578512396695e-06,
"logits/chosen": -0.11572265625,
"logits/rejected": -0.255859375,
"logps/chosen": -390.0,
"logps/rejected": -322.0,
"loss": 0.3901,
"rewards/accuracies": 0.796875,
"rewards/chosen": 1.8515625,
"rewards/margins": 6.15625,
"rewards/rejected": -4.3125,
"step": 106
},
{
"epoch": 0.1312883435582822,
"grad_norm": 32.692119431844716,
"learning_rate": 1.9322314049586777e-06,
"logits/chosen": -0.1435546875,
"logits/rejected": -0.2177734375,
"logps/chosen": -350.0,
"logps/rejected": -312.0,
"loss": 0.2869,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.546875,
"rewards/margins": 5.96875,
"rewards/rejected": -4.4375,
"step": 107
},
{
"epoch": 0.1325153374233129,
"grad_norm": 31.238198640139856,
"learning_rate": 1.931404958677686e-06,
"logits/chosen": -0.15625,
"logits/rejected": -0.36328125,
"logps/chosen": -378.0,
"logps/rejected": -320.0,
"loss": 0.2526,
"rewards/accuracies": 0.90625,
"rewards/chosen": 1.625,
"rewards/margins": 6.875,
"rewards/rejected": -5.25,
"step": 108
},
{
"epoch": 0.13374233128834356,
"grad_norm": 31.313807796476095,
"learning_rate": 1.930578512396694e-06,
"logits/chosen": -0.140625,
"logits/rejected": -0.30859375,
"logps/chosen": -406.0,
"logps/rejected": -324.0,
"loss": 0.3696,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 2.984375,
"rewards/margins": 7.5,
"rewards/rejected": -4.5,
"step": 109
},
{
"epoch": 0.13496932515337423,
"grad_norm": 55.26135095805823,
"learning_rate": 1.9297520661157023e-06,
"logits/chosen": -0.123046875,
"logits/rejected": -0.255859375,
"logps/chosen": -402.0,
"logps/rejected": -348.0,
"loss": 0.4029,
"rewards/accuracies": 0.8125,
"rewards/chosen": 2.1875,
"rewards/margins": 6.8125,
"rewards/rejected": -4.65625,
"step": 110
},
{
"epoch": 0.1361963190184049,
"grad_norm": 30.918211789348547,
"learning_rate": 1.9289256198347105e-06,
"logits/chosen": -0.039794921875,
"logits/rejected": -0.1953125,
"logps/chosen": -332.0,
"logps/rejected": -286.0,
"loss": 0.3262,
"rewards/accuracies": 0.859375,
"rewards/chosen": 1.3828125,
"rewards/margins": 5.90625,
"rewards/rejected": -4.5,
"step": 111
},
{
"epoch": 0.1374233128834356,
"grad_norm": 33.146957985170864,
"learning_rate": 1.928099173553719e-06,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.2412109375,
"logps/chosen": -346.0,
"logps/rejected": -298.0,
"loss": 0.3843,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.99609375,
"rewards/margins": 6.125,
"rewards/rejected": -5.125,
"step": 112
},
{
"epoch": 0.13865030674846626,
"grad_norm": 35.941768464246515,
"learning_rate": 1.9272727272727273e-06,
"logits/chosen": -0.029541015625,
"logits/rejected": -0.107421875,
"logps/chosen": -380.0,
"logps/rejected": -320.0,
"loss": 0.4812,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 1.3125,
"rewards/margins": 5.96875,
"rewards/rejected": -4.65625,
"step": 113
},
{
"epoch": 0.13987730061349693,
"grad_norm": 35.678880117573186,
"learning_rate": 1.9264462809917355e-06,
"logits/chosen": -0.06982421875,
"logits/rejected": -0.21875,
"logps/chosen": -380.0,
"logps/rejected": -326.0,
"loss": 0.4366,
"rewards/accuracies": 0.8671875,
"rewards/chosen": 0.7578125,
"rewards/margins": 5.59375,
"rewards/rejected": -4.84375,
"step": 114
},
{
"epoch": 0.1411042944785276,
"grad_norm": 42.97654524727648,
"learning_rate": 1.9256198347107436e-06,
"logits/chosen": -0.078125,
"logits/rejected": -0.193359375,
"logps/chosen": -348.0,
"logps/rejected": -330.0,
"loss": 0.5519,
"rewards/accuracies": 0.7265625,
"rewards/chosen": 0.126953125,
"rewards/margins": 4.875,
"rewards/rejected": -4.75,
"step": 115
},
{
"epoch": 0.1423312883435583,
"grad_norm": 32.044910051093204,
"learning_rate": 1.924793388429752e-06,
"logits/chosen": -0.1396484375,
"logits/rejected": -0.357421875,
"logps/chosen": -384.0,
"logps/rejected": -336.0,
"loss": 0.3344,
"rewards/accuracies": 0.8125,
"rewards/chosen": 1.609375,
"rewards/margins": 6.25,
"rewards/rejected": -4.65625,
"step": 116
},
{
"epoch": 0.14355828220858896,
"grad_norm": 36.79751505676989,
"learning_rate": 1.9239669421487604e-06,
"logits/chosen": -0.0810546875,
"logits/rejected": -0.216796875,
"logps/chosen": -332.0,
"logps/rejected": -280.0,
"loss": 0.4879,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.578125,
"rewards/margins": 5.78125,
"rewards/rejected": -5.1875,
"step": 117
},
{
"epoch": 0.14478527607361963,
"grad_norm": 39.861211046062785,
"learning_rate": 1.9231404958677686e-06,
"logits/chosen": -0.10693359375,
"logits/rejected": -0.2451171875,
"logps/chosen": -426.0,
"logps/rejected": -370.0,
"loss": 0.441,
"rewards/accuracies": 0.796875,
"rewards/chosen": 1.515625,
"rewards/margins": 6.40625,
"rewards/rejected": -4.875,
"step": 118
},
{
"epoch": 0.1460122699386503,
"grad_norm": 31.059311442315625,
"learning_rate": 1.922314049586777e-06,
"logits/chosen": -0.17578125,
"logits/rejected": -0.2578125,
"logps/chosen": -358.0,
"logps/rejected": -334.0,
"loss": 0.3019,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 1.078125,
"rewards/margins": 6.03125,
"rewards/rejected": -4.9375,
"step": 119
},
{
"epoch": 0.147239263803681,
"grad_norm": 36.71684766907722,
"learning_rate": 1.921487603305785e-06,
"logits/chosen": -0.158203125,
"logits/rejected": -0.330078125,
"logps/chosen": -422.0,
"logps/rejected": -362.0,
"loss": 0.4122,
"rewards/accuracies": 0.84375,
"rewards/chosen": 2.1875,
"rewards/margins": 7.0625,
"rewards/rejected": -4.875,
"step": 120
},
{
"epoch": 0.14846625766871166,
"grad_norm": 31.580600140009683,
"learning_rate": 1.920661157024793e-06,
"logits/chosen": -0.0751953125,
"logits/rejected": -0.2265625,
"logps/chosen": -408.0,
"logps/rejected": -342.0,
"loss": 0.318,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 2.234375,
"rewards/margins": 7.03125,
"rewards/rejected": -4.78125,
"step": 121
},
{
"epoch": 0.14969325153374233,
"grad_norm": 38.07479588174048,
"learning_rate": 1.9198347107438014e-06,
"logits/chosen": -0.08642578125,
"logits/rejected": -0.2333984375,
"logps/chosen": -380.0,
"logps/rejected": -300.0,
"loss": 0.4213,
"rewards/accuracies": 0.828125,
"rewards/chosen": 1.5234375,
"rewards/margins": 5.78125,
"rewards/rejected": -4.25,
"step": 122
},
{
"epoch": 0.150920245398773,
"grad_norm": 38.70926544812021,
"learning_rate": 1.91900826446281e-06,
"logits/chosen": 0.037109375,
"logits/rejected": -0.134765625,
"logps/chosen": -382.0,
"logps/rejected": -292.0,
"loss": 0.4465,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.1015625,
"rewards/margins": 5.625,
"rewards/rejected": -4.53125,
"step": 123
},
{
"epoch": 0.1521472392638037,
"grad_norm": 30.104729040601388,
"learning_rate": 1.918181818181818e-06,
"logits/chosen": -0.1513671875,
"logits/rejected": -0.2080078125,
"logps/chosen": -348.0,
"logps/rejected": -294.0,
"loss": 0.2893,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 2.25,
"rewards/margins": 7.0,
"rewards/rejected": -4.75,
"step": 124
},
{
"epoch": 0.15337423312883436,
"grad_norm": 33.272882764937705,
"learning_rate": 1.9173553719008264e-06,
"logits/chosen": -0.2216796875,
"logits/rejected": -0.392578125,
"logps/chosen": -432.0,
"logps/rejected": -336.0,
"loss": 0.3599,
"rewards/accuracies": 0.859375,
"rewards/chosen": 1.9453125,
"rewards/margins": 6.65625,
"rewards/rejected": -4.71875,
"step": 125
},
{
"epoch": 0.15460122699386503,
"grad_norm": 42.7456801600713,
"learning_rate": 1.9165289256198346e-06,
"logits/chosen": -0.0673828125,
"logits/rejected": -0.255859375,
"logps/chosen": -366.0,
"logps/rejected": -318.0,
"loss": 0.4402,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 0.95703125,
"rewards/margins": 5.8125,
"rewards/rejected": -4.84375,
"step": 126
},
{
"epoch": 0.1558282208588957,
"grad_norm": 38.3840180629571,
"learning_rate": 1.915702479338843e-06,
"logits/chosen": -0.0267333984375,
"logits/rejected": -0.2021484375,
"logps/chosen": -388.0,
"logps/rejected": -338.0,
"loss": 0.4874,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 1.796875,
"rewards/margins": 6.25,
"rewards/rejected": -4.4375,
"step": 127
},
{
"epoch": 0.1570552147239264,
"grad_norm": 41.71305992138482,
"learning_rate": 1.914876033057851e-06,
"logits/chosen": -0.06494140625,
"logits/rejected": -0.2451171875,
"logps/chosen": -372.0,
"logps/rejected": -342.0,
"loss": 0.4317,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.6640625,
"rewards/margins": 6.53125,
"rewards/rejected": -4.875,
"step": 128
},
{
"epoch": 0.15828220858895706,
"grad_norm": 30.46951522169217,
"learning_rate": 1.9140495867768595e-06,
"logits/chosen": 0.038818359375,
"logits/rejected": -0.08203125,
"logps/chosen": -340.0,
"logps/rejected": -300.0,
"loss": 0.3383,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.890625,
"rewards/margins": 5.5,
"rewards/rejected": -4.625,
"step": 129
},
{
"epoch": 0.15950920245398773,
"grad_norm": 39.03675957302347,
"learning_rate": 1.9132231404958677e-06,
"logits/chosen": -0.08154296875,
"logits/rejected": -0.2138671875,
"logps/chosen": -384.0,
"logps/rejected": -322.0,
"loss": 0.431,
"rewards/accuracies": 0.7421875,
"rewards/chosen": 0.9453125,
"rewards/margins": 5.96875,
"rewards/rejected": -5.03125,
"step": 130
},
{
"epoch": 0.1607361963190184,
"grad_norm": 34.53910295433846,
"learning_rate": 1.912396694214876e-06,
"logits/chosen": -0.19921875,
"logits/rejected": -0.330078125,
"logps/chosen": -394.0,
"logps/rejected": -352.0,
"loss": 0.3021,
"rewards/accuracies": 0.8671875,
"rewards/chosen": 1.6171875,
"rewards/margins": 6.84375,
"rewards/rejected": -5.21875,
"step": 131
},
{
"epoch": 0.1619631901840491,
"grad_norm": 39.326983546154786,
"learning_rate": 1.911570247933884e-06,
"logits/chosen": -0.154296875,
"logits/rejected": -0.330078125,
"logps/chosen": -390.0,
"logps/rejected": -330.0,
"loss": 0.4658,
"rewards/accuracies": 0.796875,
"rewards/chosen": 1.453125,
"rewards/margins": 6.09375,
"rewards/rejected": -4.625,
"step": 132
},
{
"epoch": 0.16319018404907976,
"grad_norm": 36.903545902575146,
"learning_rate": 1.9107438016528923e-06,
"logits/chosen": -0.197265625,
"logits/rejected": -0.345703125,
"logps/chosen": -386.0,
"logps/rejected": -338.0,
"loss": 0.3493,
"rewards/accuracies": 0.859375,
"rewards/chosen": 1.1875,
"rewards/margins": 6.25,
"rewards/rejected": -5.0625,
"step": 133
},
{
"epoch": 0.16441717791411042,
"grad_norm": 50.21305412716651,
"learning_rate": 1.909917355371901e-06,
"logits/chosen": -0.10986328125,
"logits/rejected": -0.31640625,
"logps/chosen": -456.0,
"logps/rejected": -372.0,
"loss": 0.4597,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.87109375,
"rewards/margins": 5.3125,
"rewards/rejected": -4.4375,
"step": 134
},
{
"epoch": 0.1656441717791411,
"grad_norm": 40.08910479710188,
"learning_rate": 1.909090909090909e-06,
"logits/chosen": 0.0223388671875,
"logits/rejected": -0.07958984375,
"logps/chosen": -376.0,
"logps/rejected": -328.0,
"loss": 0.4875,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.40625,
"rewards/margins": 5.25,
"rewards/rejected": -4.84375,
"step": 135
},
{
"epoch": 0.1668711656441718,
"grad_norm": 33.25948422978582,
"learning_rate": 1.9082644628099173e-06,
"logits/chosen": -0.23828125,
"logits/rejected": -0.287109375,
"logps/chosen": -392.0,
"logps/rejected": -320.0,
"loss": 0.341,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.90625,
"rewards/margins": 6.1875,
"rewards/rejected": -5.28125,
"step": 136
},
{
"epoch": 0.16809815950920245,
"grad_norm": 41.732736479742044,
"learning_rate": 1.9074380165289255e-06,
"logits/chosen": 0.01385498046875,
"logits/rejected": -0.1279296875,
"logps/chosen": -400.0,
"logps/rejected": -320.0,
"loss": 0.4942,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.50390625,
"rewards/margins": 5.15625,
"rewards/rejected": -4.625,
"step": 137
},
{
"epoch": 0.16932515337423312,
"grad_norm": 40.733053910497496,
"learning_rate": 1.9066115702479337e-06,
"logits/chosen": -0.08056640625,
"logits/rejected": -0.2158203125,
"logps/chosen": -406.0,
"logps/rejected": -360.0,
"loss": 0.4638,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.62890625,
"rewards/margins": 5.53125,
"rewards/rejected": -4.875,
"step": 138
},
{
"epoch": 0.1705521472392638,
"grad_norm": 41.75429610561302,
"learning_rate": 1.905785123966942e-06,
"logits/chosen": -0.08544921875,
"logits/rejected": -0.2451171875,
"logps/chosen": -418.0,
"logps/rejected": -378.0,
"loss": 0.4655,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.1875,
"rewards/margins": 6.6875,
"rewards/rejected": -5.5,
"step": 139
},
{
"epoch": 0.17177914110429449,
"grad_norm": 41.411470035597695,
"learning_rate": 1.9049586776859503e-06,
"logits/chosen": -0.0478515625,
"logits/rejected": -0.2255859375,
"logps/chosen": -428.0,
"logps/rejected": -380.0,
"loss": 0.4414,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.765625,
"rewards/margins": 6.25,
"rewards/rejected": -5.46875,
"step": 140
},
{
"epoch": 0.17300613496932515,
"grad_norm": 32.754374609189824,
"learning_rate": 1.9041322314049587e-06,
"logits/chosen": -0.030029296875,
"logits/rejected": -0.1513671875,
"logps/chosen": -362.0,
"logps/rejected": -342.0,
"loss": 0.3183,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.65625,
"rewards/margins": 6.5,
"rewards/rejected": -5.84375,
"step": 141
},
{
"epoch": 0.17423312883435582,
"grad_norm": 40.07898004444572,
"learning_rate": 1.9033057851239668e-06,
"logits/chosen": -0.06884765625,
"logits/rejected": -0.24609375,
"logps/chosen": -404.0,
"logps/rejected": -356.0,
"loss": 0.4872,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 0.671875,
"rewards/margins": 6.375,
"rewards/rejected": -5.71875,
"step": 142
},
{
"epoch": 0.1754601226993865,
"grad_norm": 40.28203339750631,
"learning_rate": 1.9024793388429752e-06,
"logits/chosen": -0.1083984375,
"logits/rejected": -0.322265625,
"logps/chosen": -388.0,
"logps/rejected": -332.0,
"loss": 0.4004,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.3203125,
"rewards/margins": 6.40625,
"rewards/rejected": -6.09375,
"step": 143
},
{
"epoch": 0.17668711656441718,
"grad_norm": 35.751934493011035,
"learning_rate": 1.9016528925619834e-06,
"logits/chosen": -0.212890625,
"logits/rejected": -0.380859375,
"logps/chosen": -424.0,
"logps/rejected": -362.0,
"loss": 0.4017,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 1.109375,
"rewards/margins": 6.84375,
"rewards/rejected": -5.75,
"step": 144
},
{
"epoch": 0.17791411042944785,
"grad_norm": 35.307761901556404,
"learning_rate": 1.9008264462809918e-06,
"logits/chosen": -0.1904296875,
"logits/rejected": -0.330078125,
"logps/chosen": -388.0,
"logps/rejected": -356.0,
"loss": 0.2959,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.8984375,
"rewards/margins": 6.9375,
"rewards/rejected": -6.0625,
"step": 145
},
{
"epoch": 0.17914110429447852,
"grad_norm": 29.518646600128047,
"learning_rate": 1.8999999999999998e-06,
"logits/chosen": -0.1904296875,
"logits/rejected": -0.291015625,
"logps/chosen": -394.0,
"logps/rejected": -340.0,
"loss": 0.2849,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.06591796875,
"rewards/margins": 6.09375,
"rewards/rejected": -6.15625,
"step": 146
},
{
"epoch": 0.18036809815950922,
"grad_norm": 34.48271141529981,
"learning_rate": 1.8991735537190082e-06,
"logits/chosen": -0.18359375,
"logits/rejected": -0.33203125,
"logps/chosen": -394.0,
"logps/rejected": -340.0,
"loss": 0.3822,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.859375,
"rewards/margins": 7.0625,
"rewards/rejected": -6.21875,
"step": 147
},
{
"epoch": 0.18159509202453988,
"grad_norm": 49.115362801311825,
"learning_rate": 1.8983471074380164e-06,
"logits/chosen": -0.2001953125,
"logits/rejected": -0.328125,
"logps/chosen": -424.0,
"logps/rejected": -378.0,
"loss": 0.4881,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.1494140625,
"rewards/margins": 6.53125,
"rewards/rejected": -6.375,
"step": 148
},
{
"epoch": 0.18282208588957055,
"grad_norm": 38.86108802614245,
"learning_rate": 1.8975206611570248e-06,
"logits/chosen": -0.07177734375,
"logits/rejected": -0.2197265625,
"logps/chosen": -414.0,
"logps/rejected": -392.0,
"loss": 0.2952,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 0.83203125,
"rewards/margins": 6.84375,
"rewards/rejected": -6.0,
"step": 149
},
{
"epoch": 0.18404907975460122,
"grad_norm": 38.51930492178913,
"learning_rate": 1.896694214876033e-06,
"logits/chosen": -0.08447265625,
"logits/rejected": -0.255859375,
"logps/chosen": -432.0,
"logps/rejected": -358.0,
"loss": 0.412,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.44921875,
"rewards/margins": 6.0,
"rewards/rejected": -5.5625,
"step": 150
},
{
"epoch": 0.18527607361963191,
"grad_norm": 32.190177217257066,
"learning_rate": 1.8958677685950412e-06,
"logits/chosen": -0.10498046875,
"logits/rejected": -0.2294921875,
"logps/chosen": -388.0,
"logps/rejected": -334.0,
"loss": 0.348,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.5625,
"rewards/margins": 6.0,
"rewards/rejected": -5.4375,
"step": 151
},
{
"epoch": 0.18650306748466258,
"grad_norm": 33.69803480693185,
"learning_rate": 1.8950413223140496e-06,
"logits/chosen": -0.1923828125,
"logits/rejected": -0.43359375,
"logps/chosen": -404.0,
"logps/rejected": -320.0,
"loss": 0.3364,
"rewards/accuracies": 0.8671875,
"rewards/chosen": 0.55078125,
"rewards/margins": 6.75,
"rewards/rejected": -6.1875,
"step": 152
},
{
"epoch": 0.18773006134969325,
"grad_norm": 32.06678113416197,
"learning_rate": 1.8942148760330578e-06,
"logits/chosen": -0.138671875,
"logits/rejected": -0.24609375,
"logps/chosen": -352.0,
"logps/rejected": -326.0,
"loss": 0.3374,
"rewards/accuracies": 0.828125,
"rewards/chosen": 1.0625,
"rewards/margins": 6.625,
"rewards/rejected": -5.5625,
"step": 153
},
{
"epoch": 0.18895705521472392,
"grad_norm": 40.996857221624495,
"learning_rate": 1.8933884297520662e-06,
"logits/chosen": -0.01409912109375,
"logits/rejected": -0.1904296875,
"logps/chosen": -426.0,
"logps/rejected": -348.0,
"loss": 0.4112,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 1.453125,
"rewards/margins": 6.5,
"rewards/rejected": -5.03125,
"step": 154
},
{
"epoch": 0.1901840490797546,
"grad_norm": 24.729104560024417,
"learning_rate": 1.8925619834710741e-06,
"logits/chosen": -0.1318359375,
"logits/rejected": -0.37890625,
"logps/chosen": -382.0,
"logps/rejected": -324.0,
"loss": 0.2101,
"rewards/accuracies": 0.921875,
"rewards/chosen": 2.3125,
"rewards/margins": 7.8125,
"rewards/rejected": -5.5,
"step": 155
},
{
"epoch": 0.19141104294478528,
"grad_norm": 40.24404266274937,
"learning_rate": 1.8917355371900825e-06,
"logits/chosen": -0.00141143798828125,
"logits/rejected": -0.10498046875,
"logps/chosen": -374.0,
"logps/rejected": -358.0,
"loss": 0.4515,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.7734375,
"rewards/margins": 6.03125,
"rewards/rejected": -5.25,
"step": 156
},
{
"epoch": 0.19263803680981595,
"grad_norm": 34.404145229474516,
"learning_rate": 1.8909090909090907e-06,
"logits/chosen": 0.002410888671875,
"logits/rejected": -0.111328125,
"logps/chosen": -394.0,
"logps/rejected": -314.0,
"loss": 0.353,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 1.25,
"rewards/margins": 6.40625,
"rewards/rejected": -5.15625,
"step": 157
},
{
"epoch": 0.19386503067484662,
"grad_norm": 26.84815928052319,
"learning_rate": 1.8900826446280991e-06,
"logits/chosen": -0.2373046875,
"logits/rejected": -0.40625,
"logps/chosen": -390.0,
"logps/rejected": -328.0,
"loss": 0.2445,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.2421875,
"rewards/margins": 7.0,
"rewards/rejected": -5.75,
"step": 158
},
{
"epoch": 0.1950920245398773,
"grad_norm": 37.97373380612299,
"learning_rate": 1.8892561983471073e-06,
"logits/chosen": -0.10986328125,
"logits/rejected": -0.2265625,
"logps/chosen": -362.0,
"logps/rejected": -332.0,
"loss": 0.4114,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 1.109375,
"rewards/margins": 5.84375,
"rewards/rejected": -4.71875,
"step": 159
},
{
"epoch": 0.19631901840490798,
"grad_norm": 27.482546285866437,
"learning_rate": 1.8884297520661157e-06,
"logits/chosen": 0.0027923583984375,
"logits/rejected": -0.2216796875,
"logps/chosen": -356.0,
"logps/rejected": -316.0,
"loss": 0.2806,
"rewards/accuracies": 0.8671875,
"rewards/chosen": 0.76171875,
"rewards/margins": 6.625,
"rewards/rejected": -5.875,
"step": 160
},
{
"epoch": 0.19754601226993865,
"grad_norm": 30.442059402847082,
"learning_rate": 1.887603305785124e-06,
"logits/chosen": -0.1796875,
"logits/rejected": -0.37890625,
"logps/chosen": -386.0,
"logps/rejected": -304.0,
"loss": 0.3275,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 1.84375,
"rewards/margins": 6.90625,
"rewards/rejected": -5.0625,
"step": 161
},
{
"epoch": 0.19877300613496932,
"grad_norm": 38.550031984431975,
"learning_rate": 1.8867768595041323e-06,
"logits/chosen": -0.08056640625,
"logits/rejected": -0.138671875,
"logps/chosen": -354.0,
"logps/rejected": -344.0,
"loss": 0.4289,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.0703125,
"rewards/margins": 5.8125,
"rewards/rejected": -4.75,
"step": 162
},
{
"epoch": 0.2,
"grad_norm": 33.61198599967516,
"learning_rate": 1.8859504132231403e-06,
"logits/chosen": -0.0069580078125,
"logits/rejected": -0.15625,
"logps/chosen": -394.0,
"logps/rejected": -348.0,
"loss": 0.3118,
"rewards/accuracies": 0.859375,
"rewards/chosen": 1.21875,
"rewards/margins": 6.4375,
"rewards/rejected": -5.21875,
"step": 163
},
{
"epoch": 0.20122699386503068,
"grad_norm": 27.270676204046016,
"learning_rate": 1.8851239669421487e-06,
"logits/chosen": -0.185546875,
"logits/rejected": -0.4140625,
"logps/chosen": -392.0,
"logps/rejected": -308.0,
"loss": 0.3204,
"rewards/accuracies": 0.859375,
"rewards/chosen": 2.296875,
"rewards/margins": 7.4375,
"rewards/rejected": -5.125,
"step": 164
},
{
"epoch": 0.20245398773006135,
"grad_norm": 41.330075772434604,
"learning_rate": 1.8842975206611569e-06,
"logits/chosen": 0.043701171875,
"logits/rejected": -0.142578125,
"logps/chosen": -444.0,
"logps/rejected": -326.0,
"loss": 0.476,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 1.3984375,
"rewards/margins": 6.09375,
"rewards/rejected": -4.6875,
"step": 165
},
{
"epoch": 0.20368098159509201,
"grad_norm": 35.202023456383465,
"learning_rate": 1.8834710743801653e-06,
"logits/chosen": -0.039306640625,
"logits/rejected": -0.25,
"logps/chosen": -390.0,
"logps/rejected": -336.0,
"loss": 0.4262,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 1.75,
"rewards/margins": 6.40625,
"rewards/rejected": -4.65625,
"step": 166
},
{
"epoch": 0.2049079754601227,
"grad_norm": 39.52153640463411,
"learning_rate": 1.8826446280991735e-06,
"logits/chosen": 0.0042724609375,
"logits/rejected": -0.126953125,
"logps/chosen": -402.0,
"logps/rejected": -316.0,
"loss": 0.4278,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 1.921875,
"rewards/margins": 6.5,
"rewards/rejected": -4.59375,
"step": 167
},
{
"epoch": 0.20613496932515338,
"grad_norm": 35.134649088519375,
"learning_rate": 1.8818181818181816e-06,
"logits/chosen": 0.0218505859375,
"logits/rejected": -0.06640625,
"logps/chosen": -348.0,
"logps/rejected": -290.0,
"loss": 0.351,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 1.0078125,
"rewards/margins": 6.3125,
"rewards/rejected": -5.3125,
"step": 168
},
{
"epoch": 0.20736196319018405,
"grad_norm": 32.449216562532385,
"learning_rate": 1.88099173553719e-06,
"logits/chosen": -0.0625,
"logits/rejected": -0.2041015625,
"logps/chosen": -370.0,
"logps/rejected": -362.0,
"loss": 0.3181,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.1171875,
"rewards/margins": 5.875,
"rewards/rejected": -4.75,
"step": 169
},
{
"epoch": 0.2085889570552147,
"grad_norm": 33.40022661196834,
"learning_rate": 1.8801652892561982e-06,
"logits/chosen": -0.054931640625,
"logits/rejected": -0.29296875,
"logps/chosen": -448.0,
"logps/rejected": -344.0,
"loss": 0.3402,
"rewards/accuracies": 0.828125,
"rewards/chosen": 1.9921875,
"rewards/margins": 7.21875,
"rewards/rejected": -5.21875,
"step": 170
},
{
"epoch": 0.2098159509202454,
"grad_norm": 27.947158933463847,
"learning_rate": 1.8793388429752066e-06,
"logits/chosen": -0.049560546875,
"logits/rejected": -0.2119140625,
"logps/chosen": -386.0,
"logps/rejected": -320.0,
"loss": 0.2666,
"rewards/accuracies": 0.890625,
"rewards/chosen": 1.4765625,
"rewards/margins": 7.375,
"rewards/rejected": -5.875,
"step": 171
},
{
"epoch": 0.21104294478527608,
"grad_norm": 30.869364523733665,
"learning_rate": 1.8785123966942146e-06,
"logits/chosen": 0.000576019287109375,
"logits/rejected": -0.1513671875,
"logps/chosen": -438.0,
"logps/rejected": -352.0,
"loss": 0.3213,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 1.859375,
"rewards/margins": 7.78125,
"rewards/rejected": -5.9375,
"step": 172
},
{
"epoch": 0.21226993865030674,
"grad_norm": 25.503527087315327,
"learning_rate": 1.877685950413223e-06,
"logits/chosen": -0.0654296875,
"logits/rejected": -0.29296875,
"logps/chosen": -426.0,
"logps/rejected": -362.0,
"loss": 0.2261,
"rewards/accuracies": 0.90625,
"rewards/chosen": 1.8671875,
"rewards/margins": 8.375,
"rewards/rejected": -6.53125,
"step": 173
},
{
"epoch": 0.2134969325153374,
"grad_norm": 41.45487694767724,
"learning_rate": 1.8768595041322312e-06,
"logits/chosen": 0.1220703125,
"logits/rejected": -0.08349609375,
"logps/chosen": -388.0,
"logps/rejected": -354.0,
"loss": 0.6127,
"rewards/accuracies": 0.7578125,
"rewards/chosen": 0.34765625,
"rewards/margins": 7.0,
"rewards/rejected": -6.65625,
"step": 174
},
{
"epoch": 0.2147239263803681,
"grad_norm": 41.942169731050996,
"learning_rate": 1.8760330578512396e-06,
"logits/chosen": -0.0478515625,
"logits/rejected": -0.1533203125,
"logps/chosen": -406.0,
"logps/rejected": -374.0,
"loss": 0.4923,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.65234375,
"rewards/margins": 7.625,
"rewards/rejected": -6.96875,
"step": 175
},
{
"epoch": 0.21595092024539878,
"grad_norm": 33.02715498525285,
"learning_rate": 1.8752066115702478e-06,
"logits/chosen": -0.06982421875,
"logits/rejected": -0.24609375,
"logps/chosen": -442.0,
"logps/rejected": -386.0,
"loss": 0.3583,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.55859375,
"rewards/margins": 7.6875,
"rewards/rejected": -7.125,
"step": 176
},
{
"epoch": 0.21717791411042944,
"grad_norm": 25.66769359217322,
"learning_rate": 1.8743801652892562e-06,
"logits/chosen": -0.0322265625,
"logits/rejected": -0.259765625,
"logps/chosen": -426.0,
"logps/rejected": -366.0,
"loss": 0.3192,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.1875,
"rewards/margins": 8.875,
"rewards/rejected": -7.6875,
"step": 177
},
{
"epoch": 0.2184049079754601,
"grad_norm": 36.222765395806164,
"learning_rate": 1.8735537190082644e-06,
"logits/chosen": -0.01397705078125,
"logits/rejected": -0.1552734375,
"logps/chosen": -344.0,
"logps/rejected": -328.0,
"loss": 0.4812,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.109375,
"rewards/margins": 6.5625,
"rewards/rejected": -7.6875,
"step": 178
},
{
"epoch": 0.2196319018404908,
"grad_norm": 35.662361802451635,
"learning_rate": 1.8727272727272728e-06,
"logits/chosen": -0.045654296875,
"logits/rejected": -0.267578125,
"logps/chosen": -386.0,
"logps/rejected": -340.0,
"loss": 0.3996,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -0.8984375,
"rewards/margins": 6.78125,
"rewards/rejected": -7.65625,
"step": 179
},
{
"epoch": 0.22085889570552147,
"grad_norm": 39.55523149344556,
"learning_rate": 1.871900826446281e-06,
"logits/chosen": -0.036376953125,
"logits/rejected": -0.1455078125,
"logps/chosen": -370.0,
"logps/rejected": -328.0,
"loss": 0.4414,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -0.193359375,
"rewards/margins": 6.4375,
"rewards/rejected": -6.65625,
"step": 180
},
{
"epoch": 0.22208588957055214,
"grad_norm": 34.73055438874572,
"learning_rate": 1.8710743801652892e-06,
"logits/chosen": -0.03955078125,
"logits/rejected": -0.18359375,
"logps/chosen": -426.0,
"logps/rejected": -402.0,
"loss": 0.3822,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.08056640625,
"rewards/margins": 7.03125,
"rewards/rejected": -6.96875,
"step": 181
},
{
"epoch": 0.2233128834355828,
"grad_norm": 35.549083959412364,
"learning_rate": 1.8702479338842973e-06,
"logits/chosen": -0.0751953125,
"logits/rejected": -0.1904296875,
"logps/chosen": -384.0,
"logps/rejected": -344.0,
"loss": 0.4471,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.404296875,
"rewards/margins": 6.53125,
"rewards/rejected": -6.9375,
"step": 182
},
{
"epoch": 0.2245398773006135,
"grad_norm": 34.334033511280325,
"learning_rate": 1.8694214876033057e-06,
"logits/chosen": 0.06884765625,
"logits/rejected": -0.10400390625,
"logps/chosen": -426.0,
"logps/rejected": -400.0,
"loss": 0.4001,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.46875,
"rewards/margins": 5.8125,
"rewards/rejected": -6.28125,
"step": 183
},
{
"epoch": 0.22576687116564417,
"grad_norm": 41.54844712953319,
"learning_rate": 1.868595041322314e-06,
"logits/chosen": 0.046875,
"logits/rejected": -0.0576171875,
"logps/chosen": -400.0,
"logps/rejected": -358.0,
"loss": 0.4696,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.275390625,
"rewards/margins": 6.0,
"rewards/rejected": -6.25,
"step": 184
},
{
"epoch": 0.22699386503067484,
"grad_norm": 43.753107851750954,
"learning_rate": 1.8677685950413223e-06,
"logits/chosen": -0.000835418701171875,
"logits/rejected": -0.045654296875,
"logps/chosen": -392.0,
"logps/rejected": -368.0,
"loss": 0.4815,
"rewards/accuracies": 0.7734375,
"rewards/chosen": 0.81640625,
"rewards/margins": 6.46875,
"rewards/rejected": -5.65625,
"step": 185
},
{
"epoch": 0.2282208588957055,
"grad_norm": 31.045678715411483,
"learning_rate": 1.8669421487603305e-06,
"logits/chosen": -0.005645751953125,
"logits/rejected": -0.1171875,
"logps/chosen": -346.0,
"logps/rejected": -328.0,
"loss": 0.3289,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.55859375,
"rewards/margins": 6.46875,
"rewards/rejected": -5.90625,
"step": 186
},
{
"epoch": 0.2294478527607362,
"grad_norm": 28.180859457617533,
"learning_rate": 1.8661157024793387e-06,
"logits/chosen": -0.0026092529296875,
"logits/rejected": -0.1591796875,
"logps/chosen": -378.0,
"logps/rejected": -356.0,
"loss": 0.2624,
"rewards/accuracies": 0.8984375,
"rewards/chosen": 0.84375,
"rewards/margins": 7.25,
"rewards/rejected": -6.40625,
"step": 187
},
{
"epoch": 0.23067484662576687,
"grad_norm": 34.6454692796615,
"learning_rate": 1.8652892561983471e-06,
"logits/chosen": 0.09716796875,
"logits/rejected": 0.020751953125,
"logps/chosen": -338.0,
"logps/rejected": -306.0,
"loss": 0.4244,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 0.62109375,
"rewards/margins": 6.375,
"rewards/rejected": -5.75,
"step": 188
},
{
"epoch": 0.23190184049079754,
"grad_norm": 29.626045464559624,
"learning_rate": 1.8644628099173553e-06,
"logits/chosen": -0.016845703125,
"logits/rejected": -0.2041015625,
"logps/chosen": -402.0,
"logps/rejected": -334.0,
"loss": 0.2424,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 1.390625,
"rewards/margins": 7.1875,
"rewards/rejected": -5.78125,
"step": 189
},
{
"epoch": 0.2331288343558282,
"grad_norm": 30.762979161416748,
"learning_rate": 1.8636363636363635e-06,
"logits/chosen": 0.125,
"logits/rejected": -0.0177001953125,
"logps/chosen": -348.0,
"logps/rejected": -326.0,
"loss": 0.3577,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.6953125,
"rewards/margins": 6.28125,
"rewards/rejected": -5.5625,
"step": 190
},
{
"epoch": 0.2343558282208589,
"grad_norm": 39.505528847896215,
"learning_rate": 1.8628099173553717e-06,
"logits/chosen": 0.0380859375,
"logits/rejected": -0.142578125,
"logps/chosen": -404.0,
"logps/rejected": -312.0,
"loss": 0.3813,
"rewards/accuracies": 0.828125,
"rewards/chosen": 1.4921875,
"rewards/margins": 7.03125,
"rewards/rejected": -5.5625,
"step": 191
},
{
"epoch": 0.23558282208588957,
"grad_norm": 36.116008803592244,
"learning_rate": 1.86198347107438e-06,
"logits/chosen": 0.021728515625,
"logits/rejected": -0.1748046875,
"logps/chosen": -392.0,
"logps/rejected": -304.0,
"loss": 0.388,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.7890625,
"rewards/margins": 5.59375,
"rewards/rejected": -4.8125,
"step": 192
},
{
"epoch": 0.23680981595092024,
"grad_norm": 27.40230966095949,
"learning_rate": 1.8611570247933883e-06,
"logits/chosen": -0.11328125,
"logits/rejected": -0.359375,
"logps/chosen": -412.0,
"logps/rejected": -346.0,
"loss": 0.2434,
"rewards/accuracies": 0.8671875,
"rewards/chosen": 1.5390625,
"rewards/margins": 7.28125,
"rewards/rejected": -5.75,
"step": 193
},
{
"epoch": 0.23803680981595093,
"grad_norm": 33.62467485299581,
"learning_rate": 1.8603305785123967e-06,
"logits/chosen": -0.1591796875,
"logits/rejected": -0.2578125,
"logps/chosen": -394.0,
"logps/rejected": -334.0,
"loss": 0.3113,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.84375,
"rewards/margins": 6.625,
"rewards/rejected": -5.78125,
"step": 194
},
{
"epoch": 0.2392638036809816,
"grad_norm": 32.17428701370047,
"learning_rate": 1.8595041322314049e-06,
"logits/chosen": 0.02490234375,
"logits/rejected": -0.232421875,
"logps/chosen": -410.0,
"logps/rejected": -346.0,
"loss": 0.3146,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 1.8828125,
"rewards/margins": 7.78125,
"rewards/rejected": -5.90625,
"step": 195
},
{
"epoch": 0.24049079754601227,
"grad_norm": 35.079148108918936,
"learning_rate": 1.8586776859504133e-06,
"logits/chosen": 0.0791015625,
"logits/rejected": -0.1201171875,
"logps/chosen": -394.0,
"logps/rejected": -306.0,
"loss": 0.35,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.0625,
"rewards/margins": 6.53125,
"rewards/rejected": -5.46875,
"step": 196
},
{
"epoch": 0.24171779141104294,
"grad_norm": 28.38496677798881,
"learning_rate": 1.8578512396694214e-06,
"logits/chosen": -0.06884765625,
"logits/rejected": -0.29296875,
"logps/chosen": -382.0,
"logps/rejected": -332.0,
"loss": 0.3581,
"rewards/accuracies": 0.828125,
"rewards/chosen": 1.3046875,
"rewards/margins": 6.78125,
"rewards/rejected": -5.46875,
"step": 197
},
{
"epoch": 0.24294478527607363,
"grad_norm": 34.75855042205488,
"learning_rate": 1.8570247933884298e-06,
"logits/chosen": 0.044189453125,
"logits/rejected": -0.03955078125,
"logps/chosen": -348.0,
"logps/rejected": -274.0,
"loss": 0.4955,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.5390625,
"rewards/margins": 5.9375,
"rewards/rejected": -5.40625,
"step": 198
},
{
"epoch": 0.2441717791411043,
"grad_norm": 24.3391639569881,
"learning_rate": 1.8561983471074378e-06,
"logits/chosen": -0.00836181640625,
"logits/rejected": -0.2099609375,
"logps/chosen": -432.0,
"logps/rejected": -326.0,
"loss": 0.2205,
"rewards/accuracies": 0.890625,
"rewards/chosen": 1.9453125,
"rewards/margins": 7.59375,
"rewards/rejected": -5.65625,
"step": 199
},
{
"epoch": 0.24539877300613497,
"grad_norm": 33.67790011389976,
"learning_rate": 1.8553719008264462e-06,
"logits/chosen": 0.00171661376953125,
"logits/rejected": -0.208984375,
"logps/chosen": -440.0,
"logps/rejected": -390.0,
"loss": 0.3635,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.4296875,
"rewards/margins": 7.34375,
"rewards/rejected": -5.9375,
"step": 200
},
{
"epoch": 0.24662576687116564,
"grad_norm": 29.94304119699642,
"learning_rate": 1.8545454545454544e-06,
"logits/chosen": 0.0040283203125,
"logits/rejected": -0.2216796875,
"logps/chosen": -402.0,
"logps/rejected": -328.0,
"loss": 0.2723,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 1.34375,
"rewards/margins": 7.21875,
"rewards/rejected": -5.875,
"step": 201
},
{
"epoch": 0.24785276073619633,
"grad_norm": 28.765821444293348,
"learning_rate": 1.8537190082644628e-06,
"logits/chosen": 0.01214599609375,
"logits/rejected": -0.2001953125,
"logps/chosen": -432.0,
"logps/rejected": -342.0,
"loss": 0.3032,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 1.078125,
"rewards/margins": 7.125,
"rewards/rejected": -6.0625,
"step": 202
},
{
"epoch": 0.249079754601227,
"grad_norm": 34.905817372902206,
"learning_rate": 1.852892561983471e-06,
"logits/chosen": 0.06396484375,
"logits/rejected": -0.10693359375,
"logps/chosen": -394.0,
"logps/rejected": -356.0,
"loss": 0.5268,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.8515625,
"rewards/margins": 6.125,
"rewards/rejected": -5.25,
"step": 203
},
{
"epoch": 0.25030674846625767,
"grad_norm": 31.956685722412658,
"learning_rate": 1.8520661157024792e-06,
"logits/chosen": 0.0751953125,
"logits/rejected": -0.06201171875,
"logps/chosen": -358.0,
"logps/rejected": -296.0,
"loss": 0.4338,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.34375,
"rewards/margins": 6.78125,
"rewards/rejected": -6.4375,
"step": 204
},
{
"epoch": 0.25153374233128833,
"grad_norm": 37.935814784521064,
"learning_rate": 1.8512396694214876e-06,
"logits/chosen": 0.12451171875,
"logits/rejected": -0.0078125,
"logps/chosen": -394.0,
"logps/rejected": -326.0,
"loss": 0.4439,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.40234375,
"rewards/margins": 6.5,
"rewards/rejected": -6.09375,
"step": 205
},
{
"epoch": 0.252760736196319,
"grad_norm": 28.711197288901985,
"learning_rate": 1.8504132231404958e-06,
"logits/chosen": -0.013671875,
"logits/rejected": -0.291015625,
"logps/chosen": -440.0,
"logps/rejected": -360.0,
"loss": 0.2712,
"rewards/accuracies": 0.9140625,
"rewards/chosen": 0.765625,
"rewards/margins": 8.0625,
"rewards/rejected": -7.3125,
"step": 206
},
{
"epoch": 0.25398773006134967,
"grad_norm": 36.2137572830465,
"learning_rate": 1.8495867768595042e-06,
"logits/chosen": -0.1435546875,
"logits/rejected": -0.333984375,
"logps/chosen": -438.0,
"logps/rejected": -386.0,
"loss": 0.4606,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.64453125,
"rewards/margins": 7.25,
"rewards/rejected": -6.59375,
"step": 207
},
{
"epoch": 0.2552147239263804,
"grad_norm": 36.36125991050883,
"learning_rate": 1.8487603305785121e-06,
"logits/chosen": -0.10400390625,
"logits/rejected": -0.232421875,
"logps/chosen": -402.0,
"logps/rejected": -354.0,
"loss": 0.4728,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.2099609375,
"rewards/margins": 7.34375,
"rewards/rejected": -7.125,
"step": 208
},
{
"epoch": 0.25644171779141106,
"grad_norm": 29.48688226760878,
"learning_rate": 1.8479338842975205e-06,
"logits/chosen": -0.10888671875,
"logits/rejected": -0.2119140625,
"logps/chosen": -404.0,
"logps/rejected": -368.0,
"loss": 0.3045,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.01483154296875,
"rewards/margins": 7.03125,
"rewards/rejected": -7.0625,
"step": 209
},
{
"epoch": 0.25766871165644173,
"grad_norm": 43.32418692899722,
"learning_rate": 1.8471074380165287e-06,
"logits/chosen": -0.057373046875,
"logits/rejected": -0.1640625,
"logps/chosen": -408.0,
"logps/rejected": -396.0,
"loss": 0.4799,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.58203125,
"rewards/margins": 6.5,
"rewards/rejected": -7.09375,
"step": 210
},
{
"epoch": 0.2588957055214724,
"grad_norm": 32.875594911340926,
"learning_rate": 1.8462809917355371e-06,
"logits/chosen": -0.1796875,
"logits/rejected": -0.369140625,
"logps/chosen": -448.0,
"logps/rejected": -380.0,
"loss": 0.4038,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.12451171875,
"rewards/margins": 7.53125,
"rewards/rejected": -7.65625,
"step": 211
},
{
"epoch": 0.26012269938650306,
"grad_norm": 32.229612216659156,
"learning_rate": 1.8454545454545453e-06,
"logits/chosen": -0.091796875,
"logits/rejected": -0.2421875,
"logps/chosen": -416.0,
"logps/rejected": -346.0,
"loss": 0.4005,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0693359375,
"rewards/margins": 7.34375,
"rewards/rejected": -7.4375,
"step": 212
},
{
"epoch": 0.26134969325153373,
"grad_norm": 33.986071909620065,
"learning_rate": 1.8446280991735537e-06,
"logits/chosen": -0.0184326171875,
"logits/rejected": -0.0732421875,
"logps/chosen": -366.0,
"logps/rejected": -318.0,
"loss": 0.3423,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.83203125,
"rewards/margins": 6.625,
"rewards/rejected": -7.46875,
"step": 213
},
{
"epoch": 0.2625766871165644,
"grad_norm": 37.10851232974184,
"learning_rate": 1.843801652892562e-06,
"logits/chosen": -0.009033203125,
"logits/rejected": -0.1591796875,
"logps/chosen": -392.0,
"logps/rejected": -348.0,
"loss": 0.4335,
"rewards/accuracies": 0.796875,
"rewards/chosen": -0.439453125,
"rewards/margins": 6.96875,
"rewards/rejected": -7.40625,
"step": 214
},
{
"epoch": 0.26380368098159507,
"grad_norm": 36.733063444572046,
"learning_rate": 1.8429752066115703e-06,
"logits/chosen": 0.03955078125,
"logits/rejected": -0.04833984375,
"logps/chosen": -372.0,
"logps/rejected": -338.0,
"loss": 0.4476,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -0.9765625,
"rewards/margins": 6.25,
"rewards/rejected": -7.21875,
"step": 215
},
{
"epoch": 0.2650306748466258,
"grad_norm": 34.01324686588401,
"learning_rate": 1.8421487603305785e-06,
"logits/chosen": -0.0233154296875,
"logits/rejected": -0.140625,
"logps/chosen": -350.0,
"logps/rejected": -328.0,
"loss": 0.3626,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.171875,
"rewards/margins": 6.34375,
"rewards/rejected": -7.5,
"step": 216
},
{
"epoch": 0.26625766871165646,
"grad_norm": 33.9425395489284,
"learning_rate": 1.8413223140495867e-06,
"logits/chosen": 0.07861328125,
"logits/rejected": -0.05712890625,
"logps/chosen": -418.0,
"logps/rejected": -340.0,
"loss": 0.4867,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -0.37109375,
"rewards/margins": 6.8125,
"rewards/rejected": -7.1875,
"step": 217
},
{
"epoch": 0.2674846625766871,
"grad_norm": 36.88406469678275,
"learning_rate": 1.8404958677685949e-06,
"logits/chosen": 0.0286865234375,
"logits/rejected": -0.0673828125,
"logps/chosen": -398.0,
"logps/rejected": -364.0,
"loss": 0.6112,
"rewards/accuracies": 0.796875,
"rewards/chosen": -0.55078125,
"rewards/margins": 6.1875,
"rewards/rejected": -6.75,
"step": 218
},
{
"epoch": 0.2687116564417178,
"grad_norm": 27.106981198592187,
"learning_rate": 1.8396694214876033e-06,
"logits/chosen": -0.06982421875,
"logits/rejected": -0.1650390625,
"logps/chosen": -364.0,
"logps/rejected": -328.0,
"loss": 0.3271,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.34375,
"rewards/margins": 6.75,
"rewards/rejected": -7.09375,
"step": 219
},
{
"epoch": 0.26993865030674846,
"grad_norm": 41.33290696076488,
"learning_rate": 1.8388429752066115e-06,
"logits/chosen": 0.10546875,
"logits/rejected": 0.04150390625,
"logps/chosen": -376.0,
"logps/rejected": -386.0,
"loss": 0.484,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.54296875,
"rewards/margins": 5.5,
"rewards/rejected": -6.0625,
"step": 220
},
{
"epoch": 0.27116564417177913,
"grad_norm": 34.82671379199956,
"learning_rate": 1.8380165289256197e-06,
"logits/chosen": -0.03125,
"logits/rejected": -0.2353515625,
"logps/chosen": -374.0,
"logps/rejected": -320.0,
"loss": 0.4323,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -0.515625,
"rewards/margins": 6.15625,
"rewards/rejected": -6.6875,
"step": 221
},
{
"epoch": 0.2723926380368098,
"grad_norm": 32.09209252085318,
"learning_rate": 1.837190082644628e-06,
"logits/chosen": -0.2294921875,
"logits/rejected": -0.35546875,
"logps/chosen": -396.0,
"logps/rejected": -330.0,
"loss": 0.3723,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.64453125,
"rewards/margins": 7.65625,
"rewards/rejected": -7.03125,
"step": 222
},
{
"epoch": 0.27361963190184047,
"grad_norm": 30.360418922302767,
"learning_rate": 1.8363636363636362e-06,
"logits/chosen": -0.0025177001953125,
"logits/rejected": -0.1767578125,
"logps/chosen": -396.0,
"logps/rejected": -350.0,
"loss": 0.3446,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.1201171875,
"rewards/margins": 6.5,
"rewards/rejected": -6.625,
"step": 223
},
{
"epoch": 0.2748466257668712,
"grad_norm": 33.28343727553535,
"learning_rate": 1.8355371900826446e-06,
"logits/chosen": -0.1494140625,
"logits/rejected": -0.314453125,
"logps/chosen": -458.0,
"logps/rejected": -360.0,
"loss": 0.3381,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.8125,
"rewards/margins": 7.4375,
"rewards/rejected": -6.625,
"step": 224
},
{
"epoch": 0.27607361963190186,
"grad_norm": 27.575287222312205,
"learning_rate": 1.8347107438016528e-06,
"logits/chosen": -0.0074462890625,
"logits/rejected": -0.197265625,
"logps/chosen": -350.0,
"logps/rejected": -330.0,
"loss": 0.2979,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.1240234375,
"rewards/margins": 6.75,
"rewards/rejected": -6.875,
"step": 225
},
{
"epoch": 0.2773006134969325,
"grad_norm": 35.804717446072374,
"learning_rate": 1.833884297520661e-06,
"logits/chosen": -0.0263671875,
"logits/rejected": -0.1533203125,
"logps/chosen": -384.0,
"logps/rejected": -334.0,
"loss": 0.5311,
"rewards/accuracies": 0.7734375,
"rewards/chosen": 0.2490234375,
"rewards/margins": 6.40625,
"rewards/rejected": -6.15625,
"step": 226
},
{
"epoch": 0.2785276073619632,
"grad_norm": 33.17082749696476,
"learning_rate": 1.8330578512396692e-06,
"logits/chosen": -0.0654296875,
"logits/rejected": -0.11962890625,
"logps/chosen": -366.0,
"logps/rejected": -338.0,
"loss": 0.3674,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.271484375,
"rewards/margins": 6.8125,
"rewards/rejected": -6.5625,
"step": 227
},
{
"epoch": 0.27975460122699386,
"grad_norm": 39.03709023154875,
"learning_rate": 1.8322314049586776e-06,
"logits/chosen": -0.0859375,
"logits/rejected": -0.265625,
"logps/chosen": -372.0,
"logps/rejected": -344.0,
"loss": 0.3658,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.08642578125,
"rewards/margins": 6.21875,
"rewards/rejected": -6.125,
"step": 228
},
{
"epoch": 0.2809815950920245,
"grad_norm": 33.405275623628135,
"learning_rate": 1.8314049586776858e-06,
"logits/chosen": 0.033447265625,
"logits/rejected": -0.1650390625,
"logps/chosen": -428.0,
"logps/rejected": -350.0,
"loss": 0.4121,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.94921875,
"rewards/margins": 6.0625,
"rewards/rejected": -5.125,
"step": 229
},
{
"epoch": 0.2822085889570552,
"grad_norm": 28.934513872861842,
"learning_rate": 1.8305785123966942e-06,
"logits/chosen": 0.01422119140625,
"logits/rejected": -0.171875,
"logps/chosen": -382.0,
"logps/rejected": -344.0,
"loss": 0.3171,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.31640625,
"rewards/margins": 6.6875,
"rewards/rejected": -6.34375,
"step": 230
},
{
"epoch": 0.28343558282208586,
"grad_norm": 42.101697675910884,
"learning_rate": 1.8297520661157024e-06,
"logits/chosen": -0.0458984375,
"logits/rejected": -0.1591796875,
"logps/chosen": -378.0,
"logps/rejected": -330.0,
"loss": 0.5022,
"rewards/accuracies": 0.765625,
"rewards/chosen": 0.1884765625,
"rewards/margins": 5.75,
"rewards/rejected": -5.5625,
"step": 231
},
{
"epoch": 0.2846625766871166,
"grad_norm": 31.041614627432494,
"learning_rate": 1.8289256198347108e-06,
"logits/chosen": -0.1416015625,
"logits/rejected": -0.2734375,
"logps/chosen": -390.0,
"logps/rejected": -352.0,
"loss": 0.3309,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.154296875,
"rewards/margins": 5.9375,
"rewards/rejected": -5.78125,
"step": 232
},
{
"epoch": 0.28588957055214725,
"grad_norm": 33.208288428637466,
"learning_rate": 1.828099173553719e-06,
"logits/chosen": -0.031982421875,
"logits/rejected": -0.240234375,
"logps/chosen": -378.0,
"logps/rejected": -304.0,
"loss": 0.3639,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.84375,
"rewards/margins": 6.5625,
"rewards/rejected": -5.71875,
"step": 233
},
{
"epoch": 0.2871165644171779,
"grad_norm": 34.551985856914754,
"learning_rate": 1.8272727272727274e-06,
"logits/chosen": -0.181640625,
"logits/rejected": -0.287109375,
"logps/chosen": -378.0,
"logps/rejected": -324.0,
"loss": 0.3713,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.7421875,
"rewards/margins": 5.75,
"rewards/rejected": -5.0,
"step": 234
},
{
"epoch": 0.2883435582822086,
"grad_norm": 33.24252120404476,
"learning_rate": 1.8264462809917353e-06,
"logits/chosen": -0.1884765625,
"logits/rejected": -0.33203125,
"logps/chosen": -368.0,
"logps/rejected": -336.0,
"loss": 0.4505,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.64453125,
"rewards/margins": 6.375,
"rewards/rejected": -5.71875,
"step": 235
},
{
"epoch": 0.28957055214723926,
"grad_norm": 35.77389224303484,
"learning_rate": 1.8256198347107437e-06,
"logits/chosen": 0.0810546875,
"logits/rejected": -0.087890625,
"logps/chosen": -400.0,
"logps/rejected": -384.0,
"loss": 0.5182,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 1.2890625,
"rewards/margins": 6.125,
"rewards/rejected": -4.84375,
"step": 236
},
{
"epoch": 0.2907975460122699,
"grad_norm": 31.129635224715592,
"learning_rate": 1.824793388429752e-06,
"logits/chosen": -0.09228515625,
"logits/rejected": -0.234375,
"logps/chosen": -372.0,
"logps/rejected": -324.0,
"loss": 0.3941,
"rewards/accuracies": 0.859375,
"rewards/chosen": 1.1015625,
"rewards/margins": 6.75,
"rewards/rejected": -5.625,
"step": 237
},
{
"epoch": 0.2920245398773006,
"grad_norm": 35.65380017849091,
"learning_rate": 1.8239669421487603e-06,
"logits/chosen": -0.0908203125,
"logits/rejected": -0.234375,
"logps/chosen": -432.0,
"logps/rejected": -364.0,
"loss": 0.5599,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.96484375,
"rewards/margins": 6.0625,
"rewards/rejected": -5.09375,
"step": 238
},
{
"epoch": 0.29325153374233126,
"grad_norm": 32.052298425748006,
"learning_rate": 1.8231404958677685e-06,
"logits/chosen": -0.12158203125,
"logits/rejected": -0.283203125,
"logps/chosen": -388.0,
"logps/rejected": -324.0,
"loss": 0.3905,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 1.5078125,
"rewards/margins": 6.84375,
"rewards/rejected": -5.34375,
"step": 239
},
{
"epoch": 0.294478527607362,
"grad_norm": 35.84557042473533,
"learning_rate": 1.8223140495867767e-06,
"logits/chosen": -0.14453125,
"logits/rejected": -0.263671875,
"logps/chosen": -426.0,
"logps/rejected": -372.0,
"loss": 0.3132,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 1.21875,
"rewards/margins": 7.1875,
"rewards/rejected": -5.96875,
"step": 240
},
{
"epoch": 0.29570552147239265,
"grad_norm": 30.402376947293806,
"learning_rate": 1.8214876033057851e-06,
"logits/chosen": -0.06298828125,
"logits/rejected": -0.18359375,
"logps/chosen": -374.0,
"logps/rejected": -350.0,
"loss": 0.3285,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.90234375,
"rewards/margins": 6.9375,
"rewards/rejected": -6.0625,
"step": 241
},
{
"epoch": 0.2969325153374233,
"grad_norm": 29.56214225717774,
"learning_rate": 1.8206611570247933e-06,
"logits/chosen": -0.09130859375,
"logits/rejected": -0.2373046875,
"logps/chosen": -360.0,
"logps/rejected": -338.0,
"loss": 0.3124,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.333984375,
"rewards/margins": 7.03125,
"rewards/rejected": -6.6875,
"step": 242
},
{
"epoch": 0.298159509202454,
"grad_norm": 38.918268887194166,
"learning_rate": 1.8198347107438015e-06,
"logits/chosen": -0.189453125,
"logits/rejected": -0.322265625,
"logps/chosen": -400.0,
"logps/rejected": -378.0,
"loss": 0.4651,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.361328125,
"rewards/margins": 6.0625,
"rewards/rejected": -5.6875,
"step": 243
},
{
"epoch": 0.29938650306748466,
"grad_norm": 37.49319000473201,
"learning_rate": 1.8190082644628097e-06,
"logits/chosen": -0.177734375,
"logits/rejected": -0.38671875,
"logps/chosen": -396.0,
"logps/rejected": -364.0,
"loss": 0.6062,
"rewards/accuracies": 0.765625,
"rewards/chosen": 0.119140625,
"rewards/margins": 6.0625,
"rewards/rejected": -5.9375,
"step": 244
},
{
"epoch": 0.3006134969325153,
"grad_norm": 27.548754613441176,
"learning_rate": 1.818181818181818e-06,
"logits/chosen": -0.150390625,
"logits/rejected": -0.283203125,
"logps/chosen": -410.0,
"logps/rejected": -370.0,
"loss": 0.3154,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.89453125,
"rewards/margins": 7.09375,
"rewards/rejected": -6.1875,
"step": 245
},
{
"epoch": 0.301840490797546,
"grad_norm": 31.428983894448056,
"learning_rate": 1.8173553719008263e-06,
"logits/chosen": -0.1689453125,
"logits/rejected": -0.31640625,
"logps/chosen": -386.0,
"logps/rejected": -364.0,
"loss": 0.4208,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.91796875,
"rewards/margins": 6.96875,
"rewards/rejected": -6.0625,
"step": 246
},
{
"epoch": 0.3030674846625767,
"grad_norm": 35.8356562486741,
"learning_rate": 1.8165289256198347e-06,
"logits/chosen": -0.1494140625,
"logits/rejected": -0.3359375,
"logps/chosen": -386.0,
"logps/rejected": -326.0,
"loss": 0.4266,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.1875,
"rewards/margins": 6.40625,
"rewards/rejected": -6.59375,
"step": 247
},
{
"epoch": 0.3042944785276074,
"grad_norm": 30.06552672230669,
"learning_rate": 1.8157024793388429e-06,
"logits/chosen": -0.0732421875,
"logits/rejected": -0.314453125,
"logps/chosen": -402.0,
"logps/rejected": -352.0,
"loss": 0.2547,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.494140625,
"rewards/margins": 6.78125,
"rewards/rejected": -6.28125,
"step": 248
},
{
"epoch": 0.30552147239263805,
"grad_norm": 36.83655921915478,
"learning_rate": 1.8148760330578513e-06,
"logits/chosen": -0.2099609375,
"logits/rejected": -0.40625,
"logps/chosen": -486.0,
"logps/rejected": -386.0,
"loss": 0.391,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.4765625,
"rewards/margins": 7.375,
"rewards/rejected": -5.90625,
"step": 249
},
{
"epoch": 0.3067484662576687,
"grad_norm": 37.752184625467414,
"learning_rate": 1.8140495867768594e-06,
"logits/chosen": -0.296875,
"logits/rejected": -0.341796875,
"logps/chosen": -352.0,
"logps/rejected": -342.0,
"loss": 0.4516,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.1357421875,
"rewards/margins": 6.4375,
"rewards/rejected": -6.28125,
"step": 250
},
{
"epoch": 0.3079754601226994,
"grad_norm": 37.215429535528145,
"learning_rate": 1.8132231404958678e-06,
"logits/chosen": 0.046875,
"logits/rejected": -0.1123046875,
"logps/chosen": -388.0,
"logps/rejected": -326.0,
"loss": 0.4531,
"rewards/accuracies": 0.765625,
"rewards/chosen": 0.1396484375,
"rewards/margins": 5.9375,
"rewards/rejected": -5.78125,
"step": 251
},
{
"epoch": 0.30920245398773005,
"grad_norm": 36.33063050800995,
"learning_rate": 1.8123966942148758e-06,
"logits/chosen": -0.1337890625,
"logits/rejected": -0.279296875,
"logps/chosen": -404.0,
"logps/rejected": -328.0,
"loss": 0.5192,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.6796875,
"rewards/margins": 6.40625,
"rewards/rejected": -5.71875,
"step": 252
},
{
"epoch": 0.3104294478527607,
"grad_norm": 23.572885198304117,
"learning_rate": 1.8115702479338842e-06,
"logits/chosen": -0.1513671875,
"logits/rejected": -0.384765625,
"logps/chosen": -348.0,
"logps/rejected": -318.0,
"loss": 0.2557,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.369140625,
"rewards/margins": 6.9375,
"rewards/rejected": -6.59375,
"step": 253
},
{
"epoch": 0.3116564417177914,
"grad_norm": 31.88920391109181,
"learning_rate": 1.8107438016528924e-06,
"logits/chosen": -0.09765625,
"logits/rejected": -0.2421875,
"logps/chosen": -364.0,
"logps/rejected": -338.0,
"loss": 0.4349,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.6953125,
"rewards/margins": 6.875,
"rewards/rejected": -6.1875,
"step": 254
},
{
"epoch": 0.3128834355828221,
"grad_norm": 34.98844147021467,
"learning_rate": 1.8099173553719008e-06,
"logits/chosen": -0.059326171875,
"logits/rejected": -0.203125,
"logps/chosen": -396.0,
"logps/rejected": -330.0,
"loss": 0.483,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.66796875,
"rewards/margins": 6.21875,
"rewards/rejected": -5.5625,
"step": 255
},
{
"epoch": 0.3141104294478528,
"grad_norm": 30.717298361863232,
"learning_rate": 1.809090909090909e-06,
"logits/chosen": -0.1533203125,
"logits/rejected": -0.314453125,
"logps/chosen": -358.0,
"logps/rejected": -334.0,
"loss": 0.3686,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 1.2578125,
"rewards/margins": 7.71875,
"rewards/rejected": -6.46875,
"step": 256
},
{
"epoch": 0.31533742331288345,
"grad_norm": 32.38957302493671,
"learning_rate": 1.8082644628099172e-06,
"logits/chosen": -0.125,
"logits/rejected": -0.26953125,
"logps/chosen": -436.0,
"logps/rejected": -372.0,
"loss": 0.3988,
"rewards/accuracies": 0.828125,
"rewards/chosen": 1.2578125,
"rewards/margins": 7.1875,
"rewards/rejected": -5.9375,
"step": 257
},
{
"epoch": 0.3165644171779141,
"grad_norm": 32.251415399902235,
"learning_rate": 1.8074380165289256e-06,
"logits/chosen": -0.062255859375,
"logits/rejected": -0.2578125,
"logps/chosen": -404.0,
"logps/rejected": -356.0,
"loss": 0.3654,
"rewards/accuracies": 0.8671875,
"rewards/chosen": 1.0234375,
"rewards/margins": 7.28125,
"rewards/rejected": -6.25,
"step": 258
},
{
"epoch": 0.3177914110429448,
"grad_norm": 29.92303190987881,
"learning_rate": 1.8066115702479338e-06,
"logits/chosen": -0.150390625,
"logits/rejected": -0.326171875,
"logps/chosen": -354.0,
"logps/rejected": -368.0,
"loss": 0.3777,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.44140625,
"rewards/margins": 6.84375,
"rewards/rejected": -6.40625,
"step": 259
},
{
"epoch": 0.31901840490797545,
"grad_norm": 35.81124429262747,
"learning_rate": 1.8057851239669422e-06,
"logits/chosen": -0.162109375,
"logits/rejected": -0.2373046875,
"logps/chosen": -396.0,
"logps/rejected": -338.0,
"loss": 0.3848,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.51953125,
"rewards/margins": 6.78125,
"rewards/rejected": -6.28125,
"step": 260
},
{
"epoch": 0.3202453987730061,
"grad_norm": 35.92574955807426,
"learning_rate": 1.8049586776859502e-06,
"logits/chosen": -0.07861328125,
"logits/rejected": -0.2255859375,
"logps/chosen": -384.0,
"logps/rejected": -338.0,
"loss": 0.4494,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.765625,
"rewards/margins": 7.03125,
"rewards/rejected": -6.28125,
"step": 261
},
{
"epoch": 0.3214723926380368,
"grad_norm": 36.90912873255913,
"learning_rate": 1.8041322314049586e-06,
"logits/chosen": -0.1259765625,
"logits/rejected": -0.29296875,
"logps/chosen": -392.0,
"logps/rejected": -348.0,
"loss": 0.407,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 1.2421875,
"rewards/margins": 7.09375,
"rewards/rejected": -5.84375,
"step": 262
},
{
"epoch": 0.3226993865030675,
"grad_norm": 44.13843960126915,
"learning_rate": 1.8033057851239667e-06,
"logits/chosen": -0.109375,
"logits/rejected": -0.2265625,
"logps/chosen": -376.0,
"logps/rejected": -328.0,
"loss": 0.5838,
"rewards/accuracies": 0.7578125,
"rewards/chosen": 0.038330078125,
"rewards/margins": 5.5625,
"rewards/rejected": -5.5,
"step": 263
},
{
"epoch": 0.3239263803680982,
"grad_norm": 35.844763168882,
"learning_rate": 1.8024793388429751e-06,
"logits/chosen": -0.0478515625,
"logits/rejected": -0.1533203125,
"logps/chosen": -358.0,
"logps/rejected": -312.0,
"loss": 0.4203,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.5625,
"rewards/margins": 6.03125,
"rewards/rejected": -5.46875,
"step": 264
},
{
"epoch": 0.32515337423312884,
"grad_norm": 38.77846474424905,
"learning_rate": 1.8016528925619833e-06,
"logits/chosen": -0.05908203125,
"logits/rejected": -0.2197265625,
"logps/chosen": -362.0,
"logps/rejected": -290.0,
"loss": 0.3753,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.55859375,
"rewards/margins": 6.59375,
"rewards/rejected": -6.03125,
"step": 265
},
{
"epoch": 0.3263803680981595,
"grad_norm": 38.91032929227862,
"learning_rate": 1.8008264462809917e-06,
"logits/chosen": -0.03369140625,
"logits/rejected": -0.1787109375,
"logps/chosen": -328.0,
"logps/rejected": -316.0,
"loss": 0.537,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.54296875,
"rewards/margins": 5.03125,
"rewards/rejected": -5.5625,
"step": 266
},
{
"epoch": 0.3276073619631902,
"grad_norm": 37.161118868538544,
"learning_rate": 1.8e-06,
"logits/chosen": -0.04736328125,
"logits/rejected": -0.265625,
"logps/chosen": -406.0,
"logps/rejected": -318.0,
"loss": 0.408,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 1.109375,
"rewards/margins": 6.3125,
"rewards/rejected": -5.21875,
"step": 267
},
{
"epoch": 0.32883435582822085,
"grad_norm": 32.186263942809234,
"learning_rate": 1.7991735537190083e-06,
"logits/chosen": -0.216796875,
"logits/rejected": -0.326171875,
"logps/chosen": -390.0,
"logps/rejected": -336.0,
"loss": 0.2732,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.97265625,
"rewards/margins": 6.8125,
"rewards/rejected": -5.84375,
"step": 268
},
{
"epoch": 0.3300613496932515,
"grad_norm": 37.074021485498456,
"learning_rate": 1.7983471074380165e-06,
"logits/chosen": -0.08447265625,
"logits/rejected": -0.392578125,
"logps/chosen": -408.0,
"logps/rejected": -314.0,
"loss": 0.2972,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.125,
"rewards/margins": 6.6875,
"rewards/rejected": -5.5625,
"step": 269
},
{
"epoch": 0.3312883435582822,
"grad_norm": 35.52997559394852,
"learning_rate": 1.7975206611570247e-06,
"logits/chosen": -0.043701171875,
"logits/rejected": -0.1591796875,
"logps/chosen": -334.0,
"logps/rejected": -304.0,
"loss": 0.5512,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 0.341796875,
"rewards/margins": 5.15625,
"rewards/rejected": -4.8125,
"step": 270
},
{
"epoch": 0.3325153374233129,
"grad_norm": 26.18507952887063,
"learning_rate": 1.7966942148760329e-06,
"logits/chosen": -0.08740234375,
"logits/rejected": -0.2001953125,
"logps/chosen": -388.0,
"logps/rejected": -338.0,
"loss": 0.3691,
"rewards/accuracies": 0.890625,
"rewards/chosen": 1.5546875,
"rewards/margins": 6.96875,
"rewards/rejected": -5.40625,
"step": 271
},
{
"epoch": 0.3337423312883436,
"grad_norm": 30.65997550912457,
"learning_rate": 1.7958677685950413e-06,
"logits/chosen": 0.0308837890625,
"logits/rejected": -0.1259765625,
"logps/chosen": -368.0,
"logps/rejected": -318.0,
"loss": 0.2986,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 0.302734375,
"rewards/margins": 6.65625,
"rewards/rejected": -6.375,
"step": 272
},
{
"epoch": 0.33496932515337424,
"grad_norm": 36.582111868528614,
"learning_rate": 1.7950413223140495e-06,
"logits/chosen": 0.1240234375,
"logits/rejected": 0.05126953125,
"logps/chosen": -344.0,
"logps/rejected": -316.0,
"loss": 0.5599,
"rewards/accuracies": 0.7890625,
"rewards/chosen": 0.07177734375,
"rewards/margins": 5.75,
"rewards/rejected": -5.6875,
"step": 273
},
{
"epoch": 0.3361963190184049,
"grad_norm": 33.279143248477546,
"learning_rate": 1.7942148760330579e-06,
"logits/chosen": 0.0888671875,
"logits/rejected": -0.055419921875,
"logps/chosen": -412.0,
"logps/rejected": -350.0,
"loss": 0.4479,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.58984375,
"rewards/margins": 6.46875,
"rewards/rejected": -5.875,
"step": 274
},
{
"epoch": 0.3374233128834356,
"grad_norm": 32.24834004521387,
"learning_rate": 1.793388429752066e-06,
"logits/chosen": 0.0167236328125,
"logits/rejected": -0.06689453125,
"logps/chosen": -330.0,
"logps/rejected": -328.0,
"loss": 0.4847,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08984375,
"rewards/margins": 5.90625,
"rewards/rejected": -5.8125,
"step": 275
},
{
"epoch": 0.33865030674846625,
"grad_norm": 27.386781158674737,
"learning_rate": 1.7925619834710742e-06,
"logits/chosen": 0.10009765625,
"logits/rejected": -0.119140625,
"logps/chosen": -394.0,
"logps/rejected": -336.0,
"loss": 0.3805,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.2275390625,
"rewards/margins": 6.375,
"rewards/rejected": -6.59375,
"step": 276
},
{
"epoch": 0.3398773006134969,
"grad_norm": 28.87751276737049,
"learning_rate": 1.7917355371900826e-06,
"logits/chosen": -0.1201171875,
"logits/rejected": -0.3046875,
"logps/chosen": -420.0,
"logps/rejected": -348.0,
"loss": 0.2843,
"rewards/accuracies": 0.8671875,
"rewards/chosen": 0.70703125,
"rewards/margins": 7.40625,
"rewards/rejected": -6.6875,
"step": 277
},
{
"epoch": 0.3411042944785276,
"grad_norm": 33.8069348498851,
"learning_rate": 1.7909090909090908e-06,
"logits/chosen": 0.01556396484375,
"logits/rejected": -0.028076171875,
"logps/chosen": -394.0,
"logps/rejected": -368.0,
"loss": 0.3724,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.1943359375,
"rewards/margins": 6.625,
"rewards/rejected": -6.8125,
"step": 278
},
{
"epoch": 0.3423312883435583,
"grad_norm": 23.691833106444715,
"learning_rate": 1.790082644628099e-06,
"logits/chosen": -0.06689453125,
"logits/rejected": -0.251953125,
"logps/chosen": -400.0,
"logps/rejected": -336.0,
"loss": 0.2062,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -0.2373046875,
"rewards/margins": 7.59375,
"rewards/rejected": -7.8125,
"step": 279
},
{
"epoch": 0.34355828220858897,
"grad_norm": 32.92127336551771,
"learning_rate": 1.7892561983471072e-06,
"logits/chosen": -0.054931640625,
"logits/rejected": -0.1904296875,
"logps/chosen": -418.0,
"logps/rejected": -384.0,
"loss": 0.4097,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.2099609375,
"rewards/margins": 7.1875,
"rewards/rejected": -7.375,
"step": 280
},
{
"epoch": 0.34478527607361964,
"grad_norm": 31.92199907548239,
"learning_rate": 1.7884297520661156e-06,
"logits/chosen": 0.04931640625,
"logits/rejected": -0.1435546875,
"logps/chosen": -398.0,
"logps/rejected": -348.0,
"loss": 0.4396,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.93359375,
"rewards/margins": 5.875,
"rewards/rejected": -6.8125,
"step": 281
},
{
"epoch": 0.3460122699386503,
"grad_norm": 26.710409053663327,
"learning_rate": 1.7876033057851238e-06,
"logits/chosen": -0.1533203125,
"logits/rejected": -0.28515625,
"logps/chosen": -358.0,
"logps/rejected": -342.0,
"loss": 0.262,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.37890625,
"rewards/margins": 7.5,
"rewards/rejected": -7.90625,
"step": 282
},
{
"epoch": 0.347239263803681,
"grad_norm": 31.34681509597123,
"learning_rate": 1.7867768595041322e-06,
"logits/chosen": -0.1708984375,
"logits/rejected": -0.25390625,
"logps/chosen": -370.0,
"logps/rejected": -316.0,
"loss": 0.3721,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.9453125,
"rewards/margins": 6.40625,
"rewards/rejected": -7.375,
"step": 283
},
{
"epoch": 0.34846625766871164,
"grad_norm": 29.846783324542276,
"learning_rate": 1.7859504132231404e-06,
"logits/chosen": 0.0216064453125,
"logits/rejected": -0.111328125,
"logps/chosen": -386.0,
"logps/rejected": -342.0,
"loss": 0.3148,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.8515625,
"rewards/margins": 7.1875,
"rewards/rejected": -8.0625,
"step": 284
},
{
"epoch": 0.3496932515337423,
"grad_norm": 29.07841735224466,
"learning_rate": 1.7851239669421488e-06,
"logits/chosen": -0.08056640625,
"logits/rejected": -0.271484375,
"logps/chosen": -378.0,
"logps/rejected": -350.0,
"loss": 0.325,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.87109375,
"rewards/margins": 7.15625,
"rewards/rejected": -8.0625,
"step": 285
},
{
"epoch": 0.350920245398773,
"grad_norm": 31.101201313842562,
"learning_rate": 1.784297520661157e-06,
"logits/chosen": 0.007110595703125,
"logits/rejected": -0.18359375,
"logps/chosen": -440.0,
"logps/rejected": -380.0,
"loss": 0.4065,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.95703125,
"rewards/margins": 7.5,
"rewards/rejected": -8.5,
"step": 286
},
{
"epoch": 0.3521472392638037,
"grad_norm": 32.42950485642569,
"learning_rate": 1.7834710743801654e-06,
"logits/chosen": -0.0986328125,
"logits/rejected": -0.2294921875,
"logps/chosen": -400.0,
"logps/rejected": -354.0,
"loss": 0.3281,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.375,
"rewards/margins": 6.90625,
"rewards/rejected": -8.3125,
"step": 287
},
{
"epoch": 0.35337423312883437,
"grad_norm": 29.079563891537067,
"learning_rate": 1.7826446280991734e-06,
"logits/chosen": 0.12255859375,
"logits/rejected": -0.0252685546875,
"logps/chosen": -408.0,
"logps/rejected": -362.0,
"loss": 0.4199,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.8359375,
"rewards/margins": 6.4375,
"rewards/rejected": -8.25,
"step": 288
},
{
"epoch": 0.35460122699386504,
"grad_norm": 24.362186652478755,
"learning_rate": 1.7818181818181818e-06,
"logits/chosen": -0.06640625,
"logits/rejected": -0.208984375,
"logps/chosen": -424.0,
"logps/rejected": -356.0,
"loss": 0.2252,
"rewards/accuracies": 0.90625,
"rewards/chosen": -1.03125,
"rewards/margins": 8.25,
"rewards/rejected": -9.25,
"step": 289
},
{
"epoch": 0.3558282208588957,
"grad_norm": 24.833763702732224,
"learning_rate": 1.78099173553719e-06,
"logits/chosen": -0.2421875,
"logits/rejected": -0.376953125,
"logps/chosen": -396.0,
"logps/rejected": -372.0,
"loss": 0.2186,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -1.03125,
"rewards/margins": 8.1875,
"rewards/rejected": -9.1875,
"step": 290
},
{
"epoch": 0.3570552147239264,
"grad_norm": 32.36383730629053,
"learning_rate": 1.7801652892561983e-06,
"logits/chosen": -0.1884765625,
"logits/rejected": -0.29296875,
"logps/chosen": -414.0,
"logps/rejected": -364.0,
"loss": 0.4522,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.3671875,
"rewards/margins": 7.625,
"rewards/rejected": -7.96875,
"step": 291
},
{
"epoch": 0.35828220858895704,
"grad_norm": 29.731019014801593,
"learning_rate": 1.7793388429752065e-06,
"logits/chosen": -0.12890625,
"logits/rejected": -0.35546875,
"logps/chosen": -426.0,
"logps/rejected": -376.0,
"loss": 0.2581,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.21875,
"rewards/margins": 7.9375,
"rewards/rejected": -9.125,
"step": 292
},
{
"epoch": 0.3595092024539877,
"grad_norm": 24.960712282687606,
"learning_rate": 1.7785123966942147e-06,
"logits/chosen": -0.0213623046875,
"logits/rejected": -0.2275390625,
"logps/chosen": -402.0,
"logps/rejected": -358.0,
"loss": 0.2337,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -1.953125,
"rewards/margins": 7.46875,
"rewards/rejected": -9.375,
"step": 293
},
{
"epoch": 0.36073619631901843,
"grad_norm": 26.249698002048582,
"learning_rate": 1.7776859504132231e-06,
"logits/chosen": -0.322265625,
"logits/rejected": -0.455078125,
"logps/chosen": -488.0,
"logps/rejected": -392.0,
"loss": 0.3401,
"rewards/accuracies": 0.890625,
"rewards/chosen": -1.0390625,
"rewards/margins": 8.375,
"rewards/rejected": -9.4375,
"step": 294
},
{
"epoch": 0.3619631901840491,
"grad_norm": 27.064994791758675,
"learning_rate": 1.7768595041322313e-06,
"logits/chosen": 0.00921630859375,
"logits/rejected": -0.1376953125,
"logps/chosen": -374.0,
"logps/rejected": -354.0,
"loss": 0.2706,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -1.4609375,
"rewards/margins": 7.3125,
"rewards/rejected": -8.75,
"step": 295
},
{
"epoch": 0.36319018404907977,
"grad_norm": 35.43162888450131,
"learning_rate": 1.7760330578512397e-06,
"logits/chosen": 0.0537109375,
"logits/rejected": -0.08984375,
"logps/chosen": -440.0,
"logps/rejected": -364.0,
"loss": 0.4592,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.83984375,
"rewards/margins": 7.1875,
"rewards/rejected": -8.0,
"step": 296
},
{
"epoch": 0.36441717791411044,
"grad_norm": 26.093937890387547,
"learning_rate": 1.7752066115702477e-06,
"logits/chosen": -0.099609375,
"logits/rejected": -0.25390625,
"logps/chosen": -378.0,
"logps/rejected": -348.0,
"loss": 0.275,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.046875,
"rewards/margins": 7.71875,
"rewards/rejected": -8.75,
"step": 297
},
{
"epoch": 0.3656441717791411,
"grad_norm": 34.67507683293938,
"learning_rate": 1.774380165289256e-06,
"logits/chosen": 0.060302734375,
"logits/rejected": -0.0279541015625,
"logps/chosen": -404.0,
"logps/rejected": -360.0,
"loss": 0.3801,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.515625,
"rewards/margins": 6.5625,
"rewards/rejected": -8.0625,
"step": 298
},
{
"epoch": 0.36687116564417177,
"grad_norm": 36.26270235220453,
"learning_rate": 1.7735537190082643e-06,
"logits/chosen": 0.0030517578125,
"logits/rejected": -0.173828125,
"logps/chosen": -420.0,
"logps/rejected": -358.0,
"loss": 0.4301,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -2.140625,
"rewards/margins": 6.21875,
"rewards/rejected": -8.3125,
"step": 299
},
{
"epoch": 0.36809815950920244,
"grad_norm": 35.40586729670696,
"learning_rate": 1.7727272727272727e-06,
"logits/chosen": -0.1220703125,
"logits/rejected": -0.2734375,
"logps/chosen": -392.0,
"logps/rejected": -352.0,
"loss": 0.5165,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.546875,
"rewards/margins": 7.0625,
"rewards/rejected": -8.625,
"step": 300
},
{
"epoch": 0.3693251533742331,
"grad_norm": 34.10518739995848,
"learning_rate": 1.7719008264462809e-06,
"logits/chosen": -0.0712890625,
"logits/rejected": -0.25,
"logps/chosen": -484.0,
"logps/rejected": -412.0,
"loss": 0.4117,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.4609375,
"rewards/margins": 7.53125,
"rewards/rejected": -9.0,
"step": 301
},
{
"epoch": 0.37055214723926383,
"grad_norm": 28.682377601987284,
"learning_rate": 1.7710743801652893e-06,
"logits/chosen": -0.09228515625,
"logits/rejected": -0.298828125,
"logps/chosen": -404.0,
"logps/rejected": -340.0,
"loss": 0.2799,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.8828125,
"rewards/margins": 6.90625,
"rewards/rejected": -8.8125,
"step": 302
},
{
"epoch": 0.3717791411042945,
"grad_norm": 40.69913245313932,
"learning_rate": 1.7702479338842975e-06,
"logits/chosen": -0.0966796875,
"logits/rejected": -0.2021484375,
"logps/chosen": -410.0,
"logps/rejected": -398.0,
"loss": 0.5452,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -2.625,
"rewards/margins": 6.34375,
"rewards/rejected": -9.0,
"step": 303
},
{
"epoch": 0.37300613496932516,
"grad_norm": 30.045946343013274,
"learning_rate": 1.7694214876033059e-06,
"logits/chosen": 0.033447265625,
"logits/rejected": -0.2412109375,
"logps/chosen": -420.0,
"logps/rejected": -360.0,
"loss": 0.3544,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -2.390625,
"rewards/margins": 7.09375,
"rewards/rejected": -9.5,
"step": 304
},
{
"epoch": 0.37423312883435583,
"grad_norm": 26.000139518526083,
"learning_rate": 1.768595041322314e-06,
"logits/chosen": -0.05029296875,
"logits/rejected": -0.1875,
"logps/chosen": -434.0,
"logps/rejected": -366.0,
"loss": 0.2725,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -1.546875,
"rewards/margins": 8.0,
"rewards/rejected": -9.5625,
"step": 305
},
{
"epoch": 0.3754601226993865,
"grad_norm": 28.483050353321193,
"learning_rate": 1.7677685950413222e-06,
"logits/chosen": -0.1669921875,
"logits/rejected": -0.333984375,
"logps/chosen": -446.0,
"logps/rejected": -386.0,
"loss": 0.2525,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -2.0625,
"rewards/margins": 7.1875,
"rewards/rejected": -9.25,
"step": 306
},
{
"epoch": 0.37668711656441717,
"grad_norm": 33.659968783805994,
"learning_rate": 1.7669421487603304e-06,
"logits/chosen": -0.01007080078125,
"logits/rejected": -0.1357421875,
"logps/chosen": -400.0,
"logps/rejected": -366.0,
"loss": 0.5429,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.8828125,
"rewards/margins": 7.3125,
"rewards/rejected": -9.1875,
"step": 307
},
{
"epoch": 0.37791411042944784,
"grad_norm": 33.27798405952561,
"learning_rate": 1.7661157024793388e-06,
"logits/chosen": 0.059814453125,
"logits/rejected": -0.1025390625,
"logps/chosen": -414.0,
"logps/rejected": -378.0,
"loss": 0.474,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -2.125,
"rewards/margins": 6.21875,
"rewards/rejected": -8.3125,
"step": 308
},
{
"epoch": 0.3791411042944785,
"grad_norm": 35.55367970177758,
"learning_rate": 1.765289256198347e-06,
"logits/chosen": -0.171875,
"logits/rejected": -0.27734375,
"logps/chosen": -400.0,
"logps/rejected": -370.0,
"loss": 0.3057,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.5234375,
"rewards/margins": 7.875,
"rewards/rejected": -8.375,
"step": 309
},
{
"epoch": 0.3803680981595092,
"grad_norm": 28.89582404017667,
"learning_rate": 1.7644628099173552e-06,
"logits/chosen": 0.10986328125,
"logits/rejected": 0.02490234375,
"logps/chosen": -332.0,
"logps/rejected": -324.0,
"loss": 0.3957,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.8203125,
"rewards/margins": 5.8125,
"rewards/rejected": -7.625,
"step": 310
},
{
"epoch": 0.3815950920245399,
"grad_norm": 28.96615638829631,
"learning_rate": 1.7636363636363636e-06,
"logits/chosen": -0.11767578125,
"logits/rejected": -0.296875,
"logps/chosen": -400.0,
"logps/rejected": -360.0,
"loss": 0.3969,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.376953125,
"rewards/margins": 8.0625,
"rewards/rejected": -8.4375,
"step": 311
},
{
"epoch": 0.38282208588957056,
"grad_norm": 37.63927932099697,
"learning_rate": 1.7628099173553718e-06,
"logits/chosen": 0.07568359375,
"logits/rejected": -0.05810546875,
"logps/chosen": -402.0,
"logps/rejected": -390.0,
"loss": 0.6106,
"rewards/accuracies": 0.7578125,
"rewards/chosen": -0.84765625,
"rewards/margins": 6.46875,
"rewards/rejected": -7.3125,
"step": 312
},
{
"epoch": 0.38404907975460123,
"grad_norm": 29.537362160889604,
"learning_rate": 1.7619834710743802e-06,
"logits/chosen": 0.0162353515625,
"logits/rejected": -0.259765625,
"logps/chosen": -416.0,
"logps/rejected": -382.0,
"loss": 0.3486,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.486328125,
"rewards/margins": 8.375,
"rewards/rejected": -7.875,
"step": 313
},
{
"epoch": 0.3852760736196319,
"grad_norm": 26.210720376336045,
"learning_rate": 1.7611570247933884e-06,
"logits/chosen": -0.0107421875,
"logits/rejected": -0.1953125,
"logps/chosen": -466.0,
"logps/rejected": -368.0,
"loss": 0.2853,
"rewards/accuracies": 0.8984375,
"rewards/chosen": 1.328125,
"rewards/margins": 9.3125,
"rewards/rejected": -8.0,
"step": 314
},
{
"epoch": 0.38650306748466257,
"grad_norm": 31.1253075063973,
"learning_rate": 1.7603305785123966e-06,
"logits/chosen": 0.1328125,
"logits/rejected": -0.068359375,
"logps/chosen": -358.0,
"logps/rejected": -308.0,
"loss": 0.387,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.52734375,
"rewards/margins": 6.75,
"rewards/rejected": -7.28125,
"step": 315
},
{
"epoch": 0.38773006134969323,
"grad_norm": 27.073834425971683,
"learning_rate": 1.7595041322314047e-06,
"logits/chosen": 0.10302734375,
"logits/rejected": -0.03515625,
"logps/chosen": -368.0,
"logps/rejected": -314.0,
"loss": 0.3848,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.01165771484375,
"rewards/margins": 7.4375,
"rewards/rejected": -7.4375,
"step": 316
},
{
"epoch": 0.3889570552147239,
"grad_norm": 28.98605055057774,
"learning_rate": 1.7586776859504131e-06,
"logits/chosen": -0.0537109375,
"logits/rejected": -0.263671875,
"logps/chosen": -406.0,
"logps/rejected": -372.0,
"loss": 0.3474,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.263671875,
"rewards/margins": 7.84375,
"rewards/rejected": -7.5625,
"step": 317
},
{
"epoch": 0.3901840490797546,
"grad_norm": 39.2536826011772,
"learning_rate": 1.7578512396694213e-06,
"logits/chosen": -0.1025390625,
"logits/rejected": -0.25390625,
"logps/chosen": -412.0,
"logps/rejected": -374.0,
"loss": 0.4691,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.039794921875,
"rewards/margins": 6.875,
"rewards/rejected": -6.84375,
"step": 318
},
{
"epoch": 0.3914110429447853,
"grad_norm": 21.757881067498776,
"learning_rate": 1.7570247933884297e-06,
"logits/chosen": -0.03173828125,
"logits/rejected": -0.2177734375,
"logps/chosen": -422.0,
"logps/rejected": -326.0,
"loss": 0.1796,
"rewards/accuracies": 0.9140625,
"rewards/chosen": 0.416015625,
"rewards/margins": 8.5625,
"rewards/rejected": -8.1875,
"step": 319
},
{
"epoch": 0.39263803680981596,
"grad_norm": 31.845194282419403,
"learning_rate": 1.756198347107438e-06,
"logits/chosen": -0.0022125244140625,
"logits/rejected": -0.1123046875,
"logps/chosen": -332.0,
"logps/rejected": -296.0,
"loss": 0.3812,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.84765625,
"rewards/margins": 6.78125,
"rewards/rejected": -7.625,
"step": 320
},
{
"epoch": 0.39386503067484663,
"grad_norm": 37.332413007576875,
"learning_rate": 1.7553719008264463e-06,
"logits/chosen": -0.162109375,
"logits/rejected": -0.30859375,
"logps/chosen": -420.0,
"logps/rejected": -408.0,
"loss": 0.4505,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.56640625,
"rewards/margins": 7.6875,
"rewards/rejected": -8.25,
"step": 321
},
{
"epoch": 0.3950920245398773,
"grad_norm": 26.763545530847892,
"learning_rate": 1.7545454545454545e-06,
"logits/chosen": -0.0654296875,
"logits/rejected": -0.2138671875,
"logps/chosen": -406.0,
"logps/rejected": -342.0,
"loss": 0.3361,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 0.05810546875,
"rewards/margins": 7.875,
"rewards/rejected": -7.8125,
"step": 322
},
{
"epoch": 0.39631901840490796,
"grad_norm": 36.23320501006155,
"learning_rate": 1.753719008264463e-06,
"logits/chosen": -0.0888671875,
"logits/rejected": -0.22265625,
"logps/chosen": -368.0,
"logps/rejected": -350.0,
"loss": 0.4543,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.70703125,
"rewards/margins": 6.28125,
"rewards/rejected": -6.96875,
"step": 323
},
{
"epoch": 0.39754601226993863,
"grad_norm": 25.797612826053182,
"learning_rate": 1.7528925619834709e-06,
"logits/chosen": -0.158203125,
"logits/rejected": -0.328125,
"logps/chosen": -366.0,
"logps/rejected": -340.0,
"loss": 0.3194,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.40625,
"rewards/margins": 7.59375,
"rewards/rejected": -8.0,
"step": 324
},
{
"epoch": 0.3987730061349693,
"grad_norm": 35.32099995396031,
"learning_rate": 1.7520661157024793e-06,
"logits/chosen": 0.024658203125,
"logits/rejected": -0.03466796875,
"logps/chosen": -344.0,
"logps/rejected": -318.0,
"loss": 0.6162,
"rewards/accuracies": 0.796875,
"rewards/chosen": -1.0625,
"rewards/margins": 6.1875,
"rewards/rejected": -7.25,
"step": 325
},
{
"epoch": 0.4,
"grad_norm": 26.28245320040819,
"learning_rate": 1.7512396694214875e-06,
"logits/chosen": -0.1953125,
"logits/rejected": -0.326171875,
"logps/chosen": -410.0,
"logps/rejected": -386.0,
"loss": 0.2342,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.45703125,
"rewards/margins": 8.5625,
"rewards/rejected": -8.0625,
"step": 326
},
{
"epoch": 0.4012269938650307,
"grad_norm": 38.737200091377495,
"learning_rate": 1.7504132231404959e-06,
"logits/chosen": -0.048828125,
"logits/rejected": -0.216796875,
"logps/chosen": -448.0,
"logps/rejected": -368.0,
"loss": 0.507,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.70703125,
"rewards/margins": 5.9375,
"rewards/rejected": -6.65625,
"step": 327
},
{
"epoch": 0.40245398773006136,
"grad_norm": 29.75047013457242,
"learning_rate": 1.749586776859504e-06,
"logits/chosen": -0.08154296875,
"logits/rejected": -0.2099609375,
"logps/chosen": -378.0,
"logps/rejected": -304.0,
"loss": 0.344,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.28125,
"rewards/margins": 6.3125,
"rewards/rejected": -7.59375,
"step": 328
},
{
"epoch": 0.403680981595092,
"grad_norm": 29.83011076964678,
"learning_rate": 1.7487603305785123e-06,
"logits/chosen": -0.040771484375,
"logits/rejected": -0.240234375,
"logps/chosen": -482.0,
"logps/rejected": -404.0,
"loss": 0.3719,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.5546875,
"rewards/margins": 8.4375,
"rewards/rejected": -9.0,
"step": 329
},
{
"epoch": 0.4049079754601227,
"grad_norm": 23.40191432839614,
"learning_rate": 1.7479338842975207e-06,
"logits/chosen": -0.1826171875,
"logits/rejected": -0.3828125,
"logps/chosen": -432.0,
"logps/rejected": -368.0,
"loss": 0.2362,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.416015625,
"rewards/margins": 8.4375,
"rewards/rejected": -8.8125,
"step": 330
},
{
"epoch": 0.40613496932515336,
"grad_norm": 26.098835314213307,
"learning_rate": 1.7471074380165288e-06,
"logits/chosen": -0.1318359375,
"logits/rejected": -0.2392578125,
"logps/chosen": -424.0,
"logps/rejected": -374.0,
"loss": 0.3222,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.49609375,
"rewards/margins": 7.84375,
"rewards/rejected": -8.3125,
"step": 331
},
{
"epoch": 0.40736196319018403,
"grad_norm": 22.96275837318382,
"learning_rate": 1.746280991735537e-06,
"logits/chosen": -0.1337890625,
"logits/rejected": -0.330078125,
"logps/chosen": -448.0,
"logps/rejected": -354.0,
"loss": 0.222,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -0.70703125,
"rewards/margins": 8.25,
"rewards/rejected": -8.9375,
"step": 332
},
{
"epoch": 0.4085889570552147,
"grad_norm": 31.858485693574398,
"learning_rate": 1.7454545454545452e-06,
"logits/chosen": 0.0712890625,
"logits/rejected": -0.051513671875,
"logps/chosen": -392.0,
"logps/rejected": -364.0,
"loss": 0.423,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.40625,
"rewards/margins": 6.46875,
"rewards/rejected": -7.875,
"step": 333
},
{
"epoch": 0.4098159509202454,
"grad_norm": 27.957364910858917,
"learning_rate": 1.7446280991735536e-06,
"logits/chosen": -0.080078125,
"logits/rejected": -0.30859375,
"logps/chosen": -400.0,
"logps/rejected": -382.0,
"loss": 0.3448,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.2890625,
"rewards/margins": 7.65625,
"rewards/rejected": -8.9375,
"step": 334
},
{
"epoch": 0.4110429447852761,
"grad_norm": 26.96892215593624,
"learning_rate": 1.7438016528925618e-06,
"logits/chosen": 0.037353515625,
"logits/rejected": -0.236328125,
"logps/chosen": -452.0,
"logps/rejected": -354.0,
"loss": 0.2357,
"rewards/accuracies": 0.90625,
"rewards/chosen": -1.6640625,
"rewards/margins": 7.25,
"rewards/rejected": -8.9375,
"step": 335
},
{
"epoch": 0.41226993865030676,
"grad_norm": 31.129366723267793,
"learning_rate": 1.7429752066115702e-06,
"logits/chosen": -0.12890625,
"logits/rejected": -0.275390625,
"logps/chosen": -422.0,
"logps/rejected": -374.0,
"loss": 0.3437,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.671875,
"rewards/margins": 7.34375,
"rewards/rejected": -9.0,
"step": 336
},
{
"epoch": 0.4134969325153374,
"grad_norm": 33.0574105356729,
"learning_rate": 1.7421487603305784e-06,
"logits/chosen": 0.072265625,
"logits/rejected": -0.080078125,
"logps/chosen": -378.0,
"logps/rejected": -372.0,
"loss": 0.448,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.75,
"rewards/margins": 7.0,
"rewards/rejected": -8.75,
"step": 337
},
{
"epoch": 0.4147239263803681,
"grad_norm": 33.43282145955899,
"learning_rate": 1.7413223140495868e-06,
"logits/chosen": 0.05078125,
"logits/rejected": -0.08349609375,
"logps/chosen": -410.0,
"logps/rejected": -374.0,
"loss": 0.3974,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.703125,
"rewards/margins": 7.0625,
"rewards/rejected": -8.75,
"step": 338
},
{
"epoch": 0.41595092024539876,
"grad_norm": 37.78258657108814,
"learning_rate": 1.740495867768595e-06,
"logits/chosen": 0.126953125,
"logits/rejected": -0.00148773193359375,
"logps/chosen": -400.0,
"logps/rejected": -368.0,
"loss": 0.4457,
"rewards/accuracies": 0.7421875,
"rewards/chosen": -2.328125,
"rewards/margins": 6.53125,
"rewards/rejected": -8.8125,
"step": 339
},
{
"epoch": 0.4171779141104294,
"grad_norm": 38.091264811731946,
"learning_rate": 1.7396694214876034e-06,
"logits/chosen": 0.01190185546875,
"logits/rejected": -0.21875,
"logps/chosen": -386.0,
"logps/rejected": -368.0,
"loss": 0.4535,
"rewards/accuracies": 0.8125,
"rewards/chosen": -2.109375,
"rewards/margins": 6.0,
"rewards/rejected": -8.125,
"step": 340
},
{
"epoch": 0.41840490797546015,
"grad_norm": 28.56735350898946,
"learning_rate": 1.7388429752066114e-06,
"logits/chosen": -0.051513671875,
"logits/rejected": -0.265625,
"logps/chosen": -414.0,
"logps/rejected": -348.0,
"loss": 0.4213,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.0234375,
"rewards/margins": 7.125,
"rewards/rejected": -8.125,
"step": 341
},
{
"epoch": 0.4196319018404908,
"grad_norm": 35.90928541046158,
"learning_rate": 1.7380165289256198e-06,
"logits/chosen": 0.0400390625,
"logits/rejected": -0.058837890625,
"logps/chosen": -356.0,
"logps/rejected": -336.0,
"loss": 0.4382,
"rewards/accuracies": 0.796875,
"rewards/chosen": -1.671875,
"rewards/margins": 6.09375,
"rewards/rejected": -7.75,
"step": 342
},
{
"epoch": 0.4208588957055215,
"grad_norm": 32.798361112567775,
"learning_rate": 1.737190082644628e-06,
"logits/chosen": -0.01092529296875,
"logits/rejected": -0.09375,
"logps/chosen": -406.0,
"logps/rejected": -374.0,
"loss": 0.4573,
"rewards/accuracies": 0.78125,
"rewards/chosen": -2.109375,
"rewards/margins": 5.5,
"rewards/rejected": -7.59375,
"step": 343
},
{
"epoch": 0.42208588957055215,
"grad_norm": 33.41501439475392,
"learning_rate": 1.7363636363636364e-06,
"logits/chosen": -0.003692626953125,
"logits/rejected": -0.1455078125,
"logps/chosen": -422.0,
"logps/rejected": -354.0,
"loss": 0.4771,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.3203125,
"rewards/margins": 5.90625,
"rewards/rejected": -7.21875,
"step": 344
},
{
"epoch": 0.4233128834355828,
"grad_norm": 29.62905133697734,
"learning_rate": 1.7355371900826445e-06,
"logits/chosen": 0.0031280517578125,
"logits/rejected": -0.1728515625,
"logps/chosen": -428.0,
"logps/rejected": -354.0,
"loss": 0.3645,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.2109375,
"rewards/margins": 6.5,
"rewards/rejected": -7.71875,
"step": 345
},
{
"epoch": 0.4245398773006135,
"grad_norm": 33.83312728123592,
"learning_rate": 1.7347107438016527e-06,
"logits/chosen": 0.024658203125,
"logits/rejected": -0.1728515625,
"logps/chosen": -358.0,
"logps/rejected": -318.0,
"loss": 0.4849,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.5390625,
"rewards/margins": 5.78125,
"rewards/rejected": -7.3125,
"step": 346
},
{
"epoch": 0.42576687116564416,
"grad_norm": 26.732035700407028,
"learning_rate": 1.7338842975206611e-06,
"logits/chosen": -0.0096435546875,
"logits/rejected": -0.125,
"logps/chosen": -382.0,
"logps/rejected": -370.0,
"loss": 0.3745,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.0859375,
"rewards/margins": 6.15625,
"rewards/rejected": -7.25,
"step": 347
},
{
"epoch": 0.4269938650306748,
"grad_norm": 24.034744290597516,
"learning_rate": 1.7330578512396693e-06,
"logits/chosen": -0.08056640625,
"logits/rejected": -0.2734375,
"logps/chosen": -428.0,
"logps/rejected": -336.0,
"loss": 0.3082,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.73046875,
"rewards/margins": 7.40625,
"rewards/rejected": -8.125,
"step": 348
},
{
"epoch": 0.42822085889570555,
"grad_norm": 33.16648036520517,
"learning_rate": 1.7322314049586777e-06,
"logits/chosen": -0.050537109375,
"logits/rejected": -0.1943359375,
"logps/chosen": -414.0,
"logps/rejected": -334.0,
"loss": 0.3973,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.8046875,
"rewards/margins": 7.21875,
"rewards/rejected": -8.0625,
"step": 349
},
{
"epoch": 0.4294478527607362,
"grad_norm": 32.075615627406215,
"learning_rate": 1.7314049586776857e-06,
"logits/chosen": 0.12060546875,
"logits/rejected": -0.07568359375,
"logps/chosen": -424.0,
"logps/rejected": -332.0,
"loss": 0.3882,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.09375,
"rewards/margins": 6.34375,
"rewards/rejected": -7.4375,
"step": 350
},
{
"epoch": 0.4306748466257669,
"grad_norm": 31.727375282436817,
"learning_rate": 1.730578512396694e-06,
"logits/chosen": -0.06982421875,
"logits/rejected": -0.2001953125,
"logps/chosen": -350.0,
"logps/rejected": -334.0,
"loss": 0.4572,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.8359375,
"rewards/margins": 6.21875,
"rewards/rejected": -7.0625,
"step": 351
},
{
"epoch": 0.43190184049079755,
"grad_norm": 30.509189174847993,
"learning_rate": 1.7297520661157023e-06,
"logits/chosen": 0.022216796875,
"logits/rejected": -0.1728515625,
"logps/chosen": -394.0,
"logps/rejected": -348.0,
"loss": 0.5106,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.1044921875,
"rewards/margins": 6.65625,
"rewards/rejected": -6.5625,
"step": 352
},
{
"epoch": 0.4331288343558282,
"grad_norm": 24.069694219856217,
"learning_rate": 1.7289256198347107e-06,
"logits/chosen": -0.03271484375,
"logits/rejected": -0.2041015625,
"logps/chosen": -368.0,
"logps/rejected": -340.0,
"loss": 0.2823,
"rewards/accuracies": 0.8671875,
"rewards/chosen": 0.2060546875,
"rewards/margins": 7.84375,
"rewards/rejected": -7.65625,
"step": 353
},
{
"epoch": 0.4343558282208589,
"grad_norm": 30.55186134035927,
"learning_rate": 1.7280991735537189e-06,
"logits/chosen": 0.051513671875,
"logits/rejected": -0.11669921875,
"logps/chosen": -452.0,
"logps/rejected": -388.0,
"loss": 0.3823,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.2216796875,
"rewards/margins": 6.78125,
"rewards/rejected": -6.5625,
"step": 354
},
{
"epoch": 0.43558282208588955,
"grad_norm": 29.806161868685802,
"learning_rate": 1.7272727272727273e-06,
"logits/chosen": -0.11962890625,
"logits/rejected": -0.2060546875,
"logps/chosen": -352.0,
"logps/rejected": -364.0,
"loss": 0.4971,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.2099609375,
"rewards/margins": 6.59375,
"rewards/rejected": -6.8125,
"step": 355
},
{
"epoch": 0.4368098159509202,
"grad_norm": 28.997448738112062,
"learning_rate": 1.7264462809917355e-06,
"logits/chosen": 0.10400390625,
"logits/rejected": -0.050048828125,
"logps/chosen": -406.0,
"logps/rejected": -346.0,
"loss": 0.4177,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.44921875,
"rewards/margins": 6.59375,
"rewards/rejected": -7.03125,
"step": 356
},
{
"epoch": 0.43803680981595094,
"grad_norm": 25.796166704510906,
"learning_rate": 1.7256198347107439e-06,
"logits/chosen": -0.1953125,
"logits/rejected": -0.34375,
"logps/chosen": -406.0,
"logps/rejected": -348.0,
"loss": 0.386,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.267578125,
"rewards/margins": 7.78125,
"rewards/rejected": -7.53125,
"step": 357
},
{
"epoch": 0.4392638036809816,
"grad_norm": 29.76888453399602,
"learning_rate": 1.724793388429752e-06,
"logits/chosen": -0.1328125,
"logits/rejected": -0.291015625,
"logps/chosen": -452.0,
"logps/rejected": -338.0,
"loss": 0.3357,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.7734375,
"rewards/margins": 7.53125,
"rewards/rejected": -6.75,
"step": 358
},
{
"epoch": 0.4404907975460123,
"grad_norm": 32.264562546278825,
"learning_rate": 1.7239669421487602e-06,
"logits/chosen": -0.004486083984375,
"logits/rejected": -0.1103515625,
"logps/chosen": -428.0,
"logps/rejected": -344.0,
"loss": 0.4028,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 0.40234375,
"rewards/margins": 7.3125,
"rewards/rejected": -6.90625,
"step": 359
},
{
"epoch": 0.44171779141104295,
"grad_norm": 30.707161953362395,
"learning_rate": 1.7231404958677684e-06,
"logits/chosen": 0.0027923583984375,
"logits/rejected": -0.1142578125,
"logps/chosen": -400.0,
"logps/rejected": -366.0,
"loss": 0.2964,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.036376953125,
"rewards/margins": 7.40625,
"rewards/rejected": -7.4375,
"step": 360
},
{
"epoch": 0.4429447852760736,
"grad_norm": 28.2532161282973,
"learning_rate": 1.7223140495867768e-06,
"logits/chosen": 0.035888671875,
"logits/rejected": -0.14453125,
"logps/chosen": -444.0,
"logps/rejected": -394.0,
"loss": 0.3447,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.09423828125,
"rewards/margins": 8.125,
"rewards/rejected": -8.0,
"step": 361
},
{
"epoch": 0.4441717791411043,
"grad_norm": 30.63004713476651,
"learning_rate": 1.721487603305785e-06,
"logits/chosen": -0.0791015625,
"logits/rejected": -0.234375,
"logps/chosen": -426.0,
"logps/rejected": -354.0,
"loss": 0.393,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.0478515625,
"rewards/margins": 7.625,
"rewards/rejected": -7.6875,
"step": 362
},
{
"epoch": 0.44539877300613495,
"grad_norm": 24.181127169354465,
"learning_rate": 1.7206611570247934e-06,
"logits/chosen": 0.01141357421875,
"logits/rejected": -0.134765625,
"logps/chosen": -400.0,
"logps/rejected": -358.0,
"loss": 0.265,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.0281982421875,
"rewards/margins": 7.34375,
"rewards/rejected": -7.34375,
"step": 363
},
{
"epoch": 0.4466257668711656,
"grad_norm": 38.68918129355689,
"learning_rate": 1.7198347107438016e-06,
"logits/chosen": 0.1015625,
"logits/rejected": -0.06884765625,
"logps/chosen": -406.0,
"logps/rejected": -330.0,
"loss": 0.4892,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.515625,
"rewards/margins": 7.125,
"rewards/rejected": -7.625,
"step": 364
},
{
"epoch": 0.44785276073619634,
"grad_norm": 26.54302110111711,
"learning_rate": 1.7190082644628098e-06,
"logits/chosen": 0.036376953125,
"logits/rejected": -0.1044921875,
"logps/chosen": -362.0,
"logps/rejected": -328.0,
"loss": 0.3292,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.443359375,
"rewards/margins": 7.0625,
"rewards/rejected": -7.53125,
"step": 365
},
{
"epoch": 0.449079754601227,
"grad_norm": 31.437353393628033,
"learning_rate": 1.7181818181818182e-06,
"logits/chosen": 0.07177734375,
"logits/rejected": -0.0167236328125,
"logps/chosen": -378.0,
"logps/rejected": -348.0,
"loss": 0.4862,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.283203125,
"rewards/margins": 6.28125,
"rewards/rejected": -6.5625,
"step": 366
},
{
"epoch": 0.4503067484662577,
"grad_norm": 24.936304243498505,
"learning_rate": 1.7173553719008264e-06,
"logits/chosen": -0.10546875,
"logits/rejected": -0.287109375,
"logps/chosen": -404.0,
"logps/rejected": -350.0,
"loss": 0.2301,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.0166015625,
"rewards/margins": 7.03125,
"rewards/rejected": -7.03125,
"step": 367
},
{
"epoch": 0.45153374233128835,
"grad_norm": 33.06699625077162,
"learning_rate": 1.7165289256198346e-06,
"logits/chosen": 0.11083984375,
"logits/rejected": 0.0703125,
"logps/chosen": -382.0,
"logps/rejected": -344.0,
"loss": 0.4432,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.71484375,
"rewards/margins": 6.125,
"rewards/rejected": -6.84375,
"step": 368
},
{
"epoch": 0.452760736196319,
"grad_norm": 32.05752953588176,
"learning_rate": 1.7157024793388428e-06,
"logits/chosen": 0.10302734375,
"logits/rejected": -0.0185546875,
"logps/chosen": -358.0,
"logps/rejected": -314.0,
"loss": 0.4169,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.2109375,
"rewards/margins": 5.9375,
"rewards/rejected": -7.15625,
"step": 369
},
{
"epoch": 0.4539877300613497,
"grad_norm": 28.897289479795006,
"learning_rate": 1.7148760330578512e-06,
"logits/chosen": -0.11328125,
"logits/rejected": -0.2890625,
"logps/chosen": -412.0,
"logps/rejected": -360.0,
"loss": 0.3875,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.68359375,
"rewards/margins": 6.875,
"rewards/rejected": -6.1875,
"step": 370
},
{
"epoch": 0.45521472392638035,
"grad_norm": 28.480183749828473,
"learning_rate": 1.7140495867768593e-06,
"logits/chosen": -0.091796875,
"logits/rejected": -0.255859375,
"logps/chosen": -472.0,
"logps/rejected": -378.0,
"loss": 0.3191,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 0.37890625,
"rewards/margins": 6.1875,
"rewards/rejected": -5.78125,
"step": 371
},
{
"epoch": 0.456441717791411,
"grad_norm": 25.3244703029385,
"learning_rate": 1.7132231404958677e-06,
"logits/chosen": 0.01361083984375,
"logits/rejected": -0.142578125,
"logps/chosen": -422.0,
"logps/rejected": -340.0,
"loss": 0.2574,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 0.1650390625,
"rewards/margins": 6.71875,
"rewards/rejected": -6.53125,
"step": 372
},
{
"epoch": 0.45766871165644174,
"grad_norm": 29.284880465036775,
"learning_rate": 1.712396694214876e-06,
"logits/chosen": -0.010009765625,
"logits/rejected": -0.11572265625,
"logps/chosen": -376.0,
"logps/rejected": -340.0,
"loss": 0.4752,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.8515625,
"rewards/margins": 6.03125,
"rewards/rejected": -6.875,
"step": 373
},
{
"epoch": 0.4588957055214724,
"grad_norm": 26.631358414161173,
"learning_rate": 1.7115702479338843e-06,
"logits/chosen": -0.04443359375,
"logits/rejected": -0.16796875,
"logps/chosen": -396.0,
"logps/rejected": -332.0,
"loss": 0.3031,
"rewards/accuracies": 0.8671875,
"rewards/chosen": 0.63671875,
"rewards/margins": 7.09375,
"rewards/rejected": -6.46875,
"step": 374
},
{
"epoch": 0.4601226993865031,
"grad_norm": 32.968452883704536,
"learning_rate": 1.7107438016528925e-06,
"logits/chosen": -0.0966796875,
"logits/rejected": -0.166015625,
"logps/chosen": -406.0,
"logps/rejected": -368.0,
"loss": 0.3377,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 0.138671875,
"rewards/margins": 6.0625,
"rewards/rejected": -5.90625,
"step": 375
},
{
"epoch": 0.46134969325153374,
"grad_norm": 34.51257771820218,
"learning_rate": 1.709917355371901e-06,
"logits/chosen": 0.038818359375,
"logits/rejected": -0.1025390625,
"logps/chosen": -394.0,
"logps/rejected": -360.0,
"loss": 0.4323,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.041259765625,
"rewards/margins": 5.78125,
"rewards/rejected": -5.8125,
"step": 376
},
{
"epoch": 0.4625766871165644,
"grad_norm": 33.75836559175619,
"learning_rate": 1.709090909090909e-06,
"logits/chosen": -0.04638671875,
"logits/rejected": -0.099609375,
"logps/chosen": -366.0,
"logps/rejected": -336.0,
"loss": 0.459,
"rewards/accuracies": 0.8046875,
"rewards/chosen": 0.028076171875,
"rewards/margins": 7.03125,
"rewards/rejected": -7.0,
"step": 377
},
{
"epoch": 0.4638036809815951,
"grad_norm": 33.30516444032953,
"learning_rate": 1.7082644628099173e-06,
"logits/chosen": -0.10498046875,
"logits/rejected": -0.337890625,
"logps/chosen": -394.0,
"logps/rejected": -352.0,
"loss": 0.4247,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -0.11962890625,
"rewards/margins": 6.71875,
"rewards/rejected": -6.8125,
"step": 378
},
{
"epoch": 0.46503067484662575,
"grad_norm": 30.763840707194113,
"learning_rate": 1.7074380165289255e-06,
"logits/chosen": -0.1513671875,
"logits/rejected": -0.3125,
"logps/chosen": -422.0,
"logps/rejected": -360.0,
"loss": 0.3412,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 0.193359375,
"rewards/margins": 7.4375,
"rewards/rejected": -7.21875,
"step": 379
},
{
"epoch": 0.4662576687116564,
"grad_norm": 31.392021389760224,
"learning_rate": 1.7066115702479339e-06,
"logits/chosen": -0.048095703125,
"logits/rejected": -0.1845703125,
"logps/chosen": -398.0,
"logps/rejected": -342.0,
"loss": 0.3494,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.0283203125,
"rewards/margins": 6.90625,
"rewards/rejected": -6.875,
"step": 380
},
{
"epoch": 0.46748466257668714,
"grad_norm": 29.785310021888524,
"learning_rate": 1.705785123966942e-06,
"logits/chosen": -0.1552734375,
"logits/rejected": -0.330078125,
"logps/chosen": -390.0,
"logps/rejected": -348.0,
"loss": 0.3816,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.72265625,
"rewards/margins": 7.25,
"rewards/rejected": -7.96875,
"step": 381
},
{
"epoch": 0.4687116564417178,
"grad_norm": 27.088976045563662,
"learning_rate": 1.7049586776859503e-06,
"logits/chosen": -0.1435546875,
"logits/rejected": -0.234375,
"logps/chosen": -400.0,
"logps/rejected": -364.0,
"loss": 0.327,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.8046875,
"rewards/margins": 7.28125,
"rewards/rejected": -8.125,
"step": 382
},
{
"epoch": 0.4699386503067485,
"grad_norm": 33.53080318242638,
"learning_rate": 1.7041322314049587e-06,
"logits/chosen": -0.06005859375,
"logits/rejected": -0.21484375,
"logps/chosen": -422.0,
"logps/rejected": -398.0,
"loss": 0.5224,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.90234375,
"rewards/margins": 6.78125,
"rewards/rejected": -7.6875,
"step": 383
},
{
"epoch": 0.47116564417177914,
"grad_norm": 32.34787146638268,
"learning_rate": 1.7033057851239669e-06,
"logits/chosen": -0.166015625,
"logits/rejected": -0.3984375,
"logps/chosen": -416.0,
"logps/rejected": -362.0,
"loss": 0.3162,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.21875,
"rewards/margins": 7.84375,
"rewards/rejected": -9.0625,
"step": 384
},
{
"epoch": 0.4723926380368098,
"grad_norm": 31.518120862909818,
"learning_rate": 1.7024793388429753e-06,
"logits/chosen": -0.07080078125,
"logits/rejected": -0.244140625,
"logps/chosen": -412.0,
"logps/rejected": -350.0,
"loss": 0.3444,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.453125,
"rewards/margins": 6.59375,
"rewards/rejected": -8.0625,
"step": 385
},
{
"epoch": 0.4736196319018405,
"grad_norm": 32.78015750065005,
"learning_rate": 1.7016528925619832e-06,
"logits/chosen": 0.00141143798828125,
"logits/rejected": -0.15625,
"logps/chosen": -358.0,
"logps/rejected": -326.0,
"loss": 0.3851,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.921875,
"rewards/margins": 6.21875,
"rewards/rejected": -8.125,
"step": 386
},
{
"epoch": 0.47484662576687114,
"grad_norm": 49.31088394399299,
"learning_rate": 1.7008264462809916e-06,
"logits/chosen": -0.031005859375,
"logits/rejected": -0.2275390625,
"logps/chosen": -440.0,
"logps/rejected": -370.0,
"loss": 0.4591,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.0859375,
"rewards/margins": 7.53125,
"rewards/rejected": -8.625,
"step": 387
},
{
"epoch": 0.47607361963190187,
"grad_norm": 41.217564371521156,
"learning_rate": 1.6999999999999998e-06,
"logits/chosen": -0.037841796875,
"logits/rejected": -0.1318359375,
"logps/chosen": -424.0,
"logps/rejected": -346.0,
"loss": 0.5822,
"rewards/accuracies": 0.78125,
"rewards/chosen": -1.7734375,
"rewards/margins": 5.8125,
"rewards/rejected": -7.5625,
"step": 388
},
{
"epoch": 0.47730061349693254,
"grad_norm": 36.38322446074805,
"learning_rate": 1.6991735537190082e-06,
"logits/chosen": -0.1083984375,
"logits/rejected": -0.1845703125,
"logps/chosen": -426.0,
"logps/rejected": -358.0,
"loss": 0.4835,
"rewards/accuracies": 0.796875,
"rewards/chosen": -1.4140625,
"rewards/margins": 6.625,
"rewards/rejected": -8.0,
"step": 389
},
{
"epoch": 0.4785276073619632,
"grad_norm": 35.6042632525022,
"learning_rate": 1.6983471074380164e-06,
"logits/chosen": -0.193359375,
"logits/rejected": -0.302734375,
"logps/chosen": -386.0,
"logps/rejected": -362.0,
"loss": 0.5877,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -2.09375,
"rewards/margins": 6.3125,
"rewards/rejected": -8.375,
"step": 390
},
{
"epoch": 0.47975460122699387,
"grad_norm": 37.78834615655166,
"learning_rate": 1.6975206611570248e-06,
"logits/chosen": -0.08056640625,
"logits/rejected": -0.1943359375,
"logps/chosen": -406.0,
"logps/rejected": -364.0,
"loss": 0.5839,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.765625,
"rewards/margins": 6.78125,
"rewards/rejected": -8.5625,
"step": 391
},
{
"epoch": 0.48098159509202454,
"grad_norm": 28.396924135723918,
"learning_rate": 1.696694214876033e-06,
"logits/chosen": -0.0213623046875,
"logits/rejected": -0.1650390625,
"logps/chosen": -378.0,
"logps/rejected": -350.0,
"loss": 0.356,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.5078125,
"rewards/margins": 7.125,
"rewards/rejected": -8.625,
"step": 392
},
{
"epoch": 0.4822085889570552,
"grad_norm": 30.381091525330017,
"learning_rate": 1.6958677685950414e-06,
"logits/chosen": 0.015380859375,
"logits/rejected": -0.12158203125,
"logps/chosen": -430.0,
"logps/rejected": -396.0,
"loss": 0.3579,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.78125,
"rewards/margins": 6.9375,
"rewards/rejected": -8.75,
"step": 393
},
{
"epoch": 0.4834355828220859,
"grad_norm": 31.404216078333306,
"learning_rate": 1.6950413223140496e-06,
"logits/chosen": -0.052001953125,
"logits/rejected": -0.255859375,
"logps/chosen": -414.0,
"logps/rejected": -364.0,
"loss": 0.323,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.9140625,
"rewards/margins": 6.5,
"rewards/rejected": -8.4375,
"step": 394
},
{
"epoch": 0.48466257668711654,
"grad_norm": 32.32011609319193,
"learning_rate": 1.6942148760330578e-06,
"logits/chosen": -0.0556640625,
"logits/rejected": -0.1669921875,
"logps/chosen": -464.0,
"logps/rejected": -378.0,
"loss": 0.4117,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.703125,
"rewards/margins": 6.625,
"rewards/rejected": -8.3125,
"step": 395
},
{
"epoch": 0.48588957055214727,
"grad_norm": 19.40179268006029,
"learning_rate": 1.693388429752066e-06,
"logits/chosen": -0.1396484375,
"logits/rejected": -0.3515625,
"logps/chosen": -362.0,
"logps/rejected": -352.0,
"loss": 0.2091,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -1.9609375,
"rewards/margins": 7.03125,
"rewards/rejected": -9.0,
"step": 396
},
{
"epoch": 0.48711656441717793,
"grad_norm": 29.664560996119025,
"learning_rate": 1.6925619834710744e-06,
"logits/chosen": -0.10595703125,
"logits/rejected": -0.26953125,
"logps/chosen": -404.0,
"logps/rejected": -372.0,
"loss": 0.3894,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -2.15625,
"rewards/margins": 7.46875,
"rewards/rejected": -9.625,
"step": 397
},
{
"epoch": 0.4883435582822086,
"grad_norm": 35.227773979950804,
"learning_rate": 1.6917355371900825e-06,
"logits/chosen": -0.08642578125,
"logits/rejected": -0.234375,
"logps/chosen": -442.0,
"logps/rejected": -366.0,
"loss": 0.4568,
"rewards/accuracies": 0.796875,
"rewards/chosen": -1.6328125,
"rewards/margins": 7.0,
"rewards/rejected": -8.625,
"step": 398
},
{
"epoch": 0.48957055214723927,
"grad_norm": 25.713713057648395,
"learning_rate": 1.6909090909090907e-06,
"logits/chosen": -0.1142578125,
"logits/rejected": -0.2451171875,
"logps/chosen": -408.0,
"logps/rejected": -366.0,
"loss": 0.2951,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -1.4296875,
"rewards/margins": 7.15625,
"rewards/rejected": -8.5625,
"step": 399
},
{
"epoch": 0.49079754601226994,
"grad_norm": 38.29848512087874,
"learning_rate": 1.6900826446280991e-06,
"logits/chosen": -0.034912109375,
"logits/rejected": -0.109375,
"logps/chosen": -398.0,
"logps/rejected": -388.0,
"loss": 0.5312,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.984375,
"rewards/margins": 6.21875,
"rewards/rejected": -8.1875,
"step": 400
},
{
"epoch": 0.4920245398773006,
"grad_norm": 28.109129917116697,
"learning_rate": 1.6892561983471073e-06,
"logits/chosen": -0.1953125,
"logits/rejected": -0.328125,
"logps/chosen": -466.0,
"logps/rejected": -408.0,
"loss": 0.3478,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.6796875,
"rewards/margins": 8.25,
"rewards/rejected": -8.9375,
"step": 401
},
{
"epoch": 0.49325153374233127,
"grad_norm": 30.844594503009763,
"learning_rate": 1.6884297520661157e-06,
"logits/chosen": -0.0240478515625,
"logits/rejected": -0.1240234375,
"logps/chosen": -406.0,
"logps/rejected": -370.0,
"loss": 0.3713,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.3515625,
"rewards/margins": 7.03125,
"rewards/rejected": -8.375,
"step": 402
},
{
"epoch": 0.49447852760736194,
"grad_norm": 31.31430113596148,
"learning_rate": 1.687603305785124e-06,
"logits/chosen": -0.0257568359375,
"logits/rejected": -0.0966796875,
"logps/chosen": -408.0,
"logps/rejected": -392.0,
"loss": 0.3707,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.21875,
"rewards/margins": 7.4375,
"rewards/rejected": -8.625,
"step": 403
},
{
"epoch": 0.49570552147239266,
"grad_norm": 22.348999852720777,
"learning_rate": 1.686776859504132e-06,
"logits/chosen": 0.04052734375,
"logits/rejected": -0.08251953125,
"logps/chosen": -382.0,
"logps/rejected": -364.0,
"loss": 0.2533,
"rewards/accuracies": 0.921875,
"rewards/chosen": -0.875,
"rewards/margins": 7.53125,
"rewards/rejected": -8.4375,
"step": 404
},
{
"epoch": 0.49693251533742333,
"grad_norm": 33.32428200450095,
"learning_rate": 1.6859504132231403e-06,
"logits/chosen": -0.04931640625,
"logits/rejected": -0.275390625,
"logps/chosen": -378.0,
"logps/rejected": -334.0,
"loss": 0.4779,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.23046875,
"rewards/margins": 7.03125,
"rewards/rejected": -7.25,
"step": 405
},
{
"epoch": 0.498159509202454,
"grad_norm": 33.838303003033246,
"learning_rate": 1.6851239669421487e-06,
"logits/chosen": 0.0869140625,
"logits/rejected": 0.01220703125,
"logps/chosen": -390.0,
"logps/rejected": -356.0,
"loss": 0.5869,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.8046875,
"rewards/margins": 6.4375,
"rewards/rejected": -7.21875,
"step": 406
},
{
"epoch": 0.49938650306748467,
"grad_norm": 34.523252957550035,
"learning_rate": 1.6842975206611569e-06,
"logits/chosen": 0.07470703125,
"logits/rejected": -0.068359375,
"logps/chosen": -420.0,
"logps/rejected": -358.0,
"loss": 0.4983,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.10400390625,
"rewards/margins": 7.53125,
"rewards/rejected": -7.4375,
"step": 407
},
{
"epoch": 0.5006134969325153,
"grad_norm": 37.89839337386224,
"learning_rate": 1.6834710743801653e-06,
"logits/chosen": -0.0157470703125,
"logits/rejected": -0.06494140625,
"logps/chosen": -438.0,
"logps/rejected": -374.0,
"loss": 0.5683,
"rewards/accuracies": 0.78125,
"rewards/chosen": -1.3203125,
"rewards/margins": 5.34375,
"rewards/rejected": -6.6875,
"step": 408
},
{
"epoch": 0.501840490797546,
"grad_norm": 42.296056623701546,
"learning_rate": 1.6826446280991735e-06,
"logits/chosen": 0.06396484375,
"logits/rejected": -0.1396484375,
"logps/chosen": -438.0,
"logps/rejected": -354.0,
"loss": 0.5362,
"rewards/accuracies": 0.796875,
"rewards/chosen": -0.69921875,
"rewards/margins": 6.625,
"rewards/rejected": -7.3125,
"step": 409
},
{
"epoch": 0.5030674846625767,
"grad_norm": 29.901013858681456,
"learning_rate": 1.6818181818181819e-06,
"logits/chosen": 0.060791015625,
"logits/rejected": -0.1298828125,
"logps/chosen": -398.0,
"logps/rejected": -372.0,
"loss": 0.433,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.73046875,
"rewards/margins": 6.25,
"rewards/rejected": -7.0,
"step": 410
},
{
"epoch": 0.5042944785276073,
"grad_norm": 27.8739976076756,
"learning_rate": 1.68099173553719e-06,
"logits/chosen": 0.08740234375,
"logits/rejected": -0.060302734375,
"logps/chosen": -352.0,
"logps/rejected": -332.0,
"loss": 0.328,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.83203125,
"rewards/margins": 6.625,
"rewards/rejected": -7.4375,
"step": 411
},
{
"epoch": 0.505521472392638,
"grad_norm": 39.10573268043823,
"learning_rate": 1.6801652892561985e-06,
"logits/chosen": 0.07275390625,
"logits/rejected": -0.061279296875,
"logps/chosen": -440.0,
"logps/rejected": -382.0,
"loss": 0.4836,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.89453125,
"rewards/margins": 6.125,
"rewards/rejected": -7.03125,
"step": 412
},
{
"epoch": 0.5067484662576687,
"grad_norm": 32.18764811981767,
"learning_rate": 1.6793388429752064e-06,
"logits/chosen": 0.01202392578125,
"logits/rejected": -0.205078125,
"logps/chosen": -420.0,
"logps/rejected": -344.0,
"loss": 0.3895,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.330078125,
"rewards/margins": 7.0625,
"rewards/rejected": -7.40625,
"step": 413
},
{
"epoch": 0.5079754601226993,
"grad_norm": 37.47692684242266,
"learning_rate": 1.6785123966942148e-06,
"logits/chosen": -0.0361328125,
"logits/rejected": -0.17578125,
"logps/chosen": -416.0,
"logps/rejected": -366.0,
"loss": 0.3699,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.259765625,
"rewards/margins": 6.875,
"rewards/rejected": -7.125,
"step": 414
},
{
"epoch": 0.50920245398773,
"grad_norm": 28.99864003821869,
"learning_rate": 1.677685950413223e-06,
"logits/chosen": 0.009765625,
"logits/rejected": -0.162109375,
"logps/chosen": -362.0,
"logps/rejected": -348.0,
"loss": 0.3426,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.73046875,
"rewards/margins": 7.09375,
"rewards/rejected": -7.8125,
"step": 415
},
{
"epoch": 0.5104294478527608,
"grad_norm": 24.822903845830673,
"learning_rate": 1.6768595041322314e-06,
"logits/chosen": 0.0439453125,
"logits/rejected": -0.1796875,
"logps/chosen": -374.0,
"logps/rejected": -342.0,
"loss": 0.1781,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.8125,
"rewards/margins": 7.1875,
"rewards/rejected": -8.0,
"step": 416
},
{
"epoch": 0.5116564417177915,
"grad_norm": 31.299263604053785,
"learning_rate": 1.6760330578512396e-06,
"logits/chosen": -0.1865234375,
"logits/rejected": -0.3515625,
"logps/chosen": -450.0,
"logps/rejected": -400.0,
"loss": 0.3577,
"rewards/accuracies": 0.8359375,
"rewards/chosen": 0.09228515625,
"rewards/margins": 8.625,
"rewards/rejected": -8.5,
"step": 417
},
{
"epoch": 0.5128834355828221,
"grad_norm": 29.613749931860756,
"learning_rate": 1.6752066115702478e-06,
"logits/chosen": -0.09130859375,
"logits/rejected": -0.173828125,
"logps/chosen": -382.0,
"logps/rejected": -326.0,
"loss": 0.4501,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.703125,
"rewards/margins": 7.71875,
"rewards/rejected": -8.4375,
"step": 418
},
{
"epoch": 0.5141104294478528,
"grad_norm": 26.144467778424943,
"learning_rate": 1.6743801652892562e-06,
"logits/chosen": -0.0308837890625,
"logits/rejected": -0.19140625,
"logps/chosen": -398.0,
"logps/rejected": -368.0,
"loss": 0.3464,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.734375,
"rewards/margins": 8.5,
"rewards/rejected": -9.25,
"step": 419
},
{
"epoch": 0.5153374233128835,
"grad_norm": 26.869642618021608,
"learning_rate": 1.6735537190082644e-06,
"logits/chosen": 0.05908203125,
"logits/rejected": -0.099609375,
"logps/chosen": -366.0,
"logps/rejected": -340.0,
"loss": 0.367,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.1171875,
"rewards/margins": 7.1875,
"rewards/rejected": -8.3125,
"step": 420
},
{
"epoch": 0.5165644171779141,
"grad_norm": 29.165183667347375,
"learning_rate": 1.6727272727272726e-06,
"logits/chosen": 0.01806640625,
"logits/rejected": -0.1923828125,
"logps/chosen": -386.0,
"logps/rejected": -350.0,
"loss": 0.4518,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.046875,
"rewards/margins": 7.53125,
"rewards/rejected": -8.5625,
"step": 421
},
{
"epoch": 0.5177914110429448,
"grad_norm": 33.09732508946622,
"learning_rate": 1.6719008264462808e-06,
"logits/chosen": 0.08837890625,
"logits/rejected": -0.07275390625,
"logps/chosen": -382.0,
"logps/rejected": -332.0,
"loss": 0.4467,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.7265625,
"rewards/margins": 7.53125,
"rewards/rejected": -9.25,
"step": 422
},
{
"epoch": 0.5190184049079755,
"grad_norm": 34.07363427937366,
"learning_rate": 1.6710743801652892e-06,
"logits/chosen": -0.038818359375,
"logits/rejected": -0.1865234375,
"logps/chosen": -424.0,
"logps/rejected": -394.0,
"loss": 0.5543,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -2.0,
"rewards/margins": 6.6875,
"rewards/rejected": -8.6875,
"step": 423
},
{
"epoch": 0.5202453987730061,
"grad_norm": 31.17924504882386,
"learning_rate": 1.6702479338842974e-06,
"logits/chosen": 0.051025390625,
"logits/rejected": -0.1416015625,
"logps/chosen": -402.0,
"logps/rejected": -378.0,
"loss": 0.4885,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.21875,
"rewards/margins": 8.3125,
"rewards/rejected": -9.5,
"step": 424
},
{
"epoch": 0.5214723926380368,
"grad_norm": 33.85685434554039,
"learning_rate": 1.6694214876033058e-06,
"logits/chosen": 0.01318359375,
"logits/rejected": -0.0888671875,
"logps/chosen": -424.0,
"logps/rejected": -388.0,
"loss": 0.5854,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.515625,
"rewards/margins": 7.9375,
"rewards/rejected": -9.4375,
"step": 425
},
{
"epoch": 0.5226993865030675,
"grad_norm": 29.831685706099364,
"learning_rate": 1.668595041322314e-06,
"logits/chosen": -0.040771484375,
"logits/rejected": -0.1396484375,
"logps/chosen": -396.0,
"logps/rejected": -384.0,
"loss": 0.4125,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.609375,
"rewards/margins": 8.0625,
"rewards/rejected": -9.625,
"step": 426
},
{
"epoch": 0.5239263803680981,
"grad_norm": 39.1961982480204,
"learning_rate": 1.6677685950413223e-06,
"logits/chosen": 0.01611328125,
"logits/rejected": -0.10400390625,
"logps/chosen": -406.0,
"logps/rejected": -370.0,
"loss": 0.512,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.6640625,
"rewards/margins": 7.53125,
"rewards/rejected": -9.1875,
"step": 427
},
{
"epoch": 0.5251533742331288,
"grad_norm": 32.948802126796025,
"learning_rate": 1.6669421487603305e-06,
"logits/chosen": -0.00872802734375,
"logits/rejected": -0.11962890625,
"logps/chosen": -394.0,
"logps/rejected": -360.0,
"loss": 0.4635,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -2.5625,
"rewards/margins": 7.09375,
"rewards/rejected": -9.625,
"step": 428
},
{
"epoch": 0.5263803680981595,
"grad_norm": 26.957031491450675,
"learning_rate": 1.666115702479339e-06,
"logits/chosen": -0.01080322265625,
"logits/rejected": -0.11572265625,
"logps/chosen": -388.0,
"logps/rejected": -408.0,
"loss": 0.3077,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -2.390625,
"rewards/margins": 8.375,
"rewards/rejected": -10.75,
"step": 429
},
{
"epoch": 0.5276073619631901,
"grad_norm": 24.559659605383004,
"learning_rate": 1.665289256198347e-06,
"logits/chosen": -0.0810546875,
"logits/rejected": -0.24609375,
"logps/chosen": -418.0,
"logps/rejected": -380.0,
"loss": 0.2681,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.4375,
"rewards/margins": 8.25,
"rewards/rejected": -9.6875,
"step": 430
},
{
"epoch": 0.5288343558282208,
"grad_norm": 37.10052986780247,
"learning_rate": 1.6644628099173553e-06,
"logits/chosen": 0.06103515625,
"logits/rejected": -0.1123046875,
"logps/chosen": -414.0,
"logps/rejected": -378.0,
"loss": 0.5234,
"rewards/accuracies": 0.828125,
"rewards/chosen": -2.59375,
"rewards/margins": 6.875,
"rewards/rejected": -9.4375,
"step": 431
},
{
"epoch": 0.5300613496932516,
"grad_norm": 32.114960158791014,
"learning_rate": 1.6636363636363635e-06,
"logits/chosen": 0.10400390625,
"logits/rejected": 0.07373046875,
"logps/chosen": -406.0,
"logps/rejected": -384.0,
"loss": 0.4615,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -1.734375,
"rewards/margins": 7.09375,
"rewards/rejected": -8.8125,
"step": 432
},
{
"epoch": 0.5312883435582823,
"grad_norm": 37.08856614918871,
"learning_rate": 1.6628099173553719e-06,
"logits/chosen": 0.1259765625,
"logits/rejected": -0.09716796875,
"logps/chosen": -412.0,
"logps/rejected": -348.0,
"loss": 0.5312,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -2.453125,
"rewards/margins": 6.9375,
"rewards/rejected": -9.375,
"step": 433
},
{
"epoch": 0.5325153374233129,
"grad_norm": 32.338206003482526,
"learning_rate": 1.66198347107438e-06,
"logits/chosen": -0.051513671875,
"logits/rejected": -0.1240234375,
"logps/chosen": -410.0,
"logps/rejected": -382.0,
"loss": 0.3539,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.9375,
"rewards/margins": 6.875,
"rewards/rejected": -8.8125,
"step": 434
},
{
"epoch": 0.5337423312883436,
"grad_norm": 35.63181748097062,
"learning_rate": 1.6611570247933883e-06,
"logits/chosen": 0.026611328125,
"logits/rejected": -0.16796875,
"logps/chosen": -414.0,
"logps/rejected": -386.0,
"loss": 0.4125,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.5078125,
"rewards/margins": 7.59375,
"rewards/rejected": -9.125,
"step": 435
},
{
"epoch": 0.5349693251533743,
"grad_norm": 26.79650669342074,
"learning_rate": 1.6603305785123967e-06,
"logits/chosen": 0.004302978515625,
"logits/rejected": -0.2001953125,
"logps/chosen": -440.0,
"logps/rejected": -380.0,
"loss": 0.2852,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.6875,
"rewards/margins": 8.25,
"rewards/rejected": -8.9375,
"step": 436
},
{
"epoch": 0.5361963190184049,
"grad_norm": 25.79868080404115,
"learning_rate": 1.6595041322314049e-06,
"logits/chosen": -0.053955078125,
"logits/rejected": -0.22265625,
"logps/chosen": -406.0,
"logps/rejected": -374.0,
"loss": 0.2641,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.375,
"rewards/margins": 7.84375,
"rewards/rejected": -9.1875,
"step": 437
},
{
"epoch": 0.5374233128834356,
"grad_norm": 32.79503864117327,
"learning_rate": 1.6586776859504133e-06,
"logits/chosen": 0.04833984375,
"logits/rejected": -0.040283203125,
"logps/chosen": -386.0,
"logps/rejected": -360.0,
"loss": 0.5513,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -2.0625,
"rewards/margins": 6.21875,
"rewards/rejected": -8.3125,
"step": 438
},
{
"epoch": 0.5386503067484663,
"grad_norm": 33.94594995824427,
"learning_rate": 1.6578512396694212e-06,
"logits/chosen": 0.09130859375,
"logits/rejected": -0.09521484375,
"logps/chosen": -392.0,
"logps/rejected": -372.0,
"loss": 0.4675,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -2.0,
"rewards/margins": 7.0625,
"rewards/rejected": -9.0625,
"step": 439
},
{
"epoch": 0.5398773006134969,
"grad_norm": 36.04971662826716,
"learning_rate": 1.6570247933884296e-06,
"logits/chosen": 0.0556640625,
"logits/rejected": -0.048095703125,
"logps/chosen": -410.0,
"logps/rejected": -368.0,
"loss": 0.498,
"rewards/accuracies": 0.828125,
"rewards/chosen": -2.234375,
"rewards/margins": 5.96875,
"rewards/rejected": -8.1875,
"step": 440
},
{
"epoch": 0.5411042944785276,
"grad_norm": 32.030469564543935,
"learning_rate": 1.6561983471074378e-06,
"logits/chosen": 0.130859375,
"logits/rejected": 0.02001953125,
"logps/chosen": -358.0,
"logps/rejected": -338.0,
"loss": 0.5277,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.9140625,
"rewards/margins": 6.65625,
"rewards/rejected": -8.5625,
"step": 441
},
{
"epoch": 0.5423312883435583,
"grad_norm": 29.151132970928362,
"learning_rate": 1.6553719008264462e-06,
"logits/chosen": -0.035400390625,
"logits/rejected": -0.169921875,
"logps/chosen": -408.0,
"logps/rejected": -374.0,
"loss": 0.41,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -1.2578125,
"rewards/margins": 7.03125,
"rewards/rejected": -8.3125,
"step": 442
},
{
"epoch": 0.5435582822085889,
"grad_norm": 33.995027646717034,
"learning_rate": 1.6545454545454544e-06,
"logits/chosen": 0.005706787109375,
"logits/rejected": -0.11279296875,
"logps/chosen": -390.0,
"logps/rejected": -356.0,
"loss": 0.3994,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.0859375,
"rewards/margins": 7.4375,
"rewards/rejected": -8.5,
"step": 443
},
{
"epoch": 0.5447852760736196,
"grad_norm": 33.498123985496186,
"learning_rate": 1.6537190082644628e-06,
"logits/chosen": -0.032958984375,
"logits/rejected": -0.275390625,
"logps/chosen": -468.0,
"logps/rejected": -402.0,
"loss": 0.4238,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.1650390625,
"rewards/margins": 8.5625,
"rewards/rejected": -8.75,
"step": 444
},
{
"epoch": 0.5460122699386503,
"grad_norm": 30.345571262302183,
"learning_rate": 1.652892561983471e-06,
"logits/chosen": 0.01611328125,
"logits/rejected": -0.1865234375,
"logps/chosen": -376.0,
"logps/rejected": -336.0,
"loss": 0.4495,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.1171875,
"rewards/margins": 6.59375,
"rewards/rejected": -7.71875,
"step": 445
},
{
"epoch": 0.5472392638036809,
"grad_norm": 25.42294156133156,
"learning_rate": 1.6520661157024794e-06,
"logits/chosen": -0.0213623046875,
"logits/rejected": -0.1806640625,
"logps/chosen": -458.0,
"logps/rejected": -396.0,
"loss": 0.2667,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.203125,
"rewards/margins": 7.0625,
"rewards/rejected": -8.25,
"step": 446
},
{
"epoch": 0.5484662576687117,
"grad_norm": 26.626753504524636,
"learning_rate": 1.6512396694214876e-06,
"logits/chosen": -0.0140380859375,
"logits/rejected": -0.2138671875,
"logps/chosen": -432.0,
"logps/rejected": -386.0,
"loss": 0.3418,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.2734375,
"rewards/margins": 9.0,
"rewards/rejected": -9.25,
"step": 447
},
{
"epoch": 0.5496932515337424,
"grad_norm": 29.24067416322435,
"learning_rate": 1.6504132231404958e-06,
"logits/chosen": 0.060546875,
"logits/rejected": -0.07958984375,
"logps/chosen": -366.0,
"logps/rejected": -340.0,
"loss": 0.3879,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.765625,
"rewards/margins": 6.65625,
"rewards/rejected": -8.4375,
"step": 448
},
{
"epoch": 0.550920245398773,
"grad_norm": 30.067697923036302,
"learning_rate": 1.649586776859504e-06,
"logits/chosen": -0.01446533203125,
"logits/rejected": -0.1435546875,
"logps/chosen": -418.0,
"logps/rejected": -370.0,
"loss": 0.386,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.70703125,
"rewards/margins": 7.875,
"rewards/rejected": -8.5625,
"step": 449
},
{
"epoch": 0.5521472392638037,
"grad_norm": 21.694636403313346,
"learning_rate": 1.6487603305785124e-06,
"logits/chosen": -0.08984375,
"logits/rejected": -0.1298828125,
"logps/chosen": -368.0,
"logps/rejected": -328.0,
"loss": 0.2156,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -1.1015625,
"rewards/margins": 7.46875,
"rewards/rejected": -8.5625,
"step": 450
},
{
"epoch": 0.5533742331288344,
"grad_norm": 29.05380302467979,
"learning_rate": 1.6479338842975206e-06,
"logits/chosen": 0.04931640625,
"logits/rejected": -0.1220703125,
"logps/chosen": -364.0,
"logps/rejected": -318.0,
"loss": 0.3986,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.1953125,
"rewards/margins": 7.0625,
"rewards/rejected": -8.25,
"step": 451
},
{
"epoch": 0.554601226993865,
"grad_norm": 27.760646528113295,
"learning_rate": 1.647107438016529e-06,
"logits/chosen": -0.0255126953125,
"logits/rejected": -0.265625,
"logps/chosen": -478.0,
"logps/rejected": -368.0,
"loss": 0.3005,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 0.0673828125,
"rewards/margins": 8.25,
"rewards/rejected": -8.1875,
"step": 452
},
{
"epoch": 0.5558282208588957,
"grad_norm": 25.281076585136077,
"learning_rate": 1.6462809917355371e-06,
"logits/chosen": -0.1201171875,
"logits/rejected": -0.326171875,
"logps/chosen": -458.0,
"logps/rejected": -402.0,
"loss": 0.3418,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.310546875,
"rewards/margins": 8.6875,
"rewards/rejected": -8.4375,
"step": 453
},
{
"epoch": 0.5570552147239264,
"grad_norm": 30.44623133664489,
"learning_rate": 1.6454545454545453e-06,
"logits/chosen": 0.062255859375,
"logits/rejected": -0.0074462890625,
"logps/chosen": -366.0,
"logps/rejected": -346.0,
"loss": 0.3232,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.96875,
"rewards/margins": 6.65625,
"rewards/rejected": -8.625,
"step": 454
},
{
"epoch": 0.558282208588957,
"grad_norm": 24.33104579537843,
"learning_rate": 1.6446280991735537e-06,
"logits/chosen": -0.061279296875,
"logits/rejected": -0.1806640625,
"logps/chosen": -388.0,
"logps/rejected": -388.0,
"loss": 0.2398,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.28125,
"rewards/margins": 8.3125,
"rewards/rejected": -8.625,
"step": 455
},
{
"epoch": 0.5595092024539877,
"grad_norm": 31.508968261672358,
"learning_rate": 1.643801652892562e-06,
"logits/chosen": 0.062255859375,
"logits/rejected": -0.039306640625,
"logps/chosen": -338.0,
"logps/rejected": -338.0,
"loss": 0.4011,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.4140625,
"rewards/margins": 7.34375,
"rewards/rejected": -8.75,
"step": 456
},
{
"epoch": 0.5607361963190184,
"grad_norm": 34.26099970076489,
"learning_rate": 1.6429752066115701e-06,
"logits/chosen": 0.03466796875,
"logits/rejected": -0.09033203125,
"logps/chosen": -380.0,
"logps/rejected": -356.0,
"loss": 0.3637,
"rewards/accuracies": 0.796875,
"rewards/chosen": -1.296875,
"rewards/margins": 6.84375,
"rewards/rejected": -8.125,
"step": 457
},
{
"epoch": 0.561963190184049,
"grad_norm": 30.109525941506696,
"learning_rate": 1.6421487603305783e-06,
"logits/chosen": -0.00640869140625,
"logits/rejected": -0.1630859375,
"logps/chosen": -394.0,
"logps/rejected": -324.0,
"loss": 0.3595,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.5390625,
"rewards/margins": 8.0,
"rewards/rejected": -8.5625,
"step": 458
},
{
"epoch": 0.5631901840490797,
"grad_norm": 36.85257202668565,
"learning_rate": 1.6413223140495867e-06,
"logits/chosen": 0.007232666015625,
"logits/rejected": -0.154296875,
"logps/chosen": -414.0,
"logps/rejected": -378.0,
"loss": 0.5023,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.6484375,
"rewards/margins": 7.875,
"rewards/rejected": -8.5,
"step": 459
},
{
"epoch": 0.5644171779141104,
"grad_norm": 26.689470495593376,
"learning_rate": 1.6404958677685949e-06,
"logits/chosen": 0.00799560546875,
"logits/rejected": -0.08837890625,
"logps/chosen": -370.0,
"logps/rejected": -360.0,
"loss": 0.2689,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -1.3046875,
"rewards/margins": 7.875,
"rewards/rejected": -9.1875,
"step": 460
},
{
"epoch": 0.5656441717791411,
"grad_norm": 30.131225321307415,
"learning_rate": 1.6396694214876033e-06,
"logits/chosen": -0.193359375,
"logits/rejected": -0.30859375,
"logps/chosen": -396.0,
"logps/rejected": -370.0,
"loss": 0.3315,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.3125,
"rewards/margins": 7.0,
"rewards/rejected": -8.3125,
"step": 461
},
{
"epoch": 0.5668711656441717,
"grad_norm": 36.664773364106914,
"learning_rate": 1.6388429752066115e-06,
"logits/chosen": 0.0751953125,
"logits/rejected": -0.1318359375,
"logps/chosen": -388.0,
"logps/rejected": -332.0,
"loss": 0.4811,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.9453125,
"rewards/margins": 6.34375,
"rewards/rejected": -8.3125,
"step": 462
},
{
"epoch": 0.5680981595092025,
"grad_norm": 33.81030632438629,
"learning_rate": 1.6380165289256199e-06,
"logits/chosen": -0.061767578125,
"logits/rejected": -0.16015625,
"logps/chosen": -382.0,
"logps/rejected": -388.0,
"loss": 0.4107,
"rewards/accuracies": 0.796875,
"rewards/chosen": -0.796875,
"rewards/margins": 7.5,
"rewards/rejected": -8.3125,
"step": 463
},
{
"epoch": 0.5693251533742332,
"grad_norm": 32.34074085259671,
"learning_rate": 1.637190082644628e-06,
"logits/chosen": 0.08056640625,
"logits/rejected": -0.0859375,
"logps/chosen": -410.0,
"logps/rejected": -350.0,
"loss": 0.3949,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.95703125,
"rewards/margins": 7.34375,
"rewards/rejected": -8.3125,
"step": 464
},
{
"epoch": 0.5705521472392638,
"grad_norm": 21.5163436057995,
"learning_rate": 1.6363636363636365e-06,
"logits/chosen": -0.0439453125,
"logits/rejected": -0.283203125,
"logps/chosen": -416.0,
"logps/rejected": -378.0,
"loss": 0.1748,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -0.494140625,
"rewards/margins": 8.6875,
"rewards/rejected": -9.1875,
"step": 465
},
{
"epoch": 0.5717791411042945,
"grad_norm": 28.68434013700241,
"learning_rate": 1.6355371900826444e-06,
"logits/chosen": 0.005279541015625,
"logits/rejected": -0.11474609375,
"logps/chosen": -438.0,
"logps/rejected": -376.0,
"loss": 0.3459,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.2890625,
"rewards/margins": 8.0625,
"rewards/rejected": -9.375,
"step": 466
},
{
"epoch": 0.5730061349693252,
"grad_norm": 36.260436829882615,
"learning_rate": 1.6347107438016528e-06,
"logits/chosen": -0.0074462890625,
"logits/rejected": -0.216796875,
"logps/chosen": -400.0,
"logps/rejected": -380.0,
"loss": 0.4537,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.40234375,
"rewards/margins": 7.71875,
"rewards/rejected": -8.125,
"step": 467
},
{
"epoch": 0.5742331288343558,
"grad_norm": 30.576534183272877,
"learning_rate": 1.633884297520661e-06,
"logits/chosen": -0.0302734375,
"logits/rejected": -0.1708984375,
"logps/chosen": -382.0,
"logps/rejected": -374.0,
"loss": 0.358,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.56640625,
"rewards/margins": 8.0625,
"rewards/rejected": -8.625,
"step": 468
},
{
"epoch": 0.5754601226993865,
"grad_norm": 20.828105770865267,
"learning_rate": 1.6330578512396694e-06,
"logits/chosen": 0.039306640625,
"logits/rejected": -0.1328125,
"logps/chosen": -400.0,
"logps/rejected": -334.0,
"loss": 0.2384,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -0.25390625,
"rewards/margins": 8.375,
"rewards/rejected": -8.625,
"step": 469
},
{
"epoch": 0.5766871165644172,
"grad_norm": 32.1934779412918,
"learning_rate": 1.6322314049586776e-06,
"logits/chosen": 0.00182342529296875,
"logits/rejected": -0.059326171875,
"logps/chosen": -366.0,
"logps/rejected": -352.0,
"loss": 0.4375,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.330078125,
"rewards/margins": 7.875,
"rewards/rejected": -8.1875,
"step": 470
},
{
"epoch": 0.5779141104294478,
"grad_norm": 30.801755679882532,
"learning_rate": 1.6314049586776858e-06,
"logits/chosen": 0.12890625,
"logits/rejected": -0.0341796875,
"logps/chosen": -418.0,
"logps/rejected": -362.0,
"loss": 0.3906,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.7734375,
"rewards/margins": 7.125,
"rewards/rejected": -7.90625,
"step": 471
},
{
"epoch": 0.5791411042944785,
"grad_norm": 29.381294679796277,
"learning_rate": 1.6305785123966942e-06,
"logits/chosen": 0.07568359375,
"logits/rejected": -0.1435546875,
"logps/chosen": -424.0,
"logps/rejected": -350.0,
"loss": 0.4164,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.58203125,
"rewards/margins": 7.46875,
"rewards/rejected": -8.0625,
"step": 472
},
{
"epoch": 0.5803680981595092,
"grad_norm": 28.86485366882726,
"learning_rate": 1.6297520661157024e-06,
"logits/chosen": -0.1005859375,
"logits/rejected": -0.2080078125,
"logps/chosen": -418.0,
"logps/rejected": -412.0,
"loss": 0.3996,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.9609375,
"rewards/margins": 7.34375,
"rewards/rejected": -8.3125,
"step": 473
},
{
"epoch": 0.5815950920245399,
"grad_norm": 34.86225551699741,
"learning_rate": 1.6289256198347108e-06,
"logits/chosen": -0.05712890625,
"logits/rejected": -0.263671875,
"logps/chosen": -452.0,
"logps/rejected": -376.0,
"loss": 0.417,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.1015625,
"rewards/margins": 7.09375,
"rewards/rejected": -8.1875,
"step": 474
},
{
"epoch": 0.5828220858895705,
"grad_norm": 27.36425660979793,
"learning_rate": 1.6280991735537188e-06,
"logits/chosen": -0.0634765625,
"logits/rejected": -0.267578125,
"logps/chosen": -442.0,
"logps/rejected": -378.0,
"loss": 0.2677,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.330078125,
"rewards/margins": 9.0625,
"rewards/rejected": -8.75,
"step": 475
},
{
"epoch": 0.5840490797546012,
"grad_norm": 31.880656616958664,
"learning_rate": 1.6272727272727272e-06,
"logits/chosen": 0.019287109375,
"logits/rejected": -0.171875,
"logps/chosen": -430.0,
"logps/rejected": -374.0,
"loss": 0.4031,
"rewards/accuracies": 0.84375,
"rewards/chosen": -2.0625,
"rewards/margins": 7.0,
"rewards/rejected": -9.0625,
"step": 476
},
{
"epoch": 0.5852760736196319,
"grad_norm": 30.464791239585146,
"learning_rate": 1.6264462809917354e-06,
"logits/chosen": -0.11083984375,
"logits/rejected": -0.251953125,
"logps/chosen": -446.0,
"logps/rejected": -388.0,
"loss": 0.3943,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.1015625,
"rewards/margins": 8.125,
"rewards/rejected": -9.1875,
"step": 477
},
{
"epoch": 0.5865030674846625,
"grad_norm": 29.036598686433265,
"learning_rate": 1.6256198347107438e-06,
"logits/chosen": -0.041015625,
"logits/rejected": -0.2060546875,
"logps/chosen": -442.0,
"logps/rejected": -384.0,
"loss": 0.4365,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.15625,
"rewards/margins": 8.0625,
"rewards/rejected": -9.25,
"step": 478
},
{
"epoch": 0.5877300613496933,
"grad_norm": 35.33691552489953,
"learning_rate": 1.624793388429752e-06,
"logits/chosen": -0.03515625,
"logits/rejected": -0.294921875,
"logps/chosen": -384.0,
"logps/rejected": -368.0,
"loss": 0.4108,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -2.515625,
"rewards/margins": 6.9375,
"rewards/rejected": -9.4375,
"step": 479
},
{
"epoch": 0.588957055214724,
"grad_norm": 23.80285309086163,
"learning_rate": 1.6239669421487603e-06,
"logits/chosen": -0.07763671875,
"logits/rejected": -0.2119140625,
"logps/chosen": -386.0,
"logps/rejected": -368.0,
"loss": 0.2707,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -2.265625,
"rewards/margins": 7.78125,
"rewards/rejected": -10.0625,
"step": 480
},
{
"epoch": 0.5901840490797546,
"grad_norm": 35.80293196148993,
"learning_rate": 1.6231404958677685e-06,
"logits/chosen": -0.0673828125,
"logits/rejected": -0.1708984375,
"logps/chosen": -458.0,
"logps/rejected": -420.0,
"loss": 0.622,
"rewards/accuracies": 0.7734375,
"rewards/chosen": -2.453125,
"rewards/margins": 7.125,
"rewards/rejected": -9.5625,
"step": 481
},
{
"epoch": 0.5914110429447853,
"grad_norm": 34.65439060835562,
"learning_rate": 1.622314049586777e-06,
"logits/chosen": -0.0673828125,
"logits/rejected": -0.2421875,
"logps/chosen": -444.0,
"logps/rejected": -374.0,
"loss": 0.4303,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -2.1875,
"rewards/margins": 7.25,
"rewards/rejected": -9.4375,
"step": 482
},
{
"epoch": 0.592638036809816,
"grad_norm": 31.444826892788168,
"learning_rate": 1.6214876033057851e-06,
"logits/chosen": 0.095703125,
"logits/rejected": -0.0390625,
"logps/chosen": -378.0,
"logps/rejected": -354.0,
"loss": 0.3818,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -2.515625,
"rewards/margins": 7.1875,
"rewards/rejected": -9.6875,
"step": 483
},
{
"epoch": 0.5938650306748466,
"grad_norm": 27.51029947994524,
"learning_rate": 1.6206611570247933e-06,
"logits/chosen": 0.01904296875,
"logits/rejected": -0.12890625,
"logps/chosen": -402.0,
"logps/rejected": -364.0,
"loss": 0.3657,
"rewards/accuracies": 0.828125,
"rewards/chosen": -2.015625,
"rewards/margins": 6.78125,
"rewards/rejected": -8.8125,
"step": 484
},
{
"epoch": 0.5950920245398773,
"grad_norm": 26.154018775320584,
"learning_rate": 1.6198347107438015e-06,
"logits/chosen": 0.048095703125,
"logits/rejected": -0.09814453125,
"logps/chosen": -390.0,
"logps/rejected": -346.0,
"loss": 0.3404,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -2.34375,
"rewards/margins": 7.3125,
"rewards/rejected": -9.6875,
"step": 485
},
{
"epoch": 0.596319018404908,
"grad_norm": 34.37685592814866,
"learning_rate": 1.61900826446281e-06,
"logits/chosen": 0.0174560546875,
"logits/rejected": -0.123046875,
"logps/chosen": -436.0,
"logps/rejected": -378.0,
"loss": 0.4585,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.796875,
"rewards/margins": 7.40625,
"rewards/rejected": -9.1875,
"step": 486
},
{
"epoch": 0.5975460122699386,
"grad_norm": 27.47900846288338,
"learning_rate": 1.618181818181818e-06,
"logits/chosen": -0.0615234375,
"logits/rejected": -0.25,
"logps/chosen": -428.0,
"logps/rejected": -388.0,
"loss": 0.3123,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.4375,
"rewards/margins": 7.8125,
"rewards/rejected": -9.25,
"step": 487
},
{
"epoch": 0.5987730061349693,
"grad_norm": 36.13068312451185,
"learning_rate": 1.6173553719008263e-06,
"logits/chosen": -0.04541015625,
"logits/rejected": -0.11572265625,
"logps/chosen": -442.0,
"logps/rejected": -394.0,
"loss": 0.3745,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.1796875,
"rewards/margins": 7.5625,
"rewards/rejected": -8.75,
"step": 488
},
{
"epoch": 0.6,
"grad_norm": 26.73911141460869,
"learning_rate": 1.6165289256198347e-06,
"logits/chosen": 0.041015625,
"logits/rejected": -0.197265625,
"logps/chosen": -402.0,
"logps/rejected": -362.0,
"loss": 0.3578,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.703125,
"rewards/margins": 8.5,
"rewards/rejected": -9.1875,
"step": 489
},
{
"epoch": 0.6012269938650306,
"grad_norm": 36.382967520176734,
"learning_rate": 1.6157024793388429e-06,
"logits/chosen": 0.08251953125,
"logits/rejected": -0.140625,
"logps/chosen": -450.0,
"logps/rejected": -388.0,
"loss": 0.4165,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.4921875,
"rewards/margins": 7.46875,
"rewards/rejected": -8.9375,
"step": 490
},
{
"epoch": 0.6024539877300613,
"grad_norm": 27.49616128734612,
"learning_rate": 1.6148760330578513e-06,
"logits/chosen": 0.10595703125,
"logits/rejected": -0.1083984375,
"logps/chosen": -382.0,
"logps/rejected": -348.0,
"loss": 0.3207,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.71875,
"rewards/margins": 7.71875,
"rewards/rejected": -8.4375,
"step": 491
},
{
"epoch": 0.603680981595092,
"grad_norm": 31.229926152563383,
"learning_rate": 1.6140495867768595e-06,
"logits/chosen": 0.0120849609375,
"logits/rejected": -0.126953125,
"logps/chosen": -412.0,
"logps/rejected": -408.0,
"loss": 0.395,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.95703125,
"rewards/margins": 7.125,
"rewards/rejected": -8.0625,
"step": 492
},
{
"epoch": 0.6049079754601226,
"grad_norm": 36.65718970012216,
"learning_rate": 1.6132231404958676e-06,
"logits/chosen": 0.1748046875,
"logits/rejected": 0.0751953125,
"logps/chosen": -406.0,
"logps/rejected": -362.0,
"loss": 0.5391,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -1.1953125,
"rewards/margins": 6.3125,
"rewards/rejected": -7.5,
"step": 493
},
{
"epoch": 0.6061349693251534,
"grad_norm": 27.396936278667518,
"learning_rate": 1.6123966942148758e-06,
"logits/chosen": 0.0703125,
"logits/rejected": -0.123046875,
"logps/chosen": -438.0,
"logps/rejected": -354.0,
"loss": 0.348,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.263671875,
"rewards/margins": 7.8125,
"rewards/rejected": -7.5625,
"step": 494
},
{
"epoch": 0.6073619631901841,
"grad_norm": 29.785285979180106,
"learning_rate": 1.6115702479338842e-06,
"logits/chosen": 0.05810546875,
"logits/rejected": -0.0751953125,
"logps/chosen": -412.0,
"logps/rejected": -366.0,
"loss": 0.333,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.0908203125,
"rewards/margins": 7.71875,
"rewards/rejected": -7.625,
"step": 495
},
{
"epoch": 0.6085889570552148,
"grad_norm": 32.75051850367622,
"learning_rate": 1.6107438016528924e-06,
"logits/chosen": 0.0289306640625,
"logits/rejected": -0.177734375,
"logps/chosen": -392.0,
"logps/rejected": -338.0,
"loss": 0.4067,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.859375,
"rewards/margins": 6.65625,
"rewards/rejected": -7.53125,
"step": 496
},
{
"epoch": 0.6098159509202454,
"grad_norm": 35.788337904833995,
"learning_rate": 1.6099173553719008e-06,
"logits/chosen": 0.064453125,
"logits/rejected": -0.09716796875,
"logps/chosen": -414.0,
"logps/rejected": -378.0,
"loss": 0.5822,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -0.7578125,
"rewards/margins": 6.71875,
"rewards/rejected": -7.5,
"step": 497
},
{
"epoch": 0.6110429447852761,
"grad_norm": 22.907226961366156,
"learning_rate": 1.609090909090909e-06,
"logits/chosen": -0.07666015625,
"logits/rejected": -0.2431640625,
"logps/chosen": -408.0,
"logps/rejected": -378.0,
"loss": 0.2661,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 0.27734375,
"rewards/margins": 7.96875,
"rewards/rejected": -7.71875,
"step": 498
},
{
"epoch": 0.6122699386503068,
"grad_norm": 34.24843898159494,
"learning_rate": 1.6082644628099174e-06,
"logits/chosen": 0.06591796875,
"logits/rejected": -0.15234375,
"logps/chosen": -434.0,
"logps/rejected": -364.0,
"loss": 0.3593,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 0.09423828125,
"rewards/margins": 7.4375,
"rewards/rejected": -7.34375,
"step": 499
},
{
"epoch": 0.6134969325153374,
"grad_norm": 28.722358927789386,
"learning_rate": 1.6074380165289256e-06,
"logits/chosen": 0.0517578125,
"logits/rejected": -0.06494140625,
"logps/chosen": -430.0,
"logps/rejected": -354.0,
"loss": 0.4054,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.036376953125,
"rewards/margins": 7.875,
"rewards/rejected": -7.90625,
"step": 500
},
{
"epoch": 0.6147239263803681,
"grad_norm": 34.150010229312755,
"learning_rate": 1.6066115702479338e-06,
"logits/chosen": -0.0091552734375,
"logits/rejected": -0.14453125,
"logps/chosen": -418.0,
"logps/rejected": -364.0,
"loss": 0.5046,
"rewards/accuracies": 0.8203125,
"rewards/chosen": 0.34375,
"rewards/margins": 7.84375,
"rewards/rejected": -7.5,
"step": 501
},
{
"epoch": 0.6159509202453988,
"grad_norm": 26.403907755376803,
"learning_rate": 1.605785123966942e-06,
"logits/chosen": 0.01611328125,
"logits/rejected": -0.255859375,
"logps/chosen": -396.0,
"logps/rejected": -354.0,
"loss": 0.3918,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.1611328125,
"rewards/margins": 8.25,
"rewards/rejected": -8.4375,
"step": 502
},
{
"epoch": 0.6171779141104294,
"grad_norm": 24.760791882275143,
"learning_rate": 1.6049586776859504e-06,
"logits/chosen": 0.2294921875,
"logits/rejected": 0.039306640625,
"logps/chosen": -344.0,
"logps/rejected": -338.0,
"loss": 0.2949,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.69140625,
"rewards/margins": 7.1875,
"rewards/rejected": -7.875,
"step": 503
},
{
"epoch": 0.6184049079754601,
"grad_norm": 23.71665205403551,
"learning_rate": 1.6041322314049586e-06,
"logits/chosen": -0.0230712890625,
"logits/rejected": -0.197265625,
"logps/chosen": -396.0,
"logps/rejected": -354.0,
"loss": 0.3141,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -0.921875,
"rewards/margins": 6.75,
"rewards/rejected": -7.65625,
"step": 504
},
{
"epoch": 0.6196319018404908,
"grad_norm": 38.50109225572899,
"learning_rate": 1.603305785123967e-06,
"logits/chosen": -0.04296875,
"logits/rejected": -0.263671875,
"logps/chosen": -442.0,
"logps/rejected": -420.0,
"loss": 0.4973,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.4375,
"rewards/margins": 7.34375,
"rewards/rejected": -8.75,
"step": 505
},
{
"epoch": 0.6208588957055214,
"grad_norm": 71.7214412137413,
"learning_rate": 1.6024793388429752e-06,
"logits/chosen": 0.11181640625,
"logits/rejected": -0.2001953125,
"logps/chosen": -436.0,
"logps/rejected": -352.0,
"loss": 0.3839,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.71875,
"rewards/margins": 7.59375,
"rewards/rejected": -8.3125,
"step": 506
},
{
"epoch": 0.6220858895705521,
"grad_norm": 21.732522573710003,
"learning_rate": 1.6016528925619833e-06,
"logits/chosen": -0.003875732421875,
"logits/rejected": -0.1103515625,
"logps/chosen": -400.0,
"logps/rejected": -332.0,
"loss": 0.1964,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -0.53125,
"rewards/margins": 7.96875,
"rewards/rejected": -8.5,
"step": 507
},
{
"epoch": 0.6233128834355828,
"grad_norm": 30.43220654300823,
"learning_rate": 1.6008264462809917e-06,
"logits/chosen": 0.1923828125,
"logits/rejected": 0.01165771484375,
"logps/chosen": -404.0,
"logps/rejected": -332.0,
"loss": 0.3349,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.828125,
"rewards/margins": 7.0625,
"rewards/rejected": -7.875,
"step": 508
},
{
"epoch": 0.6245398773006134,
"grad_norm": 35.34543973547442,
"learning_rate": 1.6e-06,
"logits/chosen": 0.01458740234375,
"logits/rejected": -0.2177734375,
"logps/chosen": -480.0,
"logps/rejected": -406.0,
"loss": 0.6533,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.515625,
"rewards/margins": 8.75,
"rewards/rejected": -8.25,
"step": 509
},
{
"epoch": 0.6257668711656442,
"grad_norm": 25.003483454597998,
"learning_rate": 1.5991735537190081e-06,
"logits/chosen": -0.06103515625,
"logits/rejected": -0.2470703125,
"logps/chosen": -374.0,
"logps/rejected": -326.0,
"loss": 0.3203,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -1.0,
"rewards/margins": 6.78125,
"rewards/rejected": -7.78125,
"step": 510
},
{
"epoch": 0.6269938650306749,
"grad_norm": 30.436670043501266,
"learning_rate": 1.5983471074380163e-06,
"logits/chosen": -0.0908203125,
"logits/rejected": -0.2138671875,
"logps/chosen": -408.0,
"logps/rejected": -378.0,
"loss": 0.3842,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.423828125,
"rewards/margins": 7.90625,
"rewards/rejected": -8.3125,
"step": 511
},
{
"epoch": 0.6282208588957056,
"grad_norm": 32.41055767899847,
"learning_rate": 1.5975206611570247e-06,
"logits/chosen": 0.134765625,
"logits/rejected": -0.00994873046875,
"logps/chosen": -398.0,
"logps/rejected": -412.0,
"loss": 0.5097,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.40625,
"rewards/margins": 6.25,
"rewards/rejected": -7.65625,
"step": 512
},
{
"epoch": 0.6294478527607362,
"grad_norm": 30.869411742460052,
"learning_rate": 1.5966942148760329e-06,
"logits/chosen": 0.13671875,
"logits/rejected": 0.00860595703125,
"logps/chosen": -394.0,
"logps/rejected": -340.0,
"loss": 0.4822,
"rewards/accuracies": 0.796875,
"rewards/chosen": -0.8671875,
"rewards/margins": 7.40625,
"rewards/rejected": -8.25,
"step": 513
},
{
"epoch": 0.6306748466257669,
"grad_norm": 27.57757346290667,
"learning_rate": 1.5958677685950413e-06,
"logits/chosen": 0.158203125,
"logits/rejected": 0.004974365234375,
"logps/chosen": -346.0,
"logps/rejected": -314.0,
"loss": 0.2937,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.7578125,
"rewards/margins": 6.96875,
"rewards/rejected": -8.75,
"step": 514
},
{
"epoch": 0.6319018404907976,
"grad_norm": 30.371864264428428,
"learning_rate": 1.5950413223140495e-06,
"logits/chosen": 0.130859375,
"logits/rejected": -0.0194091796875,
"logps/chosen": -366.0,
"logps/rejected": -374.0,
"loss": 0.3528,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.890625,
"rewards/margins": 6.84375,
"rewards/rejected": -8.6875,
"step": 515
},
{
"epoch": 0.6331288343558282,
"grad_norm": 25.700607667521123,
"learning_rate": 1.5942148760330579e-06,
"logits/chosen": 0.0927734375,
"logits/rejected": -0.020263671875,
"logps/chosen": -386.0,
"logps/rejected": -358.0,
"loss": 0.2479,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.71875,
"rewards/margins": 7.0625,
"rewards/rejected": -8.75,
"step": 516
},
{
"epoch": 0.6343558282208589,
"grad_norm": 35.013987422735795,
"learning_rate": 1.593388429752066e-06,
"logits/chosen": 0.138671875,
"logits/rejected": -0.0169677734375,
"logps/chosen": -410.0,
"logps/rejected": -366.0,
"loss": 0.5313,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -1.59375,
"rewards/margins": 6.625,
"rewards/rejected": -8.25,
"step": 517
},
{
"epoch": 0.6355828220858896,
"grad_norm": 25.25730204534431,
"learning_rate": 1.5925619834710745e-06,
"logits/chosen": 0.01300048828125,
"logits/rejected": -0.0869140625,
"logps/chosen": -436.0,
"logps/rejected": -376.0,
"loss": 0.2264,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.77734375,
"rewards/margins": 8.0625,
"rewards/rejected": -8.8125,
"step": 518
},
{
"epoch": 0.6368098159509202,
"grad_norm": 33.20839003769473,
"learning_rate": 1.5917355371900824e-06,
"logits/chosen": 0.03564453125,
"logits/rejected": -0.107421875,
"logps/chosen": -408.0,
"logps/rejected": -372.0,
"loss": 0.3779,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.8671875,
"rewards/margins": 7.40625,
"rewards/rejected": -9.25,
"step": 519
},
{
"epoch": 0.6380368098159509,
"grad_norm": 27.098797675737742,
"learning_rate": 1.5909090909090908e-06,
"logits/chosen": 0.01080322265625,
"logits/rejected": -0.2197265625,
"logps/chosen": -392.0,
"logps/rejected": -370.0,
"loss": 0.3268,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.515625,
"rewards/margins": 8.5,
"rewards/rejected": -10.0625,
"step": 520
},
{
"epoch": 0.6392638036809816,
"grad_norm": 25.557455564203316,
"learning_rate": 1.590082644628099e-06,
"logits/chosen": 0.2158203125,
"logits/rejected": 0.0673828125,
"logps/chosen": -446.0,
"logps/rejected": -400.0,
"loss": 0.3273,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -1.7734375,
"rewards/margins": 8.375,
"rewards/rejected": -10.125,
"step": 521
},
{
"epoch": 0.6404907975460122,
"grad_norm": 26.296777147407337,
"learning_rate": 1.5892561983471074e-06,
"logits/chosen": -0.00885009765625,
"logits/rejected": -0.158203125,
"logps/chosen": -456.0,
"logps/rejected": -398.0,
"loss": 0.3643,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -2.34375,
"rewards/margins": 8.625,
"rewards/rejected": -11.0,
"step": 522
},
{
"epoch": 0.6417177914110429,
"grad_norm": 34.909791507886766,
"learning_rate": 1.5884297520661156e-06,
"logits/chosen": 0.07177734375,
"logits/rejected": -0.08447265625,
"logps/chosen": -402.0,
"logps/rejected": -372.0,
"loss": 0.5212,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -3.34375,
"rewards/margins": 6.65625,
"rewards/rejected": -10.0,
"step": 523
},
{
"epoch": 0.6429447852760736,
"grad_norm": 35.306110095538884,
"learning_rate": 1.5876033057851238e-06,
"logits/chosen": 0.09619140625,
"logits/rejected": -0.107421875,
"logps/chosen": -464.0,
"logps/rejected": -406.0,
"loss": 0.4883,
"rewards/accuracies": 0.828125,
"rewards/chosen": -3.65625,
"rewards/margins": 6.59375,
"rewards/rejected": -10.25,
"step": 524
},
{
"epoch": 0.6441717791411042,
"grad_norm": 42.08361150244396,
"learning_rate": 1.5867768595041322e-06,
"logits/chosen": 0.12353515625,
"logits/rejected": 0.07373046875,
"logps/chosen": -434.0,
"logps/rejected": -412.0,
"loss": 0.6614,
"rewards/accuracies": 0.7578125,
"rewards/chosen": -4.125,
"rewards/margins": 5.78125,
"rewards/rejected": -9.9375,
"step": 525
},
{
"epoch": 0.645398773006135,
"grad_norm": 30.66385671655035,
"learning_rate": 1.5859504132231404e-06,
"logits/chosen": 0.0888671875,
"logits/rejected": -0.06005859375,
"logps/chosen": -430.0,
"logps/rejected": -386.0,
"loss": 0.3992,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -3.390625,
"rewards/margins": 7.3125,
"rewards/rejected": -10.6875,
"step": 526
},
{
"epoch": 0.6466257668711657,
"grad_norm": 29.996892955815646,
"learning_rate": 1.5851239669421488e-06,
"logits/chosen": 0.1611328125,
"logits/rejected": -0.061279296875,
"logps/chosen": -466.0,
"logps/rejected": -380.0,
"loss": 0.3949,
"rewards/accuracies": 0.84375,
"rewards/chosen": -3.59375,
"rewards/margins": 7.21875,
"rewards/rejected": -10.8125,
"step": 527
},
{
"epoch": 0.6478527607361964,
"grad_norm": 24.00032978466971,
"learning_rate": 1.5842975206611568e-06,
"logits/chosen": -0.00897216796875,
"logits/rejected": -0.19140625,
"logps/chosen": -398.0,
"logps/rejected": -374.0,
"loss": 0.3277,
"rewards/accuracies": 0.859375,
"rewards/chosen": -3.59375,
"rewards/margins": 7.59375,
"rewards/rejected": -11.1875,
"step": 528
},
{
"epoch": 0.649079754601227,
"grad_norm": 29.084542618150397,
"learning_rate": 1.5834710743801652e-06,
"logits/chosen": 0.06396484375,
"logits/rejected": -0.1142578125,
"logps/chosen": -384.0,
"logps/rejected": -386.0,
"loss": 0.4317,
"rewards/accuracies": 0.828125,
"rewards/chosen": -3.578125,
"rewards/margins": 7.1875,
"rewards/rejected": -10.75,
"step": 529
},
{
"epoch": 0.6503067484662577,
"grad_norm": 25.801081390477748,
"learning_rate": 1.5826446280991734e-06,
"logits/chosen": 0.1123046875,
"logits/rejected": -0.01495361328125,
"logps/chosen": -402.0,
"logps/rejected": -400.0,
"loss": 0.2661,
"rewards/accuracies": 0.875,
"rewards/chosen": -3.28125,
"rewards/margins": 7.6875,
"rewards/rejected": -10.9375,
"step": 530
},
{
"epoch": 0.6515337423312884,
"grad_norm": 23.866451346648457,
"learning_rate": 1.5818181818181818e-06,
"logits/chosen": 0.037841796875,
"logits/rejected": -0.1416015625,
"logps/chosen": -426.0,
"logps/rejected": -372.0,
"loss": 0.2961,
"rewards/accuracies": 0.84375,
"rewards/chosen": -3.40625,
"rewards/margins": 7.3125,
"rewards/rejected": -10.75,
"step": 531
},
{
"epoch": 0.652760736196319,
"grad_norm": 27.455946324648277,
"learning_rate": 1.58099173553719e-06,
"logits/chosen": 0.1611328125,
"logits/rejected": 0.018310546875,
"logps/chosen": -426.0,
"logps/rejected": -378.0,
"loss": 0.3709,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -3.375,
"rewards/margins": 6.875,
"rewards/rejected": -10.25,
"step": 532
},
{
"epoch": 0.6539877300613497,
"grad_norm": 25.813940321838846,
"learning_rate": 1.5801652892561984e-06,
"logits/chosen": -0.030517578125,
"logits/rejected": -0.2333984375,
"logps/chosen": -442.0,
"logps/rejected": -396.0,
"loss": 0.3182,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -2.203125,
"rewards/margins": 8.375,
"rewards/rejected": -10.5625,
"step": 533
},
{
"epoch": 0.6552147239263804,
"grad_norm": 25.906290815392918,
"learning_rate": 1.5793388429752065e-06,
"logits/chosen": 0.1259765625,
"logits/rejected": 0.004913330078125,
"logps/chosen": -404.0,
"logps/rejected": -374.0,
"loss": 0.3372,
"rewards/accuracies": 0.84375,
"rewards/chosen": -3.0625,
"rewards/margins": 6.875,
"rewards/rejected": -9.9375,
"step": 534
},
{
"epoch": 0.656441717791411,
"grad_norm": 32.230057629912686,
"learning_rate": 1.578512396694215e-06,
"logits/chosen": 0.0155029296875,
"logits/rejected": -0.0888671875,
"logps/chosen": -408.0,
"logps/rejected": -384.0,
"loss": 0.3744,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -3.671875,
"rewards/margins": 6.96875,
"rewards/rejected": -10.625,
"step": 535
},
{
"epoch": 0.6576687116564417,
"grad_norm": 21.470589864019242,
"learning_rate": 1.5776859504132231e-06,
"logits/chosen": 0.056884765625,
"logits/rejected": -0.04150390625,
"logps/chosen": -420.0,
"logps/rejected": -364.0,
"loss": 0.2251,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -1.921875,
"rewards/margins": 8.1875,
"rewards/rejected": -10.125,
"step": 536
},
{
"epoch": 0.6588957055214724,
"grad_norm": 40.221164894996356,
"learning_rate": 1.5768595041322313e-06,
"logits/chosen": 0.10400390625,
"logits/rejected": -0.055419921875,
"logps/chosen": -410.0,
"logps/rejected": -348.0,
"loss": 0.6504,
"rewards/accuracies": 0.75,
"rewards/chosen": -2.96875,
"rewards/margins": 5.71875,
"rewards/rejected": -8.6875,
"step": 537
},
{
"epoch": 0.660122699386503,
"grad_norm": 32.42512557852992,
"learning_rate": 1.5760330578512395e-06,
"logits/chosen": 0.10107421875,
"logits/rejected": -0.0693359375,
"logps/chosen": -426.0,
"logps/rejected": -394.0,
"loss": 0.5261,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.6328125,
"rewards/margins": 7.71875,
"rewards/rejected": -9.375,
"step": 538
},
{
"epoch": 0.6613496932515337,
"grad_norm": 29.534640861584272,
"learning_rate": 1.575206611570248e-06,
"logits/chosen": 0.11474609375,
"logits/rejected": -0.004486083984375,
"logps/chosen": -422.0,
"logps/rejected": -378.0,
"loss": 0.5435,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.34375,
"rewards/margins": 6.84375,
"rewards/rejected": -8.1875,
"step": 539
},
{
"epoch": 0.6625766871165644,
"grad_norm": 31.036305365350792,
"learning_rate": 1.574380165289256e-06,
"logits/chosen": 0.1376953125,
"logits/rejected": -0.033447265625,
"logps/chosen": -418.0,
"logps/rejected": -360.0,
"loss": 0.5134,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.421875,
"rewards/margins": 7.25,
"rewards/rejected": -8.6875,
"step": 540
},
{
"epoch": 0.6638036809815951,
"grad_norm": 33.567702018570266,
"learning_rate": 1.5735537190082645e-06,
"logits/chosen": 0.1337890625,
"logits/rejected": 0.03759765625,
"logps/chosen": -412.0,
"logps/rejected": -384.0,
"loss": 0.405,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.8125,
"rewards/margins": 6.625,
"rewards/rejected": -8.4375,
"step": 541
},
{
"epoch": 0.6650306748466258,
"grad_norm": 27.257076226417922,
"learning_rate": 1.5727272727272727e-06,
"logits/chosen": 0.0771484375,
"logits/rejected": -0.009521484375,
"logps/chosen": -376.0,
"logps/rejected": -348.0,
"loss": 0.4032,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.0078125,
"rewards/margins": 6.8125,
"rewards/rejected": -7.8125,
"step": 542
},
{
"epoch": 0.6662576687116565,
"grad_norm": 29.161632484611417,
"learning_rate": 1.5719008264462809e-06,
"logits/chosen": 0.0245361328125,
"logits/rejected": -0.1640625,
"logps/chosen": -468.0,
"logps/rejected": -378.0,
"loss": 0.3993,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.1884765625,
"rewards/margins": 7.6875,
"rewards/rejected": -7.875,
"step": 543
},
{
"epoch": 0.6674846625766871,
"grad_norm": 34.520687337307265,
"learning_rate": 1.5710743801652893e-06,
"logits/chosen": 0.052734375,
"logits/rejected": -0.08935546875,
"logps/chosen": -394.0,
"logps/rejected": -336.0,
"loss": 0.5406,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.078125,
"rewards/margins": 6.59375,
"rewards/rejected": -7.6875,
"step": 544
},
{
"epoch": 0.6687116564417178,
"grad_norm": 33.97863952629742,
"learning_rate": 1.5702479338842975e-06,
"logits/chosen": -0.006134033203125,
"logits/rejected": -0.1767578125,
"logps/chosen": -476.0,
"logps/rejected": -392.0,
"loss": 0.4504,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.71875,
"rewards/margins": 6.875,
"rewards/rejected": -7.59375,
"step": 545
},
{
"epoch": 0.6699386503067485,
"grad_norm": 32.39648902259067,
"learning_rate": 1.5694214876033057e-06,
"logits/chosen": 0.11376953125,
"logits/rejected": 0.0107421875,
"logps/chosen": -390.0,
"logps/rejected": -358.0,
"loss": 0.4618,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.8046875,
"rewards/margins": 6.75,
"rewards/rejected": -7.5625,
"step": 546
},
{
"epoch": 0.6711656441717792,
"grad_norm": 26.434328780260252,
"learning_rate": 1.5685950413223138e-06,
"logits/chosen": 0.05908203125,
"logits/rejected": -0.1279296875,
"logps/chosen": -398.0,
"logps/rejected": -330.0,
"loss": 0.3104,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.34375,
"rewards/margins": 6.875,
"rewards/rejected": -7.21875,
"step": 547
},
{
"epoch": 0.6723926380368098,
"grad_norm": 36.794045043015835,
"learning_rate": 1.5677685950413222e-06,
"logits/chosen": -0.0247802734375,
"logits/rejected": -0.2275390625,
"logps/chosen": -414.0,
"logps/rejected": -370.0,
"loss": 0.3867,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.038818359375,
"rewards/margins": 6.375,
"rewards/rejected": -6.40625,
"step": 548
},
{
"epoch": 0.6736196319018405,
"grad_norm": 31.042635603273403,
"learning_rate": 1.5669421487603304e-06,
"logits/chosen": 0.08740234375,
"logits/rejected": -0.11669921875,
"logps/chosen": -426.0,
"logps/rejected": -358.0,
"loss": 0.3804,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.4765625,
"rewards/margins": 6.28125,
"rewards/rejected": -6.75,
"step": 549
},
{
"epoch": 0.6748466257668712,
"grad_norm": 28.58856278951386,
"learning_rate": 1.5661157024793388e-06,
"logits/chosen": 0.01904296875,
"logits/rejected": -0.048583984375,
"logps/chosen": -414.0,
"logps/rejected": -346.0,
"loss": 0.4403,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.09375,
"rewards/margins": 6.0,
"rewards/rejected": -7.09375,
"step": 550
},
{
"epoch": 0.6760736196319018,
"grad_norm": 25.362529579052058,
"learning_rate": 1.565289256198347e-06,
"logits/chosen": 0.1103515625,
"logits/rejected": -0.009765625,
"logps/chosen": -418.0,
"logps/rejected": -356.0,
"loss": 0.373,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 0.287109375,
"rewards/margins": 6.90625,
"rewards/rejected": -6.625,
"step": 551
},
{
"epoch": 0.6773006134969325,
"grad_norm": 27.078129855159084,
"learning_rate": 1.5644628099173554e-06,
"logits/chosen": 0.0172119140625,
"logits/rejected": -0.1259765625,
"logps/chosen": -426.0,
"logps/rejected": -372.0,
"loss": 0.3205,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.173828125,
"rewards/margins": 6.59375,
"rewards/rejected": -6.78125,
"step": 552
},
{
"epoch": 0.6785276073619632,
"grad_norm": 30.3677321608354,
"learning_rate": 1.5636363636363636e-06,
"logits/chosen": 0.054931640625,
"logits/rejected": -0.08984375,
"logps/chosen": -374.0,
"logps/rejected": -352.0,
"loss": 0.4096,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.953125,
"rewards/margins": 5.65625,
"rewards/rejected": -6.625,
"step": 553
},
{
"epoch": 0.6797546012269938,
"grad_norm": 31.118820825566615,
"learning_rate": 1.562809917355372e-06,
"logits/chosen": 0.115234375,
"logits/rejected": -0.08056640625,
"logps/chosen": -444.0,
"logps/rejected": -344.0,
"loss": 0.3757,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.1181640625,
"rewards/margins": 6.4375,
"rewards/rejected": -6.5625,
"step": 554
},
{
"epoch": 0.6809815950920245,
"grad_norm": 30.25830591807912,
"learning_rate": 1.56198347107438e-06,
"logits/chosen": 0.236328125,
"logits/rejected": 0.1240234375,
"logps/chosen": -374.0,
"logps/rejected": -328.0,
"loss": 0.383,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.68359375,
"rewards/margins": 6.375,
"rewards/rejected": -7.0625,
"step": 555
},
{
"epoch": 0.6822085889570552,
"grad_norm": 23.74286637882293,
"learning_rate": 1.5611570247933884e-06,
"logits/chosen": 0.0859375,
"logits/rejected": -0.130859375,
"logps/chosen": -432.0,
"logps/rejected": -368.0,
"loss": 0.2854,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 0.1708984375,
"rewards/margins": 7.71875,
"rewards/rejected": -7.5625,
"step": 556
},
{
"epoch": 0.6834355828220859,
"grad_norm": 28.47005861846514,
"learning_rate": 1.5603305785123966e-06,
"logits/chosen": 0.08251953125,
"logits/rejected": -0.1376953125,
"logps/chosen": -408.0,
"logps/rejected": -356.0,
"loss": 0.376,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.5390625,
"rewards/margins": 6.71875,
"rewards/rejected": -7.25,
"step": 557
},
{
"epoch": 0.6846625766871166,
"grad_norm": 23.800569126231828,
"learning_rate": 1.559504132231405e-06,
"logits/chosen": 0.11865234375,
"logits/rejected": -0.049560546875,
"logps/chosen": -384.0,
"logps/rejected": -350.0,
"loss": 0.3018,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.98828125,
"rewards/margins": 7.21875,
"rewards/rejected": -8.1875,
"step": 558
},
{
"epoch": 0.6858895705521473,
"grad_norm": 32.26680257778667,
"learning_rate": 1.5586776859504132e-06,
"logits/chosen": -0.04052734375,
"logits/rejected": -0.1240234375,
"logps/chosen": -396.0,
"logps/rejected": -364.0,
"loss": 0.4383,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.0703125,
"rewards/margins": 6.71875,
"rewards/rejected": -7.78125,
"step": 559
},
{
"epoch": 0.6871165644171779,
"grad_norm": 22.365677248331806,
"learning_rate": 1.5578512396694213e-06,
"logits/chosen": -0.146484375,
"logits/rejected": -0.279296875,
"logps/chosen": -402.0,
"logps/rejected": -352.0,
"loss": 0.2877,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -0.408203125,
"rewards/margins": 8.125,
"rewards/rejected": -8.5,
"step": 560
},
{
"epoch": 0.6883435582822086,
"grad_norm": 24.634630895620287,
"learning_rate": 1.5570247933884297e-06,
"logits/chosen": 0.0283203125,
"logits/rejected": -0.14453125,
"logps/chosen": -370.0,
"logps/rejected": -326.0,
"loss": 0.2368,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -0.8046875,
"rewards/margins": 7.53125,
"rewards/rejected": -8.375,
"step": 561
},
{
"epoch": 0.6895705521472393,
"grad_norm": 22.374160429629676,
"learning_rate": 1.556198347107438e-06,
"logits/chosen": 0.171875,
"logits/rejected": -0.03662109375,
"logps/chosen": -390.0,
"logps/rejected": -352.0,
"loss": 0.2198,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -1.5078125,
"rewards/margins": 7.3125,
"rewards/rejected": -8.8125,
"step": 562
},
{
"epoch": 0.69079754601227,
"grad_norm": 31.54406859623512,
"learning_rate": 1.5553719008264463e-06,
"logits/chosen": -0.0264892578125,
"logits/rejected": -0.1787109375,
"logps/chosen": -408.0,
"logps/rejected": -400.0,
"loss": 0.4203,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.333984375,
"rewards/margins": 8.375,
"rewards/rejected": -8.75,
"step": 563
},
{
"epoch": 0.6920245398773006,
"grad_norm": 24.058898026260223,
"learning_rate": 1.5545454545454543e-06,
"logits/chosen": -0.008544921875,
"logits/rejected": -0.12255859375,
"logps/chosen": -408.0,
"logps/rejected": -364.0,
"loss": 0.351,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.40625,
"rewards/margins": 6.96875,
"rewards/rejected": -8.375,
"step": 564
},
{
"epoch": 0.6932515337423313,
"grad_norm": 29.340521512150396,
"learning_rate": 1.5537190082644627e-06,
"logits/chosen": 0.035400390625,
"logits/rejected": -0.15234375,
"logps/chosen": -420.0,
"logps/rejected": -374.0,
"loss": 0.5463,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.9140625,
"rewards/margins": 6.5,
"rewards/rejected": -8.4375,
"step": 565
},
{
"epoch": 0.694478527607362,
"grad_norm": 32.21389471809945,
"learning_rate": 1.552892561983471e-06,
"logits/chosen": 0.0400390625,
"logits/rejected": -0.05419921875,
"logps/chosen": -434.0,
"logps/rejected": -364.0,
"loss": 0.342,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.6640625,
"rewards/margins": 7.5625,
"rewards/rejected": -8.1875,
"step": 566
},
{
"epoch": 0.6957055214723926,
"grad_norm": 21.917368910045532,
"learning_rate": 1.5520661157024793e-06,
"logits/chosen": 0.1494140625,
"logits/rejected": 0.0191650390625,
"logps/chosen": -336.0,
"logps/rejected": -306.0,
"loss": 0.2178,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -1.734375,
"rewards/margins": 6.46875,
"rewards/rejected": -8.1875,
"step": 567
},
{
"epoch": 0.6969325153374233,
"grad_norm": 29.04560621007937,
"learning_rate": 1.5512396694214875e-06,
"logits/chosen": -0.01556396484375,
"logits/rejected": -0.059326171875,
"logps/chosen": -402.0,
"logps/rejected": -352.0,
"loss": 0.367,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.0625,
"rewards/margins": 7.0625,
"rewards/rejected": -8.125,
"step": 568
},
{
"epoch": 0.698159509202454,
"grad_norm": 29.65708766378445,
"learning_rate": 1.5504132231404959e-06,
"logits/chosen": 0.068359375,
"logits/rejected": -0.080078125,
"logps/chosen": -406.0,
"logps/rejected": -336.0,
"loss": 0.3189,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.6796875,
"rewards/margins": 6.46875,
"rewards/rejected": -8.125,
"step": 569
},
{
"epoch": 0.6993865030674846,
"grad_norm": 31.47023159862534,
"learning_rate": 1.549586776859504e-06,
"logits/chosen": -0.1083984375,
"logits/rejected": -0.232421875,
"logps/chosen": -422.0,
"logps/rejected": -370.0,
"loss": 0.2566,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.66796875,
"rewards/margins": 8.0,
"rewards/rejected": -8.6875,
"step": 570
},
{
"epoch": 0.7006134969325153,
"grad_norm": 29.00025801151588,
"learning_rate": 1.5487603305785125e-06,
"logits/chosen": 0.0380859375,
"logits/rejected": -0.0849609375,
"logps/chosen": -350.0,
"logps/rejected": -338.0,
"loss": 0.3851,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.7578125,
"rewards/margins": 6.3125,
"rewards/rejected": -8.0625,
"step": 571
},
{
"epoch": 0.701840490797546,
"grad_norm": 28.43874652292678,
"learning_rate": 1.5479338842975207e-06,
"logits/chosen": 0.0478515625,
"logits/rejected": -0.10400390625,
"logps/chosen": -406.0,
"logps/rejected": -402.0,
"loss": 0.2895,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.61328125,
"rewards/margins": 8.1875,
"rewards/rejected": -8.8125,
"step": 572
},
{
"epoch": 0.7030674846625767,
"grad_norm": 31.974101424964097,
"learning_rate": 1.5471074380165289e-06,
"logits/chosen": 0.08251953125,
"logits/rejected": -0.043701171875,
"logps/chosen": -414.0,
"logps/rejected": -372.0,
"loss": 0.5633,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -2.15625,
"rewards/margins": 7.0625,
"rewards/rejected": -9.25,
"step": 573
},
{
"epoch": 0.7042944785276074,
"grad_norm": 31.879449258141157,
"learning_rate": 1.546280991735537e-06,
"logits/chosen": -0.05322265625,
"logits/rejected": -0.185546875,
"logps/chosen": -346.0,
"logps/rejected": -346.0,
"loss": 0.3867,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.5234375,
"rewards/margins": 7.5,
"rewards/rejected": -9.0625,
"step": 574
},
{
"epoch": 0.7055214723926381,
"grad_norm": 29.486616809481717,
"learning_rate": 1.5454545454545454e-06,
"logits/chosen": -0.1171875,
"logits/rejected": -0.2734375,
"logps/chosen": -430.0,
"logps/rejected": -414.0,
"loss": 0.2805,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.75390625,
"rewards/margins": 9.25,
"rewards/rejected": -10.0625,
"step": 575
},
{
"epoch": 0.7067484662576687,
"grad_norm": 20.384749054808264,
"learning_rate": 1.5446280991735536e-06,
"logits/chosen": 0.032958984375,
"logits/rejected": -0.1767578125,
"logps/chosen": -402.0,
"logps/rejected": -368.0,
"loss": 0.1897,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -0.58203125,
"rewards/margins": 9.4375,
"rewards/rejected": -10.0,
"step": 576
},
{
"epoch": 0.7079754601226994,
"grad_norm": 32.821988719859526,
"learning_rate": 1.5438016528925618e-06,
"logits/chosen": 0.0859375,
"logits/rejected": -0.031494140625,
"logps/chosen": -384.0,
"logps/rejected": -360.0,
"loss": 0.4854,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.8671875,
"rewards/margins": 9.0,
"rewards/rejected": -9.875,
"step": 577
},
{
"epoch": 0.7092024539877301,
"grad_norm": 32.009542067645974,
"learning_rate": 1.5429752066115702e-06,
"logits/chosen": -0.06787109375,
"logits/rejected": -0.21484375,
"logps/chosen": -440.0,
"logps/rejected": -382.0,
"loss": 0.4126,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.0390625,
"rewards/margins": 9.5,
"rewards/rejected": -10.5,
"step": 578
},
{
"epoch": 0.7104294478527607,
"grad_norm": 36.86286983429948,
"learning_rate": 1.5421487603305784e-06,
"logits/chosen": -0.025146484375,
"logits/rejected": -0.12255859375,
"logps/chosen": -466.0,
"logps/rejected": -384.0,
"loss": 0.522,
"rewards/accuracies": 0.765625,
"rewards/chosen": -3.21875,
"rewards/margins": 6.9375,
"rewards/rejected": -10.1875,
"step": 579
},
{
"epoch": 0.7116564417177914,
"grad_norm": 33.83544892119213,
"learning_rate": 1.5413223140495868e-06,
"logits/chosen": 0.06494140625,
"logits/rejected": -0.1142578125,
"logps/chosen": -408.0,
"logps/rejected": -400.0,
"loss": 0.2903,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.96875,
"rewards/margins": 9.0,
"rewards/rejected": -11.0,
"step": 580
},
{
"epoch": 0.7128834355828221,
"grad_norm": 26.31261089547377,
"learning_rate": 1.540495867768595e-06,
"logits/chosen": -0.05078125,
"logits/rejected": -0.2490234375,
"logps/chosen": -398.0,
"logps/rejected": -364.0,
"loss": 0.2563,
"rewards/accuracies": 0.890625,
"rewards/chosen": -1.6484375,
"rewards/margins": 9.125,
"rewards/rejected": -10.8125,
"step": 581
},
{
"epoch": 0.7141104294478527,
"grad_norm": 32.303625869068206,
"learning_rate": 1.5396694214876032e-06,
"logits/chosen": 0.1953125,
"logits/rejected": -0.0306396484375,
"logps/chosen": -426.0,
"logps/rejected": -382.0,
"loss": 0.3773,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -2.421875,
"rewards/margins": 7.78125,
"rewards/rejected": -10.1875,
"step": 582
},
{
"epoch": 0.7153374233128834,
"grad_norm": 31.249678572637528,
"learning_rate": 1.5388429752066114e-06,
"logits/chosen": -0.035888671875,
"logits/rejected": -0.1845703125,
"logps/chosen": -416.0,
"logps/rejected": -392.0,
"loss": 0.3792,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.9296875,
"rewards/margins": 8.1875,
"rewards/rejected": -10.125,
"step": 583
},
{
"epoch": 0.7165644171779141,
"grad_norm": 35.19712562385684,
"learning_rate": 1.5380165289256198e-06,
"logits/chosen": 0.07080078125,
"logits/rejected": 0.01214599609375,
"logps/chosen": -404.0,
"logps/rejected": -420.0,
"loss": 0.5182,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -2.984375,
"rewards/margins": 6.21875,
"rewards/rejected": -9.25,
"step": 584
},
{
"epoch": 0.7177914110429447,
"grad_norm": 42.163190326894934,
"learning_rate": 1.537190082644628e-06,
"logits/chosen": 0.162109375,
"logits/rejected": 0.04638671875,
"logps/chosen": -434.0,
"logps/rejected": -372.0,
"loss": 0.7286,
"rewards/accuracies": 0.7734375,
"rewards/chosen": -2.3125,
"rewards/margins": 6.8125,
"rewards/rejected": -9.125,
"step": 585
},
{
"epoch": 0.7190184049079754,
"grad_norm": 32.981762650345296,
"learning_rate": 1.5363636363636364e-06,
"logits/chosen": 0.0211181640625,
"logits/rejected": -0.0888671875,
"logps/chosen": -376.0,
"logps/rejected": -348.0,
"loss": 0.3953,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.9921875,
"rewards/margins": 7.40625,
"rewards/rejected": -9.375,
"step": 586
},
{
"epoch": 0.7202453987730061,
"grad_norm": 27.432785526510457,
"learning_rate": 1.5355371900826445e-06,
"logits/chosen": 0.0001220703125,
"logits/rejected": -0.11474609375,
"logps/chosen": -362.0,
"logps/rejected": -358.0,
"loss": 0.3823,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.828125,
"rewards/margins": 7.59375,
"rewards/rejected": -9.4375,
"step": 587
},
{
"epoch": 0.7214723926380369,
"grad_norm": 23.66359373618013,
"learning_rate": 1.534710743801653e-06,
"logits/chosen": -0.043212890625,
"logits/rejected": -0.197265625,
"logps/chosen": -406.0,
"logps/rejected": -364.0,
"loss": 0.3267,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.58203125,
"rewards/margins": 8.5625,
"rewards/rejected": -9.125,
"step": 588
},
{
"epoch": 0.7226993865030675,
"grad_norm": 23.386867855314378,
"learning_rate": 1.5338842975206611e-06,
"logits/chosen": -0.11376953125,
"logits/rejected": -0.2236328125,
"logps/chosen": -390.0,
"logps/rejected": -382.0,
"loss": 0.3111,
"rewards/accuracies": 0.875,
"rewards/chosen": -2.34375,
"rewards/margins": 7.03125,
"rewards/rejected": -9.375,
"step": 589
},
{
"epoch": 0.7239263803680982,
"grad_norm": 31.15551320155721,
"learning_rate": 1.5330578512396693e-06,
"logits/chosen": -0.01129150390625,
"logits/rejected": -0.1240234375,
"logps/chosen": -398.0,
"logps/rejected": -356.0,
"loss": 0.4364,
"rewards/accuracies": 0.8125,
"rewards/chosen": -2.25,
"rewards/margins": 7.25,
"rewards/rejected": -9.5,
"step": 590
},
{
"epoch": 0.7251533742331289,
"grad_norm": 32.28054810617703,
"learning_rate": 1.5322314049586775e-06,
"logits/chosen": -0.1845703125,
"logits/rejected": -0.388671875,
"logps/chosen": -432.0,
"logps/rejected": -376.0,
"loss": 0.2741,
"rewards/accuracies": 0.890625,
"rewards/chosen": -1.0546875,
"rewards/margins": 8.5625,
"rewards/rejected": -9.625,
"step": 591
},
{
"epoch": 0.7263803680981595,
"grad_norm": 27.5726026871591,
"learning_rate": 1.531404958677686e-06,
"logits/chosen": -0.0400390625,
"logits/rejected": -0.23046875,
"logps/chosen": -396.0,
"logps/rejected": -352.0,
"loss": 0.3069,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -1.28125,
"rewards/margins": 8.9375,
"rewards/rejected": -10.25,
"step": 592
},
{
"epoch": 0.7276073619631902,
"grad_norm": 36.01336820443863,
"learning_rate": 1.530578512396694e-06,
"logits/chosen": 0.0012054443359375,
"logits/rejected": -0.248046875,
"logps/chosen": -474.0,
"logps/rejected": -418.0,
"loss": 0.4487,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.3515625,
"rewards/margins": 8.25,
"rewards/rejected": -9.625,
"step": 593
},
{
"epoch": 0.7288343558282209,
"grad_norm": 31.432239305878504,
"learning_rate": 1.5297520661157025e-06,
"logits/chosen": -0.05615234375,
"logits/rejected": -0.212890625,
"logps/chosen": -384.0,
"logps/rejected": -356.0,
"loss": 0.397,
"rewards/accuracies": 0.828125,
"rewards/chosen": -2.125,
"rewards/margins": 7.65625,
"rewards/rejected": -9.8125,
"step": 594
},
{
"epoch": 0.7300613496932515,
"grad_norm": 32.78075859841031,
"learning_rate": 1.5289256198347107e-06,
"logits/chosen": -0.078125,
"logits/rejected": -0.287109375,
"logps/chosen": -472.0,
"logps/rejected": -392.0,
"loss": 0.3211,
"rewards/accuracies": 0.90625,
"rewards/chosen": -1.2890625,
"rewards/margins": 8.5625,
"rewards/rejected": -9.875,
"step": 595
},
{
"epoch": 0.7312883435582822,
"grad_norm": 37.09538956451303,
"learning_rate": 1.5280991735537189e-06,
"logits/chosen": -0.05517578125,
"logits/rejected": -0.20703125,
"logps/chosen": -442.0,
"logps/rejected": -390.0,
"loss": 0.4995,
"rewards/accuracies": 0.7734375,
"rewards/chosen": -2.03125,
"rewards/margins": 7.375,
"rewards/rejected": -9.375,
"step": 596
},
{
"epoch": 0.7325153374233129,
"grad_norm": 30.38608812480124,
"learning_rate": 1.5272727272727273e-06,
"logits/chosen": 0.06103515625,
"logits/rejected": -0.1162109375,
"logps/chosen": -406.0,
"logps/rejected": -328.0,
"loss": 0.4722,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.625,
"rewards/margins": 7.0,
"rewards/rejected": -8.625,
"step": 597
},
{
"epoch": 0.7337423312883435,
"grad_norm": 24.96224727342717,
"learning_rate": 1.5264462809917355e-06,
"logits/chosen": -0.042236328125,
"logits/rejected": -0.240234375,
"logps/chosen": -462.0,
"logps/rejected": -356.0,
"loss": 0.2659,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.359375,
"rewards/margins": 8.4375,
"rewards/rejected": -8.75,
"step": 598
},
{
"epoch": 0.7349693251533742,
"grad_norm": 27.231923547025172,
"learning_rate": 1.5256198347107437e-06,
"logits/chosen": -0.19140625,
"logits/rejected": -0.326171875,
"logps/chosen": -468.0,
"logps/rejected": -398.0,
"loss": 0.3553,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.439453125,
"rewards/margins": 8.3125,
"rewards/rejected": -8.75,
"step": 599
},
{
"epoch": 0.7361963190184049,
"grad_norm": 31.336627885808458,
"learning_rate": 1.5247933884297518e-06,
"logits/chosen": -0.2021484375,
"logits/rejected": -0.271484375,
"logps/chosen": -380.0,
"logps/rejected": -348.0,
"loss": 0.5022,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.1015625,
"rewards/margins": 7.46875,
"rewards/rejected": -8.5625,
"step": 600
},
{
"epoch": 0.7374233128834355,
"grad_norm": 26.47772076736151,
"learning_rate": 1.5239669421487602e-06,
"logits/chosen": -0.05712890625,
"logits/rejected": -0.2431640625,
"logps/chosen": -360.0,
"logps/rejected": -336.0,
"loss": 0.3024,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -1.671875,
"rewards/margins": 7.34375,
"rewards/rejected": -9.0,
"step": 601
},
{
"epoch": 0.7386503067484662,
"grad_norm": 28.06837562889773,
"learning_rate": 1.5231404958677684e-06,
"logits/chosen": 0.0869140625,
"logits/rejected": -0.07080078125,
"logps/chosen": -416.0,
"logps/rejected": -360.0,
"loss": 0.3123,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.39453125,
"rewards/margins": 8.3125,
"rewards/rejected": -8.6875,
"step": 602
},
{
"epoch": 0.7398773006134969,
"grad_norm": 23.585510852292025,
"learning_rate": 1.5223140495867768e-06,
"logits/chosen": -0.08203125,
"logits/rejected": -0.2109375,
"logps/chosen": -394.0,
"logps/rejected": -346.0,
"loss": 0.3208,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.265625,
"rewards/margins": 8.1875,
"rewards/rejected": -8.5,
"step": 603
},
{
"epoch": 0.7411042944785277,
"grad_norm": 29.623466911959838,
"learning_rate": 1.521487603305785e-06,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.283203125,
"logps/chosen": -428.0,
"logps/rejected": -380.0,
"loss": 0.3527,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.578125,
"rewards/margins": 7.9375,
"rewards/rejected": -8.5,
"step": 604
},
{
"epoch": 0.7423312883435583,
"grad_norm": 26.542623136863696,
"learning_rate": 1.5206611570247934e-06,
"logits/chosen": -0.078125,
"logits/rejected": -0.26171875,
"logps/chosen": -388.0,
"logps/rejected": -354.0,
"loss": 0.2974,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.5078125,
"rewards/margins": 8.3125,
"rewards/rejected": -8.8125,
"step": 605
},
{
"epoch": 0.743558282208589,
"grad_norm": 30.27478018190493,
"learning_rate": 1.5198347107438016e-06,
"logits/chosen": -0.1572265625,
"logits/rejected": -0.271484375,
"logps/chosen": -400.0,
"logps/rejected": -354.0,
"loss": 0.453,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.5625,
"rewards/margins": 7.15625,
"rewards/rejected": -7.71875,
"step": 606
},
{
"epoch": 0.7447852760736197,
"grad_norm": 29.55279807825864,
"learning_rate": 1.51900826446281e-06,
"logits/chosen": -0.046630859375,
"logits/rejected": -0.25390625,
"logps/chosen": -410.0,
"logps/rejected": -388.0,
"loss": 0.3935,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.796875,
"rewards/margins": 7.8125,
"rewards/rejected": -8.625,
"step": 607
},
{
"epoch": 0.7460122699386503,
"grad_norm": 30.00982757412949,
"learning_rate": 1.518181818181818e-06,
"logits/chosen": 0.08984375,
"logits/rejected": -0.1484375,
"logps/chosen": -416.0,
"logps/rejected": -368.0,
"loss": 0.4166,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.8046875,
"rewards/margins": 6.53125,
"rewards/rejected": -8.375,
"step": 608
},
{
"epoch": 0.747239263803681,
"grad_norm": 31.74812049299925,
"learning_rate": 1.5173553719008264e-06,
"logits/chosen": -0.037109375,
"logits/rejected": -0.19921875,
"logps/chosen": -420.0,
"logps/rejected": -348.0,
"loss": 0.4428,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.9453125,
"rewards/margins": 7.8125,
"rewards/rejected": -8.75,
"step": 609
},
{
"epoch": 0.7484662576687117,
"grad_norm": 25.131626088463726,
"learning_rate": 1.5165289256198346e-06,
"logits/chosen": -0.11083984375,
"logits/rejected": -0.318359375,
"logps/chosen": -460.0,
"logps/rejected": -402.0,
"loss": 0.2651,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.5234375,
"rewards/margins": 8.4375,
"rewards/rejected": -9.0,
"step": 610
},
{
"epoch": 0.7496932515337423,
"grad_norm": 39.73416137414698,
"learning_rate": 1.515702479338843e-06,
"logits/chosen": -0.052978515625,
"logits/rejected": -0.220703125,
"logps/chosen": -452.0,
"logps/rejected": -390.0,
"loss": 0.5685,
"rewards/accuracies": 0.828125,
"rewards/chosen": -2.234375,
"rewards/margins": 6.53125,
"rewards/rejected": -8.75,
"step": 611
},
{
"epoch": 0.750920245398773,
"grad_norm": 32.048420022414305,
"learning_rate": 1.5148760330578512e-06,
"logits/chosen": -0.040283203125,
"logits/rejected": -0.17578125,
"logps/chosen": -414.0,
"logps/rejected": -386.0,
"loss": 0.4866,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.5703125,
"rewards/margins": 6.59375,
"rewards/rejected": -8.1875,
"step": 612
},
{
"epoch": 0.7521472392638037,
"grad_norm": 31.74945608082927,
"learning_rate": 1.5140495867768594e-06,
"logits/chosen": -0.045654296875,
"logits/rejected": -0.08837890625,
"logps/chosen": -400.0,
"logps/rejected": -358.0,
"loss": 0.4784,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -2.25,
"rewards/margins": 6.59375,
"rewards/rejected": -8.8125,
"step": 613
},
{
"epoch": 0.7533742331288343,
"grad_norm": 36.930153188921594,
"learning_rate": 1.5132231404958678e-06,
"logits/chosen": -0.09375,
"logits/rejected": -0.216796875,
"logps/chosen": -442.0,
"logps/rejected": -372.0,
"loss": 0.5188,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -1.5625,
"rewards/margins": 6.875,
"rewards/rejected": -8.4375,
"step": 614
},
{
"epoch": 0.754601226993865,
"grad_norm": 30.44342763152856,
"learning_rate": 1.512396694214876e-06,
"logits/chosen": -0.07421875,
"logits/rejected": -0.1611328125,
"logps/chosen": -388.0,
"logps/rejected": -372.0,
"loss": 0.393,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.171875,
"rewards/margins": 7.3125,
"rewards/rejected": -8.5,
"step": 615
},
{
"epoch": 0.7558282208588957,
"grad_norm": 28.70066590412152,
"learning_rate": 1.5115702479338843e-06,
"logits/chosen": -0.0005035400390625,
"logits/rejected": -0.1474609375,
"logps/chosen": -346.0,
"logps/rejected": -322.0,
"loss": 0.3475,
"rewards/accuracies": 0.828125,
"rewards/chosen": -2.1875,
"rewards/margins": 6.1875,
"rewards/rejected": -8.375,
"step": 616
},
{
"epoch": 0.7570552147239263,
"grad_norm": 27.872660098071364,
"learning_rate": 1.5107438016528923e-06,
"logits/chosen": 0.0400390625,
"logits/rejected": -0.0257568359375,
"logps/chosen": -394.0,
"logps/rejected": -352.0,
"loss": 0.3236,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -2.09375,
"rewards/margins": 6.59375,
"rewards/rejected": -8.6875,
"step": 617
},
{
"epoch": 0.758282208588957,
"grad_norm": 44.37398776062372,
"learning_rate": 1.5099173553719007e-06,
"logits/chosen": 0.1142578125,
"logits/rejected": -0.0478515625,
"logps/chosen": -444.0,
"logps/rejected": -348.0,
"loss": 0.5947,
"rewards/accuracies": 0.7578125,
"rewards/chosen": -2.34375,
"rewards/margins": 5.8125,
"rewards/rejected": -8.125,
"step": 618
},
{
"epoch": 0.7595092024539877,
"grad_norm": 30.52042734733885,
"learning_rate": 1.509090909090909e-06,
"logits/chosen": 0.08837890625,
"logits/rejected": -0.11083984375,
"logps/chosen": -448.0,
"logps/rejected": -362.0,
"loss": 0.33,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.2109375,
"rewards/margins": 7.40625,
"rewards/rejected": -8.625,
"step": 619
},
{
"epoch": 0.7607361963190185,
"grad_norm": 34.288657959614106,
"learning_rate": 1.5082644628099173e-06,
"logits/chosen": 0.08740234375,
"logits/rejected": -0.09716796875,
"logps/chosen": -426.0,
"logps/rejected": -360.0,
"loss": 0.32,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.5859375,
"rewards/margins": 6.5625,
"rewards/rejected": -8.125,
"step": 620
},
{
"epoch": 0.7619631901840491,
"grad_norm": 30.081394584471248,
"learning_rate": 1.5074380165289255e-06,
"logits/chosen": -0.046875,
"logits/rejected": -0.193359375,
"logps/chosen": -496.0,
"logps/rejected": -392.0,
"loss": 0.4241,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.6015625,
"rewards/margins": 8.0,
"rewards/rejected": -8.625,
"step": 621
},
{
"epoch": 0.7631901840490798,
"grad_norm": 28.055390118710246,
"learning_rate": 1.506611570247934e-06,
"logits/chosen": 0.07275390625,
"logits/rejected": -0.078125,
"logps/chosen": -396.0,
"logps/rejected": -368.0,
"loss": 0.414,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.15625,
"rewards/margins": 7.4375,
"rewards/rejected": -8.5625,
"step": 622
},
{
"epoch": 0.7644171779141105,
"grad_norm": 30.135628517542635,
"learning_rate": 1.505785123966942e-06,
"logits/chosen": 0.03466796875,
"logits/rejected": -0.1357421875,
"logps/chosen": -472.0,
"logps/rejected": -406.0,
"loss": 0.3729,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.458984375,
"rewards/margins": 7.96875,
"rewards/rejected": -8.4375,
"step": 623
},
{
"epoch": 0.7656441717791411,
"grad_norm": 30.413030957188685,
"learning_rate": 1.5049586776859505e-06,
"logits/chosen": -0.042724609375,
"logits/rejected": -0.21484375,
"logps/chosen": -394.0,
"logps/rejected": -350.0,
"loss": 0.3593,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.3515625,
"rewards/margins": 8.8125,
"rewards/rejected": -9.1875,
"step": 624
},
{
"epoch": 0.7668711656441718,
"grad_norm": 28.497434559578014,
"learning_rate": 1.5041322314049587e-06,
"logits/chosen": -0.003204345703125,
"logits/rejected": -0.1376953125,
"logps/chosen": -422.0,
"logps/rejected": -352.0,
"loss": 0.2916,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.7578125,
"rewards/margins": 7.59375,
"rewards/rejected": -8.3125,
"step": 625
},
{
"epoch": 0.7680981595092025,
"grad_norm": 34.77802419683538,
"learning_rate": 1.5033057851239669e-06,
"logits/chosen": -0.1328125,
"logits/rejected": -0.255859375,
"logps/chosen": -428.0,
"logps/rejected": -376.0,
"loss": 0.4555,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.11962890625,
"rewards/margins": 7.53125,
"rewards/rejected": -7.65625,
"step": 626
},
{
"epoch": 0.7693251533742331,
"grad_norm": 31.232324709961738,
"learning_rate": 1.502479338842975e-06,
"logits/chosen": 0.07470703125,
"logits/rejected": 0.00176239013671875,
"logps/chosen": -330.0,
"logps/rejected": -352.0,
"loss": 0.4537,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -2.125,
"rewards/margins": 5.65625,
"rewards/rejected": -7.78125,
"step": 627
},
{
"epoch": 0.7705521472392638,
"grad_norm": 27.078767146825378,
"learning_rate": 1.5016528925619834e-06,
"logits/chosen": 0.050537109375,
"logits/rejected": -0.09814453125,
"logps/chosen": -394.0,
"logps/rejected": -324.0,
"loss": 0.3413,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.70703125,
"rewards/margins": 6.96875,
"rewards/rejected": -7.6875,
"step": 628
},
{
"epoch": 0.7717791411042945,
"grad_norm": 26.995519017475925,
"learning_rate": 1.5008264462809916e-06,
"logits/chosen": 0.0048828125,
"logits/rejected": -0.11474609375,
"logps/chosen": -364.0,
"logps/rejected": -312.0,
"loss": 0.2447,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.83203125,
"rewards/margins": 7.375,
"rewards/rejected": -8.1875,
"step": 629
},
{
"epoch": 0.7730061349693251,
"grad_norm": 37.908685925186354,
"learning_rate": 1.5e-06,
"logits/chosen": 0.0771484375,
"logits/rejected": -0.1474609375,
"logps/chosen": -388.0,
"logps/rejected": -392.0,
"loss": 0.4056,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.1201171875,
"rewards/margins": 7.71875,
"rewards/rejected": -7.84375,
"step": 630
},
{
"epoch": 0.7742331288343558,
"grad_norm": 31.987483581709707,
"learning_rate": 1.4991735537190082e-06,
"logits/chosen": -0.1328125,
"logits/rejected": -0.216796875,
"logps/chosen": -406.0,
"logps/rejected": -346.0,
"loss": 0.4456,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -0.28515625,
"rewards/margins": 7.46875,
"rewards/rejected": -7.75,
"step": 631
},
{
"epoch": 0.7754601226993865,
"grad_norm": 28.841217050963028,
"learning_rate": 1.4983471074380164e-06,
"logits/chosen": -0.03125,
"logits/rejected": -0.1552734375,
"logps/chosen": -420.0,
"logps/rejected": -368.0,
"loss": 0.3419,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.28125,
"rewards/margins": 7.21875,
"rewards/rejected": -7.5,
"step": 632
},
{
"epoch": 0.7766871165644171,
"grad_norm": 34.39881672142265,
"learning_rate": 1.4975206611570248e-06,
"logits/chosen": 0.054931640625,
"logits/rejected": -0.056640625,
"logps/chosen": -356.0,
"logps/rejected": -358.0,
"loss": 0.4147,
"rewards/accuracies": 0.796875,
"rewards/chosen": -1.0,
"rewards/margins": 6.375,
"rewards/rejected": -7.375,
"step": 633
},
{
"epoch": 0.7779141104294478,
"grad_norm": 26.652870260622375,
"learning_rate": 1.496694214876033e-06,
"logits/chosen": -0.0654296875,
"logits/rejected": -0.2578125,
"logps/chosen": -428.0,
"logps/rejected": -352.0,
"loss": 0.2238,
"rewards/accuracies": 0.890625,
"rewards/chosen": 1.28125,
"rewards/margins": 9.375,
"rewards/rejected": -8.125,
"step": 634
},
{
"epoch": 0.7791411042944786,
"grad_norm": 22.91550745058302,
"learning_rate": 1.4958677685950412e-06,
"logits/chosen": -0.05078125,
"logits/rejected": -0.119140625,
"logps/chosen": -374.0,
"logps/rejected": -324.0,
"loss": 0.2554,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -0.69140625,
"rewards/margins": 7.03125,
"rewards/rejected": -7.71875,
"step": 635
},
{
"epoch": 0.7803680981595092,
"grad_norm": 35.731763745917725,
"learning_rate": 1.4950413223140494e-06,
"logits/chosen": -0.07470703125,
"logits/rejected": -0.177734375,
"logps/chosen": -430.0,
"logps/rejected": -392.0,
"loss": 0.5242,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.005889892578125,
"rewards/margins": 7.59375,
"rewards/rejected": -7.59375,
"step": 636
},
{
"epoch": 0.7815950920245399,
"grad_norm": 37.67735509679774,
"learning_rate": 1.4942148760330578e-06,
"logits/chosen": 0.10302734375,
"logits/rejected": -0.080078125,
"logps/chosen": -398.0,
"logps/rejected": -330.0,
"loss": 0.4897,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.1328125,
"rewards/margins": 6.875,
"rewards/rejected": -8.0,
"step": 637
},
{
"epoch": 0.7828220858895706,
"grad_norm": 28.360694731541145,
"learning_rate": 1.493388429752066e-06,
"logits/chosen": -0.06494140625,
"logits/rejected": -0.263671875,
"logps/chosen": -420.0,
"logps/rejected": -364.0,
"loss": 0.3245,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -0.271484375,
"rewards/margins": 7.75,
"rewards/rejected": -8.0,
"step": 638
},
{
"epoch": 0.7840490797546013,
"grad_norm": 34.11184459648905,
"learning_rate": 1.4925619834710744e-06,
"logits/chosen": 0.064453125,
"logits/rejected": -0.10009765625,
"logps/chosen": -428.0,
"logps/rejected": -370.0,
"loss": 0.5196,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.8515625,
"rewards/margins": 7.21875,
"rewards/rejected": -8.0625,
"step": 639
},
{
"epoch": 0.7852760736196319,
"grad_norm": 28.094071707833443,
"learning_rate": 1.4917355371900826e-06,
"logits/chosen": -0.10546875,
"logits/rejected": -0.23046875,
"logps/chosen": -464.0,
"logps/rejected": -422.0,
"loss": 0.3126,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.1884765625,
"rewards/margins": 8.5,
"rewards/rejected": -8.6875,
"step": 640
},
{
"epoch": 0.7865030674846626,
"grad_norm": 36.241517750247986,
"learning_rate": 1.490909090909091e-06,
"logits/chosen": -0.146484375,
"logits/rejected": -0.271484375,
"logps/chosen": -420.0,
"logps/rejected": -386.0,
"loss": 0.6696,
"rewards/accuracies": 0.78125,
"rewards/chosen": -1.2734375,
"rewards/margins": 6.75,
"rewards/rejected": -8.0,
"step": 641
},
{
"epoch": 0.7877300613496933,
"grad_norm": 19.04510317464584,
"learning_rate": 1.4900826446280991e-06,
"logits/chosen": -0.031982421875,
"logits/rejected": -0.255859375,
"logps/chosen": -372.0,
"logps/rejected": -336.0,
"loss": 0.2417,
"rewards/accuracies": 0.890625,
"rewards/chosen": -1.0625,
"rewards/margins": 7.90625,
"rewards/rejected": -8.9375,
"step": 642
},
{
"epoch": 0.7889570552147239,
"grad_norm": 31.405897455216135,
"learning_rate": 1.4892561983471075e-06,
"logits/chosen": -0.189453125,
"logits/rejected": -0.345703125,
"logps/chosen": -428.0,
"logps/rejected": -414.0,
"loss": 0.3286,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -1.171875,
"rewards/margins": 7.625,
"rewards/rejected": -8.8125,
"step": 643
},
{
"epoch": 0.7901840490797546,
"grad_norm": 27.366634664404017,
"learning_rate": 1.4884297520661155e-06,
"logits/chosen": -0.10107421875,
"logits/rejected": -0.2490234375,
"logps/chosen": -412.0,
"logps/rejected": -366.0,
"loss": 0.4229,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -1.1328125,
"rewards/margins": 8.1875,
"rewards/rejected": -9.3125,
"step": 644
},
{
"epoch": 0.7914110429447853,
"grad_norm": 29.73627781193197,
"learning_rate": 1.487603305785124e-06,
"logits/chosen": -0.06591796875,
"logits/rejected": -0.2578125,
"logps/chosen": -358.0,
"logps/rejected": -374.0,
"loss": 0.3118,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.1328125,
"rewards/margins": 8.25,
"rewards/rejected": -9.4375,
"step": 645
},
{
"epoch": 0.7926380368098159,
"grad_norm": 32.15075062928481,
"learning_rate": 1.4867768595041321e-06,
"logits/chosen": 0.02197265625,
"logits/rejected": -0.15625,
"logps/chosen": -408.0,
"logps/rejected": -366.0,
"loss": 0.3289,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.5234375,
"rewards/margins": 7.625,
"rewards/rejected": -9.1875,
"step": 646
},
{
"epoch": 0.7938650306748466,
"grad_norm": 31.704459481417484,
"learning_rate": 1.4859504132231405e-06,
"logits/chosen": -0.05908203125,
"logits/rejected": -0.1923828125,
"logps/chosen": -404.0,
"logps/rejected": -354.0,
"loss": 0.3989,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -0.85546875,
"rewards/margins": 7.96875,
"rewards/rejected": -8.8125,
"step": 647
},
{
"epoch": 0.7950920245398773,
"grad_norm": 36.63393493327759,
"learning_rate": 1.4851239669421487e-06,
"logits/chosen": -0.10791015625,
"logits/rejected": -0.1083984375,
"logps/chosen": -350.0,
"logps/rejected": -354.0,
"loss": 0.518,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.7734375,
"rewards/margins": 6.4375,
"rewards/rejected": -8.1875,
"step": 648
},
{
"epoch": 0.7963190184049079,
"grad_norm": 31.3887880166484,
"learning_rate": 1.4842975206611569e-06,
"logits/chosen": 0.04150390625,
"logits/rejected": -0.04833984375,
"logps/chosen": -388.0,
"logps/rejected": -358.0,
"loss": 0.5288,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.640625,
"rewards/margins": 5.8125,
"rewards/rejected": -7.46875,
"step": 649
},
{
"epoch": 0.7975460122699386,
"grad_norm": 35.19357807219741,
"learning_rate": 1.4834710743801653e-06,
"logits/chosen": 0.005035400390625,
"logits/rejected": -0.1455078125,
"logps/chosen": -450.0,
"logps/rejected": -378.0,
"loss": 0.5002,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.0078125,
"rewards/margins": 6.1875,
"rewards/rejected": -7.21875,
"step": 650
},
{
"epoch": 0.7987730061349694,
"grad_norm": 35.39802370538856,
"learning_rate": 1.4826446280991735e-06,
"logits/chosen": -0.1279296875,
"logits/rejected": -0.1962890625,
"logps/chosen": -388.0,
"logps/rejected": -368.0,
"loss": 0.4878,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.2138671875,
"rewards/margins": 7.46875,
"rewards/rejected": -7.6875,
"step": 651
},
{
"epoch": 0.8,
"grad_norm": 31.850658115907073,
"learning_rate": 1.4818181818181819e-06,
"logits/chosen": -0.03857421875,
"logits/rejected": -0.1474609375,
"logps/chosen": -390.0,
"logps/rejected": -370.0,
"loss": 0.5013,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.7578125,
"rewards/margins": 6.21875,
"rewards/rejected": -7.96875,
"step": 652
},
{
"epoch": 0.8012269938650307,
"grad_norm": 27.809940613872435,
"learning_rate": 1.4809917355371899e-06,
"logits/chosen": 0.0252685546875,
"logits/rejected": -0.1396484375,
"logps/chosen": -368.0,
"logps/rejected": -348.0,
"loss": 0.2946,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.92578125,
"rewards/margins": 6.8125,
"rewards/rejected": -7.75,
"step": 653
},
{
"epoch": 0.8024539877300614,
"grad_norm": 25.196262513153428,
"learning_rate": 1.4801652892561983e-06,
"logits/chosen": 0.041259765625,
"logits/rejected": -0.1552734375,
"logps/chosen": -412.0,
"logps/rejected": -336.0,
"loss": 0.2938,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.7421875,
"rewards/margins": 6.96875,
"rewards/rejected": -7.71875,
"step": 654
},
{
"epoch": 0.803680981595092,
"grad_norm": 32.55370820352105,
"learning_rate": 1.4793388429752064e-06,
"logits/chosen": -0.01458740234375,
"logits/rejected": -0.18359375,
"logps/chosen": -404.0,
"logps/rejected": -364.0,
"loss": 0.4016,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.03125,
"rewards/margins": 6.0625,
"rewards/rejected": -7.0625,
"step": 655
},
{
"epoch": 0.8049079754601227,
"grad_norm": 36.85883245142648,
"learning_rate": 1.4785123966942148e-06,
"logits/chosen": 0.05029296875,
"logits/rejected": -0.087890625,
"logps/chosen": -386.0,
"logps/rejected": -336.0,
"loss": 0.482,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.0546875,
"rewards/margins": 5.75,
"rewards/rejected": -6.78125,
"step": 656
},
{
"epoch": 0.8061349693251534,
"grad_norm": 25.458699629502085,
"learning_rate": 1.477685950413223e-06,
"logits/chosen": -0.09716796875,
"logits/rejected": -0.2314453125,
"logps/chosen": -376.0,
"logps/rejected": -346.0,
"loss": 0.3363,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.765625,
"rewards/margins": 6.0625,
"rewards/rejected": -6.84375,
"step": 657
},
{
"epoch": 0.807361963190184,
"grad_norm": 29.410306637836257,
"learning_rate": 1.4768595041322314e-06,
"logits/chosen": -0.07568359375,
"logits/rejected": -0.203125,
"logps/chosen": -406.0,
"logps/rejected": -358.0,
"loss": 0.3754,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.71484375,
"rewards/margins": 6.0,
"rewards/rejected": -6.71875,
"step": 658
},
{
"epoch": 0.8085889570552147,
"grad_norm": 31.46664227556155,
"learning_rate": 1.4760330578512396e-06,
"logits/chosen": -0.025634765625,
"logits/rejected": -0.16015625,
"logps/chosen": -376.0,
"logps/rejected": -342.0,
"loss": 0.4448,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.2421875,
"rewards/margins": 5.71875,
"rewards/rejected": -6.96875,
"step": 659
},
{
"epoch": 0.8098159509202454,
"grad_norm": 28.21553466859993,
"learning_rate": 1.475206611570248e-06,
"logits/chosen": -0.0419921875,
"logits/rejected": -0.2177734375,
"logps/chosen": -418.0,
"logps/rejected": -366.0,
"loss": 0.3795,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.419921875,
"rewards/margins": 6.53125,
"rewards/rejected": -6.9375,
"step": 660
},
{
"epoch": 0.811042944785276,
"grad_norm": 37.78781324517118,
"learning_rate": 1.4743801652892562e-06,
"logits/chosen": 0.05712890625,
"logits/rejected": -0.050048828125,
"logps/chosen": -380.0,
"logps/rejected": -314.0,
"loss": 0.546,
"rewards/accuracies": 0.765625,
"rewards/chosen": -1.7734375,
"rewards/margins": 5.4375,
"rewards/rejected": -7.21875,
"step": 661
},
{
"epoch": 0.8122699386503067,
"grad_norm": 20.96160828276327,
"learning_rate": 1.4735537190082644e-06,
"logits/chosen": 0.05810546875,
"logits/rejected": -0.056640625,
"logps/chosen": -378.0,
"logps/rejected": -338.0,
"loss": 0.2145,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.171875,
"rewards/margins": 7.09375,
"rewards/rejected": -7.28125,
"step": 662
},
{
"epoch": 0.8134969325153374,
"grad_norm": 25.21125046878929,
"learning_rate": 1.4727272727272726e-06,
"logits/chosen": 0.111328125,
"logits/rejected": -0.07666015625,
"logps/chosen": -370.0,
"logps/rejected": -338.0,
"loss": 0.3529,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.2490234375,
"rewards/margins": 6.53125,
"rewards/rejected": -6.78125,
"step": 663
},
{
"epoch": 0.8147239263803681,
"grad_norm": 25.92352688135653,
"learning_rate": 1.471900826446281e-06,
"logits/chosen": -0.21484375,
"logits/rejected": -0.33984375,
"logps/chosen": -392.0,
"logps/rejected": -368.0,
"loss": 0.2527,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.421875,
"rewards/margins": 7.9375,
"rewards/rejected": -7.53125,
"step": 664
},
{
"epoch": 0.8159509202453987,
"grad_norm": 30.423590286493077,
"learning_rate": 1.4710743801652892e-06,
"logits/chosen": 0.1259765625,
"logits/rejected": -0.0361328125,
"logps/chosen": -350.0,
"logps/rejected": -308.0,
"loss": 0.4031,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.9296875,
"rewards/margins": 6.40625,
"rewards/rejected": -7.34375,
"step": 665
},
{
"epoch": 0.8171779141104294,
"grad_norm": 34.68883884219752,
"learning_rate": 1.4702479338842974e-06,
"logits/chosen": 0.078125,
"logits/rejected": -0.08740234375,
"logps/chosen": -434.0,
"logps/rejected": -368.0,
"loss": 0.53,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.474609375,
"rewards/margins": 6.6875,
"rewards/rejected": -7.15625,
"step": 666
},
{
"epoch": 0.8184049079754602,
"grad_norm": 25.374410525378718,
"learning_rate": 1.4694214876033058e-06,
"logits/chosen": -0.00909423828125,
"logits/rejected": -0.2021484375,
"logps/chosen": -386.0,
"logps/rejected": -350.0,
"loss": 0.3167,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.24609375,
"rewards/margins": 7.1875,
"rewards/rejected": -7.4375,
"step": 667
},
{
"epoch": 0.8196319018404908,
"grad_norm": 28.726155717525497,
"learning_rate": 1.468595041322314e-06,
"logits/chosen": 0.01116943359375,
"logits/rejected": -0.125,
"logps/chosen": -404.0,
"logps/rejected": -370.0,
"loss": 0.4085,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.6328125,
"rewards/margins": 6.78125,
"rewards/rejected": -7.4375,
"step": 668
},
{
"epoch": 0.8208588957055215,
"grad_norm": 31.107351564988974,
"learning_rate": 1.4677685950413223e-06,
"logits/chosen": -0.051025390625,
"logits/rejected": -0.2001953125,
"logps/chosen": -350.0,
"logps/rejected": -348.0,
"loss": 0.3181,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.31640625,
"rewards/margins": 7.03125,
"rewards/rejected": -7.34375,
"step": 669
},
{
"epoch": 0.8220858895705522,
"grad_norm": 23.334995347430365,
"learning_rate": 1.4669421487603305e-06,
"logits/chosen": 0.1767578125,
"logits/rejected": 0.02783203125,
"logps/chosen": -334.0,
"logps/rejected": -314.0,
"loss": 0.2454,
"rewards/accuracies": 0.9140625,
"rewards/chosen": -0.11328125,
"rewards/margins": 6.90625,
"rewards/rejected": -7.0,
"step": 670
},
{
"epoch": 0.8233128834355828,
"grad_norm": 28.996479865272974,
"learning_rate": 1.4661157024793387e-06,
"logits/chosen": 0.04345703125,
"logits/rejected": -0.1142578125,
"logps/chosen": -386.0,
"logps/rejected": -346.0,
"loss": 0.3446,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.40234375,
"rewards/margins": 7.59375,
"rewards/rejected": -7.1875,
"step": 671
},
{
"epoch": 0.8245398773006135,
"grad_norm": 28.7983416415084,
"learning_rate": 1.465289256198347e-06,
"logits/chosen": 0.060546875,
"logits/rejected": -0.208984375,
"logps/chosen": -460.0,
"logps/rejected": -348.0,
"loss": 0.3188,
"rewards/accuracies": 0.8671875,
"rewards/chosen": 0.6015625,
"rewards/margins": 7.9375,
"rewards/rejected": -7.3125,
"step": 672
},
{
"epoch": 0.8257668711656442,
"grad_norm": 30.439536228635117,
"learning_rate": 1.4644628099173553e-06,
"logits/chosen": 0.140625,
"logits/rejected": -0.09423828125,
"logps/chosen": -406.0,
"logps/rejected": -350.0,
"loss": 0.3206,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.5703125,
"rewards/margins": 6.6875,
"rewards/rejected": -7.28125,
"step": 673
},
{
"epoch": 0.8269938650306748,
"grad_norm": 32.172451597856636,
"learning_rate": 1.4636363636363635e-06,
"logits/chosen": 0.158203125,
"logits/rejected": 0.00136566162109375,
"logps/chosen": -378.0,
"logps/rejected": -352.0,
"loss": 0.4855,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.875,
"rewards/margins": 7.0625,
"rewards/rejected": -7.9375,
"step": 674
},
{
"epoch": 0.8282208588957055,
"grad_norm": 29.896957123078558,
"learning_rate": 1.462809917355372e-06,
"logits/chosen": 0.0859375,
"logits/rejected": -0.1220703125,
"logps/chosen": -444.0,
"logps/rejected": -388.0,
"loss": 0.5364,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.275390625,
"rewards/margins": 7.71875,
"rewards/rejected": -8.0,
"step": 675
},
{
"epoch": 0.8294478527607362,
"grad_norm": 34.520059752466025,
"learning_rate": 1.46198347107438e-06,
"logits/chosen": -0.034912109375,
"logits/rejected": -0.1416015625,
"logps/chosen": -410.0,
"logps/rejected": -372.0,
"loss": 0.4196,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.1875,
"rewards/margins": 7.25,
"rewards/rejected": -8.4375,
"step": 676
},
{
"epoch": 0.8306748466257668,
"grad_norm": 25.80650712803427,
"learning_rate": 1.4611570247933885e-06,
"logits/chosen": 0.09814453125,
"logits/rejected": -0.08447265625,
"logps/chosen": -358.0,
"logps/rejected": -340.0,
"loss": 0.3818,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.7734375,
"rewards/margins": 7.71875,
"rewards/rejected": -9.5,
"step": 677
},
{
"epoch": 0.8319018404907975,
"grad_norm": 32.549007655347566,
"learning_rate": 1.4603305785123967e-06,
"logits/chosen": 0.07568359375,
"logits/rejected": -0.134765625,
"logps/chosen": -448.0,
"logps/rejected": -390.0,
"loss": 0.5133,
"rewards/accuracies": 0.8125,
"rewards/chosen": -2.078125,
"rewards/margins": 7.21875,
"rewards/rejected": -9.3125,
"step": 678
},
{
"epoch": 0.8331288343558282,
"grad_norm": 28.24908049312222,
"learning_rate": 1.4595041322314049e-06,
"logits/chosen": 0.166015625,
"logits/rejected": 0.058837890625,
"logps/chosen": -374.0,
"logps/rejected": -362.0,
"loss": 0.4139,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -2.6875,
"rewards/margins": 6.75,
"rewards/rejected": -9.4375,
"step": 679
},
{
"epoch": 0.8343558282208589,
"grad_norm": 27.716668413166527,
"learning_rate": 1.458677685950413e-06,
"logits/chosen": 0.029296875,
"logits/rejected": -0.146484375,
"logps/chosen": -482.0,
"logps/rejected": -404.0,
"loss": 0.3225,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.4453125,
"rewards/margins": 8.375,
"rewards/rejected": -9.8125,
"step": 680
},
{
"epoch": 0.8355828220858895,
"grad_norm": 22.83938713224214,
"learning_rate": 1.4578512396694215e-06,
"logits/chosen": -0.026611328125,
"logits/rejected": -0.1787109375,
"logps/chosen": -378.0,
"logps/rejected": -370.0,
"loss": 0.2259,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -2.328125,
"rewards/margins": 8.5,
"rewards/rejected": -10.8125,
"step": 681
},
{
"epoch": 0.8368098159509203,
"grad_norm": 26.927865724525695,
"learning_rate": 1.4570247933884296e-06,
"logits/chosen": -0.00433349609375,
"logits/rejected": -0.12255859375,
"logps/chosen": -386.0,
"logps/rejected": -368.0,
"loss": 0.4388,
"rewards/accuracies": 0.875,
"rewards/chosen": -2.6875,
"rewards/margins": 7.5,
"rewards/rejected": -10.1875,
"step": 682
},
{
"epoch": 0.838036809815951,
"grad_norm": 28.48111409969154,
"learning_rate": 1.456198347107438e-06,
"logits/chosen": -0.032470703125,
"logits/rejected": -0.1455078125,
"logps/chosen": -408.0,
"logps/rejected": -364.0,
"loss": 0.3907,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -2.71875,
"rewards/margins": 7.9375,
"rewards/rejected": -10.625,
"step": 683
},
{
"epoch": 0.8392638036809816,
"grad_norm": 25.384242987665978,
"learning_rate": 1.4553719008264462e-06,
"logits/chosen": 0.1982421875,
"logits/rejected": 0.08056640625,
"logps/chosen": -356.0,
"logps/rejected": -388.0,
"loss": 0.3465,
"rewards/accuracies": 0.875,
"rewards/chosen": -4.1875,
"rewards/margins": 6.375,
"rewards/rejected": -10.5625,
"step": 684
},
{
"epoch": 0.8404907975460123,
"grad_norm": 32.12795978669184,
"learning_rate": 1.4545454545454544e-06,
"logits/chosen": 0.032470703125,
"logits/rejected": -0.126953125,
"logps/chosen": -434.0,
"logps/rejected": -412.0,
"loss": 0.3812,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -2.734375,
"rewards/margins": 8.6875,
"rewards/rejected": -11.4375,
"step": 685
},
{
"epoch": 0.841717791411043,
"grad_norm": 20.94926346062215,
"learning_rate": 1.4537190082644628e-06,
"logits/chosen": 0.02734375,
"logits/rejected": -0.10302734375,
"logps/chosen": -436.0,
"logps/rejected": -384.0,
"loss": 0.2907,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -3.359375,
"rewards/margins": 7.90625,
"rewards/rejected": -11.25,
"step": 686
},
{
"epoch": 0.8429447852760736,
"grad_norm": 28.546478615273625,
"learning_rate": 1.452892561983471e-06,
"logits/chosen": 0.0277099609375,
"logits/rejected": -0.11474609375,
"logps/chosen": -416.0,
"logps/rejected": -402.0,
"loss": 0.3323,
"rewards/accuracies": 0.84375,
"rewards/chosen": -3.046875,
"rewards/margins": 8.125,
"rewards/rejected": -11.125,
"step": 687
},
{
"epoch": 0.8441717791411043,
"grad_norm": 28.462016204604527,
"learning_rate": 1.4520661157024792e-06,
"logits/chosen": -0.006927490234375,
"logits/rejected": -0.166015625,
"logps/chosen": -416.0,
"logps/rejected": -360.0,
"loss": 0.4034,
"rewards/accuracies": 0.84375,
"rewards/chosen": -3.828125,
"rewards/margins": 7.4375,
"rewards/rejected": -11.25,
"step": 688
},
{
"epoch": 0.845398773006135,
"grad_norm": 27.07857679187277,
"learning_rate": 1.4512396694214874e-06,
"logits/chosen": 0.01348876953125,
"logits/rejected": -0.0732421875,
"logps/chosen": -410.0,
"logps/rejected": -380.0,
"loss": 0.3169,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -2.65625,
"rewards/margins": 7.90625,
"rewards/rejected": -10.5625,
"step": 689
},
{
"epoch": 0.8466257668711656,
"grad_norm": 39.121660005293045,
"learning_rate": 1.4504132231404958e-06,
"logits/chosen": 0.154296875,
"logits/rejected": -0.03466796875,
"logps/chosen": -442.0,
"logps/rejected": -400.0,
"loss": 0.6079,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -2.4375,
"rewards/margins": 7.875,
"rewards/rejected": -10.3125,
"step": 690
},
{
"epoch": 0.8478527607361963,
"grad_norm": 21.76491354614814,
"learning_rate": 1.449586776859504e-06,
"logits/chosen": -0.1787109375,
"logits/rejected": -0.291015625,
"logps/chosen": -388.0,
"logps/rejected": -396.0,
"loss": 0.252,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -1.953125,
"rewards/margins": 8.6875,
"rewards/rejected": -10.625,
"step": 691
},
{
"epoch": 0.849079754601227,
"grad_norm": 32.02003293503873,
"learning_rate": 1.4487603305785124e-06,
"logits/chosen": -0.0086669921875,
"logits/rejected": -0.1669921875,
"logps/chosen": -440.0,
"logps/rejected": -384.0,
"loss": 0.3402,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.5859375,
"rewards/margins": 8.625,
"rewards/rejected": -10.25,
"step": 692
},
{
"epoch": 0.8503067484662576,
"grad_norm": 27.414163330501403,
"learning_rate": 1.4479338842975206e-06,
"logits/chosen": -0.023681640625,
"logits/rejected": -0.2138671875,
"logps/chosen": -472.0,
"logps/rejected": -408.0,
"loss": 0.3703,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.84375,
"rewards/margins": 9.1875,
"rewards/rejected": -10.0625,
"step": 693
},
{
"epoch": 0.8515337423312883,
"grad_norm": 39.642457752407,
"learning_rate": 1.447107438016529e-06,
"logits/chosen": -0.007568359375,
"logits/rejected": -0.1943359375,
"logps/chosen": -402.0,
"logps/rejected": -372.0,
"loss": 0.6025,
"rewards/accuracies": 0.8125,
"rewards/chosen": -2.484375,
"rewards/margins": 6.28125,
"rewards/rejected": -8.75,
"step": 694
},
{
"epoch": 0.852760736196319,
"grad_norm": 36.16807222911162,
"learning_rate": 1.4462809917355372e-06,
"logits/chosen": 0.022216796875,
"logits/rejected": -0.05908203125,
"logps/chosen": -358.0,
"logps/rejected": -344.0,
"loss": 0.5588,
"rewards/accuracies": 0.796875,
"rewards/chosen": -2.296875,
"rewards/margins": 5.75,
"rewards/rejected": -8.0625,
"step": 695
},
{
"epoch": 0.8539877300613496,
"grad_norm": 29.70676917089465,
"learning_rate": 1.4454545454545456e-06,
"logits/chosen": 0.05419921875,
"logits/rejected": -0.12158203125,
"logps/chosen": -406.0,
"logps/rejected": -358.0,
"loss": 0.3273,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.109375,
"rewards/margins": 7.84375,
"rewards/rejected": -8.9375,
"step": 696
},
{
"epoch": 0.8552147239263803,
"grad_norm": 35.22010457179923,
"learning_rate": 1.4446280991735535e-06,
"logits/chosen": -0.11376953125,
"logits/rejected": -0.1494140625,
"logps/chosen": -410.0,
"logps/rejected": -400.0,
"loss": 0.5057,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.294921875,
"rewards/margins": 8.375,
"rewards/rejected": -8.6875,
"step": 697
},
{
"epoch": 0.8564417177914111,
"grad_norm": 29.432728874044596,
"learning_rate": 1.443801652892562e-06,
"logits/chosen": 0.047607421875,
"logits/rejected": -0.07373046875,
"logps/chosen": -416.0,
"logps/rejected": -380.0,
"loss": 0.4517,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.7421875,
"rewards/margins": 7.75,
"rewards/rejected": -8.5,
"step": 698
},
{
"epoch": 0.8576687116564418,
"grad_norm": 24.19674153808839,
"learning_rate": 1.4429752066115701e-06,
"logits/chosen": -0.015625,
"logits/rejected": -0.099609375,
"logps/chosen": -356.0,
"logps/rejected": -354.0,
"loss": 0.2956,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -1.2109375,
"rewards/margins": 6.78125,
"rewards/rejected": -7.96875,
"step": 699
},
{
"epoch": 0.8588957055214724,
"grad_norm": 30.49738374159626,
"learning_rate": 1.4421487603305785e-06,
"logits/chosen": 0.10498046875,
"logits/rejected": 0.0118408203125,
"logps/chosen": -392.0,
"logps/rejected": -356.0,
"loss": 0.4495,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.1640625,
"rewards/margins": 6.53125,
"rewards/rejected": -7.6875,
"step": 700
},
{
"epoch": 0.8601226993865031,
"grad_norm": 34.42692978508714,
"learning_rate": 1.4413223140495867e-06,
"logits/chosen": 0.1259765625,
"logits/rejected": 0.0159912109375,
"logps/chosen": -402.0,
"logps/rejected": -358.0,
"loss": 0.524,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.5078125,
"rewards/margins": 6.8125,
"rewards/rejected": -8.3125,
"step": 701
},
{
"epoch": 0.8613496932515338,
"grad_norm": 28.491225794492916,
"learning_rate": 1.440495867768595e-06,
"logits/chosen": -0.0279541015625,
"logits/rejected": -0.32421875,
"logps/chosen": -416.0,
"logps/rejected": -360.0,
"loss": 0.2766,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.033935546875,
"rewards/margins": 8.3125,
"rewards/rejected": -8.3125,
"step": 702
},
{
"epoch": 0.8625766871165644,
"grad_norm": 29.809130872353457,
"learning_rate": 1.4396694214876033e-06,
"logits/chosen": 0.11572265625,
"logits/rejected": -0.014404296875,
"logps/chosen": -438.0,
"logps/rejected": -376.0,
"loss": 0.3615,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.3203125,
"rewards/margins": 6.875,
"rewards/rejected": -8.1875,
"step": 703
},
{
"epoch": 0.8638036809815951,
"grad_norm": 26.475832213271982,
"learning_rate": 1.4388429752066115e-06,
"logits/chosen": 0.029296875,
"logits/rejected": -0.1279296875,
"logps/chosen": -344.0,
"logps/rejected": -332.0,
"loss": 0.3837,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.03125,
"rewards/margins": 7.375,
"rewards/rejected": -8.4375,
"step": 704
},
{
"epoch": 0.8650306748466258,
"grad_norm": 33.410232854812115,
"learning_rate": 1.4380165289256199e-06,
"logits/chosen": -0.08984375,
"logits/rejected": -0.212890625,
"logps/chosen": -438.0,
"logps/rejected": -396.0,
"loss": 0.3586,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.62109375,
"rewards/margins": 8.625,
"rewards/rejected": -9.25,
"step": 705
},
{
"epoch": 0.8662576687116564,
"grad_norm": 32.736741072215864,
"learning_rate": 1.4371900826446279e-06,
"logits/chosen": -0.0185546875,
"logits/rejected": -0.220703125,
"logps/chosen": -424.0,
"logps/rejected": -334.0,
"loss": 0.4525,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.140625,
"rewards/margins": 7.34375,
"rewards/rejected": -8.5,
"step": 706
},
{
"epoch": 0.8674846625766871,
"grad_norm": 34.51576760656713,
"learning_rate": 1.4363636363636363e-06,
"logits/chosen": -0.041748046875,
"logits/rejected": -0.20703125,
"logps/chosen": -408.0,
"logps/rejected": -348.0,
"loss": 0.3675,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.515625,
"rewards/margins": 7.96875,
"rewards/rejected": -9.5,
"step": 707
},
{
"epoch": 0.8687116564417178,
"grad_norm": 26.415911063275388,
"learning_rate": 1.4355371900826444e-06,
"logits/chosen": -0.0164794921875,
"logits/rejected": -0.236328125,
"logps/chosen": -394.0,
"logps/rejected": -350.0,
"loss": 0.279,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.74609375,
"rewards/margins": 8.0625,
"rewards/rejected": -8.8125,
"step": 708
},
{
"epoch": 0.8699386503067484,
"grad_norm": 22.544329099857716,
"learning_rate": 1.4347107438016528e-06,
"logits/chosen": 0.07421875,
"logits/rejected": -0.0791015625,
"logps/chosen": -458.0,
"logps/rejected": -382.0,
"loss": 0.2553,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.40625,
"rewards/margins": 9.25,
"rewards/rejected": -9.6875,
"step": 709
},
{
"epoch": 0.8711656441717791,
"grad_norm": 28.529561462599776,
"learning_rate": 1.433884297520661e-06,
"logits/chosen": 0.1337890625,
"logits/rejected": 0.006072998046875,
"logps/chosen": -386.0,
"logps/rejected": -354.0,
"loss": 0.414,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.4765625,
"rewards/margins": 7.21875,
"rewards/rejected": -8.6875,
"step": 710
},
{
"epoch": 0.8723926380368098,
"grad_norm": 26.292208659052864,
"learning_rate": 1.4330578512396694e-06,
"logits/chosen": 0.10400390625,
"logits/rejected": -0.095703125,
"logps/chosen": -408.0,
"logps/rejected": -358.0,
"loss": 0.3861,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.15625,
"rewards/margins": 7.84375,
"rewards/rejected": -9.0,
"step": 711
},
{
"epoch": 0.8736196319018404,
"grad_norm": 29.55452586068932,
"learning_rate": 1.4322314049586776e-06,
"logits/chosen": 0.09375,
"logits/rejected": -0.056640625,
"logps/chosen": -428.0,
"logps/rejected": -382.0,
"loss": 0.4511,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.5234375,
"rewards/margins": 7.78125,
"rewards/rejected": -8.3125,
"step": 712
},
{
"epoch": 0.8748466257668711,
"grad_norm": 24.284151309581777,
"learning_rate": 1.431404958677686e-06,
"logits/chosen": 0.00897216796875,
"logits/rejected": -0.20703125,
"logps/chosen": -404.0,
"logps/rejected": -364.0,
"loss": 0.3247,
"rewards/accuracies": 0.890625,
"rewards/chosen": -1.1953125,
"rewards/margins": 8.375,
"rewards/rejected": -9.625,
"step": 713
},
{
"epoch": 0.8760736196319019,
"grad_norm": 27.147595372766023,
"learning_rate": 1.4305785123966942e-06,
"logits/chosen": 0.1357421875,
"logits/rejected": -0.0859375,
"logps/chosen": -386.0,
"logps/rejected": -354.0,
"loss": 0.3173,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -0.734375,
"rewards/margins": 7.8125,
"rewards/rejected": -8.5625,
"step": 714
},
{
"epoch": 0.8773006134969326,
"grad_norm": 26.988571669436155,
"learning_rate": 1.4297520661157024e-06,
"logits/chosen": -0.10302734375,
"logits/rejected": -0.181640625,
"logps/chosen": -402.0,
"logps/rejected": -354.0,
"loss": 0.3565,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.6953125,
"rewards/margins": 8.5,
"rewards/rejected": -9.25,
"step": 715
},
{
"epoch": 0.8785276073619632,
"grad_norm": 22.190701460200966,
"learning_rate": 1.4289256198347106e-06,
"logits/chosen": -0.062255859375,
"logits/rejected": -0.2333984375,
"logps/chosen": -402.0,
"logps/rejected": -352.0,
"loss": 0.277,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.6328125,
"rewards/margins": 7.9375,
"rewards/rejected": -8.5625,
"step": 716
},
{
"epoch": 0.8797546012269939,
"grad_norm": 25.791214816251124,
"learning_rate": 1.428099173553719e-06,
"logits/chosen": 0.02880859375,
"logits/rejected": -0.12890625,
"logps/chosen": -364.0,
"logps/rejected": -312.0,
"loss": 0.3465,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.203125,
"rewards/margins": 7.6875,
"rewards/rejected": -8.9375,
"step": 717
},
{
"epoch": 0.8809815950920246,
"grad_norm": 21.677038331933062,
"learning_rate": 1.4272727272727272e-06,
"logits/chosen": -0.080078125,
"logits/rejected": -0.2158203125,
"logps/chosen": -420.0,
"logps/rejected": -384.0,
"loss": 0.2486,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -0.22265625,
"rewards/margins": 8.875,
"rewards/rejected": -9.0625,
"step": 718
},
{
"epoch": 0.8822085889570552,
"grad_norm": 31.275102961470218,
"learning_rate": 1.4264462809917354e-06,
"logits/chosen": -0.12158203125,
"logits/rejected": -0.251953125,
"logps/chosen": -426.0,
"logps/rejected": -394.0,
"loss": 0.3328,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.169921875,
"rewards/margins": 8.9375,
"rewards/rejected": -8.8125,
"step": 719
},
{
"epoch": 0.8834355828220859,
"grad_norm": 28.177039424566583,
"learning_rate": 1.4256198347107438e-06,
"logits/chosen": -0.11669921875,
"logits/rejected": -0.322265625,
"logps/chosen": -430.0,
"logps/rejected": -378.0,
"loss": 0.3401,
"rewards/accuracies": 0.8515625,
"rewards/chosen": 0.1484375,
"rewards/margins": 8.9375,
"rewards/rejected": -8.75,
"step": 720
},
{
"epoch": 0.8846625766871166,
"grad_norm": 24.36988004036112,
"learning_rate": 1.424793388429752e-06,
"logits/chosen": -0.11474609375,
"logits/rejected": -0.373046875,
"logps/chosen": -428.0,
"logps/rejected": -388.0,
"loss": 0.3233,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1591796875,
"rewards/margins": 9.75,
"rewards/rejected": -9.5625,
"step": 721
},
{
"epoch": 0.8858895705521472,
"grad_norm": 26.34423022787914,
"learning_rate": 1.4239669421487604e-06,
"logits/chosen": -0.0849609375,
"logits/rejected": -0.1787109375,
"logps/chosen": -396.0,
"logps/rejected": -380.0,
"loss": 0.3255,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.0693359375,
"rewards/margins": 8.5625,
"rewards/rejected": -8.625,
"step": 722
},
{
"epoch": 0.8871165644171779,
"grad_norm": 30.186809880156144,
"learning_rate": 1.4231404958677685e-06,
"logits/chosen": -0.07373046875,
"logits/rejected": -0.1787109375,
"logps/chosen": -390.0,
"logps/rejected": -352.0,
"loss": 0.3484,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.482421875,
"rewards/margins": 7.875,
"rewards/rejected": -8.375,
"step": 723
},
{
"epoch": 0.8883435582822086,
"grad_norm": 28.732160993316025,
"learning_rate": 1.4223140495867767e-06,
"logits/chosen": -0.06787109375,
"logits/rejected": -0.2890625,
"logps/chosen": -394.0,
"logps/rejected": -340.0,
"loss": 0.3932,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.0145263671875,
"rewards/margins": 8.375,
"rewards/rejected": -8.375,
"step": 724
},
{
"epoch": 0.8895705521472392,
"grad_norm": 28.878669838062223,
"learning_rate": 1.421487603305785e-06,
"logits/chosen": 0.09130859375,
"logits/rejected": -0.083984375,
"logps/chosen": -420.0,
"logps/rejected": -356.0,
"loss": 0.4533,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.56640625,
"rewards/margins": 7.5625,
"rewards/rejected": -8.125,
"step": 725
},
{
"epoch": 0.8907975460122699,
"grad_norm": 30.17893494033232,
"learning_rate": 1.4206611570247933e-06,
"logits/chosen": -0.056884765625,
"logits/rejected": -0.1826171875,
"logps/chosen": -352.0,
"logps/rejected": -318.0,
"loss": 0.329,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.67578125,
"rewards/margins": 7.90625,
"rewards/rejected": -8.625,
"step": 726
},
{
"epoch": 0.8920245398773006,
"grad_norm": 33.608941642903545,
"learning_rate": 1.4198347107438015e-06,
"logits/chosen": -0.02880859375,
"logits/rejected": -0.177734375,
"logps/chosen": -388.0,
"logps/rejected": -354.0,
"loss": 0.2906,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.421875,
"rewards/margins": 7.84375,
"rewards/rejected": -8.25,
"step": 727
},
{
"epoch": 0.8932515337423312,
"grad_norm": 28.91416626418709,
"learning_rate": 1.41900826446281e-06,
"logits/chosen": -0.051025390625,
"logits/rejected": -0.19140625,
"logps/chosen": -418.0,
"logps/rejected": -400.0,
"loss": 0.3732,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.030517578125,
"rewards/margins": 9.125,
"rewards/rejected": -9.125,
"step": 728
},
{
"epoch": 0.894478527607362,
"grad_norm": 26.23208605642664,
"learning_rate": 1.418181818181818e-06,
"logits/chosen": -0.06201171875,
"logits/rejected": -0.1943359375,
"logps/chosen": -408.0,
"logps/rejected": -386.0,
"loss": 0.2404,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.283203125,
"rewards/margins": 9.0,
"rewards/rejected": -9.3125,
"step": 729
},
{
"epoch": 0.8957055214723927,
"grad_norm": 25.774838299998283,
"learning_rate": 1.4173553719008265e-06,
"logits/chosen": -0.12109375,
"logits/rejected": -0.2236328125,
"logps/chosen": -414.0,
"logps/rejected": -390.0,
"loss": 0.2348,
"rewards/accuracies": 0.8828125,
"rewards/chosen": 0.447265625,
"rewards/margins": 8.75,
"rewards/rejected": -8.3125,
"step": 730
},
{
"epoch": 0.8969325153374234,
"grad_norm": 31.842104798671258,
"learning_rate": 1.4165289256198347e-06,
"logits/chosen": 0.0927734375,
"logits/rejected": -0.0220947265625,
"logps/chosen": -450.0,
"logps/rejected": -376.0,
"loss": 0.3761,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.51171875,
"rewards/margins": 8.0625,
"rewards/rejected": -8.5625,
"step": 731
},
{
"epoch": 0.898159509202454,
"grad_norm": 28.21943911685738,
"learning_rate": 1.415702479338843e-06,
"logits/chosen": -0.080078125,
"logits/rejected": -0.234375,
"logps/chosen": -390.0,
"logps/rejected": -384.0,
"loss": 0.3918,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.322265625,
"rewards/margins": 7.8125,
"rewards/rejected": -8.125,
"step": 732
},
{
"epoch": 0.8993865030674847,
"grad_norm": 29.041683327276143,
"learning_rate": 1.414876033057851e-06,
"logits/chosen": 0.043701171875,
"logits/rejected": -0.10595703125,
"logps/chosen": -376.0,
"logps/rejected": -372.0,
"loss": 0.3207,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.0703125,
"rewards/margins": 7.5625,
"rewards/rejected": -8.625,
"step": 733
},
{
"epoch": 0.9006134969325154,
"grad_norm": 30.30128813839964,
"learning_rate": 1.4140495867768595e-06,
"logits/chosen": 0.056884765625,
"logits/rejected": -0.12255859375,
"logps/chosen": -392.0,
"logps/rejected": -362.0,
"loss": 0.3404,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.388671875,
"rewards/margins": 8.375,
"rewards/rejected": -8.75,
"step": 734
},
{
"epoch": 0.901840490797546,
"grad_norm": 28.991498564684523,
"learning_rate": 1.4132231404958677e-06,
"logits/chosen": -0.0517578125,
"logits/rejected": -0.271484375,
"logps/chosen": -444.0,
"logps/rejected": -402.0,
"loss": 0.3195,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.734375,
"rewards/margins": 9.0625,
"rewards/rejected": -9.8125,
"step": 735
},
{
"epoch": 0.9030674846625767,
"grad_norm": 27.484399578704373,
"learning_rate": 1.412396694214876e-06,
"logits/chosen": 0.1357421875,
"logits/rejected": 0.012451171875,
"logps/chosen": -372.0,
"logps/rejected": -354.0,
"loss": 0.4043,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.6640625,
"rewards/margins": 7.125,
"rewards/rejected": -8.8125,
"step": 736
},
{
"epoch": 0.9042944785276074,
"grad_norm": 34.0157091638658,
"learning_rate": 1.4115702479338842e-06,
"logits/chosen": 0.0301513671875,
"logits/rejected": -0.07275390625,
"logps/chosen": -372.0,
"logps/rejected": -362.0,
"loss": 0.521,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.6484375,
"rewards/margins": 7.25,
"rewards/rejected": -8.875,
"step": 737
},
{
"epoch": 0.905521472392638,
"grad_norm": 29.26954900442495,
"learning_rate": 1.4107438016528924e-06,
"logits/chosen": -0.052734375,
"logits/rejected": -0.1630859375,
"logps/chosen": -462.0,
"logps/rejected": -382.0,
"loss": 0.3774,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -0.76171875,
"rewards/margins": 8.625,
"rewards/rejected": -9.4375,
"step": 738
},
{
"epoch": 0.9067484662576687,
"grad_norm": 26.555268317808686,
"learning_rate": 1.4099173553719008e-06,
"logits/chosen": 0.044921875,
"logits/rejected": -0.08056640625,
"logps/chosen": -360.0,
"logps/rejected": -356.0,
"loss": 0.275,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.390625,
"rewards/margins": 7.5,
"rewards/rejected": -8.875,
"step": 739
},
{
"epoch": 0.9079754601226994,
"grad_norm": 27.061032091197205,
"learning_rate": 1.409090909090909e-06,
"logits/chosen": -0.0361328125,
"logits/rejected": -0.193359375,
"logps/chosen": -356.0,
"logps/rejected": -342.0,
"loss": 0.3565,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.1796875,
"rewards/margins": 7.875,
"rewards/rejected": -9.0625,
"step": 740
},
{
"epoch": 0.90920245398773,
"grad_norm": 31.60349380035715,
"learning_rate": 1.4082644628099174e-06,
"logits/chosen": -0.0211181640625,
"logits/rejected": -0.1806640625,
"logps/chosen": -370.0,
"logps/rejected": -344.0,
"loss": 0.4085,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.4140625,
"rewards/margins": 9.0,
"rewards/rejected": -9.4375,
"step": 741
},
{
"epoch": 0.9104294478527607,
"grad_norm": 26.61394408236033,
"learning_rate": 1.4074380165289254e-06,
"logits/chosen": -0.0458984375,
"logits/rejected": -0.20703125,
"logps/chosen": -380.0,
"logps/rejected": -388.0,
"loss": 0.3156,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.58984375,
"rewards/margins": 9.0,
"rewards/rejected": -9.625,
"step": 742
},
{
"epoch": 0.9116564417177914,
"grad_norm": 32.61195100311176,
"learning_rate": 1.4066115702479338e-06,
"logits/chosen": -0.00848388671875,
"logits/rejected": -0.06640625,
"logps/chosen": -442.0,
"logps/rejected": -412.0,
"loss": 0.4269,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.59375,
"rewards/margins": 7.46875,
"rewards/rejected": -9.0625,
"step": 743
},
{
"epoch": 0.912883435582822,
"grad_norm": 28.563408773577645,
"learning_rate": 1.405785123966942e-06,
"logits/chosen": 0.0189208984375,
"logits/rejected": -0.1640625,
"logps/chosen": -396.0,
"logps/rejected": -362.0,
"loss": 0.3528,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -0.59765625,
"rewards/margins": 9.3125,
"rewards/rejected": -9.875,
"step": 744
},
{
"epoch": 0.9141104294478528,
"grad_norm": 28.351305424214722,
"learning_rate": 1.4049586776859504e-06,
"logits/chosen": 0.06982421875,
"logits/rejected": -0.021240234375,
"logps/chosen": -362.0,
"logps/rejected": -340.0,
"loss": 0.3199,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.5625,
"rewards/margins": 7.25,
"rewards/rejected": -8.8125,
"step": 745
},
{
"epoch": 0.9153374233128835,
"grad_norm": 33.96507331459219,
"learning_rate": 1.4041322314049586e-06,
"logits/chosen": 0.07470703125,
"logits/rejected": -0.10009765625,
"logps/chosen": -426.0,
"logps/rejected": -378.0,
"loss": 0.4361,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.2734375,
"rewards/margins": 8.0625,
"rewards/rejected": -9.3125,
"step": 746
},
{
"epoch": 0.9165644171779141,
"grad_norm": 26.76986957266807,
"learning_rate": 1.403305785123967e-06,
"logits/chosen": -0.126953125,
"logits/rejected": -0.240234375,
"logps/chosen": -358.0,
"logps/rejected": -368.0,
"loss": 0.2992,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.5078125,
"rewards/margins": 7.5,
"rewards/rejected": -9.0,
"step": 747
},
{
"epoch": 0.9177914110429448,
"grad_norm": 32.7326110006311,
"learning_rate": 1.4024793388429752e-06,
"logits/chosen": 0.107421875,
"logits/rejected": -0.0062255859375,
"logps/chosen": -398.0,
"logps/rejected": -378.0,
"loss": 0.5331,
"rewards/accuracies": 0.7734375,
"rewards/chosen": -2.34375,
"rewards/margins": 6.875,
"rewards/rejected": -9.1875,
"step": 748
},
{
"epoch": 0.9190184049079755,
"grad_norm": 30.856327543823536,
"learning_rate": 1.4016528925619836e-06,
"logits/chosen": -0.06640625,
"logits/rejected": -0.267578125,
"logps/chosen": -440.0,
"logps/rejected": -380.0,
"loss": 0.4432,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.46875,
"rewards/margins": 8.0625,
"rewards/rejected": -9.5625,
"step": 749
},
{
"epoch": 0.9202453987730062,
"grad_norm": 32.95828711550431,
"learning_rate": 1.4008264462809917e-06,
"logits/chosen": -0.0023651123046875,
"logits/rejected": -0.138671875,
"logps/chosen": -430.0,
"logps/rejected": -374.0,
"loss": 0.4616,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.6640625,
"rewards/margins": 8.1875,
"rewards/rejected": -9.8125,
"step": 750
},
{
"epoch": 0.9214723926380368,
"grad_norm": 34.25501142385686,
"learning_rate": 1.4e-06,
"logits/chosen": -0.0296630859375,
"logits/rejected": -0.1943359375,
"logps/chosen": -446.0,
"logps/rejected": -392.0,
"loss": 0.3754,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.234375,
"rewards/margins": 9.25,
"rewards/rejected": -10.5,
"step": 751
},
{
"epoch": 0.9226993865030675,
"grad_norm": 30.76023258106853,
"learning_rate": 1.3991735537190081e-06,
"logits/chosen": -0.05078125,
"logits/rejected": -0.296875,
"logps/chosen": -442.0,
"logps/rejected": -394.0,
"loss": 0.4164,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.046875,
"rewards/margins": 9.25,
"rewards/rejected": -10.3125,
"step": 752
},
{
"epoch": 0.9239263803680982,
"grad_norm": 27.654836403118072,
"learning_rate": 1.3983471074380165e-06,
"logits/chosen": 0.1201171875,
"logits/rejected": -0.014404296875,
"logps/chosen": -426.0,
"logps/rejected": -388.0,
"loss": 0.3484,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.6875,
"rewards/margins": 8.1875,
"rewards/rejected": -9.875,
"step": 753
},
{
"epoch": 0.9251533742331288,
"grad_norm": 32.354546439688335,
"learning_rate": 1.3975206611570247e-06,
"logits/chosen": 0.04296875,
"logits/rejected": -0.1318359375,
"logps/chosen": -412.0,
"logps/rejected": -372.0,
"loss": 0.458,
"rewards/accuracies": 0.796875,
"rewards/chosen": -1.9921875,
"rewards/margins": 7.65625,
"rewards/rejected": -9.625,
"step": 754
},
{
"epoch": 0.9263803680981595,
"grad_norm": 29.017964657934716,
"learning_rate": 1.396694214876033e-06,
"logits/chosen": -0.004119873046875,
"logits/rejected": -0.1328125,
"logps/chosen": -406.0,
"logps/rejected": -392.0,
"loss": 0.3862,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -2.0625,
"rewards/margins": 8.125,
"rewards/rejected": -10.1875,
"step": 755
},
{
"epoch": 0.9276073619631902,
"grad_norm": 24.680066346312046,
"learning_rate": 1.3958677685950413e-06,
"logits/chosen": 0.08837890625,
"logits/rejected": -0.00445556640625,
"logps/chosen": -360.0,
"logps/rejected": -354.0,
"loss": 0.3137,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -2.4375,
"rewards/margins": 7.8125,
"rewards/rejected": -10.25,
"step": 756
},
{
"epoch": 0.9288343558282208,
"grad_norm": 21.628298869025013,
"learning_rate": 1.3950413223140495e-06,
"logits/chosen": 0.1376953125,
"logits/rejected": -0.0830078125,
"logps/chosen": -420.0,
"logps/rejected": -372.0,
"loss": 0.2783,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.8515625,
"rewards/margins": 9.125,
"rewards/rejected": -9.9375,
"step": 757
},
{
"epoch": 0.9300613496932515,
"grad_norm": 35.66137842607611,
"learning_rate": 1.3942148760330579e-06,
"logits/chosen": 0.05908203125,
"logits/rejected": -0.10546875,
"logps/chosen": -392.0,
"logps/rejected": -346.0,
"loss": 0.4513,
"rewards/accuracies": 0.84375,
"rewards/chosen": -2.234375,
"rewards/margins": 7.625,
"rewards/rejected": -9.875,
"step": 758
},
{
"epoch": 0.9312883435582822,
"grad_norm": 26.26811416539099,
"learning_rate": 1.393388429752066e-06,
"logits/chosen": 0.08203125,
"logits/rejected": -0.14453125,
"logps/chosen": -414.0,
"logps/rejected": -366.0,
"loss": 0.326,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.6015625,
"rewards/margins": 7.78125,
"rewards/rejected": -9.375,
"step": 759
},
{
"epoch": 0.9325153374233128,
"grad_norm": 24.851920470373752,
"learning_rate": 1.3925619834710743e-06,
"logits/chosen": -0.1220703125,
"logits/rejected": -0.380859375,
"logps/chosen": -458.0,
"logps/rejected": -390.0,
"loss": 0.3206,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.4453125,
"rewards/margins": 9.4375,
"rewards/rejected": -9.875,
"step": 760
},
{
"epoch": 0.9337423312883436,
"grad_norm": 30.55354124740392,
"learning_rate": 1.3917355371900825e-06,
"logits/chosen": 0.12109375,
"logits/rejected": -0.006622314453125,
"logps/chosen": -398.0,
"logps/rejected": -378.0,
"loss": 0.4391,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.1328125,
"rewards/margins": 7.9375,
"rewards/rejected": -9.0625,
"step": 761
},
{
"epoch": 0.9349693251533743,
"grad_norm": 31.618904719465664,
"learning_rate": 1.3909090909090909e-06,
"logits/chosen": 0.1259765625,
"logits/rejected": -0.05908203125,
"logps/chosen": -444.0,
"logps/rejected": -388.0,
"loss": 0.3448,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.2109375,
"rewards/margins": 8.4375,
"rewards/rejected": -9.625,
"step": 762
},
{
"epoch": 0.9361963190184049,
"grad_norm": 27.471562829766043,
"learning_rate": 1.390082644628099e-06,
"logits/chosen": 0.0673828125,
"logits/rejected": -0.0220947265625,
"logps/chosen": -416.0,
"logps/rejected": -386.0,
"loss": 0.422,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.15625,
"rewards/margins": 8.1875,
"rewards/rejected": -9.375,
"step": 763
},
{
"epoch": 0.9374233128834356,
"grad_norm": 27.813477501412212,
"learning_rate": 1.3892561983471074e-06,
"logits/chosen": -0.158203125,
"logits/rejected": -0.3203125,
"logps/chosen": -344.0,
"logps/rejected": -340.0,
"loss": 0.3219,
"rewards/accuracies": 0.890625,
"rewards/chosen": -1.8984375,
"rewards/margins": 7.8125,
"rewards/rejected": -9.6875,
"step": 764
},
{
"epoch": 0.9386503067484663,
"grad_norm": 35.1646310481215,
"learning_rate": 1.3884297520661156e-06,
"logits/chosen": 0.08837890625,
"logits/rejected": -0.03955078125,
"logps/chosen": -420.0,
"logps/rejected": -342.0,
"loss": 0.4236,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.75,
"rewards/margins": 6.8125,
"rewards/rejected": -8.5625,
"step": 765
},
{
"epoch": 0.939877300613497,
"grad_norm": 27.592476560371697,
"learning_rate": 1.387603305785124e-06,
"logits/chosen": 0.01409912109375,
"logits/rejected": -0.1826171875,
"logps/chosen": -458.0,
"logps/rejected": -360.0,
"loss": 0.3505,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.82421875,
"rewards/margins": 8.1875,
"rewards/rejected": -9.0625,
"step": 766
},
{
"epoch": 0.9411042944785276,
"grad_norm": 31.90981191788155,
"learning_rate": 1.3867768595041322e-06,
"logits/chosen": 0.00347900390625,
"logits/rejected": -0.14453125,
"logps/chosen": -400.0,
"logps/rejected": -362.0,
"loss": 0.3799,
"rewards/accuracies": 0.796875,
"rewards/chosen": -1.328125,
"rewards/margins": 8.3125,
"rewards/rejected": -9.625,
"step": 767
},
{
"epoch": 0.9423312883435583,
"grad_norm": 32.31524381355194,
"learning_rate": 1.3859504132231404e-06,
"logits/chosen": -0.0296630859375,
"logits/rejected": -0.197265625,
"logps/chosen": -424.0,
"logps/rejected": -402.0,
"loss": 0.5188,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -0.83984375,
"rewards/margins": 7.9375,
"rewards/rejected": -8.8125,
"step": 768
},
{
"epoch": 0.943558282208589,
"grad_norm": 24.9484574754309,
"learning_rate": 1.3851239669421486e-06,
"logits/chosen": -0.036376953125,
"logits/rejected": -0.1845703125,
"logps/chosen": -392.0,
"logps/rejected": -362.0,
"loss": 0.3514,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.359375,
"rewards/margins": 8.125,
"rewards/rejected": -9.5,
"step": 769
},
{
"epoch": 0.9447852760736196,
"grad_norm": 29.724831207517727,
"learning_rate": 1.384297520661157e-06,
"logits/chosen": -0.054931640625,
"logits/rejected": -0.298828125,
"logps/chosen": -428.0,
"logps/rejected": -390.0,
"loss": 0.3526,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.451171875,
"rewards/margins": 8.0,
"rewards/rejected": -8.4375,
"step": 770
},
{
"epoch": 0.9460122699386503,
"grad_norm": 34.49223344860793,
"learning_rate": 1.3834710743801652e-06,
"logits/chosen": -0.038818359375,
"logits/rejected": -0.0537109375,
"logps/chosen": -444.0,
"logps/rejected": -378.0,
"loss": 0.5503,
"rewards/accuracies": 0.78125,
"rewards/chosen": -2.046875,
"rewards/margins": 6.75,
"rewards/rejected": -8.8125,
"step": 771
},
{
"epoch": 0.947239263803681,
"grad_norm": 27.871880415257962,
"learning_rate": 1.3826446280991736e-06,
"logits/chosen": 0.09130859375,
"logits/rejected": -0.1279296875,
"logps/chosen": -436.0,
"logps/rejected": -380.0,
"loss": 0.3883,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.83984375,
"rewards/margins": 7.8125,
"rewards/rejected": -8.625,
"step": 772
},
{
"epoch": 0.9484662576687116,
"grad_norm": 33.61022001136346,
"learning_rate": 1.3818181818181818e-06,
"logits/chosen": 0.10888671875,
"logits/rejected": -0.0693359375,
"logps/chosen": -386.0,
"logps/rejected": -340.0,
"loss": 0.4304,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.859375,
"rewards/margins": 6.8125,
"rewards/rejected": -8.6875,
"step": 773
},
{
"epoch": 0.9496932515337423,
"grad_norm": 31.238399838630126,
"learning_rate": 1.38099173553719e-06,
"logits/chosen": 0.09765625,
"logits/rejected": -0.044921875,
"logps/chosen": -378.0,
"logps/rejected": -344.0,
"loss": 0.4225,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -2.859375,
"rewards/margins": 5.5,
"rewards/rejected": -8.375,
"step": 774
},
{
"epoch": 0.950920245398773,
"grad_norm": 31.68469327733575,
"learning_rate": 1.3801652892561984e-06,
"logits/chosen": 0.173828125,
"logits/rejected": -0.0042724609375,
"logps/chosen": -434.0,
"logps/rejected": -382.0,
"loss": 0.4133,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -1.96875,
"rewards/margins": 6.46875,
"rewards/rejected": -8.4375,
"step": 775
},
{
"epoch": 0.9521472392638037,
"grad_norm": 29.267036991785805,
"learning_rate": 1.3793388429752066e-06,
"logits/chosen": -0.046142578125,
"logits/rejected": -0.2041015625,
"logps/chosen": -426.0,
"logps/rejected": -380.0,
"loss": 0.4733,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.1640625,
"rewards/margins": 6.875,
"rewards/rejected": -8.0625,
"step": 776
},
{
"epoch": 0.9533742331288344,
"grad_norm": 28.583966780563642,
"learning_rate": 1.3785123966942147e-06,
"logits/chosen": -0.0089111328125,
"logits/rejected": -0.1357421875,
"logps/chosen": -420.0,
"logps/rejected": -360.0,
"loss": 0.4234,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.8125,
"rewards/margins": 6.875,
"rewards/rejected": -8.6875,
"step": 777
},
{
"epoch": 0.9546012269938651,
"grad_norm": 28.160692020645605,
"learning_rate": 1.377685950413223e-06,
"logits/chosen": 0.0289306640625,
"logits/rejected": -0.1669921875,
"logps/chosen": -412.0,
"logps/rejected": -342.0,
"loss": 0.2711,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.953125,
"rewards/margins": 6.0625,
"rewards/rejected": -8.0,
"step": 778
},
{
"epoch": 0.9558282208588957,
"grad_norm": 28.786162074277648,
"learning_rate": 1.3768595041322313e-06,
"logits/chosen": -0.031005859375,
"logits/rejected": -0.1923828125,
"logps/chosen": -456.0,
"logps/rejected": -376.0,
"loss": 0.3692,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.1953125,
"rewards/margins": 7.75,
"rewards/rejected": -8.9375,
"step": 779
},
{
"epoch": 0.9570552147239264,
"grad_norm": 33.93000816819851,
"learning_rate": 1.3760330578512395e-06,
"logits/chosen": 0.09375,
"logits/rejected": -0.0810546875,
"logps/chosen": -402.0,
"logps/rejected": -378.0,
"loss": 0.5206,
"rewards/accuracies": 0.7734375,
"rewards/chosen": -2.453125,
"rewards/margins": 6.15625,
"rewards/rejected": -8.625,
"step": 780
},
{
"epoch": 0.9582822085889571,
"grad_norm": 26.56406725425245,
"learning_rate": 1.375206611570248e-06,
"logits/chosen": -0.049072265625,
"logits/rejected": -0.27734375,
"logps/chosen": -440.0,
"logps/rejected": -370.0,
"loss": 0.2804,
"rewards/accuracies": 0.8828125,
"rewards/chosen": -0.453125,
"rewards/margins": 8.875,
"rewards/rejected": -9.3125,
"step": 781
},
{
"epoch": 0.9595092024539877,
"grad_norm": 25.348486184371342,
"learning_rate": 1.374380165289256e-06,
"logits/chosen": -0.006195068359375,
"logits/rejected": -0.099609375,
"logps/chosen": -384.0,
"logps/rejected": -370.0,
"loss": 0.3026,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.4921875,
"rewards/margins": 7.3125,
"rewards/rejected": -8.8125,
"step": 782
},
{
"epoch": 0.9607361963190184,
"grad_norm": 63.770958134013526,
"learning_rate": 1.3735537190082645e-06,
"logits/chosen": -0.026123046875,
"logits/rejected": -0.1640625,
"logps/chosen": -434.0,
"logps/rejected": -388.0,
"loss": 0.3397,
"rewards/accuracies": 0.859375,
"rewards/chosen": -1.015625,
"rewards/margins": 8.25,
"rewards/rejected": -9.25,
"step": 783
},
{
"epoch": 0.9619631901840491,
"grad_norm": 32.288193349248125,
"learning_rate": 1.3727272727272727e-06,
"logits/chosen": 0.053955078125,
"logits/rejected": 0.006134033203125,
"logps/chosen": -404.0,
"logps/rejected": -370.0,
"loss": 0.4502,
"rewards/accuracies": 0.8125,
"rewards/chosen": -2.359375,
"rewards/margins": 6.3125,
"rewards/rejected": -8.6875,
"step": 784
},
{
"epoch": 0.9631901840490797,
"grad_norm": 21.993651500393696,
"learning_rate": 1.371900826446281e-06,
"logits/chosen": 0.08154296875,
"logits/rejected": -0.08447265625,
"logps/chosen": -398.0,
"logps/rejected": -338.0,
"loss": 0.1918,
"rewards/accuracies": 0.921875,
"rewards/chosen": -1.40625,
"rewards/margins": 7.4375,
"rewards/rejected": -8.8125,
"step": 785
},
{
"epoch": 0.9644171779141104,
"grad_norm": 23.05424200363552,
"learning_rate": 1.371074380165289e-06,
"logits/chosen": 0.0673828125,
"logits/rejected": -0.1337890625,
"logps/chosen": -386.0,
"logps/rejected": -346.0,
"loss": 0.2392,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.7890625,
"rewards/margins": 7.3125,
"rewards/rejected": -9.125,
"step": 786
},
{
"epoch": 0.9656441717791411,
"grad_norm": 33.84343849581761,
"learning_rate": 1.3702479338842975e-06,
"logits/chosen": -0.0194091796875,
"logits/rejected": -0.1337890625,
"logps/chosen": -430.0,
"logps/rejected": -364.0,
"loss": 0.3952,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.8828125,
"rewards/margins": 7.6875,
"rewards/rejected": -9.5625,
"step": 787
},
{
"epoch": 0.9668711656441717,
"grad_norm": 25.257200964506605,
"learning_rate": 1.3694214876033057e-06,
"logits/chosen": -0.041748046875,
"logits/rejected": -0.20703125,
"logps/chosen": -402.0,
"logps/rejected": -378.0,
"loss": 0.2111,
"rewards/accuracies": 0.8984375,
"rewards/chosen": -0.78125,
"rewards/margins": 8.0625,
"rewards/rejected": -8.875,
"step": 788
},
{
"epoch": 0.9680981595092024,
"grad_norm": 27.6408264153912,
"learning_rate": 1.368595041322314e-06,
"logits/chosen": 0.076171875,
"logits/rejected": -0.10546875,
"logps/chosen": -400.0,
"logps/rejected": -350.0,
"loss": 0.4365,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -2.15625,
"rewards/margins": 7.0,
"rewards/rejected": -9.1875,
"step": 789
},
{
"epoch": 0.9693251533742331,
"grad_norm": 29.798816940792484,
"learning_rate": 1.3677685950413222e-06,
"logits/chosen": -0.06640625,
"logits/rejected": -0.2734375,
"logps/chosen": -402.0,
"logps/rejected": -348.0,
"loss": 0.2237,
"rewards/accuracies": 0.90625,
"rewards/chosen": -1.609375,
"rewards/margins": 7.46875,
"rewards/rejected": -9.0625,
"step": 790
},
{
"epoch": 0.9705521472392638,
"grad_norm": 31.358117893593867,
"learning_rate": 1.3669421487603304e-06,
"logits/chosen": -0.0693359375,
"logits/rejected": -0.26171875,
"logps/chosen": -412.0,
"logps/rejected": -360.0,
"loss": 0.4102,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.0546875,
"rewards/margins": 8.3125,
"rewards/rejected": -9.375,
"step": 791
},
{
"epoch": 0.9717791411042945,
"grad_norm": 29.723517426719823,
"learning_rate": 1.3661157024793388e-06,
"logits/chosen": -0.037109375,
"logits/rejected": -0.1650390625,
"logps/chosen": -454.0,
"logps/rejected": -390.0,
"loss": 0.4537,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.1875,
"rewards/margins": 6.9375,
"rewards/rejected": -8.125,
"step": 792
},
{
"epoch": 0.9730061349693252,
"grad_norm": 29.941763131336998,
"learning_rate": 1.365289256198347e-06,
"logits/chosen": -0.01611328125,
"logits/rejected": -0.14453125,
"logps/chosen": -408.0,
"logps/rejected": -376.0,
"loss": 0.4007,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.6953125,
"rewards/margins": 6.6875,
"rewards/rejected": -8.375,
"step": 793
},
{
"epoch": 0.9742331288343559,
"grad_norm": 32.53853431959141,
"learning_rate": 1.3644628099173554e-06,
"logits/chosen": 0.035400390625,
"logits/rejected": -0.08935546875,
"logps/chosen": -374.0,
"logps/rejected": -352.0,
"loss": 0.5349,
"rewards/accuracies": 0.8203125,
"rewards/chosen": -2.21875,
"rewards/margins": 6.5625,
"rewards/rejected": -8.75,
"step": 794
},
{
"epoch": 0.9754601226993865,
"grad_norm": 21.371634989628767,
"learning_rate": 1.3636363636363634e-06,
"logits/chosen": -0.185546875,
"logits/rejected": -0.330078125,
"logps/chosen": -406.0,
"logps/rejected": -384.0,
"loss": 0.3106,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.5625,
"rewards/margins": 9.1875,
"rewards/rejected": -9.75,
"step": 795
},
{
"epoch": 0.9766871165644172,
"grad_norm": 33.741391271868395,
"learning_rate": 1.3628099173553718e-06,
"logits/chosen": -0.0654296875,
"logits/rejected": -0.26171875,
"logps/chosen": -426.0,
"logps/rejected": -354.0,
"loss": 0.3692,
"rewards/accuracies": 0.890625,
"rewards/chosen": -2.484375,
"rewards/margins": 7.125,
"rewards/rejected": -9.625,
"step": 796
},
{
"epoch": 0.9779141104294479,
"grad_norm": 23.345670575024723,
"learning_rate": 1.36198347107438e-06,
"logits/chosen": 0.01483154296875,
"logits/rejected": -0.1650390625,
"logps/chosen": -424.0,
"logps/rejected": -344.0,
"loss": 0.2477,
"rewards/accuracies": 0.890625,
"rewards/chosen": -2.078125,
"rewards/margins": 7.15625,
"rewards/rejected": -9.25,
"step": 797
},
{
"epoch": 0.9791411042944785,
"grad_norm": 33.658901557419405,
"learning_rate": 1.3611570247933884e-06,
"logits/chosen": -0.03369140625,
"logits/rejected": -0.20703125,
"logps/chosen": -446.0,
"logps/rejected": -394.0,
"loss": 0.3878,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.4453125,
"rewards/margins": 7.875,
"rewards/rejected": -9.3125,
"step": 798
},
{
"epoch": 0.9803680981595092,
"grad_norm": 29.15355444814546,
"learning_rate": 1.3603305785123966e-06,
"logits/chosen": -0.08935546875,
"logits/rejected": -0.2451171875,
"logps/chosen": -418.0,
"logps/rejected": -382.0,
"loss": 0.361,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -1.4765625,
"rewards/margins": 7.96875,
"rewards/rejected": -9.4375,
"step": 799
},
{
"epoch": 0.9815950920245399,
"grad_norm": 29.90426744282101,
"learning_rate": 1.359504132231405e-06,
"logits/chosen": -0.055908203125,
"logits/rejected": -0.2412109375,
"logps/chosen": -402.0,
"logps/rejected": -362.0,
"loss": 0.335,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.59375,
"rewards/margins": 7.46875,
"rewards/rejected": -9.0625,
"step": 800
},
{
"epoch": 0.9828220858895705,
"grad_norm": 33.28235046112419,
"learning_rate": 1.3586776859504132e-06,
"logits/chosen": -0.061279296875,
"logits/rejected": -0.21484375,
"logps/chosen": -454.0,
"logps/rejected": -400.0,
"loss": 0.4711,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.8359375,
"rewards/margins": 6.71875,
"rewards/rejected": -8.5625,
"step": 801
},
{
"epoch": 0.9840490797546012,
"grad_norm": 33.439121725020144,
"learning_rate": 1.3578512396694216e-06,
"logits/chosen": -0.11865234375,
"logits/rejected": -0.259765625,
"logps/chosen": -404.0,
"logps/rejected": -366.0,
"loss": 0.5122,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.875,
"rewards/margins": 6.96875,
"rewards/rejected": -8.8125,
"step": 802
},
{
"epoch": 0.9852760736196319,
"grad_norm": 28.780793215852647,
"learning_rate": 1.3570247933884298e-06,
"logits/chosen": -0.1826171875,
"logits/rejected": -0.3359375,
"logps/chosen": -414.0,
"logps/rejected": -364.0,
"loss": 0.3669,
"rewards/accuracies": 0.828125,
"rewards/chosen": -1.0,
"rewards/margins": 7.78125,
"rewards/rejected": -8.75,
"step": 803
},
{
"epoch": 0.9865030674846625,
"grad_norm": 30.526208765254125,
"learning_rate": 1.356198347107438e-06,
"logits/chosen": 0.004180908203125,
"logits/rejected": -0.107421875,
"logps/chosen": -378.0,
"logps/rejected": -364.0,
"loss": 0.3932,
"rewards/accuracies": 0.84375,
"rewards/chosen": -2.265625,
"rewards/margins": 6.90625,
"rewards/rejected": -9.1875,
"step": 804
},
{
"epoch": 0.9877300613496932,
"grad_norm": 31.397135878242935,
"learning_rate": 1.3553719008264461e-06,
"logits/chosen": -0.11181640625,
"logits/rejected": -0.2451171875,
"logps/chosen": -452.0,
"logps/rejected": -412.0,
"loss": 0.5187,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.4375,
"rewards/margins": 7.8125,
"rewards/rejected": -9.25,
"step": 805
},
{
"epoch": 0.9889570552147239,
"grad_norm": 31.9035120566701,
"learning_rate": 1.3545454545454545e-06,
"logits/chosen": 0.12109375,
"logits/rejected": -0.004241943359375,
"logps/chosen": -432.0,
"logps/rejected": -404.0,
"loss": 0.4677,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.7265625,
"rewards/margins": 7.15625,
"rewards/rejected": -8.875,
"step": 806
},
{
"epoch": 0.9901840490797545,
"grad_norm": 32.3834218507154,
"learning_rate": 1.3537190082644627e-06,
"logits/chosen": 0.02294921875,
"logits/rejected": -0.1279296875,
"logps/chosen": -418.0,
"logps/rejected": -370.0,
"loss": 0.427,
"rewards/accuracies": 0.8671875,
"rewards/chosen": -1.375,
"rewards/margins": 8.4375,
"rewards/rejected": -9.8125,
"step": 807
},
{
"epoch": 0.9914110429447853,
"grad_norm": 26.16505359058739,
"learning_rate": 1.352892561983471e-06,
"logits/chosen": -0.11279296875,
"logits/rejected": -0.1298828125,
"logps/chosen": -382.0,
"logps/rejected": -372.0,
"loss": 0.3583,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -2.265625,
"rewards/margins": 7.78125,
"rewards/rejected": -10.0625,
"step": 808
},
{
"epoch": 0.992638036809816,
"grad_norm": 30.884948310504473,
"learning_rate": 1.3520661157024793e-06,
"logits/chosen": -0.041259765625,
"logits/rejected": -0.263671875,
"logps/chosen": -454.0,
"logps/rejected": -378.0,
"loss": 0.3529,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -0.8515625,
"rewards/margins": 8.6875,
"rewards/rejected": -9.5625,
"step": 809
},
{
"epoch": 0.9938650306748467,
"grad_norm": 24.2565802115778,
"learning_rate": 1.3512396694214875e-06,
"logits/chosen": -0.1435546875,
"logits/rejected": -0.310546875,
"logps/chosen": -462.0,
"logps/rejected": -402.0,
"loss": 0.2396,
"rewards/accuracies": 0.890625,
"rewards/chosen": -1.25,
"rewards/margins": 8.125,
"rewards/rejected": -9.375,
"step": 810
},
{
"epoch": 0.9950920245398773,
"grad_norm": 25.407958302423644,
"learning_rate": 1.350413223140496e-06,
"logits/chosen": -0.1162109375,
"logits/rejected": -0.2470703125,
"logps/chosen": -412.0,
"logps/rejected": -398.0,
"loss": 0.3705,
"rewards/accuracies": 0.84375,
"rewards/chosen": -1.4140625,
"rewards/margins": 7.53125,
"rewards/rejected": -8.9375,
"step": 811
},
{
"epoch": 0.996319018404908,
"grad_norm": 34.05939574037828,
"learning_rate": 1.349586776859504e-06,
"logits/chosen": -0.0888671875,
"logits/rejected": -0.1572265625,
"logps/chosen": -378.0,
"logps/rejected": -356.0,
"loss": 0.4438,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -1.671875,
"rewards/margins": 7.71875,
"rewards/rejected": -9.375,
"step": 812
},
{
"epoch": 0.9975460122699387,
"grad_norm": 25.330838160708396,
"learning_rate": 1.3487603305785123e-06,
"logits/chosen": -0.0194091796875,
"logits/rejected": -0.15234375,
"logps/chosen": -356.0,
"logps/rejected": -350.0,
"loss": 0.2459,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.93359375,
"rewards/margins": 7.875,
"rewards/rejected": -8.8125,
"step": 813
},
{
"epoch": 0.9987730061349693,
"grad_norm": 30.50590414254102,
"learning_rate": 1.3479338842975205e-06,
"logits/chosen": 0.01202392578125,
"logits/rejected": -0.06689453125,
"logps/chosen": -404.0,
"logps/rejected": -390.0,
"loss": 0.3759,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -2.453125,
"rewards/margins": 6.46875,
"rewards/rejected": -8.9375,
"step": 814
},
{
"epoch": 1.0,
"grad_norm": 28.53278445551448,
"learning_rate": 1.3471074380165289e-06,
"logits/chosen": 0.087890625,
"logits/rejected": -0.1025390625,
"logps/chosen": -402.0,
"logps/rejected": -382.0,
"loss": 0.247,
"rewards/accuracies": 0.8823530077934265,
"rewards/chosen": -1.6328125,
"rewards/margins": 7.9375,
"rewards/rejected": -9.5625,
"step": 815
},
{
"epoch": 1.0012269938650307,
"grad_norm": 5.788908987319821,
"learning_rate": 1.346280991735537e-06,
"logits/chosen": 0.01031494140625,
"logits/rejected": -0.12890625,
"logps/chosen": -392.0,
"logps/rejected": -354.0,
"loss": 0.0346,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.37109375,
"rewards/margins": 9.9375,
"rewards/rejected": -10.3125,
"step": 816
},
{
"epoch": 1.0024539877300613,
"grad_norm": 8.697184625477801,
"learning_rate": 1.3454545454545455e-06,
"logits/chosen": -0.00604248046875,
"logits/rejected": -0.154296875,
"logps/chosen": -376.0,
"logps/rejected": -354.0,
"loss": 0.0454,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.77734375,
"rewards/margins": 9.25,
"rewards/rejected": -10.0625,
"step": 817
},
{
"epoch": 1.003680981595092,
"grad_norm": 5.742008660241724,
"learning_rate": 1.3446280991735536e-06,
"logits/chosen": -0.134765625,
"logits/rejected": -0.2158203125,
"logps/chosen": -376.0,
"logps/rejected": -382.0,
"loss": 0.0324,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.09228515625,
"rewards/margins": 9.9375,
"rewards/rejected": -10.0,
"step": 818
},
{
"epoch": 1.0049079754601227,
"grad_norm": 6.150716954787426,
"learning_rate": 1.343801652892562e-06,
"logits/chosen": 0.00714111328125,
"logits/rejected": -0.166015625,
"logps/chosen": -404.0,
"logps/rejected": -388.0,
"loss": 0.027,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.006439208984375,
"rewards/margins": 10.625,
"rewards/rejected": -10.625,
"step": 819
},
{
"epoch": 1.0061349693251533,
"grad_norm": 5.863008957712078,
"learning_rate": 1.3429752066115702e-06,
"logits/chosen": 0.041259765625,
"logits/rejected": -0.08203125,
"logps/chosen": -414.0,
"logps/rejected": -380.0,
"loss": 0.0265,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.08544921875,
"rewards/margins": 9.875,
"rewards/rejected": -9.9375,
"step": 820
},
{
"epoch": 1.007361963190184,
"grad_norm": 13.28418747108858,
"learning_rate": 1.3421487603305786e-06,
"logits/chosen": -0.05029296875,
"logits/rejected": -0.1728515625,
"logps/chosen": -364.0,
"logps/rejected": -362.0,
"loss": 0.0861,
"rewards/accuracies": 0.9765625,
"rewards/chosen": 0.041748046875,
"rewards/margins": 10.0,
"rewards/rejected": -9.9375,
"step": 821
},
{
"epoch": 1.0085889570552147,
"grad_norm": 15.022810643238998,
"learning_rate": 1.3413223140495866e-06,
"logits/chosen": -0.04296875,
"logits/rejected": -0.173828125,
"logps/chosen": -422.0,
"logps/rejected": -392.0,
"loss": 0.0615,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -0.06689453125,
"rewards/margins": 9.5,
"rewards/rejected": -9.5625,
"step": 822
},
{
"epoch": 1.0098159509202453,
"grad_norm": 11.51053203290327,
"learning_rate": 1.340495867768595e-06,
"logits/chosen": -0.018310546875,
"logits/rejected": -0.197265625,
"logps/chosen": -380.0,
"logps/rejected": -374.0,
"loss": 0.0476,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.1318359375,
"rewards/margins": 10.1875,
"rewards/rejected": -10.0625,
"step": 823
},
{
"epoch": 1.011042944785276,
"grad_norm": 12.791890120895983,
"learning_rate": 1.3396694214876032e-06,
"logits/chosen": -0.09521484375,
"logits/rejected": -0.232421875,
"logps/chosen": -396.0,
"logps/rejected": -384.0,
"loss": 0.0378,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.16015625,
"rewards/margins": 9.25,
"rewards/rejected": -9.125,
"step": 824
},
{
"epoch": 1.0122699386503067,
"grad_norm": 8.030022327829245,
"learning_rate": 1.3388429752066116e-06,
"logits/chosen": 0.08984375,
"logits/rejected": -0.1728515625,
"logps/chosen": -412.0,
"logps/rejected": -378.0,
"loss": 0.0348,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.1142578125,
"rewards/margins": 10.0,
"rewards/rejected": -10.125,
"step": 825
},
{
"epoch": 1.0134969325153373,
"grad_norm": 17.49835332495942,
"learning_rate": 1.3380165289256198e-06,
"logits/chosen": -0.1142578125,
"logits/rejected": -0.25,
"logps/chosen": -388.0,
"logps/rejected": -376.0,
"loss": 0.1191,
"rewards/accuracies": 0.9453125,
"rewards/chosen": -0.341796875,
"rewards/margins": 9.4375,
"rewards/rejected": -9.75,
"step": 826
},
{
"epoch": 1.014723926380368,
"grad_norm": 8.286688878591844,
"learning_rate": 1.337190082644628e-06,
"logits/chosen": -0.03515625,
"logits/rejected": -0.1435546875,
"logps/chosen": -362.0,
"logps/rejected": -358.0,
"loss": 0.042,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.046875,
"rewards/margins": 8.75,
"rewards/rejected": -9.8125,
"step": 827
},
{
"epoch": 1.0159509202453987,
"grad_norm": 4.526592144175515,
"learning_rate": 1.3363636363636364e-06,
"logits/chosen": 0.10107421875,
"logits/rejected": -0.08935546875,
"logps/chosen": -398.0,
"logps/rejected": -352.0,
"loss": 0.0304,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.5,
"rewards/margins": 9.3125,
"rewards/rejected": -9.8125,
"step": 828
},
{
"epoch": 1.0171779141104293,
"grad_norm": 12.437406803058959,
"learning_rate": 1.3355371900826446e-06,
"logits/chosen": -0.173828125,
"logits/rejected": -0.2158203125,
"logps/chosen": -388.0,
"logps/rejected": -400.0,
"loss": 0.063,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3203125,
"rewards/margins": 10.125,
"rewards/rejected": -9.8125,
"step": 829
},
{
"epoch": 1.01840490797546,
"grad_norm": 6.685346021125586,
"learning_rate": 1.334710743801653e-06,
"logits/chosen": -0.09619140625,
"logits/rejected": -0.28515625,
"logps/chosen": -422.0,
"logps/rejected": -396.0,
"loss": 0.0336,
"rewards/accuracies": 0.9921875,
"rewards/chosen": 0.97265625,
"rewards/margins": 11.1875,
"rewards/rejected": -10.1875,
"step": 830
},
{
"epoch": 1.019631901840491,
"grad_norm": 16.99015772568169,
"learning_rate": 1.333884297520661e-06,
"logits/chosen": -0.0732421875,
"logits/rejected": -0.1259765625,
"logps/chosen": -416.0,
"logps/rejected": -420.0,
"loss": 0.0807,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.416015625,
"rewards/margins": 11.375,
"rewards/rejected": -10.9375,
"step": 831
},
{
"epoch": 1.0208588957055216,
"grad_norm": 11.431723848321804,
"learning_rate": 1.3330578512396693e-06,
"logits/chosen": -0.0693359375,
"logits/rejected": -0.26953125,
"logps/chosen": -418.0,
"logps/rejected": -396.0,
"loss": 0.0482,
"rewards/accuracies": 0.9765625,
"rewards/chosen": 0.0250244140625,
"rewards/margins": 9.75,
"rewards/rejected": -9.6875,
"step": 832
},
{
"epoch": 1.0220858895705522,
"grad_norm": 16.58275538607598,
"learning_rate": 1.3322314049586775e-06,
"logits/chosen": -0.1376953125,
"logits/rejected": -0.291015625,
"logps/chosen": -458.0,
"logps/rejected": -416.0,
"loss": 0.0991,
"rewards/accuracies": 0.9921875,
"rewards/chosen": 0.1748046875,
"rewards/margins": 10.125,
"rewards/rejected": -9.9375,
"step": 833
},
{
"epoch": 1.023312883435583,
"grad_norm": 9.686701105258097,
"learning_rate": 1.331404958677686e-06,
"logits/chosen": -0.0172119140625,
"logits/rejected": -0.043212890625,
"logps/chosen": -370.0,
"logps/rejected": -380.0,
"loss": 0.0331,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.125,
"rewards/margins": 9.1875,
"rewards/rejected": -10.3125,
"step": 834
},
{
"epoch": 1.0245398773006136,
"grad_norm": 16.391027647227297,
"learning_rate": 1.3305785123966941e-06,
"logits/chosen": 0.029541015625,
"logits/rejected": -0.1787109375,
"logps/chosen": -428.0,
"logps/rejected": -416.0,
"loss": 0.0722,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.482421875,
"rewards/margins": 10.0625,
"rewards/rejected": -10.5625,
"step": 835
},
{
"epoch": 1.0257668711656442,
"grad_norm": 20.046891618112777,
"learning_rate": 1.3297520661157025e-06,
"logits/chosen": -0.06982421875,
"logits/rejected": -0.1484375,
"logps/chosen": -386.0,
"logps/rejected": -386.0,
"loss": 0.1107,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -0.2216796875,
"rewards/margins": 10.4375,
"rewards/rejected": -10.6875,
"step": 836
},
{
"epoch": 1.026993865030675,
"grad_norm": 7.709008126462052,
"learning_rate": 1.3289256198347107e-06,
"logits/chosen": 0.083984375,
"logits/rejected": -0.16796875,
"logps/chosen": -458.0,
"logps/rejected": -422.0,
"loss": 0.0381,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.41015625,
"rewards/margins": 10.4375,
"rewards/rejected": -10.8125,
"step": 837
},
{
"epoch": 1.0282208588957056,
"grad_norm": 15.911547986783308,
"learning_rate": 1.328099173553719e-06,
"logits/chosen": -0.07177734375,
"logits/rejected": -0.251953125,
"logps/chosen": -404.0,
"logps/rejected": -398.0,
"loss": 0.073,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.77734375,
"rewards/margins": 10.5,
"rewards/rejected": -11.25,
"step": 838
},
{
"epoch": 1.0294478527607362,
"grad_norm": 17.686745572720934,
"learning_rate": 1.3272727272727273e-06,
"logits/chosen": -0.02294921875,
"logits/rejected": -0.1640625,
"logps/chosen": -414.0,
"logps/rejected": -406.0,
"loss": 0.0674,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -0.79296875,
"rewards/margins": 10.625,
"rewards/rejected": -11.4375,
"step": 839
},
{
"epoch": 1.030674846625767,
"grad_norm": 16.5579708094439,
"learning_rate": 1.3264462809917355e-06,
"logits/chosen": -0.043701171875,
"logits/rejected": -0.2734375,
"logps/chosen": -460.0,
"logps/rejected": -436.0,
"loss": 0.0549,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.52734375,
"rewards/margins": 11.875,
"rewards/rejected": -12.375,
"step": 840
},
{
"epoch": 1.0319018404907976,
"grad_norm": 9.374559144151373,
"learning_rate": 1.3256198347107437e-06,
"logits/chosen": 0.0257568359375,
"logits/rejected": -0.125,
"logps/chosen": -402.0,
"logps/rejected": -418.0,
"loss": 0.0677,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.4140625,
"rewards/margins": 10.875,
"rewards/rejected": -12.25,
"step": 841
},
{
"epoch": 1.0331288343558283,
"grad_norm": 6.844859088271391,
"learning_rate": 1.324793388429752e-06,
"logits/chosen": -0.06640625,
"logits/rejected": -0.1865234375,
"logps/chosen": -476.0,
"logps/rejected": -390.0,
"loss": 0.0414,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.46875,
"rewards/margins": 10.6875,
"rewards/rejected": -12.1875,
"step": 842
},
{
"epoch": 1.034355828220859,
"grad_norm": 15.343682501752589,
"learning_rate": 1.3239669421487603e-06,
"logits/chosen": -0.06201171875,
"logits/rejected": -0.1826171875,
"logps/chosen": -480.0,
"logps/rejected": -440.0,
"loss": 0.0889,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.5,
"rewards/margins": 11.0625,
"rewards/rejected": -12.5625,
"step": 843
},
{
"epoch": 1.0355828220858896,
"grad_norm": 11.926860809694226,
"learning_rate": 1.3231404958677684e-06,
"logits/chosen": 0.039306640625,
"logits/rejected": -0.1796875,
"logps/chosen": -452.0,
"logps/rejected": -412.0,
"loss": 0.0428,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.67578125,
"rewards/margins": 12.75,
"rewards/rejected": -13.4375,
"step": 844
},
{
"epoch": 1.0368098159509203,
"grad_norm": 7.092484849007815,
"learning_rate": 1.3223140495867768e-06,
"logits/chosen": -0.033203125,
"logits/rejected": -0.1416015625,
"logps/chosen": -396.0,
"logps/rejected": -382.0,
"loss": 0.0267,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.75,
"rewards/margins": 10.0,
"rewards/rejected": -11.75,
"step": 845
},
{
"epoch": 1.038036809815951,
"grad_norm": 8.395431032730178,
"learning_rate": 1.321487603305785e-06,
"logits/chosen": 0.0693359375,
"logits/rejected": -0.1416015625,
"logps/chosen": -448.0,
"logps/rejected": -386.0,
"loss": 0.0429,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.484375,
"rewards/margins": 11.875,
"rewards/rejected": -13.375,
"step": 846
},
{
"epoch": 1.0392638036809816,
"grad_norm": 9.116821917662776,
"learning_rate": 1.3206611570247934e-06,
"logits/chosen": 0.04931640625,
"logits/rejected": -0.11083984375,
"logps/chosen": -402.0,
"logps/rejected": -402.0,
"loss": 0.0375,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.3125,
"rewards/margins": 10.5625,
"rewards/rejected": -12.875,
"step": 847
},
{
"epoch": 1.0404907975460123,
"grad_norm": 3.865755311086331,
"learning_rate": 1.3198347107438014e-06,
"logits/chosen": -0.056640625,
"logits/rejected": -0.1552734375,
"logps/chosen": -382.0,
"logps/rejected": -398.0,
"loss": 0.0224,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.515625,
"rewards/margins": 11.5,
"rewards/rejected": -14.0,
"step": 848
},
{
"epoch": 1.041717791411043,
"grad_norm": 14.30080337286753,
"learning_rate": 1.3190082644628098e-06,
"logits/chosen": -0.005218505859375,
"logits/rejected": -0.08056640625,
"logps/chosen": -418.0,
"logps/rejected": -464.0,
"loss": 0.0845,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.328125,
"rewards/margins": 11.375,
"rewards/rejected": -14.75,
"step": 849
},
{
"epoch": 1.0429447852760736,
"grad_norm": 9.515634879793929,
"learning_rate": 1.318181818181818e-06,
"logits/chosen": -0.03369140625,
"logits/rejected": -0.267578125,
"logps/chosen": -406.0,
"logps/rejected": -408.0,
"loss": 0.0381,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.40625,
"rewards/margins": 11.5625,
"rewards/rejected": -14.0,
"step": 850
},
{
"epoch": 1.0441717791411043,
"grad_norm": 2.7291849020374754,
"learning_rate": 1.3173553719008264e-06,
"logits/chosen": -0.0810546875,
"logits/rejected": -0.28515625,
"logps/chosen": -412.0,
"logps/rejected": -434.0,
"loss": 0.0096,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.34375,
"rewards/margins": 12.0,
"rewards/rejected": -14.375,
"step": 851
},
{
"epoch": 1.045398773006135,
"grad_norm": 3.7138511500625406,
"learning_rate": 1.3165289256198346e-06,
"logits/chosen": -0.142578125,
"logits/rejected": -0.291015625,
"logps/chosen": -464.0,
"logps/rejected": -458.0,
"loss": 0.0174,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.3125,
"rewards/margins": 11.625,
"rewards/rejected": -13.9375,
"step": 852
},
{
"epoch": 1.0466257668711656,
"grad_norm": 4.925467253309806,
"learning_rate": 1.315702479338843e-06,
"logits/chosen": -0.05859375,
"logits/rejected": -0.1640625,
"logps/chosen": -444.0,
"logps/rejected": -414.0,
"loss": 0.0179,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.078125,
"rewards/margins": 11.5625,
"rewards/rejected": -13.6875,
"step": 853
},
{
"epoch": 1.0478527607361963,
"grad_norm": 22.411530083884138,
"learning_rate": 1.3148760330578512e-06,
"logits/chosen": 0.03759765625,
"logits/rejected": -0.09814453125,
"logps/chosen": -426.0,
"logps/rejected": -426.0,
"loss": 0.1408,
"rewards/accuracies": 0.953125,
"rewards/chosen": -2.765625,
"rewards/margins": 10.1875,
"rewards/rejected": -12.9375,
"step": 854
},
{
"epoch": 1.049079754601227,
"grad_norm": 6.4786052852219775,
"learning_rate": 1.3140495867768596e-06,
"logits/chosen": 0.09814453125,
"logits/rejected": -0.05224609375,
"logps/chosen": -426.0,
"logps/rejected": -448.0,
"loss": 0.0353,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.40625,
"rewards/margins": 11.625,
"rewards/rejected": -13.0,
"step": 855
},
{
"epoch": 1.0503067484662576,
"grad_norm": 5.973518916812513,
"learning_rate": 1.3132231404958678e-06,
"logits/chosen": -0.01043701171875,
"logits/rejected": -0.1923828125,
"logps/chosen": -430.0,
"logps/rejected": -394.0,
"loss": 0.0274,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.2421875,
"rewards/margins": 11.25,
"rewards/rejected": -12.5,
"step": 856
},
{
"epoch": 1.0515337423312883,
"grad_norm": 5.456709479494061,
"learning_rate": 1.312396694214876e-06,
"logits/chosen": -0.1259765625,
"logits/rejected": -0.298828125,
"logps/chosen": -422.0,
"logps/rejected": -412.0,
"loss": 0.0259,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.8203125,
"rewards/margins": 11.625,
"rewards/rejected": -12.4375,
"step": 857
},
{
"epoch": 1.052760736196319,
"grad_norm": 9.852424035696899,
"learning_rate": 1.3115702479338841e-06,
"logits/chosen": 0.00531005859375,
"logits/rejected": -0.0595703125,
"logps/chosen": -342.0,
"logps/rejected": -360.0,
"loss": 0.0413,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.71875,
"rewards/margins": 11.6875,
"rewards/rejected": -13.4375,
"step": 858
},
{
"epoch": 1.0539877300613496,
"grad_norm": 11.583750763906302,
"learning_rate": 1.3107438016528925e-06,
"logits/chosen": -0.040771484375,
"logits/rejected": -0.255859375,
"logps/chosen": -416.0,
"logps/rejected": -380.0,
"loss": 0.0666,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.265625,
"rewards/margins": 11.5,
"rewards/rejected": -12.75,
"step": 859
},
{
"epoch": 1.0552147239263803,
"grad_norm": 9.827193256235123,
"learning_rate": 1.3099173553719007e-06,
"logits/chosen": 0.04833984375,
"logits/rejected": -0.1650390625,
"logps/chosen": -432.0,
"logps/rejected": -412.0,
"loss": 0.0489,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.03125,
"rewards/margins": 10.125,
"rewards/rejected": -12.1875,
"step": 860
},
{
"epoch": 1.056441717791411,
"grad_norm": 8.972662560553697,
"learning_rate": 1.3090909090909091e-06,
"logits/chosen": 0.00457763671875,
"logits/rejected": -0.1904296875,
"logps/chosen": -418.0,
"logps/rejected": -380.0,
"loss": 0.0318,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.80078125,
"rewards/margins": 11.0625,
"rewards/rejected": -11.875,
"step": 861
},
{
"epoch": 1.0576687116564418,
"grad_norm": 15.67835032114997,
"learning_rate": 1.3082644628099173e-06,
"logits/chosen": -0.1220703125,
"logits/rejected": -0.19921875,
"logps/chosen": -402.0,
"logps/rejected": -402.0,
"loss": 0.0678,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.9453125,
"rewards/margins": 11.0625,
"rewards/rejected": -13.0,
"step": 862
},
{
"epoch": 1.0588957055214725,
"grad_norm": 8.109733874609805,
"learning_rate": 1.3074380165289255e-06,
"logits/chosen": -0.1318359375,
"logits/rejected": -0.34765625,
"logps/chosen": -440.0,
"logps/rejected": -426.0,
"loss": 0.0251,
"rewards/accuracies": 0.9921875,
"rewards/chosen": 0.412109375,
"rewards/margins": 12.8125,
"rewards/rejected": -12.375,
"step": 863
},
{
"epoch": 1.0601226993865032,
"grad_norm": 2.8617240293125077,
"learning_rate": 1.306611570247934e-06,
"logits/chosen": -0.052978515625,
"logits/rejected": -0.2470703125,
"logps/chosen": -394.0,
"logps/rejected": -410.0,
"loss": 0.0159,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.99609375,
"rewards/margins": 11.75,
"rewards/rejected": -12.75,
"step": 864
},
{
"epoch": 1.0613496932515338,
"grad_norm": 6.342988680233583,
"learning_rate": 1.305785123966942e-06,
"logits/chosen": -0.2119140625,
"logits/rejected": -0.310546875,
"logps/chosen": -446.0,
"logps/rejected": -390.0,
"loss": 0.0269,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.0625,
"rewards/margins": 11.4375,
"rewards/rejected": -12.5,
"step": 865
},
{
"epoch": 1.0625766871165645,
"grad_norm": 9.676853178030932,
"learning_rate": 1.3049586776859503e-06,
"logits/chosen": -0.1689453125,
"logits/rejected": -0.353515625,
"logps/chosen": -364.0,
"logps/rejected": -384.0,
"loss": 0.0484,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.384765625,
"rewards/margins": 11.9375,
"rewards/rejected": -12.375,
"step": 866
},
{
"epoch": 1.0638036809815952,
"grad_norm": 6.86376081456906,
"learning_rate": 1.3041322314049585e-06,
"logits/chosen": -0.11474609375,
"logits/rejected": -0.26171875,
"logps/chosen": -450.0,
"logps/rejected": -398.0,
"loss": 0.0442,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.453125,
"rewards/margins": 10.375,
"rewards/rejected": -11.875,
"step": 867
},
{
"epoch": 1.0650306748466258,
"grad_norm": 13.494921556285234,
"learning_rate": 1.3033057851239669e-06,
"logits/chosen": 0.11181640625,
"logits/rejected": -0.08642578125,
"logps/chosen": -374.0,
"logps/rejected": -350.0,
"loss": 0.0612,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.5625,
"rewards/margins": 10.0,
"rewards/rejected": -11.5625,
"step": 868
},
{
"epoch": 1.0662576687116565,
"grad_norm": 11.31535114702991,
"learning_rate": 1.302479338842975e-06,
"logits/chosen": -0.107421875,
"logits/rejected": -0.228515625,
"logps/chosen": -428.0,
"logps/rejected": -420.0,
"loss": 0.0434,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.25,
"rewards/margins": 11.625,
"rewards/rejected": -12.875,
"step": 869
},
{
"epoch": 1.0674846625766872,
"grad_norm": 17.308246619390637,
"learning_rate": 1.3016528925619835e-06,
"logits/chosen": 0.0439453125,
"logits/rejected": -0.1318359375,
"logps/chosen": -406.0,
"logps/rejected": -400.0,
"loss": 0.0851,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.1171875,
"rewards/margins": 11.5,
"rewards/rejected": -12.625,
"step": 870
},
{
"epoch": 1.0687116564417178,
"grad_norm": 12.453448936699616,
"learning_rate": 1.3008264462809916e-06,
"logits/chosen": 0.05810546875,
"logits/rejected": -0.10888671875,
"logps/chosen": -428.0,
"logps/rejected": -392.0,
"loss": 0.0575,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.6640625,
"rewards/margins": 10.4375,
"rewards/rejected": -12.0625,
"step": 871
},
{
"epoch": 1.0699386503067485,
"grad_norm": 9.049294109604224,
"learning_rate": 1.3e-06,
"logits/chosen": 0.02294921875,
"logits/rejected": -0.10107421875,
"logps/chosen": -434.0,
"logps/rejected": -362.0,
"loss": 0.0312,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.1796875,
"rewards/margins": 10.75,
"rewards/rejected": -11.9375,
"step": 872
},
{
"epoch": 1.0711656441717792,
"grad_norm": 8.97823587253812,
"learning_rate": 1.2991735537190082e-06,
"logits/chosen": -0.064453125,
"logits/rejected": -0.2216796875,
"logps/chosen": -394.0,
"logps/rejected": -418.0,
"loss": 0.0487,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.7265625,
"rewards/margins": 12.5,
"rewards/rejected": -13.1875,
"step": 873
},
{
"epoch": 1.0723926380368098,
"grad_norm": 20.804782732106812,
"learning_rate": 1.2983471074380166e-06,
"logits/chosen": -0.09814453125,
"logits/rejected": -0.2255859375,
"logps/chosen": -452.0,
"logps/rejected": -436.0,
"loss": 0.1232,
"rewards/accuracies": 0.953125,
"rewards/chosen": -0.52734375,
"rewards/margins": 12.0625,
"rewards/rejected": -12.625,
"step": 874
},
{
"epoch": 1.0736196319018405,
"grad_norm": 8.305071581325844,
"learning_rate": 1.2975206611570246e-06,
"logits/chosen": 0.0242919921875,
"logits/rejected": -0.1279296875,
"logps/chosen": -374.0,
"logps/rejected": -412.0,
"loss": 0.0385,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.421875,
"rewards/margins": 10.9375,
"rewards/rejected": -12.375,
"step": 875
},
{
"epoch": 1.0748466257668712,
"grad_norm": 6.888284555099352,
"learning_rate": 1.296694214876033e-06,
"logits/chosen": -0.10595703125,
"logits/rejected": -0.28515625,
"logps/chosen": -440.0,
"logps/rejected": -446.0,
"loss": 0.0234,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.4921875,
"rewards/margins": 12.25,
"rewards/rejected": -13.75,
"step": 876
},
{
"epoch": 1.0760736196319018,
"grad_norm": 3.514889904551701,
"learning_rate": 1.2958677685950412e-06,
"logits/chosen": 0.0869140625,
"logits/rejected": -0.059326171875,
"logps/chosen": -424.0,
"logps/rejected": -396.0,
"loss": 0.0132,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.7265625,
"rewards/margins": 11.0,
"rewards/rejected": -12.75,
"step": 877
},
{
"epoch": 1.0773006134969325,
"grad_norm": 15.028382357150559,
"learning_rate": 1.2950413223140496e-06,
"logits/chosen": -0.08642578125,
"logits/rejected": -0.29296875,
"logps/chosen": -402.0,
"logps/rejected": -410.0,
"loss": 0.0781,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.015625,
"rewards/margins": 11.25,
"rewards/rejected": -13.25,
"step": 878
},
{
"epoch": 1.0785276073619632,
"grad_norm": 5.215036247602813,
"learning_rate": 1.2942148760330578e-06,
"logits/chosen": 0.041748046875,
"logits/rejected": -0.220703125,
"logps/chosen": -430.0,
"logps/rejected": -388.0,
"loss": 0.0177,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.490234375,
"rewards/margins": 11.9375,
"rewards/rejected": -12.4375,
"step": 879
},
{
"epoch": 1.0797546012269938,
"grad_norm": 9.34102612397062,
"learning_rate": 1.293388429752066e-06,
"logits/chosen": 0.0419921875,
"logits/rejected": -0.203125,
"logps/chosen": -366.0,
"logps/rejected": -376.0,
"loss": 0.0457,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.75,
"rewards/margins": 11.5625,
"rewards/rejected": -13.3125,
"step": 880
},
{
"epoch": 1.0809815950920245,
"grad_norm": 12.29195877168792,
"learning_rate": 1.2925619834710744e-06,
"logits/chosen": 0.0908203125,
"logits/rejected": -0.05029296875,
"logps/chosen": -368.0,
"logps/rejected": -348.0,
"loss": 0.0482,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.4140625,
"rewards/margins": 10.0,
"rewards/rejected": -11.4375,
"step": 881
},
{
"epoch": 1.0822085889570552,
"grad_norm": 18.244018217570957,
"learning_rate": 1.2917355371900826e-06,
"logits/chosen": -0.060302734375,
"logits/rejected": -0.2021484375,
"logps/chosen": -418.0,
"logps/rejected": -422.0,
"loss": 0.1025,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -0.2431640625,
"rewards/margins": 11.4375,
"rewards/rejected": -11.6875,
"step": 882
},
{
"epoch": 1.0834355828220859,
"grad_norm": 13.915963438783027,
"learning_rate": 1.290909090909091e-06,
"logits/chosen": -0.10107421875,
"logits/rejected": -0.2236328125,
"logps/chosen": -402.0,
"logps/rejected": -386.0,
"loss": 0.0421,
"rewards/accuracies": 0.9765625,
"rewards/chosen": 0.10302734375,
"rewards/margins": 10.75,
"rewards/rejected": -10.6875,
"step": 883
},
{
"epoch": 1.0846625766871165,
"grad_norm": 10.11378213997985,
"learning_rate": 1.290082644628099e-06,
"logits/chosen": -0.08837890625,
"logits/rejected": -0.2490234375,
"logps/chosen": -442.0,
"logps/rejected": -432.0,
"loss": 0.028,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.51171875,
"rewards/margins": 12.5625,
"rewards/rejected": -12.0625,
"step": 884
},
{
"epoch": 1.0858895705521472,
"grad_norm": 4.138508137248215,
"learning_rate": 1.2892561983471073e-06,
"logits/chosen": -0.007171630859375,
"logits/rejected": -0.1474609375,
"logps/chosen": -404.0,
"logps/rejected": -376.0,
"loss": 0.0271,
"rewards/accuracies": 0.9921875,
"rewards/chosen": 0.142578125,
"rewards/margins": 11.0625,
"rewards/rejected": -10.9375,
"step": 885
},
{
"epoch": 1.0871165644171779,
"grad_norm": 8.274091371317361,
"learning_rate": 1.2884297520661155e-06,
"logits/chosen": 0.0888671875,
"logits/rejected": -0.11328125,
"logps/chosen": -400.0,
"logps/rejected": -412.0,
"loss": 0.0421,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.97265625,
"rewards/margins": 10.4375,
"rewards/rejected": -11.4375,
"step": 886
},
{
"epoch": 1.0883435582822085,
"grad_norm": 9.112369408801136,
"learning_rate": 1.287603305785124e-06,
"logits/chosen": -0.09033203125,
"logits/rejected": -0.2734375,
"logps/chosen": -414.0,
"logps/rejected": -412.0,
"loss": 0.0473,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.333984375,
"rewards/margins": 12.0,
"rewards/rejected": -12.3125,
"step": 887
},
{
"epoch": 1.0895705521472392,
"grad_norm": 9.854679815729673,
"learning_rate": 1.2867768595041321e-06,
"logits/chosen": -0.06689453125,
"logits/rejected": -0.33984375,
"logps/chosen": -412.0,
"logps/rejected": -404.0,
"loss": 0.0298,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.1328125,
"rewards/margins": 11.75,
"rewards/rejected": -11.875,
"step": 888
},
{
"epoch": 1.0907975460122699,
"grad_norm": 16.9455885147046,
"learning_rate": 1.2859504132231405e-06,
"logits/chosen": -0.0247802734375,
"logits/rejected": -0.138671875,
"logps/chosen": -468.0,
"logps/rejected": -446.0,
"loss": 0.0586,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.1005859375,
"rewards/margins": 12.125,
"rewards/rejected": -12.25,
"step": 889
},
{
"epoch": 1.0920245398773005,
"grad_norm": 7.67997087393842,
"learning_rate": 1.2851239669421487e-06,
"logits/chosen": -0.080078125,
"logits/rejected": -0.2060546875,
"logps/chosen": -380.0,
"logps/rejected": -382.0,
"loss": 0.0468,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.37890625,
"rewards/margins": 11.125,
"rewards/rejected": -11.5,
"step": 890
},
{
"epoch": 1.0932515337423312,
"grad_norm": 4.2045422369346745,
"learning_rate": 1.2842975206611571e-06,
"logits/chosen": -0.12060546875,
"logits/rejected": -0.263671875,
"logps/chosen": -382.0,
"logps/rejected": -412.0,
"loss": 0.0254,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.95703125,
"rewards/margins": 11.625,
"rewards/rejected": -12.5625,
"step": 891
},
{
"epoch": 1.0944785276073619,
"grad_norm": 10.513410285587861,
"learning_rate": 1.2834710743801653e-06,
"logits/chosen": -0.0294189453125,
"logits/rejected": -0.26171875,
"logps/chosen": -374.0,
"logps/rejected": -392.0,
"loss": 0.0552,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.4765625,
"rewards/margins": 11.6875,
"rewards/rejected": -13.1875,
"step": 892
},
{
"epoch": 1.0957055214723925,
"grad_norm": 7.81031762086179,
"learning_rate": 1.2826446280991735e-06,
"logits/chosen": -0.07666015625,
"logits/rejected": -0.087890625,
"logps/chosen": -336.0,
"logps/rejected": -360.0,
"loss": 0.0437,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.109375,
"rewards/margins": 10.875,
"rewards/rejected": -11.9375,
"step": 893
},
{
"epoch": 1.0969325153374232,
"grad_norm": 15.642534196874868,
"learning_rate": 1.2818181818181817e-06,
"logits/chosen": -0.056640625,
"logits/rejected": -0.271484375,
"logps/chosen": -458.0,
"logps/rejected": -442.0,
"loss": 0.0821,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.53125,
"rewards/margins": 12.4375,
"rewards/rejected": -13.0,
"step": 894
},
{
"epoch": 1.098159509202454,
"grad_norm": 11.412582814931287,
"learning_rate": 1.28099173553719e-06,
"logits/chosen": -0.0361328125,
"logits/rejected": -0.203125,
"logps/chosen": -406.0,
"logps/rejected": -404.0,
"loss": 0.0432,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.384765625,
"rewards/margins": 11.875,
"rewards/rejected": -12.25,
"step": 895
},
{
"epoch": 1.0993865030674848,
"grad_norm": 11.416860652227472,
"learning_rate": 1.2801652892561983e-06,
"logits/chosen": -0.07763671875,
"logits/rejected": -0.240234375,
"logps/chosen": -386.0,
"logps/rejected": -400.0,
"loss": 0.0462,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.69140625,
"rewards/margins": 11.375,
"rewards/rejected": -12.0625,
"step": 896
},
{
"epoch": 1.1006134969325154,
"grad_norm": 12.564527551772402,
"learning_rate": 1.2793388429752065e-06,
"logits/chosen": -0.10595703125,
"logits/rejected": -0.345703125,
"logps/chosen": -458.0,
"logps/rejected": -414.0,
"loss": 0.0343,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.62890625,
"rewards/margins": 12.0625,
"rewards/rejected": -12.6875,
"step": 897
},
{
"epoch": 1.101840490797546,
"grad_norm": 9.504318144890796,
"learning_rate": 1.2785123966942149e-06,
"logits/chosen": -0.1025390625,
"logits/rejected": -0.30859375,
"logps/chosen": -432.0,
"logps/rejected": -412.0,
"loss": 0.0349,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.130859375,
"rewards/margins": 12.5625,
"rewards/rejected": -12.6875,
"step": 898
},
{
"epoch": 1.1030674846625768,
"grad_norm": 11.108964675901117,
"learning_rate": 1.277685950413223e-06,
"logits/chosen": -0.025390625,
"logits/rejected": -0.15234375,
"logps/chosen": -350.0,
"logps/rejected": -370.0,
"loss": 0.0336,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.0703125,
"rewards/margins": 11.4375,
"rewards/rejected": -12.5,
"step": 899
},
{
"epoch": 1.1042944785276074,
"grad_norm": 13.852498236070456,
"learning_rate": 1.2768595041322314e-06,
"logits/chosen": 0.048583984375,
"logits/rejected": -0.1435546875,
"logps/chosen": -418.0,
"logps/rejected": -428.0,
"loss": 0.0864,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.015625,
"rewards/margins": 11.5625,
"rewards/rejected": -12.5625,
"step": 900
},
{
"epoch": 1.105521472392638,
"grad_norm": 4.733438173592714,
"learning_rate": 1.2760330578512396e-06,
"logits/chosen": -0.1123046875,
"logits/rejected": -0.328125,
"logps/chosen": -504.0,
"logps/rejected": -454.0,
"loss": 0.0228,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.4296875,
"rewards/margins": 14.1875,
"rewards/rejected": -13.75,
"step": 901
},
{
"epoch": 1.1067484662576688,
"grad_norm": 8.484315986474956,
"learning_rate": 1.2752066115702478e-06,
"logits/chosen": -0.146484375,
"logits/rejected": -0.302734375,
"logps/chosen": -390.0,
"logps/rejected": -406.0,
"loss": 0.0515,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.765625,
"rewards/margins": 11.875,
"rewards/rejected": -12.625,
"step": 902
},
{
"epoch": 1.1079754601226994,
"grad_norm": 8.855648149513486,
"learning_rate": 1.274380165289256e-06,
"logits/chosen": -0.044677734375,
"logits/rejected": -0.259765625,
"logps/chosen": -378.0,
"logps/rejected": -390.0,
"loss": 0.0308,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.52734375,
"rewards/margins": 12.125,
"rewards/rejected": -12.625,
"step": 903
},
{
"epoch": 1.10920245398773,
"grad_norm": 9.051987833954742,
"learning_rate": 1.2735537190082644e-06,
"logits/chosen": -0.04541015625,
"logits/rejected": -0.1787109375,
"logps/chosen": -388.0,
"logps/rejected": -434.0,
"loss": 0.0324,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.0498046875,
"rewards/margins": 12.5625,
"rewards/rejected": -12.5,
"step": 904
},
{
"epoch": 1.1104294478527608,
"grad_norm": 12.048891685038269,
"learning_rate": 1.2727272727272726e-06,
"logits/chosen": -0.216796875,
"logits/rejected": -0.416015625,
"logps/chosen": -402.0,
"logps/rejected": -410.0,
"loss": 0.0419,
"rewards/accuracies": 0.9921875,
"rewards/chosen": 0.58203125,
"rewards/margins": 13.0,
"rewards/rejected": -12.4375,
"step": 905
},
{
"epoch": 1.1116564417177914,
"grad_norm": 7.683696149710046,
"learning_rate": 1.271900826446281e-06,
"logits/chosen": -0.1259765625,
"logits/rejected": -0.2158203125,
"logps/chosen": -354.0,
"logps/rejected": -400.0,
"loss": 0.0318,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.515625,
"rewards/margins": 10.25,
"rewards/rejected": -11.75,
"step": 906
},
{
"epoch": 1.112883435582822,
"grad_norm": 9.463274872399804,
"learning_rate": 1.2710743801652892e-06,
"logits/chosen": -0.07421875,
"logits/rejected": -0.3515625,
"logps/chosen": -394.0,
"logps/rejected": -382.0,
"loss": 0.0341,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.404296875,
"rewards/margins": 12.4375,
"rewards/rejected": -12.8125,
"step": 907
},
{
"epoch": 1.1141104294478528,
"grad_norm": 13.442425696135015,
"learning_rate": 1.2702479338842976e-06,
"logits/chosen": -0.12158203125,
"logits/rejected": -0.1923828125,
"logps/chosen": -404.0,
"logps/rejected": -398.0,
"loss": 0.0538,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.2734375,
"rewards/margins": 12.0625,
"rewards/rejected": -11.75,
"step": 908
},
{
"epoch": 1.1153374233128834,
"grad_norm": 9.861015901315275,
"learning_rate": 1.2694214876033058e-06,
"logits/chosen": 0.031494140625,
"logits/rejected": -0.072265625,
"logps/chosen": -428.0,
"logps/rejected": -576.0,
"loss": 0.0371,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.416015625,
"rewards/margins": 23.75,
"rewards/rejected": -24.125,
"step": 909
},
{
"epoch": 1.116564417177914,
"grad_norm": 10.034686967609899,
"learning_rate": 1.2685950413223142e-06,
"logits/chosen": -0.1181640625,
"logits/rejected": -0.294921875,
"logps/chosen": -402.0,
"logps/rejected": -418.0,
"loss": 0.0363,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.02099609375,
"rewards/margins": 12.4375,
"rewards/rejected": -12.5,
"step": 910
},
{
"epoch": 1.1177914110429448,
"grad_norm": 11.917727210359411,
"learning_rate": 1.2677685950413221e-06,
"logits/chosen": -0.08056640625,
"logits/rejected": -0.3203125,
"logps/chosen": -482.0,
"logps/rejected": -446.0,
"loss": 0.0755,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.62890625,
"rewards/margins": 14.0625,
"rewards/rejected": -13.4375,
"step": 911
},
{
"epoch": 1.1190184049079754,
"grad_norm": 13.61479931680405,
"learning_rate": 1.2669421487603305e-06,
"logits/chosen": 0.05029296875,
"logits/rejected": -0.045654296875,
"logps/chosen": -372.0,
"logps/rejected": -400.0,
"loss": 0.0427,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.98046875,
"rewards/margins": 11.0,
"rewards/rejected": -11.9375,
"step": 912
},
{
"epoch": 1.120245398773006,
"grad_norm": 5.722716592878231,
"learning_rate": 1.2661157024793387e-06,
"logits/chosen": -0.1455078125,
"logits/rejected": -0.25,
"logps/chosen": -336.0,
"logps/rejected": -390.0,
"loss": 0.0216,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.2421875,
"rewards/margins": 12.1875,
"rewards/rejected": -12.4375,
"step": 913
},
{
"epoch": 1.1214723926380368,
"grad_norm": 15.315717662601804,
"learning_rate": 1.2652892561983471e-06,
"logits/chosen": 0.03857421875,
"logits/rejected": -0.140625,
"logps/chosen": -426.0,
"logps/rejected": -396.0,
"loss": 0.0926,
"rewards/accuracies": 0.9453125,
"rewards/chosen": -1.453125,
"rewards/margins": 10.6875,
"rewards/rejected": -12.125,
"step": 914
},
{
"epoch": 1.1226993865030674,
"grad_norm": 8.29885427815819,
"learning_rate": 1.2644628099173553e-06,
"logits/chosen": 0.002105712890625,
"logits/rejected": -0.25390625,
"logps/chosen": -420.0,
"logps/rejected": -430.0,
"loss": 0.0181,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.4453125,
"rewards/margins": 13.0,
"rewards/rejected": -13.4375,
"step": 915
},
{
"epoch": 1.123926380368098,
"grad_norm": 6.550986659275621,
"learning_rate": 1.2636363636363635e-06,
"logits/chosen": -0.1669921875,
"logits/rejected": -0.314453125,
"logps/chosen": -406.0,
"logps/rejected": -400.0,
"loss": 0.0261,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.8125,
"rewards/margins": 12.4375,
"rewards/rejected": -13.25,
"step": 916
},
{
"epoch": 1.1251533742331288,
"grad_norm": 11.88490369990794,
"learning_rate": 1.262809917355372e-06,
"logits/chosen": -0.1337890625,
"logits/rejected": -0.36328125,
"logps/chosen": -442.0,
"logps/rejected": -456.0,
"loss": 0.0599,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.9921875,
"rewards/margins": 12.0625,
"rewards/rejected": -13.0625,
"step": 917
},
{
"epoch": 1.1263803680981594,
"grad_norm": 23.872483214200095,
"learning_rate": 1.26198347107438e-06,
"logits/chosen": -0.0017547607421875,
"logits/rejected": -0.1435546875,
"logps/chosen": -404.0,
"logps/rejected": -414.0,
"loss": 0.0937,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.3125,
"rewards/margins": 12.0,
"rewards/rejected": -13.3125,
"step": 918
},
{
"epoch": 1.1276073619631901,
"grad_norm": 11.238016206654214,
"learning_rate": 1.2611570247933885e-06,
"logits/chosen": -0.2099609375,
"logits/rejected": -0.263671875,
"logps/chosen": -402.0,
"logps/rejected": -440.0,
"loss": 0.0576,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.0625,
"rewards/margins": 12.3125,
"rewards/rejected": -14.375,
"step": 919
},
{
"epoch": 1.1288343558282208,
"grad_norm": 4.993439391026325,
"learning_rate": 1.2603305785123965e-06,
"logits/chosen": -0.03759765625,
"logits/rejected": -0.25390625,
"logps/chosen": -428.0,
"logps/rejected": -430.0,
"loss": 0.0164,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.78125,
"rewards/margins": 12.625,
"rewards/rejected": -14.4375,
"step": 920
},
{
"epoch": 1.1300613496932514,
"grad_norm": 7.864089020242171,
"learning_rate": 1.2595041322314049e-06,
"logits/chosen": -0.061279296875,
"logits/rejected": -0.21484375,
"logps/chosen": -414.0,
"logps/rejected": -426.0,
"loss": 0.0223,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.54296875,
"rewards/margins": 13.0,
"rewards/rejected": -13.5,
"step": 921
},
{
"epoch": 1.1312883435582821,
"grad_norm": 16.73562616420389,
"learning_rate": 1.258677685950413e-06,
"logits/chosen": -0.01422119140625,
"logits/rejected": -0.126953125,
"logps/chosen": -416.0,
"logps/rejected": -436.0,
"loss": 0.0743,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.2421875,
"rewards/margins": 12.125,
"rewards/rejected": -13.375,
"step": 922
},
{
"epoch": 1.132515337423313,
"grad_norm": 14.52993832417819,
"learning_rate": 1.2578512396694215e-06,
"logits/chosen": 0.041015625,
"logits/rejected": -0.05419921875,
"logps/chosen": -384.0,
"logps/rejected": -414.0,
"loss": 0.0433,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.0078125,
"rewards/margins": 12.0625,
"rewards/rejected": -13.0625,
"step": 923
},
{
"epoch": 1.1337423312883437,
"grad_norm": 10.565117185339505,
"learning_rate": 1.2570247933884297e-06,
"logits/chosen": -0.11669921875,
"logits/rejected": -0.203125,
"logps/chosen": -400.0,
"logps/rejected": -402.0,
"loss": 0.0394,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.64453125,
"rewards/margins": 13.0625,
"rewards/rejected": -13.6875,
"step": 924
},
{
"epoch": 1.1349693251533743,
"grad_norm": 9.24365199770807,
"learning_rate": 1.256198347107438e-06,
"logits/chosen": -0.181640625,
"logits/rejected": -0.38671875,
"logps/chosen": -394.0,
"logps/rejected": -400.0,
"loss": 0.0259,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.53125,
"rewards/margins": 12.875,
"rewards/rejected": -14.4375,
"step": 925
},
{
"epoch": 1.136196319018405,
"grad_norm": 13.074225584556196,
"learning_rate": 1.2553719008264462e-06,
"logits/chosen": -0.1953125,
"logits/rejected": -0.37109375,
"logps/chosen": -444.0,
"logps/rejected": -444.0,
"loss": 0.103,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.8359375,
"rewards/margins": 12.75,
"rewards/rejected": -13.625,
"step": 926
},
{
"epoch": 1.1374233128834357,
"grad_norm": 14.129592351964368,
"learning_rate": 1.2545454545454546e-06,
"logits/chosen": -0.0693359375,
"logits/rejected": -0.228515625,
"logps/chosen": -446.0,
"logps/rejected": -444.0,
"loss": 0.0643,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.0703125,
"rewards/margins": 12.8125,
"rewards/rejected": -13.875,
"step": 927
},
{
"epoch": 1.1386503067484663,
"grad_norm": 4.103229864409712,
"learning_rate": 1.2537190082644628e-06,
"logits/chosen": -0.050537109375,
"logits/rejected": -0.259765625,
"logps/chosen": -434.0,
"logps/rejected": -434.0,
"loss": 0.0203,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.265625,
"rewards/margins": 12.375,
"rewards/rejected": -13.6875,
"step": 928
},
{
"epoch": 1.139877300613497,
"grad_norm": 12.788232600580178,
"learning_rate": 1.252892561983471e-06,
"logits/chosen": -0.012939453125,
"logits/rejected": -0.19140625,
"logps/chosen": -450.0,
"logps/rejected": -382.0,
"loss": 0.0529,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.1953125,
"rewards/margins": 12.0,
"rewards/rejected": -13.1875,
"step": 929
},
{
"epoch": 1.1411042944785277,
"grad_norm": 6.121038532093352,
"learning_rate": 1.2520661157024792e-06,
"logits/chosen": -0.04736328125,
"logits/rejected": -0.283203125,
"logps/chosen": -422.0,
"logps/rejected": -426.0,
"loss": 0.0176,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.8671875,
"rewards/margins": 13.5625,
"rewards/rejected": -14.375,
"step": 930
},
{
"epoch": 1.1423312883435583,
"grad_norm": 13.508596981176845,
"learning_rate": 1.2512396694214876e-06,
"logits/chosen": -0.0400390625,
"logits/rejected": -0.1279296875,
"logps/chosen": -430.0,
"logps/rejected": -410.0,
"loss": 0.067,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.7890625,
"rewards/margins": 11.0625,
"rewards/rejected": -12.875,
"step": 931
},
{
"epoch": 1.143558282208589,
"grad_norm": 10.222567348725061,
"learning_rate": 1.2504132231404958e-06,
"logits/chosen": -0.177734375,
"logits/rejected": -0.35546875,
"logps/chosen": -394.0,
"logps/rejected": -408.0,
"loss": 0.0621,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.453125,
"rewards/margins": 12.375,
"rewards/rejected": -13.8125,
"step": 932
},
{
"epoch": 1.1447852760736197,
"grad_norm": 16.863270427365446,
"learning_rate": 1.249586776859504e-06,
"logits/chosen": -0.0208740234375,
"logits/rejected": -0.11083984375,
"logps/chosen": -388.0,
"logps/rejected": -432.0,
"loss": 0.0816,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.125,
"rewards/margins": 11.875,
"rewards/rejected": -13.0,
"step": 933
},
{
"epoch": 1.1460122699386504,
"grad_norm": 10.013621594088688,
"learning_rate": 1.2487603305785124e-06,
"logits/chosen": -0.046875,
"logits/rejected": -0.2158203125,
"logps/chosen": -404.0,
"logps/rejected": -398.0,
"loss": 0.0444,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.93359375,
"rewards/margins": 11.5625,
"rewards/rejected": -12.5,
"step": 934
},
{
"epoch": 1.147239263803681,
"grad_norm": 6.873242667684438,
"learning_rate": 1.2479338842975206e-06,
"logits/chosen": -0.107421875,
"logits/rejected": -0.2470703125,
"logps/chosen": -434.0,
"logps/rejected": -438.0,
"loss": 0.0244,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.125,
"rewards/margins": 11.875,
"rewards/rejected": -13.0,
"step": 935
},
{
"epoch": 1.1484662576687117,
"grad_norm": 14.89317546756919,
"learning_rate": 1.247107438016529e-06,
"logits/chosen": 0.0625,
"logits/rejected": -0.1796875,
"logps/chosen": -386.0,
"logps/rejected": -414.0,
"loss": 0.0964,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.03125,
"rewards/margins": 11.875,
"rewards/rejected": -13.875,
"step": 936
},
{
"epoch": 1.1496932515337424,
"grad_norm": 7.982857945277371,
"learning_rate": 1.246280991735537e-06,
"logits/chosen": -0.017822265625,
"logits/rejected": -0.25390625,
"logps/chosen": -452.0,
"logps/rejected": -438.0,
"loss": 0.0263,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.5234375,
"rewards/margins": 12.5,
"rewards/rejected": -14.0,
"step": 937
},
{
"epoch": 1.150920245398773,
"grad_norm": 8.846805319628498,
"learning_rate": 1.2454545454545454e-06,
"logits/chosen": 0.014892578125,
"logits/rejected": -0.034423828125,
"logps/chosen": -392.0,
"logps/rejected": -412.0,
"loss": 0.0393,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.6640625,
"rewards/margins": 12.0,
"rewards/rejected": -13.6875,
"step": 938
},
{
"epoch": 1.1521472392638037,
"grad_norm": 3.2077133405437586,
"learning_rate": 1.2446280991735535e-06,
"logits/chosen": -0.1572265625,
"logits/rejected": -0.298828125,
"logps/chosen": -468.0,
"logps/rejected": -452.0,
"loss": 0.0109,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.67578125,
"rewards/margins": 13.5,
"rewards/rejected": -14.125,
"step": 939
},
{
"epoch": 1.1533742331288344,
"grad_norm": 5.851720087027257,
"learning_rate": 1.243801652892562e-06,
"logits/chosen": -0.1484375,
"logits/rejected": -0.33984375,
"logps/chosen": -438.0,
"logps/rejected": -420.0,
"loss": 0.0229,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.8125,
"rewards/margins": 13.5625,
"rewards/rejected": -14.375,
"step": 940
},
{
"epoch": 1.154601226993865,
"grad_norm": 12.832514340549876,
"learning_rate": 1.2429752066115701e-06,
"logits/chosen": 0.006011962890625,
"logits/rejected": -0.197265625,
"logps/chosen": -434.0,
"logps/rejected": -418.0,
"loss": 0.0473,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.373046875,
"rewards/margins": 12.125,
"rewards/rejected": -12.5,
"step": 941
},
{
"epoch": 1.1558282208588957,
"grad_norm": 8.486663453729426,
"learning_rate": 1.2421487603305785e-06,
"logits/chosen": -0.23046875,
"logits/rejected": -0.37109375,
"logps/chosen": -434.0,
"logps/rejected": -434.0,
"loss": 0.0279,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.39453125,
"rewards/margins": 13.5,
"rewards/rejected": -13.875,
"step": 942
},
{
"epoch": 1.1570552147239264,
"grad_norm": 10.666575713276558,
"learning_rate": 1.2413223140495867e-06,
"logits/chosen": 0.02685546875,
"logits/rejected": -0.134765625,
"logps/chosen": -372.0,
"logps/rejected": -384.0,
"loss": 0.0414,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.5078125,
"rewards/margins": 11.6875,
"rewards/rejected": -13.25,
"step": 943
},
{
"epoch": 1.158282208588957,
"grad_norm": 9.64349458342075,
"learning_rate": 1.2404958677685951e-06,
"logits/chosen": -0.0712890625,
"logits/rejected": -0.24609375,
"logps/chosen": -426.0,
"logps/rejected": -448.0,
"loss": 0.028,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.046875,
"rewards/margins": 13.0,
"rewards/rejected": -14.0,
"step": 944
},
{
"epoch": 1.1595092024539877,
"grad_norm": 7.949142582252125,
"learning_rate": 1.2396694214876033e-06,
"logits/chosen": -0.15625,
"logits/rejected": -0.330078125,
"logps/chosen": -438.0,
"logps/rejected": -416.0,
"loss": 0.0292,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.66015625,
"rewards/margins": 12.4375,
"rewards/rejected": -13.125,
"step": 945
},
{
"epoch": 1.1607361963190184,
"grad_norm": 8.932186397300311,
"learning_rate": 1.2388429752066115e-06,
"logits/chosen": 0.010498046875,
"logits/rejected": -0.060791015625,
"logps/chosen": -402.0,
"logps/rejected": -440.0,
"loss": 0.0343,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.0625,
"rewards/margins": 11.5625,
"rewards/rejected": -13.625,
"step": 946
},
{
"epoch": 1.161963190184049,
"grad_norm": 10.514109678390449,
"learning_rate": 1.2380165289256197e-06,
"logits/chosen": -0.2021484375,
"logits/rejected": -0.390625,
"logps/chosen": -366.0,
"logps/rejected": -402.0,
"loss": 0.0477,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.1640625,
"rewards/margins": 11.6875,
"rewards/rejected": -12.875,
"step": 947
},
{
"epoch": 1.1631901840490797,
"grad_norm": 8.877325372648517,
"learning_rate": 1.237190082644628e-06,
"logits/chosen": -0.1806640625,
"logits/rejected": -0.4140625,
"logps/chosen": -448.0,
"logps/rejected": -416.0,
"loss": 0.0407,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.51953125,
"rewards/margins": 12.3125,
"rewards/rejected": -12.8125,
"step": 948
},
{
"epoch": 1.1644171779141104,
"grad_norm": 8.754355293262861,
"learning_rate": 1.2363636363636363e-06,
"logits/chosen": 0.02685546875,
"logits/rejected": -0.251953125,
"logps/chosen": -434.0,
"logps/rejected": -450.0,
"loss": 0.0418,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.54296875,
"rewards/margins": 13.5,
"rewards/rejected": -14.0625,
"step": 949
},
{
"epoch": 1.165644171779141,
"grad_norm": 4.1108349538584825,
"learning_rate": 1.2355371900826447e-06,
"logits/chosen": -0.11474609375,
"logits/rejected": -0.22265625,
"logps/chosen": -356.0,
"logps/rejected": -368.0,
"loss": 0.0164,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.5703125,
"rewards/margins": 11.9375,
"rewards/rejected": -13.5,
"step": 950
},
{
"epoch": 1.1668711656441717,
"grad_norm": 9.31776042696322,
"learning_rate": 1.2347107438016529e-06,
"logits/chosen": 0.0091552734375,
"logits/rejected": -0.11669921875,
"logps/chosen": -366.0,
"logps/rejected": -386.0,
"loss": 0.0323,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.3515625,
"rewards/margins": 11.625,
"rewards/rejected": -12.9375,
"step": 951
},
{
"epoch": 1.1680981595092024,
"grad_norm": 8.933208458194814,
"learning_rate": 1.233884297520661e-06,
"logits/chosen": -0.201171875,
"logits/rejected": -0.4765625,
"logps/chosen": -438.0,
"logps/rejected": -418.0,
"loss": 0.0287,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.2275390625,
"rewards/margins": 12.875,
"rewards/rejected": -13.125,
"step": 952
},
{
"epoch": 1.169325153374233,
"grad_norm": 9.190704531144403,
"learning_rate": 1.2330578512396694e-06,
"logits/chosen": -0.03857421875,
"logits/rejected": -0.2431640625,
"logps/chosen": -402.0,
"logps/rejected": -392.0,
"loss": 0.0568,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.447265625,
"rewards/margins": 12.1875,
"rewards/rejected": -12.6875,
"step": 953
},
{
"epoch": 1.1705521472392637,
"grad_norm": 15.447894329208678,
"learning_rate": 1.2322314049586776e-06,
"logits/chosen": -0.03125,
"logits/rejected": -0.248046875,
"logps/chosen": -336.0,
"logps/rejected": -344.0,
"loss": 0.0516,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.9296875,
"rewards/margins": 10.75,
"rewards/rejected": -12.6875,
"step": 954
},
{
"epoch": 1.1717791411042944,
"grad_norm": 9.786150682980374,
"learning_rate": 1.2314049586776858e-06,
"logits/chosen": 0.039794921875,
"logits/rejected": -0.02734375,
"logps/chosen": -396.0,
"logps/rejected": -406.0,
"loss": 0.0325,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.50390625,
"rewards/margins": 12.125,
"rewards/rejected": -12.625,
"step": 955
},
{
"epoch": 1.173006134969325,
"grad_norm": 10.192839968241447,
"learning_rate": 1.230578512396694e-06,
"logits/chosen": -0.053955078125,
"logits/rejected": -0.162109375,
"logps/chosen": -328.0,
"logps/rejected": -366.0,
"loss": 0.0394,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.0,
"rewards/margins": 10.75,
"rewards/rejected": -11.75,
"step": 956
},
{
"epoch": 1.1742331288343557,
"grad_norm": 9.482261644753402,
"learning_rate": 1.2297520661157024e-06,
"logits/chosen": -0.0966796875,
"logits/rejected": -0.314453125,
"logps/chosen": -404.0,
"logps/rejected": -428.0,
"loss": 0.0452,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.40234375,
"rewards/margins": 11.8125,
"rewards/rejected": -12.25,
"step": 957
},
{
"epoch": 1.1754601226993864,
"grad_norm": 11.911094206094816,
"learning_rate": 1.2289256198347106e-06,
"logits/chosen": -0.01373291015625,
"logits/rejected": -0.10888671875,
"logps/chosen": -374.0,
"logps/rejected": -428.0,
"loss": 0.0444,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.69921875,
"rewards/margins": 12.3125,
"rewards/rejected": -13.0625,
"step": 958
},
{
"epoch": 1.1766871165644173,
"grad_norm": 11.530120779052213,
"learning_rate": 1.228099173553719e-06,
"logits/chosen": -0.05517578125,
"logits/rejected": -0.228515625,
"logps/chosen": -410.0,
"logps/rejected": -414.0,
"loss": 0.0372,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.72265625,
"rewards/margins": 11.9375,
"rewards/rejected": -12.6875,
"step": 959
},
{
"epoch": 1.177914110429448,
"grad_norm": 3.1550473881150807,
"learning_rate": 1.2272727272727272e-06,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.29296875,
"logps/chosen": -362.0,
"logps/rejected": -374.0,
"loss": 0.0124,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.015625,
"rewards/margins": 11.125,
"rewards/rejected": -13.125,
"step": 960
},
{
"epoch": 1.1791411042944786,
"grad_norm": 12.944181255499222,
"learning_rate": 1.2264462809917356e-06,
"logits/chosen": -0.09130859375,
"logits/rejected": -0.1943359375,
"logps/chosen": -418.0,
"logps/rejected": -406.0,
"loss": 0.0344,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.439453125,
"rewards/margins": 12.75,
"rewards/rejected": -13.1875,
"step": 961
},
{
"epoch": 1.1803680981595093,
"grad_norm": 7.505423517064192,
"learning_rate": 1.2256198347107438e-06,
"logits/chosen": 0.052001953125,
"logits/rejected": -0.11767578125,
"logps/chosen": -458.0,
"logps/rejected": -458.0,
"loss": 0.0321,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.203125,
"rewards/margins": 12.0625,
"rewards/rejected": -13.25,
"step": 962
},
{
"epoch": 1.18159509202454,
"grad_norm": 8.634387194412563,
"learning_rate": 1.2247933884297522e-06,
"logits/chosen": -0.0869140625,
"logits/rejected": -0.275390625,
"logps/chosen": -390.0,
"logps/rejected": -380.0,
"loss": 0.0337,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.66015625,
"rewards/margins": 12.25,
"rewards/rejected": -12.9375,
"step": 963
},
{
"epoch": 1.1828220858895706,
"grad_norm": 7.968338693139223,
"learning_rate": 1.2239669421487602e-06,
"logits/chosen": -0.021484375,
"logits/rejected": -0.2041015625,
"logps/chosen": -392.0,
"logps/rejected": -392.0,
"loss": 0.0221,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.498046875,
"rewards/margins": 12.75,
"rewards/rejected": -13.1875,
"step": 964
},
{
"epoch": 1.1840490797546013,
"grad_norm": 20.464410540441207,
"learning_rate": 1.2231404958677686e-06,
"logits/chosen": -0.09912109375,
"logits/rejected": -0.2265625,
"logps/chosen": -380.0,
"logps/rejected": -414.0,
"loss": 0.0776,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.65625,
"rewards/margins": 12.25,
"rewards/rejected": -13.875,
"step": 965
},
{
"epoch": 1.185276073619632,
"grad_norm": 12.408473848345519,
"learning_rate": 1.2223140495867767e-06,
"logits/chosen": -0.1630859375,
"logits/rejected": -0.294921875,
"logps/chosen": -410.0,
"logps/rejected": -386.0,
"loss": 0.0521,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.4375,
"rewards/margins": 11.875,
"rewards/rejected": -13.3125,
"step": 966
},
{
"epoch": 1.1865030674846626,
"grad_norm": 7.549537773527989,
"learning_rate": 1.2214876033057851e-06,
"logits/chosen": -0.09423828125,
"logits/rejected": -0.26171875,
"logps/chosen": -430.0,
"logps/rejected": -408.0,
"loss": 0.0224,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.78515625,
"rewards/margins": 12.75,
"rewards/rejected": -13.5625,
"step": 967
},
{
"epoch": 1.1877300613496933,
"grad_norm": 21.356090528669018,
"learning_rate": 1.2206611570247933e-06,
"logits/chosen": -0.0189208984375,
"logits/rejected": -0.2060546875,
"logps/chosen": -440.0,
"logps/rejected": -430.0,
"loss": 0.0856,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.76953125,
"rewards/margins": 14.0625,
"rewards/rejected": -14.8125,
"step": 968
},
{
"epoch": 1.188957055214724,
"grad_norm": 4.75344602409549,
"learning_rate": 1.2198347107438015e-06,
"logits/chosen": -0.1181640625,
"logits/rejected": -0.28125,
"logps/chosen": -406.0,
"logps/rejected": -454.0,
"loss": 0.0196,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.15625,
"rewards/margins": 11.3125,
"rewards/rejected": -14.4375,
"step": 969
},
{
"epoch": 1.1901840490797546,
"grad_norm": 12.850006718300646,
"learning_rate": 1.21900826446281e-06,
"logits/chosen": -0.0849609375,
"logits/rejected": -0.234375,
"logps/chosen": -390.0,
"logps/rejected": -540.0,
"loss": 0.0502,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.75,
"rewards/margins": 24.875,
"rewards/rejected": -26.625,
"step": 970
},
{
"epoch": 1.1914110429447853,
"grad_norm": 5.746825962849126,
"learning_rate": 1.2181818181818181e-06,
"logits/chosen": 0.009765625,
"logits/rejected": -0.23046875,
"logps/chosen": -374.0,
"logps/rejected": -392.0,
"loss": 0.0216,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.7421875,
"rewards/margins": 12.5625,
"rewards/rejected": -14.3125,
"step": 971
},
{
"epoch": 1.192638036809816,
"grad_norm": 7.646865150926059,
"learning_rate": 1.2173553719008265e-06,
"logits/chosen": -0.028076171875,
"logits/rejected": -0.171875,
"logps/chosen": -362.0,
"logps/rejected": -344.0,
"loss": 0.0363,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.390625,
"rewards/margins": 10.75,
"rewards/rejected": -13.125,
"step": 972
},
{
"epoch": 1.1938650306748466,
"grad_norm": 16.639992283251654,
"learning_rate": 1.2165289256198345e-06,
"logits/chosen": -0.1328125,
"logits/rejected": -0.251953125,
"logps/chosen": -434.0,
"logps/rejected": -466.0,
"loss": 0.0605,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.5859375,
"rewards/margins": 12.75,
"rewards/rejected": -14.3125,
"step": 973
},
{
"epoch": 1.1950920245398773,
"grad_norm": 4.567276764371933,
"learning_rate": 1.2157024793388429e-06,
"logits/chosen": -0.2109375,
"logits/rejected": -0.3984375,
"logps/chosen": -420.0,
"logps/rejected": -442.0,
"loss": 0.0146,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.0546875,
"rewards/margins": 13.375,
"rewards/rejected": -14.4375,
"step": 974
},
{
"epoch": 1.196319018404908,
"grad_norm": 16.538248085370746,
"learning_rate": 1.214876033057851e-06,
"logits/chosen": 0.0810546875,
"logits/rejected": -0.04248046875,
"logps/chosen": -384.0,
"logps/rejected": -372.0,
"loss": 0.0592,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.109375,
"rewards/margins": 11.625,
"rewards/rejected": -13.75,
"step": 975
},
{
"epoch": 1.1975460122699386,
"grad_norm": 9.847022221108725,
"learning_rate": 1.2140495867768595e-06,
"logits/chosen": -0.15234375,
"logits/rejected": -0.373046875,
"logps/chosen": -442.0,
"logps/rejected": -426.0,
"loss": 0.0362,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.046875,
"rewards/margins": 12.0625,
"rewards/rejected": -13.125,
"step": 976
},
{
"epoch": 1.1987730061349693,
"grad_norm": 7.542773701887827,
"learning_rate": 1.2132231404958677e-06,
"logits/chosen": -0.04833984375,
"logits/rejected": -0.248046875,
"logps/chosen": -410.0,
"logps/rejected": -414.0,
"loss": 0.0212,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.28125,
"rewards/margins": 13.25,
"rewards/rejected": -14.5625,
"step": 977
},
{
"epoch": 1.2,
"grad_norm": 15.424661364927971,
"learning_rate": 1.212396694214876e-06,
"logits/chosen": -0.08837890625,
"logits/rejected": -0.1181640625,
"logps/chosen": -390.0,
"logps/rejected": -386.0,
"loss": 0.0879,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.734375,
"rewards/margins": 11.5625,
"rewards/rejected": -14.3125,
"step": 978
},
{
"epoch": 1.2012269938650306,
"grad_norm": 9.396706852674509,
"learning_rate": 1.2115702479338842e-06,
"logits/chosen": 0.0262451171875,
"logits/rejected": -0.10107421875,
"logps/chosen": -434.0,
"logps/rejected": -428.0,
"loss": 0.0293,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.671875,
"rewards/margins": 13.0,
"rewards/rejected": -14.6875,
"step": 979
},
{
"epoch": 1.2024539877300613,
"grad_norm": 6.571933361630648,
"learning_rate": 1.2107438016528926e-06,
"logits/chosen": -0.162109375,
"logits/rejected": -0.341796875,
"logps/chosen": -384.0,
"logps/rejected": -414.0,
"loss": 0.0236,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.5234375,
"rewards/margins": 13.4375,
"rewards/rejected": -13.9375,
"step": 980
},
{
"epoch": 1.203680981595092,
"grad_norm": 11.474305445699706,
"learning_rate": 1.2099173553719008e-06,
"logits/chosen": -0.068359375,
"logits/rejected": -0.154296875,
"logps/chosen": -412.0,
"logps/rejected": -424.0,
"loss": 0.0421,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.6796875,
"rewards/margins": 12.3125,
"rewards/rejected": -14.0,
"step": 981
},
{
"epoch": 1.2049079754601226,
"grad_norm": 10.20449927069489,
"learning_rate": 1.209090909090909e-06,
"logits/chosen": -0.07470703125,
"logits/rejected": -0.24609375,
"logps/chosen": -434.0,
"logps/rejected": -450.0,
"loss": 0.0438,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.75,
"rewards/margins": 12.4375,
"rewards/rejected": -14.1875,
"step": 982
},
{
"epoch": 1.2061349693251533,
"grad_norm": 14.97705311254297,
"learning_rate": 1.2082644628099172e-06,
"logits/chosen": -0.076171875,
"logits/rejected": -0.2578125,
"logps/chosen": -408.0,
"logps/rejected": -384.0,
"loss": 0.0822,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.8203125,
"rewards/margins": 10.875,
"rewards/rejected": -12.6875,
"step": 983
},
{
"epoch": 1.207361963190184,
"grad_norm": 13.05578709428694,
"learning_rate": 1.2074380165289256e-06,
"logits/chosen": -0.10888671875,
"logits/rejected": -0.283203125,
"logps/chosen": -384.0,
"logps/rejected": -378.0,
"loss": 0.0485,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.734375,
"rewards/margins": 11.375,
"rewards/rejected": -13.125,
"step": 984
},
{
"epoch": 1.2085889570552146,
"grad_norm": 8.73456726352084,
"learning_rate": 1.2066115702479338e-06,
"logits/chosen": -0.0225830078125,
"logits/rejected": -0.1845703125,
"logps/chosen": -372.0,
"logps/rejected": -384.0,
"loss": 0.0374,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.296875,
"rewards/margins": 11.5625,
"rewards/rejected": -12.875,
"step": 985
},
{
"epoch": 1.2098159509202455,
"grad_norm": 7.861853834042409,
"learning_rate": 1.205785123966942e-06,
"logits/chosen": 0.08740234375,
"logits/rejected": -0.061767578125,
"logps/chosen": -414.0,
"logps/rejected": -388.0,
"loss": 0.027,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.3125,
"rewards/margins": 10.875,
"rewards/rejected": -12.1875,
"step": 986
},
{
"epoch": 1.2110429447852762,
"grad_norm": 8.766298480592287,
"learning_rate": 1.2049586776859504e-06,
"logits/chosen": -0.12451171875,
"logits/rejected": -0.373046875,
"logps/chosen": -474.0,
"logps/rejected": -436.0,
"loss": 0.0384,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.236328125,
"rewards/margins": 12.5625,
"rewards/rejected": -12.8125,
"step": 987
},
{
"epoch": 1.2122699386503069,
"grad_norm": 4.029272452040693,
"learning_rate": 1.2041322314049586e-06,
"logits/chosen": -0.01458740234375,
"logits/rejected": -0.2421875,
"logps/chosen": -388.0,
"logps/rejected": -374.0,
"loss": 0.0122,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.53125,
"rewards/margins": 11.5625,
"rewards/rejected": -13.0625,
"step": 988
},
{
"epoch": 1.2134969325153375,
"grad_norm": 8.944026149848822,
"learning_rate": 1.203305785123967e-06,
"logits/chosen": 0.023193359375,
"logits/rejected": -0.146484375,
"logps/chosen": -372.0,
"logps/rejected": -368.0,
"loss": 0.0399,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.0625,
"rewards/margins": 10.375,
"rewards/rejected": -12.4375,
"step": 989
},
{
"epoch": 1.2147239263803682,
"grad_norm": 5.179320439212364,
"learning_rate": 1.2024793388429752e-06,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.3125,
"logps/chosen": -416.0,
"logps/rejected": -420.0,
"loss": 0.0227,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.8515625,
"rewards/margins": 12.3125,
"rewards/rejected": -13.125,
"step": 990
},
{
"epoch": 1.2159509202453989,
"grad_norm": 15.977051854013217,
"learning_rate": 1.2016528925619834e-06,
"logits/chosen": -0.0703125,
"logits/rejected": -0.2021484375,
"logps/chosen": -426.0,
"logps/rejected": -430.0,
"loss": 0.0379,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.40625,
"rewards/margins": 12.0,
"rewards/rejected": -13.375,
"step": 991
},
{
"epoch": 1.2171779141104295,
"grad_norm": 15.858494272070253,
"learning_rate": 1.2008264462809915e-06,
"logits/chosen": -0.1005859375,
"logits/rejected": -0.287109375,
"logps/chosen": -402.0,
"logps/rejected": -416.0,
"loss": 0.093,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.15625,
"rewards/margins": 11.875,
"rewards/rejected": -13.0625,
"step": 992
},
{
"epoch": 1.2184049079754602,
"grad_norm": 16.14251495033581,
"learning_rate": 1.2e-06,
"logits/chosen": -0.158203125,
"logits/rejected": -0.30078125,
"logps/chosen": -390.0,
"logps/rejected": -392.0,
"loss": 0.0951,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.5390625,
"rewards/margins": 11.125,
"rewards/rejected": -11.6875,
"step": 993
},
{
"epoch": 1.2196319018404909,
"grad_norm": 8.547796922186873,
"learning_rate": 1.1991735537190081e-06,
"logits/chosen": -0.15625,
"logits/rejected": -0.330078125,
"logps/chosen": -440.0,
"logps/rejected": -426.0,
"loss": 0.0287,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.92578125,
"rewards/margins": 11.625,
"rewards/rejected": -12.5625,
"step": 994
},
{
"epoch": 1.2208588957055215,
"grad_norm": 10.160029663539905,
"learning_rate": 1.1983471074380165e-06,
"logits/chosen": -0.08544921875,
"logits/rejected": -0.232421875,
"logps/chosen": -370.0,
"logps/rejected": -412.0,
"loss": 0.0215,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.4140625,
"rewards/margins": 10.6875,
"rewards/rejected": -12.125,
"step": 995
},
{
"epoch": 1.2220858895705522,
"grad_norm": 19.452317804705746,
"learning_rate": 1.1975206611570247e-06,
"logits/chosen": -0.01116943359375,
"logits/rejected": -0.2734375,
"logps/chosen": -398.0,
"logps/rejected": -386.0,
"loss": 0.0656,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1953125,
"rewards/margins": 10.5,
"rewards/rejected": -11.6875,
"step": 996
},
{
"epoch": 1.2233128834355829,
"grad_norm": 13.533791677083688,
"learning_rate": 1.1966942148760331e-06,
"logits/chosen": -0.181640625,
"logits/rejected": -0.3671875,
"logps/chosen": -428.0,
"logps/rejected": -392.0,
"loss": 0.0515,
"rewards/accuracies": 0.9765625,
"rewards/chosen": 0.25390625,
"rewards/margins": 11.75,
"rewards/rejected": -11.5,
"step": 997
},
{
"epoch": 1.2245398773006135,
"grad_norm": 11.848136882520404,
"learning_rate": 1.1958677685950413e-06,
"logits/chosen": -0.0086669921875,
"logits/rejected": -0.2060546875,
"logps/chosen": -460.0,
"logps/rejected": -432.0,
"loss": 0.027,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.28515625,
"rewards/margins": 11.5625,
"rewards/rejected": -11.8125,
"step": 998
},
{
"epoch": 1.2257668711656442,
"grad_norm": 9.541868816097741,
"learning_rate": 1.1950413223140497e-06,
"logits/chosen": -0.06787109375,
"logits/rejected": -0.234375,
"logps/chosen": -420.0,
"logps/rejected": -402.0,
"loss": 0.0397,
"rewards/accuracies": 0.9765625,
"rewards/chosen": 0.26171875,
"rewards/margins": 11.875,
"rewards/rejected": -11.625,
"step": 999
},
{
"epoch": 1.2269938650306749,
"grad_norm": 10.980857798677132,
"learning_rate": 1.1942148760330577e-06,
"logits/chosen": -0.00372314453125,
"logits/rejected": -0.09033203125,
"logps/chosen": -396.0,
"logps/rejected": -406.0,
"loss": 0.066,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.107421875,
"rewards/margins": 11.75,
"rewards/rejected": -11.875,
"step": 1000
},
{
"epoch": 1.2282208588957055,
"grad_norm": 4.634321275932294,
"learning_rate": 1.193388429752066e-06,
"logits/chosen": -0.1845703125,
"logits/rejected": -0.3515625,
"logps/chosen": -420.0,
"logps/rejected": -392.0,
"loss": 0.0159,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.45703125,
"rewards/margins": 12.125,
"rewards/rejected": -11.6875,
"step": 1001
},
{
"epoch": 1.2294478527607362,
"grad_norm": 14.691871767924098,
"learning_rate": 1.1925619834710743e-06,
"logits/chosen": -0.05712890625,
"logits/rejected": -0.09033203125,
"logps/chosen": -390.0,
"logps/rejected": -430.0,
"loss": 0.0631,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.3671875,
"rewards/margins": 11.5,
"rewards/rejected": -11.875,
"step": 1002
},
{
"epoch": 1.2306748466257669,
"grad_norm": 16.78704234522903,
"learning_rate": 1.1917355371900827e-06,
"logits/chosen": -0.150390625,
"logits/rejected": -0.283203125,
"logps/chosen": -376.0,
"logps/rejected": -398.0,
"loss": 0.1099,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -0.73046875,
"rewards/margins": 11.5625,
"rewards/rejected": -12.3125,
"step": 1003
},
{
"epoch": 1.2319018404907975,
"grad_norm": 12.437884297351662,
"learning_rate": 1.1909090909090909e-06,
"logits/chosen": -0.024169921875,
"logits/rejected": -0.234375,
"logps/chosen": -374.0,
"logps/rejected": -350.0,
"loss": 0.0418,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.77734375,
"rewards/margins": 10.5625,
"rewards/rejected": -11.375,
"step": 1004
},
{
"epoch": 1.2331288343558282,
"grad_norm": 5.325399930170229,
"learning_rate": 1.190082644628099e-06,
"logits/chosen": -0.024169921875,
"logits/rejected": -0.2119140625,
"logps/chosen": -408.0,
"logps/rejected": -380.0,
"loss": 0.0238,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.76171875,
"rewards/margins": 11.375,
"rewards/rejected": -12.125,
"step": 1005
},
{
"epoch": 1.2343558282208589,
"grad_norm": 7.7871544288260175,
"learning_rate": 1.1892561983471075e-06,
"logits/chosen": -0.08837890625,
"logits/rejected": -0.259765625,
"logps/chosen": -384.0,
"logps/rejected": -380.0,
"loss": 0.0315,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.953125,
"rewards/margins": 11.375,
"rewards/rejected": -12.3125,
"step": 1006
},
{
"epoch": 1.2355828220858895,
"grad_norm": 15.329760712489666,
"learning_rate": 1.1884297520661156e-06,
"logits/chosen": -0.05615234375,
"logits/rejected": -0.212890625,
"logps/chosen": -418.0,
"logps/rejected": -426.0,
"loss": 0.0657,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -0.5078125,
"rewards/margins": 12.0,
"rewards/rejected": -12.5,
"step": 1007
},
{
"epoch": 1.2368098159509202,
"grad_norm": 8.444858942456518,
"learning_rate": 1.187603305785124e-06,
"logits/chosen": -0.06591796875,
"logits/rejected": -0.1865234375,
"logps/chosen": -372.0,
"logps/rejected": -376.0,
"loss": 0.0417,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.1640625,
"rewards/margins": 10.9375,
"rewards/rejected": -12.125,
"step": 1008
},
{
"epoch": 1.2380368098159509,
"grad_norm": 16.143259489433873,
"learning_rate": 1.186776859504132e-06,
"logits/chosen": 0.027099609375,
"logits/rejected": -0.173828125,
"logps/chosen": -444.0,
"logps/rejected": -406.0,
"loss": 0.0912,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.4453125,
"rewards/margins": 12.0,
"rewards/rejected": -12.4375,
"step": 1009
},
{
"epoch": 1.2392638036809815,
"grad_norm": 10.769295507845479,
"learning_rate": 1.1859504132231404e-06,
"logits/chosen": -0.001007080078125,
"logits/rejected": -0.087890625,
"logps/chosen": -372.0,
"logps/rejected": -404.0,
"loss": 0.0471,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.7890625,
"rewards/margins": 11.3125,
"rewards/rejected": -13.125,
"step": 1010
},
{
"epoch": 1.2404907975460122,
"grad_norm": 4.694884526096991,
"learning_rate": 1.1851239669421486e-06,
"logits/chosen": -0.0174560546875,
"logits/rejected": -0.2080078125,
"logps/chosen": -426.0,
"logps/rejected": -418.0,
"loss": 0.0187,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.015625,
"rewards/margins": 12.0,
"rewards/rejected": -13.0,
"step": 1011
},
{
"epoch": 1.2417177914110429,
"grad_norm": 11.14299328967405,
"learning_rate": 1.184297520661157e-06,
"logits/chosen": -0.09228515625,
"logits/rejected": -0.2431640625,
"logps/chosen": -400.0,
"logps/rejected": -398.0,
"loss": 0.0563,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.1953125,
"rewards/margins": 11.1875,
"rewards/rejected": -12.375,
"step": 1012
},
{
"epoch": 1.2429447852760735,
"grad_norm": 15.432263414767332,
"learning_rate": 1.1834710743801652e-06,
"logits/chosen": 0.0260009765625,
"logits/rejected": -0.037841796875,
"logps/chosen": -416.0,
"logps/rejected": -406.0,
"loss": 0.0618,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.8984375,
"rewards/margins": 10.0625,
"rewards/rejected": -11.9375,
"step": 1013
},
{
"epoch": 1.2441717791411042,
"grad_norm": 8.051839192246304,
"learning_rate": 1.1826446280991736e-06,
"logits/chosen": -0.08203125,
"logits/rejected": -0.2109375,
"logps/chosen": -406.0,
"logps/rejected": -434.0,
"loss": 0.0408,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.984375,
"rewards/margins": 10.75,
"rewards/rejected": -12.75,
"step": 1014
},
{
"epoch": 1.2453987730061349,
"grad_norm": 10.159231355173494,
"learning_rate": 1.1818181818181818e-06,
"logits/chosen": -0.05419921875,
"logits/rejected": -0.169921875,
"logps/chosen": -382.0,
"logps/rejected": -420.0,
"loss": 0.0431,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.13671875,
"rewards/margins": 13.3125,
"rewards/rejected": -13.5,
"step": 1015
},
{
"epoch": 1.2466257668711656,
"grad_norm": 14.588997195276331,
"learning_rate": 1.1809917355371902e-06,
"logits/chosen": -0.059814453125,
"logits/rejected": -0.142578125,
"logps/chosen": -384.0,
"logps/rejected": -378.0,
"loss": 0.0848,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.078125,
"rewards/margins": 10.4375,
"rewards/rejected": -12.5625,
"step": 1016
},
{
"epoch": 1.2478527607361962,
"grad_norm": 1.7622734192520961,
"learning_rate": 1.1801652892561984e-06,
"logits/chosen": -0.0673828125,
"logits/rejected": -0.298828125,
"logps/chosen": -422.0,
"logps/rejected": -390.0,
"loss": 0.0087,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.55078125,
"rewards/margins": 12.9375,
"rewards/rejected": -13.5,
"step": 1017
},
{
"epoch": 1.2490797546012269,
"grad_norm": 8.586072122468636,
"learning_rate": 1.1793388429752066e-06,
"logits/chosen": -0.09814453125,
"logits/rejected": -0.1806640625,
"logps/chosen": -420.0,
"logps/rejected": -440.0,
"loss": 0.0326,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.3828125,
"rewards/margins": 12.25,
"rewards/rejected": -13.625,
"step": 1018
},
{
"epoch": 1.2503067484662576,
"grad_norm": 7.454525084876923,
"learning_rate": 1.1785123966942147e-06,
"logits/chosen": -0.1396484375,
"logits/rejected": -0.28515625,
"logps/chosen": -394.0,
"logps/rejected": -408.0,
"loss": 0.0316,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.4609375,
"rewards/margins": 12.375,
"rewards/rejected": -13.8125,
"step": 1019
},
{
"epoch": 1.2515337423312882,
"grad_norm": 8.753659634452339,
"learning_rate": 1.1776859504132231e-06,
"logits/chosen": -0.076171875,
"logits/rejected": -0.169921875,
"logps/chosen": -430.0,
"logps/rejected": -434.0,
"loss": 0.0408,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.234375,
"rewards/margins": 13.3125,
"rewards/rejected": -14.5625,
"step": 1020
},
{
"epoch": 1.252760736196319,
"grad_norm": 4.422275674570636,
"learning_rate": 1.1768595041322313e-06,
"logits/chosen": -0.04345703125,
"logits/rejected": -0.12451171875,
"logps/chosen": -390.0,
"logps/rejected": -412.0,
"loss": 0.0211,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.9375,
"rewards/margins": 12.75,
"rewards/rejected": -14.6875,
"step": 1021
},
{
"epoch": 1.2539877300613496,
"grad_norm": 5.7879749078778815,
"learning_rate": 1.1760330578512395e-06,
"logits/chosen": -0.166015625,
"logits/rejected": -0.306640625,
"logps/chosen": -436.0,
"logps/rejected": -426.0,
"loss": 0.0228,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.25,
"rewards/margins": 12.6875,
"rewards/rejected": -13.9375,
"step": 1022
},
{
"epoch": 1.2552147239263804,
"grad_norm": 8.969057204677366,
"learning_rate": 1.175206611570248e-06,
"logits/chosen": -0.1357421875,
"logits/rejected": -0.306640625,
"logps/chosen": -422.0,
"logps/rejected": -430.0,
"loss": 0.0389,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.9609375,
"rewards/margins": 12.9375,
"rewards/rejected": -13.9375,
"step": 1023
},
{
"epoch": 1.2564417177914111,
"grad_norm": 7.130825092354974,
"learning_rate": 1.1743801652892561e-06,
"logits/chosen": -0.01904296875,
"logits/rejected": -0.267578125,
"logps/chosen": -432.0,
"logps/rejected": -454.0,
"loss": 0.023,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.7734375,
"rewards/margins": 13.25,
"rewards/rejected": -15.0625,
"step": 1024
},
{
"epoch": 1.2576687116564418,
"grad_norm": 16.852326885416577,
"learning_rate": 1.1735537190082645e-06,
"logits/chosen": -0.0299072265625,
"logits/rejected": -0.1865234375,
"logps/chosen": -438.0,
"logps/rejected": -452.0,
"loss": 0.0466,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.2265625,
"rewards/margins": 12.5,
"rewards/rejected": -13.75,
"step": 1025
},
{
"epoch": 1.2588957055214725,
"grad_norm": 5.356931220922423,
"learning_rate": 1.1727272727272725e-06,
"logits/chosen": -0.126953125,
"logits/rejected": -0.2890625,
"logps/chosen": -390.0,
"logps/rejected": -410.0,
"loss": 0.0268,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.734375,
"rewards/margins": 12.1875,
"rewards/rejected": -13.9375,
"step": 1026
},
{
"epoch": 1.2601226993865031,
"grad_norm": 4.025169633529637,
"learning_rate": 1.1719008264462809e-06,
"logits/chosen": -0.1669921875,
"logits/rejected": -0.40234375,
"logps/chosen": -466.0,
"logps/rejected": -442.0,
"loss": 0.0153,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.2890625,
"rewards/margins": 12.5,
"rewards/rejected": -13.8125,
"step": 1027
},
{
"epoch": 1.2613496932515338,
"grad_norm": 4.592967156765468,
"learning_rate": 1.171074380165289e-06,
"logits/chosen": -0.1494140625,
"logits/rejected": -0.302734375,
"logps/chosen": -414.0,
"logps/rejected": -428.0,
"loss": 0.0142,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.52734375,
"rewards/margins": 13.75,
"rewards/rejected": -14.25,
"step": 1028
},
{
"epoch": 1.2625766871165645,
"grad_norm": 7.1473694166433965,
"learning_rate": 1.1702479338842975e-06,
"logits/chosen": -0.08740234375,
"logits/rejected": -0.279296875,
"logps/chosen": -410.0,
"logps/rejected": -412.0,
"loss": 0.0285,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.59375,
"rewards/margins": 11.25,
"rewards/rejected": -12.8125,
"step": 1029
},
{
"epoch": 1.2638036809815951,
"grad_norm": 7.5317745769902755,
"learning_rate": 1.1694214876033057e-06,
"logits/chosen": -0.2890625,
"logits/rejected": -0.373046875,
"logps/chosen": -428.0,
"logps/rejected": -436.0,
"loss": 0.0188,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.2119140625,
"rewards/margins": 13.3125,
"rewards/rejected": -13.5,
"step": 1030
},
{
"epoch": 1.2650306748466258,
"grad_norm": 9.28796641990803,
"learning_rate": 1.168595041322314e-06,
"logits/chosen": -0.052734375,
"logits/rejected": -0.294921875,
"logps/chosen": -396.0,
"logps/rejected": -384.0,
"loss": 0.0588,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.984375,
"rewards/margins": 11.1875,
"rewards/rejected": -12.1875,
"step": 1031
},
{
"epoch": 1.2662576687116565,
"grad_norm": 10.17581121642878,
"learning_rate": 1.1677685950413223e-06,
"logits/chosen": 0.05908203125,
"logits/rejected": -0.1513671875,
"logps/chosen": -394.0,
"logps/rejected": -384.0,
"loss": 0.0294,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.0546875,
"rewards/margins": 11.3125,
"rewards/rejected": -12.375,
"step": 1032
},
{
"epoch": 1.2674846625766871,
"grad_norm": 17.629407303632064,
"learning_rate": 1.1669421487603307e-06,
"logits/chosen": -0.1044921875,
"logits/rejected": -0.31640625,
"logps/chosen": -454.0,
"logps/rejected": -420.0,
"loss": 0.0942,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.7109375,
"rewards/margins": 11.0,
"rewards/rejected": -12.6875,
"step": 1033
},
{
"epoch": 1.2687116564417178,
"grad_norm": 7.921949810579345,
"learning_rate": 1.1661157024793388e-06,
"logits/chosen": -0.140625,
"logits/rejected": -0.369140625,
"logps/chosen": -480.0,
"logps/rejected": -442.0,
"loss": 0.0225,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.3203125,
"rewards/margins": 12.875,
"rewards/rejected": -13.1875,
"step": 1034
},
{
"epoch": 1.2699386503067485,
"grad_norm": 8.2688209516239,
"learning_rate": 1.165289256198347e-06,
"logits/chosen": -0.05322265625,
"logits/rejected": -0.263671875,
"logps/chosen": -422.0,
"logps/rejected": -410.0,
"loss": 0.0309,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.6328125,
"rewards/margins": 12.0,
"rewards/rejected": -12.625,
"step": 1035
},
{
"epoch": 1.2711656441717791,
"grad_norm": 12.060040768536464,
"learning_rate": 1.1644628099173552e-06,
"logits/chosen": -0.048095703125,
"logits/rejected": -0.1826171875,
"logps/chosen": -396.0,
"logps/rejected": -386.0,
"loss": 0.0348,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.47265625,
"rewards/margins": 11.125,
"rewards/rejected": -11.625,
"step": 1036
},
{
"epoch": 1.2723926380368098,
"grad_norm": 9.716295747684459,
"learning_rate": 1.1636363636363636e-06,
"logits/chosen": -0.259765625,
"logits/rejected": -0.388671875,
"logps/chosen": -430.0,
"logps/rejected": -450.0,
"loss": 0.0301,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.330078125,
"rewards/margins": 12.0625,
"rewards/rejected": -12.375,
"step": 1037
},
{
"epoch": 1.2736196319018405,
"grad_norm": 8.828924438984327,
"learning_rate": 1.1628099173553718e-06,
"logits/chosen": -0.087890625,
"logits/rejected": -0.251953125,
"logps/chosen": -394.0,
"logps/rejected": -408.0,
"loss": 0.0182,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.6484375,
"rewards/margins": 12.0,
"rewards/rejected": -12.625,
"step": 1038
},
{
"epoch": 1.2748466257668711,
"grad_norm": 11.843727477483496,
"learning_rate": 1.1619834710743802e-06,
"logits/chosen": -0.12353515625,
"logits/rejected": -0.2138671875,
"logps/chosen": -398.0,
"logps/rejected": -440.0,
"loss": 0.0418,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.3828125,
"rewards/margins": 11.625,
"rewards/rejected": -13.0,
"step": 1039
},
{
"epoch": 1.2760736196319018,
"grad_norm": 12.673779303634513,
"learning_rate": 1.1611570247933884e-06,
"logits/chosen": -0.15234375,
"logits/rejected": -0.439453125,
"logps/chosen": -436.0,
"logps/rejected": -384.0,
"loss": 0.0572,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.28125,
"rewards/margins": 12.5625,
"rewards/rejected": -12.875,
"step": 1040
},
{
"epoch": 1.2773006134969325,
"grad_norm": 9.27637004981359,
"learning_rate": 1.1603305785123966e-06,
"logits/chosen": -0.1064453125,
"logits/rejected": -0.24609375,
"logps/chosen": -396.0,
"logps/rejected": -398.0,
"loss": 0.0312,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1015625,
"rewards/margins": 12.0625,
"rewards/rejected": -13.1875,
"step": 1041
},
{
"epoch": 1.2785276073619631,
"grad_norm": 5.240907133996138,
"learning_rate": 1.159504132231405e-06,
"logits/chosen": -0.27734375,
"logits/rejected": -0.4765625,
"logps/chosen": -462.0,
"logps/rejected": -454.0,
"loss": 0.0109,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.359375,
"rewards/margins": 13.6875,
"rewards/rejected": -14.0,
"step": 1042
},
{
"epoch": 1.2797546012269938,
"grad_norm": 14.408088097702748,
"learning_rate": 1.1586776859504132e-06,
"logits/chosen": -0.06884765625,
"logits/rejected": -0.251953125,
"logps/chosen": -396.0,
"logps/rejected": -412.0,
"loss": 0.0626,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.15625,
"rewards/margins": 11.25,
"rewards/rejected": -13.4375,
"step": 1043
},
{
"epoch": 1.2809815950920245,
"grad_norm": 6.481935579315082,
"learning_rate": 1.1578512396694214e-06,
"logits/chosen": -0.173828125,
"logits/rejected": -0.390625,
"logps/chosen": -442.0,
"logps/rejected": -422.0,
"loss": 0.0152,
"rewards/accuracies": 0.9921875,
"rewards/chosen": 0.0179443359375,
"rewards/margins": 13.0625,
"rewards/rejected": -13.0625,
"step": 1044
},
{
"epoch": 1.2822085889570551,
"grad_norm": 6.5837250988984355,
"learning_rate": 1.1570247933884296e-06,
"logits/chosen": -0.21484375,
"logits/rejected": -0.4921875,
"logps/chosen": -442.0,
"logps/rejected": -398.0,
"loss": 0.0212,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.490234375,
"rewards/margins": 12.75,
"rewards/rejected": -13.25,
"step": 1045
},
{
"epoch": 1.2834355828220858,
"grad_norm": 7.360555654135404,
"learning_rate": 1.156198347107438e-06,
"logits/chosen": 0.03466796875,
"logits/rejected": -0.11572265625,
"logps/chosen": -412.0,
"logps/rejected": -426.0,
"loss": 0.0283,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.640625,
"rewards/margins": 11.1875,
"rewards/rejected": -12.8125,
"step": 1046
},
{
"epoch": 1.2846625766871167,
"grad_norm": 11.92972158256486,
"learning_rate": 1.1553719008264461e-06,
"logits/chosen": -0.13671875,
"logits/rejected": -0.279296875,
"logps/chosen": -418.0,
"logps/rejected": -424.0,
"loss": 0.0348,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.62890625,
"rewards/margins": 13.0,
"rewards/rejected": -13.625,
"step": 1047
},
{
"epoch": 1.2858895705521474,
"grad_norm": 6.532999108856601,
"learning_rate": 1.1545454545454545e-06,
"logits/chosen": -0.0294189453125,
"logits/rejected": -0.2294921875,
"logps/chosen": -354.0,
"logps/rejected": -370.0,
"loss": 0.0242,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.15625,
"rewards/margins": 11.9375,
"rewards/rejected": -13.0625,
"step": 1048
},
{
"epoch": 1.287116564417178,
"grad_norm": 7.374695524155877,
"learning_rate": 1.1537190082644627e-06,
"logits/chosen": -0.055908203125,
"logits/rejected": -0.279296875,
"logps/chosen": -386.0,
"logps/rejected": -392.0,
"loss": 0.0301,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.4921875,
"rewards/margins": 11.125,
"rewards/rejected": -12.625,
"step": 1049
},
{
"epoch": 1.2883435582822087,
"grad_norm": 13.182547731072962,
"learning_rate": 1.1528925619834711e-06,
"logits/chosen": -0.2041015625,
"logits/rejected": -0.34375,
"logps/chosen": -408.0,
"logps/rejected": -420.0,
"loss": 0.0551,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.3359375,
"rewards/margins": 11.375,
"rewards/rejected": -12.6875,
"step": 1050
},
{
"epoch": 1.2895705521472394,
"grad_norm": 4.933273422582305,
"learning_rate": 1.1520661157024793e-06,
"logits/chosen": -0.232421875,
"logits/rejected": -0.421875,
"logps/chosen": -430.0,
"logps/rejected": -444.0,
"loss": 0.0183,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.1953125,
"rewards/margins": 13.75,
"rewards/rejected": -13.9375,
"step": 1051
},
{
"epoch": 1.29079754601227,
"grad_norm": 13.147335745579854,
"learning_rate": 1.1512396694214877e-06,
"logits/chosen": -0.083984375,
"logits/rejected": -0.2890625,
"logps/chosen": -448.0,
"logps/rejected": -434.0,
"loss": 0.0707,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.7734375,
"rewards/margins": 11.0,
"rewards/rejected": -12.8125,
"step": 1052
},
{
"epoch": 1.2920245398773007,
"grad_norm": 17.89117182973075,
"learning_rate": 1.1504132231404957e-06,
"logits/chosen": -0.0233154296875,
"logits/rejected": -0.2431640625,
"logps/chosen": -378.0,
"logps/rejected": -388.0,
"loss": 0.0706,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.0390625,
"rewards/margins": 12.125,
"rewards/rejected": -13.1875,
"step": 1053
},
{
"epoch": 1.2932515337423314,
"grad_norm": 11.894902603375346,
"learning_rate": 1.149586776859504e-06,
"logits/chosen": -0.080078125,
"logits/rejected": -0.30078125,
"logps/chosen": -416.0,
"logps/rejected": -416.0,
"loss": 0.0684,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.1328125,
"rewards/margins": 12.75,
"rewards/rejected": -13.875,
"step": 1054
},
{
"epoch": 1.294478527607362,
"grad_norm": 11.855826173867971,
"learning_rate": 1.1487603305785123e-06,
"logits/chosen": -0.09375,
"logits/rejected": -0.310546875,
"logps/chosen": -398.0,
"logps/rejected": -408.0,
"loss": 0.0403,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.3671875,
"rewards/margins": 12.5625,
"rewards/rejected": -13.9375,
"step": 1055
},
{
"epoch": 1.2957055214723927,
"grad_norm": 6.54120593399342,
"learning_rate": 1.1479338842975207e-06,
"logits/chosen": -0.12890625,
"logits/rejected": -0.318359375,
"logps/chosen": -382.0,
"logps/rejected": -368.0,
"loss": 0.0218,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.375,
"rewards/margins": 11.8125,
"rewards/rejected": -13.1875,
"step": 1056
},
{
"epoch": 1.2969325153374234,
"grad_norm": 12.069194034475203,
"learning_rate": 1.1471074380165289e-06,
"logits/chosen": -0.11083984375,
"logits/rejected": -0.2470703125,
"logps/chosen": -420.0,
"logps/rejected": -416.0,
"loss": 0.034,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.3046875,
"rewards/margins": 12.125,
"rewards/rejected": -13.4375,
"step": 1057
},
{
"epoch": 1.298159509202454,
"grad_norm": 12.81723443687315,
"learning_rate": 1.146280991735537e-06,
"logits/chosen": -0.12109375,
"logits/rejected": -0.345703125,
"logps/chosen": -408.0,
"logps/rejected": -410.0,
"loss": 0.0442,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.1171875,
"rewards/margins": 12.5625,
"rewards/rejected": -13.6875,
"step": 1058
},
{
"epoch": 1.2993865030674847,
"grad_norm": 19.668616593165343,
"learning_rate": 1.1454545454545455e-06,
"logits/chosen": -0.1669921875,
"logits/rejected": -0.369140625,
"logps/chosen": -432.0,
"logps/rejected": -406.0,
"loss": 0.0771,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.9296875,
"rewards/margins": 11.875,
"rewards/rejected": -13.75,
"step": 1059
},
{
"epoch": 1.3006134969325154,
"grad_norm": 4.764240636634084,
"learning_rate": 1.1446280991735536e-06,
"logits/chosen": -0.1328125,
"logits/rejected": -0.2236328125,
"logps/chosen": -354.0,
"logps/rejected": -378.0,
"loss": 0.0166,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.3046875,
"rewards/margins": 12.3125,
"rewards/rejected": -13.625,
"step": 1060
},
{
"epoch": 1.301840490797546,
"grad_norm": 13.349737415518328,
"learning_rate": 1.143801652892562e-06,
"logits/chosen": -0.04150390625,
"logits/rejected": -0.1396484375,
"logps/chosen": -364.0,
"logps/rejected": -400.0,
"loss": 0.051,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.125,
"rewards/margins": 11.5,
"rewards/rejected": -13.5625,
"step": 1061
},
{
"epoch": 1.3030674846625767,
"grad_norm": 17.311517850074033,
"learning_rate": 1.14297520661157e-06,
"logits/chosen": -0.07958984375,
"logits/rejected": -0.2099609375,
"logps/chosen": -444.0,
"logps/rejected": -444.0,
"loss": 0.0964,
"rewards/accuracies": 0.953125,
"rewards/chosen": -1.9140625,
"rewards/margins": 11.4375,
"rewards/rejected": -13.3125,
"step": 1062
},
{
"epoch": 1.3042944785276074,
"grad_norm": 16.89674032193128,
"learning_rate": 1.1421487603305784e-06,
"logits/chosen": -0.142578125,
"logits/rejected": -0.28125,
"logps/chosen": -386.0,
"logps/rejected": -392.0,
"loss": 0.1149,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.90625,
"rewards/margins": 11.6875,
"rewards/rejected": -13.625,
"step": 1063
},
{
"epoch": 1.305521472392638,
"grad_norm": 6.913627860848936,
"learning_rate": 1.1413223140495866e-06,
"logits/chosen": -0.1494140625,
"logits/rejected": -0.287109375,
"logps/chosen": -402.0,
"logps/rejected": -418.0,
"loss": 0.0272,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.453125,
"rewards/margins": 12.625,
"rewards/rejected": -14.125,
"step": 1064
},
{
"epoch": 1.3067484662576687,
"grad_norm": 12.33620790684063,
"learning_rate": 1.140495867768595e-06,
"logits/chosen": -0.095703125,
"logits/rejected": -0.412109375,
"logps/chosen": -464.0,
"logps/rejected": -434.0,
"loss": 0.0578,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.4609375,
"rewards/margins": 14.125,
"rewards/rejected": -14.5625,
"step": 1065
},
{
"epoch": 1.3079754601226994,
"grad_norm": 7.54472806810441,
"learning_rate": 1.1396694214876032e-06,
"logits/chosen": -0.119140625,
"logits/rejected": -0.41015625,
"logps/chosen": -482.0,
"logps/rejected": -456.0,
"loss": 0.029,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.3984375,
"rewards/margins": 12.4375,
"rewards/rejected": -13.8125,
"step": 1066
},
{
"epoch": 1.30920245398773,
"grad_norm": 8.813890231917389,
"learning_rate": 1.1388429752066116e-06,
"logits/chosen": -0.1396484375,
"logits/rejected": -0.25390625,
"logps/chosen": -396.0,
"logps/rejected": -416.0,
"loss": 0.0292,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.296875,
"rewards/margins": 10.75,
"rewards/rejected": -13.0625,
"step": 1067
},
{
"epoch": 1.3104294478527607,
"grad_norm": 11.457689134913586,
"learning_rate": 1.1380165289256198e-06,
"logits/chosen": -0.1572265625,
"logits/rejected": -0.3046875,
"logps/chosen": -406.0,
"logps/rejected": -392.0,
"loss": 0.0573,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.4765625,
"rewards/margins": 12.1875,
"rewards/rejected": -13.625,
"step": 1068
},
{
"epoch": 1.3116564417177914,
"grad_norm": 9.193072844310997,
"learning_rate": 1.1371900826446282e-06,
"logits/chosen": -0.051513671875,
"logits/rejected": -0.27734375,
"logps/chosen": -426.0,
"logps/rejected": -434.0,
"loss": 0.0467,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.5625,
"rewards/margins": 11.9375,
"rewards/rejected": -13.5,
"step": 1069
},
{
"epoch": 1.312883435582822,
"grad_norm": 7.739296185791426,
"learning_rate": 1.1363636363636364e-06,
"logits/chosen": -0.1640625,
"logits/rejected": -0.240234375,
"logps/chosen": -402.0,
"logps/rejected": -436.0,
"loss": 0.0246,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.66015625,
"rewards/margins": 13.5625,
"rewards/rejected": -14.25,
"step": 1070
},
{
"epoch": 1.3141104294478527,
"grad_norm": 11.923582671449667,
"learning_rate": 1.1355371900826446e-06,
"logits/chosen": -0.2001953125,
"logits/rejected": -0.390625,
"logps/chosen": -406.0,
"logps/rejected": -422.0,
"loss": 0.0828,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.0546875,
"rewards/margins": 13.0625,
"rewards/rejected": -14.125,
"step": 1071
},
{
"epoch": 1.3153374233128834,
"grad_norm": 7.011783516581803,
"learning_rate": 1.1347107438016528e-06,
"logits/chosen": 0.0196533203125,
"logits/rejected": -0.171875,
"logps/chosen": -430.0,
"logps/rejected": -426.0,
"loss": 0.0263,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.4609375,
"rewards/margins": 12.0,
"rewards/rejected": -13.4375,
"step": 1072
},
{
"epoch": 1.316564417177914,
"grad_norm": 8.705400307021929,
"learning_rate": 1.1338842975206612e-06,
"logits/chosen": -0.1689453125,
"logits/rejected": -0.287109375,
"logps/chosen": -346.0,
"logps/rejected": -404.0,
"loss": 0.0254,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.5546875,
"rewards/margins": 11.9375,
"rewards/rejected": -13.5,
"step": 1073
},
{
"epoch": 1.3177914110429447,
"grad_norm": 8.904135421291642,
"learning_rate": 1.1330578512396693e-06,
"logits/chosen": -0.181640625,
"logits/rejected": -0.30078125,
"logps/chosen": -408.0,
"logps/rejected": -418.0,
"loss": 0.0355,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.484375,
"rewards/margins": 12.625,
"rewards/rejected": -14.125,
"step": 1074
},
{
"epoch": 1.3190184049079754,
"grad_norm": 11.515080176449112,
"learning_rate": 1.1322314049586775e-06,
"logits/chosen": -0.036865234375,
"logits/rejected": -0.20703125,
"logps/chosen": -418.0,
"logps/rejected": -428.0,
"loss": 0.0492,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.6875,
"rewards/margins": 12.4375,
"rewards/rejected": -14.125,
"step": 1075
},
{
"epoch": 1.320245398773006,
"grad_norm": 9.03764988799755,
"learning_rate": 1.131404958677686e-06,
"logits/chosen": -0.01287841796875,
"logits/rejected": -0.095703125,
"logps/chosen": -422.0,
"logps/rejected": -430.0,
"loss": 0.0416,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.9921875,
"rewards/margins": 12.4375,
"rewards/rejected": -14.4375,
"step": 1076
},
{
"epoch": 1.3214723926380367,
"grad_norm": 10.099191955462704,
"learning_rate": 1.1305785123966941e-06,
"logits/chosen": -0.1748046875,
"logits/rejected": -0.314453125,
"logps/chosen": -322.0,
"logps/rejected": -342.0,
"loss": 0.0544,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.296875,
"rewards/margins": 11.0625,
"rewards/rejected": -13.3125,
"step": 1077
},
{
"epoch": 1.3226993865030674,
"grad_norm": 5.486875279495536,
"learning_rate": 1.1297520661157025e-06,
"logits/chosen": -0.0194091796875,
"logits/rejected": -0.130859375,
"logps/chosen": -406.0,
"logps/rejected": -428.0,
"loss": 0.0292,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.640625,
"rewards/margins": 10.5,
"rewards/rejected": -13.125,
"step": 1078
},
{
"epoch": 1.323926380368098,
"grad_norm": 15.612402485436549,
"learning_rate": 1.1289256198347107e-06,
"logits/chosen": -0.0908203125,
"logits/rejected": -0.236328125,
"logps/chosen": -406.0,
"logps/rejected": -416.0,
"loss": 0.049,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.9921875,
"rewards/margins": 12.25,
"rewards/rejected": -14.25,
"step": 1079
},
{
"epoch": 1.3251533742331287,
"grad_norm": 11.695955328947008,
"learning_rate": 1.128099173553719e-06,
"logits/chosen": -0.028564453125,
"logits/rejected": -0.2265625,
"logps/chosen": -382.0,
"logps/rejected": -386.0,
"loss": 0.0454,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.671875,
"rewards/margins": 11.25,
"rewards/rejected": -12.875,
"step": 1080
},
{
"epoch": 1.3263803680981594,
"grad_norm": 12.95159332825153,
"learning_rate": 1.127272727272727e-06,
"logits/chosen": -0.0693359375,
"logits/rejected": -0.23046875,
"logps/chosen": -408.0,
"logps/rejected": -424.0,
"loss": 0.0718,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.3671875,
"rewards/margins": 12.0625,
"rewards/rejected": -13.4375,
"step": 1081
},
{
"epoch": 1.32760736196319,
"grad_norm": 9.81940001837259,
"learning_rate": 1.1264462809917355e-06,
"logits/chosen": -0.162109375,
"logits/rejected": -0.400390625,
"logps/chosen": -430.0,
"logps/rejected": -394.0,
"loss": 0.0374,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.53125,
"rewards/margins": 11.4375,
"rewards/rejected": -13.0,
"step": 1082
},
{
"epoch": 1.3288343558282207,
"grad_norm": 6.400253744341072,
"learning_rate": 1.1256198347107437e-06,
"logits/chosen": -0.0595703125,
"logits/rejected": -0.2490234375,
"logps/chosen": -388.0,
"logps/rejected": -352.0,
"loss": 0.0257,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.765625,
"rewards/margins": 10.5625,
"rewards/rejected": -12.375,
"step": 1083
},
{
"epoch": 1.3300613496932514,
"grad_norm": 8.444026170405825,
"learning_rate": 1.124793388429752e-06,
"logits/chosen": -0.10693359375,
"logits/rejected": -0.1142578125,
"logps/chosen": -370.0,
"logps/rejected": -388.0,
"loss": 0.0373,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.453125,
"rewards/margins": 11.5625,
"rewards/rejected": -13.0625,
"step": 1084
},
{
"epoch": 1.331288343558282,
"grad_norm": 9.169663665787084,
"learning_rate": 1.1239669421487603e-06,
"logits/chosen": 0.0068359375,
"logits/rejected": -0.1357421875,
"logps/chosen": -404.0,
"logps/rejected": -402.0,
"loss": 0.0308,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.96875,
"rewards/margins": 10.875,
"rewards/rejected": -12.875,
"step": 1085
},
{
"epoch": 1.332515337423313,
"grad_norm": 12.388648096466534,
"learning_rate": 1.1231404958677687e-06,
"logits/chosen": -0.060546875,
"logits/rejected": -0.1884765625,
"logps/chosen": -330.0,
"logps/rejected": -366.0,
"loss": 0.049,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.046875,
"rewards/margins": 11.5,
"rewards/rejected": -12.5625,
"step": 1086
},
{
"epoch": 1.3337423312883436,
"grad_norm": 11.999502595211819,
"learning_rate": 1.1223140495867769e-06,
"logits/chosen": -0.1689453125,
"logits/rejected": -0.302734375,
"logps/chosen": -334.0,
"logps/rejected": -394.0,
"loss": 0.0504,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.453125,
"rewards/margins": 11.0625,
"rewards/rejected": -12.5,
"step": 1087
},
{
"epoch": 1.3349693251533743,
"grad_norm": 8.891255801535511,
"learning_rate": 1.1214876033057853e-06,
"logits/chosen": -0.09619140625,
"logits/rejected": -0.322265625,
"logps/chosen": -460.0,
"logps/rejected": -402.0,
"loss": 0.0318,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.75390625,
"rewards/margins": 12.125,
"rewards/rejected": -12.875,
"step": 1088
},
{
"epoch": 1.336196319018405,
"grad_norm": 8.918347449638453,
"learning_rate": 1.1206611570247932e-06,
"logits/chosen": -0.142578125,
"logits/rejected": -0.302734375,
"logps/chosen": -408.0,
"logps/rejected": -382.0,
"loss": 0.0442,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.25,
"rewards/margins": 10.375,
"rewards/rejected": -12.625,
"step": 1089
},
{
"epoch": 1.3374233128834356,
"grad_norm": 12.793929135194107,
"learning_rate": 1.1198347107438016e-06,
"logits/chosen": -0.091796875,
"logits/rejected": -0.294921875,
"logps/chosen": -390.0,
"logps/rejected": -372.0,
"loss": 0.0414,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.7578125,
"rewards/margins": 10.5,
"rewards/rejected": -12.25,
"step": 1090
},
{
"epoch": 1.3386503067484663,
"grad_norm": 16.499007058381682,
"learning_rate": 1.1190082644628098e-06,
"logits/chosen": 0.06103515625,
"logits/rejected": -0.10986328125,
"logps/chosen": -444.0,
"logps/rejected": -394.0,
"loss": 0.1058,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.71875,
"rewards/margins": 10.8125,
"rewards/rejected": -12.5,
"step": 1091
},
{
"epoch": 1.339877300613497,
"grad_norm": 8.500740173918128,
"learning_rate": 1.1181818181818182e-06,
"logits/chosen": -0.10498046875,
"logits/rejected": -0.275390625,
"logps/chosen": -432.0,
"logps/rejected": -426.0,
"loss": 0.0261,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.28125,
"rewards/margins": 11.8125,
"rewards/rejected": -13.0625,
"step": 1092
},
{
"epoch": 1.3411042944785276,
"grad_norm": 3.5758332131591115,
"learning_rate": 1.1173553719008264e-06,
"logits/chosen": -0.1650390625,
"logits/rejected": -0.306640625,
"logps/chosen": -392.0,
"logps/rejected": -394.0,
"loss": 0.0151,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.0078125,
"rewards/margins": 11.0625,
"rewards/rejected": -12.0625,
"step": 1093
},
{
"epoch": 1.3423312883435583,
"grad_norm": 10.250127714023796,
"learning_rate": 1.1165289256198346e-06,
"logits/chosen": -0.038818359375,
"logits/rejected": -0.263671875,
"logps/chosen": -444.0,
"logps/rejected": -448.0,
"loss": 0.0459,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.140625,
"rewards/margins": 11.9375,
"rewards/rejected": -13.0625,
"step": 1094
},
{
"epoch": 1.343558282208589,
"grad_norm": 7.549182170613035,
"learning_rate": 1.115702479338843e-06,
"logits/chosen": -0.09716796875,
"logits/rejected": -0.310546875,
"logps/chosen": -464.0,
"logps/rejected": -456.0,
"loss": 0.03,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.828125,
"rewards/margins": 13.375,
"rewards/rejected": -14.1875,
"step": 1095
},
{
"epoch": 1.3447852760736196,
"grad_norm": 18.418565843621806,
"learning_rate": 1.1148760330578512e-06,
"logits/chosen": -0.10791015625,
"logits/rejected": -0.2451171875,
"logps/chosen": -400.0,
"logps/rejected": -404.0,
"loss": 0.1051,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.9140625,
"rewards/margins": 11.0625,
"rewards/rejected": -13.0,
"step": 1096
},
{
"epoch": 1.3460122699386503,
"grad_norm": 10.197334871983669,
"learning_rate": 1.1140495867768596e-06,
"logits/chosen": -0.0625,
"logits/rejected": -0.2490234375,
"logps/chosen": -450.0,
"logps/rejected": -412.0,
"loss": 0.0318,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.28125,
"rewards/margins": 12.0,
"rewards/rejected": -13.3125,
"step": 1097
},
{
"epoch": 1.347239263803681,
"grad_norm": 15.038795320690456,
"learning_rate": 1.1132231404958676e-06,
"logits/chosen": 0.000812530517578125,
"logits/rejected": -0.1533203125,
"logps/chosen": -380.0,
"logps/rejected": -416.0,
"loss": 0.0516,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.296875,
"rewards/margins": 12.5,
"rewards/rejected": -13.75,
"step": 1098
},
{
"epoch": 1.3484662576687116,
"grad_norm": 11.79834009669459,
"learning_rate": 1.112396694214876e-06,
"logits/chosen": -0.05859375,
"logits/rejected": -0.1728515625,
"logps/chosen": -370.0,
"logps/rejected": -382.0,
"loss": 0.0578,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.8359375,
"rewards/margins": 11.9375,
"rewards/rejected": -13.75,
"step": 1099
},
{
"epoch": 1.3496932515337423,
"grad_norm": 12.08925789040524,
"learning_rate": 1.1115702479338841e-06,
"logits/chosen": -0.12255859375,
"logits/rejected": -0.3515625,
"logps/chosen": -426.0,
"logps/rejected": -410.0,
"loss": 0.0332,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.046875,
"rewards/margins": 12.5625,
"rewards/rejected": -13.625,
"step": 1100
},
{
"epoch": 1.350920245398773,
"grad_norm": 14.594290361661232,
"learning_rate": 1.1107438016528925e-06,
"logits/chosen": 0.07275390625,
"logits/rejected": -0.09033203125,
"logps/chosen": -390.0,
"logps/rejected": -384.0,
"loss": 0.0934,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.3515625,
"rewards/margins": 12.6875,
"rewards/rejected": -14.0625,
"step": 1101
},
{
"epoch": 1.3521472392638036,
"grad_norm": 16.392401563130303,
"learning_rate": 1.1099173553719007e-06,
"logits/chosen": -0.2255859375,
"logits/rejected": -0.404296875,
"logps/chosen": -386.0,
"logps/rejected": -380.0,
"loss": 0.1283,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.94921875,
"rewards/margins": 13.0625,
"rewards/rejected": -14.0,
"step": 1102
},
{
"epoch": 1.3533742331288343,
"grad_norm": 11.589221885924317,
"learning_rate": 1.1090909090909091e-06,
"logits/chosen": -0.09765625,
"logits/rejected": -0.251953125,
"logps/chosen": -434.0,
"logps/rejected": -436.0,
"loss": 0.044,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.46875,
"rewards/margins": 12.6875,
"rewards/rejected": -14.125,
"step": 1103
},
{
"epoch": 1.354601226993865,
"grad_norm": 11.569191498481278,
"learning_rate": 1.1082644628099173e-06,
"logits/chosen": -0.052734375,
"logits/rejected": -0.2001953125,
"logps/chosen": -384.0,
"logps/rejected": -412.0,
"loss": 0.0622,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.4921875,
"rewards/margins": 12.25,
"rewards/rejected": -13.75,
"step": 1104
},
{
"epoch": 1.3558282208588956,
"grad_norm": 3.868808082562751,
"learning_rate": 1.1074380165289257e-06,
"logits/chosen": -0.2001953125,
"logits/rejected": -0.34765625,
"logps/chosen": -426.0,
"logps/rejected": -450.0,
"loss": 0.0137,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.734375,
"rewards/margins": 13.125,
"rewards/rejected": -13.875,
"step": 1105
},
{
"epoch": 1.3570552147239263,
"grad_norm": 16.223504437577937,
"learning_rate": 1.1066115702479337e-06,
"logits/chosen": -0.12890625,
"logits/rejected": -0.2412109375,
"logps/chosen": -380.0,
"logps/rejected": -412.0,
"loss": 0.0502,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.7734375,
"rewards/margins": 12.5,
"rewards/rejected": -14.25,
"step": 1106
},
{
"epoch": 1.358282208588957,
"grad_norm": 12.163334554633638,
"learning_rate": 1.105785123966942e-06,
"logits/chosen": 0.06494140625,
"logits/rejected": -0.056396484375,
"logps/chosen": -422.0,
"logps/rejected": -412.0,
"loss": 0.0542,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.2734375,
"rewards/margins": 12.0625,
"rewards/rejected": -13.3125,
"step": 1107
},
{
"epoch": 1.3595092024539877,
"grad_norm": 4.111674738323493,
"learning_rate": 1.1049586776859503e-06,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.310546875,
"logps/chosen": -462.0,
"logps/rejected": -440.0,
"loss": 0.0166,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.875,
"rewards/margins": 13.9375,
"rewards/rejected": -14.8125,
"step": 1108
},
{
"epoch": 1.3607361963190185,
"grad_norm": 9.586036719606902,
"learning_rate": 1.1041322314049587e-06,
"logits/chosen": -0.0107421875,
"logits/rejected": -0.1591796875,
"logps/chosen": -426.0,
"logps/rejected": -422.0,
"loss": 0.0388,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.9375,
"rewards/margins": 11.8125,
"rewards/rejected": -13.6875,
"step": 1109
},
{
"epoch": 1.3619631901840492,
"grad_norm": 9.423691628063677,
"learning_rate": 1.1033057851239669e-06,
"logits/chosen": -0.10107421875,
"logits/rejected": -0.31640625,
"logps/chosen": -418.0,
"logps/rejected": -428.0,
"loss": 0.0333,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.609375,
"rewards/margins": 12.9375,
"rewards/rejected": -14.5625,
"step": 1110
},
{
"epoch": 1.3631901840490799,
"grad_norm": 3.887903082881031,
"learning_rate": 1.102479338842975e-06,
"logits/chosen": -0.1318359375,
"logits/rejected": -0.326171875,
"logps/chosen": -454.0,
"logps/rejected": -422.0,
"loss": 0.0121,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.5546875,
"rewards/margins": 13.1875,
"rewards/rejected": -14.75,
"step": 1111
},
{
"epoch": 1.3644171779141105,
"grad_norm": 21.75364320203141,
"learning_rate": 1.1016528925619835e-06,
"logits/chosen": -0.12109375,
"logits/rejected": -0.21484375,
"logps/chosen": -444.0,
"logps/rejected": -448.0,
"loss": 0.128,
"rewards/accuracies": 0.953125,
"rewards/chosen": -2.21875,
"rewards/margins": 12.75,
"rewards/rejected": -15.0,
"step": 1112
},
{
"epoch": 1.3656441717791412,
"grad_norm": 11.723144845985662,
"learning_rate": 1.1008264462809917e-06,
"logits/chosen": -0.09375,
"logits/rejected": -0.15234375,
"logps/chosen": -384.0,
"logps/rejected": -402.0,
"loss": 0.048,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.53125,
"rewards/margins": 11.625,
"rewards/rejected": -14.1875,
"step": 1113
},
{
"epoch": 1.3668711656441719,
"grad_norm": 14.4541664951003,
"learning_rate": 1.1e-06,
"logits/chosen": -0.244140625,
"logits/rejected": -0.361328125,
"logps/chosen": -368.0,
"logps/rejected": -398.0,
"loss": 0.0484,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.875,
"rewards/margins": 11.625,
"rewards/rejected": -14.5,
"step": 1114
},
{
"epoch": 1.3680981595092025,
"grad_norm": 12.99737927975128,
"learning_rate": 1.099173553719008e-06,
"logits/chosen": -0.1328125,
"logits/rejected": -0.2470703125,
"logps/chosen": -400.0,
"logps/rejected": -408.0,
"loss": 0.042,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.109375,
"rewards/margins": 12.875,
"rewards/rejected": -15.0,
"step": 1115
},
{
"epoch": 1.3693251533742332,
"grad_norm": 4.63602627137829,
"learning_rate": 1.0983471074380164e-06,
"logits/chosen": -0.0615234375,
"logits/rejected": -0.2470703125,
"logps/chosen": -456.0,
"logps/rejected": -450.0,
"loss": 0.023,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.390625,
"rewards/margins": 13.9375,
"rewards/rejected": -16.375,
"step": 1116
},
{
"epoch": 1.3705521472392639,
"grad_norm": 6.228478350481593,
"learning_rate": 1.0975206611570246e-06,
"logits/chosen": -0.244140625,
"logits/rejected": -0.46875,
"logps/chosen": -464.0,
"logps/rejected": -444.0,
"loss": 0.0202,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.203125,
"rewards/margins": 13.375,
"rewards/rejected": -15.5625,
"step": 1117
},
{
"epoch": 1.3717791411042946,
"grad_norm": 13.957316343629058,
"learning_rate": 1.096694214876033e-06,
"logits/chosen": -0.049560546875,
"logits/rejected": -0.2255859375,
"logps/chosen": -408.0,
"logps/rejected": -424.0,
"loss": 0.0812,
"rewards/accuracies": 0.953125,
"rewards/chosen": -3.1875,
"rewards/margins": 12.0,
"rewards/rejected": -15.1875,
"step": 1118
},
{
"epoch": 1.3730061349693252,
"grad_norm": 13.063057761778065,
"learning_rate": 1.0958677685950412e-06,
"logits/chosen": -0.146484375,
"logits/rejected": -0.326171875,
"logps/chosen": -454.0,
"logps/rejected": -464.0,
"loss": 0.0711,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.109375,
"rewards/margins": 12.4375,
"rewards/rejected": -15.5625,
"step": 1119
},
{
"epoch": 1.3742331288343559,
"grad_norm": 10.199819984826927,
"learning_rate": 1.0950413223140496e-06,
"logits/chosen": -0.1044921875,
"logits/rejected": -0.400390625,
"logps/chosen": -456.0,
"logps/rejected": -440.0,
"loss": 0.0302,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.140625,
"rewards/margins": 13.5625,
"rewards/rejected": -15.6875,
"step": 1120
},
{
"epoch": 1.3754601226993866,
"grad_norm": 12.945149935356588,
"learning_rate": 1.0942148760330578e-06,
"logits/chosen": -0.21875,
"logits/rejected": -0.3828125,
"logps/chosen": -470.0,
"logps/rejected": -450.0,
"loss": 0.0471,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.59375,
"rewards/margins": 13.0625,
"rewards/rejected": -15.625,
"step": 1121
},
{
"epoch": 1.3766871165644172,
"grad_norm": 44.95428070783949,
"learning_rate": 1.0933884297520662e-06,
"logits/chosen": -0.2353515625,
"logits/rejected": -0.37109375,
"logps/chosen": -398.0,
"logps/rejected": -416.0,
"loss": 0.0564,
"rewards/accuracies": 0.984375,
"rewards/chosen": -3.875,
"rewards/margins": 11.75,
"rewards/rejected": -15.625,
"step": 1122
},
{
"epoch": 1.377914110429448,
"grad_norm": 4.007931665438838,
"learning_rate": 1.0925619834710744e-06,
"logits/chosen": -0.232421875,
"logits/rejected": -0.38671875,
"logps/chosen": -472.0,
"logps/rejected": -428.0,
"loss": 0.0127,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.265625,
"rewards/margins": 12.625,
"rewards/rejected": -15.875,
"step": 1123
},
{
"epoch": 1.3791411042944786,
"grad_norm": 9.868525682809,
"learning_rate": 1.0917355371900826e-06,
"logits/chosen": -0.1533203125,
"logits/rejected": -0.34765625,
"logps/chosen": -422.0,
"logps/rejected": -412.0,
"loss": 0.0264,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.828125,
"rewards/margins": 13.25,
"rewards/rejected": -16.125,
"step": 1124
},
{
"epoch": 1.3803680981595092,
"grad_norm": 11.166114244137697,
"learning_rate": 1.0909090909090908e-06,
"logits/chosen": -0.224609375,
"logits/rejected": -0.380859375,
"logps/chosen": -416.0,
"logps/rejected": -424.0,
"loss": 0.0372,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -3.484375,
"rewards/margins": 12.125,
"rewards/rejected": -15.625,
"step": 1125
},
{
"epoch": 1.38159509202454,
"grad_norm": 13.280915899781382,
"learning_rate": 1.0900826446280992e-06,
"logits/chosen": -0.2216796875,
"logits/rejected": -0.357421875,
"logps/chosen": -402.0,
"logps/rejected": -412.0,
"loss": 0.0423,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.890625,
"rewards/margins": 13.0,
"rewards/rejected": -15.875,
"step": 1126
},
{
"epoch": 1.3828220858895706,
"grad_norm": 14.128061178067208,
"learning_rate": 1.0892561983471074e-06,
"logits/chosen": -0.1787109375,
"logits/rejected": -0.39453125,
"logps/chosen": -482.0,
"logps/rejected": -478.0,
"loss": 0.0629,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.390625,
"rewards/margins": 13.125,
"rewards/rejected": -15.5625,
"step": 1127
},
{
"epoch": 1.3840490797546012,
"grad_norm": 21.084699918466672,
"learning_rate": 1.0884297520661158e-06,
"logits/chosen": -0.134765625,
"logits/rejected": -0.296875,
"logps/chosen": -426.0,
"logps/rejected": -458.0,
"loss": 0.0941,
"rewards/accuracies": 0.953125,
"rewards/chosen": -3.65625,
"rewards/margins": 11.5,
"rewards/rejected": -15.1875,
"step": 1128
},
{
"epoch": 1.385276073619632,
"grad_norm": 11.280833468857944,
"learning_rate": 1.087603305785124e-06,
"logits/chosen": -0.0223388671875,
"logits/rejected": -0.173828125,
"logps/chosen": -424.0,
"logps/rejected": -412.0,
"loss": 0.0381,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.640625,
"rewards/margins": 12.3125,
"rewards/rejected": -14.9375,
"step": 1129
},
{
"epoch": 1.3865030674846626,
"grad_norm": 14.123568665705431,
"learning_rate": 1.0867768595041321e-06,
"logits/chosen": 0.037109375,
"logits/rejected": -0.193359375,
"logps/chosen": -460.0,
"logps/rejected": -450.0,
"loss": 0.0441,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.671875,
"rewards/margins": 12.3125,
"rewards/rejected": -15.0,
"step": 1130
},
{
"epoch": 1.3877300613496932,
"grad_norm": 6.178909028368577,
"learning_rate": 1.0859504132231405e-06,
"logits/chosen": -0.2275390625,
"logits/rejected": -0.52734375,
"logps/chosen": -456.0,
"logps/rejected": -438.0,
"loss": 0.02,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.09375,
"rewards/margins": 12.6875,
"rewards/rejected": -14.8125,
"step": 1131
},
{
"epoch": 1.388957055214724,
"grad_norm": 10.805776636910203,
"learning_rate": 1.0851239669421487e-06,
"logits/chosen": -0.1279296875,
"logits/rejected": -0.361328125,
"logps/chosen": -512.0,
"logps/rejected": -446.0,
"loss": 0.0368,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.09375,
"rewards/margins": 13.125,
"rewards/rejected": -14.1875,
"step": 1132
},
{
"epoch": 1.3901840490797546,
"grad_norm": 19.841864661673558,
"learning_rate": 1.084297520661157e-06,
"logits/chosen": -0.208984375,
"logits/rejected": -0.349609375,
"logps/chosen": -430.0,
"logps/rejected": -448.0,
"loss": 0.0922,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.2109375,
"rewards/margins": 13.625,
"rewards/rejected": -14.8125,
"step": 1133
},
{
"epoch": 1.3914110429447852,
"grad_norm": 10.194863335887721,
"learning_rate": 1.083471074380165e-06,
"logits/chosen": -0.2001953125,
"logits/rejected": -0.416015625,
"logps/chosen": -346.0,
"logps/rejected": -370.0,
"loss": 0.0495,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.046875,
"rewards/margins": 11.0,
"rewards/rejected": -14.0,
"step": 1134
},
{
"epoch": 1.392638036809816,
"grad_norm": 7.326038004027609,
"learning_rate": 1.0826446280991735e-06,
"logits/chosen": -0.14453125,
"logits/rejected": -0.341796875,
"logps/chosen": -430.0,
"logps/rejected": -412.0,
"loss": 0.033,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.234375,
"rewards/margins": 13.3125,
"rewards/rejected": -14.5625,
"step": 1135
},
{
"epoch": 1.3938650306748466,
"grad_norm": 9.877857564056603,
"learning_rate": 1.0818181818181817e-06,
"logits/chosen": -0.294921875,
"logits/rejected": -0.451171875,
"logps/chosen": -484.0,
"logps/rejected": -442.0,
"loss": 0.0328,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.66796875,
"rewards/margins": 13.6875,
"rewards/rejected": -14.375,
"step": 1136
},
{
"epoch": 1.3950920245398772,
"grad_norm": 13.659752886354067,
"learning_rate": 1.08099173553719e-06,
"logits/chosen": -0.232421875,
"logits/rejected": -0.484375,
"logps/chosen": -484.0,
"logps/rejected": -438.0,
"loss": 0.0743,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.3046875,
"rewards/margins": 12.375,
"rewards/rejected": -13.6875,
"step": 1137
},
{
"epoch": 1.396319018404908,
"grad_norm": 14.524155747469125,
"learning_rate": 1.0801652892561983e-06,
"logits/chosen": -0.04931640625,
"logits/rejected": -0.25390625,
"logps/chosen": -404.0,
"logps/rejected": -384.0,
"loss": 0.0553,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.8203125,
"rewards/margins": 10.9375,
"rewards/rejected": -12.75,
"step": 1138
},
{
"epoch": 1.3975460122699386,
"grad_norm": 10.894448699490265,
"learning_rate": 1.0793388429752067e-06,
"logits/chosen": -0.1982421875,
"logits/rejected": -0.40625,
"logps/chosen": -376.0,
"logps/rejected": -400.0,
"loss": 0.0446,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.28125,
"rewards/margins": 12.8125,
"rewards/rejected": -14.125,
"step": 1139
},
{
"epoch": 1.3987730061349692,
"grad_norm": 15.91233768493971,
"learning_rate": 1.0785123966942149e-06,
"logits/chosen": -0.09814453125,
"logits/rejected": -0.2392578125,
"logps/chosen": -368.0,
"logps/rejected": -386.0,
"loss": 0.0726,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.9140625,
"rewards/margins": 11.625,
"rewards/rejected": -13.5,
"step": 1140
},
{
"epoch": 1.4,
"grad_norm": 6.640740366705044,
"learning_rate": 1.0776859504132233e-06,
"logits/chosen": -0.1630859375,
"logits/rejected": -0.392578125,
"logps/chosen": -370.0,
"logps/rejected": -382.0,
"loss": 0.0252,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.4375,
"rewards/margins": 11.375,
"rewards/rejected": -12.8125,
"step": 1141
},
{
"epoch": 1.4012269938650306,
"grad_norm": 7.153198912223154,
"learning_rate": 1.0768595041322312e-06,
"logits/chosen": -0.046875,
"logits/rejected": -0.189453125,
"logps/chosen": -360.0,
"logps/rejected": -404.0,
"loss": 0.0239,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.94921875,
"rewards/margins": 11.9375,
"rewards/rejected": -12.9375,
"step": 1142
},
{
"epoch": 1.4024539877300612,
"grad_norm": 9.642681019052885,
"learning_rate": 1.0760330578512396e-06,
"logits/chosen": -0.12109375,
"logits/rejected": -0.2451171875,
"logps/chosen": -414.0,
"logps/rejected": -438.0,
"loss": 0.0358,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.171875,
"rewards/margins": 11.375,
"rewards/rejected": -13.5625,
"step": 1143
},
{
"epoch": 1.403680981595092,
"grad_norm": 14.227675253016205,
"learning_rate": 1.0752066115702478e-06,
"logits/chosen": -0.2431640625,
"logits/rejected": -0.3828125,
"logps/chosen": -406.0,
"logps/rejected": -408.0,
"loss": 0.0513,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.265625,
"rewards/margins": 11.8125,
"rewards/rejected": -13.0625,
"step": 1144
},
{
"epoch": 1.4049079754601226,
"grad_norm": 11.800571213742684,
"learning_rate": 1.0743801652892562e-06,
"logits/chosen": -0.140625,
"logits/rejected": -0.328125,
"logps/chosen": -472.0,
"logps/rejected": -454.0,
"loss": 0.0427,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.625,
"rewards/margins": 12.4375,
"rewards/rejected": -13.0625,
"step": 1145
},
{
"epoch": 1.4061349693251532,
"grad_norm": 14.914551219811399,
"learning_rate": 1.0735537190082644e-06,
"logits/chosen": -0.0322265625,
"logits/rejected": -0.1572265625,
"logps/chosen": -394.0,
"logps/rejected": -420.0,
"loss": 0.061,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.8359375,
"rewards/margins": 11.75,
"rewards/rejected": -13.5625,
"step": 1146
},
{
"epoch": 1.407361963190184,
"grad_norm": 6.858664975772462,
"learning_rate": 1.0727272727272726e-06,
"logits/chosen": -0.1513671875,
"logits/rejected": -0.35546875,
"logps/chosen": -404.0,
"logps/rejected": -406.0,
"loss": 0.0241,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.5859375,
"rewards/margins": 13.0,
"rewards/rejected": -13.625,
"step": 1147
},
{
"epoch": 1.4085889570552146,
"grad_norm": 10.962257082037691,
"learning_rate": 1.071900826446281e-06,
"logits/chosen": -0.072265625,
"logits/rejected": -0.2333984375,
"logps/chosen": -384.0,
"logps/rejected": -398.0,
"loss": 0.0583,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.328125,
"rewards/margins": 11.8125,
"rewards/rejected": -13.125,
"step": 1148
},
{
"epoch": 1.4098159509202455,
"grad_norm": 6.794326014079488,
"learning_rate": 1.0710743801652892e-06,
"logits/chosen": -0.1279296875,
"logits/rejected": -0.30078125,
"logps/chosen": -392.0,
"logps/rejected": -420.0,
"loss": 0.0196,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.5,
"rewards/margins": 13.125,
"rewards/rejected": -13.625,
"step": 1149
},
{
"epoch": 1.4110429447852761,
"grad_norm": 9.508505178960478,
"learning_rate": 1.0702479338842976e-06,
"logits/chosen": -0.051513671875,
"logits/rejected": -0.2353515625,
"logps/chosen": -402.0,
"logps/rejected": -408.0,
"loss": 0.0448,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.21875,
"rewards/margins": 12.1875,
"rewards/rejected": -13.4375,
"step": 1150
},
{
"epoch": 1.4122699386503068,
"grad_norm": 5.663071454826858,
"learning_rate": 1.0694214876033056e-06,
"logits/chosen": -0.12060546875,
"logits/rejected": -0.318359375,
"logps/chosen": -402.0,
"logps/rejected": -432.0,
"loss": 0.0197,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.609375,
"rewards/margins": 12.75,
"rewards/rejected": -14.375,
"step": 1151
},
{
"epoch": 1.4134969325153375,
"grad_norm": 9.091569922950566,
"learning_rate": 1.068595041322314e-06,
"logits/chosen": -0.1904296875,
"logits/rejected": -0.306640625,
"logps/chosen": -432.0,
"logps/rejected": -458.0,
"loss": 0.0319,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.65625,
"rewards/margins": 13.3125,
"rewards/rejected": -14.0,
"step": 1152
},
{
"epoch": 1.4147239263803681,
"grad_norm": 13.128211932921769,
"learning_rate": 1.0677685950413222e-06,
"logits/chosen": -0.1083984375,
"logits/rejected": -0.25390625,
"logps/chosen": -418.0,
"logps/rejected": -428.0,
"loss": 0.0658,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.8671875,
"rewards/margins": 12.3125,
"rewards/rejected": -13.1875,
"step": 1153
},
{
"epoch": 1.4159509202453988,
"grad_norm": 11.294169081027212,
"learning_rate": 1.0669421487603306e-06,
"logits/chosen": -0.1943359375,
"logits/rejected": -0.365234375,
"logps/chosen": -460.0,
"logps/rejected": -448.0,
"loss": 0.0473,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.76171875,
"rewards/margins": 13.875,
"rewards/rejected": -14.625,
"step": 1154
},
{
"epoch": 1.4171779141104295,
"grad_norm": 12.509865559648775,
"learning_rate": 1.0661157024793387e-06,
"logits/chosen": -0.1865234375,
"logits/rejected": -0.306640625,
"logps/chosen": -392.0,
"logps/rejected": -412.0,
"loss": 0.0541,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.515625,
"rewards/margins": 12.0,
"rewards/rejected": -13.5,
"step": 1155
},
{
"epoch": 1.4184049079754601,
"grad_norm": 9.578194633018429,
"learning_rate": 1.0652892561983471e-06,
"logits/chosen": -0.11181640625,
"logits/rejected": -0.376953125,
"logps/chosen": -454.0,
"logps/rejected": -424.0,
"loss": 0.0308,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.64453125,
"rewards/margins": 13.6875,
"rewards/rejected": -14.3125,
"step": 1156
},
{
"epoch": 1.4196319018404908,
"grad_norm": 18.224674000278817,
"learning_rate": 1.0644628099173553e-06,
"logits/chosen": -0.1357421875,
"logits/rejected": -0.26953125,
"logps/chosen": -468.0,
"logps/rejected": -452.0,
"loss": 0.0601,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.69921875,
"rewards/margins": 13.0625,
"rewards/rejected": -13.75,
"step": 1157
},
{
"epoch": 1.4208588957055215,
"grad_norm": 7.115474354709706,
"learning_rate": 1.0636363636363637e-06,
"logits/chosen": -0.1572265625,
"logits/rejected": -0.310546875,
"logps/chosen": -362.0,
"logps/rejected": -384.0,
"loss": 0.0254,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.234375,
"rewards/margins": 12.625,
"rewards/rejected": -13.875,
"step": 1158
},
{
"epoch": 1.4220858895705522,
"grad_norm": 15.973404988960032,
"learning_rate": 1.062809917355372e-06,
"logits/chosen": -0.10302734375,
"logits/rejected": -0.18359375,
"logps/chosen": -368.0,
"logps/rejected": -422.0,
"loss": 0.0867,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.625,
"rewards/margins": 12.4375,
"rewards/rejected": -14.0625,
"step": 1159
},
{
"epoch": 1.4233128834355828,
"grad_norm": 14.365704372419215,
"learning_rate": 1.0619834710743801e-06,
"logits/chosen": -0.2265625,
"logits/rejected": -0.3984375,
"logps/chosen": -432.0,
"logps/rejected": -432.0,
"loss": 0.074,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.4453125,
"rewards/margins": 12.8125,
"rewards/rejected": -14.25,
"step": 1160
},
{
"epoch": 1.4245398773006135,
"grad_norm": 9.476208059624636,
"learning_rate": 1.0611570247933883e-06,
"logits/chosen": -0.0673828125,
"logits/rejected": -0.1923828125,
"logps/chosen": -398.0,
"logps/rejected": -448.0,
"loss": 0.104,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.9765625,
"rewards/margins": 11.9375,
"rewards/rejected": -13.9375,
"step": 1161
},
{
"epoch": 1.4257668711656442,
"grad_norm": 9.6888401476112,
"learning_rate": 1.0603305785123967e-06,
"logits/chosen": -0.177734375,
"logits/rejected": -0.306640625,
"logps/chosen": -412.0,
"logps/rejected": -416.0,
"loss": 0.0424,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.7734375,
"rewards/margins": 12.375,
"rewards/rejected": -14.125,
"step": 1162
},
{
"epoch": 1.4269938650306748,
"grad_norm": 8.768687516162553,
"learning_rate": 1.0595041322314049e-06,
"logits/chosen": -0.26953125,
"logits/rejected": -0.5234375,
"logps/chosen": -420.0,
"logps/rejected": -410.0,
"loss": 0.0244,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.375,
"rewards/margins": 13.125,
"rewards/rejected": -14.5,
"step": 1163
},
{
"epoch": 1.4282208588957055,
"grad_norm": 17.370413456407626,
"learning_rate": 1.058677685950413e-06,
"logits/chosen": -0.06591796875,
"logits/rejected": -0.10791015625,
"logps/chosen": -356.0,
"logps/rejected": -400.0,
"loss": 0.0999,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.03125,
"rewards/margins": 11.5625,
"rewards/rejected": -13.5625,
"step": 1164
},
{
"epoch": 1.4294478527607362,
"grad_norm": 7.7047074063867464,
"learning_rate": 1.0578512396694215e-06,
"logits/chosen": -0.083984375,
"logits/rejected": -0.228515625,
"logps/chosen": -408.0,
"logps/rejected": -402.0,
"loss": 0.027,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.9140625,
"rewards/margins": 11.9375,
"rewards/rejected": -13.875,
"step": 1165
},
{
"epoch": 1.4306748466257668,
"grad_norm": 13.14829439569346,
"learning_rate": 1.0570247933884297e-06,
"logits/chosen": -0.12255859375,
"logits/rejected": -0.36328125,
"logps/chosen": -432.0,
"logps/rejected": -420.0,
"loss": 0.0317,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.546875,
"rewards/margins": 11.1875,
"rewards/rejected": -13.75,
"step": 1166
},
{
"epoch": 1.4319018404907975,
"grad_norm": 3.67221489210726,
"learning_rate": 1.056198347107438e-06,
"logits/chosen": -0.1494140625,
"logits/rejected": -0.34375,
"logps/chosen": -424.0,
"logps/rejected": -446.0,
"loss": 0.011,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.71875,
"rewards/margins": 13.375,
"rewards/rejected": -15.125,
"step": 1167
},
{
"epoch": 1.4331288343558282,
"grad_norm": 12.68303541143202,
"learning_rate": 1.0553719008264463e-06,
"logits/chosen": -0.12890625,
"logits/rejected": -0.271484375,
"logps/chosen": -396.0,
"logps/rejected": -410.0,
"loss": 0.0602,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.59375,
"rewards/margins": 12.5625,
"rewards/rejected": -15.125,
"step": 1168
},
{
"epoch": 1.4343558282208588,
"grad_norm": 13.166789252257422,
"learning_rate": 1.0545454545454544e-06,
"logits/chosen": -0.055419921875,
"logits/rejected": -0.2197265625,
"logps/chosen": -400.0,
"logps/rejected": -434.0,
"loss": 0.0581,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.015625,
"rewards/margins": 11.4375,
"rewards/rejected": -13.4375,
"step": 1169
},
{
"epoch": 1.4355828220858895,
"grad_norm": 10.122182839810499,
"learning_rate": 1.0537190082644626e-06,
"logits/chosen": -0.15625,
"logits/rejected": -0.412109375,
"logps/chosen": -412.0,
"logps/rejected": -398.0,
"loss": 0.0439,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.703125,
"rewards/margins": 12.5,
"rewards/rejected": -14.25,
"step": 1170
},
{
"epoch": 1.4368098159509202,
"grad_norm": 12.28593650410948,
"learning_rate": 1.052892561983471e-06,
"logits/chosen": -0.10888671875,
"logits/rejected": -0.267578125,
"logps/chosen": -400.0,
"logps/rejected": -404.0,
"loss": 0.0511,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.5703125,
"rewards/margins": 12.0625,
"rewards/rejected": -13.625,
"step": 1171
},
{
"epoch": 1.438036809815951,
"grad_norm": 16.416802043884378,
"learning_rate": 1.0520661157024792e-06,
"logits/chosen": -0.0281982421875,
"logits/rejected": -0.1533203125,
"logps/chosen": -460.0,
"logps/rejected": -438.0,
"loss": 0.071,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.671875,
"rewards/margins": 10.625,
"rewards/rejected": -13.3125,
"step": 1172
},
{
"epoch": 1.4392638036809817,
"grad_norm": 11.495432692757694,
"learning_rate": 1.0512396694214876e-06,
"logits/chosen": -0.109375,
"logits/rejected": -0.263671875,
"logps/chosen": -448.0,
"logps/rejected": -452.0,
"loss": 0.0411,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.796875,
"rewards/margins": 12.9375,
"rewards/rejected": -14.75,
"step": 1173
},
{
"epoch": 1.4404907975460124,
"grad_norm": 7.827933882471983,
"learning_rate": 1.0504132231404958e-06,
"logits/chosen": -0.11865234375,
"logits/rejected": -0.1474609375,
"logps/chosen": -382.0,
"logps/rejected": -406.0,
"loss": 0.0169,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.03125,
"rewards/margins": 12.4375,
"rewards/rejected": -14.4375,
"step": 1174
},
{
"epoch": 1.441717791411043,
"grad_norm": 6.911761370873668,
"learning_rate": 1.0495867768595042e-06,
"logits/chosen": -0.0888671875,
"logits/rejected": -0.1630859375,
"logps/chosen": -368.0,
"logps/rejected": -400.0,
"loss": 0.038,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.5,
"rewards/margins": 11.375,
"rewards/rejected": -13.8125,
"step": 1175
},
{
"epoch": 1.4429447852760737,
"grad_norm": 14.093934930652209,
"learning_rate": 1.0487603305785124e-06,
"logits/chosen": -0.171875,
"logits/rejected": -0.30078125,
"logps/chosen": -416.0,
"logps/rejected": -442.0,
"loss": 0.0594,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.609375,
"rewards/margins": 11.6875,
"rewards/rejected": -14.3125,
"step": 1176
},
{
"epoch": 1.4441717791411044,
"grad_norm": 11.398235074758908,
"learning_rate": 1.0479338842975208e-06,
"logits/chosen": -0.0250244140625,
"logits/rejected": -0.2236328125,
"logps/chosen": -404.0,
"logps/rejected": -394.0,
"loss": 0.0362,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.9453125,
"rewards/margins": 11.5,
"rewards/rejected": -13.4375,
"step": 1177
},
{
"epoch": 1.445398773006135,
"grad_norm": 8.650828823930954,
"learning_rate": 1.0471074380165288e-06,
"logits/chosen": -0.1171875,
"logits/rejected": -0.333984375,
"logps/chosen": -414.0,
"logps/rejected": -398.0,
"loss": 0.0318,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.65625,
"rewards/margins": 12.5625,
"rewards/rejected": -13.1875,
"step": 1178
},
{
"epoch": 1.4466257668711657,
"grad_norm": 15.383094090660647,
"learning_rate": 1.0462809917355372e-06,
"logits/chosen": -0.2255859375,
"logits/rejected": -0.43359375,
"logps/chosen": -456.0,
"logps/rejected": -428.0,
"loss": 0.0532,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.203125,
"rewards/margins": 12.4375,
"rewards/rejected": -13.625,
"step": 1179
},
{
"epoch": 1.4478527607361964,
"grad_norm": 5.966722490536281,
"learning_rate": 1.0454545454545454e-06,
"logits/chosen": -0.10400390625,
"logits/rejected": -0.15234375,
"logps/chosen": -360.0,
"logps/rejected": -418.0,
"loss": 0.0232,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.5234375,
"rewards/margins": 12.4375,
"rewards/rejected": -13.9375,
"step": 1180
},
{
"epoch": 1.449079754601227,
"grad_norm": 7.062609195059248,
"learning_rate": 1.0446280991735538e-06,
"logits/chosen": -0.140625,
"logits/rejected": -0.275390625,
"logps/chosen": -448.0,
"logps/rejected": -464.0,
"loss": 0.0256,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.5625,
"rewards/margins": 12.6875,
"rewards/rejected": -13.25,
"step": 1181
},
{
"epoch": 1.4503067484662577,
"grad_norm": 8.984623434884268,
"learning_rate": 1.043801652892562e-06,
"logits/chosen": -0.08154296875,
"logits/rejected": -0.2314453125,
"logps/chosen": -442.0,
"logps/rejected": -432.0,
"loss": 0.0394,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.09375,
"rewards/margins": 11.4375,
"rewards/rejected": -13.5625,
"step": 1182
},
{
"epoch": 1.4515337423312884,
"grad_norm": 12.747447422128472,
"learning_rate": 1.0429752066115701e-06,
"logits/chosen": -0.111328125,
"logits/rejected": -0.1767578125,
"logps/chosen": -344.0,
"logps/rejected": -402.0,
"loss": 0.0512,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.703125,
"rewards/margins": 11.1875,
"rewards/rejected": -12.9375,
"step": 1183
},
{
"epoch": 1.452760736196319,
"grad_norm": 7.606005889724365,
"learning_rate": 1.0421487603305785e-06,
"logits/chosen": -0.126953125,
"logits/rejected": -0.33203125,
"logps/chosen": -382.0,
"logps/rejected": -376.0,
"loss": 0.0397,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.15625,
"rewards/margins": 11.9375,
"rewards/rejected": -13.125,
"step": 1184
},
{
"epoch": 1.4539877300613497,
"grad_norm": 10.21035569809519,
"learning_rate": 1.0413223140495867e-06,
"logits/chosen": -0.0167236328125,
"logits/rejected": -0.16796875,
"logps/chosen": -436.0,
"logps/rejected": -430.0,
"loss": 0.0372,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.1171875,
"rewards/margins": 12.0,
"rewards/rejected": -13.125,
"step": 1185
},
{
"epoch": 1.4552147239263804,
"grad_norm": 11.435692772633331,
"learning_rate": 1.0404958677685951e-06,
"logits/chosen": -0.09228515625,
"logits/rejected": -0.248046875,
"logps/chosen": -396.0,
"logps/rejected": -418.0,
"loss": 0.0579,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.5546875,
"rewards/margins": 11.375,
"rewards/rejected": -12.9375,
"step": 1186
},
{
"epoch": 1.456441717791411,
"grad_norm": 9.387405560750024,
"learning_rate": 1.039669421487603e-06,
"logits/chosen": -0.11474609375,
"logits/rejected": -0.322265625,
"logps/chosen": -474.0,
"logps/rejected": -436.0,
"loss": 0.045,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.0,
"rewards/margins": 11.3125,
"rewards/rejected": -12.3125,
"step": 1187
},
{
"epoch": 1.4576687116564417,
"grad_norm": 15.569141511930194,
"learning_rate": 1.0388429752066115e-06,
"logits/chosen": -0.038818359375,
"logits/rejected": -0.1611328125,
"logps/chosen": -448.0,
"logps/rejected": -460.0,
"loss": 0.1006,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.4453125,
"rewards/margins": 11.375,
"rewards/rejected": -12.875,
"step": 1188
},
{
"epoch": 1.4588957055214724,
"grad_norm": 11.43706799193642,
"learning_rate": 1.0380165289256197e-06,
"logits/chosen": -0.146484375,
"logits/rejected": -0.333984375,
"logps/chosen": -442.0,
"logps/rejected": -426.0,
"loss": 0.0836,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.03125,
"rewards/margins": 12.0625,
"rewards/rejected": -13.0625,
"step": 1189
},
{
"epoch": 1.460122699386503,
"grad_norm": 8.525040760730164,
"learning_rate": 1.037190082644628e-06,
"logits/chosen": -0.154296875,
"logits/rejected": -0.37890625,
"logps/chosen": -448.0,
"logps/rejected": -436.0,
"loss": 0.0359,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.453125,
"rewards/margins": 13.625,
"rewards/rejected": -14.0625,
"step": 1190
},
{
"epoch": 1.4613496932515337,
"grad_norm": 11.626307215028127,
"learning_rate": 1.0363636363636363e-06,
"logits/chosen": 0.0279541015625,
"logits/rejected": -0.12353515625,
"logps/chosen": -384.0,
"logps/rejected": -414.0,
"loss": 0.0389,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1484375,
"rewards/margins": 12.375,
"rewards/rejected": -13.5,
"step": 1191
},
{
"epoch": 1.4625766871165644,
"grad_norm": 8.257653707089931,
"learning_rate": 1.0355371900826447e-06,
"logits/chosen": -0.09765625,
"logits/rejected": -0.27734375,
"logps/chosen": -414.0,
"logps/rejected": -430.0,
"loss": 0.0314,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.25,
"rewards/margins": 12.5625,
"rewards/rejected": -13.8125,
"step": 1192
},
{
"epoch": 1.463803680981595,
"grad_norm": 12.281186684503984,
"learning_rate": 1.0347107438016529e-06,
"logits/chosen": -0.166015625,
"logits/rejected": -0.3671875,
"logps/chosen": -470.0,
"logps/rejected": -474.0,
"loss": 0.0411,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.73046875,
"rewards/margins": 15.625,
"rewards/rejected": -16.375,
"step": 1193
},
{
"epoch": 1.4650306748466257,
"grad_norm": 4.313717676376673,
"learning_rate": 1.0338842975206613e-06,
"logits/chosen": -0.140625,
"logits/rejected": -0.26953125,
"logps/chosen": -436.0,
"logps/rejected": -428.0,
"loss": 0.0125,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.265625,
"rewards/margins": 11.75,
"rewards/rejected": -13.0625,
"step": 1194
},
{
"epoch": 1.4662576687116564,
"grad_norm": 13.88877509717408,
"learning_rate": 1.0330578512396692e-06,
"logits/chosen": -0.11767578125,
"logits/rejected": -0.2373046875,
"logps/chosen": -418.0,
"logps/rejected": -436.0,
"loss": 0.0466,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.59375,
"rewards/margins": 11.875,
"rewards/rejected": -13.5,
"step": 1195
},
{
"epoch": 1.467484662576687,
"grad_norm": 12.964619413353676,
"learning_rate": 1.0322314049586776e-06,
"logits/chosen": -0.02783203125,
"logits/rejected": -0.158203125,
"logps/chosen": -406.0,
"logps/rejected": -412.0,
"loss": 0.0487,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.78125,
"rewards/margins": 10.6875,
"rewards/rejected": -12.5,
"step": 1196
},
{
"epoch": 1.4687116564417177,
"grad_norm": 16.143742441817903,
"learning_rate": 1.0314049586776858e-06,
"logits/chosen": -0.041748046875,
"logits/rejected": -0.228515625,
"logps/chosen": -442.0,
"logps/rejected": -406.0,
"loss": 0.0678,
"rewards/accuracies": 0.953125,
"rewards/chosen": -1.953125,
"rewards/margins": 11.375,
"rewards/rejected": -13.3125,
"step": 1197
},
{
"epoch": 1.4699386503067484,
"grad_norm": 9.55388473183669,
"learning_rate": 1.0305785123966942e-06,
"logits/chosen": 0.0269775390625,
"logits/rejected": -0.1298828125,
"logps/chosen": -404.0,
"logps/rejected": -382.0,
"loss": 0.0492,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.921875,
"rewards/margins": 11.4375,
"rewards/rejected": -13.375,
"step": 1198
},
{
"epoch": 1.471165644171779,
"grad_norm": 14.139992024133479,
"learning_rate": 1.0297520661157024e-06,
"logits/chosen": -0.203125,
"logits/rejected": -0.376953125,
"logps/chosen": -408.0,
"logps/rejected": -402.0,
"loss": 0.0408,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1484375,
"rewards/margins": 12.6875,
"rewards/rejected": -13.8125,
"step": 1199
},
{
"epoch": 1.4723926380368098,
"grad_norm": 9.626395290959188,
"learning_rate": 1.0289256198347106e-06,
"logits/chosen": -0.138671875,
"logits/rejected": -0.3046875,
"logps/chosen": -350.0,
"logps/rejected": -380.0,
"loss": 0.0258,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.046875,
"rewards/margins": 11.25,
"rewards/rejected": -13.3125,
"step": 1200
},
{
"epoch": 1.4736196319018404,
"grad_norm": 16.075503296089575,
"learning_rate": 1.028099173553719e-06,
"logits/chosen": -0.048095703125,
"logits/rejected": -0.197265625,
"logps/chosen": -400.0,
"logps/rejected": -440.0,
"loss": 0.0545,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.046875,
"rewards/margins": 11.6875,
"rewards/rejected": -13.75,
"step": 1201
},
{
"epoch": 1.474846625766871,
"grad_norm": 15.592021837628844,
"learning_rate": 1.0272727272727272e-06,
"logits/chosen": -0.138671875,
"logits/rejected": -0.28515625,
"logps/chosen": -450.0,
"logps/rejected": -450.0,
"loss": 0.0587,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.3515625,
"rewards/margins": 12.375,
"rewards/rejected": -13.75,
"step": 1202
},
{
"epoch": 1.4760736196319018,
"grad_norm": 6.45016518360233,
"learning_rate": 1.0264462809917356e-06,
"logits/chosen": -0.2392578125,
"logits/rejected": -0.421875,
"logps/chosen": -428.0,
"logps/rejected": -402.0,
"loss": 0.0372,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.46875,
"rewards/margins": 12.3125,
"rewards/rejected": -13.8125,
"step": 1203
},
{
"epoch": 1.4773006134969324,
"grad_norm": 8.846408526453407,
"learning_rate": 1.0256198347107436e-06,
"logits/chosen": -0.07861328125,
"logits/rejected": -0.3125,
"logps/chosen": -394.0,
"logps/rejected": -420.0,
"loss": 0.0291,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.2890625,
"rewards/margins": 12.1875,
"rewards/rejected": -13.5,
"step": 1204
},
{
"epoch": 1.478527607361963,
"grad_norm": 16.10058807172318,
"learning_rate": 1.024793388429752e-06,
"logits/chosen": 0.036865234375,
"logits/rejected": -0.201171875,
"logps/chosen": -388.0,
"logps/rejected": -412.0,
"loss": 0.0824,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.09375,
"rewards/margins": 11.4375,
"rewards/rejected": -13.5,
"step": 1205
},
{
"epoch": 1.4797546012269938,
"grad_norm": 6.469506353472691,
"learning_rate": 1.0239669421487602e-06,
"logits/chosen": -0.010498046875,
"logits/rejected": -0.30078125,
"logps/chosen": -368.0,
"logps/rejected": -372.0,
"loss": 0.0358,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.8828125,
"rewards/margins": 11.25,
"rewards/rejected": -13.125,
"step": 1206
},
{
"epoch": 1.4809815950920244,
"grad_norm": 9.780191610021085,
"learning_rate": 1.0231404958677686e-06,
"logits/chosen": -0.0791015625,
"logits/rejected": -0.2734375,
"logps/chosen": -426.0,
"logps/rejected": -380.0,
"loss": 0.0336,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.015625,
"rewards/margins": 12.125,
"rewards/rejected": -14.125,
"step": 1207
},
{
"epoch": 1.482208588957055,
"grad_norm": 10.486888457679001,
"learning_rate": 1.0223140495867768e-06,
"logits/chosen": -0.0859375,
"logits/rejected": -0.25,
"logps/chosen": -396.0,
"logps/rejected": -418.0,
"loss": 0.0548,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.078125,
"rewards/margins": 11.8125,
"rewards/rejected": -13.875,
"step": 1208
},
{
"epoch": 1.4834355828220858,
"grad_norm": 10.047817635797577,
"learning_rate": 1.0214876033057852e-06,
"logits/chosen": -0.06005859375,
"logits/rejected": -0.2421875,
"logps/chosen": -384.0,
"logps/rejected": -396.0,
"loss": 0.0579,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.140625,
"rewards/margins": 12.5,
"rewards/rejected": -14.625,
"step": 1209
},
{
"epoch": 1.4846625766871164,
"grad_norm": 13.308086407088918,
"learning_rate": 1.0206611570247933e-06,
"logits/chosen": -0.01019287109375,
"logits/rejected": -0.16796875,
"logps/chosen": -386.0,
"logps/rejected": -400.0,
"loss": 0.0481,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.453125,
"rewards/margins": 12.875,
"rewards/rejected": -14.3125,
"step": 1210
},
{
"epoch": 1.4858895705521473,
"grad_norm": 9.41424461600161,
"learning_rate": 1.0198347107438017e-06,
"logits/chosen": -0.037353515625,
"logits/rejected": -0.265625,
"logps/chosen": -380.0,
"logps/rejected": -414.0,
"loss": 0.023,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.953125,
"rewards/margins": 12.0625,
"rewards/rejected": -14.0,
"step": 1211
},
{
"epoch": 1.487116564417178,
"grad_norm": 8.327167588802823,
"learning_rate": 1.01900826446281e-06,
"logits/chosen": -0.1474609375,
"logits/rejected": -0.2578125,
"logps/chosen": -376.0,
"logps/rejected": -414.0,
"loss": 0.0302,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.15625,
"rewards/margins": 12.0625,
"rewards/rejected": -14.25,
"step": 1212
},
{
"epoch": 1.4883435582822087,
"grad_norm": 13.15092274885723,
"learning_rate": 1.0181818181818181e-06,
"logits/chosen": -0.13671875,
"logits/rejected": -0.3984375,
"logps/chosen": -452.0,
"logps/rejected": -428.0,
"loss": 0.0511,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.1171875,
"rewards/margins": 12.75,
"rewards/rejected": -13.875,
"step": 1213
},
{
"epoch": 1.4895705521472393,
"grad_norm": 9.065357608147506,
"learning_rate": 1.0173553719008263e-06,
"logits/chosen": -0.0869140625,
"logits/rejected": -0.216796875,
"logps/chosen": -368.0,
"logps/rejected": -406.0,
"loss": 0.0404,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.203125,
"rewards/margins": 11.875,
"rewards/rejected": -14.0625,
"step": 1214
},
{
"epoch": 1.49079754601227,
"grad_norm": 14.293577666490417,
"learning_rate": 1.0165289256198347e-06,
"logits/chosen": -0.146484375,
"logits/rejected": -0.369140625,
"logps/chosen": -398.0,
"logps/rejected": -416.0,
"loss": 0.0539,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1796875,
"rewards/margins": 13.3125,
"rewards/rejected": -14.5,
"step": 1215
},
{
"epoch": 1.4920245398773007,
"grad_norm": 8.39168826799615,
"learning_rate": 1.0157024793388429e-06,
"logits/chosen": -0.099609375,
"logits/rejected": -0.146484375,
"logps/chosen": -398.0,
"logps/rejected": -398.0,
"loss": 0.028,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.359375,
"rewards/margins": 11.5,
"rewards/rejected": -13.875,
"step": 1216
},
{
"epoch": 1.4932515337423313,
"grad_norm": 11.106412166909418,
"learning_rate": 1.0148760330578513e-06,
"logits/chosen": -0.10986328125,
"logits/rejected": -0.232421875,
"logps/chosen": -424.0,
"logps/rejected": -436.0,
"loss": 0.0318,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.796875,
"rewards/margins": 13.25,
"rewards/rejected": -14.0,
"step": 1217
},
{
"epoch": 1.494478527607362,
"grad_norm": 12.063242433285243,
"learning_rate": 1.0140495867768595e-06,
"logits/chosen": -0.0164794921875,
"logits/rejected": -0.1923828125,
"logps/chosen": -396.0,
"logps/rejected": -414.0,
"loss": 0.0455,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.921875,
"rewards/margins": 10.75,
"rewards/rejected": -13.625,
"step": 1218
},
{
"epoch": 1.4957055214723927,
"grad_norm": 13.89389372851753,
"learning_rate": 1.0132231404958677e-06,
"logits/chosen": -0.1171875,
"logits/rejected": -0.271484375,
"logps/chosen": -410.0,
"logps/rejected": -436.0,
"loss": 0.0554,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.8046875,
"rewards/margins": 11.8125,
"rewards/rejected": -13.625,
"step": 1219
},
{
"epoch": 1.4969325153374233,
"grad_norm": 12.017753208964738,
"learning_rate": 1.012396694214876e-06,
"logits/chosen": -0.140625,
"logits/rejected": -0.2333984375,
"logps/chosen": -418.0,
"logps/rejected": -448.0,
"loss": 0.0476,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.046875,
"rewards/margins": 12.3125,
"rewards/rejected": -14.375,
"step": 1220
},
{
"epoch": 1.498159509202454,
"grad_norm": 10.473250772416604,
"learning_rate": 1.0115702479338843e-06,
"logits/chosen": -0.169921875,
"logits/rejected": -0.33203125,
"logps/chosen": -424.0,
"logps/rejected": -404.0,
"loss": 0.0379,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.25,
"rewards/margins": 12.4375,
"rewards/rejected": -13.6875,
"step": 1221
},
{
"epoch": 1.4993865030674847,
"grad_norm": 8.317899279262472,
"learning_rate": 1.0107438016528924e-06,
"logits/chosen": -0.0556640625,
"logits/rejected": -0.232421875,
"logps/chosen": -356.0,
"logps/rejected": -400.0,
"loss": 0.0388,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.40625,
"rewards/margins": 11.5625,
"rewards/rejected": -13.9375,
"step": 1222
},
{
"epoch": 1.5006134969325153,
"grad_norm": 7.618560046103496,
"learning_rate": 1.0099173553719006e-06,
"logits/chosen": -0.07275390625,
"logits/rejected": -0.20703125,
"logps/chosen": -444.0,
"logps/rejected": -428.0,
"loss": 0.0242,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.140625,
"rewards/margins": 12.3125,
"rewards/rejected": -13.4375,
"step": 1223
},
{
"epoch": 1.501840490797546,
"grad_norm": 10.163884901417632,
"learning_rate": 1.009090909090909e-06,
"logits/chosen": -0.0556640625,
"logits/rejected": -0.1591796875,
"logps/chosen": -376.0,
"logps/rejected": -398.0,
"loss": 0.056,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.671875,
"rewards/margins": 10.5625,
"rewards/rejected": -13.25,
"step": 1224
},
{
"epoch": 1.5030674846625767,
"grad_norm": 6.709949597185231,
"learning_rate": 1.0082644628099172e-06,
"logits/chosen": -0.053466796875,
"logits/rejected": -0.185546875,
"logps/chosen": -378.0,
"logps/rejected": -402.0,
"loss": 0.027,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.9765625,
"rewards/margins": 11.375,
"rewards/rejected": -13.375,
"step": 1225
},
{
"epoch": 1.5042944785276073,
"grad_norm": 11.335768851255144,
"learning_rate": 1.0074380165289256e-06,
"logits/chosen": -0.126953125,
"logits/rejected": -0.3125,
"logps/chosen": -408.0,
"logps/rejected": -406.0,
"loss": 0.0523,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.09375,
"rewards/margins": 11.5625,
"rewards/rejected": -13.625,
"step": 1226
},
{
"epoch": 1.505521472392638,
"grad_norm": 10.294381533365499,
"learning_rate": 1.0066115702479338e-06,
"logits/chosen": -0.29296875,
"logits/rejected": -0.369140625,
"logps/chosen": -412.0,
"logps/rejected": -446.0,
"loss": 0.029,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.25,
"rewards/margins": 12.375,
"rewards/rejected": -13.5625,
"step": 1227
},
{
"epoch": 1.5067484662576687,
"grad_norm": 20.051676248124764,
"learning_rate": 1.0057851239669422e-06,
"logits/chosen": -0.1025390625,
"logits/rejected": -0.20703125,
"logps/chosen": -432.0,
"logps/rejected": -450.0,
"loss": 0.0986,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.046875,
"rewards/margins": 11.125,
"rewards/rejected": -13.1875,
"step": 1228
},
{
"epoch": 1.5079754601226993,
"grad_norm": 5.70876551224663,
"learning_rate": 1.0049586776859504e-06,
"logits/chosen": -0.1962890625,
"logits/rejected": -0.31640625,
"logps/chosen": -398.0,
"logps/rejected": -416.0,
"loss": 0.0221,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.78125,
"rewards/margins": 11.8125,
"rewards/rejected": -13.5625,
"step": 1229
},
{
"epoch": 1.50920245398773,
"grad_norm": 11.620088040403106,
"learning_rate": 1.0041322314049588e-06,
"logits/chosen": -0.0830078125,
"logits/rejected": -0.263671875,
"logps/chosen": -386.0,
"logps/rejected": -392.0,
"loss": 0.0488,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.484375,
"rewards/margins": 11.3125,
"rewards/rejected": -12.75,
"step": 1230
},
{
"epoch": 1.510429447852761,
"grad_norm": 14.466395056240852,
"learning_rate": 1.0033057851239668e-06,
"logits/chosen": -0.0201416015625,
"logits/rejected": -0.189453125,
"logps/chosen": -372.0,
"logps/rejected": -376.0,
"loss": 0.0443,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.71875,
"rewards/margins": 10.9375,
"rewards/rejected": -12.625,
"step": 1231
},
{
"epoch": 1.5116564417177916,
"grad_norm": 9.476481447528245,
"learning_rate": 1.0024793388429752e-06,
"logits/chosen": -0.267578125,
"logits/rejected": -0.458984375,
"logps/chosen": -414.0,
"logps/rejected": -414.0,
"loss": 0.0247,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.92578125,
"rewards/margins": 12.6875,
"rewards/rejected": -13.625,
"step": 1232
},
{
"epoch": 1.5128834355828222,
"grad_norm": 4.234590504273159,
"learning_rate": 1.0016528925619834e-06,
"logits/chosen": -0.1689453125,
"logits/rejected": -0.35546875,
"logps/chosen": -400.0,
"logps/rejected": -398.0,
"loss": 0.0139,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.8359375,
"rewards/margins": 11.8125,
"rewards/rejected": -13.625,
"step": 1233
},
{
"epoch": 1.514110429447853,
"grad_norm": 18.011746894539794,
"learning_rate": 1.0008264462809918e-06,
"logits/chosen": -0.09814453125,
"logits/rejected": -0.296875,
"logps/chosen": -444.0,
"logps/rejected": -416.0,
"loss": 0.0876,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.1484375,
"rewards/margins": 11.8125,
"rewards/rejected": -12.9375,
"step": 1234
},
{
"epoch": 1.5153374233128836,
"grad_norm": 8.82857831183976,
"learning_rate": 1e-06,
"logits/chosen": -0.0208740234375,
"logits/rejected": -0.1689453125,
"logps/chosen": -410.0,
"logps/rejected": -406.0,
"loss": 0.0237,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.71875,
"rewards/margins": 11.0,
"rewards/rejected": -13.75,
"step": 1235
},
{
"epoch": 1.5165644171779142,
"grad_norm": 11.767641629473584,
"learning_rate": 9.991735537190081e-07,
"logits/chosen": -0.10498046875,
"logits/rejected": -0.28125,
"logps/chosen": -412.0,
"logps/rejected": -408.0,
"loss": 0.0513,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.8671875,
"rewards/margins": 11.0625,
"rewards/rejected": -12.9375,
"step": 1236
},
{
"epoch": 1.517791411042945,
"grad_norm": 18.38939401821609,
"learning_rate": 9.983471074380165e-07,
"logits/chosen": -0.22265625,
"logits/rejected": -0.38671875,
"logps/chosen": -448.0,
"logps/rejected": -426.0,
"loss": 0.0772,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.5546875,
"rewards/margins": 13.125,
"rewards/rejected": -14.6875,
"step": 1237
},
{
"epoch": 1.5190184049079756,
"grad_norm": 7.197558238265637,
"learning_rate": 9.975206611570247e-07,
"logits/chosen": -0.038330078125,
"logits/rejected": -0.1953125,
"logps/chosen": -482.0,
"logps/rejected": -420.0,
"loss": 0.0262,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1015625,
"rewards/margins": 12.25,
"rewards/rejected": -13.3125,
"step": 1238
},
{
"epoch": 1.5202453987730062,
"grad_norm": 15.662388417998418,
"learning_rate": 9.96694214876033e-07,
"logits/chosen": -0.1669921875,
"logits/rejected": -0.3828125,
"logps/chosen": -420.0,
"logps/rejected": -406.0,
"loss": 0.0601,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.7265625,
"rewards/margins": 11.8125,
"rewards/rejected": -13.5,
"step": 1239
},
{
"epoch": 1.521472392638037,
"grad_norm": 6.277183773852738,
"learning_rate": 9.958677685950413e-07,
"logits/chosen": -0.050048828125,
"logits/rejected": -0.2490234375,
"logps/chosen": -428.0,
"logps/rejected": -424.0,
"loss": 0.0306,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.125,
"rewards/margins": 11.3125,
"rewards/rejected": -13.4375,
"step": 1240
},
{
"epoch": 1.5226993865030676,
"grad_norm": 9.884741573105416,
"learning_rate": 9.950413223140495e-07,
"logits/chosen": 0.01123046875,
"logits/rejected": -0.1474609375,
"logps/chosen": -380.0,
"logps/rejected": -396.0,
"loss": 0.0518,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.5,
"rewards/margins": 10.75,
"rewards/rejected": -13.25,
"step": 1241
},
{
"epoch": 1.5239263803680982,
"grad_norm": 11.061419272154637,
"learning_rate": 9.942148760330577e-07,
"logits/chosen": -0.2353515625,
"logits/rejected": -0.404296875,
"logps/chosen": -402.0,
"logps/rejected": -408.0,
"loss": 0.0568,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.125,
"rewards/margins": 11.75,
"rewards/rejected": -13.875,
"step": 1242
},
{
"epoch": 1.525153374233129,
"grad_norm": 8.704895919155105,
"learning_rate": 9.93388429752066e-07,
"logits/chosen": -0.0211181640625,
"logits/rejected": -0.1865234375,
"logps/chosen": -352.0,
"logps/rejected": -380.0,
"loss": 0.033,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.578125,
"rewards/margins": 10.8125,
"rewards/rejected": -13.375,
"step": 1243
},
{
"epoch": 1.5263803680981596,
"grad_norm": 4.709489142754261,
"learning_rate": 9.925619834710743e-07,
"logits/chosen": -0.01324462890625,
"logits/rejected": -0.10986328125,
"logps/chosen": -362.0,
"logps/rejected": -402.0,
"loss": 0.0189,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.484375,
"rewards/margins": 10.8125,
"rewards/rejected": -13.25,
"step": 1244
},
{
"epoch": 1.5276073619631902,
"grad_norm": 15.627733749459543,
"learning_rate": 9.917355371900827e-07,
"logits/chosen": -0.068359375,
"logits/rejected": -0.26953125,
"logps/chosen": -442.0,
"logps/rejected": -444.0,
"loss": 0.0628,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.8828125,
"rewards/margins": 12.0,
"rewards/rejected": -13.875,
"step": 1245
},
{
"epoch": 1.528834355828221,
"grad_norm": 9.822569951010871,
"learning_rate": 9.909090909090909e-07,
"logits/chosen": -0.201171875,
"logits/rejected": -0.373046875,
"logps/chosen": -366.0,
"logps/rejected": -388.0,
"loss": 0.0456,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.4296875,
"rewards/margins": 11.5,
"rewards/rejected": -12.9375,
"step": 1246
},
{
"epoch": 1.5300613496932516,
"grad_norm": 11.126202025567135,
"learning_rate": 9.90082644628099e-07,
"logits/chosen": -0.1513671875,
"logits/rejected": -0.265625,
"logps/chosen": -450.0,
"logps/rejected": -428.0,
"loss": 0.0242,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.234375,
"rewards/margins": 13.0,
"rewards/rejected": -14.25,
"step": 1247
},
{
"epoch": 1.5312883435582823,
"grad_norm": 11.372498906055963,
"learning_rate": 9.892561983471075e-07,
"logits/chosen": -0.1123046875,
"logits/rejected": -0.30078125,
"logps/chosen": -390.0,
"logps/rejected": -402.0,
"loss": 0.0361,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.9609375,
"rewards/margins": 11.75,
"rewards/rejected": -12.6875,
"step": 1248
},
{
"epoch": 1.532515337423313,
"grad_norm": 9.495687690026228,
"learning_rate": 9.884297520661157e-07,
"logits/chosen": 0.07861328125,
"logits/rejected": -0.025146484375,
"logps/chosen": -366.0,
"logps/rejected": -402.0,
"loss": 0.0421,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.25,
"rewards/margins": 11.6875,
"rewards/rejected": -13.9375,
"step": 1249
},
{
"epoch": 1.5337423312883436,
"grad_norm": 9.429046291035485,
"learning_rate": 9.87603305785124e-07,
"logits/chosen": -0.2041015625,
"logits/rejected": -0.361328125,
"logps/chosen": -456.0,
"logps/rejected": -486.0,
"loss": 0.0275,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.65234375,
"rewards/margins": 13.5625,
"rewards/rejected": -14.25,
"step": 1250
},
{
"epoch": 1.5349693251533743,
"grad_norm": 12.639866145919319,
"learning_rate": 9.867768595041322e-07,
"logits/chosen": -0.25,
"logits/rejected": -0.361328125,
"logps/chosen": -392.0,
"logps/rejected": -434.0,
"loss": 0.039,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.015625,
"rewards/margins": 13.0,
"rewards/rejected": -14.0625,
"step": 1251
},
{
"epoch": 1.536196319018405,
"grad_norm": 8.764497938959002,
"learning_rate": 9.859504132231404e-07,
"logits/chosen": -0.1435546875,
"logits/rejected": -0.314453125,
"logps/chosen": -402.0,
"logps/rejected": -394.0,
"loss": 0.0401,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.1171875,
"rewards/margins": 13.25,
"rewards/rejected": -14.375,
"step": 1252
},
{
"epoch": 1.5374233128834356,
"grad_norm": 9.43151117319145,
"learning_rate": 9.851239669421486e-07,
"logits/chosen": -0.1328125,
"logits/rejected": -0.294921875,
"logps/chosen": -436.0,
"logps/rejected": -428.0,
"loss": 0.0311,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.3828125,
"rewards/margins": 11.5625,
"rewards/rejected": -12.9375,
"step": 1253
},
{
"epoch": 1.5386503067484663,
"grad_norm": 12.118961622207411,
"learning_rate": 9.84297520661157e-07,
"logits/chosen": -0.03076171875,
"logits/rejected": -0.1689453125,
"logps/chosen": -396.0,
"logps/rejected": -380.0,
"loss": 0.0481,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.4375,
"rewards/margins": 11.1875,
"rewards/rejected": -12.625,
"step": 1254
},
{
"epoch": 1.539877300613497,
"grad_norm": 8.772127224796138,
"learning_rate": 9.834710743801652e-07,
"logits/chosen": -0.1826171875,
"logits/rejected": -0.40625,
"logps/chosen": -426.0,
"logps/rejected": -452.0,
"loss": 0.028,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.88671875,
"rewards/margins": 13.3125,
"rewards/rejected": -14.1875,
"step": 1255
},
{
"epoch": 1.5411042944785276,
"grad_norm": 13.866956631534878,
"learning_rate": 9.826446280991734e-07,
"logits/chosen": -0.09423828125,
"logits/rejected": -0.310546875,
"logps/chosen": -428.0,
"logps/rejected": -418.0,
"loss": 0.0354,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.75,
"rewards/margins": 10.875,
"rewards/rejected": -12.625,
"step": 1256
},
{
"epoch": 1.5423312883435583,
"grad_norm": 11.245467613343983,
"learning_rate": 9.818181818181818e-07,
"logits/chosen": -0.05224609375,
"logits/rejected": -0.24609375,
"logps/chosen": -410.0,
"logps/rejected": -412.0,
"loss": 0.0428,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.828125,
"rewards/margins": 11.625,
"rewards/rejected": -13.4375,
"step": 1257
},
{
"epoch": 1.543558282208589,
"grad_norm": 8.292880493914762,
"learning_rate": 9.8099173553719e-07,
"logits/chosen": -0.09814453125,
"logits/rejected": -0.306640625,
"logps/chosen": -420.0,
"logps/rejected": -390.0,
"loss": 0.0313,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.9375,
"rewards/margins": 11.75,
"rewards/rejected": -12.6875,
"step": 1258
},
{
"epoch": 1.5447852760736196,
"grad_norm": 15.243061529529134,
"learning_rate": 9.801652892561984e-07,
"logits/chosen": -0.099609375,
"logits/rejected": -0.341796875,
"logps/chosen": -424.0,
"logps/rejected": -402.0,
"loss": 0.0676,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.4453125,
"rewards/margins": 11.25,
"rewards/rejected": -12.6875,
"step": 1259
},
{
"epoch": 1.5460122699386503,
"grad_norm": 10.577241635378371,
"learning_rate": 9.793388429752066e-07,
"logits/chosen": -0.1669921875,
"logits/rejected": -0.34375,
"logps/chosen": -466.0,
"logps/rejected": -420.0,
"loss": 0.0359,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.7578125,
"rewards/margins": 12.4375,
"rewards/rejected": -13.1875,
"step": 1260
},
{
"epoch": 1.547239263803681,
"grad_norm": 12.83289975558173,
"learning_rate": 9.785123966942148e-07,
"logits/chosen": -0.228515625,
"logits/rejected": -0.353515625,
"logps/chosen": -428.0,
"logps/rejected": -416.0,
"loss": 0.0678,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.6484375,
"rewards/margins": 11.0625,
"rewards/rejected": -12.6875,
"step": 1261
},
{
"epoch": 1.5484662576687116,
"grad_norm": 8.912075287643129,
"learning_rate": 9.776859504132232e-07,
"logits/chosen": -0.1533203125,
"logits/rejected": -0.33984375,
"logps/chosen": -404.0,
"logps/rejected": -390.0,
"loss": 0.0324,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.96875,
"rewards/margins": 11.75,
"rewards/rejected": -13.75,
"step": 1262
},
{
"epoch": 1.5496932515337423,
"grad_norm": 8.426880917372406,
"learning_rate": 9.768595041322313e-07,
"logits/chosen": -0.09716796875,
"logits/rejected": -0.310546875,
"logps/chosen": -414.0,
"logps/rejected": -408.0,
"loss": 0.0322,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.3203125,
"rewards/margins": 12.375,
"rewards/rejected": -13.6875,
"step": 1263
},
{
"epoch": 1.550920245398773,
"grad_norm": 19.715550992495395,
"learning_rate": 9.760330578512395e-07,
"logits/chosen": -0.028076171875,
"logits/rejected": -0.2001953125,
"logps/chosen": -412.0,
"logps/rejected": -428.0,
"loss": 0.1062,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.53125,
"rewards/margins": 10.8125,
"rewards/rejected": -13.375,
"step": 1264
},
{
"epoch": 1.5521472392638036,
"grad_norm": 8.875641717471945,
"learning_rate": 9.75206611570248e-07,
"logits/chosen": -0.1767578125,
"logits/rejected": -0.35546875,
"logps/chosen": -404.0,
"logps/rejected": -416.0,
"loss": 0.0312,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.890625,
"rewards/margins": 11.625,
"rewards/rejected": -13.5,
"step": 1265
},
{
"epoch": 1.5533742331288343,
"grad_norm": 7.232895661850965,
"learning_rate": 9.743801652892561e-07,
"logits/chosen": -0.2099609375,
"logits/rejected": -0.302734375,
"logps/chosen": -372.0,
"logps/rejected": -400.0,
"loss": 0.0189,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.890625,
"rewards/margins": 11.4375,
"rewards/rejected": -13.375,
"step": 1266
},
{
"epoch": 1.554601226993865,
"grad_norm": 16.09377763932608,
"learning_rate": 9.735537190082645e-07,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.271484375,
"logps/chosen": -390.0,
"logps/rejected": -394.0,
"loss": 0.0977,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.8125,
"rewards/margins": 11.625,
"rewards/rejected": -13.4375,
"step": 1267
},
{
"epoch": 1.5558282208588956,
"grad_norm": 19.10859135550339,
"learning_rate": 9.727272727272727e-07,
"logits/chosen": -0.1474609375,
"logits/rejected": -0.26171875,
"logps/chosen": -520.0,
"logps/rejected": -456.0,
"loss": 0.0853,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.4609375,
"rewards/margins": 13.125,
"rewards/rejected": -14.5625,
"step": 1268
},
{
"epoch": 1.5570552147239263,
"grad_norm": 5.568010791740834,
"learning_rate": 9.71900826446281e-07,
"logits/chosen": -0.1826171875,
"logits/rejected": -0.31640625,
"logps/chosen": -396.0,
"logps/rejected": -392.0,
"loss": 0.0168,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.96484375,
"rewards/margins": 12.75,
"rewards/rejected": -13.6875,
"step": 1269
},
{
"epoch": 1.558282208588957,
"grad_norm": 12.468368113698983,
"learning_rate": 9.710743801652893e-07,
"logits/chosen": -0.169921875,
"logits/rejected": -0.2265625,
"logps/chosen": -428.0,
"logps/rejected": -440.0,
"loss": 0.0367,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.6640625,
"rewards/margins": 12.125,
"rewards/rejected": -13.8125,
"step": 1270
},
{
"epoch": 1.5595092024539876,
"grad_norm": 20.597813871094168,
"learning_rate": 9.702479338842975e-07,
"logits/chosen": -0.08056640625,
"logits/rejected": -0.1708984375,
"logps/chosen": -378.0,
"logps/rejected": -396.0,
"loss": 0.1063,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.53125,
"rewards/margins": 11.6875,
"rewards/rejected": -13.25,
"step": 1271
},
{
"epoch": 1.5607361963190183,
"grad_norm": 11.091131952158705,
"learning_rate": 9.694214876033057e-07,
"logits/chosen": -0.255859375,
"logits/rejected": -0.416015625,
"logps/chosen": -440.0,
"logps/rejected": -426.0,
"loss": 0.0393,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.07177734375,
"rewards/margins": 14.0,
"rewards/rejected": -14.125,
"step": 1272
},
{
"epoch": 1.561963190184049,
"grad_norm": 11.360447287761163,
"learning_rate": 9.685950413223139e-07,
"logits/chosen": -0.2060546875,
"logits/rejected": -0.3046875,
"logps/chosen": -444.0,
"logps/rejected": -444.0,
"loss": 0.0664,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.5234375,
"rewards/margins": 12.0,
"rewards/rejected": -13.5625,
"step": 1273
},
{
"epoch": 1.5631901840490796,
"grad_norm": 4.637651986819552,
"learning_rate": 9.677685950413223e-07,
"logits/chosen": -0.3125,
"logits/rejected": -0.5078125,
"logps/chosen": -418.0,
"logps/rejected": -416.0,
"loss": 0.0127,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.4609375,
"rewards/margins": 12.0625,
"rewards/rejected": -13.5,
"step": 1274
},
{
"epoch": 1.5644171779141103,
"grad_norm": 14.1119790875733,
"learning_rate": 9.669421487603305e-07,
"logits/chosen": -0.1005859375,
"logits/rejected": -0.26171875,
"logps/chosen": -406.0,
"logps/rejected": -422.0,
"loss": 0.088,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.890625,
"rewards/margins": 11.75,
"rewards/rejected": -13.625,
"step": 1275
},
{
"epoch": 1.565644171779141,
"grad_norm": 12.939584595920241,
"learning_rate": 9.661157024793389e-07,
"logits/chosen": -0.005859375,
"logits/rejected": -0.2001953125,
"logps/chosen": -438.0,
"logps/rejected": -402.0,
"loss": 0.0766,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.4609375,
"rewards/margins": 11.8125,
"rewards/rejected": -13.3125,
"step": 1276
},
{
"epoch": 1.5668711656441716,
"grad_norm": 7.363791473461773,
"learning_rate": 9.65289256198347e-07,
"logits/chosen": -0.1669921875,
"logits/rejected": -0.302734375,
"logps/chosen": -374.0,
"logps/rejected": -380.0,
"loss": 0.0313,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.65625,
"rewards/margins": 10.9375,
"rewards/rejected": -12.625,
"step": 1277
},
{
"epoch": 1.5680981595092025,
"grad_norm": 6.582521820083355,
"learning_rate": 9.644628099173552e-07,
"logits/chosen": -0.1357421875,
"logits/rejected": -0.3515625,
"logps/chosen": -416.0,
"logps/rejected": -422.0,
"loss": 0.0189,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.43359375,
"rewards/margins": 13.375,
"rewards/rejected": -13.8125,
"step": 1278
},
{
"epoch": 1.5693251533742332,
"grad_norm": 9.590189078550395,
"learning_rate": 9.636363636363636e-07,
"logits/chosen": -0.1474609375,
"logits/rejected": -0.287109375,
"logps/chosen": -372.0,
"logps/rejected": -418.0,
"loss": 0.0394,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.3515625,
"rewards/margins": 11.5,
"rewards/rejected": -12.875,
"step": 1279
},
{
"epoch": 1.5705521472392638,
"grad_norm": 11.52653510111759,
"learning_rate": 9.628099173553718e-07,
"logits/chosen": -0.2099609375,
"logits/rejected": -0.337890625,
"logps/chosen": -444.0,
"logps/rejected": -454.0,
"loss": 0.0301,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.5546875,
"rewards/margins": 13.3125,
"rewards/rejected": -13.875,
"step": 1280
},
{
"epoch": 1.5717791411042945,
"grad_norm": 10.705339949228822,
"learning_rate": 9.619834710743802e-07,
"logits/chosen": -0.2021484375,
"logits/rejected": -0.365234375,
"logps/chosen": -448.0,
"logps/rejected": -458.0,
"loss": 0.0739,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.0322265625,
"rewards/margins": 13.4375,
"rewards/rejected": -13.4375,
"step": 1281
},
{
"epoch": 1.5730061349693252,
"grad_norm": 7.914232376096601,
"learning_rate": 9.611570247933884e-07,
"logits/chosen": 0.0810546875,
"logits/rejected": -0.1611328125,
"logps/chosen": -406.0,
"logps/rejected": -396.0,
"loss": 0.0279,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.296875,
"rewards/margins": 12.0,
"rewards/rejected": -13.3125,
"step": 1282
},
{
"epoch": 1.5742331288343558,
"grad_norm": 9.2263736657431,
"learning_rate": 9.603305785123966e-07,
"logits/chosen": 0.0341796875,
"logits/rejected": -0.08203125,
"logps/chosen": -368.0,
"logps/rejected": -400.0,
"loss": 0.0377,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.265625,
"rewards/margins": 11.4375,
"rewards/rejected": -13.6875,
"step": 1283
},
{
"epoch": 1.5754601226993865,
"grad_norm": 9.58838328282707,
"learning_rate": 9.59504132231405e-07,
"logits/chosen": -0.0272216796875,
"logits/rejected": -0.2119140625,
"logps/chosen": -414.0,
"logps/rejected": -440.0,
"loss": 0.0599,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.2734375,
"rewards/margins": 13.3125,
"rewards/rejected": -14.5625,
"step": 1284
},
{
"epoch": 1.5766871165644172,
"grad_norm": 11.937185182948856,
"learning_rate": 9.586776859504132e-07,
"logits/chosen": -0.09130859375,
"logits/rejected": -0.341796875,
"logps/chosen": -434.0,
"logps/rejected": -444.0,
"loss": 0.0677,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.21875,
"rewards/margins": 13.375,
"rewards/rejected": -14.5625,
"step": 1285
},
{
"epoch": 1.5779141104294478,
"grad_norm": 13.463301558454244,
"learning_rate": 9.578512396694216e-07,
"logits/chosen": -0.032958984375,
"logits/rejected": -0.2294921875,
"logps/chosen": -378.0,
"logps/rejected": -372.0,
"loss": 0.0448,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.5703125,
"rewards/margins": 11.75,
"rewards/rejected": -13.3125,
"step": 1286
},
{
"epoch": 1.5791411042944785,
"grad_norm": 11.56864577031034,
"learning_rate": 9.570247933884298e-07,
"logits/chosen": -0.12890625,
"logits/rejected": -0.208984375,
"logps/chosen": -338.0,
"logps/rejected": -398.0,
"loss": 0.0508,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.25,
"rewards/margins": 11.9375,
"rewards/rejected": -14.1875,
"step": 1287
},
{
"epoch": 1.5803680981595092,
"grad_norm": 9.552370361542511,
"learning_rate": 9.56198347107438e-07,
"logits/chosen": -0.1875,
"logits/rejected": -0.36328125,
"logps/chosen": -402.0,
"logps/rejected": -432.0,
"loss": 0.0358,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.96484375,
"rewards/margins": 13.25,
"rewards/rejected": -14.25,
"step": 1288
},
{
"epoch": 1.5815950920245399,
"grad_norm": 7.192440609380427,
"learning_rate": 9.553719008264462e-07,
"logits/chosen": -0.04296875,
"logits/rejected": -0.1904296875,
"logps/chosen": -344.0,
"logps/rejected": -364.0,
"loss": 0.0376,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.09375,
"rewards/margins": 11.8125,
"rewards/rejected": -13.9375,
"step": 1289
},
{
"epoch": 1.5828220858895705,
"grad_norm": 8.915549893521046,
"learning_rate": 9.545454545454546e-07,
"logits/chosen": -0.1962890625,
"logits/rejected": -0.3671875,
"logps/chosen": -404.0,
"logps/rejected": -436.0,
"loss": 0.0269,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.515625,
"rewards/margins": 13.75,
"rewards/rejected": -15.25,
"step": 1290
},
{
"epoch": 1.5840490797546012,
"grad_norm": 4.9086913682593485,
"learning_rate": 9.537190082644627e-07,
"logits/chosen": -0.06396484375,
"logits/rejected": -0.177734375,
"logps/chosen": -380.0,
"logps/rejected": -394.0,
"loss": 0.0153,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.671875,
"rewards/margins": 12.4375,
"rewards/rejected": -14.125,
"step": 1291
},
{
"epoch": 1.5852760736196319,
"grad_norm": 6.3611459828522605,
"learning_rate": 9.52892561983471e-07,
"logits/chosen": -0.2236328125,
"logits/rejected": -0.333984375,
"logps/chosen": -402.0,
"logps/rejected": -446.0,
"loss": 0.023,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.828125,
"rewards/margins": 12.9375,
"rewards/rejected": -14.75,
"step": 1292
},
{
"epoch": 1.5865030674846625,
"grad_norm": 10.387641657005787,
"learning_rate": 9.520661157024793e-07,
"logits/chosen": 0.0224609375,
"logits/rejected": -0.255859375,
"logps/chosen": -428.0,
"logps/rejected": -410.0,
"loss": 0.0262,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.3203125,
"rewards/margins": 12.875,
"rewards/rejected": -14.1875,
"step": 1293
},
{
"epoch": 1.5877300613496934,
"grad_norm": 2.6296997510598374,
"learning_rate": 9.512396694214876e-07,
"logits/chosen": -0.0810546875,
"logits/rejected": -0.275390625,
"logps/chosen": -424.0,
"logps/rejected": -450.0,
"loss": 0.0087,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.65625,
"rewards/margins": 13.375,
"rewards/rejected": -15.0,
"step": 1294
},
{
"epoch": 1.588957055214724,
"grad_norm": 5.31648524230237,
"learning_rate": 9.504132231404959e-07,
"logits/chosen": -0.22265625,
"logits/rejected": -0.41796875,
"logps/chosen": -384.0,
"logps/rejected": -402.0,
"loss": 0.028,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.9453125,
"rewards/margins": 12.0625,
"rewards/rejected": -14.0,
"step": 1295
},
{
"epoch": 1.5901840490797547,
"grad_norm": 16.24397472242787,
"learning_rate": 9.495867768595041e-07,
"logits/chosen": -0.099609375,
"logits/rejected": -0.1826171875,
"logps/chosen": -410.0,
"logps/rejected": -430.0,
"loss": 0.0801,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.859375,
"rewards/margins": 12.0625,
"rewards/rejected": -14.875,
"step": 1296
},
{
"epoch": 1.5914110429447854,
"grad_norm": 12.833234825790893,
"learning_rate": 9.487603305785124e-07,
"logits/chosen": -0.01007080078125,
"logits/rejected": -0.1787109375,
"logps/chosen": -438.0,
"logps/rejected": -416.0,
"loss": 0.0357,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.703125,
"rewards/margins": 10.5625,
"rewards/rejected": -13.25,
"step": 1297
},
{
"epoch": 1.592638036809816,
"grad_norm": 14.008944130190512,
"learning_rate": 9.479338842975206e-07,
"logits/chosen": -0.047119140625,
"logits/rejected": -0.169921875,
"logps/chosen": -430.0,
"logps/rejected": -440.0,
"loss": 0.0553,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.6640625,
"rewards/margins": 12.5,
"rewards/rejected": -14.125,
"step": 1298
},
{
"epoch": 1.5938650306748468,
"grad_norm": 16.43406113725855,
"learning_rate": 9.471074380165289e-07,
"logits/chosen": -0.1728515625,
"logits/rejected": -0.265625,
"logps/chosen": -414.0,
"logps/rejected": -432.0,
"loss": 0.0838,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.203125,
"rewards/margins": 12.0,
"rewards/rejected": -14.1875,
"step": 1299
},
{
"epoch": 1.5950920245398774,
"grad_norm": 7.594180252515016,
"learning_rate": 9.462809917355371e-07,
"logits/chosen": -0.06201171875,
"logits/rejected": -0.259765625,
"logps/chosen": -424.0,
"logps/rejected": -440.0,
"loss": 0.0261,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.5234375,
"rewards/margins": 12.8125,
"rewards/rejected": -14.3125,
"step": 1300
},
{
"epoch": 1.596319018404908,
"grad_norm": 4.285068909220888,
"learning_rate": 9.454545454545454e-07,
"logits/chosen": -0.062255859375,
"logits/rejected": -0.267578125,
"logps/chosen": -404.0,
"logps/rejected": -430.0,
"loss": 0.015,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.03125,
"rewards/margins": 12.6875,
"rewards/rejected": -14.75,
"step": 1301
},
{
"epoch": 1.5975460122699388,
"grad_norm": 13.265637550707137,
"learning_rate": 9.446280991735537e-07,
"logits/chosen": -0.275390625,
"logits/rejected": -0.388671875,
"logps/chosen": -426.0,
"logps/rejected": -432.0,
"loss": 0.0366,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.6015625,
"rewards/margins": 12.75,
"rewards/rejected": -14.3125,
"step": 1302
},
{
"epoch": 1.5987730061349694,
"grad_norm": 6.548870459600642,
"learning_rate": 9.43801652892562e-07,
"logits/chosen": -0.1455078125,
"logits/rejected": -0.361328125,
"logps/chosen": -462.0,
"logps/rejected": -444.0,
"loss": 0.0322,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.5078125,
"rewards/margins": 13.9375,
"rewards/rejected": -15.4375,
"step": 1303
},
{
"epoch": 1.6,
"grad_norm": 11.463970926018966,
"learning_rate": 9.429752066115701e-07,
"logits/chosen": -0.2138671875,
"logits/rejected": -0.384765625,
"logps/chosen": -400.0,
"logps/rejected": -444.0,
"loss": 0.0312,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.2734375,
"rewards/margins": 13.9375,
"rewards/rejected": -15.1875,
"step": 1304
},
{
"epoch": 1.6012269938650308,
"grad_norm": 9.415806324610234,
"learning_rate": 9.421487603305784e-07,
"logits/chosen": -0.11181640625,
"logits/rejected": -0.251953125,
"logps/chosen": -372.0,
"logps/rejected": -402.0,
"loss": 0.0359,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.109375,
"rewards/margins": 12.125,
"rewards/rejected": -14.1875,
"step": 1305
},
{
"epoch": 1.6024539877300614,
"grad_norm": 11.890901870355478,
"learning_rate": 9.413223140495867e-07,
"logits/chosen": -0.1806640625,
"logits/rejected": -0.2890625,
"logps/chosen": -430.0,
"logps/rejected": -422.0,
"loss": 0.0372,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.8046875,
"rewards/margins": 12.8125,
"rewards/rejected": -14.625,
"step": 1306
},
{
"epoch": 1.603680981595092,
"grad_norm": 11.16252011245357,
"learning_rate": 9.40495867768595e-07,
"logits/chosen": -0.1884765625,
"logits/rejected": -0.376953125,
"logps/chosen": -462.0,
"logps/rejected": -438.0,
"loss": 0.0384,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1640625,
"rewards/margins": 12.6875,
"rewards/rejected": -13.8125,
"step": 1307
},
{
"epoch": 1.6049079754601228,
"grad_norm": 5.679322602920968,
"learning_rate": 9.396694214876033e-07,
"logits/chosen": -0.244140625,
"logits/rejected": -0.388671875,
"logps/chosen": -404.0,
"logps/rejected": -414.0,
"loss": 0.014,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.5390625,
"rewards/margins": 13.1875,
"rewards/rejected": -14.75,
"step": 1308
},
{
"epoch": 1.6061349693251534,
"grad_norm": 9.569153983001263,
"learning_rate": 9.388429752066115e-07,
"logits/chosen": -0.18359375,
"logits/rejected": -0.306640625,
"logps/chosen": -414.0,
"logps/rejected": -432.0,
"loss": 0.0259,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.03125,
"rewards/margins": 12.875,
"rewards/rejected": -14.875,
"step": 1309
},
{
"epoch": 1.607361963190184,
"grad_norm": 6.425025155641295,
"learning_rate": 9.380165289256198e-07,
"logits/chosen": -0.099609375,
"logits/rejected": -0.267578125,
"logps/chosen": -354.0,
"logps/rejected": -388.0,
"loss": 0.0218,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.3046875,
"rewards/margins": 12.4375,
"rewards/rejected": -13.75,
"step": 1310
},
{
"epoch": 1.6085889570552148,
"grad_norm": 17.800848129087864,
"learning_rate": 9.371900826446281e-07,
"logits/chosen": -0.046630859375,
"logits/rejected": -0.259765625,
"logps/chosen": -448.0,
"logps/rejected": -422.0,
"loss": 0.0666,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.96875,
"rewards/margins": 11.0625,
"rewards/rejected": -14.0625,
"step": 1311
},
{
"epoch": 1.6098159509202454,
"grad_norm": 5.556020415598615,
"learning_rate": 9.363636363636364e-07,
"logits/chosen": -0.234375,
"logits/rejected": -0.470703125,
"logps/chosen": -426.0,
"logps/rejected": -428.0,
"loss": 0.0178,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.46875,
"rewards/margins": 13.6875,
"rewards/rejected": -15.1875,
"step": 1312
},
{
"epoch": 1.611042944785276,
"grad_norm": 6.4048066084093085,
"learning_rate": 9.355371900826446e-07,
"logits/chosen": -0.1494140625,
"logits/rejected": -0.296875,
"logps/chosen": -392.0,
"logps/rejected": -412.0,
"loss": 0.0356,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.296875,
"rewards/margins": 12.0,
"rewards/rejected": -14.25,
"step": 1313
},
{
"epoch": 1.6122699386503068,
"grad_norm": 5.829147747044031,
"learning_rate": 9.347107438016529e-07,
"logits/chosen": -0.330078125,
"logits/rejected": -0.41015625,
"logps/chosen": -410.0,
"logps/rejected": -442.0,
"loss": 0.0139,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.71484375,
"rewards/margins": 14.0625,
"rewards/rejected": -14.75,
"step": 1314
},
{
"epoch": 1.6134969325153374,
"grad_norm": 17.83003895742431,
"learning_rate": 9.338842975206612e-07,
"logits/chosen": -0.1728515625,
"logits/rejected": -0.3984375,
"logps/chosen": -478.0,
"logps/rejected": -458.0,
"loss": 0.0748,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.1875,
"rewards/margins": 12.5625,
"rewards/rejected": -14.75,
"step": 1315
},
{
"epoch": 1.614723926380368,
"grad_norm": 17.110861200505923,
"learning_rate": 9.330578512396694e-07,
"logits/chosen": -0.0419921875,
"logits/rejected": -0.23828125,
"logps/chosen": -400.0,
"logps/rejected": -404.0,
"loss": 0.0623,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.421875,
"rewards/margins": 11.8125,
"rewards/rejected": -14.25,
"step": 1316
},
{
"epoch": 1.6159509202453988,
"grad_norm": 11.010541116058228,
"learning_rate": 9.322314049586776e-07,
"logits/chosen": -0.2109375,
"logits/rejected": -0.3203125,
"logps/chosen": -412.0,
"logps/rejected": -454.0,
"loss": 0.0413,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.15625,
"rewards/margins": 12.8125,
"rewards/rejected": -15.0,
"step": 1317
},
{
"epoch": 1.6171779141104294,
"grad_norm": 9.048541596144348,
"learning_rate": 9.314049586776858e-07,
"logits/chosen": -0.1455078125,
"logits/rejected": -0.361328125,
"logps/chosen": -412.0,
"logps/rejected": -422.0,
"loss": 0.0188,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.28125,
"rewards/margins": 13.125,
"rewards/rejected": -15.4375,
"step": 1318
},
{
"epoch": 1.61840490797546,
"grad_norm": 14.740903912942425,
"learning_rate": 9.305785123966941e-07,
"logits/chosen": -0.1748046875,
"logits/rejected": -0.33203125,
"logps/chosen": -414.0,
"logps/rejected": -462.0,
"loss": 0.0685,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.9453125,
"rewards/margins": 13.5625,
"rewards/rejected": -15.5,
"step": 1319
},
{
"epoch": 1.6196319018404908,
"grad_norm": 14.237407011740913,
"learning_rate": 9.297520661157024e-07,
"logits/chosen": -0.1474609375,
"logits/rejected": -0.337890625,
"logps/chosen": -458.0,
"logps/rejected": -440.0,
"loss": 0.0541,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.5390625,
"rewards/margins": 13.125,
"rewards/rejected": -14.625,
"step": 1320
},
{
"epoch": 1.6208588957055214,
"grad_norm": 16.42125801755334,
"learning_rate": 9.289256198347107e-07,
"logits/chosen": -0.197265625,
"logits/rejected": -0.330078125,
"logps/chosen": -404.0,
"logps/rejected": -410.0,
"loss": 0.0435,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.8046875,
"rewards/margins": 12.875,
"rewards/rejected": -14.6875,
"step": 1321
},
{
"epoch": 1.622085889570552,
"grad_norm": 15.87448389315227,
"learning_rate": 9.280991735537189e-07,
"logits/chosen": -0.212890625,
"logits/rejected": -0.369140625,
"logps/chosen": -384.0,
"logps/rejected": -432.0,
"loss": 0.0648,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.03125,
"rewards/margins": 12.625,
"rewards/rejected": -14.625,
"step": 1322
},
{
"epoch": 1.6233128834355828,
"grad_norm": 7.505627434298467,
"learning_rate": 9.272727272727272e-07,
"logits/chosen": -0.04736328125,
"logits/rejected": -0.2451171875,
"logps/chosen": -356.0,
"logps/rejected": -408.0,
"loss": 0.0205,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.984375,
"rewards/margins": 12.5625,
"rewards/rejected": -14.5625,
"step": 1323
},
{
"epoch": 1.6245398773006134,
"grad_norm": 10.381572742786943,
"learning_rate": 9.264462809917355e-07,
"logits/chosen": -0.20703125,
"logits/rejected": -0.43359375,
"logps/chosen": -434.0,
"logps/rejected": -430.0,
"loss": 0.0399,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.546875,
"rewards/margins": 13.6875,
"rewards/rejected": -15.1875,
"step": 1324
},
{
"epoch": 1.6257668711656441,
"grad_norm": 7.941912196683046,
"learning_rate": 9.256198347107438e-07,
"logits/chosen": -0.1064453125,
"logits/rejected": -0.369140625,
"logps/chosen": -410.0,
"logps/rejected": -428.0,
"loss": 0.0348,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.515625,
"rewards/margins": 13.0,
"rewards/rejected": -15.5,
"step": 1325
},
{
"epoch": 1.6269938650306748,
"grad_norm": 14.495673016632852,
"learning_rate": 9.247933884297521e-07,
"logits/chosen": -0.2265625,
"logits/rejected": -0.361328125,
"logps/chosen": -434.0,
"logps/rejected": -456.0,
"loss": 0.0456,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.25,
"rewards/margins": 13.9375,
"rewards/rejected": -16.25,
"step": 1326
},
{
"epoch": 1.6282208588957054,
"grad_norm": 16.18783168026297,
"learning_rate": 9.239669421487603e-07,
"logits/chosen": -0.15234375,
"logits/rejected": -0.263671875,
"logps/chosen": -394.0,
"logps/rejected": -444.0,
"loss": 0.0851,
"rewards/accuracies": 0.984375,
"rewards/chosen": -3.078125,
"rewards/margins": 12.5,
"rewards/rejected": -15.5625,
"step": 1327
},
{
"epoch": 1.6294478527607361,
"grad_norm": 17.02205561554116,
"learning_rate": 9.231404958677686e-07,
"logits/chosen": -0.2275390625,
"logits/rejected": -0.44140625,
"logps/chosen": -438.0,
"logps/rejected": -432.0,
"loss": 0.0483,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.765625,
"rewards/margins": 12.6875,
"rewards/rejected": -15.4375,
"step": 1328
},
{
"epoch": 1.6306748466257668,
"grad_norm": 13.259175145560656,
"learning_rate": 9.223140495867769e-07,
"logits/chosen": -0.259765625,
"logits/rejected": -0.439453125,
"logps/chosen": -444.0,
"logps/rejected": -458.0,
"loss": 0.047,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.90625,
"rewards/margins": 12.875,
"rewards/rejected": -15.75,
"step": 1329
},
{
"epoch": 1.6319018404907975,
"grad_norm": 15.5016428721918,
"learning_rate": 9.214876033057852e-07,
"logits/chosen": -0.1484375,
"logits/rejected": -0.3671875,
"logps/chosen": -430.0,
"logps/rejected": -444.0,
"loss": 0.0576,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.90625,
"rewards/margins": 12.9375,
"rewards/rejected": -15.8125,
"step": 1330
},
{
"epoch": 1.6331288343558281,
"grad_norm": 8.305494421061486,
"learning_rate": 9.206611570247933e-07,
"logits/chosen": -0.2021484375,
"logits/rejected": -0.2734375,
"logps/chosen": -392.0,
"logps/rejected": -424.0,
"loss": 0.0229,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -3.6875,
"rewards/margins": 12.8125,
"rewards/rejected": -16.5,
"step": 1331
},
{
"epoch": 1.6343558282208588,
"grad_norm": 6.604476022543088,
"learning_rate": 9.198347107438016e-07,
"logits/chosen": -0.291015625,
"logits/rejected": -0.4453125,
"logps/chosen": -404.0,
"logps/rejected": -428.0,
"loss": 0.0163,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.28125,
"rewards/margins": 13.3125,
"rewards/rejected": -15.5625,
"step": 1332
},
{
"epoch": 1.6355828220858895,
"grad_norm": 17.709710398270747,
"learning_rate": 9.190082644628098e-07,
"logits/chosen": -0.3046875,
"logits/rejected": -0.4453125,
"logps/chosen": -448.0,
"logps/rejected": -482.0,
"loss": 0.0616,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -3.4375,
"rewards/margins": 12.6875,
"rewards/rejected": -16.125,
"step": 1333
},
{
"epoch": 1.6368098159509201,
"grad_norm": 7.6418660273051575,
"learning_rate": 9.181818181818181e-07,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.2734375,
"logps/chosen": -406.0,
"logps/rejected": -436.0,
"loss": 0.025,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.9296875,
"rewards/margins": 13.375,
"rewards/rejected": -15.3125,
"step": 1334
},
{
"epoch": 1.6380368098159508,
"grad_norm": 16.333081187186348,
"learning_rate": 9.173553719008264e-07,
"logits/chosen": -0.263671875,
"logits/rejected": -0.47265625,
"logps/chosen": -456.0,
"logps/rejected": -418.0,
"loss": 0.0443,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.2109375,
"rewards/margins": 12.5625,
"rewards/rejected": -13.75,
"step": 1335
},
{
"epoch": 1.6392638036809815,
"grad_norm": 15.284451020700127,
"learning_rate": 9.165289256198346e-07,
"logits/chosen": -0.38671875,
"logits/rejected": -0.55859375,
"logps/chosen": -460.0,
"logps/rejected": -472.0,
"loss": 0.045,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.921875,
"rewards/margins": 13.3125,
"rewards/rejected": -16.25,
"step": 1336
},
{
"epoch": 1.6404907975460121,
"grad_norm": 16.58621383658074,
"learning_rate": 9.157024793388429e-07,
"logits/chosen": -0.2275390625,
"logits/rejected": -0.408203125,
"logps/chosen": -438.0,
"logps/rejected": -416.0,
"loss": 0.0576,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.265625,
"rewards/margins": 12.625,
"rewards/rejected": -14.9375,
"step": 1337
},
{
"epoch": 1.6417177914110428,
"grad_norm": 8.96432355990632,
"learning_rate": 9.148760330578512e-07,
"logits/chosen": -0.302734375,
"logits/rejected": -0.42578125,
"logps/chosen": -454.0,
"logps/rejected": -446.0,
"loss": 0.03,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.8203125,
"rewards/margins": 12.9375,
"rewards/rejected": -14.75,
"step": 1338
},
{
"epoch": 1.6429447852760735,
"grad_norm": 20.297262294819006,
"learning_rate": 9.140495867768595e-07,
"logits/chosen": -0.1513671875,
"logits/rejected": -0.2109375,
"logps/chosen": -416.0,
"logps/rejected": -382.0,
"loss": 0.1217,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.59375,
"rewards/margins": 11.25,
"rewards/rejected": -13.8125,
"step": 1339
},
{
"epoch": 1.6441717791411041,
"grad_norm": 16.959246435499818,
"learning_rate": 9.132231404958677e-07,
"logits/chosen": -0.08447265625,
"logits/rejected": -0.2412109375,
"logps/chosen": -436.0,
"logps/rejected": -428.0,
"loss": 0.0832,
"rewards/accuracies": 0.953125,
"rewards/chosen": -2.1875,
"rewards/margins": 11.375,
"rewards/rejected": -13.5625,
"step": 1340
},
{
"epoch": 1.645398773006135,
"grad_norm": 3.941235607303432,
"learning_rate": 9.12396694214876e-07,
"logits/chosen": -0.251953125,
"logits/rejected": -0.482421875,
"logps/chosen": -466.0,
"logps/rejected": -432.0,
"loss": 0.0113,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.0,
"rewards/margins": 13.0,
"rewards/rejected": -15.0,
"step": 1341
},
{
"epoch": 1.6466257668711657,
"grad_norm": 13.465072086608481,
"learning_rate": 9.115702479338843e-07,
"logits/chosen": -0.27734375,
"logits/rejected": -0.5,
"logps/chosen": -432.0,
"logps/rejected": -410.0,
"loss": 0.036,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.578125,
"rewards/margins": 12.0625,
"rewards/rejected": -13.625,
"step": 1342
},
{
"epoch": 1.6478527607361964,
"grad_norm": 22.54111740486076,
"learning_rate": 9.107438016528926e-07,
"logits/chosen": -0.1845703125,
"logits/rejected": -0.421875,
"logps/chosen": -430.0,
"logps/rejected": -440.0,
"loss": 0.1415,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.5,
"rewards/margins": 11.9375,
"rewards/rejected": -14.4375,
"step": 1343
},
{
"epoch": 1.649079754601227,
"grad_norm": 15.375871926972172,
"learning_rate": 9.099173553719007e-07,
"logits/chosen": -0.16796875,
"logits/rejected": -0.43359375,
"logps/chosen": -456.0,
"logps/rejected": -418.0,
"loss": 0.0509,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.140625,
"rewards/margins": 12.75,
"rewards/rejected": -13.875,
"step": 1344
},
{
"epoch": 1.6503067484662577,
"grad_norm": 15.548034161822667,
"learning_rate": 9.09090909090909e-07,
"logits/chosen": -0.197265625,
"logits/rejected": -0.353515625,
"logps/chosen": -444.0,
"logps/rejected": -408.0,
"loss": 0.0852,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.84375,
"rewards/margins": 11.0,
"rewards/rejected": -12.8125,
"step": 1345
},
{
"epoch": 1.6515337423312884,
"grad_norm": 22.360906708807086,
"learning_rate": 9.082644628099173e-07,
"logits/chosen": -0.1259765625,
"logits/rejected": -0.326171875,
"logps/chosen": -460.0,
"logps/rejected": -424.0,
"loss": 0.0863,
"rewards/accuracies": 0.9453125,
"rewards/chosen": -1.3828125,
"rewards/margins": 11.8125,
"rewards/rejected": -13.1875,
"step": 1346
},
{
"epoch": 1.652760736196319,
"grad_norm": 11.885454277052277,
"learning_rate": 9.074380165289256e-07,
"logits/chosen": -0.1494140625,
"logits/rejected": -0.3125,
"logps/chosen": -446.0,
"logps/rejected": -454.0,
"loss": 0.0554,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.0,
"rewards/margins": 11.8125,
"rewards/rejected": -13.8125,
"step": 1347
},
{
"epoch": 1.6539877300613497,
"grad_norm": 9.451376089668251,
"learning_rate": 9.066115702479339e-07,
"logits/chosen": -0.1455078125,
"logits/rejected": -0.328125,
"logps/chosen": -362.0,
"logps/rejected": -410.0,
"loss": 0.0399,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.1875,
"rewards/margins": 11.375,
"rewards/rejected": -13.5625,
"step": 1348
},
{
"epoch": 1.6552147239263804,
"grad_norm": 6.988928928049771,
"learning_rate": 9.057851239669421e-07,
"logits/chosen": -0.12890625,
"logits/rejected": -0.3359375,
"logps/chosen": -392.0,
"logps/rejected": -408.0,
"loss": 0.0265,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.6171875,
"rewards/margins": 11.5625,
"rewards/rejected": -13.1875,
"step": 1349
},
{
"epoch": 1.656441717791411,
"grad_norm": 16.243737250154922,
"learning_rate": 9.049586776859504e-07,
"logits/chosen": -0.1728515625,
"logits/rejected": -0.359375,
"logps/chosen": -440.0,
"logps/rejected": -456.0,
"loss": 0.0634,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.31640625,
"rewards/margins": 13.25,
"rewards/rejected": -13.5625,
"step": 1350
},
{
"epoch": 1.6576687116564417,
"grad_norm": 18.229675107125082,
"learning_rate": 9.041322314049586e-07,
"logits/chosen": -0.12353515625,
"logits/rejected": -0.26953125,
"logps/chosen": -416.0,
"logps/rejected": -416.0,
"loss": 0.0988,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.8359375,
"rewards/margins": 11.3125,
"rewards/rejected": -13.125,
"step": 1351
},
{
"epoch": 1.6588957055214724,
"grad_norm": 8.769525071323859,
"learning_rate": 9.033057851239669e-07,
"logits/chosen": -0.22265625,
"logits/rejected": -0.373046875,
"logps/chosen": -406.0,
"logps/rejected": -420.0,
"loss": 0.0249,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.4765625,
"rewards/margins": 12.0,
"rewards/rejected": -13.5,
"step": 1352
},
{
"epoch": 1.660122699386503,
"grad_norm": 14.502978040508614,
"learning_rate": 9.024793388429751e-07,
"logits/chosen": -0.11376953125,
"logits/rejected": -0.1484375,
"logps/chosen": -396.0,
"logps/rejected": -442.0,
"loss": 0.0544,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.21875,
"rewards/margins": 11.5,
"rewards/rejected": -13.75,
"step": 1353
},
{
"epoch": 1.6613496932515337,
"grad_norm": 14.167491840283715,
"learning_rate": 9.016528925619834e-07,
"logits/chosen": -0.1884765625,
"logits/rejected": -0.345703125,
"logps/chosen": -382.0,
"logps/rejected": -414.0,
"loss": 0.0448,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.03125,
"rewards/margins": 12.1875,
"rewards/rejected": -13.1875,
"step": 1354
},
{
"epoch": 1.6625766871165644,
"grad_norm": 14.907961946583502,
"learning_rate": 9.008264462809917e-07,
"logits/chosen": -0.2099609375,
"logits/rejected": -0.345703125,
"logps/chosen": -440.0,
"logps/rejected": -440.0,
"loss": 0.0511,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.8671875,
"rewards/margins": 11.1875,
"rewards/rejected": -13.0,
"step": 1355
},
{
"epoch": 1.6638036809815953,
"grad_norm": 6.199366044704542,
"learning_rate": 9e-07,
"logits/chosen": -0.162109375,
"logits/rejected": -0.333984375,
"logps/chosen": -426.0,
"logps/rejected": -438.0,
"loss": 0.0262,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.078125,
"rewards/margins": 12.75,
"rewards/rejected": -14.875,
"step": 1356
},
{
"epoch": 1.665030674846626,
"grad_norm": 7.777763276581302,
"learning_rate": 8.991735537190083e-07,
"logits/chosen": -0.126953125,
"logits/rejected": -0.359375,
"logps/chosen": -450.0,
"logps/rejected": -428.0,
"loss": 0.0187,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.140625,
"rewards/margins": 12.4375,
"rewards/rejected": -13.5625,
"step": 1357
},
{
"epoch": 1.6662576687116566,
"grad_norm": 9.435812724576301,
"learning_rate": 8.983471074380164e-07,
"logits/chosen": -0.2138671875,
"logits/rejected": -0.4609375,
"logps/chosen": -416.0,
"logps/rejected": -406.0,
"loss": 0.0429,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.84375,
"rewards/margins": 10.6875,
"rewards/rejected": -12.5625,
"step": 1358
},
{
"epoch": 1.6674846625766873,
"grad_norm": 4.155607552455537,
"learning_rate": 8.975206611570247e-07,
"logits/chosen": -0.1171875,
"logits/rejected": -0.31640625,
"logps/chosen": -428.0,
"logps/rejected": -430.0,
"loss": 0.0188,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.1953125,
"rewards/margins": 12.3125,
"rewards/rejected": -13.5,
"step": 1359
},
{
"epoch": 1.668711656441718,
"grad_norm": 12.468924980897397,
"learning_rate": 8.96694214876033e-07,
"logits/chosen": -0.38671875,
"logits/rejected": -0.61328125,
"logps/chosen": -404.0,
"logps/rejected": -390.0,
"loss": 0.0559,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -0.5703125,
"rewards/margins": 11.875,
"rewards/rejected": -12.4375,
"step": 1360
},
{
"epoch": 1.6699386503067486,
"grad_norm": 10.99794230165957,
"learning_rate": 8.958677685950413e-07,
"logits/chosen": -0.06982421875,
"logits/rejected": -0.234375,
"logps/chosen": -436.0,
"logps/rejected": -444.0,
"loss": 0.0372,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.7578125,
"rewards/margins": 11.3125,
"rewards/rejected": -13.0625,
"step": 1361
},
{
"epoch": 1.6711656441717793,
"grad_norm": 15.394549211761396,
"learning_rate": 8.950413223140495e-07,
"logits/chosen": -0.1064453125,
"logits/rejected": -0.23828125,
"logps/chosen": -420.0,
"logps/rejected": -396.0,
"loss": 0.0521,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1796875,
"rewards/margins": 12.0,
"rewards/rejected": -13.1875,
"step": 1362
},
{
"epoch": 1.67239263803681,
"grad_norm": 3.482355176057617,
"learning_rate": 8.942148760330578e-07,
"logits/chosen": -0.2001953125,
"logits/rejected": -0.400390625,
"logps/chosen": -412.0,
"logps/rejected": -382.0,
"loss": 0.0111,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.82421875,
"rewards/margins": 11.875,
"rewards/rejected": -12.6875,
"step": 1363
},
{
"epoch": 1.6736196319018406,
"grad_norm": 12.417237075751807,
"learning_rate": 8.933884297520661e-07,
"logits/chosen": -0.07568359375,
"logits/rejected": -0.265625,
"logps/chosen": -392.0,
"logps/rejected": -378.0,
"loss": 0.0225,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.453125,
"rewards/margins": 11.75,
"rewards/rejected": -13.1875,
"step": 1364
},
{
"epoch": 1.6748466257668713,
"grad_norm": 10.79947731327148,
"learning_rate": 8.925619834710744e-07,
"logits/chosen": -0.01409912109375,
"logits/rejected": -0.197265625,
"logps/chosen": -426.0,
"logps/rejected": -390.0,
"loss": 0.0387,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.03125,
"rewards/margins": 11.875,
"rewards/rejected": -12.9375,
"step": 1365
},
{
"epoch": 1.676073619631902,
"grad_norm": 10.748873895750465,
"learning_rate": 8.917355371900827e-07,
"logits/chosen": -0.09814453125,
"logits/rejected": -0.326171875,
"logps/chosen": -414.0,
"logps/rejected": -388.0,
"loss": 0.0414,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.828125,
"rewards/margins": 11.25,
"rewards/rejected": -12.0625,
"step": 1366
},
{
"epoch": 1.6773006134969326,
"grad_norm": 9.47666595268894,
"learning_rate": 8.909090909090909e-07,
"logits/chosen": -0.0712890625,
"logits/rejected": -0.22265625,
"logps/chosen": -414.0,
"logps/rejected": -422.0,
"loss": 0.0385,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.28125,
"rewards/margins": 12.1875,
"rewards/rejected": -13.4375,
"step": 1367
},
{
"epoch": 1.6785276073619633,
"grad_norm": 13.326208138435703,
"learning_rate": 8.900826446280992e-07,
"logits/chosen": -0.287109375,
"logits/rejected": -0.43359375,
"logps/chosen": -410.0,
"logps/rejected": -406.0,
"loss": 0.0418,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.7109375,
"rewards/margins": 12.0,
"rewards/rejected": -12.6875,
"step": 1368
},
{
"epoch": 1.679754601226994,
"grad_norm": 12.783191443198902,
"learning_rate": 8.892561983471074e-07,
"logits/chosen": -0.208984375,
"logits/rejected": -0.40625,
"logps/chosen": -420.0,
"logps/rejected": -414.0,
"loss": 0.0687,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.6328125,
"rewards/margins": 11.0625,
"rewards/rejected": -12.75,
"step": 1369
},
{
"epoch": 1.6809815950920246,
"grad_norm": 9.76188769745529,
"learning_rate": 8.884297520661157e-07,
"logits/chosen": -0.1455078125,
"logits/rejected": -0.259765625,
"logps/chosen": -396.0,
"logps/rejected": -422.0,
"loss": 0.0313,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.80078125,
"rewards/margins": 12.0625,
"rewards/rejected": -12.875,
"step": 1370
},
{
"epoch": 1.6822085889570553,
"grad_norm": 12.787572490005264,
"learning_rate": 8.876033057851238e-07,
"logits/chosen": -0.08447265625,
"logits/rejected": -0.3515625,
"logps/chosen": -484.0,
"logps/rejected": -450.0,
"loss": 0.0701,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.8203125,
"rewards/margins": 12.5,
"rewards/rejected": -13.3125,
"step": 1371
},
{
"epoch": 1.683435582822086,
"grad_norm": 14.53994484302953,
"learning_rate": 8.867768595041321e-07,
"logits/chosen": -0.1396484375,
"logits/rejected": -0.3671875,
"logps/chosen": -408.0,
"logps/rejected": -404.0,
"loss": 0.09,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.93359375,
"rewards/margins": 12.0,
"rewards/rejected": -12.9375,
"step": 1372
},
{
"epoch": 1.6846625766871166,
"grad_norm": 13.632516261440003,
"learning_rate": 8.859504132231404e-07,
"logits/chosen": -0.0986328125,
"logits/rejected": -0.181640625,
"logps/chosen": -390.0,
"logps/rejected": -432.0,
"loss": 0.0821,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.015625,
"rewards/margins": 11.8125,
"rewards/rejected": -12.8125,
"step": 1373
},
{
"epoch": 1.6858895705521473,
"grad_norm": 16.48214090098275,
"learning_rate": 8.851239669421487e-07,
"logits/chosen": -0.00830078125,
"logits/rejected": -0.2451171875,
"logps/chosen": -412.0,
"logps/rejected": -390.0,
"loss": 0.0792,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.59375,
"rewards/margins": 11.0,
"rewards/rejected": -12.625,
"step": 1374
},
{
"epoch": 1.687116564417178,
"grad_norm": 7.821232753322752,
"learning_rate": 8.84297520661157e-07,
"logits/chosen": -0.04443359375,
"logits/rejected": -0.150390625,
"logps/chosen": -344.0,
"logps/rejected": -382.0,
"loss": 0.0278,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.40625,
"rewards/margins": 11.25,
"rewards/rejected": -12.625,
"step": 1375
},
{
"epoch": 1.6883435582822086,
"grad_norm": 11.83013820549058,
"learning_rate": 8.834710743801652e-07,
"logits/chosen": -0.2060546875,
"logits/rejected": -0.3125,
"logps/chosen": -376.0,
"logps/rejected": -422.0,
"loss": 0.0366,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.171875,
"rewards/margins": 12.125,
"rewards/rejected": -13.3125,
"step": 1376
},
{
"epoch": 1.6895705521472393,
"grad_norm": 7.666549312007542,
"learning_rate": 8.826446280991735e-07,
"logits/chosen": -0.1748046875,
"logits/rejected": -0.361328125,
"logps/chosen": -374.0,
"logps/rejected": -400.0,
"loss": 0.0243,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.5703125,
"rewards/margins": 12.875,
"rewards/rejected": -13.4375,
"step": 1377
},
{
"epoch": 1.69079754601227,
"grad_norm": 9.39508387311802,
"learning_rate": 8.818181818181818e-07,
"logits/chosen": -0.1337890625,
"logits/rejected": -0.314453125,
"logps/chosen": -384.0,
"logps/rejected": -386.0,
"loss": 0.034,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.078125,
"rewards/margins": 10.6875,
"rewards/rejected": -12.8125,
"step": 1378
},
{
"epoch": 1.6920245398773006,
"grad_norm": 14.31936771528684,
"learning_rate": 8.809917355371901e-07,
"logits/chosen": -0.1533203125,
"logits/rejected": -0.306640625,
"logps/chosen": -426.0,
"logps/rejected": -400.0,
"loss": 0.0565,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.9765625,
"rewards/margins": 11.0625,
"rewards/rejected": -12.0625,
"step": 1379
},
{
"epoch": 1.6932515337423313,
"grad_norm": 10.898597216986863,
"learning_rate": 8.801652892561983e-07,
"logits/chosen": -0.10400390625,
"logits/rejected": -0.333984375,
"logps/chosen": -440.0,
"logps/rejected": -378.0,
"loss": 0.0278,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.0234375,
"rewards/margins": 11.5,
"rewards/rejected": -12.5,
"step": 1380
},
{
"epoch": 1.694478527607362,
"grad_norm": 10.992398343790574,
"learning_rate": 8.793388429752066e-07,
"logits/chosen": -0.03271484375,
"logits/rejected": -0.06494140625,
"logps/chosen": -382.0,
"logps/rejected": -390.0,
"loss": 0.0534,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.6875,
"rewards/margins": 10.5625,
"rewards/rejected": -12.25,
"step": 1381
},
{
"epoch": 1.6957055214723926,
"grad_norm": 20.464481466405882,
"learning_rate": 8.785123966942149e-07,
"logits/chosen": -0.109375,
"logits/rejected": -0.2265625,
"logps/chosen": -366.0,
"logps/rejected": -398.0,
"loss": 0.1138,
"rewards/accuracies": 0.953125,
"rewards/chosen": -1.828125,
"rewards/margins": 10.6875,
"rewards/rejected": -12.5,
"step": 1382
},
{
"epoch": 1.6969325153374233,
"grad_norm": 6.270153833401205,
"learning_rate": 8.776859504132232e-07,
"logits/chosen": -0.11767578125,
"logits/rejected": -0.30078125,
"logps/chosen": -406.0,
"logps/rejected": -420.0,
"loss": 0.0219,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.9140625,
"rewards/margins": 12.1875,
"rewards/rejected": -13.125,
"step": 1383
},
{
"epoch": 1.698159509202454,
"grad_norm": 15.776034006349834,
"learning_rate": 8.768595041322315e-07,
"logits/chosen": 0.0147705078125,
"logits/rejected": -0.10791015625,
"logps/chosen": -390.0,
"logps/rejected": -382.0,
"loss": 0.0684,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.03125,
"rewards/margins": 10.6875,
"rewards/rejected": -12.6875,
"step": 1384
},
{
"epoch": 1.6993865030674846,
"grad_norm": 10.334829477248885,
"learning_rate": 8.760330578512396e-07,
"logits/chosen": -0.115234375,
"logits/rejected": -0.2373046875,
"logps/chosen": -348.0,
"logps/rejected": -368.0,
"loss": 0.0556,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.3671875,
"rewards/margins": 11.0625,
"rewards/rejected": -12.4375,
"step": 1385
},
{
"epoch": 1.7006134969325153,
"grad_norm": 7.7823206823810676,
"learning_rate": 8.752066115702479e-07,
"logits/chosen": -0.2578125,
"logits/rejected": -0.470703125,
"logps/chosen": -434.0,
"logps/rejected": -440.0,
"loss": 0.0336,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.58984375,
"rewards/margins": 13.3125,
"rewards/rejected": -13.875,
"step": 1386
},
{
"epoch": 1.701840490797546,
"grad_norm": 7.437543918838008,
"learning_rate": 8.743801652892561e-07,
"logits/chosen": -0.2041015625,
"logits/rejected": -0.380859375,
"logps/chosen": -446.0,
"logps/rejected": -466.0,
"loss": 0.024,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.9765625,
"rewards/margins": 12.3125,
"rewards/rejected": -13.25,
"step": 1387
},
{
"epoch": 1.7030674846625766,
"grad_norm": 9.766676771989493,
"learning_rate": 8.735537190082644e-07,
"logits/chosen": 0.020263671875,
"logits/rejected": -0.12255859375,
"logps/chosen": -394.0,
"logps/rejected": -380.0,
"loss": 0.0339,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.90625,
"rewards/margins": 10.625,
"rewards/rejected": -12.5,
"step": 1388
},
{
"epoch": 1.7042944785276073,
"grad_norm": 4.994405881939517,
"learning_rate": 8.727272727272726e-07,
"logits/chosen": -0.259765625,
"logits/rejected": -0.375,
"logps/chosen": -422.0,
"logps/rejected": -436.0,
"loss": 0.0175,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.5703125,
"rewards/margins": 12.8125,
"rewards/rejected": -13.4375,
"step": 1389
},
{
"epoch": 1.705521472392638,
"grad_norm": 17.579302907222175,
"learning_rate": 8.719008264462809e-07,
"logits/chosen": -0.130859375,
"logits/rejected": -0.265625,
"logps/chosen": -390.0,
"logps/rejected": -412.0,
"loss": 0.0619,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.328125,
"rewards/margins": 12.3125,
"rewards/rejected": -13.625,
"step": 1390
},
{
"epoch": 1.7067484662576686,
"grad_norm": 9.312469510621938,
"learning_rate": 8.710743801652892e-07,
"logits/chosen": -0.13671875,
"logits/rejected": -0.38671875,
"logps/chosen": -406.0,
"logps/rejected": -412.0,
"loss": 0.0406,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.248046875,
"rewards/margins": 12.375,
"rewards/rejected": -12.625,
"step": 1391
},
{
"epoch": 1.7079754601226993,
"grad_norm": 9.256518305214534,
"learning_rate": 8.702479338842975e-07,
"logits/chosen": 0.044189453125,
"logits/rejected": -0.1328125,
"logps/chosen": -380.0,
"logps/rejected": -372.0,
"loss": 0.0427,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.234375,
"rewards/margins": 10.0625,
"rewards/rejected": -12.3125,
"step": 1392
},
{
"epoch": 1.70920245398773,
"grad_norm": 7.978440132624637,
"learning_rate": 8.694214876033057e-07,
"logits/chosen": -0.1806640625,
"logits/rejected": -0.376953125,
"logps/chosen": -390.0,
"logps/rejected": -366.0,
"loss": 0.0264,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.99609375,
"rewards/margins": 11.0,
"rewards/rejected": -12.0,
"step": 1393
},
{
"epoch": 1.7104294478527606,
"grad_norm": 15.435615666072344,
"learning_rate": 8.68595041322314e-07,
"logits/chosen": -0.2294921875,
"logits/rejected": -0.39453125,
"logps/chosen": -424.0,
"logps/rejected": -404.0,
"loss": 0.0762,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.484375,
"rewards/margins": 11.5625,
"rewards/rejected": -13.0,
"step": 1394
},
{
"epoch": 1.7116564417177913,
"grad_norm": 4.291578312759804,
"learning_rate": 8.677685950413223e-07,
"logits/chosen": -0.13671875,
"logits/rejected": -0.341796875,
"logps/chosen": -422.0,
"logps/rejected": -402.0,
"loss": 0.0177,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.7890625,
"rewards/margins": 11.5625,
"rewards/rejected": -12.375,
"step": 1395
},
{
"epoch": 1.712883435582822,
"grad_norm": 6.057095991809985,
"learning_rate": 8.669421487603306e-07,
"logits/chosen": 0.0191650390625,
"logits/rejected": -0.2060546875,
"logps/chosen": -398.0,
"logps/rejected": -396.0,
"loss": 0.0171,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.0390625,
"rewards/margins": 12.8125,
"rewards/rejected": -13.8125,
"step": 1396
},
{
"epoch": 1.7141104294478526,
"grad_norm": 4.297553257973654,
"learning_rate": 8.661157024793389e-07,
"logits/chosen": -0.16015625,
"logits/rejected": -0.306640625,
"logps/chosen": -404.0,
"logps/rejected": -410.0,
"loss": 0.0136,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.5859375,
"rewards/margins": 13.25,
"rewards/rejected": -13.8125,
"step": 1397
},
{
"epoch": 1.7153374233128833,
"grad_norm": 18.047286138704802,
"learning_rate": 8.65289256198347e-07,
"logits/chosen": -0.1064453125,
"logits/rejected": -0.2177734375,
"logps/chosen": -450.0,
"logps/rejected": -454.0,
"loss": 0.0676,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.375,
"rewards/margins": 12.625,
"rewards/rejected": -14.0,
"step": 1398
},
{
"epoch": 1.716564417177914,
"grad_norm": 9.052400441474742,
"learning_rate": 8.644628099173553e-07,
"logits/chosen": -0.08447265625,
"logits/rejected": -0.19921875,
"logps/chosen": -380.0,
"logps/rejected": -426.0,
"loss": 0.0321,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.8984375,
"rewards/margins": 11.0625,
"rewards/rejected": -12.9375,
"step": 1399
},
{
"epoch": 1.7177914110429446,
"grad_norm": 8.12246763954807,
"learning_rate": 8.636363636363636e-07,
"logits/chosen": -0.09130859375,
"logits/rejected": -0.2890625,
"logps/chosen": -364.0,
"logps/rejected": -376.0,
"loss": 0.0223,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.328125,
"rewards/margins": 10.875,
"rewards/rejected": -13.25,
"step": 1400
},
{
"epoch": 1.7190184049079753,
"grad_norm": 5.881346141257154,
"learning_rate": 8.628099173553719e-07,
"logits/chosen": -0.1474609375,
"logits/rejected": -0.380859375,
"logps/chosen": -464.0,
"logps/rejected": -470.0,
"loss": 0.0211,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.0703125,
"rewards/margins": 13.3125,
"rewards/rejected": -14.4375,
"step": 1401
},
{
"epoch": 1.720245398773006,
"grad_norm": 7.876391407551083,
"learning_rate": 8.619834710743801e-07,
"logits/chosen": -0.1806640625,
"logits/rejected": -0.40234375,
"logps/chosen": -424.0,
"logps/rejected": -398.0,
"loss": 0.0334,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.3984375,
"rewards/margins": 12.625,
"rewards/rejected": -14.0,
"step": 1402
},
{
"epoch": 1.7214723926380369,
"grad_norm": 17.096894939040883,
"learning_rate": 8.611570247933884e-07,
"logits/chosen": -0.07666015625,
"logits/rejected": -0.23046875,
"logps/chosen": -428.0,
"logps/rejected": -412.0,
"loss": 0.0561,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.9609375,
"rewards/margins": 11.5,
"rewards/rejected": -13.5,
"step": 1403
},
{
"epoch": 1.7226993865030675,
"grad_norm": 5.351690273001028,
"learning_rate": 8.603305785123967e-07,
"logits/chosen": -0.1015625,
"logits/rejected": -0.255859375,
"logps/chosen": -352.0,
"logps/rejected": -354.0,
"loss": 0.0196,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.8203125,
"rewards/margins": 12.5625,
"rewards/rejected": -13.375,
"step": 1404
},
{
"epoch": 1.7239263803680982,
"grad_norm": 11.479482395279408,
"learning_rate": 8.595041322314049e-07,
"logits/chosen": -0.2109375,
"logits/rejected": -0.380859375,
"logps/chosen": -448.0,
"logps/rejected": -438.0,
"loss": 0.0384,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.7265625,
"rewards/margins": 12.375,
"rewards/rejected": -14.125,
"step": 1405
},
{
"epoch": 1.7251533742331289,
"grad_norm": 6.094464818773876,
"learning_rate": 8.586776859504132e-07,
"logits/chosen": -0.337890625,
"logits/rejected": -0.458984375,
"logps/chosen": -344.0,
"logps/rejected": -396.0,
"loss": 0.0145,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.9140625,
"rewards/margins": 12.5,
"rewards/rejected": -14.4375,
"step": 1406
},
{
"epoch": 1.7263803680981595,
"grad_norm": 15.531525799270492,
"learning_rate": 8.578512396694214e-07,
"logits/chosen": -0.1552734375,
"logits/rejected": -0.435546875,
"logps/chosen": -466.0,
"logps/rejected": -456.0,
"loss": 0.0525,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.84375,
"rewards/margins": 12.4375,
"rewards/rejected": -14.25,
"step": 1407
},
{
"epoch": 1.7276073619631902,
"grad_norm": 7.64929466578026,
"learning_rate": 8.570247933884297e-07,
"logits/chosen": -0.1728515625,
"logits/rejected": -0.345703125,
"logps/chosen": -494.0,
"logps/rejected": -472.0,
"loss": 0.0288,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.59375,
"rewards/margins": 13.8125,
"rewards/rejected": -15.4375,
"step": 1408
},
{
"epoch": 1.7288343558282209,
"grad_norm": 14.709074361585227,
"learning_rate": 8.56198347107438e-07,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.302734375,
"logps/chosen": -400.0,
"logps/rejected": -404.0,
"loss": 0.0807,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.921875,
"rewards/margins": 12.625,
"rewards/rejected": -14.5625,
"step": 1409
},
{
"epoch": 1.7300613496932515,
"grad_norm": 10.852332997081168,
"learning_rate": 8.553719008264463e-07,
"logits/chosen": -0.2177734375,
"logits/rejected": -0.3984375,
"logps/chosen": -424.0,
"logps/rejected": -414.0,
"loss": 0.0567,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.890625,
"rewards/margins": 11.125,
"rewards/rejected": -14.0,
"step": 1410
},
{
"epoch": 1.7312883435582822,
"grad_norm": 6.655231153245812,
"learning_rate": 8.545454545454544e-07,
"logits/chosen": -0.1708984375,
"logits/rejected": -0.318359375,
"logps/chosen": -380.0,
"logps/rejected": -408.0,
"loss": 0.0208,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.5,
"rewards/margins": 12.125,
"rewards/rejected": -14.625,
"step": 1411
},
{
"epoch": 1.7325153374233129,
"grad_norm": 11.888467520244667,
"learning_rate": 8.537190082644627e-07,
"logits/chosen": -0.12109375,
"logits/rejected": -0.361328125,
"logps/chosen": -446.0,
"logps/rejected": -424.0,
"loss": 0.0764,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.546875,
"rewards/margins": 12.75,
"rewards/rejected": -14.3125,
"step": 1412
},
{
"epoch": 1.7337423312883435,
"grad_norm": 12.064972855751652,
"learning_rate": 8.52892561983471e-07,
"logits/chosen": -0.265625,
"logits/rejected": -0.482421875,
"logps/chosen": -418.0,
"logps/rejected": -416.0,
"loss": 0.0459,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.53125,
"rewards/margins": 12.625,
"rewards/rejected": -15.125,
"step": 1413
},
{
"epoch": 1.7349693251533742,
"grad_norm": 7.092872717094714,
"learning_rate": 8.520661157024793e-07,
"logits/chosen": -0.1376953125,
"logits/rejected": -0.322265625,
"logps/chosen": -458.0,
"logps/rejected": -416.0,
"loss": 0.0305,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.8984375,
"rewards/margins": 12.0,
"rewards/rejected": -13.875,
"step": 1414
},
{
"epoch": 1.7361963190184049,
"grad_norm": 6.351683265351178,
"learning_rate": 8.512396694214876e-07,
"logits/chosen": -0.19921875,
"logits/rejected": -0.3828125,
"logps/chosen": -368.0,
"logps/rejected": -402.0,
"loss": 0.0419,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.890625,
"rewards/margins": 12.0625,
"rewards/rejected": -13.9375,
"step": 1415
},
{
"epoch": 1.7374233128834355,
"grad_norm": 12.243640180893975,
"learning_rate": 8.504132231404958e-07,
"logits/chosen": -0.1201171875,
"logits/rejected": -0.38671875,
"logps/chosen": -442.0,
"logps/rejected": -430.0,
"loss": 0.0473,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.5234375,
"rewards/margins": 12.9375,
"rewards/rejected": -14.5,
"step": 1416
},
{
"epoch": 1.7386503067484662,
"grad_norm": 9.992881854403064,
"learning_rate": 8.495867768595041e-07,
"logits/chosen": -0.259765625,
"logits/rejected": -0.400390625,
"logps/chosen": -392.0,
"logps/rejected": -438.0,
"loss": 0.0325,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.9921875,
"rewards/margins": 15.1875,
"rewards/rejected": -17.25,
"step": 1417
},
{
"epoch": 1.7398773006134969,
"grad_norm": 14.680535177471516,
"learning_rate": 8.487603305785124e-07,
"logits/chosen": -0.1455078125,
"logits/rejected": -0.38671875,
"logps/chosen": -416.0,
"logps/rejected": -438.0,
"loss": 0.0459,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.03125,
"rewards/margins": 13.375,
"rewards/rejected": -15.375,
"step": 1418
},
{
"epoch": 1.7411042944785278,
"grad_norm": 11.912035091982608,
"learning_rate": 8.479338842975207e-07,
"logits/chosen": -0.1064453125,
"logits/rejected": -0.2392578125,
"logps/chosen": -368.0,
"logps/rejected": -370.0,
"loss": 0.0517,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.84375,
"rewards/margins": 11.125,
"rewards/rejected": -14.0,
"step": 1419
},
{
"epoch": 1.7423312883435584,
"grad_norm": 10.36690557190644,
"learning_rate": 8.471074380165289e-07,
"logits/chosen": -0.337890625,
"logits/rejected": -0.48828125,
"logps/chosen": -448.0,
"logps/rejected": -446.0,
"loss": 0.0341,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.8828125,
"rewards/margins": 13.0,
"rewards/rejected": -14.875,
"step": 1420
},
{
"epoch": 1.743558282208589,
"grad_norm": 7.577882176685783,
"learning_rate": 8.462809917355372e-07,
"logits/chosen": -0.2236328125,
"logits/rejected": -0.423828125,
"logps/chosen": -398.0,
"logps/rejected": -420.0,
"loss": 0.0242,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.8125,
"rewards/margins": 13.4375,
"rewards/rejected": -15.25,
"step": 1421
},
{
"epoch": 1.7447852760736198,
"grad_norm": 21.924224990444568,
"learning_rate": 8.454545454545454e-07,
"logits/chosen": -0.09814453125,
"logits/rejected": -0.265625,
"logps/chosen": -424.0,
"logps/rejected": -424.0,
"loss": 0.1269,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.625,
"rewards/margins": 11.8125,
"rewards/rejected": -14.4375,
"step": 1422
},
{
"epoch": 1.7460122699386504,
"grad_norm": 4.878766510345756,
"learning_rate": 8.446280991735537e-07,
"logits/chosen": -0.1787109375,
"logits/rejected": -0.359375,
"logps/chosen": -402.0,
"logps/rejected": -454.0,
"loss": 0.0147,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.984375,
"rewards/margins": 13.3125,
"rewards/rejected": -16.25,
"step": 1423
},
{
"epoch": 1.747239263803681,
"grad_norm": 6.7512716597255045,
"learning_rate": 8.43801652892562e-07,
"logits/chosen": -0.271484375,
"logits/rejected": -0.5078125,
"logps/chosen": -442.0,
"logps/rejected": -436.0,
"loss": 0.0182,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.5703125,
"rewards/margins": 13.0,
"rewards/rejected": -14.5625,
"step": 1424
},
{
"epoch": 1.7484662576687118,
"grad_norm": 6.312558713834704,
"learning_rate": 8.429752066115701e-07,
"logits/chosen": -0.1396484375,
"logits/rejected": -0.2578125,
"logps/chosen": -404.0,
"logps/rejected": -424.0,
"loss": 0.0169,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.6796875,
"rewards/margins": 13.3125,
"rewards/rejected": -15.0,
"step": 1425
},
{
"epoch": 1.7496932515337424,
"grad_norm": 16.911489526733224,
"learning_rate": 8.421487603305784e-07,
"logits/chosen": -0.1376953125,
"logits/rejected": -0.31640625,
"logps/chosen": -394.0,
"logps/rejected": -416.0,
"loss": 0.0679,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.6484375,
"rewards/margins": 12.5,
"rewards/rejected": -14.125,
"step": 1426
},
{
"epoch": 1.7509202453987731,
"grad_norm": 16.23891466552936,
"learning_rate": 8.413223140495867e-07,
"logits/chosen": -0.1435546875,
"logits/rejected": -0.275390625,
"logps/chosen": -402.0,
"logps/rejected": -418.0,
"loss": 0.0767,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.6953125,
"rewards/margins": 12.3125,
"rewards/rejected": -14.0,
"step": 1427
},
{
"epoch": 1.7521472392638038,
"grad_norm": 5.402598900404919,
"learning_rate": 8.40495867768595e-07,
"logits/chosen": -0.1904296875,
"logits/rejected": -0.302734375,
"logps/chosen": -438.0,
"logps/rejected": -442.0,
"loss": 0.019,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.94140625,
"rewards/margins": 13.75,
"rewards/rejected": -14.6875,
"step": 1428
},
{
"epoch": 1.7533742331288344,
"grad_norm": 16.81478239806244,
"learning_rate": 8.396694214876032e-07,
"logits/chosen": -0.1416015625,
"logits/rejected": -0.30859375,
"logps/chosen": -378.0,
"logps/rejected": -396.0,
"loss": 0.0404,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.125,
"rewards/margins": 12.5,
"rewards/rejected": -14.625,
"step": 1429
},
{
"epoch": 1.7546012269938651,
"grad_norm": 10.453530917447333,
"learning_rate": 8.388429752066115e-07,
"logits/chosen": -0.2265625,
"logits/rejected": -0.314453125,
"logps/chosen": -408.0,
"logps/rejected": -448.0,
"loss": 0.0335,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.7578125,
"rewards/margins": 12.9375,
"rewards/rejected": -14.6875,
"step": 1430
},
{
"epoch": 1.7558282208588958,
"grad_norm": 19.652204676954934,
"learning_rate": 8.380165289256198e-07,
"logits/chosen": -0.03369140625,
"logits/rejected": -0.19921875,
"logps/chosen": -418.0,
"logps/rejected": -412.0,
"loss": 0.0713,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.046875,
"rewards/margins": 11.5,
"rewards/rejected": -13.5,
"step": 1431
},
{
"epoch": 1.7570552147239265,
"grad_norm": 5.988594919951452,
"learning_rate": 8.371900826446281e-07,
"logits/chosen": -0.1953125,
"logits/rejected": -0.244140625,
"logps/chosen": -354.0,
"logps/rejected": -410.0,
"loss": 0.0127,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.4765625,
"rewards/margins": 13.0,
"rewards/rejected": -14.4375,
"step": 1432
},
{
"epoch": 1.7582822085889571,
"grad_norm": 14.532270409007625,
"learning_rate": 8.363636363636363e-07,
"logits/chosen": -0.0030059814453125,
"logits/rejected": -0.12451171875,
"logps/chosen": -390.0,
"logps/rejected": -394.0,
"loss": 0.0794,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -3.0,
"rewards/margins": 11.125,
"rewards/rejected": -14.125,
"step": 1433
},
{
"epoch": 1.7595092024539878,
"grad_norm": 9.745512220554525,
"learning_rate": 8.355371900826446e-07,
"logits/chosen": -0.03369140625,
"logits/rejected": -0.1298828125,
"logps/chosen": -366.0,
"logps/rejected": -446.0,
"loss": 0.0272,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.9609375,
"rewards/margins": 11.8125,
"rewards/rejected": -13.75,
"step": 1434
},
{
"epoch": 1.7607361963190185,
"grad_norm": 6.934740711385021,
"learning_rate": 8.347107438016529e-07,
"logits/chosen": -0.08349609375,
"logits/rejected": -0.2001953125,
"logps/chosen": -372.0,
"logps/rejected": -402.0,
"loss": 0.0309,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.765625,
"rewards/margins": 12.0,
"rewards/rejected": -13.8125,
"step": 1435
},
{
"epoch": 1.7619631901840491,
"grad_norm": 7.158308263530979,
"learning_rate": 8.338842975206612e-07,
"logits/chosen": -0.123046875,
"logits/rejected": -0.341796875,
"logps/chosen": -404.0,
"logps/rejected": -436.0,
"loss": 0.0196,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.203125,
"rewards/margins": 14.0,
"rewards/rejected": -14.1875,
"step": 1436
},
{
"epoch": 1.7631901840490798,
"grad_norm": 17.490770780783436,
"learning_rate": 8.330578512396695e-07,
"logits/chosen": -0.271484375,
"logits/rejected": -0.482421875,
"logps/chosen": -412.0,
"logps/rejected": -446.0,
"loss": 0.1,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.046875,
"rewards/margins": 13.375,
"rewards/rejected": -14.4375,
"step": 1437
},
{
"epoch": 1.7644171779141105,
"grad_norm": 12.779786949895705,
"learning_rate": 8.322314049586777e-07,
"logits/chosen": -0.150390625,
"logits/rejected": -0.30859375,
"logps/chosen": -402.0,
"logps/rejected": -418.0,
"loss": 0.0418,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.765625,
"rewards/margins": 12.375,
"rewards/rejected": -14.125,
"step": 1438
},
{
"epoch": 1.7656441717791411,
"grad_norm": 7.544173520665693,
"learning_rate": 8.314049586776859e-07,
"logits/chosen": -0.2060546875,
"logits/rejected": -0.4453125,
"logps/chosen": -386.0,
"logps/rejected": -404.0,
"loss": 0.0201,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.8515625,
"rewards/margins": 12.0,
"rewards/rejected": -13.875,
"step": 1439
},
{
"epoch": 1.7668711656441718,
"grad_norm": 11.97903800164342,
"learning_rate": 8.305785123966941e-07,
"logits/chosen": -0.1650390625,
"logits/rejected": -0.375,
"logps/chosen": -492.0,
"logps/rejected": -464.0,
"loss": 0.0356,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.296875,
"rewards/margins": 13.625,
"rewards/rejected": -14.9375,
"step": 1440
},
{
"epoch": 1.7680981595092025,
"grad_norm": 11.524568867802012,
"learning_rate": 8.297520661157024e-07,
"logits/chosen": -0.3125,
"logits/rejected": -0.392578125,
"logps/chosen": -374.0,
"logps/rejected": -422.0,
"loss": 0.0574,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.171875,
"rewards/margins": 13.0,
"rewards/rejected": -14.125,
"step": 1441
},
{
"epoch": 1.7693251533742331,
"grad_norm": 17.064990732948186,
"learning_rate": 8.289256198347106e-07,
"logits/chosen": -0.2412109375,
"logits/rejected": -0.46484375,
"logps/chosen": -456.0,
"logps/rejected": -436.0,
"loss": 0.0584,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.046875,
"rewards/margins": 12.5625,
"rewards/rejected": -14.625,
"step": 1442
},
{
"epoch": 1.7705521472392638,
"grad_norm": 7.6897818341002955,
"learning_rate": 8.280991735537189e-07,
"logits/chosen": -0.09716796875,
"logits/rejected": -0.244140625,
"logps/chosen": -446.0,
"logps/rejected": -448.0,
"loss": 0.0301,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.765625,
"rewards/margins": 13.0,
"rewards/rejected": -14.75,
"step": 1443
},
{
"epoch": 1.7717791411042945,
"grad_norm": 10.154504504256899,
"learning_rate": 8.272727272727272e-07,
"logits/chosen": -0.173828125,
"logits/rejected": -0.33984375,
"logps/chosen": -416.0,
"logps/rejected": -428.0,
"loss": 0.037,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.0703125,
"rewards/margins": 13.125,
"rewards/rejected": -14.1875,
"step": 1444
},
{
"epoch": 1.7730061349693251,
"grad_norm": 4.211609848161802,
"learning_rate": 8.264462809917355e-07,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.3125,
"logps/chosen": -346.0,
"logps/rejected": -378.0,
"loss": 0.0185,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.78125,
"rewards/margins": 11.9375,
"rewards/rejected": -13.75,
"step": 1445
},
{
"epoch": 1.7742331288343558,
"grad_norm": 11.004454554243601,
"learning_rate": 8.256198347107438e-07,
"logits/chosen": -0.1181640625,
"logits/rejected": -0.275390625,
"logps/chosen": -438.0,
"logps/rejected": -448.0,
"loss": 0.0455,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.859375,
"rewards/margins": 13.5625,
"rewards/rejected": -15.4375,
"step": 1446
},
{
"epoch": 1.7754601226993865,
"grad_norm": 7.902423493642877,
"learning_rate": 8.24793388429752e-07,
"logits/chosen": -0.26953125,
"logits/rejected": -0.44140625,
"logps/chosen": -404.0,
"logps/rejected": -422.0,
"loss": 0.0342,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.0625,
"rewards/margins": 12.875,
"rewards/rejected": -14.9375,
"step": 1447
},
{
"epoch": 1.7766871165644171,
"grad_norm": 16.107815036818316,
"learning_rate": 8.239669421487603e-07,
"logits/chosen": -0.119140625,
"logits/rejected": -0.248046875,
"logps/chosen": -364.0,
"logps/rejected": -406.0,
"loss": 0.0458,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.671875,
"rewards/margins": 11.9375,
"rewards/rejected": -14.625,
"step": 1448
},
{
"epoch": 1.7779141104294478,
"grad_norm": 10.545906451552389,
"learning_rate": 8.231404958677686e-07,
"logits/chosen": -0.035888671875,
"logits/rejected": -0.228515625,
"logps/chosen": -446.0,
"logps/rejected": -448.0,
"loss": 0.0364,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.7109375,
"rewards/margins": 12.3125,
"rewards/rejected": -14.0,
"step": 1449
},
{
"epoch": 1.7791411042944785,
"grad_norm": 11.22957614989993,
"learning_rate": 8.223140495867769e-07,
"logits/chosen": -0.193359375,
"logits/rejected": -0.36328125,
"logps/chosen": -442.0,
"logps/rejected": -424.0,
"loss": 0.0357,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.4375,
"rewards/margins": 12.75,
"rewards/rejected": -14.1875,
"step": 1450
},
{
"epoch": 1.7803680981595091,
"grad_norm": 7.976385598249082,
"learning_rate": 8.214876033057851e-07,
"logits/chosen": -0.10302734375,
"logits/rejected": -0.26171875,
"logps/chosen": -438.0,
"logps/rejected": -440.0,
"loss": 0.0205,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.265625,
"rewards/margins": 13.4375,
"rewards/rejected": -14.6875,
"step": 1451
},
{
"epoch": 1.7815950920245398,
"grad_norm": 10.110737179008327,
"learning_rate": 8.206611570247933e-07,
"logits/chosen": -0.3125,
"logits/rejected": -0.578125,
"logps/chosen": -466.0,
"logps/rejected": -438.0,
"loss": 0.0163,
"rewards/accuracies": 0.9921875,
"rewards/chosen": 0.345703125,
"rewards/margins": 14.375,
"rewards/rejected": -14.0,
"step": 1452
},
{
"epoch": 1.7828220858895705,
"grad_norm": 19.579068812216534,
"learning_rate": 8.198347107438016e-07,
"logits/chosen": -0.177734375,
"logits/rejected": -0.384765625,
"logps/chosen": -428.0,
"logps/rejected": -410.0,
"loss": 0.0807,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.3046875,
"rewards/margins": 12.9375,
"rewards/rejected": -14.25,
"step": 1453
},
{
"epoch": 1.7840490797546011,
"grad_norm": 17.909563593809587,
"learning_rate": 8.190082644628099e-07,
"logits/chosen": -0.072265625,
"logits/rejected": -0.27734375,
"logps/chosen": -414.0,
"logps/rejected": -416.0,
"loss": 0.0627,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.28125,
"rewards/margins": 12.875,
"rewards/rejected": -14.1875,
"step": 1454
},
{
"epoch": 1.7852760736196318,
"grad_norm": 7.975168709997291,
"learning_rate": 8.181818181818182e-07,
"logits/chosen": -0.1552734375,
"logits/rejected": -0.28125,
"logps/chosen": -416.0,
"logps/rejected": -446.0,
"loss": 0.0383,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.734375,
"rewards/margins": 12.4375,
"rewards/rejected": -14.1875,
"step": 1455
},
{
"epoch": 1.7865030674846625,
"grad_norm": 6.451698136731205,
"learning_rate": 8.173553719008264e-07,
"logits/chosen": -0.1767578125,
"logits/rejected": -0.296875,
"logps/chosen": -388.0,
"logps/rejected": -394.0,
"loss": 0.0261,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.03125,
"rewards/margins": 11.25,
"rewards/rejected": -13.3125,
"step": 1456
},
{
"epoch": 1.7877300613496931,
"grad_norm": 13.832898169450077,
"learning_rate": 8.165289256198347e-07,
"logits/chosen": -0.19921875,
"logits/rejected": -0.4296875,
"logps/chosen": -438.0,
"logps/rejected": -440.0,
"loss": 0.0674,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.34375,
"rewards/margins": 12.625,
"rewards/rejected": -14.0,
"step": 1457
},
{
"epoch": 1.7889570552147238,
"grad_norm": 11.950932725064204,
"learning_rate": 8.157024793388429e-07,
"logits/chosen": -0.05029296875,
"logits/rejected": -0.13671875,
"logps/chosen": -378.0,
"logps/rejected": -424.0,
"loss": 0.0329,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.046875,
"rewards/margins": 11.3125,
"rewards/rejected": -13.3125,
"step": 1458
},
{
"epoch": 1.7901840490797545,
"grad_norm": 3299.794435885176,
"learning_rate": 8.148760330578512e-07,
"logits/chosen": -0.1591796875,
"logits/rejected": -0.388671875,
"logps/chosen": -612.0,
"logps/rejected": -410.0,
"loss": 20.9129,
"rewards/accuracies": 0.984375,
"rewards/chosen": -21.875,
"rewards/margins": -7.59375,
"rewards/rejected": -14.25,
"step": 1459
},
{
"epoch": 1.7914110429447851,
"grad_norm": 6.622830365064994,
"learning_rate": 8.140495867768594e-07,
"logits/chosen": -0.125,
"logits/rejected": -0.265625,
"logps/chosen": -440.0,
"logps/rejected": -430.0,
"loss": 0.0256,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.421875,
"rewards/margins": 12.0,
"rewards/rejected": -13.4375,
"step": 1460
},
{
"epoch": 1.7926380368098158,
"grad_norm": 13.881535402235917,
"learning_rate": 8.132231404958677e-07,
"logits/chosen": -0.12353515625,
"logits/rejected": -0.3359375,
"logps/chosen": -446.0,
"logps/rejected": -440.0,
"loss": 0.06,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.0546875,
"rewards/margins": 14.4375,
"rewards/rejected": -15.4375,
"step": 1461
},
{
"epoch": 1.7938650306748465,
"grad_norm": 10.348121505071811,
"learning_rate": 8.12396694214876e-07,
"logits/chosen": -0.12890625,
"logits/rejected": -0.2001953125,
"logps/chosen": -342.0,
"logps/rejected": -398.0,
"loss": 0.0629,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.515625,
"rewards/margins": 12.5625,
"rewards/rejected": -14.125,
"step": 1462
},
{
"epoch": 1.7950920245398772,
"grad_norm": 6.932694869302806,
"learning_rate": 8.115702479338843e-07,
"logits/chosen": -0.05615234375,
"logits/rejected": -0.294921875,
"logps/chosen": -422.0,
"logps/rejected": -420.0,
"loss": 0.0212,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.4140625,
"rewards/margins": 12.25,
"rewards/rejected": -13.625,
"step": 1463
},
{
"epoch": 1.7963190184049078,
"grad_norm": 10.574264997532612,
"learning_rate": 8.107438016528926e-07,
"logits/chosen": -0.185546875,
"logits/rejected": -0.33203125,
"logps/chosen": -356.0,
"logps/rejected": -386.0,
"loss": 0.0357,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.9296875,
"rewards/margins": 12.625,
"rewards/rejected": -13.5625,
"step": 1464
},
{
"epoch": 1.7975460122699385,
"grad_norm": 24.3418712342261,
"learning_rate": 8.099173553719008e-07,
"logits/chosen": -0.2294921875,
"logits/rejected": -0.35546875,
"logps/chosen": -412.0,
"logps/rejected": -436.0,
"loss": 0.1072,
"rewards/accuracies": 0.9453125,
"rewards/chosen": -1.03125,
"rewards/margins": 13.25,
"rewards/rejected": -14.25,
"step": 1465
},
{
"epoch": 1.7987730061349694,
"grad_norm": 6.3254317917292155,
"learning_rate": 8.09090909090909e-07,
"logits/chosen": -0.15234375,
"logits/rejected": -0.37109375,
"logps/chosen": -378.0,
"logps/rejected": -400.0,
"loss": 0.0167,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.3828125,
"rewards/margins": 12.9375,
"rewards/rejected": -14.3125,
"step": 1466
},
{
"epoch": 1.8,
"grad_norm": 16.570570079618726,
"learning_rate": 8.082644628099173e-07,
"logits/chosen": -0.2099609375,
"logits/rejected": -0.310546875,
"logps/chosen": -444.0,
"logps/rejected": -444.0,
"loss": 0.0592,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.0078125,
"rewards/margins": 12.3125,
"rewards/rejected": -13.375,
"step": 1467
},
{
"epoch": 1.8012269938650307,
"grad_norm": 15.738865838591,
"learning_rate": 8.074380165289256e-07,
"logits/chosen": -0.09814453125,
"logits/rejected": -0.298828125,
"logps/chosen": -428.0,
"logps/rejected": -428.0,
"loss": 0.0475,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.68359375,
"rewards/margins": 13.6875,
"rewards/rejected": -14.375,
"step": 1468
},
{
"epoch": 1.8024539877300614,
"grad_norm": 9.667257990756262,
"learning_rate": 8.066115702479338e-07,
"logits/chosen": -0.08154296875,
"logits/rejected": -0.2265625,
"logps/chosen": -420.0,
"logps/rejected": -416.0,
"loss": 0.0405,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.703125,
"rewards/margins": 12.625,
"rewards/rejected": -14.375,
"step": 1469
},
{
"epoch": 1.803680981595092,
"grad_norm": 7.2948304370554755,
"learning_rate": 8.057851239669421e-07,
"logits/chosen": -0.0546875,
"logits/rejected": -0.28125,
"logps/chosen": -422.0,
"logps/rejected": -414.0,
"loss": 0.0337,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.171875,
"rewards/margins": 12.1875,
"rewards/rejected": -14.375,
"step": 1470
},
{
"epoch": 1.8049079754601227,
"grad_norm": 7.708776699518576,
"learning_rate": 8.049586776859504e-07,
"logits/chosen": -0.0673828125,
"logits/rejected": -0.1748046875,
"logps/chosen": -392.0,
"logps/rejected": -424.0,
"loss": 0.0273,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.578125,
"rewards/margins": 11.75,
"rewards/rejected": -13.3125,
"step": 1471
},
{
"epoch": 1.8061349693251534,
"grad_norm": 10.50520663004266,
"learning_rate": 8.041322314049587e-07,
"logits/chosen": -0.1064453125,
"logits/rejected": -0.25,
"logps/chosen": -406.0,
"logps/rejected": -424.0,
"loss": 0.0373,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.125,
"rewards/margins": 13.3125,
"rewards/rejected": -14.4375,
"step": 1472
},
{
"epoch": 1.807361963190184,
"grad_norm": 11.220112442508238,
"learning_rate": 8.033057851239669e-07,
"logits/chosen": -0.1435546875,
"logits/rejected": -0.400390625,
"logps/chosen": -402.0,
"logps/rejected": -410.0,
"loss": 0.0543,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.5078125,
"rewards/margins": 12.875,
"rewards/rejected": -14.375,
"step": 1473
},
{
"epoch": 1.8085889570552147,
"grad_norm": 14.056634161393513,
"learning_rate": 8.024793388429752e-07,
"logits/chosen": -0.01708984375,
"logits/rejected": -0.23046875,
"logps/chosen": -444.0,
"logps/rejected": -442.0,
"loss": 0.0377,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.625,
"rewards/margins": 12.6875,
"rewards/rejected": -14.3125,
"step": 1474
},
{
"epoch": 1.8098159509202454,
"grad_norm": 9.423252953165358,
"learning_rate": 8.016528925619835e-07,
"logits/chosen": -0.1533203125,
"logits/rejected": -0.34375,
"logps/chosen": -422.0,
"logps/rejected": -426.0,
"loss": 0.0342,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.796875,
"rewards/margins": 13.0625,
"rewards/rejected": -14.8125,
"step": 1475
},
{
"epoch": 1.811042944785276,
"grad_norm": 15.296807299702936,
"learning_rate": 8.008264462809917e-07,
"logits/chosen": -0.1875,
"logits/rejected": -0.34375,
"logps/chosen": -386.0,
"logps/rejected": -418.0,
"loss": 0.0605,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.7421875,
"rewards/margins": 13.1875,
"rewards/rejected": -14.9375,
"step": 1476
},
{
"epoch": 1.8122699386503067,
"grad_norm": 18.125847891374626,
"learning_rate": 8e-07,
"logits/chosen": -0.062255859375,
"logits/rejected": -0.1884765625,
"logps/chosen": -410.0,
"logps/rejected": -430.0,
"loss": 0.0854,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.671875,
"rewards/margins": 11.625,
"rewards/rejected": -14.3125,
"step": 1477
},
{
"epoch": 1.8134969325153374,
"grad_norm": 8.862440370155301,
"learning_rate": 7.991735537190082e-07,
"logits/chosen": -0.095703125,
"logits/rejected": -0.267578125,
"logps/chosen": -424.0,
"logps/rejected": -454.0,
"loss": 0.0244,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.1875,
"rewards/margins": 13.25,
"rewards/rejected": -14.4375,
"step": 1478
},
{
"epoch": 1.814723926380368,
"grad_norm": 3.2080827187958083,
"learning_rate": 7.983471074380164e-07,
"logits/chosen": -0.1884765625,
"logits/rejected": -0.361328125,
"logps/chosen": -400.0,
"logps/rejected": -424.0,
"loss": 0.0114,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.3515625,
"rewards/margins": 13.375,
"rewards/rejected": -14.6875,
"step": 1479
},
{
"epoch": 1.8159509202453987,
"grad_norm": 6.483435633987567,
"learning_rate": 7.975206611570247e-07,
"logits/chosen": -0.267578125,
"logits/rejected": -0.408203125,
"logps/chosen": -418.0,
"logps/rejected": -458.0,
"loss": 0.0279,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.3515625,
"rewards/margins": 12.5625,
"rewards/rejected": -13.9375,
"step": 1480
},
{
"epoch": 1.8171779141104294,
"grad_norm": 13.364338309777926,
"learning_rate": 7.96694214876033e-07,
"logits/chosen": -0.2255859375,
"logits/rejected": -0.34375,
"logps/chosen": -454.0,
"logps/rejected": -460.0,
"loss": 0.0461,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.109375,
"rewards/margins": 12.6875,
"rewards/rejected": -14.8125,
"step": 1481
},
{
"epoch": 1.8184049079754603,
"grad_norm": 13.416142675368022,
"learning_rate": 7.958677685950412e-07,
"logits/chosen": -0.05126953125,
"logits/rejected": -0.212890625,
"logps/chosen": -396.0,
"logps/rejected": -410.0,
"loss": 0.0868,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.140625,
"rewards/margins": 12.375,
"rewards/rejected": -14.5625,
"step": 1482
},
{
"epoch": 1.819631901840491,
"grad_norm": 18.062506501700554,
"learning_rate": 7.950413223140495e-07,
"logits/chosen": 0.01324462890625,
"logits/rejected": -0.150390625,
"logps/chosen": -382.0,
"logps/rejected": -372.0,
"loss": 0.1124,
"rewards/accuracies": 0.9453125,
"rewards/chosen": -2.828125,
"rewards/margins": 11.4375,
"rewards/rejected": -14.25,
"step": 1483
},
{
"epoch": 1.8208588957055216,
"grad_norm": 8.181265676234366,
"learning_rate": 7.942148760330578e-07,
"logits/chosen": -0.22265625,
"logits/rejected": -0.376953125,
"logps/chosen": -372.0,
"logps/rejected": -404.0,
"loss": 0.0311,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.171875,
"rewards/margins": 12.125,
"rewards/rejected": -14.3125,
"step": 1484
},
{
"epoch": 1.8220858895705523,
"grad_norm": 11.44343043929689,
"learning_rate": 7.933884297520661e-07,
"logits/chosen": -0.208984375,
"logits/rejected": -0.240234375,
"logps/chosen": -370.0,
"logps/rejected": -454.0,
"loss": 0.0357,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.421875,
"rewards/margins": 12.1875,
"rewards/rejected": -14.625,
"step": 1485
},
{
"epoch": 1.823312883435583,
"grad_norm": 9.90427252004485,
"learning_rate": 7.925619834710744e-07,
"logits/chosen": -0.287109375,
"logits/rejected": -0.451171875,
"logps/chosen": -402.0,
"logps/rejected": -430.0,
"loss": 0.0462,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.265625,
"rewards/margins": 12.75,
"rewards/rejected": -15.0,
"step": 1486
},
{
"epoch": 1.8245398773006136,
"grad_norm": 7.184480583156823,
"learning_rate": 7.917355371900826e-07,
"logits/chosen": -0.34375,
"logits/rejected": -0.51171875,
"logps/chosen": -432.0,
"logps/rejected": -414.0,
"loss": 0.0243,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.4296875,
"rewards/margins": 13.5,
"rewards/rejected": -14.875,
"step": 1487
},
{
"epoch": 1.8257668711656443,
"grad_norm": 12.853477099110478,
"learning_rate": 7.909090909090909e-07,
"logits/chosen": -0.1953125,
"logits/rejected": -0.462890625,
"logps/chosen": -430.0,
"logps/rejected": -406.0,
"loss": 0.0523,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.40625,
"rewards/margins": 13.3125,
"rewards/rejected": -14.6875,
"step": 1488
},
{
"epoch": 1.826993865030675,
"grad_norm": 8.176432782897919,
"learning_rate": 7.900826446280992e-07,
"logits/chosen": -0.3359375,
"logits/rejected": -0.54296875,
"logps/chosen": -426.0,
"logps/rejected": -436.0,
"loss": 0.0293,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.4140625,
"rewards/margins": 13.9375,
"rewards/rejected": -15.375,
"step": 1489
},
{
"epoch": 1.8282208588957056,
"grad_norm": 7.731766346251227,
"learning_rate": 7.892561983471075e-07,
"logits/chosen": -0.1826171875,
"logits/rejected": -0.408203125,
"logps/chosen": -414.0,
"logps/rejected": -432.0,
"loss": 0.0241,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.953125,
"rewards/margins": 13.875,
"rewards/rejected": -14.8125,
"step": 1490
},
{
"epoch": 1.8294478527607363,
"grad_norm": 4.739968760458063,
"learning_rate": 7.884297520661157e-07,
"logits/chosen": -0.2080078125,
"logits/rejected": -0.466796875,
"logps/chosen": -498.0,
"logps/rejected": -474.0,
"loss": 0.0148,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.59375,
"rewards/margins": 14.5,
"rewards/rejected": -15.0625,
"step": 1491
},
{
"epoch": 1.830674846625767,
"grad_norm": 16.34711580837951,
"learning_rate": 7.87603305785124e-07,
"logits/chosen": -0.341796875,
"logits/rejected": -0.498046875,
"logps/chosen": -404.0,
"logps/rejected": -424.0,
"loss": 0.0526,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.5078125,
"rewards/margins": 13.125,
"rewards/rejected": -14.625,
"step": 1492
},
{
"epoch": 1.8319018404907976,
"grad_norm": 7.107963413840639,
"learning_rate": 7.867768595041322e-07,
"logits/chosen": -0.30859375,
"logits/rejected": -0.427734375,
"logps/chosen": -344.0,
"logps/rejected": -392.0,
"loss": 0.0294,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.484375,
"rewards/margins": 12.3125,
"rewards/rejected": -14.8125,
"step": 1493
},
{
"epoch": 1.8331288343558283,
"grad_norm": 5.613408975161089,
"learning_rate": 7.859504132231404e-07,
"logits/chosen": -0.24609375,
"logits/rejected": -0.38671875,
"logps/chosen": -458.0,
"logps/rejected": -466.0,
"loss": 0.0217,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.84375,
"rewards/margins": 13.3125,
"rewards/rejected": -15.125,
"step": 1494
},
{
"epoch": 1.834355828220859,
"grad_norm": 13.098254113739143,
"learning_rate": 7.851239669421487e-07,
"logits/chosen": -0.2080078125,
"logits/rejected": -0.373046875,
"logps/chosen": -382.0,
"logps/rejected": -402.0,
"loss": 0.0443,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.421875,
"rewards/margins": 12.0625,
"rewards/rejected": -13.5,
"step": 1495
},
{
"epoch": 1.8355828220858896,
"grad_norm": 8.78117635480224,
"learning_rate": 7.842975206611569e-07,
"logits/chosen": -0.1513671875,
"logits/rejected": -0.294921875,
"logps/chosen": -392.0,
"logps/rejected": -416.0,
"loss": 0.0318,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1484375,
"rewards/margins": 12.3125,
"rewards/rejected": -13.5,
"step": 1496
},
{
"epoch": 1.8368098159509203,
"grad_norm": 8.273148884106954,
"learning_rate": 7.834710743801652e-07,
"logits/chosen": -0.1396484375,
"logits/rejected": -0.380859375,
"logps/chosen": -428.0,
"logps/rejected": -408.0,
"loss": 0.025,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.0078125,
"rewards/margins": 13.0,
"rewards/rejected": -14.0,
"step": 1497
},
{
"epoch": 1.838036809815951,
"grad_norm": 21.138608747159992,
"learning_rate": 7.826446280991735e-07,
"logits/chosen": -0.31640625,
"logits/rejected": -0.50390625,
"logps/chosen": -438.0,
"logps/rejected": -460.0,
"loss": 0.0906,
"rewards/accuracies": 0.953125,
"rewards/chosen": -0.97265625,
"rewards/margins": 12.75,
"rewards/rejected": -13.75,
"step": 1498
},
{
"epoch": 1.8392638036809816,
"grad_norm": 13.450717371026645,
"learning_rate": 7.818181818181818e-07,
"logits/chosen": -0.11328125,
"logits/rejected": -0.3046875,
"logps/chosen": -406.0,
"logps/rejected": -422.0,
"loss": 0.0579,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.21875,
"rewards/margins": 12.8125,
"rewards/rejected": -14.0,
"step": 1499
},
{
"epoch": 1.8404907975460123,
"grad_norm": 9.5168049111157,
"learning_rate": 7.8099173553719e-07,
"logits/chosen": -0.14453125,
"logits/rejected": -0.3671875,
"logps/chosen": -386.0,
"logps/rejected": -370.0,
"loss": 0.0395,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.5234375,
"rewards/margins": 12.5,
"rewards/rejected": -13.0,
"step": 1500
},
{
"epoch": 1.841717791411043,
"grad_norm": 10.638498503833137,
"learning_rate": 7.801652892561983e-07,
"logits/chosen": -0.142578125,
"logits/rejected": -0.279296875,
"logps/chosen": -390.0,
"logps/rejected": -424.0,
"loss": 0.0422,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.046875,
"rewards/margins": 12.75,
"rewards/rejected": -13.8125,
"step": 1501
},
{
"epoch": 1.8429447852760736,
"grad_norm": 13.694183232767102,
"learning_rate": 7.793388429752066e-07,
"logits/chosen": -0.09912109375,
"logits/rejected": -0.208984375,
"logps/chosen": -384.0,
"logps/rejected": -422.0,
"loss": 0.0659,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.46875,
"rewards/margins": 11.875,
"rewards/rejected": -14.3125,
"step": 1502
},
{
"epoch": 1.8441717791411043,
"grad_norm": 4.563452214084135,
"learning_rate": 7.785123966942149e-07,
"logits/chosen": -0.205078125,
"logits/rejected": -0.419921875,
"logps/chosen": -446.0,
"logps/rejected": -484.0,
"loss": 0.0171,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.1328125,
"rewards/margins": 13.375,
"rewards/rejected": -14.5,
"step": 1503
},
{
"epoch": 1.845398773006135,
"grad_norm": 7.091255084250044,
"learning_rate": 7.776859504132232e-07,
"logits/chosen": -0.263671875,
"logits/rejected": -0.416015625,
"logps/chosen": -406.0,
"logps/rejected": -436.0,
"loss": 0.0262,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.359375,
"rewards/margins": 12.4375,
"rewards/rejected": -13.75,
"step": 1504
},
{
"epoch": 1.8466257668711656,
"grad_norm": 6.848767113677235,
"learning_rate": 7.768595041322314e-07,
"logits/chosen": -0.2421875,
"logits/rejected": -0.41015625,
"logps/chosen": -434.0,
"logps/rejected": -450.0,
"loss": 0.03,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.6328125,
"rewards/margins": 12.75,
"rewards/rejected": -14.375,
"step": 1505
},
{
"epoch": 1.8478527607361963,
"grad_norm": 9.273171488865707,
"learning_rate": 7.760330578512397e-07,
"logits/chosen": -0.1826171875,
"logits/rejected": -0.361328125,
"logps/chosen": -374.0,
"logps/rejected": -424.0,
"loss": 0.0338,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.140625,
"rewards/margins": 12.1875,
"rewards/rejected": -14.3125,
"step": 1506
},
{
"epoch": 1.849079754601227,
"grad_norm": 10.64315051922298,
"learning_rate": 7.752066115702479e-07,
"logits/chosen": -0.1640625,
"logits/rejected": -0.3828125,
"logps/chosen": -422.0,
"logps/rejected": -420.0,
"loss": 0.0352,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.421875,
"rewards/margins": 12.125,
"rewards/rejected": -13.5625,
"step": 1507
},
{
"epoch": 1.8503067484662576,
"grad_norm": 7.6047839394533625,
"learning_rate": 7.743801652892562e-07,
"logits/chosen": -0.07275390625,
"logits/rejected": -0.24609375,
"logps/chosen": -410.0,
"logps/rejected": -434.0,
"loss": 0.0298,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.203125,
"rewards/margins": 12.25,
"rewards/rejected": -14.4375,
"step": 1508
},
{
"epoch": 1.8515337423312883,
"grad_norm": 5.493283871607361,
"learning_rate": 7.735537190082644e-07,
"logits/chosen": -0.1640625,
"logits/rejected": -0.3671875,
"logps/chosen": -464.0,
"logps/rejected": -450.0,
"loss": 0.0194,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.4453125,
"rewards/margins": 12.125,
"rewards/rejected": -13.5625,
"step": 1509
},
{
"epoch": 1.852760736196319,
"grad_norm": 5.24900957883192,
"learning_rate": 7.727272727272727e-07,
"logits/chosen": -0.1328125,
"logits/rejected": -0.3828125,
"logps/chosen": -450.0,
"logps/rejected": -424.0,
"loss": 0.016,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.265625,
"rewards/margins": 13.0,
"rewards/rejected": -14.25,
"step": 1510
},
{
"epoch": 1.8539877300613496,
"grad_norm": 6.181938286000045,
"learning_rate": 7.719008264462809e-07,
"logits/chosen": -0.212890625,
"logits/rejected": -0.287109375,
"logps/chosen": -436.0,
"logps/rejected": -482.0,
"loss": 0.0154,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.296875,
"rewards/margins": 13.4375,
"rewards/rejected": -14.75,
"step": 1511
},
{
"epoch": 1.8552147239263803,
"grad_norm": 10.451305753039685,
"learning_rate": 7.710743801652892e-07,
"logits/chosen": -0.154296875,
"logits/rejected": -0.384765625,
"logps/chosen": -376.0,
"logps/rejected": -386.0,
"loss": 0.0251,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.8359375,
"rewards/margins": 13.5,
"rewards/rejected": -14.375,
"step": 1512
},
{
"epoch": 1.856441717791411,
"grad_norm": 13.462785355394733,
"learning_rate": 7.702479338842975e-07,
"logits/chosen": -0.1552734375,
"logits/rejected": -0.3828125,
"logps/chosen": -420.0,
"logps/rejected": -408.0,
"loss": 0.0468,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.453125,
"rewards/margins": 13.0625,
"rewards/rejected": -14.5,
"step": 1513
},
{
"epoch": 1.8576687116564417,
"grad_norm": 9.524803750366768,
"learning_rate": 7.694214876033057e-07,
"logits/chosen": -0.201171875,
"logits/rejected": -0.384765625,
"logps/chosen": -430.0,
"logps/rejected": -454.0,
"loss": 0.0411,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.4375,
"rewards/margins": 14.125,
"rewards/rejected": -15.5625,
"step": 1514
},
{
"epoch": 1.8588957055214723,
"grad_norm": 5.894843489816778,
"learning_rate": 7.68595041322314e-07,
"logits/chosen": -0.2275390625,
"logits/rejected": -0.455078125,
"logps/chosen": -422.0,
"logps/rejected": -416.0,
"loss": 0.0171,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.50390625,
"rewards/margins": 14.0625,
"rewards/rejected": -14.5625,
"step": 1515
},
{
"epoch": 1.860122699386503,
"grad_norm": 11.494715146279521,
"learning_rate": 7.677685950413223e-07,
"logits/chosen": -0.1845703125,
"logits/rejected": -0.330078125,
"logps/chosen": -438.0,
"logps/rejected": -446.0,
"loss": 0.0391,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.703125,
"rewards/margins": 12.1875,
"rewards/rejected": -14.875,
"step": 1516
},
{
"epoch": 1.8613496932515337,
"grad_norm": 2.178911266960936,
"learning_rate": 7.669421487603306e-07,
"logits/chosen": -0.228515625,
"logits/rejected": -0.431640625,
"logps/chosen": -436.0,
"logps/rejected": -430.0,
"loss": 0.0089,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.0078125,
"rewards/margins": 14.375,
"rewards/rejected": -15.375,
"step": 1517
},
{
"epoch": 1.8625766871165643,
"grad_norm": 13.576294310507379,
"learning_rate": 7.661157024793388e-07,
"logits/chosen": -0.24609375,
"logits/rejected": -0.4453125,
"logps/chosen": -400.0,
"logps/rejected": -398.0,
"loss": 0.0582,
"rewards/accuracies": 0.953125,
"rewards/chosen": -1.8203125,
"rewards/margins": 13.375,
"rewards/rejected": -15.1875,
"step": 1518
},
{
"epoch": 1.863803680981595,
"grad_norm": 20.061133205285515,
"learning_rate": 7.65289256198347e-07,
"logits/chosen": -0.2373046875,
"logits/rejected": -0.359375,
"logps/chosen": -390.0,
"logps/rejected": -442.0,
"loss": 0.0866,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.8125,
"rewards/margins": 12.375,
"rewards/rejected": -15.1875,
"step": 1519
},
{
"epoch": 1.8650306748466257,
"grad_norm": 14.129015471911169,
"learning_rate": 7.644628099173553e-07,
"logits/chosen": -0.228515625,
"logits/rejected": -0.314453125,
"logps/chosen": -414.0,
"logps/rejected": -434.0,
"loss": 0.0509,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.3125,
"rewards/margins": 13.1875,
"rewards/rejected": -15.5,
"step": 1520
},
{
"epoch": 1.8662576687116563,
"grad_norm": 12.106552118774427,
"learning_rate": 7.636363636363636e-07,
"logits/chosen": -0.1416015625,
"logits/rejected": -0.34375,
"logps/chosen": -396.0,
"logps/rejected": -404.0,
"loss": 0.057,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.46875,
"rewards/margins": 12.375,
"rewards/rejected": -14.875,
"step": 1521
},
{
"epoch": 1.867484662576687,
"grad_norm": 12.525306037497732,
"learning_rate": 7.628099173553718e-07,
"logits/chosen": -0.1708984375,
"logits/rejected": -0.365234375,
"logps/chosen": -390.0,
"logps/rejected": -402.0,
"loss": 0.056,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.8515625,
"rewards/margins": 12.5,
"rewards/rejected": -14.375,
"step": 1522
},
{
"epoch": 1.8687116564417177,
"grad_norm": 8.669313542817841,
"learning_rate": 7.619834710743801e-07,
"logits/chosen": -0.240234375,
"logits/rejected": -0.3828125,
"logps/chosen": -394.0,
"logps/rejected": -406.0,
"loss": 0.0315,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.7265625,
"rewards/margins": 13.125,
"rewards/rejected": -14.875,
"step": 1523
},
{
"epoch": 1.8699386503067483,
"grad_norm": 7.171137359247992,
"learning_rate": 7.611570247933884e-07,
"logits/chosen": -0.09375,
"logits/rejected": -0.25390625,
"logps/chosen": -368.0,
"logps/rejected": -432.0,
"loss": 0.0247,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.734375,
"rewards/margins": 12.5625,
"rewards/rejected": -15.3125,
"step": 1524
},
{
"epoch": 1.871165644171779,
"grad_norm": 12.486897148967087,
"learning_rate": 7.603305785123967e-07,
"logits/chosen": -0.2158203125,
"logits/rejected": -0.373046875,
"logps/chosen": -370.0,
"logps/rejected": -418.0,
"loss": 0.0349,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.46875,
"rewards/margins": 13.3125,
"rewards/rejected": -14.75,
"step": 1525
},
{
"epoch": 1.8723926380368097,
"grad_norm": 9.946526391656043,
"learning_rate": 7.59504132231405e-07,
"logits/chosen": -0.08154296875,
"logits/rejected": -0.275390625,
"logps/chosen": -432.0,
"logps/rejected": -424.0,
"loss": 0.0415,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.5234375,
"rewards/margins": 12.9375,
"rewards/rejected": -14.4375,
"step": 1526
},
{
"epoch": 1.8736196319018403,
"grad_norm": 12.598698164695472,
"learning_rate": 7.586776859504132e-07,
"logits/chosen": -0.1162109375,
"logits/rejected": -0.333984375,
"logps/chosen": -434.0,
"logps/rejected": -400.0,
"loss": 0.0457,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.75,
"rewards/margins": 12.875,
"rewards/rejected": -14.625,
"step": 1527
},
{
"epoch": 1.874846625766871,
"grad_norm": 16.241862409012366,
"learning_rate": 7.578512396694215e-07,
"logits/chosen": -0.080078125,
"logits/rejected": -0.3046875,
"logps/chosen": -418.0,
"logps/rejected": -396.0,
"loss": 0.0927,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.640625,
"rewards/margins": 13.25,
"rewards/rejected": -14.875,
"step": 1528
},
{
"epoch": 1.876073619631902,
"grad_norm": 2.993809987176909,
"learning_rate": 7.570247933884297e-07,
"logits/chosen": -0.2109375,
"logits/rejected": -0.455078125,
"logps/chosen": -440.0,
"logps/rejected": -434.0,
"loss": 0.0091,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.51171875,
"rewards/margins": 15.0,
"rewards/rejected": -15.5,
"step": 1529
},
{
"epoch": 1.8773006134969326,
"grad_norm": 9.513712024522786,
"learning_rate": 7.56198347107438e-07,
"logits/chosen": -0.197265625,
"logits/rejected": -0.34375,
"logps/chosen": -410.0,
"logps/rejected": -400.0,
"loss": 0.0345,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.921875,
"rewards/margins": 12.875,
"rewards/rejected": -15.8125,
"step": 1530
},
{
"epoch": 1.8785276073619632,
"grad_norm": 7.006523582079429,
"learning_rate": 7.553719008264462e-07,
"logits/chosen": -0.048828125,
"logits/rejected": -0.203125,
"logps/chosen": -402.0,
"logps/rejected": -406.0,
"loss": 0.0279,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.671875,
"rewards/margins": 12.375,
"rewards/rejected": -15.0625,
"step": 1531
},
{
"epoch": 1.879754601226994,
"grad_norm": 10.676992819808984,
"learning_rate": 7.545454545454545e-07,
"logits/chosen": -0.330078125,
"logits/rejected": -0.49609375,
"logps/chosen": -452.0,
"logps/rejected": -476.0,
"loss": 0.0436,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.83984375,
"rewards/margins": 14.75,
"rewards/rejected": -15.5625,
"step": 1532
},
{
"epoch": 1.8809815950920246,
"grad_norm": 12.974034958143907,
"learning_rate": 7.537190082644627e-07,
"logits/chosen": -0.12158203125,
"logits/rejected": -0.267578125,
"logps/chosen": -404.0,
"logps/rejected": -432.0,
"loss": 0.0445,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.109375,
"rewards/margins": 12.0,
"rewards/rejected": -14.125,
"step": 1533
},
{
"epoch": 1.8822085889570552,
"grad_norm": 11.78612785274464,
"learning_rate": 7.52892561983471e-07,
"logits/chosen": -0.20703125,
"logits/rejected": -0.34765625,
"logps/chosen": -412.0,
"logps/rejected": -444.0,
"loss": 0.0375,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.65625,
"rewards/margins": 12.75,
"rewards/rejected": -15.4375,
"step": 1534
},
{
"epoch": 1.883435582822086,
"grad_norm": 12.331006996175937,
"learning_rate": 7.520661157024793e-07,
"logits/chosen": -0.049072265625,
"logits/rejected": -0.31640625,
"logps/chosen": -392.0,
"logps/rejected": -386.0,
"loss": 0.0727,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.4765625,
"rewards/margins": 12.6875,
"rewards/rejected": -14.1875,
"step": 1535
},
{
"epoch": 1.8846625766871166,
"grad_norm": 16.765850483219367,
"learning_rate": 7.512396694214875e-07,
"logits/chosen": -0.06298828125,
"logits/rejected": -0.248046875,
"logps/chosen": -478.0,
"logps/rejected": -468.0,
"loss": 0.0885,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.765625,
"rewards/margins": 12.6875,
"rewards/rejected": -14.4375,
"step": 1536
},
{
"epoch": 1.8858895705521472,
"grad_norm": 2.7485005320139124,
"learning_rate": 7.504132231404958e-07,
"logits/chosen": -0.1220703125,
"logits/rejected": -0.357421875,
"logps/chosen": -398.0,
"logps/rejected": -416.0,
"loss": 0.0087,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.671875,
"rewards/margins": 13.0625,
"rewards/rejected": -14.75,
"step": 1537
},
{
"epoch": 1.887116564417178,
"grad_norm": 12.602800676345558,
"learning_rate": 7.495867768595041e-07,
"logits/chosen": -0.10986328125,
"logits/rejected": -0.267578125,
"logps/chosen": -380.0,
"logps/rejected": -420.0,
"loss": 0.0314,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.0546875,
"rewards/margins": 13.375,
"rewards/rejected": -14.4375,
"step": 1538
},
{
"epoch": 1.8883435582822086,
"grad_norm": 3.5133244640890138,
"learning_rate": 7.487603305785124e-07,
"logits/chosen": -0.01611328125,
"logits/rejected": -0.251953125,
"logps/chosen": -398.0,
"logps/rejected": -416.0,
"loss": 0.0136,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.6875,
"rewards/margins": 12.4375,
"rewards/rejected": -14.125,
"step": 1539
},
{
"epoch": 1.8895705521472392,
"grad_norm": 7.119436687638344,
"learning_rate": 7.479338842975206e-07,
"logits/chosen": -0.3046875,
"logits/rejected": -0.4453125,
"logps/chosen": -454.0,
"logps/rejected": -490.0,
"loss": 0.0208,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.125,
"rewards/margins": 13.1875,
"rewards/rejected": -14.3125,
"step": 1540
},
{
"epoch": 1.89079754601227,
"grad_norm": 11.572169999605313,
"learning_rate": 7.471074380165289e-07,
"logits/chosen": -0.251953125,
"logits/rejected": -0.416015625,
"logps/chosen": -402.0,
"logps/rejected": -430.0,
"loss": 0.0563,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.6171875,
"rewards/margins": 12.5625,
"rewards/rejected": -14.1875,
"step": 1541
},
{
"epoch": 1.8920245398773006,
"grad_norm": 5.8629742402764595,
"learning_rate": 7.462809917355372e-07,
"logits/chosen": -0.2099609375,
"logits/rejected": -0.390625,
"logps/chosen": -420.0,
"logps/rejected": -432.0,
"loss": 0.0168,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.86328125,
"rewards/margins": 14.0625,
"rewards/rejected": -14.9375,
"step": 1542
},
{
"epoch": 1.8932515337423312,
"grad_norm": 5.281836941502651,
"learning_rate": 7.454545454545455e-07,
"logits/chosen": -0.205078125,
"logits/rejected": -0.375,
"logps/chosen": -396.0,
"logps/rejected": -420.0,
"loss": 0.018,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.4921875,
"rewards/margins": 13.3125,
"rewards/rejected": -14.8125,
"step": 1543
},
{
"epoch": 1.8944785276073621,
"grad_norm": 8.540563113484346,
"learning_rate": 7.446280991735538e-07,
"logits/chosen": -0.2578125,
"logits/rejected": -0.423828125,
"logps/chosen": -438.0,
"logps/rejected": -474.0,
"loss": 0.026,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.3828125,
"rewards/margins": 13.3125,
"rewards/rejected": -14.6875,
"step": 1544
},
{
"epoch": 1.8957055214723928,
"grad_norm": 12.375691683062389,
"learning_rate": 7.43801652892562e-07,
"logits/chosen": -0.1328125,
"logits/rejected": -0.345703125,
"logps/chosen": -412.0,
"logps/rejected": -384.0,
"loss": 0.049,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.171875,
"rewards/margins": 11.5625,
"rewards/rejected": -13.75,
"step": 1545
},
{
"epoch": 1.8969325153374235,
"grad_norm": 20.0893097112506,
"learning_rate": 7.429752066115703e-07,
"logits/chosen": -0.1767578125,
"logits/rejected": -0.357421875,
"logps/chosen": -394.0,
"logps/rejected": -398.0,
"loss": 0.0485,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.7734375,
"rewards/margins": 12.25,
"rewards/rejected": -14.0,
"step": 1546
},
{
"epoch": 1.8981595092024541,
"grad_norm": 10.335715206456626,
"learning_rate": 7.421487603305784e-07,
"logits/chosen": -0.162109375,
"logits/rejected": -0.5,
"logps/chosen": -508.0,
"logps/rejected": -440.0,
"loss": 0.0387,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.40625,
"rewards/margins": 13.5625,
"rewards/rejected": -14.9375,
"step": 1547
},
{
"epoch": 1.8993865030674848,
"grad_norm": 19.072960495868333,
"learning_rate": 7.413223140495867e-07,
"logits/chosen": -0.16796875,
"logits/rejected": -0.21484375,
"logps/chosen": -420.0,
"logps/rejected": -458.0,
"loss": 0.049,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.09375,
"rewards/margins": 12.75,
"rewards/rejected": -14.8125,
"step": 1548
},
{
"epoch": 1.9006134969325155,
"grad_norm": 6.11625064079758,
"learning_rate": 7.404958677685949e-07,
"logits/chosen": -0.054443359375,
"logits/rejected": -0.28125,
"logps/chosen": -406.0,
"logps/rejected": -398.0,
"loss": 0.025,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.8125,
"rewards/margins": 12.125,
"rewards/rejected": -13.9375,
"step": 1549
},
{
"epoch": 1.9018404907975461,
"grad_norm": 12.537023686920781,
"learning_rate": 7.396694214876032e-07,
"logits/chosen": -0.201171875,
"logits/rejected": -0.3046875,
"logps/chosen": -412.0,
"logps/rejected": -422.0,
"loss": 0.044,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.78125,
"rewards/margins": 13.375,
"rewards/rejected": -15.1875,
"step": 1550
},
{
"epoch": 1.9030674846625768,
"grad_norm": 10.772519895679293,
"learning_rate": 7.388429752066115e-07,
"logits/chosen": -0.21875,
"logits/rejected": -0.435546875,
"logps/chosen": -450.0,
"logps/rejected": -438.0,
"loss": 0.0351,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.03125,
"rewards/margins": 11.9375,
"rewards/rejected": -13.9375,
"step": 1551
},
{
"epoch": 1.9042944785276075,
"grad_norm": 12.666754566617103,
"learning_rate": 7.380165289256198e-07,
"logits/chosen": -0.1396484375,
"logits/rejected": -0.271484375,
"logps/chosen": -376.0,
"logps/rejected": -388.0,
"loss": 0.0577,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.984375,
"rewards/margins": 11.0,
"rewards/rejected": -13.0,
"step": 1552
},
{
"epoch": 1.9055214723926381,
"grad_norm": 6.969793207195761,
"learning_rate": 7.371900826446281e-07,
"logits/chosen": -0.07861328125,
"logits/rejected": -0.205078125,
"logps/chosen": -408.0,
"logps/rejected": -382.0,
"loss": 0.0193,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.7421875,
"rewards/margins": 12.25,
"rewards/rejected": -14.0,
"step": 1553
},
{
"epoch": 1.9067484662576688,
"grad_norm": 11.935809288218362,
"learning_rate": 7.363636363636363e-07,
"logits/chosen": -0.296875,
"logits/rejected": -0.5546875,
"logps/chosen": -440.0,
"logps/rejected": -424.0,
"loss": 0.0325,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.3828125,
"rewards/margins": 12.5,
"rewards/rejected": -13.9375,
"step": 1554
},
{
"epoch": 1.9079754601226995,
"grad_norm": 10.547646827650535,
"learning_rate": 7.355371900826446e-07,
"logits/chosen": -0.310546875,
"logits/rejected": -0.322265625,
"logps/chosen": -404.0,
"logps/rejected": -436.0,
"loss": 0.0324,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.7890625,
"rewards/margins": 12.5,
"rewards/rejected": -14.3125,
"step": 1555
},
{
"epoch": 1.9092024539877301,
"grad_norm": 5.626132483362647,
"learning_rate": 7.347107438016529e-07,
"logits/chosen": -0.10595703125,
"logits/rejected": -0.34375,
"logps/chosen": -426.0,
"logps/rejected": -416.0,
"loss": 0.0202,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.40625,
"rewards/margins": 12.4375,
"rewards/rejected": -13.8125,
"step": 1556
},
{
"epoch": 1.9104294478527608,
"grad_norm": 12.406478226571439,
"learning_rate": 7.338842975206612e-07,
"logits/chosen": -0.013916015625,
"logits/rejected": -0.2734375,
"logps/chosen": -422.0,
"logps/rejected": -438.0,
"loss": 0.0522,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.7734375,
"rewards/margins": 11.75,
"rewards/rejected": -13.5625,
"step": 1557
},
{
"epoch": 1.9116564417177915,
"grad_norm": 13.715039413680758,
"learning_rate": 7.330578512396694e-07,
"logits/chosen": -0.1884765625,
"logits/rejected": -0.349609375,
"logps/chosen": -406.0,
"logps/rejected": -454.0,
"loss": 0.0292,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.91015625,
"rewards/margins": 13.3125,
"rewards/rejected": -14.25,
"step": 1558
},
{
"epoch": 1.9128834355828221,
"grad_norm": 8.338422782672891,
"learning_rate": 7.322314049586777e-07,
"logits/chosen": -0.032958984375,
"logits/rejected": -0.12890625,
"logps/chosen": -414.0,
"logps/rejected": -380.0,
"loss": 0.0317,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.9765625,
"rewards/margins": 11.8125,
"rewards/rejected": -13.75,
"step": 1559
},
{
"epoch": 1.9141104294478528,
"grad_norm": 12.074418171132558,
"learning_rate": 7.31404958677686e-07,
"logits/chosen": -0.10107421875,
"logits/rejected": -0.298828125,
"logps/chosen": -390.0,
"logps/rejected": -392.0,
"loss": 0.0541,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.421875,
"rewards/margins": 11.9375,
"rewards/rejected": -14.375,
"step": 1560
},
{
"epoch": 1.9153374233128835,
"grad_norm": 15.37715368474599,
"learning_rate": 7.305785123966942e-07,
"logits/chosen": -0.2001953125,
"logits/rejected": -0.478515625,
"logps/chosen": -470.0,
"logps/rejected": -434.0,
"loss": 0.0633,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.7734375,
"rewards/margins": 13.75,
"rewards/rejected": -14.5625,
"step": 1561
},
{
"epoch": 1.9165644171779141,
"grad_norm": 11.339393590564708,
"learning_rate": 7.297520661157024e-07,
"logits/chosen": -0.2197265625,
"logits/rejected": -0.435546875,
"logps/chosen": -452.0,
"logps/rejected": -436.0,
"loss": 0.0274,
"rewards/accuracies": 0.9921875,
"rewards/chosen": 0.026611328125,
"rewards/margins": 13.4375,
"rewards/rejected": -13.375,
"step": 1562
},
{
"epoch": 1.9177914110429448,
"grad_norm": 7.792629495875165,
"learning_rate": 7.289256198347107e-07,
"logits/chosen": -0.1796875,
"logits/rejected": -0.41796875,
"logps/chosen": -418.0,
"logps/rejected": -426.0,
"loss": 0.0375,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.65234375,
"rewards/margins": 13.5,
"rewards/rejected": -14.125,
"step": 1563
},
{
"epoch": 1.9190184049079755,
"grad_norm": 2.6371817425478614,
"learning_rate": 7.28099173553719e-07,
"logits/chosen": -0.1748046875,
"logits/rejected": -0.3671875,
"logps/chosen": -402.0,
"logps/rejected": -424.0,
"loss": 0.0088,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.5546875,
"rewards/margins": 11.875,
"rewards/rejected": -13.4375,
"step": 1564
},
{
"epoch": 1.9202453987730062,
"grad_norm": 6.0361304321411495,
"learning_rate": 7.272727272727272e-07,
"logits/chosen": -0.306640625,
"logits/rejected": -0.50390625,
"logps/chosen": -334.0,
"logps/rejected": -368.0,
"loss": 0.0248,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.71875,
"rewards/margins": 13.5625,
"rewards/rejected": -14.25,
"step": 1565
},
{
"epoch": 1.9214723926380368,
"grad_norm": 15.99984528178758,
"learning_rate": 7.264462809917355e-07,
"logits/chosen": -0.138671875,
"logits/rejected": -0.28125,
"logps/chosen": -422.0,
"logps/rejected": -446.0,
"loss": 0.0693,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.65234375,
"rewards/margins": 13.125,
"rewards/rejected": -13.8125,
"step": 1566
},
{
"epoch": 1.9226993865030675,
"grad_norm": 12.13372536905135,
"learning_rate": 7.256198347107437e-07,
"logits/chosen": -0.16796875,
"logits/rejected": -0.32421875,
"logps/chosen": -392.0,
"logps/rejected": -410.0,
"loss": 0.0462,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.3125,
"rewards/margins": 12.75,
"rewards/rejected": -14.0625,
"step": 1567
},
{
"epoch": 1.9239263803680982,
"grad_norm": 14.209951191797739,
"learning_rate": 7.24793388429752e-07,
"logits/chosen": -0.12158203125,
"logits/rejected": -0.353515625,
"logps/chosen": -410.0,
"logps/rejected": -428.0,
"loss": 0.0532,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.5625,
"rewards/margins": 13.125,
"rewards/rejected": -13.6875,
"step": 1568
},
{
"epoch": 1.9251533742331288,
"grad_norm": 7.04354544652744,
"learning_rate": 7.239669421487603e-07,
"logits/chosen": 0.001983642578125,
"logits/rejected": -0.1484375,
"logps/chosen": -408.0,
"logps/rejected": -398.0,
"loss": 0.0136,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.484375,
"rewards/margins": 13.125,
"rewards/rejected": -14.5625,
"step": 1569
},
{
"epoch": 1.9263803680981595,
"grad_norm": 5.304297061872547,
"learning_rate": 7.231404958677686e-07,
"logits/chosen": -0.1357421875,
"logits/rejected": -0.369140625,
"logps/chosen": -400.0,
"logps/rejected": -412.0,
"loss": 0.0251,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.640625,
"rewards/margins": 12.0625,
"rewards/rejected": -13.75,
"step": 1570
},
{
"epoch": 1.9276073619631902,
"grad_norm": 10.278636413268362,
"learning_rate": 7.223140495867768e-07,
"logits/chosen": -0.1689453125,
"logits/rejected": -0.326171875,
"logps/chosen": -444.0,
"logps/rejected": -458.0,
"loss": 0.0537,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.2109375,
"rewards/margins": 13.125,
"rewards/rejected": -14.3125,
"step": 1571
},
{
"epoch": 1.9288343558282208,
"grad_norm": 4.917396618428534,
"learning_rate": 7.214876033057851e-07,
"logits/chosen": -0.216796875,
"logits/rejected": -0.4296875,
"logps/chosen": -428.0,
"logps/rejected": -430.0,
"loss": 0.0102,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.15625,
"rewards/margins": 13.8125,
"rewards/rejected": -14.9375,
"step": 1572
},
{
"epoch": 1.9300613496932515,
"grad_norm": 11.131774953589117,
"learning_rate": 7.206611570247934e-07,
"logits/chosen": -0.205078125,
"logits/rejected": -0.341796875,
"logps/chosen": -422.0,
"logps/rejected": -424.0,
"loss": 0.0476,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.390625,
"rewards/margins": 12.125,
"rewards/rejected": -14.5,
"step": 1573
},
{
"epoch": 1.9312883435582822,
"grad_norm": 9.981916907725461,
"learning_rate": 7.198347107438016e-07,
"logits/chosen": -0.06396484375,
"logits/rejected": -0.2021484375,
"logps/chosen": -386.0,
"logps/rejected": -432.0,
"loss": 0.0321,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.03125,
"rewards/margins": 11.9375,
"rewards/rejected": -13.9375,
"step": 1574
},
{
"epoch": 1.9325153374233128,
"grad_norm": 14.02643231888889,
"learning_rate": 7.190082644628099e-07,
"logits/chosen": -0.197265625,
"logits/rejected": -0.33984375,
"logps/chosen": -416.0,
"logps/rejected": -408.0,
"loss": 0.0729,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.28125,
"rewards/margins": 13.0,
"rewards/rejected": -14.3125,
"step": 1575
},
{
"epoch": 1.9337423312883435,
"grad_norm": 13.206619390046587,
"learning_rate": 7.181818181818181e-07,
"logits/chosen": -0.1962890625,
"logits/rejected": -0.416015625,
"logps/chosen": -396.0,
"logps/rejected": -414.0,
"loss": 0.0351,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.515625,
"rewards/margins": 12.75,
"rewards/rejected": -15.25,
"step": 1576
},
{
"epoch": 1.9349693251533742,
"grad_norm": 8.628626362271302,
"learning_rate": 7.173553719008264e-07,
"logits/chosen": -0.14453125,
"logits/rejected": -0.337890625,
"logps/chosen": -406.0,
"logps/rejected": -378.0,
"loss": 0.0292,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.87890625,
"rewards/margins": 13.875,
"rewards/rejected": -14.75,
"step": 1577
},
{
"epoch": 1.9361963190184048,
"grad_norm": 9.252275671498813,
"learning_rate": 7.165289256198347e-07,
"logits/chosen": -0.1669921875,
"logits/rejected": -0.341796875,
"logps/chosen": -400.0,
"logps/rejected": -454.0,
"loss": 0.0358,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.84375,
"rewards/margins": 13.875,
"rewards/rejected": -15.75,
"step": 1578
},
{
"epoch": 1.9374233128834355,
"grad_norm": 10.574155078620965,
"learning_rate": 7.15702479338843e-07,
"logits/chosen": -0.193359375,
"logits/rejected": -0.3046875,
"logps/chosen": -404.0,
"logps/rejected": -420.0,
"loss": 0.0284,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.7890625,
"rewards/margins": 13.5,
"rewards/rejected": -15.25,
"step": 1579
},
{
"epoch": 1.9386503067484662,
"grad_norm": 10.432760638611116,
"learning_rate": 7.148760330578512e-07,
"logits/chosen": -0.1953125,
"logits/rejected": -0.42578125,
"logps/chosen": -462.0,
"logps/rejected": -450.0,
"loss": 0.0281,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1484375,
"rewards/margins": 13.8125,
"rewards/rejected": -15.0,
"step": 1580
},
{
"epoch": 1.9398773006134968,
"grad_norm": 6.639958720647097,
"learning_rate": 7.140495867768595e-07,
"logits/chosen": -0.146484375,
"logits/rejected": -0.3046875,
"logps/chosen": -438.0,
"logps/rejected": -444.0,
"loss": 0.0185,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.5,
"rewards/margins": 13.6875,
"rewards/rejected": -15.1875,
"step": 1581
},
{
"epoch": 1.9411042944785275,
"grad_norm": 6.827592238478363,
"learning_rate": 7.132231404958677e-07,
"logits/chosen": -0.076171875,
"logits/rejected": -0.197265625,
"logps/chosen": -354.0,
"logps/rejected": -388.0,
"loss": 0.0374,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.53125,
"rewards/margins": 12.25,
"rewards/rejected": -14.8125,
"step": 1582
},
{
"epoch": 1.9423312883435582,
"grad_norm": 12.802796544727078,
"learning_rate": 7.12396694214876e-07,
"logits/chosen": -0.1689453125,
"logits/rejected": -0.349609375,
"logps/chosen": -438.0,
"logps/rejected": -434.0,
"loss": 0.0566,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.1640625,
"rewards/margins": 13.625,
"rewards/rejected": -14.8125,
"step": 1583
},
{
"epoch": 1.9435582822085888,
"grad_norm": 19.067684481237826,
"learning_rate": 7.115702479338843e-07,
"logits/chosen": -0.1298828125,
"logits/rejected": -0.32421875,
"logps/chosen": -460.0,
"logps/rejected": -430.0,
"loss": 0.0965,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.09375,
"rewards/margins": 12.25,
"rewards/rejected": -14.3125,
"step": 1584
},
{
"epoch": 1.9447852760736195,
"grad_norm": 16.97072434557295,
"learning_rate": 7.107438016528925e-07,
"logits/chosen": -0.2294921875,
"logits/rejected": -0.376953125,
"logps/chosen": -438.0,
"logps/rejected": -466.0,
"loss": 0.052,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1796875,
"rewards/margins": 14.4375,
"rewards/rejected": -15.625,
"step": 1585
},
{
"epoch": 1.9460122699386502,
"grad_norm": 9.852918729623598,
"learning_rate": 7.099173553719008e-07,
"logits/chosen": -0.2421875,
"logits/rejected": -0.427734375,
"logps/chosen": -428.0,
"logps/rejected": -418.0,
"loss": 0.0417,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -2.21875,
"rewards/margins": 11.9375,
"rewards/rejected": -14.1875,
"step": 1586
},
{
"epoch": 1.9472392638036808,
"grad_norm": 11.168636850358272,
"learning_rate": 7.09090909090909e-07,
"logits/chosen": -0.2138671875,
"logits/rejected": -0.40234375,
"logps/chosen": -380.0,
"logps/rejected": -402.0,
"loss": 0.0534,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.3125,
"rewards/margins": 12.4375,
"rewards/rejected": -14.75,
"step": 1587
},
{
"epoch": 1.9484662576687115,
"grad_norm": 10.29993753533456,
"learning_rate": 7.082644628099173e-07,
"logits/chosen": -0.142578125,
"logits/rejected": -0.318359375,
"logps/chosen": -398.0,
"logps/rejected": -410.0,
"loss": 0.0343,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.03125,
"rewards/margins": 12.25,
"rewards/rejected": -14.25,
"step": 1588
},
{
"epoch": 1.9496932515337422,
"grad_norm": 14.223154222626455,
"learning_rate": 7.074380165289255e-07,
"logits/chosen": -0.2197265625,
"logits/rejected": -0.392578125,
"logps/chosen": -384.0,
"logps/rejected": -422.0,
"loss": 0.0477,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.015625,
"rewards/margins": 13.625,
"rewards/rejected": -15.625,
"step": 1589
},
{
"epoch": 1.9509202453987728,
"grad_norm": 12.453079518633523,
"learning_rate": 7.066115702479338e-07,
"logits/chosen": -0.1435546875,
"logits/rejected": -0.287109375,
"logps/chosen": -422.0,
"logps/rejected": -454.0,
"loss": 0.0335,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.9140625,
"rewards/margins": 13.375,
"rewards/rejected": -15.3125,
"step": 1590
},
{
"epoch": 1.9521472392638037,
"grad_norm": 7.8773680278995375,
"learning_rate": 7.057851239669421e-07,
"logits/chosen": -0.23046875,
"logits/rejected": -0.384765625,
"logps/chosen": -386.0,
"logps/rejected": -406.0,
"loss": 0.0171,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.109375,
"rewards/margins": 13.5,
"rewards/rejected": -15.625,
"step": 1591
},
{
"epoch": 1.9533742331288344,
"grad_norm": 16.735680592899843,
"learning_rate": 7.049586776859504e-07,
"logits/chosen": -0.11962890625,
"logits/rejected": -0.265625,
"logps/chosen": -402.0,
"logps/rejected": -434.0,
"loss": 0.0631,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.875,
"rewards/margins": 12.375,
"rewards/rejected": -15.25,
"step": 1592
},
{
"epoch": 1.954601226993865,
"grad_norm": 21.980643477359607,
"learning_rate": 7.041322314049587e-07,
"logits/chosen": -0.154296875,
"logits/rejected": -0.3125,
"logps/chosen": -428.0,
"logps/rejected": -432.0,
"loss": 0.1011,
"rewards/accuracies": 0.9453125,
"rewards/chosen": -2.828125,
"rewards/margins": 12.9375,
"rewards/rejected": -15.75,
"step": 1593
},
{
"epoch": 1.9558282208588957,
"grad_norm": 12.924426395398994,
"learning_rate": 7.033057851239669e-07,
"logits/chosen": -0.2373046875,
"logits/rejected": -0.3984375,
"logps/chosen": -350.0,
"logps/rejected": -372.0,
"loss": 0.0722,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.9296875,
"rewards/margins": 12.25,
"rewards/rejected": -14.1875,
"step": 1594
},
{
"epoch": 1.9570552147239264,
"grad_norm": 25.619194490819055,
"learning_rate": 7.024793388429752e-07,
"logits/chosen": -0.1875,
"logits/rejected": -0.265625,
"logps/chosen": -404.0,
"logps/rejected": -442.0,
"loss": 0.105,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -3.0625,
"rewards/margins": 13.4375,
"rewards/rejected": -16.5,
"step": 1595
},
{
"epoch": 1.958282208588957,
"grad_norm": 4.199255846633373,
"learning_rate": 7.016528925619835e-07,
"logits/chosen": -0.251953125,
"logits/rejected": -0.30859375,
"logps/chosen": -384.0,
"logps/rejected": -402.0,
"loss": 0.0148,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.671875,
"rewards/margins": 12.875,
"rewards/rejected": -15.5625,
"step": 1596
},
{
"epoch": 1.9595092024539877,
"grad_norm": 8.538199632867174,
"learning_rate": 7.008264462809918e-07,
"logits/chosen": -0.15234375,
"logits/rejected": -0.369140625,
"logps/chosen": -422.0,
"logps/rejected": -428.0,
"loss": 0.026,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.234375,
"rewards/margins": 13.875,
"rewards/rejected": -16.125,
"step": 1597
},
{
"epoch": 1.9607361963190184,
"grad_norm": 16.765528483594718,
"learning_rate": 7e-07,
"logits/chosen": -0.25,
"logits/rejected": -0.3359375,
"logps/chosen": -416.0,
"logps/rejected": -462.0,
"loss": 0.0658,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -3.0,
"rewards/margins": 12.75,
"rewards/rejected": -15.75,
"step": 1598
},
{
"epoch": 1.961963190184049,
"grad_norm": 2.073937713879576,
"learning_rate": 6.991735537190083e-07,
"logits/chosen": -0.15234375,
"logits/rejected": -0.3984375,
"logps/chosen": -420.0,
"logps/rejected": -418.0,
"loss": 0.0091,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.078125,
"rewards/margins": 13.125,
"rewards/rejected": -15.25,
"step": 1599
},
{
"epoch": 1.9631901840490797,
"grad_norm": 10.932012179083754,
"learning_rate": 6.983471074380165e-07,
"logits/chosen": -0.09814453125,
"logits/rejected": -0.275390625,
"logps/chosen": -436.0,
"logps/rejected": -442.0,
"loss": 0.0356,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.578125,
"rewards/margins": 12.75,
"rewards/rejected": -15.3125,
"step": 1600
},
{
"epoch": 1.9644171779141104,
"grad_norm": 7.649583715313472,
"learning_rate": 6.975206611570247e-07,
"logits/chosen": -0.0703125,
"logits/rejected": -0.177734375,
"logps/chosen": -370.0,
"logps/rejected": -402.0,
"loss": 0.0324,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.21875,
"rewards/margins": 11.4375,
"rewards/rejected": -14.625,
"step": 1601
},
{
"epoch": 1.965644171779141,
"grad_norm": 15.179814031877818,
"learning_rate": 6.96694214876033e-07,
"logits/chosen": -0.15234375,
"logits/rejected": -0.37109375,
"logps/chosen": -462.0,
"logps/rejected": -408.0,
"loss": 0.047,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.703125,
"rewards/margins": 13.0625,
"rewards/rejected": -14.75,
"step": 1602
},
{
"epoch": 1.9668711656441717,
"grad_norm": 11.446886140775492,
"learning_rate": 6.958677685950412e-07,
"logits/chosen": -0.17578125,
"logits/rejected": -0.373046875,
"logps/chosen": -492.0,
"logps/rejected": -462.0,
"loss": 0.0524,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.265625,
"rewards/margins": 13.75,
"rewards/rejected": -16.0,
"step": 1603
},
{
"epoch": 1.9680981595092024,
"grad_norm": 12.440414697811256,
"learning_rate": 6.950413223140495e-07,
"logits/chosen": -0.11669921875,
"logits/rejected": -0.30859375,
"logps/chosen": -412.0,
"logps/rejected": -420.0,
"loss": 0.0437,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.9140625,
"rewards/margins": 12.1875,
"rewards/rejected": -14.0625,
"step": 1604
},
{
"epoch": 1.969325153374233,
"grad_norm": 10.105467224707297,
"learning_rate": 6.942148760330578e-07,
"logits/chosen": -0.1083984375,
"logits/rejected": -0.26171875,
"logps/chosen": -454.0,
"logps/rejected": -468.0,
"loss": 0.0453,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.90625,
"rewards/margins": 12.625,
"rewards/rejected": -15.5,
"step": 1605
},
{
"epoch": 1.9705521472392638,
"grad_norm": 12.75530347235316,
"learning_rate": 6.933884297520661e-07,
"logits/chosen": -0.2314453125,
"logits/rejected": -0.455078125,
"logps/chosen": -434.0,
"logps/rejected": -458.0,
"loss": 0.0542,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.5078125,
"rewards/margins": 13.0,
"rewards/rejected": -14.5,
"step": 1606
},
{
"epoch": 1.9717791411042946,
"grad_norm": 7.46884420785602,
"learning_rate": 6.925619834710743e-07,
"logits/chosen": -0.1826171875,
"logits/rejected": -0.42578125,
"logps/chosen": -400.0,
"logps/rejected": -392.0,
"loss": 0.0214,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.5,
"rewards/margins": 13.1875,
"rewards/rejected": -14.6875,
"step": 1607
},
{
"epoch": 1.9730061349693253,
"grad_norm": 15.399212590445346,
"learning_rate": 6.917355371900826e-07,
"logits/chosen": -0.19140625,
"logits/rejected": -0.39453125,
"logps/chosen": -408.0,
"logps/rejected": -436.0,
"loss": 0.053,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.4375,
"rewards/margins": 13.3125,
"rewards/rejected": -14.75,
"step": 1608
},
{
"epoch": 1.974233128834356,
"grad_norm": 11.856025547749626,
"learning_rate": 6.909090909090909e-07,
"logits/chosen": -0.19140625,
"logits/rejected": -0.3359375,
"logps/chosen": -394.0,
"logps/rejected": -422.0,
"loss": 0.0488,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -2.046875,
"rewards/margins": 12.9375,
"rewards/rejected": -15.0,
"step": 1609
},
{
"epoch": 1.9754601226993866,
"grad_norm": 12.703840358172142,
"learning_rate": 6.900826446280992e-07,
"logits/chosen": -0.2353515625,
"logits/rejected": -0.333984375,
"logps/chosen": -378.0,
"logps/rejected": -384.0,
"loss": 0.0493,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -1.34375,
"rewards/margins": 12.875,
"rewards/rejected": -14.1875,
"step": 1610
},
{
"epoch": 1.9766871165644173,
"grad_norm": 13.998285839343135,
"learning_rate": 6.892561983471074e-07,
"logits/chosen": -0.1064453125,
"logits/rejected": -0.2431640625,
"logps/chosen": -352.0,
"logps/rejected": -372.0,
"loss": 0.0667,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -3.078125,
"rewards/margins": 11.25,
"rewards/rejected": -14.3125,
"step": 1611
},
{
"epoch": 1.977914110429448,
"grad_norm": 18.438784360262748,
"learning_rate": 6.884297520661157e-07,
"logits/chosen": -0.08642578125,
"logits/rejected": -0.291015625,
"logps/chosen": -454.0,
"logps/rejected": -486.0,
"loss": 0.0785,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -1.3203125,
"rewards/margins": 13.375,
"rewards/rejected": -14.6875,
"step": 1612
},
{
"epoch": 1.9791411042944786,
"grad_norm": 3.4851659010385676,
"learning_rate": 6.87603305785124e-07,
"logits/chosen": -0.0615234375,
"logits/rejected": -0.2333984375,
"logps/chosen": -460.0,
"logps/rejected": -446.0,
"loss": 0.0112,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.7109375,
"rewards/margins": 14.0625,
"rewards/rejected": -15.75,
"step": 1613
},
{
"epoch": 1.9803680981595093,
"grad_norm": 12.606281125983013,
"learning_rate": 6.867768595041323e-07,
"logits/chosen": -0.267578125,
"logits/rejected": -0.48828125,
"logps/chosen": -452.0,
"logps/rejected": -454.0,
"loss": 0.0668,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.46875,
"rewards/margins": 13.625,
"rewards/rejected": -15.0625,
"step": 1614
},
{
"epoch": 1.98159509202454,
"grad_norm": 9.90525420849227,
"learning_rate": 6.859504132231405e-07,
"logits/chosen": -0.291015625,
"logits/rejected": -0.392578125,
"logps/chosen": -390.0,
"logps/rejected": -434.0,
"loss": 0.0476,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.3359375,
"rewards/margins": 13.4375,
"rewards/rejected": -14.75,
"step": 1615
},
{
"epoch": 1.9828220858895707,
"grad_norm": 15.81916128621746,
"learning_rate": 6.851239669421487e-07,
"logits/chosen": -0.099609375,
"logits/rejected": -0.263671875,
"logps/chosen": -372.0,
"logps/rejected": -374.0,
"loss": 0.075,
"rewards/accuracies": 0.9609375,
"rewards/chosen": -2.28125,
"rewards/margins": 12.125,
"rewards/rejected": -14.4375,
"step": 1616
},
{
"epoch": 1.9840490797546013,
"grad_norm": 8.150805055881774,
"learning_rate": 6.84297520661157e-07,
"logits/chosen": -0.040283203125,
"logits/rejected": -0.228515625,
"logps/chosen": -382.0,
"logps/rejected": -404.0,
"loss": 0.0354,
"rewards/accuracies": 0.984375,
"rewards/chosen": -2.140625,
"rewards/margins": 12.0625,
"rewards/rejected": -14.1875,
"step": 1617
},
{
"epoch": 1.985276073619632,
"grad_norm": 13.151183898630745,
"learning_rate": 6.834710743801652e-07,
"logits/chosen": -0.2138671875,
"logits/rejected": -0.333984375,
"logps/chosen": -388.0,
"logps/rejected": -410.0,
"loss": 0.027,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.6484375,
"rewards/margins": 13.1875,
"rewards/rejected": -14.875,
"step": 1618
},
{
"epoch": 1.9865030674846627,
"grad_norm": 7.977242068564573,
"learning_rate": 6.826446280991735e-07,
"logits/chosen": -0.23046875,
"logits/rejected": -0.388671875,
"logps/chosen": -434.0,
"logps/rejected": -414.0,
"loss": 0.0314,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.8515625,
"rewards/margins": 12.5625,
"rewards/rejected": -14.4375,
"step": 1619
},
{
"epoch": 1.9877300613496933,
"grad_norm": 7.717132929367279,
"learning_rate": 6.818181818181817e-07,
"logits/chosen": -0.134765625,
"logits/rejected": -0.322265625,
"logps/chosen": -388.0,
"logps/rejected": -394.0,
"loss": 0.0255,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.28125,
"rewards/margins": 12.3125,
"rewards/rejected": -13.625,
"step": 1620
},
{
"epoch": 1.988957055214724,
"grad_norm": 12.277942790500736,
"learning_rate": 6.8099173553719e-07,
"logits/chosen": -0.1064453125,
"logits/rejected": -0.232421875,
"logps/chosen": -424.0,
"logps/rejected": -446.0,
"loss": 0.0384,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.171875,
"rewards/margins": 13.375,
"rewards/rejected": -14.5625,
"step": 1621
},
{
"epoch": 1.9901840490797547,
"grad_norm": 13.789540960182217,
"learning_rate": 6.801652892561983e-07,
"logits/chosen": -0.3671875,
"logits/rejected": -0.4921875,
"logps/chosen": -424.0,
"logps/rejected": -464.0,
"loss": 0.0493,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.7265625,
"rewards/margins": 12.4375,
"rewards/rejected": -14.1875,
"step": 1622
},
{
"epoch": 1.9914110429447853,
"grad_norm": 11.784412601953619,
"learning_rate": 6.793388429752066e-07,
"logits/chosen": -0.08349609375,
"logits/rejected": -0.29296875,
"logps/chosen": -414.0,
"logps/rejected": -422.0,
"loss": 0.039,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.6953125,
"rewards/margins": 13.25,
"rewards/rejected": -13.9375,
"step": 1623
},
{
"epoch": 1.992638036809816,
"grad_norm": 9.375105242990639,
"learning_rate": 6.785123966942149e-07,
"logits/chosen": -0.189453125,
"logits/rejected": -0.451171875,
"logps/chosen": -392.0,
"logps/rejected": -412.0,
"loss": 0.0233,
"rewards/accuracies": 0.9921875,
"rewards/chosen": -0.82421875,
"rewards/margins": 13.0625,
"rewards/rejected": -13.875,
"step": 1624
},
{
"epoch": 1.9938650306748467,
"grad_norm": 19.779116155549996,
"learning_rate": 6.776859504132231e-07,
"logits/chosen": -0.033447265625,
"logits/rejected": -0.2470703125,
"logps/chosen": -456.0,
"logps/rejected": -432.0,
"loss": 0.094,
"rewards/accuracies": 0.984375,
"rewards/chosen": -0.765625,
"rewards/margins": 13.3125,
"rewards/rejected": -14.0625,
"step": 1625
},
{
"epoch": 1.9950920245398773,
"grad_norm": 15.56250197673987,
"learning_rate": 6.768595041322314e-07,
"logits/chosen": -0.1533203125,
"logits/rejected": -0.259765625,
"logps/chosen": -450.0,
"logps/rejected": -448.0,
"loss": 0.0473,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.4296875,
"rewards/margins": 12.4375,
"rewards/rejected": -13.875,
"step": 1626
},
{
"epoch": 1.996319018404908,
"grad_norm": 10.271607340994601,
"learning_rate": 6.760330578512397e-07,
"logits/chosen": -0.224609375,
"logits/rejected": -0.33203125,
"logps/chosen": -386.0,
"logps/rejected": -390.0,
"loss": 0.0421,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -0.94140625,
"rewards/margins": 12.9375,
"rewards/rejected": -13.875,
"step": 1627
},
{
"epoch": 1.9975460122699387,
"grad_norm": 10.638643766191663,
"learning_rate": 6.75206611570248e-07,
"logits/chosen": -0.1572265625,
"logits/rejected": -0.287109375,
"logps/chosen": -386.0,
"logps/rejected": -430.0,
"loss": 0.0438,
"rewards/accuracies": 0.984375,
"rewards/chosen": -1.1640625,
"rewards/margins": 13.125,
"rewards/rejected": -14.3125,
"step": 1628
},
{
"epoch": 1.9987730061349693,
"grad_norm": 13.333208390753416,
"learning_rate": 6.743801652892561e-07,
"logits/chosen": -0.04248046875,
"logits/rejected": -0.2041015625,
"logps/chosen": -414.0,
"logps/rejected": -432.0,
"loss": 0.0573,
"rewards/accuracies": 0.9765625,
"rewards/chosen": -1.7421875,
"rewards/margins": 12.3125,
"rewards/rejected": -14.0625,
"step": 1629
},
{
"epoch": 2.0,
"grad_norm": 12.464295436509438,
"learning_rate": 6.735537190082644e-07,
"logits/chosen": -0.154296875,
"logits/rejected": -0.328125,
"logps/chosen": -442.0,
"logps/rejected": -446.0,
"loss": 0.0462,
"rewards/accuracies": 0.9747899770736694,
"rewards/chosen": -1.203125,
"rewards/margins": 13.6875,
"rewards/rejected": -14.9375,
"step": 1630
}
],
"logging_steps": 1,
"max_steps": 2445,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}