{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 815, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.001226993865030675, "grad_norm": 151.42932274482283, "learning_rate": 3.2e-08, "logits/chosen": -0.32421875, "logits/rejected": -0.515625, "logps/chosen": -474.0, "logps/rejected": -316.0, "loss": 0.6914, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1 }, { "epoch": 0.00245398773006135, "grad_norm": 162.73344539002164, "learning_rate": 6.4e-08, "logits/chosen": -0.22265625, "logits/rejected": -0.439453125, "logps/chosen": -436.0, "logps/rejected": -292.0, "loss": 0.6914, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2 }, { "epoch": 0.0036809815950920245, "grad_norm": 111.8042794987884, "learning_rate": 9.599999999999999e-08, "logits/chosen": -0.12890625, "logits/rejected": -0.255859375, "logps/chosen": -368.0, "logps/rejected": -272.0, "loss": 0.6886, "rewards/accuracies": 0.3046875, "rewards/chosen": 0.01531982421875, "rewards/margins": 0.01361083984375, "rewards/rejected": 0.0016632080078125, "step": 3 }, { "epoch": 0.0049079754601227, "grad_norm": 155.41451533543852, "learning_rate": 1.28e-07, "logits/chosen": -0.166015625, "logits/rejected": -0.326171875, "logps/chosen": -422.0, "logps/rejected": -242.0, "loss": 0.7131, "rewards/accuracies": 0.328125, "rewards/chosen": -0.00408935546875, "rewards/margins": -0.0218505859375, "rewards/rejected": 0.017822265625, "step": 4 }, { "epoch": 0.006134969325153374, "grad_norm": 307.019899938903, "learning_rate": 1.6e-07, "logits/chosen": -0.1845703125, "logits/rejected": -0.326171875, "logps/chosen": -380.0, "logps/rejected": -270.0, "loss": 0.6906, "rewards/accuracies": 0.3515625, "rewards/chosen": 0.01171875, "rewards/margins": 0.01251220703125, "rewards/rejected": -0.00078582763671875, "step": 5 }, { "epoch": 0.007361963190184049, "grad_norm": 340.66722515261114, "learning_rate": 1.9199999999999997e-07, "logits/chosen": -0.2578125, "logits/rejected": -0.345703125, "logps/chosen": -412.0, "logps/rejected": -306.0, "loss": 0.7151, "rewards/accuracies": 0.25, "rewards/chosen": -0.0228271484375, "rewards/margins": -0.034912109375, "rewards/rejected": 0.01220703125, "step": 6 }, { "epoch": 0.008588957055214725, "grad_norm": 239.24556126143491, "learning_rate": 2.2400000000000002e-07, "logits/chosen": -0.2060546875, "logits/rejected": -0.38671875, "logps/chosen": -378.0, "logps/rejected": -266.0, "loss": 0.7032, "rewards/accuracies": 0.2734375, "rewards/chosen": -0.0003414154052734375, "rewards/margins": -0.01373291015625, "rewards/rejected": 0.01336669921875, "step": 7 }, { "epoch": 0.0098159509202454, "grad_norm": 139.49365426176607, "learning_rate": 2.56e-07, "logits/chosen": -0.1142578125, "logits/rejected": -0.322265625, "logps/chosen": -432.0, "logps/rejected": -292.0, "loss": 0.7012, "rewards/accuracies": 0.3671875, "rewards/chosen": 0.0284423828125, "rewards/margins": -0.00927734375, "rewards/rejected": 0.037841796875, "step": 8 }, { "epoch": 0.011042944785276074, "grad_norm": 122.82829055069632, "learning_rate": 2.88e-07, "logits/chosen": -0.1328125, "logits/rejected": -0.359375, "logps/chosen": -402.0, "logps/rejected": -294.0, "loss": 0.6871, "rewards/accuracies": 0.375, "rewards/chosen": 0.037353515625, "rewards/margins": 0.0244140625, "rewards/rejected": 0.01300048828125, "step": 9 }, { "epoch": 0.012269938650306749, "grad_norm": 137.4984961934261, "learning_rate": 3.2e-07, "logits/chosen": -0.1982421875, "logits/rejected": -0.3515625, "logps/chosen": -402.0, "logps/rejected": -278.0, "loss": 0.6605, "rewards/accuracies": 0.46875, "rewards/chosen": 0.057861328125, "rewards/margins": 0.07275390625, "rewards/rejected": -0.01495361328125, "step": 10 }, { "epoch": 0.013496932515337423, "grad_norm": 154.04829614927058, "learning_rate": 3.52e-07, "logits/chosen": -0.388671875, "logits/rejected": -0.52734375, "logps/chosen": -422.0, "logps/rejected": -296.0, "loss": 0.6512, "rewards/accuracies": 0.4765625, "rewards/chosen": 0.0625, "rewards/margins": 0.09912109375, "rewards/rejected": -0.036376953125, "step": 11 }, { "epoch": 0.014723926380368098, "grad_norm": 292.49015304309825, "learning_rate": 3.8399999999999994e-07, "logits/chosen": -0.1455078125, "logits/rejected": -0.25390625, "logps/chosen": -374.0, "logps/rejected": -262.0, "loss": 0.6321, "rewards/accuracies": 0.53125, "rewards/chosen": 0.080078125, "rewards/margins": 0.1435546875, "rewards/rejected": -0.06298828125, "step": 12 }, { "epoch": 0.015950920245398775, "grad_norm": 179.53722097804638, "learning_rate": 4.16e-07, "logits/chosen": -0.255859375, "logits/rejected": -0.421875, "logps/chosen": -392.0, "logps/rejected": -249.0, "loss": 0.6194, "rewards/accuracies": 0.6171875, "rewards/chosen": 0.12109375, "rewards/margins": 0.1845703125, "rewards/rejected": -0.0634765625, "step": 13 }, { "epoch": 0.01717791411042945, "grad_norm": 108.27195029021392, "learning_rate": 4.4800000000000004e-07, "logits/chosen": -0.23046875, "logits/rejected": -0.41015625, "logps/chosen": -472.0, "logps/rejected": -312.0, "loss": 0.5477, "rewards/accuracies": 0.6875, "rewards/chosen": 0.310546875, "rewards/margins": 0.408203125, "rewards/rejected": -0.09814453125, "step": 14 }, { "epoch": 0.018404907975460124, "grad_norm": 71.36850002174661, "learning_rate": 4.8e-07, "logits/chosen": -0.1142578125, "logits/rejected": -0.18359375, "logps/chosen": -418.0, "logps/rejected": -290.0, "loss": 0.5893, "rewards/accuracies": 0.59375, "rewards/chosen": 0.2412109375, "rewards/margins": 0.337890625, "rewards/rejected": -0.09619140625, "step": 15 }, { "epoch": 0.0196319018404908, "grad_norm": 80.69275734688873, "learning_rate": 5.12e-07, "logits/chosen": -0.26171875, "logits/rejected": -0.4296875, "logps/chosen": -406.0, "logps/rejected": -306.0, "loss": 0.5357, "rewards/accuracies": 0.6484375, "rewards/chosen": 0.318359375, "rewards/margins": 0.48828125, "rewards/rejected": -0.1689453125, "step": 16 }, { "epoch": 0.020858895705521473, "grad_norm": 103.00148200369824, "learning_rate": 5.44e-07, "logits/chosen": -0.1728515625, "logits/rejected": -0.32421875, "logps/chosen": -432.0, "logps/rejected": -255.0, "loss": 0.5279, "rewards/accuracies": 0.6953125, "rewards/chosen": 0.369140625, "rewards/margins": 0.54296875, "rewards/rejected": -0.1728515625, "step": 17 }, { "epoch": 0.022085889570552148, "grad_norm": 90.51865254706846, "learning_rate": 5.76e-07, "logits/chosen": -0.1533203125, "logits/rejected": -0.333984375, "logps/chosen": -404.0, "logps/rejected": -276.0, "loss": 0.5097, "rewards/accuracies": 0.765625, "rewards/chosen": 0.419921875, "rewards/margins": 0.66015625, "rewards/rejected": -0.23828125, "step": 18 }, { "epoch": 0.023312883435582823, "grad_norm": 63.171857373704086, "learning_rate": 6.079999999999999e-07, "logits/chosen": -0.1953125, "logits/rejected": -0.369140625, "logps/chosen": -386.0, "logps/rejected": -290.0, "loss": 0.5237, "rewards/accuracies": 0.6953125, "rewards/chosen": 0.4375, "rewards/margins": 0.80078125, "rewards/rejected": -0.36328125, "step": 19 }, { "epoch": 0.024539877300613498, "grad_norm": 44.73691218363087, "learning_rate": 6.4e-07, "logits/chosen": -0.279296875, "logits/rejected": -0.44921875, "logps/chosen": -462.0, "logps/rejected": -314.0, "loss": 0.4345, "rewards/accuracies": 0.796875, "rewards/chosen": 0.82421875, "rewards/margins": 1.3984375, "rewards/rejected": -0.5703125, "step": 20 }, { "epoch": 0.025766871165644172, "grad_norm": 60.19744308670884, "learning_rate": 6.72e-07, "logits/chosen": -0.1552734375, "logits/rejected": -0.33203125, "logps/chosen": -408.0, "logps/rejected": -262.0, "loss": 0.4418, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.62890625, "rewards/margins": 1.1328125, "rewards/rejected": -0.50390625, "step": 21 }, { "epoch": 0.026993865030674847, "grad_norm": 60.06635545400663, "learning_rate": 7.04e-07, "logits/chosen": -0.1533203125, "logits/rejected": -0.287109375, "logps/chosen": -378.0, "logps/rejected": -294.0, "loss": 0.4638, "rewards/accuracies": 0.7578125, "rewards/chosen": 0.640625, "rewards/margins": 1.25, "rewards/rejected": -0.61328125, "step": 22 }, { "epoch": 0.02822085889570552, "grad_norm": 81.66202093067754, "learning_rate": 7.36e-07, "logits/chosen": -0.27734375, "logits/rejected": -0.33203125, "logps/chosen": -378.0, "logps/rejected": -306.0, "loss": 0.5093, "rewards/accuracies": 0.7421875, "rewards/chosen": 0.81640625, "rewards/margins": 1.421875, "rewards/rejected": -0.6015625, "step": 23 }, { "epoch": 0.029447852760736196, "grad_norm": 83.23689816485307, "learning_rate": 7.679999999999999e-07, "logits/chosen": -0.2109375, "logits/rejected": -0.39453125, "logps/chosen": -376.0, "logps/rejected": -278.0, "loss": 0.511, "rewards/accuracies": 0.7265625, "rewards/chosen": 0.47265625, "rewards/margins": 1.03125, "rewards/rejected": -0.5546875, "step": 24 }, { "epoch": 0.03067484662576687, "grad_norm": 38.90986069898983, "learning_rate": 8e-07, "logits/chosen": -0.291015625, "logits/rejected": -0.4765625, "logps/chosen": -434.0, "logps/rejected": -300.0, "loss": 0.4067, "rewards/accuracies": 0.84375, "rewards/chosen": 0.8515625, "rewards/margins": 1.7578125, "rewards/rejected": -0.90625, "step": 25 }, { "epoch": 0.03190184049079755, "grad_norm": 47.94846803093583, "learning_rate": 7.996694214876033e-07, "logits/chosen": -0.185546875, "logits/rejected": -0.34375, "logps/chosen": -386.0, "logps/rejected": -276.0, "loss": 0.4388, "rewards/accuracies": 0.765625, "rewards/chosen": 1.0234375, "rewards/margins": 1.84375, "rewards/rejected": -0.8203125, "step": 26 }, { "epoch": 0.033128834355828224, "grad_norm": 44.30203970039667, "learning_rate": 7.993388429752066e-07, "logits/chosen": -0.1279296875, "logits/rejected": -0.302734375, "logps/chosen": -358.0, "logps/rejected": -280.0, "loss": 0.3991, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.2421875, "rewards/margins": 2.234375, "rewards/rejected": -1.0, "step": 27 }, { "epoch": 0.0343558282208589, "grad_norm": 38.710283535206564, "learning_rate": 7.990082644628099e-07, "logits/chosen": -0.06591796875, "logits/rejected": -0.1767578125, "logps/chosen": -378.0, "logps/rejected": -262.0, "loss": 0.4113, "rewards/accuracies": 0.796875, "rewards/chosen": 1.265625, "rewards/margins": 2.015625, "rewards/rejected": -0.74609375, "step": 28 }, { "epoch": 0.03558282208588957, "grad_norm": 52.910805586215126, "learning_rate": 7.986776859504132e-07, "logits/chosen": -0.298828125, "logits/rejected": -0.451171875, "logps/chosen": -416.0, "logps/rejected": -322.0, "loss": 0.392, "rewards/accuracies": 0.796875, "rewards/chosen": 1.453125, "rewards/margins": 2.546875, "rewards/rejected": -1.1015625, "step": 29 }, { "epoch": 0.03680981595092025, "grad_norm": 45.21313329781316, "learning_rate": 7.983471074380164e-07, "logits/chosen": -0.1650390625, "logits/rejected": -0.28515625, "logps/chosen": -334.0, "logps/rejected": -266.0, "loss": 0.4322, "rewards/accuracies": 0.8125, "rewards/chosen": 1.1015625, "rewards/margins": 2.03125, "rewards/rejected": -0.93359375, "step": 30 }, { "epoch": 0.03803680981595092, "grad_norm": 41.258011933772664, "learning_rate": 7.980165289256198e-07, "logits/chosen": -0.150390625, "logits/rejected": -0.275390625, "logps/chosen": -382.0, "logps/rejected": -276.0, "loss": 0.4115, "rewards/accuracies": 0.7734375, "rewards/chosen": 1.640625, "rewards/margins": 2.765625, "rewards/rejected": -1.1171875, "step": 31 }, { "epoch": 0.0392638036809816, "grad_norm": 39.16160748489701, "learning_rate": 7.976859504132231e-07, "logits/chosen": -0.197265625, "logits/rejected": -0.388671875, "logps/chosen": -388.0, "logps/rejected": -286.0, "loss": 0.3836, "rewards/accuracies": 0.796875, "rewards/chosen": 1.5859375, "rewards/margins": 2.71875, "rewards/rejected": -1.1328125, "step": 32 }, { "epoch": 0.04049079754601227, "grad_norm": 38.84939653302124, "learning_rate": 7.973553719008264e-07, "logits/chosen": -0.0869140625, "logits/rejected": -0.2255859375, "logps/chosen": -328.0, "logps/rejected": -234.0, "loss": 0.3966, "rewards/accuracies": 0.84375, "rewards/chosen": 1.1484375, "rewards/margins": 2.234375, "rewards/rejected": -1.0859375, "step": 33 }, { "epoch": 0.04171779141104295, "grad_norm": 44.221302785049176, "learning_rate": 7.970247933884297e-07, "logits/chosen": -0.240234375, "logits/rejected": -0.373046875, "logps/chosen": -386.0, "logps/rejected": -302.0, "loss": 0.4038, "rewards/accuracies": 0.765625, "rewards/chosen": 1.390625, "rewards/margins": 2.859375, "rewards/rejected": -1.46875, "step": 34 }, { "epoch": 0.04294478527607362, "grad_norm": 46.59951208776938, "learning_rate": 7.96694214876033e-07, "logits/chosen": -0.1484375, "logits/rejected": -0.30078125, "logps/chosen": -358.0, "logps/rejected": -264.0, "loss": 0.3758, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.0625, "rewards/margins": 2.71875, "rewards/rejected": -1.6484375, "step": 35 }, { "epoch": 0.044171779141104296, "grad_norm": 41.317139252172254, "learning_rate": 7.963636363636364e-07, "logits/chosen": -0.2080078125, "logits/rejected": -0.294921875, "logps/chosen": -400.0, "logps/rejected": -296.0, "loss": 0.3557, "rewards/accuracies": 0.8125, "rewards/chosen": 1.4921875, "rewards/margins": 3.234375, "rewards/rejected": -1.7421875, "step": 36 }, { "epoch": 0.04539877300613497, "grad_norm": 39.795000825479654, "learning_rate": 7.960330578512397e-07, "logits/chosen": -0.171875, "logits/rejected": -0.2890625, "logps/chosen": -388.0, "logps/rejected": -314.0, "loss": 0.3698, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.796875, "rewards/margins": 3.328125, "rewards/rejected": -1.53125, "step": 37 }, { "epoch": 0.046625766871165646, "grad_norm": 35.75368356475873, "learning_rate": 7.95702479338843e-07, "logits/chosen": -0.11328125, "logits/rejected": -0.255859375, "logps/chosen": -396.0, "logps/rejected": -304.0, "loss": 0.3582, "rewards/accuracies": 0.828125, "rewards/chosen": 2.015625, "rewards/margins": 3.6875, "rewards/rejected": -1.671875, "step": 38 }, { "epoch": 0.04785276073619632, "grad_norm": 46.53573926538421, "learning_rate": 7.953719008264462e-07, "logits/chosen": -0.232421875, "logits/rejected": -0.41015625, "logps/chosen": -424.0, "logps/rejected": -310.0, "loss": 0.3835, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.6875, "rewards/margins": 3.671875, "rewards/rejected": -1.984375, "step": 39 }, { "epoch": 0.049079754601226995, "grad_norm": 33.56284839867345, "learning_rate": 7.950413223140495e-07, "logits/chosen": -0.1630859375, "logits/rejected": -0.302734375, "logps/chosen": -374.0, "logps/rejected": -290.0, "loss": 0.3042, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.6640625, "rewards/margins": 3.765625, "rewards/rejected": -2.109375, "step": 40 }, { "epoch": 0.05030674846625767, "grad_norm": 39.46235435607716, "learning_rate": 7.947107438016528e-07, "logits/chosen": -0.1611328125, "logits/rejected": -0.36328125, "logps/chosen": -378.0, "logps/rejected": -278.0, "loss": 0.3708, "rewards/accuracies": 0.796875, "rewards/chosen": 1.5546875, "rewards/margins": 3.546875, "rewards/rejected": -2.0, "step": 41 }, { "epoch": 0.051533742331288344, "grad_norm": 37.85600478708204, "learning_rate": 7.943801652892562e-07, "logits/chosen": -0.1171875, "logits/rejected": -0.298828125, "logps/chosen": -364.0, "logps/rejected": -290.0, "loss": 0.3236, "rewards/accuracies": 0.859375, "rewards/chosen": 1.4375, "rewards/margins": 3.59375, "rewards/rejected": -2.15625, "step": 42 }, { "epoch": 0.05276073619631902, "grad_norm": 43.531972474165585, "learning_rate": 7.940495867768595e-07, "logits/chosen": -0.1796875, "logits/rejected": -0.373046875, "logps/chosen": -416.0, "logps/rejected": -330.0, "loss": 0.3117, "rewards/accuracies": 0.859375, "rewards/chosen": 1.6484375, "rewards/margins": 4.0625, "rewards/rejected": -2.421875, "step": 43 }, { "epoch": 0.053987730061349694, "grad_norm": 63.54372274745974, "learning_rate": 7.937190082644628e-07, "logits/chosen": -0.25, "logits/rejected": -0.37890625, "logps/chosen": -390.0, "logps/rejected": -300.0, "loss": 0.4265, "rewards/accuracies": 0.78125, "rewards/chosen": 1.0859375, "rewards/margins": 3.625, "rewards/rejected": -2.53125, "step": 44 }, { "epoch": 0.05521472392638037, "grad_norm": 42.36111410389095, "learning_rate": 7.933884297520661e-07, "logits/chosen": -0.314453125, "logits/rejected": -0.416015625, "logps/chosen": -356.0, "logps/rejected": -294.0, "loss": 0.3513, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.2421875, "rewards/margins": 3.875, "rewards/rejected": -2.640625, "step": 45 }, { "epoch": 0.05644171779141104, "grad_norm": 44.51420354088873, "learning_rate": 7.930578512396694e-07, "logits/chosen": -0.1845703125, "logits/rejected": -0.376953125, "logps/chosen": -422.0, "logps/rejected": -300.0, "loss": 0.3109, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.875, "rewards/margins": 4.5, "rewards/rejected": -2.609375, "step": 46 }, { "epoch": 0.05766871165644172, "grad_norm": 61.22394416060924, "learning_rate": 7.927272727272727e-07, "logits/chosen": -0.2353515625, "logits/rejected": -0.33203125, "logps/chosen": -392.0, "logps/rejected": -368.0, "loss": 0.4432, "rewards/accuracies": 0.7265625, "rewards/chosen": 1.2109375, "rewards/margins": 3.5, "rewards/rejected": -2.28125, "step": 47 }, { "epoch": 0.05889570552147239, "grad_norm": 35.37901763029379, "learning_rate": 7.92396694214876e-07, "logits/chosen": -0.21484375, "logits/rejected": -0.361328125, "logps/chosen": -352.0, "logps/rejected": -282.0, "loss": 0.3719, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.109375, "rewards/margins": 3.203125, "rewards/rejected": -2.09375, "step": 48 }, { "epoch": 0.06012269938650307, "grad_norm": 31.606470718574474, "learning_rate": 7.920661157024793e-07, "logits/chosen": -0.2314453125, "logits/rejected": -0.462890625, "logps/chosen": -402.0, "logps/rejected": -296.0, "loss": 0.2642, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.90625, "rewards/margins": 4.65625, "rewards/rejected": -2.75, "step": 49 }, { "epoch": 0.06134969325153374, "grad_norm": 48.38174059914219, "learning_rate": 7.917355371900826e-07, "logits/chosen": -0.216796875, "logits/rejected": -0.40234375, "logps/chosen": -404.0, "logps/rejected": -316.0, "loss": 0.3848, "rewards/accuracies": 0.7734375, "rewards/chosen": 1.4609375, "rewards/margins": 3.8125, "rewards/rejected": -2.359375, "step": 50 }, { "epoch": 0.06257668711656442, "grad_norm": 41.76003291409928, "learning_rate": 7.914049586776859e-07, "logits/chosen": -0.1611328125, "logits/rejected": -0.328125, "logps/chosen": -442.0, "logps/rejected": -358.0, "loss": 0.2936, "rewards/accuracies": 0.828125, "rewards/chosen": 1.890625, "rewards/margins": 4.53125, "rewards/rejected": -2.640625, "step": 51 }, { "epoch": 0.0638036809815951, "grad_norm": 36.258140724486836, "learning_rate": 7.910743801652892e-07, "logits/chosen": -0.1923828125, "logits/rejected": -0.384765625, "logps/chosen": -398.0, "logps/rejected": -334.0, "loss": 0.3238, "rewards/accuracies": 0.8125, "rewards/chosen": 1.4765625, "rewards/margins": 4.21875, "rewards/rejected": -2.75, "step": 52 }, { "epoch": 0.06503067484662577, "grad_norm": 38.82725433032811, "learning_rate": 7.907438016528925e-07, "logits/chosen": -0.1328125, "logits/rejected": -0.294921875, "logps/chosen": -400.0, "logps/rejected": -320.0, "loss": 0.3104, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.75, "rewards/margins": 4.03125, "rewards/rejected": -2.28125, "step": 53 }, { "epoch": 0.06625766871165645, "grad_norm": 34.79397739539489, "learning_rate": 7.904132231404959e-07, "logits/chosen": -0.0284423828125, "logits/rejected": -0.208984375, "logps/chosen": -336.0, "logps/rejected": -258.0, "loss": 0.2634, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.25, "rewards/margins": 3.78125, "rewards/rejected": -2.546875, "step": 54 }, { "epoch": 0.06748466257668712, "grad_norm": 41.093192913712485, "learning_rate": 7.900826446280992e-07, "logits/chosen": -0.154296875, "logits/rejected": -0.322265625, "logps/chosen": -378.0, "logps/rejected": -294.0, "loss": 0.3081, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.59375, "rewards/margins": 4.09375, "rewards/rejected": -2.515625, "step": 55 }, { "epoch": 0.0687116564417178, "grad_norm": 45.49364963721349, "learning_rate": 7.897520661157025e-07, "logits/chosen": -0.119140625, "logits/rejected": -0.302734375, "logps/chosen": -388.0, "logps/rejected": -328.0, "loss": 0.3753, "rewards/accuracies": 0.7578125, "rewards/chosen": 1.78125, "rewards/margins": 4.0625, "rewards/rejected": -2.265625, "step": 56 }, { "epoch": 0.06993865030674846, "grad_norm": 50.666379541833365, "learning_rate": 7.894214876033057e-07, "logits/chosen": -0.1181640625, "logits/rejected": -0.203125, "logps/chosen": -354.0, "logps/rejected": -320.0, "loss": 0.3742, "rewards/accuracies": 0.796875, "rewards/chosen": 1.53125, "rewards/margins": 3.953125, "rewards/rejected": -2.421875, "step": 57 }, { "epoch": 0.07116564417177915, "grad_norm": 47.64145593969582, "learning_rate": 7.89090909090909e-07, "logits/chosen": -0.1298828125, "logits/rejected": -0.2177734375, "logps/chosen": -376.0, "logps/rejected": -326.0, "loss": 0.3598, "rewards/accuracies": 0.7421875, "rewards/chosen": 1.7109375, "rewards/margins": 4.125, "rewards/rejected": -2.421875, "step": 58 }, { "epoch": 0.07239263803680981, "grad_norm": 51.11345473280857, "learning_rate": 7.887603305785123e-07, "logits/chosen": -0.049560546875, "logits/rejected": -0.140625, "logps/chosen": -378.0, "logps/rejected": -292.0, "loss": 0.4133, "rewards/accuracies": 0.78125, "rewards/chosen": 1.28125, "rewards/margins": 3.28125, "rewards/rejected": -1.9921875, "step": 59 }, { "epoch": 0.0736196319018405, "grad_norm": 39.0647396184868, "learning_rate": 7.884297520661157e-07, "logits/chosen": -0.12451171875, "logits/rejected": -0.263671875, "logps/chosen": -384.0, "logps/rejected": -284.0, "loss": 0.3578, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.1796875, "rewards/margins": 3.46875, "rewards/rejected": -2.28125, "step": 60 }, { "epoch": 0.07484662576687116, "grad_norm": 39.12713457741509, "learning_rate": 7.88099173553719e-07, "logits/chosen": -0.125, "logits/rejected": -0.267578125, "logps/chosen": -418.0, "logps/rejected": -316.0, "loss": 0.3224, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.953125, "rewards/margins": 4.53125, "rewards/rejected": -2.578125, "step": 61 }, { "epoch": 0.07607361963190185, "grad_norm": 41.544347269900555, "learning_rate": 7.877685950413223e-07, "logits/chosen": -0.10791015625, "logits/rejected": -0.3203125, "logps/chosen": -428.0, "logps/rejected": -306.0, "loss": 0.3433, "rewards/accuracies": 0.765625, "rewards/chosen": 2.328125, "rewards/margins": 5.03125, "rewards/rejected": -2.703125, "step": 62 }, { "epoch": 0.07730061349693251, "grad_norm": 52.28530938487766, "learning_rate": 7.874380165289256e-07, "logits/chosen": -0.0257568359375, "logits/rejected": -0.197265625, "logps/chosen": -418.0, "logps/rejected": -304.0, "loss": 0.331, "rewards/accuracies": 0.828125, "rewards/chosen": 1.515625, "rewards/margins": 3.9375, "rewards/rejected": -2.40625, "step": 63 }, { "epoch": 0.0785276073619632, "grad_norm": 44.343811483698694, "learning_rate": 7.871074380165289e-07, "logits/chosen": -0.1728515625, "logits/rejected": -0.35546875, "logps/chosen": -402.0, "logps/rejected": -328.0, "loss": 0.3628, "rewards/accuracies": 0.8125, "rewards/chosen": 1.9921875, "rewards/margins": 4.5, "rewards/rejected": -2.5, "step": 64 }, { "epoch": 0.07975460122699386, "grad_norm": 40.38168553746162, "learning_rate": 7.867768595041322e-07, "logits/chosen": -0.220703125, "logits/rejected": -0.322265625, "logps/chosen": -392.0, "logps/rejected": -300.0, "loss": 0.3193, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.828125, "rewards/margins": 4.28125, "rewards/rejected": -2.453125, "step": 65 }, { "epoch": 0.08098159509202454, "grad_norm": 35.90018196646264, "learning_rate": 7.864462809917355e-07, "logits/chosen": -0.201171875, "logits/rejected": -0.349609375, "logps/chosen": -318.0, "logps/rejected": -260.0, "loss": 0.2892, "rewards/accuracies": 0.8515625, "rewards/chosen": 2.0, "rewards/margins": 4.8125, "rewards/rejected": -2.8125, "step": 66 }, { "epoch": 0.08220858895705521, "grad_norm": 39.83708858843296, "learning_rate": 7.861157024793388e-07, "logits/chosen": -0.1005859375, "logits/rejected": -0.224609375, "logps/chosen": -332.0, "logps/rejected": -294.0, "loss": 0.344, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.2265625, "rewards/margins": 3.90625, "rewards/rejected": -2.671875, "step": 67 }, { "epoch": 0.0834355828220859, "grad_norm": 41.25508984701749, "learning_rate": 7.857851239669421e-07, "logits/chosen": -0.1845703125, "logits/rejected": -0.2578125, "logps/chosen": -360.0, "logps/rejected": -330.0, "loss": 0.3597, "rewards/accuracies": 0.796875, "rewards/chosen": 1.484375, "rewards/margins": 3.953125, "rewards/rejected": -2.46875, "step": 68 }, { "epoch": 0.08466257668711656, "grad_norm": 35.61462182457114, "learning_rate": 7.854545454545454e-07, "logits/chosen": -0.2451171875, "logits/rejected": -0.423828125, "logps/chosen": -408.0, "logps/rejected": -282.0, "loss": 0.2797, "rewards/accuracies": 0.828125, "rewards/chosen": 2.3125, "rewards/margins": 4.96875, "rewards/rejected": -2.65625, "step": 69 }, { "epoch": 0.08588957055214724, "grad_norm": 43.949799113654095, "learning_rate": 7.851239669421487e-07, "logits/chosen": -0.12109375, "logits/rejected": -0.3203125, "logps/chosen": -408.0, "logps/rejected": -338.0, "loss": 0.3016, "rewards/accuracies": 0.8515625, "rewards/chosen": 2.328125, "rewards/margins": 4.65625, "rewards/rejected": -2.34375, "step": 70 }, { "epoch": 0.08711656441717791, "grad_norm": 40.385403541291616, "learning_rate": 7.84793388429752e-07, "logits/chosen": -0.068359375, "logits/rejected": -0.1494140625, "logps/chosen": -346.0, "logps/rejected": -278.0, "loss": 0.3925, "rewards/accuracies": 0.765625, "rewards/chosen": 1.3515625, "rewards/margins": 3.625, "rewards/rejected": -2.265625, "step": 71 }, { "epoch": 0.08834355828220859, "grad_norm": 42.66471807743761, "learning_rate": 7.844628099173554e-07, "logits/chosen": -0.2265625, "logits/rejected": -0.38671875, "logps/chosen": -430.0, "logps/rejected": -348.0, "loss": 0.2955, "rewards/accuracies": 0.875, "rewards/chosen": 1.9609375, "rewards/margins": 4.25, "rewards/rejected": -2.28125, "step": 72 }, { "epoch": 0.08957055214723926, "grad_norm": 45.57465316917817, "learning_rate": 7.841322314049587e-07, "logits/chosen": -0.171875, "logits/rejected": -0.267578125, "logps/chosen": -348.0, "logps/rejected": -296.0, "loss": 0.3924, "rewards/accuracies": 0.7578125, "rewards/chosen": 1.53125, "rewards/margins": 4.09375, "rewards/rejected": -2.5625, "step": 73 }, { "epoch": 0.09079754601226994, "grad_norm": 41.41678309244041, "learning_rate": 7.838016528925619e-07, "logits/chosen": -0.1728515625, "logits/rejected": -0.267578125, "logps/chosen": -354.0, "logps/rejected": -328.0, "loss": 0.2911, "rewards/accuracies": 0.84375, "rewards/chosen": 1.2890625, "rewards/margins": 3.9375, "rewards/rejected": -2.65625, "step": 74 }, { "epoch": 0.09202453987730061, "grad_norm": 36.36740264063768, "learning_rate": 7.834710743801652e-07, "logits/chosen": -0.1435546875, "logits/rejected": -0.306640625, "logps/chosen": -380.0, "logps/rejected": -318.0, "loss": 0.271, "rewards/accuracies": 0.859375, "rewards/chosen": 1.9453125, "rewards/margins": 4.65625, "rewards/rejected": -2.703125, "step": 75 }, { "epoch": 0.09325153374233129, "grad_norm": 51.152036733559505, "learning_rate": 7.831404958677685e-07, "logits/chosen": -0.1513671875, "logits/rejected": -0.337890625, "logps/chosen": -396.0, "logps/rejected": -288.0, "loss": 0.3262, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.9453125, "rewards/margins": 4.46875, "rewards/rejected": -2.53125, "step": 76 }, { "epoch": 0.09447852760736196, "grad_norm": 34.55182641721203, "learning_rate": 7.828099173553718e-07, "logits/chosen": -0.171875, "logits/rejected": -0.328125, "logps/chosen": -350.0, "logps/rejected": -296.0, "loss": 0.2774, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.4453125, "rewards/margins": 4.3125, "rewards/rejected": -2.875, "step": 77 }, { "epoch": 0.09570552147239264, "grad_norm": 40.758007342891354, "learning_rate": 7.824793388429752e-07, "logits/chosen": -0.1298828125, "logits/rejected": -0.30859375, "logps/chosen": -416.0, "logps/rejected": -314.0, "loss": 0.2953, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.7421875, "rewards/margins": 4.59375, "rewards/rejected": -2.859375, "step": 78 }, { "epoch": 0.09693251533742331, "grad_norm": 40.243771187807226, "learning_rate": 7.821487603305785e-07, "logits/chosen": -0.1142578125, "logits/rejected": -0.255859375, "logps/chosen": -354.0, "logps/rejected": -286.0, "loss": 0.324, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.296875, "rewards/margins": 4.09375, "rewards/rejected": -2.796875, "step": 79 }, { "epoch": 0.09815950920245399, "grad_norm": 37.86169713828253, "learning_rate": 7.818181818181818e-07, "logits/chosen": -0.1708984375, "logits/rejected": -0.3984375, "logps/chosen": -404.0, "logps/rejected": -324.0, "loss": 0.2795, "rewards/accuracies": 0.8828125, "rewards/chosen": 2.375, "rewards/margins": 5.375, "rewards/rejected": -3.0, "step": 80 }, { "epoch": 0.09938650306748466, "grad_norm": 36.69542578194377, "learning_rate": 7.814876033057851e-07, "logits/chosen": -0.2353515625, "logits/rejected": -0.4140625, "logps/chosen": -436.0, "logps/rejected": -340.0, "loss": 0.2988, "rewards/accuracies": 0.796875, "rewards/chosen": 1.9375, "rewards/margins": 5.03125, "rewards/rejected": -3.09375, "step": 81 }, { "epoch": 0.10061349693251534, "grad_norm": 52.318975452049024, "learning_rate": 7.811570247933884e-07, "logits/chosen": -0.1484375, "logits/rejected": -0.2734375, "logps/chosen": -428.0, "logps/rejected": -332.0, "loss": 0.3562, "rewards/accuracies": 0.8125, "rewards/chosen": 1.265625, "rewards/margins": 4.46875, "rewards/rejected": -3.1875, "step": 82 }, { "epoch": 0.10184049079754601, "grad_norm": 48.36250064527517, "learning_rate": 7.808264462809916e-07, "logits/chosen": -0.1337890625, "logits/rejected": -0.30859375, "logps/chosen": -350.0, "logps/rejected": -304.0, "loss": 0.3065, "rewards/accuracies": 0.8125, "rewards/chosen": 1.3125, "rewards/margins": 4.5625, "rewards/rejected": -3.234375, "step": 83 }, { "epoch": 0.10306748466257669, "grad_norm": 56.4532578365936, "learning_rate": 7.80495867768595e-07, "logits/chosen": -0.11083984375, "logits/rejected": -0.349609375, "logps/chosen": -448.0, "logps/rejected": -344.0, "loss": 0.2942, "rewards/accuracies": 0.828125, "rewards/chosen": 1.75, "rewards/margins": 5.28125, "rewards/rejected": -3.53125, "step": 84 }, { "epoch": 0.10429447852760736, "grad_norm": 40.84421229525563, "learning_rate": 7.801652892561983e-07, "logits/chosen": -0.2060546875, "logits/rejected": -0.376953125, "logps/chosen": -376.0, "logps/rejected": -322.0, "loss": 0.3021, "rewards/accuracies": 0.859375, "rewards/chosen": 1.109375, "rewards/margins": 4.59375, "rewards/rejected": -3.484375, "step": 85 }, { "epoch": 0.10552147239263804, "grad_norm": 42.8824866796569, "learning_rate": 7.798347107438016e-07, "logits/chosen": -0.1376953125, "logits/rejected": -0.26171875, "logps/chosen": -424.0, "logps/rejected": -302.0, "loss": 0.3346, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.5546875, "rewards/margins": 4.59375, "rewards/rejected": -3.03125, "step": 86 }, { "epoch": 0.1067484662576687, "grad_norm": 32.177789360920215, "learning_rate": 7.795041322314049e-07, "logits/chosen": -0.17578125, "logits/rejected": -0.318359375, "logps/chosen": -352.0, "logps/rejected": -260.0, "loss": 0.2835, "rewards/accuracies": 0.84375, "rewards/chosen": 0.77734375, "rewards/margins": 4.25, "rewards/rejected": -3.46875, "step": 87 }, { "epoch": 0.10797546012269939, "grad_norm": 34.28909140331474, "learning_rate": 7.791735537190082e-07, "logits/chosen": -0.1552734375, "logits/rejected": -0.33203125, "logps/chosen": -362.0, "logps/rejected": -276.0, "loss": 0.265, "rewards/accuracies": 0.828125, "rewards/chosen": 1.171875, "rewards/margins": 4.46875, "rewards/rejected": -3.3125, "step": 88 }, { "epoch": 0.10920245398773006, "grad_norm": 42.40518360379319, "learning_rate": 7.788429752066116e-07, "logits/chosen": -0.171875, "logits/rejected": -0.287109375, "logps/chosen": -394.0, "logps/rejected": -328.0, "loss": 0.3464, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.4140625, "rewards/margins": 4.5, "rewards/rejected": -3.09375, "step": 89 }, { "epoch": 0.11042944785276074, "grad_norm": 49.53932371851528, "learning_rate": 7.785123966942149e-07, "logits/chosen": -0.2041015625, "logits/rejected": -0.392578125, "logps/chosen": -380.0, "logps/rejected": -320.0, "loss": 0.3253, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.98828125, "rewards/margins": 4.3125, "rewards/rejected": -3.3125, "step": 90 }, { "epoch": 0.1116564417177914, "grad_norm": 40.48862678893552, "learning_rate": 7.781818181818182e-07, "logits/chosen": -0.039794921875, "logits/rejected": -0.302734375, "logps/chosen": -394.0, "logps/rejected": -296.0, "loss": 0.2845, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.3359375, "rewards/margins": 4.53125, "rewards/rejected": -3.203125, "step": 91 }, { "epoch": 0.11288343558282209, "grad_norm": 44.87681376045074, "learning_rate": 7.778512396694214e-07, "logits/chosen": -0.126953125, "logits/rejected": -0.2490234375, "logps/chosen": -392.0, "logps/rejected": -302.0, "loss": 0.2738, "rewards/accuracies": 0.84375, "rewards/chosen": 1.3359375, "rewards/margins": 4.84375, "rewards/rejected": -3.5, "step": 92 }, { "epoch": 0.11411042944785275, "grad_norm": 36.61224632474363, "learning_rate": 7.775206611570247e-07, "logits/chosen": -0.1455078125, "logits/rejected": -0.373046875, "logps/chosen": -404.0, "logps/rejected": -300.0, "loss": 0.282, "rewards/accuracies": 0.859375, "rewards/chosen": 2.015625, "rewards/margins": 5.3125, "rewards/rejected": -3.3125, "step": 93 }, { "epoch": 0.11533742331288344, "grad_norm": 42.24461574764279, "learning_rate": 7.77190082644628e-07, "logits/chosen": -0.1767578125, "logits/rejected": -0.400390625, "logps/chosen": -432.0, "logps/rejected": -342.0, "loss": 0.2813, "rewards/accuracies": 0.8203125, "rewards/chosen": 2.234375, "rewards/margins": 5.375, "rewards/rejected": -3.140625, "step": 94 }, { "epoch": 0.1165644171779141, "grad_norm": 42.13498046583409, "learning_rate": 7.768595041322314e-07, "logits/chosen": -0.251953125, "logits/rejected": -0.41015625, "logps/chosen": -380.0, "logps/rejected": -306.0, "loss": 0.2988, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.7734375, "rewards/margins": 5.15625, "rewards/rejected": -3.390625, "step": 95 }, { "epoch": 0.11779141104294479, "grad_norm": 39.13305361039425, "learning_rate": 7.765289256198347e-07, "logits/chosen": -0.2333984375, "logits/rejected": -0.40625, "logps/chosen": -370.0, "logps/rejected": -310.0, "loss": 0.253, "rewards/accuracies": 0.8671875, "rewards/chosen": 2.203125, "rewards/margins": 5.59375, "rewards/rejected": -3.40625, "step": 96 }, { "epoch": 0.11901840490797547, "grad_norm": 46.1275059887527, "learning_rate": 7.76198347107438e-07, "logits/chosen": -0.2294921875, "logits/rejected": -0.380859375, "logps/chosen": -426.0, "logps/rejected": -352.0, "loss": 0.357, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.9453125, "rewards/margins": 4.84375, "rewards/rejected": -2.890625, "step": 97 }, { "epoch": 0.12024539877300613, "grad_norm": 38.580559184520915, "learning_rate": 7.758677685950413e-07, "logits/chosen": -0.041015625, "logits/rejected": -0.248046875, "logps/chosen": -358.0, "logps/rejected": -282.0, "loss": 0.3015, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.7109375, "rewards/margins": 4.53125, "rewards/rejected": -2.828125, "step": 98 }, { "epoch": 0.12147239263803682, "grad_norm": 38.975117366609354, "learning_rate": 7.755371900826446e-07, "logits/chosen": -0.1962890625, "logits/rejected": -0.298828125, "logps/chosen": -340.0, "logps/rejected": -244.0, "loss": 0.2586, "rewards/accuracies": 0.890625, "rewards/chosen": 1.2578125, "rewards/margins": 4.09375, "rewards/rejected": -2.84375, "step": 99 }, { "epoch": 0.12269938650306748, "grad_norm": 38.2314125667712, "learning_rate": 7.752066115702479e-07, "logits/chosen": -0.220703125, "logits/rejected": -0.41015625, "logps/chosen": -394.0, "logps/rejected": -316.0, "loss": 0.3048, "rewards/accuracies": 0.796875, "rewards/chosen": 1.7890625, "rewards/margins": 4.875, "rewards/rejected": -3.09375, "step": 100 }, { "epoch": 0.12392638036809817, "grad_norm": 47.72088602593496, "learning_rate": 7.748760330578512e-07, "logits/chosen": -0.2177734375, "logits/rejected": -0.41015625, "logps/chosen": -412.0, "logps/rejected": -338.0, "loss": 0.3549, "rewards/accuracies": 0.796875, "rewards/chosen": 1.921875, "rewards/margins": 4.90625, "rewards/rejected": -2.984375, "step": 101 }, { "epoch": 0.12515337423312883, "grad_norm": 39.20874470259191, "learning_rate": 7.745454545454545e-07, "logits/chosen": -0.193359375, "logits/rejected": -0.314453125, "logps/chosen": -394.0, "logps/rejected": -318.0, "loss": 0.3073, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.9375, "rewards/margins": 4.65625, "rewards/rejected": -2.71875, "step": 102 }, { "epoch": 0.1263803680981595, "grad_norm": 36.963577318972284, "learning_rate": 7.742148760330578e-07, "logits/chosen": -0.181640625, "logits/rejected": -0.34375, "logps/chosen": -348.0, "logps/rejected": -294.0, "loss": 0.2878, "rewards/accuracies": 0.84375, "rewards/chosen": 1.7265625, "rewards/margins": 4.46875, "rewards/rejected": -2.75, "step": 103 }, { "epoch": 0.1276073619631902, "grad_norm": 50.89003123288155, "learning_rate": 7.738842975206611e-07, "logits/chosen": -0.107421875, "logits/rejected": -0.2490234375, "logps/chosen": -414.0, "logps/rejected": -334.0, "loss": 0.3679, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.703125, "rewards/margins": 4.40625, "rewards/rejected": -2.71875, "step": 104 }, { "epoch": 0.12883435582822086, "grad_norm": 34.19259318441508, "learning_rate": 7.735537190082644e-07, "logits/chosen": -0.1884765625, "logits/rejected": -0.39453125, "logps/chosen": -376.0, "logps/rejected": -306.0, "loss": 0.2586, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.984375, "rewards/margins": 5.125, "rewards/rejected": -3.140625, "step": 105 }, { "epoch": 0.13006134969325153, "grad_norm": 38.48374397973381, "learning_rate": 7.732231404958677e-07, "logits/chosen": -0.1669921875, "logits/rejected": -0.326171875, "logps/chosen": -390.0, "logps/rejected": -308.0, "loss": 0.3111, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.9140625, "rewards/margins": 4.75, "rewards/rejected": -2.828125, "step": 106 }, { "epoch": 0.1312883435582822, "grad_norm": 41.75637341421824, "learning_rate": 7.728925619834711e-07, "logits/chosen": -0.197265625, "logits/rejected": -0.29296875, "logps/chosen": -348.0, "logps/rejected": -296.0, "loss": 0.2869, "rewards/accuracies": 0.828125, "rewards/chosen": 1.6953125, "rewards/margins": 4.53125, "rewards/rejected": -2.84375, "step": 107 }, { "epoch": 0.1325153374233129, "grad_norm": 33.954750583294235, "learning_rate": 7.725619834710744e-07, "logits/chosen": -0.2080078125, "logits/rejected": -0.421875, "logps/chosen": -380.0, "logps/rejected": -302.0, "loss": 0.2625, "rewards/accuracies": 0.84375, "rewards/chosen": 1.578125, "rewards/margins": 4.90625, "rewards/rejected": -3.328125, "step": 108 }, { "epoch": 0.13374233128834356, "grad_norm": 36.44619320062165, "learning_rate": 7.722314049586777e-07, "logits/chosen": -0.189453125, "logits/rejected": -0.376953125, "logps/chosen": -410.0, "logps/rejected": -310.0, "loss": 0.2958, "rewards/accuracies": 0.84375, "rewards/chosen": 2.6875, "rewards/margins": 5.65625, "rewards/rejected": -2.96875, "step": 109 }, { "epoch": 0.13496932515337423, "grad_norm": 41.465536696868014, "learning_rate": 7.719008264462809e-07, "logits/chosen": -0.1787109375, "logits/rejected": -0.33203125, "logps/chosen": -402.0, "logps/rejected": -332.0, "loss": 0.3213, "rewards/accuracies": 0.7578125, "rewards/chosen": 2.234375, "rewards/margins": 5.25, "rewards/rejected": -3.015625, "step": 110 }, { "epoch": 0.1361963190184049, "grad_norm": 34.97820982991418, "learning_rate": 7.715702479338842e-07, "logits/chosen": -0.1142578125, "logits/rejected": -0.279296875, "logps/chosen": -330.0, "logps/rejected": -268.0, "loss": 0.2777, "rewards/accuracies": 0.875, "rewards/chosen": 1.640625, "rewards/margins": 4.40625, "rewards/rejected": -2.75, "step": 111 }, { "epoch": 0.1374233128834356, "grad_norm": 37.33233370442031, "learning_rate": 7.712396694214875e-07, "logits/chosen": -0.1884765625, "logits/rejected": -0.310546875, "logps/chosen": -340.0, "logps/rejected": -278.0, "loss": 0.2729, "rewards/accuracies": 0.875, "rewards/chosen": 1.546875, "rewards/margins": 4.6875, "rewards/rejected": -3.125, "step": 112 }, { "epoch": 0.13865030674846626, "grad_norm": 39.32831836749558, "learning_rate": 7.709090909090909e-07, "logits/chosen": -0.1044921875, "logits/rejected": -0.2001953125, "logps/chosen": -374.0, "logps/rejected": -302.0, "loss": 0.3238, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.84375, "rewards/margins": 4.71875, "rewards/rejected": -2.890625, "step": 113 }, { "epoch": 0.13987730061349693, "grad_norm": 43.77160490529073, "learning_rate": 7.705785123966942e-07, "logits/chosen": -0.1416015625, "logits/rejected": -0.30078125, "logps/chosen": -374.0, "logps/rejected": -306.0, "loss": 0.3356, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.3515625, "rewards/margins": 4.3125, "rewards/rejected": -2.96875, "step": 114 }, { "epoch": 0.1411042944785276, "grad_norm": 45.86173030028754, "learning_rate": 7.702479338842975e-07, "logits/chosen": -0.1484375, "logits/rejected": -0.275390625, "logps/chosen": -338.0, "logps/rejected": -312.0, "loss": 0.3666, "rewards/accuracies": 0.78125, "rewards/chosen": 1.03125, "rewards/margins": 4.0, "rewards/rejected": -2.96875, "step": 115 }, { "epoch": 0.1423312883435583, "grad_norm": 31.833834890400677, "learning_rate": 7.699173553719008e-07, "logits/chosen": -0.2001953125, "logits/rejected": -0.439453125, "logps/chosen": -380.0, "logps/rejected": -320.0, "loss": 0.2561, "rewards/accuracies": 0.84375, "rewards/chosen": 2.078125, "rewards/margins": 5.21875, "rewards/rejected": -3.140625, "step": 116 }, { "epoch": 0.14355828220858896, "grad_norm": 34.65342816309822, "learning_rate": 7.695867768595041e-07, "logits/chosen": -0.1484375, "logits/rejected": -0.30078125, "logps/chosen": -324.0, "logps/rejected": -262.0, "loss": 0.2802, "rewards/accuracies": 0.8125, "rewards/chosen": 1.265625, "rewards/margins": 4.71875, "rewards/rejected": -3.453125, "step": 117 }, { "epoch": 0.14478527607361963, "grad_norm": 40.64680750199124, "learning_rate": 7.692561983471075e-07, "logits/chosen": -0.1669921875, "logits/rejected": -0.333984375, "logps/chosen": -420.0, "logps/rejected": -352.0, "loss": 0.3232, "rewards/accuracies": 0.8046875, "rewards/chosen": 2.015625, "rewards/margins": 5.125, "rewards/rejected": -3.09375, "step": 118 }, { "epoch": 0.1460122699386503, "grad_norm": 39.06542225750342, "learning_rate": 7.689256198347107e-07, "logits/chosen": -0.236328125, "logits/rejected": -0.337890625, "logps/chosen": -354.0, "logps/rejected": -318.0, "loss": 0.3009, "rewards/accuracies": 0.8125, "rewards/chosen": 1.3984375, "rewards/margins": 4.75, "rewards/rejected": -3.34375, "step": 119 }, { "epoch": 0.147239263803681, "grad_norm": 45.793161618342445, "learning_rate": 7.68595041322314e-07, "logits/chosen": -0.220703125, "logits/rejected": -0.412109375, "logps/chosen": -420.0, "logps/rejected": -346.0, "loss": 0.2967, "rewards/accuracies": 0.796875, "rewards/chosen": 2.421875, "rewards/margins": 5.65625, "rewards/rejected": -3.234375, "step": 120 }, { "epoch": 0.14846625766871166, "grad_norm": 36.35506762175528, "learning_rate": 7.682644628099173e-07, "logits/chosen": -0.138671875, "logits/rejected": -0.302734375, "logps/chosen": -408.0, "logps/rejected": -326.0, "loss": 0.2827, "rewards/accuracies": 0.8046875, "rewards/chosen": 2.265625, "rewards/margins": 5.34375, "rewards/rejected": -3.09375, "step": 121 }, { "epoch": 0.14969325153374233, "grad_norm": 43.61172830028863, "learning_rate": 7.679338842975206e-07, "logits/chosen": -0.1552734375, "logits/rejected": -0.32421875, "logps/chosen": -378.0, "logps/rejected": -288.0, "loss": 0.2954, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.6953125, "rewards/margins": 4.71875, "rewards/rejected": -3.015625, "step": 122 }, { "epoch": 0.150920245398773, "grad_norm": 44.76510892093205, "learning_rate": 7.676033057851239e-07, "logits/chosen": -0.054443359375, "logits/rejected": -0.2294921875, "logps/chosen": -380.0, "logps/rejected": -278.0, "loss": 0.3266, "rewards/accuracies": 0.796875, "rewards/chosen": 1.2265625, "rewards/margins": 4.40625, "rewards/rejected": -3.171875, "step": 123 }, { "epoch": 0.1521472392638037, "grad_norm": 34.74558330134135, "learning_rate": 7.672727272727273e-07, "logits/chosen": -0.220703125, "logits/rejected": -0.294921875, "logps/chosen": -350.0, "logps/rejected": -280.0, "loss": 0.26, "rewards/accuracies": 0.8515625, "rewards/chosen": 2.015625, "rewards/margins": 5.46875, "rewards/rejected": -3.46875, "step": 124 }, { "epoch": 0.15337423312883436, "grad_norm": 42.40382525839625, "learning_rate": 7.669421487603306e-07, "logits/chosen": -0.28125, "logits/rejected": -0.4609375, "logps/chosen": -434.0, "logps/rejected": -326.0, "loss": 0.2816, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.765625, "rewards/margins": 5.3125, "rewards/rejected": -3.5625, "step": 125 }, { "epoch": 0.15460122699386503, "grad_norm": 54.09847924655591, "learning_rate": 7.666115702479339e-07, "logits/chosen": -0.1484375, "logits/rejected": -0.34375, "logps/chosen": -366.0, "logps/rejected": -302.0, "loss": 0.3503, "rewards/accuracies": 0.8125, "rewards/chosen": 0.99609375, "rewards/margins": 4.34375, "rewards/rejected": -3.34375, "step": 126 }, { "epoch": 0.1558282208588957, "grad_norm": 42.126209906017394, "learning_rate": 7.662809917355372e-07, "logits/chosen": -0.09375, "logits/rejected": -0.283203125, "logps/chosen": -386.0, "logps/rejected": -324.0, "loss": 0.3524, "rewards/accuracies": 0.796875, "rewards/chosen": 1.96875, "rewards/margins": 5.125, "rewards/rejected": -3.15625, "step": 127 }, { "epoch": 0.1570552147239264, "grad_norm": 41.454801423663085, "learning_rate": 7.659504132231404e-07, "logits/chosen": -0.1416015625, "logits/rejected": -0.3359375, "logps/chosen": -370.0, "logps/rejected": -328.0, "loss": 0.2841, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.8671875, "rewards/margins": 5.25, "rewards/rejected": -3.390625, "step": 128 }, { "epoch": 0.15828220858895706, "grad_norm": 37.48031578456685, "learning_rate": 7.656198347107437e-07, "logits/chosen": -0.0478515625, "logits/rejected": -0.1796875, "logps/chosen": -336.0, "logps/rejected": -284.0, "loss": 0.3245, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.3125, "rewards/margins": 4.3125, "rewards/rejected": -3.0, "step": 129 }, { "epoch": 0.15950920245398773, "grad_norm": 38.14450880210714, "learning_rate": 7.65289256198347e-07, "logits/chosen": -0.146484375, "logits/rejected": -0.291015625, "logps/chosen": -380.0, "logps/rejected": -306.0, "loss": 0.3273, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.3203125, "rewards/margins": 4.75, "rewards/rejected": -3.421875, "step": 130 }, { "epoch": 0.1607361963190184, "grad_norm": 35.19502262660919, "learning_rate": 7.649586776859504e-07, "logits/chosen": -0.255859375, "logits/rejected": -0.400390625, "logps/chosen": -392.0, "logps/rejected": -336.0, "loss": 0.2106, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.953125, "rewards/margins": 5.5625, "rewards/rejected": -3.59375, "step": 131 }, { "epoch": 0.1619631901840491, "grad_norm": 42.07184086801236, "learning_rate": 7.646280991735537e-07, "logits/chosen": -0.21484375, "logits/rejected": -0.40625, "logps/chosen": -388.0, "logps/rejected": -318.0, "loss": 0.3252, "rewards/accuracies": 0.828125, "rewards/chosen": 1.765625, "rewards/margins": 5.15625, "rewards/rejected": -3.40625, "step": 132 }, { "epoch": 0.16319018404907976, "grad_norm": 43.059635351413924, "learning_rate": 7.64297520661157e-07, "logits/chosen": -0.244140625, "logits/rejected": -0.416015625, "logps/chosen": -382.0, "logps/rejected": -324.0, "loss": 0.2872, "rewards/accuracies": 0.84375, "rewards/chosen": 1.546875, "rewards/margins": 5.25, "rewards/rejected": -3.703125, "step": 133 }, { "epoch": 0.16441717791411042, "grad_norm": 48.09563853008669, "learning_rate": 7.639669421487603e-07, "logits/chosen": -0.1796875, "logits/rejected": -0.390625, "logps/chosen": -450.0, "logps/rejected": -358.0, "loss": 0.2946, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.53125, "rewards/margins": 4.625, "rewards/rejected": -3.109375, "step": 134 }, { "epoch": 0.1656441717791411, "grad_norm": 46.36508764131004, "learning_rate": 7.636363636363636e-07, "logits/chosen": -0.05712890625, "logits/rejected": -0.171875, "logps/chosen": -370.0, "logps/rejected": -314.0, "loss": 0.3654, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.9765625, "rewards/margins": 4.375, "rewards/rejected": -3.390625, "step": 135 }, { "epoch": 0.1668711656441718, "grad_norm": 39.349987951574626, "learning_rate": 7.63305785123967e-07, "logits/chosen": -0.28125, "logits/rejected": -0.36328125, "logps/chosen": -388.0, "logps/rejected": -304.0, "loss": 0.3195, "rewards/accuracies": 0.8125, "rewards/chosen": 1.390625, "rewards/margins": 5.1875, "rewards/rejected": -3.78125, "step": 136 }, { "epoch": 0.16809815950920245, "grad_norm": 46.78307320347251, "learning_rate": 7.629752066115702e-07, "logits/chosen": -0.061279296875, "logits/rejected": -0.212890625, "logps/chosen": -394.0, "logps/rejected": -304.0, "loss": 0.3621, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.15625, "rewards/margins": 4.25, "rewards/rejected": -3.078125, "step": 137 }, { "epoch": 0.16932515337423312, "grad_norm": 37.18351460769713, "learning_rate": 7.626446280991735e-07, "logits/chosen": -0.142578125, "logits/rejected": -0.28515625, "logps/chosen": -402.0, "logps/rejected": -344.0, "loss": 0.3022, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.109375, "rewards/margins": 4.59375, "rewards/rejected": -3.46875, "step": 138 }, { "epoch": 0.1705521472392638, "grad_norm": 42.545002180919454, "learning_rate": 7.623140495867768e-07, "logits/chosen": -0.1318359375, "logits/rejected": -0.30859375, "logps/chosen": -412.0, "logps/rejected": -362.0, "loss": 0.352, "rewards/accuracies": 0.7734375, "rewards/chosen": 1.640625, "rewards/margins": 5.46875, "rewards/rejected": -3.828125, "step": 139 }, { "epoch": 0.17177914110429449, "grad_norm": 47.45496980791103, "learning_rate": 7.619834710743801e-07, "logits/chosen": -0.10400390625, "logits/rejected": -0.29296875, "logps/chosen": -420.0, "logps/rejected": -360.0, "loss": 0.3166, "rewards/accuracies": 0.8125, "rewards/chosen": 1.53125, "rewards/margins": 5.09375, "rewards/rejected": -3.5625, "step": 140 }, { "epoch": 0.17300613496932515, "grad_norm": 34.622965144928166, "learning_rate": 7.616528925619834e-07, "logits/chosen": -0.0849609375, "logits/rejected": -0.2119140625, "logps/chosen": -354.0, "logps/rejected": -320.0, "loss": 0.251, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.546875, "rewards/margins": 5.0625, "rewards/rejected": -3.515625, "step": 141 }, { "epoch": 0.17423312883435582, "grad_norm": 40.37071693879945, "learning_rate": 7.613223140495868e-07, "logits/chosen": -0.12060546875, "logits/rejected": -0.3125, "logps/chosen": -396.0, "logps/rejected": -336.0, "loss": 0.3233, "rewards/accuracies": 0.8125, "rewards/chosen": 1.5625, "rewards/margins": 5.21875, "rewards/rejected": -3.640625, "step": 142 }, { "epoch": 0.1754601226993865, "grad_norm": 41.48963188375289, "learning_rate": 7.609917355371901e-07, "logits/chosen": -0.1435546875, "logits/rejected": -0.3671875, "logps/chosen": -380.0, "logps/rejected": -310.0, "loss": 0.2941, "rewards/accuracies": 0.859375, "rewards/chosen": 1.1796875, "rewards/margins": 5.0, "rewards/rejected": -3.828125, "step": 143 }, { "epoch": 0.17668711656441718, "grad_norm": 40.697834722668915, "learning_rate": 7.606611570247934e-07, "logits/chosen": -0.23828125, "logits/rejected": -0.4296875, "logps/chosen": -416.0, "logps/rejected": -340.0, "loss": 0.2905, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.96875, "rewards/margins": 5.5625, "rewards/rejected": -3.59375, "step": 144 }, { "epoch": 0.17791411042944785, "grad_norm": 39.56968971060715, "learning_rate": 7.603305785123967e-07, "logits/chosen": -0.228515625, "logits/rejected": -0.380859375, "logps/chosen": -380.0, "logps/rejected": -332.0, "loss": 0.2715, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.7109375, "rewards/margins": 5.375, "rewards/rejected": -3.65625, "step": 145 }, { "epoch": 0.17914110429447852, "grad_norm": 34.52865223755899, "learning_rate": 7.599999999999999e-07, "logits/chosen": -0.21484375, "logits/rejected": -0.333984375, "logps/chosen": -384.0, "logps/rejected": -316.0, "loss": 0.2436, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.0546875, "rewards/margins": 4.84375, "rewards/rejected": -3.78125, "step": 146 }, { "epoch": 0.18036809815950922, "grad_norm": 35.86987627703754, "learning_rate": 7.596694214876032e-07, "logits/chosen": -0.21484375, "logits/rejected": -0.37109375, "logps/chosen": -384.0, "logps/rejected": -316.0, "loss": 0.2741, "rewards/accuracies": 0.859375, "rewards/chosen": 1.84375, "rewards/margins": 5.5625, "rewards/rejected": -3.71875, "step": 147 }, { "epoch": 0.18159509202453988, "grad_norm": 49.681572441729514, "learning_rate": 7.593388429752066e-07, "logits/chosen": -0.23828125, "logits/rejected": -0.376953125, "logps/chosen": -412.0, "logps/rejected": -350.0, "loss": 0.3761, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.3046875, "rewards/margins": 4.9375, "rewards/rejected": -3.625, "step": 148 }, { "epoch": 0.18282208588957055, "grad_norm": 43.932202256712266, "learning_rate": 7.590082644628099e-07, "logits/chosen": -0.11474609375, "logits/rejected": -0.279296875, "logps/chosen": -402.0, "logps/rejected": -366.0, "loss": 0.2534, "rewards/accuracies": 0.875, "rewards/chosen": 1.984375, "rewards/margins": 5.375, "rewards/rejected": -3.390625, "step": 149 }, { "epoch": 0.18404907975460122, "grad_norm": 39.402366627439726, "learning_rate": 7.586776859504132e-07, "logits/chosen": -0.146484375, "logits/rejected": -0.330078125, "logps/chosen": -422.0, "logps/rejected": -332.0, "loss": 0.3158, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.6328125, "rewards/margins": 4.71875, "rewards/rejected": -3.09375, "step": 150 }, { "epoch": 0.18527607361963191, "grad_norm": 41.79252221918161, "learning_rate": 7.583471074380165e-07, "logits/chosen": -0.1591796875, "logits/rejected": -0.291015625, "logps/chosen": -378.0, "logps/rejected": -310.0, "loss": 0.3211, "rewards/accuracies": 0.828125, "rewards/chosen": 1.640625, "rewards/margins": 4.65625, "rewards/rejected": -3.03125, "step": 151 }, { "epoch": 0.18650306748466258, "grad_norm": 35.715508495832665, "learning_rate": 7.580165289256198e-07, "logits/chosen": -0.25, "logits/rejected": -0.494140625, "logps/chosen": -394.0, "logps/rejected": -298.0, "loss": 0.2622, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.5234375, "rewards/margins": 5.4375, "rewards/rejected": -3.921875, "step": 152 }, { "epoch": 0.18773006134969325, "grad_norm": 36.417969122212845, "learning_rate": 7.576859504132231e-07, "logits/chosen": -0.22265625, "logits/rejected": -0.33984375, "logps/chosen": -346.0, "logps/rejected": -304.0, "loss": 0.2871, "rewards/accuracies": 0.84375, "rewards/chosen": 1.625, "rewards/margins": 5.03125, "rewards/rejected": -3.390625, "step": 153 }, { "epoch": 0.18895705521472392, "grad_norm": 45.428337431051204, "learning_rate": 7.573553719008265e-07, "logits/chosen": -0.09716796875, "logits/rejected": -0.2890625, "logps/chosen": -420.0, "logps/rejected": -328.0, "loss": 0.3165, "rewards/accuracies": 0.8046875, "rewards/chosen": 2.046875, "rewards/margins": 5.03125, "rewards/rejected": -2.984375, "step": 154 }, { "epoch": 0.1901840490797546, "grad_norm": 28.34310543484037, "learning_rate": 7.570247933884297e-07, "logits/chosen": -0.2060546875, "logits/rejected": -0.455078125, "logps/chosen": -380.0, "logps/rejected": -306.0, "loss": 0.1864, "rewards/accuracies": 0.90625, "rewards/chosen": 2.5625, "rewards/margins": 6.21875, "rewards/rejected": -3.65625, "step": 155 }, { "epoch": 0.19141104294478528, "grad_norm": 43.05423041815277, "learning_rate": 7.56694214876033e-07, "logits/chosen": -0.11865234375, "logits/rejected": -0.2314453125, "logps/chosen": -366.0, "logps/rejected": -336.0, "loss": 0.2995, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.4765625, "rewards/margins": 4.5625, "rewards/rejected": -3.09375, "step": 156 }, { "epoch": 0.19263803680981595, "grad_norm": 35.31331641855709, "learning_rate": 7.563636363636363e-07, "logits/chosen": -0.11474609375, "logits/rejected": -0.244140625, "logps/chosen": -392.0, "logps/rejected": -296.0, "loss": 0.2791, "rewards/accuracies": 0.875, "rewards/chosen": 1.5390625, "rewards/margins": 4.875, "rewards/rejected": -3.328125, "step": 157 }, { "epoch": 0.19386503067484662, "grad_norm": 32.52885612180771, "learning_rate": 7.560330578512396e-07, "logits/chosen": -0.30859375, "logits/rejected": -0.498046875, "logps/chosen": -384.0, "logps/rejected": -308.0, "loss": 0.2615, "rewards/accuracies": 0.84375, "rewards/chosen": 1.703125, "rewards/margins": 5.375, "rewards/rejected": -3.6875, "step": 158 }, { "epoch": 0.1950920245398773, "grad_norm": 40.74250145862389, "learning_rate": 7.55702479338843e-07, "logits/chosen": -0.2099609375, "logits/rejected": -0.341796875, "logps/chosen": -356.0, "logps/rejected": -318.0, "loss": 0.312, "rewards/accuracies": 0.84375, "rewards/chosen": 1.6640625, "rewards/margins": 4.90625, "rewards/rejected": -3.25, "step": 159 }, { "epoch": 0.19631901840490798, "grad_norm": 32.03909927740134, "learning_rate": 7.553719008264463e-07, "logits/chosen": -0.10009765625, "logits/rejected": -0.326171875, "logps/chosen": -352.0, "logps/rejected": -296.0, "loss": 0.2149, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.2421875, "rewards/margins": 5.0, "rewards/rejected": -3.765625, "step": 160 }, { "epoch": 0.19754601226993865, "grad_norm": 33.48229976640365, "learning_rate": 7.550413223140496e-07, "logits/chosen": -0.271484375, "logits/rejected": -0.478515625, "logps/chosen": -386.0, "logps/rejected": -290.0, "loss": 0.2313, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.8984375, "rewards/margins": 5.59375, "rewards/rejected": -3.703125, "step": 161 }, { "epoch": 0.19877300613496932, "grad_norm": 44.9989690142436, "learning_rate": 7.547107438016529e-07, "logits/chosen": -0.1923828125, "logits/rejected": -0.275390625, "logps/chosen": -350.0, "logps/rejected": -330.0, "loss": 0.3547, "rewards/accuracies": 0.8125, "rewards/chosen": 1.4375, "rewards/margins": 4.84375, "rewards/rejected": -3.390625, "step": 162 }, { "epoch": 0.2, "grad_norm": 45.392211600179095, "learning_rate": 7.543801652892561e-07, "logits/chosen": -0.1318359375, "logits/rejected": -0.28125, "logps/chosen": -392.0, "logps/rejected": -330.0, "loss": 0.3203, "rewards/accuracies": 0.828125, "rewards/chosen": 1.4765625, "rewards/margins": 4.90625, "rewards/rejected": -3.4375, "step": 163 }, { "epoch": 0.20122699386503068, "grad_norm": 30.10144812491185, "learning_rate": 7.540495867768594e-07, "logits/chosen": -0.275390625, "logits/rejected": -0.515625, "logps/chosen": -392.0, "logps/rejected": -298.0, "loss": 0.2205, "rewards/accuracies": 0.859375, "rewards/chosen": 2.125, "rewards/margins": 6.09375, "rewards/rejected": -3.953125, "step": 164 }, { "epoch": 0.20245398773006135, "grad_norm": 41.70055038557836, "learning_rate": 7.537190082644627e-07, "logits/chosen": -0.078125, "logits/rejected": -0.283203125, "logps/chosen": -440.0, "logps/rejected": -314.0, "loss": 0.2684, "rewards/accuracies": 0.875, "rewards/chosen": 1.7578125, "rewards/margins": 5.25, "rewards/rejected": -3.484375, "step": 165 }, { "epoch": 0.20368098159509201, "grad_norm": 40.19134249676154, "learning_rate": 7.533884297520661e-07, "logits/chosen": -0.1435546875, "logits/rejected": -0.37890625, "logps/chosen": -388.0, "logps/rejected": -322.0, "loss": 0.3382, "rewards/accuracies": 0.828125, "rewards/chosen": 2.03125, "rewards/margins": 5.34375, "rewards/rejected": -3.296875, "step": 166 }, { "epoch": 0.2049079754601227, "grad_norm": 40.73221481198693, "learning_rate": 7.530578512396694e-07, "logits/chosen": -0.1240234375, "logits/rejected": -0.279296875, "logps/chosen": -400.0, "logps/rejected": -306.0, "loss": 0.3475, "rewards/accuracies": 0.8125, "rewards/chosen": 2.21875, "rewards/margins": 5.625, "rewards/rejected": -3.40625, "step": 167 }, { "epoch": 0.20613496932515338, "grad_norm": 36.56704570459498, "learning_rate": 7.527272727272727e-07, "logits/chosen": -0.10888671875, "logits/rejected": -0.2236328125, "logps/chosen": -346.0, "logps/rejected": -276.0, "loss": 0.2594, "rewards/accuracies": 0.859375, "rewards/chosen": 1.1796875, "rewards/margins": 5.1875, "rewards/rejected": -4.0, "step": 168 }, { "epoch": 0.20736196319018405, "grad_norm": 36.86789794879476, "learning_rate": 7.52396694214876e-07, "logits/chosen": -0.185546875, "logits/rejected": -0.3515625, "logps/chosen": -370.0, "logps/rejected": -350.0, "loss": 0.2793, "rewards/accuracies": 0.84375, "rewards/chosen": 1.1875, "rewards/margins": 4.9375, "rewards/rejected": -3.75, "step": 169 }, { "epoch": 0.2085889570552147, "grad_norm": 43.700977925857806, "learning_rate": 7.520661157024793e-07, "logits/chosen": -0.171875, "logits/rejected": -0.416015625, "logps/chosen": -448.0, "logps/rejected": -328.0, "loss": 0.2994, "rewards/accuracies": 0.8203125, "rewards/chosen": 2.046875, "rewards/margins": 5.8125, "rewards/rejected": -3.765625, "step": 170 }, { "epoch": 0.2098159509202454, "grad_norm": 33.49786387415663, "learning_rate": 7.517355371900827e-07, "logits/chosen": -0.1591796875, "logits/rejected": -0.349609375, "logps/chosen": -382.0, "logps/rejected": -302.0, "loss": 0.2804, "rewards/accuracies": 0.890625, "rewards/chosen": 1.7734375, "rewards/margins": 5.84375, "rewards/rejected": -4.0625, "step": 171 }, { "epoch": 0.21104294478527608, "grad_norm": 36.775839118353844, "learning_rate": 7.514049586776859e-07, "logits/chosen": -0.12890625, "logits/rejected": -0.294921875, "logps/chosen": -436.0, "logps/rejected": -334.0, "loss": 0.2514, "rewards/accuracies": 0.875, "rewards/chosen": 2.03125, "rewards/margins": 6.0625, "rewards/rejected": -4.03125, "step": 172 }, { "epoch": 0.21226993865030674, "grad_norm": 29.010747243935523, "learning_rate": 7.510743801652892e-07, "logits/chosen": -0.1845703125, "logits/rejected": -0.423828125, "logps/chosen": -422.0, "logps/rejected": -338.0, "loss": 0.2075, "rewards/accuracies": 0.875, "rewards/chosen": 2.296875, "rewards/margins": 6.40625, "rewards/rejected": -4.125, "step": 173 }, { "epoch": 0.2134969325153374, "grad_norm": 42.10282379400345, "learning_rate": 7.507438016528925e-07, "logits/chosen": -0.035400390625, "logits/rejected": -0.248046875, "logps/chosen": -378.0, "logps/rejected": -326.0, "loss": 0.3371, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.484375, "rewards/margins": 5.375, "rewards/rejected": -3.890625, "step": 174 }, { "epoch": 0.2147239263803681, "grad_norm": 44.4053310320228, "learning_rate": 7.504132231404958e-07, "logits/chosen": -0.17578125, "logits/rejected": -0.3125, "logps/chosen": -392.0, "logps/rejected": -344.0, "loss": 0.3132, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.9609375, "rewards/margins": 5.875, "rewards/rejected": -3.921875, "step": 175 }, { "epoch": 0.21595092024539878, "grad_norm": 38.79125305740806, "learning_rate": 7.500826446280991e-07, "logits/chosen": -0.208984375, "logits/rejected": -0.400390625, "logps/chosen": -428.0, "logps/rejected": -354.0, "loss": 0.315, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.9453125, "rewards/margins": 5.8125, "rewards/rejected": -3.875, "step": 176 }, { "epoch": 0.21717791411042944, "grad_norm": 29.08349894872895, "learning_rate": 7.497520661157025e-07, "logits/chosen": -0.1552734375, "logits/rejected": -0.388671875, "logps/chosen": -412.0, "logps/rejected": -332.0, "loss": 0.2249, "rewards/accuracies": 0.8671875, "rewards/chosen": 2.453125, "rewards/margins": 6.84375, "rewards/rejected": -4.375, "step": 177 }, { "epoch": 0.2184049079754601, "grad_norm": 39.84454997153339, "learning_rate": 7.494214876033058e-07, "logits/chosen": -0.15234375, "logits/rejected": -0.3046875, "logps/chosen": -324.0, "logps/rejected": -296.0, "loss": 0.3147, "rewards/accuracies": 0.8125, "rewards/chosen": 0.79296875, "rewards/margins": 5.1875, "rewards/rejected": -4.375, "step": 178 }, { "epoch": 0.2196319018404908, "grad_norm": 32.49552053062871, "learning_rate": 7.490909090909091e-07, "logits/chosen": -0.189453125, "logits/rejected": -0.3984375, "logps/chosen": -368.0, "logps/rejected": -306.0, "loss": 0.2585, "rewards/accuracies": 0.859375, "rewards/chosen": 1.0390625, "rewards/margins": 5.375, "rewards/rejected": -4.34375, "step": 179 }, { "epoch": 0.22085889570552147, "grad_norm": 41.53796098392134, "learning_rate": 7.487603305785124e-07, "logits/chosen": -0.1875, "logits/rejected": -0.314453125, "logps/chosen": -356.0, "logps/rejected": -300.0, "loss": 0.3355, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.265625, "rewards/margins": 5.0, "rewards/rejected": -3.75, "step": 180 }, { "epoch": 0.22208588957055214, "grad_norm": 43.27113784190138, "learning_rate": 7.484297520661156e-07, "logits/chosen": -0.1748046875, "logits/rejected": -0.3359375, "logps/chosen": -410.0, "logps/rejected": -372.0, "loss": 0.3558, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.5546875, "rewards/margins": 5.59375, "rewards/rejected": -4.03125, "step": 181 }, { "epoch": 0.2233128834355828, "grad_norm": 40.060092182372635, "learning_rate": 7.480991735537189e-07, "logits/chosen": -0.2099609375, "logits/rejected": -0.345703125, "logps/chosen": -372.0, "logps/rejected": -316.0, "loss": 0.3329, "rewards/accuracies": 0.828125, "rewards/chosen": 0.92578125, "rewards/margins": 5.0, "rewards/rejected": -4.0625, "step": 182 }, { "epoch": 0.2245398773006135, "grad_norm": 42.893284410160845, "learning_rate": 7.477685950413223e-07, "logits/chosen": -0.0888671875, "logits/rejected": -0.275390625, "logps/chosen": -412.0, "logps/rejected": -374.0, "loss": 0.3303, "rewards/accuracies": 0.8046875, "rewards/chosen": 0.96484375, "rewards/margins": 4.65625, "rewards/rejected": -3.703125, "step": 183 }, { "epoch": 0.22576687116564417, "grad_norm": 44.81738203832481, "learning_rate": 7.474380165289256e-07, "logits/chosen": -0.12255859375, "logits/rejected": -0.2431640625, "logps/chosen": -390.0, "logps/rejected": -336.0, "loss": 0.3382, "rewards/accuracies": 0.7890625, "rewards/chosen": 0.77734375, "rewards/margins": 4.84375, "rewards/rejected": -4.0625, "step": 184 }, { "epoch": 0.22699386503067484, "grad_norm": 49.18179746490089, "learning_rate": 7.471074380165289e-07, "logits/chosen": -0.1650390625, "logits/rejected": -0.2373046875, "logps/chosen": -384.0, "logps/rejected": -348.0, "loss": 0.3425, "rewards/accuracies": 0.8125, "rewards/chosen": 1.671875, "rewards/margins": 5.40625, "rewards/rejected": -3.734375, "step": 185 }, { "epoch": 0.2282208588957055, "grad_norm": 38.62632364463619, "learning_rate": 7.467768595041322e-07, "logits/chosen": -0.177734375, "logits/rejected": -0.30859375, "logps/chosen": -338.0, "logps/rejected": -308.0, "loss": 0.3061, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.3671875, "rewards/margins": 5.3125, "rewards/rejected": -3.953125, "step": 186 }, { "epoch": 0.2294478527607362, "grad_norm": 37.48238102625356, "learning_rate": 7.464462809917355e-07, "logits/chosen": -0.1611328125, "logits/rejected": -0.333984375, "logps/chosen": -374.0, "logps/rejected": -336.0, "loss": 0.2719, "rewards/accuracies": 0.859375, "rewards/chosen": 1.328125, "rewards/margins": 5.71875, "rewards/rejected": -4.375, "step": 187 }, { "epoch": 0.23067484662576687, "grad_norm": 33.9965710800535, "learning_rate": 7.461157024793388e-07, "logits/chosen": -0.0712890625, "logits/rejected": -0.1689453125, "logps/chosen": -332.0, "logps/rejected": -288.0, "loss": 0.2908, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.3125, "rewards/margins": 5.40625, "rewards/rejected": -4.09375, "step": 188 }, { "epoch": 0.23190184049079754, "grad_norm": 32.6251624460159, "learning_rate": 7.457851239669422e-07, "logits/chosen": -0.16015625, "logits/rejected": -0.353515625, "logps/chosen": -398.0, "logps/rejected": -318.0, "loss": 0.2196, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.75, "rewards/margins": 6.0625, "rewards/rejected": -4.3125, "step": 189 }, { "epoch": 0.2331288343558282, "grad_norm": 33.86427029616883, "learning_rate": 7.454545454545454e-07, "logits/chosen": -0.05810546875, "logits/rejected": -0.224609375, "logps/chosen": -342.0, "logps/rejected": -308.0, "loss": 0.2859, "rewards/accuracies": 0.84375, "rewards/chosen": 1.21875, "rewards/margins": 5.09375, "rewards/rejected": -3.875, "step": 190 }, { "epoch": 0.2343558282208589, "grad_norm": 48.95754374693823, "learning_rate": 7.451239669421487e-07, "logits/chosen": -0.12890625, "logits/rejected": -0.318359375, "logps/chosen": -400.0, "logps/rejected": -298.0, "loss": 0.3495, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.78125, "rewards/margins": 5.96875, "rewards/rejected": -4.1875, "step": 191 }, { "epoch": 0.23558282208588957, "grad_norm": 44.694192367882906, "learning_rate": 7.44793388429752e-07, "logits/chosen": -0.140625, "logits/rejected": -0.345703125, "logps/chosen": -386.0, "logps/rejected": -292.0, "loss": 0.3014, "rewards/accuracies": 0.828125, "rewards/chosen": 1.265625, "rewards/margins": 4.84375, "rewards/rejected": -3.578125, "step": 192 }, { "epoch": 0.23680981595092024, "grad_norm": 34.25684662561766, "learning_rate": 7.444628099173553e-07, "logits/chosen": -0.2578125, "logits/rejected": -0.51171875, "logps/chosen": -408.0, "logps/rejected": -332.0, "loss": 0.2177, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.875, "rewards/margins": 6.15625, "rewards/rejected": -4.28125, "step": 193 }, { "epoch": 0.23803680981595093, "grad_norm": 39.119509435238996, "learning_rate": 7.441322314049586e-07, "logits/chosen": -0.306640625, "logits/rejected": -0.431640625, "logps/chosen": -392.0, "logps/rejected": -320.0, "loss": 0.2953, "rewards/accuracies": 0.828125, "rewards/chosen": 1.046875, "rewards/margins": 5.46875, "rewards/rejected": -4.4375, "step": 194 }, { "epoch": 0.2392638036809816, "grad_norm": 34.817335787332766, "learning_rate": 7.43801652892562e-07, "logits/chosen": -0.1181640625, "logits/rejected": -0.38671875, "logps/chosen": -408.0, "logps/rejected": -332.0, "loss": 0.2301, "rewards/accuracies": 0.875, "rewards/chosen": 2.1875, "rewards/margins": 6.625, "rewards/rejected": -4.4375, "step": 195 }, { "epoch": 0.24049079754601227, "grad_norm": 40.102802913255154, "learning_rate": 7.434710743801653e-07, "logits/chosen": -0.09130859375, "logits/rejected": -0.298828125, "logps/chosen": -390.0, "logps/rejected": -290.0, "loss": 0.297, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.453125, "rewards/margins": 5.28125, "rewards/rejected": -3.828125, "step": 196 }, { "epoch": 0.24171779141104294, "grad_norm": 34.798967486094014, "learning_rate": 7.431404958677686e-07, "logits/chosen": -0.2041015625, "logits/rejected": -0.453125, "logps/chosen": -376.0, "logps/rejected": -318.0, "loss": 0.2803, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.7421875, "rewards/margins": 5.8125, "rewards/rejected": -4.0625, "step": 197 }, { "epoch": 0.24294478527607363, "grad_norm": 39.54376141056963, "learning_rate": 7.428099173553719e-07, "logits/chosen": -0.1318359375, "logits/rejected": -0.2265625, "logps/chosen": -340.0, "logps/rejected": -258.0, "loss": 0.3347, "rewards/accuracies": 0.828125, "rewards/chosen": 1.265625, "rewards/margins": 4.9375, "rewards/rejected": -3.671875, "step": 198 }, { "epoch": 0.2441717791411043, "grad_norm": 29.961664099131877, "learning_rate": 7.424793388429751e-07, "logits/chosen": -0.158203125, "logits/rejected": -0.373046875, "logps/chosen": -428.0, "logps/rejected": -310.0, "loss": 0.1903, "rewards/accuracies": 0.9140625, "rewards/chosen": 2.359375, "rewards/margins": 6.46875, "rewards/rejected": -4.09375, "step": 199 }, { "epoch": 0.24539877300613497, "grad_norm": 41.86791512110987, "learning_rate": 7.421487603305784e-07, "logits/chosen": -0.1337890625, "logits/rejected": -0.359375, "logps/chosen": -432.0, "logps/rejected": -370.0, "loss": 0.3056, "rewards/accuracies": 0.84375, "rewards/chosen": 2.203125, "rewards/margins": 6.125, "rewards/rejected": -3.921875, "step": 200 }, { "epoch": 0.24662576687116564, "grad_norm": 32.0817049971399, "learning_rate": 7.418181818181818e-07, "logits/chosen": -0.1435546875, "logits/rejected": -0.373046875, "logps/chosen": -394.0, "logps/rejected": -308.0, "loss": 0.2166, "rewards/accuracies": 0.890625, "rewards/chosen": 2.0625, "rewards/margins": 5.78125, "rewards/rejected": -3.734375, "step": 201 }, { "epoch": 0.24785276073619633, "grad_norm": 35.7245529395789, "learning_rate": 7.414876033057851e-07, "logits/chosen": -0.12060546875, "logits/rejected": -0.33984375, "logps/chosen": -422.0, "logps/rejected": -318.0, "loss": 0.2641, "rewards/accuracies": 0.8359375, "rewards/chosen": 2.109375, "rewards/margins": 5.75, "rewards/rejected": -3.640625, "step": 202 }, { "epoch": 0.249079754601227, "grad_norm": 42.27175209208064, "learning_rate": 7.411570247933884e-07, "logits/chosen": -0.08935546875, "logits/rejected": -0.271484375, "logps/chosen": -384.0, "logps/rejected": -334.0, "loss": 0.4055, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.8828125, "rewards/margins": 4.90625, "rewards/rejected": -3.03125, "step": 203 }, { "epoch": 0.25030674846625767, "grad_norm": 39.50994905620242, "learning_rate": 7.408264462809917e-07, "logits/chosen": -0.0771484375, "logits/rejected": -0.2255859375, "logps/chosen": -346.0, "logps/rejected": -268.0, "loss": 0.3395, "rewards/accuracies": 0.828125, "rewards/chosen": 1.671875, "rewards/margins": 5.34375, "rewards/rejected": -3.671875, "step": 204 }, { "epoch": 0.25153374233128833, "grad_norm": 37.49332179023069, "learning_rate": 7.40495867768595e-07, "logits/chosen": -0.02880859375, "logits/rejected": -0.173828125, "logps/chosen": -380.0, "logps/rejected": -298.0, "loss": 0.3209, "rewards/accuracies": 0.84375, "rewards/chosen": 1.84375, "rewards/margins": 5.125, "rewards/rejected": -3.265625, "step": 205 }, { "epoch": 0.252760736196319, "grad_norm": 27.399492756017406, "learning_rate": 7.401652892561984e-07, "logits/chosen": -0.1279296875, "logits/rejected": -0.4140625, "logps/chosen": -426.0, "logps/rejected": -330.0, "loss": 0.2051, "rewards/accuracies": 0.921875, "rewards/chosen": 2.1875, "rewards/margins": 6.46875, "rewards/rejected": -4.28125, "step": 206 }, { "epoch": 0.25398773006134967, "grad_norm": 43.41671912422527, "learning_rate": 7.398347107438017e-07, "logits/chosen": -0.251953125, "logits/rejected": -0.4609375, "logps/chosen": -424.0, "logps/rejected": -358.0, "loss": 0.3584, "rewards/accuracies": 0.796875, "rewards/chosen": 2.140625, "rewards/margins": 5.84375, "rewards/rejected": -3.71875, "step": 207 }, { "epoch": 0.2552147239263804, "grad_norm": 38.06892744188352, "learning_rate": 7.395041322314049e-07, "logits/chosen": -0.2236328125, "logits/rejected": -0.357421875, "logps/chosen": -386.0, "logps/rejected": -324.0, "loss": 0.3179, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.71875, "rewards/margins": 5.8125, "rewards/rejected": -4.09375, "step": 208 }, { "epoch": 0.25644171779141106, "grad_norm": 38.21598347000612, "learning_rate": 7.391735537190082e-07, "logits/chosen": -0.2177734375, "logits/rejected": -0.3515625, "logps/chosen": -388.0, "logps/rejected": -336.0, "loss": 0.306, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.640625, "rewards/margins": 5.53125, "rewards/rejected": -3.90625, "step": 209 }, { "epoch": 0.25766871165644173, "grad_norm": 45.46016539899385, "learning_rate": 7.388429752066115e-07, "logits/chosen": -0.1728515625, "logits/rejected": -0.2890625, "logps/chosen": -392.0, "logps/rejected": -364.0, "loss": 0.3476, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.125, "rewards/margins": 5.0625, "rewards/rejected": -3.9375, "step": 210 }, { "epoch": 0.2588957055214724, "grad_norm": 38.3264065355804, "learning_rate": 7.385123966942148e-07, "logits/chosen": -0.259765625, "logits/rejected": -0.466796875, "logps/chosen": -432.0, "logps/rejected": -348.0, "loss": 0.3035, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.546875, "rewards/margins": 6.0625, "rewards/rejected": -4.53125, "step": 211 }, { "epoch": 0.26012269938650306, "grad_norm": 37.36895578645757, "learning_rate": 7.381818181818182e-07, "logits/chosen": -0.1904296875, "logits/rejected": -0.359375, "logps/chosen": -396.0, "logps/rejected": -316.0, "loss": 0.2805, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.8203125, "rewards/margins": 6.09375, "rewards/rejected": -4.28125, "step": 212 }, { "epoch": 0.26134969325153373, "grad_norm": 33.79330367194955, "learning_rate": 7.378512396694215e-07, "logits/chosen": -0.1376953125, "logits/rejected": -0.2119140625, "logps/chosen": -346.0, "logps/rejected": -284.0, "loss": 0.2588, "rewards/accuracies": 0.84375, "rewards/chosen": 1.109375, "rewards/margins": 5.0625, "rewards/rejected": -3.9375, "step": 213 }, { "epoch": 0.2625766871165644, "grad_norm": 41.91194027673872, "learning_rate": 7.375206611570248e-07, "logits/chosen": -0.11328125, "logits/rejected": -0.2890625, "logps/chosen": -372.0, "logps/rejected": -316.0, "loss": 0.3085, "rewards/accuracies": 0.796875, "rewards/chosen": 1.5703125, "rewards/margins": 5.6875, "rewards/rejected": -4.125, "step": 214 }, { "epoch": 0.26380368098159507, "grad_norm": 42.67216156371333, "learning_rate": 7.371900826446281e-07, "logits/chosen": -0.0927734375, "logits/rejected": -0.1953125, "logps/chosen": -350.0, "logps/rejected": -304.0, "loss": 0.3066, "rewards/accuracies": 0.828125, "rewards/chosen": 1.1484375, "rewards/margins": 4.96875, "rewards/rejected": -3.8125, "step": 215 }, { "epoch": 0.2650306748466258, "grad_norm": 41.6917127385005, "learning_rate": 7.368595041322314e-07, "logits/chosen": -0.1494140625, "logits/rejected": -0.2734375, "logps/chosen": -330.0, "logps/rejected": -290.0, "loss": 0.3077, "rewards/accuracies": 0.84375, "rewards/chosen": 0.93359375, "rewards/margins": 4.65625, "rewards/rejected": -3.734375, "step": 216 }, { "epoch": 0.26625766871165646, "grad_norm": 41.999916191643734, "learning_rate": 7.365289256198346e-07, "logits/chosen": -0.05322265625, "logits/rejected": -0.20703125, "logps/chosen": -396.0, "logps/rejected": -304.0, "loss": 0.3621, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.796875, "rewards/margins": 5.21875, "rewards/rejected": -3.421875, "step": 217 }, { "epoch": 0.2674846625766871, "grad_norm": 48.35045291177634, "learning_rate": 7.36198347107438e-07, "logits/chosen": -0.10009765625, "logits/rejected": -0.21875, "logps/chosen": -378.0, "logps/rejected": -332.0, "loss": 0.3724, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.359375, "rewards/margins": 4.875, "rewards/rejected": -3.515625, "step": 218 }, { "epoch": 0.2687116564417178, "grad_norm": 36.99776737120032, "learning_rate": 7.358677685950413e-07, "logits/chosen": -0.1953125, "logits/rejected": -0.30859375, "logps/chosen": -348.0, "logps/rejected": -296.0, "loss": 0.3041, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.4140625, "rewards/margins": 5.28125, "rewards/rejected": -3.875, "step": 219 }, { "epoch": 0.26993865030674846, "grad_norm": 49.4734461720144, "learning_rate": 7.355371900826446e-07, "logits/chosen": -0.05078125, "logits/rejected": -0.1318359375, "logps/chosen": -362.0, "logps/rejected": -358.0, "loss": 0.3781, "rewards/accuracies": 0.78125, "rewards/chosen": 0.95703125, "rewards/margins": 4.375, "rewards/rejected": -3.421875, "step": 220 }, { "epoch": 0.27116564417177913, "grad_norm": 50.14968062203286, "learning_rate": 7.352066115702479e-07, "logits/chosen": -0.1455078125, "logits/rejected": -0.357421875, "logps/chosen": -358.0, "logps/rejected": -292.0, "loss": 0.3828, "rewards/accuracies": 0.765625, "rewards/chosen": 1.1484375, "rewards/margins": 4.9375, "rewards/rejected": -3.796875, "step": 221 }, { "epoch": 0.2723926380368098, "grad_norm": 35.95574239692987, "learning_rate": 7.348760330578512e-07, "logits/chosen": -0.314453125, "logits/rejected": -0.462890625, "logps/chosen": -382.0, "logps/rejected": -302.0, "loss": 0.2649, "rewards/accuracies": 0.8671875, "rewards/chosen": 2.09375, "rewards/margins": 6.28125, "rewards/rejected": -4.15625, "step": 222 }, { "epoch": 0.27361963190184047, "grad_norm": 40.443295860960646, "learning_rate": 7.345454545454545e-07, "logits/chosen": -0.1279296875, "logits/rejected": -0.314453125, "logps/chosen": -382.0, "logps/rejected": -320.0, "loss": 0.2888, "rewards/accuracies": 0.84375, "rewards/chosen": 1.3515625, "rewards/margins": 5.09375, "rewards/rejected": -3.75, "step": 223 }, { "epoch": 0.2748466257668712, "grad_norm": 42.19474227390439, "learning_rate": 7.342148760330579e-07, "logits/chosen": -0.228515625, "logits/rejected": -0.41796875, "logps/chosen": -446.0, "logps/rejected": -334.0, "loss": 0.288, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.9453125, "rewards/margins": 6.03125, "rewards/rejected": -4.09375, "step": 224 }, { "epoch": 0.27607361963190186, "grad_norm": 37.9965018970918, "learning_rate": 7.338842975206612e-07, "logits/chosen": -0.10546875, "logits/rejected": -0.306640625, "logps/chosen": -336.0, "logps/rejected": -304.0, "loss": 0.261, "rewards/accuracies": 0.84375, "rewards/chosen": 1.265625, "rewards/margins": 5.65625, "rewards/rejected": -4.40625, "step": 225 }, { "epoch": 0.2773006134969325, "grad_norm": 38.80764018954137, "learning_rate": 7.335537190082644e-07, "logits/chosen": -0.119140625, "logits/rejected": -0.265625, "logps/chosen": -368.0, "logps/rejected": -312.0, "loss": 0.3311, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.703125, "rewards/margins": 5.59375, "rewards/rejected": -3.890625, "step": 226 }, { "epoch": 0.2785276073619632, "grad_norm": 42.55177823975192, "learning_rate": 7.332231404958677e-07, "logits/chosen": -0.154296875, "logits/rejected": -0.2373046875, "logps/chosen": -356.0, "logps/rejected": -316.0, "loss": 0.3198, "rewards/accuracies": 0.84375, "rewards/chosen": 1.3515625, "rewards/margins": 5.78125, "rewards/rejected": -4.40625, "step": 227 }, { "epoch": 0.27975460122699386, "grad_norm": 47.83061041994659, "learning_rate": 7.32892561983471e-07, "logits/chosen": -0.162109375, "logits/rejected": -0.353515625, "logps/chosen": -362.0, "logps/rejected": -324.0, "loss": 0.3258, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.09375, "rewards/margins": 5.21875, "rewards/rejected": -4.125, "step": 228 }, { "epoch": 0.2809815950920245, "grad_norm": 36.471929966124165, "learning_rate": 7.325619834710743e-07, "logits/chosen": -0.07373046875, "logits/rejected": -0.283203125, "logps/chosen": -418.0, "logps/rejected": -336.0, "loss": 0.2558, "rewards/accuracies": 0.875, "rewards/chosen": 1.9921875, "rewards/margins": 5.5625, "rewards/rejected": -3.59375, "step": 229 }, { "epoch": 0.2822085889570552, "grad_norm": 36.373451110997884, "learning_rate": 7.322314049586777e-07, "logits/chosen": -0.06884765625, "logits/rejected": -0.259765625, "logps/chosen": -370.0, "logps/rejected": -324.0, "loss": 0.2454, "rewards/accuracies": 0.84375, "rewards/chosen": 1.4375, "rewards/margins": 5.71875, "rewards/rejected": -4.28125, "step": 230 }, { "epoch": 0.28343558282208586, "grad_norm": 44.837599338102365, "learning_rate": 7.31900826446281e-07, "logits/chosen": -0.14453125, "logits/rejected": -0.265625, "logps/chosen": -364.0, "logps/rejected": -310.0, "loss": 0.3895, "rewards/accuracies": 0.796875, "rewards/chosen": 1.4609375, "rewards/margins": 5.09375, "rewards/rejected": -3.625, "step": 231 }, { "epoch": 0.2846625766871166, "grad_norm": 40.26904672106654, "learning_rate": 7.315702479338843e-07, "logits/chosen": -0.2109375, "logits/rejected": -0.3515625, "logps/chosen": -382.0, "logps/rejected": -334.0, "loss": 0.3097, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.015625, "rewards/margins": 5.09375, "rewards/rejected": -4.0625, "step": 232 }, { "epoch": 0.28588957055214725, "grad_norm": 37.854698103189165, "learning_rate": 7.312396694214876e-07, "logits/chosen": -0.10888671875, "logits/rejected": -0.33984375, "logps/chosen": -370.0, "logps/rejected": -288.0, "loss": 0.3055, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.8125, "rewards/margins": 5.875, "rewards/rejected": -4.0625, "step": 233 }, { "epoch": 0.2871165644171779, "grad_norm": 38.018318477115464, "learning_rate": 7.309090909090909e-07, "logits/chosen": -0.251953125, "logits/rejected": -0.3828125, "logps/chosen": -370.0, "logps/rejected": -312.0, "loss": 0.2977, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.65625, "rewards/margins": 5.375, "rewards/rejected": -3.71875, "step": 234 }, { "epoch": 0.2883435582822086, "grad_norm": 37.47355891059506, "learning_rate": 7.305785123966941e-07, "logits/chosen": -0.267578125, "logits/rejected": -0.423828125, "logps/chosen": -358.0, "logps/rejected": -320.0, "loss": 0.284, "rewards/accuracies": 0.828125, "rewards/chosen": 1.65625, "rewards/margins": 5.71875, "rewards/rejected": -4.0625, "step": 235 }, { "epoch": 0.28957055214723926, "grad_norm": 53.75756263750908, "learning_rate": 7.302479338842975e-07, "logits/chosen": -0.0238037109375, "logits/rejected": -0.2080078125, "logps/chosen": -392.0, "logps/rejected": -368.0, "loss": 0.4235, "rewards/accuracies": 0.8203125, "rewards/chosen": 2.125, "rewards/margins": 5.3125, "rewards/rejected": -3.1875, "step": 236 }, { "epoch": 0.2907975460122699, "grad_norm": 34.35888091553625, "learning_rate": 7.299173553719008e-07, "logits/chosen": -0.171875, "logits/rejected": -0.32421875, "logps/chosen": -366.0, "logps/rejected": -308.0, "loss": 0.2606, "rewards/accuracies": 0.890625, "rewards/chosen": 1.75, "rewards/margins": 5.84375, "rewards/rejected": -4.09375, "step": 237 }, { "epoch": 0.2920245398773006, "grad_norm": 42.88801905010467, "learning_rate": 7.295867768595041e-07, "logits/chosen": -0.1884765625, "logits/rejected": -0.349609375, "logps/chosen": -424.0, "logps/rejected": -352.0, "loss": 0.3538, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.7578125, "rewards/margins": 5.65625, "rewards/rejected": -3.90625, "step": 238 }, { "epoch": 0.29325153374233126, "grad_norm": 42.29179859412283, "learning_rate": 7.292561983471074e-07, "logits/chosen": -0.1982421875, "logits/rejected": -0.388671875, "logps/chosen": -382.0, "logps/rejected": -312.0, "loss": 0.3291, "rewards/accuracies": 0.8359375, "rewards/chosen": 2.109375, "rewards/margins": 6.28125, "rewards/rejected": -4.15625, "step": 239 }, { "epoch": 0.294478527607362, "grad_norm": 37.481940316076816, "learning_rate": 7.289256198347107e-07, "logits/chosen": -0.21484375, "logits/rejected": -0.37109375, "logps/chosen": -418.0, "logps/rejected": -360.0, "loss": 0.2328, "rewards/accuracies": 0.875, "rewards/chosen": 1.890625, "rewards/margins": 6.59375, "rewards/rejected": -4.6875, "step": 240 }, { "epoch": 0.29570552147239265, "grad_norm": 37.13709897048156, "learning_rate": 7.28595041322314e-07, "logits/chosen": -0.154296875, "logits/rejected": -0.291015625, "logps/chosen": -364.0, "logps/rejected": -332.0, "loss": 0.2698, "rewards/accuracies": 0.8359375, "rewards/chosen": 2.03125, "rewards/margins": 6.28125, "rewards/rejected": -4.25, "step": 241 }, { "epoch": 0.2969325153374233, "grad_norm": 30.985673644793227, "learning_rate": 7.282644628099174e-07, "logits/chosen": -0.16796875, "logits/rejected": -0.3359375, "logps/chosen": -348.0, "logps/rejected": -318.0, "loss": 0.228, "rewards/accuracies": 0.890625, "rewards/chosen": 1.40625, "rewards/margins": 6.25, "rewards/rejected": -4.84375, "step": 242 }, { "epoch": 0.298159509202454, "grad_norm": 53.9279211325065, "learning_rate": 7.279338842975206e-07, "logits/chosen": -0.2490234375, "logits/rejected": -0.400390625, "logps/chosen": -390.0, "logps/rejected": -364.0, "loss": 0.3208, "rewards/accuracies": 0.828125, "rewards/chosen": 1.28125, "rewards/margins": 5.625, "rewards/rejected": -4.34375, "step": 243 }, { "epoch": 0.29938650306748466, "grad_norm": 44.157193824232536, "learning_rate": 7.276033057851239e-07, "logits/chosen": -0.2431640625, "logits/rejected": -0.462890625, "logps/chosen": -386.0, "logps/rejected": -346.0, "loss": 0.4473, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.2578125, "rewards/margins": 5.40625, "rewards/rejected": -4.125, "step": 244 }, { "epoch": 0.3006134969325153, "grad_norm": 36.965116220324916, "learning_rate": 7.272727272727272e-07, "logits/chosen": -0.2138671875, "logits/rejected": -0.359375, "logps/chosen": -402.0, "logps/rejected": -352.0, "loss": 0.2506, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.6953125, "rewards/margins": 6.15625, "rewards/rejected": -4.46875, "step": 245 }, { "epoch": 0.301840490797546, "grad_norm": 35.79905789258026, "learning_rate": 7.269421487603305e-07, "logits/chosen": -0.2158203125, "logits/rejected": -0.380859375, "logps/chosen": -374.0, "logps/rejected": -346.0, "loss": 0.292, "rewards/accuracies": 0.828125, "rewards/chosen": 2.078125, "rewards/margins": 6.46875, "rewards/rejected": -4.40625, "step": 246 }, { "epoch": 0.3030674846625767, "grad_norm": 46.030369589419166, "learning_rate": 7.266115702479338e-07, "logits/chosen": -0.21484375, "logits/rejected": -0.400390625, "logps/chosen": -374.0, "logps/rejected": -308.0, "loss": 0.3237, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.96484375, "rewards/margins": 5.71875, "rewards/rejected": -4.75, "step": 247 }, { "epoch": 0.3042944785276074, "grad_norm": 38.420936945371935, "learning_rate": 7.262809917355372e-07, "logits/chosen": -0.1337890625, "logits/rejected": -0.384765625, "logps/chosen": -392.0, "logps/rejected": -332.0, "loss": 0.2497, "rewards/accuracies": 0.875, "rewards/chosen": 1.4375, "rewards/margins": 5.71875, "rewards/rejected": -4.28125, "step": 248 }, { "epoch": 0.30552147239263805, "grad_norm": 42.67532255005307, "learning_rate": 7.259504132231405e-07, "logits/chosen": -0.25390625, "logits/rejected": -0.453125, "logps/chosen": -476.0, "logps/rejected": -370.0, "loss": 0.2862, "rewards/accuracies": 0.875, "rewards/chosen": 2.328125, "rewards/margins": 6.625, "rewards/rejected": -4.3125, "step": 249 }, { "epoch": 0.3067484662576687, "grad_norm": 40.02525959257945, "learning_rate": 7.256198347107438e-07, "logits/chosen": -0.34375, "logits/rejected": -0.4140625, "logps/chosen": -342.0, "logps/rejected": -324.0, "loss": 0.3299, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.1015625, "rewards/margins": 5.53125, "rewards/rejected": -4.40625, "step": 250 }, { "epoch": 0.3079754601226994, "grad_norm": 43.266430285019, "learning_rate": 7.252892561983471e-07, "logits/chosen": -0.041015625, "logits/rejected": -0.2138671875, "logps/chosen": -376.0, "logps/rejected": -306.0, "loss": 0.3567, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.296875, "rewards/margins": 5.0625, "rewards/rejected": -3.75, "step": 251 }, { "epoch": 0.30920245398773005, "grad_norm": 37.89906733852128, "learning_rate": 7.249586776859503e-07, "logits/chosen": -0.205078125, "logits/rejected": -0.35546875, "logps/chosen": -394.0, "logps/rejected": -310.0, "loss": 0.2982, "rewards/accuracies": 0.828125, "rewards/chosen": 1.7734375, "rewards/margins": 5.625, "rewards/rejected": -3.859375, "step": 252 }, { "epoch": 0.3104294478527607, "grad_norm": 33.28018552295872, "learning_rate": 7.246280991735536e-07, "logits/chosen": -0.208984375, "logits/rejected": -0.44140625, "logps/chosen": -338.0, "logps/rejected": -296.0, "loss": 0.2522, "rewards/accuracies": 0.890625, "rewards/chosen": 1.3046875, "rewards/margins": 5.75, "rewards/rejected": -4.46875, "step": 253 }, { "epoch": 0.3116564417177914, "grad_norm": 42.254563825083, "learning_rate": 7.24297520661157e-07, "logits/chosen": -0.1484375, "logits/rejected": -0.310546875, "logps/chosen": -354.0, "logps/rejected": -318.0, "loss": 0.3681, "rewards/accuracies": 0.796875, "rewards/chosen": 1.6640625, "rewards/margins": 5.8125, "rewards/rejected": -4.15625, "step": 254 }, { "epoch": 0.3128834355828221, "grad_norm": 39.895653943663504, "learning_rate": 7.239669421487603e-07, "logits/chosen": -0.1396484375, "logits/rejected": -0.298828125, "logps/chosen": -384.0, "logps/rejected": -310.0, "loss": 0.3481, "rewards/accuracies": 0.828125, "rewards/chosen": 1.8359375, "rewards/margins": 5.3125, "rewards/rejected": -3.46875, "step": 255 }, { "epoch": 0.3141104294478528, "grad_norm": 37.11298367671905, "learning_rate": 7.236363636363636e-07, "logits/chosen": -0.1953125, "logits/rejected": -0.3671875, "logps/chosen": -348.0, "logps/rejected": -310.0, "loss": 0.2374, "rewards/accuracies": 0.875, "rewards/chosen": 2.34375, "rewards/margins": 6.40625, "rewards/rejected": -4.0625, "step": 256 }, { "epoch": 0.31533742331288345, "grad_norm": 44.74542880830349, "learning_rate": 7.233057851239669e-07, "logits/chosen": -0.1962890625, "logits/rejected": -0.345703125, "logps/chosen": -426.0, "logps/rejected": -348.0, "loss": 0.3118, "rewards/accuracies": 0.828125, "rewards/chosen": 2.15625, "rewards/margins": 5.6875, "rewards/rejected": -3.546875, "step": 257 }, { "epoch": 0.3165644171779141, "grad_norm": 34.05504946265699, "learning_rate": 7.229752066115702e-07, "logits/chosen": -0.1435546875, "logits/rejected": -0.330078125, "logps/chosen": -396.0, "logps/rejected": -332.0, "loss": 0.2467, "rewards/accuracies": 0.90625, "rewards/chosen": 1.8984375, "rewards/margins": 5.75, "rewards/rejected": -3.859375, "step": 258 }, { "epoch": 0.3177914110429448, "grad_norm": 35.06646898219457, "learning_rate": 7.226446280991736e-07, "logits/chosen": -0.201171875, "logits/rejected": -0.3984375, "logps/chosen": -342.0, "logps/rejected": -344.0, "loss": 0.278, "rewards/accuracies": 0.84375, "rewards/chosen": 1.4921875, "rewards/margins": 5.4375, "rewards/rejected": -3.96875, "step": 259 }, { "epoch": 0.31901840490797545, "grad_norm": 48.15030024240453, "learning_rate": 7.223140495867769e-07, "logits/chosen": -0.232421875, "logits/rejected": -0.3203125, "logps/chosen": -386.0, "logps/rejected": -312.0, "loss": 0.3099, "rewards/accuracies": 0.8125, "rewards/chosen": 1.5234375, "rewards/margins": 5.15625, "rewards/rejected": -3.640625, "step": 260 }, { "epoch": 0.3202453987730061, "grad_norm": 43.183782239877885, "learning_rate": 7.219834710743801e-07, "logits/chosen": -0.1650390625, "logits/rejected": -0.318359375, "logps/chosen": -376.0, "logps/rejected": -312.0, "loss": 0.3207, "rewards/accuracies": 0.828125, "rewards/chosen": 1.609375, "rewards/margins": 5.3125, "rewards/rejected": -3.71875, "step": 261 }, { "epoch": 0.3214723926380368, "grad_norm": 43.81473087786423, "learning_rate": 7.216528925619834e-07, "logits/chosen": -0.2041015625, "logits/rejected": -0.3984375, "logps/chosen": -382.0, "logps/rejected": -324.0, "loss": 0.3077, "rewards/accuracies": 0.828125, "rewards/chosen": 2.1875, "rewards/margins": 5.6875, "rewards/rejected": -3.484375, "step": 262 }, { "epoch": 0.3226993865030675, "grad_norm": 45.763039013247074, "learning_rate": 7.213223140495867e-07, "logits/chosen": -0.1962890625, "logits/rejected": -0.326171875, "logps/chosen": -366.0, "logps/rejected": -304.0, "loss": 0.345, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.2265625, "rewards/margins": 4.5, "rewards/rejected": -3.265625, "step": 263 }, { "epoch": 0.3239263803680982, "grad_norm": 41.54807658858699, "learning_rate": 7.2099173553719e-07, "logits/chosen": -0.1552734375, "logits/rejected": -0.2734375, "logps/chosen": -348.0, "logps/rejected": -288.0, "loss": 0.3193, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.5234375, "rewards/margins": 4.75, "rewards/rejected": -3.234375, "step": 264 }, { "epoch": 0.32515337423312884, "grad_norm": 43.72770395576322, "learning_rate": 7.206611570247934e-07, "logits/chosen": -0.1630859375, "logits/rejected": -0.326171875, "logps/chosen": -354.0, "logps/rejected": -266.0, "loss": 0.296, "rewards/accuracies": 0.828125, "rewards/chosen": 1.4609375, "rewards/margins": 4.96875, "rewards/rejected": -3.515625, "step": 265 }, { "epoch": 0.3263803680981595, "grad_norm": 49.68472762312363, "learning_rate": 7.203305785123967e-07, "logits/chosen": -0.13671875, "logits/rejected": -0.287109375, "logps/chosen": -316.0, "logps/rejected": -292.0, "loss": 0.41, "rewards/accuracies": 0.7578125, "rewards/chosen": 0.68359375, "rewards/margins": 3.875, "rewards/rejected": -3.1875, "step": 266 }, { "epoch": 0.3276073619631902, "grad_norm": 54.21686609921306, "learning_rate": 7.2e-07, "logits/chosen": -0.16015625, "logits/rejected": -0.380859375, "logps/chosen": -400.0, "logps/rejected": -296.0, "loss": 0.3765, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.828125, "rewards/margins": 4.8125, "rewards/rejected": -2.984375, "step": 267 }, { "epoch": 0.32883435582822085, "grad_norm": 36.013473849533085, "learning_rate": 7.196694214876033e-07, "logits/chosen": -0.3046875, "logits/rejected": -0.419921875, "logps/chosen": -382.0, "logps/rejected": -310.0, "loss": 0.2353, "rewards/accuracies": 0.859375, "rewards/chosen": 1.6875, "rewards/margins": 5.03125, "rewards/rejected": -3.328125, "step": 268 }, { "epoch": 0.3300613496932515, "grad_norm": 37.07985683341205, "learning_rate": 7.193388429752066e-07, "logits/chosen": -0.193359375, "logits/rejected": -0.5, "logps/chosen": -400.0, "logps/rejected": -292.0, "loss": 0.229, "rewards/accuracies": 0.890625, "rewards/chosen": 1.9453125, "rewards/margins": 5.40625, "rewards/rejected": -3.46875, "step": 269 }, { "epoch": 0.3312883435582822, "grad_norm": 43.39229519288019, "learning_rate": 7.190082644628098e-07, "logits/chosen": -0.1943359375, "logits/rejected": -0.3125, "logps/chosen": -326.0, "logps/rejected": -286.0, "loss": 0.3693, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.3046875, "rewards/margins": 4.1875, "rewards/rejected": -2.875, "step": 270 }, { "epoch": 0.3325153374233129, "grad_norm": 33.45853348793219, "learning_rate": 7.186776859504132e-07, "logits/chosen": -0.2060546875, "logits/rejected": -0.328125, "logps/chosen": -382.0, "logps/rejected": -316.0, "loss": 0.2511, "rewards/accuracies": 0.875, "rewards/chosen": 2.34375, "rewards/margins": 5.5625, "rewards/rejected": -3.234375, "step": 271 }, { "epoch": 0.3337423312883436, "grad_norm": 36.86544969536763, "learning_rate": 7.183471074380165e-07, "logits/chosen": -0.1025390625, "logits/rejected": -0.2734375, "logps/chosen": -356.0, "logps/rejected": -290.0, "loss": 0.2449, "rewards/accuracies": 0.84375, "rewards/chosen": 1.3515625, "rewards/margins": 5.0, "rewards/rejected": -3.640625, "step": 272 }, { "epoch": 0.33496932515337424, "grad_norm": 45.60464590137911, "learning_rate": 7.180165289256198e-07, "logits/chosen": -0.05029296875, "logits/rejected": -0.1357421875, "logps/chosen": -334.0, "logps/rejected": -292.0, "loss": 0.4336, "rewards/accuracies": 0.78125, "rewards/chosen": 1.171875, "rewards/margins": 4.59375, "rewards/rejected": -3.4375, "step": 273 }, { "epoch": 0.3361963190184049, "grad_norm": 38.72003382453235, "learning_rate": 7.176859504132231e-07, "logits/chosen": -0.06591796875, "logits/rejected": -0.21875, "logps/chosen": -398.0, "logps/rejected": -324.0, "loss": 0.3223, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.9453125, "rewards/margins": 5.3125, "rewards/rejected": -3.359375, "step": 274 }, { "epoch": 0.3374233128834356, "grad_norm": 41.46753745108232, "learning_rate": 7.173553719008264e-07, "logits/chosen": -0.130859375, "logits/rejected": -0.23828125, "logps/chosen": -316.0, "logps/rejected": -304.0, "loss": 0.3348, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.515625, "rewards/margins": 5.0, "rewards/rejected": -3.5, "step": 275 }, { "epoch": 0.33865030674846625, "grad_norm": 29.942801211334718, "learning_rate": 7.170247933884297e-07, "logits/chosen": -0.056396484375, "logits/rejected": -0.271484375, "logps/chosen": -376.0, "logps/rejected": -308.0, "loss": 0.2861, "rewards/accuracies": 0.859375, "rewards/chosen": 1.4765625, "rewards/margins": 5.3125, "rewards/rejected": -3.84375, "step": 276 }, { "epoch": 0.3398773006134969, "grad_norm": 36.649252691867474, "learning_rate": 7.166942148760331e-07, "logits/chosen": -0.2265625, "logits/rejected": -0.42578125, "logps/chosen": -404.0, "logps/rejected": -324.0, "loss": 0.2238, "rewards/accuracies": 0.890625, "rewards/chosen": 2.15625, "rewards/margins": 6.46875, "rewards/rejected": -4.3125, "step": 277 }, { "epoch": 0.3411042944785276, "grad_norm": 41.64219712301306, "learning_rate": 7.163636363636364e-07, "logits/chosen": -0.146484375, "logits/rejected": -0.2119140625, "logps/chosen": -376.0, "logps/rejected": -340.0, "loss": 0.2881, "rewards/accuracies": 0.859375, "rewards/chosen": 1.5390625, "rewards/margins": 5.65625, "rewards/rejected": -4.125, "step": 278 }, { "epoch": 0.3423312883435583, "grad_norm": 25.028100153022006, "learning_rate": 7.160330578512396e-07, "logits/chosen": -0.1953125, "logits/rejected": -0.38671875, "logps/chosen": -382.0, "logps/rejected": -306.0, "loss": 0.1819, "rewards/accuracies": 0.9453125, "rewards/chosen": 1.4921875, "rewards/margins": 6.375, "rewards/rejected": -4.875, "step": 279 }, { "epoch": 0.34355828220858897, "grad_norm": 43.34524582256192, "learning_rate": 7.157024793388429e-07, "logits/chosen": -0.177734375, "logits/rejected": -0.34375, "logps/chosen": -400.0, "logps/rejected": -356.0, "loss": 0.3811, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.6171875, "rewards/margins": 6.25, "rewards/rejected": -4.625, "step": 280 }, { "epoch": 0.34478527607361964, "grad_norm": 39.57499610045821, "learning_rate": 7.153719008264462e-07, "logits/chosen": -0.12158203125, "logits/rejected": -0.32421875, "logps/chosen": -378.0, "logps/rejected": -320.0, "loss": 0.3441, "rewards/accuracies": 0.84375, "rewards/chosen": 1.078125, "rewards/margins": 5.03125, "rewards/rejected": -3.9375, "step": 281 }, { "epoch": 0.3460122699386503, "grad_norm": 32.558914994483004, "learning_rate": 7.150413223140495e-07, "logits/chosen": -0.287109375, "logits/rejected": -0.44921875, "logps/chosen": -340.0, "logps/rejected": -312.0, "loss": 0.2162, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.4765625, "rewards/margins": 6.53125, "rewards/rejected": -5.0625, "step": 282 }, { "epoch": 0.347239263803681, "grad_norm": 33.09320412279389, "learning_rate": 7.147107438016529e-07, "logits/chosen": -0.314453125, "logits/rejected": -0.427734375, "logps/chosen": -350.0, "logps/rejected": -288.0, "loss": 0.2537, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.984375, "rewards/margins": 5.5, "rewards/rejected": -4.5, "step": 283 }, { "epoch": 0.34846625766871164, "grad_norm": 40.734540729970675, "learning_rate": 7.143801652892562e-07, "logits/chosen": -0.1337890625, "logits/rejected": -0.28125, "logps/chosen": -368.0, "logps/rejected": -310.0, "loss": 0.272, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.015625, "rewards/margins": 5.875, "rewards/rejected": -4.84375, "step": 284 }, { "epoch": 0.3496932515337423, "grad_norm": 30.9410258264426, "learning_rate": 7.140495867768595e-07, "logits/chosen": -0.21484375, "logits/rejected": -0.427734375, "logps/chosen": -358.0, "logps/rejected": -320.0, "loss": 0.2413, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.0546875, "rewards/margins": 6.0, "rewards/rejected": -4.96875, "step": 285 }, { "epoch": 0.350920245398773, "grad_norm": 37.246332837421065, "learning_rate": 7.137190082644628e-07, "logits/chosen": -0.146484375, "logits/rejected": -0.359375, "logps/chosen": -418.0, "logps/rejected": -346.0, "loss": 0.3337, "rewards/accuracies": 0.84375, "rewards/chosen": 1.15625, "rewards/margins": 6.25, "rewards/rejected": -5.09375, "step": 286 }, { "epoch": 0.3521472392638037, "grad_norm": 40.87355956326826, "learning_rate": 7.133884297520661e-07, "logits/chosen": -0.2431640625, "logits/rejected": -0.3984375, "logps/chosen": -378.0, "logps/rejected": -320.0, "loss": 0.2981, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.68359375, "rewards/margins": 5.625, "rewards/rejected": -4.9375, "step": 287 }, { "epoch": 0.35337423312883437, "grad_norm": 37.148615900618886, "learning_rate": 7.130578512396693e-07, "logits/chosen": -0.05908203125, "logits/rejected": -0.212890625, "logps/chosen": -384.0, "logps/rejected": -324.0, "loss": 0.3085, "rewards/accuracies": 0.859375, "rewards/chosen": 0.609375, "rewards/margins": 5.21875, "rewards/rejected": -4.59375, "step": 288 }, { "epoch": 0.35460122699386504, "grad_norm": 29.32351813266847, "learning_rate": 7.127272727272727e-07, "logits/chosen": -0.1953125, "logits/rejected": -0.33984375, "logps/chosen": -400.0, "logps/rejected": -316.0, "loss": 0.1987, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.265625, "rewards/margins": 6.625, "rewards/rejected": -5.34375, "step": 289 }, { "epoch": 0.3558282208588957, "grad_norm": 34.03478605235303, "learning_rate": 7.12396694214876e-07, "logits/chosen": -0.359375, "logits/rejected": -0.51171875, "logps/chosen": -374.0, "logps/rejected": -338.0, "loss": 0.2024, "rewards/accuracies": 0.890625, "rewards/chosen": 1.109375, "rewards/margins": 6.8125, "rewards/rejected": -5.71875, "step": 290 }, { "epoch": 0.3570552147239264, "grad_norm": 38.57928856233812, "learning_rate": 7.120661157024793e-07, "logits/chosen": -0.296875, "logits/rejected": -0.431640625, "logps/chosen": -390.0, "logps/rejected": -330.0, "loss": 0.3224, "rewards/accuracies": 0.8125, "rewards/chosen": 2.03125, "rewards/margins": 6.53125, "rewards/rejected": -4.5, "step": 291 }, { "epoch": 0.35828220858895704, "grad_norm": 36.5133266014805, "learning_rate": 7.117355371900826e-07, "logits/chosen": -0.255859375, "logits/rejected": -0.484375, "logps/chosen": -402.0, "logps/rejected": -334.0, "loss": 0.2451, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.1328125, "rewards/margins": 6.15625, "rewards/rejected": -5.03125, "step": 292 }, { "epoch": 0.3595092024539877, "grad_norm": 31.073871401773395, "learning_rate": 7.114049586776859e-07, "logits/chosen": -0.1826171875, "logits/rejected": -0.380859375, "logps/chosen": -376.0, "logps/rejected": -318.0, "loss": 0.2162, "rewards/accuracies": 0.890625, "rewards/chosen": 0.70703125, "rewards/margins": 5.9375, "rewards/rejected": -5.25, "step": 293 }, { "epoch": 0.36073619631901843, "grad_norm": 31.419020907335653, "learning_rate": 7.110743801652892e-07, "logits/chosen": -0.427734375, "logits/rejected": -0.578125, "logps/chosen": -464.0, "logps/rejected": -354.0, "loss": 0.2389, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.3828125, "rewards/margins": 6.9375, "rewards/rejected": -5.53125, "step": 294 }, { "epoch": 0.3619631901840491, "grad_norm": 33.66575248055817, "learning_rate": 7.107438016528926e-07, "logits/chosen": -0.146484375, "logits/rejected": -0.298828125, "logps/chosen": -350.0, "logps/rejected": -316.0, "loss": 0.2242, "rewards/accuracies": 0.8828125, "rewards/chosen": 0.93359375, "rewards/margins": 5.96875, "rewards/rejected": -5.03125, "step": 295 }, { "epoch": 0.36319018404907977, "grad_norm": 40.06405186289625, "learning_rate": 7.104132231404959e-07, "logits/chosen": -0.11962890625, "logits/rejected": -0.283203125, "logps/chosen": -414.0, "logps/rejected": -326.0, "loss": 0.3209, "rewards/accuracies": 0.84375, "rewards/chosen": 1.7421875, "rewards/margins": 5.9375, "rewards/rejected": -4.1875, "step": 296 }, { "epoch": 0.36441717791411044, "grad_norm": 30.371449913820346, "learning_rate": 7.100826446280991e-07, "logits/chosen": -0.25, "logits/rejected": -0.42578125, "logps/chosen": -352.0, "logps/rejected": -306.0, "loss": 0.2354, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.5390625, "rewards/margins": 6.03125, "rewards/rejected": -4.5, "step": 297 }, { "epoch": 0.3656441717791411, "grad_norm": 40.780831154790015, "learning_rate": 7.097520661157024e-07, "logits/chosen": -0.126953125, "logits/rejected": -0.23046875, "logps/chosen": -376.0, "logps/rejected": -318.0, "loss": 0.2901, "rewards/accuracies": 0.84375, "rewards/chosen": 1.3671875, "rewards/margins": 5.25, "rewards/rejected": -3.890625, "step": 298 }, { "epoch": 0.36687116564417177, "grad_norm": 48.39132901882327, "learning_rate": 7.094214876033057e-07, "logits/chosen": -0.16796875, "logits/rejected": -0.345703125, "logps/chosen": -388.0, "logps/rejected": -314.0, "loss": 0.3427, "rewards/accuracies": 0.796875, "rewards/chosen": 0.9453125, "rewards/margins": 5.0, "rewards/rejected": -4.0625, "step": 299 }, { "epoch": 0.36809815950920244, "grad_norm": 39.25730980280545, "learning_rate": 7.09090909090909e-07, "logits/chosen": -0.26953125, "logits/rejected": -0.431640625, "logps/chosen": -360.0, "logps/rejected": -308.0, "loss": 0.3287, "rewards/accuracies": 0.84375, "rewards/chosen": 1.5390625, "rewards/margins": 5.75, "rewards/rejected": -4.21875, "step": 300 }, { "epoch": 0.3693251533742331, "grad_norm": 34.87785766178715, "learning_rate": 7.087603305785124e-07, "logits/chosen": -0.2119140625, "logits/rejected": -0.408203125, "logps/chosen": -448.0, "logps/rejected": -366.0, "loss": 0.2823, "rewards/accuracies": 0.84375, "rewards/chosen": 2.03125, "rewards/margins": 6.25, "rewards/rejected": -4.1875, "step": 301 }, { "epoch": 0.37055214723926383, "grad_norm": 30.464291800676158, "learning_rate": 7.084297520661157e-07, "logits/chosen": -0.251953125, "logits/rejected": -0.453125, "logps/chosen": -370.0, "logps/rejected": -294.0, "loss": 0.2182, "rewards/accuracies": 0.921875, "rewards/chosen": 1.53125, "rewards/margins": 5.6875, "rewards/rejected": -4.15625, "step": 302 }, { "epoch": 0.3717791411042945, "grad_norm": 45.78814856158198, "learning_rate": 7.08099173553719e-07, "logits/chosen": -0.251953125, "logits/rejected": -0.37109375, "logps/chosen": -374.0, "logps/rejected": -352.0, "loss": 0.3512, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.0390625, "rewards/margins": 5.4375, "rewards/rejected": -4.40625, "step": 303 }, { "epoch": 0.37300613496932516, "grad_norm": 33.26834608933062, "learning_rate": 7.077685950413223e-07, "logits/chosen": -0.1435546875, "logits/rejected": -0.3984375, "logps/chosen": -380.0, "logps/rejected": -310.0, "loss": 0.2448, "rewards/accuracies": 0.875, "rewards/chosen": 1.4609375, "rewards/margins": 6.0, "rewards/rejected": -4.53125, "step": 304 }, { "epoch": 0.37423312883435583, "grad_norm": 35.609604648743236, "learning_rate": 7.074380165289256e-07, "logits/chosen": -0.220703125, "logits/rejected": -0.37109375, "logps/chosen": -402.0, "logps/rejected": -316.0, "loss": 0.2744, "rewards/accuracies": 0.859375, "rewards/chosen": 1.7421875, "rewards/margins": 6.375, "rewards/rejected": -4.625, "step": 305 }, { "epoch": 0.3754601226993865, "grad_norm": 43.837358024220855, "learning_rate": 7.071074380165288e-07, "logits/chosen": -0.3125, "logits/rejected": -0.48046875, "logps/chosen": -414.0, "logps/rejected": -340.0, "loss": 0.2737, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.234375, "rewards/margins": 5.75, "rewards/rejected": -4.5, "step": 306 }, { "epoch": 0.37668711656441717, "grad_norm": 39.17650253748135, "learning_rate": 7.067768595041322e-07, "logits/chosen": -0.1748046875, "logits/rejected": -0.322265625, "logps/chosen": -368.0, "logps/rejected": -320.0, "loss": 0.3713, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.3125, "rewards/margins": 6.03125, "rewards/rejected": -4.71875, "step": 307 }, { "epoch": 0.37791411042944784, "grad_norm": 36.807676017880326, "learning_rate": 7.064462809917355e-07, "logits/chosen": -0.138671875, "logits/rejected": -0.298828125, "logps/chosen": -384.0, "logps/rejected": -334.0, "loss": 0.3165, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.94140625, "rewards/margins": 5.0, "rewards/rejected": -4.0625, "step": 308 }, { "epoch": 0.3791411042944785, "grad_norm": 32.288551419968854, "learning_rate": 7.061157024793388e-07, "logits/chosen": -0.30078125, "logits/rejected": -0.416015625, "logps/chosen": -378.0, "logps/rejected": -334.0, "loss": 0.2283, "rewards/accuracies": 0.90625, "rewards/chosen": 1.6484375, "rewards/margins": 6.5625, "rewards/rejected": -4.90625, "step": 309 }, { "epoch": 0.3803680981595092, "grad_norm": 47.130716517812814, "learning_rate": 7.057851239669421e-07, "logits/chosen": -0.0908203125, "logits/rejected": -0.1884765625, "logps/chosen": -312.0, "logps/rejected": -294.0, "loss": 0.3596, "rewards/accuracies": 0.84375, "rewards/chosen": 0.15234375, "rewards/margins": 4.84375, "rewards/rejected": -4.6875, "step": 310 }, { "epoch": 0.3815950920245399, "grad_norm": 34.12148114082454, "learning_rate": 7.054545454545454e-07, "logits/chosen": -0.26171875, "logits/rejected": -0.4453125, "logps/chosen": -384.0, "logps/rejected": -328.0, "loss": 0.2543, "rewards/accuracies": 0.84375, "rewards/chosen": 1.390625, "rewards/margins": 6.75, "rewards/rejected": -5.375, "step": 311 }, { "epoch": 0.38282208588957056, "grad_norm": 44.35564676375722, "learning_rate": 7.051239669421488e-07, "logits/chosen": -0.125, "logits/rejected": -0.26171875, "logps/chosen": -384.0, "logps/rejected": -362.0, "loss": 0.4044, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.0078125, "rewards/margins": 5.53125, "rewards/rejected": -4.5, "step": 312 }, { "epoch": 0.38404907975460123, "grad_norm": 33.82923751151301, "learning_rate": 7.047933884297521e-07, "logits/chosen": -0.134765625, "logits/rejected": -0.412109375, "logps/chosen": -402.0, "logps/rejected": -356.0, "loss": 0.2685, "rewards/accuracies": 0.875, "rewards/chosen": 1.8828125, "rewards/margins": 7.28125, "rewards/rejected": -5.375, "step": 313 }, { "epoch": 0.3852760736196319, "grad_norm": 33.17604766084792, "learning_rate": 7.044628099173554e-07, "logits/chosen": -0.1708984375, "logits/rejected": -0.365234375, "logps/chosen": -456.0, "logps/rejected": -344.0, "loss": 0.1847, "rewards/accuracies": 0.8984375, "rewards/chosen": 2.25, "rewards/margins": 7.96875, "rewards/rejected": -5.71875, "step": 314 }, { "epoch": 0.38650306748466257, "grad_norm": 38.90508166705689, "learning_rate": 7.041322314049586e-07, "logits/chosen": -0.06396484375, "logits/rejected": -0.255859375, "logps/chosen": -346.0, "logps/rejected": -286.0, "loss": 0.2412, "rewards/accuracies": 0.859375, "rewards/chosen": 0.5546875, "rewards/margins": 5.75, "rewards/rejected": -5.21875, "step": 315 }, { "epoch": 0.38773006134969323, "grad_norm": 31.950078808944912, "learning_rate": 7.038016528925619e-07, "logits/chosen": -0.06982421875, "logits/rejected": -0.2158203125, "logps/chosen": -358.0, "logps/rejected": -294.0, "loss": 0.2551, "rewards/accuracies": 0.84375, "rewards/chosen": 0.86328125, "rewards/margins": 6.3125, "rewards/rejected": -5.4375, "step": 316 }, { "epoch": 0.3889570552147239, "grad_norm": 34.528377745666106, "learning_rate": 7.034710743801652e-07, "logits/chosen": -0.197265625, "logits/rejected": -0.419921875, "logps/chosen": -398.0, "logps/rejected": -356.0, "loss": 0.2296, "rewards/accuracies": 0.890625, "rewards/chosen": 1.15625, "rewards/margins": 7.03125, "rewards/rejected": -5.875, "step": 317 }, { "epoch": 0.3901840490797546, "grad_norm": 46.9506582652498, "learning_rate": 7.031404958677686e-07, "logits/chosen": -0.2431640625, "logits/rejected": -0.408203125, "logps/chosen": -400.0, "logps/rejected": -352.0, "loss": 0.3503, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.265625, "rewards/margins": 5.96875, "rewards/rejected": -4.71875, "step": 318 }, { "epoch": 0.3914110429447853, "grad_norm": 26.867054074267944, "learning_rate": 7.028099173553719e-07, "logits/chosen": -0.169921875, "logits/rejected": -0.36328125, "logps/chosen": -414.0, "logps/rejected": -306.0, "loss": 0.1701, "rewards/accuracies": 0.921875, "rewards/chosen": 1.328125, "rewards/margins": 7.4375, "rewards/rejected": -6.125, "step": 319 }, { "epoch": 0.39263803680981596, "grad_norm": 40.540053142562215, "learning_rate": 7.024793388429752e-07, "logits/chosen": -0.1728515625, "logits/rejected": -0.287109375, "logps/chosen": -318.0, "logps/rejected": -274.0, "loss": 0.3046, "rewards/accuracies": 0.859375, "rewards/chosen": 0.5625, "rewards/margins": 5.875, "rewards/rejected": -5.3125, "step": 320 }, { "epoch": 0.39386503067484663, "grad_norm": 46.49642012587718, "learning_rate": 7.021487603305785e-07, "logits/chosen": -0.291015625, "logits/rejected": -0.4609375, "logps/chosen": -406.0, "logps/rejected": -384.0, "loss": 0.2961, "rewards/accuracies": 0.84375, "rewards/chosen": 0.8046875, "rewards/margins": 6.78125, "rewards/rejected": -5.96875, "step": 321 }, { "epoch": 0.3950920245398773, "grad_norm": 33.72622281793196, "learning_rate": 7.018181818181818e-07, "logits/chosen": -0.2099609375, "logits/rejected": -0.369140625, "logps/chosen": -392.0, "logps/rejected": -316.0, "loss": 0.2496, "rewards/accuracies": 0.890625, "rewards/chosen": 1.5, "rewards/margins": 6.8125, "rewards/rejected": -5.3125, "step": 322 }, { "epoch": 0.39631901840490796, "grad_norm": 39.04984997032008, "learning_rate": 7.014876033057851e-07, "logits/chosen": -0.240234375, "logits/rejected": -0.376953125, "logps/chosen": -350.0, "logps/rejected": -324.0, "loss": 0.3837, "rewards/accuracies": 0.828125, "rewards/chosen": 1.015625, "rewards/margins": 5.3125, "rewards/rejected": -4.3125, "step": 323 }, { "epoch": 0.39754601226993863, "grad_norm": 33.57036215026917, "learning_rate": 7.011570247933884e-07, "logits/chosen": -0.28125, "logits/rejected": -0.451171875, "logps/chosen": -352.0, "logps/rejected": -316.0, "loss": 0.2714, "rewards/accuracies": 0.859375, "rewards/chosen": 0.96875, "rewards/margins": 6.46875, "rewards/rejected": -5.5, "step": 324 }, { "epoch": 0.3987730061349693, "grad_norm": 45.64995516248102, "learning_rate": 7.008264462809917e-07, "logits/chosen": -0.138671875, "logits/rejected": -0.2177734375, "logps/chosen": -328.0, "logps/rejected": -290.0, "loss": 0.4112, "rewards/accuracies": 0.7890625, "rewards/chosen": 0.6875, "rewards/margins": 5.21875, "rewards/rejected": -4.53125, "step": 325 }, { "epoch": 0.4, "grad_norm": 34.28943945713478, "learning_rate": 7.00495867768595e-07, "logits/chosen": -0.310546875, "logits/rejected": -0.462890625, "logps/chosen": -394.0, "logps/rejected": -356.0, "loss": 0.2004, "rewards/accuracies": 0.859375, "rewards/chosen": 2.09375, "rewards/margins": 7.125, "rewards/rejected": -5.03125, "step": 326 }, { "epoch": 0.4012269938650307, "grad_norm": 48.50197304580951, "learning_rate": 7.001652892561983e-07, "logits/chosen": -0.203125, "logits/rejected": -0.380859375, "logps/chosen": -424.0, "logps/rejected": -338.0, "loss": 0.3949, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.5234375, "rewards/margins": 5.21875, "rewards/rejected": -3.6875, "step": 327 }, { "epoch": 0.40245398773006136, "grad_norm": 40.72777385232644, "learning_rate": 6.998347107438016e-07, "logits/chosen": -0.236328125, "logits/rejected": -0.37109375, "logps/chosen": -356.0, "logps/rejected": -272.0, "loss": 0.3146, "rewards/accuracies": 0.84375, "rewards/chosen": 0.86328125, "rewards/margins": 5.15625, "rewards/rejected": -4.3125, "step": 328 }, { "epoch": 0.403680981595092, "grad_norm": 35.55525281765151, "learning_rate": 6.995041322314049e-07, "logits/chosen": -0.1787109375, "logits/rejected": -0.38671875, "logps/chosen": -454.0, "logps/rejected": -362.0, "loss": 0.2936, "rewards/accuracies": 0.8359375, "rewards/chosen": 2.1875, "rewards/margins": 7.09375, "rewards/rejected": -4.90625, "step": 329 }, { "epoch": 0.4049079754601227, "grad_norm": 42.0221302571432, "learning_rate": 6.991735537190083e-07, "logits/chosen": -0.3125, "logits/rejected": -0.5234375, "logps/chosen": -408.0, "logps/rejected": -328.0, "loss": 0.2435, "rewards/accuracies": 0.859375, "rewards/chosen": 1.9765625, "rewards/margins": 6.6875, "rewards/rejected": -4.71875, "step": 330 }, { "epoch": 0.40613496932515336, "grad_norm": 32.84700653520424, "learning_rate": 6.988429752066116e-07, "logits/chosen": -0.279296875, "logits/rejected": -0.39453125, "logps/chosen": -400.0, "logps/rejected": -336.0, "loss": 0.2501, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.9375, "rewards/margins": 6.3125, "rewards/rejected": -4.375, "step": 331 }, { "epoch": 0.40736196319018403, "grad_norm": 27.379927529722597, "learning_rate": 6.985123966942148e-07, "logits/chosen": -0.28515625, "logits/rejected": -0.478515625, "logps/chosen": -420.0, "logps/rejected": -310.0, "loss": 0.2017, "rewards/accuracies": 0.8828125, "rewards/chosen": 2.125, "rewards/margins": 6.625, "rewards/rejected": -4.46875, "step": 332 }, { "epoch": 0.4085889570552147, "grad_norm": 36.70659629756495, "learning_rate": 6.981818181818181e-07, "logits/chosen": -0.10791015625, "logits/rejected": -0.23828125, "logps/chosen": -362.0, "logps/rejected": -324.0, "loss": 0.3078, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.546875, "rewards/margins": 5.40625, "rewards/rejected": -3.84375, "step": 333 }, { "epoch": 0.4098159509202454, "grad_norm": 34.15971280742034, "learning_rate": 6.978512396694214e-07, "logits/chosen": -0.21875, "logits/rejected": -0.455078125, "logps/chosen": -368.0, "logps/rejected": -338.0, "loss": 0.273, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.8046875, "rewards/margins": 6.3125, "rewards/rejected": -4.5, "step": 334 }, { "epoch": 0.4110429447852761, "grad_norm": 37.2375068536928, "learning_rate": 6.975206611570247e-07, "logits/chosen": -0.1484375, "logits/rejected": -0.3984375, "logps/chosen": -420.0, "logps/rejected": -306.0, "loss": 0.2248, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.4609375, "rewards/margins": 5.5, "rewards/rejected": -4.03125, "step": 335 }, { "epoch": 0.41226993865030676, "grad_norm": 36.84981287485191, "learning_rate": 6.971900826446281e-07, "logits/chosen": -0.294921875, "logits/rejected": -0.447265625, "logps/chosen": -390.0, "logps/rejected": -326.0, "loss": 0.2764, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.5625, "rewards/margins": 5.78125, "rewards/rejected": -4.21875, "step": 336 }, { "epoch": 0.4134969325153374, "grad_norm": 46.94122451213228, "learning_rate": 6.968595041322314e-07, "logits/chosen": -0.09375, "logits/rejected": -0.263671875, "logps/chosen": -344.0, "logps/rejected": -322.0, "loss": 0.389, "rewards/accuracies": 0.796875, "rewards/chosen": 1.5234375, "rewards/margins": 5.4375, "rewards/rejected": -3.921875, "step": 337 }, { "epoch": 0.4147239263803681, "grad_norm": 38.247859512270246, "learning_rate": 6.965289256198347e-07, "logits/chosen": -0.13671875, "logits/rejected": -0.291015625, "logps/chosen": -378.0, "logps/rejected": -326.0, "loss": 0.3295, "rewards/accuracies": 0.8125, "rewards/chosen": 1.59375, "rewards/margins": 5.59375, "rewards/rejected": -4.0, "step": 338 }, { "epoch": 0.41595092024539876, "grad_norm": 40.84741702132196, "learning_rate": 6.96198347107438e-07, "logits/chosen": -0.07470703125, "logits/rejected": -0.2109375, "logps/chosen": -364.0, "logps/rejected": -322.0, "loss": 0.3275, "rewards/accuracies": 0.828125, "rewards/chosen": 1.3515625, "rewards/margins": 5.5, "rewards/rejected": -4.15625, "step": 339 }, { "epoch": 0.4171779141104294, "grad_norm": 43.700613878566976, "learning_rate": 6.958677685950413e-07, "logits/chosen": -0.169921875, "logits/rejected": -0.3984375, "logps/chosen": -352.0, "logps/rejected": -328.0, "loss": 0.2879, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.2421875, "rewards/margins": 5.34375, "rewards/rejected": -4.09375, "step": 340 }, { "epoch": 0.41840490797546015, "grad_norm": 31.54531879054049, "learning_rate": 6.955371900826445e-07, "logits/chosen": -0.21875, "logits/rejected": -0.44140625, "logps/chosen": -386.0, "logps/rejected": -314.0, "loss": 0.2805, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.734375, "rewards/margins": 6.40625, "rewards/rejected": -4.65625, "step": 341 }, { "epoch": 0.4196319018404908, "grad_norm": 39.0902727508844, "learning_rate": 6.952066115702479e-07, "logits/chosen": -0.1748046875, "logits/rejected": -0.279296875, "logps/chosen": -328.0, "logps/rejected": -300.0, "loss": 0.3322, "rewards/accuracies": 0.8125, "rewards/chosen": 1.1875, "rewards/margins": 5.375, "rewards/rejected": -4.1875, "step": 342 }, { "epoch": 0.4208588957055215, "grad_norm": 39.32051666516945, "learning_rate": 6.948760330578512e-07, "logits/chosen": -0.1962890625, "logits/rejected": -0.302734375, "logps/chosen": -372.0, "logps/rejected": -336.0, "loss": 0.3545, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.140625, "rewards/margins": 5.0625, "rewards/rejected": -3.921875, "step": 343 }, { "epoch": 0.42208588957055215, "grad_norm": 42.12526028461151, "learning_rate": 6.945454545454545e-07, "logits/chosen": -0.2060546875, "logits/rejected": -0.34765625, "logps/chosen": -398.0, "logps/rejected": -324.0, "loss": 0.3584, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.140625, "rewards/margins": 5.1875, "rewards/rejected": -4.0625, "step": 344 }, { "epoch": 0.4233128834355828, "grad_norm": 39.02371998906191, "learning_rate": 6.942148760330578e-07, "logits/chosen": -0.1875, "logits/rejected": -0.376953125, "logps/chosen": -402.0, "logps/rejected": -320.0, "loss": 0.3288, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.359375, "rewards/margins": 5.65625, "rewards/rejected": -4.3125, "step": 345 }, { "epoch": 0.4245398773006135, "grad_norm": 41.19695447421548, "learning_rate": 6.938842975206611e-07, "logits/chosen": -0.1923828125, "logits/rejected": -0.384765625, "logps/chosen": -332.0, "logps/rejected": -286.0, "loss": 0.3569, "rewards/accuracies": 0.84375, "rewards/chosen": 0.96484375, "rewards/margins": 5.09375, "rewards/rejected": -4.125, "step": 346 }, { "epoch": 0.42576687116564416, "grad_norm": 28.472619739287644, "learning_rate": 6.935537190082645e-07, "logits/chosen": -0.20703125, "logits/rejected": -0.341796875, "logps/chosen": -360.0, "logps/rejected": -340.0, "loss": 0.2332, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.234375, "rewards/margins": 5.5, "rewards/rejected": -4.25, "step": 347 }, { "epoch": 0.4269938650306748, "grad_norm": 33.19419614917591, "learning_rate": 6.932231404958678e-07, "logits/chosen": -0.24609375, "logits/rejected": -0.455078125, "logps/chosen": -410.0, "logps/rejected": -310.0, "loss": 0.2594, "rewards/accuracies": 0.859375, "rewards/chosen": 0.91796875, "rewards/margins": 6.53125, "rewards/rejected": -5.59375, "step": 348 }, { "epoch": 0.42822085889570555, "grad_norm": 38.111059722172605, "learning_rate": 6.928925619834711e-07, "logits/chosen": -0.2412109375, "logits/rejected": -0.38671875, "logps/chosen": -396.0, "logps/rejected": -308.0, "loss": 0.3255, "rewards/accuracies": 0.84375, "rewards/chosen": 0.890625, "rewards/margins": 6.21875, "rewards/rejected": -5.34375, "step": 349 }, { "epoch": 0.4294478527607362, "grad_norm": 37.49784569992658, "learning_rate": 6.925619834710743e-07, "logits/chosen": -0.0986328125, "logits/rejected": -0.296875, "logps/chosen": -402.0, "logps/rejected": -302.0, "loss": 0.2857, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.1640625, "rewards/margins": 5.4375, "rewards/rejected": -4.28125, "step": 350 }, { "epoch": 0.4306748466257669, "grad_norm": 42.647163206760126, "learning_rate": 6.922314049586776e-07, "logits/chosen": -0.259765625, "logits/rejected": -0.404296875, "logps/chosen": -336.0, "logps/rejected": -312.0, "loss": 0.3505, "rewards/accuracies": 0.796875, "rewards/chosen": 0.5078125, "rewards/margins": 5.28125, "rewards/rejected": -4.78125, "step": 351 }, { "epoch": 0.43190184049079755, "grad_norm": 36.26120743659289, "learning_rate": 6.919008264462809e-07, "logits/chosen": -0.1728515625, "logits/rejected": -0.375, "logps/chosen": -380.0, "logps/rejected": -322.0, "loss": 0.3453, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.6875, "rewards/margins": 5.71875, "rewards/rejected": -4.03125, "step": 352 }, { "epoch": 0.4331288343558282, "grad_norm": 30.933441803520967, "learning_rate": 6.915702479338843e-07, "logits/chosen": -0.224609375, "logits/rejected": -0.3984375, "logps/chosen": -354.0, "logps/rejected": -314.0, "loss": 0.2406, "rewards/accuracies": 0.875, "rewards/chosen": 1.484375, "rewards/margins": 6.46875, "rewards/rejected": -4.96875, "step": 353 }, { "epoch": 0.4343558282208589, "grad_norm": 34.874499707263155, "learning_rate": 6.912396694214876e-07, "logits/chosen": -0.1455078125, "logits/rejected": -0.326171875, "logps/chosen": -434.0, "logps/rejected": -364.0, "loss": 0.2963, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.875, "rewards/margins": 5.90625, "rewards/rejected": -4.03125, "step": 354 }, { "epoch": 0.43558282208588955, "grad_norm": 39.848840136754845, "learning_rate": 6.909090909090909e-07, "logits/chosen": -0.296875, "logits/rejected": -0.392578125, "logps/chosen": -340.0, "logps/rejected": -342.0, "loss": 0.3581, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.140625, "rewards/margins": 5.65625, "rewards/rejected": -4.53125, "step": 355 }, { "epoch": 0.4368098159509202, "grad_norm": 44.03875893573232, "learning_rate": 6.905785123966942e-07, "logits/chosen": -0.0966796875, "logits/rejected": -0.240234375, "logps/chosen": -388.0, "logps/rejected": -316.0, "loss": 0.3406, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.359375, "rewards/margins": 5.40625, "rewards/rejected": -4.03125, "step": 356 }, { "epoch": 0.43803680981595094, "grad_norm": 36.68968799262988, "learning_rate": 6.902479338842975e-07, "logits/chosen": -0.3515625, "logits/rejected": -0.50390625, "logps/chosen": -396.0, "logps/rejected": -322.0, "loss": 0.2926, "rewards/accuracies": 0.84375, "rewards/chosen": 1.3984375, "rewards/margins": 6.34375, "rewards/rejected": -4.9375, "step": 357 }, { "epoch": 0.4392638036809816, "grad_norm": 36.204158508103596, "learning_rate": 6.899173553719008e-07, "logits/chosen": -0.30078125, "logits/rejected": -0.45703125, "logps/chosen": -438.0, "logps/rejected": -314.0, "loss": 0.2673, "rewards/accuracies": 0.875, "rewards/chosen": 1.9921875, "rewards/margins": 6.40625, "rewards/rejected": -4.40625, "step": 358 }, { "epoch": 0.4404907975460123, "grad_norm": 40.16138545949422, "learning_rate": 6.89586776859504e-07, "logits/chosen": -0.1845703125, "logits/rejected": -0.296875, "logps/chosen": -414.0, "logps/rejected": -316.0, "loss": 0.2988, "rewards/accuracies": 0.84375, "rewards/chosen": 1.953125, "rewards/margins": 6.03125, "rewards/rejected": -4.09375, "step": 359 }, { "epoch": 0.44171779141104295, "grad_norm": 35.21609251200673, "learning_rate": 6.892561983471074e-07, "logits/chosen": -0.15625, "logits/rejected": -0.283203125, "logps/chosen": -388.0, "logps/rejected": -340.0, "loss": 0.2614, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.1640625, "rewards/margins": 6.09375, "rewards/rejected": -4.9375, "step": 360 }, { "epoch": 0.4429447852760736, "grad_norm": 33.95190421090596, "learning_rate": 6.889256198347107e-07, "logits/chosen": -0.10791015625, "logits/rejected": -0.3046875, "logps/chosen": -426.0, "logps/rejected": -362.0, "loss": 0.2599, "rewards/accuracies": 0.859375, "rewards/chosen": 1.78125, "rewards/margins": 6.59375, "rewards/rejected": -4.8125, "step": 361 }, { "epoch": 0.4441717791411043, "grad_norm": 32.41395226001234, "learning_rate": 6.88595041322314e-07, "logits/chosen": -0.236328125, "logits/rejected": -0.38671875, "logps/chosen": -408.0, "logps/rejected": -326.0, "loss": 0.2625, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.6796875, "rewards/margins": 6.4375, "rewards/rejected": -4.75, "step": 362 }, { "epoch": 0.44539877300613495, "grad_norm": 31.06408733284358, "learning_rate": 6.882644628099173e-07, "logits/chosen": -0.1455078125, "logits/rejected": -0.302734375, "logps/chosen": -382.0, "logps/rejected": -328.0, "loss": 0.2362, "rewards/accuracies": 0.890625, "rewards/chosen": 1.796875, "rewards/margins": 6.15625, "rewards/rejected": -4.375, "step": 363 }, { "epoch": 0.4466257668711656, "grad_norm": 40.778000027843554, "learning_rate": 6.879338842975206e-07, "logits/chosen": -0.07470703125, "logits/rejected": -0.2578125, "logps/chosen": -384.0, "logps/rejected": -296.0, "loss": 0.2885, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.578125, "rewards/margins": 5.875, "rewards/rejected": -4.28125, "step": 364 }, { "epoch": 0.44785276073619634, "grad_norm": 30.8545654380382, "learning_rate": 6.87603305785124e-07, "logits/chosen": -0.1328125, "logits/rejected": -0.27734375, "logps/chosen": -344.0, "logps/rejected": -298.0, "loss": 0.2419, "rewards/accuracies": 0.875, "rewards/chosen": 1.40625, "rewards/margins": 5.9375, "rewards/rejected": -4.53125, "step": 365 }, { "epoch": 0.449079754601227, "grad_norm": 35.25923514975111, "learning_rate": 6.872727272727273e-07, "logits/chosen": -0.11376953125, "logits/rejected": -0.21484375, "logps/chosen": -358.0, "logps/rejected": -318.0, "loss": 0.3324, "rewards/accuracies": 0.84375, "rewards/chosen": 1.71875, "rewards/margins": 5.4375, "rewards/rejected": -3.703125, "step": 366 }, { "epoch": 0.4503067484662577, "grad_norm": 29.75727838549342, "learning_rate": 6.869421487603306e-07, "logits/chosen": -0.2490234375, "logits/rejected": -0.427734375, "logps/chosen": -388.0, "logps/rejected": -322.0, "loss": 0.2265, "rewards/accuracies": 0.875, "rewards/chosen": 1.5625, "rewards/margins": 5.8125, "rewards/rejected": -4.25, "step": 367 }, { "epoch": 0.45153374233128835, "grad_norm": 41.34860966923763, "learning_rate": 6.866115702479338e-07, "logits/chosen": -0.060546875, "logits/rejected": -0.11328125, "logps/chosen": -364.0, "logps/rejected": -318.0, "loss": 0.3251, "rewards/accuracies": 0.828125, "rewards/chosen": 1.1953125, "rewards/margins": 5.375, "rewards/rejected": -4.1875, "step": 368 }, { "epoch": 0.452760736196319, "grad_norm": 39.802701196225414, "learning_rate": 6.862809917355371e-07, "logits/chosen": -0.08349609375, "logits/rejected": -0.19140625, "logps/chosen": -340.0, "logps/rejected": -286.0, "loss": 0.3103, "rewards/accuracies": 0.8359375, "rewards/chosen": 0.6640625, "rewards/margins": 5.03125, "rewards/rejected": -4.375, "step": 369 }, { "epoch": 0.4539877300613497, "grad_norm": 35.44626532768664, "learning_rate": 6.859504132231404e-07, "logits/chosen": -0.2470703125, "logits/rejected": -0.4375, "logps/chosen": -400.0, "logps/rejected": -340.0, "loss": 0.3001, "rewards/accuracies": 0.8515625, "rewards/chosen": 2.015625, "rewards/margins": 6.03125, "rewards/rejected": -4.0, "step": 370 }, { "epoch": 0.45521472392638035, "grad_norm": 34.081640470685045, "learning_rate": 6.856198347107438e-07, "logits/chosen": -0.2314453125, "logits/rejected": -0.408203125, "logps/chosen": -458.0, "logps/rejected": -356.0, "loss": 0.268, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.8203125, "rewards/margins": 5.5625, "rewards/rejected": -3.734375, "step": 371 }, { "epoch": 0.456441717791411, "grad_norm": 32.10146522336104, "learning_rate": 6.852892561983471e-07, "logits/chosen": -0.14453125, "logits/rejected": -0.30078125, "logps/chosen": -406.0, "logps/rejected": -316.0, "loss": 0.2227, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.75, "rewards/margins": 5.90625, "rewards/rejected": -4.15625, "step": 372 }, { "epoch": 0.45766871165644174, "grad_norm": 38.40212256087746, "learning_rate": 6.849586776859504e-07, "logits/chosen": -0.1728515625, "logits/rejected": -0.279296875, "logps/chosen": -360.0, "logps/rejected": -314.0, "loss": 0.3491, "rewards/accuracies": 0.828125, "rewards/chosen": 0.88671875, "rewards/margins": 5.28125, "rewards/rejected": -4.40625, "step": 373 }, { "epoch": 0.4588957055214724, "grad_norm": 33.89078532536025, "learning_rate": 6.846280991735537e-07, "logits/chosen": -0.1943359375, "logits/rejected": -0.328125, "logps/chosen": -382.0, "logps/rejected": -310.0, "loss": 0.2439, "rewards/accuracies": 0.8515625, "rewards/chosen": 2.03125, "rewards/margins": 6.28125, "rewards/rejected": -4.25, "step": 374 }, { "epoch": 0.4601226993865031, "grad_norm": 38.36603856770271, "learning_rate": 6.84297520661157e-07, "logits/chosen": -0.24609375, "logits/rejected": -0.330078125, "logps/chosen": -390.0, "logps/rejected": -346.0, "loss": 0.2743, "rewards/accuracies": 0.84375, "rewards/chosen": 1.7890625, "rewards/margins": 5.5625, "rewards/rejected": -3.78125, "step": 375 }, { "epoch": 0.46134969325153374, "grad_norm": 32.73897251445023, "learning_rate": 6.839669421487603e-07, "logits/chosen": -0.12255859375, "logits/rejected": -0.271484375, "logps/chosen": -374.0, "logps/rejected": -342.0, "loss": 0.231, "rewards/accuracies": 0.90625, "rewards/chosen": 1.796875, "rewards/margins": 5.75, "rewards/rejected": -3.9375, "step": 376 }, { "epoch": 0.4625766871165644, "grad_norm": 36.44881761827906, "learning_rate": 6.836363636363636e-07, "logits/chosen": -0.197265625, "logits/rejected": -0.26171875, "logps/chosen": -350.0, "logps/rejected": -314.0, "loss": 0.2817, "rewards/accuracies": 0.8125, "rewards/chosen": 1.65625, "rewards/margins": 6.46875, "rewards/rejected": -4.8125, "step": 377 }, { "epoch": 0.4638036809815951, "grad_norm": 36.92866834323212, "learning_rate": 6.833057851239669e-07, "logits/chosen": -0.2275390625, "logits/rejected": -0.474609375, "logps/chosen": -376.0, "logps/rejected": -328.0, "loss": 0.3001, "rewards/accuracies": 0.8125, "rewards/chosen": 1.734375, "rewards/margins": 6.25, "rewards/rejected": -4.5, "step": 378 }, { "epoch": 0.46503067484662575, "grad_norm": 32.73144242036404, "learning_rate": 6.829752066115702e-07, "logits/chosen": -0.27734375, "logits/rejected": -0.447265625, "logps/chosen": -408.0, "logps/rejected": -338.0, "loss": 0.2471, "rewards/accuracies": 0.84375, "rewards/chosen": 1.7578125, "rewards/margins": 6.8125, "rewards/rejected": -5.0625, "step": 379 }, { "epoch": 0.4662576687116564, "grad_norm": 34.6763093414022, "learning_rate": 6.826446280991735e-07, "logits/chosen": -0.1923828125, "logits/rejected": -0.34375, "logps/chosen": -384.0, "logps/rejected": -324.0, "loss": 0.2659, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.5546875, "rewards/margins": 6.53125, "rewards/rejected": -4.96875, "step": 380 }, { "epoch": 0.46748466257668714, "grad_norm": 34.98446202126656, "learning_rate": 6.823140495867768e-07, "logits/chosen": -0.2734375, "logits/rejected": -0.453125, "logps/chosen": -372.0, "logps/rejected": -324.0, "loss": 0.3193, "rewards/accuracies": 0.890625, "rewards/chosen": 0.99609375, "rewards/margins": 6.59375, "rewards/rejected": -5.59375, "step": 381 }, { "epoch": 0.4687116564417178, "grad_norm": 33.068661800772716, "learning_rate": 6.819834710743801e-07, "logits/chosen": -0.279296875, "logits/rejected": -0.384765625, "logps/chosen": -380.0, "logps/rejected": -336.0, "loss": 0.2838, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.0703125, "rewards/margins": 6.46875, "rewards/rejected": -5.40625, "step": 382 }, { "epoch": 0.4699386503067485, "grad_norm": 37.187464031340724, "learning_rate": 6.816528925619835e-07, "logits/chosen": -0.1943359375, "logits/rejected": -0.359375, "logps/chosen": -404.0, "logps/rejected": -378.0, "loss": 0.33, "rewards/accuracies": 0.859375, "rewards/chosen": 0.96875, "rewards/margins": 6.59375, "rewards/rejected": -5.625, "step": 383 }, { "epoch": 0.47116564417177914, "grad_norm": 35.133860722289874, "learning_rate": 6.813223140495868e-07, "logits/chosen": -0.283203125, "logits/rejected": -0.52734375, "logps/chosen": -398.0, "logps/rejected": -336.0, "loss": 0.2466, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.60546875, "rewards/margins": 7.09375, "rewards/rejected": -6.5, "step": 384 }, { "epoch": 0.4723926380368098, "grad_norm": 40.48440514462701, "learning_rate": 6.809917355371901e-07, "logits/chosen": -0.1884765625, "logits/rejected": -0.38671875, "logps/chosen": -394.0, "logps/rejected": -328.0, "loss": 0.3252, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2578125, "rewards/margins": 6.03125, "rewards/rejected": -5.78125, "step": 385 }, { "epoch": 0.4736196319018405, "grad_norm": 40.628340663991764, "learning_rate": 6.806611570247933e-07, "logits/chosen": -0.1416015625, "logits/rejected": -0.30859375, "logps/chosen": -344.0, "logps/rejected": -306.0, "loss": 0.3025, "rewards/accuracies": 0.875, "rewards/chosen": -0.359375, "rewards/margins": 5.71875, "rewards/rejected": -6.0625, "step": 386 }, { "epoch": 0.47484662576687114, "grad_norm": 51.72741620856106, "learning_rate": 6.803305785123966e-07, "logits/chosen": -0.162109375, "logits/rejected": -0.365234375, "logps/chosen": -422.0, "logps/rejected": -342.0, "loss": 0.2838, "rewards/accuracies": 0.859375, "rewards/chosen": 0.79296875, "rewards/margins": 6.6875, "rewards/rejected": -5.90625, "step": 387 }, { "epoch": 0.47607361963190187, "grad_norm": 43.50814776279542, "learning_rate": 6.8e-07, "logits/chosen": -0.1826171875, "logits/rejected": -0.291015625, "logps/chosen": -406.0, "logps/rejected": -322.0, "loss": 0.3977, "rewards/accuracies": 0.796875, "rewards/chosen": 0.05029296875, "rewards/margins": 5.15625, "rewards/rejected": -5.09375, "step": 388 }, { "epoch": 0.47730061349693254, "grad_norm": 44.9083628878753, "learning_rate": 6.796694214876033e-07, "logits/chosen": -0.2373046875, "logits/rejected": -0.3359375, "logps/chosen": -408.0, "logps/rejected": -334.0, "loss": 0.3913, "rewards/accuracies": 0.796875, "rewards/chosen": 0.44140625, "rewards/margins": 6.0625, "rewards/rejected": -5.625, "step": 389 }, { "epoch": 0.4785276073619632, "grad_norm": 42.893730022875914, "learning_rate": 6.793388429752066e-07, "logits/chosen": -0.3046875, "logits/rejected": -0.443359375, "logps/chosen": -368.0, "logps/rejected": -338.0, "loss": 0.3759, "rewards/accuracies": 0.7890625, "rewards/chosen": -0.263671875, "rewards/margins": 5.71875, "rewards/rejected": -6.0, "step": 390 }, { "epoch": 0.47975460122699387, "grad_norm": 46.56902163562806, "learning_rate": 6.790082644628099e-07, "logits/chosen": -0.2138671875, "logits/rejected": -0.34375, "logps/chosen": -384.0, "logps/rejected": -334.0, "loss": 0.4122, "rewards/accuracies": 0.828125, "rewards/chosen": 0.3984375, "rewards/margins": 5.96875, "rewards/rejected": -5.5625, "step": 391 }, { "epoch": 0.48098159509202454, "grad_norm": 32.46380915314015, "learning_rate": 6.786776859504132e-07, "logits/chosen": -0.166015625, "logits/rejected": -0.3203125, "logps/chosen": -356.0, "logps/rejected": -320.0, "loss": 0.2695, "rewards/accuracies": 0.859375, "rewards/chosen": 0.69921875, "rewards/margins": 6.375, "rewards/rejected": -5.65625, "step": 392 }, { "epoch": 0.4822085889570552, "grad_norm": 36.411647842869584, "learning_rate": 6.783471074380165e-07, "logits/chosen": -0.130859375, "logits/rejected": -0.27734375, "logps/chosen": -406.0, "logps/rejected": -362.0, "loss": 0.2936, "rewards/accuracies": 0.8125, "rewards/chosen": 0.66015625, "rewards/margins": 6.125, "rewards/rejected": -5.46875, "step": 393 }, { "epoch": 0.4834355828220859, "grad_norm": 36.43693693488016, "learning_rate": 6.780165289256199e-07, "logits/chosen": -0.19921875, "logits/rejected": -0.416015625, "logps/chosen": -388.0, "logps/rejected": -332.0, "loss": 0.2504, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.7265625, "rewards/margins": 6.0625, "rewards/rejected": -5.34375, "step": 394 }, { "epoch": 0.48466257668711654, "grad_norm": 36.92302249692751, "learning_rate": 6.776859504132231e-07, "logits/chosen": -0.201171875, "logits/rejected": -0.33203125, "logps/chosen": -438.0, "logps/rejected": -344.0, "loss": 0.3275, "rewards/accuracies": 0.828125, "rewards/chosen": 0.890625, "rewards/margins": 5.84375, "rewards/rejected": -4.96875, "step": 395 }, { "epoch": 0.48588957055214727, "grad_norm": 31.266490118113346, "learning_rate": 6.773553719008264e-07, "logits/chosen": -0.271484375, "logits/rejected": -0.486328125, "logps/chosen": -338.0, "logps/rejected": -320.0, "loss": 0.2215, "rewards/accuracies": 0.875, "rewards/chosen": 0.462890625, "rewards/margins": 6.15625, "rewards/rejected": -5.6875, "step": 396 }, { "epoch": 0.48711656441717793, "grad_norm": 34.937182799458625, "learning_rate": 6.770247933884297e-07, "logits/chosen": -0.2470703125, "logits/rejected": -0.42578125, "logps/chosen": -374.0, "logps/rejected": -332.0, "loss": 0.2752, "rewards/accuracies": 0.828125, "rewards/chosen": 0.8125, "rewards/margins": 6.46875, "rewards/rejected": -5.65625, "step": 397 }, { "epoch": 0.4883435582822086, "grad_norm": 38.419527775162116, "learning_rate": 6.76694214876033e-07, "logits/chosen": -0.236328125, "logits/rejected": -0.390625, "logps/chosen": -414.0, "logps/rejected": -332.0, "loss": 0.3231, "rewards/accuracies": 0.796875, "rewards/chosen": 1.1640625, "rewards/margins": 6.21875, "rewards/rejected": -5.0625, "step": 398 }, { "epoch": 0.48957055214723927, "grad_norm": 35.54458075122045, "learning_rate": 6.763636363636363e-07, "logits/chosen": -0.2578125, "logits/rejected": -0.404296875, "logps/chosen": -382.0, "logps/rejected": -330.0, "loss": 0.306, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.0546875, "rewards/margins": 6.0, "rewards/rejected": -4.9375, "step": 399 }, { "epoch": 0.49079754601226994, "grad_norm": 47.751486198572856, "learning_rate": 6.760330578512397e-07, "logits/chosen": -0.2060546875, "logits/rejected": -0.291015625, "logps/chosen": -370.0, "logps/rejected": -350.0, "loss": 0.3896, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.90234375, "rewards/margins": 5.375, "rewards/rejected": -4.46875, "step": 400 }, { "epoch": 0.4920245398773006, "grad_norm": 31.519656830052252, "learning_rate": 6.75702479338843e-07, "logits/chosen": -0.328125, "logits/rejected": -0.482421875, "logps/chosen": -444.0, "logps/rejected": -372.0, "loss": 0.2337, "rewards/accuracies": 0.875, "rewards/chosen": 1.6953125, "rewards/margins": 7.03125, "rewards/rejected": -5.34375, "step": 401 }, { "epoch": 0.49325153374233127, "grad_norm": 36.11809592072752, "learning_rate": 6.753719008264463e-07, "logits/chosen": -0.1943359375, "logits/rejected": -0.302734375, "logps/chosen": -382.0, "logps/rejected": -332.0, "loss": 0.3095, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.1328125, "rewards/margins": 5.90625, "rewards/rejected": -4.78125, "step": 402 }, { "epoch": 0.49447852760736194, "grad_norm": 38.21909292164752, "learning_rate": 6.750413223140496e-07, "logits/chosen": -0.1884765625, "logits/rejected": -0.291015625, "logps/chosen": -386.0, "logps/rejected": -354.0, "loss": 0.3169, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.0625, "rewards/margins": 5.9375, "rewards/rejected": -4.875, "step": 403 }, { "epoch": 0.49570552147239266, "grad_norm": 32.22630836566114, "learning_rate": 6.747107438016528e-07, "logits/chosen": -0.13671875, "logits/rejected": -0.28515625, "logps/chosen": -362.0, "logps/rejected": -328.0, "loss": 0.2283, "rewards/accuracies": 0.890625, "rewards/chosen": 1.2578125, "rewards/margins": 6.25, "rewards/rejected": -5.0, "step": 404 }, { "epoch": 0.49693251533742333, "grad_norm": 37.593793152840426, "learning_rate": 6.743801652892561e-07, "logits/chosen": -0.216796875, "logits/rejected": -0.451171875, "logps/chosen": -362.0, "logps/rejected": -308.0, "loss": 0.3305, "rewards/accuracies": 0.84375, "rewards/chosen": 1.40625, "rewards/margins": 6.0625, "rewards/rejected": -4.65625, "step": 405 }, { "epoch": 0.498159509202454, "grad_norm": 41.53333095908596, "learning_rate": 6.740495867768595e-07, "logits/chosen": -0.115234375, "logits/rejected": -0.2109375, "logps/chosen": -372.0, "logps/rejected": -326.0, "loss": 0.3932, "rewards/accuracies": 0.78125, "rewards/chosen": 1.078125, "rewards/margins": 5.375, "rewards/rejected": -4.3125, "step": 406 }, { "epoch": 0.49938650306748467, "grad_norm": 42.42876322706536, "learning_rate": 6.737190082644628e-07, "logits/chosen": -0.0986328125, "logits/rejected": -0.26171875, "logps/chosen": -400.0, "logps/rejected": -326.0, "loss": 0.3513, "rewards/accuracies": 0.8203125, "rewards/chosen": 2.140625, "rewards/margins": 6.4375, "rewards/rejected": -4.3125, "step": 407 }, { "epoch": 0.5006134969325153, "grad_norm": 48.89324534838805, "learning_rate": 6.733884297520661e-07, "logits/chosen": -0.1982421875, "logits/rejected": -0.29296875, "logps/chosen": -418.0, "logps/rejected": -348.0, "loss": 0.4164, "rewards/accuracies": 0.7734375, "rewards/chosen": 0.80078125, "rewards/margins": 4.78125, "rewards/rejected": -3.984375, "step": 408 }, { "epoch": 0.501840490797546, "grad_norm": 45.10686444580896, "learning_rate": 6.730578512396694e-07, "logits/chosen": -0.1318359375, "logits/rejected": -0.33203125, "logps/chosen": -416.0, "logps/rejected": -328.0, "loss": 0.3079, "rewards/accuracies": 0.84375, "rewards/chosen": 1.46875, "rewards/margins": 6.21875, "rewards/rejected": -4.75, "step": 409 }, { "epoch": 0.5030674846625767, "grad_norm": 38.62243714595701, "learning_rate": 6.727272727272727e-07, "logits/chosen": -0.119140625, "logits/rejected": -0.326171875, "logps/chosen": -382.0, "logps/rejected": -344.0, "loss": 0.2966, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.0390625, "rewards/margins": 5.34375, "rewards/rejected": -4.3125, "step": 410 }, { "epoch": 0.5042944785276073, "grad_norm": 37.41136253841519, "learning_rate": 6.72396694214876e-07, "logits/chosen": -0.11083984375, "logits/rejected": -0.255859375, "logps/chosen": -336.0, "logps/rejected": -306.0, "loss": 0.284, "rewards/accuracies": 0.84375, "rewards/chosen": 0.76953125, "rewards/margins": 5.71875, "rewards/rejected": -4.9375, "step": 411 }, { "epoch": 0.505521472392638, "grad_norm": 47.69531455944101, "learning_rate": 6.720661157024794e-07, "logits/chosen": -0.1171875, "logits/rejected": -0.259765625, "logps/chosen": -420.0, "logps/rejected": -354.0, "loss": 0.3619, "rewards/accuracies": 0.84375, "rewards/chosen": 1.0546875, "rewards/margins": 5.3125, "rewards/rejected": -4.28125, "step": 412 }, { "epoch": 0.5067484662576687, "grad_norm": 39.571364824526874, "learning_rate": 6.717355371900826e-07, "logits/chosen": -0.154296875, "logits/rejected": -0.388671875, "logps/chosen": -402.0, "logps/rejected": -316.0, "loss": 0.3069, "rewards/accuracies": 0.84375, "rewards/chosen": 1.5078125, "rewards/margins": 6.09375, "rewards/rejected": -4.59375, "step": 413 }, { "epoch": 0.5079754601226993, "grad_norm": 34.32054957685153, "learning_rate": 6.714049586776859e-07, "logits/chosen": -0.19921875, "logits/rejected": -0.353515625, "logps/chosen": -402.0, "logps/rejected": -342.0, "loss": 0.2497, "rewards/accuracies": 0.890625, "rewards/chosen": 1.28125, "rewards/margins": 6.09375, "rewards/rejected": -4.8125, "step": 414 }, { "epoch": 0.50920245398773, "grad_norm": 35.2489180238823, "learning_rate": 6.710743801652892e-07, "logits/chosen": -0.1591796875, "logits/rejected": -0.34375, "logps/chosen": -346.0, "logps/rejected": -318.0, "loss": 0.2788, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.0078125, "rewards/margins": 5.84375, "rewards/rejected": -4.84375, "step": 415 }, { "epoch": 0.5104294478527608, "grad_norm": 28.41248357906051, "learning_rate": 6.707438016528925e-07, "logits/chosen": -0.130859375, "logits/rejected": -0.35546875, "logps/chosen": -356.0, "logps/rejected": -310.0, "loss": 0.186, "rewards/accuracies": 0.90625, "rewards/chosen": 0.8515625, "rewards/margins": 5.59375, "rewards/rejected": -4.75, "step": 416 }, { "epoch": 0.5116564417177915, "grad_norm": 35.52909474934163, "learning_rate": 6.704132231404958e-07, "logits/chosen": -0.328125, "logits/rejected": -0.5078125, "logps/chosen": -434.0, "logps/rejected": -370.0, "loss": 0.2995, "rewards/accuracies": 0.828125, "rewards/chosen": 1.8203125, "rewards/margins": 7.34375, "rewards/rejected": -5.53125, "step": 417 }, { "epoch": 0.5128834355828221, "grad_norm": 36.29519060781132, "learning_rate": 6.700826446280992e-07, "logits/chosen": -0.244140625, "logits/rejected": -0.34765625, "logps/chosen": -362.0, "logps/rejected": -292.0, "loss": 0.2828, "rewards/accuracies": 0.84375, "rewards/chosen": 1.265625, "rewards/margins": 6.375, "rewards/rejected": -5.09375, "step": 418 }, { "epoch": 0.5141104294478528, "grad_norm": 31.87680208130441, "learning_rate": 6.697520661157025e-07, "logits/chosen": -0.181640625, "logits/rejected": -0.353515625, "logps/chosen": -378.0, "logps/rejected": -330.0, "loss": 0.2486, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.2265625, "rewards/margins": 6.8125, "rewards/rejected": -5.59375, "step": 419 }, { "epoch": 0.5153374233128835, "grad_norm": 40.881697279170936, "learning_rate": 6.694214876033058e-07, "logits/chosen": -0.1162109375, "logits/rejected": -0.29296875, "logps/chosen": -344.0, "logps/rejected": -304.0, "loss": 0.3244, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.03125, "rewards/margins": 5.78125, "rewards/rejected": -4.75, "step": 420 }, { "epoch": 0.5165644171779141, "grad_norm": 34.11082321167536, "learning_rate": 6.69090909090909e-07, "logits/chosen": -0.15625, "logits/rejected": -0.365234375, "logps/chosen": -362.0, "logps/rejected": -312.0, "loss": 0.339, "rewards/accuracies": 0.859375, "rewards/chosen": 1.40625, "rewards/margins": 6.21875, "rewards/rejected": -4.8125, "step": 421 }, { "epoch": 0.5177914110429448, "grad_norm": 35.18821029472038, "learning_rate": 6.687603305785123e-07, "logits/chosen": -0.0810546875, "logits/rejected": -0.2490234375, "logps/chosen": -358.0, "logps/rejected": -294.0, "loss": 0.3166, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.69921875, "rewards/margins": 6.0625, "rewards/rejected": -5.34375, "step": 422 }, { "epoch": 0.5190184049079755, "grad_norm": 41.06855790218669, "learning_rate": 6.684297520661156e-07, "logits/chosen": -0.1982421875, "logits/rejected": -0.365234375, "logps/chosen": -398.0, "logps/rejected": -356.0, "loss": 0.3606, "rewards/accuracies": 0.8359375, "rewards/chosen": 0.6640625, "rewards/margins": 5.625, "rewards/rejected": -4.96875, "step": 423 }, { "epoch": 0.5202453987730061, "grad_norm": 36.724024878608596, "learning_rate": 6.68099173553719e-07, "logits/chosen": -0.123046875, "logits/rejected": -0.326171875, "logps/chosen": -378.0, "logps/rejected": -340.0, "loss": 0.3438, "rewards/accuracies": 0.828125, "rewards/chosen": 1.1171875, "rewards/margins": 6.6875, "rewards/rejected": -5.5625, "step": 424 }, { "epoch": 0.5214723926380368, "grad_norm": 41.01181618114964, "learning_rate": 6.677685950413223e-07, "logits/chosen": -0.1591796875, "logits/rejected": -0.28125, "logps/chosen": -396.0, "logps/rejected": -342.0, "loss": 0.4073, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.3203125, "rewards/margins": 6.28125, "rewards/rejected": -4.96875, "step": 425 }, { "epoch": 0.5226993865030675, "grad_norm": 44.64404869891064, "learning_rate": 6.674380165289256e-07, "logits/chosen": -0.2041015625, "logits/rejected": -0.3359375, "logps/chosen": -370.0, "logps/rejected": -342.0, "loss": 0.3035, "rewards/accuracies": 0.890625, "rewards/chosen": 1.171875, "rewards/margins": 6.625, "rewards/rejected": -5.46875, "step": 426 }, { "epoch": 0.5239263803680981, "grad_norm": 91.8646628453638, "learning_rate": 6.671074380165289e-07, "logits/chosen": -0.1640625, "logits/rejected": -0.28125, "logps/chosen": -378.0, "logps/rejected": -328.0, "loss": 0.299, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.15625, "rewards/margins": 6.25, "rewards/rejected": -5.09375, "step": 427 }, { "epoch": 0.5251533742331288, "grad_norm": 36.99313104379447, "learning_rate": 6.667768595041322e-07, "logits/chosen": -0.189453125, "logits/rejected": -0.318359375, "logps/chosen": -362.0, "logps/rejected": -316.0, "loss": 0.3507, "rewards/accuracies": 0.828125, "rewards/chosen": 0.66015625, "rewards/margins": 5.90625, "rewards/rejected": -5.21875, "step": 428 }, { "epoch": 0.5263803680981595, "grad_norm": 33.0190569729192, "learning_rate": 6.664462809917356e-07, "logits/chosen": -0.19140625, "logits/rejected": -0.310546875, "logps/chosen": -360.0, "logps/rejected": -366.0, "loss": 0.246, "rewards/accuracies": 0.859375, "rewards/chosen": 0.443359375, "rewards/margins": 6.90625, "rewards/rejected": -6.46875, "step": 429 }, { "epoch": 0.5276073619631901, "grad_norm": 30.408983999620382, "learning_rate": 6.661157024793388e-07, "logits/chosen": -0.2578125, "logits/rejected": -0.431640625, "logps/chosen": -394.0, "logps/rejected": -342.0, "loss": 0.2248, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.9921875, "rewards/margins": 6.84375, "rewards/rejected": -5.84375, "step": 430 }, { "epoch": 0.5288343558282208, "grad_norm": 47.87075432548269, "learning_rate": 6.657851239669421e-07, "logits/chosen": -0.1435546875, "logits/rejected": -0.31640625, "logps/chosen": -384.0, "logps/rejected": -336.0, "loss": 0.4545, "rewards/accuracies": 0.796875, "rewards/chosen": 0.45703125, "rewards/margins": 5.6875, "rewards/rejected": -5.25, "step": 431 }, { "epoch": 0.5300613496932516, "grad_norm": 43.65339869428465, "learning_rate": 6.654545454545454e-07, "logits/chosen": -0.0927734375, "logits/rejected": -0.1435546875, "logps/chosen": -376.0, "logps/rejected": -344.0, "loss": 0.3724, "rewards/accuracies": 0.8125, "rewards/chosen": 1.2265625, "rewards/margins": 6.09375, "rewards/rejected": -4.875, "step": 432 }, { "epoch": 0.5312883435582823, "grad_norm": 45.133784704459096, "learning_rate": 6.651239669421487e-07, "logits/chosen": -0.078125, "logits/rejected": -0.3046875, "logps/chosen": -382.0, "logps/rejected": -308.0, "loss": 0.3416, "rewards/accuracies": 0.8046875, "rewards/chosen": 0.39453125, "rewards/margins": 5.75, "rewards/rejected": -5.34375, "step": 433 }, { "epoch": 0.5325153374233129, "grad_norm": 40.47930492236747, "learning_rate": 6.64793388429752e-07, "logits/chosen": -0.232421875, "logits/rejected": -0.326171875, "logps/chosen": -386.0, "logps/rejected": -346.0, "loss": 0.254, "rewards/accuracies": 0.84375, "rewards/chosen": 0.53125, "rewards/margins": 5.8125, "rewards/rejected": -5.25, "step": 434 }, { "epoch": 0.5337423312883436, "grad_norm": 41.262979059220854, "learning_rate": 6.644628099173554e-07, "logits/chosen": -0.1689453125, "logits/rejected": -0.380859375, "logps/chosen": -386.0, "logps/rejected": -350.0, "loss": 0.3119, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.125, "rewards/margins": 6.53125, "rewards/rejected": -5.40625, "step": 435 }, { "epoch": 0.5349693251533743, "grad_norm": 38.67538014065472, "learning_rate": 6.641322314049587e-07, "logits/chosen": -0.1748046875, "logits/rejected": -0.38671875, "logps/chosen": -416.0, "logps/rejected": -346.0, "loss": 0.2467, "rewards/accuracies": 0.859375, "rewards/chosen": 1.6796875, "rewards/margins": 7.15625, "rewards/rejected": -5.46875, "step": 436 }, { "epoch": 0.5361963190184049, "grad_norm": 31.32861125197491, "learning_rate": 6.63801652892562e-07, "logits/chosen": -0.2138671875, "logits/rejected": -0.400390625, "logps/chosen": -382.0, "logps/rejected": -338.0, "loss": 0.248, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.078125, "rewards/margins": 6.65625, "rewards/rejected": -5.5625, "step": 437 }, { "epoch": 0.5374233128834356, "grad_norm": 42.810824724719026, "learning_rate": 6.634710743801653e-07, "logits/chosen": -0.1337890625, "logits/rejected": -0.2392578125, "logps/chosen": -358.0, "logps/rejected": -322.0, "loss": 0.3969, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.80078125, "rewards/margins": 5.1875, "rewards/rejected": -4.375, "step": 438 }, { "epoch": 0.5386503067484663, "grad_norm": 36.79651022084742, "learning_rate": 6.631404958677685e-07, "logits/chosen": -0.083984375, "logits/rejected": -0.287109375, "logps/chosen": -364.0, "logps/rejected": -334.0, "loss": 0.2838, "rewards/accuracies": 0.828125, "rewards/chosen": 0.79296875, "rewards/margins": 5.96875, "rewards/rejected": -5.1875, "step": 439 }, { "epoch": 0.5398773006134969, "grad_norm": 49.84881532208057, "learning_rate": 6.628099173553718e-07, "logits/chosen": -0.1298828125, "logits/rejected": -0.2333984375, "logps/chosen": -384.0, "logps/rejected": -332.0, "loss": 0.3608, "rewards/accuracies": 0.8046875, "rewards/chosen": 0.384765625, "rewards/margins": 5.0625, "rewards/rejected": -4.6875, "step": 440 }, { "epoch": 0.5411042944785276, "grad_norm": 37.976634967176224, "learning_rate": 6.624793388429752e-07, "logits/chosen": -0.06640625, "logits/rejected": -0.1826171875, "logps/chosen": -332.0, "logps/rejected": -300.0, "loss": 0.328, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.71484375, "rewards/margins": 5.46875, "rewards/rejected": -4.75, "step": 441 }, { "epoch": 0.5423312883435583, "grad_norm": 37.80188895923485, "learning_rate": 6.621487603305785e-07, "logits/chosen": -0.2109375, "logits/rejected": -0.34765625, "logps/chosen": -382.0, "logps/rejected": -340.0, "loss": 0.3304, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.171875, "rewards/margins": 5.96875, "rewards/rejected": -4.8125, "step": 442 }, { "epoch": 0.5435582822085889, "grad_norm": 40.24381216440989, "learning_rate": 6.618181818181818e-07, "logits/chosen": -0.162109375, "logits/rejected": -0.296875, "logps/chosen": -364.0, "logps/rejected": -318.0, "loss": 0.3159, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.4140625, "rewards/margins": 6.0, "rewards/rejected": -4.59375, "step": 443 }, { "epoch": 0.5447852760736196, "grad_norm": 37.922945446281, "learning_rate": 6.614876033057851e-07, "logits/chosen": -0.201171875, "logits/rejected": -0.44140625, "logps/chosen": -446.0, "logps/rejected": -366.0, "loss": 0.2446, "rewards/accuracies": 0.8671875, "rewards/chosen": 2.09375, "rewards/margins": 7.25, "rewards/rejected": -5.15625, "step": 444 }, { "epoch": 0.5460122699386503, "grad_norm": 38.45325276499507, "learning_rate": 6.611570247933884e-07, "logits/chosen": -0.169921875, "logits/rejected": -0.353515625, "logps/chosen": -350.0, "logps/rejected": -300.0, "loss": 0.389, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.3671875, "rewards/margins": 5.46875, "rewards/rejected": -4.125, "step": 445 }, { "epoch": 0.5472392638036809, "grad_norm": 33.02180393783636, "learning_rate": 6.608264462809917e-07, "logits/chosen": -0.185546875, "logits/rejected": -0.359375, "logps/chosen": -432.0, "logps/rejected": -356.0, "loss": 0.2348, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.46875, "rewards/margins": 5.71875, "rewards/rejected": -4.25, "step": 446 }, { "epoch": 0.5484662576687117, "grad_norm": 31.670625439038492, "learning_rate": 6.604958677685951e-07, "logits/chosen": -0.1767578125, "logits/rejected": -0.388671875, "logps/chosen": -410.0, "logps/rejected": -346.0, "loss": 0.2551, "rewards/accuracies": 0.875, "rewards/chosen": 1.875, "rewards/margins": 7.15625, "rewards/rejected": -5.28125, "step": 447 }, { "epoch": 0.5496932515337424, "grad_norm": 37.605046960174505, "learning_rate": 6.601652892561983e-07, "logits/chosen": -0.10888671875, "logits/rejected": -0.259765625, "logps/chosen": -338.0, "logps/rejected": -298.0, "loss": 0.3209, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.90234375, "rewards/margins": 5.15625, "rewards/rejected": -4.25, "step": 448 }, { "epoch": 0.550920245398773, "grad_norm": 34.080535896094865, "learning_rate": 6.598347107438016e-07, "logits/chosen": -0.1748046875, "logits/rejected": -0.322265625, "logps/chosen": -392.0, "logps/rejected": -330.0, "loss": 0.2712, "rewards/accuracies": 0.859375, "rewards/chosen": 1.9453125, "rewards/margins": 6.5, "rewards/rejected": -4.53125, "step": 449 }, { "epoch": 0.5521472392638037, "grad_norm": 35.069217343013015, "learning_rate": 6.595041322314049e-07, "logits/chosen": -0.255859375, "logits/rejected": -0.30859375, "logps/chosen": -344.0, "logps/rejected": -288.0, "loss": 0.285, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.2734375, "rewards/margins": 5.90625, "rewards/rejected": -4.625, "step": 450 }, { "epoch": 0.5533742331288344, "grad_norm": 33.87966228532685, "learning_rate": 6.591735537190082e-07, "logits/chosen": -0.1259765625, "logits/rejected": -0.30859375, "logps/chosen": -340.0, "logps/rejected": -280.0, "loss": 0.3043, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.1953125, "rewards/margins": 5.6875, "rewards/rejected": -4.5, "step": 451 }, { "epoch": 0.554601226993865, "grad_norm": 35.08833886262592, "learning_rate": 6.588429752066115e-07, "logits/chosen": -0.1865234375, "logits/rejected": -0.443359375, "logps/chosen": -454.0, "logps/rejected": -328.0, "loss": 0.258, "rewards/accuracies": 0.859375, "rewards/chosen": 2.421875, "rewards/margins": 6.625, "rewards/rejected": -4.21875, "step": 452 }, { "epoch": 0.5558282208588957, "grad_norm": 30.509116856340853, "learning_rate": 6.585123966942149e-07, "logits/chosen": -0.26171875, "logits/rejected": -0.48828125, "logps/chosen": -436.0, "logps/rejected": -366.0, "loss": 0.214, "rewards/accuracies": 0.90625, "rewards/chosen": 2.578125, "rewards/margins": 7.34375, "rewards/rejected": -4.78125, "step": 453 }, { "epoch": 0.5570552147239264, "grad_norm": 36.06945734305074, "learning_rate": 6.581818181818182e-07, "logits/chosen": -0.11572265625, "logits/rejected": -0.19921875, "logps/chosen": -338.0, "logps/rejected": -306.0, "loss": 0.2945, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.859375, "rewards/margins": 5.5, "rewards/rejected": -4.625, "step": 454 }, { "epoch": 0.558282208588957, "grad_norm": 35.814869576892626, "learning_rate": 6.578512396694215e-07, "logits/chosen": -0.224609375, "logits/rejected": -0.36328125, "logps/chosen": -366.0, "logps/rejected": -350.0, "loss": 0.2399, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.9609375, "rewards/margins": 6.75, "rewards/rejected": -4.8125, "step": 455 }, { "epoch": 0.5595092024539877, "grad_norm": 38.450506141939925, "learning_rate": 6.575206611570248e-07, "logits/chosen": -0.12060546875, "logits/rejected": -0.2236328125, "logps/chosen": -312.0, "logps/rejected": -302.0, "loss": 0.2952, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.1171875, "rewards/margins": 6.25, "rewards/rejected": -5.125, "step": 456 }, { "epoch": 0.5607361963190184, "grad_norm": 37.93391723235656, "learning_rate": 6.57190082644628e-07, "logits/chosen": -0.1484375, "logits/rejected": -0.2890625, "logps/chosen": -354.0, "logps/rejected": -320.0, "loss": 0.3025, "rewards/accuracies": 0.828125, "rewards/chosen": 1.2265625, "rewards/margins": 5.78125, "rewards/rejected": -4.5625, "step": 457 }, { "epoch": 0.561963190184049, "grad_norm": 33.44669035850576, "learning_rate": 6.568595041322313e-07, "logits/chosen": -0.1689453125, "logits/rejected": -0.341796875, "logps/chosen": -370.0, "logps/rejected": -290.0, "loss": 0.2297, "rewards/accuracies": 0.890625, "rewards/chosen": 1.75, "rewards/margins": 6.875, "rewards/rejected": -5.125, "step": 458 }, { "epoch": 0.5631901840490797, "grad_norm": 34.06851635286411, "learning_rate": 6.565289256198347e-07, "logits/chosen": -0.1611328125, "logits/rejected": -0.337890625, "logps/chosen": -390.0, "logps/rejected": -344.0, "loss": 0.2786, "rewards/accuracies": 0.875, "rewards/chosen": 1.8125, "rewards/margins": 6.875, "rewards/rejected": -5.0625, "step": 459 }, { "epoch": 0.5644171779141104, "grad_norm": 34.68751260016757, "learning_rate": 6.56198347107438e-07, "logits/chosen": -0.1630859375, "logits/rejected": -0.2734375, "logps/chosen": -348.0, "logps/rejected": -330.0, "loss": 0.26, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.76171875, "rewards/margins": 6.78125, "rewards/rejected": -6.03125, "step": 460 }, { "epoch": 0.5656441717791411, "grad_norm": 38.71078681224242, "learning_rate": 6.558677685950413e-07, "logits/chosen": -0.3515625, "logits/rejected": -0.48046875, "logps/chosen": -374.0, "logps/rejected": -342.0, "loss": 0.2741, "rewards/accuracies": 0.859375, "rewards/chosen": 0.80078125, "rewards/margins": 6.15625, "rewards/rejected": -5.34375, "step": 461 }, { "epoch": 0.5668711656441717, "grad_norm": 39.327400074833584, "learning_rate": 6.555371900826446e-07, "logits/chosen": -0.11279296875, "logits/rejected": -0.3125, "logps/chosen": -364.0, "logps/rejected": -298.0, "loss": 0.3248, "rewards/accuracies": 0.84375, "rewards/chosen": 0.609375, "rewards/margins": 5.46875, "rewards/rejected": -4.875, "step": 462 }, { "epoch": 0.5680981595092025, "grad_norm": 37.637164385131356, "learning_rate": 6.552066115702479e-07, "logits/chosen": -0.220703125, "logits/rejected": -0.333984375, "logps/chosen": -364.0, "logps/rejected": -360.0, "loss": 0.2848, "rewards/accuracies": 0.796875, "rewards/chosen": 0.98046875, "rewards/margins": 6.46875, "rewards/rejected": -5.46875, "step": 463 }, { "epoch": 0.5693251533742332, "grad_norm": 41.25059009443085, "learning_rate": 6.548760330578512e-07, "logits/chosen": -0.09619140625, "logits/rejected": -0.279296875, "logps/chosen": -392.0, "logps/rejected": -322.0, "loss": 0.2951, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.8671875, "rewards/margins": 6.21875, "rewards/rejected": -5.34375, "step": 464 }, { "epoch": 0.5705521472392638, "grad_norm": 27.065991136479923, "learning_rate": 6.545454545454546e-07, "logits/chosen": -0.2109375, "logits/rejected": -0.453125, "logps/chosen": -400.0, "logps/rejected": -346.0, "loss": 0.1759, "rewards/accuracies": 0.90625, "rewards/chosen": 1.125, "rewards/margins": 7.1875, "rewards/rejected": -6.0625, "step": 465 }, { "epoch": 0.5717791411042945, "grad_norm": 43.40449571309543, "learning_rate": 6.542148760330578e-07, "logits/chosen": -0.1591796875, "logits/rejected": -0.298828125, "logps/chosen": -418.0, "logps/rejected": -342.0, "loss": 0.2899, "rewards/accuracies": 0.828125, "rewards/chosen": 0.609375, "rewards/margins": 6.5625, "rewards/rejected": -5.9375, "step": 466 }, { "epoch": 0.5730061349693252, "grad_norm": 40.392254031751044, "learning_rate": 6.538842975206611e-07, "logits/chosen": -0.1669921875, "logits/rejected": -0.39453125, "logps/chosen": -384.0, "logps/rejected": -352.0, "loss": 0.3087, "rewards/accuracies": 0.8125, "rewards/chosen": 1.2890625, "rewards/margins": 6.5625, "rewards/rejected": -5.28125, "step": 467 }, { "epoch": 0.5742331288343558, "grad_norm": 41.32661857185299, "learning_rate": 6.535537190082644e-07, "logits/chosen": -0.171875, "logits/rejected": -0.32421875, "logps/chosen": -366.0, "logps/rejected": -344.0, "loss": 0.3022, "rewards/accuracies": 0.84375, "rewards/chosen": 1.015625, "rewards/margins": 6.8125, "rewards/rejected": -5.78125, "step": 468 }, { "epoch": 0.5754601226993865, "grad_norm": 29.07874137818143, "learning_rate": 6.532231404958677e-07, "logits/chosen": -0.12451171875, "logits/rejected": -0.306640625, "logps/chosen": -386.0, "logps/rejected": -306.0, "loss": 0.1838, "rewards/accuracies": 0.90625, "rewards/chosen": 1.21875, "rewards/margins": 6.90625, "rewards/rejected": -5.6875, "step": 469 }, { "epoch": 0.5766871165644172, "grad_norm": 35.40917214666752, "learning_rate": 6.52892561983471e-07, "logits/chosen": -0.1533203125, "logits/rejected": -0.2353515625, "logps/chosen": -350.0, "logps/rejected": -324.0, "loss": 0.301, "rewards/accuracies": 0.875, "rewards/chosen": 1.34375, "rewards/margins": 6.75, "rewards/rejected": -5.40625, "step": 470 }, { "epoch": 0.5779141104294478, "grad_norm": 38.07545863951338, "learning_rate": 6.525619834710744e-07, "logits/chosen": -0.03369140625, "logits/rejected": -0.203125, "logps/chosen": -402.0, "logps/rejected": -336.0, "loss": 0.3263, "rewards/accuracies": 0.8046875, "rewards/chosen": 0.96484375, "rewards/margins": 6.09375, "rewards/rejected": -5.125, "step": 471 }, { "epoch": 0.5791411042944785, "grad_norm": 40.21918996431336, "learning_rate": 6.522314049586777e-07, "logits/chosen": -0.08447265625, "logits/rejected": -0.306640625, "logps/chosen": -406.0, "logps/rejected": -322.0, "loss": 0.3173, "rewards/accuracies": 0.828125, "rewards/chosen": 1.15625, "rewards/margins": 6.34375, "rewards/rejected": -5.15625, "step": 472 }, { "epoch": 0.5803680981595092, "grad_norm": 37.03158250739783, "learning_rate": 6.51900826446281e-07, "logits/chosen": -0.25, "logits/rejected": -0.37109375, "logps/chosen": -396.0, "logps/rejected": -378.0, "loss": 0.3328, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.1015625, "rewards/margins": 6.03125, "rewards/rejected": -4.90625, "step": 473 }, { "epoch": 0.5815950920245399, "grad_norm": 38.12266289452875, "learning_rate": 6.515702479338843e-07, "logits/chosen": -0.2099609375, "logits/rejected": -0.419921875, "logps/chosen": -430.0, "logps/rejected": -346.0, "loss": 0.2648, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.1015625, "rewards/margins": 6.34375, "rewards/rejected": -5.21875, "step": 474 }, { "epoch": 0.5828220858895705, "grad_norm": 31.08159067757818, "learning_rate": 6.512396694214875e-07, "logits/chosen": -0.1953125, "logits/rejected": -0.4140625, "logps/chosen": -426.0, "logps/rejected": -346.0, "loss": 0.2361, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.9921875, "rewards/margins": 7.59375, "rewards/rejected": -5.59375, "step": 475 }, { "epoch": 0.5840490797546012, "grad_norm": 31.0829148956811, "learning_rate": 6.509090909090908e-07, "logits/chosen": -0.1376953125, "logits/rejected": -0.328125, "logps/chosen": -408.0, "logps/rejected": -340.0, "loss": 0.2813, "rewards/accuracies": 0.84375, "rewards/chosen": 0.185546875, "rewards/margins": 5.875, "rewards/rejected": -5.6875, "step": 476 }, { "epoch": 0.5852760736196319, "grad_norm": 36.7408304979899, "learning_rate": 6.505785123966942e-07, "logits/chosen": -0.244140625, "logits/rejected": -0.396484375, "logps/chosen": -420.0, "logps/rejected": -354.0, "loss": 0.257, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.421875, "rewards/margins": 7.1875, "rewards/rejected": -5.75, "step": 477 }, { "epoch": 0.5865030674846625, "grad_norm": 34.872893059723594, "learning_rate": 6.502479338842975e-07, "logits/chosen": -0.16796875, "logits/rejected": -0.345703125, "logps/chosen": -418.0, "logps/rejected": -350.0, "loss": 0.2988, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.140625, "rewards/margins": 7.0, "rewards/rejected": -5.84375, "step": 478 }, { "epoch": 0.5877300613496933, "grad_norm": 35.26754811760802, "learning_rate": 6.499173553719008e-07, "logits/chosen": -0.166015625, "logits/rejected": -0.42578125, "logps/chosen": -356.0, "logps/rejected": -334.0, "loss": 0.2784, "rewards/accuracies": 0.8359375, "rewards/chosen": 0.240234375, "rewards/margins": 6.21875, "rewards/rejected": -5.96875, "step": 479 }, { "epoch": 0.588957055214724, "grad_norm": 33.02148763705059, "learning_rate": 6.495867768595041e-07, "logits/chosen": -0.212890625, "logits/rejected": -0.34765625, "logps/chosen": -358.0, "logps/rejected": -328.0, "loss": 0.2364, "rewards/accuracies": 0.890625, "rewards/chosen": 0.4765625, "rewards/margins": 6.59375, "rewards/rejected": -6.125, "step": 480 }, { "epoch": 0.5901840490797546, "grad_norm": 39.97994667673503, "learning_rate": 6.492561983471074e-07, "logits/chosen": -0.2099609375, "logits/rejected": -0.33203125, "logps/chosen": -424.0, "logps/rejected": -378.0, "loss": 0.3732, "rewards/accuracies": 0.8046875, "rewards/chosen": 0.84765625, "rewards/margins": 6.3125, "rewards/rejected": -5.46875, "step": 481 }, { "epoch": 0.5914110429447853, "grad_norm": 33.72401411710678, "learning_rate": 6.489256198347108e-07, "logits/chosen": -0.2041015625, "logits/rejected": -0.37890625, "logps/chosen": -410.0, "logps/rejected": -334.0, "loss": 0.2739, "rewards/accuracies": 0.828125, "rewards/chosen": 1.109375, "rewards/margins": 6.53125, "rewards/rejected": -5.4375, "step": 482 }, { "epoch": 0.592638036809816, "grad_norm": 34.19291475160813, "learning_rate": 6.485950413223141e-07, "logits/chosen": -0.0703125, "logits/rejected": -0.2138671875, "logps/chosen": -346.0, "logps/rejected": -312.0, "loss": 0.2917, "rewards/accuracies": 0.828125, "rewards/chosen": 0.69921875, "rewards/margins": 6.28125, "rewards/rejected": -5.5625, "step": 483 }, { "epoch": 0.5938650306748466, "grad_norm": 35.398942571150606, "learning_rate": 6.482644628099173e-07, "logits/chosen": -0.1455078125, "logits/rejected": -0.30078125, "logps/chosen": -368.0, "logps/rejected": -326.0, "loss": 0.3155, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.3125, "rewards/margins": 6.1875, "rewards/rejected": -4.875, "step": 484 }, { "epoch": 0.5950920245398773, "grad_norm": 30.26872146503766, "learning_rate": 6.479338842975206e-07, "logits/chosen": -0.12255859375, "logits/rejected": -0.271484375, "logps/chosen": -358.0, "logps/rejected": -306.0, "loss": 0.26, "rewards/accuracies": 0.859375, "rewards/chosen": 0.77734375, "rewards/margins": 6.40625, "rewards/rejected": -5.625, "step": 485 }, { "epoch": 0.596319018404908, "grad_norm": 35.38748335338782, "learning_rate": 6.476033057851239e-07, "logits/chosen": -0.1494140625, "logits/rejected": -0.291015625, "logps/chosen": -402.0, "logps/rejected": -336.0, "loss": 0.2658, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.5390625, "rewards/margins": 6.5, "rewards/rejected": -4.96875, "step": 486 }, { "epoch": 0.5975460122699386, "grad_norm": 30.285435869887902, "learning_rate": 6.472727272727272e-07, "logits/chosen": -0.212890625, "logits/rejected": -0.423828125, "logps/chosen": -402.0, "logps/rejected": -350.0, "loss": 0.233, "rewards/accuracies": 0.875, "rewards/chosen": 1.28125, "rewards/margins": 6.84375, "rewards/rejected": -5.5625, "step": 487 }, { "epoch": 0.5987730061349693, "grad_norm": 37.89908939404138, "learning_rate": 6.469421487603306e-07, "logits/chosen": -0.212890625, "logits/rejected": -0.294921875, "logps/chosen": -416.0, "logps/rejected": -356.0, "loss": 0.2436, "rewards/accuracies": 0.859375, "rewards/chosen": 1.359375, "rewards/margins": 6.40625, "rewards/rejected": -5.0625, "step": 488 }, { "epoch": 0.6, "grad_norm": 30.515429632482274, "learning_rate": 6.466115702479339e-07, "logits/chosen": -0.1298828125, "logits/rejected": -0.37890625, "logps/chosen": -376.0, "logps/rejected": -326.0, "loss": 0.272, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.8125, "rewards/margins": 7.3125, "rewards/rejected": -5.5, "step": 489 }, { "epoch": 0.6012269938650306, "grad_norm": 40.37971138033072, "learning_rate": 6.462809917355372e-07, "logits/chosen": -0.09765625, "logits/rejected": -0.326171875, "logps/chosen": -422.0, "logps/rejected": -350.0, "loss": 0.3004, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.3125, "rewards/margins": 6.5, "rewards/rejected": -5.1875, "step": 490 }, { "epoch": 0.6024539877300613, "grad_norm": 34.45143017996783, "learning_rate": 6.459504132231405e-07, "logits/chosen": -0.08203125, "logits/rejected": -0.291015625, "logps/chosen": -364.0, "logps/rejected": -318.0, "loss": 0.2549, "rewards/accuracies": 0.90625, "rewards/chosen": 1.1953125, "rewards/margins": 6.625, "rewards/rejected": -5.4375, "step": 491 }, { "epoch": 0.603680981595092, "grad_norm": 36.58265725949472, "learning_rate": 6.456198347107438e-07, "logits/chosen": -0.1669921875, "logits/rejected": -0.31640625, "logps/chosen": -390.0, "logps/rejected": -378.0, "loss": 0.2737, "rewards/accuracies": 0.859375, "rewards/chosen": 1.296875, "rewards/margins": 6.25, "rewards/rejected": -4.9375, "step": 492 }, { "epoch": 0.6049079754601226, "grad_norm": 42.46481332966053, "learning_rate": 6.45289256198347e-07, "logits/chosen": -0.024169921875, "logits/rejected": -0.134765625, "logps/chosen": -384.0, "logps/rejected": -328.0, "loss": 0.3917, "rewards/accuracies": 0.7890625, "rewards/chosen": 1.015625, "rewards/margins": 5.28125, "rewards/rejected": -4.25, "step": 493 }, { "epoch": 0.6061349693251534, "grad_norm": 33.59404853921049, "learning_rate": 6.449586776859504e-07, "logits/chosen": -0.11328125, "logits/rejected": -0.302734375, "logps/chosen": -422.0, "logps/rejected": -330.0, "loss": 0.2643, "rewards/accuracies": 0.875, "rewards/chosen": 1.7890625, "rewards/margins": 6.90625, "rewards/rejected": -5.09375, "step": 494 }, { "epoch": 0.6073619631901841, "grad_norm": 37.484469870256234, "learning_rate": 6.446280991735537e-07, "logits/chosen": -0.1220703125, "logits/rejected": -0.275390625, "logps/chosen": -396.0, "logps/rejected": -340.0, "loss": 0.3066, "rewards/accuracies": 0.859375, "rewards/chosen": 1.625, "rewards/margins": 6.84375, "rewards/rejected": -5.21875, "step": 495 }, { "epoch": 0.6085889570552148, "grad_norm": 40.63137683640751, "learning_rate": 6.44297520661157e-07, "logits/chosen": -0.1640625, "logits/rejected": -0.3828125, "logps/chosen": -376.0, "logps/rejected": -314.0, "loss": 0.3177, "rewards/accuracies": 0.875, "rewards/chosen": 0.79296875, "rewards/margins": 6.09375, "rewards/rejected": -5.28125, "step": 496 }, { "epoch": 0.6098159509202454, "grad_norm": 41.064298986990785, "learning_rate": 6.439669421487603e-07, "logits/chosen": -0.12158203125, "logits/rejected": -0.29296875, "logps/chosen": -398.0, "logps/rejected": -358.0, "loss": 0.3865, "rewards/accuracies": 0.796875, "rewards/chosen": 0.85546875, "rewards/margins": 6.375, "rewards/rejected": -5.5, "step": 497 }, { "epoch": 0.6110429447852761, "grad_norm": 34.6148352569408, "learning_rate": 6.436363636363636e-07, "logits/chosen": -0.2431640625, "logits/rejected": -0.421875, "logps/chosen": -394.0, "logps/rejected": -358.0, "loss": 0.2817, "rewards/accuracies": 0.84375, "rewards/chosen": 1.53125, "rewards/margins": 7.1875, "rewards/rejected": -5.65625, "step": 498 }, { "epoch": 0.6122699386503068, "grad_norm": 36.60546803390198, "learning_rate": 6.433057851239669e-07, "logits/chosen": -0.115234375, "logits/rejected": -0.34375, "logps/chosen": -420.0, "logps/rejected": -340.0, "loss": 0.2842, "rewards/accuracies": 0.859375, "rewards/chosen": 1.4609375, "rewards/margins": 6.59375, "rewards/rejected": -5.125, "step": 499 }, { "epoch": 0.6134969325153374, "grad_norm": 33.21675862161022, "learning_rate": 6.429752066115703e-07, "logits/chosen": -0.13671875, "logits/rejected": -0.259765625, "logps/chosen": -412.0, "logps/rejected": -328.0, "loss": 0.2718, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.59375, "rewards/margins": 6.8125, "rewards/rejected": -5.21875, "step": 500 }, { "epoch": 0.6147239263803681, "grad_norm": 32.544310987499145, "learning_rate": 6.426446280991735e-07, "logits/chosen": -0.189453125, "logits/rejected": -0.32421875, "logps/chosen": -404.0, "logps/rejected": -344.0, "loss": 0.26, "rewards/accuracies": 0.875, "rewards/chosen": 1.796875, "rewards/margins": 7.40625, "rewards/rejected": -5.625, "step": 501 }, { "epoch": 0.6159509202453988, "grad_norm": 32.09170254227315, "learning_rate": 6.423140495867768e-07, "logits/chosen": -0.1591796875, "logits/rejected": -0.4296875, "logps/chosen": -378.0, "logps/rejected": -328.0, "loss": 0.2639, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.515625, "rewards/margins": 7.46875, "rewards/rejected": -5.96875, "step": 502 }, { "epoch": 0.6171779141104294, "grad_norm": 35.53103605940553, "learning_rate": 6.419834710743801e-07, "logits/chosen": 0.01153564453125, "logits/rejected": -0.1904296875, "logps/chosen": -326.0, "logps/rejected": -312.0, "loss": 0.2795, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.0234375, "rewards/margins": 6.28125, "rewards/rejected": -5.25, "step": 503 }, { "epoch": 0.6184049079754601, "grad_norm": 30.299429390734634, "learning_rate": 6.416528925619834e-07, "logits/chosen": -0.22265625, "logits/rejected": -0.39453125, "logps/chosen": -382.0, "logps/rejected": -330.0, "loss": 0.2658, "rewards/accuracies": 0.875, "rewards/chosen": 0.625, "rewards/margins": 6.03125, "rewards/rejected": -5.40625, "step": 504 }, { "epoch": 0.6196319018404908, "grad_norm": 44.689012762744575, "learning_rate": 6.413223140495867e-07, "logits/chosen": -0.220703125, "logits/rejected": -0.453125, "logps/chosen": -424.0, "logps/rejected": -394.0, "loss": 0.3776, "rewards/accuracies": 0.7890625, "rewards/chosen": 0.369140625, "rewards/margins": 6.5, "rewards/rejected": -6.15625, "step": 505 }, { "epoch": 0.6208588957055214, "grad_norm": 32.33588195685234, "learning_rate": 6.409917355371901e-07, "logits/chosen": -0.08349609375, "logits/rejected": -0.384765625, "logps/chosen": -420.0, "logps/rejected": -328.0, "loss": 0.2588, "rewards/accuracies": 0.8125, "rewards/chosen": 0.90625, "rewards/margins": 6.78125, "rewards/rejected": -5.875, "step": 506 }, { "epoch": 0.6220858895705521, "grad_norm": 29.030680879470466, "learning_rate": 6.406611570247934e-07, "logits/chosen": -0.1865234375, "logits/rejected": -0.306640625, "logps/chosen": -386.0, "logps/rejected": -308.0, "loss": 0.1953, "rewards/accuracies": 0.8984375, "rewards/chosen": 0.90234375, "rewards/margins": 7.0625, "rewards/rejected": -6.15625, "step": 507 }, { "epoch": 0.6233128834355828, "grad_norm": 31.4626526695897, "learning_rate": 6.403305785123967e-07, "logits/chosen": -0.0201416015625, "logits/rejected": -0.2021484375, "logps/chosen": -388.0, "logps/rejected": -310.0, "loss": 0.24, "rewards/accuracies": 0.875, "rewards/chosen": 0.671875, "rewards/margins": 6.25, "rewards/rejected": -5.59375, "step": 508 }, { "epoch": 0.6245398773006134, "grad_norm": 42.61520515559976, "learning_rate": 6.4e-07, "logits/chosen": -0.1611328125, "logits/rejected": -0.40234375, "logps/chosen": -466.0, "logps/rejected": -384.0, "loss": 0.3973, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.8984375, "rewards/margins": 7.96875, "rewards/rejected": -6.0625, "step": 509 }, { "epoch": 0.6257668711656442, "grad_norm": 30.165060750168916, "learning_rate": 6.396694214876032e-07, "logits/chosen": -0.271484375, "logits/rejected": -0.443359375, "logps/chosen": -362.0, "logps/rejected": -304.0, "loss": 0.2226, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.306640625, "rewards/margins": 5.9375, "rewards/rejected": -5.625, "step": 510 }, { "epoch": 0.6269938650306749, "grad_norm": 40.15670022385489, "learning_rate": 6.393388429752065e-07, "logits/chosen": -0.271484375, "logits/rejected": -0.41015625, "logps/chosen": -394.0, "logps/rejected": -356.0, "loss": 0.3348, "rewards/accuracies": 0.8359375, "rewards/chosen": 0.81640625, "rewards/margins": 7.0, "rewards/rejected": -6.1875, "step": 511 }, { "epoch": 0.6282208588957056, "grad_norm": 44.290408519253646, "learning_rate": 6.390082644628099e-07, "logits/chosen": -0.09130859375, "logits/rejected": -0.2431640625, "logps/chosen": -380.0, "logps/rejected": -384.0, "loss": 0.3621, "rewards/accuracies": 0.828125, "rewards/chosen": 0.35546875, "rewards/margins": 5.375, "rewards/rejected": -5.0, "step": 512 }, { "epoch": 0.6294478527607362, "grad_norm": 37.44250565144745, "learning_rate": 6.386776859504132e-07, "logits/chosen": -0.09521484375, "logits/rejected": -0.23828125, "logps/chosen": -374.0, "logps/rejected": -312.0, "loss": 0.337, "rewards/accuracies": 0.828125, "rewards/chosen": 1.1171875, "rewards/margins": 6.5, "rewards/rejected": -5.375, "step": 513 }, { "epoch": 0.6306748466257669, "grad_norm": 29.97245642529846, "learning_rate": 6.383471074380165e-07, "logits/chosen": -0.0830078125, "logits/rejected": -0.2412109375, "logps/chosen": -330.0, "logps/rejected": -288.0, "loss": 0.2436, "rewards/accuracies": 0.890625, "rewards/chosen": -0.051513671875, "rewards/margins": 6.0, "rewards/rejected": -6.03125, "step": 514 }, { "epoch": 0.6319018404907976, "grad_norm": 36.989875573277935, "learning_rate": 6.380165289256198e-07, "logits/chosen": -0.09912109375, "logits/rejected": -0.255859375, "logps/chosen": -348.0, "logps/rejected": -346.0, "loss": 0.2882, "rewards/accuracies": 0.8515625, "rewards/chosen": -0.041748046875, "rewards/margins": 5.8125, "rewards/rejected": -5.84375, "step": 515 }, { "epoch": 0.6331288343558282, "grad_norm": 31.306859511596812, "learning_rate": 6.376859504132231e-07, "logits/chosen": -0.1474609375, "logits/rejected": -0.2490234375, "logps/chosen": -368.0, "logps/rejected": -330.0, "loss": 0.2432, "rewards/accuracies": 0.859375, "rewards/chosen": 0.1142578125, "rewards/margins": 5.96875, "rewards/rejected": -5.84375, "step": 516 }, { "epoch": 0.6343558282208589, "grad_norm": 43.67170294973452, "learning_rate": 6.373553719008264e-07, "logits/chosen": -0.12255859375, "logits/rejected": -0.283203125, "logps/chosen": -390.0, "logps/rejected": -334.0, "loss": 0.3884, "rewards/accuracies": 0.796875, "rewards/chosen": 0.53125, "rewards/margins": 5.5625, "rewards/rejected": -5.03125, "step": 517 }, { "epoch": 0.6355828220858896, "grad_norm": 29.354877414703584, "learning_rate": 6.370247933884298e-07, "logits/chosen": -0.2099609375, "logits/rejected": -0.3359375, "logps/chosen": -416.0, "logps/rejected": -342.0, "loss": 0.1963, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.265625, "rewards/margins": 6.59375, "rewards/rejected": -5.34375, "step": 518 }, { "epoch": 0.6368098159509202, "grad_norm": 40.61854272265548, "learning_rate": 6.36694214876033e-07, "logits/chosen": -0.197265625, "logits/rejected": -0.333984375, "logps/chosen": -382.0, "logps/rejected": -334.0, "loss": 0.299, "rewards/accuracies": 0.828125, "rewards/chosen": 0.75390625, "rewards/margins": 6.25, "rewards/rejected": -5.5, "step": 519 }, { "epoch": 0.6380368098159509, "grad_norm": 38.052325639181014, "learning_rate": 6.363636363636363e-07, "logits/chosen": -0.228515625, "logits/rejected": -0.46484375, "logps/chosen": -366.0, "logps/rejected": -326.0, "loss": 0.3436, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.1640625, "rewards/margins": 6.875, "rewards/rejected": -5.6875, "step": 520 }, { "epoch": 0.6392638036809816, "grad_norm": 32.37002227141111, "learning_rate": 6.360330578512396e-07, "logits/chosen": -0.03271484375, "logits/rejected": -0.171875, "logps/chosen": -412.0, "logps/rejected": -354.0, "loss": 0.2525, "rewards/accuracies": 0.875, "rewards/chosen": 1.5234375, "rewards/margins": 7.03125, "rewards/rejected": -5.5, "step": 521 }, { "epoch": 0.6404907975460122, "grad_norm": 40.41274539784558, "learning_rate": 6.357024793388429e-07, "logits/chosen": -0.23046875, "logits/rejected": -0.392578125, "logps/chosen": -420.0, "logps/rejected": -348.0, "loss": 0.3152, "rewards/accuracies": 0.828125, "rewards/chosen": 1.21875, "rewards/margins": 7.1875, "rewards/rejected": -5.96875, "step": 522 }, { "epoch": 0.6417177914110429, "grad_norm": 42.30362208986331, "learning_rate": 6.353719008264462e-07, "logits/chosen": -0.16015625, "logits/rejected": -0.310546875, "logps/chosen": -362.0, "logps/rejected": -322.0, "loss": 0.3605, "rewards/accuracies": 0.796875, "rewards/chosen": 0.6171875, "rewards/margins": 5.625, "rewards/rejected": -5.03125, "step": 523 }, { "epoch": 0.6429447852760736, "grad_norm": 46.893532525519284, "learning_rate": 6.350413223140496e-07, "logits/chosen": -0.1279296875, "logits/rejected": -0.333984375, "logps/chosen": -420.0, "logps/rejected": -354.0, "loss": 0.3361, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.6953125, "rewards/margins": 5.75, "rewards/rejected": -5.0625, "step": 524 }, { "epoch": 0.6441717791411042, "grad_norm": 49.422180518954264, "learning_rate": 6.347107438016529e-07, "logits/chosen": -0.1259765625, "logits/rejected": -0.185546875, "logps/chosen": -388.0, "logps/rejected": -360.0, "loss": 0.3927, "rewards/accuracies": 0.796875, "rewards/chosen": 0.498046875, "rewards/margins": 5.15625, "rewards/rejected": -4.65625, "step": 525 }, { "epoch": 0.645398773006135, "grad_norm": 38.5530601675623, "learning_rate": 6.343801652892562e-07, "logits/chosen": -0.1484375, "logits/rejected": -0.30078125, "logps/chosen": -386.0, "logps/rejected": -334.0, "loss": 0.2504, "rewards/accuracies": 0.859375, "rewards/chosen": 1.0625, "rewards/margins": 6.625, "rewards/rejected": -5.5625, "step": 526 }, { "epoch": 0.6466257668711657, "grad_norm": 35.94650372227145, "learning_rate": 6.340495867768595e-07, "logits/chosen": -0.0859375, "logits/rejected": -0.306640625, "logps/chosen": -420.0, "logps/rejected": -322.0, "loss": 0.2888, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.9609375, "rewards/margins": 6.15625, "rewards/rejected": -5.1875, "step": 527 }, { "epoch": 0.6478527607361964, "grad_norm": 33.57585022481078, "learning_rate": 6.337190082644627e-07, "logits/chosen": -0.2099609375, "logits/rejected": -0.404296875, "logps/chosen": -354.0, "logps/rejected": -320.0, "loss": 0.2986, "rewards/accuracies": 0.8125, "rewards/chosen": 0.71484375, "rewards/margins": 6.4375, "rewards/rejected": -5.71875, "step": 528 }, { "epoch": 0.649079754601227, "grad_norm": 35.863933883867006, "learning_rate": 6.33388429752066e-07, "logits/chosen": -0.1591796875, "logits/rejected": -0.337890625, "logps/chosen": -338.0, "logps/rejected": -330.0, "loss": 0.3657, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.0390625, "rewards/margins": 6.25, "rewards/rejected": -5.1875, "step": 529 }, { "epoch": 0.6503067484662577, "grad_norm": 41.86945425639466, "learning_rate": 6.330578512396694e-07, "logits/chosen": -0.12353515625, "logits/rejected": -0.2578125, "logps/chosen": -356.0, "logps/rejected": -344.0, "loss": 0.3197, "rewards/accuracies": 0.859375, "rewards/chosen": 1.21875, "rewards/margins": 6.59375, "rewards/rejected": -5.375, "step": 530 }, { "epoch": 0.6515337423312884, "grad_norm": 33.3934976525138, "learning_rate": 6.327272727272727e-07, "logits/chosen": -0.1953125, "logits/rejected": -0.37109375, "logps/chosen": -380.0, "logps/rejected": -316.0, "loss": 0.2751, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.15625, "rewards/margins": 6.34375, "rewards/rejected": -5.1875, "step": 531 }, { "epoch": 0.652760736196319, "grad_norm": 35.72821914002383, "learning_rate": 6.32396694214876e-07, "logits/chosen": -0.07958984375, "logits/rejected": -0.2197265625, "logps/chosen": -382.0, "logps/rejected": -324.0, "loss": 0.2782, "rewards/accuracies": 0.875, "rewards/chosen": 1.078125, "rewards/margins": 5.96875, "rewards/rejected": -4.875, "step": 532 }, { "epoch": 0.6539877300613497, "grad_norm": 36.05732236551947, "learning_rate": 6.320661157024793e-07, "logits/chosen": -0.2421875, "logits/rejected": -0.44921875, "logps/chosen": -402.0, "logps/rejected": -344.0, "loss": 0.2611, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.8671875, "rewards/margins": 7.3125, "rewards/rejected": -5.4375, "step": 533 }, { "epoch": 0.6552147239263804, "grad_norm": 43.004226294889776, "learning_rate": 6.317355371900826e-07, "logits/chosen": -0.10302734375, "logits/rejected": -0.228515625, "logps/chosen": -362.0, "logps/rejected": -324.0, "loss": 0.2813, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.1328125, "rewards/margins": 5.96875, "rewards/rejected": -4.84375, "step": 534 }, { "epoch": 0.656441717791411, "grad_norm": 39.5682500491772, "learning_rate": 6.31404958677686e-07, "logits/chosen": -0.2109375, "logits/rejected": -0.326171875, "logps/chosen": -368.0, "logps/rejected": -332.0, "loss": 0.2961, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.380859375, "rewards/margins": 5.9375, "rewards/rejected": -5.5625, "step": 535 }, { "epoch": 0.6576687116564417, "grad_norm": 36.55745143954986, "learning_rate": 6.310743801652893e-07, "logits/chosen": -0.1552734375, "logits/rejected": -0.265625, "logps/chosen": -386.0, "logps/rejected": -316.0, "loss": 0.2275, "rewards/accuracies": 0.875, "rewards/chosen": 1.5078125, "rewards/margins": 6.96875, "rewards/rejected": -5.4375, "step": 536 }, { "epoch": 0.6588957055214724, "grad_norm": 45.10266990819029, "learning_rate": 6.307438016528925e-07, "logits/chosen": -0.140625, "logits/rejected": -0.30078125, "logps/chosen": -378.0, "logps/rejected": -310.0, "loss": 0.3939, "rewards/accuracies": 0.796875, "rewards/chosen": 0.265625, "rewards/margins": 5.125, "rewards/rejected": -4.84375, "step": 537 }, { "epoch": 0.660122699386503, "grad_norm": 44.09458580737532, "learning_rate": 6.304132231404958e-07, "logits/chosen": -0.1123046875, "logits/rejected": -0.29296875, "logps/chosen": -394.0, "logps/rejected": -348.0, "loss": 0.3783, "rewards/accuracies": 0.828125, "rewards/chosen": 1.53125, "rewards/margins": 6.375, "rewards/rejected": -4.84375, "step": 538 }, { "epoch": 0.6613496932515337, "grad_norm": 36.16672414551654, "learning_rate": 6.300826446280991e-07, "logits/chosen": -0.11181640625, "logits/rejected": -0.25390625, "logps/chosen": -394.0, "logps/rejected": -340.0, "loss": 0.309, "rewards/accuracies": 0.828125, "rewards/chosen": 1.3984375, "rewards/margins": 5.8125, "rewards/rejected": -4.40625, "step": 539 }, { "epoch": 0.6625766871165644, "grad_norm": 39.077710779231424, "learning_rate": 6.297520661157024e-07, "logits/chosen": -0.0908203125, "logits/rejected": -0.263671875, "logps/chosen": -390.0, "logps/rejected": -324.0, "loss": 0.3217, "rewards/accuracies": 0.859375, "rewards/chosen": 1.4921875, "rewards/margins": 6.65625, "rewards/rejected": -5.15625, "step": 540 }, { "epoch": 0.6638036809815951, "grad_norm": 35.971169171679556, "learning_rate": 6.294214876033058e-07, "logits/chosen": -0.10986328125, "logits/rejected": -0.2080078125, "logps/chosen": -386.0, "logps/rejected": -346.0, "loss": 0.2834, "rewards/accuracies": 0.84375, "rewards/chosen": 0.75390625, "rewards/margins": 5.5625, "rewards/rejected": -4.8125, "step": 541 }, { "epoch": 0.6650306748466258, "grad_norm": 34.168657597082216, "learning_rate": 6.290909090909091e-07, "logits/chosen": -0.1474609375, "logits/rejected": -0.2490234375, "logps/chosen": -352.0, "logps/rejected": -316.0, "loss": 0.2812, "rewards/accuracies": 0.859375, "rewards/chosen": 1.328125, "rewards/margins": 6.0, "rewards/rejected": -4.65625, "step": 542 }, { "epoch": 0.6662576687116565, "grad_norm": 36.23729440291612, "learning_rate": 6.287603305785124e-07, "logits/chosen": -0.1884765625, "logits/rejected": -0.369140625, "logps/chosen": -444.0, "logps/rejected": -348.0, "loss": 0.2622, "rewards/accuracies": 0.8828125, "rewards/chosen": 2.15625, "rewards/margins": 6.9375, "rewards/rejected": -4.78125, "step": 543 }, { "epoch": 0.6674846625766871, "grad_norm": 45.238447000820585, "learning_rate": 6.284297520661157e-07, "logits/chosen": -0.166015625, "logits/rejected": -0.3125, "logps/chosen": -374.0, "logps/rejected": -312.0, "loss": 0.3695, "rewards/accuracies": 0.859375, "rewards/chosen": 0.91015625, "rewards/margins": 6.15625, "rewards/rejected": -5.25, "step": 544 }, { "epoch": 0.6687116564417178, "grad_norm": 43.061817496062964, "learning_rate": 6.28099173553719e-07, "logits/chosen": -0.2138671875, "logits/rejected": -0.388671875, "logps/chosen": -452.0, "logps/rejected": -360.0, "loss": 0.4047, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.59375, "rewards/margins": 6.15625, "rewards/rejected": -4.5625, "step": 545 }, { "epoch": 0.6699386503067485, "grad_norm": 40.8862609592416, "learning_rate": 6.277685950413222e-07, "logits/chosen": -0.10205078125, "logits/rejected": -0.20703125, "logps/chosen": -370.0, "logps/rejected": -332.0, "loss": 0.3402, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.1953125, "rewards/margins": 6.3125, "rewards/rejected": -5.09375, "step": 546 }, { "epoch": 0.6711656441717792, "grad_norm": 32.99712535949366, "learning_rate": 6.274380165289256e-07, "logits/chosen": -0.1591796875, "logits/rejected": -0.3359375, "logps/chosen": -380.0, "logps/rejected": -306.0, "loss": 0.2883, "rewards/accuracies": 0.828125, "rewards/chosen": 1.5390625, "rewards/margins": 6.46875, "rewards/rejected": -4.9375, "step": 547 }, { "epoch": 0.6723926380368098, "grad_norm": 40.33054062017028, "learning_rate": 6.271074380165289e-07, "logits/chosen": -0.2119140625, "logits/rejected": -0.431640625, "logps/chosen": -396.0, "logps/rejected": -354.0, "loss": 0.2583, "rewards/accuracies": 0.859375, "rewards/chosen": 1.6328125, "rewards/margins": 6.375, "rewards/rejected": -4.71875, "step": 548 }, { "epoch": 0.6736196319018405, "grad_norm": 37.72507019090557, "learning_rate": 6.267768595041322e-07, "logits/chosen": -0.11474609375, "logits/rejected": -0.330078125, "logps/chosen": -408.0, "logps/rejected": -338.0, "loss": 0.3, "rewards/accuracies": 0.84375, "rewards/chosen": 1.2265625, "rewards/margins": 6.0625, "rewards/rejected": -4.84375, "step": 549 }, { "epoch": 0.6748466257668712, "grad_norm": 37.30173963897267, "learning_rate": 6.264462809917355e-07, "logits/chosen": -0.1884765625, "logits/rejected": -0.265625, "logps/chosen": -394.0, "logps/rejected": -322.0, "loss": 0.3323, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.0078125, "rewards/margins": 5.625, "rewards/rejected": -4.59375, "step": 550 }, { "epoch": 0.6760736196319018, "grad_norm": 33.242769441390706, "learning_rate": 6.261157024793388e-07, "logits/chosen": -0.0986328125, "logits/rejected": -0.2265625, "logps/chosen": -402.0, "logps/rejected": -336.0, "loss": 0.2814, "rewards/accuracies": 0.859375, "rewards/chosen": 1.9296875, "rewards/margins": 6.53125, "rewards/rejected": -4.59375, "step": 551 }, { "epoch": 0.6773006134969325, "grad_norm": 35.53857403218536, "learning_rate": 6.257851239669421e-07, "logits/chosen": -0.1845703125, "logits/rejected": -0.326171875, "logps/chosen": -410.0, "logps/rejected": -352.0, "loss": 0.3055, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.359375, "rewards/margins": 6.0625, "rewards/rejected": -4.6875, "step": 552 }, { "epoch": 0.6785276073619632, "grad_norm": 39.8186178694702, "learning_rate": 6.254545454545455e-07, "logits/chosen": -0.13671875, "logits/rejected": -0.28515625, "logps/chosen": -358.0, "logps/rejected": -334.0, "loss": 0.3556, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.60546875, "rewards/margins": 5.40625, "rewards/rejected": -4.8125, "step": 553 }, { "epoch": 0.6797546012269938, "grad_norm": 34.396570445757696, "learning_rate": 6.251239669421488e-07, "logits/chosen": -0.08349609375, "logits/rejected": -0.29296875, "logps/chosen": -424.0, "logps/rejected": -326.0, "loss": 0.261, "rewards/accuracies": 0.859375, "rewards/chosen": 1.78125, "rewards/margins": 6.46875, "rewards/rejected": -4.6875, "step": 554 }, { "epoch": 0.6809815950920245, "grad_norm": 37.46750845748253, "learning_rate": 6.24793388429752e-07, "logits/chosen": 0.0196533203125, "logits/rejected": -0.107421875, "logps/chosen": -354.0, "logps/rejected": -304.0, "loss": 0.3763, "rewards/accuracies": 0.796875, "rewards/chosen": 1.296875, "rewards/margins": 5.9375, "rewards/rejected": -4.65625, "step": 555 }, { "epoch": 0.6822085889570552, "grad_norm": 28.75095679008507, "learning_rate": 6.244628099173553e-07, "logits/chosen": -0.10693359375, "logits/rejected": -0.32421875, "logps/chosen": -414.0, "logps/rejected": -344.0, "loss": 0.2294, "rewards/accuracies": 0.875, "rewards/chosen": 2.109375, "rewards/margins": 7.1875, "rewards/rejected": -5.0625, "step": 556 }, { "epoch": 0.6834355828220859, "grad_norm": 32.12117772558378, "learning_rate": 6.241322314049586e-07, "logits/chosen": -0.11669921875, "logits/rejected": -0.341796875, "logps/chosen": -386.0, "logps/rejected": -330.0, "loss": 0.2775, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.65625, "rewards/margins": 6.34375, "rewards/rejected": -4.65625, "step": 557 }, { "epoch": 0.6846625766871166, "grad_norm": 30.45940478111348, "learning_rate": 6.238016528925619e-07, "logits/chosen": -0.07861328125, "logits/rejected": -0.2373046875, "logps/chosen": -366.0, "logps/rejected": -326.0, "loss": 0.2442, "rewards/accuracies": 0.875, "rewards/chosen": 0.8359375, "rewards/margins": 6.6875, "rewards/rejected": -5.875, "step": 558 }, { "epoch": 0.6858895705521473, "grad_norm": 38.28759745643993, "learning_rate": 6.234710743801653e-07, "logits/chosen": -0.2236328125, "logits/rejected": -0.3359375, "logps/chosen": -376.0, "logps/rejected": -338.0, "loss": 0.3234, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.0078125, "rewards/margins": 6.25, "rewards/rejected": -5.25, "step": 559 }, { "epoch": 0.6871165644171779, "grad_norm": 25.47174077723704, "learning_rate": 6.231404958677686e-07, "logits/chosen": -0.3046875, "logits/rejected": -0.451171875, "logps/chosen": -384.0, "logps/rejected": -328.0, "loss": 0.2016, "rewards/accuracies": 0.9296875, "rewards/chosen": 1.3359375, "rewards/margins": 7.34375, "rewards/rejected": -6.03125, "step": 560 }, { "epoch": 0.6883435582822086, "grad_norm": 28.61531386213562, "learning_rate": 6.228099173553719e-07, "logits/chosen": -0.158203125, "logits/rejected": -0.337890625, "logps/chosen": -350.0, "logps/rejected": -300.0, "loss": 0.2021, "rewards/accuracies": 0.90625, "rewards/chosen": 1.09375, "rewards/margins": 6.78125, "rewards/rejected": -5.6875, "step": 561 }, { "epoch": 0.6895705521472393, "grad_norm": 30.528229373220828, "learning_rate": 6.224793388429752e-07, "logits/chosen": -0.032470703125, "logits/rejected": -0.2333984375, "logps/chosen": -370.0, "logps/rejected": -320.0, "loss": 0.2462, "rewards/accuracies": 0.8984375, "rewards/chosen": 0.5, "rewards/margins": 6.0625, "rewards/rejected": -5.5625, "step": 562 }, { "epoch": 0.69079754601227, "grad_norm": 34.031991776353316, "learning_rate": 6.221487603305785e-07, "logits/chosen": -0.19921875, "logits/rejected": -0.359375, "logps/chosen": -388.0, "logps/rejected": -370.0, "loss": 0.2904, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.546875, "rewards/margins": 7.21875, "rewards/rejected": -5.65625, "step": 563 }, { "epoch": 0.6920245398773006, "grad_norm": 24.836619890425215, "learning_rate": 6.218181818181817e-07, "logits/chosen": -0.203125, "logits/rejected": -0.326171875, "logps/chosen": -388.0, "logps/rejected": -334.0, "loss": 0.224, "rewards/accuracies": 0.8984375, "rewards/chosen": 0.7109375, "rewards/margins": 6.0625, "rewards/rejected": -5.34375, "step": 564 }, { "epoch": 0.6932515337423313, "grad_norm": 35.09286389818353, "learning_rate": 6.214876033057851e-07, "logits/chosen": -0.1455078125, "logits/rejected": -0.345703125, "logps/chosen": -394.0, "logps/rejected": -338.0, "loss": 0.3639, "rewards/accuracies": 0.828125, "rewards/chosen": 0.6015625, "rewards/margins": 5.4375, "rewards/rejected": -4.84375, "step": 565 }, { "epoch": 0.694478527607362, "grad_norm": 33.71563020260373, "learning_rate": 6.211570247933884e-07, "logits/chosen": -0.158203125, "logits/rejected": -0.265625, "logps/chosen": -412.0, "logps/rejected": -334.0, "loss": 0.2462, "rewards/accuracies": 0.828125, "rewards/chosen": 1.53125, "rewards/margins": 6.6875, "rewards/rejected": -5.1875, "step": 566 }, { "epoch": 0.6957055214723926, "grad_norm": 25.84647564741135, "learning_rate": 6.208264462809917e-07, "logits/chosen": -0.053955078125, "logits/rejected": -0.1875, "logps/chosen": -316.0, "logps/rejected": -274.0, "loss": 0.2061, "rewards/accuracies": 0.875, "rewards/chosen": 0.359375, "rewards/margins": 5.4375, "rewards/rejected": -5.09375, "step": 567 }, { "epoch": 0.6969325153374233, "grad_norm": 37.567177147049684, "learning_rate": 6.20495867768595e-07, "logits/chosen": -0.1845703125, "logits/rejected": -0.255859375, "logps/chosen": -382.0, "logps/rejected": -322.0, "loss": 0.3064, "rewards/accuracies": 0.828125, "rewards/chosen": 1.03125, "rewards/margins": 6.25, "rewards/rejected": -5.21875, "step": 568 }, { "epoch": 0.698159509202454, "grad_norm": 32.35117698678835, "learning_rate": 6.201652892561983e-07, "logits/chosen": -0.10302734375, "logits/rejected": -0.251953125, "logps/chosen": -382.0, "logps/rejected": -304.0, "loss": 0.2508, "rewards/accuracies": 0.875, "rewards/chosen": 0.69140625, "rewards/margins": 5.8125, "rewards/rejected": -5.125, "step": 569 }, { "epoch": 0.6993865030674846, "grad_norm": 25.32334987337483, "learning_rate": 6.198347107438017e-07, "logits/chosen": -0.26953125, "logits/rejected": -0.404296875, "logps/chosen": -400.0, "logps/rejected": -338.0, "loss": 0.1649, "rewards/accuracies": 0.9453125, "rewards/chosen": 1.578125, "rewards/margins": 6.9375, "rewards/rejected": -5.34375, "step": 570 }, { "epoch": 0.7006134969325153, "grad_norm": 31.066523168854104, "learning_rate": 6.19504132231405e-07, "logits/chosen": -0.13671875, "logits/rejected": -0.267578125, "logps/chosen": -326.0, "logps/rejected": -308.0, "loss": 0.2262, "rewards/accuracies": 0.8828125, "rewards/chosen": 0.6015625, "rewards/margins": 5.6875, "rewards/rejected": -5.09375, "step": 571 }, { "epoch": 0.701840490797546, "grad_norm": 32.881821449548816, "learning_rate": 6.191735537190083e-07, "logits/chosen": -0.1142578125, "logits/rejected": -0.267578125, "logps/chosen": -382.0, "logps/rejected": -364.0, "loss": 0.2291, "rewards/accuracies": 0.921875, "rewards/chosen": 1.7890625, "rewards/margins": 6.71875, "rewards/rejected": -4.9375, "step": 572 }, { "epoch": 0.7030674846625767, "grad_norm": 40.68529761937124, "learning_rate": 6.188429752066115e-07, "logits/chosen": -0.07177734375, "logits/rejected": -0.212890625, "logps/chosen": -386.0, "logps/rejected": -334.0, "loss": 0.4034, "rewards/accuracies": 0.796875, "rewards/chosen": 0.52734375, "rewards/margins": 5.84375, "rewards/rejected": -5.3125, "step": 573 }, { "epoch": 0.7042944785276074, "grad_norm": 38.820291986225, "learning_rate": 6.185123966942148e-07, "logits/chosen": -0.19921875, "logits/rejected": -0.328125, "logps/chosen": -322.0, "logps/rejected": -308.0, "loss": 0.2792, "rewards/accuracies": 0.859375, "rewards/chosen": 0.96484375, "rewards/margins": 6.21875, "rewards/rejected": -5.25, "step": 574 }, { "epoch": 0.7055214723926381, "grad_norm": 33.59717634578736, "learning_rate": 6.181818181818181e-07, "logits/chosen": -0.240234375, "logits/rejected": -0.41015625, "logps/chosen": -404.0, "logps/rejected": -370.0, "loss": 0.2284, "rewards/accuracies": 0.875, "rewards/chosen": 1.8203125, "rewards/margins": 7.40625, "rewards/rejected": -5.59375, "step": 575 }, { "epoch": 0.7067484662576687, "grad_norm": 28.04916589516562, "learning_rate": 6.178512396694215e-07, "logits/chosen": -0.10302734375, "logits/rejected": -0.3125, "logps/chosen": -380.0, "logps/rejected": -328.0, "loss": 0.2001, "rewards/accuracies": 0.90625, "rewards/chosen": 1.671875, "rewards/margins": 7.53125, "rewards/rejected": -5.875, "step": 576 }, { "epoch": 0.7079754601226994, "grad_norm": 36.15869255614372, "learning_rate": 6.175206611570248e-07, "logits/chosen": -0.03955078125, "logits/rejected": -0.1767578125, "logps/chosen": -360.0, "logps/rejected": -320.0, "loss": 0.2929, "rewards/accuracies": 0.859375, "rewards/chosen": 1.578125, "rewards/margins": 7.40625, "rewards/rejected": -5.84375, "step": 577 }, { "epoch": 0.7092024539877301, "grad_norm": 36.89994352340565, "learning_rate": 6.171900826446281e-07, "logits/chosen": -0.1923828125, "logits/rejected": -0.345703125, "logps/chosen": -414.0, "logps/rejected": -334.0, "loss": 0.322, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.65625, "rewards/margins": 7.40625, "rewards/rejected": -5.75, "step": 578 }, { "epoch": 0.7104294478527607, "grad_norm": 42.55492037495249, "learning_rate": 6.168595041322314e-07, "logits/chosen": -0.1796875, "logits/rejected": -0.2734375, "logps/chosen": -428.0, "logps/rejected": -332.0, "loss": 0.3864, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.451171875, "rewards/margins": 5.4375, "rewards/rejected": -4.96875, "step": 579 }, { "epoch": 0.7116564417177914, "grad_norm": 35.02868013813214, "learning_rate": 6.165289256198347e-07, "logits/chosen": -0.07275390625, "logits/rejected": -0.2451171875, "logps/chosen": -382.0, "logps/rejected": -354.0, "loss": 0.229, "rewards/accuracies": 0.875, "rewards/chosen": 0.73046875, "rewards/margins": 6.96875, "rewards/rejected": -6.25, "step": 580 }, { "epoch": 0.7128834355828221, "grad_norm": 29.748844282456343, "learning_rate": 6.16198347107438e-07, "logits/chosen": -0.1865234375, "logits/rejected": -0.37890625, "logps/chosen": -370.0, "logps/rejected": -316.0, "loss": 0.2071, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.328125, "rewards/margins": 7.1875, "rewards/rejected": -5.84375, "step": 581 }, { "epoch": 0.7141104294478527, "grad_norm": 41.261123421442086, "learning_rate": 6.158677685950413e-07, "logits/chosen": 0.01953125, "logits/rejected": -0.197265625, "logps/chosen": -392.0, "logps/rejected": -326.0, "loss": 0.3132, "rewards/accuracies": 0.8359375, "rewards/chosen": 0.9453125, "rewards/margins": 5.71875, "rewards/rejected": -4.78125, "step": 582 }, { "epoch": 0.7153374233128834, "grad_norm": 37.14443132697755, "learning_rate": 6.155371900826446e-07, "logits/chosen": -0.1650390625, "logits/rejected": -0.318359375, "logps/chosen": -382.0, "logps/rejected": -340.0, "loss": 0.3036, "rewards/accuracies": 0.796875, "rewards/chosen": 1.421875, "rewards/margins": 6.28125, "rewards/rejected": -4.875, "step": 583 }, { "epoch": 0.7165644171779141, "grad_norm": 42.810461239623855, "learning_rate": 6.152066115702479e-07, "logits/chosen": -0.0693359375, "logits/rejected": -0.14453125, "logps/chosen": -368.0, "logps/rejected": -370.0, "loss": 0.3929, "rewards/accuracies": 0.78125, "rewards/chosen": 0.5859375, "rewards/margins": 4.84375, "rewards/rejected": -4.25, "step": 584 }, { "epoch": 0.7177914110429447, "grad_norm": 44.860424166016166, "learning_rate": 6.148760330578512e-07, "logits/chosen": 0.0206298828125, "logits/rejected": -0.099609375, "logps/chosen": -398.0, "logps/rejected": -322.0, "loss": 0.4253, "rewards/accuracies": 0.78125, "rewards/chosen": 1.3515625, "rewards/margins": 5.40625, "rewards/rejected": -4.0625, "step": 585 }, { "epoch": 0.7190184049079754, "grad_norm": 36.65848945690881, "learning_rate": 6.145454545454545e-07, "logits/chosen": -0.1064453125, "logits/rejected": -0.2158203125, "logps/chosen": -346.0, "logps/rejected": -300.0, "loss": 0.3226, "rewards/accuracies": 0.859375, "rewards/chosen": 1.015625, "rewards/margins": 5.59375, "rewards/rejected": -4.5625, "step": 586 }, { "epoch": 0.7202453987730061, "grad_norm": 34.66555869797275, "learning_rate": 6.142148760330578e-07, "logits/chosen": -0.1396484375, "logits/rejected": -0.2490234375, "logps/chosen": -332.0, "logps/rejected": -308.0, "loss": 0.319, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.09375, "rewards/margins": 5.625, "rewards/rejected": -4.5, "step": 587 }, { "epoch": 0.7214723926380369, "grad_norm": 25.81313251350675, "learning_rate": 6.138842975206612e-07, "logits/chosen": -0.1494140625, "logits/rejected": -0.310546875, "logps/chosen": -380.0, "logps/rejected": -316.0, "loss": 0.2328, "rewards/accuracies": 0.875, "rewards/chosen": 1.9765625, "rewards/margins": 6.3125, "rewards/rejected": -4.34375, "step": 588 }, { "epoch": 0.7226993865030675, "grad_norm": 39.45475953492192, "learning_rate": 6.135537190082645e-07, "logits/chosen": -0.2216796875, "logits/rejected": -0.322265625, "logps/chosen": -360.0, "logps/rejected": -328.0, "loss": 0.3428, "rewards/accuracies": 0.828125, "rewards/chosen": 0.7734375, "rewards/margins": 4.84375, "rewards/rejected": -4.0625, "step": 589 }, { "epoch": 0.7239263803680982, "grad_norm": 28.739570926494295, "learning_rate": 6.132231404958677e-07, "logits/chosen": -0.11962890625, "logits/rejected": -0.2392578125, "logps/chosen": -364.0, "logps/rejected": -306.0, "loss": 0.2629, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.140625, "rewards/margins": 5.53125, "rewards/rejected": -4.375, "step": 590 }, { "epoch": 0.7251533742331289, "grad_norm": 39.542558184509424, "learning_rate": 6.12892561983471e-07, "logits/chosen": -0.28125, "logits/rejected": -0.474609375, "logps/chosen": -402.0, "logps/rejected": -330.0, "loss": 0.2455, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.8046875, "rewards/margins": 6.75, "rewards/rejected": -4.9375, "step": 591 }, { "epoch": 0.7263803680981595, "grad_norm": 31.700565699717185, "learning_rate": 6.125619834710743e-07, "logits/chosen": -0.1435546875, "logits/rejected": -0.33203125, "logps/chosen": -368.0, "logps/rejected": -302.0, "loss": 0.2372, "rewards/accuracies": 0.875, "rewards/chosen": 1.6015625, "rewards/margins": 6.8125, "rewards/rejected": -5.1875, "step": 592 }, { "epoch": 0.7276073619631902, "grad_norm": 43.160388567583965, "learning_rate": 6.122314049586776e-07, "logits/chosen": -0.08251953125, "logits/rejected": -0.341796875, "logps/chosen": -442.0, "logps/rejected": -366.0, "loss": 0.3556, "rewards/accuracies": 0.84375, "rewards/chosen": 1.8046875, "rewards/margins": 6.34375, "rewards/rejected": -4.5625, "step": 593 }, { "epoch": 0.7288343558282209, "grad_norm": 33.17336982955441, "learning_rate": 6.11900826446281e-07, "logits/chosen": -0.150390625, "logits/rejected": -0.31640625, "logps/chosen": -356.0, "logps/rejected": -314.0, "loss": 0.2737, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.77734375, "rewards/margins": 6.375, "rewards/rejected": -5.59375, "step": 594 }, { "epoch": 0.7300613496932515, "grad_norm": 35.78921531146286, "learning_rate": 6.115702479338843e-07, "logits/chosen": -0.1611328125, "logits/rejected": -0.359375, "logps/chosen": -444.0, "logps/rejected": -348.0, "loss": 0.2188, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.6328125, "rewards/margins": 7.03125, "rewards/rejected": -5.40625, "step": 595 }, { "epoch": 0.7312883435582822, "grad_norm": 39.132566907776244, "learning_rate": 6.112396694214876e-07, "logits/chosen": -0.1298828125, "logits/rejected": -0.29296875, "logps/chosen": -410.0, "logps/rejected": -346.0, "loss": 0.3258, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.140625, "rewards/margins": 6.28125, "rewards/rejected": -5.125, "step": 596 }, { "epoch": 0.7325153374233129, "grad_norm": 36.16852227530472, "learning_rate": 6.109090909090909e-07, "logits/chosen": -0.03515625, "logits/rejected": -0.2138671875, "logps/chosen": -380.0, "logps/rejected": -290.0, "loss": 0.3225, "rewards/accuracies": 0.84375, "rewards/chosen": 1.109375, "rewards/margins": 6.03125, "rewards/rejected": -4.9375, "step": 597 }, { "epoch": 0.7337423312883435, "grad_norm": 29.88526191086389, "learning_rate": 6.105785123966942e-07, "logits/chosen": -0.134765625, "logits/rejected": -0.326171875, "logps/chosen": -438.0, "logps/rejected": -318.0, "loss": 0.204, "rewards/accuracies": 0.875, "rewards/chosen": 2.109375, "rewards/margins": 7.21875, "rewards/rejected": -5.125, "step": 598 }, { "epoch": 0.7349693251533742, "grad_norm": 32.885582252909025, "learning_rate": 6.102479338842974e-07, "logits/chosen": -0.267578125, "logits/rejected": -0.41796875, "logps/chosen": -448.0, "logps/rejected": -366.0, "loss": 0.2847, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.6328125, "rewards/margins": 7.1875, "rewards/rejected": -5.53125, "step": 599 }, { "epoch": 0.7361963190184049, "grad_norm": 37.722786017646094, "learning_rate": 6.099173553719008e-07, "logits/chosen": -0.275390625, "logits/rejected": -0.365234375, "logps/chosen": -356.0, "logps/rejected": -318.0, "loss": 0.368, "rewards/accuracies": 0.828125, "rewards/chosen": 1.15625, "rewards/margins": 6.6875, "rewards/rejected": -5.53125, "step": 600 }, { "epoch": 0.7374233128834355, "grad_norm": 31.64488245915107, "learning_rate": 6.095867768595041e-07, "logits/chosen": -0.154296875, "logits/rejected": -0.33984375, "logps/chosen": -342.0, "logps/rejected": -306.0, "loss": 0.2698, "rewards/accuracies": 0.859375, "rewards/chosen": 0.1826171875, "rewards/margins": 6.125, "rewards/rejected": -5.9375, "step": 601 }, { "epoch": 0.7386503067484662, "grad_norm": 25.124092304435703, "learning_rate": 6.092561983471074e-07, "logits/chosen": -0.0076904296875, "logits/rejected": -0.1708984375, "logps/chosen": -400.0, "logps/rejected": -332.0, "loss": 0.189, "rewards/accuracies": 0.921875, "rewards/chosen": 1.2421875, "rewards/margins": 7.28125, "rewards/rejected": -6.03125, "step": 602 }, { "epoch": 0.7398773006134969, "grad_norm": 30.45546682074925, "learning_rate": 6.089256198347107e-07, "logits/chosen": -0.1689453125, "logits/rejected": -0.30859375, "logps/chosen": -376.0, "logps/rejected": -316.0, "loss": 0.2864, "rewards/accuracies": 0.875, "rewards/chosen": 1.546875, "rewards/margins": 7.1875, "rewards/rejected": -5.625, "step": 603 }, { "epoch": 0.7411042944785277, "grad_norm": 31.94436328392251, "learning_rate": 6.08595041322314e-07, "logits/chosen": -0.2197265625, "logits/rejected": -0.390625, "logps/chosen": -412.0, "logps/rejected": -354.0, "loss": 0.2464, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.078125, "rewards/margins": 6.96875, "rewards/rejected": -5.90625, "step": 604 }, { "epoch": 0.7423312883435583, "grad_norm": 33.65745564504924, "learning_rate": 6.082644628099173e-07, "logits/chosen": -0.16796875, "logits/rejected": -0.359375, "logps/chosen": -374.0, "logps/rejected": -328.0, "loss": 0.2598, "rewards/accuracies": 0.859375, "rewards/chosen": 0.984375, "rewards/margins": 7.125, "rewards/rejected": -6.15625, "step": 605 }, { "epoch": 0.743558282208589, "grad_norm": 38.63161562009038, "learning_rate": 6.079338842975207e-07, "logits/chosen": -0.2421875, "logits/rejected": -0.380859375, "logps/chosen": -384.0, "logps/rejected": -330.0, "loss": 0.3454, "rewards/accuracies": 0.828125, "rewards/chosen": 1.1484375, "rewards/margins": 6.46875, "rewards/rejected": -5.3125, "step": 606 }, { "epoch": 0.7447852760736197, "grad_norm": 33.230355625984764, "learning_rate": 6.07603305785124e-07, "logits/chosen": -0.12890625, "logits/rejected": -0.349609375, "logps/chosen": -396.0, "logps/rejected": -366.0, "loss": 0.2611, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.48828125, "rewards/margins": 6.875, "rewards/rejected": -6.40625, "step": 607 }, { "epoch": 0.7460122699386503, "grad_norm": 33.50647832359134, "learning_rate": 6.072727272727272e-07, "logits/chosen": -0.0216064453125, "logits/rejected": -0.263671875, "logps/chosen": -396.0, "logps/rejected": -342.0, "loss": 0.2913, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.099609375, "rewards/margins": 5.78125, "rewards/rejected": -5.6875, "step": 608 }, { "epoch": 0.747239263803681, "grad_norm": 35.459553964773974, "learning_rate": 6.069421487603305e-07, "logits/chosen": -0.1435546875, "logits/rejected": -0.30859375, "logps/chosen": -404.0, "logps/rejected": -322.0, "loss": 0.2856, "rewards/accuracies": 0.84375, "rewards/chosen": 0.54296875, "rewards/margins": 6.75, "rewards/rejected": -6.21875, "step": 609 }, { "epoch": 0.7484662576687117, "grad_norm": 31.662560042647854, "learning_rate": 6.066115702479338e-07, "logits/chosen": -0.2021484375, "logits/rejected": -0.419921875, "logps/chosen": -444.0, "logps/rejected": -376.0, "loss": 0.2452, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.09375, "rewards/margins": 7.46875, "rewards/rejected": -6.375, "step": 610 }, { "epoch": 0.7496932515337423, "grad_norm": 49.54193875289406, "learning_rate": 6.062809917355371e-07, "logits/chosen": -0.1669921875, "logits/rejected": -0.3359375, "logps/chosen": -432.0, "logps/rejected": -362.0, "loss": 0.3976, "rewards/accuracies": 0.828125, "rewards/chosen": -0.1396484375, "rewards/margins": 5.875, "rewards/rejected": -6.0, "step": 611 }, { "epoch": 0.750920245398773, "grad_norm": 39.062720193674714, "learning_rate": 6.059504132231405e-07, "logits/chosen": -0.1669921875, "logits/rejected": -0.30859375, "logps/chosen": -392.0, "logps/rejected": -358.0, "loss": 0.3777, "rewards/accuracies": 0.84375, "rewards/chosen": 0.546875, "rewards/margins": 5.96875, "rewards/rejected": -5.40625, "step": 612 }, { "epoch": 0.7521472392638037, "grad_norm": 35.9253243800041, "learning_rate": 6.056198347107438e-07, "logits/chosen": -0.15625, "logits/rejected": -0.2216796875, "logps/chosen": -378.0, "logps/rejected": -328.0, "loss": 0.3394, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.10107421875, "rewards/margins": 6.0625, "rewards/rejected": -5.96875, "step": 613 }, { "epoch": 0.7533742331288343, "grad_norm": 54.139929990418025, "learning_rate": 6.052892561983471e-07, "logits/chosen": -0.212890625, "logits/rejected": -0.3515625, "logps/chosen": -420.0, "logps/rejected": -344.0, "loss": 0.3142, "rewards/accuracies": 0.8359375, "rewards/chosen": 0.609375, "rewards/margins": 6.40625, "rewards/rejected": -5.78125, "step": 614 }, { "epoch": 0.754601226993865, "grad_norm": 37.247633297004576, "learning_rate": 6.049586776859504e-07, "logits/chosen": -0.1943359375, "logits/rejected": -0.298828125, "logps/chosen": -368.0, "logps/rejected": -346.0, "loss": 0.3089, "rewards/accuracies": 0.84375, "rewards/chosen": 0.84765625, "rewards/margins": 6.84375, "rewards/rejected": -6.0, "step": 615 }, { "epoch": 0.7558282208588957, "grad_norm": 31.187596328354086, "learning_rate": 6.046280991735537e-07, "logits/chosen": -0.146484375, "logits/rejected": -0.294921875, "logps/chosen": -324.0, "logps/rejected": -294.0, "loss": 0.2528, "rewards/accuracies": 0.875, "rewards/chosen": 0.10302734375, "rewards/margins": 5.59375, "rewards/rejected": -5.46875, "step": 616 }, { "epoch": 0.7570552147239263, "grad_norm": 39.842219715736135, "learning_rate": 6.04297520661157e-07, "logits/chosen": -0.125, "logits/rejected": -0.208984375, "logps/chosen": -370.0, "logps/rejected": -318.0, "loss": 0.3542, "rewards/accuracies": 0.8046875, "rewards/chosen": 0.48828125, "rewards/margins": 5.8125, "rewards/rejected": -5.3125, "step": 617 }, { "epoch": 0.758282208588957, "grad_norm": 43.96609425022703, "learning_rate": 6.039669421487603e-07, "logits/chosen": -0.052734375, "logits/rejected": -0.2255859375, "logps/chosen": -416.0, "logps/rejected": -316.0, "loss": 0.3723, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.51953125, "rewards/margins": 5.46875, "rewards/rejected": -4.9375, "step": 618 }, { "epoch": 0.7595092024539877, "grad_norm": 32.587670722826026, "learning_rate": 6.036363636363636e-07, "logits/chosen": -0.0791015625, "logits/rejected": -0.28515625, "logps/chosen": -426.0, "logps/rejected": -336.0, "loss": 0.2331, "rewards/accuracies": 0.890625, "rewards/chosen": 1.078125, "rewards/margins": 6.96875, "rewards/rejected": -5.90625, "step": 619 }, { "epoch": 0.7607361963190185, "grad_norm": 44.41642388280846, "learning_rate": 6.033057851239669e-07, "logits/chosen": -0.0830078125, "logits/rejected": -0.287109375, "logps/chosen": -406.0, "logps/rejected": -330.0, "loss": 0.3088, "rewards/accuracies": 0.828125, "rewards/chosen": 0.5234375, "rewards/margins": 5.75, "rewards/rejected": -5.21875, "step": 620 }, { "epoch": 0.7619631901840491, "grad_norm": 34.02108964551065, "learning_rate": 6.029752066115702e-07, "logits/chosen": -0.19921875, "logits/rejected": -0.369140625, "logps/chosen": -478.0, "logps/rejected": -368.0, "loss": 0.2661, "rewards/accuracies": 0.875, "rewards/chosen": 1.171875, "rewards/margins": 7.3125, "rewards/rejected": -6.125, "step": 621 }, { "epoch": 0.7631901840490798, "grad_norm": 31.832438088278238, "learning_rate": 6.026446280991735e-07, "logits/chosen": -0.0888671875, "logits/rejected": -0.26171875, "logps/chosen": -378.0, "logps/rejected": -342.0, "loss": 0.236, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.72265625, "rewards/margins": 6.75, "rewards/rejected": -6.03125, "step": 622 }, { "epoch": 0.7644171779141105, "grad_norm": 38.89511615880052, "learning_rate": 6.023140495867769e-07, "logits/chosen": -0.1181640625, "logits/rejected": -0.296875, "logps/chosen": -452.0, "logps/rejected": -376.0, "loss": 0.3167, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.4453125, "rewards/margins": 6.90625, "rewards/rejected": -5.46875, "step": 623 }, { "epoch": 0.7656441717791411, "grad_norm": 32.19915482428781, "learning_rate": 6.019834710743802e-07, "logits/chosen": -0.185546875, "logits/rejected": -0.357421875, "logps/chosen": -378.0, "logps/rejected": -324.0, "loss": 0.2307, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.234375, "rewards/margins": 7.78125, "rewards/rejected": -6.53125, "step": 624 }, { "epoch": 0.7668711656441718, "grad_norm": 32.198949298871604, "learning_rate": 6.016528925619835e-07, "logits/chosen": -0.1494140625, "logits/rejected": -0.296875, "logps/chosen": -404.0, "logps/rejected": -322.0, "loss": 0.2191, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.0859375, "rewards/margins": 6.4375, "rewards/rejected": -5.375, "step": 625 }, { "epoch": 0.7680981595092025, "grad_norm": 40.391116665536885, "learning_rate": 6.013223140495867e-07, "logits/chosen": -0.265625, "logits/rejected": -0.416015625, "logps/chosen": -412.0, "logps/rejected": -350.0, "loss": 0.3346, "rewards/accuracies": 0.859375, "rewards/chosen": 1.5390625, "rewards/margins": 6.5625, "rewards/rejected": -5.03125, "step": 626 }, { "epoch": 0.7693251533742331, "grad_norm": 33.50213686948866, "learning_rate": 6.0099173553719e-07, "logits/chosen": -0.06396484375, "logits/rejected": -0.154296875, "logps/chosen": -310.0, "logps/rejected": -326.0, "loss": 0.3297, "rewards/accuracies": 0.8515625, "rewards/chosen": -0.1552734375, "rewards/margins": 5.0625, "rewards/rejected": -5.21875, "step": 627 }, { "epoch": 0.7705521472392638, "grad_norm": 37.25258333430096, "learning_rate": 6.006611570247933e-07, "logits/chosen": -0.0947265625, "logits/rejected": -0.2392578125, "logps/chosen": -376.0, "logps/rejected": -296.0, "loss": 0.2886, "rewards/accuracies": 0.84375, "rewards/chosen": 1.046875, "rewards/margins": 5.9375, "rewards/rejected": -4.90625, "step": 628 }, { "epoch": 0.7717791411042945, "grad_norm": 23.68892864954692, "learning_rate": 6.003305785123967e-07, "logits/chosen": -0.1220703125, "logits/rejected": -0.2470703125, "logps/chosen": -348.0, "logps/rejected": -284.0, "loss": 0.1789, "rewards/accuracies": 0.9296875, "rewards/chosen": 0.8046875, "rewards/margins": 6.15625, "rewards/rejected": -5.375, "step": 629 }, { "epoch": 0.7730061349693251, "grad_norm": 33.10208379218177, "learning_rate": 6e-07, "logits/chosen": -0.060546875, "logits/rejected": -0.298828125, "logps/chosen": -370.0, "logps/rejected": -364.0, "loss": 0.2663, "rewards/accuracies": 0.859375, "rewards/chosen": 1.7421875, "rewards/margins": 6.78125, "rewards/rejected": -5.0625, "step": 630 }, { "epoch": 0.7742331288343558, "grad_norm": 36.528138511875646, "learning_rate": 5.996694214876033e-07, "logits/chosen": -0.251953125, "logits/rejected": -0.353515625, "logps/chosen": -388.0, "logps/rejected": -318.0, "loss": 0.3321, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.53125, "rewards/margins": 6.40625, "rewards/rejected": -4.875, "step": 631 }, { "epoch": 0.7754601226993865, "grad_norm": 36.37506860284647, "learning_rate": 5.993388429752066e-07, "logits/chosen": -0.1669921875, "logits/rejected": -0.302734375, "logps/chosen": -400.0, "logps/rejected": -336.0, "loss": 0.3056, "rewards/accuracies": 0.875, "rewards/chosen": 1.671875, "rewards/margins": 6.0, "rewards/rejected": -4.34375, "step": 632 }, { "epoch": 0.7766871165644171, "grad_norm": 40.1484232566858, "learning_rate": 5.990082644628099e-07, "logits/chosen": -0.08642578125, "logits/rejected": -0.21484375, "logps/chosen": -338.0, "logps/rejected": -330.0, "loss": 0.3418, "rewards/accuracies": 0.796875, "rewards/chosen": 0.84375, "rewards/margins": 5.5, "rewards/rejected": -4.65625, "step": 633 }, { "epoch": 0.7779141104294478, "grad_norm": 32.83617762178678, "learning_rate": 5.986776859504132e-07, "logits/chosen": -0.185546875, "logits/rejected": -0.392578125, "logps/chosen": -414.0, "logps/rejected": -322.0, "loss": 0.2202, "rewards/accuracies": 0.90625, "rewards/chosen": 2.734375, "rewards/margins": 7.9375, "rewards/rejected": -5.1875, "step": 634 }, { "epoch": 0.7791411042944786, "grad_norm": 29.099912658258905, "learning_rate": 5.983471074380165e-07, "logits/chosen": -0.1884765625, "logits/rejected": -0.255859375, "logps/chosen": -358.0, "logps/rejected": -296.0, "loss": 0.2119, "rewards/accuracies": 0.890625, "rewards/chosen": 1.015625, "rewards/margins": 5.875, "rewards/rejected": -4.84375, "step": 635 }, { "epoch": 0.7803680981595092, "grad_norm": 39.54581126371982, "learning_rate": 5.980165289256198e-07, "logits/chosen": -0.1884765625, "logits/rejected": -0.310546875, "logps/chosen": -412.0, "logps/rejected": -366.0, "loss": 0.3099, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.8046875, "rewards/margins": 6.71875, "rewards/rejected": -4.90625, "step": 636 }, { "epoch": 0.7815950920245399, "grad_norm": 45.109718146173684, "learning_rate": 5.976859504132231e-07, "logits/chosen": -0.03125, "logits/rejected": -0.212890625, "logps/chosen": -376.0, "logps/rejected": -300.0, "loss": 0.3522, "rewards/accuracies": 0.828125, "rewards/chosen": 0.96875, "rewards/margins": 5.96875, "rewards/rejected": -5.0, "step": 637 }, { "epoch": 0.7828220858895706, "grad_norm": 29.717665569657886, "learning_rate": 5.973553719008264e-07, "logits/chosen": -0.173828125, "logits/rejected": -0.37109375, "logps/chosen": -402.0, "logps/rejected": -334.0, "loss": 0.2213, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.6875, "rewards/margins": 6.625, "rewards/rejected": -4.9375, "step": 638 }, { "epoch": 0.7840490797546013, "grad_norm": 38.75212680036792, "learning_rate": 5.970247933884297e-07, "logits/chosen": -0.048828125, "logits/rejected": -0.2265625, "logps/chosen": -402.0, "logps/rejected": -332.0, "loss": 0.3316, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.6484375, "rewards/margins": 6.0, "rewards/rejected": -4.34375, "step": 639 }, { "epoch": 0.7852760736196319, "grad_norm": 39.02043679792906, "learning_rate": 5.96694214876033e-07, "logits/chosen": -0.2021484375, "logits/rejected": -0.33984375, "logps/chosen": -440.0, "logps/rejected": -382.0, "loss": 0.2894, "rewards/accuracies": 0.8671875, "rewards/chosen": 2.15625, "rewards/margins": 6.875, "rewards/rejected": -4.71875, "step": 640 }, { "epoch": 0.7865030674846626, "grad_norm": 44.494628054471185, "learning_rate": 5.963636363636364e-07, "logits/chosen": -0.2373046875, "logits/rejected": -0.373046875, "logps/chosen": -390.0, "logps/rejected": -348.0, "loss": 0.4553, "rewards/accuracies": 0.8125, "rewards/chosen": 1.734375, "rewards/margins": 5.75, "rewards/rejected": -4.03125, "step": 641 }, { "epoch": 0.7877300613496933, "grad_norm": 27.200186618621586, "learning_rate": 5.960330578512397e-07, "logits/chosen": -0.1416015625, "logits/rejected": -0.353515625, "logps/chosen": -346.0, "logps/rejected": -290.0, "loss": 0.2487, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.5390625, "rewards/margins": 6.03125, "rewards/rejected": -4.5, "step": 642 }, { "epoch": 0.7889570552147239, "grad_norm": 36.983988342062, "learning_rate": 5.95702479338843e-07, "logits/chosen": -0.275390625, "logits/rejected": -0.447265625, "logps/chosen": -398.0, "logps/rejected": -372.0, "loss": 0.2631, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.7109375, "rewards/margins": 6.21875, "rewards/rejected": -4.53125, "step": 643 }, { "epoch": 0.7901840490797546, "grad_norm": 39.431613095622076, "learning_rate": 5.953719008264462e-07, "logits/chosen": -0.1923828125, "logits/rejected": -0.337890625, "logps/chosen": -384.0, "logps/rejected": -324.0, "loss": 0.2856, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.703125, "rewards/margins": 6.78125, "rewards/rejected": -5.09375, "step": 644 }, { "epoch": 0.7914110429447853, "grad_norm": 33.34429063414653, "learning_rate": 5.950413223140495e-07, "logits/chosen": -0.140625, "logits/rejected": -0.345703125, "logps/chosen": -328.0, "logps/rejected": -330.0, "loss": 0.2445, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.796875, "rewards/margins": 6.75, "rewards/rejected": -4.9375, "step": 645 }, { "epoch": 0.7926380368098159, "grad_norm": 34.57872089054598, "learning_rate": 5.947107438016528e-07, "logits/chosen": -0.0859375, "logits/rejected": -0.263671875, "logps/chosen": -376.0, "logps/rejected": -322.0, "loss": 0.2881, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.6171875, "rewards/margins": 6.375, "rewards/rejected": -4.75, "step": 646 }, { "epoch": 0.7938650306748466, "grad_norm": 34.439204602754096, "learning_rate": 5.943801652892562e-07, "logits/chosen": -0.1484375, "logits/rejected": -0.296875, "logps/chosen": -376.0, "logps/rejected": -318.0, "loss": 0.2819, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.9921875, "rewards/margins": 7.125, "rewards/rejected": -5.125, "step": 647 }, { "epoch": 0.7950920245398773, "grad_norm": 41.50373217977521, "learning_rate": 5.940495867768595e-07, "logits/chosen": -0.203125, "logits/rejected": -0.2119140625, "logps/chosen": -324.0, "logps/rejected": -320.0, "loss": 0.3682, "rewards/accuracies": 0.8046875, "rewards/chosen": 0.859375, "rewards/margins": 5.71875, "rewards/rejected": -4.84375, "step": 648 }, { "epoch": 0.7963190184049079, "grad_norm": 43.045318488956525, "learning_rate": 5.937190082644628e-07, "logits/chosen": -0.0654296875, "logits/rejected": -0.1650390625, "logps/chosen": -362.0, "logps/rejected": -324.0, "loss": 0.491, "rewards/accuracies": 0.7734375, "rewards/chosen": 1.140625, "rewards/margins": 5.34375, "rewards/rejected": -4.21875, "step": 649 }, { "epoch": 0.7975460122699386, "grad_norm": 41.49765653672477, "learning_rate": 5.933884297520661e-07, "logits/chosen": -0.08642578125, "logits/rejected": -0.25390625, "logps/chosen": -422.0, "logps/rejected": -346.0, "loss": 0.3786, "rewards/accuracies": 0.796875, "rewards/chosen": 1.8125, "rewards/margins": 5.90625, "rewards/rejected": -4.09375, "step": 650 }, { "epoch": 0.7987730061349694, "grad_norm": 38.92619113627064, "learning_rate": 5.930578512396694e-07, "logits/chosen": -0.2275390625, "logits/rejected": -0.302734375, "logps/chosen": -368.0, "logps/rejected": -348.0, "loss": 0.2788, "rewards/accuracies": 0.875, "rewards/chosen": 1.78125, "rewards/margins": 7.34375, "rewards/rejected": -5.5625, "step": 651 }, { "epoch": 0.8, "grad_norm": 40.314158512080596, "learning_rate": 5.927272727272728e-07, "logits/chosen": -0.158203125, "logits/rejected": -0.29296875, "logps/chosen": -364.0, "logps/rejected": -340.0, "loss": 0.3015, "rewards/accuracies": 0.828125, "rewards/chosen": 0.703125, "rewards/margins": 5.78125, "rewards/rejected": -5.09375, "step": 652 }, { "epoch": 0.8012269938650307, "grad_norm": 41.91917001542575, "learning_rate": 5.92396694214876e-07, "logits/chosen": -0.103515625, "logits/rejected": -0.283203125, "logps/chosen": -346.0, "logps/rejected": -328.0, "loss": 0.2786, "rewards/accuracies": 0.828125, "rewards/chosen": 1.1796875, "rewards/margins": 6.78125, "rewards/rejected": -5.625, "step": 653 }, { "epoch": 0.8024539877300614, "grad_norm": 32.50826629622854, "learning_rate": 5.920661157024793e-07, "logits/chosen": -0.083984375, "logits/rejected": -0.291015625, "logps/chosen": -390.0, "logps/rejected": -312.0, "loss": 0.2325, "rewards/accuracies": 0.859375, "rewards/chosen": 1.4375, "rewards/margins": 6.78125, "rewards/rejected": -5.34375, "step": 654 }, { "epoch": 0.803680981595092, "grad_norm": 36.66838919465664, "learning_rate": 5.917355371900826e-07, "logits/chosen": -0.142578125, "logits/rejected": -0.318359375, "logps/chosen": -384.0, "logps/rejected": -344.0, "loss": 0.2743, "rewards/accuracies": 0.84375, "rewards/chosen": 1.1328125, "rewards/margins": 6.28125, "rewards/rejected": -5.15625, "step": 655 }, { "epoch": 0.8049079754601227, "grad_norm": 40.353892524687666, "learning_rate": 5.914049586776859e-07, "logits/chosen": -0.080078125, "logits/rejected": -0.2373046875, "logps/chosen": -368.0, "logps/rejected": -320.0, "loss": 0.3542, "rewards/accuracies": 0.84375, "rewards/chosen": 0.86328125, "rewards/margins": 6.09375, "rewards/rejected": -5.25, "step": 656 }, { "epoch": 0.8061349693251534, "grad_norm": 32.71653938190321, "learning_rate": 5.910743801652892e-07, "logits/chosen": -0.2236328125, "logits/rejected": -0.380859375, "logps/chosen": -356.0, "logps/rejected": -330.0, "loss": 0.3238, "rewards/accuracies": 0.828125, "rewards/chosen": 1.0625, "rewards/margins": 6.25, "rewards/rejected": -5.1875, "step": 657 }, { "epoch": 0.807361963190184, "grad_norm": 35.63490892300594, "learning_rate": 5.907438016528926e-07, "logits/chosen": -0.23046875, "logits/rejected": -0.369140625, "logps/chosen": -388.0, "logps/rejected": -344.0, "loss": 0.2672, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.99609375, "rewards/margins": 6.375, "rewards/rejected": -5.375, "step": 658 }, { "epoch": 0.8085889570552147, "grad_norm": 36.34676950346043, "learning_rate": 5.904132231404959e-07, "logits/chosen": -0.169921875, "logits/rejected": -0.32421875, "logps/chosen": -362.0, "logps/rejected": -328.0, "loss": 0.3323, "rewards/accuracies": 0.859375, "rewards/chosen": 0.2177734375, "rewards/margins": 5.90625, "rewards/rejected": -5.6875, "step": 659 }, { "epoch": 0.8098159509202454, "grad_norm": 31.25262331885713, "learning_rate": 5.900826446280992e-07, "logits/chosen": -0.1826171875, "logits/rejected": -0.373046875, "logps/chosen": -400.0, "logps/rejected": -352.0, "loss": 0.2661, "rewards/accuracies": 0.875, "rewards/chosen": 1.4296875, "rewards/margins": 6.90625, "rewards/rejected": -5.46875, "step": 660 }, { "epoch": 0.811042944785276, "grad_norm": 44.04724360514248, "learning_rate": 5.897520661157025e-07, "logits/chosen": -0.11181640625, "logits/rejected": -0.2236328125, "logps/chosen": -360.0, "logps/rejected": -298.0, "loss": 0.3716, "rewards/accuracies": 0.8125, "rewards/chosen": 0.3125, "rewards/margins": 5.8125, "rewards/rejected": -5.46875, "step": 661 }, { "epoch": 0.8122699386503067, "grad_norm": 28.306859195207647, "learning_rate": 5.894214876033057e-07, "logits/chosen": -0.11962890625, "logits/rejected": -0.2578125, "logps/chosen": -362.0, "logps/rejected": -322.0, "loss": 0.2117, "rewards/accuracies": 0.890625, "rewards/chosen": 1.390625, "rewards/margins": 7.09375, "rewards/rejected": -5.71875, "step": 662 }, { "epoch": 0.8134969325153374, "grad_norm": 28.755676702838585, "learning_rate": 5.89090909090909e-07, "logits/chosen": -0.06689453125, "logits/rejected": -0.263671875, "logps/chosen": -354.0, "logps/rejected": -322.0, "loss": 0.2615, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.3671875, "rewards/margins": 6.46875, "rewards/rejected": -5.09375, "step": 663 }, { "epoch": 0.8147239263803681, "grad_norm": 30.20251070806522, "learning_rate": 5.887603305785124e-07, "logits/chosen": -0.349609375, "logits/rejected": -0.494140625, "logps/chosen": -384.0, "logps/rejected": -358.0, "loss": 0.1821, "rewards/accuracies": 0.9140625, "rewards/chosen": 1.21875, "rewards/margins": 7.84375, "rewards/rejected": -6.625, "step": 664 }, { "epoch": 0.8159509202453987, "grad_norm": 43.59493072844384, "learning_rate": 5.884297520661157e-07, "logits/chosen": -0.05029296875, "logits/rejected": -0.2197265625, "logps/chosen": -334.0, "logps/rejected": -292.0, "loss": 0.2979, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.5234375, "rewards/margins": 6.3125, "rewards/rejected": -5.78125, "step": 665 }, { "epoch": 0.8171779141104294, "grad_norm": 42.64325196007558, "learning_rate": 5.88099173553719e-07, "logits/chosen": -0.08642578125, "logits/rejected": -0.271484375, "logps/chosen": -418.0, "logps/rejected": -348.0, "loss": 0.368, "rewards/accuracies": 0.8046875, "rewards/chosen": 1.1875, "rewards/margins": 6.40625, "rewards/rejected": -5.21875, "step": 666 }, { "epoch": 0.8184049079754602, "grad_norm": 34.27649786728366, "learning_rate": 5.877685950413223e-07, "logits/chosen": -0.1611328125, "logits/rejected": -0.359375, "logps/chosen": -374.0, "logps/rejected": -332.0, "loss": 0.2601, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.0625, "rewards/margins": 6.8125, "rewards/rejected": -5.75, "step": 667 }, { "epoch": 0.8196319018404908, "grad_norm": 33.27456675278737, "learning_rate": 5.874380165289256e-07, "logits/chosen": -0.15234375, "logits/rejected": -0.291015625, "logps/chosen": -386.0, "logps/rejected": -348.0, "loss": 0.2841, "rewards/accuracies": 0.859375, "rewards/chosen": 1.15625, "rewards/margins": 6.5625, "rewards/rejected": -5.40625, "step": 668 }, { "epoch": 0.8208588957055215, "grad_norm": 41.4043511264187, "learning_rate": 5.871074380165289e-07, "logits/chosen": -0.212890625, "logits/rejected": -0.37109375, "logps/chosen": -338.0, "logps/rejected": -328.0, "loss": 0.3017, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.875, "rewards/margins": 6.25, "rewards/rejected": -5.375, "step": 669 }, { "epoch": 0.8220858895705522, "grad_norm": 31.799223551777082, "learning_rate": 5.867768595041323e-07, "logits/chosen": -0.0191650390625, "logits/rejected": -0.1650390625, "logps/chosen": -324.0, "logps/rejected": -296.0, "loss": 0.2541, "rewards/accuracies": 0.890625, "rewards/chosen": 1.03125, "rewards/margins": 6.15625, "rewards/rejected": -5.125, "step": 670 }, { "epoch": 0.8233128834355828, "grad_norm": 31.913109572694793, "learning_rate": 5.864462809917355e-07, "logits/chosen": -0.1298828125, "logits/rejected": -0.294921875, "logps/chosen": -372.0, "logps/rejected": -326.0, "loss": 0.2407, "rewards/accuracies": 0.859375, "rewards/chosen": 1.7890625, "rewards/margins": 6.84375, "rewards/rejected": -5.0625, "step": 671 }, { "epoch": 0.8245398773006135, "grad_norm": 32.62700830171627, "learning_rate": 5.861157024793388e-07, "logits/chosen": -0.109375, "logits/rejected": -0.376953125, "logps/chosen": -444.0, "logps/rejected": -326.0, "loss": 0.2681, "rewards/accuracies": 0.859375, "rewards/chosen": 2.078125, "rewards/margins": 7.25, "rewards/rejected": -5.15625, "step": 672 }, { "epoch": 0.8257668711656442, "grad_norm": 36.66995682138012, "learning_rate": 5.857851239669421e-07, "logits/chosen": -0.0498046875, "logits/rejected": -0.28125, "logps/chosen": -388.0, "logps/rejected": -324.0, "loss": 0.2592, "rewards/accuracies": 0.859375, "rewards/chosen": 1.265625, "rewards/margins": 5.90625, "rewards/rejected": -4.625, "step": 673 }, { "epoch": 0.8269938650306748, "grad_norm": 34.606200421728126, "learning_rate": 5.854545454545454e-07, "logits/chosen": -0.01300048828125, "logits/rejected": -0.177734375, "logps/chosen": -354.0, "logps/rejected": -324.0, "loss": 0.2822, "rewards/accuracies": 0.84375, "rewards/chosen": 1.3359375, "rewards/margins": 6.40625, "rewards/rejected": -5.09375, "step": 674 }, { "epoch": 0.8282208588957055, "grad_norm": 35.038586845163366, "learning_rate": 5.851239669421487e-07, "logits/chosen": -0.08642578125, "logits/rejected": -0.30078125, "logps/chosen": -424.0, "logps/rejected": -360.0, "loss": 0.3168, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.625, "rewards/margins": 6.90625, "rewards/rejected": -5.28125, "step": 675 }, { "epoch": 0.8294478527607362, "grad_norm": 35.465018732105385, "learning_rate": 5.847933884297521e-07, "logits/chosen": -0.1806640625, "logits/rejected": -0.291015625, "logps/chosen": -390.0, "logps/rejected": -344.0, "loss": 0.2534, "rewards/accuracies": 0.859375, "rewards/chosen": 0.71875, "rewards/margins": 6.25, "rewards/rejected": -5.53125, "step": 676 }, { "epoch": 0.8306748466257668, "grad_norm": 36.537944400776084, "learning_rate": 5.844628099173554e-07, "logits/chosen": -0.06982421875, "logits/rejected": -0.2451171875, "logps/chosen": -334.0, "logps/rejected": -304.0, "loss": 0.2916, "rewards/accuracies": 0.859375, "rewards/chosen": 0.52734375, "rewards/margins": 6.375, "rewards/rejected": -5.84375, "step": 677 }, { "epoch": 0.8319018404907975, "grad_norm": 33.168213995988694, "learning_rate": 5.841322314049587e-07, "logits/chosen": -0.1005859375, "logits/rejected": -0.30859375, "logps/chosen": -418.0, "logps/rejected": -348.0, "loss": 0.2768, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.95703125, "rewards/margins": 6.21875, "rewards/rejected": -5.25, "step": 678 }, { "epoch": 0.8331288343558282, "grad_norm": 37.74716831610831, "learning_rate": 5.838016528925619e-07, "logits/chosen": -0.01220703125, "logits/rejected": -0.1259765625, "logps/chosen": -338.0, "logps/rejected": -314.0, "loss": 0.3364, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.015625, "rewards/margins": 5.84375, "rewards/rejected": -4.8125, "step": 679 }, { "epoch": 0.8343558282208589, "grad_norm": 34.79631984317766, "learning_rate": 5.834710743801652e-07, "logits/chosen": -0.142578125, "logits/rejected": -0.318359375, "logps/chosen": -454.0, "logps/rejected": -362.0, "loss": 0.2698, "rewards/accuracies": 0.859375, "rewards/chosen": 1.4375, "rewards/margins": 7.09375, "rewards/rejected": -5.65625, "step": 680 }, { "epoch": 0.8355828220858895, "grad_norm": 27.30848566312445, "learning_rate": 5.831404958677685e-07, "logits/chosen": -0.1728515625, "logits/rejected": -0.333984375, "logps/chosen": -344.0, "logps/rejected": -324.0, "loss": 0.1854, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.0859375, "rewards/margins": 7.34375, "rewards/rejected": -6.25, "step": 681 }, { "epoch": 0.8368098159509203, "grad_norm": 36.85289178579729, "learning_rate": 5.828099173553719e-07, "logits/chosen": -0.169921875, "logits/rejected": -0.291015625, "logps/chosen": -350.0, "logps/rejected": -322.0, "loss": 0.3333, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.81640625, "rewards/margins": 6.46875, "rewards/rejected": -5.65625, "step": 682 }, { "epoch": 0.838036809815951, "grad_norm": 33.68839599065418, "learning_rate": 5.824793388429752e-07, "logits/chosen": -0.18359375, "logits/rejected": -0.302734375, "logps/chosen": -370.0, "logps/rejected": -316.0, "loss": 0.2767, "rewards/accuracies": 0.859375, "rewards/chosen": 1.203125, "rewards/margins": 7.0, "rewards/rejected": -5.8125, "step": 683 }, { "epoch": 0.8392638036809816, "grad_norm": 35.217179760941754, "learning_rate": 5.821487603305785e-07, "logits/chosen": 0.000904083251953125, "logits/rejected": -0.1181640625, "logps/chosen": -314.0, "logps/rejected": -338.0, "loss": 0.3304, "rewards/accuracies": 0.8671875, "rewards/chosen": -0.0341796875, "rewards/margins": 5.40625, "rewards/rejected": -5.4375, "step": 684 }, { "epoch": 0.8404907975460123, "grad_norm": 34.3907812005455, "learning_rate": 5.818181818181818e-07, "logits/chosen": -0.11865234375, "logits/rejected": -0.29296875, "logps/chosen": -398.0, "logps/rejected": -364.0, "loss": 0.2858, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.9375, "rewards/margins": 7.53125, "rewards/rejected": -6.59375, "step": 685 }, { "epoch": 0.841717791411043, "grad_norm": 29.480838482306872, "learning_rate": 5.814876033057851e-07, "logits/chosen": -0.1328125, "logits/rejected": -0.267578125, "logps/chosen": -392.0, "logps/rejected": -330.0, "loss": 0.2598, "rewards/accuracies": 0.859375, "rewards/chosen": 1.03125, "rewards/margins": 6.875, "rewards/rejected": -5.8125, "step": 686 }, { "epoch": 0.8429447852760736, "grad_norm": 34.28684664510481, "learning_rate": 5.811570247933884e-07, "logits/chosen": -0.11767578125, "logits/rejected": -0.263671875, "logps/chosen": -374.0, "logps/rejected": -346.0, "loss": 0.2709, "rewards/accuracies": 0.84375, "rewards/chosen": 1.1328125, "rewards/margins": 6.78125, "rewards/rejected": -5.65625, "step": 687 }, { "epoch": 0.8441717791411043, "grad_norm": 35.903679070126266, "learning_rate": 5.808264462809917e-07, "logits/chosen": -0.1640625, "logits/rejected": -0.326171875, "logps/chosen": -376.0, "logps/rejected": -308.0, "loss": 0.2748, "rewards/accuracies": 0.828125, "rewards/chosen": 0.07958984375, "rewards/margins": 6.21875, "rewards/rejected": -6.125, "step": 688 }, { "epoch": 0.845398773006135, "grad_norm": 37.11450186775036, "learning_rate": 5.80495867768595e-07, "logits/chosen": -0.12353515625, "logits/rejected": -0.2197265625, "logps/chosen": -372.0, "logps/rejected": -328.0, "loss": 0.3107, "rewards/accuracies": 0.859375, "rewards/chosen": 1.2109375, "rewards/margins": 6.59375, "rewards/rejected": -5.375, "step": 689 }, { "epoch": 0.8466257668711656, "grad_norm": 49.86231404884124, "learning_rate": 5.801652892561983e-07, "logits/chosen": 0.004058837890625, "logits/rejected": -0.1943359375, "logps/chosen": -402.0, "logps/rejected": -350.0, "loss": 0.4457, "rewards/accuracies": 0.78125, "rewards/chosen": 1.5, "rewards/margins": 6.8125, "rewards/rejected": -5.3125, "step": 690 }, { "epoch": 0.8478527607361963, "grad_norm": 30.320356705626047, "learning_rate": 5.798347107438016e-07, "logits/chosen": -0.298828125, "logits/rejected": -0.41796875, "logps/chosen": -356.0, "logps/rejected": -346.0, "loss": 0.2435, "rewards/accuracies": 0.875, "rewards/chosen": 1.2734375, "rewards/margins": 7.0, "rewards/rejected": -5.71875, "step": 691 }, { "epoch": 0.849079754601227, "grad_norm": 43.95989415122109, "learning_rate": 5.795041322314049e-07, "logits/chosen": -0.134765625, "logits/rejected": -0.29296875, "logps/chosen": -408.0, "logps/rejected": -336.0, "loss": 0.282, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.703125, "rewards/margins": 7.0625, "rewards/rejected": -5.34375, "step": 692 }, { "epoch": 0.8503067484662576, "grad_norm": 33.0652784939274, "learning_rate": 5.791735537190082e-07, "logits/chosen": -0.1474609375, "logits/rejected": -0.34765625, "logps/chosen": -442.0, "logps/rejected": -364.0, "loss": 0.2934, "rewards/accuracies": 0.8671875, "rewards/chosen": 2.203125, "rewards/margins": 7.8125, "rewards/rejected": -5.625, "step": 693 }, { "epoch": 0.8515337423312883, "grad_norm": 46.044690743816275, "learning_rate": 5.788429752066116e-07, "logits/chosen": -0.13671875, "logits/rejected": -0.318359375, "logps/chosen": -370.0, "logps/rejected": -330.0, "loss": 0.4005, "rewards/accuracies": 0.8125, "rewards/chosen": 0.79296875, "rewards/margins": 5.34375, "rewards/rejected": -4.5625, "step": 694 }, { "epoch": 0.852760736196319, "grad_norm": 47.292538608776496, "learning_rate": 5.785123966942149e-07, "logits/chosen": -0.11376953125, "logits/rejected": -0.208984375, "logps/chosen": -328.0, "logps/rejected": -302.0, "loss": 0.4681, "rewards/accuracies": 0.7578125, "rewards/chosen": 0.703125, "rewards/margins": 4.625, "rewards/rejected": -3.90625, "step": 695 }, { "epoch": 0.8539877300613496, "grad_norm": 38.43478974924762, "learning_rate": 5.781818181818182e-07, "logits/chosen": -0.07568359375, "logits/rejected": -0.25390625, "logps/chosen": -378.0, "logps/rejected": -316.0, "loss": 0.3104, "rewards/accuracies": 0.828125, "rewards/chosen": 1.5625, "rewards/margins": 6.25, "rewards/rejected": -4.6875, "step": 696 }, { "epoch": 0.8552147239263803, "grad_norm": 58.82691398412282, "learning_rate": 5.778512396694214e-07, "logits/chosen": -0.224609375, "logits/rejected": -0.2734375, "logps/chosen": -386.0, "logps/rejected": -360.0, "loss": 0.3128, "rewards/accuracies": 0.859375, "rewards/chosen": 2.140625, "rewards/margins": 6.90625, "rewards/rejected": -4.78125, "step": 697 }, { "epoch": 0.8564417177914111, "grad_norm": 37.608292873182215, "learning_rate": 5.775206611570247e-07, "logits/chosen": -0.080078125, "logits/rejected": -0.216796875, "logps/chosen": -392.0, "logps/rejected": -344.0, "loss": 0.2946, "rewards/accuracies": 0.84375, "rewards/chosen": 1.6640625, "rewards/margins": 6.5, "rewards/rejected": -4.84375, "step": 698 }, { "epoch": 0.8576687116564418, "grad_norm": 41.848029972370156, "learning_rate": 5.77190082644628e-07, "logits/chosen": -0.1455078125, "logits/rejected": -0.2421875, "logps/chosen": -334.0, "logps/rejected": -320.0, "loss": 0.2843, "rewards/accuracies": 0.84375, "rewards/chosen": 0.91015625, "rewards/margins": 5.625, "rewards/rejected": -4.71875, "step": 699 }, { "epoch": 0.8588957055214724, "grad_norm": 39.920137771888676, "learning_rate": 5.768595041322314e-07, "logits/chosen": -0.054931640625, "logits/rejected": -0.1640625, "logps/chosen": -368.0, "logps/rejected": -320.0, "loss": 0.3259, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.34375, "rewards/margins": 5.59375, "rewards/rejected": -4.25, "step": 700 }, { "epoch": 0.8601226993865031, "grad_norm": 41.52681124295287, "learning_rate": 5.765289256198347e-07, "logits/chosen": -0.025146484375, "logits/rejected": -0.138671875, "logps/chosen": -376.0, "logps/rejected": -322.0, "loss": 0.385, "rewards/accuracies": 0.828125, "rewards/chosen": 1.078125, "rewards/margins": 5.84375, "rewards/rejected": -4.78125, "step": 701 }, { "epoch": 0.8613496932515338, "grad_norm": 28.252991079387233, "learning_rate": 5.76198347107438e-07, "logits/chosen": -0.166015625, "logits/rejected": -0.458984375, "logps/chosen": -394.0, "logps/rejected": -330.0, "loss": 0.1786, "rewards/accuracies": 0.8828125, "rewards/chosen": 2.125, "rewards/margins": 7.34375, "rewards/rejected": -5.21875, "step": 702 }, { "epoch": 0.8625766871165644, "grad_norm": 31.56795802217109, "learning_rate": 5.758677685950413e-07, "logits/chosen": -0.046142578125, "logits/rejected": -0.1884765625, "logps/chosen": -410.0, "logps/rejected": -338.0, "loss": 0.2909, "rewards/accuracies": 0.859375, "rewards/chosen": 1.5078125, "rewards/margins": 5.8125, "rewards/rejected": -4.3125, "step": 703 }, { "epoch": 0.8638036809815951, "grad_norm": 34.11635728276886, "learning_rate": 5.755371900826446e-07, "logits/chosen": -0.1201171875, "logits/rejected": -0.294921875, "logps/chosen": -320.0, "logps/rejected": -298.0, "loss": 0.3105, "rewards/accuracies": 0.84375, "rewards/chosen": 1.25, "rewards/margins": 6.1875, "rewards/rejected": -4.9375, "step": 704 }, { "epoch": 0.8650306748466258, "grad_norm": 38.95077133588588, "learning_rate": 5.75206611570248e-07, "logits/chosen": -0.2353515625, "logits/rejected": -0.365234375, "logps/chosen": -410.0, "logps/rejected": -352.0, "loss": 0.2767, "rewards/accuracies": 0.84375, "rewards/chosen": 2.265625, "rewards/margins": 7.15625, "rewards/rejected": -4.875, "step": 705 }, { "epoch": 0.8662576687116564, "grad_norm": 35.267737415428456, "learning_rate": 5.748760330578512e-07, "logits/chosen": -0.169921875, "logits/rejected": -0.37109375, "logps/chosen": -398.0, "logps/rejected": -294.0, "loss": 0.3068, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.4609375, "rewards/margins": 6.0, "rewards/rejected": -4.53125, "step": 706 }, { "epoch": 0.8674846625766871, "grad_norm": 34.32550780952695, "learning_rate": 5.745454545454545e-07, "logits/chosen": -0.1845703125, "logits/rejected": -0.34765625, "logps/chosen": -382.0, "logps/rejected": -304.0, "loss": 0.2683, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.1796875, "rewards/margins": 6.4375, "rewards/rejected": -5.25, "step": 707 }, { "epoch": 0.8687116564417178, "grad_norm": 31.650191661242673, "learning_rate": 5.742148760330578e-07, "logits/chosen": -0.1669921875, "logits/rejected": -0.384765625, "logps/chosen": -370.0, "logps/rejected": -312.0, "loss": 0.2379, "rewards/accuracies": 0.875, "rewards/chosen": 1.6796875, "rewards/margins": 6.5625, "rewards/rejected": -4.875, "step": 708 }, { "epoch": 0.8699386503067484, "grad_norm": 25.32301991794396, "learning_rate": 5.738842975206611e-07, "logits/chosen": -0.06640625, "logits/rejected": -0.23046875, "logps/chosen": -434.0, "logps/rejected": -340.0, "loss": 0.185, "rewards/accuracies": 0.921875, "rewards/chosen": 1.9765625, "rewards/margins": 7.53125, "rewards/rejected": -5.53125, "step": 709 }, { "epoch": 0.8711656441717791, "grad_norm": 33.22472192244502, "learning_rate": 5.735537190082644e-07, "logits/chosen": -0.017333984375, "logits/rejected": -0.15234375, "logps/chosen": -362.0, "logps/rejected": -312.0, "loss": 0.299, "rewards/accuracies": 0.84375, "rewards/chosen": 1.1015625, "rewards/margins": 5.71875, "rewards/rejected": -4.625, "step": 710 }, { "epoch": 0.8723926380368098, "grad_norm": 29.02267964751041, "learning_rate": 5.732231404958678e-07, "logits/chosen": -0.042724609375, "logits/rejected": -0.236328125, "logps/chosen": -382.0, "logps/rejected": -316.0, "loss": 0.2551, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.5078125, "rewards/margins": 6.28125, "rewards/rejected": -4.78125, "step": 711 }, { "epoch": 0.8736196319018404, "grad_norm": 40.668984053435686, "learning_rate": 5.728925619834711e-07, "logits/chosen": -0.03857421875, "logits/rejected": -0.1923828125, "logps/chosen": -404.0, "logps/rejected": -342.0, "loss": 0.3587, "rewards/accuracies": 0.84375, "rewards/chosen": 1.9921875, "rewards/margins": 6.375, "rewards/rejected": -4.375, "step": 712 }, { "epoch": 0.8748466257668711, "grad_norm": 33.08084767770349, "learning_rate": 5.725619834710744e-07, "logits/chosen": -0.1279296875, "logits/rejected": -0.32421875, "logps/chosen": -380.0, "logps/rejected": -320.0, "loss": 0.2665, "rewards/accuracies": 0.859375, "rewards/chosen": 1.28125, "rewards/margins": 6.4375, "rewards/rejected": -5.15625, "step": 713 }, { "epoch": 0.8760736196319019, "grad_norm": 36.45936464644564, "learning_rate": 5.722314049586777e-07, "logits/chosen": -0.0159912109375, "logits/rejected": -0.2333984375, "logps/chosen": -366.0, "logps/rejected": -316.0, "loss": 0.2938, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.2578125, "rewards/margins": 6.0, "rewards/rejected": -4.75, "step": 714 }, { "epoch": 0.8773006134969326, "grad_norm": 30.913206903477224, "learning_rate": 5.719008264462809e-07, "logits/chosen": -0.2275390625, "logits/rejected": -0.310546875, "logps/chosen": -382.0, "logps/rejected": -316.0, "loss": 0.2684, "rewards/accuracies": 0.859375, "rewards/chosen": 1.3515625, "rewards/margins": 6.90625, "rewards/rejected": -5.53125, "step": 715 }, { "epoch": 0.8785276073619632, "grad_norm": 41.616080953336535, "learning_rate": 5.715702479338842e-07, "logits/chosen": -0.1865234375, "logits/rejected": -0.369140625, "logps/chosen": -380.0, "logps/rejected": -312.0, "loss": 0.3142, "rewards/accuracies": 0.84375, "rewards/chosen": 1.421875, "rewards/margins": 6.03125, "rewards/rejected": -4.625, "step": 716 }, { "epoch": 0.8797546012269939, "grad_norm": 34.18654539125182, "learning_rate": 5.712396694214876e-07, "logits/chosen": -0.09423828125, "logits/rejected": -0.255859375, "logps/chosen": -342.0, "logps/rejected": -276.0, "loss": 0.2911, "rewards/accuracies": 0.8125, "rewards/chosen": 0.9296875, "rewards/margins": 6.25, "rewards/rejected": -5.3125, "step": 717 }, { "epoch": 0.8809815950920246, "grad_norm": 28.09115304120503, "learning_rate": 5.709090909090909e-07, "logits/chosen": -0.1875, "logits/rejected": -0.333984375, "logps/chosen": -398.0, "logps/rejected": -344.0, "loss": 0.2254, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.859375, "rewards/margins": 6.9375, "rewards/rejected": -5.0625, "step": 718 }, { "epoch": 0.8822085889570552, "grad_norm": 41.08426714668054, "learning_rate": 5.705785123966942e-07, "logits/chosen": -0.2275390625, "logits/rejected": -0.35546875, "logps/chosen": -406.0, "logps/rejected": -354.0, "loss": 0.3011, "rewards/accuracies": 0.828125, "rewards/chosen": 2.25, "rewards/margins": 7.1875, "rewards/rejected": -4.9375, "step": 719 }, { "epoch": 0.8834355828220859, "grad_norm": 28.518925312083375, "learning_rate": 5.702479338842975e-07, "logits/chosen": -0.22265625, "logits/rejected": -0.43359375, "logps/chosen": -410.0, "logps/rejected": -338.0, "loss": 0.2223, "rewards/accuracies": 0.8671875, "rewards/chosen": 2.265625, "rewards/margins": 7.0625, "rewards/rejected": -4.78125, "step": 720 }, { "epoch": 0.8846625766871166, "grad_norm": 26.149570167864507, "learning_rate": 5.699173553719008e-07, "logits/chosen": -0.20703125, "logits/rejected": -0.46875, "logps/chosen": -410.0, "logps/rejected": -352.0, "loss": 0.2073, "rewards/accuracies": 0.9296875, "rewards/chosen": 1.890625, "rewards/margins": 7.96875, "rewards/rejected": -6.09375, "step": 721 }, { "epoch": 0.8858895705521472, "grad_norm": 30.929567326750046, "learning_rate": 5.695867768595041e-07, "logits/chosen": -0.1923828125, "logits/rejected": -0.2890625, "logps/chosen": -376.0, "logps/rejected": -346.0, "loss": 0.2229, "rewards/accuracies": 0.890625, "rewards/chosen": 1.859375, "rewards/margins": 7.0, "rewards/rejected": -5.125, "step": 722 }, { "epoch": 0.8871165644171779, "grad_norm": 34.37293415398814, "learning_rate": 5.692561983471075e-07, "logits/chosen": -0.189453125, "logits/rejected": -0.306640625, "logps/chosen": -372.0, "logps/rejected": -322.0, "loss": 0.2808, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.3125, "rewards/margins": 6.75, "rewards/rejected": -5.4375, "step": 723 }, { "epoch": 0.8883435582822086, "grad_norm": 33.90677929130864, "learning_rate": 5.689256198347107e-07, "logits/chosen": -0.1806640625, "logits/rejected": -0.40625, "logps/chosen": -378.0, "logps/rejected": -308.0, "loss": 0.254, "rewards/accuracies": 0.875, "rewards/chosen": 1.7265625, "rewards/margins": 6.9375, "rewards/rejected": -5.21875, "step": 724 }, { "epoch": 0.8895705521472392, "grad_norm": 34.97307578381243, "learning_rate": 5.68595041322314e-07, "logits/chosen": -0.055419921875, "logits/rejected": -0.2314453125, "logps/chosen": -400.0, "logps/rejected": -326.0, "loss": 0.3044, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.453125, "rewards/margins": 6.59375, "rewards/rejected": -5.15625, "step": 725 }, { "epoch": 0.8907975460122699, "grad_norm": 28.627835648582934, "learning_rate": 5.682644628099173e-07, "logits/chosen": -0.1796875, "logits/rejected": -0.31640625, "logps/chosen": -336.0, "logps/rejected": -288.0, "loss": 0.2135, "rewards/accuracies": 0.8828125, "rewards/chosen": 0.9765625, "rewards/margins": 6.5625, "rewards/rejected": -5.5625, "step": 726 }, { "epoch": 0.8920245398773006, "grad_norm": 34.81272514902735, "learning_rate": 5.679338842975206e-07, "logits/chosen": -0.15625, "logits/rejected": -0.306640625, "logps/chosen": -368.0, "logps/rejected": -324.0, "loss": 0.248, "rewards/accuracies": 0.859375, "rewards/chosen": 1.5234375, "rewards/margins": 6.6875, "rewards/rejected": -5.15625, "step": 727 }, { "epoch": 0.8932515337423312, "grad_norm": 37.8936877345969, "learning_rate": 5.676033057851239e-07, "logits/chosen": -0.1689453125, "logits/rejected": -0.3203125, "logps/chosen": -398.0, "logps/rejected": -364.0, "loss": 0.2946, "rewards/accuracies": 0.8359375, "rewards/chosen": 2.015625, "rewards/margins": 7.65625, "rewards/rejected": -5.625, "step": 728 }, { "epoch": 0.894478527607362, "grad_norm": 29.90567314985844, "learning_rate": 5.672727272727273e-07, "logits/chosen": -0.1865234375, "logits/rejected": -0.333984375, "logps/chosen": -390.0, "logps/rejected": -354.0, "loss": 0.2088, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.609375, "rewards/margins": 7.6875, "rewards/rejected": -6.0625, "step": 729 }, { "epoch": 0.8957055214723927, "grad_norm": 31.408249750098918, "learning_rate": 5.669421487603306e-07, "logits/chosen": -0.2578125, "logits/rejected": -0.376953125, "logps/chosen": -398.0, "logps/rejected": -364.0, "loss": 0.2204, "rewards/accuracies": 0.8984375, "rewards/chosen": 2.1875, "rewards/margins": 7.9375, "rewards/rejected": -5.75, "step": 730 }, { "epoch": 0.8969325153374234, "grad_norm": 33.91624972638253, "learning_rate": 5.666115702479339e-07, "logits/chosen": -0.052734375, "logits/rejected": -0.1845703125, "logps/chosen": -430.0, "logps/rejected": -348.0, "loss": 0.2736, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.390625, "rewards/margins": 7.1875, "rewards/rejected": -5.8125, "step": 731 }, { "epoch": 0.898159509202454, "grad_norm": 40.7773464371931, "learning_rate": 5.662809917355372e-07, "logits/chosen": -0.2080078125, "logits/rejected": -0.376953125, "logps/chosen": -372.0, "logps/rejected": -356.0, "loss": 0.3647, "rewards/accuracies": 0.78125, "rewards/chosen": 1.390625, "rewards/margins": 6.78125, "rewards/rejected": -5.375, "step": 732 }, { "epoch": 0.8993865030674847, "grad_norm": 31.001224216873553, "learning_rate": 5.659504132231404e-07, "logits/chosen": -0.10791015625, "logits/rejected": -0.267578125, "logps/chosen": -356.0, "logps/rejected": -344.0, "loss": 0.2212, "rewards/accuracies": 0.875, "rewards/chosen": 1.0546875, "rewards/margins": 6.90625, "rewards/rejected": -5.84375, "step": 733 }, { "epoch": 0.9006134969325154, "grad_norm": 37.803749225628884, "learning_rate": 5.656198347107437e-07, "logits/chosen": -0.08837890625, "logits/rejected": -0.275390625, "logps/chosen": -374.0, "logps/rejected": -338.0, "loss": 0.2954, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.2578125, "rewards/margins": 7.5, "rewards/rejected": -6.25, "step": 734 }, { "epoch": 0.901840490797546, "grad_norm": 30.18047116909555, "learning_rate": 5.652892561983471e-07, "logits/chosen": -0.1943359375, "logits/rejected": -0.427734375, "logps/chosen": -424.0, "logps/rejected": -372.0, "loss": 0.1824, "rewards/accuracies": 0.8984375, "rewards/chosen": 1.3046875, "rewards/margins": 8.125, "rewards/rejected": -6.8125, "step": 735 }, { "epoch": 0.9030674846625767, "grad_norm": 38.572832638835585, "learning_rate": 5.649586776859504e-07, "logits/chosen": -0.025634765625, "logits/rejected": -0.1552734375, "logps/chosen": -356.0, "logps/rejected": -328.0, "loss": 0.3608, "rewards/accuracies": 0.828125, "rewards/chosen": 0.0908203125, "rewards/margins": 6.40625, "rewards/rejected": -6.3125, "step": 736 }, { "epoch": 0.9042944785276074, "grad_norm": 46.258369054797996, "learning_rate": 5.646280991735537e-07, "logits/chosen": -0.12451171875, "logits/rejected": -0.2255859375, "logps/chosen": -354.0, "logps/rejected": -334.0, "loss": 0.4383, "rewards/accuracies": 0.7890625, "rewards/chosen": 0.1826171875, "rewards/margins": 6.4375, "rewards/rejected": -6.25, "step": 737 }, { "epoch": 0.905521472392638, "grad_norm": 32.39664225178629, "learning_rate": 5.64297520661157e-07, "logits/chosen": -0.185546875, "logits/rejected": -0.31640625, "logps/chosen": -442.0, "logps/rejected": -350.0, "loss": 0.2588, "rewards/accuracies": 0.828125, "rewards/chosen": 1.3046875, "rewards/margins": 7.5625, "rewards/rejected": -6.28125, "step": 738 }, { "epoch": 0.9067484662576687, "grad_norm": 34.18126494383032, "learning_rate": 5.639669421487603e-07, "logits/chosen": -0.11328125, "logits/rejected": -0.25390625, "logps/chosen": -344.0, "logps/rejected": -330.0, "loss": 0.2836, "rewards/accuracies": 0.859375, "rewards/chosen": 0.2470703125, "rewards/margins": 6.40625, "rewards/rejected": -6.15625, "step": 739 }, { "epoch": 0.9079754601226994, "grad_norm": 35.15083279583394, "learning_rate": 5.636363636363636e-07, "logits/chosen": -0.1796875, "logits/rejected": -0.345703125, "logps/chosen": -342.0, "logps/rejected": -318.0, "loss": 0.3072, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.2431640625, "rewards/margins": 6.9375, "rewards/rejected": -6.6875, "step": 740 }, { "epoch": 0.90920245398773, "grad_norm": 33.535600643328806, "learning_rate": 5.63305785123967e-07, "logits/chosen": -0.16796875, "logits/rejected": -0.3359375, "logps/chosen": -354.0, "logps/rejected": -318.0, "loss": 0.2851, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.125, "rewards/margins": 7.9375, "rewards/rejected": -6.8125, "step": 741 }, { "epoch": 0.9104294478527607, "grad_norm": 31.52809779595991, "learning_rate": 5.629752066115702e-07, "logits/chosen": -0.1748046875, "logits/rejected": -0.3671875, "logps/chosen": -364.0, "logps/rejected": -362.0, "loss": 0.2244, "rewards/accuracies": 0.890625, "rewards/chosen": 1.140625, "rewards/margins": 8.0625, "rewards/rejected": -6.90625, "step": 742 }, { "epoch": 0.9116564417177914, "grad_norm": 35.37117075886455, "learning_rate": 5.626446280991735e-07, "logits/chosen": -0.142578125, "logits/rejected": -0.212890625, "logps/chosen": -418.0, "logps/rejected": -380.0, "loss": 0.2769, "rewards/accuracies": 0.84375, "rewards/chosen": 0.703125, "rewards/margins": 6.53125, "rewards/rejected": -5.8125, "step": 743 }, { "epoch": 0.912883435582822, "grad_norm": 26.42035749866701, "learning_rate": 5.623140495867768e-07, "logits/chosen": -0.1259765625, "logits/rejected": -0.318359375, "logps/chosen": -378.0, "logps/rejected": -330.0, "loss": 0.1917, "rewards/accuracies": 0.9296875, "rewards/chosen": 1.328125, "rewards/margins": 8.0625, "rewards/rejected": -6.75, "step": 744 }, { "epoch": 0.9141104294478528, "grad_norm": 35.853268232755404, "learning_rate": 5.619834710743801e-07, "logits/chosen": -0.08251953125, "logits/rejected": -0.1865234375, "logps/chosen": -342.0, "logps/rejected": -310.0, "loss": 0.3009, "rewards/accuracies": 0.8359375, "rewards/chosen": 0.390625, "rewards/margins": 6.28125, "rewards/rejected": -5.875, "step": 745 }, { "epoch": 0.9153374233128835, "grad_norm": 43.35686834196019, "learning_rate": 5.616528925619834e-07, "logits/chosen": -0.0849609375, "logits/rejected": -0.255859375, "logps/chosen": -404.0, "logps/rejected": -346.0, "loss": 0.317, "rewards/accuracies": 0.859375, "rewards/chosen": 0.86328125, "rewards/margins": 6.84375, "rewards/rejected": -6.0, "step": 746 }, { "epoch": 0.9165644171779141, "grad_norm": 34.17444251605582, "learning_rate": 5.613223140495868e-07, "logits/chosen": -0.26171875, "logits/rejected": -0.380859375, "logps/chosen": -338.0, "logps/rejected": -336.0, "loss": 0.2811, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.41796875, "rewards/margins": 6.21875, "rewards/rejected": -5.78125, "step": 747 }, { "epoch": 0.9177914110429448, "grad_norm": 40.3104413419788, "learning_rate": 5.609917355371901e-07, "logits/chosen": -0.05224609375, "logits/rejected": -0.169921875, "logps/chosen": -374.0, "logps/rejected": -342.0, "loss": 0.3882, "rewards/accuracies": 0.796875, "rewards/chosen": 0.0279541015625, "rewards/margins": 5.65625, "rewards/rejected": -5.625, "step": 748 }, { "epoch": 0.9190184049079755, "grad_norm": 40.57709610969512, "learning_rate": 5.606611570247934e-07, "logits/chosen": -0.1865234375, "logits/rejected": -0.396484375, "logps/chosen": -416.0, "logps/rejected": -346.0, "loss": 0.3642, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.98828125, "rewards/margins": 7.0625, "rewards/rejected": -6.09375, "step": 749 }, { "epoch": 0.9202453987730062, "grad_norm": 43.682412563973024, "learning_rate": 5.603305785123967e-07, "logits/chosen": -0.1552734375, "logits/rejected": -0.298828125, "logps/chosen": -406.0, "logps/rejected": -334.0, "loss": 0.3704, "rewards/accuracies": 0.828125, "rewards/chosen": 0.63671875, "rewards/margins": 6.53125, "rewards/rejected": -5.875, "step": 750 }, { "epoch": 0.9214723926380368, "grad_norm": 42.01608666567515, "learning_rate": 5.599999999999999e-07, "logits/chosen": -0.1640625, "logits/rejected": -0.337890625, "logps/chosen": -422.0, "logps/rejected": -350.0, "loss": 0.3006, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.1640625, "rewards/margins": 7.4375, "rewards/rejected": -6.28125, "step": 751 }, { "epoch": 0.9226993865030675, "grad_norm": 32.96496448782055, "learning_rate": 5.596694214876033e-07, "logits/chosen": -0.169921875, "logits/rejected": -0.431640625, "logps/chosen": -418.0, "logps/rejected": -354.0, "loss": 0.2435, "rewards/accuracies": 0.890625, "rewards/chosen": 1.3984375, "rewards/margins": 7.75, "rewards/rejected": -6.34375, "step": 752 }, { "epoch": 0.9239263803680982, "grad_norm": 35.77444345136624, "learning_rate": 5.593388429752066e-07, "logits/chosen": -0.048095703125, "logits/rejected": -0.1923828125, "logps/chosen": -402.0, "logps/rejected": -344.0, "loss": 0.2851, "rewards/accuracies": 0.859375, "rewards/chosen": 0.796875, "rewards/margins": 6.375, "rewards/rejected": -5.5625, "step": 753 }, { "epoch": 0.9251533742331288, "grad_norm": 39.56695959824003, "learning_rate": 5.590082644628099e-07, "logits/chosen": -0.1171875, "logits/rejected": -0.287109375, "logps/chosen": -386.0, "logps/rejected": -332.0, "loss": 0.3588, "rewards/accuracies": 0.828125, "rewards/chosen": 0.703125, "rewards/margins": 6.28125, "rewards/rejected": -5.59375, "step": 754 }, { "epoch": 0.9263803680981595, "grad_norm": 33.47777157003214, "learning_rate": 5.586776859504132e-07, "logits/chosen": -0.162109375, "logits/rejected": -0.2890625, "logps/chosen": -376.0, "logps/rejected": -348.0, "loss": 0.2421, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.890625, "rewards/margins": 6.59375, "rewards/rejected": -5.6875, "step": 755 }, { "epoch": 0.9276073619631902, "grad_norm": 30.73963254337421, "learning_rate": 5.583471074380165e-07, "logits/chosen": -0.0732421875, "logits/rejected": -0.1669921875, "logps/chosen": -332.0, "logps/rejected": -308.0, "loss": 0.248, "rewards/accuracies": 0.8828125, "rewards/chosen": 0.322265625, "rewards/margins": 6.0625, "rewards/rejected": -5.75, "step": 756 }, { "epoch": 0.9288343558282208, "grad_norm": 25.863947966401952, "learning_rate": 5.580165289256198e-07, "logits/chosen": -0.0252685546875, "logits/rejected": -0.251953125, "logps/chosen": -396.0, "logps/rejected": -326.0, "loss": 0.2117, "rewards/accuracies": 0.890625, "rewards/chosen": 1.640625, "rewards/margins": 7.03125, "rewards/rejected": -5.375, "step": 757 }, { "epoch": 0.9300613496932515, "grad_norm": 40.231833773135115, "learning_rate": 5.576859504132232e-07, "logits/chosen": -0.08837890625, "logits/rejected": -0.259765625, "logps/chosen": -366.0, "logps/rejected": -304.0, "loss": 0.3497, "rewards/accuracies": 0.8125, "rewards/chosen": 0.46875, "rewards/margins": 6.0625, "rewards/rejected": -5.59375, "step": 758 }, { "epoch": 0.9312883435582822, "grad_norm": 34.14796678847348, "learning_rate": 5.573553719008265e-07, "logits/chosen": -0.0595703125, "logits/rejected": -0.291015625, "logps/chosen": -386.0, "logps/rejected": -326.0, "loss": 0.2511, "rewards/accuracies": 0.875, "rewards/chosen": 1.1875, "rewards/margins": 6.53125, "rewards/rejected": -5.34375, "step": 759 }, { "epoch": 0.9325153374233128, "grad_norm": 29.867916639384045, "learning_rate": 5.570247933884297e-07, "logits/chosen": -0.2353515625, "logits/rejected": -0.498046875, "logps/chosen": -432.0, "logps/rejected": -348.0, "loss": 0.2724, "rewards/accuracies": 0.8671875, "rewards/chosen": 2.109375, "rewards/margins": 7.8125, "rewards/rejected": -5.71875, "step": 760 }, { "epoch": 0.9337423312883436, "grad_norm": 38.414301746929866, "learning_rate": 5.56694214876033e-07, "logits/chosen": -0.0264892578125, "logits/rejected": -0.1669921875, "logps/chosen": -372.0, "logps/rejected": -340.0, "loss": 0.2874, "rewards/accuracies": 0.8671875, "rewards/chosen": 1.375, "rewards/margins": 6.78125, "rewards/rejected": -5.375, "step": 761 }, { "epoch": 0.9349693251533743, "grad_norm": 40.447076836962, "learning_rate": 5.563636363636363e-07, "logits/chosen": -0.01397705078125, "logits/rejected": -0.19921875, "logps/chosen": -420.0, "logps/rejected": -348.0, "loss": 0.2888, "rewards/accuracies": 0.890625, "rewards/chosen": 1.109375, "rewards/margins": 6.78125, "rewards/rejected": -5.6875, "step": 762 }, { "epoch": 0.9361963190184049, "grad_norm": 31.879754151772115, "learning_rate": 5.560330578512396e-07, "logits/chosen": -0.07373046875, "logits/rejected": -0.171875, "logps/chosen": -390.0, "logps/rejected": -346.0, "loss": 0.2711, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.5, "rewards/margins": 6.9375, "rewards/rejected": -5.4375, "step": 763 }, { "epoch": 0.9374233128834356, "grad_norm": 35.145542304507835, "learning_rate": 5.55702479338843e-07, "logits/chosen": -0.28515625, "logits/rejected": -0.447265625, "logps/chosen": -322.0, "logps/rejected": -302.0, "loss": 0.2896, "rewards/accuracies": 0.875, "rewards/chosen": 0.26171875, "rewards/margins": 6.28125, "rewards/rejected": -6.0, "step": 764 }, { "epoch": 0.9386503067484663, "grad_norm": 40.67019743057879, "learning_rate": 5.553719008264463e-07, "logits/chosen": -0.0595703125, "logits/rejected": -0.19140625, "logps/chosen": -394.0, "logps/rejected": -306.0, "loss": 0.3457, "rewards/accuracies": 0.8125, "rewards/chosen": 0.76171875, "rewards/margins": 5.71875, "rewards/rejected": -4.96875, "step": 765 }, { "epoch": 0.939877300613497, "grad_norm": 32.24931969694431, "learning_rate": 5.550413223140496e-07, "logits/chosen": -0.11767578125, "logits/rejected": -0.3203125, "logps/chosen": -436.0, "logps/rejected": -326.0, "loss": 0.274, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.375, "rewards/margins": 6.9375, "rewards/rejected": -5.5625, "step": 766 }, { "epoch": 0.9411042944785276, "grad_norm": 34.46831261260643, "learning_rate": 5.547107438016529e-07, "logits/chosen": -0.134765625, "logits/rejected": -0.28515625, "logps/chosen": -378.0, "logps/rejected": -324.0, "loss": 0.3035, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.953125, "rewards/margins": 6.90625, "rewards/rejected": -5.9375, "step": 767 }, { "epoch": 0.9423312883435583, "grad_norm": 36.15353177119284, "learning_rate": 5.543801652892561e-07, "logits/chosen": -0.150390625, "logits/rejected": -0.33203125, "logps/chosen": -402.0, "logps/rejected": -372.0, "loss": 0.316, "rewards/accuracies": 0.859375, "rewards/chosen": 1.359375, "rewards/margins": 7.125, "rewards/rejected": -5.75, "step": 768 }, { "epoch": 0.943558282208589, "grad_norm": 29.41748843520645, "learning_rate": 5.540495867768594e-07, "logits/chosen": -0.1611328125, "logits/rejected": -0.30859375, "logps/chosen": -372.0, "logps/rejected": -332.0, "loss": 0.2432, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.6328125, "rewards/margins": 7.03125, "rewards/rejected": -6.375, "step": 769 }, { "epoch": 0.9447852760736196, "grad_norm": 41.73128837710126, "learning_rate": 5.537190082644628e-07, "logits/chosen": -0.1748046875, "logits/rejected": -0.42578125, "logps/chosen": -408.0, "logps/rejected": -360.0, "loss": 0.3004, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.6171875, "rewards/margins": 7.09375, "rewards/rejected": -5.46875, "step": 770 }, { "epoch": 0.9460122699386503, "grad_norm": 42.981692808778455, "learning_rate": 5.533884297520661e-07, "logits/chosen": -0.1689453125, "logits/rejected": -0.201171875, "logps/chosen": -422.0, "logps/rejected": -346.0, "loss": 0.429, "rewards/accuracies": 0.7734375, "rewards/chosen": 0.0869140625, "rewards/margins": 5.65625, "rewards/rejected": -5.5625, "step": 771 }, { "epoch": 0.947239263803681, "grad_norm": 35.00554577923317, "learning_rate": 5.530578512396694e-07, "logits/chosen": -0.038330078125, "logits/rejected": -0.259765625, "logps/chosen": -416.0, "logps/rejected": -350.0, "loss": 0.3114, "rewards/accuracies": 0.8515625, "rewards/chosen": 1.1640625, "rewards/margins": 6.84375, "rewards/rejected": -5.6875, "step": 772 }, { "epoch": 0.9484662576687116, "grad_norm": 36.88335000648106, "learning_rate": 5.527272727272727e-07, "logits/chosen": -0.0361328125, "logits/rejected": -0.2255859375, "logps/chosen": -366.0, "logps/rejected": -310.0, "loss": 0.3175, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1513671875, "rewards/margins": 5.9375, "rewards/rejected": -5.78125, "step": 773 }, { "epoch": 0.9496932515337423, "grad_norm": 38.52772066032803, "learning_rate": 5.52396694214876e-07, "logits/chosen": -0.058837890625, "logits/rejected": -0.2001953125, "logps/chosen": -352.0, "logps/rejected": -310.0, "loss": 0.3665, "rewards/accuracies": 0.8203125, "rewards/chosen": -0.330078125, "rewards/margins": 4.75, "rewards/rejected": -5.0625, "step": 774 }, { "epoch": 0.950920245398773, "grad_norm": 38.30272199053397, "learning_rate": 5.520661157024793e-07, "logits/chosen": 0.0306396484375, "logits/rejected": -0.162109375, "logps/chosen": -406.0, "logps/rejected": -348.0, "loss": 0.3245, "rewards/accuracies": 0.859375, "rewards/chosen": 0.79296875, "rewards/margins": 5.8125, "rewards/rejected": -5.03125, "step": 775 }, { "epoch": 0.9521472392638037, "grad_norm": 33.16873912890908, "learning_rate": 5.517355371900827e-07, "logits/chosen": -0.173828125, "logits/rejected": -0.35546875, "logps/chosen": -404.0, "logps/rejected": -352.0, "loss": 0.3113, "rewards/accuracies": 0.828125, "rewards/chosen": 1.1171875, "rewards/margins": 6.5, "rewards/rejected": -5.375, "step": 776 }, { "epoch": 0.9533742331288344, "grad_norm": 35.432794054015964, "learning_rate": 5.514049586776859e-07, "logits/chosen": -0.142578125, "logits/rejected": -0.2890625, "logps/chosen": -396.0, "logps/rejected": -330.0, "loss": 0.3098, "rewards/accuracies": 0.8203125, "rewards/chosen": 0.5625, "rewards/margins": 6.375, "rewards/rejected": -5.8125, "step": 777 }, { "epoch": 0.9546012269938651, "grad_norm": 35.189286152943, "learning_rate": 5.510743801652892e-07, "logits/chosen": -0.1083984375, "logits/rejected": -0.318359375, "logps/chosen": -388.0, "logps/rejected": -314.0, "loss": 0.251, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.443359375, "rewards/margins": 5.78125, "rewards/rejected": -5.34375, "step": 778 }, { "epoch": 0.9558282208588957, "grad_norm": 41.96194349470727, "learning_rate": 5.507438016528925e-07, "logits/chosen": -0.1640625, "logits/rejected": -0.34375, "logps/chosen": -434.0, "logps/rejected": -348.0, "loss": 0.2827, "rewards/accuracies": 0.8203125, "rewards/chosen": 1.0234375, "rewards/margins": 7.0, "rewards/rejected": -5.96875, "step": 779 }, { "epoch": 0.9570552147239264, "grad_norm": 35.73940962793884, "learning_rate": 5.504132231404958e-07, "logits/chosen": -0.059326171875, "logits/rejected": -0.2353515625, "logps/chosen": -374.0, "logps/rejected": -346.0, "loss": 0.3415, "rewards/accuracies": 0.828125, "rewards/chosen": 0.2138671875, "rewards/margins": 5.65625, "rewards/rejected": -5.4375, "step": 780 }, { "epoch": 0.9582822085889571, "grad_norm": 26.50283260922046, "learning_rate": 5.500826446280991e-07, "logits/chosen": -0.173828125, "logits/rejected": -0.408203125, "logps/chosen": -418.0, "logps/rejected": -342.0, "loss": 0.1906, "rewards/accuracies": 0.890625, "rewards/chosen": 1.609375, "rewards/margins": 8.0625, "rewards/rejected": -6.4375, "step": 781 }, { "epoch": 0.9595092024539877, "grad_norm": 29.07388144480791, "learning_rate": 5.497520661157025e-07, "logits/chosen": -0.1376953125, "logits/rejected": -0.2490234375, "logps/chosen": -360.0, "logps/rejected": -338.0, "loss": 0.2204, "rewards/accuracies": 0.890625, "rewards/chosen": 0.875, "rewards/margins": 6.4375, "rewards/rejected": -5.5625, "step": 782 }, { "epoch": 0.9607361963190184, "grad_norm": 36.281519570454215, "learning_rate": 5.494214876033058e-07, "logits/chosen": -0.1552734375, "logits/rejected": -0.3046875, "logps/chosen": -412.0, "logps/rejected": -356.0, "loss": 0.2544, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.25, "rewards/margins": 7.34375, "rewards/rejected": -6.09375, "step": 783 }, { "epoch": 0.9619631901840491, "grad_norm": 41.7797714543972, "learning_rate": 5.490909090909091e-07, "logits/chosen": -0.11181640625, "logits/rejected": -0.162109375, "logps/chosen": -378.0, "logps/rejected": -340.0, "loss": 0.3585, "rewards/accuracies": 0.8359375, "rewards/chosen": 0.1767578125, "rewards/margins": 5.8125, "rewards/rejected": -5.625, "step": 784 }, { "epoch": 0.9631901840490797, "grad_norm": 31.81554374340158, "learning_rate": 5.487603305785124e-07, "logits/chosen": -0.0751953125, "logits/rejected": -0.24609375, "logps/chosen": -374.0, "logps/rejected": -308.0, "loss": 0.2472, "rewards/accuracies": 0.859375, "rewards/chosen": 0.88671875, "rewards/margins": 6.71875, "rewards/rejected": -5.8125, "step": 785 }, { "epoch": 0.9644171779141104, "grad_norm": 27.670018917456815, "learning_rate": 5.484297520661156e-07, "logits/chosen": -0.0732421875, "logits/rejected": -0.28515625, "logps/chosen": -364.0, "logps/rejected": -318.0, "loss": 0.2222, "rewards/accuracies": 0.921875, "rewards/chosen": 0.4921875, "rewards/margins": 6.71875, "rewards/rejected": -6.25, "step": 786 }, { "epoch": 0.9656441717791411, "grad_norm": 37.16124889650476, "learning_rate": 5.480991735537189e-07, "logits/chosen": -0.15234375, "logits/rejected": -0.2890625, "logps/chosen": -404.0, "logps/rejected": -334.0, "loss": 0.2838, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.69140625, "rewards/margins": 7.125, "rewards/rejected": -6.4375, "step": 787 }, { "epoch": 0.9668711656441717, "grad_norm": 24.391962735004444, "learning_rate": 5.477685950413223e-07, "logits/chosen": -0.1708984375, "logits/rejected": -0.3515625, "logps/chosen": -382.0, "logps/rejected": -352.0, "loss": 0.1706, "rewards/accuracies": 0.9296875, "rewards/chosen": 1.2734375, "rewards/margins": 7.53125, "rewards/rejected": -6.25, "step": 788 }, { "epoch": 0.9680981595092024, "grad_norm": 32.024862187416, "learning_rate": 5.474380165289256e-07, "logits/chosen": -0.07958984375, "logits/rejected": -0.265625, "logps/chosen": -374.0, "logps/rejected": -316.0, "loss": 0.2843, "rewards/accuracies": 0.8671875, "rewards/chosen": 0.408203125, "rewards/margins": 6.1875, "rewards/rejected": -5.78125, "step": 789 }, { "epoch": 0.9693251533742331, "grad_norm": 27.51754897072937, "learning_rate": 5.471074380165289e-07, "logits/chosen": -0.2041015625, "logits/rejected": -0.423828125, "logps/chosen": -380.0, "logps/rejected": -316.0, "loss": 0.1866, "rewards/accuracies": 0.90625, "rewards/chosen": 0.70703125, "rewards/margins": 6.71875, "rewards/rejected": -6.03125, "step": 790 }, { "epoch": 0.9705521472392638, "grad_norm": 37.440979455018265, "learning_rate": 5.467768595041322e-07, "logits/chosen": -0.1796875, "logits/rejected": -0.392578125, "logps/chosen": -390.0, "logps/rejected": -330.0, "loss": 0.2983, "rewards/accuracies": 0.84375, "rewards/chosen": 1.1875, "rewards/margins": 7.59375, "rewards/rejected": -6.375, "step": 791 }, { "epoch": 0.9717791411042945, "grad_norm": 36.704827910830204, "learning_rate": 5.464462809917355e-07, "logits/chosen": -0.1728515625, "logits/rejected": -0.32421875, "logps/chosen": -430.0, "logps/rejected": -360.0, "loss": 0.3431, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.2265625, "rewards/margins": 6.25, "rewards/rejected": -5.03125, "step": 792 }, { "epoch": 0.9730061349693252, "grad_norm": 37.60757704339766, "learning_rate": 5.461157024793389e-07, "logits/chosen": -0.15234375, "logits/rejected": -0.294921875, "logps/chosen": -384.0, "logps/rejected": -346.0, "loss": 0.3237, "rewards/accuracies": 0.84375, "rewards/chosen": 0.79296875, "rewards/margins": 6.21875, "rewards/rejected": -5.4375, "step": 793 }, { "epoch": 0.9742331288343559, "grad_norm": 37.59792190871499, "learning_rate": 5.457851239669422e-07, "logits/chosen": -0.103515625, "logits/rejected": -0.2431640625, "logps/chosen": -350.0, "logps/rejected": -322.0, "loss": 0.3909, "rewards/accuracies": 0.828125, "rewards/chosen": 0.21875, "rewards/margins": 6.0, "rewards/rejected": -5.78125, "step": 794 }, { "epoch": 0.9754601226993865, "grad_norm": 28.85691430451381, "learning_rate": 5.454545454545454e-07, "logits/chosen": -0.291015625, "logits/rejected": -0.466796875, "logps/chosen": -384.0, "logps/rejected": -356.0, "loss": 0.2394, "rewards/accuracies": 0.875, "rewards/chosen": 1.59375, "rewards/margins": 8.5, "rewards/rejected": -6.90625, "step": 795 }, { "epoch": 0.9766871165644172, "grad_norm": 41.11938718622486, "learning_rate": 5.451239669421487e-07, "logits/chosen": -0.189453125, "logits/rejected": -0.400390625, "logps/chosen": -402.0, "logps/rejected": -322.0, "loss": 0.2984, "rewards/accuracies": 0.8828125, "rewards/chosen": -0.0673828125, "rewards/margins": 6.3125, "rewards/rejected": -6.375, "step": 796 }, { "epoch": 0.9779141104294479, "grad_norm": 30.942308293626358, "learning_rate": 5.44793388429752e-07, "logits/chosen": -0.1171875, "logits/rejected": -0.30078125, "logps/chosen": -396.0, "logps/rejected": -308.0, "loss": 0.254, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.6953125, "rewards/margins": 6.3125, "rewards/rejected": -5.625, "step": 797 }, { "epoch": 0.9791411042944785, "grad_norm": 36.786308023977305, "learning_rate": 5.444628099173553e-07, "logits/chosen": -0.154296875, "logits/rejected": -0.33984375, "logps/chosen": -424.0, "logps/rejected": -362.0, "loss": 0.2823, "rewards/accuracies": 0.828125, "rewards/chosen": 0.76953125, "rewards/margins": 6.875, "rewards/rejected": -6.125, "step": 798 }, { "epoch": 0.9803680981595092, "grad_norm": 40.89607573095922, "learning_rate": 5.441322314049587e-07, "logits/chosen": -0.1953125, "logits/rejected": -0.369140625, "logps/chosen": -392.0, "logps/rejected": -346.0, "loss": 0.3222, "rewards/accuracies": 0.828125, "rewards/chosen": 1.109375, "rewards/margins": 6.875, "rewards/rejected": -5.78125, "step": 799 }, { "epoch": 0.9815950920245399, "grad_norm": 36.10519822526459, "learning_rate": 5.43801652892562e-07, "logits/chosen": -0.173828125, "logits/rejected": -0.373046875, "logps/chosen": -378.0, "logps/rejected": -330.0, "loss": 0.2658, "rewards/accuracies": 0.875, "rewards/chosen": 0.61328125, "rewards/margins": 6.625, "rewards/rejected": -6.0, "step": 800 }, { "epoch": 0.9828220858895705, "grad_norm": 42.48783397210697, "learning_rate": 5.434710743801653e-07, "logits/chosen": -0.17578125, "logits/rejected": -0.3359375, "logps/chosen": -428.0, "logps/rejected": -366.0, "loss": 0.3944, "rewards/accuracies": 0.8125, "rewards/chosen": 0.765625, "rewards/margins": 5.9375, "rewards/rejected": -5.1875, "step": 801 }, { "epoch": 0.9840490797546012, "grad_norm": 43.552763355211724, "learning_rate": 5.431404958677686e-07, "logits/chosen": -0.2255859375, "logits/rejected": -0.373046875, "logps/chosen": -380.0, "logps/rejected": -336.0, "loss": 0.3899, "rewards/accuracies": 0.8046875, "rewards/chosen": 0.453125, "rewards/margins": 6.3125, "rewards/rejected": -5.84375, "step": 802 }, { "epoch": 0.9852760736196319, "grad_norm": 32.09849729457811, "learning_rate": 5.428099173553719e-07, "logits/chosen": -0.287109375, "logits/rejected": -0.45703125, "logps/chosen": -392.0, "logps/rejected": -334.0, "loss": 0.2997, "rewards/accuracies": 0.859375, "rewards/chosen": 1.1328125, "rewards/margins": 6.90625, "rewards/rejected": -5.78125, "step": 803 }, { "epoch": 0.9865030674846625, "grad_norm": 32.33615160143916, "learning_rate": 5.424793388429751e-07, "logits/chosen": -0.11962890625, "logits/rejected": -0.240234375, "logps/chosen": -352.0, "logps/rejected": -328.0, "loss": 0.3208, "rewards/accuracies": 0.8515625, "rewards/chosen": 0.251953125, "rewards/margins": 5.90625, "rewards/rejected": -5.65625, "step": 804 }, { "epoch": 0.9877300613496932, "grad_norm": 39.61512778302868, "learning_rate": 5.421487603305785e-07, "logits/chosen": -0.224609375, "logits/rejected": -0.37109375, "logps/chosen": -428.0, "logps/rejected": -380.0, "loss": 0.3968, "rewards/accuracies": 0.8359375, "rewards/chosen": 1.0234375, "rewards/margins": 6.96875, "rewards/rejected": -5.96875, "step": 805 }, { "epoch": 0.9889570552147239, "grad_norm": 40.74080836640833, "learning_rate": 5.418181818181818e-07, "logits/chosen": -0.01202392578125, "logits/rejected": -0.1474609375, "logps/chosen": -408.0, "logps/rejected": -368.0, "loss": 0.3811, "rewards/accuracies": 0.7890625, "rewards/chosen": 0.8046875, "rewards/margins": 6.15625, "rewards/rejected": -5.34375, "step": 806 }, { "epoch": 0.9901840490797545, "grad_norm": 36.652039792723684, "learning_rate": 5.414876033057851e-07, "logits/chosen": -0.1005859375, "logits/rejected": -0.26171875, "logps/chosen": -394.0, "logps/rejected": -334.0, "loss": 0.2327, "rewards/accuracies": 0.8828125, "rewards/chosen": 1.078125, "rewards/margins": 7.21875, "rewards/rejected": -6.125, "step": 807 }, { "epoch": 0.9914110429447853, "grad_norm": 33.57961890786831, "learning_rate": 5.411570247933884e-07, "logits/chosen": -0.2353515625, "logits/rejected": -0.2578125, "logps/chosen": -358.0, "logps/rejected": -336.0, "loss": 0.3091, "rewards/accuracies": 0.859375, "rewards/chosen": 0.11572265625, "rewards/margins": 6.65625, "rewards/rejected": -6.53125, "step": 808 }, { "epoch": 0.992638036809816, "grad_norm": 35.60132202210017, "learning_rate": 5.408264462809917e-07, "logits/chosen": -0.1533203125, "logits/rejected": -0.3828125, "logps/chosen": -430.0, "logps/rejected": -344.0, "loss": 0.2618, "rewards/accuracies": 0.828125, "rewards/chosen": 1.609375, "rewards/margins": 7.875, "rewards/rejected": -6.28125, "step": 809 }, { "epoch": 0.9938650306748467, "grad_norm": 33.977380429457895, "learning_rate": 5.40495867768595e-07, "logits/chosen": -0.251953125, "logits/rejected": -0.4375, "logps/chosen": -438.0, "logps/rejected": -368.0, "loss": 0.227, "rewards/accuracies": 0.859375, "rewards/chosen": 1.21875, "rewards/margins": 7.28125, "rewards/rejected": -6.0625, "step": 810 }, { "epoch": 0.9950920245398773, "grad_norm": 31.635546850530186, "learning_rate": 5.401652892561984e-07, "logits/chosen": -0.234375, "logits/rejected": -0.38671875, "logps/chosen": -386.0, "logps/rejected": -366.0, "loss": 0.2741, "rewards/accuracies": 0.859375, "rewards/chosen": 1.0703125, "rewards/margins": 6.78125, "rewards/rejected": -5.71875, "step": 811 }, { "epoch": 0.996319018404908, "grad_norm": 40.80563506539147, "learning_rate": 5.398347107438017e-07, "logits/chosen": -0.2119140625, "logits/rejected": -0.294921875, "logps/chosen": -358.0, "logps/rejected": -328.0, "loss": 0.2687, "rewards/accuracies": 0.9140625, "rewards/chosen": 0.4609375, "rewards/margins": 7.0, "rewards/rejected": -6.53125, "step": 812 }, { "epoch": 0.9975460122699387, "grad_norm": 30.19996782105712, "learning_rate": 5.395041322314049e-07, "logits/chosen": -0.1337890625, "logits/rejected": -0.279296875, "logps/chosen": -338.0, "logps/rejected": -324.0, "loss": 0.1913, "rewards/accuracies": 0.8984375, "rewards/chosen": 0.87109375, "rewards/margins": 7.0625, "rewards/rejected": -6.1875, "step": 813 }, { "epoch": 0.9987730061349693, "grad_norm": 37.73036986625575, "learning_rate": 5.391735537190082e-07, "logits/chosen": -0.11767578125, "logits/rejected": -0.201171875, "logps/chosen": -380.0, "logps/rejected": -358.0, "loss": 0.3425, "rewards/accuracies": 0.8359375, "rewards/chosen": -0.1416015625, "rewards/margins": 5.5, "rewards/rejected": -5.65625, "step": 814 }, { "epoch": 1.0, "grad_norm": 40.870567834511405, "learning_rate": 5.388429752066115e-07, "logits/chosen": -0.0458984375, "logits/rejected": -0.23828125, "logps/chosen": -380.0, "logps/rejected": -350.0, "loss": 0.2125, "rewards/accuracies": 0.8571429252624512, "rewards/chosen": 0.59375, "rewards/margins": 6.875, "rewards/rejected": -6.28125, "step": 815 } ], "logging_steps": 1, "max_steps": 2445, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }