Files
ModelHub XC 3b1dbd380c 初始化项目,由ModelHub XC社区提供模型
Model: CriteriaPO/qwen2.5-3b-dpo-finegrained
Source: Original Platform
2026-08-12 18:09:31 +08:00

7565 lines
224 KiB
JSON

{
"best_metric": 0.22352416813373566,
"best_model_checkpoint": "models/qwen2.5-3b-dpo-finegrained/checkpoint-5000",
"epoch": 0.36093264996751606,
"eval_steps": 5000,
"global_step": 5000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 7.218652999350322e-05,
"grad_norm": 1.852354340577762,
"learning_rate": 3.6075036075036073e-10,
"logits/chosen": -2.59375,
"logits/rejected": -1.6015625,
"logps/chosen": -146.0,
"logps/rejected": -166.0,
"loss": 0.6914,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1
},
{
"epoch": 0.0007218652999350321,
"grad_norm": 1.998199384338708,
"learning_rate": 3.6075036075036073e-09,
"logits/chosen": -2.265625,
"logits/rejected": -1.953125,
"logps/chosen": -157.0,
"logps/rejected": -143.0,
"loss": 0.6922,
"rewards/accuracies": 0.2638888955116272,
"rewards/chosen": 0.000766754150390625,
"rewards/margins": 0.000606536865234375,
"rewards/rejected": 0.000156402587890625,
"step": 10
},
{
"epoch": 0.0014437305998700643,
"grad_norm": 1.859902408963682,
"learning_rate": 7.215007215007215e-09,
"logits/chosen": -2.34375,
"logits/rejected": -1.984375,
"logps/chosen": -157.0,
"logps/rejected": -139.0,
"loss": 0.6927,
"rewards/accuracies": 0.36250001192092896,
"rewards/chosen": 0.001129150390625,
"rewards/margins": 0.00061798095703125,
"rewards/rejected": 0.000507354736328125,
"step": 20
},
{
"epoch": 0.0021655958998050965,
"grad_norm": 1.800945636929482,
"learning_rate": 1.0822510822510822e-08,
"logits/chosen": -2.390625,
"logits/rejected": -2.015625,
"logps/chosen": -146.0,
"logps/rejected": -148.0,
"loss": 0.6923,
"rewards/accuracies": 0.3375000059604645,
"rewards/chosen": 0.000640869140625,
"rewards/margins": -0.0003757476806640625,
"rewards/rejected": 0.00101470947265625,
"step": 30
},
{
"epoch": 0.0028874611997401285,
"grad_norm": 1.9512697515276394,
"learning_rate": 1.443001443001443e-08,
"logits/chosen": -2.421875,
"logits/rejected": -2.0,
"logps/chosen": -165.0,
"logps/rejected": -161.0,
"loss": 0.6927,
"rewards/accuracies": 0.2874999940395355,
"rewards/chosen": 0.00010967254638671875,
"rewards/margins": 0.0003910064697265625,
"rewards/rejected": -0.00028228759765625,
"step": 40
},
{
"epoch": 0.0036093264996751606,
"grad_norm": 1.9685077450218404,
"learning_rate": 1.8037518037518035e-08,
"logits/chosen": -2.21875,
"logits/rejected": -2.015625,
"logps/chosen": -165.0,
"logps/rejected": -143.0,
"loss": 0.6929,
"rewards/accuracies": 0.3187499940395355,
"rewards/chosen": 9.441375732421875e-05,
"rewards/margins": 0.0001239776611328125,
"rewards/rejected": -3.0159950256347656e-05,
"step": 50
},
{
"epoch": 0.004331191799610193,
"grad_norm": 1.9944209672205195,
"learning_rate": 2.1645021645021644e-08,
"logits/chosen": -2.34375,
"logits/rejected": -1.984375,
"logps/chosen": -160.0,
"logps/rejected": -136.0,
"loss": 0.6926,
"rewards/accuracies": 0.3812499940395355,
"rewards/chosen": -0.000232696533203125,
"rewards/margins": 0.00102996826171875,
"rewards/rejected": -0.0012664794921875,
"step": 60
},
{
"epoch": 0.005053057099545225,
"grad_norm": 1.8602055997261977,
"learning_rate": 2.525252525252525e-08,
"logits/chosen": -2.40625,
"logits/rejected": -1.8984375,
"logps/chosen": -150.0,
"logps/rejected": -154.0,
"loss": 0.6926,
"rewards/accuracies": 0.3375000059604645,
"rewards/chosen": 0.000438690185546875,
"rewards/margins": 0.00054931640625,
"rewards/rejected": -0.00010919570922851562,
"step": 70
},
{
"epoch": 0.005774922399480257,
"grad_norm": 1.7129972696287459,
"learning_rate": 2.886002886002886e-08,
"logits/chosen": -2.359375,
"logits/rejected": -2.046875,
"logps/chosen": -170.0,
"logps/rejected": -145.0,
"loss": 0.6928,
"rewards/accuracies": 0.39375001192092896,
"rewards/chosen": 0.000579833984375,
"rewards/margins": 0.0004520416259765625,
"rewards/rejected": 0.0001239776611328125,
"step": 80
},
{
"epoch": 0.006496787699415289,
"grad_norm": 1.8246478253492482,
"learning_rate": 3.246753246753246e-08,
"logits/chosen": -2.484375,
"logits/rejected": -2.0625,
"logps/chosen": -178.0,
"logps/rejected": -158.0,
"loss": 0.6925,
"rewards/accuracies": 0.3499999940395355,
"rewards/chosen": 0.000469207763671875,
"rewards/margins": 0.0001888275146484375,
"rewards/rejected": 0.0002803802490234375,
"step": 90
},
{
"epoch": 0.007218652999350321,
"grad_norm": 1.7657315202986226,
"learning_rate": 3.607503607503607e-08,
"logits/chosen": -2.390625,
"logits/rejected": -1.984375,
"logps/chosen": -172.0,
"logps/rejected": -163.0,
"loss": 0.6927,
"rewards/accuracies": 0.3062500059604645,
"rewards/chosen": 0.000797271728515625,
"rewards/margins": -0.0003910064697265625,
"rewards/rejected": 0.001190185546875,
"step": 100
},
{
"epoch": 0.007940518299285354,
"grad_norm": 2.0123631368082844,
"learning_rate": 3.968253968253968e-08,
"logits/chosen": -2.453125,
"logits/rejected": -1.9296875,
"logps/chosen": -153.0,
"logps/rejected": -140.0,
"loss": 0.6926,
"rewards/accuracies": 0.35624998807907104,
"rewards/chosen": 0.000186920166015625,
"rewards/margins": 0.00018787384033203125,
"rewards/rejected": 1.1473894119262695e-06,
"step": 110
},
{
"epoch": 0.008662383599220386,
"grad_norm": 1.9667654175700489,
"learning_rate": 4.329004329004329e-08,
"logits/chosen": -2.40625,
"logits/rejected": -2.0,
"logps/chosen": -146.0,
"logps/rejected": -137.0,
"loss": 0.6926,
"rewards/accuracies": 0.33125001192092896,
"rewards/chosen": 0.00154876708984375,
"rewards/margins": -0.00103759765625,
"rewards/rejected": 0.0025787353515625,
"step": 120
},
{
"epoch": 0.009384248899155418,
"grad_norm": 1.7516436962452608,
"learning_rate": 4.68975468975469e-08,
"logits/chosen": -2.5625,
"logits/rejected": -2.1875,
"logps/chosen": -152.0,
"logps/rejected": -151.0,
"loss": 0.6925,
"rewards/accuracies": 0.4312500059604645,
"rewards/chosen": 0.0027313232421875,
"rewards/margins": 0.00164031982421875,
"rewards/rejected": 0.0010986328125,
"step": 130
},
{
"epoch": 0.01010611419909045,
"grad_norm": 2.0629971445302435,
"learning_rate": 5.05050505050505e-08,
"logits/chosen": -2.34375,
"logits/rejected": -2.046875,
"logps/chosen": -167.0,
"logps/rejected": -152.0,
"loss": 0.6921,
"rewards/accuracies": 0.39375001192092896,
"rewards/chosen": 0.0018768310546875,
"rewards/margins": 0.000438690185546875,
"rewards/rejected": 0.00144195556640625,
"step": 140
},
{
"epoch": 0.010827979499025482,
"grad_norm": 2.0455409873804205,
"learning_rate": 5.411255411255411e-08,
"logits/chosen": -2.375,
"logits/rejected": -2.09375,
"logps/chosen": -165.0,
"logps/rejected": -147.0,
"loss": 0.6923,
"rewards/accuracies": 0.40625,
"rewards/chosen": 0.001739501953125,
"rewards/margins": 5.435943603515625e-05,
"rewards/rejected": 0.001678466796875,
"step": 150
},
{
"epoch": 0.011549844798960514,
"grad_norm": 2.003008491192784,
"learning_rate": 5.772005772005772e-08,
"logits/chosen": -2.359375,
"logits/rejected": -1.8359375,
"logps/chosen": -166.0,
"logps/rejected": -161.0,
"loss": 0.6919,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.0026702880859375,
"rewards/margins": 0.00093841552734375,
"rewards/rejected": 0.00173187255859375,
"step": 160
},
{
"epoch": 0.012271710098895546,
"grad_norm": 1.8970983946398985,
"learning_rate": 6.132756132756133e-08,
"logits/chosen": -2.34375,
"logits/rejected": -1.9921875,
"logps/chosen": -163.0,
"logps/rejected": -142.0,
"loss": 0.6915,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.00445556640625,
"rewards/margins": 0.00396728515625,
"rewards/rejected": 0.0004787445068359375,
"step": 170
},
{
"epoch": 0.012993575398830578,
"grad_norm": 1.9000812663628288,
"learning_rate": 6.493506493506492e-08,
"logits/chosen": -2.390625,
"logits/rejected": -1.9140625,
"logps/chosen": -184.0,
"logps/rejected": -166.0,
"loss": 0.6913,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.004791259765625,
"rewards/margins": 0.00274658203125,
"rewards/rejected": 0.0020294189453125,
"step": 180
},
{
"epoch": 0.01371544069876561,
"grad_norm": 1.7694192875136483,
"learning_rate": 6.854256854256854e-08,
"logits/chosen": -2.375,
"logits/rejected": -2.015625,
"logps/chosen": -168.0,
"logps/rejected": -147.0,
"loss": 0.691,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.007598876953125,
"rewards/margins": 0.003387451171875,
"rewards/rejected": 0.00421142578125,
"step": 190
},
{
"epoch": 0.014437305998700642,
"grad_norm": 1.8022914272788901,
"learning_rate": 7.215007215007214e-08,
"logits/chosen": -2.296875,
"logits/rejected": -1.890625,
"logps/chosen": -150.0,
"logps/rejected": -137.0,
"loss": 0.6907,
"rewards/accuracies": 0.5562499761581421,
"rewards/chosen": 0.007354736328125,
"rewards/margins": 0.005584716796875,
"rewards/rejected": 0.0017547607421875,
"step": 200
},
{
"epoch": 0.015159171298635674,
"grad_norm": 1.7754509638333658,
"learning_rate": 7.575757575757576e-08,
"logits/chosen": -2.328125,
"logits/rejected": -2.0,
"logps/chosen": -155.0,
"logps/rejected": -151.0,
"loss": 0.6908,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.007537841796875,
"rewards/margins": 0.0034942626953125,
"rewards/rejected": 0.0040283203125,
"step": 210
},
{
"epoch": 0.015881036598570708,
"grad_norm": 1.8713087698233093,
"learning_rate": 7.936507936507936e-08,
"logits/chosen": -2.546875,
"logits/rejected": -1.8984375,
"logps/chosen": -156.0,
"logps/rejected": -168.0,
"loss": 0.6903,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.00860595703125,
"rewards/margins": 0.00469970703125,
"rewards/rejected": 0.00390625,
"step": 220
},
{
"epoch": 0.01660290189850574,
"grad_norm": 1.7352700913418746,
"learning_rate": 8.297258297258297e-08,
"logits/chosen": -2.359375,
"logits/rejected": -2.0,
"logps/chosen": -171.0,
"logps/rejected": -150.0,
"loss": 0.6897,
"rewards/accuracies": 0.606249988079071,
"rewards/chosen": 0.01153564453125,
"rewards/margins": 0.00640869140625,
"rewards/rejected": 0.005157470703125,
"step": 230
},
{
"epoch": 0.017324767198440772,
"grad_norm": 1.923679325098434,
"learning_rate": 8.658008658008658e-08,
"logits/chosen": -2.40625,
"logits/rejected": -2.171875,
"logps/chosen": -168.0,
"logps/rejected": -153.0,
"loss": 0.6889,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.01507568359375,
"rewards/margins": 0.00933837890625,
"rewards/rejected": 0.005706787109375,
"step": 240
},
{
"epoch": 0.018046632498375802,
"grad_norm": 1.9336109183415302,
"learning_rate": 9.018759018759018e-08,
"logits/chosen": -2.46875,
"logits/rejected": -2.140625,
"logps/chosen": -198.0,
"logps/rejected": -190.0,
"loss": 0.6883,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": 0.015625,
"rewards/margins": 0.01055908203125,
"rewards/rejected": 0.005035400390625,
"step": 250
},
{
"epoch": 0.018768497798310836,
"grad_norm": 1.7118991587292718,
"learning_rate": 9.37950937950938e-08,
"logits/chosen": -2.484375,
"logits/rejected": -1.9921875,
"logps/chosen": -148.0,
"logps/rejected": -164.0,
"loss": 0.6873,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.0172119140625,
"rewards/margins": 0.012451171875,
"rewards/rejected": 0.00469970703125,
"step": 260
},
{
"epoch": 0.019490363098245866,
"grad_norm": 2.0498889647791634,
"learning_rate": 9.74025974025974e-08,
"logits/chosen": -2.578125,
"logits/rejected": -2.125,
"logps/chosen": -168.0,
"logps/rejected": -150.0,
"loss": 0.6875,
"rewards/accuracies": 0.6187499761581421,
"rewards/chosen": 0.0159912109375,
"rewards/margins": 0.00982666015625,
"rewards/rejected": 0.006195068359375,
"step": 270
},
{
"epoch": 0.0202122283981809,
"grad_norm": 1.7948780770940682,
"learning_rate": 1.01010101010101e-07,
"logits/chosen": -2.5,
"logits/rejected": -1.9140625,
"logps/chosen": -162.0,
"logps/rejected": -170.0,
"loss": 0.6865,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": 0.018310546875,
"rewards/margins": 0.01513671875,
"rewards/rejected": 0.0032196044921875,
"step": 280
},
{
"epoch": 0.02093409369811593,
"grad_norm": 1.7485728753360685,
"learning_rate": 1.0461760461760462e-07,
"logits/chosen": -2.390625,
"logits/rejected": -2.09375,
"logps/chosen": -173.0,
"logps/rejected": -152.0,
"loss": 0.6865,
"rewards/accuracies": 0.5874999761581421,
"rewards/chosen": 0.0172119140625,
"rewards/margins": 0.0089111328125,
"rewards/rejected": 0.0084228515625,
"step": 290
},
{
"epoch": 0.021655958998050964,
"grad_norm": 1.7752446010354384,
"learning_rate": 1.0822510822510822e-07,
"logits/chosen": -2.453125,
"logits/rejected": -2.15625,
"logps/chosen": -162.0,
"logps/rejected": -165.0,
"loss": 0.6857,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": 0.0238037109375,
"rewards/margins": 0.015625,
"rewards/rejected": 0.00823974609375,
"step": 300
},
{
"epoch": 0.022377824297985995,
"grad_norm": 1.9527079542055057,
"learning_rate": 1.1183261183261184e-07,
"logits/chosen": -2.546875,
"logits/rejected": -2.078125,
"logps/chosen": -148.0,
"logps/rejected": -153.0,
"loss": 0.6845,
"rewards/accuracies": 0.737500011920929,
"rewards/chosen": 0.0203857421875,
"rewards/margins": 0.0184326171875,
"rewards/rejected": 0.00201416015625,
"step": 310
},
{
"epoch": 0.02309968959792103,
"grad_norm": 1.798683396295616,
"learning_rate": 1.1544011544011543e-07,
"logits/chosen": -2.453125,
"logits/rejected": -2.09375,
"logps/chosen": -163.0,
"logps/rejected": -141.0,
"loss": 0.6844,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": 0.02197265625,
"rewards/margins": 0.0184326171875,
"rewards/rejected": 0.003570556640625,
"step": 320
},
{
"epoch": 0.02382155489785606,
"grad_norm": 1.822086025310402,
"learning_rate": 1.1904761904761903e-07,
"logits/chosen": -2.453125,
"logits/rejected": -1.9765625,
"logps/chosen": -159.0,
"logps/rejected": -147.0,
"loss": 0.6816,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.02490234375,
"rewards/margins": 0.0225830078125,
"rewards/rejected": 0.002349853515625,
"step": 330
},
{
"epoch": 0.024543420197791092,
"grad_norm": 1.8205804931965275,
"learning_rate": 1.2265512265512265e-07,
"logits/chosen": -2.453125,
"logits/rejected": -2.125,
"logps/chosen": -163.0,
"logps/rejected": -168.0,
"loss": 0.6809,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": 0.0240478515625,
"rewards/margins": 0.02392578125,
"rewards/rejected": 4.839897155761719e-05,
"step": 340
},
{
"epoch": 0.025265285497726123,
"grad_norm": 2.015225469187424,
"learning_rate": 1.2626262626262626e-07,
"logits/chosen": -2.4375,
"logits/rejected": -2.1875,
"logps/chosen": -168.0,
"logps/rejected": -138.0,
"loss": 0.6787,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": 0.023193359375,
"rewards/margins": 0.02880859375,
"rewards/rejected": -0.005706787109375,
"step": 350
},
{
"epoch": 0.025987150797661156,
"grad_norm": 1.8960338628946363,
"learning_rate": 1.2987012987012984e-07,
"logits/chosen": -2.34375,
"logits/rejected": -2.0625,
"logps/chosen": -171.0,
"logps/rejected": -155.0,
"loss": 0.679,
"rewards/accuracies": 0.7437499761581421,
"rewards/chosen": 0.024169921875,
"rewards/margins": 0.029052734375,
"rewards/rejected": -0.004791259765625,
"step": 360
},
{
"epoch": 0.02670901609759619,
"grad_norm": 1.9289106441512014,
"learning_rate": 1.3347763347763348e-07,
"logits/chosen": -2.484375,
"logits/rejected": -2.125,
"logps/chosen": -143.0,
"logps/rejected": -147.0,
"loss": 0.6755,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.0277099609375,
"rewards/margins": 0.036376953125,
"rewards/rejected": -0.00848388671875,
"step": 370
},
{
"epoch": 0.02743088139753122,
"grad_norm": 2.4318763159683168,
"learning_rate": 1.370851370851371e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.078125,
"logps/chosen": -161.0,
"logps/rejected": -154.0,
"loss": 0.6738,
"rewards/accuracies": 0.768750011920929,
"rewards/chosen": 0.016845703125,
"rewards/margins": 0.0390625,
"rewards/rejected": -0.022216796875,
"step": 380
},
{
"epoch": 0.028152746697466254,
"grad_norm": 1.727518768188907,
"learning_rate": 1.406926406926407e-07,
"logits/chosen": -2.46875,
"logits/rejected": -2.125,
"logps/chosen": -151.0,
"logps/rejected": -145.0,
"loss": 0.6737,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": 0.0238037109375,
"rewards/margins": 0.04541015625,
"rewards/rejected": -0.0216064453125,
"step": 390
},
{
"epoch": 0.028874611997401285,
"grad_norm": 1.8565593414895172,
"learning_rate": 1.4430014430014428e-07,
"logits/chosen": -2.453125,
"logits/rejected": -2.046875,
"logps/chosen": -169.0,
"logps/rejected": -162.0,
"loss": 0.6703,
"rewards/accuracies": 0.762499988079071,
"rewards/chosen": 0.01324462890625,
"rewards/margins": 0.0458984375,
"rewards/rejected": -0.03271484375,
"step": 400
},
{
"epoch": 0.02959647729733632,
"grad_norm": 1.9588571879597823,
"learning_rate": 1.479076479076479e-07,
"logits/chosen": -2.46875,
"logits/rejected": -2.296875,
"logps/chosen": -152.0,
"logps/rejected": -137.0,
"loss": 0.6681,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": 0.006378173828125,
"rewards/margins": 0.052734375,
"rewards/rejected": -0.04638671875,
"step": 410
},
{
"epoch": 0.03031834259727135,
"grad_norm": 1.93069247030128,
"learning_rate": 1.5151515151515152e-07,
"logits/chosen": -2.515625,
"logits/rejected": -2.203125,
"logps/chosen": -172.0,
"logps/rejected": -144.0,
"loss": 0.6667,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0025787353515625,
"rewards/margins": 0.044189453125,
"rewards/rejected": -0.046875,
"step": 420
},
{
"epoch": 0.031040207897206382,
"grad_norm": 1.819742407006859,
"learning_rate": 1.5512265512265513e-07,
"logits/chosen": -2.546875,
"logits/rejected": -2.125,
"logps/chosen": -172.0,
"logps/rejected": -152.0,
"loss": 0.6625,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.002685546875,
"rewards/margins": 0.06396484375,
"rewards/rejected": -0.06640625,
"step": 430
},
{
"epoch": 0.031762073197141416,
"grad_norm": 2.3055219231256108,
"learning_rate": 1.5873015873015872e-07,
"logits/chosen": -2.4375,
"logits/rejected": -2.1875,
"logps/chosen": -155.0,
"logps/rejected": -158.0,
"loss": 0.6555,
"rewards/accuracies": 0.768750011920929,
"rewards/chosen": -0.01123046875,
"rewards/margins": 0.078125,
"rewards/rejected": -0.08935546875,
"step": 440
},
{
"epoch": 0.032483938497076446,
"grad_norm": 1.9129712763765747,
"learning_rate": 1.6233766233766232e-07,
"logits/chosen": -2.515625,
"logits/rejected": -2.140625,
"logps/chosen": -166.0,
"logps/rejected": -154.0,
"loss": 0.6547,
"rewards/accuracies": 0.737500011920929,
"rewards/chosen": -0.031494140625,
"rewards/margins": 0.07666015625,
"rewards/rejected": -0.10791015625,
"step": 450
},
{
"epoch": 0.03320580379701148,
"grad_norm": 1.936887902580248,
"learning_rate": 1.6594516594516593e-07,
"logits/chosen": -2.609375,
"logits/rejected": -2.25,
"logps/chosen": -166.0,
"logps/rejected": -163.0,
"loss": 0.65,
"rewards/accuracies": 0.737500011920929,
"rewards/chosen": -0.0478515625,
"rewards/margins": 0.08740234375,
"rewards/rejected": -0.1357421875,
"step": 460
},
{
"epoch": 0.03392766909694651,
"grad_norm": 2.1168551608123725,
"learning_rate": 1.6955266955266957e-07,
"logits/chosen": -2.65625,
"logits/rejected": -2.234375,
"logps/chosen": -187.0,
"logps/rejected": -190.0,
"loss": 0.6399,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": -0.06298828125,
"rewards/margins": 0.11279296875,
"rewards/rejected": -0.17578125,
"step": 470
},
{
"epoch": 0.034649534396881544,
"grad_norm": 2.4110075564522533,
"learning_rate": 1.7316017316017315e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.296875,
"logps/chosen": -171.0,
"logps/rejected": -167.0,
"loss": 0.6345,
"rewards/accuracies": 0.762499988079071,
"rewards/chosen": -0.09375,
"rewards/margins": 0.1376953125,
"rewards/rejected": -0.2314453125,
"step": 480
},
{
"epoch": 0.035371399696816574,
"grad_norm": 2.561479324237141,
"learning_rate": 1.7676767676767676e-07,
"logits/chosen": -2.5625,
"logits/rejected": -2.34375,
"logps/chosen": -165.0,
"logps/rejected": -169.0,
"loss": 0.6272,
"rewards/accuracies": 0.7437499761581421,
"rewards/chosen": -0.1552734375,
"rewards/margins": 0.1328125,
"rewards/rejected": -0.287109375,
"step": 490
},
{
"epoch": 0.036093264996751605,
"grad_norm": 2.2009284942320004,
"learning_rate": 1.8037518037518037e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.1875,
"logps/chosen": -180.0,
"logps/rejected": -198.0,
"loss": 0.6213,
"rewards/accuracies": 0.762499988079071,
"rewards/chosen": -0.1826171875,
"rewards/margins": 0.1806640625,
"rewards/rejected": -0.36328125,
"step": 500
},
{
"epoch": 0.036815130296686635,
"grad_norm": 2.433624086599741,
"learning_rate": 1.8398268398268395e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.203125,
"logps/chosen": -182.0,
"logps/rejected": -181.0,
"loss": 0.6137,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": -0.2294921875,
"rewards/margins": 0.1787109375,
"rewards/rejected": -0.408203125,
"step": 510
},
{
"epoch": 0.03753699559662167,
"grad_norm": 2.3303081056576396,
"learning_rate": 1.875901875901876e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.3125,
"logps/chosen": -183.0,
"logps/rejected": -198.0,
"loss": 0.6089,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.28125,
"rewards/margins": 0.1953125,
"rewards/rejected": -0.4765625,
"step": 520
},
{
"epoch": 0.0382588608965567,
"grad_norm": 7.529255626517495,
"learning_rate": 1.911976911976912e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.203125,
"logps/chosen": -188.0,
"logps/rejected": -206.0,
"loss": 0.6063,
"rewards/accuracies": 0.768750011920929,
"rewards/chosen": -0.3046875,
"rewards/margins": 0.236328125,
"rewards/rejected": -0.5390625,
"step": 530
},
{
"epoch": 0.03898072619649173,
"grad_norm": 2.2072494405878578,
"learning_rate": 1.948051948051948e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.3125,
"logps/chosen": -203.0,
"logps/rejected": -224.0,
"loss": 0.5956,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.3515625,
"rewards/margins": 0.283203125,
"rewards/rejected": -0.6328125,
"step": 540
},
{
"epoch": 0.03970259149642677,
"grad_norm": 2.310476086986689,
"learning_rate": 1.984126984126984e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.484375,
"logps/chosen": -220.0,
"logps/rejected": -209.0,
"loss": 0.5867,
"rewards/accuracies": 0.737500011920929,
"rewards/chosen": -0.416015625,
"rewards/margins": 0.236328125,
"rewards/rejected": -0.65234375,
"step": 550
},
{
"epoch": 0.0404244567963618,
"grad_norm": 2.6001658124806286,
"learning_rate": 2.02020202020202e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.359375,
"logps/chosen": -208.0,
"logps/rejected": -239.0,
"loss": 0.5754,
"rewards/accuracies": 0.7875000238418579,
"rewards/chosen": -0.447265625,
"rewards/margins": 0.31640625,
"rewards/rejected": -0.76171875,
"step": 560
},
{
"epoch": 0.04114632209629683,
"grad_norm": 2.635075269431316,
"learning_rate": 2.0562770562770563e-07,
"logits/chosen": -2.609375,
"logits/rejected": -2.390625,
"logps/chosen": -217.0,
"logps/rejected": -227.0,
"loss": 0.5719,
"rewards/accuracies": 0.7875000238418579,
"rewards/chosen": -0.494140625,
"rewards/margins": 0.33984375,
"rewards/rejected": -0.83203125,
"step": 570
},
{
"epoch": 0.04186818739623186,
"grad_norm": 2.5380650062224066,
"learning_rate": 2.0923520923520924e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.453125,
"logps/chosen": -216.0,
"logps/rejected": -237.0,
"loss": 0.5794,
"rewards/accuracies": 0.762499988079071,
"rewards/chosen": -0.50390625,
"rewards/margins": 0.349609375,
"rewards/rejected": -0.8515625,
"step": 580
},
{
"epoch": 0.0425900526961669,
"grad_norm": 2.808866971835476,
"learning_rate": 2.1284271284271282e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.546875,
"logps/chosen": -216.0,
"logps/rejected": -264.0,
"loss": 0.5557,
"rewards/accuracies": 0.768750011920929,
"rewards/chosen": -0.5390625,
"rewards/margins": 0.50390625,
"rewards/rejected": -1.046875,
"step": 590
},
{
"epoch": 0.04331191799610193,
"grad_norm": 3.660790591856929,
"learning_rate": 2.1645021645021643e-07,
"logits/chosen": -3.0625,
"logits/rejected": -2.734375,
"logps/chosen": -215.0,
"logps/rejected": -226.0,
"loss": 0.5374,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": -0.60546875,
"rewards/margins": 0.3203125,
"rewards/rejected": -0.92578125,
"step": 600
},
{
"epoch": 0.04403378329603696,
"grad_norm": 3.4012692341173842,
"learning_rate": 2.2005772005772004e-07,
"logits/chosen": -2.984375,
"logits/rejected": -2.671875,
"logps/chosen": -243.0,
"logps/rejected": -288.0,
"loss": 0.5302,
"rewards/accuracies": 0.737500011920929,
"rewards/chosen": -0.75,
"rewards/margins": 0.51953125,
"rewards/rejected": -1.2734375,
"step": 610
},
{
"epoch": 0.04475564859597199,
"grad_norm": 3.1213723367337276,
"learning_rate": 2.2366522366522368e-07,
"logits/chosen": -3.265625,
"logits/rejected": -2.796875,
"logps/chosen": -252.0,
"logps/rejected": -290.0,
"loss": 0.5349,
"rewards/accuracies": 0.768750011920929,
"rewards/chosen": -0.82421875,
"rewards/margins": 0.6171875,
"rewards/rejected": -1.4375,
"step": 620
},
{
"epoch": 0.045477513895907026,
"grad_norm": 3.4139219834989825,
"learning_rate": 2.2727272727272726e-07,
"logits/chosen": -3.078125,
"logits/rejected": -2.8125,
"logps/chosen": -241.0,
"logps/rejected": -290.0,
"loss": 0.5313,
"rewards/accuracies": 0.793749988079071,
"rewards/chosen": -0.76953125,
"rewards/margins": 0.625,
"rewards/rejected": -1.390625,
"step": 630
},
{
"epoch": 0.04619937919584206,
"grad_norm": 3.545601457816913,
"learning_rate": 2.3088023088023087e-07,
"logits/chosen": -3.0625,
"logits/rejected": -2.796875,
"logps/chosen": -254.0,
"logps/rejected": -306.0,
"loss": 0.5163,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.796875,
"rewards/margins": 0.671875,
"rewards/rejected": -1.46875,
"step": 640
},
{
"epoch": 0.04692124449577709,
"grad_norm": 6.320535114176617,
"learning_rate": 2.3448773448773448e-07,
"logits/chosen": -3.15625,
"logits/rejected": -2.9375,
"logps/chosen": -258.0,
"logps/rejected": -312.0,
"loss": 0.5168,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": -0.92578125,
"rewards/margins": 0.625,
"rewards/rejected": -1.5546875,
"step": 650
},
{
"epoch": 0.04764310979571212,
"grad_norm": 4.40606882426551,
"learning_rate": 2.3809523809523806e-07,
"logits/chosen": -3.234375,
"logits/rejected": -2.984375,
"logps/chosen": -258.0,
"logps/rejected": -300.0,
"loss": 0.506,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": -0.9375,
"rewards/margins": 0.6171875,
"rewards/rejected": -1.5546875,
"step": 660
},
{
"epoch": 0.048364975095647154,
"grad_norm": 7.228420353041346,
"learning_rate": 2.4170274170274167e-07,
"logits/chosen": -3.046875,
"logits/rejected": -2.8125,
"logps/chosen": -230.0,
"logps/rejected": -308.0,
"loss": 0.5231,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.8359375,
"rewards/margins": 0.7421875,
"rewards/rejected": -1.578125,
"step": 670
},
{
"epoch": 0.049086840395582185,
"grad_norm": 4.810449590822843,
"learning_rate": 2.453102453102453e-07,
"logits/chosen": -3.046875,
"logits/rejected": -2.75,
"logps/chosen": -246.0,
"logps/rejected": -280.0,
"loss": 0.5107,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.88671875,
"rewards/margins": 0.498046875,
"rewards/rejected": -1.3828125,
"step": 680
},
{
"epoch": 0.049808705695517215,
"grad_norm": 6.916956622472092,
"learning_rate": 2.4891774891774894e-07,
"logits/chosen": -3.046875,
"logits/rejected": -2.9375,
"logps/chosen": -270.0,
"logps/rejected": -322.0,
"loss": 0.5105,
"rewards/accuracies": 0.762499988079071,
"rewards/chosen": -0.9765625,
"rewards/margins": 0.6484375,
"rewards/rejected": -1.625,
"step": 690
},
{
"epoch": 0.050530570995452245,
"grad_norm": 5.072218871042774,
"learning_rate": 2.525252525252525e-07,
"logits/chosen": -3.109375,
"logits/rejected": -2.84375,
"logps/chosen": -256.0,
"logps/rejected": -326.0,
"loss": 0.5065,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.92578125,
"rewards/margins": 0.76953125,
"rewards/rejected": -1.6953125,
"step": 700
},
{
"epoch": 0.05125243629538728,
"grad_norm": 8.875662849487487,
"learning_rate": 2.5613275613275616e-07,
"logits/chosen": -3.09375,
"logits/rejected": -2.84375,
"logps/chosen": -254.0,
"logps/rejected": -306.0,
"loss": 0.5112,
"rewards/accuracies": 0.762499988079071,
"rewards/chosen": -0.94921875,
"rewards/margins": 0.61328125,
"rewards/rejected": -1.5625,
"step": 710
},
{
"epoch": 0.05197430159532231,
"grad_norm": 5.595849818392523,
"learning_rate": 2.597402597402597e-07,
"logits/chosen": -3.15625,
"logits/rejected": -2.96875,
"logps/chosen": -264.0,
"logps/rejected": -340.0,
"loss": 0.5107,
"rewards/accuracies": 0.793749988079071,
"rewards/chosen": -1.0078125,
"rewards/margins": 0.8125,
"rewards/rejected": -1.8203125,
"step": 720
},
{
"epoch": 0.05269616689525734,
"grad_norm": 5.404147285645744,
"learning_rate": 2.633477633477633e-07,
"logits/chosen": -3.03125,
"logits/rejected": -2.65625,
"logps/chosen": -268.0,
"logps/rejected": -368.0,
"loss": 0.5035,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.984375,
"rewards/margins": 0.94140625,
"rewards/rejected": -1.9296875,
"step": 730
},
{
"epoch": 0.05341803219519238,
"grad_norm": 8.76041109611346,
"learning_rate": 2.6695526695526696e-07,
"logits/chosen": -2.984375,
"logits/rejected": -2.828125,
"logps/chosen": -286.0,
"logps/rejected": -342.0,
"loss": 0.4887,
"rewards/accuracies": 0.7875000238418579,
"rewards/chosen": -1.125,
"rewards/margins": 0.75390625,
"rewards/rejected": -1.8828125,
"step": 740
},
{
"epoch": 0.05413989749512741,
"grad_norm": 7.025589443972428,
"learning_rate": 2.7056277056277054e-07,
"logits/chosen": -2.96875,
"logits/rejected": -2.78125,
"logps/chosen": -262.0,
"logps/rejected": -348.0,
"loss": 0.4823,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.0,
"rewards/margins": 0.94921875,
"rewards/rejected": -1.953125,
"step": 750
},
{
"epoch": 0.05486176279506244,
"grad_norm": 11.975302977639574,
"learning_rate": 2.741702741702742e-07,
"logits/chosen": -2.953125,
"logits/rejected": -2.75,
"logps/chosen": -276.0,
"logps/rejected": -322.0,
"loss": 0.4766,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": -1.140625,
"rewards/margins": 0.6953125,
"rewards/rejected": -1.8359375,
"step": 760
},
{
"epoch": 0.05558362809499747,
"grad_norm": 6.5118457359444,
"learning_rate": 2.7777777777777776e-07,
"logits/chosen": -2.953125,
"logits/rejected": -2.734375,
"logps/chosen": -280.0,
"logps/rejected": -346.0,
"loss": 0.4846,
"rewards/accuracies": 0.800000011920929,
"rewards/chosen": -1.1875,
"rewards/margins": 0.80859375,
"rewards/rejected": -1.9921875,
"step": 770
},
{
"epoch": 0.05630549339493251,
"grad_norm": 6.106781577833728,
"learning_rate": 2.813852813852814e-07,
"logits/chosen": -3.015625,
"logits/rejected": -2.6875,
"logps/chosen": -260.0,
"logps/rejected": -356.0,
"loss": 0.4665,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": -1.046875,
"rewards/margins": 0.83203125,
"rewards/rejected": -1.875,
"step": 780
},
{
"epoch": 0.05702735869486754,
"grad_norm": 10.75495308386994,
"learning_rate": 2.8499278499278503e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.625,
"logps/chosen": -284.0,
"logps/rejected": -408.0,
"loss": 0.4695,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": -1.2109375,
"rewards/margins": 1.171875,
"rewards/rejected": -2.390625,
"step": 790
},
{
"epoch": 0.05774922399480257,
"grad_norm": 5.788421207967755,
"learning_rate": 2.8860028860028856e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.65625,
"logps/chosen": -274.0,
"logps/rejected": -334.0,
"loss": 0.4767,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.125,
"rewards/margins": 0.84765625,
"rewards/rejected": -1.9765625,
"step": 800
},
{
"epoch": 0.0584710892947376,
"grad_norm": 8.78614857490401,
"learning_rate": 2.922077922077922e-07,
"logits/chosen": -3.015625,
"logits/rejected": -2.71875,
"logps/chosen": -262.0,
"logps/rejected": -362.0,
"loss": 0.4722,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.234375,
"rewards/margins": 0.8984375,
"rewards/rejected": -2.125,
"step": 810
},
{
"epoch": 0.05919295459467264,
"grad_norm": 7.3161771388355294,
"learning_rate": 2.958152958152958e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.578125,
"logps/chosen": -272.0,
"logps/rejected": -376.0,
"loss": 0.4996,
"rewards/accuracies": 0.793749988079071,
"rewards/chosen": -1.1796875,
"rewards/margins": 0.93359375,
"rewards/rejected": -2.109375,
"step": 820
},
{
"epoch": 0.05991481989460767,
"grad_norm": 8.266553993044619,
"learning_rate": 2.994227994227994e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.546875,
"logps/chosen": -282.0,
"logps/rejected": -376.0,
"loss": 0.4545,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": -1.15625,
"rewards/margins": 1.015625,
"rewards/rejected": -2.171875,
"step": 830
},
{
"epoch": 0.0606366851945427,
"grad_norm": 8.218438777679667,
"learning_rate": 3.0303030303030305e-07,
"logits/chosen": -2.890625,
"logits/rejected": -2.640625,
"logps/chosen": -272.0,
"logps/rejected": -382.0,
"loss": 0.4639,
"rewards/accuracies": 0.8062499761581421,
"rewards/chosen": -1.25,
"rewards/margins": 1.0234375,
"rewards/rejected": -2.28125,
"step": 840
},
{
"epoch": 0.06135855049447773,
"grad_norm": 8.61378341353772,
"learning_rate": 3.0663780663780663e-07,
"logits/chosen": -3.078125,
"logits/rejected": -2.640625,
"logps/chosen": -284.0,
"logps/rejected": -408.0,
"loss": 0.4536,
"rewards/accuracies": 0.793749988079071,
"rewards/chosen": -1.2578125,
"rewards/margins": 1.109375,
"rewards/rejected": -2.359375,
"step": 850
},
{
"epoch": 0.062080415794412765,
"grad_norm": 12.398406848670698,
"learning_rate": 3.1024531024531027e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.65625,
"logps/chosen": -286.0,
"logps/rejected": -372.0,
"loss": 0.476,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": -1.2578125,
"rewards/margins": 1.0078125,
"rewards/rejected": -2.265625,
"step": 860
},
{
"epoch": 0.0628022810943478,
"grad_norm": 12.244121744087602,
"learning_rate": 3.138528138528138e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.671875,
"logps/chosen": -294.0,
"logps/rejected": -388.0,
"loss": 0.4623,
"rewards/accuracies": 0.78125,
"rewards/chosen": -1.3671875,
"rewards/margins": 0.984375,
"rewards/rejected": -2.359375,
"step": 870
},
{
"epoch": 0.06352414639428283,
"grad_norm": 10.812869810884447,
"learning_rate": 3.1746031746031743e-07,
"logits/chosen": -3.03125,
"logits/rejected": -2.796875,
"logps/chosen": -268.0,
"logps/rejected": -366.0,
"loss": 0.4498,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": -1.234375,
"rewards/margins": 0.99609375,
"rewards/rejected": -2.234375,
"step": 880
},
{
"epoch": 0.06424601169421786,
"grad_norm": 11.229212598361977,
"learning_rate": 3.2106782106782107e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.75,
"logps/chosen": -298.0,
"logps/rejected": -394.0,
"loss": 0.4373,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.3828125,
"rewards/margins": 1.0859375,
"rewards/rejected": -2.46875,
"step": 890
},
{
"epoch": 0.06496787699415289,
"grad_norm": 7.414765021326351,
"learning_rate": 3.2467532467532465e-07,
"logits/chosen": -2.984375,
"logits/rejected": -2.75,
"logps/chosen": -294.0,
"logps/rejected": -394.0,
"loss": 0.4253,
"rewards/accuracies": 0.8062499761581421,
"rewards/chosen": -1.34375,
"rewards/margins": 1.140625,
"rewards/rejected": -2.484375,
"step": 900
},
{
"epoch": 0.06568974229408793,
"grad_norm": 6.656174306105041,
"learning_rate": 3.282828282828283e-07,
"logits/chosen": -2.96875,
"logits/rejected": -2.65625,
"logps/chosen": -322.0,
"logps/rejected": -440.0,
"loss": 0.4366,
"rewards/accuracies": 0.8062499761581421,
"rewards/chosen": -1.6328125,
"rewards/margins": 1.1484375,
"rewards/rejected": -2.78125,
"step": 910
},
{
"epoch": 0.06641160759402295,
"grad_norm": 6.986955189515223,
"learning_rate": 3.3189033189033187e-07,
"logits/chosen": -2.921875,
"logits/rejected": -2.71875,
"logps/chosen": -328.0,
"logps/rejected": -422.0,
"loss": 0.4335,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": -1.515625,
"rewards/margins": 1.234375,
"rewards/rejected": -2.75,
"step": 920
},
{
"epoch": 0.06713347289395799,
"grad_norm": 8.704691417598838,
"learning_rate": 3.354978354978355e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.6875,
"logps/chosen": -322.0,
"logps/rejected": -406.0,
"loss": 0.4048,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": -1.5703125,
"rewards/margins": 1.0703125,
"rewards/rejected": -2.640625,
"step": 930
},
{
"epoch": 0.06785533819389301,
"grad_norm": 19.52535270358171,
"learning_rate": 3.3910533910533914e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.65625,
"logps/chosen": -316.0,
"logps/rejected": -476.0,
"loss": 0.434,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -1.6015625,
"rewards/margins": 1.609375,
"rewards/rejected": -3.21875,
"step": 940
},
{
"epoch": 0.06857720349382805,
"grad_norm": 11.339737953685198,
"learning_rate": 3.4271284271284267e-07,
"logits/chosen": -2.5625,
"logits/rejected": -2.375,
"logps/chosen": -316.0,
"logps/rejected": -398.0,
"loss": 0.4334,
"rewards/accuracies": 0.8187500238418579,
"rewards/chosen": -1.5625,
"rewards/margins": 1.03125,
"rewards/rejected": -2.59375,
"step": 950
},
{
"epoch": 0.06929906879376309,
"grad_norm": 10.31037341226185,
"learning_rate": 3.463203463203463e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.4375,
"logps/chosen": -322.0,
"logps/rejected": -456.0,
"loss": 0.4161,
"rewards/accuracies": 0.8062499761581421,
"rewards/chosen": -1.6328125,
"rewards/margins": 1.40625,
"rewards/rejected": -3.046875,
"step": 960
},
{
"epoch": 0.07002093409369811,
"grad_norm": 11.130584733664083,
"learning_rate": 3.499278499278499e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.59375,
"logps/chosen": -298.0,
"logps/rejected": -424.0,
"loss": 0.4078,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": -1.4296875,
"rewards/margins": 1.3671875,
"rewards/rejected": -2.796875,
"step": 970
},
{
"epoch": 0.07074279939363315,
"grad_norm": 9.06083640139615,
"learning_rate": 3.535353535353535e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.609375,
"logps/chosen": -308.0,
"logps/rejected": -442.0,
"loss": 0.4178,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -1.53125,
"rewards/margins": 1.3515625,
"rewards/rejected": -2.890625,
"step": 980
},
{
"epoch": 0.07146466469356819,
"grad_norm": 9.541422651232944,
"learning_rate": 3.5714285714285716e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.46875,
"logps/chosen": -338.0,
"logps/rejected": -450.0,
"loss": 0.3953,
"rewards/accuracies": 0.78125,
"rewards/chosen": -1.7109375,
"rewards/margins": 1.375,
"rewards/rejected": -3.078125,
"step": 990
},
{
"epoch": 0.07218652999350321,
"grad_norm": 9.110551563711448,
"learning_rate": 3.6075036075036074e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.5,
"logps/chosen": -326.0,
"logps/rejected": -464.0,
"loss": 0.4021,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": -1.53125,
"rewards/margins": 1.453125,
"rewards/rejected": -2.984375,
"step": 1000
},
{
"epoch": 0.07290839529343825,
"grad_norm": 15.071837561832831,
"learning_rate": 3.643578643578644e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.5625,
"logps/chosen": -314.0,
"logps/rejected": -452.0,
"loss": 0.4045,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": -1.5625,
"rewards/margins": 1.3671875,
"rewards/rejected": -2.921875,
"step": 1010
},
{
"epoch": 0.07363026059337327,
"grad_norm": 13.920977378141336,
"learning_rate": 3.679653679653679e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.59375,
"logps/chosen": -334.0,
"logps/rejected": -492.0,
"loss": 0.431,
"rewards/accuracies": 0.8187500238418579,
"rewards/chosen": -1.8125,
"rewards/margins": 1.46875,
"rewards/rejected": -3.28125,
"step": 1020
},
{
"epoch": 0.07435212589330831,
"grad_norm": 11.085289038392293,
"learning_rate": 3.7157287157287154e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.5,
"logps/chosen": -298.0,
"logps/rejected": -456.0,
"loss": 0.3934,
"rewards/accuracies": 0.8125,
"rewards/chosen": -1.5703125,
"rewards/margins": 1.390625,
"rewards/rejected": -2.96875,
"step": 1030
},
{
"epoch": 0.07507399119324334,
"grad_norm": 10.088971897286424,
"learning_rate": 3.751803751803752e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.625,
"logps/chosen": -322.0,
"logps/rejected": -456.0,
"loss": 0.4073,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -1.7109375,
"rewards/margins": 1.3515625,
"rewards/rejected": -3.0625,
"step": 1040
},
{
"epoch": 0.07579585649317837,
"grad_norm": 43.24163673888106,
"learning_rate": 3.7878787878787876e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.375,
"logps/chosen": -348.0,
"logps/rejected": -496.0,
"loss": 0.4152,
"rewards/accuracies": 0.8062499761581421,
"rewards/chosen": -1.890625,
"rewards/margins": 1.25,
"rewards/rejected": -3.140625,
"step": 1050
},
{
"epoch": 0.0765177217931134,
"grad_norm": 8.537892452168746,
"learning_rate": 3.823953823953824e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.40625,
"logps/chosen": -338.0,
"logps/rejected": -480.0,
"loss": 0.3947,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": -1.765625,
"rewards/margins": 1.5234375,
"rewards/rejected": -3.296875,
"step": 1060
},
{
"epoch": 0.07723958709304844,
"grad_norm": 9.485771716655114,
"learning_rate": 3.86002886002886e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.375,
"logps/chosen": -326.0,
"logps/rejected": -462.0,
"loss": 0.3837,
"rewards/accuracies": 0.78125,
"rewards/chosen": -1.640625,
"rewards/margins": 1.453125,
"rewards/rejected": -3.09375,
"step": 1070
},
{
"epoch": 0.07796145239298347,
"grad_norm": 9.46365785011617,
"learning_rate": 3.896103896103896e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.328125,
"logps/chosen": -386.0,
"logps/rejected": -536.0,
"loss": 0.3848,
"rewards/accuracies": 0.8187500238418579,
"rewards/chosen": -2.15625,
"rewards/margins": 1.7890625,
"rewards/rejected": -3.9375,
"step": 1080
},
{
"epoch": 0.0786833176929185,
"grad_norm": 13.461346342787172,
"learning_rate": 3.9321789321789325e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.453125,
"logps/chosen": -360.0,
"logps/rejected": -520.0,
"loss": 0.3922,
"rewards/accuracies": 0.800000011920929,
"rewards/chosen": -1.875,
"rewards/margins": 1.8984375,
"rewards/rejected": -3.765625,
"step": 1090
},
{
"epoch": 0.07940518299285354,
"grad_norm": 12.44634151581957,
"learning_rate": 3.968253968253968e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.40625,
"logps/chosen": -356.0,
"logps/rejected": -508.0,
"loss": 0.3727,
"rewards/accuracies": 0.8125,
"rewards/chosen": -2.015625,
"rewards/margins": 1.5,
"rewards/rejected": -3.515625,
"step": 1100
},
{
"epoch": 0.08012704829278856,
"grad_norm": 11.687822831294243,
"learning_rate": 4.004329004329004e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.4375,
"logps/chosen": -346.0,
"logps/rejected": -568.0,
"loss": 0.3765,
"rewards/accuracies": 0.875,
"rewards/chosen": -1.875,
"rewards/margins": 2.171875,
"rewards/rejected": -4.0625,
"step": 1110
},
{
"epoch": 0.0808489135927236,
"grad_norm": 16.193115895860167,
"learning_rate": 4.04040404040404e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.4375,
"logps/chosen": -356.0,
"logps/rejected": -532.0,
"loss": 0.3726,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": -1.9921875,
"rewards/margins": 1.6484375,
"rewards/rejected": -3.65625,
"step": 1120
},
{
"epoch": 0.08157077889265862,
"grad_norm": 10.454280347519187,
"learning_rate": 4.0764790764790763e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.421875,
"logps/chosen": -350.0,
"logps/rejected": -496.0,
"loss": 0.4066,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": -1.78125,
"rewards/margins": 1.515625,
"rewards/rejected": -3.296875,
"step": 1130
},
{
"epoch": 0.08229264419259366,
"grad_norm": 10.033847939954763,
"learning_rate": 4.1125541125541127e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.5625,
"logps/chosen": -334.0,
"logps/rejected": -462.0,
"loss": 0.355,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -1.7890625,
"rewards/margins": 1.3984375,
"rewards/rejected": -3.1875,
"step": 1140
},
{
"epoch": 0.0830145094925287,
"grad_norm": 13.538065077526934,
"learning_rate": 4.1486291486291485e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.6875,
"logps/chosen": -398.0,
"logps/rejected": -588.0,
"loss": 0.3843,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": -2.1875,
"rewards/margins": 2.078125,
"rewards/rejected": -4.28125,
"step": 1150
},
{
"epoch": 0.08373637479246372,
"grad_norm": 12.06165274825125,
"learning_rate": 4.184704184704185e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.484375,
"logps/chosen": -314.0,
"logps/rejected": -500.0,
"loss": 0.3816,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": -1.6796875,
"rewards/margins": 1.7578125,
"rewards/rejected": -3.4375,
"step": 1160
},
{
"epoch": 0.08445824009239876,
"grad_norm": 14.245004620424362,
"learning_rate": 4.22077922077922e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.640625,
"logps/chosen": -376.0,
"logps/rejected": -612.0,
"loss": 0.3599,
"rewards/accuracies": 0.84375,
"rewards/chosen": -2.21875,
"rewards/margins": 2.375,
"rewards/rejected": -4.59375,
"step": 1170
},
{
"epoch": 0.0851801053923338,
"grad_norm": 12.93467746542696,
"learning_rate": 4.2568542568542565e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.578125,
"logps/chosen": -330.0,
"logps/rejected": -476.0,
"loss": 0.3635,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": -1.75,
"rewards/margins": 1.5859375,
"rewards/rejected": -3.34375,
"step": 1180
},
{
"epoch": 0.08590197069226882,
"grad_norm": 11.202101570401776,
"learning_rate": 4.292929292929293e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.546875,
"logps/chosen": -364.0,
"logps/rejected": -536.0,
"loss": 0.3583,
"rewards/accuracies": 0.856249988079071,
"rewards/chosen": -2.125,
"rewards/margins": 1.8359375,
"rewards/rejected": -3.953125,
"step": 1190
},
{
"epoch": 0.08662383599220386,
"grad_norm": 10.771994466129188,
"learning_rate": 4.3290043290043287e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.5,
"logps/chosen": -358.0,
"logps/rejected": -510.0,
"loss": 0.3465,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": -1.8828125,
"rewards/margins": 1.578125,
"rewards/rejected": -3.46875,
"step": 1200
},
{
"epoch": 0.08734570129213888,
"grad_norm": 14.841268368598595,
"learning_rate": 4.365079365079365e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.578125,
"logps/chosen": -364.0,
"logps/rejected": -584.0,
"loss": 0.3477,
"rewards/accuracies": 0.84375,
"rewards/chosen": -2.234375,
"rewards/margins": 2.171875,
"rewards/rejected": -4.40625,
"step": 1210
},
{
"epoch": 0.08806756659207392,
"grad_norm": 9.504108427187644,
"learning_rate": 4.401154401154401e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.546875,
"logps/chosen": -394.0,
"logps/rejected": -648.0,
"loss": 0.3755,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": -2.25,
"rewards/margins": 2.703125,
"rewards/rejected": -4.9375,
"step": 1220
},
{
"epoch": 0.08878943189200895,
"grad_norm": 12.115514229718103,
"learning_rate": 4.437229437229437e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.578125,
"logps/chosen": -304.0,
"logps/rejected": -520.0,
"loss": 0.3704,
"rewards/accuracies": 0.90625,
"rewards/chosen": -1.5390625,
"rewards/margins": 2.1875,
"rewards/rejected": -3.71875,
"step": 1230
},
{
"epoch": 0.08951129719194398,
"grad_norm": 10.317228267259349,
"learning_rate": 4.4733044733044736e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.625,
"logps/chosen": -420.0,
"logps/rejected": -612.0,
"loss": 0.3559,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -2.5,
"rewards/margins": 1.9453125,
"rewards/rejected": -4.46875,
"step": 1240
},
{
"epoch": 0.09023316249187902,
"grad_norm": 11.197522859178363,
"learning_rate": 4.509379509379509e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.546875,
"logps/chosen": -428.0,
"logps/rejected": -604.0,
"loss": 0.3219,
"rewards/accuracies": 0.8062499761581421,
"rewards/chosen": -2.71875,
"rewards/margins": 1.859375,
"rewards/rejected": -4.59375,
"step": 1250
},
{
"epoch": 0.09095502779181405,
"grad_norm": 13.497331724381818,
"learning_rate": 4.545454545454545e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.453125,
"logps/chosen": -412.0,
"logps/rejected": -604.0,
"loss": 0.3388,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": -2.546875,
"rewards/margins": 1.9765625,
"rewards/rejected": -4.53125,
"step": 1260
},
{
"epoch": 0.09167689309174908,
"grad_norm": 11.433124284340494,
"learning_rate": 4.581529581529581e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.5625,
"logps/chosen": -390.0,
"logps/rejected": -560.0,
"loss": 0.3458,
"rewards/accuracies": 0.875,
"rewards/chosen": -2.234375,
"rewards/margins": 1.7734375,
"rewards/rejected": -4.0,
"step": 1270
},
{
"epoch": 0.09239875839168411,
"grad_norm": 12.324384516756012,
"learning_rate": 4.6176046176046174e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.5,
"logps/chosen": -410.0,
"logps/rejected": -580.0,
"loss": 0.3426,
"rewards/accuracies": 0.90625,
"rewards/chosen": -2.328125,
"rewards/margins": 1.890625,
"rewards/rejected": -4.21875,
"step": 1280
},
{
"epoch": 0.09312062369161915,
"grad_norm": 10.730987022263216,
"learning_rate": 4.6536796536796537e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.390625,
"logps/chosen": -442.0,
"logps/rejected": -612.0,
"loss": 0.3593,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": -2.828125,
"rewards/margins": 1.7890625,
"rewards/rejected": -4.625,
"step": 1290
},
{
"epoch": 0.09384248899155417,
"grad_norm": 10.132938191746307,
"learning_rate": 4.6897546897546896e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.578125,
"logps/chosen": -408.0,
"logps/rejected": -564.0,
"loss": 0.3632,
"rewards/accuracies": 0.84375,
"rewards/chosen": -2.359375,
"rewards/margins": 1.75,
"rewards/rejected": -4.09375,
"step": 1300
},
{
"epoch": 0.09456435429148921,
"grad_norm": 11.988621181927288,
"learning_rate": 4.725829725829726e-07,
"logits/chosen": -2.578125,
"logits/rejected": -2.4375,
"logps/chosen": -452.0,
"logps/rejected": -624.0,
"loss": 0.3609,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": -2.921875,
"rewards/margins": 1.78125,
"rewards/rejected": -4.71875,
"step": 1310
},
{
"epoch": 0.09528621959142423,
"grad_norm": 8.802084815882347,
"learning_rate": 4.761904761904761e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.515625,
"logps/chosen": -458.0,
"logps/rejected": -604.0,
"loss": 0.3197,
"rewards/accuracies": 0.800000011920929,
"rewards/chosen": -2.9375,
"rewards/margins": 1.5859375,
"rewards/rejected": -4.53125,
"step": 1320
},
{
"epoch": 0.09600808489135927,
"grad_norm": 13.978035740824382,
"learning_rate": 4.797979797979798e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.4375,
"logps/chosen": -420.0,
"logps/rejected": -660.0,
"loss": 0.355,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": -2.703125,
"rewards/margins": 2.46875,
"rewards/rejected": -5.15625,
"step": 1330
},
{
"epoch": 0.09672995019129431,
"grad_norm": 9.329953252240916,
"learning_rate": 4.834054834054833e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.53125,
"logps/chosen": -426.0,
"logps/rejected": -612.0,
"loss": 0.3382,
"rewards/accuracies": 0.875,
"rewards/chosen": -2.703125,
"rewards/margins": 1.8203125,
"rewards/rejected": -4.53125,
"step": 1340
},
{
"epoch": 0.09745181549122933,
"grad_norm": 14.354032725201476,
"learning_rate": 4.87012987012987e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.390625,
"logps/chosen": -438.0,
"logps/rejected": -628.0,
"loss": 0.3375,
"rewards/accuracies": 0.856249988079071,
"rewards/chosen": -2.53125,
"rewards/margins": 2.15625,
"rewards/rejected": -4.6875,
"step": 1350
},
{
"epoch": 0.09817368079116437,
"grad_norm": 11.184165035806638,
"learning_rate": 4.906204906204906e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.5,
"logps/chosen": -444.0,
"logps/rejected": -640.0,
"loss": 0.3528,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -2.6875,
"rewards/margins": 2.015625,
"rewards/rejected": -4.6875,
"step": 1360
},
{
"epoch": 0.0988955460910994,
"grad_norm": 9.32730305340813,
"learning_rate": 4.942279942279942e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.515625,
"logps/chosen": -420.0,
"logps/rejected": -592.0,
"loss": 0.3343,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -2.609375,
"rewards/margins": 1.9375,
"rewards/rejected": -4.53125,
"step": 1370
},
{
"epoch": 0.09961741139103443,
"grad_norm": 17.291834755334516,
"learning_rate": 4.978354978354979e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.671875,
"logps/chosen": -450.0,
"logps/rejected": -636.0,
"loss": 0.3246,
"rewards/accuracies": 0.856249988079071,
"rewards/chosen": -2.71875,
"rewards/margins": 1.9765625,
"rewards/rejected": -4.6875,
"step": 1380
},
{
"epoch": 0.10033927669096947,
"grad_norm": 10.743034154219572,
"learning_rate": 4.999998729993963e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.53125,
"logps/chosen": -430.0,
"logps/rejected": -604.0,
"loss": 0.3335,
"rewards/accuracies": 0.84375,
"rewards/chosen": -2.6875,
"rewards/margins": 1.8984375,
"rewards/rejected": -4.59375,
"step": 1390
},
{
"epoch": 0.10106114199090449,
"grad_norm": 17.190340388139088,
"learning_rate": 4.999984442440868e-07,
"logits/chosen": -2.96875,
"logits/rejected": -2.703125,
"logps/chosen": -438.0,
"logps/rejected": -680.0,
"loss": 0.3204,
"rewards/accuracies": 0.84375,
"rewards/chosen": -2.984375,
"rewards/margins": 2.453125,
"rewards/rejected": -5.4375,
"step": 1400
},
{
"epoch": 0.10178300729083953,
"grad_norm": 9.641498367561857,
"learning_rate": 4.99995427991816e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.53125,
"logps/chosen": -442.0,
"logps/rejected": -648.0,
"loss": 0.3379,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -2.71875,
"rewards/margins": 2.171875,
"rewards/rejected": -4.875,
"step": 1410
},
{
"epoch": 0.10250487259077457,
"grad_norm": 9.768069678095703,
"learning_rate": 4.999908242617371e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.609375,
"logps/chosen": -452.0,
"logps/rejected": -648.0,
"loss": 0.34,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -2.765625,
"rewards/margins": 1.84375,
"rewards/rejected": -4.59375,
"step": 1420
},
{
"epoch": 0.10322673789070959,
"grad_norm": 13.37422488078675,
"learning_rate": 4.99984633083084e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.578125,
"logps/chosen": -416.0,
"logps/rejected": -616.0,
"loss": 0.331,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -2.6875,
"rewards/margins": 1.8984375,
"rewards/rejected": -4.5625,
"step": 1430
},
{
"epoch": 0.10394860319064463,
"grad_norm": 11.253293027609532,
"learning_rate": 4.99976854495171e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.625,
"logps/chosen": -488.0,
"logps/rejected": -696.0,
"loss": 0.3218,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -3.453125,
"rewards/margins": 2.09375,
"rewards/rejected": -5.53125,
"step": 1440
},
{
"epoch": 0.10467046849057966,
"grad_norm": 10.82613372416563,
"learning_rate": 4.999674885473922e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.484375,
"logps/chosen": -458.0,
"logps/rejected": -656.0,
"loss": 0.3213,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -2.921875,
"rewards/margins": 1.734375,
"rewards/rejected": -4.65625,
"step": 1450
},
{
"epoch": 0.10539233379051469,
"grad_norm": 15.794446739298891,
"learning_rate": 4.999565352992216e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.6875,
"logps/chosen": -502.0,
"logps/rejected": -712.0,
"loss": 0.3289,
"rewards/accuracies": 0.90625,
"rewards/chosen": -3.21875,
"rewards/margins": 2.296875,
"rewards/rejected": -5.5,
"step": 1460
},
{
"epoch": 0.10611419909044972,
"grad_norm": 10.361664841175285,
"learning_rate": 4.999439948202127e-07,
"logits/chosen": -2.859375,
"logits/rejected": -2.609375,
"logps/chosen": -450.0,
"logps/rejected": -596.0,
"loss": 0.3261,
"rewards/accuracies": 0.84375,
"rewards/chosen": -2.859375,
"rewards/margins": 1.8515625,
"rewards/rejected": -4.71875,
"step": 1470
},
{
"epoch": 0.10683606439038476,
"grad_norm": 10.555951221100015,
"learning_rate": 4.999298671899977e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.5625,
"logps/chosen": -452.0,
"logps/rejected": -644.0,
"loss": 0.3399,
"rewards/accuracies": 0.875,
"rewards/chosen": -2.75,
"rewards/margins": 2.171875,
"rewards/rejected": -4.9375,
"step": 1480
},
{
"epoch": 0.10755792969031978,
"grad_norm": 9.802204192641314,
"learning_rate": 4.999141524982877e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.515625,
"logps/chosen": -444.0,
"logps/rejected": -700.0,
"loss": 0.309,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -2.84375,
"rewards/margins": 2.6875,
"rewards/rejected": -5.53125,
"step": 1490
},
{
"epoch": 0.10827979499025482,
"grad_norm": 12.72303480502336,
"learning_rate": 4.998968508448714e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.453125,
"logps/chosen": -432.0,
"logps/rejected": -632.0,
"loss": 0.3276,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -2.625,
"rewards/margins": 2.15625,
"rewards/rejected": -4.78125,
"step": 1500
},
{
"epoch": 0.10900166029018984,
"grad_norm": 14.570251314538908,
"learning_rate": 4.998779623396146e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.46875,
"logps/chosen": -502.0,
"logps/rejected": -720.0,
"loss": 0.2995,
"rewards/accuracies": 0.856249988079071,
"rewards/chosen": -3.140625,
"rewards/margins": 2.5,
"rewards/rejected": -5.65625,
"step": 1510
},
{
"epoch": 0.10972352559012488,
"grad_norm": 11.169758259343533,
"learning_rate": 4.9985748710246e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.421875,
"logps/chosen": -476.0,
"logps/rejected": -656.0,
"loss": 0.3344,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -3.21875,
"rewards/margins": 1.84375,
"rewards/rejected": -5.0625,
"step": 1520
},
{
"epoch": 0.11044539089005992,
"grad_norm": 10.504554948014457,
"learning_rate": 4.998354252634257e-07,
"logits/chosen": -2.609375,
"logits/rejected": -2.46875,
"logps/chosen": -486.0,
"logps/rejected": -668.0,
"loss": 0.2853,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -3.21875,
"rewards/margins": 2.078125,
"rewards/rejected": -5.28125,
"step": 1530
},
{
"epoch": 0.11116725618999494,
"grad_norm": 15.073212833972551,
"learning_rate": 4.998117769626051e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.703125,
"logps/chosen": -456.0,
"logps/rejected": -676.0,
"loss": 0.309,
"rewards/accuracies": 0.8187500238418579,
"rewards/chosen": -2.984375,
"rewards/margins": 2.25,
"rewards/rejected": -5.21875,
"step": 1540
},
{
"epoch": 0.11188912148992998,
"grad_norm": 10.298569511142073,
"learning_rate": 4.997865423501657e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.53125,
"logps/chosen": -380.0,
"logps/rejected": -564.0,
"loss": 0.3261,
"rewards/accuracies": 0.84375,
"rewards/chosen": -2.328125,
"rewards/margins": 1.8828125,
"rewards/rejected": -4.21875,
"step": 1550
},
{
"epoch": 0.11261098678986502,
"grad_norm": 11.022262328486809,
"learning_rate": 4.997597215863477e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.546875,
"logps/chosen": -480.0,
"logps/rejected": -716.0,
"loss": 0.2878,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -3.09375,
"rewards/margins": 2.59375,
"rewards/rejected": -5.6875,
"step": 1560
},
{
"epoch": 0.11333285208980004,
"grad_norm": 12.425423187064853,
"learning_rate": 4.99731314841464e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.53125,
"logps/chosen": -500.0,
"logps/rejected": -704.0,
"loss": 0.3008,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -3.390625,
"rewards/margins": 2.1875,
"rewards/rejected": -5.5625,
"step": 1570
},
{
"epoch": 0.11405471738973508,
"grad_norm": 10.996930809431353,
"learning_rate": 4.997013222958978e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.546875,
"logps/chosen": -496.0,
"logps/rejected": -732.0,
"loss": 0.3105,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -3.234375,
"rewards/margins": 2.578125,
"rewards/rejected": -5.8125,
"step": 1580
},
{
"epoch": 0.1147765826896701,
"grad_norm": 11.11449736666811,
"learning_rate": 4.99669744140103e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.53125,
"logps/chosen": -512.0,
"logps/rejected": -716.0,
"loss": 0.3043,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -3.75,
"rewards/margins": 2.09375,
"rewards/rejected": -5.84375,
"step": 1590
},
{
"epoch": 0.11549844798960514,
"grad_norm": 10.155961204890554,
"learning_rate": 4.996365805746015e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.5625,
"logps/chosen": -474.0,
"logps/rejected": -752.0,
"loss": 0.2908,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -3.234375,
"rewards/margins": 2.796875,
"rewards/rejected": -6.03125,
"step": 1600
},
{
"epoch": 0.11622031328954018,
"grad_norm": 9.079844890608808,
"learning_rate": 4.996018318099829e-07,
"logits/chosen": -2.421875,
"logits/rejected": -2.28125,
"logps/chosen": -506.0,
"logps/rejected": -712.0,
"loss": 0.2977,
"rewards/accuracies": 0.84375,
"rewards/chosen": -3.46875,
"rewards/margins": 2.171875,
"rewards/rejected": -5.65625,
"step": 1610
},
{
"epoch": 0.1169421785894752,
"grad_norm": 13.337729397169802,
"learning_rate": 4.995654980669028e-07,
"logits/chosen": -2.859375,
"logits/rejected": -2.5,
"logps/chosen": -476.0,
"logps/rejected": -748.0,
"loss": 0.2937,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -3.03125,
"rewards/margins": 2.875,
"rewards/rejected": -5.90625,
"step": 1620
},
{
"epoch": 0.11766404388941024,
"grad_norm": 9.987891055540013,
"learning_rate": 4.995275795760816e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.734375,
"logps/chosen": -454.0,
"logps/rejected": -660.0,
"loss": 0.2991,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": -2.953125,
"rewards/margins": 2.109375,
"rewards/rejected": -5.0625,
"step": 1630
},
{
"epoch": 0.11838590918934527,
"grad_norm": 12.804317711855225,
"learning_rate": 4.994880765783026e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.671875,
"logps/chosen": -484.0,
"logps/rejected": -672.0,
"loss": 0.2883,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -3.109375,
"rewards/margins": 2.015625,
"rewards/rejected": -5.125,
"step": 1640
},
{
"epoch": 0.1191077744892803,
"grad_norm": 11.589955875632223,
"learning_rate": 4.99446989324411e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.5625,
"logps/chosen": -470.0,
"logps/rejected": -756.0,
"loss": 0.2847,
"rewards/accuracies": 0.875,
"rewards/chosen": -2.953125,
"rewards/margins": 3.046875,
"rewards/rejected": -6.0,
"step": 1650
},
{
"epoch": 0.11982963978921533,
"grad_norm": 14.992092750756044,
"learning_rate": 4.99404318075312e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.546875,
"logps/chosen": -488.0,
"logps/rejected": -672.0,
"loss": 0.2926,
"rewards/accuracies": 0.84375,
"rewards/chosen": -3.21875,
"rewards/margins": 2.125,
"rewards/rejected": -5.34375,
"step": 1660
},
{
"epoch": 0.12055150508915037,
"grad_norm": 14.63652475825442,
"learning_rate": 4.993600631019689e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.578125,
"logps/chosen": -484.0,
"logps/rejected": -680.0,
"loss": 0.3115,
"rewards/accuracies": 0.875,
"rewards/chosen": -3.328125,
"rewards/margins": 1.984375,
"rewards/rejected": -5.3125,
"step": 1670
},
{
"epoch": 0.1212733703890854,
"grad_norm": 10.01896442134856,
"learning_rate": 4.993142246854024e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.59375,
"logps/chosen": -434.0,
"logps/rejected": -656.0,
"loss": 0.2917,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -2.84375,
"rewards/margins": 2.15625,
"rewards/rejected": -5.0,
"step": 1680
},
{
"epoch": 0.12199523568902043,
"grad_norm": 10.480137264657502,
"learning_rate": 4.992668031166876e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.703125,
"logps/chosen": -444.0,
"logps/rejected": -672.0,
"loss": 0.3114,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -2.90625,
"rewards/margins": 2.421875,
"rewards/rejected": -5.34375,
"step": 1690
},
{
"epoch": 0.12271710098895545,
"grad_norm": 9.543166172183264,
"learning_rate": 4.992177986969526e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.484375,
"logps/chosen": -430.0,
"logps/rejected": -624.0,
"loss": 0.3235,
"rewards/accuracies": 0.875,
"rewards/chosen": -2.71875,
"rewards/margins": 1.890625,
"rewards/rejected": -4.59375,
"step": 1700
},
{
"epoch": 0.12343896628889049,
"grad_norm": 9.39264085167921,
"learning_rate": 4.991672117373769e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.5625,
"logps/chosen": -452.0,
"logps/rejected": -712.0,
"loss": 0.2971,
"rewards/accuracies": 0.856249988079071,
"rewards/chosen": -2.796875,
"rewards/margins": 2.625,
"rewards/rejected": -5.4375,
"step": 1710
},
{
"epoch": 0.12416083158882553,
"grad_norm": 9.35509206624716,
"learning_rate": 4.991150425591891e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.46875,
"logps/chosen": -448.0,
"logps/rejected": -700.0,
"loss": 0.2908,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -2.96875,
"rewards/margins": 2.5625,
"rewards/rejected": -5.53125,
"step": 1720
},
{
"epoch": 0.12488269688876055,
"grad_norm": 9.262201280713281,
"learning_rate": 4.99061291493665e-07,
"logits/chosen": -2.890625,
"logits/rejected": -2.625,
"logps/chosen": -444.0,
"logps/rejected": -676.0,
"loss": 0.2925,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -2.859375,
"rewards/margins": 2.453125,
"rewards/rejected": -5.3125,
"step": 1730
},
{
"epoch": 0.1256045621886956,
"grad_norm": 10.008148122591312,
"learning_rate": 4.99005958882125e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.609375,
"logps/chosen": -450.0,
"logps/rejected": -684.0,
"loss": 0.3133,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": -2.953125,
"rewards/margins": 2.359375,
"rewards/rejected": -5.3125,
"step": 1740
},
{
"epoch": 0.12632642748863063,
"grad_norm": 8.554136981806407,
"learning_rate": 4.989490450759331e-07,
"logits/chosen": -2.890625,
"logits/rejected": -2.625,
"logps/chosen": -482.0,
"logps/rejected": -696.0,
"loss": 0.2649,
"rewards/accuracies": 0.84375,
"rewards/chosen": -3.125,
"rewards/margins": 2.3125,
"rewards/rejected": -5.4375,
"step": 1750
},
{
"epoch": 0.12704829278856566,
"grad_norm": 8.929491173417231,
"learning_rate": 4.988905504364933e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.578125,
"logps/chosen": -516.0,
"logps/rejected": -768.0,
"loss": 0.2715,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -3.40625,
"rewards/margins": 2.703125,
"rewards/rejected": -6.09375,
"step": 1760
},
{
"epoch": 0.12777015808850067,
"grad_norm": 19.85583075822656,
"learning_rate": 4.988304753352482e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.609375,
"logps/chosen": -454.0,
"logps/rejected": -744.0,
"loss": 0.2838,
"rewards/accuracies": 0.875,
"rewards/chosen": -3.046875,
"rewards/margins": 2.84375,
"rewards/rejected": -5.875,
"step": 1770
},
{
"epoch": 0.1284920233884357,
"grad_norm": 11.573857511888404,
"learning_rate": 4.987688201536764e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.453125,
"logps/chosen": -404.0,
"logps/rejected": -636.0,
"loss": 0.3207,
"rewards/accuracies": 0.875,
"rewards/chosen": -2.375,
"rewards/margins": 2.453125,
"rewards/rejected": -4.84375,
"step": 1780
},
{
"epoch": 0.12921388868837075,
"grad_norm": 10.767926076980798,
"learning_rate": 4.987055852832899e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.625,
"logps/chosen": -504.0,
"logps/rejected": -784.0,
"loss": 0.2768,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -3.296875,
"rewards/margins": 2.859375,
"rewards/rejected": -6.15625,
"step": 1790
},
{
"epoch": 0.12993575398830579,
"grad_norm": 9.480524665881354,
"learning_rate": 4.986407711256319e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.46875,
"logps/chosen": -434.0,
"logps/rejected": -656.0,
"loss": 0.2996,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": -2.8125,
"rewards/margins": 2.203125,
"rewards/rejected": -5.0,
"step": 1800
},
{
"epoch": 0.13065761928824082,
"grad_norm": 11.059595953397832,
"learning_rate": 4.98574378092274e-07,
"logits/chosen": -2.890625,
"logits/rejected": -2.6875,
"logps/chosen": -506.0,
"logps/rejected": -760.0,
"loss": 0.2706,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -3.40625,
"rewards/margins": 2.828125,
"rewards/rejected": -6.21875,
"step": 1810
},
{
"epoch": 0.13137948458817586,
"grad_norm": 12.559652259820835,
"learning_rate": 4.985064066048139e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.40625,
"logps/chosen": -424.0,
"logps/rejected": -660.0,
"loss": 0.3016,
"rewards/accuracies": 0.875,
"rewards/chosen": -2.625,
"rewards/margins": 2.375,
"rewards/rejected": -5.0,
"step": 1820
},
{
"epoch": 0.13210134988811087,
"grad_norm": 16.780300866871737,
"learning_rate": 4.984368570948724e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.484375,
"logps/chosen": -444.0,
"logps/rejected": -704.0,
"loss": 0.2943,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -2.828125,
"rewards/margins": 2.515625,
"rewards/rejected": -5.34375,
"step": 1830
},
{
"epoch": 0.1328232151880459,
"grad_norm": 10.65248837076819,
"learning_rate": 4.983657300040907e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.65625,
"logps/chosen": -472.0,
"logps/rejected": -704.0,
"loss": 0.2699,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": -3.25,
"rewards/margins": 2.484375,
"rewards/rejected": -5.75,
"step": 1840
},
{
"epoch": 0.13354508048798094,
"grad_norm": 10.948003648298677,
"learning_rate": 4.982930257841278e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.453125,
"logps/chosen": -456.0,
"logps/rejected": -728.0,
"loss": 0.2941,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -2.96875,
"rewards/margins": 2.78125,
"rewards/rejected": -5.75,
"step": 1850
},
{
"epoch": 0.13426694578791598,
"grad_norm": 12.047287233162004,
"learning_rate": 4.982187448966575e-07,
"logits/chosen": -2.65625,
"logits/rejected": -2.46875,
"logps/chosen": -536.0,
"logps/rejected": -768.0,
"loss": 0.2898,
"rewards/accuracies": 0.875,
"rewards/chosen": -3.640625,
"rewards/margins": 2.390625,
"rewards/rejected": -6.03125,
"step": 1860
},
{
"epoch": 0.13498881108785102,
"grad_norm": 14.9941388186048,
"learning_rate": 4.981428878133656e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.4375,
"logps/chosen": -468.0,
"logps/rejected": -772.0,
"loss": 0.2811,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -3.109375,
"rewards/margins": 3.09375,
"rewards/rejected": -6.1875,
"step": 1870
},
{
"epoch": 0.13571067638778603,
"grad_norm": 9.951835424657778,
"learning_rate": 4.980654550159463e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.609375,
"logps/chosen": -492.0,
"logps/rejected": -708.0,
"loss": 0.2732,
"rewards/accuracies": 0.875,
"rewards/chosen": -3.1875,
"rewards/margins": 2.5,
"rewards/rejected": -5.6875,
"step": 1880
},
{
"epoch": 0.13643254168772107,
"grad_norm": 8.861361984310934,
"learning_rate": 4.979864469961004e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.578125,
"logps/chosen": -464.0,
"logps/rejected": -716.0,
"loss": 0.2762,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -3.078125,
"rewards/margins": 2.671875,
"rewards/rejected": -5.75,
"step": 1890
},
{
"epoch": 0.1371544069876561,
"grad_norm": 9.692735634395657,
"learning_rate": 4.979058642555307e-07,
"logits/chosen": -2.859375,
"logits/rejected": -2.578125,
"logps/chosen": -452.0,
"logps/rejected": -676.0,
"loss": 0.2931,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -2.84375,
"rewards/margins": 2.46875,
"rewards/rejected": -5.3125,
"step": 1900
},
{
"epoch": 0.13787627228759114,
"grad_norm": 9.565594633496087,
"learning_rate": 4.978237073059399e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.515625,
"logps/chosen": -464.0,
"logps/rejected": -676.0,
"loss": 0.2898,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -3.078125,
"rewards/margins": 2.171875,
"rewards/rejected": -5.25,
"step": 1910
},
{
"epoch": 0.13859813758752618,
"grad_norm": 11.007909649107406,
"learning_rate": 4.977399766690269e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.40625,
"logps/chosen": -498.0,
"logps/rejected": -796.0,
"loss": 0.2902,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -3.1875,
"rewards/margins": 3.109375,
"rewards/rejected": -6.3125,
"step": 1920
},
{
"epoch": 0.1393200028874612,
"grad_norm": 9.107456714393756,
"learning_rate": 4.976546728764836e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.421875,
"logps/chosen": -498.0,
"logps/rejected": -724.0,
"loss": 0.284,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -3.3125,
"rewards/margins": 2.4375,
"rewards/rejected": -5.75,
"step": 1930
},
{
"epoch": 0.14004186818739622,
"grad_norm": 8.927298343498093,
"learning_rate": 4.975677964699912e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.40625,
"logps/chosen": -502.0,
"logps/rejected": -776.0,
"loss": 0.2524,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -3.5625,
"rewards/margins": 2.796875,
"rewards/rejected": -6.34375,
"step": 1940
},
{
"epoch": 0.14076373348733126,
"grad_norm": 10.144209347121677,
"learning_rate": 4.974793480012174e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.515625,
"logps/chosen": -464.0,
"logps/rejected": -716.0,
"loss": 0.2621,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -2.859375,
"rewards/margins": 2.6875,
"rewards/rejected": -5.5625,
"step": 1950
},
{
"epoch": 0.1414855987872663,
"grad_norm": 7.533895015502329,
"learning_rate": 4.973893280318125e-07,
"logits/chosen": -2.890625,
"logits/rejected": -2.734375,
"logps/chosen": -492.0,
"logps/rejected": -764.0,
"loss": 0.2844,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -3.34375,
"rewards/margins": 2.796875,
"rewards/rejected": -6.125,
"step": 1960
},
{
"epoch": 0.14220746408720134,
"grad_norm": 13.017212573238576,
"learning_rate": 4.972977371334056e-07,
"logits/chosen": -2.65625,
"logits/rejected": -2.5,
"logps/chosen": -424.0,
"logps/rejected": -672.0,
"loss": 0.2873,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -2.5,
"rewards/margins": 2.46875,
"rewards/rejected": -4.96875,
"step": 1970
},
{
"epoch": 0.14292932938713637,
"grad_norm": 8.958119059657708,
"learning_rate": 4.972045758876014e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.59375,
"logps/chosen": -488.0,
"logps/rejected": -724.0,
"loss": 0.2477,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": -3.265625,
"rewards/margins": 2.359375,
"rewards/rejected": -5.625,
"step": 1980
},
{
"epoch": 0.14365119468707138,
"grad_norm": 10.493203877125167,
"learning_rate": 4.971098448859766e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.6875,
"logps/chosen": -488.0,
"logps/rejected": -692.0,
"loss": 0.2933,
"rewards/accuracies": 0.875,
"rewards/chosen": -3.265625,
"rewards/margins": 2.234375,
"rewards/rejected": -5.5,
"step": 1990
},
{
"epoch": 0.14437305998700642,
"grad_norm": 9.973862051012356,
"learning_rate": 4.970135447300752e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.3125,
"logps/chosen": -516.0,
"logps/rejected": -788.0,
"loss": 0.2595,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -3.5,
"rewards/margins": 2.5625,
"rewards/rejected": -6.0625,
"step": 2000
},
{
"epoch": 0.14509492528694146,
"grad_norm": 13.28264552294119,
"learning_rate": 4.969156760314064e-07,
"logits/chosen": -2.65625,
"logits/rejected": -2.453125,
"logps/chosen": -524.0,
"logps/rejected": -796.0,
"loss": 0.2904,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -3.640625,
"rewards/margins": 2.703125,
"rewards/rejected": -6.34375,
"step": 2010
},
{
"epoch": 0.1458167905868765,
"grad_norm": 8.872169286182675,
"learning_rate": 4.968162394114387e-07,
"logits/chosen": -2.5625,
"logits/rejected": -2.46875,
"logps/chosen": -488.0,
"logps/rejected": -744.0,
"loss": 0.2523,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -3.265625,
"rewards/margins": 2.703125,
"rewards/rejected": -5.96875,
"step": 2020
},
{
"epoch": 0.14653865588681153,
"grad_norm": 12.757195149734072,
"learning_rate": 4.967152355015974e-07,
"logits/chosen": -2.609375,
"logits/rejected": -2.546875,
"logps/chosen": -478.0,
"logps/rejected": -724.0,
"loss": 0.2783,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -3.375,
"rewards/margins": 2.5625,
"rewards/rejected": -5.9375,
"step": 2030
},
{
"epoch": 0.14726052118674654,
"grad_norm": 12.796953074989913,
"learning_rate": 4.966126649432603e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.625,
"logps/chosen": -496.0,
"logps/rejected": -780.0,
"loss": 0.2723,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -3.53125,
"rewards/margins": 2.578125,
"rewards/rejected": -6.125,
"step": 2040
},
{
"epoch": 0.14798238648668158,
"grad_norm": 19.108616982264344,
"learning_rate": 4.96508528387753e-07,
"logits/chosen": -3.0625,
"logits/rejected": -2.828125,
"logps/chosen": -540.0,
"logps/rejected": -812.0,
"loss": 0.2763,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -3.96875,
"rewards/margins": 2.734375,
"rewards/rejected": -6.6875,
"step": 2050
},
{
"epoch": 0.14870425178661661,
"grad_norm": 9.380783201026548,
"learning_rate": 4.964028264963456e-07,
"logits/chosen": -2.890625,
"logits/rejected": -2.625,
"logps/chosen": -516.0,
"logps/rejected": -800.0,
"loss": 0.2822,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -3.46875,
"rewards/margins": 2.71875,
"rewards/rejected": -6.1875,
"step": 2060
},
{
"epoch": 0.14942611708655165,
"grad_norm": 10.81595001993398,
"learning_rate": 4.962955599402481e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.53125,
"logps/chosen": -560.0,
"logps/rejected": -784.0,
"loss": 0.266,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": -4.0,
"rewards/margins": 2.25,
"rewards/rejected": -6.25,
"step": 2070
},
{
"epoch": 0.1501479823864867,
"grad_norm": 11.456291625001526,
"learning_rate": 4.961867294006059e-07,
"logits/chosen": -2.921875,
"logits/rejected": -2.796875,
"logps/chosen": -608.0,
"logps/rejected": -836.0,
"loss": 0.3064,
"rewards/accuracies": 0.800000011920929,
"rewards/chosen": -4.46875,
"rewards/margins": 2.40625,
"rewards/rejected": -6.875,
"step": 2080
},
{
"epoch": 0.15086984768642173,
"grad_norm": 7.960182686516041,
"learning_rate": 4.96076335568496e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.5625,
"logps/chosen": -516.0,
"logps/rejected": -776.0,
"loss": 0.2467,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -3.4375,
"rewards/margins": 2.765625,
"rewards/rejected": -6.21875,
"step": 2090
},
{
"epoch": 0.15159171298635674,
"grad_norm": 10.25400623338689,
"learning_rate": 4.959643791449222e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.625,
"logps/chosen": -564.0,
"logps/rejected": -788.0,
"loss": 0.2977,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -3.796875,
"rewards/margins": 2.5625,
"rewards/rejected": -6.375,
"step": 2100
},
{
"epoch": 0.15231357828629177,
"grad_norm": 10.09340211565806,
"learning_rate": 4.958508608408109e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.4375,
"logps/chosen": -544.0,
"logps/rejected": -736.0,
"loss": 0.2829,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": -3.921875,
"rewards/margins": 2.03125,
"rewards/rejected": -5.9375,
"step": 2110
},
{
"epoch": 0.1530354435862268,
"grad_norm": 8.537784621679538,
"learning_rate": 4.957357813770064e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.46875,
"logps/chosen": -596.0,
"logps/rejected": -860.0,
"loss": 0.2479,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.28125,
"rewards/margins": 2.765625,
"rewards/rejected": -7.03125,
"step": 2120
},
{
"epoch": 0.15375730888616185,
"grad_norm": 8.985222338453365,
"learning_rate": 4.956191414842665e-07,
"logits/chosen": -2.96875,
"logits/rejected": -2.71875,
"logps/chosen": -572.0,
"logps/rejected": -860.0,
"loss": 0.2629,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.1875,
"rewards/margins": 2.84375,
"rewards/rejected": -7.03125,
"step": 2130
},
{
"epoch": 0.15447917418609688,
"grad_norm": 10.993021927824719,
"learning_rate": 4.955009419032575e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.515625,
"logps/chosen": -572.0,
"logps/rejected": -840.0,
"loss": 0.2681,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.0,
"rewards/margins": 2.8125,
"rewards/rejected": -6.8125,
"step": 2140
},
{
"epoch": 0.1552010394860319,
"grad_norm": 11.792550816411442,
"learning_rate": 4.953811833845503e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.484375,
"logps/chosen": -528.0,
"logps/rejected": -756.0,
"loss": 0.265,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -3.75,
"rewards/margins": 2.328125,
"rewards/rejected": -6.0625,
"step": 2150
},
{
"epoch": 0.15592290478596693,
"grad_norm": 13.163433586155344,
"learning_rate": 4.952598666886145e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.515625,
"logps/chosen": -600.0,
"logps/rejected": -856.0,
"loss": 0.2516,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.3125,
"rewards/margins": 2.6875,
"rewards/rejected": -7.0,
"step": 2160
},
{
"epoch": 0.15664477008590197,
"grad_norm": 15.36607001210862,
"learning_rate": 4.951369925858147e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.609375,
"logps/chosen": -544.0,
"logps/rejected": -792.0,
"loss": 0.2598,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -3.796875,
"rewards/margins": 2.703125,
"rewards/rejected": -6.5,
"step": 2170
},
{
"epoch": 0.157366635385837,
"grad_norm": 8.701540096554936,
"learning_rate": 4.950125618564046e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.765625,
"logps/chosen": -528.0,
"logps/rejected": -784.0,
"loss": 0.251,
"rewards/accuracies": 0.90625,
"rewards/chosen": -3.625,
"rewards/margins": 2.5625,
"rewards/rejected": -6.1875,
"step": 2180
},
{
"epoch": 0.15808850068577204,
"grad_norm": 10.616304811087307,
"learning_rate": 4.948865752905228e-07,
"logits/chosen": -2.859375,
"logits/rejected": -2.703125,
"logps/chosen": -576.0,
"logps/rejected": -828.0,
"loss": 0.2533,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -4.0625,
"rewards/margins": 2.65625,
"rewards/rejected": -6.75,
"step": 2190
},
{
"epoch": 0.15881036598570708,
"grad_norm": 10.818629515177625,
"learning_rate": 4.947590336881874e-07,
"logits/chosen": -2.859375,
"logits/rejected": -2.53125,
"logps/chosen": -584.0,
"logps/rejected": -816.0,
"loss": 0.2593,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -4.0625,
"rewards/margins": 2.625,
"rewards/rejected": -6.6875,
"step": 2200
},
{
"epoch": 0.1595322312856421,
"grad_norm": 10.595421594796772,
"learning_rate": 4.946299378592912e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.625,
"logps/chosen": -532.0,
"logps/rejected": -784.0,
"loss": 0.2795,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -3.578125,
"rewards/margins": 2.546875,
"rewards/rejected": -6.125,
"step": 2210
},
{
"epoch": 0.16025409658557713,
"grad_norm": 13.24386115549115,
"learning_rate": 4.944992886235961e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.53125,
"logps/chosen": -572.0,
"logps/rejected": -828.0,
"loss": 0.2521,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -3.96875,
"rewards/margins": 2.765625,
"rewards/rejected": -6.71875,
"step": 2220
},
{
"epoch": 0.16097596188551216,
"grad_norm": 8.619302388111215,
"learning_rate": 4.943670868107284e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.609375,
"logps/chosen": -532.0,
"logps/rejected": -832.0,
"loss": 0.27,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -3.65625,
"rewards/margins": 3.078125,
"rewards/rejected": -6.71875,
"step": 2230
},
{
"epoch": 0.1616978271854472,
"grad_norm": 8.272453046055942,
"learning_rate": 4.942333332601731e-07,
"logits/chosen": -2.5625,
"logits/rejected": -2.46875,
"logps/chosen": -564.0,
"logps/rejected": -864.0,
"loss": 0.2661,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -3.984375,
"rewards/margins": 3.1875,
"rewards/rejected": -7.15625,
"step": 2240
},
{
"epoch": 0.16241969248538224,
"grad_norm": 6.171166558818759,
"learning_rate": 4.940980288212691e-07,
"logits/chosen": -2.5,
"logits/rejected": -2.375,
"logps/chosen": -576.0,
"logps/rejected": -800.0,
"loss": 0.2574,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.03125,
"rewards/margins": 2.453125,
"rewards/rejected": -6.46875,
"step": 2250
},
{
"epoch": 0.16314155778531725,
"grad_norm": 9.42178572046336,
"learning_rate": 4.939611743532031e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.59375,
"logps/chosen": -560.0,
"logps/rejected": -828.0,
"loss": 0.2385,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -3.9375,
"rewards/margins": 2.828125,
"rewards/rejected": -6.78125,
"step": 2260
},
{
"epoch": 0.16386342308525229,
"grad_norm": 8.438515261081413,
"learning_rate": 4.93822770725005e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.625,
"logps/chosen": -544.0,
"logps/rejected": -776.0,
"loss": 0.2737,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -3.734375,
"rewards/margins": 2.609375,
"rewards/rejected": -6.34375,
"step": 2270
},
{
"epoch": 0.16458528838518732,
"grad_norm": 11.043392051990788,
"learning_rate": 4.936828188155413e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.65625,
"logps/chosen": -520.0,
"logps/rejected": -776.0,
"loss": 0.2496,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -3.625,
"rewards/margins": 2.640625,
"rewards/rejected": -6.28125,
"step": 2280
},
{
"epoch": 0.16530715368512236,
"grad_norm": 10.831257780639715,
"learning_rate": 4.935413195135106e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.6875,
"logps/chosen": -572.0,
"logps/rejected": -872.0,
"loss": 0.2479,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.03125,
"rewards/margins": 3.140625,
"rewards/rejected": -7.15625,
"step": 2290
},
{
"epoch": 0.1660290189850574,
"grad_norm": 9.747157511340994,
"learning_rate": 4.933982737174374e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.640625,
"logps/chosen": -560.0,
"logps/rejected": -852.0,
"loss": 0.2701,
"rewards/accuracies": 0.84375,
"rewards/chosen": -4.09375,
"rewards/margins": 2.796875,
"rewards/rejected": -6.875,
"step": 2300
},
{
"epoch": 0.1667508842849924,
"grad_norm": 9.870871070277088,
"learning_rate": 4.932536823356664e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.5625,
"logps/chosen": -620.0,
"logps/rejected": -880.0,
"loss": 0.2543,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.6875,
"rewards/margins": 2.578125,
"rewards/rejected": -7.28125,
"step": 2310
},
{
"epoch": 0.16747274958492744,
"grad_norm": 8.8575895636107,
"learning_rate": 4.931075462863567e-07,
"logits/chosen": -2.96875,
"logits/rejected": -2.609375,
"logps/chosen": -604.0,
"logps/rejected": -912.0,
"loss": 0.2594,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -4.375,
"rewards/margins": 3.0625,
"rewards/rejected": -7.4375,
"step": 2320
},
{
"epoch": 0.16819461488486248,
"grad_norm": 7.816395810688846,
"learning_rate": 4.929598664974762e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.609375,
"logps/chosen": -652.0,
"logps/rejected": -940.0,
"loss": 0.2511,
"rewards/accuracies": 0.9375,
"rewards/chosen": -4.65625,
"rewards/margins": 3.25,
"rewards/rejected": -7.90625,
"step": 2330
},
{
"epoch": 0.16891648018479752,
"grad_norm": 8.344064880799563,
"learning_rate": 4.928106439067958e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.46875,
"logps/chosen": -560.0,
"logps/rejected": -816.0,
"loss": 0.2669,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": -4.09375,
"rewards/margins": 2.53125,
"rewards/rejected": -6.625,
"step": 2340
},
{
"epoch": 0.16963834548473256,
"grad_norm": 10.994252200422187,
"learning_rate": 4.926598794618829e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.5,
"logps/chosen": -552.0,
"logps/rejected": -784.0,
"loss": 0.278,
"rewards/accuracies": 0.90625,
"rewards/chosen": -3.921875,
"rewards/margins": 2.5625,
"rewards/rejected": -6.46875,
"step": 2350
},
{
"epoch": 0.1703602107846676,
"grad_norm": 15.14815293816792,
"learning_rate": 4.92507574120096e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.5,
"logps/chosen": -604.0,
"logps/rejected": -852.0,
"loss": 0.2777,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": -4.375,
"rewards/margins": 2.609375,
"rewards/rejected": -7.0,
"step": 2360
},
{
"epoch": 0.1710820760846026,
"grad_norm": 7.821370479620557,
"learning_rate": 4.923537288485779e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.5,
"logps/chosen": -556.0,
"logps/rejected": -812.0,
"loss": 0.2638,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -4.09375,
"rewards/margins": 2.59375,
"rewards/rejected": -6.6875,
"step": 2370
},
{
"epoch": 0.17180394138453764,
"grad_norm": 9.211826498394792,
"learning_rate": 4.921983446242506e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.609375,
"logps/chosen": -644.0,
"logps/rejected": -944.0,
"loss": 0.2493,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.59375,
"rewards/margins": 3.265625,
"rewards/rejected": -7.875,
"step": 2380
},
{
"epoch": 0.17252580668447268,
"grad_norm": 8.298256232187494,
"learning_rate": 4.92041422433808e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.609375,
"logps/chosen": -548.0,
"logps/rejected": -924.0,
"loss": 0.2348,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -3.921875,
"rewards/margins": 3.71875,
"rewards/rejected": -7.65625,
"step": 2390
},
{
"epoch": 0.17324767198440771,
"grad_norm": 10.983625039262604,
"learning_rate": 4.918829632737103e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.625,
"logps/chosen": -560.0,
"logps/rejected": -896.0,
"loss": 0.2633,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.125,
"rewards/margins": 3.375,
"rewards/rejected": -7.5,
"step": 2400
},
{
"epoch": 0.17396953728434275,
"grad_norm": 12.61039915689691,
"learning_rate": 4.917229681501774e-07,
"logits/chosen": -2.65625,
"logits/rejected": -2.53125,
"logps/chosen": -580.0,
"logps/rejected": -824.0,
"loss": 0.264,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.0625,
"rewards/margins": 2.609375,
"rewards/rejected": -6.6875,
"step": 2410
},
{
"epoch": 0.17469140258427776,
"grad_norm": 11.643682996836732,
"learning_rate": 4.91561438079183e-07,
"logits/chosen": -2.578125,
"logits/rejected": -2.34375,
"logps/chosen": -628.0,
"logps/rejected": -900.0,
"loss": 0.2668,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.625,
"rewards/margins": 2.6875,
"rewards/rejected": -7.3125,
"step": 2420
},
{
"epoch": 0.1754132678842128,
"grad_norm": 13.088952482660957,
"learning_rate": 4.913983740864473e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.390625,
"logps/chosen": -632.0,
"logps/rejected": -920.0,
"loss": 0.2359,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.5625,
"rewards/margins": 2.859375,
"rewards/rejected": -7.4375,
"step": 2430
},
{
"epoch": 0.17613513318414784,
"grad_norm": 10.188119267424455,
"learning_rate": 4.91233777207431e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.453125,
"logps/chosen": -592.0,
"logps/rejected": -916.0,
"loss": 0.2748,
"rewards/accuracies": 0.856249988079071,
"rewards/chosen": -4.46875,
"rewards/margins": 3.203125,
"rewards/rejected": -7.6875,
"step": 2440
},
{
"epoch": 0.17685699848408287,
"grad_norm": 8.609826083562075,
"learning_rate": 4.910676484873292e-07,
"logits/chosen": -2.5,
"logits/rejected": -2.390625,
"logps/chosen": -612.0,
"logps/rejected": -864.0,
"loss": 0.2658,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.4375,
"rewards/margins": 2.671875,
"rewards/rejected": -7.09375,
"step": 2450
},
{
"epoch": 0.1775788637840179,
"grad_norm": 10.48253643988837,
"learning_rate": 4.908999889810633e-07,
"logits/chosen": -2.578125,
"logits/rejected": -2.375,
"logps/chosen": -572.0,
"logps/rejected": -876.0,
"loss": 0.2331,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -4.03125,
"rewards/margins": 3.140625,
"rewards/rejected": -7.15625,
"step": 2460
},
{
"epoch": 0.17830072908395295,
"grad_norm": 17.344352556263694,
"learning_rate": 4.907307997532761e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.59375,
"logps/chosen": -632.0,
"logps/rejected": -984.0,
"loss": 0.2354,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -4.6875,
"rewards/margins": 3.484375,
"rewards/rejected": -8.125,
"step": 2470
},
{
"epoch": 0.17902259438388796,
"grad_norm": 9.982854645114383,
"learning_rate": 4.905600818783237e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.53125,
"logps/chosen": -664.0,
"logps/rejected": -980.0,
"loss": 0.3273,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.75,
"rewards/margins": 3.515625,
"rewards/rejected": -8.25,
"step": 2480
},
{
"epoch": 0.179744459683823,
"grad_norm": 10.68094022282627,
"learning_rate": 4.903878364402691e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.59375,
"logps/chosen": -568.0,
"logps/rejected": -836.0,
"loss": 0.2468,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -3.953125,
"rewards/margins": 2.953125,
"rewards/rejected": -6.90625,
"step": 2490
},
{
"epoch": 0.18046632498375803,
"grad_norm": 8.296383042780498,
"learning_rate": 4.902140645328759e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.546875,
"logps/chosen": -564.0,
"logps/rejected": -848.0,
"loss": 0.2599,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.1875,
"rewards/margins": 2.9375,
"rewards/rejected": -7.125,
"step": 2500
},
{
"epoch": 0.18118819028369307,
"grad_norm": 9.103787824302069,
"learning_rate": 4.900387672596003e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.4375,
"logps/chosen": -528.0,
"logps/rejected": -816.0,
"loss": 0.2318,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -3.671875,
"rewards/margins": 3.015625,
"rewards/rejected": -6.6875,
"step": 2510
},
{
"epoch": 0.1819100555836281,
"grad_norm": 16.67988360600736,
"learning_rate": 4.898619457335848e-07,
"logits/chosen": -2.578125,
"logits/rejected": -2.4375,
"logps/chosen": -568.0,
"logps/rejected": -844.0,
"loss": 0.248,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.0,
"rewards/margins": 2.921875,
"rewards/rejected": -6.9375,
"step": 2520
},
{
"epoch": 0.18263192088356311,
"grad_norm": 10.469848545031832,
"learning_rate": 4.896836010776509e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.53125,
"logps/chosen": -644.0,
"logps/rejected": -1012.0,
"loss": 0.2595,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.78125,
"rewards/margins": 3.59375,
"rewards/rejected": -8.375,
"step": 2530
},
{
"epoch": 0.18335378618349815,
"grad_norm": 9.661637065408652,
"learning_rate": 4.895037344242921e-07,
"logits/chosen": -2.484375,
"logits/rejected": -2.296875,
"logps/chosen": -580.0,
"logps/rejected": -856.0,
"loss": 0.2585,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.125,
"rewards/margins": 2.953125,
"rewards/rejected": -7.09375,
"step": 2540
},
{
"epoch": 0.1840756514834332,
"grad_norm": 8.853616581850865,
"learning_rate": 4.893223469156664e-07,
"logits/chosen": -2.609375,
"logits/rejected": -2.390625,
"logps/chosen": -584.0,
"logps/rejected": -856.0,
"loss": 0.249,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": -4.1875,
"rewards/margins": 2.78125,
"rewards/rejected": -6.9375,
"step": 2550
},
{
"epoch": 0.18479751678336823,
"grad_norm": 14.23122096213618,
"learning_rate": 4.891394397035896e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.53125,
"logps/chosen": -588.0,
"logps/rejected": -848.0,
"loss": 0.2458,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -4.25,
"rewards/margins": 2.75,
"rewards/rejected": -7.0,
"step": 2560
},
{
"epoch": 0.18551938208330326,
"grad_norm": 7.165047283079565,
"learning_rate": 4.889550139495275e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.59375,
"logps/chosen": -556.0,
"logps/rejected": -872.0,
"loss": 0.2193,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -3.90625,
"rewards/margins": 3.25,
"rewards/rejected": -7.15625,
"step": 2570
},
{
"epoch": 0.1862412473832383,
"grad_norm": 9.892022723104382,
"learning_rate": 4.887690708245887e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.53125,
"logps/chosen": -540.0,
"logps/rejected": -860.0,
"loss": 0.2276,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -3.765625,
"rewards/margins": 3.125,
"rewards/rejected": -6.875,
"step": 2580
},
{
"epoch": 0.1869631126831733,
"grad_norm": 9.543867068973059,
"learning_rate": 4.885816115095171e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.515625,
"logps/chosen": -600.0,
"logps/rejected": -928.0,
"loss": 0.2391,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.375,
"rewards/margins": 3.203125,
"rewards/rejected": -7.5625,
"step": 2590
},
{
"epoch": 0.18768497798310835,
"grad_norm": 10.889738728754864,
"learning_rate": 4.883926371946843e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.375,
"logps/chosen": -608.0,
"logps/rejected": -872.0,
"loss": 0.2702,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.375,
"rewards/margins": 2.671875,
"rewards/rejected": -7.03125,
"step": 2600
},
{
"epoch": 0.18840684328304338,
"grad_norm": 6.728294158129367,
"learning_rate": 4.882021490800826e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.453125,
"logps/chosen": -580.0,
"logps/rejected": -816.0,
"loss": 0.2438,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -4.09375,
"rewards/margins": 2.453125,
"rewards/rejected": -6.53125,
"step": 2610
},
{
"epoch": 0.18912870858297842,
"grad_norm": 9.374612134195704,
"learning_rate": 4.880101483753167e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.4375,
"logps/chosen": -560.0,
"logps/rejected": -896.0,
"loss": 0.2198,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.1875,
"rewards/margins": 3.15625,
"rewards/rejected": -7.34375,
"step": 2620
},
{
"epoch": 0.18985057388291346,
"grad_norm": 8.403906697614635,
"learning_rate": 4.878166362995963e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.578125,
"logps/chosen": -588.0,
"logps/rejected": -900.0,
"loss": 0.2728,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.21875,
"rewards/margins": 3.015625,
"rewards/rejected": -7.25,
"step": 2630
},
{
"epoch": 0.19057243918284847,
"grad_norm": 9.739452944604345,
"learning_rate": 4.876216140817285e-07,
"logits/chosen": -2.546875,
"logits/rejected": -2.296875,
"logps/chosen": -568.0,
"logps/rejected": -856.0,
"loss": 0.2399,
"rewards/accuracies": 0.9375,
"rewards/chosen": -4.09375,
"rewards/margins": 2.890625,
"rewards/rejected": -7.0,
"step": 2640
},
{
"epoch": 0.1912943044827835,
"grad_norm": 9.412524327526398,
"learning_rate": 4.874250829601094e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.515625,
"logps/chosen": -672.0,
"logps/rejected": -928.0,
"loss": 0.2287,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": -4.8125,
"rewards/margins": 2.796875,
"rewards/rejected": -7.59375,
"step": 2650
},
{
"epoch": 0.19201616978271854,
"grad_norm": 9.67143825795057,
"learning_rate": 4.872270441827174e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.453125,
"logps/chosen": -668.0,
"logps/rejected": -960.0,
"loss": 0.2358,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -4.96875,
"rewards/margins": 3.0,
"rewards/rejected": -8.0,
"step": 2660
},
{
"epoch": 0.19273803508265358,
"grad_norm": 10.225198499138108,
"learning_rate": 4.870274990071038e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.453125,
"logps/chosen": -568.0,
"logps/rejected": -868.0,
"loss": 0.2511,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.28125,
"rewards/margins": 3.0625,
"rewards/rejected": -7.3125,
"step": 2670
},
{
"epoch": 0.19345990038258862,
"grad_norm": 8.93422692887298,
"learning_rate": 4.868264487003862e-07,
"logits/chosen": -2.578125,
"logits/rejected": -2.40625,
"logps/chosen": -588.0,
"logps/rejected": -908.0,
"loss": 0.2518,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.28125,
"rewards/margins": 3.125,
"rewards/rejected": -7.40625,
"step": 2680
},
{
"epoch": 0.19418176568252365,
"grad_norm": 8.108160852039612,
"learning_rate": 4.866238945392393e-07,
"logits/chosen": -2.5625,
"logits/rejected": -2.46875,
"logps/chosen": -588.0,
"logps/rejected": -840.0,
"loss": 0.2465,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.1875,
"rewards/margins": 2.78125,
"rewards/rejected": -6.96875,
"step": 2690
},
{
"epoch": 0.19490363098245866,
"grad_norm": 8.305890952481619,
"learning_rate": 4.864198378098877e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.46875,
"logps/chosen": -510.0,
"logps/rejected": -804.0,
"loss": 0.237,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -3.5,
"rewards/margins": 3.015625,
"rewards/rejected": -6.53125,
"step": 2700
},
{
"epoch": 0.1956254962823937,
"grad_norm": 12.954558843929119,
"learning_rate": 4.862142798080973e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.578125,
"logps/chosen": -576.0,
"logps/rejected": -848.0,
"loss": 0.2245,
"rewards/accuracies": 0.875,
"rewards/chosen": -4.15625,
"rewards/margins": 2.96875,
"rewards/rejected": -7.125,
"step": 2710
},
{
"epoch": 0.19634736158232874,
"grad_norm": 6.775612276163364,
"learning_rate": 4.860072218391669e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.625,
"logps/chosen": -556.0,
"logps/rejected": -872.0,
"loss": 0.2153,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -3.90625,
"rewards/margins": 3.296875,
"rewards/rejected": -7.21875,
"step": 2720
},
{
"epoch": 0.19706922688226378,
"grad_norm": 8.770593576643066,
"learning_rate": 4.857986652179203e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.4375,
"logps/chosen": -596.0,
"logps/rejected": -872.0,
"loss": 0.2534,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.15625,
"rewards/margins": 2.765625,
"rewards/rejected": -6.9375,
"step": 2730
},
{
"epoch": 0.1977910921821988,
"grad_norm": 8.729235176349604,
"learning_rate": 4.855886112686977e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.59375,
"logps/chosen": -596.0,
"logps/rejected": -920.0,
"loss": 0.2018,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -4.3125,
"rewards/margins": 3.25,
"rewards/rejected": -7.5625,
"step": 2740
},
{
"epoch": 0.19851295748213382,
"grad_norm": 10.466383153721448,
"learning_rate": 4.853770613253476e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.59375,
"logps/chosen": -564.0,
"logps/rejected": -884.0,
"loss": 0.2365,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -4.15625,
"rewards/margins": 3.390625,
"rewards/rejected": -7.53125,
"step": 2750
},
{
"epoch": 0.19923482278206886,
"grad_norm": 10.738593768361735,
"learning_rate": 4.851640167312178e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.4375,
"logps/chosen": -568.0,
"logps/rejected": -868.0,
"loss": 0.224,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.0,
"rewards/margins": 2.96875,
"rewards/rejected": -7.0,
"step": 2760
},
{
"epoch": 0.1999566880820039,
"grad_norm": 9.416300695572696,
"learning_rate": 4.849494788391473e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.4375,
"logps/chosen": -664.0,
"logps/rejected": -1032.0,
"loss": 0.2284,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.03125,
"rewards/margins": 3.75,
"rewards/rejected": -8.8125,
"step": 2770
},
{
"epoch": 0.20067855338193893,
"grad_norm": 9.528669823636646,
"learning_rate": 4.847334490114576e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.5625,
"logps/chosen": -628.0,
"logps/rejected": -916.0,
"loss": 0.2293,
"rewards/accuracies": 0.875,
"rewards/chosen": -4.75,
"rewards/margins": 3.0625,
"rewards/rejected": -7.8125,
"step": 2780
},
{
"epoch": 0.20140041868187397,
"grad_norm": 9.797059355953671,
"learning_rate": 4.84515928619944e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.59375,
"logps/chosen": -632.0,
"logps/rejected": -988.0,
"loss": 0.2094,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.625,
"rewards/margins": 3.515625,
"rewards/rejected": -8.1875,
"step": 2790
},
{
"epoch": 0.20212228398180898,
"grad_norm": 9.406533092835442,
"learning_rate": 4.84296919045867e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.4375,
"logps/chosen": -624.0,
"logps/rejected": -968.0,
"loss": 0.2334,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -4.625,
"rewards/margins": 3.171875,
"rewards/rejected": -7.78125,
"step": 2800
},
{
"epoch": 0.20284414928174402,
"grad_norm": 9.254549987899654,
"learning_rate": 4.840764216799433e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.375,
"logps/chosen": -608.0,
"logps/rejected": -904.0,
"loss": 0.2337,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.46875,
"rewards/margins": 3.0,
"rewards/rejected": -7.46875,
"step": 2810
},
{
"epoch": 0.20356601458167906,
"grad_norm": 9.14538857003236,
"learning_rate": 4.838544379223373e-07,
"logits/chosen": -2.953125,
"logits/rejected": -2.671875,
"logps/chosen": -592.0,
"logps/rejected": -904.0,
"loss": 0.2619,
"rewards/accuracies": 0.875,
"rewards/chosen": -4.28125,
"rewards/margins": 3.21875,
"rewards/rejected": -7.5,
"step": 2820
},
{
"epoch": 0.2042878798816141,
"grad_norm": 9.535277544276601,
"learning_rate": 4.836309691826518e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.671875,
"logps/chosen": -556.0,
"logps/rejected": -840.0,
"loss": 0.238,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.03125,
"rewards/margins": 2.875,
"rewards/rejected": -6.90625,
"step": 2830
},
{
"epoch": 0.20500974518154913,
"grad_norm": 8.327834581371992,
"learning_rate": 4.834060168799195e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.46875,
"logps/chosen": -592.0,
"logps/rejected": -856.0,
"loss": 0.2305,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.15625,
"rewards/margins": 2.875,
"rewards/rejected": -7.03125,
"step": 2840
},
{
"epoch": 0.20573161048148417,
"grad_norm": 7.7347670431429405,
"learning_rate": 4.831795824425938e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.546875,
"logps/chosen": -620.0,
"logps/rejected": -916.0,
"loss": 0.2542,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.46875,
"rewards/margins": 3.171875,
"rewards/rejected": -7.625,
"step": 2850
},
{
"epoch": 0.20645347578141918,
"grad_norm": 8.15521635648461,
"learning_rate": 4.829516673085394e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.421875,
"logps/chosen": -604.0,
"logps/rejected": -904.0,
"loss": 0.2113,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.375,
"rewards/margins": 3.078125,
"rewards/rejected": -7.4375,
"step": 2860
},
{
"epoch": 0.20717534108135421,
"grad_norm": 8.022215432273788,
"learning_rate": 4.827222729250236e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.46875,
"logps/chosen": -596.0,
"logps/rejected": -916.0,
"loss": 0.2461,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.21875,
"rewards/margins": 3.421875,
"rewards/rejected": -7.65625,
"step": 2870
},
{
"epoch": 0.20789720638128925,
"grad_norm": 7.199943747449723,
"learning_rate": 4.824914007487072e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.609375,
"logps/chosen": -588.0,
"logps/rejected": -932.0,
"loss": 0.2155,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.34375,
"rewards/margins": 3.40625,
"rewards/rejected": -7.75,
"step": 2880
},
{
"epoch": 0.2086190716812243,
"grad_norm": 12.583865202253415,
"learning_rate": 4.822590522456347e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.65625,
"logps/chosen": -560.0,
"logps/rejected": -844.0,
"loss": 0.2309,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.0,
"rewards/margins": 3.0,
"rewards/rejected": -7.0,
"step": 2890
},
{
"epoch": 0.20934093698115933,
"grad_norm": 10.061884816438084,
"learning_rate": 4.820252288912254e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.671875,
"logps/chosen": -600.0,
"logps/rejected": -876.0,
"loss": 0.2257,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -4.3125,
"rewards/margins": 2.875,
"rewards/rejected": -7.1875,
"step": 2900
},
{
"epoch": 0.21006280228109434,
"grad_norm": 8.24310045419468,
"learning_rate": 4.817899321702642e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.625,
"logps/chosen": -620.0,
"logps/rejected": -952.0,
"loss": 0.2341,
"rewards/accuracies": 0.9375,
"rewards/chosen": -4.34375,
"rewards/margins": 3.484375,
"rewards/rejected": -7.84375,
"step": 2910
},
{
"epoch": 0.21078466758102937,
"grad_norm": 9.993736684687924,
"learning_rate": 4.815531635768916e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.390625,
"logps/chosen": -628.0,
"logps/rejected": -952.0,
"loss": 0.2298,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -4.65625,
"rewards/margins": 3.109375,
"rewards/rejected": -7.78125,
"step": 2920
},
{
"epoch": 0.2115065328809644,
"grad_norm": 8.215550634524817,
"learning_rate": 4.813149246145946e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.625,
"logps/chosen": -648.0,
"logps/rejected": -968.0,
"loss": 0.2413,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": -4.875,
"rewards/margins": 3.203125,
"rewards/rejected": -8.0625,
"step": 2930
},
{
"epoch": 0.21222839818089945,
"grad_norm": 6.880787558392017,
"learning_rate": 4.810752167961971e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.390625,
"logps/chosen": -624.0,
"logps/rejected": -904.0,
"loss": 0.2364,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.6875,
"rewards/margins": 2.71875,
"rewards/rejected": -7.40625,
"step": 2940
},
{
"epoch": 0.21295026348083448,
"grad_norm": 8.022287212940531,
"learning_rate": 4.808340416438505e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.453125,
"logps/chosen": -632.0,
"logps/rejected": -880.0,
"loss": 0.2212,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.75,
"rewards/margins": 2.734375,
"rewards/rejected": -7.46875,
"step": 2950
},
{
"epoch": 0.21367212878076952,
"grad_norm": 10.935811215207599,
"learning_rate": 4.805914006890234e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.5625,
"logps/chosen": -692.0,
"logps/rejected": -972.0,
"loss": 0.2454,
"rewards/accuracies": 0.90625,
"rewards/chosen": -5.1875,
"rewards/margins": 2.875,
"rewards/rejected": -8.0625,
"step": 2960
},
{
"epoch": 0.21439399408070453,
"grad_norm": 7.928137164090748,
"learning_rate": 4.803472954724928e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.515625,
"logps/chosen": -676.0,
"logps/rejected": -944.0,
"loss": 0.2296,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.125,
"rewards/margins": 2.828125,
"rewards/rejected": -7.96875,
"step": 2970
},
{
"epoch": 0.21511585938063957,
"grad_norm": 10.309732813070605,
"learning_rate": 4.801017275443331e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.5625,
"logps/chosen": -676.0,
"logps/rejected": -980.0,
"loss": 0.2371,
"rewards/accuracies": 0.875,
"rewards/chosen": -5.125,
"rewards/margins": 3.234375,
"rewards/rejected": -8.375,
"step": 2980
},
{
"epoch": 0.2158377246805746,
"grad_norm": 9.479637952138695,
"learning_rate": 4.798546984639076e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.4375,
"logps/chosen": -712.0,
"logps/rejected": -1040.0,
"loss": 0.216,
"rewards/accuracies": 0.90625,
"rewards/chosen": -5.5625,
"rewards/margins": 3.3125,
"rewards/rejected": -8.875,
"step": 2990
},
{
"epoch": 0.21655958998050964,
"grad_norm": 11.653196066334537,
"learning_rate": 4.796062097998578e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.375,
"logps/chosen": -700.0,
"logps/rejected": -988.0,
"loss": 0.2311,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -5.28125,
"rewards/margins": 3.125,
"rewards/rejected": -8.375,
"step": 3000
},
{
"epoch": 0.21728145528044468,
"grad_norm": 12.258514957096317,
"learning_rate": 4.793562631300932e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.625,
"logps/chosen": -712.0,
"logps/rejected": -996.0,
"loss": 0.2292,
"rewards/accuracies": 0.875,
"rewards/chosen": -5.5,
"rewards/margins": 2.875,
"rewards/rejected": -8.375,
"step": 3010
},
{
"epoch": 0.2180033205803797,
"grad_norm": 7.907531921224019,
"learning_rate": 4.791048600417824e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.640625,
"logps/chosen": -660.0,
"logps/rejected": -984.0,
"loss": 0.2244,
"rewards/accuracies": 0.90625,
"rewards/chosen": -5.03125,
"rewards/margins": 3.34375,
"rewards/rejected": -8.375,
"step": 3020
},
{
"epoch": 0.21872518588031473,
"grad_norm": 8.125306615010935,
"learning_rate": 4.788520021313416e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.8125,
"logps/chosen": -636.0,
"logps/rejected": -952.0,
"loss": 0.2078,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.75,
"rewards/margins": 3.140625,
"rewards/rejected": -7.875,
"step": 3030
},
{
"epoch": 0.21944705118024976,
"grad_norm": 9.119966563903791,
"learning_rate": 4.785976910044255e-07,
"logits/chosen": -2.9375,
"logits/rejected": -2.703125,
"logps/chosen": -576.0,
"logps/rejected": -924.0,
"loss": 0.2032,
"rewards/accuracies": 0.9375,
"rewards/chosen": -4.1875,
"rewards/margins": 3.625,
"rewards/rejected": -7.8125,
"step": 3040
},
{
"epoch": 0.2201689164801848,
"grad_norm": 12.1919687251649,
"learning_rate": 4.783419282759168e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.578125,
"logps/chosen": -624.0,
"logps/rejected": -928.0,
"loss": 0.2312,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.65625,
"rewards/margins": 3.21875,
"rewards/rejected": -7.84375,
"step": 3050
},
{
"epoch": 0.22089078178011984,
"grad_norm": 10.966337886877598,
"learning_rate": 4.780847155699157e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.484375,
"logps/chosen": -656.0,
"logps/rejected": -960.0,
"loss": 0.2282,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.90625,
"rewards/margins": 3.140625,
"rewards/rejected": -8.0625,
"step": 3060
},
{
"epoch": 0.22161264708005488,
"grad_norm": 10.89546424385192,
"learning_rate": 4.778260545197301e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.609375,
"logps/chosen": -628.0,
"logps/rejected": -916.0,
"loss": 0.2326,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.78125,
"rewards/margins": 2.9375,
"rewards/rejected": -7.71875,
"step": 3070
},
{
"epoch": 0.22233451237998988,
"grad_norm": 8.635404642662332,
"learning_rate": 4.775659467678645e-07,
"logits/chosen": -2.890625,
"logits/rejected": -2.71875,
"logps/chosen": -688.0,
"logps/rejected": -1004.0,
"loss": 0.213,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -5.25,
"rewards/margins": 3.390625,
"rewards/rejected": -8.625,
"step": 3080
},
{
"epoch": 0.22305637767992492,
"grad_norm": 13.172555524642066,
"learning_rate": 4.773043939660105e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.671875,
"logps/chosen": -656.0,
"logps/rejected": -956.0,
"loss": 0.2527,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.875,
"rewards/margins": 3.171875,
"rewards/rejected": -8.0625,
"step": 3090
},
{
"epoch": 0.22377824297985996,
"grad_norm": 10.053263971609315,
"learning_rate": 4.770413977750353e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.515625,
"logps/chosen": -680.0,
"logps/rejected": -984.0,
"loss": 0.2074,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -5.0625,
"rewards/margins": 3.234375,
"rewards/rejected": -8.3125,
"step": 3100
},
{
"epoch": 0.224500108279795,
"grad_norm": 7.080435865876819,
"learning_rate": 4.7677695986497225e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.515625,
"logps/chosen": -676.0,
"logps/rejected": -956.0,
"loss": 0.2285,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.0,
"rewards/margins": 2.90625,
"rewards/rejected": -7.90625,
"step": 3110
},
{
"epoch": 0.22522197357973003,
"grad_norm": 8.489071949818994,
"learning_rate": 4.7651108191500896e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.578125,
"logps/chosen": -624.0,
"logps/rejected": -948.0,
"loss": 0.2217,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.46875,
"rewards/margins": 3.3125,
"rewards/rejected": -7.75,
"step": 3120
},
{
"epoch": 0.22594383887966504,
"grad_norm": 7.48950614324499,
"learning_rate": 4.762437656134778e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.6875,
"logps/chosen": -648.0,
"logps/rejected": -956.0,
"loss": 0.2206,
"rewards/accuracies": 0.875,
"rewards/chosen": -4.8125,
"rewards/margins": 3.28125,
"rewards/rejected": -8.0625,
"step": 3130
},
{
"epoch": 0.22666570417960008,
"grad_norm": 11.147541103318718,
"learning_rate": 4.7597501265784466e-07,
"logits/chosen": -2.65625,
"logits/rejected": -2.484375,
"logps/chosen": -660.0,
"logps/rejected": -924.0,
"loss": 0.2274,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -5.0,
"rewards/margins": 2.75,
"rewards/rejected": -7.75,
"step": 3140
},
{
"epoch": 0.22738756947953512,
"grad_norm": 9.2136696723812,
"learning_rate": 4.757048247546982e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.453125,
"logps/chosen": -612.0,
"logps/rejected": -940.0,
"loss": 0.2588,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -4.625,
"rewards/margins": 3.34375,
"rewards/rejected": -7.96875,
"step": 3150
},
{
"epoch": 0.22810943477947015,
"grad_norm": 12.83236893491969,
"learning_rate": 4.7543320361973884e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.46875,
"logps/chosen": -604.0,
"logps/rejected": -904.0,
"loss": 0.2172,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.5,
"rewards/margins": 3.109375,
"rewards/rejected": -7.625,
"step": 3160
},
{
"epoch": 0.2288313000794052,
"grad_norm": 9.608775546642143,
"learning_rate": 4.751601509777683e-07,
"logits/chosen": -2.921875,
"logits/rejected": -2.625,
"logps/chosen": -620.0,
"logps/rejected": -968.0,
"loss": 0.219,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -4.6875,
"rewards/margins": 3.421875,
"rewards/rejected": -8.125,
"step": 3170
},
{
"epoch": 0.2295531653793402,
"grad_norm": 8.893320591024583,
"learning_rate": 4.748856685626784e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.6875,
"logps/chosen": -620.0,
"logps/rejected": -932.0,
"loss": 0.2299,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -4.46875,
"rewards/margins": 3.21875,
"rewards/rejected": -7.6875,
"step": 3180
},
{
"epoch": 0.23027503067927524,
"grad_norm": 6.813416083172801,
"learning_rate": 4.7460975811743986e-07,
"logits/chosen": -2.890625,
"logits/rejected": -2.734375,
"logps/chosen": -672.0,
"logps/rejected": -992.0,
"loss": 0.2321,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.9375,
"rewards/margins": 3.3125,
"rewards/rejected": -8.25,
"step": 3190
},
{
"epoch": 0.23099689597921028,
"grad_norm": 11.910753128704322,
"learning_rate": 4.743324213940917e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.59375,
"logps/chosen": -580.0,
"logps/rejected": -864.0,
"loss": 0.2362,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.1875,
"rewards/margins": 2.953125,
"rewards/rejected": -7.15625,
"step": 3200
},
{
"epoch": 0.2317187612791453,
"grad_norm": 10.880683342821822,
"learning_rate": 4.740536601537295e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.71875,
"logps/chosen": -632.0,
"logps/rejected": -924.0,
"loss": 0.226,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.53125,
"rewards/margins": 3.125,
"rewards/rejected": -7.6875,
"step": 3210
},
{
"epoch": 0.23244062657908035,
"grad_norm": 9.387075119803855,
"learning_rate": 4.73773476166495e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.546875,
"logps/chosen": -620.0,
"logps/rejected": -916.0,
"loss": 0.2052,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.53125,
"rewards/margins": 3.0625,
"rewards/rejected": -7.59375,
"step": 3220
},
{
"epoch": 0.2331624918790154,
"grad_norm": 9.319384117903645,
"learning_rate": 4.73491871211564e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.5,
"logps/chosen": -568.0,
"logps/rejected": -880.0,
"loss": 0.2334,
"rewards/accuracies": 0.9375,
"rewards/chosen": -4.0,
"rewards/margins": 3.15625,
"rewards/rejected": -7.15625,
"step": 3230
},
{
"epoch": 0.2338843571789504,
"grad_norm": 7.92062494143796,
"learning_rate": 4.7320884707713573e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.375,
"logps/chosen": -572.0,
"logps/rejected": -872.0,
"loss": 0.226,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.09375,
"rewards/margins": 3.0625,
"rewards/rejected": -7.15625,
"step": 3240
},
{
"epoch": 0.23460622247888543,
"grad_norm": 7.5905378566734445,
"learning_rate": 4.7292440556042116e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.421875,
"logps/chosen": -636.0,
"logps/rejected": -956.0,
"loss": 0.2381,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.875,
"rewards/margins": 3.28125,
"rewards/rejected": -8.125,
"step": 3250
},
{
"epoch": 0.23532808777882047,
"grad_norm": 7.104939281324458,
"learning_rate": 4.726385484676318e-07,
"logits/chosen": -2.5625,
"logits/rejected": -2.421875,
"logps/chosen": -600.0,
"logps/rejected": -876.0,
"loss": 0.2311,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.4375,
"rewards/margins": 2.84375,
"rewards/rejected": -7.28125,
"step": 3260
},
{
"epoch": 0.2360499530787555,
"grad_norm": 7.112864388089024,
"learning_rate": 4.723512776139679e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.453125,
"logps/chosen": -592.0,
"logps/rejected": -872.0,
"loss": 0.218,
"rewards/accuracies": 0.875,
"rewards/chosen": -4.5625,
"rewards/margins": 2.65625,
"rewards/rejected": -7.21875,
"step": 3270
},
{
"epoch": 0.23677181837869055,
"grad_norm": 9.110259152947808,
"learning_rate": 4.7206259482360734e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.515625,
"logps/chosen": -624.0,
"logps/rejected": -916.0,
"loss": 0.2342,
"rewards/accuracies": 0.875,
"rewards/chosen": -4.59375,
"rewards/margins": 3.0625,
"rewards/rejected": -7.65625,
"step": 3280
},
{
"epoch": 0.23749368367862556,
"grad_norm": 8.883129926158574,
"learning_rate": 4.7177250192969364e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.53125,
"logps/chosen": -648.0,
"logps/rejected": -976.0,
"loss": 0.2037,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.75,
"rewards/margins": 3.46875,
"rewards/rejected": -8.25,
"step": 3290
},
{
"epoch": 0.2382155489785606,
"grad_norm": 10.573842474018138,
"learning_rate": 4.714810007743247e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.5,
"logps/chosen": -744.0,
"logps/rejected": -1080.0,
"loss": 0.2226,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -5.65625,
"rewards/margins": 3.609375,
"rewards/rejected": -9.25,
"step": 3300
},
{
"epoch": 0.23893741427849563,
"grad_norm": 9.209497924010089,
"learning_rate": 4.7118809320854077e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.46875,
"logps/chosen": -672.0,
"logps/rejected": -1000.0,
"loss": 0.2122,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.25,
"rewards/margins": 3.421875,
"rewards/rejected": -8.6875,
"step": 3310
},
{
"epoch": 0.23965927957843067,
"grad_norm": 9.372117356581454,
"learning_rate": 4.7089378109231294e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.40625,
"logps/chosen": -688.0,
"logps/rejected": -984.0,
"loss": 0.2315,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -5.34375,
"rewards/margins": 2.96875,
"rewards/rejected": -8.3125,
"step": 3320
},
{
"epoch": 0.2403811448783657,
"grad_norm": 8.352914263375952,
"learning_rate": 4.7059806629453116e-07,
"logits/chosen": -2.609375,
"logits/rejected": -2.4375,
"logps/chosen": -648.0,
"logps/rejected": -920.0,
"loss": 0.2278,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.6875,
"rewards/margins": 2.96875,
"rewards/rejected": -7.65625,
"step": 3330
},
{
"epoch": 0.24110301017830074,
"grad_norm": 10.512336386108508,
"learning_rate": 4.7030095069299257e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.546875,
"logps/chosen": -656.0,
"logps/rejected": -976.0,
"loss": 0.2011,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -4.8125,
"rewards/margins": 3.34375,
"rewards/rejected": -8.125,
"step": 3340
},
{
"epoch": 0.24182487547823575,
"grad_norm": 9.166170654186674,
"learning_rate": 4.700024361743893e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.59375,
"logps/chosen": -620.0,
"logps/rejected": -960.0,
"loss": 0.1937,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -4.5625,
"rewards/margins": 3.5625,
"rewards/rejected": -8.125,
"step": 3350
},
{
"epoch": 0.2425467407781708,
"grad_norm": 10.052841673647455,
"learning_rate": 4.697025246342967e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.5625,
"logps/chosen": -608.0,
"logps/rejected": -916.0,
"loss": 0.2115,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.5,
"rewards/margins": 3.40625,
"rewards/rejected": -7.90625,
"step": 3360
},
{
"epoch": 0.24326860607810583,
"grad_norm": 12.87931292960993,
"learning_rate": 4.6940121797716127e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.5625,
"logps/chosen": -588.0,
"logps/rejected": -912.0,
"loss": 0.227,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.28125,
"rewards/margins": 3.34375,
"rewards/rejected": -7.625,
"step": 3370
},
{
"epoch": 0.24399047137804086,
"grad_norm": 11.246155735848257,
"learning_rate": 4.6909851811628853e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.578125,
"logps/chosen": -644.0,
"logps/rejected": -948.0,
"loss": 0.1985,
"rewards/accuracies": 0.875,
"rewards/chosen": -4.8125,
"rewards/margins": 3.15625,
"rewards/rejected": -7.96875,
"step": 3380
},
{
"epoch": 0.2447123366779759,
"grad_norm": 8.247097831323758,
"learning_rate": 4.68794426973831e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.5,
"logps/chosen": -584.0,
"logps/rejected": -892.0,
"loss": 0.2203,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -4.25,
"rewards/margins": 3.140625,
"rewards/rejected": -7.375,
"step": 3390
},
{
"epoch": 0.2454342019779109,
"grad_norm": 7.982031142460416,
"learning_rate": 4.684889464807755e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.453125,
"logps/chosen": -588.0,
"logps/rejected": -912.0,
"loss": 0.2141,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.3125,
"rewards/margins": 3.15625,
"rewards/rejected": -7.46875,
"step": 3400
},
{
"epoch": 0.24615606727784595,
"grad_norm": 8.859057538137234,
"learning_rate": 4.681820785769317e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.5,
"logps/chosen": -624.0,
"logps/rejected": -932.0,
"loss": 0.2002,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.53125,
"rewards/margins": 3.328125,
"rewards/rejected": -7.875,
"step": 3410
},
{
"epoch": 0.24687793257778098,
"grad_norm": 10.507595703830146,
"learning_rate": 4.678738252109192e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.515625,
"logps/chosen": -604.0,
"logps/rejected": -916.0,
"loss": 0.2272,
"rewards/accuracies": 0.875,
"rewards/chosen": -4.4375,
"rewards/margins": 3.28125,
"rewards/rejected": -7.71875,
"step": 3420
},
{
"epoch": 0.24759979787771602,
"grad_norm": 9.701082860121796,
"learning_rate": 4.675641883401553e-07,
"logits/chosen": -2.578125,
"logits/rejected": -2.375,
"logps/chosen": -624.0,
"logps/rejected": -936.0,
"loss": 0.2157,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.625,
"rewards/margins": 3.15625,
"rewards/rejected": -7.78125,
"step": 3430
},
{
"epoch": 0.24832166317765106,
"grad_norm": 9.249938002509944,
"learning_rate": 4.672531699308425e-07,
"logits/chosen": -2.65625,
"logits/rejected": -2.4375,
"logps/chosen": -628.0,
"logps/rejected": -964.0,
"loss": 0.2167,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -4.8125,
"rewards/margins": 3.375,
"rewards/rejected": -8.1875,
"step": 3440
},
{
"epoch": 0.2490435284775861,
"grad_norm": 10.341717167410792,
"learning_rate": 4.669407719579562e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.546875,
"logps/chosen": -604.0,
"logps/rejected": -920.0,
"loss": 0.2035,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -4.25,
"rewards/margins": 3.453125,
"rewards/rejected": -7.71875,
"step": 3450
},
{
"epoch": 0.2497653937775211,
"grad_norm": 8.681196124713722,
"learning_rate": 4.666269964052322e-07,
"logits/chosen": -2.859375,
"logits/rejected": -2.53125,
"logps/chosen": -596.0,
"logps/rejected": -952.0,
"loss": 0.2126,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.25,
"rewards/margins": 3.828125,
"rewards/rejected": -8.0625,
"step": 3460
},
{
"epoch": 0.25048725907745617,
"grad_norm": 9.212928240257371,
"learning_rate": 4.6631184526515384e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.65625,
"logps/chosen": -624.0,
"logps/rejected": -924.0,
"loss": 0.2196,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.53125,
"rewards/margins": 3.140625,
"rewards/rejected": -7.6875,
"step": 3470
},
{
"epoch": 0.2512091243773912,
"grad_norm": 9.229554206053074,
"learning_rate": 4.6599532053893936e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.53125,
"logps/chosen": -660.0,
"logps/rejected": -944.0,
"loss": 0.2172,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.90625,
"rewards/margins": 2.96875,
"rewards/rejected": -7.875,
"step": 3480
},
{
"epoch": 0.2519309896773262,
"grad_norm": 7.2543396832627876,
"learning_rate": 4.6567742423652955e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.53125,
"logps/chosen": -672.0,
"logps/rejected": -972.0,
"loss": 0.2158,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -5.03125,
"rewards/margins": 3.15625,
"rewards/rejected": -8.1875,
"step": 3490
},
{
"epoch": 0.25265285497726125,
"grad_norm": 8.156746365270518,
"learning_rate": 4.6535815837657456e-07,
"logits/chosen": -2.609375,
"logits/rejected": -2.359375,
"logps/chosen": -688.0,
"logps/rejected": -1024.0,
"loss": 0.2254,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -5.1875,
"rewards/margins": 3.453125,
"rewards/rejected": -8.625,
"step": 3500
},
{
"epoch": 0.25337472027719626,
"grad_norm": 9.476042547482471,
"learning_rate": 4.6503752498642133e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.421875,
"logps/chosen": -696.0,
"logps/rejected": -972.0,
"loss": 0.2247,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.375,
"rewards/margins": 2.953125,
"rewards/rejected": -8.3125,
"step": 3510
},
{
"epoch": 0.25409658557713133,
"grad_norm": 11.068802868497535,
"learning_rate": 4.6471552610210073e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.640625,
"logps/chosen": -648.0,
"logps/rejected": -968.0,
"loss": 0.2236,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -4.84375,
"rewards/margins": 3.265625,
"rewards/rejected": -8.125,
"step": 3520
},
{
"epoch": 0.25481845087706634,
"grad_norm": 9.184379291366328,
"learning_rate": 4.6439216376831447e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.546875,
"logps/chosen": -628.0,
"logps/rejected": -972.0,
"loss": 0.2076,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.65625,
"rewards/margins": 3.421875,
"rewards/rejected": -8.0625,
"step": 3530
},
{
"epoch": 0.25554031617700135,
"grad_norm": 12.322007532110128,
"learning_rate": 4.6406744003842213e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.59375,
"logps/chosen": -612.0,
"logps/rejected": -920.0,
"loss": 0.2124,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.5,
"rewards/margins": 3.25,
"rewards/rejected": -7.75,
"step": 3540
},
{
"epoch": 0.2562621814769364,
"grad_norm": 7.159317606243659,
"learning_rate": 4.6374135697442833e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.546875,
"logps/chosen": -596.0,
"logps/rejected": -940.0,
"loss": 0.2098,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.40625,
"rewards/margins": 3.453125,
"rewards/rejected": -7.875,
"step": 3550
},
{
"epoch": 0.2569840467768714,
"grad_norm": 29.4711769624419,
"learning_rate": 4.634139166469695e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.390625,
"logps/chosen": -620.0,
"logps/rejected": -944.0,
"loss": 0.2267,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.5,
"rewards/margins": 3.078125,
"rewards/rejected": -7.59375,
"step": 3560
},
{
"epoch": 0.2577059120768065,
"grad_norm": 7.80532559868148,
"learning_rate": 4.6308512113530063e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.46875,
"logps/chosen": -560.0,
"logps/rejected": -852.0,
"loss": 0.2187,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.0,
"rewards/margins": 2.984375,
"rewards/rejected": -7.0,
"step": 3570
},
{
"epoch": 0.2584277773767415,
"grad_norm": 7.185706232473536,
"learning_rate": 4.627549725272822e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.59375,
"logps/chosen": -604.0,
"logps/rejected": -916.0,
"loss": 0.2362,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.34375,
"rewards/margins": 3.265625,
"rewards/rejected": -7.59375,
"step": 3580
},
{
"epoch": 0.2591496426766765,
"grad_norm": 7.836489814314065,
"learning_rate": 4.62423472919367e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.421875,
"logps/chosen": -604.0,
"logps/rejected": -896.0,
"loss": 0.2143,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -4.40625,
"rewards/margins": 3.0,
"rewards/rejected": -7.40625,
"step": 3590
},
{
"epoch": 0.25987150797661157,
"grad_norm": 10.312658330041376,
"learning_rate": 4.6209062441658654e-07,
"logits/chosen": -2.578125,
"logits/rejected": -2.359375,
"logps/chosen": -604.0,
"logps/rejected": -904.0,
"loss": 0.2176,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.46875,
"rewards/margins": 3.109375,
"rewards/rejected": -7.5625,
"step": 3600
},
{
"epoch": 0.2605933732765466,
"grad_norm": 7.660185299883346,
"learning_rate": 4.6175642913253783e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.4375,
"logps/chosen": -604.0,
"logps/rejected": -912.0,
"loss": 0.1951,
"rewards/accuracies": 0.9375,
"rewards/chosen": -4.34375,
"rewards/margins": 3.296875,
"rewards/rejected": -7.65625,
"step": 3610
},
{
"epoch": 0.26131523857648165,
"grad_norm": 9.630986662907384,
"learning_rate": 4.6142088918937016e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.515625,
"logps/chosen": -608.0,
"logps/rejected": -952.0,
"loss": 0.2009,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.4375,
"rewards/margins": 3.609375,
"rewards/rejected": -8.0625,
"step": 3620
},
{
"epoch": 0.26203710387641665,
"grad_norm": 7.9637824352647195,
"learning_rate": 4.6108400671777135e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.40625,
"logps/chosen": -620.0,
"logps/rejected": -928.0,
"loss": 0.2137,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.46875,
"rewards/margins": 3.28125,
"rewards/rejected": -7.75,
"step": 3630
},
{
"epoch": 0.2627589691763517,
"grad_norm": 10.302801071286787,
"learning_rate": 4.607457838569544e-07,
"logits/chosen": -2.65625,
"logits/rejected": -2.296875,
"logps/chosen": -600.0,
"logps/rejected": -964.0,
"loss": 0.208,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.375,
"rewards/margins": 3.484375,
"rewards/rejected": -7.84375,
"step": 3640
},
{
"epoch": 0.26348083447628673,
"grad_norm": 9.200762753858287,
"learning_rate": 4.6040622275464355e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.609375,
"logps/chosen": -580.0,
"logps/rejected": -960.0,
"loss": 0.2058,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.34375,
"rewards/margins": 3.703125,
"rewards/rejected": -8.0625,
"step": 3650
},
{
"epoch": 0.26420269977622174,
"grad_norm": 8.72614280680941,
"learning_rate": 4.6006532556706124e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.515625,
"logps/chosen": -532.0,
"logps/rejected": -856.0,
"loss": 0.2263,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -3.875,
"rewards/margins": 3.296875,
"rewards/rejected": -7.15625,
"step": 3660
},
{
"epoch": 0.2649245650761568,
"grad_norm": 9.95080301383368,
"learning_rate": 4.5972309445891386e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.515625,
"logps/chosen": -544.0,
"logps/rejected": -884.0,
"loss": 0.2212,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -3.859375,
"rewards/margins": 3.609375,
"rewards/rejected": -7.46875,
"step": 3670
},
{
"epoch": 0.2656464303760918,
"grad_norm": 7.898181548134635,
"learning_rate": 4.593795316033783e-07,
"logits/chosen": -2.578125,
"logits/rejected": -2.375,
"logps/chosen": -588.0,
"logps/rejected": -872.0,
"loss": 0.2504,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.28125,
"rewards/margins": 2.96875,
"rewards/rejected": -7.28125,
"step": 3680
},
{
"epoch": 0.2663682956760269,
"grad_norm": 9.27071552978421,
"learning_rate": 4.5903463918208815e-07,
"logits/chosen": -2.515625,
"logits/rejected": -2.296875,
"logps/chosen": -560.0,
"logps/rejected": -904.0,
"loss": 0.2182,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.03125,
"rewards/margins": 3.46875,
"rewards/rejected": -7.5,
"step": 3690
},
{
"epoch": 0.2670901609759619,
"grad_norm": 7.471297940396982,
"learning_rate": 4.586884193851197e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.421875,
"logps/chosen": -568.0,
"logps/rejected": -864.0,
"loss": 0.2165,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.125,
"rewards/margins": 2.921875,
"rewards/rejected": -7.03125,
"step": 3700
},
{
"epoch": 0.2678120262758969,
"grad_norm": 9.198139304204727,
"learning_rate": 4.5834087441097806e-07,
"logits/chosen": -2.9375,
"logits/rejected": -2.5625,
"logps/chosen": -568.0,
"logps/rejected": -960.0,
"loss": 0.1971,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -4.125,
"rewards/margins": 3.90625,
"rewards/rejected": -8.0625,
"step": 3710
},
{
"epoch": 0.26853389157583196,
"grad_norm": 7.074538199167009,
"learning_rate": 4.5799200646658345e-07,
"logits/chosen": -2.859375,
"logits/rejected": -2.5,
"logps/chosen": -568.0,
"logps/rejected": -900.0,
"loss": 0.1914,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -4.25,
"rewards/margins": 3.28125,
"rewards/rejected": -7.53125,
"step": 3720
},
{
"epoch": 0.26925575687576697,
"grad_norm": 7.9353245918675,
"learning_rate": 4.576418177672568e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.6875,
"logps/chosen": -680.0,
"logps/rejected": -1020.0,
"loss": 0.2194,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -5.0,
"rewards/margins": 3.59375,
"rewards/rejected": -8.5625,
"step": 3730
},
{
"epoch": 0.26997762217570204,
"grad_norm": 7.362232757163594,
"learning_rate": 4.5729031053670596e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.5625,
"logps/chosen": -576.0,
"logps/rejected": -888.0,
"loss": 0.2025,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -4.0625,
"rewards/margins": 3.421875,
"rewards/rejected": -7.46875,
"step": 3740
},
{
"epoch": 0.27069948747563705,
"grad_norm": 9.803377167019393,
"learning_rate": 4.569374870070114e-07,
"logits/chosen": -2.953125,
"logits/rejected": -2.65625,
"logps/chosen": -620.0,
"logps/rejected": -960.0,
"loss": 0.2077,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.59375,
"rewards/margins": 3.515625,
"rewards/rejected": -8.125,
"step": 3750
},
{
"epoch": 0.27142135277557206,
"grad_norm": 6.923819353668018,
"learning_rate": 4.565833494186122e-07,
"logits/chosen": -2.953125,
"logits/rejected": -2.734375,
"logps/chosen": -644.0,
"logps/rejected": -968.0,
"loss": 0.1945,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -4.84375,
"rewards/margins": 3.328125,
"rewards/rejected": -8.1875,
"step": 3760
},
{
"epoch": 0.2721432180755071,
"grad_norm": 7.409462373704994,
"learning_rate": 4.562279000202919e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.59375,
"logps/chosen": -624.0,
"logps/rejected": -952.0,
"loss": 0.1891,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -4.46875,
"rewards/margins": 3.640625,
"rewards/rejected": -8.125,
"step": 3770
},
{
"epoch": 0.27286508337544213,
"grad_norm": 8.55425171800717,
"learning_rate": 4.5587114106916366e-07,
"logits/chosen": -2.890625,
"logits/rejected": -2.609375,
"logps/chosen": -664.0,
"logps/rejected": -1040.0,
"loss": 0.2089,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.96875,
"rewards/margins": 3.71875,
"rewards/rejected": -8.6875,
"step": 3780
},
{
"epoch": 0.2735869486753772,
"grad_norm": 8.283760196639793,
"learning_rate": 4.5551307483065664e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.65625,
"logps/chosen": -716.0,
"logps/rejected": -1064.0,
"loss": 0.2264,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -5.46875,
"rewards/margins": 3.671875,
"rewards/rejected": -9.125,
"step": 3790
},
{
"epoch": 0.2743088139753122,
"grad_norm": 9.334259623082545,
"learning_rate": 4.5515370357850136e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.640625,
"logps/chosen": -664.0,
"logps/rejected": -1056.0,
"loss": 0.1902,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -5.0,
"rewards/margins": 3.890625,
"rewards/rejected": -8.875,
"step": 3800
},
{
"epoch": 0.2750306792752472,
"grad_norm": 8.790752805238721,
"learning_rate": 4.547930295947151e-07,
"logits/chosen": -2.859375,
"logits/rejected": -2.578125,
"logps/chosen": -640.0,
"logps/rejected": -960.0,
"loss": 0.1949,
"rewards/accuracies": 0.9375,
"rewards/chosen": -4.71875,
"rewards/margins": 3.5625,
"rewards/rejected": -8.25,
"step": 3810
},
{
"epoch": 0.2757525445751823,
"grad_norm": 11.07615206391536,
"learning_rate": 4.5443105516958737e-07,
"logits/chosen": -2.859375,
"logits/rejected": -2.640625,
"logps/chosen": -700.0,
"logps/rejected": -1072.0,
"loss": 0.2074,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.34375,
"rewards/margins": 3.90625,
"rewards/rejected": -9.25,
"step": 3820
},
{
"epoch": 0.2764744098751173,
"grad_norm": 12.156443108793454,
"learning_rate": 4.5406778260166586e-07,
"logits/chosen": -2.5625,
"logits/rejected": -2.421875,
"logps/chosen": -648.0,
"logps/rejected": -984.0,
"loss": 0.2064,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.90625,
"rewards/margins": 3.59375,
"rewards/rejected": -8.5,
"step": 3830
},
{
"epoch": 0.27719627517505235,
"grad_norm": 9.054451472292419,
"learning_rate": 4.5370321419774117e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.390625,
"logps/chosen": -616.0,
"logps/rejected": -936.0,
"loss": 0.2138,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.59375,
"rewards/margins": 3.171875,
"rewards/rejected": -7.78125,
"step": 3840
},
{
"epoch": 0.27791814047498736,
"grad_norm": 6.698493216999741,
"learning_rate": 4.5333735227283274e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.5,
"logps/chosen": -676.0,
"logps/rejected": -992.0,
"loss": 0.2083,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.25,
"rewards/margins": 3.15625,
"rewards/rejected": -8.4375,
"step": 3850
},
{
"epoch": 0.2786400057749224,
"grad_norm": 9.735985205726063,
"learning_rate": 4.5297019915017375e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.53125,
"logps/chosen": -672.0,
"logps/rejected": -1032.0,
"loss": 0.1875,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.28125,
"rewards/margins": 3.59375,
"rewards/rejected": -8.875,
"step": 3860
},
{
"epoch": 0.27936187107485744,
"grad_norm": 8.810687694126111,
"learning_rate": 4.5260175716119655e-07,
"logits/chosen": -2.609375,
"logits/rejected": -2.53125,
"logps/chosen": -660.0,
"logps/rejected": -968.0,
"loss": 0.212,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -4.71875,
"rewards/margins": 3.375,
"rewards/rejected": -8.0625,
"step": 3870
},
{
"epoch": 0.28008373637479245,
"grad_norm": 10.6784883112821,
"learning_rate": 4.522320286455179e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.546875,
"logps/chosen": -632.0,
"logps/rejected": -944.0,
"loss": 0.2101,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.8125,
"rewards/margins": 3.359375,
"rewards/rejected": -8.1875,
"step": 3880
},
{
"epoch": 0.2808056016747275,
"grad_norm": 9.94830452756906,
"learning_rate": 4.5186101595092403e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.59375,
"logps/chosen": -664.0,
"logps/rejected": -980.0,
"loss": 0.2116,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -5.0625,
"rewards/margins": 3.234375,
"rewards/rejected": -8.3125,
"step": 3890
},
{
"epoch": 0.2815274669746625,
"grad_norm": 9.418299320110647,
"learning_rate": 4.5148872143335566e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.578125,
"logps/chosen": -656.0,
"logps/rejected": -1016.0,
"loss": 0.2042,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -4.90625,
"rewards/margins": 3.71875,
"rewards/rejected": -8.625,
"step": 3900
},
{
"epoch": 0.2822493322745976,
"grad_norm": 11.904953591713511,
"learning_rate": 4.5111514745689307e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.4375,
"logps/chosen": -640.0,
"logps/rejected": -1024.0,
"loss": 0.2084,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.96875,
"rewards/margins": 3.890625,
"rewards/rejected": -8.875,
"step": 3910
},
{
"epoch": 0.2829711975745326,
"grad_norm": 11.15522188195295,
"learning_rate": 4.507402963937414e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.53125,
"logps/chosen": -704.0,
"logps/rejected": -1064.0,
"loss": 0.1865,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -5.3125,
"rewards/margins": 3.703125,
"rewards/rejected": -9.0,
"step": 3920
},
{
"epoch": 0.2836930628744676,
"grad_norm": 11.36508327799745,
"learning_rate": 4.5036417062421506e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.453125,
"logps/chosen": -748.0,
"logps/rejected": -1088.0,
"loss": 0.2226,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -5.8125,
"rewards/margins": 3.546875,
"rewards/rejected": -9.375,
"step": 3930
},
{
"epoch": 0.28441492817440267,
"grad_norm": 9.897929517208977,
"learning_rate": 4.4998677253672297e-07,
"logits/chosen": -2.5625,
"logits/rejected": -2.390625,
"logps/chosen": -732.0,
"logps/rejected": -1032.0,
"loss": 0.2208,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -5.625,
"rewards/margins": 3.046875,
"rewards/rejected": -8.6875,
"step": 3940
},
{
"epoch": 0.2851367934743377,
"grad_norm": 9.778813209573705,
"learning_rate": 4.496081045277533e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.359375,
"logps/chosen": -736.0,
"logps/rejected": -1080.0,
"loss": 0.2031,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -5.75,
"rewards/margins": 3.125,
"rewards/rejected": -8.875,
"step": 3950
},
{
"epoch": 0.28585865877427274,
"grad_norm": 7.8313055942532275,
"learning_rate": 4.492281690018583e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.625,
"logps/chosen": -696.0,
"logps/rejected": -1048.0,
"loss": 0.1818,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -5.375,
"rewards/margins": 3.75,
"rewards/rejected": -9.125,
"step": 3960
},
{
"epoch": 0.28658052407420775,
"grad_norm": 8.317207474938273,
"learning_rate": 4.4884696837163905e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.59375,
"logps/chosen": -748.0,
"logps/rejected": -1056.0,
"loss": 0.2117,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.6875,
"rewards/margins": 3.265625,
"rewards/rejected": -8.9375,
"step": 3970
},
{
"epoch": 0.28730238937414276,
"grad_norm": 10.26976433894447,
"learning_rate": 4.484645050577299e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.375,
"logps/chosen": -724.0,
"logps/rejected": -1056.0,
"loss": 0.2079,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -5.6875,
"rewards/margins": 3.265625,
"rewards/rejected": -8.9375,
"step": 3980
},
{
"epoch": 0.28802425467407783,
"grad_norm": 11.840261029137109,
"learning_rate": 4.480807814887833e-07,
"logits/chosen": -2.546875,
"logits/rejected": -2.40625,
"logps/chosen": -660.0,
"logps/rejected": -960.0,
"loss": 0.214,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.03125,
"rewards/margins": 3.21875,
"rewards/rejected": -8.25,
"step": 3990
},
{
"epoch": 0.28874611997401284,
"grad_norm": 8.811651662253073,
"learning_rate": 4.476958001014544e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.4375,
"logps/chosen": -728.0,
"logps/rejected": -1064.0,
"loss": 0.2135,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.6875,
"rewards/margins": 3.46875,
"rewards/rejected": -9.125,
"step": 4000
},
{
"epoch": 0.2894679852739479,
"grad_norm": 8.267204182411973,
"learning_rate": 4.4730956334038565e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.546875,
"logps/chosen": -736.0,
"logps/rejected": -1088.0,
"loss": 0.2013,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -5.65625,
"rewards/margins": 3.78125,
"rewards/rejected": -9.4375,
"step": 4010
},
{
"epoch": 0.2901898505738829,
"grad_norm": 7.77369954894956,
"learning_rate": 4.46922073658191e-07,
"logits/chosen": -2.671875,
"logits/rejected": -2.5,
"logps/chosen": -708.0,
"logps/rejected": -1056.0,
"loss": 0.2009,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -5.46875,
"rewards/margins": 3.703125,
"rewards/rejected": -9.1875,
"step": 4020
},
{
"epoch": 0.2909117158738179,
"grad_norm": 8.886847365802758,
"learning_rate": 4.465333335154406e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.40625,
"logps/chosen": -684.0,
"logps/rejected": -1020.0,
"loss": 0.2115,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.3125,
"rewards/margins": 3.359375,
"rewards/rejected": -8.6875,
"step": 4030
},
{
"epoch": 0.291633581173753,
"grad_norm": 11.540304268095925,
"learning_rate": 4.461433453806449e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.34375,
"logps/chosen": -712.0,
"logps/rejected": -1032.0,
"loss": 0.2096,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -5.4375,
"rewards/margins": 3.25,
"rewards/rejected": -8.6875,
"step": 4040
},
{
"epoch": 0.292355446473688,
"grad_norm": 11.614291076457404,
"learning_rate": 4.457521117302392e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.40625,
"logps/chosen": -636.0,
"logps/rejected": -956.0,
"loss": 0.2274,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.875,
"rewards/margins": 3.25,
"rewards/rejected": -8.125,
"step": 4050
},
{
"epoch": 0.29307731177362306,
"grad_norm": 11.959955939062517,
"learning_rate": 4.45359635048568e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.59375,
"logps/chosen": -672.0,
"logps/rejected": -992.0,
"loss": 0.1962,
"rewards/accuracies": 0.90625,
"rewards/chosen": -5.15625,
"rewards/margins": 3.1875,
"rewards/rejected": -8.375,
"step": 4060
},
{
"epoch": 0.29379917707355807,
"grad_norm": 10.625522954210599,
"learning_rate": 4.4496591782786883e-07,
"logits/chosen": -2.953125,
"logits/rejected": -2.609375,
"logps/chosen": -780.0,
"logps/rejected": -1168.0,
"loss": 0.2562,
"rewards/accuracies": 0.9375,
"rewards/chosen": -6.25,
"rewards/margins": 3.890625,
"rewards/rejected": -10.125,
"step": 4070
},
{
"epoch": 0.2945210423734931,
"grad_norm": 8.706370989411305,
"learning_rate": 4.44570962568257e-07,
"logits/chosen": -2.96875,
"logits/rejected": -2.6875,
"logps/chosen": -736.0,
"logps/rejected": -1136.0,
"loss": 0.2059,
"rewards/accuracies": 0.9375,
"rewards/chosen": -5.75,
"rewards/margins": 4.1875,
"rewards/rejected": -9.9375,
"step": 4080
},
{
"epoch": 0.29524290767342815,
"grad_norm": 10.084781546011934,
"learning_rate": 4.4417477177770905e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.671875,
"logps/chosen": -704.0,
"logps/rejected": -1056.0,
"loss": 0.2059,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.5,
"rewards/margins": 3.609375,
"rewards/rejected": -9.125,
"step": 4090
},
{
"epoch": 0.29596477297336315,
"grad_norm": 10.211730254994997,
"learning_rate": 4.4377734797204747e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.671875,
"logps/chosen": -700.0,
"logps/rejected": -1056.0,
"loss": 0.1966,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -5.5,
"rewards/margins": 3.640625,
"rewards/rejected": -9.125,
"step": 4100
},
{
"epoch": 0.2966866382732982,
"grad_norm": 8.821514902632222,
"learning_rate": 4.433786936749241e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.46875,
"logps/chosen": -744.0,
"logps/rejected": -1080.0,
"loss": 0.2048,
"rewards/accuracies": 0.90625,
"rewards/chosen": -5.59375,
"rewards/margins": 3.734375,
"rewards/rejected": -9.3125,
"step": 4110
},
{
"epoch": 0.29740850357323323,
"grad_norm": 9.210606252468882,
"learning_rate": 4.429788114178049e-07,
"logits/chosen": -2.65625,
"logits/rejected": -2.421875,
"logps/chosen": -744.0,
"logps/rejected": -1072.0,
"loss": 0.2042,
"rewards/accuracies": 0.90625,
"rewards/chosen": -5.84375,
"rewards/margins": 3.40625,
"rewards/rejected": -9.25,
"step": 4120
},
{
"epoch": 0.2981303688731683,
"grad_norm": 8.00555161785549,
"learning_rate": 4.425777037399529e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.40625,
"logps/chosen": -744.0,
"logps/rejected": -1064.0,
"loss": 0.1886,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.75,
"rewards/margins": 3.40625,
"rewards/rejected": -9.1875,
"step": 4130
},
{
"epoch": 0.2988522341731033,
"grad_norm": 11.207346805964308,
"learning_rate": 4.42175373188413e-07,
"logits/chosen": -2.578125,
"logits/rejected": -2.375,
"logps/chosen": -780.0,
"logps/rejected": -1080.0,
"loss": 0.2083,
"rewards/accuracies": 0.90625,
"rewards/chosen": -6.1875,
"rewards/margins": 3.25,
"rewards/rejected": -9.4375,
"step": 4140
},
{
"epoch": 0.2995740994730383,
"grad_norm": 8.172701676742552,
"learning_rate": 4.4177182231799513e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.34375,
"logps/chosen": -716.0,
"logps/rejected": -1080.0,
"loss": 0.2072,
"rewards/accuracies": 0.9375,
"rewards/chosen": -5.59375,
"rewards/margins": 3.515625,
"rewards/rejected": -9.125,
"step": 4150
},
{
"epoch": 0.3002959647729734,
"grad_norm": 5.801373290887345,
"learning_rate": 4.413670536912584e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.46875,
"logps/chosen": -728.0,
"logps/rejected": -1048.0,
"loss": 0.2031,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -5.40625,
"rewards/margins": 3.46875,
"rewards/rejected": -8.875,
"step": 4160
},
{
"epoch": 0.3010178300729084,
"grad_norm": 6.307391224443462,
"learning_rate": 4.4096106987849457e-07,
"logits/chosen": -2.890625,
"logits/rejected": -2.515625,
"logps/chosen": -732.0,
"logps/rejected": -1120.0,
"loss": 0.2027,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -5.625,
"rewards/margins": 3.96875,
"rewards/rejected": -9.625,
"step": 4170
},
{
"epoch": 0.30173969537284345,
"grad_norm": 11.867957943680011,
"learning_rate": 4.405538734577121e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.5,
"logps/chosen": -744.0,
"logps/rejected": -1136.0,
"loss": 0.1975,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.84375,
"rewards/margins": 3.90625,
"rewards/rejected": -9.75,
"step": 4180
},
{
"epoch": 0.30246156067277846,
"grad_norm": 9.987667285927838,
"learning_rate": 4.401454670146193e-07,
"logits/chosen": -2.921875,
"logits/rejected": -2.71875,
"logps/chosen": -712.0,
"logps/rejected": -1080.0,
"loss": 0.2163,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.375,
"rewards/margins": 3.890625,
"rewards/rejected": -9.25,
"step": 4190
},
{
"epoch": 0.30318342597271347,
"grad_norm": 8.977809465407699,
"learning_rate": 4.3973585314260836e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.53125,
"logps/chosen": -668.0,
"logps/rejected": -1048.0,
"loss": 0.1906,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -5.15625,
"rewards/margins": 3.703125,
"rewards/rejected": -8.8125,
"step": 4200
},
{
"epoch": 0.30390529127264854,
"grad_norm": 10.825945402642533,
"learning_rate": 4.393250344427385e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.515625,
"logps/chosen": -736.0,
"logps/rejected": -1056.0,
"loss": 0.2047,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -5.8125,
"rewards/margins": 3.34375,
"rewards/rejected": -9.125,
"step": 4210
},
{
"epoch": 0.30462715657258355,
"grad_norm": 8.126172608631684,
"learning_rate": 4.389130135237196e-07,
"logits/chosen": -2.890625,
"logits/rejected": -2.5625,
"logps/chosen": -692.0,
"logps/rejected": -1088.0,
"loss": 0.2207,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.5625,
"rewards/margins": 3.859375,
"rewards/rejected": -9.4375,
"step": 4220
},
{
"epoch": 0.3053490218725186,
"grad_norm": 7.626491220106016,
"learning_rate": 4.38499793001896e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.484375,
"logps/chosen": -672.0,
"logps/rejected": -992.0,
"loss": 0.2096,
"rewards/accuracies": 0.90625,
"rewards/chosen": -5.09375,
"rewards/margins": 3.375,
"rewards/rejected": -8.4375,
"step": 4230
},
{
"epoch": 0.3060708871724536,
"grad_norm": 9.904614258788264,
"learning_rate": 4.3808537550122913e-07,
"logits/chosen": -2.609375,
"logits/rejected": -2.296875,
"logps/chosen": -656.0,
"logps/rejected": -948.0,
"loss": 0.211,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.9375,
"rewards/margins": 3.109375,
"rewards/rejected": -8.0625,
"step": 4240
},
{
"epoch": 0.30679275247238863,
"grad_norm": 9.163789602486757,
"learning_rate": 4.376697636532816e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.421875,
"logps/chosen": -668.0,
"logps/rejected": -1040.0,
"loss": 0.1866,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -5.1875,
"rewards/margins": 3.6875,
"rewards/rejected": -8.875,
"step": 4250
},
{
"epoch": 0.3075146177723237,
"grad_norm": 9.658094123529755,
"learning_rate": 4.3725296009719985e-07,
"logits/chosen": -2.953125,
"logits/rejected": -2.5625,
"logps/chosen": -672.0,
"logps/rejected": -1064.0,
"loss": 0.1865,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -5.125,
"rewards/margins": 3.984375,
"rewards/rejected": -9.125,
"step": 4260
},
{
"epoch": 0.3082364830722587,
"grad_norm": 6.663743741837934,
"learning_rate": 4.3683496747969804e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.5625,
"logps/chosen": -668.0,
"logps/rejected": -1040.0,
"loss": 0.1913,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -5.125,
"rewards/margins": 3.84375,
"rewards/rejected": -8.9375,
"step": 4270
},
{
"epoch": 0.30895834837219377,
"grad_norm": 9.431783701004399,
"learning_rate": 4.364157884550406e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.609375,
"logps/chosen": -744.0,
"logps/rejected": -1120.0,
"loss": 0.2088,
"rewards/accuracies": 0.90625,
"rewards/chosen": -5.71875,
"rewards/margins": 3.875,
"rewards/rejected": -9.625,
"step": 4280
},
{
"epoch": 0.3096802136721288,
"grad_norm": 10.281531783875531,
"learning_rate": 4.359954256850259e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.53125,
"logps/chosen": -692.0,
"logps/rejected": -1064.0,
"loss": 0.2274,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -5.46875,
"rewards/margins": 3.703125,
"rewards/rejected": -9.1875,
"step": 4290
},
{
"epoch": 0.3104020789720638,
"grad_norm": 9.63227220127926,
"learning_rate": 4.35573881838969e-07,
"logits/chosen": -2.6875,
"logits/rejected": -2.5625,
"logps/chosen": -732.0,
"logps/rejected": -1032.0,
"loss": 0.2038,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -5.71875,
"rewards/margins": 3.203125,
"rewards/rejected": -8.9375,
"step": 4300
},
{
"epoch": 0.31112394427199885,
"grad_norm": 10.289092693608229,
"learning_rate": 4.3515115959368476e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.53125,
"logps/chosen": -716.0,
"logps/rejected": -1016.0,
"loss": 0.2013,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -5.4375,
"rewards/margins": 3.25,
"rewards/rejected": -8.6875,
"step": 4310
},
{
"epoch": 0.31184580957193386,
"grad_norm": 10.974607276803276,
"learning_rate": 4.3472726163347116e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.5625,
"logps/chosen": -728.0,
"logps/rejected": -1048.0,
"loss": 0.2179,
"rewards/accuracies": 0.875,
"rewards/chosen": -5.65625,
"rewards/margins": 3.46875,
"rewards/rejected": -9.125,
"step": 4320
},
{
"epoch": 0.31256767487186893,
"grad_norm": 6.412992045987879,
"learning_rate": 4.3430219065009177e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.40625,
"logps/chosen": -700.0,
"logps/rejected": -1040.0,
"loss": 0.1975,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -5.375,
"rewards/margins": 3.4375,
"rewards/rejected": -8.8125,
"step": 4330
},
{
"epoch": 0.31328954017180394,
"grad_norm": 10.403220300532743,
"learning_rate": 4.3387594934275896e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.59375,
"logps/chosen": -764.0,
"logps/rejected": -1112.0,
"loss": 0.2001,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -6.0,
"rewards/margins": 3.515625,
"rewards/rejected": -9.5,
"step": 4340
},
{
"epoch": 0.31401140547173895,
"grad_norm": 6.73518127809711,
"learning_rate": 4.334485404181167e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.5625,
"logps/chosen": -736.0,
"logps/rejected": -1104.0,
"loss": 0.186,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.78125,
"rewards/margins": 3.765625,
"rewards/rejected": -9.5,
"step": 4350
},
{
"epoch": 0.314733270771674,
"grad_norm": 10.054893296825982,
"learning_rate": 4.3301996659022334e-07,
"logits/chosen": -2.625,
"logits/rejected": -2.28125,
"logps/chosen": -664.0,
"logps/rejected": -1020.0,
"loss": 0.2176,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": -5.0,
"rewards/margins": 3.578125,
"rewards/rejected": -8.5625,
"step": 4360
},
{
"epoch": 0.315455136071609,
"grad_norm": 7.828814625819192,
"learning_rate": 4.3259023058053444e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.328125,
"logps/chosen": -724.0,
"logps/rejected": -1040.0,
"loss": 0.2147,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.625,
"rewards/margins": 3.234375,
"rewards/rejected": -8.875,
"step": 4370
},
{
"epoch": 0.3161770013715441,
"grad_norm": 7.009502435156667,
"learning_rate": 4.3215933511788544e-07,
"logits/chosen": -2.578125,
"logits/rejected": -2.28125,
"logps/chosen": -716.0,
"logps/rejected": -1020.0,
"loss": 0.2081,
"rewards/accuracies": 0.9375,
"rewards/chosen": -5.6875,
"rewards/margins": 3.15625,
"rewards/rejected": -8.875,
"step": 4380
},
{
"epoch": 0.3168988666714791,
"grad_norm": 9.3284353021479,
"learning_rate": 4.317272829384743e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.4375,
"logps/chosen": -704.0,
"logps/rejected": -1016.0,
"loss": 0.1829,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -5.4375,
"rewards/margins": 3.21875,
"rewards/rejected": -8.625,
"step": 4390
},
{
"epoch": 0.31762073197141416,
"grad_norm": 8.811880524775491,
"learning_rate": 4.3129407678584414e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.390625,
"logps/chosen": -672.0,
"logps/rejected": -1016.0,
"loss": 0.2084,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -5.125,
"rewards/margins": 3.609375,
"rewards/rejected": -8.75,
"step": 4400
},
{
"epoch": 0.31834259727134917,
"grad_norm": 8.125525464636453,
"learning_rate": 4.3085971941086585e-07,
"logits/chosen": -2.578125,
"logits/rejected": -2.390625,
"logps/chosen": -728.0,
"logps/rejected": -1032.0,
"loss": 0.1915,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -5.6875,
"rewards/margins": 3.125,
"rewards/rejected": -8.8125,
"step": 4410
},
{
"epoch": 0.3190644625712842,
"grad_norm": 8.751734979718838,
"learning_rate": 4.3042421357172076e-07,
"logits/chosen": -2.640625,
"logits/rejected": -2.3125,
"logps/chosen": -708.0,
"logps/rejected": -1072.0,
"loss": 0.1923,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.4375,
"rewards/margins": 3.515625,
"rewards/rejected": -8.9375,
"step": 4420
},
{
"epoch": 0.31978632787121924,
"grad_norm": 7.608014094617588,
"learning_rate": 4.2998756203388285e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.4375,
"logps/chosen": -684.0,
"logps/rejected": -1032.0,
"loss": 0.2152,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -5.0,
"rewards/margins": 3.8125,
"rewards/rejected": -8.8125,
"step": 4430
},
{
"epoch": 0.32050819317115425,
"grad_norm": 7.639743064757877,
"learning_rate": 4.2954976757010133e-07,
"logits/chosen": -2.59375,
"logits/rejected": -2.421875,
"logps/chosen": -672.0,
"logps/rejected": -1032.0,
"loss": 0.1902,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -5.0625,
"rewards/margins": 3.78125,
"rewards/rejected": -8.875,
"step": 4440
},
{
"epoch": 0.3212300584710893,
"grad_norm": 11.460888477745158,
"learning_rate": 4.2911083296038285e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.546875,
"logps/chosen": -688.0,
"logps/rejected": -1056.0,
"loss": 0.1824,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -5.21875,
"rewards/margins": 3.859375,
"rewards/rejected": -9.0625,
"step": 4450
},
{
"epoch": 0.32195192377102433,
"grad_norm": 9.224352773153688,
"learning_rate": 4.2867076099197446e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.5,
"logps/chosen": -668.0,
"logps/rejected": -980.0,
"loss": 0.1895,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.90625,
"rewards/margins": 3.5,
"rewards/rejected": -8.4375,
"step": 4460
},
{
"epoch": 0.32267378907095934,
"grad_norm": 9.244876887068662,
"learning_rate": 4.2822955445934505e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.5625,
"logps/chosen": -732.0,
"logps/rejected": -1080.0,
"loss": 0.1772,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -5.5625,
"rewards/margins": 3.765625,
"rewards/rejected": -9.3125,
"step": 4470
},
{
"epoch": 0.3233956543708944,
"grad_norm": 8.906087322512382,
"learning_rate": 4.277872161641681e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.453125,
"logps/chosen": -760.0,
"logps/rejected": -1120.0,
"loss": 0.1962,
"rewards/accuracies": 0.90625,
"rewards/chosen": -5.875,
"rewards/margins": 3.6875,
"rewards/rejected": -9.5625,
"step": 4480
},
{
"epoch": 0.3241175196708294,
"grad_norm": 9.689414725700667,
"learning_rate": 4.273437489153041e-07,
"logits/chosen": -2.609375,
"logits/rejected": -2.390625,
"logps/chosen": -716.0,
"logps/rejected": -1048.0,
"loss": 0.2001,
"rewards/accuracies": 0.9375,
"rewards/chosen": -5.4375,
"rewards/margins": 3.59375,
"rewards/rejected": -9.0,
"step": 4490
},
{
"epoch": 0.3248393849707645,
"grad_norm": 8.996613366246144,
"learning_rate": 4.2689915552878207e-07,
"logits/chosen": -2.609375,
"logits/rejected": -2.4375,
"logps/chosen": -688.0,
"logps/rejected": -1008.0,
"loss": 0.1829,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -5.125,
"rewards/margins": 3.390625,
"rewards/rejected": -8.5,
"step": 4500
},
{
"epoch": 0.3255612502706995,
"grad_norm": 9.607472232534843,
"learning_rate": 4.2645343882778215e-07,
"logits/chosen": -2.734375,
"logits/rejected": -2.453125,
"logps/chosen": -720.0,
"logps/rejected": -1088.0,
"loss": 0.2257,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.625,
"rewards/margins": 3.828125,
"rewards/rejected": -9.4375,
"step": 4510
},
{
"epoch": 0.3262831155706345,
"grad_norm": 8.846494209878479,
"learning_rate": 4.260066016426177e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.46875,
"logps/chosen": -680.0,
"logps/rejected": -1032.0,
"loss": 0.1767,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -5.21875,
"rewards/margins": 3.59375,
"rewards/rejected": -8.8125,
"step": 4520
},
{
"epoch": 0.32700498087056956,
"grad_norm": 11.245824423136213,
"learning_rate": 4.25558646810717e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.59375,
"logps/chosen": -688.0,
"logps/rejected": -1020.0,
"loss": 0.1856,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -5.25,
"rewards/margins": 3.453125,
"rewards/rejected": -8.6875,
"step": 4530
},
{
"epoch": 0.32772684617050457,
"grad_norm": 8.60581993865266,
"learning_rate": 4.251095771766055e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.5,
"logps/chosen": -672.0,
"logps/rejected": -1048.0,
"loss": 0.177,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.09375,
"rewards/margins": 3.640625,
"rewards/rejected": -8.75,
"step": 4540
},
{
"epoch": 0.32844871147043964,
"grad_norm": 7.6110846227784625,
"learning_rate": 4.246593955918877e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.5625,
"logps/chosen": -716.0,
"logps/rejected": -1048.0,
"loss": 0.2188,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.59375,
"rewards/margins": 3.453125,
"rewards/rejected": -9.0625,
"step": 4550
},
{
"epoch": 0.32917057677037465,
"grad_norm": 7.571006600020749,
"learning_rate": 4.2420810491522896e-07,
"logits/chosen": -2.5625,
"logits/rejected": -2.34375,
"logps/chosen": -672.0,
"logps/rejected": -988.0,
"loss": 0.2004,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -5.28125,
"rewards/margins": 3.171875,
"rewards/rejected": -8.4375,
"step": 4560
},
{
"epoch": 0.32989244207030965,
"grad_norm": 9.619717180276336,
"learning_rate": 4.237557080123373e-07,
"logits/chosen": -2.53125,
"logits/rejected": -2.4375,
"logps/chosen": -672.0,
"logps/rejected": -956.0,
"loss": 0.2037,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -5.09375,
"rewards/margins": 3.140625,
"rewards/rejected": -8.25,
"step": 4570
},
{
"epoch": 0.3306143073702447,
"grad_norm": 9.813397994219041,
"learning_rate": 4.2330220775594567e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.515625,
"logps/chosen": -660.0,
"logps/rejected": -972.0,
"loss": 0.1992,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.9375,
"rewards/margins": 3.328125,
"rewards/rejected": -8.25,
"step": 4580
},
{
"epoch": 0.33133617267017973,
"grad_norm": 8.765749359430536,
"learning_rate": 4.228476070257929e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.46875,
"logps/chosen": -680.0,
"logps/rejected": -992.0,
"loss": 0.1884,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -5.21875,
"rewards/margins": 3.203125,
"rewards/rejected": -8.4375,
"step": 4590
},
{
"epoch": 0.3320580379701148,
"grad_norm": 10.82246666876482,
"learning_rate": 4.223919087086062e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.609375,
"logps/chosen": -640.0,
"logps/rejected": -1012.0,
"loss": 0.1802,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -4.875,
"rewards/margins": 3.859375,
"rewards/rejected": -8.75,
"step": 4600
},
{
"epoch": 0.3327799032700498,
"grad_norm": 7.941514770204173,
"learning_rate": 4.2193511569808225e-07,
"logits/chosen": -2.859375,
"logits/rejected": -2.609375,
"logps/chosen": -616.0,
"logps/rejected": -988.0,
"loss": 0.1991,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -4.5625,
"rewards/margins": 3.75,
"rewards/rejected": -8.3125,
"step": 4610
},
{
"epoch": 0.3335017685699848,
"grad_norm": 7.912745662185516,
"learning_rate": 4.214772308948693e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.453125,
"logps/chosen": -600.0,
"logps/rejected": -1024.0,
"loss": 0.2012,
"rewards/accuracies": 0.90625,
"rewards/chosen": -4.40625,
"rewards/margins": 4.4375,
"rewards/rejected": -8.8125,
"step": 4620
},
{
"epoch": 0.3342236338699199,
"grad_norm": 10.9521651772932,
"learning_rate": 4.2101825720654827e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.484375,
"logps/chosen": -644.0,
"logps/rejected": -936.0,
"loss": 0.2081,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -4.875,
"rewards/margins": 3.046875,
"rewards/rejected": -7.90625,
"step": 4630
},
{
"epoch": 0.3349454991698549,
"grad_norm": 6.99023599526195,
"learning_rate": 4.205581975476146e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.421875,
"logps/chosen": -652.0,
"logps/rejected": -988.0,
"loss": 0.2041,
"rewards/accuracies": 0.9375,
"rewards/chosen": -4.9375,
"rewards/margins": 3.453125,
"rewards/rejected": -8.4375,
"step": 4640
},
{
"epoch": 0.33566736446978995,
"grad_norm": 8.603344530140768,
"learning_rate": 4.200970548394598e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.578125,
"logps/chosen": -724.0,
"logps/rejected": -1040.0,
"loss": 0.1965,
"rewards/accuracies": 0.90625,
"rewards/chosen": -5.375,
"rewards/margins": 3.515625,
"rewards/rejected": -8.875,
"step": 4650
},
{
"epoch": 0.33638922976972496,
"grad_norm": 9.717823679934542,
"learning_rate": 4.196348320103527e-07,
"logits/chosen": -2.78125,
"logits/rejected": -2.609375,
"logps/chosen": -656.0,
"logps/rejected": -1024.0,
"loss": 0.213,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.125,
"rewards/margins": 3.515625,
"rewards/rejected": -8.625,
"step": 4660
},
{
"epoch": 0.33711109506966,
"grad_norm": 7.935814772911749,
"learning_rate": 4.191715319954209e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.53125,
"logps/chosen": -644.0,
"logps/rejected": -1008.0,
"loss": 0.1937,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -4.96875,
"rewards/margins": 3.625,
"rewards/rejected": -8.5625,
"step": 4670
},
{
"epoch": 0.33783296036959504,
"grad_norm": 8.769171773282734,
"learning_rate": 4.187071577366321e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.6875,
"logps/chosen": -684.0,
"logps/rejected": -1008.0,
"loss": 0.176,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -5.3125,
"rewards/margins": 3.421875,
"rewards/rejected": -8.75,
"step": 4680
},
{
"epoch": 0.33855482566953005,
"grad_norm": 7.096843320580391,
"learning_rate": 4.182417121827755e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.546875,
"logps/chosen": -676.0,
"logps/rejected": -1040.0,
"loss": 0.1906,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.3125,
"rewards/margins": 3.546875,
"rewards/rejected": -8.875,
"step": 4690
},
{
"epoch": 0.3392766909694651,
"grad_norm": 10.058671513695627,
"learning_rate": 4.177751982894433e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.515625,
"logps/chosen": -600.0,
"logps/rejected": -916.0,
"loss": 0.1903,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -4.34375,
"rewards/margins": 3.5625,
"rewards/rejected": -7.90625,
"step": 4700
},
{
"epoch": 0.3399985562694001,
"grad_norm": 10.565296750226013,
"learning_rate": 4.1730761901901135e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.46875,
"logps/chosen": -684.0,
"logps/rejected": -1064.0,
"loss": 0.1993,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.125,
"rewards/margins": 3.890625,
"rewards/rejected": -9.0,
"step": 4710
},
{
"epoch": 0.3407204215693352,
"grad_norm": 9.850412180420557,
"learning_rate": 4.168389773406209e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.5625,
"logps/chosen": -696.0,
"logps/rejected": -1032.0,
"loss": 0.2055,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": -5.3125,
"rewards/margins": 3.546875,
"rewards/rejected": -8.875,
"step": 4720
},
{
"epoch": 0.3414422868692702,
"grad_norm": 11.906676776121467,
"learning_rate": 4.1636927623015927e-07,
"logits/chosen": -2.96875,
"logits/rejected": -2.578125,
"logps/chosen": -656.0,
"logps/rejected": -1016.0,
"loss": 0.1838,
"rewards/accuracies": 0.9375,
"rewards/chosen": -4.875,
"rewards/margins": 3.796875,
"rewards/rejected": -8.6875,
"step": 4730
},
{
"epoch": 0.3421641521692052,
"grad_norm": 10.205674489245993,
"learning_rate": 4.158985186702415e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.4375,
"logps/chosen": -628.0,
"logps/rejected": -1056.0,
"loss": 0.2092,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -4.75,
"rewards/margins": 4.125,
"rewards/rejected": -8.875,
"step": 4740
},
{
"epoch": 0.34288601746914027,
"grad_norm": 9.260984330253814,
"learning_rate": 4.1542670765019104e-07,
"logits/chosen": -2.765625,
"logits/rejected": -2.5,
"logps/chosen": -672.0,
"logps/rejected": -1040.0,
"loss": 0.1958,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -5.125,
"rewards/margins": 3.828125,
"rewards/rejected": -8.9375,
"step": 4750
},
{
"epoch": 0.3436078827690753,
"grad_norm": 8.949027397431555,
"learning_rate": 4.149538461660206e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.40625,
"logps/chosen": -672.0,
"logps/rejected": -1004.0,
"loss": 0.2089,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.28125,
"rewards/margins": 3.296875,
"rewards/rejected": -8.5625,
"step": 4760
},
{
"epoch": 0.34432974806901034,
"grad_norm": 6.720014771416349,
"learning_rate": 4.144799372204136e-07,
"logits/chosen": -2.921875,
"logits/rejected": -2.6875,
"logps/chosen": -644.0,
"logps/rejected": -956.0,
"loss": 0.1826,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -4.875,
"rewards/margins": 3.21875,
"rewards/rejected": -8.125,
"step": 4770
},
{
"epoch": 0.34505161336894535,
"grad_norm": 8.959024936705582,
"learning_rate": 4.140049838227049e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.625,
"logps/chosen": -664.0,
"logps/rejected": -1012.0,
"loss": 0.1987,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -4.90625,
"rewards/margins": 3.703125,
"rewards/rejected": -8.5625,
"step": 4780
},
{
"epoch": 0.34577347866888036,
"grad_norm": 10.372748362230645,
"learning_rate": 4.135289889888615e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.65625,
"logps/chosen": -728.0,
"logps/rejected": -1088.0,
"loss": 0.1637,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.5,
"rewards/margins": 3.78125,
"rewards/rejected": -9.3125,
"step": 4790
},
{
"epoch": 0.34649534396881543,
"grad_norm": 8.270570715124181,
"learning_rate": 4.130519557414636e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.671875,
"logps/chosen": -660.0,
"logps/rejected": -1040.0,
"loss": 0.2018,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.96875,
"rewards/margins": 3.90625,
"rewards/rejected": -8.875,
"step": 4800
},
{
"epoch": 0.34721720926875044,
"grad_norm": 9.893879868420212,
"learning_rate": 4.1257388710968533e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.5,
"logps/chosen": -648.0,
"logps/rejected": -1008.0,
"loss": 0.1925,
"rewards/accuracies": 0.9375,
"rewards/chosen": -4.8125,
"rewards/margins": 3.8125,
"rewards/rejected": -8.625,
"step": 4810
},
{
"epoch": 0.3479390745686855,
"grad_norm": 12.331591426723168,
"learning_rate": 4.120947861292757e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.5625,
"logps/chosen": -716.0,
"logps/rejected": -1072.0,
"loss": 0.1966,
"rewards/accuracies": 0.9375,
"rewards/chosen": -5.5,
"rewards/margins": 3.671875,
"rewards/rejected": -9.1875,
"step": 4820
},
{
"epoch": 0.3486609398686205,
"grad_norm": 10.172376095851071,
"learning_rate": 4.11614655842539e-07,
"logits/chosen": -2.796875,
"logits/rejected": -2.65625,
"logps/chosen": -724.0,
"logps/rejected": -1056.0,
"loss": 0.2024,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.375,
"rewards/margins": 3.546875,
"rewards/rejected": -8.9375,
"step": 4830
},
{
"epoch": 0.3493828051685555,
"grad_norm": 11.310294528639917,
"learning_rate": 4.111334992983156e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.4375,
"logps/chosen": -640.0,
"logps/rejected": -992.0,
"loss": 0.1973,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.8125,
"rewards/margins": 3.5625,
"rewards/rejected": -8.375,
"step": 4840
},
{
"epoch": 0.3501046704684906,
"grad_norm": 9.138376308040302,
"learning_rate": 4.1065131955196294e-07,
"logits/chosen": -2.75,
"logits/rejected": -2.40625,
"logps/chosen": -656.0,
"logps/rejected": -1020.0,
"loss": 0.1957,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.03125,
"rewards/margins": 3.65625,
"rewards/rejected": -8.6875,
"step": 4850
},
{
"epoch": 0.3508265357684256,
"grad_norm": 10.948111955434124,
"learning_rate": 4.1016811966533536e-07,
"logits/chosen": -2.84375,
"logits/rejected": -2.53125,
"logps/chosen": -708.0,
"logps/rejected": -1104.0,
"loss": 0.1823,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.59375,
"rewards/margins": 3.953125,
"rewards/rejected": -9.5625,
"step": 4860
},
{
"epoch": 0.35154840106836066,
"grad_norm": 6.8483776654650965,
"learning_rate": 4.096839027067656e-07,
"logits/chosen": -2.953125,
"logits/rejected": -2.625,
"logps/chosen": -644.0,
"logps/rejected": -1016.0,
"loss": 0.2069,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -4.84375,
"rewards/margins": 3.796875,
"rewards/rejected": -8.625,
"step": 4870
},
{
"epoch": 0.35227026636829567,
"grad_norm": 7.262308675444548,
"learning_rate": 4.0919867175104435e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.6875,
"logps/chosen": -656.0,
"logps/rejected": -972.0,
"loss": 0.1921,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -4.875,
"rewards/margins": 3.40625,
"rewards/rejected": -8.25,
"step": 4880
},
{
"epoch": 0.35299213166823074,
"grad_norm": 17.175486759838638,
"learning_rate": 4.0871242987940155e-07,
"logits/chosen": -2.875,
"logits/rejected": -2.71875,
"logps/chosen": -688.0,
"logps/rejected": -1048.0,
"loss": 0.1981,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -5.3125,
"rewards/margins": 3.734375,
"rewards/rejected": -9.0625,
"step": 4890
},
{
"epoch": 0.35371399696816574,
"grad_norm": 6.418913714694265,
"learning_rate": 4.082251801794865e-07,
"logits/chosen": -3.0,
"logits/rejected": -2.71875,
"logps/chosen": -684.0,
"logps/rejected": -1048.0,
"loss": 0.1888,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -5.125,
"rewards/margins": 3.640625,
"rewards/rejected": -8.75,
"step": 4900
},
{
"epoch": 0.35443586226810075,
"grad_norm": 6.8125539564399515,
"learning_rate": 4.0773692574534795e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.5625,
"logps/chosen": -684.0,
"logps/rejected": -1000.0,
"loss": 0.1871,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": -5.1875,
"rewards/margins": 3.359375,
"rewards/rejected": -8.5625,
"step": 4910
},
{
"epoch": 0.3551577275680358,
"grad_norm": 7.814190613362822,
"learning_rate": 4.072476696774151e-07,
"logits/chosen": -2.8125,
"logits/rejected": -2.546875,
"logps/chosen": -720.0,
"logps/rejected": -1112.0,
"loss": 0.1852,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": -5.40625,
"rewards/margins": 4.03125,
"rewards/rejected": -9.4375,
"step": 4920
},
{
"epoch": 0.35587959286797083,
"grad_norm": 10.826610307359978,
"learning_rate": 4.0675741508247715e-07,
"logits/chosen": -2.953125,
"logits/rejected": -2.59375,
"logps/chosen": -680.0,
"logps/rejected": -1144.0,
"loss": 0.1675,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.3125,
"rewards/margins": 4.78125,
"rewards/rejected": -10.0625,
"step": 4930
},
{
"epoch": 0.3566014581679059,
"grad_norm": 8.596687269801581,
"learning_rate": 4.062661650736643e-07,
"logits/chosen": -3.046875,
"logits/rejected": -2.765625,
"logps/chosen": -728.0,
"logps/rejected": -1112.0,
"loss": 0.1869,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -5.59375,
"rewards/margins": 4.0,
"rewards/rejected": -9.625,
"step": 4940
},
{
"epoch": 0.3573233234678409,
"grad_norm": 6.416195679478135,
"learning_rate": 4.0577392277042766e-07,
"logits/chosen": -2.90625,
"logits/rejected": -2.671875,
"logps/chosen": -700.0,
"logps/rejected": -1056.0,
"loss": 0.1855,
"rewards/accuracies": 0.90625,
"rewards/chosen": -5.375,
"rewards/margins": 3.6875,
"rewards/rejected": -9.0625,
"step": 4950
},
{
"epoch": 0.3580451887677759,
"grad_norm": 8.918928643083534,
"learning_rate": 4.0528069129851914e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.46875,
"logps/chosen": -712.0,
"logps/rejected": -1088.0,
"loss": 0.1846,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -5.28125,
"rewards/margins": 3.953125,
"rewards/rejected": -9.25,
"step": 4960
},
{
"epoch": 0.358767054067711,
"grad_norm": 8.47545192360217,
"learning_rate": 4.0478647378997223e-07,
"logits/chosen": -2.703125,
"logits/rejected": -2.515625,
"logps/chosen": -724.0,
"logps/rejected": -1048.0,
"loss": 0.2025,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.5625,
"rewards/margins": 3.46875,
"rewards/rejected": -9.0625,
"step": 4970
},
{
"epoch": 0.359488919367646,
"grad_norm": 8.09646150016637,
"learning_rate": 4.0429127338308154e-07,
"logits/chosen": -2.828125,
"logits/rejected": -2.53125,
"logps/chosen": -700.0,
"logps/rejected": -1024.0,
"loss": 0.206,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.375,
"rewards/margins": 3.421875,
"rewards/rejected": -8.8125,
"step": 4980
},
{
"epoch": 0.36021078466758105,
"grad_norm": 7.912242395511905,
"learning_rate": 4.037950932223832e-07,
"logits/chosen": -2.71875,
"logits/rejected": -2.5,
"logps/chosen": -676.0,
"logps/rejected": -1072.0,
"loss": 0.186,
"rewards/accuracies": 0.918749988079071,
"rewards/chosen": -5.21875,
"rewards/margins": 3.796875,
"rewards/rejected": -9.0,
"step": 4990
},
{
"epoch": 0.36093264996751606,
"grad_norm": 8.510565195808283,
"learning_rate": 4.032979364586349e-07,
"logits/chosen": -2.953125,
"logits/rejected": -2.703125,
"logps/chosen": -688.0,
"logps/rejected": -1064.0,
"loss": 0.2007,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": -5.28125,
"rewards/margins": 3.734375,
"rewards/rejected": -9.0,
"step": 5000
},
{
"epoch": 0.36093264996751606,
"eval_logits/chosen": -2.90625,
"eval_logits/rejected": -2.65625,
"eval_logps/chosen": -700.0,
"eval_logps/rejected": -1040.0,
"eval_loss": 0.22352416813373566,
"eval_rewards/accuracies": 0.9081980586051941,
"eval_rewards/chosen": -5.3125,
"eval_rewards/margins": 3.546875,
"eval_rewards/rejected": -8.875,
"eval_runtime": 3594.5422,
"eval_samples_per_second": 27.403,
"eval_steps_per_second": 0.428,
"step": 5000
}
],
"logging_steps": 10,
"max_steps": 13853,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 5000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}