{ "best_metric": 0.22352416813373566, "best_model_checkpoint": "models/qwen2.5-3b-dpo-finegrained/checkpoint-5000", "epoch": 0.36093264996751606, "eval_steps": 5000, "global_step": 5000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 7.218652999350322e-05, "grad_norm": 1.852354340577762, "learning_rate": 3.6075036075036073e-10, "logits/chosen": -2.59375, "logits/rejected": -1.6015625, "logps/chosen": -146.0, "logps/rejected": -166.0, "loss": 0.6914, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1 }, { "epoch": 0.0007218652999350321, "grad_norm": 1.998199384338708, "learning_rate": 3.6075036075036073e-09, "logits/chosen": -2.265625, "logits/rejected": -1.953125, "logps/chosen": -157.0, "logps/rejected": -143.0, "loss": 0.6922, "rewards/accuracies": 0.2638888955116272, "rewards/chosen": 0.000766754150390625, "rewards/margins": 0.000606536865234375, "rewards/rejected": 0.000156402587890625, "step": 10 }, { "epoch": 0.0014437305998700643, "grad_norm": 1.859902408963682, "learning_rate": 7.215007215007215e-09, "logits/chosen": -2.34375, "logits/rejected": -1.984375, "logps/chosen": -157.0, "logps/rejected": -139.0, "loss": 0.6927, "rewards/accuracies": 0.36250001192092896, "rewards/chosen": 0.001129150390625, "rewards/margins": 0.00061798095703125, "rewards/rejected": 0.000507354736328125, "step": 20 }, { "epoch": 0.0021655958998050965, "grad_norm": 1.800945636929482, "learning_rate": 1.0822510822510822e-08, "logits/chosen": -2.390625, "logits/rejected": -2.015625, "logps/chosen": -146.0, "logps/rejected": -148.0, "loss": 0.6923, "rewards/accuracies": 0.3375000059604645, "rewards/chosen": 0.000640869140625, "rewards/margins": -0.0003757476806640625, "rewards/rejected": 0.00101470947265625, "step": 30 }, { "epoch": 0.0028874611997401285, "grad_norm": 1.9512697515276394, "learning_rate": 1.443001443001443e-08, "logits/chosen": -2.421875, "logits/rejected": -2.0, "logps/chosen": -165.0, "logps/rejected": -161.0, "loss": 0.6927, "rewards/accuracies": 0.2874999940395355, "rewards/chosen": 0.00010967254638671875, "rewards/margins": 0.0003910064697265625, "rewards/rejected": -0.00028228759765625, "step": 40 }, { "epoch": 0.0036093264996751606, "grad_norm": 1.9685077450218404, "learning_rate": 1.8037518037518035e-08, "logits/chosen": -2.21875, "logits/rejected": -2.015625, "logps/chosen": -165.0, "logps/rejected": -143.0, "loss": 0.6929, "rewards/accuracies": 0.3187499940395355, "rewards/chosen": 9.441375732421875e-05, "rewards/margins": 0.0001239776611328125, "rewards/rejected": -3.0159950256347656e-05, "step": 50 }, { "epoch": 0.004331191799610193, "grad_norm": 1.9944209672205195, "learning_rate": 2.1645021645021644e-08, "logits/chosen": -2.34375, "logits/rejected": -1.984375, "logps/chosen": -160.0, "logps/rejected": -136.0, "loss": 0.6926, "rewards/accuracies": 0.3812499940395355, "rewards/chosen": -0.000232696533203125, "rewards/margins": 0.00102996826171875, "rewards/rejected": -0.0012664794921875, "step": 60 }, { "epoch": 0.005053057099545225, "grad_norm": 1.8602055997261977, "learning_rate": 2.525252525252525e-08, "logits/chosen": -2.40625, "logits/rejected": -1.8984375, "logps/chosen": -150.0, "logps/rejected": -154.0, "loss": 0.6926, "rewards/accuracies": 0.3375000059604645, "rewards/chosen": 0.000438690185546875, "rewards/margins": 0.00054931640625, "rewards/rejected": -0.00010919570922851562, "step": 70 }, { "epoch": 0.005774922399480257, "grad_norm": 1.7129972696287459, "learning_rate": 2.886002886002886e-08, "logits/chosen": -2.359375, "logits/rejected": -2.046875, "logps/chosen": -170.0, "logps/rejected": -145.0, "loss": 0.6928, "rewards/accuracies": 0.39375001192092896, "rewards/chosen": 0.000579833984375, "rewards/margins": 0.0004520416259765625, "rewards/rejected": 0.0001239776611328125, "step": 80 }, { "epoch": 0.006496787699415289, "grad_norm": 1.8246478253492482, "learning_rate": 3.246753246753246e-08, "logits/chosen": -2.484375, "logits/rejected": -2.0625, "logps/chosen": -178.0, "logps/rejected": -158.0, "loss": 0.6925, "rewards/accuracies": 0.3499999940395355, "rewards/chosen": 0.000469207763671875, "rewards/margins": 0.0001888275146484375, "rewards/rejected": 0.0002803802490234375, "step": 90 }, { "epoch": 0.007218652999350321, "grad_norm": 1.7657315202986226, "learning_rate": 3.607503607503607e-08, "logits/chosen": -2.390625, "logits/rejected": -1.984375, "logps/chosen": -172.0, "logps/rejected": -163.0, "loss": 0.6927, "rewards/accuracies": 0.3062500059604645, "rewards/chosen": 0.000797271728515625, "rewards/margins": -0.0003910064697265625, "rewards/rejected": 0.001190185546875, "step": 100 }, { "epoch": 0.007940518299285354, "grad_norm": 2.0123631368082844, "learning_rate": 3.968253968253968e-08, "logits/chosen": -2.453125, "logits/rejected": -1.9296875, "logps/chosen": -153.0, "logps/rejected": -140.0, "loss": 0.6926, "rewards/accuracies": 0.35624998807907104, "rewards/chosen": 0.000186920166015625, "rewards/margins": 0.00018787384033203125, "rewards/rejected": 1.1473894119262695e-06, "step": 110 }, { "epoch": 0.008662383599220386, "grad_norm": 1.9667654175700489, "learning_rate": 4.329004329004329e-08, "logits/chosen": -2.40625, "logits/rejected": -2.0, "logps/chosen": -146.0, "logps/rejected": -137.0, "loss": 0.6926, "rewards/accuracies": 0.33125001192092896, "rewards/chosen": 0.00154876708984375, "rewards/margins": -0.00103759765625, "rewards/rejected": 0.0025787353515625, "step": 120 }, { "epoch": 0.009384248899155418, "grad_norm": 1.7516436962452608, "learning_rate": 4.68975468975469e-08, "logits/chosen": -2.5625, "logits/rejected": -2.1875, "logps/chosen": -152.0, "logps/rejected": -151.0, "loss": 0.6925, "rewards/accuracies": 0.4312500059604645, "rewards/chosen": 0.0027313232421875, "rewards/margins": 0.00164031982421875, "rewards/rejected": 0.0010986328125, "step": 130 }, { "epoch": 0.01010611419909045, "grad_norm": 2.0629971445302435, "learning_rate": 5.05050505050505e-08, "logits/chosen": -2.34375, "logits/rejected": -2.046875, "logps/chosen": -167.0, "logps/rejected": -152.0, "loss": 0.6921, "rewards/accuracies": 0.39375001192092896, "rewards/chosen": 0.0018768310546875, "rewards/margins": 0.000438690185546875, "rewards/rejected": 0.00144195556640625, "step": 140 }, { "epoch": 0.010827979499025482, "grad_norm": 2.0455409873804205, "learning_rate": 5.411255411255411e-08, "logits/chosen": -2.375, "logits/rejected": -2.09375, "logps/chosen": -165.0, "logps/rejected": -147.0, "loss": 0.6923, "rewards/accuracies": 0.40625, "rewards/chosen": 0.001739501953125, "rewards/margins": 5.435943603515625e-05, "rewards/rejected": 0.001678466796875, "step": 150 }, { "epoch": 0.011549844798960514, "grad_norm": 2.003008491192784, "learning_rate": 5.772005772005772e-08, "logits/chosen": -2.359375, "logits/rejected": -1.8359375, "logps/chosen": -166.0, "logps/rejected": -161.0, "loss": 0.6919, "rewards/accuracies": 0.4375, "rewards/chosen": 0.0026702880859375, "rewards/margins": 0.00093841552734375, "rewards/rejected": 0.00173187255859375, "step": 160 }, { "epoch": 0.012271710098895546, "grad_norm": 1.8970983946398985, "learning_rate": 6.132756132756133e-08, "logits/chosen": -2.34375, "logits/rejected": -1.9921875, "logps/chosen": -163.0, "logps/rejected": -142.0, "loss": 0.6915, "rewards/accuracies": 0.53125, "rewards/chosen": 0.00445556640625, "rewards/margins": 0.00396728515625, "rewards/rejected": 0.0004787445068359375, "step": 170 }, { "epoch": 0.012993575398830578, "grad_norm": 1.9000812663628288, "learning_rate": 6.493506493506492e-08, "logits/chosen": -2.390625, "logits/rejected": -1.9140625, "logps/chosen": -184.0, "logps/rejected": -166.0, "loss": 0.6913, "rewards/accuracies": 0.4375, "rewards/chosen": 0.004791259765625, "rewards/margins": 0.00274658203125, "rewards/rejected": 0.0020294189453125, "step": 180 }, { "epoch": 0.01371544069876561, "grad_norm": 1.7694192875136483, "learning_rate": 6.854256854256854e-08, "logits/chosen": -2.375, "logits/rejected": -2.015625, "logps/chosen": -168.0, "logps/rejected": -147.0, "loss": 0.691, "rewards/accuracies": 0.5249999761581421, "rewards/chosen": 0.007598876953125, "rewards/margins": 0.003387451171875, "rewards/rejected": 0.00421142578125, "step": 190 }, { "epoch": 0.014437305998700642, "grad_norm": 1.8022914272788901, "learning_rate": 7.215007215007214e-08, "logits/chosen": -2.296875, "logits/rejected": -1.890625, "logps/chosen": -150.0, "logps/rejected": -137.0, "loss": 0.6907, "rewards/accuracies": 0.5562499761581421, "rewards/chosen": 0.007354736328125, "rewards/margins": 0.005584716796875, "rewards/rejected": 0.0017547607421875, "step": 200 }, { "epoch": 0.015159171298635674, "grad_norm": 1.7754509638333658, "learning_rate": 7.575757575757576e-08, "logits/chosen": -2.328125, "logits/rejected": -2.0, "logps/chosen": -155.0, "logps/rejected": -151.0, "loss": 0.6908, "rewards/accuracies": 0.53125, "rewards/chosen": 0.007537841796875, "rewards/margins": 0.0034942626953125, "rewards/rejected": 0.0040283203125, "step": 210 }, { "epoch": 0.015881036598570708, "grad_norm": 1.8713087698233093, "learning_rate": 7.936507936507936e-08, "logits/chosen": -2.546875, "logits/rejected": -1.8984375, "logps/chosen": -156.0, "logps/rejected": -168.0, "loss": 0.6903, "rewards/accuracies": 0.574999988079071, "rewards/chosen": 0.00860595703125, "rewards/margins": 0.00469970703125, "rewards/rejected": 0.00390625, "step": 220 }, { "epoch": 0.01660290189850574, "grad_norm": 1.7352700913418746, "learning_rate": 8.297258297258297e-08, "logits/chosen": -2.359375, "logits/rejected": -2.0, "logps/chosen": -171.0, "logps/rejected": -150.0, "loss": 0.6897, "rewards/accuracies": 0.606249988079071, "rewards/chosen": 0.01153564453125, "rewards/margins": 0.00640869140625, "rewards/rejected": 0.005157470703125, "step": 230 }, { "epoch": 0.017324767198440772, "grad_norm": 1.923679325098434, "learning_rate": 8.658008658008658e-08, "logits/chosen": -2.40625, "logits/rejected": -2.171875, "logps/chosen": -168.0, "logps/rejected": -153.0, "loss": 0.6889, "rewards/accuracies": 0.6499999761581421, "rewards/chosen": 0.01507568359375, "rewards/margins": 0.00933837890625, "rewards/rejected": 0.005706787109375, "step": 240 }, { "epoch": 0.018046632498375802, "grad_norm": 1.9336109183415302, "learning_rate": 9.018759018759018e-08, "logits/chosen": -2.46875, "logits/rejected": -2.140625, "logps/chosen": -198.0, "logps/rejected": -190.0, "loss": 0.6883, "rewards/accuracies": 0.6312500238418579, "rewards/chosen": 0.015625, "rewards/margins": 0.01055908203125, "rewards/rejected": 0.005035400390625, "step": 250 }, { "epoch": 0.018768497798310836, "grad_norm": 1.7118991587292718, "learning_rate": 9.37950937950938e-08, "logits/chosen": -2.484375, "logits/rejected": -1.9921875, "logps/chosen": -148.0, "logps/rejected": -164.0, "loss": 0.6873, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": 0.0172119140625, "rewards/margins": 0.012451171875, "rewards/rejected": 0.00469970703125, "step": 260 }, { "epoch": 0.019490363098245866, "grad_norm": 2.0498889647791634, "learning_rate": 9.74025974025974e-08, "logits/chosen": -2.578125, "logits/rejected": -2.125, "logps/chosen": -168.0, "logps/rejected": -150.0, "loss": 0.6875, "rewards/accuracies": 0.6187499761581421, "rewards/chosen": 0.0159912109375, "rewards/margins": 0.00982666015625, "rewards/rejected": 0.006195068359375, "step": 270 }, { "epoch": 0.0202122283981809, "grad_norm": 1.7948780770940682, "learning_rate": 1.01010101010101e-07, "logits/chosen": -2.5, "logits/rejected": -1.9140625, "logps/chosen": -162.0, "logps/rejected": -170.0, "loss": 0.6865, "rewards/accuracies": 0.643750011920929, "rewards/chosen": 0.018310546875, "rewards/margins": 0.01513671875, "rewards/rejected": 0.0032196044921875, "step": 280 }, { "epoch": 0.02093409369811593, "grad_norm": 1.7485728753360685, "learning_rate": 1.0461760461760462e-07, "logits/chosen": -2.390625, "logits/rejected": -2.09375, "logps/chosen": -173.0, "logps/rejected": -152.0, "loss": 0.6865, "rewards/accuracies": 0.5874999761581421, "rewards/chosen": 0.0172119140625, "rewards/margins": 0.0089111328125, "rewards/rejected": 0.0084228515625, "step": 290 }, { "epoch": 0.021655958998050964, "grad_norm": 1.7752446010354384, "learning_rate": 1.0822510822510822e-07, "logits/chosen": -2.453125, "logits/rejected": -2.15625, "logps/chosen": -162.0, "logps/rejected": -165.0, "loss": 0.6857, "rewards/accuracies": 0.6937500238418579, "rewards/chosen": 0.0238037109375, "rewards/margins": 0.015625, "rewards/rejected": 0.00823974609375, "step": 300 }, { "epoch": 0.022377824297985995, "grad_norm": 1.9527079542055057, "learning_rate": 1.1183261183261184e-07, "logits/chosen": -2.546875, "logits/rejected": -2.078125, "logps/chosen": -148.0, "logps/rejected": -153.0, "loss": 0.6845, "rewards/accuracies": 0.737500011920929, "rewards/chosen": 0.0203857421875, "rewards/margins": 0.0184326171875, "rewards/rejected": 0.00201416015625, "step": 310 }, { "epoch": 0.02309968959792103, "grad_norm": 1.798683396295616, "learning_rate": 1.1544011544011543e-07, "logits/chosen": -2.453125, "logits/rejected": -2.09375, "logps/chosen": -163.0, "logps/rejected": -141.0, "loss": 0.6844, "rewards/accuracies": 0.637499988079071, "rewards/chosen": 0.02197265625, "rewards/margins": 0.0184326171875, "rewards/rejected": 0.003570556640625, "step": 320 }, { "epoch": 0.02382155489785606, "grad_norm": 1.822086025310402, "learning_rate": 1.1904761904761903e-07, "logits/chosen": -2.453125, "logits/rejected": -1.9765625, "logps/chosen": -159.0, "logps/rejected": -147.0, "loss": 0.6816, "rewards/accuracies": 0.65625, "rewards/chosen": 0.02490234375, "rewards/margins": 0.0225830078125, "rewards/rejected": 0.002349853515625, "step": 330 }, { "epoch": 0.024543420197791092, "grad_norm": 1.8205804931965275, "learning_rate": 1.2265512265512265e-07, "logits/chosen": -2.453125, "logits/rejected": -2.125, "logps/chosen": -163.0, "logps/rejected": -168.0, "loss": 0.6809, "rewards/accuracies": 0.6937500238418579, "rewards/chosen": 0.0240478515625, "rewards/margins": 0.02392578125, "rewards/rejected": 4.839897155761719e-05, "step": 340 }, { "epoch": 0.025265285497726123, "grad_norm": 2.015225469187424, "learning_rate": 1.2626262626262626e-07, "logits/chosen": -2.4375, "logits/rejected": -2.1875, "logps/chosen": -168.0, "logps/rejected": -138.0, "loss": 0.6787, "rewards/accuracies": 0.706250011920929, "rewards/chosen": 0.023193359375, "rewards/margins": 0.02880859375, "rewards/rejected": -0.005706787109375, "step": 350 }, { "epoch": 0.025987150797661156, "grad_norm": 1.8960338628946363, "learning_rate": 1.2987012987012984e-07, "logits/chosen": -2.34375, "logits/rejected": -2.0625, "logps/chosen": -171.0, "logps/rejected": -155.0, "loss": 0.679, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": 0.024169921875, "rewards/margins": 0.029052734375, "rewards/rejected": -0.004791259765625, "step": 360 }, { "epoch": 0.02670901609759619, "grad_norm": 1.9289106441512014, "learning_rate": 1.3347763347763348e-07, "logits/chosen": -2.484375, "logits/rejected": -2.125, "logps/chosen": -143.0, "logps/rejected": -147.0, "loss": 0.6755, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": 0.0277099609375, "rewards/margins": 0.036376953125, "rewards/rejected": -0.00848388671875, "step": 370 }, { "epoch": 0.02743088139753122, "grad_norm": 2.4318763159683168, "learning_rate": 1.370851370851371e-07, "logits/chosen": -2.59375, "logits/rejected": -2.078125, "logps/chosen": -161.0, "logps/rejected": -154.0, "loss": 0.6738, "rewards/accuracies": 0.768750011920929, "rewards/chosen": 0.016845703125, "rewards/margins": 0.0390625, "rewards/rejected": -0.022216796875, "step": 380 }, { "epoch": 0.028152746697466254, "grad_norm": 1.727518768188907, "learning_rate": 1.406926406926407e-07, "logits/chosen": -2.46875, "logits/rejected": -2.125, "logps/chosen": -151.0, "logps/rejected": -145.0, "loss": 0.6737, "rewards/accuracies": 0.731249988079071, "rewards/chosen": 0.0238037109375, "rewards/margins": 0.04541015625, "rewards/rejected": -0.0216064453125, "step": 390 }, { "epoch": 0.028874611997401285, "grad_norm": 1.8565593414895172, "learning_rate": 1.4430014430014428e-07, "logits/chosen": -2.453125, "logits/rejected": -2.046875, "logps/chosen": -169.0, "logps/rejected": -162.0, "loss": 0.6703, "rewards/accuracies": 0.762499988079071, "rewards/chosen": 0.01324462890625, "rewards/margins": 0.0458984375, "rewards/rejected": -0.03271484375, "step": 400 }, { "epoch": 0.02959647729733632, "grad_norm": 1.9588571879597823, "learning_rate": 1.479076479076479e-07, "logits/chosen": -2.46875, "logits/rejected": -2.296875, "logps/chosen": -152.0, "logps/rejected": -137.0, "loss": 0.6681, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": 0.006378173828125, "rewards/margins": 0.052734375, "rewards/rejected": -0.04638671875, "step": 410 }, { "epoch": 0.03031834259727135, "grad_norm": 1.93069247030128, "learning_rate": 1.5151515151515152e-07, "logits/chosen": -2.515625, "logits/rejected": -2.203125, "logps/chosen": -172.0, "logps/rejected": -144.0, "loss": 0.6667, "rewards/accuracies": 0.6875, "rewards/chosen": -0.0025787353515625, "rewards/margins": 0.044189453125, "rewards/rejected": -0.046875, "step": 420 }, { "epoch": 0.031040207897206382, "grad_norm": 1.819742407006859, "learning_rate": 1.5512265512265513e-07, "logits/chosen": -2.546875, "logits/rejected": -2.125, "logps/chosen": -172.0, "logps/rejected": -152.0, "loss": 0.6625, "rewards/accuracies": 0.675000011920929, "rewards/chosen": -0.002685546875, "rewards/margins": 0.06396484375, "rewards/rejected": -0.06640625, "step": 430 }, { "epoch": 0.031762073197141416, "grad_norm": 2.3055219231256108, "learning_rate": 1.5873015873015872e-07, "logits/chosen": -2.4375, "logits/rejected": -2.1875, "logps/chosen": -155.0, "logps/rejected": -158.0, "loss": 0.6555, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.01123046875, "rewards/margins": 0.078125, "rewards/rejected": -0.08935546875, "step": 440 }, { "epoch": 0.032483938497076446, "grad_norm": 1.9129712763765747, "learning_rate": 1.6233766233766232e-07, "logits/chosen": -2.515625, "logits/rejected": -2.140625, "logps/chosen": -166.0, "logps/rejected": -154.0, "loss": 0.6547, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.031494140625, "rewards/margins": 0.07666015625, "rewards/rejected": -0.10791015625, "step": 450 }, { "epoch": 0.03320580379701148, "grad_norm": 1.936887902580248, "learning_rate": 1.6594516594516593e-07, "logits/chosen": -2.609375, "logits/rejected": -2.25, "logps/chosen": -166.0, "logps/rejected": -163.0, "loss": 0.65, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.0478515625, "rewards/margins": 0.08740234375, "rewards/rejected": -0.1357421875, "step": 460 }, { "epoch": 0.03392766909694651, "grad_norm": 2.1168551608123725, "learning_rate": 1.6955266955266957e-07, "logits/chosen": -2.65625, "logits/rejected": -2.234375, "logps/chosen": -187.0, "logps/rejected": -190.0, "loss": 0.6399, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.06298828125, "rewards/margins": 0.11279296875, "rewards/rejected": -0.17578125, "step": 470 }, { "epoch": 0.034649534396881544, "grad_norm": 2.4110075564522533, "learning_rate": 1.7316017316017315e-07, "logits/chosen": -2.59375, "logits/rejected": -2.296875, "logps/chosen": -171.0, "logps/rejected": -167.0, "loss": 0.6345, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.09375, "rewards/margins": 0.1376953125, "rewards/rejected": -0.2314453125, "step": 480 }, { "epoch": 0.035371399696816574, "grad_norm": 2.561479324237141, "learning_rate": 1.7676767676767676e-07, "logits/chosen": -2.5625, "logits/rejected": -2.34375, "logps/chosen": -165.0, "logps/rejected": -169.0, "loss": 0.6272, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.1552734375, "rewards/margins": 0.1328125, "rewards/rejected": -0.287109375, "step": 490 }, { "epoch": 0.036093264996751605, "grad_norm": 2.2009284942320004, "learning_rate": 1.8037518037518037e-07, "logits/chosen": -2.59375, "logits/rejected": -2.1875, "logps/chosen": -180.0, "logps/rejected": -198.0, "loss": 0.6213, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.1826171875, "rewards/margins": 0.1806640625, "rewards/rejected": -0.36328125, "step": 500 }, { "epoch": 0.036815130296686635, "grad_norm": 2.433624086599741, "learning_rate": 1.8398268398268395e-07, "logits/chosen": -2.625, "logits/rejected": -2.203125, "logps/chosen": -182.0, "logps/rejected": -181.0, "loss": 0.6137, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.2294921875, "rewards/margins": 0.1787109375, "rewards/rejected": -0.408203125, "step": 510 }, { "epoch": 0.03753699559662167, "grad_norm": 2.3303081056576396, "learning_rate": 1.875901875901876e-07, "logits/chosen": -2.6875, "logits/rejected": -2.3125, "logps/chosen": -183.0, "logps/rejected": -198.0, "loss": 0.6089, "rewards/accuracies": 0.75, "rewards/chosen": -0.28125, "rewards/margins": 0.1953125, "rewards/rejected": -0.4765625, "step": 520 }, { "epoch": 0.0382588608965567, "grad_norm": 7.529255626517495, "learning_rate": 1.911976911976912e-07, "logits/chosen": -2.59375, "logits/rejected": -2.203125, "logps/chosen": -188.0, "logps/rejected": -206.0, "loss": 0.6063, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.3046875, "rewards/margins": 0.236328125, "rewards/rejected": -0.5390625, "step": 530 }, { "epoch": 0.03898072619649173, "grad_norm": 2.2072494405878578, "learning_rate": 1.948051948051948e-07, "logits/chosen": -2.71875, "logits/rejected": -2.3125, "logps/chosen": -203.0, "logps/rejected": -224.0, "loss": 0.5956, "rewards/accuracies": 0.78125, "rewards/chosen": -0.3515625, "rewards/margins": 0.283203125, "rewards/rejected": -0.6328125, "step": 540 }, { "epoch": 0.03970259149642677, "grad_norm": 2.310476086986689, "learning_rate": 1.984126984126984e-07, "logits/chosen": -2.703125, "logits/rejected": -2.484375, "logps/chosen": -220.0, "logps/rejected": -209.0, "loss": 0.5867, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.416015625, "rewards/margins": 0.236328125, "rewards/rejected": -0.65234375, "step": 550 }, { "epoch": 0.0404244567963618, "grad_norm": 2.6001658124806286, "learning_rate": 2.02020202020202e-07, "logits/chosen": -2.765625, "logits/rejected": -2.359375, "logps/chosen": -208.0, "logps/rejected": -239.0, "loss": 0.5754, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.447265625, "rewards/margins": 0.31640625, "rewards/rejected": -0.76171875, "step": 560 }, { "epoch": 0.04114632209629683, "grad_norm": 2.635075269431316, "learning_rate": 2.0562770562770563e-07, "logits/chosen": -2.609375, "logits/rejected": -2.390625, "logps/chosen": -217.0, "logps/rejected": -227.0, "loss": 0.5719, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.494140625, "rewards/margins": 0.33984375, "rewards/rejected": -0.83203125, "step": 570 }, { "epoch": 0.04186818739623186, "grad_norm": 2.5380650062224066, "learning_rate": 2.0923520923520924e-07, "logits/chosen": -2.71875, "logits/rejected": -2.453125, "logps/chosen": -216.0, "logps/rejected": -237.0, "loss": 0.5794, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.50390625, "rewards/margins": 0.349609375, "rewards/rejected": -0.8515625, "step": 580 }, { "epoch": 0.0425900526961669, "grad_norm": 2.808866971835476, "learning_rate": 2.1284271284271282e-07, "logits/chosen": -2.875, "logits/rejected": -2.546875, "logps/chosen": -216.0, "logps/rejected": -264.0, "loss": 0.5557, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.5390625, "rewards/margins": 0.50390625, "rewards/rejected": -1.046875, "step": 590 }, { "epoch": 0.04331191799610193, "grad_norm": 3.660790591856929, "learning_rate": 2.1645021645021643e-07, "logits/chosen": -3.0625, "logits/rejected": -2.734375, "logps/chosen": -215.0, "logps/rejected": -226.0, "loss": 0.5374, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.60546875, "rewards/margins": 0.3203125, "rewards/rejected": -0.92578125, "step": 600 }, { "epoch": 0.04403378329603696, "grad_norm": 3.4012692341173842, "learning_rate": 2.2005772005772004e-07, "logits/chosen": -2.984375, "logits/rejected": -2.671875, "logps/chosen": -243.0, "logps/rejected": -288.0, "loss": 0.5302, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.75, "rewards/margins": 0.51953125, "rewards/rejected": -1.2734375, "step": 610 }, { "epoch": 0.04475564859597199, "grad_norm": 3.1213723367337276, "learning_rate": 2.2366522366522368e-07, "logits/chosen": -3.265625, "logits/rejected": -2.796875, "logps/chosen": -252.0, "logps/rejected": -290.0, "loss": 0.5349, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.82421875, "rewards/margins": 0.6171875, "rewards/rejected": -1.4375, "step": 620 }, { "epoch": 0.045477513895907026, "grad_norm": 3.4139219834989825, "learning_rate": 2.2727272727272726e-07, "logits/chosen": -3.078125, "logits/rejected": -2.8125, "logps/chosen": -241.0, "logps/rejected": -290.0, "loss": 0.5313, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.76953125, "rewards/margins": 0.625, "rewards/rejected": -1.390625, "step": 630 }, { "epoch": 0.04619937919584206, "grad_norm": 3.545601457816913, "learning_rate": 2.3088023088023087e-07, "logits/chosen": -3.0625, "logits/rejected": -2.796875, "logps/chosen": -254.0, "logps/rejected": -306.0, "loss": 0.5163, "rewards/accuracies": 0.8125, "rewards/chosen": -0.796875, "rewards/margins": 0.671875, "rewards/rejected": -1.46875, "step": 640 }, { "epoch": 0.04692124449577709, "grad_norm": 6.320535114176617, "learning_rate": 2.3448773448773448e-07, "logits/chosen": -3.15625, "logits/rejected": -2.9375, "logps/chosen": -258.0, "logps/rejected": -312.0, "loss": 0.5168, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.92578125, "rewards/margins": 0.625, "rewards/rejected": -1.5546875, "step": 650 }, { "epoch": 0.04764310979571212, "grad_norm": 4.40606882426551, "learning_rate": 2.3809523809523806e-07, "logits/chosen": -3.234375, "logits/rejected": -2.984375, "logps/chosen": -258.0, "logps/rejected": -300.0, "loss": 0.506, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.9375, "rewards/margins": 0.6171875, "rewards/rejected": -1.5546875, "step": 660 }, { "epoch": 0.048364975095647154, "grad_norm": 7.228420353041346, "learning_rate": 2.4170274170274167e-07, "logits/chosen": -3.046875, "logits/rejected": -2.8125, "logps/chosen": -230.0, "logps/rejected": -308.0, "loss": 0.5231, "rewards/accuracies": 0.78125, "rewards/chosen": -0.8359375, "rewards/margins": 0.7421875, "rewards/rejected": -1.578125, "step": 670 }, { "epoch": 0.049086840395582185, "grad_norm": 4.810449590822843, "learning_rate": 2.453102453102453e-07, "logits/chosen": -3.046875, "logits/rejected": -2.75, "logps/chosen": -246.0, "logps/rejected": -280.0, "loss": 0.5107, "rewards/accuracies": 0.75, "rewards/chosen": -0.88671875, "rewards/margins": 0.498046875, "rewards/rejected": -1.3828125, "step": 680 }, { "epoch": 0.049808705695517215, "grad_norm": 6.916956622472092, "learning_rate": 2.4891774891774894e-07, "logits/chosen": -3.046875, "logits/rejected": -2.9375, "logps/chosen": -270.0, "logps/rejected": -322.0, "loss": 0.5105, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.9765625, "rewards/margins": 0.6484375, "rewards/rejected": -1.625, "step": 690 }, { "epoch": 0.050530570995452245, "grad_norm": 5.072218871042774, "learning_rate": 2.525252525252525e-07, "logits/chosen": -3.109375, "logits/rejected": -2.84375, "logps/chosen": -256.0, "logps/rejected": -326.0, "loss": 0.5065, "rewards/accuracies": 0.78125, "rewards/chosen": -0.92578125, "rewards/margins": 0.76953125, "rewards/rejected": -1.6953125, "step": 700 }, { "epoch": 0.05125243629538728, "grad_norm": 8.875662849487487, "learning_rate": 2.5613275613275616e-07, "logits/chosen": -3.09375, "logits/rejected": -2.84375, "logps/chosen": -254.0, "logps/rejected": -306.0, "loss": 0.5112, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.94921875, "rewards/margins": 0.61328125, "rewards/rejected": -1.5625, "step": 710 }, { "epoch": 0.05197430159532231, "grad_norm": 5.595849818392523, "learning_rate": 2.597402597402597e-07, "logits/chosen": -3.15625, "logits/rejected": -2.96875, "logps/chosen": -264.0, "logps/rejected": -340.0, "loss": 0.5107, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -1.0078125, "rewards/margins": 0.8125, "rewards/rejected": -1.8203125, "step": 720 }, { "epoch": 0.05269616689525734, "grad_norm": 5.404147285645744, "learning_rate": 2.633477633477633e-07, "logits/chosen": -3.03125, "logits/rejected": -2.65625, "logps/chosen": -268.0, "logps/rejected": -368.0, "loss": 0.5035, "rewards/accuracies": 0.78125, "rewards/chosen": -0.984375, "rewards/margins": 0.94140625, "rewards/rejected": -1.9296875, "step": 730 }, { "epoch": 0.05341803219519238, "grad_norm": 8.76041109611346, "learning_rate": 2.6695526695526696e-07, "logits/chosen": -2.984375, "logits/rejected": -2.828125, "logps/chosen": -286.0, "logps/rejected": -342.0, "loss": 0.4887, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -1.125, "rewards/margins": 0.75390625, "rewards/rejected": -1.8828125, "step": 740 }, { "epoch": 0.05413989749512741, "grad_norm": 7.025589443972428, "learning_rate": 2.7056277056277054e-07, "logits/chosen": -2.96875, "logits/rejected": -2.78125, "logps/chosen": -262.0, "logps/rejected": -348.0, "loss": 0.4823, "rewards/accuracies": 0.8125, "rewards/chosen": -1.0, "rewards/margins": 0.94921875, "rewards/rejected": -1.953125, "step": 750 }, { "epoch": 0.05486176279506244, "grad_norm": 11.975302977639574, "learning_rate": 2.741702741702742e-07, "logits/chosen": -2.953125, "logits/rejected": -2.75, "logps/chosen": -276.0, "logps/rejected": -322.0, "loss": 0.4766, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -1.140625, "rewards/margins": 0.6953125, "rewards/rejected": -1.8359375, "step": 760 }, { "epoch": 0.05558362809499747, "grad_norm": 6.5118457359444, "learning_rate": 2.7777777777777776e-07, "logits/chosen": -2.953125, "logits/rejected": -2.734375, "logps/chosen": -280.0, "logps/rejected": -346.0, "loss": 0.4846, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -1.1875, "rewards/margins": 0.80859375, "rewards/rejected": -1.9921875, "step": 770 }, { "epoch": 0.05630549339493251, "grad_norm": 6.106781577833728, "learning_rate": 2.813852813852814e-07, "logits/chosen": -3.015625, "logits/rejected": -2.6875, "logps/chosen": -260.0, "logps/rejected": -356.0, "loss": 0.4665, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.046875, "rewards/margins": 0.83203125, "rewards/rejected": -1.875, "step": 780 }, { "epoch": 0.05702735869486754, "grad_norm": 10.75495308386994, "learning_rate": 2.8499278499278503e-07, "logits/chosen": -2.875, "logits/rejected": -2.625, "logps/chosen": -284.0, "logps/rejected": -408.0, "loss": 0.4695, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.2109375, "rewards/margins": 1.171875, "rewards/rejected": -2.390625, "step": 790 }, { "epoch": 0.05774922399480257, "grad_norm": 5.788421207967755, "learning_rate": 2.8860028860028856e-07, "logits/chosen": -2.875, "logits/rejected": -2.65625, "logps/chosen": -274.0, "logps/rejected": -334.0, "loss": 0.4767, "rewards/accuracies": 0.8125, "rewards/chosen": -1.125, "rewards/margins": 0.84765625, "rewards/rejected": -1.9765625, "step": 800 }, { "epoch": 0.0584710892947376, "grad_norm": 8.78614857490401, "learning_rate": 2.922077922077922e-07, "logits/chosen": -3.015625, "logits/rejected": -2.71875, "logps/chosen": -262.0, "logps/rejected": -362.0, "loss": 0.4722, "rewards/accuracies": 0.8125, "rewards/chosen": -1.234375, "rewards/margins": 0.8984375, "rewards/rejected": -2.125, "step": 810 }, { "epoch": 0.05919295459467264, "grad_norm": 7.3161771388355294, "learning_rate": 2.958152958152958e-07, "logits/chosen": -2.84375, "logits/rejected": -2.578125, "logps/chosen": -272.0, "logps/rejected": -376.0, "loss": 0.4996, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -1.1796875, "rewards/margins": 0.93359375, "rewards/rejected": -2.109375, "step": 820 }, { "epoch": 0.05991481989460767, "grad_norm": 8.266553993044619, "learning_rate": 2.994227994227994e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -282.0, "logps/rejected": -376.0, "loss": 0.4545, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.15625, "rewards/margins": 1.015625, "rewards/rejected": -2.171875, "step": 830 }, { "epoch": 0.0606366851945427, "grad_norm": 8.218438777679667, "learning_rate": 3.0303030303030305e-07, "logits/chosen": -2.890625, "logits/rejected": -2.640625, "logps/chosen": -272.0, "logps/rejected": -382.0, "loss": 0.4639, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -1.25, "rewards/margins": 1.0234375, "rewards/rejected": -2.28125, "step": 840 }, { "epoch": 0.06135855049447773, "grad_norm": 8.61378341353772, "learning_rate": 3.0663780663780663e-07, "logits/chosen": -3.078125, "logits/rejected": -2.640625, "logps/chosen": -284.0, "logps/rejected": -408.0, "loss": 0.4536, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -1.2578125, "rewards/margins": 1.109375, "rewards/rejected": -2.359375, "step": 850 }, { "epoch": 0.062080415794412765, "grad_norm": 12.398406848670698, "learning_rate": 3.1024531024531027e-07, "logits/chosen": -2.875, "logits/rejected": -2.65625, "logps/chosen": -286.0, "logps/rejected": -372.0, "loss": 0.476, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -1.2578125, "rewards/margins": 1.0078125, "rewards/rejected": -2.265625, "step": 860 }, { "epoch": 0.0628022810943478, "grad_norm": 12.244121744087602, "learning_rate": 3.138528138528138e-07, "logits/chosen": -2.765625, "logits/rejected": -2.671875, "logps/chosen": -294.0, "logps/rejected": -388.0, "loss": 0.4623, "rewards/accuracies": 0.78125, "rewards/chosen": -1.3671875, "rewards/margins": 0.984375, "rewards/rejected": -2.359375, "step": 870 }, { "epoch": 0.06352414639428283, "grad_norm": 10.812869810884447, "learning_rate": 3.1746031746031743e-07, "logits/chosen": -3.03125, "logits/rejected": -2.796875, "logps/chosen": -268.0, "logps/rejected": -366.0, "loss": 0.4498, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.234375, "rewards/margins": 0.99609375, "rewards/rejected": -2.234375, "step": 880 }, { "epoch": 0.06424601169421786, "grad_norm": 11.229212598361977, "learning_rate": 3.2106782106782107e-07, "logits/chosen": -2.84375, "logits/rejected": -2.75, "logps/chosen": -298.0, "logps/rejected": -394.0, "loss": 0.4373, "rewards/accuracies": 0.8125, "rewards/chosen": -1.3828125, "rewards/margins": 1.0859375, "rewards/rejected": -2.46875, "step": 890 }, { "epoch": 0.06496787699415289, "grad_norm": 7.414765021326351, "learning_rate": 3.2467532467532465e-07, "logits/chosen": -2.984375, "logits/rejected": -2.75, "logps/chosen": -294.0, "logps/rejected": -394.0, "loss": 0.4253, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -1.34375, "rewards/margins": 1.140625, "rewards/rejected": -2.484375, "step": 900 }, { "epoch": 0.06568974229408793, "grad_norm": 6.656174306105041, "learning_rate": 3.282828282828283e-07, "logits/chosen": -2.96875, "logits/rejected": -2.65625, "logps/chosen": -322.0, "logps/rejected": -440.0, "loss": 0.4366, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -1.6328125, "rewards/margins": 1.1484375, "rewards/rejected": -2.78125, "step": 910 }, { "epoch": 0.06641160759402295, "grad_norm": 6.986955189515223, "learning_rate": 3.3189033189033187e-07, "logits/chosen": -2.921875, "logits/rejected": -2.71875, "logps/chosen": -328.0, "logps/rejected": -422.0, "loss": 0.4335, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -1.515625, "rewards/margins": 1.234375, "rewards/rejected": -2.75, "step": 920 }, { "epoch": 0.06713347289395799, "grad_norm": 8.704691417598838, "learning_rate": 3.354978354978355e-07, "logits/chosen": -2.734375, "logits/rejected": -2.6875, "logps/chosen": -322.0, "logps/rejected": -406.0, "loss": 0.4048, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -1.5703125, "rewards/margins": 1.0703125, "rewards/rejected": -2.640625, "step": 930 }, { "epoch": 0.06785533819389301, "grad_norm": 19.52535270358171, "learning_rate": 3.3910533910533914e-07, "logits/chosen": -2.8125, "logits/rejected": -2.65625, "logps/chosen": -316.0, "logps/rejected": -476.0, "loss": 0.434, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -1.6015625, "rewards/margins": 1.609375, "rewards/rejected": -3.21875, "step": 940 }, { "epoch": 0.06857720349382805, "grad_norm": 11.339737953685198, "learning_rate": 3.4271284271284267e-07, "logits/chosen": -2.5625, "logits/rejected": -2.375, "logps/chosen": -316.0, "logps/rejected": -398.0, "loss": 0.4334, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -1.5625, "rewards/margins": 1.03125, "rewards/rejected": -2.59375, "step": 950 }, { "epoch": 0.06929906879376309, "grad_norm": 10.31037341226185, "learning_rate": 3.463203463203463e-07, "logits/chosen": -2.828125, "logits/rejected": -2.4375, "logps/chosen": -322.0, "logps/rejected": -456.0, "loss": 0.4161, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -1.6328125, "rewards/margins": 1.40625, "rewards/rejected": -3.046875, "step": 960 }, { "epoch": 0.07002093409369811, "grad_norm": 11.130584733664083, "learning_rate": 3.499278499278499e-07, "logits/chosen": -2.78125, "logits/rejected": -2.59375, "logps/chosen": -298.0, "logps/rejected": -424.0, "loss": 0.4078, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -1.4296875, "rewards/margins": 1.3671875, "rewards/rejected": -2.796875, "step": 970 }, { "epoch": 0.07074279939363315, "grad_norm": 9.06083640139615, "learning_rate": 3.535353535353535e-07, "logits/chosen": -2.796875, "logits/rejected": -2.609375, "logps/chosen": -308.0, "logps/rejected": -442.0, "loss": 0.4178, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -1.53125, "rewards/margins": 1.3515625, "rewards/rejected": -2.890625, "step": 980 }, { "epoch": 0.07146466469356819, "grad_norm": 9.541422651232944, "learning_rate": 3.5714285714285716e-07, "logits/chosen": -2.75, "logits/rejected": -2.46875, "logps/chosen": -338.0, "logps/rejected": -450.0, "loss": 0.3953, "rewards/accuracies": 0.78125, "rewards/chosen": -1.7109375, "rewards/margins": 1.375, "rewards/rejected": -3.078125, "step": 990 }, { "epoch": 0.07218652999350321, "grad_norm": 9.110551563711448, "learning_rate": 3.6075036075036074e-07, "logits/chosen": -2.640625, "logits/rejected": -2.5, "logps/chosen": -326.0, "logps/rejected": -464.0, "loss": 0.4021, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -1.53125, "rewards/margins": 1.453125, "rewards/rejected": -2.984375, "step": 1000 }, { "epoch": 0.07290839529343825, "grad_norm": 15.071837561832831, "learning_rate": 3.643578643578644e-07, "logits/chosen": -2.6875, "logits/rejected": -2.5625, "logps/chosen": -314.0, "logps/rejected": -452.0, "loss": 0.4045, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.5625, "rewards/margins": 1.3671875, "rewards/rejected": -2.921875, "step": 1010 }, { "epoch": 0.07363026059337327, "grad_norm": 13.920977378141336, "learning_rate": 3.679653679653679e-07, "logits/chosen": -2.78125, "logits/rejected": -2.59375, "logps/chosen": -334.0, "logps/rejected": -492.0, "loss": 0.431, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -1.8125, "rewards/margins": 1.46875, "rewards/rejected": -3.28125, "step": 1020 }, { "epoch": 0.07435212589330831, "grad_norm": 11.085289038392293, "learning_rate": 3.7157287157287154e-07, "logits/chosen": -2.75, "logits/rejected": -2.5, "logps/chosen": -298.0, "logps/rejected": -456.0, "loss": 0.3934, "rewards/accuracies": 0.8125, "rewards/chosen": -1.5703125, "rewards/margins": 1.390625, "rewards/rejected": -2.96875, "step": 1030 }, { "epoch": 0.07507399119324334, "grad_norm": 10.088971897286424, "learning_rate": 3.751803751803752e-07, "logits/chosen": -2.78125, "logits/rejected": -2.625, "logps/chosen": -322.0, "logps/rejected": -456.0, "loss": 0.4073, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -1.7109375, "rewards/margins": 1.3515625, "rewards/rejected": -3.0625, "step": 1040 }, { "epoch": 0.07579585649317837, "grad_norm": 43.24163673888106, "learning_rate": 3.7878787878787876e-07, "logits/chosen": -2.59375, "logits/rejected": -2.375, "logps/chosen": -348.0, "logps/rejected": -496.0, "loss": 0.4152, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -1.890625, "rewards/margins": 1.25, "rewards/rejected": -3.140625, "step": 1050 }, { "epoch": 0.0765177217931134, "grad_norm": 8.537892452168746, "learning_rate": 3.823953823953824e-07, "logits/chosen": -2.59375, "logits/rejected": -2.40625, "logps/chosen": -338.0, "logps/rejected": -480.0, "loss": 0.3947, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -1.765625, "rewards/margins": 1.5234375, "rewards/rejected": -3.296875, "step": 1060 }, { "epoch": 0.07723958709304844, "grad_norm": 9.485771716655114, "learning_rate": 3.86002886002886e-07, "logits/chosen": -2.625, "logits/rejected": -2.375, "logps/chosen": -326.0, "logps/rejected": -462.0, "loss": 0.3837, "rewards/accuracies": 0.78125, "rewards/chosen": -1.640625, "rewards/margins": 1.453125, "rewards/rejected": -3.09375, "step": 1070 }, { "epoch": 0.07796145239298347, "grad_norm": 9.46365785011617, "learning_rate": 3.896103896103896e-07, "logits/chosen": -2.625, "logits/rejected": -2.328125, "logps/chosen": -386.0, "logps/rejected": -536.0, "loss": 0.3848, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -2.15625, "rewards/margins": 1.7890625, "rewards/rejected": -3.9375, "step": 1080 }, { "epoch": 0.0786833176929185, "grad_norm": 13.461346342787172, "learning_rate": 3.9321789321789325e-07, "logits/chosen": -2.625, "logits/rejected": -2.453125, "logps/chosen": -360.0, "logps/rejected": -520.0, "loss": 0.3922, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -1.875, "rewards/margins": 1.8984375, "rewards/rejected": -3.765625, "step": 1090 }, { "epoch": 0.07940518299285354, "grad_norm": 12.44634151581957, "learning_rate": 3.968253968253968e-07, "logits/chosen": -2.640625, "logits/rejected": -2.40625, "logps/chosen": -356.0, "logps/rejected": -508.0, "loss": 0.3727, "rewards/accuracies": 0.8125, "rewards/chosen": -2.015625, "rewards/margins": 1.5, "rewards/rejected": -3.515625, "step": 1100 }, { "epoch": 0.08012704829278856, "grad_norm": 11.687822831294243, "learning_rate": 4.004329004329004e-07, "logits/chosen": -2.75, "logits/rejected": -2.4375, "logps/chosen": -346.0, "logps/rejected": -568.0, "loss": 0.3765, "rewards/accuracies": 0.875, "rewards/chosen": -1.875, "rewards/margins": 2.171875, "rewards/rejected": -4.0625, "step": 1110 }, { "epoch": 0.0808489135927236, "grad_norm": 16.193115895860167, "learning_rate": 4.04040404040404e-07, "logits/chosen": -2.640625, "logits/rejected": -2.4375, "logps/chosen": -356.0, "logps/rejected": -532.0, "loss": 0.3726, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -1.9921875, "rewards/margins": 1.6484375, "rewards/rejected": -3.65625, "step": 1120 }, { "epoch": 0.08157077889265862, "grad_norm": 10.454280347519187, "learning_rate": 4.0764790764790763e-07, "logits/chosen": -2.625, "logits/rejected": -2.421875, "logps/chosen": -350.0, "logps/rejected": -496.0, "loss": 0.4066, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.78125, "rewards/margins": 1.515625, "rewards/rejected": -3.296875, "step": 1130 }, { "epoch": 0.08229264419259366, "grad_norm": 10.033847939954763, "learning_rate": 4.1125541125541127e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5625, "logps/chosen": -334.0, "logps/rejected": -462.0, "loss": 0.355, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -1.7890625, "rewards/margins": 1.3984375, "rewards/rejected": -3.1875, "step": 1140 }, { "epoch": 0.0830145094925287, "grad_norm": 13.538065077526934, "learning_rate": 4.1486291486291485e-07, "logits/chosen": -2.875, "logits/rejected": -2.6875, "logps/chosen": -398.0, "logps/rejected": -588.0, "loss": 0.3843, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -2.1875, "rewards/margins": 2.078125, "rewards/rejected": -4.28125, "step": 1150 }, { "epoch": 0.08373637479246372, "grad_norm": 12.06165274825125, "learning_rate": 4.184704184704185e-07, "logits/chosen": -2.75, "logits/rejected": -2.484375, "logps/chosen": -314.0, "logps/rejected": -500.0, "loss": 0.3816, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -1.6796875, "rewards/margins": 1.7578125, "rewards/rejected": -3.4375, "step": 1160 }, { "epoch": 0.08445824009239876, "grad_norm": 14.245004620424362, "learning_rate": 4.22077922077922e-07, "logits/chosen": -2.703125, "logits/rejected": -2.640625, "logps/chosen": -376.0, "logps/rejected": -612.0, "loss": 0.3599, "rewards/accuracies": 0.84375, "rewards/chosen": -2.21875, "rewards/margins": 2.375, "rewards/rejected": -4.59375, "step": 1170 }, { "epoch": 0.0851801053923338, "grad_norm": 12.93467746542696, "learning_rate": 4.2568542568542565e-07, "logits/chosen": -2.765625, "logits/rejected": -2.578125, "logps/chosen": -330.0, "logps/rejected": -476.0, "loss": 0.3635, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.75, "rewards/margins": 1.5859375, "rewards/rejected": -3.34375, "step": 1180 }, { "epoch": 0.08590197069226882, "grad_norm": 11.202101570401776, "learning_rate": 4.292929292929293e-07, "logits/chosen": -2.78125, "logits/rejected": -2.546875, "logps/chosen": -364.0, "logps/rejected": -536.0, "loss": 0.3583, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -2.125, "rewards/margins": 1.8359375, "rewards/rejected": -3.953125, "step": 1190 }, { "epoch": 0.08662383599220386, "grad_norm": 10.771994466129188, "learning_rate": 4.3290043290043287e-07, "logits/chosen": -2.59375, "logits/rejected": -2.5, "logps/chosen": -358.0, "logps/rejected": -510.0, "loss": 0.3465, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -1.8828125, "rewards/margins": 1.578125, "rewards/rejected": -3.46875, "step": 1200 }, { "epoch": 0.08734570129213888, "grad_norm": 14.841268368598595, "learning_rate": 4.365079365079365e-07, "logits/chosen": -2.703125, "logits/rejected": -2.578125, "logps/chosen": -364.0, "logps/rejected": -584.0, "loss": 0.3477, "rewards/accuracies": 0.84375, "rewards/chosen": -2.234375, "rewards/margins": 2.171875, "rewards/rejected": -4.40625, "step": 1210 }, { "epoch": 0.08806756659207392, "grad_norm": 9.504108427187644, "learning_rate": 4.401154401154401e-07, "logits/chosen": -2.875, "logits/rejected": -2.546875, "logps/chosen": -394.0, "logps/rejected": -648.0, "loss": 0.3755, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -2.25, "rewards/margins": 2.703125, "rewards/rejected": -4.9375, "step": 1220 }, { "epoch": 0.08878943189200895, "grad_norm": 12.115514229718103, "learning_rate": 4.437229437229437e-07, "logits/chosen": -2.765625, "logits/rejected": -2.578125, "logps/chosen": -304.0, "logps/rejected": -520.0, "loss": 0.3704, "rewards/accuracies": 0.90625, "rewards/chosen": -1.5390625, "rewards/margins": 2.1875, "rewards/rejected": -3.71875, "step": 1230 }, { "epoch": 0.08951129719194398, "grad_norm": 10.317228267259349, "learning_rate": 4.4733044733044736e-07, "logits/chosen": -2.796875, "logits/rejected": -2.625, "logps/chosen": -420.0, "logps/rejected": -612.0, "loss": 0.3559, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -2.5, "rewards/margins": 1.9453125, "rewards/rejected": -4.46875, "step": 1240 }, { "epoch": 0.09023316249187902, "grad_norm": 11.197522859178363, "learning_rate": 4.509379509379509e-07, "logits/chosen": -2.671875, "logits/rejected": -2.546875, "logps/chosen": -428.0, "logps/rejected": -604.0, "loss": 0.3219, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -2.71875, "rewards/margins": 1.859375, "rewards/rejected": -4.59375, "step": 1250 }, { "epoch": 0.09095502779181405, "grad_norm": 13.497331724381818, "learning_rate": 4.545454545454545e-07, "logits/chosen": -2.703125, "logits/rejected": -2.453125, "logps/chosen": -412.0, "logps/rejected": -604.0, "loss": 0.3388, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -2.546875, "rewards/margins": 1.9765625, "rewards/rejected": -4.53125, "step": 1260 }, { "epoch": 0.09167689309174908, "grad_norm": 11.433124284340494, "learning_rate": 4.581529581529581e-07, "logits/chosen": -2.671875, "logits/rejected": -2.5625, "logps/chosen": -390.0, "logps/rejected": -560.0, "loss": 0.3458, "rewards/accuracies": 0.875, "rewards/chosen": -2.234375, "rewards/margins": 1.7734375, "rewards/rejected": -4.0, "step": 1270 }, { "epoch": 0.09239875839168411, "grad_norm": 12.324384516756012, "learning_rate": 4.6176046176046174e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5, "logps/chosen": -410.0, "logps/rejected": -580.0, "loss": 0.3426, "rewards/accuracies": 0.90625, "rewards/chosen": -2.328125, "rewards/margins": 1.890625, "rewards/rejected": -4.21875, "step": 1280 }, { "epoch": 0.09312062369161915, "grad_norm": 10.730987022263216, "learning_rate": 4.6536796536796537e-07, "logits/chosen": -2.671875, "logits/rejected": -2.390625, "logps/chosen": -442.0, "logps/rejected": -612.0, "loss": 0.3593, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -2.828125, "rewards/margins": 1.7890625, "rewards/rejected": -4.625, "step": 1290 }, { "epoch": 0.09384248899155417, "grad_norm": 10.132938191746307, "learning_rate": 4.6897546897546896e-07, "logits/chosen": -2.734375, "logits/rejected": -2.578125, "logps/chosen": -408.0, "logps/rejected": -564.0, "loss": 0.3632, "rewards/accuracies": 0.84375, "rewards/chosen": -2.359375, "rewards/margins": 1.75, "rewards/rejected": -4.09375, "step": 1300 }, { "epoch": 0.09456435429148921, "grad_norm": 11.988621181927288, "learning_rate": 4.725829725829726e-07, "logits/chosen": -2.578125, "logits/rejected": -2.4375, "logps/chosen": -452.0, "logps/rejected": -624.0, "loss": 0.3609, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -2.921875, "rewards/margins": 1.78125, "rewards/rejected": -4.71875, "step": 1310 }, { "epoch": 0.09528621959142423, "grad_norm": 8.802084815882347, "learning_rate": 4.761904761904761e-07, "logits/chosen": -2.671875, "logits/rejected": -2.515625, "logps/chosen": -458.0, "logps/rejected": -604.0, "loss": 0.3197, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -2.9375, "rewards/margins": 1.5859375, "rewards/rejected": -4.53125, "step": 1320 }, { "epoch": 0.09600808489135927, "grad_norm": 13.978035740824382, "learning_rate": 4.797979797979798e-07, "logits/chosen": -2.6875, "logits/rejected": -2.4375, "logps/chosen": -420.0, "logps/rejected": -660.0, "loss": 0.355, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -2.703125, "rewards/margins": 2.46875, "rewards/rejected": -5.15625, "step": 1330 }, { "epoch": 0.09672995019129431, "grad_norm": 9.329953252240916, "learning_rate": 4.834054834054833e-07, "logits/chosen": -2.71875, "logits/rejected": -2.53125, "logps/chosen": -426.0, "logps/rejected": -612.0, "loss": 0.3382, "rewards/accuracies": 0.875, "rewards/chosen": -2.703125, "rewards/margins": 1.8203125, "rewards/rejected": -4.53125, "step": 1340 }, { "epoch": 0.09745181549122933, "grad_norm": 14.354032725201476, "learning_rate": 4.87012987012987e-07, "logits/chosen": -2.625, "logits/rejected": -2.390625, "logps/chosen": -438.0, "logps/rejected": -628.0, "loss": 0.3375, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -2.53125, "rewards/margins": 2.15625, "rewards/rejected": -4.6875, "step": 1350 }, { "epoch": 0.09817368079116437, "grad_norm": 11.184165035806638, "learning_rate": 4.906204906204906e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5, "logps/chosen": -444.0, "logps/rejected": -640.0, "loss": 0.3528, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -2.6875, "rewards/margins": 2.015625, "rewards/rejected": -4.6875, "step": 1360 }, { "epoch": 0.0988955460910994, "grad_norm": 9.32730305340813, "learning_rate": 4.942279942279942e-07, "logits/chosen": -2.6875, "logits/rejected": -2.515625, "logps/chosen": -420.0, "logps/rejected": -592.0, "loss": 0.3343, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -2.609375, "rewards/margins": 1.9375, "rewards/rejected": -4.53125, "step": 1370 }, { "epoch": 0.09961741139103443, "grad_norm": 17.291834755334516, "learning_rate": 4.978354978354979e-07, "logits/chosen": -2.765625, "logits/rejected": -2.671875, "logps/chosen": -450.0, "logps/rejected": -636.0, "loss": 0.3246, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -2.71875, "rewards/margins": 1.9765625, "rewards/rejected": -4.6875, "step": 1380 }, { "epoch": 0.10033927669096947, "grad_norm": 10.743034154219572, "learning_rate": 4.999998729993963e-07, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -430.0, "logps/rejected": -604.0, "loss": 0.3335, "rewards/accuracies": 0.84375, "rewards/chosen": -2.6875, "rewards/margins": 1.8984375, "rewards/rejected": -4.59375, "step": 1390 }, { "epoch": 0.10106114199090449, "grad_norm": 17.190340388139088, "learning_rate": 4.999984442440868e-07, "logits/chosen": -2.96875, "logits/rejected": -2.703125, "logps/chosen": -438.0, "logps/rejected": -680.0, "loss": 0.3204, "rewards/accuracies": 0.84375, "rewards/chosen": -2.984375, "rewards/margins": 2.453125, "rewards/rejected": -5.4375, "step": 1400 }, { "epoch": 0.10178300729083953, "grad_norm": 9.641498367561857, "learning_rate": 4.99995427991816e-07, "logits/chosen": -2.703125, "logits/rejected": -2.53125, "logps/chosen": -442.0, "logps/rejected": -648.0, "loss": 0.3379, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -2.71875, "rewards/margins": 2.171875, "rewards/rejected": -4.875, "step": 1410 }, { "epoch": 0.10250487259077457, "grad_norm": 9.768069678095703, "learning_rate": 4.999908242617371e-07, "logits/chosen": -2.84375, "logits/rejected": -2.609375, "logps/chosen": -452.0, "logps/rejected": -648.0, "loss": 0.34, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -2.765625, "rewards/margins": 1.84375, "rewards/rejected": -4.59375, "step": 1420 }, { "epoch": 0.10322673789070959, "grad_norm": 13.37422488078675, "learning_rate": 4.99984633083084e-07, "logits/chosen": -2.765625, "logits/rejected": -2.578125, "logps/chosen": -416.0, "logps/rejected": -616.0, "loss": 0.331, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -2.6875, "rewards/margins": 1.8984375, "rewards/rejected": -4.5625, "step": 1430 }, { "epoch": 0.10394860319064463, "grad_norm": 11.253293027609532, "learning_rate": 4.99976854495171e-07, "logits/chosen": -2.765625, "logits/rejected": -2.625, "logps/chosen": -488.0, "logps/rejected": -696.0, "loss": 0.3218, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -3.453125, "rewards/margins": 2.09375, "rewards/rejected": -5.53125, "step": 1440 }, { "epoch": 0.10467046849057966, "grad_norm": 10.82613372416563, "learning_rate": 4.999674885473922e-07, "logits/chosen": -2.90625, "logits/rejected": -2.484375, "logps/chosen": -458.0, "logps/rejected": -656.0, "loss": 0.3213, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -2.921875, "rewards/margins": 1.734375, "rewards/rejected": -4.65625, "step": 1450 }, { "epoch": 0.10539233379051469, "grad_norm": 15.794446739298891, "learning_rate": 4.999565352992216e-07, "logits/chosen": -2.8125, "logits/rejected": -2.6875, "logps/chosen": -502.0, "logps/rejected": -712.0, "loss": 0.3289, "rewards/accuracies": 0.90625, "rewards/chosen": -3.21875, "rewards/margins": 2.296875, "rewards/rejected": -5.5, "step": 1460 }, { "epoch": 0.10611419909044972, "grad_norm": 10.361664841175285, "learning_rate": 4.999439948202127e-07, "logits/chosen": -2.859375, "logits/rejected": -2.609375, "logps/chosen": -450.0, "logps/rejected": -596.0, "loss": 0.3261, "rewards/accuracies": 0.84375, "rewards/chosen": -2.859375, "rewards/margins": 1.8515625, "rewards/rejected": -4.71875, "step": 1470 }, { "epoch": 0.10683606439038476, "grad_norm": 10.555951221100015, "learning_rate": 4.999298671899977e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5625, "logps/chosen": -452.0, "logps/rejected": -644.0, "loss": 0.3399, "rewards/accuracies": 0.875, "rewards/chosen": -2.75, "rewards/margins": 2.171875, "rewards/rejected": -4.9375, "step": 1480 }, { "epoch": 0.10755792969031978, "grad_norm": 9.802204192641314, "learning_rate": 4.999141524982877e-07, "logits/chosen": -2.734375, "logits/rejected": -2.515625, "logps/chosen": -444.0, "logps/rejected": -700.0, "loss": 0.309, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -2.84375, "rewards/margins": 2.6875, "rewards/rejected": -5.53125, "step": 1490 }, { "epoch": 0.10827979499025482, "grad_norm": 12.72303480502336, "learning_rate": 4.998968508448714e-07, "logits/chosen": -2.640625, "logits/rejected": -2.453125, "logps/chosen": -432.0, "logps/rejected": -632.0, "loss": 0.3276, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -2.625, "rewards/margins": 2.15625, "rewards/rejected": -4.78125, "step": 1500 }, { "epoch": 0.10900166029018984, "grad_norm": 14.570251314538908, "learning_rate": 4.998779623396146e-07, "logits/chosen": -2.671875, "logits/rejected": -2.46875, "logps/chosen": -502.0, "logps/rejected": -720.0, "loss": 0.2995, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -3.140625, "rewards/margins": 2.5, "rewards/rejected": -5.65625, "step": 1510 }, { "epoch": 0.10972352559012488, "grad_norm": 11.169758259343533, "learning_rate": 4.9985748710246e-07, "logits/chosen": -2.59375, "logits/rejected": -2.421875, "logps/chosen": -476.0, "logps/rejected": -656.0, "loss": 0.3344, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.21875, "rewards/margins": 1.84375, "rewards/rejected": -5.0625, "step": 1520 }, { "epoch": 0.11044539089005992, "grad_norm": 10.504554948014457, "learning_rate": 4.998354252634257e-07, "logits/chosen": -2.609375, "logits/rejected": -2.46875, "logps/chosen": -486.0, "logps/rejected": -668.0, "loss": 0.2853, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -3.21875, "rewards/margins": 2.078125, "rewards/rejected": -5.28125, "step": 1530 }, { "epoch": 0.11116725618999494, "grad_norm": 15.073212833972551, "learning_rate": 4.998117769626051e-07, "logits/chosen": -2.796875, "logits/rejected": -2.703125, "logps/chosen": -456.0, "logps/rejected": -676.0, "loss": 0.309, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -2.984375, "rewards/margins": 2.25, "rewards/rejected": -5.21875, "step": 1540 }, { "epoch": 0.11188912148992998, "grad_norm": 10.298569511142073, "learning_rate": 4.997865423501657e-07, "logits/chosen": -2.734375, "logits/rejected": -2.53125, "logps/chosen": -380.0, "logps/rejected": -564.0, "loss": 0.3261, "rewards/accuracies": 0.84375, "rewards/chosen": -2.328125, "rewards/margins": 1.8828125, "rewards/rejected": -4.21875, "step": 1550 }, { "epoch": 0.11261098678986502, "grad_norm": 11.022262328486809, "learning_rate": 4.997597215863477e-07, "logits/chosen": -2.6875, "logits/rejected": -2.546875, "logps/chosen": -480.0, "logps/rejected": -716.0, "loss": 0.2878, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -3.09375, "rewards/margins": 2.59375, "rewards/rejected": -5.6875, "step": 1560 }, { "epoch": 0.11333285208980004, "grad_norm": 12.425423187064853, "learning_rate": 4.99731314841464e-07, "logits/chosen": -2.640625, "logits/rejected": -2.53125, "logps/chosen": -500.0, "logps/rejected": -704.0, "loss": 0.3008, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -3.390625, "rewards/margins": 2.1875, "rewards/rejected": -5.5625, "step": 1570 }, { "epoch": 0.11405471738973508, "grad_norm": 10.996930809431353, "learning_rate": 4.997013222958978e-07, "logits/chosen": -2.625, "logits/rejected": -2.546875, "logps/chosen": -496.0, "logps/rejected": -732.0, "loss": 0.3105, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.234375, "rewards/margins": 2.578125, "rewards/rejected": -5.8125, "step": 1580 }, { "epoch": 0.1147765826896701, "grad_norm": 11.11449736666811, "learning_rate": 4.99669744140103e-07, "logits/chosen": -2.640625, "logits/rejected": -2.53125, "logps/chosen": -512.0, "logps/rejected": -716.0, "loss": 0.3043, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -3.75, "rewards/margins": 2.09375, "rewards/rejected": -5.84375, "step": 1590 }, { "epoch": 0.11549844798960514, "grad_norm": 10.155961204890554, "learning_rate": 4.996365805746015e-07, "logits/chosen": -2.671875, "logits/rejected": -2.5625, "logps/chosen": -474.0, "logps/rejected": -752.0, "loss": 0.2908, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.234375, "rewards/margins": 2.796875, "rewards/rejected": -6.03125, "step": 1600 }, { "epoch": 0.11622031328954018, "grad_norm": 9.079844890608808, "learning_rate": 4.996018318099829e-07, "logits/chosen": -2.421875, "logits/rejected": -2.28125, "logps/chosen": -506.0, "logps/rejected": -712.0, "loss": 0.2977, "rewards/accuracies": 0.84375, "rewards/chosen": -3.46875, "rewards/margins": 2.171875, "rewards/rejected": -5.65625, "step": 1610 }, { "epoch": 0.1169421785894752, "grad_norm": 13.337729397169802, "learning_rate": 4.995654980669028e-07, "logits/chosen": -2.859375, "logits/rejected": -2.5, "logps/chosen": -476.0, "logps/rejected": -748.0, "loss": 0.2937, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -3.03125, "rewards/margins": 2.875, "rewards/rejected": -5.90625, "step": 1620 }, { "epoch": 0.11766404388941024, "grad_norm": 9.987891055540013, "learning_rate": 4.995275795760816e-07, "logits/chosen": -2.84375, "logits/rejected": -2.734375, "logps/chosen": -454.0, "logps/rejected": -660.0, "loss": 0.2991, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -2.953125, "rewards/margins": 2.109375, "rewards/rejected": -5.0625, "step": 1630 }, { "epoch": 0.11838590918934527, "grad_norm": 12.804317711855225, "learning_rate": 4.994880765783026e-07, "logits/chosen": -2.75, "logits/rejected": -2.671875, "logps/chosen": -484.0, "logps/rejected": -672.0, "loss": 0.2883, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -3.109375, "rewards/margins": 2.015625, "rewards/rejected": -5.125, "step": 1640 }, { "epoch": 0.1191077744892803, "grad_norm": 11.589955875632223, "learning_rate": 4.99446989324411e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5625, "logps/chosen": -470.0, "logps/rejected": -756.0, "loss": 0.2847, "rewards/accuracies": 0.875, "rewards/chosen": -2.953125, "rewards/margins": 3.046875, "rewards/rejected": -6.0, "step": 1650 }, { "epoch": 0.11982963978921533, "grad_norm": 14.992092750756044, "learning_rate": 4.99404318075312e-07, "logits/chosen": -2.640625, "logits/rejected": -2.546875, "logps/chosen": -488.0, "logps/rejected": -672.0, "loss": 0.2926, "rewards/accuracies": 0.84375, "rewards/chosen": -3.21875, "rewards/margins": 2.125, "rewards/rejected": -5.34375, "step": 1660 }, { "epoch": 0.12055150508915037, "grad_norm": 14.63652475825442, "learning_rate": 4.993600631019689e-07, "logits/chosen": -2.671875, "logits/rejected": -2.578125, "logps/chosen": -484.0, "logps/rejected": -680.0, "loss": 0.3115, "rewards/accuracies": 0.875, "rewards/chosen": -3.328125, "rewards/margins": 1.984375, "rewards/rejected": -5.3125, "step": 1670 }, { "epoch": 0.1212733703890854, "grad_norm": 10.01896442134856, "learning_rate": 4.993142246854024e-07, "logits/chosen": -2.78125, "logits/rejected": -2.59375, "logps/chosen": -434.0, "logps/rejected": -656.0, "loss": 0.2917, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -2.84375, "rewards/margins": 2.15625, "rewards/rejected": -5.0, "step": 1680 }, { "epoch": 0.12199523568902043, "grad_norm": 10.480137264657502, "learning_rate": 4.992668031166876e-07, "logits/chosen": -2.828125, "logits/rejected": -2.703125, "logps/chosen": -444.0, "logps/rejected": -672.0, "loss": 0.3114, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -2.90625, "rewards/margins": 2.421875, "rewards/rejected": -5.34375, "step": 1690 }, { "epoch": 0.12271710098895545, "grad_norm": 9.543166172183264, "learning_rate": 4.992177986969526e-07, "logits/chosen": -2.75, "logits/rejected": -2.484375, "logps/chosen": -430.0, "logps/rejected": -624.0, "loss": 0.3235, "rewards/accuracies": 0.875, "rewards/chosen": -2.71875, "rewards/margins": 1.890625, "rewards/rejected": -4.59375, "step": 1700 }, { "epoch": 0.12343896628889049, "grad_norm": 9.39264085167921, "learning_rate": 4.991672117373769e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5625, "logps/chosen": -452.0, "logps/rejected": -712.0, "loss": 0.2971, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -2.796875, "rewards/margins": 2.625, "rewards/rejected": -5.4375, "step": 1710 }, { "epoch": 0.12416083158882553, "grad_norm": 9.35509206624716, "learning_rate": 4.991150425591891e-07, "logits/chosen": -2.765625, "logits/rejected": -2.46875, "logps/chosen": -448.0, "logps/rejected": -700.0, "loss": 0.2908, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -2.96875, "rewards/margins": 2.5625, "rewards/rejected": -5.53125, "step": 1720 }, { "epoch": 0.12488269688876055, "grad_norm": 9.262201280713281, "learning_rate": 4.99061291493665e-07, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -444.0, "logps/rejected": -676.0, "loss": 0.2925, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -2.859375, "rewards/margins": 2.453125, "rewards/rejected": -5.3125, "step": 1730 }, { "epoch": 0.1256045621886956, "grad_norm": 10.008148122591312, "learning_rate": 4.99005958882125e-07, "logits/chosen": -2.78125, "logits/rejected": -2.609375, "logps/chosen": -450.0, "logps/rejected": -684.0, "loss": 0.3133, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -2.953125, "rewards/margins": 2.359375, "rewards/rejected": -5.3125, "step": 1740 }, { "epoch": 0.12632642748863063, "grad_norm": 8.554136981806407, "learning_rate": 4.989490450759331e-07, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -482.0, "logps/rejected": -696.0, "loss": 0.2649, "rewards/accuracies": 0.84375, "rewards/chosen": -3.125, "rewards/margins": 2.3125, "rewards/rejected": -5.4375, "step": 1750 }, { "epoch": 0.12704829278856566, "grad_norm": 8.929491173417231, "learning_rate": 4.988905504364933e-07, "logits/chosen": -2.78125, "logits/rejected": -2.578125, "logps/chosen": -516.0, "logps/rejected": -768.0, "loss": 0.2715, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.40625, "rewards/margins": 2.703125, "rewards/rejected": -6.09375, "step": 1760 }, { "epoch": 0.12777015808850067, "grad_norm": 19.85583075822656, "learning_rate": 4.988304753352482e-07, "logits/chosen": -2.796875, "logits/rejected": -2.609375, "logps/chosen": -454.0, "logps/rejected": -744.0, "loss": 0.2838, "rewards/accuracies": 0.875, "rewards/chosen": -3.046875, "rewards/margins": 2.84375, "rewards/rejected": -5.875, "step": 1770 }, { "epoch": 0.1284920233884357, "grad_norm": 11.573857511888404, "learning_rate": 4.987688201536764e-07, "logits/chosen": -2.671875, "logits/rejected": -2.453125, "logps/chosen": -404.0, "logps/rejected": -636.0, "loss": 0.3207, "rewards/accuracies": 0.875, "rewards/chosen": -2.375, "rewards/margins": 2.453125, "rewards/rejected": -4.84375, "step": 1780 }, { "epoch": 0.12921388868837075, "grad_norm": 10.767926076980798, "learning_rate": 4.987055852832899e-07, "logits/chosen": -2.734375, "logits/rejected": -2.625, "logps/chosen": -504.0, "logps/rejected": -784.0, "loss": 0.2768, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -3.296875, "rewards/margins": 2.859375, "rewards/rejected": -6.15625, "step": 1790 }, { "epoch": 0.12993575398830579, "grad_norm": 9.480524665881354, "learning_rate": 4.986407711256319e-07, "logits/chosen": -2.71875, "logits/rejected": -2.46875, "logps/chosen": -434.0, "logps/rejected": -656.0, "loss": 0.2996, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -2.8125, "rewards/margins": 2.203125, "rewards/rejected": -5.0, "step": 1800 }, { "epoch": 0.13065761928824082, "grad_norm": 11.059595953397832, "learning_rate": 4.98574378092274e-07, "logits/chosen": -2.890625, "logits/rejected": -2.6875, "logps/chosen": -506.0, "logps/rejected": -760.0, "loss": 0.2706, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.40625, "rewards/margins": 2.828125, "rewards/rejected": -6.21875, "step": 1810 }, { "epoch": 0.13137948458817586, "grad_norm": 12.559652259820835, "learning_rate": 4.985064066048139e-07, "logits/chosen": -2.6875, "logits/rejected": -2.40625, "logps/chosen": -424.0, "logps/rejected": -660.0, "loss": 0.3016, "rewards/accuracies": 0.875, "rewards/chosen": -2.625, "rewards/margins": 2.375, "rewards/rejected": -5.0, "step": 1820 }, { "epoch": 0.13210134988811087, "grad_norm": 16.780300866871737, "learning_rate": 4.984368570948724e-07, "logits/chosen": -2.734375, "logits/rejected": -2.484375, "logps/chosen": -444.0, "logps/rejected": -704.0, "loss": 0.2943, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -2.828125, "rewards/margins": 2.515625, "rewards/rejected": -5.34375, "step": 1830 }, { "epoch": 0.1328232151880459, "grad_norm": 10.65248837076819, "learning_rate": 4.983657300040907e-07, "logits/chosen": -2.78125, "logits/rejected": -2.65625, "logps/chosen": -472.0, "logps/rejected": -704.0, "loss": 0.2699, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -3.25, "rewards/margins": 2.484375, "rewards/rejected": -5.75, "step": 1840 }, { "epoch": 0.13354508048798094, "grad_norm": 10.948003648298677, "learning_rate": 4.982930257841278e-07, "logits/chosen": -2.828125, "logits/rejected": -2.453125, "logps/chosen": -456.0, "logps/rejected": -728.0, "loss": 0.2941, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -2.96875, "rewards/margins": 2.78125, "rewards/rejected": -5.75, "step": 1850 }, { "epoch": 0.13426694578791598, "grad_norm": 12.047287233162004, "learning_rate": 4.982187448966575e-07, "logits/chosen": -2.65625, "logits/rejected": -2.46875, "logps/chosen": -536.0, "logps/rejected": -768.0, "loss": 0.2898, "rewards/accuracies": 0.875, "rewards/chosen": -3.640625, "rewards/margins": 2.390625, "rewards/rejected": -6.03125, "step": 1860 }, { "epoch": 0.13498881108785102, "grad_norm": 14.9941388186048, "learning_rate": 4.981428878133656e-07, "logits/chosen": -2.8125, "logits/rejected": -2.4375, "logps/chosen": -468.0, "logps/rejected": -772.0, "loss": 0.2811, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -3.109375, "rewards/margins": 3.09375, "rewards/rejected": -6.1875, "step": 1870 }, { "epoch": 0.13571067638778603, "grad_norm": 9.951835424657778, "learning_rate": 4.980654550159463e-07, "logits/chosen": -2.84375, "logits/rejected": -2.609375, "logps/chosen": -492.0, "logps/rejected": -708.0, "loss": 0.2732, "rewards/accuracies": 0.875, "rewards/chosen": -3.1875, "rewards/margins": 2.5, "rewards/rejected": -5.6875, "step": 1880 }, { "epoch": 0.13643254168772107, "grad_norm": 8.861361984310934, "learning_rate": 4.979864469961004e-07, "logits/chosen": -2.796875, "logits/rejected": -2.578125, "logps/chosen": -464.0, "logps/rejected": -716.0, "loss": 0.2762, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -3.078125, "rewards/margins": 2.671875, "rewards/rejected": -5.75, "step": 1890 }, { "epoch": 0.1371544069876561, "grad_norm": 9.692735634395657, "learning_rate": 4.979058642555307e-07, "logits/chosen": -2.859375, "logits/rejected": -2.578125, "logps/chosen": -452.0, "logps/rejected": -676.0, "loss": 0.2931, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -2.84375, "rewards/margins": 2.46875, "rewards/rejected": -5.3125, "step": 1900 }, { "epoch": 0.13787627228759114, "grad_norm": 9.565594633496087, "learning_rate": 4.978237073059399e-07, "logits/chosen": -2.703125, "logits/rejected": -2.515625, "logps/chosen": -464.0, "logps/rejected": -676.0, "loss": 0.2898, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -3.078125, "rewards/margins": 2.171875, "rewards/rejected": -5.25, "step": 1910 }, { "epoch": 0.13859813758752618, "grad_norm": 11.007909649107406, "learning_rate": 4.977399766690269e-07, "logits/chosen": -2.59375, "logits/rejected": -2.40625, "logps/chosen": -498.0, "logps/rejected": -796.0, "loss": 0.2902, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -3.1875, "rewards/margins": 3.109375, "rewards/rejected": -6.3125, "step": 1920 }, { "epoch": 0.1393200028874612, "grad_norm": 9.107456714393756, "learning_rate": 4.976546728764836e-07, "logits/chosen": -2.59375, "logits/rejected": -2.421875, "logps/chosen": -498.0, "logps/rejected": -724.0, "loss": 0.284, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.3125, "rewards/margins": 2.4375, "rewards/rejected": -5.75, "step": 1930 }, { "epoch": 0.14004186818739622, "grad_norm": 8.927298343498093, "learning_rate": 4.975677964699912e-07, "logits/chosen": -2.59375, "logits/rejected": -2.40625, "logps/chosen": -502.0, "logps/rejected": -776.0, "loss": 0.2524, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -3.5625, "rewards/margins": 2.796875, "rewards/rejected": -6.34375, "step": 1940 }, { "epoch": 0.14076373348733126, "grad_norm": 10.144209347121677, "learning_rate": 4.974793480012174e-07, "logits/chosen": -2.734375, "logits/rejected": -2.515625, "logps/chosen": -464.0, "logps/rejected": -716.0, "loss": 0.2621, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -2.859375, "rewards/margins": 2.6875, "rewards/rejected": -5.5625, "step": 1950 }, { "epoch": 0.1414855987872663, "grad_norm": 7.533895015502329, "learning_rate": 4.973893280318125e-07, "logits/chosen": -2.890625, "logits/rejected": -2.734375, "logps/chosen": -492.0, "logps/rejected": -764.0, "loss": 0.2844, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.34375, "rewards/margins": 2.796875, "rewards/rejected": -6.125, "step": 1960 }, { "epoch": 0.14220746408720134, "grad_norm": 13.017212573238576, "learning_rate": 4.972977371334056e-07, "logits/chosen": -2.65625, "logits/rejected": -2.5, "logps/chosen": -424.0, "logps/rejected": -672.0, "loss": 0.2873, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -2.5, "rewards/margins": 2.46875, "rewards/rejected": -4.96875, "step": 1970 }, { "epoch": 0.14292932938713637, "grad_norm": 8.958119059657708, "learning_rate": 4.972045758876014e-07, "logits/chosen": -2.8125, "logits/rejected": -2.59375, "logps/chosen": -488.0, "logps/rejected": -724.0, "loss": 0.2477, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -3.265625, "rewards/margins": 2.359375, "rewards/rejected": -5.625, "step": 1980 }, { "epoch": 0.14365119468707138, "grad_norm": 10.493203877125167, "learning_rate": 4.971098448859766e-07, "logits/chosen": -2.75, "logits/rejected": -2.6875, "logps/chosen": -488.0, "logps/rejected": -692.0, "loss": 0.2933, "rewards/accuracies": 0.875, "rewards/chosen": -3.265625, "rewards/margins": 2.234375, "rewards/rejected": -5.5, "step": 1990 }, { "epoch": 0.14437305998700642, "grad_norm": 9.973862051012356, "learning_rate": 4.970135447300752e-07, "logits/chosen": -2.59375, "logits/rejected": -2.3125, "logps/chosen": -516.0, "logps/rejected": -788.0, "loss": 0.2595, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -3.5, "rewards/margins": 2.5625, "rewards/rejected": -6.0625, "step": 2000 }, { "epoch": 0.14509492528694146, "grad_norm": 13.28264552294119, "learning_rate": 4.969156760314064e-07, "logits/chosen": -2.65625, "logits/rejected": -2.453125, "logps/chosen": -524.0, "logps/rejected": -796.0, "loss": 0.2904, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -3.640625, "rewards/margins": 2.703125, "rewards/rejected": -6.34375, "step": 2010 }, { "epoch": 0.1458167905868765, "grad_norm": 8.872169286182675, "learning_rate": 4.968162394114387e-07, "logits/chosen": -2.5625, "logits/rejected": -2.46875, "logps/chosen": -488.0, "logps/rejected": -744.0, "loss": 0.2523, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -3.265625, "rewards/margins": 2.703125, "rewards/rejected": -5.96875, "step": 2020 }, { "epoch": 0.14653865588681153, "grad_norm": 12.757195149734072, "learning_rate": 4.967152355015974e-07, "logits/chosen": -2.609375, "logits/rejected": -2.546875, "logps/chosen": -478.0, "logps/rejected": -724.0, "loss": 0.2783, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -3.375, "rewards/margins": 2.5625, "rewards/rejected": -5.9375, "step": 2030 }, { "epoch": 0.14726052118674654, "grad_norm": 12.796953074989913, "learning_rate": 4.966126649432603e-07, "logits/chosen": -2.796875, "logits/rejected": -2.625, "logps/chosen": -496.0, "logps/rejected": -780.0, "loss": 0.2723, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -3.53125, "rewards/margins": 2.578125, "rewards/rejected": -6.125, "step": 2040 }, { "epoch": 0.14798238648668158, "grad_norm": 19.108616982264344, "learning_rate": 4.96508528387753e-07, "logits/chosen": -3.0625, "logits/rejected": -2.828125, "logps/chosen": -540.0, "logps/rejected": -812.0, "loss": 0.2763, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.96875, "rewards/margins": 2.734375, "rewards/rejected": -6.6875, "step": 2050 }, { "epoch": 0.14870425178661661, "grad_norm": 9.380783201026548, "learning_rate": 4.964028264963456e-07, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -516.0, "logps/rejected": -800.0, "loss": 0.2822, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -3.46875, "rewards/margins": 2.71875, "rewards/rejected": -6.1875, "step": 2060 }, { "epoch": 0.14942611708655165, "grad_norm": 10.81595001993398, "learning_rate": 4.962955599402481e-07, "logits/chosen": -2.703125, "logits/rejected": -2.53125, "logps/chosen": -560.0, "logps/rejected": -784.0, "loss": 0.266, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.0, "rewards/margins": 2.25, "rewards/rejected": -6.25, "step": 2070 }, { "epoch": 0.1501479823864867, "grad_norm": 11.456291625001526, "learning_rate": 4.961867294006059e-07, "logits/chosen": -2.921875, "logits/rejected": -2.796875, "logps/chosen": -608.0, "logps/rejected": -836.0, "loss": 0.3064, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -4.46875, "rewards/margins": 2.40625, "rewards/rejected": -6.875, "step": 2080 }, { "epoch": 0.15086984768642173, "grad_norm": 7.960182686516041, "learning_rate": 4.96076335568496e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5625, "logps/chosen": -516.0, "logps/rejected": -776.0, "loss": 0.2467, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -3.4375, "rewards/margins": 2.765625, "rewards/rejected": -6.21875, "step": 2090 }, { "epoch": 0.15159171298635674, "grad_norm": 10.25400623338689, "learning_rate": 4.959643791449222e-07, "logits/chosen": -2.75, "logits/rejected": -2.625, "logps/chosen": -564.0, "logps/rejected": -788.0, "loss": 0.2977, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -3.796875, "rewards/margins": 2.5625, "rewards/rejected": -6.375, "step": 2100 }, { "epoch": 0.15231357828629177, "grad_norm": 10.09340211565806, "learning_rate": 4.958508608408109e-07, "logits/chosen": -2.625, "logits/rejected": -2.4375, "logps/chosen": -544.0, "logps/rejected": -736.0, "loss": 0.2829, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -3.921875, "rewards/margins": 2.03125, "rewards/rejected": -5.9375, "step": 2110 }, { "epoch": 0.1530354435862268, "grad_norm": 8.537784621679538, "learning_rate": 4.957357813770064e-07, "logits/chosen": -2.828125, "logits/rejected": -2.46875, "logps/chosen": -596.0, "logps/rejected": -860.0, "loss": 0.2479, "rewards/accuracies": 0.90625, "rewards/chosen": -4.28125, "rewards/margins": 2.765625, "rewards/rejected": -7.03125, "step": 2120 }, { "epoch": 0.15375730888616185, "grad_norm": 8.985222338453365, "learning_rate": 4.956191414842665e-07, "logits/chosen": -2.96875, "logits/rejected": -2.71875, "logps/chosen": -572.0, "logps/rejected": -860.0, "loss": 0.2629, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.1875, "rewards/margins": 2.84375, "rewards/rejected": -7.03125, "step": 2130 }, { "epoch": 0.15447917418609688, "grad_norm": 10.993021927824719, "learning_rate": 4.955009419032575e-07, "logits/chosen": -2.75, "logits/rejected": -2.515625, "logps/chosen": -572.0, "logps/rejected": -840.0, "loss": 0.2681, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.0, "rewards/margins": 2.8125, "rewards/rejected": -6.8125, "step": 2140 }, { "epoch": 0.1552010394860319, "grad_norm": 11.792550816411442, "learning_rate": 4.953811833845503e-07, "logits/chosen": -2.71875, "logits/rejected": -2.484375, "logps/chosen": -528.0, "logps/rejected": -756.0, "loss": 0.265, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -3.75, "rewards/margins": 2.328125, "rewards/rejected": -6.0625, "step": 2150 }, { "epoch": 0.15592290478596693, "grad_norm": 13.163433586155344, "learning_rate": 4.952598666886145e-07, "logits/chosen": -2.734375, "logits/rejected": -2.515625, "logps/chosen": -600.0, "logps/rejected": -856.0, "loss": 0.2516, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.3125, "rewards/margins": 2.6875, "rewards/rejected": -7.0, "step": 2160 }, { "epoch": 0.15664477008590197, "grad_norm": 15.36607001210862, "learning_rate": 4.951369925858147e-07, "logits/chosen": -2.78125, "logits/rejected": -2.609375, "logps/chosen": -544.0, "logps/rejected": -792.0, "loss": 0.2598, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.796875, "rewards/margins": 2.703125, "rewards/rejected": -6.5, "step": 2170 }, { "epoch": 0.157366635385837, "grad_norm": 8.701540096554936, "learning_rate": 4.950125618564046e-07, "logits/chosen": -2.875, "logits/rejected": -2.765625, "logps/chosen": -528.0, "logps/rejected": -784.0, "loss": 0.251, "rewards/accuracies": 0.90625, "rewards/chosen": -3.625, "rewards/margins": 2.5625, "rewards/rejected": -6.1875, "step": 2180 }, { "epoch": 0.15808850068577204, "grad_norm": 10.616304811087307, "learning_rate": 4.948865752905228e-07, "logits/chosen": -2.859375, "logits/rejected": -2.703125, "logps/chosen": -576.0, "logps/rejected": -828.0, "loss": 0.2533, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -4.0625, "rewards/margins": 2.65625, "rewards/rejected": -6.75, "step": 2190 }, { "epoch": 0.15881036598570708, "grad_norm": 10.818629515177625, "learning_rate": 4.947590336881874e-07, "logits/chosen": -2.859375, "logits/rejected": -2.53125, "logps/chosen": -584.0, "logps/rejected": -816.0, "loss": 0.2593, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -4.0625, "rewards/margins": 2.625, "rewards/rejected": -6.6875, "step": 2200 }, { "epoch": 0.1595322312856421, "grad_norm": 10.595421594796772, "learning_rate": 4.946299378592912e-07, "logits/chosen": -2.8125, "logits/rejected": -2.625, "logps/chosen": -532.0, "logps/rejected": -784.0, "loss": 0.2795, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.578125, "rewards/margins": 2.546875, "rewards/rejected": -6.125, "step": 2210 }, { "epoch": 0.16025409658557713, "grad_norm": 13.24386115549115, "learning_rate": 4.944992886235961e-07, "logits/chosen": -2.796875, "logits/rejected": -2.53125, "logps/chosen": -572.0, "logps/rejected": -828.0, "loss": 0.2521, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -3.96875, "rewards/margins": 2.765625, "rewards/rejected": -6.71875, "step": 2220 }, { "epoch": 0.16097596188551216, "grad_norm": 8.619302388111215, "learning_rate": 4.943670868107284e-07, "logits/chosen": -2.75, "logits/rejected": -2.609375, "logps/chosen": -532.0, "logps/rejected": -832.0, "loss": 0.27, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -3.65625, "rewards/margins": 3.078125, "rewards/rejected": -6.71875, "step": 2230 }, { "epoch": 0.1616978271854472, "grad_norm": 8.272453046055942, "learning_rate": 4.942333332601731e-07, "logits/chosen": -2.5625, "logits/rejected": -2.46875, "logps/chosen": -564.0, "logps/rejected": -864.0, "loss": 0.2661, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.984375, "rewards/margins": 3.1875, "rewards/rejected": -7.15625, "step": 2240 }, { "epoch": 0.16241969248538224, "grad_norm": 6.171166558818759, "learning_rate": 4.940980288212691e-07, "logits/chosen": -2.5, "logits/rejected": -2.375, "logps/chosen": -576.0, "logps/rejected": -800.0, "loss": 0.2574, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.03125, "rewards/margins": 2.453125, "rewards/rejected": -6.46875, "step": 2250 }, { "epoch": 0.16314155778531725, "grad_norm": 9.42178572046336, "learning_rate": 4.939611743532031e-07, "logits/chosen": -2.796875, "logits/rejected": -2.59375, "logps/chosen": -560.0, "logps/rejected": -828.0, "loss": 0.2385, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.9375, "rewards/margins": 2.828125, "rewards/rejected": -6.78125, "step": 2260 }, { "epoch": 0.16386342308525229, "grad_norm": 8.438515261081413, "learning_rate": 4.93822770725005e-07, "logits/chosen": -2.796875, "logits/rejected": -2.625, "logps/chosen": -544.0, "logps/rejected": -776.0, "loss": 0.2737, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.734375, "rewards/margins": 2.609375, "rewards/rejected": -6.34375, "step": 2270 }, { "epoch": 0.16458528838518732, "grad_norm": 11.043392051990788, "learning_rate": 4.936828188155413e-07, "logits/chosen": -2.78125, "logits/rejected": -2.65625, "logps/chosen": -520.0, "logps/rejected": -776.0, "loss": 0.2496, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -3.625, "rewards/margins": 2.640625, "rewards/rejected": -6.28125, "step": 2280 }, { "epoch": 0.16530715368512236, "grad_norm": 10.831257780639715, "learning_rate": 4.935413195135106e-07, "logits/chosen": -2.78125, "logits/rejected": -2.6875, "logps/chosen": -572.0, "logps/rejected": -872.0, "loss": 0.2479, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.03125, "rewards/margins": 3.140625, "rewards/rejected": -7.15625, "step": 2290 }, { "epoch": 0.1660290189850574, "grad_norm": 9.747157511340994, "learning_rate": 4.933982737174374e-07, "logits/chosen": -2.875, "logits/rejected": -2.640625, "logps/chosen": -560.0, "logps/rejected": -852.0, "loss": 0.2701, "rewards/accuracies": 0.84375, "rewards/chosen": -4.09375, "rewards/margins": 2.796875, "rewards/rejected": -6.875, "step": 2300 }, { "epoch": 0.1667508842849924, "grad_norm": 9.870871070277088, "learning_rate": 4.932536823356664e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5625, "logps/chosen": -620.0, "logps/rejected": -880.0, "loss": 0.2543, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.6875, "rewards/margins": 2.578125, "rewards/rejected": -7.28125, "step": 2310 }, { "epoch": 0.16747274958492744, "grad_norm": 8.8575895636107, "learning_rate": 4.931075462863567e-07, "logits/chosen": -2.96875, "logits/rejected": -2.609375, "logps/chosen": -604.0, "logps/rejected": -912.0, "loss": 0.2594, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -4.375, "rewards/margins": 3.0625, "rewards/rejected": -7.4375, "step": 2320 }, { "epoch": 0.16819461488486248, "grad_norm": 7.816395810688846, "learning_rate": 4.929598664974762e-07, "logits/chosen": -2.75, "logits/rejected": -2.609375, "logps/chosen": -652.0, "logps/rejected": -940.0, "loss": 0.2511, "rewards/accuracies": 0.9375, "rewards/chosen": -4.65625, "rewards/margins": 3.25, "rewards/rejected": -7.90625, "step": 2330 }, { "epoch": 0.16891648018479752, "grad_norm": 8.344064880799563, "learning_rate": 4.928106439067958e-07, "logits/chosen": -2.671875, "logits/rejected": -2.46875, "logps/chosen": -560.0, "logps/rejected": -816.0, "loss": 0.2669, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.09375, "rewards/margins": 2.53125, "rewards/rejected": -6.625, "step": 2340 }, { "epoch": 0.16963834548473256, "grad_norm": 10.994252200422187, "learning_rate": 4.926598794618829e-07, "logits/chosen": -2.6875, "logits/rejected": -2.5, "logps/chosen": -552.0, "logps/rejected": -784.0, "loss": 0.278, "rewards/accuracies": 0.90625, "rewards/chosen": -3.921875, "rewards/margins": 2.5625, "rewards/rejected": -6.46875, "step": 2350 }, { "epoch": 0.1703602107846676, "grad_norm": 15.14815293816792, "learning_rate": 4.92507574120096e-07, "logits/chosen": -2.78125, "logits/rejected": -2.5, "logps/chosen": -604.0, "logps/rejected": -852.0, "loss": 0.2777, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.375, "rewards/margins": 2.609375, "rewards/rejected": -7.0, "step": 2360 }, { "epoch": 0.1710820760846026, "grad_norm": 7.821370479620557, "learning_rate": 4.923537288485779e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5, "logps/chosen": -556.0, "logps/rejected": -812.0, "loss": 0.2638, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -4.09375, "rewards/margins": 2.59375, "rewards/rejected": -6.6875, "step": 2370 }, { "epoch": 0.17180394138453764, "grad_norm": 9.211826498394792, "learning_rate": 4.921983446242506e-07, "logits/chosen": -2.765625, "logits/rejected": -2.609375, "logps/chosen": -644.0, "logps/rejected": -944.0, "loss": 0.2493, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.59375, "rewards/margins": 3.265625, "rewards/rejected": -7.875, "step": 2380 }, { "epoch": 0.17252580668447268, "grad_norm": 8.298256232187494, "learning_rate": 4.92041422433808e-07, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -548.0, "logps/rejected": -924.0, "loss": 0.2348, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -3.921875, "rewards/margins": 3.71875, "rewards/rejected": -7.65625, "step": 2390 }, { "epoch": 0.17324767198440771, "grad_norm": 10.983625039262604, "learning_rate": 4.918829632737103e-07, "logits/chosen": -2.765625, "logits/rejected": -2.625, "logps/chosen": -560.0, "logps/rejected": -896.0, "loss": 0.2633, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.125, "rewards/margins": 3.375, "rewards/rejected": -7.5, "step": 2400 }, { "epoch": 0.17396953728434275, "grad_norm": 12.61039915689691, "learning_rate": 4.917229681501774e-07, "logits/chosen": -2.65625, "logits/rejected": -2.53125, "logps/chosen": -580.0, "logps/rejected": -824.0, "loss": 0.264, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.0625, "rewards/margins": 2.609375, "rewards/rejected": -6.6875, "step": 2410 }, { "epoch": 0.17469140258427776, "grad_norm": 11.643682996836732, "learning_rate": 4.91561438079183e-07, "logits/chosen": -2.578125, "logits/rejected": -2.34375, "logps/chosen": -628.0, "logps/rejected": -900.0, "loss": 0.2668, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.625, "rewards/margins": 2.6875, "rewards/rejected": -7.3125, "step": 2420 }, { "epoch": 0.1754132678842128, "grad_norm": 13.088952482660957, "learning_rate": 4.913983740864473e-07, "logits/chosen": -2.59375, "logits/rejected": -2.390625, "logps/chosen": -632.0, "logps/rejected": -920.0, "loss": 0.2359, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.5625, "rewards/margins": 2.859375, "rewards/rejected": -7.4375, "step": 2430 }, { "epoch": 0.17613513318414784, "grad_norm": 10.188119267424455, "learning_rate": 4.91233777207431e-07, "logits/chosen": -2.625, "logits/rejected": -2.453125, "logps/chosen": -592.0, "logps/rejected": -916.0, "loss": 0.2748, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -4.46875, "rewards/margins": 3.203125, "rewards/rejected": -7.6875, "step": 2440 }, { "epoch": 0.17685699848408287, "grad_norm": 8.609826083562075, "learning_rate": 4.910676484873292e-07, "logits/chosen": -2.5, "logits/rejected": -2.390625, "logps/chosen": -612.0, "logps/rejected": -864.0, "loss": 0.2658, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.4375, "rewards/margins": 2.671875, "rewards/rejected": -7.09375, "step": 2450 }, { "epoch": 0.1775788637840179, "grad_norm": 10.48253643988837, "learning_rate": 4.908999889810633e-07, "logits/chosen": -2.578125, "logits/rejected": -2.375, "logps/chosen": -572.0, "logps/rejected": -876.0, "loss": 0.2331, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -4.03125, "rewards/margins": 3.140625, "rewards/rejected": -7.15625, "step": 2460 }, { "epoch": 0.17830072908395295, "grad_norm": 17.344352556263694, "learning_rate": 4.907307997532761e-07, "logits/chosen": -2.734375, "logits/rejected": -2.59375, "logps/chosen": -632.0, "logps/rejected": -984.0, "loss": 0.2354, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.6875, "rewards/margins": 3.484375, "rewards/rejected": -8.125, "step": 2470 }, { "epoch": 0.17902259438388796, "grad_norm": 9.982854645114383, "learning_rate": 4.905600818783237e-07, "logits/chosen": -2.640625, "logits/rejected": -2.53125, "logps/chosen": -664.0, "logps/rejected": -980.0, "loss": 0.3273, "rewards/accuracies": 0.90625, "rewards/chosen": -4.75, "rewards/margins": 3.515625, "rewards/rejected": -8.25, "step": 2480 }, { "epoch": 0.179744459683823, "grad_norm": 10.68094022282627, "learning_rate": 4.903878364402691e-07, "logits/chosen": -2.828125, "logits/rejected": -2.59375, "logps/chosen": -568.0, "logps/rejected": -836.0, "loss": 0.2468, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -3.953125, "rewards/margins": 2.953125, "rewards/rejected": -6.90625, "step": 2490 }, { "epoch": 0.18046632498375803, "grad_norm": 8.296383042780498, "learning_rate": 4.902140645328759e-07, "logits/chosen": -2.796875, "logits/rejected": -2.546875, "logps/chosen": -564.0, "logps/rejected": -848.0, "loss": 0.2599, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.1875, "rewards/margins": 2.9375, "rewards/rejected": -7.125, "step": 2500 }, { "epoch": 0.18118819028369307, "grad_norm": 9.103787824302069, "learning_rate": 4.900387672596003e-07, "logits/chosen": -2.703125, "logits/rejected": -2.4375, "logps/chosen": -528.0, "logps/rejected": -816.0, "loss": 0.2318, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -3.671875, "rewards/margins": 3.015625, "rewards/rejected": -6.6875, "step": 2510 }, { "epoch": 0.1819100555836281, "grad_norm": 16.67988360600736, "learning_rate": 4.898619457335848e-07, "logits/chosen": -2.578125, "logits/rejected": -2.4375, "logps/chosen": -568.0, "logps/rejected": -844.0, "loss": 0.248, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.0, "rewards/margins": 2.921875, "rewards/rejected": -6.9375, "step": 2520 }, { "epoch": 0.18263192088356311, "grad_norm": 10.469848545031832, "learning_rate": 4.896836010776509e-07, "logits/chosen": -2.640625, "logits/rejected": -2.53125, "logps/chosen": -644.0, "logps/rejected": -1012.0, "loss": 0.2595, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.78125, "rewards/margins": 3.59375, "rewards/rejected": -8.375, "step": 2530 }, { "epoch": 0.18335378618349815, "grad_norm": 9.661637065408652, "learning_rate": 4.895037344242921e-07, "logits/chosen": -2.484375, "logits/rejected": -2.296875, "logps/chosen": -580.0, "logps/rejected": -856.0, "loss": 0.2585, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.125, "rewards/margins": 2.953125, "rewards/rejected": -7.09375, "step": 2540 }, { "epoch": 0.1840756514834332, "grad_norm": 8.853616581850865, "learning_rate": 4.893223469156664e-07, "logits/chosen": -2.609375, "logits/rejected": -2.390625, "logps/chosen": -584.0, "logps/rejected": -856.0, "loss": 0.249, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.1875, "rewards/margins": 2.78125, "rewards/rejected": -6.9375, "step": 2550 }, { "epoch": 0.18479751678336823, "grad_norm": 14.23122096213618, "learning_rate": 4.891394397035896e-07, "logits/chosen": -2.703125, "logits/rejected": -2.53125, "logps/chosen": -588.0, "logps/rejected": -848.0, "loss": 0.2458, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -4.25, "rewards/margins": 2.75, "rewards/rejected": -7.0, "step": 2560 }, { "epoch": 0.18551938208330326, "grad_norm": 7.165047283079565, "learning_rate": 4.889550139495275e-07, "logits/chosen": -2.8125, "logits/rejected": -2.59375, "logps/chosen": -556.0, "logps/rejected": -872.0, "loss": 0.2193, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -3.90625, "rewards/margins": 3.25, "rewards/rejected": -7.15625, "step": 2570 }, { "epoch": 0.1862412473832383, "grad_norm": 9.892022723104382, "learning_rate": 4.887690708245887e-07, "logits/chosen": -2.6875, "logits/rejected": -2.53125, "logps/chosen": -540.0, "logps/rejected": -860.0, "loss": 0.2276, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.765625, "rewards/margins": 3.125, "rewards/rejected": -6.875, "step": 2580 }, { "epoch": 0.1869631126831733, "grad_norm": 9.543867068973059, "learning_rate": 4.885816115095171e-07, "logits/chosen": -2.828125, "logits/rejected": -2.515625, "logps/chosen": -600.0, "logps/rejected": -928.0, "loss": 0.2391, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.375, "rewards/margins": 3.203125, "rewards/rejected": -7.5625, "step": 2590 }, { "epoch": 0.18768497798310835, "grad_norm": 10.889738728754864, "learning_rate": 4.883926371946843e-07, "logits/chosen": -2.6875, "logits/rejected": -2.375, "logps/chosen": -608.0, "logps/rejected": -872.0, "loss": 0.2702, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.375, "rewards/margins": 2.671875, "rewards/rejected": -7.03125, "step": 2600 }, { "epoch": 0.18840684328304338, "grad_norm": 6.728294158129367, "learning_rate": 4.882021490800826e-07, "logits/chosen": -2.671875, "logits/rejected": -2.453125, "logps/chosen": -580.0, "logps/rejected": -816.0, "loss": 0.2438, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -4.09375, "rewards/margins": 2.453125, "rewards/rejected": -6.53125, "step": 2610 }, { "epoch": 0.18912870858297842, "grad_norm": 9.374612134195704, "learning_rate": 4.880101483753167e-07, "logits/chosen": -2.71875, "logits/rejected": -2.4375, "logps/chosen": -560.0, "logps/rejected": -896.0, "loss": 0.2198, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.1875, "rewards/margins": 3.15625, "rewards/rejected": -7.34375, "step": 2620 }, { "epoch": 0.18985057388291346, "grad_norm": 8.403906697614635, "learning_rate": 4.878166362995963e-07, "logits/chosen": -2.75, "logits/rejected": -2.578125, "logps/chosen": -588.0, "logps/rejected": -900.0, "loss": 0.2728, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.21875, "rewards/margins": 3.015625, "rewards/rejected": -7.25, "step": 2630 }, { "epoch": 0.19057243918284847, "grad_norm": 9.739452944604345, "learning_rate": 4.876216140817285e-07, "logits/chosen": -2.546875, "logits/rejected": -2.296875, "logps/chosen": -568.0, "logps/rejected": -856.0, "loss": 0.2399, "rewards/accuracies": 0.9375, "rewards/chosen": -4.09375, "rewards/margins": 2.890625, "rewards/rejected": -7.0, "step": 2640 }, { "epoch": 0.1912943044827835, "grad_norm": 9.412524327526398, "learning_rate": 4.874250829601094e-07, "logits/chosen": -2.671875, "logits/rejected": -2.515625, "logps/chosen": -672.0, "logps/rejected": -928.0, "loss": 0.2287, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.8125, "rewards/margins": 2.796875, "rewards/rejected": -7.59375, "step": 2650 }, { "epoch": 0.19201616978271854, "grad_norm": 9.67143825795057, "learning_rate": 4.872270441827174e-07, "logits/chosen": -2.640625, "logits/rejected": -2.453125, "logps/chosen": -668.0, "logps/rejected": -960.0, "loss": 0.2358, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -4.96875, "rewards/margins": 3.0, "rewards/rejected": -8.0, "step": 2660 }, { "epoch": 0.19273803508265358, "grad_norm": 10.225198499138108, "learning_rate": 4.870274990071038e-07, "logits/chosen": -2.671875, "logits/rejected": -2.453125, "logps/chosen": -568.0, "logps/rejected": -868.0, "loss": 0.2511, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.28125, "rewards/margins": 3.0625, "rewards/rejected": -7.3125, "step": 2670 }, { "epoch": 0.19345990038258862, "grad_norm": 8.93422692887298, "learning_rate": 4.868264487003862e-07, "logits/chosen": -2.578125, "logits/rejected": -2.40625, "logps/chosen": -588.0, "logps/rejected": -908.0, "loss": 0.2518, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.28125, "rewards/margins": 3.125, "rewards/rejected": -7.40625, "step": 2680 }, { "epoch": 0.19418176568252365, "grad_norm": 8.108160852039612, "learning_rate": 4.866238945392393e-07, "logits/chosen": -2.5625, "logits/rejected": -2.46875, "logps/chosen": -588.0, "logps/rejected": -840.0, "loss": 0.2465, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.1875, "rewards/margins": 2.78125, "rewards/rejected": -6.96875, "step": 2690 }, { "epoch": 0.19490363098245866, "grad_norm": 8.305890952481619, "learning_rate": 4.864198378098877e-07, "logits/chosen": -2.671875, "logits/rejected": -2.46875, "logps/chosen": -510.0, "logps/rejected": -804.0, "loss": 0.237, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -3.5, "rewards/margins": 3.015625, "rewards/rejected": -6.53125, "step": 2700 }, { "epoch": 0.1956254962823937, "grad_norm": 12.954558843929119, "learning_rate": 4.862142798080973e-07, "logits/chosen": -2.734375, "logits/rejected": -2.578125, "logps/chosen": -576.0, "logps/rejected": -848.0, "loss": 0.2245, "rewards/accuracies": 0.875, "rewards/chosen": -4.15625, "rewards/margins": 2.96875, "rewards/rejected": -7.125, "step": 2710 }, { "epoch": 0.19634736158232874, "grad_norm": 6.775612276163364, "learning_rate": 4.860072218391669e-07, "logits/chosen": -2.8125, "logits/rejected": -2.625, "logps/chosen": -556.0, "logps/rejected": -872.0, "loss": 0.2153, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -3.90625, "rewards/margins": 3.296875, "rewards/rejected": -7.21875, "step": 2720 }, { "epoch": 0.19706922688226378, "grad_norm": 8.770593576643066, "learning_rate": 4.857986652179203e-07, "logits/chosen": -2.71875, "logits/rejected": -2.4375, "logps/chosen": -596.0, "logps/rejected": -872.0, "loss": 0.2534, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.15625, "rewards/margins": 2.765625, "rewards/rejected": -6.9375, "step": 2730 }, { "epoch": 0.1977910921821988, "grad_norm": 8.729235176349604, "learning_rate": 4.855886112686977e-07, "logits/chosen": -2.78125, "logits/rejected": -2.59375, "logps/chosen": -596.0, "logps/rejected": -920.0, "loss": 0.2018, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.3125, "rewards/margins": 3.25, "rewards/rejected": -7.5625, "step": 2740 }, { "epoch": 0.19851295748213382, "grad_norm": 10.466383153721448, "learning_rate": 4.853770613253476e-07, "logits/chosen": -2.796875, "logits/rejected": -2.59375, "logps/chosen": -564.0, "logps/rejected": -884.0, "loss": 0.2365, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.15625, "rewards/margins": 3.390625, "rewards/rejected": -7.53125, "step": 2750 }, { "epoch": 0.19923482278206886, "grad_norm": 10.738593768361735, "learning_rate": 4.851640167312178e-07, "logits/chosen": -2.6875, "logits/rejected": -2.4375, "logps/chosen": -568.0, "logps/rejected": -868.0, "loss": 0.224, "rewards/accuracies": 0.90625, "rewards/chosen": -4.0, "rewards/margins": 2.96875, "rewards/rejected": -7.0, "step": 2760 }, { "epoch": 0.1999566880820039, "grad_norm": 9.416300695572696, "learning_rate": 4.849494788391473e-07, "logits/chosen": -2.765625, "logits/rejected": -2.4375, "logps/chosen": -664.0, "logps/rejected": -1032.0, "loss": 0.2284, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.03125, "rewards/margins": 3.75, "rewards/rejected": -8.8125, "step": 2770 }, { "epoch": 0.20067855338193893, "grad_norm": 9.528669823636646, "learning_rate": 4.847334490114576e-07, "logits/chosen": -2.75, "logits/rejected": -2.5625, "logps/chosen": -628.0, "logps/rejected": -916.0, "loss": 0.2293, "rewards/accuracies": 0.875, "rewards/chosen": -4.75, "rewards/margins": 3.0625, "rewards/rejected": -7.8125, "step": 2780 }, { "epoch": 0.20140041868187397, "grad_norm": 9.797059355953671, "learning_rate": 4.84515928619944e-07, "logits/chosen": -2.875, "logits/rejected": -2.59375, "logps/chosen": -632.0, "logps/rejected": -988.0, "loss": 0.2094, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.625, "rewards/margins": 3.515625, "rewards/rejected": -8.1875, "step": 2790 }, { "epoch": 0.20212228398180898, "grad_norm": 9.406533092835442, "learning_rate": 4.84296919045867e-07, "logits/chosen": -2.765625, "logits/rejected": -2.4375, "logps/chosen": -624.0, "logps/rejected": -968.0, "loss": 0.2334, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.625, "rewards/margins": 3.171875, "rewards/rejected": -7.78125, "step": 2800 }, { "epoch": 0.20284414928174402, "grad_norm": 9.254549987899654, "learning_rate": 4.840764216799433e-07, "logits/chosen": -2.640625, "logits/rejected": -2.375, "logps/chosen": -608.0, "logps/rejected": -904.0, "loss": 0.2337, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.46875, "rewards/margins": 3.0, "rewards/rejected": -7.46875, "step": 2810 }, { "epoch": 0.20356601458167906, "grad_norm": 9.14538857003236, "learning_rate": 4.838544379223373e-07, "logits/chosen": -2.953125, "logits/rejected": -2.671875, "logps/chosen": -592.0, "logps/rejected": -904.0, "loss": 0.2619, "rewards/accuracies": 0.875, "rewards/chosen": -4.28125, "rewards/margins": 3.21875, "rewards/rejected": -7.5, "step": 2820 }, { "epoch": 0.2042878798816141, "grad_norm": 9.535277544276601, "learning_rate": 4.836309691826518e-07, "logits/chosen": -2.828125, "logits/rejected": -2.671875, "logps/chosen": -556.0, "logps/rejected": -840.0, "loss": 0.238, "rewards/accuracies": 0.90625, "rewards/chosen": -4.03125, "rewards/margins": 2.875, "rewards/rejected": -6.90625, "step": 2830 }, { "epoch": 0.20500974518154913, "grad_norm": 8.327834581371992, "learning_rate": 4.834060168799195e-07, "logits/chosen": -2.84375, "logits/rejected": -2.46875, "logps/chosen": -592.0, "logps/rejected": -856.0, "loss": 0.2305, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.15625, "rewards/margins": 2.875, "rewards/rejected": -7.03125, "step": 2840 }, { "epoch": 0.20573161048148417, "grad_norm": 7.7347670431429405, "learning_rate": 4.831795824425938e-07, "logits/chosen": -2.765625, "logits/rejected": -2.546875, "logps/chosen": -620.0, "logps/rejected": -916.0, "loss": 0.2542, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.46875, "rewards/margins": 3.171875, "rewards/rejected": -7.625, "step": 2850 }, { "epoch": 0.20645347578141918, "grad_norm": 8.15521635648461, "learning_rate": 4.829516673085394e-07, "logits/chosen": -2.59375, "logits/rejected": -2.421875, "logps/chosen": -604.0, "logps/rejected": -904.0, "loss": 0.2113, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.375, "rewards/margins": 3.078125, "rewards/rejected": -7.4375, "step": 2860 }, { "epoch": 0.20717534108135421, "grad_norm": 8.022215432273788, "learning_rate": 4.827222729250236e-07, "logits/chosen": -2.640625, "logits/rejected": -2.46875, "logps/chosen": -596.0, "logps/rejected": -916.0, "loss": 0.2461, "rewards/accuracies": 0.90625, "rewards/chosen": -4.21875, "rewards/margins": 3.421875, "rewards/rejected": -7.65625, "step": 2870 }, { "epoch": 0.20789720638128925, "grad_norm": 7.199943747449723, "learning_rate": 4.824914007487072e-07, "logits/chosen": -2.765625, "logits/rejected": -2.609375, "logps/chosen": -588.0, "logps/rejected": -932.0, "loss": 0.2155, "rewards/accuracies": 0.90625, "rewards/chosen": -4.34375, "rewards/margins": 3.40625, "rewards/rejected": -7.75, "step": 2880 }, { "epoch": 0.2086190716812243, "grad_norm": 12.583865202253415, "learning_rate": 4.822590522456347e-07, "logits/chosen": -2.828125, "logits/rejected": -2.65625, "logps/chosen": -560.0, "logps/rejected": -844.0, "loss": 0.2309, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.0, "rewards/margins": 3.0, "rewards/rejected": -7.0, "step": 2890 }, { "epoch": 0.20934093698115933, "grad_norm": 10.061884816438084, "learning_rate": 4.820252288912254e-07, "logits/chosen": -2.84375, "logits/rejected": -2.671875, "logps/chosen": -600.0, "logps/rejected": -876.0, "loss": 0.2257, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -4.3125, "rewards/margins": 2.875, "rewards/rejected": -7.1875, "step": 2900 }, { "epoch": 0.21006280228109434, "grad_norm": 8.24310045419468, "learning_rate": 4.817899321702642e-07, "logits/chosen": -2.75, "logits/rejected": -2.625, "logps/chosen": -620.0, "logps/rejected": -952.0, "loss": 0.2341, "rewards/accuracies": 0.9375, "rewards/chosen": -4.34375, "rewards/margins": 3.484375, "rewards/rejected": -7.84375, "step": 2910 }, { "epoch": 0.21078466758102937, "grad_norm": 9.993736684687924, "learning_rate": 4.815531635768916e-07, "logits/chosen": -2.75, "logits/rejected": -2.390625, "logps/chosen": -628.0, "logps/rejected": -952.0, "loss": 0.2298, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -4.65625, "rewards/margins": 3.109375, "rewards/rejected": -7.78125, "step": 2920 }, { "epoch": 0.2115065328809644, "grad_norm": 8.215550634524817, "learning_rate": 4.813149246145946e-07, "logits/chosen": -2.78125, "logits/rejected": -2.625, "logps/chosen": -648.0, "logps/rejected": -968.0, "loss": 0.2413, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.875, "rewards/margins": 3.203125, "rewards/rejected": -8.0625, "step": 2930 }, { "epoch": 0.21222839818089945, "grad_norm": 6.880787558392017, "learning_rate": 4.810752167961971e-07, "logits/chosen": -2.625, "logits/rejected": -2.390625, "logps/chosen": -624.0, "logps/rejected": -904.0, "loss": 0.2364, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.6875, "rewards/margins": 2.71875, "rewards/rejected": -7.40625, "step": 2940 }, { "epoch": 0.21295026348083448, "grad_norm": 8.022287212940531, "learning_rate": 4.808340416438505e-07, "logits/chosen": -2.671875, "logits/rejected": -2.453125, "logps/chosen": -632.0, "logps/rejected": -880.0, "loss": 0.2212, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.75, "rewards/margins": 2.734375, "rewards/rejected": -7.46875, "step": 2950 }, { "epoch": 0.21367212878076952, "grad_norm": 10.935811215207599, "learning_rate": 4.805914006890234e-07, "logits/chosen": -2.703125, "logits/rejected": -2.5625, "logps/chosen": -692.0, "logps/rejected": -972.0, "loss": 0.2454, "rewards/accuracies": 0.90625, "rewards/chosen": -5.1875, "rewards/margins": 2.875, "rewards/rejected": -8.0625, "step": 2960 }, { "epoch": 0.21439399408070453, "grad_norm": 7.928137164090748, "learning_rate": 4.803472954724928e-07, "logits/chosen": -2.71875, "logits/rejected": -2.515625, "logps/chosen": -676.0, "logps/rejected": -944.0, "loss": 0.2296, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.125, "rewards/margins": 2.828125, "rewards/rejected": -7.96875, "step": 2970 }, { "epoch": 0.21511585938063957, "grad_norm": 10.309732813070605, "learning_rate": 4.801017275443331e-07, "logits/chosen": -2.734375, "logits/rejected": -2.5625, "logps/chosen": -676.0, "logps/rejected": -980.0, "loss": 0.2371, "rewards/accuracies": 0.875, "rewards/chosen": -5.125, "rewards/margins": 3.234375, "rewards/rejected": -8.375, "step": 2980 }, { "epoch": 0.2158377246805746, "grad_norm": 9.479637952138695, "learning_rate": 4.798546984639076e-07, "logits/chosen": -2.6875, "logits/rejected": -2.4375, "logps/chosen": -712.0, "logps/rejected": -1040.0, "loss": 0.216, "rewards/accuracies": 0.90625, "rewards/chosen": -5.5625, "rewards/margins": 3.3125, "rewards/rejected": -8.875, "step": 2990 }, { "epoch": 0.21655958998050964, "grad_norm": 11.653196066334537, "learning_rate": 4.796062097998578e-07, "logits/chosen": -2.78125, "logits/rejected": -2.375, "logps/chosen": -700.0, "logps/rejected": -988.0, "loss": 0.2311, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.28125, "rewards/margins": 3.125, "rewards/rejected": -8.375, "step": 3000 }, { "epoch": 0.21728145528044468, "grad_norm": 12.258514957096317, "learning_rate": 4.793562631300932e-07, "logits/chosen": -2.6875, "logits/rejected": -2.625, "logps/chosen": -712.0, "logps/rejected": -996.0, "loss": 0.2292, "rewards/accuracies": 0.875, "rewards/chosen": -5.5, "rewards/margins": 2.875, "rewards/rejected": -8.375, "step": 3010 }, { "epoch": 0.2180033205803797, "grad_norm": 7.907531921224019, "learning_rate": 4.791048600417824e-07, "logits/chosen": -2.84375, "logits/rejected": -2.640625, "logps/chosen": -660.0, "logps/rejected": -984.0, "loss": 0.2244, "rewards/accuracies": 0.90625, "rewards/chosen": -5.03125, "rewards/margins": 3.34375, "rewards/rejected": -8.375, "step": 3020 }, { "epoch": 0.21872518588031473, "grad_norm": 8.125306615010935, "learning_rate": 4.788520021313416e-07, "logits/chosen": -2.875, "logits/rejected": -2.8125, "logps/chosen": -636.0, "logps/rejected": -952.0, "loss": 0.2078, "rewards/accuracies": 0.90625, "rewards/chosen": -4.75, "rewards/margins": 3.140625, "rewards/rejected": -7.875, "step": 3030 }, { "epoch": 0.21944705118024976, "grad_norm": 9.119966563903791, "learning_rate": 4.785976910044255e-07, "logits/chosen": -2.9375, "logits/rejected": -2.703125, "logps/chosen": -576.0, "logps/rejected": -924.0, "loss": 0.2032, "rewards/accuracies": 0.9375, "rewards/chosen": -4.1875, "rewards/margins": 3.625, "rewards/rejected": -7.8125, "step": 3040 }, { "epoch": 0.2201689164801848, "grad_norm": 12.1919687251649, "learning_rate": 4.783419282759168e-07, "logits/chosen": -2.8125, "logits/rejected": -2.578125, "logps/chosen": -624.0, "logps/rejected": -928.0, "loss": 0.2312, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.65625, "rewards/margins": 3.21875, "rewards/rejected": -7.84375, "step": 3050 }, { "epoch": 0.22089078178011984, "grad_norm": 10.966337886877598, "learning_rate": 4.780847155699157e-07, "logits/chosen": -2.765625, "logits/rejected": -2.484375, "logps/chosen": -656.0, "logps/rejected": -960.0, "loss": 0.2282, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.90625, "rewards/margins": 3.140625, "rewards/rejected": -8.0625, "step": 3060 }, { "epoch": 0.22161264708005488, "grad_norm": 10.89546424385192, "learning_rate": 4.778260545197301e-07, "logits/chosen": -2.765625, "logits/rejected": -2.609375, "logps/chosen": -628.0, "logps/rejected": -916.0, "loss": 0.2326, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.78125, "rewards/margins": 2.9375, "rewards/rejected": -7.71875, "step": 3070 }, { "epoch": 0.22233451237998988, "grad_norm": 8.635404642662332, "learning_rate": 4.775659467678645e-07, "logits/chosen": -2.890625, "logits/rejected": -2.71875, "logps/chosen": -688.0, "logps/rejected": -1004.0, "loss": 0.213, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.25, "rewards/margins": 3.390625, "rewards/rejected": -8.625, "step": 3080 }, { "epoch": 0.22305637767992492, "grad_norm": 13.172555524642066, "learning_rate": 4.773043939660105e-07, "logits/chosen": -2.828125, "logits/rejected": -2.671875, "logps/chosen": -656.0, "logps/rejected": -956.0, "loss": 0.2527, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.875, "rewards/margins": 3.171875, "rewards/rejected": -8.0625, "step": 3090 }, { "epoch": 0.22377824297985996, "grad_norm": 10.053263971609315, "learning_rate": 4.770413977750353e-07, "logits/chosen": -2.84375, "logits/rejected": -2.515625, "logps/chosen": -680.0, "logps/rejected": -984.0, "loss": 0.2074, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -5.0625, "rewards/margins": 3.234375, "rewards/rejected": -8.3125, "step": 3100 }, { "epoch": 0.224500108279795, "grad_norm": 7.080435865876819, "learning_rate": 4.7677695986497225e-07, "logits/chosen": -2.796875, "logits/rejected": -2.515625, "logps/chosen": -676.0, "logps/rejected": -956.0, "loss": 0.2285, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.0, "rewards/margins": 2.90625, "rewards/rejected": -7.90625, "step": 3110 }, { "epoch": 0.22522197357973003, "grad_norm": 8.489071949818994, "learning_rate": 4.7651108191500896e-07, "logits/chosen": -2.71875, "logits/rejected": -2.578125, "logps/chosen": -624.0, "logps/rejected": -948.0, "loss": 0.2217, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.46875, "rewards/margins": 3.3125, "rewards/rejected": -7.75, "step": 3120 }, { "epoch": 0.22594383887966504, "grad_norm": 7.48950614324499, "learning_rate": 4.762437656134778e-07, "logits/chosen": -2.8125, "logits/rejected": -2.6875, "logps/chosen": -648.0, "logps/rejected": -956.0, "loss": 0.2206, "rewards/accuracies": 0.875, "rewards/chosen": -4.8125, "rewards/margins": 3.28125, "rewards/rejected": -8.0625, "step": 3130 }, { "epoch": 0.22666570417960008, "grad_norm": 11.147541103318718, "learning_rate": 4.7597501265784466e-07, "logits/chosen": -2.65625, "logits/rejected": -2.484375, "logps/chosen": -660.0, "logps/rejected": -924.0, "loss": 0.2274, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.0, "rewards/margins": 2.75, "rewards/rejected": -7.75, "step": 3140 }, { "epoch": 0.22738756947953512, "grad_norm": 9.2136696723812, "learning_rate": 4.757048247546982e-07, "logits/chosen": -2.703125, "logits/rejected": -2.453125, "logps/chosen": -612.0, "logps/rejected": -940.0, "loss": 0.2588, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -4.625, "rewards/margins": 3.34375, "rewards/rejected": -7.96875, "step": 3150 }, { "epoch": 0.22810943477947015, "grad_norm": 12.83236893491969, "learning_rate": 4.7543320361973884e-07, "logits/chosen": -2.703125, "logits/rejected": -2.46875, "logps/chosen": -604.0, "logps/rejected": -904.0, "loss": 0.2172, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.5, "rewards/margins": 3.109375, "rewards/rejected": -7.625, "step": 3160 }, { "epoch": 0.2288313000794052, "grad_norm": 9.608775546642143, "learning_rate": 4.751601509777683e-07, "logits/chosen": -2.921875, "logits/rejected": -2.625, "logps/chosen": -620.0, "logps/rejected": -968.0, "loss": 0.219, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.6875, "rewards/margins": 3.421875, "rewards/rejected": -8.125, "step": 3170 }, { "epoch": 0.2295531653793402, "grad_norm": 8.893320591024583, "learning_rate": 4.748856685626784e-07, "logits/chosen": -2.84375, "logits/rejected": -2.6875, "logps/chosen": -620.0, "logps/rejected": -932.0, "loss": 0.2299, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -4.46875, "rewards/margins": 3.21875, "rewards/rejected": -7.6875, "step": 3180 }, { "epoch": 0.23027503067927524, "grad_norm": 6.813416083172801, "learning_rate": 4.7460975811743986e-07, "logits/chosen": -2.890625, "logits/rejected": -2.734375, "logps/chosen": -672.0, "logps/rejected": -992.0, "loss": 0.2321, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.9375, "rewards/margins": 3.3125, "rewards/rejected": -8.25, "step": 3190 }, { "epoch": 0.23099689597921028, "grad_norm": 11.910753128704322, "learning_rate": 4.743324213940917e-07, "logits/chosen": -2.703125, "logits/rejected": -2.59375, "logps/chosen": -580.0, "logps/rejected": -864.0, "loss": 0.2362, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.1875, "rewards/margins": 2.953125, "rewards/rejected": -7.15625, "step": 3200 }, { "epoch": 0.2317187612791453, "grad_norm": 10.880683342821822, "learning_rate": 4.740536601537295e-07, "logits/chosen": -2.84375, "logits/rejected": -2.71875, "logps/chosen": -632.0, "logps/rejected": -924.0, "loss": 0.226, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.53125, "rewards/margins": 3.125, "rewards/rejected": -7.6875, "step": 3210 }, { "epoch": 0.23244062657908035, "grad_norm": 9.387075119803855, "learning_rate": 4.73773476166495e-07, "logits/chosen": -2.75, "logits/rejected": -2.546875, "logps/chosen": -620.0, "logps/rejected": -916.0, "loss": 0.2052, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.53125, "rewards/margins": 3.0625, "rewards/rejected": -7.59375, "step": 3220 }, { "epoch": 0.2331624918790154, "grad_norm": 9.319384117903645, "learning_rate": 4.73491871211564e-07, "logits/chosen": -2.6875, "logits/rejected": -2.5, "logps/chosen": -568.0, "logps/rejected": -880.0, "loss": 0.2334, "rewards/accuracies": 0.9375, "rewards/chosen": -4.0, "rewards/margins": 3.15625, "rewards/rejected": -7.15625, "step": 3230 }, { "epoch": 0.2338843571789504, "grad_norm": 7.92062494143796, "learning_rate": 4.7320884707713573e-07, "logits/chosen": -2.6875, "logits/rejected": -2.375, "logps/chosen": -572.0, "logps/rejected": -872.0, "loss": 0.226, "rewards/accuracies": 0.90625, "rewards/chosen": -4.09375, "rewards/margins": 3.0625, "rewards/rejected": -7.15625, "step": 3240 }, { "epoch": 0.23460622247888543, "grad_norm": 7.5905378566734445, "learning_rate": 4.7292440556042116e-07, "logits/chosen": -2.8125, "logits/rejected": -2.421875, "logps/chosen": -636.0, "logps/rejected": -956.0, "loss": 0.2381, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.875, "rewards/margins": 3.28125, "rewards/rejected": -8.125, "step": 3250 }, { "epoch": 0.23532808777882047, "grad_norm": 7.104939281324458, "learning_rate": 4.726385484676318e-07, "logits/chosen": -2.5625, "logits/rejected": -2.421875, "logps/chosen": -600.0, "logps/rejected": -876.0, "loss": 0.2311, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.4375, "rewards/margins": 2.84375, "rewards/rejected": -7.28125, "step": 3260 }, { "epoch": 0.2360499530787555, "grad_norm": 7.112864388089024, "learning_rate": 4.723512776139679e-07, "logits/chosen": -2.640625, "logits/rejected": -2.453125, "logps/chosen": -592.0, "logps/rejected": -872.0, "loss": 0.218, "rewards/accuracies": 0.875, "rewards/chosen": -4.5625, "rewards/margins": 2.65625, "rewards/rejected": -7.21875, "step": 3270 }, { "epoch": 0.23677181837869055, "grad_norm": 9.110259152947808, "learning_rate": 4.7206259482360734e-07, "logits/chosen": -2.71875, "logits/rejected": -2.515625, "logps/chosen": -624.0, "logps/rejected": -916.0, "loss": 0.2342, "rewards/accuracies": 0.875, "rewards/chosen": -4.59375, "rewards/margins": 3.0625, "rewards/rejected": -7.65625, "step": 3280 }, { "epoch": 0.23749368367862556, "grad_norm": 8.883129926158574, "learning_rate": 4.7177250192969364e-07, "logits/chosen": -2.6875, "logits/rejected": -2.53125, "logps/chosen": -648.0, "logps/rejected": -976.0, "loss": 0.2037, "rewards/accuracies": 0.90625, "rewards/chosen": -4.75, "rewards/margins": 3.46875, "rewards/rejected": -8.25, "step": 3290 }, { "epoch": 0.2382155489785606, "grad_norm": 10.573842474018138, "learning_rate": 4.714810007743247e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5, "logps/chosen": -744.0, "logps/rejected": -1080.0, "loss": 0.2226, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -5.65625, "rewards/margins": 3.609375, "rewards/rejected": -9.25, "step": 3300 }, { "epoch": 0.23893741427849563, "grad_norm": 9.209497924010089, "learning_rate": 4.7118809320854077e-07, "logits/chosen": -2.78125, "logits/rejected": -2.46875, "logps/chosen": -672.0, "logps/rejected": -1000.0, "loss": 0.2122, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.25, "rewards/margins": 3.421875, "rewards/rejected": -8.6875, "step": 3310 }, { "epoch": 0.23965927957843067, "grad_norm": 9.372117356581454, "learning_rate": 4.7089378109231294e-07, "logits/chosen": -2.625, "logits/rejected": -2.40625, "logps/chosen": -688.0, "logps/rejected": -984.0, "loss": 0.2315, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.34375, "rewards/margins": 2.96875, "rewards/rejected": -8.3125, "step": 3320 }, { "epoch": 0.2403811448783657, "grad_norm": 8.352914263375952, "learning_rate": 4.7059806629453116e-07, "logits/chosen": -2.609375, "logits/rejected": -2.4375, "logps/chosen": -648.0, "logps/rejected": -920.0, "loss": 0.2278, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.6875, "rewards/margins": 2.96875, "rewards/rejected": -7.65625, "step": 3330 }, { "epoch": 0.24110301017830074, "grad_norm": 10.512336386108508, "learning_rate": 4.7030095069299257e-07, "logits/chosen": -2.8125, "logits/rejected": -2.546875, "logps/chosen": -656.0, "logps/rejected": -976.0, "loss": 0.2011, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -4.8125, "rewards/margins": 3.34375, "rewards/rejected": -8.125, "step": 3340 }, { "epoch": 0.24182487547823575, "grad_norm": 9.166170654186674, "learning_rate": 4.700024361743893e-07, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -620.0, "logps/rejected": -960.0, "loss": 0.1937, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.5625, "rewards/margins": 3.5625, "rewards/rejected": -8.125, "step": 3350 }, { "epoch": 0.2425467407781708, "grad_norm": 10.052841673647455, "learning_rate": 4.697025246342967e-07, "logits/chosen": -2.703125, "logits/rejected": -2.5625, "logps/chosen": -608.0, "logps/rejected": -916.0, "loss": 0.2115, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.5, "rewards/margins": 3.40625, "rewards/rejected": -7.90625, "step": 3360 }, { "epoch": 0.24326860607810583, "grad_norm": 12.87931292960993, "learning_rate": 4.6940121797716127e-07, "logits/chosen": -2.734375, "logits/rejected": -2.5625, "logps/chosen": -588.0, "logps/rejected": -912.0, "loss": 0.227, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.28125, "rewards/margins": 3.34375, "rewards/rejected": -7.625, "step": 3370 }, { "epoch": 0.24399047137804086, "grad_norm": 11.246155735848257, "learning_rate": 4.6909851811628853e-07, "logits/chosen": -2.84375, "logits/rejected": -2.578125, "logps/chosen": -644.0, "logps/rejected": -948.0, "loss": 0.1985, "rewards/accuracies": 0.875, "rewards/chosen": -4.8125, "rewards/margins": 3.15625, "rewards/rejected": -7.96875, "step": 3380 }, { "epoch": 0.2447123366779759, "grad_norm": 8.247097831323758, "learning_rate": 4.68794426973831e-07, "logits/chosen": -2.75, "logits/rejected": -2.5, "logps/chosen": -584.0, "logps/rejected": -892.0, "loss": 0.2203, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.25, "rewards/margins": 3.140625, "rewards/rejected": -7.375, "step": 3390 }, { "epoch": 0.2454342019779109, "grad_norm": 7.982031142460416, "learning_rate": 4.684889464807755e-07, "logits/chosen": -2.671875, "logits/rejected": -2.453125, "logps/chosen": -588.0, "logps/rejected": -912.0, "loss": 0.2141, "rewards/accuracies": 0.90625, "rewards/chosen": -4.3125, "rewards/margins": 3.15625, "rewards/rejected": -7.46875, "step": 3400 }, { "epoch": 0.24615606727784595, "grad_norm": 8.859057538137234, "learning_rate": 4.681820785769317e-07, "logits/chosen": -2.671875, "logits/rejected": -2.5, "logps/chosen": -624.0, "logps/rejected": -932.0, "loss": 0.2002, "rewards/accuracies": 0.90625, "rewards/chosen": -4.53125, "rewards/margins": 3.328125, "rewards/rejected": -7.875, "step": 3410 }, { "epoch": 0.24687793257778098, "grad_norm": 10.507595703830146, "learning_rate": 4.678738252109192e-07, "logits/chosen": -2.625, "logits/rejected": -2.515625, "logps/chosen": -604.0, "logps/rejected": -916.0, "loss": 0.2272, "rewards/accuracies": 0.875, "rewards/chosen": -4.4375, "rewards/margins": 3.28125, "rewards/rejected": -7.71875, "step": 3420 }, { "epoch": 0.24759979787771602, "grad_norm": 9.701082860121796, "learning_rate": 4.675641883401553e-07, "logits/chosen": -2.578125, "logits/rejected": -2.375, "logps/chosen": -624.0, "logps/rejected": -936.0, "loss": 0.2157, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.625, "rewards/margins": 3.15625, "rewards/rejected": -7.78125, "step": 3430 }, { "epoch": 0.24832166317765106, "grad_norm": 9.249938002509944, "learning_rate": 4.672531699308425e-07, "logits/chosen": -2.65625, "logits/rejected": -2.4375, "logps/chosen": -628.0, "logps/rejected": -964.0, "loss": 0.2167, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -4.8125, "rewards/margins": 3.375, "rewards/rejected": -8.1875, "step": 3440 }, { "epoch": 0.2490435284775861, "grad_norm": 10.341717167410792, "learning_rate": 4.669407719579562e-07, "logits/chosen": -2.734375, "logits/rejected": -2.546875, "logps/chosen": -604.0, "logps/rejected": -920.0, "loss": 0.2035, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.25, "rewards/margins": 3.453125, "rewards/rejected": -7.71875, "step": 3450 }, { "epoch": 0.2497653937775211, "grad_norm": 8.681196124713722, "learning_rate": 4.666269964052322e-07, "logits/chosen": -2.859375, "logits/rejected": -2.53125, "logps/chosen": -596.0, "logps/rejected": -952.0, "loss": 0.2126, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.25, "rewards/margins": 3.828125, "rewards/rejected": -8.0625, "step": 3460 }, { "epoch": 0.25048725907745617, "grad_norm": 9.212928240257371, "learning_rate": 4.6631184526515384e-07, "logits/chosen": -2.828125, "logits/rejected": -2.65625, "logps/chosen": -624.0, "logps/rejected": -924.0, "loss": 0.2196, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.53125, "rewards/margins": 3.140625, "rewards/rejected": -7.6875, "step": 3470 }, { "epoch": 0.2512091243773912, "grad_norm": 9.229554206053074, "learning_rate": 4.6599532053893936e-07, "logits/chosen": -2.734375, "logits/rejected": -2.53125, "logps/chosen": -660.0, "logps/rejected": -944.0, "loss": 0.2172, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.90625, "rewards/margins": 2.96875, "rewards/rejected": -7.875, "step": 3480 }, { "epoch": 0.2519309896773262, "grad_norm": 7.2543396832627876, "learning_rate": 4.6567742423652955e-07, "logits/chosen": -2.6875, "logits/rejected": -2.53125, "logps/chosen": -672.0, "logps/rejected": -972.0, "loss": 0.2158, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.03125, "rewards/margins": 3.15625, "rewards/rejected": -8.1875, "step": 3490 }, { "epoch": 0.25265285497726125, "grad_norm": 8.156746365270518, "learning_rate": 4.6535815837657456e-07, "logits/chosen": -2.609375, "logits/rejected": -2.359375, "logps/chosen": -688.0, "logps/rejected": -1024.0, "loss": 0.2254, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.1875, "rewards/margins": 3.453125, "rewards/rejected": -8.625, "step": 3500 }, { "epoch": 0.25337472027719626, "grad_norm": 9.476042547482471, "learning_rate": 4.6503752498642133e-07, "logits/chosen": -2.6875, "logits/rejected": -2.421875, "logps/chosen": -696.0, "logps/rejected": -972.0, "loss": 0.2247, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.375, "rewards/margins": 2.953125, "rewards/rejected": -8.3125, "step": 3510 }, { "epoch": 0.25409658557713133, "grad_norm": 11.068802868497535, "learning_rate": 4.6471552610210073e-07, "logits/chosen": -2.8125, "logits/rejected": -2.640625, "logps/chosen": -648.0, "logps/rejected": -968.0, "loss": 0.2236, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.84375, "rewards/margins": 3.265625, "rewards/rejected": -8.125, "step": 3520 }, { "epoch": 0.25481845087706634, "grad_norm": 9.184379291366328, "learning_rate": 4.6439216376831447e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -628.0, "logps/rejected": -972.0, "loss": 0.2076, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.65625, "rewards/margins": 3.421875, "rewards/rejected": -8.0625, "step": 3530 }, { "epoch": 0.25554031617700135, "grad_norm": 12.322007532110128, "learning_rate": 4.6406744003842213e-07, "logits/chosen": -2.828125, "logits/rejected": -2.59375, "logps/chosen": -612.0, "logps/rejected": -920.0, "loss": 0.2124, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.5, "rewards/margins": 3.25, "rewards/rejected": -7.75, "step": 3540 }, { "epoch": 0.2562621814769364, "grad_norm": 7.159317606243659, "learning_rate": 4.6374135697442833e-07, "logits/chosen": -2.796875, "logits/rejected": -2.546875, "logps/chosen": -596.0, "logps/rejected": -940.0, "loss": 0.2098, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.40625, "rewards/margins": 3.453125, "rewards/rejected": -7.875, "step": 3550 }, { "epoch": 0.2569840467768714, "grad_norm": 29.4711769624419, "learning_rate": 4.634139166469695e-07, "logits/chosen": -2.671875, "logits/rejected": -2.390625, "logps/chosen": -620.0, "logps/rejected": -944.0, "loss": 0.2267, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.5, "rewards/margins": 3.078125, "rewards/rejected": -7.59375, "step": 3560 }, { "epoch": 0.2577059120768065, "grad_norm": 7.80532559868148, "learning_rate": 4.6308512113530063e-07, "logits/chosen": -2.59375, "logits/rejected": -2.46875, "logps/chosen": -560.0, "logps/rejected": -852.0, "loss": 0.2187, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.0, "rewards/margins": 2.984375, "rewards/rejected": -7.0, "step": 3570 }, { "epoch": 0.2584277773767415, "grad_norm": 7.185706232473536, "learning_rate": 4.627549725272822e-07, "logits/chosen": -2.75, "logits/rejected": -2.59375, "logps/chosen": -604.0, "logps/rejected": -916.0, "loss": 0.2362, "rewards/accuracies": 0.90625, "rewards/chosen": -4.34375, "rewards/margins": 3.265625, "rewards/rejected": -7.59375, "step": 3580 }, { "epoch": 0.2591496426766765, "grad_norm": 7.836489814314065, "learning_rate": 4.62423472919367e-07, "logits/chosen": -2.734375, "logits/rejected": -2.421875, "logps/chosen": -604.0, "logps/rejected": -896.0, "loss": 0.2143, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -4.40625, "rewards/margins": 3.0, "rewards/rejected": -7.40625, "step": 3590 }, { "epoch": 0.25987150797661157, "grad_norm": 10.312658330041376, "learning_rate": 4.6209062441658654e-07, "logits/chosen": -2.578125, "logits/rejected": -2.359375, "logps/chosen": -604.0, "logps/rejected": -904.0, "loss": 0.2176, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.46875, "rewards/margins": 3.109375, "rewards/rejected": -7.5625, "step": 3600 }, { "epoch": 0.2605933732765466, "grad_norm": 7.660185299883346, "learning_rate": 4.6175642913253783e-07, "logits/chosen": -2.640625, "logits/rejected": -2.4375, "logps/chosen": -604.0, "logps/rejected": -912.0, "loss": 0.1951, "rewards/accuracies": 0.9375, "rewards/chosen": -4.34375, "rewards/margins": 3.296875, "rewards/rejected": -7.65625, "step": 3610 }, { "epoch": 0.26131523857648165, "grad_norm": 9.630986662907384, "learning_rate": 4.6142088918937016e-07, "logits/chosen": -2.671875, "logits/rejected": -2.515625, "logps/chosen": -608.0, "logps/rejected": -952.0, "loss": 0.2009, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.4375, "rewards/margins": 3.609375, "rewards/rejected": -8.0625, "step": 3620 }, { "epoch": 0.26203710387641665, "grad_norm": 7.9637824352647195, "learning_rate": 4.6108400671777135e-07, "logits/chosen": -2.796875, "logits/rejected": -2.40625, "logps/chosen": -620.0, "logps/rejected": -928.0, "loss": 0.2137, "rewards/accuracies": 0.90625, "rewards/chosen": -4.46875, "rewards/margins": 3.28125, "rewards/rejected": -7.75, "step": 3630 }, { "epoch": 0.2627589691763517, "grad_norm": 10.302801071286787, "learning_rate": 4.607457838569544e-07, "logits/chosen": -2.65625, "logits/rejected": -2.296875, "logps/chosen": -600.0, "logps/rejected": -964.0, "loss": 0.208, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.375, "rewards/margins": 3.484375, "rewards/rejected": -7.84375, "step": 3640 }, { "epoch": 0.26348083447628673, "grad_norm": 9.200762753858287, "learning_rate": 4.6040622275464355e-07, "logits/chosen": -2.796875, "logits/rejected": -2.609375, "logps/chosen": -580.0, "logps/rejected": -960.0, "loss": 0.2058, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.34375, "rewards/margins": 3.703125, "rewards/rejected": -8.0625, "step": 3650 }, { "epoch": 0.26420269977622174, "grad_norm": 8.72614280680941, "learning_rate": 4.6006532556706124e-07, "logits/chosen": -2.71875, "logits/rejected": -2.515625, "logps/chosen": -532.0, "logps/rejected": -856.0, "loss": 0.2263, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -3.875, "rewards/margins": 3.296875, "rewards/rejected": -7.15625, "step": 3660 }, { "epoch": 0.2649245650761568, "grad_norm": 9.95080301383368, "learning_rate": 4.5972309445891386e-07, "logits/chosen": -2.671875, "logits/rejected": -2.515625, "logps/chosen": -544.0, "logps/rejected": -884.0, "loss": 0.2212, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -3.859375, "rewards/margins": 3.609375, "rewards/rejected": -7.46875, "step": 3670 }, { "epoch": 0.2656464303760918, "grad_norm": 7.898181548134635, "learning_rate": 4.593795316033783e-07, "logits/chosen": -2.578125, "logits/rejected": -2.375, "logps/chosen": -588.0, "logps/rejected": -872.0, "loss": 0.2504, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.28125, "rewards/margins": 2.96875, "rewards/rejected": -7.28125, "step": 3680 }, { "epoch": 0.2663682956760269, "grad_norm": 9.27071552978421, "learning_rate": 4.5903463918208815e-07, "logits/chosen": -2.515625, "logits/rejected": -2.296875, "logps/chosen": -560.0, "logps/rejected": -904.0, "loss": 0.2182, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.03125, "rewards/margins": 3.46875, "rewards/rejected": -7.5, "step": 3690 }, { "epoch": 0.2670901609759619, "grad_norm": 7.471297940396982, "learning_rate": 4.586884193851197e-07, "logits/chosen": -2.703125, "logits/rejected": -2.421875, "logps/chosen": -568.0, "logps/rejected": -864.0, "loss": 0.2165, "rewards/accuracies": 0.90625, "rewards/chosen": -4.125, "rewards/margins": 2.921875, "rewards/rejected": -7.03125, "step": 3700 }, { "epoch": 0.2678120262758969, "grad_norm": 9.198139304204727, "learning_rate": 4.5834087441097806e-07, "logits/chosen": -2.9375, "logits/rejected": -2.5625, "logps/chosen": -568.0, "logps/rejected": -960.0, "loss": 0.1971, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -4.125, "rewards/margins": 3.90625, "rewards/rejected": -8.0625, "step": 3710 }, { "epoch": 0.26853389157583196, "grad_norm": 7.074538199167009, "learning_rate": 4.5799200646658345e-07, "logits/chosen": -2.859375, "logits/rejected": -2.5, "logps/chosen": -568.0, "logps/rejected": -900.0, "loss": 0.1914, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.25, "rewards/margins": 3.28125, "rewards/rejected": -7.53125, "step": 3720 }, { "epoch": 0.26925575687576697, "grad_norm": 7.9353245918675, "learning_rate": 4.576418177672568e-07, "logits/chosen": -2.90625, "logits/rejected": -2.6875, "logps/chosen": -680.0, "logps/rejected": -1020.0, "loss": 0.2194, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.0, "rewards/margins": 3.59375, "rewards/rejected": -8.5625, "step": 3730 }, { "epoch": 0.26997762217570204, "grad_norm": 7.362232757163594, "learning_rate": 4.5729031053670596e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5625, "logps/chosen": -576.0, "logps/rejected": -888.0, "loss": 0.2025, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.0625, "rewards/margins": 3.421875, "rewards/rejected": -7.46875, "step": 3740 }, { "epoch": 0.27069948747563705, "grad_norm": 9.803377167019393, "learning_rate": 4.569374870070114e-07, "logits/chosen": -2.953125, "logits/rejected": -2.65625, "logps/chosen": -620.0, "logps/rejected": -960.0, "loss": 0.2077, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.59375, "rewards/margins": 3.515625, "rewards/rejected": -8.125, "step": 3750 }, { "epoch": 0.27142135277557206, "grad_norm": 6.923819353668018, "learning_rate": 4.565833494186122e-07, "logits/chosen": -2.953125, "logits/rejected": -2.734375, "logps/chosen": -644.0, "logps/rejected": -968.0, "loss": 0.1945, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.84375, "rewards/margins": 3.328125, "rewards/rejected": -8.1875, "step": 3760 }, { "epoch": 0.2721432180755071, "grad_norm": 7.409462373704994, "learning_rate": 4.562279000202919e-07, "logits/chosen": -2.90625, "logits/rejected": -2.59375, "logps/chosen": -624.0, "logps/rejected": -952.0, "loss": 0.1891, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -4.46875, "rewards/margins": 3.640625, "rewards/rejected": -8.125, "step": 3770 }, { "epoch": 0.27286508337544213, "grad_norm": 8.55425171800717, "learning_rate": 4.5587114106916366e-07, "logits/chosen": -2.890625, "logits/rejected": -2.609375, "logps/chosen": -664.0, "logps/rejected": -1040.0, "loss": 0.2089, "rewards/accuracies": 0.90625, "rewards/chosen": -4.96875, "rewards/margins": 3.71875, "rewards/rejected": -8.6875, "step": 3780 }, { "epoch": 0.2735869486753772, "grad_norm": 8.283760196639793, "learning_rate": 4.5551307483065664e-07, "logits/chosen": -2.8125, "logits/rejected": -2.65625, "logps/chosen": -716.0, "logps/rejected": -1064.0, "loss": 0.2264, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.46875, "rewards/margins": 3.671875, "rewards/rejected": -9.125, "step": 3790 }, { "epoch": 0.2743088139753122, "grad_norm": 9.334259623082545, "learning_rate": 4.5515370357850136e-07, "logits/chosen": -2.734375, "logits/rejected": -2.640625, "logps/chosen": -664.0, "logps/rejected": -1056.0, "loss": 0.1902, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.0, "rewards/margins": 3.890625, "rewards/rejected": -8.875, "step": 3800 }, { "epoch": 0.2750306792752472, "grad_norm": 8.790752805238721, "learning_rate": 4.547930295947151e-07, "logits/chosen": -2.859375, "logits/rejected": -2.578125, "logps/chosen": -640.0, "logps/rejected": -960.0, "loss": 0.1949, "rewards/accuracies": 0.9375, "rewards/chosen": -4.71875, "rewards/margins": 3.5625, "rewards/rejected": -8.25, "step": 3810 }, { "epoch": 0.2757525445751823, "grad_norm": 11.07615206391536, "learning_rate": 4.5443105516958737e-07, "logits/chosen": -2.859375, "logits/rejected": -2.640625, "logps/chosen": -700.0, "logps/rejected": -1072.0, "loss": 0.2074, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.34375, "rewards/margins": 3.90625, "rewards/rejected": -9.25, "step": 3820 }, { "epoch": 0.2764744098751173, "grad_norm": 12.156443108793454, "learning_rate": 4.5406778260166586e-07, "logits/chosen": -2.5625, "logits/rejected": -2.421875, "logps/chosen": -648.0, "logps/rejected": -984.0, "loss": 0.2064, "rewards/accuracies": 0.90625, "rewards/chosen": -4.90625, "rewards/margins": 3.59375, "rewards/rejected": -8.5, "step": 3830 }, { "epoch": 0.27719627517505235, "grad_norm": 9.054451472292419, "learning_rate": 4.5370321419774117e-07, "logits/chosen": -2.6875, "logits/rejected": -2.390625, "logps/chosen": -616.0, "logps/rejected": -936.0, "loss": 0.2138, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.59375, "rewards/margins": 3.171875, "rewards/rejected": -7.78125, "step": 3840 }, { "epoch": 0.27791814047498736, "grad_norm": 6.698493216999741, "learning_rate": 4.5333735227283274e-07, "logits/chosen": -2.640625, "logits/rejected": -2.5, "logps/chosen": -676.0, "logps/rejected": -992.0, "loss": 0.2083, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.25, "rewards/margins": 3.15625, "rewards/rejected": -8.4375, "step": 3850 }, { "epoch": 0.2786400057749224, "grad_norm": 9.735985205726063, "learning_rate": 4.5297019915017375e-07, "logits/chosen": -2.75, "logits/rejected": -2.53125, "logps/chosen": -672.0, "logps/rejected": -1032.0, "loss": 0.1875, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.28125, "rewards/margins": 3.59375, "rewards/rejected": -8.875, "step": 3860 }, { "epoch": 0.27936187107485744, "grad_norm": 8.810687694126111, "learning_rate": 4.5260175716119655e-07, "logits/chosen": -2.609375, "logits/rejected": -2.53125, "logps/chosen": -660.0, "logps/rejected": -968.0, "loss": 0.212, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.71875, "rewards/margins": 3.375, "rewards/rejected": -8.0625, "step": 3870 }, { "epoch": 0.28008373637479245, "grad_norm": 10.6784883112821, "learning_rate": 4.522320286455179e-07, "logits/chosen": -2.828125, "logits/rejected": -2.546875, "logps/chosen": -632.0, "logps/rejected": -944.0, "loss": 0.2101, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.8125, "rewards/margins": 3.359375, "rewards/rejected": -8.1875, "step": 3880 }, { "epoch": 0.2808056016747275, "grad_norm": 9.94830452756906, "learning_rate": 4.5186101595092403e-07, "logits/chosen": -2.734375, "logits/rejected": -2.59375, "logps/chosen": -664.0, "logps/rejected": -980.0, "loss": 0.2116, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.0625, "rewards/margins": 3.234375, "rewards/rejected": -8.3125, "step": 3890 }, { "epoch": 0.2815274669746625, "grad_norm": 9.418299320110647, "learning_rate": 4.5148872143335566e-07, "logits/chosen": -2.875, "logits/rejected": -2.578125, "logps/chosen": -656.0, "logps/rejected": -1016.0, "loss": 0.2042, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.90625, "rewards/margins": 3.71875, "rewards/rejected": -8.625, "step": 3900 }, { "epoch": 0.2822493322745976, "grad_norm": 11.904953591713511, "learning_rate": 4.5111514745689307e-07, "logits/chosen": -2.78125, "logits/rejected": -2.4375, "logps/chosen": -640.0, "logps/rejected": -1024.0, "loss": 0.2084, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.96875, "rewards/margins": 3.890625, "rewards/rejected": -8.875, "step": 3910 }, { "epoch": 0.2829711975745326, "grad_norm": 11.15522188195295, "learning_rate": 4.507402963937414e-07, "logits/chosen": -2.796875, "logits/rejected": -2.53125, "logps/chosen": -704.0, "logps/rejected": -1064.0, "loss": 0.1865, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.3125, "rewards/margins": 3.703125, "rewards/rejected": -9.0, "step": 3920 }, { "epoch": 0.2836930628744676, "grad_norm": 11.36508327799745, "learning_rate": 4.5036417062421506e-07, "logits/chosen": -2.734375, "logits/rejected": -2.453125, "logps/chosen": -748.0, "logps/rejected": -1088.0, "loss": 0.2226, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.8125, "rewards/margins": 3.546875, "rewards/rejected": -9.375, "step": 3930 }, { "epoch": 0.28441492817440267, "grad_norm": 9.897929517208977, "learning_rate": 4.4998677253672297e-07, "logits/chosen": -2.5625, "logits/rejected": -2.390625, "logps/chosen": -732.0, "logps/rejected": -1032.0, "loss": 0.2208, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -5.625, "rewards/margins": 3.046875, "rewards/rejected": -8.6875, "step": 3940 }, { "epoch": 0.2851367934743377, "grad_norm": 9.778813209573705, "learning_rate": 4.496081045277533e-07, "logits/chosen": -2.59375, "logits/rejected": -2.359375, "logps/chosen": -736.0, "logps/rejected": -1080.0, "loss": 0.2031, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -5.75, "rewards/margins": 3.125, "rewards/rejected": -8.875, "step": 3950 }, { "epoch": 0.28585865877427274, "grad_norm": 7.8313055942532275, "learning_rate": 4.492281690018583e-07, "logits/chosen": -2.8125, "logits/rejected": -2.625, "logps/chosen": -696.0, "logps/rejected": -1048.0, "loss": 0.1818, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.375, "rewards/margins": 3.75, "rewards/rejected": -9.125, "step": 3960 }, { "epoch": 0.28658052407420775, "grad_norm": 8.317207474938273, "learning_rate": 4.4884696837163905e-07, "logits/chosen": -2.828125, "logits/rejected": -2.59375, "logps/chosen": -748.0, "logps/rejected": -1056.0, "loss": 0.2117, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.6875, "rewards/margins": 3.265625, "rewards/rejected": -8.9375, "step": 3970 }, { "epoch": 0.28730238937414276, "grad_norm": 10.26976433894447, "learning_rate": 4.484645050577299e-07, "logits/chosen": -2.875, "logits/rejected": -2.375, "logps/chosen": -724.0, "logps/rejected": -1056.0, "loss": 0.2079, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.6875, "rewards/margins": 3.265625, "rewards/rejected": -8.9375, "step": 3980 }, { "epoch": 0.28802425467407783, "grad_norm": 11.840261029137109, "learning_rate": 4.480807814887833e-07, "logits/chosen": -2.546875, "logits/rejected": -2.40625, "logps/chosen": -660.0, "logps/rejected": -960.0, "loss": 0.214, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.03125, "rewards/margins": 3.21875, "rewards/rejected": -8.25, "step": 3990 }, { "epoch": 0.28874611997401284, "grad_norm": 8.811651662253073, "learning_rate": 4.476958001014544e-07, "logits/chosen": -2.8125, "logits/rejected": -2.4375, "logps/chosen": -728.0, "logps/rejected": -1064.0, "loss": 0.2135, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.6875, "rewards/margins": 3.46875, "rewards/rejected": -9.125, "step": 4000 }, { "epoch": 0.2894679852739479, "grad_norm": 8.267204182411973, "learning_rate": 4.4730956334038565e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -736.0, "logps/rejected": -1088.0, "loss": 0.2013, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.65625, "rewards/margins": 3.78125, "rewards/rejected": -9.4375, "step": 4010 }, { "epoch": 0.2901898505738829, "grad_norm": 7.77369954894956, "learning_rate": 4.46922073658191e-07, "logits/chosen": -2.671875, "logits/rejected": -2.5, "logps/chosen": -708.0, "logps/rejected": -1056.0, "loss": 0.2009, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.46875, "rewards/margins": 3.703125, "rewards/rejected": -9.1875, "step": 4020 }, { "epoch": 0.2909117158738179, "grad_norm": 8.886847365802758, "learning_rate": 4.465333335154406e-07, "logits/chosen": -2.703125, "logits/rejected": -2.40625, "logps/chosen": -684.0, "logps/rejected": -1020.0, "loss": 0.2115, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.3125, "rewards/margins": 3.359375, "rewards/rejected": -8.6875, "step": 4030 }, { "epoch": 0.291633581173753, "grad_norm": 11.540304268095925, "learning_rate": 4.461433453806449e-07, "logits/chosen": -2.703125, "logits/rejected": -2.34375, "logps/chosen": -712.0, "logps/rejected": -1032.0, "loss": 0.2096, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.4375, "rewards/margins": 3.25, "rewards/rejected": -8.6875, "step": 4040 }, { "epoch": 0.292355446473688, "grad_norm": 11.614291076457404, "learning_rate": 4.457521117302392e-07, "logits/chosen": -2.734375, "logits/rejected": -2.40625, "logps/chosen": -636.0, "logps/rejected": -956.0, "loss": 0.2274, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.875, "rewards/margins": 3.25, "rewards/rejected": -8.125, "step": 4050 }, { "epoch": 0.29307731177362306, "grad_norm": 11.959955939062517, "learning_rate": 4.45359635048568e-07, "logits/chosen": -2.734375, "logits/rejected": -2.59375, "logps/chosen": -672.0, "logps/rejected": -992.0, "loss": 0.1962, "rewards/accuracies": 0.90625, "rewards/chosen": -5.15625, "rewards/margins": 3.1875, "rewards/rejected": -8.375, "step": 4060 }, { "epoch": 0.29379917707355807, "grad_norm": 10.625522954210599, "learning_rate": 4.4496591782786883e-07, "logits/chosen": -2.953125, "logits/rejected": -2.609375, "logps/chosen": -780.0, "logps/rejected": -1168.0, "loss": 0.2562, "rewards/accuracies": 0.9375, "rewards/chosen": -6.25, "rewards/margins": 3.890625, "rewards/rejected": -10.125, "step": 4070 }, { "epoch": 0.2945210423734931, "grad_norm": 8.706370989411305, "learning_rate": 4.44570962568257e-07, "logits/chosen": -2.96875, "logits/rejected": -2.6875, "logps/chosen": -736.0, "logps/rejected": -1136.0, "loss": 0.2059, "rewards/accuracies": 0.9375, "rewards/chosen": -5.75, "rewards/margins": 4.1875, "rewards/rejected": -9.9375, "step": 4080 }, { "epoch": 0.29524290767342815, "grad_norm": 10.084781546011934, "learning_rate": 4.4417477177770905e-07, "logits/chosen": -2.875, "logits/rejected": -2.671875, "logps/chosen": -704.0, "logps/rejected": -1056.0, "loss": 0.2059, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5, "rewards/margins": 3.609375, "rewards/rejected": -9.125, "step": 4090 }, { "epoch": 0.29596477297336315, "grad_norm": 10.211730254994997, "learning_rate": 4.4377734797204747e-07, "logits/chosen": -2.875, "logits/rejected": -2.671875, "logps/chosen": -700.0, "logps/rejected": -1056.0, "loss": 0.1966, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.5, "rewards/margins": 3.640625, "rewards/rejected": -9.125, "step": 4100 }, { "epoch": 0.2966866382732982, "grad_norm": 8.821514902632222, "learning_rate": 4.433786936749241e-07, "logits/chosen": -2.703125, "logits/rejected": -2.46875, "logps/chosen": -744.0, "logps/rejected": -1080.0, "loss": 0.2048, "rewards/accuracies": 0.90625, "rewards/chosen": -5.59375, "rewards/margins": 3.734375, "rewards/rejected": -9.3125, "step": 4110 }, { "epoch": 0.29740850357323323, "grad_norm": 9.210606252468882, "learning_rate": 4.429788114178049e-07, "logits/chosen": -2.65625, "logits/rejected": -2.421875, "logps/chosen": -744.0, "logps/rejected": -1072.0, "loss": 0.2042, "rewards/accuracies": 0.90625, "rewards/chosen": -5.84375, "rewards/margins": 3.40625, "rewards/rejected": -9.25, "step": 4120 }, { "epoch": 0.2981303688731683, "grad_norm": 8.00555161785549, "learning_rate": 4.425777037399529e-07, "logits/chosen": -2.640625, "logits/rejected": -2.40625, "logps/chosen": -744.0, "logps/rejected": -1064.0, "loss": 0.1886, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.75, "rewards/margins": 3.40625, "rewards/rejected": -9.1875, "step": 4130 }, { "epoch": 0.2988522341731033, "grad_norm": 11.207346805964308, "learning_rate": 4.42175373188413e-07, "logits/chosen": -2.578125, "logits/rejected": -2.375, "logps/chosen": -780.0, "logps/rejected": -1080.0, "loss": 0.2083, "rewards/accuracies": 0.90625, "rewards/chosen": -6.1875, "rewards/margins": 3.25, "rewards/rejected": -9.4375, "step": 4140 }, { "epoch": 0.2995740994730383, "grad_norm": 8.172701676742552, "learning_rate": 4.4177182231799513e-07, "logits/chosen": -2.703125, "logits/rejected": -2.34375, "logps/chosen": -716.0, "logps/rejected": -1080.0, "loss": 0.2072, "rewards/accuracies": 0.9375, "rewards/chosen": -5.59375, "rewards/margins": 3.515625, "rewards/rejected": -9.125, "step": 4150 }, { "epoch": 0.3002959647729734, "grad_norm": 5.801373290887345, "learning_rate": 4.413670536912584e-07, "logits/chosen": -2.765625, "logits/rejected": -2.46875, "logps/chosen": -728.0, "logps/rejected": -1048.0, "loss": 0.2031, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.40625, "rewards/margins": 3.46875, "rewards/rejected": -8.875, "step": 4160 }, { "epoch": 0.3010178300729084, "grad_norm": 6.307391224443462, "learning_rate": 4.4096106987849457e-07, "logits/chosen": -2.890625, "logits/rejected": -2.515625, "logps/chosen": -732.0, "logps/rejected": -1120.0, "loss": 0.2027, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.625, "rewards/margins": 3.96875, "rewards/rejected": -9.625, "step": 4170 }, { "epoch": 0.30173969537284345, "grad_norm": 11.867957943680011, "learning_rate": 4.405538734577121e-07, "logits/chosen": -2.75, "logits/rejected": -2.5, "logps/chosen": -744.0, "logps/rejected": -1136.0, "loss": 0.1975, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.84375, "rewards/margins": 3.90625, "rewards/rejected": -9.75, "step": 4180 }, { "epoch": 0.30246156067277846, "grad_norm": 9.987667285927838, "learning_rate": 4.401454670146193e-07, "logits/chosen": -2.921875, "logits/rejected": -2.71875, "logps/chosen": -712.0, "logps/rejected": -1080.0, "loss": 0.2163, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.375, "rewards/margins": 3.890625, "rewards/rejected": -9.25, "step": 4190 }, { "epoch": 0.30318342597271347, "grad_norm": 8.977809465407699, "learning_rate": 4.3973585314260836e-07, "logits/chosen": -2.796875, "logits/rejected": -2.53125, "logps/chosen": -668.0, "logps/rejected": -1048.0, "loss": 0.1906, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.15625, "rewards/margins": 3.703125, "rewards/rejected": -8.8125, "step": 4200 }, { "epoch": 0.30390529127264854, "grad_norm": 10.825945402642533, "learning_rate": 4.393250344427385e-07, "logits/chosen": -2.765625, "logits/rejected": -2.515625, "logps/chosen": -736.0, "logps/rejected": -1056.0, "loss": 0.2047, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.8125, "rewards/margins": 3.34375, "rewards/rejected": -9.125, "step": 4210 }, { "epoch": 0.30462715657258355, "grad_norm": 8.126172608631684, "learning_rate": 4.389130135237196e-07, "logits/chosen": -2.890625, "logits/rejected": -2.5625, "logps/chosen": -692.0, "logps/rejected": -1088.0, "loss": 0.2207, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5625, "rewards/margins": 3.859375, "rewards/rejected": -9.4375, "step": 4220 }, { "epoch": 0.3053490218725186, "grad_norm": 7.626491220106016, "learning_rate": 4.38499793001896e-07, "logits/chosen": -2.71875, "logits/rejected": -2.484375, "logps/chosen": -672.0, "logps/rejected": -992.0, "loss": 0.2096, "rewards/accuracies": 0.90625, "rewards/chosen": -5.09375, "rewards/margins": 3.375, "rewards/rejected": -8.4375, "step": 4230 }, { "epoch": 0.3060708871724536, "grad_norm": 9.904614258788264, "learning_rate": 4.3808537550122913e-07, "logits/chosen": -2.609375, "logits/rejected": -2.296875, "logps/chosen": -656.0, "logps/rejected": -948.0, "loss": 0.211, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.9375, "rewards/margins": 3.109375, "rewards/rejected": -8.0625, "step": 4240 }, { "epoch": 0.30679275247238863, "grad_norm": 9.163789602486757, "learning_rate": 4.376697636532816e-07, "logits/chosen": -2.625, "logits/rejected": -2.421875, "logps/chosen": -668.0, "logps/rejected": -1040.0, "loss": 0.1866, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.1875, "rewards/margins": 3.6875, "rewards/rejected": -8.875, "step": 4250 }, { "epoch": 0.3075146177723237, "grad_norm": 9.658094123529755, "learning_rate": 4.3725296009719985e-07, "logits/chosen": -2.953125, "logits/rejected": -2.5625, "logps/chosen": -672.0, "logps/rejected": -1064.0, "loss": 0.1865, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.125, "rewards/margins": 3.984375, "rewards/rejected": -9.125, "step": 4260 }, { "epoch": 0.3082364830722587, "grad_norm": 6.663743741837934, "learning_rate": 4.3683496747969804e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5625, "logps/chosen": -668.0, "logps/rejected": -1040.0, "loss": 0.1913, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.125, "rewards/margins": 3.84375, "rewards/rejected": -8.9375, "step": 4270 }, { "epoch": 0.30895834837219377, "grad_norm": 9.431783701004399, "learning_rate": 4.364157884550406e-07, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -744.0, "logps/rejected": -1120.0, "loss": 0.2088, "rewards/accuracies": 0.90625, "rewards/chosen": -5.71875, "rewards/margins": 3.875, "rewards/rejected": -9.625, "step": 4280 }, { "epoch": 0.3096802136721288, "grad_norm": 10.281531783875531, "learning_rate": 4.359954256850259e-07, "logits/chosen": -2.8125, "logits/rejected": -2.53125, "logps/chosen": -692.0, "logps/rejected": -1064.0, "loss": 0.2274, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.46875, "rewards/margins": 3.703125, "rewards/rejected": -9.1875, "step": 4290 }, { "epoch": 0.3104020789720638, "grad_norm": 9.63227220127926, "learning_rate": 4.35573881838969e-07, "logits/chosen": -2.6875, "logits/rejected": -2.5625, "logps/chosen": -732.0, "logps/rejected": -1032.0, "loss": 0.2038, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.71875, "rewards/margins": 3.203125, "rewards/rejected": -8.9375, "step": 4300 }, { "epoch": 0.31112394427199885, "grad_norm": 10.289092693608229, "learning_rate": 4.3515115959368476e-07, "logits/chosen": -2.8125, "logits/rejected": -2.53125, "logps/chosen": -716.0, "logps/rejected": -1016.0, "loss": 0.2013, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.4375, "rewards/margins": 3.25, "rewards/rejected": -8.6875, "step": 4310 }, { "epoch": 0.31184580957193386, "grad_norm": 10.974607276803276, "learning_rate": 4.3472726163347116e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5625, "logps/chosen": -728.0, "logps/rejected": -1048.0, "loss": 0.2179, "rewards/accuracies": 0.875, "rewards/chosen": -5.65625, "rewards/margins": 3.46875, "rewards/rejected": -9.125, "step": 4320 }, { "epoch": 0.31256767487186893, "grad_norm": 6.412992045987879, "learning_rate": 4.3430219065009177e-07, "logits/chosen": -2.75, "logits/rejected": -2.40625, "logps/chosen": -700.0, "logps/rejected": -1040.0, "loss": 0.1975, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.375, "rewards/margins": 3.4375, "rewards/rejected": -8.8125, "step": 4330 }, { "epoch": 0.31328954017180394, "grad_norm": 10.403220300532743, "learning_rate": 4.3387594934275896e-07, "logits/chosen": -2.90625, "logits/rejected": -2.59375, "logps/chosen": -764.0, "logps/rejected": -1112.0, "loss": 0.2001, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.0, "rewards/margins": 3.515625, "rewards/rejected": -9.5, "step": 4340 }, { "epoch": 0.31401140547173895, "grad_norm": 6.73518127809711, "learning_rate": 4.334485404181167e-07, "logits/chosen": -2.875, "logits/rejected": -2.5625, "logps/chosen": -736.0, "logps/rejected": -1104.0, "loss": 0.186, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.78125, "rewards/margins": 3.765625, "rewards/rejected": -9.5, "step": 4350 }, { "epoch": 0.314733270771674, "grad_norm": 10.054893296825982, "learning_rate": 4.3301996659022334e-07, "logits/chosen": -2.625, "logits/rejected": -2.28125, "logps/chosen": -664.0, "logps/rejected": -1020.0, "loss": 0.2176, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -5.0, "rewards/margins": 3.578125, "rewards/rejected": -8.5625, "step": 4360 }, { "epoch": 0.315455136071609, "grad_norm": 7.828814625819192, "learning_rate": 4.3259023058053444e-07, "logits/chosen": -2.640625, "logits/rejected": -2.328125, "logps/chosen": -724.0, "logps/rejected": -1040.0, "loss": 0.2147, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.625, "rewards/margins": 3.234375, "rewards/rejected": -8.875, "step": 4370 }, { "epoch": 0.3161770013715441, "grad_norm": 7.009502435156667, "learning_rate": 4.3215933511788544e-07, "logits/chosen": -2.578125, "logits/rejected": -2.28125, "logps/chosen": -716.0, "logps/rejected": -1020.0, "loss": 0.2081, "rewards/accuracies": 0.9375, "rewards/chosen": -5.6875, "rewards/margins": 3.15625, "rewards/rejected": -8.875, "step": 4380 }, { "epoch": 0.3168988666714791, "grad_norm": 9.3284353021479, "learning_rate": 4.317272829384743e-07, "logits/chosen": -2.640625, "logits/rejected": -2.4375, "logps/chosen": -704.0, "logps/rejected": -1016.0, "loss": 0.1829, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.4375, "rewards/margins": 3.21875, "rewards/rejected": -8.625, "step": 4390 }, { "epoch": 0.31762073197141416, "grad_norm": 8.811880524775491, "learning_rate": 4.3129407678584414e-07, "logits/chosen": -2.703125, "logits/rejected": -2.390625, "logps/chosen": -672.0, "logps/rejected": -1016.0, "loss": 0.2084, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.125, "rewards/margins": 3.609375, "rewards/rejected": -8.75, "step": 4400 }, { "epoch": 0.31834259727134917, "grad_norm": 8.125525464636453, "learning_rate": 4.3085971941086585e-07, "logits/chosen": -2.578125, "logits/rejected": -2.390625, "logps/chosen": -728.0, "logps/rejected": -1032.0, "loss": 0.1915, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.6875, "rewards/margins": 3.125, "rewards/rejected": -8.8125, "step": 4410 }, { "epoch": 0.3190644625712842, "grad_norm": 8.751734979718838, "learning_rate": 4.3042421357172076e-07, "logits/chosen": -2.640625, "logits/rejected": -2.3125, "logps/chosen": -708.0, "logps/rejected": -1072.0, "loss": 0.1923, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.4375, "rewards/margins": 3.515625, "rewards/rejected": -8.9375, "step": 4420 }, { "epoch": 0.31978632787121924, "grad_norm": 7.608014094617588, "learning_rate": 4.2998756203388285e-07, "logits/chosen": -2.703125, "logits/rejected": -2.4375, "logps/chosen": -684.0, "logps/rejected": -1032.0, "loss": 0.2152, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.0, "rewards/margins": 3.8125, "rewards/rejected": -8.8125, "step": 4430 }, { "epoch": 0.32050819317115425, "grad_norm": 7.639743064757877, "learning_rate": 4.2954976757010133e-07, "logits/chosen": -2.59375, "logits/rejected": -2.421875, "logps/chosen": -672.0, "logps/rejected": -1032.0, "loss": 0.1902, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.0625, "rewards/margins": 3.78125, "rewards/rejected": -8.875, "step": 4440 }, { "epoch": 0.3212300584710893, "grad_norm": 11.460888477745158, "learning_rate": 4.2911083296038285e-07, "logits/chosen": -2.765625, "logits/rejected": -2.546875, "logps/chosen": -688.0, "logps/rejected": -1056.0, "loss": 0.1824, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.21875, "rewards/margins": 3.859375, "rewards/rejected": -9.0625, "step": 4450 }, { "epoch": 0.32195192377102433, "grad_norm": 9.224352773153688, "learning_rate": 4.2867076099197446e-07, "logits/chosen": -2.703125, "logits/rejected": -2.5, "logps/chosen": -668.0, "logps/rejected": -980.0, "loss": 0.1895, "rewards/accuracies": 0.90625, "rewards/chosen": -4.90625, "rewards/margins": 3.5, "rewards/rejected": -8.4375, "step": 4460 }, { "epoch": 0.32267378907095934, "grad_norm": 9.244876887068662, "learning_rate": 4.2822955445934505e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5625, "logps/chosen": -732.0, "logps/rejected": -1080.0, "loss": 0.1772, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.5625, "rewards/margins": 3.765625, "rewards/rejected": -9.3125, "step": 4470 }, { "epoch": 0.3233956543708944, "grad_norm": 8.906087322512382, "learning_rate": 4.277872161641681e-07, "logits/chosen": -2.8125, "logits/rejected": -2.453125, "logps/chosen": -760.0, "logps/rejected": -1120.0, "loss": 0.1962, "rewards/accuracies": 0.90625, "rewards/chosen": -5.875, "rewards/margins": 3.6875, "rewards/rejected": -9.5625, "step": 4480 }, { "epoch": 0.3241175196708294, "grad_norm": 9.689414725700667, "learning_rate": 4.273437489153041e-07, "logits/chosen": -2.609375, "logits/rejected": -2.390625, "logps/chosen": -716.0, "logps/rejected": -1048.0, "loss": 0.2001, "rewards/accuracies": 0.9375, "rewards/chosen": -5.4375, "rewards/margins": 3.59375, "rewards/rejected": -9.0, "step": 4490 }, { "epoch": 0.3248393849707645, "grad_norm": 8.996613366246144, "learning_rate": 4.2689915552878207e-07, "logits/chosen": -2.609375, "logits/rejected": -2.4375, "logps/chosen": -688.0, "logps/rejected": -1008.0, "loss": 0.1829, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.125, "rewards/margins": 3.390625, "rewards/rejected": -8.5, "step": 4500 }, { "epoch": 0.3255612502706995, "grad_norm": 9.607472232534843, "learning_rate": 4.2645343882778215e-07, "logits/chosen": -2.734375, "logits/rejected": -2.453125, "logps/chosen": -720.0, "logps/rejected": -1088.0, "loss": 0.2257, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.625, "rewards/margins": 3.828125, "rewards/rejected": -9.4375, "step": 4510 }, { "epoch": 0.3262831155706345, "grad_norm": 8.846494209878479, "learning_rate": 4.260066016426177e-07, "logits/chosen": -2.75, "logits/rejected": -2.46875, "logps/chosen": -680.0, "logps/rejected": -1032.0, "loss": 0.1767, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.21875, "rewards/margins": 3.59375, "rewards/rejected": -8.8125, "step": 4520 }, { "epoch": 0.32700498087056956, "grad_norm": 11.245824423136213, "learning_rate": 4.25558646810717e-07, "logits/chosen": -2.703125, "logits/rejected": -2.59375, "logps/chosen": -688.0, "logps/rejected": -1020.0, "loss": 0.1856, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.25, "rewards/margins": 3.453125, "rewards/rejected": -8.6875, "step": 4530 }, { "epoch": 0.32772684617050457, "grad_norm": 8.60581993865266, "learning_rate": 4.251095771766055e-07, "logits/chosen": -2.78125, "logits/rejected": -2.5, "logps/chosen": -672.0, "logps/rejected": -1048.0, "loss": 0.177, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.09375, "rewards/margins": 3.640625, "rewards/rejected": -8.75, "step": 4540 }, { "epoch": 0.32844871147043964, "grad_norm": 7.6110846227784625, "learning_rate": 4.246593955918877e-07, "logits/chosen": -2.8125, "logits/rejected": -2.5625, "logps/chosen": -716.0, "logps/rejected": -1048.0, "loss": 0.2188, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.59375, "rewards/margins": 3.453125, "rewards/rejected": -9.0625, "step": 4550 }, { "epoch": 0.32917057677037465, "grad_norm": 7.571006600020749, "learning_rate": 4.2420810491522896e-07, "logits/chosen": -2.5625, "logits/rejected": -2.34375, "logps/chosen": -672.0, "logps/rejected": -988.0, "loss": 0.2004, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.28125, "rewards/margins": 3.171875, "rewards/rejected": -8.4375, "step": 4560 }, { "epoch": 0.32989244207030965, "grad_norm": 9.619717180276336, "learning_rate": 4.237557080123373e-07, "logits/chosen": -2.53125, "logits/rejected": -2.4375, "logps/chosen": -672.0, "logps/rejected": -956.0, "loss": 0.2037, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.09375, "rewards/margins": 3.140625, "rewards/rejected": -8.25, "step": 4570 }, { "epoch": 0.3306143073702447, "grad_norm": 9.813397994219041, "learning_rate": 4.2330220775594567e-07, "logits/chosen": -2.78125, "logits/rejected": -2.515625, "logps/chosen": -660.0, "logps/rejected": -972.0, "loss": 0.1992, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.9375, "rewards/margins": 3.328125, "rewards/rejected": -8.25, "step": 4580 }, { "epoch": 0.33133617267017973, "grad_norm": 8.765749359430536, "learning_rate": 4.228476070257929e-07, "logits/chosen": -2.75, "logits/rejected": -2.46875, "logps/chosen": -680.0, "logps/rejected": -992.0, "loss": 0.1884, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -5.21875, "rewards/margins": 3.203125, "rewards/rejected": -8.4375, "step": 4590 }, { "epoch": 0.3320580379701148, "grad_norm": 10.82246666876482, "learning_rate": 4.223919087086062e-07, "logits/chosen": -2.796875, "logits/rejected": -2.609375, "logps/chosen": -640.0, "logps/rejected": -1012.0, "loss": 0.1802, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -4.875, "rewards/margins": 3.859375, "rewards/rejected": -8.75, "step": 4600 }, { "epoch": 0.3327799032700498, "grad_norm": 7.941514770204173, "learning_rate": 4.2193511569808225e-07, "logits/chosen": -2.859375, "logits/rejected": -2.609375, "logps/chosen": -616.0, "logps/rejected": -988.0, "loss": 0.1991, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.5625, "rewards/margins": 3.75, "rewards/rejected": -8.3125, "step": 4610 }, { "epoch": 0.3335017685699848, "grad_norm": 7.912745662185516, "learning_rate": 4.214772308948693e-07, "logits/chosen": -2.90625, "logits/rejected": -2.453125, "logps/chosen": -600.0, "logps/rejected": -1024.0, "loss": 0.2012, "rewards/accuracies": 0.90625, "rewards/chosen": -4.40625, "rewards/margins": 4.4375, "rewards/rejected": -8.8125, "step": 4620 }, { "epoch": 0.3342236338699199, "grad_norm": 10.9521651772932, "learning_rate": 4.2101825720654827e-07, "logits/chosen": -2.765625, "logits/rejected": -2.484375, "logps/chosen": -644.0, "logps/rejected": -936.0, "loss": 0.2081, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -4.875, "rewards/margins": 3.046875, "rewards/rejected": -7.90625, "step": 4630 }, { "epoch": 0.3349454991698549, "grad_norm": 6.99023599526195, "learning_rate": 4.205581975476146e-07, "logits/chosen": -2.765625, "logits/rejected": -2.421875, "logps/chosen": -652.0, "logps/rejected": -988.0, "loss": 0.2041, "rewards/accuracies": 0.9375, "rewards/chosen": -4.9375, "rewards/margins": 3.453125, "rewards/rejected": -8.4375, "step": 4640 }, { "epoch": 0.33566736446978995, "grad_norm": 8.603344530140768, "learning_rate": 4.200970548394598e-07, "logits/chosen": -2.765625, "logits/rejected": -2.578125, "logps/chosen": -724.0, "logps/rejected": -1040.0, "loss": 0.1965, "rewards/accuracies": 0.90625, "rewards/chosen": -5.375, "rewards/margins": 3.515625, "rewards/rejected": -8.875, "step": 4650 }, { "epoch": 0.33638922976972496, "grad_norm": 9.717823679934542, "learning_rate": 4.196348320103527e-07, "logits/chosen": -2.78125, "logits/rejected": -2.609375, "logps/chosen": -656.0, "logps/rejected": -1024.0, "loss": 0.213, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.125, "rewards/margins": 3.515625, "rewards/rejected": -8.625, "step": 4660 }, { "epoch": 0.33711109506966, "grad_norm": 7.935814772911749, "learning_rate": 4.191715319954209e-07, "logits/chosen": -2.90625, "logits/rejected": -2.53125, "logps/chosen": -644.0, "logps/rejected": -1008.0, "loss": 0.1937, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.96875, "rewards/margins": 3.625, "rewards/rejected": -8.5625, "step": 4670 }, { "epoch": 0.33783296036959504, "grad_norm": 8.769171773282734, "learning_rate": 4.187071577366321e-07, "logits/chosen": -2.875, "logits/rejected": -2.6875, "logps/chosen": -684.0, "logps/rejected": -1008.0, "loss": 0.176, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.3125, "rewards/margins": 3.421875, "rewards/rejected": -8.75, "step": 4680 }, { "epoch": 0.33855482566953005, "grad_norm": 7.096843320580391, "learning_rate": 4.182417121827755e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -676.0, "logps/rejected": -1040.0, "loss": 0.1906, "rewards/accuracies": 0.96875, "rewards/chosen": -5.3125, "rewards/margins": 3.546875, "rewards/rejected": -8.875, "step": 4690 }, { "epoch": 0.3392766909694651, "grad_norm": 10.058671513695627, "learning_rate": 4.177751982894433e-07, "logits/chosen": -2.828125, "logits/rejected": -2.515625, "logps/chosen": -600.0, "logps/rejected": -916.0, "loss": 0.1903, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.34375, "rewards/margins": 3.5625, "rewards/rejected": -7.90625, "step": 4700 }, { "epoch": 0.3399985562694001, "grad_norm": 10.565296750226013, "learning_rate": 4.1730761901901135e-07, "logits/chosen": -2.828125, "logits/rejected": -2.46875, "logps/chosen": -684.0, "logps/rejected": -1064.0, "loss": 0.1993, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.125, "rewards/margins": 3.890625, "rewards/rejected": -9.0, "step": 4710 }, { "epoch": 0.3407204215693352, "grad_norm": 9.850412180420557, "learning_rate": 4.168389773406209e-07, "logits/chosen": -2.875, "logits/rejected": -2.5625, "logps/chosen": -696.0, "logps/rejected": -1032.0, "loss": 0.2055, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.3125, "rewards/margins": 3.546875, "rewards/rejected": -8.875, "step": 4720 }, { "epoch": 0.3414422868692702, "grad_norm": 11.906676776121467, "learning_rate": 4.1636927623015927e-07, "logits/chosen": -2.96875, "logits/rejected": -2.578125, "logps/chosen": -656.0, "logps/rejected": -1016.0, "loss": 0.1838, "rewards/accuracies": 0.9375, "rewards/chosen": -4.875, "rewards/margins": 3.796875, "rewards/rejected": -8.6875, "step": 4730 }, { "epoch": 0.3421641521692052, "grad_norm": 10.205674489245993, "learning_rate": 4.158985186702415e-07, "logits/chosen": -2.84375, "logits/rejected": -2.4375, "logps/chosen": -628.0, "logps/rejected": -1056.0, "loss": 0.2092, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.75, "rewards/margins": 4.125, "rewards/rejected": -8.875, "step": 4740 }, { "epoch": 0.34288601746914027, "grad_norm": 9.260984330253814, "learning_rate": 4.1542670765019104e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5, "logps/chosen": -672.0, "logps/rejected": -1040.0, "loss": 0.1958, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.125, "rewards/margins": 3.828125, "rewards/rejected": -8.9375, "step": 4750 }, { "epoch": 0.3436078827690753, "grad_norm": 8.949027397431555, "learning_rate": 4.149538461660206e-07, "logits/chosen": -2.75, "logits/rejected": -2.40625, "logps/chosen": -672.0, "logps/rejected": -1004.0, "loss": 0.2089, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.28125, "rewards/margins": 3.296875, "rewards/rejected": -8.5625, "step": 4760 }, { "epoch": 0.34432974806901034, "grad_norm": 6.720014771416349, "learning_rate": 4.144799372204136e-07, "logits/chosen": -2.921875, "logits/rejected": -2.6875, "logps/chosen": -644.0, "logps/rejected": -956.0, "loss": 0.1826, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.875, "rewards/margins": 3.21875, "rewards/rejected": -8.125, "step": 4770 }, { "epoch": 0.34505161336894535, "grad_norm": 8.959024936705582, "learning_rate": 4.140049838227049e-07, "logits/chosen": -2.8125, "logits/rejected": -2.625, "logps/chosen": -664.0, "logps/rejected": -1012.0, "loss": 0.1987, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -4.90625, "rewards/margins": 3.703125, "rewards/rejected": -8.5625, "step": 4780 }, { "epoch": 0.34577347866888036, "grad_norm": 10.372748362230645, "learning_rate": 4.135289889888615e-07, "logits/chosen": -2.875, "logits/rejected": -2.65625, "logps/chosen": -728.0, "logps/rejected": -1088.0, "loss": 0.1637, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5, "rewards/margins": 3.78125, "rewards/rejected": -9.3125, "step": 4790 }, { "epoch": 0.34649534396881543, "grad_norm": 8.270570715124181, "learning_rate": 4.130519557414636e-07, "logits/chosen": -2.875, "logits/rejected": -2.671875, "logps/chosen": -660.0, "logps/rejected": -1040.0, "loss": 0.2018, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.96875, "rewards/margins": 3.90625, "rewards/rejected": -8.875, "step": 4800 }, { "epoch": 0.34721720926875044, "grad_norm": 9.893879868420212, "learning_rate": 4.1257388710968533e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5, "logps/chosen": -648.0, "logps/rejected": -1008.0, "loss": 0.1925, "rewards/accuracies": 0.9375, "rewards/chosen": -4.8125, "rewards/margins": 3.8125, "rewards/rejected": -8.625, "step": 4810 }, { "epoch": 0.3479390745686855, "grad_norm": 12.331591426723168, "learning_rate": 4.120947861292757e-07, "logits/chosen": -2.8125, "logits/rejected": -2.5625, "logps/chosen": -716.0, "logps/rejected": -1072.0, "loss": 0.1966, "rewards/accuracies": 0.9375, "rewards/chosen": -5.5, "rewards/margins": 3.671875, "rewards/rejected": -9.1875, "step": 4820 }, { "epoch": 0.3486609398686205, "grad_norm": 10.172376095851071, "learning_rate": 4.11614655842539e-07, "logits/chosen": -2.796875, "logits/rejected": -2.65625, "logps/chosen": -724.0, "logps/rejected": -1056.0, "loss": 0.2024, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.375, "rewards/margins": 3.546875, "rewards/rejected": -8.9375, "step": 4830 }, { "epoch": 0.3493828051685555, "grad_norm": 11.310294528639917, "learning_rate": 4.111334992983156e-07, "logits/chosen": -2.703125, "logits/rejected": -2.4375, "logps/chosen": -640.0, "logps/rejected": -992.0, "loss": 0.1973, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.8125, "rewards/margins": 3.5625, "rewards/rejected": -8.375, "step": 4840 }, { "epoch": 0.3501046704684906, "grad_norm": 9.138376308040302, "learning_rate": 4.1065131955196294e-07, "logits/chosen": -2.75, "logits/rejected": -2.40625, "logps/chosen": -656.0, "logps/rejected": -1020.0, "loss": 0.1957, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.03125, "rewards/margins": 3.65625, "rewards/rejected": -8.6875, "step": 4850 }, { "epoch": 0.3508265357684256, "grad_norm": 10.948111955434124, "learning_rate": 4.1016811966533536e-07, "logits/chosen": -2.84375, "logits/rejected": -2.53125, "logps/chosen": -708.0, "logps/rejected": -1104.0, "loss": 0.1823, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.59375, "rewards/margins": 3.953125, "rewards/rejected": -9.5625, "step": 4860 }, { "epoch": 0.35154840106836066, "grad_norm": 6.8483776654650965, "learning_rate": 4.096839027067656e-07, "logits/chosen": -2.953125, "logits/rejected": -2.625, "logps/chosen": -644.0, "logps/rejected": -1016.0, "loss": 0.2069, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -4.84375, "rewards/margins": 3.796875, "rewards/rejected": -8.625, "step": 4870 }, { "epoch": 0.35227026636829567, "grad_norm": 7.262308675444548, "learning_rate": 4.0919867175104435e-07, "logits/chosen": -2.8125, "logits/rejected": -2.6875, "logps/chosen": -656.0, "logps/rejected": -972.0, "loss": 0.1921, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.875, "rewards/margins": 3.40625, "rewards/rejected": -8.25, "step": 4880 }, { "epoch": 0.35299213166823074, "grad_norm": 17.175486759838638, "learning_rate": 4.0871242987940155e-07, "logits/chosen": -2.875, "logits/rejected": -2.71875, "logps/chosen": -688.0, "logps/rejected": -1048.0, "loss": 0.1981, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.3125, "rewards/margins": 3.734375, "rewards/rejected": -9.0625, "step": 4890 }, { "epoch": 0.35371399696816574, "grad_norm": 6.418913714694265, "learning_rate": 4.082251801794865e-07, "logits/chosen": -3.0, "logits/rejected": -2.71875, "logps/chosen": -684.0, "logps/rejected": -1048.0, "loss": 0.1888, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.125, "rewards/margins": 3.640625, "rewards/rejected": -8.75, "step": 4900 }, { "epoch": 0.35443586226810075, "grad_norm": 6.8125539564399515, "learning_rate": 4.0773692574534795e-07, "logits/chosen": -2.90625, "logits/rejected": -2.5625, "logps/chosen": -684.0, "logps/rejected": -1000.0, "loss": 0.1871, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.1875, "rewards/margins": 3.359375, "rewards/rejected": -8.5625, "step": 4910 }, { "epoch": 0.3551577275680358, "grad_norm": 7.814190613362822, "learning_rate": 4.072476696774151e-07, "logits/chosen": -2.8125, "logits/rejected": -2.546875, "logps/chosen": -720.0, "logps/rejected": -1112.0, "loss": 0.1852, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.40625, "rewards/margins": 4.03125, "rewards/rejected": -9.4375, "step": 4920 }, { "epoch": 0.35587959286797083, "grad_norm": 10.826610307359978, "learning_rate": 4.0675741508247715e-07, "logits/chosen": -2.953125, "logits/rejected": -2.59375, "logps/chosen": -680.0, "logps/rejected": -1144.0, "loss": 0.1675, "rewards/accuracies": 0.96875, "rewards/chosen": -5.3125, "rewards/margins": 4.78125, "rewards/rejected": -10.0625, "step": 4930 }, { "epoch": 0.3566014581679059, "grad_norm": 8.596687269801581, "learning_rate": 4.062661650736643e-07, "logits/chosen": -3.046875, "logits/rejected": -2.765625, "logps/chosen": -728.0, "logps/rejected": -1112.0, "loss": 0.1869, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.59375, "rewards/margins": 4.0, "rewards/rejected": -9.625, "step": 4940 }, { "epoch": 0.3573233234678409, "grad_norm": 6.416195679478135, "learning_rate": 4.0577392277042766e-07, "logits/chosen": -2.90625, "logits/rejected": -2.671875, "logps/chosen": -700.0, "logps/rejected": -1056.0, "loss": 0.1855, "rewards/accuracies": 0.90625, "rewards/chosen": -5.375, "rewards/margins": 3.6875, "rewards/rejected": -9.0625, "step": 4950 }, { "epoch": 0.3580451887677759, "grad_norm": 8.918928643083534, "learning_rate": 4.0528069129851914e-07, "logits/chosen": -2.828125, "logits/rejected": -2.46875, "logps/chosen": -712.0, "logps/rejected": -1088.0, "loss": 0.1846, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.28125, "rewards/margins": 3.953125, "rewards/rejected": -9.25, "step": 4960 }, { "epoch": 0.358767054067711, "grad_norm": 8.47545192360217, "learning_rate": 4.0478647378997223e-07, "logits/chosen": -2.703125, "logits/rejected": -2.515625, "logps/chosen": -724.0, "logps/rejected": -1048.0, "loss": 0.2025, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.5625, "rewards/margins": 3.46875, "rewards/rejected": -9.0625, "step": 4970 }, { "epoch": 0.359488919367646, "grad_norm": 8.09646150016637, "learning_rate": 4.0429127338308154e-07, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -700.0, "logps/rejected": -1024.0, "loss": 0.206, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.375, "rewards/margins": 3.421875, "rewards/rejected": -8.8125, "step": 4980 }, { "epoch": 0.36021078466758105, "grad_norm": 7.912242395511905, "learning_rate": 4.037950932223832e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5, "logps/chosen": -676.0, "logps/rejected": -1072.0, "loss": 0.186, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.21875, "rewards/margins": 3.796875, "rewards/rejected": -9.0, "step": 4990 }, { "epoch": 0.36093264996751606, "grad_norm": 8.510565195808283, "learning_rate": 4.032979364586349e-07, "logits/chosen": -2.953125, "logits/rejected": -2.703125, "logps/chosen": -688.0, "logps/rejected": -1064.0, "loss": 0.2007, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.28125, "rewards/margins": 3.734375, "rewards/rejected": -9.0, "step": 5000 }, { "epoch": 0.36093264996751606, "eval_logits/chosen": -2.90625, "eval_logits/rejected": -2.65625, "eval_logps/chosen": -700.0, "eval_logps/rejected": -1040.0, "eval_loss": 0.22352416813373566, "eval_rewards/accuracies": 0.9081980586051941, "eval_rewards/chosen": -5.3125, "eval_rewards/margins": 3.546875, "eval_rewards/rejected": -8.875, "eval_runtime": 3594.5422, "eval_samples_per_second": 27.403, "eval_steps_per_second": 0.428, "step": 5000 } ], "logging_steps": 10, "max_steps": 13853, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }